本プロトコルでは、意味的コンポーネント解析、トポロジーモデリング、デュアルストリーム特徴エンコーディング、および構造誘導融合を統合することで、構造を認識した衣服表現を生成します。これにより、コンピュータビジョンおよびアパレル研究者は、色やテクスチャではなく、コンポーネントの構成やシルエットのレイアウトに基づいた衣服の検索やデザインリファレンスの比較を行うことが可能になります。
本プロトコルでは、意味的コンポーネント解析、トポロジーモデリング、デュアルストリーム特徴エンコーディング、および構造誘導融合を統合することで、構造を認識した衣服表現を生成します。これにより、コンピュータビジョンおよびアパレル研究者は、色やテクスチャではなく、コンポーネントの構成やシルエットのレイアウトに基づいた衣服の検索やデザインリファレンスの比較を行うことが可能になります。
衣類の画像検索手法では、色やテクスチャが重視される傾向があり、外観が似ていても構成要素の配置が異なる衣類の間で混同が生じることがあります。本研究では、衣類画像検索およびデザイン参照比較のための、構成要素を考慮した特徴学習プロトコルを提案します。このプロトコルは、衣類の意味的な領域をパースして画像レベルの衣類構成要素グラフを構築し、外観と構成要素間の関係を並列にエンコードし、構造的一貫性、構造的関係、および構造的識別の各損失を用いて両方の表現を融合させます。DeepFashion2の画像を512 x 512ピクセルに標準化し、HRNet-W48でパースし、ResNet-50とグラフ畳み込みでエンコードした後、構造的な検索とクラスタリングを通じて評価を行いました。完全なモデルにより、構造的一貫性指標0.81、構造的識別指標0.71、Recall@5 89.2%、平均適合率(mAP)86.4%、およびシルエット係数0.74を達成しました。本プロトコルは、表面的な外観が衣類の構造を正確に表現していない場合に、衣類構造の検索、構造比較、および相違箇所の特定を可能にします。
アパレル業界へのコンピュータビジョンと人工知能の統合が進むにつれ、衣類画像の解析は、基本的な認識タスクからデザイン重視の解析や意思決定支援へと徐々に拡大しています1,2。アパレルデザインのプロセスにおいて、デザイン案の区別は、単なる外見上の違いよりも構造的な構成や構成要素間の関係性に依存するため、デザイン支援におけるアパレル画像特徴量の構造的な表現力が、解析の有効性を左右する重要な要因となります3,4。しかし、既存の視覚的解析手法の多くは依然としてテクスチャ、色、およびグローバルな輪郭を主な特徴量として依拠しており、デザインプロセスにおける衣服の階層構造や構成の違いを体系的に解析することが困難です5,6。したがって、デザイン解析の客観性と一貫性を向上させるためには、アパレルデザイン支援に向けた構造認識型の画像特徴量学習手法を開発することが重要です7。本プロトコルは、衣服が類似した色、テクスチャ、またはグローバルな輪郭を共有しているが、構成要素の組織化、接続パターン、または空間的レイアウトが異なる場合に適しています。このような条件下では、外見中心の表現では構造的に異なるデザインが特徴空間上で近接して配置される傾向があり、検索やデザイン比較の信頼性が低下します。本プロトコルは、衣服構成要素間の関係性が構造的検索、デザイン評価、および局所的な差異解析の主要な根拠となるタスクに対処します。
データスケール、モデルの複雑さ、およびタスクの多様性の点において、衣類画像の自動解析および理解に関する現在の研究は著しい進歩を遂げています8,9。しかし、実際のアプリケーションでは、衣類の構造情報はセグメンテーションや検出の結果に暗黙的に含まれていることが多く、特徴学習段階の統合的なモデリングでは考慮されていません。その結果、特徴空間において異なる構造設計間の安定した区別が欠如しています10,11。衣類構成要素間の空間的関係、階層的制約、およびトポロジー構造が明示的にエンコードされていないため、特徴表現がデザインレベルでの構造的な差異を反映させることが困難となっています12,13。明示的な構造モデリングの欠如は、デザイン支援シナリオにおける衣類画像特徴の解析粒度と意思決定の信頼性を制限しており、より深い意味理解を備えたインテリジェント設計システムの開発にとって大きな障壁となっています14。
衣服の画像特徴学習および分析を支援するため、関連研究ではいくつかの技術的な方向性が探索されてきた15。セマンティックセグメンテーションやガーメントパース(衣服解析)の手法により、ピクセルレベルのアノテーションを通じて衣服の領域や構成要素の精緻な描写が可能となり、構造情報の抽出に向けた基盤が提供されている16,17。画像クエリによる衣服検索手法では、トポロジーと色・テクスチャの融合、グローバルおよびローカルのアテンションアライメント、ガーメントパース、マルチスケールおよびマルチグラニュラリティ表現、そして特徴選択を伴うレジデュアルアテンションなどが導入されてきた。これらの手法は、カタログ検索、消費者から店舗へのマッチング、クロスドメイン製品検索、および電子商取引における視覚検索を対象としている。各手法は視覚クエリに基づいて衣服画像をランキングするため、その適用設定はデザイン参照検索と密接に関連しているが、特徴融合の過程で型指定された構成要素の隣接関係や垂直方向の順序関係は保持されていない18,19,20。一方で、デザインやレコメンデーションのシナリオに関する研究では、マルチモーダル融合、関係モデリング、およびスタイル分析が徐々に導入され、衣服の視覚的特徴の適用範囲が拡大している21,22。これらの手法はそれぞれのタスクにおいて進展を見せているものの、その核心となる特徴は依然として大部分の外観記述に基づいており、構造情報が特徴学習のための本質的な制約として一様にモデル化されていない。そのため、構造的な整合や構造比較を必要とする衣服デザイン支援のニーズを満たすことは困難である23。
衣類デザイン支援における構造的差別化能力の不足に対処するため、本論文では衣類構造の知覚に基づく画像特徴学習手法を提案する。この手法は、衣類解析結果と主要な構造情報を衣類画像の入力段階に組み込み、衣類構成領域、空間関係、および階層的接続を共同でモデル化する。構造関係のエンコーディングと視覚的な特徴アライメントにより、衣類の制約を特徴学習プロセスに明示的に統合し、視覚的な外観と構造的な一貫性の両方を保持した表現を生成する。この特徴は、統一された空間内で衣類の構造的な差異を特徴づけ、その後の構造的類似性分析、構造的クラスタリング、およびデザイン支援の意思決定のための安定した基盤を提供し、これにより既存の手法における構造モデリングの欠如に起因する特徴の混同問題を軽減する。構造情報を緩やかに接続された補助属性として扱う一般的な視覚検索戦略とは異なり、本フレームワークはトポロジー関係を中心とした特徴変調メカニズムを構築している。このメカニズムは、学習された表現が可視的な衣類領域の構成に従うことを促進し、同時にテクスチャ主導の応答を低減させる。各グラフノードは画像レベルのセマンティック領域を表し、各グラフ関係は画像平面における可視的な隣接関係または正規化された相対位置を記述する。得られたエンべディングは、異なる衣類画像間での構成要素のレイアウトやシルエット構成の比較を可能にする。これらの領域および関係は、縫製パターンのピース、シーム接続、構築上のランドマーク、またはグレーディングパラメータではない。外観駆動型の検索手法と比較して、本プロトコルは構造情報をダウンストリームの解析結果として扱うのではなく、特徴学習を通じて明示的な構成要素のトポロジーを保持する。構造的な手がかりを補助的な入力としてのみ導入するアプローチと比較して、デュアルストリームエンコーディングとトポロジー一貫性のある融合により、テクスチャ主導の応答を抑えつつ幾何学的関係を保持する。結果として得られる表現は、衣類構造の検索、構造的クラスタリング、デザインリファレンスの選別、および局所的なデザイン差異分析をサポートし、同時に衣類デザインプロセスにおいて解釈可能な構成要素レベルのエビデンスを提供する。本プロトコルに関連する研究領域は、衣類画像の特徴学習、衣類構造のモデリング、構造認識表現、およびアパレルデザイン支援のための視覚分析にわたる。
特徴表現のレベルにおいて、衣類画像の研究は長らく外観モデリング、深層特徴抽出、およびマルチスケール表現に焦点を当ててきました24,25。初期の研究では、畳み込みニューラルネットワークを用いて、分類、検索、および類似性マッチングタスクのための衣類画像のエンドツーエンドモデリングが行われました26,27。その後、異なる視野角、ポーズ、および撮影条件による衣類画像間の差異を緩和するために、マルチスケール特徴融合およびクロスドメイン学習が導入されました28,29。検索タスクにおいては、特徴の識別能と計算効率を向上させるために、アテンションメカニズムと特徴圧縮戦略が用いられました30,31。これらの手法は信頼性の高い外観識別を実現していますが、その特徴学習プロセスは依然としてグローバルな視覚情報に重点を置いており、衣服内部の構造に関する体系的な表現に欠けています32。構成的ファッション検索手法は、参照画像とテキストによる修正指示をさらに組み合わせていますが、そのクエリモダリティは本研究で検討している画像のみのプロトコルとは異なります。これらは関連する商用検索の方向性としてレビューされますが、追加のテキスト入力があると制御された画像クエリ評価ができなくなるため、定量的比較には含まれていません。
衣服の画像解析が外見の識別から構造的な理解へと移行するにつれ、衣服の構成要素、幾何学的関係、およびトポロジカルな接続のモデリングに焦点を当てた研究が増えています33。セマンティックセグメンテーションネットワークは、特徴投影とマルチアテンションメカニズムを通じて、衣服の構成要素レベルの解析を実現しており、構造情報の抽出のための信頼性の高い基盤を提供しています34,35。キーポイント検出および構造トポロジーモデリングの手法は、衣服の外形と局所構造との関係をさらに特徴づけ、衣服の幾何学的特徴を表現するモデルの能力を向上させました36,37。いくつかの研究では、衣服構成要素間の関係をモデリングするためにグラフ構造と関係推論ネットワークが導入され、それによって詳細な認識とクロスドメイン検索の性能が向上しました38,39。これらの研究により、視覚的解析における構造情報の重要な役割が検証されましたが、構造は主に補助的な特徴または中間結果として利用されており、構造的制約を核とした特徴学習システムはまだ開発されていません40。
アパレルデザイン支援において、これらの進展はデザインの推奨、スタイル分析、インタラクティブシステムの構築、および構造指向のデザイン評価を支えてきました41。レコメンデーションシステムの研究では、視覚的特徴とユーザーの好みを統合することで、アパレルのマッチングやパーソナライズされた推奨を実現しています42。デザイン支援に関する研究では、生成モデル、スタイルモデリング、および人間とコンピュータの協調メカニズムを組み合わせることで、インテリジェントなデザインサポートの新たな道を模索してきました43。バーチャル試着、サイズ測定、およびスタイル転送に関する研究は、デザインから生産プロセスに至るまで、アパレル視覚分析の適用範囲を広げました。これらの研究によってアパレルデザイン支援の技術的形態は豊かになりましたが、その核心となる視覚的特徴は依然として主に外観に依存しており、分析のためのデザイン構造の統一された表現が不足しています。対照的に、本論文では衣服の構造を特徴表現の核心的な制約として扱い、アパレルデザイン支援における構造分析のための視覚的表現手法を提示します。
このような進展があるにもかかわらず、近年のジェネレーティブデザインの手法では、構造的条件を拡散プロセス内での緩やかな空間ガイダンス行列として扱うことが多い。現代の構造解析フレームワークでは、トポロジーを主要な視覚的埋め込み空間とは別の補助的な意味論的ラベルとして表現している。提案するフレームワークは、コンポーネントレベルでの視覚的特徴学習を明示的に変調させる、グラフ事前分布に基づくトポロジー制約を定義することで、このメカニズムを変更する。マルチレベルの一貫性目的関数は、画像レベルでのコンポーネント配置が類似している衣服を特徴空間内で近接させ、一方で可視領域の構成が異なる衣服を分離させるように促す。この目的関数は、評価された検索設定におけるテクスチャへの依存性を低減させるが、素材、ポーズ、または背景の変化に対する不変性を確立するものではない。本プロトコルは、入力画像に十分に可視化された個別の衣服が含まれており、意味論的なコンポーネントが識別可能な境界を保持しており、かつ分析目的が粗いカテゴリー認識ではなくコンポーネントレベルの構造比較を必要とする場合に選択されるべきである。本手法は、構造に敏感な視覚分析に従事するコンピュータビジョン研究者、アパレルデザイン研究者、およびデジタル衣服開発チームを対象としている。色や素材の認識のみに焦点を当てたタスクや、衣服のトポロジーが大部分的に隠れている画像には適していない。以下のプロトコルでは、データセットの準備と意味論的確率マッピングから、幾何学的関係の構築、デュアルストリーム特徴エンコーディング、構造ガイド付き融合、および一貫性に基づく最適化までのワークフローを提示する。ワークフロー全体の概要はFigure 1にまとめられている。
本研究では、公開されている衣類画像データセットを使用しており、ヒト被験者の募集、個人情報の収集、動物実験、および生物学的材料の使用は行っていない。そのため、機関の倫理承認およびインフォームド・コンセントは適用されない。
1. ソフトウェア環境とプロジェクト設定
2. 入力画像の受入、データセットの構築および前処理
3. 前景制限視覚コンポーネントのパースおよび確率マッピング
4. 画像レベルのコンポーネント幾何学および空間関係のモデリング
5. デュアルストリーム構造認識特徴エンコーディング
6. 構造ガイド付き特徴融合
7. モデルのトレーニングと一貫性の最適化
8. 推論、検索、クラスタリング、および出力の検証
9. 比較モデル評価
報告されたすべての実験は、表2および材料表に記載されたハードウェアおよびソフトウェア環境を使用して実施されました。前処理、学習、推論、および評価の全工程において、同一バージョンのグラフィックスドライバ、CUDA、cuDNN、Python、NumPy、PyTorch、およびtorchvisionが使用されました。完全なハードウェアおよびソフトウェア環境は、表2および材料表にまとめられています。表1には、処理済みの学習、検証、およびテストデータセットと、画像レベルのトポロジー統計がまとめられています。表2には、すべての比較手法で使用された共通の設定がまとめられています。
比較評価結果
比較評価は、プロトコルのセクション7~9で規定されている一般的なデータ分割、前処理操作、トレーニング制御、および指標の定義に従って行われました。 表3 汎用的な視覚エンコーダー、パーツアライメントモデル、グラフベースの衣類表現、クロスドメイン・ファッション検索ネットワーク、トポロジーおよび外観融合手法、ならびに電子商取引向け視覚検索手法を、すべて同一の画像クエリプロトコルを用いて評価し比較します。ドメイン固有の手法には、色およびテクスチャ融合を伴うトポロジー特徴ヒストグラム(TFH-CT)、アテンションガイド付きカスケードネットワーク(AGC-Net)、マルチスケール・マルチグラニュラリティ特徴学習ネットワーク(MMFL-Net)、およびEgret Swarm Optimizationを用いた残差ネットワークによるファッション検索(FARE-RNET)が含まれます。すべての評価指標は 表 3 は、同一の乱数シード、トレーニングマニフェスト、バリデーションマニフェスト、テストマニフェスト、クエリ・ギャラリー割り当て、および指標実装を用いた5回の独立した試行における平均値および標本標準偏差として報告されています。ペアを組んだ p-同一の乱数シード条件下で各手法を提案手法と比較することにより、SCI、SDI、Recall@5、mAP、およびシルエット係数の値を個別に算出した。これらの結果は、その後の構造可視化、検索、クラスタリング、および設計指向解析のための定量的な根拠となる。
代表的なプロトコルの結果と解釈
保存されたパースファイルおよびグラフファイルから再構成された画像レベルのコンポーネントグラフにおいて、すべての活性ノードが対応する衣服領域内に配置され、型付き隣接行列に記録されたリレーションタイプが保持されていれば、プロトコルは正常に実行されたことを示します(図 5C 参照)。構造を考慮したレスポンスは、図 5D に示すように、衣服の前景に集中している必要があります。図 6E は期待される検索結果を示しており、提案手法によって赤色の背景の影響が軽減され、無関係な赤い物体ではなく上半身の衣服が検索されています。図 6B–G はまた、検索ランキングが画像レベルのコンポーネントリレーションおよび融合後のコンポーネント対応によって支持されていることを示しています。この結果は、袖の長さや局所的なトポロジーに検索サンプル間で差異があるものの、大まかな衣服カテゴリが復元されたことを反映しています。
一般的な失敗例としては、図 5Bにおけるテクスチャ主導の活性化、図 6の上段における背景色主導の検索、および図 7における残留背景活性化が挙げられます。図 7については、支配的な応答が拡大された下半身のシルエットと右側の衣服境界に沿っている一方で、隣接する背景領域に活性化が残留しているため、部分的な局在化として解釈されるべきです。トポロジー差分行列、幾何学的関係差分行列、融合後のコンポーネント差分グラフ、および空間応答が、一貫した衣服領域を特定した場合にのみ、局在化は構造的に支持されていると考えられます。行列やコンポーネントに対応する変化を伴わない空間的なホットスポットは、構造的な根拠ではなく、視覚的な干渉を示しています。
プロトコルの実行が有効であると見なされるのは、承認されたすべての画像から、正規化された意味論的確率マップ、K行K列のリレーション行列、K行512列の外観および構造特徴行列、および正しい画像識別子にリンクされた有限の融合特徴ベクトルが生成された場合である。視覚的検査により、トポロジーが衣類の構成要素に従っていること、前景の応答が背景の応答を上回っていること、および検索結果が背景色ではなく衣類のカテゴリーと構造に基づいて導かれていることを確認する必要がある。確率マップの断片化、コンポーネントノードの欠落、非数値行列、拡散した背景応答、または色に支配された検索結果は、実行の失敗を示しており、パース、グラフ構築、特徴融合、またはチェックポイントのロードの検査が必要となる。
画像レベルの衣類コンポーネント応答の視覚的解析
図5では、同一の衣服画像を用いて、ResNet-50ベースラインとコンポーネント認識モデルを比較しています。図5Bは、外観ベースラインのクラス活性化マップ(class activation map)を示しています。図5Cは、プロトコルのセクション3および4で生成された、前景制限確率マップ、コンポーネント中心行列、型付き隣接行列、非活性ノードマスク、およびコンポーネントラベルマッピングから再構成された、画像レベルの衣服コンポーネントグラフを示しています。図5Dは、融合表現の活性化応答を示しています。図5Cの生成に、ヒューマンポーズ推定器や人間の関節アノテーションは使用されていません。
図5Bに示すように、ベースラインの応答は下衣の局所的なテクスチャ領域に集中しており、衣服全体の境界に一貫して沿っていませんでした。図5Cでは、各ノードが活性化した衣服構成要素領域の中心に対応し、各エッジは共有された前景境界または事前定義された垂直方向の順序関係を表しています。このグラフは衣服領域の構成を反映したものであり、人間の解剖学的な関節を表すものではありません。図5Dに示すように、構造を認識した応答は、ほとんどの背景領域での活性化を低く抑えつつ、衣服前景の主要部分をカバーしていました。これらの結果は、構成要素グラフと特徴融合モジュールによって、評価画像におけるテクスチャ主導の活性化が抑制されたことを示しています。
衣類構造類似性解析およびデザイン参照結果
図6に、検索ランキングと、その解釈に用いられた構造的な根拠を示す。 図6Bのクエリコンポーネントグラフは、活性化された衣服領域とその型付き関係を記録しており、図6Cの行列は、グラフ伝搬に供給される関係パターンを示している。 図6Dのベースライン結果は、依然として赤色の外観キューに支配されている。 図6Eの構造認識結果では、異なる色や背景においても上半身の衣服カテゴリーが維持されている。 図6Fの最高ランク結果のコンポーネントグラフにより、クエリグラフとの直接比較が可能となり、図6Gの対応行列によって、同じ識別子を共有するコンポーネントが構造誘導融合後も整列したままであるかどうかが明らかになる。 対角線上の対応は、欠落したノードおよび変更されたグラフ関係と合わせて解釈されるべきである。 グラフの一致がないまま外観の類似性だけが強い場合は、構造的な検索に成功したとはみなされない。
検索された衣類は大まかなカテゴリーは維持していますが、袖の構成や局所的な構成要素の相関関係に差異があり、詳細な対応関係は不完全であることが示されています。提案手法は、表3に報告されている通り、Recall@5で89.2%、mAPで86.4%を達成しました。これらの定量値はランキング性能を示すものであり、一方で図6B–Gは、その解釈を裏付ける中間的な構造的根拠を提供しています。したがって、検索に関する結論は、テストしたクエリにおいて、背景色の干渉に対する耐性が向上し、画像レベルの構成要素の整理が強化されたことに限定されます。
構造的差異の応答および設計解析支援
図7Hの純粋差分応答ヒートマップは、主要な応答がターゲット画像の拡大された下半身のシルエットおよび右側の衣服境界に集中していることを示しています。図7Iのオーバーレイでは、最強の応答が衣服のメイン前景と一致し続けている一方で、隣接するカーテンおよび壁領域の弱い活性化が残留背景干渉として残っていることがわかります。空間応答は、図7C–Gに提示されたコンポーネントグラフおよび行列の根拠と併せて解釈する必要があります。高応答の衣服領域が、隣接性の変化、幾何学的関係の変化、および融合後のコンポーネント間距離パターンと一致する場合にのみ、その応答は有効な構造的差異として扱われます。
構造的な差異として認められるのは、図 7Eに示すタイピングされた隣接関係の変化、または図 7Fに示す幾何学的関係の変化に伴い、図 7Gにおけるコンポーネント間距離の増加および図 7H,Iにおける前景整合的な空間応答が見られる場合に限られます。拡大した下半身領域と右側の衣服境界はこのクロスステージ基準を満たしています。カーテンや壁における活性化は、コンポーネントノード、関係パターン、または融合コンポーネント距離の変化に対応していないため、非構造的な残留干渉として棄却されます。この結果は画像レベルでの差異局在化を支持しますが、縫製パターンや構成パラメータの変動を立証するものではありません。
特徴量の空間分布および構造クラスター解析
潜在特徴空間の分布を分析することで、衣類の構造的意味論を識別するモデルの能力が明らかになります。この分析では、構造的事前分布が、異なるトポロジー構成を持つ衣類を個別の特徴多様体に整理しているかを確認します。テストセットから、半袖トップス、パンツ、スカート、ロングコート、ワンピースという5つの代表的な構造カテゴリを選択しました。高次元の特徴ベクトルは、t-distributed stochastic neighbor embedding (t-SNE) を用いて2次元平面上に投影されました。特徴空間における構造的意味論の構成を特徴づけるため、類似サンプルの凝集性と非類似サンプルの分離性を評価しました。構造を考慮した特徴空間のt-SNE分布を図 8に示します。
図8Aに示すように、t-SNE投影では5つの主要な特徴領域が形成され、隣接するカテゴリ間の重複は限定的であった。5つのカテゴリ領域に対応する代表的なサンプルを図8Bに示す。表3に記載され、図8で可視化されている通り、0.81のSCIは同一の構造ラベルを共有するサンプルの凝集性を反映しており、0.71のSDIは異なる構造ラベルを持つサンプル間の分離性を反映している。これらの指標は特徴空間の分布の尺度として解釈されるべきであり、誤警報率を直接的に規定するものではない。図8Aに示すように、半袖トップスとスカートは投影された特徴空間において異なる主要領域を占めていたが、少数のサンプルは隣接するカテゴリの境界付近に留まっていた。トラウザーズとドレスも、隣接するカテゴリから明確に分離していた。この分布は、グラフ事前分布が完全なクラスター分離をもたらすことなく、カテゴリレベルの構造的組織化に寄与したことを示している。この評価では、表現の質と検索の有効性を区別している。SCIは、同一の構造ラベルを共有する衣類が学習された特徴空間内で凝集しているかを評価し、一方でSDIは、異なる構造ラベルを持つ衣類が分離して留まっているかを評価する。これらの指標は、本プロトコルの構造表現の目的に対応している。Recall@5は、構造的に関連する衣類が検索結果の最初の5件以内に現れるかを測定し、mAPはすべての関連するギャラリーサンプルにわたるランキングの質を測定する。これらの指標は、デザインリファレンスの検索目的に対応している。SCIとSDIがすでに特徴空間の組織化を特徴づけているため、シルエット係数はクラスタリング性能の評価のみに使用された。
図9は、手法間の正規化を行わない、代表的な4つの手法における5回の試行の生の結果を示しています。図9Aは元のスケールでのSCIおよびSDIを、図9BはRecall@5およびmAPをパーセンテージで示しています。個々の試行マーカーと標準偏差の誤差線は、単なる集計ランキングではなく、モデル学習に伴う変動を示しています。外観ベースのベースラインは0.62のSCIを達成しましたが、提案手法は0.81のSCIおよび0.71のSDIを達成しました(表3および図9A)。SCIおよびSDIの結果は、評価設定下において、ラベル内での凝集性とラベル間の分離性がより高いことを示しています。提案手法は89.2%のRecall@5および86.4%のmAPを達成しました(表3および図9B)。これらの検索指標は異なるランキング特性を評価するものであり、SCIおよびSDIとは別に解釈されます。4つの指標すべてで手法の順序が一貫していることは、表現の質と検索性能が一致していることを示していますが、これは4つの評価次元において相対的な改善度が同一であることを意味するものではありません。
アブレーション実験および構造モジュールの有効性解析
アブレーション実験では、完全なモデルと、構造的事前知識または融合モジュールを削除した変異体との比較を行います。これら3つの構成すべてで同一のリファレンス画像とターゲット画像を使用しているため、背景応答と局在化の集中度を直接比較することが可能です。構造的事前知識のない変異体では、画像レベルの衣服構成グラフとその関係制約を削除し、外観特徴の抽出を畳み込みバックボーンのみに依存させています。一方、非融合変異体ではグラフ推論は維持しますが、特徴ピラミッドを削除し、高レベルの意味的特徴のみを使用します。可視化された差分ヒートマップにより、ノイズ抑制と境界定義における各モジュールの具体的な役割が明らかになります。異なるモジュール構成における構造的差分応答の定性的比較を図10に示します。
図10C–Eのレスポンスマップは、共通のレスポンススケールと同一のオーバーレイ設定を用いて描画されました。構造事前分布(structure prior)のないバリアントでは、図10Cに示すように、左側の背景および無関係な環境領域周辺に強い活性化が見られました。融合モジュール(fusion module)のないバリアントでは、衣服外のレスポンスの一部が減少しましたが、図10Dに示すように、下衣および右側の周辺領域にわたって依然として広範な拡散が保持されていました。完全なモデルでは、図10Eに示すように、支配的なレスポンスが主たる衣服の前景に向かってさらに収縮しました。図10Fは、非融合バリアントと完全なモデルとの間における前景制限レスポンスの差を直接的に可視化したものであり、完全なモデルが主たる衣服に沿ったレスポンスを保持しつつ、残留する側方への拡散を抑制していることを示しています。これらの結果は、構造事前分布が主に環境ノイズを減少させ、融合モジュールがレスポンスの集中度と構造的な整合性をさらに向上させたことを示しています。図10E は、背景の活性化を完全に除去したのではなく、相対的な改善を表しています。
表4に、構造事前分布なし、融合モジュールなし、および完全なモデルにおけるSCI、SDI、およびRecall@5を示します。構造事前分布を除去したことで、SCIは0.81から0.65に、Recall@5は89.2%から74.5%に低下しました。融合モジュールを除去したところ、SDIは0.71から0.64に、Recall@5は89.2%から85.1%へと、4.1パーセントポイント低下しました。これらの結果は、構造事前分布が構造的一貫性と検索に大きな影響を与える一方で、特徴融合は見かけの情報と構造情報の整合性を向上させたことを示しています。
効率性の分析により、完全なモデルとResNet-50ベースラインの計算コストを比較した。ResNet-50ベースラインでは、2,560万個のパラメータと41億回の浮動小数点演算が必要であった。一方、完全な構造認識モデルでは、2,930万個のパラメータと54億回の浮動小数点演算が必要であった。1画像あたりの平均推論時間は、ベースラインで15 milliseconds、完全なモデルで22 millisecondsであり、7 milliseconds増加した。この結果は、時間制約のあるワークフローに本プロトコルを導入する際に考慮すべき、測定可能な計算コストが生じることを示している(表5))。構造制約ウェイトは、最終的なテスト評価の前にバリデーションセットを用いて決定した。構造制約ウェイトを0.1、0.3、0.5、0.8、1.0、1.2、1.5、2.0として、バリデーションRecall@5を検証した。その後のすべてのトレーニングおよびテスト実行において、ウェイトを1.0に固定した。図11 に、バリデーションに基づく構造制約ウェイト1.0の選定過程を示す。

図1: 構造認識型衣服画像特徴量学習プロトコルの全体的なワークフロー。入力された衣服画像は、外観特徴量ブランチと、セマンティックパースおよび空間グラフモデリングを用いる構造特徴量ブランチによって処理される。これら2つの表現は、構造ガイド付き融合モジュールによって処理され、最終的な構造認識特徴量が生成される。構造一貫性損失、構造識別損失、および構造関係損失が共同して特徴空間を制約する。本図は、特徴量学習を通じて衣服の外観とコンポーネントのトポロジーがどのように統合されるかを示している。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 2: 画像レベルの衣類コンポーネント・トポロジー事前情報の構築。 (A) 入力衣類画像 I。(B) 前景に限定された視覚的コンポーネントマップ P。ここでは7色で画像レベルの衣類領域が示されており、すべての背景ピクセルはコンポーネントチャネルから除外されている。(C) 画像レベルのコンポーネント関係グラフ G。ノードは可視な衣類領域を表し、実線のエッジは共有された前景境界を、破線の関係は定義済みの垂直方向の順序を表す。このマップとグラフは、画像の検索および視覚的構造の比較をサポートする。これらは、縫製パターンのパーツ、シームの幾何学形状、ダーツ構造、グレーディングパラメータ、または裁断指示を表すものではない。こちらのリンクをクリックして、この図の拡大版を表示してください。

図3構造誘導型特徴融合モジュール 構造的特徴は、線形写像と活性化関数によって変換される。 Ψ 構造ウェイトを生成します。構造ウェイトは、要素ごとの乗算を通じて外観特徴量を変調させます。変調された外観特徴量と構造特徴量は結合され、Wcによって投影されます。その後、残差構造特徴量が加算され、最終的なコンポーネント特徴量が生成されます。図は、最終的な融合の前に、構造情報が外観特徴量の重み付けを制御することを示しています。 この図の拡大版を表示するには、ここをクリックしてください。

図 4: 構造的一貫性制約下での特徴空間の最適化。 (A) 同じ構造クラスに属するサンプルは構造的一貫性損失によって互いに近づけられ、同時に構造関係損失によって内部コンポーネント間の関係が保持される。(B) 異なる構造クラスのサンプルは構造識別損失によって互いに遠ざけられる。この図は、これら3つの構造的目的関数が共同して、クラス内の凝集性とクラス間の分離性をどのように向上させるかを示している。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 5: 衣類の特徴応答およびコンポーネントグラフの可視化の代表例。 (A) 入力された衣類画像。 (B) ResNet-50外観ベースラインのクラス活性化応答。 (C) プロトコルのセクション 3 および 4 で保存された、前景制限コンポーネントマップ、コンポーネント中心行列、型付き隣接行列、非活性ノードマスク、およびコンポーネントラベルマッピングから再構成した画像レベルの衣類コンポーネントグラフ。ノードは活性化した衣類領域を、実線のエッジは共有された前景境界を、点線のエッジは事前定義された垂直順序関係を示す。 (D) 融合されたコンポーネント認識表現の活性化応答。この比較は、テクスチャ主導の活性化と衣類領域主導の活性化との違いを示している。 こちらのリンクをクリックして、この図の拡大版を表示してください。

図 6: 赤色背景の干渉下における検索結果および中間構造の根拠。 (A) クエリ画像。 (B) 保存されたコンポーネント中心と型付き隣接行列から生成されたクエリコンポーネントグラフ。 (C) クエリの型付き隣接行列。行列の値によって、非活性な関係、共有された前景境界、および定義済みの垂直方向の順序関係が区別される。 (D) 外観ベースラインによって得られた上位3つの検索結果。 (E) 構造認識表現によって得られた上位3つの結果。 (F) 構造認識結果の中で最もランクの高いコンポーネントグラフ。 (G) クエリと最高ランクの結果との間の融合後コンポーネント対応行列。対角線上での高い対応は、同じ識別子を持つコンポーネント間の一致を示し、弱い応答または位置がずれた応答は、コンポーネント構成の欠落または不一致を示す。検索結果は、大まかな上半身のカテゴリは維持しているが、袖の構成や局所的なトポロジーにおいて完全な一致は得られていない。こちらをクリックして、この図の拡大版を表示してください。

図7: 画像レベルの衣服トポロジーから空間的応答への構造的差異の追跡。 (A) リファレンス画像。(B) ターゲット画像。(C) リファレンスコンポーネントグラフ。(D) ターゲットコンポーネントグラフ。どちらのグラフも、保存されたコンポーネント中心と型付き隣接行列から再構成されている。(E) 型付き隣接差異行列。(F) 幾何学的関係の差異は、コンポーネント中心の変位、空間的分散、および関係重みの変化から導出される。(G) 融合後のコンポーネント差異グラフ。ノードの強度は対応する融合コンポーネントベクトル間の正規化距離を表し、エッジの幅は関係重みの変化を表す。(H) 純粋な空間的差異応答ヒートマップ。オーバーレイと同じ固定応答スケールを使用してレンダリングされた。(I) ターゲット画像にオーバーレイされた応答。構造的差異は、隣接性の変化、幾何学的関係の変化、コンポーネント間距離の変化、および前景に整合した熱応答が一貫している場合にのみ認められる。コンポーネントや関係の対応する根拠がない背景の活性化は、有効な衣服構造の差異ではなく、残留干渉として処理される。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 8: 構造を考慮した特徴空間クラスタリング。 (A) 半袖トップス、ズボン、スカート、ロングコート、ドレスのt-SNE投影。5つのカテゴリーは、境界付近でわずかに重複しつつも、主要な特徴領域を形成している。(B) 5つの衣類カテゴリーに割り当てられた代表的なテスト画像。枠線の色は(A)のカテゴリー色に対応している。この図は、隣接するカテゴリー領域付近に少数のサンプルを保持しつつ、カテゴリーレベルの構造的組織化を示している。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 9: 特徴空間の構造および検索ランキングの目的における生のパフォーマンス比較。 (A) 外観駆動ベースライン、弱構造モデル、明示的構造モデル、および提案手法におけるSCIとSDI。 (B) 同じ4つの手法におけるRecall@5とmAP。大きなマーカーは5回の独立した試行の算術平均を示し、エラーラインは標本標準偏差を、小さなマーカーは試行ごとの結果を示す。SCIとSDIは0から1までの固定スケールで表示され、Recall@5とmAPは0から100までの固定パーセントスケールで表示されている。min-max正規化や手法間の再スケーリングは適用されていない。こちらのリンクをクリックして、この図の拡大版を表示してください。

図10: 異なるモジュール構成における構造差分レスポンス。 (A) リファレンス画像。(B) ターゲット画像。(C) 構造事前分布のないバリアントのレスポンス。(D) フュージョンモジュールのないバリアントのレスポンス。(E) 完全なモデルのレスポンス。(C–E) は、同一の正規化レスポンススケール、カラーマップ、およびオーバーレイ設定を用いてレンダリングされている。(F) 非フュージョンバリアントと完全なモデルとの間の、前景制限付き絶対レスポンス差分。完全なモデルは、主要な構造領域外への残差の広がりを抑制しつつ、衣服に沿った主要なレスポンスを保持している。この比較により、構造事前分布が衣服外の干渉を低減し、フュージョンモジュールが構造レスポンスをさらに鋭鋭化させることが示されている。こちらのリンクから、この図の拡大版を表示してください。

図 11: バリデーションに基づく構造制約重みの選択。構造制約重みが 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5, および 2.0 のときにおけるバリデーション Recall@5 を示す。各点は5回のバリデーション実行の算術平均を表し、各エラーバーは標本標準偏差を表す。最終的なテスト評価の前に、重みは 1.0 に固定された。この図はパラメータ選択の手順を記録したものであり、独立したアーキテクチャ上の寄与を構成するものではない。ここをクリックして、この図の拡大版を表示してください。
表1:衣類サブセットS1からS5におけるデータセットの割り当ておよび画像レベルのトポロジー統計。本表では、学習用、検証用、テスト用、および合計の画像数とともに、各構造レベルにおける意味的コンポーネント数、アクティブノード数、型付きエッジ数、および注釈付き画像平面ランドマーク数の平均値を報告しています。すべての値は、処理済みのデータマニフェストから生成されました。学習用、検証用、およびテスト用の画像数は、構造レビュー、重複グループ制御、およびリーク検査後の最終的なサブセットマニフェストから取得し、トポロジー統計は、モデル評価時に適用したものと同じコンポーネント順序および関係定義を用いて、最終的なグラフレコードから算出しました。こちらのリンクからファイルをダウンロードしてください。
表2:プロトコル全体で使用された計算環境、入力構成、オーグメンテーション、表現、最適化、損失、および再現性の設定。 この表では、使用したオペレーティングシステム、プロセッサ、実装メモリ、グラフィックス処理装置(GPU)、グラフィックスメモリ、グラフィックスドライバ、CUDA、cuDNN、Python、NumPy、PyTorch、およびtorchvisionの正確なバージョンに加え、画像サイズ、バッチ構築、オプティマイザ、学習率スケジューラ、エポック数、乱数シード、表現次元、および構造的な目的関数の重みを報告している。各値は、software_versions.txt、configs/protocol.yaml、または対応するトレーニング記録にリンクしている。こちらをクリックしてファイルをダウンロードしてください。
表 3:一般的な視覚表現モデル、グラフベースの衣服モデル、およびドメイン固有のファッション検索手法の定量的比較。本表では、同一のデータ分割および評価プロトコルの下で、11の手法における検索フォーカス、クエリモダリティ、SCI、SDI、Recall@5、mAP、およびシルエット係数を報告する。各指標は、5回の独立した試行における平均値および標本標準偏差として報告されている。報告されたp値は、同一の5つのランダムシードを用いて生成された結果に基づき、各比較手法と提案手法を比較した両側対応t検定から得られたものである。提案手法をリファレンス行として扱う。こちらのリンクをクリックしてファイルをダウンロードしてください。
表4:構造事前知識および特徴融合モジュールの切除実験結果。本表は、構造事前知識を排除したバリアント、融合モジュールを排除したバリアント、および完全なモデルにおけるSCI、SDI、およびRecall@5を報告している。構造事前知識を削除するとSCIとRecall@5の大幅な低下を招き、一方で融合モジュールを削除するとSDIと応答のアライメントが低下する。完全なモデルが3つの指標すべてにおいて最高値を記録している。こちらのリンクをクリックしてファイルをダウンロードしてください。
表 5:ResNet-50ベースラインと完全な構造認識モデルの計算効率。 本表では、表 2 および材料表に記載されたハードウェアおよびソフトウェア環境において、学習可能なパラメータ数、画像1枚あたりの浮動小数点演算数、および画像1枚あたりの平均推論時間を報告しています。両モデルとも、同一の画像解像度、推論バッチ設定、前処理操作、および計測手順を用いています。完全なモデルでは、ベースラインと比較して、パラメータ数が 3.7 million、浮動小数点演算数が 1.3 billion、画像1枚あたりの推論時間が 7 milliseconds 増加しています。こちらをクリックしてファイルをダウンロードしてください。
最も重要なプロトコルの段階は、衣服を保存するための前処理と、前景に限定した意味的コンポーネントのパース(解析)である。コンポーネントの中心、空間分散値、共有境界関係、垂直順序関係、関係の重み、および融合表現は、すべてパースの出力から導出される。境界の漏れ、コンポーネント領域の統合、コンポーネント領域の欠落、および不適切なチャネル割り当ては、グラフ構築および特徴融合を通じて伝播する。これらのエラーにより、グラフファイルの次元は有効であっても、表現されたコンポーネント間の関係が元の衣服と矛盾した状態になる可能性がある。したがって、構造的事前知識を承認する前に、確率マップ、前景制限、コンポーネントのプレビュー、およびパース品質の記録を確認しなければならない。
グラフの構築および特徴融合には、セマンティックコンポーネントの固定された順序が必要です。グラフは、前景の衣服コンポーネントと、それらの画像平面上の関係から導出されます。検索および差異局在化の図は、単に最終的なランキング画像やレスポンスヒートマップを表示するのではなく、構造的な処理パスを提示するものです。型定義済み隣接行列は個別のコンポーネント関係を記録し、幾何学的関係行列は正規化された空間配置を記録し、融合後のコンポーネント行列は検索および局在化に使用される表現を記録します。構造的な結論は、これらの中間表現が最終的な視覚的出力と一致する場合にのみ受け入れられるべきです。コンポーネントグラフでは、解剖学的ランドマーク、ヒトの関節座標、またはポーズ推定ネットワークは使用しません。グラフのオーバーレイは、そのノードと関係タイプが保存されたコンポーネントファイルおよび隣接ファイルから再現された場合にのみ受け入れられるべきです。非アクティブなコンポーネントは、非アクティブノードインジケータを伴うゼロベクトルとして保持されるべきであり、外観および構造特徴行列は、融合前にそれぞれK行512列でなければなりません。これらのチェックにより、ノードの不整合や次元エラーがモデルの挙動として誤認されることを防ぎます。
トラブルシューティングは、無効な中間出力が最初に現れた段階から開始してください。確率マップが一様である場合は、チェックポイント、正規化、またはカテゴリインデックスのエラーが考えられます。構造行列が非数値である場合は、確率の分母が無効であるか、座標スケーリングに問題があります。応答が拡散している場合や、色の影響が支配的な検索結果が得られる場合は、構造事前分布が弱い、融合に失敗している、あるいはチェックポイントの読み込みが正しくないことを示しています。トレーニングログで、グラフおよび融合層における勾配と、検証に基づいたチェックポイントの選択を確認する必要があります。視覚的なヒートレスポンスを単独で構造的な結論として使用してはいけません。保存された前景マスク、入力された隣接関係の変化、幾何学的関係行列、および融合後のコンポーネント差分グラフと照らし合わせて確認する必要があります。衣服の前景以外に残留活性が見られる場合は、検証された構造的な差異ではなく、応答の特異性が限定的であることを示しています。
外観主導の検索と比較して、本プロトコルでは距離学習の前にコンポーネントのトポロジーを導入しています。弱い構造的制約や固定トポロジーのグラフモデルと比較して、意味的な関係重みにより、現在の衣服に合わせてグラフ伝播を適応させることができます。完全なモデルでは、Table 3に報告されている通り、SCI 0.81、SDI 0.71、Recall@5 89.2%、mAP 86.4%、およびシルエット係数 0.74を達成しました。追加の構造モジュールにより、Table 4に報告されている通り、パラメータ数は25.6 millionから29.3 millionへ、推論時間は1枚あたり15ミリ秒から22ミリ秒へと増加しました。本プロトコルの技術的な貢献は、画像レベルの衣服コンポーネントグラフの構築、外観とコンポーネント関係の並列エンコーディング、構造ガイド付き特徴融合メカニズム、および構造的一貫性、関係性、識別性の目的関数にある点です。Figure 11に報告されている検証スイープは、固定の学習係数を決定するためだけに行われたものであり、ネットワークアーキテクチャや目的関数の設計への貢献として提示されるものではありません。
本プロトコルは、深刻な遮蔽、衣服の重なり、ソース画像の小ささ、ポーズの変動、複雑な背景、および可視化された構成が固定された7領域スキーマに準拠しない衣服に対して依然として敏感です。非対称なデザイン、取り外し可能なレイヤー、密なドレープ、多層のボトムス、および重なり合った装飾領域は、複数の意味的領域を統合させたり、現在のグラフ定義に存在しないコンポーネント関係を導入したりする可能性があります。遮蔽は、アクティブなコンポーネントを抑制し、その確率重心をシフトさせ、有効な共有境界関係を排除することがあります。図6は、大まかな上半身カテゴリーの回復は見られるものの、袖のトポロジーの一致が不完全であることを示しており、図7および10では、隣接する背景領域に応答が保持されています。これらの結果は、テンソルの次元とグラフの接続性が有効であっても、意味的に正しい構造的解釈が保証されるわけではないことを示しています。したがって、本研究は、デザインワークフローの効率化やパターンパラメータの直接的な推定ではなく、画像ベースの検索、クラスタリング、および差異の局在化を支持するものです。本研究におけるすべての定量的実験は、保持され構造的に再ラベル付けされたDeepFashion2コホートを用いて実施されています。現在の結果は、異なる衣服分類、アノテーション基準、文化的衣類カテゴリー、画像ソース、または取得環境を持つ独立したデータセット全体における堅牢性を立証するものではありません。別のデータセットへ移行する場合、7つのコンポーネントチャネルの再マッピングおよび型定義された関係スキーマの再構築が必要になる可能性があります。したがって、報告された結論は、評価されたデータ分布および画像レベルのコンポーネント定義に限定されます。
これらの制限範囲内において、本プロトコルは、セマンティックパース、幾何学的関係のモデリング、デュアルストリームエンコーディング、および構造ガイド付きフュージョンを通じて、衣服画像からコンポーネントを認識した表現を得るための再現可能なシーケンスを提供します。今後の検証では、異なるアノテーションシステム、衣服カテゴリー、ポーズ、および背景条件を持つ独立した衣服データセットを使用します。また、現在の7領域マッピングが、非対称、レイヤード、取り外し可能、または文化的に固有な衣服構造に対して拡張が必要かどうかも検討します。手書きのデザインスケッチ、生地をまたいだバリエーション、およびパラメータ化されたパターン調整は、タスク固有のデータと評価手順を必要とする個別の応用方向として残されています。専門的なユーザビリティおよびデザインレビューの効率については、定義された参加者、評価基準、および統計的手順を備え、別途文書化されたヒト被験者研究が必要です。
著者らに申告すべき利益相反はありません。
本研究は、第14次5ヵ年計画における省レベルの重点学部教育改革プロジェクト(第2次募集)の、「『三統合・三融合』共同構築モデルに基づく『衣服・アパレルデザイン』の教育改革と探究」(プロジェクト番号:JGZD2024096)というプロジェクトの支援を受けて実施されました。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 中央処理装置 | Intel Corporation | Intel Core i9-13900K、24コア、32スレッド、最大5.80 GHz | |
| Conda | Anaconda, Inc., anaconda.com | Miniconda3 23.11.0 | |
| CUDA Toolkit | NVIDIA Corporation, developer.nvidia.com | CUDA 11.8 | |
| cuDNN | NVIDIA Corporation, developer.nvidia.com | cuDNN 8.9.7 | |
| DeepFashion2データセット | 香港中文大学、github.com/switchablenorms/DeepFashion2 | 公式DeepFashion2リリース、バージョン1.0 | |
| グラフィックス処理装置 | NVIDIA Corporation | NVIDIA GeForce RTX 4090, 24 GB GDDR6X | |
| HRNet-W48 セマンティックパース チェックポイント | HRNetプロジェクト、github.com/HRNet/HRNet-Semantic-Segmentation | hrnet_w48_garment_parser_7class.pth, プロジェクトチェックポイント バージョン1.0 | |
| ImageNetで事前学習済みのResNet-50重み | PyTorch Foundation, pytorch.org | ResNet50_Weights.IMAGENET1K_V2 | |
| Matplotlib | Matplotlib開発チーム、matplotlib.org | バージョン 3.8.2 | |
| NumPy | NumPy開発者、numpy.org | バージョン 1.26.4 | |
| NVIDIAグラフィックスドライバー | NVIDIA Corporation | バージョン 546.33 | |
| OpenCV-Python | OpenCVチーム、opencv.org | バージョン 4.8.1.78 | |
| オペレーティングシステム | Microsoft Corporation | Windows 11 Pro 23H2, 64ビット, OSビルド 22631.3155 | |
| Pandas | Pandas開発チーム、pandas.pydata.org | バージョン 2.1.4 | |
| Python | Python Software Foundation, python.org | バージョン 3.10.13 | |
| PyTorch | PyTorch Foundation, pytorch.org | CUDA 11.8対応 Version 2.1.2 | |
| PyYAML | PyYAMLプロジェクト、pyyaml.org | バージョン 6.0.1 | |
| scikit-learn | scikit-learn 開発者、scikit-learn.org | バージョン 1.3.2 | |
| SciPy | SciPy開発者、scipy.org | バージョン 1.11.4 | |
| ソースコードリポジトリ | 原稿とともに提出された補完ソースコードアーカイブ | 衣類トポロジープロトコル、バージョン1.0 | |
| 保存装置 | サムスン電子 | Samsung 990 PRO NVMe SSD, 2 TB | |
| システムメモリ | Kingston Technology | Kingston FURY Beast DDR5, 64 GB, 2 × 32 GB, 5600 MHz | |
| torchvision | PyTorch Foundation, pytorch.org | CUDA 11.8対応 バージョン 0.16.2 | |
| ワークステーション | カスタム構築のディープラーニング用ワークステーション | Intel Core i9-13900K、NVIDIA GeForce RTX 4090、64 GBメモリ、2 TB NVMe SSD |