本プロトコルでは、意味的コンポーネント解析、トポロジーモデリング、デュアルストリーム特徴エンコーディング、および構造誘導融合を統合することで、構造を認識した衣服表現を生成します。これにより、コンピュータビジョンおよびアパレル研究者は、色やテクスチャではなく、コンポーネントの構成やシルエットのレイアウトに基づいた衣服の検索やデザインリファレンスの比較を行うことが可能になります。
本プロトコルでは、意味的コンポーネント解析、トポロジーモデリング、デュアルストリーム特徴エンコーディング、および構造誘導融合を統合することで、構造を認識した衣服表現を生成します。これにより、コンピュータビジョンおよびアパレル研究者は、色やテクスチャではなく、コンポーネントの構成やシルエットのレイアウトに基づいた衣服の検索やデザインリファレンスの比較を行うことが可能になります。
衣類の画像検索手法では、色やテクスチャが重視される傾向があり、外観が似ていても構成要素の配置が異なる衣類の間で混同が生じることがあります。本研究では、衣類画像検索およびデザイン参照比較のための、構成要素を考慮した特徴学習プロトコルを提案します。このプロトコルは、衣類の意味的な領域をパースして画像レベルの衣類構成要素グラフを構築し、外観と構成要素間の関係を並列にエンコードし、構造的一貫性、構造的関係、および構造的識別の各損失を用いて両方の表現を融合させます。DeepFashion2の画像を512 x 512ピクセルに標準化し、HRNet-W48でパースし、ResNet-50とグラフ畳み込みでエンコードした後、構造的な検索とクラスタリングを通じて評価を行いました。完全なモデルにより、構造的一貫性指標0.81、構造的識別指標0.71、Recall@5 89.2%、平均適合率(mAP)86.4%、およびシルエット係数0.74を達成しました。本プロトコルは、表面的な外観が衣類の構造を正確に表現していない場合に、衣類構造の検索、構造比較、および相違箇所の特定を可能にします。
アパレル業界へのコンピュータビジョンと人工知能の統合が進むにつれ、衣類画像の解析は、基本的な認識タスクからデザイン重視の解析や意思決定支援へと徐々に拡大しています1,2。アパレルデザインのプロセスにおいて、デザイン案の区別は、単なる外見上の違いよりも構造的な構成や構成要素間の関係性に依存するため、デザイン支援におけるアパレル画像特徴量の構造的な表現力が、解析の有効性を左右する重要な要因となります3,4。しかし、既存の視覚的解析手法の多くは依然としてテクスチャ、色、およびグローバルな輪郭を主な特徴量として依拠しており、デザインプロセスにおける衣服の階層構造や構成の違いを体系的に解析することが困難です5,6。したがって、デザイン解析の客観性と一貫性を向上させるためには、アパレルデザイン支援に向けた構造認識型の画像特徴量学習手法を開発することが重要です7。本プロトコルは、衣服が類似した色、テクスチャ、またはグローバルな輪郭を共有しているが、構成要素の組織化、接続パターン、または空間的レイアウトが異なる場合に適しています。このような条件下では、外見中心の表現では構造的に異なるデザインが特徴空間上で近接して配置される傾向があり、検索やデザイン比較の信頼性が低下します。本プロトコルは、衣服構成要素間の関係性が構造的検索、デザイン評価、および局所的な差異解析の主要な根拠となるタスクに対処します。
データスケール、モデルの複雑さ、およびタスクの多様性の点において、衣類画像の自動解析および理解に関する現在の研究は著しい進歩を遂げています8,9。しかし、実際のアプリケーションでは、衣類の構造情報はセグメンテーションや検出の結果に暗黙的に含まれていることが多く、特徴学習段階の統合的なモデリングでは考慮されていません。その結果、特徴空間において異なる構造設計間の安定した区別が欠如しています10,11。衣類構成要素間の空間的関係、階層的制約、およびトポロジー構造が明示的にエンコードされていないため、特徴表現がデザインレベルでの構造的な差異を反映させることが困難となっています12,13。明示的な構造モデリングの欠如は、デザイン支援シナリオにおける衣類画像特徴の解析粒度と意思決定の信頼性を制限しており、より深い意味理解を備えたインテリジェント設計システムの開発にとって大きな障壁となっています14。
衣服の画像特徴学習および分析を支援するため、関連研究ではいくつかの技術的な方向性が探索されてきた15。セマンティックセグメンテーションやガーメントパース(衣服解析)の手法により、ピクセルレベルのアノテーションを通じて衣服の領域や構成要素の精緻な描写が可能となり、構造情報の抽出に向けた基盤が提供されている16,17。画像クエリによる衣服検索手法では、トポロジーと色・テクスチャの融合、グローバルおよびローカルのアテンションアライメント、ガーメントパース、マルチスケールおよびマルチグラニュラリティ表現、そして特徴選択を伴うレジデュアルアテンションなどが導入されてきた。これらの手法は、カタログ検索、消費者から店舗へのマッチング、クロスドメイン製品検索、および電子商取引における視覚検索を対象としている。各手法は視覚クエリに基づいて衣服画像をランキングするため、その適用設定はデザイン参照検索と密接に関連しているが、特徴融合の過程で型指定された構成要素の隣接関係や垂直方向の順序関係は保持されていない18,19,20。一方で、デザインやレコメンデーションのシナリオに関する研究では、マルチモーダル融合、関係モデリング、およびスタイル分析が徐々に導入され、衣服の視覚的特徴の適用範囲が拡大している21,22。これらの手法はそれぞれのタスクにおいて進展を見せているものの、その核心となる特徴は依然として大部分の外観記述に基づいており、構造情報が特徴学習のための本質的な制約として一様にモデル化されていない。そのため、構造的な整合や構造比較を必要とする衣服デザイン支援のニーズを満たすことは困難である23。
衣類デザイン支援における構造的差別化能力の不足に対処するため、本論文では衣類構造の知覚に基づく画像特徴学習手法を提案する。この手法は、衣類解析結果と主要な構造情報を衣類画像の入力段階に組み込み、衣類構成領域、空間関係、および階層的接続を共同でモデル化する。構造関係のエンコーディングと視覚的な特徴アライメントにより、衣類の制約を特徴学習プロセスに明示的に統合し、視覚的な外観と構造的な一貫性の両方を保持した表現を生成する。この特徴は、統一された空間内で衣類の構造的な差異を特徴づけ、その後の構造的類似性分析、構造的クラスタリング、およびデザイン支援の意思決定のための安定した基盤を提供し、これにより既存の手法における構造モデリングの欠如に起因する特徴の混同問題を軽減する。構造情報を緩やかに接続された補助属性として扱う一般的な視覚検索戦略とは異なり、本フレームワークはトポロジー関係を中心とした特徴変調メカニズムを構築している。このメカニズムは、学習された表現が可視的な衣類領域の構成に従うことを促進し、同時にテクスチャ主導の応答を低減させる。各グラフノードは画像レベルのセマンティック領域を表し、各グラフ関係は画像平面における可視的な隣接関係または正規化された相対位置を記述する。得られたエンべディングは、異なる衣類画像間での構成要素のレイアウトやシルエット構成の比較を可能にする。これらの領域および関係は、縫製パターンのピース、シーム接続、構築上のランドマーク、またはグレーディングパラメータではない。外観駆動型の検索手法と比較して、本プロトコルは構造情報をダウンストリームの解析結果として扱うのではなく、特徴学習を通じて明示的な構成要素のトポロジーを保持する。構造的な手がかりを補助的な入力としてのみ導入するアプローチと比較して、デュアルストリームエンコーディングとトポロジー一貫性のある融合により、テクスチャ主導の応答を抑えつつ幾何学的関係を保持する。結果として得られる表現は、衣類構造の検索、構造的クラスタリング、デザインリファレンスの選別、および局所的なデザイン差異分析をサポートし、同時に衣類デザインプロセスにおいて解釈可能な構成要素レベルのエビデンスを提供する。本プロトコルに関連する研究領域は、衣類画像の特徴学習、衣類構造のモデリング、構造認識表現、およびアパレルデザイン支援のための視覚分析にわたる。
特徴表現のレベルにおいて、衣類画像の研究は長らく外観モデリング、深層特徴抽出、およびマルチスケール表現に焦点を当ててきました24,25。初期の研究では、畳み込みニューラルネットワークを用いて、分類、検索、および類似性マッチングタスクのための衣類画像のエンドツーエンドモデリングが行われました26,27。その後、異なる視野角、ポーズ、および撮影条件による衣類画像間の差異を緩和するために、マルチスケール特徴融合およびクロスドメイン学習が導入されました28,29。検索タスクにおいては、特徴の識別能と計算効率を向上させるために、アテンションメカニズムと特徴圧縮戦略が用いられました30,31。これらの手法は信頼性の高い外観識別を実現していますが、その特徴学習プロセスは依然としてグローバルな視覚情報に重点を置いており、衣服内部の構造に関する体系的な表現に欠けています32。構成的ファッション検索手法は、参照画像とテキストによる修正指示をさらに組み合わせていますが、そのクエリモダリティは本研究で検討している画像のみのプロトコルとは異なります。これらは関連する商用検索の方向性としてレビューされますが、追加のテキスト入力があると制御された画像クエリ評価ができなくなるため、定量的比較には含まれていません。
衣服の画像解析が外見の識別から構造的な理解へと移行するにつれ、衣服の構成要素、幾何学的関係、およびトポロジカルな接続のモデリングに焦点を当てた研究が増えています33。セマンティックセグメンテーションネットワークは、特徴投影とマルチアテンションメカニズムを通じて、衣服の構成要素レベルの解析を実現しており、構造情報の抽出のための信頼性の高い基盤を提供しています34,35。キーポイント検出および構造トポロジーモデリングの手法は、衣服の外形と局所構造との関係をさらに特徴づけ、衣服の幾何学的特徴を表現するモデルの能力を向上させました36,37。いくつかの研究では、衣服構成要素間の関係をモデリングするためにグラフ構造と関係推論ネットワークが導入され、それによって詳細な認識とクロスドメイン検索の性能が向上しました38,39。これらの研究により、視覚的解析における構造情報の重要な役割が検証されましたが、構造は主に補助的な特徴または中間結果として利用されており、構造的制約を核とした特徴学習システムはまだ開発されていません40。
アパレルデザイン支援において、これらの進展はデザインの推奨、スタイル分析、インタラクティブシステムの構築、および構造指向のデザイン評価を支えてきました41。レコメンデーションシステムの研究では、視覚的特徴とユーザーの好みを統合することで、アパレルのマッチングやパーソナライズされた推奨を実現しています42。デザイン支援に関する研究では、生成モデル、スタイルモデリング、および人間とコンピュータの協調メカニズムを組み合わせることで、インテリジェントなデザインサポートの新たな道を模索してきました43。バーチャル試着、サイズ測定、およびスタイル転送に関する研究は、デザインから生産プロセスに至るまで、アパレル視覚分析の適用範囲を広げました。これらの研究によってアパレルデザイン支援の技術的形態は豊かになりましたが、その核心となる視覚的特徴は依然として主に外観に依存しており、分析のためのデザイン構造の統一された表現が不足しています。対照的に、本論文では衣服の構造を特徴表現の核心的な制約として扱い、アパレルデザイン支援における構造分析のための視覚的表現手法を提示します。
このような進展があるにもかかわらず、近年のジェネレーティブデザインの手法では、構造的条件を拡散プロセス内での緩やかな空間ガイダンス行列として扱うことが多い。現代の構造解析フレームワークでは、トポロジーを主要な視覚的埋め込み空間とは別の補助的な意味論的ラベルとして表現している。提案するフレームワークは、コンポーネントレベルでの視覚的特徴学習を明示的に変調させる、グラフ事前分布に基づくトポロジー制約を定義することで、このメカニズムを変更する。マルチレベルの一貫性目的関数は、画像レベルでのコンポーネント配置が類似している衣服を特徴空間内で近接させ、一方で可視領域の構成が異なる衣服を分離させるように促す。この目的関数は、評価された検索設定におけるテクスチャへの依存性を低減させるが、素材、ポーズ、または背景の変化に対する不変性を確立するものではない。本プロトコルは、入力画像に十分に可視化された個別の衣服が含まれており、意味論的なコンポーネントが識別可能な境界を保持しており、かつ分析目的が粗いカテゴリー認識ではなくコンポーネントレベルの構造比較を必要とする場合に選択されるべきである。本手法は、構造に敏感な視覚分析に従事するコンピュータビジョン研究者、アパレルデザイン研究者、およびデジタル衣服開発チームを対象としている。色や素材の認識のみに焦点を当てたタスクや、衣服のトポロジーが大部分的に隠れている画像には適していない。以下のプロトコルでは、データセットの準備と意味論的確率マッピングから、幾何学的関係の構築、デュアルストリーム特徴エンコーディング、構造ガイド付き融合、および一貫性に基づく最適化までのワークフローを提示する。ワークフロー全体の概要はFigure 1にまとめられている。
本研究では、公開されている衣類画像データセットを使用しており、ヒト被験者の募集、個人情報の収集、動物実験、および生物学的材料の使用は行っていない。そのため、機関の倫理承認およびインフォームド・コンセントは適用されない。
1. ソフトウェア環境とプロジェクト設定
2. 入力画像の受入、データセットの構築および前処理
3. 前景制限視覚コンポーネントのパースおよび確率マッピング
4. 画像レベルのコンポーネント幾何学および空間関係のモデリング
5. デュアルストリーム構造認識特徴エンコーディング
6. 構造ガイド付き特徴融合
7. モデルのトレーニングと一貫性の最適化
8. 推論、検索、クラスタリング、および出力の検証
9. 比較モデル評価
報告されたすべての実験は、表2および材料表に記載されたハードウェアおよびソフトウェア環境を用いて実施されました。前処理、トレーニング、推論、および評価を通じて、同一バージョンのグラフィックスドライバー、CUDA、cuDNN、Python、NumPy、PyTorch、およびtorchvisionが使用されました。ハードウェアおよびソフトウェア環境の詳細は、表2および材料表にまとめられています。表1には、処理済みのトレーニング、検証、およびテストデータセットと、画像レベルのトポロジー統計がまとめられています。表2には、すべての比較手法に使用された共通の設定がまとめられています。
比較評価結果
比較評価は、「プロトコル」セクション7〜9で規定された、一般的なデータ分割、前処理操作、トレーニング制御、および指標の定義に従って行われた。 表3 一般的な視覚エンコーダー、部位アラインメントモデル、グラフベースの衣類表現、クロスドメイン・ファッション検索ネットワーク、トポロジーおよび外観融合手法、ならびにECサイト向け視覚検索手法を、すべて同一の画像クエリプロトコルを用いて評価し、比較します。ドメイン固有の手法には、色およびテクスチャ融合を伴うトポロジー特徴ヒストグラム(TFH-CT)、アテンションガイド付きカスケードネットワーク(AGC-Net)、マルチスケールおよびマルチグラニュラリティ特徴学習ネットワーク(MMFL-Net)、およびエグレット群最適化を用いた残差ネットワークによるファッション検索(FARE-RNET)が含まれます。すべての評価指標は、 表3 同一のランダムシード、トレーニングマニフェスト、検証マニフェスト、テストマニフェスト、クエリ・ギャラリー割り当て、および指標の実装を用いて5回の独立した試行を行い、その平均値と標本標準偏差として報告されている。ペアを組んだ p-同一の乱数シード条件下で各手法を提案手法と比較することにより、SCI、SDI、Recall@5、mAP、およびシルエット係数の値を個別に算出した。これらの結果は、その後の構造可視化、検索、クラスタリング、および設計指向解析のための定量的な根拠となる。
代表的なプロトコルの結果と解釈
保存されたパースファイルおよびグラフファイルから再構成された画像レベルのコンポーネントグラフにおいて、すべての活性ノードが対応する衣類領域内に配置され、図5Cに示すように、型指定隣接行列に記録されたリレーションタイプが保持されていれば、プロトコルの実行は成功したといえます。構造を考慮したレスポンスは、図5Dに示すように、衣類の前景に集中している必要があります。Figure 6Eは期待される検索結果を示しており、提案手法によって赤い背景の影響が低減され、無関係な赤い物体ではなく上半身の衣類が検索されています。図6B–Gはまた、検索ランキングが画像レベルのコンポーネントリレーションおよび融合後のコンポーネント対応によって支持されていることを示しています。この結果は、袖の長さや局所的なトポロジーには依然として個体差があるものの、大まかな衣類カテゴリーの回復を反映しています。
代表的な失敗例として、図 5Bにおけるテクスチャ主導の活性化、図 6の上段における背景色による検索、および図 7における残留背景活性化が挙げられます。図 7については、支配的な応答が拡大した下半身のシルエットと右側の衣類境界に従っている一方で、隣接する背景領域に活性化が残留しているため、部分的な局在化であると解釈されます。トポロジー差分行列、幾何学的関係差分行列、融合後コンポーネント差分グラフ、および空間応答が、一貫した衣類領域を特定した場合にのみ、その局在化は構造的に裏付けられているとみなされます。行列やコンポーネントに相当する変化を伴わない空間的なホットスポットは、構造的な根拠ではなく、視覚的な干渉であることを示しています。
プロトコルの実行は、承認されたすべての画像から、正規化された意味確率マップ、K行K列のリレーション行列、K行512列の外観および構造特徴行列、および正しい画像識別子に紐付けられた有限の融合特徴ベクトルが生成された場合に有効であると見なされます。視覚的な検査により、トポロジーが衣類の構成部品に従っていること、前景の応答が背景の応答を上回っていること、および検索結果が背景色ではなく衣類のカテゴリーと構造に基づいて導出されていることを確認する必要があります。確率マップの断片化、コンポーネントノードの欠落、非数値行列、拡散した背景応答、または色に支配された検索結果は、実行の失敗を示しており、パース、グラフ構築、特徴融合、またはチェックポイントのロードの検証が必要です。
画像レベルでの衣服構成要素の応答に関する視覚的解析
図5では、同一の衣類画像を用いて、ResNet-50のベースラインとコンポーネント認識モデルを比較しています。図5Bは、外観ベースラインのクラス活性化マップ(CAM)を示しています。図5Cは、プロトコルのセクション3および4で生成された、前景制限確率マップ、コンポーネント中心行列、型付き隣接行列、非活性ノードマスク、およびコンポーネントラベルマッピングから再構成された、画像レベルの衣類コンポーネントグラフを示しています。図5Dは、融合表現の活性化応答を示しています。図5Cの生成にあたり、人間の姿勢推定器や人間の関節アノテーションは使用されていません。
ベースラインの応答は、図5Bに示すように、下衣の局所的なテクスチャ領域に集中しており、衣類全体の境界に一貫して沿っていませんでした。図5Cでは、各ノードは活性化した衣類コンポーネント領域の中心に対応し、各エッジは共有された前景境界または定義済みの垂直方向の順序関係を表しています。このグラフは衣類領域の構成を反映したものであり、人間の解剖学的な関節を表すものではありません。構造を認識した応答は、図5Dに示すように、ほとんどの背景領域で活性化を低く抑えつつ、主要な衣類の前景をカバーしていました。これらの結果は、コンポーネントグラフと特徴融合モジュールによって、評価画像におけるテクスチャ主体の活性化が抑制されたことを示しています。
衣類の構造的類似性分析およびデザイン参照結果
図6に、検索ランキングと、その解釈に用いられた構造的根拠を示します。図6Bのクエリコンポーネントグラフは、活性化された衣類領域とその型定義された関係を記録しており、図6Cの行列は、グラフ伝播に提供された関係パターンを示しています。図6Dのベースラインの結果では、依然として赤色の外見的な手がかりが支配的です。図6Eの構造認識結果では、異なる色や背景においても上半身の衣類カテゴリーが維持されています。図6Fの最高ランクの結果におけるコンポーネントグラフにより、クエリグラフとの直接的な比較が可能となり、図6Gの対応行列は、同じ識別子を共有するコンポーネントが構造誘導融合後も整列したままであるかを示しています。対角線上の対応は、欠損ノードや変化したグラフ関係と合わせて解釈されるべきです。グラフの一致を伴わない強い外見的類似性は、構造的な検索の成功とはみなされません。
検索された衣類は大まかなカテゴリーは維持しているが、袖の構成や局所的なコンポーネント間の関係性に相違が見られるため、きめ細かな対応関係は不完全である。提案手法は、表3に報告されている通り、Recall@5で89.2%、mAPで86.4%を達成した。これらの定量的数値はランキング性能を示す一方、図6B–Gは、その解釈を支持する中間的な構造的根拠を提示している。したがって、検索結果としての結論は、テストしたクエリにおいて、背景色の干渉に対する耐性が向上し、画像レベルのコンポーネント構成が強化されたことに限定される。
構造的差異に対する応答および設計解析サポート
図7Hの純粋な差分応答ヒートマップは、支配的な応答がターゲット画像の拡大された下半身のシルエットと右側の衣服の境界に集中していることを示しています。図7Iのオーバーレイでは、最強の応答が主要な衣服の前景と一致し続けている一方で、隣接するカーテンや壁の領域における弱い活性化が残留背景干渉として残っていることがわかります。空間応答は、図7C–Gに示されているコンポーネントグラフおよび行列のエビデンスと併せて解釈されるべきです。高応答の衣服領域が、隣接関係の変化、幾何学的関係の変化、および融合後のコンポーネント間距離パターンと一致する場合にのみ、その応答は有効な構造的差分として扱われます。
構造的な差異は、図 7Eに示されるタイピングされた隣接関係の変化、または図 7Fに示される幾何学的関係の変化に伴い、図 7Gにおけるコンポーネント間距離の増加および図 7H,Iにおける前景整列空間応答が認められた場合にのみ受理される。拡大した下半身領域と右側の衣服境界は、このステージ横断的基準を満たしている。カーテンおよび壁面における活性化は、コンポーネントノード、関係パターン、または融合コンポーネント距離の変化に対応しておらず、したがって非構造的な残留干渉として棄却される。この結果は画像レベルの差異局在化を支持するが、縫製パターンや構造パラメータの変動を立証するものではない。
特徴の空間分布および構造クラスター分析
潜在特徴空間の分布を分析することで、衣類の構造的意味論を識別するモデルの能力が明らかになります。この分析では、構造的事前知識によって、異なるトポロジー構成を持つ衣類が個別の特徴多様体に整理されるかどうかを検証します。テストセットから、半袖トップス、パンツ、スカート、ロングコート、ドレスの5つの代表的な構造カテゴリーを選択しました。高次元の特徴ベクトルは、t-distributed stochastic neighbor embedding (t-SNE) を用いて2次元平面に投影されました。特徴空間における構造的意味論の構成を特性化するため、類似サンプルの凝集性と非類似サンプルの分離性を評価しました。構造認識特徴空間のt-SNE分布を図 8に示します。
図8Aに示すように、t-SNE投影により、隣接するカテゴリー間の重複が限定的な5つの主要な特徴領域が形成されました。これら5つのカテゴリー領域に対応する代表的なサンプルを図8Bに示します。表3に報告され、図8で可視化されている通り、0.81というSCIは同じ構造ラベルを共有するサンプルの凝集性を反映し、0.71というSDIは異なる構造ラベルを持つサンプル間の分離度を反映しています。これらの指標は特徴空間の分布の尺度として解釈されるべきであり、誤警報率を直接的に規定するものではありません。図8Aに示すように、半袖トップスとスカートは投影された特徴空間において異なる主要領域を占めていましたが、少数のサンプルは隣接するカテゴリーの境界付近に留まっていました。パンツとドレスについても、隣接カテゴリーからの明確な分離が認められました。この分布は、グラフ事前分布が、完全なクラスター分離をもたらすことなく、カテゴリーレベルの構造的組織化に寄与したことを示しています。この評価では、表現の質と検索の有効性を分けて検討しています。SCIは、同じ構造ラベルを共有する衣服が学習された特徴空間において凝集しているかを評価し、SDIは、異なる構造ラベルを持つ衣服が分離しているかを評価します。これらの指標は、プロトコルの構造的表現の目的に対応しています。Recall@5は、構造的に関連する衣服が検索結果の上位5件以内に現れるかを測定し、mAPはすべての関連ギャラリーサンプルにおけるランキングの質を測定します。これらの指標は、デザイン参照検索の目的に対応しています。SCIとSDIで既に特徴空間の組織化が特性付けられているため、シルエット係数はクラスタリング性能の評価のみに使用されました。
図9は、手法間の正規化を行わない、代表的な4つの手法における5回の試行の生の結果を示している。図9Aは元のスケールでのSCIおよびSDIを、図9BはパーセンテージとしてのRecall@5およびmAPを示している。個々の試行マーカーと標準偏差の誤差線は、単なる集計ランキングではなく、モデルトレーニングに伴う変動を示している。外観ベースのベースラインは0.62のSCIを達成したが、提案手法は0.81のSCIおよび0.71のSDIを達成した(表3および図9A)。SCIおよびSDIの結果は、評価設定において、ラベル内でのより強い凝集性とラベル間のより強い分離性が得られたことを示している。提案手法は89.2%のRecall@5および86.4%のmAPを達成した(表3および図9B)。これらの検索指標は異なるランキング特性を評価するものであり、SCIおよびSDIとは別に解釈される。4つの指標すべてで手法の順位が一致していることは、表現の品質と検索性能が整合していることを示しているが、4つの評価次元において相対的な改善度が同一であることを意味するものではない。
アブレーション実験および構造モジュールの有効性分析
アブレーション実験では、完全なモデルと、構造的事前知識(structural prior)または融合モジュール(fusion module)を削除したバリアントを比較しています。これら3つの構成すべてで同じ参照画像とターゲット画像を使用しているため、背景応答と局在化の集中度を直接比較することが可能です。構造的事前知識のないバリアントでは、画像レベルの衣類コンポーネントグラフとその関係制約を削除し、外見特徴の抽出を畳み込みバックボーンのみに依存させています。非融合バリアントでは、グラフ推論は維持していますが、特徴ピラミッドを削除し、高レベルのセマンティック特徴のみを使用しています。可視化された差分ヒートマップから、ノイズ抑制と境界定義における各モジュールの具体的な役割が明らかになります。異なるモジュール構成における構造的差分応答の定性的な比較を図10に示します。
図10C–Eの応答マップは、共通の応答スケールと同一のオーバーレイ設定を用いて描画された。構造事前分布(structure prior)のないバリアントでは、図10Cに示すように、左側の背景および無関係な環境領域周辺に強い活性化が見られた。フュージョンモジュール(fusion module)のないバリアントでは、衣服外の応答の一部は減少したが、図10Dに示すように、下衣および右側の周辺領域にわたる広範な分散が依然として保持されていた。完全なモデルでは、図10Eに示すように、支配的な応答が主たる衣服の前景に向けてさらに収束した。図10Fは、非フュージョンバリアントと完全なモデルの間で、前景に限定された応答の差を直接的に可視化しており、完全なモデルが主要な衣服に沿った応答を維持しつつ、残留する側方への分散を抑制していることを示している。これらの結果は、構造事前分布が主に環境ノイズを減少させ、フュージョンモジュールが応答の集中度と構造的な整合性をさらに向上させたことを示唆している。図10E は、背景活性化の完全な除去ではなく、相対的な改善を表している。
表4に、構造事前知識(structure prior)なし、融合モジュール(fusion module)なし、および完全なモデルにおけるSCI、SDI、Recall@5を示す。構造事前知識を除去すると、SCIは0.81から0.65に低下し、Recall@5は89.2%から74.5%に低下した。融合モジュールを除去すると、SDIは0.71から0.64に低下し、Recall@5は89.2%から85.1%へと4.1パーセントポイント低下した。これらの結果は、構造事前知識が構造的一貫性と検索に大きな影響を及ぼす一方で、特徴融合外観情報と構造情報の整合性を向上させることを示している。
効率分析では、完全モデルとResNet-50ベースラインの計算コストを比較している。ResNet-50ベースラインでは2,560万個のパラメータと41億回の浮動小数点演算が必要であった。一方、完全な構造認識モデルでは2,930万個のパラメータと54億回の浮動小数点演算が必要であった。1画像あたりの平均推論時間は、ベースラインで15ミリ秒、完全モデルで22ミリ秒であり、7ミリ秒の増加となった。この結果は、時間を要するワークフローに本プロトコルを導入する際に考慮すべき、測定可能な計算コストが存在することを示している。表5)構造制約の重みは、最終的なテスト評価の前に検証用スプリットを用いて決定した。構造制約の重みを0.1、0.3、0.5、0.8、1.0、1.2、1.5、および2.0として、検証用Recall@5を検討した。それ以降のすべてのトレーニングおよびテストにおいて、重みを1.0に固定した。 図11 バリデーションに基づく構造拘束ウェイト1.0の選択について記録している。

図 1: 構造認識型衣服画像特徴学習プロトコルの全体的なワークフロー。入力された衣服画像は、外観特徴ブランチと、セマンティックパースおよび空間グラフモデリングを用いる構造特徴ブランチによって処理される。これら2つの表現は、構造誘導型フュージョンモジュールで処理され、最終的な構造認識特徴が生成される。構造一貫性損失、構造識別損失、および構造関係損失が共同で特徴空間を制約する。本図は、特徴学習全体を通じて衣服の外観とコンポーネントのトポロジーがどのように統合されるかを示している。こちらをクリックして、この図の拡大版を表示してください。

図 2: 画像レベルの衣類コンポーネントトポロジーの事前構築。 (A) 入力された衣類画像 I。(B) 前景に限定された視覚的コンポーネントマップ P。ここでは7色の色で画像レベルの衣類領域が示されている。すべての背景ピクセルはコンポーネントチャネルから除外される。(C) 画像レベルのコンポーネント関係グラフ G。ノードは可視化された衣類領域を表し、実線のエッジは共有された前景境界を、破線の関係は事前定義された垂直方向の順序を表す。このマップとグラフは、画像の検索および視覚的構造の比較を支援する。これらは、縫製パターンのピース、シームの形状、ダーツ構造、グレーディングパラメータ、または裁断指示を表すものではない。この図の拡大版を表示するには、ここをクリックしてください。

図 3: 構造ガイド付き特徴融合モジュール。 構造的特徴は、線形写像と活性化関数 Ψ によって変換され、構造重みが生成されます。この構造重みは、要素ごとの乗算を通じて外観特徴を変調させます。変調された外観特徴と構造的特徴は結合され、Wc によって投影された後、残差構造特徴が加算されて最終的なコンポーネント特徴が生成されます。本図は、最終的な融合の前に構造情報が外観特徴の重み付けを制御することを示しています。こちらのリンクをクリックして、この図の拡大版を表示してください。

図4構造的一貫性制約下における特徴空間の最適化。 (A) 構造的一貫性損失(structure consistency loss)によって、同じ構造クラスに属するサンプル同士が近づけられる一方で、構造関係損失(structure relationship loss)によって、それらの内部成分間の関係性が維持されます。 (B) 異なる構造クラスのサンプルは、構造識別損失によって互いに遠ざけられます。この図は、3つの構造的目的関数が共同して、クラス内の凝集性とクラス間の分離性をどのように向上させるかを示しています。 この図の拡大版を表示するには、ここをクリックしてください。

図5代表的な衣類の特徴量応答およびコンポーネントグラフによる可視化。 (A) 入力衣服画像。 (B) ResNet-50外観ベースラインのクラス活性化応答。 (C) 画像レベルの衣類コンポーネントグラフは、プロトコルのセクション3および4で保存された、前景制限コンポーネントマップ、コンポーネント中心行列、型指定隣接行列、非活性ノードマスク、およびコンポーネントラベルマッピングから再構成された。ノードは活性な衣類領域を表し、実線エッジは共有された前景境界を、破線エッジは定義済みの垂直方向の順序関係を表している。 (D) 統合されたコンポーネント認識表現の活性化応答。この比較は、テクスチャ主導の活性化と衣類領域ガイドによる活性化の違いを示している。 この図の拡大版を表示するには、ここをクリックしてください。

図6赤色背景干渉下における想起結果および中間構造的根拠 (A) クエリ画像 (B) クエリコンポーネントグラフは、保存されたコンポーネント中心と入力された隣接行列から生成されます。 (C) クエリとして入力された隣接行列であり、行列の値によって非活性な関係、共有された前景境界、および事前定義された垂直方向の順序関係を区別する。 (D) 上位3件の検索結果は、外観ベースラインによって生成された。 (E) 上位3つの結果は、構造認識表現によって導き出された。 (F) 最高ランクの構造認識結果のコンポーネントグラフ。 (G) クエリと最高ランクの結果との間の、融合後のコンポーネント対応行列。対角線上の高い対応は、同一の識別子を持つコンポーネント間の一致を示し、弱またはずれた応答は、コンポーネント構成の欠落または不一致を示す。検索結果において、大まかな上半身のカテゴリーは維持されているが、袖の構成および局所的なトポロジーにおける完全な一致には至っていない。 こちらの図の拡大版を表示するには、ここをクリックしてください。

図7: 画像レベルの衣服トポロジーから空間的応答に至る構造的差分の追跡。 (A) リファレンス画像。 (B) ターゲット画像。 (C) リファレンスコンポーネントグラフ。 (D) ターゲットコンポーネントグラフ。両グラフは、保存されたコンポーネント中心と型付き隣接行列から再構成されている。 (E) 型付き隣接差分行列。 (F) 幾何学的関係の差分は、コンポーネント中心の変位、空間的分散、および関係ウェイトの変化から導出される。 (G) フュージョン後のコンポーネント差分グラフ。ノードの強度は対応する融合コンポーネントベクトル間の正規化距離を表し、エッジの幅は関係ウェイトの変化を表す。 (H) 純粋な空間的差分応答ヒートマップ。オーバーレイと同じ固定応答スケールを用いてレンダリングされている。 (I) ターゲット画像にオーバーレイされた応答。隣接関係の変化、幾何学的関係の変化、コンポーネント間距離の変化、および前景に整合したヒート応答が一貫している場合にのみ、構造的差分として認められる。コンポーネントや関係の根拠がない背景の活性化は、有効な衣服構造の差分ではなく、残留干渉として処理される。こちらのリンクをクリックして、この図の拡大版を表示してください。

図 8: 構造を考慮した特徴空間クラスタリング。 (A) 半袖トップス、パンツ、スカート、ロングコート、およびドレスのt-SNE投影。5つのカテゴリーが主要な特徴領域を形成しており、境界付近での重複は限定的である。(B) 5つの衣類カテゴリーに割り当てられた代表的なテスト画像。枠線の色は(A)のカテゴリー色に対応している。本図は、隣接するカテゴリー領域付近に少数のサンプルを保持しつつ、カテゴリーレベルの構造的組織化を示している。こちらをクリックして、この図の拡大版を表示してください。

図 9特徴空間の構造および検索ランキングの目的関数における、生パフォーマンスの比較。 (A) 外観駆動ベースライン、弱構造モデル、明示的構造モデル、および提案手法におけるSCIおよびSDI。 (B) 同一の4つの手法におけるRecall@5およびmAP。大きなマーカーは5回の独立した試行における算術平均を、エラーバーは標本標準偏差を、小さなマーカーは試行ごとの結果を示している。SCIとSDIは0から1までの固定スケールで表示され、Recall@5とmAPは0から100までの固定パーセントスケールで表示されている。最小最大正規化および手法間のリスケーリングは適用されていない。 この図の拡大版を表示するには、ここをクリックしてください。

図10異なるモジュール構成下における構造的差異の応答。 (A) 参照画像 (B) ターゲット画像 (C) 先行構造を持たないバリアントの応答。 (D) 融合モジュールを持たない変異体の応答。 (E) 完全なモデルの応答。 (C–E) 同一の正規化応答スケール、カラーマップ、およびオーバーレイ設定を用いてレンダリングされています。 (F) 非融合バリアントと完全モデルとの間における、前景限定の絶対応答差。完全モデルは、主要な構造領域外の残留拡散を低減しつつ、衣類に沿った主たる応答を維持している。この比較により、構造事前分布が衣類外の干渉を低減し、さらに融合モジュールが構造応答をより鮮明にすることが示されている。 この図の拡大版を表示するには、ここをクリックしてください。

Figure 11: バリデーションに基づく構造制約ウェイトの選択。構造制約ウェイトを0.1、0.3、0.5、0.8、1.0、1.2、1.5、および2.0としたときのValidation Recall@5を示す。各点は5回のバリデーションランの算術平均を表し、各エラーラインは標本標準偏差を表す。最終的なテスト評価の前に、ウェイトは1.0に固定された。本図はパラメータ選択の手順を記録したものであり、独立したアーキテクチャ上の寄与を構成するものではない。こちらのリンクをクリックして、この図の拡大版を表示してください。
表1:衣服サブセットS1からS5におけるデータセットの割り当ておよび画像レベルのトポロジー統計。 本表は、各構造レベルにおけるトレーニング、検証、テスト、および合計の画像数とともに、平均セマンティックコンポーネント数、アクティブノード数、型付きエッジ数、およびアノテーション済み画像平面ランドマーク数を報告している。すべての数値は処理済みデータマニフェストから生成されたものである。トレーニング、検証、およびテストの画像数は、構造レビュー、重複グループ制御、およびリーク検査後の最終サブセットマニフェストから取得され、トポロジー統計は、モデル評価時に適用されたものと同じコンポーネント順序および関係定義を用いて最終グラフレコードから算出された。 こちらをクリックしてファイルをダウンロードしてください。
表2:プロトコル全体で使用された計算環境、入力設定、オーギュメンテーション、表現、最適化、損失、および再現性の設定。 この表には、正確なオペレーティングシステム、プロセッサ、搭載メモリ、グラフィックス処理ユニット、グラフィックスメモリ、グラフィックスドライバー、CUDA、cuDNN、Python、NumPy、PyTorch、およびtorchvisionのバージョンとともに、画像サイズ、バッチ構成、オプティマイザー、学習率スケジュール、エポック数、乱数シード、表現次元、および構造的目的関数の重みが記載されています。各値は、software_versions.txt、configs/protocol.yaml、または対応するトレーニング記録にリンクされています。こちらをクリックしてファイルをダウンロードしてください。
表3:一般的な視覚表現モデル、グラフベースの衣服モデル、およびドメイン固有のファッション検索手法の定量的比較。 本表は、同一のデータ分割および評価プロトコルの下での11の手法における検索フォーカス、クエリモダリティ、SCI、SDI、Recall@5、mAP、およびシルエット係数を示す。各指標は、5回の独立した試行における平均値と標本標準偏差として報告されている。報告されたp値は、同一の5つのランダムシードを用いて得られた結果に基づき、各比較手法と提案手法を比較した両側対応t検定から算出された。提案手法を基準行としている。こちらのリンクからファイルをダウンロードしてください。
表4:構造的事前知識および特徴融合モジュールの切除実験結果構造的事前知識を用いないバリアント、融合モジュールを用いないバリアント、および完全なモデルにおけるSCI、SDI、およびRecall@5を報告する。構造的事前知識を除去すると、SCIとRecall@5が大幅に低下する一方、融合モジュールを除去するとSDIと応答の整合性が低下する。完全なモデルは、これら3つの指標すべてにおいて最高値を記録している。こちらのリンクからファイルをダウンロードしてください。
表5:ResNet-50ベースラインと完全な構造認識モデルの計算効率。本表は、表2および材料表に記載されたハードウェアおよびソフトウェア環境下における、学習可能パラメータ数、画像あたりの浮動小数点演算数、および画像あたりの平均推論時間を報告している。両モデルともに、同一の画像解像度、推論バッチ設定、前処理操作、および計測手順を用いている。完全なモデルは、ベースラインと比較して、パラメータ数が3.7 million、浮動小数点演算数が1.3 billion、画像あたりの推論時間が7 milliseconds増加している。こちらのリンクからファイルをダウンロードしてください。
最も重要なプロトコルの段階は、衣服を保存するための前処理と、前景に限定した意味的コンポーネントのパース(解析)である。コンポーネントの中心、空間分散値、共有境界関係、垂直順序関係、関係の重み、および融合表現は、すべてパースの出力から導出される。境界の漏れ、コンポーネント領域の統合、コンポーネント領域の欠落、および不適切なチャネル割り当ては、グラフ構築および特徴融合を通じて伝播する。これらのエラーにより、グラフファイルの次元は有効であっても、表現されたコンポーネント間の関係が元の衣服と矛盾した状態になる可能性がある。したがって、構造的事前知識を承認する前に、確率マップ、前景制限、コンポーネントのプレビュー、およびパース品質の記録を確認しなければならない。
グラフの構築および特徴融合には、セマンティックコンポーネントの固定された順序が必要です。グラフは、前景の衣服コンポーネントと、それらの画像平面上の関係から導出されます。検索および差異局在化の図は、単に最終的なランキング画像やレスポンスヒートマップを表示するのではなく、構造的な処理パスを提示するものです。型定義済み隣接行列は個別のコンポーネント関係を記録し、幾何学的関係行列は正規化された空間配置を記録し、融合後のコンポーネント行列は検索および局在化に使用される表現を記録します。構造的な結論は、これらの中間表現が最終的な視覚的出力と一致する場合にのみ受け入れられるべきです。コンポーネントグラフでは、解剖学的ランドマーク、ヒトの関節座標、またはポーズ推定ネットワークは使用しません。グラフのオーバーレイは、そのノードと関係タイプが保存されたコンポーネントファイルおよび隣接ファイルから再現された場合にのみ受け入れられるべきです。非アクティブなコンポーネントは、非アクティブノードインジケータを伴うゼロベクトルとして保持されるべきであり、外観および構造特徴行列は、融合前にそれぞれK行512列でなければなりません。これらのチェックにより、ノードの不整合や次元エラーがモデルの挙動として誤認されることを防ぎます。
トラブルシューティングは、無効な中間出力が最初に現れた段階から開始してください。確率マップが一様である場合は、チェックポイント、正規化、またはカテゴリインデックスのエラーが考えられます。構造行列が非数値である場合は、確率の分母が無効であるか、座標スケーリングに問題があります。応答が拡散している場合や、色の影響が支配的な検索結果が得られる場合は、構造事前分布が弱い、融合に失敗している、あるいはチェックポイントの読み込みが正しくないことを示しています。トレーニングログで、グラフおよび融合層における勾配と、検証に基づいたチェックポイントの選択を確認する必要があります。視覚的なヒートレスポンスを単独で構造的な結論として使用してはいけません。保存された前景マスク、入力された隣接関係の変化、幾何学的関係行列、および融合後のコンポーネント差分グラフと照らし合わせて確認する必要があります。衣服の前景以外に残留活性が見られる場合は、検証された構造的な差異ではなく、応答の特異性が限定的であることを示しています。
外観主導の検索と比較して、本プロトコルでは距離学習の前にコンポーネントのトポロジーを導入しています。弱い構造的制約や固定トポロジーのグラフモデルと比較して、意味的な関係重みにより、現在の衣服に合わせてグラフ伝播を適応させることができます。完全なモデルでは、Table 3に報告されている通り、SCI 0.81、SDI 0.71、Recall@5 89.2%、mAP 86.4%、およびシルエット係数 0.74を達成しました。追加の構造モジュールにより、Table 4に報告されている通り、パラメータ数は25.6 millionから29.3 millionへ、推論時間は1枚あたり15ミリ秒から22ミリ秒へと増加しました。本プロトコルの技術的な貢献は、画像レベルの衣服コンポーネントグラフの構築、外観とコンポーネント関係の並列エンコーディング、構造ガイド付き特徴融合メカニズム、および構造的一貫性、関係性、識別性の目的関数にある点です。Figure 11に報告されている検証スイープは、固定の学習係数を決定するためだけに行われたものであり、ネットワークアーキテクチャや目的関数の設計への貢献として提示されるものではありません。
本プロトコルは、深刻な遮蔽、衣服の重なり、ソース画像の小ささ、ポーズの変動、複雑な背景、および可視化された構成が固定された7領域スキーマに準拠しない衣服に対して依然として敏感です。非対称なデザイン、取り外し可能なレイヤー、密なドレープ、多層のボトムス、および重なり合った装飾領域は、複数の意味的領域を統合させたり、現在のグラフ定義に存在しないコンポーネント関係を導入したりする可能性があります。遮蔽は、アクティブなコンポーネントを抑制し、その確率重心をシフトさせ、有効な共有境界関係を排除することがあります。図6は、大まかな上半身カテゴリーの回復は見られるものの、袖のトポロジーの一致が不完全であることを示しており、図7および10では、隣接する背景領域に応答が保持されています。これらの結果は、テンソルの次元とグラフの接続性が有効であっても、意味的に正しい構造的解釈が保証されるわけではないことを示しています。したがって、本研究は、デザインワークフローの効率化やパターンパラメータの直接的な推定ではなく、画像ベースの検索、クラスタリング、および差異の局在化を支持するものです。本研究におけるすべての定量的実験は、保持され構造的に再ラベル付けされたDeepFashion2コホートを用いて実施されています。現在の結果は、異なる衣服分類、アノテーション基準、文化的衣類カテゴリー、画像ソース、または取得環境を持つ独立したデータセット全体における堅牢性を立証するものではありません。別のデータセットへ移行する場合、7つのコンポーネントチャネルの再マッピングおよび型定義された関係スキーマの再構築が必要になる可能性があります。したがって、報告された結論は、評価されたデータ分布および画像レベルのコンポーネント定義に限定されます。
これらの制限範囲内において、本プロトコルは、セマンティックパース、幾何学的関係のモデリング、デュアルストリームエンコーディング、および構造ガイド付きフュージョンを通じて、衣服画像からコンポーネントを認識した表現を得るための再現可能なシーケンスを提供します。今後の検証では、異なるアノテーションシステム、衣服カテゴリー、ポーズ、および背景条件を持つ独立した衣服データセットを使用します。また、現在の7領域マッピングが、非対称、レイヤード、取り外し可能、または文化的に固有な衣服構造に対して拡張が必要かどうかも検討します。手書きのデザインスケッチ、生地をまたいだバリエーション、およびパラメータ化されたパターン調整は、タスク固有のデータと評価手順を必要とする個別の応用方向として残されています。専門的なユーザビリティおよびデザインレビューの効率については、定義された参加者、評価基準、および統計的手順を備え、別途文書化されたヒト被験者研究が必要です。
著者らに申告すべき利益相反はありません。
本研究は、第14次5ヵ年計画における省レベルの重点学部教育改革プロジェクト(第2次募集)の、「『三統合・三融合』共同構築モデルに基づく『衣服・アパレルデザイン』の教育改革と探究」(プロジェクト番号:JGZD2024096)というプロジェクトの支援を受けて実施されました。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| 中央処理装置 | Intel Corporation | Intel Core i9-13900K、24コア、32スレッド、最大5.80 GHz | |
| Conda | Anaconda, Inc., anaconda.com | Miniconda3 23.11.0 | |
| CUDA Toolkit | NVIDIA Corporation, developer.nvidia.com | CUDA 11.8 | |
| cuDNN | NVIDIA Corporation, developer.nvidia.com | cuDNN 8.9.7 | |
| DeepFashion2データセット | 香港中文大学、github.com/switchablenorms/DeepFashion2 | 公式DeepFashion2リリース、バージョン1.0 | |
| グラフィックス処理装置 | NVIDIA Corporation | NVIDIA GeForce RTX 4090, 24 GB GDDR6X | |
| HRNet-W48 セマンティックパース チェックポイント | HRNetプロジェクト、github.com/HRNet/HRNet-Semantic-Segmentation | hrnet_w48_garment_parser_7class.pth, プロジェクトチェックポイント バージョン1.0 | |
| ImageNetで事前学習済みのResNet-50重み | PyTorch Foundation, pytorch.org | ResNet50_Weights.IMAGENET1K_V2 | |
| Matplotlib | Matplotlib開発チーム、matplotlib.org | バージョン 3.8.2 | |
| NumPy | NumPy開発者、numpy.org | バージョン 1.26.4 | |
| NVIDIAグラフィックスドライバー | NVIDIA Corporation | バージョン 546.33 | |
| OpenCV-Python | OpenCVチーム、opencv.org | バージョン 4.8.1.78 | |
| オペレーティングシステム | Microsoft Corporation | Windows 11 Pro 23H2, 64ビット, OSビルド 22631.3155 | |
| Pandas | Pandas開発チーム、pandas.pydata.org | バージョン 2.1.4 | |
| Python | Python Software Foundation, python.org | バージョン 3.10.13 | |
| PyTorch | PyTorch Foundation, pytorch.org | CUDA 11.8対応 Version 2.1.2 | |
| PyYAML | PyYAMLプロジェクト、pyyaml.org | バージョン 6.0.1 | |
| scikit-learn | scikit-learn 開発者、scikit-learn.org | バージョン 1.3.2 | |
| SciPy | SciPy開発者、scipy.org | バージョン 1.11.4 | |
| ソースコードリポジトリ | 原稿とともに提出された補完ソースコードアーカイブ | 衣類トポロジープロトコル、バージョン1.0 | |
| 保存装置 | サムスン電子 | Samsung 990 PRO NVMe SSD, 2 TB | |
| システムメモリ | Kingston Technology | Kingston FURY Beast DDR5, 64 GB, 2 × 32 GB, 5600 MHz | |
| torchvision | PyTorch Foundation, pytorch.org | CUDA 11.8対応 バージョン 0.16.2 | |
| ワークステーション | カスタム構築のディープラーニング用ワークステーション | Intel Core i9-13900K、NVIDIA GeForce RTX 4090、64 GBメモリ、2 TB NVMe SSD |