本研究は、シフトウィンドウ階層型トランスフォーマーエンコーダで捕捉された階層的視覚特徴と、線分検出によって生成されるマンハッタン3Dバウンディングボックスの事前深度を密接に結合し、複雑な屋内シーンの高精度な意味再構築を実現するアルゴリズムを提案します。
本研究は、シフトウィンドウ階層型トランスフォーマーエンコーダで捕捉された階層的視覚特徴と、線分検出によって生成されるマンハッタン3Dバウンディングボックスの事前深度を密接に結合し、複雑な屋内シーンの高精度な意味再構築を実現するアルゴリズムを提案します。
複雑な屋内シーンにおける家具の遮蔽による意味的予測の不連続性や物理的境界歪みに対処するため、本論文は建物構造の事前分布を活用した意味解析手法を提案します。このスキームは、シフトウィンドウ階層型トランスフォーマーエンコーダを用いてマルチスケールの視覚特徴を抽出し、勾配方向整合線分検出アルゴリズムを組み合わせてマンハッタン3Dバウンディングボックスを構築します。このバウンディングボックスは符号付き距離場(SDF)に変換され、離散的な幾何学的輪郭を連続物理ポテンシャル場に符号化します。構造誘導型クロスアテンション機構により、視覚信号が実際の3D直交幾何学的境界に整列し、遮蔽された領域で特徴の連続性を回復します。スーパーピクセルノードから構成された空間隣接グラフはグラフ畳み込みネットワーク(GCN)を駆動し、特徴を集約し、物理的な荷重を支える平面内での巨視的な意味的整合性を確保します。ピクセルレベルのクロスエントロピー損失とカスタム設計の構造的一貫性損失の組み合わせにより制約が強化され、境界外の予測にペナルティが加わります。複数の独立した実験では、結合上の平均交差(mIoU)が標準偏差0.2%で68.7%に達し、構造境界F1スコアは標準偏差0.3%で76.4%に達し、提案モジュールの堅実な性能を裏付けています。単一の画像ノードサイズが256の場合、平均推論時間は61msのままでした。
屋内シーン画像意味解析は、三次元空間認知および知的空間推論課題において重要な位置を占めています。1,2。実際の物理的環境における視覚的特徴抽出は、複雑な空間レイアウトによって大きく妨げられることが多いです。3.大規模な家具の遮蔽による建物基礎構造の意味的不連続性と物理的境界歪みの解消は空間認知研究において重要です。雑多な物体からの干渉を正確に除去し、同じ壁と床の物理的な連続性を回復することは、三次元シーン再構築とグローバル空間論理解析の精度を直接決定します。大規模な家具閉塞による意味的不連続性と提案された建物事前指導の構造修復効果は図1に示されており、表1Aの遮蔽された赤緑青(RGB)入力、図1Bのベースラインマスク歪み、図1Cの構造事前修理結果が同じ屋内シーン条件下で比較されています。
空間論理推論の精度要件を満たすために、現在の主流のピクセル駆動型視覚ネットワークは複雑な屋内環境を扱う際に多くの障害に直面しています。屋内空間はしばしば密度の高い家具や散らかった家具で満たされており、画像における低レベルの視覚的境界信号の著しい喪失を引き起こしています。従来の特徴抽出メカニズムは局所的な二次元の色やテクスチャ応答に過度に依存しており、三次元人工構造の剛直交法則のマクロな理解が欠けています。局所受容野のこの制限により特徴伝播が容易に中断され、閉塞11を越えてグローバルトポロジーを拡張することが困難になります。現在、オクルージョンや干渉によって引き起こされる意味的予測の不連続性と物理的境界の深刻な歪みという根本的な問題を解決することが緊急に求められています。
閉塞や干渉による建物基礎の構造的欠陥に対処するため、学術コミュニティはさまざまな的を絞った介入措置を開発しました。クロスモーダル特徴集約ネットワークは、赤・緑・青(RGB)画像の解析を支援するために、空間知覚における単一の視覚モダリティの本質的な欠点を効果的に補うために、深度マップやテキストプリアーを導入します14,15。境界知覚と適応的コンテキスト選択フレームワークは、特徴デコード段階に物理的な輪郭強化戦略を注入し、複雑なシーンにおける予測結果のエッジフィットを大幅に向上させます。GCNと特徴相互作用メカニズムに基づく推論モデルは、ノードレベルの接続を構築することで、均質領域における特徴の滑らかさとマクロ意味論的一貫性を大幅に向上させます(18,19)。明示的なマンハッタン構造事前分布を視覚的特徴抽出パイプラインに統合することで、幾何学的一貫性境界が強制され、広範囲な前景オブジェクト遮蔽による特徴不連続性の課題に対処します。
建築インフラに伴う意味的予測の欠陥や物理的境界の深刻な歪みという根本的な課題に対処するため、アーキテクチャの事前処理を取り入れた閉ループ結合メカニズムに基づく意味解析フレームワークが提案されます。このフレームワークは、単純な工学的パイプラインを超え、連続した幾何学的ポテンシャル場と離散的な視覚的特徴多様体の間に双方向のマッピングアライメントを確立し、構造法則を通じて遮蔽誤差を修正する非自明な相乗効果を形成します。この方式は、マルチスケールの視覚バックボーンネットワークと消点推定に基づく線分検出アルゴリズムに依存し、マンハッタン3Dバウンディングボックスを並列で表現する局所的な外観特徴と直交辺の事前分布を取得し、それらをSDFに変換します。このアルゴリズムは構造誘導型クロスアテンション機構を採用しており、視覚的特徴をクエリベクトルとして用い、SDFの特徴をドット積計算のキーと値として扱うことで、視覚信号を特徴空間内の実際の3D幾何学的境界と一致させます。スーパーピクセルノードと空間共平面の辺特徴から構成された空間隣接グラフがGCNに入力され、ノード間の特徴集約とメッセージ伝達が行われます。エンドツーエンドのパラメータ最適化プロセスは、ピクセルレベルのクロスエントロピーとカスタム構造的整合性損失関数を共同で用いており、これは建築前境界を越える予測ピクセルを厳密に制約しペナルティします。完全なセマンティック解析パイプラインは 図2にまとめられており、RGB画像入力、幾何学的事前抽出、クロスアテンションアライメント、スーパーピクセルグラフ推論、セマンティックマスクデコードを統一アーキテクチャ内で結びつけています。
初期のシーン解析ネットワークは局所的な外観テクスチャを捉えるために畳み込み操作に依存していましたが、局所受容野の制限により、大規模ターゲット21,22の意味的整合性が不十分でした。これまでの研究では、ビジュアルトランスフォーマーアーキテクチャの自己注意モジュールを応用し、グローバルな文脈情報を抽出し、長距離ピクセル関連特徴を構築しています。クロスモーダルマルチビュー特徴集約戦略は、深さマップ点群とテキストコマンド入力を融合させてシーンの三次元幾何学的空間特徴を抽出します。特定のドメインを標的とした特徴融合のためのハイブリッド注意機構は徐々に成熟しています。特徴相互作用ブリッジを構築することで、多スケールの視覚信号伝送におけるエネルギー損失と特徴の疎度を大幅に低減し、複素構造解析の堅牢性を向上させました。最先端のエンコーダ設計は、グローバルおよび局所的特徴と共に高周波領域の空間詳細を統合・推論することで、高い類似度を持つ細かな意味カテゴリを識別するネットワークの能力を強化し、屋内解析の精度を向上させます(27,28)。セマンティックセグメンテーションアーキテクチャの最近の進展は、計算効率と空間知覚の最適化に貴重な参考資料を提供しています。高密度予測および多スケール文脈集約用に設計されたモデルは、複雑な背景から細かい幾何学的特徴を抽出します。特徴デカップリングおよび相乗融合戦略は、境界領域における意味的な曖昧さに対応します。軽量な注意メカニズムとゲート付き集約モジュールはパラメータ分布を最適化し、局所的な構造詳細を保持しつつ推論を加速させます。これらの効率的なアーキテクチャ設計の実装は、屋内シーン解析における非ユークリッド位相的推論演算の計算オーバーヘッドを削減するための理論的指針を提供します。
建物構造事先解析と3Dレイアウト推定を用いて局所的な視覚解析誤差を修正します。これまでの研究では、屋内建物の直交および平行幾何学的特徴を推論制約として抽出し、屋内背景の混雑によるネットワーク予測バイアスを低減させています(30,31)。既存の手法では、線分検出アルゴリズムや画像アブレーションポイント解析技術を用いてマンハッタン3Dバウンディングボックスを生成し、部屋の物理的境界をマッピングし、基礎となる視覚的特徴の局所化を支援しています。境界認識モジュールとマルチスケールコンテキストの共同アーキテクチャは、高次元特徴デコードプロセスに事前の構造情報を暗黙的に埋め込み、ネットワークは実際の物理的輪郭に密接に一致するセマンティックマスクを出力させ、物体エッジのギザギザやぼやけを効果的に改善します33.境界増強特性を持つ半教師ありまたは弱監督型損失関数設計は広く検討されています。空間的位相規則に違反する独立したピクセル分類挙動を罰するために厳密な数学的公式に依拠し、勾配最適化の源から最終的なセグメンテーション結果の幾何学的な滑らかさと構造的完全性が保証されます。
いくつかの研究では、グラフニューラルネットワークを用いて視覚的特徴のクロスドメイン集約や高次元空間35における位相的関係の推論を行っています。スーパーピクセルセグメンテーションアルゴリズムは、色応答やテクスチャの特徴が似ている隣接ピクセルブロックを独立接続ノードに事前集約します。スーパーピクセルセグメンテーションアルゴリズムは、画像レベルでグラフ構造の計算冗長性を圧縮し、画像36の基本的な幾何学的位相を保持します。GCNは高次元ノード特徴ベクトルと空間的近接を表す隣接行列を基盤とし、空間領域37,38における物理的連結グラフに沿った多スケール視覚情報の効率的な方向伝送とインタラクティブな融合を駆動します。時間情報強化モジュールとハイブリッド多スケールスキップ接続機構の適用により、多層ディープメッセージパッシング39の過程で生成されるノード特徴の過度な平滑化や均質化を抑制します。マルチスケールグラフウェーブレット変換技術と疑似ラベル要素学習最適化戦略は、ノード特徴更新式の背景ノイズ対策メカニズムを最適化し、同じ意味属性を持つ特徴が複雑ネットワークトポロジー40で協調応答モードを維持できるようにします。グラフベースの推論メカニズムは、正則ピクセルグリッドを非ユークリッド位相空間にマッピングし、不規則な建物構造や内部要素の特徴集約計算を行います。
ネットワークトレーニング前に、屋内RGBシーンデータセットとその意味論的注釈が作成されました。大規模な屋内3DデータセットおよびRGB-D屋内シーンデータセット(材料 表参照)は、それぞれの公式リポジトリから取得されました。家具の遮蔽、照明の変化、壁の境界の遮断、複雑な空間配置を含む屋内取得シーンは、ターゲット解析シナリオに合わせて保持されました。セマンティックラベルはインデックス付き単一チャネルPNG注釈マスクに変換され、すべてのRGB画像とセマンティックマスクは512ピクセル×512ピクセルにリサイズされました。トレーニング中にオンラインデータ増強が適用され、0.5の確率でランダムな水平反転、0.8から1.2のランダムな明るさのスケーリング、−10°から+10°のランダム回転で構造レイアウト分布を広げました。RGBチャンネルは平均値0.485、0.456、0.406、標準偏差0.229、0.224、0.225で正規化されました。大規模な屋内3Dベンチマークは、本研究で使用された公式リリース区分に従い、1201のトレーニングシーンと312の検証シーンをモデル開発および検証に含みました。RGB-Dの屋内シーンベンチマークは公式の評価プロトコルに従い、795枚のトレーニング画像と654枚のテスト画像を用いました。これら2つの公開ベンチマークに対しては、追加のパーセンテージに基づく分割は適用されませんでした。
シフトウィンドウ階層型トランスフォーマーの視覚バックボーンネットワーク(材料表参照)は、ムービングウィンドウトランスフォーマーエンコーダバックボーンとして初期化されました。パッチ埋め込みサイズは4×4ピクセルとして設定されました。4つの階層段の埋め込み寸法は128、256、512、1024に設定され、4段の変圧器ブロック数は2、2、18、2に設定されました。局所的な注意ウィンドウのサイズは7×7に設定され、注意の頭部数は4、8、16、32に設定されました。非線形連続活性化関数はすべての多層パーセプトロン層内で使用されました。空間的ダウンサンプリングは、各階層的ステージ後に2のストライドでパッチマージ処理によって実施されました。コアネットワークアーキテクチャと畳み込み推論モジュールのハイパーパラメータは表1にまとめられています。
その後、入力特徴マップに対してシフトウィンドウ自己注意特徴抽出が行われました。各特徴図は、空間寸法が7×7の重複しないローカルウィンドウに分割されていました。通常の窓の注意とシフトウィンドウの注意は、隣接するシフトウィンドウの変圧器ブロック間で交互に行われていました。サイクリックシフト距離は3ピクセルに設定され、各局所注意ウィンドウ内に相対位置バイアス符号化が適用されました。局所的な視覚的特徴は、マルチヘッドの自己注意によって集約され、階層的かつ多スケールの特徴表現が生成されました。
マンハッタン構造事前解析は屋内RGB画像から抽出されました。構造的なエッジセグメントは勾配方向整合性の線分検出アルゴリズムを用いて検出されました。支配的な構造方向は、消失点推定に基づくランダムサンプルコンセンサス(RANSAC)アルゴリズム(材料 表参照)によってクラスタリングされました。3つの互いに直交するマンハッタン方向を再構成し、マンハッタン3次元バウンディングボックス表現を生成しました。再構築された構造境界は、各ピクセルから最も近い境界線分までの最小ユークリッド距離を計算することでSDFマップに変換されました。
構造誘導型クロスアテンション特徴は、視覚的特徴とSDF事前指標が得られた後に生成されました。視覚的特徴多様体は、二重打点帽Rの線形変換行列Wの部分Q元を通じてクエリテンソルQに写し、二重打点帽Rの構成行列Wの部分Q元を形成行列
にマッピングしました。連続距離場の事前処理は、変換行列
を通じてキーテンソルKと値テンソルVにマッピングされ、モデル次元は512に設定されました。マルチヘッド変調は射影空間を8つの独立した部分空間に分割し、各ヘッドの次元は64でした。空間配置は、離散ピクセル座標を連続ポテンシャル場に投影し、ドット積類似度行列を変調するための明示的な加法的空間バイアスとして構造親和行列Sを生成しました。視覚的特徴テンソルがクエリソースとして用いられたのは、意味解析では各視覚位置が幾何学的事前空間から構造的に一貫した証拠を積極的に取得する必要があるからです。SDFの事前データは、マンハッタンのレイアウトから派生した連続した境界距離と内外構造手がかりを保存するため、鍵および価値のソースとして使用されました。ドット積項は意味的な外観と幾何学的事前分布との互換性を測定し、加法的構造項λSは同じ物理面上または建築的輪郭に近いピクセルに注意の重みを移しました。係数λは抽出された構造事前比への信頼度を表し、剛直交制約が注意分布にどの程度組み込まれているかを制御しました。この定式化は家具の閉塞による境界を越えた特徴拡散を減らし、マンハッタン以外のレイアウトでも適応的緩和を保持しました。構造誘導型注意分布は式1に従って計算されました。
式1: 
ここで、Aは構造誘導アシスタント集約行列、Qは視覚的特徴から生成されるクエリテンソル、KはSDF事前特徴から生成されるキーテンソル、Vは構造的事前表現から生成される値テンソル、dkはキーテンソルの特徴次元、λは局所領域の幾何学的信頼度を特定し、非マンハッタン空間における剛直交制約を緩和するために用いられる適応構造的重み付け係数を表します。レイアウト、SはSDF親和行列を示します。dkによる分割により注意ロギットのスケールが安定し、大きな特徴寸法が過剰に集中する注意重みを生み出すのを防ぎました。正規化指数関数(材料 表参照)は、変調された類似度スコアを正規化された空間分布に変換し、各ピクセルが意味的および幾何学的整合性に基づいて構造的な事前情報を集約できるようにしました。この設計は、視覚的外観と建築的境界の事前先が直接的な特徴の連結ではなく注意レベルで融合する理由を説明しています。
スーパーピクセルトポロジーグラフは、構造アライメントされた特徴マップから構築されました。特徴マップは空間領域生成アルゴリズムを用いてセグメント化されました。スーパーピクセル数は256、コンパクトネス係数は10、ガウス平滑係数は1.0、反復数は10に設定されました。クラスタリング時に距離指標の重みを特徴色空間距離に対して1.0の一定比率に設定することで空間的近接制約が適用され、密集したクラッター境界間で均一なノード生成を維持しました。均質な意味応答を持つピクセルはスーパーピクセルノードに集約されました。グラフの辺は空間隣接関係、SDF親和性強度、共平面幾何学的整合性制約に基づいて構築されました。構造親和行列と位相的結合性の構築過程は 図3に示されており、SDFガイダンスがどのようにグラフレベルの空間関係へと変換されたかを示しています。
このグラフの定式化は、密なピクセル単位の推論を均質な構造領域上のノードごとの空間的推論に変換するために導入されました。各スーパーピクセルノードは類似した意味応答と空間的連続性を持つ局所領域を表し、各辺は隣接性、距離-場親和性、共平面整合性制約に従う特徴伝送の信頼できる経路を表していました。この設計により、孤立したノイズの多いピクセルの影響を減らし、閉塞された壁、床、天井の領域が物理的に隣接するノードからのメッセージを受け取ることを可能にしました。したがって、エッジ構成は連続SDFガイダンスと離散非ユークリッドグラフ推論との間の数学的な架け橋として機能しました。
3層グラフ畳み込み推論ネットワークは、隠れた特徴寸法が512、256、128に設定されました。グラフ畳み込み層はノードの空間的関係に基づいてグラフ構造に特徴の平滑化を行いました。自己ループ隣接はメッセージパッシング時に各ノードの元の状態を保持し、小さな構造領域の特徴が周囲の大きな領域によって消去されるのを防ぎました。対称正規化により、隣接行列要素はノード次数の逆平方根の積でスケーリングされ、高次数ノードと低次数ノードが伝播中に比較可能な数値大きさで寄与するようにしました。フィードフォワード伝搬は局所的空間集約を行い、各ノード状態が隣接する共平面クラスタから高次元特徴を吸収し、その後要素ごとの非線形整形関数を適用しました。この定式化により、グラフ畳み込み層は、無関係なオブジェクトの境界を無制限に平滑化するのではなく、物理的に意味のある屋内平面に沿った意味拡散を近似することになりました。グラフノードの特徴は式2に従って評価されました。
式2: 
高密度ピクセル特徴からスーパーピクセルノードへの投影、グラフ畳み込みメッセージの通過、座標のバックプロジェクションは 図4に示されており、正則画像グリッドから非ユークリッドトポロジー、そして再び高密度セマンティック表現への特徴集約経路を明確にしています。 図4A の濃いピクセル特徴から 図4Bのスーパーピクセルノードへの投影、 図4Cのグラフ畳み込みメッセージの通過、 図4D の座標バックプロジェクションにより、通常の画像グリッドから非ユークリッド位相、そして再び濃密な意味的表現への特徴集約経路が明確になります。
ここで H(l) は l 番目のグラフ畳み込み層のノード特徴テンソル、Â は自己ループ接続を持つ隣接行列、D は隣接行列に対応する次数行列、W(l) は第lグラフ畳み込み層の学習可能な重み行列、σ は整正線形単位活性化関数を表します。ÂH(l)という用語は隣接するスーパーピクセルノードの特徴を集約し、D−1/2 およびD−1/2 は異なる接続密度を持つノードの寄与をバランスさせた。学習可能な行列W(l)は集約されたノードの特徴を新しい意味空間に投影し、グラフ層が構造的一貫性と通常の空間的近接性を区別できるようにしました。非線形活性化により、特徴集約後の同一面領域と非同一平面領域の応答差が保持されました。
意味分割の特徴はグラフ推論の後に解読されました。デコーダは3段階のバイリニア補間アップサンプリングとクロスレイヤースキップ接続融合操作を用いて構築されました。浅い空間エンコーダの特徴は、チャネルごとに融合することで高レベルの意味解碼機能と連結されました。特徴分解能は元の画像サイズに戻され、最終的な意味確率予測マップは1×1畳み込み層を通じて生成されました。
完全な意味解析ネットワークは、デカップリングされた重み減衰最適化器( Table of Materials参照)を用いて訓練されました。両方の公開ベンチマークで初期学習率は0.0001、重み減衰係数は0.01、バッチサイズは8に設定されました。第1モーメント減衰率は0.9、第2モーメント減衰率は0.999、数値安定性イプシロン係数は1×10⁻8に設定されました。検証損失は各エポックの終わりに監視され、検証セットのmIoUが増加した際にチェックポイントが保存されました。ネットワークは減衰検出力0.9の多項式学習率減衰戦略を用いて300エポックにわたり訓練されました。異なるランダムシード初期化を用いて5回の独立したトレーニングランを実施し、統計的に厳密な評価ベースラインを確立しました。ネットワークはピクセルレベルのクロスエントロピー損失と構造的整合性損失を用いて共同最適化されました。すべての実験は高容量並列計算ハードウェアを搭載したコンピューティングプラットフォーム上で行われ、詳細なハードウェア情報は 材料表に報告されました。
ジョイント最適化はクラス確率テンソルの空間的勾配の大きさを計算することで幾何学的境界整列を強制しました。構造的一貫性損失は正則化器として用いられ、空間予測勾配のノルムに連続SDF値を掛け合わせました。数学的な理論として、意味カテゴリの変更は実際の建築的輪郭付近に集中し、SDFがゼロに近づく一方で、平らな壁、床、天井の内部は滑らかな意味応答を維持するべきだというものでした。大きな予測勾配が構造境界から遠く離れた場合、距離場項はペナルティを増やし、均質な物理平面内での偽意味的遷移を抑制しました。予測勾配がゼロ距離等高線付近に現れた場合、ペナルティは限定的であり、建築的境界に沿った正当なクラス遷移を保持しました。意味遷移領域は、式3で示されるSDFの零距離輪郭に一致するように制約されていました。
式3: 
ここで、Ltotal は最終的な最適化目的関数、Lce はピクセルレベルの交差エントロピー損失、Lscl は構造的一貫性のペナルティ損失、αは構造的損失の重み付け係数を表します。クロスエントロピー項は注釈マスクを用いたピクセルレベルの意味的監督を提供し、構造的整合性項は建築的事前処理を用いた幾何学的正則化を課しました。重み付け係数はカテゴリ認識と境界整合のバランスα、局所ラベルの精度や剛性構造輪郭の過剰学習を防ぎます。この共同目標は、視覚的意味論、物理的境界の整合性、訓練可能なネットワークパラメータを統一された最適化ターゲットの中で結びつけました。
実験装置
本研究では、大規模な屋内3DデータセットとRGB-D屋内シーンデータセットという2つの標準的な屋内シーン解析データセットを用いて、性能評価とモデルのチューニングを行いました。大規模な屋内3Dデータセットは、リアルにスキャンされた複雑な物理空間シーンと高解像度RGBビューを含み、高精度でピクセル単位の3Dポイントクラウドセマンティックラベルや2D空間投影セグメンテーションマスクを提供します。その本質的に現実的な物理空間グリッド再構築データと直交平面特性は、抽出分岐におけるマンハッタン3Dバウンディングボックスを正確に構築するための幾何学的真理比較基準を確立しています。RGB-D屋内シーンデータセットは、家具や雑多なものに隠れた屋内奥行き画像を含み、ネットワークのグローバルな論理推論の正確さと遮蔽に対する堅牢性をテストするために使用されます。
このアルゴリズムはmIoUを用いて予測された意味分布と真の意味分布の空間的重なりを測定し、さらに構造的境界F1スコアを導入して、予測されたマスクとSDFで較正されたゼロ距離物理構造エッジとのフィット精度を厳密に評価します。計算時にユークリッド空間の固定ピクセル距離誤差閾値を設定し、ネットワークによって生成されるエッジピクセルが建物の実際の物理的境界線と交差しているかどうかを判定します。この二重評価システムは、大面積の意味ブロックにおける分類誤差を抑制しつつ、剛直線の位相的再構成効果のミクロ定量的評価を強化します。実験データ構成と最適化プロセスの整合性を維持するため、データセットのスケールとコアトレーニングハイパーパラメータは表2にまとめられています 。表2は 改訂原稿の権威ある実験構成の一つを報告しています。大規模な屋内3Dベンチマークは1201の訓練シーンと312の検証シーンを使用し、RGB-Dの屋内シーンベンチマークは795の訓練画像と654のテスト画像を使用し、両ベンチマークともバッチサイズ8、初期学習率0.0001、ウェイト減衰係数0.01、300訓練エポックで訓練されています。
最新手法との比較
屋内シーン解析アルゴリズムの定量的比較表を提示する前に、この節では多次元評価システムで使用されるテストベンチマークを厳密に定義します。モデルの異なる粒度での分類性能を反映するため、評価システムはテストシステムに加えて、グローバルピクセル精度(PixelAcc)と平均クラス精度(MeanAcc)という2つの追加指標を備えています。これらの指標は、詳細なアルゴリズム性能検証システムを構築し、その後の定量分析のための厳密な理論的参照を確立します。複雑な物理空間における提案アルゴリズムのセマンティック解析精度と閉塞の堅牢性を評価するため、RGB-D屋内シーン検証セット上で既存のアルゴリズムとの比較テストが実施されました。比較モデルライブラリは、基礎的なマスク-注意フレームワーク、階層的ビジョン変換器、現代の純粋畳み込みセグメンテーションパイプライン、統一された高密度予測アーキテクチャ、クロスチャネル注意ネットワークをカバーしています。ベンチマーク評価は、トランスフォーマーベースのセグメンテーションベースライン、統一高密度予測ベースライン、統一検出およびセグメンテーションベースライン、大規模視覚基盤ベースライン、純粋畳み込みベースライン、マスク注意ベースのセグメンテーションベースライン、クロスモーダル特徴集約ベースライン、および進行的特徴融合ベースライン( Table of Materials参照)を含むように拡張されました)は、同じRGB-Dの屋内シーン検証セット、入力解像度、トレーニングスケジュール、メトリックプロトコルを使用していました。提案されたアーキテクチャでは、構造誘導ネットワークがシフトウィンドウのマルチスケール視覚バックボーン、SDFを備えた構造誘導クロスアテンションモジュール、スーパーピクセルGCNを統合しています。拡張された比較では、トランスフォーマーベースの高密度予測、畳み込みベースの高密度予測、マスク注意解析、クロスモーダル特徴融合、プログレッシブ特徴融合パラダイムをカバーし、より広い室内シーン解析ベースラインに対する明示的3D幾何学的境界介入の貢献を評価することが可能になります。
表3は 、各ネットワークのコア定量指標における客観的な評価パフォーマンスを詳細に示し、5つの独立したランで平均値と対応する標準偏差を報告しています。拡張されたベースライン比較では、提案された構造指向推論メカニズムが、標準的な高密度予測バックボーン、マスクベースのセグメンテーションネットワーク、RGB-D特徴融合ネットワークを超えた精度向上に寄与するかどうかを評価します。実験データによると、提案されたアルゴリズムは4つの定量的指標すべてで安定した利益を達成しています。トランスフォーマーベースの高密度予測ネットワークやマスク注意ネットワークは強力なグローバルコンテキストモデリング能力を保持しましたが、予測マスクに明示的な物理的境界制約が欠けているため、前景の混雑が起きた場合に境界F1値は低く保たれました。クロスモーダルおよびプログレッシブ融合ネットワークは局所的な意味的連続性を改善しましたが、特徴融合は依然として符号付き距離構造事前論ではなく、外観や深さ応答に主に依存していました。提案された構造誘導ネットワークは、mIoU 0.687、標準偏差0.002、平均境界F1スコア0.764、標準偏差0.003を達成しました。拡張された比較により、性能向上は単に予測バックボーンの密度が大きいだけでなく、符号付き距離フィールドガイダンス、構造認識型クロスアテンション、グラフベースの位相推論の共同使用によるものであることが示されています。
閉塞下でのモデルのグローバル論理推論精度を解析するため、家具やその他の雑多なものによって大きく遮られている典型的なシナリオを検証セットから特定・抽出し、ピクセルレベルの予測マスクの可視化を作成しました。
その後、手法のワークフローとグラフ推論プロセスは 図1、 図2、 図3、 図4で定義されました。 図5 は、極端な閉塞条件下でのモデル間形態予測の違いを示しています。定性比較メッシュマップの赤い長方形は、角や荷重支え面が遮られている重要な紛争領域を示しています。マスク注意ベースの分割ベースラインからの出力マスクは、顕著なエッジ平滑化とクラス間粘着を示します。クロスモーダル特徴集約ベースラインおよびプログレッシブ特徴融合ベースラインはクロスモーダルデータを組み込んでいますが、それらの予測結果は依然として構造クラスの不連続性や物理的な境界歪みを示しています。この提案された手法で生成されるマスクは、グラウンドトゥルースラベルと高い空間的重複を示します。純粋にピクセル駆動の原理に制約されたベースラインモデルは、遮断されると局所的な受容野を失いやすいです。提案された手法は、超ピクセルGCNを用いて非ユークリッド空間でメッセージパッシングを行い、暗黙の幾何学的境界に導かれた基礎となるコーナーや線形空間骨格を再構築します。これにより、複雑な屋内レイアウトの解決における我々の提案した解決策の反干渉性能が視覚的形態学的観点から検証されます。
アブレーション実験
提案されたアーキテクチャにおける各独立コンポーネントの実際の貢献を分析するため、本研究ではRGB-D屋内シーン検証セットに対して拡張されたモジュール式アブレーションテストを構築しました。試験ベースラインは、基底シフトウィンドウトランスの視覚バックボーンのみを用いた従来の分類ネットワークに設定されました。定量的評価では、構造誘導クロスアテンション、符号付き距離フィールドバイアス、適応構造重み付け、スーパーピクセルグラフ推論、共平面エッジの構築、対称グラフ正規化、構造的一貫性損失の独立的な寄与が測定されました。この拡張されたアブレーション設計により、累積モジュールの利得と成分除去効果が分離され、各設計選択の寄与境界が明確になりました。
表4 と 図6 は、拡張累積および除去ベースのアブレーション設定下での精度の進化を示しています。基底シフトウィンドウトランスフォーマーネットワークは三次元の物理的境界制約を欠いているため、背景が混雑した中で特徴集約が限られています。構造誘導クロスアテンションを加えることでmIoUが0.615から0.648に、境界F1スコアが0.630から0.685に増加し、符号付き距離フィールドの事前評価が視覚的特徴と構造輪郭の整合を改善したことを示しました。スーパーピクセルグラフ推論を加えただけでmIoUは0.641に、境界F1スコアは0.676に増加し、ノードごとのトポロジー推論が均質な物理領域における意味的一貫性を向上させたことを示しました。構造的一貫性損失のみを加えるとmIoUは0.632、境界F1スコアは0.662となり、損失項は主に境界適合に影響し、広範な文脈集約にはあまり影響を与えなかったことが示されました。
クロスアテンションとグラフ推論を組み合わせることでmIoUは0.669、境界F1スコアは0.721に増加し、視覚的構造的整合性とグラフドメインメッセージの伝達が補完効果をもたらすことが示されました。クロスアテンションと構造的一貫性損失を組み合わせるとmIoUは0.660、境界F1スコアは0.713となり、グラフ推論と構造的整合性損失を組み合わせるとmIoUは0.653、境界F1スコアは0.704となりました。これらのペアワイズ結果は、クロスアテンションモジュールが主要な幾何学的アラインメント信号を提供し、グラフ推論モジュールがこの信号を同一平面領域に拡張し、構造的整合性の損失が最適化中に意味遷移境界を精緻化したことを示しています。
除去ベースのアブレーションは、内部設計の選択の貢献をさらに明確にしました。符号付き距離場加法バイアスを除去するとmIoUは0.656に、境界F1スコアは0.698に減少し、構造親和性行列が境界を越えた特徴拡散抑制の中心であることが確認されました。適応構造重み付け係数λを除去するとmIoUは0.671に、境界F1スコアは0.736に減少し、固定された構造的制約がマンハッタン以外の視覚的に劣化した地域ではモデル応答を弱めていることを示しました。共面辺制約を取り除くとmIoUは0.666に、境界F1スコアは0.728に減少し、局所隣接のみに基づくグラフの辺では物理面の整合性を保てないことが示されました。対称グラフ正規化を除去するとmIoUは0.673に、境界F1スコアは0.737に減少し、安定したノード集約には度数バランス伝播が必要であることを示しました。提案された完全な構造誘導ネットワークはmIoU 0.687、境界F1スコア0.764を達成し、最終的な利点は構造注意、グラフ推論、境界認識最適化の協調的な相互作用によるものであることを示しました。
計算複雑さ、訓練時間、推論効率の解析
SDF抽出、構造ガイド付きクロスアテンション、スーパーピクセルグラフ畳み込み推論の計算コストを評価するため、本研究ではパラメータスケール、浮動小数点演算、ピークメモリ使用量、訓練時間、単一フレーム推論遅延、フレームレート、mIoUを同一計算プラットフォーム上で評価しました。浮動小数点演算は512×512の入力解像度で計算されました。推論遅延はモデルウォームアップ後のバッチサイズ1で測定され、報告されたフレームレートは平均単一画像レイテンシから算出されました。訓練時間は同じ300エポックスケジュール、8のバッチサイズ、最適化設定、データ前処理パイプラインで測定されました。
表5は 、各ネットワークアーキテクチャにおけるモデルスケール、訓練コスト、推論効率、解析精度の関係を詳述しています。 表5 のmIoUおよび境界F1列は、対応する各モデルに対して表 3 と同じ全体的な検証セット値を使用しています。これら2つの精度列は表 5 で繰り返し、解析精度と計算コストを比較するためのみです。訓練可能なパラメータの増加は主に、構造指向クロスアテンションモジュール内のクエリ・キー・値射影層と3つのグラフ畳み込み層の重み行列によるものでした。非訓練可能なコストは主にSDF生成、スーパーピクセル分割、グラフ隣接構造によって発生しました。これらの非訓練可能な操作は入力画像ごとに1回だけ実行されるため、推論遅延は増加しましたが、訓練可能なパラメータの数を大幅に増やすことはありませんでした。この分離が、提案された手法でパラメータは中程度に増加した一方で、レイテンシはより顕著に増加した理由を説明しています。複雑度の結果は、マスク注意に基づくセグメンテーションベースラインがパラメータ数を小さく推論遅延を保持したものの、ネットワークに明示的な幾何学的境界ガイダンスがないため、深刻な閉塞下では境界F1スコアとmIoUが制限されていることが示されています。クロスモーダル特徴集約のベースラインは、より多くの浮動小数点演算とより長い訓練時間を必要としました。これは、クロスモーダル集約が追加の特徴整合オーバーヘッドをもたらすためです。進行的特徴融合のベースラインは計算コストは中程度を維持しましたが、境界歪み下での予測精度は提案された手法より低く残りました。提案された構造誘導ネットワークは、SDF構築、構造的クロスアテンション射影、スーパーピクセルグラフ構築、グラフ畳み込み伝播により追加の計算コストを伴います。フルモデルは6,680万パラメータ、1,214億回の浮動小数点演算、15.6時間の訓練時間、7.9GBのピークメモリ、61ミリ秒の単一フレーム推論時間、16.4フレーム毎秒を搭載していました。推論遅延は純粋なマスク注意ベースラインよりも高かったものの、モデルは0.687のmIoUと0.764の境界F1スコアを達成し、追加コストは主に構造的境界修復とトポロジー認識型意味的整合性を支えていることを示しました。
計算スケールとモデルの解析精度との2次元空間バランスを視覚的に表現するため、浮動小数点演算回数とアルゴリズムのmIoUを示すバブル分布図が作成されました。改訂された可視化では、図の注釈領域における訓練時間と推論遅延も報告され、訓練と展開の両観点から精度向上と計算コストの比較が可能となりました。水平軸は浮動小数点演算を保持し、縦軸はmIoUを保持し、気泡サイズは訓練可能なパラメータ量を表し、添付ラベルは各手法の推論時間を報告しました。
図7 は浮動小数点演算、パラメータスケール、推論遅延、解析精度の関係を示しています。提案された方法は比較ネットワークよりも高いmIoUを達成しつつ、FLOPやパラメータ数はクロスモーダルおよびプログレッシブ融合ベースラインに近いままです。61msという単一フレーム遅延は、SDFやグラフ推論のブランチが追加されたことで展開オーバーヘッドが発生しましたが、遅延は多くの屋内シーン解釈タスクに必要なリアルタイム範囲内に収まっています。各トレーニングエポックで構造的事前抽出、注意投影、グラフ推論が行われたため、トレーニング時間は15.6時間に増加しました。この結果は、提案された手法の計算コストが制御されていないパラメータ展開ではなく、境界認識構造的推論に主に集中していることを示しています。
構造的一貫性損失と空間的距離損失の特異的比較
境界空間変換距離の量子化における逆変換ネットワーク損失は、準同型変換パラメータを用いて境界オフセットを捉え、純粋な空間距離指標がピクセルラベル変化に基づく従来のクロスエントロピー損失を上回ることを示しています。この理論的コンセンサスを基に、境界制約スキームを用いて並行検証実験を行い、マンハッタンバウンディングボックスベースのカスタム構造一貫性損失(SCL)のシーン適応性に関する比較性能を評価します。実験は、マルチスケールの視覚バックボーンとグラフ推論ネットワークを融合させる解析アーキテクチャを維持しつつ、逆伝播時に境界損失項を単純に置き換えています。4つの並列検証ネットワークが構成されています。基本的な分類クロスエントロピー損失のみを用いたネットワークは高次元幾何学的制約を欠き、標準境界二値クロスエントロピー(BCE)損失を追加したネットワークは、従来のエッジ二値分類監督を行います。空間的境界距離損失を追加したネットワークは局所的な変形の捕捉に焦点を当てています。提案されたSCLを適用するネットワークは、SDFに基づく直交位相ペナルティを課します。RGB-Dの屋内シーン検証セットにおける量子化指標は、mIoUと構造境界F1スコアに限定されています。
表6は 、基礎となる空間論理認知に対する異なる逆伝播最適化戦略の介入度を詳述しています。 表6 のクロスエントロピーのみの項目は、ピクセルレベルのクロスエントロピー損失のみで訓練された我々の提案アーキテクチャを示し、視覚的バックボーン、符号付き距離フィールド分岐、構造誘導クロスアテンションモジュール、スーパーピクセルグラフ推論分岐は変更しないようにしています。このエントリはMask2Formalのベースラインではなく、同じモデルを使用しているため、 表3の全体のMask2Foren値と比較しないでください。基本的なクロスエントロピー損失のみに依存するネットワークは、最も低い境界適合スコアを達成します。追加の標準境界二項クロスエントロピー損失を持つネットワークはわずかな利得を得ますが、このメカニズムは大規模な閉塞下でもエッジのぼやけを引き起こします。空間境界距離の損失は空間変換知覚機構を通じてスコアを向上させ、歪んだエッジを効果的に修正します。本論文で提案された構造的一貫性の損失は、実際のSDFを直接活用し、物理的荷重を支える表面内の異常な意味変異に勾配ペナルティを課し、構造境界で最高のF1スコアを獲得します。
異なる損失関数構成がマスク予測精度や境界適合度に与える駆動効果を視覚的に比較するため、異なる最適化戦略にまたがるグループ化された棒グラフをプロットしました。
図8 は、損失関数の空間知覚次元をアップグレードしたことで得られる段階的な性能向上を示しています。構造境界のF1スコアを表す棒グラフは有意な上昇傾向を示しています。実験データによると、このカスタマイズされたペナルティメカニズムにより、予測されたカテゴリーの空間ジャンプ位置が直交する物理的輪郭と正確に一致することが示されています。屋内直交事前分布にカスタマイズされた距離場ペナルティ機構は、一般的な空間境界捕獲損失よりも高精度を達成し、複雑な建築障害に対処するための効果的な最適化経路を確立します。
極端な遮蔽分布、異常構造、厳しい照明条件の堅牢性試験
オブジェクト間の複雑な空間関係と相互遮蔽は、グローバルな3D空間認知に悪影響を及ぼします。共同予測アーキテクチャは、シーンレイアウト制約が基礎となるマスクの抽出に伴う役割を強調しています。広範囲の視覚信号損失や3D直交物理仮定に違反する異常な空間配置におけるアルゴリズムの干渉防止限界を検証することで、アルゴリズムの効果的な応用範囲が明確に定義され、核心的かつ実証可能な価値があります。グラウンドトゥルースラベルでマスクされた大型家具の割合に基づき、RGB-Dの屋内シーンテストセットは、軽度、中度、重度閉塞の3つの難易度が徐々に高まるサブセットに細分化されます。同時に、傾斜した天井や曲線した壁を持つマンハッタン典型ではないシーンは手動で抽出され、異常境界テストセットを構築し、極めて暗い環境、露出過多、広範囲の光沢や透明なガラス面を持つシーンは、難易度の高い照明やテクスチャのサブセットに分類されます。比較モデルライブラリにはマスク・注意ベースのセグメンテーションベースラインが含まれています。マスクアタッションに基づく一般的なセグメンテーションアーキテクチャでグローバルなコンテキストを捉え、包括的なクロスモーダル集約戦略を用いたクロスモーダル特徴集約ベースライン;そして、多段階の段階的プログレッシブ特徴抽出機構を統合したプログレッシブ特徴融合ベースラインです。本論文で構築された各比較ベースライン、融合視覚バックボーン、グラフ推論ネットワーク解析アーキテクチャは、上記の部分集合上で独立して評価され、各モデルの精度減衰勾配を統計的に解析します。
表7は 、軽度、中等度、重度の閉塞、困難な照明、テクスチャ干渉、非マンハッタン異常条件におけるサブセット特異の堅牢性指標を報告しています。 表7は 空間干渉下での異なるモデルのマスク予測精度の変化を詳述しています。 表7は 、空間干渉条件下で異なるモデルのサブセット固有のmIoU値を報告しており、対応する遮蔽、照明、テクスチャ、または非マンハッタンのサブセット内でのみ計算されており、全体の屋内RGB-Dシーン検証セット上では計算されません。軽度および中度閉塞のサブセットでは、すべてのモデルが基準的な精度を維持します。閉塞面積が増加するにつれて、ピクセル駆動規則に依存するベースラインモデルでは、重度に閉塞された部分集合で交差-和合比(IU)が減少します。マスク注意に基づくセグメンテーションベースラインおよびクロスモーダル特徴集約ベースラインは、このサブセットで著しい精度低下を受けます。プログレッシブ特徴融合ベースラインの多段階プログレッシブ特徴抽出アーキテクチャは、著しい性能低下を示しています。提案された解決策は、明示的な3Dスケルトン特徴に依存して損傷した視覚信号のアライメントを強制し、重度に遮蔽された部分集合上で安定したマスク出力形状を維持し、セマンティックマスク出力の位相的安定性を示すものです。難易度の高い照明およびテクスチャのサブセットでは、線分検出器が強い反射や透明なガラスの領域で構造的なエッジを見逃し、SDFに局所的な不連続性が生じます。誤った幾何座標は構造親和行列と構造的整合性の喪失を通過し、意味的特徴に異常な勾配ペナルティを適用し、境界予測にそれに対応する逸脱を引き起こします。GCNのグローバル空間コンテキスト推論メカニズムは、隣接する構造的親和性を持つ欠落した幾何学的事前分布を補完し、許容範囲内の解析精度を維持し、複雑な物理的干渉下でのアルゴリズムの視覚知覚能力の境界を明らかにします。非マンハッタン異常部分セットでは、このモデルの最下層にあるSDF事前処理がわずかなマッピングバイアスを導入し、進行的特徴融合ベースラインよりもやや低い性能を示します。クロスアテンションモジュールの適応構造重み係数は、基盤となる物理構造の勾配の一貫性を動的に評価します。湾曲した壁や傾斜した天井があるシーンでは、この係数が自動的にSDFの制約重みを減少させ、ネットワークがスーパーピクセルグラフネットワークの局所特徴ノード集約機構に依存して均質領域での意味的一貫性を保つことを促し、非マンハッタン空間配置に対して効果的な幾何学的補償メカニズムを確立します。
閉塞の重症度が解像度精度に与える悪影響を視覚的に示すため、異なるアルゴリズムモデル間で精度の低下を示す折れ線グラフをプロットしました。
図9 は、極端な物理環境下での異なる特徴抽出パラダイム間の堅牢性の違いを視覚的に明らかにしています。ベースラインモデルを表す3本の破線はすべて、重度に遮蔽されたノードで有意な減少傾向を示しており、大規模な信号損失下での特徴抽出における従来の受容野の限界を反映しています。提案された方法を表す実線は比較的緩やかな減衰軌道を維持します。実験データは、明示的な3Dアーキテクチャ事前解析とグラフベースの推論メカニズムの結合が、閉塞耐性シーン解析タスクの構造的サポートを提供し、複雑な環境下でのモデル一般化性能を向上させることを示しています。
トポロジーグラフノード分割の空間感受性解析
座標空間グラフ畳み込みモジュールの次元削減サンプリングレートパラメータは、受容野の品質とグラフネットワークの計算負荷を直接制御します。本論文の理論的枠組みに沿って、本研究は単純な線形反復クラスタリングによって生成される離散グラフノードの数が非ユークリッド位相推論の性能にどのように影響するかを調査し、ハイパーパラメータ選択の厳密なサポートを提供することを目指します。クラスタリングアルゴリズムの初期化制御パラメータを調整し、特徴空間の動的次元削減に強制的に介入し、スーパーピクセルグラフノードの分割数を64、128、256、512、1024に設定する実験が行われました。厳密に整合したテストベンチマークの下で、平均交差点と結合(IoU)比率、構造境界F1スコア、高解像度画像あたりの平均推論時間が異なるトポロジカルノードサイズで同時に記録されました。
表8は 特徴空間における動的次元削減の度合いと解析精度および計算コストとの関係を詳述しています。ノード数を少なく設定すると画像特徴の分割が不足し、小さな物体の意味的属性が大規模な壁の特徴と融合し、さまざまな精度指標が低下します。ノード分割スケールが大きくなるにつれて、モデルの局所空間的詳細に対する感度は大幅に向上します。ノード数を512および1024に増やすと、均質領域の断片化、グラフニューラルネットワークにおける巨視的特徴への平滑化効果の低下、ノード関係行列の次元増加、推論時間の増加をもたらします。ノード数が256の固定されたパラメータ構成は、交差-ユニオン比と境界スコアで最高値を得ます。
非ユークリッド位相推論における精度と計算能力のトレードオフを視覚的に表現するため、ノードサイズ感度を示す二軸統計グラフをプロットしました。
図10 は、離散グラフノードの数がネットワーク特徴の進化に影響を与える基盤となる論理を示しています。計算時間を表す背景バーは、ノード数が256の閾値を超えると急激に増加します。精度を表す二重線は水平軸上で256でピークを迎え、その後断片化の影響でかなり低下します。客観的な定量データと視覚的進化の傾向は非常に一貫しており、計算グラフのサイズを256ノードに維持することで、現在の固定パラメータ構成の下でハードウェア処理と論理的推論のバランスが取れていることを示しています。このノード数から逸脱することで生じる深刻な性能低下は、固定スーパーピクセルセグメンテーション戦略がハイパーパラメータチューニングに非常に敏感であることを示し、動的ノード選択機構の開発の必要性を強調しています。
データの利用可能性:
本研究で分析された生のベンチマークデータは、材料表に掲載された公式リポジトリから公開されています。大規模な屋内3Dベンチマークは、公式のScanNet v2リリースとしてアクセスされ、データセットのリリース識別子はScanNet v2でした。RGB-Dの屋内シーンベンチマークは、公式のNYU Depth Dataset V2リリース(リリース識別子はNYU Depth Dataset V2)を通じてアクセスされました。大規模屋内3Dベンチマークの記述的DOIは10.1109/CVPR.2017.261であり、RGB-D屋内シーンベンチマークの記述的DOIは10.1007/978-3-642-33715-4_54です。本研究では新たな生画像やRGB-Dデータセットは生成されませんでした。処理された分割ファイル、トレーニング設定ファイル、生の評価ログ、テーブル2、テーブル3、テーブル4、テーブル5、テーブル6、テーブル7、テーブル8、および図5、図6、図7、図8、図9、図10をサポートする数値ソースファイル、訓練済みのモデル重み、ソースコードはDOI: 10.6084/m9.figshare.32906765の名義でfigshareに保存されています。Figshareレコードは、この原稿で報告された定量的な表や図を再現するために必要な完全な生の結果データを提供します。リポジトリには、報告されたmIoU、境界F1、PixelAcc、平均計算、計算複雑性、ロバスト性、損失関数検証、ノード分割感度解析に使用される予測マスク、境界評価ファイル、メトリック計算スクリプト、モデルチェックポイント、テーブルソースファイルが含まれています。

図1:複雑な屋内閉塞シナリオにおける意味的不連続性と構造的事前修復効果の比較。 (A) 大規模な家具の遮蔽を伴うオリジナルRGB画像。(B) 物理的な境界歪みや意味的不連続性の欠陥を強調する従来のベースラインモデルの出力。(C) 提案された手法の出力には、3D建物骨格を明示的にマッピングし、基礎構造の損傷した特徴の位相修復のためにシアンの破線透視オーバーレイを用いること。この図の拡大版はこちらをクリックしてご覧ください。

図2:構造的事前解析を基に導く全体のセマンティック解析フレームワーク。 図は、RGB画像入力から始まり、シフトウィンドウの視覚的特徴抽出ブランチおよび構造事前抽出ブランチを経て、構造ガイド付きクロスアテンションモジュールへ、スーパーピクセルGCNによる位相推論、そして最後に濃密セマンティックマップへとデコードする完全なパイプラインを示しています。注意親和行列計算、グラフメッセージパッシング、および結合最適化損失関数の詳細なレイアウトは右側に示されています。 この図の拡大版はこちらをクリックしてご覧ください。

図3:親和行列と位相的連結性の構成のフローチャート。 このチャートは、入力距離フィールドマップと選択されたピクセルペアから、連続的な幾何学的ポテンシャル特徴抽出と勾配整合性評価を経て、クロスアテンション機構の明示的な空間バイアスとして用いられる正規化親和行列への変換を示す、段階的な数学的マッピングパイプラインの詳細を示しています。 この図の拡大版はこちらをクリックしてご覧ください。

図4:スーパーピクセルグラフ畳み込みノード投影および特徴集約の概略図。 パネルは非ユークリッド位相推論過程を詳述しています:(A) 元の局所特徴行列とスーパーピクセルクラスタリング境界を示す濃いピクセル特徴;(B) 正グリッドを離散ノードや物理的に接続された辺にマッピングするスーパーピクセルグラフトポロジー構成;(C) 局所特徴の方向性集約を行うグラフ畳み込みメッセージパッシング;(D) 重いグリッド上で復元された巨視的意味的整合性特徴を示す座標バックプロジェクション。 この図の拡大版はこちらをクリックしてご覧ください。

図5:定性的比較グリッド図。 このマトリックスは、異なる行ごとの屋内シーン間で視覚的な性能評価を提供し、元の屋内RGB入力とグラウンドトゥルースレイアウトを、マスク注意ベースのセグメンテーションベースライン、クロスモーダル特徴集約ベースライン、プログレッシブフィーチャーフュージョンベースライン、そして閉塞された角を復元し荷重を支える面を整列する提案手法の出力と比較します。 この図の拡大版はこちらをクリックしてご覧ください。

図6:累積モジュール積分のアブレーション結果。 二軸チャートは、異なるモジュラーアブレーション設定間での性能の段階的な進化を示しており、平均交差(mIoU)の上向き軌道をバーとして、構造境界F1スコアをベースラインのバックボーンから全体のフレームワークまでの折れ線グラフとしてプロットしています。 この図の拡大版はこちらをクリックしてご覧ください。

図7:計算複雑度、訓練時間、推論効率分布。 多次元バブルチャートは、計算オーバーヘッドと解析精度のトレードオフを明らかにします。横軸は浮動小数点演算(FLOP)を測定し、縦軸はmIoU、バブルサイズは訓練可能なパラメータのスケール、隣接するテキストラベルは各ネットワークアーキテクチャの単一フレーム推論遅延を示します。 この図の拡大版はこちらをクリックしてご覧ください。

図8:異なる損失関数構成における境界精度と計量スコアのヒストグラム。 グループ化された棒グラフは、さまざまな最適化戦略が基盤となる空間論理に与える駆動効果を比較し、標準的なクロスエントロピー定式化から提案された構造的一貫性損失へのアップグレードによってmIoUおよび構造境界F1スコアの大幅な向上を示しています。 この図の拡大版はこちらをクリックしてご覧ください。

図9:閉塞の重症度とパフォーマンス低下の関係を示す折れ線グラフ。 この曲線は、軽度、中程度、重度の閉塞レベル下での異なる特徴抽出パラダイムにおける精度の低下を追跡し、提案された構造誘導フレームワークの堅牢なトポロジー安定性と干渉防止能力を純粋なピクセル駆動ベースラインと比較して強調しています。 この図の拡大版はこちらをクリックしてご覧ください。

図10:スーパーピクセルノードスケールの感度解析。 二軸統計グラフは、異なるグラフ分割サイズにおけるハードウェア処理速度と論理推論精度のトレードオフを示し、スーパーピクセルノードの数が精度指標に影響し、平均推論時間の急激な増加につながることを示しています。 この図の拡大版はこちらをクリックしてご覧ください。
| ネットワーク層番号付け | 入力ノード特徴寸法 | 出力ノード特徴寸法 | ランダム不活性化確率設定 |
| 1 | 512 | 256 | 0.15 |
| 2 | 256 | 256 | 0.15 |
| 3 | 256 | 128 | 0.1 |
| 4 | 128 | 64 | 0.05 |
表1:畳み込み推論モジュールのネットワークアーキテクチャのハイパーパラメータ構成表。 この表は、グラフ推論ネットワークで使用されるネットワーク層の番号付け、入力ノードの特徴次元、出力ノードの特徴次元、ランダム非活性化確率設定を報告しています。
| 構成項目 | 大規模屋内3Dベンチマーク | RGB-D屋内シーンベンチマーク |
| 公式リリース識別子 | スキャンネット v2 | NYU深度データセットV2 |
| 本研究で使用された訓練サンプル | 1201のシーン | 795枚の画像 |
| 評価に用いられる検証またはテストサンプル | 312の検証シーン | 654枚のテスト画像 |
| 全意味圏 | 20 | 40 |
| 入力画像解像度 | 512×512 | 512×512 |
| 初期学習率 | 0.0001 | 0.0001 |
| バッチ入力サンプルカウント | 8 | 8 |
| 重量減衰係数 | 0.01 | 0.01 |
| 総訓練時代 | 300 | 300 |
| 独立ランの回数 | 5 | 5 |
表2:実験データセットの分割と統一訓練ハイパーパラメータ構成。 この表は、大規模な屋内3DデータセットおよびRGB-D屋内シーンデータセットのサンプル分割設定、意味カテゴリ数、学習率設定、バッチ入力サンプル数、重み減衰率、総トレーニング反復数を報告します。
| ネットワークモデルアーキテクチャ | mIoU | 境界F1 | ピクセルアック | ミーンアック |
| セグフォーマー | 0.596 ± 0.003 | 0.635 ± 0.004 | 0.838 ± 0.003 | 0.704 ± 0.004 |
| ConvNeXt UperNet | 0.604 ± 0.003 | 0.642 ± 0.004 | 0.846 ± 0.003 | 0.713 ± 0.004 |
| マスク2フォーマー | 0.612 ± 0.003 | 0.654 ± 0.004 | 0.853 ± 0.003 | 0.721 ± 0.004 |
| ワン・フォーマー | 0.621 ± 0.002 | 0.663 ± 0.003 | 0.861 ± 0.003 | 0.733 ± 0.003 |
| マスクディーノ | 0.628 ± 0.002 | 0.667 ± 0.003 | 0.869 ± 0.003 | 0.741 ± 0.003 |
| CCANet(キャネット) | 0.635 ± 0.003 | 0.671 ± 0.004 | 0.876 ± 0.003 | 0.745 ± 0.004 |
| インターナイメージ UperNet | 0.641 ± 0.002 | 0.692 ± 0.003 | 0.884 ± 0.002 | 0.756 ± 0.003 |
| CMPFFNet | 0.658 ± 0.002 | 0.712 ± 0.003 | 0.891 ± 0.002 | 0.773 ± 0.003 |
| SGCA_GCN | 0.687 ± 0.002 | 0.764 ± 0.003 | 0.924 ± 0.002 | 0.816 ± 0.003 |
表3:RGB-D屋内シーン検証セットにおける屋内シーン解析ベースラインの全体的な定量比較。 この表は、マスク注意ベースのセグメンテーションベースライン、クロスモーダル特徴集約ベースライン、プログレッシブ特徴融合ベースライン、そして提案された構造指向ネットワークアーキテクチャのmIoU、境界F1スコア、グローバルピクセル精度、平均クラス精度を報告しています。
| ネットワークアーキテクチャ構成 | mIoU | 境界F1 | ピクセルアック | ミーンアック |
| ベースシフトウィンドウバックボーン | 0.615 ± 0.003 | 0.630 ± 0.004 | 0.842±0.003 | 0.706 ± 0.004 |
| バックボーンと構造指向のクロスアテンション | 0.648 ± 0.003 | 0.685 ± 0.004 | 0.874 ± 0.003 | 0.748 ± 0.004 |
| バックボーンとスーパーピクセルグラフの推論 | 0.641 ± 0.003 | 0.676 ± 0.004 | 0.868 ± 0.003 | 0.741 ± 0.004 |
| 骨格と構造の整合性の喪失 | 0.632 ± 0.003 | 0.662 ± 0.004 | 0.859 ± 0.003 | 0.732 ± 0.004 |
| バックボーンとクロスアテントおよびグラフ推論 | 0.669 ± 0.002 | 0.721 ± 0.003 | 0.897 ± 0.002 | 0.782 ± 0.003 |
| 背骨とクロスアティスティアと構造の一貫性の喪失 | 0.660 ± 0.002 | 0.713 ± 0.003 | 0.889 ± 0.002 | 0.773 ± 0.003 |
| バックボーンプラスグラフ推論と構造的一貫性の損失 | 0.653 ± 0.003 | 0.704 ± 0.003 | 0.881 ± 0.003 | 0.765 ± 0.003 |
| 符号付き距離場加法バイアスなしの全モデル | 0.656 ± 0.003 | 0.698 ± 0.004 | 0.884 ± 0.003 | 0.761 ± 0.004 |
| 適応構造的重み付けλを伴わない完全なモデル | 0.671 ± 0.002 | 0.736 ± 0.003 | 0.904 ± 0.002 | 0.792 ± 0.003 |
| 共面辺制約なしの完全なモデル | 0.666 ± 0.002 | 0.728 ± 0.003 | 0.899 ± 0.002 | 0.786 ± 0.003 |
| 対称グラフ正規化なしの全モデル | 0.673 ± 0.002 | 0.737 ± 0.003 | 0.906 ± 0.002 | 0.795 ± 0.003 |
| フルSGCA_GCN | 0.687 ± 0.002 | 0.764 ± 0.003 | 0.924 ± 0.002 | 0.816 ± 0.003 |
表4:コア成分の拡張定量的アブレーション解析。 この表は、構造ガイド付きクロスアテンション、符号付き距離場バイアス、適応構造重み付け、スーパーピクセルグラフ推論、共面辺の構築、対称グラフ正規化、構造一貫性損失の独立かつ協力的な寄与を定量化するための累積モジュール積分、ペアワイズモジュールの組み合わせ、コンポーネント除去設定を報告しています。
| ネットワークモデルアーキテクチャ | パラメータ | フロップ | ピークメモリ | トレーニング時間 | 推論時間 | FPS | mIoU | 境界F1 |
| セグフォーマー | 83.7 M | 80.1 G | 6.1 GB | 10.6時間 | 44ミリ秒 | 22.7 | 0.596 | 0.635 |
| ConvNeXt UperNet | 60.2 M | 91.5 G | 6.4 GB | 11.2 時間 | 47ミリ秒 | 21.3 | 0.604 | 0.642 |
| マスク2フォーマー | 44.0 M | 74.6 G | 5.8GB | 9.4時間 | 41ミリ秒 | 24.4 | 0.612 | 0.654 |
| ワン・フォーマー | 64.1 M | 103.2 G | 7.0 GB | 12.9時間 | 55 ms | 18.2 | 0.621 | 0.663 |
| マスクディーノ | 52.8 M | 96.8 G | 6.8GB | 12.1 時間 | 52ミリ秒 | 19.2 | 0.628 | 0.667 |
| CCANet(キャネット) | 63.5 M | 118.7 G | 7.6 GB | 14.8時間 | 67ミリ秒 | 14.9 | 0.635 | 0.671 |
| インターナイメージ UperNet | 70.4 M | 112.3 G | 7.4GB | 14.2時間 | 64 ms | 15.6 | 0.641 | 0.692 |
| CMPFFNet | 58.9 M | 104.6 G | 7.1GB | 13.1 時間 | 59ミリ秒 | 16.9 | 0.658 | 0.712 |
| SGCA_GCN | 66.8 M | 121.4 G | 7.9GB | 15.6時間 | 61ミリ秒 | 16.4 | 0.687 | 0.764 |
表5:計算複雑度、訓練時間、推論効率と全体的な検証セットの精度との比較。 この表は、訓練可能なパラメータ、浮動小数点演算、ピークメモリ使用量、300エポックの訓練時間、単一フレーム推論遅延、フレーム毎秒、mIoU、および提案された手法および比較ネットワークの境界F1スコアを報告しています。
| 損失関数構成 | mIoU | 境界F1 |
| クロスエントロピー(CE)のみ | 0.669 | 0.721 |
| 紀元前 + 境界 | 0.674 | 0.738 |
| CE + 逆形式損失 | 0.681 | 0.752 |
| CE + Ours SCL | 0.687 | 0.764 |
表6:損失関数検証の定量比較。 表は、交差エントロピー損失、境界二項交差エントロピー損失、逆変換損失、および提案された構造一貫性損失におけるmIoUおよび境界F1スコアを報告しています。
| アルゴリズムモデルアーキテクチャ | 軽度閉塞 | 中等度の閉塞 | 重度の閉塞 | ノンマンハッタン異常集合 | テクスチャ干渉部分集合 |
| (借り金) | (借り金) | (借り金) | (借り金) | (借り金) | |
| マスク2フォーマー | 0.685 | 0.612 | 0.421 | 0.584 | 0.553 |
| CCANet(キャネット) | 0.698 | 0.635 | 0.463 | 0.612 | 0.566 |
| CMPFFNet | 0.715 | 0.658 | 0.512 | 0.635 | 0.602 |
| SGCA_GCN | 0.732 | 0.687 | 0.645 | 0.628 | 0.649 |
表7:極端な閉塞分布および非マンハッタン構造のサブセット特異的ロバスト性解析。 表は、軽度遮蔽、中程度閉鎖、重度閉塞、挑戦照明、テクスチャ干渉、非マンハッタン異常のサブセットにおける解析精度の変化を報告しています。
| スーパースケールノードの数 | mIoU | バウンダリーF1 | 平均推論時間(ms) |
| 64 | 0.641 | 0.695 | 45 |
| 128 | 0.665 | 0.732 | 52 |
| 256 | 0.687 | 0.764 | 61 |
| 512 | 0.678 | 0.751 | 95 |
| 1024 | 0.662 | 0.735 | 185 |
表8:トポロジーグラフにおけるノード分割スケールの空間感受性解析。 この表はmIoU、構造境界F1スコア、および異なるスーパーピクセルノード分割設定における平均推論時間を報告しています。
本論文のアルゴリズムは、シフトウィンドウ階層型トランスフォーマーエンコーダで捕捉される階層的視覚特徴と、線分検出によって生成されるマンハッタン3Dバウンディングボックスの事前深度を密接に結合し、複雑な屋内シーンの高精度な意味再構成を実現しています。構造誘導型クロスアテンション機構により、視覚信号がSDFによってキャリブレーションされた真の幾何学的境界に一致し、局所的に遮蔽された領域42の低層構造の連続性を回復します。トポロジーグラフは、反復的な局所クラスタリングアルゴリズムによって生成されたスーパーピクセルノードを用いて構築され、GCNが物理的な共平面制約の下で特徴集約を行うように駆動し、巨視的意味分布43の整合性を確保します。実験結果は、この手法がユニオン比の平均交差を68.7%、標準偏差0.2%、実用的な工学的価値、構造境界F1スコア76.4%、標準偏差0.3%、平均推論時間61msを達成していることを示しており、境界再構築の精度を最終的な推論効率よりも優先する意図的なトレードオフを示しています.堅牢性テストはさらに、モデルが大規模な視覚信号損失の極端条件下で強力なトポロジー修復能力を示すことを示しています。構造的一貫性損失を導入することで、SDFで較正されたゼロ距離物理境界との予測マスクの整合性の精度が向上し、計算複雑さと解析品質45の相乗最適化が達成されます。このスキームは三次元空間の法則に基づく特徴融合アプローチを提供し、大規模な家具閉塞や物理的境界歪みを扱う際の位相修復における論理的一貫性を示します。研究成果は、知的空間推論と高精度3D再構築のための堅牢な物理幾何学的制約フレームワークを提供し、実際の物理環境におけるロボットの視覚ナビゲーションおよびシーン認識タスクにおいて実用的な工学的価値を持っています。
マンハッタン世界仮説に大きく依存する幾何学的位相幾何学的導出メカニズムは、曲線壁や非直交境界を持つ不規則な建築空間を扱う際にフィッティングバイアスに悩まされます(47)。この幾何学的モデリングのボトルネックを克服するため、その後のネットワーク反復では、多次数多項式曲面フィッティングアルゴリズムと非一様な有理Bスプライン曲線抽出モジュールを物理事前分岐に統合します。この普遍的な空間モデリング戦略は、剛直交線を動的に変形可能な位相的境界に変換し、異常な屋内空間レイアウトにおいてアルゴリズムの解析精度を継続的に向上させます。
幾何学的事前抽出は基本的な線分検出器に依存しているため、反射性または透明材料が支配的な室内シーンを処理する際に構造マスク歪みに脆弱になります。構造的一貫性の損失は、この検出器によって生成されるSDFを直接呼び起こし、事前抽出と勾配最適化の間に閉じた依存ループを確立します。視覚的干渉が異常な線分検出を引き起こすと、欠陥のある幾何座標がSDFにマッピングされ、逆伝播時の構造的整合性の損失によって直接増幅され、ネットワークパラメータが誤った物理的境界に適合せざるを得なくなります。その後のアルゴリズムの反復では、深層深度マップや赤外線放射測定データを取り込むマルチモーダル適応融合分岐が導入され、幾何学的構造知覚を可視光照明制約から切り離し、極端な光学環境における空間的推論の境界を拡大します。
固定されたスーパーピクセルノードスケールによる性能感度のボトルネックを解決するため、今後の研究では、画像の複雑さに基づいてノード分割スキームを動的に決定する学習可能な適応型グラフプーリングモジュールを設計し、ネットワークの手動ハイパーパラメータチューニングへの依存を排除します。スーパーピクセルグラフネットワークの計算オーバーヘッドによるハードウェア展開の制約に対処するため、今後の最適化計画では軽量な特徴デカップリング機構やゲート付き集約モジュールを導入し、パラメータスケールを圧縮し、幾何学的前分岐50の行列操作を加速させる予定です。
著者たちは、財政的な利益相反は一切ないと宣言しています。
資金提供:陝西省重点研究開発プログラム(プログラム番号2024CY2-GJHX-76)。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| AdamW optimizer | PyTorch Contributors | https://pytorch.org/ | |
| CCANet | Zihao Z. et al. | https://doi.org/10.1109/TCDS.2024.3455356 | |
| CMPFFNet | Zhou W. et al. | https://doi.org/10.1109/TASE.2023.3332021 | |
| ConvNeXt | Meta AI Research | https://github.com/facebookresearch/ConvNeXt | |
| InternImage | OpenGVLab | https://github.com/OpenGVLab/InternImage | |
| Mask2Former | Meta AI Research | https://github.com/facebookresearch/Mask2Former | |
| MaskDINO | IDEA-Research | https://github.com/IDEA-Research/MaskDINO | |
| NYUv2 | http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html | ||
| OneFormer | SHI Labs | https://github.com/SHI-Labs/OneFormer | |
| RANSAC algorithm | scikit-learn developers | https://scikit-learn.org/ | |
| ScanNet V2 | http://www.scan-net.org/ | ||
| SegFormer | NVIDIA | https://github.com/NVlabs/SegFormer | |
| SGCA_GCN | Authors of this study | Proposed method (N/A) | |
| Softmax function | PyTorch Contributors | https://pytorch.org/ | |
| Swin Transformer | Microsoft Research | https://github.com/microsoft/Swin-Transformer |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト