Article de recherche

Une méthode d’analyse sémantique pour les images de scènes intérieures basée sur des connaissances préalables sur la structure du bâtiment

30 vues

DOI :

10.3791/72054

11 août 2026

Dans cet article

Résumé

Cette étude propose un algorithme qui couple étroitement les caractéristiques visuelles hiérarchiques capturées par un encodeur hiérarchique à fenêtre décalée avec la profondeur préalable de la boîte englobante 3D Manhattan générée par la détection de segments de ligne, permettant ainsi une reconstruction sémantique à haute précision de scènes intérieures complexes.

Résumé

Pour traiter les discontinuités de prédiction sémantiques et les distorsions physiques des frontières causées par l’occlusion du mobilier dans des scènes intérieures complexes, cet article propose une méthode d’analyse sémantique qui exploite les priors de structure de bâtiment. Le schéma utilise un encodeur transformateur hiérarchique à fenêtre décalée pour extraire des caractéristiques visuelles multi-échelles et combine un algorithme de détection de segments de ligne à consistance gradient-direction pour construire une boîte englobante 3D Manhattan. Cette boîte englobante est transformée en un champ de distance signé (SDF) avant d’encoder des contours géométriques discrets en un champ potentiel physique continu. Un mécanisme d’attention croisée guidé par la structure force les signaux visuels à s’aligner avec les frontières géométriques orthogonales 3D réelles, restaurant la continuité des caractéristiques dans les zones occultées. Un graphe d’adjacence spatiale construit à partir de nœuds superpixels pilote un Réseau Convolutionnel de Graphes (GCN) pour agréger des caractéristiques, assurant une cohérence sémantique macroscopique dans le plan porteur physique de charge. Une combinaison de perte d’entropie croisée au niveau des pixels et d’une perte de cohérence structurelle conçue sur mesure renforce les contraintes, pénalisant les prédictions hors limites. Des expériences réalisées sur plusieurs exécutions indépendantes montrent que la moyenne de l’intersection sur l’union (mIoU) atteint 68,7 % avec un écart-type de 0,2 %, et que le score F1 de la limite structurelle atteint 76,4 % avec un écart-type de 0,3 %, confirmant la robustesse des modules proposés. Avec une taille de nœud d’image unique de 256, le temps moyen d’inférence est resté à 61 ms.

Introduction

L’analyse sémantique des images de scènes intérieures occupe une place centrale dans la cognition spatiale tridimensionnelle et les tâches de raisonnement spatialintelligent 1,2. L’extraction de caractéristiques visuelles dans des environnements physiques réels est souvent gravement entravée par des configurations spatialescomplexes 3. Résoudre la discontinuité sémantique et la distorsion physique des limites de la structure de fondation du bâtiment causée par l’occlusion de mobilier à grande échelle est important pour la recherche en cognitionspatiale 4,5. Éliminer avec précision les interférences des objets encombrés et restaurer la continuité physique du même mur et sol déterminera directement la précision de la reconstitution tridimensionnelle de la scène et de l’analyse logique spatialeglobale 6. La discontinuité sémantique causée par l’occlusion du mobilier à grande échelle et l’effet de réparation structurelle des recommandations proposées à priori du bâtiment sont illustrées dans la Figure 1, où l’entrée occultée rouge-vert bleu (RGB) dans le Tableau 1A, la distorsion du masque de base dans la Figure 1B, et le résultat de réparation préalable de la structure dans la Figure 1C sont comparés sous la même condition de scène intérieure.

Pour répondre aux exigences de précision du raisonnement logique spatial, les réseaux visuels actuels pilotés par des pixels grand public rencontrent de multiples obstacles lorsqu’ils traitent des environnements intérieurscomplexes 7,8. Les espaces intérieurs sont souvent remplis de meubles denses et de mobilier encombré, ce qui entraîne une perte significative des signaux de frontière visuelle bas niveau sur les images9. Les mécanismes conventionnels d’extraction des caractéristiques reposent excessivement sur des réponses locales bidimensionnelles des couleurs et textures, manquant d’une compréhension macroscopique des lois orthogonales rigides des structures artificiellestridimensionnelles 10. Cette limitation du champ réceptif local rend la propagation des caractéristiques facilement interrompue, rendant difficile l’extension de la topologie globale à travers lesocclusions 11. Actuellement, il est urgent de résoudre le problème fondamental des discontinuités de prédiction sémantiques et des distorsions sévères des frontières physiques causées par l’occlusion et l’interférence12.

Pour traiter les défauts structurels des fondations des bâtiments causés par l’obstruction et les interférences, la communauté académique a développé une variété de mesures d’interventionciblées 13. Les réseaux d’agrégation de caractéristiques intermodals compensent efficacement les lacunes inhérentes d’une seule modalité visuelle en perception spatiale en introduisant des cartes de profondeur ou des priors textuels pour aider avec les images rouge-vert-bleu(RGB) 14,15. Les cadres de perception des limites et de sélection adaptative de contexte injectent des stratégies d’amélioration physique des contours dans l’étape de décodage des caractéristiques, ce qui améliore considérablement l’ajustement des contours des résultats de prédiction dans les scènescomplexes 16,17. Les modèles d’inférence basés sur les GCN et les mécanismes d’interaction des caractéristiques améliorent significativement la fluidité des caractéristiques et la cohérence macro-sémantique dans des régions homogènes en construisant des connexions au niveau desnœuds 18,19. Intégrer des priors structurels explicites de Manhattan dans la pipeline d’extraction des caractéristiques visuelles impose des limites de cohérence géométrique, ce qui répond aux défis de discontinuité des caractéristiques causés par une occlusion étendue d’objets aupremier plan 20.

Pour relever le défi central des défauts de prédiction sémantiques et des distorsions sévères des frontières physiques associées à l’infrastructure de construction, un cadre d’analyse sémantique est proposé basé sur un mécanisme de couplage en boucle fermée incorporant des priors architecturaux. Ce cadre transcende les pipelines d’ingénierie naïfs en établissant un alignement bidirectionnel entre des champs potentiels géométriques continus et des variétés de caractéristiques visuelles discrètes, formant une synergie non triviale qui corrige les erreurs d’occlusion par des lois structurales. Ce schéma repose sur un réseau de colonne vertébrale visuelle multi-échelles et un algorithme de détection de segments de ligne basé sur l’estimation du point d’arrivée pour acquérir des caractéristiques d’apparence locale et des priors d’arêtes orthogonales représentant en parallèle la boîte délimitante 3D de Manhattan, puis les transformer en SDF. L’algorithme utilise un mécanisme d’attention croisée guidé par la structure, utilisant des caractéristiques visuelles comme vecteurs de requête et traitant les caractéristiques SDF comme des clés et des valeurs pour les calculs du produit scalaire, forçant ainsi le signal visuel à s’aligner avec la frontière géométrique 3D réelle dans l’espace des caractéristiques. Un graphe d’adjacence spatiale construit à partir de nœuds superpixels et de traits de coplanarité spatiale est alimenté dans un GCN pour effectuer l’agrégation de caractéristiques inter-nœuds et le passage de messages. Le processus d’optimisation des paramètres de bout en bout utilise conjointement l’entropie croisée au niveau des pixels et une fonction de perte de cohérence structurelle personnalisée, qui contraint et pénalise strictement les pixels prédicts franchissant la frontière du bâtiment-prior. Le pipeline complet d’analyse sémantique est résumé dans la Figure 2, qui relie l’entrée d’images RVB, l’extraction géométrique a priori, l’alignement d’attention croisée, le raisonnement des graphes superpixels et le décodage sémantique des masques au sein d’une architecture unifiée.

Les premiers réseaux d’analyse de scènes reposaient sur des opérations convolutionnelles pour capturer les textures d’apparence locale, mais en raison des limitations des champs réceptifs locaux, ils présentaient une cohérence sémantique insuffisante des cibles à grandeéchelle 21,22. Des études antérieures ont appliqué le module d’auto-attention de l’architecture visuelle Transformer pour extraire des informations contextuelles globales et construire des caractéristiques d’association de pixels à longuedistance 23,24. Les stratégies d’agrégation de caractéristiques multi-modales extraient les caractéristiques géométriques spatiales tridimensionnelles de la scène en fusionnant des nuages de points de la carte de profondeur et des entrées de commandestexte 25,26. Les mécanismes d’attention hybrides pour la fusion de caractéristiques ciblant des domaines spécifiques ont progressivement mûri. En construisant des ponts d’interaction de caractéristiques, ils ont considérablement réduit la perte d’énergie et la rareté des caractéristiques dans la transmission multi-échelle des signaux visuels, et ont amélioré la robustesse de l’analyse syntaxique complexe. Les conceptions d’encodeurs de pointe intègrent et inférent conjointement des détails spatiaux dans le domaine haute fréquence aux côtés de caractéristiques globales et locales, renforçant la capacité du réseau à distinguer les catégories sémantiques à grain fin avec une grande similarité et améliorant la précision de l’analyse syntaxiqueen intérieur 27,28. Les avancées récentes dans les architectures de segmentation sémantique fournissent des références précieuses pour optimiser l’efficacité computationnelle et la perception spatiale. Les modèles conçus pour la prédiction dense et l’agrégation contextuelle à plusieurs échelles extraient des caractéristiques géométriques fines à travers des contextes complexes. Le découplage des caractéristiques et les stratégies de fusion synergique traitent l’ambiguïté sémantique dans les régions frontières. Des mécanismes d’attention légers et des modules d’agrégation à gated optimisent la distribution des paramètres, accélérant ainsi l’inférence tout en préservant les détails structurels locaux. La mise en œuvre de ces conceptions architecturales efficaces offre des conseils théoriques pour réduire la surcharge de calcul des opérations d’inférence topologique non euclidiennes dans l’analyse syntaxique de scènes intérieures.

Les priors de structure de bâtiment et l’estimation de la disposition 3D sont utilisés pour corriger les erreurs d’analyse visuellelocale 29. Des études antérieures ont extrait des caractéristiques géométriques orthogonales et parallèles des bâtiments intérieurs comme contraintes d’inférence afin de réduire le biais de prédiction du réseau causé par des arrière-plans intérieursencombrés 30,31. Les schémas existants utilisent des algorithmes de détection de segments de ligne et des techniques d’analyse de points d’ablation d’image pour générer des boîtes délimitantes 3D Manhattan afin de cartographier les limites physiques des pièces et d’aider à localiser les caractéristiques visuellessous-jacentes 32. L’architecture conjointe du module de connaissance des limites et du contexte multi-échelle intègre implicitement des informations structurelles antérieures dans le processus de décodage des caractéristiques à haute dimension, forçant le réseau à produire des masques sémantiques qui correspondent étroitement aux contours physiques réels, améliorant ainsi la dentelure et le flou des contours des objets33. Les conceptions de fonctions de perte semi-supervisées ou faiblement supervisées avec des propriétés d’amélioration des limites ont été largement explorées. En s’appuyant sur des formules mathématiques rigoureuses pour punir un comportement indépendant de classification des pixels qui viole les règles topologiques spatiales, la fluidité géométrique et l’intégrité structurelle du résultat final de segmentation sont garanties par la source de l’optimisation du gradient34.

Certaines études ont utilisé des réseaux de neurones graphiques pour réaliser l’agrégation inter-domaines de caractéristiques visuelles et le raisonnement sur les relations topologiques dans un espace de hautedimension 35. L’algorithme de segmentation superpixel pré-agrège des blocs de pixels adjacents avec une réponse couleur et des textures similaires en nœuds connectés indépendants. L’algorithme de segmentation superpixel compresse la redondance computationnelle de la structure du graphe au niveau de l’image et préserve la topologie géométrique de base de l’image36. Le GCN, construit sur le vecteur de caractéristiques de nœud de haute dimension, et la matrice d’adjacence représentant la proximité spatiale favorise la transmission directionnelle efficace et la fusion interactive d’informations visuelles multi-échelle le long du graphe connexe physique dans le domainespatial 37,38. L’application du module d’amélioration de l’information temporelle et du mécanisme hybride de connexion à saut multi-échelle supprime le lissage excessif et l’homogénéisation des caractéristiques des nœuds générés lors du passage de messages profondsmulti-couches 39. La technologie de transformation en ondelettes de graphe multi-échelle, ainsi que la stratégie d’optimisation de l’apprentissage des pseudo-éléments d’étiquette, optimisent le mécanisme anti-bruit de fond de la formule de mise à jour des caractéristiques des nœuds, de sorte que les caractéristiques ayant les mêmes attributs sémantiques maintiennent un mode de réponse coopérative dans la topologie réseaucomplexe 40. Le mécanisme de raisonnement basé sur les graphes associe des grilles de pixels régulières à des espaces topologiques non euclidiens pour effectuer des calculs d’agrégation de caractéristiques de structures de bâtiments irrégulières et de composantsintérieurs 41.

Protocole

Les ensembles de données de scènes RVB intérieures et leurs annotations sémantiques ont été préparés avant l’entraînement réseau. Les grands ensembles de données 3D intérieures et RGB-D sur les scènes intérieures (voir le tableau des matériaux) ont été obtenus à partir de leurs dépôts officiels. Les scènes d’acquisition intérieures contenant l’occlusion du mobilier, la variation de l’éclairage, l’interruption des limites des murs et des dispositions spatiales complexes ont été conservées pour correspondre au scénario d’analyse cible. Les étiquettes sémantiques ont été converties en masques d’annotation PNG indexés à canal unique, et toutes les images RVB ainsi que les masques sémantiques ont été redimensionnés à 512 × 512 pixels. L’augmentation des données en ligne a été appliquée pendant l’entraînement, avec un basculement horizontal aléatoire à une probabilité de 0,5, une échelle de luminosité aléatoire entre 0,8 et 1,2, et une rotation aléatoire entre −10° et +10° pour élargir la distribution de la disposition structurelle. Les canaux RVB ont été normalisés avec des valeurs moyennes de 0,485, 0,456 et 0,406 et des valeurs d’écart-type de 0,229, 0,224 et 0,225. Le benchmark 3D intérieur à grande échelle a suivi la répartition officielle de la version utilisée dans cette étude, avec 1201 scènes d’entraînement et 312 scènes de validation pour le développement et la validation du modèle. Le benchmark RGB-D de scène intérieure a suivi le protocole d’évaluation officiel, avec 795 images d’entraînement et 654 images de test. Aucune répartition supplémentaire basée sur les pourcentages n’a été appliquée à ces deux références publiques.

Un réseau visuel de transformateur hiérarchique à fenêtre décalée (voir le tableau des matériaux) a été initialisé comme le réseau dorsal des encodeurs de transformateurs à fenêtre mobile. La taille de l’embedding du patch était configurée à 4 x 4 pixels. Les dimensions d’immersion des quatre étages hiérarchiques ont été réglées à 128, 256, 512 et 1024, et le nombre de blocs transformateurs dans les quatre étages a été fixé à 2, 2, 18 et 2. La taille de la fenêtre d’attention locale était fixée à 7 x 7, et le nombre de têtes d’attention était fixé à 4, 8, 16 et 32 pour les quatre étapes hiérarchiques. Des fonctions d’activation continue non linéaires étaient utilisées à l’intérieur de toutes les couches de perceptron multicouches. Le downsampling spatial a été réalisé par des opérations de fusion de patchs avec un pas de 2 à chaque étape hiérarchique. L’architecture du réseau central et les hyperparamètres du module d’inférence convolutionnelle ont été résumés dans le tableau 1.

L’extraction des caractéristiques d’auto-attention par fenêtre décalée a ensuite été effectuée sur les cartes de caractéristiques d’entrée. Chaque carte de caractéristiques était divisée en fenêtres locales non superposées avec des dimensions spatiales de 7 × 7. L’attention de fenêtre régulière et celle de fenêtre décalée étaient alternées entre des blocs de transformateurs à fenêtre décalée adjacents. La distance de décalage cyclique était réglée à 3 pixels, et un encodage de biais positionnel relatif était appliqué dans chaque fenêtre d’attention locale. Les caractéristiques visuelles locales ont été agrégées via l’auto-attention multi-têtes pour générer des représentations hiérarchiques et multi-échelles.

Les priors structurels de Manhattan ont été extraits d’images RVB intérieures. Les segments structuraux des arêtes ont été détectés à l’aide d’un algorithme de détection de segments de ligne à consistance gradient-direction. Les directions structurelles dominantes ont été regroupées via un algorithme de consensus aléatoire d’échantillon (RANSAC) (voir le tableau des matériaux) basé sur l’estimation du point d’arrivée. Trois directions Manhattan mutuellement orthogonales ont été reconstruites pour générer la représentation de la boîte englobante 3D de Manhattan. La frontière structurelle reconstruite a été convertie en une carte SDF en calculant la distance euclidienne minimale de chaque pixel au segment de ligne de limite le plus proche.

Les caractéristiques d’attention croisée guidées par la structure ont été générées après l’obtention des éléments visuels et des précédents SDF. La variété de caractéristiques visuelles a été mappée au tenseur d’interrogation Q via la matrice de transformation linéaire W sous-élément Q de la capsule à double frappe R, puis à la matrice de formation W sous-élément Q de la double coupe R à la matrice figure-protocol-1de formation. Le champ de distance continue précédent a été mappé au tenseur clé K et au tenseur de valeur V via les matrices figure-protocol-2de transformation , et la dimension du modèle a été fixée à 512. La modulation multi-têtes divisait l’espace de projection en 8 sous-espaces indépendants, chaque tête ayant une dimension de 64. La disposition spatiale antérieure projetait des coordonnées discrètes de pixels dans un champ potentiel continu et générait la matrice d’affinité structurelle S comme un biais spatial additif explicite pour moduler la matrice de similarité du produit scalaire. Le tenseur des caractéristiques visuelles a été utilisé comme source de requête car l’analyse sémantique exige que chaque emplacement visuel récupère activement des preuves structurellement cohérentes de l’espace a priori géométrique. Le SDF prior a été utilisé comme source clé et de valeur car il stocke la distance continue des limites et les indices structurels intérieur-extérieur dérivés de la disposition Manhattan. Le terme produit scalaire mesurait la compatibilité entre l’apparence sémantique et le prior géométrique, tandis que le terme structurel additif λS déplaçait les poids de l’attention vers des pixels sur le même plan physique ou près du même contour architectural. Le coefficient λ représentait la confiance dans le prior structurel extrait et contrôlait dans quelle mesure les contraintes orthogonales rigides étaient intégrées dans la distribution d’attention. Cette formulation réduisait la diffusion transfrontalière des caractéristiques causée par l’occlusion du mobilier et conservait la relaxation adaptative dans les agencements hors Manhattan. La distribution de l’attention guidée par la structure a été calculée selon l’équation 1.

Équation 1 : figure-protocol-3

où A désigne la matrice d’agrégation de l’attention guidée par la structure, Q désigne le tenseur de requête généré à partir de caractéristiques visuelles, K désigne le tenseur clé généré à partir des caractéristiques antérieures SDF, V désigne le tenseur de valeur généré à partir de représentations a priori structurales, dk désigne la dimension des caractéristiques du tenseur clé, λ désigne le coefficient de pondération structurelle adaptatif utilisé pour identifier la confiance géométrique des régions locales et relâcher les contraintes orthogonales rigides dans des espaces non-Manhattan et S désigne la matrice d’affinité SDF. La division par dk a stabilisé l’échelle des logits d’attention et empêché que les grandes dimensions des caractéristiques ne produisent des poids d’attention surconcentrés. La fonction exponentielle normalisée (voir le tableau des matériaux) transformait les scores de similarité modulés en une distribution spatiale normalisée, permettant à chaque pixel d’agréger des informations structurelles a priori en fonction de la cohérence sémantique et géométrique. Ce design explique pourquoi les priors de l’apparence visuelle et des limites architecturales sont fusionnés au niveau de l’attention plutôt que par une concaténation directe de caractéristiques.

Le graphe topologique des superpixels a été construit à partir de la carte de caractéristiques alignée sur la structure. La carte des caractéristiques était segmentée à l’aide d’un algorithme de génération de régions spatiales. Le nombre de superpixels était fixé à 256, le coefficient de compacité à 10, le coefficient de lissage gaussienne à 1,0, et le nombre d’itération à 10. Les contraintes de proximité spatiale étaient appliquées en fixant le poids métrique de distance à un rapport constant de 1,0 à la distance colorimétrique des caractéristiques lors du clustering, maintenant ainsi une génération uniforme de nœuds sur les frontières denses de clac. Les pixels avec des réponses sémantiques homogènes ont été agrégés en nœuds superpixels. Les arêtes des graphes ont été construites selon les relations d’adjacence spatiale, la force d’affinité SDF et les contraintes de cohérence géométrique coplanaire. Le processus de construction de la matrice d’affinité structurelle et de la connectivité topologique est montré à la Figure 3, qui montre comment la guidance SDF a été transformée en relations spatiales au niveau des graphes.

La formulation graphe a été introduite pour convertir le raisonnement dense pixel par pixel en raisonnement spatial nœud par nœud sur des régions structurelles homogènes. Chaque nœud superpixel représentait une région locale avec une réponse sémantique et une continuité spatiale similaires, tandis que chaque arête représentait un chemin fiable pour la transmission de caractéristiques soumis aux contraintes d’adjacence, d’affinité de champ de distance et de coconsistance coplanaire. Cette conception réduisait l’influence des pixels bruyants isolés et permettait aux zones obstruées des murs, des planchers et des plafonds de recevoir des messages provenant de nœuds physiquement adjacents. La construction des arêtes servait donc de pont mathématique entre le guidage SDF continu et le raisonnement discret non euclidien sur les graphes.

Un réseau de raisonnement convolutionnel à trois couches a été configuré avec des dimensions de caractéristiques cachées de 512, 256 et 128. La couche convolutionnelle du graphe effectuait un lissage des caractéristiques sur la structure du graphe en fonction des relations spatiales entre les nœuds. L’adjacence en boucle propre a conservé l’état original de chaque nœud lors du passage des messages, empêchant que les caractéristiques d’une petite région structurelle soient effacées par les grandes régions environnantes. La normalisation symétrique a mis à l’échelle les éléments de la matrice d’adjacence par le produit des racines carrées inverses des degrés des nœuds, de sorte que les nœuds de haut et de bas degré contribuaient sous des magnitudes numériques comparables lors de la propagation. La propagation en avance effectuait une agrégation spatiale localisée, dans laquelle chaque état de nœud absorbait des caractéristiques de haute dimension provenant de groupes coplanaires adjacents avant que la fonction de rectification non linéaire par élément ne soit appliquée. Cette formulation faisait que la couche de convolution de graphe approchait la diffusion sémantique le long de plans intérieurs physiquement significatifs plutôt qu’un lissage illimité sur les frontières d’objets non liés. Les caractéristiques des nœuds graphiques ont été évaluées selon l’équation 2.

Équation 2 : figure-protocol-4

La projection des caractéristiques denses des pixels vers les nœuds superpixels, le passage de messages par convolution graphique, et la rétroprojection des coordonnées sont présentées dans la Figure 4, clarifiant le chemin d’agrégation des caractéristiques des grilles d’images régulières vers une topologie non euclidienne, puis de retour à une représentation sémantique dense. La projection des caractéristiques de pixels denses dans la Figure 4A vers les nœuds superpixels de la Figure 4B, le passage du message graphe-convolution dans la Figure 4C, et la rétroprojection des coordonnées dans la Figure 4D clarifient le chemin d’agrégation des caractéristiques des grilles d’images régulières vers une topologie non euclidienne, puis de retour à une représentation sémantique dense.

où H(l) désigne le tenseur de caractéristiques du nœud de la l-ième couche de convolution du graphe, Â désigne la matrice d’adjacence avec des connexions à auto-boucle, D désigne la matrice des degrés correspondant à la matrice d’adjacence, W(l) désigne la matrice de poids apprenable de la l-ième couche de convolution du graphe, et σ désigne la fonction d’activation de l’unité linéaire rectifiée. Le terme ÂH(l) agrégeait des caractéristiques provenant des nœuds superpixels adjacents, tandis que D−1/2 et D−1/2 équilibraient la contribution des nœuds avec différentes densités de connexion. La matrice apprenable W(l) projetait des caractéristiques agrégées dans un nouvel espace sémantique, permettant à la couche graphe de distinguer la cohérence structurelle de la proximité spatiale ordinaire. L’activation non linéaire a préservé la différence de réponses entre les régions coplanaires et non coplanaires après l’agrégation des caractéristiques.

Les caractéristiques de segmentation sémantique ont été décodées après le raisonnement des graphes. Le décodeur a été construit à l’aide de trois étages d’upsampling d’interpolation bilinéaire et d’opérations de fusion par connexion inter-couche. Les caractéristiques peu profondes des encodeurs spatiaux étaient concaténées avec des caractéristiques sémantiques de haut niveau par fusion canal. La résolution des caractéristiques a été rétablie à la taille originale de l’image, et la carte finale de prédiction sémantique des probabilités a été générée via une couche de convolution 1 × 1.

Le réseau d’analyse sémantique complet a été entraîné à l’aide d’un optimiseur de désintégration poids découplé (voir le tableau des matériaux). Le taux d’apprentissage initial a été fixé à 0,0001, le coefficient de désintégration pondérative à 0,01, et la taille du lot à 8 pour les deux benchmarks publics. Le taux de désintégration du premier moment était fixé à 0,9, le taux de désintégration du second moment à 0,999, et le coefficient de stabilité numérique de l’épsilon était fixé à 1 × 10⁻8. La perte de validation était surveillée à la fin de chaque époque, et les points de contrôle étaient sauvegardés lorsque le mIoU sur l’ensemble de validation augmentait. Le réseau a été entraîné pendant 300 époques en utilisant une stratégie de désintégration du taux d’apprentissage polynomial avec une puissance de décroissance de 0,9. Cinq entraînements indépendants ont été réalisés en utilisant différentes initialisations de graines aléatoires afin d’établir une base d’évaluation statistiquement rigoureuse. Le réseau a été optimisé conjointement en utilisant la perte d’entropie croisée au niveau des pixels et la perte de cohérence structurelle. Toutes les expériences ont été réalisées sur une plateforme informatique équipée de matériel de calcul parallèle à haute mémoire, et des informations matérielles détaillées ont été rapportées dans le Table of Materials.

L’optimisation conjointe imposait l’alignement géométrique des frontières en calculant la magnitude du gradient spatial du tenseur de probabilité de classe. La perte de cohérence structurelle a été utilisée comme régularisateur, multipliant la norme des gradients de prédiction spatiale par les valeurs SDF continues. La logique mathématique était que les changements de catégories sémantiques devaient se concentrer près des contours architecturaux réels, où la SDF tendait vers zéro, tandis que les intérieurs plats des murs, des sols et des plafonds devaient maintenir des réponses sémantiques lisses. Lorsqu’un grand gradient de prédiction apparaissait loin d’une frontière structurelle, le terme du champ de distance augmentait la pénalité et décourageait les fausses transitions sémantiques à l’intérieur d’un plan physique homogène. Lorsqu’un gradient de prédiction apparaissait près d’un contour de distance nulle, la pénalité restait limitée et préservait les transitions de classe légitimes le long des frontières architecturales. Les régions de transition sémantiques étaient contraintes à s’aligner avec les contours de distance nulle de la SDF, comme indiqué par l’équation 3.

Équation 3 : figure-protocol-5

où Ltotal désigne la fonction objectif d’optimisation finale, Lce désigne la perte d’entropie croisée au niveau des pixels, Lscl désigne la perte de pénalité de cohérence structurelle, et α désigne le coefficient de pondération de perte structurelle. Le terme cross-entropie offrait une supervision sémantique au niveau des pixels via des masques d’annotage, tandis que le terme de cohérence structurelle imposait une régularisation géométrique à l’aide de priors architecturaux. Le coefficient de pondération α la reconnaissance équilibrée des catégories et l’alignement des frontières, empêchant l’optimisation de surajuster la précision locale des étiquettes ou les contours structurels rigides. Cet objectif commun reliait la sémantique visuelle, la cohérence physique des frontières et les paramètres du réseau entraînables au sein d’une cible d’optimisation unifiée.

Résultats

Installation expérimentale

Cette étude a utilisé deux ensembles de données standards d’analyse des scènes intérieures, un jeu de données 3D intérieur à grande échelle et un jeu de données RGB-D sur les scènes intérieures, afin d’évaluer la performance et d’ajuster le modèle. Le jeu de données 3D intérieur à grande échelle contient des scènes complexes de l’espace physique scannées de manière réaliste et des vues RVB haute résolution, fournissant des étiquettes sémantiques 3D 3D pixel par pixel de haute précision et des masques de segmentation de projection spatiale 2D. Ses données de reconstruction de grilles en espace physique intrinsèquement réalistes et ses propriétés orthogonales établissent un critère de comparaison géométrique pour construire avec précision la boîte englobante 3D Manhattan dans la branche d’extraction. Le jeu de données RGB-D sur les scènes intérieures contient des images de profondeur intérieures obscurcies par le mobilier et le désordre, et sert à tester la précision globale du raisonnement logique et la robustesse face aux occlusions.

L’algorithme utilise mIoU pour mesurer le chevauchement spatial entre les distributions sémantiques prédite et vraie, tout en introduisant un score F1 de frontière structurelle pour évaluer rigoureusement la précision de l’ajustement entre le masque prédit et les arêtes physique-structurales à distance nulle calibrées par la SDF. Un seuil d’erreur fixe pour la distance des pixels dans l’espace euclidien est fixé lors du calcul afin de déterminer si les pixels de bord produits par le réseau intersectent les véritables contours physiques des bâtiments. Ce système d’évaluation double limite les erreurs de classification dans les blocs sémantiques à grande surface tout en renforçant l’évaluation micro-quantitative de l’effet de reconstruction topologique des droites rigides. Pour maintenir la cohérence entre la configuration des données expérimentales et le processus d’optimisation, l’échelle du jeu de données et les hyperparamètres d’entraînement du cœur ont été résumés dans le tableau 2. Le tableau 2 rapporte une configuration expérimentale faisant autorité pour le manuscrit révisé. Le benchmark 3D intérieur à grande échelle utilise 1201 scènes d’entraînement et 312 scènes de validation, le benchmark RGB-D utilise 795 images d’entraînement et 654 images de test, et les deux benchmarks sont entraînés avec une taille de lot de 8, un taux d’apprentissage initial de 0,0001, un coefficient de décroissance de poids de 0,01, et 300 époques d’entraînement.

Comparaison avec les méthodes de pointe

Avant de présenter une table comparative quantitative des algorithmes d’analyse des scènes intérieures, cette section définit rigoureusement les benchmarks de test utilisés dans le système d’évaluation multidimensionnelle. Pour refléter la performance de classification du modèle à différentes granularités, le système d’évaluation complète le système de test avec deux métriques supplémentaires : la précision globale des pixels (PixelAcc) et la précision des classes moyennes (MeanAcc). Ces indicateurs ensemble construisent un système détaillé de vérification des performances des algorithmes, établissant une référence théorique rigoureuse pour une analyse quantitative ultérieure. Pour évaluer la précision sémantique de l’analyse syntaxique et la robustesse à l’occlusion de l’algorithme proposé dans des espaces physiques complexes, des tests comparatifs ont été réalisés avec des algorithmes existants sur l’ensemble de validation RGB-D pour scènes intérieures. La bibliothèque de modèles de comparaison couvre les cadres fondamentaux de masque-attention, les Transformers de vision hiérarchique, les pipelines modernes de segmentation pure convolutionnelle, les architectures unifiées de prédiction dense et les réseaux d’attention intercanaux. L’évaluation de référence a été élargie pour inclure une base de segmentation basée sur des transformateurs, une base unifiée de prédiction dense, une base unifiée de détection et segmentation, une base de base de vision à grande échelle, une base purement convolutionnelle, une base de segmentation basée sur l’attention du masque, une base d’agrégation de caractéristiques intermodale et une base de fusion progressive des caractéristiques ( voir le tableau des matériaux), en utilisant le même ensemble de validation de scène intérieure RGB-D, la résolution d’entrée, le même calendrier d’entraînement et le même protocole métrique. Dans l’architecture proposée, le réseau guidé par la structure intègre une colonne vertébrale visuelle multi-échelle à fenêtres décalées, un module d’attention croisée guidé par la structure avec un SDF, et un GCN superpixel. La comparaison élargie couvre la prédiction dense basée sur les transformateurs, la prédiction dense basée sur la convolution, l’analyse syntaxique par masque, la fusion intermodale des caractéristiques et les paradigmes de fusion progressive des caractéristiques, permettant d’évaluer la contribution de l’intervention explicite 3D des limites géométriques contre des bases plus larges de l’analyse des scènes intérieures.

Le tableau 3 détaille la performance d’évaluation objective de chaque réseau sur les métriques quantitatives principales, en rapportant les valeurs moyennes et les écarts-types correspondants sur cinq exécutions indépendantes. La comparaison élargie de la base évalue si le mécanisme de raisonnement guidé par la structure proposé contribue à des gains de précision au-delà des backbonds de prédiction dense standard, des réseaux de segmentation basés sur le masque et des réseaux de fusion de caractéristiques RGB-D. Les données expérimentales montrent que l’algorithme proposé obtient des gains stables sur les quatre métriques quantitatives. Les réseaux de prédiction dense basés sur des transformateurs et les réseaux d’attention masque conservaient une forte capacité de modélisation globale du contexte, mais leurs valeurs F1 de la frontière restaient plus faibles en présence de désordre au premier plan, car les masques prédits ne comportaient pas de contraintes physiques explicites de la frontière. Les réseaux de fusion inter-modaux et progressifs ont amélioré la continuité sémantique locale, mais leur fusion de caractéristiques reposait encore principalement sur les réponses à l’apparence et à la profondeur plutôt que sur un prior structurel à distance signée. Le réseau guidé par la structure proposé a atteint un mIoU de 0,687 avec un écart-type de 0,002 et un score moyen F1 de la frontière de 0,764 avec un écart-type de 0,003. La comparaison élargie indique que le gain de performance ne résultait pas uniquement d’une colonne vertébrale de prédiction plus dense, mais plutôt de l’utilisation conjointe du guidage de champ à distance signée, de l’attention croisée consciente de la structure et du raisonnement topologique basé sur les graphes.

Pour analyser la précision globale du raisonnement logique du modèle sous occlusions, nous avons identifié et extrait des scénarios typiques dans l’ensemble de validation qui étaient gravement obstrués par le mobilier et autres encombrements, et produit des visualisations de masques de prédiction au niveau des pixels.

Après cela, le flux de travail de la méthode et le raisonnement graphique ont été définis dans les figures 1, 2, 3 et 4. La figure 5 illustre les différences dans les prédictions morphologiques entre les modèles sous des conditions d’occlusion extrêmes. Les rectangles rouges dans la carte qualitative de maillage de comparaison marquent les zones de conflit clés où les coins et les surfaces porteuses sont occultés. Le masque de sortie de la base de segmentation basée sur l’attention du masque montre un lissage des bords prononcé et une adhésion inter-classes. Bien que la base d’agrégation de caractéristiques intermodale et la base de fusion progressive des caractéristiques intègrent des données intermodales, leurs résultats de prédiction présentent néanmoins des discontinuités de classes structurales et des distorsions physiques des frontières. Le masque généré par cette méthode proposée présente un fort chevauchement spatial avec les labels de la réalité de base. Les modèles de base, contraints par des principes purement pilotés par les pixels, sont susceptibles de perdre leurs champs réceptifs locaux lorsqu’ils sont occultés. La méthode proposée utilise un GCN superpixel pour effectuer le passage de messages dans l’espace non euclidien, reconstruisant ainsi les coins sous-jacents et les squelettes spatiaux linéaires guidés par des frontières géométriques implicites. Cela vérifie la performance anti-interférence de notre solution proposée pour résoudre des aménagements intérieurs complexes d’un point de vue morphologique visuel.

Expérience d’ablation

Pour analyser la contribution réelle de chaque composant indépendant dans l’architecture proposée, cette étude a construit un test d’ablation modulaire étendu sur le jeu de validation de scènes intérieures RGB-D. La base de test a été réglée sur un réseau de classification conventionnel avec seulement la colonne vertébrale visuelle du transformateur à fenêtre décalée de base. L’évaluation quantitative a mesuré la contribution indépendante de l’attention croisée guidée par la structure, du biais de champ à distance signée, de la pondération structurelle adaptative, du raisonnement sur graphes superpixels, de la construction coplanaire des arêtes, de la normalisation symétrique des graphes et de la perte de cohérence structurelle. Cette conception d’ablation étendue séparait les gains cumulatifs des modules des effets de suppression des composants, rendant la frontière de contribution de chaque choix de conception plus claire.

Le tableau 4 et la figure 6 illustrent l’évolution de la précision sous des paramètres d’ablation cumulative et basée sur le retrait élargis. Le réseau de transformateurs de base à fenêtre décalée ne présente pas de contraintes de frontière physique tridimensionnelle, ce qui entraîne une agrégation de caractéristiques limitée dans des fonds encombrés. L’ajout d’une attention croisée guidée par la structure a augmenté le mIoU de 0,615 à 0,648 et le score F1 de la frontière de 0,630 à 0,685, montrant que le champ de distance signée auparavant améliorait l’alignement entre les caractéristiques visuelles et les contours structurels. L’ajout du raisonnement par graphe superpixel seul augmentait le mIoU à 0,641 et le score F1 de la frontière à 0,676, indiquant que le raisonnement topologique par nœud améliorait la cohérence sémantique sur des régions physiques homogènes. Ajouter seule la perte de cohérence structurelle a augmenté le mIoU à 0,632 et le score F1 de la frontière à 0,662, montrant que le terme de perte affectait principalement l’ajustement des limites plutôt que l’agrégation contextuelle large.

La combinaison de l’attention croisée avec le raisonnement graphique a augmenté le mIoU à 0,669 et le score F1 de la frontière à 0,721, montrant que l’alignement visuel-structurel et le passage des messages dans le domaine graphe produisaient des effets complémentaires. La combinaison de l’attention croisée avec la perte de cohérence structurelle a permis d’obtenir un mIoU de 0,660 et un score F1 de la Boundary de 0,713, tandis que la combinaison du raisonnement graphique avec la perte de cohérence structurelle a permis un mIoU de 0,653 et un score F1 de la Boundary de 0,704. Ces résultats par paires indiquent que le module d’attention croisée fournissait le principal signal d’alignement géométrique, que le module de raisonnement des graphes a étendu ce signal sur des régions coplanaires, et que la perte de cohérence structurelle a affiné la frontière de transition sémantique lors de l’optimisation.

L’ablation basée sur le retrait a encore clarifié la contribution des choix de conception interne. La suppression du biais additif de champ à distance signée a réduit le mIoU à 0,656 et le score F1 de la frontière à 0,698, confirmant que la matrice d’affinité structurelle était centrale pour supprimer la diffusion transfrontalière des caractéristiques. La suppression du coefficient de pondération structurelle adaptative λ a réduit le mIoU à 0,671 et le score F1 de la frontière à 0,736, indiquant qu’une contrainte structurelle fixe affaiblissait la réponse du modèle dans les régions non Manhattan et dégradées visuellement. La suppression de la contrainte des arêtes coplanaires a réduit le mIoU à 0,666 et le score F1 de la frontière à 0,728, montrant que les arêtes du graphe basées uniquement sur l’adjacence locale ne préservaient pas la cohérence du plan physique. La suppression de la normalisation symétrique du graphe a réduit le mIoU à 0,673 et le score F1 de la frontière à 0,737, indiquant qu’une propagation équilibrée par degré était nécessaire pour une agrégation stable de nœuds. Le réseau complet guidé par la structure proposé a atteint un mIoU de 0,687 et un score F1 de frontière de 0,764, démontrant que le gain final résultait de l’interaction coordonnée entre l’attention structurelle, le raisonnement des graphes et l’optimisation consciente des frontières.

Analyse de la complexité computationnelle, du temps d’entraînement et de l’efficacité de l’inférence

Pour évaluer le coût computationnel de l’extraction SDF, de l’attention croisée guidée par la structure et du raisonnement convolutionnel sur graphes superpixels, cette étude a évalué l’échelle des paramètres, les opérations en virgule flottante, l’utilisation maximale de la mémoire, le temps d’entraînement, la latence d’inférence sur une seule image, la fréquence d’images et le mIoU sur la même plateforme informatique. Les opérations en virgule flottante étaient calculées avec une résolution d’entrée 512 × 512. La latence d’inférence a été mesurée avec une taille de lot de 1 après échauffement du modèle, tandis que le taux d’images rapporté a été calculé à partir de la latence moyenne d’une seule image. Le temps d’entraînement était mesuré selon le même calendrier de 300 époques, la même taille de lot de 8, les réglages de l’optimiseur et le pipeline de prétraitement des données.

Le tableau 5 détaille la relation entre l’échelle du modèle, le coût d’entraînement, l’efficacité d’inférence et la précision de l’analyse syntaxique pour chaque architecture réseau. Les colonnes mIoU et F1 de la frontière dans le tableau 5 utilisent les mêmes valeurs globales de l’ensemble de validation que le tableau 3 pour chaque modèle correspondant. Ces deux colonnes de précision sont répétées dans le tableau 5 uniquement pour comparer la précision de l’analyse syntaxique au coût de calcul. L’augmentation des paramètres entraînables était principalement due aux couches de projection requête-clé-valeur dans le module d’attention croisée guidée par la structure et aux matrices de poids des trois couches convolutionnelles du graphe. Le coût non entraînable était principalement supporté par la génération de SDF, le partitionnement des superpixels et la construction d’adjacence de graphes. Puisque ces opérations non entraînables étaient exécutées une fois pour chaque image d’entrée, elles augmentaient la latence d’inférence mais n’augmentaient pas substantiellement le nombre de paramètres entraînables. Cette séparation explique pourquoi la méthode proposée a montré une augmentation modérée des paramètres mais une augmentation plus marquée de la latence. Les résultats de complexité montrent que la base de segmentation basée sur l’attention du masque conservait un nombre de paramètres plus faible et une latence d’inférence plus courte, mais son score F1 de la frontière et son mIoU étaient limités sous une occlusion sévère en raison de l’absence de guidage explicite des frontières géométriques du réseau. La base d’agrégation de caractéristiques intermodale nécessitait plus d’opérations en virgule flottante et un temps d’entraînement plus long, car l’agrégation intermodale introduisait une surcharge supplémentaire d’alignement des caractéristiques. La base progressive de fusion des caractéristiques maintenait un coût computationnel modéré, mais sa précision de prédiction restait inférieure à celle de la méthode proposée sous distorsion des frontières. Le réseau guidé par la structure proposé engendre un coût computationnel supplémentaire en raison de la construction SDF, de la projection structurelle à attention croisée, de la construction de graphes superpixels et de la propagation par convolution de graphes. Le modèle complet utilisait 66,8 millions de paramètres, 121,4 milliards d’opérations en virgule flottante, 15,6 heures d’entraînement, 7,9 Go de mémoire de crête, 61 ms de temps d’inférence sur une seule trame et 16,4 images par seconde. Bien que la latence d’inférence ait été supérieure à celle de la référence de l’attention purement masquée, le modèle a atteint un mIoU de 0,687 et un score F1 de frontière de 0,764, indiquant que le coût supplémentaire soutenait principalement la réparation des limites structurelles et la cohérence sémantique consciente de la topologie.

Pour représenter visuellement l’équilibre spatial bidimensionnel entre l’échelle computationnelle et la précision analytique du modèle, un diagramme de distribution en bulles montrant le nombre d’opérations en virgule flottante et le mIoU de l’algorithme a été créé. La visualisation révisée a également rapporté le temps d’entraînement et la latence d’inférence dans la zone d’annotation de la figure, permettant de comparer les gains de précision et les coûts computationnels, tant du point de vue de l’entraînement que du déploiement. L’axe horizontal conservait les opérations en virgule flottante, l’axe vertical conservait le mIoU, la taille de la bulle représentait la grandeur des paramètres entraînables, et l’étiquette attachée indiquait le temps d’inférence pour chaque méthode.

La figure 7 révèle la relation entre les opérations en virgule flottante, l’échelle des paramètres, la latence d’inférence et la précision de l’analyse syntatique. La méthode proposée atteint un mIoU plus élevé que les réseaux de comparaison, tandis que ses FLOPs et son nombre de paramètres restent proches de ceux des bases de fusion intermodale et progressive. La latence sur une seule image de 61 ms indique que les branches SDF et de raisonnement graphique ajoutées introduisaient une surcharge de déploiement, mais la latence restait dans la plage temps réel requise pour de nombreuses tâches d’interprétation de scènes intérieures. Le temps d’entraînement a augmenté à 15,6 heures car l’extraction préalable structurelle, la projection de l’attention et le raisonnement graphique étaient réalisés à chaque époque d’entraînement. Ce résultat montre que le coût computationnel de la méthode proposée est principalement concentré sur le raisonnement structurel conscient des frontières plutôt que sur l’expansion non contrôlée des paramètres.

Comparaison spécifique entre la perte de cohérence structurelle et la perte de distance spatiale

La perte de réseau de transformation inverse pour quantifier la distance de transformation spatiale de la frontière utilise des paramètres de transformation homomorphes pour capturer les décalages de frontière, démontrant que les métriques purement spatiales surpassent les pertes traditionnelles d’entropie croisée basées sur les changements d’étiquettes de pixels. S’appuyant sur ce consensus théorique, des expériences de validation parallèle sont menées en utilisant des schémas de contraintes de frontière pour évaluer la performance comparative de la perte de cohérence structurelle (SCL) personnalisée basée sur la boîte englobante de Manhattan en ce qui concerne l’adaptabilité de la scène. Les expériences maintiennent l’architecture analytique consistant à fusionner une colonne vertébrale visuelle multi-échelle avec un réseau d’inférence graphique, tout en remplaçant simplement le terme de perte aux limites lors de la rétropropagation. Quatre réseaux de validation parallèles sont configurés : un réseau utilisant uniquement la classification de base de perte croisée d’entropie n’a pas de contraintes géométriques de haute dimension ; un réseau avec une perte standard d’entropie binaire (BCE) ajoutée effectue une supervision conventionnelle de classification binaire des bords ; un réseau avec une perte de distance spatiale ajoutée se concentre sur la capture des déformations locales ; et un réseau appliquant la SCL proposée impose des pénalités topologiques orthogonales basées sur la SDF. Les métriques de quantification sur l’ensemble de validation de scènes intérieures RGB-D sont limitées au mIoU et au score F1 de la limite structurelle.

Le tableau 6 détaille le degré d’intervention des différentes stratégies d’optimisation de rétropropagation sur la cognition logique spatiale sous-jacente. L’entrée uniquement entre entropies croisées dans le Tableau 6 désigne l’architecture proposée de notre corps entraînée uniquement avec la perte d’entropie croisée au niveau des pixels, tout en conservant inchangés la colonne vertébrale visuelle, la branche de champs à distance signée, le module d’attention croisée guidé par la structure et la branche de raisonnement des graphes superpixels. Cette entrée n’est pas une référence Mask2Former et ne doit pas être comparée à la valeur globale de Mask2Former dans le tableau 3, car elle utilise le même modèle. Les réseaux reposant uniquement sur la perte basique d’entropie croisée obtiennent le score d’ajustement aux frontières le plus bas. Les réseaux présentant une perte binaire standard de frontière supplémentaire par entropie croisée obtiennent un léger gain, mais ce mécanisme provoque tout de même un flou des contours sous une occlusion à grande échelle. La perte de distance de la frontière spatiale améliore le score grâce à un mécanisme de perception par transformation spatiale, corrigeant efficacement certains arêtes déformées. La perte de cohérence structurelle proposée dans cet article exploite directement la SDF réelle pour imposer des pénalités de gradient sur les mutations sémantiques anormales au sein de la surface portante physique, atteignant ainsi le score F1 le plus élevé sur la frontière structurelle.

Pour comparer visuellement les effets moteurs des différentes configurations de fonction de perte sur la précision de la prédiction du masque et l’ajustement des limites, nous avons tracé des graphiques à barres groupés à travers différentes stratégies d’optimisation.

La figure 8 illustre l’amélioration progressive des performances résultant de la mise à niveau de la dimension de perception spatiale de la fonction de perte. Le graphique à barres représentant le score F1 de la limite structurelle montre une tendance haussière significative. Les données expérimentales montrent que ce mécanisme de pénalité personnalisé force la position de saut spatiale de la catégorie prédite à coïncider précisément avec le contour physique orthogonal. Le mécanisme de pénalité de champ de distance, personnalisé pour les priors orthogonaux intérieurs, atteint une précision supérieure à la perte générale de capture de frontière spatiale, établissant ainsi un chemin d’optimisation efficace pour traiter des défauts complexes de bâtiments.

Tests de robustesse de la distribution extrême d’occlusion, des structures anormales et des conditions d’éclairage difficiles

Les relations spatiales complexes entre objets et l’occlusion mutuelle affectent négativement la cognition spatiale 3D globale. L’architecture de prédiction conjointe met en lumière le rôle de soutien des contraintes de disposition de la scène dans l’extraction du masque sous-jacent. L’examen des limites anti-interférences de l’algorithme sous la perte de signal visuel à grande surface et les configurations spatiales anormales qui violent l’hypothèse physique orthogonale 3D définit clairement la limite d’application effective de l’algorithme et a une valeur fondamentale et démontrable. En fonction de la proportion de meubles de grande taille masqués par les libelles de la réalité, le set de test de scène intérieure RGB-D est subdivisé en trois sous-ensembles de plus en plus difficiles : occlusion légère, modérée et sévère. Simultanément, les scènes non typiques de Manhattan avec des plafonds en pente ou des murs courbés sont extraites manuellement pour construire des ensembles de tests de limites d’anomalie, et les scènes présentant des conditions de très faible luminosité, une surexposition et des surfaces vitrées brillantes ou transparentes sur de grandes surfaces sont classées en sous-ensembles d’éclairage et de texture difficiles. La bibliothèque de modèles de comparaison inclut une base de segmentation basée sur l’attention du masque ; une architecture de segmentation générale basée sur l’attention du masque pour capturer le contexte global ; une base d’agrégation de caractéristiques intermodale employant une stratégie d’agrégation intermodale complète ; et une base progressive de fusion de caractéristiques intégrant un mécanisme d’extraction progressive de caractéristiques à plusieurs étapes. Chaque référence de comparaison, la dorsale visuelle de fusion et l’architecture d’analyse du réseau d’inférence graphique construite dans cet article sont évaluées indépendamment sur les sous-ensembles ci-dessus, et le gradient de désintégration de précision de chaque modèle est analysé statistiquement.

Le tableau 7 rapporte les métriques de robustesse spécifiques à chaque sous-ensemble sous des conditions d’occlusion légère, modérée et sévère, d’illumination difficile, d’interférence de texture et d’anomalies hors Manhattan. Le tableau 7 détaille les changements dans la précision de la prédiction des masques de différents modèles sous interférence spatiale. Le tableau 7 rapporte les valeurs de mIoU spécifiques à chaque sous-ensemble pour différents modèles en conditions d’interférence spatiale, calculées uniquement dans l’occlusion, l’illumination, la texture ou le sous-ensemble non Manhattan correspondant, plutôt que sur l’ensemble global de validation de la scène intérieure RGB-D. Dans les sous-ensembles d’occlusion légère et modérée, tous les modèles maintiennent une précision de base. Avec l’augmentation de la surface d’occlusion, les modèles de référence s’appuyant sur des règles pilotées par les pixels montrent une diminution du ratio d’union intersection (UI) sur le sous-ensemble fortement occlus. La base de segmentation basée sur l’attention du masque et la base d’agrégation de caractéristiques intermodale subissent des pertes de précision significatives sur ce sous-ensemble. L’architecture progressive d’extraction de caractéristiques à plusieurs étapes de la base de fusion progressive présente une baisse sévère des performances. La solution proposée repose sur des caractéristiques explicites du squelette 3D pour forcer l’alignement des signaux visuels endommagés, en maintenant une forme stable de sortie de masque sur le sous-ensemble fortement occulté et en démontrant la stabilité topologique de la sortie du masque sémantique. Dans les sous-ensembles d’éclairage et de texture difficiles, le détecteur de segments de ligne manque les bords structurels dans les régions à forte réflexion et verre transparent, ce qui entraîne des discontinuités localisées dans la SDF. Les coordonnées géométriques erronées se propagent à travers la matrice d’affinité structurelle et la perte de consistance structurale, appliquant ainsi des pénalités de gradient anormales aux caractéristiques sémantiques et provoquant des écarts correspondants dans les prédictions des frontières. Le mécanisme global de raisonnement du contexte spatial du GCN complète les priors géométriques manquants par des affinités structurelles adjacentes, maintenant une précision globale d’analyse dans une plage de désintégration acceptable et révélant la limite des capacités de perception visuelle de l’algorithme sous interférences physiques complexes. Dans le sous-ensemble non Manhattan des anomalies, la SDF antérieure à la couche inférieure de ce modèle introduit un léger biais de cartographie, ce qui entraîne des performances légèrement inférieures à la base progressive de fusion de caractéristiques. Le coefficient de pondération structurelle adaptatif dans le module d’attention croisée évalue dynamiquement la cohérence des gradients de la structure physique sous-jacente. Dans les scènes avec des murs courbés ou des plafonds inclinés, ce coefficient réduit automatiquement le poids de contrainte du SDF, encourageant le réseau à s’appuyer sur le mécanisme d’agrégation locale des nœuds de caractéristiques du réseau de graphes superpixels pour maintenir la cohérence sémantique dans des régions homogènes, établissant ainsi un mécanisme efficace de compensation géométrique pour les configurations spatiales hors Manhattan.

Pour démontrer visuellement l’impact négatif de la sévérité de l’occlusion sur la précision de la résolution, nous avons tracé des graphiques linéaires montrant la baisse de la précision à travers différents modèles d’algorithmes.

La figure 9 révèle visuellement les différences de robustesse entre les différents paradigmes d’extraction de caractéristiques dans des environnements physiques extrêmes. Les trois lignes pointillées représentant les modèles de base présentent toutes une tendance significative à la baisse sur les nœuds fortement obstrués, reflétant les limites des champs réceptifs conventionnels dans l’extraction de caractéristiques sous des pertes de signal à grande échelle. La ligne continue représentant la méthode proposée maintient une trajectoire de désintégration relativement douce. Les données expérimentales montrent que le couplage entre les priors architecturaux 3D explicites et les mécanismes d’inférence basés sur les graphes offre un support structurel pour les tâches d’analyse de scènes résistantes à l’occlusion et améliore la généralisation des modèles dans des environnements complexes.

Analyse de sensibilité spatiale du partitionnement topologique des nœuds de graphes

Le paramètre de taux d’échantillonnage à réduction de dimensionnalité du module de convolution graphe en espace de coordonnées contrôle directement la qualité du champ récepteur et la charge computationnelle du réseau de graphes. Conformément au cadre théorique de cet article, cette étude étudie comment le nombre de nœuds graphiques discrets produits par un simple regroupement linéaire itératif affecte la performance de l’inférence topologique non euclidienne, visant à fournir un support rigoureux pour la sélection des hyperparamètres. Des expériences ont été menées pour ajuster les paramètres de contrôle d’initialisation de l’algorithme de clusterisation, intervenant de force dans la réduction dynamique de dimensionnalité de l’espace des caractéristiques, fixant le nombre de partitions de nœuds de graphes superpixels à 64, 128, 256, 512 et 1024. Sous un benchmark de test strictement aligné, le rapport moyen intersection-union-union (IoU), le score F1 de la frontière structurelle et le temps moyen d’inférence par image haute résolution ont été enregistrés simultanément sur différentes tailles de nœuds topologiques.

Le tableau 8 détaille la relation entre le degré de réduction de dimensionnalité dynamique dans l’espace des caractéristiques et la précision analytique ainsi que le coût computationnel. Fixer le nombre de nœuds trop bas conduit à une sous-segmentation des caractéristiques d’image, ce qui fait fusionner les attributs sémantiques des petits objets avec les éléments muraux à grande échelle, diminuant ainsi diverses métriques de précision. À mesure que l’échelle de partitionnement des nœuds augmente, la sensibilité du modèle aux détails spatiaux locaux s’améliore considérablement. Augmenter le nombre de nœuds à 512 et 1024 entraîne une fragmentation des régions homogènes, affaiblit l’effet de lissage sur les caractéristiques macroscopiques dans les réseaux neuronaux de graphes, augmente la dimensionnalité de la matrice de relations entre nœuds et accroît le temps d’inférence. Une configuration de paramètres avec un nombre fixe de nœuds de 256 conduit aux valeurs les plus élevées pour le rapport intersection-union et le score de frontière.

Pour représenter visuellement le compromis entre précision et puissance de calcul dans l’inférence topologique non euclidienne, un graphe statistique biaxial montrant la sensibilité à la taille des nœuds a été tracé.

La figure 10 illustre la logique sous-jacente par laquelle le nombre de nœuds graphiques discrets influence l’évolution des caractéristiques du réseau. La barre de fond représentant le temps de calcul montre une forte augmentation après que le nombre de nœuds a dépassé le seuil de 256. La double ligne représentant la précision atteint un pic à 256 sur l’axe horizontal, puis diminue raisonnablement en raison des effets de fragmentation. Les données quantitatives objectives et la tendance d’évolution visuelle sont très cohérentes, démontrant que maintenir la taille du graphe de calcul à 256 nœuds trouve un équilibre entre le traitement matériel et le raisonnement logique sous la configuration actuelle à paramètres fixes. La sévère dégradation des performances causée par l’écart par rapport à ce nombre de nœuds révèle la grande sensibilité de la stratégie de segmentation fixe des superpixels à l’ajustement des hyperparamètres et souligne la nécessité de développer un mécanisme dynamique de sélection des nœuds.

DISPONIBILITÉ DES DONNÉES :

Les données brutes de référence analysées dans cette étude sont accessibles au public dans les dépôts officiels listés dans le Tableau des matériaux. Le benchmark 3D intérieur à grande échelle a été consulté comme la version officielle ScanNet v2, avec l’identifiant de publication du jeu de données ScanNet v2. Le benchmark RGB-D de scènes intérieures a été consulté via la version officielle NYU Depth Dataset V2, avec l’identifiant de publication NYU Depth Dataset V2. Le DOI descriptif de publication pour le benchmark 3D intérieur à grande échelle est 10.1109/CVPR.2017.261, et le DOI descriptif pour le benchmark RGB-D de scènes intérieures est 10.1007/978-3-642-33715-4_54. Aucune nouvelle image brute ni jeu de données RGB-D n’a été générée dans cette étude. Les fichiers séparés traités, les fichiers de configuration d’entraînement, les journaux d’évaluation bruts, les fichiers sources numériques supportant les Tables 2, 3, 4, 5, 6, 7 et 8, ainsi que les figures 5, 6, 7, 8, 9 et 10, les poids des modèles entraînés et le code source ont été déposés dans figshare sous DOI : 10.6084/m9.figshare.32906765. L’enregistrement figshare fournit les données brutes complètes nécessaires pour reproduire les tableaux quantitatifs et les chiffres rapportés dans ce manuscrit. Le dépôt contient les masques de prédiction, les fichiers d’évaluation des frontières, les scripts de calcul métrique, les points de contrôle des modèles et les fichiers sources de tables utilisés pour le mIoU rapporté, Boundary F1, PixelAcc, MeanAcc, les analyses de complexité computationnelle, de robustesse, de validation de la fonction de perte et de sensibilité des partitions de nœuds.

figure-results-1
Figure 1 : Comparaison des effets de discontinuité sémantique et de réparation structurelle antérieure dans des scénarios complexes d’occlusion intérieure. (A) Image RVB originale avec une occlusion de mobilier à grande échelle. (B) Sortie du modèle de base traditionnel mettant en évidence la distorsion physique des frontières et les défauts de discontinuité sémantique. (C) Sortie de la méthode proposée avec une superposition de perspective en pointillés cyan qui cartographie explicitement le squelette 3D du bâtiment pour la réparation topologique des éléments endommagés de la structure sous-jacente. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-2
Figure 2 : Cadre global d’analyse sémantique guidé par la construction de priors structurels. Le diagramme décrit le pipeline complet depuis l’entrée de l’image RGB, passant par la branche d’extraction des caractéristiques visuelles décalée par fenêtre et la branche d’extraction antérieure de la structure, jusqu’au module d’attention croisée guidé par la structure, suivi du raisonnement topologique via le GCN superpixel, et enfin le décodage dans la carte sémantique dense. Des mises en page détaillées du calcul de la matrice d’affinité d’attention, du passage de messages graphiques et des fonctions de perte d’optimisation conjointe sont présentées à droite. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-3
Figure 3 : Organigramme de la construction de la matrice d’affinité et de la connectivité topologique. Le graphique détaille la chaîne de cartographie mathématique étape par étape, montrant la transformation de la carte de distance d’entrée et des paires de pixels sélectionnées, à travers l’extraction continue de caractéristiques géométriques potentielles et l’évaluation de la cohérence du gradient, vers la matrice d’affinité normalisée utilisée comme biais spatial explicite pour le mécanisme d’attention croisée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-4
Figure 4 : Schéma de projection et agrégation de caractéristiques par convolution de graphe superpixel. Le panneau détaille le processus de raisonnement topologique non euclidien : (A) des caractéristiques denses des pixels montrant la matrice locale des caractéristiques d’origine et les frontières de regroupement des superpixels ; (B) construction topologique de graphe superpixel, associant la grille régulière à des nœuds discrets et des arêtes physiquement connectées ; (C) passage convolutif de messages de graphe effectuant l’agrégation directionnelle des caractéristiques locales ; et (D) la rétroprojection de coordonnées présentant les caractéristiques de cohérence sémantique macroscopique restaurées sur la grille dense. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-5
Figure 5 : Diagramme qualitatif de grille de comparaison. La matrice fournit une évaluation visuelle des performances à travers différentes scènes intérieures rangées par rangées, comparant les entrées RGB intérieures originales et les dispositions de la vérité du terrain avec les sorties de la base de segmentation basée sur l’attention du masque, de la base d’agrégation de caractéristiques intermodale, de la base progressive de fusion de caractéristiques, et de la méthode proposée, qui restaure avec succès les coins occultés et aligne les surfaces portantes. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-6
Figure 6 : Résultats d’ablation pour l’intégration cumulative des modules. Le graphique à double axe montre l’évolution progressive des performances à travers différents paramètres d’ablation modulaire, en traçant la trajectoire ascendante constante de l’intersection moyenne sur union (mIoU) sous forme de barres et le score F1 de la frontière structurelle sous forme de graphique linéaire allant de la base jusqu’à l’ensemble du cadre. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-7
Figure 7 : Complexité computationnelle, temps d’entraînement et distribution de l’efficacité d’inférence. Le graphique multidimensionnel des bulles révèle les compromis entre la surcharge computationnelle et la précision de l’analyse syntatique. L’axe horizontal mesure les opérations en virgule flottante (FLOP), l’axe vertical indique le mIoU, la taille de la bulle représente l’échelle des paramètres entraînables, et les étiquettes de texte adjacentes indiquent la latence d’inférence d’une seule trame pour chaque architecture réseau. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-8
Figure 8 : Histogramme de la précision aux limites et des scores métriques sous différentes configurations de fonction de perte. Le graphique à barres groupé compare les effets moteurs de diverses stratégies d’optimisation sur la logique spatiale sous-jacente, illustrant les gains significatifs en mIoU et en score F1 de la limite structurelle obtenus en passant des formulations standard d’entropie croisée à la perte de cohérence structurelle proposée. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-9
Figure 9 : graphique linéaire montrant la relation entre la sévérité de l’occlusion et la décroissance des performances. La courbe suit la dégradation de la précision à travers différents paradigmes d’extraction de caractéristiques sous des niveaux d’occlusion doux, modéré et sévère, mettant en lumière la robuste stabilité topologique et la capacité anti-interférence du cadre guidé par la structure proposé comparé aux bases purement pilotées par les pixels. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-10
Figure 10 : Analyse de sensibilité de l’échelle des nœuds superpixels. Le graphique statistique biaxial illustre le compromis entre la vitesse de traitement matériel et la précision du raisonnement logique selon les tailles de partition des graphes, montrant comment le nombre de nœuds superpixels affecte les métriques de précision et conduit à une forte augmentation du temps moyen d’inférence. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Numérotation de la couche réseauDimension de la caractéristique du nœud d’entréeDimension des caractéristiques du nœud de sortieRéglage de probabilité d’inactivation aléatoire
15122560.15
22562560.15
32561280.1
4128640.05

Tableau 1 : Table de configuration des hyperparamètres de l’architecture réseau pour le module d’inférence convolutionnelle. Le tableau indique la numérotation de la couche réseau, les dimensions des caractéristiques des nœuds d’entrée, des dimensions des caractéristiques des nœuds de sortie et les paramètres de probabilité d’inactivation aléatoire utilisés dans le réseau de raisonnement graphique.

Élément de configurationBenchmark 3D intérieur à grande échelleRéférence RGB-D pour scènes intérieures
Identifiant officiel de la versionScanNet v2Jeu de données de profondeur NYU V2
Échantillons d’entraînement utilisés dans cette étude1201 scènes795 images
Échantillons de validation ou d’essai utilisés pour l’évaluation312 scènes de validation654 images de test
Catégories sémantiques totales2040
Résolution de l’image d’entrée512 × 512512 × 512
Taux d’apprentissage initial0.00010.0001
Nombre d’échantillons d’entrée par lots88
Coefficient de désintégration de poids0.010.01
Époques totales de formation300300
Nombre de parcours indépendants55

Tableau 2 : Répartition expérimentale des jeux de données et configuration unifiée des hyperparamètres d’entraînement. Le tableau rapporte les paramètres de partitionnement des échantillons d’échantillons RGB-D pour les ensembles de données 3D intérieures et RGB-D, le nombre sémantique de catégories, le taux d’apprentissage, le nombre d’échantillons en batch, le taux de décroissance du poids et le nombre total d’itérations d’entraînement.

Architecture du modèle réseaumIoUFrontière F1PixelAccMeanAcc
SegFormer0,596 ± 0,0030,635 ± 0,0040,838 ± 0,0030,704 ± 0,004
ConvNeXt UperNet0,604 ± 0,0030,642 ± 0,0040,846 ± 0,0030,713 ± 0,004
Mask2Former0,612 ± 0,0030,654 ± 0,0040,853 ± 0,0030,721 ± 0,004
OneFormer0,621 ± 0,0020,663 ± 0,0030,861 ± 0,0030,733 ± 0,003
MaskDINO0,628 ± 0,0020,667 ± 0,0030,869 ± 0,0030,741 ± 0,003
CCANet0,635 ± 0,0030,671 ± 0,0040,876 ± 0,0030,745 ± 0,004
InternImage UperNet0,641 ± 0,0020,692 ± 0,0030,884 ± 0,0020,756 ± 0,003
CMPFFNet0,658 ± 0,0020,712 ± 0,0030,891 ± 0,0020,773 ± 0,003
SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Tableau 3 : Comparaison quantitative globale des bases d’analyse des scènes intérieures sur le jeu de validation des scènes intérieures RGB-D. Le tableau rapporte mIoU, score F1 de la frontière, précision globale des pixels et précision de classe moyenne pour la base de segmentation basée sur l’attention masquée, la base d’agrégation de caractéristiques intermodale, la base de fusion progressive des caractéristiques, ainsi que l’architecture de réseau guidée par structure proposée.

Configuration de l’architecture réseaumIoUFrontière F1PixelAccMeanAcc
Colonne vertébrale à fenêtre décalée de base0,615 ± 0,0030,630 ± 0,0040,842±0,0030,706 ± 0,004
Colonne vertébrale plus attention croisée guidée par la structure0,648 ± 0,0030,685 ± 0,0040,874 ± 0,0030,748 ± 0,004
Raisonnement de la colonne vertébrale plus graphe superpixel0,641 ± 0,0030,676 ± 0,0040,868 ± 0,0030,741 ± 0,004
Perte de consistance de la colonne vertébrale plus structure0,632 ± 0,0030,662 ± 0,0040,859 ± 0,0030,732 ± 0,004
Colonne vertébrale plus attention croisée et raisonnement graphique0,669 ± 0,0020,721 ± 0,0030,897 ± 0,0020,782 ± 0,003
Colonne vertébrale plus attention croisée et perte de cohérence structurelle0,660 ± 0,0020,713 ± 0,0030,889 ± 0,0020,773 ± 0,003
Raisonnement de la colonne vertébrale plus graphe et perte de cohérence structurelle0,653 ± 0,0030,704 ± 0,0030,881 ± 0,0030,765 ± 0,003
Modèle complet sans biais additif de champ à distance signée0,656 ± 0,0030,698 ± 0,0040,884 ± 0,0030,761 ± 0,004
Modèle complet sans pondération structurelle adaptative λ0,671 ± 0,0020,736 ± 0,0030,904 ± 0,0020,792 ± 0,003
Modèle complet sans contrainte d’arête coplanaire0,666 ± 0,0020,728 ± 0,0030,899 ± 0,0020,786 ± 0,003
Modèle complet sans normalisation de graphe symétrique0,673 ± 0,0020,737 ± 0,0030,906 ± 0,0020,795 ± 0,003
Pleine SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Tableau 4 : Analyse quantitative étendue des composants principaux. Le tableau rapporte l’intégration cumulée des modules, les combinaisons par deux modules et les réglages de suppression des composants afin de quantifier les contributions indépendantes et coopératives de l’attention croisée guidée par la structure, du biais de champ à distance signée, de la pondération structurelle adaptative, du raisonnement sur les graphes superpixels, de la construction coplanaire des arêtes, de la normalisation symétrique des graphes et de la perte de cohérence structurelle.

Architecture du modèle réseauParamètresFLOPsMémoire de picTemps d’entraînementTemps d’inférenceFPSmIoUFrontière F1
SegFormer83,7 M80,1 G6,1 Go10,6 h44 ms22.70.5960.635
ConvNeXt UperNet60,2 M91,5 G6,4 Go11,2 h47 ms21.30.6040.642
Mask2Former44,0 M74,6 G5,8 Go9,4 h41 ms24.40.6120.654
OneFormer64,1 M103,2 G7,0 Go12,9 h55 ms18.20.6210.663
MaskDINO52,8 M96,8 G6,8 Go12,1 h52 ms19.20.6280.667
CCANet63,5 M118,7 G7,6 Go14,8 h67 ms14.90.6350.671
InternImage UperNet70,4 M112,3 G7,4 Go14,2 h64 ms15.60.6410.692
CMPFFNet58,9 M104,6 G7,1 Go13,1 h59 ms16.90.6580.712
SGCA_GCN66,8 M121,4 G7,9 Go15,6 h61 ms16.40.6870.764

Tableau 5 : Complexité computationnelle, temps d’entraînement et comparaison de l’efficacité d’inférence avec la précision globale de l’ensemble de validation. Le tableau rapporte les paramètres entraînables, les opérations en virgule flottante, l’utilisation maximale de la mémoire, le temps d’entraînement pour 300 époques, la latence d’inférence sur une seule trame, les trames par seconde, le mIoU et le score F1 de la limite pour la méthode proposée et les réseaux de comparaison.

Configuration de la fonction de pertemIoUFrontière F1
Entropie croisée (EC) uniquement0.6690.721
EC + Frontière av. J.-C.0.6740.738
CE + Perte inverseForm0.6810.752
CE + Nous, SCL0.6870.764

Tableau 6 : Comparaison quantitative de la validation de la fonction de perte. Le tableau rapporte le score mIoU et F1 de la frontière sous la perte d’entropie croisée, la perte binaire d’entropie croisée de bord, la perte par transformation inverse, ainsi que la perte de cohérence structurelle proposée.

Architecture du modèle algorithmiqueOcclusion légèreOcclusion modéréeOcclusion sévèreEnsemble d’anomalies hors ManhattanSous-ensemble texture-interférence
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

Tableau 7 : Analyse de robustesse spécifique à sous-ensemble de la distribution extrême d’occlusion et des structures non-Manhattan. Le tableau rapporte les changements de précision de l’analyse syntaxique entre les sous-ensembles de l’occlusion légère, de l’occlusion modérée, de l’occlusion sévère, de l’illumination difficile, de l’interférence de texture et des non-anomalies de Manhattan.

Nombre de nœuds à superéchellemIoUFrontièreF1Temps moyen d’inférence (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

Tableau 8 : Analyse de sensibilité spatiale de l’échelle de partition de nœud dans un graphe topologique. Le tableau rapporte le mIoU, le score F1 de la frontière structurelle, et le temps moyen d’inférence à travers différents paramètres de partition de nœuds superpixels.

Discussion

L’algorithme de cet article couple étroitement les caractéristiques visuelles hiérarchiques capturées par un encodeur transformateur hiérarchique à fenêtre décalée avec la profondeur préalable de la boîte englobante 3D Manhattan générée par la détection de segments de ligne, permettant ainsi une reconstruction sémantique à haute précision de scènes intérieures complexes. Un mécanisme d’attention croisée guidé par la structure force le signal visuel à s’aligner avec la véritable frontière géométrique calibrée par la SDF, restaurant ainsi la continuité des caractéristiques de faible niveau dans les zones localementoccluses 42. Un graphe topologique est construit à partir de nœuds superpixels générés par un algorithme de clustering local itératif, qui permet à un GCN d’effectuer l’agrégation de caractéristiques sous contraintes physiques coplanaires, assurant la cohérence de la distribution sémantiquemacroscopique 43. Les résultats expérimentaux montrent que la méthode atteint un ratio moyen d’intersection sur union de 68,7 % avec un écart-type de 0,2 %, une valeur d’ingénierie pratique, un score F1 de 76,4 % sur la frontière structurelle avec un écart-type de 0,3 %, et un temps d’inférence moyen de 61 ms avec une configuration de 256 nœuds superpixels, reflétant un compromis délibéré privilégiant la précision de la reconstruction des limites plutôt que l’efficacité d’inférenceultime 44. Les tests de robustesse démontrent également que le modèle présente de fortes capacités de réparation topologique dans des conditions extrêmes de perte visuelle à grande échelle. En introduisant une perte de cohérence structurelle, la précision de l’alignement du masque prédit avec la limite physique à distance nulle calibrée par le SDF est améliorée, obtenant une optimisation synergique de la complexité computationnelle et de la qualité d’analysesyntaxique 45. Ce schéma propose une approche de fusion de caractéristiques basée sur les lois de l’espace tridimensionnel et démontre une cohérence logique dans la réparation topologique lorsqu’il s’agit d’une occlusion de mobilier à grande échelle et d’une distorsion physiquedes frontières 46. Les résultats de la recherche fournissent un cadre robuste de contraintes physique-géométriques pour le raisonnement spatial intelligent et la reconstruction 3D à haute précision, et ont une valeur d’ingénierie pratique pour la navigation visuelle robotique et les tâches de reconnaissance de scènes dans des environnements physiques réels.

Le mécanisme de dérivation géométrique de la topologie, qui dépend fortement de l’hypothèse du monde de Manhattan, souffre d’un biais d’ajustement lorsqu’il s’agit d’espaces architecturaux irréguliers avec des murs courbés ou des frontières nonorthogonales 47. Pour surmonter ce goulot d’étranglement de modélisation géométrique, les itérations réseau ultérieures intégreront des algorithmes d’ajustement de surface polynomiaux multi-degrés et des modules d’extraction de courbes rationnelles B-splines non uniformes dans la branche physique à priori. Cette stratégie universelle de modélisation spatiale traduit des lignes orthogonales rigides en frontières topologiques dynamiquement déformables, améliorant ainsi continuellement la précision d’analyse syntaxique de l’algorithme dans des configurations spatiales intérieures anormales.

L’extraction géométrique a priori repose sur le détecteur de segments de ligne de base, ce qui rend le système vulnérable à la distorsion du masque structurel lors du traitement de scènes intérieures dominées par des matériaux réfléchissantsou transparents 48. La perte de cohérence structurelle invoque directement la SDF générée par ce détecteur, établissant une boucle de dépendance fermée entre l’extraction préalable et l’optimisation du gradient. Lorsque les interférences visuelles déclenchent des détections anormales de segments de ligne, les coordonnées géométriques défectueuses sont mappées dans la SDF et directement amplifiées par la perte de cohérence structurelle lors de la rétropropagation, forçant ainsi les paramètres du réseau à correspondre à des frontières physiquesincorrectes 49. Les itérations algorithmiques ultérieures introduiront des branches de fusion adaptatives multimodales pour ingérer des cartes de profondeur profondes et des données radiométriques infrarouges, découplant ainsi la perception structurelle géométrique des contraintes d’illumination en lumière visible et élargissant la frontière de raisonnement spatial dans des environnements optiques extrêmes.

Pour résoudre le goulot d’étranglement de sensibilité aux performances causé par l’échelle fixe des nœuds superpixels, des recherches ultérieures concevront un module de pooling de graphes adaptatif et apprenable qui détermine dynamiquement le schéma de partitionnement des nœuds en fonction de la complexité de l’image, éliminant ainsi la dépendance du réseau à l’ajustement manuel des hyperparamètres. Pour répondre aux limitations de déploiement matériel causées par la surcharge computationnelle du réseau de graphes superpixels, les plans d’optimisation futurs introduiront des mécanismes légers de découplage des caractéristiques et des modules d’agrégation à portes pour compresser l’échelle des paramètres et accélérer les opérations matricielles de la branche précédentegéométrique 50.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont pas de conflits d’intérêts financiers.

Remerciements

Financement : Programme clé de recherche et développement du Shaanxi (Programme n° 2024 CY2-GJHX-76).

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

Références

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

A priori de structure de b timentTransformeur hi rarchiqueD tection de segments de ligneBo te englobante 3D de ManhattanChamp de distance sign eM canisme d attention crois eR seau convolutionnel sur graphePerte de coh rence structurelle

Articles connexes