Les ensembles de données de scènes RVB intérieures et leurs annotations sémantiques ont été préparés avant l’entraînement réseau. Les grands ensembles de données 3D intérieures et RGB-D sur les scènes intérieures (voir le tableau des matériaux) ont été obtenus à partir de leurs dépôts officiels. Les scènes d’acquisition intérieures contenant l’occlusion du mobilier, la variation de l’éclairage, l’interruption des limites des murs et des dispositions spatiales complexes ont été conservées pour correspondre au scénario d’analyse cible. Les étiquettes sémantiques ont été converties en masques d’annotation PNG indexés à canal unique, et toutes les images RVB ainsi que les masques sémantiques ont été redimensionnés à 512 × 512 pixels. L’augmentation des données en ligne a été appliquée pendant l’entraînement, avec un basculement horizontal aléatoire à une probabilité de 0,5, une échelle de luminosité aléatoire entre 0,8 et 1,2, et une rotation aléatoire entre −10° et +10° pour élargir la distribution de la disposition structurelle. Les canaux RVB ont été normalisés avec des valeurs moyennes de 0,485, 0,456 et 0,406 et des valeurs d’écart-type de 0,229, 0,224 et 0,225. Le benchmark 3D intérieur à grande échelle a suivi la répartition officielle de la version utilisée dans cette étude, avec 1201 scènes d’entraînement et 312 scènes de validation pour le développement et la validation du modèle. Le benchmark RGB-D de scène intérieure a suivi le protocole d’évaluation officiel, avec 795 images d’entraînement et 654 images de test. Aucune répartition supplémentaire basée sur les pourcentages n’a été appliquée à ces deux références publiques.
Un réseau visuel de transformateur hiérarchique à fenêtre décalée (voir le tableau des matériaux) a été initialisé comme le réseau dorsal des encodeurs de transformateurs à fenêtre mobile. La taille de l’embedding du patch était configurée à 4 x 4 pixels. Les dimensions d’immersion des quatre étages hiérarchiques ont été réglées à 128, 256, 512 et 1024, et le nombre de blocs transformateurs dans les quatre étages a été fixé à 2, 2, 18 et 2. La taille de la fenêtre d’attention locale était fixée à 7 x 7, et le nombre de têtes d’attention était fixé à 4, 8, 16 et 32 pour les quatre étapes hiérarchiques. Des fonctions d’activation continue non linéaires étaient utilisées à l’intérieur de toutes les couches de perceptron multicouches. Le downsampling spatial a été réalisé par des opérations de fusion de patchs avec un pas de 2 à chaque étape hiérarchique. L’architecture du réseau central et les hyperparamètres du module d’inférence convolutionnelle ont été résumés dans le tableau 1.
L’extraction des caractéristiques d’auto-attention par fenêtre décalée a ensuite été effectuée sur les cartes de caractéristiques d’entrée. Chaque carte de caractéristiques était divisée en fenêtres locales non superposées avec des dimensions spatiales de 7 × 7. L’attention de fenêtre régulière et celle de fenêtre décalée étaient alternées entre des blocs de transformateurs à fenêtre décalée adjacents. La distance de décalage cyclique était réglée à 3 pixels, et un encodage de biais positionnel relatif était appliqué dans chaque fenêtre d’attention locale. Les caractéristiques visuelles locales ont été agrégées via l’auto-attention multi-têtes pour générer des représentations hiérarchiques et multi-échelles.
Les priors structurels de Manhattan ont été extraits d’images RVB intérieures. Les segments structuraux des arêtes ont été détectés à l’aide d’un algorithme de détection de segments de ligne à consistance gradient-direction. Les directions structurelles dominantes ont été regroupées via un algorithme de consensus aléatoire d’échantillon (RANSAC) (voir le tableau des matériaux) basé sur l’estimation du point d’arrivée. Trois directions Manhattan mutuellement orthogonales ont été reconstruites pour générer la représentation de la boîte englobante 3D de Manhattan. La frontière structurelle reconstruite a été convertie en une carte SDF en calculant la distance euclidienne minimale de chaque pixel au segment de ligne de limite le plus proche.
Les caractéristiques d’attention croisée guidées par la structure ont été générées après l’obtention des éléments visuels et des précédents SDF. La variété de caractéristiques visuelles a été mappée au tenseur d’interrogation Q via la matrice de transformation linéaire W sous-élément Q de la capsule à double frappe R, puis à la matrice de formation W sous-élément Q de la double coupe R à la matrice
de formation. Le champ de distance continue précédent a été mappé au tenseur clé K et au tenseur de valeur V via les matrices
de transformation , et la dimension du modèle a été fixée à 512. La modulation multi-têtes divisait l’espace de projection en 8 sous-espaces indépendants, chaque tête ayant une dimension de 64. La disposition spatiale antérieure projetait des coordonnées discrètes de pixels dans un champ potentiel continu et générait la matrice d’affinité structurelle S comme un biais spatial additif explicite pour moduler la matrice de similarité du produit scalaire. Le tenseur des caractéristiques visuelles a été utilisé comme source de requête car l’analyse sémantique exige que chaque emplacement visuel récupère activement des preuves structurellement cohérentes de l’espace a priori géométrique. Le SDF prior a été utilisé comme source clé et de valeur car il stocke la distance continue des limites et les indices structurels intérieur-extérieur dérivés de la disposition Manhattan. Le terme produit scalaire mesurait la compatibilité entre l’apparence sémantique et le prior géométrique, tandis que le terme structurel additif λS déplaçait les poids de l’attention vers des pixels sur le même plan physique ou près du même contour architectural. Le coefficient λ représentait la confiance dans le prior structurel extrait et contrôlait dans quelle mesure les contraintes orthogonales rigides étaient intégrées dans la distribution d’attention. Cette formulation réduisait la diffusion transfrontalière des caractéristiques causée par l’occlusion du mobilier et conservait la relaxation adaptative dans les agencements hors Manhattan. La distribution de l’attention guidée par la structure a été calculée selon l’équation 1.
Équation 1 : 
où A désigne la matrice d’agrégation de l’attention guidée par la structure, Q désigne le tenseur de requête généré à partir de caractéristiques visuelles, K désigne le tenseur clé généré à partir des caractéristiques antérieures SDF, V désigne le tenseur de valeur généré à partir de représentations a priori structurales, dk désigne la dimension des caractéristiques du tenseur clé, λ désigne le coefficient de pondération structurelle adaptatif utilisé pour identifier la confiance géométrique des régions locales et relâcher les contraintes orthogonales rigides dans des espaces non-Manhattan et S désigne la matrice d’affinité SDF. La division par dk a stabilisé l’échelle des logits d’attention et empêché que les grandes dimensions des caractéristiques ne produisent des poids d’attention surconcentrés. La fonction exponentielle normalisée (voir le tableau des matériaux) transformait les scores de similarité modulés en une distribution spatiale normalisée, permettant à chaque pixel d’agréger des informations structurelles a priori en fonction de la cohérence sémantique et géométrique. Ce design explique pourquoi les priors de l’apparence visuelle et des limites architecturales sont fusionnés au niveau de l’attention plutôt que par une concaténation directe de caractéristiques.
Le graphe topologique des superpixels a été construit à partir de la carte de caractéristiques alignée sur la structure. La carte des caractéristiques était segmentée à l’aide d’un algorithme de génération de régions spatiales. Le nombre de superpixels était fixé à 256, le coefficient de compacité à 10, le coefficient de lissage gaussienne à 1,0, et le nombre d’itération à 10. Les contraintes de proximité spatiale étaient appliquées en fixant le poids métrique de distance à un rapport constant de 1,0 à la distance colorimétrique des caractéristiques lors du clustering, maintenant ainsi une génération uniforme de nœuds sur les frontières denses de clac. Les pixels avec des réponses sémantiques homogènes ont été agrégés en nœuds superpixels. Les arêtes des graphes ont été construites selon les relations d’adjacence spatiale, la force d’affinité SDF et les contraintes de cohérence géométrique coplanaire. Le processus de construction de la matrice d’affinité structurelle et de la connectivité topologique est montré à la Figure 3, qui montre comment la guidance SDF a été transformée en relations spatiales au niveau des graphes.
La formulation graphe a été introduite pour convertir le raisonnement dense pixel par pixel en raisonnement spatial nœud par nœud sur des régions structurelles homogènes. Chaque nœud superpixel représentait une région locale avec une réponse sémantique et une continuité spatiale similaires, tandis que chaque arête représentait un chemin fiable pour la transmission de caractéristiques soumis aux contraintes d’adjacence, d’affinité de champ de distance et de coconsistance coplanaire. Cette conception réduisait l’influence des pixels bruyants isolés et permettait aux zones obstruées des murs, des planchers et des plafonds de recevoir des messages provenant de nœuds physiquement adjacents. La construction des arêtes servait donc de pont mathématique entre le guidage SDF continu et le raisonnement discret non euclidien sur les graphes.
Un réseau de raisonnement convolutionnel à trois couches a été configuré avec des dimensions de caractéristiques cachées de 512, 256 et 128. La couche convolutionnelle du graphe effectuait un lissage des caractéristiques sur la structure du graphe en fonction des relations spatiales entre les nœuds. L’adjacence en boucle propre a conservé l’état original de chaque nœud lors du passage des messages, empêchant que les caractéristiques d’une petite région structurelle soient effacées par les grandes régions environnantes. La normalisation symétrique a mis à l’échelle les éléments de la matrice d’adjacence par le produit des racines carrées inverses des degrés des nœuds, de sorte que les nœuds de haut et de bas degré contribuaient sous des magnitudes numériques comparables lors de la propagation. La propagation en avance effectuait une agrégation spatiale localisée, dans laquelle chaque état de nœud absorbait des caractéristiques de haute dimension provenant de groupes coplanaires adjacents avant que la fonction de rectification non linéaire par élément ne soit appliquée. Cette formulation faisait que la couche de convolution de graphe approchait la diffusion sémantique le long de plans intérieurs physiquement significatifs plutôt qu’un lissage illimité sur les frontières d’objets non liés. Les caractéristiques des nœuds graphiques ont été évaluées selon l’équation 2.
Équation 2 : 
La projection des caractéristiques denses des pixels vers les nœuds superpixels, le passage de messages par convolution graphique, et la rétroprojection des coordonnées sont présentées dans la Figure 4, clarifiant le chemin d’agrégation des caractéristiques des grilles d’images régulières vers une topologie non euclidienne, puis de retour à une représentation sémantique dense. La projection des caractéristiques de pixels denses dans la Figure 4A vers les nœuds superpixels de la Figure 4B, le passage du message graphe-convolution dans la Figure 4C, et la rétroprojection des coordonnées dans la Figure 4D clarifient le chemin d’agrégation des caractéristiques des grilles d’images régulières vers une topologie non euclidienne, puis de retour à une représentation sémantique dense.
où H(l) désigne le tenseur de caractéristiques du nœud de la l-ième couche de convolution du graphe, Â désigne la matrice d’adjacence avec des connexions à auto-boucle, D désigne la matrice des degrés correspondant à la matrice d’adjacence, W(l) désigne la matrice de poids apprenable de la l-ième couche de convolution du graphe, et σ désigne la fonction d’activation de l’unité linéaire rectifiée. Le terme ÂH(l) agrégeait des caractéristiques provenant des nœuds superpixels adjacents, tandis que D−1/2 et D−1/2 équilibraient la contribution des nœuds avec différentes densités de connexion. La matrice apprenable W(l) projetait des caractéristiques agrégées dans un nouvel espace sémantique, permettant à la couche graphe de distinguer la cohérence structurelle de la proximité spatiale ordinaire. L’activation non linéaire a préservé la différence de réponses entre les régions coplanaires et non coplanaires après l’agrégation des caractéristiques.
Les caractéristiques de segmentation sémantique ont été décodées après le raisonnement des graphes. Le décodeur a été construit à l’aide de trois étages d’upsampling d’interpolation bilinéaire et d’opérations de fusion par connexion inter-couche. Les caractéristiques peu profondes des encodeurs spatiaux étaient concaténées avec des caractéristiques sémantiques de haut niveau par fusion canal. La résolution des caractéristiques a été rétablie à la taille originale de l’image, et la carte finale de prédiction sémantique des probabilités a été générée via une couche de convolution 1 × 1.
Le réseau d’analyse sémantique complet a été entraîné à l’aide d’un optimiseur de désintégration poids découplé (voir le tableau des matériaux). Le taux d’apprentissage initial a été fixé à 0,0001, le coefficient de désintégration pondérative à 0,01, et la taille du lot à 8 pour les deux benchmarks publics. Le taux de désintégration du premier moment était fixé à 0,9, le taux de désintégration du second moment à 0,999, et le coefficient de stabilité numérique de l’épsilon était fixé à 1 × 10⁻8. La perte de validation était surveillée à la fin de chaque époque, et les points de contrôle étaient sauvegardés lorsque le mIoU sur l’ensemble de validation augmentait. Le réseau a été entraîné pendant 300 époques en utilisant une stratégie de désintégration du taux d’apprentissage polynomial avec une puissance de décroissance de 0,9. Cinq entraînements indépendants ont été réalisés en utilisant différentes initialisations de graines aléatoires afin d’établir une base d’évaluation statistiquement rigoureuse. Le réseau a été optimisé conjointement en utilisant la perte d’entropie croisée au niveau des pixels et la perte de cohérence structurelle. Toutes les expériences ont été réalisées sur une plateforme informatique équipée de matériel de calcul parallèle à haute mémoire, et des informations matérielles détaillées ont été rapportées dans le Table of Materials.
L’optimisation conjointe imposait l’alignement géométrique des frontières en calculant la magnitude du gradient spatial du tenseur de probabilité de classe. La perte de cohérence structurelle a été utilisée comme régularisateur, multipliant la norme des gradients de prédiction spatiale par les valeurs SDF continues. La logique mathématique était que les changements de catégories sémantiques devaient se concentrer près des contours architecturaux réels, où la SDF tendait vers zéro, tandis que les intérieurs plats des murs, des sols et des plafonds devaient maintenir des réponses sémantiques lisses. Lorsqu’un grand gradient de prédiction apparaissait loin d’une frontière structurelle, le terme du champ de distance augmentait la pénalité et décourageait les fausses transitions sémantiques à l’intérieur d’un plan physique homogène. Lorsqu’un gradient de prédiction apparaissait près d’un contour de distance nulle, la pénalité restait limitée et préservait les transitions de classe légitimes le long des frontières architecturales. Les régions de transition sémantiques étaient contraintes à s’aligner avec les contours de distance nulle de la SDF, comme indiqué par l’équation 3.
Équation 3 : 
où Ltotal désigne la fonction objectif d’optimisation finale, Lce désigne la perte d’entropie croisée au niveau des pixels, Lscl désigne la perte de pénalité de cohérence structurelle, et α désigne le coefficient de pondération de perte structurelle. Le terme cross-entropie offrait une supervision sémantique au niveau des pixels via des masques d’annotage, tandis que le terme de cohérence structurelle imposait une régularisation géométrique à l’aide de priors architecturaux. Le coefficient de pondération α la reconnaissance équilibrée des catégories et l’alignement des frontières, empêchant l’optimisation de surajuster la précision locale des étiquettes ou les contours structurels rigides. Cet objectif commun reliait la sémantique visuelle, la cohérence physique des frontières et les paramètres du réseau entraînables au sein d’une cible d’optimisation unifiée.