Indoor-RGB-Szenen-Datensätze und ihre semantischen Annotationen wurden vor dem Netzwerktraining vorbereitet. Der groß angelegte 3D-Datensatz für den Innenraum und der RGB-D-Datensatz für Innenszenen (siehe die Materialtabelle) wurden aus ihren offiziellen Repositorien bezogen. Innenraum-Aufnahmeszenen mit Möbelverschluss, Beleuchtungsvariationen, Unterbrechung von Wandgrenzen und komplexen räumlichen Layouts wurden beibehalten, um dem Ziel-Parsing-Szenario zu entsprechen. Semantische Labels wurden in indexierte Einzelkanal-PNG-Annotationsmasken umgewandelt, und alle RGB-Bilder und semantischen Masken wurden auf 512 × 512 Pixel verkleinert. Während des Trainings wurde eine Online-Datenerweiterung angewendet, mit zufälligem horizontalen Umdrehen bei einer Wahrscheinlichkeit von 0,5, zufälliger Helligkeitsskalierung zwischen 0,8 und 1,2 sowie zufälliger Rotation zwischen −10° und +10°, um die strukturelle Layoutverteilung zu erweitern. RGB-Kanäle wurden mit Mittelwerten von 0,485, 0,456 und 0,406 sowie Standardabweichungswerten von 0,229, 0,224 und 0,225 normalisiert. Der groß angelegte 3D-Benchmark in Innenräumen folgte der offiziellen Veröffentlichungsaufteilung in dieser Studie, mit 1201 Trainingsszenen und 312 Validierungsszenen für Modellentwicklung und Validierung. Der RGB-D Indoor-Szenen-Benchmark folgte dem offiziellen Bewertungsprotokoll mit 795 Trainingsbildern und 654 Testbildern. Auf diese beiden öffentlichen Benchmarks wurde keine zusätzliche prozentuale Aufteilung angewandt.
Ein visuelles Backbone-Netzwerk für einen hierarchischen Transformer mit verschobenem Fenster (siehe die Materialtabelle) wurde als Backbone des moving-window-Transformator-Encoders initialisiert. Die Größe der Patch-Einbettung war auf 4 x 4 Pixel konfiguriert. Die Einbettungsmaße der vier hierarchischen Stufen wurden auf 128, 256, 512 und 1024 gesetzt, und die Anzahl der Transformatorblöcke in den vier Stufen wurde auf 2, 2, 18 und 2 gesetzt. Die Größe des lokalen Aufmerksamkeitsfensters wurde auf 7 x 7 gesetzt, und die Anzahl der Aufmerksamkeitsköpfe auf 4, 8, 16 und 32 für die vier hierarchischen Stufen. In allen mehrschichtigen Perzeptronschichten wurden nichtlineare kontinuierliche Aktivierungsfunktionen verwendet. Das räumliche Downsampling erfolgte durch Patch-Merging-Operationen mit einem Schritt von 2 nach jeder hierarchischen Stufe. Die Kernnetzwerkarchitektur und die Hyperparameter des Faltungsinferenzmoduls wurden in Tabelle 1 zusammengefasst.
Anschließend wurde auf den Eingabe-Merkmalskarten die Extraktion der Self-Attention-Merkmale im verschobenen Fenster durchgeführt. Jede Merkmalskarte wurde in nicht überlappende lokale Fenster mit räumlichen Maßen 7 × 7 unterteilt. Regelmäßige Fensterbetreuung und verschobene Fenster wurden zwischen benachbarten Transformatorblöcken mit verschobenen Fenstern abwechselnd. Der zyklische Verschiebungsabstand wurde auf 3 Pixel gesetzt, und innerhalb jedes lokalen Aufmerksamkeitsfensters wurde eine relative Positionsbias-Codierung angewendet. Lokale visuelle Merkmale wurden über Multi-Head-Selbstaufmerksamkeit aggregiert, um hierarchische, multiskalierte Merkmalsrepräsentationen zu erzeugen.
Strukturelle Vorpriore in Manhattan wurden aus Indoor-RGB-Bildern extrahiert. Strukturelle Kantensegmente wurden mit einem Gradient-Richtung-Konsistenz-Liniensegment-Erkennungsalgorithmus erkannt. Dominante strukturelle Richtungen wurden durch einen RANSAC-Algorithmus (RANSAC) gruppiert (siehe Materialtabelle) basierend auf der Verschwindepunktschätzung. Drei sich gegenseitig orthogonale Manhattan-Richtungen wurden rekonstruiert, um die Manhattan 3D-Begrenzungsbox-Darstellung zu erzeugen. Die rekonstruierte strukturelle Grenze wurde in eine SDF-Karte umgewandelt, indem der minimale euklidische Abstand von jedem Pixel zum nächstgelegenen Grenzliniensegment berechnet wurde.
Strukturgesteuerte Cross-Attention-Merkmale wurden generiert, nachdem die visuellen Merkmale und SDF-Priors erfasst worden waren. Die visuelle Merkmaligfaltigkeit wurde über die lineare Transformationsmatrix W Sub Q der doppelt durchgestrichenen Kappe R auf die Formationsmatrix W sub Q der doppelt durchgestrichenen Kappe R auf die Formationsmatrix
abgebildet. Das stetige Distanzfeld zuvor wurde über die Transformationsmatrizen
auf den Schlüsseltensor K und den Werttensor V abgebildet, und die Modelldimension wurde auf 512 gesetzt. Die Multi-Head-Modulation unterteilte den Projektionsraum in 8 unabhängige Unterräume, wobei jeder Kopf eine Dimension von 64 hatte. Das räumliche Layout vorher projizierte diskrete Pixelkoordinaten in ein kontinuierliches Potentialfeld und erzeugte die strukturelle Affinitätsmatrix S als explizite additive räumliche Verzerrung zur Modulation der Dot-Produkt-Ähnlichkeitsmatrix. Der visuelle Merkmalstensor wurde als Abfragequelle verwendet, da semantisches Parsing erfordert, dass jeder visuelle Ort aktiv strukturell konsistente Beweise aus dem geometrischen Vorraum abruft. Das SDF wurde zuvor als Schlüssel- und Wertquelle verwendet, da es kontinuierliche Grenzdistanz und Inner-Außen-Strukturhinweise speichert, die aus dem Manhattan-Layout abgeleitet sind. Der Dot-Produkt-Term maß die Kompatibilität zwischen dem semantischen Erscheinungsbild und dem geometrischen Prior, während der additive strukturelle Term λS die Aufmerksamkeitsgewichte auf Pixel auf derselben physikalischen Ebene oder nahe derselben architektonischen Kontur verlagerte. Der Koeffizient λ stellte das Vertrauen in das extrahierte strukturelle Prior dar und kontrollierte, inwieweit starre orthogonale Einschränkungen in die Aufmerksamkeitsverteilung integriert wurden. Diese Formulierung reduzierte die grenzüberschreitende Merkmale-Diffusion, verursacht durch Möbelverschluss, und behielt die adaptive Relaxation in Nicht-Manhattan-Layouts bei. Die strukturgesteuerte Aufmerksamkeitsverteilung wurde gemäß Gleichung 1 berechnet.
Gleichung 1: 
wobei A die strukturgesteuerte Aufmerksamkeitsaggregationsmatrix bezeichnet, Q den Abfragetensor, der aus visuellen Merkmalen generiert wird, K den Schlüsseltensor, der aus SDF-Vormerkmalen generiert wird, V den Werttensor aus strukturellen Vordarstellungen, dk die Merkmalsdimension des Schlüsseltensors, λ den adaptiven strukturellen Gewichtungskoeffizienten bezeichnet, der zur Identifizierung der geometrischen Sicherheit lokaler Regionen und zur Lockerung starrer orthogonaler Nebenbedingungen in nicht-Manhattan-räumlichen Räumlichkeiten verwendet wird Layouts, und S bezeichnet die SDF-Affinitätsmatrix. Die Teilung durch dk stabilisierte die Skala der Aufmerksamkeitslogits und verhinderte, dass große Feature-Dimensionen überkonzentrierte Aufmerksamkeitsgewichte erzeugten. Die normierte Exponentialfunktion (siehe Materialtabelle) wandelte die modulierten Ähnlichkeitswerte in eine normalisierte räumliche Verteilung um, sodass jedes Pixel strukturelle Vorinformationen basierend auf semantischer und geometrischer Konsistenz aggregieren konnte. Dieses Design erklärt, warum visuelles Erscheinungsbild und architektonische Grenzpriore auf Aufmerksamkeitsebene und nicht durch direkte Merkmalsverkettung verschmolzen sind.
Der Superpixel-Topologiegraph wurde aus der strukturausgerichteten Merkmalskarte konstruiert. Die Merkmalskarte wurde mithilfe eines Algorithmus zur Generierung räumlicher Regionen segmentiert. Die Superpixelzahl wurde auf 256 gesetzt, der Kompaktheitskoeffizient auf 10, der Gaußsche Glättungskoeffizient auf 1,0 und die Iterationszahl auf 10. Räumliche Nähebeschränkungen wurden erzwungen, indem das Gewicht der Entfernungsmetrik während des Clusterings auf ein konstantes Verhältnis von 1,0 zum Farbraumabstand des Merkmals gesetzt wurde, wodurch eine einheitliche Knotengenerierung über dichte Clutter-Grenzen hinweg erhalten blieb. Pixel mit homogenen semantischen Antworten wurden zu Superpixel-Knoten aggregiert. Graphkanten wurden entsprechend räumlicher Nachbarschaftsbeziehungen, SDF-Affinitätsstärke und koplanaren geometrischen Konsistenzbedingungen konstruiert. Der Konstruktionsprozess der strukturellen Affinitätsmatrix und der topologischen Konnektivität ist in Abbildung 3 dargestellt, die zeigt, wie SDF-Führung in geografische Beziehungen auf Graphenebene umgewandelt wurde.
Die Graphenformulierung wurde eingeführt, um dichtes pixelweises Denken über homogene strukturelle Bereiche in knotenweise räumliches Denken umzuwandeln. Jeder Superpixelknoten repräsentierte einen lokalen Bereich mit ähnlicher semantischer Antwort und räumlicher Kontinuität, während jede Kante einen zuverlässigen Weg für die Merkmalsübertragung darstellte, vorbehaltlich von Adjazenz, Entfernungsfeldaffinität und koplanaren Konsistenzbedingungen. Dieses Design reduzierte den Einfluss isolierter verrauschter Pixel und ermöglichte es verdeckten Wand-, Boden- und Deckenbereichen, Nachrichten von physisch benachbarten Knoten zu empfangen. Die Kantenkonstruktion diente daher als mathematische Brücke zwischen kontinuierlicher SDF-Führung und diskretem nicht-euklidischen Graphendenken.
Ein dreischichtiges Graphen-Konvolutions-Denknetzwerk wurde mit den versteckten Merkmalsdimensionen 512, 256 und 128 konfiguriert. Die Graph-Konfaltionsschicht führte eine Feature-Glättung über die Graphstruktur durch, basierend auf den räumlichen Beziehungen der Knoten. Die Selbstschleifen-Adjazenz behielt während der Nachrichtenübertragung den ursprünglichen Zustand jedes Knotens bei, wodurch verhindert wurde, dass die Merkmale einer kleinen strukturellen Region von umliegenden großen Bereichen gelöscht werden. Die symmetrische Normalisierung skalierte die Adjazenzmatrixelemente durch das Produkt der umgekehrten Quadratwurzeln der Knotengrade, sodass hochgradige und niedriggradige Knoten während der Ausbreitung unter vergleichbaren numerischen Größen beitrugen. Die Vorwärtsausbreitung führte eine lokalisierte räumliche Aggregation durch, bei der jeder Knotenzustand hochdimensionale Merkmale von benachbarten koplanaren Clustern absorbierte, bevor die elementweise nichtlineare Rektifikationsfunktion angewendet wurde. Diese Formulierung ließ die Graphen-Faltungsschicht die semantische Diffusion entlang physikalisch bedeutungsvoller Innenflächen approximieren, anstatt uneingeschränkte Glättung über die Grenzen nicht verwandter Objekte hinweg zu ermöglichen. Die Graphknotenmerkmale wurden gemäß Gleichung 2 bewertet.
Gleichung 2: 
Die Projektion von dichten Pixelmerkmalen zu Superpixel-Knoten, das Austausch von Graphen-Faltungs-Nachrichten und die Koordinatenrückprojektion sind in Abbildung 4 dargestellt, die den Merkmalsaggregationspfad von regulären Bildgittern zu einer nicht-euklidischen Topologie und zurück zu einer dichten semantischen Darstellung erläutert. Die Projektion von dichten Pixelmerkmalen in Abbildung 4A zu Superpixel-Knoten in Abbildung 4B, der Graphen-Faltungs-Nachrichtenübermittlung in Abbildung 4C und die Koordinatenrückprojektion in Abbildung 4D verdeutlichen den Feature-Aggregationspfad von regulären Bildgittern zu einer nicht-euklidischen Topologie und zurück zu einer dichten semantischen Darstellung.
wobei H(l) den Knotenmerkmal-Tensor der l-ten Graphfaltungsschicht bezeichnet, Â die Adjazenzmatrix mit Selbstschleifenverbindungen, D die Gradmatrix der Adjazenzmatrix, W(l) die lernbare Gewichtungsmatrix der l-ten Graphfaltungsschicht und σ die rektive lineare Einheitsaktivierungsfunktion bezeichnet. Der Begriff ÂH(l) aggregierte Merkmale benachbarter Superpixel-Knoten, während D−1/2 und D−1/2 den Beitrag von Knoten mit unterschiedlichen Verbindungsdichten ausbalancierten. Die lernbare Matrix W(l) projizierte aggregierte Knotenmerkmale in einen neuen semantischen Raum und ermöglichte es der Graphenschicht, strukturelle Konsistenz von gewöhnlicher räumlicher Nähe zu unterscheiden. Die nichtlineare Aktivierung bewahrte den Unterschied in den Antworten zwischen koplanaren und nicht-koplanaren Regionen nach der Merkmalaggregation.
Semantische Segmentierungsmerkmale wurden nach Graphen-Argumentation entschlüsselt. Der Decoder wurde mit drei bilinearen Interpolations-Upsampling-Stufen und Schichtübergreifenden Skip-Connection-Fusionsoperationen konstruiert. Flache räumliche Encoderfunktionen wurden durch kanalweise Fusion mit hochstufigen semantischen Decoderfunktionen verkettet. Die Feature-Auflösung wurde auf die ursprüngliche Bildgröße zurückgesetzt, und die endgültige semantische Wahrscheinlichkeitsvorhersagekarte wurde über eine 1×-1-Faltungsschicht erzeugt.
Das vollständige semantische Parsing-Netzwerk wurde mit einem entkoppelten Gewichts-Abfall-Optimierer trainiert (siehe Materialtabelle). Die anfängliche Lernrate wurde auf 0,0001 gesetzt, der Gewichtsverfall auf 0,01 und die Batchgröße auf 8 für beide öffentlichen Benchmarks. Die erste Momentzerfallsrate wurde auf 0,9 gesetzt, die zweite auf 0,999 und der numerische Stabilitäts-Epsilonkoeffizient auf 1 × 10⁻8. Der Validierungsverlust wurde am Ende jeder Epoche überwacht, und Kontrollpunkte wurden gespeichert, wenn die mIoU im Validierungssatz stieg. Das Netzwerk wurde über 300 Epochen mit einer Polynom-Lernrate-Zerfallsstrategie mit einer Decay-Potenz von 0,9 trainiert. Fünf unabhängige Trainingsläufe wurden mit verschiedenen zufälligen Seed-Initialisierungen durchgeführt, um eine statistisch strenge Bewertungsbasis zu etablieren. Das Netzwerk wurde gemeinsam unter Verwendung von Pixelebene-Kreuzentropieverlust und struktureller Konsistenzverlust optimiert. Alle Experimente wurden auf einer Rechenplattform durchgeführt, die mit hochspeicherfähiger paralleler Rechenhardware ausgestattet war, und detaillierte Hardwareinformationen wurden in der Materialtabelle angegeben.
Die gemeinsame Optimierung erzwingt geometrische Randausrichtung durch Berechnung des räumlichen Gradientenbetrags des Klassenwahrscheinlichkeitstensors. Der strukturelle Konsistenzverlust wurde als Regularisator verwendet, indem die Norm der räumlichen Vorhersagegradienten mit den kontinuierlichen SDF-Werten multipliziert wurde. Die mathematische Begründung war, dass semantische Kategorienänderungen sich nahe realen architektonischen Konturen konzentrieren sollten, wo die SDF gegen Null geht, während flache Wände, Boden und Deckeninnenräume flüssige semantische Antworten aufrechterhalten sollten. Wenn ein großer Vorhersagegradient weit von einer strukturellen Grenze entfernt erschien, erhöhte der Distanzfeldterm die Strafe und entmutigte falsche semantische Übergänge innerhalb einer homogenen physikalischen Ebene. Wenn ein Vorhersagegradient in der Nähe einer Null-Entfernungs-Kurve auftrat, blieb die Strafe begrenzt und bewahrte legitime Klassenübergänge entlang architektonischer Grenzen. Semantische Übergangsregionen wurden darauf beschränkt, sich mit den Null-Distanz-Konturen der SDF auszurichten, wie sie durch Gleichung 3 gegeben sind.
Gleichung 3: 
wobei Ltotal die endgültige Optimierungszielfunktion bezeichnet, Lce den Pixel-Ebene-Kreuzentropieverlust, Lscl den strukturellen Konsistenz-Strafverlust und α den strukturellen Verlustgewichtungskoeffizienten. Der Kreuzentropie-Term ermöglichte pixelfreie semantische Überwachung über Annotationsmasken, während der strukturelle Konsistenzterm eine geometrische Regularisierung unter Verwendung architektonischer Priors auferlegte. Der Gewichtungskoeffizient α ausgewogene Kategorienerkennung und Randausrichtung, wodurch verhindert wird, dass die Optimierung entweder die lokale Etikettengenauigkeit oder starre strukturelle Konturen überfittet. Dieses gemeinsame Ziel verband visuelle Semantik, physikalische Randkonsistenz und trainierbare Netzwerkparameter innerhalb eines einheitlichen Optimierungsziels.