Indoor RGB-scènesdatasets en hun semantische annotaties werden voorbereid vóór netwerktraining. De grootschalige indoor 3D-dataset en RGB-D indoor scene dataset (zie de Table of Materials) zijn verkregen uit hun officiële archieven. Binnenopnames met meubelocclusie, verlichtingsvariatie, muurgrensonderbreking en complexe ruimtelijke indelingen werden behouden om aan te sluiten bij het doelparsingscenario. Semantische labels werden omgezet in geïndexeerde enkelkanaals PNG-annotatiemaskers, en alle RGB-afbeeldingen en semantische maskers werden verkleind tot 512 × 512 pixels. Online data-augmentatie werd toegepast tijdens de training, met willekeurige horizontale flipping bij een kans van 0,5, willekeurige helderheidsscaling tussen 0,8 en 1,2, en willekeurige rotatie tussen −10° en +10° om de structurele indelingsverdeling te verbreden. RGB-kanalen werden genormaliseerd met gemiddelde waarden van 0,485, 0,456 en 0,406 en standaarddeviatiewaarden van 0,229, 0,224 en 0,225. De grootschalige indoor 3D-benchmark volgde de officiële release-verdeling die in deze studie werd gebruikt, met 1201 trainingsscènes en 312 validatiescènes voor modelontwikkeling en validatie. De RGB-D indoor scene benchmark volgde het officiële evaluatieprotocol, met 795 trainingsbeelden en 654 testbeelden. Er werd geen extra procentuele splitsing toegepast op deze twee publieke benchmarks.
Een visueel transformer-backbone-netwerk met verschoven-venster (zie de Table of Materials) werd geïnitialiseerd als de backbone van de moving-window transformer-encoder. De patch-embedding was geconfigureerd als 4 x 4 pixels. De embedding-afmetingen van de vier hiërarchische fasen werden ingesteld op 128, 256, 512 en 1024, en het aantal transformatorblokken in de vier fasen werd ingesteld op 2, 2, 18 en 2. De grootte van het lokale aandachtsvenster werd ingesteld op 7 x 7, en het aantal aandachtshoofden op 4, 8, 16 en 32 voor de vier hiërarchische fasen. Niet-lineaire continue activatiefuncties werden gebruikt in alle perceptronlagen van meerdere lagen. Ruimtelijke downsampling werd uitgevoerd via patch-merging operaties met een stap van 2 na elke hiërarchische fase. De kernnetwerkarchitectuur en hyperparameters van de convolutionele inferentiemodule werden samengevat in Tabel 1.
Vervolgens werd het extraheren van zelfaandachtskenmerken in verschoven vensters uitgevoerd op de invoerkenmerkkaarten. Elke featurekaart was verdeeld in niet-overlappende lokale vensters met ruimtelijke afmetingen van 7 × 7. Regelmatige raamaandacht en verschoven raam werden afgewisseld tussen aangrenzende transformatorblokken met verschoven raam. De cyclische shiftafstand werd ingesteld op 3 pixels, en er werd relatieve positionele bias-codering toegepast binnen elk lokaal aandachtsvenster. Lokale visuele kenmerken werden geaggregeerd via multi-head self-attention om hiërarchische, multi-scale feature-representaties te genereren.
Manhattan structurele priors werden geëxtraheerd uit indoor RGB-afbeeldingen. Structurele randsegmenten werden gedetecteerd met behulp van een gradient-direction-consistentie lijnsegmentdetectie-algoritme. Dominante structurele richtingen werden geclusterd via een random sample consensus (RANSAC) algoritme (zie de Materiaaltabel) gebaseerd op nulpuntschatting. Drie onderling orthogonale Manhattan-richtingen werden gereconstrueerd om de Manhattan 3D-begrenzingsboxrepresentatie te genereren. De gereconstrueerde structurele grens werd omgezet in een SDF-kaart door de minimale Euclidische afstand van elke pixel tot het dichtstbijzijnde grenslijnsegment te berekenen.
Structuurgestuurde cross-attention kenmerken werden gegenereerd nadat de visuele kenmerken en SDF-voorafgaande functies waren verkregen. De visuele featurevariëteit werd afgebeeld naar de query-tensor Q via de lineaire transformatiematrix W sub Q element van dubbel geslagen cap R naar de formatiematrix W sub Q element van dubbel geslagen cap R naar de formatiematrix
. Het continue afstandsveld daarvoor werd afgebeeld op de sleuteltensor K en de waardetensor V via de transformatiematrices
, en de modeldimensie werd ingesteld op 512. Multi-head modulatie verdeelde de projectieruimte in 8 onafhankelijke subruimten, waarbij elke head een dimensie van 64 had. De ruimtelijke indeling vooraf projecteerde discrete pixelcoördinaten in een continu potentiaalveld en genereerde de structurele affiniteitsmatrix S als expliciete additief ruimtelijke bias voor het moduleren van de dot-productgelijkenismatrix. De visuele kenmerktensor werd gebruikt als querybron omdat semantische parsing vereist dat elke visuele locatie actief structureel consistent bewijs uit de geometrische voorgaande ruimte haalt. De SDF werd daarvoor gebruikt als sleutel- en waardebron omdat deze continue grensafstand en binnen-buiten structurele aanwijzingen opslaat, afgeleid van de Manhattan-indeling. De dotproductterm mat de compatibiliteit tussen het semantische uiterlijk en de geometrische prior, terwijl de additieve structurele term λS de aandachtsgewichten verplaatste naar pixels op hetzelfde fysisch vlak of nabij dezelfde architectonische contour. De coëfficiënt λ vertegenwoordigde het vertrouwen in de geëxtraheerde structurele prior en bepaalde in hoeverre rigide orthogonale beperkingen in de aandachtsverdeling werden opgenomen. Deze formulering verminderde de diffusie van cross-boundary features veroorzaakt door meubelocclusie en behield adaptieve relaxatie in niet-Manhattan layouts. De structuurgeleide aandachtverdeling werd berekend volgens Vergelijking 1.
Vergelijking 1: 
waarbij A de structuurgeleide aandachtsaggregatiematrix aanduidt, Q de querytensor die wordt gegenereerd uit visuele kenmerken, K de sleuteltensor die wordt gegenereerd uit SDF-voorgaande kenmerken, V de waardetensor die wordt gegenereerd uit structurele priorrepresentaties, dk de kenmerkdimensie van de sleuteltensor, λ de adaptieve structurele wegingscoëfficiënt die wordt gebruikt om de geometrische betrouwbaarheid van lokale regio's te identificeren en starre orthogonale beperkingen in niet-Manhattan ruimtelijke beperkingen te ontspannen layouts, en S duidt de SDF-affiniteitsmatrix aan. De verdeling door dk stabiliseerde de schaal van aandachtslogits en voorkwam dat grote feature-dimensies overgeconcentreerde aandachtsgewichten produceerden. De genormaliseerde exponentiële functie (zie de Tabel van Materiaal) transformeerde de gemoduleerde gelijkenisscores in een genormaliseerde ruimtelijke verdeling, waardoor elke pixel structurele voorinformatie kon aggregeren op basis van semantische en geometrische consistentie. Dit ontwerp verklaart waarom visuele uiterlijk en architectonische grenspriors op aandachtsniveau worden samengevoegd in plaats van door directe feature-concatenatie.
De superpixeltopologiegrafiek is geconstrueerd uit de structuur-uitgelijnde featuremap. De featuremap werd gesegmenteerd met behulp van een algoritme voor ruimtelijke regiogeneratie. Het superpixelgetal werd ingesteld op 256, de compactheidscoëfficiënt op 10, de Gaussische gladmakingscoëfficiënt op 1,0 en het iteratiegetal op 10. Ruimtelijke nabijheidsbeperkingen werden gehandhaafd door het gewicht van de afstandsmetriek tijdens clustering in te stellen op een constante verhouding van 1,0 tot de feature-kleurruimteafstand, waardoor uniforme knooppuntgeneratie over dichte rommelgrenzen behouden bleef. Pixels met homogene semantische responsen werden geaggregeerd tot superpixelknooppunten. Grafranden werden geconstrueerd volgens ruimtelijke nabijheidrelaties, SDF-affiniteitssterkte en coplanaire geometrische consistentiebeperkingen. Het constructieproces van de structurele affiniteitsmatrix en topologische connectiviteit wordt weergegeven in Figuur 3, waarin wordt getoond hoe SDF-geleiding werd omgezet in ruimtelijke relaties op grafniveau.
De grafiekformulering werd geïntroduceerd om dichte pixelwijze redenering om te zetten in node-gewijze ruimtelijke redenering over homogene structurele gebieden. Elke superpixelknoop vertegenwoordigde een lokaal gebied met een vergelijkbare semantische respons en ruimtelijke continuïteit, terwijl elke rand een betrouwbaar pad voor feature-overdracht vertegenwoordigde, onderhevig aan nabijheid, afstand-veld affiniteit en coplanair-consistentiebeperkingen. Dit ontwerp verminderde de invloed van geïsoleerde ruisachtige pixels en maakte occludeerde wand-, vloer- en plafondgebieden mogelijk om berichten te ontvangen van fysiek aangrenzende knooppunten. De randconstructie diende daarom als een wiskundige brug tussen continue SDF-geleiding en discrete niet-Euclidische graafredenering.
Een drielaags graf convolutioneel redeneernetwerk werd geconfigureerd met verborgen feature-dimensies van 512, 256 en 128. De convolutionele laag van de graaf voerde feature-gladmaking uit over de grafiekstructuur op basis van de ruimtelijke relaties tussen de knooppunten. De zelf-lus adjacency behield de oorspronkelijke staat van elke knoop tijdens het doorgeven van berichten, waardoor voorkomen dat de kenmerken van een kleine structurele regio werden gewist door omliggende grote gebieden. Symmetrische normalisatie schaalde de elementen van de nabijheid matrix met het product van de inverse vierkantswortels van de knoopgraden, zodat knooppunten met hoge en lage graad tijdens voortplanting bijdroegen onder vergelijkbare numerieke groottes. Feed-forward propagatie voerde lokale ruimtelijke aggregatie uit, waarbij elke knooptoestand hoogdimensionale kenmerken van aangrenzende coplanaire clusters absorbeerde voordat de elementgewijze niet-lineaire rectificatiefunctie werd toegepast. Deze formulering maakte de grafiekconvolutielaag een benaderde semantische diffusie langs fysiek betekenisvolle binnenvlakken in plaats van onbeperkte gladstrijking over de grenzen van niet-gerelateerde objecten. Grafiekknoopkenmerken werden geëvalueerd volgens Vergelijking 2.
Vergelijking 2: 
De projectie van dichte pixelfeatures naar superpixelknooppunten, het doorgeven van grafconvolutieberichten en coördinaten-terugprojectie worden weergegeven in Figuur 4, waarin het feature-aggregatiepad van reguliere beeldroosters naar een niet-Euclidische topologie en terug naar een dichte semantische representatie wordt verduidelijkt. De projectie van dichte pixelkenmerken in Figuur 4A naar superpixelknooppunten in Figuur 4B, het doorgeven van grafconvolutieberichten in Figuur 4C en de coördinaten-backprojectie in Figuur 4D verduidelijken het feature-aggregatiepad van reguliere beeldroosters naar een niet-Euclidische topologie en terug naar een dichte semantische representatie.
waarbij H(l) de knoopkenschapstensor van de l-de grafconvolutielaag aanduidt, Â de adjacentiematrix met zelflusverbindingen, D de graadmatrix die overeenkomt met de adjacentiematrix, W(l) de leerbare gewichtmatrix van de l-de graafconvolutielaag aanduidt, en σ de activatiefunctie van de gerectificeerde lineaire eenheid. De term ÂH(l) aggregeerde kenmerken van aangrenzende superpixelknooppunten, terwijl D−1/2 en D−1/2 de bijdrage van knooppunten met verschillende verbindingsdichtheden in balans brachten. De leerbare matrix W(l) projecteerde geaggregeerde knoopkenmerken in een nieuwe semantische ruimte, waardoor de graaflaag structurele consistentie kon onderscheiden van gewone ruimtelijke nabijheid. De niet-lineaire activatie behield het verschil in responsen tussen coplanaire en niet-coplanaire regio's na feature-aggregatie.
Semantische segmentatiekenmerken werden ontcijferd na graafredenering. De decoder werd geconstrueerd met drie bilineaire interpolatie-upsampling-fasen en cross-layer skip-connection fusieoperaties. Ondiepe ruimtelijke encoderkenmerken werden gekoppeld aan hoog-niveau semantische decoderkenmerken via kanaalgewijze fusie. De featureresolutie werd hersteld naar de oorspronkelijke beeldgrootte, en de uiteindelijke semantische kansvoorspellingskaart werd gegenereerd via een convolutielaag van 1 × 1.
Het volledige semantische parsingsnetwerk werd getraind met een ontkoppelde gewicht-decay optimizer (zie de Materiaaltabel). De initiële leersnelheid werd ingesteld op 0,0001, de gewichtsvervalcoëfficiënt op 0,01 en de batchgrootte op 8 voor beide publieke benchmarks. De eerste momentvervalsnelheid werd ingesteld op 0,9, de tweede op 0,999, en de numerieke stabiliteitsepsiloncoëfficiënt op 1 × 10⁻8. Het validatieverlies werd aan het einde van elke epoch gemonitord, en checkpoints werden opgeslagen wanneer de mIoU op de validatieset toenam. Het netwerk werd getraind voor 300 epochs met behulp van een polynomiale leersnelheidsvervalstrategie met een vervalkracht van 0,9. Vijf onafhankelijke trainingsruns werden uitgevoerd met verschillende willekeurige seed-initialisaties om een statistisch rigoureuze evaluatiebaseline vast te stellen. Het netwerk werd gezamenlijk geoptimaliseerd met behulp van pixelniveau cross-entropieverlies en structurele consistentieverlies. Alle experimenten werden uitgevoerd op een computerplatform uitgerust met hooggeheugen parallelle computerhardware, en gedetailleerde hardware-informatie werd gerapporteerd in de Table of Materials.
Gesamentlike optimalisatie dwong geometrische randuitlijning af door de ruimtelijke gradiëntgrootte van de klasse-kanstensor te berekenen. Het structurele consistentieverlies werd gebruikt als een regularizer, waarbij de norm van de ruimtelijke voorspellingsgradiënten werd vermenigvuldigd met de continue SDF-waarden. De wiskundige redenering was dat veranderingen in semantische categorieën zich moesten concentreren nabij reële architectonische contouren, waar de SDF naar nul toe gaat, terwijl vlakke wand-, vloer- en plafondinterieurs soepele semantische antwoorden moesten behouden. Wanneer een grote voorspellingsgradiënt ver van een structurele grens leek, verhoogde de afstandsveldterm de straf en ontmoedigde valse semantische overgangen binnen een homogeen fysisch vlak. Wanneer een voorspellingsgradiënt verscheen nabij een nul-afstandscontour, bleef de straf beperkt en behield legitieme klasseovergangen langs architectonische grenzen. Semantische overgangsgebieden werden beperkt om uit te lijnen met de nul-afstandscontouren van de SDF, zoals gegeven door Vergelijking 3.
Vergelijking 3: 
waarbij Ltotaal de uiteindelijke optimalisatiedoelfunctie aanduidt, Lce het pixelniveau kruis-entropieverlies, Lscl het verlies voor structurele consistentie en α de gewichtscoëfficiënt voor structureel verliesverlies. De kruis-entropieterm bood pixelniveau semantische supervisie via annotatiemaskers, terwijl de term structurele consistentie geometrische regularisatie oplegde met behulp van architecturale priors. De wegingscoëfficiënt α gebalanceerde categorieherkenning en grensuitlijning, waardoor wordt voorkomen dat de optimalisatie lokale labelnauwkeurigheid of starre structurele contouren overpast. Dit gezamenlijke doel verbond visuele semantiek, fysieke grensconsistentie en trainbare netwerkparameters binnen een geïntegreerde optimalisatiedoelstelling.