I dataset di scene RGB interne e le loro annotazioni semantiche sono stati preparati prima dell'addestramento alla rete. Il dataset 3D indoor su larga scala e il dataset RGB-D di scene interne (vedi la Tabella dei Materiali) sono stati ottenuti dai loro repository ufficiali. Le scene di acquisizione interne contenenti occlusione dei mobili, variazioni di illuminazione, interruzione dei confini muri e complessi layout spaziali sono state mantenute per adattarsi allo scenario di analisi del bersaglio. Le etichette semantiche furono convertite in maschere di annotazione PNG a canale singolo indicizzato, e tutte le immagini RGB e le maschere semantiche furono ridimensionate a 512 × 512 pixel. Durante l'addestramento è stato applicato l'aumento dei dati online, con inversione orizzontale casuale a probabilità di 0,5, scala casuale della luminosità tra 0,8 e 1,2, e rotazione casuale tra −10° e +10° per ampliare la distribuzione strutturale. I canali RGB sono stati normalizzati con valori medi di 0,485, 0,456 e 0,406 e valori di deviazione standard di 0,229, 0,224 e 0,225. Il benchmark 3D indoor su larga scala ha seguito la divisione ufficiale del rilascio utilizzata in questo studio, con 1201 scene di addestramento e 312 scene di validazione per lo sviluppo e la validazione del modello. Il benchmark RGB-D per la scena indoor ha seguito il protocollo ufficiale di valutazione, con 795 immagini di addestramento e 654 immagini di test. Non è stata applicata alcuna ulteriore suddivisione percentuale a questi due parametri di riferimento pubblici.
Una rete visiva di backbone gerarchica a trasformatori a finestra spostata (vedi la Tabella dei Materiali) fu inizializzata come backbone degli encoder a trasformatori a finestra mobile. La dimensione dell'embedding della patch era configurata come 4 x 4 pixel. Le dimensioni di embedding dei quattro stadi gerarchici furono impostate a 128, 256, 512 e 1024, e il numero di blocchi trasformatori nei quattro stadi fu impostato a 2, 2, 18 e 2. La dimensione della finestra di attenzione locale fu impostata a 7 x 7, e il numero di teste di attenzione fu impostato a 4, 8, 16 e 32 per le quattro fasi gerarchiche. Funzioni di attivazione continua non lineari venivano utilizzate all'interno di tutti gli strati di percettrone multistrato. Il downsampling spaziale veniva eseguito tramite operazioni di patch-merging con un passo di 2 dopo ogni fase gerarchica. L'architettura di rete centrale e gli iperparametri del modulo di inferenza convoluzionale sono stati riassunti nella Tabella 1.
L'estrazione delle caratteristiche di autoattenzione a finestra spostata veniva quindi eseguita sulle mappe delle caratteristiche di input. Ogni mappa delle caratteristiche era suddivisa in finestre locali non sovrapposte con dimensioni spaziali di 7 × 7. L'attenzione regolare delle finestre e quella delle finestre spostate venivano alternate tra i blocchi adiacenti dei trasformatori a finestra spostata. La distanza di spostamento ciclico fu impostata a 3 pixel e fu applicata una codifica relativa al bias posizionale all'interno di ogni finestra di attenzione locale. Le caratteristiche visive locali sono state aggregate tramite auto-attenzione multi-testa per generare rappresentazioni gerarchiche e su scala multipla.
I precedenti strutturali di Manhattan sono stati estratti da immagini RGB interne. I segmenti di bordo strutturale sono stati rilevati utilizzando un algoritmo di rilevamento dei segmenti di linea con direzione e coerenza gradiente. Le direzioni strutturali dominanti sono state raggruppate tramite un algoritmo di consenso casuale per campioni (RANSAC) (vedi la Tabella dei Materiali) basato sulla stima del punto di fuga. Tre direzioni Manhattan mutuamente ortogonali furono ricostruite per generare la rappresentazione della scatola delimitante 3D di Manhattan. Il confine strutturale ricostruito è stato convertito in una mappa SDF calcolando la distanza euclidea minima da ogni pixel al segmento di linea di confine più vicino.
Le caratteristiche di attenzione incrociata guidate dalla struttura sono state generate dopo che le caratteristiche visive e i precedenti SDF erano stati ottenuti. La varietà di caratteristiche visive è stata mappata al tensore di interrogazione Q attraverso la matrice di trasformazione lineare W subelemento Q del cappuccio a doppio coniuto R alla matrice di formazione W subelemento Q del cappuccio a doppio coniuto R alla matrice
di formazione. Il campo di distanza continua a priori è stato mappato al tensore chiave K e il tensore di valore V attraverso le matrici
di trasformazione , e la dimensione del modello è stata impostata a 512. La modulazione multi-head divise lo spazio di proiezione in 8 sottospazi indipendenti, ciascuna con una dimensione di 64. La disposizione spaziale precedente proiettava coordinate discrete dei pixel in un campo potenziale continuo e generava la matrice di affinità strutturale S come esplicito bias spaziale additivo per modulare la matrice di similarità a prodotto scalare. Il tensore delle caratteristiche visive è stato utilizzato come sorgente della query perché l'analisi semantica richiede che ogni posizione visiva recuperi attivamente prove strutturalmente coerenti dallo spazio geometrico di prior. Il precedente SDF è stato utilizzato come fonte chiave e di valore perché memorizza la distanza continua dei confini e le indicazioni strutturali interno-esterno derivate dalla disposizione Manhattan. Il termine prodotto scalare misurava la compatibilità tra l'aspetto semantico e il prior geometrico, mentre il termine strutturale additivo λS spostava i pesi dell'attenzione verso i pixel sullo stesso piano fisico o vicino allo stesso contorno architettonico. Il coefficiente λ rappresentava la fiducia nel prior strutturale estratto e controllava fino a che punto i vincoli ortogonali rigidi venivano incorporati nella distribuzione dell'attenzione. Questa formulazione riduceva la diffusione delle caratteristiche transfrontaliere causata dall'occlusione dei mobili e manteneva il rilassamento adattivo nei layout non Manhattan. La distribuzione dell'attenzione guidata dalla struttura è stata calcolata secondo l'Equazione 1.
Equazione 1: 
dove A indica la matrice di aggregazione dell'attenzione guidata dalla struttura, Q indica il tensore di query generato dalle caratteristiche visive, K indica il tensore chiave generato da caratteristiche precedenti SDF, V indica il tensore di valore generato da rappresentazioni priori strutturali, dk indica la dimensione delle caratteristiche del tensore chiave, λ indica il coefficiente di ponderazione strutturale adattivo usato per identificare la fiducia geometrica delle regioni locali e rilassare i vincoli ortogonali rigidi in spazi non Manhattan layout, e S indica la matrice di affinità SDF. La divisione per dk stabilì la scala dei logit di attenzione e impediva che grandi dimensioni di caratteristiche producessero pesi di attenzione eccessivamente concentrati. La funzione esponenziale normalizzata (vedi la Tabella dei Materiali) trasformava i punteggi di somiglianza modulati in una distribuzione spaziale normalizzata, permettendo a ogni pixel di aggregare informazioni a priori strutturali basate sulla consistenza semantica e geometrica. Questo design spiega perché l'aspetto visivo e i priori di confine architettonico sono fusi a livello di attenzione piuttosto che tramite concatenazione diretta di caratteristiche.
Il grafo topologico superpixel è stato costruito dalla mappa delle caratteristiche allineate alla struttura. La mappa delle caratteristiche è stata segmentata utilizzando un algoritmo di generazione di regioni spaziali. Il numero di superpixel fu impostato a 256, il coefficiente di compattezza a 10, il coefficiente di levigatura gaussiano a 1,0 e il numero di iterazione a 10. I vincoli di prossimità spaziale venivano imposti impostando il peso metrico della distanza a un rapporto costante di 1,0 rispetto alla distanza colore-spazio delle caratteristiche durante il clustering, mantenendo così una generazione uniforme dei nodi lungo i confini di clutter denso. I pixel con risposte semantiche omogenee venivano aggregati in nodi superpixel. Gli archi dei grafi sono stati costruiti in base alle relazioni di adiacenza spaziale, alla forza di affinità SDF e ai vincoli di coerenza geometrica coplanare. Il processo di costruzione della matrice di affinità strutturale e della connettività topologica è mostrato nella Figura 3, che mostra come la guida SDF sia stata trasformata in relazioni spaziali a livello di grafo.
La formulazione grafica è stata introdotta per convertire il ragionamento denso pixel a pixel in ragionamento spaziale nodo su regioni strutturali omogenee. Ogni nodo superpixel rappresentava una regione locale con risposta semantica e continuità spaziale simili, mentre ogni arco rappresentava un percorso affidabile per la trasmissione di caratteristiche soggetto a vincoli di adiacenza, affinità di campo di distanza e coerenza coplanare. Questo design ridusse l'influenza di pixel rumorosi isolati e permise a aree occlute di pareti, pavimenti e soffitti di ricevere messaggi da nodi fisicamente adiacenti. La costruzione degli archi, quindi, fungeva da ponte matematico tra la guida SDF continua e il ragionamento discreto a grafo non euclideo.
Una rete di ragionamento convoluzionale a tre livelli a grafo era configurata con dimensioni nascoste di caratteristiche 512, 256 e 128. Il livello convoluzionale del grafo eseguiva il livellamento delle caratteristiche sulla struttura del grafo basato sulle relazioni spaziali dei nodi. L'adiacenza a auto-anello manteneva lo stato originale di ciascun nodo durante il passaggio del messaggio, impedendo che le caratteristiche di una piccola regione strutturale venissero cancellate dalle grandi regioni circostanti. La normalizzazione simmetrica scalava gli elementi della matrice di adiacenza tramite il prodotto delle radici quadrate inverse dei gradi dei nodi, in modo che nodi di alto grado e basso grado contribuissero sotto magnitudini numeriche comparabili durante la propagazione. La propagazione in avanti ha eseguito un'aggregazione spaziale localizzata, in cui ogni stato del nodo ha assorbito caratteristiche ad alta dimensione da cluster coplanari adiacenti prima che fosse applicata la funzione di rettificazione non lineare elemento per elemento. Questa formulazione faceva sì che lo strato di convoluzione del grafo approssimassasse la diffusione semantica lungo piani interni fisicamente significativi, piuttosto che un levigamento illimitato attraverso i confini di oggetti non correlati. Le caratteristiche dei nodi del grafo sono state valutate secondo l'Equazione 2.
Equazione 2: 
La proiezione dalle caratteristiche dense dei pixel ai nodi superpixel, il passaggio di messaggi a convoluzione di grafo e la retroproiezione delle coordinate sono presentate nella Figura 4, chiarendo il percorso di aggregazione delle caratteristiche dalle griglie d'immagine regolari a una topologia non euclidea e poi di nuovo a una rappresentazione semantica densa. La proiezione dalle caratteristiche di pixel densi nella Figura 4A ai nodi superpixel nella Figura 4B, il passaggio di messaggi a convoluzione grafica nella Figura 4C e la retroproiezione delle coordinate nella Figura 4D chiariscono il percorso di aggregazione di caratteristiche dalle griglie d'immagine regolari a una topologia non euclidea e poi di nuovo a una rappresentazione semantica densa.
dove H(l) indica il tensore delle caratteristiche del nodo del l-esimo strato di convoluzione del grafo, Â indica la matrice di adiacenza con connessioni auto-loop, D indica la matrice dei gradi corrispondente alla matrice di adiacenza, W(l) indica la matrice di pesi apprendibile dello strato di convoluzione del grafo l-esimo, e σ indica la funzione di attivazione dell'Unità Lineare Rettificata. Il termine ÂH(l) aggregava le caratteristiche dei nodi superpixel adiacenti, mentre D−1/2 e D−1/2 bilanciavano il contributo dei nodi con densità di connessione diverse. La matrice apprendibile W(l) proiettava le caratteristiche aggregate del nodo in un nuovo spazio semantico, permettendo al livello del grafo di distinguere la consistenza strutturale dalla vicidità spaziale ordinaria. L'attivazione non lineare ha preservato la differenza nelle risposte tra regioni coplanari e non coplanari dopo l'aggregazione delle caratteristiche.
Le caratteristiche di segmentazione semantica sono state decodificate dopo il ragionamento dei grafi. Il decodificatore è stato costruito utilizzando tre stadi di upsampling di interpolazione bilineare e operazioni di fusione con connessione saltata cross-layer. Le caratteristiche superficiali degli encoder spaziali venivano concatenate con caratteristiche semantiche di alto livello tramite fusione canale per canale. La risoluzione delle caratteristiche è stata ripristinata alla dimensione originale dell'immagine e la mappa finale di previsione semantica della probabilità è stata generata tramite uno strato convoluzionale 1 × 1.
La rete semantica completa di parsing è stata addestrata utilizzando un ottimizzatore di decadimento peso disaccoppiato (vedi la Tabella dei Materiali). Il tasso di apprendimento iniziale è stato impostato a 0,0001, il coefficiente di decadimento del peso a 0,01 e la dimensione del lotto a 8 per entrambi i benchmark pubblici. Il primo tasso di decadimento momentaneo fu impostato a 0,9, il secondo tasso di decadimento a 0,999 e il coefficiente numerico di stabilità epsilon fu impostato a 1 × 10⁻8. La perdita di validazione veniva monitorata alla fine di ogni epoca e i checkpoint venivano salvati quando il mIoU sul set di validazione aumentava. La rete è stata addestrata per 300 epoche utilizzando una strategia di decadimento del tasso di apprendimento polinomiale con una potenza di decadimento di 0,9. Sono state condotte cinque corse di addestramento indipendenti utilizzando diverse inizializzazioni a semi casuali per stabilire una base di valutazione statisticamente rigorosa. La rete è stata ottimizzata congiuntamente utilizzando la perdita di entropia incrociata a livello di pixel e la perdita di coerenza strutturale. Tutti gli esperimenti sono stati condotti su una piattaforma di calcolo equipaggiata con hardware di calcolo parallelo ad alta memoria, e le informazioni hardware dettagliate sono state riportate nella Tabella dei Materiali.
L'ottimizzazione congiunta ha imposto l'allineamento geometrico dei confini calcolando la grandezza del gradiente spaziale del tensore di probabilità di classe. La perdita di coerenza strutturale veniva utilizzata come regolarizzatore, moltiplicando la norma dei gradienti di previsione spaziale per i valori continui di SDF. La logica matematica era che i cambiamenti semantici delle categorie dovessero concentrarsi vicino ai contorni architettonici reali, dove la SDF si avvicina a zero, mentre gli interni piani di pareti, pavimenti e soffitti dovessero mantenere risposte semantiche fluide. Quando un grande gradiente di previsione appariva lontano da un confine strutturale, il termine del campo di distanza aumentava la penalità e scoraggiava le false transizioni semantiche all'interno di un piano fisico omogeneo. Quando appariva un gradiente di previsione vicino a un contorno di distanza zero, la penalità rimaneva limitata e preservava le legittime transizioni di classe lungo i confini architettonici. Le regioni di transizione semantiche erano vincolate ad allinearsi con i contorni a distanza zero dell'SDF, come indicato dall'Equazione 3.
Equazione 3: 
dove Ltotale indica la funzione obiettivo finale di ottimizzazione, Lce indica la perdita di entropia incrociata a livello di pixel, Lscl indica la perdita di penalità di coerenza strutturale e α indica il coefficiente di pesatura della perdita strutturale. Il termine a entropia incrociata forniva una supervisione semantica a livello di pixel tramite maschere di annotazione, mentre il termine di coerenza strutturale imponeva una regolarizzazione geometrica usando priori architettonici. Il coefficiente di pesatura α il riconoscimento bilanciato delle categorie e l'allineamento dei bordi, impedendo all'ottimizzazione di sovraattaccare sia l'accuratezza locale dell'etichetta sia i contorni strutturali rigidi. Questo obiettivo congiunto collegava semantica visiva, coerenza fisica dei confini e parametri di rete addestrabili all'interno di un obiettivo di ottimizzazione unificato.