Przed trenowaniem sieci przygotowano zestawy danych scen RGB wewnątrz pomieszczeń oraz ich adnotacje semantyczne. Wielkoskalowy zestaw danych 3D wnętrz oraz zestaw danych scen RGB-D wewnątrz pomieszczeń (patrz Tabela materiałów) pobrano z ich oficjalnych repozytoriów. Zachowano sceny wnętrz zawierające przesłonięcia przez meble, zmienność oświetlenia, przerwy w granicach ścian oraz złożone układy przestrzenne, aby dopasować je do docelowego scenariusza segmentacji. Etykiety semantyczne przekształcono w indeksowane jednokanałowe maski adnotacji w formacie PNG, a wszystkie obrazy RGB i maski semantyczne zmieniono rozmiarem do 512 × 512 pikseli. Podczas trenowania zastosowano augmentację danych online, obejmującą losowe poziome odbicie lustrzane z prawdopodobieństwem 0,5, losowe skalowanie jasności w zakresie od 0,8 do 1,2 oraz losowy obrót od −10° do +10°, aby rozszerzyć rozkład układów strukturalnych. Kanały RGB znormalizowano, przyjmując wartości średnie 0,485, 0,456 i 0,406 oraz wartości odchylenia standardowego 0,229, 0,224 i 0,225. W przypadku wielkoskalowego benchmarku 3D wnętrz zastosowano oficjalny podział danych wykorzystany w tej badaniu, obejmujący 1201 scen treningowych i 312 scen walidacyjnych do opracowania i walidacji modelu. Benchmark scen RGB-D wewnątrz pomieszczeń realizowano zgodnie z oficjalnym protokołem ewaluacyjnym, wykorzystując 795 obrazów treningowych i 654 obrazy testowe. W przypadku tych dwóch publicznych benchmarków nie stosowano dodatkowego podziału procentowego.
Jako szkielet kodera transformera z przesuwnym oknem zainicjowano hierarchiczną sieć transformatora wizualnego o przesuniętym oknie (patrz Tabela Materiałów). Rozmiar osadzania patchy (patch embedding) skonfigurowano na 4 x 4 piksele. Wymiary osadzania dla czterech etapów hierarchicznych ustawiono odpowiednio na 128, 256, 512 i 1024, a liczbę bloków transformera w tych czterech etapach na 2, 2, 18 i 2. Rozmiar lokalnego okna uwagi ustawiono na 7 x 7, natomiast liczbę głowic uwagi dla czterech etapów hierarchicznych na 4, 8, 16 i 32. Wewnątrz wszystkich warstw wielowarstwowego perceptrona zastosowano nieliniowe ciągłe funkcje aktywacji. Downsampling przestrzenny przeprowadzano poprzez operacje łączenia patchy (patch-merging) z krokiem 2 po każdym etapie hierarchicznym. Podstawowa architektura sieci oraz hiperparametry modułu wnioskowania splotowego zostały podsumowane w Tabeli 1.
Następnie przeprowadzono ekstrakcję cech z map cech wejściowych przy użyciu mechanizmu przesuniętego okna samo-uwagi (shifted-window self-attention). Każda mapa cech została podzielona na niezachodzące na siebie lokalne okna o wymiarach przestrzennych 7 × 7. Mechanizm uwagi w regularnych oknach oraz uwaga w przesuniętych oknach były stosowane naprzemiennie w sąsiadujących blokach transformera z przesuniętymi oknami. Odległość przesunięcia cyklicznego ustawiono na 3 piksele, a w obrębie każdego lokalnego okna uwagi zastosowano kodowanie względnego obciążenia pozycyjnego. Lokalne cechy wizualne zostały zagregowane za pomocą wielogłowicowej samo-uwagi w celu wygenerowania hierarchicznych, wieloskalowych reprezentacji cech.
Strukturalne priory Techniki Manhattan zostały wyekstrahowane z wewnętrznych obrazów RGB. Segmenty krawędzi strukturalnych wykryto za pomocą algorytmu detekcji segmentów linii opartego na spójności kierunku gradientu. Dominujące kierunki strukturalne zgrupowano przy użyciu algorytmu RANSAC (random sample consensus) (patrz w Tabela materiałów) na podstawie estymacji punktu zbiegu. Zrekonstruowano trzy wzajemnie prostopadłe kierunki Manhattan, aby wygenerować reprezentację 3D w formie ograniczającego prostokąta Manhattan (Manhattan 3D bounding box). Zrekonstruowaną granicę strukturalną przekształcono w mapę SDF poprzez obliczenie minimalnej odległości euklidesowej z każdego piksela do najbliższego odcinka linii granicznej.
Cechy wzajemnej uwagi sterowanej strukturą zostały wygenerowane po uzyskaniu cech wizualnych i priorytetów SDF. Rozmaitość cech wizualnych została odwzorowana na tensor zapytania Q za pomocą liniowej macierzy transformacji W sub Q element of double-struck cap R to the formation matrix W sub Q element of double-struck cap R to the formation matrix
. Priorytet ciągłego pola dystansu został odwzorowany na tensor klucza K oraz tensor wartości V za pomocą macierzy transformacji
, a wymiar modelu ustawiono na 512. Modulacja wielogłowicowa podzieliła przestrzeń projekcji na 8 niezależnych podprzestrzeni, z których każda głowica miała wymiar 64. Priorytet układu przestrzennego rzutował dyskretne współrzędne pikseli na ciągłe pole potencjału i generował macierz powinowactwa strukturalnego S jako jawne addytywne obciążenie przestrzenne do modulacji macierzy podobieństwa iloczynu skalarnego. Tensor cech wizualnych posłużył jako źródło zapytania, ponieważ analiza semantyczna wymaga, aby każda lokalizacja wizualna aktywnie pobierała strukturalnie spójne dowody z przestrzeni priorytetów geometrycznych. Priorytet SDF został użyty jako źródło klucza i wartości, ponieważ przechowuje on ciągły dystans brzegowy oraz strukturalne wskazówki wewnątrz-zewnątrz pochodzące z układu Manhattan. Człon iloczynu skalarnego mierzył kompatybilność między wyglądem semantycznym a priorytetem geometrycznym, podczas gdy addytywny człon strukturalny λS przesuwał wagi uwagi w stronę pikseli znajdujących się na tej samej płaszczyźnie fizycznej lub w pobliżu tego samego konturu architektonicznego. Współczynnik λ reprezentował stopień pewności w zakresie wyekstrahowanego priorytetu strukturalnego i kontrolował zakres, w jakim sztywne ograniczenia ortogonalne zostały włączone do rozkładu uwagi. Sformułowanie to zredukowało dyfuzję cech międzygranicznych spowodowaną przesłonięciem przez meble i zachowało adaptacyjne rozluźnienie w układach nie-Manhattan. Rozkład uwagi sterowanej strukturą został obliczony zgodnie z Równaniem 1.
Równanie 1: 
gdzie A oznacza macierz agregacji uwagi sterowanej strukturą, Q oznacza tensor zapytania (query) wygenerowany z cech wizualnych, K oznacza tensor klucza (key) wygenerowany z cech a priori SDF, V oznacza tensor wartości (value) wygenerowany z reprezentacji strukturalnych a priori, dk oznacza wymiar cech tensora klucza, λ oznacza adaptacyjny współczynnik wag strukturalnych używany do określenia pewności geometrycznej obszarów lokalnych i rozluźnienia sztywnych ograniczeń ortogonalnych w przestrzennych układach niemanhattańskich, a S oznacza macierz powinowactwa SDF. Dzielenie przez dk ustabilizowało skalę logitów uwagi i zapobiegło powstawaniu nadmiernie skoncentrowanych wag uwagi przy dużych wymiarach cech. Znormalizowana funkcja wykładnicza (patrz: Tabela materiałów) przekształciła zmodyfikowane wyniki podobieństwa w znormalizowany rozkład przestrzenny, co pozwoliło każdemu pikselowi agregować informacje strukturalne a priori w oparciu o spójność semantyczną i geometryczną. Taka konstrukcja wyjaśnia, dlaczego wygląd wizualny i priory teoretyczne granic architektonicznych są łączone na poziomie uwagi, a nie poprzez bezpośrednią konkatenację cech.
Graf topologii superpikseli został zbudowany na podstawie mapy cech wyrównanej strukturalnie. Mapę cech podzielono przy użyciu algorytmu generowania regionów przestrzennych. Liczbę superpikseli ustawiono na 256, współczynnik zwartości na 10, współczynnik wygładzania Gaussa na 1,0, a liczbę iteracji na 10. Ograniczenia bliskości przestrzennej wymuszono poprzez ustawienie wagi metryki odległości na stały stosunek 1,0 do odległości w przestrzeni kolorów cech podczas klastrowania, co pozwoliło na utrzymanie jednorodnego generowania węzłów na gęstych granicach szumu. Piksele o jednolitych odpowiedziach semantycznych zostały zagregowane w węzły superpikseli. Krawędzie grafu zbudowano zgodnie z relacjami sąsiedztwa przestrzennego, siłą powinowactwa SDF oraz ograniczeniami spójności geometrycznej współpłaszczyznowości. Proces budowy macierzy powinowactwa strukturalnego i łączności topologicznej przedstawiono na Rysunku 3, który obrazuje, w jaki sposób prowadzenie SDF zostało przekształcone w relacje przestrzenne na poziomie grafu.
Sformułowanie grafu wprowadzono w celu przekształcenia gęstego rozumowania na poziomie pikseli w rozumowanie przestrzenne na poziomie węzłów w obrębie jednorodnych regionów strukturalnych. Każdy węzeł superpiksela reprezentował lokalny obszar o podobnej odpowiedzi semantycznej i ciągłości przestrzennej, podczas gdy każda krawędź reprezentowała niezawodną ścieżkę transmisji cech, podlegającą ograniczeniom sąsiedztwa, powinowactwa pola odległości oraz spójności koplanarnej. Taka konstrukcja ograniczyła wpływ izolowanych szumów pikselowych i umożliwiła przysłoniętym regionom ścian, podłóg i sufitów odbieranie komunikatów z fizycznie sąsiednich węzłów. Konstrukcja krawędzi służyła zatem jako matematyczny pomost pomiędzy ciągłym prowadzeniem SDF a dyskretnym, nieeuklidesowym rozumowaniem grafowym.
Skonfigurowano trójwarstwową grafową splotową sieć rozumowania z wymiarami cech ukrytych wynoszącymi 512, 256 i 128. Grafowa warstwa splotowa przeprowadzała wygładzanie cech w strukturze grafu w oparciu o relacje przestrzenne węzłów. Autopętla macierzy sąsiedztwa pozwalała zachować pierwotny stan każdego węzła podczas przekazywania komunikatów, zapobiegając usunięciu cech niewielkiego regionu strukturalnego przez otaczające go duże regiony. Symetryczna normalizacja skalowała elementy macierzy sąsiedztwa przez iloczyn odwrotności pierwiastków kwadratowych stopni węzłów, aby węzły o wysokim i niskim stopniu wnosiły wkład o zbliżonej wartości liczbowej podczas propagacji. Propagacja w przód realizowała lokalną agregację przestrzenną, w której stan każdego węzła absorbował wysokowymiarowe cechy z sąsiednich klastrów współpłaszczyznowych przed zastosowaniem elementowej nieliniowej funkcji prostowania. Taka konstrukcja sprawiła, że grafowa warstwa splotowa przybliżała dyfuzję semantyczną wzdłuż fizycznie znaczących płaszczyzn wewnętrznych, zamiast nieograniczonego wygładzania ponad granicami niepowiązanych obiektów. Cechy węzłów grafu oceniano zgodnie z Równaniem 2.
Równanie 2: 
Projekcja z gęstych cech pikseli na węzły superpikseli, przekazywanie wiadomości za pomocą splotu grafowego oraz odwrotna projekcja współrzędnych zostały przedstawione na Rysunku 4, co wyjaśnia ścieżkę agregacji cech od regularnych siatek obrazu do topologii nieeuklidesowej i z powrotem do gęstej reprezentacji semantycznej. Projekcja z gęstych cech pikseli na Rysunku 4A na węzły superpikseli na Rysunku 4B, przekazywanie wiadomości za pomocą splotu grafowego na Rysunku 4C oraz odwrotna projekcja współrzędnych na Rysunku 4D wyjaśniają ścieżkę agregacji cech od regularnych siatek obrazu do topologii nieeuklidesowej i z powrotem do gęstej reprezentacji semantycznej.
gdzie H(l) oznacza tensor cech węzłów l-tej warstwy splotu grafowego, Â oznacza macierz sąsiedztwa z połączeniami samopętlowymi, D oznacza macierz stopni odpowiadającą macierzy sąsiedztwa, W(l) oznacza uczną macierz wag l-tej warstwy splotu grafowego, a σ oznacza funkcję aktywacji ReLU (Rectified Linear Unit). Termin ÂH(l) agreguje cechy z sąsiednich węzłów superpikseli, natomiast D−1/2 i D−1/2 balansują wkład węzłów o różnej gęstości połączeń. Uczna macierz W(l) rzutuje zagregowane cechy węzłów do nowej przestrzeni semantycznej, co pozwala warstwie grafowej odróżnić spójność strukturalną od zwykłego sąsiedztwa przestrzennego. Nieliniowa aktywacja zachowuje różnice w odpowiedziach między obszarami koplanarnymi a niekoplanarnymi po agregacji cech.
Cechy segmentacji semantycznej zostały zdekodowane po wnioskowaniu grafowym. Dekoder skonstruowano z trzech etapów upsamplingu z interpolacją biliniową oraz operacji fuzji z połączeniami pomijającymi (skip-connections) między warstwami. Płytkie cechy przestrzenne kodera zostały połączone z wysokopoziomowymi semantycznymi cechami dekodera poprzez fuzję kanałową. Rozdzielczość cech przywrócono do pierwotnego rozmiaru obrazu, a końcowa mapa przewidywania prawdopodobieństwa semantycznego została wygenerowana za pomocą warstwy splotu 1 × 1.
Pełna sieć analizy semantycznej została wytrenowana przy użyciu optymalizatora z rozdzielonymy zanikiem wag (weight-decay) (patrz Tabela Materiałów). Początkowa szybkość uczenia została ustawiona na 0,0001, współczynnik zaniku wag na 0,01, a rozmiar serii (batch size) na 8 dla obu publicznych zestawów referencyjnych. Współczynnik zaniku pierwszego momentu ustawiono na 0,9, współczynnik zaniku drugiego momentu na 0,999, a współczynnik epsilon dla stabilności numerycznej na 1 × 10⁻8. Stratę walidacyjną monitorowano po każdej epoce, a punkty kontrolne (checkpoints) zapisywano w momencie wzrostu mIoU na zbiorze walidacyjnym. Sieć była trenowana przez 300 epok przy użyciu wielomianowej strategii zaniku szybkości uczenia z potęgą zaniku równą 0,9. Przeprowadzono pięć niezależnych procesów trenowania z różnymi losowymi inicjacjami ziarna (random-seed), aby stworzyć statystycznie rygorystyczną bazę oceny. Sieć optymalizowano wspólnie, wykorzystując stratę entropii krzyżowej na poziomie pikseli oraz stratę spójności strukturalnej. Wszystkie eksperymenty wykonano na platformie obliczeniowej wyposażonej w sprzęt do obliczeń równoległych o dużej pojemności pamięci; szczegółowe informacje o sprzęcie podano w Tabeli Materiałów.
Wspólna optymalizacja wymusiła geometryczne wyrównanie granic poprzez obliczenie wielkości gradientu przestrzennego tensora prawdopodobieństwa klasy. Strata spójności strukturalnej została wykorzystana jako regulator, mnożąc normę gradientów przestrzennych predykcji przez ciągłe wartości SDF. Uzasadnienie matematyczne polegało na tym, że zmiany kategorii semantycznej powinny koncentrować się w pobliżu rzeczywistych konturów architektonicznych, gdzie SDF dąży do zera, podczas gdy wnętrza płaskich ścian, podłóg i sufitów powinny zachowywać gładkie odpowiedzi semantyczne. Gdy pojawiał się duży gradient predykcji daleko od granicy strukturalnej, człon pola dystansu zwiększał karę i zniechęcał do fałszywych przejść semantycznych wewnątrz jednorodnej płaszczyzny fizycznej. Gdy gradient predykcji pojawił się w pobliżu konturu o zerowym dystansie, kara pozostawała ograniczona i zachowywała uzasadnione przejścia klas wzdłuż granic architektonicznych. Regiony przejścia semantycznego zostały ograniczone tak, aby pokrywały się z konturami zerowego dystansu SDF, zgodnie z równaniem 3.
Równanie 3: 
gdzie Ltotal oznacza końcową funkcję celu optymalizacji, Lce oznacza stratę entropii krzyżowej na poziomie pikseli, Lscl oznacza stratę kary za spójność strukturalną, a α oznacza współczynnik wagowy straty strukturalnej. Termin entropii krzyżowej zapewniał semantyczny nadzór na poziomie pikseli za pomocą masek adnotacji, podczas gdy termin spójności strukturalnej narzucał regularyzację geometryczną z wykorzystaniem priorytetów architektonicznych. Współczynnik wagowy α równoważył rozpoznawanie kategorii i dopasowanie granic, zapobiegając przeuczeniu optymalizacji pod kątem dokładności lokalnych etykiet lub sztywnych konturów strukturalnych. Ten wspólny cel powiązał semantykę wizualną, spójność granic fizycznych oraz trenowalne parametry sieci w ramach jednolitego celu optymalizacji.