Conjuntos de dados de cenas RGB internas e suas anotações semânticas foram preparados antes do treinamento em rede. O conjunto de dados 3D interno em grande escala e o conjunto de dados de cenas internas RGB-D (veja a Tabela de Materiais) foram obtidos de seus repositórios oficiais. Cenas de aquisição internas contendo oclusão de móveis, variação de iluminação, interrupção de limites de paredes e layouts espaciais complexos foram mantidas para corresponder ao cenário de análise alvo. Rótulos semânticos foram convertidos em máscaras de anotação PNG indexadas de canal único, e todas as imagens RGB e máscaras semânticas foram redimensionadas para 512 × 512 pixels. A ampliação de dados online foi aplicada durante o treinamento, com inversão horizontal aleatória com probabilidade de 0,5, escala aleatória de brilho entre 0,8 e 1,2, e rotação aleatória entre −10° e +10° para ampliar a distribuição estrutural. Os canais RGB foram normalizados com valores médios de 0,485, 0,456 e 0,406 e valores de desvio padrão de 0,229, 0,224 e 0,225. O benchmark 3D interno em grande escala seguiu a divisão oficial de lançamento usada neste estudo, com 1201 cenas de treinamento e 312 cenas de validação para desenvolvimento e validação do modelo. O benchmark RGB-D de cenas internas seguiu o protocolo oficial de avaliação, com 795 imagens de treinamento e 654 imagens de teste. Nenhuma divisão adicional baseada em porcentagem foi aplicada a esses dois parâmetros públicos.
Uma rede visual de backbone hierárquica de transformadores de janela deslocada (veja a Tabela de Materiais) foi inicializada como a espinha dorsal do codificador de transformador de janela móvel. O tamanho da incorporação do patch foi configurado como 4 x 4 pixels. As dimensões de embedding dos quatro estágios hierárquicos foram definidas para 128, 256, 512 e 1024, e o número de blocos transformadores nos quatro estágios foi definido para 2, 2, 18 e 2. O tamanho da janela de atenção local foi definido para 7 x 7, e o número de cabeças de atenção foi definido para 4, 8, 16 e 32 para os quatro estágios hierárquicos. Funções de ativação contínua não lineares foram usadas dentro de todas as camadas de perceptron multicamadas. A reamostragem espacial foi realizada por meio de operações de fusão de patches, com um passo de 2 após cada estágio hierárquico. A arquitetura central da rede e os hiperparâmetros do módulo de inferência convolucional foram resumidos na Tabela 1.
A extração de características de autoatenção por janela deslocada era então realizada nos mapas de características de entrada. Cada mapa de características foi dividido em janelas locais não sobrepostas com dimensões espaciais de 7 × 7. A atenção regular das janelas e a atenção das janelas deslocadas eram alternadas entre blocos adjacentes de transformadores de janela deslocada. A distância de deslocamento cíclico foi definida para 3 pixels, e a codificação de viés posicional relativo foi aplicada em cada janela de atenção local. As características visuais locais foram agregadas por meio de autoatenção multi-cabeças para gerar representações hierárquicas e multi-escala.
Os prévios estruturais de Manhattan foram extraídos de imagens RGB internas. Segmentos estruturais de aresta foram detectados usando um algoritmo de detecção de segmentos de linha com consistência de gradiente, direção. As direções estruturais dominantes foram agrupadas por meio de um algoritmo de consenso amostral aleatório (RANSAC) (veja a Tabela de Materiais) baseado na estimativa do ponto de fuga. Três direções Manhattan mutuamente ortogonais foram reconstruídas para gerar a representação da caixa delimitadora 3D de Manhattan. A fronteira estrutural reconstruída foi convertida em um mapa SDF calculando a distância euclidiana mínima de cada pixel até o segmento de linha de fronteira mais próximo.
Características de atenção cruzada guiadas por estruturas foram geradas após a obtenção dos prévios visuais e SDF. A variedade de características visuais foi mapeada para o tensor de consulta Q através da matriz de transformação linear W subelemento Q da tampa de dupla cunhada R para a matriz de formação W subelemento Q da tampa de dupla cunhagem R para a matriz
de formação. O campo de distâncias contínuas antes foi mapeado para o tensor chave K e o tensor de valores V através das matrizes
de transformação , e a dimensão do modelo foi definida para 512. A modulação multi-cabeça dividia o espaço de projeção em 8 subespaços independentes, com cada cabeça tendo uma dimensão de 64. O layout espacial anterior projetou coordenadas discretas de píxeis em um campo potencial contínuo e gerou a matriz de afinidade estrutural S como um viés espacial aditivo explícito para modular a matriz de similaridade do produto escalar. O tensor de características visuais foi usado como fonte de consulta porque a análise semântica exige que cada localização visual recupere ativamente evidências estruturalmente consistentes do espaço geométrico de prévio. O SDF prior foi usado como chave e fonte de valor porque armazena distâncias contínuas de fronteira e pistas estruturais de dentro e fora derivadas do layout Manhattan. O termo produto escalar media a compatibilidade entre a aparência semântica e o prior geométrico, enquanto o termo estrutural aditivo λS deslocava os pesos da atenção para pixels no mesmo plano físico ou próximos ao mesmo contorno arquitetônico. O coeficiente λ representava a confiança no prior estrutural extraído e controlava até que ponto restrições ortogonais rígidas eram incorporadas à distribuição de atenção. Essa formulação reduziu a difusão de características transfronteiriças causada pela oclusão dos móveis e manteve o relaxamento adaptativo em layouts fora do Manhattan. A distribuição de atenção guiada pela estrutura foi calculada de acordo com a Equação 1.
Equação 1: 
onde A denota a matriz de agregação de atenção guiada pela estrutura, Q denota o tensor de consulta gerado a partir de características visuais, K denota o tensor chave gerado a partir de características anteriores SDF, V denota o tensor de valores gerado a partir de representações a priori estruturais, dk denota a dimensão de características do tensor chave, λ denota o coeficiente de ponderação estrutural adaptativa usado para identificar a confiança geométrica de regiões locais e relaxar restrições ortogonais rígidas em espaços fora de Manhattan layouts, e S denota a matriz de afinidade SDF. A divisão por dk estabilizou a escala dos logits de atenção e impediu que grandes dimensões de características produzissem pesos de atenção excessivamente concentrados. A função exponencial normalizada (veja a Tabela de Materiais) transformava as pontuações de similaridade moduladas em uma distribuição espacial normalizada, permitindo que cada pixel agregasse informações estruturais a priori com base na consistência semântica e geométrica. Esse design explica por que a aparência visual e os priors de limites arquitetônicos são fundidos no nível de atenção, em vez de por concatenação direta de características.
O grafo de topologia superpixel foi construído a partir do mapa de características alinhado à estrutura. O mapa de características foi segmentado usando um algoritmo de geração de regiões espaciais. O número de superpixels foi definido para 256, o coeficiente de compacidade para 10, o coeficiente de suavização gaussiano para 1,0 e o número de iteração para 10. Restrições de proximidade espacial foram aplicadas ao definir o peso métrico de distância para uma razão constante de 1,0 em relação à distância entre espaço de cor e característica durante o agrupamento, mantendo assim uma geração uniforme de nós ao longo dos limites de denso clutter (clutter denso). Pixels com respostas semânticas homogêneas foram agregados em nós superpixel. As arestas dos grafos foram construídas de acordo com relações de adjacência espacial, força de afinidade SDF e restrições de consistência geométrica coplanar. O processo de construção da matriz de afinidade estrutural e da conectividade topológica é mostrado na Figura 3, que apresenta como a orientação SDF foi transformada em relações espaciais em nível de grafo.
A formulação de grafos foi introduzida para converter raciocínio denso pixelado em raciocínio espacial por nós sobre regiões estruturais homogêneas. Cada nó superpixel representava uma região local com resposta semântica e continuidade espacial semelhantes, enquanto cada aresta representava um caminho confiável para transmissão de características, sujeito a restrições de adjacência, afinidade de campo de distância e consistência coplanar. Esse design reduziu a influência de pixels isolados e ruidosos e permitiu que regiões obstruídas de paredes, pisos e tetos recebessem mensagens de nós fisicamente adjacentes. A construção de aresta, portanto, servia como uma ponte matemática entre a orientação contínua de SDF e o raciocínio discreto de grafos não euclidianos.
Uma rede de raciocínio convolucional de grafos de três camadas foi configurada com dimensões de características ocultas de 512, 256 e 128. A camada convolucional do grafo realizava suavização de características sobre a estrutura do grafo com base nas relações espaciais dos nós. A adjacência em auto-loop manteve o estado original de cada nó durante a passagem da mensagem, impedindo que as características de uma pequena região estrutural fossem apagadas por grandes regiões ao redor. A normalização simétrica escalou os elementos da matriz de adjacência pelo produto das raízes quadradas inversas dos graus dos nós, de modo que nós de alto e baixo grau contribuíram sob magnitudes numéricas comparáveis durante a propagação. A propagação por avanço realizou agregação espacial localizada, na qual cada estado do nó absorveu características de alta dimensão de agrupamentos coplanares adjacentes antes da aplicação da função de retificação não linear elemento a elemento. Essa formulação fazia com que a camada de convolução do grafo aproximasse a difusão semântica ao longo de planos internos fisicamente significativos, em vez de suavizar sem restrições sobre os limites de objetos não relacionados. As características dos nós do grafo foram avaliadas de acordo com a Equação 2.
Equação 2: 
A projeção de características densas de pixels para nós superpixel, passagem de mensagens por convolução de grafos e retroprojeção de coordenadas são apresentadas na Figura 4, esclarecendo o caminho de agregação de características de grades de imagem regulares para uma topologia não euclidiana e de volta para uma representação semântica densa. A projeção de características de pixels densos na Figura 4A para nós superpixels na Figura 4B, a passagem de mensagens de convolução de grafo na Figura 4C e a retroprojeção de coordenadas na Figura 4D clarificam o caminho de agregação de características das grades regulares de imagem para uma topologia não euclidiana e de volta para uma representação semântica densa.
onde H(l) denota o tensor de características do nó da camada de convolução do grafo l, Â denota a matriz de adjacência com conexões de auto-laço, D denota a matriz de graus correspondente à matriz de adjacência, W(l) denota a matriz de pesos aprendível da camada de convolução do grafo l-ésimo, e σ denota a função de ativação da Unidade Linear Retificada. O termo ÂH(l) agregava características de nós superpixel adjacentes, enquanto D−1/2 e D−1/2 equilibravam a contribuição dos nós com diferentes densidades de conexão. A matriz aprendível W(l) projetava características agregadas do nó em um novo espaço semântico, permitindo que a camada do grafo distinguisse consistência estrutural da proximidade espacial comum. A ativação não linear preservou a diferença nas respostas entre regiões coplanares e não coplanares após a agregação de características.
As características de segmentação semântica foram decodificadas após o raciocínio de grafos. O decodificador foi construído usando três estágios bilineares de interpolação para upsampling e operações de fusão por conexão de salto entre camadas. Características superficiais do codificador espacial foram concatenadas com características semânticas de alto nível do decodificador por meio da fusão canal a canal. A resolução das características foi restaurada ao tamanho original da imagem, e o mapa final de previsão semântica de probabilidade foi gerado por meio de uma camada de convolução 1 × 1.
A rede semântica completa de análise sintática foi treinada usando um otimizador de decaimento de peso desacoplado (veja a Tabela de Materiais). A taxa inicial de aprendizado foi definida para 0,0001, o coeficiente de decaimento de peso para 0,01 e o tamanho do lote para 8 para ambos os benchmarks públicos. A taxa de decaimento do primeiro momento foi definida para 0,9, a taxa de decaimento do segundo momento foi fixada em 0,999, e o coeficiente numérico de estabilidade épsilon foi fixado em 1 × 10⁻8. A perda de validação era monitorada ao final de cada época, e os pontos de verificação eram salvos quando o mIoU no conjunto de validação aumentava. A rede foi treinada por 300 épocas usando uma estratégia de decaimento da taxa de aprendizado polinomial com um poder de decaimento de 0,9. Cinco treinamentos independentes foram realizados usando diferentes inicializações de semente aleatória para estabelecer uma linha de base de avaliação estatisticamente rigorosa. A rede foi otimizada conjuntamente usando perda de entropia cruzada em nível de pixel e perda de consistência estrutural. Todos os experimentos foram realizados em uma plataforma computacional equipada com hardware paralelo de alta memória, e informações detalhadas de hardware foram reportadas na Tabela de Materiais.
A otimização conjunta impôs o alinhamento geométrico dos limites calculando a magnitude do gradiente espacial do tensor de probabilidade de classe. A perda de consistência estrutural foi usada como regularizador, multiplicando a norma dos gradientes de predição espacial pelos valores contínuos de SDF. A justificativa matemática era que as mudanças semânticas de categorias deveriam se concentrar próximo a contornos arquitetônicos reais, onde a SDF se aproxima de zero, enquanto interiores planos de paredes, pisos e tetos deveriam manter respostas semânticas suaves. Quando um grande gradiente de previsão aparecia longe de uma fronteira estrutural, o termo campo de distância aumentava a penalidade e desencorajava transições semânticas falsas dentro de um plano físico homogêneo. Quando um gradiente de previsão aparecia próximo a um contorno de distância zero, a penalidade permanecia limitada e preservava transições legítimas de classe ao longo dos limites arquitetônicos. Regiões de transição semântica foram restringidas a se alinhar com os contornos de distância zero da SDF, conforme indicado pela Equação 3.
Equação 3: 
onde Ltotal denota a função objetivo final de otimização, Lce denota a perda cruzada de entropia em nível de pixel, Lscl denota a perda de penalidade de consistência estrutural e α denota o coeficiente de ponderação de perda estrutural. O termo de entropia cruzada fornecia supervisão semântica em nível de pixel por meio de máscaras de anotação, enquanto o termo de consistência estrutural impunha regularização geométrica usando priors arquitetônicos. O coeficiente de ponderação α reconhecimento de categorias balanceadas e alinhamento de fronteiras, impedindo que a otimização sobreajuste tanto a precisão local do rótulo quanto contornos estruturais rígidos. Esse objetivo conjunto ligava semântica visual, consistência física de fronteira e parâmetros de rede treináveis dentro de um alvo unificado de otimização.