Artigo de investigação

Um método de análise semântica para imagens de cenas internas baseado em conhecimento prévio da estrutura do edifício

29 vistas

DOI:

10.3791/72054

11 de agosto de 2026

Neste artigo

Resumo

Este estudo propõe um algoritmo que acopla de forma rígida as características visuais hierárquicas capturadas por um codificador transformador hierárquico de janela deslocada com a profundidade prévia da caixa delimitadora 3D Manhattan gerada pela detecção de segmentos de linha, alcançando assim a reconstrução semântica de alta precisão de cenas internas complexas.

Resumo

Para abordar descontinuidades de predição semântica e distorções físicas de fronteira causadas pela oclusão de móveis em cenas internas complexas, este artigo propõe um método de análise semântica que aproveita os prévios estrutura-edifício. O esquema utiliza um codificador hierárquico de transformador com janelas deslocadas para extrair características visuais multiescala e combina um algoritmo de detecção de segmentos de linha com consistência gradiente-direção para construir uma caixa delimitadora 3D Manhattan. Essa caixa delimitadora é transformada em um campo de distância assinado (SDF) antes de codificar contornos geométricos discretos em um campo contínuo de potencial físico. Um mecanismo de atenção cruzada guiado pela estrutura força os sinais visuais a se alinharem com limites geométricos ortogonais 3D reais, restaurando a continuidade das características em áreas ocluidas. Um grafo de adjacência espacial construído a partir de nós superpixel impulsiona uma Rede Convolucional de Grafos (GCN) para agregar características, garantindo consistência semântica macroscópica dentro do plano físico de suporte. Uma combinação de perda de entropia cruzada em nível de pixel e uma perda estrutural de consistência projetada sob medida fortalece as restrições, penalizando previsões fora dos limites. Experimentos em múltiplas execuções independentes mostram que a interseção média sobre união (mIoU) atinge 68,7% com desvio padrão de 0,2%, e a pontuação F1 do limite estrutural chega a 76,4% com desvio padrão de 0,3%, confirmando o desempenho robusto dos módulos propostos. Com um único nó de imagem de 256, o tempo médio de inferência permaneceu em 61 ms.

Introdução

A análise semântica de imagens de cenas internas ocupa uma posição central em tarefas de cognição espacial tridimensional e raciocínio espacialinteligente 1,2. A extração de características visuais em ambientes físicos reais é frequentemente severamente prejudicada por layouts espaciaiscomplexos 3. Resolver a descontinuidade semântica e a distorção física dos limites da estrutura da fundação do edifício causada pela oclusão em grande escala de móveis é importante para a pesquisa em cogniçãoespacial 4,5. Remover com precisão interferências de objetos desordenados e restaurar a continuidade física da mesma parede e piso determinará diretamente a precisão da reconstrução tridimensional da cena e da análise lógica espacialglobal 6. A descontinuidade semântica causada pela oclusão em grande escala de móveis e o efeito de reparo estrutural da orientação prévia proposta para edifícios são ilustrados na Figura 1, onde a entrada ocluida vermelho-verde-azul (RGB) na Tabela 1A, a distorção da máscara de base na Figura 1B e o resultado de reparo prévio da estrutura na Figura 1C são comparados sob a mesma condição interna da cena.

Para atender aos requisitos de precisão do raciocínio lógico espacial, as redes visuais atuais baseadas em pixels enfrentam múltiplos obstáculos ao lidar com ambientes internoscomplexos 7,8. Os espaços internos costumam ser preenchidos com móveis densos e móveis bagunçados, resultando em uma perda significativa de sinais de limites visuais em baixo nível nasimagens 9. Mecanismos convencionais de extração de características dependem excessivamente de respostas locais bidimensionais de cor e textura, carecendo de uma compreensão macroscópica das leis ortogonais rígidas das estruturas tridimensionais feitaspelo homem 10. Essa limitação do campo receptivo local torna a propagação de características facilmente interrompida, dificultando a extensão da topologia global através dasoclusões 11. Atualmente, há uma necessidade urgente de resolver o problema central das descontinuidades da predição semântica e das distorções severas das fronteiras físicas causadas pela oclusão einterferência 12.

Para corrigir falhas estruturais nas fundações dos edifícios causadas por oclusão e interferência, a comunidade acadêmica desenvolveu uma variedade de medidas de intervençãodirecionadas 13. Redes de agregação de características intermodais compensam efetivamente as deficiências inerentes de uma única modalidade visual na percepção espacial ao introduzir mapas de profundidade ou priors de texto para auxiliar com imagens vermelho-verde-azul (RGB) 14,15. Estruturas de percepção de limites e seleção adaptativa de contexto injetam estratégias de aprimoramento físico de contornos na etapa de decodificação de características, o que melhora muito o ajuste das bordas dos resultados de previsão em cenascomplexas 16,17. Modelos de inferência baseados em GCNs e mecanismos de interação de características melhoram significativamente a suavidade das características e a consistência macrosemântica em regiões homogêneas ao construir conexões em nível denó 18,19. Integrar priors estruturais explícitos de Manhattan no pipeline de extração de características visuais impõe limites de consistência geométrica, o que resolve os desafios de descontinuidade causados pela extensa oclusão de objetos em primeiroplano 20.

Para enfrentar o desafio central das falhas de predição semântica e das distorções severas dos limites físicos associados à infraestrutura de construção, é proposto um arcabouço de análise semântica baseado em um mecanismo de acoplamento em malha fechada incorporando priors arquitetônicos. Essa estrutura transcende pipelines ingênuos de engenharia ao estabelecer um alinhamento bidirecional de mapeamento entre campos geométricos contínuos de potencial e variedades visuais discretas, formando uma sinergia não trivial que corrige erros de oclusão por meio de leis estruturais. Esse esquema depende de uma rede de espinha dorsal visual multiescala e de um algoritmo de detecção de segmentos de linha baseado na estimativa do ponto de fuga, para adquirir características de aparência local e priors ortogonais de arestas que representam a caixa delimitadora 3D Manhattan em paralelo, e então transformá-los em um SDF. O algoritmo emprega um mecanismo de atenção cruzada guiado pela estrutura, usando características visuais como vetores de consulta e tratando características SDF como chaves e valores para cálculos do produto escalar, forçando assim o sinal visual a se alinhar com a fronteira geométrica 3D real no espaço de características. Um grafo de adjacência espacial construído a partir de nós superpixel e características de borda de coplanaridade espacial é alimentado em um GCN para realizar agregação de características entre nós e passagem de mensagens. O processo de otimização de parâmetros de ponta a ponta emprega conjuntamente entropia cruzada em nível de pixel e uma função personalizada de perda de consistência estrutural, que restringe e penaliza estritamente os pixels previstos que cruzam a fronteira prévia do prédio. O pipeline completo de análise semântica é resumido na Figura 2, que conecta entrada de imagem RGB, extração geométrica de prévios, alinhamento de atenção cruzada, raciocínio de grafos superpixels e decodificação semântica de máscaras dentro de uma arquitetura unificada.

As primeiras redes de análise de cenas dependiam de operações convolucionais para capturar texturas de aparência local, mas devido a limitações nos campos receptivos locais, apresentavam coerência semântica insuficiente de alvosem grande escala 21,22. Estudos anteriores aplicaram o módulo de autoatenção da arquitetura visual Transformer para extrair informações contextuais globais e construir características de associação de pixels de longadistância 23,24. Estratégias de agregação de características multi-modais multi-view extraem as características geométricas espaciais tridimensionais da cena fundindo nuvens de pontos do mapa de profundidade e entradas de comandode texto 25,26. Mecanismos híbridos de atenção para fusão de características direcionando domínios específicos amadureceram gradualmente. Ao construir pontes de interação de características, elas reduziram significativamente a perda de energia e a escassez de características na transmissão multiescala de sinais visuais e melhoraram a robustez da análise sintática de estruturas complexas. Projetos de codificadores de ponta integram e inferem conjuntamente detalhes espaciais do domínio de alta frequência junto com características globais e locais, fortalecendo a capacidade da rede de distinguir categorias semânticas de grão fino com alta semelhança e melhorando a precisão da análise sintática interna27,28. Avanços recentes em arquiteturas de segmentação semântica fornecem referências valiosas para otimizar a eficiência computacional e a percepção espacial. Modelos projetados para previsão densa e agregação contextual em múltiplas escalas extraem características geométricas de grão fino de fundos complexos. Estratégias de desacoplamento de características e fusão sinérgica abordam a ambiguidade semântica nas regiões de fronteira. Mecanismos de atenção leves e módulos de agregação com gate otimizam a distribuição dos parâmetros, acelerando assim a inferência enquanto preservam os detalhes estruturais locais. A implementação desses projetos arquitetônicos eficientes oferece orientações teóricas para reduzir a sobrecarga computacional das operações de inferência topológica não euclidianas na análise sintática de cenas internas.

Os prévios da estrutura do edifício e a estimativa de layout 3D são usados para corrigir erros locais de análise visual29. Estudos anteriores extraíram características geométricas ortogonais e paralelas de edifícios internos como restrições de inferência para reduzir o viés de previsão de redes causado por fundos internossobrecarregados 30,31. Esquemas existentes utilizam algoritmos de detecção de segmentos de linha e técnicas de análise de pontos de ablação de imagem para gerar caixas delimitadoras 3D Manhattan, mapeando os limites físicos das salas e auxiliando na localização das características visuaissubjacentes 32. A arquitetura conjunta do módulo de consciência de fronteira e o contexto multiescala incorporam implicitamente informações estruturais prévias no processo de decodificação de características de alta dimensão, forçando a rede a produzir máscaras semânticas que correspondam de perto aos contornos físicos reais, melhorando efetivamente a irregularidade e o desfoque das bordas dos objetos33. Projetos de função de perda semi-supervisionados ou fracamente supervisionados com propriedades de realce de limites têm sido amplamente explorados. Baseando-se em fórmulas matemáticas rigorosas para punir comportamentos independentes de classificação de pixels que violam regras topológicas espaciais, a suavidade geométrica e a integridade estrutural do resultado final da segmentação são garantidas pela fonte da otimizaçãode gradiente 34.

Alguns estudos utilizaram redes neurais de grafos para realizar agregação cruz de domínios de características visuais e raciocínio sobre relações topológicas em espaços de altadimensão 35. O algoritmo de segmentação superpixel pré-agrega blocos de pixels adjacentes com resposta de cor e características de textura semelhantes em nós conectados independentes. O algoritmo de segmentação superpixel comprime a redundância computacional da estrutura do grafo no nível da imagem e preserva a topologia geométrica básica daimagem 36. O GCN, construído sobre o vetor de características de nós de alta dimensão, e a matriz de adjacência representando proximidade espacial, impulsiona a transmissão direcional eficiente e a fusão interativa de informações visuais multiescala ao longo do grafo físico conexo no domínioespacial 37,38. A aplicação do módulo de aprimoramento temporal de informações e do mecanismo híbrido de salto multiescala suprime o suavizamento excessivo e a homogeneização das características dos nós geradas no processo de passagem de mensagens profundas em múltiplascamadas 39. A tecnologia de transformação wavelet de grafo multiescala e a estratégia de otimização de aprendizado de elementos pseudo-rótulos otimizam o mecanismo anti-ruído de fundo da fórmula de atualização de características de nós, de modo que características com os mesmos atributos semânticos mantenham um modo de resposta cooperativa na topologia complexade rede 40. O mecanismo de raciocínio baseado em grafos mapeia grades de pixels regulares para espaços topológicos não euclidianos para realizar cálculos de agregação de características de estruturas edificais irregulares e componentesinternos 41.

Protocolo

Conjuntos de dados de cenas RGB internas e suas anotações semânticas foram preparados antes do treinamento em rede. O conjunto de dados 3D interno em grande escala e o conjunto de dados de cenas internas RGB-D (veja a Tabela de Materiais) foram obtidos de seus repositórios oficiais. Cenas de aquisição internas contendo oclusão de móveis, variação de iluminação, interrupção de limites de paredes e layouts espaciais complexos foram mantidas para corresponder ao cenário de análise alvo. Rótulos semânticos foram convertidos em máscaras de anotação PNG indexadas de canal único, e todas as imagens RGB e máscaras semânticas foram redimensionadas para 512 × 512 pixels. A ampliação de dados online foi aplicada durante o treinamento, com inversão horizontal aleatória com probabilidade de 0,5, escala aleatória de brilho entre 0,8 e 1,2, e rotação aleatória entre −10° e +10° para ampliar a distribuição estrutural. Os canais RGB foram normalizados com valores médios de 0,485, 0,456 e 0,406 e valores de desvio padrão de 0,229, 0,224 e 0,225. O benchmark 3D interno em grande escala seguiu a divisão oficial de lançamento usada neste estudo, com 1201 cenas de treinamento e 312 cenas de validação para desenvolvimento e validação do modelo. O benchmark RGB-D de cenas internas seguiu o protocolo oficial de avaliação, com 795 imagens de treinamento e 654 imagens de teste. Nenhuma divisão adicional baseada em porcentagem foi aplicada a esses dois parâmetros públicos.

Uma rede visual de backbone hierárquica de transformadores de janela deslocada (veja a Tabela de Materiais) foi inicializada como a espinha dorsal do codificador de transformador de janela móvel. O tamanho da incorporação do patch foi configurado como 4 x 4 pixels. As dimensões de embedding dos quatro estágios hierárquicos foram definidas para 128, 256, 512 e 1024, e o número de blocos transformadores nos quatro estágios foi definido para 2, 2, 18 e 2. O tamanho da janela de atenção local foi definido para 7 x 7, e o número de cabeças de atenção foi definido para 4, 8, 16 e 32 para os quatro estágios hierárquicos. Funções de ativação contínua não lineares foram usadas dentro de todas as camadas de perceptron multicamadas. A reamostragem espacial foi realizada por meio de operações de fusão de patches, com um passo de 2 após cada estágio hierárquico. A arquitetura central da rede e os hiperparâmetros do módulo de inferência convolucional foram resumidos na Tabela 1.

A extração de características de autoatenção por janela deslocada era então realizada nos mapas de características de entrada. Cada mapa de características foi dividido em janelas locais não sobrepostas com dimensões espaciais de 7 × 7. A atenção regular das janelas e a atenção das janelas deslocadas eram alternadas entre blocos adjacentes de transformadores de janela deslocada. A distância de deslocamento cíclico foi definida para 3 pixels, e a codificação de viés posicional relativo foi aplicada em cada janela de atenção local. As características visuais locais foram agregadas por meio de autoatenção multi-cabeças para gerar representações hierárquicas e multi-escala.

Os prévios estruturais de Manhattan foram extraídos de imagens RGB internas. Segmentos estruturais de aresta foram detectados usando um algoritmo de detecção de segmentos de linha com consistência de gradiente, direção. As direções estruturais dominantes foram agrupadas por meio de um algoritmo de consenso amostral aleatório (RANSAC) (veja a Tabela de Materiais) baseado na estimativa do ponto de fuga. Três direções Manhattan mutuamente ortogonais foram reconstruídas para gerar a representação da caixa delimitadora 3D de Manhattan. A fronteira estrutural reconstruída foi convertida em um mapa SDF calculando a distância euclidiana mínima de cada pixel até o segmento de linha de fronteira mais próximo.

Características de atenção cruzada guiadas por estruturas foram geradas após a obtenção dos prévios visuais e SDF. A variedade de características visuais foi mapeada para o tensor de consulta Q através da matriz de transformação linear W subelemento Q da tampa de dupla cunhada R para a matriz de formação W subelemento Q da tampa de dupla cunhagem R para a matriz figure-protocol-1de formação. O campo de distâncias contínuas antes foi mapeado para o tensor chave K e o tensor de valores V através das matrizes figure-protocol-2de transformação , e a dimensão do modelo foi definida para 512. A modulação multi-cabeça dividia o espaço de projeção em 8 subespaços independentes, com cada cabeça tendo uma dimensão de 64. O layout espacial anterior projetou coordenadas discretas de píxeis em um campo potencial contínuo e gerou a matriz de afinidade estrutural S como um viés espacial aditivo explícito para modular a matriz de similaridade do produto escalar. O tensor de características visuais foi usado como fonte de consulta porque a análise semântica exige que cada localização visual recupere ativamente evidências estruturalmente consistentes do espaço geométrico de prévio. O SDF prior foi usado como chave e fonte de valor porque armazena distâncias contínuas de fronteira e pistas estruturais de dentro e fora derivadas do layout Manhattan. O termo produto escalar media a compatibilidade entre a aparência semântica e o prior geométrico, enquanto o termo estrutural aditivo λS deslocava os pesos da atenção para pixels no mesmo plano físico ou próximos ao mesmo contorno arquitetônico. O coeficiente λ representava a confiança no prior estrutural extraído e controlava até que ponto restrições ortogonais rígidas eram incorporadas à distribuição de atenção. Essa formulação reduziu a difusão de características transfronteiriças causada pela oclusão dos móveis e manteve o relaxamento adaptativo em layouts fora do Manhattan. A distribuição de atenção guiada pela estrutura foi calculada de acordo com a Equação 1.

Equação 1: figure-protocol-3

onde A denota a matriz de agregação de atenção guiada pela estrutura, Q denota o tensor de consulta gerado a partir de características visuais, K denota o tensor chave gerado a partir de características anteriores SDF, V denota o tensor de valores gerado a partir de representações a priori estruturais, dk denota a dimensão de características do tensor chave, λ denota o coeficiente de ponderação estrutural adaptativa usado para identificar a confiança geométrica de regiões locais e relaxar restrições ortogonais rígidas em espaços fora de Manhattan layouts, e S denota a matriz de afinidade SDF. A divisão por dk estabilizou a escala dos logits de atenção e impediu que grandes dimensões de características produzissem pesos de atenção excessivamente concentrados. A função exponencial normalizada (veja a Tabela de Materiais) transformava as pontuações de similaridade moduladas em uma distribuição espacial normalizada, permitindo que cada pixel agregasse informações estruturais a priori com base na consistência semântica e geométrica. Esse design explica por que a aparência visual e os priors de limites arquitetônicos são fundidos no nível de atenção, em vez de por concatenação direta de características.

O grafo de topologia superpixel foi construído a partir do mapa de características alinhado à estrutura. O mapa de características foi segmentado usando um algoritmo de geração de regiões espaciais. O número de superpixels foi definido para 256, o coeficiente de compacidade para 10, o coeficiente de suavização gaussiano para 1,0 e o número de iteração para 10. Restrições de proximidade espacial foram aplicadas ao definir o peso métrico de distância para uma razão constante de 1,0 em relação à distância entre espaço de cor e característica durante o agrupamento, mantendo assim uma geração uniforme de nós ao longo dos limites de denso clutter (clutter denso). Pixels com respostas semânticas homogêneas foram agregados em nós superpixel. As arestas dos grafos foram construídas de acordo com relações de adjacência espacial, força de afinidade SDF e restrições de consistência geométrica coplanar. O processo de construção da matriz de afinidade estrutural e da conectividade topológica é mostrado na Figura 3, que apresenta como a orientação SDF foi transformada em relações espaciais em nível de grafo.

A formulação de grafos foi introduzida para converter raciocínio denso pixelado em raciocínio espacial por nós sobre regiões estruturais homogêneas. Cada nó superpixel representava uma região local com resposta semântica e continuidade espacial semelhantes, enquanto cada aresta representava um caminho confiável para transmissão de características, sujeito a restrições de adjacência, afinidade de campo de distância e consistência coplanar. Esse design reduziu a influência de pixels isolados e ruidosos e permitiu que regiões obstruídas de paredes, pisos e tetos recebessem mensagens de nós fisicamente adjacentes. A construção de aresta, portanto, servia como uma ponte matemática entre a orientação contínua de SDF e o raciocínio discreto de grafos não euclidianos.

Uma rede de raciocínio convolucional de grafos de três camadas foi configurada com dimensões de características ocultas de 512, 256 e 128. A camada convolucional do grafo realizava suavização de características sobre a estrutura do grafo com base nas relações espaciais dos nós. A adjacência em auto-loop manteve o estado original de cada nó durante a passagem da mensagem, impedindo que as características de uma pequena região estrutural fossem apagadas por grandes regiões ao redor. A normalização simétrica escalou os elementos da matriz de adjacência pelo produto das raízes quadradas inversas dos graus dos nós, de modo que nós de alto e baixo grau contribuíram sob magnitudes numéricas comparáveis durante a propagação. A propagação por avanço realizou agregação espacial localizada, na qual cada estado do nó absorveu características de alta dimensão de agrupamentos coplanares adjacentes antes da aplicação da função de retificação não linear elemento a elemento. Essa formulação fazia com que a camada de convolução do grafo aproximasse a difusão semântica ao longo de planos internos fisicamente significativos, em vez de suavizar sem restrições sobre os limites de objetos não relacionados. As características dos nós do grafo foram avaliadas de acordo com a Equação 2.

Equação 2: figure-protocol-4

A projeção de características densas de pixels para nós superpixel, passagem de mensagens por convolução de grafos e retroprojeção de coordenadas são apresentadas na Figura 4, esclarecendo o caminho de agregação de características de grades de imagem regulares para uma topologia não euclidiana e de volta para uma representação semântica densa. A projeção de características de pixels densos na Figura 4A para nós superpixels na Figura 4B, a passagem de mensagens de convolução de grafo na Figura 4C e a retroprojeção de coordenadas na Figura 4D clarificam o caminho de agregação de características das grades regulares de imagem para uma topologia não euclidiana e de volta para uma representação semântica densa.

onde H(l) denota o tensor de características do nó da camada de convolução do grafo l, Â denota a matriz de adjacência com conexões de auto-laço, D denota a matriz de graus correspondente à matriz de adjacência, W(l) denota a matriz de pesos aprendível da camada de convolução do grafo l-ésimo, e σ denota a função de ativação da Unidade Linear Retificada. O termo ÂH(l) agregava características de nós superpixel adjacentes, enquanto D−1/2 e D−1/2 equilibravam a contribuição dos nós com diferentes densidades de conexão. A matriz aprendível W(l) projetava características agregadas do nó em um novo espaço semântico, permitindo que a camada do grafo distinguisse consistência estrutural da proximidade espacial comum. A ativação não linear preservou a diferença nas respostas entre regiões coplanares e não coplanares após a agregação de características.

As características de segmentação semântica foram decodificadas após o raciocínio de grafos. O decodificador foi construído usando três estágios bilineares de interpolação para upsampling e operações de fusão por conexão de salto entre camadas. Características superficiais do codificador espacial foram concatenadas com características semânticas de alto nível do decodificador por meio da fusão canal a canal. A resolução das características foi restaurada ao tamanho original da imagem, e o mapa final de previsão semântica de probabilidade foi gerado por meio de uma camada de convolução 1 × 1.

A rede semântica completa de análise sintática foi treinada usando um otimizador de decaimento de peso desacoplado (veja a Tabela de Materiais). A taxa inicial de aprendizado foi definida para 0,0001, o coeficiente de decaimento de peso para 0,01 e o tamanho do lote para 8 para ambos os benchmarks públicos. A taxa de decaimento do primeiro momento foi definida para 0,9, a taxa de decaimento do segundo momento foi fixada em 0,999, e o coeficiente numérico de estabilidade épsilon foi fixado em 1 × 10⁻8. A perda de validação era monitorada ao final de cada época, e os pontos de verificação eram salvos quando o mIoU no conjunto de validação aumentava. A rede foi treinada por 300 épocas usando uma estratégia de decaimento da taxa de aprendizado polinomial com um poder de decaimento de 0,9. Cinco treinamentos independentes foram realizados usando diferentes inicializações de semente aleatória para estabelecer uma linha de base de avaliação estatisticamente rigorosa. A rede foi otimizada conjuntamente usando perda de entropia cruzada em nível de pixel e perda de consistência estrutural. Todos os experimentos foram realizados em uma plataforma computacional equipada com hardware paralelo de alta memória, e informações detalhadas de hardware foram reportadas na Tabela de Materiais.

A otimização conjunta impôs o alinhamento geométrico dos limites calculando a magnitude do gradiente espacial do tensor de probabilidade de classe. A perda de consistência estrutural foi usada como regularizador, multiplicando a norma dos gradientes de predição espacial pelos valores contínuos de SDF. A justificativa matemática era que as mudanças semânticas de categorias deveriam se concentrar próximo a contornos arquitetônicos reais, onde a SDF se aproxima de zero, enquanto interiores planos de paredes, pisos e tetos deveriam manter respostas semânticas suaves. Quando um grande gradiente de previsão aparecia longe de uma fronteira estrutural, o termo campo de distância aumentava a penalidade e desencorajava transições semânticas falsas dentro de um plano físico homogêneo. Quando um gradiente de previsão aparecia próximo a um contorno de distância zero, a penalidade permanecia limitada e preservava transições legítimas de classe ao longo dos limites arquitetônicos. Regiões de transição semântica foram restringidas a se alinhar com os contornos de distância zero da SDF, conforme indicado pela Equação 3.

Equação 3: figure-protocol-5

onde Ltotal denota a função objetivo final de otimização, Lce denota a perda cruzada de entropia em nível de pixel, Lscl denota a perda de penalidade de consistência estrutural e α denota o coeficiente de ponderação de perda estrutural. O termo de entropia cruzada fornecia supervisão semântica em nível de pixel por meio de máscaras de anotação, enquanto o termo de consistência estrutural impunha regularização geométrica usando priors arquitetônicos. O coeficiente de ponderação α reconhecimento de categorias balanceadas e alinhamento de fronteiras, impedindo que a otimização sobreajuste tanto a precisão local do rótulo quanto contornos estruturais rígidos. Esse objetivo conjunto ligava semântica visual, consistência física de fronteira e parâmetros de rede treináveis dentro de um alvo unificado de otimização.

Resultados

Configuração Experimental

Este estudo utilizou dois conjuntos de dados padrão de análise de cenas internas, um conjunto de dados 3D interno em grande escala e um conjunto de dados RGB-D de cenas internas, para avaliar o desempenho e ajustar o modelo. O conjunto de dados 3D interno em grande escala contém cenas complexas de espaço físico escaneadas de forma realista e vistas RGB de alta resolução, fornecendo rótulos semânticos 3D de alta precisão, pixel a pixel, e máscaras de segmentação de projeção espacial 2D. Seus dados de reconstrução de grade em espaço físico inerentemente realistas e propriedades ortogonais do plano estabelecem um critério de comparação geométrica de verdade para construir com precisão a caixa delimitadora 3D de Manhattan no ramo de extração. O conjunto de dados RGB-D de cenas internas contém imagens de profundidade internas ocultas por móveis e desordem e é usado para testar a precisão e robustez global do raciocínio lógico da rede contra oclusões.

O algoritmo utiliza mIoU para medir a sobreposição espacial entre as distribuições semânticas previstas e verdadeiras, ao mesmo tempo em que introduz uma pontuação F1 de fronteira estrutural para avaliar rigorosamente a precisão do ajuste entre a máscara prevista e as arestas de estrutura física de distância zero calibradas pelo SDF. Um limiar fixo de erro de distância de pixel no espaço euclidiano é definido durante o cálculo para determinar se os pixels de borda produzidos pela rede intersectam os verdadeiros contornos físicos da fronteira dos edifícios. Esse sistema de avaliação dual limita erros de classificação em blocos semânticos de grande área enquanto fortalece a avaliação microquantitativa do efeito de reconstrução topológica de linhas rígidas. Para manter a consistência entre a configuração experimental dos dados e o processo de otimização, a escala do conjunto de dados e os hiperparâmetros de treinamento core foram resumidos na Tabela 2. A Tabela 2 relata uma configuração experimental autoritativa para o manuscrito revisado. O benchmark 3D indoor em grande escala usa 1201 cenas de treinamento e 312 cenas de validação, o benchmark RGB-D de cenas internas usa 795 imagens de treinamento e 654 imagens de teste, e ambos os benchmarks são treinados com tamanho de lote de 8, taxa inicial de aprendizado de 0,0001, coeficiente de decaimento de peso de 0,01 e 300 épocas de treinamento.

Comparação com métodos de ponta

Antes de apresentar uma tabela comparativa quantitativa dos algoritmos de análise de cenas internas, esta seção define rigorosamente os benchmarks de teste usados no sistema de avaliação multidimensional. Para refletir o desempenho de classificação do modelo em diferentes granularidades, o sistema de avaliação complementa o sistema de teste com duas métricas adicionais: precisão global de pixels (PixelAcc) e precisão de classe média (MeanAcc). Essas métricas juntas constroem um sistema detalhado de verificação de desempenho de algoritmos, estabelecendo uma referência teórica rigorosa para análises quantitativas subsequentes. Para avaliar a precisão da análise semântica e a robustez à oclusão do algoritmo proposto em espaços físicos complexos, foram realizados testes comparativos com algoritmos existentes no conjunto de validação de cenas internas RGB-D. A biblioteca de modelos de comparação abrange frameworks fundamentais de máscara-atenção, Transformers de visão hierárquica, pipelines modernos de segmentação convolucional pura, arquiteturas unificadas de previsão densa e redes de atenção multicanl. A avaliação do benchmark foi expandida para incluir uma linha base de segmentação baseada em transformadores, uma linha base unificada de predição densa, uma linha base unificada de detecção e segmentação, uma linha base de base de visão em grande escala, uma linha base puramente convolucional, uma linha base de segmentação baseada em atenção em máscara, uma linha base de agregação de características cruz-modal e uma linha base progressiva para fusão de características (veja a Tabela de Materiais), usando o mesmo conjunto de validação de cenas internas RGB-D, resolução de entrada, cronograma de treinamento e protocolo métrico. Na arquitetura proposta, a rede guiada por estrutura integra uma espinha dorsal visual multiescala com janelas deslocadas, um módulo de atenção cruzada guiado por estrutura com um SDF e um GCN superpixel. A comparação expandida abrange predição densa baseada em transformadores, predição densa baseada em convolução, análise sintática de atenção à máscara, fusão de características intermodais e paradigmas progressivos de fusão de características, permitindo a avaliação da contribuição da intervenção explícita de fronteira geométrica 3D contra linhas de base mais amplas de análise de cenas internas.

A Tabela 3 detalha o desempenho de avaliação objetiva de cada rede nas métricas quantitativas centrais, reportando os valores médios e os desvios padrão correspondentes em cinco execuções independentes. A comparação de linha base expandida avalia se o mecanismo de raciocínio guiado por estrutura proposto contribui para ganhos de precisão além dos backbones padrão de predição densa, redes de segmentação baseadas em máscara e redes de fusão de características RGB-D. Dados experimentais mostram que o algoritmo proposto alcança ganhos estáveis em todas as quatro métricas quantitativas. Redes de previsão densa baseadas em transformadores e redes de atenção com máscara mantiveram forte capacidade de modelagem global de contexto, mas seus valores de Fronteira F1 permaneceram menores na presença de desordem em primeiro plano, pois as máscaras previstas não apresentavam restrições físicas explícitas de fronteira. Redes de fusão cross-modais e progressivas melhoraram a continuidade semântica local, mas sua fusão de características ainda dependia principalmente de respostas de aparência e profundidade, em vez de um prior estrutural de distância gestual. A rede guiada por estrutura proposta alcançou um mIoU de 0,687 com desvio padrão de 0,002 e uma média de F1 de 0,764 com desvio padrão de 0,003. A comparação ampliada indica que o ganho de desempenho não se deveu apenas a uma espinha dorsal de previsão maior e densa, mas sim ao uso conjunto da orientação de campo por distância sinalizada, atenção cruzada consciente da estrutura e raciocínio topológico baseado em grafos.

Para analisar a precisão global do raciocínio lógico do modelo sob oclusões, identificamos e extraímos cenários típicos no conjunto de validação que estavam severamente obstruídos por móveis e outras bagunças, e produzimos visualizações de máscaras de previsão em nível de pixel.

Após o fluxo de trabalho do método e o processo de raciocínio em grafos foram definidos nas Figuras 1, Figura 2, Figura 3 e Figura 4. A Figura 5 ilustra as diferenças nas previsões morfológicas entre modelos sob condições extremas de oclusão. Os retângulos vermelhos no mapa qualitativo de malha de comparação marcam áreas-chave de conflito onde cantos e superfícies de suporte estão oclusos. A máscara de saída da linha de base de segmentação baseada em atenção na máscara mostra suavização de bordas pronunciada e adesão entre classes. Embora a linha base de agregação de características cruzadas e a linha de base de fusão progressiva de características incorporem dados intermodais, seus resultados de previsão ainda exibem descontinuidades de classes estruturais e distorções físicas de fronteira. A máscara gerada por esse método proposto apresenta alta sobreposição espacial com os rótulos de verdade no terreno. Modelos base, limitados por princípios puramente guiados por pixels, tendem a perder seus campos receptivos locais quando ocluídos. O método proposto utiliza um GCN superpixel para realizar a passagem de mensagens em espaço não euclidiano, reconstruindo assim os cantos subjacentes e esqueletos espaciais lineares guiados por fronteiras geométricas implícitas. Isso verifica o desempenho anti-interferência da nossa solução proposta na resolução de layouts internos complexos sob uma perspectiva morfológica visual.

Experimento de ablação

Para analisar a contribuição real de cada componente independente na arquitetura proposta, este estudo construiu um teste modular expandido de ablação no conjunto de validação de cenas internas RGB-D. A linha de base do teste foi definida para uma rede de classificação convencional com apenas a espinha dorsal visual do transformador com janela deslocada base. A avaliação quantitativa mediu a contribuição independente da atenção cruzada guiada pela estrutura, viés de campo por distância sinalizada, ponderação estrutural adaptativa, raciocínio em grafos superpixel, construção coplanar de aresta, normalização simétrica de grafos e perda de consistência estrutural. Esse projeto de ablação expandida separava os ganhos cumulativos dos módulos dos efeitos de remoção de componentes, tornando a fronteira de contribuição de cada escolha de projeto mais clara.

A Tabela 4 e a Figura 6 ilustram a evolução da precisão sob configurações expandidas de ablação cumulativa e baseada em remoção. A rede base de transformadores de janela deslocada não possui restrições físicas tridimensionais de fronteira, resultando em agregação limitada de características em fundos desordenados. Adicionar atenção cruzada guiada pela estrutura aumentou o mIoU de 0,615 para 0,648 e a pontuação F1 da Fronteira de 0,630 para 0,685, mostrando que o campo de distância sinalada anteriormente melhorou o alinhamento entre características visuais e contornos estruturais. Adicionar apenas raciocínio em grafos superpixels aumentou o mIoU para 0,641 e a pontuação F1 da fronteira para 0,676, indicando que o raciocínio topológico por nós melhorou a consistência semântica em regiões físicas homogêneas. A adição de perda de consistência estrutural aumentou o mIoU para 0,632 e a pontuação F1 da fronteira para 0,662, mostrando que o termo de perda afetava principalmente o ajuste de fronteiras, e não a agregação contextual ampla.

A combinação de atenção cruzada com raciocínio de grafos aumentou o mIoU para 0,669 e a pontuação F1 da fronteira para 0,721, mostrando que o alinhamento visual-estrutural e a passagem de mensagens no domínio do grafo produziram efeitos complementares. Combinando atenção cruzada com perda de consistência estrutural, obteve um mIoU de 0,660 e uma pontuação F1 de Boundary de 0,713, enquanto a combinação de raciocínio em grafos com perda de consistência estrutural obteve mIoU de 0,653 e uma pontuação F1 de 0,704. Esses resultados par a par indicam que o módulo de atenção cruzada forneceu o principal sinal de alinhamento geométrico, o módulo de raciocínio em grafos expandiu esse sinal por regiões coplanares, e a perda de consistência estrutural refinou a fronteira de transição semântica durante a otimização.

A ablação baseada em remoção esclareceu ainda mais a contribuição das escolhas internas de design. A remoção do viés aditivo de campo de distância sinalizada reduziu o mIoU para 0,656 e a pontuação F1 da fronteira para 0,698, confirmando que a matriz de afinidade estrutural era central para suprimir a difusão de características transfronteiriças. A remoção do coeficiente estrutural adaptativo λ reduziu o mIoU para 0,671 e a pontuação F1 da Fronteira para 0,736, indicando que uma restrição estrutural fixa enfraqueceu a resposta do modelo em regiões não Manhattan e visualmente degradadas. Remover a restrição de arestas coplanar reduziu o mIoU para 0,666 e a pontuação F1 do Limite para 0,728, mostrando que as arestas do grafo baseadas apenas na adjacência local não preservaram a consistência do plano físico. A remoção da normalização simétrica do grafo reduziu o mIoU para 0,673 e a pontuação F1 da fronteira para 0,737, indicando que a propagação balanceada em grau era necessária para a agregação estável de nós. A rede guiada estrutural proposta completa alcançou um mIoU de 0,687 e uma pontuação F1 de Boundary de 0,764, demonstrando que o ganho final resultou da interação coordenada entre atenção estrutural, raciocínio de grafos e otimização consciente de fronteiras.

Análise da complexidade computacional, tempo de treinamento e eficiência de inferência

Para avaliar o custo computacional da extração SDF, atenção cruzada guiada por estrutura e raciocínio convolucional em grafos superpixel, este estudo avaliou a escala de parâmetros, operações em ponto flutuante, uso máximo de memória, tempo de treinamento, latência de inferência de quadro único, taxa de quadros e mIoU na mesma plataforma computacional. As operações em ponto flutuante foram calculadas sob resolução de entrada 512 × 512. A latência de inferência foi medida com um tamanho de lote de 1 após o aquecimento do modelo, enquanto a taxa de quadros reportada foi calculada a partir da latência média de uma única imagem. O tempo de treinamento foi medido sob o mesmo cronograma de 300 épocas, tamanho de lote de 8, configurações do otimizador e pipeline de pré-processamento de dados.

A Tabela 5 detalha a relação entre escala do modelo, custo de treinamento, eficiência de inferência e precisão de análise para cada arquitetura de rede. As colunas mIoU e F1 de Fronteira na Tabela 5 usam os mesmos valores gerais do conjunto de validação que a Tabela 3 para cada modelo correspondente. Essas duas colunas de precisão são repetidas na Tabela 5 apenas para comparar a precisão da análise sintática com o custo computacional. O aumento nos parâmetros treináveis foi principalmente devido às camadas de projeção de consulta-chave-valor no módulo de atenção cruzada guiada por estrutura e às matrizes de pesos das três camadas convolucionais de grafos. O custo não treinável era principalmente incorrido pela geração de SDF, particionamento de superpixels e construção de adjacência de grafos. Como essas operações não treináveis eram executadas uma vez para cada imagem de entrada, aumentavam a latência de inferência, mas não aumentavam substancialmente o número de parâmetros treináveis. Essa separação explica por que o método proposto mostrou um aumento moderado nos parâmetros, mas um aumento mais pronunciado na latência. Os resultados de complexidade mostram que a linha base de segmentação baseada em atenção na máscara manteve uma contagem menor de parâmetros e uma latência de inferência menor, mas sua pontuação F1 de Fronteira e mIoU foram limitados sob oclusão severa devido à falta de orientação explícita de fronteira geométrica na rede. A linha de base de agregação de características entre modales exigia mais operações em ponto flutuante e tempo de treinamento mais longo porque a agregação entre modales introduzia uma sobrecarga adicional de alinhamento de características. A linha de base progressiva da fusão de características manteve custo computacional moderado, mas sua precisão de previsão permaneceu menor do que a do método proposto sob distorção de fronteira. A rede guiada por estrutura proposta envolve custos computacionais adicionais devido à construção de SDF, projeção estrutural de atenção cruzada, construção de grafos superpixels e propagação de convolução de grafos. O modelo completo usou 66,8 milhões de parâmetros, 121,4 bilhões de operações em ponto flutuante, 15,6 horas de treinamento, 7,9 GB de memória de pico, 61 ms de tempo de inferência em quadro único e 16,4 quadros por segundo. Embora a latência de inferência fosse maior do que a da linha base pura de atenção à máscara, o modelo alcançou um mIoU de 0,687 e uma pontuação F1 de Boundary de 0,764, indicando que o custo adicional apoiava principalmente a reparação estrutural de limites e a consistência semântica consciente da topologia.

Para representar visualmente o equilíbrio espacial bidimensional entre a escala computacional e a precisão analítica do modelo, foi criado um diagrama de distribuição de bolhas mostrando o número de operações em ponto flutuante e o mIoU do algoritmo. A visualização revisada também relatou tempo de treinamento e latência de inferência na área de anotação de figuras, permitindo a comparação de ganhos de precisão e custos computacionais tanto sob a perspectiva do treinamento quanto do implante. O eixo horizontal manteve operações de ponto flutuante, o eixo vertical manteve mIoU, o tamanho da bolha representou a quantidade de parâmetros treináveis, e o rótulo anexado reportou o tempo de inferência para cada método.

A Figura 7 revela a relação entre operações em ponto flutuante, escala de parâmetros, latência de inferência e precisão de análise sintática. O método proposto alcança um mIoU maior do que as redes de comparação, enquanto seus FLOPs e contagem de parâmetros permanecem próximos aos das linhas de base de fusão cruz-modal e progressiva. A latência de quadro único de 61 ms indica que os ramos adicionados de SDF e raciocínio de grafos introduziram sobrecarga de implantação, mas a latência permaneceu dentro da faixa de tempo real exigida para muitas tarefas de interpretação de cenas internas. O tempo de treinamento aumentou para 15,6 horas porque extração prévia estrutural, projeção de atenção e raciocínio gráfico foram executados em cada época de treinamento. Esse resultado mostra que o custo computacional do método proposto está principalmente concentrado no raciocínio estrutural consciente de fronteiras, em vez da expansão não controlada dos parâmetros.

Comparação específica entre perda de consistência estrutural e perda de distância espacial

A perda da rede de transformação inversa para quantizar distâncias de transformação espacial de fronteira utiliza parâmetros de transformação homomórfica para capturar deslocamentos de fronteira, demonstrando que métricas puras de distância espacial superam as perdas tradicionais de entropia cruzada baseadas em mudanças de rótulos de pixel. Com base nesse consenso teórico, experimentos de validação paralela são conduzidos usando esquemas de restrições de fronteira para avaliar o desempenho comparativo da Perda de Consistência Estrutural (SCL) personalizada baseada em Manhattan, em relação à adaptabilidade da cena. Os experimentos mantêm a arquitetura analítica de fundir uma espinha dorsal visual multiescala com uma rede de inferência de grafos, enquanto simplesmente substituem o termo de perda de fronteira durante a retropropagação. Quatro redes paralelas de validação são configuradas: uma rede que usa apenas a classificação básica de perda cruzada de entropia não possui restrições geométricas de alta dimensão; uma rede com perda adicional de entropia binária binária padrão de fronteira (BCE) realiza supervisão convencional de classificação binária de borda; uma rede com perda adicional de distância de fronteira espacial foca em capturar deformações locais; e uma rede que aplica a SCL proposta impõe penalidades topológicas ortogonais baseadas na SDF. As métricas de quantização no conjunto de validação de cenas internas RGB-D são limitadas ao mIoU e à pontuação F1 da fronteira estrutural.

A Tabela 6 detalha o grau de intervenção de diferentes estratégias de otimização por retropropagação na cognição lógica espacial subjacente. A entrada apenas de entropia cruzada na Tabela 6 denota a arquitetura nossa proposta treinada exclusivamente com perda de entropia cruzada em nível de pixel, mantendo a espinha dorsal visual, o ramo de campo de distância sinalizada, o módulo de atenção cruzada guiado por estrutura e o ramo de raciocínio em grafos superpixels inalterados. Esta entrada não é uma referência do Mask2Former e não deve ser comparada com o valor geral do Mask2Former na Tabela 3, pois utiliza o mesmo modelo. Redes que dependem exclusivamente da perda básica de entropia cruzada alcançam a menor pontuação de ajuste de fronteira. Redes com perda adicional de entropia cruzada binária padrão de fronteira alcançam um leve ganho, mas esse mecanismo ainda causa desfoque das bordas sob oclusão em larga escala. A perda de distância na fronteira espacial melhora a pontuação por meio de um mecanismo de percepção por transformação espacial, corrigindo efetivamente algumas bordas distorcidas. A perda de consistência estrutural proposta neste artigo utiliza diretamente a SDF real para impor penalidades de gradiente em mutações semânticas anômalas dentro da superfície física de suporte, alcançando a maior pontuação F1 na fronteira estrutural.

Para comparar visualmente os efeitos impulsionadores de diferentes configurações de função de perda na precisão da previsão de máscaras e no ajuste de limites, traçamos gráficos de barras agrupados entre diferentes estratégias de otimização.

A Figura 8 ilustra a melhoria de desempenho passo a passo resultante da atualização da dimensão de percepção espacial da função de perda. O gráfico de barras que representa a pontuação F1 da fronteira estrutural mostra uma tendência significativa de alta. Dados experimentais mostram que esse mecanismo de penalidade personalizado força a localização do salto espacial da categoria prevista a coincidir precisamente com o contorno físico ortogonal. O mecanismo de penalização de campo de distância, personalizado para priors ortogonais internos, alcança maior precisão do que a perda geral de captura de fronteira espacial, estabelecendo assim um caminho de otimização eficaz para o tratamento de falhas complexas de edifícios.

Teste de robustez de distribuição extrema de oclusão, estruturas anômalas e condições desafiadoras de iluminação

Relações espaciais complexas entre objetos e a oclusão mútua afetam negativamente a cognição espacial global 3D. A arquitetura de previsão conjunta destaca o papel de apoio das restrições de layout de cena na extração da máscara subjacente. Examinar os limites anti-interferência do algoritmo sob perda de sinal visual de grande área e layouts espaciais anômalos que violam a suposição física ortogonal 3D define claramente o limite efetivo da aplicação do algoritmo e tem valor central e demonstrável. Com base na proporção de móveis de grande porte mascarados com rótulos de verdade, o conjunto de teste de cenas internas RGB-D é subdividido em três subconjuntos progressivamente mais difíceis: oclusão leve, moderada e severa. Simultaneamente, cenas não típicas de Manhattan com tetos inclinados ou paredes curvas são extraídas manualmente para construir conjuntos de teste de contorno de anomalias, e cenas com condições de luz extremamente baixa, superexposição e superfícies de vidro brilhante ou transparente de grande área são categorizadas em subconjuntos desafiadores de iluminação e textura. A biblioteca de modelos de comparação inclui uma linha de segmentação baseada em máscara-atenção; uma arquitetura geral de segmentação baseada em atenção à máscara para capturar o contexto global; uma linha de base de agregação de características intermodal empregando uma estratégia abrangente de agregação multimodal; e uma linha base de fusão progressiva de características que integra um mecanismo progressivo de extração de características em múltiplos estágios. Cada linha base de comparação, a espinha dorsal visual de fusão e a arquitetura de análise da rede de inferência de grafos construída neste artigo são avaliados independentemente nos subconjuntos acima, e o gradiente de decaimento de precisão de cada modelo é analisado estatisticamente.

A Tabela 7 relata métricas de robustez específicas de subconjunto sob condições de oclusão leve, moderada e severa, iluminação desafiadora, interferência de textura e anomalias fora de Manhattan. A Tabela 7 detalha as mudanças na precisão da previsão de máscaras de diferentes modelos sob interferência espacial. A Tabela 7 relata valores de mIoU específicos de subconjunto para diferentes modelos sob condições de interferência espacial, calculados apenas dentro da oclusão, iluminação, textura ou subconjunto não Manhattan correspondente, em vez do conjunto geral de validação de cenas internas RGB-D. Nos subconjuntos de oclusão leve e moderada, todos os modelos mantêm uma precisão de base. Com o aumento da área de oclusão, os modelos de base baseados que dependem de regras baseadas em pixels mostram uma diminuição na razão de união de interseção (UI) no subconjunto fortemente ocluído. A linha base de segmentação baseada em atenção na máscara e a linha base de agregação de características intermodal sofrem perdas significativas de precisão nesse subconjunto. A arquitetura progressiva de extração de características em múltiplos estágios da linha base de fusão progressiva apresenta um declínio severo no desempenho. A solução proposta depende de características explícitas do esqueleto 3D para forçar o alinhamento de sinais visuais danificados, mantendo uma forma estável de saída de máscara no subconjunto fortemente ocluído e demonstrando a estabilidade topológica da saída da máscara semântica. Nos subconjuntos de iluminação e textura desafiadores, o detector de segmentos de linha não apresenta bordas estruturais em regiões com reflexões fortes e vidro transparente, levando a descontinuidades localizadas no SDF. As coordenadas geométricas errôneas propagam-se através da matriz de afinidade estrutural e da perda de consistência estrutural, aplicando assim penalidades anômalas de gradiente às características semânticas e causando desvios correspondentes nas previsões de fronteira. O mecanismo global de raciocínio do contexto espacial do GCN complementa os priors geométricos ausentes com afinidades estruturais adjacentes, mantendo a precisão geral da análise dentro de uma faixa de decaimento aceitável e revelando o limite das capacidades de percepção visual do algoritmo sob interferência física complexa. No subconjunto de anomalias não Manhattan, o prior SDF na camada inferior deste modelo introduz um leve viés de mapeamento, resultando em desempenho ligeiramente inferior ao da linha de base progressiva de fusão de características. O coeficiente de ponderação estrutural adaptativa no módulo de atenção cruzada avalia dinamicamente a consistência dos gradientes da estrutura física subjacente. Em cenas com paredes curvas ou tetos inclinados, esse coeficiente reduz automaticamente o peso de restrição do SDF, incentivando a rede a depender do mecanismo local de agregação de nós de características da rede de grafos superpixels para manter a coerência semântica em regiões homogêneas, estabelecendo assim um mecanismo eficaz de compensação geométrica para layouts espaciais não Manhattan.

Para demonstrar visualmente o impacto negativo da gravidade da oclusão na precisão da resolução, traçamos gráficos de linhas mostrando a diminuição da precisão entre diferentes modelos de algoritmos.

A Figura 9 revela visualmente as diferenças de robustez entre diferentes paradigmas de extração de características sob ambientes físicos extremos. As três linhas tracejadas que representam os modelos de linha base apresentam uma tendência significativa de queda em nós fortemente ocluídos, refletindo as limitações dos campos receptivos convencionais na extração de características sob perda de sinal em grande escala. A linha sólida que representa o método proposto mantém uma trajetória de decaimento relativamente suave. Dados experimentais mostram que o acoplamento entre priors arquitetônicos 3D explícitos e mecanismos de inferência baseados em grafos fornece suporte estrutural para tarefas de análise de cenas resistentes à oclusão e melhora o desempenho da generalização de modelos em ambientes complexos.

Análise de sensibilidade espacial da partição de nós de grafos de topologia

O parâmetro de taxa de amostragem de redução de dimensionalidade do módulo de convolução de grafos no espaço coordenado controla diretamente a qualidade do campo receptivo e a carga computacional da rede de grafos. Em linha com o arcabouço teórico deste artigo, este estudo investiga como o número de nós de grafo discretos produzidos por agrupamento iterativo linear simples afeta o desempenho da inferência topológica não euclidiana, visando fornecer suporte rigoroso para a seleção de hiperparâmetros. Experimentos foram realizados para ajustar os parâmetros de controle de inicialização do algoritmo de clustering, intervindo à força na redução dinâmica da dimensionalidade do espaço de características, estabelecendo o número de partições de nós de grafo superpixel para 64, 128, 256, 512 e 1024. Sob um benchmark de teste estritamente alinhado, a razão média interseção sobre união (IoU), a pontuação F1 do limite estrutural e o tempo médio de inferência por imagem de alta resolução foram registrados simultaneamente em diferentes tamanhos de nós topológicos.

A Tabela 8 detalha a relação entre o grau de redução dinâmica da dimensionalidade no espaço de características e tanto a precisão analítica quanto o custo computacional. Reduzir o número de nós muito baixo leva à subsegmentação das características da imagem, fazendo com que os atributos semânticos de objetos pequenos se fundam com as características de parede em grande escala, diminuindo assim várias métricas de precisão. À medida que a escala de particionamento dos nós aumenta, a sensibilidade do modelo a detalhes espaciais locais melhora significativamente. Aumentar o número de nós para 512 e 1024 resulta na fragmentação de regiões homogêneas, enfraquece o efeito de suavização sobre características macroscópicas em redes neurais de grafos, aumenta a dimensionalidade da matriz de relações entre nós e aumenta o tempo de inferência. Uma configuração de parâmetros com um número fixo de nós de 256 leva aos valores mais altos para a razão interseção-união e a pontuação de fronteira.

Para representar visualmente o equilíbrio entre precisão e poder computacional na inferência topológica não euclidiana, foi plotado um grafo estatístico biaxial mostrando a sensibilidade do tamanho do nó.

A Figura 10 ilustra a lógica subjacente pela qual o número de nós discretos do grafo afeta a evolução das características da rede. A barra de fundo que representa o tempo de computação mostra um aumento acentuado após o número de nós ultrapassar o limiar de 256. A linha dupla que representa a precisão atinge o pico em 256 no eixo horizontal, então diminui razoavelmente devido aos efeitos de fragmentação. Os dados quantitativos objetivos e a tendência de evolução visual são altamente consistentes, demonstrando que manter o tamanho do grafo computacional em 256 nós alcança um equilíbrio entre processamento por hardware e raciocínio lógico sob a configuração atual de parâmetros fixos. A severa degradação de desempenho causada pelo desvio desse número de nós revela a alta sensibilidade da estratégia fixa de segmentação superpixel à sintonia de hiperparâmetros e ressalta a necessidade de desenvolver um mecanismo dinâmico de seleção de nós.

DISPONIBILIDADE DE DADOS:

Os dados brutos de referência analisados neste estudo estão disponíveis publicamente nos repositórios oficiais listados na Tabela de Materiais. O benchmark 3D interno em grande escala foi acessado como a versão oficial ScanNet v2, com o identificador de lançamento do conjunto de dados ScanNet v2. O benchmark de cenas internas RGB-D foi acessado via a versão oficial NYU Depth Dataset V2, com o identificador de lançamento NYU Depth Dataset V2. O DOI descritivo para o benchmark 3D indoor em grande escala é 10.1109/CVPR.2017.261, e o DOI descritivo para o benchmark RGB-D de cenas internas é 10.1007/978-3-642-33715-4_54. Nenhuma nova imagem bruta ou conjunto de dados RGB-D foi gerada neste estudo. Os arquivos split processados, arquivos de configuração de treinamento, logs de avaliação brutos, arquivos fonte numéricos que suportam Tabela 2, Tabela 3, Tabela 4, Tabela 5, Tabela 6, Tabela 7 e Tabela 8, e Figura 5, Figura 6, Figura 7, Figura 8, Figura 9 e Figura 10, os pesos treinados dos modelos e o código-fonte foram depositados no figshare sob o DOI: 10.6084/m9.figshare.32906765. O registro do figshare fornece os dados completos de resultados brutos necessários para reproduzir as tabelas quantitativas e os números relatados neste manuscrito. O repositório contém as máscaras de previsão, arquivos de avaliação de fronteiras, scripts de cálculo métrico, checkpoints de modelo e arquivos-fonte de tabelas usados para o mIoU reportado, Boundary F1, PixelAcc, MeanAcc, complexidade computacional, robustez, validação da função de perda e análises de sensibilidade de partição de nós.

figure-results-1
Figura 1: Comparação entre os efeitos de descontinuidade semântica e reparo estrutural prévio em cenários complexos de oclusão interna. (A) Imagem RGB original com oclusão de móveis em grande escala. (B) Saída do modelo tradicional de linha de base destacando distorção física de fronteira e defeitos de descontinuidade semântica. (C) Saída do método proposto com uma sobreposição de perspectiva de linha tracejada ciano que mapeia explicitamente o esqueleto 3D do edifício para reparo topológico das características danificadas da estrutura subjacente. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-2
Figura 2: Estrutura geral de análise semântica guiada por priors estruturais de construção. O diagrama delineia todo o pipeline começando pela entrada da imagem RGB, passando pelo ramo de extração de características visuais com janela deslocada e o ramo de extração prévia da estrutura, até o módulo de atenção cruzada guiado pela estrutura, seguido pelo raciocínio topológico via o GCN superpixel, e finalmente a decodificação no mapa semântico denso. Layouts detalhados do cálculo da matriz de afinidade de atenção, passagem de mensagens de grafo e das funções de perda de otimização conjunta são apresentados à direita. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-3
Figura 3: Fluxograma da matriz de afinidade e construção da conectividade topológica. O gráfico detalha o pipeline de mapeamento matemático passo a passo, mostrando a transformação do mapa de distância de entrada e dos pares de pixels selecionados, através da extração contínua de características geométricas de potencial e avaliação de consistência de gradiente, até a matriz de afinidade normalizada usada como viés espacial explícito para o mecanismo de atenção cruzada. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-4
Figura 4: Diagrama esquemático de projeção de convolução de grafo superpixel e agregação de características. O painel detalha o processo de raciocínio topológico não euclidiano: (A) características densas de pixels mostrando a matriz local original de características e os limites de agrupamento de superpixels; (B) construção da topologia de grafo superpixel mapeando a grade regular para nós discretos e arestas fisicamente conectadas; (C) passagem convolucional de mensagens de grafo realizando agregação direcional de características locais; e (D) retroprojeção de coordenadas apresentando as características de consistência semântica macroscópica restauradas na grade densa. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-5
Figura 5: Diagrama qualitativo de grade comparativa. A matriz fornece uma avaliação visual de desempenho em diferentes cenas internas por linha, comparando as entradas RGB originais e os layouts ground-truth com as saídas da linha base de segmentação baseada em atenção na máscara, a linha base de agregação de características cross-modal, a linha base progressiva de fusão de características e o método proposto, que restaura com sucesso cantos ocluídos e alinha superfícies suportantes. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-6
Figura 6: Resultados da ablação para integração cumulativa de módulos. O gráfico de dois eixos demonstra a evolução do desempenho passo a passo entre diferentes configurações modulares de ablação, traçando a trajetória constante para cima da interseção média sobre união (mIoU) como barras e a pontuação F1 da fronteira estrutural como um gráfico de linhas desde a espinha dorsal da linha de base até a estrutura completa. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-7
Figura 7: Complexidade computacional, tempo de treinamento e distribuição de eficiência de inferência. O gráfico multidimensional de bolhas revela as compensações entre overhead computacional e precisão de análise sintática. O eixo horizontal mede operações em ponto flutuante (FLOPs), o eixo vertical indica mIoU, o tamanho da bolha representa a escala dos parâmetros treináveis, e os rótulos de texto adjacentes reportam a latência de inferência de quadro único para cada arquitetura de rede. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-8
Figura 8: Histograma da precisão dos limites e das pontuações métricas sob diferentes configurações de função de perda. O gráfico de barras agrupado compara os efeitos impulsionadores de várias estratégias de otimização na lógica espacial subjacente, ilustrando os ganhos significativos em mIoU e na pontuação F1 da fronteira estrutural alcançados ao atualizar das formulações padrão de entropia cruzada para a proposta de perda de consistência estrutural. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-9
Figura 9: Gráfico de linhas mostrando a relação entre gravidade da oclusão e decaimento do desempenho. A curva acompanha a degradação da precisão entre diferentes paradigmas de extração de características sob níveis de oclusão leve, moderada e severa, destacando a robusta estabilidade topológica e capacidade anti-interferência do framework guiado por estrutura proposto em comparação com as linhas base puramente base-pixel. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-10
Figura 10: Análise de sensibilidade da escala de nós superpixel. O gráfico estatístico biaxial ilustra o equilíbrio entre velocidade de processamento de hardware e precisão do raciocínio lógico entre diferentes tamanhos de partição de grafos, mostrando como o número de nós superpixel afeta métricas de precisão e leva a um aumento acentuado no tempo médio de inferência. Por favor, clique aqui para ver uma versão ampliada desta figura.

Numeração da camada de redeDimensão das características do nó de entradaDimensão de característica do nó de saídaConfiguração de probabilidade de inativação aleatória
15122560.15
22562560.15
32561280.1
4128640.05

Tabela 1: Tabela de Configuração de Hiperparâmetros da Arquitetura de Rede para o Módulo de Inferência Convolucional. A tabela relata a numeração da camada de rede, as dimensões das características dos nós de entrada, as dimensões das características dos nós de saída e as configurações de probabilidade aleatória de inativação usadas na rede de raciocínio por grafos.

Item de configuraçãoBenchmark 3D em grande escala para ambientes internosBenchmark de cenas internas RGB-D
Identificador oficial de lançamentoScanNet v2Conjunto de Dados de Profundidade da NYU V2
Amostras de treinamento utilizadas neste estudo1201 cenas795 imagens
Validação ou teste de amostras usadas para avaliação312 cenas de validação654 imagens de teste
Categorias semânticas totais2040
Resolução da imagem de entrada512 × 512512 × 512
Taxa inicial de aprendizado0.00010.0001
Contagem de amostras de entrada em lote88
Coeficiente de decaimento de peso0.010.01
Épocas totais de treinamento300300
Número de corridas independentes55

Tabela 2: Divisão do Conjunto de Dados Experimental e Configuração Unificada de Hiperparâmetros de Treinamento. A tabela reporta configurações de partição de amostras de amostras de conjunto de dados 3D internos em grande escala e conjunto de dados RGB-D de cenas internas, contagens semânticas de categorias, configurações de taxa de aprendizado, contagem de amostras em lote de entrada, taxa de decaimento de peso e contagem total de iterações de treinamento.

Arquitetura do modelo de redemIoULimite F1PixelAccMeanAcc
SegFormer0,596 ± 0,0030,635 ± 0,0040,838 ± 0,0030,704 ± 0,004
ConvNeXt UperNet0,604 ± 0,0030,642 ± 0,0040,846 ± 0,0030,713 ± 0,004
Mask2Former0,612 ± 0,0030,654 ± 0,0040,853 ± 0,0030,721 ± 0,004
OneFormer0,621 ± 0,0020,663 ± 0,0030,861 ± 0,0030,733 ± 0,003
MaskDINO0,628 ± 0,0020,667 ± 0,0030,869 ± 0,0030,741 ± 0,003
CCANet0,635 ± 0,0030,671 ± 0,0040,876 ± 0,0030,745 ± 0,004
InternImage UperNet0,641 ± 0,0020,692 ± 0,0030,884 ± 0,0020,756 ± 0,003
CMPFFNet0,658 ± 0,0020,712 ± 0,0030,891 ± 0,0020,773 ± 0,003
SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Tabela 3: Comparação quantitativa geral das linhas de base de análise de cenas internas no conjunto de validação de cenas internas RGB-D. A tabela relata mIoU, pontuação F1 da fronteira, precisão global de pixels e precisão da classe média para a linha base de segmentação baseada em atenção em máscara, linha base de agregação de características intermodal, linha base progressiva de fusão de características e a arquitetura de rede guiada por estrutura proposta.

Configuração da arquitetura de redemIoULimite F1PixelAccMeanAcc
Espinha dorsal de janela deslocada base0,615 ± 0,0030,630 ± 0,0040,842±0,0030,706 ± 0,004
Espinha dorsal mais atenção cruzada guiada pela estrutura0,648 ± 0,0030,685 ± 0,0040,874 ± 0,0030,748 ± 0,004
Raciocínio de grafos de espinha dorsal mais superpixel0,641 ± 0,0030,676 ± 0,0040,868 ± 0,0030,741 ± 0,004
Perda de consistência entre espinha dorsal e estrutura0,632 ± 0,0030,662 ± 0,0040,859 ± 0,0030,732 ± 0,004
Backbone mais atenção cruzada e raciocínio por grafos0,669 ± 0,0020,721 ± 0,0030,897 ± 0,0020,782 ± 0,003
Espinha dorsal mais atenção cruzada e perda de consistência estrutural0,660 ± 0,0020,713 ± 0,0030,889 ± 0,0020,773 ± 0,003
Raciocínio de espinha dorsal mais gráfico e perda de consistência estrutural0,653 ± 0,0030,704 ± 0,0030,881 ± 0,0030,765 ± 0,003
Modelo completo sem viés aditivo de campo de distância sinalizada0,656 ± 0,0030,698 ± 0,0040,884 ± 0,0030,761 ± 0,004
Modelo completo sem ponderação estrutural adaptativa λ0,671 ± 0,0020,736 ± 0,0030,904 ± 0,0020,792 ± 0,003
Modelo completo sem restrição de arestas coplanar0,666 ± 0,0020,728 ± 0,0030,899 ± 0,0020,786 ± 0,003
Modelo completo sem normalização simétrica de grafos0,673 ± 0,0020,737 ± 0,0030,906 ± 0,0020,795 ± 0,003
Pleno SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Tabela 4: Análise ampliada de ablação quantitativa dos componentes principais. A tabela relata integração cumulativa de módulos, combinações de módulos par a par e configurações de remoção de componentes para quantificar as contribuições independentes e cooperativas da atenção cruzada guiada pela estrutura, viés de campo por distância sinalizada, ponderação estrutural adaptativa, raciocínio em grafos superpixel, construção coplanar de aresta, normalização simétrica de grafos e perda de consistência estrutural.

Arquitetura do modelo de redeParâmetrosFLOPsMemória de picoTempo de treinamentoTempo de inferênciaFPSmIoULimite F1
SegFormer83,7 M80,1 G6,1 GB10,6 h44 ms22.70.5960.635
ConvNeXt UperNet60,2 M91,5 G6,4 GB11,2 h47 ms21.30.6040.642
Mask2Former44,0 M74,6 G5,8 GB9,4 h41 ms24.40.6120.654
OneFormer64,1 M103,2 G7,0 GB12,9 h55 ms18.20.6210.663
MaskDINO52,8 M96,8 G6,8 GB12,1 h52 ms19.20.6280.667
CCANet63,5 M118,7 G7,6 GB14,8 h67 ms14.90.6350.671
InternImage UperNet70,4 M112,3 G7,4 GB14,2 h64 ms15.60.6410.692
CMPFFNet58,9 M104,6 G7,1 GB13,1 h59 ms16.90.6580.712
SGCA_GCN66,8 M121,4 G7,9 GB15,6 h61 ms16.40.6870.764

Tabela 5: Complexidade computacional, tempo de treinamento e comparação de eficiência de inferência com a precisão geral do conjunto de validação. A tabela reporta parâmetros treináveis, operações em ponto flutuante, uso máximo de memória, tempo de treinamento para 300 épocas, latência de inferência de quadro único, quadros por segundo, mIoU e pontuação Boundary F1 para o método proposto e redes de comparação.

Configuração da Função de PerdamIoULimite F1
Apenas Entropia Cruzada (CE)0.6690.721
CE + Limite BCE0.6740.738
CE + Perda InversaForma0.6810.752
CE + Nosso SCL0.6870.764

Tabela 6: Comparação quantitativa da validação da função de perda. A tabela relata a pontuação mIoU e F1 de fronteira sob perda de entropia cruzada, perda binária de entropia cruzada de fronteira, perda por transformação inversa e a perda de consistência estrutural proposta.

Arquitetura de modelos algorítmicosOclusão leveOclusão moderadaOclusão severaConjunto de anomalias fora de ManhattanSubconjunto de interferência de textura
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

Tabela 7: Análise de robustez específica por subconjunto da distribuição extrema de oclusão e estruturas fora de Manhattan. A tabela relata mudanças na precisão da análise sintática entre os subconjuntos de oclusão leve, oclusão moderada, oclusão severa, iluminação desafiadora, interferência de textura e não-anomalia de Manhattan.

Número de nós superscalemIoUFronteiraF1Tempo médio de inferência (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

Tabela 8: Análise de Sensibilidade Espacial da Escala de Partição de Nós em Grafo de Topologia. A tabela relata o mIoU, a pontuação F1 do limite estrutural e o tempo médio de inferência entre diferentes configurações de partição de nós superpixel.

Discussão

O algoritmo deste artigo acopla de forma rígida as características visuais hierárquicas capturadas por um codificador transformador hierárquico de janela deslocada com a profundidade prévia da caixa delimitadora 3D Manhattan gerada pela detecção de segmentos de linha, alcançando assim a reconstrução semântica de alta precisão de cenas internas complexas. Um mecanismo de atenção cruzada guiado pela estrutura força o sinal visual a alinhar-se com a verdadeira fronteira geométrica calibrada pelo SDF, restaurando assim a continuidade das características de baixo nível nas áreas localmenteocluídas 42. Um grafo topológico é construído usando nós superpixel gerados por um algoritmo iterativo de clustering local, que conduz um GCN a realizar agregação de características sob restrições coplanares físicas, garantindo a consistência da distribuição semânticamacroscópica 43. Resultados experimentais mostram que o método alcança uma média de interseção sobre união de 68,7% com desvio padrão de 0,2%, um valor prático de engenharia, uma pontuação F1 de 76,4% na fronteira estrutural com desvio padrão de 0,3% e um tempo médio de inferência de 61 ms com uma configuração de 256 nós superpixel, refletindo um trade-off deliberado priorizando a precisão da reconstrução de fronteiras em detrimento da eficiência finalde inferência 44. Testes de robustez demonstram ainda que o modelo apresenta fortes capacidades de reparo de topologia sob condições extremas de perda visual em larga escala. Ao introduzir perda de consistência estrutural, a precisão do alinhamento da máscara prevista com a fronteira física de distância zero calibrada pelo SDF é aprimorada, alcançando uma otimização sinérgica da complexidade computacional e da qualidade de análisesintática 45. Esse esquema fornece uma abordagem de fusão de características baseada nas leis do espaço tridimensional e demonstra consistência lógica na reparação de topologia ao lidar com oclusão de móveis em grande escala e distorção físicade fronteira 46. Os resultados da pesquisa fornecem uma estrutura robusta de restrições físico-geométricas para raciocínio espacial inteligente e reconstrução 3D de alta precisão, além de ter valor prático em engenharia para tarefas de navegação visual robótica e reconhecimento de cenas em ambientes físicos reais.

O mecanismo de derivação da topologia geométrica, que depende fortemente da hipótese do mundo de Manhattan, sofre de viés de ajuste ao lidar com espaços arquitetônicos irregulares com paredes curvas ou limites nãoortogonais 47. Para superar esse gargalo de modelagem geométrica, iterações subsequentes da rede integrarão algoritmos de ajuste de superfície polinomial de múltiplos graus e módulos racionais de extração de curvas B-spline não uniformes no ramo físico-prior. Essa estratégia universal de modelagem espacial traduz linhas ortogonais rígidas em limites topológicos dinamicamente deformáveis, aumentando continuamente a precisão de análise do algoritmo em layouts espaciais anômalos internos.

A extração prévia geométrica depende do detector básico de segmento de linha, deixando o sistema vulnerável à distorção estrutural da máscara ao processar cenas internas dominadas por materiais refletivosou transparentes 48. A perda de consistência estrutural invoca diretamente a SDF gerada por esse detector, estabelecendo um ciclo de dependência fechado entre extração prévia e otimização de gradiente. Quando interferência visual desencadeia detecções anômalas de segmentos de linha, as coordenadas geométricas falhas são mapeadas para a SDF e amplificadas diretamente pela perda de consistência estrutural durante a retropropagação, forçando assim os parâmetros da rede a se ajustarem a limites físicosincorretos 49. Iterações algorítmicas subsequentes introduzirão ramos de fusão adaptativos multimodais para ingerir mapas de profundidade profundos e dados radiométricos infravermelhos, desacoplando assim a percepção estrutural geométrica das restrições de iluminação em luz visível e expandindo a fronteira de raciocínio espacial em ambientes ópticos extremos.

Para resolver o gargalo de sensibilidade ao desempenho causado pela escala fixa de nós superpixel, pesquisas subsequentes projetarão um módulo de pooling de grafos adaptativo e aprendível que determina dinamicamente o esquema de particionamento de nós com base na complexidade da imagem, eliminando a dependência da rede da sintonia manual de hiperparâmetros. Para resolver as limitações de implantação de hardware causadas pela sobrecarga computacional da rede de grafos superpixel, planos futuros de otimização introduzirão mecanismos leves de desacoplamento de características e módulos de agregação com gate para comprimir a escala dos parâmetros e acelerar as operações matriciais do branch geométricoprior 50.

Divulgações

Os autores declaram que não têm conflitos financeiros de interesse.

Agradecimentos

Financiamento: Programa Chave de Pesquisa e Desenvolvimento de Shaanxi (Programa nº 2024CY2-GJHX-76).

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

Referências

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Priores de Estrutura de Edif ciosTransformer Hier rquicoDetec o de Segmentos de LinhaBounding Box 3D de ManhattanCampo de Dist ncia SinalizadoMecanismo de Aten o CruzadaRede Neural Convolucional de GrafosPerda de Consist ncia Estrutural

Artigos relacionados