Configuração Experimental
Este estudo utilizou dois conjuntos de dados padrão de análise de cenas internas, um conjunto de dados 3D interno em grande escala e um conjunto de dados RGB-D de cenas internas, para avaliar o desempenho e ajustar o modelo. O conjunto de dados 3D interno em grande escala contém cenas complexas de espaço físico escaneadas de forma realista e vistas RGB de alta resolução, fornecendo rótulos semânticos 3D de alta precisão, pixel a pixel, e máscaras de segmentação de projeção espacial 2D. Seus dados de reconstrução de grade em espaço físico inerentemente realistas e propriedades ortogonais do plano estabelecem um critério de comparação geométrica de verdade para construir com precisão a caixa delimitadora 3D de Manhattan no ramo de extração. O conjunto de dados RGB-D de cenas internas contém imagens de profundidade internas ocultas por móveis e desordem e é usado para testar a precisão e robustez global do raciocínio lógico da rede contra oclusões.
O algoritmo utiliza mIoU para medir a sobreposição espacial entre as distribuições semânticas previstas e verdadeiras, ao mesmo tempo em que introduz uma pontuação F1 de fronteira estrutural para avaliar rigorosamente a precisão do ajuste entre a máscara prevista e as arestas de estrutura física de distância zero calibradas pelo SDF. Um limiar fixo de erro de distância de pixel no espaço euclidiano é definido durante o cálculo para determinar se os pixels de borda produzidos pela rede intersectam os verdadeiros contornos físicos da fronteira dos edifícios. Esse sistema de avaliação dual limita erros de classificação em blocos semânticos de grande área enquanto fortalece a avaliação microquantitativa do efeito de reconstrução topológica de linhas rígidas. Para manter a consistência entre a configuração experimental dos dados e o processo de otimização, a escala do conjunto de dados e os hiperparâmetros de treinamento core foram resumidos na Tabela 2. A Tabela 2 relata uma configuração experimental autoritativa para o manuscrito revisado. O benchmark 3D indoor em grande escala usa 1201 cenas de treinamento e 312 cenas de validação, o benchmark RGB-D de cenas internas usa 795 imagens de treinamento e 654 imagens de teste, e ambos os benchmarks são treinados com tamanho de lote de 8, taxa inicial de aprendizado de 0,0001, coeficiente de decaimento de peso de 0,01 e 300 épocas de treinamento.
Comparação com métodos de ponta
Antes de apresentar uma tabela comparativa quantitativa dos algoritmos de análise de cenas internas, esta seção define rigorosamente os benchmarks de teste usados no sistema de avaliação multidimensional. Para refletir o desempenho de classificação do modelo em diferentes granularidades, o sistema de avaliação complementa o sistema de teste com duas métricas adicionais: precisão global de pixels (PixelAcc) e precisão de classe média (MeanAcc). Essas métricas juntas constroem um sistema detalhado de verificação de desempenho de algoritmos, estabelecendo uma referência teórica rigorosa para análises quantitativas subsequentes. Para avaliar a precisão da análise semântica e a robustez à oclusão do algoritmo proposto em espaços físicos complexos, foram realizados testes comparativos com algoritmos existentes no conjunto de validação de cenas internas RGB-D. A biblioteca de modelos de comparação abrange frameworks fundamentais de máscara-atenção, Transformers de visão hierárquica, pipelines modernos de segmentação convolucional pura, arquiteturas unificadas de previsão densa e redes de atenção multicanl. A avaliação do benchmark foi expandida para incluir uma linha base de segmentação baseada em transformadores, uma linha base unificada de predição densa, uma linha base unificada de detecção e segmentação, uma linha base de base de visão em grande escala, uma linha base puramente convolucional, uma linha base de segmentação baseada em atenção em máscara, uma linha base de agregação de características cruz-modal e uma linha base progressiva para fusão de características (veja a Tabela de Materiais), usando o mesmo conjunto de validação de cenas internas RGB-D, resolução de entrada, cronograma de treinamento e protocolo métrico. Na arquitetura proposta, a rede guiada por estrutura integra uma espinha dorsal visual multiescala com janelas deslocadas, um módulo de atenção cruzada guiado por estrutura com um SDF e um GCN superpixel. A comparação expandida abrange predição densa baseada em transformadores, predição densa baseada em convolução, análise sintática de atenção à máscara, fusão de características intermodais e paradigmas progressivos de fusão de características, permitindo a avaliação da contribuição da intervenção explícita de fronteira geométrica 3D contra linhas de base mais amplas de análise de cenas internas.
A Tabela 3 detalha o desempenho de avaliação objetiva de cada rede nas métricas quantitativas centrais, reportando os valores médios e os desvios padrão correspondentes em cinco execuções independentes. A comparação de linha base expandida avalia se o mecanismo de raciocínio guiado por estrutura proposto contribui para ganhos de precisão além dos backbones padrão de predição densa, redes de segmentação baseadas em máscara e redes de fusão de características RGB-D. Dados experimentais mostram que o algoritmo proposto alcança ganhos estáveis em todas as quatro métricas quantitativas. Redes de previsão densa baseadas em transformadores e redes de atenção com máscara mantiveram forte capacidade de modelagem global de contexto, mas seus valores de Fronteira F1 permaneceram menores na presença de desordem em primeiro plano, pois as máscaras previstas não apresentavam restrições físicas explícitas de fronteira. Redes de fusão cross-modais e progressivas melhoraram a continuidade semântica local, mas sua fusão de características ainda dependia principalmente de respostas de aparência e profundidade, em vez de um prior estrutural de distância gestual. A rede guiada por estrutura proposta alcançou um mIoU de 0,687 com desvio padrão de 0,002 e uma média de F1 de 0,764 com desvio padrão de 0,003. A comparação ampliada indica que o ganho de desempenho não se deveu apenas a uma espinha dorsal de previsão maior e densa, mas sim ao uso conjunto da orientação de campo por distância sinalizada, atenção cruzada consciente da estrutura e raciocínio topológico baseado em grafos.
Para analisar a precisão global do raciocínio lógico do modelo sob oclusões, identificamos e extraímos cenários típicos no conjunto de validação que estavam severamente obstruídos por móveis e outras bagunças, e produzimos visualizações de máscaras de previsão em nível de pixel.
Após o fluxo de trabalho do método e o processo de raciocínio em grafos foram definidos nas Figuras 1, Figura 2, Figura 3 e Figura 4. A Figura 5 ilustra as diferenças nas previsões morfológicas entre modelos sob condições extremas de oclusão. Os retângulos vermelhos no mapa qualitativo de malha de comparação marcam áreas-chave de conflito onde cantos e superfícies de suporte estão oclusos. A máscara de saída da linha de base de segmentação baseada em atenção na máscara mostra suavização de bordas pronunciada e adesão entre classes. Embora a linha base de agregação de características cruzadas e a linha de base de fusão progressiva de características incorporem dados intermodais, seus resultados de previsão ainda exibem descontinuidades de classes estruturais e distorções físicas de fronteira. A máscara gerada por esse método proposto apresenta alta sobreposição espacial com os rótulos de verdade no terreno. Modelos base, limitados por princípios puramente guiados por pixels, tendem a perder seus campos receptivos locais quando ocluídos. O método proposto utiliza um GCN superpixel para realizar a passagem de mensagens em espaço não euclidiano, reconstruindo assim os cantos subjacentes e esqueletos espaciais lineares guiados por fronteiras geométricas implícitas. Isso verifica o desempenho anti-interferência da nossa solução proposta na resolução de layouts internos complexos sob uma perspectiva morfológica visual.
Experimento de ablação
Para analisar a contribuição real de cada componente independente na arquitetura proposta, este estudo construiu um teste modular expandido de ablação no conjunto de validação de cenas internas RGB-D. A linha de base do teste foi definida para uma rede de classificação convencional com apenas a espinha dorsal visual do transformador com janela deslocada base. A avaliação quantitativa mediu a contribuição independente da atenção cruzada guiada pela estrutura, viés de campo por distância sinalizada, ponderação estrutural adaptativa, raciocínio em grafos superpixel, construção coplanar de aresta, normalização simétrica de grafos e perda de consistência estrutural. Esse projeto de ablação expandida separava os ganhos cumulativos dos módulos dos efeitos de remoção de componentes, tornando a fronteira de contribuição de cada escolha de projeto mais clara.
A Tabela 4 e a Figura 6 ilustram a evolução da precisão sob configurações expandidas de ablação cumulativa e baseada em remoção. A rede base de transformadores de janela deslocada não possui restrições físicas tridimensionais de fronteira, resultando em agregação limitada de características em fundos desordenados. Adicionar atenção cruzada guiada pela estrutura aumentou o mIoU de 0,615 para 0,648 e a pontuação F1 da Fronteira de 0,630 para 0,685, mostrando que o campo de distância sinalada anteriormente melhorou o alinhamento entre características visuais e contornos estruturais. Adicionar apenas raciocínio em grafos superpixels aumentou o mIoU para 0,641 e a pontuação F1 da fronteira para 0,676, indicando que o raciocínio topológico por nós melhorou a consistência semântica em regiões físicas homogêneas. A adição de perda de consistência estrutural aumentou o mIoU para 0,632 e a pontuação F1 da fronteira para 0,662, mostrando que o termo de perda afetava principalmente o ajuste de fronteiras, e não a agregação contextual ampla.
A combinação de atenção cruzada com raciocínio de grafos aumentou o mIoU para 0,669 e a pontuação F1 da fronteira para 0,721, mostrando que o alinhamento visual-estrutural e a passagem de mensagens no domínio do grafo produziram efeitos complementares. Combinando atenção cruzada com perda de consistência estrutural, obteve um mIoU de 0,660 e uma pontuação F1 de Boundary de 0,713, enquanto a combinação de raciocínio em grafos com perda de consistência estrutural obteve mIoU de 0,653 e uma pontuação F1 de 0,704. Esses resultados par a par indicam que o módulo de atenção cruzada forneceu o principal sinal de alinhamento geométrico, o módulo de raciocínio em grafos expandiu esse sinal por regiões coplanares, e a perda de consistência estrutural refinou a fronteira de transição semântica durante a otimização.
A ablação baseada em remoção esclareceu ainda mais a contribuição das escolhas internas de design. A remoção do viés aditivo de campo de distância sinalizada reduziu o mIoU para 0,656 e a pontuação F1 da fronteira para 0,698, confirmando que a matriz de afinidade estrutural era central para suprimir a difusão de características transfronteiriças. A remoção do coeficiente estrutural adaptativo λ reduziu o mIoU para 0,671 e a pontuação F1 da Fronteira para 0,736, indicando que uma restrição estrutural fixa enfraqueceu a resposta do modelo em regiões não Manhattan e visualmente degradadas. Remover a restrição de arestas coplanar reduziu o mIoU para 0,666 e a pontuação F1 do Limite para 0,728, mostrando que as arestas do grafo baseadas apenas na adjacência local não preservaram a consistência do plano físico. A remoção da normalização simétrica do grafo reduziu o mIoU para 0,673 e a pontuação F1 da fronteira para 0,737, indicando que a propagação balanceada em grau era necessária para a agregação estável de nós. A rede guiada estrutural proposta completa alcançou um mIoU de 0,687 e uma pontuação F1 de Boundary de 0,764, demonstrando que o ganho final resultou da interação coordenada entre atenção estrutural, raciocínio de grafos e otimização consciente de fronteiras.
Análise da complexidade computacional, tempo de treinamento e eficiência de inferência
Para avaliar o custo computacional da extração SDF, atenção cruzada guiada por estrutura e raciocínio convolucional em grafos superpixel, este estudo avaliou a escala de parâmetros, operações em ponto flutuante, uso máximo de memória, tempo de treinamento, latência de inferência de quadro único, taxa de quadros e mIoU na mesma plataforma computacional. As operações em ponto flutuante foram calculadas sob resolução de entrada 512 × 512. A latência de inferência foi medida com um tamanho de lote de 1 após o aquecimento do modelo, enquanto a taxa de quadros reportada foi calculada a partir da latência média de uma única imagem. O tempo de treinamento foi medido sob o mesmo cronograma de 300 épocas, tamanho de lote de 8, configurações do otimizador e pipeline de pré-processamento de dados.
A Tabela 5 detalha a relação entre escala do modelo, custo de treinamento, eficiência de inferência e precisão de análise para cada arquitetura de rede. As colunas mIoU e F1 de Fronteira na Tabela 5 usam os mesmos valores gerais do conjunto de validação que a Tabela 3 para cada modelo correspondente. Essas duas colunas de precisão são repetidas na Tabela 5 apenas para comparar a precisão da análise sintática com o custo computacional. O aumento nos parâmetros treináveis foi principalmente devido às camadas de projeção de consulta-chave-valor no módulo de atenção cruzada guiada por estrutura e às matrizes de pesos das três camadas convolucionais de grafos. O custo não treinável era principalmente incorrido pela geração de SDF, particionamento de superpixels e construção de adjacência de grafos. Como essas operações não treináveis eram executadas uma vez para cada imagem de entrada, aumentavam a latência de inferência, mas não aumentavam substancialmente o número de parâmetros treináveis. Essa separação explica por que o método proposto mostrou um aumento moderado nos parâmetros, mas um aumento mais pronunciado na latência. Os resultados de complexidade mostram que a linha base de segmentação baseada em atenção na máscara manteve uma contagem menor de parâmetros e uma latência de inferência menor, mas sua pontuação F1 de Fronteira e mIoU foram limitados sob oclusão severa devido à falta de orientação explícita de fronteira geométrica na rede. A linha de base de agregação de características entre modales exigia mais operações em ponto flutuante e tempo de treinamento mais longo porque a agregação entre modales introduzia uma sobrecarga adicional de alinhamento de características. A linha de base progressiva da fusão de características manteve custo computacional moderado, mas sua precisão de previsão permaneceu menor do que a do método proposto sob distorção de fronteira. A rede guiada por estrutura proposta envolve custos computacionais adicionais devido à construção de SDF, projeção estrutural de atenção cruzada, construção de grafos superpixels e propagação de convolução de grafos. O modelo completo usou 66,8 milhões de parâmetros, 121,4 bilhões de operações em ponto flutuante, 15,6 horas de treinamento, 7,9 GB de memória de pico, 61 ms de tempo de inferência em quadro único e 16,4 quadros por segundo. Embora a latência de inferência fosse maior do que a da linha base pura de atenção à máscara, o modelo alcançou um mIoU de 0,687 e uma pontuação F1 de Boundary de 0,764, indicando que o custo adicional apoiava principalmente a reparação estrutural de limites e a consistência semântica consciente da topologia.
Para representar visualmente o equilíbrio espacial bidimensional entre a escala computacional e a precisão analítica do modelo, foi criado um diagrama de distribuição de bolhas mostrando o número de operações em ponto flutuante e o mIoU do algoritmo. A visualização revisada também relatou tempo de treinamento e latência de inferência na área de anotação de figuras, permitindo a comparação de ganhos de precisão e custos computacionais tanto sob a perspectiva do treinamento quanto do implante. O eixo horizontal manteve operações de ponto flutuante, o eixo vertical manteve mIoU, o tamanho da bolha representou a quantidade de parâmetros treináveis, e o rótulo anexado reportou o tempo de inferência para cada método.
A Figura 7 revela a relação entre operações em ponto flutuante, escala de parâmetros, latência de inferência e precisão de análise sintática. O método proposto alcança um mIoU maior do que as redes de comparação, enquanto seus FLOPs e contagem de parâmetros permanecem próximos aos das linhas de base de fusão cruz-modal e progressiva. A latência de quadro único de 61 ms indica que os ramos adicionados de SDF e raciocínio de grafos introduziram sobrecarga de implantação, mas a latência permaneceu dentro da faixa de tempo real exigida para muitas tarefas de interpretação de cenas internas. O tempo de treinamento aumentou para 15,6 horas porque extração prévia estrutural, projeção de atenção e raciocínio gráfico foram executados em cada época de treinamento. Esse resultado mostra que o custo computacional do método proposto está principalmente concentrado no raciocínio estrutural consciente de fronteiras, em vez da expansão não controlada dos parâmetros.
Comparação específica entre perda de consistência estrutural e perda de distância espacial
A perda da rede de transformação inversa para quantizar distâncias de transformação espacial de fronteira utiliza parâmetros de transformação homomórfica para capturar deslocamentos de fronteira, demonstrando que métricas puras de distância espacial superam as perdas tradicionais de entropia cruzada baseadas em mudanças de rótulos de pixel. Com base nesse consenso teórico, experimentos de validação paralela são conduzidos usando esquemas de restrições de fronteira para avaliar o desempenho comparativo da Perda de Consistência Estrutural (SCL) personalizada baseada em Manhattan, em relação à adaptabilidade da cena. Os experimentos mantêm a arquitetura analítica de fundir uma espinha dorsal visual multiescala com uma rede de inferência de grafos, enquanto simplesmente substituem o termo de perda de fronteira durante a retropropagação. Quatro redes paralelas de validação são configuradas: uma rede que usa apenas a classificação básica de perda cruzada de entropia não possui restrições geométricas de alta dimensão; uma rede com perda adicional de entropia binária binária padrão de fronteira (BCE) realiza supervisão convencional de classificação binária de borda; uma rede com perda adicional de distância de fronteira espacial foca em capturar deformações locais; e uma rede que aplica a SCL proposta impõe penalidades topológicas ortogonais baseadas na SDF. As métricas de quantização no conjunto de validação de cenas internas RGB-D são limitadas ao mIoU e à pontuação F1 da fronteira estrutural.
A Tabela 6 detalha o grau de intervenção de diferentes estratégias de otimização por retropropagação na cognição lógica espacial subjacente. A entrada apenas de entropia cruzada na Tabela 6 denota a arquitetura nossa proposta treinada exclusivamente com perda de entropia cruzada em nível de pixel, mantendo a espinha dorsal visual, o ramo de campo de distância sinalizada, o módulo de atenção cruzada guiado por estrutura e o ramo de raciocínio em grafos superpixels inalterados. Esta entrada não é uma referência do Mask2Former e não deve ser comparada com o valor geral do Mask2Former na Tabela 3, pois utiliza o mesmo modelo. Redes que dependem exclusivamente da perda básica de entropia cruzada alcançam a menor pontuação de ajuste de fronteira. Redes com perda adicional de entropia cruzada binária padrão de fronteira alcançam um leve ganho, mas esse mecanismo ainda causa desfoque das bordas sob oclusão em larga escala. A perda de distância na fronteira espacial melhora a pontuação por meio de um mecanismo de percepção por transformação espacial, corrigindo efetivamente algumas bordas distorcidas. A perda de consistência estrutural proposta neste artigo utiliza diretamente a SDF real para impor penalidades de gradiente em mutações semânticas anômalas dentro da superfície física de suporte, alcançando a maior pontuação F1 na fronteira estrutural.
Para comparar visualmente os efeitos impulsionadores de diferentes configurações de função de perda na precisão da previsão de máscaras e no ajuste de limites, traçamos gráficos de barras agrupados entre diferentes estratégias de otimização.
A Figura 8 ilustra a melhoria de desempenho passo a passo resultante da atualização da dimensão de percepção espacial da função de perda. O gráfico de barras que representa a pontuação F1 da fronteira estrutural mostra uma tendência significativa de alta. Dados experimentais mostram que esse mecanismo de penalidade personalizado força a localização do salto espacial da categoria prevista a coincidir precisamente com o contorno físico ortogonal. O mecanismo de penalização de campo de distância, personalizado para priors ortogonais internos, alcança maior precisão do que a perda geral de captura de fronteira espacial, estabelecendo assim um caminho de otimização eficaz para o tratamento de falhas complexas de edifícios.
Teste de robustez de distribuição extrema de oclusão, estruturas anômalas e condições desafiadoras de iluminação
Relações espaciais complexas entre objetos e a oclusão mútua afetam negativamente a cognição espacial global 3D. A arquitetura de previsão conjunta destaca o papel de apoio das restrições de layout de cena na extração da máscara subjacente. Examinar os limites anti-interferência do algoritmo sob perda de sinal visual de grande área e layouts espaciais anômalos que violam a suposição física ortogonal 3D define claramente o limite efetivo da aplicação do algoritmo e tem valor central e demonstrável. Com base na proporção de móveis de grande porte mascarados com rótulos de verdade, o conjunto de teste de cenas internas RGB-D é subdividido em três subconjuntos progressivamente mais difíceis: oclusão leve, moderada e severa. Simultaneamente, cenas não típicas de Manhattan com tetos inclinados ou paredes curvas são extraídas manualmente para construir conjuntos de teste de contorno de anomalias, e cenas com condições de luz extremamente baixa, superexposição e superfícies de vidro brilhante ou transparente de grande área são categorizadas em subconjuntos desafiadores de iluminação e textura. A biblioteca de modelos de comparação inclui uma linha de segmentação baseada em máscara-atenção; uma arquitetura geral de segmentação baseada em atenção à máscara para capturar o contexto global; uma linha de base de agregação de características intermodal empregando uma estratégia abrangente de agregação multimodal; e uma linha base de fusão progressiva de características que integra um mecanismo progressivo de extração de características em múltiplos estágios. Cada linha base de comparação, a espinha dorsal visual de fusão e a arquitetura de análise da rede de inferência de grafos construída neste artigo são avaliados independentemente nos subconjuntos acima, e o gradiente de decaimento de precisão de cada modelo é analisado estatisticamente.
A Tabela 7 relata métricas de robustez específicas de subconjunto sob condições de oclusão leve, moderada e severa, iluminação desafiadora, interferência de textura e anomalias fora de Manhattan. A Tabela 7 detalha as mudanças na precisão da previsão de máscaras de diferentes modelos sob interferência espacial. A Tabela 7 relata valores de mIoU específicos de subconjunto para diferentes modelos sob condições de interferência espacial, calculados apenas dentro da oclusão, iluminação, textura ou subconjunto não Manhattan correspondente, em vez do conjunto geral de validação de cenas internas RGB-D. Nos subconjuntos de oclusão leve e moderada, todos os modelos mantêm uma precisão de base. Com o aumento da área de oclusão, os modelos de base baseados que dependem de regras baseadas em pixels mostram uma diminuição na razão de união de interseção (UI) no subconjunto fortemente ocluído. A linha base de segmentação baseada em atenção na máscara e a linha base de agregação de características intermodal sofrem perdas significativas de precisão nesse subconjunto. A arquitetura progressiva de extração de características em múltiplos estágios da linha base de fusão progressiva apresenta um declínio severo no desempenho. A solução proposta depende de características explícitas do esqueleto 3D para forçar o alinhamento de sinais visuais danificados, mantendo uma forma estável de saída de máscara no subconjunto fortemente ocluído e demonstrando a estabilidade topológica da saída da máscara semântica. Nos subconjuntos de iluminação e textura desafiadores, o detector de segmentos de linha não apresenta bordas estruturais em regiões com reflexões fortes e vidro transparente, levando a descontinuidades localizadas no SDF. As coordenadas geométricas errôneas propagam-se através da matriz de afinidade estrutural e da perda de consistência estrutural, aplicando assim penalidades anômalas de gradiente às características semânticas e causando desvios correspondentes nas previsões de fronteira. O mecanismo global de raciocínio do contexto espacial do GCN complementa os priors geométricos ausentes com afinidades estruturais adjacentes, mantendo a precisão geral da análise dentro de uma faixa de decaimento aceitável e revelando o limite das capacidades de percepção visual do algoritmo sob interferência física complexa. No subconjunto de anomalias não Manhattan, o prior SDF na camada inferior deste modelo introduz um leve viés de mapeamento, resultando em desempenho ligeiramente inferior ao da linha de base progressiva de fusão de características. O coeficiente de ponderação estrutural adaptativa no módulo de atenção cruzada avalia dinamicamente a consistência dos gradientes da estrutura física subjacente. Em cenas com paredes curvas ou tetos inclinados, esse coeficiente reduz automaticamente o peso de restrição do SDF, incentivando a rede a depender do mecanismo local de agregação de nós de características da rede de grafos superpixels para manter a coerência semântica em regiões homogêneas, estabelecendo assim um mecanismo eficaz de compensação geométrica para layouts espaciais não Manhattan.
Para demonstrar visualmente o impacto negativo da gravidade da oclusão na precisão da resolução, traçamos gráficos de linhas mostrando a diminuição da precisão entre diferentes modelos de algoritmos.
A Figura 9 revela visualmente as diferenças de robustez entre diferentes paradigmas de extração de características sob ambientes físicos extremos. As três linhas tracejadas que representam os modelos de linha base apresentam uma tendência significativa de queda em nós fortemente ocluídos, refletindo as limitações dos campos receptivos convencionais na extração de características sob perda de sinal em grande escala. A linha sólida que representa o método proposto mantém uma trajetória de decaimento relativamente suave. Dados experimentais mostram que o acoplamento entre priors arquitetônicos 3D explícitos e mecanismos de inferência baseados em grafos fornece suporte estrutural para tarefas de análise de cenas resistentes à oclusão e melhora o desempenho da generalização de modelos em ambientes complexos.
Análise de sensibilidade espacial da partição de nós de grafos de topologia
O parâmetro de taxa de amostragem de redução de dimensionalidade do módulo de convolução de grafos no espaço coordenado controla diretamente a qualidade do campo receptivo e a carga computacional da rede de grafos. Em linha com o arcabouço teórico deste artigo, este estudo investiga como o número de nós de grafo discretos produzidos por agrupamento iterativo linear simples afeta o desempenho da inferência topológica não euclidiana, visando fornecer suporte rigoroso para a seleção de hiperparâmetros. Experimentos foram realizados para ajustar os parâmetros de controle de inicialização do algoritmo de clustering, intervindo à força na redução dinâmica da dimensionalidade do espaço de características, estabelecendo o número de partições de nós de grafo superpixel para 64, 128, 256, 512 e 1024. Sob um benchmark de teste estritamente alinhado, a razão média interseção sobre união (IoU), a pontuação F1 do limite estrutural e o tempo médio de inferência por imagem de alta resolução foram registrados simultaneamente em diferentes tamanhos de nós topológicos.
A Tabela 8 detalha a relação entre o grau de redução dinâmica da dimensionalidade no espaço de características e tanto a precisão analítica quanto o custo computacional. Reduzir o número de nós muito baixo leva à subsegmentação das características da imagem, fazendo com que os atributos semânticos de objetos pequenos se fundam com as características de parede em grande escala, diminuindo assim várias métricas de precisão. À medida que a escala de particionamento dos nós aumenta, a sensibilidade do modelo a detalhes espaciais locais melhora significativamente. Aumentar o número de nós para 512 e 1024 resulta na fragmentação de regiões homogêneas, enfraquece o efeito de suavização sobre características macroscópicas em redes neurais de grafos, aumenta a dimensionalidade da matriz de relações entre nós e aumenta o tempo de inferência. Uma configuração de parâmetros com um número fixo de nós de 256 leva aos valores mais altos para a razão interseção-união e a pontuação de fronteira.
Para representar visualmente o equilíbrio entre precisão e poder computacional na inferência topológica não euclidiana, foi plotado um grafo estatístico biaxial mostrando a sensibilidade do tamanho do nó.
A Figura 10 ilustra a lógica subjacente pela qual o número de nós discretos do grafo afeta a evolução das características da rede. A barra de fundo que representa o tempo de computação mostra um aumento acentuado após o número de nós ultrapassar o limiar de 256. A linha dupla que representa a precisão atinge o pico em 256 no eixo horizontal, então diminui razoavelmente devido aos efeitos de fragmentação. Os dados quantitativos objetivos e a tendência de evolução visual são altamente consistentes, demonstrando que manter o tamanho do grafo computacional em 256 nós alcança um equilíbrio entre processamento por hardware e raciocínio lógico sob a configuração atual de parâmetros fixos. A severa degradação de desempenho causada pelo desvio desse número de nós revela a alta sensibilidade da estratégia fixa de segmentação superpixel à sintonia de hiperparâmetros e ressalta a necessidade de desenvolver um mecanismo dinâmico de seleção de nós.
DISPONIBILIDADE DE DADOS:
Os dados brutos de referência analisados neste estudo estão disponíveis publicamente nos repositórios oficiais listados na Tabela de Materiais. O benchmark 3D interno em grande escala foi acessado como a versão oficial ScanNet v2, com o identificador de lançamento do conjunto de dados ScanNet v2. O benchmark de cenas internas RGB-D foi acessado via a versão oficial NYU Depth Dataset V2, com o identificador de lançamento NYU Depth Dataset V2. O DOI descritivo para o benchmark 3D indoor em grande escala é 10.1109/CVPR.2017.261, e o DOI descritivo para o benchmark RGB-D de cenas internas é 10.1007/978-3-642-33715-4_54. Nenhuma nova imagem bruta ou conjunto de dados RGB-D foi gerada neste estudo. Os arquivos split processados, arquivos de configuração de treinamento, logs de avaliação brutos, arquivos fonte numéricos que suportam Tabela 2, Tabela 3, Tabela 4, Tabela 5, Tabela 6, Tabela 7 e Tabela 8, e Figura 5, Figura 6, Figura 7, Figura 8, Figura 9 e Figura 10, os pesos treinados dos modelos e o código-fonte foram depositados no figshare sob o DOI: 10.6084/m9.figshare.32906765. O registro do figshare fornece os dados completos de resultados brutos necessários para reproduzir as tabelas quantitativas e os números relatados neste manuscrito. O repositório contém as máscaras de previsão, arquivos de avaliação de fronteiras, scripts de cálculo métrico, checkpoints de modelo e arquivos-fonte de tabelas usados para o mIoU reportado, Boundary F1, PixelAcc, MeanAcc, complexidade computacional, robustez, validação da função de perda e análises de sensibilidade de partição de nós.

Figura 1: Comparação entre os efeitos de descontinuidade semântica e reparo estrutural prévio em cenários complexos de oclusão interna. (A) Imagem RGB original com oclusão de móveis em grande escala. (B) Saída do modelo tradicional de linha de base destacando distorção física de fronteira e defeitos de descontinuidade semântica. (C) Saída do método proposto com uma sobreposição de perspectiva de linha tracejada ciano que mapeia explicitamente o esqueleto 3D do edifício para reparo topológico das características danificadas da estrutura subjacente. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 2: Estrutura geral de análise semântica guiada por priors estruturais de construção. O diagrama delineia todo o pipeline começando pela entrada da imagem RGB, passando pelo ramo de extração de características visuais com janela deslocada e o ramo de extração prévia da estrutura, até o módulo de atenção cruzada guiado pela estrutura, seguido pelo raciocínio topológico via o GCN superpixel, e finalmente a decodificação no mapa semântico denso. Layouts detalhados do cálculo da matriz de afinidade de atenção, passagem de mensagens de grafo e das funções de perda de otimização conjunta são apresentados à direita. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 3: Fluxograma da matriz de afinidade e construção da conectividade topológica. O gráfico detalha o pipeline de mapeamento matemático passo a passo, mostrando a transformação do mapa de distância de entrada e dos pares de pixels selecionados, através da extração contínua de características geométricas de potencial e avaliação de consistência de gradiente, até a matriz de afinidade normalizada usada como viés espacial explícito para o mecanismo de atenção cruzada. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 4: Diagrama esquemático de projeção de convolução de grafo superpixel e agregação de características. O painel detalha o processo de raciocínio topológico não euclidiano: (A) características densas de pixels mostrando a matriz local original de características e os limites de agrupamento de superpixels; (B) construção da topologia de grafo superpixel mapeando a grade regular para nós discretos e arestas fisicamente conectadas; (C) passagem convolucional de mensagens de grafo realizando agregação direcional de características locais; e (D) retroprojeção de coordenadas apresentando as características de consistência semântica macroscópica restauradas na grade densa. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 5: Diagrama qualitativo de grade comparativa. A matriz fornece uma avaliação visual de desempenho em diferentes cenas internas por linha, comparando as entradas RGB originais e os layouts ground-truth com as saídas da linha base de segmentação baseada em atenção na máscara, a linha base de agregação de características cross-modal, a linha base progressiva de fusão de características e o método proposto, que restaura com sucesso cantos ocluídos e alinha superfícies suportantes. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 6: Resultados da ablação para integração cumulativa de módulos. O gráfico de dois eixos demonstra a evolução do desempenho passo a passo entre diferentes configurações modulares de ablação, traçando a trajetória constante para cima da interseção média sobre união (mIoU) como barras e a pontuação F1 da fronteira estrutural como um gráfico de linhas desde a espinha dorsal da linha de base até a estrutura completa. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 7: Complexidade computacional, tempo de treinamento e distribuição de eficiência de inferência. O gráfico multidimensional de bolhas revela as compensações entre overhead computacional e precisão de análise sintática. O eixo horizontal mede operações em ponto flutuante (FLOPs), o eixo vertical indica mIoU, o tamanho da bolha representa a escala dos parâmetros treináveis, e os rótulos de texto adjacentes reportam a latência de inferência de quadro único para cada arquitetura de rede. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 8: Histograma da precisão dos limites e das pontuações métricas sob diferentes configurações de função de perda. O gráfico de barras agrupado compara os efeitos impulsionadores de várias estratégias de otimização na lógica espacial subjacente, ilustrando os ganhos significativos em mIoU e na pontuação F1 da fronteira estrutural alcançados ao atualizar das formulações padrão de entropia cruzada para a proposta de perda de consistência estrutural. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 9: Gráfico de linhas mostrando a relação entre gravidade da oclusão e decaimento do desempenho. A curva acompanha a degradação da precisão entre diferentes paradigmas de extração de características sob níveis de oclusão leve, moderada e severa, destacando a robusta estabilidade topológica e capacidade anti-interferência do framework guiado por estrutura proposto em comparação com as linhas base puramente base-pixel. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 10: Análise de sensibilidade da escala de nós superpixel. O gráfico estatístico biaxial ilustra o equilíbrio entre velocidade de processamento de hardware e precisão do raciocínio lógico entre diferentes tamanhos de partição de grafos, mostrando como o número de nós superpixel afeta métricas de precisão e leva a um aumento acentuado no tempo médio de inferência. Por favor, clique aqui para ver uma versão ampliada desta figura.
| Numeração da camada de rede | Dimensão das características do nó de entrada | Dimensão de característica do nó de saída | Configuração de probabilidade de inativação aleatória |
| 1 | 512 | 256 | 0.15 |
| 2 | 256 | 256 | 0.15 |
| 3 | 256 | 128 | 0.1 |
| 4 | 128 | 64 | 0.05 |
Tabela 1: Tabela de Configuração de Hiperparâmetros da Arquitetura de Rede para o Módulo de Inferência Convolucional. A tabela relata a numeração da camada de rede, as dimensões das características dos nós de entrada, as dimensões das características dos nós de saída e as configurações de probabilidade aleatória de inativação usadas na rede de raciocínio por grafos.
| Item de configuração | Benchmark 3D em grande escala para ambientes internos | Benchmark de cenas internas RGB-D |
| Identificador oficial de lançamento | ScanNet v2 | Conjunto de Dados de Profundidade da NYU V2 |
| Amostras de treinamento utilizadas neste estudo | 1201 cenas | 795 imagens |
| Validação ou teste de amostras usadas para avaliação | 312 cenas de validação | 654 imagens de teste |
| Categorias semânticas totais | 20 | 40 |
| Resolução da imagem de entrada | 512 × 512 | 512 × 512 |
| Taxa inicial de aprendizado | 0.0001 | 0.0001 |
| Contagem de amostras de entrada em lote | 8 | 8 |
| Coeficiente de decaimento de peso | 0.01 | 0.01 |
| Épocas totais de treinamento | 300 | 300 |
| Número de corridas independentes | 5 | 5 |
Tabela 2: Divisão do Conjunto de Dados Experimental e Configuração Unificada de Hiperparâmetros de Treinamento. A tabela reporta configurações de partição de amostras de amostras de conjunto de dados 3D internos em grande escala e conjunto de dados RGB-D de cenas internas, contagens semânticas de categorias, configurações de taxa de aprendizado, contagem de amostras em lote de entrada, taxa de decaimento de peso e contagem total de iterações de treinamento.
| Arquitetura do modelo de rede | mIoU | Limite F1 | PixelAcc | MeanAcc |
| SegFormer | 0,596 ± 0,003 | 0,635 ± 0,004 | 0,838 ± 0,003 | 0,704 ± 0,004 |
| ConvNeXt UperNet | 0,604 ± 0,003 | 0,642 ± 0,004 | 0,846 ± 0,003 | 0,713 ± 0,004 |
| Mask2Former | 0,612 ± 0,003 | 0,654 ± 0,004 | 0,853 ± 0,003 | 0,721 ± 0,004 |
| OneFormer | 0,621 ± 0,002 | 0,663 ± 0,003 | 0,861 ± 0,003 | 0,733 ± 0,003 |
| MaskDINO | 0,628 ± 0,002 | 0,667 ± 0,003 | 0,869 ± 0,003 | 0,741 ± 0,003 |
| CCANet | 0,635 ± 0,003 | 0,671 ± 0,004 | 0,876 ± 0,003 | 0,745 ± 0,004 |
| InternImage UperNet | 0,641 ± 0,002 | 0,692 ± 0,003 | 0,884 ± 0,002 | 0,756 ± 0,003 |
| CMPFFNet | 0,658 ± 0,002 | 0,712 ± 0,003 | 0,891 ± 0,002 | 0,773 ± 0,003 |
| SGCA_GCN | 0,687 ± 0,002 | 0,764 ± 0,003 | 0,924 ± 0,002 | 0,816 ± 0,003 |
Tabela 3: Comparação quantitativa geral das linhas de base de análise de cenas internas no conjunto de validação de cenas internas RGB-D. A tabela relata mIoU, pontuação F1 da fronteira, precisão global de pixels e precisão da classe média para a linha base de segmentação baseada em atenção em máscara, linha base de agregação de características intermodal, linha base progressiva de fusão de características e a arquitetura de rede guiada por estrutura proposta.
| Configuração da arquitetura de rede | mIoU | Limite F1 | PixelAcc | MeanAcc |
| Espinha dorsal de janela deslocada base | 0,615 ± 0,003 | 0,630 ± 0,004 | 0,842±0,003 | 0,706 ± 0,004 |
| Espinha dorsal mais atenção cruzada guiada pela estrutura | 0,648 ± 0,003 | 0,685 ± 0,004 | 0,874 ± 0,003 | 0,748 ± 0,004 |
| Raciocínio de grafos de espinha dorsal mais superpixel | 0,641 ± 0,003 | 0,676 ± 0,004 | 0,868 ± 0,003 | 0,741 ± 0,004 |
| Perda de consistência entre espinha dorsal e estrutura | 0,632 ± 0,003 | 0,662 ± 0,004 | 0,859 ± 0,003 | 0,732 ± 0,004 |
| Backbone mais atenção cruzada e raciocínio por grafos | 0,669 ± 0,002 | 0,721 ± 0,003 | 0,897 ± 0,002 | 0,782 ± 0,003 |
| Espinha dorsal mais atenção cruzada e perda de consistência estrutural | 0,660 ± 0,002 | 0,713 ± 0,003 | 0,889 ± 0,002 | 0,773 ± 0,003 |
| Raciocínio de espinha dorsal mais gráfico e perda de consistência estrutural | 0,653 ± 0,003 | 0,704 ± 0,003 | 0,881 ± 0,003 | 0,765 ± 0,003 |
| Modelo completo sem viés aditivo de campo de distância sinalizada | 0,656 ± 0,003 | 0,698 ± 0,004 | 0,884 ± 0,003 | 0,761 ± 0,004 |
| Modelo completo sem ponderação estrutural adaptativa λ | 0,671 ± 0,002 | 0,736 ± 0,003 | 0,904 ± 0,002 | 0,792 ± 0,003 |
| Modelo completo sem restrição de arestas coplanar | 0,666 ± 0,002 | 0,728 ± 0,003 | 0,899 ± 0,002 | 0,786 ± 0,003 |
| Modelo completo sem normalização simétrica de grafos | 0,673 ± 0,002 | 0,737 ± 0,003 | 0,906 ± 0,002 | 0,795 ± 0,003 |
| Pleno SGCA_GCN | 0,687 ± 0,002 | 0,764 ± 0,003 | 0,924 ± 0,002 | 0,816 ± 0,003 |
Tabela 4: Análise ampliada de ablação quantitativa dos componentes principais. A tabela relata integração cumulativa de módulos, combinações de módulos par a par e configurações de remoção de componentes para quantificar as contribuições independentes e cooperativas da atenção cruzada guiada pela estrutura, viés de campo por distância sinalizada, ponderação estrutural adaptativa, raciocínio em grafos superpixel, construção coplanar de aresta, normalização simétrica de grafos e perda de consistência estrutural.
| Arquitetura do modelo de rede | Parâmetros | FLOPs | Memória de pico | Tempo de treinamento | Tempo de inferência | FPS | mIoU | Limite F1 |
| SegFormer | 83,7 M | 80,1 G | 6,1 GB | 10,6 h | 44 ms | 22.7 | 0.596 | 0.635 |
| ConvNeXt UperNet | 60,2 M | 91,5 G | 6,4 GB | 11,2 h | 47 ms | 21.3 | 0.604 | 0.642 |
| Mask2Former | 44,0 M | 74,6 G | 5,8 GB | 9,4 h | 41 ms | 24.4 | 0.612 | 0.654 |
| OneFormer | 64,1 M | 103,2 G | 7,0 GB | 12,9 h | 55 ms | 18.2 | 0.621 | 0.663 |
| MaskDINO | 52,8 M | 96,8 G | 6,8 GB | 12,1 h | 52 ms | 19.2 | 0.628 | 0.667 |
| CCANet | 63,5 M | 118,7 G | 7,6 GB | 14,8 h | 67 ms | 14.9 | 0.635 | 0.671 |
| InternImage UperNet | 70,4 M | 112,3 G | 7,4 GB | 14,2 h | 64 ms | 15.6 | 0.641 | 0.692 |
| CMPFFNet | 58,9 M | 104,6 G | 7,1 GB | 13,1 h | 59 ms | 16.9 | 0.658 | 0.712 |
| SGCA_GCN | 66,8 M | 121,4 G | 7,9 GB | 15,6 h | 61 ms | 16.4 | 0.687 | 0.764 |
Tabela 5: Complexidade computacional, tempo de treinamento e comparação de eficiência de inferência com a precisão geral do conjunto de validação. A tabela reporta parâmetros treináveis, operações em ponto flutuante, uso máximo de memória, tempo de treinamento para 300 épocas, latência de inferência de quadro único, quadros por segundo, mIoU e pontuação Boundary F1 para o método proposto e redes de comparação.
| Configuração da Função de Perda | mIoU | Limite F1 |
| Apenas Entropia Cruzada (CE) | 0.669 | 0.721 |
| CE + Limite BCE | 0.674 | 0.738 |
| CE + Perda InversaForma | 0.681 | 0.752 |
| CE + Nosso SCL | 0.687 | 0.764 |
Tabela 6: Comparação quantitativa da validação da função de perda. A tabela relata a pontuação mIoU e F1 de fronteira sob perda de entropia cruzada, perda binária de entropia cruzada de fronteira, perda por transformação inversa e a perda de consistência estrutural proposta.
| Arquitetura de modelos algorítmicos | Oclusão leve | Oclusão moderada | Oclusão severa | Conjunto de anomalias fora de Manhattan | Subconjunto de interferência de textura |
| (mIoU) | (mIoU) | (mIoU) | (mIoU) | (mIoU) |
| Mask2Former | 0.685 | 0.612 | 0.421 | 0.584 | 0.553 |
| CCANet | 0.698 | 0.635 | 0.463 | 0.612 | 0.566 |
| CMPFFNet | 0.715 | 0.658 | 0.512 | 0.635 | 0.602 |
| SGCA_GCN | 0.732 | 0.687 | 0.645 | 0.628 | 0.649 |
Tabela 7: Análise de robustez específica por subconjunto da distribuição extrema de oclusão e estruturas fora de Manhattan. A tabela relata mudanças na precisão da análise sintática entre os subconjuntos de oclusão leve, oclusão moderada, oclusão severa, iluminação desafiadora, interferência de textura e não-anomalia de Manhattan.
| Número de nós superscale | mIoU | FronteiraF1 | Tempo médio de inferência (ms) |
| 64 | 0.641 | 0.695 | 45 |
| 128 | 0.665 | 0.732 | 52 |
| 256 | 0.687 | 0.764 | 61 |
| 512 | 0.678 | 0.751 | 95 |
| 1024 | 0.662 | 0.735 | 185 |
Tabela 8: Análise de Sensibilidade Espacial da Escala de Partição de Nós em Grafo de Topologia. A tabela relata o mIoU, a pontuação F1 do limite estrutural e o tempo médio de inferência entre diferentes configurações de partição de nós superpixel.