Artículo de investigación

Un método de análisis semántico para imágenes de escenas interiores basado en conocimientos previos sobre la estructura de edificios

30 vistas

DOI:

10.3791/72054

11 de agosto de 2026

En este artículo

Resumen

Este estudio propone un algoritmo que acopla estrechamente las características visuales jerárquicas capturadas por un codificador jerárquico de transformador de ventana desplazada con la profundidad previa de la caja delimitadora 3D Manhattan generada por detección de segmentos de línea, logrando así una reconstrucción semántica de alta precisión de escenas interiores complejas.

Resumen

Para abordar las discontinuidades de predicción semántica y las distorsiones físicas de los límites causadas por la oclusión de muebles en escenas interiores complejas, este artículo propone un método de análisis semántico que aprovecha los priors de estructura de edificios. El esquema utiliza un codificador jerárquico de transformador de ventana desplazada para extraer características visuales multiescala y combina un algoritmo de detección de segmentos de línea con consistencia en dirección de gradiente para construir una caja delimitadora 3D Manhattan. Esta caja delimitadora se transforma en un campo de distancia con signo (SDF) antes de codificar contornos geométricos discretos en un campo de potencial físico continuo. Un mecanismo de atención cruzada guiado por la estructura fuerza a que las señales visuales se alineen con los límites geométricos ortogonales 3D reales, restaurando la continuidad de las características en las áreas ocluidas. Un grafo de adyacencia espacial construido a partir de nodos superpíxeles impulsa una Red Convolucional de Grafos (GCN) para agregar características, asegurando la consistencia semántica macroscópica dentro del plano físico portador de carga. Una combinación de pérdida de entropía cruzada a nivel de píxel y una pérdida de consistencia estructural diseñada a medida refuerza las restricciones, penalizando las predicciones fuera de límites. Experimentos realizados en múltiples corridas independientes muestran que la intersección media sobre unión (mIoU) alcanza el 68,7% con una desviación estándar del 0,2%, y la puntuación F1 del límite estructural alcanza el 76,4% con una desviación estándar del 0,3%, confirmando el rendimiento robusto de los módulos propuestos. Con un tamaño de nodo de imagen único de 256, el tiempo medio de inferencia se mantuvo en 61 ms.

Introducción

El análisis semántico de imágenes de escenas interiores ocupa una posición central en la cognición espacial tridimensional y en las tareas de razonamiento espacialinteligente 1,2. La extracción de características visuales en entornos físicos reales suele verse gravemente obstaculizada por disposiciones espacialescomplejas 3. Resolver la discontinuidad semántica y la distorsión física de los límites de la estructura de la cimentación del edificio causada por la oclusión de muebles a gran escala es importante para la investigación en cogniciónespacial 4,5. Eliminar con precisión la interferencia de objetos desordenados y restaurar la continuidad física de la misma pared y suelo determinará directamente la precisión de la reconstrucción tridimensional de escenas y el análisis lógico espacialglobal 6. La discontinuidad semántica causada por la oclusión de mobiliario a gran escala y el efecto de reparación estructural de la guía previal propuesta para edificios se ilustran en la Figura 1, donde la entrada ocluida rojo verde azul (RGB) en la Tabla 1A, la distorsión base de la máscara en la Figura 1B y el resultado de reparación previa de la estructura en la Figura 1C se comparan bajo la misma condición de escena interior.

Para cumplir con los requisitos de precisión del razonamiento lógico espacial, las redes visuales actuales impulsadas por píxeles se enfrentan a múltiples obstáculos al tratar con entornos interiorescomplejos 7,8. Los espacios interiores suelen estar llenos de mobiliario denso y mobiliario desordenado, lo que provoca una pérdida significativa de señales de límite visual a bajo nivel en lasimágenes 9. Los mecanismos convencionales de extracción de características dependen en exceso de respuestas locales bidimensionales de color y textura, careciendo de una comprensión macroscópica de las rígidas leyes ortogonales de estructuras tridimensionales hechaspor el hombre 10. Esta limitación del campo receptivo local hace que la propagación de características se interrumpa fácilmente, dificultando la extensión de la topología global a través de lasoclusiones 11. Actualmente, existe una necesidad urgente de resolver el problema central de las discontinuidades en la predicción semántica y las graves distorsiones de los límites físicos causadas por la oclusión einterferencia 12.

Para abordar fallos estructurales en los cimientos de los edificios causados por la oclusión y la interferencia, la comunidad académica ha desarrollado una variedad de medidas de intervencióndirigidas 13. Las redes de agregación de características intermodales compensan eficazmente las deficiencias inherentes de una sola modalidad visual en la percepción espacial introduciendo mapas de profundidad o priors de texto para ayudar con imágenes rojo-verde-azul (RGB) 14,15. Los marcos de percepción de límites y selección adaptativa de contexto inyectan estrategias de mejora física de contornos en la etapa de decodificación de características, lo que mejora considerablemente el ajuste de bordes de los resultados de predicción en escenascomplejas 16,17. Los modelos de inferencia basados en GCNs y mecanismos de interacción de características mejoran significativamente la suavidad de características y la consistencia macrosemántica en regiones homogéneas al construir conexiones a nivel denodo 18,19. Integrar priors estructurales explícitos de Manhattan en la tubería de extracción de características visuales impone límites de consistencia geométrica, lo que aborda los desafíos de discontinuidad de características causados por una oclusión extensa de objetos en primerplano 20.

Para abordar el desafío central de fallos de predicción semántica y distorsiones severas de los límites físicos asociados a la infraestructura de construcción, se propone un marco de análisis semántico basado en un mecanismo de acoplamiento de lazo cerrado que incorpora priors arquitectónicos. Este marco trasciende las canaletas de ingeniería ingenuas al establecer una alineación bidireccional de mapeo entre campos geométricos continuos de potencial y variedades de características visuales discretas, formando una sinergia no trivial que corrige errores de oclusión mediante leyes estructurales. Este esquema se basa en una red de columna vertebral visual multiescala y un algoritmo de detección de segmentos de línea basado en la estimación del punto de fuga, para adquirir características de apariencia local y priors ortogonales de aristas que representan la caja delimitadora 3D de Manhattan en paralelo, y luego transformarlos en una SDF. El algoritmo emplea un mecanismo de atención cruzada guiado por la estructura, empleando características visuales como vectores de consulta y tratando las características SDF como claves y valores para cálculos de producto escalar, forzando así que la señal visual se alinee con el límite geométrico 3D real en el espacio de características. Un grafo de adyacencia espacial construido a partir de nodos superpíxeles y características de borde de coplanaridad espacial se introduce en un GCN para realizar la agregación de características entre nodos y el paso de mensajes. El proceso de optimización de parámetros de extremo a extremo emplea conjuntamente entropía cruzada a nivel de píxel y una función de pérdida de consistencia estructural personalizada, que limita y penaliza estrictamente a los píxeles predichos que cruzan el límite edificio-prior. La cadena completa de análisis semántico se resume en la Figura 2, que vincula la entrada de imágenes RGB, la extracción geométrica de prior, el alineamiento de atención cruzada, el razonamiento de grafos superpíxeles y la decodificación de máscaras semánticas dentro de una arquitectura unificada.

Las primeras redes de análisis sintáctico de escenas dependían de operaciones convolucionales para capturar texturas de apariencia local, pero debido a limitaciones en los campos receptivos locales, mostraban una coherencia semántica insuficiente de objetivos a granescala 21,22. Estudios previos han aplicado el módulo de autoatención de la arquitectura visual Transformer para extraer información contextual global y construir características de asociación de píxeles a largadistancia 23,24. Las estrategias de agregación de características multi-vista multimodal extraen los rasgos geométricos espaciales tridimensionales de la escena fusionando nubes de puntos en el mapa de profundidad y entradas de comandosde texto 25,26. Los mecanismos híbridos de atención para fusión de características dirigidos a dominios específicos han madurado gradualmente. Al construir puentes de interacción de características, han reducido significativamente la pérdida de energía y la escasez de características en la transmisión multiescala de señales visuales, y han mejorado la robustez del análisis sintáctico de estructuras complejas. Los diseños de codificadores de vanguardia integran e inferen conjuntamente detalles espaciales en el dominio de alta frecuencia junto con características globales y locales, reforzando la capacidad de la red para distinguir categorías semánticas de grano fino con alta similitud y mejorando la precisión del análisis eninteriores 27,28. Los avances recientes en arquitecturas de segmentación semántica proporcionan referencias valiosas para optimizar la eficiencia computacional y la percepción espacial. Los modelos diseñados para predicción densa y agregación contextual a escala múltiple extraen características geométricas de grano fino de fondos complejos. Las estrategias de desacoplamiento de características y fusión sinérgica abordan la ambigüedad semántica en las regiones límite. Mecanismos de atención ligeros y módulos de agregación con puertas optimizan la distribución de parámetros, acelerando así la inferencia mientras se preservan los detalles estructurales locales. La implementación de estos diseños arquitectónicos eficientes ofrece una guía teórica para reducir la sobrecarga computacional de las operaciones de inferencia topológica no euclidianas en el análisis de escenas interiores.

Se utilizan los previos de estructura de edificios y la estimación de disposición 3D para corregir errores de análisis visuallocal 29. Estudios previos han extraído características geométricas ortogonales y paralelas de edificios interiores como restricciones de inferencia para reducir el sesgo de predicción de redes causado por fondos interioressaturados 30,31. Los esquemas existentes utilizan algoritmos de detección de segmentos de línea y técnicas de análisis puntual de ablación de imágenes para generar cajas delimitadoras Manhattan 3D que mapeen los límites físicos de las habitaciones y ayuden en la localización de las características visualessubyacentes 32. La arquitectura conjunta del módulo de conciencia de límites y el contexto multiescala incrustan implícitamente información estructural previa en el proceso de decodificación de características de alta dimensión, obligando a la red a producir máscaras semánticas que coincidan estrechamente con los contornos físicos reales, mejorando efectivamente la irregularidad y el desenfoque de los bordes de losobjetos 33. Se han explorado ampliamente diseños de funciones de pérdida semi-supervisadas o débilmente supervisadas con propiedades de realce de fronteras. Apoyándose en fórmulas matemáticas rigurosas para castigar comportamientos independientes de clasificación de píxeles que violan las reglas topológicas espaciales, la suavidad geométrica y la integridad estructural del resultado final de segmentación están garantizadas desde la fuente de optimización degradientes 34.

Algunos estudios han utilizado redes neuronales de grafos para realizar agregación multidominio de características visuales y razonamiento sobre relaciones topológicas en un espacio de altadimensión 35. El algoritmo de segmentación de superpíxeles preagrega bloques de píxeles adyacentes con características similares de respuesta de color y textura en nodos conectados independientes. El algoritmo de segmentación superpíxel comprime la redundancia computacional de la estructura del grafo a nivel de imagen y preserva la topología geométrica básica de la imagen36. El GCN, construido sobre el vector de características nodales de alta dimensión, y la matriz de adyacencia que representa la proximidad espacial impulsa la transmisión direccional eficiente y la fusión interactiva de información visual multiescala a lo largo del grafo físico conectado en el dominioespacial 37,38. La aplicación del módulo de mejora temporal de información y el mecanismo híbrido de salto multiescala suprime el suavizado excesivo y homogeneización de las características del nodo generadas en el proceso de paso profundo de mensajesmulticapa 39. La tecnología de transformación wavelet de grafo multiescala y la estrategia de optimización de aprendizaje de elementos pseudo-etiquetados optimizan el mecanismo antiruido de fondo de la fórmula de actualización de características de nodos, de modo que características con los mismos atributos semánticos mantengan un modo de respuesta cooperativa en topología de redcompleja 40. El mecanismo de razonamiento basado en grafos asigna cuadrículas de píxeles regulares a espacios topológicos no euclidianos para realizar cálculos de agregación de características de estructuras irregulares de edificios y componentesinteriores 41.

Protocolo

Se prepararon conjuntos de datos de escenas RGB interiores y sus anotaciones semánticas antes del entrenamiento en red. El conjunto de datos 3D para interiores a gran escala y el conjunto de datos de escenas interiores RGB-D (véase la Tabla de Materiales) se obtuvieron de sus repositorios oficiales. Se conservaron las escenas de adquisición interiores que contenían oclusión de mobiliario, variación de iluminación, interrupción de límites de muros y complejos diseños espaciales para coincidir con el escenario de análisis objetivo. Las etiquetas semánticas se convirtieron en máscaras de anotación PNG de canal único indexadas, y todas las imágenes RGB y máscaras semánticas se redimensionaron a 512 × 512 píxeles. Durante el entrenamiento se aplicó aumento de datos en línea, con giros horizontales aleatorios con probabilidad de 0,5, escalado aleatorio de brillo entre 0,8 y 1,2, y rotación aleatoria entre −10° y +10° para ampliar la distribución estructural. Los canales RGB se normalizaron con valores medios de 0,485, 0,456 y 0,406 y valores de desviación estándar de 0,229, 0,224 y 0,225. La prueba 3D a gran escala en interiores siguió la división oficial de lanzamiento utilizada en este estudio, con 1201 escenas de entrenamiento y 312 escenas de validación para el desarrollo y validación del modelo. El benchmark RGB-D de escenas interiores siguió el protocolo oficial de evaluación, con 795 imágenes de entrenamiento y 654 imágenes de prueba. No se aplicó ninguna división adicional basada en porcentaje a estos dos referentes públicos.

Se inicializó una red de columna vertebral visual jerárquica de transformadores de ventana desplazada (véase la Tabla de Materiales) como la red troncal del codificador de transformadores de ventana móvil. El tamaño de la incrustación del parche estaba configurado como 4 x 4 píxeles. Las dimensiones de incrustación de las cuatro etapas jerárquicas se establecieron en 128, 256, 512 y 1024, y el número de bloques transformadores en las cuatro etapas se fijó en 2, 2, 18 y 2. El tamaño de la ventana de atención local se estableció en 7 x 7, y el número de cabezas de atención en 4, 8, 16 y 32 para las cuatro etapas jerárquicas. Se usaron funciones de activación continua no lineales dentro de todas las capas de perceptrón multicapa. El muestreo espacial se realizó mediante operaciones de fusión de parches con un paso de 2 tras cada etapa jerárquica. La arquitectura de la red central y los hiperparámetros del módulo de inferencia convolucional se resumieron en la Tabla 1.

A continuación, se realizó la extracción de características de autoatención con ventana desplazada en los mapas de características de entrada. Cada mapa de características se dividía en ventanas locales no solapadas con dimensiones espaciales de 7 × 7. La atención regular de ventana y la atención de ventana desplazada se alternaban entre bloques adyacentes de transformadores de ventana desplazada. La distancia de desplazamiento cíclico se estableció en 3 píxeles y se aplicó codificación de sesgo posicional relativo dentro de cada ventana de atención local. Las características visuales locales se agregaron mediante autoatención multi-cabeza para generar representaciones jerárquicas y a escala múltiple.

Los previos estructurales de Manhattan se extrajeron de imágenes RGB interiores. Los segmentos estructurales de los bordes se detectaron mediante un algoritmo de detección de segmentos de línea de gradiente-dirección-consistencia. Las direcciones estructurales dominantes se agruparon mediante un algoritmo de consenso aleatorio de muestra (RANSAC) (véase la Tabla de Materiales) basado en la estimación del punto de fuga. Se reconstruyeron tres direcciones Manhattan mutuamente ortogonales para generar la representación Manhattan 3D de la caja delimitadora. El límite estructural reconstruido se convirtió en un mapa SDF calculando la distancia euclidiana mínima desde cada píxel hasta el segmento de línea límite más cercano.

Se generaron características de atención cruzada guiadas por estructuras después de que se obtuvieran las características visuales y los previos de SDF. La variedad de características visuales se mapeó al tensor de consulta Q a través de la matriz de transformación lineal W subelemento Q de la tapa de doble acuñación R, a la matriz de formación W, subelemento Q de la tapa de doble acuñación R, a la matriz figure-protocol-1de formación. El campo de distancias continuas previa se mapeó al tensor clave K y al tensor de valor V a través de las matrices figure-protocol-2de transformación , y la dimensión del modelo se estableció en 512. La modulación multi-cabeza dividió el espacio de proyección en 8 subespacios independientes, con cada cabeza con una dimensión de 64. La disposición espacial previa proyectaba coordenadas discretas de píxeles en un campo de potencial continuo y generaba la matriz de afinidad estructural S como un sesgo espacial aditivo explícito para modular la matriz de similitud del producto escalar. El tensor de características visuales se utilizó como fuente de consulta porque el análisis semántico requiere que cada ubicación visual recupere activamente evidencia estructuralmente consistente del espacio geométrico a priori. El prior SDF se utilizó como fuente clave y de valor porque almacena la distancia continua de límite y las pistas estructurales interior-exterior derivadas del diseño Manhattan. El término producto escalar medía la compatibilidad entre la apariencia semántica y el prior geométrico, mientras que el término estructural aditivo λS desplazaba los pesos de atención hacia píxeles en el mismo plano físico o cerca del mismo contorno arquitectónico. El coeficiente λ representaba la confianza en el prior estructural extraído y controlaba hasta qué punto se incorporaban restricciones ortogonales rígidas en la distribución de atención. Esta formulación redujo la difusión transfronteriza causada por la oclusión del mobiliario y mantuvo la relajación adaptativa en diseños no Manhattan. La distribución de la atención guiada por la estructura se calculó según la Ecuación 1.

Ecuación 1: figure-protocol-3

donde A denota la matriz de agregación de atención guiada por estructuras, Q denota el tensor de consulta generado a partir de características visuales, K denota el tensor clave generado a partir de características previas SDF, V denota el tensor de valores generado a partir de representaciones a priori estructurales, dk denota la dimensión de características del tensor clave, λ denota el coeficiente de ponderación estructural adaptativo utilizado para identificar la confianza geométrica de regiones locales y relajar restricciones ortogonales rígidas en espacios no Manhattan y S denota la matriz de afinidad SDF. La división por dk estabilizó la escala de los logits de atención y evitó que las grandes dimensiones de las características produjeran pesos de atención sobreconcentrados. La función exponencial normalizada (véase la Tabla de Materiales) transformaba las puntuaciones de similitud moduladas en una distribución espacial normalizada, permitiendo que cada píxel agregara información estructural previa basada en la consistencia semántica y geométrica. Este diseño explica por qué la apariencia visual y los priors de límite arquitectónico se fusionan a nivel de atención en lugar de por concatenación directa de características.

El grafo de topología de superpíxeles se construyó a partir del mapa de características alineado con la estructura. El mapa de características se segmentó utilizando un algoritmo de generación de regiones espaciales. El número de superpíxeles se estableció en 256, el coeficiente de compacidad en 10, el coeficiente de suavizado gaussiano en 1,0 y el número de iteración en 10. Las restricciones de proximidad espacial se impusieron estableciendo el peso métrico de distancia a una relación constante de 1,0 respecto a la distancia entre el espacio de color de características durante el agrupamiento, manteniendo así una generación uniforme de nodos a través de límites de denso desorden. Los píxeles con respuestas semánticas homogéneas se agregaron en nodos superpíxeles. Las aristas de grafos se construyeron según relaciones de adyacencia espacial, fuerza de afinidad SDF y restricciones de consistencia geométrica coplanar. El proceso de construcción de la matriz de afinidad estructural y la conectividad topológica se muestra en la Figura 3, que muestra cómo la guía SDF se transformó en relaciones espaciales a nivel de grafo.

La formulación de grafos se introdujo para convertir el razonamiento denso píxel a píxel en razonamiento espacial nodo a nodo sobre regiones estructurales homogéneas. Cada nodo superpíxel representaba una región local con respuesta semántica y continuidad espacial similares, mientras que cada arista representaba un camino fiable para la transmisión de características sujeto a las restricciones de adyacencia, afinidad de campo de distancia y consistencia coplanar. Este diseño redujo la influencia de píxeles aislados y ruidosos y permitió que regiones ocluidas de paredes, suelos y techos recibieran mensajes de nodos físicamente adyacentes. Por tanto, la construcción de aristas servía como un puente matemático entre la guía SDF continua y el razonamiento discreto de grafos no euclidianos.

Se configuró una red de razonamiento convolucional de grafos de tres capas con dimensiones ocultas de características 512, 256 y 128. La capa convolucional de grafos realizaba suavizado de características sobre la estructura del grafo basado en las relaciones espaciales de los nodos. La adyacencia de auto-bucle mantuvo el estado original de cada nodo durante el paso de mensajes, evitando que las características de una pequeña región estructural fueran borradas por las grandes regiones circundantes. La normalización simétrica escaló los elementos de la matriz de adyacencia mediante el producto de las raíces cuadradas inversas de los grados de los nodos, de modo que nodos de alto y bajo grado contribuyeron bajo magnitudes numéricas comparables durante la propagación. La propagación por avance de avance realizó una agregación espacial localizada, en la que cada estado de nodo absorbió características de alta dimensión de grupos coplanares adyacentes antes de aplicar la función de rectificación no lineal elemento por elemento. Esta formulación hacía que la capa de convolución de grafos aproximara la difusión semántica a lo largo de planos interiores físicamente significativos en lugar de suavizar sin restricciones los límites de objetos no relacionados. Las características de los nodos del grafo se evaluaron según la Ecuación 2.

Ecuación 2: figure-protocol-4

La proyección desde características densas de píxeles hasta nodos superpíxeles, el paso de mensajes de convolución de grafos y la retroproyección de coordenadas se presentan en la Figura 4, aclarando el camino de agregación de características desde cuadrículas de imagen regulares hasta una topología no euclidiana y de vuelta a una representación semántica densa. La proyección desde características densas de píxeles en la Figura 4A a nodos superpíxeles en la Figura 4B, el paso de mensajes de convolución de grafo en la Figura 4C y la retroproyección de coordenadas en la Figura 4D aclaran el camino de agregación de características desde las cuadrículas de imagen regulares hasta una topología no euclidiana y de nuevo a una representación semántica densa.

donde H(l) denota el tensor de características del nodo de la capa de convolución del grafo l-ésimo, Â denota la matriz de adyacencia con conexiones de auto-lazo, D denota la matriz de grados correspondiente a la matriz de adyacencia, W(l) denota la matriz de pesos aprendible de la capa de convolución del grafo l-ésimo, y σ denota la función de activación de la Unidad Lineal Rectificada. El término ÂH(l) agregaba características de nodos superpíxeles adyacentes, mientras que D−1/2 y D−1/2 equilibraban la contribución de nodos con diferentes densidades de conexión. La matriz aprendible W(l) proyectaba características agregadas en un nuevo espacio semántico, permitiendo que la capa de grafos distinga la consistencia estructural de la cercanía espacial ordinaria. La activación no lineal preservó la diferencia en las respuestas entre regiones coplanares y no coplanares tras la agregación de características.

Las características de segmentación semántica se decodificaban tras el razonamiento de grafos. El decodificador se construyó utilizando tres etapas de upsampling bilineal de interpolación y operaciones de fusión de conexión por salto entre capas. Las características superficiales del codificador espacial se concatenaron con características semánticas de alto nivel mediante fusión canal a canal. La resolución de las características se restauró al tamaño original de la imagen, y el mapa final de predicción semántica de probabilidad se generó mediante una capa de convolución 1 × 1.

La red completa de análisis semántico se entrenó usando un optimizador de desintegración de pesos desacoplado (véase la Tabla de Materiales). La tasa de aprendizaje inicial se estableció en 0,0001, el coeficiente de decaimiento en peso en 0,01 y el tamaño del lote en 8 para ambos benchmarks públicos. La tasa de decaimiento del primer momento se estableció en 0,9, la tasa de decaimiento del segundo momento en 0,999 y el coeficiente numérico de estabilidad épsilon en 1 × 10⁻8. La pérdida de validación se monitorizaba al final de cada época, y los puntos de control se guardaban cuando aumentaba el mIoU en el conjunto de validación. La red fue entrenada durante 300 épocas utilizando una estrategia de decaimiento de la tasa de aprendizaje polinómica con una potencia de decaimiento de 0,9. Se realizaron cinco entrenamientos independientes utilizando diferentes inicializaciones de semillas aleatorias para establecer una línea base de evaluación estadísticamente rigurosa. La red se optimizó conjuntamente mediante pérdida de entropía cruzada a nivel de píxel y pérdida de consistencia estructural. Todos los experimentos se realizaron en una plataforma informática equipada con hardware de computación paralela de alta memoria, y la información detallada del hardware se reportó en la Tabla de Materiales.

La optimización conjunta imponía la alineación geométrica de los límites calculando la magnitud del gradiente espacial del tensor de probabilidad de clase. La pérdida de consistencia estructural se utilizó como regularizador, multiplicando la norma de los gradientes de predicción espacial por los valores continuos de SDF. La lógica matemática era que los cambios semánticos de categorías debían concentrarse cerca de los contornos arquitectónicos reales, donde la SDF se aproximaba a cero, mientras que los interiores planos de paredes, suelos y techos debían mantener respuestas semánticas suaves. Cuando un gran gradiente de predicción aparecía lejos de un límite estructural, el término del campo de distancia aumentaba la penalización y desalentaba las transiciones semánticas falsas dentro de un plano físico homogéneo. Cuando aparecía un gradiente de predicción cerca de un contorno de distancia cero, la penalización seguía siendo limitada y preservaba transiciones legítimas de clase a lo largo de los límites arquitectónicos. Las regiones de transición semántica se restringieron a alinearse con los contornos de distancia cero de la SDF, según la Ecuación 3.

Ecuación 3: figure-protocol-5

donde Ltotal denota la función objetivo de optimización final, Lce denota la pérdida cruzada de entropía a nivel de píxel, Lscl denota la pérdida de penalización por consistencia estructural y α denota el coeficiente de ponderación de pérdida estructural. El término de entropía cruzada proporcionaba supervisión semántica a nivel de píxel mediante máscaras de anotación, mientras que el término de consistencia estructural imponía regularización geométrica usando priors arquitectónicos. El coeficiente de ponderación α reconocimiento equilibrado de categorías y alineación de fronteras, evitando que la optimización sobreajuste tanto la precisión local de la etiqueta como los contornos estructurales rígidos. Este objetivo conjunto vinculaba semántica visual, consistencia física de los límites y parámetros de red entreenables dentro de un objetivo de optimización unificado.

Resultados

Montaje experimental

Este estudio utilizó dos conjuntos de datos estándar de análisis de escenas interiores, un conjunto de datos 3D para interiores a gran escala y un conjunto de datos RGB-D para escenas interiores, para evaluar el rendimiento y ajustar el modelo. El conjunto de datos 3D para interiores a gran escala contiene escenas complejas de espacio físico escaneadas de forma realista y vistas RGB de alta resolución, proporcionando etiquetas semánticas 3D de nube de puntos píxel a píxel de alta precisión y máscaras de segmentación de proyección espacial 2D. Sus datos de reconstrucción de rejillas en espacio físico inherentemente realistas y sus propiedades ortogonales de planos establecen un criterio de comparación geométrico-verdad para construir con precisión la caja delimitadora 3D de Manhattan en la rama de extracción. El conjunto de datos de escenas interiores RGB-D contiene imágenes de profundidad interiores ocultas por muebles y desorden, y se utiliza para probar la precisión y robustez global del razonamiento lógico de la red frente a oclusiones.

El algoritmo utiliza mIoU para medir la superposición espacial entre las distribuciones semánticas predichas y verdaderas, al tiempo que introduce una puntuación F1 de frontera estructural para evaluar rigurosamente la precisión del ajuste entre la máscara predicha y los bordes de estructura física calibrados por la SDF a distancia cero. Durante el cálculo se establece un umbral fijo de error de distancia de píxeles en el espacio euclidiano para determinar si los píxeles de borde producidos por la red intersectan los verdaderos contornos físicos de los límites de los edificios. Este sistema de evaluación dual limita los errores de clasificación en bloques semánticos de gran área mientras fortalece la evaluación microcuantitativa del efecto de reconstrucción topológica de las líneas rígidas. Para mantener la consistencia entre la configuración experimental de datos y el proceso de optimización, la escala del conjunto de datos y los hiperparámetros de entrenamiento central se resumieron en la Tabla 2. La Tabla 2 informa de una configuración experimental autorizada para el manuscrito revisado. El benchmark 3D a gran escala en interiores utiliza 1201 escenas de entrenamiento y 312 escenas de validación, el benchmark RGB-D de escenas interiores utiliza 795 imágenes de entrenamiento y 654 imágenes de prueba, y ambos benchmarks se entrenan con un tamaño de lote de 8, una tasa de aprendizaje inicial de 0,0001, un coeficiente de decaimiento de peso de 0,01 y 300 épocas de entrenamiento.

Comparación con métodos de última generación

Antes de presentar una tabla comparativa cuantitativa de algoritmos de análisis sintáctico de escenas interiores, esta sección define rigurosamente los puntos de referencia de prueba utilizados en el sistema de evaluación multidimensional. Para reflejar el rendimiento de clasificación del modelo en diferentes granularidades, el sistema de evaluación complementa el sistema de prueba con dos métricas adicionales: precisión global de píxeles (PixelAcc) y precisión de clase media (MeanAcc). Estas métricas conjuntas construyen un sistema detallado de verificación del rendimiento de algoritmos, estableciendo una referencia teórica rigurosa para el análisis cuantitativo posterior. Para evaluar la precisión del análisis semántico y la robustez a la oclusión del algoritmo propuesto en espacios físicos complejos, se realizaron pruebas comparativas con algoritmos existentes en el conjunto de validación de escenas interiores RGB-D. La biblioteca de modelos de comparación cubre marcos fundamentales de atención a máscaras, Transformers de visión jerárquica, pipelines modernos de segmentación convolucional pura, arquitecturas unificadas de predicción densa y redes de atención multicanal. La evaluación de la prueba se amplió para incluir una línea base de segmentación basada en transformadores, una base unificada de predicción densa, una base unificada de detección y segmentación, una base base de visión a gran escala, una línea base puramente convolucional, una base de segmentación basada en la atención en máscara, una base de agregación de características intermodal y una línea base progresiva de fusión de características (véase la Tabla de Materiales), utilizando el mismo conjunto de validación de escenas interiores RGB-D, resolución de entrada, horario de entrenamiento y protocolo métrico. En la arquitectura propuesta, la red guiada por estructura integra una columna vertebral visual multiescala con ventanas desplazadas, un módulo de atención cruzada guiado por estructura con un SDF y un GCN superpíxel. La comparación ampliada abarca la predicción densa basada en transformadores, la predicción densa basada en convolución, el análisis de atención a máscaras, la fusión de características entre modales y los paradigmas progresivos de fusión de características, permitiendo evaluar la contribución de la intervención explícita en límites geométricos 3D frente a líneas base más amplias de análisis de escenas interiores.

La Tabla 3 detalla el desempeño objetivo de evaluación de cada red en las métricas cuantitativas principales, informando de los valores medios y las desviaciones estándar correspondientes a lo largo de cinco ejecuciones independientes. La comparación ampliada de la línea base evalúa si el mecanismo de razonamiento guiado por estructura propuesto contribuye a ganancias de precisión más allá de los backbones estándar de predicción densa, las redes de segmentación basadas en máscaras y las redes de fusión de características RGB-D. Los datos experimentales muestran que el algoritmo propuesto logra ganancias estables en las cuatro métricas cuantitativas. Las redes de predicción densa basadas en transformadores y las redes de atención a la máscara conservaron una fuerte capacidad de modelado global del contexto, pero sus valores F1 de frontera seguían siendo menores en presencia de desorden en primer plano porque las máscaras predichas carecían de restricciones físicas explícitas en los límites. Las redes de fusión cruzadas y progresivas mejoraron la continuidad semántica local, pero su fusión de características seguía dependiendo principalmente de la apariencia y la profundidad de respuestas más que de un prior estructural de distancia con signos. La red guiada por estructura propuesta alcanzó un mIoU de 0,687 con una desviación estándar de 0,002 y una puntuación media F1 en el Límite de 0,764 con una desviación estándar de 0,003. La comparación ampliada indica que la ganancia de rendimiento no se debió únicamente a una columna vertebral de predicción densa y mayor, sino más bien al uso conjunto de la guía de campo a distancia con signos, la atención cruzada consciente de la estructura y el razonamiento topológico basado en grafos.

Para analizar la precisión global del razonamiento lógico del modelo bajo oclusiones, identificamos y extrajimos escenarios típicos en el conjunto de validación que estaban gravemente obstruidos por muebles y otros desordens, y producimos visualizaciones de máscaras de predicción a nivel de píxel.

Después se definieron el flujo de trabajo del método y el proceso de razonamiento por grafos en la Figura 1, Figura 2, Figura 3 y Figura 4. La Figura 5 ilustra las diferencias en las predicciones morfológicas entre modelos bajo condiciones extremas de oclusión. Los rectángulos rojos en el mapa de malla de comparación cualitativa marcan áreas clave de conflicto donde las esquinas y las superficies portantes están ocluidas. La máscara de salida de la línea base de segmentación basada en atención en la máscara muestra un suavizado pronunciado de bordes y adhesión entre clases. Aunque la línea base de agregación de características cruzadas y la línea base de fusión progresiva incorporan datos cruzados, sus resultados de predicción siguen mostrando discontinuidades estructurales de clase y distorsiones físicas de los límites. La máscara generada por este método propuesto presenta una alta superposición espacial con las etiquetas de la verdad fundamental. Los modelos base, limitados por principios puramente impulsados por píxeles, tienden a perder sus campos receptivos locales cuando están ocluidos. El método propuesto utiliza un GCN superpíxel para realizar el paso de mensajes en el espacio no euclidiano, reconstruyendo así las esquinas subyacentes y esqueletos espaciales lineales guiados por límites geométricos implícitos. Esto verifica el rendimiento anti-interferencia de nuestra solución propuesta para resolver complejos diseños interiores desde una perspectiva morfológica visual.

Experimento de ablación

Para analizar la contribución real de cada componente independiente en la arquitectura propuesta, este estudio construyó una prueba de ablación modular ampliada sobre el conjunto de validación de escenas interiores RGB-D. La línea base de la prueba se estableció en una red de clasificación convencional con solo la columna vertebral visual del transformador de ventana desplazada base. La evaluación cuantitativa midió la contribución independiente de la atención cruzada guiada por la estructura, el sesgo de campo por distancia con signo, la ponderación estructural adaptativa, el razonamiento de grafos superpíxeles, la construcción de aristas coplanares, la normalización simétrica de grafos y la pérdida de consistencia estructural. Este diseño de ablación ampliada separaba las ganancias acumuladas de los módulos de los efectos de eliminación de componentes, haciendo más claro el límite de contribución de cada elección de diseño.

La Tabla 4 y la Figura 6 ilustran la evolución de la precisión bajo configuraciones ampliadas de ablación acumulativa y basada en la eliminación. La red base de transformadores de ventana desplazada carece de restricciones físicas tridimensionales en los límites, lo que resulta en una agregación limitada de características en fondos saturados. Añadir atención cruzada guiada por estructuras aumentó el mIoU de 0,615 a 0,648 y la puntuación F1 de Boundary de 0,630 a 0,685, mostrando que el campo de distancia señalada previamente mejoró la alineación entre las características visuales y los contornos estructurales. Añadiendo solo razonamiento de grafos superpíxeles aumentó el mIoU a 0,641 y la puntuación F1 de frontera a 0,676, lo que indica que el razonamiento topológico nodo por nodo mejoró la consistencia semántica sobre regiones físicas homogéneas. Sumando solo la pérdida de consistencia estructural aumentó el mIoU a 0,632 y la puntuación F1 de la frontera a 0,662, mostrando que el término de pérdida afectaba principalmente al ajuste de límites más que a la agregación contextual amplia.

Combinar la atención cruzada con el razonamiento de grafos aumentó el mIoU a 0,669 y la puntuación F1 de Boundary a 0,721, mostrando que la alineación visual-estructural y el paso de mensajes en el dominio del grafo producían efectos complementarios. Combinando la atención cruzada con la pérdida de consistencia estructural, se logró un mIoU de 0,660 y una puntuación F1 en Boundary de 0,713, mientras que combinar razonamiento en gráficos con pérdida de consistencia estructural obtuvo un mIoU de 0,653 y una puntuación F1 en Boundary de 0,704. Estos resultados por pares indican que el módulo de atención cruzada proporcionó la señal principal de alineación geométrica, el módulo de razonamiento de grafos expandió esta señal a través de regiones coplanares, y la pérdida de consistencia estructural refinó el límite de transición semántica durante la optimización.

La ablación basada en la eliminación aclaró aún más la contribución de las elecciones internas de diseño. Eliminar el sesgo aditivo de campo por distancia con signo redujo el mIoU a 0,656 y la puntuación F1 de frontera a 0,698, confirmando que la matriz de afinidad estructural era central para suprimir la difusión transfronteriza de características. Eliminar el coeficiente de ponderación estructural adaptativo λ redujo el mIoU a 0,671 y la puntuación F1 de la frontera a 0,736, indicando que una restricción estructural fija debilitaba la respuesta del modelo en regiones no Manhattan y visualmente degradadas. Eliminar la restricción de aristas coplanar redujo el mIoU a 0,666 y la puntuación F1 de frontera a 0,728, mostrando que las aristas del grafo basadas únicamente en la adyacencia local no preservaron la consistencia del plano físico. Eliminar la normalización simétrica de grafos redujo el mIoU a 0,673 y la puntuación F1 de frontera a 0,737, lo que indica que la propagación balanceada en grados era necesaria para la agregación estable de nodos. La red guiada por estructura propuesta completa logró un mIoU de 0,687 y una puntuación F1 en el Límite de 0,764, demostrando que la ganancia final resultó de la interacción coordinada entre la atención estructural, el razonamiento de grafos y la optimización consciente de los límites.

Análisis de la complejidad computacional, el tiempo de entrenamiento y la eficiencia de la inferencia

Para evaluar el coste computacional de la extracción SDF, la atención cruzada guiada por la estructura y el razonamiento convolucional de grafos superpíxeles, este estudio evaluó la escala de parámetros, las operaciones en punto flotante, el uso máximo de memoria, el tiempo de entrenamiento, la latencia de inferencia de un solo fotograma, la tasa de fotogramas y el mIoU en la misma plataforma informática. Las operaciones en coma flotante se calculaban bajo una resolución de entrada 512 × 512. La latencia de inferencia se midió con un tamaño de lote de 1 después del calentamiento del modelo, mientras que la tasa de fotogramas reportada se calculó a partir de la latencia media de una sola imagen. El tiempo de entrenamiento se midió bajo el mismo calendario de 300 épocas, tamaño de lote de 8, ajustes del optimizador y pipeline de preprocesamiento de datos.

La Tabla 5 detalla la relación entre la escala del modelo, el coste de entrenamiento, la eficiencia de inferencia y la precisión del análisis para cada arquitectura de red. Las columnas mIoU y F1 de frontera en la Tabla 5 utilizan los mismos valores globales del conjunto de validación que la Tabla 3 para cada modelo correspondiente. Estas dos columnas de precisión se repiten en la Tabla 5 únicamente para comparar la precisión del análisis sintáctico con el coste computacional. El aumento de parámetros entreenables se debió principalmente a las capas de proyección de consulta-clave-valor en el módulo de atención cruzada guiado por estructura y a las matrices de pesos de las tres capas convolucionales del grafo. El coste no entrenó se incurrió principalmente en la generación de SDF, la partición de superpíxeles y la construcción de adyacencia de grafos. Dado que estas operaciones no entreenables se ejecutaban una vez por cada imagen de entrada, aumentaban la latencia de inferencia pero no incrementaban sustancialmente el número de parámetros entreables. Esta separación explica por qué el método propuesto mostró un aumento moderado de parámetros pero un aumento más pronunciado de la latencia. Los resultados de complejidad muestran que la línea base de segmentación basada en la atención de la máscara mantuvo un menor conteo de parámetros y una latencia de inferencia menor, pero su puntuación F1 en el Límite y mIoU estaban limitados bajo oclusión severa debido a la falta de una guía geométrica explícita de los límites en la red. La línea base de agregación de características entre modales requería más operaciones en coma flotante y un tiempo de entrenamiento más largo porque la agregación entre modales introducía una sobrecarga adicional de alineación de características. La línea base de fusión progresiva de características mantuvo un coste computacional moderado, pero su precisión de predicción seguía siendo inferior a la del método propuesto bajo distorsión de frontera. La red guiada por estructura propuesta implica costes computacionales adicionales debido a la construcción de SDF, proyección estructural de atención cruzada, construcción de grafos superpíxeles y propagación de convolución de grafos. El modelo completo utilizó 66,8 millones de parámetros, 121,4 mil millones de operaciones en coma flotante, 15,6 horas de entrenamiento, 7,9 GB de memoria de pico, 61 ms de tiempo de inferencia de un solo fotograma y 16,4 fotogramas por segundo. Aunque la latencia de inferencia fue mayor que la de la línea base pura de atención a la máscara, el modelo logró un mIoU de 0,687 y una puntuación F1 en el Límite de 0,764, lo que indica que el coste adicional apoyó principalmente la reparación de límites estructurales y la consistencia semántica consciente de la topología.

Para representar visualmente el equilibrio espacial bidimensional entre la escala computacional y la precisión analítica del modelo, se creó un diagrama de distribución de burbujas que muestra el número de operaciones en coma flotante y el mIoU del algoritmo. La visualización revisada también informó del tiempo de entrenamiento y la latencia de inferencia en el área de anotación de figuras, permitiendo comparar las ganancias de precisión y los costes computacionales tanto desde la perspectiva del entrenamiento como del despliegue. El eje horizontal conservaba las operaciones de punto flotante, el eje vertical retenía el mIoU, el tamaño de la burbuja representaba la cantidad de parámetro entrenable y la etiqueta adjunta reportaba el tiempo de inferencia para cada método.

La Figura 7 revela la relación entre las operaciones en coma flotante, la escala de parámetros, la latencia de inferencia y la precisión del análisis sintáctico. El método propuesto alcanza un mIoU mayor que las redes de comparación, mientras que sus FLOPs y el conteo de parámetros permanecen cercanos a los de las líneas base de fusión cruzada y progresiva. La latencia de un solo fotograma de 61 ms indica que las ramas añadidas de SDF y razonamiento de grafos introdujeron sobrecarga de despliegue, pero la latencia permaneció dentro del rango de tiempo real requerido para muchas tareas de interpretación de escenas en interiores. El tiempo de entrenamiento aumentó a 15,6 horas porque se ejecutaron extracciones estructural previas, proyección de atención y razonamiento gráfico durante cada época de entrenamiento. Este resultado muestra que el coste computacional del método propuesto se concentra principalmente en el razonamiento estructural consciente de fronteras más que en la expansión incontrolada de los parámetros.

Comparación específica entre pérdida de consistencia estructural y pérdida por distancia espacial

La pérdida inversa de la red de transformación para cuantificar la distancia de transformación espacial de los límites utiliza parámetros de transformación homomórficas para capturar desplazamientos de frontera, demostrando que las métricas puras de distancia espacial superan las pérdidas tradicionales de entropía cruzada basadas en cambios en las etiquetas de píxeles. Basándose en este consenso teórico, se realizan experimentos de validación paralela utilizando esquemas de restricciones de frontera para evaluar el rendimiento comparativo de la Pérdida de Consistencia Estructural (SCL) personalizada basada en cajas delimitadoras de Manhattan respecto a la adaptabilidad de la escena. Los experimentos mantienen la arquitectura analítica de fusionar una columna vertebral visual multiescala con una red de inferencia de grafos, mientras simplemente reemplazan el término de pérdida de frontera durante la retropropagación. Se configuran cuatro redes de validación paralelas: una red que utiliza solo la clasificación básica de pérdida cruzada carece de restricciones geométricas de alta dimensión; una red con pérdida adicional de entropía cruzada binaria estándar de frontera (BCE) realiza la supervisión convencional de clasificación binaria de bordes; una red con pérdida adicional de distancia en frontera espacial se centra en capturar deformaciones locales; y una red que aplica la SCL propuesta impone penalizaciones topológicas ortogonales basadas en la SDF. Las métricas de cuantización en el conjunto de validación de escenas interiores RGB-D están limitadas al mIoU y a la puntuación F1 del límite estructural.

La Tabla 6 detalla el grado de intervención de diferentes estrategias de optimización por retropropagación sobre la cognición lógica espacial subyacente. La entrada solo de entropía cruzada en la Tabla 6 denota la arquitectura propuesta nuestra entrenada únicamente con pérdida de entropía cruzada a nivel de píxel, manteniendo sin cambios la columna vertebral visual, la rama de campo de distancia con signos, el módulo de atención cruzada guiado por la estructura y la rama de razonamiento de grafos superpíxeles. Esta entrada no es una referencia de Mask2Former y no debe compararse con el valor global de Mask2Former en la Tabla 3, ya que utiliza el mismo modelo. Las redes que dependen únicamente de la pérdida básica de entropía cruzada alcanzan la puntuación de ajuste de frontera más baja. Las redes con una pérdida binaria binaria estándar adicional de entropía cruzada en el límite logran una ligera ganancia, pero este mecanismo sigue causando desenfoque de bordes bajo oclusión a gran escala. La pérdida de distancia en el límite espacial mejora la puntuación mediante un mecanismo de percepción por transformación espacial, corrigiendo eficazmente algunos bordes distorsionados. La pérdida de consistencia estructural propuesta en este artículo aprovecha directamente la SDF real para imponer penalizaciones de gradiente sobre mutaciones semánticas anómalas dentro de la superficie física portante, logrando la puntuación F1 más alta en el límite estructural.

Para comparar visualmente los efectos impulsores de diferentes configuraciones de funciones de pérdida en la precisión de la predicción de máscaras y el ajuste de los límites, trazamos gráficos de barras agrupados entre distintas estrategias de optimización.

La Figura 8 ilustra la mejora de rendimiento escalonada que resulta de la mejora de la dimensión de percepción espacial de la función de pérdida. El gráfico de barras que representa la puntuación F1 del límite estructural muestra una tendencia ascendente significativa. Los datos experimentales muestran que este mecanismo de penalización personalizado obliga a que la ubicación del salto espacial de la categoría predicha coincida exactamente con el contorno físico ortogonal. El mecanismo de penalización de campo de distancia, personalizado para priors ortogonales en interiores, logra una mayor precisión que la pérdida general por captura de límites espaciales, estableciendo así un camino de optimización eficaz para abordar fallos complejos de edificios.

Pruebas de robustez de distribución extrema de oclusión, estructuras anómalas y condiciones de iluminación desafiantes

Las complejas relaciones espaciales entre objetos y la oclusión mutua afectan negativamente a la cognición espacial global en 3D. La arquitectura de predicción conjunta destaca el papel de apoyo de las restricciones de disposición de escenas en la extracción de la máscara subyacente. Examinar los límites anti-interferencia del algoritmo bajo pérdida de señal visual de gran área y disposiciones espaciales anómalas que violan la suposición física ortogonal 3D define claramente el límite efectivo de aplicación del algoritmo y tiene un valor central y demostrable. Según la proporción de mobiliario de gran tamaño enmascarado con las etiquetas de la verdad en el terreno, el conjunto de pruebas de escenas interiores RGB-D se subdivide en tres subconjuntos progresivamente más difíciles: oclusión leve, moderada y severa. Simultáneamente, las escenas no típicas de Manhattan con techos inclinados o paredes curvas se extraen manualmente para construir conjuntos de pruebas de contorno anomalo, y las escenas con condiciones de luz extremadamente baja, sobreexposición y superficies de vidrio brillantes o transparentes de gran superficie se clasifican en subconjuntos de iluminación y textura desafiantes. La biblioteca de modelos de comparación incluye una línea base de segmentación basada en la atención en la máscara; una arquitectura general de segmentación basada en la atención de la máscara para capturar el contexto global; una línea base de agregación de características intermodales que emplea una estrategia integral de agregación intermodal; y una línea base de fusión progresiva de características que integra un mecanismo de extracción progresiva de características de varias etapas. Cada línea base de comparación, la columna vertebral visual de fusión y la arquitectura de análisis de la red de inferencia de grafos construida en este artículo se evalúan de forma independiente sobre los subconjuntos anteriores, y el gradiente de decaimiento de precisión de cada modelo se analiza estadísticamente.

La Tabla 7 informa métricas de robustez específicas de subconjunto bajo oclusión leve, moderada y severa, iluminación desafiante, interferencia de texturas y condiciones de anomalías no Manhattan. La Tabla 7 detalla los cambios en la precisión de la predicción de máscaras de diferentes modelos bajo interferencia espacial. La Tabla 7 informa de valores de mIoU específicos de subconjunto para diferentes modelos bajo condiciones de interferencia espacial, calculados solo dentro de la oclusión, iluminación, textura o subconjunto no Manhattan correspondiente, en lugar de en el conjunto general de validación de escenas interiores RGB-D. En los subconjuntos de oclusión leve y moderada, todos los modelos mantienen una precisión base. Con el aumento del área de oclusión, los modelos base que se basan en reglas impulsadas por píxeles muestran una disminución en la proporción intersección-unión (UI) en el subconjunto fuertemente ocluido. La línea base de segmentación basada en la atención en la máscara y la línea base de agregación de características entre modales sufren pérdidas significativas de precisión en este subconjunto. La arquitectura de extracción progresiva de características de múltiples etapas de la línea base de fusión progresiva muestra un descenso severo en el rendimiento. La solución propuesta se basa en características explícitas del esqueleto 3D para forzar la alineación de señales visuales dañadas, manteniendo una forma estable de salida de máscara en el subconjunto fuertemente ocluido y demostrando la estabilidad topológica de la salida de la máscara semántica. En los subconjuntos de iluminación y textura desafiantes, el detector de segmentos de línea no presenta bordes estructurales en regiones con fuertes reflexiones y vidrio transparente, lo que provoca discontinuidades localizadas en el SDF. Las coordenadas geométricas erróneas se propagan a través de la matriz de afinidad estructural y la pérdida de consistencia estructural, aplicando así penalizaciones anómalas de gradiente a las características semánticas y causando desviaciones correspondientes en las predicciones de frontera. El mecanismo global de razonamiento del contexto espacial del GCN complementa los priores geométricos ausentes con afinidades estructurales adyacentes, manteniendo la precisión global del análisis dentro de un rango aceptable de decaimiento y revelando el límite de las capacidades de percepción visual del algoritmo bajo interferencias físicas complejas. En el subconjunto de anomalías no de Manhattan, el prior SDF en la capa inferior de este modelo introduce un ligero sesgo de mapeo, resultando en un rendimiento ligeramente inferior al de la línea base de fusión progresiva de características. El coeficiente de ponderación estructural adaptativa en el módulo de atención cruzada evalúa dinámicamente la consistencia de los gradientes de la estructura física subyacente. En escenas con paredes curvas o techos inclinados, este coeficiente reduce automáticamente el peso de restricción del SDF, animando a la red a confiar en el mecanismo local de agregación de nodos de características de la red de grafos de superpíxeles para mantener la coherencia semántica en regiones homogéneas, estableciendo así un mecanismo efectivo de compensación geométrica para disposiciones espaciales no Manhattan.

Para demostrar visualmente el impacto negativo de la severidad de la oclusión en la precisión de la resolución, trazamos gráficos lineales que muestran la disminución de la precisión entre diferentes modelos de algoritmos.

La Figura 9 revela visualmente las diferencias en la robustez entre los distintos paradigmas de extracción de características bajo entornos físicos extremos. Las tres líneas discontinuas que representan los modelos base presentan una tendencia descendente significativa en nodos fuertemente ocluidos, reflejando las limitaciones de los campos receptivos convencionales en la extracción de características bajo pérdida de señal a gran escala. La línea sólida que representa el método propuesto mantiene una trayectoria de decaimiento relativamente suave. Los datos experimentales muestran que el acoplamiento entre los priors arquitectónicos 3D explícitos y los mecanismos de inferencia basados en grafos proporciona soporte estructural para tareas de análisis de escenas resistentes a la oclusión y mejora el rendimiento de la generalización de modelos en entornos complejos.

Análisis de sensibilidad espacial de la partición de nodos de grafos topológicos

El parámetro de tasa de muestreo de reducción de dimensionalidad del módulo de convolución de grafos en espacio de coordenadas controla directamente la calidad del campo receptivo y la carga computacional de la red de grafos. En línea con el marco teórico de este artículo, este estudio investiga cómo el número de nodos de grafo discretos producidos por agrupamiento iterativo lineal simple afecta al rendimiento de la inferencia topológica no euclidiana, con el objetivo de proporcionar un soporte riguroso para la selección de hiperparámetros. Se realizaron experimentos para ajustar los parámetros de control de inicialización del algoritmo de agrupamiento, interviniendo forzosamente en la reducción dinámica de dimensionalidad del espacio de características, estableciendo el número de particiones de nodos de grafos superpíxeles en 64, 128, 256, 512 y 1024. Bajo un benchmark de prueba estrictamente alineado, la proporción media intersección sobre unión (IoU), la puntuación F1 del límite estructural y el tiempo medio de inferencia por imagen de alta resolución se registraron simultáneamente en diferentes tamaños de nodos topológicos.

La Tabla 8 detalla la relación entre el grado de reducción de dimensionalidad dinámica en el espacio de características y tanto la precisión analítica como el coste computacional. Reducir demasiado el número de nodos conduce a una subsegmentación de las características de la imagen, haciendo que los atributos semánticos de los objetos pequeños se fusionen con los elementos de pared a gran escala, disminuyendo así varias métricas de precisión. A medida que aumenta la escala de partición de nodos, la sensibilidad del modelo a los detalles espaciales locales mejora significativamente. Aumentar el número de nodos a 512 y 1024 provoca la fragmentación de regiones homogéneas, debilita el efecto de suavizado sobre las características macroscópicas en redes neuronales de grafos, incrementa la dimensionalidad de la matriz de relaciones de nodos y aumenta el tiempo de inferencia. Una configuración de parámetros con un número fijo de nodos de 256 conduce a los valores más altos para la proporción intersección-unión y la puntuación de límite.

Para representar visualmente el equilibrio entre precisión y potencia computacional en la inferencia topológica no euclidiana, se graficó un gráfico estadístico biaxial mostrando la sensibilidad al tamaño del nodo.

La Figura 10 ilustra la lógica subyacente mediante la cual el número de nodos discretos de grafo afecta la evolución de las características de la red. La barra de fondo que representa el tiempo de cálculo muestra un aumento pronunciado después de que el número de nodos supere el umbral de 256. La doble línea que representa la precisión alcanza su pico en 256 en el eje horizontal, y luego disminuye razonablemente debido a los efectos de fragmentación. Los datos cuantitativos objetivos y la tendencia de evolución visual son muy consistentes, demostrando que mantener el tamaño del grafo de cómputo en 256 nodos logra un equilibrio entre el procesamiento por hardware y el razonamiento lógico bajo la configuración actual de parámetros fijos. La severa degradación del rendimiento causada por desviarse de este recuento de nodos revela la alta sensibilidad de la estrategia fija de segmentación superpíxel a la afinación de hiperparámetros y subraya la necesidad de desarrollar un mecanismo dinámico de selección de nodos.

DISPONIBILIDAD DE DATOS:

Los datos de referencia en bruto analizados en este estudio están disponibles públicamente en los repositorios oficiales listados en la Tabla de Materiales. El benchmark 3D a gran escala para interiores fue accedido como la versión oficial de ScanNet v2, con el identificador de lanzamiento de conjunto de datos ScanNet v2. El benchmark de escenas interiores RGB-D fue accedido a través de la versión oficial NYU Depth Dataset V2, con el identificador de lanzamiento NYU Depth Dataset V2. El DOI descriptivo de publicación para el benchmark 3D de interiores a gran escala es 10.1109/CVPR.2017.261, y el DOI descriptivo para el benchmark de escenas interiores RGB-D es 10.1007/978-3-642-33715-4_54. No se generaron nuevas imágenes en bruto ni conjuntos de datos RGB-D en este estudio. Los archivos procesados de split, archivos de configuración de entrenamiento, registros de evaluación en bruto, archivos fuente numéricos que soportan la Tabla 2, Tabla 3, Tabla 4, Tabla 5, Tabla 6, Tabla 7 y Tabla 8, y Figura 5, Figura 6, Figura 7, Figura 8, Figura 9 y Figura 10, los pesos entrenados de los modelos y el código fuente han sido depositados en figshare bajo el DOI: 10.6084/m9.figshare.32906765. El registro de figshare proporciona los datos completos de resultados en bruto necesarios para reproducir las tablas cuantitativas y cifras reportadas en este manuscrito. El repositorio contiene las máscaras de predicción, archivos de evaluación de límites, scripts de cálculo de métricas, puntos de control de modelos y archivos fuente de tablas utilizados para el mIoU reportado, Boundary F1, PixelAcc, MeanAcc, análisis de complejidad computacional, robustez, validación de la función de pérdida y sensibilidad de particiones de nodos.

figure-results-1
Figura 1: Comparación de la discontinuidad semántica y los efectos de reparación previa estructural en escenarios complejos de oclusión interior. (A) Imagen RGB original con oclusión de muebles a gran escala. (B) Salida del modelo base tradicional que destaca la distorsión física de los límites y los defectos de discontinuidad semántica. (C) Salida del método propuesto con una superposición de perspectiva de línea discontinua cian que mapea explícitamente el esqueleto 3D del edificio para la reparación topológica de características dañadas de la estructura subyacente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-2
Figura 2: Marco general de análisis semántico guiado por los priors estructurales de construcción. El diagrama describe toda la cadena de operaciones comenzando desde la entrada de imagen RGB, pasando por la rama de extracción de características visuales con ventana desplazada y la rama de extracción previa de estructuras, hasta el módulo de atención cruzada guiado por estructuras, seguido por el razonamiento topológico mediante el GCN del superpíxel, y finalmente la decodificación en el mapa semántico denso. A la derecha se presentan los diseños detallados del cálculo de la matriz de afinidad de atención, el paso de mensajes en grafos y las funciones de pérdida de optimización conjunta. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3: Diagrama de flujo de la construcción de la matriz de afinidad y la conectividad topológica. El gráfico detalla la cadena de mapeo matemático paso a paso, mostrando la transformación desde el mapa de distancia de entrada y los pares de píxeles seleccionados, a través de la extracción continua de características geométricas potenciales y la evaluación de la consistencia del gradiente, hasta la matriz de afinidad normalizada utilizada como sesgo espacial explícito para el mecanismo de atención cruzada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 4: Diagrama esquemático de la proyección de nodos de convolución del grafo superpíxeles y agregación de características. El panel detalla el proceso de razonamiento topológico no euclidiano: (A) características densas de píxeles que muestran la matriz local original de características y los límites de agrupamiento de superpíxeles; (B) construcción de topología de grafos superpíxeles que mapea la cuadrícula regular a nodos discretos y aristas físicamente conectadas; (C) paso convolucional de mensajes de grafo realizando agregación direccional de características locales; y (D) retroproyección de coordenadas que presenta las características semánticas macroscópicas restauradas de consistencia semántica en la cuadrícula densa. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 5: Diagrama de cuadrícula comparativa cualitativa. La matriz proporciona una evaluación visual del rendimiento a través de diferentes escenas interiores fila a fila, comparando las entradas RGB originales interiores y los diseños de la verdad del terreno con las salidas de la línea base de segmentación basada en la atención en la máscara, la base de agregación de características cross-modal, la base de fusión progresiva de características y el método propuesto, que restaura con éxito esquinas ocluidas y alinea superficies portantes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-6
Figura 6: Resultados de ablación para la integración acumulativa de módulos. El gráfico de doble eje muestra la evolución del rendimiento paso a paso a través de diferentes configuraciones de ablación modular, representando la trayectoria ascendente constante de la intersección media sobre unión (mIoU) como barras y la puntuación F1 del límite estructural como un gráfico de líneas desde la columna vertebral base hasta el marco completo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-7
Figura 7: Complejidad computacional, tiempo de entrenamiento y distribución de la eficiencia de inferencia. El gráfico de burbujas multidimensional revela los compromisos entre la sobrecarga computacional y la precisión del análisis sintáctico. El eje horizontal mide las operaciones en coma flotante (FLOPs), el eje vertical indica mIoU, el tamaño de la burbuja representa la escala de parámetros entreenables y las etiquetas de texto adyacentes informan la latencia de inferencia de trama única para cada arquitectura de red. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-8
Figura 8: Histograma de precisión de frontera y puntuaciones métricas bajo diferentes configuraciones de funciones de pérdida. El gráfico de barras agrupado compara los efectos impulsores de diversas estrategias de optimización sobre la lógica espacial subyacente, ilustrando las ganancias significativas en mIoU y en la puntuación F1 del límite estructural logradas al actualizar de formulaciones estándar de entropía cruzada a la pérdida de consistencia estructural propuesta. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-9
Figura 9: Gráfico de líneas que muestra la relación entre la severidad de la oclusión y la decadencia del rendimiento. La curva sigue la degradación de la precisión a través de diferentes paradigmas de extracción de características bajo niveles de oclusión leve, moderada y severa, destacando la robusta estabilidad topológica y la capacidad anti-interferencia del marco guiado por estructuras propuesto en comparación con líneas base puramente impulsadas por píxeles. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-10
Figura 10: Análisis de sensibilidad de la escala de nodos superpíxeles. El gráfico estadístico biaxial ilustra el equilibrio entre la velocidad de procesamiento por hardware y la precisión del razonamiento lógico a lo largo de diferentes tamaños de partición de grafos, mostrando cómo el número de nodos superpíxeles afecta a las métricas de precisión y conduce a un aumento pronunciado en el tiempo medio de inferencia. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Numeración en la capa de redDimensión de características del nodo de entradaDimensión de característica del nodo de salidaAjuste de probabilidad de inactivación aleatoria
15122560.15
22562560.15
32561280.1
4128640.05

Tabla 1: Tabla de configuración de hiperparámetros de la arquitectura de red para el módulo de inferencia convolucional. La tabla informa de la numeración de la capa de red, las dimensiones de características de los nodos de entrada, las dimensiones de las características de los nodos de salida y las configuraciones de probabilidad de inactivación aleatoria utilizadas en la red de razonamiento de grafos.

Elemento de configuraciónBenchmark 3D a gran escala para interioresReferencia de escenas interiores RGB-D
Identificador oficial de la versiónScanNet v2Conjunto de Datos de Profundidad NYU V2
Muestras de entrenamiento utilizadas en este estudio1201 escenas795 imágenes
Muestras de validación o prueba utilizadas para la evaluación312 escenas de validación654 imágenes de prueba
Categorías semánticas totales2040
Resolución de imagen de entrada512 × 512512 × 512
Tasa inicial de aprendizaje0.00010.0001
Recuento de muestras de entrada por lotes88
Coeficiente de decaimiento de peso0.010.01
Épocas totales de entrenamiento300300
Número de carreras independientes55

Tabla 2: División experimental del conjunto de datos y configuración unificada de hiperparámetros de entrenamiento. La tabla informa de conjuntos de datos 3D a gran escala para interiores y de conjuntos de datos RGB-D de escenas interiores para la partición, el conteo de categorías semánticas, la tasa de aprendizaje, el número de muestras de entrada por lotes, la tasa de decaimiento de peso y el conteo total de iteraciones de entrenamiento.

Arquitectura del modelo de redmIoULímite F1PixelAccMeanAcc
SegFormer0,596 ± 0,0030,635 ± 0,0040,838 ± 0,0030,704 ± 0,004
ConvNeXt UperNet0,604 ± 0,0030,642 ± 0,0040,846 ± 0,0030,713 ± 0,004
Mask2Former0,612 ± 0,0030,654 ± 0,0040,853 ± 0,0030,721 ± 0,004
OneFormer0,621 ± 0,0020,663 ± 0,0030,861 ± 0,0030,733 ± 0,003
MaskDINO0,628 ± 0,0020,667 ± 0,0030,869 ± 0,0030,741 ± 0,003
CCANet0,635 ± 0,0030,671 ± 0,0040,876 ± 0,0030,745 ± 0,004
InternImage UperNet0,641 ± 0,0020,692 ± 0,0030,884 ± 0,0020,756 ± 0,003
CMPFFNet0,658 ± 0,0020,712 ± 0,0030,891 ± 0,0020,773 ± 0,003
SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Tabla 3: Comparación cuantitativa general de las líneas base de análisis de escenas interiores en el conjunto de validación de escenas interiores RGB-D. La tabla informa sobre mIoU, puntuación F1 de frontera, precisión global de píxeles y precisión de clase media para la línea base de segmentación basada en la atención en la máscara, la línea base de agregación de características intermodal, la línea base de fusión progresiva de características y la arquitectura de red propuesta guiada por estructura.

Configuración de la arquitectura de redmIoULímite F1PixelAccMeanAcc
Columna vertebral base de ventana desplazada0,615 ± 0,0030,630 ± 0,0040,842±0,0030,706 ± 0,004
Columna vertebral más atención cruzada guiada por la estructura0,648 ± 0,0030,685 ± 0,0040,874 ± 0,0030,748 ± 0,004
Razonamiento de la columna vertebral más el gráfico superpíxeles0,641 ± 0,0030,676 ± 0,0040,868 ± 0,0030,741 ± 0,004
Pérdida de consistencia entre columna vertebral y estructural0,632 ± 0,0030,662 ± 0,0040,859 ± 0,0030,732 ± 0,004
Columna vertebral más atención cruzada y razonamiento en gráficos0,669 ± 0,0020,721 ± 0,0030,897 ± 0,0020,782 ± 0,003
Columna vertebral más atención cruzada y pérdida de consistencia estructural0,660 ± 0,0020,713 ± 0,0030,889 ± 0,0020,773 ± 0,003
Razonamiento de columna vertebral más gráfico y pérdida de consistencia estructural0,653 ± 0,0030,704 ± 0,0030,881 ± 0,0030,765 ± 0,003
Modelo completo sin sesgo aditivo de campo de distancia con signos0,656 ± 0,0030,698 ± 0,0040,884 ± 0,0030,761 ± 0,004
Modelo completo sin ponderación estructural adaptativa λ0,671 ± 0,0020,736 ± 0,0030,904 ± 0,0020,792 ± 0,003
Modelo completo sin restricción de aristas coplanar0,666 ± 0,0020,728 ± 0,0030,899 ± 0,0020,786 ± 0,003
Modelo completo sin normalización simétrica de grafos0,673 ± 0,0020,737 ± 0,0030,906 ± 0,0020,795 ± 0,003
A SGCA_GCN0,687 ± 0,0020,764 ± 0,0030,924 ± 0,0020,816 ± 0,003

Tabla 4: Análisis ampliado de ablación cuantitativa de los componentes principales. La tabla informa sobre la integración acumulativa de módulos, combinaciones de módulos por pares y ajustes de eliminación de componentes para cuantificar las contribuciones independientes y cooperativas de la atención cruzada guiada por estructuras, el sesgo de campo por distancia con signo, el ponderado estructural adaptativo, el razonamiento de grafos superpíxeles, la construcción de aristas coplanares, la normalización simétrica de grafos y la pérdida de consistencia estructural.

Arquitectura del modelo de redParámetrosFLOPsMemoria máximaTiempo de entrenamientoTiempo de inferenciaFPSmIoULímite F1
SegFormer83,7 M80.1 G6,1 GB10.6 h44 ms22.70.5960.635
ConvNeXt UperNet60,2 M91,5 G6,4 GB11.2 h47 ms21.30.6040.642
Mask2Former44,0 M74,6 G5,8 GB9,4 h41 ms24.40.6120.654
OneFormer64,1 M103,2 G7,0 GB12.9 h55 ms18.20.6210.663
MaskDINO52,8 M96,8 G6,8 GB12.1 h52 ms19.20.6280.667
CCANet63,5 M118,7 G7,6 GB14,8 h67 ms14.90.6350.671
InternImage UperNet70,4 M112,3 G7,4 GB14,2 h64 ms15.60.6410.692
CMPFFNet58,9 M104,6 G7,1 GB13.1 h59 ms16.90.6580.712
SGCA_GCN66,8 M121,4 G7,9 GB15,6 h61 ms16.40.6870.764

Tabla 5: Complejidad computacional, tiempo de entrenamiento y comparación de eficiencia de inferencia con la precisión global del conjunto de validación. La tabla informa de parámetros entrenables, operaciones en coma flotante, uso máximo de memoria, tiempo de entrenamiento para 300 épocas, latencia de inferencia de trama única, fotogramas por segundo, mIoU y puntuación Boundary F1 para el método propuesto y las redes de comparación.

Configuración de la función de pérdidamIoULímite F1
Solo entropía cruzada (EC)0.6690.721
CE + Frontera a.C.0.6740.738
CE + Pérdida en forma inversa0.6810.752
CE + Nuestros SCL0.6870.764

Tabla 6: Comparación cuantitativa de la validación de la función de pérdida. La tabla informa de la puntuación mIoU y F1 de frontera bajo pérdida de entropía cruzada, pérdida binaria binaria cruzada de entropía, pérdida por transformación inversa y la pérdida propuesta de consistencia estructural.

Arquitectura de modelos algorítmicosOclusión leveOclusión moderadaOclusión severaConjunto de anomalías que no son de ManhattanSubconjunto de interferencia de texturas
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

Tabla 7: Análisis de robustez específico por subconjunto de la distribución extrema de oclusión y estructuras no Manhattan. La tabla informa de cambios en la precisión del análisis analizable entre los subconjuntos de oclusión leve, oclusión moderada, oclusión severa, iluminación desafiante, interferencia de texturas y no anomalías de Manhattan.

Número de nodos superscalemIoUFronteraF1Tiempo medio de inferencia (ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

Tabla 8: Análisis de sensibilidad espacial de la escala de particiones de nodos en grafo topológico. La tabla informa del mIoU, la puntuación F1 del límite estructural y el tiempo medio de inferencia entre diferentes configuraciones de particiones de nodos superpíxeles.

Discusión

El algoritmo de este artículo acopla estrechamente las características visuales jerárquicas capturadas por un codificador jerárquico de transformador de ventana desplazada con la profundidad previa de la caja delimitadora 3D Manhattan generada por detección de segmentos de línea, logrando así una reconstrucción semántica de alta precisión de escenas interiores complejas. Un mecanismo de atención cruzada guiado por la estructura fuerza la señal visual a alinearse con el verdadero límite geométrico calibrado por la SDF, restaurando así la continuidad de las características de bajo nivel en áreas localmenteocluidas 42. Un grafo topológico se construye utilizando nodos superpíxeles generados por un algoritmo iterativo de agrupamiento local, que impulsa un GCN a realizar agregación de características bajo restricciones coplanares físicas, asegurando la consistencia de la distribución semánticamacroscópica 43. Los resultados experimentales muestran que el método logra una proporción media de intersección sobre unión del 68,7% con una desviación estándar del 0,2%, un valor práctico de ingeniería, una puntuación F1 de frontera estructural del 76,4% con una desviación estándar del 0,3%, y un tiempo medio de inferencia de 61 ms con una configuración de 256 nodos superpíxeles, reflejando un compromiso deliberado que prioriza la precisión en la reconstrucción de límites sobre la eficiencia de inferenciaúltima 44. Las pruebas de robustez demuestran además que el modelo presenta fuertes capacidades de reparación de topología bajo condiciones extremas de pérdida visual a gran escala. Al introducir la pérdida de consistencia estructural, se mejora la precisión del alineamiento de la máscara predicha con el límite físico de distancia cero calibrado por el SDF, logrando una optimización sinérgica de la complejidad computacional y la calidad de análisis45. Este esquema proporciona un enfoque de fusión de características basado en las leyes del espacio tridimensional y demuestra consistencia lógica en la reparación de topología al tratar con oclusión de muebles a gran escala y distorsión físicade fronteras 46. Los resultados de la investigación proporcionan un marco robusto de restricciones físico-geométricas para el razonamiento espacial inteligente y la reconstrucción 3D de alta precisión, y tienen valor práctico en ingeniería para tareas de navegación visual robótica y reconocimiento de escenas en entornos físicos reales.

El mecanismo de derivación de topología geométrica, que depende en gran medida de la hipótesis del mundo de Manhattan, sufre de sesgo de ajuste al tratar con espacios arquitectónicos irregulares con paredes curvas o fronteras no ortogonales47. Para superar este cuello de botella en modelado geométrique, las iteraciones posteriores de la red integrarán algoritmos de ajuste de superficies polinómicos de múltiples grados y módulos de extracción de curvas B-spline racionales no uniformes en la rama física-prior. Esta estrategia universal de modelado espacial traduce líneas ortogonales rígidas en límites topológicos dinámicamente deformables, mejorando así continuamente la precisión del algoritmo en el análisis en layouts espaciales interiores anómalos.

La extracción geométrica previa se basa en el detector básico de segmento de línea, lo que deja al sistema vulnerable a la distorsión de la máscara estructural al procesar escenas interiores dominadas por materiales reflectanteso transparentes 48. La pérdida de consistencia estructural invoca directamente la SDF generada por este detector, estableciendo un bucle de dependencia cerrado entre la extracción previa y la optimización del gradiente. Cuando la interferencia visual desencadena detecciones anómalas de segmentos de línea, las coordenadas geométricas defectuosas se mapean en la SDF y se amplifican directamente por la pérdida de consistencia estructural durante la retropropagación, obligando así a los parámetros de la red a ajustarse a límites físicosincorrectos 49. Las iteraciones algorítmicas posteriores introducirán ramas de fusión adaptativas multimodales para ingerir mapas de profundidad profundos y datos radiométricos infrarrojos, desacoplando así la percepción estructural geométrica de las restricciones de iluminación en luz visible y ampliando el límite de razonamiento espacial en entornos ópticos extremos.

Para resolver el cuello de botella de sensibilidad al rendimiento causado por la escala fija de nodos superpíxeles, investigaciones posteriores diseñarán un módulo de agrupación de grafos adaptativo y aprendible que determine dinámicamente el esquema de partición de nodos en función de la complejidad de la imagen, eliminando la dependencia de la red en la sintonización manual de hiperparámetros. Para abordar las limitaciones de despliegue de hardware causadas por la sobrecarga computacional de la red de grafos superpíxeles, los planes de optimización futuros introducirán mecanismos ligeros de desacoplamiento de características y módulos de agregación con puertas para comprimir la escala de parámetros y acelerar las operaciones matriciales de la rama geométricaprior 50.

Divulgaciones

Los autores declaran que no tienen conflictos de interés económicos.

Agradecimientos

Financiación: Programa clave de Investigación y Desarrollo de Shaanxi (Programa nº 2024CY2-GJHX-76).

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
AdamW optimizerPyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. et al.https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. et al.https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC algorithmscikit-learn developershttps://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCNAuthors of this studyProposed method (N/A)
Softmax functionPyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

Referencias

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

Reimpresiones y permisos

Etiquetas

Prioris de Estructura de EdificiosTransformador Jer rquicoDetecci n de Segmentos de L neaCaja Delimitadora 3D de ManhattanCampo de Distancia con SignoMecanismo de Atenci n CruzadaRed Neuronal Convolucional de GrafosP rdida de Consistencia Estructural