Montaje experimental
Este estudio utilizó dos conjuntos de datos estándar de análisis de escenas interiores, un conjunto de datos 3D para interiores a gran escala y un conjunto de datos RGB-D para escenas interiores, para evaluar el rendimiento y ajustar el modelo. El conjunto de datos 3D para interiores a gran escala contiene escenas complejas de espacio físico escaneadas de forma realista y vistas RGB de alta resolución, proporcionando etiquetas semánticas 3D de nube de puntos píxel a píxel de alta precisión y máscaras de segmentación de proyección espacial 2D. Sus datos de reconstrucción de rejillas en espacio físico inherentemente realistas y sus propiedades ortogonales de planos establecen un criterio de comparación geométrico-verdad para construir con precisión la caja delimitadora 3D de Manhattan en la rama de extracción. El conjunto de datos de escenas interiores RGB-D contiene imágenes de profundidad interiores ocultas por muebles y desorden, y se utiliza para probar la precisión y robustez global del razonamiento lógico de la red frente a oclusiones.
El algoritmo utiliza mIoU para medir la superposición espacial entre las distribuciones semánticas predichas y verdaderas, al tiempo que introduce una puntuación F1 de frontera estructural para evaluar rigurosamente la precisión del ajuste entre la máscara predicha y los bordes de estructura física calibrados por la SDF a distancia cero. Durante el cálculo se establece un umbral fijo de error de distancia de píxeles en el espacio euclidiano para determinar si los píxeles de borde producidos por la red intersectan los verdaderos contornos físicos de los límites de los edificios. Este sistema de evaluación dual limita los errores de clasificación en bloques semánticos de gran área mientras fortalece la evaluación microcuantitativa del efecto de reconstrucción topológica de las líneas rígidas. Para mantener la consistencia entre la configuración experimental de datos y el proceso de optimización, la escala del conjunto de datos y los hiperparámetros de entrenamiento central se resumieron en la Tabla 2. La Tabla 2 informa de una configuración experimental autorizada para el manuscrito revisado. El benchmark 3D a gran escala en interiores utiliza 1201 escenas de entrenamiento y 312 escenas de validación, el benchmark RGB-D de escenas interiores utiliza 795 imágenes de entrenamiento y 654 imágenes de prueba, y ambos benchmarks se entrenan con un tamaño de lote de 8, una tasa de aprendizaje inicial de 0,0001, un coeficiente de decaimiento de peso de 0,01 y 300 épocas de entrenamiento.
Comparación con métodos de última generación
Antes de presentar una tabla comparativa cuantitativa de algoritmos de análisis sintáctico de escenas interiores, esta sección define rigurosamente los puntos de referencia de prueba utilizados en el sistema de evaluación multidimensional. Para reflejar el rendimiento de clasificación del modelo en diferentes granularidades, el sistema de evaluación complementa el sistema de prueba con dos métricas adicionales: precisión global de píxeles (PixelAcc) y precisión de clase media (MeanAcc). Estas métricas conjuntas construyen un sistema detallado de verificación del rendimiento de algoritmos, estableciendo una referencia teórica rigurosa para el análisis cuantitativo posterior. Para evaluar la precisión del análisis semántico y la robustez a la oclusión del algoritmo propuesto en espacios físicos complejos, se realizaron pruebas comparativas con algoritmos existentes en el conjunto de validación de escenas interiores RGB-D. La biblioteca de modelos de comparación cubre marcos fundamentales de atención a máscaras, Transformers de visión jerárquica, pipelines modernos de segmentación convolucional pura, arquitecturas unificadas de predicción densa y redes de atención multicanal. La evaluación de la prueba se amplió para incluir una línea base de segmentación basada en transformadores, una base unificada de predicción densa, una base unificada de detección y segmentación, una base base de visión a gran escala, una línea base puramente convolucional, una base de segmentación basada en la atención en máscara, una base de agregación de características intermodal y una línea base progresiva de fusión de características (véase la Tabla de Materiales), utilizando el mismo conjunto de validación de escenas interiores RGB-D, resolución de entrada, horario de entrenamiento y protocolo métrico. En la arquitectura propuesta, la red guiada por estructura integra una columna vertebral visual multiescala con ventanas desplazadas, un módulo de atención cruzada guiado por estructura con un SDF y un GCN superpíxel. La comparación ampliada abarca la predicción densa basada en transformadores, la predicción densa basada en convolución, el análisis de atención a máscaras, la fusión de características entre modales y los paradigmas progresivos de fusión de características, permitiendo evaluar la contribución de la intervención explícita en límites geométricos 3D frente a líneas base más amplias de análisis de escenas interiores.
La Tabla 3 detalla el desempeño objetivo de evaluación de cada red en las métricas cuantitativas principales, informando de los valores medios y las desviaciones estándar correspondientes a lo largo de cinco ejecuciones independientes. La comparación ampliada de la línea base evalúa si el mecanismo de razonamiento guiado por estructura propuesto contribuye a ganancias de precisión más allá de los backbones estándar de predicción densa, las redes de segmentación basadas en máscaras y las redes de fusión de características RGB-D. Los datos experimentales muestran que el algoritmo propuesto logra ganancias estables en las cuatro métricas cuantitativas. Las redes de predicción densa basadas en transformadores y las redes de atención a la máscara conservaron una fuerte capacidad de modelado global del contexto, pero sus valores F1 de frontera seguían siendo menores en presencia de desorden en primer plano porque las máscaras predichas carecían de restricciones físicas explícitas en los límites. Las redes de fusión cruzadas y progresivas mejoraron la continuidad semántica local, pero su fusión de características seguía dependiendo principalmente de la apariencia y la profundidad de respuestas más que de un prior estructural de distancia con signos. La red guiada por estructura propuesta alcanzó un mIoU de 0,687 con una desviación estándar de 0,002 y una puntuación media F1 en el Límite de 0,764 con una desviación estándar de 0,003. La comparación ampliada indica que la ganancia de rendimiento no se debió únicamente a una columna vertebral de predicción densa y mayor, sino más bien al uso conjunto de la guía de campo a distancia con signos, la atención cruzada consciente de la estructura y el razonamiento topológico basado en grafos.
Para analizar la precisión global del razonamiento lógico del modelo bajo oclusiones, identificamos y extrajimos escenarios típicos en el conjunto de validación que estaban gravemente obstruidos por muebles y otros desordens, y producimos visualizaciones de máscaras de predicción a nivel de píxel.
Después se definieron el flujo de trabajo del método y el proceso de razonamiento por grafos en la Figura 1, Figura 2, Figura 3 y Figura 4. La Figura 5 ilustra las diferencias en las predicciones morfológicas entre modelos bajo condiciones extremas de oclusión. Los rectángulos rojos en el mapa de malla de comparación cualitativa marcan áreas clave de conflicto donde las esquinas y las superficies portantes están ocluidas. La máscara de salida de la línea base de segmentación basada en atención en la máscara muestra un suavizado pronunciado de bordes y adhesión entre clases. Aunque la línea base de agregación de características cruzadas y la línea base de fusión progresiva incorporan datos cruzados, sus resultados de predicción siguen mostrando discontinuidades estructurales de clase y distorsiones físicas de los límites. La máscara generada por este método propuesto presenta una alta superposición espacial con las etiquetas de la verdad fundamental. Los modelos base, limitados por principios puramente impulsados por píxeles, tienden a perder sus campos receptivos locales cuando están ocluidos. El método propuesto utiliza un GCN superpíxel para realizar el paso de mensajes en el espacio no euclidiano, reconstruyendo así las esquinas subyacentes y esqueletos espaciales lineales guiados por límites geométricos implícitos. Esto verifica el rendimiento anti-interferencia de nuestra solución propuesta para resolver complejos diseños interiores desde una perspectiva morfológica visual.
Experimento de ablación
Para analizar la contribución real de cada componente independiente en la arquitectura propuesta, este estudio construyó una prueba de ablación modular ampliada sobre el conjunto de validación de escenas interiores RGB-D. La línea base de la prueba se estableció en una red de clasificación convencional con solo la columna vertebral visual del transformador de ventana desplazada base. La evaluación cuantitativa midió la contribución independiente de la atención cruzada guiada por la estructura, el sesgo de campo por distancia con signo, la ponderación estructural adaptativa, el razonamiento de grafos superpíxeles, la construcción de aristas coplanares, la normalización simétrica de grafos y la pérdida de consistencia estructural. Este diseño de ablación ampliada separaba las ganancias acumuladas de los módulos de los efectos de eliminación de componentes, haciendo más claro el límite de contribución de cada elección de diseño.
La Tabla 4 y la Figura 6 ilustran la evolución de la precisión bajo configuraciones ampliadas de ablación acumulativa y basada en la eliminación. La red base de transformadores de ventana desplazada carece de restricciones físicas tridimensionales en los límites, lo que resulta en una agregación limitada de características en fondos saturados. Añadir atención cruzada guiada por estructuras aumentó el mIoU de 0,615 a 0,648 y la puntuación F1 de Boundary de 0,630 a 0,685, mostrando que el campo de distancia señalada previamente mejoró la alineación entre las características visuales y los contornos estructurales. Añadiendo solo razonamiento de grafos superpíxeles aumentó el mIoU a 0,641 y la puntuación F1 de frontera a 0,676, lo que indica que el razonamiento topológico nodo por nodo mejoró la consistencia semántica sobre regiones físicas homogéneas. Sumando solo la pérdida de consistencia estructural aumentó el mIoU a 0,632 y la puntuación F1 de la frontera a 0,662, mostrando que el término de pérdida afectaba principalmente al ajuste de límites más que a la agregación contextual amplia.
Combinar la atención cruzada con el razonamiento de grafos aumentó el mIoU a 0,669 y la puntuación F1 de Boundary a 0,721, mostrando que la alineación visual-estructural y el paso de mensajes en el dominio del grafo producían efectos complementarios. Combinando la atención cruzada con la pérdida de consistencia estructural, se logró un mIoU de 0,660 y una puntuación F1 en Boundary de 0,713, mientras que combinar razonamiento en gráficos con pérdida de consistencia estructural obtuvo un mIoU de 0,653 y una puntuación F1 en Boundary de 0,704. Estos resultados por pares indican que el módulo de atención cruzada proporcionó la señal principal de alineación geométrica, el módulo de razonamiento de grafos expandió esta señal a través de regiones coplanares, y la pérdida de consistencia estructural refinó el límite de transición semántica durante la optimización.
La ablación basada en la eliminación aclaró aún más la contribución de las elecciones internas de diseño. Eliminar el sesgo aditivo de campo por distancia con signo redujo el mIoU a 0,656 y la puntuación F1 de frontera a 0,698, confirmando que la matriz de afinidad estructural era central para suprimir la difusión transfronteriza de características. Eliminar el coeficiente de ponderación estructural adaptativo λ redujo el mIoU a 0,671 y la puntuación F1 de la frontera a 0,736, indicando que una restricción estructural fija debilitaba la respuesta del modelo en regiones no Manhattan y visualmente degradadas. Eliminar la restricción de aristas coplanar redujo el mIoU a 0,666 y la puntuación F1 de frontera a 0,728, mostrando que las aristas del grafo basadas únicamente en la adyacencia local no preservaron la consistencia del plano físico. Eliminar la normalización simétrica de grafos redujo el mIoU a 0,673 y la puntuación F1 de frontera a 0,737, lo que indica que la propagación balanceada en grados era necesaria para la agregación estable de nodos. La red guiada por estructura propuesta completa logró un mIoU de 0,687 y una puntuación F1 en el Límite de 0,764, demostrando que la ganancia final resultó de la interacción coordinada entre la atención estructural, el razonamiento de grafos y la optimización consciente de los límites.
Análisis de la complejidad computacional, el tiempo de entrenamiento y la eficiencia de la inferencia
Para evaluar el coste computacional de la extracción SDF, la atención cruzada guiada por la estructura y el razonamiento convolucional de grafos superpíxeles, este estudio evaluó la escala de parámetros, las operaciones en punto flotante, el uso máximo de memoria, el tiempo de entrenamiento, la latencia de inferencia de un solo fotograma, la tasa de fotogramas y el mIoU en la misma plataforma informática. Las operaciones en coma flotante se calculaban bajo una resolución de entrada 512 × 512. La latencia de inferencia se midió con un tamaño de lote de 1 después del calentamiento del modelo, mientras que la tasa de fotogramas reportada se calculó a partir de la latencia media de una sola imagen. El tiempo de entrenamiento se midió bajo el mismo calendario de 300 épocas, tamaño de lote de 8, ajustes del optimizador y pipeline de preprocesamiento de datos.
La Tabla 5 detalla la relación entre la escala del modelo, el coste de entrenamiento, la eficiencia de inferencia y la precisión del análisis para cada arquitectura de red. Las columnas mIoU y F1 de frontera en la Tabla 5 utilizan los mismos valores globales del conjunto de validación que la Tabla 3 para cada modelo correspondiente. Estas dos columnas de precisión se repiten en la Tabla 5 únicamente para comparar la precisión del análisis sintáctico con el coste computacional. El aumento de parámetros entreenables se debió principalmente a las capas de proyección de consulta-clave-valor en el módulo de atención cruzada guiado por estructura y a las matrices de pesos de las tres capas convolucionales del grafo. El coste no entrenó se incurrió principalmente en la generación de SDF, la partición de superpíxeles y la construcción de adyacencia de grafos. Dado que estas operaciones no entreenables se ejecutaban una vez por cada imagen de entrada, aumentaban la latencia de inferencia pero no incrementaban sustancialmente el número de parámetros entreables. Esta separación explica por qué el método propuesto mostró un aumento moderado de parámetros pero un aumento más pronunciado de la latencia. Los resultados de complejidad muestran que la línea base de segmentación basada en la atención de la máscara mantuvo un menor conteo de parámetros y una latencia de inferencia menor, pero su puntuación F1 en el Límite y mIoU estaban limitados bajo oclusión severa debido a la falta de una guía geométrica explícita de los límites en la red. La línea base de agregación de características entre modales requería más operaciones en coma flotante y un tiempo de entrenamiento más largo porque la agregación entre modales introducía una sobrecarga adicional de alineación de características. La línea base de fusión progresiva de características mantuvo un coste computacional moderado, pero su precisión de predicción seguía siendo inferior a la del método propuesto bajo distorsión de frontera. La red guiada por estructura propuesta implica costes computacionales adicionales debido a la construcción de SDF, proyección estructural de atención cruzada, construcción de grafos superpíxeles y propagación de convolución de grafos. El modelo completo utilizó 66,8 millones de parámetros, 121,4 mil millones de operaciones en coma flotante, 15,6 horas de entrenamiento, 7,9 GB de memoria de pico, 61 ms de tiempo de inferencia de un solo fotograma y 16,4 fotogramas por segundo. Aunque la latencia de inferencia fue mayor que la de la línea base pura de atención a la máscara, el modelo logró un mIoU de 0,687 y una puntuación F1 en el Límite de 0,764, lo que indica que el coste adicional apoyó principalmente la reparación de límites estructurales y la consistencia semántica consciente de la topología.
Para representar visualmente el equilibrio espacial bidimensional entre la escala computacional y la precisión analítica del modelo, se creó un diagrama de distribución de burbujas que muestra el número de operaciones en coma flotante y el mIoU del algoritmo. La visualización revisada también informó del tiempo de entrenamiento y la latencia de inferencia en el área de anotación de figuras, permitiendo comparar las ganancias de precisión y los costes computacionales tanto desde la perspectiva del entrenamiento como del despliegue. El eje horizontal conservaba las operaciones de punto flotante, el eje vertical retenía el mIoU, el tamaño de la burbuja representaba la cantidad de parámetro entrenable y la etiqueta adjunta reportaba el tiempo de inferencia para cada método.
La Figura 7 revela la relación entre las operaciones en coma flotante, la escala de parámetros, la latencia de inferencia y la precisión del análisis sintáctico. El método propuesto alcanza un mIoU mayor que las redes de comparación, mientras que sus FLOPs y el conteo de parámetros permanecen cercanos a los de las líneas base de fusión cruzada y progresiva. La latencia de un solo fotograma de 61 ms indica que las ramas añadidas de SDF y razonamiento de grafos introdujeron sobrecarga de despliegue, pero la latencia permaneció dentro del rango de tiempo real requerido para muchas tareas de interpretación de escenas en interiores. El tiempo de entrenamiento aumentó a 15,6 horas porque se ejecutaron extracciones estructural previas, proyección de atención y razonamiento gráfico durante cada época de entrenamiento. Este resultado muestra que el coste computacional del método propuesto se concentra principalmente en el razonamiento estructural consciente de fronteras más que en la expansión incontrolada de los parámetros.
Comparación específica entre pérdida de consistencia estructural y pérdida por distancia espacial
La pérdida inversa de la red de transformación para cuantificar la distancia de transformación espacial de los límites utiliza parámetros de transformación homomórficas para capturar desplazamientos de frontera, demostrando que las métricas puras de distancia espacial superan las pérdidas tradicionales de entropía cruzada basadas en cambios en las etiquetas de píxeles. Basándose en este consenso teórico, se realizan experimentos de validación paralela utilizando esquemas de restricciones de frontera para evaluar el rendimiento comparativo de la Pérdida de Consistencia Estructural (SCL) personalizada basada en cajas delimitadoras de Manhattan respecto a la adaptabilidad de la escena. Los experimentos mantienen la arquitectura analítica de fusionar una columna vertebral visual multiescala con una red de inferencia de grafos, mientras simplemente reemplazan el término de pérdida de frontera durante la retropropagación. Se configuran cuatro redes de validación paralelas: una red que utiliza solo la clasificación básica de pérdida cruzada carece de restricciones geométricas de alta dimensión; una red con pérdida adicional de entropía cruzada binaria estándar de frontera (BCE) realiza la supervisión convencional de clasificación binaria de bordes; una red con pérdida adicional de distancia en frontera espacial se centra en capturar deformaciones locales; y una red que aplica la SCL propuesta impone penalizaciones topológicas ortogonales basadas en la SDF. Las métricas de cuantización en el conjunto de validación de escenas interiores RGB-D están limitadas al mIoU y a la puntuación F1 del límite estructural.
La Tabla 6 detalla el grado de intervención de diferentes estrategias de optimización por retropropagación sobre la cognición lógica espacial subyacente. La entrada solo de entropía cruzada en la Tabla 6 denota la arquitectura propuesta nuestra entrenada únicamente con pérdida de entropía cruzada a nivel de píxel, manteniendo sin cambios la columna vertebral visual, la rama de campo de distancia con signos, el módulo de atención cruzada guiado por la estructura y la rama de razonamiento de grafos superpíxeles. Esta entrada no es una referencia de Mask2Former y no debe compararse con el valor global de Mask2Former en la Tabla 3, ya que utiliza el mismo modelo. Las redes que dependen únicamente de la pérdida básica de entropía cruzada alcanzan la puntuación de ajuste de frontera más baja. Las redes con una pérdida binaria binaria estándar adicional de entropía cruzada en el límite logran una ligera ganancia, pero este mecanismo sigue causando desenfoque de bordes bajo oclusión a gran escala. La pérdida de distancia en el límite espacial mejora la puntuación mediante un mecanismo de percepción por transformación espacial, corrigiendo eficazmente algunos bordes distorsionados. La pérdida de consistencia estructural propuesta en este artículo aprovecha directamente la SDF real para imponer penalizaciones de gradiente sobre mutaciones semánticas anómalas dentro de la superficie física portante, logrando la puntuación F1 más alta en el límite estructural.
Para comparar visualmente los efectos impulsores de diferentes configuraciones de funciones de pérdida en la precisión de la predicción de máscaras y el ajuste de los límites, trazamos gráficos de barras agrupados entre distintas estrategias de optimización.
La Figura 8 ilustra la mejora de rendimiento escalonada que resulta de la mejora de la dimensión de percepción espacial de la función de pérdida. El gráfico de barras que representa la puntuación F1 del límite estructural muestra una tendencia ascendente significativa. Los datos experimentales muestran que este mecanismo de penalización personalizado obliga a que la ubicación del salto espacial de la categoría predicha coincida exactamente con el contorno físico ortogonal. El mecanismo de penalización de campo de distancia, personalizado para priors ortogonales en interiores, logra una mayor precisión que la pérdida general por captura de límites espaciales, estableciendo así un camino de optimización eficaz para abordar fallos complejos de edificios.
Pruebas de robustez de distribución extrema de oclusión, estructuras anómalas y condiciones de iluminación desafiantes
Las complejas relaciones espaciales entre objetos y la oclusión mutua afectan negativamente a la cognición espacial global en 3D. La arquitectura de predicción conjunta destaca el papel de apoyo de las restricciones de disposición de escenas en la extracción de la máscara subyacente. Examinar los límites anti-interferencia del algoritmo bajo pérdida de señal visual de gran área y disposiciones espaciales anómalas que violan la suposición física ortogonal 3D define claramente el límite efectivo de aplicación del algoritmo y tiene un valor central y demostrable. Según la proporción de mobiliario de gran tamaño enmascarado con las etiquetas de la verdad en el terreno, el conjunto de pruebas de escenas interiores RGB-D se subdivide en tres subconjuntos progresivamente más difíciles: oclusión leve, moderada y severa. Simultáneamente, las escenas no típicas de Manhattan con techos inclinados o paredes curvas se extraen manualmente para construir conjuntos de pruebas de contorno anomalo, y las escenas con condiciones de luz extremadamente baja, sobreexposición y superficies de vidrio brillantes o transparentes de gran superficie se clasifican en subconjuntos de iluminación y textura desafiantes. La biblioteca de modelos de comparación incluye una línea base de segmentación basada en la atención en la máscara; una arquitectura general de segmentación basada en la atención de la máscara para capturar el contexto global; una línea base de agregación de características intermodales que emplea una estrategia integral de agregación intermodal; y una línea base de fusión progresiva de características que integra un mecanismo de extracción progresiva de características de varias etapas. Cada línea base de comparación, la columna vertebral visual de fusión y la arquitectura de análisis de la red de inferencia de grafos construida en este artículo se evalúan de forma independiente sobre los subconjuntos anteriores, y el gradiente de decaimiento de precisión de cada modelo se analiza estadísticamente.
La Tabla 7 informa métricas de robustez específicas de subconjunto bajo oclusión leve, moderada y severa, iluminación desafiante, interferencia de texturas y condiciones de anomalías no Manhattan. La Tabla 7 detalla los cambios en la precisión de la predicción de máscaras de diferentes modelos bajo interferencia espacial. La Tabla 7 informa de valores de mIoU específicos de subconjunto para diferentes modelos bajo condiciones de interferencia espacial, calculados solo dentro de la oclusión, iluminación, textura o subconjunto no Manhattan correspondiente, en lugar de en el conjunto general de validación de escenas interiores RGB-D. En los subconjuntos de oclusión leve y moderada, todos los modelos mantienen una precisión base. Con el aumento del área de oclusión, los modelos base que se basan en reglas impulsadas por píxeles muestran una disminución en la proporción intersección-unión (UI) en el subconjunto fuertemente ocluido. La línea base de segmentación basada en la atención en la máscara y la línea base de agregación de características entre modales sufren pérdidas significativas de precisión en este subconjunto. La arquitectura de extracción progresiva de características de múltiples etapas de la línea base de fusión progresiva muestra un descenso severo en el rendimiento. La solución propuesta se basa en características explícitas del esqueleto 3D para forzar la alineación de señales visuales dañadas, manteniendo una forma estable de salida de máscara en el subconjunto fuertemente ocluido y demostrando la estabilidad topológica de la salida de la máscara semántica. En los subconjuntos de iluminación y textura desafiantes, el detector de segmentos de línea no presenta bordes estructurales en regiones con fuertes reflexiones y vidrio transparente, lo que provoca discontinuidades localizadas en el SDF. Las coordenadas geométricas erróneas se propagan a través de la matriz de afinidad estructural y la pérdida de consistencia estructural, aplicando así penalizaciones anómalas de gradiente a las características semánticas y causando desviaciones correspondientes en las predicciones de frontera. El mecanismo global de razonamiento del contexto espacial del GCN complementa los priores geométricos ausentes con afinidades estructurales adyacentes, manteniendo la precisión global del análisis dentro de un rango aceptable de decaimiento y revelando el límite de las capacidades de percepción visual del algoritmo bajo interferencias físicas complejas. En el subconjunto de anomalías no de Manhattan, el prior SDF en la capa inferior de este modelo introduce un ligero sesgo de mapeo, resultando en un rendimiento ligeramente inferior al de la línea base de fusión progresiva de características. El coeficiente de ponderación estructural adaptativa en el módulo de atención cruzada evalúa dinámicamente la consistencia de los gradientes de la estructura física subyacente. En escenas con paredes curvas o techos inclinados, este coeficiente reduce automáticamente el peso de restricción del SDF, animando a la red a confiar en el mecanismo local de agregación de nodos de características de la red de grafos de superpíxeles para mantener la coherencia semántica en regiones homogéneas, estableciendo así un mecanismo efectivo de compensación geométrica para disposiciones espaciales no Manhattan.
Para demostrar visualmente el impacto negativo de la severidad de la oclusión en la precisión de la resolución, trazamos gráficos lineales que muestran la disminución de la precisión entre diferentes modelos de algoritmos.
La Figura 9 revela visualmente las diferencias en la robustez entre los distintos paradigmas de extracción de características bajo entornos físicos extremos. Las tres líneas discontinuas que representan los modelos base presentan una tendencia descendente significativa en nodos fuertemente ocluidos, reflejando las limitaciones de los campos receptivos convencionales en la extracción de características bajo pérdida de señal a gran escala. La línea sólida que representa el método propuesto mantiene una trayectoria de decaimiento relativamente suave. Los datos experimentales muestran que el acoplamiento entre los priors arquitectónicos 3D explícitos y los mecanismos de inferencia basados en grafos proporciona soporte estructural para tareas de análisis de escenas resistentes a la oclusión y mejora el rendimiento de la generalización de modelos en entornos complejos.
Análisis de sensibilidad espacial de la partición de nodos de grafos topológicos
El parámetro de tasa de muestreo de reducción de dimensionalidad del módulo de convolución de grafos en espacio de coordenadas controla directamente la calidad del campo receptivo y la carga computacional de la red de grafos. En línea con el marco teórico de este artículo, este estudio investiga cómo el número de nodos de grafo discretos producidos por agrupamiento iterativo lineal simple afecta al rendimiento de la inferencia topológica no euclidiana, con el objetivo de proporcionar un soporte riguroso para la selección de hiperparámetros. Se realizaron experimentos para ajustar los parámetros de control de inicialización del algoritmo de agrupamiento, interviniendo forzosamente en la reducción dinámica de dimensionalidad del espacio de características, estableciendo el número de particiones de nodos de grafos superpíxeles en 64, 128, 256, 512 y 1024. Bajo un benchmark de prueba estrictamente alineado, la proporción media intersección sobre unión (IoU), la puntuación F1 del límite estructural y el tiempo medio de inferencia por imagen de alta resolución se registraron simultáneamente en diferentes tamaños de nodos topológicos.
La Tabla 8 detalla la relación entre el grado de reducción de dimensionalidad dinámica en el espacio de características y tanto la precisión analítica como el coste computacional. Reducir demasiado el número de nodos conduce a una subsegmentación de las características de la imagen, haciendo que los atributos semánticos de los objetos pequeños se fusionen con los elementos de pared a gran escala, disminuyendo así varias métricas de precisión. A medida que aumenta la escala de partición de nodos, la sensibilidad del modelo a los detalles espaciales locales mejora significativamente. Aumentar el número de nodos a 512 y 1024 provoca la fragmentación de regiones homogéneas, debilita el efecto de suavizado sobre las características macroscópicas en redes neuronales de grafos, incrementa la dimensionalidad de la matriz de relaciones de nodos y aumenta el tiempo de inferencia. Una configuración de parámetros con un número fijo de nodos de 256 conduce a los valores más altos para la proporción intersección-unión y la puntuación de límite.
Para representar visualmente el equilibrio entre precisión y potencia computacional en la inferencia topológica no euclidiana, se graficó un gráfico estadístico biaxial mostrando la sensibilidad al tamaño del nodo.
La Figura 10 ilustra la lógica subyacente mediante la cual el número de nodos discretos de grafo afecta la evolución de las características de la red. La barra de fondo que representa el tiempo de cálculo muestra un aumento pronunciado después de que el número de nodos supere el umbral de 256. La doble línea que representa la precisión alcanza su pico en 256 en el eje horizontal, y luego disminuye razonablemente debido a los efectos de fragmentación. Los datos cuantitativos objetivos y la tendencia de evolución visual son muy consistentes, demostrando que mantener el tamaño del grafo de cómputo en 256 nodos logra un equilibrio entre el procesamiento por hardware y el razonamiento lógico bajo la configuración actual de parámetros fijos. La severa degradación del rendimiento causada por desviarse de este recuento de nodos revela la alta sensibilidad de la estrategia fija de segmentación superpíxel a la afinación de hiperparámetros y subraya la necesidad de desarrollar un mecanismo dinámico de selección de nodos.
DISPONIBILIDAD DE DATOS:
Los datos de referencia en bruto analizados en este estudio están disponibles públicamente en los repositorios oficiales listados en la Tabla de Materiales. El benchmark 3D a gran escala para interiores fue accedido como la versión oficial de ScanNet v2, con el identificador de lanzamiento de conjunto de datos ScanNet v2. El benchmark de escenas interiores RGB-D fue accedido a través de la versión oficial NYU Depth Dataset V2, con el identificador de lanzamiento NYU Depth Dataset V2. El DOI descriptivo de publicación para el benchmark 3D de interiores a gran escala es 10.1109/CVPR.2017.261, y el DOI descriptivo para el benchmark de escenas interiores RGB-D es 10.1007/978-3-642-33715-4_54. No se generaron nuevas imágenes en bruto ni conjuntos de datos RGB-D en este estudio. Los archivos procesados de split, archivos de configuración de entrenamiento, registros de evaluación en bruto, archivos fuente numéricos que soportan la Tabla 2, Tabla 3, Tabla 4, Tabla 5, Tabla 6, Tabla 7 y Tabla 8, y Figura 5, Figura 6, Figura 7, Figura 8, Figura 9 y Figura 10, los pesos entrenados de los modelos y el código fuente han sido depositados en figshare bajo el DOI: 10.6084/m9.figshare.32906765. El registro de figshare proporciona los datos completos de resultados en bruto necesarios para reproducir las tablas cuantitativas y cifras reportadas en este manuscrito. El repositorio contiene las máscaras de predicción, archivos de evaluación de límites, scripts de cálculo de métricas, puntos de control de modelos y archivos fuente de tablas utilizados para el mIoU reportado, Boundary F1, PixelAcc, MeanAcc, análisis de complejidad computacional, robustez, validación de la función de pérdida y sensibilidad de particiones de nodos.

Figura 1: Comparación de la discontinuidad semántica y los efectos de reparación previa estructural en escenarios complejos de oclusión interior. (A) Imagen RGB original con oclusión de muebles a gran escala. (B) Salida del modelo base tradicional que destaca la distorsión física de los límites y los defectos de discontinuidad semántica. (C) Salida del método propuesto con una superposición de perspectiva de línea discontinua cian que mapea explícitamente el esqueleto 3D del edificio para la reparación topológica de características dañadas de la estructura subyacente. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 2: Marco general de análisis semántico guiado por los priors estructurales de construcción. El diagrama describe toda la cadena de operaciones comenzando desde la entrada de imagen RGB, pasando por la rama de extracción de características visuales con ventana desplazada y la rama de extracción previa de estructuras, hasta el módulo de atención cruzada guiado por estructuras, seguido por el razonamiento topológico mediante el GCN del superpíxel, y finalmente la decodificación en el mapa semántico denso. A la derecha se presentan los diseños detallados del cálculo de la matriz de afinidad de atención, el paso de mensajes en grafos y las funciones de pérdida de optimización conjunta. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3: Diagrama de flujo de la construcción de la matriz de afinidad y la conectividad topológica. El gráfico detalla la cadena de mapeo matemático paso a paso, mostrando la transformación desde el mapa de distancia de entrada y los pares de píxeles seleccionados, a través de la extracción continua de características geométricas potenciales y la evaluación de la consistencia del gradiente, hasta la matriz de afinidad normalizada utilizada como sesgo espacial explícito para el mecanismo de atención cruzada. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 4: Diagrama esquemático de la proyección de nodos de convolución del grafo superpíxeles y agregación de características. El panel detalla el proceso de razonamiento topológico no euclidiano: (A) características densas de píxeles que muestran la matriz local original de características y los límites de agrupamiento de superpíxeles; (B) construcción de topología de grafos superpíxeles que mapea la cuadrícula regular a nodos discretos y aristas físicamente conectadas; (C) paso convolucional de mensajes de grafo realizando agregación direccional de características locales; y (D) retroproyección de coordenadas que presenta las características semánticas macroscópicas restauradas de consistencia semántica en la cuadrícula densa. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 5: Diagrama de cuadrícula comparativa cualitativa. La matriz proporciona una evaluación visual del rendimiento a través de diferentes escenas interiores fila a fila, comparando las entradas RGB originales interiores y los diseños de la verdad del terreno con las salidas de la línea base de segmentación basada en la atención en la máscara, la base de agregación de características cross-modal, la base de fusión progresiva de características y el método propuesto, que restaura con éxito esquinas ocluidas y alinea superficies portantes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 6: Resultados de ablación para la integración acumulativa de módulos. El gráfico de doble eje muestra la evolución del rendimiento paso a paso a través de diferentes configuraciones de ablación modular, representando la trayectoria ascendente constante de la intersección media sobre unión (mIoU) como barras y la puntuación F1 del límite estructural como un gráfico de líneas desde la columna vertebral base hasta el marco completo. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 7: Complejidad computacional, tiempo de entrenamiento y distribución de la eficiencia de inferencia. El gráfico de burbujas multidimensional revela los compromisos entre la sobrecarga computacional y la precisión del análisis sintáctico. El eje horizontal mide las operaciones en coma flotante (FLOPs), el eje vertical indica mIoU, el tamaño de la burbuja representa la escala de parámetros entreenables y las etiquetas de texto adyacentes informan la latencia de inferencia de trama única para cada arquitectura de red. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 8: Histograma de precisión de frontera y puntuaciones métricas bajo diferentes configuraciones de funciones de pérdida. El gráfico de barras agrupado compara los efectos impulsores de diversas estrategias de optimización sobre la lógica espacial subyacente, ilustrando las ganancias significativas en mIoU y en la puntuación F1 del límite estructural logradas al actualizar de formulaciones estándar de entropía cruzada a la pérdida de consistencia estructural propuesta. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 9: Gráfico de líneas que muestra la relación entre la severidad de la oclusión y la decadencia del rendimiento. La curva sigue la degradación de la precisión a través de diferentes paradigmas de extracción de características bajo niveles de oclusión leve, moderada y severa, destacando la robusta estabilidad topológica y la capacidad anti-interferencia del marco guiado por estructuras propuesto en comparación con líneas base puramente impulsadas por píxeles. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 10: Análisis de sensibilidad de la escala de nodos superpíxeles. El gráfico estadístico biaxial ilustra el equilibrio entre la velocidad de procesamiento por hardware y la precisión del razonamiento lógico a lo largo de diferentes tamaños de partición de grafos, mostrando cómo el número de nodos superpíxeles afecta a las métricas de precisión y conduce a un aumento pronunciado en el tiempo medio de inferencia. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| Numeración en la capa de red | Dimensión de características del nodo de entrada | Dimensión de característica del nodo de salida | Ajuste de probabilidad de inactivación aleatoria |
| 1 | 512 | 256 | 0.15 |
| 2 | 256 | 256 | 0.15 |
| 3 | 256 | 128 | 0.1 |
| 4 | 128 | 64 | 0.05 |
Tabla 1: Tabla de configuración de hiperparámetros de la arquitectura de red para el módulo de inferencia convolucional. La tabla informa de la numeración de la capa de red, las dimensiones de características de los nodos de entrada, las dimensiones de las características de los nodos de salida y las configuraciones de probabilidad de inactivación aleatoria utilizadas en la red de razonamiento de grafos.
| Elemento de configuración | Benchmark 3D a gran escala para interiores | Referencia de escenas interiores RGB-D |
| Identificador oficial de la versión | ScanNet v2 | Conjunto de Datos de Profundidad NYU V2 |
| Muestras de entrenamiento utilizadas en este estudio | 1201 escenas | 795 imágenes |
| Muestras de validación o prueba utilizadas para la evaluación | 312 escenas de validación | 654 imágenes de prueba |
| Categorías semánticas totales | 20 | 40 |
| Resolución de imagen de entrada | 512 × 512 | 512 × 512 |
| Tasa inicial de aprendizaje | 0.0001 | 0.0001 |
| Recuento de muestras de entrada por lotes | 8 | 8 |
| Coeficiente de decaimiento de peso | 0.01 | 0.01 |
| Épocas totales de entrenamiento | 300 | 300 |
| Número de carreras independientes | 5 | 5 |
Tabla 2: División experimental del conjunto de datos y configuración unificada de hiperparámetros de entrenamiento. La tabla informa de conjuntos de datos 3D a gran escala para interiores y de conjuntos de datos RGB-D de escenas interiores para la partición, el conteo de categorías semánticas, la tasa de aprendizaje, el número de muestras de entrada por lotes, la tasa de decaimiento de peso y el conteo total de iteraciones de entrenamiento.
| Arquitectura del modelo de red | mIoU | Límite F1 | PixelAcc | MeanAcc |
| SegFormer | 0,596 ± 0,003 | 0,635 ± 0,004 | 0,838 ± 0,003 | 0,704 ± 0,004 |
| ConvNeXt UperNet | 0,604 ± 0,003 | 0,642 ± 0,004 | 0,846 ± 0,003 | 0,713 ± 0,004 |
| Mask2Former | 0,612 ± 0,003 | 0,654 ± 0,004 | 0,853 ± 0,003 | 0,721 ± 0,004 |
| OneFormer | 0,621 ± 0,002 | 0,663 ± 0,003 | 0,861 ± 0,003 | 0,733 ± 0,003 |
| MaskDINO | 0,628 ± 0,002 | 0,667 ± 0,003 | 0,869 ± 0,003 | 0,741 ± 0,003 |
| CCANet | 0,635 ± 0,003 | 0,671 ± 0,004 | 0,876 ± 0,003 | 0,745 ± 0,004 |
| InternImage UperNet | 0,641 ± 0,002 | 0,692 ± 0,003 | 0,884 ± 0,002 | 0,756 ± 0,003 |
| CMPFFNet | 0,658 ± 0,002 | 0,712 ± 0,003 | 0,891 ± 0,002 | 0,773 ± 0,003 |
| SGCA_GCN | 0,687 ± 0,002 | 0,764 ± 0,003 | 0,924 ± 0,002 | 0,816 ± 0,003 |
Tabla 3: Comparación cuantitativa general de las líneas base de análisis de escenas interiores en el conjunto de validación de escenas interiores RGB-D. La tabla informa sobre mIoU, puntuación F1 de frontera, precisión global de píxeles y precisión de clase media para la línea base de segmentación basada en la atención en la máscara, la línea base de agregación de características intermodal, la línea base de fusión progresiva de características y la arquitectura de red propuesta guiada por estructura.
| Configuración de la arquitectura de red | mIoU | Límite F1 | PixelAcc | MeanAcc |
| Columna vertebral base de ventana desplazada | 0,615 ± 0,003 | 0,630 ± 0,004 | 0,842±0,003 | 0,706 ± 0,004 |
| Columna vertebral más atención cruzada guiada por la estructura | 0,648 ± 0,003 | 0,685 ± 0,004 | 0,874 ± 0,003 | 0,748 ± 0,004 |
| Razonamiento de la columna vertebral más el gráfico superpíxeles | 0,641 ± 0,003 | 0,676 ± 0,004 | 0,868 ± 0,003 | 0,741 ± 0,004 |
| Pérdida de consistencia entre columna vertebral y estructural | 0,632 ± 0,003 | 0,662 ± 0,004 | 0,859 ± 0,003 | 0,732 ± 0,004 |
| Columna vertebral más atención cruzada y razonamiento en gráficos | 0,669 ± 0,002 | 0,721 ± 0,003 | 0,897 ± 0,002 | 0,782 ± 0,003 |
| Columna vertebral más atención cruzada y pérdida de consistencia estructural | 0,660 ± 0,002 | 0,713 ± 0,003 | 0,889 ± 0,002 | 0,773 ± 0,003 |
| Razonamiento de columna vertebral más gráfico y pérdida de consistencia estructural | 0,653 ± 0,003 | 0,704 ± 0,003 | 0,881 ± 0,003 | 0,765 ± 0,003 |
| Modelo completo sin sesgo aditivo de campo de distancia con signos | 0,656 ± 0,003 | 0,698 ± 0,004 | 0,884 ± 0,003 | 0,761 ± 0,004 |
| Modelo completo sin ponderación estructural adaptativa λ | 0,671 ± 0,002 | 0,736 ± 0,003 | 0,904 ± 0,002 | 0,792 ± 0,003 |
| Modelo completo sin restricción de aristas coplanar | 0,666 ± 0,002 | 0,728 ± 0,003 | 0,899 ± 0,002 | 0,786 ± 0,003 |
| Modelo completo sin normalización simétrica de grafos | 0,673 ± 0,002 | 0,737 ± 0,003 | 0,906 ± 0,002 | 0,795 ± 0,003 |
| A SGCA_GCN | 0,687 ± 0,002 | 0,764 ± 0,003 | 0,924 ± 0,002 | 0,816 ± 0,003 |
Tabla 4: Análisis ampliado de ablación cuantitativa de los componentes principales. La tabla informa sobre la integración acumulativa de módulos, combinaciones de módulos por pares y ajustes de eliminación de componentes para cuantificar las contribuciones independientes y cooperativas de la atención cruzada guiada por estructuras, el sesgo de campo por distancia con signo, el ponderado estructural adaptativo, el razonamiento de grafos superpíxeles, la construcción de aristas coplanares, la normalización simétrica de grafos y la pérdida de consistencia estructural.
| Arquitectura del modelo de red | Parámetros | FLOPs | Memoria máxima | Tiempo de entrenamiento | Tiempo de inferencia | FPS | mIoU | Límite F1 |
| SegFormer | 83,7 M | 80.1 G | 6,1 GB | 10.6 h | 44 ms | 22.7 | 0.596 | 0.635 |
| ConvNeXt UperNet | 60,2 M | 91,5 G | 6,4 GB | 11.2 h | 47 ms | 21.3 | 0.604 | 0.642 |
| Mask2Former | 44,0 M | 74,6 G | 5,8 GB | 9,4 h | 41 ms | 24.4 | 0.612 | 0.654 |
| OneFormer | 64,1 M | 103,2 G | 7,0 GB | 12.9 h | 55 ms | 18.2 | 0.621 | 0.663 |
| MaskDINO | 52,8 M | 96,8 G | 6,8 GB | 12.1 h | 52 ms | 19.2 | 0.628 | 0.667 |
| CCANet | 63,5 M | 118,7 G | 7,6 GB | 14,8 h | 67 ms | 14.9 | 0.635 | 0.671 |
| InternImage UperNet | 70,4 M | 112,3 G | 7,4 GB | 14,2 h | 64 ms | 15.6 | 0.641 | 0.692 |
| CMPFFNet | 58,9 M | 104,6 G | 7,1 GB | 13.1 h | 59 ms | 16.9 | 0.658 | 0.712 |
| SGCA_GCN | 66,8 M | 121,4 G | 7,9 GB | 15,6 h | 61 ms | 16.4 | 0.687 | 0.764 |
Tabla 5: Complejidad computacional, tiempo de entrenamiento y comparación de eficiencia de inferencia con la precisión global del conjunto de validación. La tabla informa de parámetros entrenables, operaciones en coma flotante, uso máximo de memoria, tiempo de entrenamiento para 300 épocas, latencia de inferencia de trama única, fotogramas por segundo, mIoU y puntuación Boundary F1 para el método propuesto y las redes de comparación.
| Configuración de la función de pérdida | mIoU | Límite F1 |
| Solo entropía cruzada (EC) | 0.669 | 0.721 |
| CE + Frontera a.C. | 0.674 | 0.738 |
| CE + Pérdida en forma inversa | 0.681 | 0.752 |
| CE + Nuestros SCL | 0.687 | 0.764 |
Tabla 6: Comparación cuantitativa de la validación de la función de pérdida. La tabla informa de la puntuación mIoU y F1 de frontera bajo pérdida de entropía cruzada, pérdida binaria binaria cruzada de entropía, pérdida por transformación inversa y la pérdida propuesta de consistencia estructural.
| Arquitectura de modelos algorítmicos | Oclusión leve | Oclusión moderada | Oclusión severa | Conjunto de anomalías que no son de Manhattan | Subconjunto de interferencia de texturas |
| (mIoU) | (mIoU) | (mIoU) | (mIoU) | (mIoU) |
| Mask2Former | 0.685 | 0.612 | 0.421 | 0.584 | 0.553 |
| CCANet | 0.698 | 0.635 | 0.463 | 0.612 | 0.566 |
| CMPFFNet | 0.715 | 0.658 | 0.512 | 0.635 | 0.602 |
| SGCA_GCN | 0.732 | 0.687 | 0.645 | 0.628 | 0.649 |
Tabla 7: Análisis de robustez específico por subconjunto de la distribución extrema de oclusión y estructuras no Manhattan. La tabla informa de cambios en la precisión del análisis analizable entre los subconjuntos de oclusión leve, oclusión moderada, oclusión severa, iluminación desafiante, interferencia de texturas y no anomalías de Manhattan.
| Número de nodos superscale | mIoU | FronteraF1 | Tiempo medio de inferencia (ms) |
| 64 | 0.641 | 0.695 | 45 |
| 128 | 0.665 | 0.732 | 52 |
| 256 | 0.687 | 0.764 | 61 |
| 512 | 0.678 | 0.751 | 95 |
| 1024 | 0.662 | 0.735 | 185 |
Tabla 8: Análisis de sensibilidad espacial de la escala de particiones de nodos en grafo topológico. La tabla informa del mIoU, la puntuación F1 del límite estructural y el tiempo medio de inferencia entre diferentes configuraciones de particiones de nodos superpíxeles.