Se prepararon conjuntos de datos de escenas RGB interiores y sus anotaciones semánticas antes del entrenamiento en red. El conjunto de datos 3D para interiores a gran escala y el conjunto de datos de escenas interiores RGB-D (véase la Tabla de Materiales) se obtuvieron de sus repositorios oficiales. Se conservaron las escenas de adquisición interiores que contenían oclusión de mobiliario, variación de iluminación, interrupción de límites de muros y complejos diseños espaciales para coincidir con el escenario de análisis objetivo. Las etiquetas semánticas se convirtieron en máscaras de anotación PNG de canal único indexadas, y todas las imágenes RGB y máscaras semánticas se redimensionaron a 512 × 512 píxeles. Durante el entrenamiento se aplicó aumento de datos en línea, con giros horizontales aleatorios con probabilidad de 0,5, escalado aleatorio de brillo entre 0,8 y 1,2, y rotación aleatoria entre −10° y +10° para ampliar la distribución estructural. Los canales RGB se normalizaron con valores medios de 0,485, 0,456 y 0,406 y valores de desviación estándar de 0,229, 0,224 y 0,225. La prueba 3D a gran escala en interiores siguió la división oficial de lanzamiento utilizada en este estudio, con 1201 escenas de entrenamiento y 312 escenas de validación para el desarrollo y validación del modelo. El benchmark RGB-D de escenas interiores siguió el protocolo oficial de evaluación, con 795 imágenes de entrenamiento y 654 imágenes de prueba. No se aplicó ninguna división adicional basada en porcentaje a estos dos referentes públicos.
Se inicializó una red de columna vertebral visual jerárquica de transformadores de ventana desplazada (véase la Tabla de Materiales) como la red troncal del codificador de transformadores de ventana móvil. El tamaño de la incrustación del parche estaba configurado como 4 x 4 píxeles. Las dimensiones de incrustación de las cuatro etapas jerárquicas se establecieron en 128, 256, 512 y 1024, y el número de bloques transformadores en las cuatro etapas se fijó en 2, 2, 18 y 2. El tamaño de la ventana de atención local se estableció en 7 x 7, y el número de cabezas de atención en 4, 8, 16 y 32 para las cuatro etapas jerárquicas. Se usaron funciones de activación continua no lineales dentro de todas las capas de perceptrón multicapa. El muestreo espacial se realizó mediante operaciones de fusión de parches con un paso de 2 tras cada etapa jerárquica. La arquitectura de la red central y los hiperparámetros del módulo de inferencia convolucional se resumieron en la Tabla 1.
A continuación, se realizó la extracción de características de autoatención con ventana desplazada en los mapas de características de entrada. Cada mapa de características se dividía en ventanas locales no solapadas con dimensiones espaciales de 7 × 7. La atención regular de ventana y la atención de ventana desplazada se alternaban entre bloques adyacentes de transformadores de ventana desplazada. La distancia de desplazamiento cíclico se estableció en 3 píxeles y se aplicó codificación de sesgo posicional relativo dentro de cada ventana de atención local. Las características visuales locales se agregaron mediante autoatención multi-cabeza para generar representaciones jerárquicas y a escala múltiple.
Los previos estructurales de Manhattan se extrajeron de imágenes RGB interiores. Los segmentos estructurales de los bordes se detectaron mediante un algoritmo de detección de segmentos de línea de gradiente-dirección-consistencia. Las direcciones estructurales dominantes se agruparon mediante un algoritmo de consenso aleatorio de muestra (RANSAC) (véase la Tabla de Materiales) basado en la estimación del punto de fuga. Se reconstruyeron tres direcciones Manhattan mutuamente ortogonales para generar la representación Manhattan 3D de la caja delimitadora. El límite estructural reconstruido se convirtió en un mapa SDF calculando la distancia euclidiana mínima desde cada píxel hasta el segmento de línea límite más cercano.
Se generaron características de atención cruzada guiadas por estructuras después de que se obtuvieran las características visuales y los previos de SDF. La variedad de características visuales se mapeó al tensor de consulta Q a través de la matriz de transformación lineal W subelemento Q de la tapa de doble acuñación R, a la matriz de formación W, subelemento Q de la tapa de doble acuñación R, a la matriz
de formación. El campo de distancias continuas previa se mapeó al tensor clave K y al tensor de valor V a través de las matrices
de transformación , y la dimensión del modelo se estableció en 512. La modulación multi-cabeza dividió el espacio de proyección en 8 subespacios independientes, con cada cabeza con una dimensión de 64. La disposición espacial previa proyectaba coordenadas discretas de píxeles en un campo de potencial continuo y generaba la matriz de afinidad estructural S como un sesgo espacial aditivo explícito para modular la matriz de similitud del producto escalar. El tensor de características visuales se utilizó como fuente de consulta porque el análisis semántico requiere que cada ubicación visual recupere activamente evidencia estructuralmente consistente del espacio geométrico a priori. El prior SDF se utilizó como fuente clave y de valor porque almacena la distancia continua de límite y las pistas estructurales interior-exterior derivadas del diseño Manhattan. El término producto escalar medía la compatibilidad entre la apariencia semántica y el prior geométrico, mientras que el término estructural aditivo λS desplazaba los pesos de atención hacia píxeles en el mismo plano físico o cerca del mismo contorno arquitectónico. El coeficiente λ representaba la confianza en el prior estructural extraído y controlaba hasta qué punto se incorporaban restricciones ortogonales rígidas en la distribución de atención. Esta formulación redujo la difusión transfronteriza causada por la oclusión del mobiliario y mantuvo la relajación adaptativa en diseños no Manhattan. La distribución de la atención guiada por la estructura se calculó según la Ecuación 1.
Ecuación 1: 
donde A denota la matriz de agregación de atención guiada por estructuras, Q denota el tensor de consulta generado a partir de características visuales, K denota el tensor clave generado a partir de características previas SDF, V denota el tensor de valores generado a partir de representaciones a priori estructurales, dk denota la dimensión de características del tensor clave, λ denota el coeficiente de ponderación estructural adaptativo utilizado para identificar la confianza geométrica de regiones locales y relajar restricciones ortogonales rígidas en espacios no Manhattan y S denota la matriz de afinidad SDF. La división por dk estabilizó la escala de los logits de atención y evitó que las grandes dimensiones de las características produjeran pesos de atención sobreconcentrados. La función exponencial normalizada (véase la Tabla de Materiales) transformaba las puntuaciones de similitud moduladas en una distribución espacial normalizada, permitiendo que cada píxel agregara información estructural previa basada en la consistencia semántica y geométrica. Este diseño explica por qué la apariencia visual y los priors de límite arquitectónico se fusionan a nivel de atención en lugar de por concatenación directa de características.
El grafo de topología de superpíxeles se construyó a partir del mapa de características alineado con la estructura. El mapa de características se segmentó utilizando un algoritmo de generación de regiones espaciales. El número de superpíxeles se estableció en 256, el coeficiente de compacidad en 10, el coeficiente de suavizado gaussiano en 1,0 y el número de iteración en 10. Las restricciones de proximidad espacial se impusieron estableciendo el peso métrico de distancia a una relación constante de 1,0 respecto a la distancia entre el espacio de color de características durante el agrupamiento, manteniendo así una generación uniforme de nodos a través de límites de denso desorden. Los píxeles con respuestas semánticas homogéneas se agregaron en nodos superpíxeles. Las aristas de grafos se construyeron según relaciones de adyacencia espacial, fuerza de afinidad SDF y restricciones de consistencia geométrica coplanar. El proceso de construcción de la matriz de afinidad estructural y la conectividad topológica se muestra en la Figura 3, que muestra cómo la guía SDF se transformó en relaciones espaciales a nivel de grafo.
La formulación de grafos se introdujo para convertir el razonamiento denso píxel a píxel en razonamiento espacial nodo a nodo sobre regiones estructurales homogéneas. Cada nodo superpíxel representaba una región local con respuesta semántica y continuidad espacial similares, mientras que cada arista representaba un camino fiable para la transmisión de características sujeto a las restricciones de adyacencia, afinidad de campo de distancia y consistencia coplanar. Este diseño redujo la influencia de píxeles aislados y ruidosos y permitió que regiones ocluidas de paredes, suelos y techos recibieran mensajes de nodos físicamente adyacentes. Por tanto, la construcción de aristas servía como un puente matemático entre la guía SDF continua y el razonamiento discreto de grafos no euclidianos.
Se configuró una red de razonamiento convolucional de grafos de tres capas con dimensiones ocultas de características 512, 256 y 128. La capa convolucional de grafos realizaba suavizado de características sobre la estructura del grafo basado en las relaciones espaciales de los nodos. La adyacencia de auto-bucle mantuvo el estado original de cada nodo durante el paso de mensajes, evitando que las características de una pequeña región estructural fueran borradas por las grandes regiones circundantes. La normalización simétrica escaló los elementos de la matriz de adyacencia mediante el producto de las raíces cuadradas inversas de los grados de los nodos, de modo que nodos de alto y bajo grado contribuyeron bajo magnitudes numéricas comparables durante la propagación. La propagación por avance de avance realizó una agregación espacial localizada, en la que cada estado de nodo absorbió características de alta dimensión de grupos coplanares adyacentes antes de aplicar la función de rectificación no lineal elemento por elemento. Esta formulación hacía que la capa de convolución de grafos aproximara la difusión semántica a lo largo de planos interiores físicamente significativos en lugar de suavizar sin restricciones los límites de objetos no relacionados. Las características de los nodos del grafo se evaluaron según la Ecuación 2.
Ecuación 2: 
La proyección desde características densas de píxeles hasta nodos superpíxeles, el paso de mensajes de convolución de grafos y la retroproyección de coordenadas se presentan en la Figura 4, aclarando el camino de agregación de características desde cuadrículas de imagen regulares hasta una topología no euclidiana y de vuelta a una representación semántica densa. La proyección desde características densas de píxeles en la Figura 4A a nodos superpíxeles en la Figura 4B, el paso de mensajes de convolución de grafo en la Figura 4C y la retroproyección de coordenadas en la Figura 4D aclaran el camino de agregación de características desde las cuadrículas de imagen regulares hasta una topología no euclidiana y de nuevo a una representación semántica densa.
donde H(l) denota el tensor de características del nodo de la capa de convolución del grafo l-ésimo, Â denota la matriz de adyacencia con conexiones de auto-lazo, D denota la matriz de grados correspondiente a la matriz de adyacencia, W(l) denota la matriz de pesos aprendible de la capa de convolución del grafo l-ésimo, y σ denota la función de activación de la Unidad Lineal Rectificada. El término ÂH(l) agregaba características de nodos superpíxeles adyacentes, mientras que D−1/2 y D−1/2 equilibraban la contribución de nodos con diferentes densidades de conexión. La matriz aprendible W(l) proyectaba características agregadas en un nuevo espacio semántico, permitiendo que la capa de grafos distinga la consistencia estructural de la cercanía espacial ordinaria. La activación no lineal preservó la diferencia en las respuestas entre regiones coplanares y no coplanares tras la agregación de características.
Las características de segmentación semántica se decodificaban tras el razonamiento de grafos. El decodificador se construyó utilizando tres etapas de upsampling bilineal de interpolación y operaciones de fusión de conexión por salto entre capas. Las características superficiales del codificador espacial se concatenaron con características semánticas de alto nivel mediante fusión canal a canal. La resolución de las características se restauró al tamaño original de la imagen, y el mapa final de predicción semántica de probabilidad se generó mediante una capa de convolución 1 × 1.
La red completa de análisis semántico se entrenó usando un optimizador de desintegración de pesos desacoplado (véase la Tabla de Materiales). La tasa de aprendizaje inicial se estableció en 0,0001, el coeficiente de decaimiento en peso en 0,01 y el tamaño del lote en 8 para ambos benchmarks públicos. La tasa de decaimiento del primer momento se estableció en 0,9, la tasa de decaimiento del segundo momento en 0,999 y el coeficiente numérico de estabilidad épsilon en 1 × 10⁻8. La pérdida de validación se monitorizaba al final de cada época, y los puntos de control se guardaban cuando aumentaba el mIoU en el conjunto de validación. La red fue entrenada durante 300 épocas utilizando una estrategia de decaimiento de la tasa de aprendizaje polinómica con una potencia de decaimiento de 0,9. Se realizaron cinco entrenamientos independientes utilizando diferentes inicializaciones de semillas aleatorias para establecer una línea base de evaluación estadísticamente rigurosa. La red se optimizó conjuntamente mediante pérdida de entropía cruzada a nivel de píxel y pérdida de consistencia estructural. Todos los experimentos se realizaron en una plataforma informática equipada con hardware de computación paralela de alta memoria, y la información detallada del hardware se reportó en la Tabla de Materiales.
La optimización conjunta imponía la alineación geométrica de los límites calculando la magnitud del gradiente espacial del tensor de probabilidad de clase. La pérdida de consistencia estructural se utilizó como regularizador, multiplicando la norma de los gradientes de predicción espacial por los valores continuos de SDF. La lógica matemática era que los cambios semánticos de categorías debían concentrarse cerca de los contornos arquitectónicos reales, donde la SDF se aproximaba a cero, mientras que los interiores planos de paredes, suelos y techos debían mantener respuestas semánticas suaves. Cuando un gran gradiente de predicción aparecía lejos de un límite estructural, el término del campo de distancia aumentaba la penalización y desalentaba las transiciones semánticas falsas dentro de un plano físico homogéneo. Cuando aparecía un gradiente de predicción cerca de un contorno de distancia cero, la penalización seguía siendo limitada y preservaba transiciones legítimas de clase a lo largo de los límites arquitectónicos. Las regiones de transición semántica se restringieron a alinearse con los contornos de distancia cero de la SDF, según la Ecuación 3.
Ecuación 3: 
donde Ltotal denota la función objetivo de optimización final, Lce denota la pérdida cruzada de entropía a nivel de píxel, Lscl denota la pérdida de penalización por consistencia estructural y α denota el coeficiente de ponderación de pérdida estructural. El término de entropía cruzada proporcionaba supervisión semántica a nivel de píxel mediante máscaras de anotación, mientras que el término de consistencia estructural imponía regularización geométrica usando priors arquitectónicos. El coeficiente de ponderación α reconocimiento equilibrado de categorías y alineación de fronteras, evitando que la optimización sobreajuste tanto la precisión local de la etiqueta como los contornos estructurales rígidos. Este objetivo conjunto vinculaba semántica visual, consistencia física de los límites y parámetros de red entreenables dentro de un objetivo de optimización unificado.