$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio utilizó un conjunto de datos público disponible de la plataforma Kaggle (Imágenes de Planta y Sus Detalles, disponible en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; consultado el 16 de abril de 2026). No implicaba participantes humanos, animales ni datos personales identificables; por lo tanto, no se requería la aprobación ética ni el consentimiento informado.
Este protocolo presenta un marco impulsado por IA para el análisis automatizado de imágenes de planos residenciales, con un enfoque en el diseño espacialmente consciente y orientado a la atención sanitaria. El flujo de trabajo experimental completo se presenta en la Figura 1. El protocolo está diseñado para tender puentes entre la predicción de características arquitectónicas de bajo nivel y la toma de decisiones orientada a aplicaciones de alto nivel. Integra DL, modelado conjunto e IA explicable para ofrecer una solución precisa, robusta e interpretable para analizar distribuciones residenciales. El marco consta de múltiples etapas, comenzando con la adquisición y preprocesamiento de datos, seguidas por el aprendizaje de características mediante CNN profundas, la predicción de meta-ensambles y, finalmente, la clasificación a nivel de aplicación. Inicialmente, las imágenes de planos de planta y sus correspondientes atributos arquitectónicos se preprocesan mediante redimensionamiento, normalización y aumento de datos para garantizar la consistencia y mejorar la generalización. Todas las imágenes de planos de planta se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1]. La mejora de datos se aplicó durante el entrenamiento utilizando giros horizontales aleatorios, rotación, zoom y desplazamiento de ancho/altura para mejorar la generalización del modelo y reducir el sobreajuste. No se aplicó ningún giro vertical. Los parámetros completos de ampliación y los detalles de implementación se proporcionan en el Archivo Suplementario 1. Los datos procesados se utilizaron para entrenar múltiples modelos de DL para la extracción y predicción de características. Todos los modelos base y el meta-aprendiz CARE-MIRV-Net se entrenaron usando una configuración consistente, incluyendo aumento de datos, paradas tempranas y programación adaptativa de la tasa de aprendizaje. La parada temprana monitorizó la pérdida de validación (val_loss) con un valor de paciencia de 5 épocas, y los mejores pesos del modelo se restauraron automáticamente tras el entrenamiento. La planificación adaptativa de la tasa de aprendizaje se implementó mediante la callback ReduceLROnPlateau, que monitorizaba la pérdida de validación y reducía la tasa de aprendizaje en un factor de 0,3 tras 2 épocas sin mejora, con una tasa mínima de aprendizaje de 1 × 10⁻7. Los detalles completos de implementación y la configuración de parámetros se proporcionan en el Archivo Suplementario 1. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20. Se utilizó una semilla aleatoria fija (42) para asegurar la reproducibilidad. Los detalles completos de la implementación se proporcionan en el Archivo Suplementario 1.

Figura 1. Flujo de trabajo del marco CARE-MIRV-Net para el análisis de planos residenciales. Resumen esquemático del protocolo propuesto. El flujo de trabajo incluye (1) adquisición y preprocesamiento de conjuntos de datos, (2) aprendizaje y predicción de características usando MobileNetV2, InceptionV3, ResNet101 y VGG16, (3) predicción de metaensambles basada en apilamiento usando CARE-MIRV-Net, (4) clasificación de layout residencial basada en reglas, (5) análisis de interpretabilidad basado en SHapley Additive ExPlanations (SHAP) y (6) evaluación del rendimiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
En la segunda fase, se emplean cuatro CNN preentrenadas, MobileNetV2, InceptionV3, ResNet101 y VGG16, como aprendices base. Cada modelo se ajusta con conocimientos por transferencia para predecir atributos arquitectónicos clave, incluyendo la superficie, el número de dormitorios, baños y garajes. Para cada modelo de aprendizaje por transferencia, las capas inferiores preentrenadas se mantuvieron congeladas, mientras que las capas superiores y la cabeza de regresión personalizada se ajustaron durante el entrenamiento. Las configuraciones detalladas de ajuste fino específicas de cada modelo se proporcionan en el Archivo Suplementario 1. Estos modelos capturan diferentes aspectos de la información espacial: MobileNetV2 proporciona una extracción eficiente de características, InceptionV3 captura patrones espaciales multiescala, ResNet101 aprende representaciones jerárquicas profundas y VGG16 garantiza un aprendizaje de características estable y consistente. La diversidad entre estos modelos mejora la capacidad representacional global del marco.
Para mejorar aún más la precisión y robustez de la predicción, se propone un modelo de meta-conjunto basado en apilamiento, denominado CARE-MIRV-Net. En este paso, las predicciones de todos los modelos base se agrupan para crear un espacio de características de mayor dimensión, que se introduce en un meta-aprendiz. Las predicciones del modelo base se generan primero de forma independiente utilizando los modelos entrenados MobileNetV2, InceptionV3, ResNet101 y VGG16. Estas predicciones se concatenan para formar el vector meta-característica utilizado por el meta-aprendiz. Para evitar fugas de datos, los conjuntos de datos de entrenamiento y pruebas están estrictamente separados, y el meta-aprendiz se entrena únicamente con predicciones generadas a partir de los datos de entrenamiento. El metamodelo, que es una red neuronal totalmente conectada, se entrena para aprender la combinación óptima de salidas del modelo base para producir predicciones refinadas. El meta-modelo consta de dos capas totalmente conectadas con 512 y 256 neuronas usando activación ReLU, seguidas de capas de dropout (0,4 y 0,3) y una capa de salida lineal. El modelo se entrena usando el optimizador Adam (tasa de aprendizaje = 0,0001), un tamaño de lote de 32 y hasta 15 épocas. La parada temprana se implementó monitorizando la pérdida de validación (val_loss) con un valor de paciencia de 5 épocas. El criterio mínimo de mejora (min_delta) se estableció en el valor por defecto de TensorFlow de 0, y los mejores pesos del modelo se restauraron automáticamente tras el entrenamiento. La planificación adaptativa de la tasa de aprendizaje se implementó mediante la callback ReduceLROnPlateau, que monitorizaba la pérdida de validación y reducía la tasa de aprendizaje en un factor de 0,3 tras dos épocas consecutivas sin mejora. La tasa mínima de aprendizaje se estableció en 1 × 10⁻7, y el parámetro de enfriamiento usó el valor predeterminado de TensorFlow de 0. Este método de conjunto reduce los sesgos individuales de los modelos y mejora la generalización gracias a las fortalezas complementarias de múltiples arquitecturas. La información detallada de implementación se proporciona en el Archivo Suplementario 1.
Tras la predicción, se añade una capa de interpretación para convertir las salidas numéricas en decisiones a nivel de aplicación. Las distribuciones residenciales pueden clasificarse en tres clases basándose en las predicciones de características arquitectónicas: atención a personas mayores, integración sanitaria (atención médica) y uso residencial general. Esta clasificación se realiza utilizando reglas de decisión predefinidas basadas en umbrales, basadas en la superficie predicha, el número de dormitorios y el número de baños. La categoría con la puntuación más alta se asigna como clasificación final, mientras que los empates se resuelven seleccionando la categoría que cumple con el mayor número de criterios de decisión. Las reglas completas de puntuación y los umbrales de clasificación se proporcionan en el Archivo Suplementario 2 (Algoritmo 1). Esta acción permite que el marco proporcione información práctica para el diseño de viviendas residenciales.
El marco utiliza IA explicable con SHAP para proporcionar transparencia e interpretabilidad. Este componente examina la contribución de las predicciones de cada modelo base a la salida del metamodelo. El análisis SHAP se realizó utilizando SHAP KernelExplainer (SHAP versión 0.51.0) con 100 muestras de entrenamiento seleccionadas aleatoriamente como conjunto de datos de fondo y 50 muestras de prueba para generación de explicaciones. La configuración completa de SHAP, incluyendo la selección de muestras en segundo plano y la configuración de implementación, se proporciona en el Archivo Suplementario 1. La capa de explicabilidad ayuda a comprender el proceso de toma de decisiones midiendo la importancia de las características y mostrando los patrones de contribución, mejorando así la transparencia y fiabilidad del modelo. El marco propuesto se evalúa utilizando MAE yR2 en todas las variables objetivo. Para la predicción multisalida, el MAE se calculó como la diferencia absoluta media entre los valores reales y predichos en todas las variables objetivo, mientras que R2 se calculó comparando la varianza explicada de las predicciones con los valores de verdad fundamental correspondientes para cada salida. Los análisis cuantitativos y cualitativos indican que el propuesto CARE-MIRV-Net mejora la precisión de la predicción y soporta la clasificación de la distribución residencial basada en reglas. La fiabilidad de la clasificación se evaluó en función de la precisión de las predicciones de regresión subyacentes y la consistencia de la capa de decisión basada en reglas. El marco es una solución adecuada y escalable para el análisis inteligente de planos de planta y puede aplicarse a viviendas inteligentes, planificación de cuidados a personas mayores y diseño residencial orientado a la atención sanitaria. Una lista completa de conjuntos de datos, paquetes de software, bibliotecas, recursos hardware y herramientas computacionales utilizados en este estudio se proporciona en la Tabla de Materiales. El código fuente, la información de configuración del entorno, las especificaciones de dependencia de software y los scripts de implementación necesarios para reproducir el flujo de trabajo reportado se proporcionan en el Archivo Suplementario 1.
Algoritmo para el protocolo
El marco propuesto adopta un enfoque multietapa para procesar planos de plantas basados en imágenes de viviendas residenciales y producir resultados predictivos y a nivel de decisión, como se muestra en el Algoritmo 1 en el Archivo Suplementario 2. Este proceso comienza con el preprocesamiento de datos, en el que las imágenes de entrada se redimensionan a una resolución estándar y se normalizan para proporcionar uniformidad en todo el conjunto de datos. Todas las imágenes de planos de planta se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1]. Este paso optimiza las imágenes para el aprendizaje mediante redes neuronales profundas y mejora la convergencia global del modelo. La segunda fase implica el uso de varios modelos DL como aprendices base, incluyendo MobileNetV2, InceptionV3, ResNet101 y VGG16. De forma independiente, cada modelo toma las imágenes de entrada y estima características arquitectónicas importantes como la superficie y el número de dormitorios, baños y garajes. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20, y se utilizó una semilla aleatoria fija para asegurar la reproducibilidad. Estos modelos capturan diferentes propiedades espaciales de los planos de planta y proporcionan predicciones complementarias. La representación de características se construye apilando las salidas de cada modelo base para crear una única representación de características. Esta salida conjunta se introduce posteriormente en un modelo meta-ensamble, CARE-MIRV-Net, que se entrena para combinar las predicciones de todos los modelos base. Las predicciones del modelo base se generaban de forma independiente y se concatenaban para formar el vector meta-característica. Se evitó la fuga de datos mediante la estricta separación de los conjuntos de datos de entrenamiento y prueba. El metamodelo refina estas predicciones y produce las previsiones finales de atributos arquitectónicos. El metamodelo consistía en capas totalmente conectadas con 512 y 256 neuronas, funciones de activación de ReLU, tasas de abandono de 0,4 y 0,3, el optimizador Adam (tasa de aprendizaje = 0,0001), un tamaño de lote de 32 y hasta 15 épocas de entrenamiento con detención temprana. Tras la predicción, se utiliza una capa de decisión para contextualizar los resultados. Según los valores estimados, cada distribución residencial se clasifica como cuidado de personas mayores, atención médica o uso residencial general. Las categorías residenciales se asignaron utilizando reglas de puntuación basadas en umbrales predefinidas derivadas de los atributos predichos del plano de planta. La categoría con la puntuación más alta se seleccionaba como clasificación final. Los umbrales completos de clasificación y las reglas de decisión se proporcionan en el Algoritmo 1 (Archivo Suplementario 2). Por último, el marco incorpora un componente de explicabilidad basado en SHAP para evaluar el impacto de cada modelo base en la predicción final. El análisis SHAP se realizó tal como se describió previamente y en el Archivo Suplementario 1. Este componente aumenta la transparencia y ayuda a comprender el proceso de toma de decisiones. La efectividad y viabilidad del enfoque propuesto se evaluaron utilizando medidas estándar de regresión de desempeño. El rendimiento se evaluó mediante una única ejecución experimental con una semilla aleatoria fija.
Modelos de evaluación
En esta sección se presentan los modelos DL utilizados en el estudio, incluyendo tanto los modelos base individuales como el propuesto CARE-MIRV-Net. Los modelos de referencia fueron seleccionados para representar arquitecturas DL diversas y ampliamente adoptadas. MobileNetV2 fue incluido como una red ligera y computacionalmente eficiente, y InceptionV3 fue seleccionado por su capacidad para capturar características espaciales multiescala. ResNet101 fue elegido por su capacidad profunda de aprendizaje residual para la extracción jerárquica de características, y VGG16 se incluyó como una arquitectura convolucional bien establecida. Todos los modelos de benchmark se entrenaron utilizando procedimientos de preprocesamiento, ajustes de aumento de datos, particiones de conjuntos de datos, parámetros de optimización, tamaño del lote y configuración de entrenamiento idénticos para garantizar una evaluación comparativa justa.
MobileNetV2:
MobileNetV2 es un sistema CNN pequeño y compacto diseñado para ser rápido, de alto rendimiento y con menos complejidad computacional. Presenta algunas de las principales innovaciones como conexiones residuales invertidas y cuellos de botella lineales, que facilitan la extracción eficiente de características y mantienen un alto poder representativo. MobileNetV2 puede usar convoluciones separables en profundidad para minimizar considerablemente el número total de parámetros y el coste computacional de las redes convolucionales tradicionales, por lo que está bien adaptado a grandes problemas de aprendizaje basados en imágenes.
MobileNetV2 se utiliza en el marco sugerido como uno de los modelos base de DL para predecir los atributos arquitectónicos de las imágenes de planos residenciales. El modelo es capaz de aprender patrones espaciales como la distribución de las habitaciones, la densidad de la distribución y la organización estructural que ocurren en los planos de planta de forma eficaz gracias a su diseño eficiente. Estas representaciones eruditas desempeñan un papel importante a la hora de estimar con precisión características importantes como la superficie, el número de dormitorios, baños y garajes. MobileNetV2 es un modelo ligero, que es un buen candidato para ser incluido en el marco propuesto de meta-ensambles. Añade algunas representaciones complementarias de características a otros modelos DL y mejora la robustez y generalización general del sistema. Este aprendizaje de modelos es muy importante para mejorar la precisión de las predicciones y para ayudar en la clasificación de diseños residenciales basados en la atención sanitaria.
El modelo MobileNetV2 se entrena utilizando una estrategia de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a un tamaño fijo de 224 × 224 × 3, lo cual es compatible con la arquitectura. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se elimina la cabeza de clasificación inicial de MobileNetV2 y se sustituye por una cabeza de regresión. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Para facilitar la adaptación al dominio, las capas inferiores preentrenadas se congelaron, mientras que las capas superiores que comenzan en block_13_expand y la cabeza de regresión personalizada fueron ajustadas finamente. Este enfoque selectivo de entrenamiento permite al modelo conservar características visuales generales mientras aprende atributos espaciales específicos de las imágenes de planos de planta. Los mapas de características extraídos se procesan a través de una capa de Global Average Pooling y capas totalmente conectadas con 512 y 256 neuronas mediante activación ReLU. Para mejorar la generalización y reducir el sobreajuste, se incorporan capas de normalización por lotes y de dropout (0,4 y 0,3). La capa final de salida contiene cuatro neuronas con activación lineal correspondientes a los atributos arquitectónicos predichos. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001 y parámetros por defecto TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas. Se aplicó una parada temprana basada en la pérdida de validación, y se empleó la reducción adaptativa de la tasa de aprendizaje para mejorar la convergencia. El entrenamiento se realizó hasta 15 épocas.
InceptionV3:
InceptionV3 es una arquitectura CNN profunda capaz de capturar características multiescala mediante el uso de operaciones convolucionales paralelas. Se basa en el módulo Inception, que utiliza una variedad de tamaños de filtro en la misma capa para extraer características de grano fino y grueso al mismo tiempo. Este tipo de diseño arquitectónico permite que la red aprenda jerarquías espaciales complejas y sea eficiente computacionalmente. Además, InceptionV3 utiliza convoluciones factorizadas y reducción de dimensionalidad, que mejoran el rendimiento y minimizan el coste computacional.
InceptionV3 se aplica en el marco propuesto como un extractor eficaz de características para analizar imágenes de planos residenciales. Los planos de planta consisten en una variedad de patrones espaciales, como tamaños de habitaciones, planos estructurales y conectividad, lo que requiere aprendizaje de características a múltiples escalas. La arquitectura Inception es especialmente adecuada para esta tarea porque es capaz de representar al mismo tiempo aspectos locales específicos (por ejemplo, habitaciones pequeñas) y estructuras globales (por ejemplo, la organización de la disposición general). InceptionV3 ofrece representaciones complementarias a otros modelos como MobileNetV2 en el contexto del marco meta-ensemble. La diversidad de predicciones aumenta gracias a su capacidad para modelar relaciones espaciales complejas, lo que es importante para mejorar el rendimiento del conjunto. Esto ayuda finalmente a predicir mejor las características arquitectónicas y refuerza la clasificación posterior de un diseño de viviendas amigables con personas mayores e integradas en la atención sanitaria.
El modelo InceptionV3 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3 para garantizar la compatibilidad con la arquitectura de red y la consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares.
Se eliminan las capas originales de clasificación de InceptionV3 y se introduce una cabeza de regresión personalizada para permitir la predicción multioutput. La cabeza de regresión personalizada consistía en una capa de Global Average Pooling seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. La base convolucional está parcialmente ajustada, con las capas inferiores preentrenadas congeladas y las capas superiores, junto con la cabeza de regresión personalizada, ajustadas para aprender características específicas del plano de planta de dominio mientras se conservan representaciones visuales generales adquiridas durante el preentrenamiento. Tras la columna vertebral convolucional, una capa de Global Average Pooling transforma los mapas de características en una representación compacta de características. A esto le siguen capas totalmente conectadas que contienen 512 y 256 neuronas con funciones de activación de ReLU. Para minimizar el sobreajuste y mejorar la generalización, se aplican tasas de dropout de 0,4 y 0,3. La capa final de salida consta de cuatro neuronas con activación lineal que corresponde a la predicción de metros cuadrados, número de dormitorios, baños y número de garajes. El modelo se entrena utilizando el optimizador Adam con una tasa de aprendizaje de 0,0001, un tamaño de lote de 32 y hasta 15 épocas de entrenamiento con paradas tempranas y reducción adaptativa de la tasa de aprendizaje para asegurar una convergencia estable.
ResNet101:
ResNet101 es una estructura profunda de la CNN construida sobre el principio del aprendizaje residual que permite entrenar redes extremadamente profundas superando el problema del gradiente nulo. Añade conexiones residuales, o llamadas conexiones de salto, que permiten a la red aprender mapeos de identidad y retener información entre capas. Esta arquitectura mejora enormemente la estabilidad del entrenamiento y permite al modelo aprender características jerárquicas complejas. ResNet101 tiene una gran capacidad representacional de 101 capas y, por tanto, es muy eficaz en tareas que requieren características espaciales adicionales.
ResNet101 se utilizará en el marco propuesto como extractor de características de alta capacidad, que analizará las imágenes de planos residenciales. El modelo puede utilizarse para representar relaciones espaciales complejas, incluyendo conectividad de salas, complejidad de distribución y variaciones estructurales, debido a su arquitectura profunda. Estas características son fundamentales para hacer predicciones precisas sobre elementos arquitectónicos como metros cuadrados, dormitorios, baños y garajes. En el diseño del meta-ensemble, ResNet101 es un componente importante y proporciona representaciones profundas y abstractas de características. ResNet101 se preocupa más por las características estructurales de grano fino y, por tanto, es más diverso entre los aprendices base en comparación con modelos ligeros como MobileNetV2. Esta heterogeneidad juega un papel esencial en mejorar el rendimiento de un conjunto y predicciones sólidas, especialmente cuando se trata de la clasificación residencial basada en el sector sanitario.
ResNet101 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3, lo que garantiza compatibilidad arquitectónica y consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se elimina el cabezal de clasificación original de ResNet101 (include_top=Falso), y se introduce un cabezal de regresión personalizado para permitir la predicción multisalida. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Para equilibrar la reutilización de características y la adaptación del dominio, las capas preentrenadas inferiores se congelaron, mientras que las capas más profundas que partían de conv4_block1_1_conv y la cabeza de regresión personalizada fueron ajustadas finamente. Esta estrategia de entrenamiento selectivo permite al modelo conservar características visuales genéricas mientras adapta representaciones de nivel superior a imágenes de planos de planta. La salida de la base convolucional se pasa a través de una capa de Agrupación de Promedios Globales para generar una representación compacta de características. A esto le siguen capas totalmente conectadas con 512 y 256 neuronas que utilizan funciones de activación de ReLU. La normalización por lotes se aplica para estabilizar el aprendizaje, y se incorporan capas de dropout con tasas de 0,4 y 0,3 para reducir el sobreajuste y mejorar la generalización. La capa final de salida contiene cuatro neuronas con activación lineal correspondiente a la superficie, número de dormitorios, baños y garajes. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001, como se describe en la configuración de entrenamiento. La ampliación de datos incluía volteos aleatorios, rotación, zoom y desplazamiento para mejorar la generalización del modelo. El entrenamiento se realizó hasta 15 épocas, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativo.
VGG16:
VGG16 es una arquitectura de red neuronal sencilla de tipo convolucional profundo que es eficaz y sencilla en tareas de reconocimiento visual. Está compuesto por 16 capas con un diseño regular u homogéneo que incorpora pequeños filtros convolucionales de 3 × 3, que facilitan el aprendizaje de representaciones jerárquicas de características por parte de la red. La arquitectura es profunda y sencilla, lo que significa que es capaz de capturar detalles de bajo nivel como bordes, texturas y estructuras semánticas de alto nivel. VGG16, con su diseño habitual y buen rendimiento, es ahora una opción popular de backbone cuando realiza aprendizaje por transferencia en tareas relacionadas con imágenes.
En el modelo sugerido, VGG16 se utiliza como modelo base de DL para derivar características espaciales de imágenes de planos residenciales. El hecho de que esté organizado le permite ser muy útil para captar los detalles más finos de los patrones de distribución, como los límites de las habitaciones, las alineaciones estructurales y la organización espacial. Estas características son fundamentales para predecir eficazmente los atributos de la arquitectura como los pies cuadrados, dormitorios, baños y garajes. En el sistema meta-ensemble, VGG16 proporciona representaciones de características estables y bien generalizadas. VGG16 ofrece un enfoque de extracción de características más equilibrado en comparación con arquitecturas más profundas, como ResNet101, y arquitecturas multiescala, como InceptionV3, aumentando la diversidad base del aprendizaje. Esta heterogeneidad es fundamental para mejorar el rendimiento del conjunto y las previsiones fiables de la clasificación residencial orientada a la atención sanitaria.
El modelo VGG16 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3 para garantizar compatibilidad con la arquitectura y la consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se eliminan las capas de clasificación originales (include_top=Falso), y se añade una cabeza de regresión personalizada para adaptar el modelo a la predicción multioutput. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Las capas inferiores preentrenadas estaban congeladas, mientras que las capas que partían de block4_conv1 y la cabeza de regresión personalizada estaban ajustadas finamente. Esta estrategia permite al modelo conservar características visuales generales mientras aprende representaciones específicas de dominio relevantes para el análisis de plantas. Las características de salida de la base convolucional se pasan por una capa de Agrupación de Promedios Globales para generar un vector de características compacto. A esto le siguen capas totalmente conectadas con 512 y 256 neuronas que utilizan funciones de activación de ReLU. Se incorporan capas de normalización por lotes y de dropout con tasas de 0,4 y 0,3 para estabilizar el entrenamiento, reducir el sobreajuste y mejorar la generalización. La capa final de salida contiene cuatro neuronas con activación lineal correspondiente a la superficie, número de dormitorios, baños y predicciones de garaje. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001, como se describe en la configuración de entrenamiento. La ampliación de datos incluía volteos aleatorios, rotación, zoom y desplazamiento para mejorar la generalización del modelo. El entrenamiento se realizó hasta 15 épocas, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativo.
CARE-MIRV-Net (Modelo Propuesto de Lanzamiento de Meta-Ensamble):
El CARE-MIRV-Net sugerido (Context-Aware Residential Ensemble utilizando MobileNetV2, InceptionV3, ResNet101 y VGG16 Network) es un marco DL basado en meta-ensambles apilados que tiene como objetivo mejorar la estimación de características arquitectónicas basándose en imágenes de planos residenciales. La arquitectura combina diversas CNN heterogéneas explotando sus ventajas sinérgicas en la extracción de características. El modelo propuesto se basa en la combinación de arquitectura ligera, profunda y multiescala que mejora el rendimiento predictivo y proporciona robustez en una amplia variedad de distribuciones residenciales. A diferencia de las técnicas tradicionales basadas en un solo modelo, CARE-MIRV-Net sigue un enfoque jerárquico de aprendizaje, donde los modelos base proporcionan predicciones iniciales, que luego son mejoradas por un meta-aprendiz.
Cuando se trata de un diseño residencial que sea espacialmente consciente y respetuoso de la salud, la correcta interpretación de la distribución de los planos es de suma importancia. Los modelos DL individuales tienden a ser insuficientes para generalizar diferentes patrones arquitectónicos. El marco propuesto superará esta debilidad utilizando cuatro arquitecturas diferentes: MobileNetV2, InceptionV3, ResNet101 y VGG16, que aportan diferentes capacidades representacionales propias. MobileNetV2 puede usarse para extraer características de forma eficiente y es ligero; InceptionV3 aprende patrones espaciales a través de múltiples escalas; ResNet101 aprende representaciones jerárquicas profundas; y VGG16 aprende características de forma consistente y fiable. Una combinación de estos modelos facilita que el marco abarque tanto los atributos espaciales locales como globales, lo que mejora la precisión y fiabilidad de las características previstas como la superficie, el número de dormitorios, baños y garajes. Las predicciones anteriores también pueden utilizarse para predecir una clasificación adicional de las distribuciones residenciales, incluyendo opciones amigables para personas mayores, integradas en la atención sanitaria y residenciales generales.
CARE-MIRV-Net se implementa utilizando una estrategia de ensamble basada en apilamiento en dos etapas. En la primera etapa, los cuatro modelos base generan predicciones de forma independiente para las variables objetivo. Las entradas del meta-aprendiz se generaban concatenando las salidas de predicción producidas por los modelos base entrenados sobre los datos de entrenamiento. Estas predicciones concatenadas formaron los vectores meta-características de 16 dimensiones usados para el entrenamiento de metamodelos. Se evitó la fuga de información mediante la estricta separación de los conjuntos de datos de entrenamiento y prueba, y no se utilizaron muestras de prueba ni durante el entrenamiento en modelos base ni en metamodelos. Durante el proceso de apilamiento se emplearon los mismos conjuntos de datos de entrenamiento y validación utilizados para los modelos base. Durante el entrenamiento y la inferencia, el vector meta-característica de 16 dimensiones se construyó concatenando las cuatro salidas de predicción generadas por MobileNetV2, InceptionV3, ResNet101 y VGG16. Dado que cada modelo genera un vector de salida de cuatro dimensiones, la representación concatenada produce una entrada de 16 dimensiones para el meta-aprendiz. Esta transformación combina las predicciones de todos los modelos base y sirve como entrada a la segunda etapa del marco. La segunda etapa consiste en construir un meta-aprendiz de red neuronal completamente conectada para aprender la combinación óptima de predicciones del modelo base. El meta-aprendiz consistía en capas totalmente conectadas con 512 y 256 neuronas, activación de ReLU, normalización por lotes, tasas de abandono de 0,4 y 0,3, y una capa lineal de salida de cuatro neuronas. Las capas de dropout con tasas de 0,4 y 0,3 se aplicaron después de las capas densas para reducir el sobreajuste y mejorar la generalización. El meta-modelo fue entrenado usando el optimizador Adam con una tasa de aprendizaje de 0,0001, un tamaño de lote de 32 y hasta 15 épocas con paradas tempranas y reducción adaptativa de la tasa de aprendizaje. Los datos de validación se utilizaron para monitorizar el rendimiento del modelo durante el entrenamiento y seleccionar el modelo con mejor rendimiento. Tras el entrenamiento, el modelo meta-conjunto generó predicciones finales combinando los resultados de todos los aprendices base. MAE yR 2 se utilizaron para evaluar el rendimiento de CARE-MIRV-Net. Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas. Los resultados se obtuvieron de una única ejecución experimental utilizando una semilla aleatoria fija. El marco propuesto mejora la capacidad predictiva al combinar varias estructuras DL mediante un mecanismo de apilamiento y proporcionar un análisis interpretable de planos residenciales. Esto hace que CARE-MIRV-Net sea aplicable en el contexto de un diseño residencial centrado en la geriatría y orientado a la atención sanitaria. El código fuente, la información de configuración del entorno, las especificaciones de dependencia de software y la documentación de implementación se proporcionan en el Archivo Suplementario 1.
Evaluación del rendimiento
El análisis del rendimiento del marco propuesto se realiza para determinar su poder predictivo, robustez y rendimiento generalizador a través de diferentes características arquitectónicas. Se realizan análisis cuantitativos y cualitativos para confirmar la utilidad del modelo propuesto. El procedimiento de evaluación implica tanto medidas estándar de regresión como entornos experimentales controlados para permitir una comparación justa con los modelos de referencia. Los experimentos se realizaron utilizando una única ejecución experimental con una semilla aleatoria fija para asegurar la reproducibilidad y consistencia en todos los modelos de referencia y propuestos.
Parámetros de rendimiento:
Se utilizan dos medidas de regresión bien conocidas, MAE y R2, para evaluar el rendimiento del marco propuesto. El MAE mide la magnitud media de los errores de predicción y proporciona una indicación clara de la proximidad entre los valores predichos y los reales. Por el contrario, el valor R2 se utiliza para evaluar la proporción de varianza en las variables objetivo explicadas por el modelo, reflejando su poder predictivo global. Una combinación de estas métricas proporciona una evaluación exhaustiva de la precisión y el rendimiento generalizado de todas las características arquitectónicas predichas. Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas.
Montaje experimental:
Los experimentos se realizaron en un entorno de computación en la nube usando Python (versión 3.12.12). El protocolo propuesto se implementó usando TensorFlow (versión 2.19.0), Keras (versión 3.13.2), NumPy (versión 2.4.6), Pandas (versión 2.3.3), Scikit-learn (versión 1.6.1), Matplotlib (versión 3.9) y SHAP (versión 0.51.0). El entorno computacional utilizaba un procesador Intel Xeon que operaba a 2,20 GHz con aproximadamente 31 GB de memoria del sistema. Los experimentos se realizaron en un sistema operativo Ubuntu 22.04 LTS utilizando GPUs NVIDIA Tesla T4 × 2. El conjunto de datos contiene 2.640 imágenes de planos residenciales que fueron preprocesadas y subdivididas en conjuntos de datos de entrenamiento y prueba. El conjunto de datos se dividió utilizando una proporción de división 80:20, resultando en 2.112 muestras de entrenamiento y 528 muestras de prueba. MobileNetV2, InceptionV3, ResNet101 y VGG16 son cuatro modelos DL que fueron entrenados usando un enfoque de ajuste fino con aprendizaje por transferencia. A continuación, se construyó un modelo meta-conjunto basado en apilamiento, CARE-MIRV-Net, para combinar predicciones de estos modelos base. Cada modelo se entrenó bajo condiciones uniformes, incluyendo redimensionamiento de imagen a 224 × 224 píxeles, aumento de datos y paradas anticipadas para reducir el sobreajuste. La ampliación de datos incluía giros aleatorios, rotación, zoom y desplazamiento. Se utilizó un tamaño de lote de 32 y un máximo de 15 épocas de entrenamiento, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativa. El análisis final se realizó en un conjunto de pruebas oculto para proporcionar una evaluación imparcial y fiable del rendimiento. El conjunto de pruebas oculto se generó durante la partición inicial del conjunto de datos y permaneció completamente aislado durante el entrenamiento y desarrollo del modelo para garantizar una evaluación del rendimiento imparcial.
Descripción del conjunto de datos:
El conjunto de datos utilizado para respaldar los hallazgos de este estudio está disponible públicamente en la plataforma Kaggle con el título "Imágenes de planos de planta y sus detalles"28. El conjunto de datos está disponible en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (consultado el 16 de abril de 2026). Los datos consisten en 2.640 imágenes de planos residenciales y metadatos arquitectónicos organizados. Cada muestra es un plano de vivienda distinto, que ofrece una amplia gama de distribuciones residenciales con diferentes tamaños, configuraciones y disposiciones espaciales. El tamaño del conjunto de datos es suficiente para el entrenamiento basado en DL y contiene una variedad de patrones arquitectónicos. El conjunto de datos consiste en una imagen bidimensional de planta y atributos numéricos relacionados que describen las características estructurales de la residencia. Estas características incluyen la superficie total, el número de dormitorios, el número de baños y el número de garajes. Además, cada registro contiene una ruta de imagen, que permite el mapeo directo de entradas visuales a las etiquetas. Las variables del conjunto de datos incluyen la imagen del plano de planta, la ruta de la imagen, los metros cuadrados, el número de dormitorios, el número de baños y el número de garajes. La imagen del plano de planta sirve como elemento de entrada, mientras que los atributos arquitectónicos se utilizan como objetivos de predicción. Por tanto, el conjunto de datos es adecuado para el aprendizaje supervisado, con imágenes que sirven como características de entrada y atributos arquitectónicos como objetivos de regresión.
El conjunto de datos contiene una amplia variedad de distribuciones residenciales, que van desde diseños compactos con menos habitaciones hasta grandes diseños de varias habitaciones. Esta variabilidad permite el aprendizaje de representaciones espaciales significativas, incluyendo la distribución de las habitaciones, la densidad de la distribución y la complejidad estructural. Esta diversidad es especialmente importante para el marco propuesto, ya que apoya la categorización de los planos en disposiciones residenciales amigables para personas mayores, integradas en atención sanitaria y residenciales generales. Antes del entrenamiento del modelo, el conjunto de datos se procesa mediante una secuencia de procedimientos de preprocesamiento para garantizar la consistencia y compatibilidad con los modelos DL. Todas las imágenes se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1] antes del entrenamiento. El conjunto de datos se organiza emparejando las rutas de imagen con sus metadatos correspondientes, tras lo cual se separa en subconjuntos de entrenamiento y prueba para facilitar el análisis del rendimiento. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20. Los registros que contenían información completa de imágenes y metadatos se incluyeron en el análisis, mientras que los registros incompletos o inválidos se excluyeron. Durante la partición de conjuntos de datos se utilizó una semilla aleatoria fija para garantizar la reproducibilidad. El conjunto de datos proporciona una base detallada para el análisis impulsado por IA de planos residenciales. La combinación de 2.640 imágenes anotadas y diversos atributos arquitectónicos apoya el modelado de regresión multisalida y permite la integración de la inteligencia espacial con la toma de decisiones de diseño residencial orientado a la atención sanitaria.