Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Predicción basada en aprendizaje profundo de atributos de planos residenciales para la evaluación de viviendas orientadas a personas mayores

28 vistas

DOI:

10.3791/72157

31 de julio de 2026

En este artículo

Resumen

Este protocolo describe un flujo de trabajo de aprendizaje profundo meta-conjunto para el análisis automatizado de imágenes de planos residenciales. El procedimiento incluye preprocesamiento de conjuntos de datos, predicción de atributos arquitectónicos utilizando múltiples redes neuronales convolucionales, aprendizaje de conjuntos basado en apilamiento, clasificación residencial basada en reglas y análisis de explicabilidad mediante SHapley Additive ExPlanations para apoyar la evaluación de la distribución residencial.

Resumen

La creciente demanda de soluciones de vivienda inteligente para poblaciones envejecidas ha incrementado la necesidad de métodos automatizados para el análisis de planos residenciales. Los enfoques convencionales de evaluación arquitectónica suelen ser manuales, requieren mucho tiempo y son difíciles de escalar, lo que pone de manifiesto la necesidad de técnicas basadas en inteligencia artificial que puedan interpretar distribuciones espaciales y apoyar la evaluación del diseño residencial. Este protocolo describe un marco de aprendizaje profundo meta-conjunto para el análisis automatizado de imágenes de planos residenciales. El marco propuesto CARE-MIRV-Net integra cuatro redes neuronales convolucionales complementarias—MobileNetV2, InceptionV3, ResNet101 y VGG16—para predecir atributos arquitectónicos, incluyendo metros cuadrados, número de dormitorios, baños y garajes. Las predicciones de los modelos base se combinan mediante un modelo meta-conjunto basado en apilamiento y posteriormente se utilizan dentro de una capa de decisión basada en reglas para categorizar los diseños residenciales como cuidados para personas mayores, atención médica o residencial general. La evaluación experimental demostró un rendimiento predictivo robusto a través de múltiples variables objetivo. El modelo propuesto logró un error absoluto medio (MAE) de 432,48 y un coeficiente de determinación (R2) de 0,7053 para la predicción de metros cuadrados. Para la predicción de baños, el marco alcanzó R2 de 0,7605, mientras que la predicción de garaje mostró la MAE más baja de 0,1697 y la R2 más alta de 0,6958. Los análisis cualitativos demostraron además la capacidad del marco para generar predicciones de atributos arquitectónicos y apoyar la evaluación de distribución residencial orientada a la aplicación. Para mejorar la transparencia y la interpretabilidad, se incorporaron explicaciones aditivas SHapley para cuantificar la contribución de cada modelo base a las predicciones finales. El marco propuesto ofrece un enfoque interpretable y escalable para el análisis de planos de planta residencial y el apoyo a la toma de decisiones.

Introducción

El rápido desarrollo de tecnologías de ciudades inteligentes y entornos de vida inteligentes ha generado una demanda creciente de soluciones automatizadas y basadas en datos en el diseño residencial. En particular, el envejecimiento creciente de la población y la demanda de viviendas orientadas a la atención sanitaria han aumentado la importancia de diseñar espacios residenciales que sean funcionales y adaptados a las necesidades de grupos de usuariosespecíficos 1,2. Los métodos convencionales de análisis de planos arquitectónicos suelen ser manuales, requieren mucho tiempo y dependen de una interpretación experta; por lo tanto, son ineficientes y difíciles de escalar. Esto ha generado una gran necesidad de sistemas inteligentes capaces de analizar automáticamente las distribuciones residenciales y apoyar la toma de decisionesinformadas 3.

Los avances recientes en inteligencia artificial (IA), especialmente en aprendizaje profundo (DL) y visión por ordenador, han mejorado significativamente el análisis de datos basados en imágenes. Las redes neuronales convolucionales (CNN) han demostrado ser muy eficaces para la extracción de características espaciales y el aprendizaje de patrones visuales complejos, lo que las hace adecuadas para el análisis de imágenes en planosde planta 4,5,6. Estos modelos pueden aprender representaciones implícitas de estructuras de salas, organización de la distribución y relaciones espaciales que son esenciales para predecir atributos arquitectónicos 7,8. Sin embargo, la dependencia de un único modelo DL puede limitar la generalización porque diferentes arquitecturas pueden centrarse en características espaciales distintas y mostrar sesgos derivados de la variabilidadarquitectónica 9. A pesar de estos avances, los enfoques existentes a menudo carecen de un marco integrado que combine múltiples modelos, soporte la predicción multisalida y proporcione interpretabilidad a nivel de aplicación. Además, la evaluación y explicabilidad residencial orientada a la atención sanitaria ha recibido una atención relativamente limitada dentro de los sistemas de análisis de planos de planta. La ausencia de estos marcos integrales limita la aplicabilidad práctica y la interpretabilidad, especialmente en ámbitos donde la transparencia y el apoyo a la toma de decisiones sonimportantes 10,11,12.

La IA también ha contribuido de manera sustancial al análisis automatizado y la generación de planos arquitectónicos. Un estudio investigó el uso de aprendizaje automático (ML) para transformar imágenes bidimensionales de planos de planta en modelostridimensionales 13. Los autores destacaron las limitaciones de los métodos convencionales basados en diseño asistido por ordenador (CAD) y subrayaron la importancia de las canaletas escalables basadas en IA para la comprensión espacial. Sus hallazgos demostraron que DL puede extraer eficazmente información estructural de los planos de planta, aunque persisten desafíos relacionados con la generalización y la variabilidad de los datos. Otro estudio propuso un marco de aprendizaje por refuerzo profundo multiagente para la generación automatizada de planosde planta 14. Aunque el enfoque ofrece una considerable flexibilidad y personalización para el diseño arquitectónico, se centra principalmente en la generación de diseño más que en el análisis predictivo de planos existentes.

Una encuesta exhaustiva de recuperación de planos examinó características semánticas, espaciales, basadas en formas y texturas para la comprensión de planos15. La encuesta subrayó la importancia de los modelos DL, incluyendo CNN y arquitecturas basadas en transformadores, para aprender representaciones significativas. Sin embargo, también identificó desafíos relacionados con el ruido, la distorsión y la discriminación de características en diseños complejos. De manera similar, un enfoque basado en aprendizaje automático incorporó relaciones topológicas y visuales para el reconocimiento de planosde planta 8. El estudio demostró que la accesibilidad visual y la conectividad espacial son importantes para entender los diseños arquitectónicos, pero no abordó las estrategias de predicción multisalida ni de aprendizaje en conjunto. La IA generativa también ha sido explorada en aplicaciones arquitectónicas. Una revisión de la IA generativa en arquitectura examinó el uso de redes generativas adversariales (GANs), autocodificadores variacionales (VAEs) y modelos de difusión para la automatizacióndel diseño 16. Los autores destacaron la creciente adopción de herramientas de IA en flujos de trabajo arquitectónicos prácticos. Sin embargo, el enfoque de ese trabajo era la generación de diseño más que la modelización predictiva o aplicaciones de apoyo a la decisión. La IA explicable se ha vuelto cada vez más importante para interpretar modelos DL. Un estudio propuso un marco basado en SHapley Additives ExPlanations (SHAP) para interpretar modelos DL en aplicaciones de simulaciónurbana 17. Los resultados demostraron que SHAP puede identificar características influyentes y mejorar la interpretabilidad tanto a nivel global como local. Aunque el estudio respalda el valor de SHAP en aplicaciones espaciales, no investigó su integración con marcos de aprendizaje en conjunto. Los desarrollos recientes en las arquitecturas DL han mejorado aún más el rendimiento en tareas basadas en imágenes. Un estudio presentó una revisión exhaustiva de los modelos contemporáneos de DL, incluyendo arquitecturas basadas en CNN y entransformadores 18. El estudio destacó la importancia de la selección de modelos y las arquitecturas híbridas para mejorar el rendimiento en generalización. Sin embargo, no abordó específicamente las solicitudes de análisis de planos de planta. Los conjuntos de datos a gran escala también han facilitado avances en el análisis arquitectónico. Por ejemplo, un estudio introdujo un conjunto de datos de referencia que contenía miles de planos complejos19. El estudio demostró que los modelos existentes siguen enfrentando desafíos al analizar distribuciones de grandes y varios apartamentos, lo que pone de manifiesto la necesidad de enfoques más robustos y generalizables.

DL también ha sido estudiada extensamente en el aprendizaje de conjuntos. Un estudio reciente sobre métodos de ensambles profundos indicó que combinar múltiples modelos puede mejorar significativamente la precisión predictiva y la robustez al reducir el sesgo y la varianza20. A pesar de su eficacia, estos métodos no se han aplicado ampliamente al análisis de planos arquitectónicos, especialmente en tareas de regresión multioutput. Además, estudios recientes en análisis automatizado de planos de planta han destacado la importancia de marcos integrados que combinan predicción, clasificación einterpretabilidad 21,22,23. La investigación existente suele centrarse en funciones individuales, como la extracción de características, la generación de maquetas o la clasificación. En consecuencia, persiste una clara carencia en la investigación en el desarrollo de un marco unificado que integre el aprendizaje multimodelo, la evaluación de la distribución residencial y la IA explicable. Aunque se han logrado avances considerables en DL y análisis arquitectónico, persisten varias lagunas en la investigación. La mayoría de los estudios existentes se centran en el reconocimiento de planos de planta, la extracción de características o la generación de layouts sin proporcionar un marco unificado que permita tanto la predicción multisalida como la toma de decisiones a nivel de aplicación. Además, muchos enfoques dependen de un único modelo DL, lo que puede limitar su capacidad para capturar características espaciales diversas e introducir sesgos específicos del modelo. El aprendizaje en conjunto para el análisis de planos de planta sigue siendo relativamente poco explorado, especialmente en lo que respecta a la integración de modelos heterogéneos para mejorar la robustez. Además, se ha prestado poca atención a la clasificación residencial, con énfasis en consideraciones de vivienda orientada a personas mayores y en la interpretabilidad. Dado que muchos modelos DL funcionan como cajas negras, entender la base de sus predicciones sigue siendo un reto. Estas limitaciones ponen de manifiesto la necesidad de un marco integral que integre aprendizaje multimodelo, predicción precisa, clasificación residencial orientada a aplicaciones e IA explicable.

Este estudio presenta un marco automatizado para el análisis de imágenes de planos residenciales, con énfasis en la conciencia espacial y la evaluación de la distribución residencial, para abordar estos desafíos. El marco propuesto introduce un modelo DL meta-ensemble, CARE-MIRV-Net, que integra cuatro CNNs complementarias—MobileNetV2, InceptionV3, ResNet101 y VGG16—dentro de una arquitectura basada enapilamiento 24,25,26,27. Cada modelo predice de forma independiente atributos arquitectónicos clave, incluyendo metros cuadrados, número de dormitorios, baños y garajes. Estas predicciones son posteriormente combinadas por un meta-aprendiz para generar predicciones refinadas. Además, se utiliza una capa de decisión basada en reglas para categorizar los diseños residenciales como atención a personas mayores, atención médica o residencial general basándose en los atributos predichos.

Las contribuciones de este trabajo son las siguientes. Primero, se propone un marco DL de meta-conjunto para la predicción multisalida de atributos arquitectónicos a partir de imágenes de planos residenciales. En segundo lugar, el modelo CARE-MIRV-Net integra cuatro arquitecturas CNN para mejorar la precisión y generalización de las predicciones. En tercer lugar, se incorpora una capa de decisión basada en reglas para soportar la categorización de distribución residencial orientada a aplicaciones basada en atributos arquitectónicos previstos. Cuarto, la IA explicable basada en SHAP está integrada para mejorar la transparencia y la interpretabilidad del modelo. Finalmente, se realizan experimentos extensos para evaluar el marco propuesto utilizando el error absoluto medio (MAE) y el coeficiente de determinación (R2) como métricas de rendimiento.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio utilizó un conjunto de datos público disponible de la plataforma Kaggle (Imágenes de Planta y Sus Detalles, disponible en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; consultado el 16 de abril de 2026). No implicaba participantes humanos, animales ni datos personales identificables; por lo tanto, no se requería la aprobación ética ni el consentimiento informado.

Este protocolo presenta un marco impulsado por IA para el análisis automatizado de imágenes de planos residenciales, con un enfoque en el diseño espacialmente consciente y orientado a la atención sanitaria. El flujo de trabajo experimental completo se presenta en la Figura 1. El protocolo está diseñado para tender puentes entre la predicción de características arquitectónicas de bajo nivel y la toma de decisiones orientada a aplicaciones de alto nivel. Integra DL, modelado conjunto e IA explicable para ofrecer una solución precisa, robusta e interpretable para analizar distribuciones residenciales. El marco consta de múltiples etapas, comenzando con la adquisición y preprocesamiento de datos, seguidas por el aprendizaje de características mediante CNN profundas, la predicción de meta-ensambles y, finalmente, la clasificación a nivel de aplicación. Inicialmente, las imágenes de planos de planta y sus correspondientes atributos arquitectónicos se preprocesan mediante redimensionamiento, normalización y aumento de datos para garantizar la consistencia y mejorar la generalización. Todas las imágenes de planos de planta se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1]. La mejora de datos se aplicó durante el entrenamiento utilizando giros horizontales aleatorios, rotación, zoom y desplazamiento de ancho/altura para mejorar la generalización del modelo y reducir el sobreajuste. No se aplicó ningún giro vertical. Los parámetros completos de ampliación y los detalles de implementación se proporcionan en el Archivo Suplementario 1. Los datos procesados se utilizaron para entrenar múltiples modelos de DL para la extracción y predicción de características. Todos los modelos base y el meta-aprendiz CARE-MIRV-Net se entrenaron usando una configuración consistente, incluyendo aumento de datos, paradas tempranas y programación adaptativa de la tasa de aprendizaje. La parada temprana monitorizó la pérdida de validación (val_loss) con un valor de paciencia de 5 épocas, y los mejores pesos del modelo se restauraron automáticamente tras el entrenamiento. La planificación adaptativa de la tasa de aprendizaje se implementó mediante la callback ReduceLROnPlateau, que monitorizaba la pérdida de validación y reducía la tasa de aprendizaje en un factor de 0,3 tras 2 épocas sin mejora, con una tasa mínima de aprendizaje de 1 × 10⁻7. Los detalles completos de implementación y la configuración de parámetros se proporcionan en el Archivo Suplementario 1. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20. Se utilizó una semilla aleatoria fija (42) para asegurar la reproducibilidad. Los detalles completos de la implementación se proporcionan en el Archivo Suplementario 1.

figure-protocol-1
Figura 1. Flujo de trabajo del marco CARE-MIRV-Net para el análisis de planos residenciales. Resumen esquemático del protocolo propuesto. El flujo de trabajo incluye (1) adquisición y preprocesamiento de conjuntos de datos, (2) aprendizaje y predicción de características usando MobileNetV2, InceptionV3, ResNet101 y VGG16, (3) predicción de metaensambles basada en apilamiento usando CARE-MIRV-Net, (4) clasificación de layout residencial basada en reglas, (5) análisis de interpretabilidad basado en SHapley Additive ExPlanations (SHAP) y (6) evaluación del rendimiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En la segunda fase, se emplean cuatro CNN preentrenadas, MobileNetV2, InceptionV3, ResNet101 y VGG16, como aprendices base. Cada modelo se ajusta con conocimientos por transferencia para predecir atributos arquitectónicos clave, incluyendo la superficie, el número de dormitorios, baños y garajes. Para cada modelo de aprendizaje por transferencia, las capas inferiores preentrenadas se mantuvieron congeladas, mientras que las capas superiores y la cabeza de regresión personalizada se ajustaron durante el entrenamiento. Las configuraciones detalladas de ajuste fino específicas de cada modelo se proporcionan en el Archivo Suplementario 1. Estos modelos capturan diferentes aspectos de la información espacial: MobileNetV2 proporciona una extracción eficiente de características, InceptionV3 captura patrones espaciales multiescala, ResNet101 aprende representaciones jerárquicas profundas y VGG16 garantiza un aprendizaje de características estable y consistente. La diversidad entre estos modelos mejora la capacidad representacional global del marco.

Para mejorar aún más la precisión y robustez de la predicción, se propone un modelo de meta-conjunto basado en apilamiento, denominado CARE-MIRV-Net. En este paso, las predicciones de todos los modelos base se agrupan para crear un espacio de características de mayor dimensión, que se introduce en un meta-aprendiz. Las predicciones del modelo base se generan primero de forma independiente utilizando los modelos entrenados MobileNetV2, InceptionV3, ResNet101 y VGG16. Estas predicciones se concatenan para formar el vector meta-característica utilizado por el meta-aprendiz. Para evitar fugas de datos, los conjuntos de datos de entrenamiento y pruebas están estrictamente separados, y el meta-aprendiz se entrena únicamente con predicciones generadas a partir de los datos de entrenamiento. El metamodelo, que es una red neuronal totalmente conectada, se entrena para aprender la combinación óptima de salidas del modelo base para producir predicciones refinadas. El meta-modelo consta de dos capas totalmente conectadas con 512 y 256 neuronas usando activación ReLU, seguidas de capas de dropout (0,4 y 0,3) y una capa de salida lineal. El modelo se entrena usando el optimizador Adam (tasa de aprendizaje = 0,0001), un tamaño de lote de 32 y hasta 15 épocas. La parada temprana se implementó monitorizando la pérdida de validación (val_loss) con un valor de paciencia de 5 épocas. El criterio mínimo de mejora (min_delta) se estableció en el valor por defecto de TensorFlow de 0, y los mejores pesos del modelo se restauraron automáticamente tras el entrenamiento. La planificación adaptativa de la tasa de aprendizaje se implementó mediante la callback ReduceLROnPlateau, que monitorizaba la pérdida de validación y reducía la tasa de aprendizaje en un factor de 0,3 tras dos épocas consecutivas sin mejora. La tasa mínima de aprendizaje se estableció en 1 × 10⁻7, y el parámetro de enfriamiento usó el valor predeterminado de TensorFlow de 0. Este método de conjunto reduce los sesgos individuales de los modelos y mejora la generalización gracias a las fortalezas complementarias de múltiples arquitecturas. La información detallada de implementación se proporciona en el Archivo Suplementario 1.

Tras la predicción, se añade una capa de interpretación para convertir las salidas numéricas en decisiones a nivel de aplicación. Las distribuciones residenciales pueden clasificarse en tres clases basándose en las predicciones de características arquitectónicas: atención a personas mayores, integración sanitaria (atención médica) y uso residencial general. Esta clasificación se realiza utilizando reglas de decisión predefinidas basadas en umbrales, basadas en la superficie predicha, el número de dormitorios y el número de baños. La categoría con la puntuación más alta se asigna como clasificación final, mientras que los empates se resuelven seleccionando la categoría que cumple con el mayor número de criterios de decisión. Las reglas completas de puntuación y los umbrales de clasificación se proporcionan en el Archivo Suplementario 2 (Algoritmo 1). Esta acción permite que el marco proporcione información práctica para el diseño de viviendas residenciales.

El marco utiliza IA explicable con SHAP para proporcionar transparencia e interpretabilidad. Este componente examina la contribución de las predicciones de cada modelo base a la salida del metamodelo. El análisis SHAP se realizó utilizando SHAP KernelExplainer (SHAP versión 0.51.0) con 100 muestras de entrenamiento seleccionadas aleatoriamente como conjunto de datos de fondo y 50 muestras de prueba para generación de explicaciones. La configuración completa de SHAP, incluyendo la selección de muestras en segundo plano y la configuración de implementación, se proporciona en el Archivo Suplementario 1. La capa de explicabilidad ayuda a comprender el proceso de toma de decisiones midiendo la importancia de las características y mostrando los patrones de contribución, mejorando así la transparencia y fiabilidad del modelo. El marco propuesto se evalúa utilizando MAE yR2 en todas las variables objetivo. Para la predicción multisalida, el MAE se calculó como la diferencia absoluta media entre los valores reales y predichos en todas las variables objetivo, mientras que R2 se calculó comparando la varianza explicada de las predicciones con los valores de verdad fundamental correspondientes para cada salida. Los análisis cuantitativos y cualitativos indican que el propuesto CARE-MIRV-Net mejora la precisión de la predicción y soporta la clasificación de la distribución residencial basada en reglas. La fiabilidad de la clasificación se evaluó en función de la precisión de las predicciones de regresión subyacentes y la consistencia de la capa de decisión basada en reglas. El marco es una solución adecuada y escalable para el análisis inteligente de planos de planta y puede aplicarse a viviendas inteligentes, planificación de cuidados a personas mayores y diseño residencial orientado a la atención sanitaria. Una lista completa de conjuntos de datos, paquetes de software, bibliotecas, recursos hardware y herramientas computacionales utilizados en este estudio se proporciona en la Tabla de Materiales. El código fuente, la información de configuración del entorno, las especificaciones de dependencia de software y los scripts de implementación necesarios para reproducir el flujo de trabajo reportado se proporcionan en el Archivo Suplementario 1.

Algoritmo para el protocolo

El marco propuesto adopta un enfoque multietapa para procesar planos de plantas basados en imágenes de viviendas residenciales y producir resultados predictivos y a nivel de decisión, como se muestra en el Algoritmo 1 en el Archivo Suplementario 2. Este proceso comienza con el preprocesamiento de datos, en el que las imágenes de entrada se redimensionan a una resolución estándar y se normalizan para proporcionar uniformidad en todo el conjunto de datos. Todas las imágenes de planos de planta se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1]. Este paso optimiza las imágenes para el aprendizaje mediante redes neuronales profundas y mejora la convergencia global del modelo. La segunda fase implica el uso de varios modelos DL como aprendices base, incluyendo MobileNetV2, InceptionV3, ResNet101 y VGG16. De forma independiente, cada modelo toma las imágenes de entrada y estima características arquitectónicas importantes como la superficie y el número de dormitorios, baños y garajes. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20, y se utilizó una semilla aleatoria fija para asegurar la reproducibilidad. Estos modelos capturan diferentes propiedades espaciales de los planos de planta y proporcionan predicciones complementarias. La representación de características se construye apilando las salidas de cada modelo base para crear una única representación de características. Esta salida conjunta se introduce posteriormente en un modelo meta-ensamble, CARE-MIRV-Net, que se entrena para combinar las predicciones de todos los modelos base. Las predicciones del modelo base se generaban de forma independiente y se concatenaban para formar el vector meta-característica. Se evitó la fuga de datos mediante la estricta separación de los conjuntos de datos de entrenamiento y prueba. El metamodelo refina estas predicciones y produce las previsiones finales de atributos arquitectónicos. El metamodelo consistía en capas totalmente conectadas con 512 y 256 neuronas, funciones de activación de ReLU, tasas de abandono de 0,4 y 0,3, el optimizador Adam (tasa de aprendizaje = 0,0001), un tamaño de lote de 32 y hasta 15 épocas de entrenamiento con detención temprana. Tras la predicción, se utiliza una capa de decisión para contextualizar los resultados. Según los valores estimados, cada distribución residencial se clasifica como cuidado de personas mayores, atención médica o uso residencial general. Las categorías residenciales se asignaron utilizando reglas de puntuación basadas en umbrales predefinidas derivadas de los atributos predichos del plano de planta. La categoría con la puntuación más alta se seleccionaba como clasificación final. Los umbrales completos de clasificación y las reglas de decisión se proporcionan en el Algoritmo 1 (Archivo Suplementario 2). Por último, el marco incorpora un componente de explicabilidad basado en SHAP para evaluar el impacto de cada modelo base en la predicción final. El análisis SHAP se realizó tal como se describió previamente y en el Archivo Suplementario 1. Este componente aumenta la transparencia y ayuda a comprender el proceso de toma de decisiones. La efectividad y viabilidad del enfoque propuesto se evaluaron utilizando medidas estándar de regresión de desempeño. El rendimiento se evaluó mediante una única ejecución experimental con una semilla aleatoria fija.

Modelos de evaluación

En esta sección se presentan los modelos DL utilizados en el estudio, incluyendo tanto los modelos base individuales como el propuesto CARE-MIRV-Net. Los modelos de referencia fueron seleccionados para representar arquitecturas DL diversas y ampliamente adoptadas. MobileNetV2 fue incluido como una red ligera y computacionalmente eficiente, y InceptionV3 fue seleccionado por su capacidad para capturar características espaciales multiescala. ResNet101 fue elegido por su capacidad profunda de aprendizaje residual para la extracción jerárquica de características, y VGG16 se incluyó como una arquitectura convolucional bien establecida. Todos los modelos de benchmark se entrenaron utilizando procedimientos de preprocesamiento, ajustes de aumento de datos, particiones de conjuntos de datos, parámetros de optimización, tamaño del lote y configuración de entrenamiento idénticos para garantizar una evaluación comparativa justa.

MobileNetV2:

MobileNetV2 es un sistema CNN pequeño y compacto diseñado para ser rápido, de alto rendimiento y con menos complejidad computacional. Presenta algunas de las principales innovaciones como conexiones residuales invertidas y cuellos de botella lineales, que facilitan la extracción eficiente de características y mantienen un alto poder representativo. MobileNetV2 puede usar convoluciones separables en profundidad para minimizar considerablemente el número total de parámetros y el coste computacional de las redes convolucionales tradicionales, por lo que está bien adaptado a grandes problemas de aprendizaje basados en imágenes.

MobileNetV2 se utiliza en el marco sugerido como uno de los modelos base de DL para predecir los atributos arquitectónicos de las imágenes de planos residenciales. El modelo es capaz de aprender patrones espaciales como la distribución de las habitaciones, la densidad de la distribución y la organización estructural que ocurren en los planos de planta de forma eficaz gracias a su diseño eficiente. Estas representaciones eruditas desempeñan un papel importante a la hora de estimar con precisión características importantes como la superficie, el número de dormitorios, baños y garajes. MobileNetV2 es un modelo ligero, que es un buen candidato para ser incluido en el marco propuesto de meta-ensambles. Añade algunas representaciones complementarias de características a otros modelos DL y mejora la robustez y generalización general del sistema. Este aprendizaje de modelos es muy importante para mejorar la precisión de las predicciones y para ayudar en la clasificación de diseños residenciales basados en la atención sanitaria.

El modelo MobileNetV2 se entrena utilizando una estrategia de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a un tamaño fijo de 224 × 224 × 3, lo cual es compatible con la arquitectura. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se elimina la cabeza de clasificación inicial de MobileNetV2 y se sustituye por una cabeza de regresión. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Para facilitar la adaptación al dominio, las capas inferiores preentrenadas se congelaron, mientras que las capas superiores que comenzan en block_13_expand y la cabeza de regresión personalizada fueron ajustadas finamente. Este enfoque selectivo de entrenamiento permite al modelo conservar características visuales generales mientras aprende atributos espaciales específicos de las imágenes de planos de planta. Los mapas de características extraídos se procesan a través de una capa de Global Average Pooling y capas totalmente conectadas con 512 y 256 neuronas mediante activación ReLU. Para mejorar la generalización y reducir el sobreajuste, se incorporan capas de normalización por lotes y de dropout (0,4 y 0,3). La capa final de salida contiene cuatro neuronas con activación lineal correspondientes a los atributos arquitectónicos predichos. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001 y parámetros por defecto TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas. Se aplicó una parada temprana basada en la pérdida de validación, y se empleó la reducción adaptativa de la tasa de aprendizaje para mejorar la convergencia. El entrenamiento se realizó hasta 15 épocas.

InceptionV3:

InceptionV3 es una arquitectura CNN profunda capaz de capturar características multiescala mediante el uso de operaciones convolucionales paralelas. Se basa en el módulo Inception, que utiliza una variedad de tamaños de filtro en la misma capa para extraer características de grano fino y grueso al mismo tiempo. Este tipo de diseño arquitectónico permite que la red aprenda jerarquías espaciales complejas y sea eficiente computacionalmente. Además, InceptionV3 utiliza convoluciones factorizadas y reducción de dimensionalidad, que mejoran el rendimiento y minimizan el coste computacional.

InceptionV3 se aplica en el marco propuesto como un extractor eficaz de características para analizar imágenes de planos residenciales. Los planos de planta consisten en una variedad de patrones espaciales, como tamaños de habitaciones, planos estructurales y conectividad, lo que requiere aprendizaje de características a múltiples escalas. La arquitectura Inception es especialmente adecuada para esta tarea porque es capaz de representar al mismo tiempo aspectos locales específicos (por ejemplo, habitaciones pequeñas) y estructuras globales (por ejemplo, la organización de la disposición general). InceptionV3 ofrece representaciones complementarias a otros modelos como MobileNetV2 en el contexto del marco meta-ensemble. La diversidad de predicciones aumenta gracias a su capacidad para modelar relaciones espaciales complejas, lo que es importante para mejorar el rendimiento del conjunto. Esto ayuda finalmente a predicir mejor las características arquitectónicas y refuerza la clasificación posterior de un diseño de viviendas amigables con personas mayores e integradas en la atención sanitaria.

El modelo InceptionV3 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3 para garantizar la compatibilidad con la arquitectura de red y la consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares.

Se eliminan las capas originales de clasificación de InceptionV3 y se introduce una cabeza de regresión personalizada para permitir la predicción multioutput. La cabeza de regresión personalizada consistía en una capa de Global Average Pooling seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. La base convolucional está parcialmente ajustada, con las capas inferiores preentrenadas congeladas y las capas superiores, junto con la cabeza de regresión personalizada, ajustadas para aprender características específicas del plano de planta de dominio mientras se conservan representaciones visuales generales adquiridas durante el preentrenamiento. Tras la columna vertebral convolucional, una capa de Global Average Pooling transforma los mapas de características en una representación compacta de características. A esto le siguen capas totalmente conectadas que contienen 512 y 256 neuronas con funciones de activación de ReLU. Para minimizar el sobreajuste y mejorar la generalización, se aplican tasas de dropout de 0,4 y 0,3. La capa final de salida consta de cuatro neuronas con activación lineal que corresponde a la predicción de metros cuadrados, número de dormitorios, baños y número de garajes. El modelo se entrena utilizando el optimizador Adam con una tasa de aprendizaje de 0,0001, un tamaño de lote de 32 y hasta 15 épocas de entrenamiento con paradas tempranas y reducción adaptativa de la tasa de aprendizaje para asegurar una convergencia estable.

ResNet101:

ResNet101 es una estructura profunda de la CNN construida sobre el principio del aprendizaje residual que permite entrenar redes extremadamente profundas superando el problema del gradiente nulo. Añade conexiones residuales, o llamadas conexiones de salto, que permiten a la red aprender mapeos de identidad y retener información entre capas. Esta arquitectura mejora enormemente la estabilidad del entrenamiento y permite al modelo aprender características jerárquicas complejas. ResNet101 tiene una gran capacidad representacional de 101 capas y, por tanto, es muy eficaz en tareas que requieren características espaciales adicionales.

ResNet101 se utilizará en el marco propuesto como extractor de características de alta capacidad, que analizará las imágenes de planos residenciales. El modelo puede utilizarse para representar relaciones espaciales complejas, incluyendo conectividad de salas, complejidad de distribución y variaciones estructurales, debido a su arquitectura profunda. Estas características son fundamentales para hacer predicciones precisas sobre elementos arquitectónicos como metros cuadrados, dormitorios, baños y garajes. En el diseño del meta-ensemble, ResNet101 es un componente importante y proporciona representaciones profundas y abstractas de características. ResNet101 se preocupa más por las características estructurales de grano fino y, por tanto, es más diverso entre los aprendices base en comparación con modelos ligeros como MobileNetV2. Esta heterogeneidad juega un papel esencial en mejorar el rendimiento de un conjunto y predicciones sólidas, especialmente cuando se trata de la clasificación residencial basada en el sector sanitario.

ResNet101 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3, lo que garantiza compatibilidad arquitectónica y consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se elimina el cabezal de clasificación original de ResNet101 (include_top=Falso), y se introduce un cabezal de regresión personalizado para permitir la predicción multisalida. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Para equilibrar la reutilización de características y la adaptación del dominio, las capas preentrenadas inferiores se congelaron, mientras que las capas más profundas que partían de conv4_block1_1_conv y la cabeza de regresión personalizada fueron ajustadas finamente. Esta estrategia de entrenamiento selectivo permite al modelo conservar características visuales genéricas mientras adapta representaciones de nivel superior a imágenes de planos de planta. La salida de la base convolucional se pasa a través de una capa de Agrupación de Promedios Globales para generar una representación compacta de características. A esto le siguen capas totalmente conectadas con 512 y 256 neuronas que utilizan funciones de activación de ReLU. La normalización por lotes se aplica para estabilizar el aprendizaje, y se incorporan capas de dropout con tasas de 0,4 y 0,3 para reducir el sobreajuste y mejorar la generalización. La capa final de salida contiene cuatro neuronas con activación lineal correspondiente a la superficie, número de dormitorios, baños y garajes. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001, como se describe en la configuración de entrenamiento. La ampliación de datos incluía volteos aleatorios, rotación, zoom y desplazamiento para mejorar la generalización del modelo. El entrenamiento se realizó hasta 15 épocas, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativo.

VGG16:

VGG16 es una arquitectura de red neuronal sencilla de tipo convolucional profundo que es eficaz y sencilla en tareas de reconocimiento visual. Está compuesto por 16 capas con un diseño regular u homogéneo que incorpora pequeños filtros convolucionales de 3 × 3, que facilitan el aprendizaje de representaciones jerárquicas de características por parte de la red. La arquitectura es profunda y sencilla, lo que significa que es capaz de capturar detalles de bajo nivel como bordes, texturas y estructuras semánticas de alto nivel. VGG16, con su diseño habitual y buen rendimiento, es ahora una opción popular de backbone cuando realiza aprendizaje por transferencia en tareas relacionadas con imágenes.

En el modelo sugerido, VGG16 se utiliza como modelo base de DL para derivar características espaciales de imágenes de planos residenciales. El hecho de que esté organizado le permite ser muy útil para captar los detalles más finos de los patrones de distribución, como los límites de las habitaciones, las alineaciones estructurales y la organización espacial. Estas características son fundamentales para predecir eficazmente los atributos de la arquitectura como los pies cuadrados, dormitorios, baños y garajes. En el sistema meta-ensemble, VGG16 proporciona representaciones de características estables y bien generalizadas. VGG16 ofrece un enfoque de extracción de características más equilibrado en comparación con arquitecturas más profundas, como ResNet101, y arquitecturas multiescala, como InceptionV3, aumentando la diversidad base del aprendizaje. Esta heterogeneidad es fundamental para mejorar el rendimiento del conjunto y las previsiones fiables de la clasificación residencial orientada a la atención sanitaria.

El modelo VGG16 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3 para garantizar compatibilidad con la arquitectura y la consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se eliminan las capas de clasificación originales (include_top=Falso), y se añade una cabeza de regresión personalizada para adaptar el modelo a la predicción multioutput. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Las capas inferiores preentrenadas estaban congeladas, mientras que las capas que partían de block4_conv1 y la cabeza de regresión personalizada estaban ajustadas finamente. Esta estrategia permite al modelo conservar características visuales generales mientras aprende representaciones específicas de dominio relevantes para el análisis de plantas. Las características de salida de la base convolucional se pasan por una capa de Agrupación de Promedios Globales para generar un vector de características compacto. A esto le siguen capas totalmente conectadas con 512 y 256 neuronas que utilizan funciones de activación de ReLU. Se incorporan capas de normalización por lotes y de dropout con tasas de 0,4 y 0,3 para estabilizar el entrenamiento, reducir el sobreajuste y mejorar la generalización. La capa final de salida contiene cuatro neuronas con activación lineal correspondiente a la superficie, número de dormitorios, baños y predicciones de garaje. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001, como se describe en la configuración de entrenamiento. La ampliación de datos incluía volteos aleatorios, rotación, zoom y desplazamiento para mejorar la generalización del modelo. El entrenamiento se realizó hasta 15 épocas, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativo.

CARE-MIRV-Net (Modelo Propuesto de Lanzamiento de Meta-Ensamble):

El CARE-MIRV-Net sugerido (Context-Aware Residential Ensemble utilizando MobileNetV2, InceptionV3, ResNet101 y VGG16 Network) es un marco DL basado en meta-ensambles apilados que tiene como objetivo mejorar la estimación de características arquitectónicas basándose en imágenes de planos residenciales. La arquitectura combina diversas CNN heterogéneas explotando sus ventajas sinérgicas en la extracción de características. El modelo propuesto se basa en la combinación de arquitectura ligera, profunda y multiescala que mejora el rendimiento predictivo y proporciona robustez en una amplia variedad de distribuciones residenciales. A diferencia de las técnicas tradicionales basadas en un solo modelo, CARE-MIRV-Net sigue un enfoque jerárquico de aprendizaje, donde los modelos base proporcionan predicciones iniciales, que luego son mejoradas por un meta-aprendiz.

Cuando se trata de un diseño residencial que sea espacialmente consciente y respetuoso de la salud, la correcta interpretación de la distribución de los planos es de suma importancia. Los modelos DL individuales tienden a ser insuficientes para generalizar diferentes patrones arquitectónicos. El marco propuesto superará esta debilidad utilizando cuatro arquitecturas diferentes: MobileNetV2, InceptionV3, ResNet101 y VGG16, que aportan diferentes capacidades representacionales propias. MobileNetV2 puede usarse para extraer características de forma eficiente y es ligero; InceptionV3 aprende patrones espaciales a través de múltiples escalas; ResNet101 aprende representaciones jerárquicas profundas; y VGG16 aprende características de forma consistente y fiable. Una combinación de estos modelos facilita que el marco abarque tanto los atributos espaciales locales como globales, lo que mejora la precisión y fiabilidad de las características previstas como la superficie, el número de dormitorios, baños y garajes. Las predicciones anteriores también pueden utilizarse para predecir una clasificación adicional de las distribuciones residenciales, incluyendo opciones amigables para personas mayores, integradas en la atención sanitaria y residenciales generales.

CARE-MIRV-Net se implementa utilizando una estrategia de ensamble basada en apilamiento en dos etapas. En la primera etapa, los cuatro modelos base generan predicciones de forma independiente para las variables objetivo. Las entradas del meta-aprendiz se generaban concatenando las salidas de predicción producidas por los modelos base entrenados sobre los datos de entrenamiento. Estas predicciones concatenadas formaron los vectores meta-características de 16 dimensiones usados para el entrenamiento de metamodelos. Se evitó la fuga de información mediante la estricta separación de los conjuntos de datos de entrenamiento y prueba, y no se utilizaron muestras de prueba ni durante el entrenamiento en modelos base ni en metamodelos. Durante el proceso de apilamiento se emplearon los mismos conjuntos de datos de entrenamiento y validación utilizados para los modelos base. Durante el entrenamiento y la inferencia, el vector meta-característica de 16 dimensiones se construyó concatenando las cuatro salidas de predicción generadas por MobileNetV2, InceptionV3, ResNet101 y VGG16. Dado que cada modelo genera un vector de salida de cuatro dimensiones, la representación concatenada produce una entrada de 16 dimensiones para el meta-aprendiz. Esta transformación combina las predicciones de todos los modelos base y sirve como entrada a la segunda etapa del marco. La segunda etapa consiste en construir un meta-aprendiz de red neuronal completamente conectada para aprender la combinación óptima de predicciones del modelo base. El meta-aprendiz consistía en capas totalmente conectadas con 512 y 256 neuronas, activación de ReLU, normalización por lotes, tasas de abandono de 0,4 y 0,3, y una capa lineal de salida de cuatro neuronas. Las capas de dropout con tasas de 0,4 y 0,3 se aplicaron después de las capas densas para reducir el sobreajuste y mejorar la generalización. El meta-modelo fue entrenado usando el optimizador Adam con una tasa de aprendizaje de 0,0001, un tamaño de lote de 32 y hasta 15 épocas con paradas tempranas y reducción adaptativa de la tasa de aprendizaje. Los datos de validación se utilizaron para monitorizar el rendimiento del modelo durante el entrenamiento y seleccionar el modelo con mejor rendimiento. Tras el entrenamiento, el modelo meta-conjunto generó predicciones finales combinando los resultados de todos los aprendices base. MAE yR 2 se utilizaron para evaluar el rendimiento de CARE-MIRV-Net. Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas. Los resultados se obtuvieron de una única ejecución experimental utilizando una semilla aleatoria fija. El marco propuesto mejora la capacidad predictiva al combinar varias estructuras DL mediante un mecanismo de apilamiento y proporcionar un análisis interpretable de planos residenciales. Esto hace que CARE-MIRV-Net sea aplicable en el contexto de un diseño residencial centrado en la geriatría y orientado a la atención sanitaria. El código fuente, la información de configuración del entorno, las especificaciones de dependencia de software y la documentación de implementación se proporcionan en el Archivo Suplementario 1.

Evaluación del rendimiento

El análisis del rendimiento del marco propuesto se realiza para determinar su poder predictivo, robustez y rendimiento generalizador a través de diferentes características arquitectónicas. Se realizan análisis cuantitativos y cualitativos para confirmar la utilidad del modelo propuesto. El procedimiento de evaluación implica tanto medidas estándar de regresión como entornos experimentales controlados para permitir una comparación justa con los modelos de referencia. Los experimentos se realizaron utilizando una única ejecución experimental con una semilla aleatoria fija para asegurar la reproducibilidad y consistencia en todos los modelos de referencia y propuestos.

Parámetros de rendimiento:

Se utilizan dos medidas de regresión bien conocidas, MAE y R2, para evaluar el rendimiento del marco propuesto. El MAE mide la magnitud media de los errores de predicción y proporciona una indicación clara de la proximidad entre los valores predichos y los reales. Por el contrario, el valor R2 se utiliza para evaluar la proporción de varianza en las variables objetivo explicadas por el modelo, reflejando su poder predictivo global. Una combinación de estas métricas proporciona una evaluación exhaustiva de la precisión y el rendimiento generalizado de todas las características arquitectónicas predichas. Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas.

Montaje experimental:

Los experimentos se realizaron en un entorno de computación en la nube usando Python (versión 3.12.12). El protocolo propuesto se implementó usando TensorFlow (versión 2.19.0), Keras (versión 3.13.2), NumPy (versión 2.4.6), Pandas (versión 2.3.3), Scikit-learn (versión 1.6.1), Matplotlib (versión 3.9) y SHAP (versión 0.51.0). El entorno computacional utilizaba un procesador Intel Xeon que operaba a 2,20 GHz con aproximadamente 31 GB de memoria del sistema. Los experimentos se realizaron en un sistema operativo Ubuntu 22.04 LTS utilizando GPUs NVIDIA Tesla T4 × 2. El conjunto de datos contiene 2.640 imágenes de planos residenciales que fueron preprocesadas y subdivididas en conjuntos de datos de entrenamiento y prueba. El conjunto de datos se dividió utilizando una proporción de división 80:20, resultando en 2.112 muestras de entrenamiento y 528 muestras de prueba. MobileNetV2, InceptionV3, ResNet101 y VGG16 son cuatro modelos DL que fueron entrenados usando un enfoque de ajuste fino con aprendizaje por transferencia. A continuación, se construyó un modelo meta-conjunto basado en apilamiento, CARE-MIRV-Net, para combinar predicciones de estos modelos base. Cada modelo se entrenó bajo condiciones uniformes, incluyendo redimensionamiento de imagen a 224 × 224 píxeles, aumento de datos y paradas anticipadas para reducir el sobreajuste. La ampliación de datos incluía giros aleatorios, rotación, zoom y desplazamiento. Se utilizó un tamaño de lote de 32 y un máximo de 15 épocas de entrenamiento, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativa. El análisis final se realizó en un conjunto de pruebas oculto para proporcionar una evaluación imparcial y fiable del rendimiento. El conjunto de pruebas oculto se generó durante la partición inicial del conjunto de datos y permaneció completamente aislado durante el entrenamiento y desarrollo del modelo para garantizar una evaluación del rendimiento imparcial.

Descripción del conjunto de datos:

El conjunto de datos utilizado para respaldar los hallazgos de este estudio está disponible públicamente en la plataforma Kaggle con el título "Imágenes de planos de planta y sus detalles"28. El conjunto de datos está disponible en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (consultado el 16 de abril de 2026). Los datos consisten en 2.640 imágenes de planos residenciales y metadatos arquitectónicos organizados. Cada muestra es un plano de vivienda distinto, que ofrece una amplia gama de distribuciones residenciales con diferentes tamaños, configuraciones y disposiciones espaciales. El tamaño del conjunto de datos es suficiente para el entrenamiento basado en DL y contiene una variedad de patrones arquitectónicos. El conjunto de datos consiste en una imagen bidimensional de planta y atributos numéricos relacionados que describen las características estructurales de la residencia. Estas características incluyen la superficie total, el número de dormitorios, el número de baños y el número de garajes. Además, cada registro contiene una ruta de imagen, que permite el mapeo directo de entradas visuales a las etiquetas. Las variables del conjunto de datos incluyen la imagen del plano de planta, la ruta de la imagen, los metros cuadrados, el número de dormitorios, el número de baños y el número de garajes. La imagen del plano de planta sirve como elemento de entrada, mientras que los atributos arquitectónicos se utilizan como objetivos de predicción. Por tanto, el conjunto de datos es adecuado para el aprendizaje supervisado, con imágenes que sirven como características de entrada y atributos arquitectónicos como objetivos de regresión.

El conjunto de datos contiene una amplia variedad de distribuciones residenciales, que van desde diseños compactos con menos habitaciones hasta grandes diseños de varias habitaciones. Esta variabilidad permite el aprendizaje de representaciones espaciales significativas, incluyendo la distribución de las habitaciones, la densidad de la distribución y la complejidad estructural. Esta diversidad es especialmente importante para el marco propuesto, ya que apoya la categorización de los planos en disposiciones residenciales amigables para personas mayores, integradas en atención sanitaria y residenciales generales. Antes del entrenamiento del modelo, el conjunto de datos se procesa mediante una secuencia de procedimientos de preprocesamiento para garantizar la consistencia y compatibilidad con los modelos DL. Todas las imágenes se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1] antes del entrenamiento. El conjunto de datos se organiza emparejando las rutas de imagen con sus metadatos correspondientes, tras lo cual se separa en subconjuntos de entrenamiento y prueba para facilitar el análisis del rendimiento. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20. Los registros que contenían información completa de imágenes y metadatos se incluyeron en el análisis, mientras que los registros incompletos o inválidos se excluyeron. Durante la partición de conjuntos de datos se utilizó una semilla aleatoria fija para garantizar la reproducibilidad. El conjunto de datos proporciona una base detallada para el análisis impulsado por IA de planos residenciales. La combinación de 2.640 imágenes anotadas y diversos atributos arquitectónicos apoya el modelado de regresión multisalida y permite la integración de la inteligencia espacial con la toma de decisiones de diseño residencial orientado a la atención sanitaria.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Se realizó un conjunto de experimentos para evaluar el marco propuesto utilizando cuatro modelos DL, MobileNetV2, InceptionV3, ResNet101 y VGG16, junto con el modelo propuesto de meta-conjunto CARE-MIRV-Net.

Resultados de la adquisición y preprocesamiento de conjuntos de datos

La fase de preprocesamiento se diseñó para preparar las imágenes en bruto del plano de planta y los metadatos relacionados para entrenamiento...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este estudio presenta CARE-MIRV-Net, un marco DL basado en meta-ensambles apilados para el análisis automatizado de imágenes de planos residenciales. El marco integra cuatro arquitecturas CNN complementarias—MobileNetV2, InceptionV3, ResNet101 y VGG16—para predecir atributos arquitectónicos clave, incluyendo metros cuadrados, número de dormitorios, baños y garajes. Estas predicciones se combinan posteriormente a través de un meta-aprendiz y se utilizan dentro de una capa de decisión basa...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Conflictos de interés:

Los autores no declaran conflictos de interés.

Contribuciones de los autores:

Ning Zhang propuso ideas de investigación, diseñó planes experimentales y coordinó el proceso de investigación. Yu Bi realizó experimentos, recopiló datos, participó en análisis de datos y revisiones de artículos.

Agradecimientos

Los autores reconocen sinceramente el apoyo financiero proporcionado por el Proyecto de Investigación Científica del Departamento de Educación de la Provincia de Jilin.

FINANCIACIÓN:

Esta investigación fue financiada por el Proyecto de Investigación Científica del Departamento de Educación de la Provincia de Jilin (Subvención nº JJKH20240801KJ).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CARE-MIRV-Net implementation packageSupplementary File 1Versión 1.0N/A
Figure and table regeneration scriptsSupplementary File 1Versión 1.0N/A
Floor Plan Images and Their Details DatasetKaggleDataset públicoN/A
GPUNVIDIA CorporationTesla T4 × 2N/A
Intel Xeon ProcessorIntel Corporation2.20 GHzN/A
KerasKeras TeamVersión 3.13.2N/A
MatplotlibMatplotlib Development TeamVersión 3.9RRID:SCR_008624
NumPyNumPy DevelopersVersión 2.4.6RRID:SCR_008633
Operating SystemLinuxUbuntu 22.04 LTSN/A
PandasPandas Development TeamVersión 2.3.3RRID:SCR_018214
PythonPython Software FoundationVersión 3.12.12RRID:SCR_008394
Scikit-learnScikit-learn DevelopersVersión 1.6.1RRID:SCR_002577
SHAPSHAP Development TeamVersión 0.51.0N/A
System Memory (RAM)Cloud Computing Environment31 GBN/A
TensorFlowGoogleVersión 2.19.0RRID:SCR_016345
Training environment configuration fileSupplementary File 1Versión 1.0N/A

Referencias

  1. Apanavičienė R, Shahrabani MMN. Key factors affecting smart building integration into smart city: technological aspects. Smart Cities. 2023;6(4):1832-1857.
  2. Li J, et al. The relationship between artificial intelligence (AI) and building information modeling (BIM) technologies for sustainable building in the context of smart cities. Sustainability. 2024;16(24):10848.
  3. Khade R, Jariwala K, Chattopadhyay C. A comprehensive survey of floor plan image analysis and related applications. Int J Doc Anal Recognit. 2026;29(1):41-59.
  4. Okuyucu EB, Kösenciğ KÖ. AI-assisted floor plan design incorporating structural constraints. Nexus Netw J. 2025;27(4):947-963.
  5. Kim H. Evaluation of deep learning-based automatic floor plan analysis technology: an AHP-based assessment. Appl Sci. 2021;11(11):4727.
  6. Goyal S, Chattopadhyay C, Bhatnagar G. A computational approach to understand building floor plan images using machine learning techniques. In: Internet of Multimedia Things. Elsevier; 2022. p. 233-259.
  7. Li Y, Chen H, Yu P, Yang L. A review of artificial intelligence in enhancing architectural design efficiency. Appl Sci. 2025;15(3):1476.
  8. Yıldız B, Çağdaş G, Zincir I. Architectural space classification considering topological and 3D visual spatial relations using machine learning techniques. Build Res Inf. 2024;52(1-2):68-86.
  9. Albukhari IN. The role of artificial intelligence (AI) in architectural design: a systematic review of emerging technologies and applications. J Umm Al-Qura Univ Eng Archit. 2025;16(4):1457-1476.
  10. Kumar H, KS KM, SAS AR, VC J. Explainability to image captioning models: an improved post-hoc approach through Grad-CAM. In: 2025 International Conference on Innovation in Computing and Engineering (ICE); 2025. p. 1-6. Available from: https://doi.org/10.1109/ICE63309.2025.10984143
  11. Alshammeri M, Ahmad Z, Humayun M, Alamri M. Explainable cluster-based predictive framework for early diagnosis of autism spectrum disorder using behavioral biomarkers. Diagnostics. 2025;15(24):3241.
  12. Zhao T, Zhao Y, Zhou T. Stacking ensemble learning for seabed sediment classification. In: 2024 7th International Conference on Information Communication and Signal Processing (ICICSP); 2024. p. 211-215. Available from: https://doi.org/10.1109/ICICSP62589.2024.10809036
  13. Bazie IG, et al. Leveraging machine learning techniques in converting 2D floorplans images to 3D models: applications, challenges, and future directions. Procedia Comput Sci. 2025;272:234-241.
  14. Luo G, et al. Controllable and flexible residential floor plan layout design based on multi-agent deep reinforcement learning with layout prior size and similar experience abandon. Adv Eng Inform. 2025;68:103702.
  15. Ling H, Luo G, Zhou N, Jiang X. Survey of architectural floor plan retrieval technology based on 3ST features. AI. 2025;6(4):67.
  16. Memon SA, Shehata W, Rowlinson S, Sunindijo RY. Generative artificial intelligence in architecture, engineering, construction, and operations: a systematic review. Buildings. 2025;15(13):2270.
  17. Yang C, et al. How can SHAP (SHapley Additive exPlanations) interpretations improve deep learning-based urban cellular automata model? Comput Environ Urban Syst. 2024;111:102133.
  18. Mienye ID, Swart TG. A comprehensive review of deep learning: architectures, recent advances, and applications. Information. 2024;15(12):755.
  19. van Engelenburg C, et al. MSD: a benchmark dataset for floor plan generation of building complexes. In: Vedaldi A, Bischof H, Brox T, Frahm JM, editors. Computer Vision – ECCV 2024. Lecture Notes in Computer Science. Cham: Springer Nature Switzerland; 2025. p. 60-75.
  20. Ganaie MA, et al. Ensemble deep learning: a review. Eng Appl Artif Intell. 2022;115:105151.
  21. Zhou W, et al. HIDIM: a novel framework of network intrusion detection for hierarchical dependency and class imbalance. Comput Secur. 2025;148:104155.
  22. Carrera L, et al. The impact of architecturally qualified data in deep learning methods for the automatic generation of social housing layouts. Autom Constr. 2024;158:105238.
  23. Yang B, et al. Automated semantics and topology representation of residential-building space using floor-plan raster maps. IEEE J Sel Top Appl Earth Obs Remote Sens. 2022;15:7809-7825.
  24. Rathnayake N, Rathnayake U, Dang TL, Hoshino Y. An efficient automatic Fruit-360 image identification and recognition using a novel modified cascaded-ANFIS algorithm. Sensors. 2022;22(12):4401.
  25. Alsulami AA, et al. Security strategy for autonomous vehicle cyber-physical systems using transfer learning. J Cloud Comput. 2023;12(1):181.
  26. Alshammari A. Construction of VGG16 convolution neural network (VGG16_CNN) classifier with NestNet-based segmentation paradigm for brain metastasis classification. Sensors. 2022;22(20):8076.
  27. Mascarenhas S, Agarwal M. A comparison between VGG16, VGG19 and ResNet50 architecture frameworks for image classification. In: 2021 International Conference on Disruptive Technologies for Multi-Disciplinary Research and Applications (CENTCON); 2021. p. 96-99. Available from: https://doi.org/10.1109/CENTCON52345.2021.9687944
  28. Kaggle. Floor Plan Images and Their Details [Internet]. Available from: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details. Accessed 2026 Apr 16.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Ingenier aN mero 233N mero 233Valor vac oN meroAprendizaje meta ensemblean lisis de planos de plantadise o residencialviviendas para el cuidado de personas mayoresdise o integrado de servicios de saludXAI
Video próximamente