Artículo de investigación

Predicción basada en aprendizaje profundo de atributos de planos residenciales para la evaluación de viviendas orientadas a personas mayores

DOI:

10.3791/72157

31 de julio de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe un flujo de trabajo de aprendizaje profundo meta-conjunto para el análisis automatizado de imágenes de planos residenciales. El procedimiento incluye preprocesamiento de conjuntos de datos, predicción de atributos arquitectónicos utilizando múltiples redes neuronales convolucionales, aprendizaje de conjuntos basado en apilamiento, clasificación residencial basada en reglas y análisis de explicabilidad mediante SHapley Additive ExPlanations para apoyar la evaluación de la distribución residencial.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La creciente demanda de soluciones de vivienda inteligente para poblaciones envejecidas ha incrementado la necesidad de métodos automatizados para el análisis de planos residenciales. Los enfoques convencionales de evaluación arquitectónica suelen ser manuales, requieren mucho tiempo y son difíciles de escalar, lo que pone de manifiesto la necesidad de técnicas basadas en inteligencia artificial que puedan interpretar distribuciones espaciales y apoyar la evaluación del diseño residencial. Este protocolo describe un marco de aprendizaje profundo meta-conjunto para el análisis automatizado de imágenes de planos residenciales. El marco propuesto CARE-MIRV-Net integra cuatro redes neuronales convolucionales complementarias—MobileNetV2, InceptionV3, ResNet101 y VGG16—para predecir atributos arquitectónicos, incluyendo metros cuadrados, número de dormitorios, baños y garajes. Las predicciones de los modelos base se combinan mediante un modelo meta-conjunto basado en apilamiento y posteriormente se utilizan dentro de una capa de decisión basada en reglas para categorizar los diseños residenciales como cuidados para personas mayores, atención médica o residencial general. La evaluación experimental demostró un rendimiento predictivo robusto a través de múltiples variables objetivo. El modelo propuesto logró un error absoluto medio (MAE) de 432,48 y un coeficiente de determinación (R2) de 0,7053 para la predicción de metros cuadrados. Para la predicción de baños, el marco alcanzó R2 de 0,7605, mientras que la predicción de garaje mostró la MAE más baja de 0,1697 y la R2 más alta de 0,6958. Los análisis cualitativos demostraron además la capacidad del marco para generar predicciones de atributos arquitectónicos y apoyar la evaluación de distribución residencial orientada a la aplicación. Para mejorar la transparencia y la interpretabilidad, se incorporaron explicaciones aditivas SHapley para cuantificar la contribución de cada modelo base a las predicciones finales. El marco propuesto ofrece un enfoque interpretable y escalable para el análisis de planos de planta residencial y el apoyo a la toma de decisiones.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El rápido desarrollo de tecnologías de ciudades inteligentes y entornos de vida inteligentes ha generado una demanda creciente de soluciones automatizadas y basadas en datos en el diseño residencial. En particular, el envejecimiento creciente de la población y la demanda de viviendas orientadas a la atención sanitaria han aumentado la importancia de diseñar espacios residenciales que sean funcionales y adaptados a las necesidades de grupos de usuariosespecíficos 1,2. Los métodos convencionales de análisis de planos arquitectónicos suelen ser manuales, requieren mucho tiempo y dependen de una interpretación experta; por lo tanto, son ineficientes y difíciles de escalar. Esto ha generado una gran necesidad de sistemas inteligentes capaces de analizar automáticamente las distribuciones residenciales y apoyar la toma de decisionesinformadas 3.

Los avances recientes en inteligencia artificial (IA), especialmente en aprendizaje profundo (DL) y visión por ordenador, han mejorado significativamente el análisis de datos basados en imágenes. Las redes neuronales convolucionales (CNN) han demostrado ser muy eficaces para la extracción de características espaciales y el aprendizaje de patrones visuales complejos, lo que las hace adecuadas para el análisis de imágenes en planosde planta 4,5,6. Estos modelos pueden aprender representaciones implícitas de estructuras de salas, organización de la distribución y relaciones espaciales que son esenciales para predecir atributos arquitectónicos 7,8. Sin embargo, la dependencia de un único modelo DL puede limitar la generalización porque diferentes arquitecturas pueden centrarse en características espaciales distintas y mostrar sesgos derivados de la variabilidadarquitectónica 9. A pesar de estos avances, los enfoques existentes a menudo carecen de un marco integrado que combine múltiples modelos, soporte la predicción multisalida y proporcione interpretabilidad a nivel de aplicación. Además, la evaluación y explicabilidad residencial orientada a la atención sanitaria ha recibido una atención relativamente limitada dentro de los sistemas de análisis de planos de planta. La ausencia de estos marcos integrales limita la aplicabilidad práctica y la interpretabilidad, especialmente en ámbitos donde la transparencia y el apoyo a la toma de decisiones sonimportantes 10,11,12.

La IA también ha contribuido de manera sustancial al análisis automatizado y la generación de planos arquitectónicos. Un estudio investigó el uso de aprendizaje automático (ML) para transformar imágenes bidimensionales de planos de planta en modelostridimensionales 13. Los autores destacaron las limitaciones de los métodos convencionales basados en diseño asistido por ordenador (CAD) y subrayaron la importancia de las canaletas escalables basadas en IA para la comprensión espacial. Sus hallazgos demostraron que DL puede extraer eficazmente información estructural de los planos de planta, aunque persisten desafíos relacionados con la generalización y la variabilidad de los datos. Otro estudio propuso un marco de aprendizaje por refuerzo profundo multiagente para la generación automatizada de planosde planta 14. Aunque el enfoque ofrece una considerable flexibilidad y personalización para el diseño arquitectónico, se centra principalmente en la generación de diseño más que en el análisis predictivo de planos existentes.

Una encuesta exhaustiva de recuperación de planos examinó características semánticas, espaciales, basadas en formas y texturas para la comprensión de planos15. La encuesta subrayó la importancia de los modelos DL, incluyendo CNN y arquitecturas basadas en transformadores, para aprender representaciones significativas. Sin embargo, también identificó desafíos relacionados con el ruido, la distorsión y la discriminación de características en diseños complejos. De manera similar, un enfoque basado en aprendizaje automático incorporó relaciones topológicas y visuales para el reconocimiento de planosde planta 8. El estudio demostró que la accesibilidad visual y la conectividad espacial son importantes para entender los diseños arquitectónicos, pero no abordó las estrategias de predicción multisalida ni de aprendizaje en conjunto. La IA generativa también ha sido explorada en aplicaciones arquitectónicas. Una revisión de la IA generativa en arquitectura examinó el uso de redes generativas adversariales (GANs), autocodificadores variacionales (VAEs) y modelos de difusión para la automatizacióndel diseño 16. Los autores destacaron la creciente adopción de herramientas de IA en flujos de trabajo arquitectónicos prácticos. Sin embargo, el enfoque de ese trabajo era la generación de diseño más que la modelización predictiva o aplicaciones de apoyo a la decisión. La IA explicable se ha vuelto cada vez más importante para interpretar modelos DL. Un estudio propuso un marco basado en SHapley Additives ExPlanations (SHAP) para interpretar modelos DL en aplicaciones de simulaciónurbana 17. Los resultados demostraron que SHAP puede identificar características influyentes y mejorar la interpretabilidad tanto a nivel global como local. Aunque el estudio respalda el valor de SHAP en aplicaciones espaciales, no investigó su integración con marcos de aprendizaje en conjunto. Los desarrollos recientes en las arquitecturas DL han mejorado aún más el rendimiento en tareas basadas en imágenes. Un estudio presentó una revisión exhaustiva de los modelos contemporáneos de DL, incluyendo arquitecturas basadas en CNN y entransformadores 18. El estudio destacó la importancia de la selección de modelos y las arquitecturas híbridas para mejorar el rendimiento en generalización. Sin embargo, no abordó específicamente las solicitudes de análisis de planos de planta. Los conjuntos de datos a gran escala también han facilitado avances en el análisis arquitectónico. Por ejemplo, un estudio introdujo un conjunto de datos de referencia que contenía miles de planos complejos19. El estudio demostró que los modelos existentes siguen enfrentando desafíos al analizar distribuciones de grandes y varios apartamentos, lo que pone de manifiesto la necesidad de enfoques más robustos y generalizables.

DL también ha sido estudiada extensamente en el aprendizaje de conjuntos. Un estudio reciente sobre métodos de ensambles profundos indicó que combinar múltiples modelos puede mejorar significativamente la precisión predictiva y la robustez al reducir el sesgo y la varianza20. A pesar de su eficacia, estos métodos no se han aplicado ampliamente al análisis de planos arquitectónicos, especialmente en tareas de regresión multioutput. Además, estudios recientes en análisis automatizado de planos de planta han destacado la importancia de marcos integrados que combinan predicción, clasificación einterpretabilidad 21,22,23. La investigación existente suele centrarse en funciones individuales, como la extracción de características, la generación de maquetas o la clasificación. En consecuencia, persiste una clara carencia en la investigación en el desarrollo de un marco unificado que integre el aprendizaje multimodelo, la evaluación de la distribución residencial y la IA explicable. Aunque se han logrado avances considerables en DL y análisis arquitectónico, persisten varias lagunas en la investigación. La mayoría de los estudios existentes se centran en el reconocimiento de planos de planta, la extracción de características o la generación de layouts sin proporcionar un marco unificado que permita tanto la predicción multisalida como la toma de decisiones a nivel de aplicación. Además, muchos enfoques dependen de un único modelo DL, lo que puede limitar su capacidad para capturar características espaciales diversas e introducir sesgos específicos del modelo. El aprendizaje en conjunto para el análisis de planos de planta sigue siendo relativamente poco explorado, especialmente en lo que respecta a la integración de modelos heterogéneos para mejorar la robustez. Además, se ha prestado poca atención a la clasificación residencial, con énfasis en consideraciones de vivienda orientada a personas mayores y en la interpretabilidad. Dado que muchos modelos DL funcionan como cajas negras, entender la base de sus predicciones sigue siendo un reto. Estas limitaciones ponen de manifiesto la necesidad de un marco integral que integre aprendizaje multimodelo, predicción precisa, clasificación residencial orientada a aplicaciones e IA explicable.

Este estudio presenta un marco automatizado para el análisis de imágenes de planos residenciales, con énfasis en la conciencia espacial y la evaluación de la distribución residencial, para abordar estos desafíos. El marco propuesto introduce un modelo DL meta-ensemble, CARE-MIRV-Net, que integra cuatro CNNs complementarias—MobileNetV2, InceptionV3, ResNet101 y VGG16—dentro de una arquitectura basada enapilamiento 24,25,26,27. Cada modelo predice de forma independiente atributos arquitectónicos clave, incluyendo metros cuadrados, número de dormitorios, baños y garajes. Estas predicciones son posteriormente combinadas por un meta-aprendiz para generar predicciones refinadas. Además, se utiliza una capa de decisión basada en reglas para categorizar los diseños residenciales como atención a personas mayores, atención médica o residencial general basándose en los atributos predichos.

Las contribuciones de este trabajo son las siguientes. Primero, se propone un marco DL de meta-conjunto para la predicción multisalida de atributos arquitectónicos a partir de imágenes de planos residenciales. En segundo lugar, el modelo CARE-MIRV-Net integra cuatro arquitecturas CNN para mejorar la precisión y generalización de las predicciones. En tercer lugar, se incorpora una capa de decisión basada en reglas para soportar la categorización de distribución residencial orientada a aplicaciones basada en atributos arquitectónicos previstos. Cuarto, la IA explicable basada en SHAP está integrada para mejorar la transparencia y la interpretabilidad del modelo. Finalmente, se realizan experimentos extensos para evaluar el marco propuesto utilizando el error absoluto medio (MAE) y el coeficiente de determinación (R2) como métricas de rendimiento.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó un conjunto de datos público disponible de la plataforma Kaggle (Imágenes de Planta y Sus Detalles, disponible en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; consultado el 16 de abril de 2026). No implicaba participantes humanos, animales ni datos personales identificables; por lo tanto, no se requería la aprobación ética ni el consentimiento informado.

Este protocolo presenta un marco impulsado por IA para el análisis automatizado de imágenes de planos residenciales, con un enfoque en el diseño espacialmente consciente y orientado a la atención sanitaria. El flujo de trabajo experimental completo se presenta en la Figura 1. El protocolo está diseñado para tender puentes entre la predicción de características arquitectónicas de bajo nivel y la toma de decisiones orientada a aplicaciones de alto nivel. Integra DL, modelado conjunto e IA explicable para ofrecer una solución precisa, robusta e interpretable para analizar distribuciones residenciales. El marco consta de múltiples etapas, comenzando con la adquisición y preprocesamiento de datos, seguidas por el aprendizaje de características mediante CNN profundas, la predicción de meta-ensambles y, finalmente, la clasificación a nivel de aplicación. Inicialmente, las imágenes de planos de planta y sus correspondientes atributos arquitectónicos se preprocesan mediante redimensionamiento, normalización y aumento de datos para garantizar la consistencia y mejorar la generalización. Todas las imágenes de planos de planta se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1]. La mejora de datos se aplicó durante el entrenamiento utilizando giros horizontales aleatorios, rotación, zoom y desplazamiento de ancho/altura para mejorar la generalización del modelo y reducir el sobreajuste. No se aplicó ningún giro vertical. Los parámetros completos de ampliación y los detalles de implementación se proporcionan en el Archivo Suplementario 1. Los datos procesados se utilizaron para entrenar múltiples modelos de DL para la extracción y predicción de características. Todos los modelos base y el meta-aprendiz CARE-MIRV-Net se entrenaron usando una configuración consistente, incluyendo aumento de datos, paradas tempranas y programación adaptativa de la tasa de aprendizaje. La parada temprana monitorizó la pérdida de validación (val_loss) con un valor de paciencia de 5 épocas, y los mejores pesos del modelo se restauraron automáticamente tras el entrenamiento. La planificación adaptativa de la tasa de aprendizaje se implementó mediante la callback ReduceLROnPlateau, que monitorizaba la pérdida de validación y reducía la tasa de aprendizaje en un factor de 0,3 tras 2 épocas sin mejora, con una tasa mínima de aprendizaje de 1 × 10⁻7. Los detalles completos de implementación y la configuración de parámetros se proporcionan en el Archivo Suplementario 1. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20. Se utilizó una semilla aleatoria fija (42) para asegurar la reproducibilidad. Los detalles completos de la implementación se proporcionan en el Archivo Suplementario 1.

figure-protocol-1
Figura 1. Flujo de trabajo del marco CARE-MIRV-Net para el análisis de planos residenciales. Resumen esquemático del protocolo propuesto. El flujo de trabajo incluye (1) adquisición y preprocesamiento de conjuntos de datos, (2) aprendizaje y predicción de características usando MobileNetV2, InceptionV3, ResNet101 y VGG16, (3) predicción de metaensambles basada en apilamiento usando CARE-MIRV-Net, (4) clasificación de layout residencial basada en reglas, (5) análisis de interpretabilidad basado en SHapley Additive ExPlanations (SHAP) y (6) evaluación del rendimiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En la segunda fase, se emplean cuatro CNN preentrenadas, MobileNetV2, InceptionV3, ResNet101 y VGG16, como aprendices base. Cada modelo se ajusta con conocimientos por transferencia para predecir atributos arquitectónicos clave, incluyendo la superficie, el número de dormitorios, baños y garajes. Para cada modelo de aprendizaje por transferencia, las capas inferiores preentrenadas se mantuvieron congeladas, mientras que las capas superiores y la cabeza de regresión personalizada se ajustaron durante el entrenamiento. Las configuraciones detalladas de ajuste fino específicas de cada modelo se proporcionan en el Archivo Suplementario 1. Estos modelos capturan diferentes aspectos de la información espacial: MobileNetV2 proporciona una extracción eficiente de características, InceptionV3 captura patrones espaciales multiescala, ResNet101 aprende representaciones jerárquicas profundas y VGG16 garantiza un aprendizaje de características estable y consistente. La diversidad entre estos modelos mejora la capacidad representacional global del marco.

Para mejorar aún más la precisión y robustez de la predicción, se propone un modelo de meta-conjunto basado en apilamiento, denominado CARE-MIRV-Net. En este paso, las predicciones de todos los modelos base se agrupan para crear un espacio de características de mayor dimensión, que se introduce en un meta-aprendiz. Las predicciones del modelo base se generan primero de forma independiente utilizando los modelos entrenados MobileNetV2, InceptionV3, ResNet101 y VGG16. Estas predicciones se concatenan para formar el vector meta-característica utilizado por el meta-aprendiz. Para evitar fugas de datos, los conjuntos de datos de entrenamiento y pruebas están estrictamente separados, y el meta-aprendiz se entrena únicamente con predicciones generadas a partir de los datos de entrenamiento. El metamodelo, que es una red neuronal totalmente conectada, se entrena para aprender la combinación óptima de salidas del modelo base para producir predicciones refinadas. El meta-modelo consta de dos capas totalmente conectadas con 512 y 256 neuronas usando activación ReLU, seguidas de capas de dropout (0,4 y 0,3) y una capa de salida lineal. El modelo se entrena usando el optimizador Adam (tasa de aprendizaje = 0,0001), un tamaño de lote de 32 y hasta 15 épocas. La parada temprana se implementó monitorizando la pérdida de validación (val_loss) con un valor de paciencia de 5 épocas. El criterio mínimo de mejora (min_delta) se estableció en el valor por defecto de TensorFlow de 0, y los mejores pesos del modelo se restauraron automáticamente tras el entrenamiento. La planificación adaptativa de la tasa de aprendizaje se implementó mediante la callback ReduceLROnPlateau, que monitorizaba la pérdida de validación y reducía la tasa de aprendizaje en un factor de 0,3 tras dos épocas consecutivas sin mejora. La tasa mínima de aprendizaje se estableció en 1 × 10⁻7, y el parámetro de enfriamiento usó el valor predeterminado de TensorFlow de 0. Este método de conjunto reduce los sesgos individuales de los modelos y mejora la generalización gracias a las fortalezas complementarias de múltiples arquitecturas. La información detallada de implementación se proporciona en el Archivo Suplementario 1.

Tras la predicción, se añade una capa de interpretación para convertir las salidas numéricas en decisiones a nivel de aplicación. Las distribuciones residenciales pueden clasificarse en tres clases basándose en las predicciones de características arquitectónicas: atención a personas mayores, integración sanitaria (atención médica) y uso residencial general. Esta clasificación se realiza utilizando reglas de decisión predefinidas basadas en umbrales, basadas en la superficie predicha, el número de dormitorios y el número de baños. La categoría con la puntuación más alta se asigna como clasificación final, mientras que los empates se resuelven seleccionando la categoría que cumple con el mayor número de criterios de decisión. Las reglas completas de puntuación y los umbrales de clasificación se proporcionan en el Archivo Suplementario 2 (Algoritmo 1). Esta acción permite que el marco proporcione información práctica para el diseño de viviendas residenciales.

El marco utiliza IA explicable con SHAP para proporcionar transparencia e interpretabilidad. Este componente examina la contribución de las predicciones de cada modelo base a la salida del metamodelo. El análisis SHAP se realizó utilizando SHAP KernelExplainer (SHAP versión 0.51.0) con 100 muestras de entrenamiento seleccionadas aleatoriamente como conjunto de datos de fondo y 50 muestras de prueba para generación de explicaciones. La configuración completa de SHAP, incluyendo la selección de muestras en segundo plano y la configuración de implementación, se proporciona en el Archivo Suplementario 1. La capa de explicabilidad ayuda a comprender el proceso de toma de decisiones midiendo la importancia de las características y mostrando los patrones de contribución, mejorando así la transparencia y fiabilidad del modelo. El marco propuesto se evalúa utilizando MAE yR2 en todas las variables objetivo. Para la predicción multisalida, el MAE se calculó como la diferencia absoluta media entre los valores reales y predichos en todas las variables objetivo, mientras que R2 se calculó comparando la varianza explicada de las predicciones con los valores de verdad fundamental correspondientes para cada salida. Los análisis cuantitativos y cualitativos indican que el propuesto CARE-MIRV-Net mejora la precisión de la predicción y soporta la clasificación de la distribución residencial basada en reglas. La fiabilidad de la clasificación se evaluó en función de la precisión de las predicciones de regresión subyacentes y la consistencia de la capa de decisión basada en reglas. El marco es una solución adecuada y escalable para el análisis inteligente de planos de planta y puede aplicarse a viviendas inteligentes, planificación de cuidados a personas mayores y diseño residencial orientado a la atención sanitaria. Una lista completa de conjuntos de datos, paquetes de software, bibliotecas, recursos hardware y herramientas computacionales utilizados en este estudio se proporciona en la Tabla de Materiales. El código fuente, la información de configuración del entorno, las especificaciones de dependencia de software y los scripts de implementación necesarios para reproducir el flujo de trabajo reportado se proporcionan en el Archivo Suplementario 1.

Algoritmo para el protocolo

El marco propuesto adopta un enfoque multietapa para procesar planos de plantas basados en imágenes de viviendas residenciales y producir resultados predictivos y a nivel de decisión, como se muestra en el Algoritmo 1 en el Archivo Suplementario 2. Este proceso comienza con el preprocesamiento de datos, en el que las imágenes de entrada se redimensionan a una resolución estándar y se normalizan para proporcionar uniformidad en todo el conjunto de datos. Todas las imágenes de planos de planta se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1]. Este paso optimiza las imágenes para el aprendizaje mediante redes neuronales profundas y mejora la convergencia global del modelo. La segunda fase implica el uso de varios modelos DL como aprendices base, incluyendo MobileNetV2, InceptionV3, ResNet101 y VGG16. De forma independiente, cada modelo toma las imágenes de entrada y estima características arquitectónicas importantes como la superficie y el número de dormitorios, baños y garajes. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20, y se utilizó una semilla aleatoria fija para asegurar la reproducibilidad. Estos modelos capturan diferentes propiedades espaciales de los planos de planta y proporcionan predicciones complementarias. La representación de características se construye apilando las salidas de cada modelo base para crear una única representación de características. Esta salida conjunta se introduce posteriormente en un modelo meta-ensamble, CARE-MIRV-Net, que se entrena para combinar las predicciones de todos los modelos base. Las predicciones del modelo base se generaban de forma independiente y se concatenaban para formar el vector meta-característica. Se evitó la fuga de datos mediante la estricta separación de los conjuntos de datos de entrenamiento y prueba. El metamodelo refina estas predicciones y produce las previsiones finales de atributos arquitectónicos. El metamodelo consistía en capas totalmente conectadas con 512 y 256 neuronas, funciones de activación de ReLU, tasas de abandono de 0,4 y 0,3, el optimizador Adam (tasa de aprendizaje = 0,0001), un tamaño de lote de 32 y hasta 15 épocas de entrenamiento con detención temprana. Tras la predicción, se utiliza una capa de decisión para contextualizar los resultados. Según los valores estimados, cada distribución residencial se clasifica como cuidado de personas mayores, atención médica o uso residencial general. Las categorías residenciales se asignaron utilizando reglas de puntuación basadas en umbrales predefinidas derivadas de los atributos predichos del plano de planta. La categoría con la puntuación más alta se seleccionaba como clasificación final. Los umbrales completos de clasificación y las reglas de decisión se proporcionan en el Algoritmo 1 (Archivo Suplementario 2). Por último, el marco incorpora un componente de explicabilidad basado en SHAP para evaluar el impacto de cada modelo base en la predicción final. El análisis SHAP se realizó tal como se describió previamente y en el Archivo Suplementario 1. Este componente aumenta la transparencia y ayuda a comprender el proceso de toma de decisiones. La efectividad y viabilidad del enfoque propuesto se evaluaron utilizando medidas estándar de regresión de desempeño. El rendimiento se evaluó mediante una única ejecución experimental con una semilla aleatoria fija.

Modelos de evaluación

En esta sección se presentan los modelos DL utilizados en el estudio, incluyendo tanto los modelos base individuales como el propuesto CARE-MIRV-Net. Los modelos de referencia fueron seleccionados para representar arquitecturas DL diversas y ampliamente adoptadas. MobileNetV2 fue incluido como una red ligera y computacionalmente eficiente, y InceptionV3 fue seleccionado por su capacidad para capturar características espaciales multiescala. ResNet101 fue elegido por su capacidad profunda de aprendizaje residual para la extracción jerárquica de características, y VGG16 se incluyó como una arquitectura convolucional bien establecida. Todos los modelos de benchmark se entrenaron utilizando procedimientos de preprocesamiento, ajustes de aumento de datos, particiones de conjuntos de datos, parámetros de optimización, tamaño del lote y configuración de entrenamiento idénticos para garantizar una evaluación comparativa justa.

MobileNetV2:

MobileNetV2 es un sistema CNN pequeño y compacto diseñado para ser rápido, de alto rendimiento y con menos complejidad computacional. Presenta algunas de las principales innovaciones como conexiones residuales invertidas y cuellos de botella lineales, que facilitan la extracción eficiente de características y mantienen un alto poder representativo. MobileNetV2 puede usar convoluciones separables en profundidad para minimizar considerablemente el número total de parámetros y el coste computacional de las redes convolucionales tradicionales, por lo que está bien adaptado a grandes problemas de aprendizaje basados en imágenes.

MobileNetV2 se utiliza en el marco sugerido como uno de los modelos base de DL para predecir los atributos arquitectónicos de las imágenes de planos residenciales. El modelo es capaz de aprender patrones espaciales como la distribución de las habitaciones, la densidad de la distribución y la organización estructural que ocurren en los planos de planta de forma eficaz gracias a su diseño eficiente. Estas representaciones eruditas desempeñan un papel importante a la hora de estimar con precisión características importantes como la superficie, el número de dormitorios, baños y garajes. MobileNetV2 es un modelo ligero, que es un buen candidato para ser incluido en el marco propuesto de meta-ensambles. Añade algunas representaciones complementarias de características a otros modelos DL y mejora la robustez y generalización general del sistema. Este aprendizaje de modelos es muy importante para mejorar la precisión de las predicciones y para ayudar en la clasificación de diseños residenciales basados en la atención sanitaria.

El modelo MobileNetV2 se entrena utilizando una estrategia de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a un tamaño fijo de 224 × 224 × 3, lo cual es compatible con la arquitectura. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se elimina la cabeza de clasificación inicial de MobileNetV2 y se sustituye por una cabeza de regresión. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Para facilitar la adaptación al dominio, las capas inferiores preentrenadas se congelaron, mientras que las capas superiores que comenzan en block_13_expand y la cabeza de regresión personalizada fueron ajustadas finamente. Este enfoque selectivo de entrenamiento permite al modelo conservar características visuales generales mientras aprende atributos espaciales específicos de las imágenes de planos de planta. Los mapas de características extraídos se procesan a través de una capa de Global Average Pooling y capas totalmente conectadas con 512 y 256 neuronas mediante activación ReLU. Para mejorar la generalización y reducir el sobreajuste, se incorporan capas de normalización por lotes y de dropout (0,4 y 0,3). La capa final de salida contiene cuatro neuronas con activación lineal correspondientes a los atributos arquitectónicos predichos. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001 y parámetros por defecto TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas. Se aplicó una parada temprana basada en la pérdida de validación, y se empleó la reducción adaptativa de la tasa de aprendizaje para mejorar la convergencia. El entrenamiento se realizó hasta 15 épocas.

InceptionV3:

InceptionV3 es una arquitectura CNN profunda capaz de capturar características multiescala mediante el uso de operaciones convolucionales paralelas. Se basa en el módulo Inception, que utiliza una variedad de tamaños de filtro en la misma capa para extraer características de grano fino y grueso al mismo tiempo. Este tipo de diseño arquitectónico permite que la red aprenda jerarquías espaciales complejas y sea eficiente computacionalmente. Además, InceptionV3 utiliza convoluciones factorizadas y reducción de dimensionalidad, que mejoran el rendimiento y minimizan el coste computacional.

InceptionV3 se aplica en el marco propuesto como un extractor eficaz de características para analizar imágenes de planos residenciales. Los planos de planta consisten en una variedad de patrones espaciales, como tamaños de habitaciones, planos estructurales y conectividad, lo que requiere aprendizaje de características a múltiples escalas. La arquitectura Inception es especialmente adecuada para esta tarea porque es capaz de representar al mismo tiempo aspectos locales específicos (por ejemplo, habitaciones pequeñas) y estructuras globales (por ejemplo, la organización de la disposición general). InceptionV3 ofrece representaciones complementarias a otros modelos como MobileNetV2 en el contexto del marco meta-ensemble. La diversidad de predicciones aumenta gracias a su capacidad para modelar relaciones espaciales complejas, lo que es importante para mejorar el rendimiento del conjunto. Esto ayuda finalmente a predicir mejor las características arquitectónicas y refuerza la clasificación posterior de un diseño de viviendas amigables con personas mayores e integradas en la atención sanitaria.

El modelo InceptionV3 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3 para garantizar la compatibilidad con la arquitectura de red y la consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares.

Se eliminan las capas originales de clasificación de InceptionV3 y se introduce una cabeza de regresión personalizada para permitir la predicción multioutput. La cabeza de regresión personalizada consistía en una capa de Global Average Pooling seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. La base convolucional está parcialmente ajustada, con las capas inferiores preentrenadas congeladas y las capas superiores, junto con la cabeza de regresión personalizada, ajustadas para aprender características específicas del plano de planta de dominio mientras se conservan representaciones visuales generales adquiridas durante el preentrenamiento. Tras la columna vertebral convolucional, una capa de Global Average Pooling transforma los mapas de características en una representación compacta de características. A esto le siguen capas totalmente conectadas que contienen 512 y 256 neuronas con funciones de activación de ReLU. Para minimizar el sobreajuste y mejorar la generalización, se aplican tasas de dropout de 0,4 y 0,3. La capa final de salida consta de cuatro neuronas con activación lineal que corresponde a la predicción de metros cuadrados, número de dormitorios, baños y número de garajes. El modelo se entrena utilizando el optimizador Adam con una tasa de aprendizaje de 0,0001, un tamaño de lote de 32 y hasta 15 épocas de entrenamiento con paradas tempranas y reducción adaptativa de la tasa de aprendizaje para asegurar una convergencia estable.

ResNet101:

ResNet101 es una estructura profunda de la CNN construida sobre el principio del aprendizaje residual que permite entrenar redes extremadamente profundas superando el problema del gradiente nulo. Añade conexiones residuales, o llamadas conexiones de salto, que permiten a la red aprender mapeos de identidad y retener información entre capas. Esta arquitectura mejora enormemente la estabilidad del entrenamiento y permite al modelo aprender características jerárquicas complejas. ResNet101 tiene una gran capacidad representacional de 101 capas y, por tanto, es muy eficaz en tareas que requieren características espaciales adicionales.

ResNet101 se utilizará en el marco propuesto como extractor de características de alta capacidad, que analizará las imágenes de planos residenciales. El modelo puede utilizarse para representar relaciones espaciales complejas, incluyendo conectividad de salas, complejidad de distribución y variaciones estructurales, debido a su arquitectura profunda. Estas características son fundamentales para hacer predicciones precisas sobre elementos arquitectónicos como metros cuadrados, dormitorios, baños y garajes. En el diseño del meta-ensemble, ResNet101 es un componente importante y proporciona representaciones profundas y abstractas de características. ResNet101 se preocupa más por las características estructurales de grano fino y, por tanto, es más diverso entre los aprendices base en comparación con modelos ligeros como MobileNetV2. Esta heterogeneidad juega un papel esencial en mejorar el rendimiento de un conjunto y predicciones sólidas, especialmente cuando se trata de la clasificación residencial basada en el sector sanitario.

ResNet101 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3, lo que garantiza compatibilidad arquitectónica y consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se elimina el cabezal de clasificación original de ResNet101 (include_top=Falso), y se introduce un cabezal de regresión personalizado para permitir la predicción multisalida. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Para equilibrar la reutilización de características y la adaptación del dominio, las capas preentrenadas inferiores se congelaron, mientras que las capas más profundas que partían de conv4_block1_1_conv y la cabeza de regresión personalizada fueron ajustadas finamente. Esta estrategia de entrenamiento selectivo permite al modelo conservar características visuales genéricas mientras adapta representaciones de nivel superior a imágenes de planos de planta. La salida de la base convolucional se pasa a través de una capa de Agrupación de Promedios Globales para generar una representación compacta de características. A esto le siguen capas totalmente conectadas con 512 y 256 neuronas que utilizan funciones de activación de ReLU. La normalización por lotes se aplica para estabilizar el aprendizaje, y se incorporan capas de dropout con tasas de 0,4 y 0,3 para reducir el sobreajuste y mejorar la generalización. La capa final de salida contiene cuatro neuronas con activación lineal correspondiente a la superficie, número de dormitorios, baños y garajes. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001, como se describe en la configuración de entrenamiento. La ampliación de datos incluía volteos aleatorios, rotación, zoom y desplazamiento para mejorar la generalización del modelo. El entrenamiento se realizó hasta 15 épocas, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativo.

VGG16:

VGG16 es una arquitectura de red neuronal sencilla de tipo convolucional profundo que es eficaz y sencilla en tareas de reconocimiento visual. Está compuesto por 16 capas con un diseño regular u homogéneo que incorpora pequeños filtros convolucionales de 3 × 3, que facilitan el aprendizaje de representaciones jerárquicas de características por parte de la red. La arquitectura es profunda y sencilla, lo que significa que es capaz de capturar detalles de bajo nivel como bordes, texturas y estructuras semánticas de alto nivel. VGG16, con su diseño habitual y buen rendimiento, es ahora una opción popular de backbone cuando realiza aprendizaje por transferencia en tareas relacionadas con imágenes.

En el modelo sugerido, VGG16 se utiliza como modelo base de DL para derivar características espaciales de imágenes de planos residenciales. El hecho de que esté organizado le permite ser muy útil para captar los detalles más finos de los patrones de distribución, como los límites de las habitaciones, las alineaciones estructurales y la organización espacial. Estas características son fundamentales para predecir eficazmente los atributos de la arquitectura como los pies cuadrados, dormitorios, baños y garajes. En el sistema meta-ensemble, VGG16 proporciona representaciones de características estables y bien generalizadas. VGG16 ofrece un enfoque de extracción de características más equilibrado en comparación con arquitecturas más profundas, como ResNet101, y arquitecturas multiescala, como InceptionV3, aumentando la diversidad base del aprendizaje. Esta heterogeneidad es fundamental para mejorar el rendimiento del conjunto y las previsiones fiables de la clasificación residencial orientada a la atención sanitaria.

El modelo VGG16 se entrena utilizando un enfoque de aprendizaje por transferencia con pesos preentrenados del conjunto de datos ImageNet. Las imágenes de entrada se escalan a 224 × 224 × 3 para garantizar compatibilidad con la arquitectura y la consistencia entre todos los modelos dentro del marco. Las imágenes se redimensionaron a 224 × 224 píxeles, normalizadas al rango [0, 1] y aumentadas mediante cambios aleatorios, rotación, zoom y desplazamiento. Durante la formación se utilizó un lote de 32 ejemplares. Se eliminan las capas de clasificación originales (include_top=Falso), y se añade una cabeza de regresión personalizada para adaptar el modelo a la predicción multioutput. La cabeza de regresión consistía en una capa de Pooling de Promedio Global seguida de capas totalmente conectadas con 512 y 256 neuronas, normalización por lotes, capas de dropout (0,4 y 0,3) y una capa lineal de salida de cuatro neuronas. Las capas inferiores preentrenadas estaban congeladas, mientras que las capas que partían de block4_conv1 y la cabeza de regresión personalizada estaban ajustadas finamente. Esta estrategia permite al modelo conservar características visuales generales mientras aprende representaciones específicas de dominio relevantes para el análisis de plantas. Las características de salida de la base convolucional se pasan por una capa de Agrupación de Promedios Globales para generar un vector de características compacto. A esto le siguen capas totalmente conectadas con 512 y 256 neuronas que utilizan funciones de activación de ReLU. Se incorporan capas de normalización por lotes y de dropout con tasas de 0,4 y 0,3 para estabilizar el entrenamiento, reducir el sobreajuste y mejorar la generalización. La capa final de salida contiene cuatro neuronas con activación lineal correspondiente a la superficie, número de dormitorios, baños y predicciones de garaje. El optimizador Adam se utilizó con una tasa de aprendizaje de 0,0001, como se describe en la configuración de entrenamiento. La ampliación de datos incluía volteos aleatorios, rotación, zoom y desplazamiento para mejorar la generalización del modelo. El entrenamiento se realizó hasta 15 épocas, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativo.

CARE-MIRV-Net (Modelo Propuesto de Lanzamiento de Meta-Ensamble):

El CARE-MIRV-Net sugerido (Context-Aware Residential Ensemble utilizando MobileNetV2, InceptionV3, ResNet101 y VGG16 Network) es un marco DL basado en meta-ensambles apilados que tiene como objetivo mejorar la estimación de características arquitectónicas basándose en imágenes de planos residenciales. La arquitectura combina diversas CNN heterogéneas explotando sus ventajas sinérgicas en la extracción de características. El modelo propuesto se basa en la combinación de arquitectura ligera, profunda y multiescala que mejora el rendimiento predictivo y proporciona robustez en una amplia variedad de distribuciones residenciales. A diferencia de las técnicas tradicionales basadas en un solo modelo, CARE-MIRV-Net sigue un enfoque jerárquico de aprendizaje, donde los modelos base proporcionan predicciones iniciales, que luego son mejoradas por un meta-aprendiz.

Cuando se trata de un diseño residencial que sea espacialmente consciente y respetuoso de la salud, la correcta interpretación de la distribución de los planos es de suma importancia. Los modelos DL individuales tienden a ser insuficientes para generalizar diferentes patrones arquitectónicos. El marco propuesto superará esta debilidad utilizando cuatro arquitecturas diferentes: MobileNetV2, InceptionV3, ResNet101 y VGG16, que aportan diferentes capacidades representacionales propias. MobileNetV2 puede usarse para extraer características de forma eficiente y es ligero; InceptionV3 aprende patrones espaciales a través de múltiples escalas; ResNet101 aprende representaciones jerárquicas profundas; y VGG16 aprende características de forma consistente y fiable. Una combinación de estos modelos facilita que el marco abarque tanto los atributos espaciales locales como globales, lo que mejora la precisión y fiabilidad de las características previstas como la superficie, el número de dormitorios, baños y garajes. Las predicciones anteriores también pueden utilizarse para predecir una clasificación adicional de las distribuciones residenciales, incluyendo opciones amigables para personas mayores, integradas en la atención sanitaria y residenciales generales.

CARE-MIRV-Net se implementa utilizando una estrategia de ensamble basada en apilamiento en dos etapas. En la primera etapa, los cuatro modelos base generan predicciones de forma independiente para las variables objetivo. Las entradas del meta-aprendiz se generaban concatenando las salidas de predicción producidas por los modelos base entrenados sobre los datos de entrenamiento. Estas predicciones concatenadas formaron los vectores meta-características de 16 dimensiones usados para el entrenamiento de metamodelos. Se evitó la fuga de información mediante la estricta separación de los conjuntos de datos de entrenamiento y prueba, y no se utilizaron muestras de prueba ni durante el entrenamiento en modelos base ni en metamodelos. Durante el proceso de apilamiento se emplearon los mismos conjuntos de datos de entrenamiento y validación utilizados para los modelos base. Durante el entrenamiento y la inferencia, el vector meta-característica de 16 dimensiones se construyó concatenando las cuatro salidas de predicción generadas por MobileNetV2, InceptionV3, ResNet101 y VGG16. Dado que cada modelo genera un vector de salida de cuatro dimensiones, la representación concatenada produce una entrada de 16 dimensiones para el meta-aprendiz. Esta transformación combina las predicciones de todos los modelos base y sirve como entrada a la segunda etapa del marco. La segunda etapa consiste en construir un meta-aprendiz de red neuronal completamente conectada para aprender la combinación óptima de predicciones del modelo base. El meta-aprendiz consistía en capas totalmente conectadas con 512 y 256 neuronas, activación de ReLU, normalización por lotes, tasas de abandono de 0,4 y 0,3, y una capa lineal de salida de cuatro neuronas. Las capas de dropout con tasas de 0,4 y 0,3 se aplicaron después de las capas densas para reducir el sobreajuste y mejorar la generalización. El meta-modelo fue entrenado usando el optimizador Adam con una tasa de aprendizaje de 0,0001, un tamaño de lote de 32 y hasta 15 épocas con paradas tempranas y reducción adaptativa de la tasa de aprendizaje. Los datos de validación se utilizaron para monitorizar el rendimiento del modelo durante el entrenamiento y seleccionar el modelo con mejor rendimiento. Tras el entrenamiento, el modelo meta-conjunto generó predicciones finales combinando los resultados de todos los aprendices base. MAE yR 2 se utilizaron para evaluar el rendimiento de CARE-MIRV-Net. Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas. Los resultados se obtuvieron de una única ejecución experimental utilizando una semilla aleatoria fija. El marco propuesto mejora la capacidad predictiva al combinar varias estructuras DL mediante un mecanismo de apilamiento y proporcionar un análisis interpretable de planos residenciales. Esto hace que CARE-MIRV-Net sea aplicable en el contexto de un diseño residencial centrado en la geriatría y orientado a la atención sanitaria. El código fuente, la información de configuración del entorno, las especificaciones de dependencia de software y la documentación de implementación se proporcionan en el Archivo Suplementario 1.

Evaluación del rendimiento

El análisis del rendimiento del marco propuesto se realiza para determinar su poder predictivo, robustez y rendimiento generalizador a través de diferentes características arquitectónicas. Se realizan análisis cuantitativos y cualitativos para confirmar la utilidad del modelo propuesto. El procedimiento de evaluación implica tanto medidas estándar de regresión como entornos experimentales controlados para permitir una comparación justa con los modelos de referencia. Los experimentos se realizaron utilizando una única ejecución experimental con una semilla aleatoria fija para asegurar la reproducibilidad y consistencia en todos los modelos de referencia y propuestos.

Parámetros de rendimiento:

Se utilizan dos medidas de regresión bien conocidas, MAE y R2, para evaluar el rendimiento del marco propuesto. El MAE mide la magnitud media de los errores de predicción y proporciona una indicación clara de la proximidad entre los valores predichos y los reales. Por el contrario, el valor R2 se utiliza para evaluar la proporción de varianza en las variables objetivo explicadas por el modelo, reflejando su poder predictivo global. Una combinación de estas métricas proporciona una evaluación exhaustiva de la precisión y el rendimiento generalizado de todas las características arquitectónicas predichas. Para la predicción multioutput, MAE y R2 se calcularon comparando los valores predichos y reales de cada variable objetivo y luego promediando los resultados entre todas las salidas.

Montaje experimental:

Los experimentos se realizaron en un entorno de computación en la nube usando Python (versión 3.12.12). El protocolo propuesto se implementó usando TensorFlow (versión 2.19.0), Keras (versión 3.13.2), NumPy (versión 2.4.6), Pandas (versión 2.3.3), Scikit-learn (versión 1.6.1), Matplotlib (versión 3.9) y SHAP (versión 0.51.0). El entorno computacional utilizaba un procesador Intel Xeon que operaba a 2,20 GHz con aproximadamente 31 GB de memoria del sistema. Los experimentos se realizaron en un sistema operativo Ubuntu 22.04 LTS utilizando GPUs NVIDIA Tesla T4 × 2. El conjunto de datos contiene 2.640 imágenes de planos residenciales que fueron preprocesadas y subdivididas en conjuntos de datos de entrenamiento y prueba. El conjunto de datos se dividió utilizando una proporción de división 80:20, resultando en 2.112 muestras de entrenamiento y 528 muestras de prueba. MobileNetV2, InceptionV3, ResNet101 y VGG16 son cuatro modelos DL que fueron entrenados usando un enfoque de ajuste fino con aprendizaje por transferencia. A continuación, se construyó un modelo meta-conjunto basado en apilamiento, CARE-MIRV-Net, para combinar predicciones de estos modelos base. Cada modelo se entrenó bajo condiciones uniformes, incluyendo redimensionamiento de imagen a 224 × 224 píxeles, aumento de datos y paradas anticipadas para reducir el sobreajuste. La ampliación de datos incluía giros aleatorios, rotación, zoom y desplazamiento. Se utilizó un tamaño de lote de 32 y un máximo de 15 épocas de entrenamiento, con una suspensión temprana basada en la pérdida de validación y la reducción de la tasa de aprendizaje adaptativa. El análisis final se realizó en un conjunto de pruebas oculto para proporcionar una evaluación imparcial y fiable del rendimiento. El conjunto de pruebas oculto se generó durante la partición inicial del conjunto de datos y permaneció completamente aislado durante el entrenamiento y desarrollo del modelo para garantizar una evaluación del rendimiento imparcial.

Descripción del conjunto de datos:

El conjunto de datos utilizado para respaldar los hallazgos de este estudio está disponible públicamente en la plataforma Kaggle con el título "Imágenes de planos de planta y sus detalles"28. El conjunto de datos está disponible en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (consultado el 16 de abril de 2026). Los datos consisten en 2.640 imágenes de planos residenciales y metadatos arquitectónicos organizados. Cada muestra es un plano de vivienda distinto, que ofrece una amplia gama de distribuciones residenciales con diferentes tamaños, configuraciones y disposiciones espaciales. El tamaño del conjunto de datos es suficiente para el entrenamiento basado en DL y contiene una variedad de patrones arquitectónicos. El conjunto de datos consiste en una imagen bidimensional de planta y atributos numéricos relacionados que describen las características estructurales de la residencia. Estas características incluyen la superficie total, el número de dormitorios, el número de baños y el número de garajes. Además, cada registro contiene una ruta de imagen, que permite el mapeo directo de entradas visuales a las etiquetas. Las variables del conjunto de datos incluyen la imagen del plano de planta, la ruta de la imagen, los metros cuadrados, el número de dormitorios, el número de baños y el número de garajes. La imagen del plano de planta sirve como elemento de entrada, mientras que los atributos arquitectónicos se utilizan como objetivos de predicción. Por tanto, el conjunto de datos es adecuado para el aprendizaje supervisado, con imágenes que sirven como características de entrada y atributos arquitectónicos como objetivos de regresión.

El conjunto de datos contiene una amplia variedad de distribuciones residenciales, que van desde diseños compactos con menos habitaciones hasta grandes diseños de varias habitaciones. Esta variabilidad permite el aprendizaje de representaciones espaciales significativas, incluyendo la distribución de las habitaciones, la densidad de la distribución y la complejidad estructural. Esta diversidad es especialmente importante para el marco propuesto, ya que apoya la categorización de los planos en disposiciones residenciales amigables para personas mayores, integradas en atención sanitaria y residenciales generales. Antes del entrenamiento del modelo, el conjunto de datos se procesa mediante una secuencia de procedimientos de preprocesamiento para garantizar la consistencia y compatibilidad con los modelos DL. Todas las imágenes se redimensionaron a 224 × 224 píxeles y se normalizaron al rango [0, 1] antes del entrenamiento. El conjunto de datos se organiza emparejando las rutas de imagen con sus metadatos correspondientes, tras lo cual se separa en subconjuntos de entrenamiento y prueba para facilitar el análisis del rendimiento. El conjunto de datos se dividió aleatoriamente en conjuntos de entrenamiento y pruebas usando una proporción de división 80:20. Los registros que contenían información completa de imágenes y metadatos se incluyeron en el análisis, mientras que los registros incompletos o inválidos se excluyeron. Durante la partición de conjuntos de datos se utilizó una semilla aleatoria fija para garantizar la reproducibilidad. El conjunto de datos proporciona una base detallada para el análisis impulsado por IA de planos residenciales. La combinación de 2.640 imágenes anotadas y diversos atributos arquitectónicos apoya el modelado de regresión multisalida y permite la integración de la inteligencia espacial con la toma de decisiones de diseño residencial orientado a la atención sanitaria.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se realizó un conjunto de experimentos para evaluar el marco propuesto utilizando cuatro modelos DL, MobileNetV2, InceptionV3, ResNet101 y VGG16, junto con el modelo propuesto de meta-conjunto CARE-MIRV-Net.

Resultados de la adquisición y preprocesamiento de conjuntos de datos

La fase de preprocesamiento se diseñó para preparar las imágenes en bruto del plano de planta y los metadatos relacionados para entrenamiento y evaluación utilizando modelos DL. El conjunto de datos se obtuvo del repositorio Kaggle y contenía 2.640 muestras. Cada muestra consistía en una imagen de planta y sus correspondientes atributos arquitectónicos. Solo se conservaron las columnas relevantes, incluyendo la ruta de la imagen, los metros cuadrados, los dormitorios, los baños y los garajes, para un análisis posterior, y se eliminaron los registros incompletos o en blanco para mantener la consistencia y calidad de los datos. Para facilitar el entrenamiento y la evaluación de modelos, el conjunto de datos se dividió en subconjuntos de entrenamiento y prueba con una proporción de 80:20, resultando en 2.112 muestras de entrenamiento y 528 muestras de prueba. Durante la partición de conjuntos de datos se utilizó una semilla aleatoria fija para garantizar la reproducibilidad. Esta división aseguró que los modelos se entrenaran con un conjunto de datos suficientemente grande, preservando al mismo tiempo un conjunto de pruebas independiente para la evaluación objetiva del rendimiento. Las rutas de imagen se estandarizaron mapeando cada registro a su ubicación correspondiente dentro del directorio del conjunto de datos. Los cuatro atributos arquitectónicos (pies cuadrados, dormitorios, baños y garajes) sirvieron como variables objetivo para la tarea de regresión multioutput. Aunque dormitorios, baños y garajes son variables discretas, se modelaron utilizando un marco de regresión multisalida para permitir la predicción simultánea de todos los atributos arquitectónicos dentro de una arquitectura de aprendizaje unificada. Este enfoque permite al modelo capturar relaciones compartidas entre las variables objetivo y explotar correlaciones entre características arquitectónicas continuas y discretas. Los valores predichos para atributos discretos se convirtieron al entero válido más cercano durante el postprocesado antes de la interpretación y la clasificación posterior del diseño residencial.

La Tabla 1 describe las características arquitectónicas previstas por el modelo propuesto, representando las características espaciales y funcionales clave de los planos residenciales. Se realizó un análisis exploratorio de datos para comprender mejor la distribución de las variables objetivo mediante histogramas y visualizaciones basadas en el recuento. La distribución de metros cuadrados es continua con densidades variables, mientras que la distribución de dormitorios, baños y garajes destaca la frecuencia de diferentes configuraciones residenciales. Estas distribuciones se representan en la Figura 2. La distribución de metros cuadrados se muestra en la Figura 2A, mientras que la distribución de dormitorios, baños y garajes se muestra en la Figura 2B–2D, respectivamente. En conjunto, estos gráficos ilustran la variabilidad y distribución de las variables objetivo dentro del conjunto de datos.

Nombre de la secciónDescripción
Metros cuadradosSuperficie total urbanizada de la unidad residencial
CamasNúmero de dormitorios en la distribución
BañosNúmero de baños en la distribución
GarajesNúmero de plazas de garaje disponibles

Tabla 1: Atributos arquitectónicos utilizados como objetivos de predicción. Definiciones de los atributos arquitectónicos extraídos del conjunto de datos de planos residenciales y utilizados como variables objetivo para el entrenamiento y evaluación de modelos. Las características incluyen la superficie total, el número de dormitorios, el número de baños y el número de espacios de garaje asociados a cada plano residencial.

figure-results-1
Figura 2. Distribución de atributos arquitectónicos en el conjunto de datos de planos de planta residenciales. Histogramas que muestran las distribuciones de (A) metros cuadrados, (B) número de dormitorios, (C) número de baños y (D) número de garajes en el conjunto de datos utilizado para el desarrollo y evaluación de modelos. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La etapa de preprocesamiento de imagen transformó todas las imágenes de planos en un formato estandarizado adecuado para modelos DL. Todas las imágenes se cargaban, convertían a espacio de color RGB, se redimensionaban a 224 × 224 píxeles y se normalizaban al rango de [0, 1]. Este proceso aseguró dimensiones de entrada consistentes y mejoró la convergencia del modelo durante el entrenamiento. Las imágenes preprocesadas se muestrearon aleatoriamente y se verificaron las etiquetas para confirmar el preprocesamiento y alineación correcta de la etiqueta. Tras el preprocesamiento, cada imagen se convertía en un array NumPy y se emparejaba con sus valores objetivo correspondientes para crear el conjunto de datos de entrada-salida. Los conjuntos de datos resultantes confirmaron la preparación exitosa de los datos, con imágenes de entrenamiento de dimensiones (2112, 224, 224, 3) y imágenes de prueba de dimensiones de (528, 224, 224, 3). Las matrices de etiquetas correspondientes tenían dimensiones (2112, 4) y (528, 4), respectivamente. Las variables objetivo se convirtieron a valores de coma flotante para apoyar el aprendizaje basado en regresión.

Para mejorar aún más la generalización del modelo y reducir el sobreajuste, se aplicaron técnicas de aumento de datos utilizando un generador de datos de imagen. Estas técnicas incluían giros horizontales aleatorios, rotación, zoom y desplazamiento de ancho/altura para aumentar la variabilidad de los datos de entrenamiento y mejorar la generalización del modelo. Estas transformaciones aumentaron la variabilidad de los datos de entrenamiento y permitieron a los modelos aprender características espaciales más robustas e invariantes. La cadena de preprocesamiento produjo datos de imagen y tabulares limpios, estandarizados y bien estructurados, proporcionando una base adecuada para entrenar el marco propuesto de aprendizaje profundo meta-ensemble.

Resultados de los modelos base y el modelo propuesto

El conjunto de datos preprocesado (2.640 imágenes de planos de planta) se utilizó para entrenar todos los modelos usando divisiones de entrenamiento y prueba. El conjunto de datos se dividió utilizando una proporción de división 80:20, resultando en 2.112 muestras de entrenamiento y 528 muestras de prueba. Se utilizaba una semilla aleatoria fija para asegurar la reproducibilidad. Se utilizaron pesos preentrenados para el aprendizaje por transferencia y el ajuste fino para adaptar los modelos al ámbito del análisis de planos arquitectónicos. Durante el entrenamiento se emplearon métodos de aumento de datos para mejorar la generalización, y se empleó una parada temprana para reducir el sobreajuste mediante el seguimiento del rendimiento de validación. Los modelos se entrenaron con un tamaño de lote de 32 durante hasta 15 épocas, aplicándose paradas tempranas para evitar sobreajustes y promover una convergencia eficiente. La parada temprana monitorizó la pérdida de validación y terminó el entrenamiento cuando no se observó ninguna mejora adicional, mientras que se aplicó una reducción adaptativa de la tasa de aprendizaje para mejorar la convergencia. Tanto la pérdida como la EMA se utilizaron para monitorizar el proceso de entrenamiento y evaluar el comportamiento y la estabilidad de convergencia. Todos los modelos se entrenaron bajo las mismas condiciones experimentales para garantizar una comparación justa. Las figuras 3–7 muestran las curvas de pérdida de entrenamiento y validación y MAE para todos los modelos, proporcionando información sobre su dinámica de aprendizaje y comportamiento de generalización.

figure-results-2
Figura 3. Rendimiento de entrenamiento de MobileNetV2. (A) Pérdida de formación y validación a través de épocas de entrenamiento. (B) El error absoluto medio (MAE) de entrenamiento y validación a lo largo de las épocas de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 4. Rendimiento de entrenamiento de InceptionV3. (A) Pérdida de formación y validación a través de épocas de entrenamiento. (B) El error absoluto medio (MAE) de entrenamiento y validación a lo largo de las épocas de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 5. Rendimiento de entrenamiento de ResNet101. (A) Pérdida de formación y validación a través de épocas de entrenamiento. (B) El error absoluto medio (MAE) de entrenamiento y validación a lo largo de las épocas de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 6. Rendimiento de entrenamiento de VGG16. (A) Pérdida de formación y validación a través de épocas de entrenamiento. (B) El error absoluto medio (MAE) de entrenamiento y validación a lo largo de las épocas de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-6
Figura 7. Rendimiento de entrenamiento de CARE-MIRV-Net. (A) Pérdida de formación y validación a través de épocas de entrenamiento. (B) El error absoluto medio (MAE) de entrenamiento y validación a lo largo de las épocas de entrenamiento. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El rendimiento de entrenamiento de MobileNetV2 se muestra en la Figura 3. Las curvas de pérdida de entrenamiento y validación se presentan en la Figura 3A, mientras que las curvas MAE de entrenamiento y validación se muestran en la Figura 3B. La pérdida de entrenamiento y la EMA disminuyeron gradualmente con el aumento de las épocas, lo que indica un comportamiento de aprendizaje estable. Las curvas de validación mostraron mayor variación y se mantuvieron relativamente más altas que las curvas de entrenamiento, lo que sugiere un menor rendimiento generalizado. Esta tendencia es coherente con los resultados cuantitativos, en los que MobileNetV2 demostró un rendimiento predictivo comparativamente menor, especialmente en la predicción de metros cuadrados. El rendimiento de entrenamiento de InceptionV3 se muestra en la Figura 4. Las curvas de pérdida de entrenamiento y validación se presentan en la Figura 4A, mientras que las curvas MAE de entrenamiento y validación se muestran en la Figura 4B. El modelo mostró una reducción constante tanto en la pérdida de entrenamiento como de validación y en la EMA, con solo una pequeña diferencia entre las curvas. Este comportamiento sugiere un aprendizaje efectivo y una generalización relativamente buena. Las curvas de validación estables indican que el modelo capturó eficazmente características espaciales multiescala, contribuyendo a un mejor rendimiento en comparación con MobileNetV2. El comportamiento de entrenamiento de ResNet101 se muestra en la Figura 5. Las curvas de pérdida de entrenamiento y validación se presentan en la Figura 5A, mientras que las curvas MAE de entrenamiento y validación se muestran en la Figura 5B. El modelo demostró un descenso gradual en la pérdida de entrenamiento y en la EAV, mientras que las curvas de validación siguieron una tendencia similar con fluctuaciones menores. Aunque se observó cierta oscilación, la convergencia general se mantuvo estable. Estas observaciones son coherentes con la capacidad del modelo para aprender representaciones espaciales jerárquicas mediante el aprendizaje residual. El rendimiento de entrenamiento de VGG16 se muestra en la Figura 6. Las curvas de pérdida de entrenamiento y validación se presentan en la Figura 6A, mientras que las curvas MAE de entrenamiento y validación se muestran en la Figura 6B.

Las curvas de entrenamiento de VGG16 mostraron una disminución continua a lo largo del entrenamiento, lo que indica un aprendizaje efectivo. Las curvas de validación mostraban oscilaciones y una ligera separación respecto a las curvas de entrenamiento, lo que sugiere un ligero sobreajuste. No obstante, el modelo siguió siendo competitivo, especialmente en cuanto a la superficie y la predicción de garajes, lo que indica que sus representaciones de características aprendidas seguían siendo efectivas y estables.

El rendimiento de entrenamiento de CARE-MIRV-Net se muestra en la Figura 7. Las curvas de pérdida de entrenamiento y validación se presentan en la Figura 7A, mientras que las curvas MAE de entrenamiento y validación se muestran en la Figura 7B. La pérdida de entrenamiento y validación y las curvas de EMA disminuyeron de forma suave y constante, con solo una pequeña diferencia entre ellas. Este comportamiento indica una fuerte convergencia y buena generalización. En comparación con los modelos individuales, el marco meta-conjunto produjo un comportamiento de aprendizaje más estable y una menor variabilidad. En general, la comparación de las curvas de entrenamiento sugiere que, aunque los modelos individuales mostraron diferentes características de convergencia y generalización, CARE-MIRV-Net mostró el comportamiento de entrenamiento más consistente entre los modelos evaluados.

En la Tabla 2 se proporciona una comparación detallada del rendimiento predictivo de MobileNetV2, InceptionV3, ResNet101, VGG16 y el modelo propuesto CARE-MIRV-Net. El rendimiento se evaluó utilizando MAE yR2 en cuatro variables objetivo: superficie, número de dormitorios, número de baños y número de garajes. Estas métricas proporcionan medidas complementarias de precisión en la predicción y rendimiento explicativo.

ModeloMetros cuadradosCamasBañosGarajes
MAEMAEMAEMAE
MobileNetV2881.6530.13270.68730.31540.65520.34570.39770.1133
InceptionV3464.640.66150.43530.67080.36270.74590.230.6351
ResNet101611.9190.58720.42870.65460.38380.7250.22980.6489
VGG16504.4350.72560.6980.33550.49950.64360.1970.6757
CARE-MIRV-Net (Propuesto)432.4880.70530.43430.68370.36890.76050.16970.6958

Tabla 2: Comparación de rendimiento entre modelos base y CARE-MIRV-Net. Comparación del rendimiento de predicción para MobileNetV2, InceptionV3, ResNet101, VGG16 y el modelo propuesto CARE-MIRV-Net a lo largo de cuatro atributos arquitectónicos: superficie, número de dormitorios, número de baños y número de garajes. El rendimiento se informa utilizando el error absoluto medio (MAE) y el coeficiente de determinación (R2). Valores más bajos de EMA indican un menor error de predicción, mientras que valores más altos deR 2 indican una mayor concordancia entre valores predichos y reales.

Los modelos individuales demostraron distintos niveles de rendimiento entre las variables objetivo. MobileNetV2 mostró el menor rendimiento global, especialmente en la predicción de metros cuadrados, con un MAE de 881,6530 y un valor de R2 de 0,1327. El rendimiento para baños y garajes también fue comparativamente menor, lo que indica limitaciones para capturar relaciones espaciales complejas cuando se usan como modelo independiente.

InceptionV3 demostró un rendimiento sólido en la mayoría de las variables objetivo, especialmente en baños y dormitorios, con valores de R2 de 0,7459 y 0,6708, respectivamente. Estos resultados sugieren una captura efectiva de características espaciales a múltiples escalas. ResNet101 también demostró un rendimiento competitivo gracias a su arquitectura deep residual, que facilitó el aprendizaje de representaciones espaciales jerárquicas. Sin embargo, su rendimiento se mantuvo ligeramente inferior al de InceptionV3 en algunas variables, incluida la predicción de metros cuadrados. El VGG16 ofreció un rendimiento relativamente equilibrado entre todas las variables objetivo y logró el mayor valor de R2 (0,7256) entre los modelos individuales.

El marco propuesto de CARE-MIRV-Net superó a los modelos individuales en la mayoría de las tareas evaluadas. CARE-MIRV-Net logró la menor superficie en metros cuadrados (432,488) manteniendo un valor de R2 de 0,7053. Para la predicción de dormitorios, el modelo alcanzó un valor deR 2 de 0,6837. Para la predicción del baño, CARE-MIRV-Net logró el valor más alto de R2 (0,7605) entre todos los modelos evaluados. De manera similar, para la predicción del garaje, el modelo alcanzó la MAE más baja (0,1697) y el valor más alto deR 2 (0,6958). Estos resultados indican que el marco meta-ensemble combinaba eficazmente las fortalezas complementarias de las arquitecturas individuales. Los resultados sugieren además que integrar predicciones de múltiples modelos redujo las limitaciones específicas del modelo y mejoró el rendimiento predictivo global. Los hallazgos demuestran que CARE-MIRV-Net proporcionó un rendimiento predictivo equilibrado en todas las variables objetivo evaluadas. La evaluación residencial orientada a la atención sanitaria presentada en este estudio debe interpretarse como una categorización orientada a la aplicación derivada del marco de decisión basado en reglas y los atributos disponibles del plano de planta, en lugar de una evaluación sanitaria clínicamente validada.

Para evaluar aún más el rendimiento predictivo, se realizó un análisis de errores residuales para todas las variables objetivo, incluyendo metros cuadrados, dormitorios, baños y garajes. Los gráficos residuales proporcionan información sobre las distribuciones de error de predicción al mostrar las diferencias entre los valores predichos y los observados. Idealmente, los residuos deberían distribuirse aleatoriamente alrededor de cero, lo que indica un sesgo sistemático limitado y una buena generalización.

La Figura 8 muestra el gráfico residual para la predicción de metros cuadrados. La mayoría de los residuos se agruparon alrededor de cero, lo que indica predicciones relativamente precisas para la mayoría de las muestras. Sin embargo, se observaron una mayor dispersión y varios valores atípicos en valores de mayor superficie prevista. Estas observaciones sugieren que la variabilidad de predicción aumentó para los diseños residenciales de mayor tamaño.

figure-results-7
Figura 8. Análisis residual para la predicción de metros cuadrados. Diagrama de dispersión que muestra errores residuales en función de los valores predichos de metros cuadrados. La línea horizontal indica error residual cero. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La distribución de los residuos para la predicción del dormitorio se muestra en la Figura 9. Los residuos generalmente se centraban en torno a cero, con el patrón diagonal reflejando la naturaleza discreta de la variable dormitorio. El rango residual relativamente estrecho indica un rendimiento predictivo consistente, sin observar sesgos sistemáticos evidentes. La Figura 10 presenta el gráfico residual para la predicción del baño. Los residuos se mantuvieron concentrados alrededor de cero pero mostraron una dispersión ligeramente mayor que los observados en la predicción del dormitorio. El patrón de bandas visibles es coherente con la naturaleza discreta de la variable objetivo. También estaban presentes varios valores atípicos en valores predichos más altos.

figure-results-8
Figura 9. Análisis residual para la predicción del dormitorio. Diagrama de dispersión que muestra errores residuales en función de los valores predichos de los dormitorios. La línea horizontal indica error residual cero. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-9
Figura 10. Análisis residual para la predicción del baño. Diagrama de dispersión que muestra errores residuales en función de los valores predichos del baño. La línea horizontal indica error residual cero. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

El análisis residual para la predicción del garaje se muestra en la Figura 11. Los valores residuales se mantuvieron concentrados alrededor de cero y mostraron una varianza relativamente baja en comparación con las demás variables objetivo. El rango discreto y limitado de valores de garaje producía patrones lineales distintos dentro del gráfico. La distribución residual estrecha sugiere un rendimiento predictivo relativamente consistente para esta variable.

figure-results-10
Figura 11. Análisis residual para la predicción del garaje. Diagrama de dispersión que muestra errores residuales en función de los valores predichos del garaje. La línea horizontal indica error residual cero. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

En general, los análisis residuales indican que CARE-MIRV-Net generó predicciones que se centraron generalmente en cero en todas las variables objetivo. Aunque se observó cierta variabilidad y valores atípicos, especialmente para la predicción de metros cuadrados, las distribuciones residuales generales apoyan la consistencia del rendimiento predictivo del modelo en todo el conjunto de datos evaluado.

Resultados del análisis explicable de IA usando SHAP

Para mejorar la interpretabilidad del marco propuesto CARE-MIRV-Net, se incorporó un enfoque de IA explicable usando SHAP. SHAP es un método basado en la teoría de juegos que explica las predicciones de modelos asignando valores de importancia de características basados en valores de Shapley. Cuando se aplicó al modelo propuesto de meta-ensamble, SHAP se utilizó para examinar la contribución de cada modelo base al resultado final del meta-aprendiz. La entrada al meta-modelo consistía en predicciones concatenadas de cuatro modelos base—InceptionV3, MobileNetV2, ResNet101 y VGG16—resultando en un espacio de características de 16 dimensiones. Cada elemento representaba un atributo arquitectónico predicho (metros cuadrados, dormitorios, baños o garajes) generado por un modelo base específico. La interpretación de estas características se realizó seleccionando un subconjunto elegido aleatoriamente de los datos de meta-entrenamiento como distribución de fondo y un subconjunto menor de muestras de prueba para la generación de explicaciones que mejoren la eficiencia computacional.

Se crearon versiones de salida única del meta-modelo para aislar y analizar las contribuciones de características para cada variable objetivo de forma independiente. El SHAP KernelExplainer se aplicó tal como se describió previamente y en el Archivo Suplementario 1 para estimar las contribuciones de características e interpretar las predicciones del marco propuesto. Estos valores se utilizaron para cuantificar hasta qué punto cada predicción del modelo base contribuía positiva o negativamente al resultado final. Según el análisis SHAP, CARE-MIRV-Net no se basó exclusivamente en un único aprendiz base, sino que asignó distintos niveles de importancia a distintos modelos según la variable objetivo y las características de entrada. Estas observaciones indican que el enfoque de conjunto basado en apilamiento utilizó información complementaria de múltiples modelos base.

Las figuras 12–15 presentan gráficos resumen SHAP para las cuatro variables objetivo: metros cuadrados, dormitorios, baños y garajes. Estos gráficos proporcionan una visión de cómo el metamodelo CARE-MIRV-Net utilizó las predicciones de los aprendices base individuales. En cada gráfico, el eje horizontal representa los valores SHAP (contribuciones de características), mientras que la escala de color representa la magnitud de las características desde valores bajos hasta altos.

figure-results-11
Figura 12. Gráfico resumen SHAP para la predicción de metros cuadrados. Gráfico resumen SHAP que muestra la contribución de las predicciones del modelo base a la estimación de metros cuadrados por parte del metaaprendiz CARE-MIRV-Net. Las características se clasifican según su importancia. El color de los puntos indica el valor de la característica, y la posición horizontal indica la contribución de SHAP a la predicción. SHAP, SHAPLEY Explicaciones aditivas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-12
Figura 13. Gráfico resumen SHAP para la predicción del dormitorio. Gráfico resumen SHAP que muestra la contribución de las predicciones del modelo base a la estimación en dormitorio por parte del meta-aprendiz CARE-MIRV-Net. Las características se clasifican según su importancia. El color de los puntos indica el valor de la característica, y la posición horizontal indica la contribución de SHAP a la predicción. SHAP, SHAPLEY Explicaciones aditivas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-13
Figura 14. Resumen gráfico SHAP para la predicción del baño. Gráfico resumen SHAP que muestra la contribución de las predicciones del modelo base a la estimación de baños por parte del metaaprendiz CARE-MIRV-Net. Las características se clasifican según su importancia. El color de los puntos indica el valor de la característica, y la posición horizontal indica la contribución de SHAP a la predicción. SHAP, SHAPLEY Explicaciones aditivas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-14
Figura 15. Gráfico resumen SHAP para la predicción del garaje. Gráfico resumen SHAP que muestra la contribución de las predicciones del modelo base a la estimación en garaje por parte del metaaprendiz CARE-MIRV-Net. Las características se clasifican según su importancia. El color de los puntos indica el valor de la característica, y la posición horizontal indica la contribución de SHAP a la predicción. SHAP, SHAPLEY Explicaciones aditivas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

La Figura 12 muestra el resumen SHAP para la predicción de metros cuadrados. Características como Mob_SF, Res_SF y Inc_SF mostraron contribuciones comparativamente mayores a SHAP que otras, lo que indica que las predicciones generadas por MobileNetV2, ResNet101 e InceptionV3 contribuyeron sustancialmente a la estimación de los metros cuadrados. Los valores más altos de las características (rojo) generalmente se asociaron con un aumento de la superficie predicha, mientras que los valores más bajos de las características (azul) se asociaron con predicciones más bajas. Las características relacionadas con dormitorios y baños mostraron contribuciones comparativamente menores, lo que indica que la predicción de metros cuadrados estuvo influenciada principalmente por las predicciones relacionadas con el área generadas por los modelos base.

La Figura 13 presenta el análisis SHAP para la predicción del dormitorio. Características como Res_Beds, VGG_Beds y Inc_Beds mostraron contribuciones comparativamente mayores que otras, lo que indica que las predicciones de ResNet101, VGG16 e InceptionV3 fueron influyentes en la determinación de la predicción final del dormitorio. Los valores de SHAP se distribuyeron alrededor de cero, lo que sugiere que el metamodelo integraba información de múltiples fuentes en lugar de depender de un único predictor dominante. Las características relacionadas con garajes y metros cuadrados mostraron contribuciones comparativamente menores.

La Figura 14 presenta el resumen SHAP para la predicción de baños. Características como VGG_Baths, Inc_Baths y Mob_Baths mostraron contribuciones comparativamente altas, lo que indica que las predicciones de VGG16, InceptionV3 y MobileNetV2 contribuyeron sustancialmente a la estimación del baño. La distribución de los valores de SHAP sugiere que el aumento de las predicciones de estos modelos base estuvo asociado a una mayor influencia en la predicción final. Las contribuciones aparecieron más distribuidas entre modelos que para algunas otras variables objetivo.

La Figura 15 presenta el análisis SHAP para la predicción de garajes. Características como Mob_Garages, Inc_Garages y VGG_Garages mostraron contribuciones relativamente fuertes a la predicción final. El gráfico demuestra que las predicciones relacionadas con el garaje de múltiples modelos base contribuyeron al resultado final, con una separación clara entre contribuciones de características de menor y alto valor. La mayor dispersión de los valores de SHAP sugiere una mayor sensibilidad del metamodelo a las características de predicción relacionadas con el garaje.

En general, el análisis SHAP demostró que el marco propuesto CARE-MIRV-Net integraba contribuciones de múltiples aprendices base al generar predicciones finales. Los resultados proporcionan una visión interpretable de la influencia relativa de las predicciones individuales de modelos a lo largo de las cuatro variables objetivo arquitectónicas y apoyan la comprensión del proceso de toma de decisiones del meta-conjunto.

Resultados de la clasificación de la distribución residencial

Ejemplos representativos de los resultados de clasificación de la distribución residencial se muestran en las figuras 16–18. Estos ejemplos ilustran la aplicación de la capa de decisión basada en reglas a los atributos arquitectónicos predichos por el marco CARE-MIRV-Net. La Figura 16 presenta un ejemplo clasificado como una distribución de atención médica, la Figura 17 presenta un ejemplo clasificado como una distribución residencial general, y la Figura 18 presenta un ejemplo clasificado como una distribución de atención a personas mayores. Los ejemplos demuestran cómo los atributos arquitectónicos predichos se traducen en categorías residenciales a nivel de aplicación mediante las reglas de decisión predefinidas descritas en la sección de Protocolo. Estos ejemplos deben interpretarse como resultados ilustrativos del marco de clasificación basado en reglas derivados de los atributos predichos del plano de planta y los criterios de decisión predefinidos, en lugar de ser clasificaciones clínicas o sanitarias validadas de forma independiente.

figure-results-15
Figura 16. Ejemplo representativo clasificado como un diseño residencial de atención médica. Ejemplo de imagen de planta residencial evaluada por el marco propuesto y asignada a la categoría de atención médica en función de los atributos arquitectónicos previstos y criterios de clasificación basados en reglas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-16
Figura 17. Ejemplo representativo clasificado como un diseño residencial general. Ejemplo de imagen de planta residencial evaluada por el marco propuesto y asignada a la categoría residencial general en función de los atributos arquitectónicos previstos y criterios de clasificación basados en reglas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-17
Figura 18. Ejemplo representativo clasificado como un diseño residencial para ancianos. Ejemplo de imagen de plano residencial evaluada por el marco propuesto y asignada a la categoría de cuidado de ancianos en función de los atributos arquitectónicos previstos y criterios de clasificación basados en reglas. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Un ejemplo representativo mostrado en la Figura 16 demuestra que el modelo predijo una superficie de 2233,16 metros cuadrados en comparación con el valor real de 2268,00, lo que indica un error de predicción relativamente pequeño. De manera similar, los valores predichos para dormitorios (3,23 vs. 3), baños (2,65 vs. 2) y garajes (1,11 vs. 1) estaban cerca de los valores de verdad a base correspondientes. Basándose en estos atributos predichos, la capa de decisión basada en reglas categorizó el diseño como atención médica. Este ejemplo ilustra cómo el marco aplica atributos arquitectónicos predichos para generar clasificaciones residenciales a nivel de aplicación.

Un segundo ejemplo mostrado en la Figura 17 muestra una disposición clasificada como uso residencial general. La superficie prevista (1692,76) era inferior al valor real (1879,00), mientras que el número previsto de dormitorios, baños y garajes se mantenía cerca de los valores de la verdad real correspondiente. En función de los atributos arquitectónicos previstos, la capa de decisión asignó la distribución a la categoría residencial general. Este ejemplo demuestra la aplicación del marco de clasificación a un diseño residencial de tamaño moderado a pesar de pequeñas desviaciones en las predicciones individuales.

La Figura 18 presenta una disposición residencial compacta con una superficie real de 981,00 metros cuadrados y una superficie prevista de 1076,17. Los valores predichos para dormitorios (1,99 vs. 2), baños (1,75 vs. 2) y garajes (0,98 vs. 1) también estuvieron cerca de los valores de verdad de base correspondientes. Basándose en estos atributos predichos, la capa de decisión categorizó la disposición como atención a personas mayores. Este ejemplo ilustra la aplicación de las reglas de clasificación predefinidas a distribuciones caracterizadas por superficies de suelo más pequeñas y menos habitaciones.

En general, los ejemplos representativos demuestran la integración de la predicción de atributos arquitectónicos y la categorización de distribución residencial basada en reglas dentro del marco CARE-MIRV-Net. En los ejemplos mostrados en las Figuras 16–18, los atributos arquitectónicos predichos eran generalmente consistentes con los valores de verdad de base correspondientes, lo que respalda el uso del marco propuesto para el análisis automatizado de planos residenciales y la clasificación a nivel de aplicación.

Disponibilidad de datos:

El conjunto de datos utilizado en este estudio está disponible públicamente a través del repositorio28 de Kaggle, titulado "Imágenes de planos de planta y sus detalles", y puede consultarse en: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details. Todos los análisis reportados en este estudio se realizaron utilizando datos obtenidos de esta fuente de acceso público. El código fuente, la documentación de implementación y la información de configuración del entorno necesarias para reproducir los resultados reportados se proporcionan en el Archivo Suplementario 1.

Archivo suplementario 1. Paquete de implementación CARE-MIRV-Net. Este archivo contiene el código fuente, la documentación de README, especificaciones de dependencia de software, información del entorno y scripts de implementación necesarios para reproducir el flujo de trabajo CARE-MIRV-Net. Por favor, haga clic aquí para descargar este archivo.

Archivo suplementario 2. Algoritmo para el análisis de planos residenciales CARE-MIRV-Net. Este archivo proporciona el Algoritmo 1, que incluye el preprocesamiento de datos, la predicción del modelo base, la concatenación de meta-características, la predicción del meta-conjunto, la clasificación por capas de decisión, la explicabilidad basada en SHAP y el flujo de trabajo de la métrica de evaluación utilizado en el estudio. Por favor, haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta CARE-MIRV-Net, un marco DL basado en meta-ensambles apilados para el análisis automatizado de imágenes de planos residenciales. El marco integra cuatro arquitecturas CNN complementarias—MobileNetV2, InceptionV3, ResNet101 y VGG16—para predecir atributos arquitectónicos clave, incluyendo metros cuadrados, número de dormitorios, baños y garajes. Estas predicciones se combinan posteriormente a través de un meta-aprendiz y se utilizan dentro de una capa de decisión basada en reglas para categorizar los diseños residenciales en categorías de cuidado de ancianos, atención médica o residencias generales. La integración de modelado predictivo, aprendizaje conjunto e IA explicable proporciona un marco unificado para el análisis de planosresidenciales 3,7,17,20.

Los resultados representativos demuestran que CARE-MIRV-Net logró un mejor rendimiento predictivo en comparación con los modelos base individuales en múltiples atributos arquitectónicos. El marco de conjunto generalmente redujo los errores de predicción y mejoró laR2, lo que sugiere que combinar arquitecturas CNN heterogéneas puede mejorar la robustezpredictiva 12,20. Además, la incorporación de SHAP permitió interpretar las contribuciones relativas de los modelos base individuales a las predicciones finales, aumentando así la transparencia del modelo11,17. Por tanto, el marco puede proporcionar un enfoque útil para estudios que requieren tanto rendimiento predictivo como interpretabilidad del modelo.

El marco propuesto podría contribuir al avance de la investigación que involucre análisis arquitectónico automatizado, evaluación de diseño residencial y sistemas de apoyo a la decisión basados en datos. Al integrar la predicción multisalida con la categorización a nivel de aplicación, el marco va más allá de los enfoques tradicionales de reconocimiento de planos de planta o extracción de características. La metodología puede ser aplicable en estudios que involucran planificación residencial, entornos de vivienda inteligente y evaluación de distribución espacial 1,2,8,22. Sin embargo, hay varias limitaciones que deben considerarse. En primer lugar, el marco se desarrolló y evaluó utilizando un único conjunto de datos disponible públicamente, y no se realizó validación externa en conjuntos de datos independientes. No se realizó validación externa en el presente estudio, y la evaluación del modelo se realizó utilizando el subconjunto de pruebas designado derivado del conjunto de datos disponible públicamente. En segundo lugar, las categorías residenciales generadas por el marco se derivan de criterios predefinidos basados en reglas, en lugar de etiquetas de diseño sanitario validadas de forma independiente. Las categorías de atención a personas mayores, atención médica y residencial general generadas por el marco derivan de criterios predefinidos basados en reglas y no deben interpretarse como evaluaciones clínicamente validadas de diseño sanitario. En tercer lugar, el marco se basa principalmente en atributos arquitectónicos derivados de imágenes de planos de planta y no incorpora estándares de diseño específicos de la sanidad, criterios de accesibilidad ni medidas de resultados centradas en el ocupante. No se utilizaron normas formales de accesibilidad, diseño sanitario ni diseño residencial para definir las reglas de clasificación. En su lugar, el marco de categorización se desarrolló utilizando los atributos disponibles del plano de planta y los criterios de decisión orientados a la aplicación. Los trabajos futuros pueden incluir validación externa de conjuntos de datos independientes, incorporación de estándares formales de accesibilidad y diseño sanitario, y evaluación utilizando medidas adicionales de diseño y de resultados centradas en el ocupante para mejorar aún más la aplicabilidad y generalización del marco.

También pueden utilizarse enfoques alternativos para investigar la misma hipótesis. Por ejemplo, modelos de visión basados en transformadores, representaciones espaciales basadas en grafos o arquitecturas híbridas de DL podrían aplicarse para capturar relaciones espaciales dentro de los diseñosresidenciales 13, 15 y 19. De manera similar, los marcos de clasificación basados en conjuntos de datos etiquetados por expertos o en estándares de diseño sanitario pueden ofrecer métodos alternativos para la evaluación de la distribución residencial 8,22. Aunque estos métodos pueden ofrecer ventajas complementarias, el marco propuesto CARE-MIRV-Net demuestra la viabilidad de combinar múltiples arquitecturas CNN dentro de un marco de conjunto basado en apilamiento para la predicción multisalida y la categorización de distribución residencial.

Futuros trabajos podrían centrarse en ampliar el marco para apoyar razonamientos espaciales más avanzados y una aplicabilidad más amplia en el mundo real. Las posibles direcciones incluyen la incorporación de representaciones de planos de planta basadas en grafos para modelar la conectividad de las salas, la evaluación de arquitecturas basadas en transformadores de visión (ViT) para la extracción de características, y el desarrollo de estrategias de clasificación multiclase o multietiqueta 13,15,18. Además, futuros estudios podrían incorporar atributos de diseño específicos de la atención sanitaria, estándares de accesibilidad y conjuntos de datos de validación independientes para evaluar aún más la aplicabilidad del marco en entornos residenciales orientados a la atenciónsanitaria 8,22. El marco también puede adaptarse para su integración en plataformas de ciudades inteligentes y sistemas de apoyo a la toma de decisiones para la planificación residencial 1,2.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Conflictos de interés:

Los autores no declaran conflictos de interés.

Contribuciones de los autores:

Ning Zhang propuso ideas de investigación, diseñó planes experimentales y coordinó el proceso de investigación. Yu Bi realizó experimentos, recopiló datos, participó en análisis de datos y revisiones de artículos.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores reconocen sinceramente el apoyo financiero proporcionado por el Proyecto de Investigación Científica del Departamento de Educación de la Provincia de Jilin.

FINANCIACIÓN:

Esta investigación fue financiada por el Proyecto de Investigación Científica del Departamento de Educación de la Provincia de Jilin (Subvención nº JJKH20240801KJ).

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CARE-MIRV-Net implementation packageSupplementary File 1Versión 1.0N/A
Figure and table regeneration scriptsSupplementary File 1Versión 1.0N/A
Floor Plan Images and Their Details DatasetKaggleDataset públicoN/A
GPUNVIDIA CorporationTesla T4 × 2N/A
Intel Xeon ProcessorIntel Corporation2.20 GHzN/A
KerasKeras TeamVersión 3.13.2N/A
MatplotlibMatplotlib Development TeamVersión 3.9RRID:SCR_008624
NumPyNumPy DevelopersVersión 2.4.6RRID:SCR_008633
Operating SystemLinuxUbuntu 22.04 LTSN/A
PandasPandas Development TeamVersión 2.3.3RRID:SCR_018214
PythonPython Software FoundationVersión 3.12.12RRID:SCR_008394
Scikit-learnScikit-learn DevelopersVersión 1.6.1RRID:SCR_002577
SHAPSHAP Development TeamVersión 0.51.0N/A
System Memory (RAM)Cloud Computing Environment31 GBN/A
TensorFlowGoogleVersión 2.19.0RRID:SCR_016345
Training environment configuration fileSupplementary File 1Versión 1.0N/A

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

EngineeringMeta ensemble learningfloor plan analysisresidential designelderly care housinghealthcare integrated designXAI
Video próximamente

Artículos relacionados