$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo utilizou um conjunto de dados público da plataforma Kaggle (Imagens de Planta e Seus Detalhes, disponível em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; acessado em 16 de abril de 2026). Não envolveu participantes humanos, animais ou dados pessoalmente identificáveis; portanto, aprovação ética e consentimento informado não eram necessários.
Esse protocolo apresenta uma estrutura orientada por IA para análise automatizada de imagens de plantas residenciais, com foco em design espacialmente consciente e voltado para a saúde. O fluxo de trabalho experimental completo é apresentado na Figura 1. O protocolo foi projetado para preencher a lacuna entre a previsão de características arquitetônicas de baixo nível e a tomada de decisão orientada à aplicação de alto nível. Ela integra DL, modelagem em conjunto e IA explicável para fornecer uma solução precisa, robusta e interpretável para análise de layouts residenciais. A estrutura consiste em múltiplas etapas, começando com a aquisição e pré-processamento de dados, seguidas pelo aprendizado de características usando CNNs profundas, previsão de meta-ensemble e, finalmente, classificação em nível de aplicação. Inicialmente, as imagens das plantas e seus atributos arquitetônicos correspondentes são pré-processados por meio de redimensionamento, normalização e aumento de dados para garantir consistência e melhorar a generalização. Todas as imagens de plantas foram redimensionadas para 224 × 224 pixels e normalizadas para a faixa [0, 1]. A ampliação de dados foi aplicada durante o treinamento usando inversão horizontal aleatória, rotação, zoom e deslocamento de largura/altura para melhorar a generalização do modelo e reduzir o sobreajuste. Não foi aplicado nenhum flip vertical. Parâmetros completos de aumento e detalhes de implementação são fornecidos no Arquivo Suplementar 1. Os dados processados foram então usados para treinar múltiplos modelos DL para extração e previsão de características. Todos os modelos base e o meta-aprendiz CARE-MIRV-Net foram treinados usando uma configuração consistente, incluindo aumento de dados, parada precoce e escalonamento adaptativo da taxa de aprendizagem. A parada precoce monitorou a perda de validação (val_loss) com valor de paciência de 5 épocas, e os melhores pesos do modelo foram restaurados automaticamente após o treinamento. O escalonamento adaptativo da taxa de aprendizado foi implementado usando o callback ReduceLROnPlateau, que monitorava a perda de validação e reduzia a taxa de aprendizado em um fator de 0,3 após 2 épocas sem melhora, com uma taxa mínima de aprendizado de 1 × 10⁻7. Detalhes completos da implementação e configurações de parâmetros são fornecidos no Arquivo Suplementar 1. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20. Uma semente aleatória fixa (42) foi usada para garantir a reprodutibilidade. Detalhes completos da implementação são fornecidos no Arquivo Suplementar 1.

Figura 1. Fluxo de trabalho da estrutura CARE-MIRV-Net para análise de plantas residenciais. Visão geral esquemática do protocolo proposto. O fluxo de trabalho inclui (1) aquisição e pré-processamento de conjuntos de dados, (2) aprendizado e previsão de características usando MobileNetV2, InceptionV3, ResNet101 e VGG16, (3) predição de meta-ensemble baseada em empilhamento usando CARE-MIRV-Net, (4) classificação de layout residencial baseada em regras, (5) análise de interpretabilidade baseada em SHapley Additive exPlanations (SHAP) e (6) avaliação de desempenho. Por favor, clique aqui para ver uma versão ampliada desta figura.
Na segunda etapa, quatro CNNs pré-treinadas, MobileNetV2, InceptionV3, ResNet101 e VGG16, são empregadas como aprendizes base. Cada modelo é ajustado com precisão usando aprendizado por transferência para prever atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Para cada modelo de aprendizagem por transferência, as camadas pré-treinadas inferiores foram mantidas congeladas, enquanto as camadas superiores e a cabeça de regressão personalizada foram ajustadas durante o treinamento. Configurações detalhadas de ajuste fino específicas do modelo são fornecidas no Arquivo Suplementar 1. Esses modelos capturam diferentes aspectos da informação espacial: o MobileNetV2 fornece extração eficiente de características, o InceptionV3 captura padrões espaciais multiescala, o ResNet101 aprende representações hierárquicas profundas e o VGG16 garante um aprendizado de características estável e consistente. A diversidade entre esses modelos aumenta a capacidade representacional geral do framework.
Para aumentar ainda mais a precisão e robustez da previsão, é proposto um modelo meta-conjunto baseado em empilhamento, denominado CARE-MIRV-Net. Nessa etapa, as previsões de todos os modelos base são agrupadas para criar um espaço de características de dimensão superior, que é introduzido para um meta-aprendiz. As previsões do modelo base são geradas inicialmente de forma independente usando os modelos treinados MobileNetV2, InceptionV3, ResNet101 e VGG16. Essas previsões são então concatenadas para formar o vetor meta-característica usado pelo meta-aprendiz. Para evitar vazamento de dados, os conjuntos de dados de treinamento e teste são estritamente separados, e o meta-aprendiz é treinado apenas com previsões geradas a partir dos dados de treinamento. O meta-modelo, que é uma rede neural totalmente conectada, é treinado para aprender a combinação ótima de resultados do modelo base para produzir previsões refinadas. O meta-modelo consiste em duas camadas totalmente conectadas com 512 e 256 neurônios usando ativação ReLU, seguidas por camadas de dropout (0,4 e 0,3) e uma camada linear de saída. O modelo é treinado usando o otimizador Adam (taxa de aprendizado = 0,0001), um tamanho de lote de 32 e até 15 épocas. A parada precoce foi implementada monitorando a perda de validação (val_loss) com valor de paciência de 5 épocas. O critério mínimo de melhoria (min_delta) foi definido para o valor padrão do TensorFlow de 0, e os melhores pesos do modelo foram restaurados automaticamente após o treinamento. O escalonamento adaptativo da taxa de aprendizado foi implementado usando o callback ReduceLROnPlateau, que monitorava a perda de validação e reduzia a taxa de aprendizado em um fator de 0,3 após 2 épocas consecutivas sem melhora. A taxa mínima de aprendizado foi definida para 1 × 10⁻7, e o parâmetro de recarga usou o valor padrão do TensorFlow de 0. Esse método de conjunto reduz vieses individuais de modelos e melhora a generalização por meio das forças complementares de múltiplas arquiteturas. Informações detalhadas de implementação são fornecidas no Arquivo Suplementar 1.
Após a previsão, uma camada de interpretação é adicionada para converter as saídas numéricas em decisões em nível de aplicação. Os layouts residenciais podem ser classificados em três classes com base nas previsões das características arquitetônicas: cuidado com idosos, assistência médica integrada (cuidados médicos) e uso residencial geral. Essa classificação é realizada usando regras de decisão baseadas em limiar, pré-definidas, baseadas na metragem quadrada prevista, número de quartos e número de banheiros. A categoria com a maior pontuação é designada como classificação final, enquanto os empates são resolvidos selecionando a categoria que atende ao maior número de critérios de decisão. As regras completas de pontuação e os limiares de classificação são fornecidos no Arquivo Suplementar 2 (Algoritmo 1). Essa ação permite que o arcabouço forneça informações práticas para o design de habitações residenciais.
O framework utiliza IA explicável com SHAP para fornecer transparência e interpretabilidade. Este componente examina a contribuição das previsões de cada modelo base para a saída do metamodelo. A análise SHAP foi realizada usando o SHAP KernelExplainer (SHAP versão 0.51.0) com 100 amostras de treinamento selecionadas aleatoriamente como conjunto de dados de fundo e 50 amostras de teste para geração de explicações. A configuração completa do SHAP, incluindo seleção de amostras em segundo plano e configurações de implementação, é fornecida no Arquivo Suplementar 1. A camada de explicabilidade ajuda a entender o processo de tomada de decisão ao medir a importância das características e exibir padrões de contribuição, melhorando assim a transparência e a confiabilidade do modelo. O framework proposto é avaliado usando MAE eR2 em todas as variáveis-alvo. Para a previsão multioutput, a MAE foi calculada como a diferença absoluta média entre os valores reais e previstos em todas as variáveis alvo, enquanto R2 foi calculada comparando a variância explicada das previsões com os valores de verdade fundamental correspondentes para cada saída. As análises quantitativas e qualitativas indicam que o CARE-MIRV-Net proposto melhora a precisão das previsões e apoia a classificação do layout residencial baseada em regras. A confiabilidade da classificação foi avaliada com base na precisão das previsões de regressão subjacentes e na consistência da camada de decisão baseada em regras. A estrutura é uma solução adequada e escalável para análise inteligente de plantas e pode ser aplicada a habitação inteligente, planejamento de cuidados a idosos e design residencial voltado para a saúde. Uma lista completa de conjuntos de dados, pacotes de software, bibliotecas, recursos de hardware e ferramentas computacionais usados neste estudo é fornecida na Tabela de Materiais. Código-fonte, informações de configuração do ambiente, especificações de dependência de software e scripts de implementação necessários para reproduzir o fluxo de trabalho reportado são fornecidos no Arquivo Suplementar 1.
Algoritmo para o Protocolo
A estrutura proposta adota uma abordagem em múltiplas etapas para processar plantas baseadas em imagens de casas residenciais e produzir resultados preditivos e em nível de decisão, conforme descrito no Algoritmo 1 no Arquivo Suplementar 2. Esse processo começa com o pré-processamento dos dados, no qual as imagens de entrada são redimensionadas para uma resolução padrão e normalizadas para fornecer uniformidade em todo o conjunto de dados. Todas as imagens de plantas foram redimensionadas para 224 × 224 pixels e normalizadas para a faixa [0, 1]. Essa etapa otimiza as imagens para aprendizado por redes neurais profundas e aprimora a convergência geral do modelo. A segunda fase envolve o uso de vários modelos DL como aprendizes base, incluindo MobileNetV2, InceptionV3, ResNet101 e VGG16. Independentemente, cada modelo pega as imagens de entrada e estima características arquitetônicas importantes, como metragem quadrada e o número de quartos, banheiros e garagens. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20, e uma semente aleatória fixa foi usada para garantir a reprodutibilidade. Esses modelos capturam diferentes propriedades espaciais das plantas e fornecem previsões complementares. A representação de características é então construída empilhando as saídas de cada modelo base para criar uma única representação de características. Essa saída conjunta é posteriormente alimentada em um modelo meta-ensemble, CARE-MIRV-Net, que é treinado para combinar as previsões de todos os modelos base. As previsões do modelo base foram geradas independentemente e concatenadas para formar o vetor meta-característico. O vazamento de dados foi evitado por meio da separação rigorosa dos conjuntos de dados de treinamento e teste. O meta-modelo refina essas previsões e produz as previsões finais dos atributos arquitetônicos. O meta-modelo consistia em camadas totalmente conectadas com 512 e 256 neurônios, funções de ativação do ReLU, taxas de abandono de 0,4 e 0,3, o otimizador Adam (taxa de aprendizado = 0,0001), um lote de 32 e até 15 épocas de treinamento com parada precoce. Após a previsão, uma camada de decisão é usada para contextualizar os resultados. De acordo com os valores estimados, cada layout residencial é categorizado como cuidado com idosos, atendimento médico ou uso residencial geral. As categorias residenciais foram atribuídas usando regras de pontuação baseadas em limiar, derivadas dos atributos previstos do plano de andar de baixo. A categoria com a maior pontuação foi selecionada como classificação final. Limiares completos de classificação e regras de decisão são fornecidos no Algoritmo 1 (Arquivo Suplementar 2). Por fim, o framework incorpora um componente de explicabilidade baseado no SHAP para avaliar o impacto de cada modelo base na previsão final. A análise SHAP foi realizada conforme descrito anteriormente e no Arquivo Suplementar 1. Esse componente aumenta a transparência e auxilia na compreensão do processo de tomada de decisão. A eficácia e viabilidade da abordagem proposta foram avaliadas usando medidas padrão de desempenho em regressão. O desempenho foi avaliado usando uma única execução experimental com uma semente aleatória fixa.
Modelos de Avaliação
Nesta seção, são apresentados os modelos DL usados no estudo, incluindo tanto os modelos base individuais quanto o proposto CARE-MIRV-Net. Os modelos de benchmark foram selecionados para representar arquiteturas DL diversas e amplamente adotadas. O MobileNetV2 foi incluído como uma rede leve e computacionalmente eficiente, e o InceptionV3 foi selecionado por sua capacidade de capturar características espaciais em múltiplas escalas. O ResNet101 foi escolhido devido à sua capacidade profunda de aprendizado residual para extração hierárquica de características, e o VGG16 foi incluído como uma arquitetura convolucional bem estabelecida. Todos os modelos de benchmark foram treinados usando procedimentos de pré-processamento idênticos, configurações de aumento de dados, partições de conjuntos de dados, parâmetros de otimização, tamanho do lote e configuração de treinamento para garantir uma avaliação comparativa justa.
MobileNetV2:
MobileNetV2 é um sistema CNN pequeno e compacto, projetado para ser rápido, de alto desempenho e com menor complexidade computacional. Apresenta algumas das principais inovações, como conexões residuais invertidas e gargalos lineares, que facilitam a extração eficiente de características e ainda mantêm alto poder representacional. O MobileNetV2 pode usar convoluções separáveis em profundidade para minimizar significativamente o número total de parâmetros e o custo computacional das redes convolucionais tradicionais, sendo assim bem adaptado a grandes problemas de aprendizado baseados em imagem.
O MobileNetV2 é usado no framework sugerido como um dos modelos fundamentais de DL para prever os atributos arquitetônicos das imagens de plantas residenciais. O modelo é capaz de aprender padrões espaciais como distribuição de salas, densidade de layout e organização estrutural que ocorrem em plantas baixas de forma eficaz devido ao seu design eficiente. Essas representações eruditas desempenham um papel importante na estimativa precisa de características importantes como metragem quadrada, número de quartos, banheiros e garagens com precisão. MobileNetV2 é um modelo leve, que é um bom candidato para ser incluído no framework proposto de meta-ensemble. Ele adiciona algumas representações complementares de características a outros modelos DL e aumenta a robustez e generalização geral do sistema. Esse aprendizado de modelos é muito importante para melhorar a precisão das previsões e auxiliar na classificação de projetos residenciais baseados na saúde.
O modelo MobileNetV2 é treinado usando uma estratégia de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para um tamanho fixo de 224 × 224 × 3, o que é compatível com a arquitetura. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. A cabeça de classificação inicial do MobileNetV2 é removida e substituída por uma cabeça de regressão. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. Para facilitar a adaptação ao domínio, as camadas inferiores pré-treinadas foram congeladas, enquanto as camadas superiores, começando a partir de block_13_expand e a cabeça de regressão personalizada, foram ajustadas finamente. Essa abordagem seletiva de treinamento permite que o modelo retenha características visuais gerais enquanto aprende atributos espaciais específicos de domínio das imagens do plano. Os mapas de características extraídos são processados por meio de uma camada de Global Average Pooling e camadas totalmente conectadas com 512 e 256 neurônios usando ativação ReLU. Para aumentar a generalização e reduzir o sobreajuste, são incorporadas camadas de normalização em lote e de dropout (0,4 e 0,3). A camada final de saída contém quatro neurônios com ativação linear correspondentes aos atributos arquitetônicos previstos. O otimizador Adam foi usado com taxa de aprendizado de 0,0001 e parâmetros padrão TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas. A parada precoce foi aplicada com base na perda de validação, e a redução adaptativa da taxa de aprendizado foi usada para melhorar a convergência. O treinamento era realizado por até 15 épocas.
InceptionV3:
InceptionV3 é uma arquitetura CNN profunda capaz de capturar características multiescala com o uso de operações convolucionais paralelas. Ela se baseia no módulo Inception, que utiliza uma variedade de tamanhos de filtro na mesma camada para extrair características de grão fino e grosseiras ao mesmo tempo. Esse tipo de design arquitetônico permite que a rede aprenda hierarquias espaciais complexas e seja computacionalmente eficiente. Além disso, o InceptionV3 utiliza convoluções fatorizadas e redução de dimensionalidade, que melhoram o desempenho e minimizam o custo computacional.
O InceptionV3 é aplicado no framework proposto como um extrator eficaz de características para analisar imagens de plantas residenciais. Plantas de andar consistem em uma variedade de padrões espaciais, como tamanhos de salas, plantas estruturais e conectividade, exigindo aprendizado de características em múltiplas escalas. A arquitetura Inception é especialmente mais adequada para essa tarefa pelo fato de ser capaz de representar especificidades locais (por exemplo, pequenas salas) e estruturas globais (por exemplo, a organização do layout geral) ao mesmo tempo. O InceptionV3 fornece representações complementares a outros modelos como o MobileNetV2 no contexto do framework meta-ensemble. A diversidade de previsões é aumentada por sua capacidade de modelar relações espaciais complexas, o que é importante para aprimorar o desempenho do conjunto. Isso eventualmente ajuda a melhor prever características arquitetônicas e reforça a classificação posterior do design habitacional amigável para idosos e integrado à saúde.
O modelo InceptionV3 é treinado usando uma abordagem de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3 para garantir compatibilidade com a arquitetura da rede e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento.
As camadas originais de classificação do InceptionV3 são removidas, e uma cabeça de regressão personalizada é introduzida para permitir a previsão multioutput. A cabeça de regressão personalizada consistia em uma camada de Global Average Pooling seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. A base convolucional é parcialmente ajustada, com as camadas inferiores pré-treinadas congeladas e as camadas superiores, juntamente com a cabeça de regressão personalizada, ajustadas para aprender características específicas do plano de domínio, mantendo representações visuais gerais adquiridas durante o pré-treinamento. Após a espinha dorsal convolucional, uma camada de Pooling Média Global transforma os mapas de características em uma representação compacta de características. Em seguida, vêm camadas totalmente conectadas contendo 512 e 256 neurônios com funções de ativação de ReLU. Para minimizar o sobreajuste e melhorar a generalização, taxas de dropout de 0,4 e 0,3 são aplicadas. A camada final de saída consiste em quatro neurônios com ativação linear correspondente à previsão de metragem quadrada, número de quartos, número de banheiros e número de garagem. O modelo é treinado usando o otimizador Adam com taxa de aprendizado de 0,0001, tamanho de lote de 32 e até 15 épocas de treinamento, com paradas precoces e redução adaptativa da taxa de aprendizado para garantir convergência estável.
ResNet101:
O ResNet101 é uma estrutura profunda da CNN construída sobre o princípio do aprendizado residual, que possibilita treinar redes extremamente profundas superando o problema do gradiente nulo. Ele adiciona conexões residuais, ou chamadas conexões de salto, que permitem à rede aprender mapeamentos de identidade e reter informações entre camadas. Essa arquitetura melhora muito a estabilidade do treinamento e permite que o modelo aprenda características hierárquicas complexas. O ResNet101 possui uma grande capacidade representacional de 101 camadas e, portanto, é muito eficaz em tarefas que exigem recursos espaciais extras.
O ResNet101 será usado no framework proposto como um extrator de características de alta capacidade, que analisará imagens de plantas residenciais. O modelo pode ser usado para representar relações espaciais complexas, incluindo conectividade de salas, complexidade de layout e variações estruturais, devido à sua arquitetura profunda. Essas características são fundamentais para fazer previsões precisas sobre elementos arquitetônicos, como metragem quadrada, quartos, banheiros e garagens. No design do meta-ensemble, o ResNet101 é um componente significativo e fornece representações profundas e abstratas de características. O ResNet101 se preocupa mais com características estruturais finas e, portanto, é mais diversificado entre os aprendizes base em comparação com modelos leves como o MobileNetV2. Essa heterogeneidade desempenha um papel essencial em melhorar o desempenho de um conjunto e previsões robustas, especialmente ao lidar com a classificação residencial baseada na saúde.
O ResNet101 é treinado usando uma abordagem de aprendizado por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3, o que garante compatibilidade arquitetônica e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. A cabeça de classificação original do ResNet101 é removida (include_top=Falso), e uma cabeça de regressão personalizada é introduzida para permitir a previsão multioutput. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. Para equilibrar reutilização de características e adaptação de domínio, as camadas pré-treinadas inferiores foram congeladas, enquanto as camadas mais profundas a partir de conv4_block1_1_conv e a cabeça de regressão personalizada foram ajustadas finamente. Essa estratégia seletiva de treinamento permite que o modelo retenha características visuais genéricas enquanto adapta representações de nível superior às imagens de planta baixa. A saída da base convolucional é passada por uma camada de Pooling Média Global para gerar uma representação compacta de características. Em seguida, vêm camadas totalmente conectadas com 512 e 256 neurônios usando funções de ativação do ReLU. A normalização em lote é aplicada para estabilizar o aprendizado, e camadas dropout com taxas de 0,4 e 0,3 são incorporadas para reduzir o sobreajuste e melhorar a generalização. A camada final de saída contém quatro neurônios com ativação linear correspondente à metragem quadrada, número de quartos, banheiros e garagens. O otimizador Adam foi usado com uma taxa de aprendizado de 0,0001, conforme descrito na configuração de treinamento. A ampliação de dados incluiu inversão aleatória, rotação, zoom e deslocamento para melhorar a generalização do modelo. O treinamento foi realizado por até 15 épocas, com paradas precoces baseadas na perda de validação e redução da taxa de aprendizado adaptativo.
VGG16:
VGG16 é uma arquitetura simples de rede neural do tipo convolucional profundo, eficaz e simples em tarefas de reconhecimento visual. É composto por 16 camadas com um design regular ou homogêneo incorporando pequenos filtros convolucionais de 3 × 3, que facilitam o aprendizado de representações hierárquicas de características pela rede. A arquitetura é focada em profundidade e simples, o que significa que é capaz de capturar detalhes de baixo nível, como bordas, texturas e estruturas semânticas de alto nível. O VGG16, com seu design regular e bom desempenho, é agora uma escolha popular de backbone ao realizar aprendizado por transferência em tarefas relacionadas a imagens.
No modelo sugerido, o VGG16 é usado como modelo DL de referência para derivar características espaciais de imagens de plantas residenciais. O fato de ser organizado permite que seja muito útil para capturar os detalhes mais finos dos padrões de layout, como limites de salas, alinhamentos estruturais e organização espacial. Essas características são essenciais para prever de forma eficaz os atributos da arquitetura, como metros quadrados, quartos, banheiros e garagens. No sistema meta-ensemble, VGG16 fornece representações de características estáveis e bem generalizadas. O VGG16 oferece uma abordagem de extração de recursos mais equilibrada em comparação com arquiteturas mais profundas, como a ResNet101, e arquiteturas multiescala, como a InceptionV3, aumentando a diversidade base do aprendize. Essa heterogeneidade é fundamental para aprimorar o desempenho do conjunto e previsões confiáveis da classificação residencial voltada para a saúde.
O modelo VGG16 é treinado usando uma abordagem de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3 para garantir compatibilidade com a arquitetura e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. As camadas originais de classificação são removidas (include_top=Falso), e uma cabeça de regressão personalizada é adicionada para adaptar o modelo para a previsão multioutput. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. As camadas pré-treinadas inferiores foram congeladas, enquanto as camadas que começam a partir de block4_conv1 e a cabeça de regressão personalizada foram ajustadas finamente. Essa estratégia permite que o modelo mantenha características visuais gerais enquanto aprende representações específicas de domínio relevantes para a análise de plantas de andar de andar (floorplanes). As características de saída da base convolucional são passadas por uma camada de Pool de Média Global para gerar um vetor de características compacto. Em seguida, vêm camadas totalmente conectadas com 512 e 256 neurônios usando funções de ativação do ReLU. A normalização em lote e camadas de dropout com taxas de 0,4 e 0,3 são incorporadas para estabilizar o treinamento, reduzir o sobreajuste e melhorar a generalização. A camada final de saída contém quatro neurônios com ativação linear correspondente à metragem quadrada, número de quartos, banheiros e previsões de garagem. O otimizador Adam foi usado com uma taxa de aprendizado de 0,0001, conforme descrito na configuração de treinamento. A ampliação de dados incluiu inversão aleatória, rotação, zoom e deslocamento para melhorar a generalização do modelo. O treinamento foi realizado por até 15 épocas, com paradas precoces baseadas na perda de validação e redução da taxa de aprendizado adaptativo.
CARE-MIRV-Net (Modelo Proposto de Meta-Ensemble DL):
O CARE-MIRV-Net sugerido (Context-Aware Residential Ensemble utilizando MobileNetV2, InceptionV3, ResNet101 e VGG16 Network) é uma estrutura DL meta-ensemble baseada em empilhamento, que visa melhorar a estimativa de características arquitetônicas com base em imagens de plantas residenciais. A arquitetura combina várias CNNs heterogêneas explorando suas vantagens sinérgicas na extração de recursos. O modelo proposto baseia-se na combinação de arquitetura leve, profunda e multiescala, que melhora o desempenho preditivo e proporciona robustez em uma ampla variedade de layouts residenciais. Em contraste com as técnicas tradicionais baseadas em modelo único, o CARE-MIRV-Net segue uma abordagem de aprendizagem hierárquica, onde modelos base fornecem previsões iniciais, que são então aprimoradas por um meta-aprendiz.
Quando se trata de design residencial que seja espacialmente consciente e cuidadoso com a saúde, a interpretação correta dos layouts da planta baixa é de extrema importância. Modelos DL únicos tendem a ser insuficientes para generalizar diferentes padrões arquitetônicos. O framework proposto superará essa fragilidade usando quatro arquiteturas diferentes: MobileNetV2, InceptionV3, ResNet101 e VGG16, que trazem diferentes capacidades representacionais próprias. O MobileNetV2 pode ser usado para extrair recursos de forma eficiente e é leve; InceptionV3 aprende padrões espaciais em múltiplas escalas; O ResNet101 aprende representações hierárquicas profundas; e o VGG16 aprende recursos de forma consistente e confiável. Uma combinação desses modelos facilita que a estrutura abrace tanto os atributos espaciais locais quanto globais, o que aumenta a precisão e confiabilidade das características previstas, como metragem quadrada, número de quartos, banheiros e garagens. As previsões acima também podem ser usadas para prever uma classificação adicional de layouts residenciais, incluindo amigáveis para idosos, integrados à saúde e residenciais gerais.
O CARE-MIRV-Net é implementado usando uma estratégia de conjunto baseada em empilhamento em dois estágios. No primeiro estágio, os quatro modelos base geram previsões independentemente para as variáveis alvo. As entradas do meta-aprendiz foram geradas concatenando as saídas de previsão produzidas pelos modelos base treinados nos dados de treinamento. Essas previsões concatenadas formaram os vetores meta-características de 16 dimensões usados para o treinamento de metamodelos. O vazamento de informações foi evitado por meio da separação rigorosa dos conjuntos de dados de treinamento e teste, e nenhuma amostra de teste foi usada durante o treinamento do modelo base ou do metamodelo. Os mesmos conjuntos de dados de treinamento e validação usados nos modelos base foram empregados durante o processo de empilhamento. Durante o treinamento e a inferência, o vetor meta-característica de 16 dimensões foi construído concatenando as quatro saídas de predição geradas pelo MobileNetV2, InceptionV3, ResNet101 e VGG16. Como cada modelo gera um vetor de saída quadridimensional, a representação concatenada produz uma entrada de 16 dimensões para o meta-aprendiz. Essa transformação combina as previsões de todos os modelos base e serve como entrada para a segunda etapa do framework. A segunda etapa envolve construir um meta-aprendiz totalmente conectado para rede neural para aprender a combinação ótima de previsões do modelo base. O meta-aprendiz consistia em camadas totalmente conectadas com 512 e 256 neurônios, ativação de ReLU, normalização em lote, taxas de abandono de 0,4 e 0,3, e uma camada linear de saída de quatro neurônios. Camadas dropout com taxas de 0,4 e 0,3 foram aplicadas após as camadas densas para reduzir o sobreajuste e melhorar a generalização. O meta-modelo foi treinado usando o otimizador Adam com taxa de aprendizado de 0,0001, tamanho de lote de 32 e até 15 épocas com paradas precoces e redução da taxa de aprendizado adaptativa. Os dados de validação foram usados para monitorar o desempenho do modelo durante o treinamento e para selecionar o modelo de melhor desempenho. Após o treinamento, o modelo meta-ensemble gerava previsões finais combinando resultados de todos os aprendizes base. MAE eR2 foram usados para avaliar o desempenho do CARE-MIRV-Net. Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas. Os resultados foram obtidos em uma única execução experimental usando uma semente aleatória fixa. A estrutura proposta melhora a capacidade preditiva ao combinar várias estruturas DL por meio de um mecanismo de empilhamento e fornecer análise interpretável de plantas residenciais. Isso torna o CARE-MIRV-Net aplicável no contexto de projetos residenciais focados na geriatria e orientados para a saúde. O código-fonte, as informações de configuração do ambiente, as especificações de dependência de software e a documentação de implementação são fornecidos no Arquivo Suplementar 1.
Avaliação de Desempenho
A análise de desempenho do framework proposto é realizada para determinar seu poder preditivo, robustez e desempenho de generalização entre diferentes características arquitetônicas. Análises quantitativas e qualitativas são realizadas para confirmar a utilidade do modelo proposto. O procedimento de avaliação envolve tanto medidas padrão de regressão quanto ambientes experimentais controlados para permitir uma comparação justa com os modelos de referência. Os experimentos foram realizados usando uma única execução experimental com uma semente aleatória fixa para garantir reprodutibilidade e consistência em todos os modelos de referência e propostos.
Parâmetros de Desempenho:
Duas medidas de regressão bem conhecidas, MAE e R2, são usadas para avaliar o desempenho do framework proposto. A MAE mede a magnitude média dos erros de predição e fornece uma indicação clara da proximidade entre os valores previstos e reais. Por outro lado, o valor R2 é usado para avaliar a proporção de variância nas variáveis-alvo explicadas pelo modelo, refletindo seu poder preditivo geral. A combinação dessas métricas fornece uma avaliação abrangente da precisão e do desempenho generalizado de todas as características arquitetônicas previstas. Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas.
Configuração Experimental:
Os experimentos foram realizados em um ambiente de computação em nuvem usando Python (versão 3.12.12). O protocolo proposto foi implementado usando TensorFlow (versão 2.19.0), Keras (versão 3.13.2), NumPy (versão 2.4.6), Pandas (versão 2.3.3), Scikit-learn (versão 1.6.1), Matplotlib (versão 3.9) e SHAP (versão 0.51.0). O ambiente computacional utilizava um processador Intel Xeon operando a 2,20 GHz com aproximadamente 31 GB de memória do sistema. Os experimentos foram realizados em um sistema operacional Ubuntu 22.04 LTS utilizando GPUs NVIDIA Tesla T4 × 2. O conjunto de dados contém 2.640 imagens de plantas residenciais que foram pré-processadas e subdivididas em conjuntos de dados de treinamento e teste. O conjunto de dados foi dividido usando uma proporção de 80:20, resultando em 2.112 amostras de treinamento e 528 amostras de teste. MobileNetV2, InceptionV3, ResNet101 e VGG16 são quatro modelos DL que foram treinados usando uma abordagem de ajuste fino com aprendizado por transferência. Um modelo meta-conjunto baseado em empilhamento, CARE-MIRV-Net, foi então construído para combinar previsões desses modelos base. Cada modelo foi treinado sob condições uniformes, incluindo redimensionamento da imagem para 224 × 224 pixels, aumento de dados e paradas antecipadas para reduzir o sobreajuste. A ampliação de dados incluía inversão aleatória, rotação, zoom e deslocamento. Foram usados um lote de 32 e um máximo de 15 épocas de treinamento, com parada precoce baseada na perda de validação e redução da taxa de aprendizado adaptativo. A análise final foi realizada em um conjunto de testes oculto para fornecer uma avaliação imparcial e confiável do desempenho. O conjunto de testes oculto foi gerado durante o particionamento inicial do conjunto de dados e permaneceu completamente isolado durante o treinamento e desenvolvimento do modelo para garantir uma avaliação de desempenho imparcial.
Descrição do Conjunto de Dados:
O conjunto de dados usado para apoiar os resultados deste estudo está disponível publicamente na plataforma Kaggle com o título "Imagens de Plantas e Seus Detalhes"28. O conjunto de dados está disponível em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (acessado em 16 de abril de 2026). Os dados consistem em 2.640 imagens de plantas residenciais e metadados arquitetônicos organizados. Cada amostra é um plano habitacional distinto, que oferece uma ampla variedade de layouts residenciais com diferentes tamanhos, configurações e arranjos espaciais. O tamanho do conjunto de dados é suficiente para treinamento baseado em DL e contém uma variedade de padrões arquitetônicos. O conjunto de dados consiste em uma imagem bidimensional de planta e atributos numéricos relacionados que descrevem as características estruturais da residência. Essas características incluem a área total em metragem quadrada, número de quartos, número de banheiros e número de garagens. Além disso, cada registro contém um caminho de imagem, que permite o mapeamento direto das entradas visuais para as etiquetas. As variáveis do conjunto de dados incluem imagem da planta baixa, caminho da imagem, metragem quadrada, número de quartos, número de banheiros e número de garagem. A imagem da planta baixa serve como recurso de entrada, enquanto os atributos arquitetônicos são usados como alvos de previsão. Portanto, o conjunto de dados é adequado para aprendizado supervisionado, com imagens servindo como características de entrada e atributos arquitetônicos como alvos de regressão.
O conjunto de dados contém uma grande variedade de layouts residenciais, que vão desde layouts compactos com menos cômodos até layouts grandes com múltiplos cômodos. Essa variabilidade permite o aprendizado de representações espaciais significativas, incluindo distribuição de salas, densidade de layout e complexidade estrutural. Essa diversidade é especialmente importante para o modelo proposto, pois apoia a categorização dos planos em layouts amigáveis para idosos, integrados à saúde e residenciais gerais. Antes do treinamento do modelo, o conjunto de dados é processado por meio de uma sequência de procedimentos de pré-processamento para garantir consistência e compatibilidade com modelos DL. Todas as imagens foram redimensionadas para 224 × 224 pixels e normalizadas para o intervalo [0, 1] antes do treinamento. O conjunto de dados é então organizado combinando caminhos de imagem com seus metadados correspondentes, após o que é separado em subconjuntos de treinamento e teste para facilitar a análise de desempenho. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20. Registros contendo informações completas de imagem e metadados foram incluídos na análise, enquanto registros incompletos ou inválidos foram excluídos. Uma semente aleatória fixa foi usada durante o particionamento do conjunto de dados para garantir a reprodutibilidade. O conjunto de dados fornece uma base detalhada para a análise de plantas residenciais impulsionada por IA. A combinação de 2.640 imagens anotadas e diversos atributos arquitetônicos suporta a modelagem de regressão multisaída e permite a integração da inteligência espacial com a tomada de decisões de design residencial voltada para a saúde.