É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de investigação

Previsão baseada em aprendizado profundo dos atributos do plano residencial para avaliação habitacional voltada para idosos

28 vistas

DOI:

10.3791/72157

31 de julho de 2026

Neste artigo

Resumo

Esse protocolo descreve um fluxo de trabalho de deep learning meta-ensemble para análise automatizada de imagens de plantas residenciais. O procedimento inclui pré-processamento de conjuntos de dados, predição de atributos arquitetônicos usando múltiplas redes neurais convolucionais, aprendizado de conjunto baseado em empilhamento, classificação residencial baseada em regras e análise de explicabilidade usando SHapley Additive ExPlanations para apoiar a avaliação de layout residencial.

Resumo

A crescente demanda por soluções de moradia inteligente para populações envelhecidas aumentou a necessidade de métodos automatizados para análise de plantas residenciais. Abordagens convencionais de avaliação arquitetônica são frequentemente manuais, demoradas e difíceis de escalar, destacando a necessidade de técnicas baseadas em inteligência artificial que possam interpretar layouts espaciais e apoiar a avaliação de projetos residenciais. Esse protocolo descreve uma estrutura de aprendizado profundo meta-ensemble para análise automatizada de imagens de plantas residenciais. O framework proposto CARE-MIRV-Net integra quatro redes neurais convolucionais complementares — MobileNetV2, InceptionV3, ResNet101 e VGG16 — para prever atributos arquitetônicos, incluindo metragem quadrada, número de quartos, banheiros e garagens. As previsões dos modelos base são combinadas por meio de um modelo meta-conjunto baseado em empilhamento e posteriormente usadas dentro de uma camada de decisão baseada em regras para categorizar layouts residenciais como cuidados para idosos, cuidados médicos ou residenciais gerais. A avaliação experimental demonstrou desempenho preditivo robusto em múltiplas variáveis-alvo. O modelo proposto alcançou um erro absoluto médio (MAE) de 432,48 e um coeficiente de determinação (R2) de 0,7053 para a previsão de metragem quadrada. Para a previsão do banheiro, a estrutura alcançou R2 de 0,7605, enquanto a previsão da garagem apresentou o menor MAE de 0,1697 e o maiorR 2 de 0,6958. Análises qualitativas também demonstraram a capacidade da estrutura de gerar previsões de atributos arquitetônicos e apoiar a avaliação de layout residencial orientada à aplicação. Para aumentar a transparência e a interpretabilidade, foram incorporadas as explicações aditivas SHapley para quantificar a contribuição de cada modelo base para as previsões finais. O framework proposto oferece uma abordagem interpretável e escalável para análise de plantas residenciais e suporte à decisão.

Introdução

O rápido desenvolvimento de tecnologias de cidades inteligentes e ambientes de vida inteligentes criou uma demanda crescente por soluções automatizadas e orientadas por dados no design residencial. Em particular, o aumento do envelhecimento da população e a demanda por moradias voltadas para a saúde aumentaram a importância de projetar espaços residenciais que sejam funcionais e adaptados às necessidades de grupos específicosde usuários 1,2. Os métodos convencionais de análise de plantas arquitetônicas são frequentemente manuais, demorados e dependentes de interpretação especializada; Portanto, são ineficientes e difíceis de escalar. Isso criou uma forte necessidade de sistemas inteligentes capazes de analisar automaticamente layouts residenciais e apoiar a tomada de decisõesinformadas 3.

Avanços recentes em inteligência artificial (IA), especialmente em deep learning (DL) e visão computacional, melhoraram significativamente a análise de dados baseados em imagens. Redes neurais convolucionais (CNNs) têm se mostrado altamente eficazes para extração de características espaciais e aprendizado de padrões visuais complexos, tornando-as adequadas para análise de imagens em plantas 4,5,6. Esses modelos podem aprender representações implícitas das estruturas dos cômodos, organização do layout e relações espaciais que são essenciais para prever atributosarquitetônicos 7,8. No entanto, a dependência de um único modelo DL pode limitar a generalização porque diferentes arquiteturas podem focar em características espaciais distintas e apresentar vieses decorrentes da variabilidadearquitetônica 9. Apesar desses avanços, abordagens existentes frequentemente carecem de uma estrutura integrada que combine múltiplos modelos, suporte a previsão multioutput e ofereça interpretabilidade em nível de aplicação. Além disso, a avaliação residencial voltada para a saúde e a explicabilidade receberam atenção relativamente limitada nos sistemas de análise de plantas baixas. A ausência de tais estruturas abrangentes limita a aplicabilidade prática e a interpretabilidade, especialmente em domínios onde transparência e suporte à decisão sãoimportantes 10,11,12.

A IA também contribuiu substancialmente para a análise automatizada e geração de plantas arquitetônicas. Um estudo investigou o uso de aprendizado de máquina (ML) para transformar imagens de plantas bidimensionais em modelostridimensionais 13. Os autores destacaram as limitações dos métodos convencionais baseados em design assistido por computador (CAD) e enfatizaram a importância de pipelines escaláveis baseados em IA para a compreensão espacial. Seus achados demonstraram que a DL pode extrair efetivamente informações estruturais de plantas baixas, embora ainda existam desafios relacionados à generalização e variabilidade dos dados. Outro estudo propôs uma estrutura de aprendizado profundo por reforço multiagente para geração automatizada de plantasde piso 14. Embora a abordagem ofereça considerável flexibilidade e personalização para o design arquitetônico, ela é focada principalmente na geração de projetos, em vez da análise preditiva de plantas existentes.

Uma pesquisa abrangente de recuperação de plantas baixas examinou características semânticas, espaciais, baseadas em formas e texturas para o entendimento de plantas15. A pesquisa enfatizou a importância dos modelos DL, incluindo CNNs e arquiteturas baseadas em transformers, para o aprendizado de representações significativas. No entanto, também identificou desafios relacionados a ruído, distorção e discriminação de características em layouts complexos. De forma semelhante, uma abordagem baseada em ML incorporou relações topológicas e visuais para o reconhecimento de plantas8. O estudo demonstrou que acessibilidade visual e conectividade espacial são importantes para entender layouts arquitetônicos, mas não abordou estratégias de previsão multisaída ou aprendizado em conjunto. A IA generativa também tem sido explorada em aplicações arquitetônicas. Uma revisão da IA generativa na arquitetura examinou o uso de redes generativas adversariais (GANs), autoencoders variacionais (VAEs) e modelos de difusão para automaçãode projetos 16. Os autores destacaram a crescente adoção de ferramentas de IA em fluxos de trabalho arquitetônicos práticos. No entanto, o foco desse trabalho era a geração de projetos, e não modelagem preditiva ou aplicações de suporte à decisão. A IA explicável tornou-se cada vez mais importante para interpretar modelos DL. Um estudo propôs uma estrutura baseada em SHapley Additives ExPlanations (SHAP) para interpretar modelos DL em aplicações de simulaçãourbana 17. Os resultados demonstraram que o SHAP pode identificar características influentes e melhorar a interpretabilidade tanto em nível global quanto local. Embora o estudo apoie o valor do SHAP em aplicações espaciais, ele não investigou sua integração com frameworks de aprendizado em conjunto. Desenvolvimentos recentes em arquiteturas de DL melhoraram ainda mais o desempenho em tarefas baseadas em imagem. Um estudo apresentou uma revisão abrangente dos modelos contemporâneos de DL, incluindo arquiteturas baseadas em CNN etransformers 18. O estudo destacou a importância da seleção de modelos e das arquiteturas híbridas para melhorar o desempenho da generalização. No entanto, não abordou especificamente as aplicações de análise de plantas de andar (floorplanes). Conjuntos de dados em grande escala também facilitaram avanços na análise arquitetônica. Por exemplo, um estudo introduziu um conjunto de dados de referência contendo milhares de plantas complexas19. O estudo demonstrou que modelos existentes continuam enfrentando desafios ao analisar layouts de grandes e vários apartamentos, destacando a necessidade de abordagens mais robustas e generalizáveis.

A DL também tem sido amplamente estudada em aprendizagem em conjunto. Um estudo recente sobre métodos de conjunto profundo indicou que combinar múltiplos modelos pode melhorar significativamente a precisão e a robustez preditivas ao reduzir o viés e a variância20. Apesar de sua eficácia, esses métodos não foram amplamente aplicados à análise de plantas arquitetônicas, especialmente em tarefas de regressão multioutput. Além disso, estudos recentes em análise automatizada de plantas de andar destacaram a importância de estruturas integradas que combinam previsão, classificação einterpretabilidade 21,22,23. Pesquisas existentes normalmente focam em funções individuais, como extração de características, geração de layout ou classificação. Consequentemente, permanece uma clara lacuna de pesquisa no desenvolvimento de uma estrutura unificada que integre aprendizagem multimodelo, avaliação de layout residencial e IA explicável. Embora avanços consideráveis tenham sido feitos em análise de DL e arquitetura, várias lacunas de pesquisa permanecem. A maioria dos estudos existentes foca no reconhecimento de plantas, extração de recursos ou geração de layout sem fornecer uma estrutura unificada que suporte tanto a previsão multisaída quanto a tomada de decisão em nível de aplicação. Além disso, muitas abordagens dependem de um único modelo DL, o que pode limitar sua capacidade de capturar diversas características espaciais e pode introduzir vieses específicos do modelo. A aprendizagem em conjunto para análise de plantas de andar ainda é relativamente pouco explorada, especialmente no que diz respeito à integração de modelos heterogêneos para melhorar a robustez. Além disso, atenção limitada tem sido dada à classificação residencial, com ênfase em considerações habitacionais voltadas para idosos e interpretabilidade. Como muitos modelos DL funcionam como caixas-pretas, entender a base de suas previsões continua sendo desafiador. Essas limitações destacam a necessidade de uma estrutura abrangente que integre aprendizado multimodelo, previsão precisa, classificação residencial orientada a aplicações e IA explicável.

Este estudo apresenta uma estrutura automatizada para a análise de imagens de plantas residenciais, com ênfase na consciência espacial e na avaliação de disposição residencial, para enfrentar esses desafios. A estrutura proposta introduz um modelo DL meta-ensemble, CARE-MIRV-Net, que integra quatro CNNs complementares — MobileNetV2, InceptionV3, ResNet101 e VGG16 — dentro de uma arquitetura baseada emempilhamento 24, 25, 26 e 27. Cada modelo prevê independentemente atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Essas previsões são posteriormente combinadas por um meta-aprendiz para gerar previsões refinadas. Além disso, uma camada de decisão baseada em regras é usada para categorizar layouts residenciais como cuidados para idosos, cuidados médicos ou residenciais gerais com base nos atributos previstos.

As contribuições deste trabalho são as seguintes. Primeiro, é proposto um framework DL meta-ensemble para a previsão multioutput de atributos arquitetônicos a partir de imagens de plantas residenciais. Segundo, o modelo CARE-MIRV-Net integra quatro arquiteturas CNN para melhorar a precisão e a generalização das previsões. Terceiro, uma camada de decisão baseada em regras é incorporada para suportar a categorização de layout residencial orientada a aplicações com base em atributos arquitetônicos previstos. Quarto, a IA explicável baseada em SHAP é integrada para aumentar a transparência e a interpretabilidade do modelo. Por fim, experimentos extensos são realizados para avaliar o arcabouço proposto usando o erro absoluto médio (MAE) e o coeficiente de determinação (R2) como métricas de desempenho.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Este estudo utilizou um conjunto de dados público da plataforma Kaggle (Imagens de Planta e Seus Detalhes, disponível em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; acessado em 16 de abril de 2026). Não envolveu participantes humanos, animais ou dados pessoalmente identificáveis; portanto, aprovação ética e consentimento informado não eram necessários.

Esse protocolo apresenta uma estrutura orientada por IA para análise automatizada de imagens de plantas residenciais, com foco em design espacialmente consciente e voltado para a saúde. O fluxo de trabalho experimental completo é apresentado na Figura 1. O protocolo foi projetado para preencher a lacuna entre a previsão de características arquitetônicas de baixo nível e a tomada de decisão orientada à aplicação de alto nível. Ela integra DL, modelagem em conjunto e IA explicável para fornecer uma solução precisa, robusta e interpretável para análise de layouts residenciais. A estrutura consiste em múltiplas etapas, começando com a aquisição e pré-processamento de dados, seguidas pelo aprendizado de características usando CNNs profundas, previsão de meta-ensemble e, finalmente, classificação em nível de aplicação. Inicialmente, as imagens das plantas e seus atributos arquitetônicos correspondentes são pré-processados por meio de redimensionamento, normalização e aumento de dados para garantir consistência e melhorar a generalização. Todas as imagens de plantas foram redimensionadas para 224 × 224 pixels e normalizadas para a faixa [0, 1]. A ampliação de dados foi aplicada durante o treinamento usando inversão horizontal aleatória, rotação, zoom e deslocamento de largura/altura para melhorar a generalização do modelo e reduzir o sobreajuste. Não foi aplicado nenhum flip vertical. Parâmetros completos de aumento e detalhes de implementação são fornecidos no Arquivo Suplementar 1. Os dados processados foram então usados para treinar múltiplos modelos DL para extração e previsão de características. Todos os modelos base e o meta-aprendiz CARE-MIRV-Net foram treinados usando uma configuração consistente, incluindo aumento de dados, parada precoce e escalonamento adaptativo da taxa de aprendizagem. A parada precoce monitorou a perda de validação (val_loss) com valor de paciência de 5 épocas, e os melhores pesos do modelo foram restaurados automaticamente após o treinamento. O escalonamento adaptativo da taxa de aprendizado foi implementado usando o callback ReduceLROnPlateau, que monitorava a perda de validação e reduzia a taxa de aprendizado em um fator de 0,3 após 2 épocas sem melhora, com uma taxa mínima de aprendizado de 1 × 10⁻7. Detalhes completos da implementação e configurações de parâmetros são fornecidos no Arquivo Suplementar 1. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20. Uma semente aleatória fixa (42) foi usada para garantir a reprodutibilidade. Detalhes completos da implementação são fornecidos no Arquivo Suplementar 1.

figure-protocol-1
Figura 1. Fluxo de trabalho da estrutura CARE-MIRV-Net para análise de plantas residenciais. Visão geral esquemática do protocolo proposto. O fluxo de trabalho inclui (1) aquisição e pré-processamento de conjuntos de dados, (2) aprendizado e previsão de características usando MobileNetV2, InceptionV3, ResNet101 e VGG16, (3) predição de meta-ensemble baseada em empilhamento usando CARE-MIRV-Net, (4) classificação de layout residencial baseada em regras, (5) análise de interpretabilidade baseada em SHapley Additive exPlanations (SHAP) e (6) avaliação de desempenho. Por favor, clique aqui para ver uma versão ampliada desta figura.

Na segunda etapa, quatro CNNs pré-treinadas, MobileNetV2, InceptionV3, ResNet101 e VGG16, são empregadas como aprendizes base. Cada modelo é ajustado com precisão usando aprendizado por transferência para prever atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Para cada modelo de aprendizagem por transferência, as camadas pré-treinadas inferiores foram mantidas congeladas, enquanto as camadas superiores e a cabeça de regressão personalizada foram ajustadas durante o treinamento. Configurações detalhadas de ajuste fino específicas do modelo são fornecidas no Arquivo Suplementar 1. Esses modelos capturam diferentes aspectos da informação espacial: o MobileNetV2 fornece extração eficiente de características, o InceptionV3 captura padrões espaciais multiescala, o ResNet101 aprende representações hierárquicas profundas e o VGG16 garante um aprendizado de características estável e consistente. A diversidade entre esses modelos aumenta a capacidade representacional geral do framework.

Para aumentar ainda mais a precisão e robustez da previsão, é proposto um modelo meta-conjunto baseado em empilhamento, denominado CARE-MIRV-Net. Nessa etapa, as previsões de todos os modelos base são agrupadas para criar um espaço de características de dimensão superior, que é introduzido para um meta-aprendiz. As previsões do modelo base são geradas inicialmente de forma independente usando os modelos treinados MobileNetV2, InceptionV3, ResNet101 e VGG16. Essas previsões são então concatenadas para formar o vetor meta-característica usado pelo meta-aprendiz. Para evitar vazamento de dados, os conjuntos de dados de treinamento e teste são estritamente separados, e o meta-aprendiz é treinado apenas com previsões geradas a partir dos dados de treinamento. O meta-modelo, que é uma rede neural totalmente conectada, é treinado para aprender a combinação ótima de resultados do modelo base para produzir previsões refinadas. O meta-modelo consiste em duas camadas totalmente conectadas com 512 e 256 neurônios usando ativação ReLU, seguidas por camadas de dropout (0,4 e 0,3) e uma camada linear de saída. O modelo é treinado usando o otimizador Adam (taxa de aprendizado = 0,0001), um tamanho de lote de 32 e até 15 épocas. A parada precoce foi implementada monitorando a perda de validação (val_loss) com valor de paciência de 5 épocas. O critério mínimo de melhoria (min_delta) foi definido para o valor padrão do TensorFlow de 0, e os melhores pesos do modelo foram restaurados automaticamente após o treinamento. O escalonamento adaptativo da taxa de aprendizado foi implementado usando o callback ReduceLROnPlateau, que monitorava a perda de validação e reduzia a taxa de aprendizado em um fator de 0,3 após 2 épocas consecutivas sem melhora. A taxa mínima de aprendizado foi definida para 1 × 10⁻7, e o parâmetro de recarga usou o valor padrão do TensorFlow de 0. Esse método de conjunto reduz vieses individuais de modelos e melhora a generalização por meio das forças complementares de múltiplas arquiteturas. Informações detalhadas de implementação são fornecidas no Arquivo Suplementar 1.

Após a previsão, uma camada de interpretação é adicionada para converter as saídas numéricas em decisões em nível de aplicação. Os layouts residenciais podem ser classificados em três classes com base nas previsões das características arquitetônicas: cuidado com idosos, assistência médica integrada (cuidados médicos) e uso residencial geral. Essa classificação é realizada usando regras de decisão baseadas em limiar, pré-definidas, baseadas na metragem quadrada prevista, número de quartos e número de banheiros. A categoria com a maior pontuação é designada como classificação final, enquanto os empates são resolvidos selecionando a categoria que atende ao maior número de critérios de decisão. As regras completas de pontuação e os limiares de classificação são fornecidos no Arquivo Suplementar 2 (Algoritmo 1). Essa ação permite que o arcabouço forneça informações práticas para o design de habitações residenciais.

O framework utiliza IA explicável com SHAP para fornecer transparência e interpretabilidade. Este componente examina a contribuição das previsões de cada modelo base para a saída do metamodelo. A análise SHAP foi realizada usando o SHAP KernelExplainer (SHAP versão 0.51.0) com 100 amostras de treinamento selecionadas aleatoriamente como conjunto de dados de fundo e 50 amostras de teste para geração de explicações. A configuração completa do SHAP, incluindo seleção de amostras em segundo plano e configurações de implementação, é fornecida no Arquivo Suplementar 1. A camada de explicabilidade ajuda a entender o processo de tomada de decisão ao medir a importância das características e exibir padrões de contribuição, melhorando assim a transparência e a confiabilidade do modelo. O framework proposto é avaliado usando MAE eR2 em todas as variáveis-alvo. Para a previsão multioutput, a MAE foi calculada como a diferença absoluta média entre os valores reais e previstos em todas as variáveis alvo, enquanto R2 foi calculada comparando a variância explicada das previsões com os valores de verdade fundamental correspondentes para cada saída. As análises quantitativas e qualitativas indicam que o CARE-MIRV-Net proposto melhora a precisão das previsões e apoia a classificação do layout residencial baseada em regras. A confiabilidade da classificação foi avaliada com base na precisão das previsões de regressão subjacentes e na consistência da camada de decisão baseada em regras. A estrutura é uma solução adequada e escalável para análise inteligente de plantas e pode ser aplicada a habitação inteligente, planejamento de cuidados a idosos e design residencial voltado para a saúde. Uma lista completa de conjuntos de dados, pacotes de software, bibliotecas, recursos de hardware e ferramentas computacionais usados neste estudo é fornecida na Tabela de Materiais. Código-fonte, informações de configuração do ambiente, especificações de dependência de software e scripts de implementação necessários para reproduzir o fluxo de trabalho reportado são fornecidos no Arquivo Suplementar 1.

Algoritmo para o Protocolo

A estrutura proposta adota uma abordagem em múltiplas etapas para processar plantas baseadas em imagens de casas residenciais e produzir resultados preditivos e em nível de decisão, conforme descrito no Algoritmo 1 no Arquivo Suplementar 2. Esse processo começa com o pré-processamento dos dados, no qual as imagens de entrada são redimensionadas para uma resolução padrão e normalizadas para fornecer uniformidade em todo o conjunto de dados. Todas as imagens de plantas foram redimensionadas para 224 × 224 pixels e normalizadas para a faixa [0, 1]. Essa etapa otimiza as imagens para aprendizado por redes neurais profundas e aprimora a convergência geral do modelo. A segunda fase envolve o uso de vários modelos DL como aprendizes base, incluindo MobileNetV2, InceptionV3, ResNet101 e VGG16. Independentemente, cada modelo pega as imagens de entrada e estima características arquitetônicas importantes, como metragem quadrada e o número de quartos, banheiros e garagens. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20, e uma semente aleatória fixa foi usada para garantir a reprodutibilidade. Esses modelos capturam diferentes propriedades espaciais das plantas e fornecem previsões complementares. A representação de características é então construída empilhando as saídas de cada modelo base para criar uma única representação de características. Essa saída conjunta é posteriormente alimentada em um modelo meta-ensemble, CARE-MIRV-Net, que é treinado para combinar as previsões de todos os modelos base. As previsões do modelo base foram geradas independentemente e concatenadas para formar o vetor meta-característico. O vazamento de dados foi evitado por meio da separação rigorosa dos conjuntos de dados de treinamento e teste. O meta-modelo refina essas previsões e produz as previsões finais dos atributos arquitetônicos. O meta-modelo consistia em camadas totalmente conectadas com 512 e 256 neurônios, funções de ativação do ReLU, taxas de abandono de 0,4 e 0,3, o otimizador Adam (taxa de aprendizado = 0,0001), um lote de 32 e até 15 épocas de treinamento com parada precoce. Após a previsão, uma camada de decisão é usada para contextualizar os resultados. De acordo com os valores estimados, cada layout residencial é categorizado como cuidado com idosos, atendimento médico ou uso residencial geral. As categorias residenciais foram atribuídas usando regras de pontuação baseadas em limiar, derivadas dos atributos previstos do plano de andar de baixo. A categoria com a maior pontuação foi selecionada como classificação final. Limiares completos de classificação e regras de decisão são fornecidos no Algoritmo 1 (Arquivo Suplementar 2). Por fim, o framework incorpora um componente de explicabilidade baseado no SHAP para avaliar o impacto de cada modelo base na previsão final. A análise SHAP foi realizada conforme descrito anteriormente e no Arquivo Suplementar 1. Esse componente aumenta a transparência e auxilia na compreensão do processo de tomada de decisão. A eficácia e viabilidade da abordagem proposta foram avaliadas usando medidas padrão de desempenho em regressão. O desempenho foi avaliado usando uma única execução experimental com uma semente aleatória fixa.

Modelos de Avaliação

Nesta seção, são apresentados os modelos DL usados no estudo, incluindo tanto os modelos base individuais quanto o proposto CARE-MIRV-Net. Os modelos de benchmark foram selecionados para representar arquiteturas DL diversas e amplamente adotadas. O MobileNetV2 foi incluído como uma rede leve e computacionalmente eficiente, e o InceptionV3 foi selecionado por sua capacidade de capturar características espaciais em múltiplas escalas. O ResNet101 foi escolhido devido à sua capacidade profunda de aprendizado residual para extração hierárquica de características, e o VGG16 foi incluído como uma arquitetura convolucional bem estabelecida. Todos os modelos de benchmark foram treinados usando procedimentos de pré-processamento idênticos, configurações de aumento de dados, partições de conjuntos de dados, parâmetros de otimização, tamanho do lote e configuração de treinamento para garantir uma avaliação comparativa justa.

MobileNetV2:

MobileNetV2 é um sistema CNN pequeno e compacto, projetado para ser rápido, de alto desempenho e com menor complexidade computacional. Apresenta algumas das principais inovações, como conexões residuais invertidas e gargalos lineares, que facilitam a extração eficiente de características e ainda mantêm alto poder representacional. O MobileNetV2 pode usar convoluções separáveis em profundidade para minimizar significativamente o número total de parâmetros e o custo computacional das redes convolucionais tradicionais, sendo assim bem adaptado a grandes problemas de aprendizado baseados em imagem.

O MobileNetV2 é usado no framework sugerido como um dos modelos fundamentais de DL para prever os atributos arquitetônicos das imagens de plantas residenciais. O modelo é capaz de aprender padrões espaciais como distribuição de salas, densidade de layout e organização estrutural que ocorrem em plantas baixas de forma eficaz devido ao seu design eficiente. Essas representações eruditas desempenham um papel importante na estimativa precisa de características importantes como metragem quadrada, número de quartos, banheiros e garagens com precisão. MobileNetV2 é um modelo leve, que é um bom candidato para ser incluído no framework proposto de meta-ensemble. Ele adiciona algumas representações complementares de características a outros modelos DL e aumenta a robustez e generalização geral do sistema. Esse aprendizado de modelos é muito importante para melhorar a precisão das previsões e auxiliar na classificação de projetos residenciais baseados na saúde.

O modelo MobileNetV2 é treinado usando uma estratégia de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para um tamanho fixo de 224 × 224 × 3, o que é compatível com a arquitetura. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. A cabeça de classificação inicial do MobileNetV2 é removida e substituída por uma cabeça de regressão. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. Para facilitar a adaptação ao domínio, as camadas inferiores pré-treinadas foram congeladas, enquanto as camadas superiores, começando a partir de block_13_expand e a cabeça de regressão personalizada, foram ajustadas finamente. Essa abordagem seletiva de treinamento permite que o modelo retenha características visuais gerais enquanto aprende atributos espaciais específicos de domínio das imagens do plano. Os mapas de características extraídos são processados por meio de uma camada de Global Average Pooling e camadas totalmente conectadas com 512 e 256 neurônios usando ativação ReLU. Para aumentar a generalização e reduzir o sobreajuste, são incorporadas camadas de normalização em lote e de dropout (0,4 e 0,3). A camada final de saída contém quatro neurônios com ativação linear correspondentes aos atributos arquitetônicos previstos. O otimizador Adam foi usado com taxa de aprendizado de 0,0001 e parâmetros padrão TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas. A parada precoce foi aplicada com base na perda de validação, e a redução adaptativa da taxa de aprendizado foi usada para melhorar a convergência. O treinamento era realizado por até 15 épocas.

InceptionV3:

InceptionV3 é uma arquitetura CNN profunda capaz de capturar características multiescala com o uso de operações convolucionais paralelas. Ela se baseia no módulo Inception, que utiliza uma variedade de tamanhos de filtro na mesma camada para extrair características de grão fino e grosseiras ao mesmo tempo. Esse tipo de design arquitetônico permite que a rede aprenda hierarquias espaciais complexas e seja computacionalmente eficiente. Além disso, o InceptionV3 utiliza convoluções fatorizadas e redução de dimensionalidade, que melhoram o desempenho e minimizam o custo computacional.

O InceptionV3 é aplicado no framework proposto como um extrator eficaz de características para analisar imagens de plantas residenciais. Plantas de andar consistem em uma variedade de padrões espaciais, como tamanhos de salas, plantas estruturais e conectividade, exigindo aprendizado de características em múltiplas escalas. A arquitetura Inception é especialmente mais adequada para essa tarefa pelo fato de ser capaz de representar especificidades locais (por exemplo, pequenas salas) e estruturas globais (por exemplo, a organização do layout geral) ao mesmo tempo. O InceptionV3 fornece representações complementares a outros modelos como o MobileNetV2 no contexto do framework meta-ensemble. A diversidade de previsões é aumentada por sua capacidade de modelar relações espaciais complexas, o que é importante para aprimorar o desempenho do conjunto. Isso eventualmente ajuda a melhor prever características arquitetônicas e reforça a classificação posterior do design habitacional amigável para idosos e integrado à saúde.

O modelo InceptionV3 é treinado usando uma abordagem de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3 para garantir compatibilidade com a arquitetura da rede e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento.

As camadas originais de classificação do InceptionV3 são removidas, e uma cabeça de regressão personalizada é introduzida para permitir a previsão multioutput. A cabeça de regressão personalizada consistia em uma camada de Global Average Pooling seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. A base convolucional é parcialmente ajustada, com as camadas inferiores pré-treinadas congeladas e as camadas superiores, juntamente com a cabeça de regressão personalizada, ajustadas para aprender características específicas do plano de domínio, mantendo representações visuais gerais adquiridas durante o pré-treinamento. Após a espinha dorsal convolucional, uma camada de Pooling Média Global transforma os mapas de características em uma representação compacta de características. Em seguida, vêm camadas totalmente conectadas contendo 512 e 256 neurônios com funções de ativação de ReLU. Para minimizar o sobreajuste e melhorar a generalização, taxas de dropout de 0,4 e 0,3 são aplicadas. A camada final de saída consiste em quatro neurônios com ativação linear correspondente à previsão de metragem quadrada, número de quartos, número de banheiros e número de garagem. O modelo é treinado usando o otimizador Adam com taxa de aprendizado de 0,0001, tamanho de lote de 32 e até 15 épocas de treinamento, com paradas precoces e redução adaptativa da taxa de aprendizado para garantir convergência estável.

ResNet101:

O ResNet101 é uma estrutura profunda da CNN construída sobre o princípio do aprendizado residual, que possibilita treinar redes extremamente profundas superando o problema do gradiente nulo. Ele adiciona conexões residuais, ou chamadas conexões de salto, que permitem à rede aprender mapeamentos de identidade e reter informações entre camadas. Essa arquitetura melhora muito a estabilidade do treinamento e permite que o modelo aprenda características hierárquicas complexas. O ResNet101 possui uma grande capacidade representacional de 101 camadas e, portanto, é muito eficaz em tarefas que exigem recursos espaciais extras.

O ResNet101 será usado no framework proposto como um extrator de características de alta capacidade, que analisará imagens de plantas residenciais. O modelo pode ser usado para representar relações espaciais complexas, incluindo conectividade de salas, complexidade de layout e variações estruturais, devido à sua arquitetura profunda. Essas características são fundamentais para fazer previsões precisas sobre elementos arquitetônicos, como metragem quadrada, quartos, banheiros e garagens. No design do meta-ensemble, o ResNet101 é um componente significativo e fornece representações profundas e abstratas de características. O ResNet101 se preocupa mais com características estruturais finas e, portanto, é mais diversificado entre os aprendizes base em comparação com modelos leves como o MobileNetV2. Essa heterogeneidade desempenha um papel essencial em melhorar o desempenho de um conjunto e previsões robustas, especialmente ao lidar com a classificação residencial baseada na saúde.

O ResNet101 é treinado usando uma abordagem de aprendizado por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3, o que garante compatibilidade arquitetônica e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. A cabeça de classificação original do ResNet101 é removida (include_top=Falso), e uma cabeça de regressão personalizada é introduzida para permitir a previsão multioutput. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. Para equilibrar reutilização de características e adaptação de domínio, as camadas pré-treinadas inferiores foram congeladas, enquanto as camadas mais profundas a partir de conv4_block1_1_conv e a cabeça de regressão personalizada foram ajustadas finamente. Essa estratégia seletiva de treinamento permite que o modelo retenha características visuais genéricas enquanto adapta representações de nível superior às imagens de planta baixa. A saída da base convolucional é passada por uma camada de Pooling Média Global para gerar uma representação compacta de características. Em seguida, vêm camadas totalmente conectadas com 512 e 256 neurônios usando funções de ativação do ReLU. A normalização em lote é aplicada para estabilizar o aprendizado, e camadas dropout com taxas de 0,4 e 0,3 são incorporadas para reduzir o sobreajuste e melhorar a generalização. A camada final de saída contém quatro neurônios com ativação linear correspondente à metragem quadrada, número de quartos, banheiros e garagens. O otimizador Adam foi usado com uma taxa de aprendizado de 0,0001, conforme descrito na configuração de treinamento. A ampliação de dados incluiu inversão aleatória, rotação, zoom e deslocamento para melhorar a generalização do modelo. O treinamento foi realizado por até 15 épocas, com paradas precoces baseadas na perda de validação e redução da taxa de aprendizado adaptativo.

VGG16:

VGG16 é uma arquitetura simples de rede neural do tipo convolucional profundo, eficaz e simples em tarefas de reconhecimento visual. É composto por 16 camadas com um design regular ou homogêneo incorporando pequenos filtros convolucionais de 3 × 3, que facilitam o aprendizado de representações hierárquicas de características pela rede. A arquitetura é focada em profundidade e simples, o que significa que é capaz de capturar detalhes de baixo nível, como bordas, texturas e estruturas semânticas de alto nível. O VGG16, com seu design regular e bom desempenho, é agora uma escolha popular de backbone ao realizar aprendizado por transferência em tarefas relacionadas a imagens.

No modelo sugerido, o VGG16 é usado como modelo DL de referência para derivar características espaciais de imagens de plantas residenciais. O fato de ser organizado permite que seja muito útil para capturar os detalhes mais finos dos padrões de layout, como limites de salas, alinhamentos estruturais e organização espacial. Essas características são essenciais para prever de forma eficaz os atributos da arquitetura, como metros quadrados, quartos, banheiros e garagens. No sistema meta-ensemble, VGG16 fornece representações de características estáveis e bem generalizadas. O VGG16 oferece uma abordagem de extração de recursos mais equilibrada em comparação com arquiteturas mais profundas, como a ResNet101, e arquiteturas multiescala, como a InceptionV3, aumentando a diversidade base do aprendize. Essa heterogeneidade é fundamental para aprimorar o desempenho do conjunto e previsões confiáveis da classificação residencial voltada para a saúde.

O modelo VGG16 é treinado usando uma abordagem de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3 para garantir compatibilidade com a arquitetura e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. As camadas originais de classificação são removidas (include_top=Falso), e uma cabeça de regressão personalizada é adicionada para adaptar o modelo para a previsão multioutput. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. As camadas pré-treinadas inferiores foram congeladas, enquanto as camadas que começam a partir de block4_conv1 e a cabeça de regressão personalizada foram ajustadas finamente. Essa estratégia permite que o modelo mantenha características visuais gerais enquanto aprende representações específicas de domínio relevantes para a análise de plantas de andar de andar (floorplanes). As características de saída da base convolucional são passadas por uma camada de Pool de Média Global para gerar um vetor de características compacto. Em seguida, vêm camadas totalmente conectadas com 512 e 256 neurônios usando funções de ativação do ReLU. A normalização em lote e camadas de dropout com taxas de 0,4 e 0,3 são incorporadas para estabilizar o treinamento, reduzir o sobreajuste e melhorar a generalização. A camada final de saída contém quatro neurônios com ativação linear correspondente à metragem quadrada, número de quartos, banheiros e previsões de garagem. O otimizador Adam foi usado com uma taxa de aprendizado de 0,0001, conforme descrito na configuração de treinamento. A ampliação de dados incluiu inversão aleatória, rotação, zoom e deslocamento para melhorar a generalização do modelo. O treinamento foi realizado por até 15 épocas, com paradas precoces baseadas na perda de validação e redução da taxa de aprendizado adaptativo.

CARE-MIRV-Net (Modelo Proposto de Meta-Ensemble DL):

O CARE-MIRV-Net sugerido (Context-Aware Residential Ensemble utilizando MobileNetV2, InceptionV3, ResNet101 e VGG16 Network) é uma estrutura DL meta-ensemble baseada em empilhamento, que visa melhorar a estimativa de características arquitetônicas com base em imagens de plantas residenciais. A arquitetura combina várias CNNs heterogêneas explorando suas vantagens sinérgicas na extração de recursos. O modelo proposto baseia-se na combinação de arquitetura leve, profunda e multiescala, que melhora o desempenho preditivo e proporciona robustez em uma ampla variedade de layouts residenciais. Em contraste com as técnicas tradicionais baseadas em modelo único, o CARE-MIRV-Net segue uma abordagem de aprendizagem hierárquica, onde modelos base fornecem previsões iniciais, que são então aprimoradas por um meta-aprendiz.

Quando se trata de design residencial que seja espacialmente consciente e cuidadoso com a saúde, a interpretação correta dos layouts da planta baixa é de extrema importância. Modelos DL únicos tendem a ser insuficientes para generalizar diferentes padrões arquitetônicos. O framework proposto superará essa fragilidade usando quatro arquiteturas diferentes: MobileNetV2, InceptionV3, ResNet101 e VGG16, que trazem diferentes capacidades representacionais próprias. O MobileNetV2 pode ser usado para extrair recursos de forma eficiente e é leve; InceptionV3 aprende padrões espaciais em múltiplas escalas; O ResNet101 aprende representações hierárquicas profundas; e o VGG16 aprende recursos de forma consistente e confiável. Uma combinação desses modelos facilita que a estrutura abrace tanto os atributos espaciais locais quanto globais, o que aumenta a precisão e confiabilidade das características previstas, como metragem quadrada, número de quartos, banheiros e garagens. As previsões acima também podem ser usadas para prever uma classificação adicional de layouts residenciais, incluindo amigáveis para idosos, integrados à saúde e residenciais gerais.

O CARE-MIRV-Net é implementado usando uma estratégia de conjunto baseada em empilhamento em dois estágios. No primeiro estágio, os quatro modelos base geram previsões independentemente para as variáveis alvo. As entradas do meta-aprendiz foram geradas concatenando as saídas de previsão produzidas pelos modelos base treinados nos dados de treinamento. Essas previsões concatenadas formaram os vetores meta-características de 16 dimensões usados para o treinamento de metamodelos. O vazamento de informações foi evitado por meio da separação rigorosa dos conjuntos de dados de treinamento e teste, e nenhuma amostra de teste foi usada durante o treinamento do modelo base ou do metamodelo. Os mesmos conjuntos de dados de treinamento e validação usados nos modelos base foram empregados durante o processo de empilhamento. Durante o treinamento e a inferência, o vetor meta-característica de 16 dimensões foi construído concatenando as quatro saídas de predição geradas pelo MobileNetV2, InceptionV3, ResNet101 e VGG16. Como cada modelo gera um vetor de saída quadridimensional, a representação concatenada produz uma entrada de 16 dimensões para o meta-aprendiz. Essa transformação combina as previsões de todos os modelos base e serve como entrada para a segunda etapa do framework. A segunda etapa envolve construir um meta-aprendiz totalmente conectado para rede neural para aprender a combinação ótima de previsões do modelo base. O meta-aprendiz consistia em camadas totalmente conectadas com 512 e 256 neurônios, ativação de ReLU, normalização em lote, taxas de abandono de 0,4 e 0,3, e uma camada linear de saída de quatro neurônios. Camadas dropout com taxas de 0,4 e 0,3 foram aplicadas após as camadas densas para reduzir o sobreajuste e melhorar a generalização. O meta-modelo foi treinado usando o otimizador Adam com taxa de aprendizado de 0,0001, tamanho de lote de 32 e até 15 épocas com paradas precoces e redução da taxa de aprendizado adaptativa. Os dados de validação foram usados para monitorar o desempenho do modelo durante o treinamento e para selecionar o modelo de melhor desempenho. Após o treinamento, o modelo meta-ensemble gerava previsões finais combinando resultados de todos os aprendizes base. MAE eR2 foram usados para avaliar o desempenho do CARE-MIRV-Net. Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas. Os resultados foram obtidos em uma única execução experimental usando uma semente aleatória fixa. A estrutura proposta melhora a capacidade preditiva ao combinar várias estruturas DL por meio de um mecanismo de empilhamento e fornecer análise interpretável de plantas residenciais. Isso torna o CARE-MIRV-Net aplicável no contexto de projetos residenciais focados na geriatria e orientados para a saúde. O código-fonte, as informações de configuração do ambiente, as especificações de dependência de software e a documentação de implementação são fornecidos no Arquivo Suplementar 1.

Avaliação de Desempenho

A análise de desempenho do framework proposto é realizada para determinar seu poder preditivo, robustez e desempenho de generalização entre diferentes características arquitetônicas. Análises quantitativas e qualitativas são realizadas para confirmar a utilidade do modelo proposto. O procedimento de avaliação envolve tanto medidas padrão de regressão quanto ambientes experimentais controlados para permitir uma comparação justa com os modelos de referência. Os experimentos foram realizados usando uma única execução experimental com uma semente aleatória fixa para garantir reprodutibilidade e consistência em todos os modelos de referência e propostos.

Parâmetros de Desempenho:

Duas medidas de regressão bem conhecidas, MAE e R2, são usadas para avaliar o desempenho do framework proposto. A MAE mede a magnitude média dos erros de predição e fornece uma indicação clara da proximidade entre os valores previstos e reais. Por outro lado, o valor R2 é usado para avaliar a proporção de variância nas variáveis-alvo explicadas pelo modelo, refletindo seu poder preditivo geral. A combinação dessas métricas fornece uma avaliação abrangente da precisão e do desempenho generalizado de todas as características arquitetônicas previstas. Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas.

Configuração Experimental:

Os experimentos foram realizados em um ambiente de computação em nuvem usando Python (versão 3.12.12). O protocolo proposto foi implementado usando TensorFlow (versão 2.19.0), Keras (versão 3.13.2), NumPy (versão 2.4.6), Pandas (versão 2.3.3), Scikit-learn (versão 1.6.1), Matplotlib (versão 3.9) e SHAP (versão 0.51.0). O ambiente computacional utilizava um processador Intel Xeon operando a 2,20 GHz com aproximadamente 31 GB de memória do sistema. Os experimentos foram realizados em um sistema operacional Ubuntu 22.04 LTS utilizando GPUs NVIDIA Tesla T4 × 2. O conjunto de dados contém 2.640 imagens de plantas residenciais que foram pré-processadas e subdivididas em conjuntos de dados de treinamento e teste. O conjunto de dados foi dividido usando uma proporção de 80:20, resultando em 2.112 amostras de treinamento e 528 amostras de teste. MobileNetV2, InceptionV3, ResNet101 e VGG16 são quatro modelos DL que foram treinados usando uma abordagem de ajuste fino com aprendizado por transferência. Um modelo meta-conjunto baseado em empilhamento, CARE-MIRV-Net, foi então construído para combinar previsões desses modelos base. Cada modelo foi treinado sob condições uniformes, incluindo redimensionamento da imagem para 224 × 224 pixels, aumento de dados e paradas antecipadas para reduzir o sobreajuste. A ampliação de dados incluía inversão aleatória, rotação, zoom e deslocamento. Foram usados um lote de 32 e um máximo de 15 épocas de treinamento, com parada precoce baseada na perda de validação e redução da taxa de aprendizado adaptativo. A análise final foi realizada em um conjunto de testes oculto para fornecer uma avaliação imparcial e confiável do desempenho. O conjunto de testes oculto foi gerado durante o particionamento inicial do conjunto de dados e permaneceu completamente isolado durante o treinamento e desenvolvimento do modelo para garantir uma avaliação de desempenho imparcial.

Descrição do Conjunto de Dados:

O conjunto de dados usado para apoiar os resultados deste estudo está disponível publicamente na plataforma Kaggle com o título "Imagens de Plantas e Seus Detalhes"28. O conjunto de dados está disponível em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (acessado em 16 de abril de 2026). Os dados consistem em 2.640 imagens de plantas residenciais e metadados arquitetônicos organizados. Cada amostra é um plano habitacional distinto, que oferece uma ampla variedade de layouts residenciais com diferentes tamanhos, configurações e arranjos espaciais. O tamanho do conjunto de dados é suficiente para treinamento baseado em DL e contém uma variedade de padrões arquitetônicos. O conjunto de dados consiste em uma imagem bidimensional de planta e atributos numéricos relacionados que descrevem as características estruturais da residência. Essas características incluem a área total em metragem quadrada, número de quartos, número de banheiros e número de garagens. Além disso, cada registro contém um caminho de imagem, que permite o mapeamento direto das entradas visuais para as etiquetas. As variáveis do conjunto de dados incluem imagem da planta baixa, caminho da imagem, metragem quadrada, número de quartos, número de banheiros e número de garagem. A imagem da planta baixa serve como recurso de entrada, enquanto os atributos arquitetônicos são usados como alvos de previsão. Portanto, o conjunto de dados é adequado para aprendizado supervisionado, com imagens servindo como características de entrada e atributos arquitetônicos como alvos de regressão.

O conjunto de dados contém uma grande variedade de layouts residenciais, que vão desde layouts compactos com menos cômodos até layouts grandes com múltiplos cômodos. Essa variabilidade permite o aprendizado de representações espaciais significativas, incluindo distribuição de salas, densidade de layout e complexidade estrutural. Essa diversidade é especialmente importante para o modelo proposto, pois apoia a categorização dos planos em layouts amigáveis para idosos, integrados à saúde e residenciais gerais. Antes do treinamento do modelo, o conjunto de dados é processado por meio de uma sequência de procedimentos de pré-processamento para garantir consistência e compatibilidade com modelos DL. Todas as imagens foram redimensionadas para 224 × 224 pixels e normalizadas para o intervalo [0, 1] antes do treinamento. O conjunto de dados é então organizado combinando caminhos de imagem com seus metadados correspondentes, após o que é separado em subconjuntos de treinamento e teste para facilitar a análise de desempenho. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20. Registros contendo informações completas de imagem e metadados foram incluídos na análise, enquanto registros incompletos ou inválidos foram excluídos. Uma semente aleatória fixa foi usada durante o particionamento do conjunto de dados para garantir a reprodutibilidade. O conjunto de dados fornece uma base detalhada para a análise de plantas residenciais impulsionada por IA. A combinação de 2.640 imagens anotadas e diversos atributos arquitetônicos suporta a modelagem de regressão multisaída e permite a integração da inteligência espacial com a tomada de decisões de design residencial voltada para a saúde.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Um conjunto de experimentos foi realizado para avaliar a estrutura proposta usando quatro modelos DL, MobileNetV2, InceptionV3, ResNet101 e VGG16, juntamente com o modelo proposto de meta-ensemble CARE-MIRV-Net.

Resultados da Aquisição e Pré-processamento de Conjuntos de Dados

A fase de pré-processamento foi projetada para preparar as imagens brutas do plano de piso e os metadados relacionados para treinamento e ava...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Este estudo apresenta o CARE-MIRV-Net, uma estrutura DL meta-ensemble baseada em empilhamento para análise automatizada de imagens de plantas residenciais. O framework integra quatro arquiteturas CNN complementares — MobileNetV2, InceptionV3, ResNet101 e VGG16 — para prever atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Essas previsões são posteriormente combinadas por meio de um meta-aprendiz e usadas dentro de uma camada de decisão...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Conflitos de Interesse:

Os autores não declaram conflitos de interesse.

Contribuições dos Autores:

Ning Zhang propôs ideias de pesquisa, desenhou planos experimentais e coordenou o processo de pesquisa. Yu Bi realizou experimentos, coletou dados, participou da análise de dados e da revisão de artigos.

Agradecimentos

Os autores reconhecem sinceramente o apoio financeiro fornecido pelo Projeto de Pesquisa Científica do Departamento Provincial de Educação de Jilin.

FINANCIAMENTO:

Essa pesquisa foi financiada pelo Projeto de Pesquisa Científica do Departamento Provincial de Educação de Jilin (Bolsa nº JJKH20240801KJ).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
PACOTE DE IMPLEMENTAÇÃO CARE-MIRV-NetArquivo Suplementar 1Versão 1.0N/A
Scripts de regeneração de figuras e tabelasArquivo Suplementar 1Versão 1.0N/A
Imagens de Plantas e Seu Dataset DetalhadoKaggleDataset PúblicoN/A
GPUNVIDIA CorporationTesla T4 × 2N/A
Processador Intel XeonIntel Corporation2,20 GHzN/A
KerasKeras TeamVersão 3.13.2N/A
MatplotlibMatplotlib Development TeamVersão 3.9RRID:SCR_008624
NumPyNumPy DevelopersVersão 2.4.6RRID:SCR_008633
Sistema OperacionalLinuxUbuntu 22.04 LTSN/A
PandasPandas Development TeamVersão 2.3.3RRID:SCR_018214
PythonPython Software FoundationVersão 3.12.12RRID:SCR_008394
Scikit-learnScikit-learn DevelopersVersão 1.6.1RRID:SCR_002577
SHAPSHAP Development TeamVersão 0.51.0N/A
Memória do Sistema (RAM)Ambiente de Computação em Nuvem31 GBN/A
TensorFlowGoogleVersão 2.19.0RRID:SCR_016345
Arquivo de configuração do ambiente de treinamentoArquivo Suplementar 1Versão 1.0N/A

Referências

  1. Apanavičienė R, Shahrabani MMN. Key factors affecting smart building integration into smart city: technological aspects. Smart Cities. 2023;6(4):1832-1857.
  2. Li J, et al. The relationship between artificial intelligence (AI) and building information modeling (BIM) technologies for sustainable building in the context of smart cities. Sustainability. 2024;16(24):10848.
  3. Khade R, Jariwala K, Chattopadhyay C. A comprehensive survey of floor plan image analysis and related applications. Int J Doc Anal Recognit. 2026;29(1):41-59.
  4. Okuyucu EB, Kösenciğ KÖ. AI-assisted floor plan design incorporating structural constraints. Nexus Netw J. 2025;27(4):947-963.
  5. Kim H. Evaluation of deep learning-based automatic floor plan analysis technology: an AHP-based assessment. Appl Sci. 2021;11(11):4727.
  6. Goyal S, Chattopadhyay C, Bhatnagar G. A computational approach to understand building floor plan images using machine learning techniques. In: Internet of Multimedia Things. Elsevier; 2022. p. 233-259.
  7. Li Y, Chen H, Yu P, Yang L. A review of artificial intelligence in enhancing architectural design efficiency. Appl Sci. 2025;15(3):1476.
  8. Yıldız B, Çağdaş G, Zincir I. Architectural space classification considering topological and 3D visual spatial relations using machine learning techniques. Build Res Inf. 2024;52(1-2):68-86.
  9. Albukhari IN. The role of artificial intelligence (AI) in architectural design: a systematic review of emerging technologies and applications. J Umm Al-Qura Univ Eng Archit. 2025;16(4):1457-1476.
  10. Kumar H, KS KM, SAS AR, VC J. Explainability to image captioning models: an improved post-hoc approach through Grad-CAM. In: 2025 International Conference on Innovation in Computing and Engineering (ICE); 2025. p. 1-6. Available from: https://doi.org/10.1109/ICE63309.2025.10984143
  11. Alshammeri M, Ahmad Z, Humayun M, Alamri M. Explainable cluster-based predictive framework for early diagnosis of autism spectrum disorder using behavioral biomarkers. Diagnostics. 2025;15(24):3241.
  12. Zhao T, Zhao Y, Zhou T. Stacking ensemble learning for seabed sediment classification. In: 2024 7th International Conference on Information Communication and Signal Processing (ICICSP); 2024. p. 211-215. Available from: https://doi.org/10.1109/ICICSP62589.2024.10809036
  13. Bazie IG, et al. Leveraging machine learning techniques in converting 2D floorplans images to 3D models: applications, challenges, and future directions. Procedia Comput Sci. 2025;272:234-241.
  14. Luo G, et al. Controllable and flexible residential floor plan layout design based on multi-agent deep reinforcement learning with layout prior size and similar experience abandon. Adv Eng Inform. 2025;68:103702.
  15. Ling H, Luo G, Zhou N, Jiang X. Survey of architectural floor plan retrieval technology based on 3ST features. AI. 2025;6(4):67.
  16. Memon SA, Shehata W, Rowlinson S, Sunindijo RY. Generative artificial intelligence in architecture, engineering, construction, and operations: a systematic review. Buildings. 2025;15(13):2270.
  17. Yang C, et al. How can SHAP (SHapley Additive exPlanations) interpretations improve deep learning-based urban cellular automata model? Comput Environ Urban Syst. 2024;111:102133.
  18. Mienye ID, Swart TG. A comprehensive review of deep learning: architectures, recent advances, and applications. Information. 2024;15(12):755.
  19. van Engelenburg C, et al. MSD: a benchmark dataset for floor plan generation of building complexes. In: Vedaldi A, Bischof H, Brox T, Frahm JM, editors. Computer Vision – ECCV 2024. Lecture Notes in Computer Science. Cham: Springer Nature Switzerland; 2025. p. 60-75.
  20. Ganaie MA, et al. Ensemble deep learning: a review. Eng Appl Artif Intell. 2022;115:105151.
  21. Zhou W, et al. HIDIM: a novel framework of network intrusion detection for hierarchical dependency and class imbalance. Comput Secur. 2025;148:104155.
  22. Carrera L, et al. The impact of architecturally qualified data in deep learning methods for the automatic generation of social housing layouts. Autom Constr. 2024;158:105238.
  23. Yang B, et al. Automated semantics and topology representation of residential-building space using floor-plan raster maps. IEEE J Sel Top Appl Earth Obs Remote Sens. 2022;15:7809-7825.
  24. Rathnayake N, Rathnayake U, Dang TL, Hoshino Y. An efficient automatic Fruit-360 image identification and recognition using a novel modified cascaded-ANFIS algorithm. Sensors. 2022;22(12):4401.
  25. Alsulami AA, et al. Security strategy for autonomous vehicle cyber-physical systems using transfer learning. J Cloud Comput. 2023;12(1):181.
  26. Alshammari A. Construction of VGG16 convolution neural network (VGG16_CNN) classifier with NestNet-based segmentation paradigm for brain metastasis classification. Sensors. 2022;22(20):8076.
  27. Mascarenhas S, Agarwal M. A comparison between VGG16, VGG19 and ResNet50 architecture frameworks for image classification. In: 2021 International Conference on Disruptive Technologies for Multi-Disciplinary Research and Applications (CENTCON); 2021. p. 96-99. Available from: https://doi.org/10.1109/CENTCON52345.2021.9687944
  28. Kaggle. Floor Plan Images and Their Details [Internet]. Available from: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details. Accessed 2026 Apr 16.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

EngenhariaEdi o 233Edi o 233Valor VazioEdi oAprendizado de meta ensemblean lise de planta baixadesign residencialhabita o para cuidados de idososdesign integrado sa deXAI
Vídeo em breve