Artigo de investigação

Previsão baseada em aprendizado profundo dos atributos do plano residencial para avaliação habitacional voltada para idosos

DOI:

10.3791/72157

31 de julho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esse protocolo descreve um fluxo de trabalho de deep learning meta-ensemble para análise automatizada de imagens de plantas residenciais. O procedimento inclui pré-processamento de conjuntos de dados, predição de atributos arquitetônicos usando múltiplas redes neurais convolucionais, aprendizado de conjunto baseado em empilhamento, classificação residencial baseada em regras e análise de explicabilidade usando SHapley Additive ExPlanations para apoiar a avaliação de layout residencial.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A crescente demanda por soluções de moradia inteligente para populações envelhecidas aumentou a necessidade de métodos automatizados para análise de plantas residenciais. Abordagens convencionais de avaliação arquitetônica são frequentemente manuais, demoradas e difíceis de escalar, destacando a necessidade de técnicas baseadas em inteligência artificial que possam interpretar layouts espaciais e apoiar a avaliação de projetos residenciais. Esse protocolo descreve uma estrutura de aprendizado profundo meta-ensemble para análise automatizada de imagens de plantas residenciais. O framework proposto CARE-MIRV-Net integra quatro redes neurais convolucionais complementares — MobileNetV2, InceptionV3, ResNet101 e VGG16 — para prever atributos arquitetônicos, incluindo metragem quadrada, número de quartos, banheiros e garagens. As previsões dos modelos base são combinadas por meio de um modelo meta-conjunto baseado em empilhamento e posteriormente usadas dentro de uma camada de decisão baseada em regras para categorizar layouts residenciais como cuidados para idosos, cuidados médicos ou residenciais gerais. A avaliação experimental demonstrou desempenho preditivo robusto em múltiplas variáveis-alvo. O modelo proposto alcançou um erro absoluto médio (MAE) de 432,48 e um coeficiente de determinação (R2) de 0,7053 para a previsão de metragem quadrada. Para a previsão do banheiro, a estrutura alcançou R2 de 0,7605, enquanto a previsão da garagem apresentou o menor MAE de 0,1697 e o maiorR 2 de 0,6958. Análises qualitativas também demonstraram a capacidade da estrutura de gerar previsões de atributos arquitetônicos e apoiar a avaliação de layout residencial orientada à aplicação. Para aumentar a transparência e a interpretabilidade, foram incorporadas as explicações aditivas SHapley para quantificar a contribuição de cada modelo base para as previsões finais. O framework proposto oferece uma abordagem interpretável e escalável para análise de plantas residenciais e suporte à decisão.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O rápido desenvolvimento de tecnologias de cidades inteligentes e ambientes de vida inteligentes criou uma demanda crescente por soluções automatizadas e orientadas por dados no design residencial. Em particular, o aumento do envelhecimento da população e a demanda por moradias voltadas para a saúde aumentaram a importância de projetar espaços residenciais que sejam funcionais e adaptados às necessidades de grupos específicosde usuários 1,2. Os métodos convencionais de análise de plantas arquitetônicas são frequentemente manuais, demorados e dependentes de interpretação especializada; Portanto, são ineficientes e difíceis de escalar. Isso criou uma forte necessidade de sistemas inteligentes capazes de analisar automaticamente layouts residenciais e apoiar a tomada de decisõesinformadas 3.

Avanços recentes em inteligência artificial (IA), especialmente em deep learning (DL) e visão computacional, melhoraram significativamente a análise de dados baseados em imagens. Redes neurais convolucionais (CNNs) têm se mostrado altamente eficazes para extração de características espaciais e aprendizado de padrões visuais complexos, tornando-as adequadas para análise de imagens em plantas 4,5,6. Esses modelos podem aprender representações implícitas das estruturas dos cômodos, organização do layout e relações espaciais que são essenciais para prever atributosarquitetônicos 7,8. No entanto, a dependência de um único modelo DL pode limitar a generalização porque diferentes arquiteturas podem focar em características espaciais distintas e apresentar vieses decorrentes da variabilidadearquitetônica 9. Apesar desses avanços, abordagens existentes frequentemente carecem de uma estrutura integrada que combine múltiplos modelos, suporte a previsão multioutput e ofereça interpretabilidade em nível de aplicação. Além disso, a avaliação residencial voltada para a saúde e a explicabilidade receberam atenção relativamente limitada nos sistemas de análise de plantas baixas. A ausência de tais estruturas abrangentes limita a aplicabilidade prática e a interpretabilidade, especialmente em domínios onde transparência e suporte à decisão sãoimportantes 10,11,12.

A IA também contribuiu substancialmente para a análise automatizada e geração de plantas arquitetônicas. Um estudo investigou o uso de aprendizado de máquina (ML) para transformar imagens de plantas bidimensionais em modelostridimensionais 13. Os autores destacaram as limitações dos métodos convencionais baseados em design assistido por computador (CAD) e enfatizaram a importância de pipelines escaláveis baseados em IA para a compreensão espacial. Seus achados demonstraram que a DL pode extrair efetivamente informações estruturais de plantas baixas, embora ainda existam desafios relacionados à generalização e variabilidade dos dados. Outro estudo propôs uma estrutura de aprendizado profundo por reforço multiagente para geração automatizada de plantasde piso 14. Embora a abordagem ofereça considerável flexibilidade e personalização para o design arquitetônico, ela é focada principalmente na geração de projetos, em vez da análise preditiva de plantas existentes.

Uma pesquisa abrangente de recuperação de plantas baixas examinou características semânticas, espaciais, baseadas em formas e texturas para o entendimento de plantas15. A pesquisa enfatizou a importância dos modelos DL, incluindo CNNs e arquiteturas baseadas em transformers, para o aprendizado de representações significativas. No entanto, também identificou desafios relacionados a ruído, distorção e discriminação de características em layouts complexos. De forma semelhante, uma abordagem baseada em ML incorporou relações topológicas e visuais para o reconhecimento de plantas8. O estudo demonstrou que acessibilidade visual e conectividade espacial são importantes para entender layouts arquitetônicos, mas não abordou estratégias de previsão multisaída ou aprendizado em conjunto. A IA generativa também tem sido explorada em aplicações arquitetônicas. Uma revisão da IA generativa na arquitetura examinou o uso de redes generativas adversariais (GANs), autoencoders variacionais (VAEs) e modelos de difusão para automaçãode projetos 16. Os autores destacaram a crescente adoção de ferramentas de IA em fluxos de trabalho arquitetônicos práticos. No entanto, o foco desse trabalho era a geração de projetos, e não modelagem preditiva ou aplicações de suporte à decisão. A IA explicável tornou-se cada vez mais importante para interpretar modelos DL. Um estudo propôs uma estrutura baseada em SHapley Additives ExPlanations (SHAP) para interpretar modelos DL em aplicações de simulaçãourbana 17. Os resultados demonstraram que o SHAP pode identificar características influentes e melhorar a interpretabilidade tanto em nível global quanto local. Embora o estudo apoie o valor do SHAP em aplicações espaciais, ele não investigou sua integração com frameworks de aprendizado em conjunto. Desenvolvimentos recentes em arquiteturas de DL melhoraram ainda mais o desempenho em tarefas baseadas em imagem. Um estudo apresentou uma revisão abrangente dos modelos contemporâneos de DL, incluindo arquiteturas baseadas em CNN etransformers 18. O estudo destacou a importância da seleção de modelos e das arquiteturas híbridas para melhorar o desempenho da generalização. No entanto, não abordou especificamente as aplicações de análise de plantas de andar (floorplanes). Conjuntos de dados em grande escala também facilitaram avanços na análise arquitetônica. Por exemplo, um estudo introduziu um conjunto de dados de referência contendo milhares de plantas complexas19. O estudo demonstrou que modelos existentes continuam enfrentando desafios ao analisar layouts de grandes e vários apartamentos, destacando a necessidade de abordagens mais robustas e generalizáveis.

A DL também tem sido amplamente estudada em aprendizagem em conjunto. Um estudo recente sobre métodos de conjunto profundo indicou que combinar múltiplos modelos pode melhorar significativamente a precisão e a robustez preditivas ao reduzir o viés e a variância20. Apesar de sua eficácia, esses métodos não foram amplamente aplicados à análise de plantas arquitetônicas, especialmente em tarefas de regressão multioutput. Além disso, estudos recentes em análise automatizada de plantas de andar destacaram a importância de estruturas integradas que combinam previsão, classificação einterpretabilidade 21,22,23. Pesquisas existentes normalmente focam em funções individuais, como extração de características, geração de layout ou classificação. Consequentemente, permanece uma clara lacuna de pesquisa no desenvolvimento de uma estrutura unificada que integre aprendizagem multimodelo, avaliação de layout residencial e IA explicável. Embora avanços consideráveis tenham sido feitos em análise de DL e arquitetura, várias lacunas de pesquisa permanecem. A maioria dos estudos existentes foca no reconhecimento de plantas, extração de recursos ou geração de layout sem fornecer uma estrutura unificada que suporte tanto a previsão multisaída quanto a tomada de decisão em nível de aplicação. Além disso, muitas abordagens dependem de um único modelo DL, o que pode limitar sua capacidade de capturar diversas características espaciais e pode introduzir vieses específicos do modelo. A aprendizagem em conjunto para análise de plantas de andar ainda é relativamente pouco explorada, especialmente no que diz respeito à integração de modelos heterogêneos para melhorar a robustez. Além disso, atenção limitada tem sido dada à classificação residencial, com ênfase em considerações habitacionais voltadas para idosos e interpretabilidade. Como muitos modelos DL funcionam como caixas-pretas, entender a base de suas previsões continua sendo desafiador. Essas limitações destacam a necessidade de uma estrutura abrangente que integre aprendizado multimodelo, previsão precisa, classificação residencial orientada a aplicações e IA explicável.

Este estudo apresenta uma estrutura automatizada para a análise de imagens de plantas residenciais, com ênfase na consciência espacial e na avaliação de disposição residencial, para enfrentar esses desafios. A estrutura proposta introduz um modelo DL meta-ensemble, CARE-MIRV-Net, que integra quatro CNNs complementares — MobileNetV2, InceptionV3, ResNet101 e VGG16 — dentro de uma arquitetura baseada emempilhamento 24, 25, 26 e 27. Cada modelo prevê independentemente atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Essas previsões são posteriormente combinadas por um meta-aprendiz para gerar previsões refinadas. Além disso, uma camada de decisão baseada em regras é usada para categorizar layouts residenciais como cuidados para idosos, cuidados médicos ou residenciais gerais com base nos atributos previstos.

As contribuições deste trabalho são as seguintes. Primeiro, é proposto um framework DL meta-ensemble para a previsão multioutput de atributos arquitetônicos a partir de imagens de plantas residenciais. Segundo, o modelo CARE-MIRV-Net integra quatro arquiteturas CNN para melhorar a precisão e a generalização das previsões. Terceiro, uma camada de decisão baseada em regras é incorporada para suportar a categorização de layout residencial orientada a aplicações com base em atributos arquitetônicos previstos. Quarto, a IA explicável baseada em SHAP é integrada para aumentar a transparência e a interpretabilidade do modelo. Por fim, experimentos extensos são realizados para avaliar o arcabouço proposto usando o erro absoluto médio (MAE) e o coeficiente de determinação (R2) como métricas de desempenho.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo utilizou um conjunto de dados público da plataforma Kaggle (Imagens de Planta e Seus Detalhes, disponível em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; acessado em 16 de abril de 2026). Não envolveu participantes humanos, animais ou dados pessoalmente identificáveis; portanto, aprovação ética e consentimento informado não eram necessários.

Esse protocolo apresenta uma estrutura orientada por IA para análise automatizada de imagens de plantas residenciais, com foco em design espacialmente consciente e voltado para a saúde. O fluxo de trabalho experimental completo é apresentado na Figura 1. O protocolo foi projetado para preencher a lacuna entre a previsão de características arquitetônicas de baixo nível e a tomada de decisão orientada à aplicação de alto nível. Ela integra DL, modelagem em conjunto e IA explicável para fornecer uma solução precisa, robusta e interpretável para análise de layouts residenciais. A estrutura consiste em múltiplas etapas, começando com a aquisição e pré-processamento de dados, seguidas pelo aprendizado de características usando CNNs profundas, previsão de meta-ensemble e, finalmente, classificação em nível de aplicação. Inicialmente, as imagens das plantas e seus atributos arquitetônicos correspondentes são pré-processados por meio de redimensionamento, normalização e aumento de dados para garantir consistência e melhorar a generalização. Todas as imagens de plantas foram redimensionadas para 224 × 224 pixels e normalizadas para a faixa [0, 1]. A ampliação de dados foi aplicada durante o treinamento usando inversão horizontal aleatória, rotação, zoom e deslocamento de largura/altura para melhorar a generalização do modelo e reduzir o sobreajuste. Não foi aplicado nenhum flip vertical. Parâmetros completos de aumento e detalhes de implementação são fornecidos no Arquivo Suplementar 1. Os dados processados foram então usados para treinar múltiplos modelos DL para extração e previsão de características. Todos os modelos base e o meta-aprendiz CARE-MIRV-Net foram treinados usando uma configuração consistente, incluindo aumento de dados, parada precoce e escalonamento adaptativo da taxa de aprendizagem. A parada precoce monitorou a perda de validação (val_loss) com valor de paciência de 5 épocas, e os melhores pesos do modelo foram restaurados automaticamente após o treinamento. O escalonamento adaptativo da taxa de aprendizado foi implementado usando o callback ReduceLROnPlateau, que monitorava a perda de validação e reduzia a taxa de aprendizado em um fator de 0,3 após 2 épocas sem melhora, com uma taxa mínima de aprendizado de 1 × 10⁻7. Detalhes completos da implementação e configurações de parâmetros são fornecidos no Arquivo Suplementar 1. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20. Uma semente aleatória fixa (42) foi usada para garantir a reprodutibilidade. Detalhes completos da implementação são fornecidos no Arquivo Suplementar 1.

figure-protocol-1
Figura 1. Fluxo de trabalho da estrutura CARE-MIRV-Net para análise de plantas residenciais. Visão geral esquemática do protocolo proposto. O fluxo de trabalho inclui (1) aquisição e pré-processamento de conjuntos de dados, (2) aprendizado e previsão de características usando MobileNetV2, InceptionV3, ResNet101 e VGG16, (3) predição de meta-ensemble baseada em empilhamento usando CARE-MIRV-Net, (4) classificação de layout residencial baseada em regras, (5) análise de interpretabilidade baseada em SHapley Additive exPlanations (SHAP) e (6) avaliação de desempenho. Por favor, clique aqui para ver uma versão ampliada desta figura.

Na segunda etapa, quatro CNNs pré-treinadas, MobileNetV2, InceptionV3, ResNet101 e VGG16, são empregadas como aprendizes base. Cada modelo é ajustado com precisão usando aprendizado por transferência para prever atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Para cada modelo de aprendizagem por transferência, as camadas pré-treinadas inferiores foram mantidas congeladas, enquanto as camadas superiores e a cabeça de regressão personalizada foram ajustadas durante o treinamento. Configurações detalhadas de ajuste fino específicas do modelo são fornecidas no Arquivo Suplementar 1. Esses modelos capturam diferentes aspectos da informação espacial: o MobileNetV2 fornece extração eficiente de características, o InceptionV3 captura padrões espaciais multiescala, o ResNet101 aprende representações hierárquicas profundas e o VGG16 garante um aprendizado de características estável e consistente. A diversidade entre esses modelos aumenta a capacidade representacional geral do framework.

Para aumentar ainda mais a precisão e robustez da previsão, é proposto um modelo meta-conjunto baseado em empilhamento, denominado CARE-MIRV-Net. Nessa etapa, as previsões de todos os modelos base são agrupadas para criar um espaço de características de dimensão superior, que é introduzido para um meta-aprendiz. As previsões do modelo base são geradas inicialmente de forma independente usando os modelos treinados MobileNetV2, InceptionV3, ResNet101 e VGG16. Essas previsões são então concatenadas para formar o vetor meta-característica usado pelo meta-aprendiz. Para evitar vazamento de dados, os conjuntos de dados de treinamento e teste são estritamente separados, e o meta-aprendiz é treinado apenas com previsões geradas a partir dos dados de treinamento. O meta-modelo, que é uma rede neural totalmente conectada, é treinado para aprender a combinação ótima de resultados do modelo base para produzir previsões refinadas. O meta-modelo consiste em duas camadas totalmente conectadas com 512 e 256 neurônios usando ativação ReLU, seguidas por camadas de dropout (0,4 e 0,3) e uma camada linear de saída. O modelo é treinado usando o otimizador Adam (taxa de aprendizado = 0,0001), um tamanho de lote de 32 e até 15 épocas. A parada precoce foi implementada monitorando a perda de validação (val_loss) com valor de paciência de 5 épocas. O critério mínimo de melhoria (min_delta) foi definido para o valor padrão do TensorFlow de 0, e os melhores pesos do modelo foram restaurados automaticamente após o treinamento. O escalonamento adaptativo da taxa de aprendizado foi implementado usando o callback ReduceLROnPlateau, que monitorava a perda de validação e reduzia a taxa de aprendizado em um fator de 0,3 após 2 épocas consecutivas sem melhora. A taxa mínima de aprendizado foi definida para 1 × 10⁻7, e o parâmetro de recarga usou o valor padrão do TensorFlow de 0. Esse método de conjunto reduz vieses individuais de modelos e melhora a generalização por meio das forças complementares de múltiplas arquiteturas. Informações detalhadas de implementação são fornecidas no Arquivo Suplementar 1.

Após a previsão, uma camada de interpretação é adicionada para converter as saídas numéricas em decisões em nível de aplicação. Os layouts residenciais podem ser classificados em três classes com base nas previsões das características arquitetônicas: cuidado com idosos, assistência médica integrada (cuidados médicos) e uso residencial geral. Essa classificação é realizada usando regras de decisão baseadas em limiar, pré-definidas, baseadas na metragem quadrada prevista, número de quartos e número de banheiros. A categoria com a maior pontuação é designada como classificação final, enquanto os empates são resolvidos selecionando a categoria que atende ao maior número de critérios de decisão. As regras completas de pontuação e os limiares de classificação são fornecidos no Arquivo Suplementar 2 (Algoritmo 1). Essa ação permite que o arcabouço forneça informações práticas para o design de habitações residenciais.

O framework utiliza IA explicável com SHAP para fornecer transparência e interpretabilidade. Este componente examina a contribuição das previsões de cada modelo base para a saída do metamodelo. A análise SHAP foi realizada usando o SHAP KernelExplainer (SHAP versão 0.51.0) com 100 amostras de treinamento selecionadas aleatoriamente como conjunto de dados de fundo e 50 amostras de teste para geração de explicações. A configuração completa do SHAP, incluindo seleção de amostras em segundo plano e configurações de implementação, é fornecida no Arquivo Suplementar 1. A camada de explicabilidade ajuda a entender o processo de tomada de decisão ao medir a importância das características e exibir padrões de contribuição, melhorando assim a transparência e a confiabilidade do modelo. O framework proposto é avaliado usando MAE eR2 em todas as variáveis-alvo. Para a previsão multioutput, a MAE foi calculada como a diferença absoluta média entre os valores reais e previstos em todas as variáveis alvo, enquanto R2 foi calculada comparando a variância explicada das previsões com os valores de verdade fundamental correspondentes para cada saída. As análises quantitativas e qualitativas indicam que o CARE-MIRV-Net proposto melhora a precisão das previsões e apoia a classificação do layout residencial baseada em regras. A confiabilidade da classificação foi avaliada com base na precisão das previsões de regressão subjacentes e na consistência da camada de decisão baseada em regras. A estrutura é uma solução adequada e escalável para análise inteligente de plantas e pode ser aplicada a habitação inteligente, planejamento de cuidados a idosos e design residencial voltado para a saúde. Uma lista completa de conjuntos de dados, pacotes de software, bibliotecas, recursos de hardware e ferramentas computacionais usados neste estudo é fornecida na Tabela de Materiais. Código-fonte, informações de configuração do ambiente, especificações de dependência de software e scripts de implementação necessários para reproduzir o fluxo de trabalho reportado são fornecidos no Arquivo Suplementar 1.

Algoritmo para o Protocolo

A estrutura proposta adota uma abordagem em múltiplas etapas para processar plantas baseadas em imagens de casas residenciais e produzir resultados preditivos e em nível de decisão, conforme descrito no Algoritmo 1 no Arquivo Suplementar 2. Esse processo começa com o pré-processamento dos dados, no qual as imagens de entrada são redimensionadas para uma resolução padrão e normalizadas para fornecer uniformidade em todo o conjunto de dados. Todas as imagens de plantas foram redimensionadas para 224 × 224 pixels e normalizadas para a faixa [0, 1]. Essa etapa otimiza as imagens para aprendizado por redes neurais profundas e aprimora a convergência geral do modelo. A segunda fase envolve o uso de vários modelos DL como aprendizes base, incluindo MobileNetV2, InceptionV3, ResNet101 e VGG16. Independentemente, cada modelo pega as imagens de entrada e estima características arquitetônicas importantes, como metragem quadrada e o número de quartos, banheiros e garagens. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20, e uma semente aleatória fixa foi usada para garantir a reprodutibilidade. Esses modelos capturam diferentes propriedades espaciais das plantas e fornecem previsões complementares. A representação de características é então construída empilhando as saídas de cada modelo base para criar uma única representação de características. Essa saída conjunta é posteriormente alimentada em um modelo meta-ensemble, CARE-MIRV-Net, que é treinado para combinar as previsões de todos os modelos base. As previsões do modelo base foram geradas independentemente e concatenadas para formar o vetor meta-característico. O vazamento de dados foi evitado por meio da separação rigorosa dos conjuntos de dados de treinamento e teste. O meta-modelo refina essas previsões e produz as previsões finais dos atributos arquitetônicos. O meta-modelo consistia em camadas totalmente conectadas com 512 e 256 neurônios, funções de ativação do ReLU, taxas de abandono de 0,4 e 0,3, o otimizador Adam (taxa de aprendizado = 0,0001), um lote de 32 e até 15 épocas de treinamento com parada precoce. Após a previsão, uma camada de decisão é usada para contextualizar os resultados. De acordo com os valores estimados, cada layout residencial é categorizado como cuidado com idosos, atendimento médico ou uso residencial geral. As categorias residenciais foram atribuídas usando regras de pontuação baseadas em limiar, derivadas dos atributos previstos do plano de andar de baixo. A categoria com a maior pontuação foi selecionada como classificação final. Limiares completos de classificação e regras de decisão são fornecidos no Algoritmo 1 (Arquivo Suplementar 2). Por fim, o framework incorpora um componente de explicabilidade baseado no SHAP para avaliar o impacto de cada modelo base na previsão final. A análise SHAP foi realizada conforme descrito anteriormente e no Arquivo Suplementar 1. Esse componente aumenta a transparência e auxilia na compreensão do processo de tomada de decisão. A eficácia e viabilidade da abordagem proposta foram avaliadas usando medidas padrão de desempenho em regressão. O desempenho foi avaliado usando uma única execução experimental com uma semente aleatória fixa.

Modelos de Avaliação

Nesta seção, são apresentados os modelos DL usados no estudo, incluindo tanto os modelos base individuais quanto o proposto CARE-MIRV-Net. Os modelos de benchmark foram selecionados para representar arquiteturas DL diversas e amplamente adotadas. O MobileNetV2 foi incluído como uma rede leve e computacionalmente eficiente, e o InceptionV3 foi selecionado por sua capacidade de capturar características espaciais em múltiplas escalas. O ResNet101 foi escolhido devido à sua capacidade profunda de aprendizado residual para extração hierárquica de características, e o VGG16 foi incluído como uma arquitetura convolucional bem estabelecida. Todos os modelos de benchmark foram treinados usando procedimentos de pré-processamento idênticos, configurações de aumento de dados, partições de conjuntos de dados, parâmetros de otimização, tamanho do lote e configuração de treinamento para garantir uma avaliação comparativa justa.

MobileNetV2:

MobileNetV2 é um sistema CNN pequeno e compacto, projetado para ser rápido, de alto desempenho e com menor complexidade computacional. Apresenta algumas das principais inovações, como conexões residuais invertidas e gargalos lineares, que facilitam a extração eficiente de características e ainda mantêm alto poder representacional. O MobileNetV2 pode usar convoluções separáveis em profundidade para minimizar significativamente o número total de parâmetros e o custo computacional das redes convolucionais tradicionais, sendo assim bem adaptado a grandes problemas de aprendizado baseados em imagem.

O MobileNetV2 é usado no framework sugerido como um dos modelos fundamentais de DL para prever os atributos arquitetônicos das imagens de plantas residenciais. O modelo é capaz de aprender padrões espaciais como distribuição de salas, densidade de layout e organização estrutural que ocorrem em plantas baixas de forma eficaz devido ao seu design eficiente. Essas representações eruditas desempenham um papel importante na estimativa precisa de características importantes como metragem quadrada, número de quartos, banheiros e garagens com precisão. MobileNetV2 é um modelo leve, que é um bom candidato para ser incluído no framework proposto de meta-ensemble. Ele adiciona algumas representações complementares de características a outros modelos DL e aumenta a robustez e generalização geral do sistema. Esse aprendizado de modelos é muito importante para melhorar a precisão das previsões e auxiliar na classificação de projetos residenciais baseados na saúde.

O modelo MobileNetV2 é treinado usando uma estratégia de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para um tamanho fixo de 224 × 224 × 3, o que é compatível com a arquitetura. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. A cabeça de classificação inicial do MobileNetV2 é removida e substituída por uma cabeça de regressão. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. Para facilitar a adaptação ao domínio, as camadas inferiores pré-treinadas foram congeladas, enquanto as camadas superiores, começando a partir de block_13_expand e a cabeça de regressão personalizada, foram ajustadas finamente. Essa abordagem seletiva de treinamento permite que o modelo retenha características visuais gerais enquanto aprende atributos espaciais específicos de domínio das imagens do plano. Os mapas de características extraídos são processados por meio de uma camada de Global Average Pooling e camadas totalmente conectadas com 512 e 256 neurônios usando ativação ReLU. Para aumentar a generalização e reduzir o sobreajuste, são incorporadas camadas de normalização em lote e de dropout (0,4 e 0,3). A camada final de saída contém quatro neurônios com ativação linear correspondentes aos atributos arquitetônicos previstos. O otimizador Adam foi usado com taxa de aprendizado de 0,0001 e parâmetros padrão TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas. A parada precoce foi aplicada com base na perda de validação, e a redução adaptativa da taxa de aprendizado foi usada para melhorar a convergência. O treinamento era realizado por até 15 épocas.

InceptionV3:

InceptionV3 é uma arquitetura CNN profunda capaz de capturar características multiescala com o uso de operações convolucionais paralelas. Ela se baseia no módulo Inception, que utiliza uma variedade de tamanhos de filtro na mesma camada para extrair características de grão fino e grosseiras ao mesmo tempo. Esse tipo de design arquitetônico permite que a rede aprenda hierarquias espaciais complexas e seja computacionalmente eficiente. Além disso, o InceptionV3 utiliza convoluções fatorizadas e redução de dimensionalidade, que melhoram o desempenho e minimizam o custo computacional.

O InceptionV3 é aplicado no framework proposto como um extrator eficaz de características para analisar imagens de plantas residenciais. Plantas de andar consistem em uma variedade de padrões espaciais, como tamanhos de salas, plantas estruturais e conectividade, exigindo aprendizado de características em múltiplas escalas. A arquitetura Inception é especialmente mais adequada para essa tarefa pelo fato de ser capaz de representar especificidades locais (por exemplo, pequenas salas) e estruturas globais (por exemplo, a organização do layout geral) ao mesmo tempo. O InceptionV3 fornece representações complementares a outros modelos como o MobileNetV2 no contexto do framework meta-ensemble. A diversidade de previsões é aumentada por sua capacidade de modelar relações espaciais complexas, o que é importante para aprimorar o desempenho do conjunto. Isso eventualmente ajuda a melhor prever características arquitetônicas e reforça a classificação posterior do design habitacional amigável para idosos e integrado à saúde.

O modelo InceptionV3 é treinado usando uma abordagem de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3 para garantir compatibilidade com a arquitetura da rede e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento.

As camadas originais de classificação do InceptionV3 são removidas, e uma cabeça de regressão personalizada é introduzida para permitir a previsão multioutput. A cabeça de regressão personalizada consistia em uma camada de Global Average Pooling seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. A base convolucional é parcialmente ajustada, com as camadas inferiores pré-treinadas congeladas e as camadas superiores, juntamente com a cabeça de regressão personalizada, ajustadas para aprender características específicas do plano de domínio, mantendo representações visuais gerais adquiridas durante o pré-treinamento. Após a espinha dorsal convolucional, uma camada de Pooling Média Global transforma os mapas de características em uma representação compacta de características. Em seguida, vêm camadas totalmente conectadas contendo 512 e 256 neurônios com funções de ativação de ReLU. Para minimizar o sobreajuste e melhorar a generalização, taxas de dropout de 0,4 e 0,3 são aplicadas. A camada final de saída consiste em quatro neurônios com ativação linear correspondente à previsão de metragem quadrada, número de quartos, número de banheiros e número de garagem. O modelo é treinado usando o otimizador Adam com taxa de aprendizado de 0,0001, tamanho de lote de 32 e até 15 épocas de treinamento, com paradas precoces e redução adaptativa da taxa de aprendizado para garantir convergência estável.

ResNet101:

O ResNet101 é uma estrutura profunda da CNN construída sobre o princípio do aprendizado residual, que possibilita treinar redes extremamente profundas superando o problema do gradiente nulo. Ele adiciona conexões residuais, ou chamadas conexões de salto, que permitem à rede aprender mapeamentos de identidade e reter informações entre camadas. Essa arquitetura melhora muito a estabilidade do treinamento e permite que o modelo aprenda características hierárquicas complexas. O ResNet101 possui uma grande capacidade representacional de 101 camadas e, portanto, é muito eficaz em tarefas que exigem recursos espaciais extras.

O ResNet101 será usado no framework proposto como um extrator de características de alta capacidade, que analisará imagens de plantas residenciais. O modelo pode ser usado para representar relações espaciais complexas, incluindo conectividade de salas, complexidade de layout e variações estruturais, devido à sua arquitetura profunda. Essas características são fundamentais para fazer previsões precisas sobre elementos arquitetônicos, como metragem quadrada, quartos, banheiros e garagens. No design do meta-ensemble, o ResNet101 é um componente significativo e fornece representações profundas e abstratas de características. O ResNet101 se preocupa mais com características estruturais finas e, portanto, é mais diversificado entre os aprendizes base em comparação com modelos leves como o MobileNetV2. Essa heterogeneidade desempenha um papel essencial em melhorar o desempenho de um conjunto e previsões robustas, especialmente ao lidar com a classificação residencial baseada na saúde.

O ResNet101 é treinado usando uma abordagem de aprendizado por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3, o que garante compatibilidade arquitetônica e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. A cabeça de classificação original do ResNet101 é removida (include_top=Falso), e uma cabeça de regressão personalizada é introduzida para permitir a previsão multioutput. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. Para equilibrar reutilização de características e adaptação de domínio, as camadas pré-treinadas inferiores foram congeladas, enquanto as camadas mais profundas a partir de conv4_block1_1_conv e a cabeça de regressão personalizada foram ajustadas finamente. Essa estratégia seletiva de treinamento permite que o modelo retenha características visuais genéricas enquanto adapta representações de nível superior às imagens de planta baixa. A saída da base convolucional é passada por uma camada de Pooling Média Global para gerar uma representação compacta de características. Em seguida, vêm camadas totalmente conectadas com 512 e 256 neurônios usando funções de ativação do ReLU. A normalização em lote é aplicada para estabilizar o aprendizado, e camadas dropout com taxas de 0,4 e 0,3 são incorporadas para reduzir o sobreajuste e melhorar a generalização. A camada final de saída contém quatro neurônios com ativação linear correspondente à metragem quadrada, número de quartos, banheiros e garagens. O otimizador Adam foi usado com uma taxa de aprendizado de 0,0001, conforme descrito na configuração de treinamento. A ampliação de dados incluiu inversão aleatória, rotação, zoom e deslocamento para melhorar a generalização do modelo. O treinamento foi realizado por até 15 épocas, com paradas precoces baseadas na perda de validação e redução da taxa de aprendizado adaptativo.

VGG16:

VGG16 é uma arquitetura simples de rede neural do tipo convolucional profundo, eficaz e simples em tarefas de reconhecimento visual. É composto por 16 camadas com um design regular ou homogêneo incorporando pequenos filtros convolucionais de 3 × 3, que facilitam o aprendizado de representações hierárquicas de características pela rede. A arquitetura é focada em profundidade e simples, o que significa que é capaz de capturar detalhes de baixo nível, como bordas, texturas e estruturas semânticas de alto nível. O VGG16, com seu design regular e bom desempenho, é agora uma escolha popular de backbone ao realizar aprendizado por transferência em tarefas relacionadas a imagens.

No modelo sugerido, o VGG16 é usado como modelo DL de referência para derivar características espaciais de imagens de plantas residenciais. O fato de ser organizado permite que seja muito útil para capturar os detalhes mais finos dos padrões de layout, como limites de salas, alinhamentos estruturais e organização espacial. Essas características são essenciais para prever de forma eficaz os atributos da arquitetura, como metros quadrados, quartos, banheiros e garagens. No sistema meta-ensemble, VGG16 fornece representações de características estáveis e bem generalizadas. O VGG16 oferece uma abordagem de extração de recursos mais equilibrada em comparação com arquiteturas mais profundas, como a ResNet101, e arquiteturas multiescala, como a InceptionV3, aumentando a diversidade base do aprendize. Essa heterogeneidade é fundamental para aprimorar o desempenho do conjunto e previsões confiáveis da classificação residencial voltada para a saúde.

O modelo VGG16 é treinado usando uma abordagem de aprendizagem por transferência com pesos pré-treinados do conjunto de dados ImageNet. As imagens de entrada são escaladas para 224 × 224 × 3 para garantir compatibilidade com a arquitetura e consistência entre todos os modelos dentro do framework. As imagens foram redimensionadas para 224 × 224 pixels, normalizadas para o intervalo [0, 1] e aumentadas usando inversão aleatória, rotação, zoom e deslocamento. Um lote de 32 unidades foi usado durante o treinamento. As camadas originais de classificação são removidas (include_top=Falso), e uma cabeça de regressão personalizada é adicionada para adaptar o modelo para a previsão multioutput. A cabeça de regressão consistia em uma camada de Global Average Pooling, seguida por camadas totalmente conectadas com 512 e 256 neurônios, normalização em lote, camadas dropout (0,4 e 0,3) e uma camada linear de saída com quatro neurônios. As camadas pré-treinadas inferiores foram congeladas, enquanto as camadas que começam a partir de block4_conv1 e a cabeça de regressão personalizada foram ajustadas finamente. Essa estratégia permite que o modelo mantenha características visuais gerais enquanto aprende representações específicas de domínio relevantes para a análise de plantas de andar de andar (floorplanes). As características de saída da base convolucional são passadas por uma camada de Pool de Média Global para gerar um vetor de características compacto. Em seguida, vêm camadas totalmente conectadas com 512 e 256 neurônios usando funções de ativação do ReLU. A normalização em lote e camadas de dropout com taxas de 0,4 e 0,3 são incorporadas para estabilizar o treinamento, reduzir o sobreajuste e melhorar a generalização. A camada final de saída contém quatro neurônios com ativação linear correspondente à metragem quadrada, número de quartos, banheiros e previsões de garagem. O otimizador Adam foi usado com uma taxa de aprendizado de 0,0001, conforme descrito na configuração de treinamento. A ampliação de dados incluiu inversão aleatória, rotação, zoom e deslocamento para melhorar a generalização do modelo. O treinamento foi realizado por até 15 épocas, com paradas precoces baseadas na perda de validação e redução da taxa de aprendizado adaptativo.

CARE-MIRV-Net (Modelo Proposto de Meta-Ensemble DL):

O CARE-MIRV-Net sugerido (Context-Aware Residential Ensemble utilizando MobileNetV2, InceptionV3, ResNet101 e VGG16 Network) é uma estrutura DL meta-ensemble baseada em empilhamento, que visa melhorar a estimativa de características arquitetônicas com base em imagens de plantas residenciais. A arquitetura combina várias CNNs heterogêneas explorando suas vantagens sinérgicas na extração de recursos. O modelo proposto baseia-se na combinação de arquitetura leve, profunda e multiescala, que melhora o desempenho preditivo e proporciona robustez em uma ampla variedade de layouts residenciais. Em contraste com as técnicas tradicionais baseadas em modelo único, o CARE-MIRV-Net segue uma abordagem de aprendizagem hierárquica, onde modelos base fornecem previsões iniciais, que são então aprimoradas por um meta-aprendiz.

Quando se trata de design residencial que seja espacialmente consciente e cuidadoso com a saúde, a interpretação correta dos layouts da planta baixa é de extrema importância. Modelos DL únicos tendem a ser insuficientes para generalizar diferentes padrões arquitetônicos. O framework proposto superará essa fragilidade usando quatro arquiteturas diferentes: MobileNetV2, InceptionV3, ResNet101 e VGG16, que trazem diferentes capacidades representacionais próprias. O MobileNetV2 pode ser usado para extrair recursos de forma eficiente e é leve; InceptionV3 aprende padrões espaciais em múltiplas escalas; O ResNet101 aprende representações hierárquicas profundas; e o VGG16 aprende recursos de forma consistente e confiável. Uma combinação desses modelos facilita que a estrutura abrace tanto os atributos espaciais locais quanto globais, o que aumenta a precisão e confiabilidade das características previstas, como metragem quadrada, número de quartos, banheiros e garagens. As previsões acima também podem ser usadas para prever uma classificação adicional de layouts residenciais, incluindo amigáveis para idosos, integrados à saúde e residenciais gerais.

O CARE-MIRV-Net é implementado usando uma estratégia de conjunto baseada em empilhamento em dois estágios. No primeiro estágio, os quatro modelos base geram previsões independentemente para as variáveis alvo. As entradas do meta-aprendiz foram geradas concatenando as saídas de previsão produzidas pelos modelos base treinados nos dados de treinamento. Essas previsões concatenadas formaram os vetores meta-características de 16 dimensões usados para o treinamento de metamodelos. O vazamento de informações foi evitado por meio da separação rigorosa dos conjuntos de dados de treinamento e teste, e nenhuma amostra de teste foi usada durante o treinamento do modelo base ou do metamodelo. Os mesmos conjuntos de dados de treinamento e validação usados nos modelos base foram empregados durante o processo de empilhamento. Durante o treinamento e a inferência, o vetor meta-característica de 16 dimensões foi construído concatenando as quatro saídas de predição geradas pelo MobileNetV2, InceptionV3, ResNet101 e VGG16. Como cada modelo gera um vetor de saída quadridimensional, a representação concatenada produz uma entrada de 16 dimensões para o meta-aprendiz. Essa transformação combina as previsões de todos os modelos base e serve como entrada para a segunda etapa do framework. A segunda etapa envolve construir um meta-aprendiz totalmente conectado para rede neural para aprender a combinação ótima de previsões do modelo base. O meta-aprendiz consistia em camadas totalmente conectadas com 512 e 256 neurônios, ativação de ReLU, normalização em lote, taxas de abandono de 0,4 e 0,3, e uma camada linear de saída de quatro neurônios. Camadas dropout com taxas de 0,4 e 0,3 foram aplicadas após as camadas densas para reduzir o sobreajuste e melhorar a generalização. O meta-modelo foi treinado usando o otimizador Adam com taxa de aprendizado de 0,0001, tamanho de lote de 32 e até 15 épocas com paradas precoces e redução da taxa de aprendizado adaptativa. Os dados de validação foram usados para monitorar o desempenho do modelo durante o treinamento e para selecionar o modelo de melhor desempenho. Após o treinamento, o modelo meta-ensemble gerava previsões finais combinando resultados de todos os aprendizes base. MAE eR2 foram usados para avaliar o desempenho do CARE-MIRV-Net. Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas. Os resultados foram obtidos em uma única execução experimental usando uma semente aleatória fixa. A estrutura proposta melhora a capacidade preditiva ao combinar várias estruturas DL por meio de um mecanismo de empilhamento e fornecer análise interpretável de plantas residenciais. Isso torna o CARE-MIRV-Net aplicável no contexto de projetos residenciais focados na geriatria e orientados para a saúde. O código-fonte, as informações de configuração do ambiente, as especificações de dependência de software e a documentação de implementação são fornecidos no Arquivo Suplementar 1.

Avaliação de Desempenho

A análise de desempenho do framework proposto é realizada para determinar seu poder preditivo, robustez e desempenho de generalização entre diferentes características arquitetônicas. Análises quantitativas e qualitativas são realizadas para confirmar a utilidade do modelo proposto. O procedimento de avaliação envolve tanto medidas padrão de regressão quanto ambientes experimentais controlados para permitir uma comparação justa com os modelos de referência. Os experimentos foram realizados usando uma única execução experimental com uma semente aleatória fixa para garantir reprodutibilidade e consistência em todos os modelos de referência e propostos.

Parâmetros de Desempenho:

Duas medidas de regressão bem conhecidas, MAE e R2, são usadas para avaliar o desempenho do framework proposto. A MAE mede a magnitude média dos erros de predição e fornece uma indicação clara da proximidade entre os valores previstos e reais. Por outro lado, o valor R2 é usado para avaliar a proporção de variância nas variáveis-alvo explicadas pelo modelo, refletindo seu poder preditivo geral. A combinação dessas métricas fornece uma avaliação abrangente da precisão e do desempenho generalizado de todas as características arquitetônicas previstas. Para a previsão de múltiplas saídas, MAE e R2 foram calculados comparando os valores previstos e reais de cada variável alvo e, em seguida, fazendo a média dos resultados entre todas as saídas.

Configuração Experimental:

Os experimentos foram realizados em um ambiente de computação em nuvem usando Python (versão 3.12.12). O protocolo proposto foi implementado usando TensorFlow (versão 2.19.0), Keras (versão 3.13.2), NumPy (versão 2.4.6), Pandas (versão 2.3.3), Scikit-learn (versão 1.6.1), Matplotlib (versão 3.9) e SHAP (versão 0.51.0). O ambiente computacional utilizava um processador Intel Xeon operando a 2,20 GHz com aproximadamente 31 GB de memória do sistema. Os experimentos foram realizados em um sistema operacional Ubuntu 22.04 LTS utilizando GPUs NVIDIA Tesla T4 × 2. O conjunto de dados contém 2.640 imagens de plantas residenciais que foram pré-processadas e subdivididas em conjuntos de dados de treinamento e teste. O conjunto de dados foi dividido usando uma proporção de 80:20, resultando em 2.112 amostras de treinamento e 528 amostras de teste. MobileNetV2, InceptionV3, ResNet101 e VGG16 são quatro modelos DL que foram treinados usando uma abordagem de ajuste fino com aprendizado por transferência. Um modelo meta-conjunto baseado em empilhamento, CARE-MIRV-Net, foi então construído para combinar previsões desses modelos base. Cada modelo foi treinado sob condições uniformes, incluindo redimensionamento da imagem para 224 × 224 pixels, aumento de dados e paradas antecipadas para reduzir o sobreajuste. A ampliação de dados incluía inversão aleatória, rotação, zoom e deslocamento. Foram usados um lote de 32 e um máximo de 15 épocas de treinamento, com parada precoce baseada na perda de validação e redução da taxa de aprendizado adaptativo. A análise final foi realizada em um conjunto de testes oculto para fornecer uma avaliação imparcial e confiável do desempenho. O conjunto de testes oculto foi gerado durante o particionamento inicial do conjunto de dados e permaneceu completamente isolado durante o treinamento e desenvolvimento do modelo para garantir uma avaliação de desempenho imparcial.

Descrição do Conjunto de Dados:

O conjunto de dados usado para apoiar os resultados deste estudo está disponível publicamente na plataforma Kaggle com o título "Imagens de Plantas e Seus Detalhes"28. O conjunto de dados está disponível em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (acessado em 16 de abril de 2026). Os dados consistem em 2.640 imagens de plantas residenciais e metadados arquitetônicos organizados. Cada amostra é um plano habitacional distinto, que oferece uma ampla variedade de layouts residenciais com diferentes tamanhos, configurações e arranjos espaciais. O tamanho do conjunto de dados é suficiente para treinamento baseado em DL e contém uma variedade de padrões arquitetônicos. O conjunto de dados consiste em uma imagem bidimensional de planta e atributos numéricos relacionados que descrevem as características estruturais da residência. Essas características incluem a área total em metragem quadrada, número de quartos, número de banheiros e número de garagens. Além disso, cada registro contém um caminho de imagem, que permite o mapeamento direto das entradas visuais para as etiquetas. As variáveis do conjunto de dados incluem imagem da planta baixa, caminho da imagem, metragem quadrada, número de quartos, número de banheiros e número de garagem. A imagem da planta baixa serve como recurso de entrada, enquanto os atributos arquitetônicos são usados como alvos de previsão. Portanto, o conjunto de dados é adequado para aprendizado supervisionado, com imagens servindo como características de entrada e atributos arquitetônicos como alvos de regressão.

O conjunto de dados contém uma grande variedade de layouts residenciais, que vão desde layouts compactos com menos cômodos até layouts grandes com múltiplos cômodos. Essa variabilidade permite o aprendizado de representações espaciais significativas, incluindo distribuição de salas, densidade de layout e complexidade estrutural. Essa diversidade é especialmente importante para o modelo proposto, pois apoia a categorização dos planos em layouts amigáveis para idosos, integrados à saúde e residenciais gerais. Antes do treinamento do modelo, o conjunto de dados é processado por meio de uma sequência de procedimentos de pré-processamento para garantir consistência e compatibilidade com modelos DL. Todas as imagens foram redimensionadas para 224 × 224 pixels e normalizadas para o intervalo [0, 1] antes do treinamento. O conjunto de dados é então organizado combinando caminhos de imagem com seus metadados correspondentes, após o que é separado em subconjuntos de treinamento e teste para facilitar a análise de desempenho. O conjunto de dados foi dividido aleatoriamente em conjuntos de treinamento e teste usando uma proporção de divisão 80:20. Registros contendo informações completas de imagem e metadados foram incluídos na análise, enquanto registros incompletos ou inválidos foram excluídos. Uma semente aleatória fixa foi usada durante o particionamento do conjunto de dados para garantir a reprodutibilidade. O conjunto de dados fornece uma base detalhada para a análise de plantas residenciais impulsionada por IA. A combinação de 2.640 imagens anotadas e diversos atributos arquitetônicos suporta a modelagem de regressão multisaída e permite a integração da inteligência espacial com a tomada de decisões de design residencial voltada para a saúde.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um conjunto de experimentos foi realizado para avaliar a estrutura proposta usando quatro modelos DL, MobileNetV2, InceptionV3, ResNet101 e VGG16, juntamente com o modelo proposto de meta-ensemble CARE-MIRV-Net.

Resultados da Aquisição e Pré-processamento de Conjuntos de Dados

A fase de pré-processamento foi projetada para preparar as imagens brutas do plano de piso e os metadados relacionados para treinamento e avaliação usando modelos DL. O conjunto de dados foi obtido do repositório Kaggle e continha 2.640 amostras. Cada amostra consistia em uma imagem de planta baixa e seus atributos arquitetônicos correspondentes. Apenas as colunas relevantes, incluindo caminho da imagem, metragem quadrada, quartos, banheiros e garagens, foram mantidas para análise adicional, e registros incompletos ou em branco foram removidos para manter a consistência e qualidade dos dados. Para facilitar o treinamento e a avaliação do modelo, o conjunto de dados foi dividido em subconjuntos de treinamento e teste em uma proporção de 80:20, resultando em 2.112 amostras de treinamento e 528 amostras de teste. Uma semente aleatória fixa foi usada durante o particionamento do conjunto de dados para garantir a reprodutibilidade. Essa divisão garantiu que os modelos fossem treinados com um conjunto de dados suficientemente grande, preservando um conjunto de testes independente para avaliação objetiva de desempenho. Os caminhos das imagens foram padronizados mapeando cada registro para sua localização correspondente dentro do diretório do conjunto de dados. Os quatro atributos arquitetônicos (pés quadrados, quartos, banheiros e garagens) serviram como variáveis-alvo para a tarefa de regressão multioutput. Embora quartos, banheiros e garagens sejam variáveis discretas, eles foram modelados usando uma estrutura de regressão multioutput para permitir a previsão simultânea de todos os atributos arquitetônicos dentro de uma arquitetura unificada de aprendizagem. Essa abordagem permite que o modelo capture relações compartilhadas entre as variáveis-alvo e explore correlações entre características arquitetônicas contínuas e discretas. Os valores previstos para atributos discretos foram convertidos para o inteiro válido mais próximo durante o pós-processamento antes da interpretação e da classificação do layout residencial a jusante.

A Tabela 1 descreve as características arquitetônicas previstas pelo modelo proposto, representando características espaciais e funcionais chave das plantas residenciais. Foi realizada uma análise exploratória de dados para melhor compreender a distribuição das variáveis-alvo usando histogramas e visualizações baseadas em contagem. A distribuição da metragem quadrada é contínua com densidades variadas, enquanto a distribuição de quartos, banheiros e garagens destaca a frequência das diferentes configurações residenciais. Essas distribuições estão representadas na Figura 2. A distribuição da metragem quadrada é mostrada na Figura 2A, enquanto as distribuições de quartos, banheiros e garagens estão mostradas na Figura 2B–2D, respectivamente. Juntos, esses gráficos ilustram a variabilidade e a distribuição das variáveis-alvo dentro do conjunto de dados.

Nome do DestaqueDescrição
Pés QuadradosÁrea total construída da unidade residencial
CamasNúmero de quartos no layout
BanhosNúmero de banheiros no layout
GaragensNúmero de vagas de garagem disponíveis

Tabela 1: Atributos arquitetônicos usados como alvos de previsão. Definições dos atributos arquitetônicos extraídas do conjunto de dados de plantas residenciais e usadas como variáveis-alvo para treinamento e avaliação de modelos. Os atributos incluem a área total em metragem quadrada, número de quartos, número de banheiros e número de espaços de garagem associados a cada planta residencial.

figure-results-1
Figura 2. Distribuição dos atributos arquitetônicos no conjunto de dados de plantas residenciais. Histogramas mostrando as distribuições de (A) metragem quadrada, (B) número de quartos, (C) número de banheiros e (D) número de garagens ao longo do conjunto de dados usado para desenvolvimento e avaliação de modelos. Por favor, clique aqui para ver uma versão ampliada desta figura.

A etapa de pré-processamento de imagem transformou todas as imagens de plantas em um formato padronizado adequado para modelos DL. Todas as imagens eram carregadas, convertidas para espaço de cor RGB, redimensionadas para 224 × 224 pixels e normalizadas para a faixa de [0, 1]. Esse processo garantiu dimensões de entrada consistentes e melhorou a convergência dos modelos durante o treinamento. Imagens pré-processadas foram amostradas aleatoriamente, e os rótulos foram verificados para confirmar o pré-processamento e alinhamento adequados. Após o pré-processamento, cada imagem era convertida em um array NumPy e pareada com seus valores-alvo correspondentes para criar o conjunto de dados de entrada-saída. Os conjuntos de dados resultantes confirmaram a preparação bem-sucedida dos dados, com imagens de treinamento com dimensões (2112, 224, 224, 3) e imagens de teste com dimensões (528, 224, 224, 3). As matrizes de etiquetas correspondentes tinham dimensões (2112, 4) e (528, 4), respectivamente. As variáveis-alvo foram convertidas em valores de ponto flutuante para apoiar o aprendizado baseado em regressão.

Para melhorar ainda mais a generalização dos modelos e reduzir o sobreajuste, técnicas de aumento de dados foram aplicadas usando um gerador de dados de imagem. Essas técnicas incluíam inversão horizontal aleatória, rotação, zoom e deslocamento de largura/altura para aumentar a variabilidade dos dados de treinamento e melhorar a generalização dos modelos. Essas transformações aumentaram a variabilidade nos dados de treinamento e permitiram que os modelos aprendessem características espaciais mais robustas e invariantes. O pipeline de pré-processamento produziu dados de imagem e tabulares limpos, padronizados e bem estruturados, fornecendo uma base adequada para o treinamento do framework de aprendizado profundo meta-ensemble proposto.

Resultados dos Modelos Base e o Modelo Proposto

O conjunto de dados pré-processado (2.640 imagens de plantas de andar térreo) foi usado para treinar todos os modelos usando divisões de treinamento e teste. O conjunto de dados foi dividido usando uma proporção de 80:20, resultando em 2.112 amostras de treinamento e 528 amostras de teste. Uma semente aleatória fixa foi usada para garantir a reprodutibilidade. Pesos pré-treinados foram usados para aprendizado por transferência e ajuste fino para adaptar os modelos ao domínio da análise de plantas arquitetônicas. Métodos de aumento de dados foram empregados durante o treinamento para melhorar a generalização, e a parada precoce foi usada para reduzir o sobreajuste monitorando o desempenho da validação. Os modelos foram treinados com um lote de 32 para até 15 épocas, com parada precoce aplicada para evitar sobreajuste e promover convergência eficiente. A parada precoce monitorou a perda de validação e encerrou o treinamento quando nenhuma melhora adicional foi observada, enquanto a redução da taxa de aprendizado adaptativo foi aplicada para melhorar a convergência. Tanto a perda quanto a MAE foram usados para monitorar o processo de treinamento e avaliar o comportamento e a estabilidade da convergência. Todos os modelos foram treinados sob as mesmas condições experimentais para garantir uma comparação justa. As figuras 3–7 mostram as curvas de perda de treinamento e validação e MAE para todos os modelos, fornecendo insights sobre sua dinâmica de aprendizado e comportamento de generalização.

figure-results-2
Figura 3. Desempenho de treinamento do MobileNetV2. (A) Perda de treinamento e validação entre épocas de treinamento. (B) Erro absoluto médio (MAE) de treinamento e validação entre épocas de treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-3
Figura 4. Desempenho de treinamento do InceptionV3. (A) Perda de treinamento e validação entre épocas de treinamento. (B) Erro absoluto médio (MAE) de treinamento e validação entre épocas de treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-4
Figura 5. Desempenho de treinamento do ResNet101. (A) Perda de treinamento e validação entre épocas de treinamento. (B) Erro absoluto médio (MAE) de treinamento e validação entre épocas de treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-5
Figura 6. Desempenho de treinamento do VGG16. (A) Perda de treinamento e validação entre épocas de treinamento. (B) Erro absoluto médio (MAE) de treinamento e validação entre épocas de treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-6
Figura 7. Desempenho de treinamento do CARE-MIRV-Net. (A) Perda de treinamento e validação entre épocas de treinamento. (B) Erro absoluto médio (MAE) de treinamento e validação entre épocas de treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.

O desempenho do treinamento do MobileNetV2 é mostrado na Figura 3. As curvas de perda de treinamento e validação são apresentadas na Figura 3A, enquanto as curvas de treinamento e validação do MAE são mostradas na Figura 3B. A perda de treinamento e a EMA diminuíram gradualmente com o aumento das épocas, indicando comportamento de aprendizagem estável. As curvas de validação apresentaram maior variação e permaneceram relativamente maiores que as curvas de treinamento, sugerindo desempenho de generalização reduzido. Essa tendência é consistente com os resultados quantitativos, nos quais o MobileNetV2 demonstrou desempenho preditivo comparativamente menor, especialmente para a previsão de metragem quadrada. O desempenho de treinamento do InceptionV3 é mostrado na Figura 4. As curvas de perda de treinamento e validação são apresentadas na Figura 4A, enquanto as curvas de treinamento e validação do MAE são mostradas na Figura 4B. O modelo apresentou uma redução constante tanto na perda de treinamento quanto de validação e na MAE, com apenas uma pequena diferença entre as curvas. Esse comportamento sugere aprendizado eficaz e uma generalização relativamente boa. As curvas de validação estáveis indicam que o modelo capturou efetivamente características espaciais multiescala, contribuindo para uma performance melhorada em comparação com o MobileNetV2. O comportamento de treinamento do ResNet101 é mostrado na Figura 5. As curvas de perda de treinamento e validação são apresentadas na Figura 5A, enquanto as curvas MAE de treinamento e validação são mostradas na Figura 5B. O modelo demonstrou um declínio gradual na perda de treinamento e na EAV, enquanto as curvas de validação seguiram uma tendência semelhante com pequenas flutuações. Embora alguma oscilação tenha sido observada, a convergência geral permaneceu estável. Essas observações são consistentes com a capacidade do modelo de aprender representações espaciais hierárquicas por meio de aprendizado residual. O desempenho de treinamento do VGG16 é mostrado na Figura 6. As curvas de perda de treinamento e validação são apresentadas na Figura 6A, enquanto as curvas de treinamento e validação do MAE são mostradas na Figura 6B.

As curvas de treinamento do VGG16 mostraram uma diminuição contínua ao longo do treinamento, indicando aprendizagem eficaz. As curvas de validação apresentavam oscilações e uma leve separação das curvas de treinamento, sugerindo um leve sobreajuste. Mesmo assim, o modelo permaneceu competitivo, especialmente em metragem quadrada e previsão de garagem, indicando que suas representações de características aprendidas continuaram eficazes e estáveis.

O desempenho do treinamento do CARE-MIRV-Net é mostrado na Figura 7. As curvas de perda de treinamento e validação são apresentadas na Figura 7A, enquanto as curvas de treinamento e validação do MAE são mostradas na Figura 7B. A perda de treinamento e validação e as curvas de EMO diminuíram de forma suave e consistente, com apenas uma pequena diferença entre elas. Esse comportamento indica forte convergência e boa generalização. Comparado aos modelos individuais, a estrutura meta-ensemble produziu um comportamento de aprendizagem mais estável e uma variabilidade reduzida. No geral, a comparação das curvas de treinamento sugere que, embora os modelos individuais demonstrassem diferentes características de convergência e generalização, o CARE-MIRV-Net apresentou o comportamento de treinamento mais consistente entre os modelos avaliados.

Uma comparação detalhada do desempenho preditivo do MobileNetV2, InceptionV3, ResNet101, VGG16 e do modelo proposto CARE-MIRV-Net é fornecida na Tabela 2. O desempenho foi avaliado usando MAE eR2 em quatro variáveis-alvo: metragem quadrada, número de quartos, número de banheiros e número de garagens. Essas métricas fornecem medidas complementares de precisão da previsão e desempenho explicativo.

ModeloPés QuadradosCamasBanhosGaragens
MAEMAEMAEMAE
MobileNetV2881.6530.13270.68730.31540.65520.34570.39770.1133
InceptionV3464.640.66150.43530.67080.36270.74590.230.6351
ResNet101611.9190.58720.42870.65460.38380.7250.22980.6489
VGG16504.4350.72560.6980.33550.49950.64360.1970.6757
CARE-MIRV-Net (Proposto)432.4880.70530.43430.68370.36890.76050.16970.6958

Tabela 2: Comparação de desempenho entre modelos de referência e CARE-MIRV-Net. Comparação do desempenho de previsão para MobileNetV2, InceptionV3, ResNet101, VGG16 e o modelo proposto CARE-MIRV-Net em quatro atributos arquitetônicos: metragem quadrada, número de quartos, número de banheiros e número de garagens. O desempenho é reportado usando o erro absoluto médio (MAE) e o coeficiente de determinação (R2). Valores de MAE mais baixos indicam erro de predição menor, enquanto valores R2 mais altos indicam maior concordância entre valores previstos e reais.

Os modelos individuais demonstraram níveis variados de desempenho entre as variáveis-alvo. O MobileNetV2 apresentou o menor desempenho geral, especialmente para a previsão de metragem quadrada, com um MAE de 881,6530 e um valor deR 2 de 0,1327. O desempenho em banheiros e garagens também foi comparativamente menor, indicando limitações na captura de relações espaciais complexas quando usado como modelo independente.

O InceptionV3 demonstrou forte desempenho na maioria das variáveis-alvo, especialmente banheiros e quartos, com valores de R2 de 0,7459 e 0,6708, respectivamente. Esses resultados sugerem captura eficaz de características espaciais em múltiplas escalas. O ResNet101 também demonstrou desempenho competitivo por meio de sua arquitetura deep residual, que facilitou o aprendizado de representações espaciais hierárquicas. No entanto, seu desempenho permaneceu um pouco inferior ao do InceptionV3 em algumas variáveis, incluindo a previsão de metragem quadrada. O VGG16 proporcionou desempenho relativamente equilibrado em todas as variáveis-alvo e alcançou o maior valor de metragem quadrada em R2 (0,7256) entre os modelos individuais.

O framework proposto do CARE-MIRV-Net superou os modelos individuais na maioria das tarefas avaliadas. O CARE-MIRV-Net alcançou a menor metragem quadrada de MAE (432.488), mantendo um valor de R2 de 0,7053. Para a previsão do quarto, o modelo alcançou um valor de R2 de 0,6837. Para a previsão do banheiro, o CARE-MIRV-Net alcançou o maior valor de R2 (0,7605) entre todos os modelos avaliados. De forma semelhante, para a previsão da garagem, o modelo alcançou o menor MAE (0,1697) e o maior valor deR 2 (0,6958). Esses resultados indicam que o framework meta-ensemble combinou efetivamente as forças complementares das arquiteturas individuais. Os resultados sugerem ainda que integrar previsões de múltiplos modelos reduziu limitações específicas do modelo e melhorou o desempenho preditivo geral. Os achados demonstram que o CARE-MIRV-Net proporcionou desempenho preditivo equilibrado em todas as variáveis-alvo avaliadas. A avaliação residencial voltada para a saúde apresentada neste estudo deve ser interpretada como uma categorização orientada à aplicação derivada do arcabouço de decisão baseado em regras e dos atributos disponíveis do plano de planta, em vez de uma avaliação de saúde clinicamente validada.

Para avaliar ainda mais o desempenho preditivo, foi realizada uma análise de erro residual para todas as variáveis alvo, incluindo metragem quadrada, quartos, banheiros e garagens físicas. Gráficos residuais fornecem insights sobre as distribuições de erros de previsão ao mostrar as diferenças entre os valores previstos e observados. Idealmente, os resíduos deveriam ser distribuídos aleatoriamente em torno de zero, indicando viés sistemático limitado e boa generalização.

A Figura 8 mostra o gráfico residual para a previsão de metragem quadrada. A maioria dos resíduos estava agrupada em torno de zero, indicando previsões relativamente precisas para a maioria das amostras. No entanto, dispersão maior e vários valores atípicos foram observados em valores maiores de metragem quadrada previstos. Essas observações sugerem que a variabilidade das previsões aumentou para layouts residenciais maiores.

figure-results-7
Figura 8. Análise residual para previsão de metragem quadrada. Gráfico de dispersão mostrando erros residuais em função dos valores previstos de metragem quadrada. A linha horizontal indica erro residual zero. Por favor, clique aqui para ver uma versão ampliada desta figura.

A distribuição dos resíduos para a previsão do dormitório é mostrada na Figura 9. Os resíduos geralmente estavam centrados em torno de zero, com o padrão diagonal refletindo a natureza discreta da variável do quarto. A faixa residual relativamente estreita indica desempenho preditivo consistente, sem viés sistemático evidente observado. A Figura 10 apresenta o gráfico residual para a previsão de banheiros. Os resíduos permaneceram concentrados em torno de zero, mas apresentaram dispersão ligeiramente maior do que os observados na previsão do dormitório. O padrão de faixas visível é consistente com a natureza discreta da variável alvo. Vários valores atípicos também estavam presentes em valores previstos mais altos.

figure-results-8
Figura 9. Análise residual para previsão de quarto. Gráfico de dispersão mostrando erros residuais em função dos valores previstos dos quartos. A linha horizontal indica erro residual zero. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-9
Figura 10. Análise residual para previsão de banheiros. Gráfico de dispersão mostrando erros residuais em função dos valores previstos do banheiro. A linha horizontal indica erro residual zero. Por favor, clique aqui para ver uma versão ampliada desta figura.

A análise residual para a previsão de garagem é mostrada na Figura 11. Os valores residuais permaneceram concentrados em torno de zero e apresentaram variância relativamente baixa em comparação com as outras variáveis-alvo. A faixa discreta e limitada de valores da garagem produziu padrões lineares distintos dentro do gráfico. A distribuição restrita de resíduos sugere desempenho preditivo relativamente consistente para essa variável.

figure-results-10
Figura 11. Análise residual para previsão de garagem. Gráfico de dispersão mostrando erros residuais em função dos valores previstos da garagem. A linha horizontal indica erro residual zero. Por favor, clique aqui para ver uma versão ampliada desta figura.

No geral, as análises residuais indicam que o CARE-MIRV-Net gerou previsões que geralmente se concentraram em zero em todas as variáveis alvo. Embora alguma variabilidade e valores atípicos tenham sido observados, especialmente para a previsão de metragem quadrada, as distribuições residuais gerais apoiam a consistência do desempenho preditivo do modelo em todo o conjunto de dados avaliado.

Resultados da Análise de IA Explicável Usando SHAP

Para melhorar a interpretabilidade do framework proposto CARE-MIRV-Net, uma abordagem explicável de IA foi incorporada usando SHAP. SHAP é um método baseado na teoria dos jogos que explica previsões de modelos atribuindo valores de importância de características com base nos valores de Shapley. Quando aplicado ao modelo meta-ensemble proposto, o SHAP foi usado para examinar a contribuição de cada modelo base para o resultado final do meta-aprendiz. A entrada para o meta-modelo consistia em previsões concatenadas de quatro modelos base — InceptionV3, MobileNetV2, ResNet101 e VGG16 — resultando em um espaço de características 16 dimensões. Cada característica representava um atributo arquitetônico previsto (metragem quadrada, quartos, banheiros ou garagens) gerado por um modelo base específico. A interpretação dessas características foi realizada selecionando um subconjunto aleatório dos dados do meta-treinamento como distribuição de fundo e um subconjunto menor de amostras de teste para geração de explicações, a fim de melhorar a eficiência computacional.

Versões de saída única do meta-modelo foram criadas para isolar e analisar contribuições de características para cada variável alvo de forma independente. O SHAP KernelExplainer foi aplicado conforme descrito anteriormente e no Arquivo Suplementar 1 para estimar contribuições de características e interpretar as previsões do framework proposto. Esses valores foram usados para quantificar até que ponto cada previsão do modelo base contribuiu positiva ou negativamente para o resultado final. Com base na análise SHAP, o CARE-MIRV-Net não se baseou exclusivamente em um único aprendiz base, mas sim atribuiu diferentes níveis de importância a diferentes modelos dependendo da variável-alvo e das características de entrada. Essas observações indicam que a abordagem de conjunto baseada em empilhamento utilizou informações complementares de múltiplos modelos base.

As Figuras 12–15 apresentam gráficos resumidos do SHAP para as quatro variáveis-alvo: metragem quadrada, quartos, banheiros e garagens. Esses gráficos fornecem insights sobre como o meta-modelo CARE-MIRV-Net usou previsões dos aprendizes base individuais. Em cada gráfico, o eixo horizontal representa os valores SHAP (contribuições de características), enquanto a escala de cores representa a magnitude das características de valores baixos a altos.

figure-results-11
Figura 12. Gráfico resumo SHAP para previsão de metragem quadrada. Gráfico resumo do SHAP mostrando a contribuição das previsões do modelo base para a estimativa de metragem quadrada pelo meta-aprendiz CARE-MIRV-Net. As características são classificadas de acordo com a importância. A cor dos pontos indica valor de característica, e a posição horizontal indica a contribuição do SHAP para a previsão. SHAP, SHapley Explicações aditivas. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-12
Figura 13. Gráfico resumo SHAP para previsão de quarto. Gráfico resumo SHAP mostrando a contribuição das previsões do modelo base para a estimação de quartos por meta-aprendiz CARE-MIRV-Net. As características são classificadas de acordo com a importância. A cor dos pontos indica valor de característica, e a posição horizontal indica a contribuição do SHAP para a previsão. SHAP, SHapley Explicações aditivas. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-13
Figura 14. Gráfico resumo SHAP para previsão de banheiros. Gráfico resumo SHAP mostrando a contribuição das previsões do modelo base para a estimativa do banheiro pelo meta-aprendiz CARE-MIRV-Net. As características são classificadas de acordo com a importância. A cor dos pontos indica valor de característica, e a posição horizontal indica a contribuição do SHAP para a previsão. SHAP, SHapley Explicações aditivas. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-14
Figura 15. Gráfico resumo SHAP para previsão de garagem. Gráfico resumo do SHAP mostrando a contribuição das previsões do modelo base para a estimativa em garagem pelo meta-aprendiz CARE-MIRV-Net. As características são classificadas de acordo com a importância. A cor dos pontos indica valor de característica, e a posição horizontal indica a contribuição do SHAP para a previsão. SHAP, SHapley Explicações aditivas. Por favor, clique aqui para ver uma versão ampliada desta figura.

A Figura 12 mostra o resumo SHAP para previsão de metragem quadrada. Recursos como Mob_SF, Res_SF e Inc_SF apresentaram contribuições comparativamente maiores para SHAP do que outras funcionalidades, indicando que as previsões geradas pelo MobileNetV2, ResNet101 e InceptionV3 contribuíram substancialmente para a estimativa de metragem quadrada. Valores mais altos de características (vermelho) geralmente estavam associados ao aumento da metragem quadrada prevista, enquanto valores de características mais baixos (azul) estavam associados a previsões mais baixas. Características relacionadas a quartos e banheiros apresentaram contribuições comparativamente menores, indicando que a previsão de metragem quadrada foi influenciada principalmente por previsões relacionadas à área geradas pelos modelos base.

A Figura 13 apresenta a análise SHAP para a previsão do quarto. Recursos como Res_Beds, VGG_Beds e Inc_Beds apresentaram contribuições comparativamente maiores do que outras funcionalidades, indicando que as previsões do ResNet101, VGG16 e InceptionV3 foram influentes na determinação da previsão final do quarto. Os valores do SHAP foram distribuídos em torno de zero, sugerindo que o metamodelo integrou informações de múltiplas fontes em vez de depender de um único preditor dominante. Características relacionadas a garagens e metragem quadrada apresentaram contribuições comparativamente menores.

A Figura 14 apresenta o resumo SHAP para a previsão de banheiros. Recursos como VGG_Baths, Inc_Baths e Mob_Baths apresentaram contribuições comparativamente altas, indicando que as previsões do VGG16, InceptionV3 e MobileNetV2 contribuíram substancialmente para a estimativa dos banheiros. A distribuição dos valores do SHAP sugere que o aumento das previsões desses modelos base estava associado a uma influência maior na previsão final. As contribuições apareceram distribuídas de forma mais ampla entre modelos do que para algumas outras variáveis-alvo.

A Figura 15 apresenta a análise SHAP para previsão de garagem. Recursos como Mob_Garages, Inc_Garages e VGG_Garages apresentaram contribuições relativamente fortes para a previsão final. O gráfico demonstra que previsões relacionadas à garagem de múltiplos modelos base contribuíram para o resultado final, com distinção clara entre contribuições de características de menor valor e de maior valor. A maior distribuição dos valores do SHAP sugere maior sensibilidade do meta-modelo às características de predição relacionadas à garagem.

No geral, a análise SHAP demonstrou que o framework proposto CARE-MIRV-Net integrou contribuições de múltiplos aprendizes base ao gerar previsões finais. Os resultados fornecem uma visão interpretável da influência relativa das previsões individuais dos modelos entre as quatro variáveis-alvo arquitetônicas e apoiam a compreensão do processo de tomada de decisão do meta-ensemble.

Resultados da Classificação de Disposição Residencial

Exemplos representativos dos resultados da classificação do layout residencial são mostrados nas Figuras 16–18. Esses exemplos ilustram a aplicação da camada de decisão baseada em regras aos atributos arquitetônicos previstos pelo framework CARE-MIRV-Net. A Figura 16 apresenta um exemplo classificado como um layout de cuidados médicos, a Figura 17 apresenta um exemplo classificado como um layout residencial geral, e a Figura 18 apresenta um exemplo classificado como um layout de cuidado para idosos. Os exemplos demonstram como os atributos arquitetônicos previstos são traduzidos em categorias residenciais de nível de aplicação por meio das regras de decisão pré-definidas descritas na seção de Protocolo. Esses exemplos devem ser interpretados como resultados ilustrativos do arcabouço de classificação baseado em regras derivados dos atributos previstos do plano de piso e critérios de decisão pré-definidos, em vez de classificações clínicas ou de saúde validadas de forma independente.

figure-results-15
Figura 16. Exemplo representativo classificado como um layout residencial de cuidados médicos. Exemplo de imagem de planta residencial avaliada pelo modelo proposto e atribuída à categoria de cuidados médicos com base nos atributos arquitetônicos previstos e critérios de classificação baseados em regras. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-16
Figura 17. Exemplo representativo classificado como um layout residencial geral. Exemplo de imagem de planta residencial avaliada pelo quadro proposto e atribuída à categoria residencial geral com base nos atributos arquitetônicos previstos e critérios de classificação baseados em regras. Por favor, clique aqui para ver uma versão ampliada desta figura.

figure-results-17
Figura 18. Exemplo representativo classificado como um layout residencial para cuidados idosos. Exemplo de imagem de planta residencial avaliada pelo modelo proposto e atribuída à categoria de cuidados a idosos com base nos atributos arquitetônicos previstos e critérios de classificação baseados em regras. Por favor, clique aqui para ver uma versão ampliada desta figura.

Um exemplo representativo mostrado na Figura 16 demonstra que o modelo previu uma área de 2233,16 em comparação com o valor real de 2268,00, indicando um erro de previsão relativamente pequeno. Da mesma forma, os valores previstos para quartos (3,23 vs. 3), banheiros (2,65 vs. 2) e garagens (1,11 vs. 1) estavam próximos dos valores de verdade correspondentes. Com base nesses atributos previstos, a camada de decisão baseada em regras categorizou o layout como atendimento médico. Este exemplo ilustra como a estrutura aplica atributos arquitetônicos previstos para gerar classificações residenciais em nível de aplicação.

Um segundo exemplo mostrado na Figura 17 demonstra um layout classificado como uso residencial geral. A metragem quadrada prevista (1692,76) foi menor que o valor real (1879,00), enquanto o número previsto de quartos, banheiros e garagens permaneceu próximo aos valores de verdade correspondente. Com base nos atributos arquitetônicos previstos, a camada de decisão atribuiu o layout à categoria residencial geral. Este exemplo demonstra a aplicação do arcabouço de classificação a um layout residencial de tamanho moderado, apesar de pequenas variações nas previsões individuais.

A Figura 18 apresenta um layout residencial compacto com uma metragem quadrada real de 981,00 e uma metragem quadrada prevista de 1076,17. Os valores previstos para quartos (1,99 vs. 2), banheiros (1,75 vs. 2) e garagens (0,98 vs. 1) também estavam próximos dos valores de verdade de base correspondentes. Com base nesses atributos previstos, a camada de decisão categorizou o layout como cuidado ao idoso. Este exemplo ilustra a aplicação das regras de classificação pré-definidas a layouts caracterizados por áreas de piso menores e menos cômodos.

De modo geral, os exemplos representativos demonstram a integração da previsão de atributos arquitetônicos e da categorização de layout residencial baseada em regras dentro do framework CARE-MIRV-Net. Nos exemplos mostrados nas Figuras 16–18, os atributos arquitetônicos previstos foram geralmente consistentes com os valores de verdade do terreno correspondentes, apoiando o uso do framework proposto para análise automatizada de plantas residenciais e classificação em nível de aplicação.

Disponibilidade de Dados:

O conjunto de dados utilizado neste estudo está disponível publicamente pelo repositórioKaggle 28, intitulado "Imagens de Plantas e Seus Detalhes", e pode ser acessado em: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details. Todas as análises relatadas neste estudo foram realizadas com dados obtidos desta fonte de acesso público. O código-fonte, a documentação de implementação e as informações de configuração do ambiente necessárias para reproduzir os resultados reportados são fornecidos no Arquivo Suplementar 1.

Arquivo Suplementar 1. Pacote de implementação CARE-MIRV-Net. Este arquivo contém o código-fonte, documentação do README, especificações de dependência de software, informações do ambiente e scripts de implementação necessários para reproduzir o fluxo de trabalho CARE-MIRV-Net. Por favor, clique aqui para baixar este arquivo.

Arquivo Suplementar 2. Algoritmo para análise de planta residencial CARE-MIRV-Net. Este arquivo fornece o Algoritmo 1, incluindo o pré-processamento de dados, previsão do modelo base, concatenação de meta-características, predição do meta-ensemble, classificação por camada de decisão, explicabilidade baseada em SHAP e fluxo de trabalho de métricas de avaliação usados no estudo. Por favor, clique aqui para baixar este arquivo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta o CARE-MIRV-Net, uma estrutura DL meta-ensemble baseada em empilhamento para análise automatizada de imagens de plantas residenciais. O framework integra quatro arquiteturas CNN complementares — MobileNetV2, InceptionV3, ResNet101 e VGG16 — para prever atributos arquitetônicos chave, incluindo metragem quadrada, número de quartos, banheiros e garagens. Essas previsões são posteriormente combinadas por meio de um meta-aprendiz e usadas dentro de uma camada de decisão baseada em regras para categorizar os layouts residenciais em categorias de cuidados a idosos, cuidados médicos ou residenciais gerais. A integração de modelagem preditiva, aprendizado em conjunto e IA explicável fornece uma estrutura unificada para análise de plantasresidenciais 3,7,17,20.

Os resultados representativos demonstram que o CARE-MIRV-Net alcançou desempenho preditivo aprimorado em comparação com os modelos base individuais em múltiplos atributos arquitetônicos. A estrutura de conjunto geralmente reduziu erros de predição e melhorou oR2, sugerindo que combinar arquiteturas CNN heterogêneas pode melhorar a robustez preditiva12,20. Além disso, a incorporação do SHAP permitiu a interpretação das contribuições relativas dos modelos base individuais para as previsões finais, aumentando assim a transparência do modelo11,17. O framework pode, portanto, fornecer uma abordagem útil para estudos que exigem tanto desempenho preditivo quanto interpretabilidade do modelo.

O arcabouço proposto pode contribuir para o avanço de pesquisas envolvendo análise arquitetônica automatizada, avaliação de projetos residenciais e sistemas de suporte à decisão baseados em dados. Ao integrar a previsão multioutput com a categorização em nível de aplicação, o framework vai além do reconhecimento tradicional de plantas ou abordagens de extração de características. A metodologia pode ser aplicável em estudos envolvendo planejamento residencial, ambientes de habitação inteligente e avaliação de layoutespacial 1,2,8,22. No entanto, várias limitações devem ser consideradas. Primeiro, o framework foi desenvolvido e avaliado usando um único conjunto de dados público, e a validação externa em conjuntos de dados independentes não foi realizada. Nenhuma validação externa foi realizada no presente estudo, e a avaliação do modelo foi realizada usando o subconjunto de teste designado derivado do conjunto de dados publicamente disponível. Segundo, as categorias residenciais geradas pelo framework são derivadas de critérios baseados em regras pré-definidos, em vez de rótulos de design de saúde validados de forma independente. As categorias de cuidado para idosos, cuidados médicos e residenciais gerais geradas pelo framework derivam de critérios baseados em regras pré-definidos e não devem ser interpretadas como avaliações clinicamente validadas do design de cuidados de saúde. Terceiro, a estrutura baseia-se principalmente em atributos arquitetônicos derivados de imagens de plantas e não incorpora padrões de design específicos da saúde, critérios de acessibilidade ou medidas de resultado centradas no ocupante. Nenhum padrão formal de acessibilidade, design de saúde ou design residencial foi utilizado para definir as regras de classificação. Em vez disso, o framework de categorização foi desenvolvido usando os atributos disponíveis do plano de andar e critérios de decisão orientados à aplicação. Trabalhos futuros podem incluir validação externa em conjuntos de dados independentes, incorporação de padrões formais de acessibilidade e design de cuidados de saúde, e avaliação utilizando medidas adicionais de design e de resultados centradas no ocupante para aprimorar ainda mais a aplicabilidade e a generalização do framework.

Abordagens alternativas também podem ser usadas para investigar a mesma hipótese. Por exemplo, modelos de visão baseados em transformadores, representações espaciais baseadas em grafos ou arquiteturas híbridas DL poderiam ser aplicadas para capturar relações espaciais dentro dos layoutsresidenciais 13, 15, 19. De forma semelhante, estruturas de classificação baseadas em conjuntos de dados rotulados por especialistas ou padrões de design de saúde podem fornecer métodos alternativos para avaliação de layout residencial 8,22. Embora esses métodos possam oferecer vantagens complementares, a estrutura proposta do CARE-MIRV-Net demonstra a viabilidade de combinar múltiplas arquiteturas CNN dentro de uma estrutura de conjunto baseada em empilhamento para previsão multisaída e categorização de layout residencial.

Trabalhos futuros podem focar em estender o arcabouço para apoiar raciocínios espaciais mais avançados e aplicabilidade mais ampla no mundo real. As direções potenciais incluem a incorporação de representações de plantas baseadas em grafos para modelar a conectividade de salas, a avaliação de arquiteturas baseadas em transformadores de visão (ViT) para extração de características, e o desenvolvimento de estratégias de classificação multiclasse ou multirótulo 13,15,18. Além disso, estudos futuros podem incorporar atributos de design específicos para a área da saúde, padrões de acessibilidade e conjuntos de dados independentes de validação para avaliar melhor a aplicabilidade do arcabouço em ambientes residenciais voltados para a saúde 8,22. O arcabouço também pode ser adaptado para integração em plataformas de cidades inteligentes e sistemas de suporte à decisão para planejamentoresidencial 1,2.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Conflitos de Interesse:

Os autores não declaram conflitos de interesse.

Contribuições dos Autores:

Ning Zhang propôs ideias de pesquisa, desenhou planos experimentais e coordenou o processo de pesquisa. Yu Bi realizou experimentos, coletou dados, participou da análise de dados e da revisão de artigos.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores reconhecem sinceramente o apoio financeiro fornecido pelo Projeto de Pesquisa Científica do Departamento Provincial de Educação de Jilin.

FINANCIAMENTO:

Essa pesquisa foi financiada pelo Projeto de Pesquisa Científica do Departamento Provincial de Educação de Jilin (Bolsa nº JJKH20240801KJ).

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
PACOTE DE IMPLEMENTAÇÃO CARE-MIRV-NetArquivo Suplementar 1Versão 1.0N/A
Scripts de regeneração de figuras e tabelasArquivo Suplementar 1Versão 1.0N/A
Imagens de Plantas e Seu Dataset DetalhadoKaggleDataset PúblicoN/A
GPUNVIDIA CorporationTesla T4 × 2N/A
Processador Intel XeonIntel Corporation2,20 GHzN/A
KerasKeras TeamVersão 3.13.2N/A
MatplotlibMatplotlib Development TeamVersão 3.9RRID:SCR_008624
NumPyNumPy DevelopersVersão 2.4.6RRID:SCR_008633
Sistema OperacionalLinuxUbuntu 22.04 LTSN/A
PandasPandas Development TeamVersão 2.3.3RRID:SCR_018214
PythonPython Software FoundationVersão 3.12.12RRID:SCR_008394
Scikit-learnScikit-learn DevelopersVersão 1.6.1RRID:SCR_002577
SHAPSHAP Development TeamVersão 0.51.0N/A
Memória do Sistema (RAM)Ambiente de Computação em Nuvem31 GBN/A
TensorFlowGoogleVersão 2.19.0RRID:SCR_016345
Arquivo de configuração do ambiente de treinamentoArquivo Suplementar 1Versão 1.0N/A

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

EngineeringMeta ensemble learningfloor plan analysisresidential designelderly care housinghealthcare integrated designXAI
Vídeo em breve

Artigos relacionados