$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Questo studio ha utilizzato un dataset pubblicamente disponibile dalla piattaforma Kaggle (Floor Plan Images and Their Details, disponibile a: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; consultato il 16 aprile 2026). Non coinvolgeva partecipanti umani, animali o dati personali identificabili; Pertanto, non erano necessarie approvazioni etiche e consenso informato.
Questo protocollo presenta un framework guidato dall'IA per l'analisi automatizzata delle immagini della pianta residenziale, con un focus su progettazione spazialmente consapevole e orientata alla sanità. Il flusso di lavoro sperimentale completo è presentato nella Figura 1. Il protocollo è progettato per colmare il divario tra la previsione delle caratteristiche architettoniche di basso livello e il processo decisionale orientato all'applicazione di alto livello. Integra DL, modellazione in ensemble e intelligenza artificiale spiegabile per fornire una soluzione accurata, robusta e interpretabile per l'analisi delle disposizioni residenziali. Il framework è composto da più fasi, a partire dall'acquisizione e preelaborazione dei dati, seguite dall'apprendimento delle caratteristiche tramite CNN profonde, previsione meta-ensemble e infine classificazione a livello applicativo. Inizialmente, le immagini della pianta e le relative caratteristiche architettoniche vengono pre-elaborate tramite ridimensionamento, normalizzazione e aumento dei dati per garantire coerenza e migliorare la generalizzazione. Tutte le immagini della pianta sono state ridimensionate a 224 × 224 pixel e normalizzate all'intervallo [0, 1]. L'aumento dei dati è stato applicato durante l'addestramento utilizzando flipping orizzontale casuale, rotazione, zoom e spostamento di larghezza/altezza per migliorare la generalizzazione del modello e ridurre l'overfitting. Non è stato applicato alcun ribaltamento verticale. I parametri completi di aumento e i dettagli di implementazione sono forniti nel File Supplementare 1. I dati elaborati sono stati poi utilizzati per addestrare molteplici modelli DL per l'estrazione e la previsione delle caratteristiche. Tutti i modelli base e il meta-learner CARE-MIRV-Net sono stati addestrati utilizzando una configurazione coerente, inclusa aumento dei dati, arresto precoce e schedulazione adattiva del tasso di apprendimento. L'arresto precoce monitorava la perdita di validazione (val_loss) con un valore di pazienza di 5 epoche, e i migliori pesi del modello venivano ripristinati automaticamente dopo l'addestramento. La programmazione adattiva del tasso di apprendimento è stata implementata utilizzando il callback ReduceLROnPlateau, che monitorava la perdita di validazione e riduceva il tasso di apprendimento di un fattore 0,3 dopo 2 epoche senza miglioramenti, con un tasso minimo di apprendimento di 1 × 10⁻7. I dettagli completi dell'implementazione e le impostazioni dei parametri sono forniti nel File Supplementare 1. Il dataset è stato suddiviso casualmente in set di addestramento e test utilizzando un rapporto di suddivisione 80:20. Veniva utilizzato un seed casuale fisso (42) per garantire la riproducibilità. I dettagli completi dell'implementazione sono forniti nel File Supplementare 1.

Figura 1. Flusso di lavoro del framework CARE-MIRV-Net per l'analisi delle planimetrie residenziali. Panoramica schematica del protocollo proposto. Il flusso di lavoro include (1) acquisizione e preelaborazione del dataset, (2) apprendimento e previsione delle caratteristiche usando MobileNetV2, InceptionV3, ResNet101 e VGG16, (3) previsione meta-ensemble basata su stacking usando CARE-MIRV-Net, (4) classificazione del layout residenziale basata su regole, (5) analisi interpretabile basata su SHapley Additive exPlanations (SHAP) e (6) valutazione delle prestazioni. Clicca qui per visualizzare una versione più grande di questa figura.
Nella seconda fase, quattro CNN pre-addestrate, MobileNetV2, InceptionV3, ResNet101 e VGG16, vengono impiegate come apprendenti base. Ogni modello viene ottimizzato utilizzando il transfer learning per prevedere attributi architettonici chiave, inclusi metratura, numero di camere da letto, bagni e garage. Per ogni modello di trasferimento-apprendimento, gli strati inferiori pre-addestrati sono stati mantenuti congelati, mentre gli strati superiori e la testa di regressione personalizzata sono stati finemente regolati durante l'addestramento. Configurazioni dettagliate di messa a punto specifiche per modello sono fornite nel File Supplementare 1. Questi modelli catturano diversi aspetti delle informazioni spaziali: MobileNetV2 fornisce un'estrazione efficiente delle caratteristiche, InceptionV3 cattura pattern spaziali multiscala, ResNet101 apprende rappresentazioni gerarchiche profonde e VGG16 garantisce un apprendimento delle caratteristiche stabile e coerente. La diversità tra questi modelli potenzia la capacità complessiva di rappresentazione del framework.
Per migliorare ulteriormente l'accuratezza e la robustezza della previsione, viene proposto un modello meta-ensemble basato su stacking, indicato come CARE-MIRV-Net. In questo passo, le previsioni di tutti i modelli base vengono aggregate per creare uno spazio di caratteristiche di dimensioni superiori, che viene inserito a un meta-learner. Le previsioni del modello base vengono generate inizialmente in modo indipendente utilizzando i modelli addestrati MobileNetV2, InceptionV3, ResNet101 e VGG16. Queste previsioni vengono poi concatenate per formare il vettore meta-feature usato dal meta-learner. Per prevenire la perdita di dati, i dataset di addestramento e test sono rigidamente separati, e il meta-learner viene addestrato solo sulle previsioni generate dai dati di addestramento. Il meta-modello, che è una rete neurale completamente connessa, è addestrato ad apprendere la combinazione ottimale degli output del modello base per produrre previsioni più raffinate. Il meta-modello è composto da due strati completamente connessi con 512 e 256 neuroni che utilizzano l'attivazione ReLU, seguiti da strati dropout (0.4 e 0.3) e uno strato di output lineare. Il modello viene addestrato utilizzando l'ottimizzatore Adam (tasso di apprendimento = 0,0001), una dimensione di batch di 32 e fino a 15 epoche. L'arresto precoce è stato implementato monitorando la perdita di validazione (val_loss) con un valore di pazienza di 5 epoche. Il criterio minimo di miglioramento (min_delta) è stato impostato al valore predefinito di TensorFlow pari a 0, e i migliori pesi del modello sono stati ripristinati automaticamente dopo l'addestramento. La scheduling adattiva del tasso di apprendimento è stata implementata utilizzando il callback ReduceLROnPlateau, che monitorava la perdita di validazione e riduceva il tasso di apprendimento di un fattore 0,3 dopo 2 epoche consecutive senza miglioramenti. La velocità minima di apprendimento era impostata a 1 × 10⁻7, e il parametro di cooldown usava il valore predefinito di TensorFlow pari a 0. Questo metodo di ensemble riduce i bias dei singoli modelli e migliora la generalizzazione grazie ai punti di forza complementari di più architetture. Informazioni dettagliate sull'implementazione sono fornite nel File Supplementare 1.
Dopo la previsione, viene aggiunto uno strato di interpretazione per convertire gli output numerici in decisioni a livello applicativo. Le disposizioni residenziali possono essere classificate in tre categorie basate sulle previsioni delle caratteristiche architettoniche: assistenza agli anziani, assistenza sanitaria integrata (assistenza medica) e uso residenziale generale. Questa classificazione viene effettuata utilizzando regole decisionali predefinite basate su soglie basate sulla metratura prevista, il numero di camere da letto e il numero di bagni. La categoria con il punteggio più alto viene assegnata come classificazione finale, mentre i pareggi si risolvono selezionando la categoria che soddisfa il maggior numero di criteri decisionali. Le regole complete di punteggio e le soglie di classificazione sono fornite nel File Supplementare 2 (Algoritmo 1). Questa azione consente al quadro di fornire informazioni pratiche per la progettazione di abitazioni residenziali.
Il framework utilizza un'IA spiegabile con SHAP per fornire trasparenza e interpretabilità. Questa componente esamina il contributo delle previsioni di ciascun modello base all'output del meta-modello. L'analisi SHAP è stata effettuata utilizzando SHAP KernelExplainer (SHAP versione 0.51.0) con 100 campioni di addestramento selezionati casualmente come dataset di background e 50 campioni di test per la generazione delle spiegazioni. La configurazione completa di SHAP, inclusa la selezione del campione in background e le impostazioni di implementazione, è fornita nel File Supplementare 1. Il livello di spiegabilità aiuta a comprendere il processo decisionale misurando l'importanza delle caratteristiche e mostrando i modelli di contributo, migliorando così la trasparenza e l'affidabilità del modello. Il framework proposto viene valutato utilizzando MAE eR2 su tutte le variabili target. Per la previsione multioutput, l'MAE è stato calcolato come la differenza assoluta media tra i valori effettivi e previsti su tutte le variabili target, mentre R2 è stato calcolato confrontando la varianza spiegata delle previsioni con i corrispondenti valori di verità fondamentale per ciascun output. Le analisi quantitative e qualitative indicano che il proposto CARE-MIRV-Net migliora l'accuratezza delle previsioni e supporta la classificazione della disposizione residenziale basata su regole. L'affidabilità della classificazione è stata valutata sulla base dell'accuratezza delle previsioni di regressione sottostanti e della coerenza dello strato decisionale basato su regole. Il framework è una soluzione adatta e scalabile per l'analisi intelligente della pianta e può essere applicato a case intelligenti, pianificazione per l'assistenza agli anziani e progettazione residenziale orientata all'assistenza sanitaria. Un elenco completo di dataset, pacchetti software, librerie, risorse hardware e strumenti computazionali utilizzati in questo studio è fornito nella Tabella dei Materiali. Il codice sorgente, le informazioni sulla configurazione dell'ambiente, le specifiche di dipendenza software e gli script di implementazione necessari per riprodurre il flusso di lavoro riportato sono forniti nel File Supplementare 1.
Algoritmo per il Protocollo
Il framework proposto adotta un approccio multifasi per elaborare le planimetrie basate su immagini di case residenziali e produrre output predittivi e a livello decisionale, come illustrato nell'Algoritmo 1 nel Supplementary File 2. Questo processo inizia con la pre-elaborazione dei dati, in cui le immagini di input vengono ridimensionate a una risoluzione standard e normalizzate per garantire uniformità in tutto il dataset. Tutte le immagini della pianta sono state ridimensionate a 224 × 224 pixel e normalizzate all'intervallo [0, 1]. Questo passaggio ottimizza le immagini per l'apprendimento tramite reti neurali profonde e migliora la convergenza complessiva del modello. La seconda fase prevede l'utilizzo di diversi modelli DL come apprendenti base, tra cui MobileNetV2, InceptionV3, ResNet101 e VGG16. In modo indipendente, ogni modello prende le immagini in input e stima caratteristiche architettoniche importanti come la metratura quadrata e il numero di camere da letto, bagni e garage. Il dataset è stato suddiviso casualmente in set di addestramento e test utilizzando un rapporto di suddivisione 80:20, e un seed casuale fisso è stato utilizzato per garantire la riproducibilità. Questi modelli catturano diverse proprietà spaziali delle planimetrie e forniscono previsioni complementari. La rappresentazione delle caratteristiche viene poi costruita impilando gli output di ciascun modello base per creare una singola rappresentazione delle caratteristiche. Questo output congiunto viene successivamente inserito in un modello meta-ensemble, CARE-MIRV-Net, che viene addestrato a combinare le previsioni di tutti i modelli base. Le previsioni del modello base sono state generate indipendentemente e concatenate per formare il vettore meta-caratteristica. La fuga di dati è stata prevenuta grazie alla rigida separazione tra i dataset di addestramento e test. Il meta-modello affina queste previsioni e produce le previsioni finali degli attributi architettonici. Il meta-modello era composto da strati completamente connessi con 512 e 256 neuroni, funzioni di attivazione di ReLU, tassi di dropout di 0,4 e 0,3, l'ottimizzatore Adam (tasso di apprendimento = 0,0001), una dimensione di lotto di 32 e fino a 15 epoche di addestramento con arresto precoce. Dopo la previsione, viene utilizzato uno strato decisionale per contestualizzare i risultati. Secondo i valori stimati, ogni disposizione residenziale è classificata come assistenza agli anziani, assistenza medica o uso residenziale generale. Le categorie residenziali sono state assegnate utilizzando regole di punteggio predefinite basate su soglie derivate dagli attributi previsti della pianta del piano. La categoria con il punteggio più alto veniva selezionata come classificazione finale. Le soglie complete di classificazione e le regole decisionali sono fornite nell'Algoritmo 1 (Supplementare File 2). Infine, il framework incorpora una componente di spiegabilità basata su SHAP per valutare l'impatto di ciascun modello base sulla previsione finale. L'analisi SHAP è stata eseguita come descritto in precedenza e nel Supplementary File 1. Questa componente aumenta la trasparenza e aiuta a comprendere il processo decisionale. L'efficacia e la fattibilità dell'approccio proposto sono state valutate utilizzando le standard misure di regressione delle performance. Le prestazioni sono state valutate utilizzando una singola esecuzione sperimentale con un seed casuale fisso.
Modelli di valutazione
In questa sezione sono presentati i modelli DL utilizzati nello studio, includendo sia i singoli modelli base sia il proposto CARE-MIRV-Net. I modelli benchmark sono stati selezionati per rappresentare architetture DL diverse e ampiamente adottate. MobileNetV2 è stato incluso come rete leggera ed efficiente dal punto di vista computazionale, e InceptionV3 è stato selezionato per la sua capacità di catturare caratteristiche spaziali multiscala. ResNet101 è stato scelto per la sua profonda capacità di apprendimento residuo per l'estrazione gerarchica di caratteristiche, e VGG16 è stato incluso come architettura convoluzionale ben affermata. Tutti i modelli di benchmark sono stati addestrati utilizzando procedure di preelaborazione identiche, impostazioni di aumento dei dati, partizioni del dataset, parametri di ottimizzazione, dimensione del lotto e configurazione di addestramento per garantire una valutazione comparativa equa.
MobileNetV2:
MobileNetV2 è un sistema CNN piccolo e compatto, progettato per essere veloce, ad alte prestazioni e con una minore complessità computazionale. Presenta alcune delle principali innovazioni come le connessioni residue invertite e i colli di bottiglia lineari, che facilitano un'estrazione efficiente delle caratteristiche e mantengono comunque un elevato potere rappresentativo. MobileNetV2 può utilizzare convoluzioni separabili in profondità per minimizzare notevolmente il numero totale di parametri e il costo computazionale delle tradizionali reti convoluzionali, ed è quindi ben adattato a grandi problemi di apprendimento basati su immagini.
MobileNetV2 è utilizzato nel framework suggerito come uno dei modelli fondamentali DL per prevedere le caratteristiche architettoniche delle immagini di pianta residenziale. Il modello è in grado di apprendere efficacemente i modelli spaziali come la distribuzione delle stanze, la densità della disposizione e l'organizzazione strutturale che si verificano nelle planimetrie grazie al suo design efficiente. Tali rappresentazioni erudite svolgono un ruolo importante nel valutare con precisione caratteristiche chiave come la metratura, il numero di camere da letto, bagni e garage. MobileNetV2 è un modello leggero, che è un buon candidato per essere incluso nel framework meta-ensemble proposto. Aggiunge alcune rappresentazioni di caratteristiche complementari ad altri modelli DL e migliora la robustezza complessiva e la generalizzazione del sistema. Questo apprendimento del modello è molto importante per migliorare l'accuratezza delle previsioni e per assistere nella classificazione dei progetti residenziali basati sull'assistenza sanitaria.
Il modello MobileNetV2 viene addestrato utilizzando una strategia di transfer-learning con pesi pre-addestrati dal dataset ImageNet. Le immagini di input sono scalate a una dimensione fissa di 224 × 224 × 3, compatibile con l'architettura. Le immagini sono state ridimensionate a 224 × 224 pixel, normalizzate all'intervallo [0, 1] e ampliate usando flipping, rotazione, zoom e spostamento casuali. Durante l'addestramento veniva utilizzato un lotto di 32 esemplari. La testa di classificazione iniziale di MobileNetV2 viene rimossa e sostituita con una testa di regressione. La testa di regressione era composta da uno strato di Global Average Pooling seguito da strati completamente connessi con 512 e 256 neuroni, normalizzazione batch, strati di dropout (0,4 e 0,3) e uno strato lineare di output a quattro neuroni. Per facilitare l'adattamento al dominio, gli strati inferiori pre-addestrati sono stati congelati, mentre gli strati superiori a partire da block_13_expand e la testa di regressione personalizzata sono stati ottimizzati. Questo approccio di addestramento selettivo permette al modello di mantenere le caratteristiche visive generali mentre apprende attributi spaziali specifici per dominio delle immagini della pianta di piano. Le feature map estratte vengono elaborate tramite uno strato di Global Average Pooling e strati completamente connessi con 512 e 256 neuroni tramite attivazione ReLU. Per migliorare la generalizzazione e ridurre l'overfitting, vengono incorporati i livelli di normalizzazione batch e dropout (0,4 e 0,3). Lo strato finale di output contiene quattro neuroni con attivazione lineare corrispondenti agli attributi architettonici previsti. L'ottimizzatore Adam veniva utilizzato con un tasso di apprendimento di 0,0001 e parametri predefiniti TensorFlow/Keras (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = Falso). Per la previsione multioutput, MAE e R2 sono stati calcolati confrontando i valori previsti e reali per ciascuna variabile target e poi facendo la media dei risultati su tutti gli output. L'arresto precoce è stato applicato sulla base della perdita di validazione, e la riduzione del tasso di apprendimento adattivo è stata utilizzata per migliorare la convergenza. L'addestramento veniva svolto fino a 15 epoche.
InceptionV3:
InceptionV3 è un'architettura CNN profonda in grado di catturare caratteristiche multiscala grazie all'uso di operazioni convoluzionali parallele. Si basa sul modulo Inception, che utilizza diverse dimensioni di filtro nello stesso strato per estrarre contemporaneamente caratteristiche a grana fine e grossolane. Questo tipo di progettazione architetturale permette alla rete di apprendere intricate gerarchie spaziali ed essere computazionalmente efficiente. Inoltre, InceptionV3 utilizza convoluzioni fattorizzate e riduzione della dimensionalità, che migliorano le prestazioni e minimizzano i costi computazionali.
InceptionV3 viene applicato nel framework proposto come estratore di caratteristiche efficace per analizzare immagini di pianta residenziali. Le planimetrie comprendono una varietà di schemi spaziali, come dimensioni delle stanze, piani strutturali e connettività, rendendo necessario l'apprendimento delle caratteristiche multiscala. L'architettura Inception è particolarmente più adatta a questo compito perché è in grado di rappresentare contemporaneamente specifiche locali (ad esempio, stanze piccole) e strutture globali (ad esempio, l'organizzazione della disposizione complessiva). InceptionV3 fornisce rappresentazioni complementari ad altri modelli come MobileNetV2 nel contesto del framework meta-ensemble. La diversità delle previsioni è aumentata dalla sua capacità di modellare complesse relazioni spaziali, e questo è importante per migliorare la performance dell'ensemble. Questo aiuta infine a una migliore previsione delle caratteristiche architettoniche e rafforza la classificazione a valle del design abitativo adatto agli anziani e integrato nell'assistenza sanitaria.
Il modello InceptionV3 viene addestrato utilizzando un approccio di transfer-learning con pesi pre-addestrati dal dataset ImageNet. Le immagini di input sono scalate a 224 × 224 × 3 per garantire compatibilità con l'architettura di rete e la coerenza tra tutti i modelli all'interno del framework. Le immagini sono state ridimensionate a 224 × 224 pixel, normalizzate all'intervallo [0, 1] e ampliate usando flipping, rotazione, zoom e spostamento casuali. Durante l'addestramento veniva utilizzato un lotto di 32 esemplari.
I livelli di classificazione originali di InceptionV3 vengono rimossi e viene introdotta una testa di regressione personalizzata per consentire la previsione multioutput. La testa di regressione personalizzata consisteva in uno strato di Global Average Pooling seguito da strati completamente connessi con 512 e 256 neuroni, normalizzazione batch, strati dropout (0,4 e 0,3) e uno strato lineare di output a quattro neuroni. La base convoluzionale è parzialmente fine-tun, con i livelli inferiori pre-addestrati congelati e i livelli superiori, insieme alla testa di regressione personalizzata, regolati per apprendere le caratteristiche specifiche del piano di dominio mantenendo però le rappresentazioni visive generali acquisite durante il pre-addestramento. Dopo la spina dorsale convoluzionale, uno strato di Global Average Pooling trasforma le feature map in una rappresentazione compatta delle feature map. A questo segue uno strato completamente connesso contenente 512 e 256 neuroni con funzioni di attivazione ReLU. Per minimizzare l'overfitting e migliorare la generalizzazione, si applicano tassi di dropout di 0,4 e 0,3. Lo strato finale di uscita è composto da quattro neuroni con attivazione lineare corrispondenti alla previsione della metratura, del numero di camere da letto, del numero di bagni e del numero di garage. Il modello viene addestrato utilizzando l'ottimizzatore Adam con un tasso di apprendimento di 0,0001, una dimensione di lotto di 32 e fino a 15 epoche di addestramento con arresto precoce e riduzione della velocità di apprendimento adattiva per garantire una convergenza stabile.
ResNet101:
ResNet101 è una struttura profonda della CNN costruita sul principio dell'apprendimento residuo che rende possibile addestrare reti estremamente profonde superando il problema del gradiente nullo. Aggiunge connessioni residue, o cosiddette connessioni saltate, che permettono alla rete di apprendere le mappature di identità e di conservare informazioni tra i livelli. Questa architettura migliora notevolmente la stabilità dell'addestramento e permette al modello di apprendere caratteristiche gerarchiche complesse. ResNet101 ha una profonda capacità rappresentativa di 101 livelli ed è quindi molto efficace in compiti che richiedono caratteristiche spaziali aggiuntive.
ResNet101 sarà utilizzato nel framework proposto come estratore di caratteristiche ad alta capacità, che analizzerà le immagini delle planimetrie residenziali. Il modello può essere utilizzato per rappresentare complesse relazioni spaziali, inclusa la connettività delle stanze, la complessità della disposizione e le variazioni strutturali, grazie alla sua architettura profonda. Queste caratteristiche sono fondamentali per fare previsioni precise su elementi architettonici come metratura, camere da letto, bagni e garage. Nel design del meta-ensemble, ResNet101 è un componente significativo e fornisce rappresentazioni di caratteristiche profonde e astratte. ResNet101 si occupa maggiormente delle caratteristiche strutturali a grana fine e quindi è più diversificato tra gli apprendenti base rispetto a modelli leggeri come MobileNetV2. Questa eterogeneità gioca un ruolo essenziale nel migliorare la performance di un ensemble e previsioni solide, specialmente quando si tratta di classificazione residenziale basata sulla sanità.
ResNet101 viene addestrato utilizzando un approccio di transfer-learning con pesi pre-addestrati dal dataset ImageNet. Le immagini di input sono scalate a 224 × 224 × 3, garantendo così compatibilità architettonica e coerenza tra tutti i modelli all'interno del framework. Le immagini sono state ridimensionate a 224 × 224 pixel, normalizzate all'intervallo [0, 1] e ampliate usando flipping, rotazione, zoom e spostamento casuali. Durante l'addestramento veniva utilizzato un lotto di 32 esemplari. La testa di classificazione originale di ResNet101 viene rimossa (include_top=Falso) e viene introdotta una testa di regressione personalizzata per consentire la previsione multioutput. La testa di regressione era composta da uno strato di Global Average Pooling seguito da strati completamente connessi con 512 e 256 neuroni, normalizzazione batch, strati di dropout (0,4 e 0,3) e uno strato lineare di output a quattro neuroni. Per bilanciare il riutilizzo delle caratteristiche e l'adattamento del dominio, i livelli pre-addestrati inferiori sono stati congelati, mentre i livelli più profondi a partire da conv4_block1_1_conv e la testa di regressione personalizzata sono stati ottimizzati. Questa strategia di addestramento selettivo permette al modello di mantenere caratteristiche visive generiche adattando al contempo rappresentazioni di livello superiore alle immagini della pianta di piano. L'output della base convoluzionale viene passato attraverso uno strato di Global Average Pooling per generare una rappresentazione compatta delle caratteristiche. A questo segue strati completamente connessi con 512 e 256 neuroni che utilizzano funzioni di attivazione ReLU. La normalizzazione batch viene applicata per stabilizzare l'apprendimento, e vengono incorporati layer dropout con tassi di 0,4 e 0,3 per ridurre l'overfitting e migliorare la generalizzazione. Il livello finale di uscita contiene quattro neuroni con attivazione lineare corrispondente alla metratura, al numero di camere da letto, bagni e garage. L'ottimizzatore Adam veniva utilizzato con un tasso di apprendimento di 0,0001, come descritto nella configurazione di addestramento. L'aumento dei dati includeva flipping casuale, rotazione, zoom e shifting per migliorare la generalizzazione del modello. L'addestramento è stato svolto fino a 15 epoche con interruzione precoce in base alla perdita di validazione e alla riduzione del tasso di apprendimento adattivo.
VGG16:
VGG16 è un'architettura di rete neurale semplice di tipo convoluzionale profondo, efficace e semplice nei compiti di riconoscimento visivo. È composto da 16 livelli con un design regolare o omogeneo che incorpora piccoli filtri convoluzionali 3 × 3, che facilitano l'apprendimento delle rappresentazioni gerarchiche delle caratteristiche da parte della rete. L'architettura è focalizzata sulla profondità e semplice, il che significa che è in grado di catturare dettagli di basso livello come bordi, texture e strutture semantiche di alto livello. VGG16, con il suo design regolare e le buone prestazioni, è ora una scelta popolare di backbone quando si esegue transfer learning in compiti legati all'immagine.
Nel modello suggerito, VGG16 viene utilizzato come modello DL di base per ricavare le caratteristiche spaziali delle immagini delle planimetrie residenziali. Il fatto che sia organizzata lo rende molto utile per catturare i dettagli più fini dei modelli di disposizione come i confini delle stanze, gli allineamenti strutturali e l'organizzazione spaziale. Le caratteristiche sono fondamentali per prevedere efficacemente le caratteristiche dell'architettura come piedi quadrati, camere da letto, bagni e garage. Nel sistema meta-ensemble, VGG16 fornisce rappresentazioni di caratteristiche stabili e ben generalizzate. VGG16 offre un approccio di estrazione delle funzionalità più bilanciato rispetto a architetture più profonde, come ResNet101, e architetture multiscala, come InceptionV3, aumentando la diversità degli studenti di base. Questa eterogeneità è fondamentale per migliorare le prestazioni dell'insieme e le previsioni affidabili della classificazione residenziale orientata all'assistenza sanitaria.
Il modello VGG16 viene addestrato utilizzando un approccio di trasferimento-apprendimento con pesi pre-addestrati dal dataset ImageNet. Le immagini di input sono scalate a 224 × 224 × 3 per garantire compatibilità con l'architettura e coerenza tra tutti i modelli all'interno del framework. Le immagini sono state ridimensionate a 224 × 224 pixel, normalizzate all'intervallo [0, 1] e ampliate usando flipping, rotazione, zoom e spostamento casuali. Durante l'addestramento veniva utilizzato un lotto di 32 esemplari. I livelli di classificazione originali vengono rimossi (include_top=Falso) e viene aggiunta una testa di regressione personalizzata per adattare il modello alla previsione multioutput. La testa di regressione era composta da uno strato di Global Average Pooling seguito da strati completamente connessi con 512 e 256 neuroni, normalizzazione batch, strati di dropout (0,4 e 0,3) e uno strato lineare di output a quattro neuroni. Gli strati pre-addestrati inferiori erano congelati, mentre quelli a partire da block4_conv1 e la testa di regressione personalizzata erano stati regolati con precisione. Questa strategia consente al modello di mantenere caratteristiche visive generali mentre apprende rappresentazioni specifiche per dominio rilevanti per l'analisi delle pianimetrie. Le caratteristiche di output della base convoluzionale vengono passate attraverso uno strato di Global Average Pooling per generare un vettore di caratteristiche compatto. A questo segue strati completamente connessi con 512 e 256 neuroni che utilizzano funzioni di attivazione ReLU. Vengono incorporati strati di normalizzazione in batch e dropout con tassi di 0,4 e 0,3 per stabilizzare l'addestramento, ridurre l'overfitting e migliorare la generalizzazione. Lo strato finale di output contiene quattro neuroni con attivazione lineare corrispondenti alla metratura, al numero di camere da letto, bagni e previsioni del garage. L'ottimizzatore Adam veniva utilizzato con un tasso di apprendimento di 0,0001, come descritto nella configurazione di addestramento. L'aumento dei dati includeva flipping casuale, rotazione, zoom e shifting per migliorare la generalizzazione del modello. L'addestramento è stato svolto fino a 15 epoche con interruzione precoce in base alla perdita di validazione e alla riduzione del tasso di apprendimento adattivo.
CARE-MIRV-Net (Modello Proposto di Meta-Ensemble DL):
Il CARE-MIRV-Net (Context-Aware Residential Ensemble utilizzando MobileNetV2, InceptionV3, ResNet101 e VGG16 Network) suggerito è un framework DL meta-ensemble basato su stacking che mira a migliorare la stima delle caratteristiche architettoniche sulla base delle immagini della pianta residenziale. L'architettura combina varie CNN eterogenee sfruttandone i vantaggi sinergici nell'estrazione delle caratteristiche. Il modello proposto si basa sulla combinazione di architettura leggera, profonda e multiscala che migliora le prestazioni predittive e offre robustezza in un'ampia gamma di layout residenziali. A differenza delle tecniche tradizionali basate su un singolo modello, CARE-MIRV-Net segue un approccio di apprendimento gerarchico, in cui i modelli base forniscono previsioni iniziali, che poi vengono migliorate da un meta-apprendente.
Quando si tratta di un design residenziale consapevole dello spazio e della salute, la corretta interpretazione della disposizione dei piani è di fondamentale importanza. I modelli DL singoli tendono a essere insufficienti nel generalizzare diversi modelli architettonici. Il framework proposto supererà questa debolezza utilizzando quattro diverse architetture: MobileNetV2, InceptionV3, ResNet101 e VGG16, che offrono diverse capacità rappresentative proprie. MobileNetV2 può essere utilizzato per estrarre le caratteristiche in modo efficiente ed è leggero; InceptionV3 apprende i modelli spaziali su più scale; ResNet101 apprende rappresentazioni gerarchiche profonde; e VGG16 apprende le funzionalità in modo coerente e affidabile. Una combinazione di questi modelli facilita il quadro che abbraccia sia gli attributi spaziali locali che globali, migliorando l'accuratezza e l'affidabilità delle caratteristiche previste come la metratura, il numero di camere da letto, bagni e garage. Le previsioni sopra possono anche essere utilizzate per prevedere ulteriori classificazioni delle disposizioni residenziali, includendo quelle adatte agli anziani, integrate nell'assistenza sanitaria e residenziali generali.
CARE-MIRV-Net è implementato utilizzando una strategia di ensemble basata su stacking a due fasi. Nella prima fase, i quattro modelli base generano indipendentemente previsioni per le variabili target. Gli input meta-learner sono stati generati concatenando gli output di previsione prodotti dai modelli base addestrati sui dati di addestramento. Queste previsioni concatenate formavano i vettori meta-feature a 16 dimensioni utilizzati per l'addestramento dei meta-modelli. La fuga di informazioni è stata evitata tramite una rigida separazione tra i dataset di addestramento e test, e non sono stati utilizzati campioni di test né durante l'addestramento del modello base né del meta-modello. Gli stessi dataset di addestramento e validazione utilizzati per i modelli base sono stati impiegati durante il processo di impilamento. Durante l'addestramento e l'inferenza, il vettore meta-feature a 16 dimensioni è stato costruito concatenando i quattro output di previsione generati da MobileNetV2, InceptionV3, ResNet101 e VGG16. Poiché ogni modello genera un vettore di uscita quadridimensionale, la rappresentazione concatenata produce un input a 16 dimensioni per il meta-apprendente. Questa trasformazione combina le previsioni di tutti i modelli base e funge da input per la seconda fase del framework. La seconda fase consiste nella costruzione di un meta-apprendente di rete neurale completamente connesso per apprendere la combinazione ottimale di previsioni del modello base. Il meta-learner era composto da strati completamente connessi con 512 e 256 neuroni, attivazione ReLU, normalizzazione batch, tassi di abbandono di 0,4 e 0,3 e uno strato lineare di output a quattro neuroni. Strati di dropout con velocità di 0,4 e 0,3 sono stati applicati dopo gli strati densi per ridurre il sovrafitting e migliorare la generalizzazione. Il meta-modello è stato addestrato utilizzando l'ottimizzatore Adam con un tasso di apprendimento di 0,0001, una dimensione di batch di 32 e fino a 15 epoche con stop precoce e riduzione del tasso di apprendimento adattivo. I dati di validazione venivano utilizzati per monitorare le prestazioni del modello durante l'addestramento e per selezionare il modello con le migliori prestazioni. Dopo l'addestramento, il modello meta-ensemble generava previsioni finali combinando i risultati di tutti gli studenti base. MAE e R2 sono stati utilizzati per valutare le prestazioni di CARE-MIRV-Net. Per la previsione multioutput, MAE e R2 sono stati calcolati confrontando i valori previsti e reali per ciascuna variabile target e poi facendo la media dei risultati su tutti gli output. I risultati sono stati ottenuti da una singola esecuzione sperimentale utilizzando un seed casuale fisso. Il framework proposto migliora la capacità predittiva combinando diverse strutture DL tramite un meccanismo di stacking e fornendo un'analisi interpretabile delle planimetrie residenziali. Questo rende CARE-MIRV-Net applicabile nel contesto di progettazione residenziale orientata alla geriatría e alla sanità. Il codice sorgente, le informazioni sulla configurazione dell'ambiente, le specifiche di dipendenza software e la documentazione di implementazione sono forniti nel File Supplementare 1.
Valutazione delle prestazioni
L'analisi delle prestazioni del framework proposto viene effettuata per determinarne il potere predittivo, la robustezza e la generalizzazione attraverso diverse caratteristiche architettoniche. Vengono condotte analisi quantitative e qualitative per confermare l'utilità del modello proposto. La procedura di valutazione prevede sia misure di regressione standard sia ambienti sperimentali controllati per consentire un confronto equo con i modelli di base. Gli esperimenti sono stati condotti utilizzando una singola esecuzione sperimentale con un seed casuale fisso per garantire riproducibilità e coerenza su tutti i modelli di benchmark e proposti.
Parametri di prestazione:
Due note misure di regressione, MAE e R2, sono utilizzate per valutare le prestazioni del quadro proposto. La MAE misura la magnitudine media degli errori di previsione e fornisce un'indicazione chiara della vicinanza tra i valori previsti e quelli reali. Al contrario, il valore R2 viene utilizzato per valutare la proporzione di varianza nelle variabili target spiegate dal modello, riflettendo il suo potere predittivo complessivo. Una combinazione di queste metriche fornisce una valutazione completa dell'accuratezza e delle prestazioni generalizzate di tutte le caratteristiche architettoniche previste. Per la previsione multioutput, MAE e R2 sono stati calcolati confrontando i valori previsti e reali per ciascuna variabile target e poi facendo la media dei risultati su tutti gli output.
Configurazione sperimentale:
Gli esperimenti sono stati condotti in un ambiente di cloud computing utilizzando Python (versione 3.12.12). Il protocollo proposto è stato implementato utilizzando TensorFlow (versione 2.19.0), Keras (versione 3.13.2), NumPy (versione 2.4.6), Pandas (versione 2.3.3), Scikit-learn (versione 1.6.1), Matplotlib (versione 3.9) e SHAP (versione 0.51.0). L'ambiente computazionale utilizzava un processore Intel Xeon che operava a 2,20 GHz con circa 31 GB di memoria di sistema. Gli esperimenti sono stati condotti su un sistema operativo Ubuntu 22.04 LTS utilizzando GPU NVIDIA Tesla T4 × 2. Il dataset contiene 2.640 immagini di pianta residenziale pre-elaborate e suddivise in dataset di addestramento e test. Il dataset è stato suddiviso utilizzando un rapporto di divisione 80:20, risultando in 2.112 campioni di addestramento e 528 campioni di test. MobileNetV2, InceptionV3, ResNet101 e VGG16 sono quattro modelli DL addestrati utilizzando un approccio di fine-tuning con transfer learning. È stato quindi costruito un modello meta-ensemble basato su stacking, CARE-MIRV-Net, per combinare le previsioni di questi modelli base. Ogni modello veniva addestrato in condizioni uniformi, inclusi ridimensionamenti dell'immagine a 224 × 224 pixel, aumento dei dati e arresti anticipati per ridurre il sovrafitting. L'aumento dei dati includeva flipping casuale, rotazione, zoom e shifting. Sono stati utilizzati un lotto di 32 e un massimo di 15 epoche di addestramento, con un'interruzione precoce basata sulla perdita di validazione e la riduzione del tasso di apprendimento adattivo. L'analisi finale è stata effettuata su un set di test nascosto per fornire una valutazione imparziale e affidabile delle prestazioni. Il set di test nascosto è stato generato durante la partizione iniziale del dataset ed è rimasto completamente isolato durante l'addestramento e lo sviluppo del modello per garantire una valutazione imparziale delle prestazioni.
Descrizione del dataset:
Il dataset utilizzato a supporto dei risultati di questo studio è pubblicamente disponibile sulla piattaforma Kaggle con il titolo "Floor Plan Images and Their Details"28. Il dataset è disponibile su: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (consultato il 16 aprile 2026). I dati consistono in 2.640 immagini di pianta residenziale e metadati architettonici organizzati. Ogni esempio è un piano abitativo distinto, che offre una vasta gamma di layout residenziali con dimensioni, configurazioni e disposizioni spaziali differenti. La dimensione del dataset è sufficiente per l'addestramento basato su DL e contiene una varietà di pattern architettonici. Il dataset consiste in un'immagine bidimensionale della pianta e attributi numerici correlati che descrivono le caratteristiche strutturali della residenza. Queste caratteristiche includono la superficie totale in metra, il numero di camere da letto, il numero di bagni e il numero di garage. Inoltre, ogni record contiene un percorso dell'immagine, che consente la mappatura diretta degli input visivi alle etichette. Le variabili del dataset includono l'immagine della pianta, il percorso dell'immagine, la metratura, il numero di camere da letto, il numero di bagni e il numero di garage. L'immagine della pianta funge da caratteristica di input, mentre gli attributi architettonici vengono utilizzati come obiettivi di previsione. Il dataset è quindi adatto all'apprendimento supervisionato, con immagini che fungono da input feature e attributi architettonici come target di regressione.
Il dataset contiene una vasta gamma di layout residenziali, che vanno da layout compatti con meno stanze a grandi layout multiroom. Questa variabilità consente l'apprendimento di rappresentazioni spaziali significative, inclusa la distribuzione delle stanze, la densità della disposizione e la complessità strutturale. Questa diversità è particolarmente importante per il quadro proposto, poiché supporta la categorizzazione delle planimetrie in layout adatti agli anziani, integrati nell'assistenza sanitaria e residenziali generali. Prima dell'addestramento del modello, il dataset viene elaborato attraverso una sequenza di procedure di pre-elaborazione per garantire coerenza e compatibilità con i modelli DL. Tutte le immagini sono state ridimensionate a 224 × 224 pixel e normalizzate all'intervallo [0, 1] prima dell'addestramento. Il dataset viene poi organizzato abbinando i percorsi delle immagini con i relativi metadati, dopodiché viene separato in sottoinsiemi di addestramento e test per facilitare l'analisi delle prestazioni. Il dataset è stato suddiviso casualmente in set di addestramento e test utilizzando un rapporto di suddivisione 80:20. I record contenenti immagini complete e dati di metadati sono stati inclusi nell'analisi, mentre quelli incompleti o non validi sono stati esclusi. Durante la partizionazione del dataset veniva utilizzato un seed casuale fisso per garantire la riproducibilità. Il dataset fornisce una base dettagliata per l'analisi guidata dall'IA delle planimetrie residenziali. La combinazione di 2.640 immagini annotate e diversi attributi architettonici supporta la modellazione di regressione multioutput e consente l'integrazione dell'intelligenza spaziale con il processo decisionale di progettazione residenziale orientato alla sanità.