$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Diese Studie nutzte einen öffentlich zugänglichen Datensatz von der Kaggle-Plattform (Floor Plan Images and Their Details, verfügbar unter: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details; abgerufen am 16. April 2026). Es betraf weder menschliche Teilnehmer, Tiere noch personenbezogene Daten; Daher waren keine ethische Zustimmung und informierte Zustimmung erforderlich.
Dieses Protokoll bietet ein KI-gesteuertes Framework für die automatisierte Analyse von Wohnraumplanbildern mit Schwerpunkt auf räumlich bewusstem und gesundheitsorientiertem Design. Der vollständige experimentelle Arbeitsablauf ist in Abbildung 1 dargestellt. Das Protokoll ist darauf ausgelegt, die Lücke zwischen niedrigstufiger architektonischer Merkmalsvorhersage und hochrangiger anwendungsorientierter Entscheidungsfindung zu schließen. Es integriert DL, Ensemble-Modellierung und erklärbare KI, um eine genaue, robuste und interpretierbare Lösung für die Analyse von Wohnanlagen bereitzustellen. Das Framework besteht aus mehreren Phasen, beginnend mit Datenerfassung und Vorverarbeitung, gefolgt von Feature Learning mit tiefen CNNs, Meta-Ensemble-Vorhersage und schließlich der Klassifikation auf Anwendungsebene. Anfangs werden Grundrissbilder und ihre entsprechenden architektonischen Attribute durch Größenänderung, Normalisierung und Datenerweiterung vorbearbeitet, um Konsistenz zu gewährleisten und die Verallgemeinerung zu verbessern. Alle Grundrissbilder wurden auf 224 × 224 Pixel verkleinert und auf den Bereich [0, 1] normalisiert. Während des Trainings wurde Datenaugmentation durch zufälliges horizontales Flippen, Drehen, Zoomen und Breiten-/Höhenverschieben angewendet, um die Modellverallgemeinerung zu verbessern und Überanpassungen zu reduzieren. Es wurde kein vertikales Flipping angewendet. Vollständige Augmentationsparameter und Implementierungsdetails sind in Supplementary File 1 bereitgestellt. Die verarbeiteten Daten wurden dann verwendet, um mehrere DL-Modelle für die Feature-Extraktion und -Vorhersage zu trainieren. Alle Basismodelle und der CARE-MIRV-Net Meta-Learner wurden mit einer konsistenten Konfiguration trainiert, einschließlich Datenaugmentation, frühzeitigem Stoppen und adaptiver Lernrate-Planung. Frühes Stoppen überwachte den Validierungsverlust (val_loss) mit einem Geduldswert von 5 Epochen, und die besten Modellgewichte wurden nach dem Training automatisch wiederhergestellt. Adaptive Learning-Rate-Scheduling wurde mit dem ReduceLROnPlateau-Callback implementiert, der den Validierungsverlust überwachte und die Lernrate nach zwei Epochen ohne Verbesserung um den Faktor 0,3 reduzierte, mit einer Mindestlernrate von 1 × 10⁻7. Vollständige Implementierungsdetails und Parametereinstellungen sind in Supplementary File 1 bereitgestellt. Der Datensatz wurde zufällig in Trainings- und Testsets mit einem 80:20-Split-Verhältnis unterteilt. Ein fester zufälliger Seed (42) wurde verwendet, um die Reproduzierbarkeit sicherzustellen. Vollständige Implementierungsdetails finden Sie in Supplementary File 1.

Abbildung 1. Arbeitsablauf des CARE-MIRV-Net-Frameworks für die Analyse von Wohngrundrissen. Schematische Übersicht des vorgeschlagenen Protokolls. Der Workflow umfasst (1) Datensatzerfassung und -vorverarbeitung, (2) Feature-Learning und -Vorhersage mit MobileNetV2, InceptionV3, ResNet101 und VGG16, (3) stackingbasierte Meta-Ensemble-Vorhersage mit CARE-MIRV-Net, (4) regelbasierte Wohnraum-Klassifikation, (5) SHapley Additive ExPlanations (SHAP)-basierte Interpretierbarkeitsanalyse und (6) Leistungsbewertung. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
In der zweiten Phase werden vier vortrainierte CNNs, MobileNetV2, InceptionV3, ResNet101 und VGG16, als Basislernende eingesetzt. Jedes Modell wird mithilfe von Transfer Learning fein abgestimmt, um wichtige architektonische Eigenschaften wie Quadratmeter, Anzahl der Schlafzimmer, Badezimmer und Garagen vorherzusagen. Für jedes Transfer-Learning-Modell wurden die unteren vortrainierten Schichten eingefroren, während die oberen Schichten und der benutzerdefinierte Regressionskopf während des Trainings fein abgestimmt wurden. Detaillierte modellspezifische Feinabstimmungskonfigurationen sind in Supplementary File 1 bereitgestellt. Diese Modelle erfassen verschiedene Aspekte räumlicher Informationen: MobileNetV2 bietet eine effiziente Feature-Extraktion, InceptionV3 erfasst multiskalige räumliche Muster, ResNet101 lernt tiefe hierarchische Darstellungen, und VGG16 sorgt für stabiles und konsistentes Merkmalslernen. Die Vielfalt dieser Modelle verbessert die Gesamtrepräsentationsfähigkeit des Frameworks.
Um die Genauigkeit und Robustheit der Vorhersage weiter zu erhöhen, wird ein stapelbasiertes Meta-Ensemble-Modell vorgeschlagen, bezeichnet als CARE-MIRV-Net. In diesem Schritt werden Vorhersagen aus allen Basismodellen zusammengefasst, um einen höherdimensionalen Merkmalsraum zu erzeugen, der an einen Meta-Learner eingegeben wird. Basismodellvorhersagen werden zunächst unabhängig mit den trainierten Modellen MobileNetV2, InceptionV3, ResNet101 und VGG16 generiert. Diese Vorhersagen werden dann verkettet, um den Meta-Merkmalvektor zu bilden, den der Meta-Learner verwendet. Um Datenlecks zu verhindern, sind die Trainings- und Testdatensätze streng getrennt, und der Meta-Lerner wird nur auf Vorhersagen aus den Trainingsdaten trainiert. Das Metamodell, das ein vollständig verbundenes neuronales Netzwerk ist, wird darauf trainiert, die optimale Kombination der Basismodellausgaben zu lernen, um verfeinerte Vorhersagen zu liefern. Das Metamodell besteht aus zwei vollständig verbundenen Schichten mit 512 und 256 Neuronen, die ReLU-Aktivierung verwenden, gefolgt von Dropout-Schichten (0,4 und 0,3) und einer linearen Ausgangsschicht. Das Modell wird mit dem Adam-Optimierer trainiert (Lernrate = 0,0001), einer Batchgröße von 32 und bis zu 15 Epochen. Frühzeitiges Stoppen wurde durch Überwachung des Validierungsverlusts (val_loss) mit einem Geduldswert von 5 Epochen umgesetzt. Das Mindestverbesserungskriterium (min_delta) wurde auf den TensorFlow-Standardwert von 0 gesetzt, und die besten Modellgewichte wurden nach dem Training automatisch wiederhergestellt. Adaptive Learning-Rate-Scheduling wurde mithilfe des ReduceLROnPlateau-Callbacks implementiert, der den Validierungsverlust überwachte und die Lernrate nach zwei aufeinanderfolgenden Epochen ohne Verbesserung um den Faktor 0,3 senkte. Die minimale Lernrate wurde auf 1 × 10⁻7 gesetzt, und der Abklingzeitparameter verwendete den Standardwert von TensorFlow von 0. Diese Ensemble-Methode reduziert individuelle Modellverzerrungen und verbessert die Verallgemeinerung durch die komplementären Stärken mehrerer Architekturen. Detaillierte Implementierungsinformationen finden Sie in Supplementary File 1.
Nach der Vorhersage wird eine Interpretationsschicht hinzugefügt, um die numerischen Ausgaben in Anwendungsentscheidungen umzuwandeln. Wohngrundrisse lassen sich basierend auf den Vorhersagen architektonischer Merkmale in drei Klassen einteilen: Altenpflege, integrierte Gesundheitsversorgung (medizinische Versorgung) und allgemeine Wohnnutzung. Diese Klassifizierung erfolgt unter Verwendung vordefinierter, schwellenwertbasierter Entscheidungsregeln, die auf der vorhergesagten Quadratmeterzahl, der Anzahl der Schlafzimmer und der Anzahl der Badezimmer basieren. Die Kategorie mit der höchsten Punktzahl wird als endgültige Klassifikation zugewiesen, während Unentschieden durch die Auswahl der Kategorie entschieden wird, die die größere Anzahl von Entscheidungskriterien erfüllt. Die vollständigen Bewertungsregeln und Klassifikationsschwellenwerte sind in Supplementary File 2 (Algorithmus 1) bereitgestellt. Diese Maßnahme ermöglicht es dem Rahmenwerk, praktische Informationen für die Wohnungsbauplanung bereitzustellen.
Das Framework verwendet erklärbare KI mit SHAP, um Transparenz und Interpretierbarkeit zu gewährleisten. Diese Komponente untersucht den Beitrag der Vorhersagen jedes Basismodells zum Ergebnis des Metamodells. Die SHAP-Analyse wurde mit SHAP KernelExplainer (SHAP-Version 0.51.0) durchgeführt, wobei 100 zufällig ausgewählte Trainingsproben als Hintergrunddatensatz und 50 Testproben zur Erstellungsgenerierung verwendet wurden. Die vollständige SHAP-Konfiguration, einschließlich Hintergrund-Sample-Auswahl und Implementierungseinstellungen, ist in Supplementary File 1 bereitgestellt. Die Erklärbarkeitsschicht hilft, den Entscheidungsprozess zu verstehen, indem sie die Bedeutung von Features misst und Beitragsmuster darstellt, wodurch die Transparenz und Zuverlässigkeit des Modells verbessert werden. Der vorgeschlagene Rahmen wird mittels MAE und R2 über alle Zielvariablen hinweg ausgewertet. Für die Multioutput-Vorhersage wurde MAE als durchschnittliche absolute Differenz zwischen tatsächlichen und vorhergesagten Werten über alle Zielvariablen berechnet, während R2 durch Vergleich der erklärten Varianz der Vorhersagen mit den entsprechenden Grundwahrheitswerten für jede Ausgabe berechnet wurde. Die quantitativen und qualitativen Analysen zeigen, dass das vorgeschlagene CARE-MIRV-Net die Vorhersagegenauigkeit verbessert und regelbasierte Wohnraumklassifikation unterstützt. Die Klassifikationszuverlässigkeit wurde anhand der Genauigkeit der zugrunde liegenden Regressionsvorhersagen und der Konsistenz der regelbasierten Entscheidungsschicht bewertet. Das Framework ist eine geeignete und skalierbare Lösung für eine intelligente Grundrissanalyse und kann auf Smart Housing, Altenpflegeplanung und gesundheitsorientierte Wohnplanung angewendet werden. Eine vollständige Liste der in dieser Studie verwendeten Datensätze, Softwarepakete, Bibliotheken, Hardwareressourcen und Rechenwerkzeuge ist in der Materialtabelle enthalten. Quellcode, Umgebungskonfigurationsinformationen, Softwareabhängigkeitsspezifikationen und Implementierungsskripte, die zur Reproduktion des gemeldeten Workflows erforderlich sind, werden in Supplementary File 1 bereitgestellt.
Algorithmus für das Protokoll
Das vorgeschlagene Framework verfolgt einen mehrstufigen Ansatz zur Verarbeitung bildbasierter Grundrisse von Wohnhäusern und zur Erzeugung prädiktiver und entscheidungsbezogener Ausgaben, wie in Algorithmus 1 in Supplementary File 2 dargestellt. Dieser Prozess beginnt mit der Datenvorverarbeitung, bei der die Eingabebilder auf eine Standardauflösung angepasst und normalisiert werden, um Einheitlichkeit im gesamten Datensatz zu gewährleisten. Alle Grundrissbilder wurden auf 224 × 224 Pixel verkleinert und auf den Bereich [0, 1] normalisiert. Dieser Schritt optimiert die Bilder für das Lernen durch tiefe neuronale Netzwerke und verbessert die Gesamtkonvergenz des Modells. Die zweite Phase beinhaltet die Verwendung mehrerer DL-Modelle als Basislerner, darunter MobileNetV2, InceptionV3, ResNet101 und VGG16. Unabhängig davon nimmt jedes Modell die Eingabebilder und schätzt wichtige architektonische Merkmale wie Quadratmeterzahl sowie die Anzahl der Schlafzimmer, Badezimmer und Garagen. Der Datensatz wurde zufällig in Trainings- und Testsätze mit einem 80:20-Split-Verhältnis unterteilt, und ein fester zufälliger Seed wurde verwendet, um die Reproduzierbarkeit sicherzustellen. Diese Modelle erfassen verschiedene räumliche Eigenschaften der Grundrisse und liefern komplementäre Vorhersagen. Die Merkmalsrepräsentation wird dann konstruiert, indem die Ausgaben jedes Basismodells gestapelt werden, um eine einzige Merkmalsrepräsentation zu erzeugen. Diese gemeinsamen Ergebnisse werden anschließend in ein Meta-Ensemble-Modell namens CARE-MIRV-Net eingespeist, das trainiert wird, um die Vorhersagen aller Basismodelle zu kombinieren. Die Vorhersagen des Basismodells wurden unabhängig erzeugt und verkettet, um den Meta-Feature-Vektor zu bilden. Datenlecks wurden durch eine strikte Trennung der Trainings- und Testdatensätze verhindert. Das Metamodell verfeinert diese Vorhersagen und erstellt die endgültigen architektonischen Attributprognosen. Das Metamodell bestand aus vollständig verbundenen Schichten mit 512 und 256 Neuronen, ReLU-Aktivierungsfunktionen, Abbruchraten von 0,4 und 0,3, dem Adam-Optimierer (Lernrate = 0,0001), einer Batchgröße von 32 und bis zu 15 Trainingsphasen mit frühem Stopp. Nach der Vorhersage wird eine Entscheidungsschicht verwendet, um die Ergebnisse in den Kontext zu setzen. Nach den geschätzten Werten wird jede Wohnanlage als Altenpflege, medizinische Versorgung oder allgemeine Wohnnutzung kategorisiert. Wohnkategorien wurden anhand vordefinierter, schwellwertbasierter Bewertungsregeln vergeben, die aus den vorhergesagten Grundrissattributen abgeleitet wurden. Die Kategorie mit der höchsten Punktzahl wurde als Endklassifikation ausgewählt. Vollständige Klassifikationsschwellenwerte und Entscheidungsregeln sind im Algorithmus 1 (Supplementary File 2) bereitgestellt. Schließlich enthält das Framework eine Erklärbarkeitskomponente auf Basis von SHAP, um die Auswirkungen jedes Basismodells auf die endgültige Vorhersage zu bewerten. Die SHAP-Analyse wurde wie zuvor beschrieben und in Supplementary File 1 durchgeführt. Diese Komponente erhöht die Transparenz und hilft beim Verständnis des Entscheidungsprozesses. Die Wirksamkeit und Tragfähigkeit des vorgeschlagenen Ansatzes wurden anhand standardisierter Regressions-Leistungskennzahlen bewertet. Die Leistung wurde mit einem einzigen experimentellen Lauf mit einem festen Zufallsseed bewertet.
Bewertungsmodelle
In diesem Abschnitt werden die in der Studie verwendeten DL-Modelle vorgestellt, darunter sowohl die einzelnen Basismodelle als auch das vorgeschlagene CARE-MIRV-Net. Die Benchmark-Modelle wurden ausgewählt, um vielfältige und weit verbreitete DL-Architekturen zu repräsentieren. MobileNetV2 wurde als leichtes und recheneffizientes Netzwerk aufgenommen, und InceptionV3 wurde wegen seiner Fähigkeit, multiskalierte räumliche Merkmale zu erfassen, ausgewählt. ResNet101 wurde aufgrund seiner tiefen Restlernfähigkeit zur hierarchischen Feature-Extraktion gewählt, und VGG16 wurde als gut etablierte Faltungsarchitektur aufgenommen. Alle Benchmark-Modelle wurden mit identischen Vorverarbeitungsverfahren, Datenerweiterungseinstellungen, Datensatzpartitionen, Optimierungsparametern, Batchgröße und Trainingskonfiguration trainiert, um eine faire vergleichende Bewertung zu gewährleisten.
MobileNetV2:
MobileNetV2 ist ein kleines und kompaktes CNN-System, das darauf ausgelegt ist, schnell, leistungsstark und mit geringerer Rechenkomplexität zu sein. Es präsentiert einige der wichtigsten Innovationen wie invertierte Restverbindungen und lineare Engpässe, die eine effiziente Merkmalsextraktion ermöglichen und dennoch eine hohe Repräsentationskraft besitzen. MobileNetV2 kann tiefenseparaable Faltungen verwenden, um die Gesamtzahl der Parameter und die Rechenkosten traditioneller Faltungsnetze stark zu minimieren, und ist daher gut an große bildbasierte Lernprobleme angepasst.
MobileNetV2 wird im vorgeschlagenen Rahmen als eines der grundlegenden DL-Modelle verwendet, um die architektonischen Eigenschaften von Wohngrundrissbildern vorherzusagen. Das Modell kann räumliche Muster wie Raumverteilung, Grundrissdichte und strukturelle Organisation, die in Grundrissen auftreten, effektiv erlernen, dank seines effizienten Designs. Solche gelehrten Darstellungen spielen eine wichtige Rolle bei der genauen Schätzung wichtiger Merkmale wie Quadratmeterzahl, Anzahl der Schlafzimmer, Badezimmer und Garagen. MobileNetV2 ist ein leichtes Modell, das ein guter Kandidat für das vorgeschlagene Meta-Ensemble-Framework ist. Es fügt anderen DL-Modellen einige ergänzende Feature-Darstellungen hinzu und erhöht die Gesamtrobustheit und Verallgemeinerung des Systems. Dieses Modelllernen ist sehr wichtig, um die Genauigkeit von Vorhersagen zu verbessern und die Klassifizierung von Wohnanlagen auf Basis des Gesundheitswesens zu unterstützen.
Das MobileNetV2-Modell wird mit einer Transfer-Learning-Strategie mit vortrainierten Gewichten aus dem ImageNet-Datensatz trainiert. Die Eingabebilder werden auf eine feste Größe von 224 × 224 × 3 skaliert, was mit der Architektur kompatibel ist. Die Bilder wurden auf 224 × 224 Pixel verkleinert, auf den Bereich [0, 1] normalisiert und durch zufälliges Flippen, Drehen, Zoomen und Verschieben ergänzt. Während der Ausbildung wurde eine Chargengröße von 32 Personen verwendet. Der ursprüngliche Klassifikationskopf von MobileNetV2 wird entfernt und durch einen Regressionskopf ersetzt. Der Regressionskopf bestand aus einer Global Average Pooling-Schicht, gefolgt von vollständig verbundenen Schichten mit 512 und 256 Neuronen, Batch-Normalisierung, Dropout-Schichten (0,4 und 0,3) und einer linearen Ausgabeschicht mit vier Neuronen. Um die Domänenanpassung zu erleichtern, wurden die unteren vortrainierten Schichten eingefroren, während die oberen Schichten ab block_13_expand und dem benutzerdefinierten Regressionskopf fein abgestimmt wurden. Dieser selektive Trainingsansatz ermöglicht es dem Modell, allgemeine visuelle Merkmale beizubehalten und domänenspezifische räumliche Attribute von Grundrissbildern zu lernen. Die extrahierten Merkmalskarten werden über eine Global Average Pooling-Schicht und vollständig verbundene Schichten mit 512 und 256 Neuronen unter Verwendung von ReLU-Aktivierung verarbeitet. Um die Verallgemeinerung zu verbessern und Overfitting zu reduzieren, werden Batch-Normalisierungs- und Dropout-Schichten (0,4 und 0,3) integriert. Die letzte Ausgabeschicht enthält vier Neuronen mit linearer Aktivierung, die den vorhergesagten architektonischen Attributen entspricht. Der Adam-Optimierer wurde mit einer Lernrate von 0,0001 und den Standardparametern von TensorFlow/Keras verwendet (β₁ = 0,9, β₂ = 0,999, ε = 1 × 10⁻7, amsgrad = False). Für die Multioutput-Vorhersage wurden MAE und R2 berechnet, indem die vorhergesagten und tatsächlichen Werte für jede Zielvariable verglichen und anschließend die Ergebnisse über alle Ausgaben gemittelt wurden. Frühes Stoppen wurde auf Basis von Validierungsverlust angewendet, und adaptive Lernratenreduktion wurde eingesetzt, um die Konvergenz zu verbessern. Die Ausbildung erfolgte über bis zu 15 Epochen.
InceptionV3:
InceptionV3 ist eine tiefgründige CNN-Architektur, die in der Lage ist, Multiscale-Features mithilfe paralleler Faltungsoperationen zu erfassen. Es basiert auf dem Inception-Modul, das verschiedene Filtergrößen in derselben Schicht verwendet, um sowohl feinkörnige als auch grobe Merkmale gleichzeitig zu extrahieren. Diese Art von Architekturdesign ermöglicht es dem Netzwerk, komplexe räumliche Hierarchien zu erlernen und rechnerisch effizient zu sein. Darüber hinaus verwendet InceptionV3 faktorisierte Faltungen und Dimensionsreduktion, die die Leistung steigern und die Rechenkosten minimieren.
InceptionV3 wird im vorgeschlagenen Rahmen als effektiver Feature-Extractor zur Analyse von Wohngebäudegrundrissbildern eingesetzt. Grundrisse bestehen aus verschiedenen räumlichen Mustern, wie Raumgrößen, strukturellen Grundrissen und Konnektivität, was das Lernen von Merkmalen im Mehrmaßstab erfordert. Die Inception-Architektur eignet sich besonders gut für diese Aufgabe, da sie lokale Details (z. B. kleine Räume) und globale Strukturen (z. B. die Organisation des Gesamtlayouts) gleichzeitig darstellen kann. InceptionV3 bietet ergänzende Darstellungen zu anderen Modellen wie MobileNetV2 im Kontext des Meta-Ensemble-Frameworks. Die Vielfalt der Vorhersagen wird durch die Fähigkeit erhöht, komplexe räumliche Beziehungen zu modellieren, was wichtig ist, um die Ensembleleistung zu verbessern. Dies hilft schließlich bei der besseren Vorhersage architektonischer Merkmale und verstärkt die nachgelagerte Einordnung von älterenfreundlichem und im Gesundheitswesen integriertem Wohndesign.
Das InceptionV3-Modell wird mit einem Transfer-Learning-Ansatz mit vortrainierten Gewichten aus dem ImageNet-Datensatz trainiert. Die Eingabebilder werden auf 224 × 224 × 3 skaliert, um die Kompatibilität mit der Netzwerkarchitektur und Konsistenz über alle Modelle innerhalb des Frameworks zu gewährleisten. Die Bilder wurden auf 224 × 224 Pixel verkleinert, auf den Bereich [0, 1] normalisiert und durch zufälliges Flippen, Drehen, Zoomen und Verschieben ergänzt. Während der Ausbildung wurde eine Chargengröße von 32 Personen verwendet.
Die ursprünglichen Klassifikationsschichten von InceptionV3 werden entfernt, und ein benutzerdefinierter Regressionskopf wird eingeführt, um die Multioutput-Vorhersage zu ermöglichen. Der benutzerdefinierte Regressionskopf bestand aus einer Global Average Pooling-Schicht, gefolgt von vollständig verbundenen Schichten mit 512 und 256 Neuronen, Batch-Normalisierung, Dropout-Schichten (0,4 und 0,3) und einer vierneuronalen linearen Ausgangsschicht. Die konvolutionelle Basis ist teilweise fein abgestimmt, wobei die unteren vortrainierten Schichten eingefroren sind und die oberen Schichten zusammen mit dem benutzerdefinierten Regressionskopf fein abgestimmt werden, um domänenspezifische Grundrissmerkmale zu lernen, während allgemeine visuelle Darstellungen, die während dem Vortraining erworben wurden, erhalten bleiben. Nach dem Faltungsrückgrat transformiert eine Global Average Pooling-Schicht die Merkmalsabbildungen in eine kompakte Merkmalsrepräsentation. Darauf folgen vollständig verbundene Schichten mit 512 und 256 Neuronen mit ReLU-Aktivierungsfunktionen. Um Overfitting zu minimieren und die Verallgemeinerung zu verbessern, werden Abbruchraten von 0,4 und 0,3 angewendet. Die endgültige Ausgangsschicht besteht aus vier Neuronen mit linearer Aktivierung, die der Vorhersage von Quadratmeter, Anzahl der Schlafzimmer, Anzahl der Badezimmer und Anzahl der Garagen entspricht. Das Modell wird mit dem Adam-Optimierer trainiert, mit einer Lernrate von 0,0001, einer Batchgröße von 32 und bis zu 15 Trainingsepochen mit frühzeitigem Stopp und einer Reduktion der adaptiven Lernrate, um eine stabile Konvergenz sicherzustellen.
ResNet101:
ResNet101 ist eine tiefe Struktur des CNN, die auf dem Prinzip des Residuallernens aufgebaut ist und es ermöglicht, extrem tiefe Netzwerke zu trainieren, indem das Verschwindungsgradientenproblem überwunden wird. Es fügt Residualverbindungen hinzu, sogenannte Skip-Verbindungen, die es dem Netzwerk ermöglichen, Identitätsabbildungen zu lernen und Informationen über Schichten hinweg zu speichern. Diese Architektur verbessert die Stabilität des Trainings erheblich und ermöglicht es dem Modell, komplexe hierarchische Eigenschaften zu erlernen. ResNet101 verfügt über eine tiefe Repräsentationskapazität von 101 Schichten und ist daher sehr effektiv bei Aufgaben, die zusätzliche räumliche Merkmale erfordern.
ResNet101 wird im vorgeschlagenen Rahmen als Hochkapazitäts-Feature-Extractor verwendet, der die Bilder von Wohngrundrissen analysiert. Das Modell kann verwendet werden, um komplexe räumliche Beziehungen darzustellen, einschließlich Raumkonnektivität, Layoutkomplexität und strukturellen Variationen, aufgrund seiner tiefen Architektur. Diese Merkmale sind entscheidend, um genaue Vorhersagen zu architektonischen Merkmalen wie Quadratmetern, Schlafzimmern, Badezimmern und Garagen zu treffen. Im Meta-Ensemble-Design ist ResNet101 eine bedeutende Komponente und bietet tiefgründige sowie abstrakte Merkmalsrepräsentationen. ResNet101 legt mehr Wert auf feinkörnige strukturelle Merkmale und ist daher unter den Basislernern vielfältiger als leichte Modelle wie MobileNetV2. Diese Heterogenität spielt eine wesentliche Rolle bei der Verbesserung der Leistung eines Ensembles und robuster Vorhersagen, insbesondere bei der Behandlung der stationären Klassifikation im Gesundheitswesen.
ResNet101 wird mit einem Transfer-Learning-Ansatz mit vortrainierten Gewichten aus dem ImageNet-Datensatz trainiert. Die Eingabebilder werden auf 224 × 224 × 3 skaliert, was architektonische Kompatibilität und Konsistenz über alle Modelle innerhalb des Frameworks hinweg gewährleistet. Die Bilder wurden auf 224 × 224 Pixel verkleinert, auf den Bereich [0, 1] normalisiert und durch zufälliges Flippen, Drehen, Zoomen und Verschieben ergänzt. Während der Ausbildung wurde eine Chargengröße von 32 Personen verwendet. Der ursprüngliche Klassifikationskopf von ResNet101 wird entfernt (include_top=False), und ein eigener Regressionskopf wird eingeführt, um Multioutput-Vorhersagen zu ermöglichen. Der Regressionskopf bestand aus einer Global Average Pooling-Schicht, gefolgt von vollständig verbundenen Schichten mit 512 und 256 Neuronen, Batch-Normalisierung, Dropout-Schichten (0,4 und 0,3) und einer linearen Ausgabeschicht mit vier Neuronen. Um Feature-Wiederverwendung und Domänenanpassung auszugleichen, wurden die unteren vortrainierten Schichten eingefroren, während die tieferen Schichten ab conv4_block1_1_conv und dem benutzerdefinierten Regressionskopf fein abgestimmt wurden. Diese selektive Trainingsstrategie ermöglicht es dem Modell, generische visuelle Merkmale beizubehalten und gleichzeitig höherstufige Darstellungen an Grundrissbilder anzupassen. Die Ausgabe der Faltungsbasis wird durch eine Global Average Pooling-Schicht geleitet, um eine kompakte Merkmalsrepräsentation zu erzeugen. Darauf folgen vollständig verbundene Schichten mit 512 und 256 Neuronen, die ReLU-Aktivierungsfunktionen verwenden. Batch-Normalisierung wird angewendet, um das Lernen zu stabilisieren, und Dropout-Schichten mit Raten von 0,4 und 0,3 werden integriert, um Overfitting zu reduzieren und die Generalisierung zu verbessern. Die endgültige Ausgangsschicht enthält vier Neuronen mit linearer Aktivierung, die der Quadratmeterzahl, der Anzahl der Schlafzimmer, Badezimmer und Garagen entspricht. Der Adam-Optimierer wurde mit einer Lernrate von 0,0001 verwendet, wie in der Trainingskonfiguration beschrieben. Datenaugmentation umfasste zufälliges Umdrehen, Drehen, Zoomen und Verschieben, um die Modellverallgemeinerung zu verbessern. Das Training wurde bis zu 15 Epochen durchgeführt, mit frühzeitigem Abbruch aufgrund von Validierungsverlust und Reduktion der adaptiven Lernrate.
VGG16:
VGG16 ist eine einfache neuronale Netzwerkarchitektur vom Typ Deep Convolutional, die bei visuellen Erkennungsaufgaben effektiv und einfach ist. Es besteht aus 16 Schichten mit einem regulären oder homogenen Design, das kleine 3 × 3 Faltungsfilter umfasst, die das Erlernen hierarchischer Merkmalsrepräsentationen durch das Netzwerk erleichtern. Die Architektur ist tiefenorientiert und einfach, was bedeutet, dass sie in der Lage ist, niedrigstufige Details wie Kanten und Texturen sowie hochrangige semantische Strukturen einzufangen. VGG16, mit seinem regulären Design und seiner guten Leistung, ist heute eine beliebte Wahl als Backbone bei Transferlernen in bildbezogenen Aufgaben.
Im vorgeschlagenen Modell wird VGG16 als Basis-DL-Modell verwendet, um räumliche Merkmale von Bildern von Wohngrundrissen abzuleiten. Die Tatsache, dass es organisiert ist, macht es sehr nützlich, um die feinen Details von Layoutmustern wie Raumgrenzen, strukturelle Ausrichtungen und räumliche Organisation zu erfassen. Die Merkmale sind entscheidend, um die Eigenschaften von Architektur wie Quadratmeter, Schlafzimmer, Badezimmer und Garagen effektiv vorherzusagen. Im Meta-Ensemble-System bietet VGG16 stabile und gut verallgemeinerte Merkmalsrepräsentationen. VGG16 bietet einen ausgewogeneren Ansatz zur Feature-Extraktion im Vergleich zu tieferen Architekturen wie ResNet101 und Multiscale-Architekturen wie InceptionV3, was die Vielfalt der Basislerner erhöht. Diese Heterogenität ist entscheidend für die Verbesserung der Leistungsfähigkeit des Ensembles und zuverlässiger Vorhersagen der gesundheitsorientierten Wohnklassifikation.
Das VGG16-Modell wird mit einem Transfer-Learning-Ansatz mit vortrainierten Gewichten aus dem ImageNet-Datensatz trainiert. Die Eingabebilder werden auf 224 × 224 × 3 skaliert, um die Kompatibilität mit der Architektur und Konsistenz über alle Modelle innerhalb des Frameworks zu gewährleisten. Die Bilder wurden auf 224 × 224 Pixel verkleinert, auf den Bereich [0, 1] normalisiert und durch zufälliges Flippen, Drehen, Zoomen und Verschieben ergänzt. Während der Ausbildung wurde eine Chargengröße von 32 Personen verwendet. Die ursprünglichen Klassifikationsschichten werden entfernt (include_top=False), und ein benutzerdefinierter Regressionskopf wird hinzugefügt, um das Modell für die Multioutput-Vorhersage anzupassen. Der Regressionskopf bestand aus einer Global Average Pooling-Schicht, gefolgt von vollständig verbundenen Schichten mit 512 und 256 Neuronen, Batch-Normalisierung, Dropout-Schichten (0,4 und 0,3) und einer linearen Ausgabeschicht mit vier Neuronen. Die unteren vortrainierten Schichten waren eingefroren, während die Schichten ab block4_conv1 und der benutzerdefinierte Regressionskopf fein abgestimmt waren. Diese Strategie ermöglicht es dem Modell, allgemeine visuelle Merkmale beizubehalten, während es domänenspezifische Darstellungen lernt, die für die Grundrissanalyse relevant sind. Die Ausgabemerkmale der Faltungsbasis werden durch eine Global Average Pooling-Schicht geleitet, um einen kompakten Merkmalsvektor zu erzeugen. Darauf folgen vollständig verbundene Schichten mit 512 und 256 Neuronen, die ReLU-Aktivierungsfunktionen verwenden. Batch-Normalisierungs- und Dropout-Schichten mit Raten von 0,4 und 0,3 werden integriert, um das Training zu stabilisieren, Overfitting zu reduzieren und die Generalisierung zu verbessern. Die finale Ausgangsschicht enthält vier Neuronen mit linearer Aktivierung, die der Quadratmeterzahl, der Anzahl der Schlafzimmer, Badezimmer und Garagenprognosen entspricht. Der Adam-Optimierer wurde mit einer Lernrate von 0,0001 verwendet, wie in der Trainingskonfiguration beschrieben. Datenaugmentation umfasste zufälliges Umdrehen, Drehen, Zoomen und Verschieben, um die Modellverallgemeinerung zu verbessern. Das Training wurde bis zu 15 Epochen durchgeführt, mit frühzeitigem Abbruch aufgrund von Validierungsverlust und Reduktion der adaptiven Lernrate.
CARE-MIRV-Net (vorgeschlagenes Meta-Ensemble-DL-Modell):
Das vorgeschlagene CARE-MIRV-Net (Context-Aware Residential Ensemble using MobileNetV2, InceptionV3, ResNet101 und VGG16 Network) ist ein stapelbasiertes Meta-Ensemble-DL-Framework, das darauf abzielt, die Schätzung architektonischer Merkmale anhand von Wohngrundrissbildern zu verbessern. Die Architektur kombiniert verschiedene heterogene CNNs, indem sie deren synergetische Vorteile bei der Extraktion von Features ausnutzt. Das vorgeschlagene Modell basiert auf der Kombination aus leichter, tiefer und multiskaliger Architektur, die die Vorhersageleistung verbessert und Robustheit in einer Vielzahl von Wohnanlagen bietet. Im Gegensatz zu traditionellen, auf einem Modell basierenden Techniken folgt CARE-MIRV-Net einem hierarchischen Lernansatz, bei dem Basismodelle erste Vorhersagen liefern, die dann von einem Meta-Lernenden verbessert werden.
Wenn es um räumlich und gesundheitsbewusstes Wohndesign geht, ist die richtige Interpretation der Grundrisse von größter Bedeutung. Einzel-DL-Modelle sind meist unzureichend, um verschiedene architektonische Muster zu verallgemeinern. Das vorgeschlagene Framework wird diese Schwäche überwinden, indem es vier verschiedene Architekturen verwendet: MobileNetV2, InceptionV3, ResNet101 und VGG16, die jeweils unterschiedliche Repräsentationsfähigkeiten bieten. MobileNetV2 kann verwendet werden, um Funktionen effizient zu extrahieren, und ist leicht; InceptionV3 lernt räumliche Muster über mehrere Skalen hinweg; ResNet101 lernt tiefe hierarchische Darstellungen; und VGG16 lernt Funktionen zuverlässig und zuverlässig. Eine Kombination dieser Modelle ermöglicht es dem Rahmenwerk, sowohl lokale als auch globale räumliche Attribute zu berücksichtigen, was die Genauigkeit und Zuverlässigkeit der vorhergesagten Merkmale wie Quadratmeterzahl, Anzahl der Schlafzimmer, Badezimmer und Garagen erhöht. Die obigen Vorhersagen können auch zur weiteren Klassifizierung von Wohnanlagen verwendet werden, einschließlich älterenfreundlicher, gesundheitsintegrierter und allgemein wohnlicher Strukturen.
CARE-MIRV-Net wird mit einer zweistufigen, stapelbasierten Ensemble-Strategie implementiert. In der ersten Phase erzeugen die vier Basismodelle unabhängig voneinander Vorhersagen für die Zielvariablen. Meta-Learner-Eingaben wurden generiert, indem die von den trainierten Basismodellen erzeugten Vorhersageausgaben auf den Trainingsdaten verkettet wurden. Diese verketteten Vorhersagen bildeten die 16-dimensionalen Meta-Feature-Vektoren, die für das Metamodelltraining verwendet werden. Informationslecks wurden durch eine strikte Trennung der Trainings- und Testdatensätze verhindert, und während des Basismodell- oder Metamodelltrainings wurden keine Testproben verwendet. Die gleichen Trainings- und Validierungsdatensätze wie für die Basismodelle wurden während des Stapelungsprozesses verwendet. Während sowohl des Trainings als auch der Inferenz wurde der 16-dimensionale Meta-Feature-Vektor konstruiert, indem die vier von MobileNetV2, InceptionV3, ResNet101 und VGG16 erzeugten Vorhersageausgaben konstruiert wurden. Da jedes Modell einen vierdimensionalen Ausgabevektor erzeugt, erzeugt die verkettete Darstellung eine 16-dimensionale Eingabe für den Meta-Learner. Diese Transformation kombiniert die Vorhersagen aller Basismodelle und dient als Input für die zweite Stufe des Frameworks. Die zweite Phase besteht darin, einen vollständig verbundenen neuronalen Netzwerk-Meta-Lerner zu konstruieren, um die optimale Kombination von Basismodellvorhersagen zu erlernen. Der Meta-Learner bestand aus vollständig verbundenen Schichten mit 512 und 256 Neuronen, ReLU-Aktivierung, Batch-Normalisierung, Abbruchraten von 0,4 und 0,3 sowie einer linearen Ausgabeschicht mit vier Neuronen. Dropout-Schichten mit Raten von 0,4 und 0,3 wurden nach den dichten Schichten aufgetragen, um Überanpassung zu reduzieren und die Generalisierung zu verbessern. Das Metamodell wurde mit dem Adam-Optimierer trainiert, mit einer Lernrate von 0,0001, einer Batchgröße von 32 und bis zu 15 Epochen mit frühzeitigem Stopp und einer Reduktion der adaptiven Lernrate. Validierungsdaten wurden verwendet, um die Modellleistung während des Trainings zu überwachen und das leistungsstärkste Modell auszuwählen. Nach dem Training erzeugte das Meta-Ensemble-Modell endgültige Vorhersagen, indem es Ausgaben aller Basislernenden kombinierte. MAE und R2 wurden verwendet, um die Leistung von CARE-MIRV-Net zu bewerten. Für die Multioutput-Vorhersage wurden MAE und R2 berechnet, indem die vorhergesagten und tatsächlichen Werte für jede Zielvariable verglichen und anschließend die Ergebnisse über alle Ausgaben gemittelt wurden. Die Ergebnisse wurden aus einem einzigen experimentellen Lauf mit einem festen Zufallsseed gewonnen. Das vorgeschlagene Rahmenwerk verbessert die Prädiktionsfähigkeit, indem es mehrere DL-Strukturen durch einen Stapelmechanismus kombiniert und interpretierbare Analysen von Wohngrundrissen ermöglicht. Dadurch ist CARE-MIRV-Net im Kontext von geriatrie- und gesundheitsorientiertem Wohndesign anwendbar. Der Quellcode, die Umgebungskonfigurationsinformationen, die Softwareabhängigkeitsspezifikationen und die Implementierungsdokumentation sind in Supplementary File 1 bereitgestellt.
Leistungsbewertung
Die Leistungsanalyse des vorgeschlagenen Frameworks wird durchgeführt, um seine Prädiktionskraft, Robustheit und Verallgemeinerungsleistung über verschiedene architektonische Eigenschaften hinweg zu bestimmen. Quantitative und qualitative Analysen werden durchgeführt, um die Nützlichkeit des vorgeschlagenen Modells zu bestätigen. Das Bewertungsverfahren umfasst sowohl Standard-Regressionsmessungen als auch kontrollierte experimentelle Umgebungen, um einen fairen Vergleich mit den Basismodellen zu ermöglichen. Die Experimente wurden mit einem einzigen Versuch und einem festen Zufallsseed durchgeführt, um Reproduzierbarkeit und Konsistenz über alle Benchmark- und vorgeschlagenen Modelle hinweg sicherzustellen.
Leistungsparameter:
Zwei bekannte Regressionsmaße, MAE und R2, werden verwendet, um die Leistung des vorgeschlagenen Rahmens zu bewerten. MAE misst die durchschnittliche Größe der Vorhersagefehler und liefert eine klare Anzeige für die Nähe zwischen vorhergesagten und tatsächlichen Werten. Umgekehrt wird derR2-Wert verwendet, um den Anteil der Varianz in den vom Modell erklärten Zielvariablen zu beurteilen und seine Gesamtprädiktionskraft widerzuspiegeln. Eine Kombination dieser Kennzahlen liefert eine umfassende Bewertung der Genauigkeit und der Verallgemeinerungsleistung aller vorhergesagten architektonischen Merkmale. Für die Multioutput-Vorhersage wurden MAE und R2 berechnet, indem die vorhergesagten und tatsächlichen Werte für jede Zielvariable verglichen und anschließend die Ergebnisse über alle Ausgaben gemittelt wurden.
Experimentelle Einrichtung:
Die Experimente wurden in einer Cloud-Computing-Umgebung mit Python (Version 3.12.12) durchgeführt. Das vorgeschlagene Protokoll wurde mit TensorFlow (Version 2.19.0), Keras (Version 3.13.2), NumPy (Version 2.4.6), Pandas (Version 2.3.3), Scikit-learn (Version 1.6.1), Matplotlib (Version 3.9) und SHAP (Version 0.51.0) implementiert. Die Informatikumgebung nutzte einen Intel Xeon-Prozessor, der mit 2,20 GHz arbeitete und etwa 31 GB Systemspeicher hatte. Die Experimente wurden auf einem Ubuntu 22.04 LTS-Betriebssystem mit NVIDIA Tesla T4 × 2 GPUs durchgeführt. Der Datensatz enthält 2.640 Wohnungsgrundrissbilder, die vorverarbeitet und in Trainings- und Testdatensätze unterteilt wurden. Der Datensatz wurde mit einem Verhältnis von 80:20 geteilt, was zu 2.112 Trainingsproben und 528 Testproben führte. MobileNetV2, InceptionV3, ResNet101 und VGG16 sind vier DL-Modelle, die mit einem Feinabstimmungsansatz und Transfer Learning trainiert wurden. Ein stapelbasiertes Meta-Ensemble-Modell, CARE-MIRV-Net, wurde dann entwickelt, um Vorhersagen dieser Basismodelle zu kombinieren. Jedes Modell wurde unter einheitlichen Bedingungen trainiert, darunter Bildgröße auf 224 × 224 Pixel, Datenerweiterung und frühes Stoppen zur Reduzierung von Overfitting. Datenaugmentation umfasste zufälliges Umblättern, Drehen, Zoomen und Verschieben. Eine Batchgröße von 32 und maximal 15 Trainingsepochen wurden verwendet, wobei frühzeitiges Stoppen auf Basis von Validierungsverlust und Reduktion der adaptiven Lernrate basierte. Die Endanalyse wurde an einem versteckten Testsatz durchgeführt, um eine unparteiische und zuverlässige Leistungseinschätzung zu liefern. Der versteckte Testsatz wurde während der initialen Datensatz-Partitionierung erstellt und blieb während des gesamten Modelltrainings und der Entwicklung vollständig isoliert, um eine unvoreingenommene Leistungsbewertung zu gewährleisten.
Datensatzbeschreibung:
Der Datensatz, der die Ergebnisse dieser Studie unterstützt, ist öffentlich auf der Kaggle-Plattform unter dem Titel "Floor Plan Images and Their Details" verfügbar28. Der Datensatz ist verfügbar unter: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details (abgerufen am 16. April 2026). Die Daten bestehen aus 2.640 Wohngrundrissbildern und organisierten architektonischen Metadaten. Jede Probe ist ein eigenständiger Wohnplan, der eine große Auswahl an Wohngrundrissen mit unterschiedlichen Größen, Konfigurationen und räumlichen Anordnungen bietet. Die Datensatzgröße ist ausreichend für DL-basiertes Training und enthält eine Vielzahl architektonischer Muster. Der Datensatz besteht aus einem zweidimensionalen Grundriss und zugehörigen numerischen Merkmalen, die die strukturellen Eigenschaften des Wohnhauses beschreiben. Zu diesen Merkmalen gehören die Gesamtfläche, die Anzahl der Schlafzimmer, die Anzahl der Badezimmer und die Anzahl der Garagen. Außerdem enthält jeder Datensatz einen Bildpfad, der eine direkte Abbildung visueller Eingaben auf Labels ermöglicht. Zu den Variablen des Datensatzes gehören Grundrissbild, Bildpfad, Quadratmeterzahl, Anzahl der Schlafzimmer, Anzahl der Badezimmer und Anzahl der Garagen. Das Grundrissbild dient als Eingabefunktion, während die architektonischen Attribute als Vorhersageobjekte verwendet werden. Der Datensatz eignet sich daher für überwachtes Lernen, wobei Bilder als Eingabemerkmale und architektonische Attribute als Regressionsziele dienen.
Der Datensatz enthält eine große Vielfalt an Wohnanlagen, von kompakten Grundrissen mit weniger Räumen bis hin zu großen Mehrraum-Grundrissen. Diese Variabilität ermöglicht das Erlernen sinnvoller räumlicher Darstellungen, einschließlich Raumverteilung, Layoutdichte und struktureller Komplexität. Diese Vielfalt ist besonders wichtig für den vorgeschlagenen Rahmen, da er die Kategorisierung von Grundrissen in älterenfreundliche, gesundheitsbezogene und allgemeine Wohnanlagen unterstützt. Vor dem Modelltraining wird der Datensatz durch eine Abfolge von Vorverarbeitungsverfahren verarbeitet, um Konsistenz und Kompatibilität mit DL-Modellen sicherzustellen. Alle Bilder wurden vor dem Training auf 224 × 224 Pixel verkleinert und auf den Bereich [0, 1] normalisiert. Der Datensatz wird dann organisiert, indem Bildpfade mit den entsprechenden Metadaten abgeglichen werden, danach wird er in Trainings- und Testteilmengen unterteilt, um die Leistungsanalyse zu erleichtern. Der Datensatz wurde zufällig in Trainings- und Testsets mit einem 80:20-Split-Verhältnis unterteilt. Datensätze mit vollständigen Bild- und Metadateninformationen wurden in die Analyse einbezogen, während unvollständige oder ungültige Datensätze ausgeschlossen wurden. Ein fester zufälliger Seed wurde während der Datensatzpartitionierung verwendet, um die Reproduzierbarkeit sicherzustellen. Der Datensatz bietet eine detaillierte Grundlage für die KI-gesteuerte Analyse von Wohngrundrissen. Die Kombination aus 2.640 annotierten Bildern und vielfältigen architektonischen Merkmalen unterstützt Multioutput-Regressionsmodellierung und ermöglicht die Integration räumlicher Intelligenz mit gesundheitsorientierten Wohndesignentscheidungen.