研究文章

基于深度学习的住宅平面图属性预测,用于老年人住房评估

DOI:

10.3791/72157

2026年7月31日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议描述了一种用于自动分析住宅平面图图像的元集成深度学习工作流程。该过程包括数据集预处理、利用多卷积神经网络进行架构属性预测、基于堆叠的集合学习、基于规则的住宅分类,以及利用SHapley加法解释进行可解释性分析以支持住宅布局评估。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

老龄化人口对智能住房解决方案需求的增长,增加了住宅平面图分析自动化方法的需求。传统的建筑评估方法往往是手工完成的、耗时且难以扩展的,凸显了基于人工智能的技术需要能够解释空间布局并支持住宅设计评估。该协议描述了一个用于自动分析住宅平面图图像的元集合深度学习框架。拟议的CARE-MIRV-Net框架集成了四个互补卷积神经网络——MobileNetV2、InceptionV3、ResNet101和VGG16——用于预测建筑属性,包括面积、卧室数量、浴室和车库。基础模型的预测通过堆叠的元集合模型进行组合,随后在基于规则的决策层中用于将住宅布局分类为老年护理、医疗护理或一般住宅。实验评估显示,在多个目标变量上具有稳健的预测表现。该模型在平方英尺预测中实现了平均绝对误差(MAE)为432.48,确定系数(R2)为0.7053。在浴室预测方面,框架实现了R² 为0.7605,而车库预测的最低MAE为0.1697,最高的R² 为0.6958。定性分析进一步证明了该框架生成建筑属性预测和支持面向应用的住宅布局评估的能力。为提升透明度和可解释性,采用了SHapley加法解释,量化每个基模型对最终预测的贡献。该框架为住宅平面图分析和决策支持提供了可解释且可扩展的方法。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

智慧城市技术和智能生活环境的快速发展,推动了住宅设计中自动化和数据驱动解决方案的需求增长。特别是,人口老龄化的增加和对医疗导向住房的需求,凸显了设计既实用又符合特定用户群体需求的住宅空间的重要性 1,2。传统的建筑平面图分析方法通常手工完成,耗时且依赖专家解读;因此,它们效率低下且难以扩展。这带来了对智能系统自动分析住宅布局和支持明智决策的强烈需求。

人工智能(AI)的最新进展,尤其是在深度学习(DL)和计算机视觉领域,显著提升了基于图像数据的分析能力。卷积神经网络(CNN)已被证明在空间特征提取和复杂视觉模式学习方面非常有效,使其适合进行平面图图像分析 4,5,6。这些模型可以学习房间结构、布局组织和空间关系的隐式表示,这些对于预测建筑属性至关重要 7,8。然而,依赖单一DL模型可能限制泛化,因为不同架构可能关注不同的空间特征,并表现出因架构变异而产生的偏见。尽管取得了这些进步,现有方法往往缺乏一个集成框架,既能结合多个模型,支持多输出预测,也缺乏应用层级的可解释性。此外,面向医疗的住宅评估和可解释性在平面图分析系统中关注相对有限。缺乏此类综合框架限制了实际适用性和解释性,尤其是在那些重视透明度和决策支持的领域 10,11,12。

人工智能还为建筑平面图的自动化分析和生成做出了重要贡献。一项研究探讨了利用机器学习将二维平面图图像转换为三维模型的应用。作者强调了传统计算机辅助设计(CAD)方法的局限性,并强调了可扩展的人工智能管道在空间理解中的重要性。他们的发现表明,DL能够有效从平面图中提取结构信息,尽管泛化和数据变异性方面仍存在挑战。另一项研究提出了一个多智能体深度强化学习框架,用于自动生成平面图14。尽管该方法为建筑设计提供了相当的灵活性和定制性,但主要侧重于设计生成,而非对现有平面图进行预测分析。

一项全面的平面图检索调查考察了语义、空间、基于形状和质感的特征,以理解平面图15。调查强调了DL模型(包括卷积神经网络和基于变换器的架构)在学习有意义表示中的重要性。然而,它也指出了复杂布局中噪声、失真和特征辨别相关的挑战。同样,基于机器学习的方法也结合了拓扑和视觉关系来识别平面图8。该研究表明,视觉可及性和空间连接性对于理解建筑布局至关重要,但未涉及多输出预测或集合学习策略。生成式人工智能也被在建筑应用中探索。关于建筑中生成式人工智能的综述考察了生成式对抗网络(GAN)、变分自编码器(VAEs)和扩散模型在设计自动化中的应用16。作者强调了AI工具在实际架构工作流程中的日益普及。然而,这项工作的重点是设计生成,而非预测建模或决策支持应用。可解释人工智能在解读DL模型中变得越来越重要。一项研究提出了基于SHapley加法解释(SHAP)的框架,用于解释城市仿真应用中的DL模型。结果表明,SHAP能够识别有影响力的特征,并在全球和本地层面提升可解释性。尽管该研究支持 SHAP 在空间应用中的价值,但未探讨其与集合学习框架的整合。DL架构的最新发展进一步提升了基于图像任务的性能。一项研究对当代深度学习模型进行了全面综述,包括基于卷积神经网络(CNN)和基于变压器的架构(18)。研究强调了模型选择和混合架构在提升泛化性能方面的重要性。然而,它并未具体涉及平面图分析的应用。大规模数据集也促进了架构分析的进步。例如,一项研究引入了一个包含数千个复杂平面图的基准数据集19。研究表明,现有模型在分析大规模和多户公寓布局时仍面临挑战,凸显了更稳健且可推广的方法的必要性。

DL在群体学习中也被广泛研究。一项关于深度集合方法的最新研究表明,结合多个模型可以通过减少偏差和方差显著提升预测准确性和鲁棒性20。尽管这些方法有效,但这些方法尚未被广泛应用于建筑平面图分析,尤其是在多输出回归任务中。此外,近期关于自动平面图分析的研究强调了结合预测、分类和可解释性集成框架的重要性 21,22,23。现有研究通常聚焦于个别功能,如特征提取、布局生成或分类。因此,在开发整合多模型学习、住宅布局评估和可解释人工智能的统一框架方面,仍存在明显的研究空白。尽管深度学习和架构分析取得了相当大的进展,但仍存在若干研究空白。大多数现有研究专注于平面图识别、特征提取或布局生成,未能提供支持多输出预测和应用级决策的统一框架。此外,许多方法依赖单一的DL模型,这可能限制其捕捉多样空间特征的能力,并可能引入模型特有的偏见。集成学习用于平面图分析的应用仍然相对不足,尤其是在异构模型整合以提高鲁棒性的方面。此外,对住宅分类的关注有限,重点关注老年人住房的考虑和可解释性。由于许多DL模型具有黑箱功能,理解其预测基础仍然具有挑战性。这些局限凸显了整合多模型学习、精准预测、面向应用的住宅分类和可解释人工智能的综合框架的必要性。

本研究提出了一个自动化的住宅平面图分析框架,重点关注空间感知和住宅布局评估,以应对这些挑战。该框架引入了一个元集合DL模型CARE-MIRV-Net,将四个互补的CNN——MobileNetV2、InceptionV3、ResNet101和VGG16——集成在基于堆叠的架构24252627中。每个模型独立预测关键建筑属性,包括面积、卧室数量、浴室和车库。这些预测随后由元学习器组合,生成精细预测。此外,基于规则的决策层用于根据预测属性将住宅布局分类为老年护理、医疗护理或一般住宅。

本研究的贡献如下。首先,提出了一个元集合DL框架,用于从住宅平面图图像中多输出预测建筑属性。其次,CARE-MIRV-Net模型整合了四种CNN架构,以提高预测准确性和泛化性。第三,基于规则的决策层被纳入,支持基于预测建筑属性的应用导向住宅布局分类。第四,集成基于SHAP的可解释人工智能,以提升模型透明度和可解释性。最后,通过使用平均绝对误差(MAE)和确定系数(R2)作为性能指标,进行了大量实验以评估所提出的框架。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究使用了Kaggle平台公开的数据集(Floor Plan Images and Their Details,访问日期:https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details;访问日期:2026年4月16日)。它不涉及人类参与者、动物或可识别个人的数据;因此,无需伦理批准和知情同意。

该协议提出了一个由人工智能驱动的住宅平面图自动分析框架,重点关注空间感知和面向医疗的设计。完整的实验工作流程如 图1所示。该协议旨在弥合低层架构特征预测与高层面向应用决策之间的鸿沟。它集成了深度学习、集合建模和可解释的人工智能,为分析住宅布局提供了准确、稳健且可解释的解决方案。该框架包含多个阶段,首先是数据采集和预处理,随后是利用深度卷积神经网络进行特征学习、元集合预测,最后是应用级分类。最初,楼层平面图图像及其对应的建筑属性会通过调整尺寸、归一化和数据增强进行预处理,以确保一致性并提升泛化性。所有平面图图像均被重新调整为224×224像素,并归一化至[0, 1]范围。训练过程中采用随机水平翻转、旋转、缩放和宽高移动等数据增强,以提升模型泛化并减少过拟合。没有垂直翻转。完整的增强参数和实现细节见补充文件1。处理后的数据随后用于训练多个DL模型,用于特征提取和预测。所有基础模型和CARE-MIRV-Net元学习器均采用一致配置训练,包括数据增强、提前停止和自适应学习率调度。早期停止监测的验证损失(val_loss),耐心值为5个历时,最佳模型权重在训练后自动恢复。自适应学习率调度采用ReduceLROnPlateau回调实现,该回调监控验证丢失,并在2个无改善的时代后将学习率降低0.3倍,最低学习率为1×10⁻7。完整的实现细节和参数设置见补充文件1。数据集被随机分为训练组和测试组,采用80:20的比例分配。使用固定随机种子(42)以确保可重复性。完整的实现细节见 补充文件1

figure-protocol-1
图1。CARE-MIRV-Net 框架用于住宅平面图分析的工作流程。 拟议方案的示意概述。工作流程包括:(1)数据集获取与预处理,(2)使用MobileNetV2、InceptionV3、ResNet101和VGG16进行特征学习与预测,(3)基于堆叠的CARE-MIRV-Net元集合预测,(4)基于规则的住宅布局分类,(5)基于SHapley的加法扩展分析(SHAP),以及(6)性能评估。 请点击此处查看该图的放大版本。

第二阶段,四个预训练的CNNs——MobileNetV2、InceptionV3、ResNet101和VGG16——作为基础学习器。每个模型都通过迁移学习进行微调,预测关键建筑属性,包括面积、卧室数量、浴室和车库。对于每个迁移学习模型,较低的预训练层保持冻结,而上层和自定义回归头在训练过程中进行微调。详细的模型特定微调配置见 补充文件1。这些模型捕捉空间信息的不同方面:MobileNetV2 提供高效的特征提取,InceptionV3 捕捉多尺度空间模式,ResNet101 学习深度层次表示,VGG16 确保特征学习的稳定和一致。这些模型之间的多样性增强了框架的整体表征能力。

为进一步提升预测的准确性和稳健性,提出了一种基于堆叠的元集合模型,称为CARE-MIRV-Net。在此阶段,所有基础模型的预测被汇总,生成一个更高维特征空间,并输入给元学习器。基础模型预测首先独立生成,使用训练好的MobileNetV2、InceptionV3、ResNet101和VGG16模型。这些预测随后被串联起来,形成元学习者使用的元特征向量。为防止数据泄露,训练数据集和测试数据集严格分离,元学习器仅基于训练数据生成的预测进行训练。元模型是一个全连接的神经网络,经过训练以学习基础模型输出的最佳组合,以产生精细预测。元模型由两层全连接层组成,分别有512和256个神经元,使用ReLU激活,随后是退出层(0.4和0.3)和线性输出层。该模型使用Adam优化器训练(学习率=0.0001),批处理量为32,最多可达15个历时。早期停止通过监控验证丢失(val_loss)实现,耐心值为5个历时。最小改进标准(min_delta)设为TensorFlow默认值0,最佳模型权重在训练后自动恢复。自适应学习率调度采用ReduceLROnPlateau回调,该回调监控验证丢失,并在连续两个无改善时期后将学习率降低0.3倍。最低学习率设置为1×10⁻7,冷却参数使用默认的张量流值0。这种集合方法通过多种架构的互补优势减少了个体模型偏差,并提升了泛化性。详细的实现信息见 补充文件1

预测后,会添加解释层,将数值输出转换为应用层决策。根据建筑特性的预测,住宅布局可分为三类:老年护理、医疗综合(医疗护理)和一般住宅用途。这种分类是基于预测面积、卧室数量和浴室数量的预设阈值决策规则进行的。得分最高的类别作为最终分类,平局则通过选择满足更多决策标准的类别来决定。完整的评分规则和分类阈值见 补充文件2算法1)。这一举措使该框架能够为住宅设计提供实用信息。

该框架使用可解释的人工智能和SHAP,提供透明度和可解释性。本部分考察每个基模型预测对元模型输出的贡献。SHAP分析使用SHAP KernelExplainer(SHAP版本0.51.0)进行,背景数据集为100个随机选取的训练样本,50个测试样本用于解释生成。完整的SHAP配置,包括背景样本选择和实现设置,均见 补充文件1。可解释层通过测量特征重要性和展示贡献模式,有助于理解决策过程,从而提升模型的透明度和可靠性。该框架采用MAE和R2 对所有目标变量进行评估。对于多输出预测,MAE计算为所有目标变量实际值与预测值的平均绝对差值,而R2 则通过比较预测的解释方差与每个输出对应的真实值计算得出。定量和定性分析表明,所提议的CARE-MIRV-Net提高了预测准确性,并支持基于规则的住宅布局分类。分类可靠性基于底层回归预测的准确性和基于规则的决策层的一致性进行评估。该框架是智能平面图分析的合适且可扩展的解决方案,可应用于智能住房、老年护理规划及面向医疗的住宅设计。本研究中使用的数据集、软件包、库、硬件资源和计算工具的完整列表见 材料表。源代码、环境配置信息、软件依赖规范以及复现报告工作流所需的实现脚本均在 补充文件1中提供。

协议算法

该框架采用多阶段方法处理基于图像的住宅户型图,并产生预测性和决策级输出,详见补充文件2中的算法1。该过程始于数据预处理,输入图像被调整为标准分辨率并归一化,以确保数据集的一致性。所有平面图图像均被重新调整为224×224像素,并归一化至[0, 1]范围。这一步优化了图像以便深度神经网络学习,并增强了整体模型的收敛性。第二阶段涉及使用多个学习模型作为基础学习器,包括MobileNetV2、InceptionV3、ResNet101和VGG16。每个模型独立地根据输入图像估算重要的建筑特征,如面积以及卧室、浴室和车库的数量。数据集被随机分为训练集和测试集,采用80:20的比例,并使用固定的随机种子以确保可重复性。这些模型捕捉了平面图的不同空间属性,并提供互补的预测。然后通过堆叠每个基础模型的输出来构建特征表示,创建一个单一的特征表示。这些联合输出随后被输入到一个元集合模型CARE-MIRV-Net中,该模型被训练为将所有基模型的预测合并。基础模型预测独立生成并串接形成元特征向量。通过严格分离训练和测试数据集,防止了数据泄露。元模型对这些预测进行细化,并生成最终的架构属性预测。元模型由全连接层组成,包含512和256个神经元,ReLU激活函数,中途退出率分别为0.4和0.3,Adam优化器(学习率=0.0001),批次规模为32个,以及最多15个训练阶段,且有早期停止。预测后,会使用决策层来为结果提供上下文。根据估算值,每种住宅布局被归类为老年护理、医疗护理或一般住宅用途。住宅类别使用预定义的基于阈值的评分规则,这些评分规则基于预测的户型图属性。最终选出得分最高的类别作为最终排名。完整的分类阈值和决策规则见算法1补充文件2)。最后,该框架包含基于SHAP的可解释性组件,以评估每个基模型对最终预测的影响。SHAP分析按照前述及补充文件1中所述进行。这一部分提高了透明度,有助于理解决策过程。采用标准回归性能指标评估了该方法的有效性和可行性。性能通过一次实验运行和固定随机种子进行评估。

评估模型

本节介绍了本研究中使用的DL模型,包括个体基础模型和提出的CARE-MIRV-Net。基准模型被选中代表多样化且广泛采用的深度学习架构。MobileNetV2被纳入为一个轻量级且计算高效的网络,InceptionV3因其捕捉多尺度空间特征的能力而被选中。选择ResNet101因其深度残差学习能力,用于层级特征提取,VGG16则作为成熟的卷积架构被纳入其中。所有基准模型均采用相同的预处理程序、数据增强设置、数据集分区、优化参数、批次大小和训练配置进行训练,以确保公平的比较评估。

MobileNetV2:

MobileNetV2 是一种小型紧凑的卷积神经网络系统,设计得更快、高性能且计算复杂度更低。它展示了一些主要创新,如倒残差联络和线性瓶颈,这些技术有助于高效地提取特征,同时仍具备较高的表示能力。MobileNetV2 可以利用深度可分卷积,大幅减少传统卷积网络的参数总数和计算成本,因此非常适合大型基于图像的学习问题。

MobileNetV2 作为预测住宅平面图图像建筑属性的基础 DL 模型之一。该模型能够有效学习空间分布、布局密度和结构组织等空间模式,这些都得益于其高效的设计。这些学习得出的表示在准确估算面积、卧室数量、浴室和车库等重要特征方面起着重要作用。MobileNetV2 是一个轻量级模型,是纳入拟议元集合框架的良好候选方案。它为其他DL模型增加了一些互补的特征表示,并增强了系统的整体稳健性和泛化性。这种模型学习对于提高预测准确性以及协助基于医疗分类住宅设计非常重要。

MobileNetV2模型采用迁移学习策略,使用ImageNet数据集中的预训练权重进行训练。输入图像被缩放为固定大小,224×224×3,这与该架构兼容。图像被重新调整为224×224像素,归一化至[0, 1]范围,并通过随机翻转、旋转、缩放和移动进行增强。培训期间使用了32人批次规模。MobileNetV2的初始分类头被移除,取而代之的是回归头。回归首由全局平均池层组成,随后是包含512和256个神经元的全连通层,批次归一化,丢弃层(0.4和0.3),以及一个四神经元线性输出层。为便于域适应,较低的预训练层被冻结,而从block_13_expand开始的上层和自定义回归首部则被微调。这种选择性训练方法使模型在学习户型图图像中特定领域的空间属性的同时,能够保留一般的视觉特征。提取的特征图通过全局平均池图层和包含512和256神经元的全连通层,利用ReLU激活处理。为增强泛化并减少过拟合,采用了批量归一化和中落层(0.4和0.3)。最终输出层包含四个神经元,具有线性激活,对应预测的架构属性。Adam 优化器采用 0.0001 学习率,默认参数为 TensorFlow/Keras (β₁ = 0.9,β₂ = 0.999,ε = 1 × 10⁻7,amsgrad = False)。对于多输出预测,MAE和R2通过比较每个目标变量的预测值和实际值,然后对所有输出结果进行平均来计算。基于验证丢失,采用早期停止,采用自适应学习率降低以改善收敛性。训练时间长达15个时代。

InceptionV3:

InceptionV3 是一种深度卷积网络架构,能够通过并行卷积运算捕捉多尺度特征。它基于 Inception 模块,该模块在同一层中使用多种滤波器尺寸,同时提取细粒度和粗粒度特征。这种架构设计使网络能够学习复杂的空间层级结构,并实现计算效率。此外,InceptionV3还使用分解卷积和降维,提升性能并降低计算成本。

InceptionV3被应用于拟建框架中,作为分析住宅平面图图像的有效特征提取器。平面图包含多种空间模式,如房间大小、结构平面和连接性,因此需要多尺度特征学习。盗梦空间架构尤其适合此任务,因为它能够同时表示局部细节(例如小房间)和整体结构(例如整体布局的组织)。InceptionV3 在元集合框架框架中,为 MobileNetV2 等其他模型提供了互补的表示。预测的多样性因其建模复杂空间关系的能力而提升,这对提升集合性能非常重要。这最终有助于更好地预测建筑特征,并强化对老年人友好型和医疗整合住房设计的后续分类。

InceptionV3模型采用迁移学习方法训练,使用ImageNet数据集中的预训练权重。输入图像被缩放为224×224×3,以确保与网络架构的兼容性以及框架内所有模型的一致性。图像被重新调整为224×224像素,归一化至[0, 1]范围,并通过随机翻转、旋转、缩放和移动进行增强。培训期间使用了32人批次规模。

InceptionV3 的原始分类层被移除,并引入了自定义回归头以实现多输出预测。自定义回归头由全局平均池化层组成,随后是包含512和256个神经元的全连接层、批次归一化、丢弃层(0.4和0.3)以及一个四神经元线性输出层。卷积基础部分微调,底层预训练层冻结,上层及自定义回归头经过微调,学习领域特定的平面图特征,同时保留预训练时获得的一般视觉表现。卷积骨干之后,全局平均池化层将特征映射转换为紧凑的特征表示。随后是包含512和256个神经元的完全连接层,具有ReLU激活功能。为了减少过拟合并改善泛化,应用了0.4和0.3的脱落率。最终输出层由四个神经元组成,线性激活对应于平方英尺数、卧室数、浴室数和车库数预测。该模型使用Adam优化器训练,学习率为0.0001,批次大小为32,最多可进行15个训练周期,并采用早期停止和自适应学习率降低,以确保收敛的稳定。

ResNet101:

ResNet101是CNN的一个深度结构,基于残差学习原理构建,使得通过克服消失梯度问题来训练极深网络成为可能。它增加了残差连接,或称为跳跃连接,使网络能够学习身份映射并保留跨层信息。这种架构大大增强了训练的稳定性,使模型能够学习复杂的层级特征。ResNet101具有101层的深度表示能力,因此在需要额外空间特征的任务中非常有效。

ResNet101将作为高容量特征提取器用于拟建框架,分析住宅平面图图像。由于其深厚的建筑结构,该模型可用于表示复杂的空间关系,包括房间连通性、布局复杂性和结构变化。这些特征对于精确预测建筑面积、卧室、浴室和车库等至关重要。在元集合设计中,ResNet101 是一个重要组成部分,提供深度且抽象的特征表示。ResNet101更关注细粒度结构特征,因此与MobileNetV2等轻量级模型相比,基础学习者的多样性更高。这种异质性在提升集合性能和稳健预测方面起着关键作用,尤其是在处理基于医疗的住宅分类时。

ResNet101 采用迁移学习方法,利用 ImageNet 数据集中的预训练权重进行训练。输入图像被缩放为224×224×3,确保框架内所有模型的架构兼容性和一致性。图像被重新调整为224×224像素,归一化至[0, 1]范围,并通过随机翻转、旋转、缩放和移动进行增强。培训期间使用了32人批次规模。ResNet101的原始分类头被移除(include_top=False),并引入了自定义回归头以实现多输出预测。回归首由全局平均池层组成,随后是包含512和256个神经元的全连通层,批次归一化,丢弃层(0.4和0.3),以及一个四神经元线性输出层。为了平衡特征重用和域适应,较低的预训练层被冻结,而从conv4_block1_1_conv开始的深层和自定义回归头则被微调。这种选择性训练策略使模型能够保留通用的视觉特征,同时将高层表示调整到平面图图像中。卷积基的输出会通过全局平均池层,生成一个紧凑的特征表示。随后是全连通层,包含512和256个神经元,使用ReLU激活函数。应用批次归一化以稳定学习,并加入了速率为0.4和0.3的退出层以减少过拟合并提升泛化。最终输出层包含四个神经元,线性激活对应面积、卧室数量、浴室和车库数量。Adam优化器以0.0001的学习率使用,如训练配置所述。数据补充包括随机翻转、旋转、缩放和移位,以提升模型泛化。训练持续了长达15个时代,基于验证丢失和自适应学习率降低而提前停止。

VGG16:

VGG16 是一种简单的深度卷积型神经网络架构,在视觉识别任务中既有效又简单。它由16层组成,采用规则或齐次设计,包含3个×3个卷积滤波器,便于网络学习层级特征表示。该架构注重深度且结构简洁,能够捕捉底层细节,如边缘、纹理以及高层语义结构。VGG16凭借其常规设计和良好的性能,现已成为图像相关任务中迁移学习的热门骨干选择。

在建议模型中,VGG16 作为基线 DL 模型,用于推导住宅平面图图像的空间特征。其有序性使其在捕捉布局模式的细节上非常有用,如房间边界、结构对齐和空间组织。这些特征对于有效预测建筑的特征(如平方英尺、卧室、浴室和车库)至关重要。在元集合系统中,VGG16 提供了稳定且广义化的特征表示。与更深层架构(如 ResNet101)和多尺度架构(如 InceptionV3)相比,VGG16 提供了更平衡的特征提取方法,提高了基础学习者的多样性。这种异质性对于提升整体性能和可靠预测的医疗导向住宅分类至关重要。

VGG16模型采用迁移学习方法训练,使用ImageNet数据集中的预训练权重。输入图像被缩放为224×224×3,以确保与架构的兼容性以及框架内所有模型的一致性。图像被重新调整为224×224像素,归一化至[0, 1]范围,并通过随机翻转、旋转、缩放和移动进行增强。培训期间使用了32人批次规模。原始分类层被移除(include_top=False),并添加自定义回归头以适应多输出预测。回归首由全局平均池层组成,随后是包含512和256个神经元的全连通层,批次归一化,丢弃层(0.4和0.3),以及一个四神经元线性输出层。较低的预训练层被冻结,而从block4_conv1开始的层和自定义回归头则被微调。该策略使模型在学习与平面图分析相关的领域特定表示的同时,能够保留一般的视觉特征。卷积基的输出特征通过全局平均池层,生成一个紧致特征向量。随后是全连通层,包含512和256个神经元,使用ReLU激活函数。采用了0.4和0.3速率的批次归一化和丢弃层,以稳定训练、减少过拟合并提升泛化。最终输出层包含四个神经元,其线性激活对应于面积、卧室数量、浴室数量和车库预测。Adam优化器以0.0001的学习率使用,如训练配置所述。数据补充包括随机翻转、旋转、缩放和移位,以提升模型泛化。训练持续了长达15个时代,基于验证丢失和自适应学习率降低而提前停止。

CARE-MIRV-Net(拟议的元集合DL模型):

建议的CARE-MIRV-Net(利用MobileNetV2、InceptionV3、ResNet101和VGG16网络的上下文感知住宅集合)是一个基于堆叠的元集合DL框架,旨在基于住宅平面图图像改进建筑特征的估计。该架构通过利用多种异构CNN在特征提取上的协同优势结合起来。该模型基于轻量化、深度和多尺度建筑的结合,提升了预测性能,并在多种住宅布局中提供稳健性。与传统的单模型技术不同,CARE-MIRV-Net采用分层学习方法,基础模型提供初始预测,随后由元学习者进行改进。

在注重空间感和健康的住宅设计中,正确解读平面布局至关重要。单一DL模型往往不足以推广不同的架构模式。所提框架将通过使用四种不同的架构:MobileNetV2、InceptionV3、ResNet101 和 VGG16,来克服这一弱点,这些架构各自带来了不同的表示能力。MobileNetV2 可用于高效提取特征,且体积轻便;InceptionV3 学习跨多个尺度的空间模式;ResNet101学习深度层级表示;VGG16能够持续且可靠地学习特征。这些模型的结合使框架能够兼顾本地和全球空间属性,从而提升了预测特征(如面积、卧室数量、浴室和车库)的准确性和可靠性。上述预测也可用于进一步分类住宅布局,包括老年人友好型、医疗整合型和综合型住宅。

CARE-MIRV-Net 采用两阶段叠加式集合策略实现。在第一阶段,四个基础模型独立生成目标变量的预测。元学习者输入是通过将训练基础模型在训练数据上产生的预测输出串接生成的。这些串联的预测构成了用于元模型训练的16维元特征矢量。通过严格分离训练和测试数据集,防止了信息泄露,且在基础模型和元模型训练过程中均未使用测试样本。堆叠过程中使用了与基础模型相同的训练和验证数据集。在训练和推断过程中,16维元特征向量是通过将MobileNetV2、InceptionV3、ResNet101和VGG16产生的四个预测输出串联而构建的。由于每个模型生成一个四维输出矢量,连接后的表示会向元学习器输出16维输入。该转换结合了所有基础模型的预测,作为框架第二阶段的输入。第二阶段是构建一个完全连接的神经网络元学习器,以学习最优的基础模型预测组合。元学习器由完全连接的层组成,包含512和256个神经元,ReLU激活,批次归一化,退出率为0.4和0.3,以及一个四神经元的线性输出层。在稠密层之后,应用了速率为0.4和0.3的dropout层,以减少过拟合并提升泛化。该元模型使用Adam优化器训练,学习率为0.0001,批次规模为32,且可支持多达15个历期,带早期停止和自适应学习率降低。验证数据用于监测模型在训练期间的性能并选择表现最佳的模型。训练后,元集合模型通过将所有基础学习者的输出合并生成最终预测。MAE和R2用于评估CARE-MIRV-Net的性能。对于多输出预测,MAE和R2 通过比较每个目标变量的预测值和实际值,然后对所有输出结果进行平均来计算。结果来自一次实验运行,使用固定随机种子。该框架通过叠加机制结合多种DL结构,并提供可解释的住宅平面图分析,从而提升了预测能力。这使得CARE-MIRV-Net在老年人和医疗导向的住宅设计中具有应用性。源代码、环境配置信息、软件依赖规范和实现文档均提供于 补充文件1中。

绩效评估

对所提框架进行性能分析,以确定其在不同架构特性下的预测能力、鲁棒性和泛化性能。通过定量和定性分析来确认所提出模型的实用性。评估过程包括标准回归测量和受控实验环境,以便与基线模型进行公平比较。实验采用固定随机种子进行单次实验运行,以确保所有基准和提出模型的重复性和一致性。

性能参数:

采用两种著名的回归测量方法MAE和R2来评估所提出框架的性能。MAE测量预测误差的平均大小,并清晰地显示预测值与实际值之间的接近程度。相反,R2 值用于评估模型解释的目标变量方差比例,反映其整体预测能力。这些指标的组合可以全面评估所有预测架构特征的准确性和泛化性能。对于多输出预测,MAE和R2通过比较每个目标变量的预测值和实际值,然后对所有输出结果进行平均来计算。

实验装置:

实验在云计算环境中使用Python(版本3.12.12)进行。该拟议协议通过 TensorFlow(版本 2.19.0)、Keras(版本 3.13.2)、NumPy(版本 2.4.6)、Pandas(版本 2.3.3)、Scikit-learn(版本 1.6.1)、Matplotlib(版本 3.9)和 SHAP(版本 0.51.0)实现。该计算环境采用了一颗运行频率为2.20 GHz的Intel Xeon处理器,系统内存约为31 GB。实验在使用 NVIDIA Tesla T4 × 2 GPU 的 Ubuntu 22.04 LTS 操作系统上进行。该数据集包含2640张住宅平面图图像,这些图像经过预处理后细分为训练和测试数据集。数据集采用80:20的拆分比例,共计2,112个训练样本和528个测试样本。MobileNetV2、InceptionV3、ResNet101 和 VGG16 是四个使用 Transfer-learning 微调方法训练的 DL 模型。随后构建了一个基于堆叠的元集合模型CARE-MIRV-Net,用以结合这些基础模型的预测。每个模型在统一条件下训练,包括图像大小调整至224×224像素、数据增强以及提前停止以减少过拟合。数据增强包括随机翻转、旋转、缩放和移动。采用32个批次,最多15个训练历程,基于验证损失和自适应学习率降低提前停止。最终分析是在隐藏测试集上进行的,以提供公正可靠的绩效评估。隐藏测试集在初始数据集分区时生成,并在模型训练和开发过程中完全隔离,以确保性能评估的公正性。

数据集描述:

用于支持本研究发现的数据集已在Kaggle平台上公开发布,标题为 “平面图图像及其细节”28。该数据集可访问:https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details(访问日期:2026年4月16日)。数据包括2640张住宅平面图图像和有序的建筑元数据。每个样本都是独立的住房规划,提供多种不同大小、配置和空间布局的住宅布局。数据集规模足以进行基于DL的训练,并包含多种架构模式。该数据集由一幅二维平面图图像及描述住宅结构特征的相关数值属性组成。这些特征包括总面积、卧室数量、浴室数量和车库数量。此外,每条记录都包含图像路径,允许将视觉输入直接映射到标签。数据集变量包括平面图图像、图像路径、面积、卧室数量、浴室数量和车库数量。平面图图像作为输入特征,建筑属性作为预测目标。因此,该数据集适合监督学习,图像作为输入特征,建筑属性作为回归目标。

数据集包含了多种住宅布局,从房间较少的紧凑布局到大型多房间布局不等。这种变异性使得学习有意义的空间表示成为可能,包括房间分布、布局密度和结构复杂性。这种多样性对拟议框架尤为重要,因为它支持将户型分为适合老年人、医疗整合和一般住宅布局。在模型训练之前,数据集会经过一系列预处理程序,以确保与DL模型的一致性和兼容性。所有图像在训练前都被调整为224×224像素并归一化至范围[0, 1]。然后通过匹配图像路径与其对应元数据来组织数据集,然后将其拆分为训练和测试子集,以便于性能分析。数据集被随机分为训练组和测试组,采用80:20的比例分配。包含完整图像和元数据信息的记录被纳入分析,而不完整或无效的记录被排除。数据集划分时使用固定随机种子以确保可重复性。该数据集为基于人工智能的住宅楼层平面图分析提供了详细基础。2640张注释图像和多样化的建筑属性相结合,支持多输出回归建模,并实现空间智能与面向医疗的住宅设计决策的整合。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

通过四个DL模型——MobileNetV2、InceptionV3、ResNet101和VGG16,以及提出的CARE-MIRV-Net元集合模型,进行了一组实验来评估所提出的框架。

数据集获取与预处理结果

预处理阶段旨在准备原始平面图图像及相关元数据,用于使用DL模型进行训练和评估。该数据集从Kaggle仓库获取,包含2640个样本。每个样本包含平面图及其对应的建筑特征。仅保留相关列,包括图像路径、面积、卧室、浴室和车库,以供进一步分析,并删除不完整或空白记录以保持数据的一致性和质量。为便于模型训练和评估,数据集按80:20比例划分为训练和测试子集,共计2,112个训练样本和528个测试样本。数据集划分时使用固定随机种子以确保可重复性。这一划分确保模型在足够大的数据集上训练,同时保留独立的测试集以实现客观性能评估。图像路径通过将每条记录映射到数据集目录中的对应位置来标准化。这四个建筑属性(平方英尺、卧室、浴室和车库)作为多输出回归任务的目标变量。虽然卧室、浴室和车库是离散变量,但它们采用多输出回归框架建模,使得在统一学习架构中同时预测所有建筑属性。这种方法使模型能够捕捉目标变量之间的共享关系,并利用连续与离散架构特性之间的相关性。离散属性的预测值在解释和下游住宅布局分类前的后处理中被转换为最接近的有效整数。

表1 概述了拟议模型预测的建筑特征,代表住宅平面图的关键空间和功能特征。通过探究性数据分析,利用直方图和基于计数的可视化,更好地理解目标变量的分布。面积分布连续且密度不一,而卧室、浴室和车库的分布则凸显了不同住宅配置的频率。这些分布如 图2所示。图 2A显示了面积分布,而卧室、浴室和车库的分布分别见 图2B–2D。这些图共同展示了目标变量在数据集中的变异性和分布情况。

特色名称描述
平方英尺住宅单元的总建筑面积
花坛布局中的卧室数量
浴场布局中的浴室数量
车库可用车库数量

表1:用作预测目标的架构属性。 从住宅平面图数据集中提取的建筑属性定义,并用作模型训练和评估的目标变量。这些属性包括每个住宅户型的总面积、卧室数量、浴室数量以及车库空间数量。

figure-results-1
图2。住宅平面图数据集中建筑属性的分布。直方图 显示了(A)平方英尺数、(B)卧室数量、(C)浴室数量和(D)车库数量在模型开发和评估中使用的数据集中的分布。 请点击此处查看该图的放大版本。

图像预处理阶段将所有平面图图像转换为适合DL模型的标准化格式。所有图像都已加载,转换为RGB色彩空间,缩放为224×224像素,并归一化至[0, 1]范围。这一过程确保了输入维度一致,并在训练过程中提升了模型的收敛性。预处理图像被随机抽样,并验证标签以确认预处理和标签对齐。预处理后,每张图像被转换为NumPy数组,并与对应的目标值配对生成输入输出数据集。所得数据集证实数据准备成功,训练图像维度为(2112, 224, 224, 3),测试图像维度为(528, 224, 224, 3)。相应的标签矩阵的维数分别为(2112, 4)和(528, 4)。目标变量被转换为浮点值,以支持基于回归的学习。

为了进一步提升模型泛化并减少过拟合,采用了使用图像数据生成器的数据增强技术。这些技术包括随机水平翻转、旋转、缩放以及宽度/高度移动,以增加训练数据的变异性并提升模型泛化性。这些变换增加了训练数据的变异性,使模型能够学习更稳健且不变的空间特征。预处理流水线产生了干净、标准化且结构良好的图像和表格数据,为训练拟议的元集成深度学习框架提供了合适的基础。

基础模型与所提出模型的结果

预处理数据集(2640张平面图图像)用于训练所有模型,采用训练和测试拆分。数据集采用80:20的拆分比例,共计2,112个训练样本和528个测试样本。使用固定随机种子以确保可重复性。预训练权重被用于迁移学习和微调,以适应建筑平面图分析领域。训练期间采用数据增强方法以增强泛化能力,并通过监控验证性能减少过拟合。模型以32个批次训练,最多可达15个时代,并采用早期停止以防止过拟合并促进高效收敛。早期停止监测验证损失,若无进一步改善则终止训练,同时采用自适应学习率降低以改善收敛。损失和MAE均用于监测训练过程并评估收敛行为和稳定性。所有模型均在相同的实验条件下训练,以确保公平的比较。 图3–7 展示了所有模型的训练和验证损失及MAE曲线,提供了对其学习动态和泛化行为的洞察。

figure-results-2
图3。MobileNetV2的训练表现。(A) 跨训练时期的训练和验证损失。B) 训练和验证在不同训练时期均为绝对误差(MAE)。 请点击此处查看该图的放大版本。

figure-results-3
图4。InceptionV3的训练表现。(A) 跨训练时期的训练和验证损失。(B) 训练和验证在不同训练时期均为绝对误差(MAE)。请点击此处查看该图的放大版本。

figure-results-4
图5。ResNet101的培训表现。(A) 跨训练时期的训练和验证损失。(B) 训练和验证在不同训练时期均为绝对误差(MAE)。请点击此处查看该图的放大版本。

figure-results-5
图6。VGG16的训练表现。A) 跨训练时期的训练和验证损失。(B) 训练和验证在不同训练时期均为绝对误差(MAE)。 请点击此处查看该图的放大版本。

figure-results-6
图7。CARE-MIRV-Net的培训表现。A) 跨训练时期的训练和验证损失。(B) 训练和验证在不同训练时期均为绝对误差(MAE)。 请点击此处查看该图的放大版本。

MobileNetV2的训练表现如 图3所示。训练和验证损失曲线见 图3A,训练和验证MAE曲线见 图3B。随着时代的增加,训练损失和MAE逐渐减少,表明学习行为稳定。验证曲线的变异性更大,且相对较高,表明泛化性能下降。这一趋势与量化结果一致,MobileNetV2在实际面积预测方面表现相对较低。InceptionV3的训练表现如 图4所示。训练和验证损失曲线见 图4A,训练和验证MAE曲线见 图4B。该模型在训练和验证损失以及MAE方面均有稳定下降,曲线间差异较小。这种行为表明其学习效果良好且具有较好的概括能力。稳定的验证曲线表明该模型有效捕捉了多尺度空间特征,从而提升了与MobileNetV2相比的性能。ResNet101的训练行为如 图5所示。训练和验证损失曲线见 图5A,训练和验证MAE曲线见 图5B。模型显示训练损失和MAE呈渐进式下降,而验证曲线则呈类似趋势,波动较小。尽管观察到一些振荡,但整体收敛保持稳定。这些观察结果与模型通过残余学习学习层级空间表示的能力一致。VGG16的训练表现如 图6所示。训练和验证损失曲线见 图6A,训练和验证MAE曲线见 图6B

VGG16的训练曲线在整个训练过程中持续下降,表明学习效果显著。验证曲线表现出振荡和与训练曲线的轻微分离,暗示轻度过拟合。尽管如此,该模型依然具有竞争力,尤其是在平方英尺和车库预测方面,表明其学习到的特征表示依然有效且稳定。

CARE-MIRV-Net的训练表现如 图7所示。训练和验证损失曲线见 图7A,训练和验证MAE曲线见 图7B。训练和验证损失与MAE曲线平滑且持续地下降,两者之间仅有小差异。这种行为表明强烈的收敛性和良好的泛化能力。与单个模型相比,元集合框架产生了更稳定的学习行为并降低了变异性。总体来看,训练曲线的比较表明,尽管各模型表现出不同的收敛性和泛化特性,但CARE-MIRV-Net在受评估模型中训练行为最为一致。

表2详细比较了MobileNetV2、InceptionV3、ResNet101、VGG16及提出的CARE-MIRV-Net模型的预测性能。利用MAE和R2在四个目标变量中评估了性能:面积、卧室数量、浴室数量和车库数量。这些指标提供了预测准确性和解释性能的互补衡量。

模型平方英尺花坛浴场车库
MAEMAEMAEMAE
移动网2881.6530.13270.68730.31540.65520.34570.39770.1133
盗梦空间V3464.640.66150.43530.67080.36270.74590.230.6351
ResNet101611.9190.58720.42870.65460.38380.7250.22980.6489
VGG16504.4350.72560.6980.33550.49950.64360.1970.6757
CARE-MIRV-Net(提议)432.4880.70530.43430.68370.36890.76050.16970.6958

表2:基线模型与CARE-MIRV-Net的性能比较。 比较MobileNetV2、InceptionV3、ResNet101、VGG16及拟议中的CARE-MIRV-Net模型在四项建筑属性上的预测性能:面积、卧室数量、浴室数量和车库数量。性能通过平均绝对误差(MAE)和决定系数(R2)进行报告。较低的MAE值表示预测误差较低,而R2 值越高表示预测值与实际值之间的吻合度越高。

各个模型在目标变量上的表现水平各异。MobileNetV2整体表现最低,尤其是在平方英尺预测方面,MAE为881.6530,R2值为0.1327。浴室和车库的性能也相对较低,表明作为独立模型时,难以捕捉复杂空间关系。

InceptionV3在大多数目标变量上表现强劲,尤其是浴室和卧室,R2 值分别为0.7459和0.6708。这些结果表明能够有效捕捉多尺度空间特征。ResNet101还通过其深沉的残差架构展现了竞争力,这有助于学习层级空间表示。然而,在某些变量(包括平方英尺预测)上,其性能仍略低于InceptionV3。VGG16在所有目标变量上表现相对平衡,并在单个模型中取得了最高的R² 平方英尺值(0.7256)。

提出的CARE-MIRV-Net框架在大多数受评估任务中表现优于单个模型。CARE-MIRV-Net在保持R2 值0.7053的同时,MAE面积为432.488,创下最低平方英尺数。在卧室预测方面,模型获得了R2 值0.6837。在浴室预测方面,CARE-MIRV-Net在所有评估模型中R2 值最高(0.7605)。同样,在车库预测方面,模型获得了最低的MAE(0.1697)和最高的R² 值(0.6958)。这些结果表明,元集合框架有效地结合了各个架构的互补优势。结果进一步表明,整合多个模型的预测减少了模型特有的局限,提升了整体预测性能。研究结果表明,CARE-MIRV-Net在所有评估目标变量上提供了平衡的预测性能。本研究中呈现的面向医疗的住院评估应被理解为基于规则决策框架和现有户型属性的应用导向分类,而非临床验证的医疗评估。

为进一步评估预测性能,对所有目标变量(包括面积、卧室、浴室和车库)进行了残差误差分析。残差图通过显示预测值与观测值之间的差异,提供了预测误差分布的洞察。理想情况下,残差应随机分布在零附近,表明系统偏差有限且推广性良好。

图8 显示了用于平方英尺预测的残差图。大多数残差集中在零附近,表明大多数样本的预测相对准确。然而,在较大的预测平方英尺数值下,观察到更大的离散值和若干异常值。这些观察表明,较大型住宅布局的预测变异性增加。

figure-results-7
图8。用于平方英尺预测的残差分析。 散点图显示了预测平方英尺数值的残余误差。横线表示残差误差为零。 请点击此处查看该图的放大版本。

卧室预测的残差分布如 图9所示。残差通常以零为中心,对角线模式反映了卧室变量的离散性质。相对较窄的残余范围表明预测表现一致,未观察到明显的系统性偏差。 图10 展示了浴室预测的残差图。残差集中在零附近,但分布略大于卧室预测时的差异。可见的条纹模式与目标变量的离散性质一致。在更高的预测值下,也出现了若干异常值。

figure-results-8
图9。卧室预测的残差分析。 散点图显示了根据预测卧室值的残余误差。横线表示残差误差为零。 请点击此处查看该图的放大版本。

figure-results-9
图10。浴室预测的残差分析。 散点图显示了根据预测浴室数值的残差误差。横线表示残差误差为零。 请点击此处查看该图的放大版本。

车库预测的残差分析见 图11。残差值保持在零附近,且与其他目标变量相比方差相对较低。车库数值的离散且有限范围在地块内产生了明显的线性图案。狭窄的残差分布表明该变量的预测表现相对一致。

figure-results-10
图11。车库预测的残差分析。 散点图显示了残余误差与预测车库数值相关的函数。横线表示残差误差为零。 请点击此处查看该图的放大版本。

总体来看,残余分析表明CARE-MIRV-Net生成的预测通常集中在所有目标变量的零附近。尽管观察到一些变异和异常值,尤其是在平方英尺预测方面,但整体残差分布支持模型在评估数据集中预测表现的一致性。

使用SHAP进行可解释人工智能分析的结果

为提升CARE-MIRV-Net框架的可解释性,采用了SHAP的可解释AI方法。SHAP是一种博弈论方法,通过根据夏普利值分配特征重要性值来解释模型预测。应用于拟议的元集成模型时,使用SHAP来考察每个基础模型对元学习者最终输出的贡献。元模型的输入由四个基模型——InceptionV3、MobileNetV2、ResNet101 和 VGG16——的串接预测组成,形成了一个16维特征空间。每个特征代表由特定基底模型生成的预测建筑属性(面积、卧室、浴室或车库)。通过随机选择元训练数据的子集作为背景分布,并选择较小的测试样本子集作为解释生成,以提升计算效率来解释这些特征。

创建了单输出版本的元模型,以独立分离和分析每个目标变量的特征贡献。SHAP KernelExplainer 按照前述及 补充文件 1 中描述的应用,用于估算特征贡献并解释拟议框架的预测。这些数值用于量化每个基模型预测对最终输出的正负贡献程度。基于SHAP分析,CARE-MIRV-Net并未仅依赖单一基学习器,而是根据目标变量和输入特征对不同模型赋予不同重要性。这些观察表明基于堆叠的集合方法利用了来自多个基模型的互补信息。

图12–15 展示了四个目标变量的SHAP总结图:面积、卧室、浴室和车库。这些图展示了CARE-MIRV-Net元模型如何利用个别基础学习者的预测数据。在每个图中,横轴表示SHAP值(特征贡献),而色彩刻度表示从低到高的特征大小。

figure-results-11
图12。用于平方英尺预测的SHAP总结图。 CARE-MIRV-Net元学习器对平方英尺估计贡献的SHAP总结图。特征按重要性排序。点颜色表示特征值,水平位置表示SHAP对预测的贡献。沙普,沙普利补充解释。 请点击此处查看该图的放大版本。

figure-results-12
图13。卧室预测的SHAP总结图。 CARE-MIRV-Net元学习器对卧室估计贡献的SHAP总结图。特征按重要性排序。点颜色表示特征值,水平位置表示SHAP对预测的贡献。沙普,沙普利补充解释。 请点击此处查看该图的放大版本。

figure-results-13
图14。浴室预测的SHAP总结图。 CARE-MIRV-Net元学习器对厕所估计贡献的SHAP总结图。特征按重要性排序。点颜色表示特征值,水平位置表示SHAP对预测的贡献。沙普,沙普利补充解释。 请点击此处查看该图的放大版本。

figure-results-14
图15。车库预测的SHAP总结图。 CARE-MIRV-Net元学习器对车库估算的SHAP总结图显示了基础模型预测对车库估算的贡献。特征按重要性排序。点颜色表示特征值,水平位置表示SHAP对预测的贡献。沙普,沙普利补充解释。 请点击此处查看该图的放大版本。

图12 展示了用于平方英尺预测的SHAP总结。Mob_SF、Res_SF和Inc_SF等特征在SHAP上的贡献相对较大,表明MobileNetV2、ResNet101和InceptionV3生成的预测对面积估计贡献显著。较高的特征值(红色)通常与预测面积增加相关,而较低的特征值(蓝色)则与较低的预测值相关。卧室和浴室相关特征贡献较小,表明平方英尺的预测主要受基础模型生成的面积相关预测影响。

图13 展示了卧室预测的SHAP分析。Res_Beds、VGG_Beds和Inc_Beds等特征的贡献相对较大,表明ResNet101、VGG16和InceptionV3的预测对最终卧室预测具有重要影响。SHAP值分布在零附近,表明元模型整合了来自多个来源的信息,而非依赖单一主导预测变量。与车库和面积相关的特征贡献相对较小。

图14 展示了浴室预测的SHAP总结。包括VGG_Baths、Inc_Baths和Mob_Baths等特征表现出较高的贡献,表明VGG16、InceptionV3和MobileNetV2的预测对浴室估计贡献显著。SHAP值的分布表明,这些基础模型预测量增加,对最终预测的影响更大。贡献在模型间分布更广泛,而其他目标变量则更为明显。

图15 展示了车库预测的SHAP分析。Mob_Garages、Inc_Garages和VGG_Garages等特征对最终预测贡献较大。图中显示,来自多个基模型的车库相关预测对最终输出有贡献,且低价值和高价值特征贡献之间有明显区分。SHAP值的更广泛分布表明元模型对车库相关预测特征的敏感度更高。

总体而言,SHAP分析表明,提出的CARE-MIRV-Net框架在生成最终预测时整合了多个基底学习者的贡献。结果提供了对四个架构目标变量中单个模型预测相对影响的可解读视角,支持对元集合决策过程的理解。

住宅布局分类结果

住宅布局分类结果的代表性示例见 图16–18。这些示例展示了基于规则的决策层如何应用于CARE-MIRV-Net框架预测的架构属性。 图16 展示了一个被归类为医疗护理布局的示例, 图17 展示了一个被归类为一般住宅布局的示例, 图18 展示了一个被归类为老年护理布局的示例。示例展示了如何通过协议部分描述的预定义决策规则,将预测的架构属性转化为应用级住宅类别。这些例子应被视为基于预测的楼层平面属性和预设决策标准得出的基于规则的分类框架的说明性结果,而非独立验证的临床或医疗分类。

figure-results-15
图16。代表性例子,被归类为医疗护理-住宅布局。 示例住宅平面图图像,由拟议框架评估,并根据预测的建筑属性和基于规则的分类标准归入医疗护理类别。 请点击此处查看该图的放大版本。

figure-results-16
图17。代表性示例,归类为一般住宅布局。 示例住宅平面图图像,由拟议框架评估,并根据预测的建筑属性和基于规则的分类标准归入一般住宅类别。 请点击此处查看该图的放大版本。

figure-results-17
图18。代表性示例被归类为老年护理住宅布局。 示例住宅平面图图像,基于拟建框架评估并根据预测的建筑属性和基于规则的分类标准划分为老年护理类别。 请点击此处查看该图的放大版本。

图16所示的代表性例子表明,模型预测的面积为2233.16平方英尺,而实际值为2268.00,显示出相对较小的预测误差。同样,卧室(3.23对3)、浴室(2.65对2)和车库(1.11对1)的预测值也接近对应的真实值。基于这些预测属性,基于规则的决策层将布局归类为医疗护理。本示例展示了该框架如何应用预测的建筑属性来生成应用级住宅分类。

图17中展示的第二个例子展示了一种被归类为一般住宅用途的布局。预测的面积(1692.76)低于实际值(1879.00),而卧室、浴室和车库的预测数量仍接近对应的真实值。基于预测的建筑属性,决策层将布局分配给一般住宅类别。该示例展示了尽管个别预测存在细微偏差,分类框架仍可应用于中等规模的住宅布局。

图18 展示了一个紧凑的住宅布局,实际面积为981.00,预计面积为1076.17。卧室(1.99对2)、浴室(1.75对2)和车库(0.98对1)的预测值也接近对应的真实值。基于这些预测属性,决策层将布局归类为老年护理。本例说明了预设分类规则在较小楼面面积和较少房间的布局上的应用。

总体而言,代表性示例展示了建筑属性预测和基于规则的住宅布局分类在CARE-MIRV-Net框架中的整合。在 图16–18所示的例子中,预测的建筑属性通常与相应的真实值一致,支持采用拟议框架进行住宅平面图自动化分析和应用层分类。

数据可用性:

本研究所用数据集通过Kaggle库28公开获取,名为“平面图图像及其详情”,访问网址为:https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details。本研究中报告的所有分析均基于该公开来源获取的数据进行。复现报告结果所需的源代码、实现文档和环境配置信息均提供于 补充文件1中。

补充档案1。CARE-MIRV-Net 实现包。 该文件包含重现CARE-MIRV-Net工作流程所需的源代码、README文档、软件依赖规范、环境信息和实现脚本。请点击这里下载此文件。

补充档案2。CARE-MIRV-Net住宅平面图分析算法。 该文件提供了算法1,包括数据预处理、基模型预测、元特征连接、元集合预测、决策层分类、基于SHAP的解释性以及评估度量工作流程。请点击这里下载此文件。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究介绍了CARE-MIRV-Net,一种基于堆叠的元集合DL框架,用于自动分析住宅平面图图像。该框架整合了四种互补的CNN架构——MobileNetV2、InceptionV3、ResNet101和VGG16——以预测关键建筑属性,包括面积、卧室数量、浴室和车库。这些预测随后通过元学习器进行整合,并用于基于规则的决策层,将住宅布局分类为老年护理、医疗护理或一般住宅类别。预测建模、集合学习和可解释人工智能的整合为住宅平面图分析提供了统一框架 3,7,17,20。

代表性结果表明,CARE-MIRV-Net在多个架构属性上相比单个基模型实现了更好的预测性能。集合框架总体上降低了预测误差并改善了R2,表明结合异构CNN架构可以提升预测鲁棒性12,20。此外,SHAP的引入使得对各个基底模型对最终预测的相对贡献进行了解释,从而提高了模型透明度11,17。因此,该框架可能为需要预测性能和模型可解释性的研究提供有用方法。

该框架有望推动自动化建筑分析、住宅设计评估和数据驱动决策支持系统等研究的发展。通过将多输出预测与应用级分类相结合,该框架超越了传统的平面图识别或特征提取方法。该方法论可适用于涉及住宅规划、智能住房环境和空间布局评估12822的研究。不过,也需要考虑一些限制。首先,该框架是基于单一公开数据集开发和评估的,且未对独立数据集进行外部验证。本研究未进行外部验证,模型评估使用了来自公开数据集的指定测试子集进行。其次,该框架生成的住宅类别是基于预定义的基于规则的标准,而非独立验证的医疗设计标签。该框架生成的老年护理、医疗护理和一般住宅类别均基于预设的规则标准,不应被解释为经过临床验证的医疗设计评估。第三,该框架主要依赖于基于平面图图像的建筑属性,未纳入医疗行业特定的设计标准、无障碍标准或以居住者为中心的结果指标。未使用正式的无障碍、医疗设计或住宅设计标准来定义分类规则。相反,分类框架是基于现有的户型属性和面向应用的决策标准开发的。未来工作可能包括对独立数据集进行外部验证、纳入正式的无障碍性和医疗设计标准,以及利用额外的设计和以居住者为中心的结果指标进行评估,以进一步提升该框架的适用性和推广性。

也可以采用替代方法来研究同一假说。例如,基于变压器的视觉模型、基于图的空间表示或混合的深度学习架构可用于捕捉住宅布局131519中的空间关系。同样,基于专家标签数据集或医疗设计标准的分类框架可能为住宅布局评估提供替代方法8,22。尽管这些方法可能互补优势,但提出的CARE-MIRV-Net框架展示了在基于堆叠的集合框架中结合多种CNN架构,实现多输出预测和住宅布局分类的可行性。

未来的工作可能聚焦于扩展该框架,以支持更高级的空间推理和更广泛的现实应用。潜在方向包括将基于图的平面图表示法应用于房间连通性建模,评估基于视觉变换器(ViT)的特征提取架构,以及开发多类或多标签分类策略131518。此外,未来研究可能会纳入医疗特有的设计属性、无障碍标准和独立验证数据集,以进一步评估该框架在医疗导向住宅环境中的适用性 8,22。该框架还可以调整为智能城市平台和住宅规划决策支持系统中的整合。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

利益冲突:

作者声明不存在利益冲突。

作者贡献:

张宁提出了研究理念,设计实验计划并协调了整个研究过程。余毕进行实验、收集数据、参与数据分析和论文修订工作。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢吉林省教育厅科学研究项目提供的资金支持。

资金来源:

该研究得到了吉林省教育厅科学研究项目(资助编号)的资助。JJKH20240801KJ)。

材料

本文使用的材料清单
姓名公司目录编号评论
CARE-MIRV-Net实施包补充文件1版本1.0N/A
图表和表格重新生成脚本补充文件1版本1.0N/A
平面图图像及其详细信息数据集Kaggle公共数据集N/A
GPU英伟达公司Tesla T4 × 2N/A
英特尔至强处理器英特尔公司2.20 GHzN/A
KerasKeras团队版本3.13.2N/A
MatplotlibMatplotlib开发团队版本3.9RRID:SCR_008624
NumPyNumPy开发者版本2.4.6RRID:SCR_008633
操作系统LinuxUbuntu 22.04 LTSN/A
PandasPandas开发团队版本2.3.3RRID:SCR_018214
PythonPython软件基金会版本3.12.12RRID:SCR_008394
Scikit-learnScikit-learn开发者版本1.6.1RRID:SCR_002577
SHAPSHAP开发团队版本0.51.0N/A
系统内存(RAM)云计算环境31 GBN/A
TensorFlow谷歌版本2.19.0RRID:SCR_016345
训练环境配置文件补充文件1版本1.0N/A

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

EngineeringMeta ensemble learningfloor plan analysisresidential designelderly care housinghealthcare integrated designXAI
视频即将推出

相关文章