需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

基于深度学习的老年人住房评估中住宅平面图属性预测

28 次观看

DOI:

10.3791/72157

2026年7月31日

本文内容

摘要

本方案描述了一种用于住宅平面图图像自动化分析的元集成深度学习工作流程。该流程包括数据集预处理、利用多个卷积神经网络进行建筑属性预测、基于堆叠的集成学习、基于规则的住宅分类,以及使用SHapley加性解释(SHapley Additive exPlanations)进行可解释性分析,以支持住宅布局评估。

摘要

随着老龄人口对智能住宅解决方案的需求不断增长,住宅平面图分析的自动化方法也愈发受到关注。传统的建筑评估方法通常依赖人工操作,耗时较长且难以规模化,这凸显了基于人工智能的技术在解读空间布局和支持住宅设计评估方面的必要性。本方案描述了一种用于住宅平面图图像自动化分析的元集成深度学习框架。所提出的 CARE-MIRV-Net 框架集成了四种互补的卷积神经网络——MobileNetV2、InceptionV3、ResNet101 和 VGG16,用于预测建筑属性,包括建筑面积(平方英尺)、卧室数量、浴室数量以及车库数量。基础模型的预测结果通过基于堆叠的元集成模型进行融合,并进一步输入基于规则的决策层,以将住宅布局分类为适老住宅、医疗照护住宅或普通住宅。实验评估表明,该模型在多个目标变量上均表现出稳健的预测性能。在建筑面积预测任务中,模型的平均绝对误差(MAE)为 432.48,决定系数(R2)为 0.7053;在浴室数量预测中,R2 达到 0.7605;而在车库数量预测中,模型取得了最低的 MAE(0.1697)和最高的 R2(0.6958)。定性分析进一步验证了该框架在生成建筑属性预测结果以及支持面向应用的住宅布局评估方面的能力。为增强模型的透明性与可解释性,本研究引入 SHapley Additive exPlanations 方法,量化各基础模型对最终预测结果的贡献。所提出的框架为住宅平面图分析与决策支持提供了一种可解释且可扩展的解决方案。

引言

智慧城市技术和智能生活环境的快速发展,使得住宅设计领域对自动化和数据驱动解决方案的需求日益增长。特别是人口老龄化加剧以及对医疗导向型住房的需求增加,进一步凸显了设计兼具功能性并满足特定用户群体需求的居住空间的重要性1,2。传统的建筑平面图分析方法通常依赖人工操作,耗时较长且需要专家解读,因此效率低下且难以规模化应用。这促使人们迫切需要能够自动分析住宅布局并支持科学决策的智能系统3

人工智能(AI)领域的最新进展,特别是在深度学习(DL)和计算机视觉方面的进步,显著提升了基于图像数据的分析能力。卷积神经网络(CNNs)在空间特征提取和复杂视觉模式学习方面表现出高度有效性,因此适用于平面图图像分析4,5,6。这些模型能够学习房间结构、布局组织以及空间关系的隐式表征,而这些表征对于预测建筑属性至关重要7,8。然而,单一深度学习模型的依赖可能限制其泛化能力,因为不同的网络架构可能关注不同的空间特征,并因建筑形式的多样性而产生偏差9。尽管已有上述进展,现有方法通常缺乏一个集成框架,无法同时融合多个模型、支持多输出预测,并提供应用层面的可解释性。此外,在平面图分析系统中,面向医疗健康的住宅评估及其结果可解释性尚未得到充分关注。此类综合性框架的缺失限制了其在实际场景中的应用价值与解释能力,尤其在需要透明性和决策支持的领域中更为突出10,11,12

人工智能在建筑平面图的自动化分析与生成方面也做出了重要贡献。一项研究探讨了利用机器学习(ML)将二维平面图图像转换为三维模型的方法13。作者指出了传统基于计算机辅助设计(CAD)方法的局限性,并强调了可扩展的基于人工智能的流程在空间理解中的重要性。研究结果表明,深度学习(DL)能够有效从平面图中提取结构信息,但在泛化能力和数据多样性方面仍存在挑战。另一项研究提出了一种用于自动化生成平面图的多智能体深度强化学习框架14。尽管该方法在建筑设计中提供了较高的灵活性和可定制性,但其主要侧重于设计生成,而非对现有平面图的预测性分析。

一项全面的平面图检索调查研究了语义、空间、基于形状和基于纹理的特征在平面图理解中的应用15。该调查强调了深度学习(DL)模型(包括卷积神经网络CNNs和基于Transformer的架构)在学习有意义表征方面的重要性。然而,研究也指出了在复杂布局中存在噪声、失真以及特征判别方面的挑战。类似地,一种基于机器学习(ML)的方法结合了拓扑和视觉关系用于平面图识别8。该研究表明,视觉可达性和空间连通性对于理解建筑布局至关重要,但未涉及多输出预测或多模型集成学习策略。生成式人工智能在建筑领域的应用也已得到探索。一篇关于生成式AI在建筑中应用的综述探讨了生成对抗网络(GANs)、变分自编码器(VAEs)和扩散模型在设计自动化中的使用16。作者指出,AI工具在实际建筑设计流程中的应用日益广泛。然而,该研究的重点是设计生成,而非预测建模或决策支持应用。可解释人工智能(Explainable AI)在解释深度学习模型方面正变得越来越重要。一项研究提出了一种基于SHapley加性解释(SHAP)的框架,用于解释城市模拟应用中的深度学习模型17。结果表明,SHAP能够识别关键特征,并在全局和局部层面提升模型的可解释性。尽管该研究支持SHAP在空间应用中的价值,但并未探讨其与集成学习框架的结合。近年来深度学习架构的发展进一步提升了基于图像任务的性能。一项研究对当前主流的深度学习模型(包括基于CNN和基于Transformer的架构)进行了系统性综述18。该研究强调了模型选择和混合架构在提升泛化能力方面的重要性。然而,该研究并未专门针对平面图分析应用展开讨论。大规模数据集也推动了建筑分析领域的进步。例如,一项研究引入了一个包含数千张复杂平面图的基准数据集19。研究表明,现有模型在分析大规模和多户住宅布局时仍面临挑战,凸显了对更鲁棒且更具泛化能力方法的需求。

深度学习在集成学习中也得到了广泛研究。最近一项关于深度集成方法的研究表明,通过结合多个模型,可以显著提高预测准确性和鲁棒性,从而降低偏差和方差20。尽管这些方法效果显著,但尚未被广泛应用于建筑平面图分析,尤其是在多输出回归任务中。此外,近期关于自动平面图分析的研究强调了集成框架的重要性,这类框架需结合预测、分类与可解释性21,22,23。现有研究通常聚焦于单一功能,例如特征提取、布局生成或分类。因此,在开发一个统一框架以整合多模型学习、住宅布局评估和可解释人工智能方面,仍存在明显的研究空白。尽管深度学习与建筑分析领域已取得显著进展,但仍存在若干研究缺口。大多数现有研究集中于平面图识别、特征提取或布局生成,未能提供支持多输出预测与应用层面决策的统一框架。此外,许多方法依赖单一深度学习模型,这可能限制其捕捉多样化空间特征的能力,并引入模型特异性偏差。针对平面图分析的集成学习仍相对缺乏探索,特别是在整合异构模型以提升鲁棒性方面。此外,针对老年人导向住房需求并强调可解释性的住宅分类研究也较为有限。由于许多深度学习模型具有“黑箱”特性,理解其预测依据仍然具有挑战性。这些局限性凸显了构建一个综合性框架的必要性,该框架应整合多模型学习、精确预测、面向应用的住宅分类以及可解释人工智能。

本研究提出了一种用于住宅平面图图像分析的自动化框架,重点在于空间感知与住宅布局评估,以应对这些挑战。该框架引入了一种元集成深度学习模型 CARE-MIRV-Net,该模型在基于堆叠的架构中整合了四种互补的卷积神经网络——MobileNetV2、InceptionV3、ResNet101 和 VGG1624,25,26,27。每个模型独立预测关键建筑属性,包括面积(平方英尺)、卧室数量、浴室数量以及车库数量。这些预测结果随后由一个元学习器进行整合,以生成更精确的预测结果。此外,框架还采用基于规则的决策层,根据预测出的属性将住宅布局分类为适老型护理、医疗护理型或普通住宅型。

本研究的贡献如下:第一,提出了一种元集成深度学习框架,用于从住宅平面图图像中进行建筑属性的多输出预测;第二,CARE-MIRV-Net 模型融合了四种卷积神经网络(CNN)架构,以提高预测准确性和泛化能力;第三,引入基于规则的决策层,根据预测的建筑属性支持面向应用的住宅布局分类;第四,集成了基于 SHAP 的可解释性人工智能方法,以增强模型的透明度与可解释性;最后,开展了大量实验,采用平均绝对误差(MAE)和决定系数(R2)作为性能指标,对所提出的框架进行评估。

访问受限。请登录或开始试用以查看此内容。

方案

本研究使用了来自 Kaggle 平台的公开数据集(Floor Plan Images and Their Details,可访问:https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details 获取;访问日期:2026年4月16日)。该研究未涉及人类受试者、动物或可识别个人身份的数据,因此无需伦理审批和知情同意。

本方案介绍了一种基于人工智能的住宅平面图图像自动化分析框架,重点关注具有空间感知能力且面向医疗保健的设计。完整的实验工作流程如图1所示。该方案旨在弥合低层次建筑特征预测与高层次应用导向决策之间的差距,通过整合深度学习(DL)、集成建模和可解释人工智能(AI),为住宅布局分析提供准确、稳健且可解释的解决方案。该框架包含多个阶段:首先进行数据获取与预处理,随后利用深度卷积神经网络(CNN)进行特征学习,接着进行元集成预测,最后实现应用层面的分类。初始阶段,对平面图图像及其对应的建筑属性进行预处理,包括调整尺寸、归一化和数据增强,以确保数据一致性并提升模型泛化能力。所有平面图图像均被调整为224 × 224像素,并归一化至[0, 1]范围。在训练过程中应用数据增强技术,包括随机水平翻转、旋转、缩放以及宽高平移,以增强模型泛化能力并减少过拟合;未采用垂直翻转。完整的数据增强参数及实现细节见补充文件1。预处理后的数据用于训练多个深度学习模型,以实现特征提取与预测。所有基础模型及CARE-MIRV-Net元学习器均采用统一配置进行训练,包括数据增强、早停机制和自适应学习率调度。早停机制监控验证损失(val_loss),耐心值设为5个训练周期,并在训练结束后自动恢复最优模型权重。自适应学习率调度通过ReduceLROnPlateau回调函数实现,监控验证损失,若连续2个周期无改善,则将学习率降低为原来的0.3倍,最低学习率设为1 × 10⁻7。完整的实现细节与参数设置见补充文件1。数据集按80:20的比例随机划分为训练集和测试集,并采用固定随机种子(42)以确保实验可重复性。完整实现细节见补充文件1

机器学习工作流程图;特征:数据获取、迁移学习、SHAP分析;CLA。
图1。用于住宅平面图分析的 CARE-MIRV-Net 框架的工作流程。 所提出协议的示意图概述。该工作流程包括:(1)数据集获取与预处理,(2)使用 MobileNetV2、InceptionV3、ResNet101 和 VGG16 进行特征学习与预测,(3)基于堆叠的元集成预测(CARE-MIRV-Net),(4)基于规则的住宅布局分类,(5)基于 SHapley 可加性解释(SHAP)的可解释性分析,以及(6)性能评估。请点击此处查看此图的放大版本。

在第二阶段,采用四种预训练的卷积神经网络(CNN)MobileNetV2、InceptionV3、ResNet101 和 VGG16 作为基础学习器。每个模型均通过迁移学习进行微调,以预测关键的建筑属性,包括建筑面积(平方英尺)、卧室数量、浴室数量以及车库数量。对于每个迁移学习模型,其底层的预训练层保持冻结,而上层结构及自定义回归头则在训练过程中进行微调。详细的模型特异性微调配置见补充文件1。这些模型能够捕捉空间信息的不同方面:MobileNetV2 提供高效的特征提取能力,InceptionV3 能够捕获多尺度的空间模式,ResNet101 可学习深层的层次化表征,而 VGG16 则确保特征学习的稳定性与一致性。这些模型之间的多样性增强了整个框架的整体表征能力。

为了进一步提高预测的准确性和鲁棒性,提出了一种基于堆叠的元集成模型,记为 CARE-MIRV-Net。在此步骤中,将所有基础模型的预测结果进行汇总,以构建更高维度的特征空间,并将其输入至元学习器。首先,使用训练好的 MobileNetV2、InceptionV3、ResNet101 和 VGG16 模型独立生成基础模型的预测结果。随后,将这些预测结果拼接起来,形成元学习器所使用的元特征向量。为防止数据泄露,训练集与测试集被严格分离,且元学习器仅基于训练数据生成的预测结果进行训练。该元模型是一个全连接神经网络,旨在学习基础模型输出的最优组合,以生成更精确的预测结果。元模型包含两个全连接层,分别具有 512 和 256 个神经元,采用 ReLU 激活函数,后接 Dropout 层(丢弃率分别为 0.4 和 0.3)以及一个线性输出层。模型使用 Adam 优化器(学习率 = 0.0001)、批量大小为 32,并最多训练 15 个轮次。通过监控验证损失(val_loss)并设置 5 个轮次的等待期,实现早停策略。最小改进阈值(min_delta)设为 TensorFlow 默认值 0,并在训练结束后自动恢复最佳模型权重。采用 ReduceLROnPlateau 回调函数实现自适应学习率调度,该回调函数监控验证损失,并在连续 2 个轮次无性能提升时将学习率降低为原来的 0.3 倍。最小学习率设置为 1 × 10⁻7,冷却期参数(cooldown)采用 TensorFlow 默认值 0。该集成方法通过多种网络架构的互补优势,降低了单个模型的偏差,提升了泛化能力。详细的实现信息见补充文件 1

预测完成后,添加一个解释层,将数值输出转换为应用层面的决策。根据建筑特征的预测结果,住宅布局可被划分为三类:老年照护型、医疗整合型(医疗服务)和普通居住型。该分类基于预测的建筑面积、卧室数量和卫生间数量,采用预定义的基于阈值的决策规则进行。最终分类结果取分数最高的类别;若出现分数相同的情况,则选择满足决策条件数量更多的类别。完整的评分规则与分类阈值详见补充文件2算法1)。此步骤使该框架能够为住宅建筑设计提供实用信息。

该框架采用基于SHAP的可解释人工智能(AI)技术,以提供透明性和可解释性。该组件用于分析每个基模型对元模型输出的预测贡献。SHAP分析使用SHAP KernelExplainer(SHAP版本0.51.0),以随机选取的100个训练样本作为背景数据集,并使用50个测试样本生成解释结果。完整的SHAP配置,包括背景样本选择和实现设置,详见补充文件1。可解释性层通过测量特征重要性并展示贡献模式,有助于理解决策过程,从而提升模型的透明度和可靠性。所提出的框架通过平均绝对误差(MAE)和R2在所有目标变量上进行评估。对于多输出预测,MAE计算为所有目标变量中实际值与预测值之间的平均绝对差异,而R2则通过比较各输出的预测解释方差与对应真实值来计算。定量与定性分析结果表明,所提出的CARE-MIRV-Net能够提高预测准确性,并支持基于规则的住宅布局分类。分类可靠性基于底层回归预测的准确性和基于规则的决策层的一致性进行评估。该框架是一种适用于智能平面图分析的合适且可扩展的解决方案,可应用于智能住宅、养老规划及医疗导向型住宅设计。本研究中使用的所有数据集、软件包、库、硬件资源和计算工具的完整列表见于材料表。用于复现所报告工作流程的源代码、环境配置信息、软件依赖说明及实现脚本均提供在补充文件1中。

实验方案的算法

该框架采用多阶段方法处理住宅建筑的基于图像的平面图,并生成预测性与决策级输出,如补充文件2中的算法1所示。该过程首先进行数据预处理,将输入图像调整为标准分辨率并进行归一化,以确保数据集的一致性。所有平面图图像均被调整为224 × 224像素,并归一化至[0, 1]范围。此步骤优化了图像以适应深度神经网络的学习,并提升了模型的整体收敛性。第二阶段涉及使用多个深度学习模型作为基础学习器,包括MobileNetV2、InceptionV3、ResNet101和VGG16。每个模型独立接收输入图像,并估计重要的建筑特征,如建筑面积、卧室数量、浴室数量和车库数量。数据集以80:20的比例随机划分为训练集和测试集,并采用固定随机种子以确保结果可重复。这些模型捕捉平面图的不同空间特性,并提供互补的预测结果。随后通过堆叠各基础模型的输出构建特征表示,形成单一的特征表达。该联合输出随后被输入至元集成模型CARE-MIRV-Net,该模型被训练用于整合所有基础模型的预测结果。基础模型的预测结果被独立生成并拼接,形成元特征向量。通过严格分离训练集与测试集,防止了数据泄露。元模型进一步优化这些预测,生成最终的建筑属性预测结果。元模型由全连接层组成,包含512和256个神经元,采用ReLU激活函数,dropout率分别为0.4和0.3,使用Adam优化器(学习率 = 0.0001),批量大小为32,最多训练15个epoch,并采用早停策略。预测完成后,通过决策层对结果进行上下文化处理。根据估计值,每个住宅布局被分类为老年照护、医疗照护或普通住宅用途。住宅类别通过基于预定义阈值的评分规则分配,这些规则源自预测的平面图属性。得分最高的类别被选为最终分类结果。算法1补充文件2)中提供了完整的分类阈值与决策规则。最后,该框架引入基于SHAP的可解释性组件,以评估每个基础模型对最终预测的影响。SHAP分析按照先前描述的方法及补充文件1中的说明执行。该组件提高了模型透明度,并有助于理解决策过程。所提出方法的有效性与可行性通过标准回归性能指标进行评估。性能评估基于单次实验运行,并采用固定随机种子。

评估模型

本节介绍研究中使用的深度学习模型,包括各个基础模型以及所提出的 CARE-MIRV-Net 模型。基准模型的选择旨在代表多样化且广泛应用的深度学习架构。MobileNetV2 因其轻量化和计算高效性被纳入,InceptionV3 则因其能够捕捉多尺度空间特征而被选用。ResNet101 凭借其深层残差学习能力,适用于分层特征提取,而 VGG16 作为一种成熟的卷积架构也被纳入比较。所有基准模型均采用相同的预处理流程、数据增强设置、数据集划分、优化参数、批量大小及训练配置,以确保公平的对比评估。

MobileNetV2:

MobileNetV2 是一种小型且紧凑的卷积神经网络系统,设计上追求高速度、高性能以及较低的计算复杂度。该网络引入了若干重要创新,例如倒残差连接和线性瓶颈结构,有助于实现高效的特征提取,同时保持强大的表征能力。MobileNetV2 采用深度可分离卷积,可显著减少传统卷积网络的参数总量和计算成本,因此非常适用于大规模基于图像的学习任务。

在所提出的框架中,MobileNetV2 被用作基础深度学习模型之一,用于预测住宅平面图图像的建筑属性。由于其高效的结构设计,该模型能够有效学习平面图中出现的空间模式,如房间分布、布局密度和结构组织。这些学习到的表征在准确估计关键特征(如建筑面积、卧室数量、浴室数量和车库数量)方面起着重要作用。MobileNetV2 是一种轻量级模型,非常适合纳入所提出的元集成框架中。它为其他深度学习模型提供了互补的特征表征,增强了系统的整体鲁棒性和泛化能力。该模型的学习对于提高预测准确性以及辅助基于医疗健康的住宅设计分类具有重要意义。

采用迁移学习策略,利用 ImageNet 数据集的预训练权重对 MobileNetV2 模型进行训练。输入图像被缩放至固定的尺寸 224 × 224 × 3,以适配网络架构。图像被调整为 224 × 224 像素,归一化至 [0, 1] 范围,并通过随机翻转、旋转、缩放和位移进行数据增强。训练过程中使用 32 的批量大小。移除 MobileNetV2 原始的分类头,并替换为回归头。该回归头由一个全局平均池化层(Global Average Pooling)组成,后接包含 512 和 256 个神经元的全连接层、批归一化(batch normalization)、丢弃率分别为 0.4 和 0.3 的 Dropout 层,以及一个包含四个神经元的线性输出层。为促进领域自适应,冻结了底层的预训练层,而从 block_13_expand 开始的上层结构及自定义回归头则进行微调。这种选择性训练策略使模型在保留通用视觉特征的同时,学习平面图图像的特定领域空间特征。提取的特征图通过全局平均池化层处理,再经由使用 ReLU 激活函数的 512 和 256 个神经元的全连接层。为增强泛化能力并减少过拟合,引入了批归一化和 Dropout 层(丢弃率分别为 0.4 和 0.3)。最终输出层包含四个神经元,采用线性激活,对应预测的建筑属性。优化器选用 Adam,学习率为 0.0001,并采用 TensorFlow/Keras 的默认参数(β₁ = 0.9,β₂ = 0.999,ε = 1 × 10⁻7,amsgrad = False)。对于多输出预测,通过比较每个目标变量的预测值与实际值计算 MAE 和 R2,然后在所有输出上对结果取平均。基于验证损失应用早停机制,并采用自适应学习率降低策略以提升收敛效果。训练最多进行 15 个训练轮次(epochs)。

InceptionV3:

InceptionV3 是一种深度卷积神经网络架构,能够通过并行卷积操作捕获多尺度特征。该架构基于 Inception 模块,该模块在同一层中使用多种滤波器尺寸,从而同时提取细粒度和粗粒度特征。这种架构设计使网络能够学习复杂的空间层次结构,并具有较高的计算效率。此外,InceptionV3 采用了因子分解卷积和降维技术,进一步提升了性能并降低了计算成本。

在所提出的框架中,InceptionV3 被用作高效的特征提取器,用于分析住宅平面图图像。平面图包含多种空间模式,例如房间尺寸、结构布局和连通性,因此需要多尺度特征学习。Inception 架构特别适合该任务,因为它能够同时表示局部细节(例如小房间)和全局结构(例如整体布局的组织方式)。在元集成框架的背景下,InceptionV3 为 MobileNetV2 等其他模型提供了互补的表示能力。其建模复杂空间关系的能力增强了预测的多样性,这对于提升集成模型的性能至关重要。这最终有助于更准确地预测建筑特征,并加强面向老年人友好型及医疗功能整合型住宅设计的下游分类。

采用基于 ImageNet 数据集预训练权重的迁移学习方法对 InceptionV3 模型进行训练。输入图像被缩放为 224 × 224 × 3,以确保与网络架构兼容,并保证框架内所有模型的一致性。图像被调整为 224 × 224 像素,归一化至 [0, 1] 范围,并通过随机翻转、旋转、缩放和位移进行数据增强。训练过程中使用的批量大小为 32。

移除了 InceptionV3 的原始分类层,并引入了一个自定义回归头,以实现多输出预测。该自定义回归头由一个全局平均池化层组成,随后是包含 512 和 256 个神经元的全连接层、批归一化层、丢弃层(丢弃率分别为 0.4 和 0.3)以及一个包含四个神经元的线性输出层。卷积基底部分进行微调,其中较低的预训练层保持冻结,而上层部分与自定义回归头共同微调,以学习特定领域的平面图特征,同时保留预训练期间获得的通用视觉表征。在卷积主干网络之后,全局平均池化层将特征图转换为紧凑的特征表示。随后是包含 512 和 256 个神经元的全连接层,激活函数为 ReLU。为最小化过拟合并提高泛化能力,应用了 0.4 和 0.3 的丢弃率。最终输出层包含四个神经元,采用线性激活函数,分别对应建筑面积、卧室数量、浴室数量和车库数量的预测。模型使用 Adam 优化器进行训练,学习率为 0.0001,批量大小为 32,最多训练 15 个轮次,并采用早停机制和自适应学习率降低策略,以确保稳定的收敛。

ResNet101:

ResNet101 是一种基于残差学习原理构建的深度卷积神经网络(CNN)结构,通过解决梯度消失问题,使得训练极深的网络成为可能。该网络引入了残差连接,也称为跳跃连接,使网络能够学习恒等映射,并在不同层之间保留信息。这种架构显著提高了训练的稳定性,并使模型能够学习到复杂的层次化特征。ResNet101 具有 101 层的深度表征能力,因此在需要提取更多空间特征的任务中表现非常有效。

在所提出的框架中,ResNet101 将作为高容量特征提取器,用于分析住宅平面图图像。由于其深层架构,该模型能够表征复杂的空间关系,包括房间连通性、布局复杂度以及结构变化。这些特征对于精确预测建筑面积、卧室数量、卫生间数量和车库等建筑特征至关重要。在元集成设计中,ResNet101 是一个关键组成部分,可提供深层且抽象的特征表示。相较于 MobileNetV2 等轻量级模型,ResNet101 更关注细粒度的结构特征,因此在基础学习器中具有更高的多样性。这种异质性在提升集成模型性能和实现鲁棒预测方面发挥着重要作用,尤其是在处理基于医疗需求的住宅分类任务时。

采用迁移学习方法,利用 ImageNet 数据集的预训练权重对 ResNet101 进行训练。输入图像被缩放为 224 × 224 × 3,以确保框架内所有模型在架构上的兼容性和一致性。图像被调整为 224 × 224 像素,归一化至 [0, 1] 范围,并通过随机翻转、旋转、缩放和位移进行数据增强。训练过程中使用 32 的批量大小。移除 ResNet101 原有的分类头(include_top=False),并引入自定义回归头以实现多输出预测。该回归头由全局平均池化层、两个全连接层(分别包含 512 和 256 个神经元)、批归一化、丢弃层(丢弃率分别为 0.4 和 0.3)以及一个包含四个神经元的线性输出层组成。为平衡特征重用与领域适应,冻结了较低层的预训练层,而从 conv4_block1_1_conv 开始的深层网络及自定义回归头则进行微调。这种选择性训练策略使模型在保留通用视觉特征的同时,将高层表示适应于平面图图像。卷积基底的输出通过全局平均池化层生成紧凑的特征表示,随后接入使用 ReLU 激活函数的 512 和 256 个神经元的全连接层。应用批归一化以稳定学习过程,并引入丢弃率为 0.4 和 0.3 的丢弃层以减少过拟合并提升泛化能力。最终输出层包含四个神经元,分别以线性激活对应建筑面积、卧室数量、浴室数量和车库数量。优化器采用 Adam,学习率为 0.0001,具体参数如训练配置所述。数据增强包括随机翻转、旋转、缩放和位移,以提升模型泛化能力。训练最多进行 15 个周期,并根据验证损失采用早停机制及自适应学习率降低策略。

VGG16:

VGG16 是一种深度卷积类型的简单神经网络架构,在视觉识别任务中具有高效且简洁的特点。该网络由 16 层组成,采用规则且统一的设计,使用较小的 3 × 3 卷积滤波器,有助于网络学习分层的特征表示。该架构注重深度且结构简单,能够捕捉低级细节(如边缘和纹理)以及高级语义结构。由于其规则的设计和良好的性能,VGG16 已成为在图像相关任务中进行迁移学习时广泛采用的骨干网络。

在建议的模型中,VGG16 被用作基线深度学习模型,以提取住宅平面图图像的空间特征。其结构的规整性使其在捕捉布局模式的细微细节(如房间边界、结构对齐和空间组织)方面非常有效。这些特征对于准确预测建筑属性(如面积、卧室数量、浴室数量和车库)至关重要。在元集成系统中,VGG16 提供了稳定且具有良好泛化能力的特征表示。与更深层的架构(如 ResNet101)和多尺度架构(如 InceptionV3)相比,VGG16 在特征提取方面提供了更均衡的方法,从而增加了基学习器的多样性。这种异质性对于提升集成模型的性能以及实现面向医疗保健的住宅分类的可靠预测至关重要。

采用迁移学习方法,利用 ImageNet 数据集的预训练权重对 VGG16 模型进行训练。输入图像被缩放至 224 × 224 × 3,以确保与模型架构的兼容性以及框架内所有模型之间的一致性。图像被调整为 224 × 224 像素,归一化至 [0, 1] 范围,并通过随机翻转、旋转、缩放和位移进行数据增强。训练过程中使用 32 的批量大小。移除原始分类层(include_top=False),并添加自定义回归头,以使模型适用于多输出预测任务。该回归头由一个全局平均池化层组成,随后是包含 512 和 256 个神经元的全连接层、批归一化层、丢弃率分别为 0.4 和 0.3 的 Dropout 层,以及一个包含四个神经元的线性输出层。底层的预训练参数被冻结,而从 block4_conv1 层开始的所有层及自定义回归头则进行微调。该策略使模型在保留通用视觉特征的同时,学习与平面图分析相关的领域特定表征。卷积基底的输出特征通过全局平均池化层生成紧凑的特征向量。随后是使用 ReLU 激活函数的 512 和 256 个神经元的全连接层。引入批归一化和丢弃率分别为 0.4 和 0.3 的 Dropout 层,以稳定训练过程、减少过拟合并提升泛化能力。最终输出层包含四个神经元,采用线性激活,分别对应建筑面积、卧室数量、浴室数量和车库的预测。优化器采用 Adam,学习率为 0.0001,具体参数如训练配置所述。数据增强包括随机翻转、旋转、缩放和位移,以提升模型的泛化能力。训练最多进行 15 个轮次,并根据验证损失采用早停机制和自适应学习率降低策略。

CARE-MIRV-Net(提出的元集成深度学习模型):

所提出的CARE-MIRV-Net(基于上下文感知的住宅集成模型,结合MobileNetV2、InceptionV3、ResNet101和VGG16网络)是一种基于堆叠的元集成深度学习框架,旨在通过住宅平面图图像提升对建筑特征的预测能力。该架构通过利用多种异构卷积神经网络(CNN)在特征提取方面的协同优势,实现性能增强。所提出的模型融合了轻量级、深层及多尺度网络结构,从而提高了预测性能,并在多种住宅布局中表现出良好的鲁棒性。与传统的单一模型方法不同,CARE-MIRV-Net采用分层学习策略:基础模型首先生成初步预测结果,随后由元学习器进一步优化这些预测。

在进行注重空间利用和健康需求的住宅设计时,正确解读平面布局至关重要。单一的深度学习模型通常难以泛化不同的建筑模式。本文提出的框架通过采用四种不同的网络架构——MobileNetV2、InceptionV3、ResNet101 和 VGG16,克服了这一局限性,这些架构各自具备独特的表征能力。MobileNetV2 能够高效提取特征且模型轻量;InceptionV3 可在多个尺度上学习空间模式;ResNet101 能够学习深层的层次化表征;VGG16 则能够稳定可靠地学习特征。结合这些模型的优势,使该框架能够同时捕捉局部与全局空间特征,从而提高对住宅面积、卧室数量、浴室数量以及车库数量等特征预测的准确性与可靠性。上述预测结果还可进一步用于对住宅布局进行分类,包括适老化住宅、医疗功能整合型住宅以及普通住宅。

CARE-MIRV-Net 采用基于两阶段堆叠的集成策略实现。在第一阶段,四个基础模型独立生成目标变量的预测结果。元学习器的输入是通过拼接基础模型在训练数据上产生的预测输出而生成的。这些拼接后的预测结果构成了用于元模型训练的16维元特征向量。通过严格分离训练集与测试集来防止信息泄露,在基础模型或元模型训练过程中均未使用任何测试样本。堆叠过程中使用了与基础模型相同的训练和验证数据集。在训练和推理阶段,均通过拼接 MobileNetV2、InceptionV3、ResNet101 和 VGG16 四个模型生成的预测输出,构建16维元特征向量。由于每个模型生成一个四维输出向量,拼接后的表示形成元学习器的16维输入。该变换整合了所有基础模型的预测结果,并作为框架第二阶段的输入。第二阶段构建一个全连接神经网络作为元学习器,以学习基础模型预测结果的最优组合。元学习器包含具有512和256个神经元的全连接层、ReLU激活函数、批归一化、0.4和0.3的dropout率,以及一个包含四个神经元的线性输出层。在全连接层之后分别应用dropout率为0.4和0.3的dropout层,以减少过拟合并提升泛化能力。元模型使用Adam优化器进行训练,学习率为0.0001,批量大小为32,最多训练15个epoch,并采用早停机制和自适应学习率降低策略。验证数据用于监控训练过程中的模型性能,并选择表现最佳的模型。训练完成后,元集成模型通过融合所有基础学习器的输出生成最终预测结果。采用平均绝对误差(MAE)和决定系数(R)评估 CARE-MIRV-Net 的性能。对于多输出预测任务,MAE 和 R2 通过比较每个目标变量的预测值与真实值,然后对所有输出的结果取平均计算得到。实验结果基于固定随机种子的单次运行获得。所提出的框架通过堆叠机制融合多种深度学习结构,提升了预测能力,并实现了对住宅平面图的可解释性分析。这使得 CARE-MIRV-Net 可应用于面向老年群体和医疗保健需求的住宅设计场景。源代码、环境配置信息、软件依赖说明及实现文档详见 补充文件1

性能评估

对所提出的框架进行性能分析,以确定其在不同架构特征下的预测能力、鲁棒性及泛化性能。通过定量与定性分析,验证所提出模型的有效性。评估过程采用标准回归指标以及受控实验环境,以实现与基线模型的公平比较。实验采用单次运行并固定随机种子,以确保所有基准模型与所提出模型之间结果的可重复性与一致性。

性能参数:

采用两种广为人知的回归评估指标——平均绝对误差(MAE)和决定系数(R2),用于评估所提出框架的性能。MAE 衡量预测误差的平均绝对大小,能够清晰反映预测值与实际值之间的接近程度。相反,R2 值用于评估模型对目标变量变异性的解释比例,反映其整体预测能力。结合使用这两个指标,可全面评估所有预测建筑特征的准确性与泛化性能。对于多输出预测,通过比较每个目标变量的预测值与实际值,分别计算 MAE 和 R2,然后在所有输出结果上取平均值。

实验设置:

实验在基于云计算的环境中使用 Python(版本 3.12.12)进行。所提出的协议使用 TensorFlow(版本 2.19.0)、Keras(版本 3.13.2)、NumPy(版本 2.4.6)、Pandas(版本 2.3.3)、Scikit-learn(版本 1.6.1)、Matplotlib(版本 3.9)和 SHAP(版本 0.51.0)实现。计算环境采用主频为 2.20 GHz 的 Intel Xeon 处理器,配备约 31 GB 系统内存。实验在搭载 NVIDIA Tesla T4 × 2 GPU 的 Ubuntu 22.04 LTS 操作系统上进行。数据集包含 2,640 张住宅平面图图像,经过预处理后被划分为训练集和测试集。数据集按 80:20 的比例划分,得到 2,112 个训练样本和 528 个测试样本。MobileNetV2、InceptionV3、ResNet101 和 VGG16 是四种采用迁移学习中的微调方法进行训练的深度学习模型。随后构建了一个基于堆叠的元集成模型 CARE-MIRV-Net,用于整合这些基础模型的预测结果。所有模型均在统一条件下进行训练,包括将图像调整为 224 × 224 像素、数据增强以及采用早停机制以减少过拟合。数据增强包括随机翻转、旋转、缩放和位移。训练时采用 32 的批量大小,最多训练 15 个周期,并根据验证损失实施早停和自适应学习率降低。最终分析在一个隐藏测试集上进行,以提供对模型性能的无偏且可靠的评估。该隐藏测试集在初始数据集划分阶段生成,在整个模型训练与开发过程中始终保持完全隔离,以确保性能评估的公正性。

数据集描述:

支持本研究发现的数据集已公开发布在 Kaggle 平台上,标题为 “Floor Plan Images and Their Details”28。该数据集可通过以下网址获取:https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details(访问时间:2026年4月16日)。数据集包含 2,640 张住宅平面图图像以及结构化的建筑元数据。每个样本均为一个独特的住宅设计方案,涵盖了不同面积、布局和空间排列的多种住宅形式。该数据集规模足以支持基于深度学习的训练,并包含多样的建筑模式。每个数据样本由一张二维平面图图像及相关数值属性组成,用于描述住宅的结构特征。这些特征包括总面积(平方英尺)、卧室数量、浴室数量以及车库数量。此外,每条记录均包含图像路径,可实现视觉输入与标签之间的直接映射。数据集变量包括平面图图像、图像路径、面积(平方英尺)、卧室数量、浴室数量和车库数量。其中,平面图图像作为输入特征,建筑属性则作为预测目标。因此,该数据集适用于监督学习任务,图像作为输入特征,建筑属性作为回归目标。

该数据集包含多种住宅布局,从房间较少的紧凑型布局到多房间的大型布局均有涵盖。这种多样性有助于学习有意义的空间表征,包括房间分布、布局密度和结构复杂性。这种多样性对于所提出的框架尤为重要,因为它支持将平面图分类为适老型、医疗整合型和普通住宅布局。在模型训练之前,数据集需经过一系列预处理步骤,以确保与深度学习模型的一致性和兼容性。所有图像在训练前均被调整为224 × 224像素,并归一化至[0, 1]范围。随后,数据集通过将图像路径与其对应的元数据进行匹配来组织,并划分为训练集和测试集,以便进行性能分析。数据集采用80:20的划分比例随机分为训练集和测试集。分析中仅包含图像和元数据信息完整的记录,不完整或无效的记录则被排除。在数据集划分过程中使用了固定的随机种子,以确保结果的可重复性。该数据集为人工智能驱动的住宅平面图分析提供了详实的基础。2,640张标注图像与多样化的建筑属性相结合,支持多输出回归建模,并实现了空间智能与面向医疗的住宅设计决策的融合。

访问受限。请登录或开始试用以查看此内容。

结果

开展了一系列实验,以评估所提出的框架,实验中使用了四种深度学习模型,即MobileNetV2、InceptionV3、ResNet101和VGG16,以及所提出的CARE-MIRV-Net元集成模型。

数据集获取与预处理结果

预处理阶段旨在为使用深度学习模型进行训练和评估准备原始平面图图像及相关元数据。数据集来自Kaggle资源库,包含2,640个样本。每个样本由一张平面图图像及其对应的建筑属性组成。仅保留与分析相关的列,包括图像路径、面积(平方英尺)、卧室数量、浴室数量和车库数量,同时删除不完整或空白的记录,以确保数据的一致性和质量。为便于模型的训练与评估,数据集按80:20的比例划分为训练集和测试集,最终得到2,112个训练样本和528个测试样本。在数据集划分过程中使用了固定的随机种子,以确保结果可重复。该划分方式保证了模型在足够大的数据集上进行训练,同时保留了独立的测试集用于客观的性能评估。通过将每条记录映射至数据集目录中的对应位置,对图像路径进行了标准化处理。四个建筑属性(面积、卧室数...

访问受限。请登录或开始试用以查看此内容。

讨论

本研究提出了CARE-MIRV-Net,一种基于堆叠的元集成深度学习框架,用于住宅平面图图像的自动化分析。该框架集成了四种互补的卷积神经网络(CNN)架构——MobileNetV2、InceptionV3、ResNet101和VGG16,用于预测关键建筑属性,包括建筑面积(平方英尺)、卧室数量、浴室数量以及车库数量。这些预测结果随后通过一个元学习器进行融合,并输入基于规则的决策层,以将住宅布局分类为适老型照护、医疗照护或普通住宅类别。通过结合预测建模、集成学习与可解释人工智能技术,该方法为住宅平面图分析提供了一个统一的框架3,7,17,20

代表性结果表明,与单个基础模型相比,CARE-MIRV-Net 在多个架构属性上均实现了更优的预测性能。该集成框架通常可降低预测误差并提高 R2

访问受限。请登录或开始试用以查看此内容。

披露

利益冲突:

作者声明无利益冲突。

作者贡献:

Ning Zhang 提出研究思路,设计实验方案并协调研究过程。Yu Bi 开展实验,收集数据,参与数据分析及论文修改工作。

致谢

作者衷心感谢吉林省教育厅科学研究项目提供的经费支持。

资助:

本研究由吉林省教育厅科学研究项目(项目编号:JJKH20240801KJ)提供经费支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
CARE-MIRV-Net 实现包补充文件 1版本 1.0N/A
图表重生成脚本补充文件 1版本 1.0N/A
楼层平面图图像及其详细信息数据集Kaggle公开数据集N/A
GPUNVIDIA CorporationTesla T4 × 2N/A
Intel Xeon 处理器Intel Corporation2.20 GHzN/A
KerasKeras Team版本 3.13.2RRID:SCR_008624
MatplotlibMatplotlib 开发团队版本 3.9RRID:SCR_008624
NumPyNumPy 开发者版本 2.4.6RRID:SCR_008633
操作系统LinuxUbuntu 22.04 LTSN/A
PandasPandas 开发团队版本 2.3.3RRID:SCR_018214
PythonPython 软件基金会版本 3.12.12RRID:SCR_008394
Scikit-learnScikit-learn 开发者版本 1.6.1RRID:SCR_002577
SHAPSHAP 开发团队版本 0.51.0N/A
系统内存 (RAM)云计算环境31 GBN/A
TensorFlowGoogle版本 2.19.0RRID:SCR_016345
训练环境配置文件补充文件 1版本 1.0N/A

参考文献

  1. Apanavičienė R, Shahrabani MMN. Key factors affecting smart building integration into smart city: technological aspects. Smart Cities. 2023;6(4):1832-1857.
  2. Li J, et al. The relationship between artificial intelligence (AI) and building information modeling (BIM) technologies for sustainable building in the context of smart cities. Sustainability. 2024;16(24):10848.
  3. Khade R, Jariwala K, Chattopadhyay C. A comprehensive survey of floor plan image analysis and related applications. Int J Doc Anal Recognit. 2026;29(1):41-59.
  4. Okuyucu EB, Kösenciğ KÖ. AI-assisted floor plan design incorporating structural constraints. Nexus Netw J. 2025;27(4):947-963.
  5. Kim H. Evaluation of deep learning-based automatic floor plan analysis technology: an AHP-based assessment. Appl Sci. 2021;11(11):4727.
  6. Goyal S, Chattopadhyay C, Bhatnagar G. A computational approach to understand building floor plan images using machine learning techniques. In: Internet of Multimedia Things. Elsevier; 2022. p. 233-259.
  7. Li Y, Chen H, Yu P, Yang L. A review of artificial intelligence in enhancing architectural design efficiency. Appl Sci. 2025;15(3):1476.
  8. Yıldız B, Çağdaş G, Zincir I. Architectural space classification considering topological and 3D visual spatial relations using machine learning techniques. Build Res Inf. 2024;52(1-2):68-86.
  9. Albukhari IN. The role of artificial intelligence (AI) in architectural design: a systematic review of emerging technologies and applications. J Umm Al-Qura Univ Eng Archit. 2025;16(4):1457-1476.
  10. Kumar H, KS KM, SAS AR, VC J. Explainability to image captioning models: an improved post-hoc approach through Grad-CAM. In: 2025 International Conference on Innovation in Computing and Engineering (ICE); 2025. p. 1-6. Available from: https://doi.org/10.1109/ICE63309.2025.10984143
  11. Alshammeri M, Ahmad Z, Humayun M, Alamri M. Explainable cluster-based predictive framework for early diagnosis of autism spectrum disorder using behavioral biomarkers. Diagnostics. 2025;15(24):3241.
  12. Zhao T, Zhao Y, Zhou T. Stacking ensemble learning for seabed sediment classification. In: 2024 7th International Conference on Information Communication and Signal Processing (ICICSP); 2024. p. 211-215. Available from: https://doi.org/10.1109/ICICSP62589.2024.10809036
  13. Bazie IG, et al. Leveraging machine learning techniques in converting 2D floorplans images to 3D models: applications, challenges, and future directions. Procedia Comput Sci. 2025;272:234-241.
  14. Luo G, et al. Controllable and flexible residential floor plan layout design based on multi-agent deep reinforcement learning with layout prior size and similar experience abandon. Adv Eng Inform. 2025;68:103702.
  15. Ling H, Luo G, Zhou N, Jiang X. Survey of architectural floor plan retrieval technology based on 3ST features. AI. 2025;6(4):67.
  16. Memon SA, Shehata W, Rowlinson S, Sunindijo RY. Generative artificial intelligence in architecture, engineering, construction, and operations: a systematic review. Buildings. 2025;15(13):2270.
  17. Yang C, et al. How can SHAP (SHapley Additive exPlanations) interpretations improve deep learning-based urban cellular automata model? Comput Environ Urban Syst. 2024;111:102133.
  18. Mienye ID, Swart TG. A comprehensive review of deep learning: architectures, recent advances, and applications. Information. 2024;15(12):755.
  19. van Engelenburg C, et al. MSD: a benchmark dataset for floor plan generation of building complexes. In: Vedaldi A, Bischof H, Brox T, Frahm JM, editors. Computer Vision – ECCV 2024. Lecture Notes in Computer Science. Cham: Springer Nature Switzerland; 2025. p. 60-75.
  20. Ganaie MA, et al. Ensemble deep learning: a review. Eng Appl Artif Intell. 2022;115:105151.
  21. Zhou W, et al. HIDIM: a novel framework of network intrusion detection for hierarchical dependency and class imbalance. Comput Secur. 2025;148:104155.
  22. Carrera L, et al. The impact of architecturally qualified data in deep learning methods for the automatic generation of social housing layouts. Autom Constr. 2024;158:105238.
  23. Yang B, et al. Automated semantics and topology representation of residential-building space using floor-plan raster maps. IEEE J Sel Top Appl Earth Obs Remote Sens. 2022;15:7809-7825.
  24. Rathnayake N, Rathnayake U, Dang TL, Hoshino Y. An efficient automatic Fruit-360 image identification and recognition using a novel modified cascaded-ANFIS algorithm. Sensors. 2022;22(12):4401.
  25. Alsulami AA, et al. Security strategy for autonomous vehicle cyber-physical systems using transfer learning. J Cloud Comput. 2023;12(1):181.
  26. Alshammari A. Construction of VGG16 convolution neural network (VGG16_CNN) classifier with NestNet-based segmentation paradigm for brain metastasis classification. Sensors. 2022;22(20):8076.
  27. Mascarenhas S, Agarwal M. A comparison between VGG16, VGG19 and ResNet50 architecture frameworks for image classification. In: 2021 International Conference on Disruptive Technologies for Multi-Disciplinary Research and Applications (CENTCON); 2021. p. 96-99. Available from: https://doi.org/10.1109/CENTCON52345.2021.9687944
  28. Kaggle. Floor Plan Images and Their Details [Internet]. Available from: https://www.kaggle.com/datasets/adilmohammed/floor-plan-images-and-their-details. Accessed 2026 Apr 16.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

233 233
视频即将推出