研究文章

一种基于建筑结构先验知识的室内场景图像语义解析方法

30 次观看

DOI:

10.3791/72054

2026年8月11日

本文内容

摘要

本研究提出了一种算法,该算法将移窗分层变换器编码器捕获的分层视觉特征与通过线段检测生成的曼哈顿式三维边界框的先验深度紧密耦合,从而实现对复杂室内场景的高精度语义重建。

摘要

为解决复杂室内场景中因家具遮挡导致的语义预测不连续性和物理边界形变问题,本文提出一种利用建筑结构先验的语义解析方法。该方案采用移窗式分层 Transformer 编码器提取多尺度视觉特征,并结合梯度方向一致性线段检测算法构建曼哈顿三维边界框。该边界框在编码离散几何轮廓为连续物理势场之前,被转换为有符号距离场(SDF)先验。一种结构引导的交叉注意力机制强制视觉信号与真实的三维正交几何边界对齐,从而恢复遮挡区域内的特征连续性。由超像素节点构建的空间邻接图驱动图卷积网络(GCN)进行特征聚合,确保物理承重平面内的宏观语义一致性。像素级交叉熵损失与自定义的结构一致性损失相结合,增强了约束条件,对越界预测施加惩罚。多次独立实验结果表明,平均交并比(mIoU)达到 68.7%,标准差为 0.2%;结构边界 F1 分数达到 76.4%,标准差为 0.3%,验证了所提出模块的鲁棒性能。在单个图像节点尺寸为 256 的情况下,平均推理时间保持在 61 ms。

引言

室内场景图像的语义分析在三维空间认知与智能空间推理任务中占据核心地位1,2。在真实物理环境中,复杂的空间布局常常严重阻碍视觉特征的提取3。解决由大尺度家具遮挡引起的建筑基础结构的语义不连续性和物理边界畸变问题,对空间认知研究具有重要意义4,5。准确消除杂乱物体的干扰,恢复同一墙面和地面的物理连续性,将直接决定三维场景重建与全局空间逻辑分析的准确性6。由大尺度家具遮挡引起的语义不连续性以及所提出的建筑先验引导的结构修复效果如图1所示,其中在相同室内场景条件下,对表1A中的被遮挡红绿蓝(RGB)输入、图1B中的基线掩码畸变以及图1C中的结构先验修复结果进行了对比。

为了满足空间逻辑推理的精度要求,当前主流的像素驱动视觉网络在处理复杂室内环境时面临多重障碍7,8。室内空间通常布满密集的家具和杂乱的陈设,导致图像中低层视觉边界信号显著丢失9。传统的特征提取机制过度依赖局部二维颜色和纹理响应,缺乏对三维人造结构刚性正交规律的宏观理解10。局部感受野的这一局限性使得特征传播容易中断,难以跨越遮挡区域扩展全局拓扑结构11。目前迫切需要解决由遮挡和干扰引起的语义预测不连续以及物理边界严重畸变这一核心问题12

为解决由遮挡和干扰引起的建筑地基结构缺陷问题,学术界已开发出多种针对性的干预措施13。跨模态特征聚合网络通过引入深度图或文本先验信息辅助红绿蓝(RGB)图像,有效弥补单一视觉模态在空间感知上的固有缺陷14,15。边界感知与自适应上下文选择框架将物理轮廓增强策略注入特征解码阶段,显著提升了复杂场景下预测结果的边缘贴合度16,17。基于图卷积网络(GCN)和特征交互机制的推理模型通过构建节点级连接,显著提高了同质区域内的特征平滑性和宏观语义一致性18,19。将显式的曼哈顿结构先验整合到视觉特征提取流程中,可强加几何一致性约束,从而应对大面积前景物体遮挡所导致的特征不连续性挑战20

为解决与建筑基础设施相关的语义预测错误及物理边界严重失真这一核心难题,本文提出一种基于闭环耦合机制并融合建筑先验的语义解析框架。该框架通过在连续几何势场与离散视觉特征流形之间建立双向映射对齐关系,突破了传统工程化流程的局限,形成一种非平凡的协同机制,利用结构规律校正遮挡误差。该方案依赖多尺度视觉骨干网络和基于消失点估计的线段检测算法,以并行方式获取局部外观特征和代表曼哈顿式三维边界框的正交边缘先验,并将其转换为符号距离场(SDF)。算法采用结构引导的交叉注意力机制,将视觉特征作为查询向量,将SDF特征作为键和值进行点积计算,从而迫使视觉信号在特征空间中与真实的三维几何边界对齐。由超像素节点及空间共面性边特征构建的空间邻接图被输入图卷积网络(GCN),以实现跨节点的特征聚合与消息传递。端到端的参数优化过程联合采用像素级交叉熵损失和一种自定义的结构一致性损失函数,严格约束并惩罚跨越建筑先验边界的预测像素。完整的语义解析流程在图2中进行了总结,该图展示了RGB图像输入、几何先验提取、交叉注意力对齐、超像素图推理与语义掩码解码在统一架构内的关联关系。

早期的场景解析网络依赖卷积操作来捕捉局部外观纹理,但由于局部感受野的限制,其在大规模目标上的语义一致性表现不足21,22。先前的研究已将视觉Transformer架构中的自注意力模块应用于提取全局上下文信息,并构建像素间的长距离关联特征23,24。跨模态多视角特征聚合策略通过融合深度图点云和文本指令输入,提取场景的三维几何空间特征25,26。面向特定领域的特征融合混合注意力机制逐渐成熟,通过构建特征交互桥梁,显著降低了视觉信号在多尺度传输过程中的能量损耗与特征稀疏性,提升了复杂结构解析的鲁棒性。前沿的编码器设计联合整合并推理高频域空间细节与全局及局部特征,增强了网络对高相似性细粒度语义类别的区分能力,提高了室内场景解析的准确性27,28。近年来语义分割架构的进展为优化计算效率和空间感知能力提供了有价值的参考。针对密集预测和多尺度上下文聚合设计的模型能够从复杂背景中提取细粒度几何特征。特征解耦与协同融合策略有效缓解了边界区域的语义模糊问题。轻量化注意力机制与门控聚合模块优化了参数分布,在保留局部结构细节的同时加快了推理速度。实施这些高效架构设计为降低室内场景解析中非欧几里得拓扑推理操作的计算开销提供了理论指导。

构建结构先验和三维布局估计被用于校正局部视觉解析错误29。以往研究提取室内建筑的正交和平行几何特征作为推理约束,以减少因杂乱的室内背景导致的网络预测偏差30,31。现有方案采用线段检测算法和图像消融点分析技术生成曼哈顿三维边界框,以映射房间的物理边界,并辅助底层视觉特征的定位32。边界感知模块与多尺度上下文的联合架构将先验结构信息隐式嵌入高维特征解码过程,迫使网络输出与真实物理轮廓高度吻合的语义掩码,有效改善物体边缘的锯齿状和模糊问题33。具有边界增强特性的半监督或弱监督损失函数设计已被广泛研究。通过依赖严格的数学公式惩罚违反空间拓扑规则的独立像素分类行为,从梯度优化源头保障最终分割结果的几何平滑性和结构完整性34

一些研究采用图神经网络在高维空间中对视觉特征进行跨域聚合,并推理拓扑关系35。超像素分割算法将具有相似颜色响应和纹理特征的相邻像素块预先聚合为独立的连通节点。该超像素分割算法在图像层面压缩了图结构的计算冗余,同时保留了图像的基本几何拓扑结构36。基于高维节点特征向量构建的图卷积网络(GCN),利用表示空间邻近性的邻接矩阵,驱动多尺度视觉信息在空间域中沿物理连接图进行高效的方向性传输与交互融合37,38。时间信息增强模块与混合多尺度跳跃连接机制的应用,抑制了在多层深度消息传递过程中产生的节点特征过度平滑与均质化现象39。多尺度图小波变换技术及伪标签元素学习优化策略,优化了节点特征更新公式中的抗背景噪声机制,使具有相同语义属性的特征在复杂网络拓扑中保持协同响应模式40。基于图的推理机制将规则像素网格映射到非欧几里得拓扑空间,以实现对不规则建筑结构及内部构件的特征聚合计算41

方案

在网络训练开始前,已准备好室内RGB场景数据集及其语义标注。大规模室内3D数据集和RGB-D室内场景数据集(参见材料表)均从其官方存储库获取。为匹配目标解析场景,保留了包含家具遮挡、光照变化、墙体边界中断及复杂空间布局的室内采集场景。语义标签被转换为索引化的单通道PNG标注掩码,所有RGB图像和语义掩码均调整至512 × 512像素尺寸。训练期间应用了在线数据增强,包括概率为0.5的随机水平翻转、0.8至1.2之间的随机亮度缩放以及-10°至+10°之间的随机旋转,以拓宽结构布局分布。RGB通道使用均值0.485、0.456、0.406和标准差0.229、0.224、0.225进行归一化处理。大规模室内3D基准遵循本研究采用的官方发布划分,使用1201个训练场景和312个验证场景进行模型开发与验证。RGB-D室内场景基准遵循官方评估协议,包含795张训练图像和654张测试图像。未对这两个公开基准进行额外的百分比划分。

采用一个移位窗口分层 Transformer 视觉骨干网络(参见材料表)作为移动窗口 Transformer 编码器骨干进行初始化。补丁嵌入尺寸配置为 4 x 4 像素。四个分层阶段的嵌入维度分别设置为 128、256、512 和 1024,四个阶段中的 Transformer 块数量设置为 2、2、18 和 2。局部注意力窗口大小设置为 7 x 7,四个分层阶段的注意力头数量分别设置为 4、8、16 和 32。所有多层感知器层内部均使用非线性连续激活函数。在每个分层阶段之后,通过步长为 2 的补丁合并操作进行空间下采样。核心网络架构和卷积推理模块的超参数总结于表 1中。

随后对输入特征图执行移位窗口自注意力特征提取。每个特征图被划分为空间尺寸为 7 × 7 的非重叠局部窗口。规则窗口注意力与移位窗口注意力在相邻的移位窗口变换器块之间交替进行。循环移位距离设置为 3 像素,并在每个局部注意力窗口内应用相对位置偏置编码。通过多头自注意力聚合局部视觉特征,以生成层次化的多尺度特征表示。

曼哈顿结构先验信息从室内 RGB 图像中提取。结构边缘线段采用梯度方向一致性线段检测算法进行检测。主导结构方向通过基于消失点估计的随机抽样一致(RANSAC)算法(参见材料表)进行聚类。重建三个相互正交的曼哈顿方向,以生成曼哈顿三维边界框表示。通过计算每个像素到最近边界线段的最小欧几里得距离,将重建的结构边界转换为符号距离函数(SDF)图。

在获得视觉特征与符号距离函数先验后,生成了结构引导的交叉注意力特征。视觉特征流形通过线性变换矩阵 figure-protocol-1 映射为查询张量 Q。连续距离场先验通过变换矩阵  figure-protocol-2 映射为键张量 K 与值张量 V,模型维度设置为 512。多头调制将投影空间划分为 8 个独立的子空间,每个头的维度为 64。空间布局先验将离散像素坐标投影至连续势场,并生成结构亲和矩阵 S 作为显式加性空间偏置,用于调制点积相似度矩阵。选择视觉特征张量作为查询源,是因为语义解析要求每个视觉位置主动从几何先验空间中检索结构一致的证据。符号距离函数先验被用作键和值源,因为它存储了源自曼哈顿布局的连续边界距离与内外结构线索。点积项度量了语义外观与几何先验之间的兼容性,而加性结构项 λS 则将注意力权重向同一物理平面或邻近同一建筑轮廓的像素偏移。系数 λ 表示对提取的结构先验的置信度,并控制刚性正交约束被纳入注意力分布的程度。此公式减少了由家具遮挡引起的跨边界特征扩散,并在非曼哈顿布局中保留了自适应松弛。结构引导的注意力分布根据公式 1 计算。

公式 1: figure-protocol-3

其中 A 表示结构引导的注意力聚合矩阵,Q 表示由视觉特征生成的查询张量,K 表示由 SDF 先验特征生成的键张量,V 表示由结构先验表示生成的值张量,dk 表示键张量的特征维度,λ 表示用于识别局部区域几何置信度并在非曼哈顿空间布局中放宽刚性正交约束的自适应结构加权系数,S 表示 SDF 亲和矩阵。除以 dk 的操作稳定了注意力逻辑值的尺度,防止了因特征维度较大而产生过度集中的注意力权重。归一化指数函数(参见材料表)将调制后的相似性分数转换为归一化的空间分布,使得每个像素能够基于语义和几何一致性聚合结构先验信息。这一设计解释了为何视觉外观和建筑边界先验是在注意力层面融合,而非通过直接的特征拼接。

超像素拓扑图由结构对齐的特征图构建而成。特征图使用空间区域生成算法进行分割。超像素数量设置为256,紧凑度系数设置为10,高斯平滑系数设置为1.0,迭代次数设置为10。在聚类过程中,通过将距离度量权重设置为特征颜色空间距离的恒定比例1.0来强制执行空间邻近约束,从而在密集杂波边界上保持均匀的节点生成。具有同质语义响应的像素被聚合成超像素节点。图边根据空间邻接关系、SDF亲和力强度以及共面几何一致性约束构建。结构亲和矩阵和拓扑连通性的构建过程如图3所示,展示了SDF引导如何转化为图级别的空间关系。

图结构表述的引入,旨在将密集的像素级推理转化为在均匀结构区域上进行节点级空间推理。每个超像素节点代表一个具有相似语义响应和空间连续性的局部区域,而每条边则代表一条受邻接性、距离场亲和性和共面一致性约束的特征传输可靠路径。该设计减少了孤立噪声像素的影响,并使被遮挡的墙壁、地板和天花板区域能够接收来自物理相邻节点的信息。因此,边的构建充当了连续符号距离场引导与离散非欧几里得图推理之间的数学桥梁。

配置了一个具有512、256和128隐藏特征维度的三层图卷积推理网络。图卷积层基于节点的空间关系在图结构上执行特征平滑。自循环邻接在消息传递过程中保留了每个节点的原始状态,防止小结构区域的特征被周围大区域抹除。对称归一化通过节点度数的逆平方根乘积来缩放邻接矩阵元素,使得在传播过程中,高度数节点和低度数节点在可比的数值量级下做出贡献。前向传播执行局部空间聚合,其中每个节点状态在应用逐元素非线性整流函数之前,从相邻的共面聚类吸收高维特征。这种表述使得图卷积层近似于沿着具有物理意义的室内平面进行语义扩散,而非跨无关物体边界进行无限制的平滑。图节点特征根据公式2进行评估。

公式 2:figure-protocol-4

从密集像素特征到超像素节点的投影、图卷积消息传递以及坐标反投影过程如图4所示,阐明了从规则图像网格到非欧几里得拓扑结构,再返回到密集语义表示的特征聚合路径。图4A中的密集像素特征到图4B中超像素节点的投影、图4C中的图卷积消息传递以及图4D中的坐标反投影,共同阐明了从规则图像网格到非欧几里得拓扑结构,再返回到密集语义表示的特征聚合路径。

其中 H(l) 表示第 l 个图卷积层的节点特征张量, 表示带自环连接的邻接矩阵,D 表示对应于邻接矩阵的度矩阵,W(l) 表示第 l 个图卷积层的可学习权重矩阵,σ 表示修正线性单元激活函数。项 ÂH(l) 聚合了来自相邻超像素节点的特征,而 D−1/2 和 D−1/2 则平衡了具有不同连接密度的节点的贡献。可学习矩阵 W(l) 将聚合后的节点特征投影到一个新的语义空间,使得图卷积层能够区分结构一致性与普通的空间邻近性。非线性激活保留了特征聚合后共面区域与非共面区域在响应上的差异。

语义分割特征在图推理后进行解码。解码器采用三个双线性插值上采样阶段和跨层跳跃连接融合操作构建。浅层空间编码器特征通过通道级融合与高层语义解码器特征拼接。特征分辨率恢复至原始图像尺寸,最终通过 1 × 1 卷积层生成语义概率预测图。

完整的语义解析网络使用解耦权重衰减优化器进行训练(参见材料表)。初始学习率设置为0.0001,权重衰减系数为0.01,两个公共基准测试的批次大小均为8。一阶矩衰减率设置为0.9,二阶矩衰减率设置为0.999,数值稳定性epsilon系数设置为1 × 10⁻8。在每个训练周期结束时监控验证损失,并在验证集上的mIoU提高时保存检查点。网络使用多项式学习率衰减策略训练了300个周期,衰减幂为0.9。使用不同的随机种子初始化进行了五次独立训练运行,以建立统计上严谨的评估基线。网络使用像素级交叉熵损失和结构一致性损失联合优化。所有实验均在配备高内存并行计算硬件的计算平台上进行,详细的硬件信息记录在材料表中。

通过计算类别概率张量的空间梯度幅度,联合优化强制了几何边界对齐。结构一致性损失被用作正则化项,将空间预测梯度的范数与连续符号距离函数值相乘。其数学原理是,语义类别变化应集中在接近真实建筑轮廓处,即符号距离函数趋近于零的位置,而平坦的墙壁、地板和天花板内部则应保持平滑的语义响应。当大的预测梯度出现在远离结构边界处时,距离场项会增加惩罚,以抑制同质物理平面内部错误的语义转换。当预测梯度出现在接近零距离轮廓处时,惩罚保持有限,从而保留沿建筑边界的合法类别转换。语义转换区域被约束为与符号距离函数的零距离轮廓对齐,如公式3所示。

公式 3:figure-protocol-5

其中 Ltotal 表示最终优化目标函数,Lce 表示像素级交叉熵损失,Lscl 表示结构一致性惩罚损失,α 表示结构损失权重系数。交叉熵项通过标注掩码提供像素级语义监督,而结构一致性项则利用建筑先验施加几何正则化。权重系数 α 平衡了类别识别与边界对齐,防止优化过程过度拟合局部标签准确性或僵化的结构轮廓。这一联合目标将视觉语义、物理边界一致性与可训练网络参数统一在一个优化目标内。

结果

实验设置

本研究采用两个标准的室内场景解析数据集、一个大规模室内三维数据集和一个RGB-D室内场景数据集,用于评估模型性能并进行调优。大规模室内三维数据集包含经过真实扫描获得的复杂物理空间场景以及高分辨率的RGB视图,提供了高精度的逐像素三维点云语义标签和二维空间投影分割掩码。其内在的真实物理空间网格重建数据和正交平面特性为提取分支中曼哈顿三维边界框的精确构建建立了几何真值比较标准。RGB-D室内场景数据集包含被家具和杂乱物体遮挡的室内深度图像,用于测试网络在全局逻辑推理方面的准确性和对遮挡的鲁棒性。

该算法采用 mIoU 来衡量预测语义分布与真实语义分布之间的空间重叠程度,同时引入结构边界 F1 分数,以严格评估预测掩码与通过符号距离函数(SDF)校准的零距离物理结构边缘之间的拟合精度。在计算过程中设定了固定的欧几里得空间像素距离误差阈值,用于判断网络生成的边缘像素是否与建筑物的真实物理边界轮廓相交。这一双重评估体系在约束大面积语义块分类误差的同时,强化了对刚性线条拓扑重建效果的微观定量评估。为保持实验数据配置与优化过程的一致性,实验所用数据集规模与核心训练超参数汇总于表 2。该表报告了修订稿件中一种权威的实验配置方案。大规模室内 3D 基准使用 1201 个训练场景和 312 个验证场景,RGB-D 室内场景基准使用 795 张训练图像和 654 张测试图像;两个基准均采用批量大小为 8、初始学习率为 0.0001、权重衰减系数为 0.01、训练周期为 300 轮的设置进行训练。

与现有先进方法的比较

在展示室内场景解析算法的定量比较表格之前,本节严格定义了多维评估系统中所使用的测试基准。为了反映模型在不同粒度下的分类性能,评估系统在测试体系中补充了两个额外指标:全局像素准确率(PixelAcc)和类别平均准确率(MeanAcc)。这些指标共同构建了一个详细的算法性能验证体系,为后续的定量分析建立了严谨的理论参考。为了评估所提出算法在复杂物理空间中的语义解析精度与遮挡鲁棒性,在RGB-D室内场景验证集上与现有算法进行了对比测试。对比模型库涵盖了基础的掩码注意力框架、分层视觉Transformer、现代纯卷积分割流水线、统一的密集预测架构以及跨通道注意力网络。基准评估进一步扩展,纳入了基于Transformer的分割基线、统一密集预测基线、统一检测与分割基线、大规模视觉基础基线、纯卷积基线、基于掩码注意力的分割基线、跨模态特征聚合基线以及渐进式特征融合基线(见材料表),所有对比均使用相同的RGB-D室内场景验证集、输入分辨率、训练计划和评估指标协议。在所提出的架构中,结构引导网络集成了移窗多尺度视觉主干、结合符号距离场(SDF)的结构引导交叉注意力模块以及超像素图卷积网络(GCN)。扩展后的对比覆盖了基于Transformer的密集预测、基于卷积的密集预测、掩码注意力解析、跨模态特征融合以及渐进式特征融合范式,从而能够在更广泛的室内场景解析基线中评估显式三维几何边界干预的贡献。

表3详细列出了各网络在核心定量指标上的客观评估性能,报告了五次独立运行的平均值及其对应的标准差。扩展的基线对比旨在评估所提出的结构引导推理机制是否能够在标准密集预测主干网络、基于掩码的分割网络以及RGB-D特征融合网络之外进一步提升精度。实验数据表明,所提出的算法在全部四项定量指标上均实现了稳定的性能提升。基于Transformer的密集预测网络和掩码注意力网络保持了较强的全局上下文建模能力,但在前景杂乱的情况下,其边界F1值仍较低,原因是预测的掩码缺乏明确的物理边界约束。跨模态与渐进式融合网络改善了局部语义连续性,但其特征融合仍主要依赖于外观和深度响应,而非带符号距离场的结构先验。所提出的结构引导网络实现了0.687的mIoU(标准差为0.002)和0.764的平均边界F1分数(标准差为0.003)。扩展对比表明,性能提升不仅源于更大的密集预测主干网络,更得益于带符号距离场引导、结构感知的交叉注意力以及基于图的拓扑推理的联合使用。

为了分析模型在遮挡条件下的全局逻辑推理准确性,我们识别并提取了验证集中被家具和其他杂物严重遮挡的典型场景,并生成了像素级预测掩膜的可视化结果。

图1图2图3图4中定义了方法流程与图推理过程后,图5展示了在极端遮挡条件下不同模型在形态预测上的差异。定性比较的网格图中红色矩形框标出了关键冲突区域,这些区域的角点和承重表面被遮挡。基于掩码注意力的分割基线模型输出的掩码表现出明显的边缘平滑和类间粘连现象。尽管跨模态特征聚合基线模型与渐进式特征融合基线模型均引入了跨模态数据,但其预测结果仍存在结构类别不连续和物理边界扭曲的问题。本研究所提出方法生成的掩码与真实标签具有较高的空间重叠度。基线模型受限于纯像素驱动机制,在发生遮挡时容易丢失局部感受野。本方法采用超像素图卷积网络(GCN)在非欧几里得空间中进行消息传递,从而在隐式几何边界引导下重建潜在的角点与线性空间骨架。这从视觉形态学角度验证了本方案在解析复杂室内布局时具备良好的抗干扰性能。

消融实验

为了分析所提出架构中各独立组件的实际贡献,本研究在RGB-D室内场景验证集上构建了扩展的模块化消融实验。实验的基线设定为仅包含基础移位窗口变换器视觉主干的常规分类网络。通过定量评估,分别测量了结构引导的交叉注意力、有符号距离场偏置、自适应结构加权、超像素图推理、共面边构建、对称图归一化以及结构一致性损失的独立贡献。这种扩展的消融设计将模块的累积增益与组件移除效应分离开来,使每个设计选择的贡献边界更加清晰。

表4图6 展示了在扩展的累积式和基于移除的消融设置下准确率的变化情况。基础的移位窗口变换器网络缺乏三维物理边界约束,导致在杂乱背景下的特征聚合能力有限。引入结构引导的交叉注意力机制后,mIoU 从 0.615 提升至 0.648,边界 F1 分数从 0.630 提升至 0.685,表明符号距离场先验有效改善了视觉特征与结构轮廓之间的对齐。单独引入超像素图推理机制时,mIoU 提升至 0.641,边界 F1 分数提升至 0.676,说明节点级拓扑推理增强了在均质物理区域上的语义一致性。单独引入结构一致性损失时,mIoU 提升至 0.632,边界 F1 分数提升至 0.662,表明该损失项主要影响边界拟合,而非广泛的上下文特征聚合。

将交叉注意力与图推理相结合,使 mIoU 提升至 0.669,边界 F1 分数提升至 0.721,表明视觉-结构对齐与图域消息传递产生了互补效应。将交叉注意力与结构一致性损失相结合,实现了 0.660 的 mIoU 和 0.713 的边界 F1 分数;而将图推理与结构一致性损失相结合,则达到了 0.653 的 mIoU 和 0.704 的边界 F1 分数。这些成对结果表明,交叉注意力模块提供了主要的几何对齐信号,图推理模块在共面区域内扩展了该信号,而结构一致性损失则在优化过程中细化了语义过渡边界。

基于移除的消融实验进一步阐明了内部设计选择的贡献。移除有符号距离场的加性偏置后,mIoU 下降至 0.656,边界 F1 分数降至 0.698,证实结构亲和矩阵在抑制跨边界特征扩散中起核心作用。移除自适应结构加权系数 λ 后,mIoU 下降至 0.671,边界 F1 分数降至 0.736,表明固定的结构约束在非曼哈顿结构和视觉退化区域中削弱了模型响应。移除共面边约束后,mIoU 下降至 0.666,边界 F1 分数降至 0.728,说明仅基于局部邻接关系构建的图边无法保持物理平面的一致性。移除对称图归一化后,mIoU 下降至 0.673,边界 F1 分数降至 0.737,表明度平衡传播对于稳定的节点聚合是必要的。所提出的完整结构引导网络实现了 0.687 的 mIoU 和 0.764 的边界 F1 分数,表明最终性能提升源于结构注意力、图推理与边界感知优化之间的协同作用。

计算复杂度、训练时间与推理效率分析

为评估 SDF 提取、结构引导的交叉注意力机制以及超像素图卷积推理的计算代价,本研究在相同的计算平台上对参数规模、浮点运算量、峰值内存占用、训练时间、单帧推理延迟、帧率和 mIoU 进行了评估。浮点运算量的计算基于 512 × 512 的输入分辨率。推理延迟在模型预热后以批量大小为 1 进行测量,而报告的帧率则由单张图像的平均延迟计算得出。训练时间在相同的 300 轮训练计划、批量大小为 8、优化器设置以及数据预处理流程下进行测量。

表5 详细列出了每种网络架构下模型规模、训练成本、推理效率与解析精度之间的关系。表5 中的 mIoU 和边界 F1 列与 表3 中对应模型的整个验证集数值相同。这两个精度指标在 表5 中重复列出,仅用于将解析精度与计算成本进行比较。可训练参数的增加主要源于结构引导的交叉注意力模块中的查询-键-值投影层以及三个图卷积层的权重矩阵。非可训练计算开销主要来自符号距离场(SDF)生成、超像素分割以及图邻接关系构建。由于这些非可训练操作对每张输入图像仅执行一次,因此它们增加了推理延迟,但并未显著增加可训练参数数量。这种分离解释了所提出方法在参数数量上仅有适度增加,但在延迟上增幅更为明显的原因。复杂度结果表明,基于掩码注意力的分割基线模型保持了较少的参数量和更短的推理延迟,但在严重遮挡情况下,由于网络缺乏显式的几何边界引导,其边界 F1 分数和 mIoU 受到限制。跨模态特征聚合基线需要更多的浮点运算和更长的训练时间,因为跨模态聚合引入了额外的特征对齐开销。渐进式特征融合基线保持了适中的计算成本,但在边界形变条件下,其预测精度仍低于所提出的方法。所提出的结构引导网络由于引入了符号距离场构建、结构交叉注意力投影、超像素图构建以及图卷积传播,因而带来了额外的计算成本。完整模型使用了 6680 万个参数、1214 亿次浮点运算、15.6 小时的训练时间、7.9 GB 的峰值内存、61 毫秒的单帧推理时间以及每秒 16.4 帧的处理速度。尽管其推理延迟高于纯掩码注意力基线模型,但该模型实现了 0.687 的 mIoU 和 0.764 的边界 F1 分数,表明所增加的计算开销主要用于支持结构边界修复和拓扑感知的语义一致性。

为了直观展示计算规模与模型分析精度之间的二维空间平衡关系,绘制了显示浮点运算次数与算法mIoU的气泡分布图。修订后的可视化图表还在图注区域报告了训练时间与推理延迟,从而能够从训练和部署两个角度对精度提升与计算成本进行比较。横轴表示浮点运算次数,纵轴表示mIoU,气泡大小代表可训练参数数量,附带的标签则标示了每种方法的推理时间。

图7展示了浮点运算次数、参数规模、推理延迟与解析精度之间的关系。所提出的方法在mIoU上高于对比网络,同时其浮点运算量(FLOPs)和参数量与跨模态和渐进式融合基线方法相近。单帧延迟为61 ms,表明所增加的SDF和图推理分支引入了一定的部署开销,但延迟仍处于许多室内场景理解任务所需的实时范围内。由于在每次训练周期中均执行了结构先验提取、注意力投影和图推理操作,训练时间增加至15.6小时。该结果表明,所提方法的计算成本主要集中于边界感知的结构推理过程,而非参数的无控制扩展。

结构一致性损失与空间距离损失的特异性比较

用于量化边界空间变换距离的逆变换网络损失利用同态变换参数来捕捉边界偏移,表明纯粹的空间距离度量优于基于像素标签变化的传统交叉熵损失。基于这一理论共识,采用边界约束方案开展并行验证实验,以评估基于曼哈顿边界框的自定义结构一致性损失(SCL)在场景适应性方面的相对性能。实验保持了多尺度视觉主干与图推理网络融合的分析架构,仅在反向传播过程中替换边界损失项。配置了四个并行验证网络:仅使用基础分类交叉熵损失的网络缺乏高维几何约束;增加标准边界二元交叉熵(BCE)损失的网络执行常规的边缘二分类监督;增加空间边界距离损失的网络侧重于捕捉局部形变;应用所提出的SCL的网络则基于符号距离场(SDF)施加正交拓扑惩罚。在RGB-D室内场景验证集上的量化指标仅限于mIoU和结构边界F1分数。

表6详细说明了不同反向传播优化策略对底层空间逻辑认知的干预程度。其中表6中的“仅交叉熵”项表示所提出的架构仅使用像素级交叉熵损失进行训练,同时保持视觉主干网络、符号距离场分支、结构引导的交叉注意力模块以及超像素图推理分支不变。该项并非Mask2Former基线,不应与表3中的整体Mask2Former数值进行比较,因其使用的是相同模型。仅依赖基本交叉熵损失的网络获得了最低的边界拟合得分。在增加标准边界二值交叉熵损失后,网络性能略有提升,但该机制在大尺度遮挡情况下仍会导致边缘模糊。空间边界距离损失通过空间变换感知机制提高了得分,有效校正了部分扭曲的边缘。本文提出的结构一致性损失直接利用真实的符号距离场(SDF),在物理承重表面内的异常语义突变区域施加梯度惩罚,从而在结构边界上取得了最高的F1得分。

为了直观比较不同损失函数配置对掩模预测精度和边界拟合的驱动效果,我们绘制了不同优化策略下的分组柱状图。

图8展示了通过提升损失函数的空间感知维度所带来的逐步性能改进。表示结构边界F1分数的柱状图呈现出显著上升趋势。实验数据表明,这种定制化的惩罚机制迫使预测类别的空间跳跃位置与正交物理轮廓精确重合。针对室内正交先验定制的距离场惩罚机制,比通用的空间边界捕捉损失具有更高的准确性,从而为解决复杂建筑缺陷建立了有效的优化路径。

极端遮挡分布、异常结构及复杂光照条件下的鲁棒性测试

物体之间复杂的空间关系以及相互遮挡对整体三维空间认知产生负面影响。联合预测架构突显了场景布局约束在提取基础掩码中的支撑作用。通过考察算法在大面积视觉信号丢失以及违反三维正交物理假设的异常空间布局下的抗干扰极限,可明确界定算法的有效应用边界,具有核心且可验证的价值。根据真实标签中被遮挡的大尺寸家具所占比例,RGB-D室内场景测试集被细分为三个难度递增的子集:轻度、中度和重度遮挡。同时,人工提取具有非曼哈顿典型特征的场景(如倾斜天花板或弯曲墙壁),以构建异常边界测试集;并将包含极低光照、过曝以及大面积反光或透明玻璃表面的场景归类为具有挑战性的光照与纹理子集。对比模型库包括:基于掩码注意力的分割基线;一种基于掩码注意力以捕获全局上下文的通用分割架构;一种采用全面跨模态聚合策略的跨模态特征聚合基线;以及一种集成多阶段渐进式特征提取机制的渐进式特征融合基线。各对比基线、融合视觉主干网络以及本文构建的图推理网络解析架构,均在上述子集上独立评估,并对各模型的精度衰减梯度进行统计分析。

表7 报告了在轻度、中度和重度遮挡、复杂光照、纹理干扰以及非曼哈顿异常条件下的子集特异性鲁棒性指标。表7 详细描述了不同模型在空间干扰条件下掩码预测准确率的变化情况。表7 报告了不同模型在空间干扰条件下各子集的特异性mIoU值,该值仅在对应的遮挡、光照、纹理或非曼哈顿子集中计算,而非在整个RGB-D室内场景验证集上计算。在轻度和中度遮挡子集中,所有模型均保持了基线准确率。随着遮挡面积增加,依赖像素驱动规则的基线模型在重度遮挡子集上的交并比(IU)出现下降。基于掩码注意力的分割基线模型和跨模态特征聚合基线模型在该子集上表现出显著的准确率损失。渐进式特征融合基线模型的多阶段渐进式特征提取架构在该子集上表现出严重的性能下降。本文提出的方法依赖显式的三维骨架特征,强制对齐受损的视觉信号,在重度遮挡子集上保持了稳定的掩码输出形状,展示了语义掩码输出的拓扑稳定性。在复杂光照和纹理干扰子集中,线段检测器在强反射区域和透明玻璃区域遗漏了结构边缘,导致SDF中出现局部不连续性。错误的几何坐标通过结构亲和矩阵和结构一致性损失进行传播,从而对语义特征施加异常的梯度惩罚,导致边界预测出现相应偏差。图卷积网络(GCN)的全局空间上下文推理机制利用相邻的结构亲和性补充缺失的几何先验,在可接受的衰减范围内维持整体解析准确率,揭示了算法在复杂物理干扰下的视觉感知能力边界。在非曼哈顿异常子集中,该模型底层的SDF先验引入了轻微的映射偏差,导致性能略低于渐进式特征融合基线。交叉注意力模块中的自适应结构加权系数动态评估底层物理结构梯度的一致性。在存在弯曲墙体或倾斜天花板的场景中,该系数自动降低SDF的约束权重,促使网络依赖超像素图网络的局部特征节点聚合机制,以在同质区域维持语义一致性,从而为非曼哈顿空间布局建立有效的几何补偿机制。

为了直观展示遮挡程度对分辨率准确性的负面影响,我们绘制了折线图,显示不同算法模型下准确率的下降情况。

图9 直观展示了不同特征提取范式在极端物理环境下的鲁棒性差异。代表基线模型的三条虚线在严重遮挡的节点处均表现出明显的下降趋势,反映出传统感受野在大规模信号丢失条件下进行特征提取时的局限性。代表所提出方法的实线则保持了相对平缓的衰减轨迹。实验数据表明,显式的三维结构先验与基于图的推理机制之间的耦合,为抗遮挡场景解析任务提供了结构支持,并提升了模型在复杂环境中的泛化性能。

拓扑图节点划分的空间敏感性分析

坐标空间图卷积模块的降维采样率参数直接控制感受野的质量以及图网络的计算负担。根据本文的理论框架,本研究探讨了由简单线性迭代聚类生成的离散图节点数量如何影响非欧几里得拓扑推断的性能,旨在为超参数选择提供严谨的支持。实验通过调整聚类算法的初始化控制参数,强制干预特征空间的动态降维过程,并将超像素图节点划分的数量设定为64、128、256、512和1024。在严格对齐的测试基准下,同步记录了不同拓扑节点规模下的平均交并比(IoU)、结构边界F1分数以及每张高分辨率图像的平均推断时间。

表8详细说明了特征空间中动态降维程度与分析精度及计算成本之间的关系。若设置的节点数量过少,会导致图像特征分割不足,使小目标的语义属性与大尺度墙体特征相融合,从而降低各项精度指标。随着节点划分尺度的增加,模型对局部空间细节的敏感性显著提升。将节点数量增加至512和1024时,会导致同质区域出现碎片化,削弱图神经网络对宏观特征的平滑效应,同时增加节点关系矩阵的维度以及推理时间。当节点数量固定为256时,交并比和边界评分达到最高值。

为了直观展示非欧几里得拓扑推断中准确性与计算能力之间的权衡关系,绘制了显示节点大小敏感性的双轴统计图。

图10 展示了离散图节点数量如何影响网络特征演化的内在逻辑。代表计算时间的背景条在节点数量超过256阈值后呈现急剧上升趋势。代表准确率的双线在横轴256处达到峰值,随后由于碎片化效应而合理下降。客观的定量数据与视觉演化趋势高度一致,表明在当前固定参数配置下,将计算图规模维持在256个节点,可在硬件处理能力与逻辑推理之间取得平衡。偏离此节点数量所导致的严重性能下降,揭示了固定超像素分割策略对超参数调优的高度敏感性,凸显了开发动态节点选择机制的必要性。

数据可用性:

本研究中分析的原始基准数据可从下列官方资源库公开获取 材料清单大规模室内三维基准数据集采用官方发布的ScanNet v2版本,数据集发布标识为ScanNet v2。RGB-D室内场景基准数据集通过官方发布的NYU Depth Dataset V2获取,发布标识为NYU Depth Dataset V2。大规模室内三维基准数据集的描述性出版物DOI为10.1109/CVPR.2017.261,RGB-D室内场景基准数据集的描述性出版物DOI为10.1007/978-3-642-33715-4_54。本研究未生成任何新的原始图像或RGB-D数据集。处理后的划分文件、训练配置文件、原始评估日志及支持性数值源文件 表2, 表3, 表4, 表5, 表6, 表7,Table 8,图5, 图6, 图7, 图8, 图9图10,训练好的模型权重和源代码已存入 figshare,DOI:10.6084/m9.figshare.32906765。该 figshare 记录提供了重现本文所述定量表格和图表所需的全部原始结果数据。该存储库包含用于报告 mIoU、Boundary F1、PixelAcc、MeanAcc、计算复杂度、鲁棒性、损失函数验证以及节点划分敏感性分析的预测掩码、边界评估文件、指标计算脚本、模型检查点和表格源文件。

figure-results-1
图 1 复杂室内遮挡场景中语义不连续性与结构先验修复效果的对比。A)存在大规模家具遮挡的原始 RGB 图像。(B)传统基线模型的输出结果,突出显示物理边界扭曲和语义不连续性缺陷。(C)所提出方法的输出结果,叠加青色虚线透视图,明确映射三维建筑骨架,用于对底层结构受损特征进行拓扑修复。请点击此处查看该图的放大版本。

figure-results-2
图 2:基于建筑结构先验引导的整体语义解析框架。 该示意图展示了从RGB图像输入开始,经过移窗视觉特征提取分支和结构先验提取分支,进入结构引导的交叉注意力模块,随后通过超像素图卷积网络(GCN)进行拓扑推理,最终解码为密集语义图的完整流程。右侧展示了注意力亲和矩阵计算、图消息传递以及联合优化损失函数的详细结构。请点击此处查看该图的放大版本。

figure-results-3
图3:亲和力矩阵与拓扑连接性构建的流程图。 该流程图详细展示了逐步数学映射流程,说明了从输入的距离场图和选定的像素对出发,经过连续几何势能特征提取与梯度一致性评估,最终生成归一化的亲和力矩阵,作为交叉注意力机制中的显式空间偏差。 请点击此处查看该图的放大版本。

figure-results-4
图4:超像素图卷积节点投影与特征聚合的示意图。 该图详细展示了非欧几里得拓扑推理过程:(A)密集像素特征,显示原始局部特征矩阵及超像素聚类边界;(B)超像素图拓扑结构构建,将规则网格映射为离散节点及物理连接的边;(C)图卷积消息传递,执行局部特征的方向性聚合;以及(D)坐标反向投影,将恢复的宏观语义一致性特征呈现在密集网格上。请点击此处查看此图的放大版本。

figure-results-5
图5:定性比较网格图。 该矩阵通过不同行方向的室内场景提供了视觉性能评估,将原始室内RGB输入和真实布局与基于掩码注意力的分割基线、跨模态特征聚合基线、渐进式特征融合基线以及所提出方法的输出结果进行对比。所提出的方法成功恢复了被遮挡的角落,并对齐了承重表面。请点击此处查看该图的放大版本。

figure-results-6
图6:累积模块集成的消融实验结果。 双轴图表展示了在不同模块消融设置下性能逐步演进的过程,以柱状图形式呈现从基线主干网络到完整框架的平均交并比(mIoU)稳定上升趋势,同时以折线图形式显示结构边界F1分数的变化。请点击此处查看该图的放大版本。

figure-results-7
图7:计算复杂度、训练时间与推理效率分布。 多维气泡图揭示了计算开销与解析精度之间的权衡关系。横轴表示浮点运算次数(FLOPs),纵轴表示平均交并比(mIoU),气泡大小代表可训练参数的规模,相邻的文本标签则列出了每种网络架构的单帧推理延迟。请点击此处查看该图的放大版本。

figure-results-8
图8:不同损失函数配置下的边界准确率与度量分数直方图。 分组柱状图比较了多种优化策略对底层空间逻辑的驱动效果,展示了从标准交叉熵形式升级到所提出的结构一致性损失后,mIoU 和结构边界 F1 分数的显著提升。请点击此处查看该图的放大版本。

figure-results-9
图9:折线图显示遮挡严重程度与性能衰减之间的关系。 该曲线描述了在轻度、中度和重度遮挡条件下,不同特征提取范式下准确率的下降情况,突显了所提出的结构引导框架相较于纯像素驱动基线方法在拓扑稳定性与抗干扰能力方面的优势。请点击此处查看该图的放大版本。

figure-results-10
图10:超像素节点尺度的敏感性分析。 双轴统计图展示了在不同图划分尺寸下硬件处理速度与逻辑推理准确率之间的权衡关系,显示了超像素节点数量对准确率指标的影响,并导致平均推理时间急剧增加。请点击此处查看该图的放大版本。

网络层编号输入节点特征维度输出节点特征维度随机失活概率设置
15122560.15
22562560.15
32561280.1
4128640.05

表1:卷积推理模块网络架构的超参数配置表。 该表格列出了图推理网络中使用的网络层编号、输入节点特征维度、输出节点特征维度以及随机失活概率设置。

配置项大规模室内三维基准RGB-D 室内场景基准
官方发布标识符ScanNet v2NYU Depth Dataset V2
本研究中使用的训练样本1201 个场景795 张图像
用于评估的验证或测试样本312 个验证场景654 张测试图像
总语义类别数2040
输入图像分辨率512 × 512512 × 512
初始学习率0.00010.0001
批量输入样本数量88
权重衰减系数0.010.01
总训练轮数300300
独立运行次数55

表2:实验数据集划分与统一训练超参数配置。 该表格报告了大规模室内3D数据集和RGB-D室内场景数据集的样本划分设置、语义类别数量、学习率设置、批量输入样本数量、权重衰减率以及总训练迭代次数。

网络模型架构mIoU边界F1像素准确率平均准确率
SegFormer0.596 ± 0.0030.635 ± 0.0040.838 ± 0.0030.704 ± 0.004
ConvNeXt UperNet0.604 ± 0.0030.642 ± 0.0040.846 ± 0.0030.713 ± 0.004
Mask2Former0.612 ± 0.0030.654 ± 0.0040.853 ± 0.0030.721 ± 0.004
OneFormer0.621 ± 0.0020.663 ± 0.0030.861 ± 0.0030.733 ± 0.003
MaskDINO0.628 ± 0.0020.667 ± 0.0030.869 ± 0.0030.741 ± 0.003
CCANet0.635 ± 0.0030.671 ± 0.0040.876 ± 0.0030.745 ± 0.004
InternImage UperNet0.641 ± 0.0020.692 ± 0.0030.884 ± 0.0020.756 ± 0.003
CMPFFNet0.658 ± 0.0020.712 ± 0.0030.891 ± 0.0020.773 ± 0.003
SGCA_GCN0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

表3:基于RGB-D室内场景验证集的室内场景解析基线方法的总体定量比较。 该表格报告了基于掩码注意力的分割基线、跨模态特征聚合基线、渐进式特征融合基线以及所提出的结构引导网络架构在平均交并比(mIoU)、边界F1分数、全局像素准确率和类别平均准确率上的性能。

网络架构配置mIoU边界F1像素准确率平均准确率
基础移位窗口主干网络0.615 ± 0.0030.630 ± 0.0040.842±0.0030.706 ± 0.004
主干网络加结构引导交叉注意力0.648 ± 0.0030.685 ± 0.0040.874 ± 0.0030.748 ± 0.004
主干网络加超像素图推理0.641 ± 0.0030.676 ± 0.0040.868 ± 0.0030.741 ± 0.004
主干网络加结构一致性损失0.632 ± 0.0030.662 ± 0.0040.859 ± 0.0030.732 ± 0.004
主干网络加交叉注意力与图推理0.669 ± 0.0020.721 ± 0.0030.897 ± 0.0020.782 ± 0.003
主干网络加交叉注意力与结构一致性损失0.660 ± 0.0020.713 ± 0.0030.889 ± 0.0020.773 ± 0.003
主干网络加图推理与结构一致性损失0.653 ± 0.0030.704 ± 0.0030.881 ± 0.0030.765 ± 0.003
完整模型(无符号距离场加性偏置)0.656 ± 0.0030.698 ± 0.0040.884 ± 0.0030.761 ± 0.004
完整模型(无自适应结构加权λ)0.671 ± 0.0020.736 ± 0.0030.904 ± 0.0020.792 ± 0.003
完整模型(无共面边约束)0.666 ± 0.0020.728 ± 0.0030.899 ± 0.0020.786 ± 0.003
完整模型(无对称图归一化)0.673 ± 0.0020.737 ± 0.0030.906 ± 0.0020.795 ± 0.003
完整SGCA_GCN模型0.687 ± 0.0020.764 ± 0.0030.924 ± 0.0020.816 ± 0.003

表4:核心组件的扩展定量消融分析。 该表格报告了累积模块整合、成对模块组合以及组件移除设置,用于量化结构引导的交叉注意力、有符号距离场偏置、自适应结构加权、超像素图推理、共面边构建、对称图归一化和结构一致性损失的独立作用与协同贡献。

网络模型架构参数量FLOPs峰值内存训练时间推理时间FPSmIoU边界 F1
SegFormer83.7 M80.1 G6.1 GB10.6 h44 ms22.70.5960.635
ConvNeXt UperNet60.2 M91.5 G6.4 GB11.2 h47 ms21.30.6040.642
Mask2Former44.0 M74.6 G5.8 GB9.4 h41 ms24.40.6120.654
OneFormer64.1 M103.2 G7.0 GB12.9 h55 ms18.20.6210.663
MaskDINO52.8 M96.8 G6.8 GB12.1 h52 ms19.20.6280.667
CCANet63.5 M118.7 G7.6 GB14.8 h67 ms14.90.6350.671
InternImage UperNet70.4 M112.3 G7.4 GB14.2 h64 ms15.60.6410.692
CMPFFNet58.9 M104.6 G7.1 GB13.1 h59 ms16.90.6580.712
SGCA_GCN66.8 M121.4 G7.9 GB15.6 h61 ms16.40.6870.764

表5:计算复杂度、训练时间与推理效率对比及整体验证集准确率。 该表格列出了所提出方法与对比网络的可训练参数数量、浮点运算次数、峰值内存占用、300个训练周期的训练时间、单帧推理延迟、每秒帧数、平均交并比(mIoU)以及边界F1分数。

损失函数配置mIoU边界 F1
仅交叉熵(CE)0.6690.721
CE + 边界 BCE0.6740.738
CE + InverseForm 损失0.6810.752
CE + 本文 SCL0.6870.764

表6:损失函数验证的定量比较。 该表格报告了在交叉熵损失、边界二元交叉熵损失、逆变换损失以及所提出的结构一致性损失下的mIoU和边界F1分数。

算法模型架构轻度遮挡中度遮挡重度遮挡非曼哈顿型异常子集纹理干扰子集 
(mIoU)(mIoU)(mIoU)(mIoU)(mIoU)
Mask2Former0.6850.6120.4210.5840.553
CCANet0.6980.6350.4630.6120.566
CMPFFNet0.7150.6580.5120.6350.602
SGCA_GCN0.7320.6870.6450.6280.649

表7:针对极端遮挡分布和非曼哈顿结构的子集特异性鲁棒性分析。 该表格报告了在轻度遮挡、中度遮挡、重度遮挡、复杂光照、纹理干扰和非曼哈顿异常子集上解析精度的变化情况。

超尺度节点数量mIoUBoundaryF1平均推理时间(ms)
640.6410.69545
1280.6650.73252
2560.6870.76461
5120.6780.75195
10240.6620.735185

表8:拓扑图中节点划分尺度的空间敏感性分析。 该表格报告了在不同超像素节点划分设置下的mIoU、结构边界F1分数以及平均推理时间。

讨论

本文的算法将移窗式分层变换器编码器捕获的分层视觉特征与通过线段检测生成的曼哈顿式三维边界框的先验深度紧密耦合,从而实现了对复杂室内场景的高精度语义重建。一种结构引导的交叉注意力机制迫使视觉信号与由符号距离场(SDF)校准的真实几何边界对齐,从而恢复局部遮挡区域中低层特征的连续性42。通过迭代局部聚类算法生成的超像素节点构建拓扑图,驱动图卷积网络(GCN)在物理共面约束下进行特征聚合,确保宏观语义分布的一致性43。实验结果表明,该方法在256个超像素节点配置下的平均交并比达到68.7%,标准差为0.2%;结构边界F1分数为76.4%,标准差为0.3%;平均推理时间为61 ms,反映出在边界重建精度与最终推理效率之间进行了有意识的权衡44。鲁棒性测试进一步表明,该模型在大规模视觉信号丢失的极端条件下仍表现出强大的拓扑修复能力。通过引入结构一致性损失,提升了预测掩码与SDF校准的零距离物理边界之间的对齐精度,实现了计算复杂度与解析质量的协同优化45。该方案提供了一种基于三维空间规律的特征融合方法,在处理大规模家具遮挡和物理边界畸变时,展现出拓扑修复的逻辑一致性46。研究成果为智能空间推理和高精度三维重建提供了稳健的物理几何约束框架,对真实物理环境中机器人的视觉导航与场景识别任务具有实际工程价值。

几何拓扑推导机制高度依赖于曼哈顿世界假设,在处理具有曲面墙体或非正交边界的不规则建筑空间时,易产生拟合偏差47。为克服这一几何建模瓶颈,后续网络迭代将把多阶多项式曲面拟合算法和非均匀有理B样条曲线提取模块整合到物理先验分支中。这种通用的空间建模策略将刚性的正交线条转化为可动态变形的拓扑边界,从而持续提升算法在异常室内空间布局中的解析精度。

几何先验提取依赖于基本的线段检测器,导致系统在处理以反射或透明材料为主的室内场景时,容易受到结构掩膜失真的影响48。结构一致性损失函数直接调用该检测器生成的符号距离场(SDF),在先验提取与梯度优化之间建立了一个闭合的依赖循环。当视觉干扰引发异常的线段检测时,错误的几何坐标将被映射到SDF中,并在反向传播过程中被结构一致性损失直接放大,从而迫使网络参数拟合错误的物理边界49。后续的算法迭代将引入多模态自适应融合分支,以融合深度深度图和红外辐射数据,从而将几何结构感知与可见光照明约束解耦,并在极端光学环境中拓展空间推理的边界。

为解决由固定超像素节点尺度引起的性能敏感性瓶颈,后续研究将设计一种可学习的自适应图池化模块,能够根据图像的复杂度动态确定节点划分方案,从而消除网络对人工超参数调优的依赖。为应对超像素图网络计算开销带来的硬件部署限制,未来的优化方案将引入轻量级特征解耦机制和门控聚合模块,以压缩几何先验分支的参数规模并加速矩阵运算50

披露

作者声明不存在经济利益冲突。

致谢

基金项目:陕西省重点研发计划(项目编号:2024CY2-GJHX-76)。

材料

本文使用的材料清单
姓名公司目录编号评论
AdamW 优化器PyTorch Contributorshttps://pytorch.org/
CCANetZihao Z. 等https://doi.org/10.1109/TCDS.2024.3455356
CMPFFNetZhou W. 等https://doi.org/10.1109/TASE.2023.3332021
ConvNeXtMeta AI Researchhttps://github.com/facebookresearch/ConvNeXt
InternImageOpenGVLabhttps://github.com/OpenGVLab/InternImage
Mask2FormerMeta AI Researchhttps://github.com/facebookresearch/Mask2Former
MaskDINOIDEA-Researchhttps://github.com/IDEA-Research/MaskDINO
NYUv2http://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
OneFormerSHI Labshttps://github.com/SHI-Labs/OneFormer
RANSAC 算法scikit-learn 开发者https://scikit-learn.org/
ScanNet V2http://www.scan-net.org/
SegFormerNVIDIAhttps://github.com/NVlabs/SegFormer
SGCA_GCN本研究作者提出的方法(无)
Softmax 函数PyTorch Contributorshttps://pytorch.org/
Swin TransformerMicrosoft Researchhttps://github.com/microsoft/Swin-Transformer

参考文献

  1. Zhang Z et al. CCANet: cross-modality comprehensive feature aggregation network for indoor scene semantic segmentation. IEEE Trans Cogn Dev Syst. 2024;17:366–378.
  2. Cui Y et al. Improving the segmentation of confusable indoor structures using point convolution and sparse vector attention. Geospat Inf Sci. 2025:1–22.
  3. Yang L, Cai H. Cost-efficient image semantic segmentation for indoor scene understanding using weakly supervised learning and BIM. J Comput Civ Eng. 2023;37:04022062–04022082.
  4. Uckan T, Aslan C, Hark C. A comprehensive hybrid approach for indoor scene recognition combining CNNs and text-based features. Sensors. 2025;25(17):5350. doi:10.3390/s25175350.
  5. Sun R et al. Training indoor and scene-specific semantic segmentation models to assist blind and low-vision users in activities of daily living. IEEE Open J Eng Med Biol. 2025;6:533–539.
  6. Ye S, Hu Y, Lin M. Indoor scene reconstruction with fine-grained details using hybrid representation and normal prior enhancement. IEEE Trans Vis Comput Graph. 2024;31:5275–5287.
  7. Naseer A et al. Multimodal scene recognition using semantic segmentation and deep learning integration. PeerJ Comput Sci. 2025;11. doi:10.7717/peerj-cs.2858.
  8. Bae JH, Yu GH, Lee JH. Superpixel image classification with graph convolutional neural networks based on learnable positional embedding. Appl Sci. 2022;12:9176–9190.
  9. Zhang H, Zou J, Zhang L. EMS-GCN: an end-to-end mixhop superpixel-based graph convolutional network for hyperspectral image classification. IEEE Trans Geosci Remote Sens. 2022;60:1–16.
  10. Mu Y, Ou L, Chen W. Superpixel-based graph convolutional network for UAV forest fire image segmentation. Drones. 2024;8:142–158.
  11. Khatun Z, Jonsson H Jr, Tsirilaki M. Beyond pixel: superpixel-based MRI segmentation through traditional machine learning and graph convolutional network. Comput Methods Programs Biomed. 2024;256:108398–108412.
  12. Yongyin L, Caixia Y. Cross-attention swin transformer for detailed segmentation of ancient architectural color patterns. Front Neurorobot. 2024;18:1513488–1513508.
  13. Zhou X, Zhou L, Gong S. Swin transformer embedding dual stream for semantic segmentation of remote sensing imagery. IEEE J Sel Top Appl Earth Obs Remote Sens. 2023;17:175–189.
  14. Ning X, Jiang L, Li W. Swin-MGNet: swin transformer-based multiview grouping network for 3D object recognition. IEEE Trans Artif Intell. 2024;6:747–758.
  15. Ke A, Luo J, Cai B. UNet-like network fused swin transformer and CNN for semantic image synthesis. Sci Rep. 2024;14:16761–16779.
  16. Li Y et al. IED-GCN: an internal and external decoupled graph convolutional network for landslide susceptibility assessment. IEEE Trans Geosci Remote Sens. 2025;63:1–17.
  17. He T, Chen J. DC-GCN: a lightweight graph convolutional network integrating local and global context for semantic segmentation. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:28283–28299. doi:10.1109/JSTARS.2025.3626006.
  18. Imani M. Superpixel-based graph convolutional neural network for polarimetric synthetic aperture radar image classification. Sci Rep. 2026;16:4736. doi:10.1038/s41598-025-34965-6.
  19. Wang S, Feng S, Wang Z. Structural prior-guided and feature-enhanced transformer with masked image modeling pretraining for retinal layers and fluid segmentation in macular edema OCT images. Biomed Opt Express. 2025;16:5096–5117.
  20. Yuan Z et al. Structure-aware progressive multimodal fusion network for RGB-T crack segmentation. J Imaging. 2025;11(11):384. doi:10.3390/jimaging11110384.
  21. Xu S, Shen R, Liu E. A structure-prior-guided adaptive context selection network for remote sensing semantic segmentation. Electron Lett. 2025;61. doi:10.1049/ell2.70161.
  22. Minaee S, Boykov Y, Porikli F. Image segmentation using deep learning: a survey. IEEE Trans Pattern Anal Mach Intell. 2021;44:3523–3542.
  23. Zhou E, Murray AT, Baik J. Mapping 3D classroom seats based on partial object point cloud completion. Cartogr Geogr Inf Sci. 2024;51:404–420.
  24. Nishi T, Kawasaki S, Iewaki K. M3R-CNN: on effective multimodal fusion of RGB and depth cues for instance segmentation in bin picking. Adv Robot. 2023;37:1143–1157.
  25. Zhou W, Xiao Y, Yan W. CMPFFNet: cross-modal and progressive feature fusion network for RGB-D indoor scene semantic segmentation. IEEE Trans Autom Sci Eng. 2023;21:5523–5533.
  26. Zhou W, Xiao Y, Liu Y. FIMKD: feature implicit mapping knowledge distillation for RGB-D indoor scene semantic segmentation. IEEE Trans Artif Intell. 2024;5:6488–6499.
  27. Liu J, Jiang Z, Xu X. Multi-robot collaborative complex indoor scene segmentation via multiplex interactive learning. CAAI Trans Intell Technol. 2025;10:1646–1660.
  28. Zhang S, Xie M. MIPANet: optimizing RGB-D semantic segmentation through multimodal interaction and pooling attention. Front Phys. 2024;12:1411559–1411572.
  29. Li JW et al. Construction of a multiscale feature fusion model for indoor scene recognition and semantic segmentation. Sci Rep. 2025;15:14701. doi:10.1038/s41598-025-95465-1.
  30. Liang X et al. Indoor building structure segmentation in unorganized point clouds based on corner feature. Eng Constr Archit Manag. 2025. doi:10.1108/ECAM-10-2024-1433.
  31. Wu LF, Wei D, Xu CA. CFANet: the cross-modal fusion attention network for indoor RGB-D semantic segmentation. J Imaging. 2025;11(6):177. doi:10.3390/jimaging11060177.
  32. Fan L, Zhou Y, Liu H. Combining swin transformer with UNet for remote sensing image semantic segmentation. IEEE Trans Geosci Remote Sens. 2023;61:1–11.
  33. Wang Z, Liao Z, Zhou B. SwinURNet: hybrid transformer-CNN architecture for real-time unstructured road segmentation. IEEE Trans Instrum Meas. 2024;73:1–16.
  34. Zhang H et al. Frequency-domain-guided swin transformer and global-local feature integration for remote sensing images semantic segmentation. IEEE Trans Geosci Remote Sens. 2025;63:5612611. doi:10.1109/TGRS.2025.3535724.
  35. Li GY, Chen J, Jang SI. SwinCross: cross-modal swin transformer for head and neck tumor segmentation in PET-CT images. Med Phys. 2024;51:2096–2107.
  36. Tang Y, Hu X, Ke T. Semantic segmentation of high-resolution remote sensing imagery via an end-to-end graph attention network with superpixel embedding. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:7236–7252.
  37. Wang R, Nie Y, Geng J. Multiscale superpixel-guided weighted graph convolutional network for polarimetric SAR image classification. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:3727–3741.
  38. Li S, Wu K, Liu H. Hyperspectral image classification based on multiscale feature search graph convolutional network with meta pseudo-labels. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:23485–23504.
  39. Yang B, Cheng X, Guo J. Temporal information-enhanced graph convolutional network with superpixel-pixel gated knowledge dynamic selection for change detection in satellite time series. IEEE J Sel Top Appl Earth Obs Remote Sens. 2024;17:18399–18412.
  40. Zhang H, Ku J, Zhao J. Multi-scale graph wavelet convolutional network for hyperspectral image classification. Front Remote Sens. 2025;6:1637820. doi:10.3389/frsen.2025.1637820.
  41. Zhou Q, Wang L, Gao G. Boundary-guided lightweight semantic segmentation with multiscale semantic context. IEEE Trans Multimedia. 2024;26:7887–7900.
  42. Xu X, Yen GG, Zhao C. Boundary-based active domain adaptation for semantic segmentation under adverse conditions. IEEE Trans Neural Netw Learn Syst. 2025;36:14721–14734.
  43. Tang Y, Feng S, Zhao C. A semantic change detection network based on boundary detection and task interaction for high-resolution remote sensing images. IEEE Trans Neural Netw Learn Syst. 2025;36:17184–17198.
  44. Guan L, Yuan X. Dynamic weighting and boundary-aware active domain adaptation for semantic segmentation in autonomous driving environment. IEEE Trans Intell Transp Syst. 2024;25:18461–18471.
  45. Fenglei W, Xin G, Zongze Z. A boundary-enhanced semantic segmentation model for buildings. IEEE J Sel Top Appl Earth Obs Remote Sens. 2025;18:5733–5748.
  46. Shan K, Tan L, Li Y, Jia T. Multi-scale boundary-aware network for remote sensing image semantic segmentation. Sci Rep. 2026;16:3797. doi:10.1038/s41598-025-33943-2.
  47. Wu D, Guo Z, Li A. Conditional boundary loss for semantic segmentation. IEEE Trans Image Process. 2023;32:3717–3731.
  48. Li Y, Zhang C, Wang H. Boundaries matter: a novel multibranch semisupervised semantic segmentation method. IEEE Intell Syst. 2024;40:35–44.
  49. Wang JQ, Chen T, Zheng L. A multiscale remote sensing semantic segmentation model with boundary enhancement based on UNetFormer. Sci Rep. 2025;15:14737. doi:10.1038/s41598-025-99663-9.
  50. Jung H, Choi HS, Kang M. Boundary enhancement semantic segmentation for building extraction from remote sensed image. IEEE Trans Geosci Remote Sens. 2021;60:1–12.

重印与许可

标签

Transformer 3D