本方案通过整合语义部件解析、拓扑建模、双流特征编码以及结构引导的融合方法,生成具有结构感知能力的服装表征。该方法使计算机视觉与服装研究领域的研究人员能够基于服装部件的组织关系和轮廓布局进行服装检索与设计参考比对,而不仅依赖于颜色或纹理特征。
本方案通过整合语义部件解析、拓扑建模、双流特征编码以及结构引导的融合方法,生成具有结构感知能力的服装表征。该方法使计算机视觉与服装研究领域的研究人员能够基于服装部件的组织关系和轮廓布局进行服装检索与设计参考比对,而不仅依赖于颜色或纹理特征。
服装图像检索方法通常强调颜色和纹理,这可能导致在外观相似但部件布局不同的服装之间产生混淆。本研究提出了一种面向部件的特征学习协议,用于服装图像检索与设计参考比对。该协议对服装的语义区域进行解析,构建图像层级的服装部件图,平行编码外观特征与部件间关系,并通过结构一致性、结构关联性与结构区分性损失融合两种表征。DeepFashion2 图像被标准化为 512 × 512 像素,使用 HRNet-W48 进行解析,通过 ResNet-50 与图卷积进行编码,并通过结构化检索与聚类进行评估。完整模型实现了 0.81 的结构一致性指数、0.71 的结构区分性指数、89.2% 的 Recall@5、86.4% 的平均精度均值(mAP)以及 0.74 的轮廓系数。该协议支持在表面外观无法可靠反映服装结构时,进行服装结构检索、结构比对及差异定位。
随着计算机视觉与人工智能在服装行业中的持续融合,服装图像分析已逐渐从基础的识别任务扩展到以设计为导向的分析与决策支持1,2。在服装设计过程中,设计方案之间的区别更多地取决于结构构成与部件间的关系,而非外观上的简单差异,这使得服装图像特征在设计辅助中的结构表达能力成为影响分析效果的关键因素3,4。然而,大多数现有的视觉方法仍主要依赖纹理、颜色和整体轮廓作为特征,难以在设计过程中对服装的层次结构与构造差异进行系统性分析5,6。因此,开发一种面向结构的服装图像特征学习方法,对于提升设计分析的客观性与一致性具有重要意义7。本方案适用于服装在颜色、纹理或整体轮廓相似,但在部件组织方式、连接模式或空间布局上存在差异的情况。在此类条件下,以外观为中心的表示方法往往会在特征空间中将结构上不同的设计置于相近位置,从而削弱了检索与设计对比的可靠性。本方案针对的是以服装部件间关系为主要依据的结构检索、设计评估与局部差异分析任务。
在数据规模、模型复杂性和任务多样性方面,当前针对服装图像的自动分析与理解研究已取得显著进展8,9。然而,在实际应用中,服装结构信息通常隐含地存在于分割或检测结果中,并未在特征学习阶段进行统一建模,导致特征空间中不同结构设计之间缺乏稳定的区分性10,11。服装部件之间的空间关系、层次约束以及拓扑结构未被显式编码,使得特征表示难以反映设计层面的结构差异12,13。缺乏显式的结构建模限制了服装图像特征在辅助设计场景下的分析精细度与决策可靠性,成为发展具有更深层次语义理解能力的智能设计系统的主要障碍14。
为了支持服装图像特征的学习与分析,相关研究已探索了多个技术方向15。语义分割与服装解析方法通过像素级标注实现了对服装区域和组件的细粒度划分,为结构信息提取提供了基础16,17。基于图像查询的服装检索方法则融合了拓扑结构与颜色纹理、全局与局部注意力对齐、服装解析、多尺度与多粒度表示以及结合特征选择的残差注意力机制。这些方法应用于商品目录搜索、消费者到店铺匹配、跨领域产品检索以及电子商务视觉搜索等场景。其应用设置与设计参考检索密切相关,因为每种方法都基于视觉查询对服装图像进行排序,但其表示方式在特征融合过程中未能始终保留带有类型信息的组件邻接关系和垂直顺序关系18,19,20。与此同时,针对设计与推荐场景的研究逐步引入了多模态融合、关系建模和风格分析,拓展了服装视觉特征的应用边界21,22。尽管这些方法在其各自任务中取得了进展,其核心特征仍主要基于外观描述,且结构信息尚未被统一建模为特征学习的固有约束,因而难以满足服装设计辅助中对结构对齐与结构比较的需求23。
为解决服装设计辅助中结构区分能力不足的问题,本文提出一种基于服装结构感知的图像特征学习方法。该方法在服装图像输入阶段融入服装分析结果与关键结构信息,联合建模服装部件区域、空间关系及层次连接。通过结构关系编码与视觉特征对齐,显式地将服装结构约束整合到特征学习过程中,生成一种既保留视觉外观又保持结构一致性的表征。该特征在统一空间内刻画服装结构差异,为后续的结构相似性分析、结构聚类及设计辅助决策提供了稳定基础,从而缓解了现有方法因缺乏结构建模而导致的特征混淆问题。不同于将结构信息视为松散关联辅助属性的通用视觉检索策略,本框架构建了一种以拓扑关系为核心的特征调制机制。该机制促使所学习的表征遵循可见的服装区域组织结构,同时降低由纹理主导的响应。每个图节点表示一个图像级语义区域,每条图关系描述图像平面中可见的邻接关系或归一化的相对位置。所生成的嵌入表示支持跨服装图像的部件布局与轮廓结构的比较。这些区域与关系并非缝纫纸样片、缝线连接、结构标记点或放码参数。相较于以外观驱动的检索方法,本方案在特征学习全过程保留了明确的部件拓扑结构,而非将结构信息作为下游分析结果处理。相较于仅将结构线索作为辅助输入的方法,双流编码与拓扑一致性融合策略在保留几何关系的同时,进一步抑制了纹理主导的响应。所生成的表征支持服装结构检索、结构聚类、设计参考筛选以及局部化设计差异分析,并提供在服装设计流程中可解释的部件级依据。本方案相关研究涵盖服装图像特征学习、服装结构建模、结构感知表征以及服装设计辅助的视觉分析等领域。
在特征表示层面,服装图像研究长期以来主要关注外观建模、深度特征提取以及多尺度表示24,25。早期研究采用卷积神经网络对服装图像进行端到端建模,以完成分类、检索和相似性匹配等任务26,27。随后,引入了多尺度特征融合和跨域学习方法,以缓解不同视角、姿态和拍摄条件下服装图像之间的差异28,29。在检索任务中,研究者采用注意力机制和特征压缩策略,以提升特征的判别能力与计算效率30,31。这些方法能够实现可靠的外观区分,但其特征学习过程仍主要聚焦于全局视觉信息,缺乏对服装内部结构的系统性表达32。组合式时尚检索方法进一步结合参考图像与文本修改指令,但其查询模态不同于本文所研究的纯图像协议。此类方法被视为相关的商业检索方向予以综述,由于额外的文本输入将无法实现受控的图像查询评估,因此未纳入定量比较。
随着服装图像分析从外观区分转向结构理解,研究 increasingly 集中于对服装部件、几何关系和拓扑连接的建模33。语义分割网络通过特征投影和多注意力机制实现了服装部件级别的分析,为结构信息提取提供了可靠的基础34,35。关键点检测与结构拓扑建模方法进一步刻画了服装轮廓与局部结构之间的关系,增强了模型对服装几何特征的表达能力36,37。一些研究引入图结构和关系推理网络来建模服装部件之间的关系,从而提升了细粒度识别和跨域检索的性能38,39。这些工作验证了结构信息在视觉分析中的重要作用,但结构信息大多仍作为辅助特征或中间结果使用,尚未建立以结构约束为核心特征学习系统40。
在服装设计辅助领域,这些发展已支持了设计推荐、风格分析、交互系统构建以及以结构为导向的设计评估41。推荐系统研究通过融合视觉特征与用户偏好,实现了服装搭配推荐与个性化推荐42。与设计辅助相关的工作通过结合生成模型、风格建模以及人机协同机制,探索了智能化设计支持的新路径43。关于虚拟试穿、尺寸测量和风格迁移的研究,拓展了服装视觉分析在设计与生产全过程中的应用。尽管这些研究丰富了服装设计辅助的技术形式,但其核心视觉特征仍主要以外观驱动为主,缺乏对设计结构的统一表示以支持分析。相比之下,本文将服装结构视为特征表示的核心约束,提出了一种面向服装设计辅助中结构分析的视觉表示方法。
尽管取得了这些进展,当前生成设计方法通常将结构条件视为扩散过程中的松散空间引导矩阵。现有的结构解析框架将拓扑结构表示为辅助语义标签,与主要的视觉嵌入空间相分离。本文提出的框架通过定义一种基于图先验的拓扑约束机制,显式地在组件层面对视觉特征学习进行调制,从而改变了这一现状。多层级一致性目标鼓励具有相似图像级组件布局的服装在特征空间中保持相近,同时将可见区域组织不同的服装分离开来。该目标在评估的检索任务中降低了对纹理的依赖性,但并未实现对材料、姿态或背景变化的不变性。当输入图像包含足够可见的单件服装、语义组件保留可识别的边界,且分析目标需要组件级的结构比较而非粗粒度类别识别时,应选择本方案。本方案适用于从事结构敏感型视觉分析的计算机视觉研究人员、服装设计研究人员以及数字服装开发团队。它不适用于仅关注颜色或材料识别的任务,也不适用于服装拓扑结构大部分被遮挡的图像。以下方案详细介绍了从数据集准备和语义概率映射,到几何关系构建、双流特征编码、结构引导融合以及基于一致性的优化的完整工作流程。完整的工作流程在图1中进行了总结。
本研究使用公开可用的服装图像数据集,未招募人类受试者,未收集个人身份信息,未进行动物实验,也未使用生物材料。无需机构伦理审批和知情同意。
1. 软件环境与项目配置
2. 输入图像的接收、数据集构建与预处理
3. 前景受限的视觉组件解析与概率映射
4. 图像级组件几何结构与空间关系建模
5. 双流结构感知特征编码
6. 结构引导的特征融合
7. 模型训练与一致性优化
8. 推断、检索、聚类与输出验证
9. 比较模型评估
所有报道的实验均使用表2和材料表中记录的硬件和软件环境进行。在整个预处理、训练、推理和评估过程中,均使用相同版本的图形驱动程序、CUDA、cuDNN、Python、NumPy、PyTorch 和 torchvision。完整的硬件和软件环境汇总于表2和材料表中。表1汇总了处理后的训练集、验证集和测试集,以及图像级别的拓扑统计信息。表2汇总了所有对比方法所采用的通用配置。
比较评估结果
比较评估遵循了第7–9节协议中规定的通用数据划分、预处理操作、训练控制和指标定义。表3比较了通用视觉编码器、部件对齐模型、基于图的服装表示方法、跨域时尚检索网络、拓扑与外观融合方法以及电子商务视觉检索方法,所有方法均采用相同的图像查询协议进行评估。领域特定方法包括融合颜色与纹理的拓扑特征直方图(TFH-CT)、注意力引导级联网络(AGC-Net)、多尺度多粒度特征学习网络(MMFL-Net)以及基于残差网络与鹭群优化的时尚检索方法(FARE-RNET)。表3中的所有评估指标均基于五次独立运行的结果报告,采用相同的随机种子、训练清单、验证清单、测试清单、查询-图库分配方式及指标实现方式,取均值和样本标准差。在匹配随机种子条件下,分别针对SCI、SDI、Recall@5、mAP和轮廓系数,将每种方法与所提出方法进行比较,单独计算配对p-值。这些结果为后续的结构可视化、检索、聚类以及面向设计的分析提供了定量依据。
代表性实验方案结果与解读
当从保存的解析结果和图文件重建的图像级组件图将每个活跃节点准确置于其对应的服装区域内,并保持类型化邻接矩阵中记录的关系类型时,表明协议成功执行,如图5C所示。结构感知响应应始终集中在服装前景区域,如图5D所示。图6E展示了一种预期的检索结果,其中所提出的方法降低了红色背景的干扰影响,准确检索出上身服装而非其他无关的红色物体。图6B–G还表明,检索排序由图像级组件关系及融合后的组件对应关系共同支持。该结果反映了粗粒度服装类别的有效恢复,尽管检索样本在袖长和局部拓扑结构上仍存在一定差异。
常见的失败情况包括由纹理主导的激活现象 图 5B由上排背景颜色驱动的检索 图6,以及残余背景激活在 图7. 图7 应解释为部分定位,因为主要响应遵循扩大的下半身轮廓和右侧服装边界,而相邻背景区域仍保留残余激活。只有当拓扑差异矩阵、几何关系差异矩阵、融合后成分差异图和空间响应均识别出一致的服装区域时,定位才被视为具有结构支持。若空间热点在矩阵或成分中无相应变化,则表明为视觉干扰而非结构证据。
当每张被接受的图像均生成归一化的语义概率图、一个包含 K 行和 K 列的关系矩阵、外观和结构特征矩阵(均为 K 行 512 列),以及一个与正确图像标识符关联的有限融合特征向量时,认为该协议运行有效。目视检查应确认拓扑结构符合服装部件的分布,前景响应强于背景响应,且检索结果由服装类别和结构主导,而非由背景颜色决定。若出现断裂的概率图、缺失的部件节点、非数值型矩阵、弥散的背景响应或以颜色为主导的检索结果,则表明执行失败,需检查解析、图构建、特征融合或检查点加载过程。
服装部件图像级响应的可视化分析
图5 比较了ResNet-50基线模型与组件感知模型在相同服装图像上的表现。图5B 显示了外观基线的类别激活图。图5C 展示了从前景受限概率图、组件中心矩阵、类型化邻接矩阵、非活跃节点掩码以及在协议第3和第4节中生成的组件标签映射重建得到的图像级服装组件图。图5D 展示了融合表示的激活响应。生成 图5C 时未使用任何人姿态估计器或人体关节标注。
基线响应集中在下装的局部纹理区域,并未持续沿整个服装边界延伸,如图5B所示。图5C中,每个节点对应一个激活的服装组件区域的中心,每条边表示共享的前景边界或预定义的垂直顺序关系。该图反映了服装区域的组织结构,并不代表人体解剖学上的关节。结构感知响应覆盖了主要的服装前景,同时在大多数背景区域保持较低的激活水平,如图5D所示。这些结果表明,组件图与特征融合模块降低了在评估图像中由纹理主导的激活响应。
服装结构相似性分析与设计参考结果
图6展示了检索排序结果以及用于解释该排序的结构证据。图6B中的查询组件图记录了活跃的服装区域及其类型化关系,而图6C中的矩阵则揭示了提供给图传播的关系模式。图6D中的基线结果仍主要由红色外观线索主导。图6E中基于结构感知的结果在不同颜色和背景条件下仍保持上身服装类别的准确性。图6F中排名最高结果的组件图可与查询图进行直接比较,而图6G中的对应矩阵则揭示了具有相同标识符的组件在结构引导融合后是否仍保持对齐。对角线上的对应关系应结合缺失节点和变化的图关系进行综合解读。缺乏图结构一致性的高外观相似性不能视为成功的结构化检索。
检索得到的服装保留了粗粒度类别,但袖子结构和局部组件关系的差异表明细粒度对应关系尚不完整。如表3所报告,所提出方法的 Recall@5 达到 89.2%,mAP 达到 86.4%。这些定量数值描述了排序性能,而图6B–G 提供了支持该解释的中间结构证据。因此,检索结论仅限于在测试查询条件下,对背景颜色干扰的抵抗能力有所提升,以及图像层级组件组织能力更强。
结构差异响应与设计分析支持
纯差异响应热图(图7H)显示,主要响应集中在目标图像放大后的下半身轮廓以及右侧服装边界处。图7I 的叠加结果显示,最强响应仍与主服装前景保持对齐,而在相邻窗帘和墙壁区域的较弱激活则作为残余背景干扰保留。空间响应应结合 图7C–G 中所示的组分图和矩阵证据共同解读。只有当高响应的服装区域与邻接变化、几何关系变化以及融合后组分距离模式一致时,该响应才被视为有效的结构差异。
只有当图7E中的类型化邻接关系变化或图7F中的几何关系变化,同时伴随着图7G中组件距离的增加以及图7H、I中前景对齐的空间响应时,才接受该结构差异。扩大的下半身区域和右侧服装边界满足这一跨阶段标准。窗帘和墙壁上的激活信号与组件节点、关系模式或融合组件距离的变化无关,因此被视为非结构性的残余干扰而被排除。该结果支持图像层面的差异定位,但尚不足以确立缝纫模式或结构参数的变化。
特征空间分布与结构聚类分析
分析潜在特征空间的分布可以揭示模型对服装结构语义的区分能力。该分析旨在检验结构先验是否将具有不同拓扑结构的服装组织到不同的特征流形中。从测试集中选取了五类具有代表性的结构类别:短袖上衣、裤子、裙子、长款外套和连衣裙。通过t分布随机邻域嵌入(t-SNE)方法,将高维特征向量投影到二维平面上。通过评估相似样本的聚集性与不相似样本的分离性,来刻画特征空间中结构语义的组织方式。图8展示了具有结构感知能力的特征空间的t-SNE分布结果。
t-SNE 投影形成了五个主要特征区域,相邻类别之间的重叠有限,如图 8A所示。对应于这五个类别区域的代表性样本如图 8B所示。结构紧凑性指数(SCI)为 0.81,反映了具有相同结构标签的样本在特征空间中的紧凑程度;结构分离性指数(SDI)为 0.71,反映了具有不同结构标签的样本之间的分离程度,如表 3所报告,并在图 8中可视化。这些指数应被理解为特征空间分布的度量,不能直接确定误报率。短袖上衣和裙子在投影的特征空间中占据了不同的主要区域,而少量样本仍位于相邻类别的边界附近,如图 8A所示。裤子和连衣裙也与相邻类别表现出明显的分离。该分布表明,图结构先验促进了类别级别的结构化组织,但并未实现完全的聚类分离。本评估将表征质量与检索有效性区分开来。SCI 用于评估具有相同结构标签的服装在学习到的特征空间中是否保持紧凑,而 SDI 用于评估具有不同结构标签的服装是否保持分离。这些指标对应于协议中的结构表征目标。Recall@5 衡量在前五个检索结果中是否出现结构相关的服装,而 mAP 衡量在所有相关图库样本中的排序质量。这些指标对应于设计-参考检索目标。由于 SCI 和 SDI 已经刻画了特征空间的组织特性,因此仅使用轮廓系数来评估聚类性能。
图9展示了四种代表性方法在未进行跨方法归一化情况下的原始五次运行结果。图9A以原始量表呈现SCI和SDI,而图9B以百分比形式呈现Recall@5和mAP。单次运行的标记点及标准差误差线反映了模型训练过程中的波动性,而不仅仅是聚合排序结果。基于外观的基线方法达到了0.62的SCI,而所提出的方法达到了0.81的SCI和0.71的SDI(表3和图9A)。SCI和SDI结果表明,在所评估的设置下,类别内紧凑性和类别间分离性更强。所提出的方法实现了89.2%的Recall@5和86.4%的mAP(表3和图9B)。这些检索指标评估了不同的排序特性,需独立于SCI和SDI进行解释。四种指标下方法排序的一致性表明表征质量与检索性能之间具有一致性,但这并不意味着在四个评估维度上的相对提升程度完全相同。
消融实验与结构模块有效性分析
消融实验将完整模型与去除结构先验或融合模块的变体模型进行比较。这三种配置均使用相同的参考图像和目标图像,从而能够直接比较背景响应和定位集中度。去除结构先验的变体移除了图像层级的服装部件图及其关系约束,仅依赖卷积主干网络提取外观特征;非融合变体保留图推理机制,但移除了特征金字塔,仅使用高层语义特征。可视化差异热图揭示了各模块在噪声抑制和边界定义中的具体作用;不同模块配置下结构差异响应的定性比较如图10所示。
反应图谱在 图10C–E 使用了共享响应量表和相同的叠加设置进行呈现。未包含结构先验的版本在左侧背景区域及与环境无关的区域周围产生了强烈的激活,如图所示 图10C. 缺少融合模块的变异体减弱了部分非衣物区域的响应,但仍保留了在下部衣物及右侧周围区域更广泛的扩散,如图所示 图10D完整的模型进一步将主导响应收缩至主要服装前景,如图所示 图10E. 图10F 直接可视化非融合变体与完整模型之间在前景限制响应上的差异,表明完整模型在保留主要与服装对齐的响应的同时,抑制了残余的侧向扩散。这些结果表明,结构先验主要降低了环境噪声,而融合模块进一步提升了响应的集中性与结构对齐程度。 图10E 表示相对改善,而非完全消除背景激活。
表4 报告了无结构先验、无融合模块以及完整模型各变体的 SCI、SDI 和 Recall@5 指标。移除结构先验使 SCI 从 0.81 降至 0.65,Recall@5 从 89.2% 降至 74.5%。移除融合模块使 SDI 从 0.71 降至 0.64,Recall@5 从 89.2% 降至 85.1%,下降了 4.1 个百分点。这些结果表明,结构先验对结构一致性与检索性能影响更大,而特征融合则改善了外观信息与结构信息之间的对齐。
效率分析比较了完整模型与ResNet-50基线模型的计算成本。ResNet-50基线模型需要2560万个参数和41亿次浮点运算。完整的结构感知模型需要2930万个参数和54亿次浮点运算。基线模型的平均推理时间为每幅图像15毫秒,完整模型为每幅图像22毫秒,增加了7毫秒。该结果表明,计算成本有所增加,在将该协议部署于时间敏感的工作流程时应予以考虑表5)在最终测试评估之前,根据验证集的划分结果确定了结构约束权重。在结构约束权重为 0.1、0.3、0.5、0.8、1.0、1.2、1.5 和 2.0 的条件下,考察了验证集上的 Recall@5 指标。后续所有训练与测试均固定采用 1.0 的权重值。 图11 记录了基于验证的结构约束权重1.0的选择。

图 1: 结构感知服装图像特征学习协议的整体工作流程。 输入的服装图像由外观特征分支和结构特征分支进行处理,其中结构特征分支采用语义解析和空间图建模。这两个表示结果通过结构引导融合模块处理,以生成最终的结构感知特征。结构一致性损失、结构判别损失和结构关系损失共同约束特征空间。该图展示了在特征学习过程中如何整合服装外观与组件拓扑结构。请点击此处查看此图的放大版本。

图 2:构建图像级服装部件拓扑结构先验。 (A) 输入的服装图像 I。 (B) 前景受限的视觉部件图 P,其中七种颜色表示图像级服装区域;所有背景像素均被排除在部件通道之外。 (C) 图像级部件关系图 G;节点表示可见的服装区域,实线边表示共享的前景边界,虚线关系表示预定义的垂直顺序。该图与映射支持图像检索和视觉结构比较,但不表示裁剪样板片、缝合几何结构、省道结构、放码参数或裁剪说明。 请点击此处查看此图的放大版本。

图3:基于结构引导的特征融合模块。 结构特征通过线性映射和激活函数 Ψ 进行变换,以生成结构权重。该结构权重通过逐元素相乘的方式对表观特征进行调制。调制后的表观特征与结构特征进行拼接,并通过矩阵 Wc 投影,随后加入残差形式的结构特征,以生成最终的组分特征。该图表明,在最终融合之前,结构信息对表观特征的加权起到了调控作用。请点击此处查看此图的放大版本。

图 4:在结构一致性约束下的特征空间优化。 (A) 属于相同结构类别的样本通过结构一致性损失被拉近,同时其内部组分关系由结构关系损失保持不变。(B) 来自不同结构类别的样本通过结构判别损失被推远。该图展示了这三个结构目标如何共同增强类内紧凑性和类间分离性。请点击此处查看此图的放大版本。

图5:服装特征响应的代表性结果及组件图可视化。 (A) 输入的服装图像。(B) ResNet-50 外观基线模型的类别激活响应。(C) 图像级服装组件图由前景受限的组件图、组件中心矩阵、带类型的邻接矩阵、非活跃节点掩码以及组件标签映射重建而成,这些数据在方案第3和第4节中已保存。节点表示活跃的服装区域,实线边表示共享的前景边界,虚线边表示预定义的垂直顺序关系。(D) 融合后的组件感知表征的激活响应。对比展示了以纹理为主导的激活与以服装区域为引导的激活之间的差异。请点击此处查看此图的放大版本。

图6:在红色背景干扰下的检索结果及中间结构证据。 (A) 查询图像。 (B) 查询组件图由保存的组件中心和带类型的邻接矩阵生成。 (C) 查询的带类型邻接矩阵,其中矩阵值用于区分非活动关系、共享的前景边界以及预定义的垂直顺序关系。 (D) 外观基线方法生成的前三项检索结果。 (E) 基于结构感知表示生成的前三项检索结果。 (F) 排名最高的结构感知结果的组件图。 (G) 查询图像与排名最高的结果之间的后融合组件对应矩阵。较高的对角线对应值表示具有相同标识符的组件之间的一致性,而较弱或偏移的响应则表明组件组织存在缺失或不匹配。检索结果保留了粗略的上身类别,但在袖型配置和局部拓扑结构上未实现完全一致。请点击此处查看此图的放大版本。

图7:从图像级服装拓扑到空间响应的结构差异追踪。 (A) 参考图像。 (B) 目标图像。 (C) 参考组件图。 (D) 目标组件图。两个图均根据保存的组件中心和类型化邻接矩阵重建。 (E) 类型化邻接差异矩阵。 (F) 几何关系差异由组件中心位移、空间离散度以及关系权重变化推导得出。 (G) 融合后组件差异图,其中节点强度表示对应融合组件向量之间的归一化距离,边宽度表示关系权重的变化。 (H) 纯空间差异响应热图,使用与叠加图相同的固定响应尺度渲染。 (I) 响应叠加在目标图像上的结果。仅当邻接变化、几何关系变化、组件距离变化以及前景对齐的热响应保持一致时,才认定存在结构差异。缺乏组件或关系对应证据的背景激活被视为残余干扰,而非有效的服装结构差异。 请点击此处查看该图的放大版本。

图 8:基于结构感知的特征空间聚类。 (A) 短袖上衣、裤子、裙子、长外套和连衣裙的 t-SNE 投影。这五类服装形成了主要的特征区域,在类别边界附近仅有有限的重叠。(B) 被分配到这五种服装类别的代表性测试图像,其边框颜色与 (A) 中类别的颜色相对应。该图展示了类别级别的结构化组织,同时在相邻类别区域附近保留了少量样本。请点击此处查看此图的高清版本。

图9:不同特征空间结构与检索排序目标下的原始性能比较。 (A) 外观驱动基线方法、弱结构模型、显式结构模型以及所提出方法的SCI和SDI结果。(B) 上述四种方法的Recall@5和mAP结果。大标记表示五次独立运行的算术平均值,误差线表示样本标准差,小标记表示单次运行的结果。SCI和SDI在0到1的固定尺度上显示,而Recall@5和mAP在0%到100%的固定百分比尺度上显示。未进行最小-最大归一化或跨方法重缩放处理。请点击此处查看该图的放大版本。

图 10:不同模块配置下的结构差异响应。 (A) 参考图像。 (B) 目标图像。 (C) 无结构先验变体的响应。 (D) 无融合模块变体的响应。 (E) 完整模型的响应。 (C–E) 使用相同的归一化响应尺度、颜色映射和叠加设置进行渲染。 (F) 非融合变体与完整模型之间的前景限制绝对响应差异。完整模型在保留主要与服装对齐的响应的同时,减少了主结构区域外的残余扩散。该比较表明,结构先验减少了服装外干扰,而融合模块进一步增强了结构响应的锐度。 请点击此处查看该图的放大版本。

图11:基于验证集的结构约束权重选择。在结构约束权重分别为0.1、0.3、0.5、0.8、1.0、1.2、1.5和2.0的条件下报告了验证集上的Recall@5结果。每个数据点表示五次验证运行的算术平均值,每条误差线表示样本标准差。在最终测试评估之前,权重固定为1.0。该图记录了参数选择过程,并不构成独立的模型结构贡献。请点击此处查看此图的高清版本。
表1:S1至S5服装子集的数据集分配及图像层级拓扑统计信息。 该表列出了各结构层级的训练、验证、测试及总图像数量,以及平均语义组件数、活动节点数、带类型边数和标注图像平面关键点数。所有数值均来源于处理后的数据清单。训练、验证和测试图像数量来自经过结构审查、重复组控制和数据泄露检查后的最终子集清单;拓扑统计数据则基于最终图记录计算得出,所用组件顺序和关系定义与模型评估期间一致。请点击此处下载该文件。
表2:本实验方案中使用的计算环境、输入配置、数据增强、表示方法、优化算法、损失函数及可重复性设置。 该表格列出了确切的操作系统、处理器、安装内存、图形处理器、显存、显卡驱动程序、CUDA、cuDNN、Python、NumPy、PyTorch 和 torchvision 的版本,以及图像尺寸、批量构建方式、优化器、学习率调度、训练轮数、随机种子、表示维度和结构目标权重。每个数值均链接至 software_versions.txt、configs/protocol.yaml 或相应的训练记录。请点击此处下载该文件。
表3:通用视觉表示模型、基于图的服装模型和领域特定时尚检索方法的定量比较。 该表格报告了在相同数据划分和评估协议下,十一种方法的检索重点、查询模态、SCI、SDI、Recall@5、mAP 和轮廓系数。所有指标均报告五次独立运行的均值和样本标准差。所报告的p值是通过双侧配对t检验,使用相同五个随机种子生成的结果,将每种对比方法与所提出方法进行比较而获得的。所提出的方法作为参考行。请点击此处下载该文件。
表4:结构先验与特征融合模块的消融实验结果。该表格报告了无结构先验变体、无融合模块变体以及完整模型在SCI、SDI和Recall@5指标上的表现。移除结构先验导致SCI和Recall@5下降更明显,而移除融合模块则降低了SDI和响应对齐能力。完整模型在三项指标上均取得最高值。请点击此处下载该文件。
表5:ResNet-50 基线模型与完整结构感知模型的计算效率。 本表列出了在表2及材料表中记录的完全相同的硬件和软件环境下,每个图像的可训练参数数量、浮点运算次数以及平均推理时间。两个模型采用相同的图像分辨率、推理批次设置、预处理操作和计时程序。与基线模型相比,完整模型每个图像增加了370万个参数、13亿次浮点运算以及7毫秒的推理时间。请点击此处下载该文件。
最关键的实验步骤是保持服装结构的预处理和前景受限的语义组件解析。组件中心、空间离散值、共享边界关系、垂直顺序关系、关系权重以及融合表征均源自解析结果。边界渗漏、组件区域合并、组件区域缺失以及通道分配错误会在图构建和特征融合过程中传播。这些错误可能生成尺寸上有效的图文件,但其所表示的组件关系仍与原始服装不一致。因此,在接受结构先验之前,必须验证概率图、前景限制、组件预览以及解析质量记录。
图构建与特征融合需要语义组件的固定顺序。该图由前景服装组件及其在图像平面中的关系推导而来。检索与差异定位图示揭示了结构化处理路径,而不仅仅是展示最终排序的图像或响应热图。类型化邻接矩阵用于记录离散组件关系,几何关系矩阵用于记录归一化的空间结构,融合后的组件矩阵则记录用于检索与定位的表示形式。仅当这些中间表示与最终视觉输出一致时,方可接受相应的结构化结论。该组件图不使用解剖学标志点、人体关节坐标或姿态估计网络。仅当图叠加的节点及其关系类型是从保存的组件与邻接文件中复现时,才应接受该叠加结果。非活跃组件应保持为零向量,并带有非活跃节点标识符;外观特征矩阵与结构特征矩阵在融合前均必须各自包含 K 行和 512 列。这些检查可防止将节点错位或维度错误误解释为模型行为。
故障排除应从最早的无效中间输出开始。概率图均匀分布表明存在检查点、归一化或类别索引错误;结构矩阵出现非数值结果表明概率分母无效或坐标缩放错误;响应弥散且颜色主导检索结果表明结构先验过弱、融合失败或检查点加载错误。训练日志应确认图结构和融合层中的梯度,以及基于验证集的检查点选择。视觉热响应不应作为独立的结构结论使用,必须结合保存的前景掩膜、输入的邻接变化、几何关系矩阵以及融合后的组分差异图进行验证。在服装前景区域外出现残余激活,表明响应特异性有限,而非经过验证的结构差异。
与外观驱动的检索方法相比,该方案在度量学习之前引入了组件拓扑结构。与弱结构约束和固定拓扑图模型相比,语义关系权重能够使图传播适应当前服装。完整模型在表3中报告的SCI达到0.81,SDI为0.71,Recall@5为89.2%,mAP为86.4%,轮廓系数为0.74。如表4所示,新增的结构模块使参数量从2560万增加到2930万,每张图像的推理时间从15毫秒增加到22毫秒。该方案的技术贡献在于构建了图像级服装组件图、外观与组件关系的并行编码、结构引导的特征融合机制,以及结构一致性、关系性和判别性目标函数。在图11中报告的验证扫描仅用于确定固定的训练系数,并不作为对网络架构或目标函数设计的贡献。
该方案对严重遮挡、衣物重叠、源图像尺寸过小、姿态变化、复杂背景以及不符合固定七区域模式的服装结构仍较为敏感。不对称设计、可拆卸层、密集褶皱、多层下装以及重叠的装饰区域可能导致多个语义区域合并,或引入当前图结构定义中不存在的组件关系。遮挡可能抑制活动组件、使其概率质心偏移,并消除有效的共享边界关系。图6展示了粗略上身类别的恢复结果,但袖子拓扑匹配不完整;而图7和图10在相邻背景区域仍保留响应。这些结果表明,有效的张量维度和图连通性并不能保证语义上正确的结构解释。因此,本研究支持基于图像的检索、聚类及差异定位,而非设计流程效率或版型参数的直接估计。本研究中所有定量实验均在保留并重新进行结构标注的DeepFashion2数据集上进行。当前结果尚未验证在具有不同服装分类体系、标注标准、文化服饰类别、图像来源或采集环境的独立数据集上的鲁棒性。迁移到其他数据集可能需要重新映射七个组件通道并重构带类型的关系模式。因此,所报告的结论仅限于所评估的数据分布及图像层级的组件定义。
在上述限制范围内,本方案通过语义解析、几何关系建模、双流编码及结构引导融合,实现了从服装图像到部件感知表示的可重复流程。未来的验证将采用具有不同标注体系、服装类别、姿态和背景条件的独立服装数据集。同时将评估当前的七区域映射是否需要扩展,以适应不对称、多层、可拆卸及具有文化特性的服装结构。手绘设计草图、跨面料变化以及参数化版型调整仍属于独立的应用方向,需依赖特定任务的数据与评估流程。专业可用性与设计评审效率的评估,需另行开展基于明确参与者、评估标准和统计方法的人因研究,并进行独立记录。
作者声明无任何利益冲突。
本工作受“十四五”期间第二批省级本科教学改革重点项目资助,项目名称为基于“三融合、三结合”共建模式的“服装与服饰设计”教学改革探索(项目编号:JGZD2024096)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 中央处理器 | Intel Corporation | Intel Core i9-13900K,24 核,32 线程,最高 5.80 GHz | |
| Conda | Anaconda, Inc.,anaconda.com | Miniconda3 23.11.0 | |
| CUDA 工具包 | NVIDIA Corporation,developer.nvidia.com | CUDA 11.8 | |
| cuDNN | NVIDIA Corporation,developer.nvidia.com | cuDNN 8.9.7 | |
| DeepFashion2 数据集 | 香港中文大学,github.com/switchablenorms/DeepFashion2 | 官方 DeepFashion2 发布版本 1.0 | |
| 图形处理器 | NVIDIA Corporation | NVIDIA GeForce RTX 4090,24 GB GDDR6X | |
| HRNet-W48 语义解析检查点 | HRNet 项目,github.com/HRNet/HRNet-Semantic-Segmentation | hrnet_w48_garment_parser_7class.pth,项目检查点版本 1.0 | |
| ImageNet 预训练 ResNet-50 权重 | PyTorch 基金会,pytorch.org | ResNet50_Weights.IMAGENET1K_V2 | |
| Matplotlib | Matplotlib 开发团队,matplotlib.org | 版本 3.8.2 | |
| NumPy | NumPy 开发者,numpy.org | 版本 1.26.4 | |
| NVIDIA 显卡驱动程序 | NVIDIA Corporation | 版本 546.33 | |
| OpenCV-Python | OpenCV 团队,opencv.org | 版本 4.8.1.78 | |
| 操作系统 | Microsoft Corporation | Windows 11 Pro 23H2,64 位,系统版本 22631.3155 | |
| Pandas | Pandas 开发团队,pandas.pydata.org | 版本 2.1.4 | |
| Python | Python 软件基金会,python.org | 版本 3.10.13 | |
| PyTorch | PyTorch 基金会,pytorch.org | 版本 2.1.2,支持 CUDA 11.8 | |
| PyYAML | PyYAML 项目,pyyaml.org | 版本 6.0.1 | |
| scikit-learn | scikit-learn 开发者,scikit-learn.org | 版本 1.3.2 | |
| SciPy | SciPy 开发者,scipy.org | 版本 1.11.4 | |
| 源代码仓库 | 随稿件提交的补充源代码归档 | 服装拓扑协议,版本 1.0 | |
| 存储设备 | Samsung Electronics | Samsung 990 PRO NVMe SSD,2 TB | |
| 系统内存 | Kingston Technology | Kingston FURY Beast DDR5,64 GB,2 × 32 GB,5600 MHz | |
| torchvision | PyTorch 基金会,pytorch.org | 版本 0.16.2,支持 CUDA 11.8 | |
| 工作站 | 自定义构建的深度学习工作站 | Intel Core i9-13900K,NVIDIA GeForce RTX 4090,64 GB 内存,2 TB NVMe SSD |