方法文章

基于服装部件拓扑结构的图像特征学习方案用于设计参考检索

1 次观看

DOI:

10.3791/72103

2026年9月1日

本文内容

摘要

本方案通过整合语义部件解析、拓扑建模、双流特征编码以及结构引导的融合方法,生成具有结构感知能力的服装表征。该方法使计算机视觉与服装研究领域的研究人员能够基于服装部件的组织关系和轮廓布局进行服装检索与设计参考比对,而不仅依赖于颜色或纹理特征。

摘要

服装图像检索方法通常强调颜色和纹理,这可能导致在外观相似但部件布局不同的服装之间产生混淆。本研究提出了一种面向部件的特征学习协议,用于服装图像检索与设计参考比对。该协议对服装的语义区域进行解析,构建图像层级的服装部件图,平行编码外观特征与部件间关系,并通过结构一致性、结构关联性与结构区分性损失融合两种表征。DeepFashion2 图像被标准化为 512 × 512 像素,使用 HRNet-W48 进行解析,通过 ResNet-50 与图卷积进行编码,并通过结构化检索与聚类进行评估。完整模型实现了 0.81 的结构一致性指数、0.71 的结构区分性指数、89.2% 的 Recall@5、86.4% 的平均精度均值(mAP)以及 0.74 的轮廓系数。该协议支持在表面外观无法可靠反映服装结构时,进行服装结构检索、结构比对及差异定位。

引言

随着计算机视觉与人工智能在服装行业中的持续融合,服装图像分析已逐渐从基础的识别任务扩展到以设计为导向的分析与决策支持12。在服装设计过程中,设计方案之间的区别更多地取决于结构构成与部件间的关系,而非外观上的简单差异,这使得服装图像特征在设计辅助中的结构表达能力成为影响分析效果的关键因素34。然而,大多数现有的视觉方法仍主要依赖纹理、颜色和整体轮廓作为特征,难以在设计过程中对服装的层次结构与构造差异进行系统性分析56。因此,开发一种面向结构的服装图像特征学习方法,对于提升设计分析的客观性与一致性具有重要意义7。本方案适用于服装在颜色、纹理或整体轮廓相似,但在部件组织方式、连接模式或空间布局上存在差异的情况。在此类条件下,以外观为中心的表示方法往往会在特征空间中将结构上不同的设计置于相近位置,从而削弱了检索与设计对比的可靠性。本方案针对的是以服装部件间关系为主要依据的结构检索、设计评估与局部差异分析任务。

在数据规模、模型复杂性和任务多样性方面,当前针对服装图像的自动分析与理解研究已取得显著进展8,9。然而,在实际应用中,服装结构信息通常隐含地存在于分割或检测结果中,并未在特征学习阶段进行统一建模,导致特征空间中不同结构设计之间缺乏稳定的区分性10,11。服装部件之间的空间关系、层次约束以及拓扑结构未被显式编码,使得特征表示难以反映设计层面的结构差异12,13。缺乏显式的结构建模限制了服装图像特征在辅助设计场景下的分析精细度与决策可靠性,成为发展具有更深层次语义理解能力的智能设计系统的主要障碍14

为了支持服装图像特征的学习与分析,相关研究已探索了多个技术方向15。语义分割与服装解析方法通过像素级标注实现了对服装区域和组件的细粒度划分,为结构信息提取提供了基础16,17。基于图像查询的服装检索方法则融合了拓扑结构与颜色纹理、全局与局部注意力对齐、服装解析、多尺度与多粒度表示以及结合特征选择的残差注意力机制。这些方法应用于商品目录搜索、消费者到店铺匹配、跨领域产品检索以及电子商务视觉搜索等场景。其应用设置与设计参考检索密切相关,因为每种方法都基于视觉查询对服装图像进行排序,但其表示方式在特征融合过程中未能始终保留带有类型信息的组件邻接关系和垂直顺序关系18,19,20。与此同时,针对设计与推荐场景的研究逐步引入了多模态融合、关系建模和风格分析,拓展了服装视觉特征的应用边界21,22。尽管这些方法在其各自任务中取得了进展,其核心特征仍主要基于外观描述,且结构信息尚未被统一建模为特征学习的固有约束,因而难以满足服装设计辅助中对结构对齐与结构比较的需求23

为解决服装设计辅助中结构区分能力不足的问题,本文提出一种基于服装结构感知的图像特征学习方法。该方法在服装图像输入阶段融入服装分析结果与关键结构信息,联合建模服装部件区域、空间关系及层次连接。通过结构关系编码与视觉特征对齐,显式地将服装结构约束整合到特征学习过程中,生成一种既保留视觉外观又保持结构一致性的表征。该特征在统一空间内刻画服装结构差异,为后续的结构相似性分析、结构聚类及设计辅助决策提供了稳定基础,从而缓解了现有方法因缺乏结构建模而导致的特征混淆问题。不同于将结构信息视为松散关联辅助属性的通用视觉检索策略,本框架构建了一种以拓扑关系为核心的特征调制机制。该机制促使所学习的表征遵循可见的服装区域组织结构,同时降低由纹理主导的响应。每个图节点表示一个图像级语义区域,每条图关系描述图像平面中可见的邻接关系或归一化的相对位置。所生成的嵌入表示支持跨服装图像的部件布局与轮廓结构的比较。这些区域与关系并非缝纫纸样片、缝线连接、结构标记点或放码参数。相较于以外观驱动的检索方法,本方案在特征学习全过程保留了明确的部件拓扑结构,而非将结构信息作为下游分析结果处理。相较于仅将结构线索作为辅助输入的方法,双流编码与拓扑一致性融合策略在保留几何关系的同时,进一步抑制了纹理主导的响应。所生成的表征支持服装结构检索、结构聚类、设计参考筛选以及局部化设计差异分析,并提供在服装设计流程中可解释的部件级依据。本方案相关研究涵盖服装图像特征学习、服装结构建模、结构感知表征以及服装设计辅助的视觉分析等领域。

在特征表示层面,服装图像研究长期以来主要关注外观建模、深度特征提取以及多尺度表示24,25。早期研究采用卷积神经网络对服装图像进行端到端建模,以完成分类、检索和相似性匹配等任务26,27。随后,引入了多尺度特征融合和跨域学习方法,以缓解不同视角、姿态和拍摄条件下服装图像之间的差异28,29。在检索任务中,研究者采用注意力机制和特征压缩策略,以提升特征的判别能力与计算效率30,31。这些方法能够实现可靠的外观区分,但其特征学习过程仍主要聚焦于全局视觉信息,缺乏对服装内部结构的系统性表达32。组合式时尚检索方法进一步结合参考图像与文本修改指令,但其查询模态不同于本文所研究的纯图像协议。此类方法被视为相关的商业检索方向予以综述,由于额外的文本输入将无法实现受控的图像查询评估,因此未纳入定量比较。

随着服装图像分析从外观区分转向结构理解,研究 increasingly 集中于对服装部件、几何关系和拓扑连接的建模33。语义分割网络通过特征投影和多注意力机制实现了服装部件级别的分析,为结构信息提取提供了可靠的基础34,35。关键点检测与结构拓扑建模方法进一步刻画了服装轮廓与局部结构之间的关系,增强了模型对服装几何特征的表达能力36,37。一些研究引入图结构和关系推理网络来建模服装部件之间的关系,从而提升了细粒度识别和跨域检索的性能38,39。这些工作验证了结构信息在视觉分析中的重要作用,但结构信息大多仍作为辅助特征或中间结果使用,尚未建立以结构约束为核心特征学习系统40

在服装设计辅助领域,这些发展已支持了设计推荐、风格分析、交互系统构建以及以结构为导向的设计评估41。推荐系统研究通过融合视觉特征与用户偏好,实现了服装搭配推荐与个性化推荐42。与设计辅助相关的工作通过结合生成模型、风格建模以及人机协同机制,探索了智能化设计支持的新路径43。关于虚拟试穿、尺寸测量和风格迁移的研究,拓展了服装视觉分析在设计与生产全过程中的应用。尽管这些研究丰富了服装设计辅助的技术形式,但其核心视觉特征仍主要以外观驱动为主,缺乏对设计结构的统一表示以支持分析。相比之下,本文将服装结构视为特征表示的核心约束,提出了一种面向服装设计辅助中结构分析的视觉表示方法。

尽管取得了这些进展,当前生成设计方法通常将结构条件视为扩散过程中的松散空间引导矩阵。现有的结构解析框架将拓扑结构表示为辅助语义标签,与主要的视觉嵌入空间相分离。本文提出的框架通过定义一种基于图先验的拓扑约束机制,显式地在组件层面对视觉特征学习进行调制,从而改变了这一现状。多层级一致性目标鼓励具有相似图像级组件布局的服装在特征空间中保持相近,同时将可见区域组织不同的服装分离开来。该目标在评估的检索任务中降低了对纹理的依赖性,但并未实现对材料、姿态或背景变化的不变性。当输入图像包含足够可见的单件服装、语义组件保留可识别的边界,且分析目标需要组件级的结构比较而非粗粒度类别识别时,应选择本方案。本方案适用于从事结构敏感型视觉分析的计算机视觉研究人员、服装设计研究人员以及数字服装开发团队。它不适用于仅关注颜色或材料识别的任务,也不适用于服装拓扑结构大部分被遮挡的图像。以下方案详细介绍了从数据集准备和语义概率映射,到几何关系构建、双流特征编码、结构引导融合以及基于一致性的优化的完整工作流程。完整的工作流程在图1中进行了总结。

方案

本研究使用公开可用的服装图像数据集,未招募人类受试者,未收集个人身份信息,未进行动物实验,也未使用生物材料。无需机构伦理审批和知情同意。

1. 软件环境与项目配置

  1. 将已发布的项目文件放置在一个具有足够存储空间的目录中,并在项目根目录下打开终端。
  2. 运行 conda env create -f environment.yml 创建软件环境。运行 conda activate garment_structure 激活该环境。
  3. 运行 python --version、conda --version、pip show numpy、pip show torch、pip show torchvision 和 nvidia-smi。将完整的命令输出保存至 software_versions.txt 文件中。
  4. 在数据预处理、模型训练、推理、效率测量和评估过程中使用相同的记录环境。在同一文件中记录 HRNet-W48 检查点文件名及 SHA-256 值、ImageNet 预训练 ResNet-50 权重标识符及 SHA-256 值、DeepFashion2 发布来源以及源代码仓库标识符。
  5. 在项目根目录下创建 data_raw、data_processed、parser_outputs、structural_priors、feature_outputs、checkpoints、logs 和 evaluation_results 目录。
  6. 打开 configs/protocol.yaml 文件。在 dataset_root 中填入 DeepFashion2 数据集目录,在 parser_checkpoint 中填入预训练 HRNet-W48 检查点路径,在 output_root 中填入项目输出目录。
  7. 设置 input_height 为 512,input_width 为 512,batch_size 为 32,structural_categories_per_batch 为 8,samples_per_category 为 4,random_seed 为 42,feature_dimension 为 512,structural_constraint_weight 为 1.0,structural_relationship_weight 为 0.5,structural_discrimination_weight 为 1.0,separation_threshold 为 0.3。
  8. 将优化器设为小批量随机梯度下降(mini-batch stochastic gradient descent)。设置 initial_learning_rate 为 0.0001,momentum 为 0.9,weight_decay 为 0.0005,max_epochs 为 120,learning_rate_schedule 为多阶段衰减(multi-step decay),learning_rate_decay_factor 为 0.1。在 learning_rate_milestones 中填入已发布配置所使用的验证过的衰减轮次。
  9. 运行 python tools/export_experiment_tables.py --config configs/protocol.yaml --output evaluation_results。将完整的模型配置导出至 model_setting_statistics.csv。验证导出的文件是否记录了输入图像尺寸、输入格式、批次构成、优化器、学习率、学习率调度策略、训练轮数、权重衰减、动量、数据增强概率、特征维度、结构损失权重、分离阈值、随机种子、检查点选择规则以及独立运行次数。
  10. 预期输出:确认软件环境能够无依赖错误地启动,software_versions.txt 包含环境记录,所有输出目录均已创建,configs/protocol.yaml 包含有效的绝对路径和数值设置。
    注意:在数据处理、模型训练、推理和评估过程中使用相同的环境和配置文件。每次保存训练检查点时,均应附带一份 configs/protocol.yaml 的副本。
    ​故障排除:若因某个软件包不可用导致环境创建中断,请删除不完整的环境,检查 environment.yml 中的软件包通道配置,并重新创建环境。若 nvidia-smi 未报告图形处理单元(GPU),请停止模型训练,并重新安装图形驱动程序和 CUDA 运行时。若执行过程中出现目录错误,请将相对路径替换为绝对路径,并确认 output_root 具有写入权限。

2. 输入图像的接收、数据集构建与预处理

  1. 仅使用扩展名为 JPG、JPEG 或 PNG 的文件。使用包含单个主要服装的 8 位 RGB 图像。
  2. 保留宽度和高度至少为 512 像素且具有一个可识别主要服装的 8 位 RGB 图像。当服装前景占据整个图像区域的比例小于 15% 时,当超过 5% 的服装掩码边界与图像边框重合时,当次要服装区域超过主要服装区域的 10% 时,当估计的遮挡区域超过主要服装掩码的 20% 时,或当拉普拉斯响应的方差低于 100 时,拒绝该图像。
  3. 在 excluded_samples.csv 中记录图像标识符、测量值、触发的排除规则和注释路径。
  4. 在进行结构标注和数据划分之前,将输入接受规则应用于 DeepFashion2 源图像。在 data_filtering_manifest.csv 中记录每个被接受和被拒绝的图像标识符、原始数据集划分、服装注释标识符、源配对标识符、前景区域比例、边界接触比例、遮挡比例、模糊评分以及最终保留状态。
  5. 运行 python tools/prepare_data.py --config configs/protocol.yaml。
  6. 从数据集注释中读取服装边界框。将边界框在其宽度和高度方向上扩展 5%,但不得超过图像边界。
  7. 裁剪服装区域,保持其原始宽高比,添加零填充以形成正方形图像,并将填充后的图像调整为 512 × 512 像素。
  8. 将调整大小后的图像转换为具有浮点值的 RGB 张量。将每个像素值除以 255。
  9. 使用均值分别为 0.485、0.456 和 0.406,标准差分别为 0.229、0.224 和 0.225,对红、绿、蓝三个通道进行归一化。
  10. 对训练图像以 0.5 的概率应用水平翻转,以 0.2 的概率应用随机擦除。对验证和测试图像仅应用确定性的裁剪、填充、调整大小和归一化操作。
  11. 在生成七通道组件图、共享边界矩阵和垂直顺序矩阵后,运行 python tools/assign_structural_levels.py --config configs/protocol.yaml。对于每个保留的图像,计算活动节点数、连通分量数、分支节点数、独立环数以及最长的有向垂直顺序路径。将分支节点定义为在共享边界图中连接至少三个其他活动节点的活动节点。
  12. 当图连通、不含独立环、不含分支节点且最长垂直顺序路径不超过两条边时,分配 S1 级别;当图连通、不含独立环、恰好包含一个分支节点且最长垂直顺序路径不超过两条边时,分配 S2 级别;当图连通、不含独立环且包含至少两个分支节点或一条长度至少为三条边的垂直顺序路径时,分配 S3 级别;当图连通、恰好包含一个独立环且垂直顺序路径不超过两条边时,分配 S4 级别;当图包含至少两个独立环,或包含一个独立环并同时具有一条长度至少为三条边的垂直顺序路径时,分配 S5 级别。
  13. 按 S5、S4、S3、S2、S1 的顺序应用规则,并将计算得到的图统计量、分配的级别和规则标识符保存至 structural_level_manifest.csv。
  14. 根据保存的组件掩码和关系矩阵自动生成功能性的 S1–S5 标签。当样本的组件图包含多个连通分量、服装前景内部的最大组件概率均值低于 0.60、某个活动组件占据服装前景面积小于 1%,或在边界接触宽度从 1 像素变为 2 像素后其分配的结构级别发生变化时,将该样本标记为结构模糊。
  15. 将每个模糊样本提交给两位作者,独立检查源图像、组件图、共享边界矩阵、垂直顺序矩阵和初步图结构。当两次检查结果一致时保留标签;若存在分歧,则提交给第三位作者,并以多数意见作为最终标签。若经审查后仍无法恢复稳定的组件关系,则排除该样本。在 structural_label_audit.csv 中记录自动标签、审查标签、分歧原因、最终标签和排除状态。
  16. 计算每个保留源文件的 SHA-256 值,并从归一化的服装裁剪图像中计算 64 位感知哈希。将具有相同 SHA-256 值的图像归入同一精确重复组。在确认来自同一服装实例的前提下,将感知哈希之间汉明距离不超过 4 的图像归入同一近似重复组。
  17. 将所有共享相同 DeepFashion2 源配对标识符或服装身份的图像合并为一个源组。在 duplicate_group_manifest.csv 中保存文件哈希、感知哈希、源标识符和重复组标识符。
  18. 在源组级别而非单个图像级别进行数据划分。将每个精确重复组、近似重复组和源身份组整体分配至一个子集。划分完成后检查所有跨子集配对,并将检测到的任何身份冲突、哈希冲突和感知哈希冲突写入 leakage_audit.csv。持续重建清单文件,直到 leakage_audit.csv 中不再包含未解决的跨子集记录。
  19. 根据最终的 S1–S5 标签对源组进行分层,并按照 表 1 中所示的已验证分配方案,将完整组分配至训练、验证和测试子集。报告每个结构级别和子集的精确图像数量和源组数量。
  20. 根据最终保留的队列计算实际的训练、验证和测试比例,而非基于未过滤的数据集。在参数学习、阈值确定、结构级别规则调整或检查点选择过程中,不得使用验证图像、测试图像、因模糊被排除的图像或属于其重复组的图像。
  21. 将处理后的图像保存至 data_processed/images。将 train_manifest.csv、validation_manifest.csv、test_manifest.csv、pair_manifest.csv 和 structural_level_manifest.csv 保存至 data_processed/manifests。
  22. 从处理后的清单中读取最终的结构标签、审查状态、重复组标识符、源组标识符和子集标签。统计 S1 至 S5 各级别的自动接受样本数、人工审查样本数、模糊性排除数、重复性排除数、源组数、训练图像数、验证图像数和测试图像数。
  23. 计算实际的子集比例、平均活动节点数、平均分支节点数、平均独立环数、平均垂直顺序深度和平均类型边数。将完整统计结果保存至 evaluation_results/dataset_statistics.csv。
  24. 预期输出:确认每个被接受的图像均为尺寸为 512 × 512 像素的 8 位 RGB 图像,并具有一条过滤记录、一个最终结构级别标签、一个源组标识符、一个重复组标识符、一个子集标签和一个有效的注释路径。确认每个模糊样本均有完整的审查记录。确认没有任何源标识符、精确重复组、近似重复组或服装身份出现在多个子集中。确认 train_manifest.csv、validation_manifest.csv、test_manifest.csv 和 dataset_statistics.csv 中的图像数量一致。
    注意:在 data_raw 中保留原始未处理图像。不要对验证或测试图像应用随机增强。
    ​故障排除:如果裁剪导致衣领、袖子、下摆或裤腿被移除,请恢复原始注释并扩大保留的边界边距。如果服装看起来被拉伸,请在调整大小前确认已添加正方形填充。如果处理后的图像包含一个或四个通道,请将源文件转换为 8 位 RGB 并重新运行预处理。如果在不同子集中出现重复标识符,请在训练前重建所有子集清单。

3. 前景受限的视觉组件解析与概率映射

  1. 运行 python tools/parse_components.py --config configs/protocol.yaml。
  2. 从 parser_checkpoint 加载预训练的 HRNet-W48 服装语义解析检查点。验证该检查点输出由数据集标注映射定义的服装组件类别。将语义解析网络切换至评估模式,并禁用梯度计算。
  3. 依次从 train_manifest.csv、validation_manifest.csv 和 test_manifest.csv 中读取已处理的图像。
  4. 从每张输入图像中提取一个七通道语义响应张量,并在整个工作流程中将 K 设为 7。使用固定的类别顺序:上部装饰区域、领口区域、衣身区域、左侧下装区域、右侧下装区域、中部下装区域和下摆区域。在概率图、组件矩阵、图矩阵、特征矩阵、清单文件和可视化文件中均保持此顺序。
  5. 沿通道维度应用 softmax 函数以生成语义组件概率图 P。验证在每个像素处,所有 K 个通道的概率之和在容差 0.0001 范围内等于 1。
  6. 从数据集标注中加载服装前景掩码,并将其与 512 × 512 的已处理图像对齐。将前景区域外所有组件的概率设为零。沿通道维度对前景掩码内的组件概率重新归一化。
  7. 验证每个激活的组件区域仍位于服装前景区域内。若彩色组件区域延伸至周围墙壁、地板、窗帘或其他背景区域,则拒绝该解析样本。将被拒绝的图像标识符和解析错误记录到 parsing_quality_log.csv 中。
  8. 计算每个组件的前景覆盖比例,并标记具有碎片化区域或无支撑孤立区域的组件以供人工检查。
  9. 将语义响应张量保存至 parser_outputs/logits。将概率图保存至 parser_outputs/probability_maps。将彩色编码的组件预览图保存至 parser_outputs/previews。
  10. 预期输出:确认每张被接受的图像生成一个空间尺寸为 512 × 512 像素的七通道前景受限概率图、一个七通道语义响应张量和一张预览图像。确认通道索引 1 至 7 遵循第 3.4 步定义的固定组件顺序。确认所有彩色组件区域均位于服装前景区域内,且背景像素的组件概率为零。确认文件标识符与源清单中的对应条目一致。
    注意:在结构建模过程中,保留服装前景内连续的组件概率。将生成的区域视为视觉分析区域。不得将这些区域的边界解释为缝合线、裁剪线、样片轮廓、省道、剪口或放码参考。
    ​故障排除:若所有通道显示近乎均匀的概率,请检查 parser_checkpoint、RGB 通道顺序和图像归一化设置。若某一组件在整个子集中始终缺失,请比较标注索引与解析器输出通道索引。若组件颜色延伸至背景区域,请在图构建前检查前景掩码对齐、插值设置和标注坐标。若某一视觉区域跨越多个不相关的服装区域,请将该样本标记为解析失败,并从结构先验生成中排除。若通道概率之和不等于 1,请沿通道维度而非空间维度应用 softmax 函数。若缺少输出文件,请在解析器日志中定位最后一个已处理的标识符,并从下一个标识符继续解析。

4. 图像级组件几何结构与空间关系建模

  1. 加载每张图像的浅层视觉特征张量及其对应的概率图 P。
  2. 将每个空间特征向量乘以其对应语义成分所分配的概率。
  3. 在空间维度上对加权后的特征向量求和,并将总和除以该成分的总概率质量。
  4. 对于概率质量为零的任何成分,分配一个零向量和一个非活性节点标识符。
  5. 对每个活性成分嵌入应用 L2 归一化,并按照固定的语义成分顺序堆叠这些嵌入。
  6. 根据各视觉成分在前景受限的概率分布中计算其在图像平面上的水平和垂直中心坐标。通过图像宽度和高度对这些坐标进行归一化。
  7. 在相同的归一化坐标系下,计算每个视觉成分在图像平面上的水平和垂直扩散范围。这些值仅用于描述处理图像中可见区域的范围。
  8. 按照固定的成分顺序创建七个图节点,并将非活性成分保留为零节点。利用前景成分掩码之间的八邻域接触关系构建一个 7×7 的共享边界矩阵。使用从上边缘区域到领口区域、从领口区域到衣身区域、从衣身区域到各个下装区域、以及从各个下装区域到下摆区域之间的固定垂直顺序关系构建一个 7×7 的垂直顺序矩阵。将所有有效关系以双向方式存储。
  9. 在图卷积之前为每个活性节点添加自环,并将连接至非活性节点的关系保持为零。
  10. 计算每对有序语义成分之间的相对中心位移和相对空间离散度。将成对的几何值堆叠形成几何关系张量。
  11. 计算每对归一化成分嵌入之间的点积。对所得相似性矩阵按行应用 softmax 函数,并将结果值用作关系权重。
  12. 将几何关系张量与对应的关系权重相乘,并对每个成分的加权关系进行聚合。
  13. 将成分嵌入矩阵、成分中心矩阵、空间离散矩阵、共享边界矩阵、垂直顺序矩阵、自环矩阵、关系权重矩阵、非活性节点掩码、成分标签映射以及结构先验表示保存至 structural_priors。所有适用的矩阵均以七行七列的形式保存。从前景受限的成分图到图像级服装成分拓扑结构先验的完整构建过程如 图2 所示。
  14. 根据前景受限的概率图、成分中心矩阵、类型化邻接矩阵、非活性节点掩码以及成分标签映射,为每个可视化样本生成成分图叠加。
  15. 将每个活性节点放置在对应成分的中心位置。使用实线边表示共享的前景边界,使用虚线边表示预定义的垂直顺序关系。
  16. 使用源图像标识符将每个图叠加保存至 structural_priors/visualizations。在 component_graph_visualization_manifest.csv 中记录源图像路径、概率图路径、成分中心路径、类型化邻接路径、非活性节点掩码路径、语义解析检查点标识符以及图叠加路径。
  17. 预期输出:确认每张图像生成一个具有 K 行的成分嵌入矩阵、一个 K×K 的类型化邻接矩阵、一个 K×K 的关系权重矩阵、一个包含 K 个值的非活性节点掩码,以及一个图像级结构先验表示。确认每个选定的可视化样本生成一个成分图叠加,其中活性节点位于对应的服装区域内。
    注意:在所有矩阵、清单、图、特征文件和图叠加中保持相同的视觉成分顺序。将成分中心、空间扩散值和图关系视为图像平面中的服装区域描述符。不得将成分图解释为人体姿态骨架,也不得从解剖学关节坐标推导其节点。不得将这些描述符转换为缝线长度、曲线半径、省道收量、剪口位置、布纹方向、放码增量或纸样部件尺寸。
    ​故障排除:如果矩阵中包含非数值,应检查概率质量分母和坐标归一化过程。如果关系权重集中在某一成分上,应在 softmax 之前从相似性矩阵中减去每行的最大值。如果不同图像之间的图节点数量不一致,请验证非活性成分是否仍以零向量形式存在,而非被移除。

5. 双流结构感知特征编码

  1. 加载 ImageNet 预训练的 ResNet-50 权重,并移除最后的池化层和分类层。
  2. 将每张归一化后的服装图像输入 ResNet-50,并从 configs/protocol.yaml 中 appearance_stage 所指定的骨干网络阶段提取外观特征张量。验证该阶段名称、输出通道数以及在输入图像尺寸为 512 × 512 像素时该阶段生成的空间维度。在所有训练、推理、消融实验和对比实验中均使用相同的阶段。
  3. 通过双线性插值将语义概率图调整至外观特征张量的空间尺寸。将外观特征张量与每个调整后的组件概率图相乘,然后在空间维度上对加权响应进行聚合。
  4. 将每个组件的外观嵌入向量通过 configs/protocol.yaml 中定义的通道重校准层。记录该层的类型、输入维度、输出维度、压缩比、激活函数及参数共享规则。按照固定的语义顺序将得到的七个组件向量堆叠,形成外观特征矩阵。
  5. 将每个几何关系向量通过结构投影层,并将输出维度设为 512。利用关系权重矩阵和无效节点掩码构建组件图。
  6. 应用两个图卷积层,输入维度为 512,输出维度也为 512。在每个图卷积层后应用批归一化,然后应用 LeakyReLU。记录 LeakyReLU 所使用的负斜率值。在每一层后应用无效节点掩码,以确保无效组件的特征保持为零。
  7. 使用归一化的组件嵌入向量进行语义对齐,并将得到的向量堆叠形成结构特征矩阵。
  8. 预期输出:确认每张图像生成一个外观特征矩阵和一个结构特征矩阵。确认两个矩阵均包含 K 行和 512 列。
    注意:将无效组件保留为零向量,并保持结构先验构建过程中确定的组件顺序。
    故障排除:若两个特征矩阵的行数不同,请检查语义类别映射和无效节点处理逻辑。若矩阵乘法报出维度错误,请验证结构投影层输出和外观通道维度是否均为 512。若所有有效组件的结构特征仍为零,请检查当前批次中是否已正确添加图边和关系权重。

6. 结构引导的特征融合

  1. 应用图3所示的结构引导特征融合序列。将结构特征矩阵输入融合权重层,并应用在 configs/protocol.yaml 中由 fusion_activation 指定的激活函数。记录激活函数名称、输入维度、输出维度,以及七个组件节点之间是否共享参数。
  2. 验证生成的结构权重矩阵包含 K 行和 512 列。
  3. 将外观特征矩阵与结构权重矩阵进行逐元素相乘。
  4. 沿通道维度拼接调制后的外观矩阵与结构特征矩阵。
  5. 对每个组件,将512维的调制后外观向量与512维的结构向量拼接,形成1024维的向量。将拼接后的向量输入融合投影层,将其维度从1024降至512。
  6. 通过残差连接,将原始结构特征矩阵与投影后的矩阵相加。
  7. 按照固定的语义顺序堆叠融合后的组件向量,并对展平后的结构感知表示进行L2归一化。
  8. 将结构权重矩阵、调制后的外观矩阵、融合后的组件矩阵以及最终的结构感知表示保存至 feature_outputs。
  9. 预期输出:确认每张图像生成一个包含 K 行和 512 列的融合组件矩阵,以及一个与源图像标识符关联的归一化结构感知特征向量。
    注意:保留结构权重矩阵和融合组件矩阵,用于响应可视化和局部差异分析。
    ​故障排除:若融合值持续增长,请检查激活输出和归一化层。若所有结构权重趋近于相同值,请验证结构特征在不同图像间是否存在差异,并确认融合层接收到梯度。若特征文件与图像标识符不匹配,请在训练或检索评估前重新构建输出清单。

7. 模型训练与一致性优化

  1. 加载 configs/seeds.yaml 中记录的五个随机种子值。对于每次运行,为 Python、NumPy、PyTorch CPU 操作以及所有 CUDA 设备设置相同的随机种子。启用确定性算法,禁用 cuDNN 基准模式,并在相应的运行目录中记录确切的五个种子值。
  2. 加载已处理的训练清单、配对清单、概率图和结构先验信息。
  3. 构建每个训练批次,包含八个结构类别,每个类别包含四个外观变化的样本。
  4. 根据共享相同结构先验的正样本对计算结构一致性损失。
  5. 根据组件特征之间的成对距离计算结构关系一致性损失。
  6. 根据具有异质结构的负样本对计算结构判别损失,并应用 0.3 的分离阈值。
  7. 按照 configs/protocol.yaml 中存储的权重,结合外观目标、结构一致性目标、结构关系目标和结构判别目标。由三个结构目标控制的特征空间优化过程如 图 4 所示。
  8. 运行 python train.py --config configs/protocol.yaml。使用第 1.8 步中定义的初始学习率、动量、权重衰减、训练轮数、衰减因子和衰减轮次,通过小批量随机梯度下降更新所有可训练参数。在训练日志中记录每个训练轮次后的学习率。
  9. 在每个训练轮次后记录总损失、外观损失、结构一致性损失、结构关系损失、结构判别损失、学习率、结构一致性指数(SCI)、结构判别指数(SDI)和 Recall@5。
  10. 在每个训练轮次后使用 validation_manifest.csv 对模型进行评估。将与最高验证 SCI 对应的检查点保存至 checkpoints/selected_model.pth。
  11. 使用五个记录的随机种子重复训练五次。将每个配置文件、训练日志和选定检查点保存在独立的运行目录中。
  12. 预期输出:确认每次运行均生成一个训练日志、一个验证日志、一个按轮次的指标文件和一个选定的检查点。确认所选检查点基于验证性能而非测试性能。
    注意:在所有模型比较和消融实验中使用相同的训练、验证和测试清单。
    ​故障排除:如果某个损失变为非数值,停止训练,检查组件概率质量,将学习率降低 10 倍,并从最新的有效检查点重新开始。如果验证 SCI 保持不变而训练损失持续下降,请验证图传播和融合参数是否接收到梯度。如果显存耗尽,请减小批量大小,并通过梯度累积保持有效批量大小为 32。如果验证性能在不同运行间发生剧烈变化,请检查记录的随机种子和数据清单顺序。

8. 推断、检索、聚类与输出验证

  1. 运行 python infer.py --config configs/protocol.yaml --checkpoint checkpoints/selected_model.pth,为每张测试图像生成概率图、结构先验、外观特征矩阵、结构特征矩阵、融合组件矩阵以及最终特征向量。
  2. 将所有推理输出保存至 feature_outputs/test 目录下,并在 test_feature_manifest.csv 中记录其路径。计算每个查询特征与所有库图像特征之间的余弦相似度,按相似度降序排列库图像标识符,并将每个查询的前五个最高排名结果保存至 evaluation_results/retrieval_results.csv。
  3. 对于每个选定用于可视化的检索样本,加载查询图像的类型化邻接矩阵、关系权重矩阵、组件中心矩阵、非活动节点掩码、组件标签映射以及融合组件矩阵;同时加载结构感知模型生成的最高排名结果对应的相同文件。
  4. 根据保存的组件中心和类型化邻接矩阵,渲染查询图像和检索图像的组件图,保持模型推理过程中使用的固定组件顺序和关系类型。
  5. 将查询图像的类型化邻接矩阵渲染为分类矩阵,使用不同的矩阵值表示非活动、共享边界和垂直顺序关系,并使用组件标签映射中存储的组件标识符标注矩阵的横轴和纵轴。
  6. 对查询图像和检索图像的融合组件矩阵进行 L2 归一化,计算每个查询组件与每个检索图像组件之间的余弦相似度,并将得到的 K × K 组件对应矩阵保存至 evaluation_results/structural_retrieval_evidence。
  7. 对于每个选定用于局部差异分析的参考-目标图像对,加载两幅图像的类型化邻接矩阵、组件中心矩阵、空间离散度矩阵、关系权重矩阵以及融合组件矩阵。
  8. 计算两个类型化邻接矩阵之间的绝对差值,并基于固定组件顺序,计算组件中心位移、空间离散度和关系权重的绝对差异,将得到的拓扑差异矩阵和几何关系差异矩阵保存至 evaluation_results/structural_difference_evidence。
  9. 计算两个融合组件矩阵对应行之间的 L2 距离,对组件级距离进行归一化并将其分配至目标组件图的节点上,根据关系权重的归一化差异增加边的宽度,并保存生成的融合后组件差异图。
  10. 在 structural_visualization_manifest.csv 中记录图像标识符、矩阵路径、图路径、组件顺序、检查点标识符以及可视化输出路径;所有结构可视化均需通过程序从记录的文件生成,禁止手动添加图节点、图边或矩阵值。
  11. 对最终特征向量应用五类 K-Means 聚类,并将聚类分配结果保存至 evaluation_results/cluster_assignments.csv。运行 python evaluate.py --config configs/protocol.yaml --feature_dir feature_outputs/test。
  12. 计算每次运行的结构紧凑性指数(SCI)、结构分离性指数(SDI)、召回率@5(Recall@5)、平均精度均值(mAP)以及轮廓系数。使用 SCI 评估具有相同结构标签的归一化特征的紧凑性,使用 SDI 评估不同结构标签之间的分离性;使用 Recall@5 评估相关结构匹配是否出现在短检索列表中,使用 mAP 评估在整个库图像中的排序质量;轮廓系数仅用于聚类分析。
  13. 在五次独立运行结果上计算算术平均值和样本标准差,保留每种方法和每个指标的五次运行级数值。不得基于被比较的方法进行最小-最大归一化、秩归一化或重新缩放。使用相同随机种子下获得的结果进行配对 t 检验,并记录检验统计量和精确的双侧显著性值。
  14. 核对已处理的测试标识符数量、特征文件数量、检索记录数量和聚类分配数量,发现任何不一致均需在报告或解释评估结果前予以解决。
  15. 预期输出:确认每张测试图像均具有一条完整的推理记录、一个检索列表、一条聚类分配结果以及一组评估输入;确认每个选定用于可视化的检索案例均包含查询组件图、检索图像组件图、类型化邻接矩阵以及融合组件对应矩阵。
  16. 确认每个结构差异案例均包含拓扑差异矩阵、几何关系差异矩阵、融合后组件差异图、空间差异热图和响应叠加图;确认所有可视化文件均通过 structural_visualization_manifest.csv 与其源矩阵关联;为每个可视化案例保存纯热图、目标图像叠加图、前景掩码以及最高响应区域坐标。
  17. 仅当主导的高响应区域与服装前景重叠,并且得到相应的类型化邻接变化、几何关系变化以及融合后组件距离证据支持时,才接受计算出的差异响应。如果最强响应主要位于服装前景之外,则检查解析输出、组件图和融合记录。
    注意:使用从验证集选定的检查点对测试集进行推理,不得根据测试集指标选择或替换检查点。在推理和可视化过程中生成图和矩阵时,必须使用相同的组件顺序、非活动节点规则、关系类型编码和归一化流程。
    ​故障排除:若推理在处理完所有测试图像前中断,请在推理日志中定位最后一个标识符,并从下一个标识符继续执行。若检索结果主要由颜色相似性主导,请检查结构先验和融合输出,并验证检查点加载是否成功。若评估报告中出现重复标识符,请重建 test_feature_manifest.csv 并在重新计算前移除重复记录。若 K-Means 产生空聚类,请验证特征归一化并使用记录的随机种子重新运行聚类。

9. 比较模型评估

  1. 运行 python compare_models.py --config configs/protocol.yaml。
  2. 使用相同的训练、验证和测试清单,训练并评估 ResNet-50、基于部件的卷积基线(PCB)、GCN、FashionGraph、Swin Transformer、CLIP、融合颜色与纹理的拓扑特征直方图、注意力引导级联网络、MMFL-Net、FARE-RNET 以及所提出的方法。
  3. 对所有方法使用相同的图像尺寸、预处理操作、训练轮数、有效批量大小、评估查询和指标实现方式。
  4. 对 ResNet-50 保留全局平均池化。在 PCB 中应用水平条带对齐。在 GCN 中应用固定的图像级服装图结构。在 FashionGraph 中应用属性引导的动态图推理。使用 Swin Transformer 和 CLIP 的标准图像编码器。通过拓扑、颜色和纹理描述符实现融合颜色与纹理的拓扑特征直方图。通过包含全局和局部特征分支以及服装解析的结构实现注意力引导级联网络。通过多尺度与多粒度特征分支实现 MMFL-Net。通过残差注意力、特征选择和扩张上下文编码实现 FARE-RNET。
  5. 仅使用每种对比方法的图像查询分支。在通用训练清单上重新训练所有可训练的方法,并从通用验证清单中选择其检查点。为每个测试查询生成排序后的候选库列表。
  6. 当所学习的嵌入原始维度不为 512 时,通过一个已注册的可训练线性层将其投影至 512 维。在基于余弦相似度的排序前进行 L2 归一化。对所有方法使用相同的查询-候选库分配方式和指标实现方式。
  7. 使用相同的五个随机种子重复每种对比方法的实验。报告 SCI、SDI、Recall@5、mAP 和轮廓系数的均值及样本标准差。针对每个指标,基于相同随机种子下的结果,在所提出方法与每种对比方法之间进行双侧配对 t 检验。将五次运行的数值、检验统计量、自由度和精确 p-值记录在 evaluation_results/comparison_metrics.csv 中。
  8. 计算每种方法的 SCI、SDI、Recall@5、mAP 和轮廓系数。将所有运行级别和聚合后的数值保存至 evaluation_results/comparison_metrics.csv。
  9. 预期输出:确认 comparison_metrics.csv 包含每种对比方法相同的指标字段和相同数量的独立运行结果。
    注意:不得更改数据划分、指标代码或不同对比方法之间的查询-候选库分配方式。
    故障排除:若某对比模型输出的特征维度不为 512,需在指标计算前添加一个已注册的单一线性投影层,并与对应模型一同训练该层。若某模型在通用学习率下无法收敛,请采用其已发表实现中指定的学习率,同时保持其余所有实验条件不变。将每种方法特定的设置记录在对比日志中。

结果

所有报道的实验均使用表2材料表中记录的硬件和软件环境进行。在整个预处理、训练、推理和评估过程中,均使用相同版本的图形驱动程序、CUDA、cuDNN、Python、NumPy、PyTorch 和 torchvision。完整的硬件和软件环境汇总于表2材料表中。表1汇总了处理后的训练集、验证集和测试集,以及图像级别的拓扑统计信息。表2汇总了所有对比方法所采用的通用配置。

比较评估结果

比较评估遵循了第7–9节协议中规定的通用数据划分、预处理操作、训练控制和指标定义。表3比较了通用视觉编码器、部件对齐模型、基于图的服装表示方法、跨域时尚检索网络、拓扑与外观融合方法以及电子商务视觉检索方法,所有方法均采用相同的图像查询协议进行评估。领域特定方法包括融合颜色与纹理的拓扑特征直方图(TFH-CT)、注意力引导级联网络(AGC-Net)、多尺度多粒度特征学习网络(MMFL-Net)以及基于残差网络与鹭群优化的时尚检索方法(FARE-RNET)。表3中的所有评估指标均基于五次独立运行的结果报告,采用相同的随机种子、训练清单、验证清单、测试清单、查询-图库分配方式及指标实现方式,取均值和样本标准差。在匹配随机种子条件下,分别针对SCI、SDI、Recall@5、mAP和轮廓系数,将每种方法与所提出方法进行比较,单独计算配对p-值。这些结果为后续的结构可视化、检索、聚类以及面向设计的分析提供了定量依据。

代表性实验方案结果与解读

当从保存的解析结果和图文件重建的图像级组件图将每个活跃节点准确置于其对应的服装区域内,并保持类型化邻接矩阵中记录的关系类型时,表明协议成功执行,如图5C所示。结构感知响应应始终集中在服装前景区域,如图5D所示。图6E展示了一种预期的检索结果,其中所提出的方法降低了红色背景的干扰影响,准确检索出上身服装而非其他无关的红色物体。图6BG还表明,检索排序由图像级组件关系及融合后的组件对应关系共同支持。该结果反映了粗粒度服装类别的有效恢复,尽管检索样本在袖长和局部拓扑结构上仍存在一定差异。

常见的失败情况包括由纹理主导的激活现象 图 5B由上排背景颜色驱动的检索 图6,以及残余背景激活在 图7. 图7 应解释为部分定位,因为主要响应遵循扩大的下半身轮廓和右侧服装边界,而相邻背景区域仍保留残余激活。只有当拓扑差异矩阵、几何关系差异矩阵、融合后成分差异图和空间响应均识别出一致的服装区域时,定位才被视为具有结构支持。若空间热点在矩阵或成分中无相应变化,则表明为视觉干扰而非结构证据。

当每张被接受的图像均生成归一化的语义概率图、一个包含 K 行和 K 列的关系矩阵、外观和结构特征矩阵(均为 K 行 512 列),以及一个与正确图像标识符关联的有限融合特征向量时,认为该协议运行有效。目视检查应确认拓扑结构符合服装部件的分布,前景响应强于背景响应,且检索结果由服装类别和结构主导,而非由背景颜色决定。若出现断裂的概率图、缺失的部件节点、非数值型矩阵、弥散的背景响应或以颜色为主导的检索结果,则表明执行失败,需检查解析、图构建、特征融合或检查点加载过程。

服装部件图像级响应的可视化分析

图5 比较了ResNet-50基线模型与组件感知模型在相同服装图像上的表现。图5B 显示了外观基线的类别激活图。图5C 展示了从前景受限概率图、组件中心矩阵、类型化邻接矩阵、非活跃节点掩码以及在协议第3和第4节中生成的组件标签映射重建得到的图像级服装组件图。图5D 展示了融合表示的激活响应。生成 图5C 时未使用任何人姿态估计器或人体关节标注。

基线响应集中在下装的局部纹理区域,并未持续沿整个服装边界延伸,如图5B所示。图5C中,每个节点对应一个激活的服装组件区域的中心,每条边表示共享的前景边界或预定义的垂直顺序关系。该图反映了服装区域的组织结构,并不代表人体解剖学上的关节。结构感知响应覆盖了主要的服装前景,同时在大多数背景区域保持较低的激活水平,如图5D所示。这些结果表明,组件图与特征融合模块降低了在评估图像中由纹理主导的激活响应。

服装结构相似性分析与设计参考结果

图6展示了检索排序结果以及用于解释该排序的结构证据。图6B中的查询组件图记录了活跃的服装区域及其类型化关系,而图6C中的矩阵则揭示了提供给图传播的关系模式。图6D中的基线结果仍主要由红色外观线索主导。图6E中基于结构感知的结果在不同颜色和背景条件下仍保持上身服装类别的准确性。图6F中排名最高结果的组件图可与查询图进行直接比较,而图6G中的对应矩阵则揭示了具有相同标识符的组件在结构引导融合后是否仍保持对齐。对角线上的对应关系应结合缺失节点和变化的图关系进行综合解读。缺乏图结构一致性的高外观相似性不能视为成功的结构化检索。

检索得到的服装保留了粗粒度类别,但袖子结构和局部组件关系的差异表明细粒度对应关系尚不完整。如表3所报告,所提出方法的 Recall@5 达到 89.2%,mAP 达到 86.4%。这些定量数值描述了排序性能,而图6B–G 提供了支持该解释的中间结构证据。因此,检索结论仅限于在测试查询条件下,对背景颜色干扰的抵抗能力有所提升,以及图像层级组件组织能力更强。

结构差异响应与设计分析支持

纯差异响应热图(图7H)显示,主要响应集中在目标图像放大后的下半身轮廓以及右侧服装边界处。图7I 的叠加结果显示,最强响应仍与主服装前景保持对齐,而在相邻窗帘和墙壁区域的较弱激活则作为残余背景干扰保留。空间响应应结合 图7C–G 中所示的组分图和矩阵证据共同解读。只有当高响应的服装区域与邻接变化、几何关系变化以及融合后组分距离模式一致时,该响应才被视为有效的结构差异。

只有当图7E中的类型化邻接关系变化或图7F中的几何关系变化,同时伴随着图7G中组件距离的增加以及图7H、I中前景对齐的空间响应时,才接受该结构差异。扩大的下半身区域和右侧服装边界满足这一跨阶段标准。窗帘和墙壁上的激活信号与组件节点、关系模式或融合组件距离的变化无关,因此被视为非结构性的残余干扰而被排除。该结果支持图像层面的差异定位,但尚不足以确立缝纫模式或结构参数的变化。

特征空间分布与结构聚类分析

分析潜在特征空间的分布可以揭示模型对服装结构语义的区分能力。该分析旨在检验结构先验是否将具有不同拓扑结构的服装组织到不同的特征流形中。从测试集中选取了五类具有代表性的结构类别:短袖上衣、裤子、裙子、长款外套和连衣裙。通过t分布随机邻域嵌入(t-SNE)方法,将高维特征向量投影到二维平面上。通过评估相似样本的聚集性与不相似样本的分离性,来刻画特征空间中结构语义的组织方式。图8展示了具有结构感知能力的特征空间的t-SNE分布结果。

t-SNE 投影形成了五个主要特征区域,相邻类别之间的重叠有限,如图 8A所示。对应于这五个类别区域的代表性样本如图 8B所示。结构紧凑性指数(SCI)为 0.81,反映了具有相同结构标签的样本在特征空间中的紧凑程度;结构分离性指数(SDI)为 0.71,反映了具有不同结构标签的样本之间的分离程度,如表 3所报告,并在图 8中可视化。这些指数应被理解为特征空间分布的度量,不能直接确定误报率。短袖上衣和裙子在投影的特征空间中占据了不同的主要区域,而少量样本仍位于相邻类别的边界附近,如图 8A所示。裤子和连衣裙也与相邻类别表现出明显的分离。该分布表明,图结构先验促进了类别级别的结构化组织,但并未实现完全的聚类分离。本评估将表征质量与检索有效性区分开来。SCI 用于评估具有相同结构标签的服装在学习到的特征空间中是否保持紧凑,而 SDI 用于评估具有不同结构标签的服装是否保持分离。这些指标对应于协议中的结构表征目标。Recall@5 衡量在前五个检索结果中是否出现结构相关的服装,而 mAP 衡量在所有相关图库样本中的排序质量。这些指标对应于设计-参考检索目标。由于 SCI 和 SDI 已经刻画了特征空间的组织特性,因此仅使用轮廓系数来评估聚类性能。

图9展示了四种代表性方法在未进行跨方法归一化情况下的原始五次运行结果。图9A以原始量表呈现SCI和SDI,而图9B以百分比形式呈现Recall@5和mAP。单次运行的标记点及标准差误差线反映了模型训练过程中的波动性,而不仅仅是聚合排序结果。基于外观的基线方法达到了0.62的SCI,而所提出的方法达到了0.81的SCI和0.71的SDI(表3图9A)。SCI和SDI结果表明,在所评估的设置下,类别内紧凑性和类别间分离性更强。所提出的方法实现了89.2%的Recall@5和86.4%的mAP(表3图9B。这些检索指标评估了不同的排序特性,需独立于SCI和SDI进行解释。四种指标下方法排序的一致性表明表征质量与检索性能之间具有一致性,但这并不意味着在四个评估维度上的相对提升程度完全相同。

消融实验与结构模块有效性分析

消融实验将完整模型与去除结构先验或融合模块的变体模型进行比较。这三种配置均使用相同的参考图像和目标图像,从而能够直接比较背景响应和定位集中度。去除结构先验的变体移除了图像层级的服装部件图及其关系约束,仅依赖卷积主干网络提取外观特征;非融合变体保留图推理机制,但移除了特征金字塔,仅使用高层语义特征。可视化差异热图揭示了各模块在噪声抑制和边界定义中的具体作用;不同模块配置下结构差异响应的定性比较如图10所示。

反应图谱在 图10C–E 使用了共享响应量表和相同的叠加设置进行呈现。未包含结构先验的版本在左侧背景区域及与环境无关的区域周围产生了强烈的激活,如图所示 图10C. 缺少融合模块的变异体减弱了部分非衣物区域的响应,但仍保留了在下部衣物及右侧周围区域更广泛的扩散,如图所示 图10D完整的模型进一步将主导响应收缩至主要服装前景,如图所示 图10E. 图10F 直接可视化非融合变体与完整模型之间在前景限制响应上的差异,表明完整模型在保留主要与服装对齐的响应的同时,抑制了残余的侧向扩散。这些结果表明,结构先验主要降低了环境噪声,而融合模块进一步提升了响应的集中性与结构对齐程度。 图10E 表示相对改善,而非完全消除背景激活。

表4 报告了无结构先验、无融合模块以及完整模型各变体的 SCI、SDI 和 Recall@5 指标。移除结构先验使 SCI 从 0.81 降至 0.65,Recall@5 从 89.2% 降至 74.5%。移除融合模块使 SDI 从 0.71 降至 0.64,Recall@5 从 89.2% 降至 85.1%,下降了 4.1 个百分点。这些结果表明,结构先验对结构一致性与检索性能影响更大,而特征融合则改善了外观信息与结构信息之间的对齐。

效率分析比较了完整模型与ResNet-50基线模型的计算成本。ResNet-50基线模型需要2560万个参数和41亿次浮点运算。完整的结构感知模型需要2930万个参数和54亿次浮点运算。基线模型的平均推理时间为每幅图像15毫秒,完整模型为每幅图像22毫秒,增加了7毫秒。该结果表明,计算成本有所增加,在将该协议部署于时间敏感的工作流程时应予以考虑表5)在最终测试评估之前,根据验证集的划分结果确定了结构约束权重。在结构约束权重为 0.1、0.3、0.5、0.8、1.0、1.2、1.5 和 2.0 的条件下,考察了验证集上的 Recall@5 指标。后续所有训练与测试均固定采用 1.0 的权重值。 图11 记录了基于验证的结构约束权重1.0的选择。

figure-results-1
图 1 结构感知服装图像特征学习协议的整体工作流程。 输入的服装图像由外观特征分支和结构特征分支进行处理,其中结构特征分支采用语义解析和空间图建模。这两个表示结果通过结构引导融合模块处理,以生成最终的结构感知特征。结构一致性损失、结构判别损失和结构关系损失共同约束特征空间。该图展示了在特征学习过程中如何整合服装外观与组件拓扑结构。请点击此处查看此图的放大版本。

figure-results-2
图 2:构建图像级服装部件拓扑结构先验。 (A) 输入的服装图像 I(B) 前景受限的视觉部件图 P,其中七种颜色表示图像级服装区域;所有背景像素均被排除在部件通道之外。 (C) 图像级部件关系图 G;节点表示可见的服装区域,实线边表示共享的前景边界,虚线关系表示预定义的垂直顺序。该图与映射支持图像检索和视觉结构比较,但不表示裁剪样板片、缝合几何结构、省道结构、放码参数或裁剪说明。 请点击此处查看此图的放大版本。

figure-results-3
图3:基于结构引导的特征融合模块。 结构特征通过线性映射和激活函数 Ψ 进行变换,以生成结构权重。该结构权重通过逐元素相乘的方式对表观特征进行调制。调制后的表观特征与结构特征进行拼接,并通过矩阵 Wc 投影,随后加入残差形式的结构特征,以生成最终的组分特征。该图表明,在最终融合之前,结构信息对表观特征的加权起到了调控作用。请点击此处查看此图的放大版本。

figure-results-4
图 4:在结构一致性约束下的特征空间优化。 (A) 属于相同结构类别的样本通过结构一致性损失被拉近,同时其内部组分关系由结构关系损失保持不变。(B) 来自不同结构类别的样本通过结构判别损失被推远。该图展示了这三个结构目标如何共同增强类内紧凑性和类间分离性。请点击此处查看此图的放大版本。

figure-results-5
图5:服装特征响应的代表性结果及组件图可视化。 (A) 输入的服装图像。(B) ResNet-50 外观基线模型的类别激活响应。(C) 图像级服装组件图由前景受限的组件图、组件中心矩阵、带类型的邻接矩阵、非活跃节点掩码以及组件标签映射重建而成,这些数据在方案第3和第4节中已保存。节点表示活跃的服装区域,实线边表示共享的前景边界,虚线边表示预定义的垂直顺序关系。(D) 融合后的组件感知表征的激活响应。对比展示了以纹理为主导的激活与以服装区域为引导的激活之间的差异。请点击此处查看此图的放大版本。

figure-results-6
图6:在红色背景干扰下的检索结果及中间结构证据。 (A) 查询图像。 (B) 查询组件图由保存的组件中心和带类型的邻接矩阵生成。 (C) 查询的带类型邻接矩阵,其中矩阵值用于区分非活动关系、共享的前景边界以及预定义的垂直顺序关系。 (D) 外观基线方法生成的前三项检索结果。 (E) 基于结构感知表示生成的前三项检索结果。 (F) 排名最高的结构感知结果的组件图。 (G) 查询图像与排名最高的结果之间的后融合组件对应矩阵。较高的对角线对应值表示具有相同标识符的组件之间的一致性,而较弱或偏移的响应则表明组件组织存在缺失或不匹配。检索结果保留了粗略的上身类别,但在袖型配置和局部拓扑结构上未实现完全一致。请点击此处查看此图的放大版本。

figure-results-7
图7:从图像级服装拓扑到空间响应的结构差异追踪。 (A) 参考图像。 (B) 目标图像。 (C) 参考组件图。 (D) 目标组件图。两个图均根据保存的组件中心和类型化邻接矩阵重建。 (E) 类型化邻接差异矩阵。 (F) 几何关系差异由组件中心位移、空间离散度以及关系权重变化推导得出。 (G) 融合后组件差异图,其中节点强度表示对应融合组件向量之间的归一化距离,边宽度表示关系权重的变化。 (H) 纯空间差异响应热图,使用与叠加图相同的固定响应尺度渲染。 (I) 响应叠加在目标图像上的结果。仅当邻接变化、几何关系变化、组件距离变化以及前景对齐的热响应保持一致时,才认定存在结构差异。缺乏组件或关系对应证据的背景激活被视为残余干扰,而非有效的服装结构差异。 请点击此处查看该图的放大版本。

figure-results-8
图 8:基于结构感知的特征空间聚类。 (A) 短袖上衣、裤子、裙子、长外套和连衣裙的 t-SNE 投影。这五类服装形成了主要的特征区域,在类别边界附近仅有有限的重叠。(B) 被分配到这五种服装类别的代表性测试图像,其边框颜色与 (A) 中类别的颜色相对应。该图展示了类别级别的结构化组织,同时在相邻类别区域附近保留了少量样本。请点击此处查看此图的高清版本。

figure-results-9
图9:不同特征空间结构与检索排序目标下的原始性能比较。 (A) 外观驱动基线方法、弱结构模型、显式结构模型以及所提出方法的SCI和SDI结果。(B) 上述四种方法的Recall@5和mAP结果。大标记表示五次独立运行的算术平均值,误差线表示样本标准差,小标记表示单次运行的结果。SCI和SDI在0到1的固定尺度上显示,而Recall@5和mAP在0%到100%的固定百分比尺度上显示。未进行最小-最大归一化或跨方法重缩放处理。请点击此处查看该图的放大版本。

figure-results-10
图 10:不同模块配置下的结构差异响应。 (A) 参考图像。 (B) 目标图像。 (C) 无结构先验变体的响应。 (D) 无融合模块变体的响应。 (E) 完整模型的响应。 (C–E) 使用相同的归一化响应尺度、颜色映射和叠加设置进行渲染。 (F) 非融合变体与完整模型之间的前景限制绝对响应差异。完整模型在保留主要与服装对齐的响应的同时,减少了主结构区域外的残余扩散。该比较表明,结构先验减少了服装外干扰,而融合模块进一步增强了结构响应的锐度。 请点击此处查看该图的放大版本。

figure-results-11
图11:基于验证集的结构约束权重选择。在结构约束权重分别为0.1、0.3、0.5、0.8、1.0、1.2、1.5和2.0的条件下报告了验证集上的Recall@5结果。每个数据点表示五次验证运行的算术平均值,每条误差线表示样本标准差。在最终测试评估之前,权重固定为1.0。该图记录了参数选择过程,并不构成独立的模型结构贡献。请点击此处查看此图的高清版本。

表1:S1至S5服装子集的数据集分配及图像层级拓扑统计信息。 该表列出了各结构层级的训练、验证、测试及总图像数量,以及平均语义组件数、活动节点数、带类型边数和标注图像平面关键点数。所有数值均来源于处理后的数据清单。训练、验证和测试图像数量来自经过结构审查、重复组控制和数据泄露检查后的最终子集清单;拓扑统计数据则基于最终图记录计算得出,所用组件顺序和关系定义与模型评估期间一致。请点击此处下载该文件。

表2:本实验方案中使用的计算环境、输入配置、数据增强、表示方法、优化算法、损失函数及可重复性设置。 该表格列出了确切的操作系统、处理器、安装内存、图形处理器、显存、显卡驱动程序、CUDA、cuDNN、Python、NumPy、PyTorch 和 torchvision 的版本,以及图像尺寸、批量构建方式、优化器、学习率调度、训练轮数、随机种子、表示维度和结构目标权重。每个数值均链接至 software_versions.txt、configs/protocol.yaml 或相应的训练记录。请点击此处下载该文件。

表3:通用视觉表示模型、基于图的服装模型和领域特定时尚检索方法的定量比较。 该表格报告了在相同数据划分和评估协议下,十一种方法的检索重点、查询模态、SCI、SDI、Recall@5、mAP 和轮廓系数。所有指标均报告五次独立运行的均值和样本标准差。所报告的p值是通过双侧配对t检验,使用相同五个随机种子生成的结果,将每种对比方法与所提出方法进行比较而获得的。所提出的方法作为参考行。请点击此处下载该文件。

表4:结构先验与特征融合模块的消融实验结果。该表格报告了无结构先验变体、无融合模块变体以及完整模型在SCI、SDI和Recall@5指标上的表现。移除结构先验导致SCI和Recall@5下降更明显,而移除融合模块则降低了SDI和响应对齐能力。完整模型在三项指标上均取得最高值。请点击此处下载该文件。

表5:ResNet-50 基线模型与完整结构感知模型的计算效率。 本表列出了在表2及材料表中记录的完全相同的硬件和软件环境下,每个图像的可训练参数数量、浮点运算次数以及平均推理时间。两个模型采用相同的图像分辨率、推理批次设置、预处理操作和计时程序。与基线模型相比,完整模型每个图像增加了370万个参数、13亿次浮点运算以及7毫秒的推理时间。请点击此处下载该文件。

讨论

最关键的实验步骤是保持服装结构的预处理和前景受限的语义组件解析。组件中心、空间离散值、共享边界关系、垂直顺序关系、关系权重以及融合表征均源自解析结果。边界渗漏、组件区域合并、组件区域缺失以及通道分配错误会在图构建和特征融合过程中传播。这些错误可能生成尺寸上有效的图文件,但其所表示的组件关系仍与原始服装不一致。因此,在接受结构先验之前,必须验证概率图、前景限制、组件预览以及解析质量记录。

图构建与特征融合需要语义组件的固定顺序。该图由前景服装组件及其在图像平面中的关系推导而来。检索与差异定位图示揭示了结构化处理路径,而不仅仅是展示最终排序的图像或响应热图。类型化邻接矩阵用于记录离散组件关系,几何关系矩阵用于记录归一化的空间结构,融合后的组件矩阵则记录用于检索与定位的表示形式。仅当这些中间表示与最终视觉输出一致时,方可接受相应的结构化结论。该组件图不使用解剖学标志点、人体关节坐标或姿态估计网络。仅当图叠加的节点及其关系类型是从保存的组件与邻接文件中复现时,才应接受该叠加结果。非活跃组件应保持为零向量,并带有非活跃节点标识符;外观特征矩阵与结构特征矩阵在融合前均必须各自包含 K 行和 512 列。这些检查可防止将节点错位或维度错误误解释为模型行为。

故障排除应从最早的无效中间输出开始。概率图均匀分布表明存在检查点、归一化或类别索引错误;结构矩阵出现非数值结果表明概率分母无效或坐标缩放错误;响应弥散且颜色主导检索结果表明结构先验过弱、融合失败或检查点加载错误。训练日志应确认图结构和融合层中的梯度,以及基于验证集的检查点选择。视觉热响应不应作为独立的结构结论使用,必须结合保存的前景掩膜、输入的邻接变化、几何关系矩阵以及融合后的组分差异图进行验证。在服装前景区域外出现残余激活,表明响应特异性有限,而非经过验证的结构差异。

与外观驱动的检索方法相比,该方案在度量学习之前引入了组件拓扑结构。与弱结构约束和固定拓扑图模型相比,语义关系权重能够使图传播适应当前服装。完整模型在表3中报告的SCI达到0.81,SDI为0.71,Recall@5为89.2%,mAP为86.4%,轮廓系数为0.74。如表4所示,新增的结构模块使参数量从2560万增加到2930万,每张图像的推理时间从15毫秒增加到22毫秒。该方案的技术贡献在于构建了图像级服装组件图、外观与组件关系的并行编码、结构引导的特征融合机制,以及结构一致性、关系性和判别性目标函数。在图11中报告的验证扫描仅用于确定固定的训练系数,并不作为对网络架构或目标函数设计的贡献。

该方案对严重遮挡、衣物重叠、源图像尺寸过小、姿态变化、复杂背景以及不符合固定七区域模式的服装结构仍较为敏感。不对称设计、可拆卸层、密集褶皱、多层下装以及重叠的装饰区域可能导致多个语义区域合并,或引入当前图结构定义中不存在的组件关系。遮挡可能抑制活动组件、使其概率质心偏移,并消除有效的共享边界关系。图6展示了粗略上身类别的恢复结果,但袖子拓扑匹配不完整;而图7和图10在相邻背景区域仍保留响应。这些结果表明,有效的张量维度和图连通性并不能保证语义上正确的结构解释。因此,本研究支持基于图像的检索、聚类及差异定位,而非设计流程效率或版型参数的直接估计。本研究中所有定量实验均在保留并重新进行结构标注的DeepFashion2数据集上进行。当前结果尚未验证在具有不同服装分类体系、标注标准、文化服饰类别、图像来源或采集环境的独立数据集上的鲁棒性。迁移到其他数据集可能需要重新映射七个组件通道并重构带类型的关系模式。因此,所报告的结论仅限于所评估的数据分布及图像层级的组件定义。

在上述限制范围内,本方案通过语义解析、几何关系建模、双流编码及结构引导融合,实现了从服装图像到部件感知表示的可重复流程。未来的验证将采用具有不同标注体系、服装类别、姿态和背景条件的独立服装数据集。同时将评估当前的七区域映射是否需要扩展,以适应不对称、多层、可拆卸及具有文化特性的服装结构。手绘设计草图、跨面料变化以及参数化版型调整仍属于独立的应用方向,需依赖特定任务的数据与评估流程。专业可用性与设计评审效率的评估,需另行开展基于明确参与者、评估标准和统计方法的人因研究,并进行独立记录。

披露

作者声明无任何利益冲突。

致谢

本工作受“十四五”期间第二批省级本科教学改革重点项目资助,项目名称为基于“三融合、三结合”共建模式的“服装与服饰设计”教学改革探索(项目编号:JGZD2024096)。

材料

本文使用的材料清单
姓名公司目录编号评论
中央处理器Intel CorporationIntel Core i9-13900K,24 核,32 线程,最高 5.80 GHz
CondaAnaconda, Inc.,anaconda.comMiniconda3 23.11.0
CUDA 工具包NVIDIA Corporation,developer.nvidia.comCUDA 11.8
cuDNNNVIDIA Corporation,developer.nvidia.comcuDNN 8.9.7
DeepFashion2 数据集香港中文大学,github.com/switchablenorms/DeepFashion2官方 DeepFashion2 发布版本 1.0
图形处理器NVIDIA CorporationNVIDIA GeForce RTX 4090,24 GB GDDR6X
HRNet-W48 语义解析检查点HRNet 项目,github.com/HRNet/HRNet-Semantic-Segmentationhrnet_w48_garment_parser_7class.pth,项目检查点版本 1.0
ImageNet 预训练 ResNet-50 权重PyTorch 基金会,pytorch.orgResNet50_Weights.IMAGENET1K_V2
MatplotlibMatplotlib 开发团队,matplotlib.org版本 3.8.2
NumPyNumPy 开发者,numpy.org版本 1.26.4
NVIDIA 显卡驱动程序NVIDIA Corporation版本 546.33
OpenCV-PythonOpenCV 团队,opencv.org版本 4.8.1.78
操作系统Microsoft CorporationWindows 11 Pro 23H2,64 位,系统版本 22631.3155
PandasPandas 开发团队,pandas.pydata.org版本 2.1.4
PythonPython 软件基金会,python.org版本 3.10.13
PyTorchPyTorch 基金会,pytorch.org版本 2.1.2,支持 CUDA 11.8
PyYAMLPyYAML 项目,pyyaml.org版本 6.0.1
scikit-learnscikit-learn 开发者,scikit-learn.org版本 1.3.2
SciPySciPy 开发者,scipy.org版本 1.11.4
源代码仓库随稿件提交的补充源代码归档服装拓扑协议,版本 1.0
存储设备Samsung ElectronicsSamsung 990 PRO NVMe SSD,2 TB
系统内存Kingston TechnologyKingston FURY Beast DDR5,64 GB,2 × 32 GB,5600 MHz
torchvisionPyTorch 基金会,pytorch.org版本 0.16.2,支持 CUDA 11.8
工作站自定义构建的深度学习工作站Intel Core i9-13900K,NVIDIA GeForce RTX 4090,64 GB 内存,2 TB NVMe SSD

参考文献

  1. Xiang Z, Zhu C, Qian M, Shen Y, Shao Y. FashionSegNet: a model for high-precision semantic segmentation of clothing images. Vis Comput. 2024;40:1711-1727. doi:10.1007/s00371-023-02881-3.
  2. Sun K, Zhang J, Zhang P, Yuan K, Li G. TsrNet: a two-stage unsupervised approach for clothing region-specific textures style transfer. J Vis Commun Image Represent. 2023;91:103778. doi:10.1016/j.jvcir.2023.103778.
  3. Yang N, Ma X. Enhanced composed fashion image retrieval with a multi-hop reasoning framework. Sci Rep. 2025;15:32217. doi:10.1038/s41598-025-17402-6.
  4. Karthika Priya D, Sathyabama B. FARE-RNET: fashion cloth retrieval via Egret Swarm Optimization-based Convolutional Attention Module integrated ResNet. Int J Comput Intell Syst. 2026;19:29. doi:10.1007/s44196-025-00979-1.
  5. Köktürk Güzel BE. Efficient image retrieval in fashion: leveraging clustering and principal component analysis for search space reduction. Erzincan Univ J Sci Technol. 2024;17:638-649. doi:10.18185/erzifbed.1500279.
  6. Zhang X, Sun H, Ma J. Research on clothing image retrieval combining topology features with color texture features. Mathematics. 2024;12:2363. doi:10.3390/math12152363.
  7. Abbas W, Zhang Z, Asim M, Chen J, Ahmad S. AI-driven precision clothing classification: revolutionizing online fashion retailing with hybrid two-objective learning. Information. 2024;15:196. doi:10.3390/info15040196.
  8. Shirkhani S, Mokayed H, Saini R, Hum YC. Study of AI-driven fashion recommender systems. SN Comput Sci. 2023;4:514. doi:10.1007/s42979-023-01932-9.
  9. Balloni E, Pietrini R, Frontoni E, Mancini A, Paolanti M. OutfitAI: shop the outfit with a deep learning-based intelligent expert system. Multimed Tools Appl. 2025;84:40195-40214. doi:10.1007/s11042-025-20753-x.
  10. Kachbal I, El Abdellaoui S. Computer vision for fashion: a systematic review of design generation, simulation, and personalized recommendations. Information. 2026;17:11. doi:10.3390/info17010011.
  11. Saranya MS, Geetha P. Cross-domain fashion cloth retrieval via novel attention-guided cascade neural network and clothing parsing. Comput Vis Image Underst. 2023;235:103777. doi:10.1016/j.cviu.2023.103777.
  12. Ning T, Gao Y, Han Y. Segmentation of ethnic clothing patterns with fusion of multiple attention mechanisms. Complex Intell Syst. 2024;10:5759-5770. doi:10.1007/s40747-024-01457-5.
  13. Jiang A, Liu L, Fu X, Liu L, Peng W. Clothing hierarchical feature representation and association learning for cross-modal fashion retrieval. J Comput Aided Des Comput Graph. 2025;37:654-667. doi:10.3724/SP.J.1089.2023-00263.
  14. An H, Lee KY, Choi Y, Park M. Conceptual framework of hybrid style in fashion image datasets for machine learning. Fash Text. 2023;10:18. doi:10.1186/s40691-023-00338-8.
  15. Adel M, Mohammed AM, Elsaid AH, Abdelatey A. Deep learning for new fashion product demand prediction: integrating visual similarity and demand correction in cold-start scenarios. Int J Data Sci Anal. 2026;22:9. doi:10.1007/s41060-025-00888-8.
  16. Tang Y, Ye D, Tao F, Du G. Enhanced group relation learning via aligned attention masking for fashion product captioning. J King Saud Univ Comput Inf Sci. 2025;37:170. doi:10.1007/s44443-025-00195-z.
  17. Lyu X, Li X, Zhang Y, Lu W. Two-stage method for clothing feature detection. Big Data Cogn Comput. 2024;8:35. doi:10.3390/bdcc8040035.
  18. Tang G, Yu F, Li H, Shi Y, Liu L, Peng T, et al. ClothSeg: semantic segmentation network with feature projection for clothing parsing. J Vis Commun Image Represent. 2023;97:103980. doi:10.1016/j.jvcir.2023.103980.
  19. Cao S, Chai W, Hao S, Zhang Y, Chen H, Wang G. DiffFashion: reference-based fashion design with structure-aware transfer by diffusion models. IEEE Trans Multimedia. 2024;26:3962-3975. doi:10.1109/TMM.2023.3318297.
  20. Hou J, Lu Y, Yang Y, Liu Z. PDN: a priori dictionary network for fashion parsing. Appl Sci. 2024;14:3509. doi:10.3390/app14083509.
  21. Moratelli N, Barraco M, Morelli D, Cornia M, Baraldi L, Cucchiara R. Fashion-oriented image captioning with external knowledge retrieval and fully attentive gates. Sensors. 2023;23:1286. doi:10.3390/s23031286.
  22. Islam T, Miron A, Liu X, Li Y. Deep learning in virtual try-on: a comprehensive survey. IEEE Access. 2024;12:29475-29502. doi:10.1109/ACCESS.2024.3368612.
  23. Yan H, Zhang H, Liu L, Zhou D, Xu X, Zhang Z, et al. Toward intelligent design: an AI-based fashion designer using generative adversarial networks aided by sketch and rendering generators. IEEE Trans Multimedia. 2023;25:2323-2338. doi:10.1109/TMM.2022.3146010.
  24. Xie Z, Zhou Z, Wang Z, Ding H, Ma L. Multi-scale spatial feature-guided cloth landmark estimation. J Comput Aided Des Comput Graph. 2022;34:1763-1771. doi:10.3724/SP.J.1089.2022.19189.
  25. Jiang J, Wu D, Deng H, Long Y, Tang W, Li X, et al. HAIGEN: towards human-AI collaboration for facilitating creativity and style generation in fashion design. Proc ACM Interact Mob Wearable Ubiquitous Technol. 2024;8:107. doi:10.1145/3678518.
  26. Danner M, Brake E, Kosel G, Kyosev Y, Rose K, Rätsch M, et al. AI-assisted pattern generator for garment design. Commun Dev Assem Text Prod. 2024;5:195-206. doi:10.25367/cdatp.2024.5.p195-206.
  27. Bao C, Zhang X, Chen J, Miao Y. MMFL-net: multi-scale and multi-granularity feature learning for cross-domain fashion retrieval. Multimed Tools Appl. 2023;82:37905-37937. doi:10.1007/s11042-022-13648-8.
  28. Yang G. Clothing design style recommendation using optimized semantic-preserved generative adversarial network. J Electr Syst. 2024;20 Suppl 3:2396-2409. doi:10.52783/jes.3064.
  29. Wang Z, Tao X, Zeng X, Xing Y, Xu Z, Bruniaux P. Design of customized garments towards sustainable fashion using 3D digital simulation and machine learning-supported human-product interactions. Int J Comput Intell Syst. 2023;16:16. doi:10.1007/s44196-023-00189-7.
  30. Wu J, Huang Y, Gao M, Gao Z, Zhao J, Zhang H, et al. A two-stream hybrid convolution-transformer network architecture for clothing-change person re-identification. IEEE Trans Multimedia. 2024;26:5326-5339. doi:10.1109/TMM.2023.3331569.
  31. Khalid M, Keming M, Hussain T. Design and implementation of clothing fashion style recommendation system using deep learning. Rom J Inf Technol Autom Control. 2021;31:123-136. doi:10.33436/v31i4y202110.
  32. Wang Y, Liu L, Fu X, Liu L. MCCP: multi-modal fashion compatibility and conditional preference model for personalized clothing recommendation. Multimed Tools Appl. 2024;83:9621-9645. doi:10.1007/s11042-023-15659-5.
  33. Ma J, Sun H, Yang D, Zhang H. Personalized fashion recommendations for diverse body shapes and local preferences with contrastive multimodal cross-attention network. ACM Trans Intell Syst Technol. 2024;15:82. doi:10.1145/3637217.
  34. Yu Z, Zhao Y, Hong B, Jin Z, Huang J, Cai D, et al. Apparel-invariant feature learning for person re-identification. IEEE Trans Multimedia. 2022;24:4482-4492. doi:10.1109/TMM.2021.3119133.
  35. Peng D, Liu R, Lu J, Zhang S. Unsupervised multi-modal modeling of fashion styles with visual attributes. Appl Soft Comput. 2022;115:108214. doi:10.1016/j.asoc.2021.108214.
  36. Mathews A, Sejal N, Venugopal KR. Analysis of content based image retrieval using deep feature extraction and similarity matching. Int J Adv Comput Sci Appl. 2022;13:646-655. doi:10.14569/IJACSA.2022.0131277.
  37. Zhang C, Ji X, Cai L. Clothing recommendation with multimodal feature fusion: price sensitivity and personalization optimization. Appl Sci. 2025;15:4591. doi:10.3390/app15084591.
  38. Zhao M, Gao S, Ma J, Zhang Z. Joint clothes image detection and search via anchor-free framework. Neural Netw. 2022;155:84-94. doi:10.1016/j.neunet.2022.08.011.
  39. Fontanini T, Ferrari C. Would your clothes look good on me? Towards transferring clothing styles with adaptive instance normalization. Sensors. 2022;22:5002. doi:10.3390/s22135002.
  40. Kim S, Moon H, Oh J, Lee Y, Kwon H, Kim S. Automatic measurements of garment sizes using computer vision deep learning models and point cloud data. Appl Sci. 2022;12:5286. doi:10.3390/app12105286.
  41. Chang YH, Zhang YY. Deep learning for clothing style recognition using YOLOv5. Micromachines. 2022;13:1678. doi:10.3390/mi13101678.
  42. de Medeiros Dantas IJ, Curth M, Freire AG. Exploring databases for training models in machine learning in the fashion industry. DAT J. 2024;9:157-174. doi:10.29147/datjournal.v9i2.877.
  43. Zhu S, Zou X, Qian J, Wong WK. Learning structured relation embeddings for fine-grained fashion attribute recognition. IEEE Trans Multimedia. 2024;26:1652-1664. doi:10.1109/TMM.2023.3284593.

重印与许可

标签

DeepFashion2 HRNet W48 ResNet 50