研究文章

一种基于UNet、GAN和CNN的端到端深度学习框架用于自动化机织物图案识别

238 次观看

DOI:

10.3791/69632

2026年4月3日

本文内容

摘要

开发了一种端到端的深度学习框架,该框架结合了卷积神经网络(CNN)、生成对抗网络(GAN)以及基于UNet的去噪方法,用于自动识别机织物的织物图案。通过数据增强和合成图像生成提高了模型的鲁棒性。该方法达到了99.1%的准确率,为工业纺织品检测提供了一种可扩展的解决方案。

摘要

高品质纺织品的质量与生产在很大程度上依赖于对织物组织图案的准确识别,而传统上这一识别过程主要依靠人工目视检测。然而,这种方法具有主观性强、耗时长且易出错的缺点。尽管机器学习方法能够实现自动化,但它们通常依赖于手工设计的特征,这些特征对光照和成像条件的变化较为敏感,从而限制了其鲁棒性和可扩展性。即使是深度学习模型,也常因实际采集条件下存在的域偏移问题而面临泛化能力不足的挑战。为应对上述问题,本文提出一种结合卷积神经网络(CNN)与生成对抗网络(GAN)的新型深度学习框架,用于端到端的织物分类。该方法融合了几何与光度数据增强技术,并结合基于UNet的图像去噪处理;其中GAN组件用于生成高质量的合成图像,以增强训练数据的多样性并促进特征学习。在机织物数据集上的实验结果表明,该方法达到了当前最优的性能水平,平衡准确率达到99.1%,在准确性、泛化能力以及对视觉畸变的鲁棒性方面均优于基线模型。该框架为自动化纺织品检测提供了一种可扩展且可靠的解决方案,对提升工业织物制造中的效率并减少人工劳动具有重要意义。本研究将CNN、GAN以及U型卷积神经网络(UNet)模块整合到一个统一的基于优化的学习流程中,而非将去噪、数据生成与分类作为独立过程处理。这种联合训练机制在生成网络与判别网络之间建立了反馈回路,在方法论上超越了传统的微调策略。

引言

图案是织物生产中最重要的因素,它极大地影响着材料的设计、重新设计、质地分析以及美学外观。织物是一项历史悠久的人类发明,已从手工织造发展到现代机器生产的数字织物1。在进一步通过织造机械加工之前,必须识别出机织织物的图案。如今,依赖视觉感知并借助显微镜或放大镜等工具增强的传统方法仍是织物图案检测的主要手段。通常由具备必要培训和经验的专家进行这种人工评估。然而,这种方法存在诸多缺点,例如工作量过大、效率低下和耗时较长,同时还伴随身体和心理上的压力、迟钝感以及疲劳等心理问题,最终影响识别结果。因此,为了准确识别织物图案并生产出符合客户需求的高质量产品,有必要采用计算机化的检测方法2

织物图案识别近年来受到关注,并取得了巨大成功3。总体而言,识别织造图案的方法可分为两类:基于纹理的统计方法和基于模型的方法。基于纹理的统计方法使用预处理后的图像。一种基于光度微分分析的方法采用了自适应维纳滤波和直方图均衡化,以从多个方向获取织物结构的信息4。随后,他们利用自适应网格模型将图像划分为子图像,以提取灰度特征。尽管该研究仅限于简单的机织材料,但该模型在检索织造结构中的交织位置方面具有较高的可靠性。基于数据库/模型的认知技术则采用识别或分类算法,用于识别并匹配材料的织造图案。

访问受限。请登录或开始试用以查看此内容。

方案

本研究未涉及人类参与者或动物实验对象,因此无需伦理审批和知情同意。所提出的端到端机织物分类框架(图1)包含四个依次进行的阶段:图像获取、预处理与数据增强、模型训练以及评估。每个阶段的输出即为下一阶段的输入。

第一阶段:图像采集:通过数字相机在受控照明条件下,从数据集中获取机织织物图像。图像采集分辨率为300 dpi,采用50 mm固定焦距镜头。

第二阶段:预处理与数据增强:对图像进行缩放并准备用于训练。为了增强模型的泛化能力,使用深度学习框架进行了几何变换和光度变换的数据增强,包括水平和垂直翻转(p = 0.1)、仿射平移(±0.1)、缩放(0.8–1.2)以及旋转(±45°)。光度调整包括亮度、对比度和饱和度的变化(±40%)以及色调变化(±10%)。
在训练前应用了基于UNet的去噪方法。该UNet模型在深度学习软件库(Keras深度学习框架)中实现,并使用Adam优化器(学习率 = 0.001,批量大小 = 16)训练了30个周期。

阶段3:模型训练:采用生成对抗网络(GAN)生成机织织物的合成图像以增强特征。判别器包含五个卷积层,激活函数为LeakyReLU;生成器则包含四个卷积层和四个....

访问受限。请登录或开始试用以查看此内容。

结果

评估指标
准确率是分类任务中最广泛使用的评估统计量,定义为所有预测中正确预测所占的比例。公式 11 表明,在这些情况下,平衡准确率是合适的性能评估指标18。其中,“N”表示类别数量。在本研究中 N=3,TP、TN、FP 和 FN 分别表示真阳性、真阴性、假阳性和假阴性的数量。所达到的平衡准确率为 99.1%

平衡准确率公式;Σ(TP+TN)/N;统计分析;方程图示。 (11)

混淆矩阵(图8)、训练与验证损失曲线(图9)以及类.......

访问受限。请登录或开始试用以查看此内容。

讨论

尽管所提出的GAN-CNN框架表现出较强的泛化能力,但仍存在其他替代方法,例如基于Transformer的视觉架构、注意力增强型CNN或自监督表征学习方法,这些方法也可用于验证类似的假设。这些方法可能在特征可解释性或计算效率方面具有优势,未来应对其进行比较评估17,19

识别与分类准确率的提升可归因于三个关键因素。首先,当考虑物理属性的变化(如纱线粗细、直径、取向、材料颜色以及光照不均)时,模型仍能保持稳定。其次,基于UNet的去噪方法增强了训练效果,提升了模型的模式识别能力。第三,所提出的GAN-CNN框架不依赖于人工设计的特征,而是采用完全自动化的端到端架构进行特征提取与分类。未来的研究可将该框架扩展至非织造布和针织物的识别与分类,以及其他纺织结构的分析。

性能比较
本研究还采用VGG-16预训练的CNN架构评估了模型的性能。在准确率及其他评估指标上观察到显著.......

访问受限。请登录或开始试用以查看此内容。

致谢

作者衷心感谢中国广州大学艺术与设计学院为本研究的完成所提供的支持。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
佳能 EOS 90D 佳能公司,日本东京EOS 90D 3250万像素 CMOS 传感器用于织物图像采集的数码成像相机
英特尔 i7 处理器英特尔公司,美国加利福尼亚州圣塔克拉拉https://www.intel.com用于计算处理的多核中央处理器(CPU)
Keras 深度学习框架谷歌有限责任公司,美国加利福尼亚州山景城https://keras.io用于神经网络开发的深度学习软件库
LED 环形灯(5500 K)市售实验室照明系统不适用用于均匀图像采集的受控照明光源
NVIDIA GeForce GTX1060MQ GPUNVIDIA 公司,美国加利福尼亚州圣塔克拉拉https://www.nvidia.com用于加速深度学习计算的图形处理器(GPU)
OpenCV 库开源社区https://opencv.org用于图像处理的计算机视觉软件库
Python 编程语言Python 软件基金会,美国特拉华州威尔明顿https://www.python.org用于机器学习实现的高级编程语言
ResNet50 预训练模型微软研究院 / He 等人(2016)https://keras.io/api/applications/resnet/用于特征提取和分类的预训练卷积神经网络架构
scikit-learn 库开源社区https://scikit-learn.org用于数据分析和模型评估的机器学习软件库
TensorFlow 框架谷歌有限责任公司,美国加利福尼亚州山景城https://www.tensorflow.org用于神经网络训练与部署的深度学习框架
经纱(聚酯,83 dtex)本单位纺织实验室不适用用作机织物样品经向材料的合成纺织纱线
机织物样品(平纹、缎纹、斜纹)本单位纺织实验室聚酯纱线 110 dtex具有不同组织结构的代表性机织纺织样品

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

UNet

相关文章