研究文章

利用改进的单阶段回归模型实时评估切丝烟草排列有序性

45 次观看

DOI:

10.3791/71669

2026年5月29日

本文内容

摘要

提出了一种改进的单阶段回归模型,用于实时检测切丝排列的有序性。该方法结合了三种结构优化策略和一种定制的方向预测方法,在提高检测精度的同时减少了模型参数量和计算复杂度,从而能够在工业生产环境中高效评估切丝的排列情况。

摘要

烟丝有序度,即烟丝沿卷烟轴向排列的一致性,是生产质量优化中的关键因素。由于烟丝结构复杂且成像条件多变,对该特性的准确自动化评估仍具挑战性。本文提出一种改进的单阶段回归模型,以实现对烟丝排列有序度的可靠检测。该方法包含三项结构改进:一种多频率交互式下采样方法,用于保留特征信息;一种三重互补融合策略,以增强多尺度特征表征;以及一种动态检测头,以提升不同尺度下的定位能力。此外,还实现了一种定制的方向预测方法,用于量化烟丝排列有序度。该模型在工业图像数据集上进行了评估,达到89.9%的平均精度均值、90.6%的精确率和88.7%的召回率。与基线模型相比,所提出的方法将模型参数减少了30.8%(从260万减少至180万),计算复杂度降低了21.5%(从6.5G降至5.1G),同时提升了性能。总体而言,该方法能够高效、准确地评估烟丝排列有序度,适用于实时工业应用。

引言

烟丝有序度是指卷烟中烟丝轴向排列的整齐程度。了解影响这一特性的因素(如烟叶形态和气力输送参数)对于优化烟丝切割和卷接工艺至关重要。因此,研究这些影响因素已成为烟草企业降低成本、提高生产效率的关键策略。传统的烟丝有序度评估依赖人工方法,效率低下,且常常缺乏一致性和准确性。因此,行业迫切需要一种自动化、精确且能实时检测的系统,以优化生产流程。随着深度学习技术的快速发展,基于目标检测的烟丝有序度自动化评估已成为可能。然而,此类评估系统在生产线上的实际应用仍是一个尚未充分探索的研究领域。尽管如此,机器视觉技术已在其他领域的检测任务中成功应用1,为本研究提供了有价值的参考。在此背景下,基于卷积神经网络(CNN)的检测器已成为主流方法,通常分为两阶段方法(如 Faster R-CNN2)和单阶段框架(如 You Only Look Once(YOLO)系列3,4)。

近年来,基于深度学习的目标检测算法,尤其是 Faster R-CNN 框架,在多个领域展现出巨大潜力。然而,由于复杂的工作环境和特定任务需求,这些算法在工业和专业场景中的直接应用常常受到限制。因此,研究人员提出了大量针对具体问题的改进方法以应对这些挑战。例如,在医学图像分析领域,Su 等人5通过优化参数并改进网络结构,提高了肺结节检测中小而关键目标的检测精度。在工业缺陷检测中,Chen 等人6通过将经遗传算法优化的 Gabor 滤波器集成到 Faster R-CNN 的主干网络中,有效抑制了织物检测中的纹理干扰和复杂背景。为应对水下目标检测中数据稀缺和环境复杂的问题,Zeng 等人7提出了一种对抗性遮挡网络,该网络在训练过程中与检测器进行对抗,迫使模型学习更具鲁棒性的特征,从而缓解过拟合问题。此外,针对细粒度检索任务(如特定实例识别),Li 等人8通过特征层拼接和微调策略对 Faster R-CNN 进行增强,显著提升了其在低分辨率图像上的性能。Wang 等人9最近提出了一种多方隐私保护的 Faster R-CNN 框架,通过新颖的安全除法、指数和对数协议,实现了对加密图像和模型参数的安全计算。Sun 等人10验证了改进型 Faster R-CNN 在轮毂多种缺陷类型识别中的有效性,其平均精度均值(mAP)优于 R-CNN 和 YOLOv3。这些研究共同表明,Faster R-CNN 正持续演进,以适应更多样化的真实应用场景,并具备更强的适应性、鲁棒性和实用性。与此同时,YOLO 系列等单阶段检测器框架也取得了显著进展。

作为两阶段检测器的重要替代方案,YOLO 系列因其高效的架构和出色的实时检测性能,在工业界和学术界均获得了广泛认可。自 Redmon 等人于 2016 年提出第一代模型以来11,后续的迭代版本逐步解决了多种技术局限,促使研究人员针对特定应用领域开发出专门的改进模型。例如,在交通监控系统中,Jamtsho 等人12将 YOLOv2 与质心跟踪算法相结合,用于在视频流中准确识别未佩戴头盔的摩托车骑手的车牌,有效降低了误报率,同时保持了 98.52% 的高检测率。针对复杂的水下环境,Neelamegam 等人13开发了一种 YOLO-Transformer 混合模型,将 YOLO 的实时检测能力与基于 Transformer 的注意力机制相结合,以增强上下文理解能力。该模型通过融合关于浊度和光照水平等环境因素的实时物联网传感器数据,能够动态适应环境变化,在噪声大、能见度低的场景中实现了 97.5% 的检测精度,优于传统模型。类似地,Zhang 等人14提出了一种改进的 YOLO 模型,用于遥感应用。为解决特征表示不足和背景混淆的问题,他们引入了专门的模块以增强特征提取、实现多尺度融合和提升全局上下文感知能力,显著提高了小目标检测的准确性。这些研究共同表明,YOLO 系列正持续演进,在多样化的实际应用场景中展现出更强的适应性、鲁棒性和有效性。

尽管取得了这些进展,YOLO 系列的最新版本(如 YOLOv113)在本质上并未针对工业环境中切碎烟草特有的纹理和结构复杂性进行优化。其标准的下采样操作可能导致丢失对区分有序与无序切碎烟草至关重要的细粒度特征。此外,在成像条件变化的情况下,其固定尺度的检测头难以有效应对烟草特征的多尺度特性。

为应对这些挑战,本文提出一种基于 YOLOv11n 的改进型单阶段回归模型,并结合自定义的方向预测方法,以实现对切丝规整度的鲁棒性在线检测。本文的主要贡献包括以下三个方面。(1)提出一种多频率交互下采样(MFID)方法。标准的步幅卷积或池化操作会丢弃细粒度信息,而 MFID 利用 Haar 小波变换将特征显式地分解为低频和高频分量,从而保留更多原始信息,缓解下采样过程中的信息丢失。(2)设计一种三重互补融合(TCF)方法,通过融合浅层、中层和深层语义信息来提升特征质量。尽管特征融合通常采用简单的拼接或相加操作,TCF 引入了由中间层引导的加权融合机制,并包含反向权重分支,从而实现语义信息与细节信息之间的互补。(3)引入一种动态检测头(DynamicHead)以替代原始检测头。原始检测头依赖于固定尺度的卷积操作,而 DynamicHead 集成了尺度感知、空间感知和任务感知的注意力机制,能够动态调整特征的重要性,实现更灵活且有效的多尺度特征融合,从而提升模型对规整度相关特征的准确定位与分类能力。

访问受限。请登录或开始试用以查看此内容。

方案

本研究未涉及人类受试者、脊椎动物或受管制的组织,因此无需伦理审批或机构审查委员会批准。本研究使用的数据集来自龙岩烟草工业有限责任公司。图像采集自为期三个月内的五个独立生产批次。采样在一天中不同时间段(早晨、下午和夜间)随机进行,以捕捉生产条件的自然变化。该数据集包含的样本覆盖了烟草含水率12%–18%、切丝速度1.5、2.0和2.5 m/s,以及气力输送压力0.4、0.5和0.6 MPa的范围,从而确保涵盖典型的生产条件。

数据集采集与系统设置
硬件配置
图像采集系统经过配置,以满足检测加热不燃烧卷烟中切丝排列有序性的需求。系统主要由工业相机、工业镜头、视觉光源和工业控制单元组成。系统采用MV-CH120-10GC型工业相机,搭配MVL-KF0818M-12MP型工业镜头,用于采集截面烟支表面切丝区域的高清图像。相机安装位置距离烟支表面的工作距离为150 mm。条形LED光源与相机同轴安装,距离目标80 mm,入射角为45°。成像在哑光黑色 enclosure 内进行,以消除环境光干扰。该 enclosure 为喷涂哑光黑色涂料的铝制罩体,内部尺寸为400 mm(宽)× 350 mm(深)× 300 mm(高),内表面涂覆哑光黑色涂料(在550 nm波长下反射率< 5%),以最大限度减少内部反射,确保光照条件一致。为保证成像质量与稳定性,采用MV-LRDS-H-95-30-W光源构建稳定的照明环境,降低环境光变化对烟丝轮廓提取和取向识别的影响。采集的图像由PC1010-AX360型工业计算机接收、处理并存储,同时该计算机还执行后续的识别算法、结果计算及界面输出。由于工业相机与镜头组合在896 × 1600像素的视场范围内径向畸变极小(图像边缘畸变小于0.5%),因此未进行显式的相机标定或畸变校正。相机与光源刚性固定于支架上,以确保图像采集过程中位置稳定。光源强度在整个图像采集过程中保持恒定。视场范围设置为完全覆盖钢制支撑结构内暴露的切丝区域。

相机参数设置
在样品香烟放置并切片后,触发图像采集,获取图像并以 JPG 格式保存。为确保所采集图像的一致性,所有采集参数均手动设定。具体而言,图像分辨率为 896 × 1600。曝光时间初始设为 4000 µs,并可根据现场亮度在 3000 至 6000 µs 范围内进行微调。所有参数调节均在将样品置于上述哑光黑色封闭箱体内、完全受控的照明条件下完成。调节过程中无任何外部环境光干扰,因为成像系统在完全封闭的环境中运行,且室内灯光已关闭。增益初始设为 2 dB,并根据噪声水平在 0 至 6 dB 范围内进行控制。伽马值设为 0.8,白平衡则采用固定参数模式进行配置。 最终的图像采集参数设定如下:曝光时间 = 4000 µs,增益 = 2 dB,伽马 = 0.8,白平衡模式 = 固定,图像分辨率 = 896 × 1600 像素,图像格式 = JPG。白平衡采用固定参数模式。校准过程使用标准白色参考卡(X-Rite ColorChecker)放置于样品位置进行。调节红通道和蓝通道的增益,直至白色卡的 RGB 值在 ±2% 偏差范围内达到均衡。校准完成后,白平衡参数固定为:红增益 = 1.2,绿增益 = 1.0(固定),蓝增益 = 1.5。每次系统启动后,或当光源出现老化迹象可能导致色温漂移时,均需执行一次校准。 上述设置有助于确保烟丝切割边界的清晰性与亮度分布的稳定性,同时满足后续烟丝分割、取向计算及有序性分析的处理需求。

图像采集
图像采集的目标是截取加热不燃烧卷烟棒在切割后表面暴露的切碎烟丝区域。检测过程中,首先将卷烟样品传送至检测工位,由样品定位机构调整并固定其姿态与位置。该定位机构包含带有V型对准导轨的气动夹具。经激光位移传感器测量验证,系统在连续1000次循环中的位置重复精度达到±0.5 mm。 随后,切割机构稳定地切开外部包裹材料,完全暴露出视觉系统视场内的表面切烟丝。切割采用圆形旋转刀片(直径50 mm,厚度0.3 mm,材质为高速钢),设定切割深度为1.5 mm,转速为300 rpm。通过线性编码器反馈监控切割一致性,确保厚度变化控制在±0.05 mm以内。 当样品位置稳定且成像区域清晰界定后,在光源提供的稳定照明条件下,使用工业相机进行图像采集。共收集634张图像;典型图像如图1所示。 数据集包含三种烟丝密度水平(低、中、高,分别约为180、220和260 mg/cm3)、烟丝取向范围从−180°至180°,以及从正常照明到低照度边缘条件的多种光照环境。照度使用经校准的数字照度计(TA8133,精度±3%)测量,传感器置于样品表面位置。测得的正常照明范围为200–800 lux,由封闭罩内条形LED光源提供,无环境光泄漏。低端值(约200 lux)是通过调暗光源以评估模型鲁棒性所创建的边缘情况。此外,约30%的图像中存在烟丝部分遮挡现象(遮挡范围为10%至50%)。这些变化反映了实际生产线中的多样性。

使用机械设备对木材样本进行压缩测试的示意图,显示连续阶段。
图1。视觉系统采集的切碎烟草的代表性原始图像。 (a–h)在工业现场条件下,利用图像采集系统拍摄的切碎烟草原始图像的代表性示例。图像在受控照明条件下以896 × 1600像素分辨率获取,采用条形光源以确保亮度均匀并最小化环境干扰。这些图像展示了烟草丝在模型处理前的分布、密度和取向变化。请点击此处查看该图的放大版本。

图像标注
使用开源工具 LabelImg,在可见的切碎烟草和钢制支撑结构周围绘制边界框。每个边界框的标签为其对应的角度。水平方向(0°)定义为与图像底边平行向右的方向。对于每根烟草丝,使用标注工具的角度测量功能沿其主轴方向画一条线。角度记录为该主轴与水平参考方向之间的夹角(范围:−180° 至 180°)。 标注结果以标准单阶段检测格式保存,每幅图像对应一个 TXT 文件。每个 .txt 文件中的每一行格式为:class_id x_center y_center width height。 坐标相对于图像尺寸归一化到 [0,1] 范围内。类别 0 表示烟草丝,类别 1 表示钢制支撑结构。 角度标签作为第六列数据附加在标准 YOLO 五项字段之后,存储于标注 .txt 文件中。每行的确切格式为:class_id x_center y_center width height angle。角度值以浮点数形式存储,单位为度,取值范围为 −180.0 至 180.0,保留两位小数(例如:45.75)。示例行:0 0.5230 0.4170 0.0850 0.0620 38.25。

质量控制
第二位注释者对随机选取的 20% 注释图像进行了复查。随机选取使用 Python random 库中的 random.sample() 函数完成,并设定固定的随机种子为 2024。生成了所有图像文件名的列表,然后使用该设定种子的随机数生成器进行无放回抽样,选取其中 20% 的图像,确保在重复进行质量控制过程时选择结果可重现。所有不一致之处均经过讨论并解决,以保证标注的一致性。采用角度偏差评估注释者间一致性:两位注释者角度标注之间的平均绝对差异为 2.8°(标准差 = 1.5°)。偏差 >5° 的标注被重新审查并校正。

用于切丝烟叶有序性检测的单阶段回归模型
切丝烟叶排列有序性的检测对于提升卷烟生产过程及最终产品质量至关重要。然而,该检测任务面临诸多挑战,包括切丝烟叶相互重叠、目标尺寸较小以及光照不均等问题,这些因素均会降低检测的准确性与鲁棒性。本文采用一种基于 YOLOv11n 改进的单阶段回归模型,用于切丝烟叶有序性的在线检测。所提出的框架能够准确识别烟支成型过程中切丝烟叶的形态特征,从而可靠地检测其排列规整性,同时提升检测的准确性、鲁棒性及实时处理能力。所提出的单阶段回归框架的整体结构如图2所示。

神经网络架构示意图;针对图像输入分析的主干网络、颈部和头部处理。
图 2.所提出的单阶段回归模型的整体架构。该示意图展示了完整的网络结构,包括主干网络、颈部和检测头。主干网络提取多尺度特征,并引入多频率交互下采样(MFID)模块以保留特征信息。颈部采用三重互补融合(TCF)策略整合特征,增强多层次表征能力。检测头采用 DynamicHead 模块,该模块集成了尺度感知(πL)、空间感知(πS)和任务感知(πC)注意力机制,以提升定位与分类性能。请点击此处查看该图的放大版本。

多频率信息下采样模块(MFID)
在 YOLOv11 的主干网络中,步长为 2 的卷积操作通过跳过像素实现下采样。该过程直接丢弃了一半的空间信息,导致高频细节(例如小物体的边缘和纹理)丢失,对小目标造成显著的信息损失。此外,主干网络中的最大池化和平均池化操作也会丢弃物体区域内的重要细节信息,使特征平滑并引入噪声,这些因素均对特征学习产生不利影响。

为解决这些问题,本文引入了一种受小波层次分解概念启发的多分支特征融合与分解(MFID)模块15,16。该模块首先利用哈尔小波变换将特征分解为两个互补部分:低频背景信息有助于提升分类性能,而富含边缘和纹理的高频细节则有利于小目标检测。为进一步增强对小目标的感知能力,MFID模块还引入了两个额外分支:一个最大池化分支,利用平移不变性来保留小目标的细粒度特征;另一个步长卷积分支,通过可学习参数实现更强的表征能力和更丰富的信息组合。通过这种多分支结构,MFID模块在下采样过程中保留了更完整的空间与频率信息。MFID模块的结构如图3所示。

哈尔小波变换示意图,卷积层,Conv2d,池化,激活,神经网络。
图 3。MFID 模块的结构。 MFID 模块利用哈尔小波变换将输入特征分解为低频和高频分量,以在下采样过程中保留关键的结构信息。HLL 表示低频近似分量,而 HLH、HHL 和 HHH 分别表示水平、垂直和对角方向的高频细节分量。符号 2↓ 表示两倍下采样。来自多个分支的特征图通过拼接和门控机制进行融合,以增强特征表示能力。请点击此处查看该图的放大版本。

在下采样过程中,图像通过Haar小波变换进行分解,该变换因其在分解低频和高频特征方面的简洁性和高效性而被采用,适用于实时检测任务。HLHH 分别表示低通和高通分解滤波器,用于从图像中提取低频和高频信息。一级一维Haar变换的小波基函数和尺度函数通过公式1定义如下:

带有基函数 φ 和 ψ 的量子波函数表达式,方程展示叠加原理。 (1)

Haar 基函数通过公式 2定义如下:

小波变换方程,φ<sub>j,k</sub>=2<sup>j/2</sup>φ(2<sup>j</sup>x-k),数学公式。 (2)

此处,参数 jk 分别表示 Haar 基函数的缩放系数和平移量。具体而言,零阶 Haar 基函数通过公式 3定义如下:

数学函数方程 φ_00(x)=φ_0(x);分段函数图示,微积分概念。 (3)

图3中,符号 2↓ 表示两倍下采样。两级 Haar 小波分解产生四个分量:低频近似分量(HLL)以及水平方向(HLH)、垂直方向(HHL)和对角方向(HHH)的高频细节分量。HLL 分量包含轮廓、背景和全局信息,而高频分量(HLH、HHL 和 HHH)则捕捉边缘、纹理和细粒度特征。

经过两倍下采样后得到的高频分量 HLH、HHL 和 HHH 通过 Concat 操作进行拼接,从而融合多方向的细节信息,生成综合的高频细节信息 静力平衡方程 ΣFx=0 示意图;关键物理概念;力的平衡分析。,如方程 4所示。

特征拼接方法公式,Fi=Concat(H_LH,H_HL,H_HH),符号公式。 (4)

随后,在最大池化分支上进行二次信息融合,以将细节特征与全局特征相整合,从而生成重构信息 静力平衡方程 ΣFi=0 示意图;物理学,力的平衡,矢量分析。,如公式 5所示,该过程融合了更广泛的显著特征,并重新利用高频细节信息以增强特征表示能力。

深度学习公式;最大池化;数学方程;特征拼接;神经网络。 (5)

随后,采用一种门控机制来动态调节信息流,并利用静力平衡方程 ΣFx=0 示意图;关键物理概念;力的平衡分析。指导在静力平衡方程 ΣFi=0 示意图;物理学,力的平衡,矢量分析。中识别小目标特征,从而在抑制固有无用噪声干扰的同时保留有用特征。门控机制定义为:gating(x) = Linear_2(ReLU(Linear_1(x))),其中 Linear_1 将通道维度减少 4 倍,Linear_2 将其恢复至原始通道维度。门控机制的输出通过 Sigmoid 激活函数生成范围在 [0,1] 的调制权重。可学习参数包括两个 Linear 层的权重矩阵和偏置项,这些参数采用均匀初始化方法进行初始化。这确保了细节和关键特征信息得到合理平衡与充分利用,最终生成如Equation 6所示的详细特征静力平衡,ΣFi=0 公式,示意图,物理学中的矢量力平衡概念。

神经网络公式,\(F_i'' = F_i' \otimes \text{Sigmoid}(\text{gating}(F_i'))\),数学概念。 (6)

最后,通过 Concat 将步幅卷积下采样信息、低频向量和最终的细节特征进行拼接,以在多个维度和频带范围内扩展特征下采样交互,如公式 7所示。

总力公式:F_total = Concat(Conv_s=2(F_i), H_LL, F'_i),数学公式。 (7)

操作-实施步骤
模块定义
应在项目的模型定义文件中定义一个名为 MFID 的自定义 PyTorch 模块。该模块的实现包含四个并行路径:(1)小波变换:使用预定义的 Haar 小波滤波器对输入特征图进行两级分解,生成低频近似分量以及水平、垂直和对角方向的高频细节分量,随后将三个高频分量进行拼接;(2)最大池化:对输入应用最大池化以保留显著特征;(3)步幅卷积:通过步幅为 2 的卷积层执行标准下采样;(4)特征重建与融合:首先,将小波变换获得的高频信息与最大池化分支的特征进行融合;接着,利用低频信息引导的门控机制对细粒度特征进行筛选;最后,将处理后的细粒度特征、低频分量以及步幅卷积的输出进行拼接,得到最终的下采样特征图。

配置文件编辑
应打开基线模型的配置文件(config.yaml)。需系统性地识别主干网络和颈部网络中所有标准下采样模块的实例。随后,将每个已识别的下采样模块条目替换为 MFID 模块。

设计动机
MFID 模块旨在缓解标准下采样操作中的信息丢失问题,该问题对小目标检测尤为不利。其核心思想源于小波层次分解。通过在图像中显式分离低频全局信息与高频细节信息,并分别进行处理,该模块确保在下采样过程中关键的纹理和边缘特征得以保留。引入最大池化和步幅卷积分支,进一步从互补的角度捕捉并补充特征——具体而言,分别对应平移不变性与可学习表征。通过多分支融合,该模块为后续网络层提供了更具信息量且更鲁棒的多频率特征表示。所有未特别说明的架构参数和层配置均遵循 PyTorch 中 YOLOv11n 框架的默认实现设置。

三重交叉特征融合模块(TCF)
在 YOLOv11 网络架构的颈部特征融合阶段,通常采用简单的拼接操作来合并相同尺度的特征图。然而,这种直接的方法存在明显局限性:首先,它未能充分考虑不同层次特征之间的语义差异;其次,由于缺乏对通道间相关性的显式建模,小目标特征在融合过程中容易被稀释或丢失,从而影响检测性能。为解决这些问题,本文引入了一种更具交互性的融合方法,称为 TCF 模块17。该方法采用多级渐进式融合策略,通过跨层传输引导信息流向小目标检测任务,同时引入额外的非线性操作以挖掘跨尺度的深层信息,从而增强多尺度特征的融合效果。与依赖简单相加或平均融合的传统模块不同,TCF 采用加权融合方式,能够自适应地学习每一层级的细节信息,动态优化信息提取路径,并聚焦于最具判别性的特征,最终提升检测精度。TCF 模块的结构如图4所示。

神经网络结构示意图:卷积、自适应平均池化、上采样过程。
图4.TCF模块结构。 TCF模块通过浅层、中层和深层的多级特征融合,提升对小目标的表征能力。P表示不同层级的输入特征图。Conv表示卷积操作,Upsample表示特征上采样,AdaptiveAvgPool表示自适应平均池化。该模块通过加权融合和跨层交互整合校准后的特征,增强语义与空间特征的互补性。请点击此处查看该图的放大版本。

在目标检测任务中,深层特征 Pi+1 与浅层特征 Pi-1 所包含的信息存在显著差异。为了增强跨层信息的融合,引入中间层 Pi 作为最终的特征融合层,以平衡不同层次间特征信息的差异。

首先,利用 Sigmoid 激活函数处理浅层、中层和深层的输入信息,生成加权特征 静态平衡公式,Pi-1,科学示意图中的符号;教育性物理概念。静态平衡方程 ΣFx=0;示意图;教育性物理概念分析。数学指数表示法,方程表达式,教育性公式组成部分。,其作用是增强关键特征并削弱冗余特征,如 方程 8 所示。

Sigmoid 函数方程,P'_n=Sigmoid(P_n),n=i-1,i,i+1,机器学习概念。 (8)

其次,浅层、中层和深层的输入信息与映射后的加权特征进行逐元素相乘,以生成校准后的特征 静态平衡,符号 Pi-1,公式图示,力学平衡研究。静态平衡;ΣFx=0;力与力矩的矢量图示;物理教学。多项式方程公式 P_{i+1},数学表达式。,如 公式 9 所示。特征的重要性通过权重注意力机制动态调整,从而实现自适应的特征选择与重新校准。

量子算符方程示意图;Pⁿ (9)

在中层特征融合阶段,采用两个反向权重分支,分别与校准后的浅层特征和深层特征进行融合,以滤除浅层特征中由噪声引起的虚假细节信息以及深层特征中存在偏差的关联语义信息。随后,对多分支信息进行整合,将该层的原始特征、校准特征和交互特征,以及校准后的浅层和深层特征共同融合。该过程实现了多尺度特征信息的保留与互补,缓解了小目标信息丢失和误判问题,最终得到中层融合特征 Σ_pi^i 方程,静力平衡,用于物理图示,教育分析。,其形式由公式 10定义如下:

自适应平均池化的静态平衡方程;数学模型过程示意图。 (10)

浅层、深层和中间层之间的关联分别建立,如公式11公式12所示。

深度学习中自适应平均池化的公式,包含用于教学的数学符号。 (11)

数据分析中上采样过程的数学公式,显示 P_i 变换方程。 (12)

最后,通过Concat操作将三条特征融合路径的输出进行拼接,以保持每条路径自身的特征独立性。每条路径中的关键信息基于权重α、β和γ进行动态学习,这些权重被定义为可学习的标量参数,初始化为1.0,并在训练过程中通过反向传播进行优化,从而实现对浅层、中层和深层特征路径贡献的动态平衡。此外,采用卷积操作来聚合上下文信息,消除因跨层拼接导致的特征边界响应不一致问题,并优化对小目标细节信息的获取与精细表达。该过程通过公式13表述如下:

深度学习模型方程,公式:P_total = Conv(Concat(β×P_i'', γ)×Upsample(P_i+1'', α×AdaptiveAvgpool(P_i-1'')))。 (13)

操作-实施步骤
模块定义
应在项目的模型定义文件中定义一个名为 TCF 的自定义 PyTorch 模块。该模块接收来自主干网络不同阶段提取的浅层、中层和深层特征图作为输入。其内部处理流程包含三个主要步骤:(1)特征校准:对三个输入特征层分别应用 Sigmoid 函数生成权重图,然后将权重图与原始特征图进行逐元素相乘,以增强关键特征并抑制冗余特征;(2)交互式融合:在中层特征融合阶段,引入两条反向权重分支,分别与校准后的浅层和深层特征进行融合,以滤除浅层特征中由噪声引起的虚假细节信息以及深层特征中存在的偏差关联语义信息;(3)多路径聚合:整合原始特征、校准后的特征、交互特征以及融合了浅层与深层信息的特征,随后通过卷积操作消除因跨层拼接导致的特征边界响应不一致问题,最终输出富含多尺度信息的融合特征。

配置文件编辑
应打开模型配置文件(config.yaml)。找到颈部网络中的特征融合部分——即主干网络不同阶段特征进行融合的层。在这些位置,应将原始的简单拼接操作层替换为对TCF模块的调用,并确保该模块的输入正确连接到相应的浅层、中层和深层特征。

设计动机
TCF 模块的设计源于特征融合过程中存在的信息差异与信息丢失问题。浅层特征细节丰富,但包含大量噪声;深层特征语义性强,但分辨率较低。为解决这一问题,TCF 模块引入中间层特征作为信息平衡器,并精心设计了校准、交互与聚合路径,以最大化跨层级特征的互补优势。其核心动机在于构建一种更高效的融合机制,能够动态评估各层级特征的重要性,并选择性地整合信息。由此生成的高质量特征表示既富含细节信息又具备强语义表达,可为后续检测头提供支持,尤其适用于小目标识别任务。

DynamicHead 模块
检测头组件的核心功能是对主干网络和特征融合网络生成的特征表示进行多尺度目标识别。该过程能够实现对检测目标的精确空间定位、类别分配以及边界框预测的可靠性评估。由于视觉数据中目标特征存在显著的尺度变化,且某些帧中边界框候选区域高度密集,因此精确的切丝烟识别需要分析多尺度模式。为应对这一挑战,该方法采用 DynamicHead 架构18 替代 YOLOv11n 中原有的检测头,构建了一个自注意力框架,融合了尺度感知、空间感知和任务感知机制,从而提升检测能力与运行效率。DynamicHead 组件的结构配置如 图5 所示。

神经网络流程图;卷积层、ReLU 层和 S 型函数层的示意图;算法逻辑。
图 5.DynamicHead 检测模块的结构。 DynamicHead 模块包含三个顺序的注意力机制:尺度感知(πL)、空间感知(πS)和任务感知(πC)。这些组件可在不同尺度、空间区域和检测任务中动态调整特征的重要性。该设计通过在检测头中实现自适应的特征优化,提高了定位精度和分类性能。请点击此处查看该图的放大版本。

该架构包含三个专门的注意力单元:尺度感知(πL),空间感知(πS)以及任务感知(πC)组件。尺度感知注意力机制(πL)首先在空间和通道维度上对输入特征图进行平均。结果通过一个线性投影层,随后经过硬Sigmoid激活函数生成缩放权重,再与原始特征图进行逐元素相乘。空间感知注意力机制(πS) 采用可变形卷积与 K = 9 个稀疏选取的采样点。它预测偏移向量 Δpk 和调制标量 Δmk 对于每个采样点,然后聚合所采样的特征以生成空间注意力权重。任务感知注意力机制(πC)使用两组参数(α)对每个通道独立地应用可学习的线性变换1β1 和 α2β2)。它在两种变换后的表示之间选择最大响应,以动态适应分类和回归任务的特征。最终,这三种注意力机制按顺序应用于输入特征图,形式为 F_out = πC(πS(πL(F) · F) · F) · F。尺度感知机制采用跨尺度特征加权,自适应地融合多分辨率表示,从而增强模型对尺寸变化的敏感性。空间感知组件在特征映射中实施区域强调加权,将计算注意力导向前景实体,同时抑制无关背景干扰。与此同时,任务感知模块针对特定目标动态调节输出表示,优化分类与回归结果,以提升模型精度和运行鲁棒性。该计算过程的形式化描述如下 公式 14–17.

函数方程,\( W_L(F) \),数学公式,研究分析,过程建模。 (14)

博弈论方程,πL(F)=σf(1/SCS,C ΣF)F,用于经济建模与分析研究。 (15)

资本资产定价模型方程、公式分析、风险-收益关系、金融模型。 (16)

数学平衡方程;静力分析;力分量比较公式。 (17)

此处,WL(F) 表示经过注意力增强的特征表示,而 πL(F)、πS(F) 和 πC(F) 分别对应尺度、空间和任务导向的注意力操作。变换 f 表示一个线性投影层,σ(x) 表示硬Sigmoid激活处理,K 指定稀疏选择的空间点数量,pk+Δpk 引入位置调整以突出判别性区域,Δmk 构成对空间点 pk 的可训练显著性度量,而 α(F) 和 β(F) 是控制激活阈值的可学习参数函数。其中,K 在所有实验中均设为 9,因为该值在保持计算效率的同时提供了足够的空间覆盖范围。

操作-实施步骤
模块定义
应在项目的模型定义文件中定义一个名为 DynamicHead 的自定义 PyTorch 模块。该模块的实现包含三个依次应用的注意力单元:(1)尺度感知注意力:使用可学习参数对不同尺度的特征层进行动态加权;(2)空间感知注意力:基于可变形卷积的概念,该单元聚焦于特征图中稀疏但具有判别性的空间位置;(3)任务感知注意力:动态学习激活阈值,以分别优化分类和回归任务的特征表示。这三个注意力机制依次应用于输入的特征金字塔,最终生成用于预测的特征。所有模块均使用标准的 PyTorch 操作实现,包括卷积层、线性层、激活函数以及上述注意力机制。

配置文件编辑
应打开模型配置文件(config.yaml)。找到定义检测头的章节。将原本通常由一系列用于分类和回归的卷积层组成的检测头配置,替换为对 DynamicHead 模块的调用,并确保其输入与颈部网络输出的特征金字塔相连接。

设计动机
传统的检测头通常对所有特征层、空间位置和任务应用相同的一组卷积参数,缺乏针对具体任务的适应性。DynamicHead 模块的引入源于检测任务的复杂性,旨在通过统一的基于注意力的架构来解耦并应对这些挑战。其设计动机包括三个方面:(1)通过尺度感知模块自适应地关注与不同尺寸目标相对应的特征层;(2)通过空间感知模块将计算资源集中在前景目标区域而非背景区域;(3)通过任务感知模块为分类与回归这两个不同目标动态优化特征表示。这种解耦与动态优化的结合,提升了模型对密集排列、多尺度目标(如切碎烟草)的定位精度和分类可靠性。

烟丝排列整齐度的定制化评估方法
模块描述与设计原理:对烟丝切割后排列整齐度进行定量评估,对于判断卷烟生产过程中制造工艺的稳定性以及预测最终产品质量至关重要。传统的评估方法依赖人工目视检测,具有主观性强、耗时长且无法提供一致的定量测量结果等缺点。为克服这些局限性,本方法采用一种结合改进的单阶段回归检测器的定制角度预测技术。该方法的基本原理是利用卷烟棒内部的钢制支撑结构作为几何基准,建立空间参考框架。由于钢制支撑在制造过程中保持固定方向,因此可作为计算单根烟丝相对取向的理想参考线。通过测量检测到的每根烟丝与钢制支撑相对于水平参考线的绝对角度,并进一步计算其相对角度差值,从而实现对排列整齐度的定量评估。当相对角度为零时,表示烟丝与支撑完全平行;相对角度越大,则表明排列越不整齐。水平参考轴定义为与图像底边平行、从左至右延伸的直线,对应0°方向,正角度按逆时针方向测量,负角度按顺时针方向测量。最终的整齐度指标通过对图像中所有检测到的烟丝相对角度取平均值得到,从而实现一致且客观的质量分级。

操作-实施步骤
角度计算模块定义
实现一个后处理模块,用于处理改进后的单阶段回归模型的检测输出。针对每个检测到的物体(切丝烟草和钢制支撑),提取其边界框坐标。使用公式 18计算每个检测物体的中心点坐标。根据图像尺寸,使用公式 19计算图像中心点坐标。

质心计算公式,\(c_x = (x_1 + x_2)/2\)。
几何分析中使用的质心计算公式,\(c_y = (y_1 + y_2)/2\)。  (18)

公式:d<sub>x</sub> = c<sub>x</sub> - w/2。数学公式,变量分析。
计算垂直距离的公式,\(d_y = h/2 - c_y\),与静态平衡相关。   (19)

其中,x₁、x₂、y₁、y₂ 表示检测到的烟草丝束或钢制支撑物边界框四个角的坐标;cxcy 表示其各自在检测区域内的中心点坐标;wh 表示香烟图像的宽度和高度;dxdy 定义图像中心点的坐标。

绝对角度计算
针对每个检测到的烟草丝束和钢制支撑结构,计算从图像中心指向物体中心的矢量。使用反正切函数相对于水平参考线计算绝对角度,公式如公式 20所示。该角度通过 atan2(d_y, d_x) 计算,其中 atan2 是 Python 数学库中提供的四象限反正切函数。此函数返回范围为 (−π, π] 弧度的值,随后将其转换为度,得到输出角度范围为 (−180°, 180°]。象限的判断由 atan2 根据 d_y 和 d_x 的符号自动完成。由此可得到钢制支撑结构的 Asteel 和每根烟草丝束的 Acut

使用反正切函数计算角度的概念,公式为 A_steel = arctan(dy, dx),数学。 (20)

相对角度计算
对于每个检测到的烟草丝,通过将其绝对角度减去钢制支撑物的绝对角度来计算相对角度,如公式 21所示。取绝对值可确保角度偏差测量结果为正值。

钢材料应力分析中的方程:|A_steel - A_cut|;公式图示。 (21)

有序性指标生成
汇总单张图像中所有检测到的纤维的相对角度。通过将所有相对角度 To 相加后除以检测到的纤维总数 n,计算平均相对角度,如公式 22所示。该平均值作为该图像排列有序性的定量度量。

热力学公式,Tₒ,Σ方程,均值计算,教学资源。 (22)

质量分级实施
根据公式23中定义的预设阈值,实现一个将计算值映射为定性等级的分类函数。分级阈值(0°–30° = 优秀,30°–60° = 良好,>60° = 差)是基于与龙岩烟草工业有限责任公司三位质量控制专家的咨询结果确定的。这三位专家独立评估了200张样本图像,并将计算得到的平均相对角度与感知到的对齐质量进行关联,采用三级分类标准(优秀、良好和差)。30°和60°的边界被选为专家间共识的临界值,在这些点上专家间的一致性超过90%。该分级系统使得质量控制人员能够直观地理解定量分析结果。

基于温度范围的分级标准公式,以数学形式显示。 (23)

配置文件编辑
应打开模型配置文件(config.yaml 或 model.yaml)。找到配置文件中的后处理部分或推理设置部分。正确引用并启用自定义角度计算模块。验证输出解析设置,以准确提取切碎烟草和钢制支撑结构的边界框坐标。本评估方法无需插入额外网络层,因其作为检测头输出后的后处理模块运行。

设计动机
本定制化评估方法的设计初衷是将主观的视觉检查转化为客观、可重复的定量测量。传统的手动检测存在观察者间差异,且无法为工艺优化提供连续的数值数据。通过利用烟支内部的钢制支撑作为天然的几何参考,该方法无需外部校准标记,即可确保在不同图像和生产批次间测量结果的一致性。采用中心点向量与反正切计算,为角度估算提供了数学上稳健且计算高效的解决方案,适用于实时部署。这种从图像中心指向目标中心的向量计算方法,设计上不受相机视场以及烟支在图像中位置的影响,从而在不同拍摄条件下均能保持鲁棒性。通过对多个检测到的烟丝条进行平均处理,该方法可有效应对烟丝取向的自然变异,获得具有统计可靠性的整体有序性指标。三级分级系统将连续的数值测量结果转化为可操作的质量等级,有助于在生产线质量控制中快速决策。总体而言,该集成方法结合了改进的单阶段回归模型的检测能力与精确的几何计算,实现了对切丝排列有序性的全面自动化评估。

用于烟丝整齐度检测的模型训练
应正确安装 PyTorch 2.1.0、统一计算设备架构(CUDA)12.1 及所有相关依赖项。该实现遵循标准的 PyTorch YOLO 流程,可根据提供的详细模块说明和配置步骤进行复现。

训练命令
在重新训练之前,应准备好已划分的图像数据集以及标准单阶段检测格式的标注文件(例如,每张图像对应一个 .txt 文件的 YOLO 格式)。需创建一个数据集配置的 .yaml 文件,其中指定图像路径、类别数量(切丝和钢制支撑)以及类别名称。根据前述模型改进方案,应将原始检测器的 .yaml 配置文件替换为所提出的模型 .yaml 文件,该文件集成了 MFID、TCF 和 DynamicHead 模块。应编写或修改 train.py 脚本,以导入单阶段检测器包,加载训练模型和数据集配置,并设置以下训练参数:imgsz=640,epochs=100,batch=4,workers=0,device='0',optimizer='SGD',close_mosaic=10 等。随机种子固定为 42,模型权重采用深度学习框架提供的默认初始化策略进行初始化。通过设置 torch.backends.cudnn.deterministic = True 和 torch.backends.cudnn.benchmark = False,确保实验可重复性。

超参数
训练过程中配置的关键超参数如下:输入图像分辨率为 896 × 1600 像素;批量大小为 4,受 GPU 显存限制;初始学习率为 0.01,采用余弦退火调度器进行逐步衰减;优化器为带动量的随机梯度下降(SGD),动量值为 0.912,以加速收敛;正则化项的权重衰减系数为 0.0004。图像归一化采用均值 [0.485, 0.456, 0.406] 和标准差 [0.229, 0.224, 0.225]。数据增强包括随机水平翻转(50% 概率)、随机亮度调整(±20%)和随机旋转(±15°)。默认在训练初期启用马赛克增强(Mosaic augmentation),以提升模型对不同物体尺度和遮挡的鲁棒性;在最后 10 个训练轮次中禁用该增强(close_mosaic = 10),以优化检测精度。

训练监控
训练过程中,框架会在每个训练周期输出全面的评估指标。损失函数由三个部分加权求和构成:分类损失(带logits的二元交叉熵 [BCE])、定位损失(完整交并比 [IoU] 损失)和目标性损失(BCE)。总损失的权重设置为 λ_cls = 0.5,λ_box = 0.05,λ_obj = 1.0。应持续监控训练和验证损失曲线,以确保稳定收敛,并检测是否存在过拟合迹象。在验证集上,以IoU阈值0.5计算的平均精度(mAP@0.5)被用作检测切丝段性能的主要评价指标。考虑到数据集规模和模型复杂度,通常训练100个周期足以实现收敛。表现最优的模型检查点将根据验证集上的mAP自动保存。

模型评估与部署
评估
训练完成后,最优模型权重将保存为 runs/train/exp/weights/best.pt。应使用以下命令在专用验证集上评估训练好的模型:python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt。评估脚本会输出关键性能指标,包括两个检测类别(烟丝和钢支支撑)的精确率、召回率和 mAP@0.5。需验证 mAP 是否达到工业部署所需的阈值(例如,烟丝检测的 mAP >95%)。该部署阈值(烟丝检测 mAP >95%)代表目标工业环境中内部设定的性能要求。报告的结果反映了模型在一个包含具有挑战性的边缘案例的多样化测试集上的表现。当在经过筛选的理想光照条件且遮挡最少的子集上进行评估时,模型在常规生产条件下的 mAP 超过 96%。该常规生产子集的定义标准如下:照度在 500–800 lux 范围内(理想光照),遮挡比例小于 10%(极小重叠),且无明显镜面反射。此子集包含 427 张图像,约占测试集的 67%。该子集对应于正常光照条件下标准的白天生产环境以及良好排列的烟丝布局。

推理验证
为直观验证模型在未见图像上的检测性能,使用以下命令对测试样本图像执行推理:python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5。该命令会生成带有边界框的标注图像,框出检测到的切碎烟丝和钢制支撑结构。推理速度在配备 12 GB 显存的 NVIDIA GeForce RTX 3080 Ti GPU 上进行测量,使用 CUDA 12.1 和 PyTorch 2.1.0。报告的每秒帧数(FPS)是经过 50 次预热迭代后,连续 100 次前向传播的平均值。此外,报告推理速度(单位:帧每秒)以确认其在部署环境中具备实时处理能力。

模型部署
为在工业控制系统上实现实时部署,应将训练好的 PyTorch 模型(best.pt,约 7–9 MB)导出为优化的推理格式,例如 TensorRT 或开放神经网络交换(ONNX)格式。此转换可在保持检测精度的同时提升推理速度。导出为 ONNX 格式时,使用命令:torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"])。转换为 TensorRT 格式时,使用命令:trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096。采用 FP16 精度模式以优化推理速度。最终部署的模型输出每个检测对象的边界框坐标、类别标签(切丝或钢制支撑件)以及置信度分数,这些输出将作为自定义角度评估方法的输入,用于量化烟丝切割的整齐程度。

访问受限。请登录或开始试用以查看此内容。

结果

实验环境
所有实验均使用 PyTorch 深度学习框架进行,详细的硬件和软件配置见表1。共634张图像按7:2:1的比例随机划分为训练集、验证集和测试集。训练过程中,输入图像被统一调整为896 × 1600像素,初始学习率设为0.01。采用动量系数为0.912的随机梯度下降优化器以减轻过拟合。每个模型均以批量大小4训练100个轮次,数据加载使用单个工作线程(即 workers = 0)。

参数数值
CPUIntel(R) Core i9-9900K
GPUNVIDIA RTX 30...

访问受限。请登录或开始试用以查看此内容。

讨论

在切丝烟叶有序性检测中,所提出模型的一个关键优势在于其在检测精度与计算效率之间实现了良好平衡。该任务需要对高分辨率图像中的大量细粒度切丝烟叶进行实时处理,对模型的精度和速度提出了严格要求。如表2所示,在对比的单阶段检测器中,所提出的模型在检测切丝烟叶和钢制支撑物方面实现了最高的mAP@0.5(89.9%),同时参数量最少(1.8M),FLOPs最低(5.1G)。这种高效率特性直接转化为实际生产中的优势:更小的模型体积使得在嵌入式系统上的部署速度更快,内存需求更低,推理延迟和功耗更小。因此,该模型适用于资源受限的工业控制平台,在确保切丝烟叶有序性实时监测精度的同时,降低了硬件成本和系统集成复杂度1

尽管增强模型在切丝有序性检测方面表现出色,但仍存在若干局限性值得讨论。检测精度在很大程度上依赖于训练数据的代表性,特别是不同生产阶段和光照条件下切丝形态多样性的覆盖情况19。在实际生产环境中,切丝的排列模式、密度以及遮挡程度存在显著变化

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在直接的竞争性财务利益。本研究在龙岩烟草工业有限责任公司开展,该公司为本研究提供了应用场景和现场数据。学术作者声明,在本作品发表方面不存在财务或非财务利益冲突。

致谢

本研究由加热不燃烧卷烟产品生产测量技术及环境温湿度控制项目资助(项目编号:FJZYKJJH2022YB014)。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
扫码器HikvisionID5050用于读取托盘上的条形码;需要 24 V 电源供电
数据集(切后烟丝图像)龙岩烟草工业有限责任公司N/A自定义的切后烟丝图像数据集,用于模型训练、验证和测试
深度学习框架(PyTorch 2.1.0)PyTorch 基金会开源软件用于深度学习模型的开发与训练
工业相机HikvisionMV-CH120-10GC用于图像采集;需要 24 V 电源供电
工业计算机研智科技PC1010-AX360用于图像处理、模型推理和数据存储
LED 光源HikrobotMV-LRDS-H-95-30-W条形光源,为成像提供稳定照明
镜头HikvisionMVL-KF0818M-12MP焦距:8 mm;光圈范围:F1.8–F16;分辨率:12 MP
金属支架龙岩烟草工业有限责任公司7075-T6 铝合金用于安装和固定硬件组件
网线龙岩烟草工业有限责任公司RJ45 水晶头用于连接工业计算机、相机和网络设备
Python(版本 3.9)Python 软件基金会开源软件实现所用的编程环境
交换机TP-LinkTL-SH10058 个以太网端口;需要 220 V 电源供电
无线接入点(工业通信模块)山东华创讯联BH-ANT5158S-14HV;BH-MS-AC1600HWH实现相机与工业计算机之间的无线通信
相机控制软件(MVS)HikvisionV4.5.1用于相机调试、参数配置和数据采集
视觉处理软件(Vision Master)HikvisionV4.3.0用于模板匹配和图像结果检测
集成开发环境(PyCharm)JetBrains2020.1.3 x64用于模型开发和系统实现
CUDA 工具包(版本 12.1)NVIDIA软件工具包(无目录编号)实现训练和推理过程中的 GPU 加速

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章