为应对自动化仓库中的遮挡和照明变化等挑战,本文引入了改进的单阶段回归架构用于香烟盒品牌检测。通过集成自适应降采样、倒置高效多尺度注意力机制和动态检测头,所提出模型实现了准确的实时智能盘点。
研究文章
为应对自动化仓库中的遮挡和照明变化等挑战,本文引入了改进的单阶段回归架构用于香烟盒品牌检测。通过集成自适应降采样、倒置高效多尺度注意力机制和动态检测头,所提出模型实现了准确的实时智能盘点。
自动香烟库存的视觉识别面临重大挑战,包括照明变化、盒体尺寸差异以及部分特征遮挡,这些都增加了品牌验证和盒装错误检测。本文提出了一种改进的实时检测模型,以应对图像识别问题并提高准确性。首先,部署自适应降采样模块,取代YOLO系列主干网络和颈部网络中的降采样卷积模块,作为基线或原始检测器,有效保留更多特征细节并实现模型的轻量化。其次,引入了倒置高效的多尺度注意力模块,用于捕捉不同尺度的空间上下文信息,生成更精确的空间注意力地图,从而提高基线模型对复杂特征和遮挡目标的预测准确性。最后,一个动态检测头模块取代了基线模型的原始检测头,对从主干网和颈部网络提取的特征图进行多尺度物体检测,以实现预测目标的准确定位和类别划分。为了评估改进模型在实地的表现,我们构建了一个香烟盒品牌的可视化数据集。该数据集通过区域特定复制粘贴和传统增强技术进行了扩展,所得数据集包含复杂的背景、遮挡和重叠、小靶及其他因素。该实验表明,本文中提出的改进模型有效满足现场实时探测的需求。所提模型实现了97.9%的mAP,参数和FLOP分别为1,849,679和5.1 G。与基线模型相比,所提模型提升了0.9%的mAP,参数减少了28.78%,浮点运算降低了1.4G。此外,该模型的推断速度达到38.5 FPS,满足了实时工业检测的需求。
现代制造和物流高度依赖自动存储与回收系统(AS/RS)1,以实现高密度存储、高效物料处理和精准库存管理。AS/RS因其高效和智能特性,已成为帮助企业提升仓储效率和降低成本的重要手段。AS/RS以多层货架、各种装卸设备为基础,是一套计算机控制机电一体化系统,集成了机械、电子、计算机科学、通信、网络、传感器和自动控制2,3等多种技术。AS/RS通过整合和优化货架、堆叠起重机、输送线、控制系统及其他设备,实现货物的高效、准确和安全储存,极大提升了存储效率。将计算机视觉整合进AS/RS,作为工业4.0的关键方面,使系统能够基于视觉数据进行观察和决策,实现前所未有的自动化和智能化水平。
随着AS/RS在烟草工厂的广泛应用,5号香烟盒品牌提出了新的盘点要求。传统的人工盘点方法存在效率低下、高误检测率和安全隐患,无法满足AS/RS的需求。随着计算机视觉技术的不断进步,机器视觉解决方案在工业检测领域中应用越来越多,6,7,8。由于每个香烟盒上都印有带有独特图案和文字的品牌信息,基于机器视觉的图像识别技术使香烟盒品牌识别和盘点成为可能。
自2012年以来,基于深度学习的物体检测算法为图像识别9、10、11带来了重大突破。从早期的两阶段物体检测模型如R-CNN12,到以YOLO系列模型为基础或原始探测器13、14、15的当代单阶段物体检测模型,这些方法对物体检测算法的发展做出了重要贡献。智能盘点任务越来越多地利用物体检测模型,在图像或视频中准确识别和定位多个目标。Li等人提出了一种智能盘点方法,结合称重传感器和图像识别技术,以提高盘点效率和准确性。Wang等人使用掩膜R-CNN从书脊图像中分割书架编号和标题位置。Sun等人设计了一个集成的视觉识别系统,利用OpenCV多模式识别材料和货架上的二维代码。他们通过引入C3CBAM注意力机制和SimOTA标记分配,优化了原始探测器(v5s),以增强多材料的准确检测损失函数。
在物体检测领域,虽然两阶段模型——以Faster R-CNN为代表——在检测精度上具有传统优势,但其复杂的区域提案生成机制导致推理速度相对较慢。因此,它们难以满足工业场景中对实时性能的严格要求 19,20。相比之下,基于回归的架构将物体检测视为单一回归问题,直接从输入图像预测目标位置和类别概率。这种架构设计使模型在推理效率、轻量化和部署灵活性方面显著优于大多数两阶段模型,同时保持竞争力的准确性。因此,这种架构已成为实时工业检测的首选解决方案。
原始模型生态系统持续快速演变,近期变体解决了具体挑战。例如,最初的探测器(v12)22 侧重于进一步提升训练时间优化和架构优化,以实现更好的准确性与效率权衡。与此同时,原始探测器(World)23引入了开放词汇检测能力,通过视觉语言建模实现对训练集类别外大量对象的实时推断。虽然这些进展推动了通用物体检测的边界,但本研究聚焦于一个专业的工业应用,在该领域对特定挑战(如部分遮挡和照明方差)的鲁棒性至关重要,且类别空间是固定且事先已知的。作为该系列中最热的版本,基线型号24继承了原始探测器(v8)25,26的优势;它不仅减少了模型参数的数量,还在检测效率和准确性之间取得了平衡。与其他物体检测模型相比,它在视觉识别任务中表现突出。
检测小型或部分遮挡的香烟盒的挑战,是计算机视觉领域更广泛问题的一个体现。小物体检测已被积极研究,方法涵盖从特征金字塔网络(FPN)27 的细化到上下文感知注意力机制,这些机制激发了多尺度特征处理的集成。此外,在工业环境中追求运营效率需要轻量化的模型设计。受 MobileNetV328 和 GhostNet29 中探索的高效架构理念启发,这些概念采用深度卷积和线性变换以降低计算复杂度,同时保持展示能力,因此我们选择了一些轻量级模块来改进模型。因此,为了处理香烟盒品牌的盘点及其影响因素,如照明变化、各品牌特征大小差异以及香烟盒间的部分遮挡,本文提出了改进的单阶段回归结构对象检测模型。
该模型的主要创新有三方面。首先,部署自适应下采样(ADown)30模块,以取代主干网络和颈部网络中的标准卷积下采样。这种新颖的设计减少了功能压缩过程中的信息丢失,这对于保留小型品牌标志和文本至关重要。其次,引入了一种倒置的高效多尺度注意力(iEMA)机制,赋予模型动态多尺度的情境感知能力,显著提升其在小型和部分遮蔽香烟盒上的表现。第三,原有的探测头被DynamicHead31 模块取代,该模块统一了尺度、空间和任务感知注意力,实现了跨巨大尺寸目标的更精确定位和分类。这些架构改进有条理地设计,旨在解决工业环境中香烟品牌识别的具体痛点。
访问受限。请登录或开始试用以查看此内容。
本文所用数据集来自龙岩烟草工业有限公司物流部的AS/RS领域。本研究未涉及人类参与者或动物。无需伦理批准。
数据集获取与建立
硬件配置:将配备8毫米焦距镜头(如MVL-HF0828M-6MPE)的工业相机安装在堆垛起重机的货平台上。通过GigE线缆和无线接入点设备(例如BH-ANT5158S-14HV、BH-MS-AC1600HWH)将摄像头连接到控制电脑。在相机周围放置一条LED灯条(例如MV-LLDS-1002-38-W)以确保照明均匀。
相机参数设置:使用制造商软件(如MVS)配置相机。将采集分辨率设置为1280 x 1024像素。将触发模式设置为 硬件触发 ,并与堆垛起重机的定位系统同步。将曝光时间设置为100毫秒,增益为5分贝,以减少运动模糊和噪点。相机与香烟盒之间的工作距离约为550毫米。
图像收集:带触发器的工业相机在烟盒存储和取回时,每次托盘放置时自动捕捉图像。共收集4,835张原始图像;典型图像见 图1。
图片注释:使用开源工具LabelImg。每张图片,在每个可见的香烟品牌特征周围画出边界框。为每个包边盒指定正确的品牌名(如洪庄、固田)作为类别标签。将注释保存为标准的单阶段检测格式,每张图片包含一个txt文件。
质量控制:第二位注释者会审查随机选出的20%的注释图像。任何差异都会被讨论并解决,确保标签一致性。
数据增强策略
本节详细介绍了应用于数据集的传统和高级增强技术。初始数据和增强数据合并为新数据集,然后将其分为训练集、验证集和测试集,以确保评估的公平性。
传统数据增强32:这些转换由训练流程实时应用(例如使用Albumentations或PyTorch变换库),每个批次都有定义的概率。
几何变换:旋转:随机旋转图像,角度介于-45°到+45°之间。缩放:将图像随机按0.8到1.2倍的比例缩放。水平翻转:随机以100%概率水平翻转图像。随机裁剪:随机裁剪原始图像区域的80%到100%之间的部分。
光度变换:亮度与对比度:通过随机选择的因子调整亮度和对比度,取自[0.6, 1.4]。高斯噪声:将标准差从[0, 0.01 * 255]随机选取高斯噪声,增加10%的图像。高斯模糊:将核大小为3x3的高斯模糊应用到图像的10%。
遮挡模拟:在图像上随机放置1到3个矩形遮挡补丁(每个覆盖图像面积的5%)。这些补丁填充随机噪点或平均图像像素值。
高级数据增强:区域特定复制粘贴
动机与影响:此次有针对性增强的主要动机是解决一个关键数据问题:几家香烟品牌的实例极少(低至一张图片)。标准的随机列车验证测试拆分可能会将稀有品牌的所有实例分配到单一集(例如全部分配到测试集),导致模型没有机会学习或验证该品牌。该方法人为增加了这些代表性不足品牌的样本量,确保每个品牌在训练、验证和测试集中分布的实例数量足够。这一基础步骤防止了稀有类别的灾难性失败,是任何有意义的模型表现和对整个品牌组合的泛化的前提。
此步骤需要对初始数据集和任何片段模型(SAM)33 进行预训练的分段基线模型。
切段源对象:对于来自代表性不足品牌的香烟盒图片,使用SAM模型生成精确的切分掩码。使用点提示模式,点击 香烟盒的品牌功能 以启动细分。手动验证和优化生成的遮罩以确保准确性。将带有透明背景的分段香烟盒图片保存为PNG文件。这创建了一个孤立对象实例库。
生成背景遮罩:使用预训练的段段基线模型对一组背景图像(空间充足或简单背景的图像)进行实例分割。模型会输出二进制遮罩,表示已被物体占据的区域。
处理遮罩和粘贴对象:对于每个背景遮罩,使用OpenCV库(“cv2.approxPolyDP”函数,ε因子为0.02 × 等高周长)进行曲线拟合并线性化遮罩边缘,获得自由空间的简化多边形表示。将背景遮罩内最大的连续多边形区域确定为目标粘贴区域。从库中随机选择一个分段的源对象。调整大小(保持宽高比),并进行仿射变换(在-5°到+5°之间做小旋转,并略带剪切),使其自然地融入目标粘贴区域,确保不会与现有物体边界重叠。使用alpha混合,将变换后的物体无缝粘贴到计算位置的背景图像上。基于复制粘贴技术在特定领域的数据增强技术整体框架如 图2所示。程序生成一个对应的新txt注释文件,更新包围框坐标和类标签。
最终增强数据集:该离线过程生成600张新的合成图像。将它们与原始的4,835张图像以及通过上述传统增强技术生成的额外1,167张图像结合起来,形成最终的6,602张图像数据集。将最终数据集拆分为训练组(70%,4,621张图片)、验证组(20%,1,320张图片)和测试组(10%,661张图片),确保同一原始序列的图像保持在同一分割范围内,以防止数据泄露。
为构建拟议改进探测器的模型修改
近年来,34 号物体检测算法在工业检测领域取得了显著进展。本节提供了详细的步骤步骤,用于修改基线模型架构以创建拟议模型。修改通过编辑模型配置文件(例如 config.yaml)并确保对应的自定义模块定义包含在代码库中实现。每个修改的理由都被提供了,以阐明其在应对特定检测挑战中的作用。所提出模型的结构如 图3所示。
用ADown模块替代降采样模块:用于下采样的标准卷积-批量规范-SiLU(CBS)模块采用单一跨线卷积,这可能成为信息瓶颈35,可能丢弃识别小型香烟盒和详细品牌标志的关键细节。ADown模块旨在通过实现双分支结构来缓解这一问题,在空间分辨率降低过程中捕捉并保留更丰富的特征集。一个分支优先保留高频局部细节,另一个分支则捕捉更广泛、丰富的上下文概览。这些互补特征的融合为后续层提供了更稳健且信息丰富的表示。
行动-实施步骤
模块定义:确保在项目的模型定义文件中定义了一个名为 ADown 的自定义 PyTorch 模块。该模块必须包含两个并行分支。第一个分支应由一个具有3x3核和步幅2的二维卷积层组成。第二分支应顺序由一个2x2的最大池化层(步幅为2)和一个1x1卷积层组成。这两个分支的输出将沿信道维度串接,所得特征映射随后通过最终的1x1卷积层进行积分并产生输出。ADown模块的结构如 图4所示。
配置文件编辑:打开基础模型配置文件(config.yaml)。系统地识别每个配置为下采样(即步幅参数设为2)的CBS模块实例。将这些CBS模块条目替换为新的ADown模块。
设计动机:ADown的设计源于减少标准步幅卷积中信息丢失的需求,这对小型对象可能有害。其双分支结构灵感来自并行处理的理念,用于捕捉高频空间细节(通过卷积)和低频上下文信息(通过池化),从而为后续层提供更丰富的多尺度特征表示。
iEMA模块的整合
理由与设计原则:为了增强模型检测小型目标和部分被遮挡目标的能力,必须采用能够有效模拟多尺度空间环境的机制。iEMA模块通过将高效多尺度注意力(EMA)36 组件嵌入倒置残差块(iRMB)37 结构中实现这一目标。iRMB通过深度可分卷积提供了计算高效的基础,而EMA部分通过并行多分支设计显式捕捉跨尺度空间交互。这种整合使模型能够动态重新校准特征权重,聚焦于不同尺度中最具辨别力的空间区域,从而提升遮挡和小物体的识别能力。
行动-实施步骤
模块定义:确保定义一个名为 iEMA 的自定义 PyTorch 模块。该模块首先应实现一个倒置残差块。该模块通常以逐点卷积进行通道扩展开始,随后进行深度卷积(例如3x3)进行空间特征提取,最后进行点对点卷积进行通道投影。紧接着该封锁后,应立即实施EMA关注机制。EMA机制通常采用分组卷积和跨维交互,高效生成多尺度空间注意力图,同时避免过多的计算开销。iEMA模块的结构如 图5所示。
配置文件编辑:在config.yaml配置文件中,找到定义颈部网络的部分,特别是紧接C2f模块之后的层。在这些战略位置,插入一个新层,调用iEMA模块。
设计动机:iEMA模块基于通过深度卷积将局部特征提取与轻量但高效的全局上下文建模机制(EMA)整合,提升特征辨别性的原则。这种混合方法使模型能够适应性地聚焦不同尺度上的信息区域,这对于识别部分可见的品牌标志和文字至关重要。
用DynamicHead模块替换检测头
原理与设计原则:原始检测头可能无法最佳处理香烟盒显著的比例变化以及定位与分类任务之间的复杂相互作用。DynamicHead模块通过将三种注意力形式统一为一个连贯的结构:尺度感知、空间感知和任务感知关注来解决这个问题。该缩放感知组件动态融合特征金字塔不同层级的特征,确保各种尺寸的对象都能有效表示。空间感知部分采用稀疏采样策略,将计算资源集中在特征图中最具信息量的区域。任务感知组件专门调整特征表示,以适应边界盒回归和类别分类这两个不同目标。这种统一的方法带来了更准确、更稳健的预测。
行动-实施步骤
模定义:这是一个复杂的模,包含方程(1)至(4)描述的三种注意力机制。其内部结构将包括用于按尺度计算权重、执行可变形空间注意力以及应用特定任务特征变换的层。
(1)
(2)
(3)
(4)
其中WL(F)表示最终的注意力细化特征映射,通过依次应用尺度感知π L(F)、空间感知π S(F)和任务感知π C(F)注意力机制对输入特征F得到。具体来说,在式(2)中,π L(F))通过先在空间(S)和通道(C)维度取平均,经过线性函数f(⋅)和硬S形激活σ(⋅)来计算按尺度计算注意力权重。在方程(3)中,πS(F) 通过聚合从 K 个采样的关键点 pk 中进行稀疏空间关注,每个特征都带有可学习的偏移 Δpk,以聚焦判别区域和重要标量 Δmk。在方程(4)中,πC(F) 通过对每个通道应用线性变换(由学习参数(α1,β1,α 2,β 2)控制)并选择最大响应,实现任务感知注意力,使头能专注于分类和回归任务。DynamicHead模块的结构如图6所示。
配置文件编辑:在config.yaml文件中,找到定义模型头部的部分,该部分最初包含Detect模块。用一个调用 DynamicHead 模块的新条目替换它。
设计动机:DynamicHead模块基于这样一个观察:物体探测头应适应规模、空间位置和任务。其统一的注意力框架,在Eqs.(1-4),使模型能够基于这三个维度动态重新校准特征响应,从而对尺度变异和背景杂乱做出更稳健的预测。
模型训练
确保安装了 PyTorch 2.1.0、CUDA 12.1 及所有依赖。
训练指挥部
在重新训练前,将分割后的图像数据和注释数据准备为标准单阶段检测格式。创建一个包含图像路径和数据类别的 .yaml 文件。根据模型改进,原检测器的.yaml文件被拟议的模型.yaml文件取代。写入 train.py 文件,导入单阶段检测器包,加载训练模型和数据路径,并设置一些训练参数,包括 imgze=640,epochs=100,batch=4,workers=0,device='0',优化器='SGD',close_mosaic=10 等。
超参数:关键参数包括:输入图像尺寸(640 x 640)、批次大小(4)、初始学习率(含余弦退火调度器0.01)、带动量的SGD优化器(0.937)和权重衰减(0.0005)。马赛克增强默认启用。
训练监控:训练过程将输出每个时代的指标。监控训练/验证损失和mAP在0.5的表现,以确保收敛并避免过拟合。通常训练100个时代就足够了。
模型评估与部署
评估:训练后,最佳模型保存为runs/train/exp/weights/best.pt。在val集上用bash、python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt 来评估。脚本会输出精度、回忆、mAP等,比如0.5。确认mAP达到要求门槛(例如97.9%)。
验证推断:对样本图像进行推断以直观验证检测结果:bash、python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5。通过验证推理,可以获得每张图像的检测结果和模型的检测速度。
部署:为了在堆栈起重机系统上实时部署,将 PyTorch 模型(best.pt,约 4.7 MB)转换为类似 TensorRT 或 ONNX 的格式,以优化推理速度。最终输出是带有类别标签(品牌名)和置信度分数的边界框。
访问受限。请登录或开始试用以查看此内容。
实验环境与参数设置
验证模型性能的实验是在深度学习框架PyTorch上进行的,实验环境的详细信息列于 表1。这里,我们使用了一个特殊数据集,包含6,602张图像,随机分为训练、验证和测试集,比例为7:2:1。所有实验均使用分辨率为640 x 640的输入图像,初始学习率为0.01,并通过随机梯度下降(动量为0.937)进行优化以防止过拟合。在训练过程中,使用马赛克增强技术在每次迭代中处理四张图像,以丰富背景以利检测。所有模型均训练了100个纪元,批次大小为4,工作线程数设为0。
评估指标
多类别分类感兴趣的样本被指定为正类,而其他样本则为负类。真阳性(TP)表示正确预测为阳性的样本数量,假阳性(FP)表示被错误预测为阳性的样本,假阴性(FN)表示被错误预测为阴性的样本,而真阴性(TN)表示被正确预测为阴性的样本。在此基础上,可以推导出多种常用的评估指标,全面评估模型在物体检测任务中的表现。本文通过精度、召回率、平均精度(AP)、平均平均精度(mAP)和识别速度(FPS)...
访问受限。请登录或开始试用以查看此内容。
准确性与效率的权衡
该模型的核心成就之一是其在准确性与计算效率之间的卓越平衡。如 表2所示,所展示模型在单级探测器模型中参数数最少且FLOP数第二低的情况下,实现了最高的mAP。这直接转化为实际优势:更小的模型部署更快,内存需求更少,且在GPU和边缘硬件上推理延迟和功耗更低。这使得它非常适合在资源有限的平台上进行实时应用,比如堆垛起重机的车载计算机,因为计算预算非常紧张。
局限性
尽管性能强劲,增强型也存在若干局限性。其准确性取决于训练数据的代表性。在极端光照条件下(如强烈镜面反射)或烟盒遮挡超过70%时,性能可能会下降,这些场景在本数据集中被低估。探索并整合专门为重度遮蔽设计的先进技术,如相关稳健检测论文39中提出的,未来有望解决这一限制。此外,在高端GPU(NVIDIA 3080 Ti)上实现了38.5 FPS的实时性能;然而,其在其他嵌入式硬件(如N...
访问受限。请登录或开始试用以查看此内容。
作者声明没有直接的竞争性财务利益。这项研究与龙岩烟草工业有限公司合作进行,该厂聘用了作者邓和李文灿,以及宝吉香烟厂,作者罗宝斌也在该公司工作。这些隶属关系为本研究提供了应用场景和实地数据。学术作者(刘君、建光毅、杨凤、赵晓波)声明本研究发表无财务或非财务利益冲突。
该工作得到了浙江省自然科学基金会联合基金资助的基于前置反射镜和多波段铸坯温度测量法(编号LZY24E050002)和由曲州科技规划项目资助的非闭合非等温钢包腔在线温度场测量方法(编号2023K231)的资金支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 代码阅读器 | 海康威视 | ID5050 | 海康视视设备:用于读取托盘上的条码,需要连接24V电源 |
| 工业相机 | 海康威视 | MV-CA013-A0GM,MV-CS016-10GM | 需要连接24V电源 |
| LED灯 | HIKROBOT | MV-LLDS-1002-38-W | 一米长的灯带光源为相机提供了足够的照明条件 |
| 透镜 | 海康威视 | MVL-HF0828M-6MPE | 焦距:8毫米,光圈范围:F2.8~F16,像素:600万 |
| MVS | 海康威视 | V4.5.1 | 海康视视软件:用于调试摄像头、设置摄像头参数和数据收集 |
| 派查姆 | 喷气脑 | 2020.1.3 x64 | 用于训练深度学习模型和开发检测系统 |
| 多个金属支架 | 龙岩烟草工业有限公司 | 7075-T6 铝合金 | 用于安装摄像头和密码读取器 |
| 多条网络电缆 | 龙岩烟草工业有限公司 | RJ45水晶头 | 将基站连接在工业电脑和无线接入点之间,连接摄像头和交换机,等等 |
| 斯维斯 | TP-Link | TL-SH1005 | 有8种以太网线接口需要220V电源 |
| 视觉大师 | 海康威视 | V4.3.0 | Hikvision软件:用于模板匹配和图像结果检测 |
| 无线接入点设备 | 山东华创勋联 | BH-ANT5158S-14HV,BH-MS-AC1600HWH | 由于堆叠起重机需要大规模移动,网络电缆无法将摄像机连接到工业计算机,因此需要无线接入点设备以确保摄像网络的顺畅运行 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可