本文提出了一种结合 You Only Look Once 第11版(YOLOv11)与卷积神经网络的生产线安全监控方法。该方法在图形处理器上实现了在交并比阈值为0.5时的平均精度均值(mAP@0.5)达到0.91,mAP@0.5:0.95为0.82,每秒处理120帧,性能优于所评估的基线模型。
本文提出了一种结合 You Only Look Once 第11版(YOLOv11)与卷积神经网络的生产线安全监控方法。该方法在图形处理器上实现了在交并比阈值为0.5时的平均精度均值(mAP@0.5)达到0.91,mAP@0.5:0.95为0.82,每秒处理120帧,性能优于所评估的基线模型。
随着工业4.0的深入推进,生产线的自动化与智能化水平显著提升,对监控系统的实时性、准确性与安全性提出了更高要求。传统的监控系统依赖人工巡检或基于简单阈值的判断,普遍存在响应速度慢、误报率高、智能化程度有限等问题。为此,本文提出一种融合You Only Look Once第11版(YOLOv11)与卷积神经网络(CNN)的生产线安全监控系统。首先对采集的图像进行预处理;随后利用YOLOv11实现对工人、设备及潜在危险源的实时识别;接着引入具有多尺度特征融合与注意力机制的改进型CNN网络,以增强对小目标及遮挡目标的特征提取能力;最后将检测结果与CNN增强的特征进行融合,以评估安全状态。实验采用自建的生产线安全数据集,使用带动量项(0.9)的随机梯度下降(SGD)优化器,初始学习率为0.01,权重衰减为0.0005,学习率采用余弦退火策略调整,批量大小为32,训练200个周期。以mAP@0.5和每秒帧数(FPS)作为评价指标,与基准算法进行对比。结果表明,所提出的系统在mAP@0.5上达到0.91,检测速度达120 FPS。在遮挡、光照变化等复杂条件下仍表现出良好的鲁棒性,验证了其在生产线安全监控中的有效性与实际应用潜力。
在现代工业生产中,安全是确保生产效率和人员福祉的基石。生产线环境通常涉及高速机械设备、复杂的工艺流程以及多任务协同作业。任何微小的潜在安全隐患都可能导致严重的生产事故,造成重大经济损失甚至人员伤亡。因此,建立一个高效、智能且实时的安全监控系统对于提升工业生产安全至关重要1,2。
传统的安全监控方法主要依赖人工视频监控和多种传感器(如红外、烟雾和振动传感器)3。人工监控不仅效率低下,而且由于监控人员容易疲劳,易出现漏检情况,无法实现持续、全面的覆盖。尽管传感器可在一定程度上提供预警功能,但其检测范围有限,且易受环境干扰,导致误报问题突出4。智能监控系统正逐渐成为研究热点。利用深度学习算法对视频流进行实时分析,可自动识别异常事件、不安全行为和潜在风险,从而显著提升监控系统的智能化水平4,5。
目标检测是智能监控中的一项核心技术。作为单阶段目标检测器的代表,YOLO(You Only Look Once)系列算法展现出显著优势。从 YOLOv1 到 YOLOv8,该系列算法持续发展,在网络结构、损失函数、训练方法等方面不断优化6,7。特别是 YOLOv11,在保持高帧率的同时实现了更高的检测精度,尤其在面对复杂背景和密集目标时表现突出8。
然而,尽管 YOLOv11 在通用目标检测任务中表现出色,但在特定的生产线安全监控场景中仍面临挑战9。例如,当工人被设备部分遮挡,或安全标识过小且颜色与背景相近时,YOLOv11 的检测精度可能会下降。这要求模型具备更强的特征提取和语义理解能力10。
卷积神经网络(CNN)在图像特征提取方面具有强大的能力11。通过设计更深、更复杂的网络结构,CNN能够学习到更丰富、更抽象的图像特征。将CNN与YOLOv11相结合,可利用YOLOv11的快速检测能力以及CNN的深度特征提取能力,从而构建一个更强大且更智能的安全监控系统。
基于此,本文提出了一种结合 YOLOv11 与 CNN 的生产线安全监控系统。本研究的创新之处包括:(1)提出一种 YOLOv11 与改进型 CNN 的深度融合架构;(2)引入多尺度特征融合与复合注意力机制,以增强对关键安全特征的识别能力;(3)在自建的复杂场景数据集上验证了该模型的性能优势。
YOLO 系列算法的发展
自 Redmon 等人于 2015 年首次提出以来12,You Only Look Once(YOLO)算法引起了广泛关注。与依赖区域建议的两阶段检测器不同,YOLO 将目标检测视为一个回归任务。通过直接预测图像中目标的类别和位置,YOLO 显著提升了检测速度,使其适用于实时应用13。
作为该系列中的开创性工作,YOLOv1 首次实现了端到端的目标检测14。YOLOv1 将输入图像划分为网格结构,每个网格单元通常以 S × S 的形式排列,负责检测位于其边界内的物体。
具体而言,YOLOv1 的输出是一个张量。在 S × S × (B × 5 + C) 中,每个边界框的预测包含 5 个元素:中心点坐标 (x,y)、宽度 w、高度 h 和置信度 c。该计算过程如公式 (1) 所示:
(1)
其中,Pr(对象) 表示网格中存在目标的概率, IOU 表示预测边界框与真实边界框之间交集与并集的比值。每个网格还预测一组类别概率, Pr 表示目标属于该类别的概率 i- 在存在目标的情况下进行分类。YOLOv1 的损失函数由三个主要部分组成:坐标预测损失、置信度估计损失和类别预测损失15.
YOLOv2 引入了批归一化、高分辨率分类器以及多尺度训练策略,这些方法提高了模型的稳定性和准确性16。YOLOv3 采用 Darknet-53 作为其骨干网络,并借鉴特征金字塔网络(FPN)的思想,以增强目标检测能力17。
YOLOv4 在 YOLOv3 的基础上进行了大量优化,引入了跨阶段部分网络(Cross Stage Partial Network, CSPNet)18、路径聚合网络(Path Aggregation Network, PANet)19 以及 Mosaic 数据增强等技术,进一步提升了模型性能。YOLOv5 在工程实现方面做出了重要贡献,提供了更易于使用且更高效的实现方式20。
近年来,YOLO 系列持续发展,相继推出了 YOLOv6、YOLOv7 和 YOLOv8 等版本。通过引入扩展高效层聚合网络(Extended Efficient Layer Aggregation Network, E-ELAN)结构和模型重参数化技术,YOLOv7 在速度和精度方面均实现了新的突破。这些改进不仅提升了特征学习的效率,还优化了网络的推理性能,使 YOLOv7 在多种实时目标检测任务中超越了此前的版本及许多主流检测器。YOLOv8 进一步优化了网络结构,采用无锚框(anchor-free)设计,简化了模型,并增强了其泛化能力21。
在先前版本优势的基础上,本研究采用的 YOLOv11 针对复杂工业场景进行了优化。其核心改进包括特征提取网络、更高效的特征融合模块以及更稳健的损失函数设计。这些改进使 YOLOv11 在应对生产环境中的遮挡、小目标和复杂背景时表现出更优的性能。YOLOv11 是由 Ultralytics 发布的 YOLO 系列的一个版本。相较于 YOLOv8,它改进了 C3K2 模块和特征融合路径,并引入了自适应锚框策略,从而在工业场景中提供更强的检测鲁棒性。
卷积神经网络(CNN)的基础与进展
卷积神经网络(CNN)是一种关键模型,对深度学习在计算机视觉领域的成功产生了深远影响。该模型通过卷积操作提取图像的局部特征,再通过池化操作降低特征维度,从而实现图像的层次化抽象22。
典型的卷积神经网络(CNN)由多个卷积层、池化层和全连接层组成。卷积层使用卷积核扫描输入图像,在局部区域上计算点积,并生成特征图。计算过程如公式(2)所示:
(2)
其中,x 为输入图像,wk 和 bk 分别为卷积核的权重和偏置,
表示输出特征图在位置 (i,j) 处的值。池化层通常采用最大池化(Max Pooling)或平均池化(Average Pooling)。全连接层负责提取特征并预测分类概率。
基于此,本文为 YOLOv11 设计了一种 CNN 特征增强模块,该模块由两个并行分支组成:一个多尺度卷积分支,采用 3 × 3 和 5 × 5 卷积核提取多尺度特征;以及一个注意力分支,依次连接通道注意力(Squeeze-and-Excitation)和空间注意力模块,以增强关键目标的判别性特征。两个分支的输出通过逐元素相加进行融合,对应的特征增强损失函数如公式 (3) 所示:
(3)
Lcoord 是边界框坐标回归损失;Lconf 是目标置信度损失;Lcls 是类别分类损失;Lfeat 是特征增强损失,用于约束CNN增强模块提取的小目标和遮挡目标的判别性特征;λcoord、λconf、λcls、λfeat 是对应损失项的权重系数。本任务中设置 λfeat = 0.05,其余权重根据检测任务需求进行平衡。
VGGNet23 和 ResNet24 等经典卷积神经网络(CNN)结构在图像分类任务中取得了巨大成功。在这些架构中,ResNet 有效缓解了深度网络训练中的梯度消失问题,从而促进了更深、更复杂网络结构的构建。
在目标检测任务中,卷积神经网络(CNN)通常被用作特征提取器(主干网络)。例如,YOLO 系列算法中的 Darknet、跨阶段部分 Darknet(CSPDarknet)等均基于 CNN25 构建。为了增强特征提取能力,研究人员提出了多种改进的 CNN 结构。例如,Inception 模块通过多尺度卷积核并行提取特征;DenseNet 通过密集连接增强特征重用;Squeeze-and-Excitation 网络则通过注意力机制自适应地调整特征通道的重要性26。
本研究中,我们设计了一种改进的卷积神经网络(CNN)模块,以增强 YOLOv11 的特征提取能力。该模块结合了多尺度特征融合与注意力机制,能够更有效地捕捉生产线场景中的关键安全信息。
深度学习在工业安全监控中的应用现状
深度学习在工业安全监控领域已得到广泛应用。基于卷积神经网络(CNN)的算法被用于判断工人是否正确佩戴安全帽、检测未经授权进入危险区域的行为,以及监测故障设备的状态27。
在行为识别方面,采用三维卷积神经网络(3D CNN)和循环神经网络来分析工人的操作行为,识别潜在的不安全动作。例如,通过分析工人的姿态序列,可判断其是否违反安全操作规程28。
YOLO 和 Faster R-CNN 广泛用于实时监控视频中人员与设备的检测。例如,已有文献提出了一种基于 YOLOv5 的实时安全帽检测系统,有效提升了建筑工地安全管理的智能化水平29。
尽管现有研究已取得一定进展,但仍存在若干挑战。首先,工业场景通常具有复杂的光照、遮挡和背景干扰,这对算法的鲁棒性提出了严格要求。其次,实时性是一项关键需求,算法必须在保持精度的同时实现高速推理。最后,现有研究主要集中在单任务检测,缺乏对多源信息融合与综合分析的探索30。
本研究提出的YOLOv11与CNN融合模型旨在通过增强特征提取与融合能力,解决上述挑战,实现对生产线安全风险的全面、实时监测。
YOLOv11 和 CNN 算法
系统整体架构
本文提出的生产线安全监控系统采用了一种结合 YOLOv11 与改进型 CNN 的混合架构,以实现高精度、高速的实时安全监测。如图1所示,该系统主要由输入预处理模块、YOLOv11 目标检测模块、CNN 特征增强模块以及融合决策模块组成。输入图像首先由预处理模块进行归一化和数据增强,以提升模型的泛化能力。随后,通过 CSPDarknet 主干网络提取特征,并利用空间金字塔池化-快速(SPPF)模块扩展感受野。在上采样后对多尺度特征进行融合,并依次对融合后的特征施加通道注意力和空间注意力机制,以进一步增强关键目标的判别性表征。CNN 特征增强模块插入于 YOLOv11 主干网络的 C3、C4 和 C5 层输出之后,分别接收尺寸为 80 × 80 × 256、40 × 40 × 512 和 20 × 20 × 1,024 的多尺度特征图。该模块可进一步增强对小目标和遮挡目标的特征提取能力。最后,融合决策模块将 YOLOv11 的检测结果与 CNN 增强后的特征相结合,并通过设计的损失函数进行联合优化,输出目标的精确位置、类别及置信度得分。
YOLOv11 检测框架
YOLOv11 引入了多项关键改进,充分发挥了 YOLO 系列单阶段检测框架的优势。其架构分为三个主要部分:骨干网络、特征融合网络和检测头。骨干网络采用增强型 CSPDarknet 结构。特征融合网络引入了跨阶段局部连接和深度可分离卷积,借鉴了特征金字塔网络和路径聚合网络的设计,以有效融合多尺度特征。
特征增强模块
特征增强模块旨在提高模型对关键安全特征的敏感性。该模块处理YOLOv11主干网络每一层生成的特征图,通过上采样和下采样操作融合不同尺度的信息。具体而言,多尺度分支用于捕捉空间尺度的多样性,而注意力分支则动态增强关键通道和位置响应。这两个分支并非独立运作,而是通过残差连接和特征重校准实现互补与融合。在每个尺度上,经增强模块处理后的特征图通过1×1卷积调整至与原始特征图相同的通道数,再通过逐元素相加的方式与原始YOLOv11特征图融合。融合后的特征图随后输入后续的特征金字塔网络(FPN)进行多尺度融合,从而形成层次化的安全特征表示。为确保模块间的无缝集成,采用端到端联合训练策略,损失函数由YOLOv11检测损失和CNN模块特征增强损失共同组成。

图 1.YOLOv11-CNN 算法。 特征增强模块旨在提高模型对关键安全特征的敏感性。该模块处理来自 YOLOv11 主干网络不同层的特征图,通过上采样和下采样操作融合多尺度特征,并引入通道注意力和空间注意力机制。为确保 YOLOv11 模块与 CNN 模块之间的无缝集成,采用联合训练策略。在训练过程中,对两个模块的参数进行端到端优化。损失函数结合了 YOLOv11 的检测损失与 CNN 模块的特征增强损失。请点击此处查看此图的放大版本。
为验证所提出的 YOLOv11 与 CNN 融合模型在生产线安全监控中的有效性,构建了一个涵盖多种安全隐患场景的数据集。该数据集包含 12,000 张生产线场景图像,按 7:1.5:1.5 的比例划分为训练集、验证集和测试集,并固定随机种子为 42。数据集覆盖多种工况,包括标准光照、低光照、部分遮挡、严重遮挡、运动模糊以及复杂背景。推理时的置信度阈值设为 0.5,非极大值抑制(NMS)阈值设为 0.45。所有实验均重复三次,结果以均值 ± 标准差形式报告。标注类别包括工人、安全帽、机械臂、危险区域、工具和车辆,采用 PASCAL Visual Object Classes(VOC)格式。交并比(IoU)阈值设为 0.5,标注一致性通过双人交叉验证确认。输入图像统一缩放至 640 × 640,并采用 Mosaic 数据增强。训练使用 SGD 优化器,初始学习率为 0.01,动量为 0.9,权重衰减为 0.0005,批量大小为 32。训练共进行 200 个轮次,采用余弦退火策略调整学习率。
为全面评估模型的有效性,采用了多种评价指标:平均精度均值(mAP)、每秒帧数(FPS)用于衡量图像帧处理速率、精确率用于评估正类预测的准确性、召回率用于衡量模型检测真正例的能力,以及曲线下面积(AUC)用于表示受试者工作特征曲线(ROC曲线)下的面积,从而反映模型的整体分类能力。计算公式如公式(4)、(5)、(6)、(7)、(8)、(9)、(10)、(11)所示:
(4)
(5)
(6)
召回率
(7)
(8)
(9)
(10)
(11)
此处,mAP@0.5 表示在 IoU 阈值为 0.5 时的平均精度均值;N 为类别数量;APi 表示第 i 个类别的平均精度;mAP@[0.5:0.95] 表示在 IoU 阈值从 0.5 到 0.95 范围内计算的平均 mAP。TP、FP、FN 和 TN 分别表示真正例、假正例、假反例和真反例的数量。F 为处理的总帧数,T 为总处理时间,TPR 为真正例率,FPR 为假正例率。
对于 YOLOv11 检测组件,损失函数如公式 (12) 所示:
(12)
其中,Lcoord 表示预测帧与真实帧之间的偏差,Lconf 衡量预测帧的置信度误差,Lclass 衡量类别预测误差,λcoord、λconf 和 λclass 为用于平衡相应损失的权重系数。
对表1中数据的分析表明,所提出的方法在mAP@0.5指标上达到0.91,在mAP@0.5:0.95指标上达到0.82,分别比YOLOv5提高了0.04和0.04。其F1分数为0.935,也高于对比模型。检测速度为120 FPS,是Faster R-CNN的4倍,略低于YOLOv10和YOLOv11。参数量为6.7M,仅比YOLOv11多1.5M,但在mAP@0.5上提升了0.03。与计算成本相近的EfficientDet相比,精度高出0.06,而参数量则低56%。数据表明,所引入的多尺度融合与注意力机制有效提升了小目标检测的准确性,在速度与精度之间实现了良好平衡。综上所述,本文提出的方法在检测精度与速度之间达到了平衡。其mAP@0.5比第二优模型高0.02,F1分数达到0.935,6.7M的参数量足以满足实际部署需求。多尺度融合与注意力机制增强了在复杂场景中对小目标和遮挡目标的识别能力。该模型在精度与效率之间实现了平衡,适用于工业安全监控等实时应用场景。值得注意的是,所有对比模型均采用官方预训练权重,输入分辨率统一为640 × 640,NMS阈值为0.45,置信度阈值为0.5。
| 方法 | mAP@0.5 | mAP@0.5:0.95 | F1分数 | FPS | 参数量 (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| OURS | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
表1:模型性能综合对比表。 数据分析表明,所提出的方法在mAP@0.5上达到0.91,在mAP@0.5:0.95上达到0.82,分别比YOLOv5提高了0.04和0.04。其F1分数为0.935,也高于所有对比模型。检测速度为120 FPS,是Faster R-CNN的4倍,但略低于YOLOv10和YOLOv11。参数量为6.7M,仅比YOLOv11多1.5M,且在mAP@0.5上提升了0.03。与计算成本相近的EfficientDet相比,精度高出0.06,而参数量减少56%。数据表明,所引入的多尺度融合与注意力机制有效提升了小目标检测的准确性,在速度与精度之间实现了良好平衡。综上所述,本文提出的方法在检测精度与速度之间达到了平衡。其mAP@0.5比第二优模型高0.02,F1分数达到0.935,6.7M的参数量足以满足实际部署需求。多尺度融合与注意力机制增强了在复杂场景中对小尺寸和遮挡目标的识别能力。该模型在精度与效率之间实现了均衡,适用于工业安全监控等实时应用场景。值得注意的是,所有对比模型均采用官方预训练权重,输入分辨率统一为640 × 640,NMS阈值统一为0.45,置信度阈值统一为0.5。
图2 对模型的误检类型进行了深入分析。YOLOv11 + CNN 的背景误检率最低(每10,000帧出现85次),大多数误检发生在相似物体(62次)和部分遮挡场景(48次)中。ROC曲线分析表明,在假阳性率(FPR)为0.1时,模型的真阳性率(TPR)达到0.9(AUC = 0.98),且曲线间最小的间距支持了检测置信度的高度可靠性。这些分析结果不仅验证了模型的性能,还为后续误检优化提供了明确的技术路径,特别是通过增强模型对相似物体的区分能力。

图2.错误分析。 对模型误检类型的分析。YOLOv11 + CNN 的背景误检率最低(每10,000帧出现85次),大多数误检集中在相似物体(62次)和部分遮挡场景(48次)。ROC曲线分析表明,在假阳性率(FPR)为0.1时,模型的真阳性率(TPR)达到0.9(AUC = 0.98),且曲线间距最窄,说明检测置信度具有较高可靠性。这些分析结果不仅验证了模型的性能,还为后续误检优化提供了明确的技术路径,特别是增强模型对相似物体的区分能力。请点击此处查看该图的放大版本。
图3比较了该模型在不同硬件平台上的性能表现。YOLOv11 + CNN在边缘张量处理单元(TPU)上实现了18 ms的超低延迟,波动仅为±2 ms,功耗控制在15 W。吞吐量测试表明,该模型在Jetson Xavier边缘计算设备上可达到70 FPS的处理速度,第99百分位延迟控制在50 ms以内。这些部署性能指标使其能够适应工业领域中各类计算平台的部署需求。误差分析进一步表明,该模型在资源受限的环境中仍能保持稳定的性能,展现出良好的工程适用性。

图3.部署性能。 模型在多种硬件平台上的性能对比。YOLOv11 + CNN 在 Edge TPU 上实现了 18 ms 的超低延迟(波动仅为 ±2 ms),功耗控制在 15 W。吞吐量测试表明,该模型在 Jetson Xavier 边缘计算设备上可达到 70 FPS 的处理速度,第99百分位延迟控制在 50 ms 以内。这些部署性能指标表明,该模型能够适应工业领域中各类计算平台的部署需求。误差分析进一步显示,该模型在资源受限的环境中仍能保持稳定的性能表现,展现出良好的工程适用性。请点击此处查看该图的放大版本。
图4比较了各模型在六个目标类别上的检测性能差异。YOLOv11 + CNN在安全帽识别任务中达到了0.96的准确率,比基准模型高出4个百分点。虚线图显示,该模型在各类别间的性能波动极小(±0.05),反映出其良好的泛化能力。以热图形式呈现的混淆矩阵显示,危险区域与机械臂之间存在15%的相互误检。这一发现为后续模型优化提供了明确方向。

图4.类别检测分析。 比较各模型在六个目标类别上的检测性能差异。YOLOv11 + CNN 在安全帽识别任务中达到了0.96的准确率,比基准模型高出4个百分点。虚线图显示,该模型在各类别间的性能波动极小(±0.05),反映出其良好的泛化能力。以热图形式呈现的混淆矩阵显示,危险区域与机械臂之间存在15%的相互误检。该发现为后续模型优化提供了明确方向。请点击此处查看该图的放大版本。
图5 提供了每个模型训练过程的全面记录。YOLOv11 + CNN 具有最快的收敛速度,在30个训练周期内损失即降至0.1,其验证集mAP曲线与训练集之间的差距始终小于1%。误差带分析显示,该模型最终的验证集mAP@0.5稳定在0.94 ± 0.01,性能波动范围仅为RetinaNet的三分之一。这些结果证明了联合训练协议的有效性。该模型在训练初期即表现出性能优势,表明其网络结构设计能够快速学习特征。

图5.训练过程分析。 各模型训练过程的记录。YOLOv11 + CNN 收敛速度最快(损失在30个训练周期内降至0.1),其验证集mAP曲线与训练集之间的差距始终小于1%。误差带图分析显示,该模型最终的验证mAP@0.5稳定在0.94 ± 0.01,性能波动范围仅为RetinaNet的三分之一。这些结果验证了联合训练策略的有效性。该模型在训练初期即表现出性能优势,表明其架构设计能够快速学习特征。请点击此处查看该图的放大版本。
表2展示了不同检测模型在复杂环境下的定量性能结果。在标准光照条件及多种极端场景下的测试数据表明,YOLOv11 + CNN 在所有条件下均保持最优性能。在标准光照条件下,该模型的 mAP@0.5 达到 0.91,显著优于 YOLOv5(0.87)和 Faster R-CNN(0.84)。随着环境条件恶化,各模型性能均出现不同程度下降,但 YOLOv11 + CNN 表现出最强的环境鲁棒性:在低光照条件(< 50 lux)下,其性能仅下降 3%(降至 0.88),优于对比模型 5% 的降幅;在严重遮挡场景(> 50%)中,其 mAP 仍可维持在 0.78,性能退化程度(13%)显著小于 YOLOv5(15%)和 Faster R-CNN(16%)。这些结果表明,YOLOv11 + CNN 通过改进的特征融合与注意力机制,增强了模型对光照变化、遮挡等复杂因素的适应能力,从而支持其在工业场景中的实际应用。
| 测试条件 | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | 性能波动 |
| 标准光照 | 0.91 | 0.87 | 0.84 | 0.01 |
| 低光照(< 50 lux) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| 部分遮挡(30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| 严重遮挡(> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| 运动模糊 | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
表2:环境适应性定量分析表。 通过定量分析不同检测模型在复杂环境中的表现。从标准光照条件到各种极端场景的测试数据显示,YOLOv11 + CNN 在所有测试条件下均保持最高性能。在标准光照条件下,该模型的 mAP@0.5 达到 0.91,显著优于 YOLOv5(0.87)和 Faster R-CNN(0.84)。随着环境条件恶化,各模型性能均出现不同程度下降,但 YOLOv11 + CNN 在所评估模型中表现出最强的环境鲁棒性:在低光照条件(< 50 lux)下,其性能仅下降 3%(降至 0.88),优于对比模型 5% 的降幅;在严重遮挡场景(> 50%)中,其 mAP 仍可维持在 0.78,性能退化(13%)显著小于 YOLOv5(15%)和 Faster R-CNN(16%)。这些结果表明,YOLOv11 + CNN 通过改进的特征融合机制与注意力设计,增强了模型对光照变化、遮挡干扰等复杂因素的适应能力,支持其在工业场景中的实际应用。
表3显示,本实验采用了SGD优化器,动量值设为0.9,以加速收敛并抑制振荡。初始学习率为0.01,并采用余弦退火策略,训练过程中逐渐衰减,以优化收敛效果。引入0.0005的权重衰减,以实现L2正则化并减少过拟合。批量大小设为32,在计算效率与梯度估计稳定性之间取得平衡。训练轮数设为200轮,以确保充分收敛。参数设置针对单阶段检测任务进行了调整,兼顾了训练速度与精度。
| 参数 | 数值 |
| 优化器 | SGD |
| 初始学习率 | 0.01 |
| 动量 | 0.9 |
| 权重衰减 | 0.0005 |
| 批量大小 | 32 |
| 训练轮数 | 200 |
| 学习率调度 | Cosine annealing |
表3:训练超参数表。 本实验使用SGD优化器,动量设置为0.9,以加速收敛并抑制振荡。初始学习率为0.01,并采用余弦退火策略,在训练过程中逐渐衰减,以优化收敛效果。引入0.0005的权重衰减,以实现L2正则化并减少过拟合。批量大小设为32,在计算效率与梯度估计稳定性之间取得平衡。训练轮数设为200轮,以确保充分收敛。这些参数针对单阶段检测任务进行调整,在训练速度与精度之间实现了平衡。
表4显示,以YOLOv11为基线时,mAP@0.5为0.89。单独引入多尺度融合使准确率下降至0.88。随后依次叠加通道注意力和空间注意力模块,准确率分别提升至0.90和0.89。所有模块组合后的综合准确率达到0.91,较基线提升0.02。数据表明,通道注意力可直接提升准确率,而多尺度融合与注意力机制联合使用时性能最优。
| 配置 | mAP@0.5 |
| YOLOv11(基线) | 0.89 |
| + 多尺度融合 | 0.88 |
| + 多尺度 + 通道注意力 | 0.9 |
| + 多尺度 + 空间注意力 | 0.89 |
| 完整模块(YOLOv11 + CNN) | 0.91 |
表4:消融实验表。 以YOLOv11为基线,mAP@0.5为0.89。单独引入多尺度融合使准确率降至0.88。在多尺度融合后分别添加通道注意力或空间注意力,准确率分别提升至0.90和0.89。所有模块组合后的准确率达到0.91,较基线提升0.02。数据表明,在此设置下通道注意力带来的增益优于空间注意力,且多尺度融合与注意力机制的联合性能最优。
图6系统评估了模型在极端环境下的性能表现。YOLOv11 + CNN在低光照条件下的mAP仅下降6%(降至0.88),在严重遮挡场景中仍保持0.78的mAP(比基准高8%)。这些结果表明,该模型具备环境适应能力,能够有效应对工业生产中常见的光照变化和局部遮挡问题,从而保障检测系统的稳定运行。

图6.环境适应性。 对模型在极端环境下的性能进行系统性评估。YOLOv11 + CNN 在低光照条件下 mAP 仅下降 6%(降至 0.88),在严重遮挡场景中仍保持 0.78 的 mAP(领先基准模型 8%)。这些结果表明,该模型具备良好的环境适应能力,能够有效应对工业生产中常见的光照变化和局部遮挡问题,从而保障检测系统的稳定运行。请点击此处查看该图的放大版本。
图7通过t-SNE降维方法比较了YOLOv11与YOLOv11 + CNN在六类工业目标上的特征分布差异。左侧图像显示,基础模型YOLOv11的特征存在显著的类内离散现象(类内距离为2.34 ± 0.15),特别是在“危险区域”(红色)和“车辆”(紫色)之间存在明显重叠,这与实验组3中15%的误检率结果一致。右侧图像表明,改进后的YOLOv11 + CNN通过特征增强模块显著提升了类内紧凑性,使各类别内聚类中心之间的平均距离增加了1.8倍。

图7.t-SNE 特征分布对比。 通过 t-SNE 降维方法对 YOLOv11 与 YOLOv11 + CNN 在六类工业目标上的特征分布差异进行比较。左侧图像显示,基础模型 YOLOv11 的特征表现出显著的类内离散(类内距离为 2.34 ± 0.15),特别是在“危险区域”(红色)和“车辆”(紫色)类别中存在大量重叠,这与实验组3中15%的误检率结果一致。右侧图像显示,改进后的 YOLOv11 + CNN 通过特征增强模块显著提升了类内紧凑性,各类别聚类中心之间的平均距离增加了1.8倍。请点击此处查看该图的高清版本。
图8通过系统的消融实验验证了每个模块的贡献。消融实验结果表明,在多尺度融合后加入通道注意力机制可将mAP@0.5提升至0.90,而加入空间注意力机制可将mAP@0.5提升至0.89。完整模块取得了最高的mAP@0.5,达到0.91。热力图可视化显示,复合注意力机制能够同时增强模型对危险区域中心(激活值:+0.15)和边缘小目标(+0.08)的检测响应。实验数据表明,多尺度特征融合与注意力机制具有累积效应,使模型能够满足不同尺度下的目标检测需求。

图8.模块化消融实验。 通过系统性消融实验验证各模块的贡献。消融结果表明,在多尺度融合后加入通道注意力机制可使mAP@0.5提升至0.90,而加入空间注意力机制可使mAP@0.5提升至0.89。完整模块组合取得了最高的mAP@0.5,达到0.91。热图可视化显示,复合注意力机制能够同时增强模型对危险区域中心(激活值:+0.15)和边缘小目标(+0.08)的检测响应。实验数据表明,多尺度特征融合与注意力机制具有累积效应,使模型能够满足跨尺度目标检测的需求。请点击此处查看该图的放大版本。
数据可用性:
完整的原始生产线图像和视频流受工业保密限制,不对外公开。补充数据集说明(补充文件1)提供了数据集采集细节、类别与场景分布、标注规范、质量控制流程、数据划分、预处理及数据增强方法。伪代码与可重复性框架(补充文件2)提供了伪代码级别的工作流程、配置说明以及复现指导。经机构和保密限制允许,非商业性学术研究者可向通讯作者申请获取匿名化子集及其他辅助材料。
补充文件1. 补充数据集说明。 本文件描述了数据集的采集协议、场景覆盖范围、类别分布、标注规范、质量控制流程、训练/验证/测试集划分、预处理及数据增强方法。请点击此处下载该文件。
补充文件 2. 伪代码与可重复性框架。 本文件提供了预处理、训练、评估和部署的伪代码级别工作流程与配置细节,并描述了对原始工业视频片段及支持材料访问的限制。请点击此处下载该文件。
实验结果表明,所提出的 YOLOv11–CNN 融合模型在生产线安全监控中提高了检测精度和实时性能。该系统利用 YOLOv11 高效的单阶段检测能力以及 CNN 模块的特征增强能力,在复杂光照和遮挡条件下成功识别了工人、设备和危险区域。通过多尺度特征融合和注意力机制,增强了对关键安全要素的关注能力,为预警提供了可解释的视觉依据。
该系统在汽车制造和电子装配等生产线上具有实际应用价值,其实时监测功能可减少对人工检查的依赖,并缩短对潜在安全隐患的响应时间。对于螺丝、工具等小型目标,以及被机械臂或其他设备部分遮挡的作业人员目标,多尺度特征融合与注意力机制能够提升模型提取和突出安全相关特征的能力。这些改进对于目标尺寸和可见性各异的生产环境具有重要意义。
然而,本研究仍存在明显的局限性。在严重遮挡或光照极低的情况下,由于目标特征信息变得不完整,现有卷积特征可能不足,导致模型性能下降。新增的卷积神经网络特征增强模块引入了150万额外参数,可能增加低成本边缘设备的计算负担,限制其在资源受限环境中的部署。本研究使用可见光图像数据,未融合多模态传感器信息(如红外热成像或毫米波雷达),因此在完全黑暗或烟雾等极端工业场景中,性能可能受限。
未来的研究将聚焦于以下方向:基于结构化剪枝和知识蒸馏的模型轻量化,以在保持检测性能的同时降低参数负担;构建可见光-红外多模态融合检测框架,以提升在极端光照与烟雾环境下的检测能力;引入轻量级 Transformer 模块以替代部分卷积层,增强长距离上下文特征提取能力;以及开发端到端的异常行为识别子系统,以支持从目标检测到行为早期预警的完整工作流程。
综上所述,本研究聚焦于一种融合 YOLOv11 与 CNN 算法的生产线安全监控系统,旨在实现对复杂工业环境中潜在安全隐患的实时检测与早期预警。通过实验验证,该融合模型在目标检测精度和推理速度方面均表现出性能优势。得益于高效的单阶段检测架构与优化的特征提取机制,YOLOv11 在快速识别工人、设备及危险区域方面表现良好,并能准确捕捉生产线场景中的关键安全要素。同时,引入改进的 CNN 模块进一步增强了对遮挡目标的特征提取与检测能力。在生产线安全监控中,该模型通过视觉分析自动聚焦于图像中的关键安全区域,为安全预警提供了可解释的依据。该融合模型在机加工、装配、仓储等多种生产线场景中均表现出较强的适应性与稳定性。本文的主要工作如下:
(1) 设计了一种 YOLOv11 与 CNN 的深度融合架构,以平衡检测速度与准确性。
(2) 构建了多尺度特征融合与注意力优化机制,以增强在复杂场景中对关键安全要素的关注能力。
(3) 在自建的生产线安全数据集上的实验表明,该模型的 mAP@0.5 达到 0.91,检测速度为 120 FPS。在跨场景测试中,模型表现出稳定的性能。
典型病例研究表明,在标准光照条件下,仅暴露40%的安全帽通过多尺度融合与通道注意力机制被准确检测(置信度0.93),而基线模型将其误识别为背景。在低光照场景中,当工人进入危险区域时,空间注意力成功通过方向线框定目标,而对比方法未能检测到该目标。失败案例包括在严重遮挡条件下,由于扳手纹理与背景高度相似而被误检为工具;以及在低光照条件下,远距离处安全帽因信噪比过低而被漏检,暴露出模型在极端条件下特征表征能力的局限性。这些结果表明,该模型在正常及中等复杂场景下具有鲁棒性,但在极端条件下仍需进一步改进。
作者声明无利益冲突。
本工作部分由台州学院高层次人才科研启动基金“智能制造中精密检测关键技术研究”(TZXY2020QDJJ006)资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| COCO API | N/A | 用于目标检测准确率评估与统计分析的评估工具。 | |
| CUDA 11.4 | NVIDIA | N/A | 与 PyTorch 1.12 框架配合使用的并行计算平台。 |
| Edge TPU | N/A | 用于延迟和功耗测试的部署平台;报告的延迟为 18 ms,功耗为 15 W。 | |
| Jetson Xavier 边缘计算设备 | NVIDIA | 用于吞吐量测试的边缘计算设备;报告的处理速度为 70 FPS,第99百分位延迟在 50 ms 以内。 | |
| NVIDIA Tesla V100 GPU | NVIDIA | 用于训练/评估服务器的 GPU。 | |
| PyTorch 1.12 | N/A | 用于模型训练与评估的深度学习框架。 | |
| scikit-learn | N/A | 用于模型评估的评估/统计分析工具。 | |
| 自建生产线安全数据集 | N/A | N/A | 包含 12,000 张生产线场景图像的数据集,采用 VOC 格式,涵盖标准光照、低光照、部分遮挡、严重遮挡、运动模糊及复杂背景;共六个标注类别:工人、安全帽、机械臂、危险区域、工具和车辆。 |
| 训练服务器 | 配备 NVIDIA Tesla V100 GPU 和 Ubuntu 20.04 操作系统的服务器。 | ||
| Ubuntu 20.04 操作系统 | N/A | 训练/评估服务器所使用的操作系统。 | |
| VOC 标注格式 | N/A | N/A | 用于自建生产线安全数据集的标注格式。 |
| YOLOv11 目标检测模型 | Ultralytics | N/A | 用于实时检测工人、设备及潜在危险的目标检测模型。 |