需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

基于改进YOLOv11的输电线路个人防护装备检测算法研究

367 次观看

DOI:

10.3791/69489

2025年12月30日

本文内容

摘要

本实验方案的目的是提供一种基于改进YOLOv11n模型的个人防护装备(PPE)检测方法的分步操作指南。文中详细介绍了模型结构与训练过程的优化策略,最终构建出一种轻量化、可实时检测的模型,其检测精度达到90.1% mAP的先进水平,并具备内在的可解释性。

摘要

在智能输电线路巡检中,边缘计算设备在复杂运行场景下进行个人防护装备识别时,面临着实时性与检测精度之间平衡的关键挑战。本研究提出了一种轻量化且具有内在可解释性的检测算法WTLS-YOLOv11n。该方法将三项协同创新集成至YOLOv11n架构中:采用离散小波变换的C3K2-WTConv模块将特征分解为具有物理意义的频率分量,从而实现具有内在可解释性的鲁棒多尺度特征提取;轻量化共享复合检测头通过策略性权重共享显著减少参数量,同时保留多尺度融合能力;MPDIoU损失函数提升了对小目标及不规则形状目标的定位精度。实验验证表明,与基线模型相比,所提出的模型在边缘硬件平台上显著降低了参数量与计算复杂度,同时实现了更高的检测精度,并保持了实时推理性能。定量可解释性分析揭示,检测决策主要由低频结构特征驱动,而非高频纹理细节,从而为模型的推理过程提供了透明的洞察。与主流检测模型的对比实验验证了所提方法在精度与效率之间的优越权衡。本研究为电力作业中的自动化安全监管提供了一种透明、高效且可信的解决方案,亦可广泛适用于需边缘部署与可解释决策的安全关键型检测任务。

引言

深度学习已经改变了工业安全规程,并为职业风险管理引入了新的方法。这种变革在电力系统工程等高风险领域尤为显著。基于视觉的智能监控系统如今利用YOLO(You Only Look Once)1架构,实现对个人防护装备(PPE)2,3的实时自动化检测。这些系统已成为工作场所安全监控的关键技术,与传统方法相比,在检测精度和响应速度方面均有显著提升。

这些系统可持续监控安全标准的执行情况,减少人为错误,并加强复杂电力作业现场的监管。然而,支撑这些系统的深度神经网络存在一个重大挑战:其决策过程仍然不透明。这种缺乏可解释性的问题是阻碍该技术在工业领域更广泛应用的主要障碍,尤其是在安全至关重要的应用中,理解系统的推理过程对于建立信任和确保责任追溯至关重要。

当模型做出错误判断,遗漏了不合规的工作人员或触发了不必要的操作停机时,其不透明的决策过程无法为安全管理人员提供可操作的信息。由于无法诊断错误、理解系统推理过程或验证决策结果,这些系统无法满足涉及人身安全的环境中所要求的可靠性标准。这一缺陷促使人们对可解释人工智能(Explainable Artificial Intelligence, XAI)4,5,6 方法的需求不断增长,这类方法旨在同时实现准确性与透明性。其目标是开发出安全人员能够在关键操作环境中理解、验证并信任的系统。

透明度仍然至关重要,但必须建立在能够在严苛运行条件下可靠运行的模型基础之上。电力作业现场具有独特的技术要求,需要强大的检测能力。这些环境中的光照条件变化剧烈,从强烈日光到完全黑暗均可能出现。复杂的机械设备经常遮挡视野,造成遮挡难题,而标准检测模型难以应对这类问题。天气状况进一步增加了不确定性,影响不同运行场景下的可见度和图像质量。应对这些挑战需要能够在如此复杂的环境条件下保持稳定性能的模型。

研究人员已采用多种方法来优化YOLO在电力站点应用中的性能。架构改进是其中一个重要的研究方向。多项研究通过在颈部结构中引入额外的检测头来增强YOLOv57网络。这一改进旨在应对个人防护装备(PPE)检测中的一个长期挑战:在远距离或视觉环境杂乱的情况下难以识别小目标物体。增加的检测层使模型能够捕捉到标准架构可能忽略的更精细的空间细节。

另一个主要的研究方向是针对部署环境的模型优化。电力作业现场通常要求检测系统在计算资源有限的边缘设备上运行。这一限制推动了模型压缩和效率提升方面的研究工作。研究人员已开发出多种技术,在保持检测精度的同时减小模型尺寸并缩短推理时间,从而在处理能力受限的硬件上实现实时性能8,9

近期的优化工作引入了多种有前景的技术以降低模型复杂度。研究人员已将MobileNetv310等高效主干网络集成到YOLO-M11等架构中。其他研究则应用模型剪枝和知识蒸馏技术,开发出Light-YOLOv412等紧凑型变体。这些方法在计算效率和部署可行性方面均表现出显著提升。

然而,这些优化方法面临着传统卷积架构固有的一种基本限制。标准卷积操作需要不断加深网络层数或增大卷积核尺寸13,以扩展感受野,而这是捕获图像中上下文信息所必需的。这种架构需求导致了一个不可避免的权衡。随着模型获取提取更丰富特征和理解更广泛空间上下文的能力,其参数数量和计算需求也会显著增加。由此产生的模型通常超出边缘设备的处理能力,限制了其在实时运行环境中的实际部署。

特征提取能力与计算效率之间的这种矛盾,是当前方法尚未完全解决的一个重要方法论挑战。该领域需要一种从根本上不同的特征提取方法,能够在不增加传统方法所导致的参数量的前提下,捕捉到分层的多尺度特征。这种方法将使模型既能保持安全关键应用所需的检测性能,又能满足边缘部署所需的效率。解决这一差距是推动电力作业环境中实用型个人防护装备(PPE)检测系统发展的关键研究优先事项。

目前,目标检测的可解释性方法主要采用事后分析方法14,例如 Grad-CAM。尽管这些方法能够提供有用的可视化结果,但它们独立于模型的学习过程运行。另一种方法是设计具有透明操作机制的架构组件。我们基于小波的特征提取方法为理解哪些频率成分有助于检测结果提供了一种直接的途径,但尚需进一步研究以全面量化这种可解释性。

本研究针对个人防护装备(PPE)检测系统中的三个相互关联的挑战:检测准确性、计算效率和模型可解释性,通过对YOLOv11n15架构进行三项有针对性的设计改进来开展工作。

首个改进引入了C3K2-WTConv模块,该模块采用受小波变换启发的特征提取过程,替代了标准卷积。该方法将视觉信息分解为不同频率成分:低频信号包含形状和轮廓信息,而高频信号则编码纹理和边缘细节。这种分离机制提升了特征质量,并使特征提取过程相较于传统卷积操作更具透明性。

第二种改进采用了轻量级共享复合检测头(Lightweight Shared Composite Detection Head, LSCD),以降低计算需求。该组件在不同检测尺度之间共享参数,从而减小模型规模,同时保持多尺度检测能力。该设计旨在应对电力作业现场所用边缘设备典型的资源限制。

第三项改进是将标准损失函数替换为MPDIoU损失16,以提高边界框的准确性。该改进通过在训练过程中提供更优的梯度稳定性,解决了与尺寸较小且形状多变的个人防护装备(PPE)物品相关的定位难题。

测试结果表明,改进后的模型在平均精度均值上比基线模型高出3.8%,同时参数量减少了11.5%。这些结果表明,该方法在提升检测性能的同时,满足了边缘部署的实际需求。本研究为电力作业中的安全监测提供了一种可行的解决方案,但仍需在多种运行条件下进一步验证,以全面评估系统的可靠性。

访问受限。请登录或开始试用以查看此内容。

方案

本研究的图像数据在获得必要许可的电力作业环境中采集。所有图像均已匿名化处理,不保留任何个人身份信息。本研究重点在于检测个人防护装备,而非识别个体身份。由于该研究仅涉及使用匿名化数据进行算法开发,因此无需伦理审批。

以下方案详细介绍了为个人防护装备(PPE)检测设计、训练和评估一种轻量级、高性能且具有内在可解释性的目标检测模型 WTLS-YOLOv11n 的完整流程。本研究中使用的软件列于材料表中。

整体架构框架

所提出的 WTLS-YOLOv11n 模型基于 YOLOv11n 基线构建。其核心方法是系统性地替换或增强主干网络和检测头中的关键模块,以提升模型性能、效率及可解释性。

所提出的 WTLS-YOLOv11n 模型基于 YOLOv11n 基线构建。其核心方法是系统性地替换或增强主干网络和检测头中的关键模块,以提升模型的性能、效率和可解释性。YOLOv11n 的整体架构范式包含主干网络、颈部和检测头,该范式在所提出的模型中得以保留。在主干网络中,特定的 C3K2 模块被替换为所提出的 C3K2-WTConv 模块,以增强特征提取能力。在检测头部分,原始检测头被替换为所提出的轻量化共享复合检测头(Lightweight Shared Composite Detection Head, LSCD),以降低模型复杂度。所提出的 WTLS-YOLOv11n 模型的完整架构与基线模型的对比详见图1

C3K2-WTConv 模块设计

该模块旨在替换 YOLOv11n 主干网络中的标准卷积模块。其设计遵循两个主要目标:(a)在不显著增加参数量和计算复杂度的前提下,高效扩展模型的感受野,以捕获多尺度上下文信息;(b)通过将特征图显式地分解到频域,学习更具鲁棒性且本质可解释的特征表示。

核心 WTConv 层的设计

基础的 WTConv(小波变换卷积)层旨在实现二维离散哈尔小波变换。该过程通过一组特定的小波核来完成:

小波核:该变换的实现方式 通过 四个固定的、非可训练的深度卷积核(F_LL、F_LH、F_HL、F_HH),分别对应哈尔小波基函数。这些卷积核负责将输入特征图分解为其低频和高频分量。

分解与下采样:这些卷积核以步长为2的方式作用于输入特征图(X)。该单一操作可高效地同时实现特征分解和空间下采样,将输入分解为四个不同的子带。

输出组分的物理意义

小波分解生成的四个特征子带具有明确的物理意义。如图2所示,WTConv层将输入递归分解为以下组成部分:

低频分量(LL):该分量以一半的空间分辨率保留目标的整体结构、轮廓及其他全局信息,作为模型理解目标“形状”的基础。

高频分量(LH、HL、HH):这三个分量分别捕捉水平、垂直和对角线方向的边缘及纹理等精细细节。它们使模型能够关注目标的“细节”部分。

整合至 C3K2 模块结构

设计的 WTConv 层被无缝集成到 YOLOv11n 的 C3K2 瓶颈结构中。

替换策略:在原始的 C3K2 模块中,标准的 3×3 卷积层被替换为 WTConv 层。该方法在保留 C3K2 架构高效特征重用机制的同时,引入了小波变换的优势,从而得到最终的 C3K2-WTConv 模块(详细结构见图3)。

级联感受野扩展:WTConv 过程可递归地应用于前一级的低频(LL)输出。这种级联分解机制使模型能够在计算开销极小的情况下,分析感受野呈指数级增长的特征,从而构建高效的多尺度频率分解通路。

轻量级共享复合检测头(LSCD)设计

该模块旨在替换原始的 YOLOv11n 检测头,主要目标是大幅降低模型复杂度和计算开销,以实现高效部署于资源受限的边缘设备。该设计解决了标准多尺度检测头中存在的显著参数冗余问题(详细结构见图4)。

基本原理与设计目标

原始YOLOv11头部中针对每个特征尺度(P3-P5)的独立预测分支导致参数量较高。LSCD引入了一种混合参数共享策略,在保持关键的多尺度特征融合能力的同时,实现了更优的参数效率。

参数共享与特征融合机制

LSCD 的核心在于其两阶段特征处理流程:

尺度特定的预处理:对于来自颈部网络的每个输入特征图(P3、P4、P5),分别应用一个不共享的1×1卷积,后接一个组归一化(GN)层。该初始步骤使网络能够学习针对不同尺度的通道变换,确保在特征融合之前保留各个特征层级的独特属性。

高效的跨尺度融合:预处理之后,采用一系列共享的 3×3 卷积-组归一化(Convolution-GN)模块,执行不同尺度间的核心特征融合。通过权重共享,这些模块学习到一种通用的特征融合模式,从而显著减少模型参数。该设计促使模型学习到更加鲁棒且通用的融合表征。

动态尺度自适应与分支优化

为了弥补权重共享可能导致的信息损失,并提高预测准确性,引入了两种额外的机制:

可学习缩放层:为每个检测尺度添加一个可学习的缩放层。该层引入了一个针对每个尺度的可学习标量,用于动态重新加权融合后的特征,使模型能够根据该尺度上占主导地位的目标物体尺寸自适应地增强或抑制相应特征。

优化的分类分支:通过使用 Softmax 激活函数进行概率分布,并引入群组归一化(Group Normalization, GN)层来增强分类分支。该方法可稳定分类任务的训练过程,并提升置信度预测的鲁棒性,这一技术在 FCOS 等网络架构中已被证明有效。

改进的损失函数设计(MPDIoU)

损失函数经过重新设计,专门针对个人防护装备检测场景中常见的小尺寸、杂乱且形状不规则目标的精确边界框回归挑战。

传统 IoU 损失的动机与局限性

基于标准 IoU 的损失函数在此背景下存在若干关键缺陷:

梯度消失:当预测框与真实框无重叠时,交并比(IoU)为零,损失函数的梯度随之消失,导致学习过程停滞。

对对齐不敏感:多种边界框配置可能产生相同的交并比(IoU)分数,导致损失函数对对齐质量不敏感(例如,中心点偏移与形状不匹配)。

对小目标检测性能较差:对于小目标而言,即使微小的像素偏差也可能具有显著影响,但这类偏差通常只会导致交并比(IoU)值发生微乎其微的变化,从而造成定位不准确。

采用最小点距离交并比(MPDIoU)损失函数

为了克服上述局限性,该方案将标准损失函数替换为最小点距离交并比(Minimum Point Distance IoU, MPDIoU)损失函数。MPDIoU 在标准 IoU 指标的基础上引入了一个惩罚项,能够直接对预测框与真实框之间的距离进行惩罚,即使二者没有重叠区域。

核心机制:惩罚项来源于预测框(pred)与真实框(gt)对应角点之间的欧氏距离。具体而言,计算左上角顶点的平方距离(运动学公式 d<sub>1</sub><sup>2</sup>,矢量运动,物理示意图,用于教学。)和右下角顶点的平方距离(静力学平衡公式,方程中的 d²₂ 符号,对力学分析至关重要。):

欧几里得距离公式 \(d^2_1=(x^{\text{pred}}_1-x^{\text{gt}}_1)^2+(y^{\text{pred}}_1-y^{\text{gt}}_1)^2\)。   (1)
用于数据分析的欧几里得距离公式 d²=(x²pred-x²gt)²+(y²pred-y²gt)²。   (2)

为确保该损失具有尺度不变性,需将此距离除以覆盖预测框与真实框的最小外接矩形的尺寸进行归一化。设wh分别为该外接矩形的宽度和高度。则MPDIoU度量定义如下:

MPDIoU 的数学公式,展示结合距离和维度的 IoU 调整。   (3)

最后,MPDIoU 损失函数(LMPDIoU)定义如下:

LMPDIoU = 1 - MPDIoU (4)

主要优势:该几何惩罚项通过以下方式直接解决了上述问题:i) 即使边界框不重叠时也能提供有意义的非零梯度,从而防止梯度消失,确保模型持续优化;ii) 对位置、尺寸和长宽比的偏差具有更高的敏感性,这对于精确定位尺寸较小且种类多样的个人防护装备(PPE)物品至关重要;iii) 在整个训练过程中提供更稳定和一致的梯度信号,有助于加快收敛速度,并实现更优的定位精度。

数据集与实验设置

自建个人防护装备检测数据集

我们建立了一个包含5,000张高压输电线路作业场景高分辨率图像的个人防护装备(PPE)检测数据集,使用LabelImg进行标注,并转换为YOLO TXT格式。该数据集包含五个类别:安全帽(1,245个实例)、安全带(1,128个实例)、臂章(892个实例)、高空作业状态(1,056个实例)和地面作业状态(1,124个实例)。数据划分为训练集(4,000张图像)、验证集(500张图像)和测试集(500张图像)。图像包含多种复杂条件,如极端光照、严重遮挡(23%的样本遮挡面积>50%)以及复杂的工业背景。训练过程中应用了标准的数据增强技术,包括随机翻转、旋转、颜色抖动和马赛克增强。

用于泛化测试的 PASCAL VOC 数据集

为了评估模型在电力作业场景之外的泛化能力,我们使用了PASCAL VOC数据集,该数据集结合了VOC2007和VOC2012,共包含21,503张图像。按照标准做法,我们使用VOC2012中的11,540张图像进行训练和验证,使用VOC2007中的9,963张图像进行测试。VOC数据集包含20个物体类别,涵盖多种真实世界场景。尽管其中的具体物体类别与我们的个人防护装备(PPE)类别不同,但检测挑战(如尺度变化、遮挡、复杂背景)具有相似性,因此该数据集适用于评估模型的通用检测能力及可迁移性。

实施细节

本方案概述了模型训练与评估的流程。假设用户已获取源代码、合适的 Python 环境以及准备好的数据集。

系统与环境准备

使用配备至少 24 GB 显存的 NVIDIA GPU 的工作站,以确保训练过程中有足够的内存(例如 NVIDIA GeForce RTX 4090)。在工作站上安装了 PyTorch 深度学习框架(版本 1.12.0 或更高)及其对应的 CUDA 工具包。通过打开终端并执行命令“python -c 'import torch; print(torch.cuda.is_available())'”来验证安装,预期返回结果为“True”。通过进入项目根目录并执行命令“pip install -r requirements.txt”来安装所需的 Python 软件包。该命令将自动安装包括 numpy、opencv-python、pyyaml、tensorboard 和 torchvision 在内的依赖项。数据集准备已进行验证,确保训练图像位于 /data/train/images/ 目录下,标注文件以 YOLO 格式(class x_center y_center width height)存放在 /data/train/labels/ 目录中。验证过程同样适用于验证集(/data/val/)和测试集(/data/test/)。

训练配置

使用文本编辑器打开配置文件 config/wtls_yolov11n.yaml 以设置训练参数。通过定位“path”参数并将其设置为数据集根目录来配置数据路径,同时验证“train”、“val”和“test”参数是否指向正确的子目录。确认“nc”参数(类别数量)与数据集匹配,针对个人防护装备(PPE)检测设置为5。训练超参数配置为:训练轮数(epochs)设为300以完成完整训练,批量大小(batch size)设为16,可根据GPU内存情况调整该值,若出现内存不足错误可降低至8。输入图像尺寸(imgsz)设为640,优化器确认使用SGD,初始学习率(lr0)为0.01。权重衰减(weight decay)确认为0.0005,动量(momentum)设为0.937。启用数据增强技术,采用默认配置设置,包括马赛克增强(mosaic: 1.0)、50%概率的随机水平翻转,以及颜色抖动,其参数为 hsvh: 0.015,hsvs: 0.7,hsv: 0.4。硬件使用参数配置为:数据加载时使用的CPU线程数(workers)设为8,设备参数(device)设为0以使用第一块GPU,如有需要也可设为“0,1”以启用多GPU训练。

模型训练执行

通过命令行执行命令“python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml”来初始化模型训练,其中--cfg参数指定模型配置文件,--weights参数设置为空字符串以从零开始训练(也可使用yolov11n.pt进行迁移学习),--data参数指定数据集配置文件。训练过程中观察收敛指标以跟踪模型性能。在前50个训练周期中,损失迅速下降,边界框损失(box_loss)从约1.5降至0.8。在第50至150个周期期间,性能稳步提升,box_loss从约0.8降至0.5。在第150至300个周期期间,进入微调阶段,box_loss稳定在0.4至0.5之间。验证集上的mAP@0.5指标预计在第200个周期时超过85%。通过检查确认模型自动每10个周期在目录runs/train/exp/weights/下保存一次检查点。确认存在last.pt(最近一次检查点)和best.pt(mAP最高的检查点),每个检查点文件大小约为5至6 MB。可选择使用TensorBoard监控训练进度:打开新终端并执行命令“tensorboard --logdir runs/train”,然后在浏览器中访问http://localhost:6006,以查看损失曲线、学习率调度和mAP趋势的实时图表。通过故障排除流程解决常见问题:显存不足(CUDA out of memory)错误可通过将批量大小减小至8或4来解决;出现NaN损失值时,应将学习率降低至0.005;当mAP停滞在80%以下时,应检查标注的正确性,并将训练周期增加至400。

模型评估方案

为了全面验证所提出模型的有效性、效率和可解释性,开展了一项多方面的评估程序。

定量性能评估

性能指标

使用交并比阈值为0.5时的平均精度均值(mAP@0.5)、精确率(Precision)和召回率(Recall)评估模型准确性。通过测量参数总量(M)和浮点运算次数(FLOPs,G)评估模型效率。在服务器级GPU和边缘设备上以每秒帧数(FPS)衡量推理速度。在边缘设备测试时,将功耗模式设置为最高性能,并在记录500张测试图像的FPS之前,先使用100次虚拟推理对模型进行预热。

与最先进模型的对比:将所提出的 WTLS-YOLOv11n 模型与其直接基线模型(YOLOv11n)以及多种检测器进行基准比较,包括主流基于 CNN 的 YOLO 模型(YOLOv5n、YOLOv8n、YOLOv9s)、一种两阶段检测器(Faster R-CNN)和一种基于 Transformer 的检测器(RT-DETR)。所有模型均使用其推荐的默认超参数训练 300 个 epoch。在自建的 PPE 数据集和 PASCAL VOC 数据集上,记录每个模型在“性能指标”部分定义的全部指标。对于 VOC 的评估,按照标准协议,在 VOC2012 trainval 与 VOC2007 trainval 的合并集上进行训练,并在 VOC2007 test 集上进行测试。

消融实验:进行系统的消融研究,以解析所提出各组分的独立贡献。

组分有效性分析:从基准 YOLOv11n 模型出发,逐步引入 C3K2-WTConv 模块、LSCD 检测头和 MPDIoU 损失函数。对每种配置,使用相同的超参数(批量大小 16,学习率 0.01,SGD 优化器)重新训练模型 300 个周期。记录 mAP、精确率、召回率、参数量、FLOPs 和 FPS 的变化,以验证每个组分的有效性。计算各指标相对于基准模型的百分比提升。

位置分析:为确定 C3K2-WTConv 模块的最佳放置位置,将其集成到网络架构的不同部分。测试三种配置:(i)仅集成于主干网络,(ii)仅集成于颈部网络,(iii)同时在主干网络和颈部网络中进行完整集成。每种配置均训练 300 个轮次,并比较所得的 mAP@0.5 分数,以确定最有效的集成策略。选择最优配置用于所有后续实验。

定性性能评估

检测结果可视化:从测试集中选取12至15张具有挑战性的现实场景代表性图像,包括强逆光、严重目标遮挡、复杂背景以及非标准相机角度等情况。针对每个对比模型(基线模型、YOLOv5n、YOLOv8n、YOLOv9s 和 WTLS-YOLOv11n),在这些图像上运行推理,置信度阈值设为0.25,IoU阈值设为0.45。生成并将检测输出结果(包含类别标签和置信度分数的边界框)渲染至这些图像上。以网格形式排列可视化结果,其中行表示不同场景,列表示不同模型。

稳健性分析:通过视觉对比不同模型生成的检测输出结果。通过统计并标记漏检(漏掉的目标)、误检(错误的检测)以及重复检测(对单个目标产生多个检测框且预测之间的交并比 IoU > 0.7)的实例,评估所提出模型的稳健性和优越性。在可视化图中使用红色圆圈标出存在问题的检测结果。计算各模型在选定测试图像上的漏检率和误检数量。提取并比较各模型对真正例检测结果的平均置信度得分。

可解释性分析

为了验证C3K2-WTConv模块赋予模型的内在可解释性,对选定的输入图像执行了可视化流程。加载训练好的WTLS-YOLOv11n模型,并在主干网络第4层的C3K2-WTConv模块上注册前向钩子(forward hook)。对输入图像进行前向传播,捕获输出的特征张量。从形状为[batch, channels, height, width]的特征张量中,分离出对应不同频率成分的通道:前25%的通道被定义为低频(LL)成分,其余75%的通道被定义为高频(LH、HL、HH)成分。针对每种频率成分类型,计算该成分内所有通道的平均值,生成单通道的激活图。在需要时,对空间维度应用L2范数以增强显著激活区域的表现。将激活图归一化至[0, 1]范围,并应用伪彩色映射(例如“jet” colormap)。使用双线性插值将热图调整至与原始输入图像相同的分辨率。将低频热图和高频热图以40%透明度叠加到原始图像上,生成可解释的可视化结果,展示模型在结构特征与纹理特征上的关注区域。

为了严格验证检测决策是否依赖于频域特征,进行了定量分析。从测试集中选取了包含成功检测结果(置信度分数大于0.5)的200至300张图像的子集。确保该子集涵盖多样化的场景,以避免采样偏差。对子集中的每张图像执行前向传播,并提取主干网络第4层C3K2-WTConv模块的输出。将特征张量分离为低频成分(LL,前25%的通道)和高频成分(HF,剩余75%的通道)。对于每张图像,分别计算两个频率成分在空间维度(高度和宽度)上的平均绝对激活强度。LL强度定义为所有空间位置上LL特征绝对值的均值,HF强度定义为所有空间位置上HF特征绝对值的均值。同时记录这些数值以及该图像的最大检测置信度分数。基于所有图像收集的数据(LL_strength、HF_strength、confidence_score),计算皮尔逊相关系数。分别计算LL强度与置信度分数之间的相关性,以及HF强度与置信度分数之间的相关性。使用统计软件或Python的scipy.stats.pearsonr函数获得两个相关系数(r)及对应的p值。采用p值阈值0.05评估统计显著性,当p值小于0.05时,认为相关性具有统计学意义。通过比较相关系数的大小,确定哪种频率成分与检测置信度的关联更强。以下指标以结构化格式记录:LL相关系数(rLL)和p值(pLL)、HF相关系数(rHF)和p值(pHF)、平均激活强度(meanLL、meanHF)以及样本量(分析的图像数量)。预期结果为:与高频特征相比,低频特征与置信度分数呈现更强的正相关关系(rLL大于0.60,p小于0.001;rHF约为0.40至0.50,p小于0.01),表明检测决策主要由LL成分所捕获的结构信息驱动。

该定量分析建立了超越定性可视化的可解释性。相关性分析(展示统计关联)与频域可视化(显示空间注意力)相结合,提供了严格的实证证据,表明模型的决策过程确实如设计初衷所预期,依赖于低频结构特征。

预期结果:低频特征与置信度评分之间的正相关性应强于高频特征(rLL > 0.60,p < 0.001),而高频特征的相关性较弱(rHF≈ 0.40–0.50,p < 0.01),表明检测决策主要由LL分量中捕获的结构信息驱动。

这种定量分析建立了超越定性可视化的可解释性。相关性分析(展示统计关联)与频域可视化(显示空间注意力)相结合,为模型的决策过程真正依赖于设计所预期的低频结构特征提供了严谨的实证证据。

访问受限。请登录或开始试用以查看此内容。

结果

为评估所提出的 WTLS-YOLOv11n 模型的性能,我们在自建的 PPE 数据集和 PASCAL VOC 2007+2012 数据集上进行了实验。除非另有说明,所有指标均在相应的测试集上报告。

与现有最先进模型的比较

我们在三种架构范式下将 WTLS-YOLOv11n 与主流目标检测器进行了基准对比:基于 CNN 的 YOLO 模型(YOLOv5n、YOLOv8n、YOLOv9t、YOLOv11n)、两阶段检测器(Faster R-CNN)以及基于 Transformer 的检测器(RT-DETR,采用 ResNet-18 主干网络)。综合结果如表 1所示。

所提出的 WTLS-YOLOv11n 达到了 90.1% 的 mAP@0.5,优于所有对比模型。值得注意的是,其性能比 YOLOv11n 基线高出 3.8 个百分点,比当前主流 YOLO 变体 YOLOv8n 高出 2.6 个百分点。在 YOLO...

访问受限。请登录或开始试用以查看此内容。

讨论

实验结果表明,与 YOLOv11n 基线相比,WTLS-YOLOv11n 在参数减少 11.5% 的同时,实现了 90.1% 的 mAP。这种在精度和效率上的提升源于三个组件的协同整合:基于小波的特征提取、轻量化检测头设计以及改进的定位损失函数。

消融实验表明,C3K2-WTConv 模块带来的单独性能提升最大,使 mAP 从 86.3% 提高到 89.1%。这表明,频域特征分解通过将结构信息(低频)与纹理细节(高频)分离,在个人防护装备(PPE)检测中具有优势。这种分离可能有助于模型聚焦于物体的稳健特征,同时降低对背景复杂性和光照变化的敏感性,而这些因素通常会影响传统卷积操作的性能。

LSCD 组件通过跨尺度权重共享实现了高效的参数利用,将模型参数量减少至 230 万,同时保持了检测能力。参数量的减少与优化的架构相结合,在 NVIDIA Jetson NX 边缘设备上实现了 21.5 帧/秒的处理速度,为所测试模型中的最高水平17,

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

材料

本文使用的材料清单
姓名公司目录编号评论
CUDA ToolkitNVIDIA CorporationCUDA Toolkit 版本 11.7
深度学习框架PyTorch FoundationPyTorch 版本 1.12.0
图形处理器NVIDIA CorporationGeForce RTX 4090
NumPyNumPy 开发者团队NumPy
OpenCVOpenCV 团队opencv-python
操作系统Canonical Ltd.Ubuntu 22.04 LTS(或注明您的操作系统)
PythonPython 软件基金会Python 版本 3.8 或更高
TensorBoardTensorFlow 作者TensorBoard
TorchvisionPyTorch FoundationTorchvision

参考文献

  1. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit, , (2016).
  2. Liu, M., Li, Z., Li, Y., Liu, Y. A fast and accurate method of power line intelligent inspection based on edge computing. IEEE Trans Instrum Meas. 71, 1-12 (2022).
  3. Gallo, G., Di Rienzo, F., Garzelli, F., Ducange, P., Vallati, C. A smart system for personal protective equipment detection in industrial environments based on deep learning at the edge. IEEE Access. 10, 110862-111110 (2022).
  4. Selvaraju, R. R., et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128, 336-359 (2020).
  5. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf Appl Comput Vis (WACV, , (2018).
  6. Axiom-based grad-CAM: Towards accurate visualization and explanation of CNNs. Fu, R., et al. Proc Brit Mach Vis Conf, , (2020).
  7. Yipeng, L., Junwu, W. Personal protective equipment detection for construction workers: A novel dataset and enhanced YOLOv5 approach. IEEE Access. 12, 47338-47358 (2024).
  8. BN, R., Guru, R. Small object detection for indoor assistance to the blind using YOLO NAS small and super gradients. arXiv preprint. , (2024).
  9. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Liao, H. Y. M. Eur Conf Comput Vis, , Springer Nature. Switzerland, Cham. (2024).
  10. Searching for mobilenetv3. Howard, A., et al. Proc. IEEE/CVF Int Conf Comput Vis, , https://ieeexplore.ieee.org/document/9008835 (2019).
  11. Liu, B., et al. YOLO-M: An efficient YOLO variant with MobileOne backbone for real-time license plate detection. Proc Int Semin Artif Intell Netw Inf Technol (AINIT). , IEEE. (2024).
  12. Ma, X., et al. Light-YOLOv4: An edge-device oriented target detection method for remote sensing images. IEEE J Sel Top Appl Earth Obs Remote Sens. 14, 10808-10820 (2021).
  13. Scaling up your kernels to 31x31: Revisiting large kernel design in CNNs. Ding, X., Zhang, X., Han, J., Ding, G. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2022/papers/Ding_Scaling_Up_Your_Kernels_to_31x31_Revisiting_Large_Kernel_Design_CVPR_2022_paper.pdf (2022).
  14. Black-box explanation of object detectors via saliency maps. Petsiuk, V., Jain, R., Manjunatha, V. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , (2020).
  15. He, L., et al. Research and application of YOLOv11-based object segmentation in intelligent recognition at construction sites. Buildings. 14 (12), 3777(2024).
  16. Liu, Q., Lv, J., Zhang, C. MAE-YOLOv8-based small object detection of green crisp plum in real complex orchard environments. Comput Electron Agric. 226, 109458(2024).
  17. Fast r-cnn. Girshick, R. Proc IEEE Int Conf Comput Vis, , https://www.cv-foundation.org/openaccess/content_iccv_2015/papers/Girshick_Fast_R-CNN_ICCV_2015_paper.pdf (2015).
  18. Detrs beat yolos on real-time object detection. Zhao, Y., et al. Proc IEEE/CVF Conf Comput Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2024/papers/Zhao_DETRs_Beat_YOLOs_on_Real-time_Object_Detection_CVPR_2024_paper.pdf (2024).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

YOLOv11