Method Article

基于局部特征的电动自行车复杂电梯场景改进的分块图像注释方法

DOI:

10.3791/69226

March 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

基于局部特征的分块图像注释方法,利用EBike-DET数据集和主流物体检测模型,提升复杂电梯场景中的电动自行车检测。

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

电动自行车(EBikes)在住宅电梯等密闭环境中的使用日益增加,带来了严重的安全隐患,并带来了自动化物体检测的重大挑战,尤其是由于频繁的遮挡问题。传统检测方法主要依赖整体注释,常常无法准确识别视觉复杂场景中部分遮挡的电子图标。为克服这些局限,本研究提出了一种基于局部特征的新颖分块注释方法,提供了更易解释的注释策略。通过将EBike分解为多个关键区域以便独立标记,该方法使检测模型能够学习细粒度结构信息,从而提升在遮挡重条件下的鲁棒性。此外,开发了一个专门数据集EBike-DET,用于支持真实电梯场景下的检测任务。该数据集采用分块方法注释,并辅以模拟环境条件,提升了模型性能和适应性。该方法通过使物体检测更加透明和结构可解释性,促进可解释人工智能(XAI)的发展,这在安全关键应用中尤为重要。采用三种主流模型(YOLOv5、YOLOv10和SSD)进行了大量实验。结果显示,YOLOv5在EBike-DET上带分块注释训练时,精度提升为3.7%,回忆提升5.3%,F1评分提升4.5%,mAP提升4.4%。与公开数据集相比,EBike-DET在遮蔽下表现出更高的稳定性和鲁棒性。这项研究不仅提升了检测准确性,也为在现实安全监测系统中部署的更具解释性和解释性的人工智能解决方案迈出了一步。

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着电动自行车(EBikes)在全球的快速普及,尤其是在中国,到2022年总数超过3.5亿辆,电动自行车已成为短途交通的主导方式。然而,它们在住宅电梯等狭小空间的频繁使用,带来了严重的安全风险,包括异常振动、设备损坏、异味和火灾隐患。一项最新研究估计,EBike相关的火灾事件发生概率约为1.44%。这些风险凸显了对高效且准确的EBike检测方法的紧迫需求,以提升电梯环境中的安全。

尽管计算机视觉和深度学习取得了进步,电梯中的电子电子检测仍然充满挑战。公开数据集稀缺,且EBike模型、颜色和遮蔽条件的多样性常常不足,限制了模型的泛化2.此外,电梯场景常涉及复杂的遮挡,电子键部分被乘客或结构部件遮挡,进一步降低了检测精度345。现有的整体注释方法将电子图标视为单一边界框,但在这种情况下常常失败,这表明需要改进注释和检测策略。如表1所示,整体注释导致性能显著下降,相较分块注释,交叉点与并集(IoU)阈值的平均精度降低最多21.5%,为0.5(mAP@0.5)。

基于深度学习的检测进展

深度学习方法,尤其是卷积神经网络(CNN),已被广泛应用于物体检测领域。你只看一次(YOLO)系列展现了强大的实时性能。然而,在检测遮挡或重叠物体时,YOLO模型往往会产生冗余的包围框。例如,YOLOv5通过深度卷积和特征金字塔网络6,7增强了多尺度特征提取,而YOLOv10则消除了非极大抑制,并采用路径聚合网络提升速度,并实现多尺度融合8,9。尽管有这些改进,冗余的边界盒和在遮挡重环境中稳健性下降的问题仍未解决。然而,当关键的电子比克结构部分被阻挡时,两者都会受到影响,因为整体注释提供的局部线索有限图1A-C所示,这一限制导致了冗余的边界盒和在中度或重度遮蔽下的检测置信度不稳定。相比之下,分块注释通过使模型能够检测独立区域(如轮子或后部区域)来缓解这一问题,从而减少在遮挡下重复的边界框。 1D-F进一步展示了分块注释能改善特征定位,并在仅部分EBike组件可见时保持检测稳定性。

同样,基于VGG-16骨干的单次多方检测器(SSD)型号10,11在不同尺度上高效检测,并在小物体12上表现良好。然而,SSD在特征连续性被严重遮挡破坏时也会遇到困难,导致检测遗漏或盒回归不稳定——即使引入了注意力机制13。分块注释在这里也有优势:模型仍可依赖剩余可见的局部部分,提高多尺度和遮蔽条件下的检测稳定性。

注释策略与局部特征学习

大多数当前检测方法采用整体注释,简化注释,但主要依赖全局特征14,15。当关键的EBike区域——如轮子、前部或后部区域——部分缺失时,这种方法会显得困难。一项最新研究16显示,局部特征学习将对象分割成多个注释部分,能够在具有挑战性的场景中提升鲁棒性和精确性。与此一致,表2的结果显示,当至少40%-60%的关键EBike组件仍可见时,分块注释依然有效,尤其是在标注车轮、前部和后部区域时。相比之下,在低遮挡场景(例如<20%遮挡)或图像分辨率为≥1280 x 720且保留完整轮廓的情况下,整体包围框仍然足够。当遮挡超过≈70%,或特征层面区域过小无法提供区分空间信息时,分块的益处会减弱。

使用哈里斯角检测的方法论依据

哈里斯角检测因其确定性行为、计算效率和无训练特性而被选用于局部特征提取,这些对于电梯环境中可靠的注释至关重要。与SuperPoint和LoFTR等可学关键点检测器不同,它避免了额外训练,并在有限的注释数据和重度遮蔽下减少了域位移。与 Canny 和 Sobel 等基于边的算符相比,哈里斯角强调几何意义的交汇,而非噪声背景边,从而实现了 EBike 结构(包括车轮和框架交点)的稳定定位。此外,哈里斯角检测还提供了可解释的超参数。经验常数 k 控制角灵敏度和稳定性。如第2.6.2.4节和 图2所示,调整 k 有助于在鲁棒性和过度检测之间实现受控平衡,这与提出的基于规则的分块注释策略非常契合。

数据增强以实现鲁棒性

数据增强已被证明有效提升检测模型的多样性和适应性。常用技术包括几何变换(如旋转、缩放、裁剪)和色彩调整(如灰度、亮度调整),这些都模拟了现实世界条件和光照变化 17,18,19。通过整合这些策略,检测模型对变异性更具韧性,更适合实际部署。

为解决上述局限性,本研究提出了基于局部特征改进的分块注释方法。该方法通过将电子数据划分为多个独立的注释部分,增强了特征学习和鲁棒性,从而在复杂遮蔽下实现更高效的检测。此外,还构建了专门针对电梯环境的电动自行车检测(EBike-DET)数据集,并通过多样化数据增强以提升模型适应性。最后,该方法在YOLOv5、YOLOv10和SSD上得到了验证,显示出持续的性能提升,分别为+5.69%至+39.81%的mAP,如 表3所示。 贡献可总结为:改进的分块注释方法,增强遮挡条件下特征学习;构建专用的电梯场景EBike-DET数据集;结合多种增强技术;并对主流检测模型进行实验验证,显示出比整体注释更优的精度和鲁棒性。

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究所用的EBike-DET数据集包括作者通过电梯、停车场和街道环境的现场摄影收集的图像,以及从网络平台获得的公开EBike图像。所有现场图像采集均在非私人环境中进行,仅用于与电子烟检测相关的安全技术研究。图像并非有意针对个人,任何偶然拍摄的人物因距离、遮挡、背向视角或适当处理去除面部特征及其他个人标识而无法识别。网络来源的图片仅来自允许学术研究重用的平台或以开放许可发布的资源。所有图片仅用于非商业研究和教育目的。由于未收集可识别的个人数据,且未与受试者有直接互动,本研究未根据作者的机构指南,无需获得机构伦理委员会的批准。

1. 数据集构建

  1. 图像分辨率、色彩空间与文件格式
    1. 将图像的原生分辨率设置为1280 x 720像素,以便在不同场景中捕捉电子版画的高质量细节。
    2. 标准化后,将图像调整为640 x 480像素,以平衡计算效率和特征保留。
    3. 将色彩空间设置为RGB,以保留完整的色彩信息,确保在不同光照条件下准确识别特征。
    4. 将图片保存为JPEG格式,以优化存储空间,同时不显著影响画质。
  2. 定义和拆分训练、验证和测试数据集
    1. 将数据集按7:2:1的比例分为训练集、验证集和测试集,确保数据集在模型训练、超参数调优和性能评估中得到适当分配。
    2. 将随机种子设置为42,以确保数据在不同实验间的可重复性。
    3. 应用分层抽样,保持每个数据集分割中EBike模型和遮蔽水平的一致分布,确保集合间无类别不平衡。
    4. 确保训练、验证和测试集之间没有泄漏,确保没有 EBike 图像出现在多个数据集中。
  3. 公共数据集构建
    1. 选择开源平台20,21,22,23的公开EBike检测数据集,该数据集包含210张全景和部分遮挡场景中的EBike图像。
    2. 要认识到公共数据集的局限性,包括单摄像机角度、低分辨率和简单的背景场景,这些可能限制模型的泛化能力,尤其是在复杂的遮挡场景下。
  4. EBike-DET数据集构建
    1. 构建EBike-DET数据集,以增强场景覆盖和样本多样性,包含来自网络平台和现场摄影的1680张高质量图像。
    2. 确保包含多样的环境,如电梯、停车场和街道,捕捉电子秀可能处境的各种环境。
    3. 采用多种摄像机角度(正面、侧面和顶视角),捕捉EBike的全方位外观,确保对检测模型的训练扎实。
    4. 通过包含多个EBike品牌和型号,颜色、尺寸和配件有差异,丰富数据集,以增加样本多样性。
    5. 确保包含遮挡场景,即行人和车辆部分遮挡电子点,模拟电梯等狭小空间中的真实环境。
    6. 确认EBike-DET数据集包含多样且复杂的样本,使其成为复杂闭塞条件下目标检测的可靠数据集。
  5. 网页和网站图片的包含与排除规则
    1. 网络图片:仅包含公开可得、在多样环境中拍摄、高分辨率且光照条件多样的图片。排除低分辨率或简单背景的图片。
    2. 现场图片:包括在真实环境中拍摄的图片,特别是电梯、停车场或街道等地点。确保图像呈现真实的电子版场景,包含遮挡、背景复杂度和天气状况的差异。排除噪点过多、失真或不现实设置的图像。
    3. 确保网页和现场图片遵循相同的分辨率和色彩空间标准,以保持数据集的一致性。
  6. 数据增益构建
    1. 应用基本的增强操作,如灰度和旋转,以增加样本多样性,并模拟各种光照条件和摄像机方向。
    2. 将EBike目标划分为几个独立的本地区域,包括轮区、前区和后区,以增强本地特征学习。
    3. 分别注释每个区域,以提高遮挡下的检测准确性,并确保模型在不同电子电子元件部分间的稳健性能。
    4. 验证所有增强图像和分块注释是否与EBike特征保持结构一致性,以避免训练数据不匹配或无效。

2. 局部特征分块注释

注意:为提升复杂遮挡场景中EBikes的检测精度,提出了基于改进局部特征的分块注释方法。该方法通过提取EBike区域的局部特征点来分割,并根据对应特征区域的遮挡程度决定是否应注释该区域。详细的实验过程如 图3所示。

  1. 利用之前构建的训练、验证和测试数据集。
  2. 手动注释:在 Python 环境中使用 LabelImg 工具进行手动注释。所有图像都只标注为电子图,确保负样本干扰最小24,25
  3. 数据处理与增强
    1. 应用Yongjiang等人提出的方法,用于去 噪和标准化图像,以确保数据集大小均匀。
    2. 执行数据增强操作(如旋转、亮度调整、灰度缩放)以增加样本多样性。确保所有增强图像保持图像质量,并增强模型对不同背景的稳健性。
  4. EBike区域的作物种植
    1. 为确保ROI定位的可重复性,应用YOLOv10表 4 中的推理参数(使用 yolov10x.pt 预训练权重文件)。输出包围盒坐标如下:
      ROI = [x1, y1, x2, y2] (1)
      方程(1)定义了ROI26 边界盒坐标 [x1, y1, x2, y2] ,其中: x1, y1 = EBike ROI的左上角坐标;x2, y2 =EBike ROI右下角坐标。这些坐标源自YOLOv10的原始输出,该输出预测每个检测对象的边界框格式为[cx, cy, w, h]。换算公式如下:
      figure-protocol-1(2)
      figure-protocol-2(3)
      figure-protocol-3(4)
      figure-protocol-4(5)
      其中cx,c y是预测边界框的水平/垂直中心坐标(按输入图像大小640 x 480缩放)。 w,h 是预测边界框的归一化宽度/高度(按输入图像大小缩放)。
    2. 通过置信阈值(0.5)过滤YOLOv10的输出,只保留与EBike相关的检测(类别ID,对应电动自行车),然后用NMS(IoU=0.45)处理以去除冗余的框。将剩余的边界框转换为 [x1, y1, x2, y2],以便进行 ROI 裁剪。
    3. 处理多重检测
      注意:在电梯场景(EBike-DET数据集的核心目标)中,电子电子键通常为单实例(因空间限制)。对于多次EBike检测的情况(例如,拥挤电梯中有两个EBike),适用以下规则。
      1. 最高置信优先级:选择置信度分数最大的边界框(YOLOv10的输出置信度反映了模型对该对象为EBike的确定性)。
      2. 空间效度检查:如果多次检测的置信度值为>0.7,请验证与电梯结构边界的空间重叠(例如,避免超出电梯墙的边界箱)。保持中心点cxc y最接近图像中心的探测器(电梯通常由前置摄像头监控,目标置中)。
      3. 边缘案例处理:如果没有有效检测达到置信阈值(例如严重遮蔽),则标记图像进行人工ROI校正(占EBike-DET数据集的<%)。
  5. 灰度转换与归一化
    1. 对ROI裁剪后的RGB图像进行灰度转换。使用加权平均法进行转换,公式如下:
      Igra = 0.299 × R + 0.587 × G + 0.114 × B(6)
      其中 R、G 和 B 分别表示红、绿、蓝三色通道的像素值。这种方法符合人类对不同颜色亮度的感知。
    2. 通过从[0, 255]线性缩放,将灰阶图像的像素值归一化至[0, 1]范围。这种归一化提高了数值计算的稳定性,并确保后续梯度计算和阈值计算在不同光照条件下能够稳定工作。
  6. 哈里斯角检测
    1. 对灰度应用哈里斯角检测,并对EBike区域进行归一化以提取局部特征点。
      注意:哈里斯角检测的核心原理是计算自相关矩阵以准确定位图像中的角点,如4B所示。这些检测到的弯道通常与关键的EBike部件有关,如轮子、前区和后区,这些部件通常具有明显的角特征。
    2. 计算图像的梯度,以识别强度变化显著的区域,如下所述。
      1. 图像平滑:对灰度图像应用高斯滤波以抑制噪声,得到平滑后的图像如下:
        Is = Gσ*I (7)
        其中*表示卷积运算,Gσ是一个标准差为σ的二维高斯核,控制平滑层级。的典型值为1.0。
      2. 计算图像梯度:使用梯度算子(如索贝尔算子)计算平滑图像的水平(x)和垂直(y)梯度:
        Ix = Kx * I s ,Iy=Ky * Iy (8)
        其中 IxI y 分别是 x 方向和 y 方向的梯度映射,Gx 和 Gy 是索贝尔算符的卷积核:
        figure-protocol-5figure-protocol-6 (9)
      3. 基于之前计算的梯度构造自相关矩阵M,使用一个以每个像素(x,y)为中心的3 x 3局部窗口W:
        figure-protocol-7(10)
        在公式中,W 指的是位置 (x, y) 的局部窗口,运算 ∑W 表示该窗口内所有图像元素的求和;A = ∑W Ix2 表示 W 窗口中 x 方向平方梯度的和,反映 x 方向变化的强度;B=∑W Iy2 表示 W 窗口中 y 方向平方梯度的和,反映了 y 方向变化的强度;C = ∑W IxIy 表示 W 窗口内 x 和 y 方向梯度的乘积,描述这两个方向变化的相关性。
      4. 计算x方向和y方向平方梯度的和,以反映各方向变化的强度。梯度 Ix Iy 之间的交叉项捕捉了 x 和 y 方向之间的相关性。
      5. 角响应函数:基于自相关矩阵的行列式和迹计算角点响应函数R,以检测图像中的角点。计算每个像素的响应值,并选择响应值更高的点作为最终角点,如 图2所示。角响应函数由下式给出:
        det(M) = A ⋅ B - C2 (11)
        trace(M) = A + B (12)
        R = det(M) - k ⋅ (trace(M))2 (13)
        其中det(M)是M的行列式,反映局部特征区域的整体变化,trace(M)是矩阵的迹,反映该区域的总梯度强度。经验常数k通常设在0.04到0.06之间。
        注意:基于实验,发现选择k显著影响结果:
        当k=0.04时,响应值过高,导致误检测的角点过多。
        当k=0.05时,响应值更为平衡,能准确检测真实角点。
        当k=0.06时,响应值过低,难以可靠检测角点。
    3. 利用哈里斯角点检测结果对EBike的局部区域进行粗粒度划分。根据几何结构和角点分布将EBike划分为不同区域,如 图4C所示,以提升模型在复杂遮挡场景下的鲁棒性和检测性能。
    4. 轮面积:如果该区域至少包含15个沿圆形对称分布的角点,且对称性分数不少于0.85,则该区域有效。对称性分数见方程11。车轮区域的宽高比应约为1:1,以确保准确反映车轮的几何特性。
    5. 前面积:如果包含至少10个角点且对称性不低于0.80,且宽度与高度比在1.2:1到1.5:1之间,则包含该区域,确保前方区域符合预期的结构特征。
    6. 后方面积:如果区域包含至少12个角点,且对称性分数不低于0.75,宽度与高度比范围在1.5:1至2:1之间,则包含该区域,确保后方区域符合预期的几何性质。
  7. 用边界框表示临界EBike区域
    1. 要将角点转换为矩形边界框,可以使用DBSCAN聚类算法。该方法将附近的角点分组成簇,确保形成区域的角点被归为一组。将簇内点之间的最大距离设置为30像素。
    2. 对于每个角点簇,确定最小和最大x和y坐标。这些坐标代表边界盒的边。
    3. 在边界框周围加10像素的边距,确保所有相关特征都包含在内。该余裕用于补偿角点检测中可能出现的错位或像素不准确。
    4. 将边界框四周化到最接近的整数,以确保像素对齐,以便图像处理。
    5. 表示第i个分量(例如轮子、前方区域、后方区域)的最终边界框坐标,如下所述。
      1. 将定义的区域(轮子面积、前部区域和后区域)合并,并用矩形边界框表示EBike的所有关键区域。
      2. 定义i分量的边界框坐标(例如轮子、前方区域、后方区域):
        figure-protocol-8(14)
        其中 Bi 代表第 i 个分量的边界框, figure-protocol-9figure-protocol-10 分别是左上角和右下角的坐标。
  8. 处理部分闭塞
    1. 评估每个区域的角对称性得分。如果对称性分数大于或等于0.7,则接受一个区域。
    2. 对于遮挡处理,测量角点的可见性。如果至少有50%的角可见,就接受一个区域。如果30%-50%的角落可见,标记该区域以便进一步检查。如果可见角少于30%,则因能见度不足以准确检测,应拒绝该区域。
  9. 局部特征区域的准确判断
    1. 使用三种定量操作指标评估每个局部特征区域的准确性:对称度量S、等高线连续度度C和连接结构度量L。将这些指标均匀应用于车轮面积、前面积和后面积。
    2. 只有当所有指标都达到预设阈值时,才接受该区域。如果某项指标在可容忍范围内失败,扩大投资回报率并重新评估。如果两个或多个指标都失败,则标记该区域为不可靠。
  10. 轮区域特征精度分析
    1. 正面视角作战检查站
      1. 计算对称度量:
        figure-protocol-11(15)
        其中nL和nR分别表示左侧和右侧角的计数。
      2. 如果S≥0.85,则接受该区域。如 图5A所示,车轮呈现出对称的圆形,沿圆周的哈里斯角点形成对称的图案。所以,把整个轮子区域都标注出来。
      3. 如果 0.70 ≤ S<0.85,则将 ROl 扩展 10-20 像素并重复计算,以便更多真实特征重新进入计算区,然后重新计算。如 图5D所示,轮子出现部分遮挡,因此应扩大裁剪范围以捕捉更多电动自行车的特征以便评估。
      4. 如果是S<0.70,则标记该区域为不可靠。如 图5G所示,圆形被破坏;将该区域排除在注释之外。
    2. 侧视操作检查站
      1. 测量轮廓连续性的方法:
        figure-protocol-12 (16)
      2. 当C降至0.75≥时接受。如 图5B所示,实际连续弧长与预期弧长的比值符合要求,轮廓完全符合边缘,且无明显断裂。
      3. 如果0.55≤C<0.75,则调整轮廓提取并重新检查。如 图5E所示,连续电弧长度与预期电弧长度的电流比值处于临界区间;需要调整提取算法的阈值,使轮廓更完整。
      4. 如果C<0.55,则因几何连续性不足而拒绝该区域。如 图5H所示,分析要求无法满足。
    3. 上视角操作检查站
      1. 利用以下方法评估结构连通性:
        figure-protocol-13 (17)
      2. 当L达到0.70≥时接受。如 图5C所示,观测距离与预期距离之间的偏差有效被偏移,结构连通性满足要求,车辆与电梯环境之间的相对位置连接也已完成。
      3. 如果L<0.70,扩大投资回报率并重新评估。如 图5F所示,观测距离与预期距离之间的电流偏差相对较大;有必要扩大分析范围,纳入更多周围结构,以提高连通性评估的准确性。
      4. 如果连接性依然不稳定,则将该区域归类为不可靠。如 图5I所示,它不能作为有效的分析区域。
  11. 前面积特征准确分析
    1. 对于EBike前部区域的特征准确性评估,遵循第2.10节定义的统一规则框架,包括在方程15中使用度规S在正面视图下进行对称性评估,在侧视角使用公规C(方程16定义)进行等高线连续性评估,以及在顶部视图下使用公规L进行结构连通性验证(如方程17定义)。
    2. 由于几何变异和前部区域频繁部分闭塞,应采用较轮区域较宽松的阈值。当S ≥ 0.80,C ≥ 0.70,L ≥ 0.65,则接受前区区域。如图6A-C所示,满足这些标准的区域表现出平衡的左右特征分布、相干轮廓和稳定的结构连通性。
    3. 如果任何指标落入第2.10节指定中间范围,扩展兴趣区域并重新评估以纳入更多上下文特征,如图6D-F所示。重新评估后未达到最低标准的区域被归类为不可靠区域,如图6G-I所示。
  12. 后面积特征准确分析
    1. 对于后方区域特征精度分析,遵循第2.10节定义的评估协议,分别采用方程15定义的S、方程16中的C和方程17定义的L,分别在正面、侧面和顶部视图下。
    2. 后部区域更容易受到乘客、携带物品或电梯结构造成的堵塞。因此,应应用更严格的拒绝条件以避免不可靠的注释。当S ≥ 0.75,C ≥ 0.70,L ≥ 0.65,则接受后方区域。具有足够对称性、等高线连续性和连通性的代表性公认案例见图7A-C
    3. 对于指标值边缘的区域,进行ROI扩展和重新评估,如图7D-F所示。如果几何关系仍然模糊或度量未满足接受标准,则将该区域标记为不可靠,如图7G-I所示。
  13. 后方区域特征准确分析
    1. 对于后方区域特征准确性分析,遵循第2.10节定义的评估协议,使用与方程15中定义的S、方程16中定义的C以及方程17中定义的L相同的指标,并结合相应的视角。
    2. 与前部相比,后部区域更容易受到乘客、携带物和电梯内部结构造成的阻塞。因此,应应用稍微严格的拒绝标准以防止不可靠的注释。当S ≥ 0.75,C ≥ 0.70,L ≥ 0.65,则接受后方区域。如图7A-C所示,公认区域保持足够的对称性、等高线一致性和结构连通性。
    3. 对于指标值处于边界的区域,请根据第2.10节展开并重新评估投资回报率,如7D-F所示。如果重新评估后几何一致性仍不足,则标记该区域为不可靠,如图7G-I所示
  14. 管道的实现
    1. 文件和文件夹结构:实现采用模块化目录结构,将检测、局部特征提取和注释判断分开。请参见下方所示的代表性文件夹组织。将所有中间结果存储在专用子文件夹中,以便独立检查每个处理步骤。
      project_root/

      ├── 数据/
      │ ├── 图片/
      │ │ ├── 列车/
      │ │ ├── Val/
      │ │ └── 测试/
      │ └── 注释/

      ├── 侦测/
      │ ├── detect_ebike.py
      │ └── yolov10_config.yaml

      ├── roi/
      │ ├── crop_roi.py
      │ └── cropped_images/

      ├── 哈里斯/
      │ ├── harris_corner.py
      │ └── corner_visualization/

      ├── chunk_annotation/
      │ ├── region_partition.py
      │ ├── validity_judgment.py
      │ └── final_annotations/

      └── 配置/
      └── thresholds.yaml
    2. 执行流水线与示例命令行
      1. EBike检测与投资回报率定位:使用预训练的物体检测模型定位EBike区域。检测结果存储为边界框坐标。
        Python检测/detect_ebike.py \
        --输入数据/图像/测试/ \
        ——输出投资回报率/对detections.json
      2. ROI 裁剪:利用检测到的边界框从原始图像中裁剪 EBike 区域。
        Python 投资回报率/crop_roi.py \
        ——检测ROI/detections.json \
        --图像数据/图像/测试/ \
        --输出投资回报率/对cropped_images/
        使用命名格式保存每张裁剪后的图片:imageID_roi_xmin_ymin_xmax_ymax.jpg
      3. 哈里斯角提取:在灰度转换后,对每个裁剪的ROI应用哈里斯角检测。保存角落响应地图和视觉覆盖图以便检查。
        派森·哈里斯/harris_corner.py \
        --输入ROI/cropped_images/ \
        --输出哈里斯/corner_visualization/ \
        --config configs/thresholds.yaml
      4. 粗粒度划分和块标注:根据角点的空间分布,将局部特征区域划分为轮、前区和后区。使用几何和特征标准进行有效性判断。
        Python chunk_annotation/region_partition.py \
        --角 哈里斯/corner_visualization/ \
        --输出chunk_annotation/final_annotations/
    3. 预期中间输出和视觉检查点:保存每个处理阶段产生的中间输出作为视觉检查点。这些中间输出支持对投资回报率(ROI)定位、角提取质量、区域划分和最终注释决策的逐步验证。
      1. ROI 裁剪输出:将裁剪后的 EBike 图片保存为 ROI/cropped_images/。每张图像包含从原始帧中提取的单个EBike区域。
      2. Harris 角落可视化:在 Harris/corner_visualization/ 中保存角落叠加。对于有效的轮区域,沿圆圈结构可以观察到密集的角点集合。此阶段可识别角响应不足的区域。
      3. 区域划分结果:独立可视化划分区域(轮子、前方区域、后方区域)。只保留满足预先定义有效性标准的区域(例如,足够的角密度和几何一致性)。
      4. 最终注释输出:将接受的区域存储在chunk_annotation/final_annotations/中,作为结构化注释文件。排除未能通过有效性判断的区域,并不将其传播到后续阶段。
        注意:所有用于角检测和区域有效性判断的阈值均集中存储在配置文件中。该流水线基于单帧输入,不依赖时间,允许对每张图像独立复现结果。在输入图像、配置文件和执行顺序相同的情况下,生成的中间输出和最终注释保持确定性。
  15. 最终确定步骤与数据集发布
    注意:为确保协议以清晰且可复现的终点结束,定义了一个最终阶段,以整合注释保存、质量验证、数据集打包和版本文档。
    1. 保存最终注释:在区域有效性判断后,将所有接受的注释保存为chunk_annotation/final_annotations/格式,使用YOLO文本格式,并为每张图片对应一个注释文件。最终注释集中仅保留满足预定义几何和特征标准的区域,排除被拒绝或不可靠的区域以后继续使用。
    2. 注释质量验证:通过重新应用区域评估中使用的有效性标准,包括对称性、等高线连续性和结构连通性指标,验证最终注释质量。在此验证阶段移除不符合这些标准的注释,确保注释生成与质量控制的一致性。
    3. 数据集打包:验证后,将图像和注释组织为固定的训练、验证和测试分割,基于定义的数据集分区。目录结构和文件列表在此阶段被冻结,打包后的数据集准备进行训练和评估,无需进一步修改。
    4. 版本和种子文档:配置文件,包括角落检测参数和区域有效性阈值,与打包数据集一同保存。使用随机种子进行数据拆分、固定算法执行和记录。此外,还要记录模型权重、配置文件和注释工具的版本。在输入数据、配置文件和记录种子相同的情况下,最终的注释和数据集拆分仍然是确定性的。

3. 数据增强

注意:一项先前研究表明,缺乏充分预处理和数据补充的训练数据集常常导致模型性能下降22。为应对这些挑战,采取了以下程序。

  1. 照明
    1. 通过在0.6–1.4范围内调整亮度因子,概率为0.8,模拟电梯内的光线变化以应对频繁的照明变化。
    2. 通过调整光强来从明亮到昏暗环境,模拟EBike运动引起的模糊。此操作使用0.7的概率。
    3. 通过调整光照条件生成增强样本,确保在不同照明下能见度稳定。
    4. 离线应用这些照明操作并存储以便后续处理。将随机种子设置为42,以确保增强过程的可重复性。
  2. 闭塞
    1. 创建合成遮挡场景,以反映电梯拥挤的环境。以0.6的概率应用遮蔽蒙罩(例如,人影、物体方块)。
    2. 应用马赛克遮挡,模拟电梯进出时EBikes的部分阻塞。使用30%、50%或70%的遮挡百分比,并确保遮挡随机施加在图像的任意象限(上、下、左、右)。
    3. 采用遮挡样本以提高部分能见度下的检测稳健性和稳定性,确保至少一个关键部件(如轮子、前部区域、后部区域)保持可见。
    4. 离线进行遮挡增强并验证样本,确保关键的 EBike 特征得以保留。将随机种子设置为42以保证可重复性。
  3. 观点
    1. 在预设的±15°范围内调整视角,以模拟不同电梯环境中多样的摄像机角度。该操作应以0.7的概率应用。
    2. 应用变形系数介于0.0到0.2之间的透视变换,以模拟不同的摄像机位置(例如,高视、侧视和斜视)。
    3. 将EBike区域缩放并移动0.8–1.2倍,以模拟相机与目标距离的变化。以0.8的概率应用此变换。
    4. 确认所有视点变换都保持EBike的几何完整性,且没有关键特征被扭曲。
    5. 离线进行视点转换并存储增强后的图像。将随机种子设置为42以保证可重复性。
  4. 增强
    1. 对30%的图像应用灰度,概率为0.3,以引入亮度驱动的变化,并增强模型在低光环境下的稳健性。
    2. 在20%的样本上使用直方图均衡,以增强EBike关键特征在强光条件下的对比度和可见性。
    3. 依次结合光照、遮挡和视点增强策略,生成高多样性样本。使用此多步骤过程的概率为0.9。
    4. 在整合到最终数据集之前,请审查增强后的样本,确保其保持EBike的结构完整性。
    5. 离线进行增强操作,并存储图像以备后续训练使用。将随机种子设置为42,以确保整个增强过程的可重复性。

4. 实验环境

  1. 配置实验环境,以确保模型训练和测试期间的计算效率和稳定性。
  2. 使用现代多核处理器、专用深度学习加速GPU、充足的内存以及支持大规模EBike图像数据处理的稳定存储系统。
  3. 通过安装兼容版本的深度学习框架、GPU驱动和加速库,将软件环境与硬件配置匹配,以优化训练速度和推理性能。
  4. 详见 表5、表6、表7和表8 ,以了解详细硬件规格、软件环境、模型依赖关系及成像设备设置,以确保可重复性。
  5. 计算开销和运行时分析
    1. 分析分块注释策略相关的计算开销,包括注释复杂度和运行效率。与整体注释相比,分块注释表示使用部分层级区域(包括轮子区域、前区域和后区域)的电子比克。仅在这些区域可见且符合预设几何和特征有效性标准时进行注释,而非对每个实例强制执行。
      注意:从注释角度看,标签数量的增加仍然有限且结构受限。一个EBike实例最多贡献三个部分级注释,而在部分遮挡(例如仅可见前部区域)时,注释区域较少。因此,每张图像的标签数量会随着场景可见性和遮挡条件变化,平均标签数量适度增加,如 表9所示。该设计平衡了局部特征表示与注释复杂度。从推理角度看,分块注释不会带来相应的后处理成本增加。虽然部分级检测可能会生成额外的候选边界框,但检测结果会在EBike对象层级汇总以供最终评估,并且在后处理前应用基于置信度的过滤。这种条件式、可视化驱动的标注策略限制了不必要的检测候选标注。对于像YOLOv10这样减少对传统非最大抑制依赖的模型,分块带来的额外开销在实际操作中仍然有限。
    2. 在典型电梯监控分辨率640 x 480像素下,使用NVIDIA RTX 3090 GPU评估运行时性能。如 表9所示,分块注释保持实时推断能力,相较整体注释仅有轻微的帧数降低。这些结果表明,分块注释策略仍适用于电梯环境中的实时电子电子标注(EBike)监测。

5. 评估指标

注意:虽然训练和推断中使用分块注释,但评估是在电动自行车对象层面进行的。部分级检测根据第2.4,3节定义的规则汇总为单一电动自行车决策。

  1. 应用目标检测研究中常用的标准评估指标27 ,全面评估EBike遮挡检测场景下的算法性能。
  2. 检测精度(P)
    1. 使用方程(8)计算检测精度,衡量正确识别EBikes在所有预测阳性样本中的比例。
      figure-protocol-14 (18)
      其中TP表示真阳性,FP表示假阳性。
    2. 将 IoU 阈值设为 0.5,以确定预测的边界框是否与地面真实框匹配。
    3. 利用精确度评估模型减少因误识别非EBike对象而引起的不必要报警的能力。
    4. 生成该指标的命令:使用相关的评估脚本(例如,evaluate_precision.py)。将结果保存在precision_results.txt以便进一步分析。
  3. 召回率(R)
    1. 使用方程(9)来确定模型在电梯环境中识别电子光谱的效果,尤其是在遮挡影响可见性时。
      figure-protocol-15(19)
      其中FN代表假阴性。
    2. 将IoU阈值设为0.5以评估检测准确性。利用回忆评估模型在减少遗漏检测方面的能力,确保即使部分受阻,电子卡也能保持准确识别。
    3. 使用命令生成这个指标:run evaluate_recall.py。存档结果在recall_results.txt。
      注意:在拥挤的电梯环境中,漏检非常关键,必须尽量减少以保障安全。在拥挤的电梯环境中,漏检会带来安全隐患,必须尽量减少。
  4. F1评分
    1. 使用方程(10)计算F1分数,以获得模型精度和回忆性能的平衡表示。
      figure-protocol-16(20)
    2. 使用F1评分提供整体评估,尤其是在精度和回忆在不同闭塞水平下存在权衡的情况下。
    3. 使用命令生成该指标:运行evaluate_f1.py计算F1分数。存档结果在f1_score_results.txt。
  5. 平均平均精度(mAP)
    1. 使用方程(11)来衡量模型在不同电子比克外观、遮挡条件和光照变化下的整体检测能力。
      figure-protocol-17 (21)
      其中APc 表示类别 c 的平均精度,C表示类别数量。
    2. 将 IoU 阈值设为 0.5,以评估模型在不同类别中的表现。
    3. 使用mAP@0.5来评估模型在电梯环境中适应不同视觉条件的适应能力,确保对检测性能的全面评估。
    4. 使用以下命令生成该指标:使用指定参数执行evaluate_map.py。存档结果在map_results.txt。

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

公共数据集上整体注释与分块注释的比较

评估基于一个公开数据集进行,包含210张来自开放式监控和交通监控场景的EBike图像,涵盖多样的光照条件、EBike颜色及不同程度的遮挡。每张图片都采用了整体方法(单边界框)和提出的分块方法(将电子图标划分为轮子、前区和后区)进行注释。

定量结果总结于 表1。在YOLOv5中,整体注释精度为0.81,召回率为0.74,F1评分为0.77,mAP@0.5为0.78。使用分块注释训练时,YOLOv5的精度提升至0.86,召回率提升至0.79,F1得分为0.82,mAP@0.5为0.84。这代表与整体注释相比,精确度提升了0.05,召回率提升了0.05,mAP提升了0.06。

同样,YOLOv10也展现了显著的改进。采用整体注释后,模型的精度为0.84,召回率为0.76,F1评分为0.80,mAP@0.5为...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

关键步骤

该协议中的关键步骤是基于局部特征的分块注释方法,将电子图标分为轮、前、后三个区域。这一划分确保检测模型能够学习细粒度的表征,这在遮挡重的电梯环境中尤为重要。例如,YOLOv5在EBike-DET数据集上使用分块注释训练,其mAP@0.5从0.925提升到0.966,凸显了准确的局部特征划分对于稳健性能的必要性。此外,哈里斯角检测阶段是局部特征提取的重要预处理步骤。经验常数(k=0.05)的选择对于优化角点检测结果尤为重要,因为偏差(k=0.04或k=0.06)要么增加假阳性,要么降低特征敏感性。

方法的改进与故障排除

可以通过多种修改来提升方法的稳健性。首先,可以引入自适应角检测阈值,使系统能够动态调整不同的光照和遮挡水平。这一调整还能进一步减少误探现象,尤其是在光线频繁变化的电梯场景中。其次,在数据集构建过程中整合多尺度增强...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者之间没有利益冲突。

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作得到了中国教育部2025年人文社会科学科研规划基金(拨款号25YJAZH002)、2024年广东省重点学科科研能力提升项目(拨款号2024ZDJS086)、广东省2024年本科创新创业培训项目(拨款号S202413714017)以及教育部就业-教育联通项目的支持: 《面向人工智能技术的计算机应用专业人才培养机制创新与实践》(资助编号2025072869464)。

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
h5py(固态硬盘)HDF集团2.10.0
matplotlib(固态硬盘)Matplotlib 社区3.1.2
matplotlib (YOLOv10)Matplotlib 社区3.9.0
matplotlib (YOLOv5)Matplotlib 社区3.8.4
matplotlib (YOLOv5+SAHI)Matplotlib 社区3.8.4
matplotlib (YOLOv8-Seg)Matplotlib 社区3.9.0
numpy(固态硬盘)NumPy 社区1.17.0
numpy(YOLOv10)NumPy 社区1.26.3
numpy(YOLOv5)NumPy 社区1.26.4
numpy(YOLOv5+SAHI)NumPy 社区1.26.4
numpy (YOLOv8-Seg)NumPy 社区1.26.3
onnx(YOLOv10)ONNX1.14.0
onnx (YOLOv5)ONNX1.14.0
onnx (YOLOv5+SAHI)ONNX1.14.0
onnxruntime (YOLOv10)Microsoft1.15.1
onnxruntime (YOLOv5)Microsoft1.15.1
onnxruntime (YOLOv5+SAHI)Microsoft1.15.1
opencv-python(SSD)OpenCV4.1.2.30
opencv-python (YOLOv10)OpenCV4.9.0.80
opencv-python (YOLOv5)OpenCV4.9.0.80
opencv-python (YOLOv5+SAHI)OpenCV4.9.0.80
opencv-python (YOLOv8-Seg)OpenCV4.9.0.80
熊猫(YOLOv10)熊猫社区2.2.2
熊猫(YOLOv5)熊猫社区2.2.2
熊猫(YOLOv5+SAHI)熊猫社区2.2.2
pandas(YOLOv8-Seg)熊猫社区2.2.2
枕头(SSD)枕头开发者8.2.0
枕头(YOLOv10)枕头开发者10.2.0
枕头(YOLOv5)枕头开发者8.5.0
枕头(YOLOv5+SAHI)枕头开发者8.5.0
枕头(YOLOv8-Seg)枕头开发者10.2.0
psutil (YOLOv10)Psutil 开发者5.9.8
psutil (YOLOv5)Psutil 开发者5.9.8
psutil (YOLOv5+SAHI)Psutil 开发者5.9.8
pycocotools (YOLOv10)COCO联盟2.0.7
pycocotools (YOLOv5)COCO联盟2.0.7
pycocotools (YOLOv5+SAHI)COCO联盟2.0.7
pycocotools (YOLOv8-Seg)COCO联盟2.0.7
py-cpuinfo (YOLOv10)Py-CPUInfo 开发者9.0.0
py-cpuinfo (YOLOv5)Py-CPUInfo 开发者9.0.0
py-cpuinfo (YOLOv5+SAHI)Py-CPUInfo 开发者9.0.0
PyYAML (YOLOv10)PyYAML6.0.1
PyYAML (YOLOv5)PyYAML6.0.1
PyYAML (YOLOv5+SAHI)PyYAML6.0.1
PyYAML (YOLOv8-Seg)PyYAML6.0.1
请求(SSD)Python 请求2.27.1
请求(YOLOv10)Python 请求2.32.3
请求(YOLOv5)Python 请求2.31.0
请求(YOLOv5+SAHI)Python 请求2.31.0
萨希SAHI开发者0.3.4+
SCIPY(固态硬盘)SciPy 社区1.2.1
Scipy(YOLOv10)SciPy 社区1.13.0
Scipy(YOLOv5)SciPy 社区1.13.0
Scipy(YOLOv5+SAHI)SciPy 社区1.13.0
scipy (YOLOv8-Seg)SciPy 社区1.13.0
海生(YOLOv10)海生开发者0.13.2
海生(YOLOv5)海生开发者0.13.2
海生(YOLOv5+SAHI)海生开发者0.13.2
海生(YOLOv8-Seg)海生开发者0.13.2
身材优美(YOLOv5+SAHI)Shapely 开发商2.0.4
固态硬盘Caffe/原始SSD作者Python 3.6.13+;PyTorch 1.2.0+;CUDA 10.0;CUDNN 7.4.1
张量板(SSD)谷歌2.10.1
张量板(YOLOv5)谷歌2.16.2
张量板(YOLOv5+SAHI)谷歌2.16.2
Torchvision(SSD)PyTorch0.4.0
火炬视界(YOLOv10)PyTorch0.15.2
火炬视野(YOLOv5)PyTorch0.17.2
火炬视界(YOLOv5+SAHI)PyTorch0.17.2
火炬视界(YOLOv8-Seg)PyTorch0.16.1+
tqdm(固态硬盘)TQDM 开发者4.60.0
tqdm (YOLOv10)TQDM 开发者4.66.4
tqdm (YOLOv5)TQDM 开发者4.66.2
tqdm (YOLOv5+SAHI)TQDM 开发者4.66.2
超溶剂(YOLOv8-Seg)超溶菌8.2.99+
YOLOv10YOLOv10 团队Python 3.8.0+;PyTorch 2.0.1+cu118;CUDA 11.8;CUDNN 8.7
YOLOv5超溶菌Python 3.8.0+;PyTorch 2.2.2+;CUDA 11.2;CUDNN 8.1.2
YOLOv5 + SAHIUltralytics + SAHI 开发商Python 3.8.0+;PyTorch 2.2.2+;CUDA 11.2;CUDNN 8.1.2
YOLOv8-Seg超溶菌Python 3.8.0+;PyTorch 2.0.1+cu118;CUDA 11.8;CUDNN 8.6.0+

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Li, Y., Han, L., Ning, X., Xu, Y. Fire risk of electric bicycle based on fuzzy Bayesian network. J Phys Conf Ser. 1578 (1), 012153-012160 (2020).
  2. Cao, F., Sheng, G., Feng, Y. Detection dataset of electric bicycles for lift control. Alexandria Eng J. 105 (1), 736-742 (2024).
  3. Zhang, J., Mohd Yunos, Z., Haron, H. Interactivity recognition graph neural network model for improving human-object interaction detection. Electronics. 12 (2), 470-482 (2023).
  4. Yang, D., Su, C., Wu, H., Xu, X., Zhao, X. Shelter identification for shelter-transporting AGV based on improved YOLOv5. IEEE Access. 10 (1), 119132-119139 (2022).
  5. Wang, X., et al. LDS-YOLO: A lightweight small object detection method for dead trees. Comp Electron Agri. 198 (1), 107035-107044 (2022).
  6. Xu, R., Zhu, D., Chen, M. A novel underwater object detection enhanced algorithm based on YOLOv5-MH. IET Image Process. 18 (10), 3415-3429 (2024).
  7. Shang, J., Wang, J., Liu, S., Wang, C., Zheng, B. Small target detection algorithm for UAV aerial photography based on improved YOLOv5s. Electronics. 12 (11), 2434-2446 (2023).
  8. Wang, C. Y., Liao, H. Y. M. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems. APSIPA Trans Signal Inf Process. 13 (1), 1-18 (2024).
  9. Sapkota, R., et al. YOLO11 to its genesis: A decadal and comprehensive review of the YOLO series. Artif Intell Rev. 58 (2), 145-182 (2025).
  10. Huang, Z., Yin, Z., Ma, Y., Fan, C., Chai, A. Mobile phone component object detection based on improved SSD. Procedia Comp Sci. 183 (1), 107-114 (2021).
  11. Li, Y., Yang, F., Li, Y., Tan, C., Liu, Z. Circuit breaker identification based on SSD. J Phys Conf Ser. 2418 (1), 012080-012088 (2023).
  12. Deng, X., Li, S. Improved SSD object detection based on attention mechanism and feature fusion. J Phys Conf Ser. 2450 (1), 012088-012096 (2023).
  13. Huo, B., Li, C., Zhang, J., Xue, Y., Lin, Z. SAFF-SSD: Self-attention combined feature fusion SSD for small object detection. Remote Sens. 15 (12), 3027-3041 (2023).
  14. Murphy, K., Torralba, A., Eaton, D., Freeman, W. Object detection and localization using local and global features. Lect Notes Comp Sci. 4170 (1), 382-400 (2006).
  15. Mamat, N., Othman, M. F., Abdulghafor, R., Alwan, A. A., Gulzar, Y. Enhancing image annotation technique for fruit classification using deep learning. Sustainability. 15 (2), 901-915 (2023).
  16. Zhang, T., Jia, K., Xu, C., Ma, Y., Ahuja, N. Partial occlusion handling via robust part matching. Proc IEEE CVPR. 2014 (1), 1258-1265 (2014).
  17. Howard, A. G. Improvements on deep convolutional neural network based image classification. Tech Rep. 1 (1), 1-12 (2013).
  18. Zhang, H. Mixup: Beyond empirical risk minimization. arXiv. , (2017).
  19. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).
  20. Qin, J., Xu, N. Social distancing monitoring based on SSD. Procedia Comp Sci. 183 (1), 768-775 (2021).
  21. Zhong, P., Liu, Y., Zheng, H., Zhao, J. Detection of urban flood inundation using traffic images. Water Resour Manag. 38 (2), 287-301 (2024).
  22. Aamir, S. M., Ma, H., Khan, M. A. A., Aaqib, M. Real-time object detection in occluded environments with background clutter. Multimed Tools Appl. 83 (4), 11245-11261 (2024).
  23. Jia, K., Niu, Q., Wang, L., Niu, Y., Ma, W. Multi-object detection and size calculation for blended tobacco shreds. Sensors. 23 (18), 8380-8395 (2023).
  24. Sun, S., et al. Multi-YOLOv8 for infrared moving small object detection. Neurocomputing. 588 (1), 127685-127696 (2024).
  25. Sadik, M. N., Hossain, T., Sayeed, F. Real-time detection and analysis of vehicles and pedestrians using deep learning. Int J Comp Vis Robot. 14 (3), 215-229 (2024).
  26. Zhang, C., Jiao, P. YOLO series target detection algorithms for underwater environments. Ocean Eng. 279 (1), 114353-114366 (2023).
  27. Luo, B., Xiong, J., Xu, L., Pei, Z. Superpixel segmentation based on global similarity and contour region transform. IEICE Transac Info Sys. E103D (3), 716-719 (2020).
  28. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications and challenges. Comp Electr Eng. 117 (1), 109246-109268 (2024).
  29. Khurshid, S., Basharat, S., Afzal, S. The magic of artificial intelligence-2. Artif Intell Hum Health Dis. 1 (1), 29-46 (2025).
  30. Pan, W., Chen, J., Lv, B., Peng, L. Improved YOLOv9s-UI for underwater object detection. Appl Sci. 14 (14), 7162-7175 (2024).
  31. Zhang, J., Yunos, Z. M., Haron, H. Parallel multi-head graph attention network for human-object interaction detection. IEEE Access. 11 (1), 131708-131725 (2023).
  32. Li, L., Gao, S., Wu, F., An, X. MBAN: Multi-branch attention network for small object detection. PeerJ Comp Sci. 10 (1), e1965-e1980 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Chunked Image AnnotationLocal Feature DetectionElectric Bike DetectionElevator Object DetectionOcclusion RobustnessEBike DET DatasetExplainable AIStructural AnnotationYOLOv5 DetectionSafety Monitoring
Video Coming Soon

Related Articles