需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

用于精准畜牧业中智能实时牛只监测与数据驱动型牧场管理的 YOLOv8-v13 架构性能评估

981 次观看

DOI:

10.3791/69490

2025年11月14日

本文内容

摘要

本方案通过基准测试六种YOLO模型,用于实时检测牛的行为,以支持动物福利和牧场管理的优化。

摘要

实时且准确的牛只行为检测对于改善动物福利和优化畜牧管理至关重要。为实现这一目标,本研究全面评估了六种社区开发的轻量级 YOLO(You Only Look Once)模型——YOLOv8n、YOLOv9t、YOLOv10n、YOLOv11n、YOLOv12n 和 YOLOv13n——在自定义 CBVD-5 数据集上识别五种关键牛只行为(站立、躺卧、采食、饮水和反刍)的能力。该数据集包含多样的光照条件和自然牛舍环境,以反映真实世界中的监测场景。所有模型均采用标准目标检测指标(精确率、召回率、mAP@50 和 mAP@50-95)以及面向部署的指标(包括推理时间、每秒帧数(FPS)、模型大小和训练时长)进行评估,以实现对准确性和效率的平衡分析。YOLOv13n 获得了最高的 mAP@50-95(0.712),而 YOLOv11n 达到了最高的 mAP@50(0.967),并在检测精度与推理速度之间表现出良好的权衡,且收敛稳定。YOLOv10n 展现出最快的推理速度(1.2 ms/帧,约 833 FPS),适用于对延迟敏感的应用场景,如持续牛舍监控。所有模型的体积均保持在 6 MB 以下,实时吞吐量均超过约 300 FPS,证实了其在边缘设备部署中的实用性。研究结果建立了一个可复现的基准框架,用于评估现代 YOLO 变体,为高效、可扩展且以动物福利为导向的畜牧监测系统中的模型选择提供了重要参考。

引言

高效监测牛只行为在精准畜牧业中至关重要,有助于动物福利管理、疾病检测和运营优化。基于视觉的非侵入性方法因其可扩展性和多功能性而具有广阔前景。CBVD-5(包含5类行为的牛只行为视频数据集)等标准化数据集在不同光照条件下提供了多样的行为标注,成为该领域有价值的基准数据集1。在大多数实际农场环境中,摄像头通常固定在中等高度,光照相对稳定,尽管牛只之间偶尔发生的遮挡可能影响检测性能。牲畜行为识别仍面临遮挡、运动变异性以及训练数据稀疏等挑战。为应对这些挑战,先前研究探索了基于传感器的方法2、图像模式建模3以及集成深度学习策略4。目标检测框架如YOLO(You Only Look Once),由Redmon等人首次提出5,及其更先进的版本YOLOv76,因其在检测精度、延迟和计算效率之间良好的平衡而脱颖而出。本研究中,“实时性能”指推理速度超过每秒30帧(FPS),以确保在实际农场环境中实现平滑连续的基于视频的行为追踪。本研究系统评估了YOLOv8n至YOLOv13n在CBVD-5数据集上的表现,重点关注实时行为检测及部署约束。YOLO架构的最新进展,包括开源社区发布的YOLOv87、YOLOv98、YOLOv109、YOLOv1110、YOLOv1211和YOLOv1312,在检测精度和计算效率方面均有提升。这些模型采用了多任务学习、无锚点检测头(anchor-free heads)和优化的迁移学习等创新技术,使其更适用于大规模牧场中常见的资源受限环境。然而,据我们所知,目前尚无针对牛只行为识别任务对这些模型进行全面评估的研究。为填补这一空白,我们使用一个旨在模拟真实农场环境的数据集,对近期YOLO模型(v8n–v13n)在牛只行为检测方面的性能进行了比较评估。通过平均精度均值(mAP)、精确率、召回率、推理时间及FPS等标准检测指标对模型进行评估,以确定哪种模型变体最适用于农场条件下的实时牛只监测应用。本研究并非提出新的网络架构,而是为近期YOLO变体在牲畜行为监测中的应用建立了一个系统化且可复现的基准评估框架,弥补了当前文献中关于这些模型比较性能研究尚不充分的空白。

YOLO系列目标检测器显著推动了实时计算机视觉的发展,尤其在需要兼顾速度与准确性的应用中表现突出。在牛只行为识别领域,由于需要对牲畜活动进行实时监测,YOLO在这些性能上的平衡使其具有高度有效性。本文综述了YOLO模型从早期版本到最新版本的演进过程,重点介绍了与牛只行为检测相关的关键创新。每一次迭代都在检测速度、准确性和农场环境下的鲁棒性方面实现了提升,使得YOLO模型日益适用于动态环境中的牛只监测。

YOLO 的早期版本(v1-v3)通过将分类与定位统一到单一回归框架中,奠定了单阶段目标检测的基础。这些版本在推理速度、空间精度和多尺度检测能力方面逐步提升,为 YOLO 在畜禽行为分析及其他实时农业场景中的应用奠定了基础13,14,15,162020年YOLOv4发布后,该架构进一步优化,包括采用跨阶段部分(CSP)主干网络、Mish激活函数以及先进的特征聚合技术17,18,19这些更新提升了模型在较小数据集上的性能,这在畜禽行为检测中是一种常见情况,因为罕见事件的标注样本有限。由 Ultralytics 于 2020 年推出的社区驱动项目 YOLOv5,因其模块化设计和易于部署而得到广泛应用。 通过 一个 PyTorch 框架20尽管没有同行评审论文支持,YOLOv5 由于在准确性和部署灵活性之间具有良好的平衡,已成为实时牛只检测任务中的事实基准。YOLOv6 于 2022 年发布,采用 EfficientRep 主干网络和 Rep-PAN 结构,优先考虑了对硬件友好的设计。21,22通过引入无锚点检测,该模型在遮挡和部分可见场景下的鲁棒性得到提升,此类情况在密集的牛群环境中十分常见。YOLOv7 进一步通过 E-ELAN 架构优化了计算效率,从而实现了更快的训练速度,并在多个检测尺度上提升了性能。23与此同时,YOLOX 等替代模型24 以及 YOLOR25 更快的检测速度和更强的泛化能力,这两者均为户外牲畜监测系统所必需的关键特性。Ultralytics 于 2023 年发布的 YOLOv8 引入了多项架构改进,包括无锚框检测头(anchor-free heads)、结构重参数化(structural reparameterization)以及更强的数据增强策略。这些更新显著提升了检测精度和推理速度,使 YOLOv8 成为实时牛只行为分析的一项有力竞争方案。此后,YOLO 系列持续演进,相继出现了 YOLOv9、YOLOv10、YOLOv11、YOLOv12 与 YOLOv13。YOLOv9 融入了多任务学习机制,可联合优化分类、定位以及关键点检测等辅助任务。YOLOv10 在此基础上进一步集成了领域自适应模块和分割感知注意力机制。YOLOv11 引入了自监督训练策略,降低了对完全标注数据的依赖,在牛只行为监测等数据稀缺的应用场景中具有显著优势。YOLOv12 重点改进了特征融合机制与动态重参数化技术。最终,YOLOv13 引入了基于 Transformer 的模块与时空注意力机制,可在复杂、实时的农业场景中实现高速、低延迟的优异检测性能。

近年来,基于YOLO的深度学习模型因其高效性和准确性,已广泛应用于牛只行为的自动化与实时监测。在YOLO检测器被采用之前,已有若干早期基于视觉的系统验证了图像驱动的牲畜监测的可行性。例如,Sumi等人开发了一种用于产犊检测的奶牛监测系统,该系统采用运动特征分析26;而Zin等人则提出了一种基于深度学习的奶牛识别框架,识别准确率达到97%27。这些研究为精准畜牧养殖中的后续目标检测方法奠定了基础。已有多个研究在不同条件下应用了多种YOLO变体,用于行为分类、运动追踪和姿态识别。例如,Mu等人基于YOLOv8提出了一种改进的轻量化牛只行为识别-YOLO28(CBR-YOLO)模型,该模型针对多场景天气适应性进行了优化,在显著减少参数量的同时实现了90.2%的平均准确率。Tong等人提出了YOLO-BoT模型29,将注意力机制和基于Transformer的模块引入YOLOv8,用于复杂环境下的牛只行为检测与追踪,检测mAP达到91.7%,帧速为31.2 FPS。Hao等人将高效的多尺度注意力(EMA)机制集成到YOLOv530(YOLOv5-EMA)中,提升了对牛只身体部位(如头部、腿部)的检测性能,mAP值达到94.8%至95.5%之间。Guarnido-Lopez等人31评估了YOLOv8和YOLOv10在夏洛莱公牛进食相关行为(如咀嚼、咬合、接近)识别中的表现,结果显示YOLOv10在mAP@50、mAP@50-95、精确率和召回率方面略优于YOLOv8,而YOLOv8则表现出更快的收敛速度和更低的过拟合程度。尽管YOLOv1至YOLOv8已在畜牧相关任务中被广泛采用并得到验证,但YOLOv9至YOLOv13在该领域的适用性仍缺乏充分探索。迄今为止,尚未有研究对这些较新的模型在牛只行为检测中的表现进行全面评估,凸显了现有研究中的关键空白,也促使进一步探究其在实际应用中的性能表现。

访问受限。请登录或开始试用以查看此内容。

方案

1. 数据集准备

注意:本研究未涉及新的动物实验。所有数据均来自公开的 CBVD-5 数据集,该数据集由其原始作者根据机构动物护理指南收集并发布。因此,本研究无需额外的伦理审批。

  1. 该数据集包含通过七台大华摄像头(2.8 mm 和 3.6 mm 镜头,型号 M/K)在标准牛舍光照条件下连续 5 天不间断拍摄的监控录像,摄像头通过千兆交换机和网络视频录像机连接。
  2. 提取代表性帧以获得 25,000 张带注释的关键帧,确保不同行为类型在时间上的多样性。使用 VGG 图像注释工具(VIA v3.0.11),按照 AVA 边界框格式对五类行为——站立、躺卧、觅食、饮水和反刍——进行标注。根据标签模式 {standing, lying, foraging, drinking, rumination} 创建统一的 VIA 项目,然后将注释导出为 JSON 文件,并使用 Roboflow 转换为 YOLO 兼容的 TXT 格式(项目设置中 normalization = True,每行一个类别)。
  3. 将所有图像调整为 640 × 640 像素,并应用自动方向校正。
  4. 在 Roboflow 中进行数据增强,应用随机水平翻转(p = 0.5)、±10° 旋转以及亮度/对比度变化(±15%),以提升模型的泛化能力。
  5. 按 70/20/10 的比例将数据集划分为训练集、验证集和测试集(分别为 2049/585/293 张图像)。

2. 模型选择与设置

  1. 选择六种轻量级 YOLO 架构:YOLOv8n、YOLOv9t、YOLOv10n、YOLOv11n、YOLOv12n 和 YOLOv13n。
  2. 记录模型规格,包括总层数、参数量和 GFLOPs,以比较计算需求,如表1所示。
  3. 本研究中使用的计算环境及软硬件配置详见材料表。为确保可重复性,确定性随机种子固定为 0、42、1337。
  4. 使用官方预训练权重(例如 yolov10n.pt、yolov13n.pt)初始化每个模型。

3. 模型训练

  1. 在相同的实验条件下,使用 Ultralytics YOLO(v8.3.63)框架训练所有 YOLO 模型。
  2. 固定输入分辨率为 640 × 640 像素,批量大小为 128,初始学习率为 0.01(SGD 优化器,余弦调度器)。
  3. 每个模型的代表性训练命令(示例:YOLOv8n):
    results = model.train(
    data=f'{dataset.location}/data.yaml',
    epochs=800,
    patience=30,
    batch=128,
    imgsz=640,
    name='yolov8n_test_800_epoch',
    save_period=100,
    pretrained=True,
    amp=True,
    workers=16,
    seed=1337
    )
  4. 当内部验证适应度指标(精确率、召回率和 mAP@50-95 的加权组合)连续 30 个训练周期未提升时,应用早停策略。
  5. 根据每个训练过程中最高的验证集 mAP@50-95 值选择最佳检查点,并对三个随机种子(0、42、1337)的结果取平均值,以确保可重复性。
  6. 由于较大的模型变体(例如 YOLOv10m、YOLOv11l)资源消耗较高,为确保在边缘设备上的可行性,故予以排除32

4. 模型评估

  1. 使用 Ultralytics 内置的验证函数评估模型性能:
    metrics = model.val(data=f'{dataset.location}/data.yaml', split='test')
  2. 计算 mAP@50 和 mAP@50-95。
  3. 生成混淆矩阵以分析各类别的性能表现。
  4. 与效率相关的指标(包括延迟(ms/帧)、FPS、模型大小(MB)和训练时长)已自动记录。其中,FPS 是总单帧执行时间的倒数,执行时间包括预处理、模型推理和后处理阶段。

访问受限。请登录或开始试用以查看此内容。

结果

本节展示了 YOLOv8 至 YOLOv13 模型在 CBVD-5 数据集上用于多行为牛只识别的评估结果。分析重点包括检测精度、训练收敛性、行为分布情况以及在资源受限环境中的部署适用性。数据集质量和类别平衡遵循协议中描述的划分方式(70/20/10),确保五种行为在训练集、验证集和测试集中具有一致的代表性。图 1 显示,标注的牛只行为通常在画面中居中良好。垂直中心坐标略偏低,这与相机角度和牛舍布局相对应。边界框的宽度和高度呈现单峰分布且具有高度相关性,表明各样本中目标尺度一致。

图2展示了YOLOv13n模型的训练动态。在全部391个训练周期中,分类损失、目标性损失和定位损失均平稳下降。验证指标的变化趋势与训练过程一致,最终精确率为93.1%,召回率为93%。该模型在mAP@50上达到96.5%,在mAP@50-95上达到71.5%,表明其具备强大的多类别行为识别能力。在后期训练周期中,性能趋于稳定,证实了训练已收敛。所有YOLO变体均表现出类似的收敛模式,如

访问受限。请登录或开始试用以查看此内容。

讨论

所提出的比较框架的整体成功在很大程度上依赖于多个实验步骤,包括高质量的行为标注、多样化的数据增强以及训练过程中稳定的收敛性监控。这些因素确保了模型性能的差异反映的是真实架构差异,而非数据或训练过程中的噪声。本研究系统评估了六种轻量级 YOLO 变体(v8n 至 v13n)在 CBVD-5 数据集上用于多类别牛行为检测的性能。在所有模型中,YOLOv11n 实现了最高的 mAP@50(0.967),而 YOLOv13n 在 mAP@50-95 上表现最佳(0.712)。YOLOv10n 具有最快的推理时间(1.2 ms),而 YOLOv13n 在保持紧凑模型尺寸(5.17 MB)的同时,展现出较强的检测精度和稳定的收敛性。在五种行为类别中,反刍行为的检测难度最大,因其细微且重复的下颌运动产生的运动线索较少,导致其在各类别中的 mAP@50-95 最低。

结果突显了在准确性、速度和模型复杂度之间的不同权衡。在模型优化过程中,由于类别不平衡和反刍样本稀疏,早期训练周期偶尔出现收敛不稳定现象。通过增强数据增强强度(旋转±10°,亮度/对比度±15%)并调整学习率调度策略,提升了训练稳定性。...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在任何竞争利益。

致谢

本工作由马来西亚理科大学桥梁资助项目资助,项目编号:R501-LR-RND003-0000001342-0000。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
大华 DH-NVR2216-HDS3 录像机Dahua Technologyhttps://www.dahuasecurity.com/
大华 DH-S3000C-16GT 千兆交换机Dahua Technologyhttps://www.dahuasecurity.com/
大华 M/K 监控摄像头(2.8 mm / 3.6 mm 镜头)Dahua Technologyhttps://www.dahuasecurity.com/
Google Colab ProGooglehttps://colab.research.google.com/
MatplotlibMatplotlib Communityhttps://matplotlib.org/
NVIDIA A100 GPUNVIDIAhttps://www.nvidia.com/en-us/data-center/a100/
NumPyNumPy Communityhttps://numpy.org/
OpenCVOpenCV.orghttps://opencv.org/
Optuna(超参数优化)Optuna.orghttps://optuna.org/
PandasPandas Communityhttps://pandas.pydata.org/
PyTorch(v2.0+)PyTorch Foundationhttps://pytorch.org/
Python(v3.10)Python Software Foundationhttps://www.python.org/
Roboflow TSL 数据集Roboflowhttps://roboflow.com/
Ubuntu 20.04 LTSCanonicalhttps://ubuntu.com/
Visual Studio CodeMicrosofthttps://code.visualstudio.com/
YOLOv13Ultralyticshttps://github.com/ultralytics/YOLOv13
YOLOv9Ultralyticshttps://github.com/ultralytics/YOLOv9

参考文献

  1. Li, K., Fan, D., Wu, H., Zhao, A. A new dataset for video-based cow behavior recognition. Sci Rep. 14 (1), 821-830 (2024).
  2. Tran, D. N., et al. Cows' behavior classification using acceleration data: a new, effective, and simple approach. J Comput Sci Cybern. 41 (1), 33-48 (2025).
  3. Bello, R. W., Talib, A., Mohamed, A. S. A. Deep learning-based architectures for recognition of cow using cow nose image pattern. Gazi Univ J Sci. 33 (2), 202-213 (2020).
  4. Ozella, L., et al. A computer vision approach for the automatic detection of social interactions of dairy cows in automatic milking systems. Acta IMEKO. 13 (3), 202-212 (2024).
  5. You only look once: unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , (2016).
  6. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. YOLOv7: trainable bag-of-freebies sets new state-of-the-art for real-time object detectors. arXiv. , (2022).
  7. Reis, D., Kupec, J., Hong, J., Daoudi, A. Real-time flying object detection with YOLOv8. arXiv. , (2023).
  8. Wang, C. Y., Yeh, I. H., Liao, H. Y. YOLOv9: learning what you want to learn using programmable gradient information. Lect Notes Comput Sci. 14640 (1), 1-21 (2024).
  9. Wang, A., et al. YOLOv10: real-time end-to-end object detection. arXiv. , (2024).
  10. Khanam, R., Hussain, M. YOLOv11: an overview of the key architectural enhancements. arXiv. , (2024).
  11. Ye, Q., Doermann, D. YOLOv12: attention-centric real-time object detectors. arXiv. , (2025).
  12. Lei, M., et al. YOLOv13: real-time object detection with hypergraph-enhanced adaptive visual perception. arXiv. , (2025).
  13. Object detection using YOLO: a survey. Tripathi, P., Gupta, M., Srivastava, C., Dixit, P., Pandey, S. Int Conf Softw Eng Technol (ICSET), 12 (1), 747-752 (2022).
  14. YOLO9000better: better, faster, stronger. Redmon, J., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , (2017).
  15. Batch normalization: accelerating deep network training by reducing internal covariate shift. Ioffe, S., Szegedy, C. Proc Int Conf Mach Learn (ICML), , (2015).
  16. Redmon, J., Farhadi, A. YOLOv3: an incremental improvement. arXiv. , (2018).
  17. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. YOLOv4: optimal speed and accuracy of object detection. arXiv. , (2020).
  18. Misra, D. Mish: a self-regularized non-monotonic neural activation function. arXiv. , (2019).
  19. Zhang, Z., et al. Bag of freebies for training object detection neural networks. arXiv. , (2019).
  20. Khanam, R., Hussain, M. What is YOLOv5? a deep look into the internal features of the popular object detector. arXiv. , (2024).
  21. Li, C., et al. YOLOv6: a single-stage object detection framework for industrial applications. arXiv. , (2022).
  22. Ding, X., et al. RepVGG: making VGG-style ConvNets great again. arXiv. , (2021).
  23. Jiao, L., Abdullah, M. I. YOLO series algorithms in object detection of unmanned aerial vehicles: a survey. Serv Oriented Comput Appl. 18 (1), 269-298 (2024).
  24. Ge, Z., Liu, S., Wang, F., Li, Z., Sun, J. YOLOX: exceeding YOLO series in 2021. arXiv. , (2021).
  25. Wang, C. Y., Yeh, I. H., Liao, H. Y. You only learn one representation: unified network for multiple tasks. arXiv. , (2021).
  26. A study on cow monitoring system for calving process. Sumi, K., Zin, T. T., Kobayashi, I., Horii, Y. Proc IEEE Glob Conf Consum Electron (GCCE), , (2017).
  27. Image technology-based cow identification system using deep learning. Zin, T. T., Phyo, C. N., Tin, P., Hama, H., Kobayashi, I. Proc Int Multiconf Eng Comput Sci (IMECS), 1, 236-247 (2018).
  28. Mu, Y., et al. Research on the behavior recognition of beef cattle based on the improved lightweight CBR-YOLO model derived from YOLOv8 in multi-scene weather. Animals. 14 (19), 2800(2024).
  29. Tong, L., Fang, J., Wang, X., Zhao, Y. Research on cattle behavior recognition and multi-object tracking algorithm based on YOLO-BoT. Animals. 14 (20), 2993(2024).
  30. Hao, W., et al. Cattle body detection based on YOLOv5-EMA for precision livestock farming. Animals. 13 (23), 3535(2023).
  31. Guarnido, P., Ramirez-Agudelo, J. F., Denimal, E., Benaouda, M. Programming and setting up the object detection algorithm YOLO to determine feeding activities of beef cattle: a comparison between YOLOv8m and YOLOv10m. Animals. 14 (19), 2821(2024).
  32. Liang, S., et al. Edge YOLO: real-time intelligent object detection system based on edge-cloud cooperation in autonomous vehicles. IEEE Trans Intell Transp Syst. 22 (12), 1-16 (2022).
  33. Rey, L., et al. A performance analysis of You Only Look Once models for deployment on constrained computational edge devices in drone applications. Electronics. 14 (3), 638(2025).
  34. Sen, A., Mishra, T., Dash, R. Novel human-machine interface via robust hand gesture recognition system using channel-pruned YOLOv5s model. arXiv. , (2024).
  35. Chen, R., Tian, X. Gesture detection and recognition based on object detection in complex background. Appl Sci. 13 (7), 4480(2023).
  36. Raj, R. R., Turuk, M., Jagdale, J., Anish, M. Performance comparison of different versions of YOLO for Indian sign language captioning in real time of multiple signers. Procedia Comput Sci. , 991-1000 (2025).
  37. Binti Aziz, A., et al. YOLO-V4 based detection of varied hand gestures in heterogeneous settings. Adv Intell Syst Comput. , Springer. Cham. (2024).
  38. Zhuang, H., Xia, Y., Wang, N., Dong, L. High inclusiveness and accuracy motion blur real-time gesture recognition based on YOLOv4 model combined attention mechanism and DeblurGanv2. Appl Sci. 11 (21), 9982(2021).
  39. Li, G., et al. Design and development of a broiler mortality removal robot. Appl Eng Agric. 38 (3), 401-409 (2022).
  40. Hao, H., et al. A dead broiler inspection system for large-scale breeding farms based on deep learning. Agriculture. 12 (8), 1176(2022).
  41. Yang, J., et al. A detection method for dead caged hens based on improved YOLOv7. Comput Electron Agric. 226, 109388(2024).
  42. Bist, R., Subedi, S., Yang, X., Chai, L. Automatic detection of cage-free dead hens with deep learning methods. AgriEngineering. 5 (2), 1020-1038 (2023).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

YOLO