Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Methodenartikel

Benchmarking von YOLOv8-v13-Architekturen für intelligentes Echtzeit-Rindermonitoring und datengesteuertes Farmmanagement in der Präzisionstierhaltung

959 Ansichten

DOI:

10.3791/69490

14. November 2025

In diesem Artikel

Zusammenfassung

Dieses Protokoll vergleicht sechs YOLO-Modelle für die Echtzeit-Erkennung des Rinderverhaltens, um das Wohlergehen und die Optimierung des Betriebsmanagements zu unterstützen.

Zusammenfassung

Die Echtzeit- und genaue Erkennung des Verhaltens von Rindern ist entscheidend für die Verbesserung des Tierschutzes und die Optimierung der Tierhaltung. Um dieses Problem anzugehen, evaluiert diese Studie sechs von der Community entwickelte leichtgewichtige YOLO-Modelle (You Only Look Once) - YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n, YOLOv12n und YOLOv13n - umfassend, um fünf wichtige Verhaltensweisen von Rindern (Stehen, Liegen, Futtersuche, Trinken und Wiederkäuen) unter Verwendung des benutzerdefinierten CBVD-5-Datensatzes zu erkennen. Der Datensatz umfasst verschiedene Lichtverhältnisse und natürliche Stallumgebungen, um reale Überwachungsszenarien widerzuspiegeln. Alle Modelle wurden unter Verwendung von Standardmetriken zur Objekterkennung (Präzision, Abruf, mAP@50 und mAP@50-95) und einsatzorientierten Indikatoren wie Inferenzzeit, Frames pro Sekunde (FPS), Modellgröße und Trainingsdauer bewertet, um eine ausgewogene Bewertung der Genauigkeit und Effizienz zu ermöglichen. YOLOv13n erreichte den höchsten mAP@50-95 (0,712), während YOLOv11n den höchsten mAP@50 (0,967) erreichte und eine stabile Konvergenz mit einem guten Kompromiss zwischen Detektionsgenauigkeit und Inferenzgeschwindigkeit aufwies. YOLOv10n zeigte die schnellste Inferenzgeschwindigkeit (1,2 ms/Frame, ~833 FPS) und eignet sich daher gut für latenzempfindliche Anwendungen wie die kontinuierliche Stallüberwachung. Alle Modelle behielten kompakte Größen von unter 6 MB und einen Echtzeitdurchsatz von mehr als ~300 FPS bei, was ihre Praktikabilität für den Edge-Einsatz bestätigt. Die Ergebnisse etablieren ein reproduzierbares Benchmarking-Framework für die Bewertung moderner YOLO-Varianten und bieten Einblicke in die Modellauswahl für effiziente, skalierbare und tierschutzorientierte Tiermonitoringsysteme.

Einleitung

Die effiziente Überwachung des Verhaltens von Rindern ist in der Präzisionstierhaltung von entscheidender Bedeutung, da sie das Tierschutzmanagement, die Erkennung von Krankheiten und die Betriebsoptimierung unterstützt. Nicht-invasive sehbasierte Ansätze sind aufgrund ihrer Skalierbarkeit und Vielseitigkeit besonders vielversprechend. Standardisierte Datensätze wie CBVD-5 (Cow Behavior Video Dataset with 5 classes) bieten vielfältige Verhaltensannotationen über unterschiedliche Lichtverhältnisse hinweg und sind damit wertvolle Benchmarks in diesem Bereich1. In den meisten praktischen landwirtschaftlichen Betrieben werden die Kameras in einer moderaten Höhe mit relativ stabiler Beleuchtung befestigt, obwohl gelegentliche Verdeckungen bei Rindern die Erkennungsleistung beeinträchtigen können. Die Verhaltenserkennung bei Nutztieren steht weiterhin vor Herausforderungen wie Okklusion, Bewegungsvariabilität und spärlichen Trainingsdaten. Um diesen Herausforderungen zu begegnen, wurden in früheren Arbeiten sensorbasierte Ansätze2, Bildmustermodellierung3 und Ensemble-Deep-Learning-Strategien4 untersucht. Objekterkennungs-Frameworks wie YOLO (You Only Look Once), das erstmals von Redmon et al.5 vorgestellt wurde, und seine weiterentwickelte Version YOLOv76 zeichnen sich durch ihre Fähigkeit aus, Erkennungsgenauigkeit, Latenz und Recheneffizienz in Einklang zu bringen. In dieser Studie bezieht sich Echtzeitleistung auf das Erreichen einer Inferenzgeschwindigkeit von über 30 Bildern pro Sekunde (FPS), die eine reibungslose und kontinuierliche videobasierte Verhaltensverfolgung in praktischen landwirtschaftlichen Umgebungen gewährleistet. In dieser Studie wird die Leistung von YOLOv8n bis YOLOv13n auf dem CBVD-5-Datensatz systematisch bewertet, wobei der Schwerpunkt auf Echtzeit-Verhaltenserkennung und Einsatzeinschränkungen liegt. Jüngste Fortschritte in der YOLO-Architektur, einschließlich der Open-Community-Releases YOLOv87, YOLOv98, YOLOv109, YOLOv1110, YOLOv1211 und YOLOv1312, haben Verbesserungen bei der Erkennungsgenauigkeit und der Recheneffizienz eingeführt. Diese Modelle nutzen Innovationen wie Multitasking-Lernen, ankerfreie Köpfe und optimiertes Transferlernen und eignen sich daher besser für ressourcenbeschränkte Umgebungen, die typischerweise in großen Viehzuchtbetrieben anzutreffen sind. Unseres Wissens nach gibt es jedoch keine umfassende Studie, die diese Modelle speziell für die Verhaltenserkennung von Rindern evaluiert. Um diese Lücke zu schließen, führen wir eine vergleichende Bewertung aktueller YOLO-Modelle (v8n-v13n) zur Erkennung des Verhaltens von Rindern durch, indem wir einen Datensatz verwenden, der entwickelt wurde, um reale landwirtschaftliche Umgebungen zu simulieren. Die Modelle werden anhand von Standard-Erkennungsmetriken wie mittlerer durchschnittlicher Präzision (mAP), Präzision, Rückruf, Inferenzzeit und FPS bewertet, um zu bestimmen, welche Variante am besten für Echtzeit-Rinderüberwachungsanwendungen unter landwirtschaftlichen Bedingungen geeignet ist. Anstatt eine neue Architektur vorzuschlagen, etabliert diese Studie einen systematischen und reproduzierbaren Benchmarking-Rahmen für aktuelle YOLO-Varianten im Kontext der Überwachung des Verhaltens von Nutztieren und schließt damit eine Lücke in der aktuellen Literatur, in der ihre vergleichende Leistung weitgehend unerforscht bleibt.

Die YOLO-Familie von Objektdetektoren hat das Echtzeit-Computer-Vision erheblich verbessert, insbesondere bei Anwendungen, die sowohl Geschwindigkeit als auch Genauigkeit erfordern. Bei der Erkennung des Verhaltens von Rindern, bei der die Echtzeitüberwachung von Tierbewegungen unerlässlich ist, ist YOLO aufgrund seiner Ausgewogenheit dieser Attribute sehr effektiv. Dieser Bericht skizziert die Entwicklung der YOLO-Modelle, von den frühen Versionen bis zu den neuesten, und hebt wichtige Innovationen hervor, die für die Erkennung des Rinderverhaltens relevant sind. Jede Iteration hat zu Verbesserungen der Erkennungsgeschwindigkeit, Genauigkeit und Robustheit unter Betriebsbedingungen geführt, so dass YOLO-Modelle zunehmend für die Überwachung von Rindern in dynamischen Umgebungen geeignet sind.

Die frühen Generationen von YOLO (v1-v3) legten die Grundlage für die einstufige Objekterkennung, indem sie Klassifizierung und Lokalisierung in einem einzigen Regressionsrahmen vereinten. Diese Versionen verbesserten nach und nach die Inferenzgeschwindigkeit, die räumliche Präzision und die Multiskalen-Detektionsfähigkeit und legten damit den Grundstein für die Anwendung von YOLO in der Verhaltensanalyse von Nutztieren und anderen landwirtschaftlichen Echtzeitszenarien 13,14,15,16. Mit der Veröffentlichung von YOLOv4 im Jahr 2020 wurde die Architektur weiter verfeinert, darunter die Einführung des Cross Stage Partial (CSP)-Backbones, der Mish-Aktivierung und fortschrittlicher Feature-Aggregationstechniken 17,18,19. Diese Aktualisierungen haben die Modellleistung bei kleineren Datensätzen verbessert, ein häufiges Szenario bei der Erkennung des Verhaltens von Nutztieren aufgrund begrenzter annotierter Stichproben für seltene Ereignisse. Das von der Community getragene YOLOv5-Projekt, das 2020 von Ultralytics ins Leben gerufen wurde, fand aufgrund seines modularen Designs und der einfachen Bereitstellung über ein PyTorch-Framework20 breite Akzeptanz. Obwohl YOLOv5 nicht von einer von Experten begutachteten Arbeit begleitet wurde, wurde es aufgrund seiner starken Balance zwischen Genauigkeit und Einsatzflexibilität de facto zu einer Grundlage für Echtzeit-Detektionsaufgaben bei Rindern. YOLOv6, das 2022 veröffentlicht wurde, legte Wert auf ein hardwarefreundliches Design mit dem EfficientRep-Backbone und dem Rep-PAN-Hals21,22. Durch die Integration einer ankerfreien Detektion verbesserte das Modell die Robustheit in Szenarien mit Okklusion und teilweiser Sicht, Bedingungen, die häufig in überfüllten Rinderumgebungen auftreten. YOLOv7 optimierte die Recheneffizienz durch die E-ELAN-Architektur weiter und ermöglichte ein schnelleres Training und eine verbesserte Leistung über mehrere Erkennungsskalen hinweg23. Gleichzeitig bieten alternative Modelle wie YOLOX24 und YOLOR25 eine fortschrittliche Erkennungsgeschwindigkeit und Generalisierung, beides wesentliche Attribute für Tierüberwachungssysteme im Freien. Die Version 2023 von YOLOv8 von Ultralytics führte mehrere architektonische Modifikationen ein, darunter ankerfreie Köpfe, strukturelle Reparametrisierung und stärkere Erweiterungsstrategien. Diese Updates führten zu erheblichen Verbesserungen sowohl bei der Erkennungsgenauigkeit als auch bei der Inferenzgeschwindigkeit, was YOLOv8 zu einer wettbewerbsfähigen Option für die Echtzeit-Verhaltensanalyse von Rindern macht. Die Entwicklung setzte sich mit dem Aufkommen von YOLOv9, YOLOv10, YOLOv11, YOLOv12 und YOLOv13 fort. YOLOv9 integriert Multitasking-Lernen, um gemeinsam Klassifizierung, Lokalisierung und Hilfsaufgaben wie die Schlüsselpunkterkennung zu verbessern. YOLOv10 baute auf dieser Grundlage auf, indem Domänenanpassungsmodule und segmentierungsbewusste Aufmerksamkeitsmechanismen eingebettet wurden. YOLOv11 führte selbstüberwachte Trainingsprotokolle ein, die die Abhängigkeit von vollständig gekennzeichneten Daten reduzierten und Vorteile bei datenarmen Anwendungen wie der Überwachung des Rinderverhaltens boten. YOLOv12 legte den Schwerpunkt auf eine verbesserte Feature-Fusion und eine dynamische Reparametrisierung. Schließlich enthielt YOLOv13 transformatorbasierte Module und räumlich-zeitliche Aufmerksamkeit, die eine überlegene Leistung für eine Hochgeschwindigkeitserkennung mit geringer Latenz in komplexen landwirtschaftlichen Echtzeitszenarien bieten.

In den letzten Jahren haben sich YOLO-basierte Deep-Learning-Modelle aufgrund ihrer Effizienz und Genauigkeit für die automatisierte und Echtzeit-Verhaltensüberwachung von Rindern durchgesetzt. Vor der Einführung von YOLO-basierten Detektoren hatten mehrere frühe bildverarbeitungsbasierte Systeme die Machbarkeit einer bildgesteuerten Tierüberwachung demonstriert. So entwickelten Sumi et al. ein Kuhüberwachungssystem zur Kalbungserkennung mittels Bewegungsmerkmalsanalyse26, während Zin et al. ein Deep-Learning-basiertes Framework zur Kuhidentifikation vorschlugen, das eine Erkennungsgenauigkeit von 97 % erreichte27. Diese Arbeiten legten den Grundstein für nachfolgende Ansätze zur Objektdetektion in der Präzisionstierhaltung. In mehreren Studien wurden verschiedene YOLO-Varianten für die Verhaltensklassifizierung, Bewegungsverfolgung und Haltungserkennung unter verschiedenen Bedingungen angewendet. Zum Beispiel schlugen Mu et al. ein verbessertes, leichtgewichtiges Cattle Behavior Recognition-YOLO28 (CBR-YOLO) Modell vor, das auf YOLOv8 basiert und für die Wetteranpassung in mehreren Szenen optimiert ist. Das Modell erreichte eine mittlere Genauigkeit von 90,2 % bei gleichzeitiger signifikanter Reduzierung der Parameteranzahl. Tong et al. stellten das YOLO-BoT-Modell29 vor, das Aufmerksamkeits- und Transformator-basierte Module in YOLOv8 für die Erkennung und Verfolgung des Verhaltens von Rindern in komplexen Umgebungen integriert und eine Detektions-mAP von 91,7 % bei 31,2 FPS erreicht. Hao et al. integrierten einen Efficient Multi-Scale Attention (EMA)-Mechanismus in YOLOv530 (YOLOv5-EMA), der die Erkennungsleistung für Körperteile von Rindern (z. B. Kopf, Beine) verbesserte und mAP-Werte zwischen 94,8 % und 95,5 % erreichte. Guarnido-Lopez et al.31 untersuchten YOLOv8 und YOLOv10 für die Erkennung von fütterungsbezogenem Verhalten (z.B. Kauen, Beißen, Annähern) bei Charolais-Bullen und berichteten, dass YOLOv10 YOLOv8 in den Bereichen mAP@50, mAP@50-95, Präzision und Rückruf leicht übertraf, während YOLOv8 eine schnellere Konvergenz und eine geringere Überanpassung aufwies. Während YOLOv1 bis YOLOv8 für Aufgaben im Zusammenhang mit der Tierhaltung weit verbreitet und validiert wurden, ist die Anwendbarkeit von YOLOv9 bis YOLOv13 in diesem Bereich noch wenig erforscht. Bisher gab es keine umfassende Evaluierung dieser neueren Modelle zur Erkennung des Verhaltens von Rindern, was eine kritische Lücke in der bestehenden Forschung aufzeigt und zu weiteren Untersuchungen ihrer Leistung in der Praxis motiviert.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

1. Vorbereitung des Datensatzes

HINWEIS: In dieser Studie wurden keine neuen Tierversuche durchgeführt. Alle Daten stammen aus dem öffentlich zugänglichen CBVD-5-Datensatz, der von seinen ursprünglichen Autoren in Übereinstimmung mit den Richtlinien für die institutionelle Tierpflege erhoben und veröffentlicht wurde. Daher war für diese Arbeit keine zusätzliche ethische Genehmigung erforderlich.

  1. Der Datensatz besteht aus kontinuierlichen Überwachungsaufzeichnungen, die von sieben Dahua-Kameras (2,8-mm- und 3,6-mm-Objektive, Modell M/K) aufgenommen wurden, die über Gigabit-Switches und Netzwerk-Videorekorder verbunden sind und 5 Tage ununterbrochene Beobachtung unter Standardlichtbedingungen im Stall abdecken.
  2. Extrahieren Sie repräsentative Frames, um 25.000 kommentierte Keyframes zu erhalten, um zeitliche Vielfalt über alle Verhaltenstypen hinweg zu gewährleisten. Kommentieren Sie fünf Verhaltensklassen: Stehen, Liegen, Futtersuche, Trinken und Grübeln mit dem VGG Image Annotator (VIA v3.0.11) nach dem AVA-Bounding-Box-Format. Erstellen Sie ein einheitliches VIA-Projekt mit dem Labelschema {stehend, liegend, sammelnd, trinkend, wiederkäuend}. Exportieren Sie dann die Anmerkungen als JSON-Dateien und konvertieren Sie sie mit Roboflow in das YOLO-kompatible TXT-Format (setzen Sie in den Projekteinstellungen normalisierung = True und eine Klasse pro Zeile).
  3. Ändern Sie die Größe aller Bilder auf 640 × 640 Pixel und wenden Sie die automatische Ausrichtung an.
  4. Führen Sie eine Datenerweiterung in Roboflow durch, indem Sie zufällige horizontale Flips (p = 0,5), Drehungen innerhalb von ±10 und Helligkeits-/Kontrastvariationen innerhalb von ±15 % anwenden, um die Modellgeneralisierung zu verbessern.
  5. Teilen Sie das Dataset in Trainings-, Validierungs- und Testteilmengen im Verhältnis 70/20/10 (2049/585/293 Bilder) auf.

2. Modellauswahl und -einrichtung

  1. Wählen Sie sechs einfache YOLO-Architekturen aus: YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n, YOLOv12n und YOLOv13n.
  2. Zeichnen Sie Modellspezifikationen auf, einschließlich der Gesamtzahl der Layer, der Parameteranzahl und der GFLOPs, um die Rechenanforderungen zu vergleichen, wie in Tabelle 1 zusammengefasst.
  3. Die in dieser Studie verwendete Computerumgebung und die Hardware-Software-Spezifikationen sind in der Materialtabelle aufgeführt. Deterministische Zufallswerte wurden zur Reproduzierbarkeit auf 0, 42, 1337 festgelegt.
  4. Initialisieren Sie jedes Modell mit offiziellen vortrainierten Gewichtungen (z. B. yolov10n.pt yolov13n.pt).

3. Modell-Training

  1. Trainieren Sie alle YOLO-Modelle unter identischen experimentellen Einstellungen mit dem Ultralytics YOLO (v8.3.63) Framework.
  2. Fixieren Sie die Eingangsauflösung auf 640 × 640 Pixel, mit Batchgröße = 128 und einer anfänglichen Lernrate von 0,01 (SGD-Optimierer, Cosinus-Scheduler).
  3. Repräsentativer Trainingsbefehl für jedes Modell (Beispiel: YOLOv8n):
    Ergebnisse = model.train(
    data=f'{Datensatz.Standort}/daten.yaml',
    epochen=800,
    Geduld=30,
    Charge = 128,
    imgsz=640,
    name='yolov8n_test_800_epoch',
    save_period=100,
    pretrained=Wahr,
    amp=Wahr,
    Arbeiter=16,
    Startwert = 1337
    )
  4. Wenden Sie einen frühen Stopp an, wenn die interne Validierungstauglichkeitsmetrik (gewichtete Kombination aus Präzision, Erinnerung und mAP@50-95) für 30 aufeinanderfolgende Epochen ein Plateau erreichte.
  5. Wählen Sie für jeden Lauf den besten Prüfpunkt basierend auf der höchsten Validierung mAP@50-95 aus, und mitteln Sie die endgültigen Werte über drei Startwerte (0, 42, 1337), um die Reproduzierbarkeit sicherzustellen.
  6. Schließen Sie größere Varianten (z. B. YOLOv10m, YOLOv11l) aufgrund des hohen Ressourcenbedarfs aus, um die Machbarkeit auf Edge-Gerätensicherzustellen 32.

4. Evaluierung des Modells

  1. Die Modellleistung wurde mit der integrierten Validierungsfunktion von Ultralytics bewertet:
    Metriken = model.val(data=f'{dataset.location}/data.yaml', split='test')
  2. Berechnen Sie mAP@50 und mAP@50-95.
  3. Generieren Sie Konfusionsmatrizen, um die klassenweise Leistung zu untersuchen.
  4. Effizienzbezogene Metriken wie Latenz (ms/Frame), FPS, Modellgröße (MB) und Trainingsdauer wurden automatisch protokolliert. Hier wurde FPS als Kehrwert der gesamten Ausführungszeit pro Frame berechnet, die die Vorverarbeitungs-, Modellinferenz- und Nachbearbeitungsphasen umfasste.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

In diesem Abschnitt werden die Evaluierungsergebnisse der Modelle YOLOv8 bis YOLOv13 auf dem CBVD-5-Datensatz für die Multi-Behavior-Rindererkennung vorgestellt. Die Analyse konzentriert sich auf die Erkennungsgenauigkeit, die Trainingskonvergenz, die Verhaltensverteilung und die Eignung für den Einsatz in Umgebungen mit begrenzten Ressourcen. Die Qualität des Datensatzes und die Ausgewogenheit der Klassen folgen den im Protokoll (70/20/10) beschriebenen Aufteilungen, um eine konsistente Darstellung aller fünf Verhaltens...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Der Gesamterfolg des vorgeschlagenen Vergleichsrahmens hängt entscheidend von mehreren Protokollschritten ab, darunter eine qualitativ hochwertige Verhaltensannotation, eine vielfältige Datenerweiterung und eine stabile Konvergenzüberwachung während des Trainings. Diese Faktoren stellen sicher, dass die Leistungsunterschiede des Modells die tatsächliche Variation der Architektur und nicht die Daten oder das Trainingsrauschen widerspiegeln. In dieser Studie wurden systematisch sechs leich...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren erklären, dass sie keine konkurrierenden Interessen haben.

Danksagungen

Diese Arbeit wurde durch ein Überbrückungsstipendium der Universiti Sains Malaysia finanziert, Projektnummer: R501-LR-RND003-0000001342-0000.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Dahua DH-NVR2216-HDS3 RecorderDahua-Technologiehttps://www.dahuasecurity.com/
Dahua DH-S3000C-16GT Gigabit-SwitchDahua-Technologiehttps://www.dahuasecurity.com/
Dahua M/K Überwachungskamera (2,8 mm / 3,6 mm Objektiv)Dahua-Technologiehttps://www.dahuasecurity.com/
Google Colab ProGoogelnhttps://colab.research.google.com/
MatplotlibMatplotlib-Gemeinschafthttps://matplotlib.org/
NVIDIA A100 GPUNVIDIAhttps://www.nvidia.com/en-us/data-center/a100/
NumPyNumPy-Gemeinschafthttps://numpy.org/
OpenCVOpenCV.orghttps://opencv.org/
Optuna (Hyperparameter-Optimierung)Optuna.orghttps://optuna.org/
PandasPandas-Gemeinschafthttps://pandas.pydata.org/
PyTorch (v2.0+)PyTorch Stiftunghttps://pytorch.org/
Python (v3.10)Python Software Foundationhttps://www.python.org/
Roboflow TSL-DatensatzRoboflowhttps://roboflow.com/
Ubuntu 20.04 LTSKanonischhttps://ubuntu.com/
Visual Studio CodeMicrosofthttps://code.visualstudio.com/
YOLOv13Ultralytikahttps://github.com/ultralytics/YOLOv13
YOLOv9Ultralytikahttps://github.com/ultralytics/YOLOv9

Referenzen

  1. Li, K., Fan, D., Wu, H., Zhao, A. A new dataset for video-based cow behavior recognition. Sci Rep. 14 (1), 821-830 (2024).
  2. Tran, D. N., et al. Cows' behavior classification using acceleration data: a new, effective, and simple approach. J Comput Sci Cybern. 41 (1), 33-48 (2025).
  3. Bello, R. W., Talib, A., Mohamed, A. S. A. Deep learning-based architectures for recognition of cow using cow nose image pattern. Gazi Univ J Sci. 33 (2), 202-213 (2020).
  4. Ozella, L., et al. A computer vision approach for the automatic detection of social interactions of dairy cows in automatic milking systems. Acta IMEKO. 13 (3), 202-212 (2024).
  5. You only look once: unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , (2016).
  6. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. YOLOv7: trainable bag-of-freebies sets new state-of-the-art for real-time object detectors. arXiv. , (2022).
  7. Reis, D., Kupec, J., Hong, J., Daoudi, A. Real-time flying object detection with YOLOv8. arXiv. , (2023).
  8. Wang, C. Y., Yeh, I. H., Liao, H. Y. YOLOv9: learning what you want to learn using programmable gradient information. Lect Notes Comput Sci. 14640 (1), 1-21 (2024).
  9. Wang, A., et al. YOLOv10: real-time end-to-end object detection. arXiv. , (2024).
  10. Khanam, R., Hussain, M. YOLOv11: an overview of the key architectural enhancements. arXiv. , (2024).
  11. Ye, Q., Doermann, D. YOLOv12: attention-centric real-time object detectors. arXiv. , (2025).
  12. Lei, M., et al. YOLOv13: real-time object detection with hypergraph-enhanced adaptive visual perception. arXiv. , (2025).
  13. Object detection using YOLO: a survey. Tripathi, P., Gupta, M., Srivastava, C., Dixit, P., Pandey, S. Int Conf Softw Eng Technol (ICSET), 12 (1), 747-752 (2022).
  14. YOLO9000better: better, faster, stronger. Redmon, J., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , (2017).
  15. Batch normalization: accelerating deep network training by reducing internal covariate shift. Ioffe, S., Szegedy, C. Proc Int Conf Mach Learn (ICML), , (2015).
  16. Redmon, J., Farhadi, A. YOLOv3: an incremental improvement. arXiv. , (2018).
  17. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. YOLOv4: optimal speed and accuracy of object detection. arXiv. , (2020).
  18. Misra, D. Mish: a self-regularized non-monotonic neural activation function. arXiv. , (2019).
  19. Zhang, Z., et al. Bag of freebies for training object detection neural networks. arXiv. , (2019).
  20. Khanam, R., Hussain, M. What is YOLOv5? a deep look into the internal features of the popular object detector. arXiv. , (2024).
  21. Li, C., et al. YOLOv6: a single-stage object detection framework for industrial applications. arXiv. , (2022).
  22. Ding, X., et al. RepVGG: making VGG-style ConvNets great again. arXiv. , (2021).
  23. Jiao, L., Abdullah, M. I. YOLO series algorithms in object detection of unmanned aerial vehicles: a survey. Serv Oriented Comput Appl. 18 (1), 269-298 (2024).
  24. Ge, Z., Liu, S., Wang, F., Li, Z., Sun, J. YOLOX: exceeding YOLO series in 2021. arXiv. , (2021).
  25. Wang, C. Y., Yeh, I. H., Liao, H. Y. You only learn one representation: unified network for multiple tasks. arXiv. , (2021).
  26. A study on cow monitoring system for calving process. Sumi, K., Zin, T. T., Kobayashi, I., Horii, Y. Proc IEEE Glob Conf Consum Electron (GCCE), , (2017).
  27. Image technology-based cow identification system using deep learning. Zin, T. T., Phyo, C. N., Tin, P., Hama, H., Kobayashi, I. Proc Int Multiconf Eng Comput Sci (IMECS), 1, 236-247 (2018).
  28. Mu, Y., et al. Research on the behavior recognition of beef cattle based on the improved lightweight CBR-YOLO model derived from YOLOv8 in multi-scene weather. Animals. 14 (19), 2800(2024).
  29. Tong, L., Fang, J., Wang, X., Zhao, Y. Research on cattle behavior recognition and multi-object tracking algorithm based on YOLO-BoT. Animals. 14 (20), 2993(2024).
  30. Hao, W., et al. Cattle body detection based on YOLOv5-EMA for precision livestock farming. Animals. 13 (23), 3535(2023).
  31. Guarnido, P., Ramirez-Agudelo, J. F., Denimal, E., Benaouda, M. Programming and setting up the object detection algorithm YOLO to determine feeding activities of beef cattle: a comparison between YOLOv8m and YOLOv10m. Animals. 14 (19), 2821(2024).
  32. Liang, S., et al. Edge YOLO: real-time intelligent object detection system based on edge-cloud cooperation in autonomous vehicles. IEEE Trans Intell Transp Syst. 22 (12), 1-16 (2022).
  33. Rey, L., et al. A performance analysis of You Only Look Once models for deployment on constrained computational edge devices in drone applications. Electronics. 14 (3), 638(2025).
  34. Sen, A., Mishra, T., Dash, R. Novel human-machine interface via robust hand gesture recognition system using channel-pruned YOLOv5s model. arXiv. , (2024).
  35. Chen, R., Tian, X. Gesture detection and recognition based on object detection in complex background. Appl Sci. 13 (7), 4480(2023).
  36. Raj, R. R., Turuk, M., Jagdale, J., Anish, M. Performance comparison of different versions of YOLO for Indian sign language captioning in real time of multiple signers. Procedia Comput Sci. , 991-1000 (2025).
  37. Binti Aziz, A., et al. YOLO-V4 based detection of varied hand gestures in heterogeneous settings. Adv Intell Syst Comput. , Springer. Cham. (2024).
  38. Zhuang, H., Xia, Y., Wang, N., Dong, L. High inclusiveness and accuracy motion blur real-time gesture recognition based on YOLOv4 model combined attention mechanism and DeblurGanv2. Appl Sci. 11 (21), 9982(2021).
  39. Li, G., et al. Design and development of a broiler mortality removal robot. Appl Eng Agric. 38 (3), 401-409 (2022).
  40. Hao, H., et al. A dead broiler inspection system for large-scale breeding farms based on deep learning. Agriculture. 12 (8), 1176(2022).
  41. Yang, J., et al. A detection method for dead caged hens based on improved YOLOv7. Comput Electron Agric. 226, 109388(2024).
  42. Bist, R., Subedi, S., Yang, X., Chai, L. Automatic detection of cage-free dead hens with deep learning methods. AgriEngineering. 5 (2), 1020-1038 (2023).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Schlagwörter

YOLO ArchitekturenDetektion von RinderverhaltenMetriken zur ObjekterkennungModell BenchmarkingEdge DeploymentTierwohlInferenzgeschwindigkeit