Dieses Protokoll vergleicht sechs YOLO-Modelle für die Echtzeit-Erkennung des Rinderverhaltens, um das Wohlergehen und die Optimierung des Betriebsmanagements zu unterstützen.
Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.
Methodenartikel
Dieses Protokoll vergleicht sechs YOLO-Modelle für die Echtzeit-Erkennung des Rinderverhaltens, um das Wohlergehen und die Optimierung des Betriebsmanagements zu unterstützen.
Die Echtzeit- und genaue Erkennung des Verhaltens von Rindern ist entscheidend für die Verbesserung des Tierschutzes und die Optimierung der Tierhaltung. Um dieses Problem anzugehen, evaluiert diese Studie sechs von der Community entwickelte leichtgewichtige YOLO-Modelle (You Only Look Once) - YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n, YOLOv12n und YOLOv13n - umfassend, um fünf wichtige Verhaltensweisen von Rindern (Stehen, Liegen, Futtersuche, Trinken und Wiederkäuen) unter Verwendung des benutzerdefinierten CBVD-5-Datensatzes zu erkennen. Der Datensatz umfasst verschiedene Lichtverhältnisse und natürliche Stallumgebungen, um reale Überwachungsszenarien widerzuspiegeln. Alle Modelle wurden unter Verwendung von Standardmetriken zur Objekterkennung (Präzision, Abruf, mAP@50 und mAP@50-95) und einsatzorientierten Indikatoren wie Inferenzzeit, Frames pro Sekunde (FPS), Modellgröße und Trainingsdauer bewertet, um eine ausgewogene Bewertung der Genauigkeit und Effizienz zu ermöglichen. YOLOv13n erreichte den höchsten mAP@50-95 (0,712), während YOLOv11n den höchsten mAP@50 (0,967) erreichte und eine stabile Konvergenz mit einem guten Kompromiss zwischen Detektionsgenauigkeit und Inferenzgeschwindigkeit aufwies. YOLOv10n zeigte die schnellste Inferenzgeschwindigkeit (1,2 ms/Frame, ~833 FPS) und eignet sich daher gut für latenzempfindliche Anwendungen wie die kontinuierliche Stallüberwachung. Alle Modelle behielten kompakte Größen von unter 6 MB und einen Echtzeitdurchsatz von mehr als ~300 FPS bei, was ihre Praktikabilität für den Edge-Einsatz bestätigt. Die Ergebnisse etablieren ein reproduzierbares Benchmarking-Framework für die Bewertung moderner YOLO-Varianten und bieten Einblicke in die Modellauswahl für effiziente, skalierbare und tierschutzorientierte Tiermonitoringsysteme.
Die effiziente Überwachung des Verhaltens von Rindern ist in der Präzisionstierhaltung von entscheidender Bedeutung, da sie das Tierschutzmanagement, die Erkennung von Krankheiten und die Betriebsoptimierung unterstützt. Nicht-invasive sehbasierte Ansätze sind aufgrund ihrer Skalierbarkeit und Vielseitigkeit besonders vielversprechend. Standardisierte Datensätze wie CBVD-5 (Cow Behavior Video Dataset with 5 classes) bieten vielfältige Verhaltensannotationen über unterschiedliche Lichtverhältnisse hinweg und sind damit wertvolle Benchmarks in diesem Bereich1. In den meisten praktischen landwirtschaftlichen Betrieben werden die Kameras in einer moderaten Höhe mit relativ stabiler Beleuchtung befestigt, obwohl gelegentliche Verdeckungen bei Rindern die Erkennungsleistung beeinträchtigen können. Die Verhaltenserkennung bei Nutztieren steht weiterhin vor Herausforderungen wie Okklusion, Bewegungsvariabilität und spärlichen Trainingsdaten. Um diesen Herausforderungen zu begegnen, wurden in früheren Arbeiten sensorbasierte Ansätze2, Bildmustermodellierung3 und Ensemble-Deep-Learning-Strategien4 untersucht. Objekterkennungs-Frameworks wie YOLO (You Only Look Once), das erstmals von Redmon et al.5 vorgestellt wurde, und seine weiterentwickelte Version YOLOv76 zeichnen sich durch ihre Fähigkeit aus, Erkennungsgenauigkeit, Latenz und Recheneffizienz in Einklang zu bringen. In dieser Studie bezieht sich Echtzeitleistung auf das Erreichen einer Inferenzgeschwindigkeit von über 30 Bildern pro Sekunde (FPS), die eine reibungslose und kontinuierliche videobasierte Verhaltensverfolgung in praktischen landwirtschaftlichen Umgebungen gewährleistet. In dieser Studie wird die Leistung von YOLOv8n bis YOLOv13n auf dem CBVD-5-Datensatz systematisch bewertet, wobei der Schwerpunkt auf Echtzeit-Verhaltenserkennung und Einsatzeinschränkungen liegt. Jüngste Fortschritte in der YOLO-Architektur, einschließlich der Open-Community-Releases YOLOv87, YOLOv98, YOLOv109, YOLOv1110, YOLOv1211 und YOLOv1312, haben Verbesserungen bei der Erkennungsgenauigkeit und der Recheneffizienz eingeführt. Diese Modelle nutzen Innovationen wie Multitasking-Lernen, ankerfreie Köpfe und optimiertes Transferlernen und eignen sich daher besser für ressourcenbeschränkte Umgebungen, die typischerweise in großen Viehzuchtbetrieben anzutreffen sind. Unseres Wissens nach gibt es jedoch keine umfassende Studie, die diese Modelle speziell für die Verhaltenserkennung von Rindern evaluiert. Um diese Lücke zu schließen, führen wir eine vergleichende Bewertung aktueller YOLO-Modelle (v8n-v13n) zur Erkennung des Verhaltens von Rindern durch, indem wir einen Datensatz verwenden, der entwickelt wurde, um reale landwirtschaftliche Umgebungen zu simulieren. Die Modelle werden anhand von Standard-Erkennungsmetriken wie mittlerer durchschnittlicher Präzision (mAP), Präzision, Rückruf, Inferenzzeit und FPS bewertet, um zu bestimmen, welche Variante am besten für Echtzeit-Rinderüberwachungsanwendungen unter landwirtschaftlichen Bedingungen geeignet ist. Anstatt eine neue Architektur vorzuschlagen, etabliert diese Studie einen systematischen und reproduzierbaren Benchmarking-Rahmen für aktuelle YOLO-Varianten im Kontext der Überwachung des Verhaltens von Nutztieren und schließt damit eine Lücke in der aktuellen Literatur, in der ihre vergleichende Leistung weitgehend unerforscht bleibt.
Die YOLO-Familie von Objektdetektoren hat das Echtzeit-Computer-Vision erheblich verbessert, insbesondere bei Anwendungen, die sowohl Geschwindigkeit als auch Genauigkeit erfordern. Bei der Erkennung des Verhaltens von Rindern, bei der die Echtzeitüberwachung von Tierbewegungen unerlässlich ist, ist YOLO aufgrund seiner Ausgewogenheit dieser Attribute sehr effektiv. Dieser Bericht skizziert die Entwicklung der YOLO-Modelle, von den frühen Versionen bis zu den neuesten, und hebt wichtige Innovationen hervor, die für die Erkennung des Rinderverhaltens relevant sind. Jede Iteration hat zu Verbesserungen der Erkennungsgeschwindigkeit, Genauigkeit und Robustheit unter Betriebsbedingungen geführt, so dass YOLO-Modelle zunehmend für die Überwachung von Rindern in dynamischen Umgebungen geeignet sind.
Die frühen Generationen von YOLO (v1-v3) legten die Grundlage für die einstufige Objekterkennung, indem sie Klassifizierung und Lokalisierung in einem einzigen Regressionsrahmen vereinten. Diese Versionen verbesserten nach und nach die Inferenzgeschwindigkeit, die räumliche Präzision und die Multiskalen-Detektionsfähigkeit und legten damit den Grundstein für die Anwendung von YOLO in der Verhaltensanalyse von Nutztieren und anderen landwirtschaftlichen Echtzeitszenarien 13,14,15,16. Mit der Veröffentlichung von YOLOv4 im Jahr 2020 wurde die Architektur weiter verfeinert, darunter die Einführung des Cross Stage Partial (CSP)-Backbones, der Mish-Aktivierung und fortschrittlicher Feature-Aggregationstechniken 17,18,19. Diese Aktualisierungen haben die Modellleistung bei kleineren Datensätzen verbessert, ein häufiges Szenario bei der Erkennung des Verhaltens von Nutztieren aufgrund begrenzter annotierter Stichproben für seltene Ereignisse. Das von der Community getragene YOLOv5-Projekt, das 2020 von Ultralytics ins Leben gerufen wurde, fand aufgrund seines modularen Designs und der einfachen Bereitstellung über ein PyTorch-Framework20 breite Akzeptanz. Obwohl YOLOv5 nicht von einer von Experten begutachteten Arbeit begleitet wurde, wurde es aufgrund seiner starken Balance zwischen Genauigkeit und Einsatzflexibilität de facto zu einer Grundlage für Echtzeit-Detektionsaufgaben bei Rindern. YOLOv6, das 2022 veröffentlicht wurde, legte Wert auf ein hardwarefreundliches Design mit dem EfficientRep-Backbone und dem Rep-PAN-Hals21,22. Durch die Integration einer ankerfreien Detektion verbesserte das Modell die Robustheit in Szenarien mit Okklusion und teilweiser Sicht, Bedingungen, die häufig in überfüllten Rinderumgebungen auftreten. YOLOv7 optimierte die Recheneffizienz durch die E-ELAN-Architektur weiter und ermöglichte ein schnelleres Training und eine verbesserte Leistung über mehrere Erkennungsskalen hinweg23. Gleichzeitig bieten alternative Modelle wie YOLOX24 und YOLOR25 eine fortschrittliche Erkennungsgeschwindigkeit und Generalisierung, beides wesentliche Attribute für Tierüberwachungssysteme im Freien. Die Version 2023 von YOLOv8 von Ultralytics führte mehrere architektonische Modifikationen ein, darunter ankerfreie Köpfe, strukturelle Reparametrisierung und stärkere Erweiterungsstrategien. Diese Updates führten zu erheblichen Verbesserungen sowohl bei der Erkennungsgenauigkeit als auch bei der Inferenzgeschwindigkeit, was YOLOv8 zu einer wettbewerbsfähigen Option für die Echtzeit-Verhaltensanalyse von Rindern macht. Die Entwicklung setzte sich mit dem Aufkommen von YOLOv9, YOLOv10, YOLOv11, YOLOv12 und YOLOv13 fort. YOLOv9 integriert Multitasking-Lernen, um gemeinsam Klassifizierung, Lokalisierung und Hilfsaufgaben wie die Schlüsselpunkterkennung zu verbessern. YOLOv10 baute auf dieser Grundlage auf, indem Domänenanpassungsmodule und segmentierungsbewusste Aufmerksamkeitsmechanismen eingebettet wurden. YOLOv11 führte selbstüberwachte Trainingsprotokolle ein, die die Abhängigkeit von vollständig gekennzeichneten Daten reduzierten und Vorteile bei datenarmen Anwendungen wie der Überwachung des Rinderverhaltens boten. YOLOv12 legte den Schwerpunkt auf eine verbesserte Feature-Fusion und eine dynamische Reparametrisierung. Schließlich enthielt YOLOv13 transformatorbasierte Module und räumlich-zeitliche Aufmerksamkeit, die eine überlegene Leistung für eine Hochgeschwindigkeitserkennung mit geringer Latenz in komplexen landwirtschaftlichen Echtzeitszenarien bieten.
In den letzten Jahren haben sich YOLO-basierte Deep-Learning-Modelle aufgrund ihrer Effizienz und Genauigkeit für die automatisierte und Echtzeit-Verhaltensüberwachung von Rindern durchgesetzt. Vor der Einführung von YOLO-basierten Detektoren hatten mehrere frühe bildverarbeitungsbasierte Systeme die Machbarkeit einer bildgesteuerten Tierüberwachung demonstriert. So entwickelten Sumi et al. ein Kuhüberwachungssystem zur Kalbungserkennung mittels Bewegungsmerkmalsanalyse26, während Zin et al. ein Deep-Learning-basiertes Framework zur Kuhidentifikation vorschlugen, das eine Erkennungsgenauigkeit von 97 % erreichte27. Diese Arbeiten legten den Grundstein für nachfolgende Ansätze zur Objektdetektion in der Präzisionstierhaltung. In mehreren Studien wurden verschiedene YOLO-Varianten für die Verhaltensklassifizierung, Bewegungsverfolgung und Haltungserkennung unter verschiedenen Bedingungen angewendet. Zum Beispiel schlugen Mu et al. ein verbessertes, leichtgewichtiges Cattle Behavior Recognition-YOLO28 (CBR-YOLO) Modell vor, das auf YOLOv8 basiert und für die Wetteranpassung in mehreren Szenen optimiert ist. Das Modell erreichte eine mittlere Genauigkeit von 90,2 % bei gleichzeitiger signifikanter Reduzierung der Parameteranzahl. Tong et al. stellten das YOLO-BoT-Modell29 vor, das Aufmerksamkeits- und Transformator-basierte Module in YOLOv8 für die Erkennung und Verfolgung des Verhaltens von Rindern in komplexen Umgebungen integriert und eine Detektions-mAP von 91,7 % bei 31,2 FPS erreicht. Hao et al. integrierten einen Efficient Multi-Scale Attention (EMA)-Mechanismus in YOLOv530 (YOLOv5-EMA), der die Erkennungsleistung für Körperteile von Rindern (z. B. Kopf, Beine) verbesserte und mAP-Werte zwischen 94,8 % und 95,5 % erreichte. Guarnido-Lopez et al.31 untersuchten YOLOv8 und YOLOv10 für die Erkennung von fütterungsbezogenem Verhalten (z.B. Kauen, Beißen, Annähern) bei Charolais-Bullen und berichteten, dass YOLOv10 YOLOv8 in den Bereichen mAP@50, mAP@50-95, Präzision und Rückruf leicht übertraf, während YOLOv8 eine schnellere Konvergenz und eine geringere Überanpassung aufwies. Während YOLOv1 bis YOLOv8 für Aufgaben im Zusammenhang mit der Tierhaltung weit verbreitet und validiert wurden, ist die Anwendbarkeit von YOLOv9 bis YOLOv13 in diesem Bereich noch wenig erforscht. Bisher gab es keine umfassende Evaluierung dieser neueren Modelle zur Erkennung des Verhaltens von Rindern, was eine kritische Lücke in der bestehenden Forschung aufzeigt und zu weiteren Untersuchungen ihrer Leistung in der Praxis motiviert.
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
1. Vorbereitung des Datensatzes
HINWEIS: In dieser Studie wurden keine neuen Tierversuche durchgeführt. Alle Daten stammen aus dem öffentlich zugänglichen CBVD-5-Datensatz, der von seinen ursprünglichen Autoren in Übereinstimmung mit den Richtlinien für die institutionelle Tierpflege erhoben und veröffentlicht wurde. Daher war für diese Arbeit keine zusätzliche ethische Genehmigung erforderlich.
2. Modellauswahl und -einrichtung
3. Modell-Training
4. Evaluierung des Modells
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
In diesem Abschnitt werden die Evaluierungsergebnisse der Modelle YOLOv8 bis YOLOv13 auf dem CBVD-5-Datensatz für die Multi-Behavior-Rindererkennung vorgestellt. Die Analyse konzentriert sich auf die Erkennungsgenauigkeit, die Trainingskonvergenz, die Verhaltensverteilung und die Eignung für den Einsatz in Umgebungen mit begrenzten Ressourcen. Die Qualität des Datensatzes und die Ausgewogenheit der Klassen folgen den im Protokoll (70/20/10) beschriebenen Aufteilungen, um eine konsistente Darstellung aller fünf Verhaltens...
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Der Gesamterfolg des vorgeschlagenen Vergleichsrahmens hängt entscheidend von mehreren Protokollschritten ab, darunter eine qualitativ hochwertige Verhaltensannotation, eine vielfältige Datenerweiterung und eine stabile Konvergenzüberwachung während des Trainings. Diese Faktoren stellen sicher, dass die Leistungsunterschiede des Modells die tatsächliche Variation der Architektur und nicht die Daten oder das Trainingsrauschen widerspiegeln. In dieser Studie wurden systematisch sechs leich...
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Die Autoren erklären, dass sie keine konkurrierenden Interessen haben.
Diese Arbeit wurde durch ein Überbrückungsstipendium der Universiti Sains Malaysia finanziert, Projektnummer: R501-LR-RND003-0000001342-0000.
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
| Name | Unternehmen | Katalognummer | Kommentare |
|---|---|---|---|
| Dahua DH-NVR2216-HDS3 Recorder | Dahua-Technologie | https://www.dahuasecurity.com/ | |
| Dahua DH-S3000C-16GT Gigabit-Switch | Dahua-Technologie | https://www.dahuasecurity.com/ | |
| Dahua M/K Überwachungskamera (2,8 mm / 3,6 mm Objektiv) | Dahua-Technologie | https://www.dahuasecurity.com/ | |
| Google Colab Pro | Googeln | https://colab.research.google.com/ | |
| Matplotlib | Matplotlib-Gemeinschaft | https://matplotlib.org/ | |
| NVIDIA A100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/a100/ | |
| NumPy | NumPy-Gemeinschaft | https://numpy.org/ | |
| OpenCV | OpenCV.org | https://opencv.org/ | |
| Optuna (Hyperparameter-Optimierung) | Optuna.org | https://optuna.org/ | |
| Pandas | Pandas-Gemeinschaft | https://pandas.pydata.org/ | |
| PyTorch (v2.0+) | PyTorch Stiftung | https://pytorch.org/ | |
| Python (v3.10) | Python Software Foundation | https://www.python.org/ | |
| Roboflow TSL-Datensatz | Roboflow | https://roboflow.com/ | |
| Ubuntu 20.04 LTS | Kanonisch | https://ubuntu.com/ | |
| Visual Studio Code | Microsoft | https://code.visualstudio.com/ | |
| YOLOv13 | Ultralytika | https://github.com/ultralytics/YOLOv13 | |
| YOLOv9 | Ultralytika | https://github.com/ultralytics/YOLOv9 |
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.