Protokół ten testuje sześć modeli YOLO do wykrywania zachowań bydła w czasie rzeczywistym, wspierając optymalizację dobrostanu i zarządzania gospodarstwem.
Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.
Artykuł metodologiczny
Protokół ten testuje sześć modeli YOLO do wykrywania zachowań bydła w czasie rzeczywistym, wspierając optymalizację dobrostanu i zarządzania gospodarstwem.
Dokładne wykrywanie zachowań bydła w czasie rzeczywistym jest kluczowe dla poprawy dobrostanu zwierząt i optymalizacji zarządzania zwierzętami. Aby temu sprostać, badanie kompleksowo ocenia sześć lekkich modeli YOLO (You Only Look Once) opracowanych przez społeczność – YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n, YOLOv12n oraz YOLOv13n – pod uwzględnieniem pięciu kluczowych zachowań bydła (stanie, leżenie, zbieranie, picie i ruminacja), korzystając z niestandardowego zbioru danych CBVD-5. Zbiór danych obejmuje różnorodne warunki oświetleniowe oraz naturalne środowiska stodoły, odzwierciedlające rzeczywiste scenariusze monitoringu. Wszystkie modele oceniano przy użyciu standardowych metryk wykrywania obiektów (precyzja, przypomnienie, mAP@50 oraz mAP@50-95) oraz wskaźników zorientowanych na wdrożenie, takich jak czas wnioskowania, klatki na sekundę (FPS), rozmiar modelu oraz czas treningu, aby zapewnić zrównoważoną ocenę dokładności i efektywności. YOLOv13n osiągnął najwyższe mAP@50-95 (0,712), podczas gdy YOLOv11n osiągnął najwyższy mAP@50 (0,967) i wykazał stabilną zbieżność z dobrym kompromisem między dokładnością wykrywania a szybkością wnioskowania. YOLOv10n wykazał najszybszą prędkość wnioskowania (1,2 ms/klatka, ~833 FPS), co czyni go dobrze przystosowanym do zastosowań wrażliwych na opóźnienia, takich jak ciągły nadzór stodoły. Wszystkie modele utrzymywały kompaktowe rozmiary poniżej 6 MB oraz przepustowość w czasie rzeczywistym przekraczającą ~300 FPS, co potwierdzało ich praktyczność do wdrożenia na krawędzi. Wyniki ustanawiają powtarzalne ramy benchmarkingowe do oceny nowoczesnych wariantów YOLO, oferując wgląd w dobór modeli dla efektywnych, skalowalnych i nastawionych na dobrostan systemów monitoringu zwierząt gospodarskich.
Efektywne monitorowanie zachowań bydła jest niezbędne w precyzyjnej hodowli zwierząt, wspierając zarządzanie dobrostanem, wykrywanie chorób oraz optymalizację operacyjną. Nieinwazyjne podejścia oparte na wzroku są szczególnie obiecujące ze względu na swoją skalowalność i wszechstronność. Standaryzowane zbiory danych, takie jak CBVD-5 (Cow Behavior Video Dataset with 5 classes), oferują różnorodne adnotacje zachowań w różnych warunkach oświetleniowych, co czyni je cennymi punktami odniesienia w tej dziedzinie1. W większości praktycznych warunków gospodarstw kamery są zamocowane na umiarkowanej wysokości przy stosunkowo stabilnym oświetleniu, choć sporadyczne zasłonienie u bydła może wpływać na wykrywanie. Rozpoznawanie zachowań u zwierząt gospodarskich nadal napotyka wyzwania takie jak zasłona, zmienność ruchu oraz rzadka ilość danych treningowych. Aby sprostać tym wyzwaniom, wcześniejsze prace dotyczyły podejść opartych na sensorach2, modelowania wzorców obrazowych3 oraz strategii głębokiego uczenia zespołowego4. Frameworki do wykrywania obiektów, takie jak YOLO (You Only Look Once), wprowadzone po raz pierwszy przez Redmona i in.5, oraz jego bardziej zaawansowana wersja YOLOv76, wyróżniają się zdolnością do równoważenia dokładności wykrywania, opóźnień i efektywności obliczeniowej. W niniejszym badaniu wydajność w czasie rzeczywistym oznacza osiągnięcie prędkości wnioskowania powyżej 30 klatek na sekundę (FPS), co zapewnia płynne i ciągłe śledzenie zachowań oparte na wideo w praktycznych warunkach farm. Badanie to systematycznie ocenia wydajność YOLOv8n do YOLOv13n na zbiorze danych CBVD-5, kładąc nacisk na ograniczenia wykrywania zachowań i wdrażania w czasie rzeczywistym. Najnowsze osiągnięcia architektury YOLO, w tym otwarte wydania społecznościowe YOLOv87, YOLOv98, YOLOv109, YOLOv1110, YOLOv1211 oraz YOLOv1312, wprowadziły poprawę w zakresie precyzji wykrywania i efektywności obliczeniowej. Modele te wykorzystują innowacje takie jak uczenie wielozadaniowe, głowice bez kotwic oraz zoptymalizowane uczenie transferowe, dzięki czemu są bardziej odpowiednie dla środowisk o ograniczonych zasobach, typowych dla dużych ferm hodowli zwierząt. Jednak według naszej wiedzy nie przeprowadzono kompleksowych badań oceniających te modele w celu rozpoznania zachowań bydła. Aby wypełnić tę lukę, przeprowadzamy porównawczą ocenę najnowszych modeli YOLO (v8n-v13n) wykrywania zachowań bydła, wykorzystując zbiór danych zaprojektowany do symulacji rzeczywistych środowisk gospodarstw. Modele są oceniane przy użyciu standardowych wskaźników wykrywania, takich jak średnia średnia precyzja (mAP), precyzja, przywołanie, czas wnioskowania oraz FPS, aby określić, która odmiana najlepiej nadaje się do monitoringu bydła w czasie rzeczywistym w warunkach rolniczych. Zamiast proponować nową architekturę, niniejsze badanie ustanawia systematyczne i powtarzalne ramy benchmarkingowe dla najnowszych wariantów YOLO w kontekście monitorowania zachowań zwierząt gospodarskich, wypełniając lukę w aktualnej literaturze, gdzie ich porównawcze wyniki pozostają w dużej mierze niezbadane.
Rodzina detektorów obiektowych YOLO posiada znacznie zaawansowane widzenie komputerowe w czasie rzeczywistym, zwłaszcza w zastosowaniach wymagających zarówno szybkości, jak i dokładności. W rozpoznawaniu zachowań bydła, gdzie monitorowanie ruchów zwierząt w czasie rzeczywistym jest niezbędne, równowaga tych cech w YOLO czyni ją bardzo skuteczną. Niniejszy przegląd przedstawia ewolucję modeli YOLO, od wczesnych wersji po najnowsze, podkreślając kluczowe innowacje istotne dla wykrywania zachowań bydła. Każda z tych wersji wprowadzała ulepszenia w zakresie szybkości, dokładności i odporności wykrywania w warunkach gospodarstwa, dzięki czemu modele YOLO są coraz bardziej odpowiednie do monitorowania bydła w dynamicznych środowiskach.
Wczesne generacje YOLO (v1-v3) ustanowiły fundamenty jednoetapowego wykrywania obiektów poprzez ujednolicenie klasyfikacji i lokalizacji w jeden framework regresji. Wersje te stopniowo poprawiały szybkość wnioskowania, precyzję przestrzenną oraz wieloskalowe możliwości wykrywania, tworząc podwaliny pod zastosowanie YOLO w analizie zachowań zwierząt gospodarskich oraz innych scenariuszach rolniczych w czasie rzeczywistym 13,14,15,16. Po wydaniu YOLOv4 w 2020 roku architektura przeszła dalsze udoskonalenia, w tym zastosowanie szkieletu Cross Stage Partial (CSP), aktywacji Mish oraz zaawansowanych technik agregacji cech17, 18, 19. Te aktualizacje poprawiły wydajność modelu na mniejszych zbiorach danych, co jest częstym scenariuszem w wykrywaniu zachowań zwierząt gospodarskich ze względu na ograniczone anotowane próbki dla rzadkich zdarzeń. Projekt YOLOv5, realizowany przez społeczność, uruchomiony przez Ultralytics w 2020 roku, zyskał szeroką adopcję dzięki modułowemu projektowi i łatwości wdrożenia za pomocą frameworka PyTorch20. Chociaż nie był objęty recenzowanym artykułem, YOLOv5 stał się de facto bazą w zadaniach wykrywania bydła w czasie rzeczywistym dzięki silnemu połączeniu między dokładnością a elastycznością wdrożenia. YOLOv6, wydany w 2022 roku, stawiał na przyjazny sprzęt projekt, z szkieletem EfficientRep i szyją Rep-PAN21,22. Dzięki zastosowaniu detekcji bez kotwicy model poprawił odporność w scenariuszach związanych z zasłoną i częściową widocznością, warunkami często spotykanymi w zatłoczonych środowiskach hodowlanych. YOLOv7 dodatkowo zoptymalizował efektywność obliczeniową dzięki architekturze E-ELAN, umożliwiając szybsze trenowanie i poprawę wydajności na wielu skalach detekcji23. Równocześnie alternatywne modele, takie jak YOLOX24 i YOLOR25, zaawansowały szybkość wykrywania i uogólnienie, co jest kluczowymi cechami systemów monitoringu zwierząt na zewnątrz. Wydanie YOLOv8 firmy Ultralytics w 2023 roku wprowadziło kilka modyfikacji architektonicznych, w tym głowice wolne od kotwic, reparametryzację strukturalną oraz silniejsze strategie augmentacji. Te aktualizacje przyniosły znaczące poprawy zarówno w zakresie precyzji wykrywania, jak i szybkości wnioskowania, czyniąc YOLOv8 konkurencyjną opcją do analizy zachowań bydła w czasie rzeczywistym. Ewolucja trwała dalej wraz z pojawieniem się YOLOv9, YOLOv10, YOLOv11, YOLOv12 i YOLOv13. YOLOv9 zintegrował uczenie wielozadaniowe, aby wspólnie usprawnić klasyfikację, lokalizację oraz zadania pomocnicze, takie jak wykrywanie punktów kluczowych. YOLOv10 został zbudowany na tym fundamencie poprzez osadzenie modułów adaptacji domenowej oraz mechanizmów uwagi uwzględniających segmentację. YOLOv11 wprowadził samonadzorowane protokoły treningowe, które zmniejszały zależność od w pełni oznaczonych danych, oferując zalety w aplikacjach o ograniczonych danych, takich jak monitorowanie zachowań bydła. YOLOv12 podkreślał ulepszoną fuzję funkcji i dynamiczną reparametryzację. Wreszcie, YOLOv13 zawierał moduły oparte na transformatorach oraz uwagę czasoprzestrzenną, oferując doskonałą wydajność w wykrywaniu dużych prędkości i niskich opóźnień w złożonych, rzeczywistych scenariuszach rolniczych.
W ostatnich latach modele głębokiego uczenia oparte na YOLO stały się szeroko wykorzystywane do zautomatyzowanego i monitorowania zachowań bydła w czasie rzeczywistym ze względu na swoją efektywność i dokładność. Przed wdrożeniem detektorów opartych na YOLO, kilka wczesnych systemów opartych na wzroku udowodniło wykonalność monitorowania zwierząt gospodarskich opartych na obrazie. Na przykład Sumi i in. opracowali system monitorowania krów do wykrywania porodów z wykorzystaniem analizy cech ruchu26, podczas gdy Zin i in. zaproponowali oparte na głębokim uczeniu ramy identyfikacji krów, osiągające 97% dokładności rozpoznania27. Prace te stworzyły podstawy dla kolejnych metod wykrywania obiektów w precyzyjnej hodowli zwierząt. Kilka badań stosowało różne warianty YOLO do klasyfikacji zachowań, śledzenia ruchu oraz rozpoznawania postawy w różnych warunkach. Na przykład Mu i in. zaproponowali ulepszony, lekki model Cattle Behavior Recognition-YOLO28 (CBR-YOLO) oparty na YOLOv8, zoptymalizowany do adaptacji pogodowej w wielu scenach. Model osiągnął średnią dokładność na poziomie 90,2%, jednocześnie znacząco zmniejszając liczbę parametrów. Tong i in. wprowadzili model YOLO-BoT29, integrujący moduły uwagi i transformatorów w YOLOv8 do wykrywania zachowań i śledzenia bydła w złożonych środowiskach, osiągając wykrywanie mAP na poziomie 91,7% przy 31,2 FPS. Hao i in. zintegrowali mechanizm Efficient Multi-Scale Attention (EMA) w YOLOv530 (YOLOv5-EMA), który poprawił wykrywalność części ciała bydła (np. głowa, nogi), osiągając wartości mAP od 94,8% do 95,5%. Guarnido-Lopez i in.31 ocenili YOLOv8 i YOLOv10 pod kątem rozpoznawania zachowań związanych z karmieniem (np. żucie, gryzienie, zbliżanie się) u byków Charolais, zgłaszając, że YOLOv10 nieco przewyższał YOLOv8 w mAP@50, mAP@50-95, precyzji i przywołaniu, podczas gdy YOLOv8 wykazywał szybszą zbieżność i niższe naddopasowanie. Chociaż YOLOv1 do YOLOv8 zostały szeroko przyjęte i zweryfikowane w zadaniach związanych z hodowlą, zastosowanie YOLOv9 do YOLOv13 w tej dziedzinie pozostaje niedostatecznie zbadane. Do tej pory nie przeprowadzono kompleksowej oceny tych nowszych modeli wykrywania zachowań bydła, co podkreśla istotną lukę w istniejących badaniach i motywuje do dalszych badań nad ich rzeczywistymi wynikami.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
1. Przygotowanie zbioru danych
UWAGA: To badanie nie obejmowało nowych eksperymentów na zwierzętach. Wszystkie dane pochodzą z publicznie dostępnego zbioru danych CBVD-5, który został zebrany i udostępniony zgodnie z wytycznymi instytucjonalnymi dotyczącymi opieki nad zwierzętami przez jego oryginalnych autorów. Dlatego nie wymagano dodatkowej zgody etycznej dla tych prac.
2. Wybór i konfiguracja modelu
3. Trening modelu
4. Ocena modelu
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Ta sekcja przedstawia wyniki oceny modeli YOLOv8 do YOLOv13 na zbiorze danych CBVD-5 dla rozpoznawania bydła wielobehawioralnego. Analiza koncentruje się na dokładności wykrywania, zbieżności treningowej, rozkładzie zachowań oraz przydatności wdrożenia w środowiskach o ograniczonych zasobach. Jakość zbioru danych i równowaga klas podążają za podziałami opisanymi w protokole (70/20/10), zapewniając spójną reprezentację wszystkich pięciu zachowań w zestawach treningowych, walidacyjnych i testowych. Rys...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Ogólny sukces proponowanego ramowego systemu porównawczego zależy w kluczowej mierze od kilku kroków protokołu, w tym wysokiej jakości adnotacji zachowań, różnorodnego uzupełniania danych oraz stabilnego monitorowania zbieżności podczas treningu. Czynniki te zapewniają, że różnice w wydajności modelu odzwierciedlają prawdziwą zmienność architektury, a nie szum danych czy treningu. W tym badaniu systematycznie oceniono sześć lekkich wariantów YOLO (v8n do v13n) pod kątem wieloklasowego wykrywania zachowań bydła, wykorzyst...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy deklarują, że nie mają ze sobą rywalizujących interesów.
Prace te zostały sfinansowane z grantu na mosty Universiti Sains Malaysia, numer projektu: R501-LR-RND003-00000001342-00000.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Rejestrator Dahua DH-NVR2216-HDS3 | Technologia Dahua | https://www.dahuasecurity.com/ | |
| Dahua DH-S3000C-16GT przełącznik gigabitowy | Technologia Dahua | https://www.dahuasecurity.com/ | |
| Kamera monitoringu Dahua M/K (obiektyw 2,8 mm / 3,6 mm) | Technologia Dahua | https://www.dahuasecurity.com/ | |
| Google Colab Pro | https://colab.research.google.com/ | ||
| Matplotlib | Społeczność Matplotlib | https://matplotlib.org/ | |
| Karta graficzna NVIDIA A100 | NVIDIA | https://www.nvidia.com/en-us/data-center/a100/ | |
| NumPy | Społeczność NumPy | https://numpy.org/ | |
| OpenCV | OpenCV.org | https://opencv.org/ | |
| Optuna (optymalizacja hiperparametrów) | Optuna.org | https://optuna.org/ | |
| Pandy | Społeczność Pandas | https://pandas.pydata.org/ | |
| PyTorch (v2.0+) | Fundacja PyTorch | https://pytorch.org/ | |
| Python (v3.10) | Python Software Foundation | https://www.python.org/ | |
| Roboflow TSL Dataset | Roboflow | https://roboflow.com/ | |
| Ubuntu 20.04 LTS | Kanoniczny | https://ubuntu.com/ | |
| Visual Studio Code | Microsoft | https://code.visualstudio.com/ | |
| YOLOv13 | Ultralityki | https://github.com/ultralytics/YOLOv13 | |
| YOLOv9 | Ultralityki | https://github.com/ultralytics/YOLOv9 |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.