Este protocolo compara seis modelos YOLO para la detección del comportamiento del ganado en tiempo real para respaldar el bienestar y la optimización de la gestión agrícola.
Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.
Artículo de método
Este protocolo compara seis modelos YOLO para la detección del comportamiento del ganado en tiempo real para respaldar el bienestar y la optimización de la gestión agrícola.
La detección precisa y en tiempo real del comportamiento del ganado es crucial para mejorar el bienestar animal y optimizar el manejo del ganado. Para abordar esto, este estudio evalúa exhaustivamente seis modelos ligeros YOLO (You Only Look Once) desarrollados por la comunidad: YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n, YOLOv12n y YOLOv13n, para reconocer cinco comportamientos clave del ganado (de pie, acostado, buscando alimento, bebiendo y rumiando) utilizando el conjunto de datos CBVD-5 personalizado. El conjunto de datos incluye diversas condiciones de iluminación y entornos naturales de graneros para reflejar escenarios de monitoreo del mundo real. Todos los modelos se evaluaron utilizando métricas estándar de detección de objetos (precisión, recuperación, mAP@50 y mAP@50-95) e indicadores orientados a la implementación, incluido el tiempo de inferencia, los fotogramas por segundo (FPS), el tamaño del modelo y la duración del entrenamiento para proporcionar una evaluación equilibrada de la precisión y la eficiencia. YOLOv13n logró el mAP@50-95 más alto (0,712), mientras que YOLOv11n alcanzó el mAP@50 más alto (0,967) y exhibió una convergencia estable con una buena compensación entre la precisión de detección y la velocidad de inferencia. YOLOv10n demostró la velocidad de inferencia más rápida (1,2 ms/fotograma, ~833 FPS), lo que lo hace muy adecuado para aplicaciones sensibles a la latencia, como la vigilancia continua de establos. Todos los modelos mantuvieron tamaños compactos por debajo de 6 MB y un rendimiento en tiempo real superior a ~ 300 FPS, lo que confirma su practicidad para la implementación en el borde. Los resultados establecen un marco de evaluación comparativa reproducible para evaluar las variantes modernas de YOLO, ofreciendo información sobre la selección de modelos para sistemas de monitoreo de ganado eficientes, escalables y orientados al bienestar.
El monitoreo eficiente del comportamiento del ganado es esencial en la ganadería de precisión, apoyando la gestión del bienestar, la detección de enfermedades y la optimización operativa. Los enfoques basados en la visión no invasivos son particularmente prometedores debido a su escalabilidad y versatilidad. Los conjuntos de datos estandarizados como CBVD-5 (Cow Behavior Video Dataset with 5 classes) ofrecen diversas anotaciones de comportamiento en diversas condiciones de iluminación, lo que los convierte en puntos de referencia valiosos en este dominio1. En la mayoría de los entornos agrícolas prácticos, las cámaras se fijan a una altura moderada con una iluminación relativamente estable, aunque la oclusión ocasional entre el ganado puede afectar el rendimiento de la detección. El reconocimiento del comportamiento en el ganado continúa enfrentando desafíos como la oclusión, la variabilidad del movimiento y la escasez de datos de entrenamiento. Para abordar estos desafíos, trabajos anteriores han explorado enfoques basados en sensores2, modelado de patrones de imágenes3 y estrategias de aprendizaje profundode conjunto 4. Los marcos de detección de objetos como YOLO (You Only Look Once), introducido por primera vez por Redmon et al.5, y su versión más avanzada YOLOv76, se destacan por su capacidad para equilibrar la precisión de la detección, la latencia y la eficiencia computacional. En este estudio, el rendimiento en tiempo real se refiere a lograr una velocidad de inferencia superior a 30 cuadros por segundo (FPS), lo que garantiza un seguimiento fluido y continuo del comportamiento basado en video en entornos agrícolas prácticos. Este estudio evalúa sistemáticamente el rendimiento de YOLOv8n a través de YOLOv13n en el conjunto de datos CBVD-5, enfatizando la detección de comportamiento en tiempo real y las restricciones de implementación. Los avances recientes en la arquitectura de YOLO, incluidas las versiones de la comunidad abierta YOLOv87, YOLOv98, YOLOv109, YOLOv1110, YOLOv1211 y YOLOv1312, han introducido mejoras en la precisión de detección y la eficiencia computacional. Estos modelos aprovechan innovaciones como el aprendizaje multitarea, cabezales sin anclajes y aprendizaje de transferencia optimizado, lo que los hace más adecuados para entornos con recursos limitados que normalmente se encuentran en granjas ganaderas a gran escala. Sin embargo, hasta donde sabemos, no se ha realizado un estudio exhaustivo que evalúe estos modelos específicamente para el reconocimiento del comportamiento del ganado. Para llenar este vacío, realizamos una evaluación comparativa de los modelos YOLO recientes (v8n-v13n) para la detección del comportamiento del ganado utilizando un conjunto de datos diseñado para simular entornos agrícolas del mundo real. Los modelos se evalúan utilizando métricas de detección estándar, como la precisión media media (mAP), la precisión, la recuperación, el tiempo de inferencia y el FPS para determinar qué variante es la más adecuada para las aplicaciones de monitorización del ganado en tiempo real en condiciones agrícolas. En lugar de proponer una nueva arquitectura, este estudio establece un marco de evaluación comparativa sistemático y reproducible para las variantes recientes de YOLO en el contexto del monitoreo del comportamiento del ganado, abordando una brecha en la literatura actual donde su desempeño comparativo permanece en gran medida inexplorado.
La familia de detectores de objetos YOLO ha avanzado significativamente la visión por computadora en tiempo real, especialmente en aplicaciones que requieren velocidad y precisión. En el reconocimiento del comportamiento del ganado, donde el monitoreo en tiempo real de los movimientos del ganado es esencial, el equilibrio de estos atributos de YOLO lo hace altamente efectivo. Esta revisión describe la evolución de los modelos YOLO, desde las primeras versiones hasta las más recientes, destacando las innovaciones clave relevantes para la detección del comportamiento del ganado. Cada iteración ha introducido mejoras en la velocidad de detección, precisión y robustez en condiciones de granja, lo que hace que los modelos YOLO sean cada vez más adecuados para monitorear ganado en entornos dinámicos.
Las primeras generaciones de YOLO (v1-v3) establecieron la base de la detección de objetos en una etapa al unificar la clasificación y la localización en un solo marco de regresión. Estas versiones mejoraron progresivamente la velocidad de inferencia, la precisión espacial y la capacidad de detección multiescala, sentando las bases para aplicar YOLO en el análisis del comportamiento del ganado y otros escenarios agrícolas en tiempo real 13,14,15,16. Con el lanzamiento de YOLOv4 en 2020, la arquitectura experimentó más refinamientos, incluida la adopción de la red troncal Cross Stage Partial (CSP), la activación de Mish y las técnicas avanzadas de agregación de funciones 17,18,19. Estas actualizaciones mejoraron el rendimiento del modelo en conjuntos de datos más pequeños, un escenario común en la detección del comportamiento del ganado debido a las muestras anotadas limitadas para eventos raros. El proyecto YOLOv5 impulsado por la comunidad, lanzado por Ultralytics en 2020, obtuvo una adopción generalizada por su diseño modular y facilidad de implementación a través de un marco PyTorch20. Aunque no estuvo acompañado de un artículo revisado por pares, YOLOv5 se convirtió en una línea de base de facto en las tareas de detección de ganado en tiempo real debido a su fuerte equilibrio entre precisión y flexibilidad de implementación. YOLOv6, lanzado en 2022, priorizó el diseño amigable con el hardware con la columna vertebral EfficientRep y el mástil Rep-PAN21,22. Al incorporar la detección sin anclaje, el modelo mejoró la robustez en escenarios que involucran oclusión y visibilidad parcial, condiciones que se encuentran con frecuencia en entornos de ganado hacinados. YOLOv7 optimizó aún más la eficiencia computacional a través de la arquitectura E-ELAN, lo que permitió un entrenamiento más rápido y un rendimiento mejorado en múltiples escalas de detección23. Al mismo tiempo, modelos alternativos como YOLOX24 y YOLOR25 avanzaron en la velocidad de detección y la generalización, ambos atributos esenciales para los sistemas de monitoreo de ganado al aire libre. La versión 2023 de YOLOv8 de Ultralytics introdujo varias modificaciones arquitectónicas, incluidos cabezales sin anclaje, reparametrización estructural y estrategias de aumento más sólidas. Estas actualizaciones brindaron ganancias significativas tanto en la precisión de detección como en la velocidad de inferencia, lo que convierte a YOLOv8 en una opción competitiva para el análisis del comportamiento del ganado en tiempo real. La evolución continuó con la aparición de YOLOv9, YOLOv10, YOLOv11, YOLOv12 y YOLOv13. YOLOv9 integró el aprendizaje multitarea para mejorar conjuntamente la clasificación, la localización y las tareas auxiliares como la detección de puntos clave. YOLOv10 se construyó sobre esta base mediante la incorporación de módulos de adaptación de dominio y mecanismos de atención conscientes de la segmentación. YOLOv11 introdujo protocolos de entrenamiento autosupervisados que redujeron la dependencia de datos completamente etiquetados, ofreciendo ventajas en aplicaciones con pocos datos, como el monitoreo del comportamiento del ganado. YOLOv12 enfatizó la fusión de características mejoradas y la reparametrización dinámica. Finalmente, YOLOv13 incorporó módulos basados en transformadores y atención espacio-temporal, ofreciendo un rendimiento superior para la detección de alta velocidad y baja latencia en escenarios agrícolas complejos y en tiempo real.
En los últimos años, los modelos de aprendizaje profundo basados en YOLO se han utilizado ampliamente para el monitoreo automatizado y en tiempo real del comportamiento del ganado debido a su eficiencia y precisión. Antes de la adopción de detectores basados en YOLO, varios sistemas tempranos basados en la visión habían demostrado la viabilidad del monitoreo del ganado basado en imágenes. Por ejemplo, Sumi et al. desarrollaron un sistema de monitoreo de vacas para la detección de partos mediante el análisis de características de movimiento26, mientras que Zin et al. propusieron un marco de identificación de vacas basado en el aprendizaje profundo que logra una precisión de reconocimiento del 97%27. Estos trabajos sentaron las bases para los posteriores enfoques de detección de objetos en la ganadería de precisión. Varios estudios han aplicado diferentes variantes de YOLO para la clasificación del comportamiento, el seguimiento del movimiento y el reconocimiento de la postura en diversas condiciones. Por ejemplo, Mu et al. propusieron un modelo mejorado de reconocimiento del comportamiento del ganado-YOLO28 (CBR-YOLO) basado en YOLOv8, optimizado para la adaptación climática de múltiples escenas. El modelo logró una precisión media del 90,2% al tiempo que redujo significativamente el recuento de parámetros. Tong et al. introdujeron el modelo YOLO-BoT29, incorporando módulos basados en atención y transformadores en YOLOv8 para la detección y seguimiento del comportamiento del ganado en entornos complejos, logrando un mAP de detección del 91,7% a 31,2 FPS. Hao et al. integraron un mecanismo de Atención Eficiente Multiescala (EMA) en YOLOv530 (YOLOv5-EMA), que mejoró el rendimiento de detección de partes del cuerpo del ganado (por ejemplo, cabeza, patas), alcanzando valores de mAP entre 94,8% y 95,5%. Guarnido-Lopez et al.31 evaluaron YOLOv8 y YOLOv10 para el reconocimiento de comportamientos relacionados con la alimentación (p. ej., masticar, morder, acercarse) en toros Charolais, informando que YOLOv10 superó ligeramente a YOLOv8 en mAP@50, mAP@50-95, precisión y recuerdo, mientras que YOLOv8 exhibió una convergencia más rápida y un menor sobreajuste. Si bien YOLOv1 a YOLOv8 han sido ampliamente adoptados y validados para tareas relacionadas con la ganadería, la aplicabilidad de YOLOv9 a YOLOv13 en este dominio sigue siendo poco explorada. Hasta la fecha, no ha habido una evaluación exhaustiva de estos modelos más nuevos para la detección del comportamiento del ganado, lo que destaca una brecha crítica en la investigación existente y motiva una mayor investigación sobre su desempeño en el mundo real.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
1. Preparación del conjunto de datos
NOTA: Este estudio no involucró nuevos experimentos con animales. Todos los datos se obtuvieron del conjunto de datos CBVD-5 disponible públicamente, que fue recopilado y publicado de acuerdo con las pautas institucionales de cuidado de animales por sus autores originales. Por lo tanto, no se requirió ninguna aprobación ética adicional para este trabajo.
2. Selección y configuración del modelo
3. Entrenamiento del modelo
4. Evaluación del modelo
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Esta sección presenta los resultados de la evaluación de los modelos YOLOv8 a YOLOv13 en el conjunto de datos CBVD-5 para el reconocimiento de ganado de múltiples comportamientos. El análisis se centra en la precisión de la detección, la convergencia del entrenamiento, la distribución del comportamiento y la idoneidad de la implementación en entornos con recursos limitados. La calidad del conjunto de datos y el equilibrio de clases siguen las divisiones descritas en el protocolo (70/20/10), lo que garantiza una represent...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
El éxito general del marco comparativo propuesto depende fundamentalmente de varios pasos del protocolo, incluida la anotación de comportamiento de alta calidad, el aumento de datos diversos y el monitoreo de convergencia estable durante el entrenamiento. Estos factores garantizan que las diferencias de rendimiento del modelo reflejen una verdadera variación arquitectónica en lugar de datos o ruido de entrenamiento. Este estudio evaluó sistemáticamente seis variantes ligeras de YOLO (v8n...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores declaran que no tienen intereses contrapuestos.
Este trabajo fue financiado por una subvención puente de la Universiti Sains Malaysia, proyecto No: R501-LR-RND003-0000001342-0000.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| Grabadora Dahua DH-NVR2216-HDS3 | Tecnología Dahua | https://www.dahuasecurity.com/ | |
| Interruptor Gigabit Dahua DH-S3000C-16GT | Tecnología Dahua | https://www.dahuasecurity.com/ | |
| Cámara de vigilancia Dahua M/K (objetivo 2,8 mm / 3,6 mm) | Tecnología Dahua | https://www.dahuasecurity.com/ | |
| Google Colab Pro | https://colab.research.google.com/ | ||
| Matplotlib | Comunidad Matplotlib | https://matplotlib.org/ | |
| NVIDIA A100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/a100/ | |
| NumPy | Comunidad NumPy | https://numpy.org/ | |
| OpenCV | OpenCV.org | https://opencv.org/ | |
| Optuna (Optimización de Hiperparámetros) | Optuna.org | https://optuna.org/ | |
| Pandas | Comunidad Pandas | https://pandas.pydata.org/ | |
| PyTorch (v2.0+) | Fundación PyTorch | https://pytorch.org/ | |
| Python (v3.10) | Fundación de Software Python | https://www.python.org/ | |
| Conjunto de datos TSL de Roboflow | Roboflow | https://roboflow.com/ | |
| Ubuntu 20.04 LTS | Canónico | https://ubuntu.com/ | |
| Código Visual Studio | Microsoft | https://code.visualstudio.com/ | |
| YOLOv13 | Ultralíticos | https://github.com/ultralytics/YOLOv13 | |
| YOLOv9 | Ultralíticos | https://github.com/ultralytics/YOLOv9 |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.