Este protocolo compara seis modelos YOLO para detecção de comportamento de gado em tempo real para apoiar a otimização do bem-estar e do gerenciamento da fazenda.
É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.
Artigo de método
Este protocolo compara seis modelos YOLO para detecção de comportamento de gado em tempo real para apoiar a otimização do bem-estar e do gerenciamento da fazenda.
A detecção precisa e em tempo real do comportamento do gado é crucial para melhorar o bem-estar animal e otimizar o manejo do gado. Para resolver isso, este estudo avalia de forma abrangente seis modelos YOLO (You Only Look Once) leves desenvolvidos pela comunidade - YOLOv8n, YOLOv9t, YOLOv10n, YOLOv11n, YOLOv12n e YOLOv13n - para reconhecer cinco comportamentos-chave do gado (em pé, deitado, forrageando, bebendo e ruminando) usando o conjunto de dados CBVD-5 personalizado. O conjunto de dados inclui diversas condições de iluminação e ambientes naturais de celeiro para refletir cenários de monitoramento do mundo real. Todos os modelos foram avaliados usando métricas padrão de detecção de objetos (precisão, recall, mAP@50 e mAP@50-95) e indicadores orientados à implantação, incluindo tempo de inferência, quadros por segundo (FPS), tamanho do modelo e duração do treinamento para fornecer uma avaliação equilibrada de precisão e eficiência. O YOLOv13n alcançou o maior mAP@50-95 (0,712), enquanto o YOLOv11n atingiu o mAP@50 mais alto (0,967) e exibiu convergência estável com um bom trade-off entre a precisão da detecção e a velocidade de inferência. O YOLOv10n demonstrou a velocidade de inferência mais rápida (1,2 ms/quadro, ~833 FPS), tornando-o adequado para aplicações sensíveis à latência, como vigilância contínua de celeiro. Todos os modelos mantiveram tamanhos compactos abaixo de 6 MB e taxa de transferência em tempo real superior a ~300 FPS, confirmando sua praticidade para implantação de borda. Os resultados estabelecem uma estrutura de benchmarking reprodutível para avaliar as variantes modernas do YOLO, oferecendo insights sobre a seleção de modelos para sistemas de monitoramento de gado eficientes, escaláveis e orientados para o bem-estar.
O monitoramento eficiente do comportamento do gado é essencial na pecuária de precisão, apoiando a gestão do bem-estar, a detecção de doenças e a otimização operacional. As abordagens não invasivas baseadas na visão são particularmente promissoras devido à sua escalabilidade e versatilidade. Conjuntos de dados padronizados, como CBVD-5 (Cow Behavior Video Dataset with 5 classes), oferecem diversas anotações de comportamento em condições de iluminação variadas, tornando-os referências valiosas neste domínio1. Na maioria dos ambientes práticos de fazenda, as câmeras são fixadas a uma altura moderada com iluminação relativamente estável, embora a oclusão ocasional entre o gado possa afetar o desempenho da detecção. O reconhecimento de comportamento na pecuária continua a enfrentar desafios como oclusão, variabilidade de movimento e dados de treinamento esparsos. Para enfrentar esses desafios, trabalhos anteriores exploraram abordagens baseadas em sensores2, modelagem de padrões de imagem3 e estratégias de aprendizado profundo em conjunto4. Estruturas de detecção de objetos como YOLO (You Only Look Once), introduzida pela primeira vez por Redmon et al.5, e sua versão mais avançada YOLOv76, destacam-se por sua capacidade de equilibrar precisão de detecção, latência e eficiência computacional. Neste estudo, o desempenho em tempo real refere-se a atingir uma velocidade de inferência acima de 30 quadros por segundo (FPS), o que garante um rastreamento de comportamento baseado em vídeo suave e contínuo em ambientes práticos de fazenda. Este estudo avalia sistematicamente o desempenho do YOLOv8n por meio do YOLOv13n no conjunto de dados CBVD-5, enfatizando a detecção de comportamento em tempo real e as restrições de implantação. Avanços recentes na arquitetura YOLO, incluindo os lançamentos da comunidade aberta YOLOv87, YOLOv98, YOLOv109, YOLOv1110, YOLOv1211 e YOLOv1312, introduziram melhorias na precisão da detecção e na eficiência computacional. Esses modelos aproveitam inovações como aprendizado multitarefa, cabeçotes sem âncora e aprendizado de transferência otimizado, tornando-os mais adequados para ambientes com recursos limitados normalmente encontrados em fazendas de gado em grande escala. No entanto, até onde sabemos, não houve nenhum estudo abrangente avaliando esses modelos especificamente para o reconhecimento do comportamento do gado. Para preencher essa lacuna, realizamos uma avaliação comparativa de modelos YOLO recentes (v8n-v13n) para detecção de comportamento de bovinos usando um conjunto de dados projetado para simular ambientes agrícolas do mundo real. Os modelos são avaliados usando métricas de detecção padrão, como precisão média média (mAP), precisão, recall, tempo de inferência e FPS para determinar qual variante é mais adequada para aplicações de monitoramento de gado em tempo real em condições de criação. Em vez de propor uma nova arquitetura, este estudo estabelece uma estrutura de benchmarking sistemática e reprodutível para variantes recentes do YOLO no contexto do monitoramento do comportamento do gado, abordando uma lacuna na literatura atual em que seu desempenho comparativo permanece amplamente inexplorado.
A família YOLO de detectores de objetos avançou significativamente a visão computacional em tempo real, especialmente em aplicações que exigem velocidade e precisão. No reconhecimento do comportamento do gado, onde o monitoramento em tempo real dos movimentos do gado é essencial, o equilíbrio desses atributos do YOLO o torna altamente eficaz. Esta revisão descreve a evolução dos modelos YOLO, desde as primeiras versões até as mais recentes, destacando as principais inovações relevantes para a detecção do comportamento do gado. Cada iteração introduziu melhorias na velocidade de detecção, precisão e robustez em condições de fazenda, tornando os modelos YOLO cada vez mais adequados para monitorar gado em ambientes dinâmicos.
As primeiras gerações do YOLO (v1-v3) estabeleceram a base da detecção de objetos em um estágio, unificando a classificação e a localização em uma única estrutura de regressão. Essas versões melhoraram progressivamente a velocidade de inferência, a precisão espacial e a capacidade de detecção em várias escalas, lançando as bases para a aplicação do YOLO na análise do comportamento do gado e em outros cenários agrícolas em tempo real 13,14,15,16. Com o lançamento do YOLOv4 em 2020, a arquitetura passou por mais refinamentos, incluindo a adoção do backbone Cross Stage Partial (CSP), ativação Mish e técnicas avançadas de agregação de recursos 17,18,19. Essas atualizações melhoraram o desempenho do modelo em conjuntos de dados menores, um cenário comum na detecção do comportamento do gado devido a amostras anotadas limitadas para eventos raros. O projeto YOLOv5 voltado para a comunidade, lançado pela Ultralytics em 2020, ganhou ampla adoção por seu design modular e facilidade de implantação por meio de uma estrutura PyTorch20. Embora não seja acompanhado por um artigo revisado por pares, o YOLOv5 tornou-se uma linha de base de fato em tarefas de detecção de gado em tempo real devido ao seu forte equilíbrio entre precisão e flexibilidade de implantação. O YOLOv6, lançado em 2022, priorizou o design amigável ao hardware com o backbone EfficientRep e o pescoço Rep-PAN21,22. Ao incorporar a detecção sem âncora, o modelo melhorou a robustez em cenários envolvendo oclusão e visibilidade parcial, condições frequentemente encontradas em ambientes de gado lotado. O YOLOv7 otimizou ainda mais a eficiência computacional por meio da arquitetura E-ELAN, permitindo treinamento mais rápido e desempenho aprimorado em várias escalas de detecção23. Ao mesmo tempo, modelos alternativos como YOLOX24 e YOLOR25 avançam na velocidade de detecção e generalização, ambos atributos essenciais para sistemas de monitoramento de gado ao ar livre. A versão 2023 do YOLOv8 da Ultralytics introduziu várias modificações arquitetônicas, incluindo cabeçotes sem âncora, reparametrização estrutural e estratégias de aumento mais fortes. Essas atualizações proporcionaram ganhos significativos na precisão de detecção e velocidade de inferência, tornando o YOLOv8 uma opção competitiva para análise do comportamento do gado em tempo real. A evolução continuou com o surgimento do YOLOv9, YOLOv10, YOLOv11, YOLOv12 e YOLOv13. O YOLOv9 integrou o aprendizado multitarefa para aprimorar conjuntamente a classificação, localização e tarefas auxiliares, como detecção de pontos-chave. O YOLOv10 foi construído sobre essa base, incorporando módulos de adaptação de domínio e mecanismos de atenção com reconhecimento de segmentação. O YOLOv11 introduziu protocolos de treinamento auto-supervisionados que reduziram a dependência de dados totalmente rotulados, oferecendo vantagens em aplicações com poucos dados, como monitoramento do comportamento do gado. O YOLOv12 enfatizou a fusão aprimorada de recursos e a reparametrização dinâmica. Por fim, o YOLOv13 incorporou módulos baseados em transformadores e atenção espaço-temporal, oferecendo desempenho superior para detecção de alta velocidade e baixa latência em cenários agrícolas complexos e em tempo real.
Nos últimos anos, os modelos de aprendizado profundo baseados em YOLO tornaram-se amplamente utilizados para monitoramento automatizado e em tempo real do comportamento do gado devido à sua eficiência e precisão. Antes da adoção de detectores baseados em YOLO, vários sistemas baseados em visão inicial demonstraram a viabilidade do monitoramento de gado orientado por imagem. Por exemplo, Sumi et al. desenvolveram um sistema de monitoramento de vacas para detecção de partos usando análise de características de movimento26, enquanto Zin et al. propuseram uma estrutura de identificação de vacas baseada em aprendizado profundo, alcançando 97% de precisão de reconhecimento27. Esses trabalhos estabeleceram as bases para abordagens subsequentes de detecção de objetos na pecuária de precisão. Vários estudos aplicaram diferentes variantes do YOLO para classificação de comportamento, rastreamento de movimento e reconhecimento de postura sob condições variadas. Por exemplo, Mu et al. propuseram um modelo leve aprimorado de Reconhecimento de Comportamento de Gado-YOLO28 (CBR-YOLO) baseado em YOLOv8, otimizado para adaptação climática em várias cenas. O modelo alcançou uma precisão média de 90,2%, reduzindo significativamente a contagem de parâmetros. Tong et al. introduziram o modelo YOLO-BoT29, incorporando módulos baseados em atenção e transformador no YOLOv8 para detecção e rastreamento do comportamento do gado em ambientes complexos, alcançando um mAP de detecção de 91,7% a 31,2 FPS. Hao et al. integraram um mecanismo de Atenção Multiescala Eficiente (EMA) no YOLOv530 (YOLOv5-EMA), que melhorou o desempenho de detecção de partes do corpo de bovinos (por exemplo, cabeça, pernas), atingindo valores de mAP entre 94,8% e 95,5%. Guarnido-Lopez et al.31 avaliaram o YOLOv8 e o YOLOv10 para o reconhecimento de comportamentos relacionados à alimentação (por exemplo, mastigar, morder, aproximar-se) em touros Charolesa, relatando que o YOLOv10 superou ligeiramente o YOLOv8 em mAP@50, mAP@50-95, precisão e recall, enquanto o YOLOv8 exibiu convergência mais rápida e menor sobreajuste. Embora o YOLOv1 a YOLOv8 tenha sido amplamente adotado e validado para tarefas relacionadas à pecuária, a aplicabilidade do YOLOv9 a YOLOv13 neste domínio permanece pouco explorada. Até o momento, não houve uma avaliação abrangente desses modelos mais recentes para detecção do comportamento do gado, destacando uma lacuna crítica na pesquisa existente e motivando uma investigação mais aprofundada sobre seu desempenho no mundo real.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
1. Preparação do conjunto de dados
NOTA: Este estudo não envolveu novos experimentos com animais. Todos os dados foram obtidos do conjunto de dados CBVD-5 disponível publicamente, que foi coletado e divulgado em conformidade com as diretrizes institucionais de cuidados com os animais por seus autores originais. Portanto, nenhuma aprovação ética adicional foi necessária para este trabalho.
2. Seleção e configuração do modelo
3. Treinamento de modelo
4. Avaliação do modelo
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Esta seção apresenta os resultados da avaliação dos modelos YOLOv8 a YOLOv13 no conjunto de dados CBVD-5 para reconhecimento de bovinos com múltiplos comportamentos. A análise se concentra na precisão da detecção, convergência de treinamento, distribuição comportamental e adequação de implantação em ambientes com recursos limitados. A qualidade do conjunto de dados e o equilíbrio da classe seguem as divisões descritas no protocolo (70/20/10), garantindo uma representação consistente de todos os cinco comportamentos em co...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
O sucesso geral da estrutura comparativa proposta depende criticamente de várias etapas do protocolo, incluindo anotação de comportamento de alta qualidade, aumento de dados diversos e monitoramento de convergência estável durante o treinamento. Esses fatores garantem que as diferenças de desempenho do modelo reflitam a verdadeira variação arquitetônica, em vez de dados ou ruído de treinamento. Este estudo avaliou sistematicamente seis variantes leves do YOLO (v8n a v13n) para detecção d...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Os autores declaram que não têm interesses conflitantes.
Este trabalho foi financiado por um Subsídio Ponte da Universiti Sains Malaysia, Projeto nº: R501-LR-RND003-0000001342-0000.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
| Nome | Empresa | Número de catálogo | Comentários |
|---|---|---|---|
| Gravador Dahua DH-NVR2216-HDS3 | Tecnologia Dahua | https://www.dahuasecurity.com/ | |
| Interruptor Gigabit Dahua DH-S3000C-16GT | Tecnologia Dahua | https://www.dahuasecurity.com/ | |
| Câmera de Vigilância Dahua M/K (lente 2,8 mm / 3,6 mm) | Tecnologia Dahua | https://www.dahuasecurity.com/ | |
| Google Colab Pro | https://colab.research.google.com/ | ||
| Matplotlib | Comunidade Matplotlib | https://matplotlib.org/ | |
| NVIDIA A100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/a100/ | |
| NumPy | Comunidade NumPy | https://numpy.org/ | |
| OpenCV | OpenCV.org | https://opencv.org/ | |
| Optuna (Otimização de Hiperparâmetros) | Optuna.org | https://optuna.org/ | |
| Pandas | Comunidade Pandas | https://pandas.pydata.org/ | |
| PyTorch (v2.0+) | Fundação PyTorch | https://pytorch.org/ | |
| Python (v3.10) | Fundação de Software Python | https://www.python.org/ | |
| Conjunto de dados Roboflow TSL | Roboflow | https://roboflow.com/ | |
| Ubuntu 20.04 LTS | Canônico | https://ubuntu.com/ | |
| Visual Studio Code | Microsoft | https://code.visualstudio.com/ | |
| YOLOv13 | Ultralíticos | https://github.com/ultralytics/YOLOv13 | |
| YOLOv9 | Ultralíticos | https://github.com/ultralytics/YOLOv9 |
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.