Research Article

Uma Estrutura de Aprendizagem Autosupervisionada em Duas Etapas para Classificação de Imagens de Plantas Silvestres no Inverno

DOI:

10.3791/69953

February 24th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabalho avalia a aplicação de um pipeline de deep learning em dois estágios para o pré-treinamento auto-supervisionado e o ajuste fino supervisionado da classificação de imagens de culturas e plantas daninhas no inverno. Os experimentos no conjunto de dados WinterCropWeedDB são realizados usando uma única divisão interna, incluindo visualizações Grad-CAM.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A agricultura de precisão exige uma discriminação precisa entre culturas de inverno e ervas daninhas, mas há falta de dados de imagem anotados para sistemas de cultivo de inverno. Este artigo investiga uma abordagem de deep learning em dois estágios que integra aprendizado de características supervisionado por auto-supervisionamento com ajuste fino supervisionado para classificação de imagens de culturas e plantas daninhas no inverno. Um novo conjunto de dados de imagens de culturas de inverno e plantas daninhas, WinterCropWeedDB, é proposto e utilizado neste artigo, que contém 1.136 imagens de alta resolução de seis espécies de culturas de inverno e quatro espécies de plantas daninhas coletadas em campos agrícolas no centro da Índia. Na primeira etapa do aprendizado auto-supervisionado, um modelo EfficientNet-B3 é pré-treinado usando uma abordagem de aprendizado auto-supervisionado no estilo SimCLR com uma função de perda InfoNCE (temperatura τ = 0,5) nas imagens. O valor médio de perda contrastiva diminui de 2,0712 na primeira iteração para 1,6835 ao final do pré-treinamento. Na segunda etapa do ajuste fino supervisionado, o modelo pré-treinado EfficientNet-B3 é ajustado com uma cabeça de classificador supervisionado nas imagens e testado em uma única divisão interna de validação (30%) do conjunto de dados. O modelo ajustado atinge uma precisão máxima de validação de 98,27%, com uma média macromédia F1 de 0,98. Mapeamento de ativação de classes ponderado por gradiente (Grad-CAM) e Grad-CAM++ são usados no modelo ajustado para fornecer uma visualização qualitativa das regiões de imagem que contribuem para as previsões de classes. Os resultados do experimento demonstram a viabilidade do uso de pré-treinamento auto-supervisionado e ajuste fino supervisionado para a classificação de imagens de culturas e plantas daninhas de inverno em um conjunto de dados específico de região, ao mesmo tempo em que enfatizam a importância de testes adicionais em conjuntos de teste independentes.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A agricultura de precisão tem visto o uso crescente de métodos de visão computacional baseados em aprendizado profundo para classificação automatizada de culturas e ervasdaninhas 1. Redes neurais convolucionais demonstraram ser eficazes em tarefas de reconhecimento de plantas; No entanto, seu desempenho geralmente depende da disponibilidade de grandes conjuntos de dados que são anotados de forma precisa2. Na maioria dos ambientes agrícolas, especialmente em sistemas de cultivo sub-representados como as culturas de inverno, o processo de obtenção de dados extensos de imagens rotuladas é demorado, trabalhoso ecaro 3,4. Isso é um obstáculo para o desenvolvimento de sistemas de apoio à decisão que sejam baseados em dados para agroecossistemas de inverno. A aprendizagem auto-supervisionada (SSL) é um paradigma que recentemente mostrou potencial para a aprendizagem por representação, onde utiliza um grande número de imagens para aprender características que são informativas, mesmo que não estejam rotuladascomo 5. Por meio do design de tarefas de pretexto, como a aprendizagem contrastiva, o SSL permite que redes neurais aprendam padrões estruturais e semânticos em dados de imagem, que podem então ser transferidos para tarefas de aprendizadosupervisionado 6. Estudos anteriores em imagens agrícolas mostraram que o pré-treinamento baseado em SSL pode melhorar o desempenho a jusante quando os dados rotulados são limitados, motivando sua busca por problemas de reconhecimento de culturas e ervasdaninhas 1,7.

Simultaneamente, métodos de aprendizagem semi-supervisionada e de aprendizagem contrastiva também foram explorados. Métodos de aprendizagem semi-supervisionada que utilizam dados rotulados e não rotulados, como aprendizagem professor-aluno e pseudo-rotulagem, foram explorados para classificação e detecção de plantasdaninhas 2,4. Mais recentemente, métodos de aprendizagem contrastiva com objetivos conscientes da classe mostraram potencial para aprender representações transferíveis a partir de imagens agrícolas, especialmente em cenários com desequilíbrio de classe ou poucasanotações 1,3. Embora esses estudos indiquem os potenciais benefícios da aprendizagem semi-supervisionada e técnicas relacionadas em relação à aprendizagem totalmente supervisionada, a maior parte da literatura existente tem se limitado a sistemas de cultivo de verão, detecção de objetos ou conjuntos de dados em grande escala.

Além da precisão preditiva, a interpretabilidade dos mecanismos internos de tomada de decisão das redes neurais profundas ainda é uma preocupação relevante para aplicações agrícolas práticas. As técnicas de inteligência artificial explicável (XAI) são projetadas para oferecer explicações interpretáveis das previsões do modelo, tentando assim preencher a lacuna entre as previsões do modelo e a expertisehumana 8. Algoritmos de visualização baseados em gradiente, como o mapeamento de ativação de classes ponderado por gradiente (Grad-CAM) e sua extensão Grad-CAM++9,10, produzem mapas de calor discriminativos por classes que apontam as regiões de interesse em uma imagem mais relevantes para as previsões de um modelo. Esses algoritmos são comumente empregados para a análise qualitativa de representações aprendidas em tarefas de análise agrícola de imagens, mas não representam uma validação formal da interpretabilidade.

O objetivo principal deste trabalho de pesquisa é investigar o potencial de uma estrutura de aprendizagem em duas etapas para a classificação de imagens de culturas e plantas daninhas de inverno, utilizando aprendizado de representação auto-supervisionada e ajuste fino supervisionado, juntamente com visualização qualitativa. Nesta pesquisa, foi investigada a aplicação de um pipeline de aprendizado em duas etapas para classificação de imagens de culturas e plantas daninhas no inverno, integrando pré-treinamento auto-supervisionado com SimCLR e ajuste fino supervisionado com EfficientNet-B3. Os experimentos são realizados com o conjunto de dados WinterCropWeedDB, um conjunto de dados específico de regiões com imagens de culturas e ervas daninhas de inverno coletadas em campos agrícolas no centro daÍndia 11. Os resultados são analisados com base em uma única divisão interna, e Grad-CAM e Grad-CAM++ são usados para visualizar a atenção do modelo. O objetivo desta pesquisa é investigar a possibilidade de combinar métodos de aprendizado e visualização de representações auto-supervisionadas para a classificação de imagens de culturas e plantas daninhas no inverno, ao mesmo tempo em que se está ciente das limitações do sistema experimental. Este fluxo de trabalho é destinado à avaliação exploratória em conjuntos de dados específicos de regiões sobre plantas daninhas agrícolas com dados rotulados limitados e não é destinado a ser um parâmetro validado para generalização ou uso em larga escala.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Descrição do conjunto de dados

O conjunto de dados WinterCropWeedDB consiste em 1.136 imagens RGB de alta resolução (vermelho, verde, azul) de seis espécies de culturas de inverno (trigo, grão-de-bico, ervilha, lentilha, mostarda e ervilha-de-grama) e quatro espécies de ervas daninhas (ervilha-comum, canário-pequeno, pé-de-galinha (Chenopodium album) e Euphorbia clementei) retiradas de campos agrícolas de inverno no estado de Chhattisgarh, Índia (Figura 1)). As imagens foram tiradas em condições naturais, incluindo variações de iluminação, estágios de crescimento e complexidade do fundo. Todas as imagens foram inicialmente não anotadas e usadas apenas para pré-treinamento auto-supervisionado. Para ajuste fino supervisionado, as imagens foram anotadas manualmente e divididas usando amostragem estratificada em conjuntos de treinamento (70%) e validação (30%). O conjunto de validação era usado apenas para avaliação interna do modelo e não foi ampliado. Para resolver problemas de desequilíbrio de classe e robustez durante o treinamento, a ampliação de dados foi realizada apenas no conjunto de treinamento. As técnicas de aumento envolviam rotações aleatórias (+/-20°), inversão horizontal, escala, translação, mudanças de brilho e transformações afins leves. As amostras de treinamento foram ampliadas para um alvo de 150 imagens por turma, resultando em um total de 1.500 imagens de treinamento, enquanto o conjunto de validação consistia em 347 imagens originais. Nenhuma imagem aumentada ou sintética foi incluída no conjunto de validação para evitar viés de avaliação. Além da avaliação de resistência, uma validação cruzada estratificada de cinco vezes também foi realizada no conjunto de dados original rotulado como análise secundária. Em cada dobra, a ampliação de dados era feita apenas nos conjuntos de treinamento, e os conjuntos de validação eram mantidos inalterados para manter a consistência com o esquema principal de avaliação.

Fluxo de trabalho computacional para treinamento de modelos auto-supervisionados e supervisionados

Um pipeline computacional em duas etapas foi utilizado para investigar a viabilidade da integração de aprendizado de representação auto-supervisionado e ajuste fino supervisionado para classificação de imagens de culturas de inverno versus ervas daninhas daninhas (Figura 2). Esse pipeline envolve: (i) pré-treinamento auto-supervisionado com imagens não rotuladas, e (ii) ajuste fino supervisionado com uma amostra rotulada das imagens. Todas as imagens eram redimensionadas para 300 × 300 pixels e normalizadas antes do treinamento. As avaliações dos modelos foram realizadas apenas em uma divisão interna, sem usar um conjunto de teste externo.

Estágio 1 - pré-treinamento auto-supervisionado

Na fase inicial, a arquitetura EfficientNet-B3 foi empregada como a rede dorsal em uma configuração de aprendizado auto-supervisionada inspirada no SimCLR. A cabeça de projeção de duas camadas reduziu a representação da espinha dorsal para um espaço de imersão de 128 dimensões. Para aprendizado auto-supervisionado, cada imagem foi convertida em duas vistas usando corte aleatório redimensionado, viragem horizontal, transformação de cor, desfoque Gaussiano e conversão para escala de cinza. As duas visões foram processadas juntas para otimizar conjuntamente a função de perda contrastiva. O processo de aprendizado auto-supervisionado foi realizado por 30 épocas, onde uma época indica uma passagem completa de todo o conjunto de dados de treinamento pelo modelo durante a otimização, com um lote de 16 imagens usando o otimizador Adam (um algoritmo de otimização baseado em gradiente adaptativo que estima os momentos de primeira e segunda ordem dos gradientes para ajustar as taxas de aprendizado durante o treinamento). O gradient clipping com norma máxima de 1.0 foi usado para garantir um treinamento estável. Além disso, pontos de verificação dos modelos eram salvos após cada época para facilitar a reprodutibilidade. O valor de temperatura de 0,5 foi usado ao calcular a perda do InfoNCE durante o aprendizado auto-supervisionado.

Estágio 2 - ajuste fino supervisionado

Após o pré-treinamento auto-supervisionado, a cabeça de projeção foi removida, e os pesos pré-treinados da coluna vertebral foram usados para ajuste fino supervisionado. Uma cabeça classificadora totalmente conectada foi adicionada à espinha dorsal para classificação multiclasse. O ajuste fino era feito usando apenas as imagens rotuladas do conjunto de treinamento. O treinamento supervisionado utilizou perda de entropia cruzada com ponderação de classe e suavização de rótulos para lidar com o desequilíbrio de classes. O otimizador Adam foi usado com diferentes taxas de aprendizado para a espinha dorsal (1 × 10⁻⁵) e classificador (1 × 10⁻⁴). Um escalonador de taxa de aprendizado foi usado para diminuir a taxa de aprendizado quando a precisão da validação estagnava. O treinamento foi realizado por 20 épocas, e o checkpoint do modelo com maior precisão de validação foi salvo para avaliação.

Além da avaliação principal de resistência, foi realizada uma validação cruzada estratificada de cinco vezes como análise adicional no conjunto rotulado. Em cada dobra, a ampliação era feita apenas nos conjuntos de treinamento, e os conjuntos de validação permaneciam inalterados. Os resultados da validação cruzada foram apresentados separadamente e não foram usados para seleção de modelos ou otimização dos checkpoints. As métricas de desempenho apresentadas neste estudo baseiam-se unicamente na divisão interna de validação e representam os resultados do desempenho observado sob a configuração experimental atual.

Visualização Grad-CAM e Grad-CAM++

Para a análise qualitativa da atenção no modelo, métodos de ativação de classes baseados em gradiente (Grad-CAM e Grad-CAM++) foram usados no modelo finamente ajustado. Os mapas de características e os gradientes foram obtidos a partir da camada convolucional final da rede base, e mapas de calor específicos de classe foram obtidos para imagens de validação escolhidas. Esses foram usados apenas para fins de análise qualitativa do modelo e não foram validados. A Tabela de materiais lista todo o hardware, bibliotecas de software, conjuntos de dados e scripts de treinamento personalizados usados nesse fluxo de trabalho.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Visão geral das abordagens anteriores e posicionamento do fluxo de trabalho

Um resumo das abordagens de aprendizagem representativa aplicadas anteriormente para o reconhecimento de plantas daninhas agrícolas está apresentado na Tabela 1. A tabela apresenta uma visão geral das estratégias de aprendizagem supervisionada, semi-supervisionada e auto-supervisionada, conjuntos de dados utilizados, resultados relatados e as limitaçõe...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabalho examinou o uso de uma abordagem de aprendizado profundo em duas etapas, consistindo em pré-treinamento auto-supervisionado usando a ideia SimCLR e ajuste fino supervisionado para classificação de imagens de culturas e plantas daninhas no inverno no conjunto de dados WinterCropWeedDB. Os resultados mostram que a abordagem proposta pode ser treinada de forma confiável em um conjunto de imagens de agricultura de inverno específica por região e testada em uma divisão do conjunt...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram não haver interesses concorrentes. Ferramentas de linguagem baseadas em IA (QuillBot) eram usadas exclusivamente para o polimento da linguagem e preparação de refutações, e todo o conteúdo científico e conclusões eram escritos pelos autores.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta pesquisa não recebeu nenhuma bolsa específica de agências financiadoras dos setores público, comercial ou sem fins lucrativos.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Kit de Ferramentas CUDANVIDIA12.8
cuDNNNVIDIA9.1
Unidade de processamento gráfico (GPU)NVIDIAGeForce RTX 5050 Laptop GPU
MatplotlibDesenvolvedores Matplotlib3.9.2
NumPyDesenvolvedores NumPy1.26.0
Sistema operacionalMicrosoftLinux (WSL2), kernel 6.6.87
PythonFundação de Software Python3.12.7
PyTorchFundação PyTorch2.1.0 (versão de desenvolvimento)
scikit-learnscikit-learn Desenvolvedores1.5.1
timmRepositório GitHub1.0.24
TorchvisionFundação PyTorch0.25.0 (versão de desenvolvimento)
WinterCropWeedDBMendeley Data, DOI: 10.17632/m4h6zdsh79.1Versão 1

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Güldenring, R., Nalpantidis, L. Self-supervised contrastive learning on agricultural images. Comput. Electron. Agric. 191, 106510(2021).
  2. Li, J., et al. Performance evaluation of semi-supervised learning frameworks for multi-class weed detection. Front. Plant Sci. 15, 1396568(2024).
  3. Saleh, A., et al. WeedCLR: Weed contrastive learning through visual representations with class-optimized loss in long-tailed datasets. arXiv. , (2023).
  4. Saleh, A., et al. Semi-supervised weed detection for rapid deployment and enhanced efficiency. Comput. Electron. Agric. 236, 110410(2025).
  5. Wang, Y., Zhang, S., Dai, B., Yang, S., Song, H. Fine-grained weed recognition using Swin Transformer and two-stage transfer learning. Front. Plant Sci. 14, 1134932(2023).
  6. Kar, S., et al. Self-supervised learning improves classification of agriculturally important insect pests in plants. Plant Phenomics J. 6 (1), e20079(2023).
  7. Garibaldi-Márquez, F., et al. Advances on deep learning for proximal image-based weed recognition and control under authentic farmlands: a state-of-the-art review. Smart Agric. Technol. 12, 101405(2025).
  8. Mohan, R. N. V. J., Rayanoothala, P. S., Sree, R. P. Next-gen agriculture: integrating AI and XAI for precision crop yield predictions. Front. Plant Sci. 15, 1451607(2025).
  9. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. Proc. IEEE Int. Conf. Comput. Vis. (ICCV), , 618-626 (2017).
  10. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhyay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf. Appl. Comput. Vis. (WACV), , 839-847 (2018).
  11. Sahu, M., Majhi, B. WinterCropWeedDB-Sample: A benchmark dataset for weed classification in winter crops. Mendeley Data. V1, (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Winter Crop ClassificationWeed Image ClassificationSelf Supervised LearningDeep LearningEfficientNet B3SimCLR ApproachContrastive LossSupervised Fine TuningGrad CAM VisualizationPrecision Agriculture

Related Articles