$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Descrição do conjunto de dados
O conjunto de dados WinterCropWeedDB consiste em 1.136 imagens RGB de alta resolução (vermelho, verde, azul) de seis espécies de culturas de inverno (trigo, grão-de-bico, ervilha, lentilha, mostarda e ervilha-de-grama) e quatro espécies de ervas daninhas (ervilha-comum, canário-pequeno, pé-de-galinha (Chenopodium album) e Euphorbia clementei) retiradas de campos agrícolas de inverno no estado de Chhattisgarh, Índia (Figura 1)). As imagens foram tiradas em condições naturais, incluindo variações de iluminação, estágios de crescimento e complexidade do fundo. Todas as imagens foram inicialmente não anotadas e usadas apenas para pré-treinamento auto-supervisionado. Para ajuste fino supervisionado, as imagens foram anotadas manualmente e divididas usando amostragem estratificada em conjuntos de treinamento (70%) e validação (30%). O conjunto de validação era usado apenas para avaliação interna do modelo e não foi ampliado. Para resolver problemas de desequilíbrio de classe e robustez durante o treinamento, a ampliação de dados foi realizada apenas no conjunto de treinamento. As técnicas de aumento envolviam rotações aleatórias (+/-20°), inversão horizontal, escala, translação, mudanças de brilho e transformações afins leves. As amostras de treinamento foram ampliadas para um alvo de 150 imagens por turma, resultando em um total de 1.500 imagens de treinamento, enquanto o conjunto de validação consistia em 347 imagens originais. Nenhuma imagem aumentada ou sintética foi incluída no conjunto de validação para evitar viés de avaliação. Além da avaliação de resistência, uma validação cruzada estratificada de cinco vezes também foi realizada no conjunto de dados original rotulado como análise secundária. Em cada dobra, a ampliação de dados era feita apenas nos conjuntos de treinamento, e os conjuntos de validação eram mantidos inalterados para manter a consistência com o esquema principal de avaliação.
Fluxo de trabalho computacional para treinamento de modelos auto-supervisionados e supervisionados
Um pipeline computacional em duas etapas foi utilizado para investigar a viabilidade da integração de aprendizado de representação auto-supervisionado e ajuste fino supervisionado para classificação de imagens de culturas de inverno versus ervas daninhas daninhas (Figura 2). Esse pipeline envolve: (i) pré-treinamento auto-supervisionado com imagens não rotuladas, e (ii) ajuste fino supervisionado com uma amostra rotulada das imagens. Todas as imagens eram redimensionadas para 300 × 300 pixels e normalizadas antes do treinamento. As avaliações dos modelos foram realizadas apenas em uma divisão interna, sem usar um conjunto de teste externo.
Estágio 1 - pré-treinamento auto-supervisionado
Na fase inicial, a arquitetura EfficientNet-B3 foi empregada como a rede dorsal em uma configuração de aprendizado auto-supervisionada inspirada no SimCLR. A cabeça de projeção de duas camadas reduziu a representação da espinha dorsal para um espaço de imersão de 128 dimensões. Para aprendizado auto-supervisionado, cada imagem foi convertida em duas vistas usando corte aleatório redimensionado, viragem horizontal, transformação de cor, desfoque Gaussiano e conversão para escala de cinza. As duas visões foram processadas juntas para otimizar conjuntamente a função de perda contrastiva. O processo de aprendizado auto-supervisionado foi realizado por 30 épocas, onde uma época indica uma passagem completa de todo o conjunto de dados de treinamento pelo modelo durante a otimização, com um lote de 16 imagens usando o otimizador Adam (um algoritmo de otimização baseado em gradiente adaptativo que estima os momentos de primeira e segunda ordem dos gradientes para ajustar as taxas de aprendizado durante o treinamento). O gradient clipping com norma máxima de 1.0 foi usado para garantir um treinamento estável. Além disso, pontos de verificação dos modelos eram salvos após cada época para facilitar a reprodutibilidade. O valor de temperatura de 0,5 foi usado ao calcular a perda do InfoNCE durante o aprendizado auto-supervisionado.
Estágio 2 - ajuste fino supervisionado
Após o pré-treinamento auto-supervisionado, a cabeça de projeção foi removida, e os pesos pré-treinados da coluna vertebral foram usados para ajuste fino supervisionado. Uma cabeça classificadora totalmente conectada foi adicionada à espinha dorsal para classificação multiclasse. O ajuste fino era feito usando apenas as imagens rotuladas do conjunto de treinamento. O treinamento supervisionado utilizou perda de entropia cruzada com ponderação de classe e suavização de rótulos para lidar com o desequilíbrio de classes. O otimizador Adam foi usado com diferentes taxas de aprendizado para a espinha dorsal (1 × 10⁻⁵) e classificador (1 × 10⁻⁴). Um escalonador de taxa de aprendizado foi usado para diminuir a taxa de aprendizado quando a precisão da validação estagnava. O treinamento foi realizado por 20 épocas, e o checkpoint do modelo com maior precisão de validação foi salvo para avaliação.
Além da avaliação principal de resistência, foi realizada uma validação cruzada estratificada de cinco vezes como análise adicional no conjunto rotulado. Em cada dobra, a ampliação era feita apenas nos conjuntos de treinamento, e os conjuntos de validação permaneciam inalterados. Os resultados da validação cruzada foram apresentados separadamente e não foram usados para seleção de modelos ou otimização dos checkpoints. As métricas de desempenho apresentadas neste estudo baseiam-se unicamente na divisão interna de validação e representam os resultados do desempenho observado sob a configuração experimental atual.
Visualização Grad-CAM e Grad-CAM++
Para a análise qualitativa da atenção no modelo, métodos de ativação de classes baseados em gradiente (Grad-CAM e Grad-CAM++) foram usados no modelo finamente ajustado. Os mapas de características e os gradientes foram obtidos a partir da camada convolucional final da rede base, e mapas de calor específicos de classe foram obtidos para imagens de validação escolhidas. Esses foram usados apenas para fins de análise qualitativa do modelo e não foram validados. A Tabela de materiais lista todo o hardware, bibliotecas de software, conjuntos de dados e scripts de treinamento personalizados usados nesse fluxo de trabalho.