Research Article

Un cadre d’apprentissage auto-supervisé en deux étapes pour la classification des images de mauvaises herbes cultivées en hiver

DOI:

10.3791/69953

February 24th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail évalue l’application d’un pipeline d’apprentissage profond en deux étapes pour la pré-formation auto-supervisée et l’ajustement fin supervisé de la classification des images des cultures d’hiver et des mauvaises herbes. Les expériences sur le jeu de données WinterCropWeedDB sont menées en utilisant une seule division interne, avec des visualisations Grad-CAM incluses.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’agriculture de précision nécessite une distinction précise entre les cultures d’hiver et les mauvaises herbes, mais il manque des données d’images annotées pour les systèmes de culture hivernale. Cet article étudie une approche d’apprentissage profond en deux étapes qui intègre l’apprentissage auto-supervisé des caractéristiques avec un ajustement supervisé pour la classification des images des cultures et des mauvaises herbes en hiver. Un nouveau jeu de données d’images des cultures d’hiver et des mauvaises herbes, WinterCropWeedDB, est proposé et utilisé dans cet article, qui contient 1 136 images haute résolution de six espèces de cultures d’hiver et quatre espèces de mauvaises herbes collectées dans des champs agricoles du centre de l’Inde. Lors de la première étape de l’apprentissage auto-supervisé, un modèle EfficientNet-B3 est pré-entraîné en utilisant une approche d’apprentissage auto-supervisé de type SimCLR avec une fonction de perte InfoNCE (température τ = 0,5) sur les images. La valeur moyenne de perte contrastive passe de 2,0712 lors de la première itération à 1,6835 à la fin du préentraînement. Lors de la deuxième étape de l’ajustement fin supervisé, le modèle EfficientNet-B3 pré-entraîné est ajusté avec une tête de classificateur supervisé sur les images et testé sur une seule répartition interne de validation (30 %) du jeu de données. Le modèle affiné atteint une précision maximale de validation de 98,27 %, avec un score F1 macro-moyen de 0,98. La cartographie d’activation des classes pondérée par gradient (Grad-CAM) et Grad-CAM++ sont utilisées sur le modèle affiné pour fournir une visualisation qualitative des régions d’image qui contribuent aux prédictions de classe. Les résultats de l’expérience démontrent la viabilité de l’utilisation d’un préentraînement auto-supervisé et d’un ajustement fin supervisé pour la classification des images de cultures d’hiver et de mauvaises herbes sur un ensemble de données régional, tout en soulignant l’importance de tests supplémentaires sur des ensembles de tests indépendants.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’agriculture de précision a vu l’utilisation croissante de méthodes de vision par ordinateur basées sur l’apprentissage profond pour la classification automatisée des cultures et des mauvaisesherbes 1. Il a été démontré que les réseaux de neurones convolutionnels sont efficaces dans les tâches de reconnaissance des plantes ; cependant, leurs performances dépendent généralement de la disponibilité de grands ensembles de données annotés de manièreprécise 2. Dans la plupart des environnements agricoles, en particulier dans les systèmes de culture sous-représentés comme les cultures d’hiver, le processus d’obtention de données d’images étiquetées étendues est long, laborieux etcoûteux 3,4. Cela nuit au développement de systèmes d’aide à la décision basés sur les données pour les agroécosystèmes hivernaux. L’apprentissage auto-supervisé (SSL) est un paradigme qui a récemment montré des promesses pour l’apprentissage par représentation, où il utilise un grand nombre d’images pour apprendre des caractéristiques informatives même si elles ne sont pas identifiées5. Grâce à la conception de tâches de prétexte, telles que l’apprentissage contrastif, SSL permet aux réseaux de neurones d’apprendre des motifs structurels et sémantiques dans les données d’images, qui peuvent ensuite être transférés vers des tâches d’apprentissagesupervisé 6. Des études antérieures en imagerie agricole ont montré que la pré-formation basée sur SSL peut améliorer les performances en aval lorsque les données marquées sont limitées, ce qui motive son exploration des problèmes de reconnaissance des cultures et des mauvaisesherbes 1,7.

Parallèlement, des méthodes d’apprentissage semi-supervisé et d’apprentissage contrastif ont également été explorées. Des méthodes d’apprentissage semi-supervisé qui exploitent à la fois des données marquées et non étiquetées, comme l’apprentissage enseignant-élève et le pseudo-marquage, ont été explorées pour la classification et la détection des mauvaisesherbes 2,4. Plus récemment, les méthodes d’apprentissage contrastif avec des objectifs conscients de la classe ont montré le potentiel d’apprendre des représentations transférables à partir d’images agricoles, en particulier dans des scénarios avec un déséquilibre de classe ou peu d’annotations 1,3. Bien que ces études indiquent les avantages potentiels de l’apprentissage semi-supervisé et des techniques associées par rapport à l’apprentissage entièrement supervisé, la majorité de la littérature existante s’est limitée aux systèmes de culture estivale, à la détection d’objets ou à des ensembles de données à grande échelle.

Au-delà de la précision prédictive, l’interprétabilité des mécanismes de prise de décision internes des réseaux de neurones profonds reste une préoccupation pertinente pour les applications agricoles pratiques. Les techniques d’intelligence artificielle explicable (XAI) sont conçues pour offrir des explications interprétables des prédictions des modèles, tentant ainsi de combler le fossé entre les prédictions du modèle et l’expertisehumaine 8. Les algorithmes de visualisation basés sur le gradient, tels que la cartographie d’activation des classes pondérée par gradient (Grad-CAM) et son extension Grad-CAM++9,10, produisent des cartes thermiques discriminatives par classe qui indiquent les régions d’intérêt dans une image les plus pertinentes pour les prédictions d’un modèle. Ces algorithmes sont couramment utilisés pour l’analyse qualitative des représentations apprises dans les tâches d’analyse d’images agricoles, mais ne représentent pas une validation formelle de l’interprétabilité.

L’objectif principal de ce travail de recherche est d’étudier le potentiel d’un cadre d’apprentissage en deux étapes pour la classification des images de cultures d’hiver et de mauvaises herbes en utilisant un apprentissage représentatif auto-supervisé et un ajustement fin supervisé, ainsi qu’une visualisation qualitative. Dans cette recherche, l’application d’un pipeline d’apprentissage en deux étapes pour la classification des images des cultures et des mauvaises herbes en hiver, intégrant un préentraînement auto-supervisé avec SimCLR et un ajustement fin supervisé avec EfficientNet-B3 a été étudiée. Les expériences sont réalisées sur le jeu de données WinterCropWeedDB, un ensemble de données régional représentant des images de cultures d’hiver et de mauvaises herbes collectées dans des champs agricoles du centre del’Inde 11. Les résultats sont analysés à partir d’une division interne unique, et Grad-CAM et Grad-CAM++ sont utilisés pour visualiser l’attention du modèle. L’objectif de cette recherche est d’étudier la possibilité de combiner l’apprentissage auto-supervisé de la représentation et des méthodes de visualisation pour la classification des images des cultures d’hiver et des mauvaises herbes, tout en étant conscient des limites de la configuration expérimentale. Ce flux de travail est destiné à l’évaluation exploratoire des ensembles de données régionales sur les plantes et les mauvaises herbes cultivées avec des données étiquetées limitées et n’est pas destiné à constituer un repère validé pour une généralisation ou une utilisation à grande échelle.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Description du jeu de données

Le jeu de données WinterCropWeedDB se compose de 1 136 images RVB haute résolution (rouge, vert, bleu) de six espèces de cultures d’hiver (blé, pois chiche, pois, lentille, moutarde et pois d’herbe) et de quatre espèces de mauvaises herbes (vesce commune, canari naine, pied d’oie (Chenopodium album) et Euphorbia clementei) prises dans des champs agricoles d’hiver dans l’État du Chhattisgarh, en Inde (Figure 1)). Les images ont été prises dans des conditions naturelles, incluant des éclairages variés, des stades de croissance et une complexité de fond. Toutes les images étaient initialement non annotées et utilisées uniquement pour la préparation auto-supervisée. Pour l’ajustement fin supervisé, les images ont été annotées manuellement et divisées en échantillonnage stratifié en ensembles d’entraînement (70 %) et de validation (30 %). Le jeu de validation n’était utilisé que pour l’évaluation interne du modèle et n’a pas été augmenté. Pour résoudre les problèmes de déséquilibre de classe et de robustesse pendant l’entraînement, l’augmentation des données n’a été réalisée que sur l’ensemble d’entraînement. Les techniques d’augmentation impliquaient des rotations aléatoires (+/-20°), des retournements horizontaux, des mises à l’échelle, des translations, des changements de luminosité et des transformations affines légères. Les échantillons d’entraînement ont été augmentés à une cible de 150 images par classe, pour un total de 1 500 images d’entraînement, tandis que l’ensemble de validation comprenait 347 images originales. Aucune image augmentée ou synthétique n’a été incluse dans l’ensemble de validation pour éviter le biais d’évaluation. Outre l’évaluation de retenue, une validation croisée stratifiée à cinq reprises a également été réalisée sur le jeu de données initialement identifié comme analyse secondaire. Dans chaque pli, l’augmentation des données était effectuée uniquement sur les ensembles d’entraînement, et les ensembles de validation étaient maintenus inchangés pour maintenir la cohérence avec le schéma principal d’évaluation.

Flux de travail computationnel pour l’entraînement de modèles auto-supervisé et supervisé

Un pipeline computationnel en deux étapes a été utilisé pour étudier la viabilité de l’intégration de l’apprentissage auto-supervisé de la représentation et de l’ajustement fin supervisé pour la classification des images des cultures d’hiver par rapport à l’image des mauvaises herbes (Figure 2). Ce pipeline comprend : (i) un préentraînement auto-supervisé avec des images non étiquetées, et (ii) un ajustement fin supervisé avec un échantillon étiqueté des images. Toutes les images étaient redimensionnées à 300 × 300 pixels et normalisées avant l’entraînement. Les évaluations des modèles n’ont été effectuées que sur une seule division interne, sans utiliser un ensemble de tests externe.

Étape 1 - pré-entraînement auto-supervisé

Au stade initial, l’architecture EfficientNet-B3 a été utilisée comme réseau dorsale dans une configuration d’apprentissage auto-supervisée inspirée de SimCLR. La tête de projection à deux couches réduisait la représentation du scol vertébral à un espace d’immersion de dimension 128. Pour l’apprentissage auto-supervisé, chaque image a été convertie en deux vues en utilisant un recadrage redimensionné aléatoire, un retournement horizontal, une transformation des couleurs, un flou gaussienne et la conversion en niveaux de gris. Les deux vues ont été traitées ensemble pour optimiser conjointement la fonction de perte contrastive. Le processus d’apprentissage auto-supervisé a été réalisé pendant 30 époques, où une époque désigne un passage complet de l’ensemble de l’ensemble des jeux de données d’entraînement à travers le modèle lors de l’optimisation, avec une taille de lot de 16 images utilisant l’optimiseur Adam (un algorithme d’optimisation adaptatif basé sur un gradient qui estime les moments de premier et second ordre des gradients pour ajuster les taux d’apprentissage pendant l’entraînement). Le clipping de gradient avec une norme maximale de 1,0 était utilisé pour assurer un entraînement stable. De plus, des points de contrôle des modèles étaient conservés après chaque époque pour faciliter la reproductibilité. La valeur de température de 0,5 a été utilisée lors du calcul de la perte InfoNCE lors de l’apprentissage auto-supervisé.

Étape 2 - réglage fin supervisé

Après un entraînement pré-supervisé auto-supervisé, la tête de projection a été retirée et les poids de la colonne vertébrale préentraînés ont été utilisés pour un réglage fin supervisé. Une tête de classificateur entièrement connectée a été ajoutée à la colonne vertébrale pour la classification multi-classes. L’ajustement fin a été effectué uniquement en utilisant les images étiquetées du jeu d’entraînement. L’entraînement supervisé utilisait la perte d’entropie croisée avec pondération des classes et lissage des étiquettes pour gérer le déséquilibre des classes. L’optimiseur Adam était utilisé avec des taux d’apprentissage différents pour la colonne vertébrale (1 × 10⁻⁵) et le classificateur (1 × 10⁻⁴). Un planificateur de taux d’apprentissage a été utilisé pour diminuer le taux d’apprentissage lorsque la précision de validation plafonnait. La formation a été effectuée pendant 20 époques, et le point de contrôle du modèle avec la plus grande précision de validation a été conservé pour évaluation.

En plus de l’évaluation principale de la retenue, une validation croisée stratifiée à cinq reprises a été réalisée comme analyse supplémentaire sur l’ensemble marqué. Dans chaque pli, l’augmentation n’était effectuée que sur les ensembles d’entraînement, et les ensembles de validation restaient inchangés. Les résultats de la validation croisée ont été présentés séparément et n’ont pas été utilisés pour la sélection du modèle ou l’optimisation des points de contrôle. Les indicateurs de performance présentés dans cette étude sont basés uniquement sur la répartition interne des validations et représentent les résultats de la performance observée dans la configuration expérimentale actuelle.

Visualisation Grad-CAM et Grad-CAM++

Pour l’analyse qualitative de l’attention dans le modèle, des méthodes de cartographie d’activation de classes basées sur le gradient (Grad-CAM et Grad-CAM++) ont été utilisées sur le modèle affiné. Les cartes de caractéristiques et les gradients ont été obtenus à partir de la couche convolutionnelle finale du réseau de base, et des cartes thermiques spécifiques à chaque classe ont été obtenues pour des images de validation choisies. Ces derniers n’étaient utilisés qu’à des fins d’analyse qualitative du modèle et n’ont pas été validés. Le tableau des matériaux répertorie tout le matériel, les bibliothèques logicielles, les jeux de données et les scripts d’entraînement personnalisés utilisés dans ce flux de travail.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aperçu des approches antérieures et du positionnement des flux de travail

Un résumé des approches d’apprentissage représentatives précédemment appliquées pour la reconnaissance des mauvaises herbes agricoles est présenté dans le Tableau 1. Le tableau présente un aperçu des stratégies d’apprentissage supervisées, semi-supervisées et auto-supervisées, des ensembles de données utilisés, des résultats rapportés et des limites prés...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a examiné l’utilisation d’une approche d’apprentissage profond en deux étapes consistant en un préentraînement auto-supervisé utilisant l’idée SimCLR et un ajustement supervisé pour la classification des images des cultures et des mauvaises herbes en hiver dans le jeu de données WinterCropWeedDB. Les résultats montrent que l’approche proposée peut être entraînée de manière fiable sur un ensemble d’images d’agriculture hivernale spécifique à une région et testée sur une divisio...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs ne déclarent aucun intérêt concurrent. Les outils de langage basés sur l’IA (QuillBot) étaient utilisés uniquement pour le polissage du langage et la préparation des réfutations, et tout le contenu scientifique ainsi que les conclusions étaient rédigés par les auteurs.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche n’a reçu aucune subvention spécifique de la part d’agences de financement des secteurs public, commercial ou à but non lucratif.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Boîte à outils CUDANVIDIA12.8
cuDNNNVIDIA9.1
Unité de traitement graphique (GPU)NVIDIAGPU GeForce RTX 5050 pour ordinateurs portables
MatplotlibDéveloppeurs Matplotlib3.9.2
NumPyDéveloppeurs NumPy1.26.0
Système d’exploitationMicrosoftLinux (WSL2), noyau 6.6.87
PythonFondation Python Software3.12.7
PyTorchFondation PyTorch2.1.0 (version de développement)
scikit-learnscikit-learn Développeurs1.5.1
timmDépôt GitHub1.0.24
TorchvisionFondation PyTorch0.25.0 (version de développement)
WinterCropWeedDBMendeley Data, DOI : 10.17632/m4h6zdsh79.1Version 1

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Güldenring, R., Nalpantidis, L. Self-supervised contrastive learning on agricultural images. Comput. Electron. Agric. 191, 106510(2021).
  2. Li, J., et al. Performance evaluation of semi-supervised learning frameworks for multi-class weed detection. Front. Plant Sci. 15, 1396568(2024).
  3. Saleh, A., et al. WeedCLR: Weed contrastive learning through visual representations with class-optimized loss in long-tailed datasets. arXiv. , (2023).
  4. Saleh, A., et al. Semi-supervised weed detection for rapid deployment and enhanced efficiency. Comput. Electron. Agric. 236, 110410(2025).
  5. Wang, Y., Zhang, S., Dai, B., Yang, S., Song, H. Fine-grained weed recognition using Swin Transformer and two-stage transfer learning. Front. Plant Sci. 14, 1134932(2023).
  6. Kar, S., et al. Self-supervised learning improves classification of agriculturally important insect pests in plants. Plant Phenomics J. 6 (1), e20079(2023).
  7. Garibaldi-Márquez, F., et al. Advances on deep learning for proximal image-based weed recognition and control under authentic farmlands: a state-of-the-art review. Smart Agric. Technol. 12, 101405(2025).
  8. Mohan, R. N. V. J., Rayanoothala, P. S., Sree, R. P. Next-gen agriculture: integrating AI and XAI for precision crop yield predictions. Front. Plant Sci. 15, 1451607(2025).
  9. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. Proc. IEEE Int. Conf. Comput. Vis. (ICCV), , 618-626 (2017).
  10. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhyay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf. Appl. Comput. Vis. (WACV), , 839-847 (2018).
  11. Sahu, M., Majhi, B. WinterCropWeedDB-Sample: A benchmark dataset for weed classification in winter crops. Mendeley Data. V1, (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Winter Crop ClassificationWeed Image ClassificationSelf Supervised LearningDeep LearningEfficientNet B3SimCLR ApproachContrastive LossSupervised Fine TuningGrad CAM VisualizationPrecision Agriculture

Related Articles