Research Article

Een tweefasig zelf-supervised leerkader voor de classificatie van wintergewas-onkruidbeelden

DOI:

10.3791/69953

February 24th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk beoordeelt de toepassing van een tweefasige deep learning-pijplijn voor de zelf-supervised pretraining en begeleide finetuning van de classificatie van wintergewassen en onkruidbeelden. De experimenten op de WinterCropWeedDB-dataset worden uitgevoerd met een enkele interne splitsing, met Grad-CAM-visualisaties inbegrepen.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Precisielandbouw vereist nauwkeurig onderscheid tussen wintergewassen en onkruid, maar er is een gebrek aan geannoteerde beeldgegevens voor winterteeltsystemen. Dit artikel onderzoekt een tweefasige deep learning-benadering die zelf-supervised feature learning integreert met supervised fine-tuning voor de classificatie van wintergewassen en onkruidbeelden. Een nieuwe dataset voor wintergewassen en onkruidbeelden, WinterCropWeedDB, wordt voorgesteld en gebruikt in dit artikel, dat 1.136 hoge-resolutiebeelden bevat van zes wintergewassoorten en vier onkruidsoorten verzameld op landbouwvelden in centraal India. In de eerste fase van zelf-supervised learning wordt een EfficientNet-B3-model vooraf getraind met een SimCLR-achtige zelf-supervised learning-aanpak met een InfoNCE-verliesfunctie (temperatuur τ = 0,5) op de afbeeldingen. De gemiddelde contrastieve verlieswaarde daalt van 2,0712 in de eerste iteratie tot 1,6835 aan het einde van de pretraining. In de tweede fase van supervised fine-tuning wordt het vooraf getrainde EfficientNet-B3-model fijn afgesteld met een begeleide classifierkop op de beelden en getest op een enkele interne validatiesplitsing (30%) van de dataset. Het fijn afgestelde model bereikt een maximale validatienauwkeurigheid van 98,27%, met een macro-gemiddelde F1-score van 0,98. Gradiëntgewogen classactivatiemapping (Grad-CAM) en Grad-CAM++ worden gebruikt op het fijn afgestemde model om een kwalitatieve visualisatie te bieden van de beeldgebieden die bijdragen aan klassevoorspellingen. De experimentresultaten tonen de haalbaarheid aan van zelf-supervised pretraining en supervised fine-tuning voor de classificatie van wintergewas- en onkruidbeelden op een regio-specifieke dataset, terwijl ook het belang wordt benadrukt van extra testen op onafhankelijke testsets.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Precisielandbouw heeft een toenemende toepassing gezien van deep learning-gebaseerde computer vision-methoden voor geautomatiseerde gewas- en onkruidclassificatie1. Convolutionele neurale netwerken zijn effectief gebleken bij plantherkenningstaken; hun prestaties zijn echter meestal afhankelijk van de beschikbaarheid van grote datasets die op een nauwkeurige manier zijn geannoteerd2. In de meeste landbouwomgevingen, vooral in ondervertegenwoordigde teeltsystemen zoals wintergewassen, is het proces om uitgebreide gelabelde beeldgegevens te verkrijgen tijdrovend, arbeidsintensief en duur 3,4. Dit belemmert de ontwikkeling van besluitvormingsondersteuningssystemen die datagedreven zijn voor winteragro-ecosystemen. Zelf-supervised learning (SSL) is een paradigma dat recentelijk veelbelovend is getoond voor representatieleer, waarbij een groot aantal afbeeldingen wordt gebruikt om kenmerken te leren die informatief zijn, ook al zijn ze niet gelabeldals 5. Door het ontwerpen van prescripttaken, zoals contrastief leren, stelt SSL neurale netwerken in staat structurele en semantische patronen in beelddata te leren, die vervolgens kunnen worden overgedragen aan begeleide leertaken6. Eerdere studies in landbouwbeeldvorming hebben aangetoond dat SSL-gebaseerde pretraining de prestaties van downstream kan verbeteren wanneer gelabelde data beperkt is, wat de verkenning van problemen met gewas- en onkruidherkenningmotiveerde 1,7.

Tegelijkertijd zijn ook semi-supervised learning en contrastief leren onderzocht. Semi-supervised leermethoden die zowel gelabelde als niet-gelabelde data gebruiken, zoals leraar-leerling leren en pseudo-labeling, zijn onderzocht voor wietclassificatie en detectie 2,4. Meer recentelijk hebben contrastieve leermethoden met klassebewuste doelstellingen aangetoond dat ze het potentieel hebben om overdraagbare representaties te leren uit landbouwbeelden, vooral in scenario's met klassenonevenwicht of weinig annotaties 1,3. Hoewel deze studies de potentiële voordelen van semi-supervised learning en gerelateerde technieken ten opzichte van volledig supervised learning aangeven, is het merendeel van de bestaande literatuur beperkt gebleven tot zomerse teelsystemen, objectdetectie of grootschalige datasets.

Afgezien van de voorspellende nauwkeurigheid is de interpreteerbaarheid van de interne besluitvormingsmechanismen van diepe neurale netwerken nog steeds een relevante zorg voor praktische landbouwtoepassingen. Verklaarbare kunstmatige intelligentie (XAI)-technieken zijn ontworpen om interpreteerbare verklaringen van modelvoorspellingen te bieden, en proberen zo de kloof tussen modelvoorspellingen en menselijke expertisete vullen 8. Gradiëntgebaseerde visualisatie-algoritmen, zoals Gradient-weighted class activation mapping (Grad-CAM) en de uitbreiding Grad-CAM++9,10, produceren klasse-discriminatieve heatmaps die de interessegebieden in een afbeelding aangeven die het meest relevant zijn voor de voorspellingen van een model. Deze algoritmen worden vaak gebruikt voor de kwalitatieve analyse van geleerde representaties in landbouwbeeldanalysetaken, maar vormen geen formele validatie van interpreteerbaarheid.

Het primaire doel van dit onderzoek is het onderzoeken van het potentieel van een tweefasig leerkader voor de classificatie van wintergewassen- en onkruidbeelden met zelf-supervised representation learning en supervised fine-tuning, samen met kwalitatieve visualisatie. In dit onderzoek werd de toepassing van een tweestaps leerpijplijn voor de classificatie van wintergewassen en onkruidbeelden onderzocht, waarbij zelfbegeleide pretraining met SimCLR en begeleide fine-tuning met EfficientNet-B3 werd geïntegreerd. De experimenten worden uitgevoerd op de WinterCropWeedDB-dataset, een regio-specifieke dataset van wintergewassen- en onkruidbeelden verzameld van landbouwvelden in centraal India11. De resultaten worden geanalyseerd op basis van een enkele interne splitsing, en Grad-CAM en Grad-CAM++ worden gebruikt om de aandacht van het model te visualiseren. Het doel van dit onderzoek is om de mogelijkheid te onderzoeken om zelf-supervised representatieleer- en visualisatiemethoden te combineren voor de classificatie van wintergewassen en onkruidbeelden, terwijl men zich ook bewust is van de beperkingen van de experimentele opzet. Deze workflow is bedoeld voor verkennende beoordeling van regio-specifieke gewasonkruid-datasets met beperkte gelabelde data en is niet bedoeld als een gevalideerde benchmark voor generalisatie of grootschalig gebruik.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Datasetbeschrijving

De WinterCropWeedDB-dataset bestaat uit 1.136 hoge-resolutie (rood, groen, blauw) RGB-afbeeldingen van zes wintergewassoorten (tarwe, kikkererwt, erwten, linzen, mosterd en graserwt) en vier onkruidsoorten (gewone wikke, kleine kanariegras, ganzenvoet (Chenopodium album) en Euphorbia clementei) afkomstig van winterlandbouwgrond in de staat Chhattisgarh, India (Figuur 1). De beelden zijn genomen onder natuurlijke omstandigheden, waaronder wisselende verlichting, groeistadia en achtergrondcomplexiteit. Alle afbeeldingen waren aanvankelijk niet geannoteerd en alleen gebruikt voor zelfbegeleide voortraining. Voor supervised fine-tuning werden de beelden handmatig geannoteerd en opgesplitst met behulp van gestratificeerde steekproeven in trainingssets (70%) en validatiesets (30%). De validatieset werd alleen gebruikt voor interne modelevaluatie en was niet uitgebreid. Om problemen met klasse-onbalans en robuustheid tijdens training aan te pakken, werd data-augmentatie alleen uitgevoerd op de trainingsset. De augmentatietechnieken omvatten willekeurige rotaties (+/-20°), horizontale flipping, schaalverdeling, translatie, helderheidsveranderingen en milde affiene transformaties. De trainingsvoorbeelden werden uitgebreid tot een doel van 150 afbeeldingen per les, wat resulteerde in een totaal van 1.500 trainingsbeelden, terwijl de validatieset uit 347 originele beelden bestond. Er werden geen augmented of synthetische beelden opgenomen in de validatieset om evaluatiebias te voorkomen. Naast de hold-out evaluatie werd ook een gestratificeerde vijfvoudige kruisvalidatie uitgevoerd op de oorspronkelijke gelabelde dataset als secundaire analyse. In elke vouw werd data-augmentatie alleen uitgevoerd op de trainingssets, en de validatiesets bleven ongewijzigd om consistentie te behouden met het hoofdevaluatieschema.

Computationele workflow voor zelfbegeleide en supervised modeltraining

Er werd een tweestaps computationele pijplijn gebruikt om de haalbaarheid te onderzoeken van het integreren van zelf-supervised representation learning en supervised fine-tuning voor de classificatie van wintergewassen versus onkruidbeelden (Figuur 2). Deze pijplijn omvat: (i) zelfbegeleide voortraining met niet-gelabelde beelden, en (ii) begeleide fine-tuning met een gelabelde steekproef van de afbeeldingen. Alle beelden werden verkleind tot 300 × 300 pixels en genormaliseerd vóór de training. Evaluaties van de modellen werden slechts uitgevoerd op één interne splitsing, zonder gebruik te maken van een externe testset.

Fase 1 - zelfbegeleide voortraining

In de beginfase werd de EfficientNet-B3-architectuur gebruikt als backbone-netwerk in een zelf-supervised leeropstelling geïnspireerd op SimCLR. De tweelaagse projectiekop reduceerde de backbone-representatie tot een 128-dimensionale embeddingruimte. Voor zelfbegeleid leren werd elke afbeelding omgezet in twee weergaven met willekeurige verkleinde uitsnijding, horizontale flipping, kleurtransformatie, Gaussische vervaging en het converteren naar grijswaarden. De twee weergaven werden samen verwerkt om gezamenlijk de contrastieve verliesfunctie te optimaliseren. Het zelf-supervised leerproces werd uitgevoerd gedurende 30 epochs, waarbij één epoche een volledige doorloop van de volledige trainingsdataset door het model tijdens optimalisatie aanduidt, met een batchgrootte van 16 afbeeldingen met behulp van de Adam-optimizer (een adaptief gradiënt-gebaseerd optimalisatie-algoritme dat eerste- en tweede-orde momenten van de gradiënten schat om leertempo's tijdens training aan te passen). Gradient clipping met een maximale norm van 1,0 werd gebruikt om stabiele training te garanderen. Daarnaast werden modelcontrolepunten na elke epoche opgeslagen om reproduceerbaarheid te vergemakkelijken. De temperatuurwaarde van 0,5 werd gebruikt bij het berekenen van het InfoNCE-verlies tijdens zelfbegeleid leren.

Fase 2 - begeleide fijnafstelling

Na zelfbegeleide voortraining werd de projectiekop verwijderd en werden de vooraf getrainde ruggengraatgewichten gebruikt voor begeleide fijnafstelling. Een volledig verbonden classifier-hoofd werd toegevoegd aan de ruggengraat voor multi-class classificatie. De fijnafstelling werd uitgevoerd met alleen de gelabelde afbeeldingen uit de trainingsset. Onder toezicht werd gebruik gemaakt van kruis-entropieverlies met klasseweging en labelgladstrijken om klasse-onevenwicht op te vangen. De Adam-optimizer werd gebruikt met verschillende leersnelheden voor de backbone (1 × 10⁻⁵) en classifier (1 × 10⁻⁴). Een learning rate scheduler werd gebruikt om de leersnelheid te verlagen wanneer de validatienauwkeurigheid een plateau bereikte. Er werd 20 epochs getraind, en het modelcheckpoint met de hoogste validatienauwkeurigheid werd bewaard voor evaluatie.

Naast de hoofd-hold-out evaluatie werd een gestratificeerde vijfvoudige kruisvalidatie uitgevoerd als aanvullende analyse op de gelabelde set. In elke vouw werd de augmentatie alleen uitgevoerd op de trainingssets, en de validatiesets bleven ongewijzigd. De resultaten van de kruisvalidatie werden afzonderlijk gepresenteerd en werden niet gebruikt voor modelselectie of optimalisatie van de checkpoints. De prestatie-indicatoren die in deze studie worden gepresenteerd, zijn uitsluitend gebaseerd op de interne validatieverdeling en vertegenwoordigen de resultaten van de waargenomen prestaties onder de huidige experimentele opstelling.

Grad-CAM en Grad-CAM++ visualisatie

Voor de kwalitatieve analyse van aandacht in het model werden gradiëntgebaseerde class-activation mapping methoden (Grad-CAM en Grad-CAM++) gebruikt op het fijn afgestemde model. De featuremaps en de gradiënten werden verkregen van de laatste convolutionele laag van het basisnetwerk, en klasse-specifieke heatmaps werden verkregen voor gekozen validatiebeelden. Deze werden alleen gebruikt voor kwalitatieve analyse van het model en waren niet gevalideerd. De Tabel met materialen geeft alle hardware, softwarebibliotheken, datasets en aangepaste trainingsscripts weer die in deze workflow worden gebruikt.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Overzicht van eerdere benaderingen en workflow-positionering

Een samenvatting van representatieve leermethoden die eerder zijn toegepast voor het herkennen van landbouwonkruid is te vinden in Tabel 1. De tabel geeft een overzicht van begeleide, semi-supervised en zelf-supervised leerstrategieën, gebruikte datasets, gerapporteerde resultaten en de gepresenteerde beperkingen. De meeste eerdere werken richten zich op zomerse teel...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit werk onderzocht het gebruik van een tweestaps deep learning-benadering, bestaande uit zelfbegeleide pretraining met behulp van het SimCLR-idee en begeleide fine-tuning voor de classificatie van wintergewassen en onkruidbeelden op de WinterCropWeedDB-dataset. De resultaten tonen aan dat de voorgestelde aanpak betrouwbaar kan worden getraind op een regio-specifieke winterlandbouwbeelddataset en getest kan worden op één splitsing van de interne validatieset. Deze sectie presenteert een ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren geen concurrerende belangen. AI-gebaseerde taaltools (QuillBot) werden uitsluitend gebruikt voor het verbeteren van de taal en het voorbereiden van weerleggingen, en alle wetenschappelijke inhoud en conclusies werden door de auteurs geschreven.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit onderzoek heeft geen specifieke subsidie ontvangen van financieringsinstanties in de publieke, commerciële of non-profitsector.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
CUDA ToolkitNVIDIA12.8
cuDNNNVIDIA9.1
Graphics processing unit (GPU)NVIDIAGeForce RTX 5050 Laptop GPU
MatplotlibMatplotlib Developers3.9.2
NumPyNumPy Developers1.26.0
Operating systemMicrosoftLinux (WSL2), kernel 6.6.87
PythonPython Software Foundation3.12.7
PyTorchPyTorch Foundation2.1.0 (development build)
scikit-learnscikit-learn Developers1.5.1
timmGitHub repository1.0.24
TorchvisionPyTorch Foundation0.25.0 (development build)
WinterCropWeedDBMendeley Data, DOI: 10.17632/m4h6zdsh79.1Versie 1

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Güldenring, R., Nalpantidis, L. Self-supervised contrastive learning on agricultural images. Comput. Electron. Agric. 191, 106510(2021).
  2. Li, J., et al. Performance evaluation of semi-supervised learning frameworks for multi-class weed detection. Front. Plant Sci. 15, 1396568(2024).
  3. Saleh, A., et al. WeedCLR: Weed contrastive learning through visual representations with class-optimized loss in long-tailed datasets. arXiv. , (2023).
  4. Saleh, A., et al. Semi-supervised weed detection for rapid deployment and enhanced efficiency. Comput. Electron. Agric. 236, 110410(2025).
  5. Wang, Y., Zhang, S., Dai, B., Yang, S., Song, H. Fine-grained weed recognition using Swin Transformer and two-stage transfer learning. Front. Plant Sci. 14, 1134932(2023).
  6. Kar, S., et al. Self-supervised learning improves classification of agriculturally important insect pests in plants. Plant Phenomics J. 6 (1), e20079(2023).
  7. Garibaldi-Márquez, F., et al. Advances on deep learning for proximal image-based weed recognition and control under authentic farmlands: a state-of-the-art review. Smart Agric. Technol. 12, 101405(2025).
  8. Mohan, R. N. V. J., Rayanoothala, P. S., Sree, R. P. Next-gen agriculture: integrating AI and XAI for precision crop yield predictions. Front. Plant Sci. 15, 1451607(2025).
  9. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. Proc. IEEE Int. Conf. Comput. Vis. (ICCV), , 618-626 (2017).
  10. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhyay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf. Appl. Comput. Vis. (WACV), , 839-847 (2018).
  11. Sahu, M., Majhi, B. WinterCropWeedDB-Sample: A benchmark dataset for weed classification in winter crops. Mendeley Data. V1, (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Winter Crop ClassificationWeed Image ClassificationSelf Supervised LearningDeep LearningEfficientNet B3SimCLR ApproachContrastive LossSupervised Fine TuningGrad CAM VisualizationPrecision Agriculture

Related Articles