Research Article

Un marco de aprendizaje autosupervisado en dos etapas para la clasificación de imágenes de malas hierbas cultivadas en invierno

DOI:

10.3791/69953

February 24th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo evalúa la aplicación de una cadena de aprendizaje profundo en dos etapas para la preformación autosupervisada y el ajuste fino supervisado de la clasificación de imágenes de cultivos y malas hierbas en invierno. Los experimentos en el conjunto de datos WinterCropWeedDB se realizan utilizando una única división interna, incluyendo visualizaciones Grad-CAM.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La agricultura de precisión requiere una discriminación precisa entre cultivos de invierno y malas hierbas, pero falta datos de imágenes anotadas para los sistemas de cultivo invernal. Este artículo investiga un enfoque de aprendizaje profundo en dos etapas que integra el aprendizaje de características autosupervisado con el ajuste fino supervisado para la clasificación de imágenes de cultivos y malas hierbas en invierno. Se propone y utiliza en este artículo un nuevo conjunto de datos de imágenes de cultivos y malas hierbas de invierno, WinterCropWeedDB, que contiene 1.136 imágenes de alta resolución de seis especies de cultivos de invierno y cuatro especies de malas hierbas recogidas en campos agrícolas del centro de la India. En la primera etapa del aprendizaje autosupervisado, un modelo EfficientNet-B3 se preentrena usando un enfoque de aprendizaje autosupervisado al estilo SimCLR con una función de pérdida InfoNCE (temperatura τ = 0,5) sobre las imágenes. El valor medio de pérdida contrastiva se reduce de 2,0712 en la primera iteración a 1,6835 al final del preentrenamiento. En la segunda etapa de ajuste fino supervisado, el modelo EfficientNet-B3 preentrenado se ajusta con una cabeza clasificadora supervisada en las imágenes y se prueba con una única división interna de validación (30%) del conjunto de datos. El modelo ajustado alcanza una precisión máxima de validación del 98,27%, con una puntuación macro-media F1 de 0,98. El mapeo de activación de clases ponderado por gradiente (Grad-CAM) y Grad-CAM++ se utilizan en el modelo ajustado para proporcionar una visualización cualitativa de las regiones de imagen que contribuyen a las predicciones de clases. Los resultados del experimento demuestran la viabilidad de utilizar el preentrenamiento autosupervisado y el ajuste fino supervisado para la clasificación de imágenes de cultivos y malas hierbas de invierno en un conjunto de datos específico de región, al tiempo que subrayan la importancia de pruebas adicionales en conjuntos de prueba independientes.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La agricultura de precisión ha visto un uso creciente de métodos de visión por ordenador basados en aprendizaje profundo para la clasificación automatizada de cultivos y malashierbas 1. Se ha demostrado que las redes neuronales convolucionales son efectivas en tareas de reconocimiento de plantas; sin embargo, su rendimiento suele depender de la disponibilidad de grandes conjuntos de datos anotados de maneraprecisa 2. En la mayoría de los entornos agrícolas, especialmente en sistemas de cultivo subrepresentados como los cultivos de invierno, el proceso de obtener datos de imágenes etiquetadas extensos es laborioso, laborioso ycostoso 3,4. Esto supone un obstáculo para el desarrollo de sistemas de apoyo a la toma de decisiones basados en datos para los agroecosistemas invernales. El aprendizaje autosupervisado (SSL) es un paradigma que recientemente ha demostrado ser prometedor para el aprendizaje por representación, donde utiliza un gran número de imágenes para aprender características que son informativas aunque no estén etiquetadascomo 5. Mediante el diseño de tareas de pretexto, como el aprendizaje contrastivo, SSL permite que las redes neuronales aprendan patrones estructurales y semánticos en datos de imágenes, que luego pueden transferirse a tareas de aprendizajesupervisado 6. Estudios previos en imágenes agrícolas han demostrado que el preentrenamiento basado en SSL puede mejorar el rendimiento aguas abajo cuando los datos etiquetados son limitados, lo que motiva su exploración de problemas de reconocimiento de cultivos ymalas hierbas 1,7.

Simultáneamente, también se han explorado métodos de aprendizaje semisupervisado y de aprendizaje contrastivo. Se han explorado métodos de aprendizaje semisupervisado que aprovechan tanto datos etiquetados como no etiquetados, como el aprendizaje profesor-alumno y el pseudo-etiquetado, para la clasificación y detección de malashierbas 2,4. Más recientemente, los métodos de aprendizaje contrastivo con objetivos conscientes de la clase han mostrado el potencial de aprender representaciones transferibles a partir de imágenes agrícolas, especialmente en escenarios con desequilibrio de clase o pocasanotaciones 1,3. Aunque estos estudios indican los posibles beneficios del aprendizaje semi-supervisado y técnicas relacionadas frente al aprendizaje totalmente supervisado, la mayor parte de la literatura existente se ha limitado a sistemas de cultivo de verano, detección de objetos o conjuntos de datos a gran escala.

Además de la precisión predictiva, la interpretabilidad de los mecanismos internos de toma de decisiones de las redes neuronales profundas sigue siendo una preocupación relevante para aplicaciones agrícolas prácticas. Las técnicas de inteligencia artificial explicable (XAI) están diseñadas para ofrecer explicaciones interpretables de las predicciones de los modelos, intentando así cubrir la brecha entre las predicciones del modelo y la experiencia humana8. Los algoritmos de visualización basados en gradientes, como el mapeo de activación de clases ponderado por gradiente (Grad-CAM) y su extensión Grad-CAM++9,10, producen mapas de calor discriminativos por clases que señalan las regiones de interés en una imagen que son más relevantes para las predicciones de un modelo. Estos algoritmos se emplean comúnmente para el análisis cualitativo de representaciones aprendidas en tareas de análisis de imágenes agrícolas, pero no representan una validación formal de la interpretabilidad.

El objetivo principal de este trabajo de investigación es investigar el potencial de un marco de aprendizaje en dos etapas para la clasificación de imágenes de cultivos y malas hierbas invernales utilizando aprendizaje de representación autosupervisado y ajuste fino supervisado, junto con visualización cualitativa. En esta investigación, se investigó la aplicación de una cadena de aprendizaje en dos pasos para la clasificación de imágenes de cultivos y malas hierbas en invierno, integrando el preentrenamiento autosupervisado con SimCLR y el ajuste fino supervisado con EfficientNet-B3. Los experimentos se realizan con el conjunto de datos WinterCropWeedDB, un conjunto de datos específico de regiones con imágenes de cultivos y malezas invernales recogidas en campos agrícolas del centro dela India 11. Los resultados se analizan basándose en una única división interna, y se utilizan Grad-CAM y Grad-CAM++ para visualizar la atención del modelo. El objetivo de esta investigación es investigar la posibilidad de combinar métodos de aprendizaje y visualización de representación autosupervisada para la clasificación de imágenes de cultivos y malezas de invierno, siendo también conscientes de las limitaciones del montaje experimental. Este flujo de trabajo está destinado a la evaluación exploratoria de conjuntos de datos específicos de cultivos y malezas con datos etiquetados limitados y no pretende ser un punto de referencia validado para generalización o uso a gran escala.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Descripción del conjunto de datos

El conjunto de datos WinterCropWeedDB consta de 1.136 imágenes RGB de alta resolución (rojo, verde, azul) de seis especies de cultivos de invierno (trigo, garbanzo, guisante, lenteja, mostaza y guisante de pasto) y cuatro especies de malas hierbas (veza común, canario menor, pie de ganso (Chenopodium album) y Euphorbia clementei) tomadas en campos agrícolas de invierno en el estado de Chhattisgarh, India (Figura 1). Las imágenes se tomaron en condiciones naturales, incluyendo variaciones de iluminación, etapas de crecimiento y complejidad del fondo. Todas las imágenes fueron inicialmente sin anotaciones y se usaron únicamente para el preentrenamiento autosupervisado. Para el ajuste fino supervisado, las imágenes se anotaron manualmente y se dividieron usando muestreo estratificado en conjuntos de entrenamiento (70%) y validación (30%). El conjunto de validación se utilizó únicamente para la evaluación interna del modelo y no fue ampliado. Para abordar el desequilibrio de clases y los problemas de robustez durante el entrenamiento, la ampliación de datos se realizó únicamente en el conjunto de entrenamiento. Las técnicas de aumento implicaban rotaciones aleatorias (+/-20°), volteo horizontal, escalado, traslación, cambios de brillo y transformaciones afines suaves. Las muestras de entrenamiento se aumentaron a un objetivo de 150 imágenes por clase, resultando en un total de 1.500 imágenes de entrenamiento, mientras que el conjunto de validación consistía en 347 imágenes originales. No se incluyeron imágenes aumentadas ni sintéticas en el conjunto de validación para evitar sesgos de evaluación. Además de la evaluación de retención, también se realizó una validación cruzada estratificada de cinco vínculos sobre el conjunto de datos original etiquetado como análisis secundario. En cada pliegue, la ampliación de datos se realizó solo sobre los conjuntos de entrenamiento, y los conjuntos de validación se mantuvieron sin cambios para mantener la coherencia con el esquema principal de evaluación.

Flujo de trabajo computacional para entrenamiento de modelos autosupervisados y supervisados

Se utilizó una cadena computacional de dos pasos para investigar la viabilidad de integrar aprendizaje de representaciones auto-supervisadas y ajuste fino supervisado para la clasificación de imágenes de cultivos de invierno frente a malas hierbas (Figura 2). Esta cadena implica: (i) preentrenamiento auto-supervisado con imágenes sin etiquetar, y (ii) ajuste fino supervisado con una muestra etiquetada de las imágenes. Todas las imágenes se redimensionaron a 300 × 300 píxeles y se normalizaron antes del entrenamiento. Las evaluaciones de los modelos se realizaron únicamente en una división interna, sin utilizar un conjunto de pruebas externo.

Etapa 1 - preentrenamiento autosupervisado

En la etapa inicial, la arquitectura EfficientNet-B3 se empleó como red troncal en una configuración de aprendizaje autosupervisada inspirada en SimCLR. La cabeza de proyección de dos capas redujo la representación de la columna vertebral a un espacio de incrustación de 128 dimensiones. Para el aprendizaje autosupervisado, cada imagen se convertía en dos vistas mediante recorte aleatorio redimensionado, volteo horizontal, transformación de color, desenfoque gaussiano y conversión a escala de grises. Las dos vistas se procesaron juntas para optimizar conjuntamente la función de pérdida contrastiva. El proceso de aprendizaje autosupervisado se realizó durante 30 épocas, donde una época indica un pase completo de todo el conjunto de datos de entrenamiento a través del modelo durante la optimización, con un tamaño de lote de 16 imágenes usando el optimizador Adam (un algoritmo de optimización basado en gradientes adaptativos que estima los momentos de primer y segundo orden de los gradientes para ajustar las tasas de aprendizaje durante el entrenamiento). Se utilizó el recorte de gradiente con una norma máxima de 1,0 para asegurar un entrenamiento estable. Además, los puntos de control de los modelos se guardaban después de cada época para facilitar la reproducibilidad. El valor de temperatura de 0,5 se utilizó al calcular la pérdida de InfoNCE durante el aprendizaje autosupervisado.

Etapa 2 - ajuste fino supervisado

Tras un preentrenamiento autosupervisado, se retiró la cabeza de proyección y se usaron los pesos preentrenados de la columna vertebral para un ajuste fino supervisado. Se añadió una cabeza clasificadora totalmente conectada a la columna vertebral para la clasificación multiclase. El ajuste fino se realizaba usando únicamente las imágenes etiquetadas del conjunto de entrenamiento. El entrenamiento supervisado utilizó pérdida de entropía cruzada con ponderación de clases y suavizado de etiquetas para manejar el desequilibrio de clases. El optimizador Adam se utilizó con diferentes tasas de aprendizaje para la columna vertebral (1 × 10⁻⁵) y el clasificador (1 × 10⁻⁴). Se utilizó un planificador de tasa de aprendizaje para disminuir la tasa de aprendizaje cuando la precisión de validación se estabilizaba. Se realizó entrenamiento durante 20 épocas, y el punto de control del modelo con mayor precisión de validación se guardó para su evaluación.

Además de la evaluación principal de la retención, se realizó una validación cruzada estratificada de cinco vínculos como análisis adicional sobre el conjunto etiquetado. En cada pliegue, la aumentación solo se realizaba en los conjuntos de entrenamiento y los conjuntos de validación permanecían sin cambios. Los resultados de la validación cruzada se presentaron por separado y no se utilizaron para la selección del modelo ni para optimizar los puntos de control. Las métricas de rendimiento presentadas en este estudio se basan únicamente en la división interna de validación y representan los resultados del rendimiento observado bajo la configuración experimental actual.

Visualización Grad-CAM y Grad-CAM++

Para el análisis cualitativo de la atención en el modelo, se utilizaron métodos de mapeo de activación de clases basados en gradientes (Grad-CAM y Grad-CAM++) en el modelo ajustado finamente. Los mapas de características y los gradientes se obtuvieron de la capa convolucional final de la red base, y se obtuvieron mapas de calor específicos de clase para imágenes de validación seleccionadas. Estos se usaron únicamente para el análisis cualitativo del modelo y no fueron validados. La Tabla de materiales enumera todo el hardware, bibliotecas de software, conjuntos de datos y scripts de entrenamiento personalizados utilizados en este flujo de trabajo.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Visión general de enfoques previos y posicionamiento de flujos de trabajo

Un resumen de los enfoques de aprendizaje representativo aplicados previamente para el reconocimiento de malezas agrícolas se presenta en la Tabla 1. La tabla presenta una visión general de las estrategias de aprendizaje supervisado, semi-supervisado y autosupervisado, los conjuntos de datos utilizados, los resultados reportados y las limitaciones presen...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo examinó el uso de un enfoque de aprendizaje profundo en dos pasos que consiste en el preentrenamiento autosupervisado usando la idea SimCLR y el ajuste fino supervisado para la clasificación de imágenes de cultivos y malas hierbas en invierno en el conjunto de datos WinterCropWeedDB. Los resultados muestran que el enfoque propuesto puede entrenarse de forma fiable con un conjunto de imágenes de agricultura invernal específico por región y probarse en una división del conjunt...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran intereses en competencia. Las herramientas de lenguaje basadas en IA (QuillBot) se usaban únicamente para pulir el lenguaje y preparar refutaciones, y todo el contenido científico y las conclusiones eran redactadas por los autores.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación no recibió ninguna subvención específica de agencias financiadoras del sector público, comercial o sin ánimo de lucro.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Kit de herramientas CUDANVIDIA12.8
cuDNNNVIDIA9.1
Unidad de procesamiento gráfico (GPU)NVIDIAGPU para portátiles GeForce RTX 5050
MatplotlibDesarrolladores de Matplotlib3.9.2
NumPyDesarrolladores NumPy1.26.0
Sistema operativoMicrosoftLinux (WSL2), kernel 6.6.87
PythonFundación de Software Python3.12.7
PyTorchFundación PyTorch2.1.0 (versión de desarrollo)
scikit-learnscikit-learn Desarrolladores1.5.1
timmRepositorio de GitHub1.0.24
TorchvisionFundación PyTorch0.25.0 (versión de desarrollo)
WinterCropWeedDBMendeley Data, DOI: 10.17632/m4h6zdsh79.1Versión 1

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Güldenring, R., Nalpantidis, L. Self-supervised contrastive learning on agricultural images. Comput. Electron. Agric. 191, 106510(2021).
  2. Li, J., et al. Performance evaluation of semi-supervised learning frameworks for multi-class weed detection. Front. Plant Sci. 15, 1396568(2024).
  3. Saleh, A., et al. WeedCLR: Weed contrastive learning through visual representations with class-optimized loss in long-tailed datasets. arXiv. , (2023).
  4. Saleh, A., et al. Semi-supervised weed detection for rapid deployment and enhanced efficiency. Comput. Electron. Agric. 236, 110410(2025).
  5. Wang, Y., Zhang, S., Dai, B., Yang, S., Song, H. Fine-grained weed recognition using Swin Transformer and two-stage transfer learning. Front. Plant Sci. 14, 1134932(2023).
  6. Kar, S., et al. Self-supervised learning improves classification of agriculturally important insect pests in plants. Plant Phenomics J. 6 (1), e20079(2023).
  7. Garibaldi-Márquez, F., et al. Advances on deep learning for proximal image-based weed recognition and control under authentic farmlands: a state-of-the-art review. Smart Agric. Technol. 12, 101405(2025).
  8. Mohan, R. N. V. J., Rayanoothala, P. S., Sree, R. P. Next-gen agriculture: integrating AI and XAI for precision crop yield predictions. Front. Plant Sci. 15, 1451607(2025).
  9. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. Proc. IEEE Int. Conf. Comput. Vis. (ICCV), , 618-626 (2017).
  10. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhyay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf. Appl. Comput. Vis. (WACV), , 839-847 (2018).
  11. Sahu, M., Majhi, B. WinterCropWeedDB-Sample: A benchmark dataset for weed classification in winter crops. Mendeley Data. V1, (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Winter Crop ClassificationWeed Image ClassificationSelf Supervised LearningDeep LearningEfficientNet B3SimCLR ApproachContrastive LossSupervised Fine TuningGrad CAM VisualizationPrecision Agriculture

Related Articles