$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Descripción del conjunto de datos
El conjunto de datos WinterCropWeedDB consta de 1.136 imágenes RGB de alta resolución (rojo, verde, azul) de seis especies de cultivos de invierno (trigo, garbanzo, guisante, lenteja, mostaza y guisante de pasto) y cuatro especies de malas hierbas (veza común, canario menor, pie de ganso (Chenopodium album) y Euphorbia clementei) tomadas en campos agrícolas de invierno en el estado de Chhattisgarh, India (Figura 1). Las imágenes se tomaron en condiciones naturales, incluyendo variaciones de iluminación, etapas de crecimiento y complejidad del fondo. Todas las imágenes fueron inicialmente sin anotaciones y se usaron únicamente para el preentrenamiento autosupervisado. Para el ajuste fino supervisado, las imágenes se anotaron manualmente y se dividieron usando muestreo estratificado en conjuntos de entrenamiento (70%) y validación (30%). El conjunto de validación se utilizó únicamente para la evaluación interna del modelo y no fue ampliado. Para abordar el desequilibrio de clases y los problemas de robustez durante el entrenamiento, la ampliación de datos se realizó únicamente en el conjunto de entrenamiento. Las técnicas de aumento implicaban rotaciones aleatorias (+/-20°), volteo horizontal, escalado, traslación, cambios de brillo y transformaciones afines suaves. Las muestras de entrenamiento se aumentaron a un objetivo de 150 imágenes por clase, resultando en un total de 1.500 imágenes de entrenamiento, mientras que el conjunto de validación consistía en 347 imágenes originales. No se incluyeron imágenes aumentadas ni sintéticas en el conjunto de validación para evitar sesgos de evaluación. Además de la evaluación de retención, también se realizó una validación cruzada estratificada de cinco vínculos sobre el conjunto de datos original etiquetado como análisis secundario. En cada pliegue, la ampliación de datos se realizó solo sobre los conjuntos de entrenamiento, y los conjuntos de validación se mantuvieron sin cambios para mantener la coherencia con el esquema principal de evaluación.
Flujo de trabajo computacional para entrenamiento de modelos autosupervisados y supervisados
Se utilizó una cadena computacional de dos pasos para investigar la viabilidad de integrar aprendizaje de representaciones auto-supervisadas y ajuste fino supervisado para la clasificación de imágenes de cultivos de invierno frente a malas hierbas (Figura 2). Esta cadena implica: (i) preentrenamiento auto-supervisado con imágenes sin etiquetar, y (ii) ajuste fino supervisado con una muestra etiquetada de las imágenes. Todas las imágenes se redimensionaron a 300 × 300 píxeles y se normalizaron antes del entrenamiento. Las evaluaciones de los modelos se realizaron únicamente en una división interna, sin utilizar un conjunto de pruebas externo.
Etapa 1 - preentrenamiento autosupervisado
En la etapa inicial, la arquitectura EfficientNet-B3 se empleó como red troncal en una configuración de aprendizaje autosupervisada inspirada en SimCLR. La cabeza de proyección de dos capas redujo la representación de la columna vertebral a un espacio de incrustación de 128 dimensiones. Para el aprendizaje autosupervisado, cada imagen se convertía en dos vistas mediante recorte aleatorio redimensionado, volteo horizontal, transformación de color, desenfoque gaussiano y conversión a escala de grises. Las dos vistas se procesaron juntas para optimizar conjuntamente la función de pérdida contrastiva. El proceso de aprendizaje autosupervisado se realizó durante 30 épocas, donde una época indica un pase completo de todo el conjunto de datos de entrenamiento a través del modelo durante la optimización, con un tamaño de lote de 16 imágenes usando el optimizador Adam (un algoritmo de optimización basado en gradientes adaptativos que estima los momentos de primer y segundo orden de los gradientes para ajustar las tasas de aprendizaje durante el entrenamiento). Se utilizó el recorte de gradiente con una norma máxima de 1,0 para asegurar un entrenamiento estable. Además, los puntos de control de los modelos se guardaban después de cada época para facilitar la reproducibilidad. El valor de temperatura de 0,5 se utilizó al calcular la pérdida de InfoNCE durante el aprendizaje autosupervisado.
Etapa 2 - ajuste fino supervisado
Tras un preentrenamiento autosupervisado, se retiró la cabeza de proyección y se usaron los pesos preentrenados de la columna vertebral para un ajuste fino supervisado. Se añadió una cabeza clasificadora totalmente conectada a la columna vertebral para la clasificación multiclase. El ajuste fino se realizaba usando únicamente las imágenes etiquetadas del conjunto de entrenamiento. El entrenamiento supervisado utilizó pérdida de entropía cruzada con ponderación de clases y suavizado de etiquetas para manejar el desequilibrio de clases. El optimizador Adam se utilizó con diferentes tasas de aprendizaje para la columna vertebral (1 × 10⁻⁵) y el clasificador (1 × 10⁻⁴). Se utilizó un planificador de tasa de aprendizaje para disminuir la tasa de aprendizaje cuando la precisión de validación se estabilizaba. Se realizó entrenamiento durante 20 épocas, y el punto de control del modelo con mayor precisión de validación se guardó para su evaluación.
Además de la evaluación principal de la retención, se realizó una validación cruzada estratificada de cinco vínculos como análisis adicional sobre el conjunto etiquetado. En cada pliegue, la aumentación solo se realizaba en los conjuntos de entrenamiento y los conjuntos de validación permanecían sin cambios. Los resultados de la validación cruzada se presentaron por separado y no se utilizaron para la selección del modelo ni para optimizar los puntos de control. Las métricas de rendimiento presentadas en este estudio se basan únicamente en la división interna de validación y representan los resultados del rendimiento observado bajo la configuración experimental actual.
Visualización Grad-CAM y Grad-CAM++
Para el análisis cualitativo de la atención en el modelo, se utilizaron métodos de mapeo de activación de clases basados en gradientes (Grad-CAM y Grad-CAM++) en el modelo ajustado finamente. Los mapas de características y los gradientes se obtuvieron de la capa convolucional final de la red base, y se obtuvieron mapas de calor específicos de clase para imágenes de validación seleccionadas. Estos se usaron únicamente para el análisis cualitativo del modelo y no fueron validados. La Tabla de materiales enumera todo el hardware, bibliotecas de software, conjuntos de datos y scripts de entrenamiento personalizados utilizados en este flujo de trabajo.