$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El siguiente protocolo ilustra el proceso de detección de enfermedades de la hoja de arroz y la construcción y despliegue del sistema de recomendaciones de tratamiento paso a paso. Los pasos seguidos deben utilizarse de forma consecutiva para replicar los hallazgos presentados en este artículo.
Preparación del conjunto de datos
Conjunto de datos de etapas de hojas de arroz: Estos datos se basaron en PaddyNet4. La escena consta de 560 imágenes clasificadas en cuatro diferentes etapas de revelado, a saber: Etapa 2, Etapa 3, Etapa 4 y Etapa 5. La clasificación depende del color y la madurez de las hojas de arroz, que dependen de la concentración de nitrógeno, entre otros factores, y del desarrollo de la planta. El conjunto de datos presentado es importante para conocer la etapa correcta de la planta de arroz (Figura 1). PaddyNet es accesible públicamente a través de la página web de data.mendeley.com/datasets/. Conjunto de datos sobre la enfermedad de las hojas de arroz: Este conjunto de datos estaba disponible como varios conjuntos de datos públicos accesibles y separados en Kaggle y se combinaron para crear un conjunto de datos unificado con un total de 6.920 imágenes, cada una perteneciente a uno de los seis tipos de enfermedad que se muestran en (Figura 2). Conjunto de datos de tratamiento: El conjunto de datos fue desarrollado de forma crítica mediante la recuperación e integración de información de varios conjuntos de datos disponibles públicamente y contiene datos sobre diversas prácticas de manejo de las enfermedades del arroz en cuatro fasesde crecimiento 21. El objetivo principal de este conjunto de datos es elaborar recomendaciones para prevenir y controlar la enfermedad del arroz. Los datos son uno de los recursos vitales para combatir las enfermedades en las plantas de arroz seleccionando el tipo adecuado depesticidas 19,22,23,24,25
Aumento de datos
La ampliación de datos se utilizó para mejorar el conjunto de datos de entrenamiento y reducir el sobreajuste. Los métodos de aumento empleados en el estudio actual son rotación (hasta 30), movimiento de ancho y altura (hasta un 20%), zoom (hasta un 20%), cizallamiento y volteo horizontal. El uso de estos métodos de aumento ayuda al modelo a adquirir los elementos esenciales del modelo y mejora la generalización del modelo cuando se prueba con datos no vistos. La ampliación de datos se realizó sobre el conjunto de datos de entrenamiento, mientras que los conjuntos de datos de validación y prueba se dejaron tal cual para revisar el rendimiento justo del sistema. El tamaño del conjunto de datos original tuvo que aumentarse con datos porque el tamaño del conjunto original es bastante pequeño, y se necesitaba el enfoque para mejorar la generalización y minimizar el sobreajuste introduciendo el modelo en las diferencias de orientación, escala y posición de las imágenes de las hojas.
Preprocesamiento de imagen
Los datos de estadio y enfermedad recogidos pasaron por varios pasos de preprocesamiento para que los datos fueran consistentes y mejoraran el rendimiento de los modelos. Todas las imágenes de ambos conjuntos de datos se escalaron a 128 × 128 × 3 para asegurar un ajuste viable en cualquier arquitectura de deep learning. Los valores de los píxeles se escalaron al intervalo [0,1] para acelerar la convergencia durante el entrenamiento. Además, las etiquetas de enfermedades y sus estadios se transformaron en números para evaluar y entrenar el modelo de forma más eficaz. Estos métodos de preprocesamiento ayudaron a extraer mejor las características, a una mejor tasa de clasificación y a la robustez del modelo a diferentes condiciones ambientales. El tamaño de la imagen utilizada, 128 × 128, se vio comprometido entre el cálculo y la pérdida de características. Concreto El tamaño de imagen más pequeño minimiza el tiempo de entrenamiento y el coste computacional, y no elimina información (características visuales) para clasificar la enfermedad y el estadio al utilizar modelos de aprendizaje profundo.
División de conjuntos de datos
Los datos procesados se dividieron en tres subconjuntos (Tabla 1): Conjunto de Entrenamiento (80%), Set de Validación (10%), Set de Prueba (10%). Para evitar una distribución desequilibrada de clases en los tres subconjuntos, se utilizó muestreo aleatorio estratificado para asegurar que tanto el conjunto de datos de estadios (560 imágenes) como el conjunto de datos de enfermedades (6.920 imágenes) tuvieran una distribución igual de clases. No hubo filtraciones de datos entre los subconjuntos.
Formación en modelos
En la clasificación del estado de crecimiento de las hojas y enfermedades del arroz, se utilizó el método modelo de entrenamiento en dos pasos.
Modelo de clasificación de etapas
El método de clasificación de la etapa de crecimiento foliar tiene cuatro clases y un tamaño de datos relativamente bajo, por lo que la arquitectura de la Red Neuronal Convolucional (NN) no fue muy ampliada pero se consideró ligera. Se puede utilizar una arquitectura más sencilla para reducir el sobreajuste y la potencia computacional, a costa de tener una alta precisión en el caso de la clasificación mediante características de color y textura. La nueva estructura CNN tendrá tres capas convolucionales utilizando las funciones de activación de ReLU. Las capas convolucionales se alternan con las capas de max-pooling (2×2) para reducir la escala de las dimensiones espaciales, así como para identificar las características destacadas. Los mapas de características pasan por una capa convolucional, tras la cual se aplanan, y la capa densa totalmente conectada con regularización de dropout se ejecuta para desincentivar el sobreajuste. Por último, la clasificación multiclase de las cuatro etapas de crecimiento se realiza con la ayuda de una capa de salida softmax. El optimizador Adam, que tiene una tasa de aprendizaje de 0,001 y una entropía cruzada categórica como función de pérdida, se utilizó para entrenar el modelo. El número del lote se estableció en 10, y el modelo se entrenó en 10 épocas. La precisión y la pérdida de validación también se utilizaron para monitorizar el rendimiento del modelo, ya que se emplean para asegurar que el modelo sea generalizado.
Modelo de clasificación de enfermedades basado en el aprendizaje en conjunto
Para la clasificación de enfermedades, se adoptó una serie de arquitecturas de aprendizaje profundo para mejorar la precisión de la predicción. El desarrollo inicial de un modelo CNN personalizado consistió en cuatro capas: tres capas convolucionales, tres capas de max-pooling, una capa densa y totalmente conectada y regularización dropout. MobileNetV2 emplea convoluciones separables en profundidad, bloques residuales invertidos y cuello de botella invertido con residuo lineal. El modelo tiene un tamaño pequeño, de solo 3,4 millones de parámetros, y puede utilizarse en un entorno con recursos limitados. Los modelos comenzaron a usar activaciones de ImageNet, y las capas convolucionales se congelaron para que no se perdieran las representaciones de características aprendidas. La capa de clasificación softmax se conectaba a una capa totalmente conectada que tenía regularización de dropout. Todos los modelos se entrenaron durante 20 épocas con un tamaño de lote de 32, y el optimizador y la pérdida eran idénticos a los del modelo CNN. En un intento de mejorar la clasificación, se utilizó el método medio de aprendizaje por conjunto de votantes. Los resultados fueron las probabilidades medias predichas por los cinco modelos (CNN, VGG16, ResNet50, InceptionV3 y MobileNetV2) para obtener las predicciones finales de la clase. Esta técnica combinada fue útil para reducir el sesgo en los modelos y mejorar la generalización. El último modelo combinado era más preciso en las clasificaciones. La razón por la que se eligió el enfoque en conjunto es que el aprendizaje de las distintas representaciones de características se aprende utilizando el mismo conjunto de datos por los distintos modelos de aprendizaje profundo. El conjunto también disminuye el sesgo y la varianza del modelo y aumenta los problemas generales de predicción y el rendimiento general de la generalización en comparación con los modelos independientes.
Estrategia de predicción
En el proceso de predecir la enfermedad de la hoja de arroz y su etapa de crecimiento asociada, se utilizó el método de clasificación basado en conjuntos. Los cinco modelos de aprendizaje profundo (CNN, VGG16, ResNet50, InceptionV3 y MobileNetV2) fueron entrenados de forma independiente para clasificar las enfermedades y se agruparon utilizando un método de conjunto de votación promedio. Este procedimiento implicaba la predicción de probabilidades de cada categoría de enfermedad de todos los modelos y la distribución de probabilidad media, lo que añade precisión a la previsibilidad y minimiza el sesgo en el modelo. La predicción final se tomó como la clase de enfermedad con mayor probabilidad promedio. Además, se entrenó y se utilizó un modelo diferente de clasificación de etapas basado en CNN para predecir la etapa de crecimiento de la hoja de arroz. Ambos modelos de clasificación tomarían imágenes de entrada de tamaño 128x128, luego normalizarían los valores de los píxeles y después usarían los modelos para hacer una inferencia. Las predicciones finales tanto de la fase foliar como de la enfermedad se mapearon entonces con un conjunto existente de recomendaciones de tratamiento para ofrecer un tratamiento válido y así gestionar la enfermedad.
Ejemplo de salida: "Estadio hoja: 3, Enfermedad: Tungro"
Recomendación de tratamiento
Para hacer más práctica la clasificación de la enfermedad de la hoja de arroz, se integró en la solicitud un sistema de recomendación de tratamiento basado en Streamlit. El sistema toma la enfermedad prevista y la fase foliar para ofrecer recomendaciones específicas de tratamiento que aseguren que la enfermedad se gestione con éxito. El modelo de clasificación de la enfermedad en conjunto (incluyendo CNN, VGG16, ResNet50, InceptionV3 y MobileNetV2) clasifica la enfermedad, mientras que el modelo de clasificación de la fase foliar es otro modelo. La fase modelada de la hoja y la enfermedad se comparan con los datos de tratamiento que tienen las dosis recomendadas (medidas preventivas y aplicación de pesticidas).
Marco metodológico y contribución
La metodología del sistema presentado es una cadena de varias etapas, que combina clasificación de imágenes y soporte a la decisión. El marco consta de cinco grandes pasos: la promoción de imágenes y el aumento, la predicción de la etapa de crecimiento foliar, el uso de modelos de aprendizaje profundo entrenados en las imágenes para clasificar la enfermedad, la combinación de los resultados de la predicción para obtener una decisión conjunta y la recomendación del tratamiento en función del tipo y etapa de crecimiento de la enfermedad. La contribución metodológica de este trabajo está orientada a la implementación de numerosos modelos de predicción y un módulo de recomendación de tratamiento en una única cadena de soporte a la decisión. El sistema se basa no solo en la clasificación de enfermedades, sino también en incorporar la información sobre la etapa de crecimiento de la planta para proporcionar recomendaciones de tratamiento en una etapa concreta. El sistema es más relevante para el proceso de toma de decisiones agrícolas en el mundo real gracias a esta estrategia de recomendación consciente de la etapa. La imagen de entrada primero pasará por un preprocesamiento antes de ser introducida a través del modelo de clasificación de estadios y de los modelos de clasificación de enfermedades. Los resultados del modelo de enfermedad se promedian mediante una técnica de conjunto, y la predicción y la etapa de crecimiento de la enfermedad se llevan hasta el final para obtener recomendaciones de tratamiento correctas basadas en la identificación de registros relevantes en la base de datos de tratamientos.
Estrategia de validación y prevención de sobreajuste
Para proporcionar una validación rigurosa de los modelos desarrollados, el conjunto de datos se dividió en tres subconjuntos disyuntivos: conjunto de entrenamiento (80%), conjunto de validación (10%) y conjunto de prueba (10%). Los modelos se entrenaban usando el conjunto de entrenamiento, se ajustaban con el conjunto de validación y evaluaban su rendimiento final usando solo el conjunto de pruebas. El conjunto de pruebas permaneció absolutamente independiente para tener un análisis imparcial del modelo. Se utilizaron los siguientes métodos para garantizar que el modelo no sobreajuste y mejorar su capacidad de generalización. Para aumentar el nivel de diversidad en el conjunto de datos, primero se utilizaron métodos de aumento de datos (rotación, zoom, desplazamiento, cizallamiento y volteo horizontal). En segundo lugar, se utilizó la regularización de dropout en las capas totalmente conectadas de los modelos CNN para reducir el sobreajuste. En tercer lugar, se transfirieron modelos preentrenados (VGG16, ResNet50, InceptionV3 y MobileNetV2) utilizando la técnica de capas convolucionales congeladas para preservar las características aprendidas y minimizar las posibilidades de sobreajuste causadas por el pequeño tamaño del conjunto de datos. Por último, la pérdida de validación y la precisión se utilizaron para monitorizar el rendimiento del modelo durante el entrenamiento y así asegurar que el modelo no se ajuste demasiado a los datos de entrenamiento. Estos son los esquemas de validación y regularización que aseguran que el modelo propuesto se generalice muy bien a datos no vistos y ofrezca un buen rendimiento.
Sistema propuesto
La sugerida es una solución de aprendizaje profundo para el manejo de la enfermedad de las hojas de arroz, que incorpora la predicción y clasificación de la fase foliar de la enfermedad. Empieza con el preprocesamiento de imágenes de hojas de arroz en términos de redimensionarlas a una altura común y los valores de los píxeles. La etapa de crecimiento de la hoja se predice mediante una red neuronal, y se utiliza una técnica media de votación para emplear un conjunto de modelos de aprendizaje profundo (CNN, VGG16, ResNet50, InceptionV3, MobileNetV2) para clasificar enfermedades. El sistema utiliza el estadio y la enfermedad previstos para prescribir las dosis adecuadas de herbicidas o pesticidas que se usarán en el tratamiento. El flujo de trabajo del sistema propuesto se muestra en (Figura 3). Las subsecciones anteriores (de la A a la I) explican cada uno de los elementos individuales de esta canalización, por eso no se hace más descripción aquí. La aplicación basada en Streamlit desarrollada en este estudio es un prototipo de herramienta de apoyo a la toma de decisiones destinada a demostrar la aplicabilidad práctica del modelo propuesto. El sistema permite a los usuarios subir imágenes de hojas de arroz y recibir predicciones de enfermedades, información sobre la etapa de crecimiento y recomendaciones de tratamiento. Se realizarán pruebas de usabilidad a gran escala y despliegue en el campo con agricultores como parte de futuros trabajos para evaluar la efectividad y usabilidad real del sistema.