$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Следующий протокол пошагово иллюстрирует процесс построения и внедрения системы обнаружения болезней рисовых листьев и рекомендаций по лечению. Предпринятые шаги необходимо применять последовательно для повторения результатов, представленных в этой статье.
Подготовка наборов данных
Набор стадий Paddy leaves: Данные были основаны на PaddyNet4. Сцена состоит из 560 изображений, классифицированных по четырём разным этапам разработки: Этап 2, Этап 3, Стадия 4 и Стадия 5. Классификация зависит от цвета и зрелости рисовых листьев, которые зависят от концентрации азота, а также от развития растения. Представленный набор данных важен для определения правильной стадии рисового растения (рисунок 1). PaddyNet доступен публично через сайт data.mendeley.com/datasets/. Набор данных о болезни Paddy leave: Этот набор данных был доступен в виде нескольких отдельных общедоступных наборов данных на Kaggle и объединился в единый набор данных с общим числом 6 920 изображений, каждое из которых принадлежало одному из шести типов заболеваний, показанных на рисунке (Рисунок 2). Набор данных по лечению: Набор данных был критически разработан путём извлечения и интеграции информации из различных общедоступных наборов данных и содержит данные о различных методах ведения болезней риса на четырех этапахроста 21. Основная цель этого набора данных — разработать рекомендации по профилактике и контролю болезни риса. Эти данные являются одним из ключевых ресурсов для борьбы с болезнями рисовых растений путём подбора правильныхпестицидов 19,22,23,24,25
Дополнение данных
Дополнение данных использовалось для улучшения учебного набора данных и снижения перенасадки. Методы увеличения, применяемые в текущем исследовании, включают вращение (до 30), движение ширины и высоты (до 20%), увеличение (до 20%), сдвиг и горизонтальное переворот. Использование этих методов дополнения помогает модели осваивать основы и улучшает её обобщение при тестировании на невидимых данных. Дополнение данных проводилось на обучающем наборе данных, в то время как валидационные и тестовые наборы данных остались как есть для оценки справедливой работы системы. Размер исходного набора данных пришлось увеличить за счёт данных, поскольку размер исходного набора довольно мал, и подход был необходим для усиления обобщения и минимизации перенагона, знакомя модель с различиями в ориентации, масштабе и положении изображений листьев.
Предварительная обработка изображений
Собранные данные о стадиях и заболеваниях проходили через ряд этапов предварительной обработки для обеспечения их согласованности и повышения производительности моделей. Все изображения из обоих наборов данных масштабировались до 128 × 128 × 3, чтобы обеспечить рабочее соответствие любой архитектуре глубокого обучения. Значения пикселей масштабировались до интервала [0,1], чтобы ускорить сходимость при тренировке. Кроме того, метки заболеваний и их стадий преобразовывались в числа для более эффективной оценки и обучения модели. Эти методы предварительной обработки помогли лучше выделить признаки, повысить уровень классификации и повысить устойчивость модели к различным условиям окружающей среды. Размер использованного изображения — 128 × 128 — был скомпрометирован между вычислениями и потерей функций. Конкретный размер изображения минимизирует время обучения и вычислительные затраты, а также не исключает информацию (визуальные признаки) для классификации заболевания и стадии при использовании моделей глубокого обучения.
Разделение наборов данных
Обработанные данные были разделены на три подгруппы (Таблица 1): Обучающий набор (80%), Валидационный набор (10%), Тестовый набор (10%). Чтобы избежать несбалансированного распределения классов во всех трёх подмножествах, использовалась стратифицированная случайная выборка, чтобы обеспечить равномерное распределение классов как стадийного набора данных (560 изображений), так и набор заболеваний (6 920 изображений). Между подмножествами не было утечки данных.
Обучение моделям
В классификации стадии роста рисовых листьев и болезней использовался двухступенчатый метод моделирования обучения.
Модель классификации стадий
Метод классификации стадии роста листьев состоит из четырёх классов и относительно небольшого объема данных, поэтому архитектура сверточной нейронной сети (NN) не была сильно расширена, но считалась лёгкой. Более простая архитектура может быть использована для снижения перенагонки и вычислительной мощности, за счёт высокой точности классификации с использованием цветовых и текстурных признаков. Новая структура CNN будет иметь три сверточных слоя с использованием функций активации ReLU. Сверточные слои чередуются с максимальными пулами (2×2) для уменьшения пространственных размеров, а также для выявления заметных особенностей. Карты объектов проходят сверточный слой, после чего они сплющаются, а полностью соединённый плотный слой с регуляризацией дропаута запускается для предотвращения перенагонки. Наконец, многоклассовая классификация четырёх стадий роста осуществляется с помощью слоя softmax выхода. Для обучения модели использовался оптимизатор Адама, имеющий скорость обучения 0,001 и категориальную кросс-энтропию как функцию потерь. Количество партии было установлено на 10, а модель тренировалась в 10 эпохах. Точность валидации и потери валидации также использовались для мониторинга производительности модели, поскольку они используются для обеспечения её обобщения.
Модель классификации заболеваний на основе ансамблевого обучения
Для классификации заболеваний была внедрена серия архитектур глубокого обучения для повышения точности прогнозирования. Первоначальная разработка собственной модели CNN состояла из четырёх слоёв: трёх сверточных слоёв, трёх слоев с максимальным пулированием, плотного полностью связанного слоя и регуляризации dropout. MobileNetV2 использует по глубине сепарабельные свёртки, инвертированные остаточные блоки и инвертированное узкое место с линейным остатком. Модель имеет небольшой размер всего 3,4 миллиона параметров и может использоваться в условиях ограниченных ресурсов. Модели начали использовать активацию ImageNet, а сверточные слои были заморажены, чтобы не потерять полученные представления признаков. Слой классификации softmax был прикреплён к полностью связанному слою с регуляризацией dropout. Все модели тренировались в течение 20 эпох с размером партии 32, а оптимизатор и потери были идентичны модели CNN. В попытке улучшить классификацию был использован метод обучения по среднему голосованию. Результатами были средние вероятности, предсказанные всеми пятью моделями (CNN, VGG16, ResNet50, InceptionV3 и MobileNetV2) для получения окончательных прогнозов класса. Эта техника комбинирования была полезна для снижения смещения в моделях и улучшения обобщения. Последняя комбинированная модель была более точной в классификации. Причина, по которой был выбран ансамблевой подход, заключается в том, что изучение различных представлений признаков обучается на основе одного и того же набора данных разными моделями глубокого обучения. Ансамбль также снижает смещение и дисперсию модели, а также увеличивает общие проблемы прогнозирования и общую производительность обобщения по сравнению с независимыми моделями.
Стратегия прогнозирования
В процессе прогнозирования болезни рисовых листьев и связанной с ней стадии роста использовался метод классификации на основе ансамбля. Пять моделей глубокого обучения (CNN, VGG16, ResNet50, InceptionV3 и MobileNetV2) были независимо обучены для классификации заболеваний и объединены с использованием среднего голосовающего ансамбля. Эта процедура включала прогнозирование вероятностей каждой категории заболеваний во всех моделях и среднего распределения вероятностей, что повышает точность предсказуемости и минимизирует смещение в модели. Окончательный прогноз был взят как класс болезни с наибольшей средней вероятностью. Кроме того, была обучена другая модель классификации стадий на основе CNN для прогнозирования стадии роста рисового листа. Обе модели классификации принимали входные изображения размером 128x128, затем нормализовали значения пикселей и использовали модели для вывода. Окончательные прогнозы как стадии листьев, так и заболевания затем сопоставлялись с существующим набором рекомендаций по лечению для обеспечения обоснованного лечения и управления болезнью.
Пример вывода: «Стадия листа: 3, Болезнь: тунгро»
Рекомендации по лечению
Чтобы сделать классификацию болезней рисового листа более практичной, в приложение была интегрирована система рекомендаций по лечению на базе Streamlit. Система принимает стадию прогнозируемого заболевания и листьев, чтобы предложить конкретные рекомендации по лечению и обеспечить успешное управление болезнью. Модель ансамблевой классификации заболеваний (включая CNN, VGG16, ResNet50, InceptionV3 и MobileNetV2) классифицирует заболевание, тогда как модель классификации листовой стадии является другой моделью. Моделируемая стадия листа и болезни сравниваются с данными обработки с рекомендованными дозировками (профилактические меры и применение пестицидов).
Методологическая основа и вклад
Методология представленной системы представляет собой конвейер многоступенчатых процессов, сочетающий классификацию изображений и поддержку принятия решений. Рамки состоят из пяти крупных этапов: продвижение изображений и увеличение, прогнозирование стадии роста листьев, использование моделей глубокого обучения, обученных на изображениях, для классификации заболевания, объединение прогнозных результатов для получения ансамблевого решения и рекомендация лечения на основе типа и стадии роста заболевания. Методологический вклад этой работы направлен на внедрение множества моделей прогнозирования и модуля рекомендаций по лечению в один конвейер поддержки принятия решений. Система основана не только на классификации болезней, но и на включении информации о стадии роста растений для предоставления рекомендаций по лечению на определённой стадии. Система более актуальна для процесса принятия сельскохозяйственных решений в реальном мире благодаря такой стратегии рекомендаций, ориентированной на этап. Входное изображение сначала проходит предварительную обработку, а затем будет передано через модель классификации стадий и модели классификации заболеваний. Результаты модели заболевания усредняются с помощью ансамблевой техники, а прогнозирование заболевания и стадия роста доведены до конца для получения правильных рекомендаций по лечению на основе идентификации соответствующих записей о лечении в базе данных.
Стратегия валидации и предотвращение перенасадки
Для строгой валидации разработанных моделей набор данных был разделён на три дизъюнктивных подмножества: обучающий набор (80%), валидационный набор (10%) и тестовый набор (10%). Модели тренировались с помощью обучающего набора, настраивались с помощью валидационного набора и оценивали их итоговую производительность только с помощью тестового набора. Тестовый набор оставался абсолютно независимым для беспристрастного анализа модели. Были использованы следующие методы, чтобы гарантировать, что модель не перенагнется, и повысить её способность к обобщению. Для увеличения разнообразия в наборе данных сначала использовались методы расширения данных (вращение, масштабирование, сдвиг, сдвиг и горизонтальное переворачивание). Во-вторых, регуляризация дропаута была использована в полностью связанных слоях моделей CNN для снижения перенагонки. В-третьих, предобученные модели (VGG16, ResNet50, InceptionV3 и MobileNetV2) были перенесены с использованием техники замороженных сверточных слоёв для сохранения изученных признаков и минимизации вероятности перенагона, вызванного малым размером набора данных. Наконец, для мониторинга производительности модели во время обучения использовались потери валидации и точность, чтобы убедиться, что модель не перенагружает обучающие данные. Это схемы валидации и регуляризации, которые гарантируют, что предлагаемая модель хорошо обобщается на невидимые данные и обеспечивает хорошую производительность.
Предлагаемая система
Предлагаемый вариант — это глубокое обучение для управления болезнью рисовых листьев, включающее прогнозирование и классификацию заболевания на стадии листьев. Всё начинается с предварительной обработки изображений рисовых листьев с точки зрения их размера до общей высоты и значения пикселей. Стадия роста листьев предсказывается с помощью нейронной сети, а средний метод голосования используется для использования комплекса моделей глубокого обучения (CNN, VGG16, ResNet50, InceptionV3, MobileNetV2) для классификации заболеваний. Система использует прогнозируемую стадию и заболевание для назначения правильных доз гербицидов или пестицидов для лечения. Рабочий процесс предлагаемой системы показан на рисунке 3. Предыдущие подразделы (A по I) объясняют каждый отдельный элемент этого пайплайна, поэтому здесь не даётся дополнительное описание. Приложение на базе Streamlit, разработанное в этом исследовании, является прототипом инструмента поддержки принятия решений, предназначенного для демонстрации практической применимости предлагаемой модели. Система позволяет пользователям загружать изображения рисовых листьев и получать прогнозы заболеваний, информацию о стадиях роста и рекомендации по лечению. В рамках будущей работы по оценке реальной эффективности и удобства использования системы будут проводиться крупномасштабные испытания удобства использования и внедрение в полевых условиях с фермерами.