Research Article

Двухэтапная самоуправляемая учебная рамка для классификации изображений озимих культур и сорняков

DOI:

10.3791/69953

February 24th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данной работе оценивается применение двухэтапного глубокого обучения для самостоятельного предварительного обучения и контролируемой точной настройки классификации озимых культур и изображений сорняков. Эксперименты с набором данных WinterCropWeedDB проводятся с использованием единого внутреннего раздела, включая визуализации Grad-CAM.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Точное земледелие требует точного различия между озимими культурами и сорняками, но отсутствует аннотированный изображений для систем озимих культур. В данной статье рассматривается двухэтапный подход к глубокому обучению, который интегрирует самоконтролируемое обучение признаков с контролируемой тонкой настройкой для классификации изображений озимых культур и сорняков. В этой статье предложен и используется новый набор изображений озимых культур и сорняков, WinterCropWeedDB, который содержит 1 136 высококачественных изображений шести видов зимних культур и четырёх видов сорняков, собранных на сельскохозяйственных полях центральной Индии. На первом этапе самоконтролируемого обучения модель EfficientNet-B3 предварительно обучается с использованием метода самоконтроля в стиле SimCLR с функцией потерь InfoNCE (температура τ = 0,5) на изображениях. Среднее значение контрастных потерь снижается с 2,0712 в первой итерации до 1,6835 в конце предварительного обучения. На втором этапе контролируемой тонкой настройки предварительно обученная модель EfficientNet-B3 тонко настраивается с помощью контролируемого классификатора на изображениях и тестируется на одном внутреннем валидационном разделе (30%) набора данных. Тонко настроенная модель достигает максимальной точности валидации 98,27% с макро-усреднённым результатом F1 0,98. Отображение активации классов с градиентным взвешенным уклоном (Grad-CAM) и Grad-CAM++ используются в тонкой модели для качественной визуализации областей изображения, способствующих прогнозированию классов. Результаты эксперимента демонстрируют жизнеспособность использования самостоятельного предварительного обучения и контролируемой тонкой настройки для классификации изображений озимих культур и сорняков на региональных наборах данных, а также подчеркивают важность дополнительных тестов на независимых тестовых наборах.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Точное сельское хозяйство наблюдается за увеличением использования методов компьютерного зрения на основе глубокого обучения для автоматизированной классификации культур исорняков 1. Сверточные нейронные сети доказали свою эффективность в задачах распознавания растений; однако их производительность обычно зависит от доступности больших наборов данных, которые аннотируются точным образом2. В большинстве сельскохозяйственных учреждений, особенно в недостаточно представленных системах выращивания, таких как озимие культуры, процесс получения обширных маркированных изображений занимает много времени, трудоёмко идорого работает 3,4. Это препятствует развитию систем поддержки принятия решений, основанных на данных для зимних агроэкосистем. Самоуправляемое обучение (SSL) — это парадигма, которая недавно показала перспективы в обучении представлениям, когда используется большое количество изображений для изучения информативных функций, хотя они и не имеютмаркировки 5. Через проектирование предлоговых задач, таких как контрастное обучение, SSL позволяет нейронным сетям изучать структурные и семантические паттерны в изображениях, которые затем могут быть перенесены в задачи с контролируемымобучением 6. Предыдущие исследования в области сельскохозяйственной визуализации показали, что предварительное обучение на основе SSL может улучшить результаты на следующих этапах при ограниченных данных с маркировкой, что мотивирует исследование проблем распознавания культур исорняков 1,7.

Одновременно исследовались методы полусупервизированного и контрастного обучения. Для классификации и обнаружения сорняков, которые используют как маркированные, так и немаркированные данные, такие как обучение учителя-ученика и псевдомаркировка, были исследованы для классификации и обнаружениясорняков 2,4. В последнее время контрастивные методы обучения с целями, ориентированными на класс, показали потенциал для изучения переносимых представлений из сельскохозяйственных изображений, особенно в ситуациях с классовым дисбалансом или небольшим количествоманнотаций 1,3. Хотя эти исследования показывают потенциальные преимущества полуконтролируемого обучения и связанных с ними методов по сравнению с полностью контролируемым обучением, большая часть существующей литературы ограничивается летними системами выращивания, обнаружением объектов или крупномасштабными наборами данных.

Помимо предсказательной точности, интерпретируемость внутренних механизмов принятия решений в глубоких нейронных сетях по-прежнему остаётся актуальной задачей для практических сельскохозяйственных применений. Методы объяснимого искусственного интеллекта (XAI) разработаны для предоставления интерпретируемых объяснений прогнозов моделей, стремясь заполнить разрыв между прогнозами модели и человеческойэкспертизой 8. Алгоритмы визуализации на основе градиента, такие как отображение активации классов с градиентным взвешенным (Grad-CAM) и его расширение Grad-CAM++9,10, создают классово-дискриминирующие тепловые карты, которые указывают на области интереса изображения, наиболее релевантные для прогнозов модели. Эти алгоритмы обычно используются для качественного анализа изученных представлений в задачах анализа сельскохозяйственных изображений, но не представляют собой формальную валидацию интерпретируемости.

Основная цель этой работы — исследовать потенциал двухэтапной образовательной системы для классификации изображений озимых культур и сорняков с использованием самоконтролируемого обучения представления и контролируемой тонкой настройки, а также качественной визуализации. В этом исследовании рассматривалось применение двухэтапного учебного процесса для классификации изображений озимих культур и сорняков, интегрирующего самоконтрольное предварительное обучение с SimCLR и контролируемую тонкую настройку с помощью EfficientNet-B3. Эксперименты проводятся на наборе данных WinterCropWeedDB — регионально специфическом наборе данных с изображениями озимых культур и сорняков, собранных на сельскохозяйственных полях центральнойИндии 11. Результаты анализируются на основе единого внутреннего разделения, а Grad-CAM и Grad-CAM++ используются для визуализации внимания модели. Цель этого исследования — изучить возможность сочетания методов самостоятельного обучения и визуализации представления для классификации изображений озимых культур и сорняков, при этом учитывая ограничения экспериментальной системы. Этот рабочий процесс предназначен для исследовательской оценки регионально-специфических наборов данных по культурным сорнякам с ограниченными маркированными данными и не предназначен как валидированный ориентир для обобщения или масштабного использования.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Описание набора данных

Набор данных WinterCropWeedDB состоит из 1 136 высококачественных (красный, зелёный, синий) RGB-изображений шести видов озимых культур (пшеница, нут, горох, чечевица, горчица и травяной горох) и четырёх видов сорняков (обыкновенная вика, малая канарейка, гусиная лапа (Chenopodium album) и Euphorbia clementei), взятых с зимних сельскохозяйственных полей в штате Чхаттисгарх, Индия (рисунок 1). Изображения были сделаны в естественных условиях, включая разную освещенность, стадии роста и сложность фона. Все изображения изначально не были аннотированы и использовались только для самостоятельного предварительного обучения. Для контролируемой тонкой настройки изображения были вручную аннотированы и разделены с помощью стратифицированного выборочного отбора на обучающие (70%) и валидационные (30%) наборы. Валидационный набор использовался только для внутренней оценки модели и не дополнялся. Для устранения проблем дисбаланса класса и устойчивости во время обучения дополнение данных проводилось только на учебном наборе. Техники аугментации включали случайные вращения (+/-20°), горизонтальное переворот, масштабирование, трансляцию, изменения яркости и лёгкие аффинные преобразования. Обучающие образцы были расширены до цели в 150 изображений на класс, в результате чего получилось 1500 обучающих изображений, а валидационный набор включал 347 оригинальных изображений. В набор валидации не были включены дополненные или синтетические изображения для предотвращения смещения оценки. Помимо оценки с удержанием, также была проведена стратифицированная пятикратная кросс-валидация исходного маркированного набора данных в качестве вторичного анализа. В каждом складке дополнение данных осуществлялось только на обучающих наборах, а валидационные наборы оставались без изменений для поддержания согласованности с основной схемой оценки.

Вычислительный рабочий процесс для обучения модели с самоконтролем и под супервизией

Двухэтапный вычислительный конвейер был использован для изучения возможности интеграции самоконтролируемого обучения представления и контролируемой тонкой настройки для классификации изображений озимых культур и сорняков (рисунок 2). Этот конвейер включает в себя: (i) самоконтролируемое предварительное обучение с немаркированными изображениями и (ii) контролируемую тонкую настройку с помощью маркированного образца изображений. Все изображения были изменены до 300 × 300 пикселей и нормализованы перед обучением. Оценки моделей проводились только на одном внутреннем разделе, без использования внешнего тестового набора.

Этап 1 — самостоятельное предварительное обучение

На начальном этапе архитектура EfficientNet-B3 использовалась в качестве основной сети в системе самоконтролируемого обучения, вдохновлённой SimCLR. Двухслойная проекционная головка сократила представление основного изображения до 128-мерного пространства вложения. Для самостоятельного обучения каждое изображение преобразовывалось в два вида с помощью случайного обрезания размера, горизонтального переворота, цветопреобразования, гауссовского размытия и преобразования в оттенки серого. Оба вида были обрабатываны вместе для совместной оптимизации функции контрастных потерь. Процесс самостоятельного обучения проводился в течение 30 эпох, где одна эпоха означает полный проход всего обучающего набора данных через модель во время оптимизации, с пакетным размером из 16 изображений с использованием оптимизатора Адама (адаптивного алгоритма оптимизации на основе градиента, который оценивает моменты первого и второго порядка градиентов для корректировки скоростей обучения во время обучения). Для обеспечения стабильной тренировки использовалось градиентное обрезывание с максимальной нормой 1,0. Кроме того, контрольные точки моделей сохранялись после каждой эпохи для облегчения воспроизводимости. Значение температуры 0,5 использовалось при вычислении потерь InfoNCE во время самоконтролируемого обучения.

Этап 2 — контролируемая тонкая настройка

После самостоятельного предварительного обучения проекционная головка была удалена, а заранее обученные груза для контроля доработки использовались для контролируемой точной настройки. Полностью соединённая головка классификатора была добавлена в основу для многоклассовой классификации. Тонкая настройка проводилась с использованием только обозначенных изображений из учебного набора. Контролируемое обучение использовало потерю кросс-энтропии с весом класса и сглаживанием меток для устранения дисбаланса класса. Оптимизатор Адама использовался с разными скоростями обучения для магистрали (1 × 10⁻⁵) и классификатора (1 × 10⁻⁴). Планировщик скорости обучения использовался для снижения скорости обучения, когда точность валидации достигла стабильности. Обучение проводилось на протяжении 20 эпох, и контрольная точка модели с наивысшей точностью валидации сохранялась для оценки.

В дополнение к основной оценке с удержанием была проведена стратифицированная пятикратная кросс-валидация в качестве дополнительного анализа помеченного множества. В каждом сгибе дополнение выполнялось только на обучающих наборах, а валидационные наборы оставались без изменений. Результаты кросс-валидации были представлены отдельно и не использовались для выбора модели или оптимизации контрольных точек. Метрики эффективности, представленные в этом исследовании, основаны исключительно на внутреннем распределении валидации и отражают результаты наблюдаемой эффективности в текущей экспериментальной системе.

Визуализация Grad-CAM и Grad-CAM++

Для качественного анализа внимания в модели на тонко настроенной модели использовались методы отображения классов на основе градиентов (Grad-CAM и Grad-CAM++). Карты признаков и градиенты были получены с финального сверточного слоя базовой сети, а для выбранных валидационных изображений — классоспецифические тепловые карты. Они использовались только для качественного анализа модели и не были подтверждены. Таблица материалов содержит перечисление всего аппаратного обеспечения, программных библиотек, наборов данных и пользовательских обучающих скриптов, используемых в этом рабочем процессе.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Обзор предыдущих подходов и позиционирования рабочих процессов

Краткое изложение репрезентативных подходов к обучению, применявшихся ранее для распознавания сельскохозяйственных сорняков, приведено в Таблице 1. В таблице представлен обзор стратегий обучения под надзором, полунадзора и самоконтроля, используемых наборов данных, отчетных результатов и представленных ограничений. Большинство ранних работ сосредоточены на летних с...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этой работе рассматривалось использование двухэтапного подхода глубокого обучения, включающего самоконтрольное предварительное обучение с использованием идеи SimCLR и контролируемую тонкую настройку для классификации изображений озимых культур и сорняков на базе данных WinterCropWeedDB. Результаты показывают, что предлагаемый подход можно надёжно обучить на региональном наборе изображений зимнего сельского хозяйства и протестировать на одном разделе внутреннего набора валидации. В этом...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о конкурирующих интересах. Языковые инструменты на базе искусственного интеллекта (QuillBot) использовались исключительно для доработки языка и подготовки опровержений, а весь научный контент и выводы были написаны авторами.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование не получило конкретных грантов от фондов в государственном, коммерческом или некоммерческом секторе.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Набор инструментов CUDANVIDIA12.8
cuDNNNVIDIA9.1
Графический процессор (GPU)NVIDIAВидеокарта для ноутбука GeForce RTX 5050
MatplotlibРазработчики Matplotlib3.9.2
NumPyРазработчики NumPy1.26.0
Операционная системаMicrosoftLinux (WSL2), ядро 6.6.87
PythonФонд программного обеспечения Python3.12.7
PyTorchФонд PyTorch2.1.0 (сборка для разработки)
scikit-learnРазработчики scikit-learn1.5.1
ТиммРепозиторий GitHub1.0.24
TorchvisionФонд PyTorch0.25.0 (билд для разработки)
WinterCropWeedDBMendeley Data, DOI: 10.17632/m4h6zdsh79.1Версия 1

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Güldenring, R., Nalpantidis, L. Self-supervised contrastive learning on agricultural images. Comput. Electron. Agric. 191, 106510(2021).
  2. Li, J., et al. Performance evaluation of semi-supervised learning frameworks for multi-class weed detection. Front. Plant Sci. 15, 1396568(2024).
  3. Saleh, A., et al. WeedCLR: Weed contrastive learning through visual representations with class-optimized loss in long-tailed datasets. arXiv. , (2023).
  4. Saleh, A., et al. Semi-supervised weed detection for rapid deployment and enhanced efficiency. Comput. Electron. Agric. 236, 110410(2025).
  5. Wang, Y., Zhang, S., Dai, B., Yang, S., Song, H. Fine-grained weed recognition using Swin Transformer and two-stage transfer learning. Front. Plant Sci. 14, 1134932(2023).
  6. Kar, S., et al. Self-supervised learning improves classification of agriculturally important insect pests in plants. Plant Phenomics J. 6 (1), e20079(2023).
  7. Garibaldi-Márquez, F., et al. Advances on deep learning for proximal image-based weed recognition and control under authentic farmlands: a state-of-the-art review. Smart Agric. Technol. 12, 101405(2025).
  8. Mohan, R. N. V. J., Rayanoothala, P. S., Sree, R. P. Next-gen agriculture: integrating AI and XAI for precision crop yield predictions. Front. Plant Sci. 15, 1451607(2025).
  9. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. Proc. IEEE Int. Conf. Comput. Vis. (ICCV), , 618-626 (2017).
  10. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhyay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf. Appl. Comput. Vis. (WACV), , 839-847 (2018).
  11. Sahu, M., Majhi, B. WinterCropWeedDB-Sample: A benchmark dataset for weed classification in winter crops. Mendeley Data. V1, (2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Winter Crop ClassificationWeed Image ClassificationSelf Supervised LearningDeep LearningEfficientNet B3SimCLR ApproachContrastive LossSupervised Fine TuningGrad CAM VisualizationPrecision Agriculture

Related Articles