$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Описание набора данных
Набор данных WinterCropWeedDB состоит из 1 136 высококачественных (красный, зелёный, синий) RGB-изображений шести видов озимых культур (пшеница, нут, горох, чечевица, горчица и травяной горох) и четырёх видов сорняков (обыкновенная вика, малая канарейка, гусиная лапа (Chenopodium album) и Euphorbia clementei), взятых с зимних сельскохозяйственных полей в штате Чхаттисгарх, Индия (рисунок 1). Изображения были сделаны в естественных условиях, включая разную освещенность, стадии роста и сложность фона. Все изображения изначально не были аннотированы и использовались только для самостоятельного предварительного обучения. Для контролируемой тонкой настройки изображения были вручную аннотированы и разделены с помощью стратифицированного выборочного отбора на обучающие (70%) и валидационные (30%) наборы. Валидационный набор использовался только для внутренней оценки модели и не дополнялся. Для устранения проблем дисбаланса класса и устойчивости во время обучения дополнение данных проводилось только на учебном наборе. Техники аугментации включали случайные вращения (+/-20°), горизонтальное переворот, масштабирование, трансляцию, изменения яркости и лёгкие аффинные преобразования. Обучающие образцы были расширены до цели в 150 изображений на класс, в результате чего получилось 1500 обучающих изображений, а валидационный набор включал 347 оригинальных изображений. В набор валидации не были включены дополненные или синтетические изображения для предотвращения смещения оценки. Помимо оценки с удержанием, также была проведена стратифицированная пятикратная кросс-валидация исходного маркированного набора данных в качестве вторичного анализа. В каждом складке дополнение данных осуществлялось только на обучающих наборах, а валидационные наборы оставались без изменений для поддержания согласованности с основной схемой оценки.
Вычислительный рабочий процесс для обучения модели с самоконтролем и под супервизией
Двухэтапный вычислительный конвейер был использован для изучения возможности интеграции самоконтролируемого обучения представления и контролируемой тонкой настройки для классификации изображений озимых культур и сорняков (рисунок 2). Этот конвейер включает в себя: (i) самоконтролируемое предварительное обучение с немаркированными изображениями и (ii) контролируемую тонкую настройку с помощью маркированного образца изображений. Все изображения были изменены до 300 × 300 пикселей и нормализованы перед обучением. Оценки моделей проводились только на одном внутреннем разделе, без использования внешнего тестового набора.
Этап 1 — самостоятельное предварительное обучение
На начальном этапе архитектура EfficientNet-B3 использовалась в качестве основной сети в системе самоконтролируемого обучения, вдохновлённой SimCLR. Двухслойная проекционная головка сократила представление основного изображения до 128-мерного пространства вложения. Для самостоятельного обучения каждое изображение преобразовывалось в два вида с помощью случайного обрезания размера, горизонтального переворота, цветопреобразования, гауссовского размытия и преобразования в оттенки серого. Оба вида были обрабатываны вместе для совместной оптимизации функции контрастных потерь. Процесс самостоятельного обучения проводился в течение 30 эпох, где одна эпоха означает полный проход всего обучающего набора данных через модель во время оптимизации, с пакетным размером из 16 изображений с использованием оптимизатора Адама (адаптивного алгоритма оптимизации на основе градиента, который оценивает моменты первого и второго порядка градиентов для корректировки скоростей обучения во время обучения). Для обеспечения стабильной тренировки использовалось градиентное обрезывание с максимальной нормой 1,0. Кроме того, контрольные точки моделей сохранялись после каждой эпохи для облегчения воспроизводимости. Значение температуры 0,5 использовалось при вычислении потерь InfoNCE во время самоконтролируемого обучения.
Этап 2 — контролируемая тонкая настройка
После самостоятельного предварительного обучения проекционная головка была удалена, а заранее обученные груза для контроля доработки использовались для контролируемой точной настройки. Полностью соединённая головка классификатора была добавлена в основу для многоклассовой классификации. Тонкая настройка проводилась с использованием только обозначенных изображений из учебного набора. Контролируемое обучение использовало потерю кросс-энтропии с весом класса и сглаживанием меток для устранения дисбаланса класса. Оптимизатор Адама использовался с разными скоростями обучения для магистрали (1 × 10⁻⁵) и классификатора (1 × 10⁻⁴). Планировщик скорости обучения использовался для снижения скорости обучения, когда точность валидации достигла стабильности. Обучение проводилось на протяжении 20 эпох, и контрольная точка модели с наивысшей точностью валидации сохранялась для оценки.
В дополнение к основной оценке с удержанием была проведена стратифицированная пятикратная кросс-валидация в качестве дополнительного анализа помеченного множества. В каждом сгибе дополнение выполнялось только на обучающих наборах, а валидационные наборы оставались без изменений. Результаты кросс-валидации были представлены отдельно и не использовались для выбора модели или оптимизации контрольных точек. Метрики эффективности, представленные в этом исследовании, основаны исключительно на внутреннем распределении валидации и отражают результаты наблюдаемой эффективности в текущей экспериментальной системе.
Визуализация Grad-CAM и Grad-CAM++
Для качественного анализа внимания в модели на тонко настроенной модели использовались методы отображения классов на основе градиентов (Grad-CAM и Grad-CAM++). Карты признаков и градиенты были получены с финального сверточного слоя базовой сети, а для выбранных валидационных изображений — классоспецифические тепловые карты. Они использовались только для качественного анализа модели и не были подтверждены. Таблица материалов содержит перечисление всего аппаратного обеспечения, программных библиотек, наборов данных и пользовательских обучающих скриптов, используемых в этом рабочем процессе.