Исследовательская статья

Оценка упорядочённости выравнивания обрезанного табака в реальном времени с помощью усовершенствованной одноступенчатой модели регрессии

DOI:

10.3791/71669

29 мая 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Разработана усовершенствованная одноступенчатая регрессионная модель для обнаружения упорядочённости выравнивания вырезанного табака в реальном времени. Подход объединяет три структурных оптимизации и метод индивидуального прогнозирования ориентации для повышения точности обнаружения при одновременном снижении параметров модели и вычислительной сложности, что позволяет эффективно оценивать выравнивание нарезного табака в промышленных производственных средах.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Упорядоченный порядок нарезного табака, определяемый как согласованность вырезанного табака вдоль оси сигареты, является ключевым фактором в оптимизации качества производства. Точная и автоматизированная оценка этого свойства остаётся сложной из-за сложных структур цепей и переменных условий визуализации. Разработана улучшенная одноступенчатая регрессионная модель для обеспечения надёжного обнаружения упорядочённости выравнивания табака. Подход включает три архитектурные модификации: многочастотный интерактивный метод понижения дискретизации для сохранения информации о признаках, тройную стратегию комплементарного синтеза для улучшения многомасштабного представления признаков и динамическую головку обнаружения для улучшения локализации на разных уровнях. Кроме того, реализуется пользовательский метод прогнозирования ориентации для количественной оценки упорядочённости выравнивания. Модель оценивается на промышленном наборе изображений, достигая средней точности 89,9%, точности 90,6% и отзыва 88,7%. По сравнению с базовой моделью, предлагаемый подход снижает параметры модели на 30,8% (с 2,6 млн до 1,8 млн) и вычислительную сложность на 21,5% (с 6,5G до 5,1G), одновременно повышая производительность. В целом, этот метод обеспечивает эффективную и точную оценку упорядочения выравнивания нарезов табака и демонстрирует пригодность для промышленных применений в реальном времени.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Упорядоченный порядок табака — это степень осевого выравнивания разрезанного табака внутри сигареты. Понимание факторов, влияющих на это свойство, таких как морфология табака и параметры пневматической транспортировки, крайне важно для оптимизации процессов резки и сборки. В результате изучение этих влияющих факторов стало ключевой стратегией для табачных предприятий, направленных на снижение затрат и повышение эффективности производства. Традиционная оценка порядка нарезанного табака опирается на ручные методы, которые неэффективны и часто не обладают последовательностью и точностью. Поэтому в отрасли существует острая потребность в автоматизированной, точной и в реальном времени системе обнаружения для оптимизации производственных процессов. С быстрым развитием глубокого обучения стала возможной автоматизированная оценка упорядочённости нарезанного табака на основе обнаружения объектов. Однако внедрение таких систем оценки на производственных линиях остаётся в значительной степени неизученной темой исследований. Тем не менее, технологии машинного зрения успешно применяются для инспекционных задачв других областях 1, предоставляя ценные справочные материалы для этого исследования. В этом контексте детекторы на основе сверточных нейронных сетей (CNN) стали доминирующей парадигмой и обычно делятся на двухэтапные подходы, такие как FasterR-CNN 2, и одноступенчатые фреймворки, такие как серия You Only Look One (YOLO) 3,4.

В последние годы алгоритмы обнаружения объектов на основе глубокого обучения, особенно фреймворк Faster R-CNN, продемонстрировали значительный потенциал в различных областях. Однако их прямое применение в конкретных промышленных и профессиональных ситуациях часто ограничено сложными операционными условиями и уникальными требованиями к задачам. В результате было предложено множество индивидуальных улучшений для решения этих проблем. В анализе медицинских изображений, например, Су и др.5 сосредоточились на оптимизации параметров и совершенствовании архитектур сетей для повышения точности обнаружения небольших критически важных целей при обнаружении узлов лёгких. В области обнаружения промышленных дефектов Чен и др. 6 решили проблему интерференции текстуры в осмотре ткани, интегрируя фильтры Габора — оптимизированные с помощью генетических алгоритмов — в основной системе Faster R-CNN для эффективного подавления сложных фонов. Чтобы преодолеть проблемы дефицита данных и экологической сложности при обнаружении подводных целей, Цзэн и др.7 внедрили состязательную окклюзионную сеть. Эта сеть конкурирует с детектором во время обучения, заставляя модель изучать более надёжные характеристики и тем самым снижая перенагон. Кроме того, для тонких задач поиска, таких как идентификация конкретных экземпляров, Li и др.8 усовершенствовали Faster R-CNN с помощью стратегий конкатенации и тонкой настройки слоёв признаков, значительно улучшив её производительность на изображениях низкого разрешения. Ванг и др. недавно предложили многосторонний фреймворк Faster R-CNN, сохраняющий конфиденциальность, который обеспечивает безопасные вычисления на зашифрованных изображениях и параметрах модели с помощью новых протоколов для безопасного деления, экспоненциации и логарифма. Sun и др.10 продемонстрировали эффективность улучшенного Faster R-CNN в распознавании нескольких типов дефектов на ступицах колес, обеспечив более высокую среднюю среднюю точность (mAP), чем R-CNN и YOLOv3. Вместе эти усилия подчеркивают дальнейшее развитие Faster R-CNN в направлении большей адаптивности, надёжности и применимости в различных реальных ситуациях. Параллельно с этими достижениями в области двухступенчатых детекторов, одноступенчатые фреймворки, такие как серия YOLO, также прошли значительное развитие.

Как заметная альтернатива двухступенчатым детекторам, серия YOLO получила значительное признание как в промышленных, так и в исследовательских кругах благодаря своей эффективной архитектуре и отличной эффективности обнаружения в реальном времени. С момента введения модели первого поколения Редмоном и др. 11в 2016 году последовательные итерации постепенно решали различные технические ограничения, что побудило исследователей разрабатывать специализированные адаптации для специфических областей приложений. В системах мониторинга движения, например, Jamtsho и др.12 реализовали YOLOv2 в сочетании с алгоритмом центроидного отслеживания для точного идентификации номеров мотоциклистов без шлемов в видеопотоках, эффективно снижая ложноположительные результаты при сохранении высокого уровня обнаружения в 98,52%. Для сложных подводных условий Neelamegam и др.13 разработали гибридную модель YOLO-Transformer, которая интегрирует возможности обнаружения в реальном времени YOLO с механизмами внимания, основанными на трансформаторах, для улучшения контекстуального понимания. Используя данные IoT-датчиков в реальном времени о факторах окружающей среды, таких как мутность и уровень освещения, модель динамически адаптируется к изменяющимся условиям, достигая точности обнаружения 97,5% и превосходя традиционные модели в шумных и маловидимых ситуациях. Аналогично, Чжан и др.14 предложили усовершенствованную модель YOLO для приложений дистанционного зондирования. Чтобы решить проблемы недостаточного представления признаков и путаницы фона, были введены специализированные модули для улучшения признаков, многомасштабного синтеза и глобального контекстного осведомлённости, которые значительно повышают точность обнаружения малых объектов. В совокупности эти исследования демонстрируют продолжающуюся эволюцию серии YOLO в направлении большей адаптивности, надёжности и эффективности в различных реальных сценариях.

Несмотря на эти достижения, современные версии семейства YOLO, такие как YOLOv113, по своей природе не оптимизированы для специфических текстурных и структурных особенностей нарезанного табака в промышленных условиях. Стандартные операции понижения пробы могут привести к потере мелкозернистых черт, которые имеют решающее значение для отличия выровненного табака от неупорядоченного нарезанного табака. Кроме того, их фиксированно-масштабные детекторные головки с трудом эффективно справляются с многомасштабной природой табачных свойств при различных условиях визуализации.

Для решения этих проблем в статье предлагается улучшенная одноступенчатая регрессионная модель на основе YOLOv11n, в сочетании с методом индивидуального прогнозирования ориентации, для надёжного онлайн-обнаружения упорядочённости порезанного табака. Основные вклады этой статьи тройные. (1) Предлагается метод многочастотного интерактивного понижения дискретизации (MFID). Стандартные операции свертки или пулинга с шагами отбрасывают мелкозернистую информацию, тогда как MFID явно разлагает признаки на низкочастотные и высокочастотные компоненты с помощью вейвлет-преобразования Хаара. Такой подход сохраняет больше оригинальной информации и минимизирует потерю информации во время понижения выборки. (2) Метод тройного комплементарного слияния (TCF) предназначен для повышения качества признаков путём слияния поверхностной, средней и глубокой семантической информации. Хотя для слияния признаков часто используются простые операции конкатенации или сложения, TCF вводит среднеслойное взвешенное слияние с обратными ветвями веса, что обеспечивает комплементарность между семантической и детальной информацией. (3) Вводится динамическая головка обнаружения (DynamicHead) вместо оригинальной головки обнаружения. Исходная головка обнаружения основана на операциях свёртки с фиксированным масштабом; в отличие от этого, DynamicHead интегрирует механизмы внимания, осознанного масштаба, пространственного и осознанного задачи. Это позволяет динамически корректировать важность признаков и более гибко и эффективно объединять многомасштабные элементы, тем самым улучшая способность модели точно локализовать и классифицировать признаки, связанные с порядком.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании не участвовали люди, позвоночные животные или регулируемые ткани; поэтому этическое одобрение или одобрение институционального контроля не требовалось. Набор данных, использованный в этом исследовании, был получен компанией Longyan Tobacco Industry Co., Ltd. Изображения были собраны из пяти независимых производственных партий в течение трёх месяцев. Отбор проб проводился случайным образом в разное время суток (утром, днём и ночью), чтобы зафиксировать естественные вариации условий производства. Набор данных включает образцы с диапазоном влажности табака от 12% до 18%, скоростью резки 1,5, 2,0 и 2,5 м/с, а также давлением пневматического транспорта 0,4, 0,5 и 0,6 МПа, что обеспечивает охват типичных производственных условий.

Сбор и настройка наборов данных
Аппаратная конфигурация
Система получения изображений была настроена на соответствие требованиям по определению упорядочённости нарезанного табака в сигаретах с нагревом, а не горением. Он в основном состоял из промышленной камеры, промышленного объектива, источника зрительного света и промышленного управляющего блока. Система использовала промышленную камеру MV-CH120-10GC в паре с промышленным объективом MVL-KF0818M-12MP для захвата высококачественных изображений области нарезанного табака на поверхности секционных стриженок. Камера располагалась на рабочем расстоянии 150 мм от поверхности сигаретного стержня. Ленточный светодиодный источник света устанавливался коаксиально с камерой на расстоянии 80 мм от цели с углом падения 45°. Визуализация проводилась внутри матово-чёрного корпуса для устранения помех от окружающего света. Корпус представляет собой матово-чёрный алюминиевый капот с внутренними размерами 400 мм (ширина) × 350 мм (глубина) × 300 мм (высота), а внутренние поверхности покрыты матовой чёрной краской (отражательная способность < 5% при 550 нм) для минимизации внутренних отражений и обеспечения стабильного освещения. Для обеспечения качества и согласованности изображения был использован источник света MV-LRDS-H-95-30-W для создания стабильной среды освещения, минимизируя влияние вариаций окружающего света на экстракцию контуров и распознавание ориентации табачных нитей. Полученные изображения принимались, обрабатывались и хранились промышленным компьютером PC1010-AX360, который также выполнял последующие алгоритмы распознавания, вычисление результатов и вывод интерфейса. Явная калибровка камеры или коррекция искажений не проводилась, поскольку промышленная камера и объектив демонстрировала незначительное радиальное искажение (менее 0,5% по краям изображения) в поле зрения 896 × 1600 пикселей. Камера и источник света были жёстко закреплены на фиксированной раме для обеспечения стабильности положения при захвате изображений. Интенсивность источника света поддерживалась на постоянном уровне на протяжении всего момента получения изображения. Поле зрения было сконфигурировано так, чтобы полностью покрыть открытую область обработанного табака внутри стальной опорной конструкции.

Настройка параметров камеры
Запускалось получение изображений, и после того, как образец сигареты был размещён и разделён на секции, а затем сохранялся в формате JPG. Для обеспечения согласованности полученных изображений параметры получения устанавливались вручную. Конкретно, разрешение изображения было установлено на 896 × 1600. Время экспозиции изначально было установлено на уровне 4000 мкс, и его можно было тонко настроить в диапазоне от 3000 до 6000 мкс, в зависимости от яркости на месте. Вся настройка параметров проводилась с использованием образца, помещённого внутри матово-чёрного корпуса, описанного выше, при полностью контролируемом освещении. Во время настройки не было внешнего окружающего освещения, так как система обработки изображений работала в полностью закрытом помещении с выключенным светом в комнате. Изначально усиление было установлено на уровне 2 дБ и управлялось в диапазоне от 0 до 6 дБ в зависимости от уровня шума. Гамма-значение было установлено на 0.8, а баланс белого настроен с фиксированными параметрами. Окончательные параметры получения были установлены следующим образом: время экспозиции = 4000 мкс, усиление = 2 дБ, гамма = 0,8, режим баланса белого = фиксированный, разрешение изображения = 896 × 1600 пикселей, формат изображения = JPG. Для баланса белого использовался режим с фиксированными параметрами. Калибровка проводилась с помощью стандартной белой эталонной карты (X-Rite ColorChecker), размещённой в позиции образца. Усиление красного и синего каналов корректировалось до тех пор, пока значения RGB белой карты не выравнивались в пределах отклонения ±2%. После калибровки параметры баланса белого фиксировались следующим образом: красный коэффициент усиления = 1,2, зелёный коэффициент усиления = 1,0 (фиксированный), синий коэффициент усиления = 1,5. Калибровка проводилась один раз после каждого запуска системы или всякий раз, когда источник света показывал признаки старения, что могло вызвать смещение цветовой температуры. Эти настройки помогли обеспечить чёткие границы нарезанного табака и стабильное распределение яркости, а также удовлетворить требования к обработке для последующего сегментирования табачных цетей, расчета ориентации и анализа порядка.

Коллекция изображений
Получение изображений было направлено на участок порезанного табака, обнажаемый на поверхности нагревающих не горящих стрижков после сечения. Во время обнаружения образец сигареты сначала доставлялся на инспекционную станцию, где его положение и поза корректировались и фиксировались механизмом позиционирования образца. Механизм позиционирования состоит из пневматического зажима с V-образными направляющими для выравнивания. Система достигает позиционной повторяемости ±0,5 мм на протяжении 1000 последовательных циклов, что подтверждается измерениями лазерных датчиков смещения. Впоследствии внешний материал обмотки стабильно разделялся резким механизмом, полностью обнажая поверхностный нарезанный табак в поле зрения зрительной системы. Использовалось круглое вращающееся лезвие (диаметр 50 мм, толщина 0,3 мм, материал высокоскоростная сталь). Глубина резки была установлена на 1,5 мм при скорости вращения 300 об/мин. Согласованность резки контролировалась линейной обратной связью энкодера, поддерживая вариацию толщины в пределах ±0,05 мм. После стабильности положения образца и чёткого определения области изображения получение изображения осуществлялось с помощью промышленной камеры при стабильном освещении источника света. Всего было собрано 634 изображения; типичные изображения показаны на рисунке 1. Набор данных включает три уровня плотности табака (низкий, средний, высокий; примерно 180, 220 и 260 мг/см³), ориентацию нитей от −180° до 180°, а также условия освещения от обычного освещения до условий слабой освещённости. Освещённость измерялась с помощью калиброванного цифрового люксометра (TA8133, точность ±3%), при этом датчик был расположен на поверхности образца. Измеренный нормальный диапазон освещения составляет 200–800 люкс, обеспечиваемый лентовидным светодиодным источником внутри закрытой вытяжки, без утечки окружающего света. Нижнее значение (примерно 200 люкс) представляет собой крайнее состояние, созданное при затемнении источника света для оценки устойчивости модели. Кроме того, частичная окклюзия табачных нитей (от 10% до 50%) присутствует примерно на 30% изображений. Эти вариации отражают реальное разнообразие производственной линии.

figure-protocol-1
Рисунок 1. Репрезентативные необработанные изображения нарезанного табака, полученные системой зрения. (a–h) Представительные примеры необработанных изображений нарезанного табака, зафиксированных в промышленных полевых условиях с использованием системы получения изображений. Изображения получались с разрешением 896 × 1600 пикселей при контролируемом освещении с использованием полосного источника света, чтобы обеспечить равномерную яркость и минимизировать помехи окружающей среды. Эти изображения иллюстрируют вариации в распределении, плотности и ориентации табачных цепочек до обработки модели. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Аннотация к изображениям
С помощью инструмента с открытым исходным кодом LabelImg ограничивающие рамки были нарисованы вокруг видимых опорных элементов из табака и стали. Правильный угол был назначен в качестве метки для каждого ограничивающего рамки. Горизонтальная ось (0°) определялась как направление вправо, параллельное нижнему краю изображения. Для каждой табачной нити функция измерения угла инструмента аннотирования использовалась для проведения линии вдоль главной оси нити. Угол записывался как угол между этой осью и горизонтальным ориентиром (диапазон: −180° до 180°). Аннотации сохранялись в стандартном формате одноступенчатого детектирования, при этом каждому изображению соответствовал один TXT-файл. Каждый .txt файл содержит строки, отформатированные так: class_id x_center y_center ширина высоты. Координаты нормализуются до [0,1] относительно размеров изображения. Класс 0 = табачная нить, класс 1 = стальная опора. Метка угла хранится в виде шестого столбца в файле .txt аннотации, добавленной после пяти стандартных полей YOLO. Точный формат для каждой строки: class_id x_center y_center ширина-высота угол. Значение угла хранится в градусах в виде числа с плавающей запятой в диапазоне от −180,0 до 180,0, с двумя знаками после запятой (например, 45,75). Пример строки: 0 0.5230 0.4170 0.0850 0.0620 38.25.

Контроль качества
Второй аннотатор просмотрел случайным образом выбранные 20% аннотированных изображений. Случайный выбор выполнялся с помощью функции random.sample() из библиотеки случайных Python с фиксированным случайным засечением 2024. Был сгенерирован список всех имён файлов изображений, и 20% изображений были отобраны без замены с помощью этого генератора случайных чисел, обеспечивающего воспроизводимый отбор при повторяющихся процедурах контроля качества. Любые несоответствия обсуждались и устранялись, обеспечивая согласованность маркировки. Согласование между аннотаторами оценивалось с помощью углового отклонения: средняя абсолютная разница между угловыми метками двух аннотаторов составляла 2,8° (стандартное отклонение = 1,5°). Аннотации с отклонением >5° были пересмотрены и согласованы.

Одноступенчатая модель регрессии для обнаружения упорядочённости резного табака
Обнаружение упорядочённости выравнивания табака имеет решающее значение для улучшения как производственного процесса, так и качества конечной продукции в производстве сигарет. Однако эта задача осмотра сталкивается с рядом проблем, включая перекрывающийся нарезный табак, небольшие размеры целей и неравномерное освещение, что снижает точность обнаружения и надёжность. Улучшенная одноступенчатая регрессионная модель на базе YOLOv11n используется для онлайн-обнаружения упорядоченной последовательности табака. Предлагаемая структура точно определяет морфологические особенности нарезанного табака во время формирования палочки, обеспечивая надежное определение регулярности выравнивания при одновременном повышении точности, прочности и возможности обработки в реальном времени. Общая конфигурация предлагаемой одноступенчатой регрессионной структуры показана на рисунке 2.

figure-protocol-2
Рисунок 2. Общая архитектура предлагаемой одноступенчатой регрессионной модели. Схема иллюстрирует полную структуру сети, включая магистраль, шейку и головку обнаружения. Магистраль извлекает многомасштабные функции, включая мультичастотные интерактивные модули понижения дискретизации (MFID) для сохранения информации о признаках. Шейка интегрирует особенности с использованием стратегии тройного комплементарного синтеза (TCF) для улучшения многоуровневого представления. Головка обнаружения использует модуль DynamicHead, который интегрирует механизмы внимания с осознанностью масштаба (πL), пространственным (πS) и осознанным задачей (πC) для повышения эффективности локализации и классификации. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Модуль понижения мультичастотной информации (MFID)
В магистральной сети YOLOv11 сверточная операция с шагом 2 выполняет пониженную дискретизацию путём пропуска пикселей. Этот процесс напрямую отбрасывает половину пространственной информации, что приводит к потере высокочастотных деталей (например, краёв и текстур мелких объектов) и значительной потере информации для малых целей. Кроме того, операции максимизации пула и среднего пула в магистрали также отбрасывают подробную информацию в областях объектов, плавные признаки и добавляют шум, что негативно влияет на обучение признаков.

Для решения этих проблем вводится модуль MFID, вдохновлённый концепцией вейвлет-иерархическогоразложения 15,16. Этот модуль сначала разбивает характеристики на две взаимодополняющие части с помощью вейвлет-преобразования Хаара: низкочастотную фоновую информацию, улучшающую классификацию, и высокочастотные детали, богатые краями и текстурами, которые улучшают обнаружение малых целей. Для дальнейшего укрепления восприятия малых целей модуль MFID включает две дополнительные ветви: ветвь с максимальным пулированием, использующую инвариантность трансляции для сохранения мелких характеристик малых целей, и ветвь с ступенчатой свёрткой, использующую обучаемые параметры для достижения большей репрезентационной ёмкости и более богатой информационной композиции. Благодаря этой многоветвевой структуре модуль MFID сохраняет более полную пространственную и частотную информацию во время понижения дискретизации. Архитектура модуля MFID показана на рисунке 3.

figure-protocol-3
Рисунок 3. Структура модуля MFID. Модуль MFID разделяет входные элементы на низкочастотные и высокочастотные компоненты с помощью вейвлет-преобразования Хаара для сохранения критически важной структурной информации во время понижения дискретизации. HLL обозначает компонент приближения низкой частоты, а HLH, H HL и HHH — компоненты высокочастотных деталей в горизонтальном, вертикальном и диагональном направлениях соответственно. Символ 2↓ обозначает двойное понижение дискретизации. Карты признаков из нескольких ветвей объединяются с помощью механизмов конкатенации и гейтинга для улучшения представления признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Во время понижения дискретизации изображение разлагается с помощью вейвлет-преобразования Хара, которое принято за свою простоту и эффективность декомпозиции низкочастотных и высокочастотных признаков, что делает его подходящим для задач обнаружения в реальном времени. HL и H H обозначают фильтры декомпозиции в низких и высокочастотных частотах соответственно и используются для извлечения низкочастотной и высокочастотной информации из изображения. Вейвлет-базисная функция и функция масштабирования для одноуровневого одномерного преобразования Хаара определяются с помощью уравнения 1 следующим образом:

figure-protocol-4 (1)

Базисная функция Хара определяется с помощью уравнения 2 следующим образом:

figure-protocol-5 (2)

Здесь параметры j и k обозначают соответственно коэффициент масштабирования и величину трансляции базисной функции Хара. В частности, база Хаара нулевого порядка определяется с помощью уравнения 3 следующим образом:

figure-protocol-6 (3)

На рисунке 3 символ 2↓ обозначает двойное понижение дискретизации. Двухуровневое вейвлетное разложение Хаара даёт четыре компонента: низкочастотное приближение (HLL) и высокочастотные компоненты детализации в горизонтальном (HLH), вертикальном (HHL) и диагональном (HHH) направлениях. КомпонентH LL несёт контурную, фоновую и глобальную информацию, тогда как высокочастотные компоненты (HLH, H HL и HHH) фиксируют край, текстуру и мелкозернистые особенности.

Высокочастотные компоненты HLH, HHL и HHH , полученные после двойного понижения дискретизации, объединяются операцией Concat, что позволяет интегрировать многонаправленную детальную информацию для генерации интегрированной высокочастотной детализации figure-protocol-7, как показано в уравнении 4.

figure-protocol-8 (4)

Впоследствии на ветке max-pooling выполняется вторичное слияние информации для интеграции детальных признаков с глобальными признаками, тем самым генерируя реконструированную информацию figure-protocol-9, как показано в уравнении 5, которое включает более широкий набор заметных признаков и повторно использует высокочастотную детальную информацию для улучшенного представления признаков.

figure-protocol-10 (5)

Затем используется механизм гейтинга для динамической регулировки потока информации, который figure-protocol-11 направляется для идентификации мелких объектов целей внутри figure-protocol-12, сохраняя полезные элементы и подавляя врождённые бесполезные помехи шума. Механизм гейтинга определяется как: гейтинг(x) = Linear_2(ReLU(Linear_1(x))), где Linear_1 уменьшает размер канала на редукционный коэффициент 4 и Linear_2 восстанавливает её исходную размерность канала. Выход механизма гейтинга проходит через сигмоидную активацию для получения модуляционных весов в диапазоне [0,1]. Используемые параметры включают матрицы весов и члены смещения обоих линейных слоёв, которые инициализируются с помощью равномерной инициализации. Это гарантирует правильное сбалансирование и использование подробной и критической информации о признаках, что приводит к окончательной детализацииfigure-protocol-13, представленной в Уравнении 6.

figure-protocol-14 (6)

Наконец, информация о понижении дискретизации шагом и свёрткой, низкочастотный вектор и итоговая детальная особенность объединяются с помощью Concat для расширения взаимодействия понижения дискретизации в различных измерениях и частотных диапазонах, как показано в уравнении 7.

figure-protocol-15 (7)

Шаги реализации действий
Определение модуля
В файлах определения модели проекта должен быть определен пользовательский модуль PyTorch с названием MFID. Реализация этого модуля состоит из четырёх параллельных путей: (1) Вейвлет-преобразование: к входной карте признаков применяется двухуровневая декомпозиция с помощью заранее определённых вейвлет-фильтров Хаара, генерируя низкочастотный компонент аппроксимации и высокочастотные компоненты детализации в горизонтальном, вертикальном и диагональном направлениях, после чего три высокочастотных компонента соединяются; (2) Макс-пулинг: макс-пулинг применяется к входу для сохранения заметных признаков; (3) Ступенчатая свёртка: стандартная даундискретизация выполняется через сверточный слой с шагом 2; (4) Реконструкция признаков и слияние: сначала высокочастотная информация, полученная от вейвлет-преобразования, объединяется с признаками ветви max-pooling; затем используется механизм гейтинга, управляемый низкочастотной информацией, для фильтрации мелкозернистых объектов; Наконец, обработанные мелкозернистые признаки, низкочастотные компоненты и выход с пошаговой свёрткой объединяются для получения окончательной карты пониженной дискретизации.

Редактирование конфигурационных файлов
Файл конфигурации базовой модели (config.yaml) должен быть открыт. Все примеры стандартных модулей понижения дискретизации как в магистрали, так и в шейных сетях должны быть систематически идентифицированы. Каждый идентифицированный элемент модуля понижения дискретизации следует заменить модулем MFID.

Мотивация для дизайна
Модуль MFID предназначен для снижения потери информации при стандартных операциях понижения дискретизации, что особенно вредно для обнаружения малых объектов. Её основная концепция вдохновлена вейвлет-иерархическим разложением. Явно отделяя низкочастотную глобальную информацию от высокочастотной детализации на изображении и обрабатывая её соответствующим образом, модуль гарантирует сохранение критически важных текстур и краёв при понижении дискретизации. Включение ветвей с максимальным пулированием и ступенчатой свёрткой дополнительно отражает и дополняет особенности с взаимодополняющих точек зрения — в частности, инвариантность перевода против обучаемого представления. Благодаря многоветвневому синтезу модуль обеспечивает более информативное и надёжное многочастотное представление признаков на последующих сетевых уровнях. Все неопределённые архитектурные параметры и конфигурации слоёв соответствуют стандартным настройкам реализации фреймворка YOLOv11n в PyTorch.

Модуль термоядерного синтеза с тройным перекрёстным элементом (TCF)
На этапе слияния признаков грифа в архитектуре сети YOLOv11 обычно используется простая операция конкатенации для слияния карт признаков одного масштаба. Однако этот прямой подход имеет явные ограничения: во-первых, он не учитывает полностью семантические различия между признаками на разных уровнях; Во-вторых, отсутствие явного моделирования межканальных корреляций делает мелкие объекты уязвимыми к размыванию или потере при термоядерном синтезе, что снижает эффективность обнаружения. Для решения этих проблем был введён более интерактивный метод слияния, называемый модулемTCF 17. Этот метод использует многоуровневую стратегию прогрессивного синтеза, которая направляет поток информации к обнаружению малых целей через передачу между слоями. Он также включает дополнительные нелинейные операции для изучения глубокоуровневой информации на разных масштабах, тем самым улучшая слияние многомасштабных признаков. В отличие от традиционных модулей, основанных на простом сложении или среднем синтезе, TCF использует взвешенный подход к термоядерному синтезу. Это позволяет адаптивно изучать подробную информацию на каждом уровне, динамически оптимизировать пути извлечения информации и фокусироваться на наиболее разборчивых признаках, что в конечном итоге повышает точность обнаружения. Архитектура модуля TCF показана на рисунке 4.

figure-protocol-16
Рисунок 4. Структура модуля TCF. Модуль TCF выполняет многоуровневую слияние элементов на мелких, средних и глубоких слоях для улучшения представления малых целей. P представляет входные карты признаков на разных уровнях. Conv — операции свёртки, Upsample — увеличение выборки признаков, а AdaptiveAvgPool — адаптивное среднее пулирование. Модуль интегрирует калиброванные признаки через взвешенное слияние и межслойное взаимодействие для повышения семантической и пространственной комплементарности признаков. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

В задаче обнаружения объектов информация, содержащаяся в объекте глубокого слоя Pi+1 и мелководье Pi-1, существенно различается. Для усиления слияния межуровневой информации вводится P i в качестве финального слоя слияния признаков для балансировки различий между информацией о признаках на разных уровнях.

Во-первых, входная информация о мелких, средних и глубоких слоях обрабатывается с помощью функции активации сигмоидов для генерации взвешенных признаков figure-protocol-17, figure-protocol-18, и figure-protocol-19, которые служат для усиления ключевых признаков и ослабления избыточных, как показано в уравнении 8.

figure-protocol-20 (8)

Во-вторых, входная информация о мелких, средних и глубоких слоях умножается по элементам на отображённые взвешенные признаки для генерации откалиброванных признаков figure-protocol-21, figure-protocol-22, и figure-protocol-23, как показано в уравнении 9. Значение признаков динамически регулируется с помощью механизма внимания веса, что обеспечивает адаптивный выбор признаков и перекалибровку.

figure-protocol-24 (9)

На стадии слияния признаков среднего слоя используются две ветви с обратным весом для слияния с калиброванными мелкими и глубокими слоями соответственно, фильтруя ложную детальную информацию, вызванную шумом в характеристиках мелких слоёв, и смещённую семантическую информацию в характеристиках глубокого слоя. Впоследствии многоветвневая информация интегрируется, и исходные признаки, калиброванные и интерактивные особенности этого слоя, а также откалиброванные мелкие и глубокие слои объединяются. Это обеспечивает сохранение и дополнение многомасштабной информации о признаках, смягчает проблемы потери информации и ошибочных оценок о малых целях, и, в конечном итоге, приводит к среднеслойным сплавленным признакам figure-protocol-25, которые формулируются с помощью уравнения 10 следующим образом:

figure-protocol-26 (10)

Связи между мелким, глубоким и средним слоями устанавливаются отдельно, как показано в уравнениях 11 и 12.

figure-protocol-27 (11)

figure-protocol-28 (12)

Наконец, выходы трёх путей синтеза признаков объединяются с помощью операции Concat, чтобы сохранить независимость каждого отдельного пути от признаков. Ключевая информация по каждому пути динамически засваивается на основе весов α, β и γ, которые определяются как обучаемые скалярные параметры, инициализированные в 1.0 и оптимизированные с помощью обратного распространения во время обучения, что позволяет динамически балансировать вклад из мелких, средних и глубоких путей признаков. Кроме того, сверточные операции применяются для агрегирования контекстной информации, устранения несогласованных ответов на границе признаков, вызванных межуровневым конкатенированием, а также оптимизации получения и уточнения детализированной информации о малых целях. Процесс формулируется с помощью уравнения 13 следующим образом:

figure-protocol-29 (13)

Шаги реализации действий
Определение модуля
В файлах определения модели проекта должен быть определен пользовательский модуль PyTorch под названием TCF. Этот модуль принимает на вход карты признаков мелкого, среднего и глубокого слоёв, извлечённых из различных стадий магистральной сети. Внутренний процесс обработки состоит из трёх основных этапов: (1) Калибровка признаков: функция Sigmoid применяется к каждому из трёх входных слоёв признаков для генерации карт весов, которые затем умножаются по элементам исходными картами признаков для улучшения ключевых признаков при подавлении избыточных; (2) Интерактивное слияние: на стадии слияния признаков среднего слоя вводятся две ветви с обратным весом, которые слияются с откалиброванными мелкими и глубокими слоями соответственно, фильтруя ложную детальную информацию, вызванную шумом в мелких слоях и смещённой семантической информацией в характеристиках глубоких слоёв; (3) Многолучевая агрегация: интегрируются исходные признаки, калиброванные признаки, интерактивные функции и признаки, объединённые с поверхностной и глубокой информацией, после чего применяются свёрточные операции для устранения несогласованных откликов границ признаков, вызванных межуровневым конкатенированием, что в итоге выводит слияющиеся объекты, богатые многомасштабной информацией.

Редактирование конфигурационных файлов
Файл конфигурации модели (config.yaml) должен быть открыт. Должны находиться участки слияния признаков в шейной сети — в частности, слои, где объединяются элементы из разных стадий магистральной сети. В этих позициях исходные простые слои операций конкатенации должны быть заменены вызовом модуля TCF, чтобы обеспечить правильное соединение входов модуля с соответствующими мелкими, средними и глубокими объектами.

Мотивация для дизайна
Дизайн модуля TCF мотивирован проблемами информационного диспропорция и потери информации при слиянии признаков. Поверхностные элементы богаты деталями, но содержат значительный шум, тогда как глубокие характеристики обладают сильной семантикой, но низкое разрешение. Для решения этой проблемы модуль TCF вводит средний уровень в качестве балансировщика информации и включает тщательно продуманные пути калибровки, взаимодействия и агрегации для максимизации дополнительных преимуществ межуровневых признаков. Основная мотивация — создать более эффективный механизм слияния, способный динамически оценивать важность признаков на каждом уровне и избирательно интегрировать информацию. В результате он создаёт высококачественное представление признаков для последующей головки обнаружения, богатое деталями и семантической информацией, что делает его особенно подходящим для распознавания малых объектов.

Модуль DynamicHead
Компонент главы обнаружения выполняет основную функцию — выполняет многомасштабное распознавание объектов на представлениях признаков, генерируемых основной системой и сетями объединения признаков. Этот процесс обеспечивает точную пространственную локализацию обнаруженных объектов, категориальное присвоение и оценку надёжности предсказаний ограничивающих коробок. Учитывая значительные различия в масштабе целевых признаков в визуальных данных и плотную концентрацию предложений ограничивающих коробок в определённых кадрах, точная идентификация нарезанного табака требует анализа многомасштабных шаблонов. Для решения этой проблемы метод использует архитектуруDynamicHead 18 в качестве замены нативной головки обнаружения в YOLOv11n, создавая рамки самоконцентрации, интегрирующие механизмы масштабирования, пространственного и задачного осознания для повышения как возможностей обнаружения, так и операционной эффективности. Структурная конфигурация компонента DynamicHead показана на рисунке 5.

figure-protocol-30
Рисунок 5. Структура модуля обнаружения DynamicHead. Модуль DynamicHead включает три последовательных механизма внимания: осознанный масштабом (πL), пространственный (πS) и осознанный задачей (πC). Эти компоненты динамически корректируют важность признаков в разных масштабах, пространственных регионах и задачах обнаружения. Эта конструкция повышает как точность локализации, так и эффективность классификации, позволяя адаптивно дорабатывать функции внутри головки обнаружения. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Эта архитектура состоит из трёх специализированных единиц внимания: масштабоориентированных компонентов (πL), пространственного осознанного (πS) и компонентов с осознанием задач (πC). Механизм внимания, учитывающий масштаб (πL), сначала усредняет карту входных признаков по пространственным и каналным измерениям. Результат проходит через линейный проекционный слой, за которым следует твёрдая сигмоидная активация для генерации масштабных весов, которые затем умножаются по элементам исходной картой признаков. Пространственно-осознанный механизм внимания (πS) использует деформируемую свёртку с K = 9 редко выбранных точек отбора. Он предсказывает смещённые векторы Δpk и скаляры модуляции Δm k для каждой точки отбора, затем агрегирует выбранные признаки для получения весов пространственного внимания. Механизм внимания, осознанного задачей (πC), независимо применяет изучаемое линейное преобразование к каждому каналу, используя два набора параметров (α1, β1 и α2, β2). Он выбирает максимальный отклик между двумя преобразованными представлениями для динамической адаптации признаков для задач классификации и регрессии. Наконец, эти три механизма внимания применяются последовательно к отображению входных признаков как F_out = πC(πS(πL(F) · F) · F) · F. Механизм с учётом масштаба использует кросс-масштабное взвешивание признаков для адаптивного объединения многоразрешённых представлений, тем самым улучшая чувствительность модели к вариациям размеров. Пространственный компонент реализует региональное взвешивание акцента в отображениях признаков, направляя вычислительный фокус на объекты переднего плана и одновременно подавляя несущественные фоновые помехи. В то же время модуль, ориентированный на задачи, динамически модулирует выходные представления для конкретных целей, совершенствуя как классификационные, так и регрессионные результаты для повышения точности модели и операционной устойчивости. Вычислительная процедура формализована в уравнениях 14–17.

figure-protocol-31 (14)

figure-protocol-32 (15)

figure-protocol-33 (16)

figure-protocol-34 (17)

Здесь WL(F) обозначает представление признаков, обогащённое вниманием, а πL(F), πS(F) и πC(F) соответствуют соответственно масштабным, пространственным и задачно-ориентированным операциям внимания. Преобразование f представляет собой линейный проекционный слой, σ(x) — обработка активации по жёсткой сигмовидной системе, K — количество редко выбранных пространственных точек, pk+Δpk — позиционные корректировки для выделения дискриминальных областей, Δmk — обучаемая мера значимости для пространственной точки pk, а α(F) и β(F)) — это обучаемые параметрические функции, управляющие порогами активации. Среди них K устанавливается на 9 во всех экспериментах, так как это значение обеспечивает достаточное пространственное покрытие при сохранении вычислительной эффективности.

Шаги реализации действий
Определение модуля
В файлах определения модели проекта должен быть определен пользовательский модуль PyTorch под названием DynamicHead. Реализация этого модуля состоит из трёх единиц внимания, применяемых последовательно: (1) Внимание с учётом масштаба: слои признаков на разных масштабах динамически взвешиваются с использованием обучаемых параметров; (2) Пространственное внимание: основываясь на концепции деформируемой свёртки, этот блок фокусируется на редких, но различительных пространственных расположениях в картах объектов; (3) Внимание к задачам: пороги активации динамически изучаются для оптимизации представлений признаков для задач классификации и регрессии соответственно. Эти три механизма внимания последовательно применяются к пирамиде входных признаков, в конечном итоге создавая признаки для предсказания. Все модули реализовывались с использованием стандартных операций PyTorch, включая сверточные слои, линейные слои, функции активации и механизмы внимания, описанные выше.

Редактирование конфигурационных файлов
Файл конфигурации модели (config.yaml) должен быть открыт. Должна находиться секция, определяющая головку обнаружения. Исходная конфигурация головки обнаружения, которая обычно состоит из серии сверточных слоёв для классификации и регрессии, должна быть заменена вызовом модуля DynamicHead, чтобы его вход был связан с выходом пирамиды признаков через сеть грифа.

Мотивация для дизайна
Традиционные головки обнаружения обычно применяют одинаковый набор сверточных параметров ко всем слоям признаков, пространственным расположениям и задачам, при этом не обладая адаптивностью к конкретным задачам. Введение модуля DynamicHead мотивировано сложностью задач обнаружения, направленным на разлучение и решение этих задач через единую архитектуру, основанную на внимании. Его мотивация проектирования тройка: (1) адаптивно сосредоточиться на уровнях признаков, соответствующих целям разного размера, через модуль с учетом масштаба; (2) концентрировать вычислительные ресурсы на передних целевых областях, а не на заднем плане через пространственный модуль; и (3) динамической оптимизации представлений признаков для конкретных целей классификации и регрессии с помощью модуля, ориентированного на задачи. Это сочетание разъединения и динамической оптимизации повышает точность локализации и надёжность классификации модели для плотно расположенных, многомасштабных целей, таких как нарезанный табак.

Индивидуальный метод оценки упорядочения обрезаного табака
Описание модуля и принцип проектирования: Количественная оценка упорядочённости выравнивания нарезанного табака крайне важна для оценки стабильности производственного процесса и прогнозирования качества конечной продукции в производстве сигарет. Традиционные методы оценки основаны на ручном визуальном осмотре, который субъективный, трудоёмкий и не способен обеспечить последовательные количественные измерения. Для устранения этих ограничений используется индивидуальный метод прогнозирования углов, интегрированный с усовершенствованным одноступенчатым регрессионным детектором. Основной принцип этого метода заключается в создании пространственной опорной структуры с использованием стальной опоры внутри сигаретной трубки в качестве геометрического ориентира. Поскольку стальная опора сохраняет фиксированную ориентацию во время производства, она служит идеальной опорной линией для расчёта относительной ориентации отдельного нарезанного табака. Измеряя абсолютные углы обнаруженного огранённого табака и стальной опоры относительно горизонтальной опорной линии, а затем вычисляя их относительные угловые различия, метод даёт количественную оценку упорядочённости выравнивания. Относительный угол нуля указывает на совершенный параллелизм между цепью и опорой, тогда как увеличение углового отклонения означает более слабое выравнивание. Горизонтальная опорная ось определяется как линия, параллельная нижнему краю изображения, ориентированная слева направо. Эта ось соответствует 0°, при этом положительные углы измеряются против часовой стрелки, а отрицательные — по часовой стрелке от этой оси. Итоговая метрика упорядочённости получается путем усреднения относительных углов всех обнаруженных нитей внутри изображения, что обеспечивает согласованную и объективную градиацию качества.

Шаги реализации действий
Определение модуля расчёта углов
Реализовать модуль постобработки, который обрабатывает результаты обнаружения из улучшенной одноступенчатой регрессионной модели. Для каждого обнаруженного объекта (разрезанная табак и стальная опора) извлекайте координаты ограничивающих коробок. Вычислите координаты центральной точки для каждого обнаруженного объекта с помощью уравнения 18. Вычислите координаты центральной точки изображения на основе размеров изображения с помощью уравнения 19.

figure-protocol-35
figure-protocol-36(18)

figure-protocol-37
figure-protocol-38(19)

где x₁, x₂, y₁, y₂ обозначают координаты четырёх углов обнаруженной ограничивающей коробки либо для табачной нити, либо для стальной опоры; cx и c y представляют координаты соответствующих центров в области обнаружения; W и h обозначают ширину и высоту изображения сигареты; dx и d y определяют координаты центральной точки изображения.

Вычисление абсолютного угла
Для каждой обнаруженной табачной нити и стальной опоры вычислите вектор от центра изображения к центру объекта. Вычислите абсолютный угол относительно горизонтальной опорной линии с помощью функции арктангенса, как сформулировано в уравнении 20. Угол вычисляется с помощью atan2(d_y, d_x), где atan2 — это четырёхквадрантная обратная касательная функция, доступная в математической библиотеке Python. Эта функция возвращает значения в радиане диапазона (−π, π), которые затем преобразуются в градусы, получая выходные углы в диапазоне (−180°, 180°). Обработка квадранта автоматическая с atan2 на основе знаков d_y и d_x. Это даёт A для стальной опоры и A для каждой табачной нити.

figure-protocol-39 (20)

Расчёт относительного угла
Для каждой обнаруженной табачной нити вычислите относительный угол, вычитая абсолютный угол стальной опоры от абсолютного угла нити, как показано в уравнении 21. Абсолютное значение гарантирует положительные измерения углового отклонения.

figure-protocol-40 (21)

Генерация метрик упорядочённости
Агрегировать относительные углы всех обнаруженных нитей в одном изображении. Вычислим средний относительный угол, суммируя все относительные углы T o и деля на общее число обнаруженных цепочек n, как сформулировано в уравнении 22. Это среднее значение служит количественной мерой упорядочённости выравнивания для этого изображения.

figure-protocol-41 (22)

Реализация качественной оценки
Реализовать функцию классификации, которая отображает рассчитанное значение в качественные оценки на основе заранее заданных порогов, как определено в уравнении 23. Пороги оценки (0°–30° = Отлично, 30–60° = Хорошо, >60° = Плохо) были установлены на основе консультаций с тремя экспертами по контролю качества из Longyan Tobacco Industry Co., Ltd. Эти эксперты независимо оценили 200 образцов изображений и сопоставили рассчитанные средние относительные углы с воспринимаемым качеством выравнивания, используя трёхкатегорийную шкалу (Отлично, Хорошо и Плохо). Границы по углам 30° и 60° были выбраны в качестве консенсусных пороговых границ, когда межэкспертное согласие превышало 90%. Эта оценка позволяет интуитивно интерпретировать количественные результаты для сотрудников контроля качества.

figure-protocol-42 (23)

Редактирование конфигурационных файлов
Файл конфигурации модели (config.yaml или model.yaml) должен быть открыт. Раздел постобработки или настройка вывода должен находиться в конфигурации. Модуль расчёта пользовательского угла должен быть корректно связан и включён. Настройки выходного разбора должны быть проверены для корректного извлечения координат ограничивающих коробок как для нарезанного табака, так и для стальной опоры. Для этого метода оценки не требуется дополнительная вставка слоёв, так как он работает как модуль постобработки после выхода головки обнаружения.

Мотивация для дизайна
Разработка этого метода индивидуальной оценки мотивирована необходимостью преобразовать субъективный визуальный осмотр в объективные, воспроизводимые количественные измерения. Традиционная ручная инспекция страдает от изменчивости между наблюдателями и не может предоставлять непрерывные численные данные для оптимизации процессов. Используя стальную опору как естественный геометрический ориентир внутри сигаретного стержня, метод устраняет необходимость в внешних калибровочных маркерах и обеспечивает согласованность измерений на разных изображениях и производственных партиях. Использование векторов по центру и арктангенциальных вычислений обеспечивает математически надёжный и вычислительно эффективный подход к оценке углов, что делает его подходящим для развертывания в реальном времени. Это векторное вычисление от центра изображения к объектному центру разработано так, чтобы быть инвариантным к полю зрения камеры и положению стрижки на изображении, что обеспечивает устойчивость при различных условиях захвата. Стратегия усреднения по нескольким обнаруженным нитям учитывает естественные вариации ориентации и даёт статистически надёжный общий показатель упорядочённости. Трёхуровневая система оценки превращает непрерывные численные измерения в применимые категории качества, что способствует быстрому принятию решений по контролю качества на производственной линии. В целом этот интегрированный подход сочетает возможности обнаружения усовершенствованной одноступенчатой регрессионной модели с точными геометрическими вычислениями, что позволяет осуществлять комплексную и автоматизированную оценку упорядочения выравнивания табака.

Модельное обучение по определению порядка в резком табаке
PyTorch 2.1.0, Compute Unified Device Architecture (CUDA) 12.1 и все зависимости должны быть корректно установлены. Реализация соответствует стандартным конвейерам PyTorch YOLO и может воспроизводиться на основе подробного описания модулей и этапов конфигурации.

Командование подготовкой
Перед повторным обучением следует подготовить разделённый набор данных изображений и файлы аннотаций в стандартном формате одноступенчатого обнаружения (например, формат YOLO с одним .txt файлом на изображение). Должен быть создан файл конфигурации dataset .yaml, указывающий пути к изображениям, количество классов (поддержка cut tobacco и steel) и имена классов. Исходя из описанных ранее улучшений модели, исходный конфигурационный файл детектора .yaml должен быть заменён предложенным модельным файлом .yaml, который включает модули MFID, TCF и DynamicHead. Скрипт train.py должен быть написан или модифицирован для импорта одноступенчатого пакета детектора, загрузки обучающей модели и конфигурации датасета, а также установки следующих обучающих параметров: imgsz=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10 и т.д. Случайное семя было закреплено на уровне 42, а веса модели инициализировались с использованием стандартной стратегии инициализации, предоставленной фреймворком глубокого обучения. Воспроизводимость обеспечивалась установкой torch.backends.cudnn.deterministic = True и torch.backends.cudnn.benchmark = False.

Гиперпараметры
Ключевые гиперпараметры, настроенные для обучения, следующие: входное разрешение изображения 896 × 1600 пикселей; размер пакета 4, ограниченный памятью GPU; начальная скорость обучения 0,01 с планировщиком косинусного отжига для постепенного распада; оптимизатор стохастического градиентного спуска (SGD) с импульсом 0,912 для ускорения сходимости; и снижение веса 0,0004 для регуляризации. Изображения нормализовались с использованием среднего [0,485, 0,456, 0,406] и стандартного отклонения [0,229, 0,224, 0,225]. Дополнение включало случайное горизонтальное переворот (50%), случайную регулировку яркости (±20%) и случайное поворот (±15°). Мозаичная аугментация по умолчанию включена в ранние обучающие эпохи для повышения устойчивости модели при различных масштабах и окклюзиях. В последние 10 эпох (close_mosaic = 10) он отключается для повышения точности обнаружения.

Мониторинг обучения
Во время обучения фреймворк предоставляет комплексные метрики для каждой эпохи. Функция потерь представляет собой взвешенную сумму трёх компонентов: потери классификации (бинарная перекрестная энтропия [BCE] с логитами), потеря локализации (полное пересечение по объединению [IoU]) и потеря объектности (BCE). Общий вес потери был установлен как λ_cls = 0,5, λ_box = 0,05 и λ_obj = 1,0. Кривые потерь обучения и валидации следует контролировать, чтобы обеспечить устойчивую сходимость и выявить признаки перепригонки. mAP при пороге IoU 0,5 (mAP@0,5) на валидационном наборе используется в качестве основного показателя эффективности для обнаружения срезанных табачных цетей. Учитывая размер набора данных и сложность модели, обучение для 100 эпох обычно достаточно для сходимости. Контрольная точка с лучшей производительностью модели сохраняется автоматически на основе валидации mAP.

Оценка и внедрение модели
Оценка
После завершения обучения оптимальные веса модели сохраняются как runs/train/exp/weights/best.pt. Обучаемая модель должна быть оценена на выделенном наборе валидации с помощью следующей команды: python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Скрипт оценки выводит ключевые показатели производительности, включая точность, отзыв и mAP@0.5, для обоих классов обнаружения (поддержка резаного табака и стали). mAP следует проверить на соответствие требуемому порогу для промышленного внедрения (например, >95% для обнаружения цепей). Порог развертывания (mAP >95% для обнаружения цепей) представляет собой внутреннее требование к производительности для целевой промышленной среды. Опубликованный результат отражает результаты на разнообразном наборе тестов, включающих сложные крайние случаи. MAP модели для рутинных условий производства превышает 96% при оценке на подмножестве, отфильтрованном для идеального освещения и минимальной окклюзии. Рутинная производственная подгруппа определялась по следующим критериям: освещение в диапазоне 500–800 люкс (оптимальное освещение), процент окклюзии менее 10% (минимальное перекрытие) и отсутствие видимых зеркальных отражений. Это подмножество содержит 427 изображений, что составляет примерно 67% тестового набора. Это подмножество соответствует стандартным дневным условиям производства при обычном освещении и хорошо ориентированном расположении нитей.

Проверка выводов
Для визуальной проверки эффективности обнаружения модели на невидимых изображениях вывод выполняется на примерах тестовых изображений с помощью следующей команды: python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Эта команда генерирует аннотированные изображения с ограничивающими рамками вокруг обнаруженных опор от нарезанного табака и стали. Скорость вывода измерялась на видеокарте NVIDIA GeForce RTX 3080 Ti (12 ГБ видеопамяти) с использованием CUDA 12.1 и PyTorch 2.1.0. Сообщаемые кадры в секунду (FPS) рассчитывались как среднее значение более 100 последовательных проходов вперёд после 50 разминок. Кроме того, скорость вывода (в кадрах в секунду) указывается для подтверждения её пригодности в реальном времени для среды развертывания.

Развертывание модели
Для обеспечения развертывания в реальном времени в промышленной системе управления обученная модель PyTorch (best.pt, примерно 7–9 МБ) должна быть экспортирована в оптимизированный формат вывода, такой как TensorRT или Open Neural Network Exchange (ONNX). Это преобразование повышает скорость вывода при сохранении точности обнаружения. Для экспорта ONNX используйте так: torch.onnx.export(model, dummy_input, "model.onnx", opset_version=11, input_names=["images"], output_names=["outputs"]). Для преобразования в TensorRT используйте: trtexec --onnx=model.onnx --saveEngine=model.trt --fp16 --workspace=4096. Режим точности FP16 использовался для оптимизации скорости вывода. Окончательная развернутая модель содержит координаты ограничивающих коробок, метки классов (разрезанная табачная нить, стальная опора) и оценки доверия для каждого обнаруженного объекта, которые служат входными инструментами для индивидуальной оценки углов, используемого для количественной оценки упорядочённости нарезанного табака.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальная среда
Все эксперименты проводились с использованием фреймворка глубокого обучения PyTorch, с подробными аппаратными и программными конфигурациями, изложенными в таблице 1. Всего 634 изображения были случайным образом разделены на обучающую, валидационную и тестовую наборы в соотношении 7:2:1. Во время обучения входные изображения равномерно изменялись до 896 × 1600 пикселей, а начальная скорость обучения была установлена на 0,01. Был...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ключевым преимуществом предлагаемой модели в определении упорядочённости резного табака является баланс между точностью обнаружения и вычислительной эффективностью. Эта задача требует обработки в реальном времени множества мелкозернистых нарезных табаков в изображениях высокого разрешения, что предъявляет строгие требования к точности и скорости моделей. Как показано в Таблице 2, предлагаемая модель достигает наибольшего mAP@0,5 (89,9%) по обнаружению опор из обработанно...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о прямых конкурирующих финансовых интересах. Это исследование проводилось в компании Longyan Tobacco Industrial Co., Ltd., которая предоставила сценарий применения и полевые данные для исследования. Академические авторы не заявляют о финансовых или нефинансовых конфликтах интересов в связи с публикацией этой работы.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было профинансировано проектом по технологии измерения производства для сигарет, не сгорающих в тепле, а также по контролю температуры и влажности окружающей среды (Грант No FJZYKJJH2022YB014).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Считыватель кодовHikvisionID5050Использовался для чтения штрихкодов на поддонах; требует питания 24 В
Набор данных (изображения вырезанного табака)Longyan Tobacco Industrial Co., Ltd.Н/ДПользовательский набор изображений нарезанного табака, используемого для обучения, валидации и тестирования моделей
Фреймворк глубокого обучения (PyTorch 2.1.0)Фонд PyTorchПрограммное обеспечение с открытым исходным кодомИспользуется для разработки и обучения моделей глубокого обучения
Промышленная камераHikvisionMV-CH120-10GCИспользуется для получения изображений; требует питания 24 В
Промышленный компьютерТехнология ЯньчжиPC1010-AX360Используется для обработки изображений, вывода моделей и хранения данных
LED-источник светаHikrobotMV-LRDS-H-95-30-WПолосчатый источник света, обеспечивающий стабильное освещение для съёмки изображений
ОбъективHikvisionMVL-KF0818M-12MPФокусное расстояние: 8 мм; диапазон диафрагмы: F1.8– F16; Разрешение 12 МП
Металлические кронштейныLongyan Tobacco Industrial Co., Ltd.Алюминиевый сплав 7075-T6Используется для монтажа и стабилизации аппаратных компонентов
Сетевые кабелиLongyan Tobacco Industrial Co., Ltd.Кристальная головка RJ45Используется для подключения промышленных компьютеров, камер и сетевых устройств
Python (версия 3.9)Фонд программного обеспечения PythonПрограммное обеспечение с открытым исходным кодомСреда программирования для реализации
ПереключательTP-LinkTL-SH10058 Ethernet-портов; требует питания 220 В
Беспроводная точка доступа (модуль промышленной связи)Шаньдун Хуачуан СюньляньBH-ANT5158S-14HV; BH-MS-AC1600HWHОбеспечивает беспроводную связь между камерой и промышленным компьютером
Программное обеспечение управления камерой (MVS)HikvisionV4.5.1Используется для отладки камеры, настройки параметров и сбора данных
Программное обеспечение для обработки зрения (Vision Master)HikvisionV4.3.0Используется для сопоставления шаблонов и обнаружения результатов изображений
Интегрированная среда разработки (PyCharm)JetBrains2020.1.3 x64Используется для разработки моделей и реализации системы
CUDA Toolkit (версия 12.1)NVIDIAПрограммный набор инструментов (без каталожного номера)Позволяет GPU ускорять для обучения и вывода

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи