Исследовательская статья

Модель обнаружения объектов в реальном времени для идентификации бренда сигарет на основе улучшенной одноступенчатой регрессионной архитектуры

DOI:

10.3791/69657

9 января 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для решения таких проблем, как окклюзия и изменения освещения в автоматизированных складах, в данной статье представлена улучшенная одноступенчатая регрессионная архитектура для определения бренда сигаретных коробок. Интегрируя адаптивное даунсэмплинг, инвертированный эффективный многомасштабный механизм внимания и динамическую головку обнаружения, предлагаемая модель достигает точного интеллектуального инвентаризации в реальном времени.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Визуальное распознавание автоматического инвентаря сигарет сталкивается с серьёзными препятствиями, такими как изменения освещения, разнообразие размеров коробок и частичная окклюзия элементов, что усложняет проверку бренда и обнаружение ошибок коробок. В этой статье предлагается улучшенная модель обнаружения в реальном времени для решения проблем распознавания изображений и повышения точности. Во-первых, адаптивный модуль понижения дискретизации внедряется для замены модуля свёртки понижения дискретизации как в основной, так и в шейной сетях серии YOLO в качестве базового или оригинального детектора, который эффективно сохраняет больше деталей характеристик и обеспечивает лёгкость модели. Во-вторых, внедряется инвертированный эффективный многомасштабный модуль внимания, который собирает пространственную контекстную информацию разных масштабов и создаёт более точную карту пространственного внимания, что повышает точность прогнозирования базовой модели для сложных объектов и целей окклюзии. Наконец, динамический модуль головы обнаружения заменяет исходную головку обнаружения базовой модели и выполняет многомасштабное обнаружение объектов на карте объектов, извлечённой из магистрали и шейной сетей, для достижения точного позиционирования и распределения категорий предсказанной цели. Для оценки эффективности улучшенной модели в полевых условиях мы создали визуальный набор данных бренда сигаретных коробок. Набор данных был дополнен с использованием регионально-специфичных методов копирования-вставки и традиционных методов аугментации, а полученный набор включает сложный фон, окклюзию и перекрытие, малую цель и другие факторы. Эксперимент демонстрирует, что улучшенная модель, представленная в этой статье, эффективно соответствует требованиям для обнаружения в реальном времени в полевых условиях. Предлагаемая модель достигает mAP 97,9% с параметрами и FLOPами 1 849 679 и 5,1 G соответственно. По сравнению с базовой моделью, предлагаемая модель улучшает mAP на 0,9%, уменьшая параметры на 28,78% и операции с плавающей запятой на 1,4 G. Кроме того, модель достигает скорости вывода 38,5 FPS, что удовлетворяет требованиям для промышленного обнаружения в реальном времени.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Современное производство и логистика в значительной степени опираются на автоматизированные системы хранения и извлечения (AS/RS)1 для достижения высокоплотного хранения, эффективного обращения с материалами и точного управления запасами. AS/RS стал ключевым инструментом, который помогает предприятиям повысить эффективность складов и снизить затраты благодаря своей высокой эффективности и интеллектуальным характеристикам. С базой многоуровневых полок и различного оборудования для погрузки и разгрузки, AS/RS представляет собой компьютерно управляемую мехатроническую систему, интегрирующую множество технологий, включая механику, электронику, информатику, связь, сети, датчики и автоматическое управление 2,3. AS/RS обеспечивает эффективное, точное и безопасное хранение и обращение с товарами за счет интеграции и оптимизации полок, кранов-штабелеров, конвейерных линий, систем управления и другого оборудования, что значительно повышает эффективность хранения. Интеграция компьютерного зрения в AS/RS, ключевой аспект Индустрии 4.0, обеспечивает беспрецедентный уровень автоматизации и интеллекта, позволяя системам видеть и принимать решения на основевизуальных данных 4.

С широко распространением AS/RS на табачныхфабриках предложено новое требование по инвентаризации брендов табачных коробок. Традиционные ручные методы инвентаризации страдают от неэффективности, высокого уровня ложного обнаружения и опасностей безопасности, которые не соответствуют требованиям AS/RS. С постоянным развитием технологий компьютерного зрения решения машинного зрения всё чаще применяются в области промышленнойинспекции 6, 7 и 8. Поскольку на каждой коробке сигарет печатается информация о бренде с уникальными узорами и текстом, технология распознавания изображений на основе машинного зрения позволяет идентифицировать и вести инвентаризацию брендов сигаретных коробок.

С 2012 года алгоритмы обнаружения объектов на основе глубокого обучения принесли значительные прорывы в распознаванииизображений 9,10,11. От ранних двухступенчатых моделей обнаружения объектов, таких какR-CNN 12, до современных одноступенчатых моделей обнаружения объектов, доминируемых моделями серии YOLO в качестве базового или оригинальногодетектора 13,14,15, эти подходы внесли значительный вклад в развитие алгоритмов обнаружения объектов. Интеллектуальные задачи инвентаризации всё чаще используют модели обнаружения объектов для точного определения и точного определения нескольких целей на изображениях или видео. Ли и др.16 предложили интеллектуальный метод инвентаризации, объединяющий датчики взвешивания и технологию распознавания изображений для повышения эффективности и точности инвентаризации. Ванг и др.17 использовали маску R-CNN для сегментирования номера книжной полки и позиции названия от изображения корешка книги. Сан и др. 18 разработали интегрированную систему визуального распознавания, которая использовала OpenCV для распознавания двумерных кодов на материалах и полках в многорежимном режиме. Они оптимизировали оригинальный детектор (v5s), внедрив механизм внимания C3CBAM и присвоение меток SimOTA для улучшения функций потерь для точного обнаружения многокомпонентных материалов.

В области обнаружения объектов, хотя двухступенчатые модели — представленные Faster R-CNN — обладают традиционными преимуществами в точности обнаружения, их сложные механизмы генерации предложений регионов приводят к относительно низким скоростям вывода. В результате им сложно соответствовать строгим требованиям к производительности в реальном времени в промышленныхсценариях 19,20. В отличие от этого, регрессионная архитектура рассматривает обнаружение объектов как единую регрессионную задачу, напрямую предсказывая расположение целей и вероятности категорий по входным изображениям. Такой архитектурный дизайн позволяет моделям значительно превосходить большинство двухступенчатых моделей по эффективности вывода, лёгкости и гибкости развертывания, при этом сохраняя конкурентную точность. Таким образом, эта архитектура стала предпочтительным решением для промышленного обнаруженияв реальном времени 21.

Оригинальная экосистема моделей продолжает быстро развиваться, а современные варианты решают конкретные задачи. Например, оригинальный детектор(v12)22 направлен на дальнейшее улучшение оптимизации времени обучения и архитектурной доработки для повышения баланса точности и эффективности. В то же время оригинальный детектор (World)23 вводит возможности обнаружения с открытым словарным запасом, позволяя в реальном времени делать выводы о широком спектре объектов за пределами обучающих категорий, используя моделирование языка зрения. Хотя эти достижения расширяют границы универсального обнаружения объектов, данная работа сосредоточена на специализированном промышленном применении, где устойчивость к конкретным проблемам, таким как частичная окклюзия и дисперсия освещения, имеет первостепенное значение, а пространство категорий фиксировано и известно априори. Будучи самой горячей версией этого семейства, базоваямодель 24 наследует преимущества от оригинального детектора(v8)25,26; Это не только уменьшает количество параметров модели, но и учитывает баланс между эффективностью обнаружения и точностью. По сравнению с другими моделями обнаружения объектов, он выделяется в задачах визуального распознавания.

Задача обнаружения маленьких или частично закрытых коробок сигарет является проявлением более широкой проблемы компьютерного зрения. Обнаружение малых объектов активно изучается, подходы варьируются от усовершенствований сети пирамиды признаков(FPN) 27 до контекстно-ориентированных механизмов внимания, которые вдохновляют интеграцию многомасштабной обработки признаков. Кроме того, стремление к операционной эффективности в промышленной среде требует разработки лёгкой модели. Вдохновлённые эффективными архитектурными концепциями, исследованными в MobileNetV328 иGhostNet 29, эти концепции используют глубокую свёртку и линейное преобразование для снижения вычислительной сложности при сохранении возможности презентации, поэтому мы выбираем несколько лёгких модулей для улучшения модели. Поэтому, чтобы рассмотреть инвентаризацию брендов сигаретных коробок и влияющие факторы, такие как изменения освещения, различия в размерах признаков различных брендов и частичная окклюзия между коробками, мы предлагаем в этой статье усовершенствованную одноступенчатую архитектуру регрессии модель обнаружения объектов.

Основные инновации предлагаемой модели тройные. Во-первых, модуль Adaptive Downsampling (ADown)30внедряется для замены стандартного сверточного даунсэмплинга как в магистральной, так и в шейной сетях. Этот инновационный дизайн снижает потерю информации при сжатии функций, что критически важно для сохранения логотипов и текста малых брендов. Во-вторых, внедряется инвертированный механизм эффективного многомасштабного внимания (iEMA), который обеспечивает модель динамическим, многомасштабным контекстуальным восприятием, значительно повышая её работу на небольших и частично закрытых сигаретных коробках. В-третьих, оригинальная головка обнаружения заменена модулемDynamicHead 31 , который объединяет масштабное, пространственное и задачное внимание, обеспечивая более точную локализацию и классификацию по целям значительно разного размера. Эти архитектурные изменения согласованно разработаны для решения специфических проблем идентификации брендов сигарет в промышленных условиях.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Набор данных, использованный в этой статье, был приобретён из поля AS/RS отдела логистики компании Longyan Tobacco Industry Co., Ltd. В этом исследовании не участвовали люди или животные. Этическое одобрение не требовалось.

Сбор и настройка наборов данных
Аппаратная конфигурация: Установите промышленную камеру (например, MV-CA013-A0GM) с объективом фокусного расстояния 8 мм (например, MVL-HF0828M-6MPE) на грузовую платформу крана-стекера. Подключите камеру к управляющему ПК через кабель GigE и беспроводное устройство точки доступа (например, BH-ANT5158S-14HV, BH-MS-AC1600HWH). Разместите ленточную светодиодную лампу (например, MV-LLDS-1002-38-W) вокруг камеры для обеспечения равномерного освещения.

Настройка параметров камеры: Настройте камеру с помощью программного обеспечения производителя (например, MVS). Установите разрешение получения на 1280 x 1024 пикселя. Установите режим спуска на Hardware Trigger и синхронизируйте его с системой позиционирования крана стекера. Установите время экспозиции на 100 мс и усиление на 5 дБ, чтобы минимизировать размытие движения и шум. Рабочее расстояние между камерой и сигаретными коробками составляет примерно 550 мм.

Коллекция изображений: промышленная камера с триггером автоматически захватывает изображение при размещении лотка во время хранения и извлечения коробок сигарет. Соберите всего 4 835 RAW; типичные изображения показаны на рисунке 1.

Аннотация изображения: Используйте инструмент с открытым исходным кодом LabelImg. Для каждого изображения нарисуйте ограничивающие рамки вокруг каждого видимого элемента бренда сигарет. Присваивайте правильное название бренда (например, Hongzhuang, Gutian) в качестве классовой метки для каждого ограничивающего рамки. Сохраняйте аннотации в стандартном формате одноступенчатого обнаружения, с одним txt-файлом на каждое изображение.

Контроль качества: второй аннотатор проверяет случайно выбранные 20% аннотированных изображений. Любые несоответствия обсуждаются и устраняются, обеспечивая согласованность маркировки.

Стратегия дополнения данных
В этом разделе подробно описаны как традиционные, так и продвинутые методы аугментации, применяемые к наборам данных. Начальные данные и дополненные данные объединяются в новый набор данных, который затем делится на обучающий набор, набор валидации и тестовый набор для обеспечения справедливости оценки.

Традиционное дополнение данных32: Эти преобразования применяются в реальном времени обучающим конвейером (например, с использованием библиотек Albumentations или PyTorch Transforms) с определённой вероятностью для каждой партии.

Геометрические преобразования: Вращение: Случайное поворот изображений под углом от -45° до +45°. Масштабирование: Случайное масштабирование изображений в диапазоне от 0,8 до 1,2 раза. Горизонтальный переворот: случайным образом переворачивайте изображения горизонтально с вероятностью 100%. Случайное обрезывание: случайным образом обрезайте участок от 80% до 100% исходной площади изображения.

Фотометрические преобразования: яркость и контраст: Регулировать яркость и контраст случайным образом из [0.6, 1.4]. Гауссов шум: Добавьте гауссовский шум со стандартным отклонением, случайным образом выбранным от [0, 0,01 * 255] до 10% изображений. Гауссовское размытие (Gaussian blur) с размером ядра от 3x3 до 10% изображений.

Симуляция окклюзии: случайным образом разместите от 1 до 3 прямоугольных участков окклюзии (покрывающих до 5% площади изображения) на изображениях. Эти участки заполнены случайным шумом или средними значениями пикселей изображения.

Расширенное дополнение данных: региональное копирование и вставка
Мотивация и влияние: Основной целью этого целевого увеличения было решение критической проблемы данных: у некоторых брендов сигарет было очень мало экземпляров (всего одно изображение). Стандартный случайный сплит теста проверки поездов может потенциально выделить все экземпляры редкого бренда в один набор (например, все в тестовый набор), в результате чего модель не имеет возможности изучать или проверять этот бренд. Этот метод искусственно увеличил размер выборки для этих недостаточно представленных брендов, обеспечивая достаточное количество экземпляров, распределённых по обучающим, валидационным и тестовым наборам. Этот фундаментальный шаг предотвращает катастрофические сбои в редких категориях и является необходимым условием для значимой производительности модели и обобщения по полному набору брендов.

Этот этап требует предварительно обученной сегментной базовой модели на начальном наборе данных и модели Segment Anything (SAM)33.

Объекты источника сегментов: Для изображений коробок сигарет от недостаточно представленных брендов используйте модель SAM для создания точных сегментационных масок. Используйте режим подсказки, кликнув по функции бренда коробки сигарет для запуска сегментации. Ручную валидацию и доработку сгенерированных масок для обеспечения точности. Сохраните сегментированные изображения коробок сигарет с прозрачным фоном в формате PNG. Это создаёт библиотеку изолированных экземпляров объектов.

Генерируйте фоновые маски: Используйте заранее обученную сегментальную базовую модель для сегментации экземпляра на наборе фоновых изображений (изображения с достаточным свободным пространством или простые фоны). Модель будет выводить бинарные маски, показывающие области, уже занятые объектами.

Обработка масок и вставка объектов: для каждой фоновой маски используйте библиотеку OpenCV (функция 'cv2.approxPolyDP' с эпсилонным коэффициентом 0,02 * контурного периметра) для подгонки кривой и линеаризации рёбер маски, получая упрощённое многоугольное представление свободного пространства. Определите самую большую непрерывную область полигона внутри фоновой маски как область целевой пасты. Случайным образом выберите сегментированный исходный объект из библиотеки. Измените размер (сохраняя соотношение сторон) и примените аффинное преобразование (небольшое вращение между -5° и +5°, небольшое сдвиг), чтобы естественно вписаться в целевой область пасты, чтобы она не перекрывалась с границами существующих объектов. Используйте альфа-смешивание, чтобы плавно вставить преобразованный объект на фоновый образ в рассчитанном месте. Общая структура технологии дополнения данных, основанная на методе копирования-вставки в конкретных областях, показана на рисунке 2. Программно генерируйте соответствующий новый файл аннотации txt для вставленного объекта, обновляя координаты ограничивающих рамок и метку класса.

Окончательный дополненный набор данных: этот офлайн-процесс генерирует 600 новых синтетических изображений. Комбинируйте их с исходными 4 835 изображениями и ещё 1 167 изображениями, полученными с помощью традиционных технологий увеличения, описанных выше, чтобы получить окончательный набор из 6 602 изображений. Разделите итоговый набор данных на обучающие (70%, 4 621 изображение), валидацию (20%, 1 320 изображений) и тестовые (10%, 661 изображение), чтобы изображения из той же оригинальной последовательности оставались в одном разделе для предотвращения утечки данных.

Модификация модели для создания предлагаемого улучшенного детектора
Оптимизированные алгоритмы обнаруженияобъектов 34 добились заметного прогресса в промышленной инспекции за последние годы. В этом разделе представлена подробная, пошаговая процедура модификации архитектуры базовой модели для создания предлагаемой модели. Модификации реализуются путём редактирования конфигурационного файла модели (например, config.yaml) и обеспечения включения соответствующих определений пользовательских модулей в кодовую базу. Объяснение каждой модификации приводится для разъяснения её роли в решении конкретных задач обнаружения. Структура предлагаемой модели показана на рисунке 3.

Замена модулей понижения дискретизации на модуль ADown: Стандартный модуль Convolution-BatchNorm-SiLU (CBS), используемый для понижения дискретизации, использует одноступенчатую свёртку, которая может служить информационным узкимместом 35, потенциально исключая мелкие детали, важные для распознавания маленьких коробок сигарет и детализированных логотипов брендов. Модуль ADown разработан для облегчения этой проблемы путём реализации структуры с двумя ветвями, которая захватывает и сохраняет более богатый набор признаков при сокращении пространственного разрешения. Одна ветвь уделяет приоритетное внимание сохранению локальных деталей высокой частоты, а другая охватывает более широкую и насыщенную контекстом обзор. Слияние этих дополняющих признаков приводит к более прочному и информативному представлению для последующих слоёв.

Шаги реализации действий
Определение модуля: Убедитесь, что пользовательский модуль PyTorch под названием ADown определен в файлах определения модели проекта. Этот модуль должен содержать две параллельные ветви. Первая ветвь должна состоять из двумерного слоя свёртки с ядром 3x3 и шагом 2. Вторая ветвь должна последовательно состоять из слоя максимального пула 2x2 (с шагом 2), за которым следует слой свёртки 1x1. Выходы этих двух ветвей должны быть объединены вдоль размера канала, а полученная карта признаков затем проходит через последний слой свёртки 1x1 для интеграции каналов и получения выхода. Структура модуля ADown показана на рисунке 4.

Редактирование конфигурационных файлов: Откройте базовый конфигурационный файл модели (config.yaml). Систематически идентифицируйте каждый экземпляр модуля CBS, настроенный для понижения дискретизации (то есть параметр шага установлен в 2). Замените каждый из этих модулей CBS новым модулем ADown.

Мотивация дизайна: Дизайн ADown мотивирован необходимостью минимизировать потерю информации в стандартных ступенчатых свертках, которые могут быть вредными для небольших объектов. Её структура с двумя ветвями вдохновлена идеей параллельной обработки для захвата как высокочастотных пространственных деталей (с помощью свёртки), так и низкочастотной контекстной информации (через пулирование), что обеспечивает более богатое многомасштабное представление признаков для последующих слоёв.

Интеграция модуля iEMA
Обоснование и принцип проектирования: Для повышения способности модели обнаруживать малые и частично скрытые цели необходимо включить механизм, способный эффективно моделировать многомасштабный пространственный контекст. Модуль iEMA достигает этого путём встраивания компонента эффективного многомасштабного внимания (EMA)36 в структуру инвертированного остаточного блока (iRMB)37 . iRMB обеспечивает вычислительно эффективную основу с использованием глубинно разделяемых сверток, тогда как компонент EMA явно фиксирует межмасштабные пространственные взаимодействия с помощью параллельного многоветвного дизайна. Эта интеграция позволяет модели динамически перекалибровать веса признаков, фокусируя внимание на наиболее разборчивых пространственных областях на разных масштабах, тем самым улучшая распознавание при окклюзии и для небольших объектов.

Шаги по реализации действий
Определение модуля: Убедитесь, что определен пользовательский модуль PyTorch с именем iEMA. Этот модуль должен сначала реализовать инвертированный остаточный блок. Этот блок обычно начинается с точечной свёртки для расширения канала, затем с глубинной свёрткой (например, 3x3) для извлечения пространственных признаков и, наконец, с поточечной свёрткой для проекции канала. Сразу после этого блока следует внедрить механизм внимания EMA. Механизм EMA обычно использует сгруппированные свёртки и межмерные взаимодействия для эффективного создания многомасштабной пространственной карты внимания без чрезмерных вычислительных затрат. Структура модуля iEMA показана на рисунке 5.

Редактирование конфигурационных файлов: В конфигурационном файле config.yaml найдите разделы, определяющие сеть шеи, а именно слои, непосредственно следующие за модулями C2f. В этих стратегических точках вставьте новый слой, который вызывает модуль iEMA.

Мотивация проектирования: модуль iEMA основан на принципе повышения различия признаков путём интеграции локального извлечения признаков (с помощью глубинной свёртки) с лёгким, но эффективным механизмом глобального моделирования контекста (EMA). Такой гибридный подход позволяет модели адаптивно фокусироваться на информативных областях на разных масштабах, что крайне важно для распознавания частично видимых логотипов и текста брендов.

Замена головки обнаружения на модуль DynamicHead
Обоснование и принцип проектирования: Оригинальная головка обнаружения может не оптимально справляться с существенными вариациями масштабов сигарет и сложной взаимосвязью задач локализации и классификации. Модуль DynamicHead решает эту проблему, объединяя три формы внимания в когерентную структуру: осознанное масштабирование, пространственное осознание и внимание к задаче. Компонент, учитывающий масштаб, динамически объединяет признаки с разных уровней пирамиды признаков, обеспечивая эффективное представление объектов всех размеров. Пространственный компонент использует стратегию разрежённой выборки для фокусировки вычислительных ресурсов на наиболее информативных областях в картах признаков. Компонент, ориентированный на задачи, адаптирует представление признаков специально для конкретных целей регрессии ограничивающих коробок и классификации категорий. Такой унифицированный подход приводит к более точным и надёжным прогнозам.

Шаги по реализации действий
Определение модуля: Это комплексный модуль, охватывающий три механизма внимания, описанные уравнениями (1) по (4). Внутренняя структура будет включать слои для вычисления масштабных весов, выполнения деформируемого пространственного внимания и применения специфических преобразований признаков, специфичных для задач.

Уравнение 1(1)

Уравнение 2(2)

Уравнение 3(3)

Уравнение 4(4)

Где WL(F) обозначает окончательное отображение признаков, уточнённое вниманием, полученное последовательно применением механизмов осознанного масштаба π L(F), пространственного осознанногоπ S(F) и задачно-осознанного πC(F) внимания к входной признаку F. Конкретно, в уравнении (2) πL(F) вычисляет вес внимания по шкале, сначала усредняя пространственные (S) и канальные (C) измерения, пропуская его через линейную функцию f(⋅) и жёсткую сигмоидную активацию σ(⋅). В уравнении (3) πS(F) выполняет разрежённое пространственное внимание, агрегируя признаки из K, выбранных ключевых точек pk, каждая с обучаемым смещением Δpk для фокусировки на дискриминативных областях и скаляром важности Δmk. В уравнении (4) πC(F) реализует задачно-осознанное внимание, применяя линейное преобразование (управляемое изученными параметрами (α1, β1,α 2,β 2)) к каждому каналу и выбором максимального отклика, что позволяет руководителю специализироваться на задачах классификации и регрессии. Структура модуля DynamicHead показана на рисунке 6.

Редактирование конфигурационных файлов: в файле config.yaml найдите раздел, определяющий голову модели, который изначально содержал модуль Detect. Замените его новой записью, которая вызывает модуль DynamicHead.

Мотивация дизайна: модуль DynamicHead основан на наблюдении, что головки обнаружения объектов должны быть адаптивны к масштабу, пространственному расположению и задаче. Её единая система внимания, формализованная в эквалайзерах. (1-4), позволяет модели динамически перекалибровать, что откликается на признаки на основе этих трёх измерений, что приводит к более надёжным прогнозам относительно вариаций масштаба и фоновых помех.

Обучение моделям
Убедитесь, что PyTorch 2.1.0, CUDA 12.1 и все зависимости установлены.

Командование подготовкой
Перед повторным обучением подготовьте разделённые изображения и аннотационные данные в стандартном одноступенчатом формате обнаружения. Создайте .yaml-файл, содержащий путь изображения и категорию данных. Согласно улучшению модели, исходный файл детектора .yaml заменяется на предложенный файл модели .yaml. Напишите train.py-файл, импортируйте пакет одноступенчатого детектора, загрузите обучающую модель и путь данных, а также установите некоторые параметры обучения, включая imgze=640, epochs=100, batch=4, workers=0, device='0', optimizer='SGD', close_mosaic=10 и т.д.

Гиперпараметры: ключевые параметры: размер входного изображения (640 x 640), размер пакета (4), начальная скорость обучения (0,01) с помощью планировщика косинусного отжига, оптимизатор SGD с импульсом (0,937) и снижение веса (0,0005). Мозаичное усиление включено по умолчанию.

Мониторинг обучения: Процесс обучения будет выдавать метрики для каждой эпохи. Следите за кривыми для потерь в обучении/валидации и mAP при 0,5, чтобы обеспечить сходимость и избежать перенагона. Обычно достаточно тренировки на протяжении 100 эпох.

Оценка и внедрение модели
Оценка: После тренировки лучшая модель сохраняется как runs/train/exp/weights/best.pt. Оценивайте это на наборе val, используя : bash python val.py --data cigarette_dataset.yaml --weights runs/train/exp/weights/best.pt. Скрипт будет выводить Precision, Recall, mAP на 0.5 и т.д. Убедитесь, что mAP соответствует необходимому порогу (например, 97,9%).

Вывод для верификации: запустить вывод на образцах изображений для визуальной проверки результатов обнаружения: bash python detect.py --weights runs/train/exp/weights/best.pt --source path/to/test/images --conf 0.5. Проверяя рассуждение, можно получить результаты обнаружения каждого изображения и скорость обнаружения модели.

Развертывание: Для развертывания в реальном времени в системе стекера-крана преобразите модель PyTorch (best.pt, ~4,7 МБ) в формат, например TensorRT или ONNX, для оптимальной скорости вывода. Итоговый результат — это ограничивающие рамки с метками классов (брендовыми названиями) и оценками доверия.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Экспериментальная среда и настройка параметров
Эксперименты для проверки эффективности предлагаемой модели проводились на фреймворке глубокого обучения PyTorch, а детали экспериментальной среды приведены в таблице 1. Здесь мы использовали специальный набор данных, содержащий 6 602 изображения, случайным образом разделённый на обучающий, валидационный и тестовый наборы в соотношении 7:2:1. Все эксперименты использовали входные изображения с разрешением 640 x 640 с начальной скоростью о...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Компромисс точности и эффективности
Ключевым достижением этой модели является её превосходный баланс между точностью и вычислительной эффективностью. Как показано в Таблице 2, представленная модель достигает наибольшего mAP, одновременно обладая наименьшим числом параметров и вторым по величине FLOP среди сравниваемых одноступенчатых детекторных моделей. Это напрямую приводит к практическим преимуществам: меньшая модель быстрее развёртается, требует м...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы не заявляют о прямых конкурирующих финансовых интересах. Это исследование проводилось в сотрудничестве с Longyan Tobacco Industrial Co., Ltd., где работают авторы Хунли Дэн и Вэньцань Ли, а также с фабрикой сигарет Baoji, где работает автор Баобин Ло. Эти аффилиации предоставили сценарий применения и полевые данные для исследования. Академические авторы (Цзюнь Лю, Цзянгуан И, Фэн Ян, Сяобо Чжао) не заявляют о финансовых или нефинансовых конфликтах интересов в связи с публикацией этой работы.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была финансово поддержана методом измерения температуры литья заготовки на основе предшествующего отражателя и многоволновой (No LZY24E050002), финансируемым совместными средствами Чжэцзянского провинциального фонда естественных наук Китая, а также онлайн-методом измерения температурного поля для незакрытой и неизотермальной полости половника (No 2023K231), финансируемым проектом планирования науки и технологий Цюйчжоу.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Считыватель кодовHikvisionID5050Оборудование Hikvision: используется для считывания штрихкодов на паллетах, нужно подключить источник питания 24V
Промышленная камераHikvisionMV-CA013-A0GM, MV-CS016-10GMНужно подключить блок питания 24V
LED-лампаHIKROBOTMV-LLDS-1002-38-WИсточник света диаметром один метр обеспечивает достаточные условия освещения для камеры
ОбъективHikvisionMVL-HF0828M-6MPEфокусное расстояние: 8 мм, диапазон диафрагмы: F2.8~F16, пикселей: 6 миллионов
MVSHikvisionV4.5.1Программное обеспечение Hikvision: используется для отладки камер, настройки параметров камеры и сбора данных
ПичармJetBrains2020.1.3 x64Используется для обучения моделей глубокого обучения и разработки систем обнаружения
Несколько металлических кронштейновLongyan Tobacco Industrial Co., Ltd.Алюминиевый сплав 7075-T6Используется для ремонта камер и считывателей кодов
Несколько сетевых кабелейLongyan Tobacco Industrial Co., Ltd.Кристальная головка RJ45Подключите базовую станцию между промышленным компьютером и беспроводной точкой доступа, подключите камеру и коммутатор и так далее
СвиктTP-LinkTL-SH1005Существует 8 Ethernet-кабельных интерфейсов, требующих питания 220 В
Мастер ВиденияHikvisionV4.3.0Программное обеспечение Hikvision: используется для сопоставления шаблонов и обнаружения результатов изображений
Беспроводное устройство точки доступаШаньдун ХуачуансюньляньBH-ANT5158S-14HV, BH-MS-AC1600HWHИз-за крупномасштабного перемещения, необходимого для кран-стекера, сетевой кабель не может подключить камеру к промышленному компьютеру, и для обеспечения бесперебойной работы сети камер требуется беспроводное устройство точки доступа

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Chen, C., Liu, J., Yin, H., Huang, B. A Vision-Based Method for Detecting the Position of Stacked Goods in Automated Storage and Retrieval Systems. Sensors. 25 (10), 2623(2025).
  2. Yu, X., Liao, X., Li, W., Liu, X., Tao, Z. Logistics automation control based on machine learning algorithm. Cluster Comput. 22 (Suppl 4), 14003-14011 (2019).
  3. Liu, J., et al. Benders decomposition for the multi-agent location and scheduling problem on unrelated parallel machines. Soft Computing. 29 (1), 195-212 (2025).
  4. Haffner, O., Kuˇcera, E., Rosinová, D. Applications of Machine Learning and Computer Vision in Industry 4.0. Appl. Sci. 14 (6), 2431(2024).
  5. Bo, Q., et al. Formulation of receiving/retrieving strategy for automatic high rack finished cigarette warehouse. Tobacco Sci Technol. 57 (6), 92-98 (2024).
  6. Voulodimos, A., Doulamis, N., Doulamis, A., Protopapadakis, A. Deep learning for computer vision: A brief review. Computat Intell Neurosci. 2018 (1), 7068349(2018).
  7. Khan, A. I., Al-Habsi, S. Machine learning in computer vision. Proc Comp Sci. 167, 1444-1451 (2020).
  8. Xu, S., et al. Computer vision techniques in construction: a critical review. Arch Computat Meth Eng. 28 (5), 3383-3397 (2021).
  9. Xu, P. Progress of Object detection: Methods and future directions. Second IYSF Acad Sympos Artif Intell Comp Eng SPIE. 12079, 530-542 (2021).
  10. Sreelakshmi, P. R., Swaraj, K. P. Occlusion resilient object detection under various situations using deep learning techniques: A review. AIP Conf Proc AIP Publishing LLC. 3037 (1), 020042(2024).
  11. Rich feature hierarchies for accurate object detection and semantic segmentation. Girshick, R., Donahue, J., Darrell, T., Malik, J. Proc IEEE Conf Comp Vision Pattern Recognit, , 580-587 (2014).
  12. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comp Vision, , 1440-1448 (2015).
  13. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comp Vision Pattern Recognit, , 779-788 (2016).
  14. Hussain, M. YOLO-v1 to YOLO-v8, the rise of YOLO and its complementary nature toward digital manufacturing and industrial defect detection. Machines. 11 (7), 677(2023).
  15. Li, C., et al. YOLOv6: A single-stage object detection framework for industrial applications. arxiv. , (2022).
  16. Li, D., Liu, Y., Hu, C., Wang, Y., Wen, X. Research and application of intelligent stocktaking method based on weighing and image recognition technology in publishing industry. Logistics Technol Applicat. 30 (1), 134-142 (2025).
  17. Wang, X., Qian, S., Zhang, J., Guo, J., Pan, C. Exploration and application of library book stocktaking system based on computer vision and artificial intelligence technology. Library J. 41 (7), 96(2022).
  18. Sun, H., Li, P. Design and development of intelligent warehouse stocktaking system based on multi pattern visual recognition technology. Construct Machinery Equip. 56 (4), 107-111 (2025).
  19. Ren, S., He, K., Girshick, R., Jian, S. Faster R-CNN: Towards real-time object detection with region proposal networks. IEEE Transact Pattern Anal Machine Intell. 39 (6), 1137-1149 (2016).
  20. Speed/Accuracy Trade-offs for Modern Convolutional Object Detectors. Huang, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit. (CVPR), , 7310-7311 (2017).
  21. Bochkovskiy, A., Wang, C. Y., Liao, H. Y. M. YOLOv4: Optimal Speed and Accuracy of Object Detection. arXiv. , (2020).
  22. Tian, Y., Ye, Q., Doermann, D. YOLOv12: Attention-Centric Real-Time Object Detectors. arXiv. , (2025).
  23. Cheng, T., et al. YOLO-World: Real-Time Open-Vocabulary Object Detection. arXiv. , (2024).
  24. Khanam, R., Hussain, M. Yolov11: An overview of the key architectural enhancements. Arxiv. , (2024).
  25. YOLOv8: A Novel Object Detection Algorithm with Enhanced Performance and Robustness. Varghese, R., Sambath, M. 2024 Int Conf Adv Data Eng Intell Comput Sys (ADICS), , IEEE. 1-6 (2024).
  26. Wan, D., et al. YOLO-MIF: Improved YOLOv8 with Multi-Information fusion for object detection in Gray-Scale images. Adv Eng Info. 62, 102709(2024).
  27. Feature Pyramid Networks for Object Detection. Lin, T. Y., et al. Proc IEEE Conf Comp Vision Pattern Recognit (CVPR), , 2117-2125 (2017).
  28. Searching for MobileNetV3. Proc IEEE/CVF Int Conf Comp Vision (ICCV). Howard, A., et al. , 1314-1324 (2019).
  29. GhostNet: More Features from Cheap Operations. Han, K., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit (CVPR), , 1580-1589 (2020).
  30. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Mark Liao, H. Y. European conference on computer vision, , Cham Springer Nat Switzerland. 1-21 (2024).
  31. Dynamic head: Unifying object detection heads with attentions. Dai, X., et al. Proc IEEE/CVF Conf Comp Vision Pattern Recognit, , 7373-7382 (2021).
  32. Zhu, X., et al. Overview of Research on Image Data Enhancement Technology. Soft Guide. 20 (5), 1-5 (2021).
  33. Segment anything. Kirillov, A., et al. Proc IEEE/CVF Int Conf Comp Vision, , 4015-4026 (2023).
  34. Jiang, H., Wang, Y., Kang, J. Overview of object detection models and optimization methods. J Automatica Sinica. 47 (6), 1367-1393 (2021).
  35. Deep Residual Learning for Image Recognition. He, K., Zhang, X., Ren, S., Sun, J. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR), , 770-778 (2016).
  36. Efficient multi-scale attention module with cross-spatial learning. ICASSP 2023-2023 IEEE Int Conf Acoustics Speech Signal Proc (ICASSP). Ouyang, D., et al. , IEEE. 1-5 (2023).
  37. Rethinking mobile block for efficient attention-based models. Zhang, J., et al. 2023 IEEE/CVF Int Conf Computer Vis (ICCV) IEEE Comp Soc, , 1389-1400 (2023).
  38. Wang, Y., et al. Multi-Type Ship Target Detection in Complex Marine Background Based on YOLOv11. Processes. 13 (1), 249(2025).
  39. Shao, X., et al. Multi-Scale Feature Pyramid Network: A Heavily Occluded Pedestrian Detection Network Based on ResNet. Sensors. 21 (5), 1820(2021).
  40. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors. Wang, C. Y., Bochkovskiy, A., Liao, H. Y. M. Proc IEEE/CVF Conf Comput Vis Pattern Recognit (CVPR), , 7464-7475 (2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Object DetectionCigarette Brand IdentificationReal Time DetectionSingle Stage RegressionAdaptive DownsamplingMulti Scale AttentionDynamic Detection HeadVisual RecognitionModel LightweightOcclusion Detection
Видео скоро будет доступно

Похожие статьи