Методическая статья

Мониторинг безопасности производственной линии в режиме реального времени с использованием детектирования объектов и улучшения признаков на основе глубокого обучения

36 просмотров

DOI:

10.3791/70968

21 августа 2026 г.

В этой статье

Краткое содержание

В данной работе предлагается метод мониторинга безопасности производственной линии, интегрирующий You Only Look Once версии 11 (YOLOv11) с сверточными нейронными сетями. Метод обеспечил среднюю точность при пороге пересечения над объединением 0,5 (mAP@0.5) на уровне 0,91, mAP@0.5:0.95 на уровне 0,82 и скорость 120 кадров в секунду на графическом процессоре, что превосходит показатели оцениваемых базовых моделей.

Аннотация

С развитием Индустрии 4.0 уровни автоматизации и интеллектуализации производственных линий значительно повысились, что предъявляет более высокие требования к производительности в реальном времени, точности и безопасности мониторинга. Традиционные системы мониторинга, основанные на ручных проверках или простых решениях на базе пороговых значений, обычно характеризуются медленным временем отклика, высоким уровнем ложных тревог и ограниченными интеллектуальными возможностями. В связи с этим в данной работе предлагается система мониторинга безопасности производственной линии, объединяющая You Only Look Once версии 11 (YOLOv11) с сверточной нейронной сетью (CNN). Сначала полученные изображения подвергались предварительной обработке. Затем с помощью YOLOv11 в реальном времени идентифицировались работники, оборудование и потенциальные опасности. Далее была представлена усовершенствованная сеть CNN с многомасштабным слиянием признаков и механизмами внимания для улучшения возможностей извлечения признаков для малых и перекрытых объектов. В завершение результаты детектирования объединялись с признаками, усиленными CNN, для оценки состояния безопасности. Эксперименты проводились с использованием собственного набора данных по безопасности производственных линий с применением оптимизатора стохастического градиентного спуска (SGD) с моментом 0.9, начальной скоростью обучения 0.01, затуханием весов 0.0005, косинусным отжигом скорости обучения, размером пакета 32 и обучением в течение 200 эпох. В качестве метрик оценки для сравнения с базовыми алгоритмами использовались mAP@0.5 и скорость детектирования в кадрах в секунду (FPS). Результаты показывают, что предложенная система достигла mAP@0.5 равного 0.91 и скорости детектирования 120 FPS. Она также продемонстрировала стабильную работу в сложных условиях, таких как затенение и переменное освещение, что подтверждает ее эффективность и потенциал практического применения в мониторинге безопасности производственных линий.

Введение

В современном промышленном производстве безопасность является краеугольным камнем обеспечения эффективности производства и благополучия персонала. Среда производственной линии обычно включает высокоскоростное механическое оборудование, сложные технологические процессы и совместные операции, охватывающие множество задач. Любая, даже незначительная потенциальная угроза безопасности может привести к серьезным производственным авариям, влекущим за собой значительные экономические потери и даже летальные исходы. Следовательно, для повышения безопасности промышленного производства крайне важно создать эффективную интеллектуальную систему мониторинга безопасности в режиме реального времени1,2.

Традиционные методы мониторинга безопасности в основном полагаются на ручное видеонаблюдение и различные датчики (такие как инфракрасные датчики, датчики дыма и вибрации)3. Ручной мониторинг не только неэффективен, но и подвержен пропускам обнаружения из-за усталости персонала, а также не может обеспечить непрерывный и всесторонний охват. Хотя датчики могут выполнять определенную функцию раннего предупреждения, их диапазон обнаружения ограничен, и они чувствительны к воздействиям окружающей среды, что приводит к серьезным проблемам с ложными срабатываниями4. Интеллектуальные системы мониторинга становятся объектом растущего исследовательского интереса. Анализ видеопотока в реальном времени с использованием алгоритма глубокого обучения позволяет автоматически идентифицировать аномальные события, небезопасное поведение и потенциальные опасности, что значительно повышает интеллектуальный уровень системы мониторинга4,5.

Детектирование объектов является основной технологией интеллектуального мониторинга. Алгоритмы серии You Only Look Once (YOLO), представляющие одноэтапные детекторы объектов, демонстрируют значительные преимущества. С YOLOv1 по YOLOv8 данная группа алгоритмов подвергалась непрерывному развитию, включая усовершенствование архитектуры сети, функций потерь и методологии обучения, среди прочего6,7. В частности, YOLOv11 позволила достичь более высокой точности детектирования при сохранении высокой частоты кадров, особенно при работе со сложным фоном и плотно расположенными целями8.

Однако, несмотря на отличные результаты в задачах общего детектирования объектов, YOLOv11 все еще сталкивается с трудностями в специфических сценариях мониторинга безопасности на производственных линиях9. Например, точность детектирования YOLOv11 может снижаться, когда работники частично перекрыты оборудованием или когда знаки безопасности имеют малый размер и по цвету очень близки к фону. Это требует от модели более мощных возможностей извлечения признаков и семантического понимания10.

Сверточные нейронные сети (CNN) обладают мощными возможностями извлечения признаков из изображений11. Благодаря проектированию более глубоких и сложных архитектур сетей, CNN могут изучать более богатые и абстрактные признаки изображений. Сочетание CNN с YOLOv11 позволяет использовать возможности быстрого обнаружения YOLOv11 и глубокое извлечение признаков CNN, что обеспечивает создание более надежной и интеллектуальной системы мониторинга безопасности.

На основании этого в данной работе предлагается система мониторинга безопасности производственной линии с использованием YOLOv11 и CNN. Инновационные аспекты данного исследования включают: (1) предложение архитектуры глубокого слияния YOLOv11 и улучшенной CNN; (2) внедрение многомасштабного слияния признаков и комбинированного механизма внимания для улучшения распознавания ключевых признаков безопасности; и (3) подтверждение преимуществ производительности модели на собственном наборе данных со сложными сценами.

Разработка алгоритмов серии YOLO
С момента первого представления алгоритма You Only Look Once (YOLO) компанией Redmon et al. в 2015 году12 он вызвал значительный интерес. В отличие от двухэтапных детекторов, опирающихся на предложения регионов, YOLO рассматривает обнаружение объектов как задачу регрессии. Напрямую предсказывая классы и положения объектов на изображении, YOLO заметно повышает скорость обнаружения, что делает его подходящим для использования в режиме реального времени13.

Как основополагающая работа в этой серии, YOLOv1 впервые реализует сквозное обнаружение целей14. Принцип работы YOLOv1 заключается в разделении входного изображения на сетку, где каждая ячейка сетки, обычно имеющая формат S × S, отвечает за обнаружение объектов, находящихся в ее границах.

В частности, выходные данные YOLOv1 представляют собой тензор. В структуре S × S × (B × 5 + C) прогноз для каждого ограничивающего прямоугольника содержит 5 элементов: координаты центральной точки (x,y), ширину w, высоту h и степень достоверности c. Процесс вычисления проиллюстрирован в уравнении (1):
Формула вероятности и пересечения над объединением (IoU) для анализа детектирования объектов.   (1)

Среди них Pr(Объект) представляет собой вероятность наличия цели в сетке, и пересечение над объединением представляет собой отношение площади пересечения к площади объединения (IoU) между предсказанной ограничивающей рамкой и истинной рамкой (ground-truth). Каждая ячейка сетки также предсказывает набор вероятностей классов, Pr представляющий вероятность того, что цель принадлежит к i-го класса в присутствии целевого объекта. Функция потерь YOLOv1 состоит из трех основных компонентов: потерь при прогнозировании координат, потерь при оценке достоверности и потерь при прогнозировании категории15.

В YOLOv2 представлены пакетная нормализация (Batch Normalization), классификатор высокого разрешения и стратегия многомасштабного обучения, которые повышают стабильность и точность16. В YOLOv3 в качестве базовой сети используется Darknet-53, а для улучшения детектирования целей применяется концепция сети пирамидальных признаков (Feature Pyramid Network, FPN)17.

В YOLOv4 была проведена многочисленная оптимизация на базе YOLOv3; для дальнейшего повышения производительности модели были внедрены такие технологии, как Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 и мозаичное дополнение данных (Mosaic data enhancement). YOLOv5 внесла значительный вклад в инженерную реализацию, предложив более эффективное и удобное в использовании исполнение20.

В последние годы серия YOLO продолжает развиваться, один за другим выходят такие версии, как YOLOv6, YOLOv7 и YOLOv8. Благодаря внедрению структуры Extended Efficient Layer Aggregation Network (E-ELAN) и методов репараметризации модели, YOLOv7 достигает новых прорывов как в скорости, так и в точности. Эти улучшения не только повышают эффективность обучения признаков, но и оптимизируют производительность вывода сети, позволяя YOLOv7 превзойти предыдущие версии и многие основные детекторы в различных задачах обнаружения объектов в режиме реального времени. YOLOv8 дополнительно оптимизирует структуру сети, использует безъякорный (anchor-free) дизайн, упрощает модель и повышает ее обобщающую способность21.

Основываясь на преимуществах предыдущих версий, модель YOLOv11, использованная в данном исследовании, была оптимизирована для сложных промышленных сценариев. Основные улучшения включают сеть извлечения признаков, более эффективный модуль слияния признаков и более надежный дизайн функции потерь. Эти доработки позволяют YOLOv11 лучше справляться с перекрытиями объектов, малыми целями и сложными фонами в условиях производства. YOLOv11 представляет собой версию серии YOLO, выпущенную компанией Ultralytics. По сравнению с YOLOv8, в ней усовершенствованы модуль C3K2 и путь слияния признаков, а также внедрена стратегия адаптивных якорных рамок (anchor box), что обеспечивает более высокую робастность детектирования в промышленных условиях.

Основы и развитие сверточных нейронных сетей (CNN)
Сверточная нейронная сеть (CNN) является ключевой моделью, которая оказала глубокое влияние на успех глубокого обучения в области компьютерного зрения. Её работа основана на извлечении локальных признаков изображения с помощью операций свертки и последующем снижении размерности признаков с помощью операций пулинга, что позволяет достичь иерархической абстракции изображения22.

Типичная СНС состоит из нескольких сверточных слоев, слоев пулинга и полносвязных слоев. Сверточный слой сканирует входное изображение с помощью ядра свертки, вычисляет скалярные произведения по локальным областям и формирует карту признаков. Процесс вычисления показан в уравнении (2):

Диаграмма формулы операции свертки; математическая нотация для моделей машинного обучения.   (2)

Где x — входное изображение, wk и bk — вес и смещение ядра свертки соответственно, а Математическое выражение y_ij^k, потенциально связанное с матричными или тензорными операциями, используемыми в алгоритмах. — значения выходной карты признаков в позиции (i,j). В слое пулинга обычно используется Max Pooling (макспулинг) или Average Pooling (средний пулинг). Полносвязный слой отвечает за извлечение признаков и прогнозирование вероятностей классификации.

На основании этого в данной работе разработан модуль усиления признаков CNN для YOLOv11, который состоит из двух параллельных ветвей: ветви многомасштабной свертки, использующей ядра свертки 3 × 3 и 5 × 5 для извлечения многомасштабных признаков, и ветви внимания, в которой последовательно соединены модули канального внимания (Squeeze-and-Excitation) и пространственного внимания для усиления дискриминационных признаков ключевых объектов. Выходы двух ветвей объединяются путем поэлементного сложения; соответствующая функция потерь усиления признаков представлена в формуле (3):

 Математическая формула для координации функции потерь L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat (3)

Lcoord — функция потерь регрессии координат ограничивающей рамки; Lconf — функция потерь целевой уверенности; Lcls — функция потерь классификации категорий; Lfeat — функция потерь усиления признаков, используемая для ограничения дискриминативных признаков малых и перекрытых целей, извлекаемых модулем усиления CNN; λcoord, λconf, λcls, λfeat — весовые коэффициенты соответствующих членов функции потерь. Для данной задачи установлено значение λfeat = 0.05, а остальные веса сбалансированы в соответствии с требованиями задачи детектирования.

Классические структуры CNN, такие как VGGNet23 и ResNet24, достигли больших успехов в задачах классификации изображений. Среди этих архитектур ResNet эффективно решает проблему затухающего градиента при обучении глубоких сетей, что облегчает создание более глубоких и сложных сетевых структур.

В задачах детектирования объектов CNN обычно используется в качестве экстрактора признаков (backbone). Например, Darknet, cross-stage partial Darknet (CSPDarknet) и другие архитектуры в серии алгоритмов YOLO построены на базе CNN25. Для расширения возможностей извлечения признаков исследователи предложили множество усовершенствованных структур CNN. Так, модуль Inception извлекает признаки параллельно с помощью многомасштабных сверточных ядер. DenseNet улучшает повторное использование признаков за счет плотных соединений. Сеть Squeeze-and-Excitation адаптивно регулирует значимость каналов признаков с помощью механизмов внимания26.

В данном исследовании мы разработали усовершенствованный модуль CNN для расширения возможностей извлечения признаков в YOLOv11. Этот модуль объединяет многомасштабное слияние признаков с механизмом внимания для более эффективного захвата ключевой информации о безопасности в сценариях производственных линий.

Применение глубокого обучения в мониторинге промышленной безопасности
Глубокое обучение получило значительное распространение в сфере мониторинга промышленной безопасности. Алгоритмы на базе CNN используются для определения правильности ношения защитных касок работниками, обнаружения несанкционированных проникновений в опасные зоны и мониторинга состояния неисправного оборудования27.

В области распознавания поведения 3D CNN и рекуррентные нейронные сети используются для анализа операционного поведения работников и выявления потенциально небезопасных действий. Например, путем анализа последовательностей поз работников можно определить, нарушают ли они правила техники безопасности28.

YOLO и Faster R-CNN широко используются для обнаружения персонала и оборудования в видеопотоках наблюдения в режиме реального времени. Например, в литературе была предложена система обнаружения защитных касок в реальном времени на базе YOLOv5, которая эффективно повышает интеллектуальный уровень управления безопасностью на строительных площадках29.

Несмотря на определенный прогресс в текущих исследованиях, ряд проблем остается нерешенным. Во-первых, для промышленных сцен типичны сложное освещение, окклюзия и помехи фона, что предъявляет строгие требования к робастности алгоритма. Во-вторых, ключевым требованием является работа в режиме реального времени, поэтому алгоритм должен обеспечивать высокую скорость вывода при сохранении точности. Наконец, существующие исследования сосредоточены преимущественно на обнаружении в рамках одной задачи и характеризуются недостаточным изучением слияния многоисточниковой информации и комплексного анализа30.

В данном исследовании предлагаемая комбинированная модель на базе YOLOv11 и CNN направлена на решение вышеупомянутых проблем и обеспечение комплексного мониторинга рисков безопасности на производственной линии в режиме реального времени за счет расширения возможностей извлечения и объединения признаков.

Протокол

Алгоритмы YOLOv11 и CNN

Общая архитектура системы
Система мониторинга безопасности производственной линии, предложенная в данной работе, основана на гибридной архитектуре, сочетающей YOLOv11 с усовершенствованной CNN для обеспечения высокоточного и высокоскоростного мониторинга безопасности в режиме реального времени. Как показано на Рисунке 1, система в основном состоит из модуля предварительной обработки входных данных, модуля детектирования объектов YOLOv11, модуля улучшения признаков CNN и модуля принятия совместных решений. Входное изображение сначала нормализуется и дополняется модулем предварительной обработки для повышения обобщающей способности модели. Затем с помощью базовой сети CSPDarknet извлекаются признаки, а модуль быстрого пространственного пирамидального пулинга (SPPF) расширяет поле восприятия. После апсэмплинга происходит слияние многомасштабных признаков, к которым последовательно применяются механизмы канального и пространственного внимания для дальнейшего усиления дискриминативного представления ключевых целей. Модуль улучшения признаков CNN встраивается после выходов слоев C3, C4 и C5 базовой сети YOLOv11, получая многомасштабные карты признаков размерами 80 × 80 × 256, 40 × 40 × 512 и 20 × 20 × 1,024 соответственно. Модуль улучшения признаков CNN дополнительно оптимизирует извлечение признаков для малых и перекрытых объектов. Наконец, модуль принятия совместных решений объединяет результаты детектирования YOLOv11 с признаками, улучшенными с помощью CNN, и совместно оптимизирует их с помощью специально разработанной функции потерь для вывода точного местоположения, категории и показателя достоверности цели.

Система детектирования YOLOv11
В YOLOv11 был представлен ряд критических улучшений, использующих преимущества одноэтапной архитектуры детектирования серии YOLO. Ее архитектура разделена на три основных компонента: базовую сеть (backbone), сеть слияния признаков и детектирующую головку. Базовая сеть использует усовершенствованную структуру CSPDarknet. Сеть слияния признаков включает в себя локальные межэтапные связи и глубинно-разделимые свертки, опираясь на принципы сетей пирамид признаков и сетей агрегации путей для эффективного объединения многомасштабных признаков.

Модуль улучшения признаков
Модуль улучшения признаков предназначен для повышения чувствительности модели к ключевым признакам безопасности. Он обрабатывает карты признаков, формируемые каждым слоем базовой сети YOLOv11, объединяя информацию на разных масштабах с помощью операций апсэмплинга (увеличения разрешения) и даунсэмплинга (уменьшения разрешения). В частности, многомасштабная ветвь фиксирует разнообразие пространственных масштабов, в то время как ветвь внимания динамически усиливает ключевые каналы и позиционные отклики. Эти две ветви действуют не независимо, а дополняют друг друга и объединяются посредством остаточных связей и рекалибровки признаков. Карта признаков, обработанная модулем улучшения на каждом масштабе, приводится в соответствие с количеством каналов исходной карты признаков с помощью свертки 1 × 1, а затем объединяется с исходной картой признаков YOLOv11 путем поэлементного сложения. Далее объединенная карта признаков подается в последующую сеть пирамиды признаков (FPN) для многомасштабного слияния, что формирует иерархическое представление признаков безопасности. Для обеспечения бесшовной интеграции между модулями применяется стратегия сквозного совместного обучения, при этом функция потерь состоит из потерь детектирования YOLOv11 и потерь улучшения признаков модуля CNN.

Схема сверточной нейронной сети; включает модули Conv, ELAN, SPPF для процесса детектирования изображений.
Рисунок 1. Алгоритм YOLOv11-CNN. Модуль улучшения признаков предназначен для повышения чувствительности модели к критическим признакам безопасности. Он обрабатывает карты признаков из различных слоев основной сети (backbone) YOLOv11, объединяя признаки разных масштабов с помощью операций повышения (upsampling) и понижения (downsampling) дискретизации. Кроме того, в него интегрированы механизмы канального и пространственного внимания. Для обеспечения бесшовной интеграции модулей YOLOv11 и CNN применяется стратегия совместного обучения. В процессе обучения параметры обоих модулей оптимизируются сквозным методом (end-to-end). Функция потерь объединяет потери детектирования YOLOv11 с потерями улучшения признаков модуля CNN. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Результаты

Для проверки эффективности предложенной комбинированной модели YOLOv11 и CNN в мониторинге безопасности производственной линии был сформирован набор данных, охватывающий различные сценарии опасных ситуаций. Данный набор содержит 12 000 изображений сцен на производственной линии, разделенных на обучающую, валидационную и тестовую выборки в соотношении 7:1,5:1,5 с фиксированным случайным числом (seed) 42. Он охватывает различные условия работы, включая стандартное освещение, недостаточное освещение, частичное перекрытие, сильное перекрытие, размытие при движении и сложные фоны. Порог уверенности для вывода был установлен на уровне 0,5, а порог подавления не-максимумов (NMS) — на уровне 0,45. Все эксперименты повторяли трижды; результаты представлены как среднее значение ± стандартное отклонение. Категории разметки включают рабочих, защитные каски, роботизированные манипуляторы, опасные зоны, инструменты и транспортные средства, с использованием формата PASCAL Visual Object Classes (VOC). Порог пересечения над объединением (IoU) установлен на уровне 0,5, а согласованность разметки подтверждена путем перекрестной проверки двумя специалистами. Входные изображения были равномерно масштабированы до 640 × 640 и дополнены с помощью метода Mosaic. Обучение проводилось с использованием оптимизатора SGD с начальной скоростью обучения 0,01, моментом 0,9, затуханием весов 0,0005 и размером пакета (batch size) 32. Обучение длилось 200 эпох, а для корректировки скорости обучения использовалось косинусное отжиг (cosine annealing).

Для тщательной оценки эффективности модели использовался ряд метрик: средняя средняя точность (mAP), количество кадров в секунду (FPS) для определения скорости обработки кадров изображения, точность (precision) для оценки достоверности положительных прогнозов, полнота (recall) для измерения способности модели обнаруживать истинно положительные результаты и площадь под кривой (AUC), указывающая на площадь под рабочей характеристической кривой (ROC), что отражает общую классификационную способность модели. Формулы расчета приведены в уравнениях (4), (5), (6), (7), (8), (9), (10), (11):

figure-results-1  (4)
figure-results-2  (5)
figure-results-3  (6)
Напомним, figure-results-4 (7)
figure-results-5  (8)
figure-results-6  (9)
figure-results-7  (10)
figure-results-8  (11)

figure-results-9  Здесь mAP@0.5 означает среднюю среднюю точность при пороге IoU 0.5; N — количество категорий; APi — средняя точность i-й категории; а mAP@[0.5:0.95] — среднее значение mAP, рассчитанное для порогов IoU от 0.5 до 0.95. TP, FP, FN и TN представляют собой количество истинно положительных, ложноположительных, ложноотрицательных и истинно отрицательных результатов соответственно. F — общее количество обработанных кадров, T — общее время обработки, TPR — доля истинно положительных результатов, а FPR — доля ложноположительных результатов.
Для компонента детектирования YOLOv11 функция потерь представлена в уравнении (12):

figure-results-10     (12)

figure-results-11  Где Lcoord обозначает отклонение между предсказанным кадром и реальным кадром, Lconf измеряет ошибку уверенности предсказанного кадра, Lclass измеряет ошибку предсказания категории, а λcoord, λconf и λclass являются весовыми коэффициентами, используемыми для балансировки соответствующих функций потерь.

Анализ данных в Таблице 1 показывает, что предлагаемый метод обеспечивает mAP@0.5 на уровне 0.91 и mAP@0.5:0.95 на уровне 0.82, что представляет собой улучшение на 0.04 и 0.04 соответственно по сравнению с YOLOv5. Его F1-score составляет 0.935, что также выше, чем у сравниваемых моделей. Скорость детектирования составляет 120 FPS, что в четыре раза выше, чем у Faster R-CNN, но немного ниже, чем у YOLOv10 и YOLOv11. Количество параметров составляет 6.7M, что всего на 1.5M больше, чем у YOLOv11, при этом mAP@0.5 выше на 0.03. По сравнению с EfficientDet, имеющей схожие вычислительные затраты, точность выше на 0.06, в то время как количество параметров меньше на 56%. Данные демонстрируют, что внедренное многомасштабное слияние и механизм внимания эффективно повышают точность детектирования малоразмерных целей, обеспечивая хороший баланс между скоростью и точностью. Резюмируя, наш предлагаемый метод достигает баланса между точностью и скоростью детектирования. mAP@0.5 на 0.02 выше, чем у второй по эффективности модели, F1-score достигает 0.935, а 6.7M параметров достаточно для практического развертывания. Многомасштабное слияние и механизм внимания улучшают распознавание малых и перекрытых целей в сложных сценах. Модель балансирует точность и эффективность, что делает ее подходящей для сценариев в реальном времени, таких как мониторинг промышленной безопасности. Следует отметить, что во всех сравниваемых моделях используются официальные предобученные веса с единообразным входным разрешением 640 × 640, порогом NMS 0.45 и порогом уверенности 0.5.

МетодmAP@0.5mAP@0.5:0.95F1-мераFPSПараметры (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
НАШ МЕТОД0.910.820.9351206.7

Таблица 1: Сводная таблица сравнения производительности моделей. Анализ данных показывает, что предлагаемый метод обеспечивает mAP@0.5 равный 0,91 и mAP@0.5:0.95 равный 0,82, что представляет собой улучшение на 0,04 и 0,04 соответственно по сравнению с YOLOv5. Его показатель F1-score составляет 0,935, что также выше, чем у сравниваемых моделей. Скорость детектирования составляет 120 FPS, что в четыре раза выше, чем у Faster R-CNN, но немного ниже, чем у YOLOv10 и YOLOv11. Количество параметров составляет 6,7M, что всего на 1,5M больше, чем у YOLOv11, при этом mAP@0.5 выше на 0,03. По сравнению с EfficientDet, имеющим схожие вычислительные затраты, точность выше на 0,06, в то время как количество параметров на 56% меньше. Данные демонстрируют, что внедренное многомасштабное слияние и механизм внимания эффективно повышают точность детектирования малоразмерных целей, обеспечивая хороший баланс между скоростью и точностью. Резюмируя, наш предлагаемый метод достигает баланса между точностью и скоростью детектирования. mAP@0.5 на 0,02 выше, чем у второй по эффективности модели, F1-score достигает 0,935, а 6,7M параметров достаточно для практического развертывания. Многомасштабное слияние и механизм внимания улучшают распознавание малых и перекрытых целей в сложных сценах. Модель балансирует точность и эффективность, что делает ее подходящей для сценариев реального времени, таких как мониторинг промышленной безопасности. Следует отметить, что во всех сравниваемых моделях использовались официальные предобученные веса с единообразным входным разрешением 640 × 640, единообразным порогом NMS 0,45 и единообразным порогом уверенности 0,5.

Рисунок 2 содержит углубленный анализ типов ложных срабатываний модели. YOLOv11 + CNN имеет самый низкий уровень ложного обнаружения фона (85 раз/10 000 кадров), при этом большинство ложных срабатываний происходит на похожих объектах (62 раза) и в сценах с частичным перекрытием (48 раз). Анализ ROC-кривых показывает, что TPR модели достиг 0,9 (AUC = 0,98) при FPR равном 0,1, а минимальный интервал между кривыми подтверждает высокую надежность уверенности детектирования. Результаты данного анализа не только подтверждают эффективность модели, но и определяют четкий технический план для последующей оптимизации ложных срабатываний, в частности, путем улучшения способности модели различать похожие объекты.

figure-results-12
Рисунок 2. Анализ ошибок. Анализ типов ложных срабатываний модели. Модель YOLOv11 + CNN имеет самый низкий уровень ложных срабатываний на фоне (85 раз/10 000 кадров), при этом большинство ложных срабатываний сосредоточено на схожих объектах (62 раза) и в сценах с частичным перекрытием (48 раз). Анализ ROC-кривой показывает, что TPR модели достигло 0,9 (AUC = 0,98) при FPR 0,1, а минимальное расстояние между кривыми подтверждает надежность уверенности обнаружения. Результаты данного анализа не только подтверждают эффективность модели, но и определяют четкую техническую дорожную карту для последующей оптимизации ложных срабатываний, в частности, путем усиления способности модели различать схожие объекты. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3 демонстрирует сравнение производительности модели на различных аппаратных платформах. YOLOv11 + CNN обеспечивает сверхнизкую задержку 18 ms на граничном тензорном процессоре (TPU) с колебанием всего ±2 ms, при этом энергопотребление поддерживается на уровне 15 W. Тесты пропускной способности показывают, что модель достигает скорости обработки 70 FPS на устройствах граничных вычислений Jetson Xavier, при этом задержка 99-го перцентиля удерживается в пределах 50 ms. Данные показатели производительности при развертывании позволяют модели адаптироваться к требованиям различных вычислительных платформ в промышленных областях. Анализ ошибок дополнительно показывает, что модель сохраняет стабильную производительность в условиях ограниченных ресурсов, что подтверждает ее применимость в инженерной практике.

figure-results-13
Рисунок 3. Показатели развертывания. Сравнение производительности модели на различных аппаратных платформах. YOLOv11 + CNN обеспечивает сверхнизкую задержку 18 ms на Edge TPU (с колебанием всего ±2 ms) при энергопотреблении 15 W. Тесты пропускной способности показывают, что модель достигает скорости обработки 70 FPS на устройствах граничных вычислений Jetson Xavier, при этом задержка на уровне 99-го процентиля удерживается в пределах 50 ms. Эти показатели производительности развертывания свидетельствуют о том, что модель может адаптироваться к требованиям развертывания на различных вычислительных платформах в промышленных областях. Анализ ошибок дополнительно показывает, что модель сохраняет стабильную производительность в условиях ограниченных ресурсов, что подтверждает ее инженерную применимость. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4 демонстрирует разницу в эффективности обнаружения каждой модели в шести целевых категориях. Модель YOLOv11 + CNN достигла точности 0,96 в задаче распознавания защитных касок, что на 4 процентных пункта выше показателя базовой модели. Пунктирный график указывает на минимальные колебания производительности модели по категориям (±0,05), что отражает ее способность к обобщению. Матрица ошибок, представленная в виде тепловой карты, выявляет 15% взаимных ложных срабатываний при определении опасной зоны и роботизированного манипулятора. Этот результат задает четкое направление для последующей оптимизации модели.

figure-results-14
Рисунок 4. Анализ обнаружения категорий. Сравнение различий в эффективности обнаружения каждой модели по шести целевым категориям. Модель YOLOv11 + CNN достигла точности 0,96 в задаче распознавания защитных касок, что на 4 процентных пункта выше показателей эталонной модели. Точечный график показывает, что модель демонстрирует минимальные колебания эффективности между категориями (±0,05), что отражает её способность к обобщению. Матрица ошибок, представленная в виде тепловой карты, выявляет 15% взаимных ложных срабатываний при обнаружении опасной зоны и роботизированного манипулятора. Этот результат задает четкое направление для последующей оптимизации модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5 содержит подробные данные о процессе обучения каждой модели. YOLOv11 + CNN демонстрирует самую высокую скорость сходимости: функция потерь снижается до 0,1 в течение 30 эпох, а разрыв между кривой mAP на валидационной выборке и обучающем наборе данных стабильно составляет менее 1%. Анализ графика полосы погрешностей показывает, что итоговый показатель mAP@0.5 модели на валидации стабилизируется на уровне 0,94 ± 0,01, а диапазон колебаний производительности составляет всего одну треть от диапазона RetinaNet. Эти результаты подтверждают эффективность протокола совместного обучения. Модель демонстрирует преимущества в производительности на ранних этапах обучения, что указывает на способность ее архитектурного дизайна быстро извлекать признаки.

figure-results-15
Рисунок 5. Анализ процесса обучения. Запись процесса обучения для каждой модели. YOLOv11 + CNN демонстрирует самую высокую скорость сходимости (потери падают до 0.1 в течение 30 эпох), а разрыв между кривой mAP на валидационном наборе и тренировочном наборе всегда составляет менее 1%. Анализ графика с полосой погрешности показывает, что итоговый показатель mAP@0.5 модели на валидации стабилен на уровне 0.94 ± 0.01, а диапазон колебаний производительности составляет лишь одну треть от диапазона RetinaNet. Эти результаты подтверждают эффективность протокола совместного обучения. Модель демонстрирует преимущества в производительности на ранних этапах обучения, что указывает на то, что ее архитектурный дизайн позволяет быстро извлекать признаки. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Таблица 2 представляет количественные результаты эффективности различных моделей детектирования в сложных условиях среды. Тестовые данные при стандартном освещении и в различных экстремальных сценариях показывают, что YOLOv11 + CNN сохраняет оптимальную производительность при всех условиях. При стандартном освещении mAP@0.5 этой модели достигла 0,91, что значительно выше, чем у YOLOv5 (0,87) и Faster R-CNN (0,84). При ухудшении условий окружающей среды эффективность каждой модели снижается в разной степени, однако YOLOv11 + CNN демонстрирует наибольшую устойчивость к внешним воздействиям: в условиях низкой освещенности (< 50 lux) производительность снижается всего на 3% (до 0,88), что лучше, чем снижение на 5% у сравнительной модели; в сценариях с сильным перекрытием объектов (> 50%) показатель mAP сохраняется на уровне 0,78, а снижение производительности (13%) значительно меньше, чем у YOLOv5 (15%) и Faster R-CNN (16%). Эти результаты демонстрируют, что YOLOv11 + CNN повышает адаптивность модели к сложным факторам, таким как изменение освещенности и перекрытия, за счет улучшенного слияния признаков и механизмов внимания, что подтверждает возможность практического применения в промышленных сценариях.

Условие испытанияYOLOv11 + CNNYOLOv5Faster R-CNNКолебания производительности
Стандартное освещение0.910.870.840.01
Слабое освещение (< 50 люкс)0.88 (-3%)0.82 (-5%)0.79 (-5%)0.02
Частичная окклюзия (30%–50%)0.85 (-6%)0.80 (-7%)0.76 (-8%)0.03
Сильная окклюзия (> 50%)0.78 (-13%)0.72 (-15%)0.68 (-16%)0.04
Размытие в движении0.83 (-8%)0.77 (-10%)0.73 (-11%)0.05

Таблица 2: Таблица количественного анализа адаптивности к условиям окружающей среды. Эффективность различных моделей детектирования в сложных условиях, определенная с помощью количественного анализа. Тестовые данные, полученные при стандартном освещении и в различных экстремальных сценариях, показывают, что YOLOv11 + CNN сохраняет самую высокую производительность при всех условиях тестирования. При стандартном освещении показатель mAP@0.5 данной модели достиг 0.91, что значительно выше, чем у YOLOv5 (0.87) и Faster R-CNN (0.84). При ухудшении условий окружающей среды производительность каждой модели снижается в разной степени, однако YOLOv11 + CNN демонстрирует наибольшую устойчивость к внешним воздействиям среди оцениваемых моделей: в условиях низкой освещенности (< 50 lux) производительность снижается всего на 3% (до 0.88), что лучше, чем снижение на 5% у сравнительной модели; в сценариях с сильным перекрытием объектов (> 50%) значение mAP сохраняется на уровне 0.78, а снижение производительности (13%) значительно меньше, чем у YOLOv5 (15%) и Faster R-CNN (16%). Эти результаты демонстрируют, что YOLOv11 + CNN повышает адаптивность модели к сложным факторам, таким как изменение освещенности и помехи при перекрытии, за счет улучшенного механизма слияния признаков и структуры внимания, что подтверждает возможность практического применения в промышленных сценариях.

В таблице 3 показано, что в данном эксперименте использовался оптимизатор SGD с моментом 0.9 для ускорения сходимости и подавления осцилляций. Начальная скорость обучения 0.01 применялась с косинусным отжигом (cosine annealing), который постепенно снижался в процессе обучения для уточнения оптимизации. Для применения L2-регуляризации и уменьшения переобучения был введен коэффициент распада весов (weight decay) 0.0005. Размер пакета (batch size) 32 позволил сбалансировать вычислительную эффективность и стабильность оценки градиента. 200 эпох обучения обеспечили достаточную сходимость. Параметры были адаптированы для задачи одностадийного детектирования, обеспечивая баланс между скоростью обучения и точностью.

ПараметрЗначение
ОптимизаторSGD (стохастический градиентный спуск)
Начальная скорость обучения0.01
Импульс0.9
Регуляризация весов (Weight decay)0.0005
Размер партии32
Эпохи обучения200
Планирование скорости обученияКосинусное отжиг (Cosine annealing)

Таблица 3: Таблица гиперпараметров обучения. В данном эксперименте использовался оптимизатор SGD с моментом 0.9 для ускорения сходимости и подавления осцилляций. Начальная скорость обучения 0.01 применялась с косинусным отжигом (cosine annealing), которая постепенно снижалась в процессе обучения для уточнения оптимизации. Для применения L2-регуляризации и уменьшения переобучения был введен коэффициент затухания весов (weight decay) 0.0005. Размер пакета (batch size) 32 позволил сбалансировать вычислительную эффективность и стабильность оценки градиента. 200 эпох обучения обеспечили достаточную сходимость. Параметры были адаптированы для задачи одноэтапного детектирования, обеспечивая баланс между скоростью обучения и точностью.

Таблица 4 показывает, что при использовании YOLOv11 в качестве базовой модели значение mAP@0.5 составляет 0.89. Внедрение только многомасштабного слияния снижает точность до 0.88. Последующее последовательное наслоение канального внимания и пространственного внимания повышает точность до 0.90 и 0.89 соответственно. Совместная точность всех модулей достигает 0.91, что на 0.02 выше базового показателя. Данные свидетельствуют о том, что канальное внимание напрямую повышает точность, а комбинированная работа многомасштабного слияния и механизмов внимания обеспечивает оптимальный результат.

КонфигурацияmAP@0.5
YOLOv11 (базовая модель)0.89
+ Многомасштабное слияние0.88
+ Многомасштабное внимание + внимание к каналам0.9
+ Многомасштабное пространственное внимание0.89
Полный модуль (YOLOv11 + CNN)0.91

Таблица 4: Таблица абляционного теста. При использовании YOLOv11 в качестве базовой модели значение mAP@0.5 составляет 0,89. Внедрение только многомасштабного слияния снижает точность до 0,88. Добавление канального внимания или пространственного внимания после многомасштабного слияния повышает точность до 0,90 и 0,89 соответственно. Совокупная точность всех модулей достигает 0,91, что на 0,02 выше базового показателя. Данные показывают, что в данных условиях канальное внимание дает больший прирост, чем пространственное внимание, а комбинированная производительность многомасштабного слияния и внимания является оптимальной.

Рисунок 6 систематически оценивает эффективность модели в экстремальных условиях. mAP YOLOv11 + CNN снизился всего на 6% (до 0,88) в условиях низкой освещенности и по-прежнему составил 0,78 (что на 8% выше эталонного показателя) в сценах с сильными перекрытиями объектов. Эти результаты демонстрируют адаптивность модели к окружающей среде, эффективно решая распространенные проблемы изменения освещенности и локальных перекрытий в промышленном производстве, что обеспечивает стабильную работу системы детектирования.

figure-results-16
Рисунок 6. Адаптивность к условиям окружающей среды. Систематическая оценка производительности модели в экстремальных условиях. mAP модели YOLOv11 + CNN снизился всего на 6% (до 0.88) в условиях низкой освещенности и остался на уровне 0.78 (что на 8% выше контрольного показателя) в сценах с сильным перекрытием объектов. Эти результаты демонстрируют адаптивность модели к окружающей среде, что позволяет эффективно решать проблемы, связанные с изменением освещения и локальным перекрытием объектов в промышленном производстве, обеспечивая тем самым стабильную работу системы обнаружения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7 демонстрирует различия в распределении признаков между YOLOv11 и YOLOv11 + CNN для шести типов промышленных объектов с помощью снижения размерности t-SNE. На левом рисунке видно, что признаки базовой модели YOLOv11 характеризуются значительным внутриклассовым разбросом (внутриклассовое расстояние 2.34 ± 0.15), особенно в категориях «Опасная зона» (красный) и «Транспортное средство» (фиолетовый), где наблюдается существенное перекрытие, что согласуется с 15% частотой ложного обнаружения в экспериментальной группе 3. На правом рисунке показано, что усовершенствованная модель YOLOv11 + CNN значительно повышает внутриклассовую компактность за счет модуля усиления признаков, увеличивая среднее расстояние между центрами кластеров в каждой категории в 1,8 раза.

figure-results-17
Рисунок 7. Сравнение распределения признаков t-SNE. Сравнение различий в распределении признаков между YOLOv11 и YOLOv11 + CNN для шести типов промышленных целей с помощью снижения размерности t-SNE. На левом рисунке показано, что признаки базовой модели YOLOv11 демонстрируют значительную внутриклассовую дисперсию (внутриклассовое расстояние 2,34 ± 0,15), особенно в категориях «Опасная зона» (красный) и «Транспортное средство» (фиолетовый), где наблюдается существенное перекрытие, что согласуется с 15%-ным уровнем ложных срабатываний в экспериментальной группе 3. На правом рисунке показано, что усовершенствованная модель YOLOv11 + CNN значительно повышает внутриклассовую компактность за счет модуля усиления признаков, при этом среднее расстояние между центрами кластеров в каждой категории увеличилось в 1,8 раза. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8 подтверждает вклад каждого модуля с помощью систематических экспериментов по абляции. Результаты абляции показывают, что добавление канального внимания после многомасштабного слияния увеличивает mAP@0.5 до 0.90, в то время как добавление пространственного внимания увеличивает mAP@0.5 до 0.89. Полный модуль обеспечивает наивысшее значение mAP@0.5, равное 0.91. Визуализация на тепловой карте показывает, что комбинированный механизм внимания может одновременно усиливать отклик детекции как в центре опасной зоны (значение активации: +0.15), так и для малых целей на краю (+0.08). Экспериментальные данные демонстрируют, что многомасштабное слияние признаков и механизмы внимания оказывают кумулятивный эффект, позволяя модели соответствовать требованиям по детектированию целей на различных масштабах.

figure-results-18
Рисунок 8. Эксперимент по модульной абляции. Подтверждение вклада каждого модуля с помощью систематических экспериментов по абляции. Результаты абляции показывают, что добавление канального внимания после многомасштабного слияния увеличивает mAP@0.5 до 0.90, в то время как добавление пространственного внимания увеличивает mAP@0.5 до 0.89. Полный модуль обеспечивает наивысшее значение mAP@0.5, равное 0.91. Визуализация тепловой карты показывает, что комбинированный механизм внимания может одновременно усиливать отклик детектирования в центре опасной зоны (значение активации: +0.15) и для малых целей по краям (+0.08). Экспериментальные данные демонстрируют, что многомасштабное слияние признаков и механизмы внимания обладают кумулятивным эффектом, позволяя модели соответствовать требованиям к детектированию целей в разных масштабах. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

ДОСТУПНОСТЬ ДАННЫХ:
Полные необработанные изображения и видеопотоки с производственных линий являются объектом ограничений промышленной конфиденциальности и не подлежат публичному разглашению. В «Описании дополнительного набора данных» (Supplemental File 1) приведены сведения о сборе данных, распределении категорий и сценариев, спецификации аннотирования, процедуры контроля качества, разделение данных, методы предварительной обработки и аугментации. «Псевдокод и структура воспроизводимости» (Supplemental File 2) содержит рабочий процесс на уровне псевдокода, описания конфигураций и рекомендации по воспроизведению. Анонимизированный подмножество данных и дополнительные вспомогательные материалы могут быть запрошены у автора, ответственного за переписку, для некоммерческих академических исследований при условии соблюдения институциональных ограничений и требований конфиденциальности.

Дополнительный файл 1. Описание дополнительного набора данных. В этом файле описаны протокол сбора данных, охват сценариев, распределение классов, спецификации аннотирования, процедуры контроля качества, разделение на обучающую/валидационную/тестовую выборки, предварительная обработка и процедуры аугментации. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 2. Псевдокод и основа для воспроизводимости. В данном файле приведены детали рабочего процесса на уровне псевдокода и сведения о конфигурации для предобработки, обучения, оценки и развертывания, а также описаны ограничения на использование необработанных промышленных видеозаписей и доступ к вспомогательным материалам. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Экспериментальные результаты показывают, что предложенная комбинированная модель YOLOv11–CNN повышает точность детектирования и производительность в реальном времени при мониторинге безопасности производственных линий. Благодаря эффективному одноэтапному детектированию YOLOv11 и улучшению признаков с помощью модуля CNN, система идентифицировала рабочих, оборудование и опасные зоны в условиях сложного освещения и перекрытий. Многомасштабное слияние признаков и механизмы внимания расширили возможность фокусировки на ключевых элементах безопасности, обеспечивая интерпретируемые визуальные доказательства для раннего предупреждения.

Система имеет практическую ценность для производственных линий в таких областях, как автомобилестроение и сборка электроники, где мониторинг в режиме реального времени позволяет снизить зависимость от ручного контроля и сократить время реагирования на потенциальные угрозы безопасности. Для малых объектов, таких как винты и инструменты, а также для объектов-работников, частично перекрытых роботизированными манипуляторами или другим оборудованием, механизмы многомасштабного слияния признаков и механизмы внимания повышают способность модели извлекать и выделять признаки, связанные с безопасностью. Эти улучшения актуальны для производственных условий, в которых объекты различаются по размеру и степени видимости.

Тем не менее, данное исследование имеет определенные ограничения. При сильном перекрытии объекта или очень низкой освещенности эффективность модели может снизиться, так как информация о признаках цели становится неполной, а существующих сверточных признаков может оказаться недостаточно. Недавно добавленный модуль усиления признаков CNN вносит дополнительные 1.5M параметров, что может увеличить вычислительную нагрузку на недорогие периферийные устройства и ограничить развертывание в условиях ограниченных ресурсов. В данном исследовании используются данные изображений в видимом свете и не интегрируется информация от мультимодальных датчиков, таких как инфракрасная тепловизионная съемка или радар миллиметрового диапазона; следовательно, эффективность может быть ограничена в экстремальных промышленных сценах, таких как полная темнота или задымление.

Будущие исследования будут сосредоточены на следующих направлениях: облегчение модели на основе структурированного прунинга и дистилляции знаний для снижения нагрузки на параметры при сохранении эффективности детектирования; создание системы мультимодального слияния видимого и инфракрасного спектров для повышения способности обнаружения в условиях экстремального освещения и задымления; внедрение облегченного модуля Transformer для замены части сверточных слоев и улучшения извлечения признаков дальнего контекста; а также разработка сквозной подсистемы распознавания аномального поведения для обеспечения полного рабочего процесса — от детектирования цели до раннего предупреждения о поведении.

В заключение, данное исследование посвящено системе мониторинга безопасности производственной линии, в которой объединяются алгоритмы YOLOv11 и CNN для обеспечения обнаружения в режиме реального времени и раннего предупреждения о потенциальных опасностях в сложных промышленных условиях. В ходе экспериментальной проверки комбинированная модель продемонстрировала преимущества в точности обнаружения объектов и скорости вывода. Благодаря эффективной одностадийной архитектуре обнаружения и оптимизированному извлечению признаков, YOLOv11 показала высокие результаты в быстром распознавании рабочих, оборудования и опасных зон, а также точно зафиксировала ключевые элементы безопасности в сценариях производственной линии. Одновременно с этим внедрение усовершенствованного модуля CNN дополнительно улучшило захват признаков и обнаружение частично перекрытых целей. При мониторинге безопасности производственной линии модель автоматически фокусируется на ключевых зонах безопасности на изображении с помощью визуального анализа, обеспечивая интерпретируемую основу для предупреждений о безопасности. Комбинированная модель продемонстрировала высокую адаптивность и стабильность в различных сценариях производственной линии, включая механическую обработку, сборку и складирование. Основная работа в данной статье заключается в следующем:

(1) Для обеспечения баланса между скоростью и точностью детектирования была разработана архитектура глубокого слияния YOLOv11 и CNN.
(2) Был создан механизм многомасштабного слияния признаков и оптимизации внимания для повышения способности модели фокусироваться на ключевых элементах безопасности в сложных сценариях.
(3) Эксперименты на собственном наборе данных по безопасности производственных линий показали, что модель достигла mAP@0.5 равного 0.91 при скорости детектирования 120 FPS. При тестировании в различных сценариях модель продемонстрировала стабильную работу.

Типовые примеры показали, что при стандартном освещении защитная каска, видимая лишь на 40%, была точно определена с помощью многомасштабного слияния и канального внимания (доверительный интервал 0,93), в то время как базовая модель ошибочно приняла ее за фон. В сценариях с низкой освещенностью, когда рабочий входил в опасную зону, механизм пространственного внимания успешно ограничил цель направляющими линиями, тогда как сравнительный метод не смог ее обнаружить. Ошибки включали ошибочное определение гаечного ключа как инструмента из-за сходства его текстуры с фоном при сильном перекрытии, а также пропуск защитной каски из-за низкого отношения сигнал/шум на расстоянии в условиях низкой освещенности, что выявило ограничения в представлении признаков в экстремальных условиях. Эти результаты указывают на то, что модель устойчива в нормальных и умеренно сложных сценариях, но все еще требует доработки для работы в экстремальных условиях.

Раскрытие информации

Авторы заявляют об отсутствии конфликта интересов.

Благодарности

Данная работа была частично профинансирована Фондом научных исследований для высококвалифицированных специалистов Университета Тайчжоу в рамках проекта «Исследование ключевых технологий прецизионного детектирования для интеллектуального производства» (TZXY2020QDJJ006).

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
COCO API   Н/ДИнструмент оценки, используемый для анализа точности обнаружения целей и статистического анализа.
CUDA 11.4NVIDIAН/ДПлатформа параллельных вычислений, используемая с фреймворком PyTorch 1.12.
Edge TPU   Н/ДПлатформа развертывания, используемая для тестирования задержки и энергопотребления; зафиксированная задержка составила 18 ms, а энергопотребление — 15 W.
Устройство граничных вычислений Jetson XavierNVIDIA   Устройство граничных вычислений, используемое для тестирования пропускной способности; зафиксированная скорость обработки составила 70 FPS с задержкой 99-го перцентиля в пределах 50 ms.
Графический процессор NVIDIA Tesla V100 GPUNVIDIA   GPU, используемый в сервере для обучения/оценки.
PyTorch 1.12   Н/ДФреймворк глубокого обучения, используемый для обучения и оценки модели.
scikit-learn    Н/ДИнструмент оценки/статистического анализа, используемый для оценки модели.
Собственный набор данных по безопасности производственной линииН/ДН/ДНабор данных из 12 000 изображений сцен производственной линии в формате VOC, охватывающий стандартное освещение, недостаточное освещение, частичное перекрытие, сильное перекрытие, размытие при движении и сложные фоны; шесть категорий аннотаций: рабочие, защитные каски, роботизированные манипуляторы, опасные зоны, инструменты и транспортные средства.
Сервер для обучения       Сервер, оснащенный графическим процессором NVIDIA Tesla V100 и операционной системой Ubuntu 20.04.
Операционная система Ubuntu 20.04     Н/ДОперационная система, используемая на сервере для обучения/оценки.
Формат аннотаций VOCН/ДН/ДФормат аннотации, используемый для собственного набора данных по безопасности производственной линии.
Модель обнаружения объектов YOLOv11UltralyticsН/ДМодель обнаружения объектов, используемая для обнаружения рабочих, оборудования и потенциальных опасностей в режиме реального времени.

Ссылки

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

Перепечатки и разрешения

Теги

YOLOv11