В современном промышленном производстве безопасность является краеугольным камнем обеспечения эффективности производства и благополучия персонала. Среда производственной линии обычно включает высокоскоростное механическое оборудование, сложные технологические процессы и совместные операции, охватывающие множество задач. Любая, даже незначительная потенциальная угроза безопасности может привести к серьезным производственным авариям, влекущим за собой значительные экономические потери и даже летальные исходы. Следовательно, для повышения безопасности промышленного производства крайне важно создать эффективную интеллектуальную систему мониторинга безопасности в режиме реального времени1,2.
Традиционные методы мониторинга безопасности в основном полагаются на ручное видеонаблюдение и различные датчики (такие как инфракрасные датчики, датчики дыма и вибрации)3. Ручной мониторинг не только неэффективен, но и подвержен пропускам обнаружения из-за усталости персонала, а также не может обеспечить непрерывный и всесторонний охват. Хотя датчики могут выполнять определенную функцию раннего предупреждения, их диапазон обнаружения ограничен, и они чувствительны к воздействиям окружающей среды, что приводит к серьезным проблемам с ложными срабатываниями4. Интеллектуальные системы мониторинга становятся объектом растущего исследовательского интереса. Анализ видеопотока в реальном времени с использованием алгоритма глубокого обучения позволяет автоматически идентифицировать аномальные события, небезопасное поведение и потенциальные опасности, что значительно повышает интеллектуальный уровень системы мониторинга4,5.
Детектирование объектов является основной технологией интеллектуального мониторинга. Алгоритмы серии You Only Look Once (YOLO), представляющие одноэтапные детекторы объектов, демонстрируют значительные преимущества. С YOLOv1 по YOLOv8 данная группа алгоритмов подвергалась непрерывному развитию, включая усовершенствование архитектуры сети, функций потерь и методологии обучения, среди прочего6,7. В частности, YOLOv11 позволила достичь более высокой точности детектирования при сохранении высокой частоты кадров, особенно при работе со сложным фоном и плотно расположенными целями8.
Однако, несмотря на отличные результаты в задачах общего детектирования объектов, YOLOv11 все еще сталкивается с трудностями в специфических сценариях мониторинга безопасности на производственных линиях9. Например, точность детектирования YOLOv11 может снижаться, когда работники частично перекрыты оборудованием или когда знаки безопасности имеют малый размер и по цвету очень близки к фону. Это требует от модели более мощных возможностей извлечения признаков и семантического понимания10.
Сверточные нейронные сети (CNN) обладают мощными возможностями извлечения признаков из изображений11. Благодаря проектированию более глубоких и сложных архитектур сетей, CNN могут изучать более богатые и абстрактные признаки изображений. Сочетание CNN с YOLOv11 позволяет использовать возможности быстрого обнаружения YOLOv11 и глубокое извлечение признаков CNN, что обеспечивает создание более надежной и интеллектуальной системы мониторинга безопасности.
На основании этого в данной работе предлагается система мониторинга безопасности производственной линии с использованием YOLOv11 и CNN. Инновационные аспекты данного исследования включают: (1) предложение архитектуры глубокого слияния YOLOv11 и улучшенной CNN; (2) внедрение многомасштабного слияния признаков и комбинированного механизма внимания для улучшения распознавания ключевых признаков безопасности; и (3) подтверждение преимуществ производительности модели на собственном наборе данных со сложными сценами.
Разработка алгоритмов серии YOLO
С момента первого представления алгоритма You Only Look Once (YOLO) компанией Redmon et al. в 2015 году12 он вызвал значительный интерес. В отличие от двухэтапных детекторов, опирающихся на предложения регионов, YOLO рассматривает обнаружение объектов как задачу регрессии. Напрямую предсказывая классы и положения объектов на изображении, YOLO заметно повышает скорость обнаружения, что делает его подходящим для использования в режиме реального времени13.
Как основополагающая работа в этой серии, YOLOv1 впервые реализует сквозное обнаружение целей14. Принцип работы YOLOv1 заключается в разделении входного изображения на сетку, где каждая ячейка сетки, обычно имеющая формат S × S, отвечает за обнаружение объектов, находящихся в ее границах.
В частности, выходные данные YOLOv1 представляют собой тензор. В структуре S × S × (B × 5 + C) прогноз для каждого ограничивающего прямоугольника содержит 5 элементов: координаты центральной точки (x,y), ширину w, высоту h и степень достоверности c. Процесс вычисления проиллюстрирован в уравнении (1):
(1)
Среди них Pr(Объект) представляет собой вероятность наличия цели в сетке, и пересечение над объединением представляет собой отношение площади пересечения к площади объединения (IoU) между предсказанной ограничивающей рамкой и истинной рамкой (ground-truth). Каждая ячейка сетки также предсказывает набор вероятностей классов, Pr представляющий вероятность того, что цель принадлежит к i-го класса в присутствии целевого объекта. Функция потерь YOLOv1 состоит из трех основных компонентов: потерь при прогнозировании координат, потерь при оценке достоверности и потерь при прогнозировании категории15.
В YOLOv2 представлены пакетная нормализация (Batch Normalization), классификатор высокого разрешения и стратегия многомасштабного обучения, которые повышают стабильность и точность16. В YOLOv3 в качестве базовой сети используется Darknet-53, а для улучшения детектирования целей применяется концепция сети пирамидальных признаков (Feature Pyramid Network, FPN)17.
В YOLOv4 была проведена многочисленная оптимизация на базе YOLOv3; для дальнейшего повышения производительности модели были внедрены такие технологии, как Cross Stage Partial Network (CSPNet)18, Path Aggregation Network (PANet)19 и мозаичное дополнение данных (Mosaic data enhancement). YOLOv5 внесла значительный вклад в инженерную реализацию, предложив более эффективное и удобное в использовании исполнение20.
В последние годы серия YOLO продолжает развиваться, один за другим выходят такие версии, как YOLOv6, YOLOv7 и YOLOv8. Благодаря внедрению структуры Extended Efficient Layer Aggregation Network (E-ELAN) и методов репараметризации модели, YOLOv7 достигает новых прорывов как в скорости, так и в точности. Эти улучшения не только повышают эффективность обучения признаков, но и оптимизируют производительность вывода сети, позволяя YOLOv7 превзойти предыдущие версии и многие основные детекторы в различных задачах обнаружения объектов в режиме реального времени. YOLOv8 дополнительно оптимизирует структуру сети, использует безъякорный (anchor-free) дизайн, упрощает модель и повышает ее обобщающую способность21.
Основываясь на преимуществах предыдущих версий, модель YOLOv11, использованная в данном исследовании, была оптимизирована для сложных промышленных сценариев. Основные улучшения включают сеть извлечения признаков, более эффективный модуль слияния признаков и более надежный дизайн функции потерь. Эти доработки позволяют YOLOv11 лучше справляться с перекрытиями объектов, малыми целями и сложными фонами в условиях производства. YOLOv11 представляет собой версию серии YOLO, выпущенную компанией Ultralytics. По сравнению с YOLOv8, в ней усовершенствованы модуль C3K2 и путь слияния признаков, а также внедрена стратегия адаптивных якорных рамок (anchor box), что обеспечивает более высокую робастность детектирования в промышленных условиях.
Основы и развитие сверточных нейронных сетей (CNN)
Сверточная нейронная сеть (CNN) является ключевой моделью, которая оказала глубокое влияние на успех глубокого обучения в области компьютерного зрения. Её работа основана на извлечении локальных признаков изображения с помощью операций свертки и последующем снижении размерности признаков с помощью операций пулинга, что позволяет достичь иерархической абстракции изображения22.
Типичная СНС состоит из нескольких сверточных слоев, слоев пулинга и полносвязных слоев. Сверточный слой сканирует входное изображение с помощью ядра свертки, вычисляет скалярные произведения по локальным областям и формирует карту признаков. Процесс вычисления показан в уравнении (2):
(2)
Где x — входное изображение, wk и bk — вес и смещение ядра свертки соответственно, а
— значения выходной карты признаков в позиции (i,j). В слое пулинга обычно используется Max Pooling (макспулинг) или Average Pooling (средний пулинг). Полносвязный слой отвечает за извлечение признаков и прогнозирование вероятностей классификации.
На основании этого в данной работе разработан модуль усиления признаков CNN для YOLOv11, который состоит из двух параллельных ветвей: ветви многомасштабной свертки, использующей ядра свертки 3 × 3 и 5 × 5 для извлечения многомасштабных признаков, и ветви внимания, в которой последовательно соединены модули канального внимания (Squeeze-and-Excitation) и пространственного внимания для усиления дискриминационных признаков ключевых объектов. Выходы двух ветвей объединяются путем поэлементного сложения; соответствующая функция потерь усиления признаков представлена в формуле (3):
(3)
Lcoord — функция потерь регрессии координат ограничивающей рамки; Lconf — функция потерь целевой уверенности; Lcls — функция потерь классификации категорий; Lfeat — функция потерь усиления признаков, используемая для ограничения дискриминативных признаков малых и перекрытых целей, извлекаемых модулем усиления CNN; λcoord, λconf, λcls, λfeat — весовые коэффициенты соответствующих членов функции потерь. Для данной задачи установлено значение λfeat = 0.05, а остальные веса сбалансированы в соответствии с требованиями задачи детектирования.
Классические структуры CNN, такие как VGGNet23 и ResNet24, достигли больших успехов в задачах классификации изображений. Среди этих архитектур ResNet эффективно решает проблему затухающего градиента при обучении глубоких сетей, что облегчает создание более глубоких и сложных сетевых структур.
В задачах детектирования объектов CNN обычно используется в качестве экстрактора признаков (backbone). Например, Darknet, cross-stage partial Darknet (CSPDarknet) и другие архитектуры в серии алгоритмов YOLO построены на базе CNN25. Для расширения возможностей извлечения признаков исследователи предложили множество усовершенствованных структур CNN. Так, модуль Inception извлекает признаки параллельно с помощью многомасштабных сверточных ядер. DenseNet улучшает повторное использование признаков за счет плотных соединений. Сеть Squeeze-and-Excitation адаптивно регулирует значимость каналов признаков с помощью механизмов внимания26.
В данном исследовании мы разработали усовершенствованный модуль CNN для расширения возможностей извлечения признаков в YOLOv11. Этот модуль объединяет многомасштабное слияние признаков с механизмом внимания для более эффективного захвата ключевой информации о безопасности в сценариях производственных линий.
Применение глубокого обучения в мониторинге промышленной безопасности
Глубокое обучение получило значительное распространение в сфере мониторинга промышленной безопасности. Алгоритмы на базе CNN используются для определения правильности ношения защитных касок работниками, обнаружения несанкционированных проникновений в опасные зоны и мониторинга состояния неисправного оборудования27.
В области распознавания поведения 3D CNN и рекуррентные нейронные сети используются для анализа операционного поведения работников и выявления потенциально небезопасных действий. Например, путем анализа последовательностей поз работников можно определить, нарушают ли они правила техники безопасности28.
YOLO и Faster R-CNN широко используются для обнаружения персонала и оборудования в видеопотоках наблюдения в режиме реального времени. Например, в литературе была предложена система обнаружения защитных касок в реальном времени на базе YOLOv5, которая эффективно повышает интеллектуальный уровень управления безопасностью на строительных площадках29.
Несмотря на определенный прогресс в текущих исследованиях, ряд проблем остается нерешенным. Во-первых, для промышленных сцен типичны сложное освещение, окклюзия и помехи фона, что предъявляет строгие требования к робастности алгоритма. Во-вторых, ключевым требованием является работа в режиме реального времени, поэтому алгоритм должен обеспечивать высокую скорость вывода при сохранении точности. Наконец, существующие исследования сосредоточены преимущественно на обнаружении в рамках одной задачи и характеризуются недостаточным изучением слияния многоисточниковой информации и комплексного анализа30.
В данном исследовании предлагаемая комбинированная модель на базе YOLOv11 и CNN направлена на решение вышеупомянутых проблем и обеспечение комплексного мониторинга рисков безопасности на производственной линии в режиме реального времени за счет расширения возможностей извлечения и объединения признаков.