Данные изображений для этого исследования были собраны в условиях эксплуатации электропитания с необходимыми разрешениями. Все изображения были анонимизированы без личной информации. Это исследование сосредоточено на выявлении средств индивидуальной защиты, а не на идентификации отдельных лиц. Поскольку исследование включает только разработку алгоритмов с использованием анонимизированных данных, этическое одобрение не требовалось.
Следующий протокол подробно описывает комплексную процедуру проектирования, обучения и оценки лёгкой, высокопроизводительной и по своей сути интерпретируемой модели обнаружения объектов, названной WTLS-YOLOv11n, для обнаружения средств индивидуальной защиты (СИЗ). Программное обеспечение, используемое в этом исследовании, указано в Таблице материалов.
Общая архитектурная структура
Предлагаемая модель WTLS-YOLOv11n построена на базовой базе YOLOv11n. Основная методология включает систематическую замену или улучшение ключевых модулей в основе и голове для повышения производительности, эффективности и интерпретируемости.
Предлагаемая модель WTLS-YOLOv11n построена на базовой базе YOLOv11n. Основная методология включает систематическую замену или улучшение ключевых модулей в основе и голове для повышения производительности, эффективности и интерпретируемости. Общая архитектурная парадигма YOLOv11n, состоящая из позвоночника, шеи и головы, была сохранена в предлагаемой модели. В основе отдельные модули C3K2 были заменены предложенными модулями C3K2-WTConv для улучшения экстракции возможностей. В головке оригинальная головка обнаружения была заменена предложенной Lightweight Shared Composite Detection Head (LSCD) для снижения сложности модели. Полная архитектура предлагаемой модели WTLS-YOLOv11n, в отличие от базовой линии, показана на рисунке 1.
Дизайн модуля C3K2-WTConv
Этот модуль предназначен для замены стандартных сверточных модулей в магистрали YOLOv11n. Его дизайн основан на двух основных целях: (a) эффективно расширить рецептивное поле модели для захвата многомасштабной контекстной информации без значительного увеличения количества параметров или вычислительной сложности, и (b) изучение более надёжных и по своей сути интерпретируемых представлений признаков путём явного разложения отображений признаков в частотную область.
Проектирование базового слоя WTConv
Базовый слой WTConv (Wavelet Transform Convolution) предназначен для реализации 2D дискретного вейвлет-преобразования Хара. Этот процесс реализуется с помощью набора специфических ядер вейвлетов:
Wavelet Kernels: Преобразование реализуется через четыре фиксированных, необучаемых ядра по глубине свёртки (F_LL, F_LH, F_HL, F_HH), которые соответствуют базисным функциям Хаара. Эти ядра отвечают за разложение входной карты признаков на низкочастотные и высокочастотные компоненты.
Декомпозиция и понижение дискретизации: эти ядра применяются к входной отображению признаков (X) шагом 2. Эта одна операция эффективно выполняет как декомпозиция признаков, так и пространственное понижение дискретизации, разделяя вход на четыре отдельных поддиапазона.
Физическая интерпретация выходных компонентов
Четыре особенных подполосы, образованные вейвлет-декомпозицией, имеют чёткую физическую интерпретацию. Как показано на рисунке 2, уровень WTConv рекурсивно разлагает входные данные на следующие компоненты:
Низкочастотный компонент (LL): этот компонент сохраняет общую структуру, контур и другую глобальную информацию цели при половине пространственного разрешения. Она служит основой для понимания «формы» цели.
Высокочастотные компоненты (LH, HL, HH): Эти три компонента фиксируют детали, такие как горизонтальные, вертикальные и диагональные края и текстуры соответственно. Они позволяют модели сосредоточиться на «деталях» цели.
Интеграция в структуру модуля C3K2
Разработанный слой WTConv органично интегрирован в структуру узкого места C3K2 YOLOv11n.
Стратегия замены: В оригинальном модуле C3K2 стандартный сверточный слой 3x3 заменён слоем WTConv. Этот подход сохраняет эффективный механизм повторного использования признаков архитектуры C3K2, одновременно вводя преимущества вейвлет-преобразования, что приводит к итоговому модулю C3K2-WTConv (детальная структура показана на рисунке 3).
Каскадное расширение рецептивного поля: процесс WTConv может рекурсивно применяться к низкочастотному (LL) выходу предыдущего этапа. Этот механизм каскадного разложения позволяет модели анализировать признаки на экспоненциально растущем рецептивном поле с минимальными вычислительными нагрузками, создавая таким образом эффективный многомасштабный путь разложения частот.
Лёгкая общая композитная детектирующая головка (LSCD)
Этот модуль спроектирован для замены оригинальной головки обнаружения YOLOv11n, с основной целью резкого снижения сложности модели и вычислительной нагрузки для эффективного развертывания на устройствах с ограниченными ресурсами периферии. Конструкция учитывает значительную избыточность параметров, присутствующую в стандартных многомасштабных головках обнаружения (подробная структура показана на рисунке 4).
Обоснование и цели проектирования
Независимые ветвления предсказания для каждой шкалы признаков (P3-P5) в оригинальной голове YOLOv11 приводят к высокому количеству параметров. LSCD вводит гибридную стратегию совместного использования параметров для достижения высшей эффективности параметров при сохранении критически важных возможностей мультимасштабного синтеза функций.
Совместное использование параметров и механизм слияния признаков
Ядро LSCD лежит в двухэтапном конвейере обработки признаков:
Масштабоспецифическая предобработка: для каждого входного отображения признаков от грифа (P3, P4, P5) применяется неразделённая свёртка 1x1, за которой следует слой нормализации группы (GN). Этот начальный шаг позволяет сети изучать масштабоспецифические преобразования каналов, обеспечивая сохранение уникальных характеристик каждого уровня признаков до слияния.
Эффективное кросс-масштабное слияние: после предварительной обработки используется серия общих 3x3 сверточных модулей GN для выполнения синтеза основных элементов на разных масштабах. Разделяя веса, эти модули изучают обобщённый шаблон слияния признаков, который является основным источником снижения параметров. Такой дизайн заставляет модель изучать более устойчивые и универсальные представления синтеза.
Динамическая адаптация масштаба и оптимизация ветвей
Для компенсации потенциальной потери информации из-за совместного веса и улучшения точности прогнозирования вводятся два дополнительных механизма:
Learnable Scale Layer: Для каждой шкалы обнаружения добавляется обучаемый уровень масштаба. Этот слой вводит обучаемый скаляр на каждом масштабе, который динамически перевзвешивает слияющиеся признаки, позволяя модели адаптивно подчёркивать или подавлять признаки в зависимости от размеров целевых объектов, распространённых на этом масштабе.
Ветка оптимизированной классификации: ветвь классификации усиливается за счёт использования функции активации Softmax для распределения вероятностей и включения слоя групповой нормализации (GN). Это стабилизирует обучение классификационной задачи и повышает устойчивость прогнозов доверия — эффективность этого метода в таких архитектурах, как FCOS.
Улучшенное проектирование функции потерь (MPDIoU)
Функция потерь переработана для решения задач точной регрессии ограничивающих коробок для небольших, захламлённых и неправильной формы целей, что часто встречается в сценариях обнаружения СИЗ.
Мотивация и ограничения традиционной потери IoU
Убытки, основанные на стандартных IoU, страдают от ряда критических недостатков в этом контексте:
Исчезающие градиенты: Когда предсказанные и правдивые поля не перекрываются, IoU равен нулю, и градиент потерь исчезает, затормозив процесс обучения.
Нечувствительность к выравниванию: Несколько конфигураций ограничивающих коробок могут дать одинаковый балл IoU, что делает функцию потерь нечувствительной к качеству выравнивания (например, отклонение центральной точки против несоответствия формы).
Плохая производительность на небольших объектах: Для малых целей даже незначительные отклонения пикселей могут быть значительными, но часто приводят к незначительным изменениям значения IoU, что приводит к неточной локализации.
Принятие минимальной потери IoU (MPDIoU)
Для преодоления вышеупомянутых ограничений протокол заменяет стандартные потери на потери по минимальному точечному расстоянию IoU (MPDIoU). MPDIoU усиливает стандартную метрику IoU, включая штрафный термин, который напрямую наказывает расстояние между предсказанными и наземными ящиками правды, даже если они не пересекаются.
Основной механизм: штрафный член выводится из евклидового расстояния между соответствующими угловыми точками предсказанной коробки (предатор) и рамки с основной правдой (gt). В частности, вычисляются квадратные расстояния для верхних левых углов
) и нижних правых углов (
) соответственно:
(1)
(2)
Чтобы штраф был инвариантен по масштабу, это расстояние нормализуется размерами наименьшей коробки, которая покрывает как предсказанные, так и наземные коробки истинности. Пусть w и h — ширина и высота этого ограждающего ящика соответственно. Метрика MPDIoU затем формулируется следующим образом:
(3)
Наконец, функция потерь MPDIoU (LMPDIoU) определяется как:
LMPDIoU = 1 - MPDIoU (4)
Ключевые преимущества: этот геометрический штрафный термин напрямую решает вышеупомянутые проблемы: i) обеспечивая значимый, ненулевой градиент даже при отсутствии пересечения, тем самым предотвращая нулевое уклонение градиентов и обеспечивая непрерывную оптимизацию модели, ii) обеспечивая повышенную чувствительность к отклонениям позиционного, размерного и аспектного отклонения, что критически важно для точной локализации небольших и разнообразных элементов СИЗ, iii) передача более стабильных и последовательных градиентных сигналов на протяжении всего обучения, что способствует более быстрой сходимости и обеспечивает лучшую точность локализации.
Наборы данных и экспериментальная установка
Самостоятельный набор данных для обнаружения СИЗ
Мы создали набор данных для обнаружения СИЗ, содержащий 5 000 высококачественных изображений с операций по линиям электропередачи, аннотированных LabelImg и конвертированных в формат YOLO TXT. Набор данных включает пять категорий: защитные шлемы (1 245 экземпляров), страховочные ремни (1 128 экземпляров), нарукавники (892 экземпляра), статус работы на высоте (1 056 экземпляров) и статус на уровне земли (1 124 экземпляра). Данные делятся на обучающие (4 000 изображений), валидационные (500 изображений) и тестовые (500 изображений). Изображения характеризуются сложными условиями, включая сильное освещение, сильную окклюзию (23% с покрытием >50%) и сложные промышленные фоны. Стандартные техники усиления (случайное переворот, вращение, цветовой джиттер, мозаика) применялись во время тренировки.
Набор данных PASCAL VOC для тестирования обобщения
Для оценки возможностей обобщения модели за пределами сценариев эксплуатации электроэнергии мы использовали набор данных PASCAL VOC, который объединяет VOC2007 и VOC2012 в общей сложности 21 503 изображения. Следуя стандартной практике, мы использовали 11 540 изображений из VOC2012 для обучения и валидации, а также 9 963 изображения из VOC2007 для тестирования. Набор данных VOC содержит 20 категорий объектов в различных реальных ситуациях. Хотя конкретные объекты отличаются от наших категорий СИЗ, задачи обнаружения (вариации масштаба, окклюзия, сложные фоны) схожи, что делает их подходящими для оценки общих возможностей и переносимости модели.
Детали реализации
Этот протокол описывает процедуру обучения и оценки модели. Предполагается, что пользователь имеет доступ к исходному коду, подходящей среде Python и подготовленным наборам данных.
Подготовка системы и среды
Для обеспечения достаточного количества памяти для обучения использовалась рабочая станция с GPU NVIDIA с не менее 24 ГБ видеопамяти (например, NVIDIA GeForce RTX 4090). Фреймворк глубокого обучения PyTorch (версия 1.12.0 или выше) вместе с соответствующим набором инструментов CUDA был установлен на рабочую станцию. Установка верифицировалась открытием терминала и выполнением команды «python -c import torch; print(torch.cuda.is_available()))'», который ожидалось вернуть «True». Необходимые пакеты на Python устанавливались путём перехода в корневую папку проекта и выполнения команды «pip install -r requirements.txt». Эта команда автоматически устанавливала зависимости, включая numpy, opencv-python, pyyaml, tensorboard и torchvision. Подготовка наборов данных была проверена, чтобы убедиться, что обучающие изображения находятся в /data/train/images/ и аннотационные файлы в /data/train/labels/ в формате YOLO (класс x_center y_center ширины). Тот же процесс верификации применялся к наборам валидации (/data/val/) и тестовым (/data/test/).
Конфигурация обучения
Конфигурационный файл config/wtls_yolov11n.yaml открывался с помощью текстового редактора для настройки обучающих параметров. Пути передачи данных настраивались путём поиска параметра 'path' и его установки в корневой каталог набора данных, а параметры 'train', 'val' и 'test' проверялись с указанием на нужные подкаталоги. Параметр 'nc' (количество классов) был подтверждён как совпадающий с набором данных, который был установлен на 5 для обнаружения СИЗ. Обучающие гиперпараметры были настроены с количеством эпох в 300 для полного обучения и размером пакета 16, с пониманием, что это значение можно регулировать на основе доступности памяти GPU и уменьшать до 8 при возникновении ошибок вне памяти. Размер входного изображения (imgsz) был установлен на 640, а оптимизатор подтвердился как SGD с начальной скоростью обучения (lr0) 0,01. Затухание веса было подтверждено как 0,0005, а импульс установлен на 0,937. Техники увеличения данных были включены с использованием стандартных настроек, включая мозаичное увеличение (мозаика: 1.0), случайный горизонтальный переворот с вероятностью 50% и цветовой джиттер с параметрами hsvh: 0.015, hsvs: 0.7 и hsvv: 0.4. Параметры использования аппаратного обеспечения были настроены так: количество рабочих — 8 для потоков процессоров, используемых при загрузке данных, а параметр устройства — 0 для использования первой GPU, с возможностью установить его в «0,1» для обучения мульти-GPU при необходимости.
Выполнение обучения модели
Обучение модели инициализировалось из командной строки выполнением команды "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml", где параметр --cfg указывал конфигурационный файл модели, параметр ---weights устанавливался на пустую строку для обучения с нуля (альтернативно, yolov11n.pt можно было использовать для обучения передачи), а параметр --data определял конфигурацию набора данных. Во время обучения наблюдались индикаторы сходимости для отслеживания эффективности модели. В первые 50 эпох наблюдалось быстрое снижение потерь — box_loss снизилось примерно с 1,5 до 0,8. Между эпохами 50 и 150 наблюдалось устойчивое улучшение, box_loss снизилось примерно с 0,8 до 0,5. В эпохи 150–300 происходила фаза тонкой настройки, при которой box_loss стабилизировался примерно на 0,4–0,5. Ожидалось, что метрика валидации mAP@0,5 превысит 85% к эпохе 200. Сохранение контрольных точек было проверено, чтобы гарантировать, что обучение автоматически сохраняет контрольные точки каждые 10 эпох в каталоге runs/train/exp/weights/. Было подтверждено наличие last.pt (последняя контрольная точка) и best.pt (максимальная контрольная точка mAP), при этом каждый файл контрольной точки должен был составлять примерно 5–6 МБ. Прогресс обучения можно было отслеживать с помощью TensorBoard, открывая новый терминал и выполняя команду «tensorboard --logdir runs/train», затем переходя в браузер для http://localhost:6006 для просмотра графиков кривых потерь, расписания скорости обучения и тенденций mAP. Распространённые проблемы решались с помощью процедур устранения неполадок, когда ошибки CUDA из памяти устранялись уменьшением размера партии до 8 или 4, значения потерь NaN устранялись снижением скорости обучения до 0,005, а плато mAP ниже 80% изучались путём проверки корректности аннотации и увеличения обучающих эпох до 400.
Протокол оценки модели
Была проведена многогранная процедура оценки для всесторонней проверки эффективности, результативности и интерпретируемости предлагаемой модели.
Количественная оценка эффективности
Показатели производительности
Оценка точности модели с использованием средней точности (mAP) при пороге IoU 0,5 (mAP@0,5), точности и отзыва. Оценивайте эффективность модели, измеряя общее количество параметров (M) и операций с плавающей запятой (FLOPs, G). Измеряйте скорость вывода в кадрах в секунду (FPS) как на серверном GPU, так и на периферийном устройстве. Для тестирования периферийных устройств установите режим питания на максимальную производительность и прогрейте модель с помощью 100 фиктивных выводов перед записью тестовых изображений в FPS свыше 500.
Сравнение с современными моделями: Сравните предложенную модель WTLS-YOLOv11n с её прямой базовой линией (YOLOv11n) и разнообразным спектром детекторов, включая основные модели YOLO на базе CNN (YOLOv5n, YOLOv8n, YOLOv9s), двухступенчатый детектор (Faster R-CNN) и детектор на основе трансформатора (RT-DETR). Обучать все модели для 300 эпох с использованием рекомендованных по умолчанию гиперпараметров. Записывайте все метрики, определённые в разделе «Метрики производительности» для каждой модели, как в самостоятельно собранном наборе данных PPE, так и в наборе данных PASCAL VOC. Для оценки VOC тренируйтесь на комбинированных наборах VOC2012 trainval и VOC2007 trainval, затем тестируйте на VOC2007 тестовом наборе согласно стандартному протоколу.
Исследования абляции: проведите систематическое исследование абляции для анализа отдельных вкладов предлагаемых компонентов.
Анализ эффективности компонентов: начиная с базовой модели YOLOv11n, постепенно интегрируйте модуль C3K2-WTConv, головку LSCD и потерю MPDIoU. Для каждой конфигурации переобучайте модель для 300 эпох с использованием одинаковых гиперпараметров (размер партии 16, скорость обучения 0,01, оптимизатор SGD). Фиксируйте изменения в mAP, точности, отзыве, параметрах, FLOP и FPS для проверки эффективности каждого компонента. Рассчитывайте процентные улучшения относительно исходного уровня для каждой метрики.
Анализ размещения: Для определения оптимального размещения модуля C3K2-WTConv интегрируйте его в различные части архитектуры сети. Протестируйте три конфигурации: (i) интеграция только с магистралью, (ii) интеграция только с грифом и (iii) полная интеграция как в магистрали, так и в грифе. Обучайте каждую конфигурацию для 300 эпох и сравнивайте полученные показатели mAP@0,5, чтобы определить наиболее эффективную стратегию интеграции. Выберите оптимальную конфигурацию для всех последующих экспериментов.
Качественная оценка эффективности
Визуализация результатов обнаружения: выберите 12-15 репрезентативных изображений из тестового набора, в которых представлены сложные реальные сценарии, включая сильное подсветка, плотную окклюзию объектов, сложные фоны и нестандартные ракурсы камеры. Для каждой модели сравнения (базовая, YOLOv5n, YOLOv8n, YOLOv9s и WTLS-YOLOv11n) проводите вывод по этим изображениям с помощью порога доверия 0,25 и порога IoU 0,45. Генерируйте и рендерите результаты обнаружения (ограничивающие рамки с метками классов и оценками доверия) на эти изображения. Организуйте визуализации в формате сетки, где строки представляют разные сценарии, а столбцы — разные модели.
Анализ надёжности: визуально сравните отрисованные результаты обнаружения из разных моделей. Оценить надёжность и превосходство предлагаемой модели, подсчитывая и отмечая случаи ложноотрицательных результатов (пропущенные объекты), ложноположительных результатов (неправильные обнаружения) и дублирующих обнаружений (несколько блоков для одного объекта с IoU > 0,7 между предсказаниями). Используйте красные круги, чтобы выделить проблемные обнаружения в визуализационной фигуре. Рассчитывайте количество ложноотрицательных и ложноположительных по моделям на выбранных тестовых изображениях. Выделить и сравнить средние показатели доверия для истинных положительных выявлений между моделями.
Анализ интерпретируемости
Для проверки врождённой интерпретируемости, предоставляемой модулем C3K2-WTConv, была проведена процедура визуализации выбранных входных изображений. Обучаемая модель WTLS-YOLOv11n была загружена, и на модуле C3K2-WTConv на четвёртом слое магистрали был зарегистрирован передний крюк. Прямое распространение осуществлялось на входном изображении, и тензор выходных признаков фиксировался. От зафиксированного тензора формы [пакет, каналы, высота, ширина] отделялись каналы, соответствующие различным частотным компонентам. Первые 25% каналов были выделены как низкочастотный (LL) компонент, а оставшиеся 75% — как высокочастотные (LH, HL, HH) компоненты. Для каждого типа частотной компоненты среднее значение по всем каналам внутри этого компонента вычислялось для создания одноканальных карт активации. L2-норма применялась по пространственным измерениям, когда это было необходимо, чтобы подчеркнуть сильные активации. Карты активации нормализовались до диапазона [0, 1], и была применена цветовая карта (например, «jet» цветовая карта). Тепловые карты были изменены по размеру для соответствия исходному разрешению входного изображения с помощью билинейной интерполяции. Низкочастотная тепловая карта и высокочастотная тепловая карта были наложены на оригинальное изображение с 40% прозрачностью, чтобы создать интерпретируемые визуализации, показывающие, где модель сосредоточена на структурных и текстурных особенностях.
Для строгой проверки того, что решения о обнаружении зависят от признаков частотной области, был проведён количественный анализ. Из тестового набора была выбрана подгруппа из 200–300 изображений, которые содержали успешные обнаружения (доверительный балл выше 0,5). Это подмножество было обеспечено для представления разнообразных сценариев, чтобы избежать смещения выборки. Для каждого изображения в подмножестве выполнялось прямое распространение, а выход модуля C3K2-WTConv на 4-м основном слое извлекался Тензор признаков был разделён на низкочастотные (LL, первые 25% каналов) и высокочастотные (HF, оставшиеся 75% каналов) компоненты. Для каждого изображения средняя абсолютная сила активации рассчитывалась по пространственным измерениям (высота и ширина) для обоих частотных компонентов. Прочность ЛЛ рассчитывалась как среднее значения абсолютного значения ЛЛ-объектов во всех пространственных позициях, а интенсивность КВ — как среднее значения абсолютного значения ВЧ-объектов во всех пространственных позициях. Эти значения записывались вместе с максимальным баллом достоверности обнаружения для этого изображения. Используя собранные данные (LL_strength, HF_strength, confidence_score) на всех изображениях, были вычислены коэффициенты корреляции Пирсона. Была рассчитана корреляция между силой ЛЛ и рейтингом доверия, а также корреляция между силой ЛФ и показателем доверия. Для получения как коэффициентов корреляции (r), так и p-значений использовалась статистическая программа или функция Python scipy.stats.pearsonr. Статистическая значимость оценивалась с помощью порога p-значения 0,05, где p-значение меньше 0,05 указывало на статистическую значимость корреляции. Величина коэффициентов корреляции была сравнивана, чтобы определить, какой частотный компонент имеет более сильную связь с уверенностью обнаружения. В структурированном формате были записаны следующие метрики: коэффициент корреляции LL (rLL) и p-значение (pLL), коэффициент корреляции HF (rHF) и p-значение (pHF), средние силы активации (meanLL, meanHF) и размер выборки (количество проанализированных изображений). Ожидаемые результаты заключались в том, что низкочастотные признаки будут демонстрировать более сильную положительную корреляцию с доверительными показателями (rLL выше 0,60, p меньше 0,001) по сравнению с высокочастотными признаками (rHF примерно 0,40–0,50, p меньше 0,01), что указывает на то, что решения о обнаружении в основном принимались на основе структурной информации, зафиксированной в компоненте LL.
Этот количественный анализ обеспечил интерпретируемость за пределами ограничений качественной визуализации. Сочетание корреляционного анализа (демонстрация статистической ассоциации) и визуализации в частотной области (показывающего пространственное внимание) предоставило строгие эмпирические доказательства того, что принятие решений моделей действительно опиралось на низкочастотные структурные особенности, как задумано в проекте.
Ожидаемые результаты: низкочастотные признаки должны демонстрировать более сильную положительную корреляцию с доверительными показателями (rLL > 0,60, p < 0,001) по сравнению с высокочастотными признаками (rHF≈ 0,40-0,50, p < 0,01), что указывает на то, что решения о обнаружении в основном определяются структурной информацией, зафиксированной в компоненте LL.
Этот количественный анализ устанавливает интерпретируемость, выходящую за рамки качественной визуализации. Сочетание корреляционного анализа (демонстрация статистической ассоциации) и визуализации в частотной области (показывающего пространственное внимание) предоставляет строгие эмпирические доказательства того, что принятие решений моделей действительно опирается на низкочастотные структурные особенности, как это задумано в дизайне.