Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Исследования алгоритма обнаружения средств индивидуальной защиты на линиях передачи на основе улучшенного YOLOv11

360 просмотров

DOI:

10.3791/69489

30 декабря 2025 г.

В этой статье

Краткое содержание

Цель этого протокола — предоставить пошаговое руководство по разработке улучшенной модели на базе YOLOv11n для обнаружения СИЗ. В ней подробно описаны архитектурные и обучающие модификации, которые приводят к созданию легкого детектора в реальном времени с передовой точностью 90,1% mAP и внутренней интерпретационностью.

Аннотация

В интеллектуальной инспекции линий передачи периферийные вычислительные устройства сталкиваются с критической задачей баланса между производительностью в реальном времени и точностью обнаружения для распознавания средств индивидуальной защиты в сложных операционных ситуациях. В данном исследовании предлагается WTLS-YOLOv11n — лёгкий и по своей природе интерпретируемый алгоритм обнаружения. Методология интегрирует три синергетические инновации в архитектуру YOLOv11n. Модуль C3K2-WTConv, использующий дискретное вейвлет-преобразование, разлагает признаки на физически значимые частотные компоненты, обеспечивая надёжное многомасштабное извлечение признаков с внутренней интерпретацией. Лёгкая общая композитная детектирующая головка обеспечивает значительное снижение параметров за счёт стратегического распределения веса, сохраняя при этом возможности многомасштабного термоядерного синтеза. Функция потерь MPDIoU повышает точность локализации для малых и неправильной формы целей. Экспериментальная валидация демонстрирует, что предлагаемая модель достигает лучшей точности обнаружения при значительно снижении параметров и вычислительной сложности по сравнению с базовым уровнем, при этом сохраняя производительность вывода в реальном времени на периферийных аппаратных платформах. Количественный анализ интерпретируемости показывает, что решения о обнаружении в основном определяются низкочастотными структурными особенностями, а не высокочастотными текстурными деталями, что обеспечивает прозрачное понимание процесса рассуждения модели. Сравнительные эксперименты с основными моделями обнаружения подтверждают преимущественное соотношение точности и эффективности предлагаемого подхода. Эта работа создаёт прозрачное, эффективное и надёжное решение для автоматизированного надзора за безопасностью в эксплуатации электроэнергии, с более широким применением к критически важным задачам обнаружения, требующим развертывания на периферии и принятии интерпретируемых решений.

Введение

Глубокое обучение преобразило протоколы промышленной безопасности и ввело новые подходы к управлению профессиональными рисками. Эта трансформация особенно заметна в секторах с высоким риском, таких как инженерия энергетических систем. Системы интеллектуального надзора на основе зрения теперь используют архитектуру YOLO (You Only Look Once)1 для автоматического обнаружения средств индивидуальной защиты (PPE)2,3 в реальном времени. Эти системы стали критически важной технологией для мониторинга безопасности на рабочем месте, предлагая значительные улучшения точности обнаружения и скорости реагирования по сравнению с традиционными методами.

Эти системы постоянно контролируют соблюдение стандартов безопасности, снижая человеческие ошибки и улучшая контроль на сложных объектах эксплуатации электроэнергии. Тем не менее, глубокие нейронные сети, лежащие в основе этих систем, представляют собой серьёзную проблему: их процессы принятия решений остаются непрозрачными. Отсутствие интерпретации является основным препятствием для более широкого внедрения отрасли, особенно в критически важных для безопасности применениях, где понимание системного рассуждения необходимо для построения доверия и обеспечения подотчетности.

Когда модель генерирует неправильное суждение, пропускает несоблюдающего сотрудника или вызывает ненужные операционные остановки, непрозрачный процесс принятия решений не предоставляет практической информации для менеджеров по безопасности. Без способности диагностировать ошибки, понимать системные рассуждения или проверять решения эти системы не могут соответствовать стандартам надёжности, требуемым в условиях, где на кону стоит безопасность человека. Этот разрыв привёл к росту спроса на подходы Explainable Artificial Intelligence (XAI)4,5,6, обеспечивающие как точность, так и прозрачность. Цель — разработать системы, которые специалисты по безопасности смогут понять, проверить и доверять в критически важных операционных ситуациях.

Прозрачность остаётся необходимой, но должна строиться на моделях, которые надёжно работают в сложных операционных условиях. Объекты эксплуатации электроэнергии предъявляют особые технические требования, требующие надёжных возможностей обнаружения. Эти среды испытывают экстремальные вариации освещения — от интенсивного дневного света до полной темноты. Сложные механизмы часто блокируют поле зрения, создавая проблемы окклюзии, которые стандартные модели обнаружения не справляются. Погодные условия добавляют дополнительную вариабельность, влияя на видимость и качество изображения в различных операционных сценариях. Для решения этих задач необходимы модели, которые сохраняют стабильную работу несмотря на такую сложность окружающей среды.

Исследователи распространили различные подходы для оптимизации производительности YOLO для приложений электростанций. Архитектурные изменения представляют собой одно из значимых направлений исследований. Несколько исследований улучшили сеть YOLOv57 , добавив дополнительные головки обнаружения в конструкцию шеи. Эта модификация решает постоянную проблему обнаружения СИЗ: сложность идентификации мелких объектов на расстоянии или в перегруженных полях зрения. Дополнительные слои обнаружения позволяют модели фиксировать более тонкие пространственные детали, которые стандартные архитектуры могут упускать из виду.

Второе крупное направление исследований сосредоточено на оптимизации моделей для сред развертывания. Энергоэксплуатационные объекты часто требуют систем обнаружения для работы на периферийных устройствах с ограниченными вычислительными ресурсами. Это ограничение стимулировало усилия по сжатию моделей и повышению эффективности. Исследователи разработали методы уменьшения размера модели и времени вывода при сохранении точности обнаружения, обеспечивая работу в реальном времени на оборудовании с ограниченными возможностямиобработки 8,9.

Недавние оптимизационные работы внедрили несколько перспективных методов для снижения сложности моделей. Исследователи интегрировали эффективные магистральные сети, такие как MobileNetv310 , в архитектуры вродеYOLO-M 11. Другие применяли обрезку моделей и дистилляцию знаний для создания компактных вариантов, включая Light-YOLOv412. Эти подходы продемонстрировали измеримые улучшения вычислительной эффективности и возможности внедрения.

Однако эти методы оптимизации сталкиваются с фундаментальными ограничениями, присущими традиционным сверточным архитектурам. Стандартные операции свёртки требуют всё более глубоких сетевых слоёв или больших размеровядра 13 для расширения рецептивного поля, что необходимо для захвата контекстной информации по всему изображению. Это архитектурное требование создаёт неизбежный компромисс. По мере того как модели получают возможность извлекать более глубокие признаки и понимать более широкий пространственный контекст, количество параметров и вычислительные требования значительно увеличиваются. Полученные модели часто превышают возможности обработки периферийных устройств, ограничивая их практическое внедрение в операционных условиях реального времени.

Это напряжение между возможностями извлечения признаков и вычислительной эффективностью представляет собой значительную методологическую проблему, которую современные подходы не полностью решали. Область требует принципиально иного подхода к извлечению признаков, который позволяет захватывать иерархические многомасштабные признаки без пропорционального увеличения параметров, навязанного традиционными методами. Такой подход позволит моделям сохранять как необходимую производительность обнаружения для критически важных для безопасности приложений, так и эффективность, необходимую для развертывания на периферии. Устранение этого пробела является критически важным исследовательским приоритетом для развития практических систем обнаружения СИЗ в условиях эксплуатации электроэнергии.

Современные методы объяснения для обнаружения объектов преимущественно используют методы пост-хоканализа, такие как Grad-CAM. Хотя эти методы предоставляют полезные визуализации, они работают независимо от процесса обучения модели. Альтернативный подход — проектировать архитектурные компоненты, обеспечивающие прозрачность через свои операционные механизмы. Наше извлечение признаков на основе вейвлетов предоставляет простой способ понять, какие частотные компоненты влияют на обнаружение, хотя для полной количественной оценки этой интерпретируемости необходимы дополнительные исследования.

В данном исследовании рассматриваются три взаимосвязанные задачи в системах обнаружения СИЗ: точность обнаружения, вычислительная эффективность и интерпретируемость моделей. Работа модифицирует архитектуру YOLOv11n15 с помощью трёх целенаправленных изменений в дизайне.

Первая модификация вводит модуль C3K2-WTConv, который заменяет стандартную свёртку процессом извлечения признаков, вдохновлённых вейвлетами. Этот подход разделяет визуальную информацию на частотные компоненты: низкочастотные сигналы содержат информацию о форме и контурах, а высокочастотные — детали текстуры и краев. Такое разделение улучшает качество признаков и делает процесс извлечения более прозрачным, чем традиционные операции свёртки.

Вторая модификация реализует Lightweight Shared Composite Detection Head (LSCD) для снижения вычислительных затрат. Этот компонент использует совместное использование параметров на разных масштабах обнаружения, уменьшая размер модели при сохранении возможностей многомасштабного обнаружения. Эта конструкция направлена на ограничения ресурсов, типичные для периферийных устройств, используемых на объектах энергоснабжения.

Третья модификация заменяет стандартную функцию потерь на MPDIoU16 для повышения точности ограничивающих коробок. Это изменение решает задачи локализации, связанные с небольшими и разнообразными элементами СИЗ, обеспечивая лучшую устойчивость градиента во время обучения.

Тестирование показало, что модифицированная модель достигает на 3,8% более высокую среднюю точность по отношению к базовому уровню при использовании на 11,5% меньше параметров. Эти результаты показывают, что подход соответствует практическим требованиям для развертывания краёв при одновременном повышении эффективности обнаружения. Эта работа предоставляет функциональное решение для мониторинга безопасности при энергоэксплуатации, хотя дальнейшая проверка в различных операционных условиях по-прежнему необходима для полной оценки надёжности системы.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Данные изображений для этого исследования были собраны в условиях эксплуатации электропитания с необходимыми разрешениями. Все изображения были анонимизированы без личной информации. Это исследование сосредоточено на выявлении средств индивидуальной защиты, а не на идентификации отдельных лиц. Поскольку исследование включает только разработку алгоритмов с использованием анонимизированных данных, этическое одобрение не требовалось.

Следующий протокол подробно описывает комплексную процедуру проектирования, обучения и оценки лёгкой, высокопроизводительной и по своей сути интерпретируемой модели обнаружения объектов, названной WTLS-YOLOv11n, для обнаружения средств индивидуальной защиты (СИЗ). Программное обеспечение, используемое в этом исследовании, указано в Таблице материалов.

Общая архитектурная структура

Предлагаемая модель WTLS-YOLOv11n построена на базовой базе YOLOv11n. Основная методология включает систематическую замену или улучшение ключевых модулей в основе и голове для повышения производительности, эффективности и интерпретируемости.

Предлагаемая модель WTLS-YOLOv11n построена на базовой базе YOLOv11n. Основная методология включает систематическую замену или улучшение ключевых модулей в основе и голове для повышения производительности, эффективности и интерпретируемости. Общая архитектурная парадигма YOLOv11n, состоящая из позвоночника, шеи и головы, была сохранена в предлагаемой модели. В основе отдельные модули C3K2 были заменены предложенными модулями C3K2-WTConv для улучшения экстракции возможностей. В головке оригинальная головка обнаружения была заменена предложенной Lightweight Shared Composite Detection Head (LSCD) для снижения сложности модели. Полная архитектура предлагаемой модели WTLS-YOLOv11n, в отличие от базовой линии, показана на рисунке 1.

Дизайн модуля C3K2-WTConv

Этот модуль предназначен для замены стандартных сверточных модулей в магистрали YOLOv11n. Его дизайн основан на двух основных целях: (a) эффективно расширить рецептивное поле модели для захвата многомасштабной контекстной информации без значительного увеличения количества параметров или вычислительной сложности, и (b) изучение более надёжных и по своей сути интерпретируемых представлений признаков путём явного разложения отображений признаков в частотную область.

Проектирование базового слоя WTConv

Базовый слой WTConv (Wavelet Transform Convolution) предназначен для реализации 2D дискретного вейвлет-преобразования Хара. Этот процесс реализуется с помощью набора специфических ядер вейвлетов:

Wavelet Kernels: Преобразование реализуется через четыре фиксированных, необучаемых ядра по глубине свёртки (F_LL, F_LH, F_HL, F_HH), которые соответствуют базисным функциям Хаара. Эти ядра отвечают за разложение входной карты признаков на низкочастотные и высокочастотные компоненты.

Декомпозиция и понижение дискретизации: эти ядра применяются к входной отображению признаков (X) шагом 2. Эта одна операция эффективно выполняет как декомпозиция признаков, так и пространственное понижение дискретизации, разделяя вход на четыре отдельных поддиапазона.

Физическая интерпретация выходных компонентов

Четыре особенных подполосы, образованные вейвлет-декомпозицией, имеют чёткую физическую интерпретацию. Как показано на рисунке 2, уровень WTConv рекурсивно разлагает входные данные на следующие компоненты:

Низкочастотный компонент (LL): этот компонент сохраняет общую структуру, контур и другую глобальную информацию цели при половине пространственного разрешения. Она служит основой для понимания «формы» цели.

Высокочастотные компоненты (LH, HL, HH): Эти три компонента фиксируют детали, такие как горизонтальные, вертикальные и диагональные края и текстуры соответственно. Они позволяют модели сосредоточиться на «деталях» цели.

Интеграция в структуру модуля C3K2

Разработанный слой WTConv органично интегрирован в структуру узкого места C3K2 YOLOv11n.

Стратегия замены: В оригинальном модуле C3K2 стандартный сверточный слой 3x3 заменён слоем WTConv. Этот подход сохраняет эффективный механизм повторного использования признаков архитектуры C3K2, одновременно вводя преимущества вейвлет-преобразования, что приводит к итоговому модулю C3K2-WTConv (детальная структура показана на рисунке 3).

Каскадное расширение рецептивного поля: процесс WTConv может рекурсивно применяться к низкочастотному (LL) выходу предыдущего этапа. Этот механизм каскадного разложения позволяет модели анализировать признаки на экспоненциально растущем рецептивном поле с минимальными вычислительными нагрузками, создавая таким образом эффективный многомасштабный путь разложения частот.

Лёгкая общая композитная детектирующая головка (LSCD)

Этот модуль спроектирован для замены оригинальной головки обнаружения YOLOv11n, с основной целью резкого снижения сложности модели и вычислительной нагрузки для эффективного развертывания на устройствах с ограниченными ресурсами периферии. Конструкция учитывает значительную избыточность параметров, присутствующую в стандартных многомасштабных головках обнаружения (подробная структура показана на рисунке 4).

Обоснование и цели проектирования

Независимые ветвления предсказания для каждой шкалы признаков (P3-P5) в оригинальной голове YOLOv11 приводят к высокому количеству параметров. LSCD вводит гибридную стратегию совместного использования параметров для достижения высшей эффективности параметров при сохранении критически важных возможностей мультимасштабного синтеза функций.

Совместное использование параметров и механизм слияния признаков

Ядро LSCD лежит в двухэтапном конвейере обработки признаков:

Масштабоспецифическая предобработка: для каждого входного отображения признаков от грифа (P3, P4, P5) применяется неразделённая свёртка 1x1, за которой следует слой нормализации группы (GN). Этот начальный шаг позволяет сети изучать масштабоспецифические преобразования каналов, обеспечивая сохранение уникальных характеристик каждого уровня признаков до слияния.

Эффективное кросс-масштабное слияние: после предварительной обработки используется серия общих 3x3 сверточных модулей GN для выполнения синтеза основных элементов на разных масштабах. Разделяя веса, эти модули изучают обобщённый шаблон слияния признаков, который является основным источником снижения параметров. Такой дизайн заставляет модель изучать более устойчивые и универсальные представления синтеза.

Динамическая адаптация масштаба и оптимизация ветвей

Для компенсации потенциальной потери информации из-за совместного веса и улучшения точности прогнозирования вводятся два дополнительных механизма:

Learnable Scale Layer: Для каждой шкалы обнаружения добавляется обучаемый уровень масштаба. Этот слой вводит обучаемый скаляр на каждом масштабе, который динамически перевзвешивает слияющиеся признаки, позволяя модели адаптивно подчёркивать или подавлять признаки в зависимости от размеров целевых объектов, распространённых на этом масштабе.

Ветка оптимизированной классификации: ветвь классификации усиливается за счёт использования функции активации Softmax для распределения вероятностей и включения слоя групповой нормализации (GN). Это стабилизирует обучение классификационной задачи и повышает устойчивость прогнозов доверия — эффективность этого метода в таких архитектурах, как FCOS.

Улучшенное проектирование функции потерь (MPDIoU)

Функция потерь переработана для решения задач точной регрессии ограничивающих коробок для небольших, захламлённых и неправильной формы целей, что часто встречается в сценариях обнаружения СИЗ.

Мотивация и ограничения традиционной потери IoU

Убытки, основанные на стандартных IoU, страдают от ряда критических недостатков в этом контексте:

Исчезающие градиенты: Когда предсказанные и правдивые поля не перекрываются, IoU равен нулю, и градиент потерь исчезает, затормозив процесс обучения.

Нечувствительность к выравниванию: Несколько конфигураций ограничивающих коробок могут дать одинаковый балл IoU, что делает функцию потерь нечувствительной к качеству выравнивания (например, отклонение центральной точки против несоответствия формы).

Плохая производительность на небольших объектах: Для малых целей даже незначительные отклонения пикселей могут быть значительными, но часто приводят к незначительным изменениям значения IoU, что приводит к неточной локализации.

Принятие минимальной потери IoU (MPDIoU)

Для преодоления вышеупомянутых ограничений протокол заменяет стандартные потери на потери по минимальному точечному расстоянию IoU (MPDIoU). MPDIoU усиливает стандартную метрику IoU, включая штрафный термин, который напрямую наказывает расстояние между предсказанными и наземными ящиками правды, даже если они не пересекаются.

Основной механизм: штрафный член выводится из евклидового расстояния между соответствующими угловыми точками предсказанной коробки (предатор) и рамки с основной правдой (gt). В частности, вычисляются квадратные расстояния для верхних левых углов Уравнение 1) и нижних правых углов (Уравнение 2) соответственно:

Уравнение 3(1)
Уравнение 4(2)

Чтобы штраф был инвариантен по масштабу, это расстояние нормализуется размерами наименьшей коробки, которая покрывает как предсказанные, так и наземные коробки истинности. Пусть w и h — ширина и высота этого ограждающего ящика соответственно. Метрика MPDIoU затем формулируется следующим образом:

Уравнение 7(3)

Наконец, функция потерь MPDIoU (LMPDIoU) определяется как:

LMPDIoU = 1 - MPDIoU (4)

Ключевые преимущества: этот геометрический штрафный термин напрямую решает вышеупомянутые проблемы: i) обеспечивая значимый, ненулевой градиент даже при отсутствии пересечения, тем самым предотвращая нулевое уклонение градиентов и обеспечивая непрерывную оптимизацию модели, ii) обеспечивая повышенную чувствительность к отклонениям позиционного, размерного и аспектного отклонения, что критически важно для точной локализации небольших и разнообразных элементов СИЗ, iii) передача более стабильных и последовательных градиентных сигналов на протяжении всего обучения, что способствует более быстрой сходимости и обеспечивает лучшую точность локализации.

Наборы данных и экспериментальная установка

Самостоятельный набор данных для обнаружения СИЗ

Мы создали набор данных для обнаружения СИЗ, содержащий 5 000 высококачественных изображений с операций по линиям электропередачи, аннотированных LabelImg и конвертированных в формат YOLO TXT. Набор данных включает пять категорий: защитные шлемы (1 245 экземпляров), страховочные ремни (1 128 экземпляров), нарукавники (892 экземпляра), статус работы на высоте (1 056 экземпляров) и статус на уровне земли (1 124 экземпляра). Данные делятся на обучающие (4 000 изображений), валидационные (500 изображений) и тестовые (500 изображений). Изображения характеризуются сложными условиями, включая сильное освещение, сильную окклюзию (23% с покрытием >50%) и сложные промышленные фоны. Стандартные техники усиления (случайное переворот, вращение, цветовой джиттер, мозаика) применялись во время тренировки.

Набор данных PASCAL VOC для тестирования обобщения

Для оценки возможностей обобщения модели за пределами сценариев эксплуатации электроэнергии мы использовали набор данных PASCAL VOC, который объединяет VOC2007 и VOC2012 в общей сложности 21 503 изображения. Следуя стандартной практике, мы использовали 11 540 изображений из VOC2012 для обучения и валидации, а также 9 963 изображения из VOC2007 для тестирования. Набор данных VOC содержит 20 категорий объектов в различных реальных ситуациях. Хотя конкретные объекты отличаются от наших категорий СИЗ, задачи обнаружения (вариации масштаба, окклюзия, сложные фоны) схожи, что делает их подходящими для оценки общих возможностей и переносимости модели.

Детали реализации

Этот протокол описывает процедуру обучения и оценки модели. Предполагается, что пользователь имеет доступ к исходному коду, подходящей среде Python и подготовленным наборам данных.

Подготовка системы и среды

Для обеспечения достаточного количества памяти для обучения использовалась рабочая станция с GPU NVIDIA с не менее 24 ГБ видеопамяти (например, NVIDIA GeForce RTX 4090). Фреймворк глубокого обучения PyTorch (версия 1.12.0 или выше) вместе с соответствующим набором инструментов CUDA был установлен на рабочую станцию. Установка верифицировалась открытием терминала и выполнением команды «python -c import torch; print(torch.cuda.is_available()))'», который ожидалось вернуть «True». Необходимые пакеты на Python устанавливались путём перехода в корневую папку проекта и выполнения команды «pip install -r requirements.txt». Эта команда автоматически устанавливала зависимости, включая numpy, opencv-python, pyyaml, tensorboard и torchvision. Подготовка наборов данных была проверена, чтобы убедиться, что обучающие изображения находятся в /data/train/images/ и аннотационные файлы в /data/train/labels/ в формате YOLO (класс x_center y_center ширины). Тот же процесс верификации применялся к наборам валидации (/data/val/) и тестовым (/data/test/).

Конфигурация обучения

Конфигурационный файл config/wtls_yolov11n.yaml открывался с помощью текстового редактора для настройки обучающих параметров. Пути передачи данных настраивались путём поиска параметра 'path' и его установки в корневой каталог набора данных, а параметры 'train', 'val' и 'test' проверялись с указанием на нужные подкаталоги. Параметр 'nc' (количество классов) был подтверждён как совпадающий с набором данных, который был установлен на 5 для обнаружения СИЗ. Обучающие гиперпараметры были настроены с количеством эпох в 300 для полного обучения и размером пакета 16, с пониманием, что это значение можно регулировать на основе доступности памяти GPU и уменьшать до 8 при возникновении ошибок вне памяти. Размер входного изображения (imgsz) был установлен на 640, а оптимизатор подтвердился как SGD с начальной скоростью обучения (lr0) 0,01. Затухание веса было подтверждено как 0,0005, а импульс установлен на 0,937. Техники увеличения данных были включены с использованием стандартных настроек, включая мозаичное увеличение (мозаика: 1.0), случайный горизонтальный переворот с вероятностью 50% и цветовой джиттер с параметрами hsvh: 0.015, hsvs: 0.7 и hsvv: 0.4. Параметры использования аппаратного обеспечения были настроены так: количество рабочих — 8 для потоков процессоров, используемых при загрузке данных, а параметр устройства — 0 для использования первой GPU, с возможностью установить его в «0,1» для обучения мульти-GPU при необходимости.

Выполнение обучения модели

Обучение модели инициализировалось из командной строки выполнением команды "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml", где параметр --cfg указывал конфигурационный файл модели, параметр ---weights устанавливался на пустую строку для обучения с нуля (альтернативно, yolov11n.pt можно было использовать для обучения передачи), а параметр --data определял конфигурацию набора данных. Во время обучения наблюдались индикаторы сходимости для отслеживания эффективности модели. В первые 50 эпох наблюдалось быстрое снижение потерь — box_loss снизилось примерно с 1,5 до 0,8. Между эпохами 50 и 150 наблюдалось устойчивое улучшение, box_loss снизилось примерно с 0,8 до 0,5. В эпохи 150–300 происходила фаза тонкой настройки, при которой box_loss стабилизировался примерно на 0,4–0,5. Ожидалось, что метрика валидации mAP@0,5 превысит 85% к эпохе 200. Сохранение контрольных точек было проверено, чтобы гарантировать, что обучение автоматически сохраняет контрольные точки каждые 10 эпох в каталоге runs/train/exp/weights/. Было подтверждено наличие last.pt (последняя контрольная точка) и best.pt (максимальная контрольная точка mAP), при этом каждый файл контрольной точки должен был составлять примерно 5–6 МБ. Прогресс обучения можно было отслеживать с помощью TensorBoard, открывая новый терминал и выполняя команду «tensorboard --logdir runs/train», затем переходя в браузер для http://localhost:6006 для просмотра графиков кривых потерь, расписания скорости обучения и тенденций mAP. Распространённые проблемы решались с помощью процедур устранения неполадок, когда ошибки CUDA из памяти устранялись уменьшением размера партии до 8 или 4, значения потерь NaN устранялись снижением скорости обучения до 0,005, а плато mAP ниже 80% изучались путём проверки корректности аннотации и увеличения обучающих эпох до 400.

Протокол оценки модели

Была проведена многогранная процедура оценки для всесторонней проверки эффективности, результативности и интерпретируемости предлагаемой модели.

Количественная оценка эффективности

Показатели производительности

Оценка точности модели с использованием средней точности (mAP) при пороге IoU 0,5 (mAP@0,5), точности и отзыва. Оценивайте эффективность модели, измеряя общее количество параметров (M) и операций с плавающей запятой (FLOPs, G). Измеряйте скорость вывода в кадрах в секунду (FPS) как на серверном GPU, так и на периферийном устройстве. Для тестирования периферийных устройств установите режим питания на максимальную производительность и прогрейте модель с помощью 100 фиктивных выводов перед записью тестовых изображений в FPS свыше 500.

Сравнение с современными моделями: Сравните предложенную модель WTLS-YOLOv11n с её прямой базовой линией (YOLOv11n) и разнообразным спектром детекторов, включая основные модели YOLO на базе CNN (YOLOv5n, YOLOv8n, YOLOv9s), двухступенчатый детектор (Faster R-CNN) и детектор на основе трансформатора (RT-DETR). Обучать все модели для 300 эпох с использованием рекомендованных по умолчанию гиперпараметров. Записывайте все метрики, определённые в разделе «Метрики производительности» для каждой модели, как в самостоятельно собранном наборе данных PPE, так и в наборе данных PASCAL VOC. Для оценки VOC тренируйтесь на комбинированных наборах VOC2012 trainval и VOC2007 trainval, затем тестируйте на VOC2007 тестовом наборе согласно стандартному протоколу.

Исследования абляции: проведите систематическое исследование абляции для анализа отдельных вкладов предлагаемых компонентов.

Анализ эффективности компонентов: начиная с базовой модели YOLOv11n, постепенно интегрируйте модуль C3K2-WTConv, головку LSCD и потерю MPDIoU. Для каждой конфигурации переобучайте модель для 300 эпох с использованием одинаковых гиперпараметров (размер партии 16, скорость обучения 0,01, оптимизатор SGD). Фиксируйте изменения в mAP, точности, отзыве, параметрах, FLOP и FPS для проверки эффективности каждого компонента. Рассчитывайте процентные улучшения относительно исходного уровня для каждой метрики.

Анализ размещения: Для определения оптимального размещения модуля C3K2-WTConv интегрируйте его в различные части архитектуры сети. Протестируйте три конфигурации: (i) интеграция только с магистралью, (ii) интеграция только с грифом и (iii) полная интеграция как в магистрали, так и в грифе. Обучайте каждую конфигурацию для 300 эпох и сравнивайте полученные показатели mAP@0,5, чтобы определить наиболее эффективную стратегию интеграции. Выберите оптимальную конфигурацию для всех последующих экспериментов.

Качественная оценка эффективности

Визуализация результатов обнаружения: выберите 12-15 репрезентативных изображений из тестового набора, в которых представлены сложные реальные сценарии, включая сильное подсветка, плотную окклюзию объектов, сложные фоны и нестандартные ракурсы камеры. Для каждой модели сравнения (базовая, YOLOv5n, YOLOv8n, YOLOv9s и WTLS-YOLOv11n) проводите вывод по этим изображениям с помощью порога доверия 0,25 и порога IoU 0,45. Генерируйте и рендерите результаты обнаружения (ограничивающие рамки с метками классов и оценками доверия) на эти изображения. Организуйте визуализации в формате сетки, где строки представляют разные сценарии, а столбцы — разные модели.

Анализ надёжности: визуально сравните отрисованные результаты обнаружения из разных моделей. Оценить надёжность и превосходство предлагаемой модели, подсчитывая и отмечая случаи ложноотрицательных результатов (пропущенные объекты), ложноположительных результатов (неправильные обнаружения) и дублирующих обнаружений (несколько блоков для одного объекта с IoU > 0,7 между предсказаниями). Используйте красные круги, чтобы выделить проблемные обнаружения в визуализационной фигуре. Рассчитывайте количество ложноотрицательных и ложноположительных по моделям на выбранных тестовых изображениях. Выделить и сравнить средние показатели доверия для истинных положительных выявлений между моделями.

Анализ интерпретируемости

Для проверки врождённой интерпретируемости, предоставляемой модулем C3K2-WTConv, была проведена процедура визуализации выбранных входных изображений. Обучаемая модель WTLS-YOLOv11n была загружена, и на модуле C3K2-WTConv на четвёртом слое магистрали был зарегистрирован передний крюк. Прямое распространение осуществлялось на входном изображении, и тензор выходных признаков фиксировался. От зафиксированного тензора формы [пакет, каналы, высота, ширина] отделялись каналы, соответствующие различным частотным компонентам. Первые 25% каналов были выделены как низкочастотный (LL) компонент, а оставшиеся 75% — как высокочастотные (LH, HL, HH) компоненты. Для каждого типа частотной компоненты среднее значение по всем каналам внутри этого компонента вычислялось для создания одноканальных карт активации. L2-норма применялась по пространственным измерениям, когда это было необходимо, чтобы подчеркнуть сильные активации. Карты активации нормализовались до диапазона [0, 1], и была применена цветовая карта (например, «jet» цветовая карта). Тепловые карты были изменены по размеру для соответствия исходному разрешению входного изображения с помощью билинейной интерполяции. Низкочастотная тепловая карта и высокочастотная тепловая карта были наложены на оригинальное изображение с 40% прозрачностью, чтобы создать интерпретируемые визуализации, показывающие, где модель сосредоточена на структурных и текстурных особенностях.

Для строгой проверки того, что решения о обнаружении зависят от признаков частотной области, был проведён количественный анализ. Из тестового набора была выбрана подгруппа из 200–300 изображений, которые содержали успешные обнаружения (доверительный балл выше 0,5). Это подмножество было обеспечено для представления разнообразных сценариев, чтобы избежать смещения выборки. Для каждого изображения в подмножестве выполнялось прямое распространение, а выход модуля C3K2-WTConv на 4-м основном слое извлекался Тензор признаков был разделён на низкочастотные (LL, первые 25% каналов) и высокочастотные (HF, оставшиеся 75% каналов) компоненты. Для каждого изображения средняя абсолютная сила активации рассчитывалась по пространственным измерениям (высота и ширина) для обоих частотных компонентов. Прочность ЛЛ рассчитывалась как среднее значения абсолютного значения ЛЛ-объектов во всех пространственных позициях, а интенсивность КВ — как среднее значения абсолютного значения ВЧ-объектов во всех пространственных позициях. Эти значения записывались вместе с максимальным баллом достоверности обнаружения для этого изображения. Используя собранные данные (LL_strength, HF_strength, confidence_score) на всех изображениях, были вычислены коэффициенты корреляции Пирсона. Была рассчитана корреляция между силой ЛЛ и рейтингом доверия, а также корреляция между силой ЛФ и показателем доверия. Для получения как коэффициентов корреляции (r), так и p-значений использовалась статистическая программа или функция Python scipy.stats.pearsonr. Статистическая значимость оценивалась с помощью порога p-значения 0,05, где p-значение меньше 0,05 указывало на статистическую значимость корреляции. Величина коэффициентов корреляции была сравнивана, чтобы определить, какой частотный компонент имеет более сильную связь с уверенностью обнаружения. В структурированном формате были записаны следующие метрики: коэффициент корреляции LL (rLL) и p-значение (pLL), коэффициент корреляции HF (rHF) и p-значение (pHF), средние силы активации (meanLL, meanHF) и размер выборки (количество проанализированных изображений). Ожидаемые результаты заключались в том, что низкочастотные признаки будут демонстрировать более сильную положительную корреляцию с доверительными показателями (rLL выше 0,60, p меньше 0,001) по сравнению с высокочастотными признаками (rHF примерно 0,40–0,50, p меньше 0,01), что указывает на то, что решения о обнаружении в основном принимались на основе структурной информации, зафиксированной в компоненте LL.

Этот количественный анализ обеспечил интерпретируемость за пределами ограничений качественной визуализации. Сочетание корреляционного анализа (демонстрация статистической ассоциации) и визуализации в частотной области (показывающего пространственное внимание) предоставило строгие эмпирические доказательства того, что принятие решений моделей действительно опиралось на низкочастотные структурные особенности, как задумано в проекте.

Ожидаемые результаты: низкочастотные признаки должны демонстрировать более сильную положительную корреляцию с доверительными показателями (rLL > 0,60, p < 0,001) по сравнению с высокочастотными признаками (rHF≈ 0,40-0,50, p < 0,01), что указывает на то, что решения о обнаружении в основном определяются структурной информацией, зафиксированной в компоненте LL.

Этот количественный анализ устанавливает интерпретируемость, выходящую за рамки качественной визуализации. Сочетание корреляционного анализа (демонстрация статистической ассоциации) и визуализации в частотной области (показывающего пространственное внимание) предоставляет строгие эмпирические доказательства того, что принятие решений моделей действительно опирается на низкочастотные структурные особенности, как это задумано в дизайне.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Для оценки эффективности предлагаемой модели WTLS-YOLOv11n мы провели эксперименты с нашим собственным набором данных СИЗ и набором данных PASCAL VOC 2007+2012. Все метрики отображаются в соответствующих тестовых наборах, если не указано иное.

Сравнение с современными моделями

Мы сравнили WTLS-YOLOv11n с основными детекторами объектов в трёх архитектурных парадигмах: модели YOLO на базе CNN (YOLOv5n, YOLOv8n, YOLOv9t, YOLOv11n), двухступенчатый дет...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Экспериментальные результаты показывают, что WTLS-YOLOv11n достигает 90,1% mAP при уменьшении параметров на 11,5% по сравнению с базовым уровнем YOLOv11n. Это повышение точности и эффективности обусловлено синергетической интеграцией трёх компонентов: вейвлет-экстракции признаков, конструкции лёгкой головки обнаружения и улучшенных потерь локализации.

Абляционное исследование показывает, что модуль C3K2-WTConv обеспечивает наибольший индивидуальный прирост про...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторы не заявляют о конфликтах интересов.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Набор инструментов CUDAКорпорация NVIDIACUDA Toolkit Версия 11.7
Фреймворк глубокого обученияФонд PyTorchPyTorch Версия 1.12.0
Графический процессорКорпорация NVIDIAGeForce RTX 4090
NumPyРазработчики NumPyNumPy
OpenCVКоманда OpenCVOpenCV-python
Операционная системаCanonical Ltd.Ubuntu 22.04 LTS (или укажите свою ОС)
PythonФонд программного обеспечения PythonPython версии 3.8 или выше
TensorBoardАвторы TensorFlowTensorBoard
TorchvisionФонд PyTorchTorchvision

Ссылки

  1. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit, , (2016).
  2. Liu, M., Li, Z., Li, Y., Liu, Y. A fast and accurate method of power line intelligent inspection based on edge computing. IEEE Trans Instrum Meas. 71, 1-12 (2022).
  3. Gallo, G., Di Rienzo, F., Garzelli, F., Ducange, P., Vallati, C. A smart system for personal protective equipment detection in industrial environments based on deep learning at the edge. IEEE Access. 10, 110862-111110 (2022).
  4. Selvaraju, R. R., et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128, 336-359 (2020).
  5. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf Appl Comput Vis (WACV, , (2018).
  6. Axiom-based grad-CAM: Towards accurate visualization and explanation of CNNs. Fu, R., et al. Proc Brit Mach Vis Conf, , (2020).
  7. Yipeng, L., Junwu, W. Personal protective equipment detection for construction workers: A novel dataset and enhanced YOLOv5 approach. IEEE Access. 12, 47338-47358 (2024).
  8. BN, R., Guru, R. Small object detection for indoor assistance to the blind using YOLO NAS small and super gradients. arXiv preprint. , (2024).
  9. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Liao, H. Y. M. Eur Conf Comput Vis, , Springer Nature. Switzerland, Cham. (2024).
  10. Searching for mobilenetv3. Howard, A., et al. Proc. IEEE/CVF Int Conf Comput Vis, , https://ieeexplore.ieee.org/document/9008835 (2019).
  11. Liu, B., et al. YOLO-M: An efficient YOLO variant with MobileOne backbone for real-time license plate detection. Proc Int Semin Artif Intell Netw Inf Technol (AINIT). , IEEE. (2024).
  12. Ma, X., et al. Light-YOLOv4: An edge-device oriented target detection method for remote sensing images. IEEE J Sel Top Appl Earth Obs Remote Sens. 14, 10808-10820 (2021).
  13. Scaling up your kernels to 31x31: Revisiting large kernel design in CNNs. Ding, X., Zhang, X., Han, J., Ding, G. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2022/papers/Ding_Scaling_Up_Your_Kernels_to_31x31_Revisiting_Large_Kernel_Design_CVPR_2022_paper.pdf (2022).
  14. Black-box explanation of object detectors via saliency maps. Petsiuk, V., Jain, R., Manjunatha, V. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , (2020).
  15. He, L., et al. Research and application of YOLOv11-based object segmentation in intelligent recognition at construction sites. Buildings. 14 (12), 3777(2024).
  16. Liu, Q., Lv, J., Zhang, C. MAE-YOLOv8-based small object detection of green crisp plum in real complex orchard environments. Comput Electron Agric. 226, 109458(2024).
  17. Fast r-cnn. Girshick, R. Proc IEEE Int Conf Comput Vis, , https://www.cv-foundation.org/openaccess/content_iccv_2015/papers/Girshick_Fast_R-CNN_ICCV_2015_paper.pdf (2015).
  18. Detrs beat yolos on real-time object detection. Zhao, Y., et al. Proc IEEE/CVF Conf Comput Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2024/papers/Zhao_DETRs_Beat_YOLOs_on_Real-time_Object_Detection_CVPR_2024_paper.pdf (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

YOLOv11