Method Article

Улучшенный метод аннотации фрагментированных изображений для электровелосипедов в сложных сценариях лифтов на основе локальных особенностей

DOI:

10.3791/69226

March 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Представлен метод аннотаций с фрагментами изображений, основанный на локальных признаках, для улучшения обнаружения электровелосипедов в сложных сценариях лифтов с использованием набора данных EBike-DET и основных моделей обнаружения объектов.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рост использования электровелосипедов (EBikes) в ограниченных условиях, таких как жилые лифты, вызвало серьёзные проблемы с безопасностью и создало серьёзные трудности для автоматизированного обнаружения объектов, особенно из-за частых окклюзионных объектов. Традиционные методы обнаружения, которые в основном опираются на целостные аннотации, часто не способны точно распознавать частично закрытые электронные книги в визуально сложных сценах. Для преодоления этих ограничений в данном исследовании предлагается новый метод аннотирования на части, основанный на локальных признаках, предлагающий более интерпретируемую стратегию аннотирования. Разлагая электронную литературу на несколько ключевых областей для независимой маркировки, предлагаемый метод позволяет моделям обнаружения изучать детализированную структурную информацию, тем самым повышая устойчивость в условиях с высокой окклюзией. Кроме того, был разработан выделенный набор данных EBike-DET для поддержки задач обнаружения в реалистичных сценариях лифта. Аннотированный с помощью метода chunked и дополненный смоделированными условиями окружающей среды, набор данных повышает как производительность модели, так и адаптивность. Предлагаемый метод способствует развитию объяснимого искусственного интеллекта (XAI), делая обнаружение объектов более прозрачным и структурно интерпретируемым, что особенно ценно в приложениях, критически важных для безопасности. Проведены обширные эксперименты с использованием трёх основных моделей (YOLOv5, YOLOv10 и SSD). Результаты показывают, что YOLOv5 при обучении на EBike-DET с фрагментированными аннотациями достигает улучшения точности на 3,7%, в воспоминании на 5,3%, в результатах F1 на 4,5% и в mAP на 4,4%. По сравнению с публичными наборами данных, EBike-DET демонстрирует большую стабильность и устойчивость при окклюзии. Это исследование не только повышает точность обнаружения, но и делает шаг к более интерпретируемым и объяснимым решениям ИИ для внедрения в реальных системах мониторинга безопасности.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

С быстрым распространением электровелосипедов (EBikes) по всему миру, особенно в Китае, где к 2022 году их общее количество превысило 350 миллионов единиц, электронные велосипеды стали доминирующим способом короткого транспорта. Однако их частое использование в ограниченных пространствах, таких как жилые лифты, создаёт серьёзные риски для безопасности, включая аномальные вибрации, повреждение оборудования, неприятные запахи и пожарную опасность. Недавнее исследование оценивает, что пожары, связанные с EBike, происходят с вероятностью примерно 1,44%1. Эти риски подчёркивают острую необходимость эффективных и точных методов обнаружения электронных источников для повышения безопасности в условиях лифтов.

Несмотря на прогресс в области компьютерного зрения и глубокого обучения, обнаружение электронных букв в лифтах остаётся сложной задачей. Общедоступные наборы данных редки и часто не имеют разнообразия в моделях EBike, цветах и условиях окклюзии, что ограничивает обобщениемоделей 2. Кроме того, сценарии лифтов часто включают сложные окклюзии, когда электронные данные частично скрыты пассажирами или конструктивными элементами, что ещё больше снижает точность обнаружения 3,4,5. Существующие холистические методы аннотирования, рассматривающие EBikes как единый ограничивающий блок, часто не работают в таких условиях, что демонстрирует необходимость улучшения стратегий аннотаций и обнаружения. Как показано в Таблице 1, целостная аннотация приводит к заметному снижению производительности, при этом средняя средняя точность при пересечении над порогом Union (IoU) снижается до 21,5 mAP@0% по сравнению с аннотированием по частям.

Достижения в обнаружении на основе глубокого обучения

Методы глубокого обучения, особенно сверточные нейронные сети (CNN), широко применяются в обнаружении объектов. Семья You Only Look Once (YOLO) демонстрирует сильную производительность в реальном времени. Однако при обнаружении окклюзированных или перекрывающихся объектов модели YOLO, как правило, производят избыточные ограничивающие рамки. Например, YOLOv5 улучшает многомасштабное извлечение признаков с помощью глубокой свёртки и пирамидальных сетей 6,7, тогда как YOLOv10 устраняет немаксимальное подавление и использует агрегационные сеть путей для повышения скорости и многомасштабногосинтеза 8,9. Несмотря на эти улучшения, избыточные ограничивающие коробки и снижение прочности в условиях с высокой окклюзией остаются нерешёнными. Тем не менее, обе они страдают, когда ключевые структуры электронных букв частично блокируются, поскольку холистическая аннотация предоставляет ограниченные локальные сигналы. Как показано на рисунке 1A-C, это ограничение приводит к избыточным ограничивающим рамкам и нестабильной уверенности в обнаружении при умеренной или сильной окклюзии. В отличие от этого, аннотация с частями смягчает эту проблему, позволяя модели обнаруживать отдельные области — такие как колёса или задняя область — тем самым снижая избыточные ограничивающие рамки при окклюзии. Рисунок 1D-F дополнительно демонстрирует, что аннотация с частями улучшает локализацию признаков и сохраняет стабильность обнаружения, когда видимы только частичные компоненты EBike.

Аналогично, модель Single Shot MultiBox Detector (SSD)10, 11, основанная на основе VGG-16, обеспечивает эффективное обнаружение на разных масштабах и хорошо работает на небольшихобъектах 12. Однако SSD также испытывает трудности, когда непрерывность признаков нарушается сильной окклюзией, что приводит к упущенным обнаружениям или нестабильной регрессии коробки — даже при введении механизмов внимания13. Аннотация с фрагментами также даёт преимущество: модель по-прежнему может полагаться на оставшиеся видимые локальные части, что повышает устойчивость обнаружения в многомасштабных и окклюзионных условиях.

Стратегии аннотации и обучение локальных признаков

Большинство современных методов обнаружения используют холистическую аннотацию, которая упрощает аннотации, но в основном опирается на глобальныепризнаки 14,15. Этот подход испытывает трудности, когда критически важные области электронной системы — такие как колёса, передняя или задняя часть — частично отсутствуют. Недавнее исследование16 показало, что локальное обучение признаков, которое сегментирует объекты на несколько аннотированных частей, может повысить устойчивость и точность в сложных ситуациях. В соответствии с этим, результаты в Таблице 2 показывают, что аннотация с частями остаётся эффективной, когда не менее 40%–60% ключевых компонентов электронной системы остаются видимы, особенно при аннотировании колёс, передней и задней зоны. В отличие от этого, целостные ограничивающие рамки остаются достаточными в сценариях с низкой окклюзией (например, <20% окклюзии) или при разрешении изображения ≥1280 x 720, когда сохраняется полный силуэт. Преимущество фрагментирования уменьшается, когда окклюзия превышает ≈70% или когда области на уровне признаков становятся слишком малыми для предоставления разборчивой пространственной информации.

Методологическое обоснование использования обнаружения углов Харриса

Обнаружение углов Харриса выбирается для локального извлечения признаков благодаря своему детерминированному поведению, вычислительной эффективности и свойству без обучения, которые необходимы для надёжной аннотации в условиях лифта. В отличие от изученных детекторов ключевых точек, таких как SuperPoint и LoFTR, он избегает дополнительного обучения и снижает сдвиг доменов при ограниченных аннотированных данных и сильной окклюзии. По сравнению с операторами на основе рёбер, такими как Canny и Sobel, углы Харриса делают акцент на геометрически значимых переходах, а не на шумных фоновых рёбрах, что позволяет стабильно локализовать структуры EBike, включая колёса и пересечения рам. Кроме того, обнаружение углов Харриса обеспечивает интерпретируемые гиперпараметры. Эмпирическая константа k управляет чувствительностью и стабильностью углов. Как показано в разделе 2.6.2.4 и рисунке 2, корректировка k поддерживает контролируемый баланс между надёжностью и чрезмерным обнаружением, что хорошо соответствует предлагаемой стратегии аннотирования на основе правил.

Дополнение данных для устойчивости

Дополнение данных доказало свою эффективность в повышении разнообразия и адаптации моделей обнаружения. Распространённые методы включают геометрические преобразования (например, вращение, масштабирование, обрезку) и цветовые корректировки (например, масштабирование серого, модификации яркости), которые имитируют реальные условия и вариацииосвещения 17,18,19. Внедряя эти стратегии, модели обнаружения становятся более устойчивыми к вариабельности и лучше подходят для реального внедрения.

Чтобы устранить вышеупомянутые ограничения, в этом исследовании предлагается усовершенствованный метод аннотирования с частями, основанный на локальных признаках. Метод повышает изучение признаков и устойчивость, разделяя электронные книги на несколько независимых аннотированных частей, что позволяет более эффективно обнаруживать при сложной окклюзии. Кроме того, создаётся специализированный набор данных Electric Bike Detection (EBike-DET), адаптированный к условиям лифтов, обогащённый разнообразными дополнениями данных для повышения адаптивности модели. Наконец, метод валидируется на YOLOv5, YOLOv10 и SSD, демонстрируя стабильный рост производительности от +5,69% до +39,81% mAP, как показано в таблице 3. Вклад можно кратко изложить следующим образом: улучшенный метод аннотаций с фрагментами, укрепляющий обучение признаков в условиях окклюзии, создание специализированного набора данных EBike-DET для сценариев лифта, включение множества методов дополнения и экспериментальная валидация на основных моделях обнаружения, демонстрируя повышенную точность и надёжность по сравнению с целостной аннотацией.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Набор данных EBike-DET, использованный в этом исследовании, состоит из изображений, собранных авторами с помощью съёмки на месте в лифтах, парковках и на улицах, а также из общедоступных изображений EBike, полученных с веб-платформ. Весь сбор изображений на месте проводился исключительно в нечастных условиях для технических исследований, связанных с безопасностью, в области обнаружения EBike. Изображения не направлены специально на отдельных лиц, и любые случайно захваченные лица не могут быть идентифицированы из-за расстояния, окклюзии, обзора сзади или соответствующей обработки, удаляющей черты лица и другие личные идентификаторы. Изображения, полученные в интернете, были получены исключительно с платформ, разрешающих повторное использование для академических исследований, или из ресурсов, выпущенных под открытыми лицензиями. Все изображения используются исключительно для некоммерческих исследований и образовательных целей. Поскольку не собирались идентифицируемые персональные данные и не происходило прямого взаимодействия с людьми, это исследование не требовало одобрения институционального этического комитета в соответствии с институциональными руководящими принципами автора.

1. Построение набора данных

  1. Разрешение изображения, цветовое пространство и форматы файлов
    1. Установите родное разрешение изображений на 1280 x 720 пикселей, чтобы запечатлеть высококачественные детали электронных знаков в различных сценах.
    2. После стандартизации измените размер изображений до 640 x 480 пикселей для баланса вычислительной эффективности и сохранения функций.
    3. Установите цветовое пространство на RGB для сохранения полной цветовой информации и точного распознавания признаков при различных условиях освещения.
    4. Сохраняйте изображения в формате JPEG, чтобы оптимизировать хранение без значительного ущерба качеству.
  2. Определение и разделение наборов данных для обучения, валидации и тестирования
    1. Разделите набор данных на обучающие, валидационные и тестовые наборы с соотношением 7:2:1, обеспечивая правильное разделение набора данных для обучения моделей, настройки гиперпараметров и оценки производительности.
    2. Установить случайное семя на 42, чтобы обеспечить воспроизводимость данных, разделённых по разным экспериментам.
    3. Применяйте стратифицированную выборку для поддержания единообразного распределения моделей EBike и уровней окклюзии в каждом разделении данных, не допуская дисбаланса классов между множествами.
    4. Убедитесь, что между обучением, валидацией и тестовыми наборами нет утечек, не появляясь ни одно изображение электронного письма в более чем одном наборе.
  3. Создание публичных наборов данных
    1. Выберите общедоступный набор данных для обнаружения электронных источников с открытойплатформы 20,21,22,23, которая содержит 210 изображений электронных книжек как в панорамных, так и в частично закрытых сценах.
    2. Осознайте ограничения публичного набора данных, включая угол одной камеры, низкое разрешение и простые фоновые сцены, которые могут ограничивать возможности модели обобщать, особенно в сложных ситуациях окклюзии.
  4. Построение наборов данных EBike-DET
    1. Сформировать набор данных EBike-DET для улучшения покрытия сцен и разнообразия выборок, включающий 1680 высококачественных изображений с веб-платформ и фотографии на месте.
    2. Убедитесь, что включены разнообразные среды, такие как лифты, парковки и улицы, фиксируя различные условия, в которых могут находиться EBikes.
    3. Используйте различные ракурсы камеры (спереди, боковые и сверху), чтобы запечатлеть полный спектр появлений в электронной литературе, обеспечивая надёжную подготовку для моделей обнаружения.
    4. Обогатите набор данных, включив несколько брендов и моделей электронных книг с вариациями цвета, размера и аксессуаров, чтобы увеличить разнообразие выборок.
    5. Убедитесь, что есть сценарии окклюзии, где электронные сайты частично закрыты пешеходами и транспортом, имитируя реальные условия в ограниченных пространствах, таких как лифты.
    6. Подтвердите, что набор данных EBike-DET включает разнообразные и сложные образцы, что делает его надёжным набором данных для обнаружения целей в сложных условиях окклюзии.
  5. Правила включения и исключения изображений на сайте и на сайте
    1. Веб-изображения: Включайте только те, что публично доступны, сняты в различных условиях, с высоким разрешением и разными условиями освещения. Исключайте изображения с низким разрешением или простыми фонами.
    2. Изображения на месте: включайте снимки, сделанные в реальной среде, особенно в таких местах, как лифты, парковки или улицы. Убедитесь, что изображения отражают реалистичные сценарии электронного образования с вариациями окклюзии, сложности фона и погодных условий. Исключайте изображения с чрезмерным шумом, искажениями или нереалистичными настройками.
    3. Убедитесь, что как веб-сайт, так и внешние изображения соответствуют одинаковым стандартам разрешения и цветового пространства, чтобы поддерживать согласованность по всему набору данных.
  6. Конструкция дополнения данных
    1. Применяйте базовые операции усиления, такие как масштабирование серого и вращение, чтобы увеличить разнообразие выборок и смоделировать различные условия освещения и ориентацию камеры.
    2. Разделите цель EBike на несколько независимых локальных регионов, включая область колеса, переднюю и заднюю зоны, чтобы улучшить локальное обучение функциям.
    3. Аннотируйте каждую область отдельно для повышения точности обнаружения при окклюзии и обеспечения надёжной производительности модели на различных деталях электронного образования.
    4. Проверьте, что все дополненные изображения и фрагментированные аннотации сохраняют структурную согласованность с особенностями EBike, чтобы избежать несоответствия или некорректности обучающих данных.

2. Аннотация локальных признаков с фрагментами

ПРИМЕЧАНИЕ: Для повышения точности обнаружения электронных знаков в сложных сценариях окклюзии предлагается метод аннотирования на части, основанный на улучшенных локальных признаках. Этот метод сегментирует область EBike, извлекая её локальные точки признаков, и определяет, следует ли аннотировать область на основе степени окклюзии в соответствующей области признаков. Детальный экспериментальный процесс иллюстрируется на рисунке 3.

  1. Используя ранее созданные наборы данных для обучения, валидации и тестирования.
  2. Ручное аннотирование: Используйте инструмент LabelImg в среде Python для ручного аннотаций. Помечайте все изображения исключительно как электронные снимки, обеспечивая минимальные помехи от негативныхобразцов 24,25.
  3. Обработка и дополнение данных
    1. Примените метод, предложенный Юнцзяном и др.22 , для удаления шума и стандартизации изображений с целью обеспечения равномерного размера по всему набору данных.
    2. Выполняйте операции по увеличению данных (например, вращение, регулировку яркости, масштабирование серого) для увеличения разнообразия выборок. Убедитесь, что все дополненные изображения сохраняют качество изображения и повышают прочность модели к различным фонам.
  4. Выкроение в области EBike
    1. Для обеспечения воспроизводимости локализации ROI примените параметры вывода из Таблицы 4 для YOLOv10 (используя yolov10x.pt предварительно обученный весовой файл). Координаты выходных ограничительных коробок следующие:
      ROI = [x1,y 1, x2, y2] (1)
      Уравнение (1) определяет координатыROI 26 с ограничивающими рамами [x1,y 1, x2, y2] , где:x 1, y1 = координаты верхнего левого угла ROI EBike; x2, y2 = координаты нижнего правого угла ROI EBike. Эти координаты получены из исходных данных YOLOv10, который предсказывает ограничивающие рамки в формате [c x,c y, w, h] для каждого обнаруженного объекта. Формулы преобразования следующие:
      figure-protocol-1(2)
      figure-protocol-2(3)
      figure-protocol-3(4)
      figure-protocol-4(5)
      Где cx,c y — нормализованные горизонтальные/вертикальные центральные координаты предсказанной ограничивающей рамки (масштабированной до размера входного изображения 640 x 480).  w, h — нормализованная ширина/высота предсказанного ограничивающего рамки (масштабированного до размера входного изображения).
    2. Отфильтруйте выходные данные YOLOv10 по порогу доверия (0,5), чтобы сохранить только обнаружения, связанные с электронным языком (идентификатор класса, соответствующий электровелосипеду), затем обработайте с помощью NMS (IoU=0,45) для удаления избыточных коробок. Преобразите оставшийся ограничивающий ящик в [x1,y 1, x2, y2] для обрезания ROI.
    3. Обработка множественных обнаружений
      ПРИМЕЧАНИЕ: В сценариях лифта (основная цель набора данных EBike-DET) EBike обычно являются одноэкземплярными (из-за ограничений по площади). Для случаев с несколькими обнаруженными электронными буквами (например, переполненные лифты с двумя электронными электронными карточками) применяются следующие правила.
      1. Приоритет с наивысшей доверительностью: выберите ограничивающую рамку с максимальным баллом доверия (уверенность выхода YOLOv10 отражает уверенность модели в том, что объект является электронным индексом).
      2. Проверка пространственной достоверности: Если при нескольких обнаружениях есть рейтинги доверия >0,7, проверьте пространственное перекрытие с границами конструкции лифта (например, избегайте ограничивающих рамок, выходящих за пределы стен лифта). Сохраняйте обнаружение, чей центр cx,c y, находится ближе всего к центру изображения (лифты обычно контролируются фронтальными камерами, а цели расположены по центру).
      3. Обработка крайних случаев: если ни одно достоверное обнаружение не достигает порога доверия (например, сильная окклюзия), отметьте изображение для ручной коррекции ROI (что составляет <3% от общего набора данных EBike-DET).
  5. Преобразование и нормализация в оттенках серого
    1. Выполните преобразование оттенков серого на обрезанном RGB-изображении из ROI. Используйте метод взвешенного среднего для преобразования, следуя формуле:
      Igra = 0,299 × R + 0,587 × G + 0,114 × B (6)
      где R, G и B представляют значения пикселей в красном, зелёном и синем каналах соответственно. Этот метод соответствует человеческому восприятию яркости при разных цветах.
    2. Нормализуйте значения пикселей изображения в оттенках серого до диапазона [0, 1], линейно масштабируя от [0, 255]. Эта нормализация повышает стабильность численных вычислений и гарантирует, что последующие вычисления градиентов и пороговые вычисления работают стабильно при изменяющихся условиях освещения.
  6. Обнаружение углов Харриса
    1. Примените обнаружение углов Харриса к оттенкам серого и нормализуйте область EBike для извлечения локальных точек признаков.
      ПРИМЕЧАНИЕ: Основной принцип обнаружения углов Харриса заключается в вычислении автокорреляционной матрицы для точного определения углов на изображении, как показано на рисунке 4B. Эти обнаруженные повороты обычно связаны с ключевыми элементами EBike, такими как колёса, передняя и задняя часть, которые часто демонстрируют чёткие черты поворотов.
    2. Вычислите градиент изображения, чтобы определить области значительных изменений интенсивности, как описано ниже.
      1. Сглаживание изображения: примените гауссовскую фильтрацию к оттенку серого для подавления шума, получая сглаженное изображение следующим образом:
        Is = Gσ*I (7)
        где * обозначает операцию свёртки, а Gσ — двумерное гауссово ядро со стандартным отклонением σ, которое управляет уровнем сглаживания. Типичное значение для — 1.0.
      2. Вычисление градиента изображения: Используйте оператор градиента (например, оператор Собеля) для вычисления горизонтальных (x) и вертикальных (y) градиентов сглаженного изображения:
        Ix =K x * Is ,Iy = Ky * Iy (8)
        где Ix и Iy — градиентные отображения в направлениях x и y соответственно, а Gx и Gy — ядра свёртки для оператора Собеля:
        figure-protocol-5, figure-protocol-6 (9)
      3. Постройте автокорреляционную матрицу M на основе ранее вычисленных градиентов, используя локальное окно W размером 3 x 3, центрированное в каждом пикселе (x,y):
        figure-protocol-7(10)
        В формуле W относится к локальному окну в позиции (x,y), а операция ∑W представляет сумму всех элементов изображения внутри этого окна; A = ∑W Ix2 представляет собой сумму квадратов градиентов в окне W в направлении x, отражая интенсивность изменений в направлении x; B=∑W Iy2 представляет собой сумму квадратов градиентов в окне W в направлении y, отражающую интенсивность изменений в направлении y; C = ∑W IxIy представляет собой сумму произведения градиентов в направлениях x и y внутри окна W, описывая корреляцию изменений между этими двумя направлениями.
      4. Вычислите сумму квадратов градиентов в обоих направлениях x, и y, чтобы отразить интенсивность изменений вдоль каждого направления. Перекрёстный член между градиентами Ix Iy отражает корреляцию между направлениями x и y.
      5. Функция отклика угла: вычислите функцию отклика R на основе детерминанта и трассы матрицы автокорреляции для обнаружения угловых точек на изображении. Вычислите значение отклика для каждого пикселя и выберите точки с более высокими значениями отклика в качестве финальных углов, как показано на рисунке 2. Функция отклика углов задаётся следующим образом:
        det(M) = A ⋅ B- C 2 (11)
        trace(M) = A + B (12)
        R = det(M) - k ⋅ (trace(M))2 (13)
        где det(M) — определитель M, отражающий общее изменение локальной области признаков, а trace(M) — след матрицы, отражающий общую интенсивность градиента в области. Эмпирическая константа k обычно устанавливается в диапазоне от 0,04 до 0,06.
        ПРИМЕЧАНИЕ: На основе экспериментов было установлено, что выбор k существенно влияет на результаты:
        При k=0,04 значения отклика слишком высоки, что приводит к избыточному количеству ошибочно обнаруженных угловых точек.
        При k=0.05 значения отклика более сбалансированы, точно обнаруживая истинные углы.
        При k=0.06 значения отклика слишком низкие, что затрудняет надёжное обнаружение угловых точек.
    3. Выполните крупнозернистое деление локальных площадей электронной библиотеки с использованием результатов обнаружения угловых точек Харриса. Разделите EBike на области на основе геометрической структуры и распределения угловых точек, как показано на рисунке 4C, чтобы повысить устойчивость модели и её эффективность обнаружения в сложных сценариях окклюзии.
    4. Площадь колеса: Считаем область действительной, если она содержит не менее 15 угловых точек, симметрично распределенных по круговой форме, с оценкой симметрии не менее 0,85. Оценка симметрии показана в уравнении 11. Соотношение ширины к высоте области колеса должно быть примерно 1:1, что гарантирует точное отражение геометрических характеристик колеса.
    5. Фронтальная область: включите область, если в ней есть не менее 10 угловых точек с показателем симметрии не менее 0,80, а отношение ширины к высоте составляет от 1,2:1 до 1,5:1, обеспечивая соответствие фронтальной части ожидаемым структурным особенностям.
    6. Задняя часть: Включите область, если в ней есть не менее 12 точек угла, с оценкой симметрии не менее 0,75 и соотношением ширины к высоте от 1,5:1 до 2:1, гарантируя, что задняя область соответствует ожидаемым геометрическим свойствам.
  7. Представление критически важных областей электронных букв с ограничивающими рамками
    1. Для преобразования угловых точек в прямоугольные ограничивающие рамки используйте алгоритм кластеризации DBSCAN. Этот метод группирует близлежащие угловые точки в кластеры, обеспечивая объединение угловых точек, образующих область. Установите максимальное расстояние между точками внутри кластера на 30 пикселей.
    2. Для каждого кластера угловых точек определите минимальные и максимальные координаты x и y. Эти координаты представляют собой рёбра ограничивающей рамки.
    3. Добавьте поле в 10 пикселей вокруг ограничивающего рамки, чтобы убедиться, что все релевантные функции включены. Этот запас компенсирует возможные несоответствия или неточности пикселей при обнаружении угловых точек.
    4. Округляйте ограничивающие координаты до ближайшего целого числа, чтобы обеспечить правильное выравнивание пикселей для обработки изображений.
    5. Представите финальные координаты ограничивающих рамок для i-го компонента (например, колесо, передняя и задняя область), как описано ниже.
      1. Объедините определённые области (область колеса, переднюю и заднюю зоны) и представите все критически важные области электронной книги с помощью прямоугольных ограничивающих рамок.
      2. Определите координаты ограничивающих рамок для компонента i (например, колесо, передняя область, задняя часть) как:
        figure-protocol-8(14)
        где Bi представляет ограничивающую рамку i-го компонента, а figure-protocol-9 и figure-protocol-10 — координаты верхнего-левого и нижнего правого углов соответственно.
  8. Обработка частичной окклюзии
    1. Оцените балл симметрии углов для каждой области. Допустим область, если балл симметрии больше или равен 0,7.
    2. Для обращения с окклюзией измеряйте видимость точек углов. Примите область, если видно хотя бы 50% углов. Если видны 30%-50% углов, пометьте регион для дальнейшего просмотра. Если видно менее 30% углов, отвергайте область из-за недостаточной видимости для точного обнаружения.
  9. Оценка точности локальных областей признаков
    1. Оценивайте точность каждой локальной области признаков с помощью трёх количественных операционных метрик: метрики симметрии S, метрики непрерывности контуров C и метрики структуры соединений L. Применяйте эти метрики равномерно к площади колеса, передней и задней зонам.
    2. Принимайте регион только тогда, когда все метрики соответствуют заранее заданным порогам. Если одна метрика не соответствует допустимому диапазону, увеличите ROI и переоцените её. Если две или более метрик не работают, отметьте регион как ненадёжный.
  10. Анализ точности признаков в области колеса
    1. Оперативный контрольно-пропускной пункт с передним видом
      1. Вычислите метрику симметрии:
        figure-protocol-11(15)
        где nL и nR обозначают количество углов в левом и правом сторонах.
      2. Примите регион, если S ≥ 0.85. Как показано на рисунке 5A, колесо имеет круглую форму с симметрией, а угловые точки Харриса вдоль окружности образуют симметричный узор. Поэтому аннотировать всю область колеса.
      3. Если 0,70 ≤ S<0,85, увеличьте ROl на 10-20 пикселей и повторите оценку, чтобы позволить большему числу реальных признаков вновь войти в область вычислений, после чего переоцените. Как показано на рисунке 5D, происходит частичная окклюзия колеса, поэтому диапазон кадрирования следует расширить, чтобы охватить больше характеристик электровелосипеда для оценки.
      4. Если S<0.70, помечайте регион как ненадёжный. Как показано на рисунке 5G, круглая форма нарушена; Исключить этот регион из аннотации.
    2. Боковой оперативный контрольный пункт
      1. Измерять непрерывность контуров с помощью следующих:
        figure-protocol-12 (16)
      2. Принимайте, когда C ≥ 0,75. Как показано на рисунке 5B, отношение фактической длины непрерывной дуги к ожидаемой длине дуги соответствует требованиям, контур полностью подходит к краю, и явного разрыва нет.
      3. Если 0,55 ≤ C < 0,75, уточните контурную экстракцию и повторите проверку. Как показано на рисунке 5E, текущее отношение непрерывной длины дуги к ожидаемой длине дуги находится в критическом диапазоне; необходимо скорректировать порог алгоритма извлечения, чтобы сделать контур более полным.
      4. Если C < 0,55, отвергайте область из-за недостаточной геометрической непрерывности. Как показано на рисунке 5H, требования к анализу не могут быть выполнены.
    3. Оперативный контрольно-пропускной пункт с верхнего вида
      1. Оценить структурную связность с помощью следующих:
        figure-protocol-13 (17)
      2. Принимай, когда L ≥ 0.70. Как показано на рисунке 5C, отклонение между наблюдаемым расстоянием и ожидаемым расстоянием фактически компенсируется, структурная связность соответствует требованиям, а относительная связь между транспортным средством и средой лифта завершается.
      3. Если L < 0,70, расширьте ROI и переоцените. Как показано на рисунке 5F, текущее отклонение между наблюдаемым расстоянием и ожидаемым расстоянием относительно велико; необходимо расширить область анализа и включить больше окружающих структур для повышения точности оценки связности.
      4. Если связь остаётся нестабильной, классифицируйте регион как ненадёжный. Как показано на рисунке 5I, её нельзя использовать как эффективную область анализа.
  11. Анализ точности признаков фронтальной области
    1. Для оценки точности признаков передней области электронной марки следует единой основной на правилах, определённой в разделе 2.10, включая оценку симметрии при фронтальном виде с использованием метрики S, определённой в уравнении 15, оценку непрерывности контуров в боковом виде с использованием метрики C, определённой в уравнении 16, и проверку структурной связности в верхнем виде с использованием метрики L, определённой в уравнении 17.
    2. Из-за геометрической изменчивости и частой частичной окклюзии в передней части используйте умеренно расслабленные пороги по сравнению с областью колеса. Фронтальная область принимается, когда S ≥ 0,80, C ≥ 0,70, а L ≥ 0,65. Как показано на рисунке 6A-C, области, удовлетворяющие этим критериям, демонстрируют сбалансированные лево-правые распределения признаков, когерентные контуры и стабильную структурную связность.
    3. Если какая-либо метрика попадает в промежуточный диапазон, указанный в разделе 2.10, расширите интересующую область и переоцените с учетом дополнительных контекстуальных признаков, как показано на рисунке 6D-F. Регионы, не соответствующие минимальным критериям после повторной оценки, классифицируются как ненадёжные, как показано на рисунке 6G-I.
  12. Анализ точности задней части
    1. Для анализа точности признаков задней части придерживайтесь протокола оценки, определённого в разделе 2.10, используя метрики S, как в уравнении 15, C как в уравнении 16, и L, как в уравнении 17 под фронтальным, боковым и верхним видом соответственно.
    2. Задняя часть более подвержена окклюзии, вызванной пассажирами, несущими предметами или конструкциями лифта. Поэтому применяйте более строгие условия отклонения, чтобы избежать ненадёжных аннотаций. Область задней части принимается, когда S ≥ 0,75, C ≥ 0,70, а L ≥ 0,65. Репрезентативные допустимые случаи с достаточной симметрией, непрерывностью контуров и связности показаны на рисунке 7A-C.
    3. Для областей с пограничными метрическими значениями выполните расширение и повторную оценку ROI, как показано на рисунке 7D-F. Если геометрические отношения остаются неоднозначными или метрики не соответствуют критериям принятия, отметьте регион как ненадёжный, как показано на рисунке 7G-I.
  13. Анализ точности характеристик задней части
    1. Для анализа точности признаков задней площади следуйте протоколу оценки, определённому в разделе 2.10, используя те же метрики S, что и в уравнении 15, C, как в уравнении 16, и L, как в уравнении 17, под соответствующими точками зрения.
    2. По сравнению с передней частью, задняя часть более подвержена окклюзии, вызванной пассажирами, переносимыми предметами и внутренними конструкциями лифта. Поэтому применяйте немного более строгие критерии отклонения, чтобы предотвратить ненадёжные аннотации. Область задней части принимается, когда S ≥ 0,75, C ≥ 0,70, а L ≥ 0,65. Как показано на рисунке 7A-C, принятые области сохраняют достаточную симметрию, когерентность контуров и структурную связность.
    3. Для регионов с пограничными метрическими значениями развернуть и переоценить ROI в соответствии с разделом 2.10, как показано на рисунках 7D-F. Если геометрическая согласованность остаётся недостаточной после повторной оценки, отметьте область как ненадёжную, как показано на рисунке 7G-I.
  14. Реализация конвейера
    1. Структура файлов и папок: реализация использует модульную структуру каталогов, разделяющую обнаружение, локальное извлечение признаков и суждение по аннотациям. См. организацию представительных папок, показанную ниже. Храните все промежуточные результаты в выделенных подпапках для независимого осмотра каждого этапа обработки.
      project_root/

      ├── data/
      │ ├── изображения/
      │ │ ├── поезд/
      │ │ ├── Вал/
      │ │ └── тест/
      │ └── аннотации/

      ├── обнаружение/
      │ ├── detect_ebike.py
      │ └── yolov10_config.yaml

      ├── roi/
      │ ├── crop_roi.py
      │ └── cropped_images/

      ├── Харрис/
      │ ├── harris_corner.py
      │ └── corner_visualization/

      ├── chunk_annotation/
      │ ├── region_partition.py
      │ ├── validity_judgment.py
      │ └── final_annotations/

      └── конфигурации/
      └── thresholds.yaml
    2. Конвейер выполнения и примерные командные строки
      1. Обнаружение EBike и локализация ROI: локализуйте области EBike с использованием предварительно обученной модели обнаружения объектов. Результаты обнаружения хранят в виде координат ограничивающих коробок.
        Обнаружение python/detect_ebike.py \
        --вводные данные/изображения/тест/ \
        --выход ROI/detections.json
      2. ROI обрезка: используйте обнаруженные ограничивающие рамки для обрезания e-ike областей из оригинальных изображений.
        Python Roi/crop_roi.py \
        --обнаружения ROI/detections.json \
        --images data/images/test/ \
        --output roi/cropped_images/
        Сохраняйте каждое обрезанное изображение в формате названия: imageID_roi_xmin_ymin_xmax_ymax.jpg
      3. Извлечение углов Харриса: примените обнаружение углов Харриса к каждому обрезанному ROI после преобразования в оттенках серого. Сохраняйте карты отклика по углам и визуальные наложения для осмотра.
        Python Harris/harris_corner.py \
        --введите roi/cropped_images/ \
        --output Harris/corner_visualization/ \
        --config configs/thresholds.yaml
      4. Крупнозернистое разбиение и аннотация кусков: Разбийте локальные области признаков на колёсные, передние и задние области на основе пространственного распределения угловых точек. Применяйте суждение по валидности с использованием геометрических и признаков.
        Python chunk_annotation/region_partition.py \
        --корнерс Харрис/corner_visualization/ \
        --выход chunk_annotation/final_annotations/
    3. Ожидаемые промежуточные выходы и визуальные контрольные точки: Сохраняйте промежуточные выходы, создаваемые каждым этапом обработки, которые служат визуальными контрольными точками. Эти промежуточные выходы позволяют пошагово проверять локализацию ROI, качество извлечения углов, разбиение регионов и окончательные решения об аннотации.
      1. Выход кадрирования ROI: Сохраняйте обрезанные изображения в электронной литературе в roi/cropped_images/. Каждое изображение содержит отдельную область электронной системы, извлечённую из оригинального кадра.
      2. Визуализация углов Харриса: Сохранить наложения углов в Harris/corner_visualization/. Для допустимых областей колеса вдоль круговой структуры ободка наблюдается плотный набор угловых точек. На этом этапе можно определить области с недостаточными угловыми реакциями.
      3. Результаты разделения регионов: визуализируйте разделённые области (колесо, передняя и задняя область) независимо от этого. Сохранять только области, которые соответствуют заранее заданным критериям достоверности (например, достаточной плотности углов и геометрической согласованности).
      4. Итоговый вывод аннотации: Храните принятые регионы в chunk_annotation/final_annotations/ в виде структурированных файлов аннотаций. Исключайте области, не допускающие суждения по валидности, и не распространяйте их на последующие этапы.
        ПРИМЕЧАНИЕ: Все пороги, используемые для обнаружения углов и оценки валидности регионов, централизованы в конфигурационных файлах. Конвейер работает на входах одного кадра без временной зависимости, что позволяет воспроизводить результаты независимо для каждого изображения. При одинаковых входных изображениях, конфигурационных файлах и порядке выполнения генерируемые промежуточные выходы и конечные аннотации остаются детерминированными.
  15. Этапы финализации и выпуск наборов данных
    ПРИМЕЧАНИЕ: Чтобы протокол завершался с чёткой и воспроизводимой конечной точкой, определен этап финализации для консолидации сбережения аннотаций, проверки качества, упаковки наборов данных и документации версий.
    1. Сохранение финальных аннотаций: после оценки достоверности региона сохраняйте все принятые аннотации в формате chunk_annotation/final_annotations/ в формате текста YOLO, при этом каждый изображение соответствует одному файлу аннотаций. Сохранять только области, которые удовлетворяют заранее заданным геометрическим и призначеским критериям в итоговом наборе аннотации, и исключать отвергнутые или ненадёжные области из дальнейшего использования.
    2. Валидация качества аннотаций: Проверьте качество окончательной аннотации, повторно применяя те же критерии валидности, используемые при оценке региона, включая симметрию, непрерывность контуров и метрики структурной связности. Удалять аннотации, не соответствующие этим критериям, на этом этапе проверки, обеспечивая согласованность между генерацией аннотаций и контролем качества.
    3. Упаковка наборов данных: после валидации организуйте изображения и аннотации по фиксированным разделениям обучения, валидации и тестирования в соответствии с определённым разделом набора данных. Структура каталогов и списки файлов на этом этапе замораживаются, а упакованный набор данных готовится к обучению и оценке без дальнейших изменений.
    4. Документация по версиям и seed: Конфигурационные файлы, включая параметры обнаружения углов и пороги валидности регионов, сохраняются вместе с упакованным набором данных. Используйте случайные сиды для разделения данных, исправления выполнения алгоритмов и записи. Кроме того, документируйте версии весов моделей, конфигурационных файлов и инструментов аннотирования. Имея идентичные входные данные, конфигурационные файлы и записанные семена, окончательные аннотации и разделения наборов данных остаются детерминированными.

3. Дополнение данных

ПРИМЕЧАНИЕ: Предыдущее исследование показало, что обучающие наборы данных, не обладающие достаточной предварительной обработкой и дополнением данных, часто приводят к снижению производительностимодели 22. Для решения этих проблем была выполнена следующая процедура.

  1. Освещение
    1. Моделировать колебания освещения внутри лифтов для устранения частых изменений освещения, регулируя коэффициент яркости в диапазоне 0,6–1,4 с вероятностью 0,8.
    2. Применяйте регулировку интенсивности освещения для перехода от яркого к тусклому, имитируя размытость, вызванную движением в электронной литературе. Используйте вероятность 0,7 для этой операции.
    3. Генерируйте усиленные образцы путём регулировки условий освещения, обеспечивая стабильную видимость при различном уровне освещения.
    4. Применяйте эти операции освещения офлайн и храните их для последующей обработки. Установите случайное сида на 42, чтобы обеспечить воспроизводимость процесса аугментации.
  2. Окклюзия
    1. Создайте сцены синтетической окклюзии, чтобы отразить переполненность лифтов. Применяйте маски окклюзии (например, человеческие силуэты, блокировки объектов) с вероятностью 0,6.
    2. Применяйте мозаичные окклюзии, имитируя частичную обструкцию EBikes при входе и выходе из лифта. Используйте проценты окклюзии 30%, 50% или 70%, и убедитесь, что окклюзия применяется случайным образом в любом квадранте (верх, снизу, левый, правый) изображения.
    3. Включите окклюзированные образцы для повышения устойчивости обнаружения при частичной видимости, обеспечивая видимость хотя бы одного ключевого компонента (например, колеса, передняя, задняя часть).
    4. Проведите дополнение окклюзии офлайн и проверьте образцы, чтобы сохранить важные функции электронной системы. Установить случайное семя на 42 для воспроизводимости.
  3. Смотровые точки
    1. Регулируйте углы обзора в заранее заданном диапазоне ±15°, чтобы имитировать различные ракурсы камеры в различных условиях лифта. Эту операцию следует применять с вероятностью 0,7.
    2. Применяйте преобразования перспективы с коэффициентами искажения от 0,0 до 0,2 для воспроизведения различных позиций камеры (например, приподнятых, боковых и косых точек обзора).
    3. Масштабируйте и сдвините область EBike на 0,8–1,2 раза, чтобы смоделировать изменения расстояния камеры от цели. Применим это преобразование с вероятностью 0,8.
    4. Убедитесь, что все преобразования точки зрения сохраняют геометрическую целостность электронной книги и что критические признаки не искажаются.
    5. Выполняйте трансформации точки обзора офлайн и сохраняйте дополненные изображения. Установить случайное семя на 42 для воспроизводимости.
  4. Улучшение
    1. Примените масштабирование серого к 30% изображений с вероятностью 0,3, чтобы добавить вариации, обусловленные яркостью, и повысить устойчивость модели при слабом освещении.
    2. Используйте гистограммную эквализацию на 20% образцов для улучшения контраста и видимости ключевых особенностей электронного компьютера при сложных условиях освещения.
    3. Комбинируйте стратегии освещения, окклюзии и расширения точки зрения последовательно для получения выборок с высоким разнообразием. Используйте вероятности 0,9 для этого многошагового процесса.
    4. Проверьте дополненные образцы, чтобы убедиться, что они сохраняют структурную целостность EBike, прежде чем интегрировать их в итоговый набор данных.
    5. Выполняйте операции улучшения офлайн и сохраняйте изображения для последующего обучения. Установить случайное сида на 42, чтобы обеспечить воспроизводимость всего процесса аугментации.

4. Экспериментальная среда

  1. Настройте экспериментальную среду для обеспечения вычислительной эффективности и стабильности во время обучения и тестирования моделей.
  2. Используйте современный многоядерный процессор, выделенный GPU для ускорения глубокого обучения, достаточную память и стабильную систему хранения данных для поддержки крупномасштабной обработки изображений на EBike.
  3. Сопоставьте программную среду с аппаратной конфигурацией, устанавливая совместимые версии фреймворка глубокого обучения, драйверы GPU и библиотеки ускорения для оптимизации скорости обучения и производительности вывода.
  4. См. таблицы 5, 6, 7 и таблицу 8 для подробной аппаратной характеристики, программной среды, зависимости моделей и настроек оборудования для визуализации для обеспечения воспроизводимости.
  5. Вычислительные накладные расходы и анализ во время выполнения
    1. Проанализировать вычислительные накладные расходы, связанные со стратегией аннотирования на частях, с точки зрения сложности аннотаций и эффективности выполнения. В сравнении с целостной аннотацией, аннотация с частями представляет электронную книгу с использованием областей уровня деталей, включая область колеса, переднюю и заднюю зоны. Аннотируйте эти области только тогда, когда они видимы и соответствуют заранее заданным геометрическим и призначеским критериям валидности, а не обязательно применяются для каждого экземпляра.
      ПРИМЕЧАНИЕ: С точки зрения аннотации увеличение количества меток остаётся ограниченным и структурно ограниченным. Экземпляр электронной литературы вносит не более трёх аннотаций на уровне части, тогда как меньше областей аннотируется в случаях частичной окклюзии (например, когда видна только передняя область). В результате количество меток на изображении меняется в зависимости от видимости сцены и условий окклюзии, а среднее количество меток умеренно увеличивается, как изложено в таблице 9. Эта конструкция балансирует локальное представление признаков с сложностью аннотации. С точки зрения вывода, аннотация с частями не приводит к пропорциональному увеличению стоимости постобработки. Хотя детектирование на уровне части может генерировать дополнительные кандидат-ограничивающие рамки, обнаружения агрегируются на уровне объекта EBike для окончательной оценки, а фильтрация на основе доверия применяется перед послеобработкой. Эта условная, ориентированная на видимость стратегия аннотаций ограничивает ненужные кандидаты на обнаружение. Для моделей, таких как YOLOv10, которые снижают зависимость от традиционного немаксимального подавления, дополнительные накладные расходы, создаваемые чанкингом, на практике остаются ограниченными.
    2. Оцените производительность во время выполнения при типичном разрешении для наблюдения с лифтом 640 x 480 пикселей с помощью видеокарты NVIDIA RTX 3090. Как показано в таблице 9, аннотация с частями сохраняет возможность вывода в реальном времени, при этом частота кадров в секунду лишь незначительно снижена по сравнению с целостной аннотацией. Эти результаты показывают, что стратегия аннотирования с блоками по-прежнему подходит для мониторинга электронных электронных ресурсов в реальном времени в условиях лифтов.

5. Метрики оценки

ПРИМЕЧАНИЕ: Хотя фрагментированные аннотации используются во время обучения и вывода, оценка проводится на уровне объекта электровелосипеда. Обнаружения на уровне деталей объединяются в единое решение по электровелосипеду согласно правилам, определённым в разделе 2.4,3.

  1. Применять стандартные метрики оценки, широко используемые в исследованиях обнаруженияцелей 27 для всесторонней оценки эффективности алгоритмов в сценариях обнаружения окклюзии на электронном языке.
  2. Точность обнаружения (P)
    1. Используйте уравнение (8) для вычисления точности обнаружения, которое измеряет долю правильно идентифицированных электронных электронных знаков среди всех предсказанных положительных образцов.
      figure-protocol-14 (18)
      где TP обозначает истинные положительные результаты, а FP — ложноположительные.
    2. Установите порог IoU на уровне 0,5, чтобы определить, совпадают ли предсказанные ограничивающие рамки с правдой на земле.
    3. Используйте точность для оценки способности модели снижать ненужные сигналы тревоги, вызванные ошибочной идентификацией неэлектронных объектов.
    4. Команды для генерации этой метрики: используйте соответствующий скрипт оценки (например, evaluate_precision.py). Сохранить результаты precision_results.txt для дальнейшего анализа.
  3. Скорость отзыва (R)
    1. Используйте уравнение (9), чтобы определить, насколько эффективно модель идентифицирует электронные книги в условиях лифта, особенно когда окклюзия влияет на видимость.
      figure-protocol-15(19)
      где FN представляет ложноотрицательные результаты.
    2. Установите порог IoU на уровне 0,5 для оценки точности обнаружения. Используйте отсрочку для оценки способности модели минимизировать пропущенные обнаружения, обеспечивая точную идентификацию электронных семей даже при частичной блокировке.
    3. Используйте команды(и) для генерации этой метрики: выполните evaluate_recall.py. Сохранение приводит к recall_results.txt.
      ПРИМЕЧАНИЕ: Пропущенные обнаружения критически важны при переполненных лифтах и должны быть минимизированы для безопасности. Пропущенные обнаружения представляют угрозу безопасности в условиях переполненности лифтов и должны быть минимизированы.
  4. Счёт в Формуле-1
    1. Вычислите результат F1 с помощью уравнения (10), чтобы получить сбалансированное представление точности и эффективности воспоминания модели.
      figure-protocol-16(20)
    2. Используйте результат F1 для обеспечения комплексной оценки, особенно в ситуациях, когда точность и воспоминание имеют компромиссы при различных уровнях окклюзии.
    3. Используйте команды(ы) для генерации этой метрики: Запустите evaluate_f1.py для вычисления результата F1. Сохранение f1_score_results.txt.
  5. Средняя средняя точность (mAP)
    1. Используйте уравнение (11) для измерения общей способности модели к обнаружению при различных внешних видах EBike, условиях окклюзии и вариациях освещения.
      figure-protocol-17 (21)
      Где APc обозначает среднюю точность категории c , а C — количество категорий.
    2. Установите порог IoU на уровне 0,5 для оценки производительности модели в различных категориях.
    3. Используйте mAP@0.5, чтобы определить, насколько хорошо модель адаптируется к различным визуальным условиям в условиях лифта, обеспечивая всестороннюю оценку эффективности обнаружения.
    4. Используйте следующие команды(и) для генерации этой метрики: выполните evaluate_map.py с указанными параметрами. Сохранение приводит к map_results.txt.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сравнение холистической аннотации и аннотации на частях в публичных наборах данных

Оценка проводилась на публичном наборе данных, включающем 210 EBike изображений, собранных с открытых мест наблюдения и мониторинга движения, с разными условиями освещения, цветами электронных электронных источников и разной степенью окклюзии. Каждое изображение было аннотировано как с помощью целостного метода (одинарный ограничивающий блок), так и предложенног...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Критические шаги

Критическим этапом в этом протоколе является метод аннотирования на части, основанный на локальных признаках, при котором электронные данные сегментируются на колёсные, передние и задние зоны. Это разделение гарантирует, что модели обнаружения могут изучать мелкозернистые представления, что оказалось необходимым в условиях элеваторов с высокой окклюзией. Например, YOLOv5, обученный с аннотациями на частях на наборе данных EBi...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликтов интересов.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была поддержана Фондом планирования исследований в области гуманитарных и социальных наук Министерства образования Китая на 2025 год (грант No 25YJAZH002), проектом по повышению потенциала исследований ключевых дисциплин провинции Гуандун 2024 года (грант No 2024ZDJS086), программой обучения бакалавров бакалавров в области инноваций и предпринимательства провинции Гуандун в 2024 году (грант No S202413714017), а также Программой связи между занятостью и образованием Министерства образования: «Инновации и практика механизма подготовки талантов для студентов, ориентированных на технологии искусственного интеллекта» (Грант No 2025072869464).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
h5py (SSD)Группа HDF2.10.0
matplotlib (SSD)Сообщество Матплотлиб3.1.2
matplotlib (YOLOv10)Сообщество Матплотлиб3.9.0
matplotlib (YOLOv5)Сообщество Матплотлиб3.8.4
matplotlib (YOLOv5+SAHI)Сообщество Матплотлиб3.8.4
matplotlib (YOLOv8-Seg)Сообщество Матплотлиб3.9.0
numpy (SSD)Сообщество NumPy1.17.0
numpy (YOLOv10)Сообщество NumPy1.26.3
numpy (YOLOv5)Сообщество NumPy1.26.4
numpy (YOLOv5+SAHI)Сообщество NumPy1.26.4
numpy (YOLOv8-Seg)Сообщество NumPy1.26.3
onnx (YOLOv10)ONNX1.14.0
onnx (YOLOv5)ONNX1.14.0
onnx (YOLOv5+SAHI)ONNX1.14.0
onnxruntime (YOLOv10)Microsoft1.15.1
onnxruntime (YOLOv5)Microsoft1.15.1
onnxruntime (YOLOv5+SAHI)Microsoft1.15.1
opencv-python (SSD)OpenCV4.1.2.30
opencv-python (YOLOv10)OpenCV4.9.0.80
opencv-python (YOLOv5)OpenCV4.9.0.80
opencv-python (YOLOv5+SAHI)OpenCV4.9.0.80
opencv-python (YOLOv8-Seg)OpenCV4.9.0.80
Панды (YOLOv10)Сообщество панд2.2.2
Панды (YOLOv5)Сообщество панд2.2.2
Панды (YOLOv5+SAHI)Сообщество панд2.2.2
Панды (YOLOv8-Seg)Сообщество панд2.2.2
Подушка (SSD)Разработчики подушек8.2.0
Подушка (YOLOv10)Разработчики подушек10.2.0
Подушка (YOLOv5)Разработчики подушек8.5.0
Подушка (YOLOv5+SAHI)Разработчики подушек8.5.0
Подушка (YOLOv8-Seg)Разработчики подушек10.2.0
psutil (YOLOv10)Разработчики Psutil5.9.8
psutil (YOLOv5)Разработчики Psutil5.9.8
psutil (YOLOv5+SAHI)Разработчики Psutil5.9.8
pycocotools (YOLOv10)Консорциум COCO2.0.7
pycocotools (YOLOv5)Консорциум COCO2.0.7
pycocotools (YOLOv5+SAHI)Консорциум COCO2.0.7
pycocotools (YOLOv8-Seg)Консорциум COCO2.0.7
py-cpuinfo (YOLOv10)Разработчики Py-CPUInfo9.0.0
py-cpuinfo (YOLOv5)Разработчики Py-CPUInfo9.0.0
py-cpuinfo (YOLOv5+SAHI)Разработчики Py-CPUInfo9.0.0
PyYAML (YOLOv10)PyYAML6.0.1
PyYAML (YOLOv5)PyYAML6.0.1
PyYAML (YOLOv5+SAHI)PyYAML6.0.1
PyYAML (YOLOv8-Seg)PyYAML6.0.1
Запросы (SSD)Запросы на Python2.27.1
requests (YOLOv10)Запросы на Python2.32.3
Запросы (YOLOv5)Запросы на Python2.31.0
Запросы (YOLOv5+SAHI)Запросы на Python2.31.0
САХИРазработчики SAHI0.3.4+
scipy (SSD)Сообщество SciPy1.2.1
Скипи (YOLOv10)Сообщество SciPy1.13.0
Скипи (YOLOv5)Сообщество SciPy1.13.0
Сципи (YOLOv5+SAHI)Сообщество SciPy1.13.0
Скипи (YOLOv8-Seg)Сообщество SciPy1.13.0
seaborn (YOLOv10)Разработчики Seaborn0.13.2
seaborn (YOLOv5)Разработчики Seaborn0.13.2
seaborn (YOLOv5+SAHI)Разработчики Seaborn0.13.2
seaborn (YOLOv8-Seg)Разработчики Seaborn0.13.2
Красивый (YOLOv5+SAHI)Стройные разработчики2.0.4
SSDКофе/оригинальные авторы SSDPython 3.6.13+; PyTorch 1.2.0+; CUDA 10.0; CUDNN 7.4.1
Тензорборд (SSD)Google2.10.1
Тензорборд (YOLOv5)Google2.16.2
Тензорборд (YOLOv5+SAHI)Google2.16.2
torchvision (SSD)PyTorch0.4.0
torchvision (YOLOv10)PyTorch0.15.2
torchvision (YOLOv5)PyTorch0.17.2
torchvision (YOLOv5+SAHI)PyTorch0.17.2
torchvision (YOLOv8-Seg)PyTorch0.16.1+
tqdm (SSD)Разработчики TQDM4.60.0
tqdm (YOLOv10)Разработчики TQDM4.66.4
tqdm (YOLOv5)Разработчики TQDM4.66.2
tqdm (YOLOv5+SAHI)Разработчики TQDM4.66.2
Ультралитики (YOLOv8-Seg)Ultralytics8.2.99+
YOLOv10Команда YOLOv10Python 3.8.0+; PyTorch 2.0.1+куб.118; CUDA 11,8; CUDNN 8.7
YOLOv5UltralyticsPython 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2
YOLOv5 + SAHIРазработчики Ultralytics + SAHIPython 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2
YOLOv8-SegUltralyticsPython 3.8.0+; PyTorch 2.0.1+куб.118; CUDA 11,8; CUDNN 8.6.0+

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Li, Y., Han, L., Ning, X., Xu, Y. Fire risk of electric bicycle based on fuzzy Bayesian network. J Phys Conf Ser. 1578 (1), 012153-012160 (2020).
  2. Cao, F., Sheng, G., Feng, Y. Detection dataset of electric bicycles for lift control. Alexandria Eng J. 105 (1), 736-742 (2024).
  3. Zhang, J., Mohd Yunos, Z., Haron, H. Interactivity recognition graph neural network model for improving human-object interaction detection. Electronics. 12 (2), 470-482 (2023).
  4. Yang, D., Su, C., Wu, H., Xu, X., Zhao, X. Shelter identification for shelter-transporting AGV based on improved YOLOv5. IEEE Access. 10 (1), 119132-119139 (2022).
  5. Wang, X., et al. LDS-YOLO: A lightweight small object detection method for dead trees. Comp Electron Agri. 198 (1), 107035-107044 (2022).
  6. Xu, R., Zhu, D., Chen, M. A novel underwater object detection enhanced algorithm based on YOLOv5-MH. IET Image Process. 18 (10), 3415-3429 (2024).
  7. Shang, J., Wang, J., Liu, S., Wang, C., Zheng, B. Small target detection algorithm for UAV aerial photography based on improved YOLOv5s. Electronics. 12 (11), 2434-2446 (2023).
  8. Wang, C. Y., Liao, H. Y. M. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems. APSIPA Trans Signal Inf Process. 13 (1), 1-18 (2024).
  9. Sapkota, R., et al. YOLO11 to its genesis: A decadal and comprehensive review of the YOLO series. Artif Intell Rev. 58 (2), 145-182 (2025).
  10. Huang, Z., Yin, Z., Ma, Y., Fan, C., Chai, A. Mobile phone component object detection based on improved SSD. Procedia Comp Sci. 183 (1), 107-114 (2021).
  11. Li, Y., Yang, F., Li, Y., Tan, C., Liu, Z. Circuit breaker identification based on SSD. J Phys Conf Ser. 2418 (1), 012080-012088 (2023).
  12. Deng, X., Li, S. Improved SSD object detection based on attention mechanism and feature fusion. J Phys Conf Ser. 2450 (1), 012088-012096 (2023).
  13. Huo, B., Li, C., Zhang, J., Xue, Y., Lin, Z. SAFF-SSD: Self-attention combined feature fusion SSD for small object detection. Remote Sens. 15 (12), 3027-3041 (2023).
  14. Murphy, K., Torralba, A., Eaton, D., Freeman, W. Object detection and localization using local and global features. Lect Notes Comp Sci. 4170 (1), 382-400 (2006).
  15. Mamat, N., Othman, M. F., Abdulghafor, R., Alwan, A. A., Gulzar, Y. Enhancing image annotation technique for fruit classification using deep learning. Sustainability. 15 (2), 901-915 (2023).
  16. Zhang, T., Jia, K., Xu, C., Ma, Y., Ahuja, N. Partial occlusion handling via robust part matching. Proc IEEE CVPR. 2014 (1), 1258-1265 (2014).
  17. Howard, A. G. Improvements on deep convolutional neural network based image classification. Tech Rep. 1 (1), 1-12 (2013).
  18. Zhang, H. Mixup: Beyond empirical risk minimization. arXiv. , (2017).
  19. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).
  20. Qin, J., Xu, N. Social distancing monitoring based on SSD. Procedia Comp Sci. 183 (1), 768-775 (2021).
  21. Zhong, P., Liu, Y., Zheng, H., Zhao, J. Detection of urban flood inundation using traffic images. Water Resour Manag. 38 (2), 287-301 (2024).
  22. Aamir, S. M., Ma, H., Khan, M. A. A., Aaqib, M. Real-time object detection in occluded environments with background clutter. Multimed Tools Appl. 83 (4), 11245-11261 (2024).
  23. Jia, K., Niu, Q., Wang, L., Niu, Y., Ma, W. Multi-object detection and size calculation for blended tobacco shreds. Sensors. 23 (18), 8380-8395 (2023).
  24. Sun, S., et al. Multi-YOLOv8 for infrared moving small object detection. Neurocomputing. 588 (1), 127685-127696 (2024).
  25. Sadik, M. N., Hossain, T., Sayeed, F. Real-time detection and analysis of vehicles and pedestrians using deep learning. Int J Comp Vis Robot. 14 (3), 215-229 (2024).
  26. Zhang, C., Jiao, P. YOLO series target detection algorithms for underwater environments. Ocean Eng. 279 (1), 114353-114366 (2023).
  27. Luo, B., Xiong, J., Xu, L., Pei, Z. Superpixel segmentation based on global similarity and contour region transform. IEICE Transac Info Sys. E103D (3), 716-719 (2020).
  28. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications and challenges. Comp Electr Eng. 117 (1), 109246-109268 (2024).
  29. Khurshid, S., Basharat, S., Afzal, S. The magic of artificial intelligence-2. Artif Intell Hum Health Dis. 1 (1), 29-46 (2025).
  30. Pan, W., Chen, J., Lv, B., Peng, L. Improved YOLOv9s-UI for underwater object detection. Appl Sci. 14 (14), 7162-7175 (2024).
  31. Zhang, J., Yunos, Z. M., Haron, H. Parallel multi-head graph attention network for human-object interaction detection. IEEE Access. 11 (1), 131708-131725 (2023).
  32. Li, L., Gao, S., Wu, F., An, X. MBAN: Multi-branch attention network for small object detection. PeerJ Comp Sci. 10 (1), e1965-e1980 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Chunked Image AnnotationLocal Feature DetectionElectric Bike DetectionElevator Object DetectionOcclusion RobustnessEBike DET DatasetExplainable AIStructural AnnotationYOLOv5 DetectionSafety Monitoring
Video Coming Soon

Related Articles