Представлен метод аннотаций с фрагментами изображений, основанный на локальных признаках, для улучшения обнаружения электровелосипедов в сложных сценариях лифтов с использованием набора данных EBike-DET и основных моделей обнаружения объектов.
Method Article
Представлен метод аннотаций с фрагментами изображений, основанный на локальных признаках, для улучшения обнаружения электровелосипедов в сложных сценариях лифтов с использованием набора данных EBike-DET и основных моделей обнаружения объектов.
Рост использования электровелосипедов (EBikes) в ограниченных условиях, таких как жилые лифты, вызвало серьёзные проблемы с безопасностью и создало серьёзные трудности для автоматизированного обнаружения объектов, особенно из-за частых окклюзионных объектов. Традиционные методы обнаружения, которые в основном опираются на целостные аннотации, часто не способны точно распознавать частично закрытые электронные книги в визуально сложных сценах. Для преодоления этих ограничений в данном исследовании предлагается новый метод аннотирования на части, основанный на локальных признаках, предлагающий более интерпретируемую стратегию аннотирования. Разлагая электронную литературу на несколько ключевых областей для независимой маркировки, предлагаемый метод позволяет моделям обнаружения изучать детализированную структурную информацию, тем самым повышая устойчивость в условиях с высокой окклюзией. Кроме того, был разработан выделенный набор данных EBike-DET для поддержки задач обнаружения в реалистичных сценариях лифта. Аннотированный с помощью метода chunked и дополненный смоделированными условиями окружающей среды, набор данных повышает как производительность модели, так и адаптивность. Предлагаемый метод способствует развитию объяснимого искусственного интеллекта (XAI), делая обнаружение объектов более прозрачным и структурно интерпретируемым, что особенно ценно в приложениях, критически важных для безопасности. Проведены обширные эксперименты с использованием трёх основных моделей (YOLOv5, YOLOv10 и SSD). Результаты показывают, что YOLOv5 при обучении на EBike-DET с фрагментированными аннотациями достигает улучшения точности на 3,7%, в воспоминании на 5,3%, в результатах F1 на 4,5% и в mAP на 4,4%. По сравнению с публичными наборами данных, EBike-DET демонстрирует большую стабильность и устойчивость при окклюзии. Это исследование не только повышает точность обнаружения, но и делает шаг к более интерпретируемым и объяснимым решениям ИИ для внедрения в реальных системах мониторинга безопасности.
С быстрым распространением электровелосипедов (EBikes) по всему миру, особенно в Китае, где к 2022 году их общее количество превысило 350 миллионов единиц, электронные велосипеды стали доминирующим способом короткого транспорта. Однако их частое использование в ограниченных пространствах, таких как жилые лифты, создаёт серьёзные риски для безопасности, включая аномальные вибрации, повреждение оборудования, неприятные запахи и пожарную опасность. Недавнее исследование оценивает, что пожары, связанные с EBike, происходят с вероятностью примерно 1,44%1. Эти риски подчёркивают острую необходимость эффективных и точных методов обнаружения электронных источников для повышения безопасности в условиях лифтов.
Несмотря на прогресс в области компьютерного зрения и глубокого обучения, обнаружение электронных букв в лифтах остаётся сложной задачей. Общедоступные наборы данных редки и часто не имеют разнообразия в моделях EBike, цветах и условиях окклюзии, что ограничивает обобщениемоделей 2. Кроме того, сценарии лифтов часто включают сложные окклюзии, когда электронные данные частично скрыты пассажирами или конструктивными элементами, что ещё больше снижает точность обнаружения 3,4,5. Существующие холистические методы аннотирования, рассматривающие EBikes как единый ограничивающий блок, часто не работают в таких условиях, что демонстрирует необходимость улучшения стратегий аннотаций и обнаружения. Как показано в Таблице 1, целостная аннотация приводит к заметному снижению производительности, при этом средняя средняя точность при пересечении над порогом Union (IoU) снижается до 21,5 mAP@0% по сравнению с аннотированием по частям.
Достижения в обнаружении на основе глубокого обучения
Методы глубокого обучения, особенно сверточные нейронные сети (CNN), широко применяются в обнаружении объектов. Семья You Only Look Once (YOLO) демонстрирует сильную производительность в реальном времени. Однако при обнаружении окклюзированных или перекрывающихся объектов модели YOLO, как правило, производят избыточные ограничивающие рамки. Например, YOLOv5 улучшает многомасштабное извлечение признаков с помощью глубокой свёртки и пирамидальных сетей 6,7, тогда как YOLOv10 устраняет немаксимальное подавление и использует агрегационные сеть путей для повышения скорости и многомасштабногосинтеза 8,9. Несмотря на эти улучшения, избыточные ограничивающие коробки и снижение прочности в условиях с высокой окклюзией остаются нерешёнными. Тем не менее, обе они страдают, когда ключевые структуры электронных букв частично блокируются, поскольку холистическая аннотация предоставляет ограниченные локальные сигналы. Как показано на рисунке 1A-C, это ограничение приводит к избыточным ограничивающим рамкам и нестабильной уверенности в обнаружении при умеренной или сильной окклюзии. В отличие от этого, аннотация с частями смягчает эту проблему, позволяя модели обнаруживать отдельные области — такие как колёса или задняя область — тем самым снижая избыточные ограничивающие рамки при окклюзии. Рисунок 1D-F дополнительно демонстрирует, что аннотация с частями улучшает локализацию признаков и сохраняет стабильность обнаружения, когда видимы только частичные компоненты EBike.
Аналогично, модель Single Shot MultiBox Detector (SSD)10, 11, основанная на основе VGG-16, обеспечивает эффективное обнаружение на разных масштабах и хорошо работает на небольшихобъектах 12. Однако SSD также испытывает трудности, когда непрерывность признаков нарушается сильной окклюзией, что приводит к упущенным обнаружениям или нестабильной регрессии коробки — даже при введении механизмов внимания13. Аннотация с фрагментами также даёт преимущество: модель по-прежнему может полагаться на оставшиеся видимые локальные части, что повышает устойчивость обнаружения в многомасштабных и окклюзионных условиях.
Стратегии аннотации и обучение локальных признаков
Большинство современных методов обнаружения используют холистическую аннотацию, которая упрощает аннотации, но в основном опирается на глобальныепризнаки 14,15. Этот подход испытывает трудности, когда критически важные области электронной системы — такие как колёса, передняя или задняя часть — частично отсутствуют. Недавнее исследование16 показало, что локальное обучение признаков, которое сегментирует объекты на несколько аннотированных частей, может повысить устойчивость и точность в сложных ситуациях. В соответствии с этим, результаты в Таблице 2 показывают, что аннотация с частями остаётся эффективной, когда не менее 40%–60% ключевых компонентов электронной системы остаются видимы, особенно при аннотировании колёс, передней и задней зоны. В отличие от этого, целостные ограничивающие рамки остаются достаточными в сценариях с низкой окклюзией (например, <20% окклюзии) или при разрешении изображения ≥1280 x 720, когда сохраняется полный силуэт. Преимущество фрагментирования уменьшается, когда окклюзия превышает ≈70% или когда области на уровне признаков становятся слишком малыми для предоставления разборчивой пространственной информации.
Методологическое обоснование использования обнаружения углов Харриса
Обнаружение углов Харриса выбирается для локального извлечения признаков благодаря своему детерминированному поведению, вычислительной эффективности и свойству без обучения, которые необходимы для надёжной аннотации в условиях лифта. В отличие от изученных детекторов ключевых точек, таких как SuperPoint и LoFTR, он избегает дополнительного обучения и снижает сдвиг доменов при ограниченных аннотированных данных и сильной окклюзии. По сравнению с операторами на основе рёбер, такими как Canny и Sobel, углы Харриса делают акцент на геометрически значимых переходах, а не на шумных фоновых рёбрах, что позволяет стабильно локализовать структуры EBike, включая колёса и пересечения рам. Кроме того, обнаружение углов Харриса обеспечивает интерпретируемые гиперпараметры. Эмпирическая константа k управляет чувствительностью и стабильностью углов. Как показано в разделе 2.6.2.4 и рисунке 2, корректировка k поддерживает контролируемый баланс между надёжностью и чрезмерным обнаружением, что хорошо соответствует предлагаемой стратегии аннотирования на основе правил.
Дополнение данных для устойчивости
Дополнение данных доказало свою эффективность в повышении разнообразия и адаптации моделей обнаружения. Распространённые методы включают геометрические преобразования (например, вращение, масштабирование, обрезку) и цветовые корректировки (например, масштабирование серого, модификации яркости), которые имитируют реальные условия и вариацииосвещения 17,18,19. Внедряя эти стратегии, модели обнаружения становятся более устойчивыми к вариабельности и лучше подходят для реального внедрения.
Чтобы устранить вышеупомянутые ограничения, в этом исследовании предлагается усовершенствованный метод аннотирования с частями, основанный на локальных признаках. Метод повышает изучение признаков и устойчивость, разделяя электронные книги на несколько независимых аннотированных частей, что позволяет более эффективно обнаруживать при сложной окклюзии. Кроме того, создаётся специализированный набор данных Electric Bike Detection (EBike-DET), адаптированный к условиям лифтов, обогащённый разнообразными дополнениями данных для повышения адаптивности модели. Наконец, метод валидируется на YOLOv5, YOLOv10 и SSD, демонстрируя стабильный рост производительности от +5,69% до +39,81% mAP, как показано в таблице 3. Вклад можно кратко изложить следующим образом: улучшенный метод аннотаций с фрагментами, укрепляющий обучение признаков в условиях окклюзии, создание специализированного набора данных EBike-DET для сценариев лифта, включение множества методов дополнения и экспериментальная валидация на основных моделях обнаружения, демонстрируя повышенную точность и надёжность по сравнению с целостной аннотацией.
Access restricted. Please log in or start a trial to view this content.
Набор данных EBike-DET, использованный в этом исследовании, состоит из изображений, собранных авторами с помощью съёмки на месте в лифтах, парковках и на улицах, а также из общедоступных изображений EBike, полученных с веб-платформ. Весь сбор изображений на месте проводился исключительно в нечастных условиях для технических исследований, связанных с безопасностью, в области обнаружения EBike. Изображения не направлены специально на отдельных лиц, и любые случайно захваченные лица не могут быть идентифицированы из-за расстояния, окклюзии, обзора сзади или соответствующей обработки, удаляющей черты лица и другие личные идентификаторы. Изображения, полученные в интернете, были получены исключительно с платформ, разрешающих повторное использование для академических исследований, или из ресурсов, выпущенных под открытыми лицензиями. Все изображения используются исключительно для некоммерческих исследований и образовательных целей. Поскольку не собирались идентифицируемые персональные данные и не происходило прямого взаимодействия с людьми, это исследование не требовало одобрения институционального этического комитета в соответствии с институциональными руководящими принципами автора.
1. Построение набора данных
2. Аннотация локальных признаков с фрагментами
ПРИМЕЧАНИЕ: Для повышения точности обнаружения электронных знаков в сложных сценариях окклюзии предлагается метод аннотирования на части, основанный на улучшенных локальных признаках. Этот метод сегментирует область EBike, извлекая её локальные точки признаков, и определяет, следует ли аннотировать область на основе степени окклюзии в соответствующей области признаков. Детальный экспериментальный процесс иллюстрируется на рисунке 3.
(2)
(3)
(4)
(5)
,
(9)
(10)
(14)
и
— координаты верхнего-левого и нижнего правого углов соответственно.
(15)
(16)
(17)3. Дополнение данных
ПРИМЕЧАНИЕ: Предыдущее исследование показало, что обучающие наборы данных, не обладающие достаточной предварительной обработкой и дополнением данных, часто приводят к снижению производительностимодели 22. Для решения этих проблем была выполнена следующая процедура.
4. Экспериментальная среда
5. Метрики оценки
ПРИМЕЧАНИЕ: Хотя фрагментированные аннотации используются во время обучения и вывода, оценка проводится на уровне объекта электровелосипеда. Обнаружения на уровне деталей объединяются в единое решение по электровелосипеду согласно правилам, определённым в разделе 2.4,3.
(18)
(19)
(20)
(21)Access restricted. Please log in or start a trial to view this content.
Сравнение холистической аннотации и аннотации на частях в публичных наборах данных
Оценка проводилась на публичном наборе данных, включающем 210 EBike изображений, собранных с открытых мест наблюдения и мониторинга движения, с разными условиями освещения, цветами электронных электронных источников и разной степенью окклюзии. Каждое изображение было аннотировано как с помощью целостного метода (одинарный ограничивающий блок), так и предложенног...
Access restricted. Please log in or start a trial to view this content.
Критические шаги
Критическим этапом в этом протоколе является метод аннотирования на части, основанный на локальных признаках, при котором электронные данные сегментируются на колёсные, передние и задние зоны. Это разделение гарантирует, что модели обнаружения могут изучать мелкозернистые представления, что оказалось необходимым в условиях элеваторов с высокой окклюзией. Например, YOLOv5, обученный с аннотациями на частях на наборе данных EBi...
Access restricted. Please log in or start a trial to view this content.
У авторов нет конфликтов интересов.
Эта работа была поддержана Фондом планирования исследований в области гуманитарных и социальных наук Министерства образования Китая на 2025 год (грант No 25YJAZH002), проектом по повышению потенциала исследований ключевых дисциплин провинции Гуандун 2024 года (грант No 2024ZDJS086), программой обучения бакалавров бакалавров в области инноваций и предпринимательства провинции Гуандун в 2024 году (грант No S202413714017), а также Программой связи между занятостью и образованием Министерства образования: «Инновации и практика механизма подготовки талантов для студентов, ориентированных на технологии искусственного интеллекта» (Грант No 2025072869464).
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| h5py (SSD) | Группа HDF | 2.10.0 | |
| matplotlib (SSD) | Сообщество Матплотлиб | 3.1.2 | |
| matplotlib (YOLOv10) | Сообщество Матплотлиб | 3.9.0 | |
| matplotlib (YOLOv5) | Сообщество Матплотлиб | 3.8.4 | |
| matplotlib (YOLOv5+SAHI) | Сообщество Матплотлиб | 3.8.4 | |
| matplotlib (YOLOv8-Seg) | Сообщество Матплотлиб | 3.9.0 | |
| numpy (SSD) | Сообщество NumPy | 1.17.0 | |
| numpy (YOLOv10) | Сообщество NumPy | 1.26.3 | |
| numpy (YOLOv5) | Сообщество NumPy | 1.26.4 | |
| numpy (YOLOv5+SAHI) | Сообщество NumPy | 1.26.4 | |
| numpy (YOLOv8-Seg) | Сообщество NumPy | 1.26.3 | |
| onnx (YOLOv10) | ONNX | 1.14.0 | |
| onnx (YOLOv5) | ONNX | 1.14.0 | |
| onnx (YOLOv5+SAHI) | ONNX | 1.14.0 | |
| onnxruntime (YOLOv10) | Microsoft | 1.15.1 | |
| onnxruntime (YOLOv5) | Microsoft | 1.15.1 | |
| onnxruntime (YOLOv5+SAHI) | Microsoft | 1.15.1 | |
| opencv-python (SSD) | OpenCV | 4.1.2.30 | |
| opencv-python (YOLOv10) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv5) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv5+SAHI) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv8-Seg) | OpenCV | 4.9.0.80 | |
| Панды (YOLOv10) | Сообщество панд | 2.2.2 | |
| Панды (YOLOv5) | Сообщество панд | 2.2.2 | |
| Панды (YOLOv5+SAHI) | Сообщество панд | 2.2.2 | |
| Панды (YOLOv8-Seg) | Сообщество панд | 2.2.2 | |
| Подушка (SSD) | Разработчики подушек | 8.2.0 | |
| Подушка (YOLOv10) | Разработчики подушек | 10.2.0 | |
| Подушка (YOLOv5) | Разработчики подушек | 8.5.0 | |
| Подушка (YOLOv5+SAHI) | Разработчики подушек | 8.5.0 | |
| Подушка (YOLOv8-Seg) | Разработчики подушек | 10.2.0 | |
| psutil (YOLOv10) | Разработчики Psutil | 5.9.8 | |
| psutil (YOLOv5) | Разработчики Psutil | 5.9.8 | |
| psutil (YOLOv5+SAHI) | Разработчики Psutil | 5.9.8 | |
| pycocotools (YOLOv10) | Консорциум COCO | 2.0.7 | |
| pycocotools (YOLOv5) | Консорциум COCO | 2.0.7 | |
| pycocotools (YOLOv5+SAHI) | Консорциум COCO | 2.0.7 | |
| pycocotools (YOLOv8-Seg) | Консорциум COCO | 2.0.7 | |
| py-cpuinfo (YOLOv10) | Разработчики Py-CPUInfo | 9.0.0 | |
| py-cpuinfo (YOLOv5) | Разработчики Py-CPUInfo | 9.0.0 | |
| py-cpuinfo (YOLOv5+SAHI) | Разработчики Py-CPUInfo | 9.0.0 | |
| PyYAML (YOLOv10) | PyYAML | 6.0.1 | |
| PyYAML (YOLOv5) | PyYAML | 6.0.1 | |
| PyYAML (YOLOv5+SAHI) | PyYAML | 6.0.1 | |
| PyYAML (YOLOv8-Seg) | PyYAML | 6.0.1 | |
| Запросы (SSD) | Запросы на Python | 2.27.1 | |
| requests (YOLOv10) | Запросы на Python | 2.32.3 | |
| Запросы (YOLOv5) | Запросы на Python | 2.31.0 | |
| Запросы (YOLOv5+SAHI) | Запросы на Python | 2.31.0 | |
| САХИ | Разработчики SAHI | 0.3.4+ | |
| scipy (SSD) | Сообщество SciPy | 1.2.1 | |
| Скипи (YOLOv10) | Сообщество SciPy | 1.13.0 | |
| Скипи (YOLOv5) | Сообщество SciPy | 1.13.0 | |
| Сципи (YOLOv5+SAHI) | Сообщество SciPy | 1.13.0 | |
| Скипи (YOLOv8-Seg) | Сообщество SciPy | 1.13.0 | |
| seaborn (YOLOv10) | Разработчики Seaborn | 0.13.2 | |
| seaborn (YOLOv5) | Разработчики Seaborn | 0.13.2 | |
| seaborn (YOLOv5+SAHI) | Разработчики Seaborn | 0.13.2 | |
| seaborn (YOLOv8-Seg) | Разработчики Seaborn | 0.13.2 | |
| Красивый (YOLOv5+SAHI) | Стройные разработчики | 2.0.4 | |
| SSD | Кофе/оригинальные авторы SSD | Python 3.6.13+; PyTorch 1.2.0+; CUDA 10.0; CUDNN 7.4.1 | |
| Тензорборд (SSD) | 2.10.1 | ||
| Тензорборд (YOLOv5) | 2.16.2 | ||
| Тензорборд (YOLOv5+SAHI) | 2.16.2 | ||
| torchvision (SSD) | PyTorch | 0.4.0 | |
| torchvision (YOLOv10) | PyTorch | 0.15.2 | |
| torchvision (YOLOv5) | PyTorch | 0.17.2 | |
| torchvision (YOLOv5+SAHI) | PyTorch | 0.17.2 | |
| torchvision (YOLOv8-Seg) | PyTorch | 0.16.1+ | |
| tqdm (SSD) | Разработчики TQDM | 4.60.0 | |
| tqdm (YOLOv10) | Разработчики TQDM | 4.66.4 | |
| tqdm (YOLOv5) | Разработчики TQDM | 4.66.2 | |
| tqdm (YOLOv5+SAHI) | Разработчики TQDM | 4.66.2 | |
| Ультралитики (YOLOv8-Seg) | Ultralytics | 8.2.99+ | |
| YOLOv10 | Команда YOLOv10 | Python 3.8.0+; PyTorch 2.0.1+куб.118; CUDA 11,8; CUDNN 8.7 | |
| YOLOv5 | Ultralytics | Python 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2 | |
| YOLOv5 + SAHI | Разработчики Ultralytics + SAHI | Python 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2 | |
| YOLOv8-Seg | Ultralytics | Python 3.8.0+; PyTorch 2.0.1+куб.118; CUDA 11,8; CUDNN 8.6.0+ |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission