Przedstawiono metodę anotacji obrazów na fragmenty opartą na lokalnych cechach, aby poprawić wykrywanie rowerów elektrycznych w złożonych scenariuszach wind, wykorzystując zbiór EBike-DET oraz powszechne modele detekcji obiektów.
Method Article
Przedstawiono metodę anotacji obrazów na fragmenty opartą na lokalnych cechach, aby poprawić wykrywanie rowerów elektrycznych w złożonych scenariuszach wind, wykorzystując zbiór EBike-DET oraz powszechne modele detekcji obiektów.
Rosnące użycie rowerów elektrycznych (EBikes) w zamkniętych warunkach, takich jak windy mieszkalne, budzi poważne obawy dotyczące bezpieczeństwa i wprowadza znaczne wyzwania w automatycznym wykrywaniu obiektów, szczególnie z powodu częstych zasłon. Tradycyjne metody wykrywania, które opierają się głównie na holistycznych adnotacjach, często nie są w stanie dokładnie rozpoznać częściowo zasłoniętych EBików w wizualnie złożonych scenach. Aby przezwyciężyć te ograniczenia, niniejsze badanie proponuje nowatorską metodę anotacji fragmentowanej opartą na lokalnych cechach, oferując bardziej interpretowalną strategię adnotacji. Poprzez rozkład EBike na wiele kluczowych obszarów dla niezależnego oznaczania, proponowana metoda umożliwia modelom detekcyjnym zdobywanie drobnoziarnistych informacji strukturalnych, co zwiększa odporność w warunkach intensywnych okluzji. Dodatkowo opracowano dedykowany zestaw danych EBike-DET wspierający zadania wykrywania w realistycznych scenariuszach windy. Z adnotacjami metodą chunked i wzbogaconymi o symulowane warunki środowiskowe, zbiór danych poprawia zarówno wydajność modelu, jak i elastyczność. Proponowana metoda promuje rozwój wyjaśnialnej sztucznej inteligencji (XAI) poprzez zwiększenie przejrzystości i strukturalnej interpretacji detekcji obiektów, co jest szczególnie cenne w zastosowaniach krytycznych dla bezpieczeństwa. Przeprowadzane są szeroko zakrojone eksperymenty z użyciem trzech popularnych modeli (YOLOv5, YOLOv10 i SSD). Wyniki pokazują, że YOLOv5, trenowany na EBike-DET z anotacjami fragmentami, osiąga poprawę o 3,7% w precyzji, 5,3% w pamięci, 4,5% w wyniku F1 oraz 4,4% w mAP. W porównaniu z publicznymi zbiorami danych, EBike-DET wykazuje większą stabilność i odporność pod względem okluzji. To badanie nie tylko zwiększa dokładność wykrywania, ale także stanowi krok w kierunku bardziej interpretowalnych i wyjaśnialnych rozwiązań AI do wdrażania w rzeczywistych systemach monitorowania bezpieczeństwa.
Wraz z szybkim rozwojem rowerów elektrycznych (EBikes) na całym świecie, szczególnie w Chinach, gdzie łączna liczba rowerów przekroczyła 350 milionów sztuk do 2022 roku, EBike stały się dominującym środkiem transportu na krótkie dystanse. Jednak ich częste użycie w zamkniętych przestrzeniach, takich jak windy mieszkalne, niesie ze sobą poważne zagrożenia dla bezpieczeństwa, w tym nieprawidłowe wibracje, uszkodzenia sprzętu, nieprzyjemne zapachy oraz zagrożenie pożarowe. Niedawne badanie szacuje, że incydenty pożarowe związane z EBike mają prawdopodobieństwo około 1,44%1. Te ryzyka podkreślają pilną potrzebę efektywnych i precyzyjnych metod wykrywania EBike, które zwiększają bezpieczeństwo w środowiskach wind.
Pomimo postępów w dziedzinie widzenia komputerowego i uczenia głębokiego, wykrywanie EBike w windach pozostaje wyzwaniem. Publicznie dostępne zbiory danych są rzadkie i często pozbawione różnorodności modeli EBike, kolorów i warunków zasłon, co ogranicza uogólnienie modelu2. Co więcej, scenariusze windy często wiążą się ze złożonymi zasłonami, gdzie EBikes są częściowo ukryte przez pasażerów lub elementy konstrukcyjne, co dodatkowo obniża precyzję wykrywania 3,4,5. Istniejące metody holistycznej adnotacji, które traktują EBikes jako jedno ramę ograniczające, często zawodzą w takich warunkach, co pokazuje potrzebę ulepszenia strategii adnotacji i wykrywania. Jak pokazano w Tabeli 1, holistyczne adnotacje prowadzą do znacznie obniżonej wydajności, z nawet 21,5% obniżeniem średniej precyzji na progu przecięcia nad sumą (IoU) wynoszącą 0,5 (mAP@0,5) w porównaniu z adnotacją podzieloną.
Postępy w wykrywaniu opartym na uczeniu głębokim
Metody głębokiego uczenia, zwłaszcza sieci neuronowe splotowe (CNN), są szeroko stosowane w wykrywaniu obiektów. Rodzina You Only Look Once (YOLO) prezentuje silne wyniki w czasie rzeczywistym. Jednak przy wykrywaniu obiektów zasłoniętych lub nakładających się, modele YOLO mają tendencję do generowania redundantnych ramek ograniczających. Na przykład YOLOv5 usprawnia wieloskalową ekstrakcję cech poprzez głęboką konwolucję i sieci piramid cech 6,7, podczas gdy YOLOv10 eliminuje tłumienie nie-maksymalne i wykorzystuje sieci agregacji ścieżek, aby zwiększyć szybkość i wieloskalową fuzję 8,9. Pomimo tych ulepszeń, redundantne ramki ograniczające i malejąca odporność w środowiskach z dużą ilością zasłon pozostają nierozwiązanymi problemami. Jednak oba cierpią, gdy kluczowe struktury EBike są częściowo zablokowane, ponieważ holistyczne adnotacje dostarczają ograniczonych lokalnych wskazówek. Jak pokazano na rysunku 1A-C, to ograniczenie prowadzi do redundantnych ramek ograniczających i niestabilnej pewności detekcji przy umiarkowanej lub silnej okluzji. Natomiast annotacja chunked łagodzi ten problem, umożliwiając modelowi wykrywanie oddzielnych obszarów – takich jak koła czy tylny obszar – co zmniejsza redundantne ramki ograniczające pod okluzją. Rysunek 1D-F dodatkowo pokazuje, że fragmentowane adnotacje poprawiają lokalizację cech i zachowują stabilność detekcji, gdy widoczne pozostają tylko częściowe komponenty EBike.
Podobnie model10,11 Single Shot MultiBox Detector (SSD), oparty na szkieletu VGG-16, zapewnia efektywne wykrywanie na różnych skalach i dobrze radzi sobie na małych obiektach12. Jednak SSD ma też trudności, gdy ciągłość cech zostaje przerwana przez silne zasłonięcie, co prowadzi do przeoczenia detekcji lub niestabilnej regresji pudełkowej – nawet gdy wprowadzono mechanizmy uwagi13. Fragmentowana adnotacja również daje tu przewagę: model nadal może polegać na pozostałych widocznych lokalnych częściach, poprawiając stabilność detekcji w warunkach wieloskalowych i zasłoniętych.
Strategie adnotacji i lokalne uczenie cech
Większość obecnych metod detekcji stosuje holistyczne adnotacje, które upraszczają adnotacje, ale opierają się głównie na cechach globalnych14,15. Takie podejście ma trudności, gdy kluczowe obszary EBike – takie jak koła, przednia czy tylna część – są częściowo nieobecne. Niedawne badanie16 wykazało, że lokalne uczenie cech, które dzieli obiekty na wiele anotowanych części, może poprawić odporność i precyzję w trudnych sytuacjach. Zgodnie z tym, wyniki z Tabeli 2 pokazują, że annotacje w fragmentach pozostają skuteczne, gdy co najmniej 40%-60% kluczowych komponentów EBike pozostaje widocznych, szczególnie podczas adnotacji kół, przedniej i tylnej części pojazdu. Natomiast holistyczne ramki ograniczające pozostają wystarczające w sytuacjach o niskim zasłonieniu (np. <20% okluzji) lub gdy rozdzielczość obrazu wynosi ≥1280 x 720, gdzie zachowana jest pełna sylwetka. Korzyść z chunkingu maleje, gdy okluzja przekracza ≈70% lub gdy obszary na poziomie cech stają się zbyt małe, by dostarczyć dyskryminacyjnych informacji przestrzennych.
Metodologiczne uzasadnienie stosowania wykrywania narożników Harrisa
Detekcja narożników Harrisa jest wybierana do lokalnej ekstrakcji cech ze względu na deterministyczne zachowanie, efektywność obliczeniową oraz właściwości wolne od treningu, które są niezbędne do niezawodnego adnotowania w środowiskach wind. W przeciwieństwie do detektorów nauczonych punktów kluczowych, takich jak SuperPoint i LoFTR, unika dodatkowego treningu i zmniejsza przesunięcie domeny przy ograniczonych anotowanych danych i silnej okluzji. W porównaniu z operatorami opartymi na krawędziach, takimi jak Canny i Sobel, narożniki Harrisa kładą nacisk na geometrycznie istotne połączenia zamiast na szumujące krawędzie tła, co umożliwia stabilną lokalizację struktur EBike, w tym przecięć kół i ram. Ponadto detekcja narożników Harrisa zapewnia interpretowalne hiperparametry. Empiryczna stała k kontroluje czułość i stabilność narożników. Jak pokazano w sekcji 2.6.2.4 i Rysunku 2, korekta k wspiera kontrolowaną równowagę między odpornością a nadmiernym wykrywaniem, co dobrze odpowiada proponowanej strategii anotacji fragmentów opartej na regułach.
Augmentacja danych dla odporności
Augmentacja danych okazała się skuteczna w zwiększaniu różnorodności i elastyczności modeli detekcji. Typowe techniki to transformacje geometryczne (np. rotacja, skalowanie, przycinanie) oraz korekty kolorów (np. skalowanie szarości, modyfikacje luminancji), które symulują rzeczywiste warunki i zmiany oświetlenia 17,18,19. Dzięki wdrożeniu tych strategii modele detekcji stają się bardziej odporne na zmienność i lepiej przystosowane do wdrożenia w rzeczywistym świecie.
Aby rozwiązać powyższe ograniczenia, niniejsze badanie proponuje ulepszoną metodę anotacji w fragmentach opartą na lokalnych cechach. Metoda ta zwiększa uczenie się cech i odporność poprzez podział EBikes na wiele niezależnych adnotowanych części, co umożliwia skuteczniejsze wykrywanie w złożonych warunkach okluzji. Dodatkowo stworzono dedykowany zestaw danych Electric Bike Detection (EBike-DET) dostosowany do środowisk wind, wzbogacony o różnorodne uzupełnienia danych, aby poprawić elastyczność modelu. Na koniec metoda jest weryfikowana na YOLOv5, YOLOv10 i SSD, wykazując stałe wzrosty wydajności od +5,69% do +39,81% mAP, jak podsumowano w Tabeli 3. Wkład można podsumować następująco: ulepszona metoda anotacji w fragmentach, która wzmacnia uczenie cech w warunkach zasłony, budowa specjalistycznego zbioru danych EBike-DET dla scenariuszy windy, z uwzględnieniem wielu technik augmentacji oraz eksperymentalna walidacja na głównych modelach detekcji, wykazująca większą precyzję i odporność w porównaniu z holistyczną adnotacją.
Access restricted. Please log in or start a trial to view this content.
Zbiór danych EBike-DET używany w tym badaniu składa się z obrazów zebranych przez autorów za pomocą fotografii na miejscu w środowiskach wind, parkingów i ulic, a także publicznie dostępnych obrazów EBike uzyskanych z platform internetowych. Cała zbieracza obrazów na miejscu była prowadzona w środowiskach nieprywatnych wyłącznie w celu technicznych badań związanych z bezpieczeństwem nad wykrywaniem EBike. Zdjęcia nie są celowo skierowane do osób, a przypadkowo uchwycone osoby są nieidentyfikowalne ze względu na odległość, zasłonę, widok z tyłu lub odpowiednie przetwarzanie usuwające cechy twarzy i inne osobiste identyfikatory. Obrazy z internetu były pozyskiwane wyłącznie z platform umożliwiających ponowne wykorzystanie do badań naukowych lub z zasobów udostępnionych na otwartych licencjach. Wszystkie zdjęcia są wykorzystywane wyłącznie do celów badawczych i edukacyjnych niekomercyjnych. Ponieważ nie zebrano żadnych identyfikowalnych danych osobowych i nie doszło do bezpośredniego kontaktu z ludźmi, badanie to nie wymagało zatwierdzenia przez instytucjonalną komisję etyczną zgodnie z wytycznymi instytucjonalnymi autora.
1. Budowa zbioru danych
2. Adnotacje fragmentowane na fragmenty lokalnych cech
UWAGA: Aby zwiększyć precyzję wykrywania EBikes w złożonych scenariuszach zasłon, proponuje się metodę anotacji w fragmentach opartą na ulepszonych cechach lokalnych. Metoda ta segmentuje region EBike poprzez wyodrębnianie jego lokalnych punktów cech i określa, czy obszar powinien być oznaczony na podstawie stopnia zasłonienia w odpowiednim obszarze cech. Szczegółowy proces eksperymentalny przedstawiono na Rysunku 3.
(2)
(3)
(4)
(5)
,
(9)
(10)
(14)
oraz są
współrzędnymi odpowiednio lewego górnego i prawego dolnego rogu.
(15)
(16)
(17) 3. Augmentacja danych
UWAGA: Poprzednie badanie wykazało, że treningowe zbiory danych o braku wystarczającego wstępnego przetwarzania i augmentacji danych często skutkują pogorszeniem wydajności modelu22. Aby sprostać tym wyzwaniom, zastosowano następującą procedurę.
4. Środowisko eksperymentalne
5. Metryki oceny
UWAGA: Chociaż podczas treningu i wnioskowania stosuje się przypisy w fragmentach, ocena przeprowadza się na poziomie obiektów roweru elektrycznego. Wykrycia na poziomie części są agregowane w jedną decyzję dotyczącą rowerów elektrycznych zgodnie z zasadami zdefiniowanymi w sekcji 2.4,3.
(18)
(19)
(20)
(21) Access restricted. Please log in or start a trial to view this content.
Porównanie adnotacji całościowej i adnotacji fragmentowych na publicznym zbiorze danych
Ocena przeprowadzona została na publicznym zbiorze danych obejmującym 210 obrazów EBike zebranych z otwartych scen nadzoru i monitorowania ruchu, z różnymi warunkami oświetlenia, kolorami EBike i różnym stopniem oczenia. Każdy obraz został adnotowany zarówno metodą całościową (pojedyncze pole wyborcze), jak i proponowaną metodą fragmentową (podzielenie EBike na koła, przednią część i tylne ...
Access restricted. Please log in or start a trial to view this content.
Kluczowe kroki
Kluczowym krokiem w tym protokole jest metoda anotacji w kawałkach oparta na lokalnych cechach, gdzie EBiki są podzielone na obszary kołowe, przednie i tylne. Ten podział zapewnia, że modele detekcyjne mogą uczyć się drobnoziarnistych reprezentacji, co okazało się kluczowe w środowiskach elewacji o dużej liczbie zasłon. Na przykład YOLOv5 trenowany z fragmentami adnotacji na zbiorze EBike-DET poprawił swój mAP@0,5 z 0,925 do 0,966, podkreślając konieczność dokł...
Access restricted. Please log in or start a trial to view this content.
Autorzy nie mają konfliktu interesów.
Prace te zostały wsparte przez Fundusz Planowania Badań Humanistycznych i Społecznych na 2025 rok Ministerstwa Edukacji Chin (Grant nr 25YJAZH002), Projekt Zwiększenia Potencjału Badawczego Kluczowej Dyscypliny Prowincji Guangdong 2024 (Grant nr 2024ZDJS086), Program Szkolenia Innowacyjnych i Przedsiębiorczości Prowincji Guangdong w 2024 roku (Grant nr S202413714017) oraz Program Współpracy Zatrudnienia z Edukacją Ministerstwa Edukacji: "Innowacje i praktyka mechanizmu kształcenia talentów dla studentów kierunku Computer Applications zorientowanych w technologii sztucznej inteligencji" (Grant nr 2025072869464).
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| h5py (SSD) | Grupa HDF | 2.10.0 | |
| matplotlib (SSD) | Społeczność Matplotlib | 3.1.2 | |
| matplotlib (YOLOv10) | Społeczność Matplotlib | 3.9.0 | |
| matplotlib (YOLOv5) | Społeczność Matplotlib | 3.8.4 | |
| matplotlib (YOLOv5+SAHI) | Społeczność Matplotlib | 3.8.4 | |
| matplotlib (YOLOv8-Seg) | Społeczność Matplotlib | 3.9.0 | |
| numpy (SSD) | Społeczność NumPy | 1.17.0 | |
| numpy (YOLOv10) | Społeczność NumPy | 1.26.3 | |
| numpy (YOLOv5) | Społeczność NumPy | 1.26.4 | |
| numpy (YOLOv5+SAHI) | Społeczność NumPy | 1.26.4 | |
| numpy (YOLOv8-Seg) | Społeczność NumPy | 1.26.3 | |
| onnx (YOLOv10) | ONNX | 1.14.0 | |
| onnx (YOLOv5) | ONNX | 1.14.0 | |
| onnx (YOLOv5+SAHI) | ONNX | 1.14.0 | |
| onnxruntime (YOLOv10) | Microsoft | 1.15.1 | |
| onnxruntime (YOLOv5) | Microsoft | 1.15.1 | |
| onnxruntime (YOLOv5+SAHI) | Microsoft | 1.15.1 | |
| opencv-python (SSD) | OpenCV | 4.1.2.30 | |
| opencv-python (YOLOv10) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv5) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv5+SAHI) | OpenCV | 4.9.0.80 | |
| opencv-python (YOLOv8-Seg) | OpenCV | 4.9.0.80 | |
| Pandas (YOLOv10) | Społeczność Pandas | 2.2.2 | |
| Pandas (YOLOv5) | Społeczność Pandas | 2.2.2 | |
| Pandas (YOLOv5+SAHI) | Społeczność Pandas | 2.2.2 | |
| Pandas (YOLOv8-Seg) | Społeczność Pandas | 2.2.2 | |
| Poduszka (SSD) | Designerzy poduszek | 8.2.0 | |
| Poduszka (YOLOv10) | Designerzy poduszek | 10.2.0 | |
| Poduszka (YOLOv5) | Designerzy poduszek | 8.5.0 | |
| Poduszka (YOLOv5+SAHI) | Designerzy poduszek | 8.5.0 | |
| Poduszka (YOLOv8-Seg) | Designerzy poduszek | 10.2.0 | |
| psutil (YOLOv10) | Programiści Psutil | 5.9.8 | |
| psutil (YOLOv5) | Programiści Psutil | 5.9.8 | |
| psutil (YOLOv5+SAHI) | Programiści Psutil | 5.9.8 | |
| pycocotools (YOLOv10) | Konsorcjum COCO | 2.0.7 | |
| pycocotools (YOLOv5) | Konsorcjum COCO | 2.0.7 | |
| pycocotools (YOLOv5+SAHI) | Konsorcjum COCO | 2.0.7 | |
| pycocotools (YOLOv8-Seg) | Konsorcjum COCO | 2.0.7 | |
| py-cpuinfo (YOLOv10) | Programiści Py-CPUInfo | 9.0.0 | |
| py-cpuinfo (YOLOv5) | Programiści Py-CPUInfo | 9.0.0 | |
| py-cpuinfo (YOLOv5+SAHI) | Programiści Py-CPUInfo | 9.0.0 | |
| PyYAML (YOLOv10) | PyYAML | 6.0.1 | |
| PyYAML (YOLOv5) | PyYAML | 6.0.1 | |
| PyYAML (YOLOv5+SAHI) | PyYAML | 6.0.1 | |
| PyYAML (YOLOv8-Seg) | PyYAML | 6.0.1 | |
| żądania (SSD) | Żądania Pythona | 2.27.1 | |
| prośby (YOLOv10) | Żądania Pythona | 2.32.3 | |
| żądania (YOLOv5) | Żądania Pythona | 2.31.0 | |
| requests (YOLOv5+SAHI) | Żądania Pythona | 2.31.0 | |
| SAHI | Deweloperzy SAHI | 0.3.4+ | |
| scipy (SSD) | Społeczność SciPy | 1.2.1 | |
| scipy (YOLOv10) | Społeczność SciPy | 1.13.0 | |
| scipy (YOLOv5) | Społeczność SciPy | 1.13.0 | |
| scipy (YOLOv5+SAHI) | Społeczność SciPy | 1.13.0 | |
| scipy (YOLOv8-Seg) | Społeczność SciPy | 1.13.0 | |
| seaborn (YOLOv10) | Deweloperzy Seaborn | 0.13.2 | |
| seaborn (YOLOv5) | Deweloperzy Seaborn | 0.13.2 | |
| seaborn (YOLOv5+SAHI) | Deweloperzy Seaborn | 0.13.2 | |
| seaborn (YOLOv8-Seg) | Deweloperzy Seaborn | 0.13.2 | |
| kształtny (YOLOv5+SAHI) | Shapely Developers | 2.0.4 | |
| SSD | Caffe/Original SSD Authors | Python 3.6.13+; PyTorch 1.2.0+; CUDA 10.0; CUDNN 7.4.1 | |
| tensorboard (SSD) | 2.10.1 | ||
| tensorboard (YOLOv5) | 2.16.2 | ||
| tensorboard (YOLOv5+SAHI) | 2.16.2 | ||
| torchvision (SSD) | PyTorch | 0.4.0 | |
| torchvision (YOLOv10) | PyTorch | 0.15.2 | |
| torchvision (YOLOv5) | PyTorch | 0.17.2 | |
| torchvision (YOLOv5+SAHI) | PyTorch | 0.17.2 | |
| torchvision (YOLOv8-Seg) | PyTorch | 0.16.1+ | |
| tqdm (SSD) | Deweloperzy TQDM | 4.60.0 | |
| tqdm (YOLOv10) | Deweloperzy TQDM | 4.66.4 | |
| tqdm (YOLOv5) | Deweloperzy TQDM | 4.66.2 | |
| tqdm (YOLOv5+SAHI) | Deweloperzy TQDM | 4.66.2 | |
| ultralityczne (YOLOv8-Seg) | Ultralityki | 8.2.99+ | |
| YOLOv10 | Drużyna YOLOv10 | Python 3.8.0+; PyTorch 2.0.1+cu118; CUDA 11.8; CUDNN 8.7 | |
| YOLOv5 | Ultralityki | Python 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2 | |
| YOLOv5 + SAHI | Ultralytics + deweloperzy SAHI | Python 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2 | |
| YOLOv8-Seg | Ultralityki | Python 3.8.0+; PyTorch 2.0.1+cu118; CUDA 11.8; CUDNN 8.6.0+ |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission