$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Met de snelle verspreiding van elektrische fietsen (EBikes) wereldwijd, vooral in China, waar het totaal in 2022 meer dan 350 miljoen eenheden bedroeg, zijn EBikes een dominante vorm van korteafstandsvervoer geworden. Hun frequente gebruik in afgesloten ruimtes zoals woonliften brengt echter ernstige veiligheidsrisico's met zich mee, waaronder abnormale trillingen, schade aan apparatuur, onaangename geuren en brandgevaar. Een recente studie schat dat EBike-gerelateerde brandincidenten plaatsvinden met een kans van ongeveer 1,44%. Deze risico's benadrukken de dringende noodzaak van efficiënte en nauwkeurige EBike-detectiemethoden om de veiligheid in liftomgevingen te verbeteren.
Ondanks vooruitgang in computer vision en deep learning blijft EBike-detectie in liften uitdagend. Publiek beschikbare datasets zijn schaars en missen vaak diversiteit in EBike-modellen, kleuren en occlusiecondities, wat modelgeneralisatie2 beperkt. Bovendien bevatten liftscenario's vaak complexe occlusies, waarbij EBikes gedeeltelijk worden verborgen door passagiers of structurele componenten, wat de detectieprecisie verder vermindert 3,4,5. Bestaande holistische annotatiemethoden, die EBikes behandelen als een enkele begrenzende doos, falen vaak onder dergelijke omstandigheden, wat de noodzaak aantoont voor verbeterde annotatie- en detectiestrategieën. Zoals weergegeven in Tabel 1 leidt holistische annotatie tot een aanzienlijk verminderde prestatie, met tot een vermindering van de gemiddelde gemiddelde precisie bij een kruispunt boven Union (IoU) drempel van 0,5 (mAP@0,5) vergeleken met gesegmenteerde annotatie.
Vooruitgang in deep learning-gebaseerde detectie
Deep learning-methoden, met name convolutionele neurale netwerken (CNN's), zijn veelvuldig toegepast bij objectdetectie. De You Only Look Once (YOLO) familie laat sterke realtime prestaties zien. Bij het detecteren van verstopte of overlappende objecten hebben YOLO-modellen echter de neiging om redundante begrenzende boxen te produceren. Zo verbetert YOLOv5 multi-scale feature extraction via deep convolution en feature pyramid netwerken 6,7, terwijl YOLOv10 niet-maximale onderdrukking elimineert en padaggregatienetwerken gebruikt om snelheid en multi-scale fusion 8,9 te verbeteren. Ondanks deze verbeteringen blijven redundante bounding boxes en afnemende robuustheid in occlusie-intensieve omgevingen onopgeloste kwesties. Toch lijden beide onder belangrijke EBike-structuren die gedeeltelijk worden geblokkeerd, omdat holistische annotatie beperkte lokale aanwijzingen biedt. Zoals getoond in Figuur 1A-C leidt deze beperking tot redundante begrenzingsboxen en een instabiel detectievertrouwen bij matige of zware occlusie. Daarentegen vermindert chunked annotatie dit probleem door het model in staat te stellen afzonderlijke regio's te detecteren—zoals wielen of het achterste gebied—waardoor overbodige bounding boxes onder occlusie worden verminderd. Figuur 1D-F toont verder aan dat chunked annotatie de lokalisatie van kenmerken verbetert en detectiestabiliteit behoudt wanneer slechts gedeeltelijke EBike-componenten zichtbaar blijven.
Evenzo biedt de Single Shot MultiBox Detector (SSD) model10,11, gebaseerd op de VGG-16 backbone, efficiënte detectie over schalen heen en presteert goed op kleine objecten12. SSD heeft echter ook moeite wanneer de continuïteit van features wordt verbroken door zware occlusion, wat leidt tot gemiste detecties of onstabiele box regressie—zelfs wanneer aandachtmechanismen worden geïntroduceerd13. Chunked annotatie biedt hier ook een voordeel: het model kan nog steeds vertrouwen op zichtbare lokale delen, wat de detectiestabiliteit verbetert in multi-scale en occluded condities.
Annotatiestrategieën en lokaal kenmerkleren
De meeste huidige detectiemethoden hanteren holistische annotatie, die annotatie vereenvoudigt maar vooral steunt op globale kenmerken14,15. Deze aanpak heeft moeite wanneer kritieke EBike-regio's - zoals de wielen, het voor- of achtergedeelte - gedeeltelijk ontbreken. Een recente studie16 heeft aangetoond dat lokaal feature learning, waarbij objecten worden opgesplitst in meerdere geannoteerde delen, robuustheid en precisie kan verbeteren in uitdagende scenario's. In overeenstemming hiermee tonen de resultaten in Tabel 2 aan dat gehulde annotatie effectief blijft wanneer minstens 40%-60% van de belangrijkste EBike-componenten zichtbaar blijven, vooral bij het annoteren van de wielen, het voor- en achtergebied. Daarentegen blijven holistische begrenzingsboxen voldoende in scenario's met lage occlusie (bijvoorbeeld <20% occlusie) of wanneer de beeldresolutie ≥1280 x 720 is, waarbij de volledige silhouet behouden blijft. Het voordeel van chunking neemt af wanneer occlusie meer dan ≈70% bedraagt, of wanneer feature-level regio's te klein worden om discriminerende ruimtelijke informatie te leveren.
Methodologische rechtvaardiging voor het gebruik van Harris Corner Detection
Harris-hoekdetectie wordt geselecteerd voor lokale feature-extractie vanwege het deterministische gedrag, de computationele efficiëntie en de trainingsvrije eigenschappen, die essentieel zijn voor betrouwbare annotatie in liftomgevingen. In tegenstelling tot geleerde keypointdetectoren zoals SuperPoint en LoFTR, voorkomt het extra training en vermindert het domeinverschuiving bij beperkte geannoteerde data en zware occlusie. In vergelijking met randgebaseerde operatoren zoals Canny en Sobel leggen Harris-hoeken de nadruk op geometrisch betekenisvolle verbindingen in plaats van ruisachtige achtergrondranden, waardoor stabiele lokalisatie van EBike-structuren mogelijk is, inclusief wielen en frame-kruisingen. Bovendien biedt Harris-hoekdetectie interpreteerbare hyperparameters. De empirische constante k regelt de gevoeligheid en stabiliteit van de hoek. Zoals weergegeven in sectie 2.6.2.4 en Figuur 2, ondersteunt het aanpassen van k een gecontroleerde balans tussen robuustheid en overdetectie, wat goed aansluit bij de voorgestelde regelgebaseerde cunked annotatiestrategie.
Data-augmentatie voor robuustheid
Data-augmentatie is effectief gebleken in het vergroten van de diversiteit en aanpassingsvermogen van detectiemodellen. Veelvoorkomende technieken zijn geometrische transformaties (bijv. rotatie, schaalvergroting, cropping) en kleuraanpassingen (bijv. grijstinten, luminantiemodificaties), die realistische omstandigheden en lichtvariaties simuleren 17,18,19. Door deze strategieën te integreren, worden detectiemodellen veerkrachtiger tegen variabiliteit en beter geschikt voor inzet in de praktijk.
Om de eerder genoemde beperkingen aan te pakken, stelt deze studie een verbeterde methode voor voor gesegmenteerde annotatie gebaseerd op lokale kenmerken. De methode verbetert feature learning en robuustheid door EBikes op te delen in meerdere onafhankelijke geannoteerde delen, waardoor effectievere detectie mogelijk wordt onder complexe occlusie. Daarnaast wordt een speciale Electric Bike Detection (EBike-DET) dataset opgebouwd, afgestemd op liftomgevingen, verrijkt met diverse data-augmentaties om de aanpassingsvermogen van het model te verbeteren. Ten slotte wordt de methode gevalideerd op YOLOv5, YOLOv10 en SSD, waarbij consistente prestatieverbeteringen van +5,69% tot +39,81% mAP worden getoond, zoals samengevat in Tabel 3. De bijdragen kunnen als volgt worden samengevat: een verbeterde chunked annotatiemethode die feature-learning onder occlusieomstandigheden versterkt, de opbouw van een gespecialiseerde EBike-DET-dataset voor liftscenario's, het integreren van meerdere augmentatietechnieken en experimentele validatie op gangbare detectiemodellen, wat een verbeterde precisie en robuustheid toont ten opzichte van holistische annotatie.