$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Avec la prolifération rapide des vélos électriques (EBikes) dans le monde, en particulier en Chine, où le total a dépassé 350 millions d’unités en 2022, les EBikes sont devenus un mode de transport dominant sur les courtes distances. Cependant, leur utilisation fréquente dans des espaces confinés tels que les ascenseurs résidentiels entraîne de sérieux risques pour la sécurité, notamment des vibrations anormales, des dommages aux équipements, des odeurs désagréables et des risques d’incendie. Une étude récente estime que les incendies liés à EBike se produisent avec une probabilité d’environ 1,44 %. Ces risques soulignent le besoin pressant de méthodes de détection EBike efficaces et précises pour renforcer la sécurité dans les environnements d’ascenseur.
Malgré les progrès en vision par ordinateur et en apprentissage profond, la détection EBike dans les ascenseurs reste un défi. Les ensembles de données accessibles publiquement sont rares et manquent souvent de diversité dans les modèles EBike, les couleurs et les conditions d’occlusion, limitant la généralisation dumodèle 2. De plus, les scénarios d’ascenseur impliquent fréquemment des occlusions complexes, où les EBikes sont partiellement cachés par les passagers ou les composants structurels, réduisant encore la précisionde détection 3,4,5. Les méthodes d’annotation holistiques existantes, qui traitent EBikes comme une seule boîte englobante, échouent souvent dans de telles conditions, démontrant la nécessité d’améliorer les stratégies d’annotation et de détection. Comme montré dans le tableau 1, l’annotation holistique conduit à une performance nettement réduite, avec une réduction allant jusqu’à 21,5 % de la précision moyenne moyenne à un seuil d’intersection sur Union (IoU) de 0,5 (mAP@0,5) par rapport à l’annotation en blocs.
Avancées dans la détection basée sur l’apprentissage profond
Les méthodes d’apprentissage profond, en particulier les réseaux neuronaux convolutionnels (CNN), ont été largement appliquées à la détection d’objets. La famille You Only Look Once (YOLO) démontre une performance en temps réel solide. Cependant, lors de la détection d’objets occlus ou qui se chevauchent, les modèles YOLO ont tendance à produire des boîtes englobantes redondantes. Par exemple, YOLOv5 améliore l’extraction de caractéristiques multi-échelle grâce à des réseaux de convolution profonde et de pyramide de caractéristiques 6,7, tandis que YOLOv10 élimine la suppression non maximale et utilise des réseaux d’agrégation de chemins pour améliorer la vitesse et la fusionmulti-échelle 8,9. Malgré ces améliorations, des boîtes englobantes redondantes et une robustesse décroissante dans des environnements à forte occlusion restent des problèmes non résolus. Pourtant, les deux souffrent lorsque les structures clés EBike sont partiellement bloquées, car l’annotation holistique fournit des indices locaux limités. Comme montré dans la figure 1A-C, cette limitation conduit à des boîtes englobantes redondantes et à une confiance de détection instable sous une occlusion modérée ou lourde. En revanche, l’annotation en blocs atténue ce problème en permettant au modèle de détecter des régions séparées — comme les roues ou la zone arrière — réduisant ainsi les boîtes englobantes redondantes en cas d’occlusion. La figure 1D-F montre également que l’annotation en blocs améliore la localisation des caractéristiques et maintient la stabilité de la détection lorsque seuls des composants partiels EBike restent visibles.
De même, le détecteur multiBox à Coup Unique (SSD)modèle 10,11, basé sur la dorsale VGG-16, offre une détection efficace à toutes les échelles et fonctionne bien sur les petits objets12. Cependant, le SSD rencontre également des difficultés lorsque la continuité des fonctionnalités est interrompue par une forte occlusion, entraînant des détections manquées ou une régression de boîte instable — même lorsque des mécanismes d’attention sontintroduits 13. L’annotation en blocs offre également un avantage ici : le modèle peut toujours s’appuyer sur les parties locales visibles restantes, améliorant la stabilité de la détection dans des conditions multi-échelle et occlées.
Stratégies d’annotation et apprentissage local des fonctionnalités
La plupart des méthodes de détection actuelles adoptent une annotation holistique, qui simplifie l’annotation mais s’appuie principalement sur les caractéristiquesglobales 14,15. Cette approche rencontre des difficultés lorsque des zones critiques d’EBike — comme les roues, la zone avant ou la zone arrière — sont partiellement absentes. Une étuderécente 16 a montré que l’apprentissage local des caractéristiques, qui segmente les objets en plusieurs parties annotées, peut améliorer la robustesse et la précision dans des situations difficiles. Conformément à cela, les résultats du tableau 2 montrent que l’annotation en blocs reste efficace lorsqu’au moins 40 % à 60 % des composants clés d’EBike restent visibles, notamment lors de l’annotation des roues, de la zone avant et de l’arrière. En revanche, les boîtes englobantes holistiques restent suffisantes dans les scénarios à faible occlusion (par exemple,
Justification méthodologique de l’utilisation de la détection de coins de Harris
La détection de coins Harris est sélectionnée pour l’extraction locale de caractéristiques en raison de son comportement déterministe, de son efficacité computationnelle et de ses propriétés sans entraînement, essentielles pour une annotation fiable dans les environnements d’ascenseur. Contrairement aux détecteurs de points clés appris tels que SuperPoint et LoFTR, il évite un entraînement supplémentaire et réduit le décalage de domaine sous des données annotées limitées et une forte occlusion. Comparés aux opérateurs basés sur les arêtes comme Canny et Sobel, les coins Harris mettent l’accent sur des jonctions géométriquement significatives plutôt que sur des arêtes bruyantes de fond, permettant une localisation stable des structures EBike, y compris les intersections de roues et de châssis. De plus, la détection des coins de Harris fournit des hyperparamètres interprétables. La constante empirique k contrôle la sensibilité et la stabilité des coins. Comme montré dans la section 2.6.2.4 et la Figure 2, l’ajustement k soutient un équilibre contrôlé entre robustesse et surdétection, ce qui correspond bien à la stratégie d’annotation en tranches basée sur des règles proposée.
Augmentation des données pour la robustesse
L’augmentation des données s’est avérée efficace pour accroître la diversité et l’adaptabilité des modèles de détection. Les techniques courantes incluent les transformations géométriques (par exemple, rotation, mise à l’échelle, recadrage) et les ajustements de couleur (par exemple, scalage de gris, modifications de luminance), qui simulent des conditions réelles et des variations d’éclairage 17,18,19. En intégrant ces stratégies, les modèles de détection deviennent plus résilients à la variabilité et mieux adaptés au déploiement dans le monde réel.
Pour répondre aux limitations mentionnées précédemment, cette étude propose une méthode d’annotation en blocs améliorée basée sur des caractéristiques locales. La méthode améliore l’apprentissage des caractéristiques et la robustesse en divisant les EBikes en plusieurs parties annotées indépendantes, permettant une détection plus efficace sous occlusion complexe. De plus, un ensemble de données dédié à la détection de vélos électriques (EBike-DET) adapté aux environnements d’ascenseur est construit, enrichi par diverses augmentations de données afin d’améliorer l’adaptabilité du modèle. Enfin, la méthode est validée sur YOLOv5, YOLOv10 et SSD, démontrant des gains de performance constants de +5,69 % à +39,81 % de mAP, comme résumé dans le tableau 3. Les contributions peuvent se résumer ainsi : une méthode d’annotation en tranches améliorée qui renforce l’apprentissage des caractéristiques en conditions d’occlusion, la construction d’un jeu de données spécialisé EBike-DET pour les scénarios d’ascenseur, l’intégration de multiples techniques d’augmentation, et la validation expérimentale sur des modèles de détection grand public, montrant une précision et une robustesse accrues par rapport à l’annotation holistique.