$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Con la rápida proliferación de bicicletas eléctricas (EBikes) en todo el mundo, especialmente en China, donde el total superó los 350 millones de unidades en 2022, EBikes se ha convertido en un modo dominante de transporte de corta distancia. Sin embargo, su uso frecuente en espacios reducidos como los ascensores residenciales conlleva graves riesgos de seguridad, como vibraciones anormales, daños en equipos, olores desagradables y riesgos de incendio. Un estudio reciente estima que los incidentes de incendios relacionados con EBike ocurren con una probabilidad aproximada del 1,44%. Estos riesgos ponen de manifiesto la urgente necesidad de métodos de detección EBike eficientes y precisos para mejorar la seguridad en los entornos de ascensores.
A pesar de los avances en visión por ordenador y aprendizaje profundo, la detección de EBike en ascensores sigue siendo un reto. Los conjuntos de datos disponibles públicamente son escasos y a menudo carecen de diversidad en los modelos EBike, colores y condiciones de oclusión, limitando la generalización delmodelo 2. Además, los escenarios de ascensor suelen implicar oclusiones complejas, donde los EBikes quedan parcialmente ocultos por pasajeros o componentes estructurales, reduciendo aún más la precisiónde detección 3,4,5. Los métodos de anotación holística existentes, que tratan EBikes como una única caja delimitadora, a menudo fallan bajo tales condiciones, demostrando la necesidad de mejorar las estrategias de anotación y detección. Como se muestra en la Tabla 1, la anotación holística conduce a un rendimiento notablemente reducido, con una reducción de hasta un 21,5% en la Precisión Media Media en un umbral de Intersección sobre Unión (IoU) de 0,5 (mAP@0,5) en comparación con la anotación fragmentada.
Avances en la detección basada en aprendizaje profundo
Los métodos de aprendizaje profundo, especialmente las redes neuronales convolucionales (CNN), se han aplicado ampliamente en la detección de objetos. La familia You Only Look Once (YOLO) demuestra un rendimiento sólido en tiempo real. Sin embargo, al detectar objetos ocluidos o superpuestos, los modelos YOLO tienden a producir cajas delimitadoras redundantes. Por ejemplo, YOLOv5 mejora la extracción de características multiescala mediante convolución profunda y redes pirámides de características 6,7, mientras que YOLOv10 elimina la supresión no máxima y emplea redes de agregación de caminos para mejorar la velocidad y la fusión multiescala 8,9. A pesar de estas mejoras, la redundancia de los cuadros delimitados y la disminución de la robustez en entornos con mucha oclusión siguen siendo cuestiones sin resolver. Sin embargo, ambos se ven afectados cuando las estructuras clave de EBike están parcialmente bloqueadas, porque la anotación holística proporciona pistas locales limitadas. Como se muestra en la Figura 1A-C, esta limitación conduce a cajas delimitadoras redundantes y confianza inestable en la detección bajo oclusión moderada o fuerte. En cambio, la anotación fragmentada mitiga este problema al permitir que el modelo detecte regiones separadas, como ruedas o la zona trasera, reduciendo así las cajas delimitadoras redundantes bajo oclusión. La Figura 1D-F demuestra además que la anotación fragmentada mejora la localización de características y mantiene la estabilidad en la detección cuando solo permanecen visibles componentes parciales de EBike.
De manera similar, el Detector MultiCaja de Disparo Único (SSD) modelo10,11, basado en la columna vertebral VGG-16, proporciona una detección eficiente a escala y funciona bien en objetospequeños 12. Sin embargo, el SSD también tiene problemas cuando la continuidad de las características se rompe por una oclusión fuerte, lo que provoca detecciones fallidas o regresión inestable de las cajas, incluso cuando se introducen mecanismosde atención 13. La anotación fragmentada también ofrece una ventaja aquí: el modelo aún puede confiar en las partes locales visibles restantes, mejorando la estabilidad de detección en condiciones de múltiples escalas y ocluidas.
Estrategias de anotación y aprendizaje de características locales
La mayoría de los métodos de detección actuales adoptan la anotación holística, que simplifica la anotación pero se basa principalmente en característicasglobales 14,15. Este enfoque tiene dificultades cuando las zonas críticas de EBike —como las ruedas, la zona delantera o la parte trasera— faltan parcialmente. Un estudioreciente 16 ha demostrado que el aprendizaje local de características, que segmenta objetos en múltiples partes anotadas, puede mejorar la robustez y precisión en escenarios desafiantes. En consonancia con esto, los resultados de la Tabla 2 muestran que la anotación en bloques sigue siendo efectiva cuando al menos el 40%-60% de los componentes clave de EBike permanecen visibles, especialmente al anotar las ruedas, la zona delantera y la parte trasera. En cambio, las cajas delimitadoras holísticas siguen siendo suficientes en escenarios de baja oclusión (por ejemplo,
Justificación metodológica para el uso de la detección de esquinas de Harris
La detección de esquinas de Harris se selecciona para la extracción local de características debido a su comportamiento determinista, eficiencia computacional y propiedad libre de entrenamiento, que son esenciales para una anotación fiable en entornos de elevador. A diferencia de detectores de puntos clave aprendidos como SuperPoint y LoFTR, evita entrenamiento adicional y reduce el desplazamiento de dominio bajo datos limitados anotados y una oclusión intensa. En comparación con operadores basados en aristas como Canny y Sobel, las esquinas Harris enfatizan uniones geométricamente significativas en lugar de bordes ruidosos de fondo, permitiendo una localización estable de estructuras EBike, incluyendo ruedas e intersecciones de bastidores. Además, la detección de esquinas de Harris proporciona hiperparámetros interpretables. La constante empírica k controla la sensibilidad y estabilidad en las esquinas. Como se muestra en la Sección 2.6.2.4 y la Figura 2, ajustar k apoya un equilibrio controlado entre robustez y sobredetección, lo que encaja bien con la estrategia propuesta de anotación fragmentada basada en reglas.
Aumento de datos para la robustez
La ampliación de datos ha demostrado ser eficaz para mejorar la diversidad y adaptabilidad de los modelos de detección. Las técnicas comunes incluyen transformaciones geométricas (por ejemplo, rotación, escalado, recorte) y ajustes de color (por ejemplo, escala de grises, modificaciones de luminancia), que simulan condiciones reales y variaciones de iluminación 17,18,19. Al incorporar estas estrategias, los modelos de detección se vuelven más resilientes a la variabilidad y más adecuados para su despliegue en el mundo real.
Para abordar las limitaciones mencionadas, este estudio propone un método mejorado de anotación fragmentada basado en características locales. El método mejora el aprendizaje de características y la robustez al dividir EBikes en múltiples partes independientes anotadas, lo que permite una detección más eficaz bajo oclusión compleja. Además, se construye un conjunto de datos dedicado de Detección de Bicicletas Eléctricas (EBike-DET) adaptado a los entornos de ascensores, enriquecido mediante diversas ampliaciones de datos para mejorar la adaptabilidad del modelo. Finalmente, el método se valida en YOLOv5, YOLOv10 y SSD, demostrando mejoras de rendimiento consistentes de +5,69% a +39,81% mAP, como se resume en la Tabla 3. Las contribuciones pueden resumirse de la siguiente manera: un método mejorado de anotación fragmentada que refuerza el aprendizaje de características bajo condiciones de oclusión, construcción de un conjunto de datos especializado EBike-DET para escenarios de elevador, incorporación de múltiples técnicas de aumento y validación experimental en modelos de detección convencionales, que muestran mayor precisión y robustez en comparación con la anotación holística.