Method Article

Método mejorado de anotación de imágenes en bloques para bicicletas eléctricas en escenarios complejos de ascensores basado en características locales

DOI:

10.3791/69226

March 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Se presenta un método de anotación de imágenes fragmentadas basado en características locales para mejorar la detección de bicicletas eléctricas en escenarios complejos de ascensores utilizando el conjunto de datos EBike-DET y modelos principales de detección de objetos.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El uso creciente de bicicletas eléctricas (EBikes) en entornos confinados como los ascensores residenciales ha planteado serias preocupaciones de seguridad y ha supuesto considerables desafíos para la detección automática de objetos, especialmente debido a las frecuentes oclusiones. Los enfoques tradicionales de detección, que dependen principalmente de anotaciones holísticas, a menudo no logran reconocer con precisión los EBikes parcialmente ocluidos en escenas visualmente complejas. Para superar estas limitaciones, este estudio propone un método novedoso de anotación fragmentada basado en características locales, ofreciendo una estrategia de anotación más interpretable. Al descomponer un EBike en múltiples regiones clave para un marcado independiente, el método propuesto permite que los modelos de detección aprendan información estructural detallada, mejorando así la robustez en condiciones con mucha oclusión. Además, se ha desarrollado un conjunto de datos dedicado, EBike-DET, para apoyar tareas de detección en escenarios realistas de ascensores. Anotado mediante el enfoque fragmentado y aumentado con condiciones ambientales simuladas, el conjunto de datos mejora tanto el rendimiento como la adaptabilidad del modelo. El método propuesto promueve el desarrollo de inteligencia artificial explicable (XAI) al hacer que la detección de objetos sea más transparente y estructuralmente interpretable, lo cual es especialmente valioso en aplicaciones críticas para la seguridad. Se realizan experimentos extensos utilizando tres modelos principales (YOLOv5, YOLOv10 y SSD). Los resultados muestran que YOLOv5, entrenado con EBike-DET con anotaciones fragmentadas, logra mejoras del 3,7% en la precisión, 5,3% en la memoria, 4,5% en la puntuación F1 y 4,4% en mAP. En comparación con los conjuntos de datos públicos, EBike-DET demuestra mayor estabilidad y robustez bajo oclusión. Este estudio no solo avanza en la precisión de la detección, sino que también supone un paso hacia soluciones de IA más interpretables y explicables para su despliegue en sistemas reales de monitorización de seguridad.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Con la rápida proliferación de bicicletas eléctricas (EBikes) en todo el mundo, especialmente en China, donde el total superó los 350 millones de unidades en 2022, EBikes se ha convertido en un modo dominante de transporte de corta distancia. Sin embargo, su uso frecuente en espacios reducidos como los ascensores residenciales conlleva graves riesgos de seguridad, como vibraciones anormales, daños en equipos, olores desagradables y riesgos de incendio. Un estudio reciente estima que los incidentes de incendios relacionados con EBike ocurren con una probabilidad aproximada del 1,44%. Estos riesgos ponen de manifiesto la urgente necesidad de métodos de detección EBike eficientes y precisos para mejorar la seguridad en los entornos de ascensores.

A pesar de los avances en visión por ordenador y aprendizaje profundo, la detección de EBike en ascensores sigue siendo un reto. Los conjuntos de datos disponibles públicamente son escasos y a menudo carecen de diversidad en los modelos EBike, colores y condiciones de oclusión, limitando la generalización delmodelo 2. Además, los escenarios de ascensor suelen implicar oclusiones complejas, donde los EBikes quedan parcialmente ocultos por pasajeros o componentes estructurales, reduciendo aún más la precisiónde detección 3,4,5. Los métodos de anotación holística existentes, que tratan EBikes como una única caja delimitadora, a menudo fallan bajo tales condiciones, demostrando la necesidad de mejorar las estrategias de anotación y detección. Como se muestra en la Tabla 1, la anotación holística conduce a un rendimiento notablemente reducido, con una reducción de hasta un 21,5% en la Precisión Media Media en un umbral de Intersección sobre Unión (IoU) de 0,5 (mAP@0,5) en comparación con la anotación fragmentada.

Avances en la detección basada en aprendizaje profundo

Los métodos de aprendizaje profundo, especialmente las redes neuronales convolucionales (CNN), se han aplicado ampliamente en la detección de objetos. La familia You Only Look Once (YOLO) demuestra un rendimiento sólido en tiempo real. Sin embargo, al detectar objetos ocluidos o superpuestos, los modelos YOLO tienden a producir cajas delimitadoras redundantes. Por ejemplo, YOLOv5 mejora la extracción de características multiescala mediante convolución profunda y redes pirámides de características 6,7, mientras que YOLOv10 elimina la supresión no máxima y emplea redes de agregación de caminos para mejorar la velocidad y la fusión multiescala 8,9. A pesar de estas mejoras, la redundancia de los cuadros delimitados y la disminución de la robustez en entornos con mucha oclusión siguen siendo cuestiones sin resolver. Sin embargo, ambos se ven afectados cuando las estructuras clave de EBike están parcialmente bloqueadas, porque la anotación holística proporciona pistas locales limitadas. Como se muestra en la Figura 1A-C, esta limitación conduce a cajas delimitadoras redundantes y confianza inestable en la detección bajo oclusión moderada o fuerte. En cambio, la anotación fragmentada mitiga este problema al permitir que el modelo detecte regiones separadas, como ruedas o la zona trasera, reduciendo así las cajas delimitadoras redundantes bajo oclusión. La Figura 1D-F demuestra además que la anotación fragmentada mejora la localización de características y mantiene la estabilidad en la detección cuando solo permanecen visibles componentes parciales de EBike.

De manera similar, el Detector MultiCaja de Disparo Único (SSD) modelo10,11, basado en la columna vertebral VGG-16, proporciona una detección eficiente a escala y funciona bien en objetospequeños 12. Sin embargo, el SSD también tiene problemas cuando la continuidad de las características se rompe por una oclusión fuerte, lo que provoca detecciones fallidas o regresión inestable de las cajas, incluso cuando se introducen mecanismosde atención 13. La anotación fragmentada también ofrece una ventaja aquí: el modelo aún puede confiar en las partes locales visibles restantes, mejorando la estabilidad de detección en condiciones de múltiples escalas y ocluidas.

Estrategias de anotación y aprendizaje de características locales

La mayoría de los métodos de detección actuales adoptan la anotación holística, que simplifica la anotación pero se basa principalmente en característicasglobales 14,15. Este enfoque tiene dificultades cuando las zonas críticas de EBike —como las ruedas, la zona delantera o la parte trasera— faltan parcialmente. Un estudioreciente 16 ha demostrado que el aprendizaje local de características, que segmenta objetos en múltiples partes anotadas, puede mejorar la robustez y precisión en escenarios desafiantes. En consonancia con esto, los resultados de la Tabla 2 muestran que la anotación en bloques sigue siendo efectiva cuando al menos el 40%-60% de los componentes clave de EBike permanecen visibles, especialmente al anotar las ruedas, la zona delantera y la parte trasera. En cambio, las cajas delimitadoras holísticas siguen siendo suficientes en escenarios de baja oclusión (por ejemplo,

Justificación metodológica para el uso de la detección de esquinas de Harris

La detección de esquinas de Harris se selecciona para la extracción local de características debido a su comportamiento determinista, eficiencia computacional y propiedad libre de entrenamiento, que son esenciales para una anotación fiable en entornos de elevador. A diferencia de detectores de puntos clave aprendidos como SuperPoint y LoFTR, evita entrenamiento adicional y reduce el desplazamiento de dominio bajo datos limitados anotados y una oclusión intensa. En comparación con operadores basados en aristas como Canny y Sobel, las esquinas Harris enfatizan uniones geométricamente significativas en lugar de bordes ruidosos de fondo, permitiendo una localización estable de estructuras EBike, incluyendo ruedas e intersecciones de bastidores. Además, la detección de esquinas de Harris proporciona hiperparámetros interpretables. La constante empírica k controla la sensibilidad y estabilidad en las esquinas. Como se muestra en la Sección 2.6.2.4 y la Figura 2, ajustar k apoya un equilibrio controlado entre robustez y sobredetección, lo que encaja bien con la estrategia propuesta de anotación fragmentada basada en reglas.

Aumento de datos para la robustez

La ampliación de datos ha demostrado ser eficaz para mejorar la diversidad y adaptabilidad de los modelos de detección. Las técnicas comunes incluyen transformaciones geométricas (por ejemplo, rotación, escalado, recorte) y ajustes de color (por ejemplo, escala de grises, modificaciones de luminancia), que simulan condiciones reales y variaciones de iluminación 17,18,19. Al incorporar estas estrategias, los modelos de detección se vuelven más resilientes a la variabilidad y más adecuados para su despliegue en el mundo real.

Para abordar las limitaciones mencionadas, este estudio propone un método mejorado de anotación fragmentada basado en características locales. El método mejora el aprendizaje de características y la robustez al dividir EBikes en múltiples partes independientes anotadas, lo que permite una detección más eficaz bajo oclusión compleja. Además, se construye un conjunto de datos dedicado de Detección de Bicicletas Eléctricas (EBike-DET) adaptado a los entornos de ascensores, enriquecido mediante diversas ampliaciones de datos para mejorar la adaptabilidad del modelo. Finalmente, el método se valida en YOLOv5, YOLOv10 y SSD, demostrando mejoras de rendimiento consistentes de +5,69% a +39,81% mAP, como se resume en la Tabla 3. Las contribuciones pueden resumirse de la siguiente manera: un método mejorado de anotación fragmentada que refuerza el aprendizaje de características bajo condiciones de oclusión, construcción de un conjunto de datos especializado EBike-DET para escenarios de elevador, incorporación de múltiples técnicas de aumento y validación experimental en modelos de detección convencionales, que muestran mayor precisión y robustez en comparación con la anotación holística.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El conjunto de datos EBike-DET utilizado en este estudio consiste en imágenes recogidas por los autores mediante fotografías in situ en entornos de ascensores, aparcamientos y calles, así como imágenes EBike disponibles públicamente obtenidas de plataformas web. Toda la recogida de imágenes in situ se realizó en entornos no privados únicamente para investigación técnica relacionada con la seguridad sobre la detección de EBike. Las imágenes no tienen como objetivo intencionado individuos, y cualquier persona capturada accidentalmente no es identificable debido a la distancia, oclusión, vistas de espalda o un procesamiento adecuado que elimina rasgos faciales y otros identificadores personales. Las imágenes obtenidas en la web se obtuvieron exclusivamente de plataformas que permiten su reutilización para investigación académica o de recursos publicados bajo licencias abiertas. Todas las imágenes se utilizan estrictamente para fines de investigación y educativos no comerciales. Como no se recopilaron datos personales identificables ni se produjo interacción directa con sujetos humanos, este estudio no requirió la aprobación de un comité de ética institucional conforme a las directrices institucionales del autor.

1. Construcción de conjuntos de datos

  1. Resolución de imagen, espacio de color y formatos de archivo
    1. Configura la resolución nativa de las imágenes a 1280 x 720 píxeles para capturar detalles de alta calidad de los eIkes en varias escenas.
    2. Tras la estandarización, redimensiona las imágenes a 640 x 480 píxeles para equilibrar la eficiencia computacional y la retención de características.
    3. Configura el espacio de color en RGB para preservar la información completa del color, asegurando un reconocimiento preciso de características en diferentes condiciones de iluminación.
    4. Guarda las imágenes en formato JPEG para optimizar el almacenamiento sin comprometer significativamente la calidad de la imagen.
  2. Definición y división de los conjuntos de datos de entrenamiento, validación y prueba
    1. Dividir el conjunto de datos en conjuntos de entrenamiento, validación y prueba con una proporción de 7:2:1, asegurando que el conjunto de datos esté adecuadamente dividido para entrenamiento de modelos, ajuste de hiperparámetros y evaluación del rendimiento.
    2. Establece la semilla aleatoria en 42 para asegurar la reproducibilidad de los datos distribuidos entre diferentes experimentos.
    3. Aplicar muestreo estratificado para mantener una distribución consistente de modelos EBike y niveles de oclusión en cada división de conjuntos de datos, asegurando que no haya desequilibrio de clases entre conjuntos.
    4. Asegura que no haya fugas entre los conjuntos de entrenamiento, validación y pruebas asegurándote de que no aparezca ninguna imagen de EBike en más de un conjunto.
  3. Construcción de conjuntos de datos públicos
    1. Selecciona el conjunto de datos de detección de EBike disponible públicamente de la plataforma de códigoabierto 20,21,22,23, que contiene 210 imágenes de EBikes tanto en escenas panorámicas como parcialmente ocluidas.
    2. Reconocer las limitaciones del conjunto público de datos, incluyendo ángulo de cámara único, baja resolución y escenas de fondo simples, que pueden limitar la capacidad de generalización del modelo, especialmente en escenarios complejos de oclusión.
  4. Construcción de conjuntos de datos EBike-DET
    1. Construir el conjunto de datos EBike-DET para mejorar la cobertura de escenas y la diversidad de muestras, compuesto por 1.680 imágenes de alta calidad de plataformas web y fotografía in situ.
    2. Asegúrate de incluir entornos diversos, como ascensores, aparcamientos y calles, capturando las distintas condiciones en las que pueda estar EBikes.
    3. Incorpora una variedad de ángulos de cámara (vista frontal, lateral y superior) para capturar toda la gama de apariencias de EBike, asegurando un entrenamiento robusto para modelos de detección.
    4. Enriquece el conjunto de datos incluyendo múltiples marcas y modelos de EBike, con variaciones en color, tamaño y accesorios, para aumentar la diversidad de muestras.
    5. Asegúrate de incluir escenarios de oclusión, donde los EBikes estén parcialmente ocluidos por peatones y vehículos, simulando condiciones reales en espacios reducidos como ascensores.
    6. Confirma que el conjunto de datos EBike-DET incluye muestras diversas y complejas, convirtiéndolo en un conjunto fiable para la detección de objetivos bajo condiciones complejas de oclusión.
  5. Normas de inclusión y exclusión para imágenes web y en el sitio
    1. Imágenes web: Incluye solo aquellas que estén disponibles públicamente, capturadas en entornos diversos, con condiciones de iluminación de alta resolución y variadas. Excluye imágenes con fondos de baja resolución o sencillos.
    2. Imágenes en el lugar: Incluye imágenes capturadas en entornos reales, especialmente en lugares como ascensores, aparcamientos o calles. Asegúrate de que las imágenes representen escenarios realistas de EBike con variaciones en oclusión, complejidad de fondo y condiciones meteorológicas. Excluye imágenes con ruido excesivo, distorsión o configuraciones poco realistas.
    3. Asegúrate de que tanto las imágenes web como las presenciales sigan los mismos estándares de resolución y espacio de color para mantener la coherencia en todo el conjunto de datos.
  6. Construcción de la ampliación de datos
    1. Aplica operaciones básicas de aumento, como escalas de grises y rotación, para aumentar la diversidad de muestras y simular diversas condiciones de iluminación y orientaciones de la cámara.
    2. Divide el objetivo de EBike en varias regiones locales independientes, incluyendo el área de ruedas, la zona delantera y la parte trasera, para mejorar el aprendizaje de características locales.
    3. Anota cada región de forma independiente para mejorar la precisión de detección bajo oclusión y asegurar un rendimiento robusto del modelo en diferentes partes de EBike.
    4. Verifica que todas las imágenes aumentadas y las anotaciones fragmentadas mantengan la coherencia estructural con las características de EBike para evitar datos de entrenamiento incompatibles o inválidos.

2. Anotación en fragmentos de características locales

NOTA: Para mejorar la precisión de detección de EBikes en escenarios complejos de oclusión, se propone un método de anotación fragmentada basado en características locales mejoradas. Este método segmenta la región EBike extrayendo sus puntos de características locales y determina si una región debe anotarse en función del grado de oclusión en la región correspondiente. El proceso experimental detallado se ilustra en la Figura 3.

  1. Utilizando los conjuntos de datos de entrenamiento, validación y prueba previamente construidos.
  2. Anotación manual: Utiliza la herramienta LabelImg en el entorno Python para la anotación manual. Etiqueta todas las imágenes exclusivamente como EBikes, asegurando la mínima interferencia de las muestrasnegativas 24,25.
  3. Procesamiento y aumento de datos
    1. Aplicar el método propuesto por Yongjiang et al.22 para reducir el ruido y estandarizar las imágenes y asegurar un tamaño uniforme en todo el conjunto de datos.
    2. Realizar operaciones de aumento de datos (por ejemplo, rotación, ajuste de brillo, escala de grises) para aumentar la diversidad de muestras. Asegúrate de que todas las imágenes aumentadas mantengan la calidad de imagen y mejoren la robustez del modelo a distintos fondos.
  4. Cultivo de superficie EBike
    1. Para asegurar la reproducibilidad de la localización ROI, aplicar los parámetros de inferencia de la Tabla 4 para YOLOv10 (usando el archivo de pesos preentrenado yolov10x.pt). Las coordenadas de la caja delimitadora de salida son las siguientes:
      ROI = [x1,y 1, x2,y 2] (1)
      La ecuación (1) define las coordenadas de la caja delimitadoraROI 26 [x1,y 1, x2,y 2], donde: x1,y 1 = Coordenadas de la esquina superior izquierda del ROI EBike; x2, y2 = Coordenadas de la esquina inferior derecha del ROI EBike. Estas coordenadas se derivan de la salida en bruto de YOLOv10, que predice las cajas delimitadoras en el formato [cx,c y, w, h] para cada objeto detectado. Las fórmulas de conversión son:
      figure-protocol-1(2)
      figure-protocol-2(3)
      figure-protocol-3(4)
      figure-protocol-4(5)
      Donde cx,c y son coordenadas centrales horizontales/verticales normalizadas de la caja delimitadora predicha (escaladas al tamaño de la imagen de entrada de 640 x 480).  w, h es el ancho/altura normalizado de la caja delimitadora predicha (escalada al tamaño de la imagen de entrada).
    2. Filtra la salida del YOLOv10 por el umbral de confianza (0.5) para conservar solo las detecciones relacionadas con EBike (ID de clase correspondiente a la bicicleta eléctrica), y luego procesa con NMS (IoU=0.45) para eliminar cajas redundantes. Convierte la caja delimitadora restante a [x1,y 1, x2, y2] para el recorte de retorno de inversión.
    3. Gestión de múltiples detecciones
      NOTA: En escenarios de ascensor (el objetivo principal del conjunto de datos EBike-DET), los EBikes suelen ser de instancia única (debido a limitaciones de espacio). Para casos con múltiples detecciones EBike (por ejemplo, ascensores saturados con dos EBikes), se aplican las siguientes reglas.
      1. Máxima prioridad de confianza: Seleccione la caja delimitadora con la puntuación máxima de confianza (la confianza en la salida de YOLOv10 refleja la certeza del modelo de que el objeto es un EBike).
      2. Comprobación de validez espacial: Si múltiples detecciones tienen puntuaciones de confianza >0,7, verifique la superposición espacial con los límites estructurales de los elevadores (por ejemplo, evitar que las cajas delimitadoras sobresalgan de las paredes del ascensor). Conservar la detección cuyo punto central cx, cy, esté más cerca del centro de imagen (los ascensores suelen ser monitorizados por cámaras frontales, con los objetivos centrados).
      3. Manejo de casos límite: Si ninguna detección válida cumple el umbral de confianza (por ejemplo, oclusión severa), marque la imagen para corrección manual de retorno de inversión (representando el <3% del conjunto de datos EBike-DET).
  5. Conversión y normalización en escala de grises
    1. Realiza la conversión en escala de grises en la imagen RGB recortada desde el ROI. Utiliza el método de media ponderada para la conversión, siguiendo la fórmula:
      Igra = 0,299 × R + 0,587 × G + 0,114 × B (6)
      donde R, G y B representan los valores de píxeles en los canales rojo, verde y azul, respectivamente. Este método se alinea con la percepción humana del brillo a través de diferentes colores.
    2. Normaliza los valores de píxeles de la imagen en escala de grises al rango de [0, 1] escalando linealmente desde [0, 255]. Esta normalización mejora la estabilidad de los cálculos numéricos y asegura que los cálculos posteriores de gradientes y los umbrales funcionen de forma consistente bajo condiciones de iluminación variables.
  6. Detección de curvas de Harris
    1. Aplica la detección de esquinas de Harris a la escala de grises y normaliza la región EBike para extraer puntos de características locales.
      NOTA: El principio fundamental de la detección de esquinas Harris implica calcular la matriz de autocorrelación para localizar con precisión las esquinas de la imagen, como se muestra visualmente en la Figura 4B. Estas curvas detectadas suelen asociarse a componentes clave de EBike, como las ruedas, la zona delantera y la parte trasera, que a menudo presentan características claras en las curvas.
    2. Calcular el gradiente de la imagen para identificar áreas con cambios significativos de intensidad como se describe a continuación.
      1. Suavizado de imagen: Aplica filtrado gaussiano a la imagen en escala de grises para suprimir el ruido, obteniendo la imagen suavizada de la siguiente manera:
        Is = Gσ*I (7)
        donde * representa la operación de convolución, y Gσ es un núcleo gaussiano 2D con una desviación estándar de σ, que controla el nivel de suavizado. Un valor típico para es 1.0.
      2. Calcular gradiente de imagen: Utiliza un operador de gradiente (como el operador Sobel) para calcular los gradientes horizontales (x) y verticales (y) de la imagen suavizada:
        Ix = Kx * Is ,I y =K y * Iy (8)
        donde Ix eI y son los mapas de gradiente en las direcciones x e y, respectivamente, y Gx y Gy son los núcleos de convolución para el operador de Sobel:
        figure-protocol-5, figure-protocol-6 (9)
      3. Construye la matriz de autocorrelación M basada en los gradientes previamente calculados, usando una ventana local 3 x 3 W centrada en cada píxel (x,y):
        figure-protocol-7(10)
        En la fórmula, W se refiere a una ventana local en la posición (x,y), y la operación ∑W representa la suma de todos los elementos de imagen dentro de esta ventana; A = ∑W Ix2 representa la suma de los gradientes al cuadrado en la ventana W en la dirección x, reflejando la intensidad de los cambios en la dirección x; B=∑W Iy2 representa la suma de los gradientes al cuadrado en la ventana W en la dirección y, reflejando la intensidad de los cambios en la dirección y; C = ∑W IxIy representa la suma del producto de los gradientes en las direcciones x e y dentro de la ventana W, describiendo la correlación de los cambios entre estas dos direcciones.
      4. Calcular la suma de gradientes al cuadrado en ambas direcciones x e y para reflejar la intensidad de los cambios a lo largo de cada dirección. El término cruzado entre los gradientes Ix Iy captura la correlación entre las direcciones x e y.
      5. Función de respuesta de la esquina: Calcular la función de respuesta de la esquina R basada en el determinante y la traza de la matriz de autocorrelación para detectar puntos de esquina en la imagen. Calcula el valor de respuesta para cada píxel y selecciona puntos con valores de respuesta más altos como las esquinas finales, como se muestra en la Figura 2. La función de respuesta en la esquina se da por:
        det(M) = A ⋅ B - C2 (11)
        trace(M) = A + B (12)
        R = det(M) - k ⋅ (trace(M))2 (13)
        donde det(M) es el determinante de M, reflejando el cambio global en la región de características locales, y trace(M) es la traza de la matriz, reflejando la intensidad total del gradiente en la región. La constante empírica k suele fijarse entre 0,04 y 0,06.
        NOTA: Según los experimentos, se encontró que la elección de k influye significativamente en los resultados:
        Cuando k=0,04, los valores de respuesta son demasiado altos, lo que provoca un exceso de puntos de esquina detectados erróneamente.
        Cuando k=0,05, los valores de respuesta están más equilibrados, detectando con precisión las esquinas verdaderas.
        Cuando k=0,06, los valores de respuesta son demasiado bajos, dificultando la detección fiable de puntos de esquina.
    3. Realizar una división de grano grueso de las áreas locales del EBike usando los resultados de detección de puntos de esquina de Harris. Divide el EBike en regiones basadas en la estructura geométrica y la distribución de puntos de esquina, como se muestra en la Figura 4C, para mejorar la robustez y el rendimiento de detección del modelo en escenarios complejos de oclusión.
    4. Área de la rueda: Considere la región válida si contiene al menos 15 puntos de esquina distribuidos simétricamente a lo largo de una forma circular, con una puntuación de simetría no inferior a 0,85. La puntuación de simetría se muestra en la Ecuación 11. La relación ancho-altura de la región de la rueda debe ser aproximadamente 1:1, asegurando que refleje con precisión las características geométricas de la rueda.
    5. Área frontal: Incluye la región si contiene al menos 10 puntos de esquina con una puntuación de simetría no inferior a 0,80, y la relación ancho-altura se sitúa entre 1,2:1 y 1,5:1, asegurando que el área frontal corresponda a las características estructurales esperadas.
    6. Área trasera: Incluye la región si contiene al menos 12 puntos de esquina, con una puntuación de simetría no inferior a 0,75, y la relación ancho-altura entre 1,5:1 y 2:1, asegurando que el área trasera cumpla con las propiedades geométricas esperadas.
  7. Representación de áreas críticas de EBike con cajas delimitadoras
    1. Para convertir puntos de esquina en cuadros delimitadoros rectangulares, utiliza el algoritmo de agrupamiento DBSCAN. Este método agrupa los puntos de esquina cercanos en grupos, asegurando que los puntos de esquina que forman una región estén agrupados. Establece la distancia máxima entre puntos dentro de un grupo a 30 píxeles.
    2. Para cada grupo de puntos de esquina, determina las coordenadas mínima y máxima x e y. Estas coordenadas representan las aristas de la caja delimitadora.
    3. Añade un margen de 10 píxeles alrededor del cuadro delimitador para asegurarse de que todas las características relevantes estén incluidas. Este margen compensa posibles desalineaciones o inexactitudes de píxeles en la detección de puntos de esquina.
    4. Redondea las coordenadas del cuadro delimitador al entero más cercano para asegurar una alineación adecuada de píxeles para el procesamiento de imágenes.
    5. Representar las coordenadas finales de la caja delimitadora para el componente i-ésimo (por ejemplo, rueda, área delantera, área trasera) como se describe a continuación.
      1. Combina las regiones definidas (área de ruedas, área delantera y área trasera) y representa todas las áreas críticas del EBike usando cajas delimitadoras rectangulares.
      2. Defina las coordenadas de la caja delimitadora para el componente i (por ejemplo, rueda, área delantera, área trasera) como:
        figure-protocol-8(14)
        donde Bi representa la caja delimitadora del componente i-ésimo, y figure-protocol-9 y figure-protocol-10 son las coordenadas de las esquinas superior izquierda e inferior derecha, respectivamente.
  8. Manejo de oclusión parcial
    1. Evalúa la puntuación de simetría de esquinas para cada región. Aceptar una región si la puntuación de simetría es mayor o igual a 0,7.
    2. Para el manejo de oclusión, mide la visibilidad de los puntos de esquina. Acepta una región si al menos el 50% de las esquinas son visibles. Si se ven entre el 30% y el 50% de las esquinas, marca la región para una revisión más detallada. Si menos del 30% de las esquinas son visibles, rechazar la región debido a la falta de visibilidad para una detección precisa.
  9. Juicio de precisión de las regiones de características locales
    1. Evalúa la precisión de cada región local de características utilizando tres métricas operativas cuantitativas: una métrica de simetría S, una métrica de continuidad de contorno C y una métrica de conexión-estructura L. Aplica estas métricas de forma uniforme al área de ruedas, la zona delantera y la zona trasera.
    2. Aceptar una región solo cuando todas las métricas cumplan los umbrales predefinidos. Si una métrica falla dentro de un rango tolerable, amplía el ROI y reevalúa. Si fallan dos o más métricas, marca la región como poco fiable.
  10. Análisis de precisión de características por región de ruedas
    1. Puesto de control operativo con vista frontal
      1. Calcular la métrica de simetría:
        figure-protocol-11(15)
        donde nL y nR denotan los conteos de las esquinas izquierda y derecha.
      2. Aceptar la región si S ≥ 0,85. Como se muestra en la Figura 5A, la rueda presenta una forma circular con simetría, y los puntos de las esquinas Harris a lo largo de la circunferencia forman un patrón simétrico. Así que anota toda la zona de la rueda.
      3. Si 0,70 ≤ S<0,85, expande el ROl en 10-20 píxeles y repite la evaluación para permitir que más características reales vuelvan a entrar en el área de cálculo, y luego reevalúa. Como se muestra en la Figura 5D, se produce oclusión parcial de la rueda, por lo que el rango de recorte debe ampliarse para capturar más características de la Ebike para su evaluación.
      4. Si es S<0,70, etiqueta la región como poco fiable. Como se muestra en la Figura 5G, la forma circular está alterada; excluye esta región de la anotación.
    2. Punto de control operativo con vista lateral
      1. Mide la continuidad de contorno usando:
        figure-protocol-12 (16)
      2. Aceptar cuando C ≥ 0,75. Como se muestra en la Figura 5B, la relación entre la longitud real del arco continuo y la longitud de arco esperada cumple con los requisitos, el contorno se ajusta completamente al borde y no hay rotura evidente.
      3. Si 0,55 ≤ C < 0,75, refina la extracción de contorno y vuelve a comprobarlo. Como se muestra en la Figura 5E, la relación de corriente entre la longitud continua del arco y la longitud esperada del arco está en el rango crítico; Es necesario ajustar el umbral del algoritmo de extracción para que el contorno sea más completo.
      4. Si C < 0,55, rechazar la región debido a la insuficiente continuidad geométrica. Como se muestra en la Figura 5H, los requisitos de análisis no pueden cumplirse.
    3. Punto de control operativo con vista superior
      1. Evalúa la conectividad estructural utilizando:
        figure-protocol-13 (17)
      2. Acepta cuando L ≥ 0,70. Como se muestra en la Figura 5C, la desviación entre la distancia observada y la distancia esperada se compensa efectivamente, la conectividad estructural cumple con los requisitos y la conexión de posición relativa entre el vehículo y el entorno del elevador está completa.
      3. Si L < 0,70, amplía el ROI y reevalúa. Como se muestra en la Figura 5F, la desviación de corriente entre la distancia observada y la distancia esperada es relativamente grande; Es necesario ampliar el alcance del análisis e incluir más estructuras circundantes para mejorar la precisión de la evaluación de la conectividad.
      4. Si la conectividad sigue siendo inconsistente, clasifica la región como poco fiable. Como se muestra en la Figura 5I, no puede utilizarse como un área de análisis eficaz.
  11. Análisis de precisión de características en el área frontal
    1. Para la evaluación de la precisión de características del área frontal de EBike, siga el marco unificado basado en reglas definido en la Sección 2.10, incluyendo la evaluación de simetría bajo la vista frontal usando la métrica S según la ecuación 15, la evaluación de continuidad de contornos bajo la vista lateral usando la métrica C definida en la ecuación 16, y la validación de conectividad estructural bajo la vista superior usando la métrica L según la ecuación 17.
    2. Debido a la variabilidad geométrica y a la frecuente oclusión parcial en la zona frontal, se adoptan umbrales moderadamente relajados en comparación con la región de la rueda. Se acepta una región de área frontal cuando S ≥ 0,80, C ≥ 0,70 y L ≥ 0,65. Como se ilustra en la Figura 6A-C, las regiones que cumplen estos criterios presentan distribuciones equilibradas de características izquierda-derecha, contornos coherentes y conectividad estructural estable.
    3. Si alguna métrica se encuentra dentro del rango intermedio especificado en la Sección 2.10, amplíe la región de interés y reevalúe para incorporar características contextuales adicionales, como se muestra en la Figura 6D-F. Las regiones que no cumplen los criterios mínimos tras la reevaluación se clasifican como poco fiables, como se ilustra en la Figura 6G-I.
  12. Análisis de precisión de características en la zona trasera
    1. Para el análisis de precisión de características en la zona trasera, sigue el protocolo de evaluación definido en la Sección 2.10, empleando las métricas S según la ecuación 15, C según la ecuación 16 y L según la ecuación 17 en las vistas frontal, lateral y superior, respectivamente.
    2. La zona trasera es más susceptible a la oclusión causada por pasajeros, objetos transportados o estructuras de ascensores. Por lo tanto, aplica condiciones de rechazo más estrictas para evitar anotaciones poco fiables. Se acepta una región de área trasera cuando S ≥ 0,75, C ≥ 0,70 y L ≥ 0,65. Los casos representativos aceptados con suficiente simetría, continuidad de contorno y conectividad se muestran en la Figura 7A-C.
    3. Para regiones con valores límite de métrica, realizar una expansión y reevaluación del ROI, como se ilustra en la Figura 7D-F. Si las relaciones geométricas permanecen ambiguas o las métricas no cumplen los criterios de aceptación, marquen la región como poco fiable, como se muestra en la Figura 7G-I.
  13. Análisis de precisión de características en la zona trasera
    1. Para el análisis de precisión de características en el área trasera, siga el protocolo de evaluación definido en la Sección 2.10, utilizando las mismas métricas S definidas en la Ecuación 15, C definidas en la Ecuación 16 y L definidas en la Ecuación 17 bajo los puntos de vista correspondientes.
    2. En comparación con la zona delantera, la parte trasera es más susceptible a la oclusión causada por pasajeros, objetos transportados y estructuras interiores de ascensores. Por lo tanto, aplica criterios de rechazo algo más estrictos para evitar anotaciones poco fiables. Se acepta una región de área trasera cuando S ≥ 0,75, C ≥ 0,70 y L ≥ 0,65. Como se muestra en la Figura 7A-C, las regiones aceptadas mantienen suficiente simetría, coherencia de contornos y conectividad estructural.
    3. Para regiones con valores límite de métricas, amplíe y reevalúe el ROI siguiendo la Sección 2.10, como se ilustra en la Figura 7D-F. Si la consistencia geométrica sigue siendo insuficiente tras la reevaluación, marqué la región como poco fiable, como se muestra en la Figura 7G-I.
  14. Implementación del oleoducto
    1. Estructura de archivos y carpetas: La implementación sigue una estructura modular de directorios que separa la detección, la extracción local de características y el juicio por anotaciones. Consulta la organización de carpetas representativas que se muestra más abajo. Almacena todos los resultados intermedios en subcarpetas dedicadas para permitir una inspección independiente de cada paso de procesamiento.
      project_root/

      ├── datos/
      │ ├── imágenes/
      │ │ ├── tren/
      │ │ ├── val/
      │ │ └── prueba/
      │ └── Anotaciones/

      ├── Detección/
      │ ├── detect_ebike.py
      │ └── yolov10_config.yaml

      ├── ROI/
      │ ├── crop_roi.py
      │ └── cropped_images/

      ├── Harris/
      │ ├── harris_corner.py
      │ └── corner_visualization/

      ├── chunk_annotation/
      │ ├── region_partition.py
      │ ├── validity_judgment.py
      │ └── final_annotations/

      └── configuraciones/
      └── umbrales.yaml
    2. Pipeline de ejecución y líneas de comandos de ejemplo
      1. Detección de EBike y localización de retorno de inversión: Localiza regiones EBike usando un modelo de detección de objetos preentrenado. Almacena los resultados de detección como coordenadas de caja delimitadora.
        Detección de Python/detect_ebike.py \
        --datos de entrada/imágenes/prueba/ \
        --ROI/detections.json
      2. Recorte de retorno de inversión: Utiliza los cuadros delimitados detectados para recortar regiones de EBike desde las imágenes originales.
        ROI/crop_roi.py de Python \
        --detecciones ROI/detections.json \
        --imágenes, datos/imágenes/prueba/ \
        --ROI/cropped_images/
        Guarda cada imagen recortada usando el formato de nombre: imageID_roi_xmin_ymin_xmax_ymax.jpg
      3. Extracción de esquinas de Harris: Aplica la detección de esquinas de Harris a cada ROI recortado tras la conversión en escala de grises. Guarda los mapas de respuesta de las esquinas y las superposiciones visuales para inspección.
        Python Harris/harris_corner.py \
        --entrada de retorno de la inversión/cropped_images/ \
        --salida harris/corner_visualization/ \
        --config configs/thresholds.yaml
      4. Particionamiento de grano grueso y anotación de bloques: Dividir las regiones de características locales en ruedas, área delantera y trasera basándose en la distribución espacial de los puntos de esquina. Aplicar el juicio de validez utilizando criterios geométricos y basados en características.
        Python chunk_annotation/region_partition.py \
        --rincones Harris/corner_visualization/ \
        --salida chunk_annotation/final_annotations/
    3. Salidas intermedias esperadas y puntos de control visuales: Guarda las salidas intermedias producidas por cada etapa de procesamiento que sirven como puntos de control visuales. Estas salidas intermedias permiten la verificación paso a paso de la localización del ROI, la calidad de extracción de esquinas, la partición de regiones y las decisiones finales de anotación.
      1. Salida de recorte de ROI: Guarda imágenes recortadas de EBike en ROI/cropped_images/. Cada imagen contiene una única región EBike extraída del fotograma original.
      2. Visualización de las esquinas Harris: Guarda las superposiciones de esquinas en Harris/corner_visualization/. Para regiones válidas de ruedas, se observa un conjunto denso de puntos de esquina a lo largo de la estructura circular del borde. En esta etapa se identifican regiones con respuestas de esquinas insuficientes.
      3. Resultados de la partición de regiones: Visualiza las regiones particionadas (rueda, zona delantera, zona trasera) de forma independiente. Solo conservar regiones que cumplan criterios de validez predefinidos (por ejemplo, densidad suficiente de esquinas y consistencia geométrica).
      4. Salida final de anotación: Almacenar regiones aceptadas en chunk_annotation/final_annotations/ como archivos de anotación estructurados. Excluye las regiones que no cumplan con el juicio de validez y no las propague a etapas posteriores.
        NOTA: Todos los umbrales utilizados para la detección de esquinas y el juicio de validez regional están centralizados en los archivos de configuración. La tubería opera con entradas de fotograma único sin dependencia temporal, permitiendo reproducir los resultados de forma independiente para cada imagen. Dadas imágenes de entrada, archivos de configuración y orden de ejecución idénticos, las salidas intermedias generadas y las anotaciones finales siguen siendo deterministas.
  15. Pasos de finalización y publicación del conjunto de datos
    NOTA: Para garantizar que el protocolo termine con un punto final claro y reproducible, se define una etapa de finalización para consolidar el guardado de anotaciones, la validación de calidad, el empaquetado del conjunto de datos y la documentación de versiones.
    1. Guardar las anotaciones finales: Tras el juicio de validez de la región, guarda todas las anotaciones aceptadas en chunk_annotation/final_annotations/ usando el formato de texto YOLO, con un archivo de anotación correspondiente a cada imagen. Conservar solo las regiones que cumplan los criterios geométricos y basados en características predefinidos en el conjunto final de anotaciones y excluir de su uso las regiones rechazadas o poco fiables.
    2. Validación de la calidad de la anotación: Validar la calidad final de la anotación reaplicando los mismos criterios de validez utilizados durante la evaluación de la región, incluyendo simetría, continuidad de contorno y métricas de conectividad estructural. Eliminar las anotaciones que no cumplan estos criterios durante esta fase de verificación, asegurando la coherencia entre la generación de anotaciones y el control de calidad.
    3. Empaquetado del conjunto de datos: Tras la validación, organiza imágenes y anotaciones en divisiones fijas de entrenamiento, validación y prueba según la partición definida del conjunto de datos. La estructura de directorios y las listas de archivos quedan congeladas en esta etapa, y el conjunto de datos empaquetado se prepara para entrenamiento y evaluación sin modificaciones adicionales.
    4. Documentación de versiones y semilla: Los archivos de configuración, incluidos los parámetros de detección de esquinas y los umbrales de validez de la región, se conservan junto con el conjunto de datos empaquetado. Utiliza semillas aleatorias para la división de datos, corregir la ejecución de algoritmos y registrar. Además, documenta las versiones de los pesos de modelos, archivos de configuración y herramientas de anotación. Dadas las idénticas datos de entrada, archivos de configuración y semillas registradas, las anotaciones finales y las divisiones de conjuntos de datos siguen siendo deterministas.

3. Aumento de datos

NOTA: Un estudio previo ha demostrado que los conjuntos de datos de entrenamiento que carecen de preprocesamiento suficiente y aumento de datos a menudo resultan en un rendimiento degradadodel modelo 22. Para abordar estos desafíos, se siguió el siguiente procedimiento.

  1. Iluminación
    1. Simula variaciones de iluminación dentro de los ascensores para corregir cambios frecuentes de iluminación ajustando el factor de brillo dentro del rango de 0,6–1,4, con una probabilidad de 0,8.
    2. Aplica ajustes de intensidad de luz para pasar de ambientes luminosos a tenues, simulando el desenfoque inducido por movimiento de EEike. Usa una probabilidad de 0,7 para esta operación.
    3. Generar muestras aumentadas ajustando las condiciones de iluminación, asegurando una visibilidad estable bajo distintos niveles de iluminación.
    4. Aplica estas operaciones de iluminación fuera de línea y guárdalas para su procesamiento posterior. Establece la semilla aleatoria en 42 para asegurar la reproducibilidad del proceso de aumentación.
  2. Oclusión
    1. Crea escenarios de oclusión sintética para reflejar las condiciones de saturación de ascensores. Aplicar máscaras de oclusión (por ejemplo, siluetas humanas, bloques de objetos) con una probabilidad de 0,6.
    2. Aplicar oclusiones en mosaico para simular la obstrucción parcial de EBikes durante la entrada y salida del ascensor. Utiliza porcentajes de oclusión del 30%, 50% o 70%, y asegúrate de que la oclusión se aplique aleatoriamente en cualquier cuadrante (arriba, abajo, izquierda, derecha) de la imagen.
    3. Incorporar muestras ocluidas para mejorar la robustez y estabilidad en la detección bajo visible parcial, asegurando que al menos un componente clave (por ejemplo, rueda, zona delantera, zona trasera) permanezca visible.
    4. Realiza la mejora de oclusión fuera de línea y valida las muestras para asegurar que se conserven las características esenciales de EBike. Pon la semilla aleatoria en 42 para mayor reproducibilidad.
  3. Puntos de vista
    1. Ajusta los ángulos de visión dentro de un rango predefinido de ±15° para simular diversos ángulos de cámara en diferentes entornos de ascensor. Esta operación debe aplicarse con una probabilidad de 0,7.
    2. Aplica transformaciones de perspectiva con coeficientes de distorsión entre 0.0 y 0.2 para replicar diferentes posiciones de cámara (por ejemplo, puntos elevados, laterales y oblicuos).
    3. Escala y desplaza la región de EBike entre 0,8 y 1,2 veces para simular cambios en la distancia de la cámara al objetivo. Aplica esta transformación con una probabilidad de 0,8.
    4. Confirma que todas las transformaciones de puntos de vista mantienen la integridad geométrica del EBike, y que no se distorsionan características críticas.
    5. Realiza transformaciones de puntos de vista fuera de línea y almacena las imágenes aumentadas. Pon la semilla aleatoria en 42 para mayor reproducibilidad.
  4. Mejora
    1. Aplicar escala de grises al 30% de las imágenes con una probabilidad de 0,3 para introducir variaciones impulsadas por la luminancia y mejorar la robustez del modelo en condiciones de poca luz.
    2. Utiliza la ecualización de histogramas en el 20% de las muestras para mejorar el contraste y la visibilidad de las características clave de la EBike, bajo condiciones de iluminación exigentes.
    3. Combina estrategias de iluminación, oclusión y aumento de puntos de vista secuencialmente para generar muestras de alta diversidad. Utiliza probabilidades de 0,9 para este proceso de varios pasos.
    4. Revisa las muestras aumentadas para asegurarte de que mantienen la integridad estructural de EBike antes de integrarlas en el conjunto de datos final.
    5. Realizar operaciones de mejora fuera de línea y almacenar las imágenes para su uso posterior en entrenamiento. Establece la semilla aleatoria en 42 para asegurar la reproducibilidad de todo el proceso de aumento.

4. Entorno experimental

  1. Configura el entorno experimental para garantizar la eficiencia y estabilidad computacional durante el entrenamiento y las pruebas del modelo.
  2. Utiliza un procesador multinúcleo moderno, una GPU dedicada para la aceleración de aprendizaje profundo, memoria suficiente y un sistema de almacenamiento estable para soportar el procesamiento de datos de imágenes a gran escala de EBike.
  3. Adapta el entorno de software con la configuración de hardware instalando versiones compatibles del framework de aprendizaje profundo, controladores de GPU y bibliotecas de aceleración para optimizar la velocidad de entrenamiento y el rendimiento de inferencia.
  4. Consulte las Tablas 5, 6, 7 y 8 para especificaciones detalladas de hardware, entorno de software, dependencias de modelos y configuraciones de equipos de imagen para garantizar la reproducibilidad.
  5. Sobrecarga computacional y análisis en tiempo de ejecución
    1. Analizar la sobrecarga computacional asociada a la estrategia de anotación fragmentada en términos de complejidad de anotación y eficiencia en tiempo de ejecución. En comparación con la anotación holística, la anotación fragmentada representa un EBike usando regiones a nivel de pieza, incluyendo la zona de la rueda, la parte delantera y la parte trasera. Anota estas regiones solo cuando sean visibles y cumplan los criterios de validez geométricos y basados en características predefinidos, en lugar de aplicarse para cada instancia.
      NOTA: Desde la perspectiva de la anotación, el aumento en el número de etiquetas sigue siendo limitado y estructuralmente limitado. Una instancia de EBike aporta como máximo tres anotaciones a nivel de parte, mientras que menos regiones se anotan en casos de oclusión parcial (por ejemplo, cuando solo se ve el área frontal). Como resultado, el número de etiquetas por imagen varía según la visibilidad de la escena y las condiciones de oclusión, y el número medio de etiquetas aumenta moderadamente, como se resume en la Tabla 9. Este diseño equilibra la representación local de características con la complejidad de las anotaciones. Desde la perspectiva de la inferencia, la anotación fragmentada no introduce un aumento proporcional en el coste de postprocesado. Aunque la detección a nivel parcial puede generar cajas delimitadoras candidatas adicionales, las detecciones se agregan a nivel de objeto EBike para su evaluación final, y se aplica un filtrado basado en confianza antes del postprocesado. Esta estrategia de anotación condicional y basada en la visibilidad limita a los candidatos de detección innecesarios. Para modelos como YOLOv10, que reducen la dependencia de la supresión tradicional no máxima, la sobrecarga adicional introducida por el chunking sigue siendo limitada en la práctica.
    2. Evalúa el rendimiento en tiempo de ejecución a una resolución típica de vigilancia de elevador de 640 x 480 píxeles usando una GPU NVIDIA RTX 3090. Como se muestra en la Tabla 9, la anotación fragmentada mantiene la capacidad de inferencia en tiempo real, con solo una reducción menor en los fotogramas por segundo en comparación con la anotación holística. Estos resultados indican que la estrategia de anotación fragmentada sigue siendo adecuada para la monitorización en tiempo real de EBike en entornos de elevadores.

5. Métricas de evaluación

NOTA: Aunque durante el entrenamiento y la inferencia se utilizan anotaciones fragmentadas, la evaluación se realiza a nivel de objeto de la bicicleta eléctrica. Las detecciones a nivel de parte se agregan en una única decisión de bicicleta eléctrica según las normas definidas en la Sección 2.4,3.

  1. Aplicar métricas estándar de evaluación comúnmente utilizadas en la investigación de detección de objetivos27 para evaluar de forma exhaustiva el rendimiento de algoritmos en escenarios de detección de oclusión de EBike.
  2. Precisión de detección (P)
    1. Utiliza la Ecuación (8) para calcular la precisión de detección, que mide la proporción de EBikes correctamente identificados entre todas las muestras positivas predichas.
      figure-protocol-14 (18)
      donde TP denota los verdaderos positivos y FP denota falsos positivos.
    2. Establece el umbral de IoU a 0,5 para determinar si las cajas delimitadoras predichas coinciden con las casillas de verdad en el terreno.
    3. Utilizar la precisión para evaluar la capacidad del modelo para reducir alarmas innecesarias causadas por la identificación errónea de objetos no EBike.
    4. Comando(s) para generar esta métrica: Utiliza el script de evaluación relevante (por ejemplo, evaluate_precision.py). Guarda los resultados en precision_results.txt para un análisis más detallado.
  3. Tasa de retirada (R)
    1. Utiliza la Ecuación (9) para determinar cuán eficazmente el modelo identifica EBikes en entornos de elevadores, especialmente cuando la oclusión afecta a la visibilidad.
      figure-protocol-15(19)
      donde FN representa falsos negativos.
    2. Establezca el umbral de IoU en 0,5 para evaluar la precisión de las detecciones. Utiliza la llamada de recuerdo para evaluar la capacidad del modelo de minimizar las detecciones fallidas, asegurando que los EBikes permanezcan identificados con precisión incluso cuando están parcialmente obstruidos.
    3. Usa comando(s) para generar esta métrica: ejecuta evaluate_recall.py. Resultados de guardado en recall_results.txt.
      NOTA: Las detecciones pasadas por alto son críticas en escenarios de ascensores llenos de gente y deben minimizarse por seguridad. Las detecciones fallidas plantean preocupaciones de seguridad en escenarios de ascensores llenos de gente y deben minimizarse.
  4. Puntuación F1
    1. Calcula la puntuación F1 usando la Ecuación (10) para obtener una representación equilibrada de la precisión y el rendimiento de recuerdo del modelo.
      figure-protocol-16(20)
    2. Utiliza la puntuación F1 para proporcionar una evaluación holística, especialmente en situaciones donde la precisión y el recuerdo presentan compensaciones bajo distintos niveles de oclusión.
    3. Utiliza comando(s) para generar esta métrica: Ejecuta evaluate_f1.py para calcular la puntuación F1. Guardados resultan en f1_score_results.txt.
  5. Precisión media media (mAP)
    1. Utiliza la Ecuación (11) para medir la capacidad global de detección del modelo a través de diferentes apariencias de EBike, condiciones de oclusión y variaciones de iluminación.
      figure-protocol-17 (21)
      Donde APc denota la precisión media de la categoría c y C es el número de categorías.
    2. Establece el umbral de IoU en 0,5 para evaluar el rendimiento del modelo en diferentes categorías.
    3. Utiliza mAP@0.5 para determinar qué tan bien se adapta el modelo a diversas condiciones visuales en entornos de ascensores, asegurando una evaluación exhaustiva del rendimiento de detección.
    4. Utiliza el/los siguiente comando(s) para generar esta métrica: ejecutar evaluate_map.py con los parámetros especificados. Resultados de guardado en map_results.txt.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comparación entre la anotación holística y la anotación fragmentada en un conjunto de datos público

La evaluación se realizó sobre un conjunto de datos público que comprende 210 imágenes de EBike recogidas de escenas de vigilancia abierta y monitorización del tráfico, con condiciones de iluminación diversas, colores de EBike y distintos grados de oclusión. Cada imagen se anotaba usando tanto el método holístico (caja delimitadora única) como e...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pasos críticos

Un paso fundamental en este protocolo es el método de anotación fragmentada basado en características locales, donde los EBikes se segmentan en áreas de rueda, delantera y trasera. Esta división garantiza que los modelos de detección puedan aprender representaciones de grano fino, que resultaron esenciales en entornos de elevadores con mucha oclusión. Por ejemplo, YOLOv5 entrenado con anotaciones fragmentadas en el conjunto de ...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por el Fondo de Planificación de la Investigación en Humanidades y Ciencias Sociales 2025 del Ministerio de Educación de China (Subvención nº 25YJAZH002), el Proyecto de Mejora de la Capacidad de Investigación de Disciplinas Clave de la Provincia de Guangdong 2024 (Subvención nº 2024ZDJS086), el Programa Provincial de Formación en Innovación y Emprendimiento de Pregrado de Guangdong en 2024 (Subvención nº S202413714017) y el Programa de Conexión Empleo-Educación del Ministerio de Educación: "Innovación y práctica del mecanismo de formación de talento para estudiantes de aplicaciones informáticas orientados a la tecnología de inteligencia artificial" (Subvención nº 2025072869464).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
h5py (SSD)Grupo HDF2.10.0
matplotlib (SSD)Comunidad Matplotlib3.1.2
matplotlib (YOLOv10)Comunidad Matplotlib3.9.0
matplotlib (YOLOv5)Comunidad Matplotlib3.8.4
matplotlib (YOLOv5+SAHI)Comunidad Matplotlib3.8.4
matplotlib (YOLOv8-Seg)Comunidad Matplotlib3.9.0
numpy (SSD)Comunidad NumPy1.17.0
numpy (YOLOv10)Comunidad NumPy1.26.3
numpy (YOLOv5)Comunidad NumPy1.26.4
numpy (YOLOv5+SAHI)Comunidad NumPy1.26.4
numpy (YOLOv8-Seg)Comunidad NumPy1.26.3
onnx (YOLOv10)ONNX1.14.0
onnx (YOLOv5)ONNX1.14.0
onnx (YOLOv5+SAHI)ONNX1.14.0
onnxruntime (YOLOv10)Microsoft1.15.1
onnxruntime (YOLOv5)Microsoft1.15.1
onnxruntime (YOLOv5+SAHI)Microsoft1.15.1
opencv-python (SSD)OpenCV4.1.2.30
opencv-python (YOLOv10)OpenCV4.9.0.80
opencv-python (YOLOv5)OpenCV4.9.0.80
opencv-python (YOLOv5+SAHI)OpenCV4.9.0.80
opencv-python (YOLOv8-Seg)OpenCV4.9.0.80
Pandas (YOLOv10)Comunidad Pandas2.2.2
Pandas (YOLOv5)Comunidad Pandas2.2.2
pandas (YOLOv5+SAHI)Comunidad Pandas2.2.2
Pandas (YOLOv8-Seg)Comunidad Pandas2.2.2
Almohada (SSD)Reveladores de almohadas8.2.0
Almohada (YOLOv10)Reveladores de almohadas10.2.0
Almohada (YOLOv5)Reveladores de almohadas8.5.0
Almohada (YOLOv5+SAHI)Reveladores de almohadas8.5.0
Almohada (YOLOv8-Seg)Reveladores de almohadas10.2.0
psutil (YOLOv10)Desarrolladores de Psutil5.9.8
psutil (YOLOv5)Desarrolladores de Psutil5.9.8
psutil (YOLOv5+SAHI)Desarrolladores de Psutil5.9.8
pycocotools (YOLOv10)Consorcio COCO2.0.7
pycocotools (YOLOv5)Consorcio COCO2.0.7
pycocotools (YOLOv5+SAHI)Consorcio COCO2.0.7
pycocotools (YOLOv8-Seg)Consorcio COCO2.0.7
py-cpuinfo (YOLOv10)Desarrolladores de Py-CPUInfo9.0.0
py-cpuinfo (YOLOv5)Desarrolladores de Py-CPUInfo9.0.0
py-cpuinfo (YOLOv5+SAHI)Desarrolladores de Py-CPUInfo9.0.0
PyYAML (YOLOv10)PyYAML6.0.1
PyYAML (YOLOv5)PyYAML6.0.1
PyYAML (YOLOv5+SAHI)PyYAML6.0.1
PyYAML (YOLOv8-Seg)PyYAML6.0.1
solicitudes (SSD)Solicitudes en Python2.27.1
solicitudes (YOLOv10)Solicitudes en Python2.32.3
solicitudes (YOLOv5)Solicitudes en Python2.31.0
solicitudes (YOLOv5+SAHI)Solicitudes en Python2.31.0
SAHIDesarrolladores de SAHI0.3.4+
scipy (SSD)Comunidad SciPy1.2.1
scipy (YOLOv10)Comunidad SciPy1.13.0
scipy (YOLOv5)Comunidad SciPy1.13.0
scipy (YOLOv5+SAHI)Comunidad SciPy1.13.0
scipy (YOLOv8-Seg)Comunidad SciPy1.13.0
seaborn (YOLOv10)Desarrolladores de Seaborn0.13.2
seaborn (YOLOv5)Desarrolladores de Seaborn0.13.2
seaborn (YOLOv5+SAHI)Desarrolladores de Seaborn0.13.2
seaborn (YOLOv8-Seg)Desarrolladores de Seaborn0.13.2
Con formas (YOLOv5+SAHI)Desarrolladores Shapey2.0.4
SSDAutores de Caffe/Original SSDPython 3.6.13+; PyTorch 1.2.0+; CUDA 10.0; CUDNN 7.4.1
Placa tensor (SSD)Google2.10.1
Tensorboard (YOLOv5)Google2.16.2
Tensorboard (YOLOv5+SAHI)Google2.16.2
Torchvision (SSD)PyTorch0.4.0
Torchvision (YOLOv10)PyTorch0.15.2
Torchvision (YOLOv5)PyTorch0.17.2
Torchvision (YOLOv5+SAHI)PyTorch0.17.2
Torchvision (YOLOv8-Seg)PyTorch0.16.1+
tqdm (SSD)Desarrolladores de TQDM4.60.0
tqdm (YOLOv10)Desarrolladores de TQDM4.66.4
tqdm (YOLOv5)Desarrolladores de TQDM4.66.2
tqdm (YOLOv5+SAHI)Desarrolladores de TQDM4.66.2
Ultralíticos (YOLOv8-Seg)Ultralíticos8.2.99+
YOLOv10Equipo YOLOv10Python 3.8.0+; PyTorch 2.0.1+cu118; CUDA 11,8; CUDNN 8.7
YOLOv5UltralíticosPython 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2
YOLOv5 + SAHIUltralytics + Desarrolladores SAHIPython 3.8.0+; PyTorch 2.2.2+; CUDA 11.2; CUDNN 8.1.2
YOLOv8-SegUltralíticosPython 3.8.0+; PyTorch 2.0.1+cu118; CUDA 11,8; CUDNN 8.6.0+

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Li, Y., Han, L., Ning, X., Xu, Y. Fire risk of electric bicycle based on fuzzy Bayesian network. J Phys Conf Ser. 1578 (1), 012153-012160 (2020).
  2. Cao, F., Sheng, G., Feng, Y. Detection dataset of electric bicycles for lift control. Alexandria Eng J. 105 (1), 736-742 (2024).
  3. Zhang, J., Mohd Yunos, Z., Haron, H. Interactivity recognition graph neural network model for improving human-object interaction detection. Electronics. 12 (2), 470-482 (2023).
  4. Yang, D., Su, C., Wu, H., Xu, X., Zhao, X. Shelter identification for shelter-transporting AGV based on improved YOLOv5. IEEE Access. 10 (1), 119132-119139 (2022).
  5. Wang, X., et al. LDS-YOLO: A lightweight small object detection method for dead trees. Comp Electron Agri. 198 (1), 107035-107044 (2022).
  6. Xu, R., Zhu, D., Chen, M. A novel underwater object detection enhanced algorithm based on YOLOv5-MH. IET Image Process. 18 (10), 3415-3429 (2024).
  7. Shang, J., Wang, J., Liu, S., Wang, C., Zheng, B. Small target detection algorithm for UAV aerial photography based on improved YOLOv5s. Electronics. 12 (11), 2434-2446 (2023).
  8. Wang, C. Y., Liao, H. Y. M. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems. APSIPA Trans Signal Inf Process. 13 (1), 1-18 (2024).
  9. Sapkota, R., et al. YOLO11 to its genesis: A decadal and comprehensive review of the YOLO series. Artif Intell Rev. 58 (2), 145-182 (2025).
  10. Huang, Z., Yin, Z., Ma, Y., Fan, C., Chai, A. Mobile phone component object detection based on improved SSD. Procedia Comp Sci. 183 (1), 107-114 (2021).
  11. Li, Y., Yang, F., Li, Y., Tan, C., Liu, Z. Circuit breaker identification based on SSD. J Phys Conf Ser. 2418 (1), 012080-012088 (2023).
  12. Deng, X., Li, S. Improved SSD object detection based on attention mechanism and feature fusion. J Phys Conf Ser. 2450 (1), 012088-012096 (2023).
  13. Huo, B., Li, C., Zhang, J., Xue, Y., Lin, Z. SAFF-SSD: Self-attention combined feature fusion SSD for small object detection. Remote Sens. 15 (12), 3027-3041 (2023).
  14. Murphy, K., Torralba, A., Eaton, D., Freeman, W. Object detection and localization using local and global features. Lect Notes Comp Sci. 4170 (1), 382-400 (2006).
  15. Mamat, N., Othman, M. F., Abdulghafor, R., Alwan, A. A., Gulzar, Y. Enhancing image annotation technique for fruit classification using deep learning. Sustainability. 15 (2), 901-915 (2023).
  16. Zhang, T., Jia, K., Xu, C., Ma, Y., Ahuja, N. Partial occlusion handling via robust part matching. Proc IEEE CVPR. 2014 (1), 1258-1265 (2014).
  17. Howard, A. G. Improvements on deep convolutional neural network based image classification. Tech Rep. 1 (1), 1-12 (2013).
  18. Zhang, H. Mixup: Beyond empirical risk minimization. arXiv. , (2017).
  19. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).
  20. Qin, J., Xu, N. Social distancing monitoring based on SSD. Procedia Comp Sci. 183 (1), 768-775 (2021).
  21. Zhong, P., Liu, Y., Zheng, H., Zhao, J. Detection of urban flood inundation using traffic images. Water Resour Manag. 38 (2), 287-301 (2024).
  22. Aamir, S. M., Ma, H., Khan, M. A. A., Aaqib, M. Real-time object detection in occluded environments with background clutter. Multimed Tools Appl. 83 (4), 11245-11261 (2024).
  23. Jia, K., Niu, Q., Wang, L., Niu, Y., Ma, W. Multi-object detection and size calculation for blended tobacco shreds. Sensors. 23 (18), 8380-8395 (2023).
  24. Sun, S., et al. Multi-YOLOv8 for infrared moving small object detection. Neurocomputing. 588 (1), 127685-127696 (2024).
  25. Sadik, M. N., Hossain, T., Sayeed, F. Real-time detection and analysis of vehicles and pedestrians using deep learning. Int J Comp Vis Robot. 14 (3), 215-229 (2024).
  26. Zhang, C., Jiao, P. YOLO series target detection algorithms for underwater environments. Ocean Eng. 279 (1), 114353-114366 (2023).
  27. Luo, B., Xiong, J., Xu, L., Pei, Z. Superpixel segmentation based on global similarity and contour region transform. IEICE Transac Info Sys. E103D (3), 716-719 (2020).
  28. Hosain, M. T., Jim, J. R., Mridha, M. F., Kabir, M. M. Explainable AI approaches in deep learning: Advancements, applications and challenges. Comp Electr Eng. 117 (1), 109246-109268 (2024).
  29. Khurshid, S., Basharat, S., Afzal, S. The magic of artificial intelligence-2. Artif Intell Hum Health Dis. 1 (1), 29-46 (2025).
  30. Pan, W., Chen, J., Lv, B., Peng, L. Improved YOLOv9s-UI for underwater object detection. Appl Sci. 14 (14), 7162-7175 (2024).
  31. Zhang, J., Yunos, Z. M., Haron, H. Parallel multi-head graph attention network for human-object interaction detection. IEEE Access. 11 (1), 131708-131725 (2023).
  32. Li, L., Gao, S., Wu, F., An, X. MBAN: Multi-branch attention network for small object detection. PeerJ Comp Sci. 10 (1), e1965-e1980 (2024).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Chunked Image AnnotationLocal Feature DetectionElectric Bike DetectionElevator Object DetectionOcclusion RobustnessEBike DET DatasetExplainable AIStructural AnnotationYOLOv5 DetectionSafety Monitoring
Video Coming Soon

Related Articles