Artículo de método

Un método de seguimiento de múltiples objetos guiado por confianza para vídeos deportivos mediante la fusión semántica de camisetas

DOI:

10.3791/71557

14 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe un flujo de trabajo de seguimiento múltiple de objetos guiado por la confianza para videos deportivos que integra la información del color del uniforme y el número del jugador para mejorar la asociación de trayectorias y la consistencia de identidad ante fluctuaciones de confianza, oclusiones y apariencias visuales similares entre atletas.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El seguimiento de múltiples objetos (MOT) en videos deportivos proporciona información de trayectoria para el análisis táctico, la interpretación del comportamiento de los jugadores y el análisis estadístico automatizado. Sin embargo, los escenarios deportivos frecuentemente implican cambios rápidos de dirección, paradas bruscas, oclusiones frecuentes y compañeros de equipo visualmente similares, lo que provoca fluctuaciones en la confianza de detección y confusión de identidad durante la asociación entre cuadros. Para abordar estos desafíos, este estudio presenta JerseyTrack, un método de MOT deportivo guiado por confianza basado en la fusión semántica de camisetas. El flujo de trabajo divide adaptativamente las cajas de detección en intervalos de alta, media y baja confianza según la distribución de confianza de cada cuadro. Las detecciones de alta confianza se asocian principalmente mediante similitud de movimiento, mientras que las detecciones de confianza media y baja incorporan además características del color de la camiseta y del número del jugador, extraídas mediante agrupamiento de colores y un modelo ligero de Reconocimiento Óptico de Caracteres (OCR). Estas características semánticas se fusionan con la información de movimiento durante la coincidencia complementaria para mejorar la continuidad de la trayectoria y la consistencia de la identidad. El método se evaluó en el conjunto de datos SportsMOT. JerseyTrack alcanzó una precisión del 88,9 % en el seguimiento de múltiples objetos (MOTA), un 74,3 % en la puntuación F1 de identidad (IDF1) y un 69,9 % en la precisión de seguimiento de orden superior (HOTA), lo que demuestra un mejor desempeño de seguimiento en el entorno deportivo evaluado. Este protocolo proporciona un flujo de trabajo reproducible para integrar la asociación guiada por confianza con información semántica de camisetas con el fin de mejorar el seguimiento de múltiples objetos en videos deportivos.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El seguimiento de múltiples objetos (MOT) proporciona una localización continua de los objetos y el mantenimiento de sus identidades en secuencias de video, y permite la extracción de trayectorias de atletas, el análisis táctico y el análisis estadístico automatizado en aplicaciones de video deportivo1,2,3. La información visual confiable también está relacionada con la toma de decisiones específica del deporte y la evaluación del rendimiento en la ciencia del deporte, lo que resalta aún más el valor de los datos estables de movimiento derivados de video para análisis deportivos posteriores4. En escenarios deportivos, la fiabilidad de los datos tácticos depende de la continuidad de las trayectorias de seguimiento y de la consistencia de las identidades de los objetivos.

En comparación con los escenarios generales de seguimiento de múltiples objetos (MOT), los videos deportivos contienen cambios rápidos de dirección, paradas bruscas, saltos, interacciones densas y oclusiones frecuentes. Estos factores provocan fluctuaciones sustanciales en la confianza de las cajas de detección y aumentan la frecuencia de detecciones con baja confianza, lo que puede interrumpir la asociación de trayectorias5,6. Los uniformes de equipo similares reducen aún más la capacidad discriminativa de las características generales de apariencia y aumentan la confusión de identidad entre compañeros de equipo visualmente parecidos7,8. Cuando la oclusión y la similitud en la apariencia ocurren en la misma secuencia, la confianza en la detección disminuye y la información sobre la apariencia del objetivo se vuelve incompleta, lo que incrementa la dificultad para asociar trayectorias y mantener la identidad9,10. En el seguimiento de múltiples objetos, la re-identificación (Re-ID) se refiere al proceso de asociar la misma identidad de un objetivo a través de cuadros, períodos de oclusión o casos de reingreso, utilizando evidencia visual relacionada con la identidad. En videos de deportes de equipo, las señales generales de Re-ID pueden debilitarse porque los atletas del mismo equipo suelen compartir uniformes y apariencias corporales similares. La revisión de la literatura técnica indica que la fragmentación de trayectorias y la confusión de identidad en el MOT deportivo se abordan comúnmente mediante dos enfoques complementarios: la utilización de la confianza en la detección y el realce de las señales de identidad. JerseyTrack se sitúa en la intersección de estos enfoques al regular el uso de señales semánticas del uniforme según la calidad de la detección, en lugar de aplicar la información de color y número del jugador de forma uniforme a todas las detecciones.

Este estudio presenta JerseyTrack, un método de seguimiento múltiple de objetos deportivos guiado por la confianza y basado en la fusión semántica de camisetas. El método está diseñado para vídeos de deportes de equipo en los que los atletas llevan camisetas visibles y los resultados de detección proporcionan cajas delimitadoras con puntuaciones de confianza. JerseyTrack combina cuatro componentes principales: detección de atletas, partición por niveles de confianza, extracción de características semánticas de la camiseta y asociación interfotograma en cascada. La confianza en la detección se utiliza para particionar de forma adaptativa las detecciones en grupos de alta, media y baja confianza, que se procesan mediante estrategias de asociación diferentes. Las detecciones de alta confianza se asocian principalmente mediante información de movimiento, mientras que las detecciones de confianza media y baja incorporan además información sobre el color de la camiseta y el número del jugador para mejorar el mantenimiento de la identidad cuando la evidencia visual es débil. El método está destinado a tareas de análisis de vídeos deportivos que requieren trayectorias estables de los atletas, como el análisis táctico y la interpretación del comportamiento de los jugadores.

El enfoque propuesto también presenta limitaciones operativas. La extracción semántica de la camiseta puede verse afectada por oclusión severa, desenfoque por movimiento, baja resolución de la imagen, poses anormales de la camiseta o números de jugador invisibles. En estos casos, las pistas semánticas basadas en la camiseta pueden volverse incompletas, y el proceso de asociación depende más fuertemente de la coherencia del movimiento y de la verificación mediante múltiples fotogramas. Por lo tanto, las afirmaciones sobre el rendimiento en este estudio se limitan a los conjuntos de datos evaluados y a las condiciones experimentales. Los experimentos en el conjunto de datos SportsMOT muestran que JerseyTrack mejora las métricas de seguimiento evaluadas y reduce los eventos de cambio de identidad bajo las condiciones de seguimiento deportivo evaluadas. La principal dificultad del MOT en videos deportivos radica en mantener la continuidad de la trayectoria y la coherencia de la identidad ante movimientos rápidos, oclusión y similitud en la apariencia. Los estudios existentes relacionados con JerseyTrack pueden clasificarse ampliamente en dos direcciones de investigación: el uso de la confianza en la detección para la asociación de trayectorias y la mejora de las pistas de identidad mediante características semánticas específicas de los deportes.

La confianza de detección se ha utilizado ampliamente para estimar la fiabilidad de los cuadros de detección y para guiar la asociación de trayectorias en el seguimiento de múltiples objetos (MOT). Los métodos iniciales de seguimiento solían tratar la confianza como un criterio binario de filtrado, en el que se eliminaban las detecciones por debajo de un umbral fijo para reducir los falsos positivos11,12. Esta estrategia reduce las detecciones ruidosas, pero también puede descartar objetivos reales en condiciones de oclusión, movimiento rápido o baja calidad de imagen, lo que provoca fragmentación de trayectorias13,14,15. Estrategias de filtrado similares han demostrado también que los umbrales fijos de confianza son sensibles a las variaciones de la escena y a la calidad de la detección16,17. Para mejorar el uso de detecciones con baja confianza, ByteTrack introdujo una estrategia de asociación que conserva los cuadros de baja confianza como objetivos candidatos para una coincidencia secundaria y los vincula con trayectorias existentes mediante la similitud de movimiento y el historial de trayectorias18. McByte amplía aún más la asociación en el MOT deportivo incorporando máscaras de segmentación propagadas temporalmente como una pista de asociación, mejorando la robustez en condiciones de movimiento rápido, oclusión y desplazamiento de cámara sin necesidad de entrenamiento adicional por video19. Estudios relacionados también han ajustado el uso de detecciones con baja confianza para conservar objetivos débiles pero potencialmente válidos durante la asociación20,21,22. Las estrategias de asociación adaptativas según la confianza refinaron posteriormente los criterios de coincidencia según la consistencia del movimiento y la fiabilidad de la detección23,24,25. También se han utilizado métodos de refinamiento de trayectorias basados en regresión de cuadros de detección y optimización de suavidad de trayectorias para reducir la fragmentación de trayectorias26,27,28. Estrategias adicionales de refinamiento proporcionan apoyo complementario para mantener la continuidad de las trayectorias en condiciones de movimiento complejas29. El flujo temporal coherente de objetos modela aún más la consistencia temporal a nivel de objeto entre cuadros, proporcionando otro enfoque orientado a la asociación para reducir la interrupción de trayectorias en escenarios complejos de MOT30. Los métodos de fusión de rastreadores también aprenden de las salidas de múltiples rastreadores y utilizan estrategias de selección o fusión basadas en aprendizaje para mejorar la robustez del seguimiento en diferentes referencias de MOT31. En conjunto, estos estudios indican que la asociación sensible a la confianza ayuda a recuperar trayectorias interrumpidas; sin embargo, la confianza y las pistas de movimiento proporcionan información limitada sobre la identidad cuando los jugadores del mismo equipo tienen apariencias visuales similares. Aunque estos métodos alivian eficazmente la fragmentación de trayectorias en escenarios generales, enfrentan limitaciones inherentes en contextos deportivos porque los jugadores del mismo equipo a menudo tienen apariencias visuales muy similares, y depender únicamente de la confianza y la información de movimiento no proporciona una base suficiente para diferenciar identidades32,33,34. Incluso cuando se recuperan eficazmente cuadros con baja confianza, la similitud de características aún puede provocar intercambios de identidad, dificultando el cumplimiento de los estrictos requisitos de consistencia de identidad en el análisis deportivo.

Las señales específicas de identidad deportiva también se han utilizado para mejorar la discriminación de identidad en el seguimiento de atletas. La información semántica de las camisetas, como el color del equipo y el número del jugador, proporciona señales de identidad más directamente relacionadas con escenarios deportivos que los embeddings generales de apariencia35,36,37. El color de la camiseta se ha empleado para facilitar la discriminación a nivel de equipo y reducir la confusión entre equipos, mientras que el reconocimiento del número del jugador ofrece una señal de identidad más precisa cuando la zona del número es visible y legible38,39. Estudios previos sobre seguimiento deportivo han incorporado características visuales específicas del dominio y el reconocimiento del color de la camiseta para mejorar la asociación de jugadores en condiciones deportivas concurridas40,41. Trabajos relacionados sobre el reconocimiento del número de la camiseta y datos sintéticos de números respaldan adicionalmente la modelización de identidad en condiciones de baja resolución o con oclusión parcial42,43. Estos estudios indican que la semántica de las camisetas puede fortalecer la representación de identidad en el seguimiento de múltiples objetos en deportes (sports MOT). Sin embargo, la mayoría de los métodos de seguimiento mejorados con semántica no modelan adecuadamente la relación entre la confianza en la detección y la calidad de la característica semántica. Las detecciones con alta confianza ya pueden contener información espacial y de apariencia confiable, lo que hace que la extracción semántica repetida sea menos eficiente. Las detecciones con baja confianza suelen verse afectadas por oclusión, desenfoque, recorte o baja resolución, lo que reduce la fiabilidad de las señales de color y del número del jugador. Esta limitación motiva un diseño de asociación guiado por la confianza, en el cual la semántica de la camiseta se introduce según la calidad de la detección, en lugar de aplicarse uniformemente a todas las detecciones. Los estudios revisados muestran que la asociación sensible a la confianza y la modelización semántica de la camiseta abordan aspectos diferentes del seguimiento de múltiples objetos en deportes. Las estrategias basadas en la confianza determinan principalmente si una detección debe participar en la asociación y cómo debe emparejarse con trayectorias existentes, mientras que las estrategias semánticas de la camiseta mejoran principalmente la representación de identidad mediante señales específicas del deporte. No obstante, estos dos mecanismos suelen diseñarse como componentes separados. Como resultado, las señales semánticas no siempre se ajustan según la calidad de la detección, y los niveles de confianza no regulan directamente el uso de la información de color y del número del jugador durante la asociación. Esta separación limita el manejo conjunto de la fragmentación de trayectorias y la confusión de identidad en vídeos de deportes de equipo. El vacío investigador restante consiste en vincular la evaluación de la calidad de la confianza en la detección con la asociación semántica de la camiseta dentro del mismo flujo de trabajo de seguimiento.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio implicó un análisis secundario de conjuntos de datos de video de referencia disponibles públicamente, específicamente SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 y MOT20. No se reclutaron participantes, no se realizó ninguna intervención y no se recopilaron nuevos datos de sujetos humanos. No se requirió la aprobación del comité de ética para este estudio según los requisitos institucionales aplicables de la Universidad Bangkok Thonburi.

El siguiente protocolo describe el flujo de trabajo utilizado para reproducir JerseyTrack, desde la preparación de los datos hasta la evaluación del seguimiento. El flujo de trabajo incluye la preparación del conjunto de datos, la preparación del detector, la extracción semántica de las camisetas, la partición por niveles de confianza, la asociación guiada por la confianza, la inferencia de seguimiento y la evaluación del rendimiento, como se resume en la Figura 1. El software, los conjuntos de datos y los recursos de hardware necesarios se enumeran en la Tabla de materiales.

figure-protocol-1
Figura 1. Flujo general del método JerseyTrack. El flujo de trabajo consta de la extracción de características semánticas del jersey, la coincidencia inicial de objetos, la coincidencia suplementaria guiada por la confianza y la fusión de características. Las características del color del equipo y del número del jugador se extraen de las regiones de los atletas detectados y se incorporan al proceso de asociación para mejorar la coincidencia de trayectorias bajo condiciones de detección inciertas. Haga clic aquí para ver una versión más grande de esta figura.

1. Preparar los conjuntos de datos y la estructura de directorios

  1. Descargue los conjuntos de datos de referencia públicos enumerados en la Tabla de materiales. Utilice SportsMOT como conjunto de datos principal para la preparación del detector y la evaluación del seguimiento. Mantenga TeamTrack, SoccerNet Tracking, MOT17 y MOT20 para la evaluación entre conjuntos de datos.
  2. Almacene todos los conjuntos de datos en un directorio de proyecto unificado. Asegúrese de que el detector, el módulo de extracción semántica, el módulo de seguimiento y el kit de evaluación utilicen los mismos identificadores de secuencia.
  3. Convierta las anotaciones oficiales de SportsMOT al formato de entrenamiento del detector utilizando el script de preparación de datos empleado en este estudio. Ejecute el siguiente comando:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. El script de preparación de datos (scripts/prepare_data.py) está disponible en el repositorio de código fuente de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Las dependencias de software requeridas se especifican en environment.yml, incluyendo Python 3.12, PyTorch 2.11.0 y OpenCV 4.10 o posterior. Configure el entorno de software utilizando el siguiente comando: conda env create -f environment.yml. Ejecute el script de preparación de datos utilizando el siguiente comando: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Verifique que la conversión genere el archivo de configuración para el entrenamiento del detector: data\processed\SportsMOT_yolo\data.yaml y el manifiesto de conversión: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    NOTA: En este estudio, el conjunto de datos de entrenamiento y validación de SportsMOT convertido contenía 90 secuencias, 55.544 fotogramas y 608.152 objetos anotados.
  6. Inspeccione secuencias representativas para verificar que el orden de los fotogramas, las coordenadas de los cuadros delimitadores y las etiquetas de identidad sean coherentes con las anotaciones originales del conjunto de referencia.
  7. Mantenga los archivos de anotación convertidos sin modificaciones durante toda la preparación del detector, la inferencia de seguimiento y la evaluación, de modo que todos los métodos utilicen la misma partición del conjunto de datos y el mismo protocolo de evaluación.
    NOTA: El resultado esperado de esta sección es un directorio estandarizado de entrenamiento del detector SportsMOT que contenga las anotaciones convertidas, el manifiesto de conversión y los archivos de división del conjunto de datos necesarios para la preparación del detector y la evaluación del seguimiento.

2. Preparar las salidas del detector

  1. Ajuste finamente el detector de objetos utilizando la división de entrenamiento preparada de SportsMOT. Optimice el detector utilizando la pérdida de clasificación y la pérdida de regresión de cuadro delimitador definidas en la Ecuación 1. Utilice la resolución de entrada del detector, tamaño de lote, tasa de aprendizaje, número de épocas de entrenamiento y otros parámetros de entrenamiento indicados en la configuración de implementación y en la Tabla de Materiales
    Ldet = Lcls + Lbox   (1)
    Aquí, Ldet  denota la pérdida total del detector, Lcls  denota la pérdida de clasificación, Lbox  denota la pérdida de regresión del cuadro delimitador.
    NOTA: El punto de control del detector utilizado en los experimentos principales (identificador interno del experimento e3) se entrenó utilizando el marco Ultralytics YOLO con la configuración del conjunto de datos SportsMOT en formato YOLO (data/processed/SportsMOT_yolo/data.yaml). Ejecute el entrenamiento del detector utilizando el siguiente comando: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Tras el entrenamiento, utilice el punto de control con mejor rendimiento resultante para generar las salidas del detector para las secuencias de validación utilizando el siguiente comando: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Guarde el punto de control del detector entrenado, el archivo de metadatos correspondiente y el registro de entrenamiento tras finalizar el entrenamiento.
    NOTA: En este estudio, el punto de control del detector utilizado para los experimentos formales se guardó como:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. El archivo de metadatos correspondiente se guardó como: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. El directorio de salida del detector utilizado en los experimentos principales de validación de SportsMOT fue: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Ejecute el detector entrenado en cada secuencia de validación para generar cuadros delimitadores y puntuaciones de confianza para los atletas. Exporte un archivo de detección por cada secuencia que contenga el índice del fotograma, las coordenadas del cuadro delimitador, la confianza de la detección y la etiqueta de clase.
    NOTA: En la ejecución de validación de SportsMOT utilizada para los experimentos principales, un umbral de confianza de 0,05 generó 343.990 detecciones de atletas.
  4. Revise el directorio de salida del detector antes de la inferencia de seguimiento. Confirme que cada secuencia tenga un archivo de detección correspondiente, que los índices de fotograma coincidan con la secuencia de imágenes preparada y que cada registro de detección contenga una puntuación de confianza.
    NOTA: El resultado esperado de esta sección es un directorio de salida del detector completo que sirve como entrada para la extracción semántica de camisetas, la partición por niveles de confianza y la asociación de seguimiento.

3. Extraer características semánticas de la camiseta

  1. Utilice los archivos de salida del detector para recortar las regiones de los atletas en cada fotograma del video. Guarde cada imagen recortada del atleta con su identificador de secuencia, índice de fotograma e índice de detección. Excluya los recortes no válidos que tengan contenido de imagen faltante o cajas delimitadoras que se extiendan fuera del límite de la imagen. Mantenga el vínculo entre cada nombre de archivo de recorte y su registro de detección original para que las características semánticas extraídas puedan asociarse con la detección correspondiente durante la asociación de seguimiento.
  2. Extraiga características de color de la camiseta a partir de las imágenes recortadas de los atletas utilizando el script de extracción semántica empleado en este estudio.
    NOTA: Los scripts de extracción de características semánticas (scripts/extract_fast_color_semantics.py y scripts/formal_extract_semantics.py) están disponibles en el repositorio de código fuente JerseyTrack (https://doi.org/10.5281/zenodo.21274352). No se requiere un archivo de configuración separado; todos los parámetros de ejecución se proporcionan mediante argumentos de línea de comandos.
    Generar descriptores de color de camiseta utilizando el siguiente comando: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Generar características semánticas del número del jugador utilizando el modelo de OCR con el siguiente comando: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Los descriptores de color de camiseta generados y las salidas de probabilidad del número del jugador se vinculan mediante el identificador de secuencia y se combinan en los archivos de características semánticas utilizados durante la asociación de seguimiento.
  3. Convierta cada imagen recortada del atleta al espacio de color Matiz, Saturación, Valor (HSV). Extraiga los píxeles del primer plano en la región de la camiseta y resuma el color dominante de la camiseta utilizando agrupamiento K-means con K = 3. Normalice el descriptor de color resultante utilizando normalización L2 antes de la comparación de características.
  4. Entrene la rama de reconocimiento del número del jugador utilizando imágenes recortadas de atletas con un tamaño de entrada de 128 × 64 píxeles. Genere etiquetas pseudoetiquetadas del número del jugador utilizando el procedimiento de etiquetado débilmente supervisado empleado en este estudio. Excluya los recortes con regiones del número del jugador invisibles, ilegibles, severamente ocluidas o con baja confianza del modelo en el cálculo de la pérdida de reconocimiento óptico de caracteres (OCR).
  5. Optimice la rama de OCR utilizando la pérdida de entropía cruzada definida en la Ecuación 2.
    figure-protocol-2 (2)
    Aquí, Locr denota la pérdida de OCR, yi denota la etiqueta supervisada del número del jugador, y figure-protocol-3 denota la categoría predicha del número del jugador.
  6. Optimice el módulo de extracción de características semánticas utilizando el optimizador adaptativo, la tasa de aprendizaje, el tamaño del lote, el decaimiento del peso y la duración del entrenamiento indicados en la Tabla de Materiales. Combine la pérdida del detector y la pérdida de OCR utilizando el objetivo total de entrenamiento definido en la Ecuación 3.
    Ltotal = Ldet + γLocr   (3)
    Aquí, Ltotal denota la pérdida total de entrenamiento, Ldet denota la pérdida del detector definida en la Ecuación 1, Locr denota la pérdida de OCR definida en la Ecuación 2, y denota el coeficiente de ponderación definido por el usuario para la pérdida de OCR.
  7. Aplique la rama de OCR entrenada a cada imagen recortada del atleta. Guarde la categoría predicha del número del jugador o el vector de probabilidad para cada recorte. Si el número del jugador no es visible o la confianza de OCR está por debajo del umbral definido en la implementación, registre la característica del número del jugador como no disponible en lugar de forzar una predicción.
  8. Combine el descriptor de color de la camiseta y la salida del número del jugador en el archivo de características semánticas utilizado por el módulo de seguimiento.
    NOTA: En la ejecución principal de validación de SportsMOT, el script de extracción semántica procesó 343.990 detecciones sin fotogramas faltantes ni recortes inválidos. En el paquete de revisión actual, el resumen de extracción semántica reportó una precisión general de extracción semántica de color y OCR del 86,7 % en la configuración de SportsMOT evaluada. El resultado esperado de esta sección es un archivo de características semánticas en el que cada registro de detección válido esté vinculado a un descriptor de color de camiseta, una salida del número del jugador cuando esté disponible y una bandera que indique si la información semántica está disponible para la asociación de seguimiento.

4. Niveles de confianza en la detección de particiones

  1. Cargue el archivo de salida del detector para cada secuencia de video. Recolecte las puntuaciones de confianza de todas las detecciones de atletas en cada fotograma.
  2. Particione las puntuaciones de confianza a nivel de fotograma en intervalos de alta, media y baja confianza utilizando agrupamiento K-means con K = 3, siguiendo el flujo de trabajo de asociación guiada por la confianza mostrado en la Figura 2. Determine los umbrales de confianza adaptativos minimizando la varianza dentro del grupo según la Ecuación 4.
    figure-protocol-4  (4)
    Aquí, sd denota la puntuación de confianza de la detección d; D1, D2 y D3 denotan los intervalos de alta, media y baja confianza, respectivamente; μ1, μ2 y μ3 denotan las puntuaciones medias de confianza de los tres intervalos; y τ1 y τ2 denotan los umbrales de confianza adaptativos obtenidos a partir de los resultados del agrupamiento K-means.
    NOTA: El script de partición por confianza (scripts/formal_partition_confidence.py) está disponible en el repositorio de código fuente de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). El módulo de partición por confianza utiliza un procedimiento de agrupamiento K-means unidimensional basado en NumPy con K = 3. No se requiere un archivo de configuración independiente; el directorio de entrada, el directorio de salida y el parámetro de agrupamiento se especifican mediante argumentos de línea de comandos. Ejecute el procedimiento de partición por confianza utilizando el siguiente comando: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Las dependencias de software requeridas, incluida la versión de NumPy, se especifican en environment.yml.
  3. Ejecute el procedimiento de partición por confianza utilizando el directorio de salida del detector como entrada.
    NOTA: En este estudio, el directorio de salida del detector fue: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. El directorio de salida del resultado de partición por confianza fue: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Los archivos de salida generados incluyeron los archivos CSV de confianza por secuencia, _confidence_frame_summary.csv y _confidence_runtime.csv.
  4. Asigne una etiqueta de nivel de confianza a cada detección. Etiquete las detecciones de alta confianza para asociación basada en movimiento, las detecciones de confianza media para asociación semántica-movimiento y las detecciones de baja confianza únicamente para recuperación de trayectoria. Mantenga la puntuación original de confianza junto con la etiqueta de nivel de confianza asignada.
  5. Revise las distribuciones de las puntuaciones de confianza y los fotogramas representativos, como se ilustra en la Figura 3. Verifique que las detecciones de alta confianza correspondan predominantemente a cajas delimitadoras completas y confiables de atletas, mientras que las detecciones de confianza media y baja contengan principalmente detecciones parciales, ocluidas, borrosas o débiles.
    NOTA: El resultado esperado de esta sección es un archivo de partición por confianza que contenga el índice de detección, la puntuación original de confianza, el nivel de confianza asignado y los umbrales de confianza adaptativos a nivel de fotograma para cada detección.

figure-protocol-5
Figura 2. Estrategia de asociación guiada por confianza. El flujo de trabajo divide la confianza de detección en intervalos de alta, media y baja confianza mediante agrupamiento adaptativo de confianza. Las detecciones de alta confianza se asocian utilizando similitud de movimiento, las detecciones de confianza media se asocian utilizando similitud combinada de movimiento y semántica de camiseta, y las detecciones de baja confianza se utilizan para la recuperación de trayectorias asistida por semántica con verificación de múltiples cuadros. El panel derecho resume la formulación matemática utilizada para la partición de confianza y la asociación. Haga clic aquí para ver una versión ampliada de esta figura.

figure-protocol-6
Figura 3. Distribución de los puntajes de confianza en la detección. El histograma muestra el número de cuadros de detección de atletas dentro de cinco intervalos de confianza para secuencias de fútbol, baloncesto y voleibol en el conjunto de datos SportsMOT. La distribución ilustra diferencias en la confianza del detector entre las categorías deportivas evaluadas. Haga clic aquí para ver una versión más grande de esta figura.

5. Realizar asociación guiada por confianza

  1. Cargue el archivo de salida del detector, el archivo de características semánticas y el archivo de partición de confianza para cada secuencia de video. Inicialice el rastreador utilizando las primeras detecciones válidas y mantenga un estado de trayectoria para cada atleta rastreado. Para cada cuadro subsiguiente, prediga la posición de cada trayectoria existente utilizando el modelo de movimiento del filtro de Kalman.
  2. Calcule la similitud de movimiento entre cada trayectoria predicha y la detección candidata utilizando la distancia de Mahalanobis definida en Ecuación 5.
    figure-protocol-7  (5)
    Aquí, figure-protocol-8 denota la trayectoria I-ésima en el cuadro k, figure-protocol-9 denota el estado predicho por Kalman de la trayectoria, dj denota la detección candidata, figure-protocol-10 denota la matriz de covarianza inversa del estado predicho de la trayectoria, y Smot denota la distancia de movimiento entre la trayectoria predicha y la detección.
    NOTA: El flujo de trabajo principal de asociación está implementado en jerseytrack/formal_tracker.py y se ejecuta mediante scripts/formal_track.py, ambos disponibles en el repositorio de código fuente de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). No se requiere un archivo de configuración independiente. Todos los parámetros en tiempo de ejecución, incluidos los umbrales de confianza, la edad máxima de la trayectoria, los coeficientes de peso de movimiento y el peso de la distancia al centro, se proporcionan mediante argumentos de línea de comandos. El comando completo de ejecución y la configuración de parámetros se indican en el paso 6.2. La implementación utiliza el algoritmo de asignación de suma lineal de SciPy para la coincidencia húngara y NumPy para la asociación basada en costos.
  3. Ejecute el flujo de trabajo de rastreo utilizando como entradas el archivo de salida del detector, el archivo de características semánticas y el archivo de partición de confianza.
    NOTA: En este estudio, el rastreador principal se implementó en jerseytrack\formal_tracker.py, y el flujo de trabajo de rastreo se ejecutó mediante scripts\formal_track.py.
  4. Asocie detecciones de alta confianza con trayectorias existentes utilizando la consistencia de movimiento. Actualice las trayectorias emparejadas e inicialice nuevas trayectorias solo cuando las detecciones de alta confianza sin emparejar cumplan los criterios de inicialización de trayectoria.
  5. Revise las salidas de extracción semántica de camiseta ilustradas en Figura 4, y construya el vector de características semánticas de camiseta para cada detección combinando el descriptor de color de equipo y la característica del número de jugador según Ecuación 6.
    fsem = [fcol;fid] (6)
    Aquí, fsem denota el vector de características semánticas fusionado, fcol denota el descriptor de color de equipo, y fid denota la característica del número de jugador generada por la rama OCR.
  6. Asocie detecciones de confianza media combinando la similitud de movimiento con la similitud semántica de la camiseta. Calcule la puntuación de coincidencia fusionada según Ecuación 7.
    figure-protocol-11 (7)
    Aquí, Ssem denota la similitud coseno entre los vectores de características semánticas de la trayectoria y la detección candidata, Smot denota la distancia de movimiento definida en Ecuación 5, y λdenota el coeficiente de fusión adaptativo que equilibra los términos de similitud de movimiento y semántica.
  7. Calcule el coeficiente de fusión adaptativo según Ecuación 8.
    figure-protocol-12 (8)
    Aquí, λdenota el coeficiente inicial de peso de movimiento, σsd denota la desviación estándar de las puntuaciones de confianza de detección en el cuadro actual, y σmax denota la desviación estándar máxima de puntuación de confianza utilizada para la normalización.
  8. Utilice únicamente las detecciones de baja confianza para la recuperación de trayectorias. Empareje detecciones de baja confianza con trayectorias interrumpidas solo cuando haya información semántica disponible y se cumplan los criterios de recuperación. Aplique verificación de múltiples cuadros antes de restaurar la identidad de una trayectoria, y descarte las detecciones que no pasen la verificación.
    NOTA: Cuando no esté disponible la característica del número de jugador, realice la asociación utilizando la información semántica disponible y la consistencia de movimiento, en lugar de forzar una coincidencia de número de jugador. El resultado esperado de esta sección es un registro de rastreo cuadro por cuadro que contenga identidades de trayectoria, cuadros delimitadores, etiquetas de nivel de confianza, costos de movimiento, información semántica y decisiones finales de asociación. En el paquete de evidencia de revisión, los resultados de rastreo se almacenaron en: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Figura 4. Extracción de características semánticas de la camiseta. Las detecciones representativas de atletas están anotadas con los descriptores de color del equipo y la información del número del jugador generados por el módulo de extracción semántica de la camiseta. Las características semánticas extraídas se incorporan posteriormente en la asociación de datos guiada por la confianza. Haga clic aquí para ver una versión más grande de esta figura.

6. Ejecutar la inferencia de seguimiento y exportar los resultados

  1. Ejecute la inferencia de seguimiento para cada secuencia de video utilizando los archivos de salida del detector preparados, los archivos de características semánticas y los archivos de partición de confianza. Procese los fotogramas del video en orden cronológico para que los estados de las trayectorias, el historial semántico y las decisiones de recuperación de trayectorias se actualicen de manera consistente a lo largo de la secuencia. Utilice la misma configuración de inferencia para todas las secuencias evaluadas, a menos que se indique explícitamente una configuración específica del conjunto de datos.
    NOTA: La inferencia de seguimiento se ejecutó utilizando scripts/formal_track.py, disponible en el repositorio de código fuente de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). No se requiere un archivo de configuración independiente. Ejecute la inferencia de seguimiento con el siguiente comando: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Todos los parámetros no especificados conservaron los valores predeterminados registrados en el código fuente archivado.
  2. Tras la inferencia, aplique la secuencia principal de postprocesamiento utilizando los siguientes comandos: python scripts/merge_tracklets.py y python scripts/sweep_track_filter.py --min-len 95.
  3. Exporte los resultados del seguimiento en el formato requerido por la herramienta de evaluación. Incluya el índice del fotograma, la identidad de la trayectoria, las coordenadas del cuadro delimitador y todos los campos exigidos por el formato de evaluación del conjunto de referencia. Guarde un archivo de resultados de seguimiento por cada secuencia utilizando una convención de nomenclatura coherente, de modo que cada archivo de resultados pueda asociarse con su archivo de anotaciones de referencia correspondiente.
  4. Aplique únicamente las operaciones de postprocesamiento utilizadas en este estudio. Realice la fusión de fragmentos de trayectoria y el filtrado de trayectorias mediante los scripts de postprocesamiento descritos en el paquete de revisión.
    NOTA: En este estudio, el flujo de trabajo de postprocesamiento utilizó los siguientes scripts:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Revise los resultados de seguimiento exportados antes de la evaluación cuantitativa. Confirme que las identidades de las trayectorias permanezcan numéricas y consistentes dentro de cada secuencia, que no falte ningún índice de fotograma y que todos los cuadros delimitadores permanezcan dentro de los límites de la imagen.
    NOTA: El resultado esperado de esta sección es un conjunto completo de archivos de resultados de seguimiento a nivel de secuencia, listos para su evaluación cuantitativa.

7. Evaluar el rendimiento del seguimiento

  1. Evalúe los archivos de resultados de seguimiento exportados utilizando el kit de evaluación enumerado en la Tabla de materiales. Asocie cada archivo de resultados de seguimiento con el archivo de anotación de referencia y la división del conjunto de datos correspondientes. Utilice la misma configuración de evaluación para todos los métodos comparados para asegurar que las diferencias de rendimiento se deban a los resultados de seguimiento y no a las configuraciones de evaluación.
  2. Ejecute la evaluación utilizando el siguiente comando
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOTA: La evaluación se realizó utilizando la implementación estándar de métricas de TrackEval (versión 1.3.0) archivada dentro del paquete de reproducibilidad de JerseyTrack. No se realizaron modificaciones en las implementaciones de las métricas de Precisión de Seguimiento de Orden Superior (HOTA), CLEAR ni de Identidad. El repositorio incluye el contenedor de ejecución en estilo MOTChallenge ubicado en evaluation/trackeval/scripts/run_mot_challenge.py, que configura las rutas de los conjuntos de datos y resultados e invoca las métricas de evaluación estándar de TrackEval.
  3. Registre las métricas de evaluación reportadas en el manuscrito, incluyendo la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la puntuación F1 de Identidad (IDF1), la Precisión de Seguimiento de Orden Superior (HOTA), la Precisión de Detección (DetA), la Precisión de Asociación (AssA), los falsos positivos (FPs), los falsos negativos (FNs) y los eventos de cambio de identidad. Exporte el resumen de evaluación como una tabla y conserve los archivos de evaluación por secuencia para su verificación.
  4. Al comparar JerseyTrack con los métodos de referencia, utilice la misma división del conjunto de datos, las salidas del detector y la configuración de evaluación para todos los métodos. Registre el conjunto de datos, la fuente de las salidas del detector, la configuración del kit de evaluación y los valores métricos para cada comparación.
  5. Revise los registros de evaluación para verificar que todas las secuencias se hayan evaluado correctamente y que no falte ningún archivo de resultados de seguimiento.
    NOTA: En este estudio, el archivo de resumen principal de TrackEval se almacenó en: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. El resultado esperado de esta sección es una tabla completa de resumen de evaluación junto con los archivos métricos por secuencia que respaldan los Resultados reportados y su posterior verificación.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta sección presenta los resultados cuantitativos y cualitativos obtenidos de los experimentos evaluados de seguimiento multiobjeto en deportes. Los resultados se centran en la precisión del seguimiento, la preservación de la identidad, la calidad de la asociación y la robustez bajo las configuraciones del conjunto de datos probadas. Las afirmaciones sobre el rendimiento se limitan a los métodos evaluados, conjuntos de datos, salidas del detector y configuración del kit de evaluación descritos en el Protocolo y Configuración de Implementación.

Configuración experimental y diseño de evaluación

Conjunto de datos y preprocesamiento:

SportsMOT se utilizó como la referencia principal para la preparación del detector, la inferencia de seguimiento y la evaluación cuantitativa. El conjunto de datos contiene 240 secuencias de video y más de 150.000 fotogramas de imagen en escenarios de fútbol, baloncesto y voleibol (Figura 5). En la evaluación formal, los principales resultados de SportsMOT se calcularon utilizando la división de validación junto con las salidas del detector, la configuración de seguimiento y los ajustes de TrackEval descritos en el Protocolo. Se realizó una evaluación cruzada entre conjuntos de datos en TeamTrack, SoccerNet Tracking, MOT17 y MOT20 para examinar la transferencia de rendimiento entre diferentes tipos de conjuntos de datos, en lugar de realizar comparaciones directas a nivel de métricas entre ellos.

figure-results-1
Figura 5. Conjuntos de datos representativos utilizados para la evaluación. Los fotogramas de ejemplo ilustran secuencias representativas de fútbol, baloncesto y voleibol utilizadas para la evaluación experimental. La figura resalta las variaciones en el punto de vista de la cámara, la densidad de jugadores y la complejidad de la escena entre los conjuntos de datos evaluados. Haga clic aquí para ver una versión más grande de esta figura.

Los datos de SportsMOT se organizaron según la estructura oficial del conjunto de datos y se convirtieron al formato de entrenamiento del detector descrito en el Protocolo. Los datos convertidos de entrenamiento y validación de SportsMOT contenían 90 secuencias, 55.544 cuadros y 608.152 objetos anotados. La partición de entrenamiento se utilizó para la preparación del detector y el ajuste de parámetros, mientras que la partición de validación se empleó para la evaluación formal del seguimiento informada en este estudio. Todos los cuadros de entrada se redimensionaron según la configuración del detector indicada en el Protocolo y en la Tabla de materiales. Se aplicó el mismo procedimiento de preprocesamiento durante la preparación del detector, la extracción de características semánticas, la inferencia de seguimiento y la evaluación con TrackEval, de modo que las diferencias informadas reflejaran principalmente la estrategia de asociación de seguimiento y no diferencias en el procesamiento de los datos.

Indicadores de evaluación:

El rendimiento del seguimiento se evaluó utilizando un protocolo de evaluación compatible con MOTChallenge, implementado con el kit de herramientas de evaluación que se enumera en la Tabla de Materiales. Las métricas reportadas describen tres aspectos del rendimiento del seguimiento múltiple en deportes: precisión general del seguimiento, preservación de identidad y calidad de la detección-asociación. Se utilizaron MOTA, IDF1 y HOTA como métricas principales de evaluación44,45. MOTA resume los falsos positivos, falsos negativos y cambios de identidad en una puntuación general de precisión del seguimiento. IDF1 mide la consistencia entre las trayectorias predichas y las identidades reales. HOTA evalúa conjuntamente la precisión de la detección y la precisión de la asociación, caracterizando así el equilibrio entre la localización del objetivo y la asociación de trayectorias. DetA y AssA se reportaron como métricas complementarias. FPs, FNs y cambios de identidad (IDs) se utilizaron para caracterizar las fuentes de error relacionadas con detecciones falsas, detecciones perdidas y cambios de identidad. Para las comparaciones entre métodos en SportsMOT, se utilizaron las mismas salidas del detector y la misma configuración del kit de herramientas de evaluación con el fin de reducir la influencia de las variaciones del detector y las diferencias en la configuración de evaluación. Para las comparaciones entre conjuntos de datos, los valores de las métricas se interpretaron como resultados de evaluación dentro del conjunto de datos, y no como evidencia de una superioridad absoluta del rendimiento entre diferentes conjuntos de datos.

Ambiente experimental y configuración de parámetros:

Los experimentos se realizaron utilizando los recursos de hardware y software enumerados en la Tabla de Materiales. Se utilizó el mismo entorno computacional, marco del detector, salidas del detector y kit de evaluación en todos los experimentos principales de SportsMOT para mantener la consistencia durante la preparación del detector, la inferencia de seguimiento y la evaluación del rendimiento. El marco del detector enumerado en la Tabla de Materiales se entrenó con un tamaño de lote de 16, una tasa de aprendizaje inicial de 0,01 y 80 épocas de entrenamiento. En el módulo de extracción semántica de camisetas, la agrupación por color utilizó K-means con K = 3, y la rama OCR empleó una red neuronal recurrente convolucional ligera con un tamaño de entrada de 128 × 64 píxeles. La rama OCR se optimizó utilizando el optimizador adaptativo enumerado en la Tabla de Materiales con una tasa de aprendizaje de 1 × 10⁻3, una disminución de peso de 1 × 10⁻5, un tamaño de lote de 64 y 40 épocas de entrenamiento. No se utilizó ninguna programación adicional de la tasa de aprendizaje durante el entrenamiento del módulo de extracción de características semánticas. El coeficiente de ponderación de la pérdida OCR (γ) se trató como un hiperparámetro definido por el usuario y se seleccionó según el rendimiento en el conjunto de validación. La estratificación por nivel de confianza utilizó una partición adaptativa mediante K-means, en la cual τ₁ y τ₂ se calcularon a partir de la distribución de confianza de detección de cada cuadro, en lugar de definirlas manualmente antes de la inferencia.

Rendimiento del seguimiento en diferentes deportes y niveles de complejidad de escenario

Rendimiento cuantitativo bajo diferentes condiciones de deportes y escenas:

El rendimiento del seguimiento se evaluó bajo dos factores de agrupación: categoría deportiva y complejidad de la escena. El análisis por categoría deportiva incluyó secuencias de fútbol, baloncesto y voleibol. El análisis de la complejidad de la escena consideró el nivel de oclusión, la velocidad del movimiento y la densidad del objetivo, utilizando los mismos criterios de agrupación en todas las secuencias evaluadas. Las métricas reportadas siguieron el protocolo de evaluación descrito en la Sección 7 del Protocolo. 

Figura 6 resume los resultados de seguimiento cuantitativo bajo diferentes categorías deportivas y condiciones de complejidad de escena. Figura 6A muestra MOTA y DetA en secuencias de fútbol, baloncesto y voleibol. Figura 6B muestra la variación de MOTA bajo diferentes niveles de oclusión, velocidad de movimiento y densidad de objetivos. Figura 6C muestra los recuentos acumulados de FP y FN para cada dimensión de complejidad de escena.

figure-results-2
Figura 6. Seguimiento del rendimiento en diferentes categorías deportivas y condiciones de la escena. (A) Precisión en el seguimiento de múltiples objetos (MOTA) y precisión en la detección (DetA) para fútbol, baloncesto, voleibol y el promedio general. (B) MOTA en distintas condiciones representativas de la escena con diferentes niveles de oclusión, densidad de jugadores y complejidad del movimiento. (C) Números de falsos positivos (FPs) y falsos negativos (FNs) en las condiciones de escena evaluadas. Haga clic aquí para ver una versión ampliada de esta figura.

En las tres categorías deportivas, JerseyTrack logró un MOTA promedio del 88,9 % y un DetA promedio del 80,2 %. La diferencia en MOTA entre las categorías deportivas fue de 1,3 puntos porcentuales, con el MOTA más alto observado en las secuencias de voleibol (89,2 %) y el más bajo en las secuencias de baloncesto (87,9 %). El menor MOTA observado en las secuencias de baloncesto es consistente con la mayor frecuencia de interacciones a corta distancia y oclusiones densas en las secuencias evaluadas. Bajo condiciones de escena menos complejas, incluyendo oclusión ligera, baja velocidad de movimiento y distribución escasa de objetivos, el MOTA alcanzó el 91,8 %, el 93,1 % y el 93,8 %, respectivamente. Bajo condiciones de escena más complejas, el MOTA disminuyó al 84,9 % en caso de oclusión intensa, al 83,6 % en movimiento a alta velocidad y al 83,1 % con distribución densa de objetivos. Estos resultados muestran que el rendimiento del seguimiento disminuyó conforme aumentó la complejidad de la escena, aunque permaneció dentro del rango reportado en los escenarios deportivos evaluados.

Seguimiento de la consistencia en escenarios deportivos representativos:

Figura 7 presenta ejemplos representativos de seguimiento que ilustran la coherencia temporal de JerseyTrack en tres escenarios deportivos desafiantes: interacciones densas entre jugadores, oclusión parcial prolongada y cambios rápidos de dirección. En estas secuencias representativas, el sistema de seguimiento mantuvo identidades de trayectoria consistentes a pesar del solapamiento frecuente entre atletas y del movimiento dinámico. La fragmentación de identidad se observó principalmente durante oclusiones severas o cuando los datos semánticos de las camisetas quedaron temporalmente no disponibles; sin embargo, la estrategia de asociación guiada por confianza permitió la recuperación de la trayectoria cuando volvieron a aparecer detecciones confiables. Estos ejemplos representativos respaldan cualitativamente los resultados cuantitativos mostrados en la Figura 6, al demostrar una preservación estable de la identidad bajo las condiciones evaluadas de seguimiento deportivo.

figure-results-3
Figura 7. Resultados representativos de seguimiento generados por JerseyTrack. Cuadros consecutivos de secuencias de baloncesto, fútbol y voleibol ilustran el mantenimiento de las identidades y trayectorias de los atletas durante el seguimiento. Los cuadros delimitadores de colores representan identidades rastreadas que se mantienen a lo largo de cuadros de video sucesivos. Haga clic aquí para ver una versión más grande de esta figura.

Resultados de ablación para la conservación de la identidad:

Se realizó un análisis de ablación para examinar las contribuciones de la estrategia de asociación guiada por confianza y del módulo de fusión semántica de camisetas a la preservación de identidades. Se compararon cuatro variantes del modelo: V0, la versión básica sin asociación guiada por confianza ni fusión semántica de camisetas; V1, la variante que utiliza únicamente la asociación guiada por confianza; V2, la variante que utiliza únicamente la fusión semántica de camisetas; y V3, la configuración completa de JerseyTrack que incorpora ambos componentes. La evaluación se centró en métricas relacionadas con la identidad, incluyendo IDs, IDF1, Precisión de Identidad (IDP) y Exhaustividad de Identidad (IDR). Los patrones representativos de preservación de identidad se muestran en la Figura 8.

figure-results-4
Figura 8. Análisis de ablación de la asociación semántica de camisetas guiada por confianza. (A) Cambios generales de identidad (IDs) y puntuación F1 de identidad (IDF1) para las variantes del modelo evaluadas. (B) Comparación de los IDs entre el modelo completo (V3) y la configuración básica (V0) en escenarios representativos de seguimiento difíciles. (C) IDF1, precisión de identidad (IDP) y recuperación de identidad (IDR) del modelo completo en diferentes escenarios de seguimiento. Haga clic aquí para ver una versión más grande de esta figura.

En el entorno general de validación de SportsMOT, la configuración completa V3 produjo el menor número de identidades (IDs) y el mayor IDF1 entre las cuatro variantes del modelo. La V3 registró 2.768 IDs, lo que representa 477 conmutaciones de identidad menos que la V0, y alcanzó un IDF1 del 74,3 %, lo que supone un aumento de 7,1 puntos porcentuales respecto a la V0. Estos resultados indican que los dos módulos contribuyeron conjuntamente a la preservación de la identidad bajo las condiciones de seguimiento deportivo evaluadas. La comparación entre las variantes con un solo módulo y la configuración completa mostró además que ambos módulos afectaron diferentes fuentes de error de seguimiento. La estrategia de asociación guiada por la confianza redujo los errores de emparejamiento asociados a la confianza inestable en la detección y a la incertidumbre en la localización, mientras que el módulo de fusión semántica de camisetas proporcionó información adicional de identidad cuando la información de movimiento por sí sola era insuficiente. La configuración completa V3 logró un mejor rendimiento relacionado con la identidad que cualquiera de las variantes con un solo módulo, lo que sugiere que ambos módulos aportaron contribuciones complementarias y no redundantes.

Los resultados a nivel de escenario mostraron diferencias más grandes bajo condiciones de preservación de identidad más desafiantes. Durante oclusiones de larga duración, V3 registró 215 identidades en comparación con 482 de V0. En escenarios densos con jugadores del mismo equipo que contenían entre 6 y 10 jugadores, V3 registró 328 identidades frente a 615 de V0. Bajo cambios rápidos de dirección a alta velocidad, V3 registró 482 identidades en comparación con 960 de V0. Estas reducciones son coherentes con el uso previsto de pistas semánticas durante la oclusión y las interacciones densas, así como con la asociación guiada por la confianza ante fluctuaciones en la confianza de detección durante movimientos rápidos. Las tendencias de IDP e IDR mostradas en Figura 8C indican que la reducción en identidades no estuvo acompañada de una reducción sustancial ni en precisión de identidad ni en recuperación de identidad. La configuración completa mantuvo valores de IDF1 superiores al 71 % en todos los escenarios desafiantes evaluados, observándose valores más bajos en interacciones densas entre jugadores del mismo equipo y cambios rápidos de dirección a alta velocidad. Estos resultados indican una mayor consistencia en la identidad bajo las condiciones evaluadas, identificando las interacciones densas y el movimiento rápido como las principales fuentes restantes de degradación del rendimiento.

Resultados de la evaluación entre conjuntos de datos:

Se realizó una evaluación entre conjuntos de datos para examinar si el comportamiento de seguimiento observado en SportsMOT podía mantenerse bajo condiciones diferentes de conjuntos de datos. La evaluación incluyó dos conjuntos de datos específicos para deportes, SoccerNet Tracking y TeamTrack, y dos conjuntos de datos generales de MOT, MOT17 y MOT20. El propósito de este experimento fue examinar la transferencia de rendimiento entre diferentes tipos de conjuntos de datos. Los resultados no se utilizaron para afirmar una superioridad directa a nivel de métricas entre conjuntos de datos, ya que los protocolos de anotación, la composición de las escenas, los puntos de vista de las cámaras y las categorías de los objetivos difieren.

Tabla 1 resume los resultados de la evaluación entre conjuntos de datos. En los conjuntos de datos específicos de deportes, JerseyTrack mantuvo valores relativamente estables de MOTA e IDF1 en comparación con la configuración principal de validación de SportsMOT. Esta tendencia sugiere que la estrategia de asociación guiada por confianza y las pistas semánticas relacionadas con las camisetas siguieron siendo efectivas cuando las escenas de seguimiento conservaron características visuales propias de deportes de equipo, incluyendo uniformes repetidos, interacciones densas entre atletas y oclusiones frecuentes. En los conjuntos de datos generales de MOT, el método mantuvo valores competitivos de MOTA y DetA, mientras que el valor de IDF1 fue inferior al observado en los conjuntos de datos específicos de deportes. Este patrón es coherente con la ausencia de pistas de color de camiseta y número de jugador en MOT17 y MOT20, que son utilizadas por el módulo de fusión semántica. Bajo estas condiciones, el componente de asociación guiada por confianza siguió siendo aplicable, mientras que la rama semántica aportó menos información específica de identidad de la que aportó en videos de deportes de equipo. En conjunto, estos resultados indican que JerseyTrack se transfirió más eficazmente a conjuntos de datos que contienen semántica visual específica de deportes que a conjuntos de datos generales de seguimiento de peatones. Por lo tanto, la evaluación entre conjuntos de datos respalda la aplicación prevista del método como un rastreador orientado a deportes, al tiempo que identifica la ausencia de semántica explícita de camisetas como un factor limitante para conjuntos de datos MOT no deportivos.

Conjunto de datosMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

Tabla 1: Resultados de la evaluación entre conjuntos de datos. Rendimiento del seguimiento de JerseyTrack evaluado en cuatro conjuntos de datos de referencia públicos. Se informan la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la Puntuación F1 de Identidad (IDF1), la Precisión de Detección (DetA) y la velocidad de procesamiento medida en Cuadros por Segundo (FPS). Valores más altos indican un mejor rendimiento para MOTA, IDF1, DetA y FPS.

Robustez bajo condiciones controladas de perturbación

Se realizaron experimentos de perturbación controlada para examinar la estabilidad de JerseyTrack ante perturbaciones visuales y de calidad de detección comunes en videos deportivos. Las perturbaciones evaluadas se agruparon en tres categorías: perturbación de características semánticas, perturbación de caja de detección y perturbación ambiental. Las perturbaciones de características semánticas incluyeron la oclusión del número del jugador, desenfoque de la imagen, degradación de la resolución y colores de camiseta similares. Las perturbaciones de caja de detección incluyeron desplazamiento de la caja delimitadora, fluctuación de la confianza de detección y cajas de detección falsas. Las perturbaciones ambientales incluyeron ruido tipo lluvia, degradación tipo niebla, iluminación intensa e interferencia de sombras. Figura 9 resume el rendimiento del seguimiento bajo estas condiciones de perturbación. Bajo perturbación de características semánticas, el rendimiento del seguimiento disminuyó a medida que la visibilidad del número del jugador y la calidad del recorte empeoraron. Cuando el 40 % de la región del número del jugador estuvo ocluida, MOTA disminuyó 3,2 puntos porcentuales y IDF1 disminuyó 5,3 puntos porcentuales en comparación con la condición sin perturbación, mientras que la precisión de extracción semántica se mantuvo en 86,7 %. Estos resultados indican que las pistas de color de la camiseta y el número del jugador proporcionaron información complementaria cuando una de las pistas semánticas se volvió menos confiable. Bajo perturbación de caja de detección, el método mostró una degradación moderada del rendimiento en lugar de un fallo brusco. Cuando las cajas de detección se desplazaron ±10 píxeles y las puntuaciones de confianza se perturbaron con ruido gaussiano, la disminución en MOTA se mantuvo por debajo de 3 puntos porcentuales, y el aumento en IDs permaneció dentro del 16 %. Esta tendencia es consistente con la estrategia de asociación guiada por confianza, en la cual las detecciones de confianza media y baja se procesan utilizando restricciones adicionales de asociación en lugar de la misma estrategia aplicada a detecciones de alta confianza.

figure-results-5
Figura 9. Evaluación de robustez bajo perturbaciones controladas. (A) Cambios en la precisión del seguimiento múltiple de objetos (MOTA), la puntuación F1 de identidad (IDF1) y los cambios de identidad (IDs) con el aumento del oclusión del número de la camiseta. (B) Degradación del rendimiento bajo condiciones representativas de interferencia. (C) Aumento de IDs bajo diferentes tipos de interferencia. (D) Precisión en la extracción semántica de la camiseta bajo las condiciones de perturbación evaluadas. Haga clic aquí para ver una versión más grande de esta figura.

Bajo perturbaciones ambientales, las disminuciones en las métricas principales de seguimiento se mantuvieron por debajo de 5 puntos porcentuales en las condiciones evaluadas, y la precisión de extracción semántica se mantuvo en 87,2 %. El uso de descriptores de color basados en HSV redujo la sensibilidad a los cambios de iluminación, mientras que la rama OCR conservó información utilizable de los números de los jugadores para un subconjunto de recortes de imagen borrosos o degradados. Estos resultados indican que el módulo semántico permaneció utilizable bajo las condiciones de perturbación evaluadas, aunque su fiabilidad siguió dependiendo de la visibilidad de las camisetas y de la calidad de los recortes. En general, los experimentos de perturbación controlada mostraron que JerseyTrack mantuvo un rendimiento de seguimiento medible bajo las perturbaciones semánticas, de calidad de detección y ambientales evaluadas. Estos hallazgos deben interpretarse dentro del rango de perturbaciones probadas. La reidentificación sistemática fuera de la vista, la interferencia grave del fondo y la oclusión completa a largo plazo no se evaluaron por separado en este experimento y se discuten como limitaciones en la sección de Discusión.

Análisis de contribución del módulo y discriminación de características

Se realizó un análisis adicional de la contribución del módulo y la discriminación de características para examinar cómo los dos componentes propuestos afectaron el rendimiento del seguimiento relacionado con la identidad. El análisis de contribución del módulo utilizó las cuatro variantes del modelo definidas en el análisis de ablación, mientras que el análisis de discriminación de características comparó las características tradicionales de Re-ID, características basadas únicamente en el color, características basadas únicamente en el número del jugador y características semánticas del jersey fusionadas. Se utilizó la razón entre la distancia interclase e intraclase para describir la separabilidad de las características, donde valores más altos indican una mayor separación entre identidades diferentes en comparación con la variación dentro de la misma identidad. Tabla 2 resume el análisis de contribución del módulo. En la evaluación general, la contribución estimada de la estrategia de asociación guiada por confianza fue del 41,7 %, la contribución estimada de la fusión semántica del jersey fue del 47,6 % y el 10,7 % restante se atribuyó al uso combinado de ambos componentes. Estos valores indican que ambos componentes contribuyeron a la mejora observada, mientras que la configuración completa se benefició de su uso conjunto en lugar de depender de cada componente por separado. El patrón de contribución varió según el tipo de escena. Bajo oclusión intensa, la contribución estimada de la fusión semántica del jersey aumentó hasta el 69,4 %, lo cual es coherente con la menor fiabilidad de las pistas de movimiento cuando los atletas estaban parcial o temporalmente ocluidos. Bajo movimiento a alta velocidad, la contribución estimada de la asociación guiada por confianza alcanzó el 44,3 %, y la ganancia combinada alcanzó el 20,6 %, lo que indica que la partición por niveles de confianza se volvió más relevante cuando la confianza de detección fluctuaba debido al movimiento rápido o a la incertidumbre en la localización.

Variante del modeloEscenario de pruebaMOTA↑IDF1↑IDs↓Contribución del móduloGanancia sinérgica
V0 (Línea base)Escena general83.567.23245
Escenas con oclusión severa77.861.53862
Escena con movimiento de alta velocidad77.162.33689
V1 (Asociación guiada por confianza)Escena general86.370.9289341.7
Escenas con oclusión severa80.965.9341529.8
Escena con movimiento de alta velocidad81.467.9302444.3
V2 (Asociación semántica de camiseta)Escena general85.271.8293747.6
Escenas con oclusión severa82.772.8275369.4
Escena con movimiento de alta velocidad80.166.8315735.1
V3 (JerseyTrack completo)Escena general88.974.3276810.7
Escenas con oclusión severa84.975.626890.8
Escena con movimiento de alta velocidad83.671.5284220.6

Tabla 2: Análisis de ablación de las contribuciones de los módulos. Comparación del rendimiento de diferentes variantes del modelo JerseyTrack en escenarios generales, con oclusiones severas y con movimientos de alta velocidad. Se informan la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la Puntuación F1 de Identidad (IDF1) y el número de Cambios de Identidad (IDs), junto con la contribución estimada del módulo y la ganancia sinérgica. Valores más altos indican un mejor rendimiento para MOTA, IDF1, contribución del módulo y ganancia sinérgica, mientras que valores más bajos indican un mejor rendimiento para IDs.

Tabla 3 resume el análisis de discriminación de características. La característica semántica combinada de la camiseta alcanzó una relación de distancia interclase/intraclase de 5,63, en comparación con 1,82 para las características tradicionales de Re-ID, lo que corresponde a una mejora relativa del 209,3 % en la medida de relación de distancia. Las características basadas únicamente en el color y únicamente en el número del jugador también mejoraron la separabilidad de las características en comparación con las características tradicionales de Re-ID, aunque cada indicio individual siguió siendo susceptible a casos específicos de fallo, incluyendo colores de equipo similares, oclusión del número del jugador, desenfoque por movimiento y zonas de la camiseta ilegibles. Entre las representaciones de características evaluadas, la representación semántica combinada logró la mayor separabilidad de características y se correspondió con el valor más alto de IDF1 y el recuento de identidades (ID) más bajo observado en el análisis de ablación. Estos hallazgos respaldan el uso de indicadores semánticos específicos de la camiseta como información complementaria de identidad para el seguimiento de múltiples objetos en deportes (MOT) cuando los atletas tienen apariencias similares y la información de movimiento por sí sola es insuficiente. Estas observaciones están limitadas al entorno SportsMOT evaluado y no deben interpretarse como evidencia de que la semántica de las camisetas resuelve toda ambigüedad de identidad en todos los vídeos deportivos.

Tipo de característicaRelación de distancia interclase/intraclaseMejora relativa (%)IDF1↑IDs↓
Características tradicionales de Re-ID1.8265.73482
Características de color de equipo3.1774.269.83125
Características de número de jugador3.4991.870.53018
Características semánticas combinadas de camiseta5.63209.374.32768

Tabla 3: Análisis de discriminación de diferentes representaciones de características. Comparación de la discriminación de características utilizando características tradicionales de re-identificación (Re-ID), características del color de la camiseta, características del número del jugador y características semánticas fusionadas. Se informa la relación entre la distancia interclase e intraclase, la mejora relativa en la discriminación de características, la puntuación F1 de identidad (IDF1) y el número de cambios de identidad (IDs). Valores más altos indican un mejor desempeño para la relación de distancia, la mejora relativa y la IDF1, mientras que valores más bajos indican un mejor desempeño para los IDs.

Comparación de referencia con métodos existentes de seguimiento de múltiples objetos

Se realizó una comparación de referencia para comparar JerseyTrack con métodos representativos de MOT bajo la misma configuración de validación SportsMOT. Los métodos comparados incluyeron QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT y MOTR. Todos los métodos utilizaron las mismas salidas del detector generadas por el marco del detector que se enumera en la Tabla de Materiales, de modo que la comparación se centrara en el rendimiento de asociación de seguimiento y no en las variaciones del detector. La evaluación utilizó las métricas definidas en el Protocolo Sección 7. Las métricas principales de evaluación incluyeron MOTA, HOTA e IDF1. Las métricas auxiliares incluyeron DetA, AssA, FPs, FNs e IDs. Tabla 4 resume la comparación cuantitativa en la división de validación de SportsMOT, y Figura 10 presenta una comparación visual de la precisión de seguimiento, la velocidad de inferencia y la distribución de HOTA en las escenas deportivas evaluadas. JerseyTrack obtuvo el MOTA más alto entre los métodos comparados, alcanzando el 88,9 %. Este valor fue 1,1 puntos porcentuales más alto que el de Deep OC-SORT (87,8 %) y 2,5 puntos porcentuales más alto que el de ByteTrack (86,4 %). Por lo tanto, bajo la configuración de validación SportsMOT evaluada, JerseyTrack logró la mayor precisión general de seguimiento entre los métodos comparados. En cuanto a HOTA, JerseyTrack alcanzó el 69,9 %, frente al 64,4 % de Deep OC-SORT y al 62,8 % de ByteTrack. Estas diferencias corresponden a mejoras de 5,5 y 7,1 puntos porcentuales, respectivamente, lo que indica un mayor equilibrio entre el rendimiento de detección y asociación bajo la misma configuración de evaluación.

MétodoMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

Tabla 4: Comparación de rendimiento de JerseyTrack y métodos representativos de seguimiento múltiple de objetos en el conjunto de validación de SportsMOT. Comparación de JerseyTrack con métodos representativos de seguimiento múltiple de objetos (MOT) en el conjunto de datos de validación de SportsMOT. Las métricas reportadas incluyen la Precisión en el Seguimiento Múltiple de Objetos (MOTA), la Precisión en el Seguimiento de Orden Superior (HOTA), la Puntuación F1 de Identidad (IDF1), la Precisión de Detección (DetA), la Precisión de Asociación (AssA), los Positivos Falsos (FP), los Negativos Falsos (FN) y el número de Cambios de Identidad (IDs). Valores más altos indican un mejor rendimiento para MOTA, HOTA, IDF1, DetA y AssA, mientras que valores más bajos indican un mejor rendimiento para FP, FN e IDs.

figure-results-6
Figura 10. Comparación de rendimiento con métodos representativos de seguimiento múltiple de objetos. (A) Comparación de la Precisión en el Seguimiento de Múltiples Objetos (MOTA) y Cuadros Por Segundo (FPS) para JerseyTrack y métodos representativos de seguimiento múltiple de objetos evaluados en el conjunto de datos SportsMOT. (B) Distribución de la Precisión de Seguimiento de Orden Superior (HOTA) entre los métodos de seguimiento evaluados. Haga clic aquí para ver una versión más grande de esta figura.

Para la preservación de la identidad, JerseyTrack alcanzó un IDF1 del 74,3 %, en comparación con el 69,9 % de Deep OC-SORT y el 67,7 % de ByteTrack. JerseyTrack también registró 2.768 identificaciones (IDs), menos que las 3.211 IDs registradas por Deep OC-SORT y las 4.192 IDs registradas por ByteTrack. Estas observaciones son coherentes con los resultados del estudio de ablación presentados en Figura 8  y Tabla 2, en los que la configuración completa de JerseyTrack redujo los cambios de identidad en comparación con las variantes del modelo de referencia. En cuanto a la calidad de detección y asociación, JerseyTrack alcanzó un DetA del 80,2 % y un AssA del 54,3 %. En comparación con Deep OC-SORT, JerseyTrack mejoró el DetA en 2,0 puntos porcentuales y el AssA en 2,2 puntos porcentuales. JerseyTrack también generó menos falsos positivos (FP) y falsos negativos (FN) que los otros métodos comparados indicados en Tabla 4, registrando 21.953 FP y 67.160 FN. En general, la comparación de referencia mostró que JerseyTrack alcanzó los valores más altos para las métricas principales de seguimiento entre los métodos evaluados bajo la configuración de validación SportsMOT. Estos resultados son coherentes con las mejoras observadas en la preservación de la identidad y la estabilidad de la asociación obtenidas mediante la asociación guiada por confianza y la fusión semántica de las camisetas. La comparación se limita a las salidas del detector compartido y la configuración de validación SportsMOT utilizadas en este estudio.

Resultados de sensibilidad de parámetros

Se realizó un análisis de sensibilidad de parámetros para examinar cómo los parámetros clave de implementación afectaban el rendimiento del seguimiento en la configuración de validación SportsMOT. Se evaluaron tres parámetros: el coeficiente de ponderación de la pérdida de OCR (γ), el número de clústeres jerárquicos por nivel de confianza (K) y la tasa de aprendizaje de la red de OCR (η). Tabla 5 resume los valores de MOTA, IDF1, HOTA e IDs obtenidos bajo diferentes configuraciones de parámetros.

ParámetroValorMOTA↑IDF1↑HOTA↑IDs↓
Peso de la pérdida de OCR (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (óptimo)88.974.369.92,768
188.273.869.32,792
Número de agrupaciones de confianza (K)286.772.168.52,876
3 (óptimo)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
Tasa de aprendizaje de OCR (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (óptimo)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

Tabla 5: Análisis de sensibilidad de parámetros. Rendimiento de seguimiento obtenido utilizando diferentes configuraciones de parámetros para JerseyTrack. Se informan la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la Puntuación F1 de Identidad (IDF1), la Precisión de Seguimiento de Orden Superior (HOTA) y el número de Cambios de Identidad (IDs) para distintos valores del coeficiente de ponderación de la pérdida de Reconocimiento Óptico de Caracteres (OCR) (γ), el número de clústeres de confianza (K) y la tasa de aprendizaje de OCR (η). Los valores de los parámetros identificados como óptimos corresponden a las configuraciones utilizadas en los experimentos descritos. Valores más altos indican un mejor rendimiento para MOTA, IDF1 y HOTA, mientras que valores más bajos indican un mejor rendimiento para IDs.

Para el coeficiente de ponderación de la pérdida de OCR (γ), se obtuvo el mejor rendimiento evaluado en γ = 0,8. Bajo esta configuración, JerseyTrack alcanzó un MOTA de 88,9 %, un IDF1 de 74,3 %, un HOTA de 69,9 % y 2.768 identificaciones (IDs). Cuando γ se redujo a 0,2, los indicadores de rendimiento descendieron a 84,7 %, 69,4 % y 66,2 %, respectivamente, mientras que el número de identificaciones aumentó a 2.944. Cuando γ se incrementó a 1,0, las métricas de rendimiento disminuyeron ligeramente en comparación con γ = 0,8, con un MOTA de 88,2 %, un IDF1 de 73,8 %, un HOTA de 69,3 % y 2.792 identificaciones. Estos resultados indican que una supervisión insuficiente del OCR redujo la discriminación de los números de los jugadores, mientras que aumentar la ponderación de la pérdida de OCR más allá del valor óptimo evaluado no mejoró el rendimiento del seguimiento bajo las condiciones probadas.

Para el número de clústeres jerárquicos por nivel de confianza (K), el mejor rendimiento evaluado se obtuvo en K = 3. Esta configuración corresponde a la estrategia de asociación de alta, media y baja confianza descrita en el método. Cuando K = 2, la partición por confianza fue menos detallada, y MOTA, IDF1 y HOTA disminuyeron a 86,7 %, 72,1 % y 68,5 %, respectivamente. Cuando K aumentó a 4 o 5, el rendimiento también disminuyó en comparación con K = 3, lo que sugiere que una partición excesiva dividió las detecciones en grupos de confianza demasiado estrechos y redujo la estabilidad de la estrategia de asociación. Estos resultados respaldan el uso de tres niveles de confianza en la configuración evaluada de JerseyTrack.

Para la tasa de aprendizaje (η) de la red OCR, se obtuvo el mejor rendimiento evaluado en η = 1 × 10-3. Con una tasa de aprendizaje más baja de 1 × 10-4, MOTA, IDF1 y HOTA disminuyeron a 85,9 %, 70,8 % y 67,3 %, respectivamente, mientras que el número de identificaciones (IDs) aumentó a 2.934. Con una tasa de aprendizaje más alta de 1 × 10-2, MOTA, IDF1 y HOTA disminuyeron a 86,5 %, 71,6 % y 68,7 %, respectivamente, mientras que el número de identificaciones aumentó a 2.889. Estos resultados indican que la rama OCR fue sensible a la selección de la tasa de aprendizaje, siendo 1 × 10-3 la que proporcionó el mejor equilibrio entre el reconocimiento del número de jugadores y el rendimiento en la preservación de identidades bajo las condiciones evaluadas.

En general, la Tabla 5 muestra que la combinación de parámetros γ = 0.8, K = 3 y η = 1 × 10-3 produjo los valores más altos evaluados de MOTA, IDF1 y HOTA, junto con el menor número de IDs. El análisis de sensibilidad también mostró que desviaciones moderadas de estos valores de parámetros resultaron en cambios medibles, pero no bruscos, en el rendimiento del seguimiento. Por consiguiente, estos ajustes de parámetros se utilizaron para la comparación de referencia y los experimentos principales de validación de SportsMOT reportados en este estudio.

Disponibilidad de datos

Los resúmenes brutos de evaluación, las salidas finales de seguimiento, los registros del entorno, los archivos de mapeo del conjunto de datos y los archivos de resumen intermedios que respaldan los hallazgos de este estudio están disponibles en un repositorio público en https://doi.org/10.5281/zenodo.21274353. Los conjuntos de datos públicos originales utilizados en este estudio, incluidos SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 y MOT20, están disponibles a través de sus respectivos proveedores y no se redistribuyen en el repositorio.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio evaluó un flujo de trabajo de seguimiento múltiple de objetos en deportes guiado por confianza que combina la partición basada en la confianza de detección con pistas semánticas de las camisetas. Se ha investigado la asociación guiada por confianza y la fusión de características semánticas como estrategias complementarias para mejorar la asociación de datos en el seguimiento múltiple de objetos12,20,23,24,46. Los resultados muestran que la configuración completa de JerseyTrack mejoró la preservación de identidad y la estabilidad de asociación en el entorno de validación SportsMOT evaluado. El resultado principal de validación SportsMOT alcanzó un MOTA del 88,9 %, un HOTA del 69,9 %, un IDF1 del 74,3 %, un DetA del 80,2 % y un AssA del 54,3 %. Estos valores deben interpretarse dentro de la fuente de salida del detector, la división del conjunto de datos y la configuración de TrackEval descritas en el Protocolo.

Un paso crítico en el flujo de trabajo es la partición por nivel de confianza, que permite aplicar diferentes estrategias de asociación según la fiabilidad de las salidas del detector20,22,23,24. Al separar las detecciones en grupos de alta, media y baja confianza, JerseyTrack aplica reglas de asociación distintas a detecciones con diferentes niveles de fiabilidad. Las detecciones de alta confianza se asocian principalmente mediante consistencia de movimiento, mientras que las detecciones de confianza media utilizan conjuntamente el movimiento y la semántica de la camiseta. Las detecciones de baja confianza no se utilizan para inicializar nuevas trayectorias y solo se consideran durante la recuperación de trayectorias. Este diseño redujo el riesgo de que detecciones débiles o falsos positivos generaran identidades inestables, al tiempo que permitió que detecciones parciales contribuyeran a la recuperación cuando había evidencia semántica adicional disponible8,11,20. El segundo paso crítico es la extracción de la semántica de la camiseta. Las características del color del equipo proporcionan una restricción a nivel de equipo, mientras que las características del número del jugador ofrecen una pista de identidad más precisa cuando la región del número es visible y legible35,41,42,43. Los resultados de los estudios de ablación indican que estas pistas son más útiles en casos de interacción densa entre jugadores del mismo equipo y en situaciones de oclusión, donde la asociación basada únicamente en el movimiento es menos confiable. Sin embargo, la semántica de la camiseta debe considerarse como evidencia auxiliar y no como un reemplazo completo de la asociación por movimiento. Los números de los jugadores pueden ser ilegibles debido al desenfoque, recorte, posturas desde la espalda, oclusión severa o baja resolución de la imagen. Además, las características del color del equipo tampoco pueden distinguir entre atletas del mismo equipo cuando no hay información disponible sobre el número35,42,43. Los resultados cruzados entre conjuntos de datos aclaran aún más el alcance del método. JerseyTrack se transfirió de forma más natural a conjuntos de datos de deportes de equipo que a conjuntos de datos generales de seguimiento de peatones (MOT), porque la rama semántica fue diseñada en torno a pistas de color de camiseta y número de jugador19,33,34,35,36,37. En conjuntos de datos MOT generales, el componente de asociación guiada por confianza siguió siendo aplicable, pero la rama semántica específica para deportes aportó menos información de identidad. Por lo tanto, el método es más adecuado para videos de deportes de equipo en los que los atletas llevan uniformes distinguibles y la región de la camiseta es suficientemente visible para la extracción semántica19,33,34,35,36,37.

Aún quedan varias limitaciones. Primero, el método depende de la calidad de las salidas del detector; detecciones perdidas graves o cajas delimitadoras inexactas reducen la confiabilidad tanto de la predicción de movimiento como del recorte semántico14,17,46. Segundo, en la implementación actual no se optimizó por separado la reidentificación a largo plazo cuando el sujeto está fuera del campo de visión. Cuando un atleta abandona la vista de la cámara durante un período prolongado y luego vuelve a ingresar, la estrategia actual de recuperación de trayectoria puede no ser suficiente para restablecer la identidad original19,34. Tercero, la presencia de desorden severo en el fondo, superposición de jugadores, desenfoque por movimiento y números de camiseta ilegibles puede reducir la confiabilidad de las características semánticas14,35,42,46. Cuarto, la evaluación actual se centró en conjuntos de datos de referencia públicos y configuraciones de perturbación controladas; la implementación en videos de transmisión con cortes de cámara, cambios de zoom y puntos de vista no estándar podría requerir módulos adicionales de preprocesamiento o de reidentificación19,33,34.

La principal implicación práctica es que la asociación guiada por confianza y las señales semánticas específicas del uniforme pueden integrarse en una canalización modular de seguimiento de múltiples objetos (MOT) sin modificar la estructura del detector. Esta capacidad es aplicable a tareas de análisis deportivo, como la extracción de trayectorias de atletas, el análisis de movimientos de equipo, la revisión de eventos tácticos y la anotación de video semiautomática1,4,33,36. Los trabajos futuros deben centrarse en una reidentificación más robusta fuera del campo de visión, el manejo de ruido de fondo, la agregación de características temporales y un reconocimiento más fiable del número de jugador bajo desenfoque severo u oclusión14,19,34,46.

En resumen, JerseyTrack es un método de MOT deportivo que combina la asociación guiada por confianza con la fusión semántica de camisetas. El método divide las detecciones en grupos de alta, media y baja confianza, y aplica diferentes reglas de asociación según la fiabilidad de las detecciones, utilizando al mismo tiempo las pistas del color de la camiseta y del número del jugador como información auxiliar de identidad durante la asociación de confianza media y la recuperación de trayectorias. En la configuración de validación SportsMOT evaluada, JerseyTrack demostró una mayor precisión en el seguimiento y una mejor preservación de la identidad en comparación con las configuraciones básicas evaluadas. Los resultados del estudio de ablación mostraron que la configuración completa redujo los cambios de identidad en comparación con la configuración básica y las variantes con un solo módulo, y la comparación con el conjunto de pruebas mostró valores más altos para las métricas principales de seguimiento bajo la misma configuración de salida del detector y evaluación. Estos hallazgos respaldan el uso de información por niveles de confianza y pistas semánticas específicas de la camiseta para el seguimiento de atletas en videos de deportes de equipo, especialmente cuando las regiones de las camisetas son visibles y la información sobre el color del equipo o el número del jugador proporciona evidencia adicional de identidad20,35,46. Abordar las limitaciones identificadas podría mejorar aún más la aplicabilidad del flujo de trabajo propuesto a escenarios de seguimiento deportivo más desafiantes.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen conflictos financieros de interés.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen reconocimientos que declarar.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Tiempo de ejecución CUDANVIDIAVersión 12.8Tiempo de ejecución de computación GPU utilizado para el entrenamiento del detector, extracción de características semánticas e inferencia de seguimiento.
EasyOCRJaided AIVersión 1.7.2Kit de herramientas de reconocimiento óptico de caracteres utilizado para el reconocimiento del número de los jugadores.
Código fuente de JerseyTrackAutoresN/AImplementación personalizada que contiene los scripts de preparación de datos, extracción de características semánticas, partición de confianza, seguimiento, postprocesamiento y evaluación. Disponible en: https://doi.org/10.5281/zenodo.21274352
Modelo OCR CRNN ligeroAutoresN/ARed neuronal recurrente convolucional personalizada (CRNN) utilizada para el reconocimiento del número de los jugadores.
Conjunto de datos MOT17MOTChallengeN/AConjunto de datos de referencia público utilizado para evaluación entre conjuntos de datos. Disponible en: https://motchallenge.net/data/MOT17/
Conjunto de datos MOT20MOTChallengeN/AConjunto de datos de referencia público utilizado para evaluación entre conjuntos de datos. Disponible en: https://motchallenge.net/data/MOT20/
motmetricsDesarrolladores de motmetricsVersión 1.4.0Biblioteca utilizada para el cálculo de métricas diagnósticas de seguimiento de múltiples objetos.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Unidad de procesamiento gráfico utilizada para el entrenamiento del detector y la inferencia de seguimiento.
Controlador de GPU NVIDIANVIDIAVersión 610.62Controlador de GPU utilizado en el entorno experimental.
NumPyDesarrolladores de NumPyVersión 2.4.4Biblioteca de computación numérica utilizada para el procesamiento de características y manejo de datos.
OpenCVOpenCVVersión 4.10.0Biblioteca de visión por computadora utilizada para carga, recorte, preprocesamiento y visualización de imágenes.
PythonPython Software FoundationVersión 3.12.2Lenguaje de programación utilizado en todo el flujo de trabajo.
PyTorchPyTorch FoundationVersión 2.11.0+cu128Marco de aprendizaje profundo utilizado para la implementación del detector y del modelo semántico.
scikit-learnDesarrolladores de scikit-learnVersión 1.9.0Biblioteca de aprendizaje automático utilizada para agrupamiento K-medias durante la extracción del color del uniforme y la partición de confianza.
Conjunto de datos SoccerNet TrackingSoccerNetN/AConjunto de datos de referencia público para seguimiento de fútbol utilizado para evaluación entre conjuntos de datos. Disponible en: https://www.soccer-net.org/tasks/tracking
Conjunto de datos SportsMOTBenchmark SportsMOTN/AConjunto de datos de referencia principal utilizado para la preparación del detector y la evaluación del seguimiento. Disponible en: https://deeperaction.github.io/datasets/sportsmot.html
Conjunto de datos TeamTrackBenchmark TeamTrackN/AConjunto de datos de referencia público para seguimiento deportivo utilizado para evaluación entre conjuntos de datos. Disponible en: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationVersión 0.26.0+cu128Biblioteca de visión por computadora utilizada junto con PyTorch para transformación de imágenes y soporte de modelos.
TrackEvalDesarrolladores de TrackEvalVersión 1.3.0Kit de herramientas de evaluación utilizado para calcular la Precisión en el Seguimiento de Múltiples Objetos (MOTA), Puntuación F1 de Identidad (IDF1), Precisión de Seguimiento de Orden Superior (HOTA), Precisión de Detección (DetA), Precisión de Asociación (AssA), falsos positivos (FP), falsos negativos (FN) y cambios de identidad (IDs).
UltralyticsUltralyticsVersión 8.4.90Marco de detección de objetos utilizado para entrenar el detector y generar detecciones de atletas.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Seguimiento guiado por confianzatrayectoria del jugadorsimilitud de movimientocolor de la camisetareconocimiento ptico de caracteresconsistencia de identidadconjunto de datos SportsMOT

Artículos relacionados