$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Esta sección presenta los resultados cuantitativos y cualitativos obtenidos de los experimentos evaluados de seguimiento multiobjeto en deportes. Los resultados se centran en la precisión del seguimiento, la preservación de la identidad, la calidad de la asociación y la robustez bajo las configuraciones del conjunto de datos probadas. Las afirmaciones sobre el rendimiento se limitan a los métodos evaluados, conjuntos de datos, salidas del detector y configuración del kit de evaluación descritos en el Protocolo y Configuración de Implementación.
Configuración experimental y diseño de evaluación
Conjunto de datos y preprocesamiento:
SportsMOT se utilizó como la referencia principal para la preparación del detector, la inferencia de seguimiento y la evaluación cuantitativa. El conjunto de datos contiene 240 secuencias de video y más de 150.000 fotogramas de imagen en escenarios de fútbol, baloncesto y voleibol (Figura 5). En la evaluación formal, los principales resultados de SportsMOT se calcularon utilizando la división de validación junto con las salidas del detector, la configuración de seguimiento y los ajustes de TrackEval descritos en el Protocolo. Se realizó una evaluación cruzada entre conjuntos de datos en TeamTrack, SoccerNet Tracking, MOT17 y MOT20 para examinar la transferencia de rendimiento entre diferentes tipos de conjuntos de datos, en lugar de realizar comparaciones directas a nivel de métricas entre ellos.

Figura 5. Conjuntos de datos representativos utilizados para la evaluación. Los fotogramas de ejemplo ilustran secuencias representativas de fútbol, baloncesto y voleibol utilizadas para la evaluación experimental. La figura resalta las variaciones en el punto de vista de la cámara, la densidad de jugadores y la complejidad de la escena entre los conjuntos de datos evaluados. Haga clic aquí para ver una versión más grande de esta figura.
Los datos de SportsMOT se organizaron según la estructura oficial del conjunto de datos y se convirtieron al formato de entrenamiento del detector descrito en el Protocolo. Los datos convertidos de entrenamiento y validación de SportsMOT contenían 90 secuencias, 55.544 cuadros y 608.152 objetos anotados. La partición de entrenamiento se utilizó para la preparación del detector y el ajuste de parámetros, mientras que la partición de validación se empleó para la evaluación formal del seguimiento informada en este estudio. Todos los cuadros de entrada se redimensionaron según la configuración del detector indicada en el Protocolo y en la Tabla de materiales. Se aplicó el mismo procedimiento de preprocesamiento durante la preparación del detector, la extracción de características semánticas, la inferencia de seguimiento y la evaluación con TrackEval, de modo que las diferencias informadas reflejaran principalmente la estrategia de asociación de seguimiento y no diferencias en el procesamiento de los datos.
Indicadores de evaluación:
El rendimiento del seguimiento se evaluó utilizando un protocolo de evaluación compatible con MOTChallenge, implementado con el kit de herramientas de evaluación que se enumera en la Tabla de Materiales. Las métricas reportadas describen tres aspectos del rendimiento del seguimiento múltiple en deportes: precisión general del seguimiento, preservación de identidad y calidad de la detección-asociación. Se utilizaron MOTA, IDF1 y HOTA como métricas principales de evaluación44,45. MOTA resume los falsos positivos, falsos negativos y cambios de identidad en una puntuación general de precisión del seguimiento. IDF1 mide la consistencia entre las trayectorias predichas y las identidades reales. HOTA evalúa conjuntamente la precisión de la detección y la precisión de la asociación, caracterizando así el equilibrio entre la localización del objetivo y la asociación de trayectorias. DetA y AssA se reportaron como métricas complementarias. FPs, FNs y cambios de identidad (IDs) se utilizaron para caracterizar las fuentes de error relacionadas con detecciones falsas, detecciones perdidas y cambios de identidad. Para las comparaciones entre métodos en SportsMOT, se utilizaron las mismas salidas del detector y la misma configuración del kit de herramientas de evaluación con el fin de reducir la influencia de las variaciones del detector y las diferencias en la configuración de evaluación. Para las comparaciones entre conjuntos de datos, los valores de las métricas se interpretaron como resultados de evaluación dentro del conjunto de datos, y no como evidencia de una superioridad absoluta del rendimiento entre diferentes conjuntos de datos.
Ambiente experimental y configuración de parámetros:
Los experimentos se realizaron utilizando los recursos de hardware y software enumerados en la Tabla de Materiales. Se utilizó el mismo entorno computacional, marco del detector, salidas del detector y kit de evaluación en todos los experimentos principales de SportsMOT para mantener la consistencia durante la preparación del detector, la inferencia de seguimiento y la evaluación del rendimiento. El marco del detector enumerado en la Tabla de Materiales se entrenó con un tamaño de lote de 16, una tasa de aprendizaje inicial de 0,01 y 80 épocas de entrenamiento. En el módulo de extracción semántica de camisetas, la agrupación por color utilizó K-means con K = 3, y la rama OCR empleó una red neuronal recurrente convolucional ligera con un tamaño de entrada de 128 × 64 píxeles. La rama OCR se optimizó utilizando el optimizador adaptativo enumerado en la Tabla de Materiales con una tasa de aprendizaje de 1 × 10⁻3, una disminución de peso de 1 × 10⁻5, un tamaño de lote de 64 y 40 épocas de entrenamiento. No se utilizó ninguna programación adicional de la tasa de aprendizaje durante el entrenamiento del módulo de extracción de características semánticas. El coeficiente de ponderación de la pérdida OCR (γ) se trató como un hiperparámetro definido por el usuario y se seleccionó según el rendimiento en el conjunto de validación. La estratificación por nivel de confianza utilizó una partición adaptativa mediante K-means, en la cual τ₁ y τ₂ se calcularon a partir de la distribución de confianza de detección de cada cuadro, en lugar de definirlas manualmente antes de la inferencia.
Rendimiento del seguimiento en diferentes deportes y niveles de complejidad de escenario
Rendimiento cuantitativo bajo diferentes condiciones de deportes y escenas:
El rendimiento del seguimiento se evaluó bajo dos factores de agrupación: categoría deportiva y complejidad de la escena. El análisis por categoría deportiva incluyó secuencias de fútbol, baloncesto y voleibol. El análisis de la complejidad de la escena consideró el nivel de oclusión, la velocidad del movimiento y la densidad del objetivo, utilizando los mismos criterios de agrupación en todas las secuencias evaluadas. Las métricas reportadas siguieron el protocolo de evaluación descrito en la Sección 7 del Protocolo.
Figura 6 resume los resultados de seguimiento cuantitativo bajo diferentes categorías deportivas y condiciones de complejidad de escena. Figura 6A muestra MOTA y DetA en secuencias de fútbol, baloncesto y voleibol. Figura 6B muestra la variación de MOTA bajo diferentes niveles de oclusión, velocidad de movimiento y densidad de objetivos. Figura 6C muestra los recuentos acumulados de FP y FN para cada dimensión de complejidad de escena.

Figura 6. Seguimiento del rendimiento en diferentes categorías deportivas y condiciones de la escena. (A) Precisión en el seguimiento de múltiples objetos (MOTA) y precisión en la detección (DetA) para fútbol, baloncesto, voleibol y el promedio general. (B) MOTA en distintas condiciones representativas de la escena con diferentes niveles de oclusión, densidad de jugadores y complejidad del movimiento. (C) Números de falsos positivos (FPs) y falsos negativos (FNs) en las condiciones de escena evaluadas. Haga clic aquí para ver una versión ampliada de esta figura.
En las tres categorías deportivas, JerseyTrack logró un MOTA promedio del 88,9 % y un DetA promedio del 80,2 %. La diferencia en MOTA entre las categorías deportivas fue de 1,3 puntos porcentuales, con el MOTA más alto observado en las secuencias de voleibol (89,2 %) y el más bajo en las secuencias de baloncesto (87,9 %). El menor MOTA observado en las secuencias de baloncesto es consistente con la mayor frecuencia de interacciones a corta distancia y oclusiones densas en las secuencias evaluadas. Bajo condiciones de escena menos complejas, incluyendo oclusión ligera, baja velocidad de movimiento y distribución escasa de objetivos, el MOTA alcanzó el 91,8 %, el 93,1 % y el 93,8 %, respectivamente. Bajo condiciones de escena más complejas, el MOTA disminuyó al 84,9 % en caso de oclusión intensa, al 83,6 % en movimiento a alta velocidad y al 83,1 % con distribución densa de objetivos. Estos resultados muestran que el rendimiento del seguimiento disminuyó conforme aumentó la complejidad de la escena, aunque permaneció dentro del rango reportado en los escenarios deportivos evaluados.
Seguimiento de la consistencia en escenarios deportivos representativos:
Figura 7 presenta ejemplos representativos de seguimiento que ilustran la coherencia temporal de JerseyTrack en tres escenarios deportivos desafiantes: interacciones densas entre jugadores, oclusión parcial prolongada y cambios rápidos de dirección. En estas secuencias representativas, el sistema de seguimiento mantuvo identidades de trayectoria consistentes a pesar del solapamiento frecuente entre atletas y del movimiento dinámico. La fragmentación de identidad se observó principalmente durante oclusiones severas o cuando los datos semánticos de las camisetas quedaron temporalmente no disponibles; sin embargo, la estrategia de asociación guiada por confianza permitió la recuperación de la trayectoria cuando volvieron a aparecer detecciones confiables. Estos ejemplos representativos respaldan cualitativamente los resultados cuantitativos mostrados en la Figura 6, al demostrar una preservación estable de la identidad bajo las condiciones evaluadas de seguimiento deportivo.

Figura 7. Resultados representativos de seguimiento generados por JerseyTrack. Cuadros consecutivos de secuencias de baloncesto, fútbol y voleibol ilustran el mantenimiento de las identidades y trayectorias de los atletas durante el seguimiento. Los cuadros delimitadores de colores representan identidades rastreadas que se mantienen a lo largo de cuadros de video sucesivos. Haga clic aquí para ver una versión más grande de esta figura.
Resultados de ablación para la conservación de la identidad:
Se realizó un análisis de ablación para examinar las contribuciones de la estrategia de asociación guiada por confianza y del módulo de fusión semántica de camisetas a la preservación de identidades. Se compararon cuatro variantes del modelo: V0, la versión básica sin asociación guiada por confianza ni fusión semántica de camisetas; V1, la variante que utiliza únicamente la asociación guiada por confianza; V2, la variante que utiliza únicamente la fusión semántica de camisetas; y V3, la configuración completa de JerseyTrack que incorpora ambos componentes. La evaluación se centró en métricas relacionadas con la identidad, incluyendo IDs, IDF1, Precisión de Identidad (IDP) y Exhaustividad de Identidad (IDR). Los patrones representativos de preservación de identidad se muestran en la Figura 8.

Figura 8. Análisis de ablación de la asociación semántica de camisetas guiada por confianza. (A) Cambios generales de identidad (IDs) y puntuación F1 de identidad (IDF1) para las variantes del modelo evaluadas. (B) Comparación de los IDs entre el modelo completo (V3) y la configuración básica (V0) en escenarios representativos de seguimiento difíciles. (C) IDF1, precisión de identidad (IDP) y recuperación de identidad (IDR) del modelo completo en diferentes escenarios de seguimiento. Haga clic aquí para ver una versión más grande de esta figura.
En el entorno general de validación de SportsMOT, la configuración completa V3 produjo el menor número de identidades (IDs) y el mayor IDF1 entre las cuatro variantes del modelo. La V3 registró 2.768 IDs, lo que representa 477 conmutaciones de identidad menos que la V0, y alcanzó un IDF1 del 74,3 %, lo que supone un aumento de 7,1 puntos porcentuales respecto a la V0. Estos resultados indican que los dos módulos contribuyeron conjuntamente a la preservación de la identidad bajo las condiciones de seguimiento deportivo evaluadas. La comparación entre las variantes con un solo módulo y la configuración completa mostró además que ambos módulos afectaron diferentes fuentes de error de seguimiento. La estrategia de asociación guiada por la confianza redujo los errores de emparejamiento asociados a la confianza inestable en la detección y a la incertidumbre en la localización, mientras que el módulo de fusión semántica de camisetas proporcionó información adicional de identidad cuando la información de movimiento por sí sola era insuficiente. La configuración completa V3 logró un mejor rendimiento relacionado con la identidad que cualquiera de las variantes con un solo módulo, lo que sugiere que ambos módulos aportaron contribuciones complementarias y no redundantes.
Los resultados a nivel de escenario mostraron diferencias más grandes bajo condiciones de preservación de identidad más desafiantes. Durante oclusiones de larga duración, V3 registró 215 identidades en comparación con 482 de V0. En escenarios densos con jugadores del mismo equipo que contenían entre 6 y 10 jugadores, V3 registró 328 identidades frente a 615 de V0. Bajo cambios rápidos de dirección a alta velocidad, V3 registró 482 identidades en comparación con 960 de V0. Estas reducciones son coherentes con el uso previsto de pistas semánticas durante la oclusión y las interacciones densas, así como con la asociación guiada por la confianza ante fluctuaciones en la confianza de detección durante movimientos rápidos. Las tendencias de IDP e IDR mostradas en Figura 8C indican que la reducción en identidades no estuvo acompañada de una reducción sustancial ni en precisión de identidad ni en recuperación de identidad. La configuración completa mantuvo valores de IDF1 superiores al 71 % en todos los escenarios desafiantes evaluados, observándose valores más bajos en interacciones densas entre jugadores del mismo equipo y cambios rápidos de dirección a alta velocidad. Estos resultados indican una mayor consistencia en la identidad bajo las condiciones evaluadas, identificando las interacciones densas y el movimiento rápido como las principales fuentes restantes de degradación del rendimiento.
Resultados de la evaluación entre conjuntos de datos:
Se realizó una evaluación entre conjuntos de datos para examinar si el comportamiento de seguimiento observado en SportsMOT podía mantenerse bajo condiciones diferentes de conjuntos de datos. La evaluación incluyó dos conjuntos de datos específicos para deportes, SoccerNet Tracking y TeamTrack, y dos conjuntos de datos generales de MOT, MOT17 y MOT20. El propósito de este experimento fue examinar la transferencia de rendimiento entre diferentes tipos de conjuntos de datos. Los resultados no se utilizaron para afirmar una superioridad directa a nivel de métricas entre conjuntos de datos, ya que los protocolos de anotación, la composición de las escenas, los puntos de vista de las cámaras y las categorías de los objetivos difieren.
Tabla 1 resume los resultados de la evaluación entre conjuntos de datos. En los conjuntos de datos específicos de deportes, JerseyTrack mantuvo valores relativamente estables de MOTA e IDF1 en comparación con la configuración principal de validación de SportsMOT. Esta tendencia sugiere que la estrategia de asociación guiada por confianza y las pistas semánticas relacionadas con las camisetas siguieron siendo efectivas cuando las escenas de seguimiento conservaron características visuales propias de deportes de equipo, incluyendo uniformes repetidos, interacciones densas entre atletas y oclusiones frecuentes. En los conjuntos de datos generales de MOT, el método mantuvo valores competitivos de MOTA y DetA, mientras que el valor de IDF1 fue inferior al observado en los conjuntos de datos específicos de deportes. Este patrón es coherente con la ausencia de pistas de color de camiseta y número de jugador en MOT17 y MOT20, que son utilizadas por el módulo de fusión semántica. Bajo estas condiciones, el componente de asociación guiada por confianza siguió siendo aplicable, mientras que la rama semántica aportó menos información específica de identidad de la que aportó en videos de deportes de equipo. En conjunto, estos resultados indican que JerseyTrack se transfirió más eficazmente a conjuntos de datos que contienen semántica visual específica de deportes que a conjuntos de datos generales de seguimiento de peatones. Por lo tanto, la evaluación entre conjuntos de datos respalda la aplicación prevista del método como un rastreador orientado a deportes, al tiempo que identifica la ausencia de semántica explícita de camisetas como un factor limitante para conjuntos de datos MOT no deportivos.
| Conjunto de datos | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86.8 | 71.3 | 77.9 | 32.1 |
| TeamTrack | 86.2 | 70.7 | 77.3 | 32.8 |
| MOT17 | 84.7 | 69.5 | 76.1 | 33.9 |
| MOT20 | 84.1 | 68.9 | 75.3 | 33.2 |
Tabla 1: Resultados de la evaluación entre conjuntos de datos. Rendimiento del seguimiento de JerseyTrack evaluado en cuatro conjuntos de datos de referencia públicos. Se informan la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la Puntuación F1 de Identidad (IDF1), la Precisión de Detección (DetA) y la velocidad de procesamiento medida en Cuadros por Segundo (FPS). Valores más altos indican un mejor rendimiento para MOTA, IDF1, DetA y FPS.
Robustez bajo condiciones controladas de perturbación
Se realizaron experimentos de perturbación controlada para examinar la estabilidad de JerseyTrack ante perturbaciones visuales y de calidad de detección comunes en videos deportivos. Las perturbaciones evaluadas se agruparon en tres categorías: perturbación de características semánticas, perturbación de caja de detección y perturbación ambiental. Las perturbaciones de características semánticas incluyeron la oclusión del número del jugador, desenfoque de la imagen, degradación de la resolución y colores de camiseta similares. Las perturbaciones de caja de detección incluyeron desplazamiento de la caja delimitadora, fluctuación de la confianza de detección y cajas de detección falsas. Las perturbaciones ambientales incluyeron ruido tipo lluvia, degradación tipo niebla, iluminación intensa e interferencia de sombras. Figura 9 resume el rendimiento del seguimiento bajo estas condiciones de perturbación. Bajo perturbación de características semánticas, el rendimiento del seguimiento disminuyó a medida que la visibilidad del número del jugador y la calidad del recorte empeoraron. Cuando el 40 % de la región del número del jugador estuvo ocluida, MOTA disminuyó 3,2 puntos porcentuales y IDF1 disminuyó 5,3 puntos porcentuales en comparación con la condición sin perturbación, mientras que la precisión de extracción semántica se mantuvo en 86,7 %. Estos resultados indican que las pistas de color de la camiseta y el número del jugador proporcionaron información complementaria cuando una de las pistas semánticas se volvió menos confiable. Bajo perturbación de caja de detección, el método mostró una degradación moderada del rendimiento en lugar de un fallo brusco. Cuando las cajas de detección se desplazaron ±10 píxeles y las puntuaciones de confianza se perturbaron con ruido gaussiano, la disminución en MOTA se mantuvo por debajo de 3 puntos porcentuales, y el aumento en IDs permaneció dentro del 16 %. Esta tendencia es consistente con la estrategia de asociación guiada por confianza, en la cual las detecciones de confianza media y baja se procesan utilizando restricciones adicionales de asociación en lugar de la misma estrategia aplicada a detecciones de alta confianza.

Figura 9. Evaluación de robustez bajo perturbaciones controladas. (A) Cambios en la precisión del seguimiento múltiple de objetos (MOTA), la puntuación F1 de identidad (IDF1) y los cambios de identidad (IDs) con el aumento del oclusión del número de la camiseta. (B) Degradación del rendimiento bajo condiciones representativas de interferencia. (C) Aumento de IDs bajo diferentes tipos de interferencia. (D) Precisión en la extracción semántica de la camiseta bajo las condiciones de perturbación evaluadas. Haga clic aquí para ver una versión más grande de esta figura.
Bajo perturbaciones ambientales, las disminuciones en las métricas principales de seguimiento se mantuvieron por debajo de 5 puntos porcentuales en las condiciones evaluadas, y la precisión de extracción semántica se mantuvo en 87,2 %. El uso de descriptores de color basados en HSV redujo la sensibilidad a los cambios de iluminación, mientras que la rama OCR conservó información utilizable de los números de los jugadores para un subconjunto de recortes de imagen borrosos o degradados. Estos resultados indican que el módulo semántico permaneció utilizable bajo las condiciones de perturbación evaluadas, aunque su fiabilidad siguió dependiendo de la visibilidad de las camisetas y de la calidad de los recortes. En general, los experimentos de perturbación controlada mostraron que JerseyTrack mantuvo un rendimiento de seguimiento medible bajo las perturbaciones semánticas, de calidad de detección y ambientales evaluadas. Estos hallazgos deben interpretarse dentro del rango de perturbaciones probadas. La reidentificación sistemática fuera de la vista, la interferencia grave del fondo y la oclusión completa a largo plazo no se evaluaron por separado en este experimento y se discuten como limitaciones en la sección de Discusión.
Análisis de contribución del módulo y discriminación de características
Se realizó un análisis adicional de la contribución del módulo y la discriminación de características para examinar cómo los dos componentes propuestos afectaron el rendimiento del seguimiento relacionado con la identidad. El análisis de contribución del módulo utilizó las cuatro variantes del modelo definidas en el análisis de ablación, mientras que el análisis de discriminación de características comparó las características tradicionales de Re-ID, características basadas únicamente en el color, características basadas únicamente en el número del jugador y características semánticas del jersey fusionadas. Se utilizó la razón entre la distancia interclase e intraclase para describir la separabilidad de las características, donde valores más altos indican una mayor separación entre identidades diferentes en comparación con la variación dentro de la misma identidad. Tabla 2 resume el análisis de contribución del módulo. En la evaluación general, la contribución estimada de la estrategia de asociación guiada por confianza fue del 41,7 %, la contribución estimada de la fusión semántica del jersey fue del 47,6 % y el 10,7 % restante se atribuyó al uso combinado de ambos componentes. Estos valores indican que ambos componentes contribuyeron a la mejora observada, mientras que la configuración completa se benefició de su uso conjunto en lugar de depender de cada componente por separado. El patrón de contribución varió según el tipo de escena. Bajo oclusión intensa, la contribución estimada de la fusión semántica del jersey aumentó hasta el 69,4 %, lo cual es coherente con la menor fiabilidad de las pistas de movimiento cuando los atletas estaban parcial o temporalmente ocluidos. Bajo movimiento a alta velocidad, la contribución estimada de la asociación guiada por confianza alcanzó el 44,3 %, y la ganancia combinada alcanzó el 20,6 %, lo que indica que la partición por niveles de confianza se volvió más relevante cuando la confianza de detección fluctuaba debido al movimiento rápido o a la incertidumbre en la localización.
| Variante del modelo | Escenario de prueba | MOTA↑ | IDF1↑ | IDs↓ | Contribución del módulo | Ganancia sinérgica |
| V0 (Línea base) | Escena general | 83.5 | 67.2 | 3245 | – | – |
| Escenas con oclusión severa | 77.8 | 61.5 | 3862 | – | – |
| Escena con movimiento de alta velocidad | 77.1 | 62.3 | 3689 | – | – |
| V1 (Asociación guiada por confianza) | Escena general | 86.3 | 70.9 | 2893 | 41.7 | – |
| Escenas con oclusión severa | 80.9 | 65.9 | 3415 | 29.8 | – |
| Escena con movimiento de alta velocidad | 81.4 | 67.9 | 3024 | 44.3 | – |
| V2 (Asociación semántica de camiseta) | Escena general | 85.2 | 71.8 | 2937 | 47.6 | – |
| Escenas con oclusión severa | 82.7 | 72.8 | 2753 | 69.4 | – |
| Escena con movimiento de alta velocidad | 80.1 | 66.8 | 3157 | 35.1 | – |
| V3 (JerseyTrack completo) | Escena general | 88.9 | 74.3 | 2768 | – | 10.7 |
| Escenas con oclusión severa | 84.9 | 75.6 | 2689 | – | 0.8 |
| Escena con movimiento de alta velocidad | 83.6 | 71.5 | 2842 | – | 20.6 |
Tabla 2: Análisis de ablación de las contribuciones de los módulos. Comparación del rendimiento de diferentes variantes del modelo JerseyTrack en escenarios generales, con oclusiones severas y con movimientos de alta velocidad. Se informan la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la Puntuación F1 de Identidad (IDF1) y el número de Cambios de Identidad (IDs), junto con la contribución estimada del módulo y la ganancia sinérgica. Valores más altos indican un mejor rendimiento para MOTA, IDF1, contribución del módulo y ganancia sinérgica, mientras que valores más bajos indican un mejor rendimiento para IDs.
Tabla 3 resume el análisis de discriminación de características. La característica semántica combinada de la camiseta alcanzó una relación de distancia interclase/intraclase de 5,63, en comparación con 1,82 para las características tradicionales de Re-ID, lo que corresponde a una mejora relativa del 209,3 % en la medida de relación de distancia. Las características basadas únicamente en el color y únicamente en el número del jugador también mejoraron la separabilidad de las características en comparación con las características tradicionales de Re-ID, aunque cada indicio individual siguió siendo susceptible a casos específicos de fallo, incluyendo colores de equipo similares, oclusión del número del jugador, desenfoque por movimiento y zonas de la camiseta ilegibles. Entre las representaciones de características evaluadas, la representación semántica combinada logró la mayor separabilidad de características y se correspondió con el valor más alto de IDF1 y el recuento de identidades (ID) más bajo observado en el análisis de ablación. Estos hallazgos respaldan el uso de indicadores semánticos específicos de la camiseta como información complementaria de identidad para el seguimiento de múltiples objetos en deportes (MOT) cuando los atletas tienen apariencias similares y la información de movimiento por sí sola es insuficiente. Estas observaciones están limitadas al entorno SportsMOT evaluado y no deben interpretarse como evidencia de que la semántica de las camisetas resuelve toda ambigüedad de identidad en todos los vídeos deportivos.
| Tipo de característica | Relación de distancia interclase/intraclase | Mejora relativa (%) | IDF1↑ | IDs↓ |
| Características tradicionales de Re-ID | 1.82 | – | 65.7 | 3482 |
| Características de color de equipo | 3.17 | 74.2 | 69.8 | 3125 |
| Características de número de jugador | 3.49 | 91.8 | 70.5 | 3018 |
| Características semánticas combinadas de camiseta | 5.63 | 209.3 | 74.3 | 2768 |
Tabla 3: Análisis de discriminación de diferentes representaciones de características. Comparación de la discriminación de características utilizando características tradicionales de re-identificación (Re-ID), características del color de la camiseta, características del número del jugador y características semánticas fusionadas. Se informa la relación entre la distancia interclase e intraclase, la mejora relativa en la discriminación de características, la puntuación F1 de identidad (IDF1) y el número de cambios de identidad (IDs). Valores más altos indican un mejor desempeño para la relación de distancia, la mejora relativa y la IDF1, mientras que valores más bajos indican un mejor desempeño para los IDs.
Comparación de referencia con métodos existentes de seguimiento de múltiples objetos
Se realizó una comparación de referencia para comparar JerseyTrack con métodos representativos de MOT bajo la misma configuración de validación SportsMOT. Los métodos comparados incluyeron QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT y MOTR. Todos los métodos utilizaron las mismas salidas del detector generadas por el marco del detector que se enumera en la Tabla de Materiales, de modo que la comparación se centrara en el rendimiento de asociación de seguimiento y no en las variaciones del detector. La evaluación utilizó las métricas definidas en el Protocolo Sección 7. Las métricas principales de evaluación incluyeron MOTA, HOTA e IDF1. Las métricas auxiliares incluyeron DetA, AssA, FPs, FNs e IDs. Tabla 4 resume la comparación cuantitativa en la división de validación de SportsMOT, y Figura 10 presenta una comparación visual de la precisión de seguimiento, la velocidad de inferencia y la distribución de HOTA en las escenas deportivas evaluadas. JerseyTrack obtuvo el MOTA más alto entre los métodos comparados, alcanzando el 88,9 %. Este valor fue 1,1 puntos porcentuales más alto que el de Deep OC-SORT (87,8 %) y 2,5 puntos porcentuales más alto que el de ByteTrack (86,4 %). Por lo tanto, bajo la configuración de validación SportsMOT evaluada, JerseyTrack logró la mayor precisión general de seguimiento entre los métodos comparados. En cuanto a HOTA, JerseyTrack alcanzó el 69,9 %, frente al 64,4 % de Deep OC-SORT y al 62,8 % de ByteTrack. Estas diferencias corresponden a mejoras de 5,5 y 7,1 puntos porcentuales, respectivamente, lo que indica un mayor equilibrio entre el rendimiento de detección y asociación bajo la misma configuración de evaluación.
| Método | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | FP↓ | FN↓ | IDs↓ |
| QDTrack | 75.9 | 53.7 | 51.6 | 65.6 | 39.7 | 96,324 | 89,871 | 8,216 |
| DeepSORT | 77.6 | 54.1 | 53.2 | 67.3 | 44 | 76,228 | 86,319 | 6,836 |
| ByteTrack | 86.4 | 62.8 | 67.7 | 73.8 | 50.9 | 33,752 | 78,698 | 4,192 |
| FairMOT | 84.1 | 54.7 | 62.5 | 77.8 | 47.8 | 45,187 | 83,620 | 4,817 |
| Deep OC-SORT | 87.8 | 64.4 | 69.9 | 78.2 | 52.1 | 25,012 | 74,385 | 3,211 |
| MOTR | 82.9 | 57.2 | 58.4 | 68.9 | 46.1 | 54,931 | 85,063 | 5,137 |
| JerseyTrack | 88.9 | 69.9 | 74.3 | 80.2 | 54.3 | 21,953 | 67,160 | 2,768 |
Tabla 4: Comparación de rendimiento de JerseyTrack y métodos representativos de seguimiento múltiple de objetos en el conjunto de validación de SportsMOT. Comparación de JerseyTrack con métodos representativos de seguimiento múltiple de objetos (MOT) en el conjunto de datos de validación de SportsMOT. Las métricas reportadas incluyen la Precisión en el Seguimiento Múltiple de Objetos (MOTA), la Precisión en el Seguimiento de Orden Superior (HOTA), la Puntuación F1 de Identidad (IDF1), la Precisión de Detección (DetA), la Precisión de Asociación (AssA), los Positivos Falsos (FP), los Negativos Falsos (FN) y el número de Cambios de Identidad (IDs). Valores más altos indican un mejor rendimiento para MOTA, HOTA, IDF1, DetA y AssA, mientras que valores más bajos indican un mejor rendimiento para FP, FN e IDs.

Figura 10. Comparación de rendimiento con métodos representativos de seguimiento múltiple de objetos. (A) Comparación de la Precisión en el Seguimiento de Múltiples Objetos (MOTA) y Cuadros Por Segundo (FPS) para JerseyTrack y métodos representativos de seguimiento múltiple de objetos evaluados en el conjunto de datos SportsMOT. (B) Distribución de la Precisión de Seguimiento de Orden Superior (HOTA) entre los métodos de seguimiento evaluados. Haga clic aquí para ver una versión más grande de esta figura.
Para la preservación de la identidad, JerseyTrack alcanzó un IDF1 del 74,3 %, en comparación con el 69,9 % de Deep OC-SORT y el 67,7 % de ByteTrack. JerseyTrack también registró 2.768 identificaciones (IDs), menos que las 3.211 IDs registradas por Deep OC-SORT y las 4.192 IDs registradas por ByteTrack. Estas observaciones son coherentes con los resultados del estudio de ablación presentados en Figura 8 y Tabla 2, en los que la configuración completa de JerseyTrack redujo los cambios de identidad en comparación con las variantes del modelo de referencia. En cuanto a la calidad de detección y asociación, JerseyTrack alcanzó un DetA del 80,2 % y un AssA del 54,3 %. En comparación con Deep OC-SORT, JerseyTrack mejoró el DetA en 2,0 puntos porcentuales y el AssA en 2,2 puntos porcentuales. JerseyTrack también generó menos falsos positivos (FP) y falsos negativos (FN) que los otros métodos comparados indicados en Tabla 4, registrando 21.953 FP y 67.160 FN. En general, la comparación de referencia mostró que JerseyTrack alcanzó los valores más altos para las métricas principales de seguimiento entre los métodos evaluados bajo la configuración de validación SportsMOT. Estos resultados son coherentes con las mejoras observadas en la preservación de la identidad y la estabilidad de la asociación obtenidas mediante la asociación guiada por confianza y la fusión semántica de las camisetas. La comparación se limita a las salidas del detector compartido y la configuración de validación SportsMOT utilizadas en este estudio.
Resultados de sensibilidad de parámetros
Se realizó un análisis de sensibilidad de parámetros para examinar cómo los parámetros clave de implementación afectaban el rendimiento del seguimiento en la configuración de validación SportsMOT. Se evaluaron tres parámetros: el coeficiente de ponderación de la pérdida de OCR (γ), el número de clústeres jerárquicos por nivel de confianza (K) y la tasa de aprendizaje de la red de OCR (η). Tabla 5 resume los valores de MOTA, IDF1, HOTA e IDs obtenidos bajo diferentes configuraciones de parámetros.
| Parámetro | Valor | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| Peso de la pérdida de OCR (γ) | 0.2 | 84.7 | 69.4 | 66.2 | 2,944 |
| 0.4 | 86.3 | 71.5 | 68.2 | 2,893 |
| 0.6 | 87.9 | 73.1 | 68.9 | 2,815 |
| 0.8 (óptimo) | 88.9 | 74.3 | 69.9 | 2,768 |
| 1 | 88.2 | 73.8 | 69.3 | 2,792 |
| Número de agrupaciones de confianza (K) | 2 | 86.7 | 72.1 | 68.5 | 2,876 |
| 3 (óptimo) | 88.9 | 74.3 | 69.9 | 2,768 |
| 4 | 88.1 | 73.6 | 69.7 | 2,803 |
| 5 | 87.3 | 72.8 | 69.2 | 2,851 |
| Tasa de aprendizaje de OCR (η) | 1 × 10⁻⁴ | 85.9 | 70.8 | 67.3 | 2,934 |
| 5 × 10⁻⁴ | 87.6 | 72.7 | 68.7 | 2,832 |
| 1 × 10⁻³ (óptimo) | 88.9 | 74.3 | 69.9 | 2,768 |
| 5 × 10⁻³ | 87.8 | 73.2 | 69 | 2,817 |
| 1 × 10⁻² | 86.5 | 71.6 | 68.7 | 2,889 |
Tabla 5: Análisis de sensibilidad de parámetros. Rendimiento de seguimiento obtenido utilizando diferentes configuraciones de parámetros para JerseyTrack. Se informan la Precisión en el Seguimiento de Múltiples Objetos (MOTA), la Puntuación F1 de Identidad (IDF1), la Precisión de Seguimiento de Orden Superior (HOTA) y el número de Cambios de Identidad (IDs) para distintos valores del coeficiente de ponderación de la pérdida de Reconocimiento Óptico de Caracteres (OCR) (γ), el número de clústeres de confianza (K) y la tasa de aprendizaje de OCR (η). Los valores de los parámetros identificados como óptimos corresponden a las configuraciones utilizadas en los experimentos descritos. Valores más altos indican un mejor rendimiento para MOTA, IDF1 y HOTA, mientras que valores más bajos indican un mejor rendimiento para IDs.
Para el coeficiente de ponderación de la pérdida de OCR (γ), se obtuvo el mejor rendimiento evaluado en γ = 0,8. Bajo esta configuración, JerseyTrack alcanzó un MOTA de 88,9 %, un IDF1 de 74,3 %, un HOTA de 69,9 % y 2.768 identificaciones (IDs). Cuando γ se redujo a 0,2, los indicadores de rendimiento descendieron a 84,7 %, 69,4 % y 66,2 %, respectivamente, mientras que el número de identificaciones aumentó a 2.944. Cuando γ se incrementó a 1,0, las métricas de rendimiento disminuyeron ligeramente en comparación con γ = 0,8, con un MOTA de 88,2 %, un IDF1 de 73,8 %, un HOTA de 69,3 % y 2.792 identificaciones. Estos resultados indican que una supervisión insuficiente del OCR redujo la discriminación de los números de los jugadores, mientras que aumentar la ponderación de la pérdida de OCR más allá del valor óptimo evaluado no mejoró el rendimiento del seguimiento bajo las condiciones probadas.
Para el número de clústeres jerárquicos por nivel de confianza (K), el mejor rendimiento evaluado se obtuvo en K = 3. Esta configuración corresponde a la estrategia de asociación de alta, media y baja confianza descrita en el método. Cuando K = 2, la partición por confianza fue menos detallada, y MOTA, IDF1 y HOTA disminuyeron a 86,7 %, 72,1 % y 68,5 %, respectivamente. Cuando K aumentó a 4 o 5, el rendimiento también disminuyó en comparación con K = 3, lo que sugiere que una partición excesiva dividió las detecciones en grupos de confianza demasiado estrechos y redujo la estabilidad de la estrategia de asociación. Estos resultados respaldan el uso de tres niveles de confianza en la configuración evaluada de JerseyTrack.
Para la tasa de aprendizaje (η) de la red OCR, se obtuvo el mejor rendimiento evaluado en η = 1 × 10-3. Con una tasa de aprendizaje más baja de 1 × 10-4, MOTA, IDF1 y HOTA disminuyeron a 85,9 %, 70,8 % y 67,3 %, respectivamente, mientras que el número de identificaciones (IDs) aumentó a 2.934. Con una tasa de aprendizaje más alta de 1 × 10-2, MOTA, IDF1 y HOTA disminuyeron a 86,5 %, 71,6 % y 68,7 %, respectivamente, mientras que el número de identificaciones aumentó a 2.889. Estos resultados indican que la rama OCR fue sensible a la selección de la tasa de aprendizaje, siendo 1 × 10-3 la que proporcionó el mejor equilibrio entre el reconocimiento del número de jugadores y el rendimiento en la preservación de identidades bajo las condiciones evaluadas.
En general, la Tabla 5 muestra que la combinación de parámetros γ = 0.8, K = 3 y η = 1 × 10-3 produjo los valores más altos evaluados de MOTA, IDF1 y HOTA, junto con el menor número de IDs. El análisis de sensibilidad también mostró que desviaciones moderadas de estos valores de parámetros resultaron en cambios medibles, pero no bruscos, en el rendimiento del seguimiento. Por consiguiente, estos ajustes de parámetros se utilizaron para la comparación de referencia y los experimentos principales de validación de SportsMOT reportados en este estudio.
Disponibilidad de datos
Los resúmenes brutos de evaluación, las salidas finales de seguimiento, los registros del entorno, los archivos de mapeo del conjunto de datos y los archivos de resumen intermedios que respaldan los hallazgos de este estudio están disponibles en un repositorio público en https://doi.org/10.5281/zenodo.21274353. Los conjuntos de datos públicos originales utilizados en este estudio, incluidos SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 y MOT20, están disponibles a través de sus respectivos proveedores y no se redistribuyen en el repositorio.