El seguimiento de múltiples objetos (MOT) proporciona una localización continua de los objetos y el mantenimiento de sus identidades en secuencias de video, y permite la extracción de trayectorias de atletas, el análisis táctico y el análisis estadístico automatizado en aplicaciones de video deportivo1,2,3. La información visual confiable también está relacionada con la toma de decisiones específica del deporte y la evaluación del rendimiento en la ciencia del deporte, lo que resalta aún más el valor de los datos estables de movimiento derivados de video para análisis deportivos posteriores4. En escenarios deportivos, la fiabilidad de los datos tácticos depende de la continuidad de las trayectorias de seguimiento y de la consistencia de las identidades de los objetivos.
En comparación con los escenarios generales de seguimiento de múltiples objetos (MOT), los videos deportivos contienen cambios rápidos de dirección, paradas bruscas, saltos, interacciones densas y oclusiones frecuentes. Estos factores provocan fluctuaciones sustanciales en la confianza de las cajas de detección y aumentan la frecuencia de detecciones con baja confianza, lo que puede interrumpir la asociación de trayectorias5,6. Los uniformes de equipo similares reducen aún más la capacidad discriminativa de las características generales de apariencia y aumentan la confusión de identidad entre compañeros de equipo visualmente parecidos7,8. Cuando la oclusión y la similitud en la apariencia ocurren en la misma secuencia, la confianza en la detección disminuye y la información sobre la apariencia del objetivo se vuelve incompleta, lo que incrementa la dificultad para asociar trayectorias y mantener la identidad9,10. En el seguimiento de múltiples objetos, la re-identificación (Re-ID) se refiere al proceso de asociar la misma identidad de un objetivo a través de cuadros, períodos de oclusión o casos de reingreso, utilizando evidencia visual relacionada con la identidad. En videos de deportes de equipo, las señales generales de Re-ID pueden debilitarse porque los atletas del mismo equipo suelen compartir uniformes y apariencias corporales similares. La revisión de la literatura técnica indica que la fragmentación de trayectorias y la confusión de identidad en el MOT deportivo se abordan comúnmente mediante dos enfoques complementarios: la utilización de la confianza en la detección y el realce de las señales de identidad. JerseyTrack se sitúa en la intersección de estos enfoques al regular el uso de señales semánticas del uniforme según la calidad de la detección, en lugar de aplicar la información de color y número del jugador de forma uniforme a todas las detecciones.
Este estudio presenta JerseyTrack, un método de seguimiento múltiple de objetos deportivos guiado por la confianza y basado en la fusión semántica de camisetas. El método está diseñado para vídeos de deportes de equipo en los que los atletas llevan camisetas visibles y los resultados de detección proporcionan cajas delimitadoras con puntuaciones de confianza. JerseyTrack combina cuatro componentes principales: detección de atletas, partición por niveles de confianza, extracción de características semánticas de la camiseta y asociación interfotograma en cascada. La confianza en la detección se utiliza para particionar de forma adaptativa las detecciones en grupos de alta, media y baja confianza, que se procesan mediante estrategias de asociación diferentes. Las detecciones de alta confianza se asocian principalmente mediante información de movimiento, mientras que las detecciones de confianza media y baja incorporan además información sobre el color de la camiseta y el número del jugador para mejorar el mantenimiento de la identidad cuando la evidencia visual es débil. El método está destinado a tareas de análisis de vídeos deportivos que requieren trayectorias estables de los atletas, como el análisis táctico y la interpretación del comportamiento de los jugadores.
El enfoque propuesto también presenta limitaciones operativas. La extracción semántica de la camiseta puede verse afectada por oclusión severa, desenfoque por movimiento, baja resolución de la imagen, poses anormales de la camiseta o números de jugador invisibles. En estos casos, las pistas semánticas basadas en la camiseta pueden volverse incompletas, y el proceso de asociación depende más fuertemente de la coherencia del movimiento y de la verificación mediante múltiples fotogramas. Por lo tanto, las afirmaciones sobre el rendimiento en este estudio se limitan a los conjuntos de datos evaluados y a las condiciones experimentales. Los experimentos en el conjunto de datos SportsMOT muestran que JerseyTrack mejora las métricas de seguimiento evaluadas y reduce los eventos de cambio de identidad bajo las condiciones de seguimiento deportivo evaluadas. La principal dificultad del MOT en videos deportivos radica en mantener la continuidad de la trayectoria y la coherencia de la identidad ante movimientos rápidos, oclusión y similitud en la apariencia. Los estudios existentes relacionados con JerseyTrack pueden clasificarse ampliamente en dos direcciones de investigación: el uso de la confianza en la detección para la asociación de trayectorias y la mejora de las pistas de identidad mediante características semánticas específicas de los deportes.
La confianza de detección se ha utilizado ampliamente para estimar la fiabilidad de los cuadros de detección y para guiar la asociación de trayectorias en el seguimiento de múltiples objetos (MOT). Los métodos iniciales de seguimiento solían tratar la confianza como un criterio binario de filtrado, en el que se eliminaban las detecciones por debajo de un umbral fijo para reducir los falsos positivos11,12. Esta estrategia reduce las detecciones ruidosas, pero también puede descartar objetivos reales en condiciones de oclusión, movimiento rápido o baja calidad de imagen, lo que provoca fragmentación de trayectorias13,14,15. Estrategias de filtrado similares han demostrado también que los umbrales fijos de confianza son sensibles a las variaciones de la escena y a la calidad de la detección16,17. Para mejorar el uso de detecciones con baja confianza, ByteTrack introdujo una estrategia de asociación que conserva los cuadros de baja confianza como objetivos candidatos para una coincidencia secundaria y los vincula con trayectorias existentes mediante la similitud de movimiento y el historial de trayectorias18. McByte amplía aún más la asociación en el MOT deportivo incorporando máscaras de segmentación propagadas temporalmente como una pista de asociación, mejorando la robustez en condiciones de movimiento rápido, oclusión y desplazamiento de cámara sin necesidad de entrenamiento adicional por video19. Estudios relacionados también han ajustado el uso de detecciones con baja confianza para conservar objetivos débiles pero potencialmente válidos durante la asociación20,21,22. Las estrategias de asociación adaptativas según la confianza refinaron posteriormente los criterios de coincidencia según la consistencia del movimiento y la fiabilidad de la detección23,24,25. También se han utilizado métodos de refinamiento de trayectorias basados en regresión de cuadros de detección y optimización de suavidad de trayectorias para reducir la fragmentación de trayectorias26,27,28. Estrategias adicionales de refinamiento proporcionan apoyo complementario para mantener la continuidad de las trayectorias en condiciones de movimiento complejas29. El flujo temporal coherente de objetos modela aún más la consistencia temporal a nivel de objeto entre cuadros, proporcionando otro enfoque orientado a la asociación para reducir la interrupción de trayectorias en escenarios complejos de MOT30. Los métodos de fusión de rastreadores también aprenden de las salidas de múltiples rastreadores y utilizan estrategias de selección o fusión basadas en aprendizaje para mejorar la robustez del seguimiento en diferentes referencias de MOT31. En conjunto, estos estudios indican que la asociación sensible a la confianza ayuda a recuperar trayectorias interrumpidas; sin embargo, la confianza y las pistas de movimiento proporcionan información limitada sobre la identidad cuando los jugadores del mismo equipo tienen apariencias visuales similares. Aunque estos métodos alivian eficazmente la fragmentación de trayectorias en escenarios generales, enfrentan limitaciones inherentes en contextos deportivos porque los jugadores del mismo equipo a menudo tienen apariencias visuales muy similares, y depender únicamente de la confianza y la información de movimiento no proporciona una base suficiente para diferenciar identidades32,33,34. Incluso cuando se recuperan eficazmente cuadros con baja confianza, la similitud de características aún puede provocar intercambios de identidad, dificultando el cumplimiento de los estrictos requisitos de consistencia de identidad en el análisis deportivo.
Las señales específicas de identidad deportiva también se han utilizado para mejorar la discriminación de identidad en el seguimiento de atletas. La información semántica de las camisetas, como el color del equipo y el número del jugador, proporciona señales de identidad más directamente relacionadas con escenarios deportivos que los embeddings generales de apariencia35,36,37. El color de la camiseta se ha empleado para facilitar la discriminación a nivel de equipo y reducir la confusión entre equipos, mientras que el reconocimiento del número del jugador ofrece una señal de identidad más precisa cuando la zona del número es visible y legible38,39. Estudios previos sobre seguimiento deportivo han incorporado características visuales específicas del dominio y el reconocimiento del color de la camiseta para mejorar la asociación de jugadores en condiciones deportivas concurridas40,41. Trabajos relacionados sobre el reconocimiento del número de la camiseta y datos sintéticos de números respaldan adicionalmente la modelización de identidad en condiciones de baja resolución o con oclusión parcial42,43. Estos estudios indican que la semántica de las camisetas puede fortalecer la representación de identidad en el seguimiento de múltiples objetos en deportes (sports MOT). Sin embargo, la mayoría de los métodos de seguimiento mejorados con semántica no modelan adecuadamente la relación entre la confianza en la detección y la calidad de la característica semántica. Las detecciones con alta confianza ya pueden contener información espacial y de apariencia confiable, lo que hace que la extracción semántica repetida sea menos eficiente. Las detecciones con baja confianza suelen verse afectadas por oclusión, desenfoque, recorte o baja resolución, lo que reduce la fiabilidad de las señales de color y del número del jugador. Esta limitación motiva un diseño de asociación guiado por la confianza, en el cual la semántica de la camiseta se introduce según la calidad de la detección, en lugar de aplicarse uniformemente a todas las detecciones. Los estudios revisados muestran que la asociación sensible a la confianza y la modelización semántica de la camiseta abordan aspectos diferentes del seguimiento de múltiples objetos en deportes. Las estrategias basadas en la confianza determinan principalmente si una detección debe participar en la asociación y cómo debe emparejarse con trayectorias existentes, mientras que las estrategias semánticas de la camiseta mejoran principalmente la representación de identidad mediante señales específicas del deporte. No obstante, estos dos mecanismos suelen diseñarse como componentes separados. Como resultado, las señales semánticas no siempre se ajustan según la calidad de la detección, y los niveles de confianza no regulan directamente el uso de la información de color y del número del jugador durante la asociación. Esta separación limita el manejo conjunto de la fragmentación de trayectorias y la confusión de identidad en vídeos de deportes de equipo. El vacío investigador restante consiste en vincular la evaluación de la calidad de la confianza en la detección con la asociación semántica de la camiseta dentro del mismo flujo de trabajo de seguimiento.