Article de méthode

Une méthode de suivi multi-objets guidée par la confiance pour les vidéos sportives utilisant la fusion sémantique des maillots

21 vues

DOI :

10.3791/71557

14 août 2026

Dans cet article

Résumé

Ce protocole décrit un flux de travail de suivi multi-objet guidé par la confiance pour les vidéos sportives, qui intègre les informations sur la couleur du maillot et le numéro du joueur afin d'améliorer l'association des trajectoires et la cohérence identitaire en cas de fluctuations de confiance, d'occultations ou d'apparences visuellement similaires entre les athlètes.

Résumé

Le suivi multi-objet (MOT) dans les vidéos sportives fournit des informations de trajectoire pour l'analyse tactique, l'interprétation du comportement des joueurs et l'analyse statistique automatisée. Cependant, les scénarios sportifs impliquent fréquemment des changements brusques de direction, des arrêts soudains, des occultations fréquentes et des coéquipiers visuellement similaires, ce qui entraîne des fluctuations de la confiance en la détection et des confusions d'identité lors de l'association entre trames. Pour relever ces défis, cette étude présente JerseyTrack, une méthode de suivi multi-objet en contexte sportif guidée par la confiance et fondée sur la fusion sémantique des maillots. Le flux de travail partitionne de manière adaptative les boîtes de détection en intervalles de haute, moyenne et faible confiance selon la distribution de confiance de chaque trame. Les détections à haute confiance sont associées principalement selon la similarité de mouvement, tandis que les détections à confiance moyenne et faible intègrent en outre des caractéristiques de couleur du maillot et du numéro du joueur extraites par regroupement chromatique et à l’aide d’un modèle léger de reconnaissance optique de caractères (OCR). Ces caractéristiques sémantiques sont fusionnées avec les informations de mouvement lors de l’appariement complémentaire afin d’améliorer la continuité des trajectoires et la cohérence des identités. La méthode a été évaluée sur le jeu de données SportsMOT. JerseyTrack a atteint une précision de suivi multi-objet (MOTA) de 88,9 %, un score F1 d’identité (IDF1) de 74,3 % et une précision de suivi d’ordre supérieur (HOTA) de 69,9 %, démontrant ainsi une performance améliorée dans le contexte de suivi sportif évalué. Ce protocole fournit un flux de travail reproductible permettant d’intégrer l’association guidée par la confiance avec les informations sémantiques des maillots afin d’améliorer le suivi multi-objet dans les vidéos sportives.

Introduction

Le suivi multi-objets (MOT) permet une localisation continue des objets et le maintien de leur identité dans des séquences vidéo, et soutient l'extraction des trajectoires des athlètes, l'analyse tactique et l'analyse statistique automatisée dans les applications vidéo sportives1,2,3. Des informations visuelles fiables sont également liées à la prise de décision propre à chaque sport et à l'évaluation de la performance en sciences du sport, soulignant davantage la valeur des données de mouvement stables issues de vidéos pour les analyses sportives ultérieures4. Dans les scénarios sportifs, la fiabilité des données tactiques dépend de la continuité des trajectoires de suivi et de la cohérence des identités des cibles.

Contrairement aux scénarios généraux de suivi multi-objets (MOT), les vidéos sportives comportent des changements brusques de direction, des arrêts soudains, des sauts, des interactions denses et des occultations fréquentes. Ces facteurs provoquent des fluctuations importantes de la confiance associée aux boîtes de détection et augmentent la fréquence des détections à faible confiance, ce qui peut interrompre l'association des trajectoires5,6. Les maillots d'équipe uniformes réduisent davantage la capacité discriminante des caractéristiques d'apparence générales et augmentent la confusion d'identité entre des coéquipiers visuellement similaires7,8. Lorsque l'occultation et la similarité d'apparence se produisent dans la même séquence, la confiance de détection diminue et les informations sur l'apparence de la cible deviennent incomplètes, ce qui accroît la difficulté d'association des trajectoires et de maintien de l'identité9,10. En suivi multi-objets, la ré-identification (Re-ID) désigne le processus d'association de la même identité de cible à travers les images, les périodes d'occultation ou les cas de réapparition, en utilisant des indices visuels liés à l'identité. Dans les vidéos de sports collectifs, les indices généraux de Re-ID peuvent être affaiblis car les athlètes d'une même équipe partagent souvent des tenues et des morphologies corporelles similaires. L'examen de la littérature technique indique que la fragmentation des trajectoires et la confusion d'identité dans le suivi multi-objets appliqué aux sports sont généralement abordées selon deux approches complémentaires : l'exploitation de la confiance de détection et le renforcement des indices d'identité. JerseyTrack s'inscrit à l'intersection de ces deux approches en régulant l'utilisation des indices sémantiques liés au maillot selon la qualité de la détection, plutôt qu'en appliquant uniformément les informations de couleur et du numéro du joueur à toutes les détections.

Cette étude présente JerseyTrack, une méthode de suivi multi-objectif (MOT) dans les sports assistée par la confiance et fondée sur la fusion sémantique des maillots. La méthode est conçue pour des vidéos de sports collectifs dans lesquelles les athlètes portent des maillots visibles et où les résultats de détection fournissent des boîtes englobantes accompagnées de scores de confiance. JerseyTrack combine quatre composants principaux : la détection des athlètes, la partition selon le niveau de confiance, l'extraction de caractéristiques sémantiques des maillots et l'association inter-images en cascade. La confiance associée à la détection est utilisée pour partitionner de manière adaptative les détections en groupes à haute, moyenne et faible confiance, qui sont ensuite traités selon des stratégies d'association différentes. Les détections à haute confiance sont principalement associées à l'aide d'informations de mouvement, tandis que les détections à confiance moyenne ou faible intègrent en outre des informations sur la couleur du maillot et le numéro du joueur afin d'améliorer le maintien de l'identité lorsque les indices visuels sont faibles. Cette méthode est destinée à des tâches d'analyse de vidéos sportives nécessitant des trajectoires d'athlètes stables, telles que l'analyse tactique ou l'interprétation du comportement des joueurs.

L'approche proposée présente également des limitations opérationnelles. L'extraction sémantique du maillot peut être affectée par une occultation sévère, un flou de mouvement, une faible résolution d'image, des poses anormales du maillot ou des numéros de joueur invisibles. Dans ces cas, les indices sémantiques basés sur le maillot peuvent devenir incomplets, et le processus d'association dépend davantage de la cohérence du mouvement et de la vérification multi-image. Par conséquent, les affirmations sur les performances dans cette étude sont limitées aux jeux de données évalués et aux conditions expérimentales testées. Des expériences menées sur le jeu de données SportsMOT montrent que JerseyTrack améliore les métriques de suivi évaluées et réduit les changements d'identité dans les conditions de suivi sportif testées. La principale difficulté du suivi multi-objet (MOT) dans les vidéos sportives réside dans le maintien de la continuité des trajectoires et de la cohérence des identités en présence de mouvements rapides, d'occultations et de similitudes d'apparence. Les études existantes liées à JerseyTrack peuvent être regroupées en deux grandes directions de recherche : l'utilisation de la confiance de détection pour l'association de trajectoires et le renforcement des indices d'identité grâce à des caractéristiques sémantiques spécifiques aux sports.

La confiance de détection est largement utilisée pour estimer la fiabilité des boîtes de détection et guider l'association des trajectoires en suivi multi-objets (MOT). Les premières méthodes de suivi traitaient généralement la confiance comme un critère binaire de filtrage, dans lequel les détections situées en dessous d'un seuil fixe étaient supprimées afin de réduire les faux positifs11,12. Cette stratégie permet de réduire les détections bruitées, mais peut également éliminer des cibles réelles en cas d'occultation, de mouvement rapide ou de faible qualité d'image, entraînant une fragmentation des trajectoires13,14,15. Des stratégies de filtrage similaires ont également montré que les seuils de confiance fixes sont sensibles aux variations de scène et à la qualité des détections16,17. Pour améliorer l'utilisation des détections à faible confiance, ByteTrack a introduit une stratégie d'association qui conserve les boîtes à faible confiance comme cibles candidates pour une correspondance secondaire, en les reliant aux trajectoires existantes grâce à la similarité de mouvement et à l'historique des trajectoires18. McByte étend davantage l'association en MOT sportif en intégrant des masques de segmentation propagés temporellement comme indice d'association, améliorant ainsi la robustesse en cas de mouvement rapide, d'occultation ou de changement de caméra, sans entraînement supplémentaire par vidéo19. D'autres études ont également ajusté l'utilisation des détections à faible confiance afin de conserver des cibles faibles mais potentiellement valides durant l'association20,21,22. Les stratégies d'association adaptatives selon la confiance ont ensuite affiné les critères d'appariement en fonction de la cohérence du mouvement et de la fiabilité des détections23,24,25. Des méthodes d'affinement des trajectoires basées sur la régression des boîtes de détection et l'optimisation de la régularité des trajectoires ont également été utilisées pour réduire la fragmentation des trajectoires26,27,28. D'autres stratégies d'affinement apportent un soutien complémentaire pour maintenir la continuité des trajectoires dans des conditions de mouvement complexes29. Le flux temporellement cohérent des objets modélise davantage la cohérence temporelle au niveau objet entre les images, offrant ainsi une autre approche orientée association pour réduire les interruptions de trajectoire dans des scénarios MOT complexes30. Les méthodes de fusion de traqueurs s'appuient également sur les sorties de plusieurs traqueurs et utilisent des stratégies de sélection ou de fusion apprises afin d'améliorer la robustesse du suivi sur différents benchmarks MOT31. Collectivement, ces études indiquent que l'association tenant compte de la confiance aide à récupérer les trajectoires interrompues ; toutefois, la confiance et les indices de mouvement fournissent des informations d'identité limitées lorsque les joueurs d'une même équipe ont des apparences visuelles similaires. Bien que ces méthodes atténuent efficacement la fragmentation des trajectoires dans des scénarios généraux, elles présentent des limitations inhérentes dans les contextes sportifs, car les joueurs d'une même équipe ont souvent des apparences visuelles très proches, et le fait de s'appuyer uniquement sur la confiance et les informations de mouvement ne permet pas de différencier suffisamment les identités32,33,34. Même lorsque les boîtes à faible confiance sont correctement rappelées, la similarité des caractéristiques peut encore entraîner des inversions d'identité, rendant difficile le respect des exigences strictes de cohérence identitaire en analyse sportive.

Des indices d'identité spécifiques aux sports ont également été utilisés pour améliorer la discrimination d'identité dans le suivi des athlètes. Les informations sémantiques du maillot, telles que la couleur de l'équipe et le numéro du joueur, fournissent des indices d'identité plus directement liés aux scénarios sportifs que les intégrations d'apparence générale35,36,37. La couleur du maillot a été utilisée pour faciliter la discrimination au niveau de l'équipe et réduire la confusion entre équipes, tandis que la reconnaissance du numéro du joueur offre un indice d'identité plus précis lorsque la zone du numéro est visible et lisible38,39. Des études existantes sur le suivi en sport ont intégré des caractéristiques visuelles spécifiques au domaine et la reconnaissance de la couleur du maillot afin d'améliorer l'association des joueurs dans des conditions sportives encombrées40,41. Des travaux connexes sur la reconnaissance du numéro du maillot et l'utilisation de données numériques synthétiques soutiennent davantage la modélisation de l'identité dans des conditions de faible résolution ou d'occultation partielle42,43. Ces études indiquent que la sémantique du maillot peut renforcer la représentation de l'identité dans le suivi multi-objets en sport (sports MOT). Toutefois, la plupart des méthodes de suivi améliorées par la sémantique ne modélisent pas suffisamment la relation entre la confiance de détection et la qualité des caractéristiques sémantiques. Les détections à haute confiance contiennent souvent déjà des informations spatiales et d'apparence fiables, rendant l'extraction sémantique répétée moins efficace. Les détections à faible confiance souffrent fréquemment d'occultation, de flou, de troncature ou de faible résolution, ce qui réduit la fiabilité des indices de couleur et de numéro de joueur. Cette limitation motive une conception d'association guidée par la confiance, dans laquelle la sémantique du maillot est introduite en fonction de la qualité de la détection plutôt que d'être appliquée uniformément à toutes les détections. Les études examinées montrent que l'association tenant compte de la confiance et la modélisation sémantique du maillot abordent des aspects différents du suivi multi-objets en sport. Les stratégies fondées sur la confiance déterminent principalement si une détection doit participer à l'association et comment elle doit être appariée avec les trajectoires existantes, tandis que les stratégies sémantiques du maillot renforcent principalement la représentation de l'identité à l'aide d'indices spécifiques au sport. Toutefois, ces deux mécanismes sont souvent conçus comme des composants séparés. En conséquence, les indices sémantiques ne sont pas toujours ajustés en fonction de la qualité de détection, et les niveaux de confiance ne régulent pas directement l'utilisation des informations de couleur et de numéro de joueur durant l'association. Cette séparation limite la gestion conjointe de la fragmentation des trajectoires et de la confusion d'identité dans les vidéos de sports collectifs. Le manque de recherche restant réside dans la liaison entre l'évaluation de la qualité de la confiance de détection et l'association sémantique du maillot au sein d'un même flux de travail de suivi.

Protocole

Cette étude a impliqué une analyse secondaire de jeux de données vidéo de référence accessibles au public, à savoir SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 et MOT20. Aucun participant n’a été recruté, aucune intervention n’a été réalisée et aucune nouvelle donnée relative à des sujets humains n’a été collectée. Une approbation par un comité d’éthique n’était pas requise pour cette étude selon les exigences institutionnelles applicables de l’université Bangkok Thonburi.

Le protocole suivant décrit le flux de travail utilisé pour reproduire JerseyTrack, depuis la préparation des données jusqu'à l'évaluation du suivi. Ce flux de travail comprend la préparation du jeu de données, la préparation du détecteur, l'extraction sémantique des maillots, le partitionnement par niveau de confiance, l'association guidée par la confiance, l'inférence de suivi et l'évaluation des performances, comme résumé dans la Figure 1. Les logiciels, jeux de données et ressources matérielles requis sont listés dans le Tableau des matériaux.

figure-protocol-1
Figure 1. Flux global de la méthode JerseyTrack. Le flux de travail comprend l'extraction de caractéristiques sémantiques du maillot, l'appariement initial des objets, un appariement complémentaire guidé par la confiance et la fusion de caractéristiques. Les caractéristiques de couleur d'équipe et de numéro de joueur sont extraites des régions détectées des athlètes et intégrées au processus d'association afin d'améliorer la correspondance des trajectoires dans des conditions de détection incertaines. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

1. Préparer les jeux de données et la structure des répertoires

  1. Téléchargez les jeux de données de référence publics répertoriés dans le Tableau des matériaux. Utilisez SportsMOT comme jeu de données principal pour la préparation du détecteur et l'évaluation du suivi. Conservez TeamTrack, SoccerNet Tracking, MOT17 et MOT20 pour l'évaluation inter-jeux de données.
  2. Stockez tous les jeux de données dans un répertoire de projet unifié. Assurez-vous que le détecteur, le module d'extraction sémantique, le module de suivi et l'outil d'évaluation utilisent des identifiants de séquence identiques.
  3. Convertissez les annotations officielles de SportsMOT au format d'entraînement du détecteur à l'aide du script de préparation des données utilisé dans cette étude. Exécutez la commande suivante :
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Le script de préparation des données (scripts/prepare_data.py) est disponible dans le dépôt de code source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Les dépendances logicielles requises sont spécifiées dans environment.yml, notamment Python 3.12, PyTorch 2.11.0 et OpenCV 4.10 ou ultérieur. Configurez l'environnement logiciel à l'aide de la commande suivante : conda env create -f environment.yml. Exécutez le script de préparation des données à l'aide de la commande suivante : python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Vérifiez que la conversion génère le fichier de configuration pour l'entraînement du détecteur : data\processed\SportsMOT_yolo\data.yaml et le manifeste de conversion : data\processed\SportsMOT_yolo\conversion_manifest.csv.
    NOTE : Dans cette étude, le jeu de données d'entraînement et de validation SportsMOT converti comprenait 90 séquences, 55 544 images et 608 152 objets annotés.
  6. Examinez des séquences représentatives afin de vérifier que l'ordre des images, les coordonnées des boîtes englobantes et les étiquettes d'identité restent cohérents avec les annotations initiales du jeu de référence.
  7. Conservez les fichiers d'annotations convertis sans modification durant toute la préparation du détecteur, l'inférence de suivi et l'évaluation, afin que toutes les méthodes utilisent la même partition du jeu de données et le même protocole d'évaluation.
    NOTE : Le résultat attendu de cette section est un répertoire standardisé de formation du détecteur SportsMOT contenant les annotations converties, le manifeste de conversion et les fichiers de répartition du jeu de données nécessaires à la préparation du détecteur et à l'évaluation du suivi.

2. Préparer les sorties du détecteur

  1. Ajustez finement le détecteur d'objets en utilisant le jeu d'entraînement SportsMOT préparé. Optimisez le détecteur à l'aide de la perte de classification et de la perte de régression de la boîte englobante définies dans l'équation 1. Utilisez la résolution d'entrée du détecteur, la taille du lot, le taux d'apprentissage, le nombre d'époques d'entraînement et les autres paramètres d'entraînement indiqués dans la configuration de mise en œuvre et dans le Tableau des matériaux
    Ldet = Lcls + Lbox   (1)
    Ici, Ldet  désigne la perte totale du détecteur, Lcls  désigne la perte de classification, Lbox  la perte de régression de la boîte englobante.
    NOTE : Le point de contrôle du détecteur utilisé dans les expériences principales (identifiant interne e3) a été entraîné à l'aide du cadre Ultralytics YOLO avec la configuration du jeu de données SportsMOT au format YOLO (data/processed/SportsMOT_yolo/data.yaml). Exécutez l'entraînement du détecteur à l'aide de la commande suivante : yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Après l'entraînement, utilisez le point de contrôle ayant donné les meilleures performances pour générer les sorties du détecteur pour les séquences de validation à l'aide de la commande suivante : python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Enregistrez le point de contrôle du détecteur entraîné, le fichier de métadonnées correspondant et le journal d'entraînement après l'entraînement.
    NOTE : Dans cette étude, le point de contrôle du détecteur utilisé pour les expériences formelles a été enregistré sous :
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Le fichier de métadonnées correspondant a été enregistré sous : outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Le répertoire de sortie du détecteur utilisé pour les expériences principales de validation SportsMOT était : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Exécutez le détecteur entraîné sur chaque séquence de validation afin de générer les boîtes englobantes des athlètes et les scores de confiance. Exportez un fichier de détection par séquence contenant l'indice de trame, les coordonnées de la boîte englobante, la confiance de détection et l'étiquette de classe.
    NOTE : Dans l'exécution de validation SportsMOT utilisée pour les expériences principales, un seuil de confiance de 0,05 a produit 343 990 détections d'athlètes.
  4. Inspectez le répertoire de sortie du détecteur avant l'inférence de suivi. Vérifiez que chaque séquence possède un fichier de détection correspondant, que les indices de trame correspondent à la séquence d'images préparée, et que chaque enregistrement de détection contient un score de confiance.
    NOTE : Le résultat attendu de cette section est un répertoire de sortie du détecteur complet, qui servira d'entrée pour l'extraction sémantique des maillots, la partition par niveau de confiance et l'association de suivi.

3. Extraire les caractéristiques sémantiques du maillot

  1. Utilisez les fichiers de sortie du détecteur pour recadrer les régions des athlètes dans chaque image vidéo. Enregistrez chaque image recadrée d'athlète avec son identifiant de séquence, son index d'image et son index de détection. Excluez les recadrages non valides dont le contenu image est manquant ou dont les boîtes englobantes s'étendent au-delà des limites de l'image. Conservez la liaison entre chaque nom de fichier recadré et son enregistrement de détection d'origine afin que les caractéristiques sémantiques extraites puissent être associées à la détection correspondante lors de l'association de suivi.
  2. Extrayez les caractéristiques de couleur des maillots à partir des images recadrées des athlètes à l'aide du script d'extraction sémantique utilisé dans cette étude.
    NOTE : Les scripts d'extraction de caractéristiques sémantiques (scripts/extract_fast_color_semantics.py et scripts/formal_extract_semantics.py) sont disponibles dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Aucun fichier de configuration distinct n'est requis ; tous les paramètres d'exécution sont fournis via les arguments en ligne de commande.
    Générez des descripteurs de couleur de maillot à l'aide de la commande suivante : python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Générez les caractéristiques sémantiques du numéro de joueur à l'aide du modèle OCR avec la commande suivante : python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Les descripteurs de couleur de maillot générés et les sorties de probabilité du numéro de joueur sont associés par identifiant de séquence et combinés en fichiers de caractéristiques sémantiques utilisés lors de l'association de suivi.
  3. Convertissez chaque image recadrée d'athlète dans l'espace colorimétrique Teinte, Saturation, Valeur (HSV). Extrayez les pixels de premier plan de la région du maillot et résumez la couleur dominante du maillot à l'aide d'un regroupement par K-moyennes avec K = 3. Normalisez le descripteur de couleur obtenu à l'aide d'une normalisation L2 avant la comparaison des caractéristiques.
  4. Entraînez la branche de reconnaissance du numéro de joueur à l'aide d'images recadrées d'athlètes avec une taille d'entrée de 128 × 64 pixels. Générez des pseudo-étiquettes de numéro de joueur à l'aide de la procédure d'étiquetage faiblement supervisée utilisée dans cette étude. Excluez les recadrages dont la zone de numéro de joueur est invisible, illisible, fortement occultée ou présente une faible confiance, du calcul de la perte OCR.
  5. Optimisez la branche OCR à l'aide de la perte d'entropie croisée définie dans l'Équation 2.
    figure-protocol-2 (2)
    Ici, Locr désigne la perte OCR, yi désigne l'étiquette supervisée du numéro de joueur, et figure-protocol-3 désigne la catégorie prédite du numéro de joueur.
  6. Optimisez le module d'extraction de caractéristiques sémantiques à l'aide de l'optimiseur adaptatif, du taux d'apprentissage, de la taille du lot, de la décroissance du poids et de la durée d'entraînement indiqués dans le Tableau des Matériaux. Combinez la perte du détecteur et la perte OCR à l'aide de l'objectif total d'entraînement défini dans l'Équation 3.
    Ltotal = Ldet + γLocr   (3)
    Ici, Ltotaldésigne la perte totale d'entraînement, Ldet désigne la perte du détecteur définie dans l'Équation 1, Locr désigne la perte OCR définie dans l'Équation 2, et désigne le coefficient de pondération défini par l'utilisateur pour la perte OCR.
  7. Appliquez la branche OCR entraînée à chaque image recadrée d'athlète. Enregistrez la catégorie prédite du numéro de joueur ou le vecteur de probabilité pour chaque recadrage. Si le numéro du joueur n'est pas visible ou si la confiance OCR est inférieure au seuil défini dans l'implémentation, enregistrez la caractéristique du numéro de joueur comme indisponible plutôt que de forcer une prédiction.
  8. Combinez le descripteur de couleur du maillot et la sortie du numéro de joueur dans le fichier de caractéristiques sémantiques utilisé par le module de suivi.
    NOTE : Dans le principal test de validation SportsMOT, le script d'extraction sémantique a traité 343 990 détections sans images manquantes ni recadrages invalides. Dans le package de révision actuel, le résumé d'extraction sémantique a indiqué une précision globale d'extraction sémantique couleur-et-OCR de 86,7 % dans le contexte SportsMOT évalué. Le résultat attendu de cette section est un fichier de caractéristiques sémantiques dans lequel chaque enregistrement de détection valide est associé à un descripteur de couleur de maillot, à une sortie de numéro de joueur lorsqu'elle est disponible, et à un indicateur signalant si des informations sémantiques sont disponibles pour l'association de suivi.

4. Niveaux de confiance pour la détection des partitions

  1. Charger le fichier de sortie du détecteur pour chaque séquence vidéo. Collecter les scores de confiance de toutes les détections d'athlètes dans chaque image.
  2. Partitionner les scores de confiance au niveau des images en intervalles de confiance élevée, moyenne et faible à l'aide du regroupement par K-moyennes avec K = 3, selon le flux de travail d'association guidé par la confiance illustré dans la Figure 2. Déterminer les seuils de confiance adaptatifs en minimisant la variance intra-groupe selon la Équation 4.
    figure-protocol-4  (4)
    Ici, sd désigne le score de confiance de la détection d ; D1, D2 et D3 désignent respectivement les intervalles de confiance élevée, moyenne et faible ; μ1, μ2 et μ3 désignent les scores moyens de confiance des trois intervalles ; et τ1 et τ2 désignent les seuils de confiance adaptatifs obtenus à partir des résultats du regroupement par K-moyennes.
    REMARQUE : Le script de partitionnement de la confiance (scripts/formal_partition_confidence.py) est disponible dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Le module de partitionnement utilise une procédure de regroupement unidimensionnel basée sur NumPy avec K = 3. Aucun fichier de configuration distinct n'est requis ; le répertoire d'entrée, le répertoire de sortie et le paramètre de regroupement sont spécifiés via les arguments en ligne de commande. Exécuter la procédure de partitionnement à l'aide de la commande suivante : python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Les dépendances logicielles requises, y compris la version de NumPy, sont précisées dans environment.yml.
  3. Exécuter la procédure de partitionnement de la confiance en utilisant le répertoire de sortie du détecteur comme entrée.
    REMARQUE : Dans cette étude, le répertoire de sortie du détecteur était : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Le répertoire de sortie du partitionnement de la confiance était : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Les fichiers de sortie générés comprenaient les fichiers CSV de confiance par séquence, _confidence_frame_summary.csv et _confidence_runtime.csv.
  4. Attribuer une étiquette de niveau de confiance à chaque détection. Étiqueter les détections à haute confiance pour l'association basée sur le mouvement, celles à confiance moyenne pour l'association mouvement-sémantique, et celles à faible confiance uniquement pour la récupération de trajectoire. Conserver le score de confiance d'origine conjointement à l'étiquette de niveau de confiance attribuée.
  5. Examiner les distributions des scores de confiance et des images représentatives, comme illustré dans la Figure 3. Vérifier que les détections à haute confiance correspondent principalement à des cadres englobants complets et fiables des athlètes, tandis que les détections à confiance moyenne ou faible contiennent principalement des détections partielles, occultées, floues ou peu marquées.
    REMARQUE : Le résultat attendu de cette section est un fichier de partitionnement de la confiance contenant l'indice de détection, le score de confiance d'origine, le niveau de confiance attribué et les seuils de confiance adaptatifs au niveau des images pour chaque détection.

figure-protocol-5
Figure 2. Stratégie d'association guidée par la confiance. Le flux de travail divise la confiance de détection en intervalles de confiance élevée, moyenne et faible à l'aide d'un regroupement adaptatif par confiance. Les détections à haute confiance sont associées selon la similarité de mouvement, celles à confiance moyenne selon une similarité combinée de mouvement et de sémantique du maillot, et les détections à faible confiance sont utilisées pour une récupération de trajectoire assistée par sémantique avec vérification sur plusieurs images. Le panneau droit résume la formulation mathématique utilisée pour la partition de la confiance et l'association. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

figure-protocol-6
Figure 3. Répartition des scores de confiance de détection. L'histogramme montre le nombre de boîtes de détection de sportifs réparties en cinq intervalles de confiance pour les séquences de football, de basketball et de volleyball du jeu de données SportsMOT. La répartition illustre les différences de confiance du détecteur entre les catégories sportives évaluées. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

5. Exécuter une association guidée par la confiance

  1. Chargez le fichier de sortie du détecteur, le fichier de caractéristiques sémantiques et le fichier de partition de confiance pour chaque séquence vidéo. Initialisez le traqueur à l’aide des premières détections valides et maintenez un état de trajectoire pour chaque athlète suivi. Pour chaque image suivante, prédisez la position de chaque trajectoire existante à l’aide du modèle de mouvement du filtre de Kalman.
  2. Calculez la similarité de mouvement entre chaque trajectoire prédite et chaque détection candidate à l’aide de la distance de Mahalanobis définie dans l’équation 5.
    figure-protocol-7  (5)
    Ici, figure-protocol-8 désigne la I-ième trajectoire à l’image k, figure-protocol-9 désigne l’état prédit par le filtre de Kalman, dj désigne la détection candidate, figure-protocol-10 désigne la matrice de covariance inverse de l’état prédit de la trajectoire, et Smot désigne la distance de mouvement entre la trajectoire prédite et la détection.
    REMARQUE : Le flux de travail principal d’association est implémenté dans jerseytrack/formal_tracker.py et exécuté via scripts/formal_track.py, tous deux disponibles dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Aucun fichier de configuration distinct n’est requis. Tous les paramètres d’exécution, y compris les seuils de confiance, l’âge maximal de la trajectoire, les coefficients de pondération du mouvement et le poids de la distance au centre, sont fournis via des arguments en ligne de commande. La commande d’exécution complète et les paramètres sont indiqués à l’étape 6.2. L’implémentation utilise l’algorithme d’affectation par somme linéaire de SciPy pour l’appariement hongrois et NumPy pour l’association basée sur les coûts.
  3. Exécutez le flux de travail de suivi en utilisant comme entrées le fichier de sortie du détecteur, le fichier de caractéristiques sémantiques et le fichier de partition de confiance.
    REMARQUE : Dans cette étude, le traqueur principal a été implémenté dans jerseytrack\formal_tracker.py, et le flux de travail de suivi a été exécuté à l’aide de scripts\formal_track.py.
  4. Associez les détections à haute confiance aux trajectoires existantes en utilisant la cohérence de mouvement. Mettez à jour les trajectoires appariées et initialisez de nouvelles trajectoires uniquement lorsque des détections non appariées à haute confiance satisfont les critères d’initialisation de trajectoire.
  5. Examinez les sorties d’extraction sémantique du maillot illustrées dans la figure 4, puis construisez le vecteur de caractéristiques sémantiques du maillot pour chaque détection en combinant le descripteur de couleur d’équipe et la caractéristique du numéro du joueur selon l’équation 6.
    fsem = [fcol;fid] (6)
    Ici, fsem désigne le vecteur de caractéristiques sémantiques fusionné, fcol désigne le descripteur de couleur d’équipe, et fid désigne la caractéristique du numéro du joueur générée par la branche OCR.
  6. Associez les détections à confiance moyenne en combinant la similarité de mouvement avec la similarité sémantique du maillot. Calculez le score d’appariement fusionné selon l’équation 7.
    figure-protocol-11 (7)
    Ici, Ssem désigne la similarité cosinus entre les vecteurs de caractéristiques sémantiques de la trajectoire et de la détection candidate, Smot désigne la distance de mouvement définie dans l’équation 5, et λ désigne le coefficient de fusion adaptatif équilibrant les termes de similarité de mouvement et sémantique.
  7. Calculez le coefficient de fusion adaptatif selon l’équation 8.
    figure-protocol-12 (8)
    Ici, λdésigne le coefficient initial de pondération du mouvement, σsd désigne l’écart-type des scores de confiance de détection dans l’image courante, et σmax désigne l’écart-type maximal du score de confiance utilisé pour la normalisation.
  8. N’utilisez les détections à faible confiance que pour la récupération de trajectoire. Associez les détections à faible confiance uniquement avec des trajectoires interrompues lorsque des informations sémantiques sont disponibles et que les critères de récupération sont satisfaits. Appliquez une vérification multi-image avant de restaurer l’identité d’une trajectoire, et rejetez les détections qui échouent à la vérification.
    REMARQUE : Lorsque la caractéristique du numéro du joueur n’est pas disponible, effectuez l’association en utilisant les informations sémantiques disponibles et la cohérence de mouvement, plutôt que d’imposer une correspondance de numéro de joueur. Le résultat attendu de cette section est un enregistrement de suivi image par image contenant les identités des trajectoires, les boîtes englobantes, les étiquettes de niveau de confiance, les coûts de mouvement, les informations sémantiques et les décisions finales d’association. Dans le jeu de preuves de révision, les résultats de suivi ont été stockés sous : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Figure 4. Extraction des caractéristiques sémantiques du maillot. Des détections représentatives d'athlètes sont annotées avec les descripteurs de couleur d'équipe et les informations sur le numéro du joueur générés par le module d'extraction sémantique du maillot. Les caractéristiques sémantiques extraites sont ensuite intégrées dans une association de données guidée par la confiance. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

6. Exécuter l'inférence de suivi et exporter les résultats

  1. Exécutez l'inférence de suivi pour chaque séquence vidéo à l'aide des fichiers préparés de sortie du détecteur, des fichiers de caractéristiques sémantiques et des fichiers de partition de confiance. Traitez les images vidéo dans l'ordre chronologique afin que les états des trajectoires, l'historique sémantique et les décisions de récupération des trajectoires soient mis à jour de manière cohérente tout au long de la séquence. Utilisez la même configuration d'inférence pour toutes les séquences évaluées, sauf si un paramétrage spécifique au jeu de données est explicitement indiqué.
    REMARQUE : L'inférence de suivi a été exécutée à l'aide du script/formal_track.py, disponible dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Aucun fichier de configuration distinct n'est requis. Lancez l'inférence de suivi à l'aide de la commande suivante : python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Tous les paramètres non spécifiés ont conservé les valeurs par défaut enregistrées dans le code source archivé.
  2. Après l'inférence, appliquez la séquence principale de post-traitement à l'aide des commandes suivantes : python scripts/merge_tracklets.py et python scripts/sweep_track_filter.py --min-len 95.
  3. Exportez les résultats de suivi dans le format requis par l'outil d'évaluation. Incluez l'indice de l'image, l'identité de la trajectoire, les coordonnées de la boîte englobante et tous les champs requis par le format d'évaluation de référence. Enregistrez un fichier de résultats de suivi pour chaque séquence en utilisant une convention de nommage cohérente afin que chaque fichier de résultats puisse être associé à son fichier d'annotations de référence correspondant.
  4. Appliquez uniquement les opérations de post-traitement utilisées dans cette étude. Effectuez la fusion des tronçons de trajectoire (tracklets) et le filtrage des trajectoires à l'aide des scripts de post-traitement décrits dans le package de révision.
    REMARQUE : Dans cette étude, le flux de travail de post-traitement a utilisé les scripts suivants :
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Examinez les résultats de suivi exportés avant l'évaluation quantitative. Vérifiez que les identités des trajectoires restent numériques et cohérentes au sein de chaque séquence, qu'aucun indice d'image n'est manquant et que toutes les boîtes englobantes restent à l'intérieur des limites de l'image.
    REMARQUE : Le résultat attendu de cette section est un ensemble complet de fichiers de résultats de suivi au niveau des séquences, prêts pour l'évaluation quantitative.

7. Évaluer les performances du suivi

  1. Évaluez les fichiers de résultats de suivi exportés à l'aide de la trousse d'évaluation indiquée dans le Tableau des matériaux. Associez chaque fichier de résultats de suivi au fichier d'annotation de référence et au segment de jeu de données correspondants. Utilisez la même configuration d'évaluation pour toutes les méthodes comparées afin de garantir que les différences de performance découlent des résultats de suivi et non des paramètres d'évaluation.
  2. Exécutez l'évaluation à l'aide de la commande suivante
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOTE : L'évaluation a été réalisée à l'aide de l'implémentation standard des métriques TrackEval (version 1.3.0) archivée dans le package de reproductibilité JerseyTrack. Aucune modification n'a été apportée aux implémentations des métriques Higher Order Tracking Accuracy (HOTA), CLEAR ou Identity. Le dépôt inclut un script d'exécution au format MOTChallenge, situé à l'adresse evaluation/trackeval/scripts/run_mot_challenge.py, qui configure les chemins vers les jeux de données et les résultats, puis appelle les métriques d'évaluation standard de TrackEval.
  3. Enregistrez les métriques d'évaluation rapportées dans l'article, notamment la précision du suivi multi-objets (MOTA), le score F1 d'identité (IDF1), la précision de suivi d'ordre supérieur (HOTA), la précision de détection (DetA), la précision d'association (AssA), les faux positifs (FPs), les faux négatifs (FNs) et les changements d'identité. Exportez le résumé de l'évaluation sous forme de tableau et conservez les fichiers d'évaluation par séquence pour vérification.
  4. Lors de la comparaison de JerseyTrack avec les méthodes de référence, utilisez le même segment de jeu de données, les mêmes sorties du détecteur et la même configuration d'évaluation pour toutes les méthodes. Enregistrez le jeu de données, la source des sorties du détecteur, la configuration de la trousse d'évaluation et les valeurs des métriques pour chaque comparaison.
  5. Examinez les journaux d'évaluation pour vérifier que toutes les séquences ont été évaluées avec succès et qu'aucun fichier de résultats de suivi n'est manquant.
    NOTE : Dans cette étude, le fichier récapitulatif principal de TrackEval était stocké à l'emplacement suivant : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Le résultat attendu de cette section est un tableau récapitulatif complet d'évaluation, accompagné des fichiers de métriques par séquence, soutenant les Résultats rapportés et permettant une vérification ultérieure.

Résultats

Cette section présente les résultats quantitatifs et qualitatifs obtenus à partir des expériences d'analyse multi-objets en sport évaluées. Les résultats portent sur la précision du suivi, la préservation des identités, la qualité de l'association et la robustesse dans les conditions définies par les jeux de données testés. Les performances indiquées se limitent aux méthodes évaluées, aux jeux de données, aux sorties du détecteur et à la configuration de l'outil d'évaluation décrits dans le protocole et le paramétrage de mise en œuvre.

Dispositif expérimental et conception de l'évaluation

Jeu de données et prétraitement :

SportsMOT a été utilisé comme référence principale pour la préparation du détecteur, l'inférence du suivi et l'évaluation quantitative. L'ensemble de données comprend 240 séquences vidéo et plus de 150 000 images issues de scénarios de football, de basketball et de volleyball (Figure 5). Lors de l'évaluation formelle, les principaux résultats de SportsMOT ont été calculés à l'aide de la partition de validation, combinée aux sorties du détecteur, à la configuration du suivi et aux paramètres de TrackEval décrits dans le protocole. Une évaluation inter-ensembles de données a été réalisée sur TeamTrack, SoccerNet Tracking, MOT17 et MOT20 afin d'examiner le transfert de performances entre différents types d'ensembles de données, plutôt que d'effectuer des comparaisons directes au niveau des métriques entre ces ensembles.

figure-results-1
Figure 5. Exemples de jeux de données utilisés pour l'évaluation. Des images représentatives illustrent des séquences typiques de football, de basketball et de volleyball utilisées pour l'évaluation expérimentale. La figure met en évidence les variations de point de vue de la caméra, de densité de joueurs et de complexité de la scène entre les jeux de données évalués. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Les données SportsMOT ont été organisées selon la structure officielle du jeu de données et converties au format d'entraînement du détecteur décrit dans le protocole. Les données d'entraînement et de validation SportsMOT converties comprenaient 90 séquences, 55 544 images et 608 152 objets annotés. La partition d'entraînement a été utilisée pour la préparation du détecteur et l'ajustement des paramètres, tandis que la partition de validation a servi à l'évaluation formelle du suivi rapportée dans cette étude. Toutes les images d'entrée ont été redimensionnées conformément à la configuration du détecteur indiquée dans le protocole et dans le Tableau des matériaux. La même procédure de prétraitement a été appliquée lors de la préparation du détecteur, de l'extraction des caractéristiques sémantiques, de l'inférence du suivi et de l'évaluation avec TrackEval, afin que les différences rapportées reflètent principalement la stratégie d'association de suivi plutôt que des variations dans le traitement des données.

Indicateurs d'évaluation :

Les performances de suivi ont été évaluées à l'aide d'un protocole d'évaluation compatible avec MOTChallenge, mis en œuvre à l'aide de la trousse d'évaluation indiquée dans le tableau des matériaux. Les métriques rapportées décrivent trois aspects des performances de suivi d'objets en contexte sportif : la précision globale du suivi, la préservation des identités et la qualité de détection-association. Les métriques MOTA, IDF1 et HOTA ont été utilisées comme indicateurs principaux d'évaluation44,45. La métrique MOTA résume les faux positifs, les faux négatifs et les changements d'identité en un score global de précision de suivi. IDF1 mesure la cohérence entre les trajectoires prédites et les identités de référence. HOTA évalue conjointement la précision de détection et la précision d'association, caractérisant ainsi l'équilibre entre la localisation des cibles et l'association des trajectoires. DetA et AssA ont été rapportées comme métriques complémentaires. Les FPs (faux positifs), FNs (faux négatifs) et changements d'identité (IDs) ont été utilisés pour caractériser les sources d'erreur liées aux détections erronées, aux détections manquées et aux modifications d'identité. Pour les comparaisons entre méthodes sur SportsMOT, les mêmes sorties de détecteur et la même configuration de la trousse d'évaluation ont été utilisées afin de réduire l'influence des variations de détecteur et des différences de paramètres d'évaluation. Pour les comparaisons entre ensembles de données, les valeurs des métriques ont été interprétées comme des résultats d'évaluation propres à chaque ensemble de données, et non comme une preuve de supériorité absolue de performance entre différents ensembles de données.

Environnement expérimental et configuration des paramètres :

Les expériences ont été réalisées à l'aide des ressources matérielles et logicielles énumérées dans le Tableau des matériaux. Le même environnement informatique, le même cadre de détecteur, les mêmes sorties de détecteur et la même trousse d'évaluation ont été utilisés tout au long des expériences principales de SportsMOT afin de maintenir la cohérence durant la préparation du détecteur, l'inférence de suivi et l'évaluation des performances. Le cadre de détecteur indiqué dans le Tableau des matériaux a été entraîné avec une taille de lot de 16, un taux d'apprentissage initial de 0,01 et 80 époques d'entraînement. Dans le module d'extraction sémantique des maillots, le regroupement par couleurs a utilisé K-moyennes avec K = 3, et la branche OCR a utilisé un réseau neuronal récurrent convolutionnel léger avec une taille d'entrée de 128 × 64 pixels. La branche OCR a été optimisée à l'aide de l'optimiseur adaptatif indiqué dans le Tableau des matériaux, avec un taux d'apprentissage de 1 × 10⁻3, une décroissance du poids de 1 × 10⁻5, une taille de lot de 64 et 40 époques d'entraînement. Aucun réglage supplémentaire du taux d'apprentissage n'a été utilisé durant l'entraînement du module d'extraction de caractéristiques sémantiques. Le coefficient de pondération de la perte OCR (γ) a été considéré comme un hyperparamètre défini par l'utilisateur et choisi en fonction des performances sur l'ensemble de validation. La stratification par niveau de confiance a utilisé un partitionnement K-moyennes adaptatif, dans lequel τ₁ et τ₂ ont été calculés à partir de la distribution de confiance de détection de chaque image, plutôt que d'être prédéfinis manuellement avant l'inférence.

Évaluation des performances dans les sports et selon la complexité des scénarios

Performance quantitatif dans différentes conditions sportives et de scène :

La performance de suivi a été évaluée selon deux facteurs de regroupement : la catégorie de sport et la complexité de la scène. L'analyse par catégorie de sport comprenait des séquences de football, de basketball et de volleyball. L'analyse de la complexité de la scène prenait en compte le niveau d'occultation, la vitesse du mouvement et la densité de la cible, en utilisant les mêmes critères de regroupement pour l'ensemble des séquences évaluées. Les métriques rapportées suivaient le protocole d'évaluation décrit dans la Section 7 du protocole. 

Figure 6 résume les résultats du suivi quantitatif selon différentes catégories sportives et conditions de complexité de scène. Figure 6A présente les valeurs de MOTA et de DetA pour les séquences de football, de basketball et de volleyball. Figure 6B présente la variation du MOTA selon différents niveaux d'occultation, de vitesse de mouvement et de densité des cibles. Figure 6C présente les décomptes cumulés de faux positifs (FP) et de faux négatifs (FN) pour chaque dimension de complexité de scène.

figure-results-2
Figure 6. Suivi des performances selon les catégories sportives et les conditions de scène. (A) Précision du suivi de plusieurs objets (MOTA) et précision de détection (DetA) pour le football, le basketball, le volleyball et la moyenne générale. (B) MOTA selon des conditions de scène représentatives présentant différents niveaux d'occultation, de densité de joueurs et de complexité du mouvement. (C) Nombre de faux positifs (FP) et de faux négatifs (FN) selon les conditions de scène évaluées. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Dans les trois catégories de sports, JerseyTrack a atteint une MOTA moyenne de 88,9 % et une DetA moyenne de 80,2 %. L'écart de MOTA entre les catégories de sports était de 1,3 point de pourcentage, la MOTA la plus élevée étant observée pour les séquences de volleyball (89,2 %) et la plus faible pour les séquences de basketball (87,9 %). La MOTA plus faible observée pour les séquences de basketball est cohérente avec la fréquence plus élevée d'interactions à courte distance et d'occultations denses dans les séquences évaluées. Dans des conditions de scène moins complexes, incluant une occultation légère, une faible vitesse de mouvement et une distribution clairsemée des cibles, la MOTA a atteint respectivement 91,8 %, 93,1 % et 93,8 %. Dans des conditions de scène plus complexes, la MOTA a diminué à 84,9 % en cas d'occultation importante, à 83,6 % en cas de mouvement à grande vitesse et à 83,1 % en cas de distribution dense des cibles. Ces résultats montrent que les performances de suivi diminuent avec l'augmentation de la complexité de la scène, tout en restant dans la plage rapportée pour les scénarios sportifs évalués.

Suivi de la cohérence dans des scénarios sportifs représentatifs :

Figure 7 présente des exemples représentatifs de suivi illustrant la cohérence temporelle de JerseyTrack dans trois scénarios sportifs difficiles : interactions denses entre joueurs, occultation partielle prolongée et changements rapides de direction. Dans ces séquences représentatives, le traqueur a maintenu des identités de trajectoire cohérentes malgré les chevauchements fréquents entre athlètes et les mouvements dynamiques. Une fragmentation d'identité a été observée principalement en cas d'occultation sévère ou lorsque les informations sémantiques des maillots sont devenues temporairement indisponibles ; toutefois, la stratégie d'association guidée par la confiance a permis la récupération des trajectoires dès que des détections fiables sont réapparues. Ces exemples représentatifs soutiennent qualitativement les résultats quantitatifs présentés dans la Figure 6, en démontrant une préservation stable de l'identité dans les conditions de suivi sportif évaluées.

figure-results-3
Figure 7. Résultats représentatifs de suivi générés par JerseyTrack. Des images consécutives issues de séquences de basketball, de football et de volleyball illustrent le maintien des identités et des trajectoires des athlètes pendant le suivi. Les cadres colorés représentent les identités suivies conservées d'une image vidéo à l'autre. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Résultats des analyses d'ablation pour la préservation de l'identité :

Une analyse d'ablation a été menée pour examiner les contributions de la stratégie d'association guidée par la confiance et du module de fusion sémantique des maillots à la préservation de l'identité. Quatre variantes de modèle ont été comparées : V0, le modèle de base sans association guidée par la confiance ni fusion sémantique des maillots ; V1, la variante utilisant uniquement l'association guidée par la confiance ; V2, la variante utilisant uniquement la fusion sémantique des maillots ; et V3, la configuration complète de JerseyTrack intégrant les deux composants. L'évaluation s'est concentrée sur des métriques liées à l'identité, notamment le nombre de changements d'identité (IDs), le score IDF1, la précision d'identité (IDP) et le rappel d'identité (IDR). Les motifs représentatifs de préservation de l'identité sont présentés dans la Figure 8.

figure-results-4
Figure 8. Analyse d'ablation de l'association sémantique de maillot guidée par la confiance. (A) Nombre total de changements d'identité (IDs) et score F1 d'identité (IDF1) pour les différentes variantes du modèle évaluées. (B) Comparaison des IDs entre le modèle complet (V3) et la configuration de base (V0) dans des scénarios de suivi représentatifs et difficiles. (C) IDF1, précision d'identité (IDP) et rappel d'identité (IDR) du modèle complet dans différents scénarios de suivi. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Dans le cadre général de validation de SportsMOT, la configuration complète V3 a produit le nombre le plus faible d'identités (IDs) et le score IDF1 le plus élevé parmi les quatre variantes de modèle. La V3 a enregistré 2 768 IDs, soit 477 changements d'identité de moins que la V0, et a atteint un IDF1 de 74,3 %, ce qui représente une augmentation de 7,1 points de pourcentage par rapport à la V0. Ces résultats indiquent que les deux modules ont conjointement contribué à la préservation de l'identité dans les conditions de suivi sportif évaluées. La comparaison des variantes à module unique avec la configuration complète a en outre montré que les deux modules affectaient différentes sources d'erreur de suivi. La stratégie d'association guidée par la confiance a réduit les erreurs d'appariement liées à une confiance instable dans la détection et à une incertitude de localisation, tandis que le module de fusion sémantique du maillot a fourni des informations supplémentaires sur l'identité lorsque les seules informations de mouvement étaient insuffisantes. La configuration complète V3 a obtenu de meilleures performances en matière d'identité que chacune des variantes à module unique, suggérant que les deux modules apportent des contributions complémentaires plutôt que redondantes.

Les résultats au niveau des scénarios ont montré des différences plus marquées dans des conditions de préservation de l'identité plus difficiles. Pendant les occultations prolongées, V3 a enregistré 215 identifications contre 482 pour V0. Dans les scénarios denses avec des joueurs de la même équipe (6 à 10 joueurs), V3 a enregistré 328 identifications contre 615 pour V0. Lors de changements de direction à grande vitesse, V3 a enregistré 482 identifications contre 960 pour V0. Ces réductions sont cohérentes avec l'utilisation prévue de signaux sémantiques pendant l'occultation et les interactions denses, ainsi qu'avec une association guidée par la confiance en cas de fluctuations de la confiance de détection pendant les mouvements rapides. Les tendances de l'IDP et de l'IDR présentées dans Figure 8C indiquent que la réduction du nombre d'identifications n'a pas été accompagnée d'une diminution importante ni de la précision d'identification ni du rappel d'identification. La configuration complète a maintenu des valeurs IDF1 supérieures à 71 % dans tous les scénarios difficiles évalués, avec des valeurs plus faibles observées lors d'interactions denses entre joueurs de la même équipe et de changements de direction à grande vitesse. Ces résultats indiquent une amélioration de la cohérence d'identification dans les conditions évaluées, tout en identifiant les interactions denses et les mouvements rapides comme les principales sources résiduelles de dégradation des performances.

Résultats de l'évaluation inter-ensembles de données :

Une évaluation inter-ensembles de données a été menée afin d'examiner si le comportement de suivi observé sur SportsMOT pouvait être maintenu dans des conditions différentes d'ensembles de données. L'évaluation comprenait deux ensembles de données spécifiques aux sports, SoccerNet Tracking et TeamTrack, ainsi que deux ensembles de données généraux de suivi d'objets multiples (MOT), MOT17 et MOT20. L'objectif de cette expérience était d'étudier le transfert de performances entre différents types d'ensembles de données. Les résultats n'ont pas été utilisés pour revendiquer une supériorité directe au niveau des métriques entre les ensembles de données, car les protocoles d'annotation, la composition des scènes, les points de vue des caméras et les catégories cibles diffèrent.

Tableau 1 résume les résultats de l'évaluation inter-ensembles de données. Sur les ensembles de données spécifiques aux sports, JerseyTrack a maintenu des valeurs relativement stables de MOTA et d'IDF1 par rapport au paramètre principal de validation SportsMOT. Cette tendance suggère que la stratégie d'association guidée par la confiance et les indices sémantiques liés aux maillots sont restés efficaces lorsque les scènes de suivi conservaient des caractéristiques visuelles propres aux sports d'équipe, notamment des tenues répétées, des interactions denses entre athlètes et des occultations fréquentes. Sur les ensembles de données MOT généraux, la méthode a conservé des valeurs compétitives de MOTA et de DetA, tandis que l'IDF1 était inférieur à celui observé sur les ensembles de données spécifiques aux sports. Ce schéma est cohérent avec l'absence d'indices de couleur de maillot et de numéro de joueur dans MOT17 et MOT20, qui sont exploités par le module de fusion sémantique. Dans ces conditions, le composant d'association guidée par la confiance est resté applicable, tandis que la branche sémantique a apporté moins d'informations spécifiques à l'identité que dans le cas des vidéos de sports d'équipe. Dans l'ensemble, ces résultats indiquent que JerseyTrack se transfère plus efficacement vers des ensembles de données contenant des sémantiques visuelles spécifiques aux sports qu'aux ensembles de données généraux de suivi de piétons. L'évaluation inter-ensembles de données soutient donc l'application prévue de la méthode en tant que système de suivi orienté vers les sports, tout en identifiant l'absence de sémantiques explicites de maillot comme un facteur limitant pour les ensembles de données MOT non sportifs.

Jeu de donnéesMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86,871,377,932,1
TeamTrack86,270,777,332,8
MOT1784,769,576,133,9
MOT2084,168,975,333,2

Tableau 1 : Résultats de l'évaluation croisée entre ensembles de données. Performance de suivi de JerseyTrack évaluée sur quatre ensembles de données de référence publics. On indique la précision du suivi multi-objet (MOTA), le score F1 d'identité (IDF1), la précision de détection (DetA) et la vitesse de traitement mesurée en images par seconde (FPS). Des valeurs plus élevées indiquent une meilleure performance pour la MOTA, l'IDF1, la DetA et les FPS.

Robustesse dans des conditions de perturbation contrôlées

Des expériences de perturbation contrôlées ont été menées afin d'examiner la stabilité de JerseyTrack face aux perturbations visuelles et de qualité de détection couramment rencontrées dans les vidéos sportives. Les perturbations évaluées ont été regroupées en trois catégories : perturbation des caractéristiques sémantiques, perturbation des boîtes de détection et perturbation environnementale. Les perturbations des caractéristiques sémantiques comprenaient l'occlusion du numéro du joueur, le flou d'image, la dégradation de la résolution et des couleurs de maillot similaires. Les perturbations des boîtes de détection comprenaient un décalage de la boîte englobante, des fluctuations de la confiance de détection et des boîtes de détection erronées. Les perturbations environnementales comprenaient un bruit de type pluie, une dégradation de type brouillard, un éclairement intense et des interférences d'ombres. Figure 9 résume les performances de suivi sous ces conditions de perturbation. En cas de perturbation des caractéristiques sémantiques, les performances de suivi ont diminué à mesure que la visibilité du numéro du joueur et la qualité du recadrage se dégradaient. Lorsque 40 % de la zone du numéro du joueur était occultée, MOTA a diminué de 3,2 points de pourcentage et IDF1 de 5,3 points de pourcentage par rapport à la condition sans perturbation, tandis que la précision d'extraction sémantique est restée à 86,7 %. Ces résultats indiquent que les indices de couleur du maillot et du numéro du joueur fournissent des informations complémentaires lorsque l'un des indices sémantiques devient moins fiable. En cas de perturbation des boîtes de détection, la méthode a présenté une dégradation modérée des performances plutôt qu'une défaillance brutale. Lorsque les boîtes de détection étaient décalées de ±10 pixels et que les scores de confiance étaient perturbés par un bruit gaussien, la diminution de MOTA est restée inférieure à 3 points de pourcentage, et l'augmentation du nombre d'identifiants (IDs) s'est limitée à 16 %. Cette tendance est cohérente avec la stratégie d'association guidée par la confiance, dans laquelle les détections de confiance moyenne ou faible sont traitées à l'aide de contraintes d'association supplémentaires, contrairement à la stratégie appliquée aux détections de haute confiance.

figure-results-5
Figure 9. Évaluation de la robustesse sous des perturbations contrôlées. (A) Évolutions de la précision de suivi de multiples objets (MOTA), du score F1 d'identité (IDF1) et des changements d'identité (IDs) avec une occultation croissante du numéro de maillot. (B) Dégradation des performances dans des conditions d'interférence représentatives. (C) Augmentation des IDs selon différents types d'interférence. (D) Précision de l'extraction sémantique du maillot dans les conditions de perturbation évaluées. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Sous perturbation environnementale, les diminutions des métriques principales de suivi sont restées inférieures à 5 points de pourcentage dans les conditions évaluées, et la précision de l'extraction sémantique est restée à 87,2 %. L'utilisation de descripteurs de couleur basés sur HSV a réduit la sensibilité aux changements d'éclairage, tandis que la branche OCR a conservé des informations exploitables sur les numéros des joueurs pour un sous-ensemble de découpes d'images floues ou dégradées. Ces résultats indiquent que le module sémantique est resté utilisable dans les conditions de perturbation évaluées, bien que sa fiabilité continue de dépendre de la visibilité des maillots et de la qualité des découpes. Dans l'ensemble, les expériences de perturbation contrôlées ont montré que JerseyTrack maintenait des performances de suivi mesurables sous les perturbations sémantiques, de qualité de détection et environnementales évaluées. Ces résultats doivent être interprétés dans la plage de perturbations testées. La ré-identification systématique hors champ, l'encombrement important du fond et l'occlusion complète à long terme n'ont pas été évalués séparément dans cette expérience et sont discutés comme des limites dans la section Discussion.

Analyse de la contribution des modules et de la discrimination des caractéristiques

La contribution des modules et la discrimination des caractéristiques ont été davantage analysées afin d'examiner comment les deux composants proposés ont influencé les performances de suivi liées à l'identité. L'analyse de la contribution des modules a utilisé les quatre variantes du modèle définies dans l'analyse d'ablation, tandis que l'analyse de discrimination des caractéristiques a comparé les caractéristiques traditionnelles de ré-identification (Re-ID), les caractéristiques basées uniquement sur la couleur, celles basées uniquement sur le numéro du joueur, et les caractéristiques sémantiques du maillot fusionnées. Le rapport entre la distance inter-classes et la distance intra-classe a été utilisé pour décrire la séparabilité des caractéristiques, des valeurs plus élevées indiquant une séparation plus grande entre différentes identités par rapport aux variations au sein d'une même identité. Tableau 2 résume l'analyse de la contribution des modules. Dans l'évaluation globale, la contribution estimée de la stratégie d'association guidée par la confiance était de 41,7 %, la contribution estimée de la fusion sémantique du maillot était de 47,6 %, et les 10,7 % restants ont été attribués à l'utilisation combinée des deux composants. Ces valeurs indiquent que les deux composants ont contribué à l'amélioration observée, tandis que la configuration complète a bénéficié de leur utilisation conjointe plutôt que de l'un ou l'autre pris isolément. Le schéma de contribution variait selon les types de scènes. En cas d'occlusion importante, la contribution estimée de la fusion sémantique du maillot a augmenté jusqu'à 69,4 %, ce qui est cohérent avec la fiabilité réduite des indices de mouvement lorsque les athlètes étaient partiellement ou temporairement occultés. En cas de mouvement rapide, la contribution estimée de l'association guidée par la confiance a atteint 44,3 %, et le gain combiné a atteint 20,6 %, indiquant que la partition selon le niveau de confiance devenait plus pertinente lorsque la confiance de détection fluctuait en raison du mouvement rapide ou de l'incertitude de localisation.

Variant du modèleScénario de testMOTA↑IDF1↑IDs↓Contribution du moduleGain synergique
V0 (Référence)Scène générale83,567,23245
Scènes fortement occultées77,861,53862
Scène de mouvement à grande vitesse77,162,33689
V1 (Association guidée par la confiance)Scène générale86,370,9289341,7
Scènes fortement occultées80,965,9341529,8
Scène de mouvement à grande vitesse81,467,9302444,3
V2 (Association sémantique par maillot)Scène générale85,271,8293747,6
Scènes fortement occultées82,772,8275369,4
Scène de mouvement à grande vitesse80,166,8315735,1
V3 (JerseyTrack complet)Scène générale88,974,3276810,7
Scènes fortement occultées84,975,626890,8
Scène de mouvement à grande vitesse83,671,5284220,6

Tableau 2 :  Analyse d'ablacion des contributions des modules. Comparaison des performances de différentes variantes du modèle JerseyTrack dans des scénarios globaux, fortement occultés et à mouvement rapide. La précision du suivi de multiples objets (MOTA), le score F1 d'identité (IDF1) et le nombre de changements d'identité (IDs) sont indiqués, ainsi que la contribution estimée des modules et le gain synergique. Des valeurs plus élevées indiquent de meilleures performances pour MOTA, IDF1, la contribution des modules et le gain synergique, tandis que des valeurs plus faibles indiquent de meilleures performances pour IDs.

Tableau 3 résume l'analyse de discrimination des caractéristiques. La caractéristique sémantique fusionnée du maillot a atteint un rapport de distance inter-classes/intra-classes de 5,63, comparé à 1,82 pour les caractéristiques traditionnelles de Re-ID, ce qui correspond à une amélioration relative de 209,3 % dans la mesure du rapport de distance. Les caractéristiques basées uniquement sur la couleur ou uniquement sur le numéro du joueur ont également amélioré la séparabilité des caractéristiques par rapport aux caractéristiques traditionnelles de Re-ID, bien que chaque indicateur individuel reste sensible à des cas d'échec spécifiques, notamment des couleurs d'équipe similaires, l'occultation du numéro du joueur, le flou de mouvement et des zones du maillot illisibles. Parmi les représentations de caractéristiques évaluées, la représentation sémantique fusionnée a obtenu la plus grande séparabilité des caractéristiques et correspondait au score IDF1 le plus élevé ainsi qu'au nombre d'identités (ID) le plus faible observé dans l'analyse d'ablation. Ces résultats soutiennent l'utilisation d'indices sémantiques spécifiques au maillot comme information d'identité complémentaire pour le suivi multi-objets (MOT) en sport lorsque les athlètes ont des apparences similaires et que l'information de mouvement seule est insuffisante. Ces observations sont limitées au contexte SportsMOT évalué et ne doivent pas être interprétées comme une preuve que les sémantiques des maillots résolvent toute ambiguïté d'identité dans toutes les vidéos sportives.

Type de caractéristiqueRapport inter-classes/intra-classesAmélioration relative (%)IDF1↑IDs↓
Caractéristiques traditionnelles de ré-identification1.8265.73482
Caractéristiques de couleur d'équipe3.1774,269,83125
Caractéristiques de numéro de joueur3.4991,870,53018
Caractéristiques sémantiques fusionnées du maillot5,63209,374,32768

Tableau 3 : Analyse de discrimination de différentes représentations de caractéristiques. Comparaison de la discrimination des caractéristiques à l’aide de caractéristiques traditionnelles de ré-identification (Re-ID), de caractéristiques de couleur de maillot, de caractéristiques de numéro de joueur et de caractéristiques sémantiques fusionnées. Le rapport entre la distance inter-classes et intra-classes, l’amélioration relative de la discrimination des caractéristiques, le score F1 d’identité (IDF1) et le nombre de changements d’identité (IDs) sont indiqués. Des valeurs plus élevées indiquent de meilleures performances pour le rapport de distance, l’amélioration relative et l’IDF1, tandis que des valeurs plus faibles indiquent de meilleures performances pour les IDs.

Comparaison comparative avec les méthodes MOT existantes

Une comparaison de référence a été réalisée afin de comparer JerseyTrack à des méthodes représentatives de suivi multi-objets (MOT) dans le même cadre de validation SportsMOT. Les méthodes comparées incluaient QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT et MOTR. Toutes les méthodes ont utilisé les mêmes sorties de détecteur générées par le cadre de détection indiqué dans le tableau des matériaux, afin que la comparaison se concentre sur les performances d'association de suivi plutôt que sur les variations du détecteur. L'évaluation a utilisé les métriques définies dans le protocole de la section 7. Les métriques principales étaient MOTA, HOTA et IDF1. Les métriques auxiliaires comprenaient DetA, AssA, FPs, FNs et IDs. Tableau 4 résume la comparaison quantitative sur la partition de validation SportsMOT, et Figure 10 présente une comparaison visuelle de la précision de suivi, de la vitesse d'inférence et de la distribution de HOTA à travers les scènes sportives évaluées. JerseyTrack a obtenu le MOTA le plus élevé parmi les méthodes comparées, atteignant 88,9 %. Cette valeur était supérieure de 1,1 point de pourcentage à celle de Deep OC-SORT (87,8 %) et de 2,5 points de pourcentage à celle de ByteTrack (86,4 %). Dans le cadre de validation SportsMOT évalué, JerseyTrack a donc atteint la précision de suivi globale la plus élevée parmi les méthodes comparées. Pour HOTA, JerseyTrack a atteint 69,9 %, contre 64,4 % pour Deep OC-SORT et 62,8 % pour ByteTrack. Ces différences correspondent à des améliorations respectives de 5,5 et 7,1 points de pourcentage, indiquant un meilleur équilibre entre la détection et les performances d'association dans le même cadre d'évaluation.

MéthodeMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75,953,751,665,639,796 32489 8718 216
DeepSORT77,654,153,267,34476 22886 3196 836
ByteTrack86,462,867,773,850,933 75278 6984 192
FairMOT84,154,762,577,847,845 18783 6204 817
Deep OC-SORT87,864,469,978,252,125 01274 3853 211
MOTR82,957,258,468,946,154 93185 0635 137
JerseyTrack88,969,974,380,254,321 95367 1602 768

Tableau 4 : Comparaison des performances de JerseyTrack et de méthodes représentatives de suivi multi-objets sur la partition de validation SportsMOT. Comparaison de JerseyTrack avec des méthodes représentatives de suivi multi-objets (MOT) sur le jeu de données de validation SportsMOT. Les métriques rapportées incluent l'exactitude du suivi multi-objets (MOTA), l'exactitude du suivi d'ordre supérieur (HOTA), le score F1 d'identité (IDF1), l'exactitude de détection (DetA), l'exactitude d'association (AssA), les faux positifs (FP), les faux négatifs (FN) et le nombre de changements d'identité (IDs). Des valeurs plus élevées indiquent de meilleures performances pour MOTA, HOTA, IDF1, DetA et AssA, tandis que des valeurs plus faibles indiquent de meilleures performances pour FP, FN et IDs.

figure-results-6
Figure 10. Comparaison des performances avec des méthodes représentatives de suivi multi-objets. (A) Comparaison de la précision de suivi de plusieurs objets (MOTA) et des images par seconde (FPS) pour JerseyTrack et des méthodes représentatives de suivi multi-objets évaluées sur le jeu de données SportsMOT. (B) Répartition de la précision de suivi d'ordre supérieur (HOTA) parmi les méthodes de suivi évaluées. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

En matière de préservation de l'identité, JerseyTrack a atteint un score IDF1 de 74,3 %, contre 69,9 % pour Deep OC-SORT et 67,7 % pour ByteTrack. JerseyTrack a également enregistré 2 768 identifiants (IDs), un nombre inférieur aux 3 211 IDs enregistrés par Deep OC-SORT et aux 4 192 IDs enregistrés par ByteTrack. Ces observations sont cohérentes avec les résultats d'analyse par suppression présentés dans la Figure 8 et le Tableau 2, où la configuration complète de JerseyTrack a réduit les changements d'identité par rapport aux variantes du modèle de référence. En ce qui concerne la qualité de détection et d'association, JerseyTrack a obtenu un score DetA de 80,2 % et un score AssA de 54,3 %. Par rapport à Deep OC-SORT, JerseyTrack a amélioré le DetA de 2,0 point de pourcentage et le AssA de 2,2 points de pourcentage. JerseyTrack a également produit moins de faux positifs (FP) et de faux négatifs (FN) que les autres méthodes comparées rapportées dans le Tableau 4, avec 21 953 FP et 67 160 FN. Dans l'ensemble, la comparaison comparative a montré que JerseyTrack atteignait les valeurs les plus élevées pour les métriques principales de suivi parmi les méthodes évaluées dans le cadre du paramètre de validation SportsMOT. Ces résultats sont cohérents avec les améliorations observées en matière de préservation de l'identité et de stabilité d'association obtenues grâce à l'association guidée par la confiance et à la fusion sémantique des maillots. La comparaison se limite aux sorties du détecteur partagé et à la configuration de validation SportsMOT utilisée dans cette étude.

Résultats de la sensibilité des paramètres

Une analyse de sensibilité des paramètres a été réalisée pour examiner comment les paramètres clés de mise en œuvre influençaient les performances de suivi dans le cadre de validation SportsMOT. Trois paramètres ont été évalués : le coefficient de pondération de la perte OCR (γ), le nombre de clusters hiérarchiques selon le niveau de confiance (K) et le taux d'apprentissage du réseau OCR (η). Tableau 5 résume les valeurs de MOTA, IDF1, HOTA et le nombre d'identités (IDs) obtenus pour différents réglages des paramètres.

ParamètreValeurMOTA↑IDF1↑HOTA↑IDs↓
Poids de la perte OCR (γ)0,284,769,466,22 944
0,486,371,568,22 893
0,687,973,168,92 815
0,8 (optimal)88,974,369,92 768
188,273,869,32 792
Nombre de groupes de confiance (K)286,772,168,52 876
3 (optimal)88,974,369,92 768
488,173,669,72 803
587,372,869,22 851
Taux d'apprentissage OCR (η)1 × 10⁻⁴85,970,867,32 934
5 × 10⁻⁴87,672,768,72 832
1 × 10⁻³ (optimal)88,974,369,92 768
5 × 10⁻³87,873,2692 817
1 × 10⁻²86,571,668,72 889

Tableau 5 : Analyse de sensibilité des paramètres. Performances de suivi obtenues en utilisant différents réglages de paramètres pour JerseyTrack. La précision du suivi de multiples objets (MOTA), le score F1 d'identité (IDF1), la précision du suivi d'ordre supérieur (HOTA) et le nombre de changements d'identité (IDs) sont indiqués pour différentes valeurs du coefficient de pondération de la perte de reconnaissance optique de caractères (OCR) (γ), du nombre de groupes de confiance (K) et du taux d'apprentissage OCR (η). Les valeurs de paramètres identifiées comme optimales correspondent aux réglages utilisés dans les expériences rapportées. Des valeurs plus élevées indiquent de meilleures performances pour MOTA, IDF1 et HOTA, tandis que des valeurs plus faibles indiquent de meilleures performances pour IDs.

Pour le coefficient de pondération de la perte OCR (γ), les meilleures performances évaluées ont été obtenues avec γ = 0,8. Dans ce cas, JerseyTrack a atteint un MOTA de 88,9 %, un IDF1 de 74,3 %, un HOTA de 69,9 % et 2 768 identifiants (IDs). Lorsque γ a été réduit à 0,2, les valeurs du MOTA, de l'IDF1 et du HOTA ont diminué respectivement à 84,7 %, 69,4 % et 66,2 %, tandis que le nombre d'IDs a augmenté à 2 944. Lorsque γ a été augmenté à 1,0, les métriques de performance ont légèrement diminué par rapport à γ = 0,8, avec un MOTA de 88,2 %, un IDF1 de 73,8 %, un HOTA de 69,3 % et 2 792 IDs. Ces résultats indiquent qu'une supervision insuffisante de la reconnaissance optique de caractères (OCR) réduit la discrimination des numéros de joueurs, tandis qu'une augmentation de la pondération de la perte OCR au-delà de l'optimum évalué n'améliore pas les performances de suivi dans les conditions testées.

Pour le nombre de clusters hiérarchiques selon le niveau de confiance (K), les meilleures performances évaluées ont été obtenues avec K = 3. Ce paramètre correspond à la stratégie d'association à haute, moyenne et faible confiance décrite dans la méthode. Lorsque K = 2, la partition par niveaux de confiance était moins fine, et les valeurs de MOTA, IDF1 et HOTA ont diminué respectivement à 86,7 %, 72,1 % et 68,5 %. Lorsque K augmentait à 4 ou 5, les performances diminuaient également par rapport à K = 3, suggérant qu'une partition excessive divisait les détections en groupes de confiance trop étroits et réduisait la stabilité de la stratégie d'association. Ces résultats soutiennent l'utilisation de trois niveaux de confiance dans la configuration évaluée de JerseyTrack.

Pour le taux d'apprentissage (η) du réseau OCR, les meilleures performances évaluées ont été obtenues avec η = 1 × 10-3. À un taux d'apprentissage plus faible de 1 × 10-4, MOTA, IDF1 et HOTA ont diminué respectivement à 85,9 %, 70,8 % et 67,3 %, tandis que le nombre d'identifiants a augmenté à 2 934. À un taux d'apprentissage plus élevé de 1 × 10-2, MOTA, IDF1 et HOTA ont diminué respectivement à 86,5 %, 71,6 % et 68,7 %, tandis que le nombre d'identifiants a augmenté à 2 889. Ces résultats indiquent que la branche OCR était sensible au choix du taux d'apprentissage, lequel à 1 × 10-3 offrait le meilleur compromis entre la reconnaissance du nombre de joueurs et la préservation des identités dans les conditions évaluées.

Dans l'ensemble, le tableau 5 montre que la combinaison de paramètres γ = 0,8, K = 3 et η = 1 × 10-3 a produit les valeurs les plus élevées de MOTA, d'IDF1 et de HOTA évaluées, ainsi que le nombre le plus faible de changements d'identité (IDs). L'analyse de sensibilité a également montré que des écarts modérés par rapport à ces valeurs de paramètres entraînaient des changements mesurables, mais non brusques, de la performance de suivi. Par conséquent, ces réglages de paramètres ont été utilisés pour la comparaison de référence et les expériences principales de validation de SportsMOT rapportées dans cette étude.

Disponibilité des données

Les résumés bruts des évaluations, les sorties finales du suivi, les enregistrements d'environnement, les fichiers de mappage des jeux de données et les fichiers intermédiaires de synthèse soutenant les résultats de cette étude sont disponibles dans un dépôt public à l'adresse https://doi.org/10.5281/zenodo.21274353. Les jeux de données publiques d'origine utilisés dans cette étude, notamment SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 et MOT20, sont accessibles auprès de leurs fournisseurs respectifs et ne sont pas redistribués dans le dépôt.

Discussion

Cette étude a évalué un flux de travail MOT sportif guidé par la confiance, combinant une partition basée sur la confiance de détection et des indices sémantiques relatifs aux maillots. L'association guidée par la confiance et la fusion de caractéristiques sémantiques ont été étudiées comme stratégies complémentaires permettant d'améliorer l'association des données dans le suivi multi-objet12,20,23,24,46. Les résultats montrent que la configuration complète de JerseyTrack a amélioré la préservation de l'identité et la stabilité de l'association dans le cadre du paramètre de validation SportsMOT évalué. Le résultat principal de validation SportsMOT a atteint un MOTA de 88,9 %, un HOTA de 69,9 %, un IDF1 de 74,3 %, un DetA de 80,2 % et un AssA de 54,3 %. Ces valeurs doivent être interprétées à la lumière de la source des sorties du détecteur, du découpage du jeu de données et de la configuration TrackEval décrits dans le protocole.

Une étape cruciale du flux de travail est la partition par niveau de confiance, qui permet d'appliquer différentes stratégies d'association en fonction de la fiabilité des sorties du détecteur20,22,23,24. En séparant les détections en groupes à haute, moyenne et faible confiance, JerseyTrack applique différentes règles d'association aux détections selon leur niveau de fiabilité. Les détections à haute confiance sont principalement associées par cohérence de mouvement, tandis que les détections à confiance moyenne utilisent conjointement le mouvement et la sémantique du maillot. Les détections à faible confiance ne servent pas à initialiser de nouvelles trajectoires et ne sont prises en compte qu'au cours de la récupération des trajectoires. Cette conception réduit le risque que des détections faibles ou des faux positifs créent des identités instables, tout en permettant aux détections partielles de contribuer à la récupération lorsque des preuves sémantiques supplémentaires sont disponibles8,11,20. La deuxième étape cruciale est l'extraction de la sémantique du maillot. Les caractéristiques de couleur d'équipe fournissent une contrainte au niveau de l'équipe, tandis que les caractéristiques du numéro du joueur offrent un indice d'identité plus précis lorsque la zone du numéro est visible et lisible35,41,42,43. Les résultats d'analyse par suppression indiquent que ces indices sont particulièrement utiles dans les cas d'interactions denses entre joueurs de la même équipe et d'occultations, où l'association basée uniquement sur le mouvement est moins fiable. Toutefois, la sémantique du maillot doit être considérée comme une preuve auxiliaire et non comme un remplacement complet de l'association par mouvement. Les numéros de joueur peuvent être illisibles en cas de flou, de troncature, de posture dos tourné, d'occultation sévère ou de faible résolution d'image. De même, les caractéristiques de couleur d'équipe ne permettent pas de distinguer les athlètes d'une même équipe lorsque l'information sur le numéro n'est pas disponible35,42,43. Les résultats sur des jeux de données croisés clarifient davantage la portée de la méthode. JerseyTrack s'applique plus naturellement à des ensembles de données de sports collectifs qu'à des ensembles de données généraux de suivi de piétons (MOT), car la branche sémantique a été conçue autour des indices de couleur du maillot et du numéro du joueur19,33,34,35,36,37. Sur des ensembles de données MOT généraux, le composant d'association guidée par la confiance reste applicable, mais la branche sémantique spécifique aux sports apporte moins d'informations d'identité. La méthode est donc particulièrement adaptée aux vidéos de sports collectifs dans lesquelles les athlètes portent des tenues distinctes et où la zone du maillot est suffisamment visible pour permettre l'extraction sémantique19,33,34,35,36,37.

Plusieurs limitations persistent. Premièrement, la méthode dépend de la qualité des sorties du détecteur ; des détections manquées importantes ou des boîtes englobantes inexactes réduisent la fiabilité de la prédiction du mouvement et du rognage sémantique14,17,46. Deuxièmement, la ré-identification à long terme hors champ n’a pas été optimisée séparément dans l’implémentation actuelle. Lorsqu’un athlète quitte le champ de la caméra pendant une période prolongée puis y réapparaît, la stratégie actuelle de récupération de trajectoire pourrait ne pas suffire à restaurer l’identité d’origine19,34. Troisièmement, un fond très encombré, des joueurs superposés, un flou de mouvement et des numéros de maillot illisibles peuvent réduire la fiabilité des caractéristiques sémantiques14,35,42,46. Quatrièmement, l’évaluation actuelle s’est concentrée sur des ensembles de données de référence publics et des réglages de perturbation contrôlés ; le déploiement dans des vidéos de diffusion comportant des changements de caméra, des zooms et des points de vue non standard pourrait nécessiter un prétraitement supplémentaire ou des modules de ré-identification19,33,34.

L'implication pratique principale est que l'association guidée par la confiance et les indices sémantiques spécifiques aux maillots peuvent être intégrés dans un pipeline modulaire de suivi d'objets multiples (MOT) sans modifier la structure du détecteur. Cette capacité s'applique à des tâches d'analyse sportive telles que l'extraction des trajectoires des athlètes, l'analyse des déplacements d'équipe, l'examen des événements tactiques et l'annotation vidéo semi-automatique1,4,33,36. Les travaux futurs devraient se concentrer sur une réidentification plus robuste hors champ, la gestion des perturbations de fond, l'agrégation de caractéristiques temporelles et une reconnaissance plus fiable des numéros de joueurs en cas de flou important ou d'occultation14,19,34,46.

En résumé, JerseyTrack est une méthode MOT appliquée au sport qui combine une association guidée par la confiance avec une fusion sémantique des maillots. La méthode partitionne les détections en groupes à haute, moyenne et faible confiance, et applique différentes règles d'association selon la fiabilité des détections, tout en utilisant la couleur du maillot et les indices du numéro du joueur comme informations d'identité auxiliaires durant l'association à confiance moyenne et la reconstruction des trajectoires. Dans le cadre de validation SportsMOT évalué, JerseyTrack a démontré une précision de suivi et une préservation de l'identité améliorées par rapport aux configurations de référence évaluées. Les résultats d'analyse par suppression ont montré que la configuration complète réduit les changements d'identité par rapport à la configuration de base et aux variantes à module unique, tandis que la comparaison sur le jeu de référence a révélé des valeurs plus élevées pour les métriques principales de suivi dans des conditions partagées de sortie du détecteur et de configuration d'évaluation. Ces résultats soutiennent l'utilisation de l'information par niveau de confiance et des indices sémantiques spécifiques au maillot pour le suivi des athlètes dans les vidéos de sports collectifs, particulièrement lorsque les zones des maillots sont visibles et que les informations sur la couleur de l'équipe ou le numéro du joueur fournissent des preuves complémentaires d'identité20,35,46. La prise en compte des limitations identifiées pourrait améliorer davantage l'applicabilité du flux de travail proposé à des scénarios de suivi sportif plus complexes.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts financier.

Remerciements

Les auteurs n'ont aucune reconnaissance à déclarer.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Runtime CUDANVIDIAVersion 12.8Runtime de calcul GPU utilisé pour l'entraînement du détecteur, l'extraction de caractéristiques sémantiques et l'inférence de suivi.
EasyOCRJaided AIVersion 1.7.2Kit d'outils de reconnaissance optique de caractères utilisé pour la reconnaissance des numéros de joueurs.
Code source de JerseyTrackAuteursN/AImplémentation personnalisée contenant les scripts de préparation des données, d'extraction de caractéristiques sémantiques, de partitionnement de confiance, de suivi, de post-traitement et d'évaluation. Disponible à l'adresse : https://doi.org/10.5281/zenodo.21274352
Modèle OCR CRNN légerAuteursN/ARéseau neuronal convolutif récurrent (CRNN) personnalisé utilisé pour la reconnaissance des numéros de joueurs.
Jeu de données MOT17MOTChallengeN/AJeu de données de référence public utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://motchallenge.net/data/MOT17/
Jeu de données MOT20MOTChallengeN/AJeu de données de référence public utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://motchallenge.net/data/MOT20/
motmetricsDéveloppeurs de motmetricsVersion 1.4.0Bibliothèque utilisée pour le calcul des métriques diagnostiques de suivi multi-objets.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Unité de traitement graphique utilisée pour l'entraînement du détecteur et l'inférence de suivi.
Pilote GPU NVIDIANVIDIAVersion 610.62Pilote GPU utilisé dans l'environnement expérimental.
NumPyDéveloppeurs de NumPyVersion 2.4.4Bibliothèque de calcul numérique utilisée pour le traitement des caractéristiques et la gestion des données.
OpenCVOpenCVVersion 4.10.0Bibliothèque de vision par ordinateur utilisée pour le chargement, le rognage, le prétraitement et la visualisation des images.
PythonFondation Python SoftwareVersion 3.12.2Langage de programmation utilisé tout au long du flux de travail.
PyTorchFondation PyTorchVersion 2.11.0+cu128Framework d'apprentissage profond utilisé pour l'implémentation du détecteur et du modèle sémantique.
scikit-learnDéveloppeurs de scikit-learnVersion 1.9.0Bibliothèque d'apprentissage automatique utilisée pour le regroupement par K-moyennes lors de l'extraction des couleurs des maillots et du partitionnement de confiance.
Jeu de données SoccerNet TrackingSoccerNetN/AJeu de données de référence public pour le suivi en football, utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://www.soccer-net.org/tasks/tracking
Jeu de données SportsMOTBenchmark SportsMOTN/AJeu de données de référence principal utilisé pour la préparation du détecteur et l'évaluation du suivi. Disponible à l'adresse : https://deeperaction.github.io/datasets/sportsmot.html
Jeu de données TeamTrackBenchmark TeamTrackN/AJeu de données de référence public pour le suivi en sport, utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://atomscott.github.io/TeamTrack/
TorchvisionFondation PyTorchVersion 0.26.0+cu128Bibliothèque de vision par ordinateur utilisée avec PyTorch pour les transformations d'images et le support des modèles.
TrackEvalDéveloppeurs de TrackEvalVersion 1.3.0Kit d'évaluation utilisé pour calculer la précision du suivi multi-objets (MOTA), le score F1 d'identité (IDF1), la précision de suivi d'ordre supérieur (HOTA), la précision de détection (DetA), la précision d'association (AssA), les faux positifs (FP), les faux négatifs (FN) et les changements d'identité (IDs).
UltralyticsUltralyticsVersion 8.4.90Framework de détection d'objets utilisé pour entraîner le détecteur et générer les détections d'athlètes.

Références

  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Suivi guid par la confiancetrajectoire du joueursimilitude de mouvementcouleur du maillotreconnaissance optique de caract rescoh rence de l identitjeu de donn es SportsMOT

Articles connexes