Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Une méthode de suivi multi-objets guidée par la confiance pour les vidéos sportives utilisant la fusion sémantique des maillots

59 vues

DOI :

10.3791/71557

14 août 2026

Dans cet article

Résumé

Ce protocole décrit un flux de travail de suivi multi-objet guidé par la confiance pour les vidéos sportives, qui intègre les informations sur la couleur du maillot et le numéro du joueur afin d'améliorer l'association des trajectoires et la cohérence identitaire en cas de fluctuations de confiance, d'occultations ou d'apparences visuellement similaires entre les athlètes.

Résumé

Le suivi multi-objet (MOT) dans les vidéos sportives fournit des informations de trajectoire pour l'analyse tactique, l'interprétation du comportement des joueurs et l'analyse statistique automatisée. Cependant, les scénarios sportifs impliquent fréquemment des changements brusques de direction, des arrêts soudains, des occultations fréquentes et des coéquipiers visuellement similaires, ce qui entraîne des fluctuations de la confiance en la détection et des confusions d'identité lors de l'association entre trames. Pour relever ces défis, cette étude présente JerseyTrack, une méthode de suivi multi-objet en contexte sportif guidée par la confiance et fondée sur la fusion sémantique des maillots. Le flux de travail partitionne de manière adaptative les boîtes de détection en intervalles de haute, moyenne et faible confiance selon la distribution de confiance de chaque trame. Les détections à haute confiance sont associées principalement selon la similarité de mouvement, tandis que les détections à confiance moyenne et faible intègrent en outre des caractéristiques de couleur du maillot et du numéro du joueur extraites par regroupement chromatique et à l’aide d’un modèle léger de reconnaissance optique de caractères (OCR). Ces caractéristiques sémantiques sont fusionnées avec les informations de mouvement lors de l’appariement complémentaire afin d’améliorer la continuité des trajectoires et la cohérence des identités. La méthode a été évaluée sur le jeu de données SportsMOT. JerseyTrack a atteint une précision de suivi multi-objet (MOTA) de 88,9 %, un score F1 d’identité (IDF1) de 74,3 % et une précision de suivi d’ordre supérieur (HOTA) de 69,9 %, démontrant ainsi une performance améliorée dans le contexte de suivi sportif évalué. Ce protocole fournit un flux de travail reproductible permettant d’intégrer l’association guidée par la confiance avec les informations sémantiques des maillots afin d’améliorer le suivi multi-objet dans les vidéos sportives.

Introduction

Le suivi multi-objets (MOT) permet une localisation continue des objets et le maintien de leur identité dans des séquences vidéo, et soutient l'extraction des trajectoires des athlètes, l'analyse tactique et l'analyse statistique automatisée dans les applications vidéo sportives1,2,3. Des informations visuelles fiables sont également liées à la prise de décision propre à chaque sport et à l'évaluation de la performance en sciences du sport, soulignant davantage la valeur des données de mouvement stables issues de vidéos pour les analyses sportives ultérieures4. Dans les scénarios sportifs, la fiabilité des données tactiques dépend de la continuité des trajectoires de suivi et de la cohérence des identités des cibles.

Contrairement aux scénarios généraux de suivi multi-objets (MOT), les vidéos sportives comportent des changements brusques de direction, des arrêts soudains, des sauts, des interactions denses et des occultations fréquentes. Ces facteurs provoquent des fluctuations importantes de la confiance associée aux boîtes de détection et augmentent la fréquence des détections à faible confiance, ce qui peut interrompre l'association des trajectoires5,6. Les maillots d'équipe uniformes réduisent davantage la capacité discriminante des caractéristiques d'apparence générales et augmentent la confusion d'identité entre des coéquipiers visuellement similaires7,8. Lorsque l'occultation et la similarité d'apparence se produisent dans la même séquence, la confiance de détection diminue et les informations sur l'apparence de la cible deviennent incomplètes, ce qui accroît la difficulté d'association des trajectoires et de maintien de l'identité9,10. En suivi multi-objets, la ré-identification (Re-ID) désigne le processus d'association de la même identité de cible à travers les images, les périodes d'occultation ou les cas de réapparition, en utilisant des indices visuels liés à l'identité. Dans les vidéos de sports collectifs, les indices généraux de Re-ID peuvent être affaiblis car les athlètes d'une même équipe partagent souvent des tenues et des morphologies corporelles similaires. L'examen de la littérature technique indique que la fragmentation des trajectoires et la confusion d'identité dans le suivi multi-objets appliqué aux sports sont généralement abordées selon deux approches complémentaires : l'exploitation de la confiance de détection et le renforcement des indices d'identité. JerseyTrack s'inscrit à l'intersection de ces deux approches en régulant l'utilisation des indices sémantiques liés au maillot selon la qualité de la détection, plutôt qu'en appliquant uniformément les informations de couleur et du numéro du joueur à toutes les détections.

Cette étude présente JerseyTrack, une méthode de suivi multi-objectif (MOT) dans les sports assistée par la confiance et fondée sur la fusion sémantique des maillots. La méthode est conçue pour des vidéos de sports collectifs dans lesquelles les athlètes portent des maillots visibles et où les résultats de détection fournissent des boîtes englobantes accompagnées de scores de confiance. JerseyTrack combine quatre composants principaux : la détection des athlètes, la partition selon le niveau de confiance, l'extraction de caractéristiques sémantiques des maillots et l'association inter-images en cascade. La confiance associée à la détection est utilisée pour partitionner de manière adaptative les détections en groupes à haute, moyenne et faible confiance, qui sont ensuite traités selon des stratégies d'association différentes. Les détections à haute confiance sont principalement associées à l'aide d'informations de mouvement, tandis que les détections à confiance moyenne ou faible intègrent en outre des informations sur la couleur du maillot et le numéro du joueur afin d'améliorer le maintien de l'identité lorsque les indices visuels sont faibles. Cette méthode est destinée à des tâches d'analyse de vidéos sportives nécessitant des trajectoires d'athlètes stables, telles que l'analyse tactique ou l'interprétation du comportement des joueurs.

L'approche proposée présente également des limitations opérationnelles. L'extraction sémantique du maillot peut être affectée par une occultation sévère, un flou de mouvement, une faible résolution d'image, des poses anormales du maillot ou des numéros de joueur invisibles. Dans ces cas, les indices sémantiques basés sur le maillot peuvent devenir incomplets, et le processus d'association dépend davantage de la cohérence du mouvement et de la vérification multi-image. Par conséquent, les affirmations sur les performances dans cette étude sont limitées aux jeux de données évalués et aux conditions expérimentales testées. Des expériences menées sur le jeu de données SportsMOT montrent que JerseyTrack améliore les métriques de suivi évaluées et réduit les changements d'identité dans les conditions de suivi sportif testées. La principale difficulté du suivi multi-objet (MOT) dans les vidéos sportives réside dans le maintien de la continuité des trajectoires et de la cohérence des identités en présence de mouvements rapides, d'occultations et de similitudes d'apparence. Les études existantes liées à JerseyTrack peuvent être regroupées en deux grandes directions de recherche : l'utilisation de la confiance de détection pour l'association de trajectoires et le renforcement des indices d'identité grâce à des caractéristiques sémantiques spécifiques aux sports.

La confiance de détection est largement utilisée pour estimer la fiabilité des boîtes de détection et guider l'association des trajectoires en suivi multi-objets (MOT). Les premières méthodes de suivi traitaient généralement la confiance comme un critère binaire de filtrage, dans lequel les détections situées en dessous d'un seuil fixe étaient supprimées afin de réduire les faux positifs11,12. Cette stratégie permet de réduire les détections bruitées, mais peut également éliminer des cibles réelles en cas d'occultation, de mouvement rapide ou de faible qualité d'image, entraînant une fragmentation des trajectoires13,14,15. Des stratégies de filtrage similaires ont également montré que les seuils de confiance fixes sont sensibles aux variations de scène et à la qualité des détections16,17. Pour améliorer l'utilisation des détections à faible confiance, ByteTrack a introduit une stratégie d'association qui conserve les boîtes à faible confiance comme cibles candidates pour une correspondance secondaire, en les reliant aux trajectoires existantes grâce à la similarité de mouvement et à l'historique des trajectoires18. McByte étend davantage l'association en MOT sportif en intégrant des masques de segmentation propagés temporellement comme indice d'association, améliorant ainsi la robustesse en cas de mouvement rapide, d'occultation ou de changement de caméra, sans entraînement supplémentaire par vidéo19. D'autres études ont également ajusté l'utilisation des détections à faible confiance afin de conserver des cibles faibles mais potentiellement valides durant l'association20,21,22. Les stratégies d'association adaptatives selon la confiance ont ensuite affiné les critères d'appariement en fonction de la cohérence du mouvement et de la fiabilité des détections23,24,25. Des méthodes d'affinement des trajectoires basées sur la régression des boîtes de détection et l'optimisation de la régularité des trajectoires ont également été utilisées pour réduire la fragmentation des trajectoires26,27,28. D'autres stratégies d'affinement apportent un soutien complémentaire pour maintenir la continuité des trajectoires dans des conditions de mouvement complexes29. Le flux temporellement cohérent des objets modélise davantage la cohérence temporelle au niveau objet entre les images, offrant ainsi une autre approche orientée association pour réduire les interruptions de trajectoire dans des scénarios MOT complexes30. Les méthodes de fusion de traqueurs s'appuient également sur les sorties de plusieurs traqueurs et utilisent des stratégies de sélection ou de fusion apprises afin d'améliorer la robustesse du suivi sur différents benchmarks MOT31. Collectivement, ces études indiquent que l'association tenant compte de la confiance aide à récupérer les trajectoires interrompues ; toutefois, la confiance et les indices de mouvement fournissent des informations d'identité limitées lorsque les joueurs d'une même équipe ont des apparences visuelles similaires. Bien que ces méthodes atténuent efficacement la fragmentation des trajectoires dans des scénarios généraux, elles présentent des limitations inhérentes dans les contextes sportifs, car les joueurs d'une même équipe ont souvent des apparences visuelles très proches, et le fait de s'appuyer uniquement sur la confiance et les informations de mouvement ne permet pas de différencier suffisamment les identités32,33,34. Même lorsque les boîtes à faible confiance sont correctement rappelées, la similarité des caractéristiques peut encore entraîner des inversions d'identité, rendant difficile le respect des exigences strictes de cohérence identitaire en analyse sportive.

Des indices d'identité spécifiques aux sports ont également été utilisés pour améliorer la discrimination d'identité dans le suivi des athlètes. Les informations sémantiques du maillot, telles que la couleur de l'équipe et le numéro du joueur, fournissent des indices d'identité plus directement liés aux scénarios sportifs que les intégrations d'apparence générale35,36,37. La couleur du maillot a été utilisée pour faciliter la discrimination au niveau de l'équipe et réduire la confusion entre équipes, tandis que la reconnaissance du numéro du joueur offre un indice d'identité plus précis lorsque la zone du numéro est visible et lisible38,39. Des études existantes sur le suivi en sport ont intégré des caractéristiques visuelles spécifiques au domaine et la reconnaissance de la couleur du maillot afin d'améliorer l'association des joueurs dans des conditions sportives encombrées40,41. Des travaux connexes sur la reconnaissance du numéro du maillot et l'utilisation de données numériques synthétiques soutiennent davantage la modélisation de l'identité dans des conditions de faible résolution ou d'occultation partielle42,43. Ces études indiquent que la sémantique du maillot peut renforcer la représentation de l'identité dans le suivi multi-objets en sport (sports MOT). Toutefois, la plupart des méthodes de suivi améliorées par la sémantique ne modélisent pas suffisamment la relation entre la confiance de détection et la qualité des caractéristiques sémantiques. Les détections à haute confiance contiennent souvent déjà des informations spatiales et d'apparence fiables, rendant l'extraction sémantique répétée moins efficace. Les détections à faible confiance souffrent fréquemment d'occultation, de flou, de troncature ou de faible résolution, ce qui réduit la fiabilité des indices de couleur et de numéro de joueur. Cette limitation motive une conception d'association guidée par la confiance, dans laquelle la sémantique du maillot est introduite en fonction de la qualité de la détection plutôt que d'être appliquée uniformément à toutes les détections. Les études examinées montrent que l'association tenant compte de la confiance et la modélisation sémantique du maillot abordent des aspects différents du suivi multi-objets en sport. Les stratégies fondées sur la confiance déterminent principalement si une détection doit participer à l'association et comment elle doit être appariée avec les trajectoires existantes, tandis que les stratégies sémantiques du maillot renforcent principalement la représentation de l'identité à l'aide d'indices spécifiques au sport. Toutefois, ces deux mécanismes sont souvent conçus comme des composants séparés. En conséquence, les indices sémantiques ne sont pas toujours ajustés en fonction de la qualité de détection, et les niveaux de confiance ne régulent pas directement l'utilisation des informations de couleur et de numéro de joueur durant l'association. Cette séparation limite la gestion conjointe de la fragmentation des trajectoires et de la confusion d'identité dans les vidéos de sports collectifs. Le manque de recherche restant réside dans la liaison entre l'évaluation de la qualité de la confiance de détection et l'association sémantique du maillot au sein d'un même flux de travail de suivi.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude a impliqué une analyse secondaire de jeux de données vidéo de référence accessibles au public, à savoir SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 et MOT20. Aucun participant n’a été recruté, aucune intervention n’a été réalisée et aucune donnée nouvelle concernant des sujets humains n’a été collectée. Une approbation par un comité d’éthique n’était pas requise pour cette étude selon les exigences institutionnelles applicables de l’université Bangkok Thonburi.

Le protocole suivant décrit le flux de travail utilisé pour reproduire JerseyTrack, depuis la préparation des données jusqu'à l'évaluation du suivi. Ce flux de travail comprend la préparation du jeu de données, la préparation du détecteur, l'extraction sémantique des maillots, la partition selon le niveau de confiance, l'association guidée par la confiance, l'inférence de suivi et l'évaluation des performances, comme résumé dans la Figure 1. Les logiciels, jeux de données et ressources matérielles requis sont listés dans le Tableau des matériaux.

Extraction des caractéristiques du maillot à l'aide de caractéristiques d'apparence ; prédiction d'état ; processus d'association de données.
Figure 1. Flux global de la méthode JerseyTrack. Le flux comprend l'extraction de caractéristiques sémantiques du maillot, l'appariement initial des objets, un appariement complémentaire guidé par la confiance et la fusion de caractéristiques. Les caractéristiques de couleur d'équipe et de numéro de joueur sont extraites des régions détectées des athlètes et intégrées au processus d'association afin d'améliorer la correspondance des trajectoires dans des conditions de détection incertaines. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

1. Préparer les ensembles de données et la structure des répertoires

  1. Téléchargez les jeux de données de référence publics répertoriés dans le Tableau des matériaux. Utilisez SportsMOT comme jeu de données principal pour la préparation du détecteur et l'évaluation du suivi. Conservez TeamTrack, SoccerNet Tracking, MOT17 et MOT20 pour l'évaluation inter-jeux de données.
  2. Stockez tous les jeux de données dans un répertoire de projet unifié. Assurez-vous que le détecteur, le module d'extraction sémantique, le module de suivi et le kit d'évaluation utilisent des identifiants de séquences identiques.
  3. Convertissez les annotations officielles de SportsMOT au format d'entraînement du détecteur à l'aide du script de préparation des données utilisé dans cette étude. Exécutez la commande suivante :
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Le script de préparation des données (scripts/prepare_data.py) est disponible dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Les dépendances logicielles requises sont précisées dans environment.yml, notamment Python 3.12, PyTorch 2.11.0 et OpenCV 4.10 ou ultérieur. Configurez l'environnement logiciel à l'aide de la commande suivante : conda env create -f environment.yml. Exécutez le script de préparation des données à l'aide de la commande suivante : python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Vérifiez que la conversion génère le fichier de configuration pour l'entraînement du détecteur : data\processed\SportsMOT_yolo\data.yaml et le manifeste de conversion : data\processed\SportsMOT_yolo\conversion_manifest.csv.
    REMARQUE : Dans cette étude, le jeu de données SportsMOT converti pour l'entraînement et la validation comprenait 90 séquences, 55 544 images et 608 152 objets annotés.
  6. Examinez des séquences représentatives afin de vérifier que l'ordre des images, les coordonnées des boîtes englobantes et les étiquettes d'identité restent cohérents avec les annotations de référence d'origine.
  7. Conservez les fichiers d'annotations convertis sans modification tout au long de la préparation du détecteur, de l'inférence du suivi et de l'évaluation, afin que toutes les méthodes utilisent la même partition du jeu de données et le même protocole d'évaluation.
    REMARQUE : Le résultat attendu de cette section est un répertoire standardisé de formation du détecteur SportsMOT contenant les annotations converties, le manifeste de conversion et les fichiers de répartition du jeu de données nécessaires à la préparation du détecteur et à l'évaluation du suivi.

2. Préparer les sorties du détecteur

  1. Ajustez finement le détecteur d'objets à l'aide de la partition d'entraînement SportsMOT préparée. Optimisez le détecteur en utilisant la perte de classification et la perte de régression de la boîte englobante définies dans l'équation 1. Utilisez la résolution d'entrée du détecteur, la taille du lot, le taux d'apprentissage, le nombre d'époques d'entraînement et les autres paramètres d'entraînement indiqués dans la configuration de mise en œuvre et dans le Tableau des matériaux
    Ldet = Lcls + Lbox   (1)
    Ici, Ldet  désigne la perte totale du détecteur, Lcls  désigne la perte de classification, Lbox  et désigne la perte de régression de la boîte englobante.
    REMARQUE : Le point de contrôle (checkpoint) du détecteur utilisé dans les expériences principales (identifiant interne de l'expérience e3) a été entraîné à l'aide du cadre Ultralytics YOLO avec la configuration de jeu de données SportsMOT au format YOLO (data/processed/SportsMOT_yolo/data.yaml). Exécutez l'entraînement du détecteur à l'aide de la commande suivante : yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Après l'entraînement, utilisez le point de contrôle ayant donné les meilleures performances pour générer les sorties du détecteur pour les séquences de validation à l'aide de la commande suivante : python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Enregistrez le point de contrôle du détecteur entraîné, le fichier de métadonnées correspondant et le journal d'entraînement après l'entraînement.
    REMARQUE : Dans cette étude, le point de contrôle du détecteur utilisé pour les expériences formelles a été enregistré sous le nom :
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Le fichier de métadonnées correspondant a été enregistré sous le nom : outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Le répertoire de sortie du détecteur utilisé pour les expériences principales de validation SportsMOT était : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Exécutez le détecteur entraîné sur chaque séquence de validation afin de générer les boîtes englobantes des athlètes et les scores de confiance. Exportez un fichier de détection par séquence contenant l'indice de trame, les coordonnées de la boîte englobante, la confiance de détection et l'étiquette de classe.
    REMARQUE : Dans l'exécution de validation SportsMOT utilisée pour les expériences principales, un seuil de confiance de 0,05 a produit 343 990 détections d'athlètes.
  4. Inspectez le répertoire de sortie du détecteur avant l'inférence de suivi. Vérifiez que chaque séquence possède un fichier de détection correspondant, que les indices de trame correspondent à la séquence d'images préparée, et que chaque enregistrement de détection contient un score de confiance.
    REMARQUE : Le résultat attendu de cette section est un répertoire de sortie du détecteur complet qui servira d'entrée pour l'extraction sémantique des maillots, la partition par niveau de confiance et l'association dans le suivi.

3. Extraire les caractéristiques sémantiques du maillot

  1. Utilisez les fichiers de sortie du détecteur pour recadrer les régions des athlètes dans chaque image vidéo. Enregistrez chaque image d'athlète recadrée avec son identifiant de séquence, son index d'image et son index de détection. Excluez les recadrages non valides dont le contenu image est manquant ou dont les boîtes englobantes s'étendent au-delà des limites de l'image. Conservez le lien entre chaque nom de fichier recadré et son enregistrement de détection d'origine afin que les caractéristiques sémantiques extraites puissent être associées à la détection correspondante lors de l'appariement en suivi.
  2. Extrayez les caractéristiques de couleur du maillot à partir des images d'athlètes recadrées à l'aide du script d'extraction sémantique utilisé dans cette étude.
    NOTE : Les scripts d'extraction de caractéristiques sémantiques (scripts/extract_fast_color_semantics.py et scripts/formal_extract_semantics.py) sont disponibles dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Aucun fichier de configuration distinct n'est requis ; tous les paramètres d'exécution sont fournis via les arguments en ligne de commande.
    Générez descripteurs de couleur du maillot à l'aide de la commande suivante : python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Générez les caractéristiques sémantiques du numéro de joueur à l'aide du modèle OCR avec la commande suivante : python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Les descripteurs de couleur du maillot et les probabilités prédites pour le numéro de joueur sont associés par identifiant de séquence et regroupés dans les fichiers de caractéristiques sémantiques utilisés lors de l'association en suivi.
  3. Convertissez chaque image d'athlète recadrée dans l'espace colorimétrique Teinte, Saturation, Valeur (HSV). Extrayez les pixels de premier plan situés dans la région du maillot et résumez la couleur dominante du maillot à l'aide d'un regroupement par K-moyennes avec K = 3. Normalisez le descripteur de couleur obtenu à l'aide d'une normalisation L2 avant la comparaison des caractéristiques.
  4. Entraînez la branche de reconnaissance du numéro de joueur à l'aide d'images d'athlètes recadrées ayant une taille d'entrée de 128 × 64 pixels. Générez des pseudo-étiquettes pour le numéro de joueur à l'aide de la procédure d'étiquetage faiblement supervisée utilisée dans cette étude. Excluez les recadrages dont la zone du numéro de joueur est invisible, illisible, fortement occultée ou présente une faible confiance, du calcul de la perte OCR.
  5. Optimisez la branche OCR à l'aide de la perte d'entropie croisée définie dans l'Équation 2.
    Formule de la perte d'entropie croisée \(L_{ocr}=-\sum_{i=1}^{N}y_i\log(\hat{y}_i)\), équation pour la classification. (2)
    Ici, Locr désigne la perte OCR, yi désigne l'étiquette supervisée du numéro de joueur, et Équation de régression polynomiale, ŷᵢ=β₀+β₁xᵢ+…+βₙxᵢⁿ, graphique d'analyse statistique désigne la catégorie prédite du numéro de joueur.
  6. Optimisez le module d'extraction de caractéristiques sémantiques à l'aide de l'optimiseur adaptatif, du taux d'apprentissage, de la taille du lot, de la décroissance du poids et de la durée d'entraînement indiqués dans le Tableau des Matériaux. Combinez la perte du détecteur et la perte OCR à l'aide de l'objectif total d'entraînement défini dans l'Équation 3.
    Ltotal = Ldet + γLocr   (3)
    Ici, Ltotaldésigne la perte totale d'entraînement, Ldet désigne la perte du détecteur définie dans l'Équation 1, Locr désigne la perte OCR définie dans l'Équation 2, et γ désigne le coefficient de pondération défini par l'utilisateur pour la perte OCR.
  7. Appliquez la branche OCR entraînée à chaque image d'athlète recadrée. Enregistrez la catégorie prédite du numéro de joueur ou le vecteur de probabilité pour chaque recadrage. Si le numéro de joueur n'est pas visible ou si la confiance OCR est inférieure au seuil défini dans l'implémentation, indiquez que la caractéristique du numéro de joueur est indisponible plutôt que de forcer une prédiction.
  8. Combinez le descripteur de couleur du maillot et la sortie du numéro de joueur dans le fichier de caractéristiques sémantiques utilisé par le module de suivi.
    NOTE : Dans le principal test de validation SportsMOT, le script d'extraction sémantique a traité 343 990 détections sans images manquantes ni recadrages non valides. Dans le package de révision actuel, le résumé de l'extraction sémantique a indiqué une précision globale d'extraction des caractéristiques sémantiques (couleur et OCR) de 86,7 % dans le contexte SportsMOT évalué. Le résultat attendu de cette section est un fichier de caractéristiques sémantiques dans lequel chaque enregistrement de détection valide est associé à un descripteur de couleur du maillot, à une sortie du numéro de joueur lorsqu'elle est disponible, et à un indicateur précisant si des informations sémantiques sont disponibles pour l'association en suivi.

4. Niveaux de confiance pour la détection des partitions

  1. Charger le fichier de sortie du détecteur pour chaque séquence vidéo. Collecter les scores de confiance de toutes les détections d'athlètes dans chaque image.
  2. Partitionner les scores de confiance au niveau des images en intervalles de confiance élevée, moyenne et faible à l’aide du regroupement par K-moyennes avec K = 3, selon le flux de travail d’association guidé par la confiance illustré dans la Figure 2. Déterminer les seuils de confiance adaptatifs en minimisant la variance intra-cluster selon la Équation 4.
    Formule du symbole d'équilibre statique ; J_conf=min Σ(sd-μ_i)^2 ; optimisation mathématique.  (4)
    Ici, sd désigne le score de confiance de la détection d ; D1, D2 et D3 désignent respectivement les intervalles de confiance élevée, moyenne et faible ; μ1, μ2 et μ3 désignent les scores moyens de confiance des trois intervalles ; et τ1 et τ2 désignent les seuils de confiance adaptatifs obtenus à partir des résultats du regroupement par K-moyennes.
    REMARQUE : Le script de partitionnement de la confiance (scripts/formal_partition_confidence.py) est disponible dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Le module de partitionnement utilise une procédure de regroupement unidimensionnel par K-moyennes basée sur NumPy avec K = 3. Aucun fichier de configuration séparé n’est requis ; le répertoire d’entrée, le répertoire de sortie et le paramètre de regroupement sont spécifiés via les arguments de ligne de commande. Exécuter la procédure de partitionnement de la confiance à l’aide de la commande suivante : python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Les dépendances logicielles requises, y compris la version de NumPy, sont précisées dans environment.yml.
  3. Exécuter la procédure de partitionnement de la confiance en utilisant le répertoire de sortie du détecteur comme entrée.
    REMARQUE : Dans cette étude, le répertoire de sortie du détecteur était : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Le répertoire de sortie du partitionnement de la confiance était : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Les fichiers de sortie générés comprenaient les fichiers CSV de confiance par séquence, _confidence_frame_summary.csv et _confidence_runtime.csv.
  4. Attribuer une étiquette de niveau de confiance à chaque détection. Étiqueter les détections à haute confiance pour l’association basée sur le mouvement, les détections à confiance moyenne pour l’association mouvement-sémantique, et les détections à faible confiance uniquement pour la récupération de trajectoire. Conserver le score de confiance d’origine conjointement à l’étiquette de niveau de confiance attribuée.
  5. Examiner les distributions des scores de confiance et les images représentatives, comme illustré dans la Figure 3. Vérifier que les détections à haute confiance correspondent principalement à des boîtes englobantes complètes et fiables des athlètes, tandis que les détections à confiance moyenne et faible contiennent principalement des détections partielles, occultées, floues ou faibles.
    REMARQUE : Le résultat attendu de cette section est un fichier de partitionnement de la confiance contenant l’indice de détection, le score de confiance d’origine, le niveau de confiance attribué et les seuils de confiance adaptatifs au niveau des images pour chaque détection.

Analyse vidéo guidée par la confiance ; schéma avec regroupement par K-moyennes et calculs d'intervalles pour la corrélation.
Figure 2. Stratégie d'association guidée par la confiance. Le flux de travail divise la confiance des détections en intervalles de confiance élevée, moyenne et faible à l'aide d'un regroupement adaptatif par confiance. Les détections à haute confiance sont associées selon la similarité de mouvement, celles à confiance moyenne selon une similarité combinée de mouvement et de sémantique du maillot, et celles à faible confiance sont utilisées pour la récupération assistée par sémantique des trajectoires, avec une vérification sur plusieurs images. Le panneau droit résume la formulation mathématique utilisée pour la partition de la confiance et l'association. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Histogramme comparant les décisions sportives par intervalle de confiance ; football, basketball, volley-ball.
Figure 3. Répartition des scores de confiance de détection. L'histogramme montre le nombre de boîtes de détection d'athlètes réparties en cinq intervalles de confiance pour les séquences de football, de basketball et de volley-ball du jeu de données SportsMOT. Cette répartition illustre les différences de confiance du détecteur entre les catégories sportives évaluées. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

5. Exécuter une association guidée par la confiance

  1. Chargez le fichier de sortie du détecteur, le fichier de caractéristiques sémantiques et le fichier de partition de confiance pour chaque séquence vidéo. Initialisez le traqueur à l’aide des premières détections valides et maintenez un état de trajectoire pour chaque athlète suivi. Pour chaque image suivante, prédisez la position de chaque trajectoire existante à l’aide du modèle de mouvement du filtre de Kalman.
  2. Calculez la similarité de mouvement entre chaque trajectoire prédite et chaque détection candidate à l’aide de la distance de Mahalanobis définie dans Équation 5.
    Formule mathématique pour l'équilibre statique, équation : S_mot(t_i^k,d_j) avec matrice de covariance.  (5)
    Ici, équilibre statique, ΣFx=0, ΣFy=0, diagramme d'équilibre des forces, concept de physique, technique de résolution de problèmes désigne la trajectoire I-ème dans l’image k, Diagramme d'équilibre statique, ΣFx=0, affichant des vecteurs de force et l'équilibre, tableau pédagogique de physique. désigne l’état prédit par Kalman de la trajectoire, dj désigne la détection candidate, Équation d'équilibre statique Σi^{-1} ; diagramme avec symboles mathématiques à usage pédagogique. désigne la matrice de covariance inverse de l’état prédit de la trajectoire, et Smot désigne la distance de mouvement entre la trajectoire prédite et la détection.
    REMARQUE : Le flux de travail principal d’association est implémenté dans jerseytrack/formal_tracker.py et exécuté via scripts/formal_track.py, disponibles tous deux dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Aucun fichier de configuration distinct n’est requis. Tous les paramètres d’exécution, y compris les seuils de confiance, l’âge maximal de la trajectoire, les coefficients de poids du mouvement et le poids de la distance au centre, sont fournis via des arguments en ligne de commande. La commande d’exécution complète et les paramètres sont indiqués à l’étape 6.2. L’implémentation utilise l’algorithme d’affectation par somme linéaire de SciPy pour l’appariement hongrois et NumPy pour l’association basée sur les coûts.
  3. Exécutez le flux de travail de suivi en utilisant comme entrées le fichier de sortie du détecteur, le fichier de caractéristiques sémantiques et le fichier de partition de confiance.
    REMARQUE : Dans cette étude, le traqueur principal a été implémenté dans jerseytrack\formal_tracker.py, et le flux de travail de suivi a été exécuté à l’aide de scripts\formal_track.py.
  4. Associez les détections à haute confiance aux trajectoires existantes en utilisant la cohérence de mouvement. Mettez à jour les trajectoires appariées et initialisez de nouvelles trajectoires uniquement lorsque des détections non appariées à haute confiance satisfont les critères d’initialisation de trajectoire.
  5. Examinez les sorties d’extraction sémantique du maillot illustrées dans Figure 4, puis construisez le vecteur de caractéristiques sémantiques du maillot pour chaque détection en combinant le descripteur de couleur d’équipe et la caractéristique du numéro de joueur selon Équation 6.
    fsem = [fcol;fid] (6)
    Ici, fsem  désigne le vecteur de caractéristiques sémantiques fusionné, fcol désigne le descripteur de couleur d’équipe, et fid désigne la caractéristique du numéro de joueur générée par la branche OCR.
  6. Associez les détections à confiance moyenne en combinant la similarité de mouvement avec la similarité sémantique du maillot. Calculez le score d’appariement fusionné selon Équation 7.
    Équation de fusion du score de mouvement et sémantique, Sf=λ(Sm/max(Sm))+(1-λ)(1-Sem). (7)
    Ici, Ssem désigne la similarité cosinus entre les vecteurs de caractéristiques sémantiques de la trajectoire et de la détection candidate, Smot désigne la distance de mouvement définie dans Équation 5, et λ désigne le coefficient de fusion adaptatif équilibrant les termes de similarité de mouvement et sémantique.
  7. Calculez le coefficient de fusion adaptatif selon Équation 8.
    Équilibre statique ; λ=λ₀exp(-σsd/σmax) ; formule liée à la distribution des contraintes dans les matériaux. (8)
    Ici, λ désigne le coefficient initial de poids du mouvement, σsd désigne l’écart-type des scores de confiance de détection dans l’image courante, et σmax désigne l’écart-type maximal du score de confiance utilisé pour la normalisation.
  8. N’utilisez les détections à faible confiance que pour la récupération de trajectoire. Associez les détections à faible confiance aux trajectoires interrompues uniquement lorsque des informations sémantiques sont disponibles et que les critères de récupération sont satisfaits. Appliquez une vérification multi-image avant de restaurer l’identité d’une trajectoire, et rejetez les détections qui échouent à la vérification.
    REMARQUE : Lorsque la caractéristique du numéro de joueur n’est pas disponible, effectuez l’association en utilisant les informations sémantiques disponibles et la cohérence de mouvement, plutôt que d’imposer une correspondance de numéro de joueur. Le résultat attendu de cette section est un enregistrement de suivi image par image contenant les identités des trajectoires, les boîtes englobantes, les étiquettes de niveau de confiance, les coûts de mouvement, les informations sémantiques et les décisions finales d’association. Dans le jeu de preuves de révision, les résultats de suivi ont été stockés sous : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

Schéma d'analyse d'un match de volley-ball avec données de suivi des joueurs pour des analyses de performance.
Figure 4. Extraction de caractéristiques sémantiques du maillot. Des détections représentatives d'athlètes sont annotées avec les descripteurs de couleur d'équipe et les informations de numéro de joueur générés par le module d'extraction sémantique du maillot. Les caractéristiques sémantiques extraites sont ensuite intégrées à une association de données guidée par la confiance. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

6. Exécuter l'inférence de suivi et exporter les résultats

  1. Exécuter l'inférence de suivi pour chaque séquence vidéo à l'aide des fichiers préparés de sortie du détecteur, des fichiers de caractéristiques sémantiques et des fichiers de partition de confiance. Traiter les images vidéo dans l'ordre chronologique afin que les états des trajectoires, l'historique sémantique et les décisions de récupération des trajectoires soient mis à jour de manière cohérente tout au long de la séquence. Utiliser la même configuration d'inférence pour toutes les séquences évaluées, sauf si un paramètre spécifique au jeu de données est explicitement indiqué.
    NOTE : L'inférence de suivi a été exécutée à l'aide du script/formal_track.py, disponible dans le dépôt source de JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Aucun fichier de configuration séparé n'est requis. Exécuter l'inférence de suivi à l'aide de la commande suivante : python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Tous les paramètres non spécifiés ont conservé les valeurs par défaut enregistrées dans le code source archivé.
  2. Après l'inférence, appliquer la séquence principale de post-traitement à l'aide des commandes suivantes : python scripts/merge_tracklets.py et python scripts/sweep_track_filter.py --min-len 95.
  3. Exporter les résultats du suivi dans le format requis par l'outil d'évaluation. Inclure l'indice de l'image, l'identité de la trajectoire, les coordonnées de la boîte englobante, ainsi que tous les champs requis par le format d'évaluation de référence. Enregistrer un fichier de résultats de suivi pour chaque séquence en utilisant une convention de nommage cohérente, afin que chaque fichier de résultats puisse être associé à son fichier d'annotations de référence correspondant.
  4. Appliquer uniquement les opérations de post-traitement utilisées dans cette étude. Réaliser la fusion des tronçons de trajectoire (tracklets) et le filtrage des trajectoires à l'aide des scripts de post-traitement décrits dans le jeu de révision.
    NOTE : Dans cette étude, le flux de travail de post-traitement a utilisé les scripts suivants :
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Examiner les résultats de suivi exportés avant l'évaluation quantitative. Vérifier que les identités des trajectoires restent numériques et cohérentes au sein de chaque séquence, qu'aucun indice d'image ne manque, et que toutes les boîtes englobantes restent à l'intérieur des limites de l'image.
    NOTE : Le résultat attendu de cette section est un ensemble complet de fichiers de résultats de suivi au niveau des séquences, prêts pour l'évaluation quantitative.

7. Évaluer les performances du suivi

  1. Évaluez les fichiers de résultats de suivi exportés à l'aide de la trousse d'évaluation indiquée dans le Tableau des matériaux. Associez chaque fichier de résultats de suivi au fichier d'annotation de référence et à la partition de jeu de données correspondants. Utilisez la même configuration d'évaluation pour toutes les méthodes comparées afin de garantir que les différences de performance découlent des résultats de suivi et non des paramètres d'évaluation.
  2. Exécutez l'évaluation à l'aide de la commande suivante
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOTE : L'évaluation a été effectuée à l'aide de l'implémentation standard des métriques TrackEval (version 1.3.0) archivée dans le package de reproductibilité JerseyTrack. Aucune modification n'a été apportée aux implémentations des métriques Higher Order Tracking Accuracy (HOTA), CLEAR ou Identity. Le dépôt inclut un script d'exécution au format MOTChallenge situé à l'emplacement evaluation/trackeval/scripts/run_mot_challenge.py, qui configure les chemins vers les jeux de données et les résultats, puis appelle les métriques d'évaluation standard de TrackEval.
  3. Enregistrez les métriques d'évaluation rapportées dans l'article, notamment la précision du suivi multi-objets (MOTA), le score F1 d'identité (IDF1), la précision de suivi d'ordre supérieur (HOTA), la précision de détection (DetA), la précision d'association (AssA), les faux positifs (FPs), les faux négatifs (FNs) et les changements d'identité. Exportez le résumé de l'évaluation sous forme de tableau et conservez les fichiers d'évaluation par séquence pour vérification.
  4. Lors de la comparaison de JerseyTrack avec les méthodes de référence, utilisez la même partition du jeu de données, les mêmes sorties du détecteur et la même configuration d'évaluation pour toutes les méthodes. Enregistrez le jeu de données, la source des sorties du détecteur, la configuration de la trousse d'évaluation et les valeurs des métriques pour chaque comparaison.
  5. Examinez les journaux d'évaluation pour vérifier que toutes les séquences ont été évaluées avec succès et qu'aucun fichier de résultats de suivi n'est manquant.
    NOTE : Dans cette étude, le fichier récapitulatif principal de TrackEval était stocké à l'emplacement suivant : outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Le résultat attendu de cette section est un tableau récapitulatif complet d'évaluation accompagné des fichiers de métriques par séquence, soutenant les Résultats rapportés et permettant une vérification ultérieure.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Cette section présente les résultats quantitatifs et qualitatifs obtenus à partir des expériences d'analyse multi-objets en sport évaluées. Les résultats portent sur la précision du suivi, la préservation des identités, la qualité des associations et la robustesse dans les conditions définies par les jeux de données testés. Les performances indiquées se limitent aux méthodes évaluées, aux jeux de données, aux sorties du détecteur et à la configuration de la trousse d'évaluation décrites dans le protocole et le dispositif...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Cette étude a évalué un flux de travail MOT sportif guidé par la confiance, combinant une partition basée sur la confiance de détection et des indices sémantiques relatifs aux maillots. L'association guidée par la confiance et la fusion de caractéristiques sémantiques ont été étudiées comme stratégies complémentaires permettant d'améliorer l'association des données dans le suivi multi-objet12,20,23,2...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont aucun conflit d’intérêts financier.

Remerciements

Les auteurs n'ont aucune reconnaissance à déclarer.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Runtime CUDANVIDIAVersion 12.8Runtime de calcul GPU utilisé pour l'entraînement du détecteur, l'extraction de caractéristiques sémantiques et l'inférence de suivi.
EasyOCRJaided AIVersion 1.7.2Kit d'outils de reconnaissance optique de caractères utilisé pour la reconnaissance des numéros de joueurs.
Code source de JerseyTrackAuteursN/AImplémentation personnalisée contenant les scripts de préparation des données, d'extraction de caractéristiques sémantiques, de partitionnement de confiance, de suivi, de post-traitement et d'évaluation. Disponible à l'adresse : https://doi.org/10.5281/zenodo.21274352
Modèle OCR CRNN légerAuteursN/ARéseau neuronal convolutif récurrent (CRNN) personnalisé utilisé pour la reconnaissance des numéros de joueurs.
Jeu de données MOT17MOTChallengeN/AJeu de données de référence public utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://motchallenge.net/data/MOT17/
Jeu de données MOT20MOTChallengeN/AJeu de données de référence public utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://motchallenge.net/data/MOT20/
motmetricsDéveloppeurs de motmetricsVersion 1.4.0Bibliothèque utilisée pour le calcul des métriques diagnostiques de suivi multi-objets.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Unité de traitement graphique utilisée pour l'entraînement du détecteur et l'inférence de suivi.
Pilote GPU NVIDIANVIDIAVersion 610.62Pilote GPU utilisé dans l'environnement expérimental.
NumPyDéveloppeurs de NumPyVersion 2.4.4Bibliothèque de calcul numérique utilisée pour le traitement des caractéristiques et la gestion des données.
OpenCVOpenCVVersion 4.10.0Bibliothèque de vision par ordinateur utilisée pour le chargement, le rognage, le prétraitement et la visualisation des images.
PythonFondation Python SoftwareVersion 3.12.2Langage de programmation utilisé tout au long du flux de travail.
PyTorchFondation PyTorchVersion 2.11.0+cu128Framework d'apprentissage profond utilisé pour l'implémentation du détecteur et du modèle sémantique.
scikit-learnDéveloppeurs de scikit-learnVersion 1.9.0Bibliothèque d'apprentissage automatique utilisée pour le regroupement par K-moyennes lors de l'extraction des couleurs des maillots et du partitionnement de confiance.
Jeu de données SoccerNet TrackingSoccerNetN/AJeu de données de référence public pour le suivi en football, utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://www.soccer-net.org/tasks/tracking
Jeu de données SportsMOTBenchmark SportsMOTN/AJeu de données de référence principal utilisé pour la préparation du détecteur et l'évaluation du suivi. Disponible à l'adresse : https://deeperaction.github.io/datasets/sportsmot.html
Jeu de données TeamTrackBenchmark TeamTrackN/AJeu de données de référence public pour le suivi en sport, utilisé pour l'évaluation inter-ensembles. Disponible à l'adresse : https://atomscott.github.io/TeamTrack/
TorchvisionFondation PyTorchVersion 0.26.0+cu128Bibliothèque de vision par ordinateur utilisée avec PyTorch pour les transformations d'images et le support des modèles.
TrackEvalDéveloppeurs de TrackEvalVersion 1.3.0Kit d'évaluation utilisé pour calculer la précision du suivi multi-objets (MOTA), le score F1 d'identité (IDF1), la précision de suivi d'ordre supérieur (HOTA), la précision de détection (DetA), la précision d'association (AssA), les faux positifs (FP), les faux négatifs (FN) et les changements d'identité (IDs).
UltralyticsUltralyticsVersion 8.4.90Framework de détection d'objets utilisé pour entraîner le détecteur et générer les détections d'athlètes.

Références

  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Suivi guidé par la confiancetrajectoire du joueursimilitude de mouvementcouleur du maillotreconnaissance optique de caractèrescohérence de l'identitéjeu de données SportsMOT