Cette section présente les résultats quantitatifs et qualitatifs obtenus à partir des expériences d'analyse multi-objets en sport évaluées. Les résultats portent sur la précision du suivi, la préservation des identités, la qualité de l'association et la robustesse dans les conditions définies par les jeux de données testés. Les performances indiquées se limitent aux méthodes évaluées, aux jeux de données, aux sorties du détecteur et à la configuration de l'outil d'évaluation décrits dans le protocole et le paramétrage de mise en œuvre.
Dispositif expérimental et conception de l'évaluation
Jeu de données et prétraitement :
SportsMOT a été utilisé comme référence principale pour la préparation du détecteur, l'inférence du suivi et l'évaluation quantitative. L'ensemble de données comprend 240 séquences vidéo et plus de 150 000 images issues de scénarios de football, de basketball et de volleyball (Figure 5). Lors de l'évaluation formelle, les principaux résultats de SportsMOT ont été calculés à l'aide de la partition de validation, combinée aux sorties du détecteur, à la configuration du suivi et aux paramètres de TrackEval décrits dans le protocole. Une évaluation inter-ensembles de données a été réalisée sur TeamTrack, SoccerNet Tracking, MOT17 et MOT20 afin d'examiner le transfert de performances entre différents types d'ensembles de données, plutôt que d'effectuer des comparaisons directes au niveau des métriques entre ces ensembles.

Figure 5. Exemples de jeux de données utilisés pour l'évaluation. Des images représentatives illustrent des séquences typiques de football, de basketball et de volleyball utilisées pour l'évaluation expérimentale. La figure met en évidence les variations de point de vue de la caméra, de densité de joueurs et de complexité de la scène entre les jeux de données évalués. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Les données SportsMOT ont été organisées selon la structure officielle du jeu de données et converties au format d'entraînement du détecteur décrit dans le protocole. Les données d'entraînement et de validation SportsMOT converties comprenaient 90 séquences, 55 544 images et 608 152 objets annotés. La partition d'entraînement a été utilisée pour la préparation du détecteur et l'ajustement des paramètres, tandis que la partition de validation a servi à l'évaluation formelle du suivi rapportée dans cette étude. Toutes les images d'entrée ont été redimensionnées conformément à la configuration du détecteur indiquée dans le protocole et dans le Tableau des matériaux. La même procédure de prétraitement a été appliquée lors de la préparation du détecteur, de l'extraction des caractéristiques sémantiques, de l'inférence du suivi et de l'évaluation avec TrackEval, afin que les différences rapportées reflètent principalement la stratégie d'association de suivi plutôt que des variations dans le traitement des données.
Indicateurs d'évaluation :
Les performances de suivi ont été évaluées à l'aide d'un protocole d'évaluation compatible avec MOTChallenge, mis en œuvre à l'aide de la trousse d'évaluation indiquée dans le tableau des matériaux. Les métriques rapportées décrivent trois aspects des performances de suivi d'objets en contexte sportif : la précision globale du suivi, la préservation des identités et la qualité de détection-association. Les métriques MOTA, IDF1 et HOTA ont été utilisées comme indicateurs principaux d'évaluation44,45. La métrique MOTA résume les faux positifs, les faux négatifs et les changements d'identité en un score global de précision de suivi. IDF1 mesure la cohérence entre les trajectoires prédites et les identités de référence. HOTA évalue conjointement la précision de détection et la précision d'association, caractérisant ainsi l'équilibre entre la localisation des cibles et l'association des trajectoires. DetA et AssA ont été rapportées comme métriques complémentaires. Les FPs (faux positifs), FNs (faux négatifs) et changements d'identité (IDs) ont été utilisés pour caractériser les sources d'erreur liées aux détections erronées, aux détections manquées et aux modifications d'identité. Pour les comparaisons entre méthodes sur SportsMOT, les mêmes sorties de détecteur et la même configuration de la trousse d'évaluation ont été utilisées afin de réduire l'influence des variations de détecteur et des différences de paramètres d'évaluation. Pour les comparaisons entre ensembles de données, les valeurs des métriques ont été interprétées comme des résultats d'évaluation propres à chaque ensemble de données, et non comme une preuve de supériorité absolue de performance entre différents ensembles de données.
Environnement expérimental et configuration des paramètres :
Les expériences ont été réalisées à l'aide des ressources matérielles et logicielles énumérées dans le Tableau des matériaux. Le même environnement informatique, le même cadre de détecteur, les mêmes sorties de détecteur et la même trousse d'évaluation ont été utilisés tout au long des expériences principales de SportsMOT afin de maintenir la cohérence durant la préparation du détecteur, l'inférence de suivi et l'évaluation des performances. Le cadre de détecteur indiqué dans le Tableau des matériaux a été entraîné avec une taille de lot de 16, un taux d'apprentissage initial de 0,01 et 80 époques d'entraînement. Dans le module d'extraction sémantique des maillots, le regroupement par couleurs a utilisé K-moyennes avec K = 3, et la branche OCR a utilisé un réseau neuronal récurrent convolutionnel léger avec une taille d'entrée de 128 × 64 pixels. La branche OCR a été optimisée à l'aide de l'optimiseur adaptatif indiqué dans le Tableau des matériaux, avec un taux d'apprentissage de 1 × 10⁻3, une décroissance du poids de 1 × 10⁻5, une taille de lot de 64 et 40 époques d'entraînement. Aucun réglage supplémentaire du taux d'apprentissage n'a été utilisé durant l'entraînement du module d'extraction de caractéristiques sémantiques. Le coefficient de pondération de la perte OCR (γ) a été considéré comme un hyperparamètre défini par l'utilisateur et choisi en fonction des performances sur l'ensemble de validation. La stratification par niveau de confiance a utilisé un partitionnement K-moyennes adaptatif, dans lequel τ₁ et τ₂ ont été calculés à partir de la distribution de confiance de détection de chaque image, plutôt que d'être prédéfinis manuellement avant l'inférence.
Évaluation des performances dans les sports et selon la complexité des scénarios
Performance quantitatif dans différentes conditions sportives et de scène :
La performance de suivi a été évaluée selon deux facteurs de regroupement : la catégorie de sport et la complexité de la scène. L'analyse par catégorie de sport comprenait des séquences de football, de basketball et de volleyball. L'analyse de la complexité de la scène prenait en compte le niveau d'occultation, la vitesse du mouvement et la densité de la cible, en utilisant les mêmes critères de regroupement pour l'ensemble des séquences évaluées. Les métriques rapportées suivaient le protocole d'évaluation décrit dans la Section 7 du protocole.
Figure 6 résume les résultats du suivi quantitatif selon différentes catégories sportives et conditions de complexité de scène. Figure 6A présente les valeurs de MOTA et de DetA pour les séquences de football, de basketball et de volleyball. Figure 6B présente la variation du MOTA selon différents niveaux d'occultation, de vitesse de mouvement et de densité des cibles. Figure 6C présente les décomptes cumulés de faux positifs (FP) et de faux négatifs (FN) pour chaque dimension de complexité de scène.

Figure 6. Suivi des performances selon les catégories sportives et les conditions de scène. (A) Précision du suivi de plusieurs objets (MOTA) et précision de détection (DetA) pour le football, le basketball, le volleyball et la moyenne générale. (B) MOTA selon des conditions de scène représentatives présentant différents niveaux d'occultation, de densité de joueurs et de complexité du mouvement. (C) Nombre de faux positifs (FP) et de faux négatifs (FN) selon les conditions de scène évaluées. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Dans les trois catégories de sports, JerseyTrack a atteint une MOTA moyenne de 88,9 % et une DetA moyenne de 80,2 %. L'écart de MOTA entre les catégories de sports était de 1,3 point de pourcentage, la MOTA la plus élevée étant observée pour les séquences de volleyball (89,2 %) et la plus faible pour les séquences de basketball (87,9 %). La MOTA plus faible observée pour les séquences de basketball est cohérente avec la fréquence plus élevée d'interactions à courte distance et d'occultations denses dans les séquences évaluées. Dans des conditions de scène moins complexes, incluant une occultation légère, une faible vitesse de mouvement et une distribution clairsemée des cibles, la MOTA a atteint respectivement 91,8 %, 93,1 % et 93,8 %. Dans des conditions de scène plus complexes, la MOTA a diminué à 84,9 % en cas d'occultation importante, à 83,6 % en cas de mouvement à grande vitesse et à 83,1 % en cas de distribution dense des cibles. Ces résultats montrent que les performances de suivi diminuent avec l'augmentation de la complexité de la scène, tout en restant dans la plage rapportée pour les scénarios sportifs évalués.
Suivi de la cohérence dans des scénarios sportifs représentatifs :
Figure 7 présente des exemples représentatifs de suivi illustrant la cohérence temporelle de JerseyTrack dans trois scénarios sportifs difficiles : interactions denses entre joueurs, occultation partielle prolongée et changements rapides de direction. Dans ces séquences représentatives, le traqueur a maintenu des identités de trajectoire cohérentes malgré les chevauchements fréquents entre athlètes et les mouvements dynamiques. Une fragmentation d'identité a été observée principalement en cas d'occultation sévère ou lorsque les informations sémantiques des maillots sont devenues temporairement indisponibles ; toutefois, la stratégie d'association guidée par la confiance a permis la récupération des trajectoires dès que des détections fiables sont réapparues. Ces exemples représentatifs soutiennent qualitativement les résultats quantitatifs présentés dans la Figure 6, en démontrant une préservation stable de l'identité dans les conditions de suivi sportif évaluées.

Figure 7. Résultats représentatifs de suivi générés par JerseyTrack. Des images consécutives issues de séquences de basketball, de football et de volleyball illustrent le maintien des identités et des trajectoires des athlètes pendant le suivi. Les cadres colorés représentent les identités suivies conservées d'une image vidéo à l'autre. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Résultats des analyses d'ablation pour la préservation de l'identité :
Une analyse d'ablation a été menée pour examiner les contributions de la stratégie d'association guidée par la confiance et du module de fusion sémantique des maillots à la préservation de l'identité. Quatre variantes de modèle ont été comparées : V0, le modèle de base sans association guidée par la confiance ni fusion sémantique des maillots ; V1, la variante utilisant uniquement l'association guidée par la confiance ; V2, la variante utilisant uniquement la fusion sémantique des maillots ; et V3, la configuration complète de JerseyTrack intégrant les deux composants. L'évaluation s'est concentrée sur des métriques liées à l'identité, notamment le nombre de changements d'identité (IDs), le score IDF1, la précision d'identité (IDP) et le rappel d'identité (IDR). Les motifs représentatifs de préservation de l'identité sont présentés dans la Figure 8.

Figure 8. Analyse d'ablation de l'association sémantique de maillot guidée par la confiance. (A) Nombre total de changements d'identité (IDs) et score F1 d'identité (IDF1) pour les différentes variantes du modèle évaluées. (B) Comparaison des IDs entre le modèle complet (V3) et la configuration de base (V0) dans des scénarios de suivi représentatifs et difficiles. (C) IDF1, précision d'identité (IDP) et rappel d'identité (IDR) du modèle complet dans différents scénarios de suivi. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Dans le cadre général de validation de SportsMOT, la configuration complète V3 a produit le nombre le plus faible d'identités (IDs) et le score IDF1 le plus élevé parmi les quatre variantes de modèle. La V3 a enregistré 2 768 IDs, soit 477 changements d'identité de moins que la V0, et a atteint un IDF1 de 74,3 %, ce qui représente une augmentation de 7,1 points de pourcentage par rapport à la V0. Ces résultats indiquent que les deux modules ont conjointement contribué à la préservation de l'identité dans les conditions de suivi sportif évaluées. La comparaison des variantes à module unique avec la configuration complète a en outre montré que les deux modules affectaient différentes sources d'erreur de suivi. La stratégie d'association guidée par la confiance a réduit les erreurs d'appariement liées à une confiance instable dans la détection et à une incertitude de localisation, tandis que le module de fusion sémantique du maillot a fourni des informations supplémentaires sur l'identité lorsque les seules informations de mouvement étaient insuffisantes. La configuration complète V3 a obtenu de meilleures performances en matière d'identité que chacune des variantes à module unique, suggérant que les deux modules apportent des contributions complémentaires plutôt que redondantes.
Les résultats au niveau des scénarios ont montré des différences plus marquées dans des conditions de préservation de l'identité plus difficiles. Pendant les occultations prolongées, V3 a enregistré 215 identifications contre 482 pour V0. Dans les scénarios denses avec des joueurs de la même équipe (6 à 10 joueurs), V3 a enregistré 328 identifications contre 615 pour V0. Lors de changements de direction à grande vitesse, V3 a enregistré 482 identifications contre 960 pour V0. Ces réductions sont cohérentes avec l'utilisation prévue de signaux sémantiques pendant l'occultation et les interactions denses, ainsi qu'avec une association guidée par la confiance en cas de fluctuations de la confiance de détection pendant les mouvements rapides. Les tendances de l'IDP et de l'IDR présentées dans Figure 8C indiquent que la réduction du nombre d'identifications n'a pas été accompagnée d'une diminution importante ni de la précision d'identification ni du rappel d'identification. La configuration complète a maintenu des valeurs IDF1 supérieures à 71 % dans tous les scénarios difficiles évalués, avec des valeurs plus faibles observées lors d'interactions denses entre joueurs de la même équipe et de changements de direction à grande vitesse. Ces résultats indiquent une amélioration de la cohérence d'identification dans les conditions évaluées, tout en identifiant les interactions denses et les mouvements rapides comme les principales sources résiduelles de dégradation des performances.
Résultats de l'évaluation inter-ensembles de données :
Une évaluation inter-ensembles de données a été menée afin d'examiner si le comportement de suivi observé sur SportsMOT pouvait être maintenu dans des conditions différentes d'ensembles de données. L'évaluation comprenait deux ensembles de données spécifiques aux sports, SoccerNet Tracking et TeamTrack, ainsi que deux ensembles de données généraux de suivi d'objets multiples (MOT), MOT17 et MOT20. L'objectif de cette expérience était d'étudier le transfert de performances entre différents types d'ensembles de données. Les résultats n'ont pas été utilisés pour revendiquer une supériorité directe au niveau des métriques entre les ensembles de données, car les protocoles d'annotation, la composition des scènes, les points de vue des caméras et les catégories cibles diffèrent.
Tableau 1 résume les résultats de l'évaluation inter-ensembles de données. Sur les ensembles de données spécifiques aux sports, JerseyTrack a maintenu des valeurs relativement stables de MOTA et d'IDF1 par rapport au paramètre principal de validation SportsMOT. Cette tendance suggère que la stratégie d'association guidée par la confiance et les indices sémantiques liés aux maillots sont restés efficaces lorsque les scènes de suivi conservaient des caractéristiques visuelles propres aux sports d'équipe, notamment des tenues répétées, des interactions denses entre athlètes et des occultations fréquentes. Sur les ensembles de données MOT généraux, la méthode a conservé des valeurs compétitives de MOTA et de DetA, tandis que l'IDF1 était inférieur à celui observé sur les ensembles de données spécifiques aux sports. Ce schéma est cohérent avec l'absence d'indices de couleur de maillot et de numéro de joueur dans MOT17 et MOT20, qui sont exploités par le module de fusion sémantique. Dans ces conditions, le composant d'association guidée par la confiance est resté applicable, tandis que la branche sémantique a apporté moins d'informations spécifiques à l'identité que dans le cas des vidéos de sports d'équipe. Dans l'ensemble, ces résultats indiquent que JerseyTrack se transfère plus efficacement vers des ensembles de données contenant des sémantiques visuelles spécifiques aux sports qu'aux ensembles de données généraux de suivi de piétons. L'évaluation inter-ensembles de données soutient donc l'application prévue de la méthode en tant que système de suivi orienté vers les sports, tout en identifiant l'absence de sémantiques explicites de maillot comme un facteur limitant pour les ensembles de données MOT non sportifs.
| Jeu de données | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86,8 | 71,3 | 77,9 | 32,1 |
| TeamTrack | 86,2 | 70,7 | 77,3 | 32,8 |
| MOT17 | 84,7 | 69,5 | 76,1 | 33,9 |
| MOT20 | 84,1 | 68,9 | 75,3 | 33,2 |
Tableau 1 : Résultats de l'évaluation croisée entre ensembles de données. Performance de suivi de JerseyTrack évaluée sur quatre ensembles de données de référence publics. On indique la précision du suivi multi-objet (MOTA), le score F1 d'identité (IDF1), la précision de détection (DetA) et la vitesse de traitement mesurée en images par seconde (FPS). Des valeurs plus élevées indiquent une meilleure performance pour la MOTA, l'IDF1, la DetA et les FPS.
Robustesse dans des conditions de perturbation contrôlées
Des expériences de perturbation contrôlées ont été menées afin d'examiner la stabilité de JerseyTrack face aux perturbations visuelles et de qualité de détection couramment rencontrées dans les vidéos sportives. Les perturbations évaluées ont été regroupées en trois catégories : perturbation des caractéristiques sémantiques, perturbation des boîtes de détection et perturbation environnementale. Les perturbations des caractéristiques sémantiques comprenaient l'occlusion du numéro du joueur, le flou d'image, la dégradation de la résolution et des couleurs de maillot similaires. Les perturbations des boîtes de détection comprenaient un décalage de la boîte englobante, des fluctuations de la confiance de détection et des boîtes de détection erronées. Les perturbations environnementales comprenaient un bruit de type pluie, une dégradation de type brouillard, un éclairement intense et des interférences d'ombres. Figure 9 résume les performances de suivi sous ces conditions de perturbation. En cas de perturbation des caractéristiques sémantiques, les performances de suivi ont diminué à mesure que la visibilité du numéro du joueur et la qualité du recadrage se dégradaient. Lorsque 40 % de la zone du numéro du joueur était occultée, MOTA a diminué de 3,2 points de pourcentage et IDF1 de 5,3 points de pourcentage par rapport à la condition sans perturbation, tandis que la précision d'extraction sémantique est restée à 86,7 %. Ces résultats indiquent que les indices de couleur du maillot et du numéro du joueur fournissent des informations complémentaires lorsque l'un des indices sémantiques devient moins fiable. En cas de perturbation des boîtes de détection, la méthode a présenté une dégradation modérée des performances plutôt qu'une défaillance brutale. Lorsque les boîtes de détection étaient décalées de ±10 pixels et que les scores de confiance étaient perturbés par un bruit gaussien, la diminution de MOTA est restée inférieure à 3 points de pourcentage, et l'augmentation du nombre d'identifiants (IDs) s'est limitée à 16 %. Cette tendance est cohérente avec la stratégie d'association guidée par la confiance, dans laquelle les détections de confiance moyenne ou faible sont traitées à l'aide de contraintes d'association supplémentaires, contrairement à la stratégie appliquée aux détections de haute confiance.

Figure 9. Évaluation de la robustesse sous des perturbations contrôlées. (A) Évolutions de la précision de suivi de multiples objets (MOTA), du score F1 d'identité (IDF1) et des changements d'identité (IDs) avec une occultation croissante du numéro de maillot. (B) Dégradation des performances dans des conditions d'interférence représentatives. (C) Augmentation des IDs selon différents types d'interférence. (D) Précision de l'extraction sémantique du maillot dans les conditions de perturbation évaluées. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Sous perturbation environnementale, les diminutions des métriques principales de suivi sont restées inférieures à 5 points de pourcentage dans les conditions évaluées, et la précision de l'extraction sémantique est restée à 87,2 %. L'utilisation de descripteurs de couleur basés sur HSV a réduit la sensibilité aux changements d'éclairage, tandis que la branche OCR a conservé des informations exploitables sur les numéros des joueurs pour un sous-ensemble de découpes d'images floues ou dégradées. Ces résultats indiquent que le module sémantique est resté utilisable dans les conditions de perturbation évaluées, bien que sa fiabilité continue de dépendre de la visibilité des maillots et de la qualité des découpes. Dans l'ensemble, les expériences de perturbation contrôlées ont montré que JerseyTrack maintenait des performances de suivi mesurables sous les perturbations sémantiques, de qualité de détection et environnementales évaluées. Ces résultats doivent être interprétés dans la plage de perturbations testées. La ré-identification systématique hors champ, l'encombrement important du fond et l'occlusion complète à long terme n'ont pas été évalués séparément dans cette expérience et sont discutés comme des limites dans la section Discussion.
Analyse de la contribution des modules et de la discrimination des caractéristiques
La contribution des modules et la discrimination des caractéristiques ont été davantage analysées afin d'examiner comment les deux composants proposés ont influencé les performances de suivi liées à l'identité. L'analyse de la contribution des modules a utilisé les quatre variantes du modèle définies dans l'analyse d'ablation, tandis que l'analyse de discrimination des caractéristiques a comparé les caractéristiques traditionnelles de ré-identification (Re-ID), les caractéristiques basées uniquement sur la couleur, celles basées uniquement sur le numéro du joueur, et les caractéristiques sémantiques du maillot fusionnées. Le rapport entre la distance inter-classes et la distance intra-classe a été utilisé pour décrire la séparabilité des caractéristiques, des valeurs plus élevées indiquant une séparation plus grande entre différentes identités par rapport aux variations au sein d'une même identité. Tableau 2 résume l'analyse de la contribution des modules. Dans l'évaluation globale, la contribution estimée de la stratégie d'association guidée par la confiance était de 41,7 %, la contribution estimée de la fusion sémantique du maillot était de 47,6 %, et les 10,7 % restants ont été attribués à l'utilisation combinée des deux composants. Ces valeurs indiquent que les deux composants ont contribué à l'amélioration observée, tandis que la configuration complète a bénéficié de leur utilisation conjointe plutôt que de l'un ou l'autre pris isolément. Le schéma de contribution variait selon les types de scènes. En cas d'occlusion importante, la contribution estimée de la fusion sémantique du maillot a augmenté jusqu'à 69,4 %, ce qui est cohérent avec la fiabilité réduite des indices de mouvement lorsque les athlètes étaient partiellement ou temporairement occultés. En cas de mouvement rapide, la contribution estimée de l'association guidée par la confiance a atteint 44,3 %, et le gain combiné a atteint 20,6 %, indiquant que la partition selon le niveau de confiance devenait plus pertinente lorsque la confiance de détection fluctuait en raison du mouvement rapide ou de l'incertitude de localisation.
| Variant du modèle | Scénario de test | MOTA↑ | IDF1↑ | IDs↓ | Contribution du module | Gain synergique |
| V0 (Référence) | Scène générale | 83,5 | 67,2 | 3245 | – | – |
| Scènes fortement occultées | 77,8 | 61,5 | 3862 | – | – |
| Scène de mouvement à grande vitesse | 77,1 | 62,3 | 3689 | – | – |
| V1 (Association guidée par la confiance) | Scène générale | 86,3 | 70,9 | 2893 | 41,7 | – |
| Scènes fortement occultées | 80,9 | 65,9 | 3415 | 29,8 | – |
| Scène de mouvement à grande vitesse | 81,4 | 67,9 | 3024 | 44,3 | – |
| V2 (Association sémantique par maillot) | Scène générale | 85,2 | 71,8 | 2937 | 47,6 | – |
| Scènes fortement occultées | 82,7 | 72,8 | 2753 | 69,4 | – |
| Scène de mouvement à grande vitesse | 80,1 | 66,8 | 3157 | 35,1 | – |
| V3 (JerseyTrack complet) | Scène générale | 88,9 | 74,3 | 2768 | – | 10,7 |
| Scènes fortement occultées | 84,9 | 75,6 | 2689 | – | 0,8 |
| Scène de mouvement à grande vitesse | 83,6 | 71,5 | 2842 | – | 20,6 |
Tableau 2 : Analyse d'ablacion des contributions des modules. Comparaison des performances de différentes variantes du modèle JerseyTrack dans des scénarios globaux, fortement occultés et à mouvement rapide. La précision du suivi de multiples objets (MOTA), le score F1 d'identité (IDF1) et le nombre de changements d'identité (IDs) sont indiqués, ainsi que la contribution estimée des modules et le gain synergique. Des valeurs plus élevées indiquent de meilleures performances pour MOTA, IDF1, la contribution des modules et le gain synergique, tandis que des valeurs plus faibles indiquent de meilleures performances pour IDs.
Tableau 3 résume l'analyse de discrimination des caractéristiques. La caractéristique sémantique fusionnée du maillot a atteint un rapport de distance inter-classes/intra-classes de 5,63, comparé à 1,82 pour les caractéristiques traditionnelles de Re-ID, ce qui correspond à une amélioration relative de 209,3 % dans la mesure du rapport de distance. Les caractéristiques basées uniquement sur la couleur ou uniquement sur le numéro du joueur ont également amélioré la séparabilité des caractéristiques par rapport aux caractéristiques traditionnelles de Re-ID, bien que chaque indicateur individuel reste sensible à des cas d'échec spécifiques, notamment des couleurs d'équipe similaires, l'occultation du numéro du joueur, le flou de mouvement et des zones du maillot illisibles. Parmi les représentations de caractéristiques évaluées, la représentation sémantique fusionnée a obtenu la plus grande séparabilité des caractéristiques et correspondait au score IDF1 le plus élevé ainsi qu'au nombre d'identités (ID) le plus faible observé dans l'analyse d'ablation. Ces résultats soutiennent l'utilisation d'indices sémantiques spécifiques au maillot comme information d'identité complémentaire pour le suivi multi-objets (MOT) en sport lorsque les athlètes ont des apparences similaires et que l'information de mouvement seule est insuffisante. Ces observations sont limitées au contexte SportsMOT évalué et ne doivent pas être interprétées comme une preuve que les sémantiques des maillots résolvent toute ambiguïté d'identité dans toutes les vidéos sportives.
| Type de caractéristique | Rapport inter-classes/intra-classes | Amélioration relative (%) | IDF1↑ | IDs↓ |
| Caractéristiques traditionnelles de ré-identification | 1.82 | – | 65.7 | 3482 |
| Caractéristiques de couleur d'équipe | 3.17 | 74,2 | 69,8 | 3125 |
| Caractéristiques de numéro de joueur | 3.49 | 91,8 | 70,5 | 3018 |
| Caractéristiques sémantiques fusionnées du maillot | 5,63 | 209,3 | 74,3 | 2768 |
Tableau 3 : Analyse de discrimination de différentes représentations de caractéristiques. Comparaison de la discrimination des caractéristiques à l’aide de caractéristiques traditionnelles de ré-identification (Re-ID), de caractéristiques de couleur de maillot, de caractéristiques de numéro de joueur et de caractéristiques sémantiques fusionnées. Le rapport entre la distance inter-classes et intra-classes, l’amélioration relative de la discrimination des caractéristiques, le score F1 d’identité (IDF1) et le nombre de changements d’identité (IDs) sont indiqués. Des valeurs plus élevées indiquent de meilleures performances pour le rapport de distance, l’amélioration relative et l’IDF1, tandis que des valeurs plus faibles indiquent de meilleures performances pour les IDs.
Comparaison comparative avec les méthodes MOT existantes
Une comparaison de référence a été réalisée afin de comparer JerseyTrack à des méthodes représentatives de suivi multi-objets (MOT) dans le même cadre de validation SportsMOT. Les méthodes comparées incluaient QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT et MOTR. Toutes les méthodes ont utilisé les mêmes sorties de détecteur générées par le cadre de détection indiqué dans le tableau des matériaux, afin que la comparaison se concentre sur les performances d'association de suivi plutôt que sur les variations du détecteur. L'évaluation a utilisé les métriques définies dans le protocole de la section 7. Les métriques principales étaient MOTA, HOTA et IDF1. Les métriques auxiliaires comprenaient DetA, AssA, FPs, FNs et IDs. Tableau 4 résume la comparaison quantitative sur la partition de validation SportsMOT, et Figure 10 présente une comparaison visuelle de la précision de suivi, de la vitesse d'inférence et de la distribution de HOTA à travers les scènes sportives évaluées. JerseyTrack a obtenu le MOTA le plus élevé parmi les méthodes comparées, atteignant 88,9 %. Cette valeur était supérieure de 1,1 point de pourcentage à celle de Deep OC-SORT (87,8 %) et de 2,5 points de pourcentage à celle de ByteTrack (86,4 %). Dans le cadre de validation SportsMOT évalué, JerseyTrack a donc atteint la précision de suivi globale la plus élevée parmi les méthodes comparées. Pour HOTA, JerseyTrack a atteint 69,9 %, contre 64,4 % pour Deep OC-SORT et 62,8 % pour ByteTrack. Ces différences correspondent à des améliorations respectives de 5,5 et 7,1 points de pourcentage, indiquant un meilleur équilibre entre la détection et les performances d'association dans le même cadre d'évaluation.
| Méthode | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | FP↓ | FN↓ | IDs↓ |
| QDTrack | 75,9 | 53,7 | 51,6 | 65,6 | 39,7 | 96 324 | 89 871 | 8 216 |
| DeepSORT | 77,6 | 54,1 | 53,2 | 67,3 | 44 | 76 228 | 86 319 | 6 836 |
| ByteTrack | 86,4 | 62,8 | 67,7 | 73,8 | 50,9 | 33 752 | 78 698 | 4 192 |
| FairMOT | 84,1 | 54,7 | 62,5 | 77,8 | 47,8 | 45 187 | 83 620 | 4 817 |
| Deep OC-SORT | 87,8 | 64,4 | 69,9 | 78,2 | 52,1 | 25 012 | 74 385 | 3 211 |
| MOTR | 82,9 | 57,2 | 58,4 | 68,9 | 46,1 | 54 931 | 85 063 | 5 137 |
| JerseyTrack | 88,9 | 69,9 | 74,3 | 80,2 | 54,3 | 21 953 | 67 160 | 2 768 |
Tableau 4 : Comparaison des performances de JerseyTrack et de méthodes représentatives de suivi multi-objets sur la partition de validation SportsMOT. Comparaison de JerseyTrack avec des méthodes représentatives de suivi multi-objets (MOT) sur le jeu de données de validation SportsMOT. Les métriques rapportées incluent l'exactitude du suivi multi-objets (MOTA), l'exactitude du suivi d'ordre supérieur (HOTA), le score F1 d'identité (IDF1), l'exactitude de détection (DetA), l'exactitude d'association (AssA), les faux positifs (FP), les faux négatifs (FN) et le nombre de changements d'identité (IDs). Des valeurs plus élevées indiquent de meilleures performances pour MOTA, HOTA, IDF1, DetA et AssA, tandis que des valeurs plus faibles indiquent de meilleures performances pour FP, FN et IDs.

Figure 10. Comparaison des performances avec des méthodes représentatives de suivi multi-objets. (A) Comparaison de la précision de suivi de plusieurs objets (MOTA) et des images par seconde (FPS) pour JerseyTrack et des méthodes représentatives de suivi multi-objets évaluées sur le jeu de données SportsMOT. (B) Répartition de la précision de suivi d'ordre supérieur (HOTA) parmi les méthodes de suivi évaluées. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
En matière de préservation de l'identité, JerseyTrack a atteint un score IDF1 de 74,3 %, contre 69,9 % pour Deep OC-SORT et 67,7 % pour ByteTrack. JerseyTrack a également enregistré 2 768 identifiants (IDs), un nombre inférieur aux 3 211 IDs enregistrés par Deep OC-SORT et aux 4 192 IDs enregistrés par ByteTrack. Ces observations sont cohérentes avec les résultats d'analyse par suppression présentés dans la Figure 8 et le Tableau 2, où la configuration complète de JerseyTrack a réduit les changements d'identité par rapport aux variantes du modèle de référence. En ce qui concerne la qualité de détection et d'association, JerseyTrack a obtenu un score DetA de 80,2 % et un score AssA de 54,3 %. Par rapport à Deep OC-SORT, JerseyTrack a amélioré le DetA de 2,0 point de pourcentage et le AssA de 2,2 points de pourcentage. JerseyTrack a également produit moins de faux positifs (FP) et de faux négatifs (FN) que les autres méthodes comparées rapportées dans le Tableau 4, avec 21 953 FP et 67 160 FN. Dans l'ensemble, la comparaison comparative a montré que JerseyTrack atteignait les valeurs les plus élevées pour les métriques principales de suivi parmi les méthodes évaluées dans le cadre du paramètre de validation SportsMOT. Ces résultats sont cohérents avec les améliorations observées en matière de préservation de l'identité et de stabilité d'association obtenues grâce à l'association guidée par la confiance et à la fusion sémantique des maillots. La comparaison se limite aux sorties du détecteur partagé et à la configuration de validation SportsMOT utilisée dans cette étude.
Résultats de la sensibilité des paramètres
Une analyse de sensibilité des paramètres a été réalisée pour examiner comment les paramètres clés de mise en œuvre influençaient les performances de suivi dans le cadre de validation SportsMOT. Trois paramètres ont été évalués : le coefficient de pondération de la perte OCR (γ), le nombre de clusters hiérarchiques selon le niveau de confiance (K) et le taux d'apprentissage du réseau OCR (η). Tableau 5 résume les valeurs de MOTA, IDF1, HOTA et le nombre d'identités (IDs) obtenus pour différents réglages des paramètres.
| Paramètre | Valeur | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| Poids de la perte OCR (γ) | 0,2 | 84,7 | 69,4 | 66,2 | 2 944 |
| 0,4 | 86,3 | 71,5 | 68,2 | 2 893 |
| 0,6 | 87,9 | 73,1 | 68,9 | 2 815 |
| 0,8 (optimal) | 88,9 | 74,3 | 69,9 | 2 768 |
| 1 | 88,2 | 73,8 | 69,3 | 2 792 |
| Nombre de groupes de confiance (K) | 2 | 86,7 | 72,1 | 68,5 | 2 876 |
| 3 (optimal) | 88,9 | 74,3 | 69,9 | 2 768 |
| 4 | 88,1 | 73,6 | 69,7 | 2 803 |
| 5 | 87,3 | 72,8 | 69,2 | 2 851 |
| Taux d'apprentissage OCR (η) | 1 × 10⁻⁴ | 85,9 | 70,8 | 67,3 | 2 934 |
| 5 × 10⁻⁴ | 87,6 | 72,7 | 68,7 | 2 832 |
| 1 × 10⁻³ (optimal) | 88,9 | 74,3 | 69,9 | 2 768 |
| 5 × 10⁻³ | 87,8 | 73,2 | 69 | 2 817 |
| 1 × 10⁻² | 86,5 | 71,6 | 68,7 | 2 889 |
Tableau 5 : Analyse de sensibilité des paramètres. Performances de suivi obtenues en utilisant différents réglages de paramètres pour JerseyTrack. La précision du suivi de multiples objets (MOTA), le score F1 d'identité (IDF1), la précision du suivi d'ordre supérieur (HOTA) et le nombre de changements d'identité (IDs) sont indiqués pour différentes valeurs du coefficient de pondération de la perte de reconnaissance optique de caractères (OCR) (γ), du nombre de groupes de confiance (K) et du taux d'apprentissage OCR (η). Les valeurs de paramètres identifiées comme optimales correspondent aux réglages utilisés dans les expériences rapportées. Des valeurs plus élevées indiquent de meilleures performances pour MOTA, IDF1 et HOTA, tandis que des valeurs plus faibles indiquent de meilleures performances pour IDs.
Pour le coefficient de pondération de la perte OCR (γ), les meilleures performances évaluées ont été obtenues avec γ = 0,8. Dans ce cas, JerseyTrack a atteint un MOTA de 88,9 %, un IDF1 de 74,3 %, un HOTA de 69,9 % et 2 768 identifiants (IDs). Lorsque γ a été réduit à 0,2, les valeurs du MOTA, de l'IDF1 et du HOTA ont diminué respectivement à 84,7 %, 69,4 % et 66,2 %, tandis que le nombre d'IDs a augmenté à 2 944. Lorsque γ a été augmenté à 1,0, les métriques de performance ont légèrement diminué par rapport à γ = 0,8, avec un MOTA de 88,2 %, un IDF1 de 73,8 %, un HOTA de 69,3 % et 2 792 IDs. Ces résultats indiquent qu'une supervision insuffisante de la reconnaissance optique de caractères (OCR) réduit la discrimination des numéros de joueurs, tandis qu'une augmentation de la pondération de la perte OCR au-delà de l'optimum évalué n'améliore pas les performances de suivi dans les conditions testées.
Pour le nombre de clusters hiérarchiques selon le niveau de confiance (K), les meilleures performances évaluées ont été obtenues avec K = 3. Ce paramètre correspond à la stratégie d'association à haute, moyenne et faible confiance décrite dans la méthode. Lorsque K = 2, la partition par niveaux de confiance était moins fine, et les valeurs de MOTA, IDF1 et HOTA ont diminué respectivement à 86,7 %, 72,1 % et 68,5 %. Lorsque K augmentait à 4 ou 5, les performances diminuaient également par rapport à K = 3, suggérant qu'une partition excessive divisait les détections en groupes de confiance trop étroits et réduisait la stabilité de la stratégie d'association. Ces résultats soutiennent l'utilisation de trois niveaux de confiance dans la configuration évaluée de JerseyTrack.
Pour le taux d'apprentissage (η) du réseau OCR, les meilleures performances évaluées ont été obtenues avec η = 1 × 10-3. À un taux d'apprentissage plus faible de 1 × 10-4, MOTA, IDF1 et HOTA ont diminué respectivement à 85,9 %, 70,8 % et 67,3 %, tandis que le nombre d'identifiants a augmenté à 2 934. À un taux d'apprentissage plus élevé de 1 × 10-2, MOTA, IDF1 et HOTA ont diminué respectivement à 86,5 %, 71,6 % et 68,7 %, tandis que le nombre d'identifiants a augmenté à 2 889. Ces résultats indiquent que la branche OCR était sensible au choix du taux d'apprentissage, lequel à 1 × 10-3 offrait le meilleur compromis entre la reconnaissance du nombre de joueurs et la préservation des identités dans les conditions évaluées.
Dans l'ensemble, le tableau 5 montre que la combinaison de paramètres γ = 0,8, K = 3 et η = 1 × 10-3 a produit les valeurs les plus élevées de MOTA, d'IDF1 et de HOTA évaluées, ainsi que le nombre le plus faible de changements d'identité (IDs). L'analyse de sensibilité a également montré que des écarts modérés par rapport à ces valeurs de paramètres entraînaient des changements mesurables, mais non brusques, de la performance de suivi. Par conséquent, ces réglages de paramètres ont été utilisés pour la comparaison de référence et les expériences principales de validation de SportsMOT rapportées dans cette étude.
Disponibilité des données
Les résumés bruts des évaluations, les sorties finales du suivi, les enregistrements d'environnement, les fichiers de mappage des jeux de données et les fichiers intermédiaires de synthèse soutenant les résultats de cette étude sont disponibles dans un dépôt public à l'adresse https://doi.org/10.5281/zenodo.21274353. Les jeux de données publiques d'origine utilisés dans cette étude, notamment SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 et MOT20, sont accessibles auprès de leurs fournisseurs respectifs et ne sont pas redistribués dans le dépôt.