Research Article

Un cadre multimodal basé sur des transformateurs pour l’analyse tactique des décisions dans les sports d’équipe avec application au football

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour améliorer la catégorisation des décisions tactiques dans le football, cette étude propose un modèle de fusion multimodal basé sur Transformer qui intègre des données visuelles, de localisation, acoustiques et contextuelles. Le modèle atteint des performances quasi en temps réel sur un ensemble de données multimodal de 500 séquences, surpassant les références CNN-LSTM, BiLSTM-Attention et GNN en termes de précision et de mauvaise classification induite par la pression.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Une prise de décision tactique rapide et précise est nécessaire dans le football moderne. Cependant, les approches traditionnelles pour l’évaluation de la prise de décision tactique ont une faible validité écologique et ne sont pas facilement évolutives. Pour relever ces défis, cet article présente un modèle de fusion multimodale basé sur les transformateurs qui intègre le positionnement des joueurs, la vidéo, l’audio et les métadonnées contextuelles pour classer les décisions tactiques en temps réel. Des expériences ont été menées avec 40 joueurs masculins et un ensemble de données comprenant 500 séquences de jeux multimodaux. Le jeu de données de 40 joueurs fait référence à des expériences de prise de décision contrôlées en laboratoire utilisées pour la validation initiale et une évaluation de la fiabilité. Ensuite, 500 séquences multimodales ont été extraites à partir de simulations de matchs étendues et d’enregistrements de matchs réels pour fournir le jeu de données plus large utilisé lors de l’entraînement et des tests du modèle de transformateur multimodal.

Il traite les entrées en cinq étapes : acquisition des données, prétraitement, extraction de caractéristiques, fusion par transformateur et classification des décisions. Comparée aux références CNN-LSTM, BiLSTM-Attention et GNN, l’approche proposée améliore la précision de la prédiction des décisions de 28 % et réduit la mauvaise classification causée par la pression de 41 %, avec une faible latence d’inférence de 52,6 ms, ce qui la rend adaptée aux applications quasi en temps réel. La généralisation des résultats dans des contextes tactiques plus divers et à des démographies plus larges des athlètes est également limitée par la taille relativement faible et l’homogénéité au sein de la population échantillonnée de jeunes joueurs masculins issus d’une seule région. Ces résultats soulignent la contribution de la fusion multimodale basée sur transformateurs à l’analyse automatisée des décisions tactiques et soulignent la nécessité de sa validation supplémentaire dans des situations de matchs plus diverses et à grande échelle.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les sports d’équipe, comme le football américain, nécessitent des décisions tactiques rapides dans des environnements dynamiques et incertains. Les joueurs doivent constamment lire les informations visuales du ballon, des coéquipiers et des adversaires, et réagir en une fraction de seconde pour garantir un avantage compétitif. La prise de décision tactique au football dépend fortement de la perception rapide des mouvements des joueurs, de la trajectoire du ballon et des indices situationnels. Bien que les compétences cognitives générales, telles que le temps de réaction et l’attention sélective, influencent effectivement la performance, des recherches récentes ont mis l’accent sur des modèles basés sur les données et conscients du contexte, capables d’approcher la cognition tactique réelle enjeu 1,2,3,4,5. Le temps de réaction et les capacités perceptives, telles que les capacités cognitives, jouent également un rôle crucial dans la performance 6,7,8. Des recherches récentes en cognition sportive ont établi que la prise de décision tactique repose non seulement sur les compétences perceptuelles, mais aussi sur la capacité de l’athlète à intégrer en temps réel l’information spatiale dynamique, la pression de l’adversaire et les indices contextuels du match. Les recherches sur l’expertise perceptuelle-cognitive suggèrent que des joueurs tactiquement plus instruits reconnaissent les indices plus rapidement, captent l’information de manière plus efficace et présentent des schémas de prise de décision plus stables sous pression. De telles découvertes soutiennent la nécessité de modèles computationnels capables de saisir la nature complexe et multi-couches des processus décisionnels sportifs.

Les méthodes classiques d’évaluation de la prise de décision tactique emploient souvent des tâches de laboratoire contrôlées et des jugements d’experts subjectifs, qui imposent des contraintes importantes à la validité écologique et à la scalabilité. Les avancées récentes en apprentissage profond offrent le potentiel d’automatiser le processus grâce à l’utilisation de sources de données multimodales — telles que la vidéo, le suivi positionnel et les métadonnées de correspondance contextuelle — au sein d’architectures de capture de dépendances temporelles et intermodales. Malgré ces avancées, la plupart des modèles actuels reposent encore sur des réseaux neuronaux convolutionnels – mémoire à long terme ou bidirectionnelle à long terme (CNN-LSTM ou BiLSTM), qui ont une capacité limitée à modéliser les dépendances à longue portée entre modalités. Cette lacune est la force motrice derrière le développement de modèles de fusion multimodaux basés sur des transformateurs, mieux équipés pour modéliser la prise de décision tactique de manière plus complète et stable dans des scénarios de football. Dans le sport d’équipe adverse que sont le football, par exemple, les joueurs doivent évaluer rapidement les informations concernant le ballon, y compris leurs coéquipiers, leurs adversaires et leur position sur le terrain. Avant de décider de la meilleure marche à suivre en fonction de leurs compétences, des instructions de l’entraîneur et des circonstances dumatch 9,10. En raison de l’accessibilité des ensembles de données organisés et des composantes tactiques définies, cette étude se concentre exclusivement sur le football ; cependant, les principes tactiques pour prendre des décisions s’appliquent à de nombreux sports d’équipe.

En effet, des études antérieures indiquent que CNN-LSTM et BiLSTM ne peuvent pas capturer des dépendances temporelles à très longue portée en utilisant un champ réceptif fixe ou en étant limitées par des portes séquentielles11, 12, 13. De même, des travaux fondamentaux de référence en reconnaissance d’action et modélisation temporelle multimodale révèlent que la performance des modèles basés sur LSTM diminue avec l’augmentation de la durée de la séquence ou lorsque des indices contextuels surviennent à plusieurs frames d’intervalle, ce qui peut limiter la validité écologique dans des contextes sportifs dynamiques. De plus, les modèles basés sur les réseaux neuronaux de graphes (GNN) sont des outils puissants pour la modélisation spatiale, mais ils ont constamment sous-performé dans des scénarios nécessitant un raisonnement temporel précis ou dans les cas où les indices de pression contextuels évoluent rapidement dans letemps 14,15. Contrairement à ces approches, les cadres plus récents basés sur les transformateurs démontrent leur supériorité de performance en analyse sportive, reconnaissance d’activité humaine et tâches vidéo-langage grâce à l’intégration conjointe d’indices temporels à longue portée, de relations spatiales et de signaux contextuels en un seul passage avant, rendue possible par l’attention globale de soi. Ces résultats de référence justifient le choix d’une architecture basée sur un transformateur comme colonne vertébrale du modèle proposé dans l’étude actuelle.

Améliorer les connaissances tactiques et comprendre les principes tactiques a été démontré comme essentiel pour résoudre les contraintes et problèmes dujeu 16,17. Les joueurs de football apprennent une variété d’éléments du jeu, notamment la pénétration, la protection offensive, le mouvement, le temps, la limitation, la protection défensive, l’équilibrage et la concentration, grâce à un entraînementtechnique-tactique. À mesure que les joueurs gagnent en expérience footballistique, leur compréhension des fondamentaux techniques et tactiques devrait s’améliorer. Les joueurs peuvent ainsi discerner plus facilement les signaux pertinents, facilitant ainsi la prise de décision appropriée pour chaque règle de jeu dans un scénario particulier19. De ce fait, les joueurs peuvent utiliser leur efficacité motrice et leurs capacités décisionnelles pour compléter les schémas de mouvement avec des talents spécialisés.

L’auteur a utilisé la prise de décision à attributs multiples pour analyser les bienfaits de l’exercice et des habitudes sur la forme physique, illustrant l’efficacité de la capacité d’entraînement qualifiée en éducation physique chez les étudiants. L’activité physique efficace, le développement de bonnes habitudes de forme physique et la promotion de réformes dans la manière dont le sport est présenté dans les établissements scolaires sont tous considérés par une importance considérable. La moyenne heronienne floue et floue (IFWHM) intuitive avec assistance aux nombres flous est utilisée pour la prise de décision efficace. Le résultat a soutenu la réussite cognitive des étudiants universitaires et a démontré une évaluation plus précise de leurs problèmes de bien-être physique. Pour détecter les liens latents dans les données, le chercheur20 a utilisé la méthode Apriori augmentée. Les conclusions de la recherche sont pertinentes pour l’évaluation de la santé physique des étudiants dans l’enseignement supérieur. Le premier résultat est déterminé en évaluant la fatigue des différentes orientations selon leur fréquence d’apparition.

Des recherches antérieures basées sur l’IA en analyse sportive se sont concentrées sur des tâches de vision par ordinateur, notamment la détection des joueurs, le suivi et la reconnaissance des activités de groupe. Des architectures récentes, faiblement supervisées et sans détecteurs, ont révélé l’importance de la modélisation multimodale et consciente du contexte pour comprendre les comportements tactiques. Ces avancées nécessitent l’intégration d’un apprentissage profond multimodal pour classifier les décisions tactiques en football. En utilisant des vecteurs de caractéristiques latents produits à partir de la matrice d’utilité via la factorisation matricielle, il calcule la similarité cosinus entre utilisateurs et utilisateurs ou entre les éléments et éléments de cet article.

Les recherches récentes en analyse sportive se sont orientées vers des cadres d’apprentissage profond multimodaux et contextuels qui combinent vidéo, données positionnelles et indices contextuels pour interpréter le comportement tactique. Diverses approches basées sur les transformateurs ont démontré une forte capacité à modéliser la structure temporelle à longue portée et les relations intermodales dans des environnements sportifs, notamment : MM-ViT pour la reconnaissance d’actions multimodales, transformateurs à fusion contrastive unifiées pour le raisonnement en contexte sportif, et détecteurs d’événements à attentioncroisée 21,22. Ces approches précisent que les décisions tactiques sont mieux représentées à l’aide d’architectures qui capturent les interactions entre les joueurs, l’espace, les indices de mouvement et les informations contextuelles, plutôt que par des modèles CNN-LSTM monomodals. Dans cette optique, l’étude proposée utilisera également un cadre de fusion multimodale basé sur des transformateurs pour traiter conjointement les signaux visuels, positionnels et contextuels pour la modélisation quasi en temps réel des décisions tactiques footballistiques.

Les modèles précédents d’analyse du football étaient généralement construits autour de l’architecture CNN-LSTM ou BiLSTM, qui capturent des schémas temporels locaux mais rencontrent des difficultés avec les dépendances à longue portée entre les modalités. Les Transformers comblent ce manque en appliquant une attention globale à soi, permettant à un modèle de relier les mouvements des joueurs, les trajectoires de balle et les indices situationnels à travers des capacités de fenêtres temporelles étendues pour une analyse robuste des décisions tactiques. Afin de résoudre le problème de la rareté des données d’évaluation pour les systèmes de recommandation, l’auteur 23,24 a suggéré une technique de factorisation matricielle basée sur des revues qui combine filtrage collaboratif basé sur les revues et imputation des notations.

Néanmoins, leur efficacité, leur évolutivité et leur applicabilité sont fortement limitées par leur dépendance aux encadrements pour l’inférence et la nécessité énorme d’étiquetage des données. Une méthode pour résoudre ce problème consiste à utiliser des étiquettes de boîtes englobantes pour entraîner simultanément la détection des joueurs et la reconnaissance des activités de groupe 25,26,27,28. Bien que des annotations de boîtes englobantes au niveau des acteurs soient toujours nécessaires pour les données d’entraînement, la méthode proposée calcule les boîtes englobantes des joueurs lors de l’inférence. L’approche de reconnaissance faiblement supervisée des activités de groupe (WSGAR), qui ne nécessite pas d’étiquettes au niveau acteur pour la formation ou l’inférence, vise à alléger la charge des annotations. Après avoir généré des suggestions de boîtes englobantes à l’aide d’un détecteur pré-entraîné sur un jeu de données externe, ils ont appris à filtrer les détections non pertinentes. Récemment29, les chercheurs ont présenté une approche sans détecteur pour le défi WSGAR qui utilise des embeddings de jetons pour générer des contextes partiels collectant des informations sur les joueurs.

Dans l’analyse sportive, les architectures multimodales et basées sur transformateurs ont récemment pris de l’importance car elles peuvent capturer des schémas temporels à longue portée et intégrer des flux de données hétérogènes30,31. Des variantes de transformateurs ont été appliquées pour prévoir les mouvements des joueurs, réaliser des analyses tactiques multi-vues et reconnaître l’intention d’action, démontrant un raisonnement temporel exceptionnel comparé au modèle CNN-LSTM. Les stratégies de fusion multimodale, qui combinent vidéo, position et indices contextuels, ont donné des résultats précoces encourageants en modélisation tactique en temps réel et ont mis en lumière l’importance de l’attention croisée et de l’apprentissage séquence à séquence dans la compréhension des dynamiques de décision en jeu.

Les cadres multimodaux basés sur les transformateurs ont récemment démontré des performances exceptionnelles dans divers secteurs où l’intégration de flux de données diversifiés est nécessaire. Par exemple, des modèles de fusion multimodale basés sur ViT ont été utilisés pour interpréter conjointement des informations vidéo, pose et audio en employant des processus d’attention croisée pour la prédiction d’événements contextuels, le suivi des joueurs et la reconnaissanced’actions 32,33. De plus, l’architecture MM-Former et basée sur Perceiver a surpassé les modèles récurrents et convolutionnels dans la fusion des indices spatio-temporels, ainsi que dans le raisonnement temporel à longue portée, en analyse sportive et analyse de l’activitéhumaine 34. Ces résultats soutiennent l’utilisation d’une architecture de fusion multimodale basée sur les transformateurs dans cette étude en indiquant que les transformateurs sont capables de capturer des interactions à grains fins entre modalités grâce à une attention globale35. Les transformateurs sont particulièrement adaptés à l’analyse tactique, car leur attention globale permet au modèle de relier les indices visuels, les données positionnelles et les signaux contextuels à travers des fenêtres temporelles plus longues, des capacités que les modèles CNN-LSTM et BiLSTM n’ont pas.

Les études précédentes ont principalement utilisé des évaluations manuellement formées et authentifiées pour évaluer la vitesse de performance et la précision des décisions dans des activités préétablies, telles que la conduite et les dépassements, malgré l’intérêt croissant pour l’évaluation de la prise de décision tactique dans les sportsd’équipe 36, 37, 38. Ces cadres ont des limites en termes de scalabilité, d’objectivité et d’adéquation pour des circonstances dynamiques et réelles, malgré la fourniture de données éclairantes sur le comportement des joueurs et l’excellence de la prisede décision 39. Les approches informatisées basées sur les données capables d’enregistrer et de comprendre la nature multimodale de la prise de décision tactique, qui implique des associations complexes entre les actions des joueurs, les signaux visuels, les indices sonores et les paramètres de jeu, ne sont pas combinées dans les méthodesactuelles 40,41,42. De plus, les structures d’IA multifacettes capables de basculer entre relations de fond et temporelles sont souvent négligées par ces méthodes. La croissance d’un cadre de fusion multimodale basé sur Transformer, qui utilise des sources de données riches en temps réel, telles que des séquences vidéo et le suivi de position, et intègre des processus décisionnels dans les sports d’équipe, fait clairement défaut. Combler cet écart peut considérablement améliorer la pénétration tactique, la scalabilité et l’indépendance de la prise de décision dans les environnements sportifs de haute performance. Contrairement aux méthodologies actuelles CNN-LSTM et BiLSTM, cette fusion basée sur les transformateurs modélise consciemment l’attention intermodale entre informations visuelles, spatiales et contextuelles. Cette nouveauté favorise une représentation tactique plus dense et aide à réduire la mauvaise classification lors des scénarios de pression de plus de 40 %.

L’objectif principal de cette étude est de développer un cadre de fusion multimodale basé sur les transformateurs pour évaluer la prise de décision tactique en football. Bien que le cadre proposé puisse être généralisé à d’autres sports d’équipe, cette étude se concentre sur le football en raison de sa complexité tactique et de la disponibilité de jeux de données structurés. Le système permet une évaluation structurée de la précision tactique et du temps de réponse dans des tâches footballistiques contrôlées et isolées, basée sur des évaluations d’experts. Ce travail répond aux limites des environnements d’évaluation manuelle et de tests statiques en intégrant des sources de données multimodales, incluant le suivi positionnel, les séquences vidéo, les signaux audio et les informations contextuelles du jeu.

En employant des processus d’attention basés sur des transformateurs, le cadre proposé apprend continuellement les liens multimodaux, permettant une interprétation unifiée et contextuelle des méthodes de prise de décision en temps réel des joueurs.

L’objectif principal de cette détermination est de promouvoir une évaluation intelligente des performances dans le sport en offrant aux entraîneurs et analystes une compréhension plus approfondie de la pensée des joueurs et de la dynamique d’équipe grâce à des analyses basées sur les données.

Le cadre proposé apprendra en continu les relations intermodales en tirant parti des mécanismes d’attention des transformers, lui permettant d’obtenir une compréhension unifiée des stratégies décisionnelles des joueurs lors de parties en temps réel.

Cela dote ainsi le système de la capacité d’apporter des informations exploitables sur un comportement tactique qui serait autrement difficile à caractériser avec des méthodes d’évaluation standard.

L’objectif est d’améliorer l’interprétabilité et de fournir aux coachs et analystes des informations plus utiles.

La principale contribution de ce travail est donnée ci-dessous :

Cette étude utilise un design de fusion multimodale basé sur Transformer pour présenter un modèle novateur d’apprentissage profond destiné à l’analyse de la prise de décision tactique dans les sports d’équipe.

En intégrant des flux de données visuelles, positionnels et contextuels extraits de séquences réelles, cette approche étend considérablement la portée des méthodes d’évaluation simples introduites dans l’étude de base, qui se concentrait sur les passes en solo et les actions de pénétration.

L’encodeur multimodal collecte des relations spatiotemporelles sophistiquées en intégrant des données de suivi des joueurs, des images visuelles et des événements contextuels de match à l’aide de mécanismes d’attention.

Des expériences sur un jeu de données de référence footballistique ont révélé que ce modèle surpassait les références traditionnelles telles que les méthodes de fusion basées sur CNN et le LSTM.

Comparé aux références CNN-LSTM, BiLSTM-Attention et GNN, l’architecture de fusion multimodale basée sur transformateurs suggérée montre des gains significatifs.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’étude comprenait 40 joueurs de football masculins âgés de 18 à 24 ans (moyenne = 20,1 ± 1,2), recrutés dans quatre clubs amateurs et semi-professionnels au sein d’une même ligue régionale. Tous les participants avaient au moins trois ans d’expérience compétitive et s’entraînaient actuellement dans un environnement structuré. La collecte de données a été effectuée dans deux contextes contrôlés : d’abord, lors d’exercices standardisés sur le terrain d’entraînement qui simulaient des scénarios tactiques de décision de passe/conduite ; deuxièmement, lors de longues sessions de simulation de matchs à partir desquelles des séquences multimodales étaient extraites. Toutes les procédures ont été approuvées par le Comité d’éthique institutionnelle de l’Université du Golfe de Beibu (Numéro d’approbation : BG-PE-2023-117), et un consentement éclairé écrit a été obtenu de tous les participants avant la collecte des données. Des normes éthiques internationales et institutionnelles ont été respectées lors de la conduite de cette enquête. Le comité d’éthique institutionnelle de l’Université du Golfe de Beibu a examiné et autorisé toutes les procédures impliquant des sujets humains (Numéro d’approbation : BG-PE-2023-117). Avant la collecte des données, chaque participant fournissait un consentement éclairé écrit, et toutes les données collectées étaient anonymisées avant analyse.

Ce travail vise à automatiser et à améliorer l’investigation de la prise de décision tactique des sports d’équipe grâce à une architecture de fusion multimodale basée sur Transformer. Il utilise une variété de sources de données, incluant la vidéo, l’audio, la localisation spatiale et les métadonnées du joueur, pour créer un modèle prédictif robuste en temps réel. La figure 1 montre l’architecture de la méthode proposée. Le projet proposé se compose de cinq étapes. Les étapes sont décrites ci-dessous :

Figure 1
Figure 1. Architecture de la méthode proposée. Schéma du modèle combinant entrées multimodales et composantes de classification pour la prise de décision tactique. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Acquisition et prétraitement des données

Les données issues de diverses modalités sont recueillies à partir d’enregistrements de matchs, tels que des flux vidéo, des commentaires audio, des informations GPS/positionnement et des indicateurs de performance des joueurs. Chaque modalité subit un prétraitement sous forme de techniques telles que l’extraction de trames (pour la vidéo), le filtrage du bruit (pour l’audio) et la normalisation (pour les lectures des capteurs), assurant la synchronisation aux étapes du temps.

Les images vidéo étaient extraites à 25 fps, réduites à 224 × 224 de résolution. Les signaux audio étaient traités avec un filtre passe-bande, allant de 300 à 3 400 Hz, afin d’éliminer la majorité du bruit environnemental. Les données de suivi positionnel provenant des capteurs GPS étaient enregistrées à 10 Hz et interpolées à l’aide d’une interpolation linéaire basée sur l’horodatage, garantissant leur alignement avec la timeline vidéo à 25 Hz. Toutes les entrées étaient alignées temporellement à l’aide de horodatages partagés, et leurs échelles étaient normalisées avec le score z.

Extraction des caractéristiques

Pour recueillir les informations spatio-temporelles des données vidéo, des CNN 3D sont utilisées. Les CNN 3D gèrent à la fois des informations spatiales et temporelles à travers les images vidéo, rendant le modèle capable de détecter les schémas de mouvement, de comprendre le comportement des groupes et d’extraire des caractéristiques basées sur le mouvement. Cette opération génère une représentation dense des caractéristiques par séquence d’actions, qui sert d’entrée visuelle au modèle. Chaque clip d’entrée vidéo contenait 16 images consécutives échantillonnées à une foulée de 2. Des recadrages aléatoires, des basculements horizontaux et une normalisation de la luminosité ont été appliqués pendant l’entraînement. Le CNN 3D a été optimisé avec Adam (lr = 0,0001), la taille du lot 16 et la perte d’entropie croisée.

Intégration et alignement des entrées multimodales

Ensuite, des embeddings provenant de différentes modalités sont intégrés aux sorties du CNN 3D. Une architecture de modèle de transformateur multimodale est employée, avec différentes branches d’encodeurs gérant chaque modalité. Des couches d’attention croisée sont employées pour la fusion et l’alignement des modalités, permettant au modèle de capturer les interdépendances (par exemple, entre les positions des joueurs et le mouvement du ballon, ainsi que le contexte issu des commentaires). Cette fusion permet une compréhension contextuelle enrichie des choix tactiques actuels. Toutes les incorporations ont également été implémentées dans PyTorch. Les caractéristiques vidéo étaient projetées linéairement de 1 024 à 512 dimensions, tandis que les caractéristiques audio et positionnelles étaient projetées respectivement sur 256 et 128 dimensions, unifiées sur 512 dimensions avant l’alignement temporel.

Fusion multimodale basée sur des transformateurs

Un transformateur multimodal est utilisé pour combiner les caractéristiques extraites de toutes les sources. Les mécanismes d’auto-attention dans le transformateur permettent au modèle d’apprendre les interdépendances entre modalités (par exemple, visuelle + audio), de capturer le flux temporel et le contexte, et de mettre en évidence des cadres et événements tactiquement importants. Le résultat de cette étape est une représentation combinée qui capture l’intention tactique et le contexte situationnel de chaque décision prise. Le transformateur multimodal se composait de six couches d’encodeur, chacune avec huit têtes d’attention. Les matrices d’attention étaient calculées à l’aide d’une attention scalaire à grande échelle. Les couches d’attention et d’avance d’avance incluaient également un dropout avec p = 0,1 pour éviter le sur-ajustement.

Classification et évaluation des décisions tactiques

Enfin, la représentation fusionnée est alimentée en entrée à une couche de classification ou à un bloc d’analyse décisionnelle, qui sert à prévoir le type de décision tactique, évaluer la qualité de la décision et, en option, générer des informations explicables pour les entraîneurs via des cartes de chaleur d’attention ou des cartes d’activation. Le résultat de cette étape fournit une évaluation quantitative et qualitative des capacités décisionnelles d’une équipe ou d’un joueur lors du match play.

La tête de classification utilisait une MLP à trois couches avec activation ReLU suivie d’une couche softmax. Le modèle a été entraîné sur une répartition 70/15/15 avec validation croisée 10 fois. Les métriques utilisées étaient la précision, la précision, le rappel, le score F1, la latence et l’AUC.

Un organigramme simplifié, résumant les cinq étapes, offre un aperçu visuel immédiat du processus séquentiel, comme montré à la Figure 2. Cette figure représente de manière concise l’ensemble du pipeline de recherche, comprenant l’acquisition de données, le prétraitement, l’extraction de caractéristiques, la fusion multimodale et la classification tactique des décisions, suivies de descriptions détaillées de chaque étape.

Figure 2
Figure 2. Le flux de travail global du processus de recherche. Aperçu du pipeline de recherche, de la collecte et prétraitement des données à l’extraction des fonctionnalités, l’entraînement et l’évaluation des modèles. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La figure 3 montre le flux de travail global du processus de recherche suggéré. Le processus est initié par l’étape 1 : Acquisition et prétraitement des données, où des sources de données multimodales, telles que la vidéo, l’audio, le suivi positionnel et les métadonnées contextuelles, sont collectées et synchronisées. Lors de l’étape 2 : Extraction de fonctionnalités, des réseaux neuronaux convolutionnels 3D (CNN 3D) sont utilisés pour extraire des informations spatiotemporelles des flux vidéo, ce qui donne des représentations visuales denses des actions des joueurs et du flux tactique. Étape 3 : Intégration et alignement des entrées multimodales combine l’audio, la vidéo et les caractéristiques positionnelles dans un espace latent partagé, avec un alignement temporel et un alignement intermodal. Ces représentations sont ensuite agrégées dans l’étape 4 : Fusion multimodale basée sur les transformateurs, où les mécanismes inter-modaux et d’auto-attention permettent au modèle d’apprendre les interdépendances entre modalités et d’obtenir des insights contextuels plus profonds sur les décisions tactiques. Enfin, à l’étape 5 : Classification et évaluation des décisions tactiques, les représentations combinées sont intégrées dans une couche de classification pour détecter les décisions tactiques, telles que passer, pousser ou maintenir. Par contre, des indicateurs de performance sont utilisés pour estimer la précision de la prise de décision et le temps de réponse. Ce diagramme offre une vue d’ensemble claire de l’approche étape par étape, complétée par les descriptions textuelles détaillées décrites dans les sections suivantes.

Figure 3
Figure 3. Pipeline de traitement séquentiel. Illustre le flux étape par étape de l’acquisition des données à la classification tactique des décisions et à la sortie du modèle. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Acquisition et prétraitement des données

Pour permettre une analyse tactique de prise de décision de haut niveau dans les sports d’équipe via un pipeline de fusion multimodale utilisant Transformer, une configuration structurée et haute fidélité pour l’acquisition et le prétraitement des données a été mise en place. La configuration consiste à fusionner plusieurs modalités de données, notamment des enregistrements vidéo, le suivi de la position des joueurs, les signaux audio issus des interactions joueur-entraîneur, ainsi que des métadonnées contextuelles telles que la phase du match, la structure de l’équipe et les zones de possession.

L’échantillon de l’étude comprenait 40 hommes âgés de 20 ans et plus, tous activement impliqués dans des ligues régionales de football amateur et semi-professionnel. Chacun d’eux a été recruté parmi quatre clubs compétitifs qui disposaient d’un programme d’entraînement structuré. L’âge moyen des athlètes était de 20,1 ± 1,2 an, avec une taille moyenne de 177,5 ± 3,1 cm et un poids moyen de 72,6 ± 2,9 kg. Ils jouaient pour leurs clubs respectifs depuis en moyenne 6,8 ± 1,5 an. Tous les participants avaient également au moins trois ans d’expérience compétitive et se sont révélés tactiquement compétents.

Pour garantir la puissance statistique, la taille de l’échantillon a été approximée en utilisant un niveau de fiabilité de 95 % (Z = 1,96) et un niveau de signification de 5 %, avec un coefficient de corrélation intraclasse (ICC) attendu de 0,96 et un intervalle de confiance de 95 % pour refléter un accord quasi parfait. Cela est cohérent avec l’objectif de valider la fiabilité et la cohérence des données de prise de décision multimodalescollectées 27.

Pour garantir la reproductibilité, les paramètres d’acquisition et les spécifications techniques ont été standardisés entre les sessions. Les données vidéo étaient enregistrées en résolution 1 080p et à 25 images par seconde à l’aide de caméras GoPro Hero4 avec un réglage large champ de vision pour capturer tout l’espace tactique. Chaque enregistrement était stabilisé et monté à une hauteur fixe de 2,5 m. Les signaux audio étaient capturés à l’aide d’un microphone de terrain externe à une fréquence d’échantillonnage mono de 44,1 kHz, puis filtrés à l’aide d’un filtre passe-bande de 300 à 3 400 Hz pour éliminer le bruit environnemental. Les données de suivi positionnel ont été collectées à l’aide de capteurs GPS portables fonctionnant à 10 Hz, avec une précision positionnelle moyenne rapportée par le fabricant de ±0,5 m. Toutes les modalités ont été synchronisées à l’aide de horodatages partagés et rééchantillonnées dans une ligne temporelle commune à 25 Hz par interpolation linéaire.

Le prétraitement comprenait alors les éléments suivants : le downsampling vidéo à 224 × 224 résolutions, l’échantillonnage d’images de 16 images consécutives avec une foulée de 2, le recadrage aléatoire, le basculement horizontal, la normalisation de la luminosité, la normalisation audio, le filtrage du bruit, ainsi que la normalisation du z-score par variables positionnelles et contextuelles.

Le script de prétraitement est organisé dans l’ordre suivant pour la reproductibilité : (i) extraction de trame ; (ii) filtrage audio ; (iii) interpolation GPS ; (iv) rééchantillonnage modal à 25 Hz ; (v) normalisation du score z ; et (vi) des tests d’intégrité pour détecter la corruption, l’occultation et l’abandon. Des scripts de traitement par lots sont utilisés pour compléter automatiquement chaque étape.

Pour garder les données fiables, les critères de contrôle qualité et d’exclusion comprenaient : i) des séquences avec >20 % d’occlusion du lecteur), ii) une interruption GPS dépassant 200 ms, iii) un son corrompu ou éclipsé, et iv) un flou de mouvement sévère ou une désynchronisation entre les modalités. Un total de 17 séquences (3,4 %) ont été exclues pour ces conditions. Le tableau 1 présente la description du jeu de données.

AttributsDétails
SportFootball (Soccer)
Participants40 joueurs de football masculins
Niveau de jeuJoueurs de football fédérés avec ≥5 ans d’expérience
Type d’essaiTest de prise de décision et d’exécution de la passe et de la pénétration (contrôle du ballon)
Configuration des testsConfiguration standardisée des terrains de football, zones marquées, positions fixes
Outils de mesureCaméras GoPro Hero4, logiciel Kinova, chronomètre
Données collectéesTemps d’exécution (ET), Précision de la prise de décision (DM), nombre d’actions correctes
Procédure de testLes joueurs ont réagi à des stimuli visuels des entraîneurs et exécuté des passes ou des pénétrations
Répétitions de procès10 essais par joueur (5 passes, 5 drives)
ÉvaluationExperts classés DM ; TE mesuré à l’aide de horodatages/vidéo
Variables de résultatTemps de réaction, nombre de décisions correctes, score d’exécution technique

Tableau 1 : Description de l’ensemble de données. Détaille les données démographiques des participants, les procédures de test, les outils de mesure et les variables de résultats.

Dans la présente étude, deux ensembles de données liés mais distincts ont été utilisés. Le premier jeu de données comprenait 40 joueurs ayant participé à des tâches contrôlées de prise de décision de passe/poussée, principalement utilisées pour établir la fiabilité de base et valider la procédure de base de mesure des décisions. Le second jeu de données comprend 500 séquences tactiques multimodales collectées à partir de simulations de matchs étendues et d’enregistrements de parties réelles. Ces séquences constituaient le principal ensemble de données d’entraînement et de test pour le modèle de fusion basé sur les transformateurs, permettant une évaluation dans des conditions écologiquement plus valides.

Bien que le jeu de données comprenne 500 séquences multimodales, l’échantillonnage stratifié a assuré une représentation équilibrée entre les actions tactiques (Passe, Drive, Hold). Des approches d’augmentation de données, telles que le recadrage temporel et le mélange de séquences, ont également été utilisées pour améliorer la variabilité et atténuer le biais du modèle lors de l’entraînement.

Il convient de noter que l’ensemble de données contrôlé par 40 joueurs a été utilisé pour la validation initiale du modèle et les tests de fiabilité, tandis que la collection plus large de 500 séquences multimodales a été compilée à partir d’enregistrements prolongés de matchs et de sessions d’entraînement organisées pour évaluer la scalabilité et la validité écologique du cadre. La fiabilité de base a été établie à partir du plus petit ensemble de données, tandis que le plus grand ensemble a facilité l’entraînement et les tests à grande échelle de modèles.

Description du jeu de données

L’expérience a recruté 40 joueurs de football masculins, chacun ayant au moins cinq ans d’expérience en fédération, afin de s’assurer que la population échantillonnée possédait des compétences techniques et tactiques de base. La collecte des données s’est déroulée dans un système standardisé de terrains de football, où des zones et des positions de jeu prédéterminées étaient attribuées afin d’assurer des conditions de test identiques. Lors de l’expérimentation, les participants devaient répondre à des indices visuels d’un entraîneur, soit pour passer, soit pour pénétrer le ballon, reproduisant ainsi les décisions tactiques prises lors d’un vrai match. Chaque participant a réalisé un total de 10 essais, cinq de passage et cinq de conduite. Ces mouvements ont été capturés avec des caméras GoPro Hero4, et les données de performance ont été mesurées à l’aide du logiciel d’analyse vidéo Kinovea en parallèle d’un chronomètre manuel pour enregistrer le temps d’exécution (ET). La principale source de données recueillie était : le temps d’exécution, la qualité du DM évaluée par des coachs expérimentés, et la quantité d’actions correctes effectuées. Ces facteurs ont fourni une base quantitative pour analyser la rapidité et l’efficacité des acteurs dans la prise et la mise en œuvre des décisions tactiques sous des conditions contrôlées de stimulus-réponse. Le jeu de données produit est une ressource structurée et étiquetée, bien adaptée à la création de benchmarks ou à l’entraînement de systèmes intelligents dans le but de modéliser la pensée tactique et les réponses motrices dans les contextes des sports d’équipe.

L’échantillon est limité aux jeunes joueurs masculins issus d’une ligue régionale, ce qui peut limiter sa généralisation à travers les groupes d’âge, les athlètes féminines ou d’autres cultures. Les études futures tenteront de constituer des échantillons plus représentatifs et diversifiés.

Une autre limitation est la taille de l’échantillon de 40 jeunes joueurs masculins issus d’une seule ligue régionale. Bien que l’échantillon homogène ait contribué à la validité interne et à la réduction de la variation des performances en raison de l’âge, du genre et des différences de contexte tactique, il limite également la généralisation des résultats à une population plus large. Les schémas tactiques que le modèle apprend peuvent donc refléter des styles de jeu spécifiques à une région ou à un genre, plutôt qu’un comportement décisionnel universel. Pour cette étude, un échantillonnage stratifié et une augmentation des données ont été utilisés pour améliorer la variabilité de l’ensemble de données en question ; Cependant, des études de recherche à plus grande échelle impliquant des athlètes, des jeunes joueuses, des joueuses professionnelles et des participantes issues de multiples cultures tactiques sont nécessaires pour confirmer la solidité du modèle dans divers environnements footballistiques. Ces résultats démontrent un fort potentiel mais nécessitent une validation supplémentaire sur des ensembles de données plus diversifiés et plus vastes avant qu’une généralisation plus large puisse être revendiquée.

Pour réduire la subjectivité, trois entraîneurs professionnels de football ont annoté indépendamment les choix tactiques. La fiabilité entre évaluateurs a été estimée à l’aide du coefficient de corrélation intraclasse (ICC = 0,96, IC 0,94-0,98), indiquant un accord quasi parfait. La discussion consensuelle a permis de résoudre les désaccords. Pour les données multimodales, le prétraitement impliquait une synchronisation temporelle entre les modalités (vidéo 25 fps et données capteurs 10 Hz) et une normalisation z-score des caractéristiques afin de permettre la comparabilité entre modalités.

La fiabilité inter-évaluateurs a été quantifiée à l’aide d’un coefficient de corrélation intraclasse à effets aléatoires bidirectionnels (ICC [2,3]), car il convient à évaluer l’accord absolu entre plusieurs évaluateurs. L’ICC de 0,96 (IC à 95 % : 0,94-0,98) indique un accord quasi parfait selon les seuils couramment utilisés et établit en outre que les étiquettes de décision tactique utilisées pour la formation étaient très fiables. La fiabilité a été calculée sur les 500 séquences multimodales, garantissant que les contextes contrôlés et de simulation de match soient correctement et de manière cohérente annotés.

Procédure d’annotation et protocole d’étiquetage

Toutes les séquences multimodales étaient annotées à l’aide d’un protocole structuré en trois étapes. Premièrement, trois entraîneurs de football agréés ont examiné indépendamment chaque séquence vidéo-positionnelle à l’aide d’une interface d’annotation synchronisée avec l’heure (Kinovea + tableur de tags personnalisé). Les annotateurs indiquaient la catégorie de décision tactique (Passe, Drive, Hold), les indices contextuels (zone de pression, disponibilité de la voie de passe) et les horodatages des événements. Deuxièmement, un script de détection des désaccords identifiait automatiquement les cas d’ambiguïté ou de conflit, qui étaient ensuite examinés lors d’une réunion de consensus conjointe. Troisièmement, pour garantir la cohérence dans la marquage des limites d’événements et l’alignement temporel entre les modalités, un dernier passage a été effectué par un analyste senior indépendant. Ce processus, pour l’entraînement ultérieur du modèle, garantissait que chaque annotation était traçable et de la meilleure qualité.

Prétraitement

Alors que la présente étude a été menée avec 500 séquences multimodales, la chaîne de prétraitement a été, par conception, conçue pour des ensembles de données à grande échelle. Toutes les modalités ont subi des scripts automatisés qui, en parallèle, ont extrait des images vidéo par lots, rééchantillonné l’audio, interpolé les données de position et appliqué la normalisation z-score. La présence d’une architecture modulaire permet à chaque modalité d’être prétraitée indépendamment sur des threads GPU/CPU séparés. Cela permet une ingestion à grand volume des images du match. Cela garantit que le flux de travail peut être facilement adapté à des ensembles de données sur toute la saison sans intervention manuelle et rend le cadre adapté au déploiement concret dans des environnements d’analyse professionnels.

Pour examiner correctement la prise de décision tactique dans les sports d’équipe, les données brutes provenant de différentes modalités — par exemple, extraits vidéo, signaux audio et enregistrements de position — doivent être prétraitées et alignées. L’illustration de l’entrée multimodale est

Équation 1(1)

Ici, V est noté comme une série de caractéristiques vidéo extraites de l’encodeur CNN.

Équation 2(2)

Ici, A est une caractéristique audio encodée par wave2vec.

Équation 3(3)

P représente la position coordonnée d’un joueur au moment ti.

Pour traiter les taux d’échantillonnage asynchrones, chaque modalité est rééchantillonnée ou interpolée dans une chronologie partagée :

Équation 4(4)

Ici Équation 5, est une caractéristique synchronisée ft , est le taux de repère combiné, Xm est une indication initiale.

Pour une échelle uniforme entre modalités, tous les vecteurs de caractéristiques sont normalisés selon le score z :

Équation 8(5)

μX et σX désignent la moyenne et l’écart-type de la dimension des caractéristiques dans l’ensemble d’entraînement.

Bien que les principales préoccupations soient les décisions de passe/pénétration, des canaux audio (par exemple, communication joueur/entraîneur, indices environnementaux de jeu) ont été ajoutés pour tenir compte des situations réelles du match où les signaux vocaux affectent la réaction tactique. Les hyperparamètres (par exemple, taux d’apprentissage, époques) ont été choisis via la recherche en grille et les évaluations existantes dans l’apprentissage multimodal, trouvant un équilibre entre stabilité de convergence et efficacité computationnelle.

Les hyperparamètres du cadre suggéré — taux d’apprentissage, taille du lot et époques d’entraînement — ont été choisis grâce à une recherche systématique en grille bien planifiée afin d’atteindre à la fois la stabilité de convergence et l’efficacité computationnelle. Le choix d’un taux d’apprentissage de 0,0001 avec l’optimiseur Adam a permis de fournir des mises à jour stables du gradient sans oscillations, tandis que les tailles de lots ont été optimisées pour équilibrer la capacité mémoire GPU avec le débit d’entraînement. Le réglage de 50 à 100 époques a été utilisé pour permettre un apprentissage adéquat sans surapprentissage, comme le confirment le suivi des pertes de validation et la validation croisée 10 fois. Ces valeurs n’ont pas été fixées arbitrairement mais ont été guidées par des tests antérieurs en apprentissage multimodal et ajustées par des essais expérimentaux sur l’ensemble de données actuel. Ce processus rigoureux garantissait que les hyperparamètres sélectionnés facilitaient l’entraînement stable des modèles et des améliorations reproductibles des performances par rapport aux approches de base.

Bien que la tâche de classification porte sur les décisions de passe/pénétration/maintien, les informations audio ont été intentionnellement incluses, car le comportement tactique réel dans le football est fortement influencé par la communication joueur-entraîneur, les appels des coéquipiers, les signaux pressés et les sons environnementaux (par exemple, contact du ballon, approche de l’adversaire). Ces indices précèdent fréquemment ou coexistent avec la prise de décision et font partie de l’environnement perceptif naturel des joueurs de football. Des expériences préliminaires d’ablation ont montré que l’exclusion de l’audio réduisait la rappel de 3,8 %, ce qui a indiqué que même des indices acoustiques subtils contribuent à la conscience du contexte. Pour cette raison, l’audio a été conservé afin de préserver la validité écologique et d’améliorer la capacité du modèle à généraliser aux conditions réelles de correspondance.

En effet, pour renforcer ces hyperparamètres, une analyse interne de sensibilité a été réalisée en variant systématiquement le taux d’apprentissage de 1e-5 à 5e-4, la taille du lot de 8 à 32, le nombre de couches transformateurs de 4 à 8, et le nombre de têtes d’attention de 4 à 12. La configuration choisie, avec un taux d’apprentissage de 1e-4, une taille de lot de 16 et un encodeur à 6 couches avec 8 têtes d’attention, a continuellement permis de produire une convergence stable avec la plus faible perte de validation, minimisant ainsi le surapprentissage sur une validation croisée de 10 fois. Des tailles de lots plus grandes entraînaient une instabilité du gradient, tandis que des lots plus petits augmentaient le bruit et retardaient la convergence. De même, les modèles de transformateurs avec plus de 8 têtes n’ont montré aucune amélioration des performances, mais ils ont considérablement augmenté le temps de calcul. Les résultats obtenus justifient les réglages finaux des hyperparamètres utilisés dans cette étude.

Extraction de caractéristiques à l’aide d’un réseau de neurones convolutionnel 3D

Dans le cadre proposé de fusion multimodale basée sur les transformateurs pour la prise de décision tactique des sports d’équipe, le réseau neuronal convolutionnel 3D (CNN 3D) est responsable de l’extraction des caractéristiques spatio-temporelles des clips vidéo bruts.

Contrairement aux CNN 2D, qui ne prennent en compte que les dimensions spatiales (largeur W et hauteur H), les CNN 3D prennent également en compte la dimension temporelle R, leur permettant de détecter la dynamique des mouvements et des schémas séquentiels cruciaux pour comprendre les comportements d’équipe, comme les pénétrations et les passes en football.

Le 3D-CNN28 est d’abord proposé pour combiner l’information spatiale et temporelle des données vidéo. Un noyau 3D est utilisé dans un algorithme de convolution 3D vers un cube composé de trames avec une partie des colonnes empilées. La convolution 3D peut être écrite en Équation (6)

Équation 11(6)

Où : Équation 12 est la caractéristique de sortie à l’emplacement (x, y, z) sur la j-ième carte de caractéristiques de la l-ième couche.Équation 14 est le poids du noyau à l’emplacement (h,w,r) de la m-ième carte de caractéristiques d’entrée. Équation 16 est l’entrée au décalage spatial-temporel par rapport à la couche précédente. blj est le biais. f(.) est la fonction d’activation (généralement ReLU). M est le nombre de cartes de caractéristiques d’entrée provenant de la couche précédente. Cette équation permet au CNN 3D de combiner en parallèle les informations spatiales (hauteur et largeur) et temporelles (séquence d’images).

Figure 4
Figure 4. Architecture de traitement CNN 3D. Illustre comment les caractéristiques spatiotemporelles sont extraites des séquences vidéo à l’aide d’opérations convolutionnelles 3D. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

La figure 4 montre le processus de fonctionnement d’un CNN 3D. Le pipeline commence par la phase d’entrée, où les flux vidéo non traités d’un match de football sont fusionnés avec des données organisées, y compris les positions des joueurs, les statistiques du match et les métadonnées contextuelles. Cette information multimodale préserve à la fois la dynamique visuelle et le contexte situationnel, qui sont essentiels pour l’analyse des tactiques d’équipe. Ensuite, le flux vidéo est acheminé à travers un réseau neuronal convolutionnel 3D (CNN 3D). Dans ce cas, une série de couches convolutionnelles 3D est utilisée sur les trames d’entrée. Les couches s’articulent le long des dimensions spatiales (hauteur et largeur) et de la dimension temporelle (images), permettant au réseau d’apprendre les schémas de mouvement, les interactions des joueurs et les tactiques basées sur la séquence, telles que les passes ou les pénétrations. Par la suite, un cube de caractéristiques se forme avec des caractéristiques spatiotemporelles denses. Ce cube est soumis à des opérations de pooling pour réduire la dimension tout en préservant des caractéristiques significatives. Lors du pooling, le volume des caractéristiques est aplati en un vecteur 1D, fournissant une représentation concise de la situation tactique. Ce vecteur de caractéristiques est ensuite envoyé dans un réseau de neurones profond (DNN) entièrement connecté. Le DNN est le bloc décisionnel, qui traite les caractéristiques fusionnées et extraites pour prendre des décisions tactiques, telles que passer, tirer ou maintenir. La sortie du réseau est la décision tactique finale prise par le système basée sur la situation réelle du jeu en temps réel ainsi que sur les schémas stratégiques appris.

Intégration et alignement des entrées multimodales

Après l’extraction des caractéristiques, les trois caractéristiques, telles que l’audio, la vidéo et la position statistique du lecteur, sont données en mode d’entrée.

Pour les entrer dans un transformateur puis les faire passer chacun via une fonction d’intégration apprenable :

Équation 19(7)

où f3DCNN apprend les caractéristiques spatiotemporelles de chaque tranche de temps Vt et les mappe à un espace latent de dimension d.

Équation 22(8)

où WP et bP sont des poids apprenables.

Équation 25(9)

Tous les plongements sont alignés par la dimension temporelle T. Si les modalités ont des fréquences disparates, il utilise l’interpolation ou l’échantillonnage descendant :

Équation 26(10)

Aujourd’hui, toutes les modalités sont synchronisées comme suit :

Équation 27(11)

Pour préserver l’ordre temporel dans le transformateur, introduisez également des codages positionnels à chaque vecteur :

Équation 28(12)

Équation 29 représente l’encodage positionnel sinusoïdal ou apprenable par défaut.

Chaque modalité est encodée opérationnellement à l’aide d’une couche linéaire PyTorch, concaténée en un vecteur 512-d, puis alimentée dans la séquence d’entrée du transformateur après un codage positionnel. Cela garantit qu’un embedding unifié est prêt pour l’attention croisée à chaque étape temporelle.

Le tenseur final est

Équation 30(13)

est intégré au Transformer Encoder, où l’auto-attention et les mécanismes d’attention inter-modaux permettent au modèle de raisonner conjointement à travers toutes les modalités pour la prise de décision tactique.

Fusion multimodale basée sur des transformateurs

Dans l’approche proposée, la méthode de factorisation matricielle de bas rang est employée pour intégrer les vecteurs de données multimodaux acquis. Le problème de haute dimension qui survient lorsque les tenseurs sont fusionnés directement est traité par cette méthode, qui utilise un facteur de décomposition de bas rang pour la fusiontensorielle 29. Chaque modalité est initialement exprimée sous forme de vecteur, et une réduction de dimensionnalité qui préserve des interactions significatives est obtenue par décomposition de bas rang. Le tenseur de fusionZ M parmi les M modalités est construit comme suit :

Équation 32(14)

Ici : Équation 33 est le facteur de rang inférieur de la m-ième modalité, Équation 60 est le produit extérieur, et r est le rang de décomposition.

Le vecteur de fusion h est alors calculé comme suit :

Équation 34(15)

Lorsque deux modalités sont utilisées seules, la fusion réduite est la suivante :

Équation 35(16)

Cela produit un vecteur de représentation multimodale conjoint h qui modélise les interactions intermodales au niveau latent des inter-modals.

Après l’acquisition du vecteur fusionné h de bas rang, le module Transformer modélise les dépendances et aligne les représentations sémantiques entre les modalités. Une attention intermodale est spécialement conçue pour permettre à une modalité de prêter attention à une autre :

Équation 36(17)

Où Qm est la requête modalité m, Kn,V n sont les vecteurs clés et valeurs dans la modalité n, dk est la dimension des vecteurs clés. Cette configuration facilite les flux d’attention spécifiques à chaque modalité, permettant de traiter chaque catégorie d’entrée par rapport aux autres (par exemple, synchroniser le mouvement du joueur avec le contexte du jeu et les indicateurs vidéo).

Les vecteurs à présence croisée sont empilés et classés via un perceptron multicouche (MLP). La sortie est une étiquette de décision tactique (par exemple, passe, drive, tenez), une perte d’entropie croisée optimisée pour l’entraînement de bout en bout.

Figure 5
Figure 5. Architecture de fusion multimodale basée sur des transformateurs. Montre comment les modalités visuelles et sensorielles sont intégrées via un encodeur transformateur pour améliorer la représentation des caractéristiques. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Le bloc de fusion multimodal, comme illustré à la Figure 5, combine des entrées visuelles et positionnelles. C’est une conception nécessaire puisque les décisions tactiques nécessitent une conscience spatiale et une dynamique de mouvement, qui ne peuvent être représentées par une seule modalité.

La figure 5 montre la structure de fonctionnement de la fusion multimodale basée sur des transformateurs. Ce design combine diverses données, vidéos, coordonnées spatiales et données contextuelles de jeu dans un seul canal pour prédire des actions tactiques telles que dépasser, conduire ou maintenir. L’approche commence par la saisie de vidéos, qui sont vérifiées à l’aide d’un réseau neuronal convolutionnel 3D (CNN 3D). Ce système identifie à la fois les structures spatiales et temporelles dans la vidéo, lui permettant de capturer l’activité dynamique et la communication des joueurs au fil du temps. Parallèlement, les informations contextuelles et positionnelles sont transmises par des couches d’immersion, transformant les entrées structurées en représentations vectorielles denses. Les flux contextuels, positionnels et vidéo peuvent alors voir leurs sorties fusionnées par un module de fusion de rang inférieur. Cette approche obtient efficacement des corrélations intermodales grâce à la décomposition de l’espace de fusion, minimisant la complexité computationnelle tout en préservant les relations essentielles entre les modalités. Enfin, la représentation multimodale fusionnée est traitée par un encodeur transformateur avec une attention intermodale. Cette procédure permet au modèle de se concentrer sur les bonnes caractéristiques à travers les modalités et les étapes de temps, améliorant ainsi sa compréhension du comportement stratégique dans les jeux. Enfin, la sortie encodée est passée par une concaténation et un bloc Multi-Layer Perceptron (MLP) qui associe la représentation apprise à certaines décisions tactiques. La sortie du modèle classe les actions des joueurs telles que « passe », « drive » ou « hold » afin de permettre un examen intelligent et basé sur les données des tactiques d’équipe.

Dans le système d’analyse tactique Transformer-Based Multimodal Fusion pour les sports d’équipe, la dernière phase est la classification et l’évaluation tactiques des décisions, qui convertit les représentations multimodales apprises en étiquettes actionnables par décision. Après avoir fusionné des caractéristiques vidéo, positionnelles et contextuelles par fusion de bas rang et les avoir affinées grâce à une attention intermodale dans l’encodeur Transformer, les vecteurs de caractéristiques résultants sont introduits dans un classificateur Multi-Layer Perceptron (MLP). Chaque classe de décision est représentée par une fonction d’activation softmax, donnant des scores de probabilité pour toutes les actions possibles. La classe la plus probable est choisie comme décision prédite par le modèle. Le modèle est entraîné sur une fonction de perte croisée, qui récompense les prédictions correctes et permet au réseau d’apprendre à différencier des différences similaires dans des situations tactiques. De plus, une évaluation dans le domaine temporel pourrait être envisagée afin de confirmer la réactivité dans des situations de jeu en temps réel ou quasi-temps réel, garantissant que le classificateur est exact et ne gaspille pas de temps sous des contraintes de temps similaires à celles des jeux. Le tableau 2 présente l’architecture du modèle et les hyperparamètres.

ComposantSpécification
Couches encodeurs de transformateurs6
Attention Heads8
Dimension cachée512
Taille de la couche à avance2048
Dimensions d’intégrationVidéo : 1024 → 512, Audio : 256 → 512, Position : 128 → 512
Codage positionnelApprentissage
Méthode de fusionFusion multimodale de bas rang (rang r = 16)
OptimiseurAdam
Taux d’apprentissage0.0001
Taille du lot16
Époques d’entraînement50–100
Abandon0.1
Fonction de perteEntropie croisée

Tableau 2 : Architecture du modèle et hyperparamètres. Liste les paramètres d’entraînement et les composants clés du modèle de fusion multimodale proposé à base de transformateurs.

Pour plus de clarté et de reproductibilité, le transformateur multimodal a été implémenté avec une pile d’encodeurs à 6 couches, chacune équipée de 8 têtes d’attention et d’une dimension cachée de 512, suivant les réglages habituels des transformateurs pour les tâches multimodales de taille moyenne. Chaque modalité passe par un bloc d’intégration : vidéo par une sortie encodeur 3D-CNN, 1024-dim ; audio par un encodeur basé sur Wave2Vec, 256-dim ; et des caractéristiques positionnelles plus contextuelles par un encodeur MLP à 2 couches, 128-dim. Tous ces plongements étaient projetés dans un espace latent partagé 512-d via des transformations linéaires apprenables. Pour établir l’alignement temporel, toutes les modalités sont d’abord interpolées sur une seule fréquence de 25 Hz, suivies de l’application d’encodages positionnels appris pour préserver l’ordre temporel. L’alignement inter-modal est réalisé à l’aide des couches d’attention croisée, qui apprennent explicitement les corrélations entre les modalités avant d’être introduites dans la pile d’encodeurs d’auto-attention. Ces choix architecturaux ont été faits pour équilibrer la capacité du modèle et l’efficacité de calcul, assurant ainsi une convergence stable sur un ensemble de données de taille modérée.

En termes pratiques, le cadre proposé de fusion multimodale basée sur les transformateurs convient le mieux aux scénarios où des données multimodales synchronisées sont disponibles, telles que des séances d’entraînement structurées, des simulations de matchs contrôlées ou des environnements professionnels équipés de flux vidéo cohérents et de systèmes de suivi positionnel. Les quatre entrées principales nécessaires à la méthode sont (i) la vidéo haute résolution, (ii) les données de suivi positionnel (GPS/LPS), (iii) les flux audio, et (iv) les métadonnées contextuelles — par exemple, possession, zones de pression, phase de correspondance. Pour obtenir des performances fiables, ces modalités doivent être alignées dans le temps avec un minimum de dérive (vidéo ≥ 25 fps et capteurs de position ≥ 10 Hz), et doivent maintenir des points de vue stables et un bruit de signal minimal. Les réglages qui ne fournissent pas ces entrées synchronisées, par exemple les matchs amateurs avec des angles de caméra irréguliers, les flux de diffusion en direct avec des artefacts de latence/compression, ou un environnement dépourvu d’infrastructure de suivi positionnel, seront moins pertinents pour le cadre. De plus, le système actuel fonctionne mieux dans des conditions semi-contrôlées mais peut être nettement moins robuste dans des situations de matchs en direct totalement incontrôlées, où les conditions d’éclairage, l’occlusion et le bruit dynamique de la foule affectent la qualité de l’acquisition des données. Ces contraintes définissent les limites pratiques dans lesquelles ce système peut être déployé et soulignent qu’une capture cohérente des données dans plusieurs modes est essentielle pour appliquer le modèle proposé.

Modifications et dépannage

En implémentation pratique, plusieurs problèmes peuvent survenir tout au long du pipeline multimodal qui peuvent réduire la stabilité du modèle ou la performance globale. Un problème courant est le désalignement temporel entre les modalités, où la vidéo enregistrée à 25 fps et les données positionnelles capturées à 10 Hz se désynchronisent, entraînant des indices déséquilibrés qui déstabilisent les cartes d’attention et réduisent la rappel. Cela peut être résolu en appliquant un rééchantillonnage basé sur des périodes, une interpolation linéaire et en supprimant automatiquement les séquences avec une dérive excessive. Les canaux audio peuvent également souffrir du bruit causé par le vent, les bruits de foule ou le clipping du microphone, ce qui fait que le transformateur ignore les jetons audio et baisse légèrement la précision. L’application d’un filtrage passe-bande, du gating spectrale et la substitution de segments gravement corrompus par des vecteurs zéro aide à maintenir la stabilité de l’intégration audio. Des problèmes de qualité visuelle, tels que les occlusions du lecteur ou le flou de mouvement, peuvent affaiblir les représentations spatiotemporelles de la 3D-CNN et augmenter la confusion entre les lecteurs de passage. Cela est atténué en excluant les séquences fortement occultées et en employant des stratégies d’augmentation, notamment le recadrage aléatoire, la normalisation de la luminosité et la simulation du flou de mouvement. L’instabilité du transformateur peut survenir si les échelles d’immersion diffèrent selon les modalités, produisant des pertes de validation oscillantes ou des pics de gradient. Assurer une normalisation cohérente du score z, utiliser un rythme d’apprentissage par échauffement, appliquer le gradient cut et augmenter l’abandon peut restaurer un entraînement stable. La fusion de bas rang peut également devenir problématique lorsque le rang de fusion est mal fixé, provoquant des relations intermodales déformées et un déséquilibre de classe. Maintenir un rang modéré pour les petits ensembles de données, augmenter le rang pour les plus grands ensembles de données et appliquer la régularisation L2 aide à préserver la fusion équilibrée. Des goulots d’étranglement computationnels peuvent survenir en raison de tenseurs vidéo volumineux qui provoquent un débordement de mémoire GPU ou un entraînement lent. Ces problèmes peuvent être traités par un entraînement en précision mixte (FP16), la réduction de la résolution d’entrée lors des premières expérimentations, ou la mise en cache de fonctionnalités 3D-CNN pré-calculées. Enfin, le déséquilibre naturel des classes dans les décisions tactiques, notamment pour le « Drive », peut réduire le rappel et provoquer des fluctuations dans l’AUC ; L’application de la perte équilibrée par classe, le suréchantillonnage des actions des minorités et l’enrichissement des métadonnées contextuelles peuvent considérablement améliorer l’équilibre et la discrimination décisionnelle. Ces directives consolidées de dépannage garantissent que les chercheurs et praticiens peuvent maintenir des conditions d’entraînement stables, améliorer la reproductibilité et adapter efficacement le cadre à travers divers ensembles de données et environnements.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce design combine diverses données, vidéos, coordonnées spatiales et données contextuelles du jeu en un seul canal pour prédire des actions tactiques telles que dépasser, conduire ou maintenir. L’approche commence par la saisie de vidéos, qui sont vérifiées à l’aide d’un réseau neuronal convolutionnel tridimensionnel (CNN 3D). Les flux contextuels, positionnels et vidéo peuvent alors voir leurs sorties fusionnées par un module de fusion de rang inférieur. Cette approche obtient efficacement des corrélations intermodales ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cadre de fusion multimodale basé sur les transformateurs présenté ici représente un développement important par rapport au test de base Stroop Task Football Test (STFT) décrit dans l’article de base. Contrairement à l’article de base, qui se concentrait sur des tests contrôlés orientés laboratoire avec des stimuli limités et statiques comme des flèches colorées et des tâches prédéfinies (conduite ou dépassement), le nouveau modèle repose sur des données multimodales réelles pour facil...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs reconnaissent chaleureusement le soutien de l’École d’éducation physique de l’Université du golfe de Beibu et de l’École de statistiques de la Southwestern University of Finance and Economics, pour avoir fourni des ressources et un soutien institutionnel au cours de cette recherche. Ce travail a également été soutenu par le projet 2023 du National Social Science Fund : Recherche sur l’utilisation efficace des ressources culturelles sportives rouges dans la zone de la base révolutionnaire ancienne Zuo jiang–You jiang (Grant n° 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D CNNImplémentation personnaliséeExtraction de caractéristiques spatiotemporelles à partir de la vidéo
GoPro Hero4GoPro Inc.https://gopro.com/Enregistrement vidéo des matchs
Capteurs GPS/IMUCatapult Sports / Xsenshttps://www.catapultsports.com/Suivi de la position des joueurs
Intel Core i7-11700K CPUIntelhttps://www.intel.comCPU de station de travail d’entraînement de modèles
Librosalibrosa.orghttps://pypi.org/project/librosa/Traitement du signal audio et rééchantillonnage
Classificateur MLPPyTorch / TensorFlowClassification tactique des décisions
NumPyFondation Python Softwarehttps://pypi.org/project/numpy/Calcul numérique et opérations matricielles
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comFormation et inférence en apprentissage profond
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Extraction d’images à partir de la vidéo
PandasFondation Python Softwarehttps://pypi.org/project/pandas/Manipulation des données et gestion tabulaire
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Réduction de dimensionnalité
Python 3.9Fondation Python Softwarehttps://www.python.org/downloads/release/python-390/Environnement de langage de programmation
PyTorchFondation PyTorchhttps://pytorch.org/Cadre d’apprentissage profond
scikit-learnDéveloppeurs SciKit-Learnhttps://pypi.org/project/scikit-learn/Validation croisée, calcul ICC
TensorFlow 2.8Googlehttps://www.tensorflow.org/Cadre d’apprentissage profond
Encodeur de transformateurPyTorch / TensorFlowIntégration de fonctionnalités multimodales avec attention
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Système d’exploitation pour l’entraînement des modèles
Poste de travailPersonnalisé / Intel, NVIDIACPU, GPU, RAM pour l’entraînement des modèles

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles