Cette étude a utilisé un cadre d'apprentissage profond en deux étapes pour la reconnaissance d'actions dans des vidéos sportives, intégrant un réseau neuronal convolutif multi-échelle (MSCNN) à un réseau à mémoire à long et court terme (LSTM). Des jeux de données de référence accessibles au public, à savoir UCF11, UCF Sports et JHMDB, ont été utilisés pour le développement et l'évaluation du modèle. Aucune nouvelle donnée n'a été collectée auprès de participants humains, et aucune information personnellement identifiable n'a été consultée ou traitée. Étant donné que l'étude consistait en une analyse secondaire de jeux de données anonymisés et accessibles au public, et qu'elle ne comportait pas de participation humaine directe, une approbation éthique institutionnelle et un consentement éclairé n'étaient pas requis.
Le flux de travail comprenait un échantillonnage par trames et une normalisation temporelle, suivis d'une extraction de caractéristiques à l'aide du module MSCNN. Les caractéristiques extraites ont ensuite été traitées à l'aide d'un réseau LSTM pour la modélisation temporelle, puis transmises à une couche de classification multiclasse. Enfin, le modèle a été entraîné et évalué à l'aide des jeux de données de référence sélectionnés. Figure 1 illustre l'architecture générale du cadre proposé.

Figure 1 : Architecture proposée MSCNN-LSTM pour la reconnaissance d'actions dans les vidéos sportives. Flux global illustrant le prétraitement vidéo, l'extraction de caractéristiques spatiales multi-échelle, l'apprentissage de séquences temporelles et la classification des actions. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Figure 1 illustre le flux de travail du cadre proposé pour la reconnaissance d'actions dans les vidéos sportives, basé sur une architecture hybride MSCNN-LSTM. Le processus débute avec des extraits vidéo sportifs contenant diverses actions athlétiques, telles que donner un coup de pied, faire de l'équitation ou effectuer un swing de golf. Les vidéos brutes ont été décomposées en images individuelles lors de l'étape de prétraitement, au cours de laquelle les images sont rognées, normalisées et préparées pour l'entrée du modèle. Les images prétraitées ont ensuite été transmises au module MSCNN pour l'extraction de caractéristiques. L'architecture convolutionnelle multi-échelle capture des caractéristiques spatiales à différents champs réceptifs, permettant ainsi d'extraire à la fois des informations locales et contextuelles à partir des images de la vidéo sportive. Les vecteurs de caractéristiques extraits ont ensuite été traités par le réseau LSTM afin de modéliser les dépendances temporelles et l'évolution du mouvement entre les images consécutives. Enfin, le module de classification et d'apprentissage a utilisé les représentations spatiotemporelles apprises pour prédire la catégorie d'action de chaque extrait vidéo. Le cadre proposé comprend quatre étapes séquentielles, commençant par la collecte de données et le prétraitement à l'aide des jeux de données de référence UCF11 (YouTube Actions), UCF Sports et JHMDB. Chaque vidéo sportive a été convertie en une séquence d'images, qui ont été redimensionnées, normalisées et augmentées par rotation, retournement et rognage afin d'améliorer la robustesse face aux variations environnementales. Les images prétraitées ont ensuite été traitées par le Réseau neuronal convolutionnel multi-échelle (MSCNN) proposé, dans lequel des branches convolutionnelles parallèles dotées de noyaux 3 × 3, 5 × 5 et 7 × 7 extraient des caractéristiques spatiales locales et contextuelles complémentaires. Ces caractéristiques multi-échelles ont été concaténées puis affinées à l'aide d'une normalisation par lot et d'un regroupement maximal afin de générer des représentations de caractéristiques compactes. Les caractéristiques au niveau des images ainsi obtenues ont ensuite été transmises à un réseau à mémoire à long et court terme (LSTM) pour modéliser les dépendances temporelles entre les images consécutives. Les sorties finales du LSTM ont été aplaties puis transmises à des couches entièrement connectées avec une activation ReLU, suivies d'un classifieur Softmax pour prédire la catégorie d'action. Le réseau a été entraîné à l'aide de l'optimiseur Adam, d'une fonction de perte d'entropie croisée et d'une régularisation par abandon (dropout) afin de réduire le surajustement. Les performances du modèle ont finalement été évaluées sur les jeux de données de référence UCF11, UCF Sports et JHMDB à l'aide de l'exactitude, de la précision, du rappel et du score F1.
1. Collecte des données et prétraitement
Trois ensembles de données de référence accessibles au public pour les sports et les actions humaines ont été utilisés dans cette étude. Ces ensembles de données contiennent des séquences vidéo réelles de sports, avec des mouvements de caméra, des points de vue et des complexités de fond variables. Plus précisément, l'étude a utilisé UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), qui contient 11 catégories d'actions extraites de 1 168 vidéos YouTube enregistrées auprès d'environ 25 individus, avec plusieurs échantillons par action. La base de données de mouvements humains annotés conjointement (JHMDB)34,35 contient 21 classes d'actions et 928 vidéos annotées. L'ensemble de données UCF Sports comprend 10 classes d'actions et 150 séquences vidéo capturées à partir de sources de diffusion avec une résolution de 720 × 480 pixels (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
Dans leur ensemble, ces ensembles de données couvrent à la fois les sports individuels et collectifs et offrent une variabilité en durée temporelle et en échelle visuelle permettant d'évaluer le cadre de reconnaissance d'actions MSCNN-LSTM proposé. Dans le cadre du processus de contrôle de qualité des données, les ensembles de données UCF11, UCF Sports et JHMDB ont été examinés afin d'identifier les vidéos corrompues, les fichiers en double et les séquences comportant des annotations incomplètes. Aucun échantillon répondant à ces critères d'exclusion n'a été identifié ; par conséquent, toutes les vidéos disponibles ont été conservées pour l'analyse ultérieure. Les ensembles de données ont ensuite été divisés en sous-ensembles d'apprentissage (70 %), de validation (15 %) et de test (15 %) à l'aide d'une stratégie de division aléatoire cohérente. Figure 2 présente des images représentatives utilisées pour l'apprentissage et l'évaluation.

Figure 2 : Images représentatives provenant des jeux de données de référence pour la reconnaissance d'actions sportives. Les panneaux (A–D) montrent des exemples du jeu de données UCF11 (YouTube Actions), les panneaux (E–H) du jeu de données UCF Sports, et les panneaux (I–L) du jeu de données JHMDB. Ces images illustrent les variations des classes d'actions, des points de vue, des arrière-plans, des conditions d'éclairage et de la complexité des mouvements. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Le modèle de reconnaissance d'actions proposé a été évalué sur les jeux de données de référence UCF11, UCF Sports et JHMDB, comme résumé dans le Tableau 3. Ces jeux de données représentent des motifs de mouvement variés et des conditions environnementales difficiles. Le jeu de données UCF11 (Actions YouTube) contient des actions sportives réparties en 11 classes, acquises dans des conditions variables d'éclairement, de point de vue et de fond. Le jeu de données UCF Sports comprend 150 vidéos de sports de terrain provenant de diffusions professionnelles, présentant des séquences de mouvement réalistes. Le jeu de données JHMDB fournit des annotations détaillées de mouvement humain pour 21 catégories d'actions fines et sert de jeu de référence pour la reconnaissance d'actions spatiotemporelles. Ensemble, ces jeux de données ont été utilisés pour évaluer les performances du modèle dans des scénarios d'actions sportives et humaines. Le réseau a été entraîné à l'aide de l'optimiseur Adam pendant 100 époques, avec une taille de lot de 32, un taux d'apprentissage initial de 0,001 et une fonction de perte d'entropie croisée. Le modèle présentant la perte de validation la plus faible a été sélectionné pour l'évaluation finale. Toutes les expériences ont utilisé une graine aléatoire fixe de 42. L'arrêt prématuré et la réduction du taux d'apprentissage en plateau ont été appliqués pour améliorer la convergence, et un élagage des gradients avec un seuil de 5,0 a été utilisé lors de l'entraînement du LSTM afin d'éviter l'explosion des gradients. Le modèle MSCNN-LSTM proposé comportait environ 15 millions de paramètres entraînables. La configuration matérielle et logicielle utilisée pour l'implémentation est résumée dans le Tableau 4. Étant donné que les distributions des classes étaient suffisamment équilibrées, aucune procédure supplémentaire de pondération des classes ou de rééchantillonnage n'a été appliquée. Les modèles comparateurs ont été implémentés en utilisant les hyperparamètres rapportés dans leurs études d'origine, les paramètres d'entraînement ayant été harmonisés lorsque cela était faisable. Les valeurs de performance ont été rapportées comme la moyenne ± l'écart type obtenus à partir de cinq exécutions indépendantes avec différentes initialisations aléatoires. Les différences entre le modèle proposé et les modèles comparateurs ont été évaluées à l'aide de tests t appariés avec un seuil de significativité de p < 0,05.
| Jeu de données | Nombre de classes | Nombre de vidéos | Résolution (px) | Source | Description |
| UCF11 (YouTube Actions) | 11 | 1168 | Variable (≈ 320×240) | University of Central Florida | Comprend 11 actions humaines provenant de sports (par exemple, tir au basket, plongeon, swing de golf, jonglage au football). Les vidéos sont extraites de YouTube et présentent une grande variabilité d'éclairage, de point de vue et de fond. |
| UCF Sports | 10 | 150 | 720×480 | UCF Sports Action Dataset | Contient des activités sportives telles que le plongeon, l'équitation, le swing de golf, la course et la musculation, enregistrées à partir de véritables séquences télévisées (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | Max Planck Institute for Intelligent Systems | Comprend des activités quotidiennes et sportives telles que la réception, le saut, le brossage des cheveux, le tir et la course, avec des annotations articulaires destinées à l'analyse du mouvement et de la posture. |
Tableau 3 : Caractéristiques des jeux de données de référence utilisés pour l'apprentissage et l'évaluation. Aperçu des jeux de données UCF11, UCF Sports et JHMDB, incluant le nombre de classes d'actions, d'échantillons vidéo, les caractéristiques des jeux de données, ainsi que leurs rôles dans l'apprentissage, la validation et les tests du modèle.
| Paramètres utilisés | Description |
| Langage de programmation | Python 3.8.18 [4] |
| Framework d'apprentissage profond | TensorFlow 2.15.0 [1] |
| Accélérateur GPU | NVIDIA GeForce RTX 3090 (24 Go de mémoire vidéo) [1] |
| Processeur (CPU) | Intel Core i9 @ 3,5 GHz × 16 cœurs |
| Système d'exploitation | Windows 11 |
| Mémoire (RAM) | 64 Go DDR4 |
| Optimiseur | Adam (taux d'apprentissage = 0,001) |
| Taille du lot | 32 |
| Nombre d'époques | 100 |
| Fonctions d'activation | ReLU (couches CNN), Softmax (couche de sortie) |
| Taux de dropout | 0,5 |
Tableau 4 : Environnement de simulation et configuration des hyperparamètres du modèle MSCNN-LSTM proposé. Spécifications matérielles, environnement logiciel, paramètres de l'optimiseur, taux d'apprentissage, taille du lot, nombre d'époques, dimensions des entrées et autres hyperparamètres utilisés lors de l'entraînement et de l'évaluation du modèle.
2. Prétraitement
Avant l'entraînement, chaque vidéo brute était convertie en une séquence de trames ordonnée dans le temps, puis normalisée, échantillonnée temporellement et augmentée. Chaque vidéo d'entrée V était d'abord convertie en une séquence de trames et représentée sous forme d'un tenseur 4D V ∈ RT×H×W×C, où T correspond au nombre de trames, H × W i désigne l'indice de la trame, et C indique le nombre de canaux de couleur (3 pour RGB). Le pipeline de prétraitement comprenait l'extraction des trames, le redimensionnement spatial suivi d'un rognage central ou aléatoire à une résolution fixe (H′, W′), la normalisation de l'intensité par pixel, et une augmentation facultative des données incluant un retournement aléatoire, un changement d'échelle et des variations de couleur, avant l'extraction des caractéristiques. Plus précisément, la normalisation de l'intensité était mise en œuvre soit par une normalisation en score standard comme dans l'Éq. (1).
(1)
où μ, σ sont les moyennes et les écarts types des canaux calculés sur l'ensemble d'apprentissage, ou selon une normalisation min-max comme dans l'équation (2).
(2)
Après la normalisation, chaque image était représentée par F̃t ∈ RH′×W′×C′ et le tenseur vidéo résultant était représenté par V′ ∈ RT×H′×W′×C. Dans un prétraitement convolutif multi-échelle, plusieurs cartes de caractéristiques spatiales à différents champs récepteurs sont obtenues en appliquant plusieurs convolutions 2D (ou 3D pour les premières convolutions spatiotemporelles) avec des tailles de noyau différentes ; une représentation des caractéristiques temporelles est ensuite générée pour chaque image ou court extrait vidéo, puis transmise au module LSTM. L'article original applique d'abord MobileNetV2, puis Deep BiLSTM pour la modélisation temporelle ; le même pipeline de prétraitement décrit ci-dessus est entièrement compatible avec un remplacement par une convolution multi-échelle + LSTM.
3. Échantillonnage et normalisation temporelle
Étant donné que la durée des vidéos T varie entre les jeux de données et au sein de chaque jeu de données, nous échantillonnons uniformément ou remplaçons temporellement les images afin de fournir à la convolution multi-échelle + LSTM une longueur d'entrée fixe N, exprimée en nombre d'images ou de courts extraits. Les indices d'images uniformes peuvent être calculés selon l'équation (3),
(3)
ainsi, la séquence d'images échantillonnée est Vs = {F̃t0, …, F̃tN−1}. Lorsqu'une fidélité temporelle plus fine est requise, nous effectuons une interpolation temporelle linéaire : pour tout temps fractionnaire rééchantillonné τ ∈ [0, T−1] calculé comme dans l'équation (4).
(4)
de sorte que la séquence rééchantillonnée Vs comporte exactement N images et préserve un mouvement fluide. Alternativement, un échantillonnage par courtes séquences contiguës (fenêtre temporelle de longueur w et pas s) produit un ensemble de tenseurs de séquences, chaque séquence Cj ∈ RT×H′×W′×C avec j = 0, …, ⌊(T − w)/s⌋. Pour la normalisation temporelle au sein du réseau, un regroupement temporel simple à plusieurs échelles s'avère efficace : étant donnée une séquence d'activations temporelles X = {x1, …, xN} produite par des convolutions multi-échelles, appliquer les caractéristiques regroupées comme indiqué dans l'équation (5).
(5)
où Sk est le support temporel pour l'échelle k (par exemple, Sk peut être des blocs non superposés ou des indices dilatés) et mk = |Sk|.
Avant l'extraction des caractéristiques, toutes les vidéos ont été redimensionnées à 224 × 224 pixels et échantillonnées à 25 images par seconde. Chaque expérience a utilisé une longueur de séquence constante de 32 images. Parmi les techniques d'augmentation des données figuraient le recadrage aléatoire (échelle = 0,8–1,0), la rotation aléatoire (±15°), le retournement horizontal aléatoire (probabilité = 0,5) et la modification de la luminosité (±20 %). Les valeurs moyennes d'ImageNet [0,485, 0,456, 0,406] et les écarts types [0,229, 0,224, 0,225] ont été utilisées pour normaliser les valeurs des pixels. Pour chaque séquence vidéo, une sélection uniforme des images a été utilisée pour l'échantillonnage temporel. Les vidéos plus longues ont été recoupées ou échantillonnées uniformément afin de préserver une longueur de séquence constante, tandis que les vidéos comportant moins de 32 images ont été complétées par des zéros. Ces paramètres ont été systématiquement utilisés durant l'apprentissage et l'évaluation.
4. Extraction de caractéristiques à l'aide de MSCNN
Un réseau neuronal convolutif multi-échelle (MSCNN) a été utilisé pour améliorer la représentation spatiale des actions dans les vidéos sportives. Les réseaux neuronaux convolutifs classiques, qui reposent sur une taille unique de noyau, peuvent avoir une capacité limitée à capturer des caractéristiques à plusieurs échelles spatiales. Étant donné que certaines actions sportives présentent des caractéristiques visuelles similaires, il peut être difficile pour une architecture convolutive mono-échelle de capturer simultanément des caractéristiques locales et globales. Pour pallier cette limitation, le cadre proposé utilise des noyaux convolutifs de différentes tailles afin d'effectuer une extraction multi-échelle des caractéristiques et une fusion des caractéristiques.
Dans l'architecture de réseau proposée, des noyaux de convolution 1 × 1 ont été utilisés pour organiser l'information entre les canaux et réduire la dimensionnalité des cartes de caractéristiques d'entrée. En outre, ces couches augmentent la capacité expressive du réseau en introduisant des transformations de caractéristiques supplémentaires et des représentations non linéaires. Des noyaux de convolution de tailles différentes permettent l'extraction d'informations spatiales à plusieurs échelles. Une normalisation séquentielle est effectuée après la fusion pondérée de caractéristiques multi-échelles afin d'améliorer la stabilité de l'apprentissage. Afin d'atténuer les problèmes de disparition et d'explosion du gradient lors de l'entraînement de réseaux profonds, l'architecture proposée utilise des connexions résiduelles et une modélisation temporelle basée sur les LSTM.
La conception multi-échelle améliore la capacité du réseau à capturer des caractéristiques à différentes résolutions spatiales et renforce la capacité de représentation des caractéristiques. De plus, le noyau de convolution conventionnel N × N est décomposé en opérations de convolution N × 1 et 1 × N. Les convolutions N × 1 et 1 × N utilisées dans le module MSCNN sont conçues pour capturer des caractéristiques spatiales directionnelles et multi-échelles complémentaires à partir de trames vidéo individuelles. Ces opérations de convolution améliorent la représentation des caractéristiques spatiales en extrayant des motifs à différentes échelles de champ récepteur. Les relations temporelles entre les trames consécutives sont ensuite modélisées par le module LSTM, qui traite la séquence de caractéristiques extraites par le MSCNN afin d'apprendre les dépendances temporelles à long terme pour la reconnaissance d'actions.
Chaque vidéo sportive V = {F1, F2, …, FT} est décomposée en T images. Pour encoder les variations spatiales, par exemple la posture des joueurs, le flou de mouvement ou la trajectoire du ballon, des branches convolutionnelles à trois échelles différentes interviennent selon s ∈ {1, 2, 3}, correspondant à des tailles de noyau de 3 × 3, 5 × 5 et 7 × 7. Chaque branche extrait des cartes de caractéristiques comme indiqué dans l'équation (6) :
(6)
où Ws et bs sont les poids et les biais de la convolution à l'échelle s, et σ est l'activation ReLU. La couche de fusion multi-échelle agrège les caractéristiques comme indiqué dans l'équation (7) :
(7)
Ce tenseur de caractéristiques fusionné intègre à la fois des indices de mouvement fins et des informations contextuelles à grande échelle, telles que les activités de groupe. Figure 3 illustre uniquement le module d'extraction de caractéristiques MSCNN. La couche LSTM (256 unités cachées), la couche dense (128 neurones) et la couche dropout (0,5) utilisées pour la modélisation temporelle et la classification sont présentées séparément dans la Figure 4.

Figure 3 : Module proposé d'extraction de caractéristiques par réseau neuronal convolutionnel multi-échelle (MSCNN). Trois branches convolutionnelles parallèles aux tailles de noyau de 3 × 3, 5 × 5 et 7 × 7 extraient des caractéristiques spatiales complémentaires à différentes échelles, qui sont fusionnées avant la modélisation temporelle par le réseau LSTM. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Architecture LSTM proposée pour la reconnaissance d'actions dans les vidéos sportives. Le module LSTM modélise les dépendances temporelles à l’aide des opérations de portes d’entrée, d’oubli et de sortie sur des trames vidéo consécutives. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Figure 3 illustre le module proposé d'extraction de caractéristiques par réseau neuronal convolutif multi-échelle (MSCNN) pour la reconnaissance d'actions dans les vidéos sportives. Les images vidéo d'entrée ont été traitées en parallèle par trois branches convolutives aux tailles de noyau 3 × 3, 5 × 5 et 7 × 7, chacune contenant 64 filtres afin de capturer des caractéristiques spatiales fines et grossières complémentaires. Les sorties ont été affinées à l'aide d'une normalisation par lot (Batch Normalization), d'une activation ReLU et d'un regroupement maximal (max pooling) 2 × 2, puis concaténées et fusionnées par une convolution 1 × 1 comportant 128 filtres. Une connexion de saut résiduelle a préservé les informations spatiales de bas niveau et amélioré le flux des gradients. Les cartes de caractéristiques fusionnées ont été aplaties puis transmises à une couche LSTM comportant 256 unités cachées pour la modélisation temporelle, suivie d'une couche entièrement connectée à 128 neurones, d'une activation ReLU et d'un taux de désactivation (dropout) de 0,5 avant la classification finale à l'aide d'une couche Softmax. Les cartes de caractéristiques multi-échelle (f1l, f2l et f3l) ont été concaténées pour former la représentation fusionnée (Fl), qui a ensuite été affinée par une convolution 3 × 3 afin de générer la carte de caractéristiques de sortie pour la couche suivante. Cette architecture hiérarchique permet d'apprendre des caractéristiques spatiales complémentaires à plusieurs champs réceptifs, améliorant ainsi les performances de reconnaissance des actions sportives.
5. Modélisation temporelle à l'aide de LSTM
Afin de modéliser l'évolution temporelle le long des séquences vidéo, la séquence de caractéristiques agrégée a été fournie au système LSTM afin de capturer les dépendances dynamiques et la continuité du mouvement. Pour chaque vidéo d'entrée, nous avons d'abord extrait des caractéristiques CNN multi-échelles par image. Soient les images de la vidéo notées I1, …, IT. Pour chaque image t et chaque échelle s, l'encodeur convolutionnel multi-échelle produit un vecteur de caractéristiques ft(s) ∈ Rd. Ensuite, les échelles sont fusionnées en un descripteur d'image unique par projection + concaténation ou par somme pondérée, comme indiqué dans l'équation (8) :
(8)
Ensuite, introduire la séquence {xt}tT=1 dans un LSTM afin de modéliser la dynamique temporelle. Dans la notation standard du LSTM, à l'instant t, les portes et états sont donnés par les équations (9) à (13) :
(9)
(10)
(11)
(12)
(13)
Ici, σ est l'activation sigmoïde, ⊙ est la multiplication élément par élément. Bien que des architectures LSTM bidirectionnelles puissent être utilisées pour capturer le contexte temporel passé et futur, le cadre proposé emploie un LSTM standard pour modéliser les dépendances temporelles entre les images vidéo séquentielles. Ce choix de conception est conforme à l'architecture MSCNN-LSTM présentée dans cette étude. Après traitement du segment, une représentation du segment a été obtenue (par exemple, dernier état caché ou regroupement temporel) : z = Poolt(vt).
Figure 4 illustre le flux de travail de l'architecture LSTM proposée pour la reconnaissance d'actions sportives. Le réseau recevait une séquence d'images vidéo ou de caractéristiques extraites par un CNN et les traitait à travers des pas de temps successifs (t−2, t−1 et t). Chaque cellule LSTM comprenait une porte d'entrée, une porte d'oubli et une porte de sortie, qui régulaient le flux d'information à travers le réseau. La porte d'entrée intégrait de nouvelles informations dans l'état de la cellule, la porte d'oubli éliminait les informations temporelles non pertinentes, et la porte de sortie produisait l'état caché transmis au pas de temps suivant. L'état de la cellule préservait les dépendances temporelles à long terme, tandis que l'état caché capturait les informations temporelles à court terme. Après un traitement séquentiel, les sorties LSTM étaient agrégées pour générer une représentation temporelle des caractéristiques, qui était ensuite transmise à une couche entièrement connectée et à un classificateur Softmax afin de prédire l'action sportive correspondante. Le réseau était entraîné à l'aide de l'optimiseur Adam pendant 100 époques avec une taille de lot de 32, un taux d'apprentissage initial de 0,001 et une fonction de perte d'entropie croisée. Le modèle présentant la perte de validation la plus faible était sélectionné pour l'évaluation finale. Afin d'assurer la reproductibilité, toutes les expériences ont été réalisées en utilisant une graine aléatoire fixe de 42. L'arrêt précoce et la réduction du taux d'apprentissage en plateau ont été utilisés pour améliorer la convergence, et une limitation des gradients avec un seuil de 5,0 a été appliquée durant l'entraînement du LSTM afin d'éviter l'explosion des gradients. Le modèle MSCNN-LSTM proposé comportait environ 15 millions de paramètres entraînables.
Les scores de classe finaux et les probabilités utilisent une couche linéaire suivie d'une fonction softmax, comme indiqué dans l'équation (14) :
(14)
Entraîner en minimisant la perte d'entropie croisée sur les extraits étiquetés, comme dans l'équation (15) :
(15)
où Nb est la taille du lot, C le nombre de classes, et y(n) la vérité terrain au format one-hot. Une régularisation (dropout sur les sorties de xt/LSTM, décroissance du poids) et une limitation du gradient sont appliquées pour améliorer la stabilité sur de longues séquences sportives.