Deze studie maakte gebruik van een tweestaps deep learning-framework voor actieherkenning in sportvideo's, waarin een Multi-Scale Convolutional Neural Network (MSCNN) is geïntegreerd met een Long Short-Term Memory (LSTM)-netwerk. Publiekelijk beschikbare benchmarkdatasets, namelijk UCF11, UCF Sports en JHMDB, werden gebruikt voor de ontwikkeling en evaluatie van het model. Er zijn geen nieuwe gegevens verzameld van menselijke participanten, en er is geen toegang gekregen tot of verwerkt persoonlijk identificeerbare informatie. Omdat de studie bestond uit de secundaire analyse van publiekelijk beschikbare, geanonimiseerde datasets en geen directe menselijke deelname inhield, waren institutionele ethische goedkeuring en geïnformeerde toestemming niet vereist.
De workflow bestond uit frame-sampling en temporele normalisatie, gevolgd door kenmerkextractie met behulp van de MSCNN-module. De geëxtraheerde kenmerken werden vervolgens verwerkt met een LSTM-netwerk voor temporele modellering en daarna doorgegeven aan een multi-klasse classificatielaag. Ten slotte werd het model getraind en geëvalueerd met behulp van de geselecteerde benchmark-datasets. Figuur 1 illustreert de algemene architectuur van het voorgestelde raamwerk.

Figuur 1: Voorgesteld MSCNN-LSTM-framework voor actieherkenning in sportvideo's. Algemene workflow die de videovoorbewerking, multi-schaal ruimtelijke kenmerkextractie, temporeel sequentieel leren en actieclassificatie illustreert. Klik hier om een grotere versie van deze figuur te bekijken.
Figuur 1 illustreert de workflow van het voorgestelde framework voor actieherkenning in sportvideo's, gebaseerd op een hybride MSCNN-LSTM-architectuur. Het proces begint met sportvideoclips die verschillende atletische acties bevatten, waaronder trappen, paardrijden en golfslagen. De ruwe video's werden tijdens de voorverwerkingsfase ontbonden in individuele frames, waarbij de frames werden bijgesneden, gestandaardiseerd en voorbereid voor modelinvoer. De voorbewerkte frames werden vervolgens ingevoerd in de MSCNN-module voor kenmerkextractie. De multi-scale convolutionele architectuur legt ruimtelijke kenmerken vast bij verschillende receptieve velden, waardoor zowel lokale als contextuele informatie uit de sportvideoframes kan worden geëxtraheerd. De geëxtraheerde kenmerkvectoren werden vervolgens verwerkt door het LSTM-netwerk om temporele afhankelijkheden en de evolutie van beweging over opeenvolgende frames te modelleren. Ten slotte gebruikte de classificatie- en trainingsmodule de geleerde spatiotemporele representaties om de actiecategorie voor elke videoclip te voorspellen. Het voorgestelde framework bestond uit vier opeenvolgende stappen, beginnend met gegevensverzameling en voorbewerking met behulp van de UCF11 (YouTube Actions), UCF Sports en JHMDB benchmark-datasets. Elke sportvideo werd omgezet in een reeks frames, die werden herschaald, genormaliseerd en uitgebreid via rotatie, spiegeling en bijsnijden om de robuustheid tegen omgevingsvariaties te verbeteren. De voorbewerkte frames werden vervolgens verwerkt door het voorgestelde Multi-Scale Convolutional Neural Network (MSCNN), waarbij parallelle convolutionele takken met 3 × 3, 5 × 5 en 7 × 7 kernels complementaire lokale en contextuele ruimtelijke kenmerken extraheerden. Deze multi-scale kenmerken werden geconcateneerd en verfijnd met behulp van batch-normalisatie en max-pooling om compacte kenmerkrepresentaties te genereren. De resulterende kenmerken op frameniveau werden vervolgens geleverd aan een Long Short-Term Memory (LSTM)-netwerk om temporele afhankelijkheden over opeenvolgende frames te modelleren. De uiteindelijke LSTM-outputs werden afgeplat en door volledig verbonden lagen met ReLU-activatie geleid, gevolgd door een Softmax-classifier om de actiecategorie te voorspellen. Het netwerk werd getraind met de Adam-optimizer met een cross-entropy verliesfunctie en dropout-regularisatie om overfitting te verminderen. De modelprestaties werden tenslotte geëvalueerd op de UCF11, UCF Sports en JHMDB benchmark-datasets met behulp van nauwkeurigheid, precisie, recall en F1-score.
1. Gegevensverzameling en voorbewerking
In deze studie werden drie publiek beschikbare benchmark-datasets voor sport en menselijke acties gebruikt. Deze datasets bevatten real-world sportbeelden met variërende camerabewegingen, standpunten en achtergrondcomplexiteit. Specifiek maakte de studie gebruik van UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), die 11 actiecategorieën bevat, verzameld uit 1.168 YouTube-video's van ongeveer 25 personen, met meerdere monsters per actie. De Joint-Annotated Human Motion Database (JHMDB)34,35 bevat 21 actieklassen en 928 geannoteerde video's. De UCF Sports-dataset bestaat uit 10 actieklassen en 150 videosequenties, vastgelegd vanuit broadcastbronnen met een resolutie van 720 × 480 pixels (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
Gezamenlijk beslaan deze datasets zowel individuele als teamsporten en bieden ze variatie in temporele duur en visuele schaal voor het evalueren van het voorgestelde MSCNN-LSTM-framework voor actieherkenning. Als onderdeel van het proces voor kwaliteitscontrole van de gegevens werden de datasets UCF11, UCF Sports en JHMDB gecontroleerd op beschadigde video's, dubbele bestanden en fragmenten met onvolledige annotaties. Er werden geen monsters geïdentificeerd die aan deze exclusiecriteria voldeden; daarom werden alle beschikbare video's behouden voor nadere analyse. De datasets werden vervolgens onderverdeeld in trainings- (70%), validatie- (15%) en testsets (15%) met behulp van een consistente strategie voor willekeurige splitsing. Figuur 2 toont representatieve afbeeldingen die zijn gebruikt voor training en evaluatie.

Figuur 2: Representatieve frames uit de benchmark-datasets voor sportactherkenning. Panelen (A–D) tonen voorbeelden uit de UCF11 (YouTube Actions) dataset, panelen (E–H) uit de UCF Sports dataset en panelen (I–L) uit de JHMDB dataset. De frames illustreren variaties in actieklassen, gezichtspunten, achtergronden, verlichtingscondities en bewegingscomplexiteit. Klik hier om een grotere versie van deze figuur te bekijken.
Het voorgestelde actieherkenningsmodel werd geëvalueerd op de benchmark-datasets UCF11, UCF Sports en JHMDB, zoals samengevat in Tabel 3. Deze datasets vertegenwoordigen diverse bewegingspatronen en uitdagende omgevingscondities. De UCF11 (YouTube Actions) dataset bevat sportacties uit 11 klassen, verkregen onder variërende belichting, standpunten en achtergrondcondities. De UCF Sports dataset bestaat uit 150 veldsportvideo's van professionele uitzendingen, met realistische bewegingssequenties. De JHMDB dataset biedt gedetailleerde annotaties van menselijke bewegingen voor 21 fijnmazige actiecategorieën en dient als benchmark-dataset voor spatiotemporele actieherkenning. Samen werden deze datasets gebruikt om de modelprestaties te evalueren in sport- en menselijke-actiescenario's. Het netwerk werd getraind met de Adam-optimizer gedurende 100 epochs met een batchgrootte van 32, een initiële leersnelheid van 0.001 en een cross-entropy verliesfunctie. Het model met het laagste validatieverlies werd geselecteerd voor de definitieve evaluatie. Alle experimenten maakten gebruik van een vast random seed van 42. Early stopping en reductie van de leersnelheid bij een plateau werden toegepast om de convergentie te verbeteren, en gradient clipping met een drempelwaarde van 5.0 werd gebruikt tijdens de LSTM-training om exploderende gradiënten te voorkomen. Het voorgestelde MSCNN-LSTM model bevatte ongeveer 15 miljoen trainbare parameters. De hardware- en softwareconfiguratie die voor de implementatie is gebruikt, is samengevat in Tabel 4. Omdat de klassendistributies voldoende gebalanceerd waren, werden er geen aanvullende procedure voor klassenweging of resampling toegepast. Vergelijkingsmodellen werden geïmplementeerd met de hyperparameters die in hun oorspronkelijke studies werden gerapporteerd, waarbij de trainingsinstellingen waar mogelijk werden geharmoniseerd. Prestatiewaarden werden gerapporteerd als het gemiddelde ± standaarddeviatie van vijf onafhankelijke runs met verschillende willekeurige initialisaties. Verschillen tussen het voorgestelde model en de vergelijkingsmodellen werden geëvalueerd met gepaarde t-toetsen bij een significantiedrempel van p < 0.05.
| Dataset | Aantal klassen | Aantal video's | Resolutie (px) | U heeft geen brontekst opgegeven om te vertalen. Voer alstublieft de Engelse tekst in die u naar het Nederlands vertaald wilt hebben. | Beschrijving |
| UCF11 (YouTube-acties) | 11 | 1168 | Variabel (≈ 320×240) | University of Central Florida | Bevat 11 menselijke handelingen uit sporten (bijv. basketballen, duiken, golfswing, voetbaljongleren). Video's zijn verzameld van YouTube met een grote variatie in verlichting, standpunt en achtergrond. |
| UCF-sporten | 10 | 150 | 720×480 | UCF Sports Action-dataset | Bevat sportactiviteiten zoals duiken, paardrijden, golfswings, hardlopen en gewichtheffen, opgenomen uit echte broadcast-tvbeelden (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | Max Planck Institute for Intelligent Systems | Bevat dagelijkse en sportactiviteiten zoals vangen, springen, haar borstelen, schieten en rennen, met bijbehorende annotaties voor bewegings- en pose-analyse. |
Tabel 3: Kenmerken van de benchmark-datasets gebruikt voor training en evaluatie. Overzicht van de UCF11-, UCF Sports- en JHMDB-datasets, inclusief het aantal actieklassen, videovoorbeelden, datasetkenmerken en hun rollen bij modeltraining, validatie en testen.
| Gebruikte parameters | Beschrijving |
| Programmeertaal | Python 3.8.18 [4] |
| Deep Learning-framework | TensorFlow 2.15.0 [1] |
| GPU-accelerator | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| CPU | Intel Core i9 @ 3,5 GHz × 16 kernen |
| Besturingssysteem | Windows 11 |
| Geheugen (RAM) | 64 GB DDR4 |
| Optimizer | Adam (leersnelheid = 0,001) |
| Batchgrootte | 32 |
| Aantal epochs | 100 |
| Activatiefuncties | ReLU (CNN-lagen), Softmax (outputlaag) |
| Uitvalpercentage | 0.5 |
Tabel 4: Simulatieomgeving en hyperparameterconfiguratie van het voorgestelde MSCNN-LSTM-model. Hardware-specificaties, softwareomgeving, optimizer-instellingen, leerfrequentie, batchgrootte, aantal epochs, inputdimensies en andere hyperparameters die zijn gebruikt tijdens de training en evaluatie van het model.
2. Voorbewerking
Voorafgaand aan de training werd elke ruwe video omgezet in een tijdgebonden reeks frames, waarna deze werd genormaliseerd, temporeel bemonsterd en uitgebreid. Elke inputvideo V werd eerst omgezet in een reeks frames en gerepresenteerd als een 4D-tensor V ∈ RT×H×W×C, waarbij T het aantal frames is, H × W i de frame-index aanduidt, en C het aantal kleurkanalen aangeeft (3 voor RGB). De preprocessing-pijplijn bestond uit frame-extractie, ruimtelijke herschaling gevolgd door center- of random cropping naar een vaste resolutie (H′, W′), intensiteitsnormalisatie per pixel en optionele data-augmentatie, waaronder random flipping, schaling en color jittering, voorafgaand aan de feature-extractie. Concreet werd de intensiteitsnormalisatie geïmplementeerd als standaard score-normalisatie zoals in vgl. (1).
(1)
waarbij μ, σ de kanaalgemiddelden en standaarddeviaties zijn die zijn berekend over de trainingset, of als min-max schaling zoals in Vergelijking (2).
(2)
Na normalisatie werd elk frame weergegeven als F̃t ∈ RH′×W′×C′ en de resulterende videotensor werd weergegeven als V′ ∈ RT×H′×W′×C. In een multi-schaal convolutionele frontend worden meerdere ruimtelijke feature maps van het receptieve veld verkregen door het toepassen van verschillende 2-D (of 3-D voor vroege spatiotemporele convoluties) convoluties met verschillende kernelgroottes; vervolgens werd voor elk frame of kort videoclipje een temporele feature-representatie gegenereerd en doorgestuurd naar de LSTM-module. Het oorspronkelijke artikel maakt gebruik van MobileNetV2 en vervolgens Deep BiLSTM voor temporele modellering; exact dezelfde bovenstaande preprocessing-pipeline is volledig compatibel met een vervanging door multi-schaal conv + LSTM.
3. Bemonstering en temporele normalisatie
Aangezien videolengtes T variëren tussen en binnen datasets, bemonsteren we frames uniform of resamplen we deze temporeel om de multi-scale convolutie + LSTM een vaste inputlengte N te geven in termen van frames of korte fragmenten. Uniforme frame-indices kunnen worden berekend zoals in Vergelijking (3),
(3)
dus, de bemonsterde framevolgorde is Vs = {F̃t0, …, F̃tN−1}. Wanneer een fijnere temporele getrouwheid vereist is, voeren we lineaire temporele interpolatie uit: voor elke opnieuw bemonsterde fractionele tijd τ ∈ [0, T−1] berekend zoals in vgl. (4).
(4)
zodat de geresamplede sequentie Vs precies N frames heeft en een vloeiende beweging behoudt. Alternatief levert sampling via korte aaneengesloten clips (temporele vensterlengte w met stapgrootte s) een set clip-tensoren op waarbij elke clip Cj ∈ RT×H′×W′×C en j = 0, …, ⌊(T − w)/s⌋. Voor temporele normalisatie binnen het netwerk is een eenvoudige temporele pooling op meerdere schalen effectief: gegeven een temporele feature-sequentie X = {x1, …, xN} gegenereerd door multi-scale convs, worden de gepoolde features toegepast zoals in Eq. (5).
(5)
waar Sk is de temporele ondersteuning voor schaal k (bijv. Sk kunnen niet-overlappende blokken of gedilateerde indices zijn) en mk = |Sk|.
Voorafgaand aan de extractie van kenmerken werden alle video's geschaald naar 224 × 224 pixels en gesampled op 25 frames per seconde. Voor elk experiment werd een constante sequentielengte van 32 frames gebruikt. De technieken voor data-augmentatie omvatten onder andere random cropping (schaal = 0.8–1.0), random rotatie (±15°), random horizontale spiegeling (waarschijnlijkheid = 0.5) en aanpassing van de helderheid (±20%). Om de pixelwaarden te standaardiseren, werden de ImageNet-gemiddelden [0.485, 0.456, 0.406] en standaarddeviaties [0.229, 0.224, 0.225] gebruikt. Voor elke videosequentie werd uniforme frameselectie toegepast voor temporele sampling. Langere films werden uniform bijgesneden of gesampled om een consistente sequentielengte te behouden, terwijl video's met minder dan 32 frames werden aangevuld met nullen (zero-padding). Deze instellingen werden constant toegepast gedurende de training en evaluatie.
4. Kenmerkextractie met behulp van MSCNN
Een Multi-Scale Convolutional Neural Network (MSCNN) werd ingezet om de ruimtelijke representatie van acties in sportvideo's te verbeteren. Conventionele convolutionele neurale netwerken die vertrouwen op een enkele kerngrootte kunnen beperkt zijn in hun vermogen om kenmerken op meerdere ruimtelijke schalen vast te leggen. Omdat sommige sportacties vergelijkbare visuele kenmerken vertonen, kan het voor een convolutionele architectuur met een enkele schaal moeilijk zijn om zowel lokale als globale kenmerken gelijktijdig vast te leggen. Om deze beperking aan te pakken, maakt het voorgestelde framework gebruik van convolutionele kernen van verschillende groottes om multi-scale kenmerkextractie en kenmerkfusie uit te voeren.
In de voorgestelde netwerkarchitectuur werden 1 × 1 convolutiekernels gebruikt om informatie over kanalen heen te organiseren en om de dimensionaliteit van de input-featuremaps te verlagen. Bovendien verhogen deze lagen de expressieve capaciteit van het netwerk door aanvullende feature-transformaties en niet-lineaire representaties te introduceren. Convolutiekernels van verschillende groottes maken de extractie van ruimtelijke informatie op meerdere schalen mogelijk. Sequentiële normalisatie wordt uitgevoerd na gewogen multi-schaal feature-fusie om de trainingsstabiliteit te verbeteren. Om problemen met het verdwijnen van gradiënten (gradient vanishing) en het exploderen van gradiënten (gradient explosion) tijdens het trainen van diepe netwerken te beperken, maakt de voorgestelde architectuur gebruik van residuale verbindingen en LSTM-gebaseerde temporele modellering.
Het ontwerp op meerdere schalen verbetert het vermogen van het netwerk om kenmerken bij verschillende ruimtelijke resoluties vast te leggen en verbetert de capaciteit voor kenmerkrepresentatie. Bovendien wordt de conventionele N × N convolutiekernel ontbonden in N × 1 en 1 × N convolutiebewerkingen. De N × 1 en 1 × N convoluties die in de MSCNN-module worden gebruikt, zijn ontworpen om complementaire directionele en multi-schaal ruimtelijke kenmerken uit individuele videoframes vast te leggen. Deze convolutiebewerkingen verbeteren de ruimtelijke kenmerkrepresentatie door patronen op verschillende schalen van het receptieve veld te extraheren. Temporele relaties tussen opeenvolgende frames worden vervolgens gemodelleerd door de LSTM-module, die de reeks door MSCNN geëxtraheerde kenmerken verwerkt om langetermijn-temporele afhankelijkheden voor actieherkenning te leren.
Elke sportvideo V = {F1, F2, …, FT} wordt ontleed in T frames. Om ruimtelijke variaties te coderen, zoals de houding van de speler, bewegingsonscherpte en de baan van de bal, werken convolutionele takken op drie verschillende schalen s ∈ {1, 2, 3}, overeenkomend met kernelgroottes van 3 × 3, 5 × 5 en 7 × 7. Elke tak extraheert feature maps zoals beschreven in vgl. (6):
(6)
Waarbij Ws en bs de convolutionele gewichten en biases zijn op schaal s, en σ de ReLU-activatie is. De multi-scale fusielaag aggregeert kenmerken zoals in vgl. (7):
(7)
Deze gefuseerde feature-tensor bevat zowel fijnmazige bewegingskenmerken als contextuele informatie over grote gebieden, zoals groepsactiviteiten. Figuur 3 illustreert enkel de feature-extractiemodule van de MSCNN. De LSTM-laag (256 hidden units), dense laag (128 neuronen) en dropout-laag (0,5) die worden gebruikt voor temporele modellering en classificatie, worden afzonderlijk weergegeven in Figuur 4.

Figuur 3: Voorgestelde module voor kenmerkextractie van het Multi-Scale Convolutional Neural Network (MSCNN). Drie parallelle convolutionele takken met kernelgroottes van 3 × 3, 5 × 5 en 7 × 7 extraheren complementaire multi-schaal ruimtelijke kenmerken, die worden gefuseerd voorafgaand aan temporele modellering door het LSTM-netwerk. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Voorgestelde LSTM-architectuur voor actieherkenning in sportvideo's. De LSTM-module modelleert temporele afhankelijkheden via invoer-, vergeet- en uitvoerpoortoperaties over opeenvolgende videoframes. Klik hier om een grotere versie van deze figuur te bekijken.
Figuur 3 illustreert de voorgestelde module voor kenmergextractie met een Multi-Scale Convolutional Neural Network (MSCNN) voor actieherkenning in sportvideo's. Inputvideoframes werden parallel verwerkt via drie convolutionele takken met kernelgroottes van 3 × 3, 5 × 5 en 7 × 7, elk met 64 filters om complementaire fijnmazige en grofmazige ruimtelijke kenmerken vast te leggen. De outputs werden verfijnd met Batch Normalization, ReLU-activatie en 2 × 2 max pooling, vervolgens geconcateneerd en gefuseerd door een 1 × 1 convolutie met 128 filters. Een residual skip connection behield laag-niveau ruimtelijke informatie en verbeterde de gradiëntstroom. De gefuseerde feature maps werden afgeplat en doorgegeven aan een LSTM-laag met 256 hidden units voor temporele modellering, gevolgd door een volledig verbonden laag met 128 neuronen, ReLU-activatie en een dropout-rate van 0,5 vóór de uiteindelijke classificatie met behulp van een Softmax-laag. De multi-scale feature maps (f1l, f2Het lijkt erop dat u alleen de letter "l" heeft ingevoerd. Voer aub de Engelse brontekst in die u wilt laten vertalen naar het Nederlands., en f3Het lijkt erop dat u slechts een enkele letter heeft ingevoerd. Voer alstublieft de volledige Engelse brontekst in die u wilt laten vertalen naar het Nederlands.) werden geconcateneerd om de gefuseerde representatie te vormen (FHet lijkt erop dat er geen brontekst is meegeleverd om te vertalen. Voer alstublieft de Engelse tekst in die u naar het Nederlands vertaald wilt hebben.), wat verder werd verfijnd door een 3 × 3 convolutie om de output-featuremap voor de volgende laag te genereren. Deze hiërarchische architectuur maakte het mogelijk om complementaire ruimtelijke kenmerken op meerdere receptieve velden te leren, waardoor de prestaties bij de herkenning van sportacties werden verbeterd.
5. Temporele modellering met behulp van LSTM
Om de tijdsgebaseerde evolutie over de videoranden te modelleren, werd de geaggregeerde kenmerksequentie aan het LSTM-systeem geleverd om dynamische afhankelijkheden en bewegingscontinuïteit vast te leggen. Voor elke inputvideo hebben we eerst multiscale CNN-kenmerken per frame geëxtraheerd. Stel dat de videoframes I1, …, IT zijn. Voor elk frame t en elke schaal s produceert de multi-scale convolutionele encoder een kenmerkvector ft(s) ∈ Rd. Vervolgens worden de schalen gefuseerd tot een enkele framedescriptor via projectie + concatenering of een gewogen som, zoals in vgl. (8):
(8)
Voer vervolgens de reeks {xt}tT=1 in een LSTM in om de temporele dynamiek te modelleren. In de standaard LSTM-notatie zijn bij tijdstip t de poorten en toestanden weergegeven in vgl. (9) tot (13):
(9)
(10)
(11)
(12)
(13)
Hier is σ de sigmoid-activatie, ⊙ is elementgewijze vermenigvuldiging.) Hoewel bidirectionele LSTM-architecturen kunnen worden gebruikt om zowel de eerdere als de toekomstige temporele context vast te leggen, maakt het voorgestelde framework gebruik van een standaard LSTM om temporele afhankelijkheden over sequentiële videoframes te modelleren. Deze ontwerpkeuze is consistent met de MSCNN-LSTM-architectuur die in deze studie wordt gepresenteerd. Na het verwerken van het fragment werd een fragmentrepresentatie verkregen (bijv. de laatste verborgen toestand of temporele pooling): z = Poolt(vt).
Figuur 4 illustreert de workflow van de voorgestelde LSTM-architectuur voor sportactieherkenning. Het netwerk ontving een reeks videoframes of door CNN geëxtraheerde kenmerken en verwerkte deze over opeenvolgende tijdstappen (t−2, t−1 en t). Elke LSTM-cel bestond uit een inputgate, een forgetgate en een outputgate, die de informatiestroom door het netwerk reguleerden. De inputgate voegde nieuwe informatie toe aan de celtoestand, de forgetgate verwijderde irrelevante temporele informatie en de outputgate genereerde de verborgen toestand die naar de volgende tijdstap werd doorgegeven. De celtoestand behield langdurige temporele afhankelijkheden, terwijl de verborgen toestand kortstondige temporele informatie vastlegde. Na sequentiële verwerking werden de LSTM-outputs gepoold om een temporele kenmerkrepresentatie te genereren, die werd doorgegeven aan een volledig verbonden laag en een Softmax-classifier om de overeenkomstige sportactie te voorspellen. Het netwerk werd getraind met de Adam-optimizer gedurende 100 epochs met een batchgrootte van 32, een initiële leerstemming van 0,001 en een cross-entropy verliesfunctie. Het model met het laagste validatieverlies werd geselecteerd voor de uiteindelijke evaluatie. Om reproduceerbaarheid te garanderen, werden alle experimenten uitgevoerd met een vast random seed van 42. Early stopping en leerstemmingsverlaging bij een plateau werden toegepast om de convergentie te verbeteren, en gradient clipping met een drempelwaarde van 5,0 werd toegepast tijdens de LSTM-training om exploderende gradiënten te voorkomen. Het voorgestelde MSCNN-LSTM-model bevatte ongeveer 15 miljoen trainbare parameters.
De uiteindelijke klassenscores en waarschijnlijkheden maken gebruik van een lineaire laag + softmax zoals in vgl. (14):
(14)
Train door de kruisentropieverlies over de gelabelde clips te minimaliseren, zoals beschreven in Eq. (15):
(15)
waarbij Nb de grootte van de batch is, C het aantal klassen, en y(n) de one-hot ground truth. Regularisatie (dropout op xt/LSTM-outputs, weight decay). Gradient clipping wordt toegepast om de stabiliteit voor lange sportsequenties te verbeteren.