Research Article

Een transformer-gebaseerd multimodaal kader voor tactische beslissingsanalyse in teamsporten met toepassing op voetbal

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Om de categorisering van tactische beslissingen in het voetbal te verbeteren, stelt deze studie een op Transformer gebaseerd multimodal fusiemodel voor dat visuele, locatie-, akoestische en contextuele data integreert. Het model behaalt bijna realtime prestaties op een multimodale dataset van 500 sequenties, waarmee het CNN-LSTM, BiLSTM-Attention en GNN baselines overtreft wat betreft nauwkeurigheid en door druk veroorzaakte misclassificatie.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Snelle en nauwkeurige tactische besluitvorming is vereist in het moderne voetbal. Traditionele benaderingen voor het beoordelen van tactische besluitvorming hebben echter weinig ecologische validiteit en zijn niet gemakkelijk op te schalen. Om deze uitdagingen aan te pakken, introduceert dit artikel een Transformer-Based Multimodal Fusion model dat spelerpositionering, video, audio en contextuele metadata integreert om realtime tactische beslissingen te classificeren. Er werden experimenten uitgevoerd met 40 mannelijke spelers en een dataset bestaande uit 500 reeksen multimodale toneelstukken. De dataset van 40 spelers verwijst naar gecontroleerde laboratoriumachtige besluitvormingsexperimenten die worden gebruikt voor initiële validatie en een betrouwbaarheidsbeoordeling. Vervolgens werden 500 multimodale sequenties geëxtraheerd uit uitgebreide match-simulaties en opnames van het echte spel om de grotere dataset te leveren die werd gebruikt voor het trainen en testen van het multimodale transformatormodel.

Het verwerkt invoer in vijf fasen: gegevensacquisitie, voorverwerking, feature-extractie, transformator-gebaseerde fusie en beslissingsclassificatie. In vergelijking met de basislijnen van CNN-LSTM, BiLSTM-Attention en GNN verbetert de voorgestelde aanpak de nauwkeurigheid van beslissingsvoorspelling met 28% en vermindert de misclassificatie veroorzaakt door druk met 41%, met een lage inferentielatentie van 52,6 ms, waardoor het geschikt is voor toepassingen in bijna realtime. De generaliseerbaarheid van bevindingen over meer diverse tactische contexten en naar bredere atletendemografieën wordt ook beperkt door de relatief kleine omvang en homogeniteit binnen de steekproefpopulatie van jonge mannelijke spelers uit één regio. Deze resultaten benadrukken de bijdrage van transformatorgebaseerde multimodale fusie aan geautomatiseerde tactische beslissingsanalyse en wijzen op de noodzaak van verdere validatie in meer diverse en grootschalige matchsituaties.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Teamsporten, zoals voetbal, vereisen snelle tactische beslissingen in dynamische en onzekere omgevingen. Spelers moeten voortdurend visuele informatie lezen van de bal, teamgenoten en tegenstanders, en binnen fracties van een seconde reageren om een concurrentievoordeel te verzekeren. Tactische besluitvorming in voetbal is sterk afhankelijk van de snelle waarneming van spelersbewegingen, balbaan en situationele aanwijzingen. Hoewel algemene perceptuele-cognitieve vaardigheden, zoals reactietijd en selectieve aandacht, inderdaad de prestaties beïnvloeden, heeft recent onderzoek de nadruk gelegd op data-gedreven, contextbewuste modellen die echte tactische cognitie in het spel kunnen benaderen. Reactietijd en waarnemingsvermogens, zoals cognitieve vermogens, spelen ook een cruciale rol in prestaties 6,7,8. Recent onderzoek in sportcognitie heeft aangetoond dat tactische besluitvorming niet alleen afhankelijk is van perceptuele vaardigheden, maar ook van het vermogen van de atleet om dynamische ruimtelijke informatie, druk van de tegenstander en contextuele spelsignalen in realtime te integreren. Onderzoek naar perceptuele-cognitieve expertise suggereert dat tactisch meer geletterde spelers signalen sneller herkennen, informatie efficiënter oppikken en stabielere besluitvormingspatronen onder druk vertonen. Dergelijke bevindingen ondersteunen de noodzaak van computationele modellen die de complexe, gelaagde aard van sportbesluitvormingsprocessen kunnen vastleggen.

Klassieke methoden voor het evalueren van tactische besluitvorming maken vaak gebruik van gecontroleerde laboratoriumtaken en subjectieve deskundige oordelen, die aanzienlijke beperkingen opleggen aan ecologische validiteit en schaalbaarheid. Recente ontwikkelingen in deep learning bieden het potentieel om het proces te automatiseren door gebruik te maken van multimodale databronnen—zoals video, positionele tracking en contextuele match-metadata—binnen temporele en cross-modale afhankelijkheidsvastleggingsarchitecturen. Ondanks deze vooruitgang zijn de meeste huidige modellen nog steeds gebaseerd op Convolutional Neural Networks-Long-Short Term Memory of Bidirectional Long-Short Term Memory (CNN-LSTM of BiLSTM) modellen, die beperkte capaciteit hebben om langeafstandsafhankelijkheden tussen modaliteiten te modelleren. Deze tekortkoming is de drijvende kracht achter de ontwikkeling van transformer-gebaseerde multimodale fusiemodellen, die beter in staat zijn om tactische besluitvorming meer volledig en stabiel te modelleren in voetbalscenario's. In de teamsport van de tegenstander, voetbal, moeten spelers bijvoorbeeld snel informatie over de bal evalueren, inclusief hun teamgenoten, tegenstanders en positie op het veld. Voordat ze de beste aanpak kiezen op basis van hun vaardigheden, de instructies van de coach en de omstandigheden van het spel 9,10. Vanwege de toegankelijkheid van georganiseerde datasets en gedefinieerde tactische componenten richt deze studie zich uitsluitend op voetbal; Toch zijn tactische principes voor het nemen van beslissingen toepasbaar op tal van teamsporten.

Eerdere studies geven inderdaad aan dat CNN-LSTM en BiLSTM geen zeer langetermijn-temporele afhankelijkheden kunnen vastleggen door gebruik te maken van een vast receptief veld of door beperkt te worden door sequentiële gating 11,12,13. Evenzo toont fundamenteel benchmarkwerk in actieherkenning en multimodale temporele modellering aan dat de prestaties van LSTM-modellen afnemen naarmate de sequentielengte toeneemt of wanneer contextuele aanwijzingen meerdere frames uit elkaar plaatsvinden, wat de ecologische validiteit in dynamische sportomgevingen kan beperken. Bovendien zijn modellen op basis van het Graph Neural Network (GNN) krachtige instrumenten voor ruimtelijke interactiemodellering, maar ze presteren consequent ondermaats in scenario's die fijnmazige temporele redenering vereisen of in gevallen waarin contextuele druksignalen snel verschuiven over de tijd14,15. In tegenstelling tot deze benaderingen tonen recentere transformer-gebaseerde kaders hun prestatiesuperioriteit aan in sportanalyse, herkenning van menselijke activiteit en videotaaltaken door de gezamenlijke integratie van langeafstands-temporele aanwijzingen, ruimtelijke relaties en contextuele signalen in één enkele voorwaartse pass, mogelijk gemaakt door globale zelfaandacht. Dergelijke benchmarkbevindingen rechtvaardigen de keuze voor een transformer-gebaseerde architectuur als ruggengraat voor het voorgestelde model in de huidige studie.

Het verbeteren van tactische kennis en het begrijpen van tactische principes is aangetoond cruciaal te zijn voor het oplossen van spelbeperkingen en problemen16,17. Footballspelers leren verschillende spelelementen, waaronder penetratie, offensieve bescherming, beweging, tijd, beperking, verdedigingsbescherming, balans en focus, via technisch-tactische training18. Naarmate spelers meer voetbalervaring opdoen, zal hun begrip van technische en tactische basisprincipes toenemen. Spelers kunnen daardoor relevante signalen gemakkelijker onderscheiden, wat het nemen van passende beslissingen voor elke spelregel in een bepaald scenario19 vergemakkelijkt. Hierdoor kunnen spelers hun motorische efficiëntie en besluitvormingsvaardigheden gebruiken om bewegingspatronen aan te vullen met gespecialiseerde talenten.

De auteur gebruikte meervoudige attributen om de fitnessvoordelen van lichaamsbeweging en -gewoonten te analyseren, waarmee hij de effectiviteit van gekwalificeerde trainingscapaciteit in lichamelijke opvoeding onder studenten illustreert. Effectieve lichamelijke activiteit, het ontwikkelen van gezonde fitnessgewoonten en het pleiten voor hervormingen in de manier waarop sport in onderwijsinstellingen wordt voorgesteld, krijgen allemaal aanzienlijke gewicht. Het Intuitionistisch Fuzzy Gewogen Heronian Gemiddelde (IFWHM) met fuzzy number assistance wordt gebruikt voor effectieve besluitvorming. De uitkomst ondersteunde het cognitieve succes van universiteitsstudenten en toonde een nauwkeurigere beoordeling van hun lichamelijke welzijnsproblemen aan. Om de latente verbindingen in de data te detecteren, gebruikte onderzoeker20 de augmented Apriori-methode. De conclusies van het onderzoek zijn relevant voor de beoordeling van de lichamelijke gezondheid van studenten in het hoger onderwijs. De eerste uitkomst wordt bepaald door de vermoeidheid van verschillende oriëntaties te evalueren op basis van hun frequentie van optreden.

Eerder AI-gebaseerd onderzoek in sportanalyse richtte zich op computervisietaken, waaronder spelersdetectie, tracking en het herkennen van groepsactiviteiten. Recente zwak gecontroleerde en detectorvrije architecturen hebben het belang van multimodale en contextbewuste modellering blootgelegd bij het begrijpen van tactisch gedrag. Deze ontwikkelingen vereisen de integratie van multimodaal deep learning om tactische beslissingen in het voetbal te classificeren. Met latente featurevectoren die worden geproduceerd uit de nutsmatrix via matrixfactorisatie, wordt de cosinusgelijkenis berekend tussen gebruikers en gebruikers of items en items in dit artikel.

Recent onderzoek in sportanalyse is verschoven naar multimodale en contextbewuste deep-learning-kaders die video, positiedata en contextuele aanwijzingen combineren om tactisch gedrag te interpreteren. Verschillende transformer-gebaseerde benaderingen hebben sterke capaciteiten aangetoond in het modelleren van langeafstands-temporele structuur en cross-modale relaties in sportomgevingen, waaronder de volgende: MM-ViT voor multimodale actieherkenning, unified contrastive fusion transformers voor sportcontextredenering, en cross-attention-driven event detectors21,22. Deze benaderingen geven aan dat tactische beslissingen het beste worden weergegeven met architecturen die de interacties tussen spelers, ruimte, bewegingssignalen en contextuele informatie vastleggen, in plaats van single-modality CNN-LSTM-modellen. In deze richting zal de voorgestelde studie ook gebruikmaken van een transformer-gebaseerd multimodal fusie-framework om gezamenlijk visuele, positionele en contextuele signalen te verwerken voor bijna realtime modellering van tactische beslissingen in voetbal.

Eerdere modellen voor voetbalanalyse waren doorgaans gebouwd rond de CNN-LSTM- of BiLSTM-architectuur, die lokale temporele patronen vastleggen maar worstelen met langeafstandsafhankelijkheden tussen modaliteiten. Transformers vullen deze kloof door globale zelfaandacht toe te passen, waardoor een model spelersbewegingen, balbanen en situationele aanwijzingen kan relateren over uitgebreide tijdsvensters voor robuuste tactische beslissingsanalyse. Om het probleem van schaarsheid in beoordelingsgegevens voor aanbevelingssystemen op te lossen, stelde de auteur23,24 een Review-Based Matrix Factorization-techniek voor die review-gebaseerde collaboratieve filtering en beoordelingsimputatie combineert.

Desalniettemin worden hun effectiviteit, schaalbaarheid en toepasbaarheid van deze methoden sterk beperkt door hun afhankelijkheid van begrenzende dozen voor inferentie en de enorme behoefte aan datalabeling. Een methode om dit probleem op te lossen is het gebruik van begrenzende boxlabels om gelijktijdig spelersdetectie en groepsactiviteitsherkenning te trainen 25,26,27,28. Hoewel actor-niveau begrenzingsbox-annotaties nog steeds nodig zijn voor trainingsgegevens, berekent de voorgestelde methode de begrenzingsboxen van spelers tijdens inferentie. De Weakly Supervised Group Activity Recognition (WSGAR)-benadering, die geen actor-niveau labels vereist voor training of afleiding, heeft als doel de annotatielast te verlichten. Na het genereren van begrenzingsboxsuggesties met een vooraf getrainde detector op een externe dataset, leerden ze irrelevante detecties eruit te filteren. Onlangspresenteerden de onderzoekers een detectorvrije aanpak voor de WSGAR-uitdaging waarbij token-embeddings worden gebruikt om gedeeltelijke contexten te genereren die spelersinformatie verzamelen.

Binnen sportanalyse hebben multimodale en transformer-gebaseerde architecturen recentelijk aan betekenis gewonnen omdat ze langetermijnpatronen kunnen vastleggen en heterogene datastromen kunnen integreren 30,31. Varianten van transformers zijn toegepast om de bewegingen van spelers te voorspellen, multi-view tactic analyses uit te voeren en actieintentie te herkennen, waarmee ze uitstekend temporeel redeneren aantonen vergeleken met het CNN-LSTM-model. Multimodale fusiestrategieën, die video, positie en contextuele aanwijzingen combineren, hebben bemoedigende vroege resultaten opgeleverd in realtime tactische modellering en benadrukten het belang van cross-attention en sequence-to-sequence leren bij het begrijpen van in-game beslissingsdynamiek.

Transformer-gebaseerde multimodale frameworks hebben recentelijk uitstekende prestaties aangetoond in verschillende sectoren waar het integreren van diverse datastromen noodzakelijk is. Zo zijn ViT-gebaseerde multimodale fusiemodellen gebruikt om gezamenlijk video-, pose- en audio-informatie te interpreteren met behulp van cross-attention-processen voor contextbewuste gebeurtenisvoorspelling, spelerstracking en actieherkenning32,33. Bovendien heeft de MM-Former en Perceiver-gebaseerde architectuur het beter gedaan dan recurrente en convolutionele modellen in het samenvoegen van ruimtelijk-temporele aanwijzingen, evenals in langetermijn-temporele redenering, in sportanalyse en human activity analysis34. Deze resultaten ondersteunen het gebruik van een transformator-gebaseerde multimodale fusiearchitectuur in deze studie door aan te geven dat transformatoren in staat zijn fijnmazige interacties tussen modaliteiten vast te leggen via globale aandacht35. Transformers zijn bijzonder geschikt voor tactische analyse, omdat hun globale aandacht het model in staat stelt visuele aanwijzingen, positiegegevens en contextuele signalen te relateren over langere tijdsvensters, mogelijkheden die CNN-LSTM- en BiLSTM-modellen missen.

Eerdere studies hebben voornamelijk handmatig gevormde en geauthenticeerde beoordelingen gebruikt om prestatiesnelheid en besluitnauwkeurigheid te evalueren in vooraf afgesproken activiteiten, zoals rijden en inhalen, ondanks de groeiende interesse in het beoordelen van tactische besluitvorming in teamsporten 36,37,38. Deze frameworks kennen grenzen op het gebied van schaalbaarheid, objectiviteit en geschiktheid voor dynamische, realistische situaties, ondanks dat ze inzichtelijke gegevens bieden over spelersgedrag en uitmuntendheid in besluitvorming39. Geautomatiseerde datagedreven benaderingen die het multimodale karakter van tactische besluitvorming kunnen vastleggen en begrijpen, waarbij complexe associaties tussen spelersacties, visuele signalen, audiosignalen en spelinstellingen betrokken zijn, worden niet gecombineerd in de huidige methoden 40,41,42. Daarnaast worden veelzijdige AI-structuren die kunnen wisselen tussen achtergrond- en temporele relaties vaak over het hoofd gezien door deze methoden. De groei van een op Transformer gebaseerd multimodaal fusie-framework dat gebruikmaakt van rijke, realtime databronnen, zoals videobeelden en positionele tracking, en besluitvormingsprocessen in teamsporten integreert, ontbreekt duidelijk. Het dichten van deze kloof kan de tactische penetratie, schaalbaarheid en onafhankelijkheid van besluitvorming in high-performance sportomgevingen aanzienlijk verbeteren. In tegenstelling tot de huidige CNN-LSTM- en BiLSTM-methodologieën, modelleert deze transformer-gebaseerde fusie bewust cross-modale aandacht tussen visuele, ruimtelijke en contextuele informatie. Deze nieuwigheid bevordert een dichtere tactische representatie en helpt om misclassificatie tijdens druksituaties met meer dan 40% te minimaliseren.

Het primaire doel van deze studie is het ontwikkelen van een Transformer-Based Multimodal Fusion framework voor het evalueren van tactische besluitvorming in voetbal. Hoewel het voorgestelde kader kan worden gegeneraliseerd naar andere teamsporten, richt deze studie zich op voetbal vanwege de tactische complexiteit en de beschikbaarheid van gestructureerde datasets. Het systeem maakt gestructureerde beoordeling van tactische nauwkeurigheid en responstiming mogelijk in gecontroleerde, geïsoleerde voetbaltaken, gebaseerd op deskundige beoordelingen. Dit werk pakt de beperkingen van handmatige evaluatie en statische testomgevingen aan door multimodale databronnen te integreren, waaronder positionele tracking, videobeelden, audiosignalen en contextuele spelinformatie.

Door gebruik te maken van transformer-gebaseerde aandachtsprocessen leert het voorgestelde framework continu multimodale verbindingen, waardoor een uniforme en contextbewuste interpretatie van de realtime besluitvormingsmethoden van spelers mogelijk is.

Het primaire doel van deze bepaling is het bevorderen van intelligente prestatie-evaluatie in de sport door coaches en analisten een dieper begrip te geven van het denken van spelers en de teamdynamiek via datagedreven inzichten.

Het voorgestelde raamwerk zal continu intermodale relaties leren door gebruik te maken van de aandachtsmechanismen van transformers, waardoor het een eenduidig begrip krijgt van de besluitvormingsstrategieën van spelers in realtime games.

Hierdoor kan het systeem bruikbare inzichten geven in tactisch gedrag dat anders moeilijk te karakteriseren is met standaard evaluatiemethoden.

Het doel is om de interpreteerbaarheid te verbeteren en coaches en analisten van meer nuttige informatie te voorzien.

De belangrijkste bijdrage van dit werk wordt hieronder gegeven:

Deze studie maakt gebruik van een Transformer-gebaseerd multimodal fusieontwerp om een nieuw deep learning-model te presenteren voor tactische besluitvormingsanalyse in teamsporten.

Door het integreren van visuele, positionele en contextuele datastromen uit echte wedstrijdbeelden, vergroot deze aanpak de reikwijdte van de eenvoudige evaluatiemethoden die in de basisstudie werden geïntroduceerd, die zich richtte op solo-passing en drive-acties.

De multimodale encoder verzamelt geavanceerde ruimtelijke en tijdelijke relaties door spelerstrackinggegevens, visuele frames en contextuele matchgebeurtenissen te integreren met behulp van aandachtmechanismen.

Experimenten met een benchmark football-dataset toonden aan dat dit model beter presteerde dan traditionele baselines zoals CNN-gebaseerde fusiemethoden en LSTM.

In vergelijking met CNN-LSTM, BiLSTM-Attention en GNN baselines laat de voorgestelde transformer-gebaseerde multimodale fusiearchitectuur aanzienlijke verbeteringen zien.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De studie omvatte 40 mannelijke voetballers van 18-24 jaar (gemiddelde = 20,1 ± 1,2), gerekruteerd uit vier amateur- en semiprofessionele clubs binnen één regionale competitie. Alle deelnemers hadden minstens drie jaar competitieve ervaring en trainden momenteel in een gestructureerde omgeving. Gegevensverzameling vond plaats in twee gecontroleerde omgevingen: eerst in gestandaardiseerde trainingsveld-oefeningen die tactische pass/drive-beslissingsscenario's simuleerden; ten tweede, in langdurige sessies van match-simulatie waaruit multimodale sequenties werden geëxtraheerd. Alle procedures werden goedgekeurd door de Institutionele Ethische Commissie van Beibu Gulf University (Goedkeuringsnummer: BG-PE-2023-117), en er werd schriftelijke geïnformeerde toestemming verkregen van alle deelnemers voorafgaand aan de gegevensverzameling. Internationale en institutionele ethische normen werden nageleefd bij het uitvoeren van dit onderzoek. De Institutional Ethics Committee van Beibu Gulf University heeft alle procedures met menselijke proefpersonen onderzocht en goedgekeurd (Goedkeuringsnummer: BG-PE-2023-117). Voorafgaand aan de gegevensverzameling gaf elke deelnemer schriftelijke geïnformeerde toestemming, en alle verzamelde gegevens werden geanonimiseerd vóór de analyse.

Dit werk streeft ernaar het onderzoek naar tactische beslissingen in teamsporten te automatiseren en te verbeteren via een Transformer-gebaseerde Multimodale Fusion-architectuur. Het gebruikt een verscheidenheid aan databronnen, waaronder video, audio, ruimtelijke locatie en spelermetadata om een robuust realtime voorspellend model te creëren. Figuur 1 toont de architectuur van de voorgestelde methode. Het voorgestelde werk bestaat uit vijf fasen. De fasen worden hieronder beschreven:

Figuur 1
Figuur 1. Architectuur van de voorgestelde methode. Schematisch van het model waarbij multimodale invoer en classificatiecomponenten worden gecombineerd voor tactische besluitvorming. Klik hier om een grotere versie van deze figuur te bekijken.

Gegevensverzameling en voorverwerking

Gegevens uit verschillende modaliteiten worden verzameld uit opnames van wedstrijden, zoals videofeeds, audiocommentaar, GPS/positioneringsinformatie en spelersprestatie-indicatoren. Elke modaliteit ondergaat preprocessing in de vorm van technieken zoals frame-extractie (voor video), ruisfiltering (voor audio) en normalisatie (voor sensormetingen), waarbij synchronisatie bij tijdstappen wordt gegarandeerd.

Videoframes werden geëxtraheerd met 25 fps, teruggesampled tot 224 × 224 resolutie. Audiosignalen werden verwerkt met een banddoorlaatfilter, variërend van 300 tot 3.400 Hz, om het merendeel van de omgevingsruis te elimineren. Positionele trackinggegevens van GPS-sensoren werden geregistreerd op 10 Hz en geïnterpoleerd met lineaire tijdstempelgebaseerde interpolatie, zodat ze overeenkomen met de 25 Hz videotijdlijn. Alle invoer werden tijdmatig uitgelijnd met gedeelde tijdstempels, en hun schalen werden genormaliseerd met z-scoring.

Feature-extractie

Om de ruimtelijke en temporele informatie van videodata te verzamelen, worden 3D-CNN's gebruikt. De 3D-CNN's verwerken zowel ruimtelijke als temporele informatie over videoframes, waardoor het model in staat stelt bewegingspatronen te detecteren, groepsgedrag te begrijpen en bewegingsgebaseerde kenmerken te extraheren. Deze bewerking genereert een dichte feature-representatie per actiesequentie, die wordt gebruikt als visuele input voor het model. Elke video-invoerclip bevatte 16 opeenvolgende frames die werden gesampled met een stap van 2. Willekeurig bijsnijden, horizontaal omdraaien en helderheidsnormalisatie werden toegepast tijdens de training. De 3D CNN werd geoptimaliseerd met Adam (lr = 0,0001), batchgrootte 16 en kruis-entropieverlies.

Embedding en uitlijning van multimodale inputs

Daarna worden embeddings uit verschillende modaliteiten geïntegreerd met de 3D-uitgangen van CNN. Er wordt een multimodale transformatormodelarchitectuur gebruikt, waarbij verschillende encodertakken elke modaliteit behandelen. Cross-attention lagen worden gebruikt voor modaliteitsfusie en -uitlijning, waardoor het model onderlinge afhankelijkheden kan vastleggen (bijvoorbeeld tussen spelerslocaties en balbeweging, en context uit commentaar). Deze samensmelting zorgt voor een verrijkt contextueel begrip van de huidige tactische keuzes. Ook alle embeddings in PyTorch geïmplementeerd. Videokenmerken werden lineair geprojecteerd van 1.024 tot 512 dimensies, en audio- en positiekenmerken werden respectievelijk geprojecteerd op 256 en 128 dimensies, verenigd tot 512 dimensies vóór temporele uitlijning.

Transformator-gebaseerde multimodale fusie

Een multimodale transformator wordt gebruikt om de uit alle bronnen gehaalde kenmerken te combineren. Zelf-aandacht mechanismen in de transformator stellen het model in staat onderlinge afhankelijkheden tussen modaliteiten (bijv. visueel + audio) te leren, temporele flow en context vast te leggen, en tactisch belangrijke frames en gebeurtenissen te markeren. Het resultaat van deze stap is een gecombineerde weergave die de tactische intentie en de situationele context van elke genomen beslissing vastlegt. De multimodale transformator bestond uit zes encoderlagen, elk met acht aandachtskoppen. Aandachtsmatrices werden berekend met behulp van geschaalde dot-product aandacht. Aandachts- en feed-forward-lagen omvatten ook dropout met p = 0,1 om overfitting te voorkomen.

Tactische beslissingsclassificatie en evaluatie

Tot slot wordt de gefuseerde representatie als input ingevoerd in een classificatielaag of beslissingsanalyseblok, dat wordt gebruikt om het tactische beslissingstype te voorspellen, de beslissingskwaliteit te beoordelen en optioneel verklaarbare inzichten voor coaches te genereren via aandachtsheatmaps of activatiekaarten. De output van deze fase biedt een kwantitatieve en kwalitatieve evaluatie van de besluitvormingsvaardigheden van een team of speler tijdens matchplay.

De classificatiekop maakte gebruik van een drielaags MLP met ReLU-activatie gevolgd door een softmax-laag. Het model werd getraind op een 70/15/15-verdeling met 10-voudige kruisvalidatie. De gebruikte meetwaarden waren nauwkeurigheid, precisie, herinnering, F1-score, latentie en AUC.

Een vereenvoudigd stroomschema, dat de vijf fasen samenvat, geeft een direct visueel overzicht van het sequentiële proces, zoals weergegeven in Figuur 2. Deze figuur geeft beknopt de volledige onderzoekspijplijn weer en omvat gegevensverzameling, voorverwerking, feature-extractie, multimodale fusie en tactische besluitvormingsclassificatie, gevolgd door gedetailleerde beschrijvingen van elke fase.

Figuur 2
Figuur 2. De algemene workflow van het onderzoeksproces. Overzicht van de onderzoekspijplijn, van dataverzameling en voorverwerking tot feature-extractie, modeltraining en evaluatie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3 toont de algemene workflow van het voorgestelde onderzoeksproces. Het proces wordt gestart in Fase 1: Gegevensverzameling en Pre-processing, waarbij multimodale databronnen, zoals video, audio, positionele tracking en contextuele metadata, worden verzameld en gesynchroniseerd. Tijdens Fase 2: Feature Extraction worden 3D Convolutionele Neurale Netwerken (3D CNN's) gebruikt om ruimtelijke tijdsinformatie uit videostromen te halen, wat resulteert in dichte visuele weergaven van spelersacties en tactische flow. Fase 3: Inbedding en uitlijning van multimodale inputs combineert audio, video en positionele kenmerken in een gedeelde latente ruimte, met temporele uitlijning en cross-modale uitlijning. Deze representaties worden vervolgens geaggregeerd in Fase 4: Transformer-gebaseerde Multimodale Fusie, waarbij cross-modale en zelf-aandacht mechanismen het model in staat stellen onderlinge afhankelijkheden tussen modaliteiten te leren en diepere contextuele inzichten te verkrijgen in tactische beslissingen. Tot slot, in Fase 5: Tactical Decision Classification and Evaluation, worden de gecombineerde representaties in een classificatielaag gevoerd om tactische beslissingen te detecteren, zoals pass, drive of hold. Ondertussen worden prestatie-metrics gebruikt om de nauwkeurigheid en responstijd van besluitvorming te schatten. Dit stroomdiagram geeft een duidelijk overzicht van de stapsgewijze aanpak, aangevuld met de uitgebreide tekstuele beschrijvingen die in de volgende secties zijn uiteengezet.

Figuur 3
Figuur 3. Sequentiële verwerkingspijplijn. Toont de stapsgewijze stroom van dataverzameling tot tactische beslissingsclassificatie en modeluitvoer. Klik hier om een grotere versie van deze figuur te bekijken.

Gegevensverzameling en voorverwerking

Om geavanceerde tactische besluitvormingsanalyses in teamsporten mogelijk te maken via een multimodale fusiepijplijn met Transformer, werd een gestructureerde en hoogwaardige dataverzamelings- en preprocessing-opstelling opgezet. De opzet omvat het samenvoegen van meerdere datamodaliteiten, waaronder video-opnames, het volgen van spelersposities, audiosignalen van interacties tussen speler en coach, en contextuele metadata zoals wedstrijdfase, teamstructuur en balbezitgebieden.

De steekproef bestond uit 40 mannen van 20 jaar en ouder, die allemaal actief betrokken waren bij regionale amateur- en semiprofessionele voetbalcompetities. Elk van hen werd gerekruteerd uit vier competitieve clubs met een gestructureerd trainingsprogramma. De gemiddelde leeftijd van de atleten was 20,1 ± 1,2 jaar, met een gemiddelde lengte van 177,5 ± 3,1 cm en een gemiddeld gewicht van 72,6 ± 2,9 kg. Ze speelden gemiddeld 6,8 ± 1,5 jaar voor hun respectievelijke clubs. Alle deelnemers hadden ook minimaal drie jaar competitieve ervaring en werden tactisch bekwaam bevonden.

Om statistische kracht te waarborgen, werd de steekproefgrootte benaderd met een betrouwbaarheidsniveau van 95% (Z = 1,96) en een significantieniveau van 5%, met een verwachte intraclass correlatiecoëfficiënt (ICC) van 0,96 en een betrouwbaarheidsinterval van 95% om bijna perfecte overeenstemming te weerspiegelen. Dit is in overeenstemming met het doel om de betrouwbaarheid en consistentie van de verzamelde multimodale besluitvormingsgegevens te valideren27.

Om reproduceerbaarheid te waarborgen, werden acquisitie-instellingen en technische specificaties gestandaardiseerd over sessies heen. Videodata werd opgenomen met een resolutie van 1.080p en 25 frames per seconde met GoPro Hero4-camera's met een breed gezichtsveld om de volledige tactische ruimte vast te leggen. Elke opname werd gestabiliseerd en gemonteerd op een vaste hoogte van 2,5 m. Audiosignalen werden vastgelegd met een externe veldmicrofoon met een bemonsteringsfrequentie van 44,1 kHz (mono) en vervolgens gefilterd met een banddoorlaatfilter van 300-3.400 Hz om omgevingsruis te verwijderen. Positionele trackinggegevens werden verzameld met draagbare GPS-sensoren die op 10 Hz werkten, met een gemiddelde door de fabrikant gerapporteerde positionele nauwkeurigheid van ±0,5 m. Alle modaliteiten werden gesynchroniseerd met gedeelde tijdstempels en opnieuw gesampled naar een gemeenschappelijke 25 Hz tijdlijn via lineaire interpolatie.

Preprocessing omvatte vervolgens het volgende: video-downsampling naar 224 × 224 resolutie, frame-sampling van 16 opeenvolgende frames met een stap van 2, willekeurig croppen, horizontale flipping, helderheidsnormalisatie, audionormalisatie en het filteren van ruis, en positionele en contextuele variabele z-score normalisatie.

Het preprocessing-script is in de volgende volgorde gerangschikt voor reproduceerbaarheid: (i) frame-extractie; (ii) audiofiltering; (iii) GPS-interpolatie; (iv) modaliteitsresampling naar 25 Hz; (v) z-score normalisatie; en (vi) integriteitstests voor corruptie, occlusie en uitval. Batchverwerkingsscripts worden gebruikt om elke fase automatisch te voltooien.

Om de data betrouwbaar te houden, omvatten de criteria voor kwaliteitscontrole en uitsluiting: i) sequenties met >20% spelerocclusie, ii) GPS-uitval van meer dan 200 ms, iii) beschadigde of afgeknipte audio, en iv) ernstige bewegingsonscherpte of desynchronisatie tussen modaliteiten. In totaal werden 17 sequenties (3,4%) uitgesloten voor deze aandoeningen. Tabel 1 toont de beschrijving van de dataset.

EigenschappenDetails
SportVoetbal (voetbal)
Deelnemers40 mannelijke voetballers
Niveau van spelFederated footballspelers met ≥5 jaar ervaring
TesttypePassing and driving (balcontrole) besluitvorming en uitvoeringstest
TestinstellingGestandaardiseerde voetbalveldopstelling, gemarkeerde zones, vaste posities
MeetinstrumentenGoPro Hero4-camera's, Kinovea-software, stopwatchtiming
Verzamelde gegevensUitvoeringstijd (ET), nauwkeurigheid van besluitvorming (DM), aantal correcte acties
TestprocedureSpelers reageerden op visuele prikkels van coaches en voerden passes of drives uit
Procesherhalingen10 trials per speler (5 passes, 5 drives)
EvaluatieExperts beoordeeld als DM; ET gemeten met behulp van tijdstempels/video
UitkomstvariabelenReactietijd, correcte beslissingsaantal, technische uitvoeringsscore

Tabel 1: Datasetbeschrijving. Beschrijft de demografie van de deelnemers, testprocedures, meetinstrumenten en uitkomstvariabelen.

In de huidige studie werden twee verwante maar verschillende datasets gebruikt. De eerste dataset bestond uit 40 spelers die deelnamen aan gecontroleerde pass/drive-beslissingen, voornamelijk gebruikt om betrouwbaarheid van de basis vast te stellen en de basisprocedure voor besluitmeting te valideren. De tweede dataset bevat 500 multimodale tactische sequenties verzameld uit uitgebreide wedstrijdsimulaties en opnames van echte wedstrijden. Deze sequenties vormden de belangrijkste trainings- en testdataset voor het transformator-gebaseerde fusiemodel, waardoor evaluatie onder ecologisch geldiger omstandigheden mogelijk is.

Hoewel de dataset uit 500 multimodale sequenties bestaat, zorgde gestratificeerde steekproefneming voor een evenwichtige representatie over tactische acties (Pass, Drive, Hold). Data-augmentatiemethoden, zoals temporele cropping en sequence shuffling, werden ook gebruikt om variabiliteit te vergroten en modelbias tijdens training te beperken.

Het is vermeldenswaard dat de 40-speler gecontroleerde dataset werd gebruikt bij de initiële modelvalidatie en het testen van betrouwbaarheid, terwijl de grotere verzameling van 500 multimodale sequenties werd samengesteld uit langdurige matchopnames en georganiseerde trainingssessies om de schaalbaarheid en ecologische validiteit van het framework te beoordelen. Basislijnbetrouwbaarheid werd vastgesteld met behulp van de kleinere dataset, terwijl de grotere dataset grootschalige modeltraining en -testen mogelijk maakte.

Datasetbeschrijving

Het experiment rekruteerde 40 mannelijke voetballers, elk met minstens vijf jaar gefedereerde speelervaring, om ervoor te zorgen dat de steekproefpopulatie beschikte over basis technische en tactische competenties. De gegevensverzameling vond plaats in een gestandaardiseerde voetbalveldindeling waarbij vooraf bepaalde zones en speelposities werden toegewezen om identieke testomstandigheden te garanderen. Tijdens het experimenteren moesten deelnemers reageren op visuele aanwijzingen van een coach, hetzij door te passen of de bal te slaan, waarmee ze tactische beslissingen uit een echte wedstrijd nabootsten. Elke deelnemer voltooide in totaal 10 proeven, waarvan vijf slagen en vijf rijden. Deze bewegingen werden vastgelegd met GoPro Hero4-camera's, en prestatiegegevens werden gemeten met Kinovea video-analysesoftware naast de handmatige stopwatch om de uitvoeringstijd (ET) vast te leggen. De belangrijkste verzamelde databron was: uitvoeringstijd, de kwaliteit van de DM zoals geëvalueerd door ervaren coaches, en de hoeveelheid correct uitgevoerde acties. Deze factoren boden een kwantitatieve basis om te analyseren hoe snel en effectief spelers tactische beslissingen namen en uitvoerden onder gecontroleerde stimulus-responsvoorwaarden. De geproduceerde dataset is een gestructureerde en gelabelde bron die goed geschikt is voor het creëren van benchmarks of het trainen van intelligente systemen met als doel het modelleren van tactisch denken en motorische reacties in teamsportcontexten.

De steekproef is beperkt tot jonge mannelijke spelers uit één regionale competitie, wat de generaliseerbaarheid ervan over leeftijdsgroepen, vrouwelijke atleten of andere culturen kan beperken. Toekomstige studies zullen proberen representatievere en diversere steekproeven te verzamelen.

Een andere beperking is de steekproef van 40 jonge mannelijke spelers uit één enkele regionale competitie. Hoewel de homogene steekproef bijdroeg aan interne validiteit en verminderde variatie in prestaties door leeftijd, geslacht en tactische achtergrondverschillen, beperkt het ook de generaliseerbaarheid van bevindingen naar een bredere populatie. De tactische patronen die het model leert, kunnen dus regio- of genderspecifieke speelstijlen weerspiegelen in plaats van universeel besluitvormingsgedrag. Voor deze studie werden gestratificeerde steekproeven en data-augmentatie gebruikt om de variabiliteit van de betreffende dataset te vergroten; Echter, grootschalige onderzoeksstudies met vrouwelijke atleten, jeugdspelers, professionele spelers en deelnemers uit meerdere tactische culturen zijn nodig om de robuustheid van het model in diverse voetbalomgevingen te bevestigen. Deze resultaten tonen veelbelovende resultaten, maar vereisen verdere validatie op meer diverse en grotere datasets voordat bredere generalisatie kan worden geclaimd.

Om subjectiviteit te verminderen, maakten drie professionele voetbalcoaches onafhankelijk van elkaar aantekeningen over de tactische keuzes. De betrouwbaarheid tussen beoordelaars werd geschat met behulp van de intraclass correlatiecoëfficiënt (ICC = 0,96, BI 0,94-0,98), wat wijst op bijna perfecte overeenkomst. Consensusdiscussie loste het meningsverschil op. Voor multimodale data hield preprocessing temporele synchronisatie tussen modaliteiten in (25 fps video en 10 Hz sensorgegevens) en z-score normalisatie van kenmerken om vergelijkbaarheid tussen modaliteiten mogelijk te maken.

De betrouwbaarheid tussen beoordelaars werd gekwantificeerd met behulp van een tweerichtings-random-effects intraclass correlatiecoëfficiënt (ICC [2,3]), omdat deze geschikt is voor het beoordelen van absolute overeenstemming tussen meerdere beoordelaars. De ICC van 0,96 (95% BI: 0,94-0,98) geeft bijna perfecte overeenstemming aan volgens de veelgebruikte drempels en stelt verder vast dat de tactische beslissingslabels die voor training werden gebruikt zeer betrouwbaar waren. De betrouwbaarheid werd berekend over alle 500 multimodale sequenties, zodat zowel gecontroleerde als match-simulatiecontexten correct en consistent werden geannoteerd.

Annotatieprocedure en labelprotocol

Alle multimodale sequenties werden geannoteerd met een gestructureerd, driefasig protocol. Ten eerste beoordeelden drie gelicentieerde voetbalcoaches onafhankelijk elke video-positievolgorde met behulp van een tijdstempel-gesynchroniseerde annotatie-interface (Kinovea + aangepaste tagging-spreadsheet). Annotators labelden de tactische beslissingscategorie (Pass, Drive, Hold), contextuele aanwijzingen (drukzone, beschikbaarheid van inhaalstroken) en tijdstempels van het evenement. Ten tweede identificeerde een disagree-detection-script automatisch gevallen van ambiguïteit of conflict, die vervolgens werden beoordeeld in een gezamenlijke consensusvergadering. Ten derde, om consistentie te waarborgen in het markeren van evenementgrenzen en temporele uitlijning tussen modaliteiten, werd een laatste ronde uitgevoerd door een onafhankelijke senior analist. Dit proces, voor latere modeltraining, zorgde ervoor dat elke annotatie traceerbaar was en van de beste kwaliteit.

Preprocessing

Terwijl de huidige studie met 500 multimodale sequenties is uitgevoerd, was de preprocessing-pijplijn ontwerp opgezet voor grootschalige datasets. Alle modaliteiten ondergingen geautomatiseerde scripts die parallel videoframes batch-extraheerden, audio resampleden, positionele gegevens interpoleerden en z-score normalisatie toepasten. De aanwezigheid van een modulaire architectuur maakt het mogelijk dat elke modaliteit onafhankelijk vooraf wordt verwerkt op aparte GPU/CPU-threads. Dit maakt het mogelijk om wedstrijdbeelden op hoog volume te consumeren. Dit zorgt ervoor dat de workflow eenvoudig kan worden opgeschaald naar volledige seizoensdatasets zonder handmatige tussenkomst en maakt het framework geschikt voor implementatie in de praktijk in professionele analyseomgevingen.

Om tactische besluitvorming in teamsporten goed te onderzoeken, moeten ruwe gegevens van verschillende modaliteiten – zoals videoclips, audiosignalen en positieopnames – vooraf worden verwerkt en afgestemd. De multimodale invoerillustratie is

Vergelijking 1(1)

Hier wordt V aangeduid als een reeks videokenmerken die uit de CNN-encoder zijn gehaald.

Vergelijking 2(2)

Hier is A een audio-karakteristiek die wordt gecodeerd door wave2vec.

Vergelijking 3(3)

P vertegenwoordigt de coördinatenpositie van een speler op tijdstip ti.

Om asynchrone bemonsteringsfrequenties te beheersen, wordt elke modaliteit opnieuw gesampled of geïnterpoleerd naar een gedeelde tijdlijn:

Vergelijking 4(4)

Hier Vergelijking 5is een gesynchroniseerde karakteristiek ft , is de snelheid van het gecombineerde frame, Xm is een beginindicatie.

Voor uniforme schaal over modaliteiten zijn alle featurevectoren z-score genormaliseerd:

Vergelijking 8(5)

μX en σX duiden het gemiddelde en de standaardafwijking van de kenmerkdimensie in de trainingsset aan.

Hoewel de belangrijkste zorgen passen en drive beslissingen zijn, zijn audiokanalen (bijvoorbeeld speler/coach-communicatie, omgevingsspelaanwijzingen) toegevoegd om rekening te houden met situaties waarin spraaksignalen de tactische reactie beïnvloeden. Hyperparameters (bijv. leersnelheid, epochs) werden gekozen via rasterzoektocht en bestaande evaluaties in multimodaal leren, waarbij een balans werd gevonden tussen convergentiestabiliteit en rekenkundige efficiëntie.

De hyperparameters van het voorgestelde kader – leersnelheid, batchgrootte en trainingstijdperken – werden gekozen via een goed geplande systematische rasterzoektocht om zowel convergentiestabiliteit als rekenefficiëntie te bereiken. De keuze voor een leersnelheid van 0,0001 met de Adam-optimizer bleek stabiele updates van de gradiënt te bieden zonder oscillaties, terwijl batchgroottes werden geoptimaliseerd om de GPU-geheugencapaciteit in balans te brengen tegen trainingsdoorvoer. De instelling van 50-100 epochs werd gebruikt om adequaat leren mogelijk te maken zonder overfitting, zoals bevestigd door validatieverliestracking en 10-voudige kruisvalidatie. Deze waarden werden niet willekeurig vastgesteld, maar werden geleid door eerdere tests in multimodaal leren en aangepast door experimentele proeven op de huidige dataset. Dit rigoureuze proces garandeerde dat de geselecteerde hyperparameters stabiele modeltraining en reproduceerbare verbeteringen in prestaties ten opzichte van basisbenaderingen mogelijk maakten.

Hoewel de classificatietaak zich richt op pass/drive/hold-beslissingen, is audio-informatie bewust toegevoegd omdat echt tactisch gedrag in football sterk wordt beïnvloed door de communicatie tussen speler en coach, cues van teamgenoten, druksignalen en omgevingsgeluiden (bijv. balcontact, aanpak van de tegenstander). Deze aanwijzingen gaan vaak vooraf aan of komen samen voor met besluitvorming en maken deel uit van de natuurlijke perceptuele omgeving van voetballers. Voorlopige ablatie-experimenten toonden aan dat het uitsluiten van audio de herinnering met 3,8% verminderde, wat aangaf dat zelfs subtiele akoestische signalen bijdragen aan contextbewustzijn. Om deze reden werd audio behouden om de ecologische validiteit te behouden en het vermogen van het model te verbeteren om te generaliseren naar echte matchcondities.

Inderdaad, ter verdere ondersteuning van deze hyperparameters werd een interne gevoeligheidsanalyse uitgevoerd door systematisch de leersnelheid te variëren van 1e-5 naar 5e-4, de batchgrootte van 8 tot 32, het aantal transformatorlagen van 4 naar 8, en het aantal aandachtskoppen van 4 tot 12. De gekozen configuratie, met een leersnelheid van 1e-4, een batchgrootte van 16 en een 6-laag encoder met 8 aandachtshoofden, leverde continu stabiele convergentie op met het laagste validatieverlies, waardoor overfitting bij 10-voudige kruisvalidatie werd geminimaliseerd. Grotere batchgroottes resulteerden in gradiëninstabiliteit, terwijl kleinere batches de ruis verhoogden en de convergentie vertraagden. Evenzo lieten transformatormodellen met meer dan 8 koppen geen prestatieverbetering zien, maar ze verhoogden wel aanzienlijk de rekentijd. De verkregen resultaten rechtvaardigen de uiteindelijke instellingen van hyperparameters die in deze studie zijn gebruikt.

Feature-extractie met behulp van een 3D convolutioneel neuraal netwerk

In het voorgestelde Transformer-Based Multimodal Fusion framework voor tactische beslissingen in teamsporten is het 3D Convolutional Neural Network (3D CNN) verantwoordelijk voor het extraheren van ruimtelijk-temporele kenmerken uit ruwe videoclips.

In tegenstelling tot 2D-CNN's, die alleen ruimtelijke afmetingen (breedte W en hoogte H) meenemen, houden 3D-CNN's ook rekening met de temporele dimensie R, waardoor ze bewegingsdynamiek en sequentiële patronen kunnen detecteren die cruciaal zijn voor het begrijpen van teamgedrag, zoals het aansturen en passen in voetbal.

De 3D-CNN28 wordt voor het eerst voorgesteld om de ruimtelijke en temporele informatie van videodata te combineren. Een 3D-kernel wordt gebruikt in een 3D-convolutie-algoritme voor een kubus die bestaat uit frames waarvan een deel van de kolommen gestapeld is. De 3D-convolutie kan worden geschreven in Eqn (6)

Vergelijking 11(6)

Waarbij: Vergelijking 12 is de uitvoerfunctie op locatie (x, y, z) op de j-de featuremap van de l-de laag.Vergelijking 14 is het gewicht van de kernel op locatie (h,w,r) vanaf de mth inputfeaturemap. Vergelijking 16 is de input op ruimtelijk-temporele offset ten opzichte van de voorgaande laag. blj is de bias. f(.) is de activatiefunctie (meestal ReLU). M is het aantal invoer-feature maps van de voorgaande laag. Deze vergelijking maakt het mogelijk dat het 3D-CNN de ruimtelijke (hoogte en breedte) en temporele (framesequentie) informatie parallel combineert.

Figuur 4
Figuur 4. 3D CNN-verwerkingsarchitectuur. Illustreert hoe ruimtelijke en tijdelijke kenmerken worden geëxtraheerd uit videosequenties met behulp van 3D-convolutionele operaties. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4 toont het werkproces van een 3D-CNN. De pijplijn begint met de invoerfase, waarin onbewerkte videostromen van een voetbalwedstrijd worden samengevoegd met georganiseerde data, waaronder spelerslocaties, wedstrijdstatistieken en contextuele metadata. Deze multimodale informatie behoudt zowel visuele dynamiek als situationele context, die cruciaal zijn voor teamtactiekanalyse. Vervolgens wordt de videostroom geleid door een 3D Convolutioneel Neuraal Netwerk (3D CNN). In dit geval wordt een reeks 3D-convolutionele lagen gebruikt op de invoerframes. De lagen verbinden zich met de ruimtelijke dimensies (hoogte en breedte) en de temporele dimensie (frames), waardoor het netwerk bewegingspatronen, spelersinteracties en sequentie-gebaseerde tactieken, zoals passes of drives, kan leren. Vervolgens wordt een featurekubus gevormd met dichte ruimtelijke en temporele kenmerken. Deze kubus wordt onderworpen aan pooling-operaties om de afmetingen te verkleinen terwijl belangrijke kenmerken behouden blijven. Bij pooling wordt het featurevolume afgevlakt tot een 1D-vector, wat een beknopte weergave van de tactische situatie geeft. Deze featurevector wordt vervolgens ingevoerd in een volledig verbonden Deep Neural Network (DNN). De DNN is het besluitvormingsblok, dat de samengevoegde en geëxtraheerde functies verwerkt om tactische beslissingen te nemen, zoals passen, schieten of vasthouden. De output van het netwerk is de uiteindelijke tactische beslissing die het systeem neemt, gebaseerd op de daadwerkelijke spelsituatie in realtime en geleerde strategische patronen.

Embedding en uitlijning van multimodale inputs

Na het extraheren van de functie worden de drie kenmerken, zoals audio, video en statistische positie van de speler, gegeven als invoermodaliteit.

Om deze in een transformator in te voeren en vervolgens elk van hen door een leerbare embeddingfunctie te voeren:

Vergelijking 19(7)

waarbij f3DCNN ruimtelijke kenmerken van elke tijdslice Vt leert en deze afbeeldt naar een d-dimensionale latente ruimte.

Vergelijking 22(8)

waarbij WP en bP leerbare gewichten zijn.

Vergelijking 25(9)

Alle inbeddingen zijn uitgelijnd volgens de temporele dimensie T. Als de modaliteiten verschillende frequenties hebben, wordt interpolatie of downsampling gebruikt:

Vergelijking 26(10)

Nu zijn alle modaliteiten gesynchroniseerd als:

Vergelijking 27(11)

Om de temporele orde in de transformator te behouden, introduceer ook positionele coderingen aan elke vector:

Vergelijking 28(12)

Waar Vergelijking 29 de standaard sinusvormige of leerbare positionele codering vertegenwoordigt.

Elke modaliteit wordt operationeel gecodeerd met behulp van een PyTorch-lineaire laag, gekoppeld tot een 512-d vector, en vervolgens gevoed in de transformator-invoervolgorde na positionele codering. Dit garandeert dat een unified embedding wordt voorbereid voor kruisaandacht bij elke tijdstap.

De eindtensor is

Vergelijking 30(13)

wordt gevoed in de Transformer Encoder, waar de zelf-aandacht en cross-modale aandachtmechanismen het model in staat stellen gezamenlijk te redeneren over alle modaliteiten voor tactische besluitvorming.

Transformator-gebaseerde multimodale fusie

In de voorgestelde aanpak wordt de laag-rang matrixfactorisatiemethode gebruikt om de verkregen multimodale datavectoren te integreren. Het hoogdimensionale probleem dat optreedt wanneer tensoren direct worden gefuseerd, wordt met deze methode aangepakt, waarbij een laag-rang decompositiefactor wordt gebruikt voor tensorfusie29. Elke modaliteit wordt aanvankelijk uitgedrukt als een vector, en dimensionaliteitsreductie die significante interacties behoudt, wordt bereikt met behulp van laag-rang decompositie. De fusietensor ZM onder M-modaliteiten is opgebouwd als:

Vergelijking 32(14)

Hier: Vergelijking 33 is de laag-rang factor van de m-de modaliteit, Vergelijking 60 is het buitenste product, en r is de ontbindingsrang.

De fusievector h wordt dan berekend als:

Vergelijking 34(15)

Wanneer twee modaliteiten afzonderlijk worden gebruikt, is de gereduceerde fusie:

Vergelijking 35(16)

Dit levert een gezamenlijke multimodale representatievector h op die interacties tussen modale bewegingen op latent niveau modelleert.

Na de verwerving van de laag-rank fused vector h modelleert de Transformer-module afhankelijkheden en lijnt semantische representaties tussen modaliteiten uit. Een cross-modale aandacht is speciaal ontworpen om de ene modaliteit in staat te stellen aandacht te besteden aan een andere:

Vergelijking 36(17)

Waarbij Qm de modaliteit m vraag, Kn,V n de sleutel- en waardevectoren zijn in modaliteit n, dk is de dimensie van de sleutelvectoren. Deze opzet faciliteert modaliteitsspecifieke aandachtsstromen, waardoor elke categorie input kan worden verwerkt ten opzichte van andere (bijvoorbeeld het synchroniseren van spelersbeweging met de spelcontext en video-indicatoren).

De kruisbewaakte vectoren worden gestapeld en geclassificeerd via een Multilayer Perceptron (MLP). De output is een tactisch beslissingslabel (bijv. pass, drive, hold), kruis-entropieverlies geoptimaliseerd voor end-to-end training.

Figuur 5
Figuur 5. Transformator-gebaseerde multimodale fusiearchitectuur. Toont hoe visuele en sensormodaliteiten worden geïntegreerd via een transformatorencoder om de weergave van kenmerken te verbeteren. Klik hier om een grotere versie van deze figuur te bekijken.

Het multimodale fusieblok, zoals geïllustreerd in Figuur 5, combineert visuele en positionele input. Het is een noodzakelijk ontwerp omdat tactische beslissingen ruimtelijk inzicht en bewegingsdynamiek vereisen, die niet door één modaliteit kunnen worden weergegeven.

Figuur 5 toont de werkstructuur van Transformer-gebaseerde Multimodale Fusie. Dit ontwerp combineert diverse data, video, ruimtelijke coördinaten en game-contextuele data in één kanaal om tactische acties zoals passeren, rijden of vasthouden te voorspellen. De aanpak begint met het invoeren van video's, die worden gecontroleerd met behulp van een 3D Convolutioneel Neuraal Netwerk (3D CNN). Dit systeem identificeert zowel ruimtelijke als temporele structuren in video, waardoor het dynamische spelersactiviteit en communicatie in de loop van de tijd kan vastleggen. Ondertussen worden contextuele en positionele informatie overgebracht door inbeddinglagen, waarbij gestructureerde invoer wordt omgezet in dichte vectorrepresentaties. De contextuele, positionele en videostreams kunnen vervolgens worden samengevoegd met een Low-Rank Fusion-module. De benadering verkrijgt effectief cross-modale correlaties via fusieruimtedecompositie, waarbij de computationele complexiteit wordt geminimaliseerd terwijl essentiële relaties tussen modaliteiten behouden blijven. Ten slotte wordt de gefuseerde multimodale representatie verwerkt door een Transformer Encoder met cross-modale aandacht. Deze procedure stelt het model in staat zich te richten op de juiste kenmerken over modaliteiten en tijdsstappen heen, waardoor het begrip van strategisch spelgedrag wordt vergroot. Ten slotte wordt de gecodeerde uitvoer door een concatenatie en een Multi-Layer Perceptron (MLP)-blok gestuurd dat de geleerde representatie koppelt aan enkele tactische beslissingen. De modeloutput classificeert spelersacties zoals "pass", "drive" of "hold" om intelligente, datagedreven analyse van teamtactieken mogelijk te maken.

In het voorgestelde Transformer-Based Multimodal Fusion tactische analysesysteem voor teamsporten is de laatste fase tactische beslissingsclassificatie en -beoordeling, waarbij geleerde multimodale representaties worden omgezet in beslissingsgerichte labels. Nadat video-, positie- en contextuele features zijn samengevoegd door low-rank fusie en deze fijn zijn afgestemd met cross-modale aandacht in de Transformer-encoder, worden de resulterende featurevectoren ingevoerd in een Multi-Layer Perceptron (MLP) classifier. Elke beslissingsklasse wordt weergegeven met een softmax-activatiefunctie, die kansscores oplevert voor alle mogelijke acties. De meest waarschijnlijke klasse wordt gekozen als de voorspelde beslissing van het model. Het model is getraind op een cross-entropie verliesfunctie, die correcte voorspellingen beloont en het netwerk leert onderscheid te maken tussen vergelijkbare verschillen in tactische situaties. Daarnaast kan tijdsdomeinevaluatie worden overwogen om de responsiviteit in realtime of bijna-realtime spelsituaties te bevestigen, zodat de classifier nauwkeurig is en ook geen tijdverspilling is onder spelachtige tijdsbeperkingen. Tabel 2 toont de modelarchitectuur en hyperparameters.

ComponentSpecificatie
Transformatorencoderlagen6
Aandacht Hoofden8
Verborgen Dimensie512
Feed-forward laaggrootte2048
Inbedding van AfmetingenVideo: 1024 → 512, Audio: 256 → 512, Positie: 128 → 512
Positionele coderingLeerbaar
FusiemethodeLow-Rank Multimodale Fusie (rang r = 16)
OptimizerAdam
Leertempo0.0001
Batchgrootte16
Opleidingsperiodes50–100
Uitval0.1
VerliesfunctieKruis-entropie

Tabel 2: Modelarchitectuur en hyperparameters. Geeft een overzicht van trainingsinstellingen en belangrijke componenten van het voorgestelde transformator-gebaseerde multimodale fusiemodel.

Voor verdere duidelijkheid en reproduceerbaarheid werd de multimodale transformator geïmplementeerd met een 6-laag encoderstack, elk uitgerust met 8 aandachtskoppen en een verborgen dimensie van 512, volgens de typische transformatorinstellingen voor middelgrote multimodale taken. Elke modaliteit gaat door een embeddingblok: video via een 3D-CNN encoder output, 1024-dim; audio door een Wave2Vec-gebaseerde encoder, 256-dim; en positionele plus contextuele kenmerken door een 2-laag MLP-encoder, 128-dim. Al deze embeddings werden geprojecteerd op een gedeelde latente ruimte van 512 dagen via leerbare lineaire transformaties. Om temporele uitlijning vast te stellen, worden alle modaliteiten eerst geïnterpoleerd op een enkele frequentie van 25 Hz, gevolgd door het toepassen van aangeleerde positionele coderingen om temporele ordening te behouden. Cross-modale uitlijning wordt uitgevoerd met behulp van de cross-attention lagen, die expliciet correlaties tussen modaliteiten leren voordat ze worden ingevoerd in de zelf-aandacht encoder stack. Deze architecturale keuzes zijn gemaakt om modelcapaciteit in balans te brengen met rekenefficiëntie, waardoor stabiele convergentie op een matig grote dataset wordt gegarandeerd.

In praktische termen is het voorgestelde Transformer-Based Multimodal Fusion-framework het meest geschikt voor scenario's waarin gesynchroniseerde multimodale data beschikbaar zijn, zoals gestructureerde trainingssessies, gecontroleerde wedstrijdsimulaties of professionele omgevingen uitgerust met consistente videofeeds en positionele trackingsystemen. De vier belangrijkste invoer die voor de methode nodig is, zijn (i) video met hoge resolutie, (ii) positionele trackinggegevens (GPS/LPS), (iii) audiostreams en (iv) contextuele metadata—bijvoorbeeld bezit, drukzones, matchfase. Om betrouwbare prestaties te bereiken, moeten deze modaliteiten tijdsgebonden zijn met minimale drift (video ≥ 25 fps en positiesensoren ≥ 10 Hz), en moeten stabiele standpunten en minimale signaalruis behouden. Die instellingen die deze gesynchroniseerde inputs niet bieden, bijvoorbeeld amateurwedstrijden met onregelmatige camerahoeken, live uitzendingen met latentie-/compressie-artefacten, of een omgeving zonder positionele trackinginfrastructuur, zullen minder relevant zijn voor het framework. Bovendien presteert het huidige systeem het beste onder semi-gecontroleerde omstandigheden, maar kan het aanzienlijk minder robuust zijn in volledig ongecontroleerde live-wedstrijdsituaties, waar lichtomstandigheden, occlusie en dynamische geluidsruis van het publiek de kwaliteit van gegevensverzameling beïnvloeden. Deze beperkingen schetsen de praktische grenzen waarbinnen dit systeem kan worden ingezet en benadrukken dat consistente gegevensverzameling in meerdere modi essentieel is bij het toepassen van het voorgestelde model.

Aanpassingen en probleemoplossing

In de praktische implementatie kunnen er verschillende problemen ontstaan in de multimodale pijplijn die de modelstabiliteit of algehele prestaties kunnen verminderen. Een veelvoorkomend probleem is temporele misalignment tussen modaliteiten, waarbij video opgenomen met 25 fps en positiegegevens die bij 10 Hz zijn vastgelegd uit sync raken, wat leidt tot mismatched cues die de aandachtskaarten destabiliseren en het geheugen verminderen. Dit kan worden opgelost door tijdstempelgebaseerde resampling, lineaire interpolatie toe te passen en automatisch reeksen met overmatige drift te verwijderen. Audiokanalen kunnen ook last hebben van ruis veroorzaakt door wind, geluiden van het publiek of microfoonclipping, waardoor de transformator audiotokens negeert en de precisie iets verlaagt. Het toepassen van banddoorlaatfiltering, spectrale gating en het vervangen van ernstig beschadigde segmenten met nulvectoren helpt de stabiliteit van audio-embedding te behouden. Visuele kwaliteitsproblemen, zoals spelerverstoppingen of bewegingsonscherpte, kunnen de ruimtelijke en temporele representaties van de 3D-CNN verzwakken en de verwarring tussen pass-drive vergroten. Dit wordt gecompenseerd door sterk verstopte sequenties uit te sluiten en augmentatiestrategieën toe te passen, waaronder willekeurige cropping, helderheidsnormalisatie en motion-blur simulatie. Transformatorinstabiliteit kan optreden als embeddingschalen verschillen tussen modaliteiten, wat oscillerende validatieverlies of gradiëntpieken veroorzaakt. Het waarborgen van consistente z-score normalisatie, het gebruik van een opwarming-up leersnelheidsschema, het toepassen van gradient clipping en het verhogen van de dropout kan de stabiele training herstellen. Low-rank fusie kan ook problematisch worden wanneer de fusierang verkeerd is ingesteld, wat leidt tot vervormde cross-modale relaties en klassegewijze onevenwichtigheid. Het handhaven van een matige rang voor kleine datasets, het verhogen van de rang voor grotere datasets en het toepassen van L2-regularisatie helpen om gebalanceerde fusie te behouden. Computationele knelpunten kunnen ontstaan door grote videotensoren die GPU-geheugenoverloop of trage training veroorzaken. Deze problemen kunnen worden aangepakt door mixed-precision (FP16) training, waarbij de inputresolutie tijdens vroege experimenten wordt verminderd, of vooraf berekende 3D-CNN-functies worden gecached. Ten slotte kan de natuurlijke klassenonbalans in tactische beslissingen, vooral voor "Drive," de terugroepactie verminderen en schommelingen in AUC veroorzaken; Het toepassen van klasse-gebalanceerd verlies, het oversampling van minderheidsacties en het verrijken van contextuele metadata kan de discriminatie van balans en beslissingen aanzienlijk verbeteren. Deze geconsolideerde probleemoplossingsrichtlijnen zorgen ervoor dat onderzoekers en praktijkmensen stabiele trainingsomstandigheden kunnen behouden, reproduceerbaarheid kunnen verbeteren en het framework effectief kunnen aanpassen over diverse datasets en omgevingen.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit ontwerp combineert diverse data, video, ruimtelijke coördinaten en wedstrijdcontextuele data in één kanaal om tactische acties zoals passen, rijden of vasthouden te voorspellen. De aanpak begint met het invoeren van video's, die worden getest met behulp van een Driedimensionaal Convolutioneel Neuraal Netwerk (3D CNN). De contextuele, positionele en videostreams kunnen vervolgens worden samengevoegd met een Low-Rank Fusion-module. De benadering verkrijgt effectief cross-modale correlaties via fusieruimtedecompositie, ...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Het hier gepresenteerde Transformer-Based Multimodal Fusion-framework vormt een belangrijke ontwikkeling ten opzichte van de basislijn Stroop Task Football Test (STFT) die in het basisartikel wordt beschreven. In tegenstelling tot het basisartikel, dat zich richtte op gecontroleerd, laboratoriumgericht testen met beperkte en statische prikkels zoals gekleurde pijlen en vooraf gedefinieerde taken (rijden of inhalen), werkt het nieuwe model vanuit realgame, multimodale brondata om een rijk...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hoeven geen belangenconflicten aan te geven.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs erkennen dankbaar de steun van de School of Physical Education van Beibu Gulf University en de School of Statistics van Southwestern University of Finance and Economics voor het bieden van middelen en institutionele ondersteuning tijdens dit onderzoek. Dit werk werd ook ondersteund door het 2023 National Social Science Fund Project: Onderzoek naar het Effectief Gebruik van Rode Sportculturele Hulpbronnen in het Zuo jiang–You jiang Oude Revolutionaire Basisgebied (Subsidie nr. 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D CNNCustom implementatieSpatiotemporale functie-extractie uit video
GoPro Hero4GoPro Inc.https://gopro.com/Video-opname van wedstrijden
GPS/IMU-sensorenCatapult Sports / Xsenshttps://www.catapultsports.com/Positionele tracking van spelers
Intel Core i7-11700K CPUIntelhttps://www.intel.comCPU voor modeltrainingswerkstation
Librosalibrosa.orghttps://pypi.org/project/librosa/Audiosignaalverwerking en hersampling
MLP-classifierPyTorch / TensorFlowTactische beslissingsclassificatie
NumPyPython Software Foundationhttps://pypi.org/project/numpy/Numerieke berekening en matrixbewerkingen
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comDeep learning training en inferentie
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Frame-extractie uit video
pandasPython Software Foundationhttps://pypi.org/project/pandas/Gegevensmanipulatie en tabelverwerking
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Dimensionaliteitsreductie
Python 3.9Python Software Foundationhttps://www.python.org/downloads/release/python-390/Programmeertaal-omgeving
PyTorchPyTorch Foundationhttps://pytorch.org/Deep learning-framework
scikit-learnscikit-learn-ontwikkelaarshttps://pypi.org/project/scikit-learn/Kruisvalidatie, ICC-berekening
TensorFlow 2.8Googlehttps://www.tensorflow.org/Deep learning-framework
Transformer EncoderPyTorch / TensorFlowMultimodale functie-integratie met aandacht
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Besturingssysteem voor modeltraining
WerkstationCustom / Intel, NVIDIACPU, GPU, RAM voor modeltraining

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles