Research Article

Un quadro multimodale basato su trasformatori per l'analisi tattica delle decisioni negli sport di squadra con applicazione al calcio

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Per migliorare la categorizzazione delle decisioni tattiche nel football, questo studio suggerisce un modello di fusione multimodale basato su Transformer che incorpora dati visivi, di posizione, acustici e contestuali. Il modello raggiunge prestazioni quasi in tempo reale su un dataset multimodale di 500 sequenze, superando le linee di base CNN-LSTM, BiLSTM-Attention e GNN in termini di accuratezza e errata classificazione indotta dalla pressione.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nel calcio moderno è richiesta una decisione tattica rapida e accurata. Tuttavia, gli approcci tradizionali per la valutazione del processo decisionale tattico hanno scarsa validità ecologica e non si scalano facilmente. Per affrontare queste sfide, questo articolo introduce un modello di Fusione Multimodale Basato su Transformer che incorpora posizionamento del giocatore, video, audio e metadati contestuali per classificare le decisioni tattiche in tempo reale. Sono stati condotti esperimenti con 40 giocatori maschi e un dataset comprendente 500 sequenze di giochi multimodali. Il dataset di 40 giocatori si riferisce a esperimenti decisionali controllati in laboratorio utilizzati per la validazione iniziale e una valutazione dell'affidabilità. Successivamente, sono state estratte 500 sequenze multimodali da simulazioni estese di partite e registrazioni di partite reali per fornire il dataset più ampio utilizzato nell'addestramento e nei test del modello multimodale del trasformatore.

Elabora gli input in cinque fasi: acquisizione dati, pre-elaborazione, estrazione delle caratteristiche, fusione basata su trasformatore e classificazione decisionale. Rispetto alle linee di base di CNN-LSTM, BiLSTM-Attention e GNN, l'approccio proposto migliora l'accuratezza della previsione decisionale del 28% e riduce la classificazione errata causata dalla pressione del 41%, con una bassa latenza di inferenza di 52,6 ms, rendendolo adatto ad applicazioni quasi in tempo reale. La generalizzazione dei risultati in contesti tattici più diversi e a una demografia più ampia degli atleti è inoltre limitata dalla dimensione relativamente piccola e dall'omogeneità all'interno della popolazione campionaria di giovani giocatori maschi provenienti da una sola regione. Questi risultati sottolineano il contributo della fusione multimodale basata su trasformatori all'analisi decisionale tattica automatizzata e evidenziano la necessità di una ulteriore validazione in situazioni di match più diverse e su larga scala.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli sport di squadra, come il calcio, richiedono decisioni tattiche rapide in ambienti dinamici e incerti. I giocatori devono leggere costantemente le informazioni visive della palla, dei compagni e degli avversari, e rispondere entro frazioni di secondo per assicurarsi un vantaggio competitivo. Il processo decisionale tattico nel football dipende fortemente dalla percezione rapida dei movimenti dei giocatori, della traiettoria della palla e dei segnali situazionali. Sebbene le abilità percettivo-cognitive generali, come il tempo di reazione e l'attenzione selettiva, influenzino effettivamente la performance, ricerche recenti hanno enfatizzato modelli guidati dai dati e consapevoli del contesto che possono approssimare la cognizione tattica reale in gioco 1,2,3,4,5. Il tempo di reazione e le capacità percettive, come le capacità cognitive, giocano anch'essi un ruolo cruciale nellaperformance 6,7,8. Ricerche recenti nella cognizione sportiva hanno stabilito che il processo decisionale tattico si basa non solo sulle abilità percettive, ma anche sulla capacità dell'atleta di integrare informazioni spaziali dinamiche, pressione degli avversari e segnali contestuali di gioco in tempo reale. Le ricerche sull'expertise percettivo-cognitiva suggeriscono che i giocatori tatticamente più alfabetizzati riconoscono i segnali più rapidamente, assimilano le informazioni in modo più efficiente e mostrano schemi decisionali più stabili sotto pressione. Tali risultati supportano la necessità di modelli computazionali in grado di catturare la natura complessa e multilivello dei processi decisionali sportivi.

I metodi classici per valutare il processo decisionale tattico spesso impiegano compiti di laboratorio controllati e giudizi esperti soggettivi, che impongono vincoli significativi alla validità ecologica e alla scalabilità. I recenti progressi nel deep learning offrono il potenziale per automatizzare il processo attraverso l'uso di fonti di dati multimodali - come video, tracciamento posizionale e metadati di corrispondenza contestuale - all'interno di architetture di cattura delle dipendenze temporali e cross-modali. Nonostante questo progresso, la maggior parte dei modelli attuali si basa ancora su modelli di Reti Neurali Convoluzionali-Long-Short Term o Bidirectional Long-Short Term Memory (CNN-LSTM o BiLSTM), che hanno una capacità limitata di modellare dipendenze a lungo raggio tra modalità. Questa carenza è la forza trainante dietro lo sviluppo di modelli multimodali di fusione basati su trasformatori, meglio attrezzati per modellare il processo decisionale tattico in modo più completo e stabile negli scenari di football. Nello sport di squadra oppositivo del calcio, ad esempio, i giocatori devono valutare rapidamente le informazioni sulla palla, inclusi compagni di squadra, avversari e posizione sul campo. Prima di decidere la migliore linea d'azione in base alle loro capacità, alle indicazioni dell'allenatore e alle circostanze dellapartita 9,10. Grazie all'accessibilità di dataset organizzati e componenti tattiche definite, questo studio si concentra esclusivamente sul football; tuttavia, i principi tattici per prendere decisioni sono applicabili a numerosi sport di squadra.

Infatti, studi precedenti indicano che CNN-LSTM e BiLSTM non possono catturare dipendenze temporali a lunga distanza utilizzando un campo ricettivo fisso o venendo limitati da gatingsequenziale 11,12,13. Analogamente, i lavori di riferimento fondamentali nel riconoscimento dell'azione e nella modellazione temporale multimodale rivelano che le prestazioni dei modelli basati su LSTM diminuiscono con l'aumento della lunghezza della sequenza o quando i segnali contestuali si verificano a diversi fotogrammi di distanza, il che può limitare la validità ecologica in contesti sportivi dinamici. Inoltre, i modelli basati su Reti Neurali a Grafo (GNN) sono strumenti potenti per la modellazione dell'interazione spaziale, ma hanno costantemente avuto scarso rendimento in scenari che richiedono un ragionamento temporale dettagliato o in casi in cui i segnali di pressione contestuali si spostano rapidamente nel tempo14,15. A differenza di questi approcci, i framework più recenti basati su transformer dimostrano la loro superiorità nelle prestazioni nell'analisi sportiva, nel riconoscimento dell'attività umana e nei compiti video-linguaggio attraverso l'integrazione congiunta di segnali temporali a lungo raggio, relazioni spaziali e segnali contestuali in un unico passaggio in avanti, resa possibile dall'attenzione globale di sé. Tali risultati giustificano la scelta di un'architettura basata su trasformatori come spina dorsale per il modello proposto nello studio attuale.

Migliorare la conoscenza tattica e comprendere i principi tattici si è dimostrato cruciale per risolvere i vincoli e le problematiche delgioco 16,17. I giocatori di football imparano una varietà di elementi di gioco, tra cui penetrazione, protezione offensiva, movimento, tempo, limitazione, protezione difensiva, bilanciamento e concentrazione, attraverso l'addestramentotecnico-tattico 18. Man mano che i giocatori acquisiscono più esperienza nel football, la loro comprensione dei fondamenti tecnici e tattici dovrebbe aumentare. I giocatori possono quindi essere in grado di distinguere più facilmente i segnali pertinenti, facilitando il processo decisionale appropriato per ogni regola di gioco in uno scenarioparticolare 19. Per questo motivo, i giocatori possono utilizzare la loro efficienza motoria e le capacità decisionali per integrare i modelli di movimento con talenti specializzati.

L'autore ha utilizzato il processo decisionale su più attributi per analizzare i benefici fisici dell'esercizio e delle abitudini, illustrando l'efficacia della capacità di allenamento qualificato nell'educazione fisica tra gli studenti universitari. L'attività fisica efficace, lo sviluppo di abitudini di fitness sane e la promozione di riforme nel modo in cui lo sport viene rappresentato nelle istituzioni educative ricevono tutti un peso considerevole. La Media Heroniana Intuitiva a Peso Confuso (IFWHM) con assistenza ai numeri fuzzy viene utilizzata per decisioni efficaci. L'esito ha supportato il successo cognitivo degli studenti universitari e ha dimostrato una valutazione più accurata dei loro problemi di benessere fisico. Per rilevare i collegamenti latenti nei dati, ilricercatore 20 ha utilizzato il metodo Apriori aumentato. Le conclusioni della ricerca sono pertinenti alle valutazioni della salute fisica degli studenti nell'istruzione superiore. Il primo esito viene determinato valutando la fatica delle diverse orientazioni in base alla frequenza di occorrenza.

Ricerche precedenti basate sull'IA nell'analisi sportiva si sono concentrate su compiti di visione artificiale, tra cui il rilevamento dei giocatori, il tracciamento e il riconoscimento delle attività di gruppo. Recenti architetture debolmente supervisionate e prive di rivelatori hanno rivelato l'importanza della modellazione multimodale e consapevole del contesto nella comprensione dei comportamenti tattici. Questi progressi richiedono l'integrazione del deep learning multimodale per classificare le decisioni tattiche nel calcio. Utilizzando vettori di caratteristiche latenti prodotti dalla matrice di utilità tramite fattorizzazione matriciale, calcola la somiglianza coseno tra utenti e utenti o tra oggetti e elementi in questo articolo.

Le ricerche recenti nell'analisi sportiva si sono spostate verso framework di deep learning multimodali e consapevoli del contesto che combinano video, dati posizionali e segnali contestuali per interpretare il comportamento tattico. Vari approcci basati su transformer hanno dimostrato una forte capacità nel modellare la struttura temporale a lungo raggio e le relazioni intermodali in ambienti sportivi, inclusi i seguenti: MM-ViT per il riconoscimento multimodale delle azioni, trasformatori a fusione contrastiva unificati per il ragionamento contestuale sportivo e rivelatori di eventi guidati dall'attenzioneincrociata 21,22. Questi approcci evidenziano che le decisioni tattiche sono meglio rappresentate tramite architetture che catturano le interazioni tra attori, spazio, segnali di movimento e informazioni contestuali, piuttosto che con modelli CNN-LSTM monomodali. In questa direzione, lo studio proposto utilizzerà anche un framework di fusione multimodale basato su transformer per elaborare congiuntamente segnali visivi, posizionali e contestuali per la modellazione quasi in tempo reale delle decisioni tattiche calcistiche.

I modelli precedenti per l'analisi calcistica erano tipicamente costruiti attorno all'architettura CNN-LSTM o BiLSTM, che catturano schemi temporali locali ma faticano con dipendenze a lungo raggio tra le modalità. I Transformers colmano questa lacuna applicando l'autoattenzione globale, permettendo a un modello di collegare i movimenti dei giocatori, le traiettorie della palla e i segnali situazionali attraverso capacità di finestre temporali estese per un'analisi tattica delle decisioni robuste. Per risolvere il problema della scarsità nei dati di valutazione per i sistemi di raccomandazione, l'autore23,24 ha suggerito una tecnica di Factorizzazione a Matrice Basata su Revisioni che combina filtraggio collaborativo basato su recensioni e imputazione di valutazione.

Tuttavia, la loro efficacia, la scalabilità e l'applicabilità di questi metodi sono fortemente limitate dalla loro dipendenza dalle riquadre di delimitazione per l'inferenza e dall'enorme esigenza di etichettatura dei dati. Un metodo per risolvere questo problema è usare etichette di bounding box per allenare contemporaneamente il rilevamento dei giocatori e il riconoscimento delle attività digruppo 25,26,27,28. Sebbene le annotazioni a livello di attore siano ancora necessarie per i dati di addestramento, il metodo proposto calcola le riquadre delimitanti dei giocatori durante l'inferenza. L'approccio Weakly Supervised Group Activity Recognition (WSGAR), che non richiede etichette a livello di attore per la formazione o l'inferenza, mira ad alleviare il carico di annotazione. Dopo aver generato suggerimenti di bounding box utilizzando un rivelatore pre-addestrato su un dataset esterno, hanno imparato a filtrare i rilevamenti irrilevanti. Recentemente29, i ricercatori hanno presentato un approccio senza rivelatori per la sfida WSGAR che utilizza embedding di token per generare contesti parziali che raccolgono informazioni sui giocatori.

All'interno dell'analisi sportiva, le architetture multimodali e basate su transformer hanno recentemente acquisito importanza perché possono catturare schemi temporali a lungo raggio e integrare flussi di datieterogenei 30,31. Varianti dei transformer sono state applicate per prevedere i movimenti dei giocatori, eseguire analisi tattiche multi-view e riconoscere l'intento d'azione, dimostrando un ragionamento temporale eccellente rispetto al modello CNN-LSTM. Le strategie di fusione multimodali, che combinano video, posizione e indizi contestuali, hanno fornito risultati incoraggianti nelle modellazioni tattiche in tempo reale e hanno evidenziato l'importanza dell'attenzione incrociata e dell'apprendimento sequenza a sequenza nella comprensione delle dinamiche decisionali in gioco.

I framework multimodali basati su Transformer hanno recentemente dimostrato prestazioni eccezionali in vari settori dove è necessaria l'integrazione di flussi di dati diversi. Ad esempio, i modelli di fusione multimodale basati su ViT sono stati utilizzati per interpretare congiuntamente informazioni video, pose e audio impiegando processi di attenzione incrociata per la previsione degli eventi consapevoli del contesto, il tracciamento del giocatore e il riconoscimento delle azioni32,33. Inoltre, l'architettura basata su MM-Former e Perceiver ha superato i modelli ricorrenti e convoluzionali nella fusione di segnali spazio-temporali, così come nel ragionamento temporale a lungo raggio, nell'analisi sportiva e nell'analisi dell'attivitàumana 34. Questi risultati supportano l'uso di un'architettura di fusione multimodale basata su Transformer in questo studio, indicando che i transformer sono in grado di catturare interazioni a grana fine tra modalità attraverso l'attenzioneglobale 35. I Transformer sono particolarmente adatti all'analisi tattica, poiché la loro attenzione globale permette al modello di collegare segnali visivi, dati posizionali e contestuali attraverso fenestra temporali più lunghe, capacità che i modelli CNN-LSTM e BiLSTM non possiedono.

Studi precedenti hanno utilizzato principalmente valutazioni manuali e autenticate per valutare la velocità delle prestazioni e l'accuratezza decisionale in attività prestabilite, come la guida e il sorpasso, nonostante il crescente interesse nella valutazione delle decisioni tattiche negli sportdi squadra 36,37,38. Questi framework hanno limiti in termini di scalabilità, obiettività e adeguatezza a circostanze dinamiche e reali, pur fornendo dati approfonditi sul comportamento dei giocatori e sull'eccellenzadecisionale 39. Approcci informatizzati basati sui dati che possono registrare e comprendere la natura multimodale del processo decisionale tattico, che coinvolge complesse associazioni tra azioni dei giocatori, segnali visivi, segnali audio e impostazioni di gioco, non sono combinati nei metodiattuali 40,41,42. Inoltre, le strutture di IA multifaccettate che possono passare da relazioni di fondo e temporali sono spesso trascurate da questi metodi. La crescita di un framework di fusione multimodale basato su Transformer che utilizzi ricche fonti di dati in tempo reale, come filmati video e tracciamento posizionale, e incorpori processi decisionali negli sport di squadra è chiaramente carente. Colmare questo divario può migliorare significativamente la penetrazione tattica, la scalabilità e l'indipendenza decisionale in ambienti sportivi ad alte prestazioni. A differenza delle attuali metodologie CNN-LSTM e BiLSTM, questa fusione basata su transformer modella consapevolmente l'attenzione cross-modale tra informazioni visive, spaziali e contestuali. Questa novità favorisce una rappresentazione tattica più densa e aiuta a ridurre la classificazione errata durante scenari di pressione di oltre il 40%.

L'obiettivo principale di questo studio è sviluppare un framework di fusione multimodale basato su Transformer per valutare il processo decisionale tattico nel football. Sebbene il quadro proposto possa essere generalizzato ad altri sport di squadra, questo studio si concentra sul football a causa della sua complessità tattica e della disponibilità di dataset strutturati. Il sistema consente una valutazione strutturata dell'accuratezza tattica e dei tempi di risposta in compiti calcistici controllati e isolati, basandosi su valutazioni di esperti. Questo lavoro affronta i limiti degli ambienti di valutazione manuale e test statici integrando fonti di dati multimodali, tra cui il tracciamento posizionale, filmati video, segnali audio e informazioni contestuali di gioco.

Impiegando processi di attenzione basati su transformer, il framework proposto apprende continuamente i collegamenti multimodali, consentendo un'interpretazione unificata e consapevole del contesto dei metodi decisionali in tempo reale dei giocatori.

L'obiettivo principale di questa determinazione è promuovere una valutazione intelligente delle prestazioni nello sport fornendo a allenatori e analisti una comprensione più profonda del pensiero dei giocatori e delle dinamiche di squadra attraverso insight basati sui dati.

Il framework proposto apprenderà continuamente le relazioni intermodali sfruttando i meccanismi di attenzione dei transformers, permettendogli di ottenere una comprensione unificata delle strategie decisionali dei giocatori nelle partite in tempo reale.

Fornisce così al sistema la capacità di fornire informazioni utili su comportamenti tattici che altrimenti sarebbe difficile da caratterizzare con metodi di valutazione standard.

L'obiettivo è migliorare l'interpretabilità e fornire a coach e analisti informazioni più utili.

Il contributo principale di questo lavoro è riportato di seguito:

Questo studio utilizza un design di fusione multimodale basato su Transformer per presentare un modello innovativo di deep learning per l'analisi tattica delle decisioni negli sport di squadra.

Attraverso l'integrazione di flussi di dati visivi, posizionali e contestuali estratti da filmati reali, questo approccio amplia significativamente l'ambito dei semplici metodi di valutazione introdotti nello studio base, che si concentrava su passaggi e azioni di penetrazione in solitaria.

L'encoder multimodale raccoglie sofisticate relazioni spaziotemporali integrando dati di tracciamento dei giocatori, fotogrammi visivi ed eventi contestuali delle partite utilizzando meccanismi di attenzione.

Esperimenti su un dataset di riferimento sul football hanno rivelato che questo modello ha superato i tradizionali parametri di base come i metodi di fusione basati su CNN e LSTM.

Rispetto a CNN-LSTM, BiLSTM-Attention e le basi GNN, l'architettura di fusione multimodale basata su trasformatori suggerita mostra guadagni significativi.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Lo studio ha coinvolto 40 calciatori maschi di età compresa tra i 18 e i 24 anni (media = 20,1 ± 1,2), reclutati da quattro club amatoriali e semi-professionistici all'interno di una stessa lega regionale. Tutti i partecipanti avevano almeno tre anni di esperienza competitiva e si stavano allenando in un ambiente strutturato. La raccolta dei dati veniva effettuata in due contesti controllati: primo, in esercitazioni standardizzate sul campo di addestramento che simulavano scenari tattici di decisione di passaggio/guida; secondo, in sessioni prolungate di simulazione di partite da cui sono state estratte sequenze multimodali. Tutte le procedure sono state approvate dal Comitato Etico Istituzionale della Beibu Gulf University (Numero di approvazione: BG-PE-2023-117) e il consenso informato scritto di tutti i partecipanti è stato ottenuto prima della raccolta dei dati. Sono stati rispettati standard etici internazionali e istituzionali nella conduzione di questa indagine. Il Comitato Etico Istituzionale dell'Università del Golfo di Beibu ha esaminato e autorizzato tutte le procedure che coinvolgono soggetti umani (Numero di approvazione: BG-PE-2023-117). Prima della raccolta dei dati, ogni partecipante forniva un consenso informato scritto e tutti i dati raccolti venivano anonimizzati prima dell'analisi.

Questo lavoro mira ad automatizzare e migliorare l'indagine sulle decisioni tattiche degli sport di squadra attraverso un'architettura Multimodal Fusion basata su Transformer. Utilizza una varietà di fonti di dati, tra cui video, audio, localizzazione spaziale e metadati del giocatore, per creare un modello predittivo in tempo reale robusto. La Figura 1 mostra l'architettura del metodo proposto. L'opera proposta è composta da cinque fasi. Le fasi sono descritte di seguito:

Figura 1
Figura 1. Architettura del metodo proposto. Schema del modello che combina input multimodali e componenti di classificazione per il processo decisionale tattico. Clicca qui per visualizzare una versione più grande di questa figura.

Acquisizione e preelaborazione dei dati

I dati di varie modalità vengono raccolti dalle registrazioni delle partite, come flussi video, commenti audio, informazioni GPS/posizionamento e indicatori di prestazione dei giocatori. Ogni modalità subisce preprocessing sotto forma di tecniche come l'estrazione dei fotogrammi (per video), il filtraggio del rumore (per l'audio) e la normalizzazione (per le letture dei sensori), garantendo la sincronizzazione nei passi temporali.

I fotogrammi video venivano estratti a 25 fps, ridimensionati a 224 × 224 di risoluzione. I segnali audio venivano processati con un filtro passa-banda, che variava da 300 a 3.400 Hz, per eliminare la maggior parte del rumore ambientale. I dati di tracciamento posizionale provenienti dai sensori GPS venivano registrati a 10 Hz e interpolati tramite interpolazione lineare basata su timestamp, assicurandosi che fossero allineati con la timeline video a 25 Hz. Tutti gli input erano allineati temporalmente usando timestamp condivisi, e le loro scale venivano normalizzate con z-scoring.

Estrazione delle caratteristiche

Per raccogliere le informazioni spaziotemporali dei dati video, si utilizzano CNN 3D. Le CNN 3D gestiscono sia informazioni spaziali che temporali tra i fotogrammi video, rendendo il modello in grado di rilevare schemi di movimento, comprendere il comportamento dei gruppi ed estrarre caratteristiche basate sul movimento. Questa operazione genera una rappresentazione densa delle caratteristiche per ogni sequenza d'azione, che viene utilizzata come input visivo al modello. Ogni clip di input video conteneva 16 fotogrammi consecutivi campionati a un passo di 2. Durante l'addestramento sono stati applicati ritaglio casuali, ribaltamento orizzontale e normalizzazione della luminosità. La CNN 3D è stata ottimizzata utilizzando Adam (lr = 0,0001), dimensione del lotto 16 e perdita di entropia incrociata.

Incorporamento e allineamento degli input multimodali

Successivamente, gli embedding di diverse modalità vengono integrati con gli output della CNN 3D. Viene impiegata un'architettura di modello a trasformatori multimodali, con vari rami di encoder che gestiscono ogni modalità. Vengono impiegati strati di attenzione incrociata per la fusione e l'allineamento delle modalità, permettendo al modello di catturare interdipendenze (ad esempio, tra le posizioni dei giocatori e il movimento della palla, e il contesto dei commenti). Questa fusione permette una comprensione contestuale arricchita delle scelte tattiche attuali. Ho anche implementato tutti gli embedding in PyTorch. Le caratteristiche video venivano proiettate linearmente da 1.024 a 512 dimensioni, mentre le caratteristiche audio e posizionali erano proiettate rispettivamente a 256 e 128 dimensioni, unificate a 512 dimensioni prima dell'allineamento temporale.

Fusione multimodale basata su trasformatori

Un Trasformatore Multimodale viene impiegato per combinare le caratteristiche estratte da tutte le sorgenti. I meccanismi di auto-attenzione nel transformer permettono al modello di apprendere le interdipendenze tra modalità (ad esempio, visiva + audio), catturare il flusso temporale e il contesto, e evidenziare frame ed eventi tatticamente importanti. Il risultato di questo passaggio è una rappresentazione combinata che cattura l'intento tattico e il contesto situazionale di ogni decisione presa. Il trasformatore multimodale era composto da sei strati di encoder, ciascuno con otto testine di attenzione. Le matrici di attenzione venivano calcolate utilizzando l'attenzione scalata a prodotto scalare. Gli strati di attenzione e feed-forward includevano anche dropout con p = 0,1 per evitare il sovrafitting.

Classificazione e valutazione delle decisioni tattiche

Infine, la rappresentazione fusa viene fornita come input a uno strato di classificazione o blocco di analisi decisionale, che viene utilizzato per prevedere il tipo di decisione tattica, valutare la qualità della decisione e, opzionalmente, generare insight spiegabili per gli allenatori tramite heatmap di attenzione o mappe di attivazione. Il risultato di questa fase fornisce una valutazione quantitativa e qualitativa delle capacità decisionali di una squadra o di un giocatore durante il match play.

La testa di classificazione utilizzava un MLP a tre strati con attivazione ReLU seguito da uno strato softmax. Il modello è stato addestrato su una suddivisione 70/15/15 con validazione incrociata a 10 volte. Le metriche utilizzate erano accuratezza, precisione, richiamo, punteggio F1, latenza e AUC.

Un diagramma di flusso semplificato, che riassume le cinque fasi, fornisce una panoramica visiva immediata del processo sequenziale, come mostrato nella Figura 2. Questa figura rappresenta in modo conciso l'intera pipeline di ricerca, comprendente acquisizione dati, pre-elaborazione, estrazione delle caratteristiche, fusione multimodale e classificazione tattica delle decisioni, seguite da descrizioni dettagliate di ogni stadio.

Figura 2
Figura 2. Il flusso di lavoro complessivo del processo di ricerca. Panoramica della pipeline di ricerca, dalla raccolta e preprocessing dei dati all'estrazione delle caratteristiche, all'addestramento e alla valutazione dei modelli. Clicca qui per visualizzare una versione più grande di questa figura.

La Figura 3 mostra il flusso di lavoro complessivo del processo di ricerca suggerito. Il processo viene avviato dalla Fase 1: Acquisizione e Pre-elaborazione dei dati, in cui vengono raccolte e sincronizzate fonti di dati multimodali, come video, audio, tracciamento posizionale e metadati contestuali. Durante la Fase 2: Estrazione delle Caratteristiche, vengono utilizzate Reti Neurali Convoluzionali 3D (CNN 3D) per estrarre informazioni spaziotemporali dai flussi video, risultando in rappresentazioni visive dense delle azioni dei giocatori e del flusso tattico. Fase 3: Incorporamento e Allineamento degli Ingressi Multimodali combina audio, video e caratteristiche posizionali in uno spazio latente condiviso, con allineamento temporale e cross-modale. Queste rappresentazioni sono successivamente aggregate nella Fase 4: Fusione Multimodale basata su Transformer, dove meccanismi cross-modali e di auto-attenzione permettono al modello di apprendere interdipendenze tra modalità e di ottenere approfondimenti contestuali nelle decisioni tattiche. Infine, nella Fase 5: Classificazione e Valutazione delle Decisioni Tattiche, le rappresentazioni combinate vengono inserite in uno strato di classificazione per rilevare decisioni tattiche, come passaggio, spinta o mantenimento. Nel frattempo, vengono utilizzate metriche di performance per stimare l'accuratezza decisionale e i tempi di risposta. Questo diagramma di flusso offre una panoramica chiara dell'approccio passo dopo passo, completato dalle elaborate descrizioni testuali delineate nelle sezioni successive.

Figura 3
Figura 3. Pipeline di elaborazione sequenziale. Rappresenta il flusso passo dopo passo dall'acquisizione dei dati alla classificazione tattica delle decisioni e all'output del modello. Clicca qui per visualizzare una versione più grande di questa figura.

Acquisizione e preelaborazione dei dati

Per consentire un'analisi tattica decisionale ad alto livello negli sport di squadra tramite una pipeline di fusione multimodale utilizzando Transformer, è stata creata una configurazione strutturata e ad alta fedeltà per l'acquisizione e la pre-elaborazione dati. L'organizzazione prevede la fusione di più modalità di data, incluse registrazioni video, tracciamento posizionale dei giocatori, segnali audio dalle interazioni giocatore-allenatore e metadati contestuali come la fase della partita, la struttura della squadra e le aree di possesso.

Il campione dello studio comprendeva 40 uomini di età pari o superiore a 20 anni, tutti attivamente coinvolti in leghe regionali di calcio amatoriale e semiprofessionistico. Ognuno di loro è stato reclutato da quattro club competitivi che avevano un programma di allenamento strutturato. L'età media degli atleti era di 20,1 ± 1,2 anni, con un'altezza media di 177,5 ± 3,1 cm e un peso medio di 72,6 ± 2,9 kg. Giocavano per i rispettivi club da una media di 6,8 ± 1,5 anni. Tutti i partecipanti avevano anche almeno tre anni di esperienza competitiva e sono stati considerati tatticamente competenti.

Per garantire la potenza statistica, la dimensione del campione è stata approssimata utilizzando un livello di affidabilità del 95% (Z = 1,96) e un livello di significatività del 5% con un coefficiente di correlazione intraclasse (ICC) atteso di 0,96 e un intervallo di confidenza del 95% per riflettere un accordo quasi perfetto. Ciò è coerente con l'obiettivo di validare l'affidabilità e la coerenza dei dati decisionali multimodaliraccolti 27.

Per garantire la riproducibilità, le impostazioni di acquisizione e le specifiche tecniche sono state standardizzate tra le sessioni. I dati video venivano registrati a risoluzione 1.080p e a 25 fotogrammi al secondo utilizzando fotocamere GoPro Hero4 con un'impostazione a campo visivo ampio per catturare tutto lo spazio tattico. Ogni registrazione era stabilizzata e montata a un'altezza fissa di 2,5 m. I segnali audio venivano catturati utilizzando un microfono di campo esterno a una frequenza di campionamento mono di 44,1 kHz e successivamente filtrati con un filtro passa-banda da 300-3.400 Hz per rimuovere il rumore ambientale. I dati di tracciamento posizionale sono stati raccolti utilizzando sensori GPS indossabili che operano a 10 Hz, con una precisione posizionale media riportata dal produttore di ±0,5 m. Tutte le modalità sono state sincronizzate usando timestamp condivisi e ricampionate su una linea temporale comune a 25 Hz tramite interpolazione lineare.

La preprocessing includeva poi quanto segue: downsampling video a risoluzione 224 × 224, campionamento dei frame di 16 frame consecutivi con un passo di 2, ritaglio casuale, flipping orizzontale, normalizzazione della luminosità, normalizzazione audio e filtraggio del rumore, e normalizzazione z-score delle variabili posizionali e contestuali.

Lo script di preprocessing è disposto nel seguente ordine per la riproducibilità: (i) estrazione dei fotogrammi; (ii) filtraggio audio; (iii) interpolazione GPS; (iv) ricampionamento della modalità a 25 Hz; (v) normalizzazione del z-score; e (vi) test di integrità per corruzione, occlusione e abbandono scolastico. Gli script di elaborazione batch vengono utilizzati per completare automaticamente ogni fase.

Per mantenere i dati affidabili, i criteri per il controllo qualità e l'esclusione includevano: i) sequenze con >20% di occlusione del giocatore, ii) perdita GPS superiore a 200 ms, iii) audio corrotto o tagliato, e iv) sfocatura di movimento grave o desincronizzazione tra modalità. Un totale di 17 sequenze (3,4%) sono state escluse per queste condizioni. La Tabella 1 mostra la descrizione del dataset.

AttributiDettagli
SportCalcio (calcio)
Partecipanti40 calciatori maschi
Livello di giocoGiocatori di football federato con ≥5 anni di esperienza
Tipo di provaTest decisionale e di esecuzione di passaggio e penetrazione (controllo della palla)
Impostazione del testConfigurazione standardizzata del campo da calcio, zone segnate, posizioni fisse
Strumenti di misurazioneTelecamere GoPro Hero4, software Kinovea, temporizzazione cronometro
Dati raccoltiTempo di esecuzione (ET), accuratezza decisionale (DM), numero di azioni corrette
Procedura di provaI giocatori rispondevano a stimoli visivi dagli allenatori ed eseguivano passaggi o penetrazioni
Ripetizioni dei processi10 prove per giocatore (5 passaggi, 5 drive)
ValutazioneEsperti classificati DM; ET misurato utilizzando timestamp/video
Variabili di EsitoTempo di reazione, conteggio corretto delle decisioni, punteggio tecnico di esecuzione

Tabella 1: Descrizione del dataset. Dettaglia la demografia dei partecipanti, le procedure di test, gli strumenti di misurazione e le variabili di risultato.

Nel presente studio sono stati utilizzati due dataset correlati ma distinti. Il primo dataset comprendeva 40 giocatori che partecipavano a compiti controllati di decisione pass/drive, utilizzati principalmente per stabilire l'affidabilità di base e validare la procedura di misurazione decisionale di base. Il secondo dataset include 500 sequenze tattiche multimodali raccolte da simulazioni di partite estese e registrazioni di partite reali. Queste sequenze costituivano il principale dataset di addestramento e test per il modello di fusione basato su transformer, permettendo la valutazione in condizioni ecologicamente più valide.

Sebbene il dataset comprenda 500 sequenze multimodali, il campionamento stratificato ha garantito una rappresentazione bilanciata tra le azioni tattiche (Pass, Drive, Hold). Anche approcci di aumento dei dati, come il ritaglio temporale e il rimescolamento delle sequenze, sono stati utilizzati per aumentare la variabilità e mitigare il bias del modello durante l'addestramento.

Vale la pena notare che il dataset controllato da 40 giocatori è stato utilizzato nella validazione iniziale del modello e nei test di affidabilità, mentre la raccolta più ampia di 500 sequenze multimodali è stata compilata da registrazioni prolungate delle partite e sessioni di allenamento organizzate per valutare la scalabilità e la validità ecologica del framework. L'affidabilità di base è stata stabilita utilizzando il dataset più piccolo, mentre il dataset più grande ha facilitato l'addestramento e i test su larga scala del modello.

Descrizione del dataset

L'esperimento ha reclutato 40 calciatori maschi, ciascuno con almeno cinque anni di esperienza nel football federato, per garantire che la popolazione campione avesse competenze tecniche e tattiche di base. La raccolta dei dati avveniva in una disposizione standardizzata del campo da calcio, dove erano assegnate zone predeterminate e posizioni di gioco per garantire condizioni di test identiche. Durante la sperimentazione, i partecipanti dovevano rispondere a segnali visivi di un allenatore, sia per passare che per penetrare, replicando decisioni tattiche prese in una partita reale. Ogni partecipante ha completato un totale di 10 prove, cinque di passaggio e cinque di guida. Questi movimenti sono stati catturati con fotocamere GoPro Hero4, e i dati di performance sono stati misurati utilizzando il software di analisi video Kinovea insieme al tempo manuale del cronometro per catturare il tempo di esecuzione (ET). La principale fonte di dati raccolta era: il tempo di esecuzione, la qualità del DM valutata da coach esperti e la quantità di azioni corrette eseguite. Questi fattori fornivano una base quantitativa per analizzare la rapidità ed efficacia con cui i giocatori prendevano ed eseguivano decisioni tattiche in condizioni di stimolo-risposta controllate. Il dataset prodotto è una risorsa strutturata e etichettata, ben adatta al compito di creare benchmark o addestrare sistemi intelligenti con l'obiettivo di modellare il pensiero tattico e le risposte motorie in contesti di sport di squadra.

Il campione è limitato a giovani giocatori maschi di una lega regionale, il che può limitarne la generalizzazione tra fasce d'età, atleti femminili o altre culture. Studi futuri cercheranno di estrarre campioni più rappresentativi e diversificati.

Un'altra limitazione è il campione di 40 giovani giocatori maschi provenienti da una singola lega regionale. Sebbene il campione omogeneo abbia contribuito alla validità interna e alla riduzione della variazione delle prestazioni dovuta a differenze di età, genere e background tattico, limita anche la generalizzazione dei risultati a una popolazione più ampia. I modelli tattici che il modello apprende possono quindi riflettere stili di gioco specifici per regione o genere piuttosto che comportamenti decisionali universali. Per questo studio, sono stati impiegati campionamenti stratificati e aumento dei dati per aumentare la variabilità del dataset in esame; Tuttavia, sono necessari studi di ricerca su larga scala che coinvolgano atlete donne, giovani giocatrici, giocatrici professioniste e partecipanti di molteplici culture tattiche per confermare la solidità del modello in diversi ambienti calcistici. Questi risultati dimostrano un forte potenziale ma necessitano di ulteriori validazioni su dataset più diversificati e ampi prima che si possa rivendicare una generalizzazione più ampia.

Per ridurre la soggettività, tre allenatori professionisti di football annotavano indipendentemente le scelte tattiche. L'affidabilità tra valutatori è stata stimata utilizzando il coefficiente di correlazione intraclasse (ICC = 0,96, CI 0,94-0,98), indicando un accordo quasi perfetto. La discussione consensuale risolse i disaccordi. Per i dati multimodali, la pre-elaborazione comportava la sincronizzazione temporale tra le modalità (video a 25 fps e dati sensori a 10 Hz) e la normalizzazione z-score delle caratteristiche per consentire la comparabilità tra le modalità.

L'affidabilità tra valutatori è stata quantificata utilizzando un coefficiente di correlazione intraclasse a effetti casuali a due vie (ICC [2,3]), poiché è adatto a valutare l'accordo assoluto tra più valutatori. L'ICC di 0,96 (IC 95%: 0,94-0,98) indica un accordo quasi perfetto secondo le soglie comunemente utilizzate e stabilisce inoltre che le etichette decisionali tattiche utilizzate per l'addestramento erano altamente affidabili. L'affidabilità è stata calcolata su tutte le 500 sequenze multimodali, garantendo che sia i contesti controllati che quelli di simulazione delle partite fossero regolarmente e coerentemente annotati.

Procedura di annotazione e protocollo di etichettatura

Tutte le sequenze multimodali venivano annotate utilizzando un protocollo strutturato a tre stadi. Per prima cosa, tre allenatori di calcio autorizzati hanno esaminato indipendentemente ogni sequenza video-posizionale utilizzando un'interfaccia di annotazione sincronizzata con timestamp (Kinovea + foglio di calcolo personalizzato per tag). Gli annotatori etichettavano la categoria decisionale tattica (Pass, Drive, Hold), i segnali contestuali (zona di pressione, disponibilità della corsia di passaggio) e i timestamp degli eventi. In secondo luogo, uno script per il rilevamento dei disaccordi identificava automaticamente i casi di ambiguità o conflitto, che venivano poi esaminati in una riunione di consenso congiunta. In terzo luogo, per garantire la coerenza nella marcatura dei confini degli eventi e nell'allineamento temporale tra le modalità, un ultimo passaggio è stato condotto da un analista senior indipendente. Questo processo, per l'addestramento successivo dei modelli, garantiva che ogni annotazione fosse tracciabile e di altissima qualità.

Preprocessing

Mentre il presente studio è stato condotto con 500 sequenze multimodali, la pipeline di preprocessing era, per progettazione, progettata per dataset su larga scala. Tutte le modalità sono state sottoposte a script automatizzati che, in parallelo, hanno estratto in batch i fotogrammi video, ricampionato audio, interpolato dati posizionali e applicato la normalizzazione z-score. La presenza di architettura modulare permette che ogni modalità venga pre-elaborata indipendentemente su thread separati GPU/CPU. Questo consente l'inggestione ad alto volume delle riprese della partita. Questo garantisce che il flusso di lavoro possa essere facilmente scalato a dataset a stagione completa senza interventi manuali e rende il framework adatto all'impiego reale in ambienti di analisi professionali.

Per esaminare correttamente il processo decisionale tattico negli sport di squadra, i dati grezzi provenienti da diverse modalità — ad esempio clip video, segnali audio e registrazioni di posizione — devono essere pre-elaborati e allineati. L'illustrazione dell'input multimodale è

Equazione 1(1)

Qui, V è indicato come una serie di caratteristiche video estratte dall'encoder CNN.

Equazione 2(2)

Qui, A è una caratteristica audio codificata da wave2vec.

Equazione 3(3)

P rappresenta la posizione coordinata di un giocatore al tempo ti.

Per gestire i tassi di campionamento asincroni, ogni modalità viene ricampionata o interpolata in una timeline condivisa:

Equazione 4(4)

Qui Equazione 5, è una caratteristica sincronizzata ft , è la velocità del frame combinato, Xm è un'indicazione iniziale.

Per una scala uniforme tra le modalità, tutti i vettori di caratteristiche sono normalizzati con z-score:

Equazione 8(5)

μX e σX indicano la media e la deviazione standard della dimensione delle caratteristiche nell'insieme di addestramento.

Sebbene le principali preoccupazioni siano le decisioni passaggio/penetrazione, sono stati aggiunti canali audio (ad esempio, comunicazione giocatore/allenatore, segnali ambientali di gioco) per tenere conto delle situazioni reali della partita in cui i segnali vocali influenzano la reazione tattica. Gli iperparametri (ad esempio, tasso di apprendimento, epoche) sono stati scelti tramite la ricerca su griglia e valutazioni esistenti nell'apprendimento multimodale, trovando un equilibrio tra stabilità della convergenza ed efficienza computazionale.

Gli iperparametri del framework suggerito — tasso di apprendimento, dimensione del lotto ed epoche di addestramento — sono stati scelti attraverso una ricerca sistematica a griglia ben pianificata per raggiungere sia stabilità di convergenza che efficienza computazionale. La scelta di una velocità di apprendimento di 0,0001 con l'ottimizzatore Adam si è rivelata fornire aggiornamenti stabili del gradiente senza oscillazioni, mentre le dimensioni dei lotti sono state ottimizzate per bilanciare la capacità della memoria GPU con la capacità di addestramento della TV. L'impostazione di 50-100 epoche è stata utilizzata per consentire un apprendimento adeguato senza sovrafitting, come confermato dal tracciamento della perdita di validazione e dalla validazione incrociata a 10 volte. Questi valori non sono stati fissati arbitrariamente, ma sono stati guidati da test precedenti nell'apprendimento multimodale e adattati da sperimenti sul dataset attuale. Questo processo rigoroso garantiva che gli iperparametri selezionati facilitassero l'addestramento stabile del modello e miglioramenti riproducibili delle prestazioni rispetto agli approcci di base.

Sebbene il compito di classificazione si concentri sulle decisioni di passaggio/penetrazione/tenuta, le informazioni audio sono state intenzionalmente incluse poiché il comportamento tattico reale nel football è fortemente influenzato dalla comunicazione giocatore-allenatore, dai segnali di squadra che chiamano segnali, dai segnali di pressione e dai suoni ambientali (ad esempio, contatto con la palla, approccio avversario). Questi segnali spesso precedono o co-avvengono con il processo decisionale e fanno parte dell'ambiente percettivo naturale dei giocatori di football. Esperimenti preliminari di ablazione hanno mostrato che escludere l'audio riduceva il richiamo del 3,8%, indicando che anche segnali acustici sottili contribuiscono alla consapevolezza del contesto. Per questo motivo, l'audio è stato mantenuto per preservare la validità ecologica e migliorare la capacità del modello di generalizzare alle condizioni reali di corrispondenza.

Infatti, a supporto di questi iperparametri, è stata condotta un'analisi interna di sensibilità variando sistematicamente la velocità di apprendimento da 1e-5 a 5e-4, la dimensione del lotto da 8 a 32, il numero di strati trasformatori da 4 a 8 e il numero di teste di attenzione da 4 a 12. La configurazione scelta, con un tasso di apprendimento di 1e-4, una dimensione di batch di 16 e un codificatore a 6 strati con 8 testine di attenzione, ha prodotto continuamente una convergenza stabile con la perdita di validazione più bassa, minimizzando l'overfitting su validazione incrociata di 10 volte. Grandi quantità di loti causavano instabilità del gradiente, mentre i lotti più piccoli aumentavano il rumore e ritardavano la convergenza. Analogamente, i modelli a trasformatore con più di 8 testine non mostravano alcun aumento delle prestazioni, ma aumentavano considerevolmente il tempo di calcolo. I risultati ottenuti giustificano le impostazioni finali degli iperparametri utilizzati in questo studio.

Estrazione di caratteristiche utilizzando reti neurali convoluzionali 3D

Nel framework proposto Transformer-Based Multimodal Fusion per il processo decisionale tattico negli sport di squadra, la 3D Convolutional Neural Network (3D CNN) è responsabile dell'estrazione delle caratteristiche spazio-temporali dai video grezzi.

A differenza delle CNN 2D, che considerano solo le dimensioni spaziali (larghezza W e altezza H), le CNN 3D tengono conto anche della dimensione temporale R, permettendo loro di rilevare dinamiche di movimento e schemi sequenziali cruciali per comprendere i comportamenti della squadra, come penetrazioni e passaggi nel football.

Il 3D-CNN28 è stato proposto per la prima volta per combinare le informazioni spaziali e temporali dei dati video. Un kernel 3D viene utilizzato in un algoritmo di convoluzione 3D su un cubo composto da frame con parte delle colonne impilate. La convoluzione 3D può essere scritta in Equn (6)

Equazione 11(6)

Dove: Equazione 12 è la caratteristica di output nella posizione (x, y, z) sulla j-esima mappa di caratteristiche del l-esimo strato.Equazione 14 è il peso del nucleo nella posizione (h,w,r) dalla m-esima mappa di entrata. Equazione 16 è l'input all'offset spazio-temporale rispetto al livello precedente. blj è il bias. f(.) è la funzione di attivazione (di solito ReLU). M è il numero di mappe di caratteristiche di input dal livello precedente. Questa equazione permette alla CNN 3D di combinare in parallelo le informazioni spaziali (altezza e larghezza) e temporali (sequenza dei fotogrammi).

Figura 4
Figura 4. Architettura di elaborazione CNN 3D. Illustra come le caratteristiche spaziotemporali vengano estratte dalle sequenze video utilizzando operazioni convoluzionali 3D. Clicca qui per visualizzare una versione più grande di questa figura.

La Figura 4 mostra il processo di funzionamento di una CNN 3D. La pipeline inizia con la fase di input, in cui i flussi video non processati di una partita di football vengono fusi con dati organizzati, inclusi i luoghi dei giocatori, le statistiche della partita e i metadati contestuali. Queste informazioni multimodali preservano sia la dinamica visiva sia il contesto situazionale, che sono fondamentali per l'analisi delle tattiche di squadra. Successivamente, il flusso video viene instradato attraverso una Rete Neurale Convoluzionale 3D (3D CNN). In questo caso, una serie di strati convoluzionali 3D viene utilizzata sui frame di input. I livelli ruotano lungo le dimensioni spaziali (altezza e larghezza) e la dimensione temporale (fotogrammi), permettendo alla rete di apprendere schemi di movimento, interazioni con i giocatori e tattiche basate sulla sequenza, come passaggi o penetrazioni. Successivamente, si forma un cubo di caratteristiche che presenta dense caratteristiche spaziotemporali. Questo cubo è sottoposto a operazioni di pooling per ridurre la dimensione preservando caratteristiche significative. Al momento del pooling, il volume delle caratteristiche viene appiattito in un vettore 1D, fornendo una rappresentazione concisa della situazione tattica. Questo vettore caratteristico viene successivamente inserito in una Rete Neurale Profonda (DNN) completamente connessa. La DNN è il blocco decisionale, che elabora le caratteristiche fuse ed estratte per prendere decisioni tattiche, come passaggio, tiro o mantenimento. L'output della rete è la decisione tattica finale presa dal sistema basata sulla situazione reale del gioco in tempo reale e sui modelli strategici appresi.

Incorporamento e allineamento degli input multimodali

Dopo l'estrazione delle caratteristiche, le tre caratteristiche, come audio, video e posizione statistica del lettore, vengono fornite come modalità di input.

Per inserirli in un trasformatore e poi alimentarli tramite una funzione di embedding apprendibile:

Equazione 19(7)

dove f3DCNN apprende le caratteristiche spaziotemporali di ogni segmento temporale Vt e le mappa a uno spazio latente d-dimensionale.

Equazione 22(8)

dove WP e bP sono pesi imparabili.

Equazione 25(9)

Tutti gli embedding sono allineati dalla dimensione temporale T. Se le modalità hanno frequenze disparate, si utilizza interpolazione o campionamento verso il basso:

Equazione 26(10)

Ora, tutte le modalità sono sincronizzate come:

Equazione 27(11)

Per preservare l'ordine temporale nel trasformatore, si introducono anche codifiche posizionali per ogni vettore:

Equazione 28(12)

Dove Equazione 29 rappresenta la codifica posizionale sinusoidale o apprendibile predefinita.

Ogni modalità viene codificata operativamente utilizzando uno strato lineare PyTorch, concatenata in un vettore 512-d, e poi inserita nella sequenza di input del trasformatore dopo la codifica posizionale. Questo garantisce che un embedded unificato sia preparato per l'attenzione incrociata in ogni passo temporale.

Il tensore finale è

Equazione 30(13)

viene inserito nel Transformer Encoder, dove i meccanismi di auto-attenzione e di attenzione cross-modale permettono al modello di ragionare congiuntamente attraverso tutte le modalità per il processo decisionale tattico.

Fusione multimodale basata su trasformatori

Nell'approccio proposto, viene impiegato il metodo di fattorizzazione matriciale a basso rango per integrare i vettori dati multimodali acquisiti. Il problema ad alta dimensione che si verifica quando i tensori vengono fusi direttamente viene affrontato da questo metodo, che utilizza un fattore di decomposizione di basso rango per la fusionetensoriale 29. Ogni modalità viene inizialmente espressa come un vettore, e la riduzione della dimensionalità che preserva interazioni significative si ottiene tramite la decomposizione di basso rango. Il tensore di fusioneZ M tra le modalità M è costruito come:

Equazione 32(14)

Qui: Equazione 33 è il fattore di rango basso della m-esima modalità, Equazione 60 è il prodotto esterno, e r è il rango di decomposizione.

Il vettore di fusione h viene quindi calcolato come:

Equazione 34(15)

Quando due modalità vengono utilizzate da sole, la fusione ridotta è:

Equazione 35(16)

Questo produce un vettore di rappresentazione multimodale congiunto h che modella le interazioni cross-modali a livello latente.

Dopo l'acquisizione del vettore fuso di basso rango h, il modulo Transformer modella le dipendenze e allinea le rappresentazioni semantiche tra modalità. Un'attenzione cross-modale è appositamente progettata per permettere a una modalità di prestare attenzione a un'altra:

Equazione 36(17)

Dove Qm è la query della modalità m, Kn,V n sono i vettori chiave e valore nella modalità n, dk è la dimensione dei vettori chiave. Questa configurazione facilita flussi di attenzione specifici per modalità, permettendo di elaborare ogni categoria di input rispetto alle altre (ad esempio, sincronizzando il movimento del giocatore con il contesto di gioco e gli indicatori video).

I vettori a vigilanza incrociata sono impilati e classificati tramite un Multilayer Perceptron (MLP). L'output è un'etichetta decisionale tattica (ad esempio, pass, drive, hold), perdita di entropia incrociata ottimizzata per l'addestramento end-to-end.

Figura 5
Figura 5. Architettura di fusione multimodale basata su Transformer. Mostra come le modalità visive e sensoriali siano integrate tramite un encoder a trasformatore per migliorare la rappresentazione delle caratteristiche. Clicca qui per visualizzare una versione più grande di questa figura.

Il blocco di fusione multimodale, come dimostrato nella Figura 5, combina input visivi e posizionali. È un progetto necessario poiché le decisioni tattiche richiedono consapevolezza spaziale e dinamiche di movimento, che non possono essere rappresentate da una singola modalità.

La Figura 5 mostra la struttura operativa della fusione multimodale basata su Transformer. Questo design combina dati diversi, video, coordinate spaziali e dati contestuali di gioco in un unico canale per prevedere azioni tattiche come sorpassi, guidare o mantenere la posizione. L'approccio inizia con l'inserimento di video, che vengono valutati utilizzando una Rete Neurale Convoluzionale 3D (3D CNN). Questo sistema identifica sia le strutture spaziali che quelle temporali nel video, permettendogli di catturare l'attività dinamica e la comunicazione dei giocatori nel tempo. Nel frattempo, le informazioni contestuali e posizionali vengono trasmesse tramite strati di incorporamento, trasformando input strutturati in rappresentazioni vettoriali dense. I flussi contestuali, posizionali e video possono quindi avere i loro output fusi da un modulo Low-Rank Fusion. L'approccio ottiene efficacemente correlazioni intermodali attraverso la decomposizione dello spazio di fusione, minimizzando la complessità computazionale e preservando le relazioni essenziali tra le modalità. Infine, la rappresentazione multimodale fusa viene elaborata da un Transformer Encoder con attenzione cross-modale. Questa procedura consente al modello di concentrarsi sulle caratteristiche giuste tra modalità e passi temporali, migliorando la comprensione del comportamento strategico nei giochi. Infine, l'output codificato viene passato attraverso una concatenazione e un blocco Multi-Layer Perceptron (MLP) che mappa la rappresentazione appresa ad alcune decisioni tattiche. L'output del modello classifica le azioni dei giocatori come "passaggio", "spinta" o "hold" per consentire un esame intelligente e basato sui dati delle tattiche di squadra.

Nel sistema di analisi tattica Transformer-Based Multimodal Fusion suggerito per sport di squadra, l'ultima fase è la classificazione e valutazione tattica delle decisioni, che converte rappresentazioni multimodali apprese in etichette decisionali e azionabili. Dopo aver fuso caratteristiche video, posizionali e contestuali tramite fusione di basso rango e averle ottimizzate usando attenzione cross-modale nell'encoder Transformer, i vettori di caratteristiche risultanti vengono inseriti in un classificatore Multi-Layer Perceptron (MLP). Ogni classe decisionale è rappresentata da una funzione di attivazione softmax, che fornisce punteggi di probabilità per tutte le azioni possibili. La classe più probabile viene scelta come decisione prevista dal modello. Il modello è addestrato su una funzione di perdita a entropia incrociata, che premia le previsioni corrette e fa sì che la rete impari a distinguere differenze simili in situazioni tattiche. Inoltre, si potrebbe considerare una valutazione nel dominio del tempo per confermare la reattività in situazioni di gioco in tempo reale o quasi in tempo reale, assicurando che il classificatore sia accurato e non perda tempo sotto vincoli di tempo simili a quelli dei giochi. La Tabella 2 mostra l'architettura del modello e gli iperparametri.

ComponenteSpecifiche
Strati Encoder Transformer6
Attenzione Teste8
Dimensione nascosta512
Dimensione dello strato a avanzamento2048
Dimensioni di incorporamentoVideo: 1024 → 512, Audio: 256 → 512, Posizionale: 128 → 512
Codifica posizionaleImparabile
Metodo di fusioneFusione Multimodale di basso rango (rango r = 16)
OttimizzatoreAdam
Tasso di apprendimento0.0001
Dimensione del lotto16
Epoche di addestramento50–100
Abbandono0.1
Funzione di perditaEntropia incrociata

Tabella 2: Architettura del modello e iperparametri. Elenca le impostazioni di addestramento e i componenti chiave del modello proposto di fusione multimodale basato su trasformatori.

Per maggiore chiarezza e riproducibilità, il trasformatore multimodale è stato implementato con uno stack di encoder a 6 livelli, ciascuno dotato di 8 testine di attenzione e una dimensione nascosta di 512, seguendo le tipiche impostazioni dei trasformatori per compiti multimodali di media scala. Ogni modalità passa attraverso un blocco di embedding: video tramite un'uscita encoder 3D-CNN, 1024-dim; audio tramite un codificatore basato su Wave2Vec, 256-dim; e caratteristiche posizionali più contestuali tramite un codificatore MLP a 2 livelli, 128-dim. Tutti questi embedding sono stati proiettati in uno spazio latente condiviso 512-d tramite trasformazioni lineari apprendibili. Per stabilire l'allineamento temporale, tutte le modalità vengono prima interpolate su una singola frequenza di 25 Hz, seguite dall'applicazione di codifiche posizionali apprese per preservare l'ordine temporale. L'allineamento cross-modale viene effettuato utilizzando i livelli di attenzione, che apprendono esplicitamente le correlazioni tra le modalità prima di essere inseriti nello stack degli encoder di auto-attenzione. Queste scelte architettoniche sono state fatte per bilanciare la capacità del modello con l'efficienza computazionale, garantendo così una convergenza stabile su un dataset di dimensioni moderate.

In termini pratici, il framework proposto per la Fusione Multimodale Basata su Transformer è più adatto a scenari in cui sono disponibili dati multimodali sincronizzati, come sessioni di allenamento strutturate, simulazioni di partite controllate o ambienti professionali dotati di flussi video coerenti e sistemi di tracciamento posizionale. I quattro principali input necessari per il metodo sono (i) video ad alta risoluzione, (ii) dati di tracciamento posizionale (GPS/LPS), (iii) flussi audio e (iv) metadati contestuali - ad esempio, possesso, zone di pressione, fase di corrispondenza. Per ottenere prestazioni affidabili, queste modalità devono essere allineate nel tempo con un minimo deriva (video ≥ 25 fps e sensori posizionali ≥ 10 Hz), e devono mantenere punti di vista stabili e minimo rumore del segnale. Quelle impostazioni che non riescono a fornire questi input sincronizzati, ad esempio partite amatoriali con angolazioni di telecamera irregolari, feed di trasmissione in diretta con artefatti di latenza/compressione, o un ambiente privo di infrastruttura di tracciamento posizionale, saranno meno rilevanti per il framework. Inoltre, l'attuale sistema funziona meglio in condizioni semi-controllate, ma può essere sostanzialmente meno robusto in situazioni di live-match completamente incontrollate, dove condizioni di luce, occlusione e rumore dinamico della folla influenzano la qualità dell'acquisizione dei dati. Questi vincoli delineano i confini pratici entro cui questo sistema può essere implementato e sottolineano che la cattura coerente dei dati in più modalità è essenziale nell'applicazione del modello proposto.

Modifiche e risoluzione dei problemi

Nell'implementazione pratica, possono sorgere diversi problemi lungo la pipeline multimodale che possono ridurre la stabilità del modello o le prestazioni complessive. Un problema comune è il disallineamento temporale tra le modalità, dove il video registrato a 25 fps e i dati posizionali catturati a 10 Hz cadono fuori sincronia, portando a segnali discorrispondenti che destabilizzano le mappe di attenzione e riducono il richiamo. Questo può essere risolto applicando un campionamento basato su timestamp, interpolazione lineare e rimuovendo automaticamente sequenze con deriva eccessiva. I canali audio possono anche soffrire di rumore causato dal vento, dai rumori della folla o dal clipping del microfono, che porta il trasformatore a ignorare i token audio e a ridurre leggermente la precisione. L'applicazione del filtraggio passa-banda, del gating spettrale e la sostituzione di segmenti gravemente corrotti con vettori zero aiuta a mantenere la stabilità dell'embedding audio. Problemi di qualità visiva, come occlusioni dei giocatori o motion blur, possono indebolire le rappresentazioni spaziotemporali della 3D-CNN e aumentare la confusione tra i pass drive. Questo viene mitigato escludendo sequenze fortemente occlute e adottando strategie di aumentazione, inclusi ritaglio casuale, normalizzazione della luminosità e simulazione del motion blur. L'instabilità del trasformatore può verificarsi se le scale di embedding differiscono tra le modalità, producendo perdita di validazione oscillante o picchi di gradiente. Garantire una normalizzazione coerente del z-score, utilizzare un programma di apprendimento del riscaldamento, applicare gradient clipping e aumentare il dropout può ripristinare un allenamento stabile. La fusione di basso rango può anche diventare problematica quando il rango di fusione è impostato in modo errato, causando relazioni intermodali distorte e squilibri di classe. Mantenere un rank moderato per dataset piccoli, aumentare il rank per dataset più grandi e applicare la regolarizzazione L2 aiutano a preservare la fusione bilanciata. I colli di bottiglia computazionali possono sorgere a causa di grandi tensori video che causano un sovraplessamento della memoria GPU o un allenamento lento. Questi problemi possono essere affrontati tramite addestramento a precisione mista (FP16), riducendo la risoluzione degli input durante le prime sperimentazioni, o memorizzando in cache funzionalità 3D-CNN precallate. Infine, il naturale squilibrio di classe nelle decisioni tattiche, specialmente per il "Drive", può ridurre il richiamo e causare fluttuazioni nell'AUC; L'applicazione della perdita bilanciata tra classi, il sovracampionamento delle azioni delle minoranze e l'arricchimento dei metadati contestuali possono migliorare sostanzialmente l'equilibrio e la discriminazione decisionale. Questa guida consolidata di risoluzione dei problemi garantisce che ricercatori e professionisti possano mantenere condizioni di addestramento stabili, migliorare la riproducibilità e adattare efficacemente il framework tra vari dataset e ambienti.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo design combina dati diversi, video, coordinate spaziali e dati contestuali di gioco in un unico canale per prevedere azioni tattiche come sorpassi, guidare o mantenere la mano. L'approccio inizia con l'inserimento di video, che vengono valutati utilizzando una Rete Neurale Convoluzionale Tridimensionale (3D CNN). I flussi contestuali, posizionali e video possono quindi avere i loro output fusi da un modulo Low-Rank Fusion. L'approccio ottiene efficacemente correlazioni intermodali attraverso la decomposizione dell...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il framework di fusione multimodale basato su Transformer presentato qui rappresenta uno sviluppo importante rispetto al test base Stroop Task Football Test (STFT) descritto nel documento base. A differenza dell'articolo base, che si concentrava su test controllati e orientati al laboratorio con stimoli limitati e statici come frecce colorate e compiti predefiniti (guida o sorpassaggio), il nuovo modello si basa su dati multimodali reali per facilitare una pipeline di analisi tattica aut...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno conflitti di interesse da dichiarare.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori riconoscono con gratitudine il sostegno della School of Physical Education della Beibu Gulf University e della School of Statistics della Southwestern University of Finance and Economics, per aver fornito risorse e supporto istituzionale durante questa ricerca. Questo lavoro è stato inoltre supportato dal Progetto 2023 del National Social Science Fund: Ricerca sull'Effettiva Utilizzo delle Risorse Culturali Sportive Rosse nell'Area della Vecchia Base Rivoluzionaria Zuo Jiang–You Jiang (Grant No. 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
CNN 3DImplementazione personalizzataEstrazione di caratteristiche spaziotemporali dal video
GoPro Hero4GoPro Inc.https://gopro.com/Registrazione video delle partite
Sensori GPS/IMUCatapult Sports / Xsenshttps://www.catapultsports.com/Tracciamento della posizione dei giocatori
Intel Core i7-11700K CPUIntelhttps://www.intel.comCPU per workstation di addestramento modello
Librosalibrosa.orghttps://pypi.org/project/librosa/Elaborazione del segnale audio e ricampionamento
Classificatore MLPPyTorch / TensorFlowClassificazione decisionale tattica
NumPyPython Software Foundationhttps://pypi.org/project/numpy/Calcolo numerico e operazioni matriciali
NVIDIA RTX 3080 GPUNVIDIAhttps://www.nvidia.comAddestramento e inferenza nel deep learning
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Estrazione dei fotogrammi dal video
PandaPython Software Foundationhttps://pypi.org/project/pandas/Manipolazione dei dati e gestione tabulare
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Riduzione della dimensionalità
Python 3.9Python Software Foundationhttps://www.python.org/downloads/release/python-390/Ambiente del linguaggio di programmazione
PyTorchFondazione PyTorchhttps://pytorch.org/Framework per il deep learning
scikit-learnSviluppatori scikit-learnhttps://pypi.org/project/scikit-learn/Validazione incrociata, calcolo ICC
TensorFlow 2.8Googlehttps://www.tensorflow.org/Framework per il deep learning
Codificatore per trasformatorePyTorch / TensorFlowIntegrazione delle funzionalità multimodali con attenzione
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/Sistema operativo per l'addestramento dei modelli
Postazione di lavoroPersonalizzato / Intel, NVIDIACPU, GPU, RAM per l'addestramento dei modelli

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles