Research Article

Transformerowy multimodalny framework do analizy decyzji taktycznych w sportach zespołowych z zastosowaniem w futbolu

DOI:

10.3791/69806

January 27th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby poprawić taktyczną kategoryzację decyzji w futbolu, badanie to sugeruje model multimodalnej fuzji oparty na Transformerze, który uwzględnia dane wizualne, lokalizacyjne, akustyczne i kontekstowe. Model osiąga niemal rzeczywiste wyniki na 500-sekwencyjnym zbiorze danych multimodalnych, przewyższając bazy CNN-LSTM, BiLSTM-Attention i GNN pod względem dokładności oraz błędnej klasyfikacji wywołanej ciśnieniem.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Szybkie i precyzyjne podejmowanie decyzji taktycznych jest wymagane we współczesnej piłce nożnej. Jednak tradycyjne podejścia do oceny podejmowania decyzji taktycznych mają słabą wartość ekologiczną i trudno się skalować. Aby sprostać tym wyzwaniom, artykuł wprowadza model multimodalnej fusion oparty na transformerach, który uwzględnia pozycjonowanie gracza, wideo, dźwięk oraz kontekstowe metadane do klasyfikacji decyzji taktycznych w czasie rzeczywistym. Przeprowadzono eksperymenty z 40 męskimi aktorami oraz zbiorem danych zawierającym 500 sekwencji multimodalnych rozgrywek. Zbiór danych obejmujący 40 graczy odnosi się do kontrolowanych eksperymentów laboratoryjnych z podejmowaniem decyzji, wykorzystywanych do wstępnej walidacji i oceny wiarygodności. Następnie wyodrębniono 500 sekwencji multimodalnych z rozszerzonych symulacji meczów i nagrań z rzeczywistych meczów, aby uzyskać większy zbiór danych wykorzystywany do trenowania i testowania modelu multimodalnego transformatora.

Przetwarza dane wejściowe w pięciu etapach: akwizycja danych, wstępne przetwarzanie, ekstrakcja cech, fuzja oparta na transformatorach oraz klasyfikacja decyzyjna. W porównaniu z bazowymi wartościami CNN-LSTM, BiLSTM-Attention i GNN, proponowane podejście poprawia dokładność predykcji decyzji o 28% i zmniejsza błędną klasyfikację spowodowaną ciśnieniem o 41%, przy niskim opóźnieniu wnioskowania wynoszącym 52,6 ms, co czyni je odpowiednim do zastosowań niemal w czasie rzeczywistym. Uogólnialność wyników w bardziej zróżnicowanych kontekstach taktycznych i na szerszą demografię sportowców jest również ograniczona przez stosunkowo niewielki rozmiar i jednorodność w populacji młodych, chłopców z jednego regionu. Wyniki te podkreślają wkład wielomodalnej fuzji opartej na transformatorach w zautomatyzowaną analizę decyzji taktycznych i wskazują na potrzebę jej dalszej weryfikacji w bardziej zróżnicowanych i dużych sytuacjach dopasowania.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sporty zespołowe, takie jak piłka nożna, wymagają szybkich decyzji taktycznych w dynamicznych i niepewnych środowiskach. Zawodnicy muszą nieustannie czytać wizualne informacje z piłki, kolegów z drużyny i przeciwników oraz reagować w ułamku sekundy, aby zapewnić sobie przewagę konkurencyjną. Podejmowanie decyzji taktycznych w piłce nożnej w dużej mierze zależy od szybkiego postrzegania ruchów zawodników, trajektorii piłki oraz sygnałów sytuacyjnych. Chociaż ogólne umiejętności percepcyjne-poznawcze, takie jak czas reakcji i selektywna uwaga, rzeczywiście wpływają na wydajność, najnowsze badania podkreślają modele oparte na danych, świadome kontekstu, które mogą przybliżyć rzeczywiste taktyczne poznanie w grze 1,2,3,4,5. Czas reakcji i zdolności percepcyjne, takie jak zdolności poznawcze, również odgrywają kluczową rolę w wydajności 6,7,8. Najnowsze badania nad poznaniem sportu wykazały, że podejmowanie decyzji taktycznych opiera się nie tylko na umiejętnościach percepcyjnych, ale także na zdolności sportowca do integrowania dynamicznych informacji przestrzennych, presji przeciwnika oraz kontekstowych wskazówek gry w czasie rzeczywistym. Badania nad percepcyjną-poznawczą wiedzą sugerują, że taktycznie bardziej piśmienni gracze szybciej rozpoznają sygnały, szybciej przyswajają informacje, efektywniej i wykazują bardziej stabilne wzorce podejmowania decyzji pod presją. Takie odkrycia wspierają potrzebę tworzenia modeli obliczeniowych, które oddają złożony, wielowarstwowy charakter procesów decyzyjnych w sporcie.

Klasyczne metody oceny podejmowania decyzji taktycznych często wykorzystują kontrolowane zadania laboratoryjne oraz subiektywne oceny ekspertów, co nakłada istotne ograniczenia na ekologiczną ważność i skalowalność. Najnowsze osiągnięcia w głębokim uczeniu dają potencjał automatyzacji procesu poprzez wykorzystanie multimodalnych źródeł danych – takich jak wideo, śledzenie pozycyjne i metadane kontekstowego dopasowania – w ramach architektur czasowych i międzymodalnych zajmujących się rejestracją zależności w ramach architektur przechwytujących zależności czasowych i międzymodalnych. Pomimo tego postępu, większość obecnych modeli nadal opiera się na modelach Convolutional Neural Networks - Long-Short Term Memory lub dwukierunkowej pamięci długotrwałej (CNN-LSTM lub BiLSTM), które mają ograniczoną zdolność do modelowania zależności długozasięgowych między modalnościami. Ta niedociągnięcia są siłą napędową rozwoju multimodalnych modeli fuzji opartych na transformatorach, które lepiej są wyposażone w modelowanie podejmowania decyzji taktycznych w bardziej kompleksowych i stabilnych scenariuszach piłkarskich. Na przykład w drużynowym sporcie przeciwnika, jakim jest piłka nożna, zawodnicy muszą szybko ocenić informacje o piłce, w tym swoich kolegów z drużyny, przeciwników i pozycję na boisku. Przed podjęciem decyzji o najlepszym planie działania na podstawie swoich umiejętności, wskazówek trenera i okoliczności meczu 9,10. Dzięki dostępności zorganizowanych zbiorów danych i określonych komponentów taktycznych, badanie koncentruje się wyłącznie na piłce nożnej; Jednak zasady taktyczne podejmowania decyzji mają zastosowanie w wielu sportach drużynowych.

Rzeczywiście, wcześniejsze badania wskazują, że CNN-LSTM i BiLSTM nie są w stanie uchwycić bardzo dalekosiężnych zależności czasowych poprzez użycie stałego pola recepcyjnego ani ograniczenia przez sekwencyjne bramki 11,12,13. Podobnie, podstawowe badania nad rozpoznawaniem akcji i multimodalnym modelowaniem czasowym pokazują, że wydajność modeli opartych na LSTM maleje wraz ze wzrostem długości sekwencji lub gdy wskazówki kontekstowe pojawiają się kilka klatek od siebie, co może ograniczać wartość ekologiczną w dynamicznych warunkach sportowych. Co więcej, modele oparte na grafowych sieciach neuronowych (GNN) są potężnymi narzędziami do modelowania interakcji przestrzennych, ale konsekwentnie nie osiągały wyników w scenariuszach wymagających precyzyjnego rozumowania czasowego lub w przypadkach, gdy sytuacje nacisku kontekstowego szybko zmieniają się w czasie14,15. W przeciwieństwie do tych podejść, nowsze frameworki oparte na transformerach wykazują swoją przewagę w analityce sportowej, rozpoznawaniu aktywności ludzkiej oraz zadaniach wideo-językowych poprzez wspólną integrację dalekosiężnych wskazówek czasowych, relacji przestrzennych i sygnałów kontekstowych w jednym podaniu do przodu, umożliwiającej globalną samouwagę. Takie wyniki benchmarkowe uzasadniają wybór architektury opartej na transformatorze jako podstawy proponowanego modelu w obecnym badaniu.

Poszerzanie wiedzy taktycznej i zrozumienie zasad taktycznych okazało się kluczowe dla rozwiązywania ograniczeń gry i problemów16,17. Piłkarze uczą się różnych elementów gry, w tym penetracji, ochrony ofensywnej, ruchu, czasu, ograniczeń, ochrony obronnej, balansowania i skupienia, poprzez szkolenie techniczno-taktyczne18. W miarę zdobywania doświadczenia piłkarskiego ich zrozumienie technicznych i taktycznych podstaw powinno się poprawiać. Gracze mogą więc łatwiej rozpoznawać istotne sygnały, co ułatwia odpowiednie podejmowanie decyzji dla każdej zasady gry w danym scenariuszu19. Dzięki temu gracze mogą wykorzystywać swoją efektywność motoryczną i umiejętności podejmowania decyzji, aby uzupełnić wzorce ruchu specjalistycznymi umiejętnościami.

Autor wykorzystał decyzje wieloatrybutowe do analizy korzyści fitness płynących z ćwiczeń i nawyków, ilustrując skuteczność wykwalifikowanej zdolności treningowej w wychowaniu fizycznym wśród studentów. Efektywna aktywność fizyczna, rozwijanie zdrowych nawyków fitness oraz działania na rzecz reform w sposobie przedstawiania sportu w instytucjach edukacyjnych są traktowane z dużą wagą. Intuicjonistyczna rozmyta średnia heronijska (IFWHM) z pomocą liczb rozmytych jest wykorzystywana do efektywnego podejmowania decyzji. Wynik ten wspierał sukces poznawczy studentów i wykazał dokładniejszą ocenę ich problemów z dobrostanem fizycznym. Aby wykryć ukryte powiązania w danych, badacz20 zastosował rozszerzoną metodę Apriori. Wnioski z badań mają znaczenie dla oceny zdrowia fizycznego studentów w szkolnictwie wyższym. Pierwszy wynik ustala się na podstawie oceny zmęczenia różnych orientacji w zależności od częstotliwości ich występowania.

Wcześniejsze badania oparte na AI w analityce sportowej koncentrowały się na zadaniach związanych z widzeniem komputerowym, w tym wykrywaniu zawodników, śledzeniu i rozpoznawaniu aktywności grupowych. Niedawne, słabo nadzorowane i wolne od detektorów architektury ujawniły znaczenie modelowania multimodalnego i świadomego kontekstu w zrozumieniu zachowań taktycznych. Te postępy wymagają integracji multimodalnego głębokiego uczenia do klasyfikacji decyzji taktycznych w piłce nożnej. Wykorzystując ukryte wektory cech uzyskane z macierzy użyteczności poprzez faktoryzację macierzy, oblicza podobieństwo cosinusowe między użytkownikami a użytkownikami lub elementami i elementami opisanymi w tym artykule.

Najnowsze badania w dziedzinie analityki sportowej przesunęły się w kierunku multimodalnych i kontekstowo świadomych ram głębokiego uczenia, które łączą wideo, dane pozycyjne oraz wskazówki kontekstowe do interpretacji zachowań taktycznych. Różne podejścia oparte na transformatorach wykazały silne możliwości modelowania długodystansowej struktury czasowej i relacji międzymodalnych w środowiskach sportowych, w tym: MM-ViT do rozpoznawania akcji multimodalnych, zintegrowane transformatory fuzyjne kontrastujące do rozumowania kontekstu sportowego oraz detektory zdarzeń sterowane przez uwagę,21,22. Te podejścia wskazują, że decyzje taktyczne najlepiej reprezentować za pomocą architektur rejestrujących interakcje między graczami, przestrzeń, wskazówki ruchu i informacje kontekstowe, a nie modele CNN-LSTM oparte na pojedynczych modalnościach. W tym kierunku proponowane badanie będzie również wykorzystywać wielofunkcyjne ramy fuzji oparte na transformatorach, aby wspólnie przetwarzać sygnały wizualne, pozycyjne i kontekstowe do niemal w czasie rzeczywistym modelowania taktycznych decyzji futbolowych.

Poprzednie modele analizy piłkarskiej opierały się zazwyczaj na architekturze CNN-LSTM lub BiLSTM, które przechwytują lokalne wzorce czasowe, ale mają trudności z długoterminowymi zależnościami między modalnościami. Transformery wypełniają tę lukę, stosując globalną samouwagę, pozwalając modelowi łączyć ruchy zawodników, trajektorie piłki i sytuacyjne wskazówki w rozszerzonych oknach czasowych – kluczowe możliwości dla solidnej analizy decyzji taktycznych. Aby rozwiązać problem rzadkości w danych oceniających systemy rekomendacyjne, autor23,24 zaproponował technikę czynnikowania macierzy opartej na recenzjach, łączącą filtrację opartą na recenzjach oraz imputację ocen.

Niemniej jednak ich skuteczność, skalowalność i zastosowanie metod są poważnie ograniczone przez uzależnienie od ramek ograniczających do wnioskowania oraz ogromne zapotrzebowanie na etykietowanie danych. Jedną z metod rozwiązania tego problemu jest użycie etykiet ramek ograniczających do jednoczesnego trenowania wykrywania zawodników i rozpoznawania aktywności grupowej na 25,26,27,28. Chociaż adnotacje ograniczających pudełek na poziomie aktora są nadal potrzebne do treningu, proponowana metoda oblicza ramki ograniczające graczy podczas wnioskowania. Podejście Weakly Supervised Group Activity Recognition (WSGAR), które nie wymaga etykiet na poziomie aktora do treningu czy wnioskowania, ma na celu zmniejszenie obciążenia adnotacją. Po wygenerowaniu sugestii ramek ograniczających za pomocą wcześniej wytrenowanego detektora na zewnętrznym zbiorze danych, nauczyli się filtrować nieistotne detekcje. Niedawno,29 lat, naukowcy przedstawili podejście bez detektorów do wyzwania WSGAR, które wykorzystuje osadzenia tokenów do generowania częściowych kontekstów zbierających informacje o zawodniku.

W analizie sportowej architektury multimodalne i oparte na transformatorach zyskały ostatnio na znaczeniu, ponieważ potrafią przechwytywać długoterminowe wzorce czasowe i integrować heterogeniczne strumienie danych30,31. Warianty transformatorów zostały zastosowane do prognozowania ruchów graczy, przeprowadzania analizy taktyki wielowidokowej oraz rozpoznawania zamiaru działania, co wykazuje się doskonałą rozumowością czasową w porównaniu z modelem CNN-LSTM. Strategie fuzji multimodalnej, łączące wskazówki wideo, pozycyjne i kontekstowe, przyniosły obiecujące wczesne wyniki w modelowaniu taktycznym w czasie rzeczywistym i podkreśliły znaczenie wzajemnej uwagi oraz uczenia się sekwencja po sekwencji w rozumieniu dynamiki decyzji w grze.

Frameworki multimodalne oparte na transformerach ostatnio wykazały się znakomitą wydajnością w różnych sektorach, gdzie konieczna jest integracja różnorodnych strumieni danych. Na przykład wielomodalne modele fuzji oparte na ViT zostały wykorzystane do wspólnej interpretacji informacji wideo, pozycji i dźwięku, wykorzystując procesy cross-attention do przewidywania zdarzeń świadomych kontekstowo, śledzenia gracza oraz rozpoznawania akcji32,33. Ponadto architektura oparta na MM-Former i Perceiver przewyższyła modele rekurencyjne i splotowe w łączeniu sygnałów przestrzenno-czasowych, a także w długodystansowym rozumowaniu czasowym, w analityce sportowej i analizie aktywności ludzkiej34. Wyniki te wspierają zastosowanie architektury multimodalnej fuzji opartej na transformatorach w tym badaniu, wskazując, że transformatory są zdolne do rejestrowania drobnoziarnistych interakcji między modalnościami poprzez globalną uwagę35. Transformatory są szczególnie odpowiednie do analizy taktycznej, ponieważ ich globalna uwaga pozwala modelowi łączyć wskazówki wizualne, dane pozycyjne i sygnały kontekstowe w dłuższych oknach czasowych, których modele CNN-LSTM i BiLSTM nie posiadają.

Poprzednie badania głównie wykorzystywały ręcznie kształtowane i uwierzytelniane oceny do oceny szybkości i dokładności decyzji w wcześniej ustalonych aktywnościach, takich jak jazda samochodem czy wydawanie, mimo rosnącego zainteresowania oceną podejmowania decyzji taktycznych w sportach drużynowych 36,37,38. Te ramy mają granice skalowalności, obiektywizmu i odpowiedniości do dynamicznych, rzeczywistych sytuacji, mimo że dostarczają wartościowych danych o zachowaniu zawodników i doskonałości podejmowania decyzji39. Komputerowe podejścia oparte na danych, które pozwalają rejestrować i rozumieć multimodalny charakter taktycznego podejmowania decyzji, obejmujące złożone powiązania między działaniami gracza, sygnałami wizualnymi, sygnałami dźwiękowymi i ustawieniami gry, nie są połączone w obecne metody 40,41,42. Dodatkowo, wieloaspektowe struktury AI, które mogą przełączać się między relacjami tła a czasowymi, są często pomijane przez te metody. Rozwój opartego na Transformerze multimodalnego frameworka fuzyjnego, który wykorzystuje bogate źródła danych w czasie rzeczywistym, takie jak nagrania wideo i śledzenie pozycji, oraz integruje procesy decyzyjne w sportach drużynowych, wyraźnie brakuje. Zmniejszenie tej luki może znacząco zwiększyć taktyczną penetrację, skalowalność i niezależność podejmowania decyzji w środowiskach sportowych o wysokich osiągnięciach. W przeciwieństwie do obecnych metodologii CNN-LSTM i BiLSTM, ta fuzja oparta na transformatorach świadomie modeluje międzymodalną uwagę pomiędzy informacjami wizualnymi, przestrzennymi i kontekstowymi. Taka nowość sprzyja gęstszej reprezentacji taktycznej i pomaga zminimalizować błędne klasyfikacje podczas scenariuszy presji o ponad 40%.

Głównym celem tego badania jest opracowanie ram multimodalnej fuzji opartej na transformatorach do oceny podejmowania decyzji taktycznych w futbolu. Chociaż proponowane ramy można uogólnić na inne sporty zespołowe, to badanie koncentruje się na piłce nożnej ze względu na złożoność taktyczną oraz dostępność ustrukturyzowanych zbiorów danych. System umożliwia uporządkowaną ocenę taktycznej dokładności i czasu reakcji w kontrolowanych, izolowanych zadaniach piłkarskich, opartą na ocenach ekspertów. Praca ta rozwiązuje ograniczenia środowisk manualnej oceny i statycznych testów poprzez integrację multimodalnych źródeł danych, w tym śledzenia pozycji, nagrań wideo, sygnałów audio oraz kontekstowych informacji z gry.

Wykorzystując procesy uwagi oparte na transformatorach, proponowany framework nieustannie uczy się powiązań multimodalnych, umożliwiając jednolitą i świadomą kontekstu interpretację metod podejmowania decyzji w czasie rzeczywistym przez graczy.

Głównym celem tego orzeczenia jest promowanie inteligentnej oceny wyników w sporcie poprzez zapewnienie trenerom i analitykom głębszego zrozumienia myślenia zawodników i dynamiki zespołu dzięki analizie opartej na danych.

Proponowane ramy będą nieustannie uczyć się relacji intermodalnych, wykorzystując mechanizmy uwagi transformerów, umożliwiając uzyskanie jednolitego zrozumienia strategii podejmowania decyzji graczy w grach w czasie rzeczywistym.

Dzięki temu system daje możliwość dostarczania praktycznych wglądów w zachowania taktycznego, które w innym przypadku trudno byłoby scharakteryzować standardowymi metodami oceny.

Celem jest zwiększenie interpretowalności oraz dostarczenie trenerom i analitykom bardziej użytecznych informacji.

Główny wkład tej pracy przedstawiono poniżej:

Niniejsze badanie wykorzystuje wielometodowy projekt fuzji oparty na Transformerze, aby przedstawić nowy model głębokiego uczenia do analizy taktycznych decyzji w sportach drużynowych.

Poprzez integrację wizualnych, pozycyjnych i kontekstowych strumieni danych wyciągniętych z rzeczywistych nagrań z meczów, podejście to znacząco rozszerza zakres prostych metod oceny wprowadzonych w badaniu bazowym, które koncentrowały się na samotnych wymijaniach i akcjach drive.

Koder multimodalny zbiera zaawansowane relacje przestrzenno-czasowe poprzez integrację danych śledzenia zawodników, ramek wizualnych oraz kontekstowych wydarzeń dopasowania z wykorzystaniem mechanizmów uwagi.

Eksperymenty na benchmarkowym zbiorze danych futbolu wykazały, że model ten przewyższał tradycyjne bazy, takie jak metody fuzji oparte na CNN i LSTM.

W porównaniu z bazami CNN-LSTM, BiLSTM-Attention i GNN, sugerowana architektura multimodalnej fuzji oparta na transformatorach wykazuje znaczące wzrosty.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Badanie objęło 40 mężczyzn w wieku 18-24 lat (średnia = 20,1 ± 1,2), rekrutowanych z czterech amatorskich i półprofesjonalnych klubów w jednej lidze regionalnej. Wszyscy uczestnicy mieli co najmniej trzy lata doświadczenia w zawodach i obecnie szkolili się w uporządkowanym środowisku. Zbieranie danych odbywało się w dwóch kontrolowanych warunkach: po pierwsze, w ustandaryzowanych ćwiczeniach na placu treningowym, które symulowały taktyczne scenariusze decyzji o podaniu/wejściu; po drugie, w długotrwałych sesjach symulacji dopasowania, z których wyciągano sekwencje multimodalne. Wszystkie procedury zostały zatwierdzone przez Komitet Etyki Instytucjonalnej Uniwersytetu Beibu Gulf (nr zatwierdzenia: BG-PE-2023-117), a przed zebraniem danych uzyskano pisemną świadomą zgodę wszystkich uczestników. Podczas prowadzenia tego dochodzenia przestrzegano międzynarodowych i instytucjonalnych standardów etycznych. Komitet Etyki Instytucjonalnej Uniwersytetu Beibu Gulf przeanalizował i zatwierdził wszystkie procedury dotyczące osób (nr zatwierdzenia: BG-PE-2023-117). Przed zebraniem danych każdy uczestnik wyraził pisemną świadomą zgodę, a wszystkie zebrane dane zostały zanonimizowane przed analizą.

Praca ta ma na celu automatyzację i usprawnienie badania podejmowania decyzji taktycznych w sportach drużynowych poprzez architekturę Multimodal Fusion opartą na Transformerach. Wykorzystuje różnorodne źródła danych, w tym wideo, audio, lokalizację przestrzenną oraz metadane odtwarzacza, aby stworzyć solidny model predykcyjny w czasie rzeczywistym. Rysunek 1 przedstawia architekturę proponowanej metody. Proponowane prace składają się z pięciu etapów. Etapy opisano poniżej:

Rysunek 1
Rysunek 1. Architektura proponowanej metody. Schemat modelu łączący wejścia multimodalne i komponenty klasyfikacyjne do podejmowania decyzji taktycznych. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Pozyskiwanie i wstępne przetwarzanie danych

Dane z różnych metod pozyskują nagrania meczów, takie jak transmisje wideo, komentarze audio, informacje GPS/pozycjonowania oraz wskaźniki wydajności zawodników. Każda modalność przechodzi wstępne przetwarzanie w formie takich technik jak ekstrakcja klatek (dla wideo), filtrowanie szumów (dla dźwięku) oraz normalizacja (dla odczytów sensorów), zapewniając synchronizację w etapach czasowych.

Klatki wideo były wyodrębniane z prędkością 25 klatek na ps, próbkowane do 224 × rozdzielczości 224. Sygnały audio były przetwarzane za pomocą filtra pasmowego o częstotliwości od 300 do 3 400 Hz, aby wyeliminować większość hałasu środowiskowego. Dane śledzenia pozycyjnego z czujników GPS były rejestrowane przy częstotliwości 10 Hz i interpolowane za pomocą liniowej interpolacji opartej na znacznikach czasu, co zapewniało zgodność z osi czasu wideo o częstotliwości 25 Hz. Wszystkie dane wejściowe były wyrównywane czasowo za pomocą wspólnych znaczników czasu, a ich skale normalizowano za pomocą punktacji z.

Ekstrakcja cech

Aby zebrać informacje przestrzenno-czasowe danych wideo, stosuje się 3D CNN. 3D CNN przetwarzają zarówno informacje przestrzenne, jak i czasowe w klatkach wideo, dzięki czemu model jest zdolny do wykrywania wzorców ruchu, rozumienia zachowań grup oraz wydobywania cech opartych na ruchu. Operacja ta generuje gęstą reprezentację cech dla każdej sekwencji akcji, która służy jako wizualne wejście do modelu. Każdy klip wejściowy zawierał 16 kolejnych klatek próbkowanych z krokiem 2. Podczas treningu stosowano losowe przycinanie, poziome flipowanie oraz normalizację jasności. 3D CNN zostało zoptymalizowane przy użyciu Adama (lr = 0,0001), wielkości partii 16 oraz strat entropii krzyżowej.

Osadzanie i wyrównywanie wejść multimodalnych

Następnie osadzenia z różnych modalności są integrowane z wyjściami 3D CNN. Stosuje się wielomodalną architekturę modelu transformatora, z różnymi gałęziami enkodera obsługującymi każdą modalność. Warstwy cross-attention są wykorzystywane do fuzji i wyrównania modalności, co pozwala modelowi uchwycić współzależności (np. między miejscami zawodników a ruchem piłki oraz kontekstem z komentarza). Ta fuzja pozwala na wzbogacone kontekstowe zrozumienie aktualnych wyborów taktycznych. Zaimplementowano też wszystkie osadzenia w PyTorch. Cechy wideo były projektowane liniowo z 1 024 do 512 wymiarów, a cechy audio i pozycyjne odpowiednio do 256 i 128 wymiarów, zjednoczone do 512 wymiarów przed wyrównaniem czasowym.

Fuzja wielomodalna oparta na transformatorach

Do łączenia cech wyodrębnionych ze wszystkich źródeł stosuje się transformator multimodalny. Mechanizmy samouwagi w transformatorze umożliwiają modelowi naukę współzależności między modalnościami (np. wizualne + audio), uchwycenie przepływu czasowego i kontekstu oraz podkreślanie taktycznie istotnych ram i zdarzeń. Efektem tego etapu jest złożona reprezentacja, która oddaje intencje taktyczne oraz kontekst sytuacyjny każdej podjętej decyzji. Transformator multimodalny składał się z sześciu warstw enkodera, z których każda miała osiem głowic uwagi. Macierze uwagi obliczano przy użyciu skalowanej uwagi w iloczynie skalarnym. Warstwy uwagi i feed-forward również zawierały dropout z p = 0,1, aby uniknąć nadmiernego dopasowania.

Taktyczna klasyfikacja i ocena decyzji

Na koniec, fuzowana reprezentacja jest dostarczana jako wejście do warstwy klasyfikacyjnej lub bloku analizy decyzji, który służy do prognozowania typu decyzji taktycznego, oceny jakości decyzji oraz opcjonalnego generowania wyjaśnionych wniosków dla trenerów poprzez mapy cieplne uwagi lub mapy aktywacji. Wyniki tego etapu dostarczają ilościowej i jakościowej oceny zdolności decyzyjnej drużyny lub zawodnika podczas gry meczowej.

Głowica klasyfikacyjna wykorzystywała trójwarstwowy MLP z aktywacją ReLU, a następnie warstwą softmax. Model był trenowany na podziale 70/15/15 z dziesięciokrotną walidacją krzyżową. Stosowane metryki to dokładność, precyzja, przywołanie, wynik F1, opóźnienie i AUC.

Uproszczeniowy schemat przepływu, podsumowujący pięć etapów, zapewnia natychmiastowy wizualny przegląd procesu sekwencyjnego, jak pokazano na Rysunku 2. Ten rysunek zwięźle przedstawia cały proces badawczy, obejmujący akwizycję danych, wstępne przetwarzanie, ekstrakcję cech, fuzję multimodalną oraz klasyfikację decyzji taktycznych, a następnie szczegółowe opisy każdego etapu.

Rysunek 2
Rysunek 2. Ogólny przebieg procesu badawczego. Przegląd toku badań, od zbierania i wstępnego przetwarzania danych po ekstrakcję cech, trenowanie modeli i ocenę. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Rysunek 3 przedstawia ogólny przebieg sugerowanego procesu badawczego. Proces rozpoczyna się etapem 1: Akwizycja i wstępne przetwarzanie danych, podczas którego zbierane są i synchronizowane multimodalne źródła danych, takie jak wideo, audio, śledzenie pozycyjne oraz kontekstowe metadane. W etapie 2: Ekstrakcja cech wykorzystywane są 3D konwolucyjne sieci neuronowe (3D CNN) do wydobywania informacji przestrzenno-czasowych ze strumieni wideo, co skutkuje gęstymi wizualnymi reprezentacjami działań graczy i przepływu taktycznego. Etap 3: Osadzanie i wyrównanie wejść multimodalnych łączy cechy audio, wideo i pozycyjne w wspólną przestrzeń ukrytą, z wyrównaniem czasowym i międzymodalnym. Te reprezentacje są następnie agregowane w etapie 4: Fuzja multimodalna oparta na transformatorze, gdzie mechanizmy międzymodalne i samorefleksyjne pozwalają modelu poznać współzależności między modalnościami i uzyskać głębsze kontekstowe wglądy w decyzje taktyczne. Na koniec, w etapie 5: Klasyfikacja i ocena decyzji taktycznych, połączone reprezentacje są wprowadzane do warstwy klasyfikacji, aby wykrywać decyzje taktyczne, takie jak mijanie, jazda czy trzymanie. Tymczasem metryki wydajności są wykorzystywane do szacowania dokładności podejmowania decyzji i czasu reakcji. Ten schemat blokowy przedstawia jasny przegląd podejścia krok po kroku, uzupełniony rozbudowanymi opisami tekstowymi przedstawionymi w kolejnych sekcjach.

Rysunek 3
Rysunek 3. Sekwencyjny proces przetwarzania. Przedstawia krok po kroku proces od pozyskiwania danych do taktycznej klasyfikacji decyzji i wyników modelu. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Pozyskiwanie i wstępne przetwarzanie danych

Aby umożliwić analizę decyzyjną na wysokim poziomie taktycznym w sportach drużynowych za pomocą wielomodalnego pipeline'u fuzji z wykorzystaniem Transformera, utworzono ustrukturyzowany i wysokiej jakości system akwizycji i wstępnego przetwarzania danych. Konfiguracja polega na łączeniu wielu modalności danych, w tym nagrań wideo, śledzenia pozycji zawodników, sygnałów dźwiękowych z interakcji zawodnika z trenerem oraz kontekstowych metadanych, takich jak faza meczu, struktura drużyny i obszary posiadania piłki.

Próba badawcza składała się z 40 mężczyzn w wieku 20 lat i starszych, wszyscy aktywnie zaangażowani w regionalne ligi amatorskie i półprofesjonalne piłkarskie. Każdy z nich został rekrutowany z czterech konkurencyjnych klubów, które miały ustrukturyzowany program treningowy. Średni wiek zawodników wynosił 20,1 ± 1,2 roku, średni wzrost 177,5 ± 3,1 cm i średnią wagę 72,6 ± 2,9 kg. Grali dla swoich klubów średnio przez 6,8 ± 1,5 roku. Wszyscy uczestnicy mieli co najmniej trzy lata doświadczenia zawodowego i uznano ich za taktycznie kompetentnych.

Aby zapewnić moc statystyczną, wielkość próby została przybliżona przy użyciu 95% poziomu wiarygodności (Z = 1,96) oraz poziomu istotności 5%, z oczekiwanym współczynnikiem korelacji wewnątrzklasowej (ICC) na poziomie 0,96 i 95% przedziałem ufności, co odzwierciedla niemal idealną zgodność. Jest to zgodne z celem weryfikacji wiarygodności i spójności zebranych danych o podejmowaniu decyzji multimodalnych27.

Aby zapewnić powtarzalność, ustawienia pozyskiwania i specyfikacje techniczne zostały ustandaryzowane w poszczególnych sesjach. Dane wideo były nagrywane w rozdzielczości 1080p i 25 klatek na sekundę za pomocą kamer GoPro Hero4 z szerokim polem widzenia, aby uchwycić pełną przestrzeń taktyczną. Każde nagranie było stabilizowane i montowane na stałej wysokości 2,5 m. Sygnały audio były rejestrowane za pomocą zewnętrznego mikrofonu pola z częstotliwością próbkowania 44,1 kHz (mono), a następnie filtrowane za pomocą filtra pasmowego 300-3 400 Hz, aby usunąć zakłócenia środowiskowe. Dane dotyczące śledzenia pozycji zbierano za pomocą noszonych czujników GPS pracujących przy częstotliwości 10 Hz, ze średnią dokładnością pozycyjną raportowaną przez producenta ±0,5 m. Wszystkie modalności były synchronizowane za pomocą wspólnych znaczników czasowych i przewzorkowane do wspólnej linii czasu 25 Hz poprzez interpolację liniową.

Następnie wstępne przetwarzanie obejmowało następujące: redukcję próbkowania wideo do 224 × rozdzielczości 224, próbkowanie klatek 16 kolejnych klatek z krokiem 2, losowe przycinanie, poziome przewracanie, normalizację jasności, normalizację dźwięku i filtrowanie szumów oraz normalizację zmiennych i kontekstowych z-score.

Skrypt wstępnego przetwarzania jest ułożony w następującej kolejności dla powtarzalności: (i) ekstrakcja ramek; (ii) filtrowanie dźwięku; (iii) interpolacja GPS; (iv) modalny przewzorkowanie do 25 Hz; (v) normalizacja wyniku z; oraz (vi) testy integralności pod kątem korupcji, zatarcia i przerwy w systemach. Skrypty przetwarzania wsadowego są używane do automatycznego ukończenia każdego etapu.

Aby zachować wiarygodność danych, kryteria kontroli jakości i wykluczania obejmowały: i) sekwencje z >20% zasłanianiem odtwarzacza, ii) przerwanie GPS przekraczające 200 ms, iii) uszkodzony lub przycięty dźwięk oraz iv) silne rozmycie ruchu lub desynchronizację między modalnościami. Łącznie 17 sekwencji (3,4%) zostało wykluczonych z powodu tych schorzeń. Tabela 1 przedstawia opis zbioru danych.

AtrybutySzczegóły
SportPiłka nożna (Soccer)
Uczestnicy40 mężczyzn w futbolu amerykańskim
Poziom gryZawodnicy futbolu amerykańskiego z ≥5 lata doświadczenia
Typ testuTest podejmowania i wykonywania decyzji podaniami i wejściami (kontrola piłki)
Ustawienia testoweUstandaryzowane boisko piłkarskie, oznaczone strefy, stałe pozycje
Narzędzia pomiaroweKamery GoPro Hero4, oprogramowanie Kinovea, pomiar czasu stopera
Zebrane daneCzas wykonania (ET), dokładność podejmowania decyzji (DM), liczba poprawnych działań
Procedura testowaZawodnicy reagowali na bodźce wizualne od trenerów i wykonywali podania lub wejścia
Powtórzenia próbne10 prób na zawodnika (5 podań, 5 prób)
OcenaEksperci oceniali DM; ET mierzone za pomocą znaczników czasu/wideo
Zmienne wynikoweCzas reakcji, poprawna liczba decyzji, wynik technicznej egzekucji

Tabela 1: Opis zbioru danych. Szczegółowo opisuje dane demograficzne uczestników, procedury testowania, narzędzia pomiarowe oraz zmienne wynikowe.

W niniejszym badaniu wykorzystano dwa powiązane, ale odrębne zestawy danych. Pierwszy zbiór danych obejmował 40 zawodników uczestniczących w zadaniach kontrolowanych podaniowych/drive, głównie służących do ustalenia niezawodności bazowej i weryfikacji podstawowej procedury pomiaru decyzji. Drugi zbiór danych zawiera 500 multimodalnych sekwencji taktycznych zebranych z rozszerzonych symulacji meczów oraz nagrań z rzeczywistych meczów. Sekwencje te stanowiły główny zbiór danych treningowych i testowych dla modelu fuzji opartego na transformatorze, umożliwiając ocenę w bardziej ekologicznych warunkach.

Chociaż zbiór danych obejmuje 500 sekwencji multimodalnych, stratyfikowane próbkowanie zapewniło zrównoważoną reprezentację w akcjach taktycznych (Przejdź, Napędz, Zatrzymaj). Stosowane były również podejścia do augmentacji danych, takie jak temporalne przycinanie i tasowanie sekwencji, aby zwiększyć zmienność i złagodzić błędy modelu podczas treningu.

Warto zauważyć, że w początkowej weryfikacji i testowaniu wiarygodności modelu użyto 40-osobowy zbiór danych, podczas gdy większa kolekcja 500 sekwencji multimodalnych została opracowana na podstawie długotrwałych nagrań meczów i zorganizowanych sesji szkoleniowych w celu oceny skalowalności i ekologicznej wartości ramy. Niezawodność bazowa została ustanowiona przy użyciu mniejszego zbioru danych, podczas gdy większy zbiór umożliwiał trenowanie i testowanie modeli na dużą skalę.

Opis zbioru danych

W eksperymencie wzięło udział 40 mężczyzn, z których każdy miał co najmniej pięć lat federacyjnego doświadczenia zawodniczego, aby upewnić się, że populacja próby posiada podstawowe kompetencje techniczne i taktyczne. Zbieranie danych odbywało się w ustandaryzowanym układzie boiska piłkarskiego, gdzie przypisano wcześniej wyznaczone strefy i pozycje do gry, aby zapewnić identyczne warunki testowe. Podczas eksperymentów uczestnicy musieli reagować na wizualne wskazówki trenera, podając lub wbijając piłkę, naśladując decyzje taktyczne podjęte w rzeczywistym meczu. Każdy uczestnik ukończył łącznie 10 prób, pięć zdawalnych i pięć za kierownicą. Ruchy te były rejestrowane kamerami GoPro Hero4, a dane dotyczące wydajności mierzono za pomocą oprogramowania Kinovea do analizy wideo wraz z ręcznym stoperem do rejestracji czasu wykonania (ET). Głównym źródłem danych były: czas realizacji, jakość Mistrza Gry oceniana przez doświadczonych trenerów oraz ilość poprawnych wykonanych działań. Czynniki te stanowiły ilościowe podstawy do analizy, jak szybko i skutecznie gracze podejmowali i realizowali decyzje taktyczne w warunkach kontrolowanych bodziec-reakcja. Powstały zbiór danych to ustrukturyzowany i oznaczony zasób, doskonale przystosowany do tworzenia benchmarków lub trenowania inteligentnych systemów, mających na celu modelowanie myślenia taktycznego i reakcji motorycznych w kontekstach sportów drużynowych.

Próba jest ograniczona do młodych zawodników z jednej ligi regionalnej, co może ograniczać jej uogólnienia w różnych grupach wiekowych, sportsmenkach lub innych kulturach. Przyszłe badania będą próbować pozyskać bardziej reprezentatywne i zróżnicowane próby.

Kolejnym ograniczeniem jest liczba 40 młodych mężczyzn z jednej ligi regionalnej. Chociaż jednorodna próba przyczyniła się do wewnętrznej trafności i zmniejszenia zmienności wyników ze względu na wiek, płeć i różnice w tle taktycznym, ogranicza ona również uogólnienie wyników na szerszą populację. Wzorce taktyczne, których model się uczy, mogą więc odzwierciedlać styl gry specyficzny dla regionu lub płci, a nie uniwersalne zachowania decyzyjne. W tym badaniu zastosowano stratyfikowane próbkowanie i uzupełnianie danych, aby zwiększyć zmienność dostępnych danych; Jednak potrzebne są badania na większą skalę z udziałem sportsmenek, młodzieżowych zawodniczek, zawodowych zawodniczek oraz uczestników z różnych kultur taktycznych, aby potwierdzić solidność modelu w różnych środowiskach piłkarskich. Wyniki te wykazują duże obietnice, ale wymagają dalszej weryfikacji na bardziej zróżnicowanych i większych zbiorach danych, zanim można będzie można twierdzić szersze uogólnienie.

Aby zmniejszyć subiektywność, trzech profesjonalnych trenerów futbolu niezależnie oznaczyło wybory taktyczne. Niezawodność między oceniającymi oszacowano za pomocą współczynnika korelacji wewnątrzklasowego (ICC = 0,96, CI 0,94-0,98), co wskazuje na niemal doskonałą zgodność. Dyskusja konsensualna rozwiązała spór. W przypadku danych multimodalnych wstępne przetwarzanie polegało na synchronizacji czasowej między modalnościami (wideo 25 fps i dane z czujnika 10 Hz) oraz normalizacji cech za pomocą punktu z, aby umożliwić porównywalność między modalnościami.

Niezawodność między oceniającymi została zmierzona za pomocą dwukierunkowego współczynnika korelacji wewnątrzklasowego (ICC [2,3]), ponieważ nadaje się do oceny bezwzględnej zgodności między wieloma oceniającymi. ICC na poziomie 0,96 (95% CI: 0,94-0,98) wskazuje na niemal doskonałą zgodność zgodnie z powszechnie stosowanymi progami i dodatkowo potwierdza, że etykiety decyzyjne taktyczne używane podczas szkolenia były wysoce wiarygodne. Niezawodność była obliczana we wszystkich 500 sekwencjach multimodalnych, zapewniając, że zarówno konteksty kontrolowane, jak i symulacyjne dopasowania były odpowiednio i konsekwentnie komentowane.

Procedura adnotacji i protokół etykietowania

Wszystkie sekwencje multimodalne były anotowane za pomocą ustrukturyzowanego, trzyetapowego protokołu. Najpierw trzech licencjonowanych trenerów futbolu amerykańskiego niezależnie przejrzyło każdą sekwencję pozycji, korzystając z interfejsu adnotacji zsynchronizowanego ze znacznikami czasowymi (Kinovea + arkusz do niestandardowego tagowania). Anotatorzy oznaczali kategorię decyzji taktycznych (Wyprzedzanie, Drive, Hold), wskazówki kontekstowe (strefa nacisku, dostępność pasów wyprzedzania) oraz znaczniki czasu zdarzeń. Po drugie, skrypt wykrywający niezgodę automatycznie identyfikował przypadki niejednoznaczności lub konfliktu, które następnie były rozpatrywane podczas wspólnego spotkania konsensusu. Po trzecie, aby zapewnić spójność w oznaczaniu granic zdarzeń i wyrównaniu czasowym między modalnościami, przeprowadzono końcowe przejście przez niezależnego starszego analityka. Proces ten, na potrzeby późniejszego treningu modeli, zapewniał, że każda adnotacja była śledzitelna i miała najlepszą jakość.

Wstępne przetwarzanie

Podczas gdy obecne badanie przeprowadzono na 500 sekwencjach multimodalnych, proces wstępnego przetwarzania został zaprojektowany z myślą o dużych zbiorach danych. Wszystkie modalności przechodziły automatyczne skrypty, które równolegle grupowo wyodrębniały klatki wideo, próbkowały dźwięk, interpolowały dane pozycyjne oraz stosowały normalizację z-score. Obecność architektury modułowej pozwala na niezależne wstępne przetwarzanie każdej modalności na oddzielnych wątkach GPU/CPU. To umożliwia dużą ilość nagrań z meczów. Zapewnia to, że workflow można łatwo skalować do pełnosezonowych zbiorów danych bez ręcznej ingerencji i sprawia, że ramy są odpowiednie do praktycznego zastosowania w profesjonalnych środowiskach analitycznych.

Aby właściwie zbadać podejmowanie decyzji taktycznych w sportach drużynowych, surowe dane z różnych modalności – np. klipy wideo, sygnały audio i nagrania pozycyjne – muszą być wstępnie przetworzone i wyrównane. Ilustracja wejścia multimodalnego to

Równanie 1   (1)

Tutaj V oznacza się serię charakterystyk wideo wyodrębnionych z enkodera CNN.

Równanie 2   (2)

Tutaj A jest cechą audio kodowaną przez wave2vec.

Równanie 3   (3)

P oznacza pozycję współrzędnych gracza w czasie ti.

Aby radzić sobie z asynchronicznymi częstotliwościami próbkowania, każda modalność jest resamplowana lub interpolowana do wspólnej osi czasu:

Równanie 4   (4)

Tutaj Równanie 5, jest zsynchronizowaną charakterystyką ft , to szybkość układu zbiorczego, Xm to początkowa wskazańca.

Dla równomiernej skali między modalnościami wszystkie wektory cech są znormalizowane w wyniku z-score:

Równanie 8   (5)

μX i σX oznaczają średnią i odchylenie standardowe wymiaru cech w zbiorze treningowym.

Chociaż głównym tematem są decyzje dotyczące podań i wejścia, dodano kanały audio (np. komunikację zawodnika/trenera, wskazówki środowiskowe), aby uwzględnić sytuacje w rzeczywistym meczu, gdzie sygnały mowy wpływają na taktyczną reakcję. Hiperparametry (np. tempo uczenia się, epoki) zostały wybrane za pomocą wyszukiwania siatkowego oraz istniejących ewaluacji w uczeniu multimodalnym, co wyważyło stabilność zbieżności z efektywnością obliczeniową.

Hiperparametry sugerowanego frameworka – tempo uczenia się, wielkość partii i epoki treningowe – zostały wybrane za pomocą dobrze zaplanowanego systematycznego wyszukiwania siatkowego, aby osiągnąć zarówno stabilność zbieżności, jak i efektywność obliczeniową. Wybór szybkości uczenia na poziomie 0,0001 z optymalizatorem Adama okazał się zapewniać stabilne aktualizacje gradientu bez oscylacji, podczas gdy rozmiary wsad były optymalizowane, aby zrównoważyć pojemność pamięci GPU z przepustowością treningową. Ustawienie 50-100 epok zostało wykorzystane, aby umożliwić odpowiednie uczenie się bez nadmiernego dopasowania, co potwierdzają śledzenie strat walidacyjnych oraz 10-krotna walidacja krzyżowa. Wartości te nie były ustalane arbitralnie, lecz były kierowane wcześniejszymi testami w uczeniu multimodalnym i korygowane przez eksperymentalne próby na obecnym zbiorze danych. Ten rygorystyczny proces gwarantował, że wybrane hiperparametry ułatwiały stabilne trenowanie modeli i powtarzalne poprawy wydajności w porównaniu do podejść bazowych.

Chociaż zadanie klasyfikacyjne koncentruje się na decyzjach dotyczących podań/drive/hold, celowo uwzględniono informacje audio, ponieważ rzeczywiste zachowanie taktyczne w futbolu jest silnie kształtowane przez komunikację między zawodnikiem a trenerem, sygnały sygnałów z drużyny, sygnały pressingu oraz dźwięki otoczenia (np. kontakt z piłką, podejście przeciwnika). Te sygnały często poprzedzają lub współwystępują z podejmowaniem decyzji i stanowią część naturalnego środowiska percepcyjnego piłkarzy. Wstępne eksperymenty ablacyjne wykazały, że wykluczenie dźwięku zmniejszało odbiór o 3,8%, co wskazywało, że nawet subtelne sygnały akustyczne przyczyniają się do świadomości kontekstu. Z tego powodu zachowano dźwięk, aby zachować wartość ekologiczną i poprawić zdolność modelu do uogólniania na rzeczywiste warunki dopasowania.

Rzeczywiście, aby dodatkowo wspierać te hiperparametry, przeprowadzono wewnętrzną analizę czułości, systematycznie zmieniając szybkość uczenia od 1e-5 do 5e-4, wielkość partii od 8 do 32, liczbę warstw transformatora od 4 do 8 oraz liczbę głowic uwagi od 4 do 12. Wybrana konfiguracja, z tempem uczenia 1e-4, wielkością partii 16 oraz 6-warstwowym enkoderem z 8 głowicami uwagi, konsekwentnie zapewniała stabilną zbieżność z najniższą stratą walidacyjną, minimalizując przeskurczenie w 10-krotnej walidacji krzyżowej. Większe partie powodowały niestabilność gradientu, podczas gdy mniejsze partie zwiększały hałas i opóźniały zbieżność. Podobnie, modele transformatorów z więcej niż 8 głowicami nie wykazały wzrostu wydajności, ale znacznie wydłużyły czas obliczeń. Uzyskane wyniki uzasadniają ostateczne ustawienia hiperparametrów użytych w tym badaniu.

Ekstrakcja cech z wykorzystaniem 3D splotowej sieci neuronowej

W proponowanym frameworku Transformer-Based Multimodal Fusion do podejmowania decyzji taktycznych w sportach drużynowych, 3D Convolucional Neural Network (3D CNN) odpowiada za wydobywanie cech przestrzenno-czasowych z surowych klipów wideo.

W przeciwieństwie do 2D CNN, które uwzględniają jedynie wymiary przestrzenne (szerokość W i wysokość H), 3D CNN uwzględniają także wymiar czasowy R, umożliwiając im wykrywanie dynamiki ruchu i wzorców sekwencyjnych, które są kluczowe dla zrozumienia zachowań zespołu, takich jak prowadzenie i podania w piłce nożnej.

Początkowo zaproponowano 3D-CNN28 w celu połączenia informacji przestrzennej i czasowej danych wideo. Jądro 3D jest używane w algorytmie konwolucyjnym 3D do sześcianu złożonego z klatek, z częścią kolumn ułożonych na siebie. Splot 3D można zapisać w równaniu (6)

Równanie 11   (6)

Gdzie: Równanie 12 jest cechą wyjściową w lokalizacji (x, y, z) na j-tej mapie cech warstwy l-tej.Równanie 14 jest wagą jądra w lokalizacji (h,w,r) z mapy cech wejściowych mth. Równanie 16 jest wejściem na przesunięciu przestrzenno-czasowym względem poprzedniej warstwy. blj to polaryzacja. f(.) jest funkcją aktywacji (zwykle ReLU). M to liczba map cech wejściowych z poprzedniej warstwy. To równanie pozwala 3D CNN łączyć równolegle informacje przestrzenne (wysokość i szerokość) oraz czasowe (sekwencja klatek).

Rysunek 4
Rysunek 4. Architektura przetwarzania 3D CNN. Ilustruje, jak cechy przestrzenno-czasowe są wyodrębniane z sekwencji wideo za pomocą 3D operacji splotowych. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Rysunek 4 pokazuje proces pracy 3D CNN. Potok zaczyna się od fazy wejścia, w której nieprzetworzone strumienie wideo z meczu futbolowego są łączone z uporządkowanymi danymi, w tym lokalizacjami zawodników, statystykami meczu i kontekstowymi metadanymi. Te informacje multimodalne zachowują zarówno dynamikę wizualną, jak i kontekst sytuacyjny, które są kluczowe dla analizy taktyki zespołowej. Następnie strumień wideo jest kierowany przez 3D Konwolucyjną Sieć Neuronową (3D CNN). W tym przypadku na ramkach wejściowych stosuje się serię trójwymiarowych warstw splotowych. Warstwy obracają się wzdłuż wymiarów przestrzennych (wysokość i szerokość) oraz wymiaru czasowego (klatki), umożliwiając sieci naukę wzorców ruchu, interakcji z zawodnikami oraz taktyk opartych na sekwencji, takich jak podania czy wejścia. Następnie powstaje sześcian cech o gęstych cechach czasoprzestrzennych. Ta kostka poddawana jest operacjom poolingu, aby zmniejszyć jej wymiar, zachowując jednocześnie istotne cechy. Po zgrupowaniu objętość cech jest spłaszczana do wektora 1D, co zapewnia zwięzłą reprezentację sytuacji taktycznej. Ten wektor cech jest następnie wprowadzany do w pełni połączonej Głębokiej Sieci Neuronowej (DNN). DNN to blok decyzyjny, który przetwarza połączone i wyodrębnione cechy w celu podejmowania decyzji taktycznych, takich jak podanie, strzał czy trzymanie. Wyjście sieci to ostateczna decyzja taktyczna podejmowana przez system na podstawie rzeczywistej sytuacji w grze w czasie rzeczywistym oraz wyuczonych wzorców strategii.

Osadzanie i wyrównywanie wejść multimodalnych

Po wyodrębnieniu cech, trzy cechy, takie jak dźwięk, obraz i statystyczna pozycja odtwarzacza, są podawane jako modalność wejściowa.

Aby wprowadzić je do transformatora, a następnie podłączyć je przez uczoną funkcję osadzania:

Równanie 19   (7)

gdzie f3DCNN uczy się cech przestrzenno-czasowych każdego przekroju czasu Vt i odwzorowuje je na d-wymiarową przestrzeń ukrytą.

Równanie 22   (8)

gdzieW P ib P to przyswajalne wagi.

Równanie 25   (9)

Wszystkie osadzenia są wyrównane względem wymiaru czasowego T. Jeśli modalności mają różne częstotliwości, stosuje się interpolację lub próbkowanie w dół:

Równanie 26   (10)

Obecnie wszystkie modalności są zsynchronizowane jako:

Równanie 27   (11)

Aby zachować porządek czasowy w transformatorze, wprowadź również kodowania pozycyjne dla każdego wektora:

Równanie 28   (12)

Gdzie Równanie 29 oznacza domyślne kodowanie sinusoidalne lub uczalne pozycyjne.

Każda modalność jest operacyjnie kodowana za pomocą warstwy liniowej PyTorch, łączona w wektor 512-d, a następnie wprowadzana do sekwencji wejściowej transformatora po kodowaniu pozycyjnym. Gwarantuje to, że na każdym kroku czasowym przygotowane jest zunifikowane osadzenie do wzajemnego udziału.

Tensor końcowy to

Równanie 30   (13)

jest wprowadzany do Transformer Encodera, gdzie mechanizmy samouwagi i cross-modal attention umożliwiają modelowi wspólne rozumowanie na wszystkich modalnościach w celu podejmowania decyzji taktycznych.

Fuzja wielomodalna oparta na transformatorach

W proponowanym podejściu stosuje się metodę rozkładania macierzy niskiego rzędu do integracji pozyskanych wektorów danych multimodalnych. Problem wysokich wymiarów, który występuje przy bezpośrednim połączeniu tensorów, jest rozwiązany tą metodą, która wykorzystuje współczynnik dekompozycji niskiego rzędu dla fuzji tensorowej29. Każda modalność jest początkowo wyrażana jako wektor, a redukcja wymiarowości, która zachowuje istotne oddziaływania, uzyskuje się za pomocą rozkładu niskiego rzędu. Tensor fuzji ZM wśród modalności M jest zbudowany jako:

Równanie 32   (14)

Oto: Równanie 33 jest czynnikiem niskiej rangi m-tej modalności, Równanie 60 jest iloczynem zewnętrznym, a r jest rangą rozkładu.

Wektor fuzji h oblicza się następująco:

Równanie 34   (15)

Gdy dwie modalności są stosowane osobno, zredukowana fuzja wygląda:

Równanie 35   (16)

Daje to wspólny wektor reprezentacji multimodalnej h, który modeluje interakcje międzymodalne na poziomie utajonym.

Po przejęciu niskorangowego fuzowanego wektora h, moduł Transformer modeluje zależności i dorównuje reprezentacje semantyczne między modalnościami. Uwaga międzymodalna jest specjalnie zaprojektowana, aby umożliwić jednej modalności zwracanie uwagi na inną:

Równanie 36   (17)

Gdzie Qm to zapytanie modalności m, Kn, Vn to wektory klucza i wartości w modalności n, dk to wymiar wektorów klucza. Takie rozwiązanie ułatwia przepływy uwagi specyficzne dla modalności, pozwalając na przetwarzanie każdej kategorii wejścia względem innych (np. synchronizacja ruchu gracza z kontekstem gry i wskaźnikami wideo).

Wektory z udziałem międzywymiarowym są układane i klasyfikowane za pomocą Multilayer Perceptron (MLP). Wyjściem jest taktyczna etykieta decyzyjna (np. pass, drive, hold), utrata entropii krzyżowej zoptymalizowana do treningu end-to-end.

Rysunek 5
Rysunek 5. Architektura fuzji multimodalnej oparta na transformerach. Pokazuje, jak modalności wizualne i sensoryczne są integrowane za pomocą enkodera transformatora, aby poprawić reprezentację cech. Proszę kliknąć tutaj, aby zobaczyć większą wersję tej figurki.

Wielomodulalny blok fuzji, jak pokazano na Rysunku 5, łączy wejścia wizualne i pozycyjne. Jest to konieczna konstrukcja, ponieważ decyzje taktyczne wymagają świadomości przestrzennej i dynamiki ruchu, której nie da się przedstawić przez jedną metodę.

Rysunek 5 przedstawia strukturę działania wielofunkcyjnej fuzji wielofunkcyjnej opartej na transformatorach. Ten projekt łączy różnorodne dane, wideo, współrzędne przestrzenne oraz dane kontekstowe gry w jednym kanale, aby przewidywać działania taktyczne, takie jak podania, drive'y czy holding. Podejście zaczyna się od wprowadzania nagrań wideo, które są weryfikowane za pomocą 3D Konwolucyjnej Sieci Neuronowej (3D CNN). System ten identyfikuje zarówno struktury przestrzenne, jak i czasowe w wideo, umożliwiając rejestrowanie dynamicznej aktywności i komunikacji gracza w czasie. Tymczasem informacje kontekstowe i pozycyjne przekazywane są poprzez osadzanie warstw, przekształcając strukturalne dane wejściowe w gęste reprezentacje wektorowe. Strumienie kontekstowe, pozycyjne i wideo mogą mieć następnie swoje wyjścia fuzyjne przez moduł Low-Rank Fusion. Podejście to skutecznie uzyskuje korelacje międzymodalne poprzez dekompozycję przestrzeni fuzyjnej, minimalizując złożoność obliczeniową przy jednoczesnym zachowaniu istotnych relacji między modalnościami. Na koniec połączona reprezentacja multimodalna jest przetwarzana przez enkoder transformatorowy z uwagą międzymodalną. Procedura ta pozwala modelowi skupić się na właściwych cechach w różnych modalnościach i etapach czasowych, co pogłębia zrozumienie strategicznego zachowania w grze. Na koniec zakodowany wynik jest przekazywany przez konkatenację oraz blok Multi-Layer Perceptron (MLP), który mapuje wyuczoną reprezentację na niektóre decyzje taktyczne. Wyniki modelu klasyfikują akcje zawodników takie jak "podanie", "drive" czy "hold", aby umożliwić inteligentną, opartą na danych analizę taktyk zespołu.

W proponowanym systemie analizy taktycznej opartej na transformatorach opartym na multimodalnej fuzji dla sportów drużynowych, ostatnią fazą jest klasyfikacja i ocena decyzji taktycznych, która przekształca wyuczone reprezentacje multimodalne w etykiety podatne na decyzję. Po połączeniu wideo, funkcji pozycyjnych i kontekstowych za pomocą fuzji niskiej rangi i ich precyzyjnym dostrojeniu za pomocą uwagi międzymodalnej w enkodzie Transformer, powstałe wektory cech są wprowadzane do klasyfikatora Multi-Layer Perceptron (MLP). Każda klasa decyzyjna jest reprezentowana przez funkcję aktywacji softmax, co daje wyniki prawdopodobieństwa dla wszystkich możliwych działań. Najbardziej prawdopodobna klasa jest wybierana jako przewidywana decyzja modelu. Model jest trenowany na funkcji utraty entropii krzyżowej, która nagradza poprawne przewidywania i sprawia, że sieć uczy się rozróżniać podobne różnice w sytuacjach taktycznych. Dodatkowo można rozważyć ocenę w dziedzinie czasu, aby potwierdzić responsywność w sytuacjach w czasie rzeczywistym lub bliskim rzeczywistym, zapewniając, że klasyfikator jest dokładny i nie marnuje czasu przy ograniczeniach czasowych podobnych do gry. Tabela 2 przedstawia architekturę modelu i hiperparametry.

SkładnikSpecyfikacja
Warstwy enkodera transformatora6
Uwaga, głowy8
Ukryty wymiar512
Rozmiar warstwy feed-forward2048
Wymiary osadzeniaWideo: 1024 → 512, Audio: 256 → 512, Pozycyjne: 128 → 512
Kodowanie pozycyjneMożliwe do nauczenia
Metoda fuzjiNiskorangowa fuzja multimodalna (ranga r = 16)
OptymalizatorAdam
Tempo uczenia się0.0001
Wielkość partii16
Epoki szkoleniowe50–100
Wycofanie0.1
Funkcja stratyEntropia krzyżowa

Tabela 2: Architektura modelu i hiperparametry. Zawiera listę ustawień treningowych oraz kluczowych elementów proponowanego modelu fuzji multimodalnej opartego na transformatorach.

Dla większej przejrzystości i powtarzalności, transformator multimodalny został zaimplementowany za pomocą 6-warstwowego stosu enkodera, z których każdy wyposażony jest w 8 głowic uwagi i ukryty wymiar 512, zgodnie z typowymi ustawieniami transformatora dla średnioskalowych zadań multimodalnych. Każda modalność przechodzi przez blok osadzający: wideo przez wyjście enkodera 3D-CNN, 1024-dim; dźwięk wykonany przez enkoder oparty na Wave2Vec, 256-dim; oraz funkcje pozycyjne plus kontekstowe za pomocą dwuwarstwowego enkodera MLP, 128-dim. Wszystkie te osadzenia były wyświetlane do wspólnej przestrzeni 512-d ukrytej poprzez uczywalne transformacje liniowe. Aby ustalić wyrównanie czasowe, wszystkie modalności najpierw interpolują się na jedną częstotliwość 25 Hz, a następnie stosuje się wyuczone kodowania pozycyjne w celu zachowania porządku czasowego. Cross-modal alignment odbywa się za pomocą warstw cross-focus, które jawnie uczą się korelacji między modalnościami przed wprowadzeniem do stosu enkodera self-attention. Decyzje architektoniczne zostały podjęte w celu zrównoważenia pojemności modelu z efektywnością obliczeniową, zapewniając tym samym stabilną zbieżność na umiarkowanie dużym zbiorze danych.

W praktyce proponowany framework Transformer-Based Multimodal Fusion jest najbardziej odpowiedni do scenariuszy, w których dostępne są zsynchronizowane dane multimodalne, takie jak ustrukturyzowane sesje szkoleniowe, kontrolowane symulacje meczów czy środowiska profesjonalne wyposażone w stałe transmisje wideo i systemy śledzenia pozycji. Cztery główne dane wejściowe potrzebne do metody to (i) wideo w wysokiej rozdzielczości, (ii) dane śledzenia pozycji (GPS/LPS), (iii) strumienie audio oraz (iv) metadane kontekstowe – np. posiadanie, strefy nacisku, faza dopasowania. Aby osiągnąć niezawodną wydajność, te metody muszą być wyrównane czasowo z minimalnym dryfem (wideo ≥ 25 fps i czujniki pozycyjne ≥ 10 Hz) oraz utrzymywać stabilne punkty widzenia i minimalny szum sygnału. Ustawienia, które nie zapewniają tych zsynchronizowanych sygnałów, na przykład amatorskie mecze z nieregularnymi kątami kamery, transmisje na żywo z artefaktami opóźnień/kompresji czy środowisko bez infrastruktury śledzenia pozycji, będą mniej istotne dla frameworka. Co więcej, obecny system najlepiej radzi sobie w warunkach półkontrolowanych, ale może być znacznie mniej odporny w całkowicie niekontrolowanych meczach na żywo, gdzie warunki oświetleniowe, okluzja i dynamiczny szum tłumu wpływają na jakość pozyskiwania danych. Te ograniczenia wyznaczają praktyczne granice, w których system może być wdrożony, i podkreślają, że konsekwentne przechwytywanie danych w wielu trybach jest niezbędne do zastosowania proponowanego modelu.

Modyfikacje i rozwiązywanie problemów

W praktyce implementacyjnej w całym procesie multimodalnym może pojawić się kilka problemów, które mogą obniżyć stabilność modelu lub ogólną wydajność. Jednym z częstych problemów jest niedopasowanie czasowe między modalnościami, gdzie wideo nagrane przy 25 fps i dane pozycyjne z 10 Hz tracą synchronizację, co prowadzi do niedopasowanych wskazówek, które destabilizują mapy uwagi i zmniejszają odwoływanie. Można to rozwiązać poprzez zastosowanie ponownego próbkowania opartego na znacznikach czasu, interpolacji liniowej oraz automatycznego usuwania sekwencji o nadmiernym dryfie. Kanały audio mogą również cierpieć na szumy spowodowane wiatrem, dźwiękami tłumu lub przenikaniem mikrofonu, co powoduje, że transformator ignoruje tokeny audio i nieco obniża precyzję. Zastosowanie filtrowania pasmowego, gatowania spektralnego oraz podstawienie mocno uszkodzonych segmentów zerowymi wektorami pomaga utrzymać stabilność osadzania dźwięku. Problemy z jakością obrazu, takie jak zasłony odtwarzacza czy rozmycie ruchu, mogą osłabić reprezentacje przestrzenno-czasowe 3D-CNN i zwiększyć zamieszanie związane z przejściem i przejściem. Jest to łagodzone przez wykluczenie silnie zasłoniętych sekwencji i stosowanie strategii augmentacji, takich jak losowe przycinanie, normalizacja jasności oraz symulacja rozmycia ruchu. Niestabilność transformatora może wystąpić, jeśli skale osadzenia różnią się w zależności od modalności, co powoduje oscylujące straty walidacyjne lub skoki gradientu. Zapewnienie spójnej normalizacji wyniku z, stosowanie harmonogramu nauki podczas rozgrzewki, stosowanie gradientowego przycinania oraz zwiększanie rezygnacji z treningu może przywrócić stabilny trening. Fuzja niskiej rangi może również stać się problematyczna, gdy ranga fuzji jest nieprawidłowo ustawiona, powodując zniekształcone relacje międzymodalne i nierównowagę klasową. Utrzymanie umiarkowanego ranku dla małych zbiorów danych, zwiększenie ranku dla większych zbiorów oraz zastosowanie regularizacji L2 pomagają zachować zrównoważoną fuzję. Wąskie gardła obliczeniowe mogą powstać z powodu dużych tensorów wideo, które powodują przepełnienie pamięci GPU lub spowolnione trenowanie. Problemy te można rozwiązać poprzez trening mieszanej precyzji (FP16), redukcję rozdzielczości wejściowej podczas wczesnych eksperymentów lub buforowanie wcześniej obliczonych funkcji 3D-CNN. Wreszcie, naturalna nierównowaga klasowa w decyzjach taktycznych, zwłaszcza dla "Drive", może zmniejszać przywołanie i powodować wahania AUC; Stosowanie strat zrównoważonych klasowo, nadmierne próbkowanie działań mniejszości oraz wzbogacanie metadanych kontekstowych może znacząco poprawić równowagę i dyskryminację decyzyjną. Te skonsolidowane wytyczne dotyczące rozwiązywania problemów gwarantują, że badacze i praktycy mogą utrzymać stabilne warunki treningowe, poprawić powtarzalność oraz skutecznie dostosować ramy do różnych zbiorów danych i środowisk.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ten projekt łączy różnorodne dane, wideo, współrzędne przestrzenne oraz dane kontekstowe gry w jednym kanale, aby przewidywać działania taktyczne, takie jak podanie, jazda czy trzymanie piłki. Podejście zaczyna się od wprowadzania filmów, które są weryfikowane za pomocą Trójwymiarowej Sieci Splotowej (3D CNN). Strumienie kontekstowe, pozycyjne i wideo mogą mieć następnie swoje wyjścia fuzyjne przez moduł Low-Rank Fusion. Podejście to skutecznie uzyskuje korelacje międzymodalne poprzez dekompozycję przestrzeni fuzyjnej, m...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ramy Transformer-Based Multimodal Fusion przedstawione tutaj stanowią istotny krok naprzód w stosunku do bazowego testu Stroop Task Football Test (STFT) opisanego w artykule bazowym. W przeciwieństwie do artykułu bazowego, który koncentrował się na kontrolowanych, laboratoryjnych testach z ograniczonymi i statycznymi bodźcami, takimi jak kolorowe strzałki i z góry określone zadania (prowadzenie lub wyprzedzanie), nowy model opiera się na danych źródłowych z rzeczywistej gry, multimodalnych, aby ułatwić bogatszy, zautomat...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych konfliktów interesów do zgłoszenia.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy z wdzięcznością dziękują Szkole Wychowania Fizycznego Uniwersytetu Beibu Gulf oraz Szkole Statystyki Southwestern University of Finance and Economics za zapewnienie zasobów i wsparcia instytucjonalnego podczas tych badań. Prace te zostały również wsparte przez projekt Narodowego Funduszu Nauk Społecznych 2023: Badania nad efektywnym wykorzystaniem czerwonych zasobów kulturowych sportu w Dawnej Rewolucyjnej Bazie Zuo jiang–You jiang (Grant nr 23CTY016).

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
3D CNNImplementacja niestandardowaEkstrakcja cech przestrzenno-czasowych z wideo
GoPro Hero4GoPro Inc.https://gopro.com/Nagrania wideo meczów
Czujniki GPS/IMUCatapult Sports / Xsenshttps://www.catapultsports.com/Śledzenie pozycji zawodnika
Procesor Intel Core i7-11700KIntelhttps://www.intel.comProcesor do modelowej stacji roboczej treningowej
Librosalibrosa.orghttps://pypi.org/project/librosa/Przetwarzanie sygnału audio i próbkowanie
Klasyfikator MLPPyTorch / TensorFlowTaktyczna klasyfikacja decyzji
NumPyPython Software Foundationhttps://pypi.org/project/numpy/Obliczenia numeryczne i operacje macierzowe
Karta graficzna NVIDIA RTX 3080NVIDIAhttps://www.nvidia.comTrening i wnioskowanie z głębokiego uczenia
OpenCVOpenCV.orghttps://pypi.org/project/opencv-python/Ekstrakcja klatek z wideo
PandyPython Software Foundationhttps://pypi.org/project/pandas/Manipulacja danymi i obsługa tabelaryczna
PCA (Scikit-learn)Scikit-learnhttps://scikit-learn.org/Redukcja wymiarowości
Python 3.9Python Software Foundationhttps://www.python.org/downloads/release/python-390/Środowisko języka programowania
PyTorchFundacja PyTorchhttps://pytorch.org/Ramy uczenia głębokiego
scikit-learnProgramiści scikit-learnhttps://pypi.org/project/scikit-learn/Walidacja krzyżowa, obliczenia ICC
TensorFlow 2.8Googlehttps://www.tensorflow.org/Ramy uczenia głębokiego
Enkoder transformatoraPyTorch / TensorFlowMultimodalna integracja cech z uwagą
Ubuntu 20.04 LTSCanonical Ltd.https://ubuntu.com/System operacyjny do trenowania modeli
Stacja roboczaCustom / Intel, NVIDIACPU, GPU, RAM do trenowania modeli

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Calle-Jaramillo, G. A., Franco, R., González, S. R., Forero, L. M., González, H. Design and validation of a test to evaluate the execution time and decision-making in technical–tactical football actions (passing and driving). Behav Sci. 13 (1), 101(2023).
  2. Renshaw, I., Davids, K., O’Sullivan, M., Maloney, M. A., Crowther, R., McCosker, C. An ecological dynamics approach to motor learning in practice: reframing the learning and performing relationship in high performance sport. Asian J Sport Exerc Psychol. 2, 18-26 (2022).
  3. Lamas, L., Senatore, J. V., Fellingham, G. Two steps for scoring a point: creating and converting opportunities in invasion team sports. PLoS ONE. 15, e0240419(2020).
  4. Gonçalves, B., et al. Extracting spatial-temporal features that describe team match demands when considering the effects of the quality of opposition in elite football. PLoS ONE. 14, e0221368(2019).
  5. Cardoso, F. D. S. L., González-Víllora, S., Guilherme, J., Teoldo, I. Young football players with higher tactical knowledge display lower cognitive effort. Percept Mot Skills. 126, 499-514 (2019).
  6. Heilmann, F. Self-report versus neuropsychological tests for examining executive functions in youth soccer athletes—a cross-sectional study. Behav Sci. 12, 346(2022).
  7. Torres-Tejeda, S., Portilla-Fernández, J. A., Mugruza-Vassallo, C. A., Córdoba-Berrios, L. L. Variations of reaction times explained by stimuli changes in size and perspective in 2D and 3D for selective attention. Rev Mex Ing Biomed. 41, 91-104 (2020).
  8. Wilke, J., Vogel, O. Computerized cognitive training with minimal motor component improves lower limb choice-reaction time. J Sports Sci Med. 19, 529(2020).
  9. Da Silva Leite Cardoso, F., Afonso, J., Roca, A., Teoldo, I. The association between perceptual-cognitive processes and response time in decision making in young soccer players. J Sports Sci. 39, 926-935 (2021).
  10. Farahani, J., Soltani, P., Rezlescu, C. Assessing decision-making in elite academy footballers using real-world video clips. Prog Brain Res. 259, Elsevier. 59-70 (2020).
  11. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  12. MM-ViT: multi-modal video transformer for compressed video action recognition. Chen, J., Ho, C. M. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 1910-1921 (2022).
  13. Shi, J., et al. A novel two-stream transformer-based framework for multi-modality human action recognition. Appl Sci. 13, 2058(2023).
  14. Capone, V., Casolaro, A., Camastra, F. Spatio-temporal prediction using graph neural networks: a survey. Neurocomputing. 594, 130400(2025).
  15. Ball trajectory inference from multi-agent sports contexts using set transformer and hierarchical bi-LSTM. Kim, H., et al. Proc 29th ACM SIGKDD Conf Knowl Discov Data Min, , (2023).
  16. Lemes, J. C., et al. Influence of pitch size and age category on the physical and physiological responses of young football players during small-sided games using GPS devices. Res Sports Med. 28, 206-216 (2020).
  17. Coutinho, D., et al. Effects of pitch configuration design on players’ physical performance and movement behaviour during football small-sided games. Res Sports Med. 27, 298-313 (2019).
  18. Clemente, F. M., Sarmento, H. Combining small-sided football games and running-based methods: a systematic review. Biol Sport. 38, 617-627 (2021).
  19. Hu, W., Li, B., Li, C., Zhang, T. An integrated intelligent decision system for physical health evaluation of college students with fuzzy number intuitionistic fuzzy information. J Intell Fuzzy Syst. 44, 611-624 (2023).
  20. Cao, L. Design and optimization of a decision support system for sports training based on data mining technology. Sci Program. 2022, 1846345(2022).
  21. Li, L., Zhang, Z., Zhang, S. Hybrid algorithm based on content and collaborative filtering in recommendation system optimization and simulation. Sci Program. 2021, 4(2021).
  22. Shi, W., Wang, L., Qin, J. User embedding for rating prediction in SVD++-based collaborative filtering. Symmetry. 12, 121(2020).
  23. Hasan, M., Roy, F. An item–item collaborative filtering recommender system using trust and genre to address the cold-start problem. Big Data Cogn Comput. 3, 39(2019).
  24. Duan, R., Jiang, C., Jain, H. K. Combining review-based collaborative filtering and matrix factorization: a solution to rating sparsity. Decis Support Syst. 156, 113748(2022).
  25. Multi-view transformation in recommender systems. Ho, T. L., Le, A. C. Proc 2021 Int Conf Syst Sci Eng (ICSSE), , IEEE. 88-91 (2021).
  26. Detector-free weakly supervised group activity recognition. Kim, D., Lee, J., Cho, M., Kwak, S. Proc IEEE CVF Conf Comput Vis Pattern Recognit (CVPR), , 20083-20093 (2022).
  27. Wensel, J., Ullah, H., Munir, A. ViT-RET: vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 11, 72227-72249 (2023).
  28. Alomar, K., Aysel, H. I., Cai, X. CNNs, RNNs and transformers in human action recognition: a survey and a hybrid model. Artif Intell Rev. 58, 1-44 (2025).
  29. Social adaptive module for weakly supervised group activity recognition. Yan, R., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 224-238 (2020).
  30. Zhang, Y., et al. FairMOT: on the fairness of detection and re-identification in multiple object tracking. Int J Comput Vis. 129, 3069-3087 (2021).
  31. Towards real-time multi-object tracking. Wang, Z., et al. Proc Eur Conf Comput Vis (ECCV), , Springer. 22-107 (2020).
  32. Shuvo, M. R., Mekala, M. S., Elyan, E. Deep learning and attention-based methods for human activity recognition and anticipation: a comprehensive review. Cogn Comput. 17, 1-28 (2025).
  33. Alqarafi, A., Almogadwy, B. TAT-SARNet: a transformer-attentive two-stream soccer action recognition network with multi-dimensional feature fusion and hierarchical temporal classification. Mathematics. 13, 3011(2025).
  34. Detection recovery in online multi-object tracking with sparse graph tracker. Hyun, J., Kang, M., Wee, D., Yeung, D. Y. Proc IEEE CVF Winter Conf Appl Comput Vis (WACV), , 4839-4848 (2023).
  35. Mukhtar, H., Khan, M. U. G. STMMOT: advancing multi-object tracking through spatiotemporal memory networks and multi-scale attention pyramids. Neural Netw. 168, 363-379 (2023).
  36. Dataset used for intraclass correlation coefficient reliability analysis. , https://docs.google.com/spreadsheets/d/1c3bZNClvy8TP7RBspwRI0z7R8-n5Wy5H (2021).
  37. Ma, X., et al. feature extraction within a complex urban area with an improved 3D-CNN using airborne hyperspectral data. Remote Sens. 15, 992(2023).
  38. Xie, W., et al. Transformer-based multi-modal data fusion method for COPD classification and physiological and biochemical indicators identification. Biomolecules. 13, 1391(2023).
  39. Wang, X., Guo, Y. Intelligent football players’ motion recognition system based on convolutional neural network and big data. Heliyon. 9, e19822(2023).
  40. Paneru, B., et al. Enhancing soccer pass receiver prediction in broadcast images through advanced deep learning techniques: a comprehensive study on model optimization and performance evaluation. J Soft Comput Explor. 5, 115-121 (2024).
  41. Shot prediction in the attacking third based on spatio-temporal features: a dynamic time-series model approach. Gong, B., et al. Proc 4th Int Conf Inf Technol Contemp Sports (TCS), , IEEE. (2024).
  42. Yang, K. O., Koh, J., Choi, J. W. Unified contrastive fusion transformer for multimodal human action recognition. arXiv. , (2023).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Transformer ModelMultimodal FusionTactical Decision AnalysisTeam SportsFootball AnalyticsPlayer PositioningDecision ClassificationFeature ExtractionReal Time PredictionVideo Analysis

Related Articles