W niniejszym badaniu zastosowano dwuetapowy model głębokiego uczenia do rozpoznawania akcji w filmach sportowych, integrujący wieloskalową konwolucyjną sieć neuronową (MSCNN) z siecią Long Short-Term Memory (LSTM). Do opracowania i oceny modelu wykorzystano publicznie dostępne zestawy danych referencyjnych, a mianowicie UCF11, UCF Sports oraz JHMDB. Nie gromadzono nowych danych od uczestników i nie uzyskano dostępu ani nie przetwarzano danych osobowych. Ze względu na to, że badanie opierało się na wtórnej analizie publicznie dostępnych, zanonimizowanych zestawów danych i nie wiązało się z bezpośrednim udziałem ludzi, nie było wymagane uzyskanie zgody instytucjonalnej komisji etycznej ani świadomej zgody uczestników.
Przepływ pracy składał się z próbkowania klatek i normalizacji czasowej, po których nastąpiła ekstrakcja cech przy użyciu modułu MSCNN. Wyekstrahowane cechy zostały następnie przetworzone przez sieć LSTM w celu modelowania czasowego, a następnie przekazane do warstwy klasyfikacji wieloklasowej. Na koniec model został wytrenowany i oceniony przy użyciu wybranych zestawów danych referencyjnych. Rycina 1 ilustruje ogólną architekturę proponowanego schematu.

Rycina 1: Proponowana struktura MSCNN-LSTM do rozpoznawania akcji w wideo sportowym. Ogólny schemat przepływu ilustrujący wstępne przetwarzanie wideo, wieloskalową ekstrakcję cech przestrzennych, uczenie sekwencji czasowych oraz klasyfikację akcji. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Rysunek 1 przedstawia schemat proponowanego systemu rozpoznawania akcji w filmach sportowych, opartego na hybrydowej architekturze MSCNN-LSTM. Proces rozpoczyna się od klipów wideo z dyscyplin sportowych zawierających różne czynności atletyczne, w tym kopanie piłki, jazdę konną i zamach w golfie. W fazie wstępnego przetwarzania surowe nagrania wideo zostały rozbite na poszczególne klatki, które następnie przycięto, zestandaryzowano i przygotowano do wprowadzenia do modelu. Przetworzone klatki zostały następnie przekazane do modułu MSCNN w celu ekstrakcji cech. Wieloskalowa architektura konwolucyjna przechwytuje cechy przestrzenne w różnych polach recepcyjnych, co umożliwia wydobycie zarówno informacji lokalnych, jak i kontekstowych z klatek wideo. Wyekstrahowane wektory cech zostały następnie przetworzone przez sieć LSTM w celu zamodelowania zależności czasowych oraz ewolucji ruchu w kolejnych klatkach. Na koniec moduł klasyfikacji i uczenia wykorzystał wyuczone reprezentacje czasoprzestrzenne do przewidzenia kategorii akcji dla każdego klipu wideo. Proponowany system składa się z czterech następujących po sobie kroków, rozpoczynając od gromadzenia i wstępnego przetwarzania danych z zestawów danych referencyjnych UCF11 (YouTube Actions), UCF Sports oraz JHMDB. Każdy film sportowy został przekształcony w sekwencję klatek, które zostały przeskalowane, znormalizowane i rozszerzone poprzez rotację, odbicie lustrzane oraz przycinanie, aby zwiększyć odporność na zmienność środowiskową. Wstępnie przetworzone klatki zostały następnie poddane obróbce przez proponowaną wieloskalową konwolucyjną sieć neuronową (MSCNN), w której równoległe gałęzie konwolucyjne z jądrami 3 × 3, 5 × 5 i 7 × 7 ekstrahowały komplementarne lokalne i kontekstowe cechy przestrzenne. Cechy wieloskalowe te zostały skonkatenowane i dopracowane przy użyciu normalizacji wsadowej (batch normalization) oraz maksymalnego pulingu (max pooling) w celu wygenerowania kompaktowych reprezentacji cech. Wynikowe cechy na poziomie klatek zostały następnie przekazane do sieci Long Short-Term Memory (LSTM) w celu zamodelowania zależności czasowych między kolejnymi klatkami. Końcowe wyjścia z sieci LSTM zostały spłaszczone i przekazane przez warstwy w pełni połączone z aktywacją ReLU, a następnie do klasyfikatora Softmax w celu przewidzenia kategorii akcji. Sieć była trenowana przy użyciu optymalizatora Adam z funkcją straty entropii krzyżowej i regularyzacją dropout w celu redukcji przeuczenia. Wydajność modelu została ostatecznie oceniona na zestawach danych referencyjnych UCF11, UCF Sports i JHMDB przy użyciu wskaźników dokładności (accuracy), precyzji (precision), czułości (recall) oraz miary F1-score.
1. Gromadzenie i wstępne przetwarzanie danych
W niniejszym badaniu wykorzystano trzy publicznie dostępne zestawy danych referencyjnych dla sportu i ludzkich działań. Zbiory te zawierają rzeczywiste nagrania sportowe z różnorodnym ruchem kamery, różnymi punktami widzenia oraz różną złożonością tła. W szczególności w badaniu wykorzystano zbiór UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php), który zawiera 11 kategorii działań zgromadzonych z 1 168 filmów z serwisu YouTube, nagranych z udziałem około 25 osób, z wieloma próbkami dla każdego działania. Baza danych Joint-Annotated Human Motion Database (JHMDB)34,35 zawiera 21 klas działań i 928 adnotowanych filmów. Zbiór UCF Sports składa się z 10 klas działań i 150 sekwencji wideo pochodzących ze źródeł nadawczych o rozdzielczości 720 × 480 pikseli (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
Wspólnie zbiory danych te obejmują zarówno sporty indywidualne, jak i drużynowe, zapewniając zróżnicowanie pod względem czasu trwania i skali wizualnej w celu oceny proponowanego frameworka rozpoznawania akcji MSCNN-LSTM. W ramach procesu weryfikacji jakości danych zbiory UCF11, UCF Sports oraz JHMDB zostały sprawdzone pod kątem uszkodzonych filmów, zduplikowanych plików oraz klipów z niepełnymi adnotacjami. Nie zidentyfikowano próbek spełniających te kryteria wykluczenia; w związku z tym wszystkie dostępne filmy zachowano do dalszej analizy. Następnie zbiory danych podzielono na podzbiory treningowy (70%), walidacyjny (15%) i testowy (15%) przy użyciu spójnej strategii losowego podziału. Rysunek 2 przedstawia reprezentatywne obrazy wykorzystane do treningu i ewaluacji.

Rycina 2: Reprezentatywne klatki z benchmarkowych zbiorów danych do rozpoznawania działań sportowych. Panele (A–D) przedstawiają przykłady ze zbioru danych UCF11 (YouTube Actions), panele (E–H) ze zbioru danych UCF Sports, a panele (I–L) ze zbioru danych JHMDB. Klatki ilustrują wariacje w klasach działań, punktach widzenia, tłach, warunkach oświetlenia oraz złożoności ruchu. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.
Zaproponowany model rozpoznawania akcji został oceniony na zbiorach danych benchmarkowych UCF11, UCF Sports i JHMDB, co podsumowano w Tabeli 3. Zbiory te reprezentują różnorodne wzorce ruchu oraz trudne warunki środowiskowe. Zbiór danych UCF11 (YouTube Actions) zawiera akcje sportowe z 11 klas, zarejestrowane w zmiennych warunkach oświetlenia, punktów widzenia i tła. Zbiór UCF Sports składa się ze 150 filmów z dyscyplin sportów polowych pochodzących z profesjonalnych transmisji, zawierających realistyczne sekwencje ruchu. Zbiór JHMDB dostarcza szczegółowych adnotacji ruchu ludzkiego dla 21 drobnoziarnistych kategorii akcji i służy jako zbiór benchmarkowy dla czasoprzestrzennego rozpoznawania akcji. Razem zbiory te posłużyły do oceny wydajności modelu w scenariuszach sportowych i dotyczących ludzkich działań. Sieć była trenowana przy użyciu optymalizatora Adam przez 100 epok z rozmiarem partii 32, początkową stopą uczenia 0,001 i funkcją straty entropii krzyżowej. Do końcowej ewaluacji wybrano model z najniższą stratą walidacyjną. We wszystkich eksperymentach zastosowano stałe ziarno losowości 42. W celu poprawy zbieżności zastosowano wczesne zatrzymanie (early stopping) oraz redukcję stopy uczenia w przypadku plateau, a podczas trenowania LSTM wykorzystano przycinanie gradientów z progiem 5,0, aby zapobiec eksplozji gradientów. Zaproponowany model MSCNN-LSTM zawierał około 15 milionów trenowalnych parametrów. Konfiguracja sprzętowa i programowa wykorzystana do implementacji została podsumowana w Tabeli 4. Ponieważ rozkłady klas były wystarczająco zrównoważone, nie zastosowano dodatkowych procedur ważenia klas ani ponownego próbkowania. Modele porównawcze zaimplementowano przy użyciu hiperparametrów opisanych w ich oryginalnych badaniach, harmonizując ustawienia trenowania tam, gdzie było to możliwe. Wartości wydajności raportowano jako średnią ± odchylenie standardowe z pięciu niezależnych uruchomień z różnymi inicjalizacjami losowymi. Różnice między zaproponowanym modelem a modelami porównawczymi oceniano za pomocą sparowanych testów t przy progu istotności p < 0,05.
| Zbiór danych | Liczba klas | Liczba filmów | Rozdzielczość (px) | Proszę podać tekst źródłowy do tłumaczenia. | Opis |
| UCF11 (Działania w serwisie YouTube) | 11 | 1168 | Zmienna (≈ 320×240) | University of Central Florida | Obejmuje 11 ludzkich czynności sportowych (np. rzut do kosza, nurkowanie, zamach w golfie, żonglowanie piłką nożną). Filmy zostały pobrane z serwisu YouTube i charakteryzują się dużą zmiennością oświetlenia, punktu widzenia oraz tła. |
| Sport UCF | 10 | 150 | 720×480 | Zbiór danych UCF Sports Action Dataset | Zawiera aktywności sportowe, takie jak nurkowanie, jazda konna, zamach w golfie, bieganie i podnoszenie ciężarów, zarejestrowane z rzeczywistych materiałów z transmisji telewizyjnych (BBC, ESPN). |
| JHMDB | 21 | 928 | 320×240 | Instytut Maks Plancka ds. Inteligentnych Systemów | Obejmuje codzienne aktywności oraz sporty, takie jak chwytanie, skakanie, czesanie włosów, strzelanie i bieganie, wraz z adnotacjami stawów do analizy ruchu i pozy. |
Tabela 3: Charakterystyka zbiorów danych referencyjnych użytych do trenowania i ewaluacji. Przegląd zbiorów danych UCF11, UCF Sports oraz JHMDB, obejmujący liczbę klas czynności, próbek wideo, charakterystykę zbiorów danych oraz ich rolę w trenowaniu, walidacji i testowaniu modelu.
| Wykorzystane parametry | Opis |
| Język programowania | Python 3.8.18 [4] |
| Środowisko głębokiego uczenia | TensorFlow 2.15.0 [1] |
| Akcelerator GPU | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| procesor (CPU) | Intel Core i9 @ 3,5 GHz × 16 rdzeni |
| System operacyjny | Windows 11 |
| Pamięć operacyjna (RAM) | 64 GB DDR4 |
| Optymalizator | Adam (learning rate = 0,001) |
| Wielkość partii | 32 |
| Liczba epok | 100 |
| Funkcje aktywacji | ReLU (warstwy CNN), Softmax (warstwa wyjściowa) |
| Wskaźnik rezygnacji | 0.5 |
Tabela 4: Środowisko symulacyjne i konfiguracja hiperparametrów proponowanego modelu MSCNN-LSTM. Specyfikacje sprzętowe, środowisko programistyczne, ustawienia optymalizatora, szybkość uczenia, rozmiar partii, liczba epok, wymiary wejściowe oraz inne hiperparametry użyte podczas trenowania i ewaluacji modelu.
2. Wstępne przetwarzanie
Przed treningiem każdy surowy film został przekonwertowany na uporządkowany czasowo ciąg klatek, a następnie znormalizowany, poddany próbkowaniu czasowemu i augmentacji. Każdy film wejściowy V został najpierw przekonwertowany na ciąg klatek i przedstawiony jako tensor 4D V ∈ RT×H×W×C, gdzie T to liczba klatek, H × W i oznacza indeks klatki, a C oznacza liczbę kanałów kolorów (3 dla RGB). Potok przetwarzania wstępnego składał się z ekstrakcji klatek, zmiany rozmiaru przestrzennego, a następnie przycinania środkowego lub losowego do stałej rozdzielczości (H′, W′), normalizacji intensywności każdego piksela oraz opcjonalnej augmentacji danych, w tym losowego odwracania, skalowania i jitteringu kolorów, przed ekstrakcją cech. Konkretnie, normalizacja intensywności została zaimplementowana jako standardowa normalizacja wyników (z-score), zgodnie z równaniem (1).
(1)
gdzie μ, σ to średnie i odchylenia standardowe kanałów obliczone dla zbioru treningowego, lub jako skalowanie min-max zgodnie z równaniem (2).
(2)
Po normalizacji każda klatka była reprezentowana jako F̃t ∈ RH′×W′×C′, a wynikający z tego tensor wideo był reprezentowany jako V′ ∈ RT×H′×W′×C. W wieloskalowym frontendzie splotowym uzyskano wiele przestrzennych map cech o różnych polach recepcyjnych poprzez zastosowanie kilku splotów 2-D (lub 3-D w przypadku wczesnych splotów czasoprzestrzennych) o różnych rozmiarach jądra; następnie dla każdej klatki lub krótkiego klipu wideo wygenerowano reprezentację cech czasowych i przekazano ją do modułu LSTM. W oryginalnej pracy zastosowano MobileNetV2, a następnie Deep BiLSTM do modelowania czasowego; powyższy potok wstępnego przetwarzania jest w pełni kompatybilny z zastąpieniem go kombinacją wieloskalowego splotu i LSTM.
3. Pobieranie próbek i normalizacja czasowa
Ponieważ długości filmów T różnią się pomiędzy zbiorami danych oraz w ich obrębie, stosujemy jednolity próbkowanie lub ponowne próbkowanie czasowe klatek, aby zapewnić wieloskalowej splotowej sieci neuronowej + LSTM stałą długość wejściową N w postaci klatek lub krótkich fragmentów. Jednolite indeksy klatek można obliczyć zgodnie z Równaniem (3),
(3)
zatem sekwencja pobranych klatek to Vs = {F̃t0, …, F̃tN−1}. Gdy wymagana jest większa wierność czasowa, wykonujemy liniową interpolację czasową: dla dowolnego resamplowanego ułamkowego czasu τ ∈ [0, T−1] obliczonego zgodnie z równaniem (4).
(4)
tak aby próbkowana ponownie sekwencja Vs posiadała dokładnie N klatek i zachowywała płynność ruchu. Alternatywnie, próbkowanie za pomocą krótkich, ciągłych klipów (długość okna czasowego w z krokiem s) daje zestaw tensorów klipów, gdzie każdy klip Cj ∈ RT×H′×W′×C oraz j = 0, …, ⌊(T − w)/s⌋. W celu normalizacji czasowej wewnątrz sieci skuteczne jest proste pooling czasowy w wielu skalach: dla sekwencji cech czasowych X = {x1, …, xN} generowanej przez sploty wieloskalowe, należy zastosować cechy po poolingu zgodnie z równaniem (5).
(5)
gdzie Sk jest wsparciem czasowym dla skali k (np. Sk mogą być niepokrywającymi się blokami lub rozszerzonymi indeksami), a mk = |Sk|.
Przed ekstrakcją cech wszystkie filmy zostały przeskalowane do wymiarów 224 × 224 pikseli i próbkowane z częstotliwością 25 klatek na sekundę. W każdym eksperymencie zastosowano stałą długość sekwencji wynoszącą 32 klatki. Techniki augmentacji danych obejmowały m.in. losowe przycinanie (skala = 0,8–1,0), losową rotację (±15°), losowe odwrócenie poziome (prawdopodobieństwo = 0,5) oraz modyfikację jasności (±20%). Do standaryzacji wartości pikseli wykorzystano średnie wartości ImageNet [0,485, 0,456, 0,406] oraz odchylenia standardowe [0,229, 0,224, 0,225]. W przypadku każdej sekwencji wideo do próbkowania czasowego zastosowano jednostajny wybór klatek. Dłuższe nagrania były jednostajnie przycinane lub próbkowane w celu zachowania spójnej długości sekwencji, natomiast filmy zawierające mniej niż 32 klatki zostały uzupełnione zerami. Parametry te stosowano konsekwentnie przez cały proces uczenia i oceny.
4. Ekstrakcja cech przy użyciu MSCNN
W celu usprawnienia reprezentacji przestrzennej czynności w nagraniach wideo ze sportami zastosowano wieloskalową splotową sieć neuronową (MSCNN). Konwencjonalne splotowe sieci neuronowe opierające się na pojedynczym rozmiarze jądra mogą mieć ograniczone możliwości przechwytywania cech w wielu skalach przestrzennych. Ze względu na to, że niektóre czynności sportowe wykazują podobne cechy wizualne, architektura splotowa jednoskalowa może mieć trudności z jednoczesnym przechwytywaniem cech lokalnych i globalnych. Aby wyeliminować to ograniczenie, proponowany schemat wykorzystuje jądra splotowe o różnych rozmiarach do przeprowadzania wieloskalowej ekstrakcji i fuzji cech.
W proponowanej architekturze sieci zastosowano jądra splotu 1 × 1 w celu organizacji informacji pomiędzy kanałami oraz redukcji wymiarowości map cech wejściowych. Ponadto warstwy te zwiększają zdolność ekspresyjną sieci poprzez wprowadzenie dodatkowych transformacji cech i reprezentacji nieliniowych. Jądra splotu o różnych rozmiarach umożliwiają ekstrakcję informacji przestrzennych w wielu skalach. Po ważonej fuzji cech wieloskalowych przeprowadzana jest sekwencyjna normalizacja, aby poprawić stabilność uczenia. W celu złagodzenia problemów zanikania i eksplozji gradientu podczas trenowania głębokiej sieci, sugerowana architektura wykorzystuje połączenia rezydualne oraz modelowanie czasowe oparte na LSTM.
Projekt wieloskalowy zwiększa zdolność sieci do przechwytywania cech w różnych rozdzielczościach przestrzennych i poprawia możliwości reprezentacji cech. Ponadto konwencjonalny jądro splotu N × N zostaje rozłożone na operacje splotu N × 1 oraz 1 × N. Sploty N × 1 i 1 × N zastosowane w module MSCNN zostały zaprojektowane w celu przechwytywania komplementarnych cech kierunkowych i wieloskalowych cech przestrzennych z poszczególnych klatek wideo. Operacje splotowe te wzmacniają reprezentację cech przestrzennych poprzez wyodrębnianie wzorców w różnych skalach pola recepcyjnego. Relacje czasowe między kolejnymi klatkami są następnie modelowane przez moduł LSTM, który przetwarza sekwencję cech wyodrębnionych przez MSCNN w celu nauczenia się długoterminowych zależności czasowych niezbędnych do rozpoznawania czynności.
Każdy film sportowy V = {F1, F2, …, FT} jest rozkładany na T klatek. Aby zakodować zmienność przestrzenną, na przykład pozę zawodnika, rozmycie ruchu czy trajektorię piłki, zastosowano gałęzie splotowe w trzech różnych skalach s ∈ {1, 2, 3}, odpowiadających rozmiarom jądra 3 × 3, 5 × 5 oraz 7 × 7. Każda gałąź ekstrahuje mapy cech zgodnie z równaniem (6):
(6)
Gdzie Ws oraz bs to wagi i przesunięcia splotowe w skali s, a σ to funkcja aktywacji ReLU. Warstwa fuzji wieloskalowej agreguje cechy zgodnie z równaniem (7):
(7)
Ten połączony tensor cech osadza zarówno precyzyjne wskazówki dotyczące ruchu, jak i kontekstowe informacje z dużych obszarów, takie jak aktywności grupowe. Rysunek 3 przedstawia wyłącznie moduł ekstrakcji cech MSCNN. Warstwa LSTM (256 jednostek ukrytych), warstwa gęsta (128 neuronów) oraz warstwa dropout (0,5) wykorzystywane do modelowania czasowego i klasyfikacji są przedstawione oddzielnie na Rysunku 4.

Rysunek 3: Proponowany moduł ekstrakcji cech wieloskalowej splotowej sieci neuronowej (MSCNN). Trzy równoległe gałęzie splotowe z jądrami o rozmiarach 3 × 3, 5 × 5 i 7 × 7 ekstrahują dopełniające się wieloskalowe cechy przestrzenne, które są łączone przed modelowaniem czasowym przez sieć LSTM. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 4: Proponowana architektura LSTM do rozpoznawania akcji w filmach sportowych. Moduł LSTM modeluje zależności czasowe poprzez operacje bramki wejściowej, bramki zapominania i bramki wyjściowej w kolejnych klatkach wideo. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Rycina 3 przedstawia proponowany moduł ekstrakcji cech w ramach wielkoskalowej konwolucyjnej sieci neuronowej (MSCNN) do rozpoznawania akcji w nagraniach wideo z wydarzeń sportowych. Klatki wejściowe z wideo były przetwarzane równolegle przez trzy gałęzie konwolucyjne o rozmiarach jąder 3 × 3, 5 × 5 i 7 × 7, z których każda zawierała 64 filtry w celu uchwycenia komplementarnych, drobno- i gruboziarnistych cech przestrzennych. Wyniki zostały przetworzone za pomocą normalizacji wsadowej (Batch Normalization), funkcji aktywacji ReLU oraz maksymalnego próbkowania (max pooling) 2 × 2, a następnie skonkatenowane i połączone za pomocą konwolucji 1 × 1 ze 128 filtrami. Rezydualne połączenie pomijające (residual skip connection) pozwoliło na zachowanie niskopoziomowych informacji przestrzennych i poprawę przepływu gradientu. Połączone mapy cech zostały spłaszczone i przekazane do warstwy LSTM z 256 jednostkami ukrytymi w celu modelowania temporalnego, a następnie do warstwy w pełni połączonej ze 128 neuronami, funkcją aktywacji ReLU i współczynnikiem dropout wynoszącym 0,5 przed końcową klasyfikacją za pomocą warstwy Softmax. Wielkoskalowe mapy cech (f1l, f2l i f3l) zostały skonkatenowane w celu utworzenia reprezentacji scalonej (Fl), która została następnie poddana dalszej obróbce przez konwolucję 3 × 3 w celu wygenerowania mapy cech wyjściowych dla kolejnej warstwy. Ta hierarchiczna architektura umożliwiła naukę komplementarnych cech przestrzennych w wielu polach recepcyjnych, co poprawiło wydajność rozpoznawania akcji sportowych.
5. Modelowanie czasowe z użyciem sieci LSTM
Aby zamodelować ewolucję czasową krawędzi wideo, zagregowana sekwencja cech została przekazana do systemu LSTM w celu uchwycenia dynamicznych zależności i ciągłości ruchu. Dla każdego filmu wejściowego najpierw wyodrębniono wieloskalowe cechy CNN dla każdej klatki. Przyjmijmy, że klatki wideo to I1, …, IT. Dla każdej klatki t i każdej skali s wieloskalowy enkoder splotowy generuje wektor cech ft(s) ∈ Rd. Następnie skale łączono w jeden deskryptor klatki za pomocą projekcji + konkatenacji lub sumy ważonej, zgodnie z równaniem (8):
(8)
Następnie wprowadź sekwencję {xt}tT=1 do sieci LSTM w celu zamodelowania dynamiki czasowej. W standardowej notacji LSTM, w czasie t bramki i stany są opisane w równaniach (9) do (13):
(9)
(10)
(11)
(12)
(13)
Tutaj σ oznacza aktywację sigmoidalną, a ⊙ mnożenie elementowe.) Chociaż architektury dwukierunkowych LSTM mogą być wykorzystywane do przechwytywania kontekstu czasowego zarówno z przeszłości, jak i przyszłości, zaproponowana struktura wykorzystuje standardowy LSTM do modelowania zależności czasowych pomiędzy sekwencyjnymi klatkami wideo. Wybór ten jest zgodny z architekturą MSCNN-LSTM przedstawioną w niniejszym badaniu. Po przetworzeniu klipu uzyskano reprezentację klipu (np. ostatni stan ukryty lub pooling czasowy): z = Poolt(vt).
Rysunek 4 przedstawia schemat działania proponowanej architektury LSTM do rozpoznawania czynności sportowych. Sieć otrzymywała sekwencję klatek wideo lub cech wyekstrahowanych przez CNN i przetwarzała je w kolejnych krokach czasowych (t−2, t−1 oraz t). Każda komórka LSTM składała się z bramki wejściowej, bramki zapominania i bramki wyjściowej, które regulowały przepływ informacji w sieci. Bramka wejściowa wprowadzała nowe informacje do stanu komórki, bramka zapominania odrzucała nieistotne informacje czasowe, a bramka wyjściowa generowała stan ukryty przekazywany do następnego kroku czasowego. Stan komórki zachowywał długoterminowe zależności czasowe, podczas gdy stan ukryty rejestrował krótkoterminowe informacje czasowe. Po sekwencyjnym przetwarzaniu wyniki LSTM zostały poddane operacji pooling w celu wygenerowania czasowej reprezentacji cech, która została przekazana do warstwy w pełni połączonej oraz klasyfikatora Softmax w celu przewidzenia odpowiadającej czynności sportowej. Sieć była trenowana przy użyciu optymalizatora Adam przez 100 epok z wielkością partii 32, początkową prędkością uczenia 0,001 oraz funkcją straty cross-entropy. Do końcowej ewaluacji wybrano model o najniższej stracie walidacyjnej. Aby zapewnić odtwarzalność, wszystkie eksperymenty przeprowadzono przy użyciu stałego ziarna losowości 42. W celu poprawy zbieżności zastosowano mechanizm wczesnego zatrzymania (early stopping) oraz redukcję prędkości uczenia w przypadku plateau, a podczas trenowania LSTM zastosowano przycinanie gradientów (gradient clipping) z progiem 5,0, aby zapobiec problemowi eksplodujących gradientów. Proponowany model MSCNN-LSTM zawierał około 15 milionów parametrów trenowalnych.
Końcowe wyniki klas i prawdopodobieństwo są obliczane przy użyciu warstwy liniowej + funkcji softmax, zgodnie z równaniem (14):
(14)
Przeprowadź trenowanie poprzez minimalizację straty entropii krzyżowej dla etykietowanych klipów, zgodnie z równaniem (15):
(15)
gdzie Nb to rozmiar partii, C liczba klas, a y(n) to one-hot ground truth. Regularyzacja (dropout na xt/wyjściach LSTM, weight decay) oraz przycinanie gradientów (gradient clipping) są stosowane w celu zwiększenia stabilności dla długich sekwencji sportowych.