W niniejszym badaniu wykorzystano publicznie dostępne zestawy danych, które nie zawierają żadnych danych osobowych. Wszystkie dane użyte w badaniu zostały zanonimizowane w celu zapewnienia prywatności uczestników. Świadoma zgoda została uzyskana od wszystkich uczestników w momencie zbierania danych, a badanie jest zgodne z wytycznymi etycznymi. Protokół wyjaśnia metodę inteligentnego rozpoznawania zachowań w klasie, która składa się z ekstrakcji cech w oparciu o fuzję danych multimodalnych oraz czasoprzestrzennego rozpoznawania zachowań w oparciu o model Transformer i mechanizm uwagi. Wydajność całej metody jest optymalizowana poprzez wspólne trenowanie.
1. Wielomodalne gromadzenie danych
Multimodalne gromadzenie danych polegało na zbieraniu zsynchronizowanych danych o zachowaniach w klasie z dwóch zbiorów danych: zbioru EduSense oraz zbioru SBU Kinect Interaction. EduSense zawierał nagrania z rzeczywistych sal wykładowych na uniwersytecie, natomiast SBU Kinect rejestrował sekwencje szkieletowe oparte na interakcjach. Zbiory danych obejmowały strumienie wideo, sygnały audio oraz informacje o 3D stawach szkieletowych w celu modelowania postaw i ruchów studentów. Wstępne przetwarzanie danych zapewniło wyrównanie czasowe oraz usuwanie szumów w celu oczyszczenia materiału. Ta konwergencja umożliwiła kompleksowe monitorowanie zachowań, rejestrując gesty wizualne i ruchy ciała w wielu sytuacjach edukacyjnych.
2. Ekstrakcja cech oparta na fuzji danych multimodalnych
W odpowiedzi na problem rozpoznawania zachowań uczniów w inteligentnych salach lekcyjnych zaproponowano metodę inteligentnego rozpoznawania zachowań w klasie z wykorzystaniem Transformer i AM. Ze względu na złożony charakter sal lekcyjnych z liczną grupą uczniów, zmiany czynników wewnątrz sceny mogą zakłócać rozpoznawanie zachowań uczniów. Ponadto ekstrakcja pojedynczej cechy posiada ograniczenia, takie jak niepełne informacje, podatność na zakłócenia środowiskowe oraz trudności w uchwyceniu złożonych zachowań19,20. W związku z tym w badaniu zaproponowano najpierw metodę ekstrakcji cech uczniów w klasie opartą na fuzji danych multimodalnych. Metoda ta łączy dane z modalności wideo i szkieletowej, wykorzystując ich komplementarność do osiągnięcia bardziej kompleksowej i dokładnej ekstrakcji cech zachowań uczniów. W szczególności każda wejściowa sekwencja wideo jest dzielona na klatki. Klatki są wprowadzane do wstępnie wytrenowanego modelu Faster R-CNN w celu lokalizacji obszarów zainteresowania (ROI) postaci ludzkich. Wykryte obszary są przekazywane do głównej sieci neuronowej splotowej (backbone) w celu uzyskania czasowych cech wizualnych. W przypadku modalności szkieletowej, trójwymiarowe pozycje stawów są traktowane jako sekwencje i kodowane przy użyciu wstępnie wytrenowanego modelu BERT w celu uzyskania zależności czasowych i przestrzennych. Są one normalizowane i osadzane przed wprowadzeniem do sieci fuzji multimodalnej. Przy tym modalność wideo odpowiada głównie za przechwytywanie cech wizualnych, takich jak ruchy i ekspresja uczniów, podczas gdy modalność szkieletowa dokładnie opisuje zmiany postawy uczniów poprzez informacje o punktach stawowych. Podczas gdy modalność wideo opiera się na globalnych cechach percepcji wizualnej w celu reprezentacji ludzkich zachowań, modalność szkieletowa koncentruje się na dynamicznych zmianach pozycji stawów, co prowadzi do znaczących różnic semantycznych między nimi21. Dlatego konieczne jest opracowanie wyspecjalizowanej sieci fuzji multimodalnej, aby skutecznie modelować korelację między obiema modalnościami. Sieć fuzji multimodalnej przedstawiono na Ryc. 1.
Na Rysunku 1 sieć jest podzielona głównie na trzy moduły. Wśród nich wejściem dla modułu przetwarzania modalności wideo jest sekwencja wideo, która jest przetwarzana za pomocą szybszej splotowej sieci neuronowej opartej na regionach (Faster R-CNN) w celu ekstrakcji cech. Przetwarzanie modalności wideo rozpoczyna się od przekształcenia ujęć wideo z sali lekcyjnej w wejścia klatka po klatce do ekstrakcji cech. Klatki są przetwarzane przez szybszą splotową sieć neuronową opartą na regionach (Faster R-CNN) z bazą ResNet-50 trenowaną na zbiorze ImageNet. Sieć przetwarza klatki RGB zmienione rozmiarem do 224 × 224 pikseli, co daje wysokopoziomowe mapy cech wizualnych z cechami przestrzennymi i obiektowymi aktywności studenta. Cechy te są następnie wprowadzane do modułu samoatencji (self-attention), który uczy się zależności czasowych między klatkami przed zakodowaniem ich w osadzenia czasowo-przestrzenne via warstwę Transformera. Pozwala to na zachowanie słabych sygnałów behawioralnych, takich jak pochylenia głowy czy podnoszenie rąk, w reprezentacjach osadzeń do późniejszej fuzji. Wyekstrahowane cechy wideo są przechwytywane przez moduł samoatencji w celu uchwycenia relacji czasowych i przestrzennych w obrębie modalności wideo, a następnie dodatkowo modelowane przez transformer w celu wygenerowania wektorów osadzeń dla informacji czasowo-przestrzennych sekwencji wideo. Wejściem dla modułu przetwarzania modalności szkieletowej jest sekwencja szkieletowa, która jest przetwarzana przez dwukierunkową reprezentację koderów z transformerów (BERT) w celu ekstrakcji cech czasowych i przestrzennych stawów szkieletowych. W przypadku danych szkieletowych poza każdego studenta jest modelowana jako sekwencja 2D współrzędnych stawów z filmów z sali lekcyjnej przy użyciu estymatora pozy opartego na OpenPose. Sekwencje te są konwertowane na tokeny osadzeń, w których każdy token odpowiada klatce z 18 punktami kluczowymi. Kontekst czasowy i zależności tych sekwencji stawów są modelowane przy użyciu modelu dwukierunkowych reprezentacji koderów z transformerów (BERT). Model wykorzystuje 12 warstw transformera, 8 głowic uwagi i ukrytą wielkość 768, co stanowi standardową architekturę BERT-base. Model jest dostrajany podczas treningu, aby nabyć wzorce stawów specyficzne dla danego zachowania. Wyjściowe osadzenia reprezentują cechy strukturalne i związane z ruchem zachowań studenta, które są następnie łączone z cechami modalności wideo. Następnie cechy szkieletowe są dalej agregowane w cechy przestrzenne i czasowe poprzez operacje 3D CNN i pooling, generując wektory osadzeń szkieletu jako reprezentacje cech modalności szkieletowej.
3. Moduł fuzji z mechanizmem cross-attention
W module fuzji cross-attention zastosowano mechanizm wielogłowicowej uwagi (multi-head attention mechanism, MHAM) w celu zbudowania relacji interakcji między modalnością wideo a modalnością szkieletową, a następnie wyekstrahowano bardziej zwarte cechy fuzji z wygenerowanych multimodalnych cech fuzji za pomocą operacji 3D CNN i poolingu. Proces fuzji jest realizowany przy użyciu dwustrumieniowej sieci uwagi, w której osadzenia czasowe każdej modalności są przekazywane przez sieci 3D CNN i dwukierunkowe jednostki GRU. Strumienie danych multimodalnych są wyrównywane za pomocą modułów wielogłowicowej uwagi (MHAM) z wykorzystaniem mechanizmu scaled dot-product attention w celu uzyskania zależności między modalnościami. Następnie osadzenia są redukowane poprzez pooling, aby rozwiązać problem złożoności wymiarowej, i przesyłane do w pełni połączonej warstwy Softmax w celu klasyfikacji.
W sieciach fuzji multimodalnej moduł self-attention jest wykorzystywany do modelowania zależności czasowych i przestrzennych w obrębie pojedynczego trybu, podczas gdy moduł fuzji cross-attention służy do ustanawiania powiązań i interakcji informacyjnych między różnymi trybami. W związku z tym oba są bardzo ważne. Moduł self-attention przechwytuje wewnętrzne zależności sekwencji wejściowej poprzez obliczanie relacji między zapytaniem Q, kluczem K a wartością V. Obliczenia Q, klucza K i wartości V przedstawiono w równaniu (1). Gdzie
to odpowiednio macierze zapytania, klucza i wartości; dk jest wymiarem wektora klucza, a dk wymiarem wektorów wartości. Współczynnik wymiaru dk jest stosowany, aby zapobiec nadmiernemu wzrostowi wartości iloczynów skalarnych, co mogłoby wpłynąć na stabilność gradientów podczas trenowania.
(1)
W równaniu (1)
reprezentuje cechy wejściowe, gdzie n jest długością sekwencji wejściowej, dmodel jest wymiarem cech, a WQ, WK i WV reprezentują trzy zestawy uczących się macierzy projekcji. Poprzez te odwzorowania macierzowe cechy wejściowe są przekształcane w zapytania (queries), klucze (keys) i wartości (values). Iloczyn skalarny zapytania Q i klucza K jest wykorzystywany do obliczenia i przeskalowania wag uwagi, jak pokazano w równaniu (2).
(2)
W równaniu (2) dk reprezentuje wymiar zapytania Q oraz klucza K, a softmax oznacza funkcję softmax wykorzystywaną do uzyskania macierzy wag uwagi. Skalowanie może skutecznie zapobiegać problemowi zbyt małego gradientu wynikającego z nadmiernych wartości iloczynu skalarnego spowodowanych wymiarowością. Macierz wag uwagi jest aplikowana do wartości V w celu uzyskania wyniku Z modułu self-attention, jak pokazano w równaniu (3).
(3)
W równaniu (3), aij oznacza wagę uwagi i -tego wektora zapytania względem j-tego wektora klucza. Szczegółowa struktura modułu fuzji uwagi krzyżowej (cross attention fusion module) przedstawiona jest na Rysunku 2.
Zgodnie z Rysunkiem 2, moduł ten rozpoczyna przede wszystkim przetwarzanie cech wejściowych z modalności szkieletowej i wideo. W pierwszej kolejności sekwencja szkieletu i sekwencja wideo są oddzielnie poddawane działaniu warstw splotowych 3D w celu ekstrakcji cech czasoprzestrzennych, a następnie cechy te są modelowane przy użyciu dwukierunkowych jednostek bramkowanych (Bi-GRUs) w celu modelowania czasowego. Następnie cechy obu modalności są dalej ekstrahowane poprzez MHAMs, aby wyodrębnić korelacje wewnątrz modalności. Każda modalność uzyskuje wewnętrzną reprezentację cech poprzez mechanizmy zapytań (queries), kluczy (keys) i wartości (values). Następnie na wyjściowych cechach wykonuje się uśrednianie czasowe (time-averaged pooling), aby zmniejszyć złożoność wymiaru czasowego. Po uśrednianiu multimodalne cechy są statystycznie agregowane w celu obliczenia średniej i odchylenia standardowego dla każdej modalności, a na koniec rozpoznawanie i klasyfikacja działań ucznia są generowane poprzez warstwę w pełni połączoną (FCL) oraz klasyfikator Softmax. Zatem zaproponowana w badaniu ekstrakcja cech oparta na fuzji danych multimodalnych wykorzystuje mechanizmy self-attention oraz cross AMs, aby precyzyjnie przechwycić i zamodelować cechy czasoprzestrzenne zachowań ucznia poprzez fuzję danych z modalności wideo i szkieletowej, co zwiększa dokładność i kompleksowość rozpoznawania zachowań uczniów w inteligentnych klasach.
4. Rozpoznawanie zachowań czasoprzestrzennych w oparciu o Transformer i mechanizm uwagi
Ekstrakcja cech oparta na fuzji danych multimodalnych pozwala na wstępną poprawę kompleksowości i dokładności analizy zachowań uczniów poprzez łączenie danych z modalności wideo i szkieletowej. Jednakże w kontekście inteligentnych klas zachowania uczniów często zmieniają się w czasie, a to samo zachowanie może wykazywać różne charakterystyki w różnych punktach czasowych i obszarach przestrzennych. Opieranie się wyłącznie na statycznych informacjach wynikających z fuzji cech multimodalnych nie pozwala na pełne uchwycenie złożonych czasowo-przestrzennych relacji dynamicznych w sekwencji zachowań.22,23W związku z tym w dalszych badaniach zaproponowano modelowanie zachowań czasoprzestrzennych oraz mechanizm uwagi (AM) oparty na architekturze Transformer. W badaniu wybrano Vision Transformer (ViT) jako architekturę sieci, która dzięki mechanizmowi samo-uwagi (self AM) pozwala modelować globalne informacje czasoprzestrzenne danych wejściowych i wykazuje większą zdolność do wychwytywania zależności czasoprzestrzennych. Po fuzji multimodalnej połączone cechy są ponownie reprezentowane za pomocą Vision Transformera (ViT) w celu prognozowania zachowań czasoprzestrzennych. Mapy cech w danych wejściowych są dzielone na rozłączne 16 × 16 patchy, liniowo osadzonych w wektorach jednowymiarowych i zakodowanych pozycyjnie w celu zachowania kolejności przestrzennej. Struktura ViT składa się z 12 bloków kodera Transformera, zbudowanych z mechanizmu wielogłowicowej uwagi własnej (8 głowic) oraz warstw przejścia w przód o wymiarze ukrytym wynoszącym 768. Aby zwiększyć istotność behawioralną, zaproponowano moduły uwagi przestrzennej (SA) i uwagi czasowej (TA). Moduł SA zwiększa istotność cech w obszarach przestrzennych poprzez aktywacja Tanh, podczas gdy moduł TA wyróżnia istotne klatki czasowe poprzez aktywacja ReLU. Te dwa strumienie uwagi są następnie łączone z główną strukturą (backbone) ViT poprzez dwuetapowa metoda trenowania, dzięki której model uczy się efektywnie rejestrować dynamiczną ewolucję zachowań w klasie. Struktura ViT została przedstawiona w Rysunek 3.
Na Rysunku 3 przedstawiono architekturę ViT, w której oryginalnym wejściem jest obraz podzielony na wiele małych bloków o stałym rozmiarze; każdy z nich reprezentuje fragment obrazu i zostaje liniowo spłaszczony do wektora jednowymiarowego. Ponieważ Transformer nie potrafi postrzegać informacji o lokalizacji, każdy mały blok jest wzbogacany o informacje pozycyjne przed wprowadzeniem do Transformera, aby zapewnić możliwość uchwycenia relacji przestrzennych pomiędzy poszczególnymi blokami. Głównym modułem ViT jest koder Transformer, który składa się z wielu ułożonych kaskadowo bloków kodujących Transformer. Bloki kodujące składają się z MHAM oraz sieci neuronowej typu feed-forward. MHAM przechwytuje zależności między sekwencjami wejściowymi w sposób równoległy, podczas gdy sieć feed-forward wykonuje nieliniowe przekształcenia wyników w celu zwiększenia zdolności modelu do wychwytywania i wyrażania informacji globalnych. Po przetworzeniu wszystkich małych fragmentów informacji przez koder Transformer, wyjście z ostatniej warstwy kodującej jest przekazywane do wielowarstwowego perceptrona (MLP Head), który generuje końcowe wyniki rozpoznawania i klasyfikacji czynności studenta.
W praktyce każda klatka jest dzielona na niezachodzące na siebie fragmenty (patche) o wymiarach 16 × 16, spłaszczana i poddawana osadzaniu pozycyjnemu w celu zachowania relacji przestrzennych. Osadzenia fragmentów są przetwarzane sekwencyjnie przez stosowane koderami transformera w architekturze ViT. Moduł uwagi przestrzennej (Spatial Attention, SA) wykorzystuje funkcję aktywacji tanh do różnicowania uwagi w obszarach zainteresowania w obrębie każdej klatki, natomiast moduł uwagi czasowej (Temporal Attention, TA) wykorzystuje funkcję ReLU do wyróżnienia klatek istotnych czasowo. Ten dwuskładnikowy mechanizm uwagi umożliwia efektywne modelowanie dynamiki zachowań w przestrzeni i czasie.
Aby dodatkowo zwiększyć wydajność ViT w złożonych sekwencjach behawioralnych, wprowadzono uwagę przestrzenną (SA) oraz uwagę czasową (TA), co pozwala modelowi ViT nie tylko na autonomiczny wybór istotnych stawów przestrzennych, ale także na skupienie się na zachowaniach w różnych punktach czasowych, co lepiej oddaje czasoprzestrzenne zmiany dynamiczne zachowania. Moduł SA i moduł TA przedstawiono na Rysunku 4.
Na Ryc. 4A moduł SA przetwarza informacje o wymiarze przestrzennym danych wejściowych, przekazując cechy bieżącej klatki do warstwy ViT w celu wyodrębnienia stanów ukrytych. Są one łączone z cechami poprzedniej klatki i wspólnie przekazywane do FCL. FCL wykonuje transformację liniową cech w celu wygenerowania latentnych reprezentacji cech. Następnie są one przekazywane do funkcji aktywacji Tanh, aby zmapować wyjście do zakresu [-1,1], co zwiększa nieliniowość i pozwala lepiej odróżnić cechy istotne od nieistotnych. Na koniec cechy są normalizowane za pomocą warstwy normalizacji, aby zapewnić relatywnie stabilną skalę cech wyjściowych. Na Ryc. 4B moduł TA koncentruje się bardziej na kluczowych informacjach zawartych w każdej klatce w wymiarze czasowym. W przeciwieństwie do funkcji Tanh w SA, moduł TA wykorzystuje funkcję aktywacji ReLU do tłumienia wartości ujemnych i zachowuje jedynie wyjścia z wartości dodatnich, co skutecznie usuwa negatywne informacje szumowe i wzmacnia zdolność modelu do przechwytywania informacji w czasie.
5. Metoda wspólnego treningu
Aby skutecznie rozwiązać problem stronniczych i redundantnych cech czasoprzestrzennych, wynikających z wzajemnego wpływu ViT, modułu SA oraz modułu TA w rozpoznawaniu zachowań czasoprzestrzennych opartym na Transformerze i mechanizmach uwagi, zastosowano metodę wspólnego trenowania w celu optymalizacji tych trzech modułów. Szczegółowy proces przedstawiono na Rysunku 5.
Na Rysunku 5 przedstawiono strategię wspólnego trenowania, która w pierwszej kolejności wprowadza parametry trenowania modelu, definiuje strukturę sieci oraz hiperparametry. Następnie przeprowadzane jest oddzielne wstępne trenowanie modułów SA i TA w celu lepszego wyuczenia cech lokalnych. Należy zauważyć, że podczas wstępnego trenowania jednego modelu, wagi drugiego modelu pozostają stałe i nie są aktualizowane. Po zakończeniu indywidualnego wstępnego trenowania, warstwa ViT zostaje połączona w celu trenowania. Następnie dwa modele uwagi zostają zamrożone, a główna sieć ViT jest trenowana osobno. Ostatecznie, poprzez wspólne trenowanie głównej sieci ViT oraz modułów SA i TA, optymalizowana jest cała sieć w celu wygenerowania końcowego modelu do inteligentnego rozpoznawania zachowań w klasie. Procedura trenowania jest realizowana etapowo: (1) autonomiczne wstępne trenowanie modułów SA i TA przy zamrożonych parametrach ViT, (2) etapowe trenowanie ViT przy zamrożonych wagach modułów uwagi oraz (3) dostrajanie end-to-end wszystkich komponentów razem przy użyciu optymalizatora Adam (learning rate = 0.001, batch size = 64, epochs = 100). Podejście to stabilizuje uczenie cech i redukuje interferencje między modułami podczas optymalizacji.
Ogólnie rzecz biorąc, proponowana metoda rozpoznawania zachowań w inteligentnej klasie łączy modalności wideo i szkieletowe, aby modelować relacje czasoprzestrzenne za pomocą mechanizmów self-attention oraz modułów cross AM. Dzięki wykorzystaniu globalnej zdolności modelowania czasoprzestrzennego ViT oraz połączeniu modułów przestrzennych i TA, model został zoptymalizowany pod kątem wychwytywania kluczowych zachowań i dynamiki czasowej, co pozwala na bardziej kompleksowe i dokładne rozpoznawanie zachowań uczniów. W rozważanej architekturze przeprowadzane są krytyczne operacje fuzji, w których łączone są multimodalne reprezentacje cech. W szczególności cechy przestrzenne wyuczone przez CNN są łączone z cechami czasowymi Bi-LSTM. Wynik ten jest następnie łączony z cechami wzmocnionymi przez mechanizm uwagi MHAM przed wykonaniem zadania klasyfikacji. Operacje fuzji te są kluczowe dla połączenia komplementarnych widoków danych behawioralnych i zostały podkreślone na Rysunku 1 oraz Rysunku 5.
Algorytm 1 ilustruje połączenie multimodalnych danych: informacji szkieletowych, tekstowych i wideo, przy użyciu modeli opartych na ViT, BERT i GCN w celu wyodrębnienia informacyjnych cech w danej klasie. Następnie wspólna reprezentacja jest etykietowana w celu identyfikacji zachowań studenta, co pozwala uzyskać wyższą dokładność dzięki uczeniu między-modalnemu.
Algorytm 1: Proces multimodalnego rozpoznawania zachowań z wykorzystaniem ViT, BERT i GCN.
Inicjalizacja:
Wstępnie wytrenowany model BERT
Wstępnie wytrenowany model Faster R-CNN
Wstępnie wytrenowany model ViT
Model GCN dla danych szkieletowych
Klasyfikator (np. MLP lub Transformer)
Wczytaj zestaw danych:
Dla każdej próbki w zbiorze danych multimodalnych:
Wyodrębnij klatki wideo
Wyodrębnij transkrypcję audio
Wyodrębnianie danych szkieletowych (OpenPose lub MediaPipe)
Krok 1: Przetwarzanie modalności wideo
Dla każdej klatki w filmie:
Zastosuj Faster R-CNN w celu wykrycia obiektów/uczestników
Zastosuj Vision Transformer (ViT) w celu wyodrębnienia cech na poziomie klatki
Agregowanie cech w czasie w celu reprezentacji temporalnej
Krok 2: Przetwarzanie modalności tekstowej
Wstępne przetwarzanie tekstu transkrypcji:
Wykonaj tokenizację przy użyciu tokenizera BERT
Prześlij tokeny przez model BERT
Wyodrębnij osadzenia kontekstowe (contextual embeddings) z tokenu [CLS] lub poprzez średnie pulowanie (average pooling)
Krok 3: Przetwarzanie modalności szkieletowej
Dla każdej sekwencji szkieletowej:
Normalizacja współrzędnych
Przeprowadź przez GCN lub ST-GCN w celu wyodrębnienia cech ruchu
Krok 4: Fuzja cech
Łączenie (konkatenacja) lub fuzja z mechanizmem uwagi:
Funkcje wideo
Funkcje tekstu
Cechy szkieletowe
Uzyskanie jednolitej reprezentacji multimodalnej
Krok 5: Klasyfikacja
Przekaż połączoną reprezentację do końcowego klasyfikatora
Przewidywanie etykiety zachowania w klasie (np. skupiony, rozproszony)
Krok 6: Ocena
Porównaj wyniki predykcji z prawdą obiektywną
Oblicz metryki: dokładność (Accuracy), precyzja (Precision), czułość (Recall), wynik F1 (F1 Score)