Artykuł badawczy

Rozpoznawanie zachowań w klasie za pomocą transformatora i mechanizmu uwagi: zastosowanie w ocenie jakości nauczania w edukacji medycznej opartej na sztucznej inteligencji

DOI:

10.3791/69052

15 sierpnia 2025

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie przedstawia oparty na Transformerze system sztucznej inteligencji do rozpoznawania zachowań w klasie w edukacji medycznej i pielęgniarskiej. Korzystając z danych multimodalnych, system ocenia zaangażowanie i stany emocjonalne uczniów. Wyniki wykazują wyższą dokładność w porównaniu z tradycyjnymi modelami, umożliwiając przekazywanie informacji zwrotnych w czasie rzeczywistym i lepsze wsparcie dla jakości nauczania i zdrowia psychicznego uczniów.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie wprowadza oparty na Transformerze system sztucznej inteligencji przeznaczony do rozpoznawania zachowań w klasie, mający na celu poprawę oceny jakości nauczania i monitorowania zdrowia psychicznego w edukacji medycznej i pielęgniarskiej. Model wykorzystuje dane multimodalne, w szczególności wideo, audio i ruch szkieletu, do oceny kluczowych wskaźników zaangażowania uczniów, takich jak koncentracja uwagi, częstotliwość interakcji i wahania emocjonalne. Nowatorska strategia fuzji multimodalnej, w połączeniu z mechanizmami uwagi czasoprzestrzennej, umożliwia systemowi rejestrowanie złożonych zachowań w klasie z większą precyzją i niezawodnością. Wyniki eksperymentów na zestawach danych EduSense i SBU Kinect pokazują, że proponowana metoda znacznie przewyższa tradycyjne modele zarówno pod względem dokładności, jak i wskaźnika fałszywych alarmów. Ponadto badania ablacyjne potwierdzają wkład modułów uwagi przestrzennej i czasowej w zdolność rozpoznawania systemu. Platforma obsługuje informacje zwrotne w czasie rzeczywistym i wizualne mapowanie zachowań, oferując praktyczną wartość w środowiskach uczenia się opartego na doświadczeniu. Podejście to zapewnia skalowalne i adaptacyjne rozwiązanie do monitorowania zachowania w klasie i wspiera strategie wczesnej interwencji w edukacji medycznej.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wraz z rosnącymi wyzwaniami związanymi ze zdrowiem psychicznym wśród studentów pielęgniarstwa i medycyny z powodu stresu akademickiego i klinicznego, integracja sztucznej inteligencji w środowisku klasowym może zapewnić nie tylko monitorowanie jakości nauczania, ale także wsparcie psychologiczne w czasie rzeczywistym. To badanie pozycjonuje rozpoznawanie zachowań w edukacji medycznej w celu wspierania uczenia się przez doświadczenie i promowania dobrego samopoczucia uczniów1. Inteligentna klasa odnosi się do nowego i wysokiej jakości modelu edukacyjnego, który łączy inteligentne i spersonalizowane procesy nauczania poprzez zastosowanie najnowocześniejszych technologii, takich jak technologia informacyjna, sztuczna inteligencja, duże zbiory danych i Internet rzeczy, aby wspomóc zarządzanie nauczaniem i interakcję w klasie2,3,4. Obecnie, wraz z rozwojem technologii, takich jak kamery i czujniki, dane behawioralne zbierane w klasie obejmują nie tylko filmy, ale także dane multimodalne, takie jak głos i audio5. Jednak radzenie sobie z tymi złożonymi informacjami i danymi czasoprzestrzennymi oraz dokładne wydobywanie z nich cennych cech behawioralnych to główne wyzwania stojące przed dziedziną inteligentnego rozpoznawania zachowań w klasie6,7. Istniejące podejścia do rozpoznawania zachowań opierają się głównie na wyodrębnianiu cech z jednomodalnych źródeł danych, takich jak strumienie wideo w klasie lub sekwencyjne obrazy8. Chociaż metody te mogą wykrywać zgrubne zdarzenia behawioralne, często nie są w stanie modelować ewolucji czasowej i niuansów przestrzennych gestów, wyrażeń lub czynników częstotliwości interakcji uczniów, które mają kluczowe znaczenie dla zrozumienia samopoczucia i skupienia ucznia9. Co więcej, obecne modele nie mają solidnych mechanizmów łączenia heterogenicznych źródeł danych, takich jak sygnały dźwiękowe i ruchy szkieletu, co ogranicza ich wrażliwość na afektywne lub niezaangażowane zachowanie10. Aby zaradzić tym ograniczeniom, w niniejszym badaniu zaproponowano oparty na transformatorach system rozpoznawania zachowań w klasie, wzbogacony o mechanizmy uwagi przestrzenno-czasowej. Wykorzystując zdolność Transformera do modelowania zależności dalekiego zasięgu i łącząc ją ze strategiami fuzji cech multimodalnych, proponowany system ma na celu poprawę precyzji klasyfikacji zachowań, umożliwiając jednocześnie wizualizację wskaźników zaangażowania i emocji w czasie rzeczywistym. Ostatecznym celem jest wspieranie dynamicznej oceny jakości nauczania i wbudowanych informacji zwrotnych na temat zdrowia psychicznego w edukację medyczną, oferując skalowalne, adaptacyjne rozwiązanie do monitorowania i zwiększania zarówno skuteczności nauczania, jak i dobrostanu uczniów.

Ocena proponuje nowatorski system rozpoznawania zachowań oparty na transformatorach, który łączy mechanizmy uwagi czasoprzestrzennej z multimodalną fuzją danych (wideo i szkieletowe) dostosowaną do inteligentnej obserwacji w klasie w edukacji medycznej i pielęgniarskiej. W przeciwieństwie do istniejących modeli, nowy model ułatwia dokładne wykrywanie uwagi uczniów i stanów emocjonalnych w czasie rzeczywistym, co jest cenne zarówno dla oceny jakości nauczania, jak i dobrego samopoczucia psychicznego.

Powiązane prace
Inteligentna klasa to nowe środowisko nauczania, które wykorzystuje nowoczesną technologię informacyjną w celu usprawnienia interakcji w nauczaniu, spersonalizowanego uczenia się i zarządzania nauczaniem. Może wykorzystywać inteligentne metody nauczania w celu poprawy efektywności i jakości nauczania, zapewniając jednocześnie uczniom bogatsze i bardziej spersonalizowane doświadczenia edukacyjne. Dlatego wielu naukowców na całym świecie prowadziło badania nad inteligentną technologią i nauczaniem w klasie. Radosavljevic i in. zaproponowali inteligentny model klasy oparty na inteligencji środowiskowej, który ocenia poziom zmęczenia uczniów i dostosowuje strategie uczenia się, analizując dane dotyczące ich codziennej aktywności akademickiej w celu optymalizacji wyników uczenia się11. Tai T. Y badał wpływ inteligentnych asystentów osobistych na poprawę umiejętności mówienia w językach obcych i odkrył, że korzystanie z Asystenta Google znacznie poprawiło umiejętności mówienia osób, dla których język obcy nie jest językiem ojczystym, z podobnymi efektami jak w przypadku native speakerów w communication12. Chen i in. odkryli w swoich badaniach, że wykorzystanie chatbotów jako narzędzi dydaktycznych może szybko reagować na potrzeby uczniów, zwiększać interaktywność i demonstrować potencjalne zastosowanie inteligentnej technologii w klasie13. Badania wykazały metodę oceny efektywności nauczania w klasie opartą na inteligentnym trybie nauczania, która poprawiła dokładność oceny dzięki zastosowaniu algorytmu wyszukiwania kukułki i ekstremalnej maszyny uczącej się14.

Rozpoznawanie zachowań w inteligentnych klasach jest kluczową technologią do osiągnięcia spersonalizowanego nauczania i optymalizacji zarządzania klasą. Może monitorować stan zachowania uczniów w czasie rzeczywistym i dostarczać skutecznych informacji zwrotnych. Dzięki rozpoznawaniu zachowań nauczyciele mogą dokładnie zrozumieć uczestnictwo i koncentrację uczniów, poprawiając w ten sposób efektywność nauczania i pomagając w podejmowaniu decyzji. W tym kontekście naukowcy na całym świecie przeprowadzili szeroko zakrojone badania nad inteligentnym rozpoznawaniem zachowań w klasie. W ramach badań zaproponowano system monitorowania wizualnego w czasie rzeczywistym oparty na sztucznej inteligencji, który wykorzystywał uczenie maszynowe do trenowania modeli rozpoznawania zachowań uczniów, aby pomóc nauczycielom lepiej monitorować uczestnictwo uczniów i interakcje w klasie, optymalizując w ten sposób jakość nauczania15. Chonggao P osiągnął rozpoznawanie zachowań uczniów w czasie rzeczywistym i poprawił dokładność analizy zachowania w klasie w zdalnym nauczaniu, łącząc analizę klastrów i algorytm losowego lasu, a także model ludzkiego szkieletu16. Wu S opracował model rozpoznawania zachowań uczniów, który łączy optymalizację roju cząstek i algorytm K-najbliższego sąsiada, promując dokładność rozpoznawania emocji, aby sprostać praktycznym potrzebom nauczania w klasie17. System ACORN zaproponowany przez Ramakrishnana i in. wykorzystywał multimodalne uczenie maszynowe i połączone konwolucyjne sieci neuronowe do analizy danych dźwiękowych, mimicznych i obrazu. Integracja tych cech za pomocą czasowych sieci konwolucyjnych pozwoliła na automatyczną ocenę atmosfery w klasie i poczynienie wstępnych postępów18.

Podsumowując, istniejące badania proponują różne techniki oparte na uczeniu maszynowym i głębokim uczeniu do inteligentnego rozpoznawania zachowań w klasie, obejmujące takie obszary jak wykrywanie zmęczenia uczniów, analiza nastrojów i monitorowanie interakcji w klasie. Jednak nadal istnieją pewne niedociągnięcia w obecnych badaniach, a wielu metodom brakuje wystarczającego czasu rzeczywistego i skalowalności w praktycznych zastosowaniach, co utrudnia dostosowanie się do złożonych i zmieniających się scenariuszy w klasie. W związku z tym w badaniu zaproponowano inteligentną metodę rozpoznawania zachowań w klasie za pomocą Transformera i AM. Innowacyjność badań polega na wykorzystaniu potężnych możliwości modelowania czasowego Transformera w połączeniu z czasoprzestrzennym AM w celu dokładnego uchwycenia kluczowych momentów i regionów behawioralnych w klasie oraz integracji wielu źródeł informacji, takich jak wideo i audio, poprzez multimodalną fuzję danych w celu zwiększenia kompleksowości i dokładności rozpoznawania zachowań.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie wykorzystuje publicznie dostępne zestawy danych, które nie zawierają żadnych danych umożliwiających identyfikację osoby. Wszystkie dane wykorzystane w badaniu zostały zanonimizowane w celu zapewnienia prywatności uczestników. Świadomą zgodę uzyskano od wszystkich uczestników w momencie zbierania danych, a badanie jest zgodne z wytycznymi etycznymi. Protokół wyjaśnia metodę inteligentnego rozpoznawania zachowań w klasie, która składa się z ekstrakcji cech w oparciu o multimodalną fuzję danych i czasoprzestrzenne rozpoznawanie zachowań w oparciu o transformator i uwagę. Wydajność całej metody jest optymalizowana dzięki wspólnemu treningowi.

1. Zbieranie danych w wielu modelach

Multimodalne zbieranie danych polegało na zbieraniu zsynchronizowanych danych o zachowaniu klas z dwóch zestawów danych: EduSense Dataset i SBU Kinect Interaction Dataset. EduSense nagrał rzeczywiste nagrania z sal uniwersyteckich, a SBU Kinect nagrał sekwencje szkieletowe oparte na interakcji. Zestawy danych zawierały strumienie wideo, wskazówki dźwiękowe i informacje o stawach szkieletowych 3D do modelowania postawy i ruchu uczniów. Wstępne przetwarzanie danych gwarantuje wyrównanie czasowe i usuwanie szumów podczas czyszczenia. Ta konwergencja zapewniła kompleksowe monitorowanie zachowania, rejestrowanie gestów wizualnych i ruchów ciała w wielu sytuacjach związanych z uczeniem się.

2. Ekstrakcja cech oparta na multimodalnej fuzji danych

Mając na celu rozwiązanie problemu rozpoznawania zachowań uczniów w inteligentnych klasach, zaproponowano metodę inteligentnego rozpoznawania zachowań uczniów w klasie za pomocą Transformera i AM. Ze względu na złożony charakter sal lekcyjnych z wieloma uczniami, zmiany czynników w obrębie sceny mogą zakłócać rozpoznawanie zachowań uczniów. Ponadto wyodrębnianie pojedynczych cech ma ograniczenia, takie jak niekompletne informacje, podatność na zakłócenia środowiskowe i trudności w uchwyceniu złożonych zachowań19,20. W związku z tym w badaniu najpierw zaproponowano metodę ekstrakcji cech w klasie studenckiej opartą na multimodalnej fuzji danych. Metoda ta łączy dane z modalności wideo i szkieletowych, wykorzystując ich komplementarność w celu uzyskania bardziej wszechstronnej i dokładnej ekstrakcji cech zachowania uczniów. W szczególności każda wejściowa sekwencja wideo jest podzielona klatkowo. Klatki są wprowadzane do wstępnie wytrenowanego Faster R-CNN w celu zlokalizowania obszarów zainteresowania ludzi. Wykryte regiony są wprowadzane do konwolucyjnej sieci neuronowej w celu uzyskania czasowych funkcji wizualnych. W przypadku modalności szkieletowej pozycje stawów 3D są przedstawiane jako sekwencje i kodowane przy użyciu wstępnie wytrenowanego modelu w celu uzyskania zależności czasowych i przestrzennych. Są one normalizowane i osadzane przed wprowadzeniem do multimodalnej sieci fuzji. Wśród nich modalność wideo jest głównie odpowiedzialna za uchwycenie cech wizualnych, takich jak ruchy i mimika uczniów, podczas gdy modalność szkieletowa dokładnie opisuje zmiany postawy uczniów poprzez informacje o punktach stawowych. Podczas gdy modalność wideo opiera się na globalnych cechach percepcji wzrokowej, podczas gdy modalność szkieletowa globalne cechy wizualne reprezentują ludzkie zachowanie, modalność szkieletowa koncentruje się na dynamicznych zmianach pozycji stawu, co prowadzi do znacznych różnic semantycznych między dwoma21. W związku z tym konieczne jest opracowanie wyspecjalizowanej multimodalnej sieci syntezy jądrowej, aby skutecznie modelować korelację między tymi dwiema modalnościami. Multimodalna sieć fuzji jest pokazana w Rysunek 1.

W Rysunek 1, sieć jest głównie podzielona na trzy moduły. Wśród nich danymi wejściowymi modułu przetwarzania modalności wideo jest sekwencja wideo, która jest wyodrębniana przez szybszą konwolucyjną sieć neuronową opartą na regionie (Faster R-CNN) w celu ekstrakcji cech. Traktowanie modalności wideo rozpoczyna się od przekształcenia ujęć wideo z klasy na dane wejściowe klatka po klatce w celu wyodrębnienia funkcji. Ramki są traktowane za pomocą szybszej konwolucyjnej sieci neuronowej opartej na regionie (Faster R-CNN) z bazą ResNet-50 wyszkoloną na ImageNet. Sieć traktuje ramki RGB o rozmiarze zmienionym na 224 × 224 piksele, co skutkuje wysokopoziomowymi wizualnymi mapami cech z przestrzennymi i specyficznymi dla obiektów cechami aktywności uczniów. Cechy te są następnie wprowadzane do modułu samouwagi, który uczy się relacji czasowych między ramkami przed zakodowaniem ich w osadzeniu czasoprzestrzennym za pomocą warstwy Transformera. Zachowuje to słabe sygnały behawioralne, takie jak przechylanie głowy lub unoszenie ręki, w osadzaniu reprezentacji do późniejszej fuzji. Wyodrębnione cechy wideo są przechwytywane przez moduł samouwagi w celu uchwycenia relacji czasowych i przestrzennych w modalności wideo, a następnie dalej modelowane przez transformator w celu wygenerowania wektorów osadzania dla informacji czasoprzestrzennych sekwencji wideo. Danymi wejściowymi modułu przetwarzania modalności szkieletowej jest sekwencja szkieletowa, która jest przetwarzana przez dwukierunkową reprezentację kodera z transformatorów () w celu wyodrębnienia czasowych i przestrzennych cech stawów szkieletowych. W przypadku danych szkieletowych pozycja każdego ucznia jest modelowana jako sekwencja współrzędnych połączeń 2D z filmów w klasie przy użyciu estymatora pozycji opartego na OpenPose. Sekwencje te są przekształcane w tokeny osadzania, w których każdy token odpowiada ramce z 18 punktami kluczowymi. Kontekst czasowy i zależności tych wspólnych sekwencji są modelowane przy użyciu modelu Bidirectional Encoder Representations from Transformers (). Model wykorzystuje 12 warstw transformatora, 8 głowic ostrzegawczych i ukryty rozmiar 768, który jest standardową architekturą opartą na. Model jest dostrajany podczas trenowania w celu uzyskania wzorców stawów specyficznych dla zachowania. Osadzenia wyjściowe reprezentują strukturalne i związane z ruchem cechy zachowania uczniów, które są następnie łączone z funkcjami modalności wideo. Następnie cechy szkieletu są dalej agregowane w cechy przestrzenne i czasowe za pomocą CNN 3D i operacji łączenia, generując osadzone wektory szkieletu jako reprezentacje cech modalności szkieletu.

3. Moduł fuzji wzajemnej uwagi

W module fuzji krzyżowej uwagi, badanie wykorzystuje mechanizm wielogłowicowej uwagi (MHAM) do konstruowania relacji interakcji między modalnością wideo a modalnością szkieletową, a następnie wyodrębnia bardziej kompaktowe cechy fuzji za pomocą CNN 3D i operacji łączenia z wygenerowanych funkcji fuzji multimodalnej. Proces fuzji odbywa się za pomocą dwustrumieniowej sieci uwagi, w której czasowe osadzenia każdej modalności są przekazywane przez 3D CNN i dwukierunkowe GRU. Multimodalne strumienie danych są dopasowywane za pomocą wielogłowicowych modułów uwagi (MHAM), ze skalowaną uwagą iloczynu skalarnego w celu osiągnięcia zależności intermodalności. Osadzenia są następnie łączone w celu rozwiązania problemu złożoności wymiarowej i wysyłane do w pełni połączonej warstwy Softmax w celu klasyfikacji.

W multimodalnych sieciach fuzji, moduł samouwagi jest używany do modelowania zależności czasowej i przestrzennej w obrębie jednego trybu, podczas gdy moduł fuzji wzajemnej uwagi jest używany do ustalenia powiązań i interakcji informacyjnych między różnymi modami. Dlatego oba są bardzo ważne. Moduł samouwagi przechwytuje wewnętrzne zależności sekwencji wejściowej, obliczając relację między zapytaniem Q, kluczem K i wartością V. Obliczenie Q, klucza K i wartości V jest pokazane w równaniu (1). Gdzie figure-protocol-1 to odpowiednio macierze zapytania, klucza i wartości; dk jest kluczową wymiarowością wektora, a dk jest wymiarowością wektorów wartości. Współczynnik wymiarowy dk jest przyjmowany w celu uniknięcia sytuacji, w której iloczyny skalarne stają się duże, co miałoby wpływ na stabilność nachyleń podczas treningu.

figure-protocol-2 (1)

W równaniu (1), figure-protocol-3 reprezentuje cechy wejściowe, gdzie n to długość sekwencji wejściowej, model d to wymiar cech, a WQ, WK i WV reprezentują trzy zestawy możliwych do opanowania macierzy projekcji. Za pomocą tych mapowań macierzy funkcje wejściowe są przekształcane w zapytania, klucze i wartości. Iloczyn skalarny zapytania Q i klucza K są wykorzystywane do obliczania wag uwagi i skalowania ich, jak pokazano w równaniu (2).

figure-protocol-4 (2)

W równaniu (2), dk reprezentuje wymiar zapytania Q i klucza K, a softmax oznacza funkcję softmax użytą do uzyskania macierzy wagi uwagi. Skalowanie może skutecznie zapobiec problemowi zbyt małego gradientu z powodu nadmiernych wartości iloczynu skalarnego spowodowanych wymiarowością. Macierz wagi uwagi jest stosowana do wartości V w celu uzyskania wyniku Z modułu samouwagi, jak pokazano w równaniu (3).

figure-protocol-5 (3)

W równaniu (3), ij oznacza wagę uwagi i-tego wektora zapytania na j-tym wektorze klucza. Specyficzna struktura modułu fuzji uwagi krzyżowej jest oznaczona w Rysunek 2.

Z Rysunek 2, ten moduł głównie zaczyna przetwarzać cechy wejściowe z modalności szkieletowej i wideo. Po pierwsze, sekwencja szkieletowa i sekwencja wideo są oddzielnie poddawane warstwom konwolucyjnym 3D w celu wyodrębnienia cech czasoprzestrzennych, a następnie te cechy czasoprzestrzenne są modelowane przy użyciu dwukierunkowych bramkowanych jednostek rekurencyjnych (Bi-GRU) do modelowania czasowego. Następnie cechy tych dwóch modalności są dalej ekstrahowane za pomocą MHAM w celu wyodrębnienia korelacji w obrębie modalności. Każda modalność osiąga wewnętrzną reprezentację funkcji za pomocą mechanizmów zapytań, kluczy i wartości. Następnie na obiektach wyjściowych wykonywane jest buforowanie uśrednione w czasie, aby zmniejszyć złożoność wymiaru czasu. Po połączeniu cechy multimodalne są statystycznie łączone w celu obliczenia średniej i odchylenia standardowego każdej modalności, a na koniec wyprowadzają rozpoznanie i klasyfikację działania ucznia za pomocą w pełni połączonej warstwy (FCL) i klasyfikatora Softmax. W związku z tym ekstrakcja cech oparta na multimodalnej fuzji danych zaproponowana w badaniu wykorzystuje samouwagę i krzyżowe AM do dokładnego uchwycenia i modelowania czasoprzestrzennych cech zachowania uczniów poprzez połączenie danych z modalności wideo i szkieletowych, poprawiając w ten sposób dokładność i kompleksowość rozpoznawania zachowań uczniów w inteligentnych klasach.

4. Rozpoznawanie zachowań czasoprzestrzennych na podstawie Transformera i uwagi

Ekstrakcja cech oparta na multimodalnej fuzji danych osiąga wstępną poprawę kompleksowości i dokładności zachowań uczniów poprzez połączenie danych z modalności wideo i szkieletowej. Jednak w kontekście inteligentnych klas zachowanie uczniów często zmienia się w czasie, a to samo zachowanie może wykazywać różne cechy w różnych punktach czasowych i regionach przestrzennych. Poleganie wyłącznie na informacjach statycznych połączonych z cechami multimodalnymi nie jest w stanie w pełni uchwycić złożonych dynamicznych relacji czasoprzestrzennych w sekwencji zachowań22,23. W związku z tym dalsze badania proponują modelowanie zachowań czasoprzestrzennych i AM w oparciu o Transformer. W badaniu wybrano Vision Transformer (ViT) jako architekturę sieci, która może modelować globalne informacje czasoprzestrzenne danych wejściowych za pośrednictwem samodzielnej AM i ma większą zdolność do wychwytywania zależności czasoprzestrzennych. Po fuzji multimodalnej, połączone cechy są ponownie reprezentowane za pomocą transformatora wizyjnego (ViT) w celu prognozowania zachowania czasoprzestrzennego. Mapy obiektów w danych wejściowych są podzielone na rozłączne łaty 16 ×, liniowo osadzone w wektorach jednowymiarowych i zakodowane pozycyjnie w celu zachowania porządku przestrzennego. Struktura ViT składa się z 12 bloków enkodera Transformer, składających się z wielogłowicowej samouwagi (8 głowic) i warstw sprzężenia zwrotnego, których ukryty wymiar wynosi 768. Aby zwiększyć istotność behawioralną, sugeruje się moduły uwagi przestrzennej (SA) i uwagi czasowej (TA). Moduł SA zachęca do istotności funkcji w obszarach przestrzennych poprzez aktywację Tanh, podczas gdy moduł TA podkreśla ważne ramy czasowe poprzez aktywację ReLU. Te dwa strumienie uwagi są następnie łączone ze szkieletem ViT za pomocą dwuetapowej metody treningu, dzięki czemu model uczy się skutecznie rejestrować dynamiczną ewolucję zachowania w klasie. Struktura ViT jest pokazana w Rysunek 3.

W Rysunek 3, w ViT, oryginalne dane wejściowe to obraz, który jest podzielony na wiele małych bloków o stałym rozmiarze, z których każdy jest reprezentowany jako część obrazu, i liniowo spłaszczany do jednowymiarowego wektora. Ponieważ transformator nie może odbierać informacji o lokalizacji, każdy mały blok jest osadzony z informacjami o lokalizacji przed wprowadzeniem do Transformera, aby zapewnić, że może uchwycić względną relację położenia przestrzennego między różnymi małymi blokami. Podstawowym modułem ViT jest enkoder Transformer, który składa się z wielu ułożonych w stos bloków kodujących Transformer. Bloki kodowania składają się z MHAM i sieci neuronowej sprzężenia zwrotnego. MHAM przechwytuje zależności między sekwencjami wejściowymi równolegle, podczas gdy sieć neuronowa sprzężenia zwrotnego wykonuje nieliniowe transformacje wyników, aby zwiększyć zdolność modelu do przechwytywania i wyrażania informacji globalnych. Po tym, jak koder Transformer przetworzy wszystkie małe fragmenty informacji, dane wyjściowe ostatniej warstwy kodowania są przekazywane do wielowarstwowej głowicy perceptronowej (MLP Head), która wyprowadza końcowe wyniki rozpoznawania i klasyfikacji działań ucznia.

Praktycznie, każda klatka jest podzielona na nienakładające się na siebie 16 × 16 łat, spłaszczone i osadzone pozycyjnie w celu zachowania relacji przestrzennych. Osadzanie łatek jest przetwarzane sekwencyjnie przez piętrowe enkodery transformatorowe w architekturze ViT. Moduł Uwagi Przestrzennej (SA) wykorzystuje aktywację tanh do zmiany uwagi w obszarach zainteresowania w każdej klatce, a moduł Uwagi Temporalnej (TA) wykorzystuje ReLU do podkreślenia czasowo ważnych ramek. Ten mechanizm podwójnej uwagi umożliwia efektywne modelowanie dynamiki zachowań w czasie i przestrzeni.

Aby jeszcze bardziej zwiększyć wydajność ViT w złożonych sekwencjach behawioralnych, wprowadzono uwagę przestrzenną (SA) i uwagę czasową (TA), aby umożliwić ViT nie tylko autonomiczne wybieranie ważnych stawów przestrzennych, ale także skupianie się na zachowaniach w różnych punktach czasowych, lepiej uchwycając czasoprzestrzenne dynamiczne zmiany zachowania. Moduł SA i moduł TA są oznaczone w Rysunek 4.

W Rysunek 4A, moduł SA przetwarza informacje o wymiarach przestrzennych danych wejściowych, przekazując cechy bieżącej klatki do warstwy ViT w celu wyodrębnienia ukrytych stanów. Są one połączone z cechami poprzedniej ramy i wspólnie wprowadzane do FCL. FCL wykona transformację liniową na obiektach w celu wygenerowania reprezentacji cech utajonych. Następnie jest przekazywany do funkcji aktywacji Tanh w celu odwzorowania danych wyjściowych do zakresu [-1,1], zwiększając nieliniowość i lepiej rozróżniając ważne i nieistotne cechy. Na koniec obiekty są normalizowane za pomocą warstwy normalizacji, aby zapewnić, że obiekty wyjściowe mają stosunkowo stabilną skalę. W Rysunek 4B, moduł TA skupia się bardziej na kluczowych informacjach zawartych w każdej klatce w wymiarze czasowym. W przeciwieństwie do Tanh w SA, moduł TA wykorzystuje funkcję aktywacji ReLU do tłumienia wartości ujemnych i zachowuje tylko dane wyjściowe wartości dodatnich, skutecznie usuwając negatywne informacje o szumie i zwiększając zdolność modelu do przechwytywania w czasie.

5. Wspólna metoda treningu

Aby skutecznie rozwiązać problem tendencyjnych i nadmiarowych cech czasoprzestrzennych spowodowanych wzajemnym wpływem między modułem ViT, SA i modułem TA w rozpoznawaniu zachowań czasoprzestrzennych w oparciu o transformator i uwagę, zastosowano wspólną metodę treningu w celu optymalizacji tych trzech modułów. Konkretny proces jest opisany w Rysunek 5.

W Rysunek 5, wspólna strategia treningowa najpierw wprowadza parametry treningu modelu, ustawia strukturę sieci i hiperparametry. Następnie przeprowadzane jest oddzielne szkolenie wstępne na temat SA i TA, aby lepiej poznać lokalne cechy. Warto zauważyć, że podczas wstępnego trenowania jednego modelu, wagi drugiego modelu są utrzymywane na stałym poziomie i nie są aktualizowane. Po wykonaniu indywidualnego treningu wstępnego, warstwa ViT jest łączona do treningu. Następnie zostaną ustalone dwa modele uwagi, a główna sieć ViT będzie trenowana oddzielnie. Wreszcie, dzięki wspólnemu szkoleniu głównej sieci ViT, modułów SA i TA, cała sieć jest optymalizowana w celu wygenerowania ostatecznego modelu inteligentnego rozpoznawania zachowań w klasie. Procedura szkolenia jest przeprowadzana etapowo: (1) autonomiczne szkolenie wstępne modułów SA i TA z zamrożonymi parametrami ViT, (2) stopniowe szkolenie ViT z zamrożonymi wagami modułów uwagi oraz (3) kompleksowe dostrajanie wszystkich komponentów wraz z optymalizatorem Adama (szybkość uczenia się = 0,001, wielkość partii = 64, epoki = 100). Podejście to stabilizuje uczenie się funkcji i zmniejsza zakłócenia między modułami podczas optymalizacji.

Ogólnie rzecz biorąc, proponowana metoda inteligentnego rozpoznawania zachowań w klasie łączy modalności wideo i szkieletowe do modelowania relacji czasoprzestrzennych poprzez samouwagę i krzyżowanie AM. Wykorzystując możliwości globalnego modelowania czasoprzestrzennego ViT i łącząc moduły przestrzenne i TA, model jest zoptymalizowany pod kątem uchwycenia kluczowych zachowań i dynamiki czasowej, uzyskując bardziej kompleksowe i dokładne rozpoznawanie zachowań uczniów. Krytyczne operacje fuzji, w których łączone są reprezentacje cech multimodalnych, są wykonywane w rozważanej architekturze. W szczególności cechy przestrzenne poznane przez CNN są powiązane z czasowymi cechami Bi-LSTM. Ten wynik jest następnie łączony z funkcjami MHAM zwiększającymi uwagę przed zadaniem klasyfikacji. Te operacje fuzji mają kluczowe znaczenie dla fuzji komplementarnych widoków danych behawioralnych i są podkreślone w Rysunek 1 i Rysunek 5.

Algorytm 1 ilustruje połączone dane multimodalne, szkieletowe, tekstowe i wideo, używając modeli opartych na ViT, i GCN do wyodrębnienia cech informacyjnych w klasie. Wspólna reprezentacja jest następnie oznaczana w celu zidentyfikowania zachowania uczniów, z większą dokładnością przy użyciu uczenia się międzymodalnego.

Algorytm 1: Proces rozpoznawania zachowań multimodalnych za pomocą ViT, i GCN.

Inicjalizuj:

Wstępnie wyszkolony model

Wstępnie wyszkolony model Faster R-CNN

Wstępnie wyszkolony model ViT

Model GCN dla danych szkieletowych

Klasyfikator (np. MLP lub Transformer)

Załaduj zestaw danych:

Dla każdej próbki w multimodalnym zbiorze danych:

Wyodrębnij klatki wideo

Wyodrębnij transkrypcję audio

Wyodrębnij dane szkieletu (OpenPose lub MediaPipe)

Krok 1: Przetwarzanie modalności wideo

Dla każdej klatki w filmie:

Zastosuj szybszy R-CNN do wykrywania obiektów/uczestników

Zastosuj transformator wizyjny (ViT), aby wyodrębnić cechy na poziomie klatki

Agreguj cechy w czasie dla reprezentacji czasowej

Krok 2: Przetwarzanie modalności tekstu

Tekst transkrypcji przed przetworzeniem:

Tokenizacja za pomocą tokenizatora

Przepuść tokeny przez model

Wyodrębnij kontekstowe osadzenia z tokena [CLS] lub średniej puli

Krok 3: Przetwarzanie modalności szkieletowej

Dla każdej sekwencji szkieletu:

Normalizuj współrzędne

Przejdź przez GCN lub ST-GCN, aby wyodrębnić elementy ruchu

Krok 4: Fuzja funkcji

Połącz lub połącz uwagę:

Funkcje wideo

Funkcje tekstowe

Cechy szkieletu

Uzyskaj ujednoliconą reprezentację multimodalną

Krok 5: Klasyfikacja

Przekaż scaloną reprezentację do końcowego klasyfikatora

Przewiduj etykietę zachowania w klasie (np. uważny, rozproszony)

Krok 6: Ocena

Porównaj przewidywania z prawdą gruntową

Metryki obliczeniowe: Dokładność, Precyzja, Kompletność, Wynik F1

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aby ocenić skuteczność i wyższość metody inteligentnego rozpoznawania zachowań w klasie z Transformerem i AM, przeprowadzono eksperymentalną weryfikację i analizę wydajności. W pierwszej kolejności skonfigurowano środowisko eksperymentalne i parametry, zgodnie z tabelą 1.

Na podstawie Tabeli 1, badanie wybrało Zestaw Danych EduSense i Zestaw Danych Interakcji Kinect SBU jako zestawy danych eksperymentalnych, nazwane odpowiednio D1 i D2. D1 zbierał zachowania u...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zaproponowano metodę rozpoznawania zachowań dla inteligentnych sal lekcyjnych opartą na Transformer i AM, aby sprostać wyzwaniom związanym ze złożonym zachowaniem uczniów i rozpoznawaniem danych multimodalnych. Sieć ViT z możliwością globalnego modelowania czasoprzestrzennego została skonstruowana poprzez integrację danych z modalności wideo i szkieletowych, a także wykorzystano samouwagę i krzyżowe AM do uchwycenia czasoprzestrzennych cech zachowania. Poprzez zintegrowanie danych wideo i audio z nową ramą Intelligent Se...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Brak.

WKŁAD AUTORA:
Liu Lei: Odpowiedzialny za koncepcję i projekt badań; zaproponowano opartą na transformatorze metodę multimodalnej fuzji danych do inteligentnego rozpoznawania zachowań w klasie. Kierował opracowaniem modelu i projektu eksperymentalnego, zarządzał gromadzeniem i przetwarzaniem danych oraz sporządził wstępny manuskrypt. Przyczynił się do analizy i dyskusji nad wynikami eksperymentów.

He Zhihua: Zapewnił ogólne wytyczne i nadzór nad badaniem; przyczynił się do stworzenia ram badawczych i wsparcia metodologicznego. Brał udział w optymalizacji modelu i analizie eksperymentalnej, recenzował i poprawiał manuskrypt, zapewniał zgodność ze standardami etycznymi i wydał ostateczną zgodę na złożenie. Osoba odpowiedzialna za korespondencję.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
128 GB pamięci RAM DDR4Wielu dostawcówhttps://www.crucial.com/memory/ddr4Wystarczająca ilość pamięci do multimodalnego przetwarzania danych
2 TB pamięci masowej SSDWielu dostawcówhttps://www.samsung.com/ssdDo przechowywania zestawów danych i modeli
(konfiguracja podstawowa)Hugging Facehttps://huggingface.co/-base-uncasedosadzania sekwencji szkieletowych
Zestaw narzędzi CUDA 11.1NVIDIAhttps://developer.nvidia.com/cuda-toolkitUmożliwia akcelerację GPU dla biblioteki PyTorch
cuDNN 8.0NVIDIAhttps://developer.nvidia.com/cudnnakcelerowana przez GPU dla głębokich sieci neuronowych
Zestaw danych EduSenseCarnegie Mellon Universityhttps://www.cs.cmu.edu/~./edusenseRzeczywisty zestaw danych
w klasie uniwersyteckiejSzybszy R-CNN (ResNet-50)Open Source (PyTorch)https://github.com/facebookresearch/detectron2Detektor obiektów używany do wyodrębniania cech wideo
Procesor Intel Xeon E5-2680 v4https://www.intel.com/products/xeon-e5-2680-v4Wysokowydajny procesor do trenowania modelu
MatplotlibOpen Sourcehttps://matplotlib.orgSłuży do kreślenia metryk wydajności
Karta graficzna NVIDIA Tesla V100https://www.nvidia.com/en-us/data-center/tesla-v100Służy do trenowania i wnioskowania; obsługuje rozpoznawanie zachowań w czasie rzeczywistym
https://github.com/CMU-Perceptual-Computing-Lab/openpose OpenPoseCMUWyodrębnia szkieletowe punkty kluczowe 2D z klatek wideo
Platforma PyTorch 1.8Open Sourcehttps://www.pytorch.orgBiblioteka głębokiego uczenia używana do Opracowanie modelu
SBU Kinect Interaction DatasetStony Brook Universityhttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectZestaw danych szkieletowych oparty na interakcjach
TensorBoardOpen Source (Google)https://www.tensorflow.org/tensorboardSłuży do wizualizacji treningowej
System operacyjny Ubuntu 20.04 LTSCanonicalhttps://www.ubuntu.com/downloadSystem operacyjny Linux używany jako środowisko programistyczne
Vision Transformer (ViT)Google / Przytulanie twarzyhttps://huggingface.co/google/vit-base-patch16-224Służy do globalnego modelowania zachowań czasoprzestrzennych
Model językowy do Biblioteka Intel NVIDIA

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Model Transformerfuzja multimodalnauwaga czasoprzestrzennazaanga owanie student winformacja zwrotna w czasie rzeczywistymmapowanie zachowa
Film wkrótce dostępny

Powiązane artykuły