Celem tego badania jest ocena zaangażowania uczniów w naukę na zajęciach uniwersyteckich za pomocą detekcji obiektów wideo opartej na głębokim uczeniu. Aby to zrobić, poprzez analizę korelacyjną, badania te najpierw zidentyfikowały siedem zachowań w klasie, które wykazują wysoce pozytywną korelację z zaangażowaniem w naukę jako wskaźniki mierzące zaangażowanie uczniów; następnie zebrano 30 zsynchronizowanych nagrań z rzeczywistym nauczaniem w klasie z 6 klas Uniwersytetu Nauki i Technologii w Shandong (SDUST) i podzielono je na zestaw szkoleniowy oraz zestaw testowy. Po ręcznym zaznaczeniu siedmiu zachowań w danych treningowych, algorytm uczenia maszynowego był trenowany w sposób nadzorowany na tym zbiorze. Po wytrenowaniu model generował początkowe adnotacje dla pozostałych nieoznaczonych danych. Aby osiągnąć dokładniejsze i bardziej efektywne rozpoznawanie zachowań w klasie, badanie to wybrało dwa reprezentatywne algorytmy, mianowicie Faster R-CNN i YOLOv5s, do eksperymentów wykrywania zachowań. Na podstawie porównania ich wyników wykrywania pod względem dokładności i kosztu czasu, YOLOv5s zostały wybrane do wykrywania zachowań w klasie w tym badaniu. Na koniec badanie wykorzystało metodę grup fokusowych do przypisania punktów każdemu zachowaniu i opracowania trzypoziomowego modelu punktacji zaangażowania w naukę. Na podstawie automatycznie mierzonych danych behawioralnych model umożliwia w czasie rzeczywistym, automatyczną ocenę zaangażowania w naukę zarówno na poziomie indywidualnym, jak i klasowym.