Все видео были получены и использованы в соответствии с современными этическими практиками исследований на людях, предписанными Шаньдунским университетом науки и технологий. Одобрение на использование данных получено.
Во-первых, был проведен корреляционный анализ для выявления поведения учащихся, которые могут служить индикаторами поведенческой вовлечённости. После того как набор данных был создан методом извлечения кадров и разделён на обучающий и тестовый, в обучающем наборе запускались два репрезентативных алгоритма для обнаружения объектов и сравнивались по точности и эффективности. Наконец, алгоритм с лучшей производительностью (YOLO-v5s) был выбран для запуска на тестовом наборе для обнаружения поведения. Рисунок 1 показывает блок-схему процесса идентификации и выявления поведения учащихся.

Рисунок 1. Блок-схема идентификации и выявления поведения учащихся. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Определение индикаторов
Перед проведением экспериментов по обнаружению объектов необходимо было выявить невербальное поведение, указывающее на поведенческую вовлечённость учеников. На сегодняшний день исследования поведенческого взаимодействия на основе обнаружения объектов успешно обнаружили различные невербальные поведения, включая прямое зрение, информацию о лице и позутела 9,10,11,12,13,14. Однако вопрос о том, оправданы ли конкретные поступки как индикаторы поведенческой вовлечённости учащихся, пока не обсуждалось. Таким образом, в данном исследовании был использован корреляционный анализ между поведением студентов и их уровнем вовлечённости в поведение для выявления поведенческих факторов.
(1) Тест на поведенческую вовлечённость
В этом исследовании были отобраны 122 студента бакалавриата из четырёх естественных классов неанглийских специальностей в SDUST-Jinan в качестве выборки для корреляционного исследования. Во-первых, были использованы шкалы самоотчёта для сбора данных о поведенческой вовлечённости среди 122 студентов, с целью понять их статус поведенческой вовлечённости с точки зрения внутреннего опыта. Поскольку видеоданные для этого исследования были взяты из классов «Академический английский», был принят многомерный инструмент оценки вовлечённости в обучение в классах английского языка, разработанныйЖэнь Цинмэй 20 . Этот инструмент специально разработан для преподавания китайских иностранных языков и использует ту же классическую классификацию вовлечённости в обучение, что и это исследование, охватывая три измерения: поведенческое, аффективное и когнитивное вовлечённость. Среди них инструмент поведенческого вовлечения состоит из девяти пунктов, соответствующих взаимодействию учителя и ученика (например, «Я активно отвечаю на вопросы, заданные учителем на уроке английского»), индивидуальным усилиям (например, «Я внимательно учитываю трудности, возникшие на уроках английского»), взаимодействию со сверстниками (например, «Я сотрудничаю с другими учениками для выполнения заданий по изучению английского языка») и т.д. Каждый пункт представлен по шкале Likert в 5 баллов, с вариантами ответа «почти никогда, редко, иногда, часто, всегда», оценивается от 1 до 5, и студентам нужно выбрать вариант, который лучше всего соответствует их учебному опыту. Ученики, набравшие 15 баллов и ниже, были отнесены к ученикам с низкой вовлечённостью, те, кто набрал 16-30 баллов — как ученики со средней вовлечённостью, а те, кто набрал 31-45 баллов — как ученики с высоким уровнем вовлечённости. В итоге было собрано 120 валидных шкал: 17 студентов — в категории с низкой вовлечённостью, 45 — в категории умеренной вовлечённости и 58 — в категории с высоким уровнем вовлечённости.
(2) Идентификация поведения
Тем временем были собраны четыре записанных видео общей продолжительностью 50 минут с полностью посещаемых занятий «Академического английского» в этих четырёх классах. С кадром, нарисованным каждые 15 секунд, наконец было извлечено 200 изображений для наблюдения. Основываясь на многократных просмотрах видеообразцов тремя студентами, это исследование изначально выявило 12 типов поведения учеников в классе: осмотр, использование мобильного телефона, обсуждение, прогулки, прогулки, еда или питьё, ведение заметок или чтение, внимательное слушание, вставание (чтобы ответить на вопрос), зевание, сон и использование компьютера. Примеры этих 12 поведенческих форм показаны на рисунке 2.

Рисунок 2. Примеры 12 поведенческих проявлений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Каждый тип сопровождался подробными описаниями визуальных признаков и пространственно-временного контекста, что сформировало Стандартную процедуру работы для аннотации поведения в классе, обеспечивавшую концептуальную согласованность между аннотациями. Таблица 1 показывает 12 категорий поведения учащихся и их описания.
Осмотр включал значительный поворот головы влево, вправо и назад. Студенты считались участниками обсуждения, если они отворачивали головы и открывали рот. В классе внимательное слушание ассоциировалось с тем, чтобы смотреть прямо на доску или на учителя, стоящего перед ними; Когда взгляд был направлен в другое место, студент, скорее всего, блуждал. Когда ученик держал голову вниз, и рядом был предмет, например, книга или тетрадь, такое поведение можно было определить как ведение заметок или чтение книги. Когда поведение включало стоячую позу, а студент стоял на своём месте с открытым ртом, считалось, что он отвечает на вопрос стоя; Если ученик был встал на своём месте, считалось, что он ходит по классу, что может указывать на опоздание ученика на занятие или выход из класса и т.д. Когда ученик лежал головой на парте, его идентифицировали как спящего. Когда ученик держал еду или напитки в руках, поведение определялось как еда или питьё. Широко открытый рот или поведенческая поза при растяжении тела указывали на зевок ученика.
| Категория поведения | Описание поведения |
| Оглядываясь вокруг | Очевидное движение головы вправо, влево или назад |
| Использование мобильного телефона | Прикасаться к мобильному телефону руками |
| Обсуждение | Рот открыт, движение головы |
| Блуждание | Затуманенный взгляд в ненужные места |
| Путешествие по кругу | Сходя с сиденья |
| Питание или питье | Открытый рот и контакт с едой или водой |
| Ведение заметок или чтение | Делать заметки или смотреть вниз в книгу |
| Внимательно слушая | Смотрел на доску или на учителя |
| Вставая (чтобы отвечать на вопросы) | Встать на сиденье с открытым ртом |
| Зевание | Открытый рот или растяжка тела |
| Сон | Голова на столе |
| Использование компьютера | Открытый компьютер на столе |
Таблица 1: Категории и описания поведения учащихся.
(3) Анализ корреляции
Используя вышеуказанные критерии, 12 опытных учителей были приглашены посмотреть видео 120 учеников и зафиксировать их поведенческие типы и частоты. Поведение было выявлено согласно Таблице 1. Учителя были разделены на четыре группы, по три учителя в каждой группе. Каждая группа отвечала за запись 30 учеников, при этом каждый из трёх учителей независимо фиксировал поведение 30 учеников. Альфа Кронбаха (называемая α) — это индикатор для измерения внутренней согласованности шкалы или анкеты. Диапазон значений альфа Кронбаха — от 0 до 1, а α ≥ 0,8 обычно интерпретируется как хорошая внутренняясогласованность 21. Если у всех трёх учителей была высокая степень согласованности (α > 0,8, то есть высокая степень согласованности) в частоте определённого типа поведения, частота этого поведения фиксировалась как среднее из трёх частот. Впоследствии, с одной стороны, данные отражали частоты различных поведений каждого ученика, а с другой — уровень их вовлечённости, был проведён корреляционный анализ между этими двумя факторами. Результат приведён в таблице 2.
| Поведение | | Поведенческая вовлечённость |
| Питание или питье | Корреляция Пирсона | .319** |
| Сиг. (двухвостый) | 0.004 |
| N | 120 |
| Зевание | Корреляция Пирсона | -.335** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Обсуждение | Корреляция Пирсона | .546** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Путешествие по кругу | Корреляция Пирсона | -.774** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Блуждание | Корреляция Пирсона | .293** |
| Сиг. (двухвостый) | 0.008 |
| N | 120 |
| Оглядываясь вокруг | Корреляция Пирсона | -.834** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Чтение или конспекты | Корреляция Пирсона | .912** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Внимательно слушая | Корреляция Пирсона | .881** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Стоя | Корреляция Пирсона | .330** |
| (чтобы ответить на вопрос) | Сиг. (двухвостый) | 0 |
| N | 120 |
| Сон | Корреляция Пирсона | -.411** |
| Сиг. (двухвостый) | 0 |
| N | 120 |
| Использование | Корреляция Пирсона | .591** |
| Мобильный телефон | Сиг. (двухвостый) | 0 |
| N | 120 |
| Использование компьютера | Корреляция Пирсона | .362** |
| Сиг. (двухвостый) | 0.001 |
| N | 120 |
Таблица 2: Результаты корреляционного анализа.
В корреляционном анализе r — это коэффициент корреляции, относящийся к линейной степени корреляции между двумя переменными, варьирующейся от −1 до 1. В зависимости от степени взаимосвязи корреляцию можно классифицировать на следующие типы:
Высокая корреляция (│r│ ≥ 0,70)
Средняя корреляция (0,40 ≤ │r│ ≤ 0,70)
Низкая корреляция (│r│ ≤ 0,40)
В зависимости от направления отношений их можно классифицировать на следующие типы:
Положительная корреляция (r > 0)
Отрицательная корреляция (r < 0)
Нет корреляции (r = 0)
Из Таблицы 1 видно, что семь поведенческих видов поведения, включая осмотр (r = −0,834**, p < 0,05), использование мобильного телефона (r = 0,591**, p < 0,05), обсуждение (r = 0,546, p < 0,05), обход (r = −0,774**, p < 0,05), ведение заметок или чтение (r = 0,912**, p < 0,05), внимательное прослушивание (r = −0,881**, p < 0,05) и сон (r = −0,411**, p < 0,05), имели высокую или среднюю корреляцию с поведенческой вовлечённостью, в то время как такие повески, как еда или питье (r = 0,319**, p = 0,04), вставание (для ответа на вопрос) (r = 0,330**, p = 0,00), зевок (r = −0,335**, p < 0,05), блуждание (r = 0,293, p > 0,05) и использование компьютера (r = 0,362, p < 0,05) имели низкую или отсутствующую корреляцию с поведенческим взаимодействием. Основываясь на корреляционном анализе, это исследование в итоге выявило семь моделей поведения как индикаторы вовлечённости в обучение: осмотр, использование мобильного телефона, обсуждение, обходы, конспект или чтение, внимательное прослушивание и сон.
Создание набора данных
Видеоданные, использованные в этом исследовании, были собраны с платформы прямой записи SDUST, которая предоставляла синхронизированные видео реального преподавания курса «Академический английский» в классе. Было собрано десять видео из четырёх классов студентов, не изучающих английский язык, каждое длительностью примерно 50 минут, чтобы создать обучаемый набор данных о поведении учеников в классе. При кадре, нарисованном каждые 15 секунд, в итоге было извлечено 2000 изображений с разрешением 1920 × 1080.
Разделение набора данных
Эксперимент разделил налет данных о поведении учащихся на две полностью независимые части: обучающий набор и тестовый, как показано в таблице 3, без общих изображений. Набор данных охватывал все семь поведений учеников. Обучающий набор и тестовый набор использовались для обучения параметров модели и оценки точности соответственно. Параметры обучения были установлены, как показано в таблице 4.
| Набор данных | Количество изображений |
| Total | 2830 |
| Тренировочный набор | 2111 |
| Тестовый набор | 719 |
Таблица 3: Разделение набора данных по поведению учащихся.
| Параметр | Ценность |
| Скорость обучения | 0.01 |
| Импульс | 0.937 |
| Снижение веса | 0.0005 |
| Эпоха | 100 |
| Размер партии | 16 |
Таблица 4: Установка экспериментальных параметров.
Чтобы предотвратить утечку данных, вызванную появлением одного и того же ученика в разных подмножествах, и сохранить естественную временную непрерывность поведения, был принят метод «стратифицированного временного разделения».
Подлежащее дизъюнкция: Набор данных был разбит по уникальным удостоверениям студентов, что обеспечило взаимное исключение студентов в наборах обучения, валидации и тестов.
Временное разбиение: Видео были отсортированы в хронологическом порядке. Первые 70% временных сегментов использовались для обучения, следующие 15% — для валидации, а последние 15% — для тестирования. Этот метод лучше моделировал реальные временные обобщения по сравнению со случайным делением.
Балансировка классов: Для недостаточно представленных категорий, таких как «спящий» и «использование мобильного телефона», в обучающем наборе применялась умеренная перевыборка, чтобы модель изучила особенности всех категорий.
Аннотация обучающего набора данных
Для ручного аннотирования обучающих данных использовался инструмент аннотирования с открытым исходным кодом. Этот инструмент использовался для аннотации ограничивающих коробок. Конкретный рабочий процесс был следующим: (1) ключевые кадры извлекались с фиксированной скоростью (1 кадр/с) из видео наблюдения, охватывающих разные школы, временные слоты и типы курсов, за которыми следовала обработка анонимизации, например, размытие лица; (2) Следуя стандартной процедуре аннотации, аннотаторы использовали прямоугольные рамки для точного обозначения ученика, выполняющего определённое поведение, и присваивания соответствующей категории; (3) Аннотации экспортировались в формате XML в формате PASCAL VOC.
Для обеспечения качества меток, особенно для предотвращения ошибок при различии неоднозначных поведений (например, обсуждение и блуждание), был реализован механизм совместной работы «Трёхступенчатая аннотация-арбитраж»:
Начальная аннотация: Каждый ключевой кадр был независимо аннотирован тремя обученными аннотаторами. Каждая метка состоит из категорической метки и ограничивающего рамки.
Проверка согласованности: Были рассчитаны согласованность между аннотациями и согласованность категорий между аннотациями. Ограничивающие рамки, являющиеся результатом начальной аннотации с IoU > 0.8 и идентичными категориями, считались «согласованными аннотациями». Ограничивающие рамки с метками IoU ≤ 0.8 или неидентичными категориями считались «несогласованными аннотациями».
Экспертный арбитраж: Для несогласованных аннотаций (например, неоднозначных случаев, таких как «оглядываться» против «обсуждать») окончательное решение принимала эксперты с опытом преподавания, основываясь на видеоклипе, поведенческом контексте и педагогических предварительных знаний. Окончательное решение принимается путём проверки точности метки с помощью проверки исходного видеосегмента ключевого кадра.
Аннотация показала, что поведение студентов характеризуется множественными, интенсивными и малыми целями, как показано на рисунке 3.

Рисунок 3. Пример аннотации изображений в классе. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Ученики на занятиях проявляли такие поведения, как внимательное слушание, использование мобильного телефона, частое чтение или конспекты, в то время как частота передвижения, скитаний и т.д. была относительно низкой. Рисунок 4 показывает распределение поведения в классе в наборе данных по обучению.

Рисунок 4. Распределение поведения в обучающем наборе данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Обнаружение поведения учащихся
Фреймворки обнаружения объектов на основе глубокого обучения в основном делились надве категории: двухступенчатые методы, представленные серией Faster R-CNN, и одноступенчатые методы, представленные YOLO. Для первой категории двухэтапные методы обнаружения сначала генерировали предложения по регионам с помощью сети региональных предложений (RPN), а затем выполняли детальные расчёты вероятности классов и регрессию по ограничивающим рамкам. Для второй категории одноступенчатые методы упростили процесс обнаружения, одновременно предсказывая классы объектов и ограничивающие рамки на одном этапе. Хотя двухэтапные методы появились на ранних этапах развития отрасли, одноступенчатые подходы приобрели популярность благодаря упрощённой архитектуре и вычислительной эффективности. Для достижения более точного и эффективного распознавания поведения в классе в этом исследовании были отобраны репрезентативные алгоритмы из обеих категорий — FasterR-CNN 23,24 и YOLO-v525,26 — для проведения экспериментов по обнаружению поведения в классе, а также сравнили результаты обнаружения двух алгоритмов, прежде чем окончательно определиться с алгоритмом, используемым для обнаружения поведения в этом исследовании.
Для эффективной оценки экспериментальных результатов внимание уделялось общей точности обнаружения по сравнению с временными затратами каждой алгоритмической модели. Для измерения обеих моделей использовались средняя средняя точность (mAP) и время обучения (h).
Семь категорий поведения были выявлены для распознавания двумя методами, а средние значения точности обнаружения (AP) были зафиксированы в Таблице 5. Среди них YOLO-v5s превосходили Faster R-CNN в обнаружении трёх категорий действий: перемещение, внимательное прослушивание лекций и использование мобильных телефонов, с AP-значениями 100%, 62,7% и 31,8% соответственно.
| Сетевая модель | Обсуждение | Путешествие | Внимательно слушаю | Оглядываясь вокруг | Сон | Ведение заметок или чтение | Использование мобильного телефона |
| Быстрее R-CNN | 32.6 | 99.5 | 45.4 | 9.3 | 22 | 52.6 | 26.8 |
| YOLO-v5s | 17.8 | 100 | 62.7 | 3.8 | 19 | 51 | 31.8 |
Таблица 5: Средняя точность двух алгоритмов для одного класса.
Время обучения и средняя точность обнаружения двух классических сетей обнаружения на тестовом наборе при IoU 0,5 показаны в таблице 6. Хотя сеть Faster R-CNN имела более высокую точность, её продолжительность работы была относительно длинной. Для сравнения, YOLO-v5 имели на 30% меньшее время работы с снижением точности всего на 0,3%, что свидетельствует о большем повышении эффективности. Учитывая необходимость обнаружения поведения учащихся в классе в реальном времени, ожидалось, что время обучения сети будет максимально коротким. Учитывая как точность обнаружения, так и временные затраты моделей, обучаемых на обучающем наборе, в данной работе пришло к выводу, что YOLO-v5s больше подходит для определения поведения учащихся в классе.
| Сетевая модель | h | mAP@0,5 (%) |
| Быстрее R-CNN | 2.88 | 41.17 |
| YOLO-v5s | 2.016 | 40.87 |
Таблица 6: Сравнение эффективности обнаружения.
Поэтому для определения поведения в классе был выбран YOLO-v5s. Результаты обнаружения, полученные YOLO-v5, показаны на рисунке 5, где показано непрерывное обнаружение поведения при многоцелевом взаимодействии с соответствующими метками.

Рисунок 5. Примеры результатов обнаружения тестового набора. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
(1) Дополнение и предобработка данных
Для повышения устойчивости и обобщения модели во время обучения применялась стратегия композитного дополнения данных, включая случайные аффинные преобразования, дрожание цвета и случайную окклюзию. Все изображения были равномерно изменены до 640 × 640 пикселей.
(2) Стратегия обучения
Процесс обучения был разделён на три этапа:
Фаза замороженного магистрали (эпохи 1-100): Магистральная сеть была заморожена, и обучена только головка обнаружения, используя низкую скорость обучения для разогрева.
Полная фаза тонкой настройки сети (эпохи 101-250): Все сетевые слои были разморажены. Планировщик косинусного отжига корректировал скорость обучения.
Фаза уточнения (эпохи 251-300): Для стабилизации обучения применялась экспоненциальная скользящая средняя, а интенсивность дополнения данных была снижена для совершенствования модели.
Для устранения дисбаланса класса к функции потерь применялись веса, специфичные для класса, обратно пропорциональные их частотам в обучающем наборе.
(3) Постобработка и временная оптимизация
Для поддержания временной согласованности поведения в классе после вывода модели применялся фильтр временной согласованности. В частности, для обнаруженной цели в видеопоследовательности её категория поведения должна была быть определена как минимум в трёх последовательных кадрах для подтверждения, что эффективно фильтрует временные ложноположительные результаты.
Установление метода оценки поведенческого вовлечения
В этом исследовании использовался метод фокус-групп для присвоения баллов каждому поведению. Двадцать преподавателей первого звена университетов были приглашены оценить вовлечённость в семь категорий поведения на основе своего опыта управления классом. Все 20 преподавателей преподавали более 10 лет и преподавали широкий спектр курсов по различным дисциплинам. Оценки за вовлечённость варьировались от 0 до 3: 0-1 — низкая вовлечённость, 1-2 — средняя вовлечённость, а 2-3 — высокая вовлечённость. Если уровень последовательности (α > 0,8) в оценках нескольких оценщиков по определённому типу поведения был высоким, вовлечённость этого поведения измерялась усреднением оценок отдельных учителей. Окончательные оценки каждого типа поведения приведены в таблице 7.
| Тип поведения | оглядываясь вокруг | Использование мобильного телефона | обсуждение | Ходим по кругу | Ведение заметок или чтение | внимательно слушая | Сон |
| Счёт вовлечения | 0.9 | 1.2 | 1.9 | 0.6 | 2.7 | 2.8 | 0.2 |
Таблица 7: Оценки поведения.
Формула поведенческой вовлечённости каждого ученика выглядит следующим образом

ESi = поведенческая вовлечённость ученика, S j = балл поведения, fj = частота поведения j.
Если предположить, что количество выявленных поведений ученика в классе составляет 100, включая 4 «обсуждения», 68 «внимательное слушание», 25 «чтение/ведение заметок» и 3 «оглядывающиеся вокруг», общий балл личной вовлечённости ученика составлял (1,9 × 4 + 2,8 × 68 + 2,7 × 25 + 0,9 × 3) / 100 = 2,68. Если рассматривать всю лекцию как ориентир, поведенческое вовлечение делилось на четыре уровня по равномерному интервалу по шкале 0-3: балл ниже 0,75 определялся как «не вовлечён», 0.76-1.5 как «слегка вовлечённый», 1.6-2.25 как «вовлечённый» и 2.26-3 как «очень вовлечённый»; Таким образом, ученик был оценён как «очень вовлечённый» в классе.
Поведенческая активность всего класса относилась к среднему баллу всех учеников. Формула поведенческого вовлечения класса выглядит так:

Ec =поведенческая вовлечённость класса, ES =поведенческая вовлечённость определённого ученика, n =количество учеников