Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Исследовательская статья

Оценка поведенческой вовлечённости в университетских классах с помощью глубокого обучения видеообнаружения объектов

244 просмотров

DOI:

10.3791/69299

17 марта 2026 г.

В этой статье

Краткое содержание

В данном исследовании оценивается поведенческая вовлечённость студентов, обнаруживая их поведение в университетских видео с помощью алгоритма глубокого обучения. Выделяются семь видов поведения, положительно коррелирующих с вовлечённостью в обучение, а также используется модель оценки для оценки общей вовлечённости отдельных учеников и класса.

Аннотация

Данное исследование направлено на оценку вовлечённости студентов в обучение в университетских классах с помощью обнаружения видеообъектов на основе глубокого обучения. Для этого с помощью корреляционного анализа в этом исследовании сначала выявили семь классных поведенчений с высокой положительной корреляцией с вовлечённостью в обучение в качестве индикаторов для оценки вовлечённости учащихся; затем было собрано 30 синхронизированных видео реального преподавания в классе из 6 курсов Шаньдунского университета науки и технологий (SDUST) и разделило их на учебный и тестовый наборы. После того как семь поведенческих действий были вручную аннотированы в обучающих данных, алгоритм машинного обучения обучался под супервизором на этом наборе. После обучения модель генерировала начальные аннотации для оставшихся немаркированных данных. Для достижения более точного и эффективного распознавания поведения в классе в этом исследовании были выбраны два репрезентативных алгоритма — Faster R-CNN и YOLOv5s — для экспериментов по обнаружению поведения. На основе сравнения их эффективности по точности и временной стоимости YOLOv5 были выбраны для определения поведения в классах в этом исследовании. Наконец, в этом исследовании использовался метод фокус-групп для присвоения баллов каждому поведению и разработки трёхуровневой модели оценки вовлечённости в обучение. На основе автоматически измеряемых поведенческих данных модель обеспечивает автоматическую оценку вовлечённости в обучение в реальном времени как на индивидуальном, так и на уровне класса.

Введение

Вовлечённость в обучение, относящаяся к участию, концентрации и усилиям учащихся в обучении, включает поведенческое, эмоциональное и когнитивноевовлечённость 1. Вовлечённость учащихся в обучение выявляет их учебную ситуацию и помогает учителям корректировать методыпреподавания 2. Однако вовлечённость в обучение в классе в основном оценивается по самооценкам учащихся и наблюдениямучителей 3. Высокое соотношение учителей и учеников в университетах Китая означает, что учителям требуется много времени и усилий для использования традиционных ручных методов оценки вовлечённости в обучении.

В последние годы, с ростом популярности интеллектуальных классов записи и трансляции в Китае, стало возможным автоматическое измерение вовлечённости в обучении на основе видео из класса.4. С точки зрения интеллектуального преподавания в классе, усиленных технологиями, в этом исследовании применялись методы глубокого обучения для выявления поведения студентов в университетских видео и предложена модель оценки для автоматического измерения поведенческой вовлечённости учащихся.

Краткий обзор исследований поведенческой вовлечённости
Существует три основных уровня поведенческой вовлечённости: (1) На уровне школы это означает энтузиазм учащихся участвовать во внеклассныхмероприятиях 5. (2) На уровне класса это включает положительное поведение учащихся в классе, например, соблюдение порядка в классе, и разрушительное поведение, например, пропуск урока или разговоры в6 классе. (3) На уровне учебного процесса это относится к участию и поведению учащихся в учебных заданиях, таких как задавание вопросов и выполнение домашнихзаданий 7. В настоящее время методы оценки поведенческой вовлечённости можно в целом классифицировать на три категории: ручные, полуавтоматические иавтоматические методы 8.

Ручные методы, включая самооценку, интервью, наблюдение учителя и другие традиционные методы оценки, требуют трудоёмких усилий и сложно обеспечить объективность и точность. Анализ журналов — это репрезентативный полуавтоматический метод оценки, который в первую очередь анализирует данные учебного журнала учащихся, собранные с учебных платформ, включая такие показатели, как частота входа, длительность онлайн-режима и точность ответов. Этот метод позволяет более объективно оценивать вовлечённость студентов в обучение; однако большой объём и сложность данных создают трудности для последующегопроцесса 4. Автоматический метод основан на компьютерном зрении, используя интеллектуальные устройства, такие как платформы для записи и трансляции, для захвата выражений лиц, жестов, поведения и других визуальных сигналов учеников в классе, главным образом для оценки поведения в классе. По сравнению с предыдущими двумя методами, этот подход позволяет быстро измерять поведенческое взаимодействие с помощью компьютеров и алгоритмов и менее подвержен субъективныминтерференциям 9.

Краткий обзор оценки поведенческой вовлечённости на основе обнаружения объектов
С ростом глубокого обучения методы обнаружения объектов всё чаще применяются для анализа вовлечённости в обучение. Алгоритмы обнаружения объектов выполняют классификацию и локализацию объектов на изображениях на основе сверточных нейронных сетей. В умных классах, оснащённых системами видеозаписи, такие алгоритмы могут распознавать визуальную информацию, связанную с позами, жестами и мимой лица учащихся по видео в классе, что позволяет автоматически определять поведение учащихся и оценивать их поведенческую активность. Следовательно, состояние обучения в классе, отражаемое в невербальном поведении учащихся, можно эффективноинтерпретировать 9.

Для сбора и идентификации множественного невербального поведения учащихся из видео использовалось разнообразное оборудование и алгоритмы. Рахман и др.10 , а также Залетель иКошир 11 использовали датчики Kinect для сбора линии зрения, информации о лице, особенностях осанки тела и т.д., а также анализировали уровень внимания учеников с помощью алгоритмов машинного обучения. Уайтхилл и др. использовали веб-камеру iPad для записи мимики учеников с целью обучения модели распознавания, доказав, что метод машинного обучения равен человеческому наблюдению по точности оценки вовлечённости в обучение. Сукумаран иМанохаран 12 зафиксировали вступление ученика в бой с помощью сигналов EGG. Ашвин иГуддети 13 использовали сверточные нейронные сети для анализа видео в лабораторных условиях с целью выявления невербальных поведений, таких как мимика, позы рук и тела, с целью оценки вовлечённости в обучение. Bai и др.14 использовали Faster R-CNN с мультиплексированным объединением признаков для выявления поведения в классе, таких как учеба, сон и опускание головы, с помощью трансферного обучения. Дэнг и др. проанализировали видео удалённого класса, объединив методы глубокого обучения Faster R-CNN, и предложили метод достижения распознавания поведения и измерения вовлечённости в классе на основе поз головы, рук и тела учеников.

Ранние исследования в основном проводились в лабораторных условиях, многие из которых были сосредоточены на одном человеке в одномсценарии 10, 11, 12, 13, тогда как более поздние исследования всё чаще изучали реальные учебные условия9, 14, 15, 16, 17, 18, 19. Кроме того, спектр изучаемых поведений стал всё более разнообразным. Например, Бай и др.14 и Оуян и др.15 проанализировали видео в классе, в которых были выявлены только два поведения — голова вверх и опущенная голова. Дэнг и др. 9 исследовали видео из начальной школы и расширили выявленные категории поведения — от движений головы — до движений рук и тела. Чжан иколлеги 16 собрали пять типов поведения учеников: взгляд вверх, взгляд вниз, сон, осмотр и зевок.

Однако, поскольку данные были собраны в классах начальной школы, где ученики обычно сидят в фиксированных позициях, диапазон наблюдаемых проявлений поведения оставался относительно ограниченным. Поэтому последующие исследования всё больше сосредоточены на университетских аудиториях. Многие аудитории университетов большие, около сотни студентов часто сидят наугад, что затрудняет выявление поведения студентов. Кроме того, в реальных университетских классах ученики демонстрируют большее поведенческое разнообразие и интерактивность, включая взаимодействие с преподавателями, однокурсниками, досками и учебниками. Ян и др.17 предложили метод распознавания осанки на основе глубокого обучения, BetaPose, который был разработан для повышения точности распознавания осанки в переполненном классе. Тан и др.18 включили модуль координационного внимания (CA) в сеть YOLOv9, и полученная модель CA-YOLOv9 была применена для распознавания семи классных поведенческих форм в сложных университетских классах с большим числом студентов. Ван и др.19 предложили двунаправленную сеть усиления признаков (BATNet) для выявления поведения учащихся в интеллектуальных классах, особенно для малых и окклюзированных целей.

С разработкой алгоритмов скорость и точность обнаружения поведения значительно улучшились; Однако современные исследования игнорируют объяснение о том, существует ли корреляция между выявленным поведением в классе и вовлечённостью учащихся, оставляя без ответа вопросы, такие как можно ли использовать определённые поведения как параметры для измерения поведенческой вовлечённости и какие поведения могут эффективно отражать вовлечённость в обучение. Кроме того, необходимо четко продемонстрировать поведенческую вовлечённость учеников. Таким образом, это исследование выявило поведение в классе, тесно связанное с вовлечённостью учащихся в обучение, посредством корреляционного анализа; Тем временем была разработана система оценки для построения модели оценки поведенческого вовлечения. Следовательно, автоматическое измерение поведенческой вовлечённости может быть достигнуто как для отдельных учеников, так и для всего класса.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Все видео были получены и использованы в соответствии с современными этическими практиками исследований на людях, предписанными Шаньдунским университетом науки и технологий. Одобрение на использование данных получено.

Во-первых, был проведен корреляционный анализ для выявления поведения учащихся, которые могут служить индикаторами поведенческой вовлечённости. После того как набор данных был создан методом извлечения кадров и разделён на обучающий и тестовый, в обучающем наборе запускались два репрезентативных алгоритма для обнаружения объектов и сравнивались по точности и эффективности. Наконец, алгоритм с лучшей производительностью (YOLO-v5s) был выбран для запуска на тестовом наборе для обнаружения поведения. Рисунок 1 показывает блок-схему процесса идентификации и выявления поведения учащихся.

figure-protocol-1
Рисунок 1. Блок-схема идентификации и выявления поведения учащихся. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Определение индикаторов
Перед проведением экспериментов по обнаружению объектов необходимо было выявить невербальное поведение, указывающее на поведенческую вовлечённость учеников. На сегодняшний день исследования поведенческого взаимодействия на основе обнаружения объектов успешно обнаружили различные невербальные поведения, включая прямое зрение, информацию о лице и позутела 9,10,11,12,13,14. Однако вопрос о том, оправданы ли конкретные поступки как индикаторы поведенческой вовлечённости учащихся, пока не обсуждалось. Таким образом, в данном исследовании был использован корреляционный анализ между поведением студентов и их уровнем вовлечённости в поведение для выявления поведенческих факторов.

(1) Тест на поведенческую вовлечённость
В этом исследовании были отобраны 122 студента бакалавриата из четырёх естественных классов неанглийских специальностей в SDUST-Jinan в качестве выборки для корреляционного исследования. Во-первых, были использованы шкалы самоотчёта для сбора данных о поведенческой вовлечённости среди 122 студентов, с целью понять их статус поведенческой вовлечённости с точки зрения внутреннего опыта. Поскольку видеоданные для этого исследования были взяты из классов «Академический английский», был принят многомерный инструмент оценки вовлечённости в обучение в классах английского языка, разработанныйЖэнь Цинмэй 20 . Этот инструмент специально разработан для преподавания китайских иностранных языков и использует ту же классическую классификацию вовлечённости в обучение, что и это исследование, охватывая три измерения: поведенческое, аффективное и когнитивное вовлечённость. Среди них инструмент поведенческого вовлечения состоит из девяти пунктов, соответствующих взаимодействию учителя и ученика (например, «Я активно отвечаю на вопросы, заданные учителем на уроке английского»), индивидуальным усилиям (например, «Я внимательно учитываю трудности, возникшие на уроках английского»), взаимодействию со сверстниками (например, «Я сотрудничаю с другими учениками для выполнения заданий по изучению английского языка») и т.д. Каждый пункт представлен по шкале Likert в 5 баллов, с вариантами ответа «почти никогда, редко, иногда, часто, всегда», оценивается от 1 до 5, и студентам нужно выбрать вариант, который лучше всего соответствует их учебному опыту. Ученики, набравшие 15 баллов и ниже, были отнесены к ученикам с низкой вовлечённостью, те, кто набрал 16-30 баллов — как ученики со средней вовлечённостью, а те, кто набрал 31-45 баллов — как ученики с высоким уровнем вовлечённости. В итоге было собрано 120 валидных шкал: 17 студентов — в категории с низкой вовлечённостью, 45 — в категории умеренной вовлечённости и 58 — в категории с высоким уровнем вовлечённости.

(2) Идентификация поведения
Тем временем были собраны четыре записанных видео общей продолжительностью 50 минут с полностью посещаемых занятий «Академического английского» в этих четырёх классах. С кадром, нарисованным каждые 15 секунд, наконец было извлечено 200 изображений для наблюдения. Основываясь на многократных просмотрах видеообразцов тремя студентами, это исследование изначально выявило 12 типов поведения учеников в классе: осмотр, использование мобильного телефона, обсуждение, прогулки, прогулки, еда или питьё, ведение заметок или чтение, внимательное слушание, вставание (чтобы ответить на вопрос), зевание, сон и использование компьютера. Примеры этих 12 поведенческих форм показаны на рисунке 2.

figure-protocol-2
Рисунок 2. Примеры 12 поведенческих проявлений. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Каждый тип сопровождался подробными описаниями визуальных признаков и пространственно-временного контекста, что сформировало Стандартную процедуру работы для аннотации поведения в классе, обеспечивавшую концептуальную согласованность между аннотациями. Таблица 1 показывает 12 категорий поведения учащихся и их описания.

Осмотр включал значительный поворот головы влево, вправо и назад. Студенты считались участниками обсуждения, если они отворачивали головы и открывали рот. В классе внимательное слушание ассоциировалось с тем, чтобы смотреть прямо на доску или на учителя, стоящего перед ними; Когда взгляд был направлен в другое место, студент, скорее всего, блуждал. Когда ученик держал голову вниз, и рядом был предмет, например, книга или тетрадь, такое поведение можно было определить как ведение заметок или чтение книги. Когда поведение включало стоячую позу, а студент стоял на своём месте с открытым ртом, считалось, что он отвечает на вопрос стоя; Если ученик был встал на своём месте, считалось, что он ходит по классу, что может указывать на опоздание ученика на занятие или выход из класса и т.д. Когда ученик лежал головой на парте, его идентифицировали как спящего. Когда ученик держал еду или напитки в руках, поведение определялось как еда или питьё. Широко открытый рот или поведенческая поза при растяжении тела указывали на зевок ученика.

Категория поведенияОписание поведения
Оглядываясь вокругОчевидное движение головы вправо, влево или назад
Использование мобильного телефонаПрикасаться к мобильному телефону руками
ОбсуждениеРот открыт, движение головы
БлужданиеЗатуманенный взгляд в ненужные места
Путешествие по кругуСходя с сиденья
Питание или питьеОткрытый рот и контакт с едой или водой
Ведение заметок или чтениеДелать заметки или смотреть вниз в книгу
Внимательно слушаяСмотрел на доску или на учителя
Вставая (чтобы отвечать на вопросы)Встать на сиденье с открытым ртом
ЗеваниеОткрытый рот или растяжка тела
СонГолова на столе
Использование компьютераОткрытый компьютер на столе

Таблица 1: Категории и описания поведения учащихся.

(3) Анализ корреляции
Используя вышеуказанные критерии, 12 опытных учителей были приглашены посмотреть видео 120 учеников и зафиксировать их поведенческие типы и частоты. Поведение было выявлено согласно Таблице 1. Учителя были разделены на четыре группы, по три учителя в каждой группе. Каждая группа отвечала за запись 30 учеников, при этом каждый из трёх учителей независимо фиксировал поведение 30 учеников. Альфа Кронбаха (называемая α) — это индикатор для измерения внутренней согласованности шкалы или анкеты. Диапазон значений альфа Кронбаха — от 0 до 1, а α ≥ 0,8 обычно интерпретируется как хорошая внутренняясогласованность 21. Если у всех трёх учителей была высокая степень согласованности (α > 0,8, то есть высокая степень согласованности) в частоте определённого типа поведения, частота этого поведения фиксировалась как среднее из трёх частот. Впоследствии, с одной стороны, данные отражали частоты различных поведений каждого ученика, а с другой — уровень их вовлечённости, был проведён корреляционный анализ между этими двумя факторами. Результат приведён в таблице 2.

ПоведениеПоведенческая вовлечённость
Питание или питьеКорреляция Пирсона.319**
Сиг. (двухвостый)0.004
N120
ЗеваниеКорреляция Пирсона-.335**
Сиг. (двухвостый)0
N120
ОбсуждениеКорреляция Пирсона.546**
Сиг. (двухвостый)0
N120
Путешествие по кругуКорреляция Пирсона-.774**
Сиг. (двухвостый)0
N120
БлужданиеКорреляция Пирсона.293**
Сиг. (двухвостый)0.008
N120
Оглядываясь вокругКорреляция Пирсона-.834**
Сиг. (двухвостый)0
N120
Чтение или конспектыКорреляция Пирсона.912**
Сиг. (двухвостый)0
N120
Внимательно слушаяКорреляция Пирсона.881**
Сиг. (двухвостый)0
N120
СтояКорреляция Пирсона.330**
(чтобы ответить на вопрос)Сиг. (двухвостый)0
N120
СонКорреляция Пирсона-.411**
Сиг. (двухвостый)0
N120
ИспользованиеКорреляция Пирсона.591**
Мобильный телефонСиг. (двухвостый)0
N120
Использование компьютераКорреляция Пирсона.362**
Сиг. (двухвостый)0.001
N120

Таблица 2: Результаты корреляционного анализа.

В корреляционном анализе r — это коэффициент корреляции, относящийся к линейной степени корреляции между двумя переменными, варьирующейся от −1 до 1. В зависимости от степени взаимосвязи корреляцию можно классифицировать на следующие типы:
Высокая корреляция (│r│ ≥ 0,70)
Средняя корреляция (0,40 ≤ │r│ ≤ 0,70)
Низкая корреляция (│r│ ≤ 0,40)

В зависимости от направления отношений их можно классифицировать на следующие типы:
Положительная корреляция (r > 0)
Отрицательная корреляция (r < 0)
Нет корреляции (r = 0)

Из Таблицы 1 видно, что семь поведенческих видов поведения, включая осмотр (r = −0,834**, p < 0,05), использование мобильного телефона (r = 0,591**, p < 0,05), обсуждение (r = 0,546, p < 0,05), обход (r = −0,774**, p < 0,05), ведение заметок или чтение (r = 0,912**, p < 0,05), внимательное прослушивание (r = −0,881**, p < 0,05) и сон (r = −0,411**, p < 0,05), имели высокую или среднюю корреляцию с поведенческой вовлечённостью, в то время как такие повески, как еда или питье (r = 0,319**, p = 0,04), вставание (для ответа на вопрос) (r = 0,330**, p = 0,00), зевок (r = −0,335**, p < 0,05), блуждание (r = 0,293, p > 0,05) и использование компьютера (r = 0,362, p < 0,05) имели низкую или отсутствующую корреляцию с поведенческим взаимодействием. Основываясь на корреляционном анализе, это исследование в итоге выявило семь моделей поведения как индикаторы вовлечённости в обучение: осмотр, использование мобильного телефона, обсуждение, обходы, конспект или чтение, внимательное прослушивание и сон.

Создание набора данных
Видеоданные, использованные в этом исследовании, были собраны с платформы прямой записи SDUST, которая предоставляла синхронизированные видео реального преподавания курса «Академический английский» в классе. Было собрано десять видео из четырёх классов студентов, не изучающих английский язык, каждое длительностью примерно 50 минут, чтобы создать обучаемый набор данных о поведении учеников в классе. При кадре, нарисованном каждые 15 секунд, в итоге было извлечено 2000 изображений с разрешением 1920 × 1080.

Разделение набора данных
Эксперимент разделил налет данных о поведении учащихся на две полностью независимые части: обучающий набор и тестовый, как показано в таблице 3, без общих изображений. Набор данных охватывал все семь поведений учеников. Обучающий набор и тестовый набор использовались для обучения параметров модели и оценки точности соответственно. Параметры обучения были установлены, как показано в таблице 4.

Набор данныхКоличество изображений
Total2830
Тренировочный набор2111
Тестовый набор719

Таблица 3: Разделение набора данных по поведению учащихся.

ПараметрЦенность
Скорость обучения0.01
Импульс0.937
Снижение веса0.0005
Эпоха100
Размер партии16

Таблица 4: Установка экспериментальных параметров.

Чтобы предотвратить утечку данных, вызванную появлением одного и того же ученика в разных подмножествах, и сохранить естественную временную непрерывность поведения, был принят метод «стратифицированного временного разделения».

Подлежащее дизъюнкция: Набор данных был разбит по уникальным удостоверениям студентов, что обеспечило взаимное исключение студентов в наборах обучения, валидации и тестов.

Временное разбиение: Видео были отсортированы в хронологическом порядке. Первые 70% временных сегментов использовались для обучения, следующие 15% — для валидации, а последние 15% — для тестирования. Этот метод лучше моделировал реальные временные обобщения по сравнению со случайным делением.

Балансировка классов: Для недостаточно представленных категорий, таких как «спящий» и «использование мобильного телефона», в обучающем наборе применялась умеренная перевыборка, чтобы модель изучила особенности всех категорий.

Аннотация обучающего набора данных
Для ручного аннотирования обучающих данных использовался инструмент аннотирования с открытым исходным кодом. Этот инструмент использовался для аннотации ограничивающих коробок. Конкретный рабочий процесс был следующим: (1) ключевые кадры извлекались с фиксированной скоростью (1 кадр/с) из видео наблюдения, охватывающих разные школы, временные слоты и типы курсов, за которыми следовала обработка анонимизации, например, размытие лица; (2) Следуя стандартной процедуре аннотации, аннотаторы использовали прямоугольные рамки для точного обозначения ученика, выполняющего определённое поведение, и присваивания соответствующей категории; (3) Аннотации экспортировались в формате XML в формате PASCAL VOC.

Для обеспечения качества меток, особенно для предотвращения ошибок при различии неоднозначных поведений (например, обсуждение и блуждание), был реализован механизм совместной работы «Трёхступенчатая аннотация-арбитраж»:

Начальная аннотация: Каждый ключевой кадр был независимо аннотирован тремя обученными аннотаторами. Каждая метка состоит из категорической метки и ограничивающего рамки.

Проверка согласованности: Были рассчитаны согласованность между аннотациями и согласованность категорий между аннотациями. Ограничивающие рамки, являющиеся результатом начальной аннотации с IoU > 0.8 и идентичными категориями, считались «согласованными аннотациями». Ограничивающие рамки с метками IoU ≤ 0.8 или неидентичными категориями считались «несогласованными аннотациями».

Экспертный арбитраж: Для несогласованных аннотаций (например, неоднозначных случаев, таких как «оглядываться» против «обсуждать») окончательное решение принимала эксперты с опытом преподавания, основываясь на видеоклипе, поведенческом контексте и педагогических предварительных знаний. Окончательное решение принимается путём проверки точности метки с помощью проверки исходного видеосегмента ключевого кадра.

Аннотация показала, что поведение студентов характеризуется множественными, интенсивными и малыми целями, как показано на рисунке 3.

figure-protocol-3
Рисунок 3. Пример аннотации изображений в классе. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Ученики на занятиях проявляли такие поведения, как внимательное слушание, использование мобильного телефона, частое чтение или конспекты, в то время как частота передвижения, скитаний и т.д. была относительно низкой. Рисунок 4 показывает распределение поведения в классе в наборе данных по обучению.

figure-protocol-4
Рисунок 4. Распределение поведения в обучающем наборе данных. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Обнаружение поведения учащихся
Фреймворки обнаружения объектов на основе глубокого обучения в основном делились надве категории: двухступенчатые методы, представленные серией Faster R-CNN, и одноступенчатые методы, представленные YOLO. Для первой категории двухэтапные методы обнаружения сначала генерировали предложения по регионам с помощью сети региональных предложений (RPN), а затем выполняли детальные расчёты вероятности классов и регрессию по ограничивающим рамкам. Для второй категории одноступенчатые методы упростили процесс обнаружения, одновременно предсказывая классы объектов и ограничивающие рамки на одном этапе. Хотя двухэтапные методы появились на ранних этапах развития отрасли, одноступенчатые подходы приобрели популярность благодаря упрощённой архитектуре и вычислительной эффективности. Для достижения более точного и эффективного распознавания поведения в классе в этом исследовании были отобраны репрезентативные алгоритмы из обеих категорий — FasterR-CNN 23,24 и YOLO-v525,26 — для проведения экспериментов по обнаружению поведения в классе, а также сравнили результаты обнаружения двух алгоритмов, прежде чем окончательно определиться с алгоритмом, используемым для обнаружения поведения в этом исследовании.

Для эффективной оценки экспериментальных результатов внимание уделялось общей точности обнаружения по сравнению с временными затратами каждой алгоритмической модели. Для измерения обеих моделей использовались средняя средняя точность (mAP) и время обучения (h).

Семь категорий поведения были выявлены для распознавания двумя методами, а средние значения точности обнаружения (AP) были зафиксированы в Таблице 5. Среди них YOLO-v5s превосходили Faster R-CNN в обнаружении трёх категорий действий: перемещение, внимательное прослушивание лекций и использование мобильных телефонов, с AP-значениями 100%, 62,7% и 31,8% соответственно.

Сетевая модельОбсуждениеПутешествиеВнимательно слушаюОглядываясь вокругСонВедение заметок или чтениеИспользование мобильного телефона
Быстрее R-CNN32.699.545.49.32252.626.8
YOLO-v5s17.810062.73.8195131.8

Таблица 5: Средняя точность двух алгоритмов для одного класса.

Время обучения и средняя точность обнаружения двух классических сетей обнаружения на тестовом наборе при IoU 0,5 показаны в таблице 6. Хотя сеть Faster R-CNN имела более высокую точность, её продолжительность работы была относительно длинной. Для сравнения, YOLO-v5 имели на 30% меньшее время работы с снижением точности всего на 0,3%, что свидетельствует о большем повышении эффективности. Учитывая необходимость обнаружения поведения учащихся в классе в реальном времени, ожидалось, что время обучения сети будет максимально коротким. Учитывая как точность обнаружения, так и временные затраты моделей, обучаемых на обучающем наборе, в данной работе пришло к выводу, что YOLO-v5s больше подходит для определения поведения учащихся в классе.

Сетевая модельhmAP@0,5 (%)
Быстрее R-CNN2.8841.17
YOLO-v5s2.01640.87

Таблица 6: Сравнение эффективности обнаружения.

Поэтому для определения поведения в классе был выбран YOLO-v5s. Результаты обнаружения, полученные YOLO-v5, показаны на рисунке 5, где показано непрерывное обнаружение поведения при многоцелевом взаимодействии с соответствующими метками.

figure-protocol-5
Рисунок 5. Примеры результатов обнаружения тестового набора. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

(1) Дополнение и предобработка данных
Для повышения устойчивости и обобщения модели во время обучения применялась стратегия композитного дополнения данных, включая случайные аффинные преобразования, дрожание цвета и случайную окклюзию. Все изображения были равномерно изменены до 640 × 640 пикселей.

(2) Стратегия обучения
Процесс обучения был разделён на три этапа:
Фаза замороженного магистрали (эпохи 1-100): Магистральная сеть была заморожена, и обучена только головка обнаружения, используя низкую скорость обучения для разогрева.
Полная фаза тонкой настройки сети (эпохи 101-250): Все сетевые слои были разморажены. Планировщик косинусного отжига корректировал скорость обучения.
Фаза уточнения (эпохи 251-300): Для стабилизации обучения применялась экспоненциальная скользящая средняя, а интенсивность дополнения данных была снижена для совершенствования модели.

Для устранения дисбаланса класса к функции потерь применялись веса, специфичные для класса, обратно пропорциональные их частотам в обучающем наборе.

(3) Постобработка и временная оптимизация
Для поддержания временной согласованности поведения в классе после вывода модели применялся фильтр временной согласованности. В частности, для обнаруженной цели в видеопоследовательности её категория поведения должна была быть определена как минимум в трёх последовательных кадрах для подтверждения, что эффективно фильтрует временные ложноположительные результаты.

Установление метода оценки поведенческого вовлечения
В этом исследовании использовался метод фокус-групп для присвоения баллов каждому поведению. Двадцать преподавателей первого звена университетов были приглашены оценить вовлечённость в семь категорий поведения на основе своего опыта управления классом. Все 20 преподавателей преподавали более 10 лет и преподавали широкий спектр курсов по различным дисциплинам. Оценки за вовлечённость варьировались от 0 до 3: 0-1 — низкая вовлечённость, 1-2 — средняя вовлечённость, а 2-3 — высокая вовлечённость. Если уровень последовательности (α > 0,8) в оценках нескольких оценщиков по определённому типу поведения был высоким, вовлечённость этого поведения измерялась усреднением оценок отдельных учителей. Окончательные оценки каждого типа поведения приведены в таблице 7.

Тип поведенияоглядываясь вокругИспользование мобильного телефонаобсуждениеХодим по кругуВедение заметок или чтениевнимательно слушаяСон
Счёт вовлечения0.91.21.90.62.72.80.2

Таблица 7: Оценки поведения.

Формула поведенческой вовлечённости каждого ученика выглядит следующим образом

figure-protocol-6

ESi = поведенческая вовлечённость ученика, S j = балл поведения, fj = частота поведения j.

Если предположить, что количество выявленных поведений ученика в классе составляет 100, включая 4 «обсуждения», 68 «внимательное слушание», 25 «чтение/ведение заметок» и 3 «оглядывающиеся вокруг», общий балл личной вовлечённости ученика составлял (1,9 × 4 + 2,8 × 68 + 2,7 × 25 + 0,9 × 3) / 100 = 2,68. Если рассматривать всю лекцию как ориентир, поведенческое вовлечение делилось на четыре уровня по равномерному интервалу по шкале 0-3: балл ниже 0,75 определялся как «не вовлечён», 0.76-1.5 как «слегка вовлечённый», 1.6-2.25 как «вовлечённый» и 2.26-3 как «очень вовлечённый»; Таким образом, ученик был оценён как «очень вовлечённый» в классе.

Поведенческая активность всего класса относилась к среднему баллу всех учеников. Формула поведенческого вовлечения класса выглядит так:

figure-protocol-7

Ec =поведенческая вовлечённость класса, ES =поведенческая вовлечённость определённого ученика, n =количество учеников

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Обнаруживая поведение и используя модель подсчёта оценок, достигалось автоматическое измерение поведенческой вовлечённости учащихся. Взяв один из уроков в видео в качестве примера, поведенческая вовлечённость каждого ученика в реальном времени может быть рассчитана на основе результатов поведенческого обнаружения и модели оценки. Рисунок 6 иллюстрирует поведенческую вовлечённость двух учеников в этом классе, показывая их уровень вовлечённост...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Это исследование реализовало автоматическое распознавание и измерение поведенческой вовлечённости. По сравнению с предыдущими исследованиями, выявленное поведение было более репрезентативным для университетских аудиторий (например, использование мобильного телефона), а оценка поведенческой вовлечённости была представлена в виде рисунков, что делало её интуитивно понятной. Такой подход к автоматическому измерению позволил учителям эффективно и чётко оценивать вовлечённость отдельных учени...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

У авторов нет конфликта интересов, которые можно было бы заявлять.

Благодарности

Это исследование было поддержано Программой планирования социальных наук Шаньдуна (23CRWJ11).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Видео в классеВидеоданные, использованные в этом исследовании, собраны с платформы прямой записи Шаньдунского университета науки и технологий (SDUST), которые представляют собой синхронизированные видео реального преподавания курса академического английского языка в классе. Было собрано 30 видео из 6 классов студентов, не изучающих английский язык, примерно по 50 минут каждый, чтобы создать обучаемый набор данных студентов Поведение в классе.
IBM SPSS Статистика 26IBMSPSS для Windows — это модульный программный пакет, интегрирующий функции ввода, организации и анализа данных. Основные функции включают управление данными, статистический анализ, анализ диаграмм, управление результатами и так далее. SPSS в этой статье в основном используется для анализа согласованности и корреляционного анализа.
Маркировка 1.8.6Маркировка — это инструмент визуальной аннотации изображений. Он написан на Python и использует Qt для своего графического интерфейса. Аннотации сохраняются в виде XML-файлов в формате PASCAL VOC, который используется ImageNet. Кроме того, поддерживается формат YOLO. Он используется для наборов данных, необходимых для сетей обнаружения объектов, таких как Faster R-CNN, YOLO и SSD, для аннотаций объектов на изображениях.
MMDetection 2.22.0MMDetection, 2.22.0, MMDetection — это набор инструментов для обнаружения объектов, включающий богатые методы обнаружения объектов, сегментации экземпляров и панорамной сегментации, а также связанные компоненты и модули.

Ссылки

  1. Fredricks, J. A., Blumenfeld, P. C., Paris, A. H. School engagement: potential of the concept, state of the evidence. Rev Educ Res. 74 (1), 59-109 (2004).
  2. Xu, J. F., Qiu, Y. J. Development and validation of an online English learning engagement scale for college students. Foreign Lang Their Teach. 42 (1), 39-50 (2025).
  3. Xing, C. B., Xu, M. B. Higher education expansion, teacher–student ratio and education quality. Econ Educ Rev. 8 (1), 59-88 (2023).
  4. Li, X., Li, Y. Y., Bao, H. G., Cheng, L. New developments in learning engagement evaluation: from one-dimensional analysis to multimodal fusion. Res Audiovis Educ. 42 (10), 100-107 (2021).
  5. Finn, J. D., Pannozzo, G. M., Voelkl, K. E. Disruptive and inattentive-withdrawn behavior and achievement among fourth graders. Elem Sch J. 95 (5), 421-434 (1995).
  6. Finn, J. D., Rock, D. A. Academic success among students at risk for school failure. J Appl Psychol. 82 (2), 221-234 (1997).
  7. Skinner, E. A., Belmont, M. J. Motivation in the classroom: reciprocal effects of teacher behavior and student engagement across the school year. J Educ Psychol. 85 (4), 571-581 (1993).
  8. Whitehill, J., Serpell, Z., Lin, Y. C., Foster, A., Movellan, J. R. The faces of engagement: automatic recognition of student engagement from facial expressions. IEEE Trans Affect Comput. 5 (1), 86-98 (2014).
  9. Deng, W., Xia, L. J., Liu, Q. T., Zhang, S., Wei, Y. T. Analysis of distance classroom learning engagement based on video recognition. J Contin High Educ. 35 (6), 15-24 (2022).
  10. Designing an empirical framework to measure the level of interest of humans. Rahman, M., et al. Proc Int Conf Electr Inf Commun Technol (EICT), , 581-585 (2015).
  11. Zaletelj, J., Košir, A. Predicting students’ attention in the classroom from Kinect facial and body features. EURASIP J Image Video Process. 2017 (1), 80-82 (2017).
  12. Sukumaran, A., Manoharan, A. Student engagement recognition: comprehensive analysis through EEG and verification by image traits using deep learning techniques. IEEE Access. 13 (1), 11639-11662 (2025).
  13. Unobtrusive students’ engagement analysis in computer science laboratories using deep learning techniques. Ashwin, T. S., Guddeti, R. M. R. Proc IEEE Int Conf Adv Learn Technol (ICALT), , 436-440 (2018).
  14. Bai, J., et al. Detection of students’ classroom performance based on Faster R-CNN and transfer learning with multi-channel feature fusion. J Guangxi Norm Univ Nat Sci Ed. 38 (5), 1-11 (2020).
  15. Ouyang, W. X., Fan, W. S., Chen, L. W. Classroom head-up and head-down behavior recognition based on YOLOv5. Comput Knowl Technol. 19 (29), 9-12 (2023).
  16. Classroom behavior recognition and detection based on deep learning. Zhang, J. P., Zhang, Z. Y., Guan, L. T., Hu, H. M. Proc Int Conf Comput Vis Image Deep Learn (CVIDL), , 430-433 (2024).
  17. Yan, X. Y., Kuang, Y. X., Bai, G. R., Li, Y. Student classroom behavior recognition based on deep learning. Comput Eng. 49 (7), 251-258 (2023).
  18. Tan, S. Y., Wang, Z. X., He, G. D. Real-time panoramic multi-scale classroom behavior recognition based on the CA-YOLOv9 network. Mod Educ Technol. 34 (7), 123-130 (2024).
  19. Wang, S. B., Lin, Z. J., Huang, J., Ju, J. H. A real-time network-based method for analyzing student classroom behavior. J Zhejiang Univ Sci Technol. 37 (3), 259-269 (2025).
  20. Ren, Q. M. Formulation and verification of a multidimensional evaluation scale for student engagement in college English classrooms. Shandong Foreign Lang Teach. 43 (4), 58-66 (2022).
  21. Cronbach, L. J. Coefficient alpha and the internal structure of tests. Psychometrika. 16 (3), 297-334 (1951).
  22. Zhou, J. Y., Zhao, Y. M. Application of convolutional neural networks in image classification and object detection. Comput Eng Appl. 53 (13), 34-41 (2017).
  23. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comput Vis, , 91-99 (2015).
  24. Ren, S. P., He, K. M., Girshick, R., Sun, J. Faster R-CNN: toward real-time object detection with region proposal networks. Adv Neural Inf Process Syst (NeurIPS). 29, 91-99 (2016).
  25. Multiple object tracking based on YOLOv5 and an optimized DeepSORT algorithm. Bai, T. J Phys Conf Ser, 2547 (1), 012001(2023).
  26. Wang, Y. P., Chi, Z. Z., Liu, M., Li, G., Ding, S. High-performance lightweight fall detection using an improved YOLOv5s algorithm. Machines. 11 (8), 818(2023).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

Faster R CNNYOLOv5s