$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании используются общедоступные наборы данных, которые не содержат никакой личной информации. Все данные, использованные в исследовании, были анонимизированы для обеспечения конфиденциальности участников. Информированное согласие было получено от всех участников на момент сбора данных, и исследование придерживается этических принципов. Протокол объясняет метод интеллектуального распознавания поведения в классе, который состоит из извлечения признаков на основе мультимодального слияния данных и пространственно-временного распознавания поведения на основе Трансформера и внимания. Эффективность всего метода оптимизируется за счет совместных тренировок.
1. Мультимодельный сбор данных
Мультимодальный сбор данных включал в себя сбор синхронизированных данных о поведении в классе из двух наборов данных: EduSense Dataset и SBU Kinect Interaction Dataset. EduSense записывал реальные записи из университетских аудиторий, а SBU Kinect записывал скелетные последовательности на основе взаимодействия. Наборы данных содержали видеопотоки, звуковые подсказки и 3D-информацию о скелетных суставах для моделирования поз и движений учащихся. Предварительная обработка данных гарантирует временное выравнивание и устранение шума при очистке. Эта конвергенция обеспечила сквозной мониторинг поведения, запись визуальных жестов и движений тела во многих учебных ситуациях.
2. Извлечение признаков на основе мультимодального слияния данных
Для решения проблемы распознавания поведения учащихся в интеллектуальных классах предложен метод распознавания поведения в интеллектуальном классе с помощью Transformer и AM. Из-за сложного характера классных комнат с большим количеством учеников изменения факторов внутри сцены могут мешать распознаванию поведения учащихся. Кроме того, извлечение отдельных признаков имеет такие ограничения, как неполная информация, восприимчивость к помехам окружающей среды и сложность захвата сложных моделей поведения19,20. Поэтому в исследовании сначала предлагается метод извлечения характеристик студенческого класса, основанный на мультимодальном слиянии данных. Этот метод объединяет данные из видео и скелетных модальностей, используя их взаимодополняемость для достижения более полного и точного извлечения характеристик поведения учащихся. В частности, каждая входная видеопоследовательность делится по кадрам. Кадры подаются в предварительно обученную более быструю R-CNN для локализации областей интереса человека. Обнаруженные области подаются в сверточную нейронную сеть для получения временных визуальных признаков. Для скелетной модальности 3D-положения суставов задаются в виде последовательностей и кодируются с использованием предварительно обученной модели BERT для получения временных и пространственных зависимостей. Они нормализуются и встраиваются перед вводом в мультимодальную сеть слияния. Среди них видеомодальность в основном отвечает за захват визуальных особенностей, таких как движения и выражение лица студентов, в то время как скелетная модальность точно описывает изменения позы учащихся с помощью совместной точечной информации. В то время как видеомодальность опирается на глобальные особенности визуального восприятия, в то время как скелетная модальность представляет глобальные визуальные особенности для репрезентации человеческого поведения, скелетная модальность фокусируется на динамических изменениях в положении суставов, что приводит к значительным семантическим различиям между двумя21. Поэтому необходимо разработать специализированную мультимодальную сеть слияния для эффективного моделирования корреляции между двумя модальностями. Мультимодальная сеть термоядерного синтеза показана на рисунке 1.
На рисунке 1 сеть в основном разбита на три модуля. Среди них входными данными модуля обработки видеомодальностей является видеопоследовательность, которая извлекается с помощью сверточной нейронной сети на основе более быстрых областей (Faster R-CNN) для извлечения признаков. Рассмотрение видеомодальности начинается с преобразования видеокадров в классе в покадровые входные данные для извлечения особенностей. Кадры обрабатываются с помощью более быстрой сверточной нейронной сети на основе регионов (Faster R-CNN) с базой ResNet-50, обученной на ImageNet. Сеть обрабатывает RGB-кадры, размер которых изменяется до 224 × 224 пикселей, в результате чего получаются высокоуровневые карты визуальных признаков с пространственными и объектно-специфическими особенностями деятельности учащихся. Затем эти функции вводятся в модуль самовнимания, который изучает временные отношения между кадрами перед их кодированием в пространственно-временные вложения через слой Transformer. Это позволяет сохранить слабые поведенческие сигналы, такие как наклон головы или поднятие рук, в встраиваемых представлениях для последующего слияния. Извлеченные видеохарактеристики захватываются модулем самовнимания для захвата временных и пространственных отношений в пределах видеомодальности, а затем моделируются преобразователем для генерации векторов встраивания пространственно-временной информации видеопоследовательности. Входными данными модуля обработки скелетной модальности является скелетная последовательность, которая обрабатывается двунаправленным энкодером из трансформеров (BERT) для извлечения временных и пространственных особенностей скелетных суставов. Для скелетных данных поза каждого учащегося моделируется в виде последовательности 2D-координат суставов из видеозаписей в классе с использованием оценки позы на основе OpenPose. Эти последовательности преобразуются в лексемы внедрения, в которых каждая лексема соответствует кадру с 18 ключевыми точками. Временной контекст и зависимости этих совместных последовательностей моделируются с помощью модели двунаправленного энкодера Representations from Transformers (BERT). В модели используется 12 слоев трансформатора, 8 головок внимания и скрытый размер 768, который является стандартной архитектурой BERT-base. Модель настраивается во время обучения для получения характерных для поведения паттернов суставов. Выходные встраивания представляют структурные и двигательные характеристики поведения учащихся, которые впоследствии сочетаются с функциями видеомодальности. Впоследствии скелетные особенности далее агрегируются в пространственные и временные особенности с помощью 3D CNN и операций объединения, генерируя встроенные векторы скелета в качестве репрезентаций скелетной модальности.
3. Модуль слияния перекрестного внимания
В модуле слияния перекрестного внимания в исследовании используется механизм многоголового внимания (MHAM) для построения взаимоотношений между видеомодальностью и скелетной модальностью, а также для дальнейшего извлечения более компактных элементов слияния с помощью 3D CNN и операций объединения из сгенерированных мультимодальных элементов слияния. Процесс слияния осуществляется с помощью двухпотоковой сети внимания, в которой временные вложения каждой модальности пропускаются через 3D CNN и двунаправленные ГРУ. Мультимодальные потоки данных выравниваются с помощью модулей внимания с несколькими головками (MHAM) с масштабированным вниманием к точечному продукту для достижения интермодальных зависимостей. Затем вложения объединяются для решения проблем размерной сложности и отправляются на полностью подключенный слой Softmax для классификации.
В мультимодальных сетях термоядерного синтеза модуль самовнимания используется для моделирования временной и пространственной зависимости в пределах одного мода, в то время как модуль слияния перекрестного внимания используется для установления ассоциации и информационного взаимодействия между различными модами. Поэтому и то, и другое очень важно. Модуль самовнимания фиксирует внутренние зависимости входной последовательности, вычисляя связь между запросом Q, ключом K и значением V. Вычисление Q, ключа K и величины V показано в уравнении (1). Где
находятся матрицы запросов, ключей и значений соответственно; dk — ключевая векторная размерность, а dk — размерность векторов значений. Размерный коэффициент dk используется для того, чтобы избежать увеличения скалярных произведений, которые могли бы повлиять на стабильность градиентов во время обучения.
(1)
В уравнении (1)
представлены входные признаки, где n — длина входной последовательности, dmodel — размерность признаков, а WQ, WK и WV представляют три набора обучаемых матриц проекции. С помощью этих матричных сопоставлений входные признаки преобразуются в запросы, ключи и значения. Скалярное произведение запроса Q и ключ K используются для вычисления весов внимания и их масштабирования, как показано в уравнении (2).
(2)
В уравнении (2) dk представляет размерность запроса Q и ключа K, а softmax обозначает функцию softmax, используемую для получения матрицы весов внимания. Масштабирование может эффективно предотвратить проблему слишком малого градиента из-за чрезмерных значений скалярного произведения, вызванных размерностью. Матрица весов внимания применяется к значению V для получения выходного значения Z модуля собственного внимания, как показано в уравнении (3).
(3)
В уравнении (3) ij означает вес внимания i-го вектора запроса на j-м ключевом векторе. Специфическая структура модуля слияния перекрестного внимания показана на рисунке 2.
Как показано на рисунке 2, этот модуль в основном начинает обработку входных функций из скелетных и видеомодальностей. Во-первых, последовательность скелета и видеопоследовательность отдельно подвергаются 3D-сверточным слоям для извлечения пространственно-временных особенностей, а затем эти пространственно-временные особенности моделируются с использованием двунаправленных стробированных рекуррентных единиц (Bi-GRU) для временного моделирования. Затем особенности двух модальностей дополнительно извлекаются с помощью MHAM для извлечения корреляций внутри модальностей. Каждая модальность обеспечивает внутреннее представление характеристик с помощью механизмов запросов, ключей и значений. Затем для выходных объектов выполняется объединение, усредненное по времени, чтобы уменьшить сложность временного измерения. После объединения мультимодальные признаки статистически объединяются для вычисления среднего и стандартного отклонения каждой модальности и, наконец, для вывода распознавания действий студента и его классификации с помощью полносвязного слоя (FCL) и классификатора Softmax. Таким образом, экстракция признаков, основанная на мультимодальном слиянии данных, предложенная в исследовании, использует самовнимание и перекрестные АМ для точного захвата и моделирования пространственно-временных особенностей поведения учащихся путем объединения данных из видео и скелетных модальностей, тем самым повышая точность и полноту распознавания поведения учащихся в интеллектуальных классах.
4. Пространственно-временное распознавание поведения на основе Трансформера и внимания
Извлечение признаков на основе мультимодального слияния данных позволяет достичь предварительного улучшения полноты и точности поведения учащихся за счет объединения данных из видео и скелетных модальностей. Однако в контексте интеллектуальных классов поведение учащихся часто меняется с течением времени, и одно и то же поведение может проявлять разные характеристики в разные временные точки и пространственные регионы. Полагаясь исключительно на статическую информацию, слитую из мультимодальных признаков, нельзя полностью охватить сложные пространственно-временные динамические отношения в поведенческой последовательности22,23. Поэтому дальнейшие исследования предлагают пространственно-временное моделирование поведения и аддитивное производство на основе Transformer. В качестве сетевой архитектуры был выбран Vision Transformer (ViT), который может моделировать глобальную пространственно-временную информацию, поступающую через собственное AM, и обладает более сильной способностью захватывать пространственно-временные зависимости. После мультимодального слияния слитые объекты снова представляются с помощью визуального трансформатора (ViT) для прогнозирования пространственно-временного поведения. Карты признаков во входных данных разбиваются на непересекающиеся 16 × 16 патчей, линейно встраиваются в одномерные векторы и позиционно кодируются для сохранения пространственного порядка. Структура ViT состоит из 12 блоков трансформера, состоящих из многоголовочных слоев самовнимания (8 головок) и слоев прямой связи, скрытый размер которых составляет 768. Для повышения поведенческой значимости предлагаются модули «Пространственное внимание» (СА) и «Временное внимание» (ТА). Модуль SA повышает релевантность функций в пространственных областях с помощью активации Tanh, в то время как модуль TA выделяет важные временные кадры с помощью активации ReLU. Эти два потока внимания впоследствии объединяются с основной структурой ViT с помощью двухступенчатого метода обучения, так что модель учится эффективно фиксировать динамическую эволюцию поведения в классе. Структура ViT показана на рисунке 3.
На рисунке 3 в ViT исходным входом является изображение, которое сегментировано на несколько небольших блоков фиксированного размера, каждый из которых представлен как часть изображения, и линейно сплющен в одномерный вектор. Поскольку Трансформер не может воспринимать информацию о местоположении, каждый маленький блок встраивается в информацию о местоположении перед вводом в Трансформер, чтобы гарантировать, что он может зафиксировать отношение относительного пространственного положения между различными маленькими блоками. Основным модулем ViT является энкодер Transformer, который состоит из нескольких многоуровневых блоков кодирования Transformer. Блоки кодирования состоят из MHAM и нейронной сети с прямой связью. MHAM фиксирует зависимости между входными последовательностями параллельно, в то время как нейронная сеть с прямой связью выполняет нелинейные преобразования результатов, чтобы повысить способность модели захватывать и выражать глобальную информацию. После того как трансформер обрабатывает все мелкие фрагменты информации, вывод последнего слоя кодирования передается на многослойную перцептронную головку (MLP Head), которая выводит окончательные результаты распознавания и классификации действий учащегося.
На практике каждый кадр разбивается на неперекрывающиеся 16 × 16 патчей, сплющиваются и позиционно встраиваются для поддержания пространственных отношений. Встраивание патчей последовательно обрабатывается многоуровневыми трансформаторными энкодерами в архитектуре ViT. Модуль пространственного внимания (SA) использует активацию tanh для изменения внимания по областям интереса в каждом кадре, а модуль временного внимания (TA) использует ReLU для выделения важных во времени кадров. Этот механизм двойного внимания позволяет эффективно моделировать динамику поведения пространства и времени.
Для дальнейшего повышения производительности ViT в сложных поведенческих последовательностях введены пространственное внимание (SA) и временное внимание (TA), которые позволяют ViT не только автономно выбирать важные пространственные суставы, но и фокусироваться на поведении в различных временных точках, лучше улавливая пространственно-временные динамические изменения поведения. Модули SA и TA показаны на рисунке 4.
На рисунке 4A модуль SA обрабатывает информацию о пространственных размерностях входных данных, передавая особенности текущего кадра в слой ViT для извлечения скрытых состояний. Они сочетаются с особенностями предыдущей рамы и совместно подаются в FCL. FCL выполнит линейное преобразование признаков для создания скрытых представлений признаков. Затем он передается в функцию активации Таня для отображения выходного сигнала в диапазоне [-1,1], повышая нелинейность и лучше различая важные и неважные признаки. Наконец, признаки нормализуются с помощью слоя нормализации, чтобы гарантировать, что выходные объекты имеют относительно стабильный масштаб. На рисунке 4B модуль TA больше фокусируется на ключевой информации, содержащейся в каждом кадре во временном измерении. В отличие от Tanh в SA, модуль TA использует функцию активации ReLU для подавления отрицательных значений и сохраняет только выходные данные положительных значений, эффективно удаляя негативную информацию о шуме и улучшая способность модели к временному захвату.
5. Метод совместной тренировки
Для эффективного решения проблемы смещения и избыточности пространственно-временных особенностей, вызванных взаимным влиянием модуля ViT, SA и модуля TA в пространственно-временном распознавании поведения на основе Трансформера и внимания, для оптимизации трех модулей используется метод совместного обучения. Конкретный процесс обозначен на рисунке 5.
На рисунке 5 стратегия совместного обучения сначала вводит параметры обучения модели, задает структуру сети и гиперпараметры. Впоследствии проводится отдельное предварительное обучение по СА и ТА для лучшего изучения местных особенностей. Стоит отметить, что во время предварительного обучения одной модели, веса другой модели остаются фиксированными и не обновляются. После прохождения индивидуальной предварительной тренировки слой ViT объединяется для тренировки. Затем будут зафиксированы две модели внимания, а основная сеть ViT будет обучена отдельно. Наконец, путем совместного обучения основной сети ViT, модулей SA и TA, общая сеть оптимизируется для создания окончательной модели интеллектуального распознавания поведения в классе. Процедура обучения проводится поэтапно: (1) автономное предварительное обучение модулей SA и TA с замороженными параметрами ViT, (2) поэтапное обучение ViT с замороженными весами модулей внимания и (3) сквозная тонкая настройка всех компонентов совместно с оптимизатором Adam (скорость обучения = 0,001, размер партии = 64, эпохи = 100). Такой подход стабилизирует обучение признакам и уменьшает интерференцию между модулями во время оптимизации.
В целом, предлагаемый интеллектуальный метод распознавания поведения в классе сочетает в себе видео и скелетные модальности для моделирования пространственно-временных отношений через самовнимание и перекрестные АМ. Используя возможности глобального пространственно-временного моделирования ViT и комбинируя пространственные модули и модули TA, модель оптимизируется для захвата ключевых моделей поведения и временной динамики, обеспечивая более полное и точное распознавание поведения учащихся. В рассматриваемой архитектуре выполняются критические операции слияния, при которых объединяются мультимодальные представления признаков. В частности, пространственные особенности, полученные CNN, связаны с темпоральными особенностями Bi-LSTM. Затем эти выходные данные объединяются с функциями MHAM, дополненными вниманием, перед задачей классификации. Эти операции слияния имеют решающее значение для слияния взаимодополняющих представлений поведенческих данных и подчеркнуты на рисунках 1 и 5.
Алгоритм 1 иллюстрирует объединенные мультимодальные данные, скелетную, текстовую и видеоинформацию с использованием моделей на основе ViT, BERT и GCN для извлечения информативных признаков в классе. Затем совместное представление маркируется для идентификации поведения учащихся с более высокой точностью с использованием кросс-модального обучения.
Алгоритм 1: Процесс мультимодального распознавания поведения с использованием ViT, BERT и GCN.
Инициализировать:
Предварительно обученная модель BERT
Предварительно обученная модель Faster R-CNN
Предварительно обученная модель ViT
Модель GCN для данных скелета
Классификатор (например, MLP или трансформатор)
Загрузить набор данных:
Для каждой выборки в мультимодальном наборе данных:
Извлечение видеокадров
Извлечение расшифровки аудио
Извлечение данных скелета (OpenPose или MediaPipe)
Шаг 1: Обработка видеомодальностей
Для каждого кадра в видео:
Применение Faster R-CNN для обнаружения объектов/участников
Применение Vision Transformer (ViT) для извлечения функций на уровне кадра
Агрегирование объектов во времени для временного представления
Шаг 2: Обработка текстовой модальности
Текст расшифровки предварительного процесса:
Токенизация с помощью токенизатора BERT
Передача токенов через модель BERT
Извлечение контекстных внедрений из токена [CLS] или пула среднего значения
Шаг 3: Обработка скелетной модальности
Для каждой последовательности скелетов:
Нормализовать координаты
Пройдите через GCN или ST-GCN для извлечения движущихся объектов
Шаг 4: Слияние функций
Конкатенат или внимание-слияние:
Особенности видео
Особенности текста
Особенности скелета
Получите единое мультимодальное представление
Шаг 5: Классификация
Передача объединенного представления в итоговый классификатор
Прогнозирование поведения в классе (например, внимательность, отвлечение)
Шаг 6: Оценка
Сравнивайте прогнозы с наземными достоверными данными
Вычислительные метрики: точность, точность, отзыв, оценка F1