Исследовательская статья

Распознавание поведения в классе с помощью трансформера и механизма внимания: применение в оценке качества преподавания для медицинского образования с использованием искусственного интеллекта

DOI:

10.3791/69052

15 августа 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании представлена система искусственного интеллекта на основе Transformer для распознавания поведения в классе в медицинском и сестринском образовании. Используя мультимодальные данные, система оценивает вовлеченность учащихся и их эмоциональное состояние. Результаты демонстрируют более высокую точность по сравнению с традиционными моделями, что позволяет получать обратную связь в режиме реального времени и улучшать поддержку качества преподавания и психического здоровья учащихся.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании представлена система искусственного интеллекта на основе Transformer, предназначенная для распознавания поведения в классе, направленная на улучшение оценки качества преподавания и мониторинга психического здоровья в медицинском и сестринском образовании. Модель использует мультимодальные данные, в частности, видео, аудио и скелетные движения, для оценки ключевых показателей вовлеченности учащихся, таких как продолжительность внимания, частота взаимодействия и эмоциональные колебания. Новая мультимодальная стратегия слияния в сочетании с пространственно-временными механизмами внимания позволяет системе фиксировать сложное поведение в классе с повышенной точностью и надежностью. Экспериментальные результаты на наборах данных EduSense и SBU Kinect показывают, что предложенный метод значительно превосходит традиционные модели как по точности, так и по уровню ложных срабатываний. Кроме того, исследования абляции подтверждают вклад пространственных и временных модулей внимания в способность системы распознавать. Фреймворк поддерживает обратную связь в режиме реального времени и визуальное отображение поведения, предлагая практическую ценность в среде эмпирического обучения. Этот подход обеспечивает масштабируемое и адаптивное решение для мониторинга поведения в классе и поддерживает стратегии раннего вмешательства в медицинском образовании.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В связи с растущими проблемами психического здоровья среди студентов-медсестер и медиков из-за академического и клинического стресса интеграция искусственного интеллекта в учебную среду может обеспечить не только мониторинг качества преподавания, но и психологическую поддержку в режиме реального времени. В этом исследовании распознавание поведения в медицинском образовании направлено на поддержку экспериментального обучения и содействие благополучию студентов1. Интеллектуальный класс относится к новой и высококачественной образовательной модели, которая сочетает в себе интеллектуальные и персонализированные процессы обучения с применением передовых технологий, таких как информационные технологии, искусственный интеллект, большие данные и Интернет вещей, для облегчения управления обучением и взаимодействия в классе 2,3,4. В настоящее время, с развитием таких технологий, как камеры и датчики, поведенческие данные, собираемые в классе, включают не только видео, но и мультимодальные данные, такие как голос и аудио. Тем не менее, работа с этой сложной пространственно-временной информацией и данными и точное извлечение из них ценных поведенческих характеристик являются основными проблемами, стоящими перед областью интеллектуального распознавания поведения в классе 6,7. Существующие подходы к распознаванию поведения в первую очередь опираются на извлечение признаков из одномодальных источников данных, таких как видеопотоки в классе или последовательные изображения8. Несмотря на то, что эти методы могут обнаруживать грубые поведенческие события, они часто не в состоянии смоделировать временную эволюцию и пространственные нюансы жестов, выражений или частот взаимодействия учащихся, критически важных для понимания благополучияи концентрации внимания учащихся. Более того, в современных моделях отсутствуют надежные механизмы для объединения разнородных источников данных, таких как звуковые сигналы и скелетные движения, что ограничивает их чувствительность к аффективномуили отстраненному поведению. Чтобы устранить эти ограничения, в данном исследовании предлагается система распознавания поведения класса на основе трансформатора, усиленная пространственно-временными механизмами внимания. Используя способность «Трансформера» моделировать долгосрочные зависимости и сочетая ее с мультимодальными стратегиями слияния признаков, предлагаемая система направлена на повышение точности классификации поведения, обеспечивая при этом визуализацию показателей вовлеченности и эмоциональных показателей в режиме реального времени. Конечная цель состоит в том, чтобы поддержать динамическую оценку качества преподавания и встроенную обратную связь по психическому здоровью в медицинском образовании, предлагая масштабируемое, адаптивное решение для мониторинга и повышения как эффективности обучения, так и благополучия учащихся.

В ходе оценки была предложена новая система распознавания поведения на основе Transformer, которая сочетает в себе пространственно-временные механизмы внимания с мультимодальным слиянием данных (видео и скелетные входы), предназначенную для интеллектуального наблюдения за классом в медицинском и сестринском образовании. В отличие от существующих моделей, новая модель способствует точному отслеживанию внимания учащихся в режиме реального времени и их эмоциональному состоянию, что имеет важное значение как для оценки качества обучения, так и для психологического благополучия.

Похожие работы
Интеллектуальный класс — это новая учебная среда, в которой используются современные информационные технологии для улучшения взаимодействия с преподаванием, персонализированного обучения и управления преподаванием. Он может использовать интеллектуальные методы обучения для повышения эффективности и качества преподавания, предоставляя учащимся более богатый и персонализированный опыт обучения. Поэтому многие ученые по всему миру исследовали интеллектуальные технологии и преподавание в классе. Радосавлевич и др. предложили интеллектуальную модель класса, основанную на интеллекте окружающей среды, которая оценивает уровень усталости учащихся и корректирует стратегии обучения, анализируя данные об их ежедневной академической активности для оптимизации результатов обучения11. Тай Т. И изучил влияние интеллектуальных персональных помощников на улучшение разговорных способностей на иностранном языке и обнаружил, что использование Google Assistant значительно улучшило разговорные способности людей, не являющихся носителями языка, с такими же эффектами в общении, как у носителей языка12. В ходе своего исследования Чен и его коллеги обнаружили, что использование чат-ботов в качестве инструментов обучения может быстро реагировать на потребности учащихся, повышать интерактивность и демонстрировать потенциальное применение интеллектуальных технологий в классе13. В исследовании был предложен метод оценки эффективности преподавания в классе, основанный на интеллектуальном режиме обучения, который повысил точность оценки за счет использования алгоритма поиска кукушки и экстремальной обучающей машины14.

Распознавание поведения в интеллектуальных классах является ключевой технологией для достижения персонализированного обучения и оптимизации управления классом. Он может отслеживать состояние поведения учащихся в режиме реального времени и предоставлять эффективную обратную связь. Благодаря распознаванию поведения учителя могут точно понимать участие и концентрацию внимания учащихся, тем самым повышая эффективность преподавания и способствуя принятию решений. В этом контексте ученые по всему миру провели обширные исследования по интеллектуальному распознаванию поведения в классе. В исследовании была предложена система визуального мониторинга в режиме реального времени на основе искусственного интеллекта, которая использовала машинное обучение для обучения моделей распознавания поведения учащихся, чтобы помочь учителям лучше контролировать участие учащихся и взаимодействие в классе, тем самым оптимизируякачество преподавания. Chonggao P добился распознавания поведения учащихся в режиме реального времени и повысил точность анализа поведения в классе при дистанционном обучении, объединив кластерный анализ и алгоритм случайного леса, а также модель скелета человека16. Wu S разработал модель распознавания поведения учащихся, которая сочетает в себе оптимизацию роя частиц и алгоритм K-ближайшего соседа, способствуя точности распознавания эмоций для удовлетворения практическихпотребностей преподавания в классе. Система ACORN, предложенная Рамакришнаном и др., использовала мультимодальное машинное обучение и комбинированные сверточные нейронные сети для анализа аудио, мимики и данных изображений. Интеграция этих функций через временные сверточные сети позволила добиться автоматической оценки атмосферы в классе и предварительного прогресса18.

Таким образом, существующие исследования предложили различные методы машинного обучения и глубокого обучения для интеллектуального распознавания поведения в классе, охватывающие такие области, как обнаружение усталости учащихся, анализ настроений и мониторинг взаимодействия в классе. Тем не менее, в текущих исследованиях все еще есть некоторые недостатки, и многим методам не хватает реального времени и масштабируемости в практических приложениях, что затрудняет адаптацию к сложным и меняющимся сценариям в классе. Таким образом, в исследовании предлагается интеллектуальный метод распознавания поведения в классе с помощью трансформатора и аддитивного производства. Инновация исследования заключается в использовании мощных возможностей временного моделирования Transformer в сочетании с пространственно-временным AM для точного захвата ключевых поведенческих моментов и областей в классе, а также в интеграции нескольких источников информации, таких как видео и аудио, посредством мультимодального слияния данных для повышения полноты и точности распознавания поведения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом исследовании используются общедоступные наборы данных, которые не содержат никакой личной информации. Все данные, использованные в исследовании, были анонимизированы для обеспечения конфиденциальности участников. Информированное согласие было получено от всех участников на момент сбора данных, и исследование придерживается этических принципов. Протокол объясняет метод интеллектуального распознавания поведения в классе, который состоит из извлечения признаков на основе мультимодального слияния данных и пространственно-временного распознавания поведения на основе Трансформера и внимания. Эффективность всего метода оптимизируется за счет совместных тренировок.

1. Мультимодельный сбор данных

Мультимодальный сбор данных включал в себя сбор синхронизированных данных о поведении в классе из двух наборов данных: EduSense Dataset и SBU Kinect Interaction Dataset. EduSense записывал реальные записи из университетских аудиторий, а SBU Kinect записывал скелетные последовательности на основе взаимодействия. Наборы данных содержали видеопотоки, звуковые подсказки и 3D-информацию о скелетных суставах для моделирования поз и движений учащихся. Предварительная обработка данных гарантирует временное выравнивание и устранение шума при очистке. Эта конвергенция обеспечила сквозной мониторинг поведения, запись визуальных жестов и движений тела во многих учебных ситуациях.

2. Извлечение признаков на основе мультимодального слияния данных

Для решения проблемы распознавания поведения учащихся в интеллектуальных классах предложен метод распознавания поведения в интеллектуальном классе с помощью Transformer и AM. Из-за сложного характера классных комнат с большим количеством учеников изменения факторов внутри сцены могут мешать распознаванию поведения учащихся. Кроме того, извлечение отдельных признаков имеет такие ограничения, как неполная информация, восприимчивость к помехам окружающей среды и сложность захвата сложных моделей поведения19,20. Поэтому в исследовании сначала предлагается метод извлечения характеристик студенческого класса, основанный на мультимодальном слиянии данных. Этот метод объединяет данные из видео и скелетных модальностей, используя их взаимодополняемость для достижения более полного и точного извлечения характеристик поведения учащихся. В частности, каждая входная видеопоследовательность делится по кадрам. Кадры подаются в предварительно обученную более быструю R-CNN для локализации областей интереса человека. Обнаруженные области подаются в сверточную нейронную сеть для получения временных визуальных признаков. Для скелетной модальности 3D-положения суставов задаются в виде последовательностей и кодируются с использованием предварительно обученной модели BERT для получения временных и пространственных зависимостей. Они нормализуются и встраиваются перед вводом в мультимодальную сеть слияния. Среди них видеомодальность в основном отвечает за захват визуальных особенностей, таких как движения и выражение лица студентов, в то время как скелетная модальность точно описывает изменения позы учащихся с помощью совместной точечной информации. В то время как видеомодальность опирается на глобальные особенности визуального восприятия, в то время как скелетная модальность представляет глобальные визуальные особенности для репрезентации человеческого поведения, скелетная модальность фокусируется на динамических изменениях в положении суставов, что приводит к значительным семантическим различиям между двумя21. Поэтому необходимо разработать специализированную мультимодальную сеть слияния для эффективного моделирования корреляции между двумя модальностями. Мультимодальная сеть термоядерного синтеза показана на рисунке 1.

На рисунке 1 сеть в основном разбита на три модуля. Среди них входными данными модуля обработки видеомодальностей является видеопоследовательность, которая извлекается с помощью сверточной нейронной сети на основе более быстрых областей (Faster R-CNN) для извлечения признаков. Рассмотрение видеомодальности начинается с преобразования видеокадров в классе в покадровые входные данные для извлечения особенностей. Кадры обрабатываются с помощью более быстрой сверточной нейронной сети на основе регионов (Faster R-CNN) с базой ResNet-50, обученной на ImageNet. Сеть обрабатывает RGB-кадры, размер которых изменяется до 224 × 224 пикселей, в результате чего получаются высокоуровневые карты визуальных признаков с пространственными и объектно-специфическими особенностями деятельности учащихся. Затем эти функции вводятся в модуль самовнимания, который изучает временные отношения между кадрами перед их кодированием в пространственно-временные вложения через слой Transformer. Это позволяет сохранить слабые поведенческие сигналы, такие как наклон головы или поднятие рук, в встраиваемых представлениях для последующего слияния. Извлеченные видеохарактеристики захватываются модулем самовнимания для захвата временных и пространственных отношений в пределах видеомодальности, а затем моделируются преобразователем для генерации векторов встраивания пространственно-временной информации видеопоследовательности. Входными данными модуля обработки скелетной модальности является скелетная последовательность, которая обрабатывается двунаправленным энкодером из трансформеров (BERT) для извлечения временных и пространственных особенностей скелетных суставов. Для скелетных данных поза каждого учащегося моделируется в виде последовательности 2D-координат суставов из видеозаписей в классе с использованием оценки позы на основе OpenPose. Эти последовательности преобразуются в лексемы внедрения, в которых каждая лексема соответствует кадру с 18 ключевыми точками. Временной контекст и зависимости этих совместных последовательностей моделируются с помощью модели двунаправленного энкодера Representations from Transformers (BERT). В модели используется 12 слоев трансформатора, 8 головок внимания и скрытый размер 768, который является стандартной архитектурой BERT-base. Модель настраивается во время обучения для получения характерных для поведения паттернов суставов. Выходные встраивания представляют структурные и двигательные характеристики поведения учащихся, которые впоследствии сочетаются с функциями видеомодальности. Впоследствии скелетные особенности далее агрегируются в пространственные и временные особенности с помощью 3D CNN и операций объединения, генерируя встроенные векторы скелета в качестве репрезентаций скелетной модальности.

3. Модуль слияния перекрестного внимания

В модуле слияния перекрестного внимания в исследовании используется механизм многоголового внимания (MHAM) для построения взаимоотношений между видеомодальностью и скелетной модальностью, а также для дальнейшего извлечения более компактных элементов слияния с помощью 3D CNN и операций объединения из сгенерированных мультимодальных элементов слияния. Процесс слияния осуществляется с помощью двухпотоковой сети внимания, в которой временные вложения каждой модальности пропускаются через 3D CNN и двунаправленные ГРУ. Мультимодальные потоки данных выравниваются с помощью модулей внимания с несколькими головками (MHAM) с масштабированным вниманием к точечному продукту для достижения интермодальных зависимостей. Затем вложения объединяются для решения проблем размерной сложности и отправляются на полностью подключенный слой Softmax для классификации.

В мультимодальных сетях термоядерного синтеза модуль самовнимания используется для моделирования временной и пространственной зависимости в пределах одного мода, в то время как модуль слияния перекрестного внимания используется для установления ассоциации и информационного взаимодействия между различными модами. Поэтому и то, и другое очень важно. Модуль самовнимания фиксирует внутренние зависимости входной последовательности, вычисляя связь между запросом Q, ключом K и значением V. Вычисление Q, ключа K и величины V показано в уравнении (1). Где figure-protocol-1 находятся матрицы запросов, ключей и значений соответственно; dk — ключевая векторная размерность, а dk — размерность векторов значений. Размерный коэффициент dk используется для того, чтобы избежать увеличения скалярных произведений, которые могли бы повлиять на стабильность градиентов во время обучения.

figure-protocol-2(1)

В уравнении (1) figure-protocol-3 представлены входные признаки, где n — длина входной последовательности, dmodel — размерность признаков, а WQ, WK и WV представляют три набора обучаемых матриц проекции. С помощью этих матричных сопоставлений входные признаки преобразуются в запросы, ключи и значения. Скалярное произведение запроса Q и ключ K используются для вычисления весов внимания и их масштабирования, как показано в уравнении (2).

figure-protocol-4(2)

В уравнении (2) dk представляет размерность запроса Q и ключа K, а softmax обозначает функцию softmax, используемую для получения матрицы весов внимания. Масштабирование может эффективно предотвратить проблему слишком малого градиента из-за чрезмерных значений скалярного произведения, вызванных размерностью. Матрица весов внимания применяется к значению V для получения выходного значения Z модуля собственного внимания, как показано в уравнении (3).

figure-protocol-5(3)

В уравнении (3) ij означает вес внимания i-го вектора запроса на j-м ключевом векторе. Специфическая структура модуля слияния перекрестного внимания показана на рисунке 2.

Как показано на рисунке 2, этот модуль в основном начинает обработку входных функций из скелетных и видеомодальностей. Во-первых, последовательность скелета и видеопоследовательность отдельно подвергаются 3D-сверточным слоям для извлечения пространственно-временных особенностей, а затем эти пространственно-временные особенности моделируются с использованием двунаправленных стробированных рекуррентных единиц (Bi-GRU) для временного моделирования. Затем особенности двух модальностей дополнительно извлекаются с помощью MHAM для извлечения корреляций внутри модальностей. Каждая модальность обеспечивает внутреннее представление характеристик с помощью механизмов запросов, ключей и значений. Затем для выходных объектов выполняется объединение, усредненное по времени, чтобы уменьшить сложность временного измерения. После объединения мультимодальные признаки статистически объединяются для вычисления среднего и стандартного отклонения каждой модальности и, наконец, для вывода распознавания действий студента и его классификации с помощью полносвязного слоя (FCL) и классификатора Softmax. Таким образом, экстракция признаков, основанная на мультимодальном слиянии данных, предложенная в исследовании, использует самовнимание и перекрестные АМ для точного захвата и моделирования пространственно-временных особенностей поведения учащихся путем объединения данных из видео и скелетных модальностей, тем самым повышая точность и полноту распознавания поведения учащихся в интеллектуальных классах.

4. Пространственно-временное распознавание поведения на основе Трансформера и внимания

Извлечение признаков на основе мультимодального слияния данных позволяет достичь предварительного улучшения полноты и точности поведения учащихся за счет объединения данных из видео и скелетных модальностей. Однако в контексте интеллектуальных классов поведение учащихся часто меняется с течением времени, и одно и то же поведение может проявлять разные характеристики в разные временные точки и пространственные регионы. Полагаясь исключительно на статическую информацию, слитую из мультимодальных признаков, нельзя полностью охватить сложные пространственно-временные динамические отношения в поведенческой последовательности22,23. Поэтому дальнейшие исследования предлагают пространственно-временное моделирование поведения и аддитивное производство на основе Transformer. В качестве сетевой архитектуры был выбран Vision Transformer (ViT), который может моделировать глобальную пространственно-временную информацию, поступающую через собственное AM, и обладает более сильной способностью захватывать пространственно-временные зависимости. После мультимодального слияния слитые объекты снова представляются с помощью визуального трансформатора (ViT) для прогнозирования пространственно-временного поведения. Карты признаков во входных данных разбиваются на непересекающиеся 16 × 16 патчей, линейно встраиваются в одномерные векторы и позиционно кодируются для сохранения пространственного порядка. Структура ViT состоит из 12 блоков трансформера, состоящих из многоголовочных слоев самовнимания (8 головок) и слоев прямой связи, скрытый размер которых составляет 768. Для повышения поведенческой значимости предлагаются модули «Пространственное внимание» (СА) и «Временное внимание» (ТА). Модуль SA повышает релевантность функций в пространственных областях с помощью активации Tanh, в то время как модуль TA выделяет важные временные кадры с помощью активации ReLU. Эти два потока внимания впоследствии объединяются с основной структурой ViT с помощью двухступенчатого метода обучения, так что модель учится эффективно фиксировать динамическую эволюцию поведения в классе. Структура ViT показана на рисунке 3.

На рисунке 3 в ViT исходным входом является изображение, которое сегментировано на несколько небольших блоков фиксированного размера, каждый из которых представлен как часть изображения, и линейно сплющен в одномерный вектор. Поскольку Трансформер не может воспринимать информацию о местоположении, каждый маленький блок встраивается в информацию о местоположении перед вводом в Трансформер, чтобы гарантировать, что он может зафиксировать отношение относительного пространственного положения между различными маленькими блоками. Основным модулем ViT является энкодер Transformer, который состоит из нескольких многоуровневых блоков кодирования Transformer. Блоки кодирования состоят из MHAM и нейронной сети с прямой связью. MHAM фиксирует зависимости между входными последовательностями параллельно, в то время как нейронная сеть с прямой связью выполняет нелинейные преобразования результатов, чтобы повысить способность модели захватывать и выражать глобальную информацию. После того как трансформер обрабатывает все мелкие фрагменты информации, вывод последнего слоя кодирования передается на многослойную перцептронную головку (MLP Head), которая выводит окончательные результаты распознавания и классификации действий учащегося.

На практике каждый кадр разбивается на неперекрывающиеся 16 × 16 патчей, сплющиваются и позиционно встраиваются для поддержания пространственных отношений. Встраивание патчей последовательно обрабатывается многоуровневыми трансформаторными энкодерами в архитектуре ViT. Модуль пространственного внимания (SA) использует активацию tanh для изменения внимания по областям интереса в каждом кадре, а модуль временного внимания (TA) использует ReLU для выделения важных во времени кадров. Этот механизм двойного внимания позволяет эффективно моделировать динамику поведения пространства и времени.

Для дальнейшего повышения производительности ViT в сложных поведенческих последовательностях введены пространственное внимание (SA) и временное внимание (TA), которые позволяют ViT не только автономно выбирать важные пространственные суставы, но и фокусироваться на поведении в различных временных точках, лучше улавливая пространственно-временные динамические изменения поведения. Модули SA и TA показаны на рисунке 4.

На рисунке 4A модуль SA обрабатывает информацию о пространственных размерностях входных данных, передавая особенности текущего кадра в слой ViT для извлечения скрытых состояний. Они сочетаются с особенностями предыдущей рамы и совместно подаются в FCL. FCL выполнит линейное преобразование признаков для создания скрытых представлений признаков. Затем он передается в функцию активации Таня для отображения выходного сигнала в диапазоне [-1,1], повышая нелинейность и лучше различая важные и неважные признаки. Наконец, признаки нормализуются с помощью слоя нормализации, чтобы гарантировать, что выходные объекты имеют относительно стабильный масштаб. На рисунке 4B модуль TA больше фокусируется на ключевой информации, содержащейся в каждом кадре во временном измерении. В отличие от Tanh в SA, модуль TA использует функцию активации ReLU для подавления отрицательных значений и сохраняет только выходные данные положительных значений, эффективно удаляя негативную информацию о шуме и улучшая способность модели к временному захвату.

5. Метод совместной тренировки

Для эффективного решения проблемы смещения и избыточности пространственно-временных особенностей, вызванных взаимным влиянием модуля ViT, SA и модуля TA в пространственно-временном распознавании поведения на основе Трансформера и внимания, для оптимизации трех модулей используется метод совместного обучения. Конкретный процесс обозначен на рисунке 5.

На рисунке 5 стратегия совместного обучения сначала вводит параметры обучения модели, задает структуру сети и гиперпараметры. Впоследствии проводится отдельное предварительное обучение по СА и ТА для лучшего изучения местных особенностей. Стоит отметить, что во время предварительного обучения одной модели, веса другой модели остаются фиксированными и не обновляются. После прохождения индивидуальной предварительной тренировки слой ViT объединяется для тренировки. Затем будут зафиксированы две модели внимания, а основная сеть ViT будет обучена отдельно. Наконец, путем совместного обучения основной сети ViT, модулей SA и TA, общая сеть оптимизируется для создания окончательной модели интеллектуального распознавания поведения в классе. Процедура обучения проводится поэтапно: (1) автономное предварительное обучение модулей SA и TA с замороженными параметрами ViT, (2) поэтапное обучение ViT с замороженными весами модулей внимания и (3) сквозная тонкая настройка всех компонентов совместно с оптимизатором Adam (скорость обучения = 0,001, размер партии = 64, эпохи = 100). Такой подход стабилизирует обучение признакам и уменьшает интерференцию между модулями во время оптимизации.

В целом, предлагаемый интеллектуальный метод распознавания поведения в классе сочетает в себе видео и скелетные модальности для моделирования пространственно-временных отношений через самовнимание и перекрестные АМ. Используя возможности глобального пространственно-временного моделирования ViT и комбинируя пространственные модули и модули TA, модель оптимизируется для захвата ключевых моделей поведения и временной динамики, обеспечивая более полное и точное распознавание поведения учащихся. В рассматриваемой архитектуре выполняются критические операции слияния, при которых объединяются мультимодальные представления признаков. В частности, пространственные особенности, полученные CNN, связаны с темпоральными особенностями Bi-LSTM. Затем эти выходные данные объединяются с функциями MHAM, дополненными вниманием, перед задачей классификации. Эти операции слияния имеют решающее значение для слияния взаимодополняющих представлений поведенческих данных и подчеркнуты на рисунках 1 и 5.

Алгоритм 1 иллюстрирует объединенные мультимодальные данные, скелетную, текстовую и видеоинформацию с использованием моделей на основе ViT, BERT и GCN для извлечения информативных признаков в классе. Затем совместное представление маркируется для идентификации поведения учащихся с более высокой точностью с использованием кросс-модального обучения.

Алгоритм 1: Процесс мультимодального распознавания поведения с использованием ViT, BERT и GCN.

Инициализировать:

Предварительно обученная модель BERT

Предварительно обученная модель Faster R-CNN

Предварительно обученная модель ViT

Модель GCN для данных скелета

Классификатор (например, MLP или трансформатор)

Загрузить набор данных:

Для каждой выборки в мультимодальном наборе данных:

Извлечение видеокадров

Извлечение расшифровки аудио

Извлечение данных скелета (OpenPose или MediaPipe)

Шаг 1: Обработка видеомодальностей

Для каждого кадра в видео:

Применение Faster R-CNN для обнаружения объектов/участников

Применение Vision Transformer (ViT) для извлечения функций на уровне кадра

Агрегирование объектов во времени для временного представления

Шаг 2: Обработка текстовой модальности

Текст расшифровки предварительного процесса:

Токенизация с помощью токенизатора BERT

Передача токенов через модель BERT

Извлечение контекстных внедрений из токена [CLS] или пула среднего значения

Шаг 3: Обработка скелетной модальности

Для каждой последовательности скелетов:

Нормализовать координаты

Пройдите через GCN или ST-GCN для извлечения движущихся объектов

Шаг 4: Слияние функций

Конкатенат или внимание-слияние:

Особенности видео

Особенности текста

Особенности скелета

Получите единое мультимодальное представление

Шаг 5: Классификация

Передача объединенного представления в итоговый классификатор

Прогнозирование поведения в классе (например, внимательность, отвлечение)

Шаг 6: Оценка

Сравнивайте прогнозы с наземными достоверными данными

Вычислительные метрики: точность, точность, отзыв, оценка F1

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Для оценки эффективности и превосходства метода распознавания поведения в классе с помощью Трансформера и АД были проведены экспериментальные проверки и анализ производительности. Во-первых, были настроены экспериментальная среда и параметры, как показано в таблице 1.

Основываясь на таблице 1, в качестве экспериментальных наборов данных были выбраны наборы данных EduSense Dataset и SBU Kinect Interaction Dataset, названные D1 и D2 соответственно. D1 собирал да...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предложен метод распознавания поведения интеллектуальных классов на основе Transformer и AM для решения задач сложного поведения учащихся и мультимодального распознавания данных. Сеть ViT с возможностями глобального пространственно-временного моделирования была построена путем интеграции данных из видео и скелетных модальностей, а самовнимание и перекрестные АМ были использованы для захвата пространственно-временных особенностей поведения. Путем интеграции видео- и аудиоданных в новую пл...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Никакой.

ВКЛАД АВТОРА:
Лю Лэй: Отвечает за концепцию и дизайн исследования; предложил метод мультимодального слияния данных на основе трансформатора для интеллектуального распознавания поведения в классе. Руководил разработкой модели и дизайна эксперимента, руководил сбором и обработкой данных, а также подготовил первоначальный проект рукописи. Участвовал в анализе и обсуждении экспериментальных результатов.

Хэ Чжихуа: Обеспечивал общее руководство и контроль за исследованием; внес вклад в разработку исследовательской базы и методологического обеспечения. Участвовал в оптимизации модели и экспериментальном анализе, рецензировал и дорабатывал рукопись, обеспечивал соответствие этическим нормам и давал окончательное одобрение к представлению. Отвечает за корреспонденцию.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
128 ГБ оперативной памяти DDR4 Несколькопоставщиковhttps://www.crucial.com/memory/ddr4Достаточная память для мультимодальной обработки данных
2 ТБ SSD-хранилищаНесколько поставщиковhttps://www.samsung.com/ssdДля хранения наборов данных и моделей
BERT (базовая конфигурация)Hugging Facehttps://huggingface.co/bert-base-uncasedЯзыковая модель для встраивания скелетных последовательностей
CUDA 11.1 ToolkitNVIDIAhttps://developer.nvidia.com/cuda-toolkitОбеспечивает ускорение GPU для библиотеки PyTorch
cuDNN 8.0 БиблиотекаNVIDIAhttps://developer.nvidia.com/cudnnGPU-ускорение для глубоких нейронных сетей
EduSense DatasetУниверситет Карнеги-Меллонаhttps://www.cs.cmu.edu/~./edusenseНабор данных
из реальной университетской аудиторииБолее быстрый R-CNN (ResNet-50)Открытыйисходный код (PyTorch)https://github.com/facebookresearch/detectron2Детектор объектов, используемый для извлечения видеофункций
Intel Xeon E5-2680 v4 ПроцессорIntelhttps://www.intel.com/products/xeon-e5-2680-v4Высокопроизводительный процессор для обучения моделей
MatplotlibOpen Sourcehttps://matplotlib.orgИспользуется для построения графиков показателей
Графический процессор NVIDIA Tesla V100NVIDIAhttps://www.nvidia.com/en-us/data-center/tesla-v100Используется для обучения и вывода; поддерживает распознавание поведения в реальном времени
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeИзвлекает 2D-скелетные ключевые точки из видеокадров
PyTorch 1.8 FrameworkOpen Sourcehttps://www.pytorch.orgБиблиотека глубокого обучения, используемая для разработка модели
SBU Kinect Interaction DatasetУниверситет Стоуни-Брукhttps://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectСкелетный набор данных на основе взаимодействия
TensorBoardOpen Source (Google)https://www.tensorflow.org/tensorboardИспользуется для обучения визуализации
Ubuntu 20.04 LTS Операционная система Canonicalhttps://www.ubuntu.com/downloadОС Linux, используемая в качестве среды разработки
Vision Transformer (ViT)Google / Hugging Facehttps://huggingface.co/google/vit-base-patch16-224Используется для глобального пространственно-временного моделирования поведения
производительности

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Видео скоро будет доступно

Похожие статьи