本研究提出了一种基于 Transformer 的人工智能系统,用于识别医学与护理教育中的课堂行为。该系统利用多模态数据评估学习者的参与度和情绪状态。结果表明,与传统模型相比,该系统具有更高的准确率,可实现即时反馈,从而提升教学质量并加强对学生心理健康的支撑。
本研究提出了一种基于 Transformer 的人工智能系统,用于识别医学与护理教育中的课堂行为。该系统利用多模态数据评估学习者的参与度和情绪状态。结果表明,与传统模型相比,该系统具有更高的准确率,可实现即时反馈,从而提升教学质量并加强对学生心理健康的支撑。
本研究介绍了一种基于Transformer的人工智能系统,专为课堂行为识别而设计,旨在提升医学与护理教育中的教学质量评估及心理健康监测水平。该模型利用多模态数据,包括视频、音频和骨骼运动,评估学生参与度的关键指标,如注意力持续时间、互动频率以及情绪波动。通过结合新型多模态融合策略与时空注意力机制,该系统能够更精确且稳健地捕捉复杂的课堂行为。在EduSense和SBU Kinect数据集上的实验结果表明,所提出的方法在准确率和误报率方面均显著优于传统模型。此外,消融实验验证了空间与时间注意力模块对系统识别能力的贡献。该框架支持实时反馈与可视化行为映射,在体验式学习环境中具有实际应用价值。该方法为课堂行为监测提供了一种可扩展且自适应的解决方案,并有助于医学教育中的早期干预策略实施。
由于学业和临床压力,护理与医学专业学生面临的心理健康挑战日益增加,将人工智能融入课堂教学环境不仅可实现教学质量监控,还能提供实时的心理支持。本研究将行为识别技术应用于医学教育中,以支持体验式学习并促进学生的身心健康1。智能课堂是指一种新型高质量教育模式,通过应用信息技术、人工智能、大数据和物联网等前沿技术,整合智能化与个性化的教学过程,辅助教学管理与课堂互动2,3,4。目前,随着摄像头和传感器等技术的发展,课堂中采集的行为数据不仅包括视频,还涵盖语音和音频等多模态数据5。然而,如何处理这些复杂的时空信息与数据,并从中准确提取有价值的行为特征,是当前智能课堂行为识别领域面临的主要挑战6,7。现有的行为识别方法主要依赖于单一模态数据源的特征提取,例如课堂视频流或连续图像序列8。尽管这些方法能够检测粗粒度的行为事件,但往往难以建模学生手势、表情或互动频率等在理解学习者专注度与心理状态方面至关重要的时空动态变化9。此外,当前模型缺乏融合音频线索与骨骼....
访问受限。请登录或开始试用以查看此内容。
本研究使用公开可用的数据集,其中不包含任何个人身份信息。研究中使用的所有数据均已匿名化处理,以确保参与者的隐私。在数据收集时已获得所有参与者的知情同意,且本研究遵循伦理准则。该方案阐述了智能课堂行为识别方法,该方法包括基于多模态数据融合的特征提取,以及基于Transformer和注意力机制的空间-时间行为识别。通过联合训练对整个方法的性能进行优化。
1. 多模态数据采集
多模态数据采集涉及从两个数据集同步采集课堂行为数据:EduSense 数据集和 SBU Kinect 交互数据集。EduSense 记录了真实大学课堂的视频,而 SBU Kinect 记录了基于交互的骨骼序列。这些数据集包含视频流、音频线索以及用于建模学生姿态和动作的三维骨骼关节信息。数据预处理确保了时间对齐并去除了噪声,以实现数据清洗。这种融合实现了端到端的行为监测,能够在多种学习情境下记录视觉手势和身体运动。
2. 基于多模态数据融合的特征提取
针对智能教室中学生行为识别的问题,提出了一种基于 Transformer 和 AM 的智能课堂行为识别方法。由于教室场景具有学生数量多、环境复杂的特点,场景内各种因素的变化可能干扰学生行为的识别。此外,单一特征提取存在信息不完整、易受环境干....
访问受限。请登录或开始试用以查看此内容。
为了评估采用Transformer和AM的改进型智能课堂行为识别方法的有效性与优越性,进行了实验性能验证与分析。首先,配置了实验环境和参数,如表1所示。
根据表1,本研究选取EduSense数据集和SBU Kinect交互数据集作为实验数据集,分别命名为D1和D2。D1采集了大学课堂中学生和教师的行为,而D2用于行为交互识别。然而,其数据类型和场景也可作为课堂行为识别的补充数据。该数据集按7:3的比例划分为训练集和测试集。首先,如图6所示,验证了多模态数据融合的有效性。
在图6中,为了评估所提出的行为识别模型的性能,采用了六个最重要的指标:A1 - 准确率(Accuracy),A2 - 宏平均F1分数(Macro F1 Score),A3 - 微平均F1分数(Micro F1 Score),A4 - 受试者工作特征曲线下面积(AUC),A5 .......
访问受限。请登录或开始试用以查看此内容。
针对学生行为复杂且多模态数据识别困难的问题,提出了一种基于 Transformer 和注意力机制(AM)的智能教室行为识别方法。通过融合视频与骨骼模态数据,构建了具有全局时空建模能力的视觉 Transformer(ViT)网络,并利用自注意力机制与交叉注意力机制(AM)捕捉行为的时空特征。进一步将视频与音频数据整合至新的多模态框架 Transformer(MFT)驱动的智能感知框架(ISF)中,以提升课堂行为检测效果24。该方法能够克服静态、单模态方法的局限性,实现对学生参与度的实时洞察。然而,当前的完整课堂动态分析尚未包含对教师行为的综合分析。传统研究提出一种改进的基于 YOLOv11 的课堂行为检测模型 YOLO-ASR25,该模型结合了冗余通道抑制与对象空间注意力机制(RCSOSA)、空间到深度卷积(SPDConv)以及自适应细粒度通道注意力机制(AFGCAttention)。尽管该方法提高了检测精度,但其显著缺陷在于仅关注学生行为,未纳入教师活动分析,因而无法实现全面评估。
在实.......
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
无。
作者贡献:
Liu Lei:负责研究的构思与设计;提出了基于Transformer的多模态数据融合方法,用于智能课堂行为识别。主导模型开发与实验设计,管理数据采集与处理,并起草了初稿论文。参与了实验结果的分析与讨论。
He Zhihua:为本研究提供了总体指导与监督;参与研究框架构建及方法学支持。参与了模型优化与实验分析,审阅并修改了稿件,确保研究符合伦理标准,并对投稿进行了最终批准。负责通讯事宜。
....访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 128 GB DDR4 内存 | 多个供应商 | https://www.crucial.com/memory/ddr4 | 适用于多模态数据处理的充足内存 |
| 2 TB 固态硬盘存储 | 多个供应商 | https://www.samsung.com/ssd | 用于存储数据集和模型 |
| BERT(基础配置) | Hugging Face | https://huggingface.co/bert-base-uncased | 用于骨骼序列嵌入的语言模型 |
| CUDA 11.1 工具包 | NVIDIA | https://developer.nvidia.com/cuda-toolkit | 为 PyTorch 提供 GPU 加速支持 |
| cuDNN 8.0 库 | NVIDIA | https://developer.nvidia.com/cudnn | 用于深度神经网络的 GPU 加速库 |
| EduSense 数据集 | 卡内基梅隆大学 | https://www.cs.cmu.edu/~./edusense | 真实大学课堂场景数据集 |
| Faster R-CNN(ResNet-50) | 开源(PyTorch) | https://github.com/facebookresearch/detectron2 | 用于视频特征提取的目标检测器 |
| Intel Xeon E5-2680 v4 CPU | Intel | https://www.intel.com/products/xeon-e5-2680-v4 | 用于模型训练的高性能处理器 |
| Matplotlib | 开源 | https://matplotlib.org | 用于绘制性能指标图表 |
| NVIDIA Tesla V100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/tesla-v100 | 用于训练与推理;支持实时行为识别 |
| OpenPose | CMU | https://github.com/CMU-Perceptual-Computing-Lab/openpose | 从视频帧中提取 2D 骨骼关键点 |
| PyTorch 1.8 框架 | 开源 | https://www.pytorch.org | 用于模型开发的深度学习库 |
| SBU Kinect 交互数据集 | 石溪大学 | https://www3.cs.stonybrook.edu/~kyunghan/sbu_kinect | 基于交互行为的骨骼数据集 |
| TensorBoard | 开源(Google) | https://www.tensorflow.org/tensorboard | 用于训练过程的可视化 |
| Ubuntu 20.04 LTS 操作系统 | Canonical | https://www.ubuntu.com/download | 作为开发环境使用的 Linux 操作系统 |
| Vision Transformer(ViT) | Google / Hugging Face | https://huggingface.co/google/vit-base-patch16-224 | 用于全局时空行为建模 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可