本研究提出了一种基于 Transformer 的人工智能系统,用于识别医学与护理教育中的课堂行为。该系统利用多模态数据评估学习者的参与度和情绪状态。结果表明,与传统模型相比,该系统具有更高的准确率,可实现即时反馈,从而提升教学质量并加强对学生心理健康的支撑。
研究文章
本研究提出了一种基于 Transformer 的人工智能系统,用于识别医学与护理教育中的课堂行为。该系统利用多模态数据评估学习者的参与度和情绪状态。结果表明,与传统模型相比,该系统具有更高的准确率,可实现即时反馈,从而提升教学质量并加强对学生心理健康的支撑。
本研究介绍了一种基于Transformer的人工智能系统,专为课堂行为识别而设计,旨在提升医学与护理教育中的教学质量评估及心理健康监测水平。该模型利用多模态数据,包括视频、音频和骨骼运动,评估学生参与度的关键指标,如注意力持续时间、互动频率以及情绪波动。通过结合新型多模态融合策略与时空注意力机制,该系统能够更精确且稳健地捕捉复杂的课堂行为。在EduSense和SBU Kinect数据集上的实验结果表明,所提出的方法在准确率和误报率方面均显著优于传统模型。此外,消融实验验证了空间与时间注意力模块对系统识别能力的贡献。该框架支持实时反馈与可视化行为映射,在体验式学习环境中具有实际应用价值。该方法为课堂行为监测提供了一种可扩展且自适应的解决方案,并有助于医学教育中的早期干预策略实施。
由于学业和临床压力,护理与医学专业学生面临的心理健康挑战日益增加,将人工智能融入课堂教学环境不仅可实现教学质量监控,还能提供实时的心理支持。本研究将行为识别技术应用于医学教育中,以支持体验式学习并促进学生的身心健康1。智能课堂是指一种新型高质量教育模式,通过应用信息技术、人工智能、大数据和物联网等前沿技术,整合智能化与个性化的教学过程,辅助教学管理与课堂互动2,3,4。目前,随着摄像头和传感器等技术的发展,课堂中采集的行为数据不仅包括视频,还涵盖语音和音频等多模态数据5。然而,如何处理这些复杂的时空信息与数据,并从中准确提取有价值的行为特征,是当前智能课堂行为识别领域面临的主要挑战6,7。现有的行为识别方法主要依赖于单一模态数据源的特征提取,例如课堂视频流或连续图像序列8。尽管这些方法能够检测粗粒度的行为事件,但往往难以建模学生手势、表情或互动频率等在理解学习者专注度与心理状态方面至关重要的时空动态变化9。此外,当前模型缺乏融合音频线索与骨骼运动等异构数据源的稳健机制,限制了其对情绪状态或注意力分散行为的敏感性10。为克服上述局限,本研究提出一种基于Transformer并结合时空注意力机制的课堂行为识别系统。通过利用Transformer在建模长距离依赖关系方面的优势,并结合多模态特征融合策略,该系统旨在提升行为分类的精确度,同时实现学习投入度与情绪指标的实时可视化。最终目标是为医学教育中的动态教学质量评估和嵌入式心理健康反馈提供可扩展、自适应的解决方案,以监测并提升教学效能与学习者福祉。
该评估提出了一种基于 Transformer 的新型行为识别系统,该系统结合了时空注意力机制与多模态数据融合(视频与骨骼输入),专为医学与护理教育中的智慧课堂观察而设计。与现有模型相比,该新模型能够实现对学生注意力状态与情绪状态的精确、实时检测,这对于教学质量和心理健康的评估均具有重要价值。
相关研究
智能教室是一种利用现代信息技术来增强教学互动、个性化学习和教学管理的新型教学环境。它能够采用智能化的教学方法,提高教学效率与质量,同时为学生提供更丰富且个性化的学习体验。因此,全球众多学者对智能技术与课堂教学的结合开展了研究。Radosavljevic 等人提出了一种基于环境智能的智能教室模型,该模型通过分析学生的日常学业活动数据评估其疲劳程度,并调整学习策略以优化学习效果11。Tai T. Y 研究了智能个人助手在提升外语口语能力方面的作用,发现使用 Google Assistant 显著提高了非母语学习者的口语能力,在交流中表现出与母语使用者相似的效果12。Chen 等人通过研究发现,将聊天机器人作为教学工具可快速响应学生需求,增强课堂互动性,展现出智能技术在课堂教学中的应用潜力13。另有研究提出了一种基于智能教学模式的课堂教学效果评价方法,该方法结合布谷鸟搜索算法与极限学习机,提高了评价的准确性14。
智能教室中的行为识别是实现个性化教学和优化课堂管理的关键技术。它能够实时监测学生的行为状态,并提供有效的反馈。通过行为识别,教师可以准确了解学生的参与度和注意力集中情况,从而提升教学效果并辅助教学决策。在此背景下,全球学者针对智能教室行为识别开展了广泛研究。有研究提出了一种基于人工智能的实时视觉监控系统,利用机器学习训练学生行为识别模型,帮助教师更好地监控学生参与度和课堂互动情况,进而优化教学质量15。Chonggao P 通过结合聚类分析与随机森林算法以及人体骨骼模型,在远程教学中实现了学生行为的实时识别,提高了课堂行为分析的准确性16。Wu S 开发了一种结合粒子群优化算法与K近邻算法的学生行为识别模型,提升了情绪识别的准确率,以满足课堂教学的实际需求17。Ramakrishnan 等人提出的 ACORN 系统利用多模态机器学习,结合卷积神经网络对音频、面部表情和图像数据进行分析,再通过时间卷积网络融合这些特征,实现了对课堂氛围的自动评估,并取得了初步进展18。
综上所述,现有研究已提出多种基于机器学习和深度学习的智能课堂行为识别技术,涵盖学生疲劳检测、情感分析以及课堂互动监测等领域。然而,当前研究仍存在一些不足,许多方法在实际应用中缺乏足够的实时性和可扩展性,难以适应复杂多变的课堂场景。因此,本研究提出了一种结合 Transformer 与注意力机制(AM)的智能课堂行为识别方法。该研究的创新之处在于,利用 Transformer 强大的时间建模能力,结合时空注意力机制(AM),精确捕捉课堂中的关键行为时刻和区域,并通过多模态数据融合整合视频、音频等多种信息源,从而提升行为识别的全面性与准确性。
访问受限。请登录或开始试用以查看此内容。
本研究使用公开可用的数据集,其中不包含任何个人身份信息。研究中使用的所有数据均已匿名化处理,以确保参与者的隐私。在数据收集时已获得所有参与者的知情同意,且本研究遵循伦理准则。该方案阐述了智能课堂行为识别方法,该方法包括基于多模态数据融合的特征提取,以及基于Transformer和注意力机制的空间-时间行为识别。通过联合训练对整个方法的性能进行优化。
1. 多模态数据采集
多模态数据采集涉及从两个数据集同步采集课堂行为数据:EduSense 数据集和 SBU Kinect 交互数据集。EduSense 记录了真实大学课堂的视频,而 SBU Kinect 记录了基于交互的骨骼序列。这些数据集包含视频流、音频线索以及用于建模学生姿态和动作的三维骨骼关节信息。数据预处理确保了时间对齐并去除了噪声,以实现数据清洗。这种融合实现了端到端的行为监测,能够在多种学习情境下记录视觉手势和身体运动。
2. 基于多模态数据融合的特征提取
针对智能教室中学生行为识别的问题,提出了一种基于 Transformer 和 AM 的智能课堂行为识别方法。由于教室场景具有学生数量多、环境复杂的特点,场景内各种因素的变化可能干扰学生行为的识别。此外,单一特征提取存在信息不完整、易受环境干扰以及难以捕捉复杂行为等局限性19,20。因此,本研究首先提出了一种基于多模态数据融合的学生课堂特征提取方法。该方法融合视频模态与骨骼模态的数据,利用二者之间的互补性,实现对学生行为更全面、更准确的特征提取。具体而言,将每段输入的视频序列按帧划分,帧图像输入预训练的 Faster R-CNN 模型以定位人体感兴趣区域。检测到的区域被送入卷积神经网络主干以提取时序视觉特征。对于骨骼模态,将 3D 关节位置作为序列进行建模,并使用预训练的 BERT 模型进行编码,以获取时空依赖关系。这些特征在归一化和嵌入处理后输入至多模态融合网络。其中,视频模态主要负责捕捉学生的动作、表情等视觉特征,而骨骼模态则通过关节点信息精确描述学生的姿态变化。视频模态依赖于视觉感知的全局特征,而骨骼模态聚焦于关节位置的动态变化,导致两者之间存在显著的语义差异21。因此,有必要设计专门的多模态融合网络,以有效建模两种模态之间的关联性。多模态融合网络结构如图1所示。
在图1中,该网络主要分为三个模块。其中,视频模态处理模块的输入为视频序列,通过基于区域的快速卷积神经网络(Faster R-CNN)进行特征提取。视频模态的处理首先将课堂视频片段转换为逐帧输入以进行特征提取。帧数据采用基于 ResNet-50 架构并在 ImageNet 上预训练的区域自适应快速卷积神经网络(Faster R-CNN)进行处理。网络处理被调整为 224 × 224 像素的 RGB 帧,生成包含学生行为空间和对象特异性特征的高级视觉特征图。这些特征随后输入至一个自注意力模块,该模块通过 Transformer 层在编码为时空嵌入表示之前学习帧间的时间关系。via 此过程可在嵌入表示中保留微弱的行为信号,例如头部倾斜或举手动作,以便后续融合。提取的视频特征由自注意力模块捕获,以捕捉视频模态内部的时间和空间关系,再进一步通过 Transformer 建模,生成视频序列时空信息的嵌入向量。骨骼模态处理模块的输入为骨骼序列,通过基于 Transformer 的双向编码器表示(BERT)提取骨骼关节点的时间和空间特征。对于骨骼数据,每位学生的姿态通过基于 OpenPose 的姿态估计器从课堂视频中提取为一系列二维关节点坐标。这些序列被转换为嵌入标记,其中每个标记对应一个包含 18 个关键点的帧。这些关节点序列的时间上下文和依赖关系由基于 Transformer 的双向编码器表示(BERT)模型建模。该模型采用 12 层 Transformer 结构、8 个注意力头以及 768 的隐藏层维度,即标准的 BERT-base 架构。模型在训练过程中进行微调,以获取特定行为的关节点模式。输出的嵌入向量表示学生行为的结构和运动相关特征,随后与视频模态特征进行融合。随后,骨骼特征进一步通过 3D CNN 和池化操作聚合为空间和时间特征,生成骨骼模态的特征表示——即骨骼的嵌入向量。
3. 交叉注意力融合模块
在交叉注意力融合模块中,该研究采用多头注意力机制(MHAM)构建视频模态与骨骼模态之间的交互关系,并通过对生成的多模态融合特征进一步进行3D卷积神经网络(CNN)和池化操作,提取更为紧凑的融合特征。融合过程通过双流注意力网络实现,其中每种模态的时间嵌入特征分别经过3D CNN和双向门控循环单元(GRU)处理。多模态数据流通过多头注意力模块(MHAM)进行对齐,利用缩放点积注意力获取模态间的依赖关系。随后,嵌入特征通过池化操作降低维度复杂度,并送入全连接的Softmax层进行分类。
在多模态融合网络中,自注意力模块用于建模单一模态内部的时间和空间依赖关系,而交叉注意力融合模块则用于建立不同模态之间的关联与信息交互。因此,二者均至关重要。自注意力模块通过计算查询Q、键K和值V之间的关系来捕捉输入序列的内部依赖性。Q、键K和值V的计算如公式(1)所示。其中
分别为查询、键和值矩阵;dk为键向量的维度,且dk也为值向量的维度。引入维度因子dk的目的是为了避免点积结果过大,从而影响训练过程中梯度的稳定性。
(1)
在公式(1)中,
表示输入特征,其中 n 为输入序列的长度,dmodel 为特征的维度,而 WQ、WK 和 WV 表示三组可学习的投影矩阵。通过这些矩阵映射,输入特征被转换为查询(queries)、键(keys)和值(values)。查询 Q 与键 K 的点积用于计算注意力权重并对其进行缩放,如公式(2)所示。
(2)
在公式(2)中,dk 表示查询 Q 和键 K 的维度,softmax 表示用于获得注意力权重矩阵的 softmax 函数。缩放操作能有效防止因维度导致的点积值过大,从而避免梯度过小的问题。注意力权重矩阵作用于值 V,以得到自注意力模块的输出 Z,如公式(3)所示。
(3)
在公式(3)中,aij 表示第 i 个查询向量对第 j 个键向量的注意力权重。交叉注意力融合模块的具体结构如图2所示。
由图2可知,该模块主要开始处理来自骨骼和视频模态的输入特征。首先,骨骼序列和视频序列分别经过3D卷积层以提取时空特征,随后利用双向门控循环单元(Bi-GRUs)对这些时空特征进行时间建模。接着,通过多头注意力模块(MHAMs)进一步提取两种模态的特征,以捕获模态内部的相关性。每种模态通过查询(queries)、键(keys)和值(values)机制在内部实现特征表示。然后,对输出特征进行时间维度上的平均池化,以降低时间维度的复杂度。池化后,对多模态特征进行统计池化,计算每种模态的均值和标准差,最后通过全连接层(FCL)和Softmax分类器输出学生的动作识别与分类结果。因此,本研究提出的基于多模态数据融合的特征提取方法,通过融合视频与骨骼模态的数据,利用自注意力机制和交叉注意力机制(cross AMs),精确捕捉并建模学生行为的时空特征,从而提升智能教室中学生行为识别的准确性与全面性。
基于 Transformer 与注意力机制的时空行为识别
基于多模态数据融合的特征提取通过融合视频与骨骼模态数据,初步提升了学生行为分析的全面性与准确性。然而,在智能教室场景中,学生行为往往随时间动态变化,同一行为在不同时间点和空间区域可能表现出不同特征。仅依赖多模态特征融合所得的静态信息,难以充分捕捉行为序列中复杂的时空动态关系。22,23因此,进一步的研究提出了一种基于 Transformer 的时空行为建模与注意力机制(AM)。该研究选用视觉 Transformer(Vision Transformer, ViT)作为网络架构,该架构可通过自注意力机制(self-AM)建模输入的全局时空信息,并具有更强的捕捉时空依赖关系的能力。在完成多模态融合后,融合后的特征再次利用视觉 Transformer(ViT)进行时空行为预测。输入中的特征图被分割为互不重叠的 16 × 16 图像块,线性嵌入为一维向量,并通过位置编码保留空间顺序。ViT 结构包含 12 个 Transformer 编码器模块,每个模块由多头自注意力机制(8 个头)和前馈网络层组成,其中隐藏层维度为 768。为增强行为显著性,提出了空间注意力(Spatial Attention, SA)和时间注意力(Temporal Attention, TA)模块。SA 模块促进空间区域内的特征相关性 通过 Tanh 激活,而 TA 模块突出重要时间帧 通过 ReLU 激活。这两个注意力流随后与 ViT 主干网络相结合 通过 一种两阶段训练方法,使模型能够高效地学习捕捉课堂行为的动态演变过程。ViT 的结构如图所示 图3.
在图3中,ViT的原始输入是一幅图像,该图像被分割成多个固定大小的小块,每一块代表图像的一部分,并被线性展平为一维向量。由于Transformer无法感知位置信息,每个小块在输入Transformer之前都会嵌入位置信息,以确保模型能够捕捉不同小块之间的相对空间位置关系。ViT的核心模块是Transformer编码器,它由多个堆叠的Transformer编码块组成。每个编码块包含一个多头注意力机制(MHAM)和一个前馈神经网络。多头注意力机制并行地捕捉输入序列之间的依赖关系,而前馈神经网络则对结果进行非线性变换,以增强模型捕捉和表达全局信息的能力。在Transformer编码器处理完所有小块信息后,最后一个编码层的输出被送入多层感知机头部(MLP Head),由其输出最终的学生动作识别与分类结果。
实际操作中,将每一帧图像分割为互不重叠的 16 × 16 图像块,展平后按顺序进行位置嵌入,以保持空间关系。这些图像块嵌入由 ViT 架构中的堆叠式 Transformer 编码器按序处理。空间注意力(SA)模块利用 tanh 激活函数,调节每一帧中不同感兴趣区域的注意力;时间注意力(TA)模块则利用 ReLU 函数突出显示在时间上具有重要意义的帧。这种双注意力机制能够有效建模空间与时间行为动态。
为了进一步提升ViT在复杂行为序列中的性能,引入了空间注意力(SA)和时间注意力(TA),使ViT不仅能够自主选择重要的空间关节点,还能关注不同时刻的行为,从而更好地捕捉行为的时空动态变化。SA模块和TA模块如图4所示。
在图4A中,SA模块通过将当前帧的特征输入ViT层以提取隐藏状态,从而处理输入的空间维度信息。这些隐藏状态与前一帧的特征相结合后共同输入FCL。FCL将对特征执行线性变换,生成潜在特征表示。随后,该表示被送入Tanh激活函数,将其输出映射到[-1,1]范围内,以增强非线性特性,并更好地区分重要与非重要特征。最后,特征通过归一化层进行标准化,以确保输出特征具有相对稳定的尺度。在图4B中,TA模块更关注时间维度上各帧所包含的关键信息。与SA中使用的Tanh函数不同,TA模块采用ReLU激活函数来抑制负值,仅保留正值的输出,从而有效去除负向噪声信息,增强模型对时间信息的捕捉能力。
5. 联合训练方法
为了有效解决基于Transformer和注意力机制的时空行为识别中,ViT、SA模块与TA模块之间相互影响所导致的时空特征偏差和冗余问题,采用了一种联合训练方法对这三个模块进行优化。具体流程如图5所示。
在图5中,联合训练策略首先输入模型训练参数,设定网络结构和超参数。随后,对SA和TA分别进行独立的预训练,以更好地学习局部特征。值得注意的是,在对一个模型进行预训练时,另一个模型的权重保持固定,不进行更新。完成各自的预训练后,将ViT层合并进行训练。接着,两个注意力模型将被固定,主ViT网络将单独进行训练。最后,通过联合训练主ViT网络、SA和TA模块,对整体网络进行优化,生成用于智能课堂行为识别的最终模型。训练过程分步进行:(1)在ViT参数冻结的情况下对SA和TA模块进行自主预训练;(2)在注意力模块权重冻结的情况下逐步训练ViT;(3)使用Adam优化器对所有组件进行端到端的微调(学习率 = 0.001,批量大小 = 64,训练轮数 = 100)。该方法稳定了特征学习过程,并减少了优化过程中各模块之间的干扰。
总体而言,所提出的智能课堂行为识别方法结合了视频和骨骼模态,通过自注意力机制和交叉注意力机制(AMs)对时空关系进行建模。该方法利用视觉Transformer(ViT)的全局时空建模能力,并融合空间模块与时间注意力(TA)模块,优化模型以捕捉关键行为和时间动态,从而实现更全面、准确的学生行为识别。在所考虑的架构中,关键的融合操作用于整合多模态特征表示。具体而言,卷积神经网络(CNN)学习到的空间特征与双向长短期记忆网络(Bi-LSTM)的时间特征相连接,随后该输出与多头注意力机制(MHAM)增强后的特征进行融合,再执行分类任务。这些融合操作对于整合行为数据的互补视角至关重要,并在图1和图5中予以强调。
算法1展示了结合多模态数据(包括骨骼、文本和视频信息)的方法,利用ViT、BERT和基于GCN的模型来提取某一类别中的有效特征。随后对联合表示进行标记,以识别学生行为,并通过跨模态学习实现更高的准确率。
算法1:使用ViT、BERT和GCN进行多模态行为识别的流程。
初始化:
预训练的 BERT 模型
预训练的 Faster R-CNN 模型
预训练的 ViT 模型
用于骨架数据的 GCN 模型
分类器(例如,MLP 或 Transformer)
加载数据集:
对于多模态数据集中的每个样本:
提取视频帧
提取音频转录文本
提取骨骼数据(OpenPose 或 MediaPipe)
步骤 1:视频模态处理
对于视频中的每一帧:
应用 Faster R-CNN 检测物体/参与者
应用视觉 Transformer(ViT)提取帧级特征
随时间聚合特征以实现时间表示
步骤 2:文本模态处理
预处理转录文本:
使用 BERT 分词器进行分词
将 token 输入 BERT 模型
从 [CLS] 标记提取上下文嵌入或进行平均池化
步骤 3:骨骼模态处理
针对每个骨骼序列:
标准化坐标
通过 GCN 或 ST-GCN 提取运动特征
步骤 4:特征融合
连接或注意力融合:
视频特点
文本特征
骨骼特征
获得统一的多模态表征
步骤 5:分类
将融合表示传递给最终分类器
预测课堂行为标签(例如,专注、分心)
步骤 6:评估
将预测结果与真实值进行比较
计算指标:准确率、精确率、召回率、F1 分数
访问受限。请登录或开始试用以查看此内容。
为了评估采用Transformer和AM的改进型智能课堂行为识别方法的有效性与优越性,进行了实验性能验证与分析。首先,配置了实验环境和参数,如表1所示。
根据表1,本研究选取EduSense数据集和SBU Kinect交互数据集作为实验数据集,分别命名为D1和D2。D1采集了大学课堂中学生和教师的行为,而D2用于行为交互识别。然而,其数据类型和场景也可作为课堂行为识别的补充数据。该数据集按7:3的比例划分为训练集和测试集。首先,如图6所示,验证了多模态数据融合的有效性。
在图6中,为了评估所提出的行为识别模型的性能,采用了六个最重要的指标:A1 - 准确率(Accuracy),A2 - 宏平均F1分数(Macro F1 Score),A3 - 微平均F1分数(Micro F1 Score),A4 - 受试者工作特征曲线下面积(AUC),A5 ...
访问受限。请登录或开始试用以查看此内容。
针对学生行为复杂且多模态数据识别困难的问题,提出了一种基于 Transformer 和注意力机制(AM)的智能教室行为识别方法。通过融合视频与骨骼模态数据,构建了具有全局时空建模能力的视觉 Transformer(ViT)网络,并利用自注意力机制与交叉注意力机制(AM)捕捉行为的时空特征。进一步将视频与音频数据整合至新的多模态框架 Transformer(MFT)驱动的智能感知框架(ISF)中,以提升课堂行为检测效果24。该方法能够克服静态、单模态方法的局限性,实现对学生参与度的实时洞察。然而,当前的完整课堂动态分析尚未包含对教师行为的综合分析。传统研究提出一种改进的基于 YOLOv11 的课堂行为检测模型 YOLO-ASR25,该模型结合了冗余通道抑制与对象空间注意力机制(RCSOSA)、空间到深度卷积(SPDConv)以及自适应细粒度通道注意力机制(AFGCAttention)。尽管该方法提高了检测精度,但其显著缺陷在于仅关注学生行为,未纳入教师活动分析,因而无法实现全面评估。
在实...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
无。
作者贡献:
Liu Lei:负责研究的构思与设计;提出了基于Transformer的多模态数据融合方法,用于智能课堂行为识别。主导模型开发与实验设计,管理数据采集与处理,并起草了初稿论文。参与了实验结果的分析与讨论。
He Zhihua:为本研究提供了总体指导与监督;参与研究框架构建及方法学支持。参与了模型优化与实验分析,审阅并修改了稿件,确保研究符合伦理标准,并对投稿进行了最终批准。负责通讯事宜。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 128 GB DDR4 内存 | 多个供应商 | https://www.crucial.com/memory/ddr4 | 适用于多模态数据处理的充足内存 |
| 2 TB 固态硬盘存储 | 多个供应商 | https://www.samsung.com/ssd | 用于存储数据集和模型 |
| BERT(基础配置) | Hugging Face | https://huggingface.co/bert-base-uncased | 用于骨骼序列嵌入的语言模型 |
| CUDA 11.1 工具包 | NVIDIA | https://developer.nvidia.com/cuda-toolkit | 为 PyTorch 提供 GPU 加速支持 |
| cuDNN 8.0 库 | NVIDIA | https://developer.nvidia.com/cudnn | 用于深度神经网络的 GPU 加速库 |
| EduSense 数据集 | 卡内基梅隆大学 | https://www.cs.cmu.edu/~./edusense | 真实大学课堂场景数据集 |
| Faster R-CNN(ResNet-50) | 开源(PyTorch) | https://github.com/facebookresearch/detectron2 | 用于视频特征提取的目标检测器 |
| Intel Xeon E5-2680 v4 CPU | Intel | https://www.intel.com/products/xeon-e5-2680-v4 | 用于模型训练的高性能处理器 |
| Matplotlib | 开源 | https://matplotlib.org | 用于绘制性能指标图表 |
| NVIDIA Tesla V100 GPU | NVIDIA | https://www.nvidia.com/en-us/data-center/tesla-v100 | 用于训练与推理;支持实时行为识别 |
| OpenPose | CMU | https://github.com/CMU-Perceptual-Computing-Lab/openpose | 从视频帧中提取 2D 骨骼关键点 |
| PyTorch 1.8 框架 | 开源 | https://www.pytorch.org | 用于模型开发的深度学习库 |
| SBU Kinect 交互数据集 | 石溪大学 | https://www3.cs.stonybrook.edu/~kyunghan/sbu_kinect | 基于交互行为的骨骼数据集 |
| TensorBoard | 开源(Google) | https://www.tensorflow.org/tensorboard | 用于训练过程的可视化 |
| Ubuntu 20.04 LTS 操作系统 | Canonical | https://www.ubuntu.com/download | 作为开发环境使用的 Linux 操作系统 |
| Vision Transformer(ViT) | Google / Hugging Face | https://huggingface.co/google/vit-base-patch16-224 | 用于全局时空行为建模 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可