需要JoVE订阅才能观看此内容。 请登录或开始免费试用

研究文章

基于深度学习的视频目标检测在大学课堂行为参与度评估中的应用

244 次观看

DOI:

10.3791/69299

2026年3月17日

本文内容

摘要

本研究通过使用深度学习算法检测大学课堂视频中学生的行为,评估其行为参与度。研究识别出七种与学习参与度正相关的行为,并采用评分模型评估单个学生及整个班级的整体参与水平。

摘要

本研究旨在利用基于深度学习的视频目标检测技术,评估大学生在课堂中的学习投入情况。为此,研究首先通过相关性分析,确定了七种与学习投入高度正相关的课堂行为,作为衡量学生学习投入的指标;随后,采集了来自山东科技大学(SDUST)6个班级共30段真实课堂教学的同步视频,并将其划分为训练集和测试集。在对训练数据中的七类行为进行人工标注后,采用监督学习方式训练机器学习算法。模型训练完成后,对剩余未标注数据生成初步标注结果。为实现更准确、高效的课堂行为识别,本研究选取了两种具有代表性的算法——Faster R-CNN 和 YOLOv5s,开展行为检测实验。通过对比两者在检测精度和时间成本方面的表现,最终选定 YOLOv5s 用于本研究的课堂行为检测。最后,研究采用焦点小组法为每种行为赋分,构建了一个三级学习投入评分模型。基于自动获取的行为数据,该模型可实现对个体及班级层面学习投入的实时、自动化评估。

引言

学习投入指学生在学习过程中的参与度、专注度和努力程度,包括行为投入、情感投入和认知投入1。学生的学习投入情况反映了其学习状态,有助于教师调整教学策略2。然而,课堂学习投入主要依赖学生的自我报告和教师的观察进行评估3。中国高校师生比较高,教师采用传统人工方法进行学习投入评估需要耗费大量时间和精力。

近年来,随着中国智能录播教室的日益普及,基于课堂视频自动测量学习投入度成为可能4。从智能技术增强课堂教学的视角出发,本研究应用深度学习方法检测高校课堂视频中学生的行为,并提出一种用于自动测量学生行为投入度的评分模型。

关于行为参与研究的简要综述
行为参与主要包括三个层次:(1)在学校层面,指学生参与课外活动的积极性5;(2)在课堂层面,包括学生在课堂中的积极行为,如遵守课堂秩序,以及破坏性行为,如逃课或课堂讲话6;(3)在学习过程层面,指学生在学习任务中的参与情况和具体行为,例如提问和完成作业7。目前,评估行为参与的方法大致可分为三类:人工方法、半自动方法和自动方法8

人工方法包括自我报告、访谈、教师观察及其他传统评估方法,这些方法耗时耗力,且难以保证客观性和准确性。日志分析是一种典型的半自动评估方法,主要分析从学习平台收集的学生学习日志数据,包括登录频率、在线时长和答题正确率等指标。该方法能够更客观地评估学生的学习投入程度;然而,数据量大且复杂,给后续处理带来挑战4。自动方法基于计算机视觉技术,利用录播平台等智能设备捕捉学生在课堂上的表情、手势、行为等视觉线索,主要用于评估课堂行为。与前两种方法相比,该方法可通过计算机和算法快速测量行为投入度,且受主观干扰较小9

基于目标检测的行为参与度评估简述
随着深度学习的发展,目标检测技术 increasingly 被应用于学习参与度分析。目标检测算法基于卷积神经网络,在图像中实现目标分类与定位。在配备视频录制系统的智慧教室中,此类算法可从课堂视频中识别与学生姿态、手势及面部表情相关的视觉信息,从而实现对学生行为的自动识别及其行为参与度的评估。因此,学生通过非言语行为所反映的课堂学习状态可得到有效解读9

已有多种设备和算法被用于从视频中采集并识别学生的多种非语言行为。Rahman 等人10 以及 Zaletelj 和 Košir11 使用 Kinect 传感器采集学生的视线方向、面部信息、身体姿态特征等,并利用机器学习算法分析学生的注意力水平。Whitehill 等人8 使用 iPad 摄像头记录学生的面部表情,用于训练识别模型,证明机器学习技术在学习投入度评估准确性方面可达到与人工观察相当的水平。Sukumaran 和 Manoharan12 利用脑电图(EGG)信号检测学生的学习投入状态。Ashwin 和 Guddeti13 在实验室环境中使用卷积神经网络分析课堂视频,以识别面部表情、手势姿态和身体姿态等非语言行为,从而评估学习投入情况。Bai 等人14 采用具有多路特征融合的 Faster R-CNN,通过迁移学习实现对“学习”“睡觉”“低头”等课堂行为的检测。Deng 等人9 结合 Faster R-CNN 深度学习技术分析远程课堂视频,提出一种基于学生头部、手部和身体姿态的行为识别与课堂投入度测量方法。

早期的研究主要在实验室环境中进行,其中许多研究集中于单一情境下的单一个体10,11,12,13,而近年来的研究则越来越多地关注真实的课堂环境9,14,15,16,17,18,19。此外,所考察的行为范围也日益多样化。例如,Bai 等人14 和 Ouyang 等人15 分析了课堂视频,仅识别出两种行为——抬头和低头。Deng 等人9 研究了小学课堂视频,将检测的行为类别从头部动作扩展到手部和身体动作。Zhang 及其同事16 收集了五类学生行为,包括抬头看、低头看、睡觉、东张西望和打哈欠。

然而,由于数据采集自小学课堂环境,而小学生通常以固定位置就座,可观测到的行为范围相对有限。因此,后续研究逐渐转向大学课堂。许多大学课堂规模较大,通常有约一百名学生随机就座,使得学生行为的检测更加困难。此外,在真实的大学课堂环境中,学生表现出更丰富的行为多样性和互动性,包括与教师、同学、黑板以及教材之间的互动。Yan 等人17提出了一种基于深度学习的姿势识别方法 BetaPose,旨在提升在拥挤课堂场景下的姿势识别准确率。Tan 等人18将坐标注意力(CA)模块引入 YOLOv9 网络,所构建的 CA-YOLOv9 模型被应用于大规模学生群体的复杂大学课堂环境中七类课堂行为的识别。Wang 等人19提出了一种双向特征增强网络(BATNet),用于识别智能教室中的学生行为,尤其适用于小尺寸和被遮挡的目标。

通过所开发的算法,行为检测的速度和准确性已得到显著提升;然而,当前的研究忽略了对检测到的课堂行为与学生参与度之间是否存在相关性的解释,导致某些行为是否可作为衡量行为参与度的参数,以及哪些行为能够有效反映学习参与度等问题尚未得到解答。此外,仍需探索一种能够明确呈现学生行为参与度的方法。因此,本研究通过相关性分析,识别出与学生学习参与度高度相关的课堂行为;同时,构建了一套评分系统,以建立行为参与度的评价模型。由此,可实现对单个学生以及整个班级学生行为参与度的自动测量。

访问受限。请登录或开始试用以查看此内容。

方案

所有视频的获取和使用均符合山东科技大学规定的人类研究现行伦理规范。数据使用已获得批准。

首先,通过相关性分析来识别可作为行为参与度指标的学生行为。在通过帧提取建立数据集并将其划分为训练集和测试集后,在训练集上运行了两种具有代表性的目标检测算法,并在准确性和效率方面进行了比较。最后,选择性能更优的算法(YOLO-v5s)在测试集上运行以执行行为检测。图1展示了学生行为识别与检测流程的流程图。

机器学习示意图;目标检测、相关性分析、训练/测试视频数据集。
图1。学生行为识别与检测的流程图。 请点击此处查看此图的放大版本。

指标的确定
在开展目标检测实验之前,需要先确定能够反映学生行为投入的非言语行为。迄今为止,基于目标检测的行为投入研究已在检测多种非言语行为方面取得成功,包括视线方向、面部信息和身体姿态9,10,11,12,13,14。然而,特定行为是否可作为学生行为投入的有效指标,目前尚未得到充分讨论。因此,本研究通过分析学生行为与其行为投入水平之间的相关性,来识别能够表征行为投入的行为指标。

(1)行为投入测试
本研究从山东科技大学济南校区四个自然班的非英语专业本科生中选取122名学生作为相关性研究的样本。首先,采用自陈量表法收集这122名学生的行为投入数据,旨在从个体内部体验的视角了解其行为投入状况。由于本研究的课堂视频数据来源于“学术英语”课程,因此采用了任庆梅开发的大学英语课堂学习投入多维评价工具20。该工具专为中国的外语教学环境设计,并与本研究采用相同的学习投入经典分类方式,包含行为投入、情感投入和认知投入三个维度。其中,行为投入量表包含九个题项,分别对应师生互动(例如:“在英语课上,我积极回答教师提出的问题”)、个体努力(例如:“在英语课学习过程中遇到困难时,我会认真思考解决方法”)、同伴互动(例如:“我会与其他同学合作完成英语课的学习任务”)等方面。每个题项采用李克特五点计分法,选项为“几乎从不、很少、有时、经常、总是”,分别计1至5分,要求学生选择最符合自身学习体验的选项。得分在15分及以下的学生被归类为低投入学生,得分为16–30分的学生为中等投入学生,得分为31–45分的学生为高投入学生。最终共回收120份有效量表,其中低投入学生17人,中等投入学生45人,高投入学生58人。

(2)行为识别
同时,收集了这四个班级“学术英语”课程中全程出勤的四段录像视频,共计50分钟。每隔15秒截取一帧画面,最终共提取出200张图像用于观察。通过对视频样本进行多次反复观看,三名学生初步识别出课堂中学生的12类行为,分别为:东张西望、使用手机、讨论交流、走神、走动、饮食、记笔记或阅读、认真听讲、站立(回答问题)、打哈欠、睡觉和使用电脑。这12种行为的示例见图2

显示学生参与讨论、阅读等各种活动的课堂活动示意图。
图 2。12 种行为的示例。 请点击此处查看此图的放大版本。

每种类型均附有视觉特征和时空背景的详细描述,构成了课堂行为标注的标准操作规程,从而确保了标注过程中概念的一致性。表1展示了学生行为的12个类别及各类行为的描述。

环顾四周包括明显地向左、向右和向后转头。如果学生转头并且张开嘴,则认为其正在讨论。在课堂情境中,认真听讲表现为直接注视黑板或注视站在前方的教师;当视线转向其他地方时,学生极有可能处于走神状态。当学生呈现低头姿势,并且面前有书本或笔记本等物体时,该行为可被识别为记笔记或阅读书籍。当行为表现为站立姿势,学生在座位上站立且张嘴时,被视为正在站立回答问题;如果学生离开座位,则被视为在走动,这可能表明学生上课迟到或正在离开教室等。当学生将头伏在课桌上时,被判定为睡觉。当学生手中持有食物或饮料时,该行为被识别为进食或饮水。张大嘴巴或身体伸展的姿态表明学生正在打哈欠。

行为类别行为描述
环顾四周头部明显向右、向左或向后转动
使用手机用手触碰手机
讨论张嘴,并伴有头部动作
走神目光呆滞地看向无关的地方
走动离开座位移动
进食或饮水张嘴并与食物或水接触
记笔记或阅读正在记笔记或低头看书
认真听讲注视黑板或教师
起立(回答问题)在座位上站起来且张嘴
打哈欠张嘴或身体伸展
睡觉头靠在桌面上
使用电脑桌面上有打开的电脑

表1:学生行为的类别及描述。

(3)相关性分析
根据上述标准,邀请了12名经验丰富的教师观看120名学生的视频,并记录其行为类型及出现频率。行为类型的判定依据为表1。教师被分为四组,每组三人,每组负责记录30名学生的行为,且每名教师独立完成对30名学生行为的记录。克朗巴赫α系数(Cronbach's Alpha,简称α)是衡量量表或问卷内部一致性的指标,其取值范围为0至1,通常认为α ≥ 0.8表示具有良好的内部一致性21。若三位教师对某一特定行为频率的记录具有高度一致性(α > 0.8,即高度一致),则该行为的频率取三位教师记录值的平均数。随后,基于一方面为每名学生各类行为的出现频率,另一方面为其行为参与水平的数据,对这两个因素进行了相关性分析。结果见表2

行为行为参与度
进食或饮水皮尔逊相关系数.319**
显著性(双尾)0.004
N120
打哈欠皮尔逊相关系数-.335**
显著性(双尾)0
N120
讨论皮尔逊相关系数.546**
显著性(双尾)0
N120
走动皮尔逊相关系数-.774**
显著性(双尾)0
N120
徘徊皮尔逊相关系数.293**
显著性(双尾)0.008
N120
环顾四周皮尔逊相关系数-.834**
显著性(双尾)0
N120
阅读或记笔记皮尔逊相关系数.912**
显著性(双尾)0
N120
认真倾听皮尔逊相关系数.881**
显著性(双尾)0
N120
起立皮尔逊相关系数.330**
(回答问题)显著性(双尾)0
N120
睡觉皮尔逊相关系数-.411**
显著性(双尾)0
N120
使用皮尔逊相关系数.591**
手机显著性(双尾)0
N120
使用计算机皮尔逊相关系数.362**
显著性(双尾)0.001
N120

表2:相关性分析结果。

在相关性分析中,r 是相关系数,表示两个变量之间的线性相关程度,取值范围为 −1 到 1。根据相关程度的不同,相关性可分为以下类型:
强相关(│r│ ≥ 0.70)
中等相关(0.40 ≤ │r│ ≤ 0.70)
弱相关(│r│ ≤ 0.40)

根据关系的方向,可将其分为以下类型:
正相关(r > 0)
负相关(r < 0)
无相关性(r = 0)

表1可以看出,七种行为与行为参与度具有高或中等相关性,包括环顾四周(r = −0.834**, p < 0.05)、使用手机(r = 0.591**, p < 0.05)、讨论(r = 0.546, p < 0.05)、走动(r = −0.774**, p < 0.05)、记笔记或阅读(r = 0.912**, p < 0.05)、认真听讲(r = −0.881**, p < 0.05)以及睡觉(r = −0.411**, p < 0.05);而进食或饮水(r = 0.319**, p = 0.04)、起立(回答问题)(r = 0.330**, p = 0.00)、打哈欠(r = −0.335**, p < 0.05)、游荡(r = 0.293, p > 0.05)以及使用电脑(r = 0.362, p < 0.05)等行为与行为参与度的相关性较低或无显著相关性。根据相关性分析,本研究最终确定七种行为作为学习参与度的指标,即环顾四周、使用手机、讨论、走动、记笔记或阅读、认真听讲和睡觉。

数据集的建立
本研究使用的视频数据来自山东科技大学(SDUST)的直接录播平台,该平台提供了“学术英语”课程真实课堂教学的同步视频。共收集了四个非英语专业班级的10段视频,每段视频时长约50分钟,用于建立学生课堂行为的可训练数据集。每隔15秒抽取一帧图像,最终提取出2,000张分辨率为1,920 × 1,080的图像。

数据集划分
实验将学生行为数据集划分为两个完全独立的部分:训练集和测试集,如表3所示,两者之间无共享图像。该数据集涵盖了全部七种学生行为。训练集用于模型参数的训练,测试集用于准确率的评估。训练参数设置如表4所示。

数据集图像数量
总计2830
训练集2111
测试集719

表3:学生行为数据集的划分。

参数数值
学习率0.01
动量0.937
权重衰减0.0005
训练轮数100
批量大小16

表4:实验参数的设置。

为防止因同一学生出现在不同子集中导致的数据泄露,并保持行为的自然时间连续性,采用了“分层时间分割”方法。

受试者分离: 数据集按唯一的学生 ID 进行划分,确保训练集、验证集和测试集中的学生互不重叠。

时间划分:视频按时间顺序进行排序。前70%的时间段用于训练,接下来的15%用于验证,最后的15%用于测试。与随机划分相比,该方法更能模拟现实世界中的时间泛化能力。

类别平衡: 对于“睡觉”和“使用手机”等样本较少的类别,在训练集中进行了适度的过采样,以确保模型能够学习到所有类别的特征。

训练数据集的标注
采用一款开源标注工具对训练数据进行人工标注,该工具用于边界框标注。具体工作流程如下:(1)以固定速率(1帧/秒)从涵盖不同学校、时间段和课程类型的监控视频中提取关键帧,并进行面部模糊等匿名化处理;(2)根据标注标准操作流程(SOP),标注人员使用矩形框精确框选出执行特定行为的学生,并赋予相应的类别标签;(3)将标注结果以PASCAL VOC格式导出为XML文件。

为确保标注质量,特别是避免在区分模糊行为(例如讨论与闲逛)时出现错误,采用了一种“三阶段标注-仲裁”协作机制:

初始标注:每个关键帧均由三位经过培训的标注人员独立标注。每个标签包含一个类别标签和一个边界框。

一致性验证: 计算了标注之间交并比(Intersection-over-Union)和类别一致性。边界框若初始标注结果的交并比(IoU)> 0.8 且类别标签相同,则视为“一致标注”;交并比(IoU)≤ 0.8 或类别标签不同的边界框则视为“不一致标注”。

专家仲裁:对于不一致的标注(例如“四处张望”与“讨论”等模糊情况),由具有教学经验的专家小组根据视频片段、行为背景及教学领域的先验知识做出最终判断。最终判定通过检视关键帧对应的原始视频片段,验证标签的准确性后确定。

标注结果显示,学生的行为特征表现为多个、密集且微小的目标,如图3所示。

教室物体检测示意图;识别正在使用的手机、四处张望的人员、数据分析。
图3。教室图像标注示例。 请点击此处查看此图的放大版本。

课堂上的学生表现出认真听讲、使用手机、频繁阅读或记笔记等行为,而走动、徘徊等行为的频率相对较低。图4 展示了训练数据集中课堂行为的分布情况。

学生行为频率条形图;活动:使用手机、记笔记、听讲。
图 4。训练数据集中行为的分布情况。 请点击此处查看此图的放大版本。

学生行为检测
基于深度学习的目标检测框架主要分为两类22:以 Faster R-CNN 系列为代表的两阶段方法,以及以 YOLO 为代表的一阶段方法。对于第一类,两阶段检测方法首先通过区域建议网络(Region Proposal Network, RPN)生成候选区域,然后进行详细的类别概率计算和边界框回归。对于第二类,一阶段方法通过在单个阶段内同时预测目标类别和边界框,简化了检测流程。尽管两阶段方法在该领域发展早期率先出现,但由于结构更简洁且计算效率更高,一阶段方法近年来逐渐受到青睐。为了实现更准确、高效的课堂行为识别,本研究从这两类方法中分别选取代表性算法——Faster R-CNN23,24 和 YOLO-v525,26,开展课堂行为检测实验,并对两种算法的检测结果进行比较,最终确定本研究中用于行为检测的算法。

为了高效评估实验结果,研究重点放在各算法模型的整体检测精度与时间成本的权衡上。采用平均精度均值(mAP)和训练时间(h)来衡量这两个模型。

通过两种方法检测了七类行为以进行识别,并在表5中记录了平均检测精度值(AP)。其中,YOLO-v5s在三类行为的检测上优于Faster R-CNN,分别为绕行、专心听课和使用手机,其AP值分别为100%、62.7%和31.8%。

网络模型讨论中走动认真倾听环顾四周睡觉记笔记或阅读使用手机
Faster R-CNN32.699.545.49.32252.626.8
YOLO-v5s17.810062.73.8195131.8

表5:两种算法在单个类别上的平均精确率。

两种经典检测网络在测试集上以 IoU 为 0.5 时的训练时间与平均检测精度如表6所示。尽管 Faster R-CNN 网络具有更高的精度,但其运行时间相对较长。相比之下,YOLO-v5s 的运行时间缩短了 30%,而精度仅下降 0.3%,在效率方面表现出更显著的提升。鉴于本研究需要实现对课堂中学生行为的实时检测,期望网络的训练时间尽可能短。综合考虑在训练集上训练模型的检测精度与时间成本,本文认为 YOLO-v5s 更适用于课堂学生行为检测。

网络模型hmAP@0.5 (%)
Faster R-CNN2.8841.17
YOLO-v5s2.01640.87

表6:检测性能比较。

因此,本研究选择 YOLO-v5s 来执行课堂行为检测。YOLO-v5s 生成的检测结果如图5所示,展示了连续的多目标行为检测及其对应的标签。

课堂活动检测;多张标注图像;学生使用手机、讨论、阅读。
图 5.测试集检测结果示例。 请点击此处查看此图的放大版本。

(1) 数据增强与预处理
为了提高模型的鲁棒性和泛化能力,在训练过程中采用了综合性的数据增强策略,包括随机仿射变换、颜色抖动和随机遮挡。所有图像均被统一调整为 640 × 640 像素。

(2)训练策略
训练过程分为三个阶段:
骨干网络冻结阶段(第1-100个epoch):冻结骨干网络,仅训练检测头,采用较低学习率进行预热。
全网络微调阶段(第101-250个epoch):解冻所有网络层,使用余弦退火调度器调整学习率。
精细化阶段(第251-300个epoch):应用指数移动平均以稳定训练过程,并降低数据增强的强度,以实现模型的精细化优化。

为解决类别不平衡问题,将与训练集中各类别频率成反比的类别特异性权重应用于损失函数。

(3) 后处理与时间优化
为保持课堂行为的时间一致性,在模型推理后应用了时间一致性滤波。具体而言,对于视频序列中检测到的目标,其行为类别必须在至少连续三帧中被识别,方可确认,从而有效滤除瞬时的假阳性结果。

行为参与度评分方法的建立
本研究采用焦点小组法对每种行为进行评分。邀请了20位一线高校教师根据其课堂管理经验,对七类行为的参与程度进行评分。所有20位教师均有超过10年的教学经验,并讲授过多门不同学科的课程。参与度评分范围为0至3分,其中0–1分表示低度参与,1–2分表示中度参与,2–3分表示高度参与。若多位评分者对某一类行为的评分具有高度一致性(α > 0.8),则通过计算各位教师评分的平均值来确定该行为的参与度。各类行为的最终评分见表7

行为类型环顾四周使用手机讨论走来走去记笔记或阅读认真听讲睡觉
参与度评分0.91.21.90.62.72.80.2

表7:行为评分。

每位学生行为参与度的计算公式为

静力平衡方程 Σ7Sf/Σ7f,物理学中平衡分析的公式,数学概念。

ESi = 学生的行为参与度,Sj = 行为得分,fj = 行为 j 的发生频率。

假设某学生在课堂上被观测到的行为总次数为100次,其中包括4次“讨论”、68次“专注听讲”、25次“阅读/记笔记”和3次“环顾四周”,则该学生的总体个人参与得分为(1.9 × 4 + 2.8 × 68 + 2.7 × 25 + 0.9 × 3)/ 100 = 2.68。以整节授课为基准,行为参与度根据0-3分量表的等距划分分为四个等级:得分低于0.75定义为“未参与”,0.76-1.5为“轻微参与”,1.6-2.25为“参与”,2.26-3为“高度参与”;因此,该学生在本节课中被评定为“高度参与”。

全班的行为参与度是指所有学生的平均得分。班级行为参与度的计算公式为:

静力平衡方程,公式 \(Ec=\frac{\Sigma_{i=1}^{n}Es}{n}\),用于教学。

Ec = 班级的行为投入,ES = 特定学生的行为投入,n = 学生人数

访问受限。请登录或开始试用以查看此内容。

结果

通过检测行为并利用评分模型,实现了对学生行为参与度的自动测量。以视频中的一堂课为例,可根据行为检测结果和评分模型,计算出每位学生实时的行为参与度。图6 展示了该课堂中两名学生的行为参与度,呈现了他们在不同时间点的参与水平。结果显示,在整节课中,学生A的平均参与度高于学生B。两名学生在课程初期(前15分钟)均表现出较高的参与度,但在课程后半段,其参与度均有所下降。

行为参与度图;学生A和B在50分钟内的时间与参与度指数。
图6.两名学生的行为参与度。

访问受限。请登录或开始试用以查看此内容。

讨论

本研究实现了对学生行为参与度的自动识别与测量。与以往研究相比,所识别的行为更能代表大学课堂中的实际情况(例如使用手机),且行为参与度的评估以图表形式呈现,直观易懂。这种自动测量方法使教师能够高效、清晰地评估单个学生以及整个班级的参与情况,从而支持个性化教学并提升课堂教学效率。例如,在图7中可以看出,两个班级在课程开始时均成功引入内容,有效吸引了学生的注意力。A班出现了多个中等和高参与度的峰值,表明师生互动有效且教学策略具有吸引力。相比之下,B班在课程后半段未出现高参与度峰值,参与度评分降至1.5以下,提示教师需重新考虑教学活动与教学策略的设计。

在基于目标检测的学生行为识别方法研究过程中,遇到了若干主要挑战。在数据标注阶段,困难主要体现在行为定义的模糊性以及标注一致性的确保上。尽管采用了“三阶段标注-仲裁”协同机制进行标注,但学生在课堂中的行为往往是连续且渐进的,难以在视频帧中精确界定其起止边界。例如,“讨论”行为可能包含完整的“环顾四周”过程,从而导致不同标注人员之间产生解释上的差异。同时,行为发生过程中的遮挡(如被前排...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无任何利益冲突。

致谢

本研究由山东省社会科学规划基金项目(23CRWJ11)资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
课堂视频本研究所使用的视频数据来自山东科技大学(SDUST)的直录播平台,为《学术英语》课程真实课堂教学的同步录像。共采集了6个非英语专业班级的30段视频,每段约50分钟,用于构建可训练的学生’课堂行为数据集。
IBM SPSS Statistics 26IBMSPSS for Windows 是一个集成数据录入、组织与分析功能的模块化软件包。其基本功能包括数据管理、统计分析、图表分析、输出管理等。本文主要使用 SPSS 进行一致性分析和相关性分析。
Labeling 1.8.6Labeling 是一种可视化图像标注工具,采用 Python 编写,并使用 Qt 构建图形界面。标注结果以 XML 文件格式保存,支持 ImageNet 所采用的 PASCAL VOC 格式,同时亦支持 YOLO 格式。该工具用于为 Faster R-CNN、YOLO 和 SSD 等目标检测网络所需的数据集标注图像中的目标对象。
MMDetection 2.22.0MMDetection 2.22.0 是一个目标检测工具箱,包含丰富的目标检测、实例分割和全景分割方法,以及相关组件与模块。

参考文献

  1. Fredricks, J. A., Blumenfeld, P. C., Paris, A. H. School engagement: potential of the concept, state of the evidence. Rev Educ Res. 74 (1), 59-109 (2004).
  2. Xu, J. F., Qiu, Y. J. Development and validation of an online English learning engagement scale for college students. Foreign Lang Their Teach. 42 (1), 39-50 (2025).
  3. Xing, C. B., Xu, M. B. Higher education expansion, teacher–student ratio and education quality. Econ Educ Rev. 8 (1), 59-88 (2023).
  4. Li, X., Li, Y. Y., Bao, H. G., Cheng, L. New developments in learning engagement evaluation: from one-dimensional analysis to multimodal fusion. Res Audiovis Educ. 42 (10), 100-107 (2021).
  5. Finn, J. D., Pannozzo, G. M., Voelkl, K. E. Disruptive and inattentive-withdrawn behavior and achievement among fourth graders. Elem Sch J. 95 (5), 421-434 (1995).
  6. Finn, J. D., Rock, D. A. Academic success among students at risk for school failure. J Appl Psychol. 82 (2), 221-234 (1997).
  7. Skinner, E. A., Belmont, M. J. Motivation in the classroom: reciprocal effects of teacher behavior and student engagement across the school year. J Educ Psychol. 85 (4), 571-581 (1993).
  8. Whitehill, J., Serpell, Z., Lin, Y. C., Foster, A., Movellan, J. R. The faces of engagement: automatic recognition of student engagement from facial expressions. IEEE Trans Affect Comput. 5 (1), 86-98 (2014).
  9. Deng, W., Xia, L. J., Liu, Q. T., Zhang, S., Wei, Y. T. Analysis of distance classroom learning engagement based on video recognition. J Contin High Educ. 35 (6), 15-24 (2022).
  10. Designing an empirical framework to measure the level of interest of humans. Rahman, M., et al. Proc Int Conf Electr Inf Commun Technol (EICT), , 581-585 (2015).
  11. Zaletelj, J., Košir, A. Predicting students’ attention in the classroom from Kinect facial and body features. EURASIP J Image Video Process. 2017 (1), 80-82 (2017).
  12. Sukumaran, A., Manoharan, A. Student engagement recognition: comprehensive analysis through EEG and verification by image traits using deep learning techniques. IEEE Access. 13 (1), 11639-11662 (2025).
  13. Unobtrusive students’ engagement analysis in computer science laboratories using deep learning techniques. Ashwin, T. S., Guddeti, R. M. R. Proc IEEE Int Conf Adv Learn Technol (ICALT), , 436-440 (2018).
  14. Bai, J., et al. Detection of students’ classroom performance based on Faster R-CNN and transfer learning with multi-channel feature fusion. J Guangxi Norm Univ Nat Sci Ed. 38 (5), 1-11 (2020).
  15. Ouyang, W. X., Fan, W. S., Chen, L. W. Classroom head-up and head-down behavior recognition based on YOLOv5. Comput Knowl Technol. 19 (29), 9-12 (2023).
  16. Classroom behavior recognition and detection based on deep learning. Zhang, J. P., Zhang, Z. Y., Guan, L. T., Hu, H. M. Proc Int Conf Comput Vis Image Deep Learn (CVIDL), , 430-433 (2024).
  17. Yan, X. Y., Kuang, Y. X., Bai, G. R., Li, Y. Student classroom behavior recognition based on deep learning. Comput Eng. 49 (7), 251-258 (2023).
  18. Tan, S. Y., Wang, Z. X., He, G. D. Real-time panoramic multi-scale classroom behavior recognition based on the CA-YOLOv9 network. Mod Educ Technol. 34 (7), 123-130 (2024).
  19. Wang, S. B., Lin, Z. J., Huang, J., Ju, J. H. A real-time network-based method for analyzing student classroom behavior. J Zhejiang Univ Sci Technol. 37 (3), 259-269 (2025).
  20. Ren, Q. M. Formulation and verification of a multidimensional evaluation scale for student engagement in college English classrooms. Shandong Foreign Lang Teach. 43 (4), 58-66 (2022).
  21. Cronbach, L. J. Coefficient alpha and the internal structure of tests. Psychometrika. 16 (3), 297-334 (1951).
  22. Zhou, J. Y., Zhao, Y. M. Application of convolutional neural networks in image classification and object detection. Comput Eng Appl. 53 (13), 34-41 (2017).
  23. Fast R-CNN. Girshick, R. Proc IEEE Int Conf Comput Vis, , 91-99 (2015).
  24. Ren, S. P., He, K. M., Girshick, R., Sun, J. Faster R-CNN: toward real-time object detection with region proposal networks. Adv Neural Inf Process Syst (NeurIPS). 29, 91-99 (2016).
  25. Multiple object tracking based on YOLOv5 and an optimized DeepSORT algorithm. Bai, T. J Phys Conf Ser, 2547 (1), 012001(2023).
  26. Wang, Y. P., Chi, Z. Z., Liu, M., Li, G., Ding, S. High-performance lightweight fall detection using an improved YOLOv5s algorithm. Machines. 11 (8), 818(2023).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Faster R CNN YOLOv5s