该研究旨在为智能教育中的教学评估校准和教育公平提供一种新的方法。实验结果表明,所提模型显著优于其他比较模型,有效解决了现有校准方法中多源数据整合不良和公平性偏差的问题。
Research Article
该研究旨在为智能教育中的教学评估校准和教育公平提供一种新的方法。实验结果表明,所提模型显著优于其他比较模型,有效解决了现有校准方法中多源数据整合不良和公平性偏差的问题。
当前教学评估校准方法面临诸如多源异质评估数据处理时集成效率低、跨学科和教学场景适应性不足,以及公平性保证薄弱的结果偏差等挑战。该研究旨在构建一个可解释、可转移且可扩展的公平性-修正框架,用于深度建模和动态校正教学评估数据。这些问题使得实现智能教育中平衡教学的核心要求变得困难。本研究提出了一种以公平为导向的教育网络算法,集成了生成式对抗网络和梯度提升决策树。该算法构建了公平性校准机制,结合了双向编码器表示模型与图注意力网络,以优化特征提取和动态适应性,提升多源数据处理效率和公平性校准准确性。这种方法实现了教学评估的精确校准和公平性保障。在指标测试中,模型在聚类评估特征中达到了98.76%的准确率,公平性修正中98.05%,跨场景修正一致性的准确率为0.968。在损失值测试任务中,在教学评估纠正任务中,模型的总损失从0.1237降至0.1018。在指标测试中,模型在聚类评估特征中达到了98.76%的准确率,公平性修正中98.05%,跨场景修正一致性的准确率为0.968。实验结果表明,所提模型显著优于其他比较模型,有效解决了现有校准方法中多源数据整合不良和公平性偏差的问题。此外,它为技术开发者提供了创新的算法框架和教育管理者可靠的技术工具,以促进教学公平。研究贡献包括:(i) 整合三个核心模块,包括多源数据预处理、动态公平指数验证和可解释性可视化;以及(ii)提出基于生成对抗网络和梯度提升树协作优化的公平性修正范式,突破传统单模型修正的局限,实现偏差建模和纠正决策的解耦学习。
教学评估与校准是确保智能教育教学质量的核心。通过动态分析、错误纠正和结果校准,它们为教学改进和个性化学习提供了基础。它们的准确性和公平性直接影响智能教育是否能够突破技术偏见,提供平衡的教育支持1,2。然而,现有方法存在若干缺陷:它们依赖单一数据源,忽视实际情况,并导致数据偏误和更正偏误。缺乏动态的公平适应机制使得满足学科和情景的公平需求变得困难 3,4.此外,处理来自多个来源的异质数据时,缺乏公平性指标以及纠正策略存在偏见等问题。为此,学者们从多个维度开展了研究,例如基于改进的密集轨迹算法评估网球辅助教学5。Yin等人利用分析层级过程和模糊综合算法监控在线教学6。陈利用改进的数据挖掘算法分析老年人的教育数据以提升教学质量7.
尽管这些研究取得了进展,但校准结果偏差和公平性协调不良等问题依然存在。因此,构建一个同时提供准确教学评估校准和动态公平保障的模型已成为智能教育的研究重点。生成对抗网络(GAN)通过生成器与判别器之间的实时对抗训练,能够消除敏感属性对结果的隐性影响,确保输出由核心因素决定,而非标签诱导的偏见8。GAN在处理评估数据中的群体偏差和建模非线性公平约束方面展现了优势。Cheng等人提出了一种基于GAN的图像增强算法,用于处理低分辨率图像。生成器从低分辨率输入输出高分辨率图像,判别器将生成的图像与真实高分辨率图像区分开来。对抗训练优化参数,使生成器输出接近真实图像9.Kang 等人提出了一种跨模态GAN模型,以提升可再生能源领域的多模态数据处理效率。生成器接收单模态数据,判别器区分真实多模态数据生成的数据,对抗训练优化模型以提高效率10。梯度增强决策树(GBDT)算法是一种经典的结构化数据处理算法,具有强大的特征捕获能力。通过迭代积分多重决策树,GBDT精确学习数据错误模式,并在处理多源异构评估信息和纠正非线性分数偏差方面展现出优势(11,12)。Mizuno等人提出了基于GBDT的强降雨路径预测方法,学习路径特征并利用实时数据预测灾害路径,通过多重决策树选择最优预测。Gao等开发了基于GBDT的视觉分析方法,用于广告点击率预测,学习视觉特征与历史点击数据之间的关系,以预测新广告的点击率14。基于上述挑战,本研究旨在系统性地回答以下核心科学问题:如何构建一个智能教育评估模型,高效整合多来源异质数据,动态适应不同教学场景,同时确保校准准确性和结果公平性。为回答这一问题,本研究利用GAN的公平约束机制与GBDT的精确误差校准能力的协同效应。此外,研究还致力于引入先进技术,如自然语言处理(BERT)、强化学习(RL)、注意力机制(AM)、长短期记忆网络(LSTM)、图注意力网络(GAT)和知识蒸馏(KD),以弥补单一模型在特征提取、动态适应和推理效率方面的固有局限。最终目标是提供一个既精确又公平,并且具备强大泛化能力的教学评估校准解决方案,适用于智能教育领域。
FairEduNet算法设计与优化
该研究结合了GAN和GBDT,构建了FairEduNet算法,实现了公平性修正和准确性修正的双重目标,而非单向优化的权衡。FairEduNet采用双信道协作架构:GBDT主干信道负责结构化错误建模和精确纠正,GAN辅助信道则专注于敏感属性的解耦和动态调整公平性。FairEduNet算法架构,结合了GAN和GBDT,见 图1。

图1:结合GAN和GBDT的FairEduNet算法架构。请点击此处查看该图的更大版本。
如 图1所示,FairEduNet首先收集并预处理多源评估数据。GBDT 使用多重决策树迭代学习评估误差模式,输出初始校准结果,并传递给 GAN 模块。GAN训练判别器学习初始校准结果与敏感属性之间的关系,而生成器则动态调整校准参数。通过多轮对抗性训练和公平性验证,公平偏见得到优化。最后,公平性校准的结果反馈给GBDT模块,该模块调整准确性和公平性,输出教学评估校准基础和报告。GBDT 计算残差如方程(1)所示。
(1)
在方程(1)中,表示
第i个样本在第t次迭代中的残差,yi 代表真实值,代表
第1次迭代的预测值。GAN的对抗过程见公式(2)。
(2)
在方程(2)中, x表示初始校准结果, z表示敏感属性特征, Pdata(x) 表示非敏感特征的真实分布, Pz(z)表示敏感属性的分布, D表示判别器, G表示生成元15。GBDT 的初始校准输出如公式(3)所示。
(3)
在方程(3)中,
表示初始决策树对第i个样本的预测,K代表决策树的总数,γ k代表第k棵树的权重,h(x)i代表第k棵树对i的预测输出-第一个样本。FairEduNet算法能够为教学评估数据提供精确校准和公平性保障。然而,在处理非结构化评估数据并适应动态场景时,FairEduNet对非结构化特征的特征提取能力较弱,导致校准偏差。此外,FairEduNet的公平性指标和校准参数是静态设置的,限制了其对不同教学场景的适应性,并影响整体校准质量。BERT-RL算法结合了变换器(BERT)和强化学习(RL)的双向编码表述,能够准确地从非结构化文本中提取深度特征,并在无需手动设置静态阈值的情况下动态调整场景参数,进一步提高了算法在场景间输出的可靠性(16,17).传统方法如TF-IDF依赖词频,但缺乏深刻的语境理解,无法区分不同场景下的“公平”方向。Word2Vec 产生静态词语向量,难以适应复杂的语境变化并识别间接偏见。BERT采用多层自注意编码双向上下文,既捕捉显式有偏见术语,也捕捉隐含有偏逻辑。传统方法需要手动构建偏见词表,依赖主观体验,并涵盖有限的情境。通过预训练的模型迁移学习,BERT无需大量手动操作即可自动学习深度语义特征,从而在识别歧义偏见方面提供了更强的泛化能力。此外,传统方法在长文本中常常丢失信息,而BERT支持多达512个令牌,保持上下文关系,准确定位偏见特征,并实现细粒度的公平性修正。BERT-RL的操作过程如图2所示。

图2:BERT-RL算法操作流程图。请点击此处查看该图的更大版本。
如 图2所示,BERT-RL首先标准化非结构化文本评估数据并将其输入到BERT模型中。BERT使用Transformer编码器进行双向语义建模,提取关键特征并构建特征矩阵。特征矩阵随后被输入到强化学习模块中,通过多次迭代学习最优策略。优化后的参数配置最终被输入 FairEduNet,提升其适应性。BERT自注意特征权重的计算见方程(4)。
(4)
在方程(4)中, dk 表示向量 K 的维数。强化学习多目标奖励函数表达在方程(5)中。
(5)
在方程(5)中,ω1、ω2 和 ω3 分别表示权重系数,表示
校准误差,Dt 是公平偏差,D 是目标公平偏差,Tt 是运行时间18。本研究将BERT-RL与FairEduNet结合,形成了BERT-RL-FairEduNet算法,称为BFEN。BFEN通过GBDT特征迭代和GAN实时对抗训练实现教学评估数据的精确校准和公平性保证,而BERT-RL则优化FairEduNet处理非结构化数据和动态适应场景,解决特征提取和静态参数限制的弱点。该研究采用基于BERT的中文模型,预训练了2024-2025学年国家智慧教育平台的真实教学日志、课堂录制文本和教育政策文件语料库,词汇量为21128。模型的隐藏层维度为768,包含12个注意力头和12个层。GBDT树深度设为8,树数为200,学习率为0.1。GAN的训练周期为150发,判别器使用三层全联网网络,大小分别为512、256和1。该发电机采用4层全联网网络,大小为1024、512、256和1。LSTM中的隐藏单元数量为128个,序列长度为512个。GAT有两层和4个注意力头。知识蒸馏的温度设置为3.0。强化学习奖励权重系数为ω1 = 0.4,ω2 = 0.35,ω3 = 0.25。权重选择标准旨在平衡多目标优化的帕累托前缘均衡与教育公平实践的可解释性要求。实验采用50%数据分割,通过交叉验证和超参数调优完成。BFEN用于教学评估校准的流程如图3所示。

图3:BFEN算法用于智能教育和教学评估的修正过程。请点击此处查看该图的放大版本。
如 图3所示,BFEN首先对多源教学评估数据进行预处理。BERT通过基于语义窗口计算文本语义相似性和深度特征权重,选择重要特征构建高维语义特征矩阵,优化FairEduNet的特征提取能力。随后,强化学习设置多目标奖励函数,计算情景适应性和参数调整梯度,进一步优化公平阈值和校准参数。FairEduNet 计算评估数据与错误模式模型之间的偏差,迭代更新决策树权重,并调整校准策略,直到误差稳定在预设阈值内。最终输出包括误差校准模型和公平性验证报告。校准模型应用于教学评估数据,生成校准前后对比表,并结合智能教育公平标准库确定目标校准参数,为智能教育教学评估校准提供科学基础。该标准图书馆涵盖教育机会公平、过程公平和结果公平三个维度,并包含12个核心指标。这些指标包括各地区教育资源分配的平衡、城乡学校数字基础设施覆盖的差异、学习情境诊断延迟响应的容忍阈值(≤200毫秒)、多模态评估中缺失数据的容忍度(≤3.5%)、算法偏差检测的敏感度(性别/地区/阶段标注的AUC偏差≤0.02), 更正前后评分分布的KL发散阈值(≤0.08)、教师干预建议的可解释性评分(≥4.2/5.0)、学生档案更新的及时性(在T+1天内完成)、跨平台学分识别的一致性系数(≥0.93)、教育政策语义对齐的准确性(BERT评分≥0.86)、公平性验证报告生成的完整性(包括偏见归因, 置信区间和可重复参数快照),以及涵盖三种典型场景的动态情景适应验证通过率:直播课堂、异步作业和人工智能助教。语义特征相似度的计算见方程(6)。
(6)
在方程(6)中, fi 表示 第 i 个语义特征维度的值, gi 代表 第 i 个重要评估特征维度的值, n 表示特征维度的总数。强化环境场景适应参数的计算见方程(7)。
(7)
在方程(7)中, θt 表示第 t 次迭代的参数值, α 表示学习率,
代表基于奖励函数 R(θt) 的参数梯度。
教学评估校准模型构建
尽管BFEN在教学评估校准方面展现出一定优势,但在多源异构评估数据中仍面临低集成效率,且在实际应用中动态公平性适应不足。AM-LSTM算法结合了注意力机制(AM)和长短期记忆(LSTM),通过AM为多源评估数据的关键特征赋予权重,并利用LSTM的顺序记忆能力捕捉评估数据随时间的动态变化模式。这种方法有效提升了多源数据集成效率和动态特征学习19,20。AM-LSTM的运行过程如图4所示。

图4:AM-LSTM操作流程图。请点击此处查看该图的更大版本。
如 图4所示,AM-LSTM首先对多源异构教学评估数据进行预处理,形成标准化数据集。AM计算来自不同数据源特征的注意力权重以选择重要特征,并构建加权特征矩阵。加权特征矩阵随后被输入LSTM,LSTM利用其门控机制学习动态模式,捕捉不同阶段评估数据之间的关系,并输出动态特征向量。最后,这些动态特征矢量与公平性约束结合,生成适应多源数据集成和动态场景的中间校准结果,为后续模型优化提供基础。注意力权重的计算见方程(8)。
(8)
在方程(8)中,n 代表第 n 个特征的注意力分配,xn 代表相似性,q 代表查询向量,softmax 表示激活函数。LSTM遗忘门表达在方程(9)中。
(9)
在方程(9)中,Wf 是遗门权重,bf 是遗漏门偏置,xt 是时间 t 的输入,ht-1 是时间 t-1 的外部状态变量,σ 表示 S₿ 函数21。本研究结合AM-LSTM与BFEN构建了AM-LSTM-BFEN教学评估校准模型,称为FBFEN。在该模型中,AM-LSTM解决了BFEN在多源异构数据集成效率和动态特征提取方面的局限性。它还集成了公平约束以优化中间校准结果,使BFEN能够进一步实现教学评估数据的精确校准和动态公平性保障。FBFEN的运行过程如图5所示。

图5:FBFEN教学评估与纠正模型的运行过程。请点击此处查看该图的放大版本。
如 图5所示,FBFEN首先对原始多源教学评估数据进行预处理,并将标准化数据集输入AM-LSTM模块。AM计算特征注意力权重,而LSTM学习动态模式,输出整合多源信息和动态特征的中间校准结果。中间结果随后被输入BFEN模块。GBDT基于中间结果和预设误差模型迭代学习评估数据的误差模式,输出初步校准结果。与此同时,GAN通过生成器与判别器之间的对抗训练,动态调整校准参数以消除偏差,分析初步结果中敏感属性引起的公平性偏差。最后,GAN优化的校准参数反馈给GBDT,更新决策树权重和校准策略,生成兼顾精度与公平性的二次校准结果。数据标准化见方程(10)。
(10)
在方程(10)中,z'表示标准化值,z表示原始值,z 最小值和z 最大值表示最小值和最大值。GAN生成元的最终目标函数表示为方程(11)。
(11)
在方程(11)中, N 表示迭代次数, λ 表示损失权重因子, ωi 表示第 i 次迭代的权重因子,
代表对抗损失函数,表示
二元交叉熵损失22。
FBFEN教学评估校准模型优化
尽管FBFEN在教学评估校准中展现出强大的多源数据整合和动态公平性保证,但由于复杂模型结构在复杂教育场景中,仍面临特征相关性较弱以及训练和推理效率较低的问题。GAT-KD算法结合了图关注网络(GAT)和知识蒸馏(KD),通过GAT的注意力机制动态构建特征间的语义关联图,增强了多源数据的语义对齐。KD将复杂模型的知识压缩到一个轻量级网络中,显著提升了推理效率,同时保持模型性能23,24。GAT-KD的操作过程如图6所示。

图6:GAT-KD操作流程图。请点击此处查看该图的更大版本。
如 图6所示,GAT-KD通过GAT模块构建特征间的语义关联图,利用注意机制动态聚合邻域特征信息,并增强局部特征的语义表示。随后,KD将输出软标签作为监督信号,最大限度地减少输出分布之间的散度损失以及预测与真实标签之间的交叉熵损失,实现知识转移和模型压缩。最终输出是一个轻量级校准模型,具有高精度和高效的性能。GAT注意系数的计算见方程(12)。
(12)
在方程(12)中,
表示
节点 i和 j的特征向量, W表示可学习权重矩阵, a表示注意力权重向量,
表示连接操作, LeakyReLU表示激活函数25。KD损失函数的计算见方程(13)。
(13)
在方程(13)中, KL表示散度损失, T2表示梯度缩放平衡, p学生表示轻量模型的软标签概率, p教师 表示复模型26的软标签概率。通过结合注意力增强特征关联和轻量级知识转移,GAT-KD 有效解决了特征语义偏见和高计算复杂性问题。本研究将GAT-KD整合进FBFEN,形成了GAT-KD-FBFEN教学评估校准模型,简称GFBFEN。GAT-KD优化了FBFEN在多源特征相关捕获不完整和推理效率低下方面的不足。GFBFEN的工作过程如 图7所示。

图7:GFBFEN教学评估与纠正模型运行过程。请点击此处查看该图的更大版本。
如 图7所示,GFBFEN标准化了多来源教学评估数据。GAT 建模特征间的复杂关系,并利用注意力机制动态计算节点间的语义关联权重。KD将复杂模型的知识压缩到一个轻量级网络中,显著提升了推理效率,同时保持了精确性。AM-LSTM模块为多源特征赋予重要权重,捕捉评估数据的时间动态模式,输出整合多源信息的中间校准结果。这些结果会被输入BFEN模块进行深度处理。具体来说,BERT从非结构化文本中提取语义特征,强化学习动态优化公平阈值和校准参数,GBDT迭代学习误差模式以进行初步校准,GAN通过对抗训练消除敏感属性引起的偏见。动态参数调整机制通过实时感知教学场景的时间变化和群分布变化,自动校准每个模块的响应敏感性和公平性权重,从而解决静态参数配置导致的适应性不足问题,确保模型在不同教学阶段都能保持稳健性和公平性, 学生小组和评估场景。评估类型直接影响时间序列建模的粒度和反馈周期,而形成性评估则强调过程的动态性。学科差异决定了BERT和GBDT模块之间特征的分配。因此,采用动态调整机制可以有效适应不同的评估类型和学科特征。最后,通过多轮参数反馈和迭代优化,模型输出精确且公正的教学评估校准结果。动态公平性约束优化函数表达在方程(14)中。
(14)
在方程(14)中, S表示敏感属性集合,
表示预测输出校准结果,
表示组内预测的方差, γ 表示组间参数,表示
整体期望值。多源特征融合权重的自适应计算见方程(15)。
(15)
在方程(15)中,wk 表示第 k 个数据源的特征权重,β 表示权重参数,Sim 表示特征相似度测量函数,fk 表示从第 k 个数据源提取的特征向量,f global 表示全局特征中心,K表示数据源的总数。研究设定了敏感属性的权重,包括性别、族裔、地区、家庭经济状况和母语背景。权重是根据相关分析结果确定的。该研究使用皮尔逊相关系数和斯皮尔曼秩相关系数作为关节评估的双重指标,结合教育领域的专家经验进行体重校准。对每个敏感属性权重的最终确定为:性别0.18,族裔0.22,地区0.25,家庭经济状况0.19,母语背景0.16。性别:依法律登记和自我认同的性别认同,二元性别(男性/女性)与非二元选项;数据字段“性别”。族裔:基于56个民族群体的民族认同,与未识别和跨境群体相兼容;数据字段“族裔”。区域:户籍或长期居住的行政区划,涵盖省、市、县级,考虑城乡双重结构和外来人口;数据字段“区域”。家庭经济状况:根据国家统计标准和教育援助指标,采用五级分类;数据字段“economic_status”。母语背景:基础教育期间的初级教学和家庭交流语言,涵盖普通话、少数民族语言、方言和外语,按习得年龄和使用频率加权;数据字段“mother_tongue”。
修正过程采用了三阶段动态加权机制。第一阶段基于敏感属性权重矩阵实现初始偏差识别,标记在性别、族裔和地区等维度上显著偏离全球特征中心的数据点。第二阶段引入教育语境约束,以情境感知方式重新限定偏差强度。第三阶段通过反事实微扰测试验证校正稳定性,系统地替换敏感属性的值,同时保持不变的非敏感特征,并观察评估分数的变化是否在±±3.2%的阈值内。
BFEN算法性能分析
实验中评估的指标包括以下内容:
评估纠正准确率(ECA)指的是教学评估结果中模型正确识别并纠正偏差项目的比例,从而反映纠正机制的整体有效性。数值越高表示校正准确度越高。
公平偏差率(FDR)衡量模型在校准过程中未能消除的组间分数差异的幅度。它是通过评分分布中每个敏感属性(如性别、地区、族裔)的标准差与整体标准差的比率计算的;较低的值意味着组间方差最小化,公平性保证更稳健。
情景适应率(SAR)表示模型在异构教学环境(如理科与人文学科、线上与线下环境)中成功执行的纠正任务比例。
公平性维护度(FMD)定义为修正后敏感属性组间公平性指标方差与校正前观察到的公平性指标方差的比值,反映了系统在校准过程中保持结构公平性的能力。
学科特征识别率(DFRR)计算各学科评估数据中,核心特征被正确识别的样本比例相对于整体评估样本量,展示了模型识别和捕捉领域特异变异的能力。
多源数据融合效率(MDFE)指的是模型在融合多源异构评估数据时,在特征比对、权重分配和偏差修正过程中的吞吐量效率。该综合指标定义为每秒处理的评估样品数(每秒样本数)与校正一致性的合规率(>95%置信水平)的乘积,其中较高的数值表示聚变管道更高效、更稳定。
校正结果稳定性(CRS)表示多次独立运行中校准输出的一致性,量化为每次运行在相同输入下校正输出之间欧几里得距离的标准差的倒数。数值越高表示系统可靠性越高。
单次数据校正时间(SDCT)表示模型完成单个评估样本校准时的平均计算延迟,单位为毫秒(ms);数值越低表示实时响应能力越强。
校正绝对误差(CAE)衡量校准后预测与真实值之间的平均绝对误差,表示模型相对于原始未校准数据的残余偏差。数值越低,表示校准后的输出更贴近真实性能水平。
校正相对误差(CRE)量化了校准后的预测与以地面真实值百分比表示的地面真实值之间的平均绝对误差,较低的值表示相对校准精度更高。
校正准确率(CAR)表示校准后绝对误差相对于总样本量<0.5的样本比例,展示了模型在满足预设精度约束方面的可靠性。高值证明了产出的经验效用和可信度。
总损耗值(TL)代表任务完成时,通过加权的各子损失项得出的综合优化目标值。具体来说,七项指标——DFRR、MDFE、CRS、SDCT、CAE、CRE和CAR——通过Z分数归一化标准化,并根据评估任务的运营优先级加权。给定权重向量 [0.15, 0.12, 0.1, 0.08, 0.13, 0.12, 0.1],这七个归一化指示值被汇总以计算最终损耗。
评估特征聚类准确率(EFCA)评估模型生成的无监督聚类配置与领域专家验证的真实类别之间的对齐程度。
高维数据处理效率(HDPE)衡量在处理包含≥50个评估特征的高维稀疏向量时,单位时间内接受特征降维和偏差校正的样本数量。以每秒样本计量,更高的数值反映了实时处理复杂大规模评估输入的能力。
公平性修正精度(FCP)评估校准效应在不同学生群体间的一致性。该度量通过计算敏感属性子群中修正绝对误差的Kolmogorov-Smirnov距离分布均值来量化;较低的数值意味着跨组表现更均衡,公平性更强。
跨场景校正一致性(CSCC)量化了校准结果在三种典型场景中的分布偏移——即课堂评估、实践评估和在线测试——以Wasserstein距离比为模型。
为验证拟议BFEN教学评估校准算法的性能,研究将其与PRF算法进行了比较,后者结合了主成分分析(PCA)和随机森林(RF);EAB算法,结合了极限学习机(ELM)和自适应提升(AdaBoost);以及DBLR算法,结合了深度信念网络(DBN)和逻辑回归(LR)。实验运行在配备英特尔Core i9-13900HX处理器和NVIDIA RTX 4080显卡的系统上,具备高并行计算能力和大容量视频内存,高效完成大规模教学评估数据的特征提取和校准计算。操作系统是Windows 11,编程使用Python 3.9。这些算法使用Scikit-learn库实现,深度学习模块通过TensorFlow框架开发,数据预处理则使用Pandas和NumPy库。开发环境使用 PyCharm Professional 2023.1,并应用 Seaborn 进行校准结果可视化,便于直观地比较算法性能。为确保数据可靠性,研究采用了全球教育监测报告数据集1 和西班牙中学生学业表现数据集2。该数据集包含12,486条记录,涵盖多模式教学评估数据,如大学教师教学评估、学生学业表现、学生教学评估和课程反馈,涵盖137个教学维度特征,包括课堂互动频率、作业反馈及时性、评分一致性、语言包容性和跨文化敏感性。目标变量是教学评估分数,在本研究中,该分数被映射为由专家校准的多维加权综合值。该研究整合了四类信息来源:学生教学评估、同行评审、指导课堂观察和教学档案审查,权重分别为0.35、0.25、0.25和0.15。训练集和验证集按时间顺序从这两个数据集中划分。研究使用2024年9月的数据作为训练集,2024年10月至2025年6月的数据作为验证集,以对应教育评估的时间进程。在预处理阶段,采用模态特定策略,结构特征通过Z分数归一化标准化,离群值温索化,文本特征则使用基于BERT的中文模型编码,并简化为768维。对抗性训练旨在增强对隐性偏见表达的鲁棒性,并减轻因文化背景差异引起的语义漂移。
为实现跨领域培训与验证研究,该模型将被转移到四个异质教学场景:K-12基础教育、职业教育、继续教育以及零样本或少数样本验证的国际中文教育。在这四个场景中,研究在算法训练过程中引入了领域自适应正则化项,以约束模型在不同教学场景下的特征分布一致性。在K-12场景中嵌入轻量语法感知掩码机制以处理短句子噪声;为解决职业教育中专业术语的歧义,构建并整合了动态领域词典,并与课程大纲知识图谱整合。设计一个年龄组比较学习模块,以解决继续教育中的代际语义差距,并在潜在空间中对齐不同年龄组的语义锚点。为应对国际中文教育中的文化负担表达,采用跨语言比较提示进行微调,增强对非字面教育概念理解的稳健性。关于原始评估记录中结构化场的专家校准和可靠性测试研究,去除Krippendorffα系数低于0.75的低可靠性条目。在学生评估文本中实施了双盲手动标注,由3位教育测量专家独立完成偏差类型标注,实现了Cohen's k = 0.86的注释一致性。最后,注释结果与指导出勤记录和教学档案审查结论交叉验证,生成最终校准标签。
所选数据集来自不同的人群、测量系统和教育背景。这种跨域验证范式严格测试了模型在真实教育生态系统中的鲁棒性和泛化边界,防止了数据同质化带来的评估错觉。这两个存储库都包含了大量教学评估记录,为部署公平意识的智能教育算法提供了直接的参考价值。这两个数据集都包含了大量教学评估数据,为设计公平意识的智能教育算法和教学评估校准提供了直接参考值。该研究用这四个算法校准了1000条教学评估记录,并计算了其ECA和公平FDR值。结果如 图8所示。

图8:ECA与FDR测试结果比较。 (A) BFEN。(B) PRF。(C) EAB。(D) 拖车。 请点击此处查看该图的放大版本。
如 图8A所示,BFEN在评估校准任务中最初实现了82.47%的ECA和5.71%的FDR。随着校准记录数量增加,ECA升至98.75%,校准421条记录后趋于稳定;而FDR降至2.87%,校准514条记录后趋于稳定。如 图8B所示,PRF算法的ECA曲线逐渐增加,而FDR线则缓慢下降。校准任务结束时,其ECA值为92.30%,PDR值为6.72%。 图8C 显示,EAB算法的ECA曲线在趋平前迅速上升,而其FDR轨迹在收敛前早期阶段出现剧烈波动,最终ECA为84.64%,FR为8.93%。如 图8D所示,DBLR算法显示ECA上升轨迹缓慢,伴有边际波动和有限的FDR线压缩,校准任务结束时ECA为83.51%,FR为8.42%。这些实验结果证实,BFEN算法在评估修正准确性和公平性偏差控制方面显著优于基线方法。这种优越的泛化能力归功于BERT在BFEN中的集成,BFEN从非结构化评估文本中提取深度语义特征以捕捉隐藏的偏见表达式,而强化学习模块则通过多目标奖励函数动态优化公平阈值和纠正参数,将敏感属性与最终输出解耦。研究随后测试了SAR和FMD的课堂评估、期末考试、实践评估和在线评估,将这四个情景标记为A、B、C、D。结果如 图9所示。

图9:SAR和FMD在不同情景下的比较结果。 (A) 搜救检测结果。(B)口蹄疫检测结果。 请点击此处查看该图的放大版本。
如 图9A所示,BFEN在所有教学场景下都实现了98%以上的SAR成绩,课堂测试中SAR最高为99.01%。不同场景下的比较算法的SAR低于BFEN算法,其中DBLR算法在最终评估场景中SAR最低,为70.23%。如 图9B所示,BFEN算法的FMD在不同教学场景下仍显著高于比较算法,FMD分别为98.47%、98.05%、97.81%和97.94%。基准算法DBLR的FMD分别为82.36%、71.74%、70.59%和69.12%。EAB算法中的FMD分别为80.79%、68.21%、67.65%和66.03%;PRF算法中的FMD分别为86.42%、82.17%、80.98%和78.33%。这些结果表明,BFEN优于对比算法,得益于GBDT通过多重决策树的迭代学习,能够准确捕捉不同场景的误差模式,并确保校准结果的稳定和公正。研究还利用这四种算法评估了中文、数学和英语的学科特征识别率(DFRR)。结果如 图10所示。

图10:不同学科DFRR测试结果比较。 (A)训练集。(B) 验证集。 请点击此处查看该图的放大版本。
如 图10A所示,BFEN在训练集中的中文、数学和英语分别取得了99.23%、98.94%和99.13%的DFRR。 图10B 表明,BFEN在验证集中也达到了比其他算法更高的DFRR。具体来说,BFEN的中国DFRR达到98.41%,高于DBLR的87.61%;数学方面,97.54%,比PRF的88.47%高9.07%;英语为98.13%,比EAB的84.79%高出13.34%。这些结果证实,BFEN通过结合BERT对语义差异的深度捕捉与GBDT对错误模式的个性化学习,高效适应了学科评估校准。为全面评估BFEN表现,研究评估了MDFE、CRS和SDCT中的四个算法。结果见 表1。
| 数据集 | 算法 | MDFE(%) | CRS | SDCT(s) |
| 培训 | BFEN | 98.42 ± 0.28*&@ | 0.975 ± 0.28*&@ | 0.78 ± 0.04*&@ |
| PRF | 83.85 ± 0.41 | 0.779 ± 0.36 | 1.32 ± 0.08 | |
| EAB | 85.91 ± 0.50 | 0.806 ± 0.40 | 1.15 ± 0.07 | |
| DBLR | 88.76 ± 0.47 | 0.753 ± 0.39 | 1.45 ± 0.08 | |
| 验证 | BFEN | 97.58 ± 0.25*&@ | 0.968 ± 0.27*&@ | 0.86 ± 0.03*&@ |
| PRF | 81.62 ± 0.32 | 0.687 ± 0.50 | 1.51 ± 0.06 | |
| EAB | 84.37 ± 0.40 | 0.749 ± 0.42 | 1.28 ± 0.05 | |
| DBLR | 87.53 ± 0.30 | 0.728 ± 0.47 | 1.63 ± 0.07 |
表1:MDFE、CRS和SDCT检测结果比较。“*”表示BFEN与PRF结果之间的显著差异(p < 0.05)。“&”表示BFEN与EAB结果的差异显著(p < 0.05)。“@”表示BFEN与DBLR结果差异显著(p < 0.05)
表1 显示,BFEN在训练集中的MDFE为98.42%,比PRF的83.85%高14.57%,CRS为0.975,比DBLR的0.753高0.222,SDCT为0.78秒,比DBLR的1.45秒低0.67秒。在验证集中,BFEN保持优异表现,MDFE、CRS和SDCT分别为97.58%、0.968和0.86秒,均优于对比算法。总体而言,结果验证了BFEN在教学评估校准方面的优越综合表现。
GFBFEN 教学评估校准模型性能验证
基于BFEN性能验证,研究进一步评估基于BFEN构建的GFBFEN教学评估校准模型的性能,并将其与使用PRF、EAB和DBLR算法构建的校准模型进行比较。为确保测试条件一致和可比性,全球教育监测报告数据集作为训练集,大学生学业表现数据集作为验证集。四个模型校准了500条教学评估记录,并计算了其CAE和CRE成绩。结果如 图11所示。

图11:CAE与CRE测试结果的比较。 (A) CAE考试结果。(B)不动产权检测结果。 请点击此处查看该图的放大版本。
如 图11A所示,GFBFEN最初的CAE为0.1279。校准过程中,CAE降至0.0641,并在记录104条后稳定下来。比较模型的初始和最终CAE均高于GFBFEN,EAB的初始和最终CAE分别为0.1858和0.1217。 图11B 显示,GFBFEN在校准任务中的初始和最终CRE仍低于对比模型,分别为0.1137和0.0912。这些结果表明GFBFEN展现出强大的拟合能力,受益于GAT的注意力机制,该机制构建特征间的语义相关图,增强多源评估数据的语义对齐,并减少因特征偏差引起的无效校准。研究随后对学生评估数据、教师评估数据、学校评估数据以及标记为I、II、III和IV的在线评估数据进行了评估。结果如 图12所示。

图12:不同评估数据CAR结果的比较。 (A) GFBFEN。(B) PRF。(C) EAB。(D) 拖车。 请点击此处查看该图的放大版本。
如 图12A所示,GFBFEN在培训集中的学生、教师、学校及在线评估数据中,CAR分别为99.34%、98.93%、99.01%和99.12%。验证集中,CAR值分别为97.89%、98.56%、97.57%和98.46%。 图12B–D 显示,对比模型在训练集和验证集上的CAR均较低。其中,EAB在验证集中表现最差,教师数据CAR为76.31%,在线数据为78.29%。这些结果证实GFBFEN显著优于对照模型。接下来,研究在教学评估校准任务中测试了目标语言,以评估拟合能力和训练稳定性。结果如 图13所示。

图13:模型拟合能力与训练稳定性测试结果。 (A) GFBFEN。(B) PRF。(C) EAB。(D) 拖车。 请点击此处查看该图的放大版本。
如 图13A所示,GFBFEN在训练集中最初的TL为0.1021。经过67次迭代,TL降至0.0725并稳定下来。在验证集中,TL从0.1237降至0.1018。 图13B–D 显示,PRF在训练集中的最终TL为0.0824,EAB在验证集的最终TL为0.1178,DBLR在两组TL中均不稳定且显著高于其他模型。这些结果表明GFBFEN展现出强大的拟合能力和训练稳定性,受益于基于KD的知识转移,使模型能够快速学习有效特征,加速损失收敛,并确保跨数据集的泛化。为全面验证GFBFEN的核心性能,研究测试了四个模型的EFCA、HDPE、FCP和CSCC。结果如 图14所示。

图14:教学评估和纠正任务的综合指标测试结果。 (A) GFBFEN检测结果。(B)PRF检测结果。(C) EAB检测结果。(D) DBLR测试结果。 请点击此处查看该图的放大版本。
如 图14A–D所示,GFBFEN模型在训练集和验证集中的EFCA值分别为99.35%和98.76%。PRF模型的EFCA分别为88.53%和87.04%。在验证集中,GFBFEN模型的EFCA比EAB模型高出6.59%,为92.17%;比DBLR模型的87.04%高出11.72%。此外,其HDPE、FCP和CSCC指标也全面领先:在验证集中,GFBFEN模型的HDPE达到98.05%,FCP达到97.93%,CSCC达到0.968,均优于PRF、EAB和DBLR模型。总体而言,这些结果验证了GFBFEN的卓越综合性能,证明模型对GAT-KD、AM-LSTM和BFEN的协调优化有效提升了教学评估的校准准确性、效率和公平性。
研究逐步构建了FairEduNet、BFEN、FBFEN和GFBFEN,最终的GFBFEN包括FairEduNet、BERT-RL、AM-LSTM和GAT-KD等组件。为了验证单个组件的独立贡献,开展研究和设计消融实验,逐步去除每个组件并评估其对整体性能的影响。比较指标包括ECA、FDR、SAR和FMD。结果显示,仅FairEduNet组件的ECA值为87.32%,FDR为12.45%,SAR为89.67%,FMD为11.89%。完整GFBFEN模型的ECA达到99.21%,FDR进一步降至1.93%,SAR稳定在99.45%,FMD优化至7.28%。去除BERT-RL后,ECA降至91.04%,FDR值为6.23%,SAR值为92.33%,FMD升至7.85%。AM-LSTM消融使SAR波动增加了14.2%。去除GAT-KD后,FMD比例上升至8.36%,其通过知识蒸馏抑制图结构偏倚传播机制,显著有效缓解了群体间隐性关联偏倚。
为进一步检验研究方法,研究引入了公认的公平性标准指标,即公平性修正基准(FCB),涵盖了三种在教育场景中广泛认可的严格约束:(1)校正后组间平均差的绝对值为≤1.2分(基于百分比系统);(2) 每个敏感属性子组修正置信区间的重叠率≥为95%;(3)在任何单一情景中,FDR和SAR的联合可行区域必须满足帕累托前沿约束(即在不FDR退化的情况下无法提升SAR水平,反之亦然)。在实验评估中,GFBFEN模型与主流基线模型(如EAB、PRF、DBLR和GBDT)进行了比较。实验基于421条来自实际教学场景的真实评估数据进行,涵盖三种典型教育场景:课堂评估、实践评估和在线测试。结果见 表2。
| 算法 | 平均分差的绝对值 | 置信区间重叠率(%) | 联合可行区域满意度(%) | 综合评分 |
| GFBFEN | 0.87 | 98.3 | 100 | 97.2 |
| 埃尔维 | 1.52 | 98.4 | 82.6 | 78.5 |
| PRF | 1.68 | 85.1 | 74.3 | 71.2 |
| DBLR | 1.45 | 87.9 | 79.8 | 75.6 |
| GBDT | 1.33 | 91.2 | 86.4 | 79.9 |
表2:公平性标准指标及实际应用验证的评估结果。
如 表2所示,GFBFEN独立完全符合所有四个FCB刚性约束,其综合得分显著优于其他基线模型+18.7分,验证了所提多阶段协作修正范式的稳健性。特别是在核心指标中,反映公平性-效率权衡能力,联合可行区域覆盖率达到100%,表明模型具备在真实教育场景中可部署的帕累托最优决策能力。
教学评估中的公平性是指在尊重个体差异和教育规则的同时,使用可验证的定量约束作为基准。公平指标的计算逻辑和阈值设定基于教育公平和实证数据验证标准的理论框架。这些研究由五位学者组成的专家委员会联合审查,以确保理论严谨性和对教育实践适应性的高度统一。为了进一步验证模型在不同公平标准下的适应性,研究对多个标准进行了进一步验证。具体来说,选定了三个公平标准进行验证。标准1是基于人口统计平权的各组接受率平衡。标准2是基于均衡赔率的真阳性和假阳性率的跨组一致性。标准3基于预测平称,用于控制预测准确性中的组间偏差。研究发现GFBFEN在所有三项标准下始终符合严格约束要求。标准一组接受率偏差≤1.2%),标准二组真假阳性率组间差异≤0.85%,标准三组预测准确率组间偏差控制在±±0.6%内。相比之下,其他模型在至少一个标准下显示出≥3.7%的约束突破,验证了GFBFEN在多元公平性范式中的推广兼容性。
数据可用性:
为确保数据可靠性,研究使用了全球教育监测报告数据集(https://www.education-progress.org/)和西班牙中学生学业表现数据集(https://archive.ics.uci.edu/dataset/320/student+performance)。训练集和验证集按时间顺序从这两个数据集中划分。该研究使用2024年9月的数据作为训练集,2024年10月至2025年6月的数据作为验证集,与教育评估的时间进程相符。
本研究提出的BFEN算法在比较实验中表现出优异性能。从ECA和FDR的角度来看,它明显优于PRF、EAB和DBLR算法。在校准421条评估记录时,BFEN将ECA提升至98.75%,保持稳定,而FDR降至2.87%。这种性能得益于BERT-RL的集成,用于特征优化和动态适应。BERT精确地从非结构化评估文本中提取了深度语义偏见信息,而强化学习则通过多目标奖励函数动态调整公平阈值和校准参数,消除了敏感属性对结果的影响。这与Valencia-Londoño等人的工作类似,他们利用人工智能算法构建了针对各种神经肌肉疾病成年人的教育包容模型。尽管构建的教育纳入模型在特定神经肌肉疾病组内的可行性已验证,但其公平性约束仅涵盖单一维度(诊断组的平等代表性),且未建立跨多组和多目标的僵化约束系统,27。 在不同教学场景的测试中,BFEN在课堂评估中取得了99.01%的SAR和97.81%的实践评估,显著高于对比模型。这一优势源于GBDT对多场景评估数据中误差模式的迭代学习,结合智能教育公平标准库以匹配目标校准参数,有效减少因情景差异引起的校准偏差和公平性不平衡。与Kumar等人提出的自适应且可解释的公平人工智能评估系统相比,后者包含了人类专家反馈循环和跨语言公平性验证模块,虽然引入了这些功能,但在具有高语义密度和强烈上下文依赖性的教育评估领域中,其评估文本中的隐性偏见链仍未能有效建模28.与文献相比,本研究在公平约束的严格保证和教育语义建模的深度耦合方面更加深入地整合了相关性28。
在实际的智能教育评估任务中,基于BFEN构建的GFBFEN模型也展现出显著优势。在500条校准记录中,GFBFEN实现了最终CAE为0.0641,CRE为0.0912。其多种评估数据的CAR在培训和验证数据集中均超过97%。这一性能得益于 GAT-KD 的特征相关优化和轻量级处理。GAT构建了特征间的语义相关图,以减少多源数据特征偏差,而KD的知识转移提升了推理效率,同时不影响模型准确性,避免了因模型复杂性引起的校准延迟。与Deho等人关于数据集漂移对学习分析模型公平性影响的研究相比,尽管他们的研究侧重于数据漂移对公平性的影响机制,但纠正策略依赖静态加权和事件后补偿,缺乏动态感知和响应实时语义偏差的能力。处理教师主观表达和学生语言风格差异导致的教育评估隐性偏见演变过程非常困难。然而,本研究通过GFBFEN模型,有效感知并动态响应评估语义中的语义偏差,捕捉教师评论中的隐性价值倾向、学生回答文本中的语言风格偏差以及跨年级/科目评估表达中的语义漂移,实现了从“静态补偿”向“动态校准”的范式转变29.在核心指标测试中,GFBFEN在训练集和验证集中分别实现了99.35%和98.76%的EFCA,以及98.52%和97.93%的FCP,显著高于对比模型。类似于由Dimari A团队开发的基于人工智能的自动评分的开放式考试系统,尽管在开放式回答的评分上实现了高度一致性,其公平性修正仅依赖于预设的评分维度权重和由人工注释的偏向样本库,而未嵌入教育语义动态演化机制。该研究在公平纠正的动态演化机制和教育语义深度建模方面取得了实质性突破,尤其在解决教师评论价值导向漂移、学生语言风格代际差异等现实问题方面展现了强的稳健性和可解释性, 以及跨学科评估表达中的歧义30.
这项研究在三个方面做出了贡献。首先,BFEN算法将BERT-RL与FairEduNet集成,通过语义特征优化和动态参数调整,提升了处理效率和多源异构数据的多场景适应性。其次,基于GAT-KD和FBFEN的GFBFEN模型引入了语义相关学习和轻量级知识转移,解决了复杂教育场景中弱特征相关性和低推理效率问题,提升了评估校准的实用性。第三,模型被用来校准不同科目和评估类型,为精准教学评估提供技术支持,促进教育公平。这些贡献为智能教育评估校准提供了一种新方法,并为复杂教育数据处理中的多算法协作提供了参考。
当前的智能教育评估校准方法缺乏适应性和公平性。本研究提出了基于FairEduNet的GFBFEN模型,利用GAN和GBDT进行公平校准。BERT-RL增强了非结构化数据处理,AM-LSTM提升了多源数据融合,GAT-KD则加强了特征相关性和轻量化。通过整合这些算法,模型实现了精确校准和动态公平性。测试显示出卓越的多源数据处理和跨场景公平性校准,满足精度和公平性要求。然而,该模型在特殊教育群体中存在局限性,需要改进推广。未来工作将优化参数并调整公平约束,以适应多样情境,支持教育公平性和教学质量。
作者没有什么可透露的。
作者声明不存在利益冲突。
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 全球教育监测报告数据集 | UNESCO | https://www.education-progress.org/ | 数据集 |
| NumPy | NumPy | https://numpy.org/ | 数据预处理 |
| Pandas | Pandas, NumPy | https://pandas.pydata.org/ | 数据预处理 |
| PyCharm Professional 2023.1 | PyCharm | 版本 2023.1 | 开发环境 |
| Python 3.9 | Python | 版本 3.9 | 编程语言 |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/index.html | 机器学习 |
| Seaborn | Seaborn | https://seaborn.pydata.org/ | 可视化 |
| 西班牙中学学生学业表现数据集 | UC Irvine 机器学习库 | https://archive.ics.uci.edu/dataset/320/student+performance | 数据集 |
| TensorFlow | TensorFlow | https://www.tensorflow.org/ | 深度学习 |
| Windows 11 | Microsoft | 版本 11 | 操作系统 |
Request permission to reuse the text or figures of this JoVE article
Request Permission