本研究基准测试STEP-DWCF-R(结构化、分层、证据驱动的动态书面纠正反馈过程,配合机器人AI代理),通过多轮AI和教师支持的修订提升雅思写作表现。
方法文章
本研究基准测试STEP-DWCF-R(结构化、分层、证据驱动的动态书面纠正反馈过程,配合机器人AI代理),通过多轮AI和教师支持的修订提升雅思写作表现。
自动写作反馈系统很普遍,但大多数只提供静态、碎片化的评论,提供了有限的修订支架。本研究评估了STEP-DWCF-R框架(结构化、分层、证据驱动的动态书面纠正反馈过程,即机器人AI代理),该框架通过机器人AI代理在一周任务周期内多次迭代传递由教师审核的AI反馈。在一项为期八周的准实验试验中,32名EFL学习者被随机分配到传统的书面纠正反馈(每任务一轮)或STEP-DWCF-R。两组均在基线和测试后完成了雅思任务2作文,作文匿名、随机分配,并由两名独立评审评分(ICC = 0.86–0.93)。线性混合效应模型显示,STEP-DWCF-R组在整体带评分(Δ=1.03对0.31带)及四个分析维度上显著提升,其中相干性和内聚力提升最大。流程数据显示,STEP-DWCF-R学习者平均每项任务完成2.26轮复习,错误数量在各轮之间线性减少。这些发现表明,集成的STEP-DWCF-R框架,涵盖AI生成反馈、教师审核和迭代机器人AI代理交付,比传统单轮反馈在雅思写作方面有更大提升,显示出AI增强动态反馈在EFL环境中的实际应用。
书面纠正反馈(WCF)仍然是L2写作教学的核心。证据表明,全面的WCF能随着时间提升学习者的准确性,并且当与课堂实践相协调时,可以与在真实情境下可行的聚焦方法共存(1,2,3)。最近的课堂研究显示,持续、全面的WCF在准确性和流利度上取得了持久的提升。关于反馈范围的研究提醒,教师应有策略地针对形式进行定位,而不是把所有表格都标记为4、5、6、7、8、9。与此同时,自动写作评估(AWE)和自动书面纠正反馈(AWCF)也迅速发展。结果参差不齐:一些研究显示AWCF或Criterion风格项目在任务完成率和语法范围上有所提升,而另一些则认为仅限教师反馈无显著优势,或指出主要为局部、表面的修订。为反映这种异质性,我们有意跨多个AWCF研究进行三角定位,而非依赖单一来源10、11、12、13。
学习者对谁在提供反馈的信念也很重要:对感知来源的准实验研究表明,当相同的反馈被框定为“教师”与“自动化”时,表现和信任会发生变化,这凸显了AWCF设计中需要考虑感知效应的必要性(14,15)。进一步,新兴研究表明,教育机器人因其具备的实体存在,也能作为反馈提供者,以独特方式影响学习者的参与度和信任度。
另一条补充的研究方向是动态书面纠正反馈(DWCF),强调频繁、可管理且全面的反馈循环,结合编码和快速修订。来自多个环境的证据表明,DWCF可靠地提高了准确性(频率对流利度有影响),尽管结果可能因课程目标和学习者群体(17、18、19、20)而异。最后,早期关于生成式人工智能中介反馈的研究报告称,结合明确的元语言指导,在写作成果和潜在益处方面与教师反馈相当,促使人类与人工智能反馈在第二语言语境中更紧密地融合(21,22)。
为应对这些挑战,我们提出了STEP-DWCF-R(结构化、分层、证据驱动的动态书面纠正反馈过程,配合机器人AI代理)框架,这是一种新型多阶段DWCF反馈系统,旨在提供结构化、迭代性和流程导向的写作支持。我们的系统利用大型语言模型(LLM)的预测和生成能力,通过机器人AI代理界面和教师审核,将复杂的写作问题划分为可管理的类别,通过多轮互动传递反馈,并结合基于结果和过程的指标评估其有效性。通过将反馈转化为结构化且互动的过程,STEP-DWCF-R 将自动写入支持从静态纠错推进到更具吸引力、具象化和学习导向的系统。
我们的贡献集中在三项综合进展。首先,我们提出了一种结构化的反馈表示模式,对错误(如语法、连贯性)进行分类,使机器人AI智能体交付的LLM反馈既可操作又具教学解释性。其次,我们引入了一种迭代多阶段流程,将反馈在语言、结构和推理中多次排序,以减轻认知负担并加深参与感。第三,我们将评估扩展到基于流程的指标,如错误减少和反馈采纳率,提供更丰富的学习影响视角。WCF框架代表了教育技术中系统化书面纠正反馈的最早尝试。这些系统起源于自动写作评估(AWE)和自动论文评分(AES),强调错误检测和熟练度评分,评分为13,14。它们的贡献在于可扩展性:成千上万的学习者可以在无需人工评分瓶颈的情况下获得反馈。然而,这些框架通常提供静态且零散的注释,如语法检查、词汇建议或全局评分,学习者难以将其转化为有意义的修订 23,24,25,26。
随着时间推移,WCF研究逐渐涵盖更多技术媒介的方法。这些新系统试图通过计算方法捕捉写作的更广泛方面 13,21。近年来,随着具象化技术的发展,教育机器人开始在写作或辅导环境中作为反馈提供者,这一范围进一步扩大。他们的实体存在感和互动性带来了信任、参与度和学习者动机的新动态。然而,尽管有这些发展,WCF的主流方向依然以结果为导向:以单次方式产生分数或零散评论。在教学上,这种取向与形成性评估不符,形成性评估应在草稿间进行修订,并支持元认知参与16,28,29,30,31。因此,WCF的概念边界揭示了一个持久的鸿沟:反馈是传递的,但没有结构化或排序来指导学习过程。
针对这些局限,学者们开始探索更具动态性的反馈写作方法。早期研究强调了迭代反馈循环的重要性,即学习者在支架指导下多次修订17,32。结构化错误分类也被提出,以提升反馈的可解释性,并使其与教学目标保持一致(33,34)。DWCF框架的概念通过嵌入三个设计原则来巩固这些方向:显式错误模式、分阶段和迭代交付,以及面向过程的评估指标19,35。DWCF不是一次性用大量纠正压垮学生,而是通过连续的17、33轮将注意力分散到写作层次——表面准确性、结构连贯性和论证深度。评估不仅限于最终评分,还包括错误减少率、反馈采纳率以及修订深度10、19、25等流程指标。尽管前景看好,DWCF的实际应用仍然稀少,大多数研究尚未将其应用于大规模、技术干预的情境下(10,36,37)。这一空白凸显了不仅要理论化DWCF,还要展示其在现实教育环境中可行性的框架的必要性。 图1展示了文献中提出的DWCF更广泛的理论框架。图中提供了动态书面纠正反馈在多个层面的运作原理,包括测量结果(如准确性、连贯性)以及本研究中理论化但未测量的结构(如写作焦虑减轻、流畅度和复杂度)。它被纳入理论导向,而非作为该试验的直接模型。与此处分析的结果和过程指标对应的元素如图所示;其他通路具有说明性,本研究未予评估。
大型语言模型和多模态系统的出现为大规模运化DWCF提供了强大手段。LLMs凭借零射击和少数射击能力,可以在无需特定任务训练的情况下生成上下文敏感反馈21,22。近期实验显示,它们具有指令分割、分阶段细化和解释生成的潜力,这与DWCF 13,37,38,39的原则高度契合。人机协作中的补充研究表明,交互、适应和选择性采纳AI反馈的迭代循环可以提升采纳率和修订质量25,30。当这些过程通过机器人体现时,这种交互理论上有潜力成为多模态——结合手势、声音和存在感——这可能进一步提升学习者的感知和动机。
基于近端发展区(ZPD)41、输入假说42和技能习得理论43,我们将STEP-DWCF-R定位为连接学习者支持、输入处理和技能发展的控制器。具体来说,评分标准关联的项目、及时整合的列表以及多轮教师审核的人工智能、人类和机器人循环在一个整合层上运作,该层调节复习并产生这里分析的可观察终点(雅思综合和TR/CC/LR/GRA;轮次、学习、持续错误、时间)。本试验提出了诸如写作焦虑减轻等概念,但未进行测量。
该方案已获得上拉奥学前教育学院小学伦理委员会批准。所有参与者均为成年人(≥18岁),并在研究前提供了书面知情同意。
1. 研究设计
注意:由于可用EFL教室的限制(总注册人数N=32),参与者被随机分为两组,每组16人。该样本量虽小,但鉴于受试者内的预后设计及基于先前DWCF研究预期的大效应量17、18、19、20,被认定为足够进行试点调查。
2. 写作任务
3. 反馈工作流程
4. 结果测量
5. 过程测量
6. 数据分析
7. 代码可用性
所有用于复现 STEP-DWCF-R 系统所需的代码、提示符、JSON 模式和示例实现文件均可在 https://github.com/YifangGaoinPG/Dynamic-Writing-Correction-Feedback 公开获取。
实验与分析
所有32名学习者均提供了基线数据。每组16名学习者的测验后数据可用(WCF和STEP-DWCF-R; 图2)。研究时间线和测量指标见 图3,端到端反馈工作流程见 图4。我们AI系统的实验设置和实现参数见 表1。分析遵循预定计划并进行意向治疗。我们首先评估基线等价性(见表2),然后报告主要结局(图5 和 表3),再报告次要结局(见表4),并进行稳健性和信度检查。
基线等价
基线(第1周)组在预设协变量(包括人口统计学和雅思写作表现)上描述相似,且未接受任何反馈(见表2)。雅思各组成部分的分数以0.5带步骤计分,而表格则报告组别平均分。第1周总体平均数(WCF = 5.625,STEP-DWCF-R = 5.500)由用于生成 图5的相同阵列计算得出。基线时我们不进行假设检验;任何残余不平衡通过预后设计和混合效应模型中的组×时间项进行处理,测试后调整基线后比较则在方案部分报告。
主要结局
图5 总结了赛前的变化, 表3 和 表5 报告了模型估计值和测试后的达成情况。基线(第1周),WCF组均值为5.625,STEP-DWCF-R为5.500,组间差异为−0.125条带(SE = 0.133,t = − 0.939,df = 29.90,p = 0.355,95% CI [−0.397,0.147])。因此, 表3中的基线估计WCF第一周平均值为5.625,置信区间95%[5.419, 5.831](SE = 0.097,df = 15)。从第1周到第8周,WCF改善了0.3125条带(SE = 0.128,t = 2.44,df = 15,p = .028,95% CI [0.039, 0.586];标准化组内效应dz = 0.61)。STEP-DWCF-R提升了1.0313条带(SE = 0.140,t = 7.34,df = 15,p = 2.44 × 10⁻⁹,95% CI [0.732,1.331];dz = 1.84)。组×时间交互的线性混合效应对比度——即差分差异——为0.7188条带(SE = 0.190,t = 3.78,df = 29.75,p = .0007,95% CI [0.330,1.107];表 3),显示在STEP-DWCF-R下获得更大的收益。在测试后(第8周),估计的边际均值偏向STEP-DWCF-R0.5938条带(韦尔奇检验对组均值:SE = 0.115,t = 5.16,df = 29.74,p = 1.50 × 10⁻⁵,95% CI [0.359, 0.829])。与此相符的是,成绩表(表5)显示,第8周时,13%的WCF学习者达到总体≥6.5,0%达到7.0≥(计数2/16和0/16),而81%的STEP-DWCF-R学习者达到≥6.5,25%达到7.0≥(计数13/16和4/16)。表3报告了对应的固定效应估计及其不确定性。
维度层面的结果
表4总结了任务2四个维度的前后期变化。任务响应(TR)显示WCF下Δ = 0.25带,而STEP-DWCF-R下Δ = 0.95,得出ΔΔ = 0.70,置信区间95% [0.28, 1.12],霍尔姆调整后p = 0.006。相干与内聚(CC)对比最大:WCF Δ = 0.30,STEP-DWCF-R Δ = 1.15,因此ΔΔ = 0.85(95% CI [0.44, 1.26],形容词p = 0.002)。词汇资源(LR)也遵循相同模式,WCF Δ = 0.35,STEP-DWCF-R Δ = 0.95,得出 ΔΔ = 0.60(95% CI [0.18, 1.02],形容词-p = 0.012)。语法范围和准确性(GRA)在WCF中提升了Δ = 0.25,STEP-DWCF-R中提升了Δ = 0.97;所得的ΔΔ = 0.72,95%置信区间为[0.31, 1.13],且 adj-p = 0.004。在所有四个维度上,Group×Time对比在Holm–Bonferroni调整后更偏向STEP-DWCF-R。
流程证据
图6 和 图7 展示了核心过程结果。在第2至7周,STEP-DWCF-R平均每项任务完成2.26轮修订(95% CI [2.17, 2.35];n = 96),而WCF所有任务均为1.00轮(n = 96)。平均差异为1.26轮(95%置信区间[1.17,1.35]);曼-惠特尼检验确认了分布的分离(U = 9216,z = 11.97,p < 10⁻³0)。在STEP-DWCF-R内,平均误差数按轮次下降:第一轮为13.78(95% CI [13.02, 14.54];n = 96),第二轮为8.94(95% CI [8.42, 9.46];n = 96),第三轮为6.16(95% CI [5.20, 7.12];n = 25)。拟合每轮观测的线性趋势估计每轮误差减少4.14次(绝对震级95% CI [3.51, 4.78];p < 10−12)。反馈接受度和任务完成时间的测量未编码在 图6 和 图7 中,因此报告在 表7中。
可靠性与稳健性
第1周和第8周论文的评审间协议从好到优。两名受过培训的评审独立评分所有剧本,并盲分组和时间;使用评级均值的平均级内相关系数(ICC[2,2]),总体及四个维度的信度范围为0.86–0.93,所有较低的95%置信区间均超过0.80(见表6)。对主要混合效应模型的诊断检查显示残差近似正常且无物质异差,拟合任务级过程摘要的模型则显示离散接近一。基于同一第1周/第8周数据集的敏感性分析得出一致推断:对检测后组进行线性回归并调整基线分数,估计第8周组间差异为0.575条带(95% CI [0.336, 0.814],p = 3.15 × 10⁻⁻5),而一个包含随机效应的评分者特异性混合模型,使用未平均分数,得出组×时间估计为0.72条带(95% CI [0.33, 1.11], p = .0007),与 表3保持一致。使用稳健标准误和分析限制于完整病例时结果无变化,进一步支持STEP-DWCF-R在后期增益大于WCF的结论。
定性发现
在定性分析中,我们分析了STEP-DWCF-R六项任务的修订轨迹及16名STEP-DWCF-R组参与者的课程结束书面反思。两名程序员独立使用基于四个反馈类别(语法、词汇、组织、推理)和理解理由的聚焦演绎框架编码材料。编码者间的一致性显著,Cohen的κ为0.78,分歧通过讨论解决。
分析揭示了五个关键主题:吸收遵循分阶段模式,学习者先解决表面特征,然后再处理组织和推理;跨区段特定、与评分标准相关联的项目比叙述性建议更可操作且更常被采纳;人工智能与教师的互补性塑造了优先级,重叠信号提高了关注度,教师的管理解决了冲突;效益在早期达到顶峰,组织模板和词汇模式在新提示中被重新使用;学习者在不同任务间调整策略。这些主题为过程证据部分所探讨的过程动态提供了参考。还记录了反馈接受率、持续错误和任务时间指标。这些额外流程指标的总结见 表7。
代表性结果的解释
综合来看,结果和过程数据表明,STEP-DWCF-R框架与雅思写作提升相比传统的单轮反馈更显著。主要结果显示组间差异差异为0.72条带,其中STEP-DWCF-R组整体改善1.03条带,而WCF组为0.31条带。这一优势在四个分析维度中均一致,其中相干性和凝聚力的对比最大,达到0.85条带,表明结构化、规律联结、多阶段反馈尤其支撑组织发展的支架。流程证据进一步表明,迭代参与是这一优势的基础。STEP-DWCF-R学习者平均每轮完成2.26轮复习,错误数量线性下降约4.1次。例如,一个具有代表性的工作流程周期包括GPT-5生成跨四个类别的结构化JSON反馈,随后由教师审核以消除误报并提升可操作性,随后通过机器人AI代理界面进行多轮学习者修订。这些发现支持了结合AI生成反馈、教师审核和迭代机器人AI代理交付的集成多组件工作流程的可行性和潜在有效性,但不应单独解读为任何单一组件的证明。2–3轮与1轮的剂量不平衡以及32个适中的样本量意味着观察到的增益反映了修订机会增加和结构化反馈的综合效应。这些结果应被视为有前景的初步证据,等待在更大规模、成分对照试验中得到确认。

图1。DWCF(动态书面纠正反馈)的理论框架。该图为DWCF的运作提供了更广泛的理由;它被纳入此试验的定位,而非作为该试验的直接模型。与此处分析的结果和过程指标对应的元素如图所示;其他路径仅具说明性,未被评估。请点击此处查看该图的放大版本。

图2。CONSORT参与者流程图。32名学习者接受了资格评估;没有人被排除在外。所有参与者均提供同意,随后以1:1比例随机分配至WCF组(n=16)或DWCF组(n=16)。所有随机参与者均接受了分配的干预措施;无因随访或停药而流失的情况,全部32种药物均纳入最终分析。请点击此处查看该图的放大版本。

图3。研究时间线和测量指标。试验持续8周:在W1时,参与者完成了基线IELTS任务2并获得评分;每周执行六个写作任务,从W2到W7(任务1–任务6),每项任务后有针对小组的反馈(WCF或DWCF)和修订。在W2至W7期间,记录了每个任务的流程指标,包括修订轮次、反馈采纳率、持续错误率和任务时间。在W8考试时,进行了测试后IELTS任务2并进行评分。请点击此处查看该图的放大版本。

图4。端到端反馈工作流程。学习者制作监考的初稿,然后接受针对小组的反馈:WCF(一轮人工反馈)或STEP-DWCF-R(由教师生成的反馈,由机器人AI代理传递,包含2–3轮迭代)。学习者会相应完成复习轮次。结果是雅思任务2的乐段成绩;流程指标包括发数、反馈采纳率(采纳/修改/拒绝)、持续错误率和任务时间。系统记录项目级别ID、类别/严重程度、来源(AI对人类与机器人)、审核操作以及用户使用状态。请点击此处查看该图的放大版本。

图5。各组别雅思整体乐队从第1周到第8周的变化。点数显示了估计的组均值和95%置信区间,轨迹显示STEP-DWCF-R下增长更大。请点击此处查看该图的更大版本。

图6。按组别(第2–7周)每个任务的复习轮次。 数据点代表WCF(蓝色)和STEP-DWCF-R(橙色)组的单个任务修订轮次。横线和误差条表示具有95%置信区间的组均值。请点击此处查看该图的放大版本。

图7。STEP-DWCF-R中每轮的平均误差计数为95%的置信区间。点表示每轮反馈(第一轮、第二轮、第三轮)的平均误差数,垂直线代表95%置信区间(CI)。 请点击此处查看该图的放大版本。
| 组成部分 | 规格 |
| 硬件 | 搭载第12代Intel(R)核心(TM)i7-12700H(2.30 GHz),32GB内存,NVIDIA RTX 3080Ti显卡(16GB) |
| 操作系统 | Windows 11 |
| 后端 | Flask~2.1 (Python~3.10) |
| 前端 | Jinja2 服务器渲染模板 |
| 人工智能模型 | OpenAI GPT-5 API(用于反馈生成),基于模式的后处理 |
| 反馈调度器 | 自定义控制器管理多级反馈(3周期) |
| 错误模式 | 语法、词汇、组织、推理 |
| 版本控制 | GitHub |
| 伐木 | 自动记录提交、反馈和修订以供分析 |
表1:实验设置与实施参数。 AI反馈系统的技术规格,包括硬件配置、操作系统、前端和后端框架、AI模型设置、反馈调度器、错误模式类别、版本控制和日志基础设施。
| 变量 | WCF(n=16) | STEP-DWCF-R (n=16) |
| 年龄(年),平均(SD) | 20.9 (1.5) | 21.1 (1.6) |
| 女性,n(%) | 9 (56%) | 8 (50%) |
| 之前有雅思准备(有),n(%) | 7 (44%) | 6 (38%) |
| 多年写作指导 | 3.1 (1.2) | 3.2 (1.1) |
| 基础雅思整体成绩(乐队) | 5.625 (0.387) | 5.500 (0.365) |
| 基线TR(波段) | 5.56 (0.50) | 5.50 (0.50) |
| 基线CC(波段) | 5.62 (0.49) | 5.53 (0.49) |
| 基线LR(波段) | 5.60 (0.46) | 5.52 (0.46) |
| 基础GRA(乐队) | 5.56 (0.48) | 5.49 (0.45) |
表2:各组参与者基线特征(第1周)。 人口统计变量及国际英语语言测试系统(IELTS)任务2写作表现前测试,适用于WCF组和STEP-DWCF-R组。数值为均值(标准差)或n(%)。
| 固定效应 | 估算 | 东南 | DF | t | p | 95%信赖区间 |
| 拦截(WCF,第~1周) | 5.625 | 0.097 | 15 | 58.1 | <.001 | [5.419, 5.831] |
| 小组(STEP-DWCF-R 与 WCF) | -0.125 | 0.133 | 29.9 | -0.939 | .355 | [-0.397, 0.147] |
| 时间(周~8 vs. 周~1) | 0.3125 | 0.128 | 15 | 2.44 | .028 | [0.039, 0.586] |
| 时间×集团 | 0.7188 | 0.19 | 29.75 | 3.78 | .0007 | [0.330, 1.107] |
表3:雅思第1周/第8周整体成绩的线性混合效应模型。固定效应估计、标准误(SE)、自由度(df)、t值、p值以及95%置信区间(CI),用于Group × Time交互作用和模型术语。
| 尺寸 | WCF Δ(波段) | STEP-DWCF-R Δ(波段) | ΔΔ(95% CI) | 加义词-p |
| 任务响应(TR) | 0.25 | 0.95 | 0.70 (0.28, 1.12) | .006 |
| 连贯性与内聚力(CC) | 0.3 | 1.15 | 0.85 (0.44, 1.26) | .002 |
| 词汇资源(LR) | 0.35 | 0.95 | 0.60 (0.18, 1.02) | .012 |
| 语法范围与准确性(GRA) | 0.25 | 0.97 | 0.72 (0.31, 1.13) | .004 |
表4:维度层面结果(任务2):前后变化及组间差异。 任务响应(TR)、连贯性与内聚力(CC)、词汇资源(LR)和语法范围与准确性(GRA)的95%置信区间(CI)和霍姆调整p值的前后变化(Δδ)和差异差异(ΔΔ)。
| 阈值 | WCF(%) | STEP-DWCF-R (%) |
| 总体≥6.5 | 13 | 81 |
| 总体评价≥7.0 | 0 | 25 |
表5:测试后波段达到率(第8周)。 WCF和STEP-DWCF-R组中达到雅思整体分数门槛至少6.5和至少7.0的学习者比例。
| 结果 | 国际板球理事会 | 95%信赖区间 |
| 总体评价 | 0.91 | [0.86, 0.94] |
| 任务响应(TR) | 0.88 | [0.82, 0.92] |
| 连贯性与内聚力(CC) | 0.9 | [0.85, 0.94] |
| 词汇资源(LR) | 0.89 | [0.83, 0.93] |
| 语法范围与准确性(GRA) | 0.87 | [0.80, 0.91] |
表6:雅思成绩的评级间信赖度。 两名盲评员对N=64篇论文进行盲测评分(第1周和第8周合计)。平均测量的班内相关系数(ICC[2,2])与95%置信区间(CI)用于整体和维度得分。
| 度量 | WCF集团 | 斯特普-DWCF-R集团 |
| 每项任务的修订轮次 | 1 | 2.26 |
| 反馈接受率(采纳或修改,百分比) | 68.5 | 82.3 |
| 最终一轮后持续错误率(%) | 67.4 | 45.6 |
| 教师审核时间(每项任务的最低限度) | 23.5 | 13.8 |
| AI代理交付时间(每个任务的最小时间) | — | 3.9 |
| 学习者复习时间(每任务最少) | 44.8 | 71.2 |
| 反馈+修改总时间(每任务最小时间) | 68.3 | 88.9 |
表7:96个任务的平均值(6个任务×16名学习者)。 在反馈点层面计算了采纳率和持续错误率。时间测量通过教师日志和系统时间戳记录。人工智能代理交付时间不适用于WCF组。
本研究比较了STEP-DWCF-R——一个多元动态的动态书面纠正反馈框架,配合机器人AI代理,与为期八周的雅思写作课程中的单轮WCF进行了比较。STEP-DWCF-R 在整体频带以及 TR、CC、LR 和 GRA 的前后后益率上都取得了更大的提升。在STEP-DWCF-R学习者完成的复习轮次也更多,错误减少更快,模型估计每轮错误减少约4.1次。最大改善体现在一致性和凝聚度(ΔΔ = 0.85),表明结构化、与评分标准相关联的反馈不仅促进了更高层次的组织能力和准确性。这些发现与此前DWCF的研究一致,显示迭代、全面的反馈能随着时间提升写作准确性,14,15,16,17。
STEP-DWCF-R 工作流程包含三个关键步骤。首先,AI系统使用受限的JSON模式和标准化系统提示,生成涵盖四个类别(语法、词汇、组织、推理)的详细反馈。其次,教师会对输出进行管理,以消除误报,补充与雅思评分标准相符的关键问题,确保措辞可操作且鼓舞人心,并保持与四类模式的一致性。这一审核步骤是主要的排查机制,纠正可能让学习者不堪重负的AI幻觉或过度评分。值得注意的是,STEP-DWCF-R中教师每项任务的审核时间比WCF更短(13.8分钟对23.5分钟),因为AI生成了初始结构化反馈,教师仅进行审核。第三,审核反馈通过基于网络的机器人AI代理界面传递,该界面记录学习者在多轮中的确认和重新提交情况。
与现有方法相比,STEP-DWCF-R 解决了明显的局限性。传统的单发WCF受教员时间限制,且通常有限的持续复习机会。自动化写作评估工具具备可扩展性,但通常呈现静态、碎片化的评论,学习者难以将其转化为有意义的修订 20,21,22。早期的DWCF研究证明了多轮反馈循环的有效性,但其依赖教师自撰的修正在14、15、16、17大班级中引发了可行性疑虑。最新的生成式人工智能反馈研究报告显示,写作结果与教师反馈相当,但缺乏结构化的审核或迭代式表达18,19。STEP-DWCF-R结合了AI可扩展性、教师监督和迭代机器人AI代理交付,实现了教师工作负荷的降低同时提高了复习频率。
我们承认存在若干局限。相对较小的样本量(N=32)限制了我们发现的普遍性,本研究应视为初步调查。这两种条件在反馈剂量上有所不同:WCF组每个任务仅接受一轮反馈,而STEP-DWCF-R组则经历2–3轮迭代。因此,STEP-DWCF-R组的优异表现反映了多次复习周期、AI生成反馈和教师审核的综合效应,而非机器人AI代理或其交付方式的孤立效应。机器人AI代理是一个纯虚拟的基于网络的界面,因此其效果无法与迭代结构本身的效果分离。多模态人类反馈(例如语音加手势)未被列入对照条件,因为这不是传统英语外语写作课堂的标准做法,需要单独的实验范式。未来研究应纳入剂量匹配对照组(如多轮教师反馈),以进一步区分这些组成部分。
尽管存在这些局限,STEP-DWCF-R 框架为 AI 辅助写作教学提供了实用的指导。其模块化架构允许集成到大型EFL课程的学习管理系统中,结构化的四类模式可适配学术写作或学科特定体裁。未来的迭代可能会探索多模态交付,以利用具身代理的理论参与优势,尽管当前的试点已确立了基于文本的迭代人工智能-教师合作的可行性。尽管如此,结果指标、流程指标的一致性以及强烈的评审间可靠性支持了这种多元方法在类似EFL环境中的可行性和潜在有效性。
作者们没有利益冲突。
该工作由马来西亚理科大学桥梁资助,项目编号:R501-LR-RND003-0000001342-00000。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Flask (Web Framework) | Pallets Projects | https://flask.palletsprojects.com | 版本 2.1;用于机器人AI代理网页界面 |
| GPT-5 API | OpenAI | https://platform.openai.com | 模型 gpt-5,温度=0.7;用于生成结构化JSON反馈 |
| Jinja2 | Pallets Projects | https://jinja.palletsprojects.com | 用于网页界面的服务器渲染模板 |
| Python | Python软件基金会 | https://www.python.org | 版本 3.10;后端脚本 |
| Windows 11 | Microsoft | https://www.microsoft.com/windows | AI反馈系统的操作系统 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可