$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
本研究中使用的所有软件和工具均列在材料表中。
评分标准
本研究采用的评估分类涵盖两个主要维度,即流利度与准确性,这两个维度包含了对作为外语的英语写作进行全面评估的全部要求。这些维度旨在衡量写作质量的关键方面,有助于有效沟通以及语言能力水平的展示。流利度模块通过衡量思想表达的流畅程度以及词汇和句子结构的使用效果,来评估写作的自然性、表现力和连贯性。准确性模块则针对语法的精确性、机械性错误的无瑕程度,以及对标准英语规范的遵守情况,理论上可在多个层面上衡量并统计语言中的错误率。(见Table 1)
任务定义
在英语学习者自动写作评估的条件下,本研究提出了一种新的英语写作计算机辅助评估系统模型。与以往研究受限于自动写作评估系统范围的情况相比,本系统通过引入创新的深度学习技术,对数据进行广泛处理,从而在语言分析水平、修改范围以及系统级反馈分析方面帮助克服这些局限性。该双模型系统基于作文的两个最重要指标——流畅性(指文本在自然性、连贯性和表达性方面的程度)和正确性(指文本在语法、机械性及语言错误方面的正确程度),利用神经网络的不同组成部分执行多项评估任务。此外,系统能够识别多个语言层面上的错误,提出纠正措施,并以列表形式提供反馈,帮助用户以系统化的方式提升学生的语言学习效果。为了描述计算机辅助自动评估系统的计算过程,我们提出以下公式(1)–(4)所示的数学模型(见表2)。
(1)
(2)
(3)
(4)
其中:最终得分 = 写作综合评估得分;w1 = 流畅性得分的权重;w2 = 正确性得分的权重;Sf = 基于 BERT 的流畅性得分(经归一化至 [0, 1]);Sc = 指数衰减正确性得分;λ = 控制错误惩罚的衰减常数;σ(x) = 逻辑 sigmoid 激活函数;ErrorRatio = 文本中错误数量与总词元数的比值。流畅性得分通过逻辑 sigmoid 函数 σ(x) 归一化至 [0, 1],而正确性得分则采用指数衰减函数进行评分,以对错误频率施加适当的惩罚。
系统架构与设计
其系统架构采用具有并行处理结构的双模型系统,通过并行评估路径对输入的作文进行并行分析。流畅性与正确性模块分别生成相应的分数,最终综合得分是这两个子分数的加权平均值。此外,正确性模块除了评分外,还提供错误检测与纠正建议(见图1)。
流利度模块
写作流利度可以定义为在语言使用过程中,关于词汇选择的准确性、句式结构的多样性、句法复杂性、连贯性等方面的特征或模式4。流利度评估模型旨在捕捉表达的思想内容,避免出现犹豫或不自然的情况,使表达尽可能接近母语者的交流模式。传统的流利度测量依赖于评分量表,存在评分者间信度的问题。本研究所提出的系统克服了这一缺陷,通过引入基于 BERT 的神经网络,利用深度情境理解自动增强语义连贯性和语言自然性。该架构选择基于 BERT 的优势而作出,研究表明 BERT 在识别上下文关系和语义模式方面表现优异,而这正是流利度测量所必需的。输入序列被送入系统后,经过 12 层 Transformer 结构,并通过多头自注意力机制识别长距离依赖关系和上下文关联(见图 2)。
注意的机制如下:
(5)
设 Q、K 和 V 分别为表示查询、键和值的矩阵,d 和 k 为键向量的维度。CLS 标记嵌入是一种摘要性嵌入,用于记录整个输入序列的整体语义一致性。
流利度评分的计算方法如下:
(6)
其中 hCLS 为 BERT [CLS] 标记的嵌入表示,Wreg 和 breg 为回归头的参数,σ 为 sigmoid 激活函数,用于将输出归一化至 [0, 1] 区间。
正确性模块
正确性评估侧重于语法准确性、机械性精确性以及对标准英语规范的遵守。该维度关注写作的技术层面,包括句法、词形、标点符号和拼写准确性。正确性评估不仅评价语言错误的数量,还考察这些错误对文本整体质量的影响。与强调语义连贯性和自然流畅性的流利度评估不同,正确性评估模块要求精确识别错误并进行系统性修正。该模块能够区分不同类型的错误,评估其严重程度,并提供有针对性的修正建议,以支持学习改进。正确性损失采用经过微调用于语法错误检测与修正的 FLAN-T5 模型。这一选择基于 T5 模型的文本到文本转换能力,使系统能够在同一框架内实现错误发现与相应修正。该系统采用编码器-解码器结构,文本以如下形式进行转换输入:(见图3)
(7)
编码器模块生成上下文相关的表征,不仅捕捉语法倾向,还识别潜在的失败区域:
(8)
通过生成适当的语法变体以纠正被错误识别的错误,解码器生成修正后的序列:
(9)
这种双向处理方式使系统能够识别错误的上下文,并了解如何修正这些上下文,从而使提示在语义上连贯,同时聚焦于语法方面的任何纠正。
误差量化与评分算法
准确性评分通过将原始写作与正确版本进行比较,综合考虑语言错误及其严重程度,错误的严重性依据其在文本中的位置以及对语义理解的干扰程度而定。该方法能够捕捉不同错误类型对文本理解影响程度的差异。评分系统以对数方式强调了错误频率与文本质量低下之间的关系。对原始文本和修改后文本进行词元比对的基本步骤,包含两个基于字符串位对齐技术的比对层级。第二阶段涉及根据已知的语言学分类体系,识别并分类错误类型,这些分类体系将错误区分为语法错误(主谓一致、时态一致性、句法结构可靠性)、机械性错误(大写、标点和拼写)以及用法错误(词语选择、习语表达和语体恰当性)。第三阶段是根据文本总长度计算错误比率。第四步采用指数衰减评分算法,将错误比率转化为可直接解释的正确性得分,以近似模拟错误频率与文本质量之间非相加性和非线性的依赖关系。
误差量化过程的数学处理始于已安装误差比率的计算,该比率提供了归一化的误差安装率,从而允许对不同长度的文本进行公平比较:
(10)
(11)
该校准参数值 2.5 是基于经验并通过人类专家判断进行全面验证后确定的,以确保评分函数能够根据错误频率的增加所导致的文本质量下降,提供与人类理解一致的结果。以这种方式设定该参数值,可保证:错误率较低的文本(Error_Ratio < 0.1)因严格遵循标准英语规则而获得较高的正确性评分;错误率中等的文本(0.1 < Error_Ratio ≤ 0.3)获得中等的正确性评分,表明存在一定的语言问题,但尚不严重;错误率较高的文本(Error_Ratio > 0.3)则因存在严重影响理解可能性的关键语言问题而获得较低的正确性评分。
正确性评分算法在进行正确性评估时,系统性地将基于T5的系统所定位并修正的所有错误作为扣分项,纳入最终错误率的计算中。用于语法错误的扣分机制通过随着错误比例增长而呈指数级下降的方式体现:当错误比例趋近于高值时,扣分趋近于0,表示文本质量极差;而当错误比例等于0时,扣分达到100,表示未检测到任何错误,完全符合英语标准规范。这种数学关系确保了正确性评分能够在整个语言能力谱系中提供显著区分度,并对连续的小幅进步具有敏感响应,从而真实反映语言习得水平。
数据集:训练与评估语料库
训练数据的质量和范围对于双模型系统的性能至关重要。本研究采用了一个设计良好的学生写作文本数据集来开发和评估该模型,该数据集通过不同的写作任务生成。样本包括45名男性和45名女性巴基斯坦大学生,平均年龄为19岁,均将“功能英语”作为必修课程学习。每位学生在八周内完成了八篇作文,包括前测、干预阶段作文和后测任务。每次写作任务允许学生撰写400至450个单词。数据集的统计信息具有以下特征:
70,500 字
平均句子长度:15.7 个词(标准差 = 3.2)
词汇广度(类符-形符比):0.64(标准差 0.08);语法错误密度:每100个词中2.3个(标准差 = 1.1)
所选数据的合理性及数据质量保证
所选数据集基于若干重要考虑因素,以确保其在自动写作评估研究中的丰富性和相关性。首先,选择经济学专业学生群体,是因为其特点与巴基斯坦高等教育中的英语作为外语(EFL)学习者相似,从而能够提供更真实、反映现实情境的写作样本。其次,根据前期研究数据,确定了每篇作文的字数范围为400至450词,该范围在语言复杂性上足以被机器可靠分析,同时在人工评分的一致性方面仍具有可管理的规模。每篇作文均由三位经过培训的英语教师依据标准化的10分制评分量表,从流利度和准确性两个维度进行评估(评分者间信度κ值分别为:流利度维度0.847,准确性维度0.823)。人工评分员的培训过程严格,依据参照雅思(IELTS)和托福(TOEFL)写作评估标准制定的评分细则进行。该数据包含一个由人工标注的数据集,可用于训练和验证基于人工标注数据的模型。
数据预处理与验证的步骤
数据集经过系统化的预处理,包括文本规范化、使用 BERT WordPiece 分词器对文本进行分词,以及进行质量验证检查。为确保数据完整性,未包含提交不完整作业或生成抄袭文本的参与者。最终数据通过分层抽样随机划分为训练集(70%,n = 189)、验证集(15%,n = 41)和测试集(15%,n = 40),以确保在不同语言熟练程度和任务类型之间保持平衡。对一个包含约5000万词的大型参考语料库进行语言学分析,该语料库包括专业编辑的学术文本、报纸文章和已发表的散文。该语料库提供了执行流利度测试所需的语言模式,并通过与标准用法的比较,辅助错误检测流程。在参考语料库中,预处理和索引之前的步骤包括分词、词性标注、句法解析和语义标注,以支持实时评估过程中的高效访问。
流利度模型训练策略
提出了一种顺序优化系统,用于训练数据以实现语言流畅性。训练过程中采用了最先进的技术特性,包括自适应学习率调度、渐进式批量大小以及先进的正则化方法,这些方法可在训练推进过程中防止过拟合,从而保持模型在识别语言流畅性相关语言模式方面的有效性。学习率设定为 5 × 10-4,并采用线性衰减策略,以确保收敛过程稳定,不会在最优参数值附近发生振荡。该学习率通过在 [1 × 10-6, 1 × 10-4] 范围内的网格搜索确定,其中 5 × 10-5 在收敛速度与稳定性之间实现了最合适的权衡。实际训练将限制为仅 3 个训练周期,这一配置基于验证损失追踪的实证效益进行优化,旨在防止过拟合的同时,确保参数得到充分更新,从而使学习有效。此外,设置了早停机制,耐心值为 2 个周期,最小变化量(delta)为 0.001,以防止模型性能下降。
优化采用 AdamW 优化器进行,其简化参数设置如下:β₁ = 0.9(动量项,用于控制一阶矩估计值的指数衰减)、β₂ = 0.999(二阶矩估计项,用于控制二阶矩估计值的指数衰减)以及 ε = 1 × 10⁻8(数值稳定性参数)。权重衰减正则化(λ = 0.01)用于防止参数幅值过度增大,该值通过在 [0.001, 0.1] 范围内进行验证性能分析后选定。复杂的监控机制能够在训练过程中持续跟踪多种指标,以确保模型达到最佳性能并避免过拟合。监控框架包含以下内容:
损失追踪:在每个训练周期内跟踪训练损失和验证损失,当验证损失在连续两个周期内不再改善时,将自动触发早停机制。
性能指标:每经过100次训练步骤,使用验证数据计算预测得分与实际得分之间的皮尔逊相关系数。
梯度感知:通过监测梯度范数来检测梯度消失和梯度爆炸,当梯度范数达到1.0时,应用梯度裁剪。
学习率调度:若检测到验证损失在超过1个epoch内出现平台期,则降低学习率(因子 = 0.5)。
正则化相关:通过系统性消融实验确定了丢弃率(BERT 部分为 0.1,回归头部分为 0.3)。在训练过程中采用了多种基于防止过拟合的正则化方法:(1)使用针对网络中每种类型层优化后的丢弃率进行丢弃正则化(dropout regularization);(2)如上所述的权重衰减(weight decay);(3)根据验证集性能确定的早停法(early stopping);(4)基于回译方法对 15% 的训练样本进行改写以实现数据增强。每轮训练后均保存性能最佳模型的检查点,并根据验证集上的相关性得分选择得分最高的模型。流畅度评估部分所使用的损失函数为均方误差(Mean Squared Error, MSE),这是用于预测连续流畅度得分的回归任务的主要目标函数。其数学形式的损失函数表达如下:
(12)
N 是总训练样本量,y_pred,i 表示第 i 个样本的预测流利度得分,y_true,i 表示由人类专家评估者给出的相应真实得分。该损失函数在以二次方式抑制预测值与实际值误差方面非常有效,使得较大的误差会受到更大的惩罚,同时该函数也是可微的。学习率调度机制高度先进,采用两阶段过程:首先经历一个线性预热阶段,随后进入系统性衰减过程,以实现最佳的收敛特性。在预热阶段中,学习率先从零开始,逐步增加至最大值,之后模型参数将基于训练数据集进行优化。预热阶段的数学表达式为:
(13)
在预热阶段之后,学习率以系统性的线性方式衰减,以避免参数值过度偏离最优解,从而实现稳定的收敛。从数学上讲,衰减阶段表示为:
(14)
其中 t 为当前训练步数,lr_max 为预热阶段达到的最大学习率,warmup 为分配给预热阶段的步数,total 为所有训练周期中的总训练步数。上述调度策略可确保模型在训练初期快速学习,并在收敛阶段保持稳定性。
正确性模型训练策略
正确性模型基于迁移学习策略,采用预训练的 FLAN-T5 模型,以充分利用所需的所有可用语法知识。该模型旨在探究通用语言理解能力,以及针对英语作为第二语言学习者所犯错误的具体信息。所采用的迁移学习方法调用了 pszemraj/flan-t5-large-grammar-synthesis 检查点作为基础模型,该模型在正确性方面具有多项显著优势。由于该模型已经过训练,并具备在多种文本领域中训练所得的高水平语言理解能力,因此能够适应多种写作风格和写作主题。特别是,该模型已在涵盖多种语法错误类型的大型纠错数据集上进行了针对语法的精细化训练,这些错误类型常见于第二语言写作中。此外,该检查点包含强大的错误检测系统,已针对不同类型的错误(即形态学错误、句法错误和语义错误)进行了测试,从而为本研究的内在纠错测试参数提供了理想的比较标准。
领域自适应过程反映了系统性的参数调整,这些调整不会改变预训练模型的语言理解通用能力,但会引入写作评估任务求解的特定特征。该自适应过程的数学推导如下:
(15)
其中,θpretrained 表示预训练模型的参数,该模型编码了通用的语言理解能力和语法知识;Δθdomain 表示从目标写作评估任务中学习到的特定参数更新。这些针对特定领域的参数更新通过在目标数据集上进行基于梯度的优化计算得到,从而确保模型在不破坏其广泛语言能力的前提下,发展出对英语作为外语(EFL)写作中常见错误类型的任务特异性敏感性。
含对照的实验
为了验证EG的功能性,建议采用皮尔逊相关系数作为衡量的关键指标,该指标用于确定自动化评分与人类专家评分之间的线性关联。相关系数可通过以下公式计算得出:
(16)
其中 xi 表示自动化评分,表示人工评分,
和
分别为各自的均值。相关系数的取值范围为 −1 到 1,接近 1 的值表示自动化评分与人工评估之间存在强正相关关系。
(17)
(18)
(19)
基线模型比较
为了评估EG的性能并证明其相较于现有方法的优势,本文将其与成熟的AWE方法及传统的单指标方法进行了深入比较。这些基线比较对于验证EG架构的附加价值至关重要,同时表明将流畅性与正确性评估相结合,相较于孤立关注单一维度的方法,能够带来可量化的性能提升。所选基线模型涵盖AWE的四个类别,每一类均体现了对写作评估方式的不同取向。第一类采用基于单个BERT的模型来评估语言流畅性,这些模型利用Transformer架构分析文本的连贯性与流畅性模式。第二类根植于传统语言学方法,专注于基于规则的语法错误检测系统,其关注点局限于正确性,而忽略了写作质量的其他方面,如衔接性与内容。第三类为基于特征的AWE系统,通过语言复杂性指标——如句子长度变化、词汇多样性以及句法复杂性——生成整体质量评分。第四类则考虑混合系统,通过结合多种表层语言特征,通常采用集成方法或加权平均策略。这些模型未能达到EG神经架构所实现的集成化复杂程度。基线模型的性能通过三个主要维度进行评估。第一个维度衡量系统生成分数与经过培训的人类专家(英语教师)使用标准化评分标准所给评分之间的一致性。第二个维度评估泛化能力,判断模型在不同主题和复杂程度的三类文章中是否保持性能稳定。第三个维度依赖于预测可靠性,通过平均绝对误差、均方根误差和置信区间分析等统计工具,评估评分的准确性与稳定性。综合来看,这三个维度构建了一个稳健的比较框架,凸显了EG系统在实现更高精度与稳定性方面相较于传统方法的优越性。
实验组和对照组
本研究包括90名正在两个完整班级中学习功能性英语课程的本科经济学学生。数据在三个时间点采集:前测、干预阶段和后测,以追踪写作准确性和流利性随时间的变化。该涉及人类受试者的研究已获得巴基斯坦COMSATS伊斯兰堡大学拉合尔校区系咨询委员会的批准。参与者被置于两种条件下:传统人工反馈和计算机辅助反馈。对照组由45名学生组成,他们接受来自经过培训的英语教师的传统书面反馈。学生收到的书面反馈包括整体评分、错误识别,以及教师以评语形式提供的改进建议。实验组同样包括45名学生,他们在课堂上的教学方式相同,但学生的写作通过EG系统提供的快速自动化反馈得到补充,该系统在提交作文后约30秒内即提供有关写作流利度和正确性的诊断信息。
本研究持续进行8周,其中在第1周进行前测,以确定受试者在接受干预前的初始写作水平。在接下来的六周内,实验组接受基于计算机的自然语言处理语义标记反馈,对照组则接受教师评价。最终在第8周进行后测,以分析准确性和流利性得分在前测与后测之间的差异。为了获得具有可比性的结果,要求所有受访者在每次评估阶段完成相似的写作任务,从而最大限度地减少任务难度和内容熟悉度等潜在的混杂变量对写作表现的影响。为确保写作提示的难度水平一致并建立内容效度,写作题目以一致的方式进行选择。论文主题的选择基于学生所涉及的多个内容领域,以避免因长时间重复相同任务而导致的练习效应和参与者厌倦情绪。
在前测阶段,要求参与者撰写一篇400–450词的作文,内容围绕学术目标与职业规划。这一描述性任务基于个人经历与未来展望,要求写作者组织好文章结构,提供清晰的实例,并有条理地陈述个人目标与动机。干预阶段的写作任务涉及不同主题,例如日常生活作息、兴趣爱好、旅行经历、大学第一天、人生中难忘的日子以及与最好朋友共度的美好时光。后测题目与“技术对沟通的影响”这一主题相关,要求作文长度为400–450词。