本方案整合了多模态行为记录,用于评估英译汉书面翻译与视译过程中认知努力的可观测指标以及修订行为的功能有效性。该方法结合了键盘记录、屏幕录制、音频分析、基于转录文本的编码以及标准化质量评估。
本方案整合了多模态行为记录,用于评估英译汉书面翻译与视译过程中认知努力的可观测指标以及修订行为的功能有效性。该方法结合了键盘记录、屏幕录制、音频分析、基于转录文本的编码以及标准化质量评估。
本文介绍了一种多模态行为实验方案,用于考察在英译汉书面翻译和视译过程中可观察到的认知努力与策略性修改的相关表现。对于书面翻译,采用键盘记录与屏幕录制同步的方法;而对于视译,则使用音频录音及逐字转录文本。修改和自我修正片段按类型及其功能结果(有效、中性或有害)进行编码,且独立于整体产出质量评分。在一项包含62名参与者(分为新手组与训练组)的示范研究中,两组参与者以交叉平衡顺序完成两种任务条件。训练组在书面翻译中的平均产出质量得分更高(20.1 ± 2.1 vs. 16.8 ± 2.3),在视译中亦然(18.9 ± 2.4 vs. 15.4 ± 2.6),且有效修改或自我修正的比例更大。由于停顿、删除、反应起始潜伏期和修改密度等指标具有间接性和任务敏感性,因此应将其解释为需通过三角验证的行为相关指标,而非单一构念的直接测量。该方案适用于受控的说明性文本,经重新校准输入方式处理、停顿时长阈值、文本可比性及评分程序后,可适配于其他语言对。
书面翻译与视译在源文本理解、跨语言转换及目标语生成方面具有共性,但二者所面临的任务条件存在差异。书面翻译允许反复阅读和延迟修改,而视译则需在更严格的时间限制下完成口头产出。认知负荷、加工难度与认知努力密切相关,但并非可互换的概念:前者关注任务本身的要求,后者则反映受试者在特定任务要求下所投入的资源。认知努力具有潜在性与多维性;因此,反应时、停顿、删除及修订密度在此被视为行为相关指标,可能反映计划、监控、运动执行过程或加工困难,需综合解读,而不能作为认知努力的直接测量指标1,2,3,4,5,6,7,8。
以过程为导向的研究将产物评分与时间对齐的行为记录相结合,以确定翻译决策发生的时间和方式。击键记录可为产出和修改序列提供信息,但中文输入法的组字过程可能导致物理按键事件与最终输入的字符相分离;因此,需要同步的屏幕录制来重构可见的文本状态9,10,11。停顿阈值是分析时的选择,而非普适的认知边界,较短的阈值可能显著改变基于停顿得出的结论8,12。因此,该实验方案需要明确的同步性核查、阈值敏感性分析,并区分任务特异性指标与共性指标。
仅凭修订频率无法判断监控是否改善了输出结果。书面修订和口头自我修正可能涉及词汇选择、句法、意义或风格,但其功能结果必须根据源文含义及此前的目标语段落来评判。关于英汉和汉英视译处理的研究表明,培训、翻译方向、眼-口协调以及语言特异性问题诱因均可能改变表现模式13,14,15,16。因此,将翻译单元类型、单元结果、最终产出质量以及与表达相关的行为分别编码为独立变量。
该方案适用于成年学习者或经过培训的翻译/口译人员,在受控的计算机会话中处理简短的非专业说明性文本。当能够捕获击键和屏幕记录以用于书面产出,同时能够录制高质量音频以用于口头产出时,该方案最为适用。该框架可适用于其他语言对,但需针对每一对语言及书写系统重新验证文本匹配、信息单元的切分、键盘或输入法行为、停顿阈值以及评分基准17。本示例比较的是任务条件的差异,而非将所有差异单纯归因于模态不同,因为文本长度、时间限制、输出方式和修改机会也各不相同。
所有涉及人类受试者的研究方法均遵循机构指南,并已获得桂林信息科技学院人类研究伦理委员会的明确批准(批准编号:UYHAJ2025899)。在参与研究之前,已从所有参与者处获得书面知情同意。有关本研究中所用设备和软件的完整清单,请参见材料表。
1. 受试者招募与分组
2. 材料选择与初步评估
3. 任务实施与记录设置
4. 行为过程指标的提取
5. 策略性修正与口语自我修复的编码
6. 质量评估与统计建模
参与者基线特征与数据可获得性
问卷共包含62名参与者(31名新手和31名受训者),任务表中共有124条记录,表明每位参与者完成了两项任务记录(表1)。新手组接受系统化翻译训练的时间少于12个月(观察到的最大值为8.6个月),而受训组至少接受了12个月的训练(观察到的最小值为13.3个月)。两组在年龄、性别、英语学习时长、熟练程度以及任务顺序分布方面相似。图1展示了最终分析的样本,并明确区分了任务相关的数据:击键日志和屏幕录屏适用于笔译任务,音频录音和逐字转录适用于视译任务,而质量评分则适用于两种任务。
不同任务条件下的行为特征
两种任务条件之间以及训练组之间在行为特征上存在差异(表2;图2A–E)。书面翻译的完成时间更长,平均停顿时间也更长,而视译在每100个信息单位中低于报告阈值的停顿次数更多。在每种任务条件下,受训组完成任务更快,且平均输出得分更高。这些差异不应被简单解释为纯粹的模态效应,因为文本长度、时间限制、输出方式和修订机会也有所不同。停顿并非总是具有干扰性:一次停顿可能反映未解决的困难、成功的计划、监控过程或输入方式的操作活动,因此停顿指标需结合修订、输出和质量指标共同解读。
策略性修订、自我修复与预测建模
编码框架将事件类型与功能结果分离开来(表3;图3A–D)。与新手相比,受训参与者产生的书面修改类事件更多(每项任务12.4 ± 3.7 次 vs. 8.9 ± 3.0 次),而两组在口头自我修正的总次数上无显著差异(每项任务4.9 ± 1.6 次 vs. 4.4 ± 1.5 次)。然而,在两项任务中,受训组的有效事件比例更高。表4中报告的混合效应汇总展示的是关联性而非因果路径;因此,图3E展示的是报告的固定效应估计值及其置信区间,而非因果图。

图1:参与者流程、任务顺序分配及任务特异性数据可用性。(A)最终纳入分析的62名参与者和124条任务记录。(B)新手组与训练组内的任务顺序交叉平衡分配。(C)数据可用性矩阵,其中击键日志和屏幕录制仅适用于笔译任务,音频录音和逐字转录仅适用于视译任务,而质量评分则适用于两项任务。(D)组别与顺序的平衡性(卡方检验,p = 0.799)。n = 62名参与者(每组31人)。请点击此处查看该图的放大版本。

图2:书面翻译与视译任务条件下的行为特征。 (A) 任务特异性录音设置。(B) 初始/起始延迟和总任务时间。(C) 停顿频率与平均停顿持续时间的联合分布。(D) 任务特异性的删除、修改及口语不流畅指标。(E) 书面产出速率与口语语速。在图B、C和E中,数据点和误差线表示组均值±标准差(SD);在图D中,数据点表示训练组减去新手组的均值差异,误差线表示95%置信区间。每组n = 31名参与者。在图E中,y轴采用对数刻度显示。请点击此处查看该图的放大版本。

图 3:修订/自我修复编码、功能结果与输出质量的关联。(A)独立分配事件类型和功能结果的决策框架。(B)各任务条件下词汇、句法、语义和文体类事件的平均发生次数。(C)有效、中性和负面事件的平均比例。(D)有效事件率与总输出质量得分之间的描述性关联。(E)森林图,显示具有95%置信区间的线性混合效应模型的固定效应(详见表 4);该图表示关联关系,并不代表因果路径模型。请点击此处查看此图的放大版本。
| 变量 | 新手组 (n = 31) | 训练组 (n = 31) | p 值 |
| 年龄,年 | 21.9 ± 1.7 | 22.4 ± 1.9 | 0.279 |
| 女性,n (%) | 22 (71.0) | 21 (67.7) | 0.779 |
| 英语学习时长,年 | 12.4 ± 2.1 | 12.9 ± 2.2 | 0.36 |
| 英语水平得分 | 548.6 ± 41.3 | 562.4 ± 45.8 | 0.216 |
| 笔译训练时长,月 | 5.6 ± 3.0 | 18.7 ± 5.4 | <0.001 |
| 视译训练时长,月 | 2.3 ± 2.1 | 13.9 ± 5.7 | <0.001 |
| 先前完成书面翻译任务 ≥5 次,n (%) | 9 (29.0) | 24 (77.4) | <0.001 |
| 先前完成视译任务 ≥5 次,n (%) | 5 (16.1) | 20 (64.5) | <0.001 |
| 先进行书面翻译,n (%) | 16 (51.6) | 15 (48.4) | 0.799 |
| 先进行视译,n (%) | 15 (48.4) | 16 (51.6) | 0.799 |
表1:按组别划分的参与者特征及基线语言训练情况。 连续性数据以均值±标准差表示,分类数据以例数(百分比)表示。报告的p值反映组间比较结果,用于验证基线人口学特征的均衡性,并确认训练时长的预期差异。
| 变量 | 初学者笔译(n = 31) | 受训者笔译(n = 31) | 初学者视译(n = 31) | 受训者视译(n = 31) | 任务效应 p | 组别效应 p |
| 初始/起始潜伏期,s | 31.8 ± 12.4 | 24.6 ± 9.7 | 14.2 ± 5.6 | 10.8 ± 4.2 | <0.001 | 0.003 |
| 总任务时间,s | 1038.5 ± 168.2 | 925.4 ± 151.6 | 305.6 ± 59.3 | 274.8 ± 50.7 | <0.001 | 0.004 |
| 停顿频率,每100个信息单位 | 18.6 ± 6.1 | 14.2 ± 5.0 | 24.8 ± 7.4 | 19.6 ± 6.3 | <0.001 | 0.001 |
| 平均停顿持续时间,s | 4.1 ± 1.2 | 3.3 ± 1.0 | 2.7 ± 0.8 | 2.3 ± 0.7 | 0.012 | 0.002 |
| 产出/语速,汉字/分钟 | 28.6 ± 6.7 | 34.1 ± 7.5 | 93.4 ± 18.9 | 108.7 ± 20.4 | 0.001 | |
| 删除率,% | 8.9 ± 3.4 | 6.8 ± 2.7 | 0.009 | |||
| 修订密度,每100个汉字 | 7.6 ± 2.8 | 8.9 ± 3.1 | 0.087 | |||
| 填充停顿频率,每分钟 | 5.7 ± 1.9 | 4.2 ± 1.6 | 0.002 | |||
| 重复频率,每分钟 | 4.9 ± 1.8 | 3.6 ± 1.4 | 0.004 | |||
| 错误起始频率,每分钟 | 2.8 ± 1.1 | 2.0 ± 0.9 | 0.006 | |||
| 自我修正频率,每分钟 | 4.8 ± 1.7 | 3.9 ± 1.4 | 0.031 | |||
| 总质量评分,0–25 | 16.8 ± 2.3 | 20.1 ± 2.1 | 15.4 ± 2.6 | 18.9 ± 2.4 | 0.002 | <0.001 |
| 准确性,0–5 | 3.4 ± 0.7 | 4.1 ± 0.6 | 3.1 ± 0.8 | 3.8 ± 0.7 | 0.004 | <0.001 |
| 完整性,0–5 | 3.3 ± 0.8 | 4.0 ± 0.6 | 3.0 ± 0.8 | 3.7 ± 0.7 | 0.006 | <0.001 |
| 词汇恰当性,0–5 | 3.2 ± 0.7 | 4.0 ± 0.6 | 3.1 ± 0.7 | 3.8 ± 0.6 | 0.041 | <0.001 |
| 连贯性,0–5 | 3.5 ± 0.6 | 4.0 ± 0.6 | 3.1 ± 0.7 | 3.8 ± 0.6 | 0.003 | <0.001 |
| 目标语言自然度,0–5 | 3.4 ± 0.7 | 4.0 ± 0.6 | 3.1 ± 0.7 | 3.8 ± 0.7 | 0.007 | <0.001 |
表2:不同任务条件和组别下的行为过程指标及产出质量。 数值以均值±标准差表示。报告的p值反映了任务模式(书面翻译与视译)和培训背景(新手与受训者)对各项过程和质量变量的主效应。
| 变量 | 新手书面翻译 | 训练者书面翻译 | p 值 | 新手视觉口译 | 训练者视觉口译 | p 值 |
| 词汇修订/自我修正,n/任务 | 3.4 ± 1.5 | 4.2 ± 1.7 | 0.053 | 1.8 ± 0.8 | 1.7 ± 0.7 | 0.612 |
| 句法修订/自我修正,n/任务 | 2.1 ± 1.1 | 3.0 ± 1.2 | 0.004 | 1.1 ± 0.7 | 1.2 ± 0.8 | 0.645 |
| 语义修订/自我修正,n/任务 | 1.8 ± 1.0 | 2.5 ± 1.1 | 0.011 | 0.9 ± 0.6 | 1.1 ± 0.7 | 0.232 |
| 风格修订/自我修正,n/任务 | 1.6 ± 0.9 | 2.7 ± 1.2 | <0.001 | 0.6 ± 0.4 | 0.9 ± 0.6 | 0.026 |
| 总修订/自我修正事件数,n/任务 | 8.9 ± 3.0 | 12.4 ± 3.7 | <0.001 | 4.4 ± 1.5 | 4.9 ± 1.6 | 0.209 |
| 有效事件比例,% | 52.6 ± 13.5 | 68.4 ± 12.1 | <0.001 | 45.1 ± 14.2 | 62.3 ± 13.0 | <0.001 |
| 中性事件比例,% | 31.8 ± 10.4 | 22.7 ± 8.8 | 0.001 | 35.6 ± 11.7 | 25.4 ± 9.6 | 0.001 |
| 有害事件比例,% | 15.6 ± 7.1 | 8.9 ± 5.6 | <0.001 | 19.3 ± 8.6 | 12.3 ± 6.8 | 0.001 |
表3:不同任务条件下书面修改和口头自我修正的类型及有效性。 各类事件以每项任务的平均次数(±标准差)表示,功能结果以平均百分比(±标准差)表示。p值表示每种任务模式下组间差异的显著性。
| 固定效应 | β | 标准误 | 95% 置信区间 | p 值 |
| 截距 | 16.74 | 0.42 | 15.91 至 17.57 | <0.001 |
| 任务模态:视译 vs. 书面翻译 | -1.08 | 0.29 | -1.65 至 -0.51 | <0.001 |
| 训练组:受训者 vs. 新手 | 2.84 | 0.47 | 1.91 至 3.77 | <0.001 |
| 任务模态 × 训练组 | 0.26 | 0.47 | -0.67 至 1.19 | 0.581 |
| 停顿频率,每 100 个信息单位 | -0.12 | 0.05 | -0.22 至 -0.02 | 0.018 |
| 平均停顿持续时间,秒 | -0.34 | 0.16 | -0.66 至 -0.02 | 0.041 |
| 修订/自我修正密度 | 0.07 | 0.07 | -0.07 至 0.21 | 0.334 |
| 有效修订/自我修正率,每增加 10% | 0.56 | 0.13 | 0.30 至 0.82 | <0.001 |
| 删除/不流畅负担 | -0.18 | 0.08 | -0.34 至 -0.02 | 0.027 |
| 产出/语速,标准化 | 0.42 | 0.19 | 0.04 至 0.80 | 0.032 |
表4:线性混合效应模型预测总体输出质量的报告固定效应。 该汇总详细列出了所有指定任务和行为预测因子的非标准化系数(β)、标准误(SE)、95%置信区间(CI)以及精确的p值。
本研究展示了一种多模态方案,用于测量英汉书面翻译与视译过程中可观察的流程指标,并对策略性修改进行编码。该方案并不直接测量单一的认知努力变量,而是将延迟、停顿、删除及修改模式解读为对任务敏感的行为相关指标,其意义需结合同步记录与产出质量证据进行三角验证。1,2,3,4,5,6,7,8两项任务在材料、时间安排、输出方式和修改机会上也存在差异,因此这些典型对比描述的是任务条件的差异,而非孤立的模态效应。本研究主要的分析贡献在于将修改频率与功能结果分离开来。在所报告的摘要中,经过训练的参与者进行书面修改的次数更多,而非更少,而各组之间口头自我修正的总次数并无显著差异。他们较高的有效修改比例表明,监控质量可能比原始频率更具信息价值,但这一解释依赖于透明的决策规则、独立的结果编码以及报告的信度。代码本与实例分析见 补充文件 1 旨在使这一区分具有可重复性,而非出于宣传目的。
关键步骤包括跨记录对齐、音频质量检查、转录文本验证以及编码一致性。在对齐日志与录音时,应核对可用的时间戳和任务边界提示。转录前必须检查音频是否存在削波及是否清晰可辨,且需根据波形图和转录文本核实所建议的停顿边界。对于中文输入,不应将组字按键操作等同于已提交字符的修改。上述检查与纠正措施均应记录在质量控制日志中。
本研究的解释存在若干局限性。该研究使用了学生和受训人员群体、简短的通用说明性文本、不同长度的任务和时间限制,以及基于可获得性的样本。任务条件在输出方式和修改机会方面也存在差异,且数据集未包含独立抽样的源文本标识符,无法估计文本层面的变异情况。此外,停顿阈值属于操作性选择,较长的停顿可能既反映有效的计划过程,也可能反映尚未解决的困难。若要将结论推广至专业人员、特定领域、其他语言对或其他书写系统,需重新验证材料、输入方式处理、阈值设定及评分锚定点。
未来的研究可将行为记录与眼动追踪、瞳孔测量或主观工作负荷测量相结合,以检验哪些停顿和修改与注意力、感知到的努力程度或成功的计划相对应5,6,13,14,15,16。Shreve 等人将眼动追踪用于视译研究,不应被引用为瞳孔测量研究18;Seeber 直接讨论了瞳孔测量的应用5。此类多模态扩展研究应保持任务需求、投入的努力、观察到的行为与表现之间的区分。因此,本方案最适合作为一种透明的过程评估框架,其指标可支持但本身不足以确立关于潜在认知努力的结论。
作者声明不存在任何商业或财务利益冲突。关于人工智能的使用,作者披露在修订过程中仅使用了OpenAI Codex,以协助语言编辑、一致性检查、修订标记的生成,以及基于作者提供的数据重新生成图表布局。作者已仔细审阅所有人工智能辅助生成的内容,并对最终稿件的准确性、完整性和原创性承担全部责任。本研究所依据的结构化工作簿已在Zenodo公开获取(https://doi.org/10.5281/zenodo.21189434)。补充文件1包含编码手册和锚定质量评估标准。
作者感谢桂林信息科技学院提供的实验室支持,感谢对源文本进行评估的双语专家、独立评分员以及参与人员。本研究未从公共、商业或非营利机构的任何资助单位获得特定资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 声学分析软件(Praat) | Paul Boersma and David Weenink | https://www.fon.hum.uva.nl/praat/ | |
| 台式计算机 | Dell | OptiPlex | |
| 数字音频录制软件(Audacity) | Audacity Team | https://www.audacityteam.org/ | |
| 按键记录软件(Inputlog) | University of Antwerp | https://www.inputlog.net/ | |
| 屏幕录制软件(OBS Studio) | OBS Project | https://democreator.wondershare.com/ | |
| 统计分析软件(SPSS) | IBM | Version 27 |
本文已发表
视频即将推出