本文综述了一种用于语言理解研究的眼动追踪方法。为了获得可靠的数据,必须遵循该方案中的关键步骤,其中包括正确设置眼动仪(例如,确保眼图像和头像质量良好)以及精确的校准。
本文综述了一种用于语言理解研究的眼动追踪方法。为了获得可靠的数据,必须遵循该方案中的关键步骤,其中包括正确设置眼动仪(例如,确保眼图像和头像质量良好)以及精确的校准。
本研究旨在描述并评估一种用于量化语言加工与视觉世界感知之间相互作用不同方面的研究方法。眼动模式的记录为视觉情境以及语言/世界知识在语言理解中的作用提供了有力证据。早期研究通过评估物体-情境效应来检验 语言加工中的模块化理论。在引言中,我们阐述了后续研究如何将更广泛的视觉语境在语言加工中的作用作为一个独立的研究课题,探讨诸如我们对事件和说话者的视觉感知如何影响语言加工等问题。 理解基于 理解者的体验。所考察的视觉语境方面包括动作、事件、说话者的注视方向、情绪性面部表情以及物体的空间构型。在概述眼动追踪方法及其不同应用之后,我们在实验方案中列出了该方法的关键步骤,说明如何成功运用该方法研究视觉情境下的语言理解过程。最后部分展示了三组代表性结果,并阐述了眼动追踪技术在探究视觉世界感知与语言理解之间相互作用方面的优势与局限性。
心理语言学研究强调了眼动分析在理解语言理解过程中所涉及机制方面的重要性。从注视记录推断理解过程的核心是一种将认知与眼动联系起来的假设5。眼动主要有三种类型:扫视运动、前庭-眼动和光滑追踪运动。扫视是快速且呈弹道式的运动,通常在无意识状态下发生,并被可靠地与 注意力转移相关联6。扫视之间相对稳定的注视时刻被称为“注视点”,被认为反映了当前的视觉注意力。测量注视点的位置及其持续时间与认知过程之间的关系,被称为“眼动追踪法”。该方法早期的应用主要用于在严格的语言情境下研究阅读理解(参见 Rayner7 的综述)。在此方法中,对某个词或句子区域的注视时长被认为与加工难度相关。然而,眼动追踪也被用于研究在观察现实世界物体(或计算机屏幕上的图像2)时的口语理解过程。在这种“视觉世界”眼动追踪范式中,物体的观察受到语言的引导。例如,当理解者听到the zebra(斑马)时,他们对屏幕上斑马图像的注视被认为反映了他们正在思考这种动物。在所谓的视觉世界范式中,理解者的视线被视作口语理解以及相关知识激活的反映(例如,当听者听到grazing(吃草)时,他们也会注视斑马,表明该动作由斑马执行)2。这类注视行为表明语言与现实世界之间的关系与眼动之间存在系统性联系2。量化这种联系的一种常用方法是计算注视屏幕上不同预设区域的比例。这使得研究人员能够直接比较(在不同实验条件下、不同 被试和项目之间)特定时间点对不同物体所分配的注意力程度,并以毫秒级的时间分辨率观察这些数值的变化。
心理语言学研究利用视觉世界中的眼动追踪来区分关于心智结构的竞争性理论假设1。此外,对图示物体的眼动注视还表明,理解者能够在语言语境足够受限的情况下进行增量式语义解释8,甚至对即将出现的词语产生预期9。此类眼动数据还揭示了多种其他理解过程,例如词汇歧义消解10,11、代词指称消解12、利用视觉语境信息消除结构和主题角色分配的歧义13,14,16,以及语用过程15等众多方面4。显然,在语言理解过程中对物体的眼动可为相关认知过程提供重要信息。
眼动追踪方法具有非侵入性,可用于婴儿、幼儿及成年语言使用者。其主要优势在于,与探测任务中瞬时性的反应或验证任务中的按键反应不同,该方法能够以毫秒级的时间分辨率,持续揭示语言如何引导注意力,以及视觉情境(以物体、动作、事件、说话者目光、情绪性面部表情以及物体的空间构型等形式呈现)如何影响语言加工过程。在句子理解过程中,眼动指标的连续性可与句子后或实验后的其他测量手段(如外显的图片/视频-句子匹配判断、理解问题和记忆回忆任务)形成良好互补。这些任务中的外显反应有助于深入理解眼动记录结果,揭示语言理解、记忆和学习的最终结果2。将眼动追踪与其他任务相结合 ,已揭示出视觉情境的不同方面在人的一生中对视觉注意力以及(即时和延迟)语言理解的调节程度。
语言(口语或书面语)与场景的呈现方式可以是同时的或相继的。例如,Knoeferle 及其合作者17 在口语句子呈现前1,000毫秒展示场景,并在口语句子播放期间持续呈现 理解。他们报告了证据表明,在德语中,与宾语-动词-主语(OVS)句式相比,动作事件的剪贴画图示有助于解决主语-动词-宾语(SVO)句式中的局部结构歧义。Knoeferle 和 Crocker18 在书面句子呈现之前展示一幅剪贴画场景,并测试剪贴画事件在阅读过程中的逐步整合 句子理解。他们观察到渐进式一致性效应,即当句子成分不匹配时,参与者的阅读时间更长与 与前一场景中描述的事件相匹配。在另一种刺激呈现变式中,参与者首先阅读一句描述空间关系的句子,随后看到一个包含物体线描图的特定空间排列场景19本研究通过要求参与者对给定句子与场景的匹配程度进行评分,并在过程中记录其眼动轨迹,来评估计算空间语言模型的预测能力。 场景询问。参与者的注视模式受到其所面对物体形状的调节——部分证实了模型预测,并为模型优化提供了数据。
尽管许多研究使用了剪贴画表示17,18,19,20,21,22,23,但也可以将真实物体、这些物体的视频或静态照片与口语结合使用1,21,24,25,26,46。Knoeferle 及其同事采用了真实世界场景24,而 Abashidze 及其同事则使用录像呈现方式来考察动作事件和时态效应25。改变场景的具体内容(例如,是否描绘动作)22,27,38 是可行的,也可揭示视觉语境效应。Rodríguez 及其合作者的一项相关研究26探讨了录像呈现的视觉性别线索对随后呈现的口语句子理解的影响。参与者观看展示男性或女性手部执行典型性别相关动作的视频,随后在同时查看并排显示的两名人物照片(一名男性和一名女性)时,听到描述典型男性或女性动作事件的句子。这种丰富的视觉与语言环境使作者能够区分语言中介的刻板知识对理解的影响与视觉呈现的(手部)性别线索的影响。
该范式另一项应用聚焦于语言加工中的发展性变化。在口语理解过程中对物体的眼动研究表明,所呈现事件的影响在4至5岁儿童27,28以及老年人29中均能实时显现,但相较于年轻成人略有延迟。Kröger 及其合作者22在一个实验中考察了韵律线索和格标记的作用,并在成人与儿童之间跨实验进行了比较。参与者在观察一个具有歧义的动作事件场景的同时,聆听一句与之相关且格标记明确的德语句子。眼动结果表明,不同的韵律模式在消除“谁对谁做了什么”的歧义时,对成人和4至5岁儿童均未产生帮助。然而,句首的格标记影响了成人的眼动行为,却未影响儿童的眼动。这表明, 5岁儿童对格标记的理解尚不够稳固,无法支持主题角色的分配(参见 Özge 及其合作者的研究30),至少在动作事件本身未能消除主题角色关系歧义的情况下如此。这些结果引人关注,因为它们与先前关于韵律对主题角色分配影响的研究结果相悖31。Kröger 及其合作者22提出,(或多或少具有支持性的)视觉语境可能是导致这些不同发现的原因。如果这些解释成立,则突显了 语境在人的一生中语言理解过程中的重要作用。
眼动追踪法与图片(或视频)-句子验证任务的测量指标相结合效果良好18,20,26,图片-图片验证任务32,语料库研究24,评分任务19或实验后回忆任务25,33. 阿巴希泽及其合作者34 以及Kreysa和合作者33 研究了说话者注视方向与现实世界动作视频之间的相互作用34 以及说话者视线与动作描绘33,作为即将到来的句子内容的线索。通过将语言理解过程中对场景中眼动的追踪与实验后的记忆任务相结合,研究者更深入地理解了听者对说话者目光以及所呈现动作的感知之间的相互作用,及其对即时语言加工和记忆回忆的影响。结果揭示了动作的独特贡献 与 说话者凝视对实时理解的影响 与 实验后记忆回忆过程
尽管眼动追踪方法具有很高的灵活性,但仍需遵循某些标准 关键。以下方案概述了一种通用的实验流程,可根据研究人员的具体需求针对不同类型的研究问题进行调整。该方案是柏林洪堡大学心理语言学实验室以及比勒费尔德大学认知交互技术卓越集群(CITEC)前语言与认知实验室所采用的标准程序。本方案描述了桌面实验和远程实验两种设置,其中远程设置推荐用于儿童或老年人的研究。文中提及的所有实验均采用此流程。 代表性结果 使用采样频率为1,000 Hz的眼动仪设备,并配合头部稳定装置、用于向受试者呈现测试内容的计算机(显示计算机)以及用于监控实验过程和受试者眼动轨迹的计算机(主机计算机)。该设备与其前代产品的主要区别在于支持双眼眼动追踪。本方案设计具有足够的通用性,可适用于其他配备头部稳定装置并采用双计算机设置(主机+显示)的眼动追踪设备。但需注意,不同设备在处理校准失败或追踪丢失等问题时可能采用不同的方法,此时实验人员应参考所用设备的具体用户手册。
本方案遵循数据采集机构的伦理准则, 即,比勒费尔德大学认知交互技术卓越集群(CITEC)与柏林洪堡大学。在比勒费尔德大学开展的实验均经该校伦理委员会 individually 批准。柏林洪堡大学心理语言学实验室拥有经德国语言学学会(Deutsche Gesellschaft für Sprachwissenschaft, DGfS)伦理委员会批准的实验室伦理规程。
1. 桌面设置
注意:以下是眼动追踪实验中的关键步骤。
2. 远程设置:针对儿童和老年人研究的设置调整
注意:本节仅描述远程设置与步骤1中所述的桌面设置之间的差异。此处未明确提及的事项,应视为与步骤1中描述的程序完全相同。
3. 调整设置以进行阅读研究
注意:在研究视觉背景对阅读的影响时,必须特别关注校准和重新校准过程。与视觉世界范式研究不同,阅读过程中的眼动追踪需要更高的设备精度,因为必须精确捕捉逐词乃至逐字母的阅读模式。
Münster 及其合作者的一项研究37 研究了句子结构、所描绘动作与面部情绪线索在语言理解过程中的相互作用。该研究非常适合用于说明该方法的优势与局限性,因为它既显示出所描绘动作对句子理解的显著效应,也显示出面部情绪线索的边缘效应。作者制作了时长5秒的视频,内容为一名女性的面部表情从静息状态转变为快乐或悲伤的表情。此外,他们还构建了情绪效价为正的德语宾语-动词-副词-主语(OVAdvS)结构句子,形式为“这个[宾语/受事]宾格] [动词] [积极副词] [主语/施事者主格].' 通过 肯定副词与“高兴”视频匹配,与“悲伤”视频不匹配,原则上允许对施事者(即面带微笑并被肯定副词描述为快乐行动的角色)进行预期。在播放说话者视频后,句子伴随一幅包含施事者、受事者和干扰角色的剪贴画场景的两个版本之一出现。在一个版本中,施事者被描绘为正在对受事者执行所述动作,而干扰角色则执行不同的动作;另一个版本则描绘角色之间无任何动作发生。场景中的眼动数据揭示了动作内容以及说话者面部表情对句子理解的影响。
动作描述迅速影响了参与者的视觉注意力,意味着当所提及的动作是(时,参与者更多地关注施动者而非干扰物与 未被描绘。这些表情是预期性的(即,出现在提及施事者之前),表明动作呈现比句子更早地澄清了施事者。动作呈现的最早效应出现在动词阶段即,动词介导了与动作相关的施事者)。相比之下,先前说话者是微笑还是看起来不高兴,对施事者的预期并无明显影响(图2)。后一结果可能反映了说话者的微笑与描述性语句中表示动作主体情绪的肯定性句内副词之间的关联较弱(相较于直接的动词-动作关联所中介的动作相关主体)。或者,这一结果可能与任务设计及刺激呈现方式特异性相关:例如,在更具社会互动性的任务中,或在句子理解过程中(而非理解前)呈现说话者面部表情时,情绪效应可能会更加显著。然而,在理解过程中呈现说话者微笑的面部可能使参与者将注意力集中于面部,从而忽略场景中的其他内容,可能掩盖了被操纵变量本应产生的可观测效应(来源:未发表数据)。
在该范式的另一种变体中,Guerra 和 Knoeferle32 探讨了空间语义上的世界-语言关系是否能够在阅读过程中调节对抽象语义内容的理解。Guerra 和 Knoeferle 借鉴了概念隐喻理论38的观点,即空间距离(例如,接近性)可为抽象语义关系(例如,相似性)的意义提供基础。与该假设一致,当抽象名词在意义上相似(而非相反)且先前呈现的视频传达了接近性(而非距离;纸牌相互靠近而非远离)时,参与者阅读这些并列抽象名词的速度更快。在另一系列研究中39,句子描述了两个人之间的互动为亲密或不友好,结果发现,当两张纸牌相互靠近的视频出现时,参与者阅读表达社会接近性/亲密性的句子区域速度加快。值得注意的是,即使句子并未提及视频中的物体,空间距离仍迅速且逐步地影响了句子的阅读过程。这些视频独特地调节了阅读时间,其调节作用取决于空间距离与句子意义在语义及社会层面之间的一致性。这些效应既体现在首次阅读时间(即首次注视某一预设句子区域的持续时间),也体现在该句子区域的总阅读时间上(参见 图3 以了解 Guerra 和 Knoeferle 研究结果的示意图)32。然而,分析还揭示了参与者之间存在显著的个体差异,因此得出结论:与动词-动作关系的影响相比,此类细微的纸牌距离效应可能并不那么稳健,这仅是其中一个例子。
另一组研究说明了句子结构的变化如何有助于评估视觉情境效应的普遍性。Abashidze 及其合作者34 以及Rodríguez及其合作者26 考察了近期动作对后续口语句子加工的影响。在这两项研究中,参与者首先观看了一段动作视频(例如,一名实验者为黄瓜调味,或女性的手在烤蛋糕)。接着,他们听了一句德语句子,该句子要么与最近的动作相关,要么与接下来可能进行的另一动作相关(为番茄调味)34;构建模型26)。在理解阶段,受试者观察显示两个物体(黄瓜、番茄)的场景34 或两名代理人面部的照片(一张女性代理人面部照片,名为“Susanna”;一张男性代理人面部照片,名为“Thomas”)26. 在Abashidze及其合作者的研究中34,说话者首先提到实验者,然后是动词(例如,香料),引发对某一主题的预期(例如,黄瓜或番茄)。在Rodríguez及其合作者的研究中26,说话者首先提到一个主题(蛋糕),然后提到动词(烘焙),从而引发听者对动作执行者(女性:Susanna,或男性:Thomas,图示)的预期 通过 一张女性面孔和一张男性面孔的照片。
在两项研究中,核心问题在于:人们在理解过程中,是否会根据所提供的进一步上下文线索,(在视觉上)预期最近动作事件中的主题/施事者,还是预期另一个主题/施事者。在Abashidze及其合作者的研究中34,实验者的注视在动词出现之初(德语原文直译:“实验者-施事者很快会品尝……”)即提示了未来的主题对象(西红柿)。在Rodríguez及其合作者的研究中26,当提及主题和动词时,与性别相关的刻板行为知识即被激活例如,“蛋糕主题即将烘焙……”)。在这两组研究中,参与者优先查看了最近动作的目标/施事(黄瓜)34 或苏珊娜26)相较于另一种选择(未来的/其他性别的)目标(西红柿34 或 Thomas26)在句子中。
因此,这种所谓的“近期事件偏好”在句子结构和实验材料存在较大变化的情况下似乎依然稳健。然而,它受到同时呈现的场景中视觉限制的调节。26,因此,在提供动词主题的合理图片之外,再呈现具有性别特征的执行者图片,可减少对最近观察到的动作事件的依赖,并根据语言所传递的性别刻板印象知识调节注意力。 图4 展示了Rodríguez及其合作者实验的主要发现26.
尽管这种视觉世界范式产生了可靠的结果,但其他研究强调了联结假设的复杂性(及局限性)。Burigo 和 Knoeferle20 发现,当参与者聆听诸如 Die Box ist über der Wurst(“盒子在香肠上方”)这样的语句时,大多会按照语句内容去查看这些物体的剪贴画图示。但在部分试验中,参与者的眼动脱离了当前提及的内容。当听到“香肠”并至少查看过一次香肠图像后,在加速验证任务中(实验1),参与者下一次查看回到盒子的比例约为21%;而在句后验证任务中(实验2),该比例高达90%。这种眼动模式表明,语言指称(听到“香肠”)仅引导了部分眼动行为(查看香肠),而非全部眼动行为(查看盒子)。此类设计可用于区分词汇指称过程与其他过程(包括句子层面的解释性过程)。然而,鉴于将眼动与认知和理解过程相联结存在模糊性,研究人员在基于眼动比例的相对差异对语言加工的不同层次作出推论时必须谨慎。

图 1:数据采集环境概览。 该图展示了用于数据采集和预处理的各种软件与硬件组件之间的相互关系。请点击此处查看此图的放大版本。

图2:明斯特及其合作者37的代表性结果。 这些图示显示了在动词区域(针对所描绘的动作)以及动词-副词区域(针对情绪启动效应)中,各受试者在不同条件下的平均注视概率对数比。结果显示,当句中提到的动作被呈现时,受试者注视目标图像的比例显著高于未呈现该动作时。情绪性面部启动效应的结果则较不明确:仅表明当面部启动具有正性情绪效价(微笑)时,对目标的平均注视对数比略高于负性效价(悲伤表情)时。误差线表示平均值的标准误。本图改编自 Münster et al.37。请点击此处查看此图的放大版本。

图3:Guerra 与 Knoeferle32 的代表性结果。 本图展示了(不)相似性形容词的首次通读时间(单位:毫秒)的平均值。结果显示,在观察到两张扑克牌移动得更近之后,相似性句子的阅读时间比移动得更远时更短。误差线表示平均值的标准误。此图改编自 Guerra 和 Knoeferle32。请点击此处查看此图的放大版本。

图 4:Rodríguez 及其合作者26的代表性结果。 本图显示了在动词区域中,各受试者在不同条件下的平均注视概率对数比。注视比例高于 0 表示更偏好目标施动者图像,低于 0 表示更偏好竞争施动者图像。结果表明,当句子中提到的物体和动词与先前录制的视频事件一致时,参与者更倾向于查看目标施动者图像;而不一致时则倾向较低。此外,当句子所描述的动作符合性别刻板印象时,参与者对目标施动者图像的注视更多。误差线表示平均值的标准误。本图改编自 Rodríguez et al.26。请点击此处查看此图的放大版本。
总之,对视觉语境中眼动追踪各种变体的研究揭示了视觉场景影响语言理解的多种方式。与反应时测量等方法相比,该方法具有关键优势。例如,持续的眼动为我们提供了观察语言理解过程的窗口,并揭示了这些过程如何随着时间与我们对视觉世界的感知相互作用。此外,参与者在进行语言理解时,并不一定需要执行明确的任务(例如判断句子的语法正确性)。 通过 按钮按压)。这使得研究人员能够将该方法应用于可能难以完成除注视以外其他明显行为反应的人群,例如婴儿、儿童,以及在某些情况下的老年人。眼动追踪具有生态学效度,因为它反映了参与者的注意力反应——这类似于人类在或多或少专注地倾听正在展开的言语时,对周围环境中与交流相关事物所进行的视觉探究。
视觉世界范式的一个边界(或特征)在于,并非所有事件都能被直接且无歧义地呈现。具体物体和事件当然可以被呈现,但如何最佳地呈现抽象概念则尚不明确。这可能会限制(或界定)通过眼动追踪视觉世界范式对语言加工与视觉感知之间交互作用的理解。另一个挑战涉及观察到的行为与理解过程之间的联结假设。眼动注视是一种单一的行为反应,很可能反映了语言理解过程中多种子过程的参与。例如、词汇通达、指称过程、语言介导的预期、视觉语境效应等)。鉴于这一认识,研究者必须谨慎,避免对观察到的注视模式进行过度解读或误读。为解决这一问题,先前的研究强调了理解子任务的作用,以澄清对注视记录的解释。40.
提高眼动数据可解释性的一种方法是将其与其他测量手段相结合,例如事件相关脑电位(ERPs)。通过使用在时间精细度上相当且在关联假设上互补的两种方法来研究同一现象,研究人员能够排除结果的其他可能解释,并深化对每种单独测量指标的解读41。这一方法已在不同实验之间得到应用43,而近年来更进一步在单个实验中实现整合(尽管目前仅限于严格的语言学情境)44。未来的研究将极大受益于这种方法学上的整合,以及与试次后任务和实验后任务的持续结合。
眼动追踪方法不仅可以复现已有的研究成果,还能检验关于场景中视觉注意与语言理解之间相互作用的新假设。由于即使是实验人员的微小错误也可能影响 数据质量,因此必须严格遵循本方案中所述的实验流程。例如,在阅读研究中,相关分析区域通常是单个词语甚至字母,这意味着即使是很小的校准误差也可能扭曲实验结果(参见Raney及其同事的文章42)。方案中的步骤1.4和1.5,即眼动仪的校准以及漂移检查/漂移校正,尤为重要,因为它们直接影响记录的准确性。若未能正确校准眼动仪,可能导致设备无法准确追踪眼球运动至预设的兴趣区域。此类追踪失败将导致数据点缺失,降低统计效能,而在研究那些效应量较小且极为细微的现实世界与语言之间的关联时,这一问题尤为突出(参见代表性结果部分中Guerra与Knoeferle32以及Münster及其同事37 所描述的实验)。
鉴于需要最大限度地提高设备的 功率和灵敏度,实验人员了解如何处理实验过程中经常出现的问题显得尤为重要。例如,佩戴眼镜的受试者其瞳孔位置和眼球运动可能因眼镜镜片上的光线反射而导致校准困难。解决此问题的一种方法是在显示计算机上镜像受试者眼睛的图像,并引导其移动头部,直到屏幕上不再显示眼镜上的光反射,这意味着摄像头已不再捕捉到该反射。校准失败的另一个原因可能是瞳孔收缩,这可能是由于光线过强所致。在此情况下,调暗实验室内的光线将有助于扩大瞳孔,从而帮助眼动仪准确地检测瞳孔。
最后,我们希望探讨视觉世界范式在二语学习研究中的潜在应用价值。该范式已被成功应用于心理语言学研究,用以考察跨语言的词汇与音位交互等现象。46,47,48此外,应用语言学领域关于第二语言习得的文献中,视觉注意与语言学习之间的紧密联系经常被强调。49,50,51未来关于第二语言学习的研究很可能会继续受益于眼动追踪技术的优势,该方法可提供视觉注意力的指标 毫秒级分辨率
作者无任何利益冲突需要披露。
本研究由祖科(ZuKo,柏林洪堡大学卓越计划)、德国研究基金会(DFG)卓越集群277“认知交互技术”(Cognitive Interaction Technology),以及欧盟第七框架计划下的研究、技术开发和示范项目(资助协议编号n°316748,LanPercept)提供资金支持。作者同时感谢智利国家科技创新局(CONICYT)关联研究计划项目FB0003“卓越中心基础基金”以及相关项目提供的支持 "FoTeRo" 在DFG的Focus中心XPrag项目中,Pia Knoeferle基于Helene Kreysa在比勒费尔德大学建立并在柏林洪堡大学沿用至今的实验方案,撰写了本文的初稿。所有作者均以不同方式对方法和结果部分的内容提出了修改意见。Camilo Rodríguez Ronderos与Pia Knoeferle负责整合作者意见,并经过两轮修改,对初稿进行了实质性修订。 Ernesto Guerra 制作 图2 - 4 根据 Katja Münster、Alba Rodríguez 和 Ernesto Guerra 的意见,Helene Kreysa 提供了 图1 以及 Pia Knoeferle 对其进行了更新。所报告的部分结果已发表于 认知科学学会年会论文集.
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 带头部/下巴托架的桌面式眼动仪 | SR Research Ltd. | EyeLink 1000 plus | http://www.sr-research.com/eyelink1000plus.html |
| 用于设计和运行眼动追踪实验的软件 | SR Research Ltd. | Experiment Builder | http://www.sr-research.com/eb.html |