方法文章

在视觉情境下的语言理解过程中进行眼动追踪:揭示视觉情境效应的灵活性与局限性

16.9K 次观看

DOI:

10.3791/57694

2018年11月30日

本文内容

摘要

本文综述了一种用于语言理解研究的眼动追踪方法。为了获得可靠的数据,必须遵循该方案中的关键步骤,其中包括正确设置眼动仪(例如,确保眼图像和头像质量良好)以及精确的校准。

摘要

本研究旨在描述并评估一种用于量化语言加工与视觉世界感知之间相互作用不同方面的研究方法。眼动模式的记录为视觉情境以及语言/世界知识在语言理解中的作用提供了有力证据。早期研究通过评估物体-情境效应来检验 语言加工中的模块化理论。在引言中,我们阐述了后续研究如何将更广泛的视觉语境在语言加工中的作用作为一个独立的研究课题,探讨诸如我们对事件和说话者的视觉感知如何影响语言加工等问题。 理解基于 理解者的体验。所考察的视觉语境方面包括动作、事件、说话者的注视方向、情绪性面部表情以及物体的空间构型。在概述眼动追踪方法及其不同应用之后,我们在实验方案中列出了该方法的关键步骤,说明如何成功运用该方法研究视觉情境下的语言理解过程。最后部分展示了三组代表性结果,并阐述了眼动追踪技术在探究视觉世界感知与语言理解之间相互作用方面的优势与局限性。

引言

心理语言学研究强调了眼动分析在理解语言理解过程中所涉及机制方面的重要性。从注视记录推断理解过程的核心是一种将认知与眼动联系起来的假设5。眼动主要有三种类型:扫视运动、前庭-眼动和光滑追踪运动。扫视是快速且呈弹道式的运动,通常在无意识状态下发生,并被可靠地与 注意力转移相关联6。扫视之间相对稳定的注视时刻被称为“注视点”,被认为反映了当前的视觉注意力。测量注视点的位置及其持续时间与认知过程之间的关系,被称为“眼动追踪法”。该方法早期的应用主要用于在严格的语言情境下研究阅读理解(参见 Rayner7 的综述)。在此方法中,对某个词或句子区域的注视时长被认为与加工难度相关。然而,眼动追踪也被用于研究在观察现实世界物体(或计算机屏幕上的图像2)时的口语理解过程。在这种“视觉世界”眼动追踪范式中,物体的观察受到语言的引导。例如,当理解者听到the zebra(斑马)时,他们对屏幕上斑马图像的注视被认为反映了他们正在思考这种动物。在所谓的视觉世界范式中,理解者的视线被视作口语理解以及相关知识激活的反映(例如,当听者听到grazing(吃草)时,他们也会注视斑马,表明该动作由斑马执行)2。这类注视行为表明语言与现实世界之间的关系与眼动之间存在系统性联系2。量化这种联系的一种常用方法是计算注视屏幕上不同预设区域的比例。这使得研究人员能够直接比较(在不同实验条件下、不同 被试和项目之间)特定时间点对不同物体所分配的注意力程度,并以毫秒级的时间分辨率观察这些数值的变化。

心理语言学研究利用视觉世界中的眼动追踪来区分关于心智结构的竞争性理论假设1。此外,对图示物体的眼动注视还表明,理解者能够在语言语境足够受限的情况下进行增量式语义解释8,甚至对即将出现的词语产生预期9。此类眼动数据还揭示了多种其他理解过程,例如词汇歧义消解10,11、代词指称消解12、利用视觉语境信息消除结构和主题角色分配的歧义13,14,16,以及语用过程15等众多方面4。显然,在语言理解过程中对物体的眼动可为相关认知过程提供重要信息。

眼动追踪方法具有非侵入性,可用于婴儿、幼儿及成年语言使用者。其主要优势在于,与探测任务中瞬时性的反应或验证任务中的按键反应不同,该方法能够以毫秒级的时间分辨率,持续揭示语言如何引导注意力,以及视觉情境(以物体、动作、事件、说话者目光、情绪性面部表情以及物体的空间构型等形式呈现)如何影响语言加工过程。在句子理解过程中,眼动指标的连续性可与句子后或实验后的其他测量手段(如外显的图片/视频-句子匹配判断、理解问题和记忆回忆任务)形成良好互补。这些任务中的外显反应有助于深入理解眼动记录结果,揭示语言理解、记忆和学习的最终结果2。将眼动追踪与其他任务相结合 ,已揭示出视觉情境的不同方面在人的一生中对视觉注意力以及(即时和延迟)语言理解的调节程度。

语言(口语或书面语)与场景的呈现方式可以是同时的或相继的。例如,Knoeferle 及其合作者17 在口语句子呈现前1,000毫秒展示场景,并在口语句子播放期间持续呈现 理解。他们报告了证据表明,在德语中,与宾语-动词-主语(OVS)句式相比,动作事件的剪贴画图示有助于解决主语-动词-宾语(SVO)句式中的局部结构歧义。Knoeferle 和 Crocker18 在书面句子呈现之前展示一幅剪贴画场景,并测试剪贴画事件在阅读过程中的逐步整合 句子理解。他们观察到渐进式一致性效应,即当句子成分不匹配时,参与者的阅读时间更长 与前一场景中描述的事件相匹配。在另一种刺激呈现变式中,参与者首先阅读一句描述空间关系的句子,随后看到一个包含物体线描图的特定空间排列场景19本研究通过要求参与者对给定句子与场景的匹配程度进行评分,并在过程中记录其眼动轨迹,来评估计算空间语言模型的预测能力。 场景询问。参与者的注视模式受到其所面对物体形状的调节——部分证实了模型预测,并为模型优化提供了数据。

尽管许多研究使用了剪贴画表示17,18,19,20,21,22,23,但也可以将真实物体、这些物体的视频或静态照片与口语结合使用1,21,24,25,26,46。Knoeferle 及其同事采用了真实世界场景24,而 Abashidze 及其同事则使用录像呈现方式来考察动作事件和时态效应25。改变场景的具体内容(例如,是否描绘动作)22,27,38 是可行的,也可揭示视觉语境效应。Rodríguez 及其合作者的一项相关研究26探讨了录像呈现的视觉性别线索对随后呈现的口语句子理解的影响。参与者观看展示男性或女性手部执行典型性别相关动作的视频,随后在同时查看并排显示的两名人物照片(一名男性和一名女性)时,听到描述典型男性或女性动作事件的句子。这种丰富的视觉与语言环境使作者能够区分语言中介的刻板知识对理解的影响与视觉呈现的(手部)性别线索的影响。

该范式另一项应用聚焦于语言加工中的发展性变化。在口语理解过程中对物体的眼动研究表明,所呈现事件的影响在4至5岁儿童27,28以及老年人29中均能实时显现,但相较于年轻成人略有延迟。Kröger 及其合作者22在一个实验中考察了韵律线索和格标记的作用,并在成人与儿童之间跨实验进行了比较。参与者在观察一个具有歧义的动作事件场景的同时,聆听一句与之相关且格标记明确的德语句子。眼动结果表明,不同的韵律模式在消除“谁对谁做了什么”的歧义时,对成人和4至5岁儿童均未产生帮助。然而,句首的格标记影响了成人的眼动行为,却未影响儿童的眼动。这表明, 5岁儿童对格标记的理解尚不够稳固,无法支持主题角色的分配(参见 Özge 及其合作者的研究30),至少在动作事件本身未能消除主题角色关系歧义的情况下如此。这些结果引人关注,因为它们与先前关于韵律对主题角色分配影响的研究结果相悖31。Kröger 及其合作者22提出,(或多或少具有支持性的)视觉语境可能是导致这些不同发现的原因。如果这些解释成立,则突显了 语境在人的一生中语言理解过程中的重要作用。

眼动追踪法与图片(或视频)-句子验证任务的测量指标相结合效果良好18,20,26,图片-图片验证任务32,语料库研究24,评分任务19或实验后回忆任务25,33. 阿巴希泽及其合作者34 以及Kreysa和合作者33 研究了说话者注视方向与现实世界动作视频之间的相互作用34 以及说话者视线与动作描绘33,作为即将到来的句子内容的线索。通过将语言理解过程中对场景中眼动的追踪与实验后的记忆任务相结合,研究者更深入地理解了听者对说话者目光以及所呈现动作的感知之间的相互作用,及其对即时语言加工和记忆回忆的影响。结果揭示了动作的独特贡献 说话者凝视对实时理解的影响 实验后记忆回忆过程

尽管眼动追踪方法具有很高的灵活性,但仍需遵循某些标准 关键。以下方案概述了一种通用的实验流程,可根据研究人员的具体需求针对不同类型的研究问题进行调整。该方案是柏林洪堡大学心理语言学实验室以及比勒费尔德大学认知交互技术卓越集群(CITEC)前语言与认知实验室所采用的标准程序。本方案描述了桌面实验和远程实验两种设置,其中远程设置推荐用于儿童或老年人的研究。文中提及的所有实验均采用此流程。 代表性结果 使用采样频率为1,000 Hz的眼动仪设备,并配合头部稳定装置、用于向受试者呈现测试内容的计算机(显示计算机)以及用于监控实验过程和受试者眼动轨迹的计算机(主机计算机)。该设备与其前代产品的主要区别在于支持双眼眼动追踪。本方案设计具有足够的通用性,可适用于其他配备头部稳定装置并采用双计算机设置(主机+显示)的眼动追踪设备。但需注意,不同设备在处理校准失败或追踪丢失等问题时可能采用不同的方法,此时实验人员应参考所用设备的具体用户手册。

方案

本方案遵循数据采集机构的伦理准则, ,比勒费尔德大学认知交互技术卓越集群(CITEC)与柏林洪堡大学。在比勒费尔德大学开展的实验均经该校伦理委员会 individually 批准。柏林洪堡大学心理语言学实验室拥有经德国语言学学会(Deutsche Gesellschaft für Sprachwissenschaft, DGfS)伦理委员会批准的实验室伦理规程。

1. 桌面设置

注意:以下是眼动追踪实验中的关键步骤。

  1. 仪器准备
    1. 打开眼动追踪相机和主机电脑(参见 图1 有关实验室数据采集和预处理设置的图示说明)。
    2. 启动眼动仪软件。
    3. 打开显示用电脑,然后打开包含实验文件的文件夹。
    4. 通过双击带有 .exe 扩展名的文件来启动“deployed”版本。
    5. 根据设置,系统可能会提示选择一个实验列表,该列表通常是一个以制表符分隔的 .csv/.txt 文件,包含参与者将要接触的实验条件、声音文件名、书面句子和/或图像。选择列表后,程序将启动。为用于存储结果的输出文件命名。
      注意:输出文件保存在显示计算机上,同时在主机计算机上保存一份备份。
    6. 保持实验的第一个界面(介绍或欢迎界面)处于打开状态。
    7. 取下眼动仪相机的保护盖。
    8. 出于卫生考虑,在下巴托上放置一张纸巾。
    9. 可选:根据实验要求准备反应垫和/或键盘。
    10. 可选:若呈现听觉刺激,请在实验开始前调节扬声器音量并进行测试。或者,测试参与者将要使用的耳机功能是否正常。
    11. 准备供参与者签署的必要表格。
    12. 调节实验室内的光照强度,使房间保持昏暗且在整个数据采集过程中光照亮度恒定。
  2. 参与者的准备工作
    1. 参与者到达后,先做自我介绍。
    2. 放置一个 请勿打扰 实验室门上的标识
    3. 请受试者就座。
    4. 指导参与者阅读信息表以及必要的知情同意书和人口统计学表格。
    5. 让受试者阅读并签署知情同意书。
    6. 简要说明实验的总体内容及持续时间。在实验开始前不要提供过多信息,以免影响参与者的注视行为及最终数据结果。
    7. 提供书面说明,并给予参与者提问的机会。
    8. 简要说明眼动仪的功能。
    9. 如有必要,需明确说明实验任务,并指出实验过程中需要按下的按钮或按键。
    10. 说明颏托的设计目的是在实验过程中尽量减少头部移动。应提及,如果受试者避免任何动作,该装置的效果最佳。
  3. 设置眼动仪
    1. 准备受试者进行实验:请受试者坐在桌前,将下巴置于下巴托上,并将前额紧贴头枕。
    2. 如有需要,请受试者调整座椅的高度和位置:受试者应感到舒适,下颌置于下颌托上,前额紧贴头枕。
    3. 说明在实验过程中头部可能会意外移动,应尽量避免这种情况。同时说明实验过程中可能需要对头部姿势进行调整。
    4. 如果实验需要按钮操作(例如, 通过 指导参与者将手指放在需要按压的按钮上,保持静止,并在按压按钮时避免低头查看反应板。
    5. 请让受试者阅读欢迎/介绍页面。
    6. 坐在主机电脑前。如果屏幕尚未开启 相机设置,点击 相机设置 进入正确的屏幕界面。如果已移除摄像头镜头的保护盖,且受试者已正确位于下颌托上,则屏幕上应显示三幅受试者眼睛的图像:上方一幅较大的图像,下方左右两侧各一幅较小的图像。这两个较小的图像分别对应左眼和右眼,每幅显示一只眼睛。
    7. 选择待追踪的眼睛。通常追踪受试者的主导眼。如果受试者不清楚哪只眼睛是主导眼,需进行眼优势测试(步骤 1.3.8)。
    8. 确定眼优势。要求受试者伸展一只手臂,用双眼睁开时将拇指与远处物体对齐。然后要求受试者交替闭上左眼或右眼。当某只眼睛睁开时,若拇指仍与物体保持对齐,则该眼为优势眼。35,36.
    9. 点击 图像 | 显示 pc (或按) 输入)以及步骤1.3.6中描述的图像也将依次显示在参与者的屏幕上,每次仅显示一幅。
    10. 在实验者或参与者的计算机键盘上按下左/右箭头键,以在眼睛的大图和小图之间切换。请关注小图(眼睛)。
    11. 按压 A (对齐眼窗使用任意一个键盘上的方向键,将搜索范围框对准瞳孔位置居中。随后,眼睛周围应出现一个红色方框,瞳孔底部附近应显示一个青绿色圆圈[“角膜反射点”(cr)],瞳孔本身应呈现蓝色。
    12. 确保屏幕上出现两个十字线(“十字准线”)——一个位于瞳孔中心,另一个位于角膜反射中心。红色方框和两个十字线表示眼动仪正在检测瞳孔和角膜反射。
      注意:如果未出现红色方框或十字标记,则表示眼睛未被追踪——若发生此情况,需重新校准或检查设备连接及照明条件。 无瞳孔反应 将显示在实验人员的计算机上。
    13. 通过手动旋转对焦镜头来调节相机的焦点。注意不要触碰镜头前端。旋转镜头直至达到最佳对焦位置。
      注意:当青绿色圆圈(角膜反射)尽可能小时,即达到最佳焦点位置((当此圆环处于焦点时)。
    14. 设置瞳孔阈值,确保只有瞳孔的图像呈蓝色例如,睫毛不应呈蓝色)上。同时确保整个瞳孔(而不仅仅是其中心部分)呈现蓝色。只需关注红色方框内的区域。
    15. 按压 A。这将自动设置瞳孔阈值。如果瞳孔未以蓝色准确显示,请使用以下方法手动调整阈值 关键在于增加和 向下 关键在于减少图像表面蓝色部分的面积。
      注意:睫毛膏(通常为黑色,与瞳孔颜色相似)可能会干扰阈值设定——眼动仪可能将深色的睫毛误认为瞳孔。此时,应请受试者卸除化妆品,可提供卸妆湿巾协助其清洁。
    16. 设置 cr 阈值。如果 A 在步骤 1.3.15 中被按压的 cr 阈值 应已自动设置。
      注意:所有阈值设置的数值均应可见。若其中出现问号,则表明先前步骤中存在问题,此时应手动设置阈值。
  4. 校准眼动仪
    注意:检查当参与者注视屏幕其他区域时,眼动仪是否能持续准确识别眼睛位置。
    1. 让参与者在相机设置窗口可见时,依次注视屏幕的四个角。当视线指向角落时,仔细观察是否存在干扰角膜反射的不规则反光(这些反光会在屏幕上显示为青绿色的“斑点”)。
    2. 要求受试者注视屏幕中心,如果在步骤1.4.1期间,眼睛周围的红框或任意一个十字线不可见,则引导其将视线转向有问题的角落。这有助于确定问题的来源。
    3. 重新调整受试者头部的位置,并检查是否有所改善。如有必要,重复此步骤。若经过多次尝试后设备仍无法准确追踪受试者的视线,则终止实验。
    4. 告知参与者,眼动仪将进行校准,他们将会看到一个黑色圆圈(内含一个灰色小点)在屏幕的不同位置移动。指导参与者注视该圆圈,直至其移动到新的位置。提醒参与者避免眼睛疲劳,并为了获得最佳效果,应始终聚焦于黑色圆圈内的灰色小点。
    5. 告诉参与者,在校准过程中保持静止非常重要,不要试图预测下一个圆圈的位置。指导他们仅用眼睛跟随圆圈移动,而不要移动头部。点击 校准 开始校准过程。通常采用9点校准程序,其中黑色圆圈会依次移动到九个位置。
    6. 进行自动校准,请按 进入 在参与者准确注视屏幕中央的第一个点后。对于手动校准(例如,当追踪受试者眼睛存在问题或面对特殊受试者群体(如儿童)时,通过按压确认每次注视 进入 (或通过点击 接受固定按压 空格键).
      注意:校准过程结束后,实验者屏幕上应显示一个近乎矩形的图案,该图案代表受试者的眼动轨迹。此外,良好的校准结果应以绿色高亮显示。若未满足此条件,需重复校准步骤。,点击 校准).
    7. 验证结果。让参与者重复相同的流程(观察光点),以验证校准过程的结果。提醒他们注视光点并保持静止。
      注意:验证过程与校准过程类似,眼动仪软件会比较两者的結果,以确保眼睛运动被准确追踪。
    8. 点击 验证。
    9. 按压以确认每次固定 进入 (或通过点击) 接受固定按压 空格键).
    10. 验证完成后,结果将显示在实验者的屏幕上。需特别关注两个误差指标:平均误差(例如,0.23°)和最大误差(例如,0.70°)。这些数值表示被追踪的图像与参与者实际注视位置之间的偏离程度。
    11. 使用视觉世界范式时,应将平均误差(第一个数值)控制在0.5°以内,最大误差(第二个数值)控制在1°以内。
    12. 如果误差值超过阈值,要求参与者重新调整头部位置并重新启动校准程序。若仍未观察到改善,则中止实验。
      注意:当受试者佩戴隐形眼镜时,常会出现较高的校准误差。应提前要求受试者佩戴处方眼镜而非隐形眼镜。
    13. 成功完成校准过程后,单击 输出/记录 开始实验。告知参与者实验现在开始。
  5. 实验过程中
    注意:在实验过程中(根据具体实验程序而定,但通常在每次实验试验之前),一个 漂移检查漂移校正 屏幕中央将显示一个圆点,用于报告当前试验的计算注视误差,并根据眼动仪型号自动进行调整。
    1. 在指导阶段,已告知参与者每当中央注视点出现时,应注视该点。确保在每次漂移检查/漂移校正阶段,参与者均重新注视该注视点。可通过主控计算机(Host PC)上显示的参与者视线进行监控,参与者的注视位置以一个移动的绿色圆圈表示。
    2. 完成漂移检查/漂移校正后,按下 进入 (或 空格键)以消除圆点并显示下一次试验。
    3. 根据所使用眼动仪的型号,确定如何处理未通过漂移校准阶段的情况。不同型号的眼动仪将执行自动操作 漂移校正 通过调整视线坐标以匹配中心点的坐标,否则设备将发出蜂鸣声,提示实验人员在继续实验前重新校准漂移检查).
    4. 若使用自动漂移校正,请注意连续试验中过频的漂移校正和/或过大的校正幅度会扭曲结果,需对设备重新校准。
  6. 实验过程中的重新校准
    1. 在实验过程中的任何时间都可以重新校准。在呈现过程中 漂移校正/漂移检查 屏幕,点击 相机设置,然后点击 校准完成校准和验证过程,直至获得满意数值,然后点击 输出/记录实验将从试验序列的退出点继续进行。
  7. 实验结束后
    1. 向参与者提供一份问卷,以评估其是否能够猜出关键的实验操控。此外,还需询问其在实验过程中可能形成的任何策略。
    2. 向参与者说明实验目的,感谢他们的参与,并根据情况提供相应的金钱报酬或给予课程学分。

2. 远程设置:针对儿童和老年人研究的设置调整

注意:本节仅描述远程设置与步骤1中所述的桌面设置之间的差异。此处未明确提及的事项,应视为与步骤1中描述的程序完全相同。

  1. 将标准的35 mm眼动仪相机镜头更换为16 mm镜头。
  2. 连接所有必要的设备(主机PC、扬声器、眼动仪,以及如果使用笔记本电脑时的笔记本电脑)。
  3. 将笔记本电脑放置在笔记本支架上,并将眼动仪置于其前方(受试者应能看到屏幕顶部的75%区域)。
  4. 在受试者前额(右眼眉毛上方)或前额过小时的右脸颊处,贴上一个“目标贴纸”(可从追踪设备制造商处获取)(适用于婴儿);该贴片可替代台式设备中的下巴托,使眼动仪能够准确定位受试者头部的位置。
  5. 确保受试者坐在距离摄像机550 - 600 mm的位置(目标贴纸到摄像机的距离)。
  6. 确保主机电脑上不显示“big angle”或“near eye”字样。若出现这些提示,说明目标贴片的位置不理想,此时应重新调整目标贴片的位置。这也可能意味着受试者的前额特别窄小。若属此种情况,可将贴片置于受试者的面颊上。
    注意:如果贴纸贴得离耳朵过近,可能会出现“角度过大”的提示,此时必须重新调整贴纸位置。
  7. 在开始第1.4步所述的校准过程之前,请确保受试者坐姿舒适。要求他们在整个实验过程中保持同一姿势,并说明眼动仪对身体移动非常敏感。强调必须保持头部静止不动。如果受试者移动过多,设备将发出嗡嗡声。
    注意:如果使用远程眼动仪设置来测试敏感人群(如儿童或老年人),建议采用手动校准程序。

3. 调整设置以进行阅读研究

注意:在研究视觉背景对阅读的影响时,必须特别关注校准和重新校准过程。与视觉世界范式研究不同,阅读过程中的眼动追踪需要更高的设备精度,因为必须精确捕捉逐词乃至逐字母的阅读模式。

  1. 确保验证阶段显示的平均误差和最大误差均低于0.5°。
  2. 校准时务必使用至少9个点的标定方案。这可以更精确地追踪眼动位置,鉴于阅读过程中兴趣区域较小,这一点至关重要。

结果

Münster 及其合作者的一项研究37 研究了句子结构、所描绘动作与面部情绪线索在语言理解过程中的相互作用。该研究非常适合用于说明该方法的优势与局限性,因为它既显示出所描绘动作对句子理解的显著效应,也显示出面部情绪线索的边缘效应。作者制作了时长5秒的视频,内容为一名女性的面部表情从静息状态转变为快乐或悲伤的表情。此外,他们还构建了情绪效价为正的德语宾语-动词-副词-主语(OVAdvS)结构句子,形式为“这个[宾语/受事]宾格] [动词] [积极副词] [主语/施事者主格].' 通过 肯定副词与“高兴”视频匹配,与“悲伤”视频不匹配,原则上允许对施事者(即面带微笑并被肯定副词描述为快乐行动的角色)进行预期。在播放说话者视频后,句子伴随一幅包含施事者、受事者和干扰角色的剪贴画场景的两个版本之一出现。在一个版本中,施事者被描绘为正在对受事者执行所述动作,而干扰角色则执行不同的动作;另一个版本则描绘角色之间无任何动作发生。场景中的眼动数据揭示了动作内容以及说话者面部表情对句子理解的影响。

动作描述迅速影响了参与者的视觉注意力,意味着当所提及的动作是(时,参与者更多地关注施动者而非干扰物 未被描绘。这些表情是预期性的(,出现在提及施事者之前),表明动作呈现比句子更早地澄清了施事者。动作呈现的最早效应出现在动词阶段,动词介导了与动作相关的施事者)。相比之下,先前说话者是微笑还是看起来不高兴,对施事者的预期并无明显影响(图2)。后一结果可能反映了说话者的微笑与描述性语句中表示动作主体情绪的肯定性句内副词之间的关联较弱(相较于直接的动词-动作关联所中介的动作相关主体)。或者,这一结果可能与任务设计及刺激呈现方式特异性相关:例如,在更具社会互动性的任务中,或在句子理解过程中(而非理解前)呈现说话者面部表情时,情绪效应可能会更加显著。然而,在理解过程中呈现说话者微笑的面部可能使参与者将注意力集中于面部,从而忽略场景中的其他内容,可能掩盖了被操纵变量本应产生的可观测效应(来源:未发表数据)。

在该范式的另一种变体中,Guerra 和 Knoeferle32 探讨了空间语义上的世界-语言关系是否能够在阅读过程中调节对抽象语义内容的理解。Guerra 和 Knoeferle 借鉴了概念隐喻理论38的观点,即空间距离(例如,接近性)可为抽象语义关系(例如,相似性)的意义提供基础。与该假设一致,当抽象名词在意义上相似(而非相反)且先前呈现的视频传达了接近性(而非距离;纸牌相互靠近而非远离)时,参与者阅读这些并列抽象名词的速度更快。在另一系列研究中39,句子描述了两个人之间的互动为亲密或不友好,结果发现,当两张纸牌相互靠近的视频出现时,参与者阅读表达社会接近性/亲密性的句子区域速度加快。值得注意的是,即使句子并未提及视频中的物体,空间距离仍迅速且逐步地影响了句子的阅读过程。这些视频独特地调节了阅读时间,其调节作用取决于空间距离与句子意义在语义及社会层面之间的一致性。这些效应既体现在首次阅读时间(即首次注视某一预设句子区域的持续时间),也体现在该句子区域的总阅读时间上(参见 图3 以了解 Guerra 和 Knoeferle 研究结果的示意图)32。然而,分析还揭示了参与者之间存在显著的个体差异,因此得出结论:与动词-动作关系的影响相比,此类细微的纸牌距离效应可能并不那么稳健,这仅是其中一个例子。

另一组研究说明了句子结构的变化如何有助于评估视觉情境效应的普遍性。Abashidze 及其合作者34 以及Rodríguez及其合作者26 考察了近期动作对后续口语句子加工的影响。在这两项研究中,参与者首先观看了一段动作视频(例如,一名实验者为黄瓜调味,或女性的手在烤蛋糕)。接着,他们听了一句德语句子,该句子要么与最近的动作相关,要么与接下来可能进行的另一动作相关(为番茄调味)34;构建模型26)。在理解阶段,受试者观察显示两个物体(黄瓜、番茄)的场景34 或两名代理人面部的照片(一张女性代理人面部照片,名为“Susanna”;一张男性代理人面部照片,名为“Thomas”)26. 在Abashidze及其合作者的研究中34,说话者首先提到实验者,然后是动词(例如,香料),引发对某一主题的预期(例如,黄瓜或番茄)。在Rodríguez及其合作者的研究中26,说话者首先提到一个主题(蛋糕),然后提到动词(烘焙),从而引发听者对动作执行者(女性:Susanna,或男性:Thomas,图示)的预期 通过 一张女性面孔和一张男性面孔的照片。

在两项研究中,核心问题在于:人们在理解过程中,是否会根据所提供的进一步上下文线索,(在视觉上)预期最近动作事件中的主题/施事者,还是预期另一个主题/施事者。在Abashidze及其合作者的研究中34,实验者的注视在动词出现之初(德语原文直译:“实验者-施事者很快会品尝……”)即提示了未来的主题对象(西红柿)。在Rodríguez及其合作者的研究中26,当提及主题和动词时,与性别相关的刻板行为知识即被激活例如,“蛋糕主题即将烘焙……”)。在这两组研究中,参与者优先查看了最近动作的目标/施事(黄瓜)34 或苏珊娜26)相较于另一种选择(未来的/其他性别的)目标(西红柿34 或 Thomas26)在句子中。

因此,这种所谓的“近期事件偏好”在句子结构和实验材料存在较大变化的情况下似乎依然稳健。然而,它受到同时呈现的场景中视觉限制的调节。26,因此,在提供动词主题的合理图片之外,再呈现具有性别特征的执行者图片,可减少对最近观察到的动作事件的依赖,并根据语言所传递的性别刻板印象知识调节注意力。 图4 展示了Rodríguez及其合作者实验的主要发现26.

尽管这种视觉世界范式产生了可靠的结果,但其他研究强调了联结假设的复杂性(及局限性)。Burigo 和 Knoeferle20 发现,当参与者聆听诸如 Die Box ist über der Wurst(“盒子在香肠上方”)这样的语句时,大多会按照语句内容去查看这些物体的剪贴画图示。但在部分试验中,参与者的眼动脱离了当前提及的内容。当听到“香肠”并至少查看过一次香肠图像后,在加速验证任务中(实验1),参与者下一次查看回到盒子的比例约为21%;而在句后验证任务中(实验2),该比例高达90%。这种眼动模式表明,语言指称(听到“香肠”)仅引导了部分眼动行为(查看香肠),而非全部眼动行为(查看盒子)。此类设计可用于区分词汇指称过程与其他过程(包括句子层面的解释性过程)。然而,鉴于将眼动与认知和理解过程相联结存在模糊性,研究人员在基于眼动比例的相对差异对语言加工的不同层次作出推论时必须谨慎。

使用 EyeLink 1000 进行眼动追踪的过程、数据输出及分析工作流程图。
图 1:数据采集环境概览。 该图展示了用于数据采集和预处理的各种软件与硬件组件之间的相互关系。请点击此处查看此图的放大版本。

动词区域和动词-副词区域中平均注视对数比的柱状图;视觉分析。
图2:明斯特及其合作者37的代表性结果。 这些图示显示了在动词区域(针对所描绘的动作)以及动词-副词区域(针对情绪启动效应)中,各受试者在不同条件下的平均注视概率对数比。结果显示,当句中提到的动作被呈现时,受试者注视目标图像的比例显著高于未呈现该动作时。情绪性面部启动效应的结果则较不明确:仅表明当面部启动具有正性情绪效价(微笑)时,对目标的平均注视对数比略高于负性效价(悲伤表情)时。误差线表示平均值的标准误。本图改编自 Münster et al.37请点击此处查看此图的放大版本。

阅读时间的条形图;距离:近 vs 远;条件:相似、不同;实验结果。
图3:Guerra 与 Knoeferle32 的代表性结果。 本图展示了(不)相似性形容词的首次通读时间(单位:毫秒)的平均值。结果显示,在观察到两张扑克牌移动得更近之后,相似性句子的阅读时间比移动得更远时更短。误差线表示平均值的标准误。此图改编自 Guerra 和 Knoeferle32请点击此处查看此图的放大版本。

动作动词与刻板印象匹配与不匹配分析中注视比例的平均对数比的柱状图。
图 4:Rodríguez 及其合作者26的代表性结果。 本图显示了在动词区域中,各受试者在不同条件下的平均注视概率对数比。注视比例高于 0 表示更偏好目标施动者图像,低于 0 表示更偏好竞争施动者图像。结果表明,当句子中提到的物体和动词与先前录制的视频事件一致时,参与者更倾向于查看目标施动者图像;而不一致时则倾向较低。此外,当句子所描述的动作符合性别刻板印象时,参与者对目标施动者图像的注视更多。误差线表示平均值的标准误。本图改编自 Rodríguez et al.26请点击此处查看此图的放大版本。

讨论

总之,对视觉语境中眼动追踪各种变体的研究揭示了视觉场景影响语言理解的多种方式。与反应时测量等方法相比,该方法具有关键优势。例如,持续的眼动为我们提供了观察语言理解过程的窗口,并揭示了这些过程如何随着时间与我们对视觉世界的感知相互作用。此外,参与者在进行语言理解时,并不一定需要执行明确的任务(例如判断句子的语法正确性)。 通过 按钮按压)。这使得研究人员能够将该方法应用于可能难以完成除注视以外其他明显行为反应的人群,例如婴儿、儿童,以及在某些情况下的老年人。眼动追踪具有生态学效度,因为它反映了参与者的注意力反应——这类似于人类在或多或少专注地倾听正在展开的言语时,对周围环境中与交流相关事物所进行的视觉探究。

视觉世界范式的一个边界(或特征)在于,并非所有事件都能被直接且无歧义地呈现。具体物体和事件当然可以被呈现,但如何最佳地呈现抽象概念则尚不明确。这可能会限制(或界定)通过眼动追踪视觉世界范式对语言加工与视觉感知之间交互作用的理解。另一个挑战涉及观察到的行为与理解过程之间的联结假设。眼动注视是一种单一的行为反应,很可能反映了语言理解过程中多种子过程的参与。例如、词汇通达、指称过程、语言介导的预期、视觉语境效应等)。鉴于这一认识,研究者必须谨慎,避免对观察到的注视模式进行过度解读或误读。为解决这一问题,先前的研究强调了理解子任务的作用,以澄清对注视记录的解释。40.

提高眼动数据可解释性的一种方法是将其与其他测量手段相结合,例如事件相关脑电位(ERPs)。通过使用在时间精细度上相当且在关联假设上互补的两种方法来研究同一现象,研究人员能够排除结果的其他可能解释,并深化对每种单独测量指标的解读41。这一方法已在不同实验之间得到应用43,而近年来更进一步在单个实验中实现整合(尽管目前仅限于严格的语言学情境)44。未来的研究将极大受益于这种方法学上的整合,以及与试次后任务和实验后任务的持续结合。

眼动追踪方法不仅可以复现已有的研究成果,还能检验关于场景中视觉注意与语言理解之间相互作用的新假设。由于即使是实验人员的微小错误也可能影响 数据质量,因此必须严格遵循本方案中所述的实验流程。例如,在阅读研究中,相关分析区域通常是单个词语甚至字母,这意味着即使是很小的校准误差也可能扭曲实验结果(参见Raney及其同事的文章42)。方案中的步骤1.4和1.5,即眼动仪的校准以及漂移检查/漂移校正,尤为重要,因为它们直接影响记录的准确性。若未能正确校准眼动仪,可能导致设备无法准确追踪眼球运动至预设的兴趣区域。此类追踪失败将导致数据点缺失,降低统计效能,而在研究那些效应量较小且极为细微的现实世界与语言之间的关联时,这一问题尤为突出(参见代表性结果部分中Guerra与Knoeferle32以及Münster及其同事37 所描述的实验)。

鉴于需要最大限度地提高设备的 功率和灵敏度,实验人员了解如何处理实验过程中经常出现的问题显得尤为重要。例如,佩戴眼镜的受试者其瞳孔位置和眼球运动可能因眼镜镜片上的光线反射而导致校准困难。解决此问题的一种方法是在显示计算机上镜像受试者眼睛的图像,并引导其移动头部,直到屏幕上不再显示眼镜上的光反射,这意味着摄像头已不再捕捉到该反射。校准失败的另一个原因可能是瞳孔收缩,这可能是由于光线过强所致。在此情况下,调暗实验室内的光线将有助于扩大瞳孔,从而帮助眼动仪准确地检测瞳孔。

最后,我们希望探讨视觉世界范式在二语学习研究中的潜在应用价值。该范式已被成功应用于心理语言学研究,用以考察跨语言的词汇与音位交互等现象。46,47,48此外,应用语言学领域关于第二语言习得的文献中,视觉注意与语言学习之间的紧密联系经常被强调。49,50,51未来关于第二语言学习的研究很可能会继续受益于眼动追踪技术的优势,该方法可提供视觉注意力的指标 毫秒级分辨率

披露

作者无任何利益冲突需要披露。

致谢

本研究由祖科(ZuKo,柏林洪堡大学卓越计划)、德国研究基金会(DFG)卓越集群277“认知交互技术”(Cognitive Interaction Technology),以及欧盟第七框架计划下的研究、技术开发和示范项目(资助协议编号n°316748,LanPercept)提供资金支持。作者同时感谢智利国家科技创新局(CONICYT)关联研究计划项目FB0003“卓越中心基础基金”以及相关项目提供的支持 "FoTeRo" 在DFG的Focus中心XPrag项目中,Pia Knoeferle基于Helene Kreysa在比勒费尔德大学建立并在柏林洪堡大学沿用至今的实验方案,撰写了本文的初稿。所有作者均以不同方式对方法和结果部分的内容提出了修改意见。Camilo Rodríguez Ronderos与Pia Knoeferle负责整合作者意见,并经过两轮修改,对初稿进行了实质性修订。 Ernesto Guerra 制作 图2 - 4 根据 Katja Münster、Alba Rodríguez 和 Ernesto Guerra 的意见,Helene Kreysa 提供了 图1 以及 Pia Knoeferle 对其进行了更新。所报告的部分结果已发表于 认知科学学会年会论文集.

材料

本文使用的材料清单
姓名公司目录编号评论
带头部/下巴托架的桌面式眼动仪SR Research Ltd.EyeLink 1000 plushttp://www.sr-research.com/eyelink1000plus.html
用于设计和运行眼动追踪实验的软件SR Research Ltd.Experiment Builderhttp://www.sr-research.com/eb.html

参考文献

  1. Tanenhaus, M. K., Spivey-Knowlton, M. J., Eberhard, K. M., Sedivy, J. C. Integration of visual and linguistic information in spoken language comprehension. Science. 268 (5217), 1632-1634 (1995).
  2. Cooper, R. M. The control of eye fixation by the meaning of spoken language: A new methodology for the real-time investigation of speech perception, memory, and language processing. Cognitive Psychology. 6 (1), 84-107 (1974).
  3. Knoeferle, P., Guerra, E. What is non-linguistic context? A view from language comprehension. In What is a Context? Linguistic Approaches and Challenges. Finkbeiner, R., Meibauer, J., Schumacher, P. B. , John Benjamins Publishing Company. Amsterdam, The Netherlands. 129-150 (2012).
  4. Knoeferle, P., Guerra, E. Visually situated language comprehension. Language and Linguistics Compass. 10 (2), 66-82 (2016).
  5. Just, M. A., Carpenter, P. A. A theory of reading: From eye fixations to comprehension. Psychological Review. 87 (4), 329-354 (1980).
  6. Deubel, H., Schneider, W. X. Saccade target selection and object recognition: Evidence for a common attentional mechanism. Vision Research. 36 (12), 1827-1837 (1996).
  7. Rayner, K. Eye movements in reading and information processing: 20 years of research. Psychological Bulletin. 124 (3), 372-422 (1998).
  8. Sedivy, J. C., Tanenhaus, M. K., Chambers, C. G., Carlson, G. N. Achieving incremental semantic interpretation through contextual representation. Cognition. 71 (2), 109-147 (1999).
  9. Kamide, Y., Scheepers, C., Altmann, G. T. Integration of syntactic and semantic information in predictive processing: Cross-linguistic evidence from German and English. Journal of Psycholinguistic Research. 32 (1), 37-55 (2003).
  10. Allopenna, P. D., Magnuson, J. S., Tanenhaus, M. K. Tracking the time course of spoken word recognition using eye movements: Evidence for continuous mapping models. Journal of Memory and Language. 38 (4), 419-439 (1998).
  11. Tanenhaus, M. K., Magnuson, J. S., Dahan, D., Chambers, C. Eye movements and lexical access in spoken-language comprehension: Evaluating a linking hypothesis between fixations and linguistic processing. Journal of Psycholinguistic Research. 29 (6), 557-580 (2000).
  12. Arnold, J. E., Eisenband, J. G., Brown-Schmidt, S., Trueswell, J. C. The rapid use of gender information: Evidence of the time course of pronoun resolution from eyetracking. Cognition. 76 (1), B13-B26 (2000).
  13. Chambers, C. G., Tanenhaus, M. K., Magnuson, J. S. Actions and affordances in syntactic ambiguity resolution. Journal of Experimental Psychology: Learning, Memory, and Cognition. 30 (3), 687-696 (2004).
  14. Spivey, M. J., Tanenhaus, M. K., Eberhard, K. M., Sedivy, J. C. Eye movements and spoken language comprehension: Effects of visual context on syntactic ambiguity resolution. Cognitive Psychology. 45 (4), 447-481 (2002).
  15. Huang, Y. T., Snedeker, J. Online interpretation of scalar quantifiers: Insight into the semantics-pragmatics interface. Cognitive Psychology. 58 (3), 376-415 (2009).
  16. Trueswell, J. C., Sekerina, I., Hill, N. M., Logrip, M. L. The kindergarten-path effect: studying online sentence processing in young children. Cognition. 73 (2), 89-134 (1999).
  17. Knoeferle, P., Crocker, M. W., Scheepers, C., Pickering, M. J. The influence of the immediate visual context on incremental thematic role-assignment: evidence from eye movements in depicted events. Cognition. 95 (1), 95-127 (2005).
  18. Knoeferle, P., Crocker, M. W. Incremental Effects of Mismatch during Picture-Sentence Integration: Evidence from Eye-tracking. Proceedings of the 26th Annual Conference of the Cognitive Science Society. , Stresa, Italy. 1166-1171 (2005).
  19. Kluth, T., Burigo, M., Schultheis, H., Knoeferle, P. The role of the center-of-mass in evaluating spatial language. Proceedings of the 13th Biannual Conference of the German Society for Cognitive Science. , Bremen, Germany. 11-14 (2016).
  20. Burigo, M., Knoeferle, P. Visual attention during spatial language comprehension. PLoS One. 10 (1), (2015).
  21. Münster, K., Carminati, M. N., Knoeferle, P. How Do Static and Dynamic Emotional Faces Prime Incremental Semantic Interpretation? Comparing Older and Younger Adults. Proceedings of the 36th Annual Meeting of the Cognitive Science Society. , Quebec City, Canada. 2675-2680 (2014).
  22. Kroeger, J. M., Münster, K., Knoeferle, P. Do Prosody and Case Marking influence Thematic Role Assignment in Ambiguous Action Scenes? Proceedings of the 39th Annual Meeting of the Cognitive Science Society. , London, UK. 2463-2468 (2017).
  23. Knoeferle, P., Crocker, M. W. The influence of recent scene events on spoken comprehension: evidence from eye movements. Journal of Memory and Language. 57 (4), 519-543 (2007).
  24. Knoeferle, P., Carminati, M. N., Abashidze, D., Essig, K. Preferential inspection of recent real-world events over future events: evidence from eye tracking during spoken sentence comprehension. Frontiers in Psychology. 2, 376(2011).
  25. Abashidze, D., Knoeferle, P., Carminati, M. N. How robust is the recent-event preference? Proceedings of the 36th Annual Meeting of the Cognitive Science Society. , Quebec City, Canada. 92-97 (2014).
  26. Rodríguez, A., Burigo, M., Knoeferle, P. Visual constraints modulate stereotypical predictability of agents during situated language comprehension. Proceedings of the 38th Annual Meeting of the Cognitive Science Society. , Philadelphia, USA. 580-585 (2016).
  27. Zhang, L., Knoeferle, P. Visual Context Effects on Thematic Role Assignment in Children versus Adults: Evidence from Eye Tracking in German. Proceedings of the Annual Meeting of the Cognitive Science Society. , Boston, USA. 2593-2598 (2012).
  28. Zhang, L., Kornbluth, L., Knoeferle, P. The role of recent versus future events in children's comprehension of referentially ambiguous sentences: Evidence from eye tracking. Proceedings of the Annual Meeting of the Cognitive Science Society. , Boston, USA. 1227-1232 (2012).
  29. Münster, K., Knoeferle, P. Situated language processing across the lifespan: A review. International Journal of English Linguistics. 7 (1), 1-13 (2017).
  30. Özge, D., et al. Predictive Use of German Case Markers in German Children. Proceedings of the 40th Annual Boston University Conference on Language Development. , Somerville, USA. 291-303 (2016).
  31. Weber, A., Grice, M., Crocker, M. W. The role of prosody in the interpretation of structural ambiguities: A study of anticipatory eye movements. Cognition. 99 (2), B63-B72 (2006).
  32. Guerra, E., Knoeferle, P. Effects of object distance on incremental semantic interpretation: similarity is closeness. Cognition. 133 (3), 535-552 (2014).
  33. Kreysa, H., Knoeferle, P., Nunnemann, E. Effects of speaker gaze versus depicted actions on visual attention during sentence comprehension. Proceedings of the 36th Annual Meeting of the Cognitive Science Society. , Quebec City, Canada. 2513-2518 (2014).
  34. Abashidze, D., Knoeferle, P., Carminati, M. N. Eye-tracking situated language comprehension: Immediate actor gaze versus recent action events. Proceedings of the 37th Annual Meeting of the Cognitive Science Society. , Pasadena, USA. 31-36 (2015).
  35. Crovitz, H. F., Zener, K. A Group-Test for Assessing Hand- and Eye-Dominance. The American Journal of Psychology. 75 (2), 271-276 (1962).
  36. Ehrenstein, W. H., Arnold-Schulz-Gahmen, B. E., Jaschinski, W. Eye preference within the context of binocular functions. Graefe's Arch Clin Exp Ophthalmol. 243, 926(2005).
  37. Münster, K., Carminati, M. N., Knoeferle, P. The Effect of Facial Emotion and Action Depiction on Situated Language Processing. Proceedings of the 37th Annual Meeting of the Cognitive Science Society. , Pasadena, USA. 1673-1678 (2015).
  38. Lakoff, G., Johnson, M. Metaphors We Live By. , University of Chicago Press. Chicago, USA. (1980).
  39. Guerra, E., Knoeferle, P. Visually perceived spatial distance affects the interpretation of linguistically mediated social meaning during online language comprehension: An eye tracking reading study. Journal of Memory and Language. 92, 43-56 (2017).
  40. Kreysa, H., Knoeferle, P. Effects of speaker gaze on spoken language comprehension: task matters. Proceedings of the Annual Meeting of the Cognitive Science Society. , Boston, USA. 1557-1562 (2012).
  41. Knoeferle, P. Language comprehension in rich non-linguistic contexts: Combining eye tracking and event-related brain potentials. Towards a cognitive neuroscience of natural language use. Roel, W. , Cambridge University Press. Cambridge, UK. 77-100 (2015).
  42. Raney, G. E., Campell, S. J., Bovee, J. C. Using eye movements to evaluate cognitive processes involved in text comprehension. Journal of Visualized Experiments. (83), e50780(2014).
  43. Knoeferle, P., Habets, B., Crocker, M. W., Muente, T. F. Visual scenes trigger immediate syntactic reanalysis: evidence from ERPs during situated spoken comprehension. Cerebral Cortex. 18 (4), 789-795 (2008).
  44. Dimigen, O., Sommer, W., Hohlfeld, A., Jacobs, A. M., Kliegl, R. Coregistration of eye movements and EEG in natural reading: Analyses and review. Journal of Experimental Psychology: General. 140 (4), 552-572 (2011).
  45. Knoeferle, P., Kreysa, H. Can speaker gaze modulate syntactic structuring and thematic role assignment during spoken sentence comprehension? Frontiers in Psychology. 3, 538(2012).
  46. Chambers, C. G., Cooke, H. Lexical competition during second-language listening: Sentence context, but not proficiency, constrains interference from the native lexicon. Journal of Experimental Psychology: Learning, Memory, and Cognition. 35 (4), 1029(2009).
  47. Duyck, W., Van Assche, E., Drieghe, D., Hartsuiker, R. J. Visual word recognition by bilinguals in a sentence context: Evidence for nonselective lexical access. Journal of Experimental Psychology: Learning, Memory, and Cognition. 33 (4), 663(2007).
  48. Weber, A., Cutler, A. Lexical competition in non-native spoken-word recognition. Journal of Memory and Language. 50 (1), 1-25 (2004).
  49. Verhallen, M. J., Bus, A. Young second language learners' visual attention to illustrations in storybooks. Journal of Early Childhood Literacy. 11 (4), 480-500 (2011).
  50. Robinson, P., Mackey, A., Gass, S. M., Schmidt, R. Attention and awareness in second language acquisition. The Routledge Handbook of Second Language Acquisition. , 247-267 (2012).
  51. Tomlin, R. S., Villa, V. Attention in cognitive science and second language acquisition. Studies in Second Language Acquisition. 16 (2), 183-203 (1994).

重印与许可

标签

眼优势角膜反射瞳孔追踪校准程序注视模式口语情境化阅读