视觉世界范式通过监测参与者在倾听或说出口语时其在视觉工作区中的眼动,来研究心理语言学中的多种在线加工问题,包括诸如析取语句等语义复杂的陈述。
方法文章
视觉世界范式通过监测参与者在倾听或说出口语时其在视觉工作区中的眼动,来研究心理语言学中的多种在线加工问题,包括诸如析取语句等语义复杂的陈述。
在使用视觉世界范式的典型眼动追踪研究中,当参与者产出或理解描述当前视觉场景的口语时,眼动仪会记录他们对视觉工作区内物体或图片的眼动。该范式具有高度的适用性,可用于多种人群,包括无法阅读和/或无法明确给出行为反应的个体,例如前阅读期儿童、老年成人以及患者。更重要的是,该范式对言语信号的细微操控极为敏感,可用于研究语言理解中大多数主题的在线加工过程,涵盖多个层面,如精细的声学语音特征、词汇属性以及语言结构。本文所描述的实验方案展示了如何开展一项典型的视觉世界眼动追踪研究,并通过一个实例说明如何利用视觉世界范式探究某些语义复杂语句的在线加工过程。
口语是一种快速、持续的信息流,转瞬即逝。对这种具有时间性且快速变化的言语信号进行实验研究具有挑战性。通过视觉世界范式中记录的眼动数据,可以克服这一挑战。在典型的采用视觉世界范式的眼动研究中,当参与者聆听或产出描述视觉场景内容的口语时,研究人员会监测他们对显示屏中图片或视觉工作区中真实物体的眼动情况1,2,3,4。该范式背后的基本逻辑,即关联假设,是理解或计划说出某个语句时,会(外显或内隐地)将参与者的视觉注意力转移到视觉世界中的某个特定物体上。这种注意力的转移极有可能引发扫视眼动,使被注意的区域进入中央凹视野。借助这一范式,研究人员旨在确定相对于言语信号中某一听觉标志点,在什么时间点会出现参与者视觉注意力的转移,该转移通过向视觉世界中某个物体或图片的扫视眼动来测量。扫视眼动在何时、何地随着言语信号的发生而启动,可用于推断语言的在线加工过程。视觉世界范式既可用于研究口语理解1,2,也可用于研究口语产出5,6。本文将重点介绍理解过程的研究。在采用视觉世界范式的理解研究中,研究人员在参与者聆听描述视觉显示内容的口语语句时,监测其在视觉显示界面上的眼动行为。
历史上设计了多种眼动追踪系统。其中最简单、成本最低且最便携的系统仅使用一台普通摄像机,记录被试眼睛的图像。随后通过逐帧回放视频录像,人工编码眼动行为。然而,这种眼动仪的采样率相对较低,且编码过程耗时较长。因此,现代商用眼动追踪系统通常采用光学传感器来测量眼球在眼眶中的方位7,8,9。为了理解现代商用眼动追踪系统的工作原理,需考虑以下几点。首先,为了准确测量中央凹视觉的方向,通常将一个红外照明器(波长通常在780-880 nm左右)置于摄像机光轴上或偏离光轴的位置,使瞳孔图像明显比周围虹膜更亮或更暗。然后利用瞳孔图像和/或瞳孔角膜反射(通常为第一普尔金耶像)来计算眼球在眼眶中的方位。其次,视觉世界中的注视位置实际上不仅取决于眼睛相对于头部的方向,还取决于头部相对于视觉世界的方向。为了从眼球方位准确推断出注视方向,眼动仪的光源和摄像机要么相对于被试头部固定(头戴式眼动仪),要么相对于视觉世界固定(桌面式或远程眼动仪)。第三,被试的头部方位必须相对于视觉世界保持固定,或在头部可自由移动时通过计算进行补偿。当在头部可自由移动模式下使用远程眼动仪时,通常通过在被试前额贴一个小标记来记录其头部位置。然后通过计算将头部方位从眼球方位中扣除,从而恢复视觉世界中的注视位置。第四,需要进行校准和验证过程,以将眼球方位映射到视觉世界中的注视方向。在校准过程中,记录被试对已知目标点的注视样本,将原始眼动数据映射到视觉世界中的注视位置。在验证过程中,向被试呈现与校准过程相同的靶点。通过比较校准结果计算出的注视位置与视觉世界中实际靶点位置之间的差异,来评估校准的准确性。为进一步确认映射过程的准确性,通常在每次试验中进行漂移检查,即向被试呈现单个注视靶点,以测量计算出的注视位置 与当前靶点实际位置之间的差异。
视觉世界研究的主要数据是在眼动仪的采样频率下记录的、贯穿整个或部分试验时长的视觉场景中的一系列注视位置。视觉世界研究中使用的因变量通常是,在特定时间窗口内,参与者注视位于视觉场景中某一特定空间区域的样本所占的比例。为了分析数据,首先需要选择一个时间窗口,通常称为感兴趣时间段。该时间窗口通常与听觉输入中某些语言事件的呈现时间点对齐。此外,还需要将视觉场景划分为若干个感兴趣区域(ROIs),每个区域对应一个或多个物体。其中一个区域包含与口语理解正确的物体相对应的内容,因此 常被称为目标区域。一种典型的数据可视化方法是注视比例图,即在时间窗口内的每个时间 bin 中,对每位参与者和每个实验项目在各个感兴趣区域上的注视样本比例进行平均。
利用视觉世界研究获得的数据,可以回答不同的研究问题:a) 在粗粒度层面上,参与者的视觉世界眼动是否受到不同听觉语言输入的影响? b) 如果存在影响,这种影响在试验过程中的发展轨迹是怎样的?是线性效应还是高阶效应? c) 如果存在影响,那么在细粒度层面上,这种效应最早在什么时间点出现,持续时间有多长?
为了对结果进行统计分析,应考虑以下几点。首先,响应变量, 即,注视比例在0到1之间,具有上下界,服从多项分布而非正态分布。因此,基于正态分布的传统统计方法,如t检验、方差分析以及线性(混合效应)模型10,除非将比例数据通过经验logit公式等方法转换为无界变量,否则无法直接使用11 或已被替换为无界因变量,例如欧几里得距离12不需要正态分布假设的统计技术,例如广义线性(混合效应)模型13 也可使用其他方法。其次,为了探究所观察效应的动态变化轨迹,需要在模型中加入一个表示时间序列的变量。该时间序列变量最初是将眼动仪的采样点重新对齐至语言输入的起始点。由于变化轨迹通常并非线性,因此一般会在(广义)线性(混合效应)模型中加入时间序列的高阶多项式函数。 即,生长曲线分析14此外,参与者在当前采样点的眼动位置在很大程度上依赖于之前的采样点,尤其是在记录频率较高的情况下,这会导致自相关问题。为了降低相邻采样点之间的自相关性,原始数据通常会被降采样或分箱处理。近年来,广义加性混合效应模型(GAMM)也被用于处理自相关误差。12,15,16时间窗口的宽度在不同研究中有所差异,范围从几毫秒到几百毫秒不等。某项研究可选择的最窄时间窗口受到该研究中所使用眼动仪采样率的限制。例如,若眼动仪的采样率为500 Hz,则时间窗口的宽度不能小于2 ms = 1000/500。第三,当对感兴趣时间段内的每个时间窗口重复进行统计分析时,必须处理由这些多次比较所引起的族系误差(familywise error)。如前所述,轨迹分析可告知研究者在粗粒度水平上观察到的效应是否随时间变化呈线性关系,但无法显示该效应从何时开始出现以及持续多长时间。为了确定观察到的差异开始分化的具体时间点,并明确该效应所持续的时间段长度,需要对每个时间窗口重复进行统计分析。这些多次比较将引入所谓的族系误差,无论采用何种统计方法均无法避免。传统上,族系误差通过邦弗罗尼校正(Bonferroni adjustment)进行校正。17最近,一种称为非参数置换检验的方法,最初用于神经影像学领域18 已应用于视觉词汇范式19 以控制族系误差。
采用视觉世界范式的科研人员旨在通过参与者在视觉场景中的眼动来推断其对口语的理解情况。为确保这一推论的有效性,必须排除或控制其他可能影响眼动的因素。以下两个因素是需要考虑的常见因素之一。第一个因素涉及参与者在无语言输入条件下眼动注视的某些系统性模式,例如倾向于注视视觉场景的左上象限,以及水平方向的眼动比垂直方向更容易等12,20。为确保所观察到的注视模式与物体本身相关,而非由物体所在的空间位置引起,应在不同试验或不同参与者之间对物体的空间位置进行平衡设计。可能影响参与者眼动的第二个因素是视觉世界中物体的基本图像特征,例如亮度对比度、颜色和边缘朝向等21。为了检验这一潜在的混杂效应,通常在口语呈现开始之前,或在关键语音标记出现之前约1000毫秒,先呈现视觉显示画面。从测试图像呈现开始到测试音频开始之间的这一时间段内,参与者尚未听到语言输入或语言的歧义消解点。在此期间不同条件下观察到的任何差异,应归因于视觉显示本身等其他混杂因素,而非语言输入。因此,该预览阶段所记录的眼动数据可作为判断语言输入效应的基线。此外,该预览阶段还使参与者能够熟悉视觉显示内容,从而在口语呈现时减少解释性注视的系统性偏差。
为了说明如何开展一项采用视觉世界范式的典型眼动追踪研究,以下方案描述了一项改编自 L. Zhan 的实验。 17 探索语义复杂语句的在线加工过程 即, 析取语句S1 或 S2),联合陈述(S1 和 S2),以及 但-陈述(S1 但非 S2)。在通常的语用推理中,某些话语所表达的信息实际上比其字面含义更强。诸如析取式的陈述 小明的盒子里有一头牛或一只公鸡 只要两个析取支为真,析取命题在逻辑上即为真 小明的盒子里有一头牛 和 小明的盒子里有一只公鸡 不同时为假。因此,当两个析取支均为真时,析取命题为真,而相应的合取命题 小明的盒子里有一头牛和一只公鸡 这一点也成立。然而在日常对话中,听到析取命题通常暗示相应的合取命题为假。标量含义推断);并表明说话者不知道这两个析取项的真值无知推断)。文献中的观点在两种推断属于语法过程还是语用过程的问题上存在分歧22,23,24,25,26该实验通过探究三个复杂语句的在线加工过程,展示了视觉世界范式如何用于判定上述不同理论解释。
访问受限。请登录或开始试用以查看此内容。
所有受试者在实施实验方案前必须签署知情同意书。所有实验程序、知情同意书及实验方案均已通过北京语言大学研究伦理委员会的批准。
注意:采用视觉世界范式进行理解研究的实验通常包含以下步骤:介绍拟探讨的理论问题;设计实验方案;准备视觉和听觉刺激材料;结合实验设计阐述理论问题;选择眼动仪以记录被试的眼动轨迹;选择软件并利用该软件编写程序以呈现刺激材料;对记录的眼动数据进行编码与分析。具体实验在上述任一步骤中均可能存在差异。本文以一个具体实验方案为例,介绍如何实施此类实验,并讨论研究人员在设计和开展基于视觉世界范式的自主实验时需注意的一些关键问题。
1. 准备测试刺激
2. 根据实验设计提出理论预测。
3. 构建实验脚本
4. 招募参与者
5. 进行实验
注意:当受试者为正常发育的成年人时,一名实验人员足以完成实验操作。但如果受试者为特殊人群(如儿童),则需要两名或以上的实验人员。
6. 数据编码与分析
访问受限。请登录或开始试用以查看此内容。
参与者的行为反应总结如下 图4. 正如我们之前所述,对合取命题的正确反应是(S1 和 S2)是一个大的开口箱,例如A箱 图1对一个的正确反应 但-声明(S1 而非 S2) 是包含前述动物的小型开放盒,例如 D 盒 图1. 关键在于,选择哪一个盒子作为析取命题S1 或 S2) 取决于析取命题的处理方式:小的封闭盒子,例如盒子 B 中的 图1只有当计算了与析取陈述相关的标量含义和无知推论时,才选择该选项。 图4 说明在理解一个析取命题(S1 或 S2),参与者会同时计算这两种推论。
访问受限。请登录或开始试用以查看此内容。
进行视觉世界研究时,需遵循若干关键步骤。首先,研究人员旨在通过参与者在视觉世界中的眼动来推断其对听觉呈现语言的理解。因此,在设计视觉刺激的布局时,应控制自然任务中可能影响参与者眼动的眼动特性,从而能够识别出言语对参与者眼动的影响。其次,口语中的声学线索具有瞬态性,且不存在仅对应于特定语言类别的声学特征。为了将参与者的眼动与某一语言标记的起始时间精确同步,研究人员需要找到一种客观且一致的方法来界定某种语言结构的边界。第三,为了准确地将参与者眼球相对于头部的旋转映射到其在视觉世界中的注视点,研究人员需要执行一次或多次校准、验证和漂移校正过程。第四,视觉世界研究获得的数据具有一些特殊性质,例如存在上下界限制以及误差自相关等。在选择统计分析方法时,应充分考虑这些特殊性质。
视觉世界研究包含三个基本组成部分:视觉显示、口语刺激和实验任务。研究者可根据具体研究目的对其中任一组分进行调整。首先,视觉显示通常是一个呈现多幅图片的屏幕画面,但也可能是一个呈现多个印刷词汇的屏幕32、一个示意图景33
访问受限。请登录或开始试用以查看此内容。
作者声明其不存在竞争性经济利益。
本研究由中央高校基本科研业务费专项资金北京语言大学科研基金资助(批准号 15YJ050003)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Pixelmator | Pixelmator Team | http://www.pixelmator.com/pro/ | 图像编辑应用程序 |
| Praat | 开源软件 | http://www.fon.hum.uva.nl/praat/ | 声音分析与编辑软件 |
| Eyelink 1000plus | SR-Research, Inc | https://www.sr-research.com/products/eyelink-1000-plus/ | 远程红外眼动仪 |
| Experimental Builder | SR-Research, Inc | https://www.sr-research.com/experiment-builder/ | 眼动仪软件 |
| Data Viewer | SR-Research, Inc | https://www.sr-research.com/data-viewer/ | 眼动仪软件 |
| R | 开源软件 | https://www.r-project.org | 用于统计计算和图形的免费软件环境 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可