方法文章

人类阅读过程中眼动追踪高质量数据采集的方法学方案

70 次观看

DOI:

10.3791/70937

2026年9月18日

本文内容

摘要

本文介绍了一种在人类阅读实验中进行高精度眼动数据采集的逐步操作方案,涵盖硬件与显示器选择、实验室设置、受试者管理、校准与验证、在线质量控制以及预处理(事件检测与漂移校正),以获得高准确度和高精度的数据及可重复的实验结果。

摘要

眼动追踪是研究阅读过程中注意力和语言加工的核心方法学手段。结果的有效性和可重复性取决于数据质量、清晰的方法学设计以及一致的预处理流程。本文提供了一套全面、分步实施的实验方案,用于在阅读研究中采集高质量的眼动数据。该方案从实验室环境准备和设备设置开始,继而进行眼动仪硬件与软件的选择与配置、刺激材料准备及实验设计。随后开展被试管理、知情同意书签署,并记录被试的语言学与心理测量学特征。接着执行校准与验证程序,在数据采集过程中实时监测被试舒适度和数据质量。预处理流程包括以标准格式导出原始数据、数据清洗、注视点与眼跳检测(采用基于速度和基于离散度的算法),参数设定明确;进行可视化检查以识别信号丢失并控制噪声,对多行文本实施垂直漂移校正,并提取标准阅读指标(注视持续时间、眼跳参数、跳读率和回视率)。在整个流程中,特别强调研究问题与硬件规格的一致性、通过定期检查管理漂移现象,以及对所有关键参数和决策进行详细报告。成功的数据采集通常表现为验证准确率在设定范围内保持稳定、数据丢失率低,并呈现出可解释的注视持续时间和眼跳行为分布,能够良好复现与词长、词频和可预测性相关的经典效应。本方案适用于台式眼动仪、常见软件环境,以及头部固定和自由头部两种实验模式,同时解决了光照条件、眼镜反光和被试姿势变化等实际问题。本研究提出了一套清晰且实用的实验流程,将方法学指导整合为统一的工作流,旨在支持阅读研究中可靠的眼动数据采集,促进结果的可重复性与元分析,提高不同实验室和研究团队之间的一致性,最终增强阅读研究的科学可信度。

引言

眼动追踪是研究阅读过程中注意力和语言加工的核心方法,因为注视和扫视反映了视觉和认知资源在刺激上的实时分配。经典和当代综述均记录了眼动与理论构念(如知觉广度、预视效益以及眼动控制模型)之间稳健的关联1,2。为了开展可靠的研究以检验这些关联,在设备选择、实验设计、校准与验证以及数据预处理方面必须遵循严格的方法学规范;否则,数据质量下降将导致估计偏差并削弱可重复性3

近十年来,多篇导论性文章和最佳实践论文整合了该领域的方法学知识。近期的一系列基础性研究将理论与测量方法联系起来,探讨了操作化定义和算法差异性问题,并为针对特定研究问题选择眼动仪提供了指导4,5,6,7,8。补充性指南则提出了硬件选择、确保准确性和精确性、测量指标定义与报告方面的最佳实践,并建议如何降低效度威胁9。面向阅读研究的入门资源也提供了实验设计、常用测量指标和分析流程的通俗概览10,11。在应用语言学与阅读领域,特定主题的综述总结了测量指标和眼动设备的选择,并强调了任务依赖性的限制条件12,13,14,15,16,17

本文将这些指导原则转化为阅读研究中高精度眼动数据采集的分步操作方案。与现有资源主要提供宽泛的理论性最佳实践指南或仅聚焦于特定分析技术不同,本方案将这些概念转化为端到端、可执行的操作流程,旨在通过具体、有序的指令促进日常实验室操作。在适用性方面,本方案特别针对使用高采样频率、基于台式设备的眼动仪(例如 500–2000 Hz)并配备头部固定装置(如下巴托或前额托)的高度受控实验室阅读实验进行优化。该方案最适合对数据质量要求严格、需要高空间准确性和精确度的研究,例如分析精确的词水平注视或精细扫视指标的研究。

采用无头部固定或自然状态下的实验设置正变得越来越流行,包括在阅读研究中,但本文将范围限定于实验室研究。我们涵盖了硬件和软件的选择、实验室设置、刺激材料准备、受试者管理、校准与验证、在线质量控制以及预处理(包括事件检测和漂移校正)。通过遵循本方案,研究人员可以记录并获得符合当前标准的数据质量,从而提高与阅读相关研究结果的透明度、可信度和可重复性。

方案

COST CA21131 数据收集的伦理许可已由波兰雅盖隆大学哲学系研究伦理委员会批准,协议编号为 221.0042.18_2024。所有参与者均签署了知情同意书。

1. 准备实验室环境并设置设备

  1. 准备实验室环境
    1. 检查光线和环境噪音条件。实验室内的窗户可能导致瞳孔突然扩张变化,并在眼动仪相机和显示器上产生光线反射。如果可能,应在无窗房间内采集数据,或使用遮光窗帘阻挡阳光。采用人工照明,并消除反射光源。确认显示器上无任何反光,调整百叶窗或显示器角度直至反光消失。确保实验环境安静,并防止外界干扰(例如使用标识、门锁)。可使用外部提示信号避免干扰(例如在门外放置“实验进行中,请勿敲门或进入房间”的提示)。
    2. 检查物理工效学。使用稳固且不可旋转的椅子;调整桌高(如可调节),以维持正确姿势,并避免因椅子旋转导致校准丢失。
    3. 避免社会存在感。实验者在同一个房间内可能会分散参与者的注意力。将控制室与参与者所在房间分隔开,或使其不在视线范围内,以尽量减少社会存在感的影响。
    4. 检查空气通风情况。在实验开始前和结束后进行通风。检查室温,因为受试者需要保持静止一段时间。
  2. 选择眼动追踪设备
    1. 检查研究目标与测量指标之间的兼容性。特定研究的目标,即目标测量指标(因变量),应与眼动追踪设备的功能相匹配。机构内设备的可及性可能对预期研究的范围构成限制。需核查眼动追踪系统三个主要组件特性(采样率、精确度和准确度)及其满足研究需求的潜力。关键在于确保眼动追踪设备的功能与研究目标相兼容。
      注意:采样率 = 采样率以 Hz 为单位,反映眼动仪在单位时间内采集样本的频率:60 Hz 的眼动仪每 16 ms 采集一次样本,而 500 Hz 的眼动仪每 1 ms 采集一次样本。采样率会影响不同类型的测量指标,因为低频率的眼动仪可能将发生在 16 ms 时间段内的扫视误判为注视,或反之。采样率有时被误认为数据准确性,但二者是不同的属性。
      精确度 = 眼动仪在一段时间内持续收集数据的一致性。
      准确度 = 眼动仪检测到的注视点与实际注视点之间的误差量。
      例如,在研究注视在单词上的落点位置(即视线在单词字母上的位置)时,相较于仅关注阅读过程中回溯性眼跳(与前向性眼跳相比)所占百分比的研究,前者对采样率(≥500–2000 Hz)、精确度和准确度的要求要高得多。
    2. 确定眼动记录的方法。使用具有高采样率、高精度和高准确性的台式眼动仪。采用下颌托或额托进行头部固定。若使用无头部固定的眼动追踪(远程眼动追踪),如有条件,可在受试者额部粘贴标记贴片以改善面部追踪效果;除非眼动仪供应商特别推荐,否则应避免使用反光贴片。
      ​注意:由于可穿戴眼动仪设备相较于台式眼动仪具有相对较低的采样率、精确度和准确性,且在眼动数据的分析方面存在挑战,因此在阅读研究中的应用较为罕见。然而,在过去十年中,无头部固定或自然情境下的实验设置逐渐流行,伴随着数据质量的提升和自动化分析流程的发展,使得阅读过程中眼动研究的范围得以扩展至更自然的情境以及虚拟现实(VR)环境中的阅读。
  3. 硬件与软件的设置
    1. 设置硬件。测量参与者面部、显示器和眼动仪之间的距离。根据制造商建议设置观看距离(例如约60–70 cm)和所需的配置几何参数,建议使用21–27英寸的平面LCD显示器(例如在60 cm处使用24英寸显示器,约48° x 28° 视野),确保所有文本位于中央视觉区域内,并处于眼动追踪器的有效范围之中。检查显示器的倾斜角度与旋转状态,以及视线向量与其在屏幕上的对应位置之间的对齐情况。将显示器尺寸和刷新率设置为目标值。将屏幕分辨率设置为指定值。在指定距离处测量白色背景下的显示器亮度。将测得的亮度值记录于实验记录报告中。
      1. 必要时,优先选用高刷新率(120 Hz 或更高,例如 144–240 Hz)的 LCD 显示器,尤其是在进行眼动依赖型任务和需要精确时间验证的实验中。应禁用可变刷新率技术(如 G-Sync/FreeSync)。若不同研究人员使用同一台眼动仪开展不同的实验,记录每次数据采集过程中所做的任何设置更改至关重要。每次数据采集结束后,应将设备恢复至该实验开始时的原始状态,或按照实验室规程所规定的标准状态复位。
    2. 设置软件。大多数眼动仪制造商都会提供相应的软件、软件开发工具包(SDK)和/或库,以实现与开源软件的兼容和集成。
      ​注意:目前,某些特定的实验设置仍存在技术挑战,需要定制化解决方案。例如,将眼动仪与脑电图(EEG)和功能性近红外光谱成像(fNIRS)等互补测量方法进行时间同步,需要特殊的硬件和/或软件方案,以确保眼动仪时钟与刺激呈现时钟之间,和/或屏幕刷新不同步之间达到适当的时间锁定水平。因此,大多数制造商提供的工具仅能构建满足研究人员基本需求的实验环境,例如呈现刺激和记录眼动数据。下文列出了当前可用的软件包清单。 材料表.

2. 实验设计与预实验

  1. 刺激物的制备
    1. 准备阅读材料。阅读材料通常以句子或段落的形式呈现,具体形式取决于研究目标。只要符合研究目标,建议从现有资料中节选阅读材料,而非手动编写文本。
    2. 检查文本再使用的许可条件。查阅所有文本的许可条款。如果已发表实验的材料属于开源性质,因而可向任何希望使用的人公开获取,则无需获得许可。否则,在使用前必须取得必要的许可。重要的是需确认这些实验刺激材料是否可用于实验,以及是否可作为补充材料共享。
    3. 准备格式化的刺激材料。格式化文本刺激材料时,需使用适当的字体属性(字体类型、大小、字母间距、词间距和行间距)。应采用等宽字体,并根据文献中常用的设置选择合适的字体大小和间距。
      ​注意:在使用基于词语的兴趣区(AOI)的阅读实验中,建议使用等宽字体(如 Courier New),因为这类字体可使拉丁字母中的不同字母数字字符和符号具有相同的像素尺寸。研究人员应检查字体、界面以及刺激材料特定属性之间的兼容性,例如非拉丁字符的呈现或从右至左的阅读方向,同时需确认实验软件工具是否提供自动定义兴趣区(IA)或兴趣区(AOI)的方法。
  2. 设计实验方案
    1. 实验步骤的准备
      ​注意:指导语非常重要,因为它们在阅读过程中对眼动行为具有显著影响。即使采用最简形式,任务指导语的使用也至关重要。缺乏明确的指导语可能导致意外后果,从而影响被试的注视行为。例如,一名被试可能默认采用仔细阅读的方式,而另一名被试则可能进行略读,而非为理解而进行的自然阅读。
      1. 呈现标准化的屏幕内指示,并记录指示的起始时间和持续时间;在记录过程中避免使用口头提示。常见的做法是要求参与者进行理解性阅读。如果期望参与者以日常自然的方式进行阅读,应告知参与者需自然阅读,即无需刻意避免眨眼或重读。此外,如果存在其他附加任务(例如理解性问题),也应提前告知参与者(此类问题对于确保参与者真正进行理解性阅读至关重要)。指导语的内容不仅可能因任务而异,还可能因实验阶段的不同而有所调整(例如训练阶段与主实验阶段)。以下提供一个训练阶段所用指导语的示例18.
        现在我们将开始一次训练。您需要使用四个标有字母(A、B、C、D)的按键。稍后将向您显示进一步的说明。训练结束后,您的表现将被评估,评估过程需要一到两分钟。如果您的训练表现未达到要求,训练的最后一部分将被重复。如果表现达标,我将返回房间。当您准备就绪后,只需按下空格键即可。
      2. 研究人员可根据旨在研究阅读的实验训练环节,灵活使用此类指导语。然而,在实验环节中应使用以下指导语。在一般相关性指导条件(文本中包含或不包含问题)下,实验阶段指导语的示例如下所示19.
        您将阅读一组简短的说明性文本。我们希望您仔细阅读文本,尽可能充分理解其内容。阅读完成后,您需要口头总结文本的主要观点,以评估您对所读内容的理解程度。
        另一个示例说明如下,适用于采用句子阅读任务的实验20.
        欢迎参加我们的阅读研究。在本研究中,您将看到约一百个句子,这些句子从多种来源随机选取,并以随机顺序呈现。请以您自然的阅读速度默读每个句子,理解其含义,就像您平时读书时阅读句子的方式一样。在部分句子之后,您可能会被问及理解性问题,请尽量回答这些问题。如果您不知道答案,可跳过该问题。实验中途设有休息时间。如果您感到不适,可随时要求暂停或退出实验。如有任何疑问,请告知实验人员。若无其他问题,请按下一个按钮以开始实验程序。
    2. 设计试验和区组。通过考虑将试验划分为区组,并对区组内及区组间的试验顺序进行随机化,来规划实验流程。在每次试验前使用注视点十字(500–800 ms),以确保被试的初始注视位置位于屏幕相同位置,且远离文本的任何部分。
      ​瞳孔大小作为因变量的眼动实验设计需要相应调整实验流程,因为瞳孔大小并非像注视-扫视序列那样的瞬时反应。具体而言,当使用瞳孔大小作为因变量时,必须引入刺激呈现前的基线期(预刺激基线窗口)以及适当持续时间的黑屏间隔,以确保在刺激呈现及后续试验开始前瞳孔大小达到稳定状态。研究人员应参考近期关于瞳孔测量学的指导性研究,以确保所记录的瞳孔数据能够被合理地解释为因变量。 关键词:眼动实验,瞳孔大小,因变量,基线期,黑屏间隔,瞳孔测量学21,22.
    3. 在区块之间设计间隔。在实验区块之间引入漂移校正界面和可选的短暂休息,以确保数据质量并减少疲劳。在预设数量的试验后插入漂移检查,或在准确性明显下降时进行检查(确认是否存在可强制校准/验证的快捷键);若出现漂移,则重新校准 >1° 视觉角度的(x 和 y 坐标的均值)。
    4. 确定目标自变量。在阅读研究中,文本的特定属性,例如词频和句子中词语的可预测性,构成主要的目标自变量。根据研究目的,列出实验中的自变量。在统计分析中,自变量的度量可能需要进行数值归一化。基于刺激材料的属性评估每个变量的相关性。
      1. 排除文本行开头的词语,因为对这些词语的注视通常不准确:它们可能反映的是在文本/句子中的首次试探性注视,或换行后首次注视(即所谓的“回扫”),这些注视本身通常不准确,且常随后被纠正性注视所取代。同时排除每一行的最后一个词,因为这些词受到后续词语的视觉拥挤效应较小,且对行末词语的注视往往反映了一次试验的结束,或向文本下一行进行回扫的准备过程。
        ​注意:在功能词较多的语言中,首次注视持续时间的重要性可能较低,例如名词前的冠词(分析区域应包含冠词和名词,但首次注视的重要性会降低,因其可能仅反映对冠词的加工)。
    5. 确定目标因变量。在阅读研究中,一组眼动指标(如首次注视时间、单一注视时间、凝视时间、回视百分比和词语跳读概率)构成了与研究目标相关的主要目标因变量。明确需分析的眼动指标,并将其作为统计分析的核心依据。
      ​注意:避免使用任何需要参与者在键盘上打字的任务,因为这可能需要离开颏托,从而导致校准丢失。相反,可让参与者使用鼠标选择其反应。在眼动记录过程中需要参与者口头反馈的情况下,应使用额托代替颏托,并要求参与者口头作答,或允许其在保持位于额托上的同时进行单键反应。
  3. 实验步骤的实施
    1. 选择刺激呈现软件。使用适当的刺激呈现软件设置实验。可采用设备制造商提供的工具或通用的实验设计工具来呈现文本并记录眼动。在选择软件时,需考虑其与现有硬件的集成能力(例如,是否原生支持所用眼动仪)、所需的时间精度,以及使用者对脚本编写与基于图形用户界面(GUI)设计的偏好。无论使用何种平台,软件必须支持刺激事件(如词 onset、句子 onset)与眼动数据流之间的可靠同步,以便在分析过程中将注视和眼跳准确对应到相应的文本内容。若使用外部软件,需检查眼动仪软件与该外部软件之间的兼容性,尤其是在数据可视化和数据导出方面。
      ​注意:软件示例:Experiment Builder(SR Research,用于 EyeLink 系统)提供图形化界面,并内置支持漂移检查、校准程序以及向记录计算机发送事件消息的功能。开源平台如 PsychoPy 和 OpenSesame 提供类似功能,且不依赖特定硬件,允许通过图形界面或脚本(例如 PsychoPy 中的 Python)设计实验试次,控制刺激呈现时间,并在单词或文本行周围定义感兴趣区域,即兴趣区域(Interest Areas, IAs)或感兴趣区(Areas of Interest, AOI)。有时,初入领域的研究人员可能发现数据可视化与数据导出的衔接并不直观,因此使用设备制造商提供的软件可能更为简便。因此,选择眼动仪时的一个重要考虑因素是不同制造商或开发者社区所提供的支持程度。
    2. 开展预实验。测试已实施的实验流程,并检查所记录的数据,以确保实验按预期进行。在实验室环境中运行预实验,通过监测预定义的成功标准,确认实验按预期运行。检查记录的数据,以确认研究所需的所有内容均已被记录。

3. 招募并告知参与者

  1. 参与者筛选
    1. 确定视力条件要求。招募具有正常视力或矫正至正常视力的参与者。可根据制造商的指导,允许使用反光较少(如防眩光、调整显示器角度)的眼镜或隐形眼镜。记录矫正类型(眼镜、隐形眼镜),用于协变量检验。
      ​注意:通常,硬性隐形眼镜(目前已不常见)极难追踪。尽管隐形眼镜一般不会造成问题,但有时镜片与角膜之间可能形成气泡,产生干扰追踪的反光。镜框反光较强的眼镜也可能影响追踪效果。对于反光较强的玻璃镜框,可在眼动仪软件中减小视野检测范围。
    2. 根据特定个体特征对参与者进行筛选,例如年龄、阅读熟练程度、语言背景、利手性,以及常见的纳入与排除标准。诸如阅读障碍、双语能力或阅读障碍等条件可能影响眼动数据。因此,应根据研究目标明确读者作为实验合适参与者的条件,即纳入与排除标准(参见讨论部分)。
    3. 检查视觉障碍情况。确保参与者不存在无法矫正的视觉障碍,例如白内障(即使术后)、青光眼或黄斑变性。
    4. 检查神经系统状况。确保参与者不存在使其对眼动记录感到不适的疾病。大多数眼动仪使用近红外LED/激光或经认证的近红外LED/VCSEL照明,被认为对眼睛安全。请确认设备的眼安全认证(例如Class 1 IEC 60825-1、IEC/EN 62471或类似标准)。向参与者说明设备的安全规范(例如制造商提供的CE认证,通常称为欧盟符合性声明,是制造商出具的文件,证明产品符合所有必要的欧洲健康、安全和环境法规)。
  2. 建立卫生规范
    1. 注意个人距离相关防护措施。如需缩短人际距离以执行实验流程,应佩戴一次性手套和口罩。
    2. 对设备进行消毒。根据当前机构指南,使用酒精湿巾对下颌托及其他配件进行消毒。注意避免使用可能损坏设备的化学试剂。请查阅制造商的技术规格说明。若在参与者在场时对下颌托、头枕、鼠标或其将接触的其他设备部件进行清洁,参与者可能会感到更安心。
  3. 向参与者说明情况
    1. 向参与者介绍实验室环境。设计一段口头说明环节,由实验员向参与者介绍实验室环境及眼动追踪设备。
    2. 向参与者说明实验内容。清晰解释实验背景(研究目的及预计持续时间;应在预实验阶段确认)、激励或报酬机制、参与者在实验中的贡献,以及其长期跟进研究结果的权利。告知参与者在记录过程中应遵守的注意事项。请参与者尽量在记录期间减少头部移动(若未使用头部固定装置),或不要离开下颌托,并说明这些措施是为了保证数据的高质量记录(否则,参与者可随时中止实验并退出,无需提供理由)。
    3. 获取知情同意。在实验开始前,向参与者提供伦理审批文件和知情同意书,并进行解释。对于成年参与者,在确保其理解研究目的、实验过程及其权利(包括自愿参与、数据隐私保护和随时退出的权利)后,获取书面知情同意。对于未成年参与者,需获得其父母或监护人的书面同意及未成年人本人的同意。只有在所有必要的知情同意和同意书均完成后,方可继续进行校准和记录。
      ​注意:若实验过程中出现暂停或中断,需重新验证校准结果;若重新验证失败,则必须重新校准。

4. 执行校准与验证

  1. 受试者定位与设备调节
    1. 定位受试者。请受试者舒适地坐下。调节椅子/桌子和/或颏托,以保持头部位置稳定。告知受试者,在校准、验证和记录阶段均需保持此头部位置。
    2. 调节设备。通过调整眼动仪摄像头的位置,使受试者的瞳孔清晰可见并可被检测到。某些眼动追踪系统可自动完成对齐,而其他系统可能需要手动调节摄像头焦距。
      ​注意:实验人员应在正式采集数据前练习设备调节与校准,以避免将这些操作负担转嫁给受试者。
  2. 执行校准
    1. 告知受试者。向受试者说明校准流程(例如,将显示一系列目标标记,受试者需注视并跟随这些标记约一分钟左右)。
      ​注意:在进行说明时应谨慎措辞。例如,应强调该过程是为受试者校准眼动仪,而非为眼动仪校准受试者。此外,必须确保眼动设备不会记录任何视频或图像。尽管受试者的眼睛可见,但仅会记录由眼睛位置转换而来的坐标数据。
    2. 执行校准程序。指导受试者跟随目标标记,并保持头部位置固定;例如,校准结束后不要向后倾斜身体。指示受试者注视校准符号的中心,直到符号移动前不要移动眼睛。受试者往往倾向于预判符号的移动,尤其是在验证阶段,这可能增加误差并导致不必要的重复校准。应在指导语或校准/验证流程说明中包含此项解释。
      ​注意:制造商为校准过程提供了不同类型的符号(如圆点、适合儿童的符号、静态或收缩符号等)以及不同的校准设置(即校准点的数量)。应检验不同校准设置下的校准差异,并选择最符合特定研究需求的设置。例如,若刺激材料覆盖整个屏幕(如多段落文本),则应采用能确保从上到下包括角落区域均具有良好校准效果的设置。然而,若刺激为屏幕中央呈现的句子,则较少数量的校准点可能已足够。此外,对于后者而言,水平方向(即x坐标)的校准精度比前者更为重要,而前者则要求在垂直和水平两个方向上均具备良好的精度。
    3. 结束校准程序。完成校准后,告知受试者即将进行验证程序。
      ​注意:若持续校准失败,应检查眼动仪摄像头的对齐情况、光照条件及受试者的位置。对于成年受试者,反光化妆品、眼镜或隐形眼镜可能干扰追踪效果。应安抚受试者,允许短暂休息,或根据需要重复校准。若问题仍存在,可考虑重启眼动追踪系统。若重启系统后问题依旧,且在检查配置参数后仍未发现校准失败的原因,应告知受试者,眼动追踪技术目前尚未发展完善,此为技术状态相关的问题,而非受试者自身原因所致。
  3. 执行验证
    1. 运行验证程序。在校准完成后立即执行验证程序。
    2. 检查误差。检查平均注视位置误差,并确保其处于可接受范围内。通常期望视觉角度小于1度(<1°),相当于约4个字符宽度(即0.5对应约2个字符)。若误差超出该范围,则需重新校准。例如,当平均误差 ≤0.5–1.0° 且最大/单点误差 ≤1.5–2.0° 时可接受;否则应重新校准。应明确重新验证的频率(如每个实验区块或中断后)。以SR Research制造商提供的校准质量评价标准为例:平均误差 <1° 且最大误差 <1.5° 视为可接受;平均误差 <1°–1.5° 且最大误差 <1.5°–2° 视为一般;超过上述数值则视为较差。
    3. 告知受试者。指导受试者尽可能保持与校准时相同的身体位置,并告知其记录阶段即将开始。

5. 数据采集

  1. 运行数据采集程序
    1. 开始记录会话。启动记录会话,并在参与者执行任务期间避免干扰,例如避免提供口头指导。
    2. 监控参与者。在数据记录过程中监控参与者的舒适度。确保参与者保持稳定的姿势,无紧张或疲劳感。注意观察是否存在注意力分散、眼睛干涩,或因使用颏托/额托而引起的不适迹象。
    3. 监控数据记录。在记录过程中监控数据质量。如果平均验证误差或在线准确度超过1°(或预设的准确度阈值),或参与者姿势发生偏移,应重新校准。
    4. 记录日志。通过记录实验过程中观察到的任何异常情况(例如校准过程异常延长,或记录期间发生意外中断),为实验后检查保留会话日志。使用会话日志模板记录事件发生时间、中断情况、重新校准次数及其误差、漂移检查以及光照变化等信息。
  2. 会话结束
    1. 保存数据。在实验会话结束时保存原始眼动数据,建议采用系统化方法对会话进行标记(例如使用实验日期和参与者编号,如2025年7月18日的第01位参与者可标记为25071801或250718-P01);避免使用参与者的个人身份信息。
    2. 告别。感谢参与者,并解答他们对实验可能存在的任何疑问;对设备进行消毒处理(参见步骤3.2.2)。
    3. 检查数据。检查数据和日志,确保会话已正确完成。

6. 数据预处理与质量检查

  1. 导出、整理和清理原始数据
    1. 导出数据。以标准格式(例如 .csv、.tsv、.edf)导出原始眼动数据,并统一会话 ID 格式(例如 25071801 或 250718-P01,参见 5.2.1)。
    2. 清理数据。使用设备制造商提供的内置工具或自定义脚本,应用眨眼检测和缺失数据检测算法对原始数据进行清理,算法需根据设备型号或采样率进行调整。
      ​注意:在运行数据清理程序时,应创建原始数据的备份。
  2. 检测眼动事件
    1. 选择眼动事件检测算法。选择并运行用于注视点检测的程序,并根据需要调整算法参数。典型的注视点识别算法主要包括基于速度的算法(例如 I-VT 速度阈值识别法)和基于离散度的算法(例如 I-DT 离散度阈值识别法)等23。每种算法都有其特定的参数设置。
      注意:制造商的软件通常默认采用特定算法和一组常用参数。研究者有责任选择合适的算法及其参数,并在研究方法描述中明确报告,例如离散度/速度阈值、最小注视持续时间阈值(如 60 ms 或 100 ms),用于剔除短于该值的注视;最大注视持续时间阈值(如 1000 ms),用于剔除长于该值的注视;所使用的平滑窗口,以及相邻注视的合并规则23
    2. 识别无效注视。剔除或标记位于显示区域之外的注视;剔除或标记短于预设最小阈值或长于预设最大阈值的注视。
    3. 视觉检查数据。利用可用的可视化工具对数据进行视觉检查,以确保数据有效性。检查是否存在信号丢失、噪声过大、样本缺失或注视点错位等情况。每次记录会话后,应使用眼动仪软件提供的可视化工具(例如注视图、扫描路径、时间序列轨迹)检查数据质量。此步骤有助于在进入预处理和分析前确认数据质量是否足够可靠。
      1. 特别地,通过观察眼动模式中是否存在长时间空白或刺激材料上某些区域无眼动采样,来检查信号丢失和追踪问题。若频繁或长时间出现追踪丢失,可能表明该会话数据应被排除或需重新采集。
      2. 为检查噪声过大,应查看原始 x/y 坐标轨迹中是否存在突变或与刺激布局不符的异常采样点。过大的噪声可能表明校准效果不佳、头部位置不稳定或硬件存在问题。
      3. 为发现缺失或不规则采样,应检查采样率是否接近预期值(例如 500 Hz),以及是否存在超出正常眨眼范围的异常采样缺失聚集现象。
      4. 为发现错位的注视点,应将注视点叠加在呈现的刺激材料上,确认其是否落在预期的行和词上。系统性偏移(例如注视点持续偏离文本)可能表明校准漂移或眼动坐标与屏幕坐标之间的映射错误。记录的眼动模式应大致遵循文本结构(例如逐行从左到右的移动),注视点应集中在词语上,且词间扫视路径相对平滑。若系统性偏离该模式,或频繁丢失可用数据,则应考虑将受影响的数据从后续分析中剔除。
    4. 执行漂移校正。根据需要进行垂直漂移误差校正。对多行文本应用逐行垂直漂移校正。检查已验证方法的适用性21
      注意:图 1 展示了本实验方案中所述的眼动实验设计与数据分析流程的步骤示意图。下一节将展示记录会话的代表性结果。

结果

数据质量与验证
成功的实验环节通常在所有目标点上产生验证准确度,其平均误差 ≤0.5–1.0°,最大值/单点误差 <1.0–1.5°;需同时报告平均值和单点误差值。应提供单点误差的直方图,以及汇总每次实验平均值 ± 标准差(SD)和最大误差的表格。这些标准符合常规实践及设备厂商的建议;超出上述阈值的实验环节应根据研究规定部分或全部剔除。图2展示了针对9点校准的校准准确度示例单点误差直方图,该数据包含三次校准尝试的结果。

精确度与数据丢失
报告精确度(例如,固定期间样本间离散度的均方根 RMS –Root Mean Square–)和数据丢失情况(每次试验/会话中缺失样本的百分比)。良好的试验运行通常在注视固定期间表现出较低的离散度以及较低的数据丢失(例如,<5–10%,具体取决于眼动追踪设备和设置)。应提供数据丢失百分比的分布情况,以及按试验绘制的精确度与丢失率的散点图,以识别异常值。请参考当前文献中关于定义和最低报告要求的相关内容3,4,5,6,7,8,9,10,11

漂移行为(校正前/后)
良好的试验运行表现出较小且接近恒定的垂直偏移,通过逐行校正(无论是使用自动漂移校正算法21还是手动校正)可显著减小该偏移。相反,存在问题的运行则显示出非单调或较大的残余漂移。应包含校正前/后的中位绝对垂直误差。检查自动漂移校正方法的适用性。

常见阅读指标的分布
提供首次注视持续时间(FFD)、单一注视持续时间(SFD)、首遍注视持续时间(FP)和总注视/凝视持续时间(GD)、跳读时间、跳读概率以及回视概率的汇总分布。对于熟练成人在阅读字母文字时,注视持续时间通常集中在约200–250毫秒(具有显著偏态分布),而眼跳幅度平均约为7–9个字符。若数值明显超出该范围,或眼跳分布呈现高度双峰形态,应检查其是否反映了因任务限制或加工困难所导致的预期前向与回视眼跳,而非计时误差。根据被试人群、具体语言及文字系统的不同,所选用的指标及其取值范围可能相应有所差异。图3展示了一个代表性实验会话中的注视持续时间分布示例方案。

合理性检验
词长增加(长词)通常会导致跳读率降低,并对这些词的凝视时间延长。另一方面,功能词(例如冠词或介词)通常会被跳过。根据语言上下文(文本或句子内)高频出现的词以及高可预测性的词,通常会导致首次注视时间和凝视时间更短,且跳读率更高(低频词和低可预测性词则表现出相反趋势)。请检查数据是否至少在一个方向上重现了这些模式。若出现显著相反的结果,可能提示存在漂移误差、词语与注视点对齐错误或数据处理错误。

眼动追踪实验流程图;实验设置、刺激设计、数据采集、建模过程。
图1 眼动追踪实验设计与数据分析流程中各步骤的示意图。请点击此处查看此图的放大版本。

显示九个位置上误差分布的箱线图;统计数据分析。
图2 针对9点校准(包含三次校准尝试)的每点误差直方图,用于评估校准准确性。 请点击此处查看该图的放大版本。

用于语言学研究的文本分割与分析;带数字的方框中的词语。
图3 来自一次代表性实验的注视持续时间分布图;一名参与者阅读《小王子》小说节选。圆圈的位置和大小分别表示注视位置和持续时间。圆圈旁边的数字表示以毫秒(ms)为单位的注视持续时间。请点击此处查看此图的放大版本。

讨论

本文所述方案总结了在阅读研究中获取可靠眼动追踪数据所需的主要步骤。尽管其中许多步骤对经验丰富的研究人员而言可能已较为熟悉,但这些内容通常分散于不同的方法学论文、厂商技术文档以及非正式的实验室操作规范中。通过将这些步骤整合为从实验室准备到数据预处理的统一工作流程,我们旨在为刚进入阅读眼动追踪研究领域的研究人员提供一份实用指南。与通用的眼动追踪指南或主要关注眼动检测算法的资源相比,本方案提供了一个端到端的框架,以满足阅读研究对高空间分辨率和高采样频率数据采集的需求。

在整个工作流程的各个阶段中,一个核心主题是主动进行数据质量管理,其始于环境控制和设备设置。显示器上的反光、座椅不稳或视距不一致等微小问题都可能导致注视位置或精度出现系统性偏差。及早解决这些问题,可最大限度减少对事后大量校正的需求,并支持更一致的验证准确性(平均误差 ≤ 0.5–1°)。

该方案还强调了研究问题与硬件特性之间匹配的重要性。许多阅读研究依赖于对注视点、眼跳落点位置和回视进行精确的空间和时间测量1,2。因此,选择具有适当采样率、精确度和准确度的眼动仪至关重要,尤其是对于落点位置或副中央凹预览等对微小空间误差敏感的指标。根据具体研究条件的限制,这些方法可以进行调整。例如,在研究无法耐受颏托的神经多样性人群时,研究人员可改用远程、免头部固定的追踪设备,并通过使用更大的字体、更宽的行距以及更广泛的兴趣区域来弥补空间精度的损失。当使用免头部固定系统时,研究人员必须考虑头部运动增加及潜在的数据丢失问题。尽管远程眼动仪支持更自然的实验设置,但目前大多数阅读任务仍优先采用头部固定方式。

实验设计是影响数据质量和可解释性的另一个关键因素。标准化的屏幕提示、试次随机化以及适当的区块结构有助于保持受试者在整个实验过程中的行为稳定性。在阅读实验中,定期进行漂移校正尤为重要,因为即使微小的渐进偏移也会在多行文本阅读过程中逐渐累积。本方案还支持使用语言相关的词汇规范,并对自变量和因变量进行透明报告,从而促进不同研究之间的重复和比较。

在数据采集过程中,持续监控准确性、姿势和受试者舒适度有助于防止大规模数据丢失。对于常见问题,通常需要主动进行故障排查。例如,若校准在屏幕角落失败,可通过调整显示器或座椅高度来解决周边区域追踪丢失的问题。由反光眼镜或隐形眼镜引起的问题,有时可通过调节环境光照或改变显示器角度来解决。维护详细的实验记录有助于后续问题排查,并通过记录中断、重新校准和意外事件来增强研究透明度。这一点日益重要,因为当前许多已发表的研究均要求明确报告质量指标,包括精确度和数据丢失百分比。

预处理部分强调在事件检测、漂移校正和数据清洗流程中应保持一致且记录完整的操作选择。由于注视分类算法和阈值会显著影响最终的测量结果,研究人员应明确说明所有参数设置,并在参数与常用默认值不同时提供合理依据。即使使用了自动化工具,人工视觉检查仍然是一个关键步骤。本方案还建议报告标准的质量指标,例如验证准确率、精确度、数据丢失率和漂移变化情况,以便更可靠地进行研究间的比较。

此外,该方案建议进行简单的阅读行为合理性检验,例如词长、词频或可预测性等效应。重现这些典型模式可额外确保避免出现未被察觉的对齐问题、数据漂移或预处理错误。这些检验不能替代完整的统计分析,但可快速反馈数据在熟练阅读条件下的表现是否符合预期。

除了前文已提及的实验方案细节外,描述参与者的语言学和心理测量学特征也至关重要。其主要原因是实验研究人员在比较不同研究时所面临的挑战。在开放科学时代,这一点尤为重要,因为公开可用的数据集可能被未直接参与数据收集的研究人员使用,因此他们可能不了解因参与者(社会)语言背景差异而产生的潜在特异性问题。

关于语言背景,应注明参与者的第一语言,并收集其使用的方言信息,以考虑可能影响结果的方言差异。如果参与者掌握多种语言——这在当今世界十分常见——应记录其第二语言熟练程度。在双语或多语及第二语言加工的研究中,应采用经过验证的第二语言水平测试来评估第二语言能力。此外,还可记录与社会经济地位相关的其他方面信息(例如参与者的阅读习惯)。

应进行测试以评估参与者的心理测量学特征,例如工作记忆广度和认知灵活性(尤其是在双语研究中)。从方法学角度而言,研究者应考虑选择哪些测试、这些测试的认知负荷和时间要求,以及在实验流程中的何时进行这些测量——是在眼动追踪实验之前、之后,还是在单独的一次会话中进行。

必须牢记,在阅读研究中,语言行为是通过刺激材料的语言特征以及读者的心理测量特征(或与参与者语言行为相关的任何其他特征)来衡量和解释的11,12,17,20。为了实现研究间的比较,所有可能与数据解释相关的因素都必须包含在内。所纳入特征的选择将取决于研究的具体目的。数据必须具有可比性。总之,数据的收集和描述应足够详尽,以使任何潜在使用者在使用这些数据时获得最大程度的灵活性。这些考虑因素虽然可能不属于实验方案本身,但对每一项独立研究都具有重要意义。在当今全球化的科研环境中,此类细节能够提升所收集数据未来的可利用价值。

该方案存在一定的局限性,其中最显著的是数据质量与生态效度之间的权衡:在头部固定且面对静态显示器进行阅读时,无法完全反映自然状态下的阅读行为;同时,严格的视觉纳入标准可能限制样本的代表性。此外,不同眼动仪在坐标缩放、时间戳精度和事件分类方面存在显著差异。当前方案的一个局限性在于,尚未阐明这些差异如何影响跨实验室或跨设备品牌的可重复性。制定跨设备验证的指导规范,以及针对现实中的未来应用(例如将实验室范式转化为沉浸式虚拟现实或增强现实阅读环境,或开发用于认知或注意力障碍的数字生物标志物)的方案,将填补这一重要空白。

总体而言,该方案将现有的方法学指导整合为一个清晰透明的工作流程,用于在阅读过程中采集高质量的眼动追踪数据。通过遵循这些步骤并报告相关的质量指标,研究人员可以提高阅读研究的可重复性和可信度,并有助于在整个领域内建立更完善的方法学一致性。

致谢

资金来源:本项目得到了COST–科学技术领域欧洲合作组织(CA21131–支持用于人类与机器语言处理研究的多语言眼动数据采集(MultiplEYE),https://www.cost.eu/actions/CA21131)24、葡萄牙科学技术基金会(资助号:UID/214/2025,UI/BD/154500/2022)以及雅盖隆大学战略计划卓越计划优先研究领域DigiWorld(ID.UJ)项目“自然与人工智能体中交互与交流的认知层面”的支持。我们感谢Anna Maria Wilkosz提供的技术支持。

材料

本文使用的材料清单
姓名公司目录编号评论
酒精棉片(70%异丙醇)清洁材料本地实验室供应
可调节高度的下颌托头部稳定装置各类实验室供应商
知情同意书及实验后说明材料文档材料机构批准的模板
眼动仪(例如 SR Research EyeLink 1000 Plus, Tobii Pro Fusion)眼动追踪硬件SR Research Ltd., Tobii AB
眼动追踪数据分析软件(Data Viewer, Tobii Pro Lab)眼动数据处理软件SR Research Ltd., Tobii AB
眼动追踪软件(例如 Experiment Builder, Tobii Pro Lab, PsychoPy)及其软件开发工具包(SDK)刺激呈现软件及软件开发工具包SR Research Ltd., Tobii AB, 开源
通用数据分析软件(R 配合 lme4, ggplot2;JASP;Python 配合 Pandas, NumPy, Matplotlib)数据预处理与分析开源,https://www.python.org, https://www.r-project.org, https://www.jasp.org
通用实验设计软件(PsychoPy)刺激呈现软件开源,https://www.psychopy.org
其他第三方软件(例如 E-Prime)刺激呈现软件Psychology Software Tools, Inc.
隔音室环境控制机构设施
标准 24 英寸 LCD 显示器(或更小)显示设备任何符合 ISO 标准的制造商

参考文献

  1. Rayner, K. Eye movements in reading and information processing: 20 years of research. Psychol Bull. 124, 372-422 (1998).
  2. Rayner, K. Eye movements and attention in reading, scene perception, and visual search. Q J Exp Psychol. 62, 1457-1506 (2009).
  3. Carter, B. T., Luke, S. G. Best practices in eye tracking research. Behav Res Methods. 52, 278-295 (2020).
  4. Hessels, R. S., et al. The fundamentals of eye tracking part 1: The link between theory and research question. Behav Res Methods. 56, 16(2024).
  5. Hooge, I. T. C., et al. The fundamentals of eye tracking part 2: From research question to operationalization. Behav Res Methods. 57, 73(2025).
  6. Nyström, M., et al. The fundamentals of eye tracking part 3: How to choose an eye tracker. Behav Res Methods. 57, 67(2025).
  7. Niehorster, D. C., et al. The fundamentals of eye tracking part 4: Tools for conducting an eye tracking study. Behav Res Methods. 57, 46(2025).
  8. Hessels, R. S., et al. The fundamentals of eye tracking part 5: The importance of piloting. Behav Res Methods. 57, 216(2025).
  9. Dunn, M. J., et al. Minimal reporting guideline for research involving eye tracking (2023 edition). Behav Res Methods. 56, 4351-4357 (2024).
  10. Eskenazi, M. A. Best practices for cleaning eye movement data in reading research. Behav Res Methods. 56, 2083-2093 (2024).
  11. Schotter, E. R., Dillon, B. A beginner’s guide to eye tracking for psycholinguistic studies of reading. Behav Res Methods. 57, 68(2025).
  12. Conklin, K., Pellicer-Sánchez, A. Using eye tracking in applied linguistics and second language research. Second Lang Res. 32 (3), 453-468 (2016).
  13. Pellicer-Sánchez, A. Eye-tracking in vocabulary research: Introduction to the special issue. Res Methods Appl Linguist. 3 (1), 100095(2024).
  14. Hutton, S. B. Eye-tracking methodology. Eye movement research: An introduction to its scientific foundations and applications. , Springer International Publishing. 277-308 (2019).
  15. Pokhoday, M. Y., et al. Eye tracking methods in psycholinguistics and parallel EEG recording. Neurosci Behav Physi. 53, 220-229 (2023).
  16. Azman, H., Mihat, W., Soh, O. K. Analyzing stimuli presentations and exit-interview protocols to improve wearable eye-tracking data collection guidelines for reading research. IJCALLT. 11 (2), 51-65 (2021).
  17. Papadopoulos, T. C., et al. Eye-tracking in reading research: A systematic review of studies with children of varying reading ability. Eur Psychol. , (2026).
  18. Garlichs, A., Lustig, M., Gamer, M., Blank, H. Protocol to study how expectations guide predictive eye movements and information sampling in humans. STAR Protoc. 6 (2), 103737(2025).
  19. Moreno, J., León, J., Kaakinen, J. K., Hyönä, Relevance instructions combined with elaborative interrogation facilitate strategic reading: Evidence from eye movements. J Psicol Educ. 27 (1), 51-65 (2020).
  20. Acartürk, C. Eyes on Text: Eye movements in reading and language processing. , John Benjamins. (2025).
  21. Steinhauer, S. R., Bradley, M. M., Siegle, G. J., Roecklein, K. A., Dix, A. Publication guidelines and recommendations for pupillary measurement in psychophysiological studies. Psychophysiology. 59 (4), e14035(2022).
  22. Papesh, M. H., Goldinger, S. D. Modern pupillometry: Cognition, neuroscience, and practical applications. , Springer. (2024).
  23. Salvucci, D. D., Goldberg, J. H. Identifying fixations and saccades in eye-tracking protocols. Proc Symposium Eye Tracking Res Appl, , 71-78 (2000).
  24. Jakobi, D. N., et al. MultiplEYE: creating a multilingual eye-tracking-while-reading corpus. Proc Symposium Eye Tracking Res Appl, , ACM. 111(2025).

重印与许可

标签

阅读研究数据质量实验设计校准程序注视检测眼跳检测数据预处理验证准确性受试者管理