需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

使用移动眼动仪捕捉联合视觉注意的方法学

7.2K 次观看

DOI:

10.3791/60670

2020年1月18日

本文内容

摘要

使用多模态传感器是理解社交互动在教育环境中作用的一种有前景的方法。本文描述了一种利用移动眼动仪捕捉共处一地的成对个体之间共同视觉注意的实验方法。

摘要

随着新技术的进步,研究者能够以前所未有的精确度在微观层面研究社会互动。高频传感器,如眼动仪、皮肤电活动腕带、脑电图(EEG)设备和运动传感器,可提供毫秒级的观测数据。这种精度使研究人员能够收集关于社会互动的大量数据集。本文讨论了如何利用多个眼动仪捕捉社会互动中的一个基本构念——共同视觉注意(JVA)。发展心理学家曾研究JVA以理解儿童如何习得语言,学习科学家利用它来探究小群体学习者如何协作,社会科学家则用它来分析小型团队中的互动。本文描述了一种在共处环境下使用移动眼动仪捕捉JVA的方法学,展示了一些实证结果,并探讨了通过捕捉微观观测数据来理解社会互动的意义。

引言

在过去的一个世纪中,联合注意(JVA)得到了广泛研究,尤其是由研究语言习得的发展心理学家所关注。研究很快发现,联合注意不仅仅是学习词汇的一种方式,更是儿童心理理论发展的先决条件1。因此,它在许多社会过程中发挥着重要作用,例如与他人交流、协作以及共情能力的发展。例如,自闭症儿童缺乏与其照护者协调视觉注意的能力,这与显著的社会功能障碍相关2。人类需要联合注意才能成为社会中的功能性成员,协调自身行为,并从他人身上学习。无论是儿童习得最初词汇、青少年向学校教师学习、学生合作完成项目,还是成人群体为共同目标而工作,联合注意都是个体之间建立共同认知基础的基本机制3。本文聚焦于教育研究中对JVA的探讨。理解联合注意如何随时间展开,对于研究协作学习过程具有重要意义。因此,它在社会建构主义教学环境中起着主导作用。

联合注意的确切定义目前仍存在争议4。本文关注的是联合注意(JA)的一个子结构,即视线联合注意(JVA)。当两个个体在同一时间注视同一位置时,即发生JVA。需要注意的是,JVA并不能提供有关联合注意研究中其他重要概念的信息,例如对共同注意、相互注意或共享注意的监测,或更广泛地说,对群体中其他成员认知状态的觉察。本文通过整合两名参与者的眼动追踪数据,并分析他们视线重合的频率,从而对JVA进行操作化和简化处理。对于更全面的讨论,感兴趣的读者可进一步参阅Siposova等人的研究4,以深入了解JA这一概念的研究。

在过去十年中,技术进步极大地改变了对联合视觉注意(JVA)的研究。主要的范式转变是使用多个眼动仪来获取注意力对齐的定量测量,而不是在实验室或生态环境中对视频记录进行定性分析。这一发展使研究人员能够收集关于二人组视觉协调的精确且详细的信息。此外,眼动仪正变得越来越经济实惠:直到最近,其使用还仅限于学术机构或大型企业。如今,已经可以购买到价格低廉且能生成可靠数据集的眼动仪。最后,随着注视追踪功能逐步被整合到现有的设备中,例如高端笔记本电脑以及虚拟和增强现实头戴设备,眼动追踪技术即将变得无处不在。

由于眼动追踪设备的普及,了解它们在社会互动研究中能够提供和无法提供哪些信息变得尤为重要。本文提出的方法标志着在这一方向上的初步探索。我针对使用多个眼动仪捕捉联合视觉注意(JVA)时面临的两个挑战:1)时间尺度上的数据同步,以及2)空间尺度上的数据同步。更具体而言,本方案利用放置在真实世界环境中的基准标记,为计算机视觉算法提供参与者注视方向的信息。这种新型方法为对小群体中人类行为的严谨分析开辟了道路。

本研究方案符合哈佛大学人类研究伦理委员会的指导方针。

访问受限。请登录或开始试用以查看此内容。

方案

1. 受试者筛选

  1. 确保招募视力正常或矫正视力正常的参与者。由于参与者需要佩戴移动式眼动仪,因此可以佩戴隐形眼镜,但不能佩戴普通眼镜。

2. 实验准备

  1. 眼动追踪设备
    1. 使用任何能够捕捉真实世界环境中眼动的移动式眼动仪。
      注:本研究中使用的移动式眼动仪为两台 Tobii Pro Glasses 2(参见材料表)。除了可追踪眼动的专用摄像头外,该眼镜还配备有高清场景摄像头和麦克风,以便在用户视野背景下可视化注视点。这些眼镜每秒采集50次注视数据。其他研究人员曾使用 ASL Mobile Eye5、SMI6 或 Pupil-labs7,这些设备均能提供来自场景摄像头的视频流以及以不同采样率(30–120 Hz)输出的眼动追踪坐标。使用其他眼动追踪设备时,以下操作步骤可能略有不同。
  2. 基准标记
    1. 以下两个步骤(即时间对齐和空间对齐)需要使用基准标记。目前已有多个计算机视觉库为研究人员提供此类标记及用于在图像或视频流中检测它们的算法。本方案采用 Chilitag 库8
  3. 时间对齐
    1. 由于眼动数据记录于两个独立的设备上,需确保数据正确同步(图1)。主要有两种方法可用。本文仅介绍第一种方法,因为服务器同步方式因不同品牌的移动眼动仪而异。
      1. 在计算机屏幕上短暂显示一个基准标记,以标记一次实验的开始和结束。这类似于视觉上的"击掌"信号(图2)。
      2. 或者,使用服务器同步两个数据采集单元的时钟。如果需要更高的时间精度,推荐使用此方法,因其准确性略高。
  4. 空间对齐
    1. 为了判断两名参与者是否在同一时间注视同一位置,需将他们的注视点映射到一个共同的平面上。该平面可以是实验场景的图片(参见图3左侧)。实验前应仔细设计此图像。
    2. 基准标记的大小:基准标记的一般尺寸取决于用于从眼动视频中检测标记的算法。靠近参与者的表面可使用较小的基准标记,而距离较远的表面则需要更大的标记,以确保从参与者的视角看其大小相似。实验前应尝试不同尺寸,确保标记能被眼动视频可靠检测。
    3. 基准标记的数量:为成功将注视点映射至共同平面,需确保在任意时刻从参与者的视角均能看见多个基准标记。
    4. 基准标记的位置:使用成条状排列的基准标记框定感兴趣的区域(例如,参见图3中的笔记本电脑屏幕)。
  5. 最后,进行预实验以测试同步流程,并确定基准标记的最佳位置、大小和数量。可通过计算机视觉算法处理眼动视频,检查基准标记是否能被稳定检测。

3. 运行实验

  1. 操作说明
    1. 指导受试者像佩戴普通眼镜一样佩戴眼动追踪眼镜。根据受试者不同的面部特征,可能需要使用不同高度的鼻托,以保证数据质量。
    2. 开启眼动仪后,让受试者将记录单元夹在身上,以便其能够自然地活动身体。
  2. 校准
    1. 在软件的校准功能启用时,指导受试者注视Tobii提供的校准标记中心。校准完成后,即可通过软件开始记录。
    2. 指导受试者在校准完成后不要移动移动式眼动仪。如果发生移动,数据可能不准确,需要重新进行校准程序。
  3. 数据监控
    1. 在研究过程中监控数据采集情况,确保眼动追踪数据被正确采集。大多数移动式眼动仪可通过另一设备(例如平板电脑)提供实时数据流,用于此目的。
  4. 数据导出
    1. 记录会话结束后,指导受试者取下眼动追踪眼镜和数据采集单元,并关闭该单元。
    2. 通过从数据采集单元中取出SD卡并导入会话数据,使用另一软件Tobii Pro Lab提取数据。Tobii Pro Lab可用于回放视频、生成可视化图表,并将眼动追踪数据导出为逗号分隔(.csv)或制表符分隔(.tsv)文件。

4. 双眼追踪数据的预处理

  1. 眼动追踪数据的合理性检查
    1. 在数据采集完成后,需对眼动追踪数据进行视觉检查。部分参与者出现数据缺失的情况并不罕见。例如,某些特殊的眼部生理结构可能对眼动追踪算法造成干扰,实验过程中眼镜可能发生位移,数据采集软件可能崩溃等。
    2. 使用描述性统计方法检查每次实验会话中丢失的数据量,并排除那些存在大量缺失或噪声数据的会话。
  2. 时间对齐
    1. 将每个移动式眼动仪采集的数据进行裁剪,仅保留参与者之间的交互时段。可通过前述方法实现(即在会话开始和结束时向参与者展示两个特殊的基准标记)。随后,从眼动追踪视频中检测这些基准标记,以对数据集进行裁剪。
  3. 空间对齐
    注意:为了判断两名参与者是否在同一时间注视同一位置,必须将他们的注视点重映射到一个公共平面上(即实验场景的图像)。实现此目标的计算方法是单应性变换(homography,即平面的透视变换)。从技术角度看,空间中同一平面的两幅图像之间可通过一个单应性矩阵关联。基于一组共同的点,该矩阵可用于推断两个平面之间其他点的位置。例如,在图3中,如果计算机视觉算法已知基准标记在讲义上的位置,就可以将参与者的注视点重映射到左侧的公共平面上。白色线条连接了每位参与者视频流与场景共享的两组点,这些点用于构建单应性矩阵,从而将左侧的绿色和蓝色点进行重映射。
    1. 使用 Python 版本的 OpenCV(或您所选编程语言中的其他合适库),根据基准标记计算单应性矩阵,并将眼动追踪数据重映射到实验场景图像上。OpenCV 提供了两个有用函数:findHomography() 用于获取单应性矩阵,perspectiveTransform() 用于将点从一个视角变换到另一个视角。
    2. 使用 findHomography() 时,需传入两个参数:源点的 X、Y 坐标(即从参与者场景视频中检测到的基准标记,如图3右侧所示)和对应的目标点坐标(即在场景图像上检测到的相同基准标记,如图3左侧所示)。
    3. 将得到的单应性矩阵与需要从源图像映射到目标图像的新点(例如,图3右侧所示的作为蓝/绿点的眼动追踪数据)一起输入 perspectiveTransform() 函数。perspectiveTransform 函数将返回该点在场景图像上的新坐标(即 图3 左侧所示的蓝/绿点)。
      注意:更多相关信息,OpenCV 官方文档提供了实现单应性变换的示例代码和案例:docs.opencv.org/master/d1/de0/tutorial_py_feature_homography.html。
  4. 单应性变换的合理性检查
    1. 对整个会话完成第 4.3 节的操作,并对移动眼动追踪视频的每一帧执行单应性变换,以检查变换质量。尽管目前尚无自动化方法可评估所得眼动数据的准确性,但应使用类似图4所示的视频对每次会话进行人工合理性检查。
    2. 若变换质量低于预期,可考虑调整以下参数以提升单应性变换效果:
      1. 检测到的基准标记数量:仅当视频流中能检测到足够数量的基准标记时才执行单应性变换。该数量可通过检查上述生成的视频确定。
      2. 基准标记的位置:若不同标记处于不同深度和方向,通常选择最接近注视坐标的标记可提高单应性变换质量,前提是这些标记足以构建稳健的单应性矩阵。
      3. 基准标记的方向:混合使用不同方向(如水平和垂直)的基准标记会导致单应性变换不准确。建议首先判断参与者正在注视的平面或感兴趣区域(AOIs)(例如计算机屏幕、提示卡、桌面,见图3),然后仅使用该平面上的基准标记进行单应性变换。
      4. 视频流质量:突然的头部运动可能导致视频帧模糊,使数据无法使用,因为基准标记无法被可靠检测(见图4)。本文所述方法不适用于涉及大量突发性头部运动的实验。

5. 分析双人眼动追踪数据

  1. 缺失数据
    1. 为确保数据已正确映射到参考图像上,需生成可视化图表(例如图5图6)和描述性统计结果,以检查缺失数据的程度。
  2. 交叉递归图
    1. 使用交叉递归图9来表示两名参与者之间的视觉同步情况(图6),其中X轴代表第一位参与者的时间,Y轴代表第二位参与者的时间。黑色方块表示参与者正在注视同一区域;一条黑色对角线表示两名受试者在同一确切时间注视相同内容;而偏离对角线的黑色方块则表示两名受试者在存在时间延迟的情况下注视相同内容。最后,区分缺失数据(白色方块)与存在数据但无联合视觉注意(JVA)的情况(灰色方块),有助于识别存在问题的实验会话。这为研究人员提供了直观的合理性检验。
  3. 计算联合视觉注意(JVA)
    1. 在对缺失数据进行过滤后,通过统计参与者视线在场景中相同半径范围内(定义见下文)且处于±2秒时间窗口内的重合次数,计算JVA指标。将该数值除以可用于计算JVA的有效数据点数量。所得商值表示两名受试者共同注视同一位置的时间百分比。最后一步对于避免因单应性变换(homography)后数据量较多而导致组间评分被高估至关重要。
      注意:在计算JVA之前需设定两个参数,即两个注视点之间的最小距离以及它们之间的时间窗口(图7):1)时间窗口:一项早期基础研究10使用单个眼动仪测量听者与说话者之间的JVA。研究人员让第一组参与者("说话者")描述一部其面前显示角色的电视节目。随后,第二组参与者("听者")在收听说话者录音的同时观看同一节目。研究人员比较了说话者与听者的 eye movements(眼动),发现听者的眼动与说话者的眼动高度匹配,但存在约2秒的延迟。在后续研究中11,研究人员分析了实时对话,发现3秒的延迟最能捕捉到JVA时刻。由于每项任务具有独特性,可能表现出不同的时间延迟,因此建议探索不同时间延迟对特定实验结果的影响。总体而言,通常根据实验任务选择在±2/3秒的时间窗口内寻找JVA,然后进一步分析不同时间延迟如何影响结果。2)注视点间距离:目前尚无经验性定义的注视点间距离标准来判定是否构成JVA。该距离取决于研究人员所设定的研究问题。研究问题应指导感兴趣目标区域的大小设定。如图7所示示例中,选择场景图像上100像素的半径(蓝色/绿色圆圈)作为分析标准,因为该范围足以涵盖参与者注视迷宫中机器人以及计算机屏幕上相似用户界面元素的情况——这两者正是本实验任务的主要兴趣区域。

访问受限。请登录或开始试用以查看此内容。

结果

上述方法学已被用于研究参加物流职业培训项目的学生(n = 54)12。在该实验中,学生两人一组与一个有形用户界面(TUI)进行交互,该界面模拟了一个小型仓库。TUI上的基准标记使研究团队能够将学生的注视点重新映射到一个公共平面上,并计算联合视觉注意(JVA)水平。研究结果表明,JVA水平较高的小组在所分配任务中的表现更好,学习效果更佳,且协作质量更高13图8,左侧)。双人眼动追踪数据集还使我们能够捕捉特定的小组动态,例如“搭便车”效应。我们通过识别每次JVA时刻的发起者(即谁的注视先到达)和响应者(即谁的注视后到达)来估算这一效应。我们发现,学习成效的提升与学生在发起和响应JVA行为上均等分担责任的倾向之间存在显著相关性。换句话说,若同一人始终发起JVA时刻,则该小组的学习可能性较低(图8,右侧);而当这一责任由成员均等分担时,小组更有可能实现有效学习。该发现表明,我们不仅能够量化联合视觉注意,还能利用双人眼动追踪数据识别...

访问受限。请登录或开始试用以查看此内容。

讨论

本文所述方法为捕捉共处一地的二人组中的共同注意(JVA)提供了一种严谨的途径。随着价格适中的传感技术以及改进的计算机视觉算法的出现,现在已能够以前所未有的精度来研究协作性互动。该方法利用分布在环境中的基准标记,并通过单应性变换将参与者的注视点重映射到一个公共平面上,从而实现对共处一地群体中共同注意的严谨研究。

该方法包含多个需要在实验不同阶段执行的合理性检查。由于这是一个复杂的流程,研究人员需要确保所获得的数据集完整且有效。最后,建议在正式实验前开展预试验,并在数据采集完成后通过视频回放重建参与者的互动过程(图3图4图5图6)。

该方法存在若干局限性:

参与者数量。虽然该方法在两名参与者的情况下效...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在任何竞争性经济利益。

致谢

本方法的开发得到了美国国家科学基金会(NSF #0835854)、由瑞士教育、研究与创新国务秘书处资助的职业教育领先机构技术项目以及哈佛教育学院院长风险基金的支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Tobii Glasses 2TobiiN/Ahttps://www.tobiipro.com/product-listing/tobii-pro-glasses-2/
基准标记Chili lab – EPFL, 瑞士N/Ahttps://github.com/chili-epfl/chilitags

参考文献

  1. Tomasello, M. Joint attention as social cognition. Joint attention: Its origins and role in development. Moore, C., Dunham, P. J. , Lawrence Erlbaum Associates, Inc. Hillsdale, NJ, England. 103-130 (1995).
  2. Mundy, P., Sigman, M., Kasari, C. A longitudinal study of joint attention and language development in autistic children. Journal of Autism and Developmental Disorders. 20, 115-128 (1990).
  3. Clark, H. H., Brennan, S. E. Grounding in communication. Perspectives on socially shared cognition. Resnick, L. B., Levine, J. M., Teasley, S. D. , American Psychological Association. Washington, DC, US. 127-149 (1991).
  4. Siposova, B., Carpenter, M. A new look at joint attention and common knowledge. Cognition. 189, 260-274 (2019).
  5. Gergle, D., Clark, A. T. See What I'm Saying?: Using Dyadic Mobile Eye Tracking to Study Collaborative Reference. Proceedings of the ACM 2011 Conference on Computer Supported Cooperative Work. , ACM. New York, NY, USA. 435-444 (2011).
  6. Renner, P., Pfeiffer, T., Wachsmuth, I. Spatial References with Gaze and Pointing in Shared Space of Humans and Robots. Spatial Cognition IX. Freksa, C., Nebel, B., Hegarty, M., Barkowsky, T. , Springer International Publishing. 121-136 (2014).
  7. Shvarts, A. Y. Automatic detection of gaze convergence in multimodal collaboration: a dual eye-tracking technology. The Russian Journal of Cognitive Science. 5, 4(2018).
  8. Bonnard, Q., et al. Chilitags: Robust Fiducial Markers for Augmented Reality [software]. , Available from: https://github.com/chili-epfl/qml-chilitags (2013).
  9. Jermann, P., Mullins, D., Nüssli, M. -A., Dillenbourg, P. Collaborative Gaze Footprints: Correlates of Interaction Quality. Connecting Computer-Supported Collaborative Learning to Policy and Practice. CSCL2011 Conference Proceedings., Volume I - Long Papers. , 184-191 (2011).
  10. Richardson, D. C., Dale, R. Looking To Understand: The Coupling Between Speakers' and Listeners' Eye Movements and Its Relationship to Discourse Comprehension. Trends in Cognitive Sciences. 29, 1045-1060 (2005).
  11. Richardson, D. C., Dale, R., Kirkham, N. Z. The Art of Conversation Is Coordination Common Ground and the Coupling of Eye Movements During Dialogue. Psychological Science. 18, 407-413 (2007).
  12. Schneider, B., et al. Using Mobile Eye-Trackers to Unpack the Perceptual Benefits of a Tangible User Interface for Collaborative Learning. ACM Transactions on Computer-Human Interaction. 23, 1-23 (2016).
  13. Meier, A., Spada, H., Rummel, N. A rating scheme for assessing the quality of computer-supported collaboration processes. Int. J. Comput.-Support. Collab. Learn. 2, 63-86 (2007).
  14. Schneider, B., Pea, R. Real-time mutual gaze perception enhances collaborative learning and collaboration quality. Journal of Computer-Supported Collaborative Learning. 8, 375-397 (2013).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Tobii Pro Glasses数据同步单应性变换交叉递归图热图可视化fiducial marker 检测时间对齐空间重映射