需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

结合眼动追踪数据与自由观看城市公园环境步行视频的视频内容分析

9.1K 次观看

DOI:

10.3791/58459

2019年5月7日

本文内容

摘要

本实验方案的目的是详细介绍如何在实验室中采集视频数据;如何记录参与者观看这些视频时的眼动数据;以及如何利用机器学习技术高效分析参与者所观看视频的内容。

摘要

随着越来越多的人生活在城市中,研究他们日常活动的方法以及可收集的数据变得日益重要和有价值。眼动追踪信息学已知与多种感觉、健康状况、心理状态和行为相关联。但由于视觉是持续眼球运动的结果,从噪声中区分出重要信息的过程复杂且需要大量数据。此外,一个重大挑战在于如何控制人们实际注视的内容与呈现给他们的内容之间的差异。

以下介绍一种将自然复杂场景视频的眼动追踪数据与用于分析视频内容的机器学习技术相结合并进行分析的方法。本实验方案重点阐述如何分析录制视频的数据,如何最佳利用视频记录参与者的眼动追踪数据,以及尤为重要的是,如何分析视频内容并将其与眼动追踪数据进行整合。我们简要总结了研究结果,并讨论了该方法在复杂环境进一步研究中的潜力。

引言

我们日常所经历的城市环境对健康与福祉有着巨大影响。我们的福祉可能取决于所看到和体验到的绿地空间的多少1,2,3,而这些视觉体验可通过眼动追踪设备进行量化,从而为公园设计的决策提供依据。然而,眼动追踪数据生成量庞大,如何有效理解和分析这些数据成为一个难题。随着在实验室或自然环境中记录注视数据的设备变得越来越易于使用且功能更强大,研究人员需要思考如何有效收集和分析数据,以支持决策相关问题的研究。

迄今为止,大量眼动追踪研究在调查或实验室环境中使用静态照片4。尽管这种方法有助于结果的高度可重复性和控制性,却无法充分利用眼动追踪技术的最新进展,例如视频和可穿戴移动眼动仪的应用。此外,我们认为,行走和放松行为本质上是动态的,尤其是在涉及寻路等任务时尤为如此5。因此,对这些情境的全面科学理解应当在实验室之外进行。然而,目前在真实自然环境中进行眼动追踪,使得被试间体验的比较变得极为困难。例如,如果我们希望比较一名受访者是否比另一名更多地注视树木,如何控制他们视角持续变化、或头部可能发生转动所带来的差异?在现有分析技术下,此类条件下的详细分析几乎不可能实现。我们认为,有必要控制被试可观察的视野区域,并在分析中能够计入任意时刻所观察的整个场景。

存在一系列理论,将压力水平和安全感知与景观视野及经过充分验证的压力测量方法联系起来6,7。同时,用于测量注视行为的眼动追踪设备在技术上也迅速变得更加精密8。眼动追踪至关重要,因为非自主性的眼球运动可能比问卷调查以及侵入性的生理测试(如唾液皮质醇水平)更能可靠地反映个体偏好、压力状态及其他传统指标。本研究的目标是开发出能够对更接近自然环境中的眼动追踪数据进行更精确测量的工具,从而为长期指导公园设计的景观理论提供进一步的支持证据或提出反驳。

本项目旨在开发并测试一种新颖的分析技术,以生成与不同公园步行模拟视频相关的有效眼动追踪数据。我们在此及其他地方9所报告的研究,介于完全移动式眼动追踪系统所处的自然环境与上述基于实验室的静态图像研究之间。具体而言,我们聚焦于使用视频作为刺激材料,探索此类材料可用于检验墨尔本市不同公园所引发的吸引力程度。本研究基于以下假设:在对公园缓解压力潜力进行更全面、更贴近真实环境的评估之前,对视频进行细致分析是必不可少的前期步骤。

在本研究中,我们使用了一台台式眼动仪,并向参与者播放了穿过城市公园的步行视频,要求他们想象自己正在公园中进行一次放松的散步。我们描述了一种方法,使得参与者在不同公园中观察各类物体所花费的时间具有可比性。与移动式眼动追踪研究相比,台式研究通常更容易控制,且能够对每位受试者进行比较分析。

标准的眼动追踪软件使用手动兴趣区工具,操作者可在每个场景中手动绘制感兴趣物体的边界。这使得系统能够自动统计参与者观察不同物体所花费的时间。对于视频数据而言,该过程费时费力,且容易受到操作者主观判断和误差的影响。在后续版本的眼动追踪分析软件中,当视频中的物体大小保持不变时,兴趣区可自动跨帧追踪物体。这一改进虽有所提升,但仅适用于每幅图像中数量较少的刺激物,且每幅图像仍需人工检查和确认。

在图像中手动标记物体是常见的操作,可通过 GNU 图像处理程序(GIMP)等图像编辑软件实现。由于每秒会产生 30 帧或图像,因此对视频进行手动标记是不现实的。此外,通过在复杂物体(如树冠)边缘周围绘制矢量多边形来标记感兴趣区域(AOI)非常耗时。最后,尽管理论上可以使用矢量标记来计算视野中物体的尺寸,但目前尚无软件提供此功能。

我们在此报告的方法解决了上述局限性。本研究采用了对象的自动标注技术。该技术可通过一种称为语义标注的图像处理方法实现,即为视频中每一帧的每个像素分配一个指示对象类别的标签。通过机器学习为每个感兴趣的对象类别构建像素分类器。这些分类器为每个像素提供一个概率性标签(称为一元势),随后通过进一步的优化过程对这些标签进行精修,以获得最终的标注结果。这些分类器在从图像中提取的特征空间中学习各个对象类别之间的统计决策边界,所用特征包括纹理、边缘方向直方图、RGB 颜色值以及归一化图像坐标。该方法已在 DARWIN 机器学习工具箱10 中实现了适当的技术,下文将对此进行描述。

访问受限。请登录或开始试用以查看此内容。

方案

该项目已获得澳大利亚天主教大学伦理委员会的伦理批准,批准编号为 #201500036E。该批准确保从所有参与者处获得知情同意,所有参与者均为自愿参与,且参与者的数据保持匿名和保密。此外,该批准还基于所采用的方法和设备符合澳大利亚标准安全法规。

1. 拍摄可用于眼动追踪研究的城市场景

  1. 使用连接云台的高质量数码摄像机创建模拟“行走”或“静坐”的视频。
  2. 以 4K 分辨率、25 fps 的帧率录制视频,并将其保存为 1920 x 1080 高清格式。
  3. 如果不熟悉此操作或无法获取相关设备,可委托专业影视制作公司制作数字影片。
  4. 所有视频均应单次拍摄完成,长度一致,并严格按照预设的路线和特征进行。
    注:示例视频细节:每段模拟行走视频时长为 3 分 50 秒,每段模拟静坐视频时长为 1 分钟。本研究中的两段视频均以一段短楼梯开始,随后进入一条路径。路径行进持续恰好 1 分 30 秒,然后摄像机停止并左转 45 至 60 度,静止 15 秒。之后摄像机继续沿路径前进至第 3 分 25 秒处,再次左转 40 至 70 度并静止 15 秒,继续沿路径行进至第 3 分 50 秒,随后渐变为黑屏。
  5. 确保各视频之间具有可比性,即避免因不同的行走轨迹或摄像机运动引入新的注视数据。每种行走方式仅拍摄一段视频,共两段。
  6. 由于眼动会受到声音影响,应从其中一段行走视频中录制一段时长相等的通用城市公园环境音,且避免公园外部突发性高音干扰(例如汽车警报声)。该音频可用于替代两段视频中原有的音轨,从而单独评估视频的视觉影响。
    注:车辆及其他物体的过度移动可能影响眼动行为并导致结果偏差。若确实出现此类干扰,仍可向受试者播放该视频,但在分析时可能需要排除相关帧。
  7. 若希望研究行走过程中的不同活动(例如行走后坐在长椅上),可将静坐与行走场景分别保存或剪辑为独立文件,以便独立测试。

2. 眼动仪设备的设置与桌面校准

  1. 在可排除自然光的房间内向受试者播放录制的视频序列,以避免屏幕反光。应尽可能使用大屏幕播放,以占据尽可能多的视野范围,从而减少视野外因素的干扰。建议使用22英寸宽屏(16:9)电脑显示器,受试者距离屏幕约60 cm,此为可接受的标准配置。
  2. 使用眼动追踪软件内置的校准工具,为每位受试者进行屏幕校准。校准过程中要求受试者注视屏幕上移动的红色球体,该球体将在5个关键校准点依次停留。
  3. 校准过程中需观察受试者,确保其头部保持静止。若受试者距离屏幕过近且屏幕尺寸较大,则可能引发头部移动问题,应相应调整其与屏幕之间的距离。
  4. 编辑每段视频,使其早期画面的左上角显示一个白色十字。此操作可通过视频编辑软件实现。该画面应持续显示3秒,随后开始播放行走视频。此步骤用于验证眼动追踪校准的准确性,并确保眼动数据采集时间可与各视频帧编号精确匹配。

3. 招募与伦理

  1. 使用专业的研究招募公司,以确保样本涵盖不同性别、年龄和职业的参与者,或直接从学生和教职员工中进行现场招募。
  2. 对参与者进行已知眼部或神经系统疾病和/或损伤的筛查。必须询问他们是否正在服用已知会影响眼动的药物(例如苯二氮䓬类药物)。
  3. 进行近视力阅读测试和手电筒眼动检查,以确认其眼动范围正常。
  4. 调查参与者关于其年龄、性别及使用公园的频率。

4. 受试者实验设置

  1. 请参与者设想自己需要恢复精力。使用一个句子帮助他们想象眼动视频所使用的场景,例如:“假设现在是中午,你独自一人在墨尔本行走。由于工作时长时间高度集中注意力,你感到精神疲惫,正在寻找一个可以散步、坐下休息片刻后再返回工作的地方”。
  2. 让参与者舒适地坐在计算机屏幕前,距离为60–65 cm,以观看视频。
  3. 使用电子表格程序在向参与者播放前将视频随机排序。
  4. 使用扬声器为所有视频播放相同的音频。
  5. 使用台式眼动仪系统记录参与者的眼动轨迹。按照制造商的说明安装台式眼动设备,可将其置于屏幕下方的桌面上,或夹在屏幕顶部边缘等位置。
  6. 使用采样频率为120 Hz、精度为0.50°的眼动仪,该规格允许较大的头部活动自由度,可在自然头部运动过程中进行记录。较低频率的眼动仪也可接受。在57.3 cm距离处,1°视角约等于屏幕上~1 cm的距离。
  7. 让参与者在显示器上以高清模式观看视频内容。
  8. 使用眼动追踪软件记录眼动数据。
  9. 采用注视点滤波器将原始眼动采样数据转换为可用于分析的形式。从主菜单中点击 工具 > 设置,选择注视点滤波器选项卡,根据制造商推荐的最佳滤波器类型,选择合适的滤波器将原始眼动数据聚类为注视点。
  10. 若使用多个视频记录眼动数据,在每次记录会话之间,应根据参与者的要求提供休息时间。

5. 将所观看的公园与视频印象关联起来

  1. 通过让参与者对每个公园在1到10分之间进行评分,比较人们观看不同环境对象的程度及其对视频的评价。评分包括两个方面:首先是他们是否觉得在该环境中能够休息和恢复(1分表示“不太能”,10分表示“非常能”),其次是他们对这个公园的喜爱程度(1分表示“不太喜欢”,10分表示“非常喜欢”)。
  2. 询问参与者是否会使用该公园来放松或缓解压力(是/否),以及他们是否认出所观看的公园(是/否),以控制先前与该公园存在关联可能带来的影响。
  3. 使用录音设备记录参与者对印象解释的简短回答,随后将这些录音内容转录为文字。

6. 用于感兴趣区域提取的自动视频分析

  1. 选择感兴趣区域(AOIs)
    1. 选择对公园设计师、城市设计师、规划师或建筑师感兴趣的项目,例如树木、灌木、指示牌、建筑物、草坪、小路、台阶 等等。
    2. 为获得最佳性能并尽量减少训练需求(下文将进一步讨论),应使用肉眼易于区分的元素,和/或在每个视频帧中始终位于不同区域的元素。通常情况下,只要提供足够数量的训练样本,清晰展现各个兴趣区域(AOI)的视觉差异,即可实现稳定的性能表现。
  2. 训练用于兴趣区域提取的分类器
    1. 用于训练的帧的选择、数量及依据
      1. 选择适当数量的训练帧(以下简称训练集)。合适的数量并无固定标准。
        注意:各帧必须充分覆盖每个物体类别的视觉外观范围。即, 在整个视频中,需要标记这些对象。例如,在一段包含15,000帧的单一公园场景视频序列中,选取40帧即可达到足够的准确度。如果序列中存在显著变化,则可能需要更多帧。
      2. 选择训练帧时需考虑帧内容,包括:照明条件、与待分类对象相关的形状例如, 不仅限于一种树木,而是多种类型的树木,它们在图像中的位置,以及受光照的方式 等等。)、质地和颜色。
      3. 还需考虑所包含的帧数。具体而言,应考虑被分析视频中视觉条件的持续时间与变化程度,以及需要识别的目标类别数量及其出现频率。
    2. 训练帧的手动像素标注
      注意:手动标注训练帧会将像素与感兴趣的目标类别相关联。
      1. 训练帧的像素标注
        1. 依次在图像编辑软件中打开视频的每一帧训练图像。
        2. 对于视频中的每一帧训练图像,在已加载的图像上叠加一个透明图层用于标注,并创建一个颜色调板,为每个感兴趣的目标类别分别提供一种颜色即, AOI
        3. 确保在整个标注过程中,配色方案及颜色与对象类别的对应关系保持一致。
        4. 选择样本感兴趣区域(AOI)的颜色。
        5. 使用鼠标点击并拖动,选择目标区域内的像素,结合适当的调色板选项,对样本感兴趣区域(AOIs)进行着色。
          注意:对较大的物体进行着色可能存在不精确的情况。然而,对于宽度仅有几个像素的细小物体,需格外仔细,以确保手动标注能准确反映物体的视觉特征。
        6. 完成某一帧的标注后,将叠加图层导出为单独的图像文件。确保基础文件名与原始帧的基础文件名一致,但在末尾添加字母“c”。例如,若原始帧文件名为“1234.png”,则标注图层文件名应为“1234c.png”。
        7. 确保所有标记的图像均存储在同一个文件夹中。
      2. 验证帧的像素标注
        注意:为了定量验证训练所得分类器的准确性,应创建另一组带标签的帧。
        1. 从原始视频序列中选取尚未被选入训练集的帧。对于一段5分钟的视频,选取的帧数无需超过20帧,但应在整个视频序列中均匀采样,以确保覆盖充分。
        2. 使用与制备训练帧(6.2.2)相同的步骤对每一帧中的像素进行标注。但此次标注应尽可能精确和全面,因为将用作真实情况的比对标准。
        3. 当一个帧的标注完成后,应使用与训练阶段相同的命名规范,但需确保文件保存在独立的验证帧文件夹中。
    3. 视频序列的自动像素标注
      1. 从 http://drwn.anu.edu.au 下载 DARWIN 软件库。
        注意:本文所述系统在 Linux 环境中实现,因此应按照网站提供的说明下载并安装 DARWIN 的 Linux 版本。
      2. 启动 Darwin 图形用户界面
      3. 在 Darwin 图形用户界面中,单击 加载训练标签.
      4. 在出现的文件浏览器对话框中,选择包含相关视频序列标注训练图像的文件夹。
      5. 点击 加载视频帧 并按照 6.2.3.2 节的相同步骤,选择包含视频序列所有原始帧的文件夹。该文件夹应为图像文件夹,其中每一帧的文件名即为该帧在视频序列中的编号例如,第1234帧将被命名为1234.png)
      6. 点击 训练 按钮。算法现在将检查每个标注的训练帧,并学习外观模型,以将像素分类为任意指定的目标类别。
    4. 验证训练好的分类器
      1. 训练完成后,单击 验证训练 按钮
      2. 使用文件资源管理器对话框,选择包含相关视频序列所有标注验证图像的文件夹。随后,将使用训练好的分类器对验证集中各帧图像中的像素进行分类,并与验证文件夹中提供的真实标签进行比较。
        注意:完成后,图形用户界面(GUI)将显示准确率统计结果,包括验证集中每一帧图像中被正确标注的像素百分比,以及整个验证集的总体准确率。
      3. 为直观验证生成的标签,单击 视觉验证 按钮。若点击,每个生成的标注图像将显示在原始验证帧旁边。
        注意:这有助于识别对象上发生误分类的位置。例如,目视检查可能显示某一对象类别的特定部位 consistently 出现错误,表明训练集中需要对该部位进行更精确的标注。或者,检查可能显示错误仅出现在视频的特定时间点,表明需要从该时间段增加更多的训练样本。
      4. 如果在定量或定性验证中观察到的准确率低于可接受水平,则需增加更多的训练样本。在此情况下,重复步骤6.2.2至6.2.4,以纳入额外的训练帧,按照6.2.3中的步骤重新训练分类器,并按照6.2.4中的步骤重新进行验证。
    5. 视频像素标注
      1. 分类器训练和验证阶段完成后,单击 标记帧 在 Darwin 图形用户界面中启动操作,以使用训练好的分类器对视频序列中的所有帧进行完整标注。
      2. 按照提示为所有输出帧选择目标文件夹,输出帧将以与训练过程中使用的相同调色板进行着色标记。

7. 将眼动追踪数据与视频内容进行配准

  1. 在眼动追踪软件中,点击 文件 > 导出… 将眼动追踪文件导出为 CSV 文件。
  2. 在电子表格程序中打开该文件。
  3. 从视频序列中确定左上角白色十字(见 2.3)消失的时间点。利用该时间点,结合眼动追踪结果中的相应数据列,确定眼动追踪的起始时刻。此即为眼动追踪数据采集的开始时间。
  4. 在眼动追踪数据中添加一列。
  5. 利用这一新列,从数字 1 开始,为每一行或每一个眼动追踪数据点标记对应的帧编号。

8. 显示参与者在视频中观察不同类别物体的时间长度

注意:由于眼动数据量巨大,建议使用 Python 编程语言完成第 8.4 步之前的所有步骤,尽管也可使用其他数据处理程序。

  1. 使用提供的 Python 代码,计算感兴趣对象与眼动追踪注视时间及注视频率之间的重叠量。
  2. 汇总这些数据,以了解参与者观察不同对象所花费的时间总量。
  3. 使用直方图显示各个对象在屏幕上出现的总时长。
  4. 将此结果与参与者观察不同对象的总时间进行比较。
  5. 在眼动追踪软件中生成热图时,通过勾选框选择其中一个公园行走视频。
  6. 点击 热图 选项卡。
  7. 根据需要调整热图的颜色和其他特征,可使用的参数包括“计数”(在时间窗口内的总注视次数)、“绝对持续时间”(累积注视时长)和“相对持续时间”(观察某一对象的时间除以观察整个场景的时间)。
  8. 将包含热图的图像或视频导出为 JPEG 文件或视频文件。

访问受限。请登录或开始试用以查看此内容。

结果

图1图2 展示了对所有参与者在整个视频过程中采集的眼动追踪数据生成的热图结果;这是眼动追踪软件包中常见的标准方法。图1图2 相比,可以发现参与者在 图1 中沿视频的 x 坐标左右扫描的程度更明显,而 图2 则呈现出更圆润的形状。这是因为 图1 的视频中包含比 图2 公园场景更多的水平元素。热图背后的图像仅为单帧画面,无法充分反映视频的全部内容。

桌面眼动追踪系统及软件仅统计能够同时定位双眼的结果...

访问受限。请登录或开始试用以查看此内容。

讨论

通常,在用于分析眼动追踪数据的标准软件包中,会使用矢量兴趣区(AOI)。即使对于单张静态图像,矢量的大小也难以直接测量。此外,将图像中所有兴趣区全部纳入并计算其相对面积是一项繁琐的工作。如果没有类似本文所述的机器学习技术,几乎不可能手动完成视频中的此类分析。上述描述相对简单,适用于自由观看的情境。而更精确的实验情境可以被采用,并且在相同刺激呈现前给予不同的场景描述也会影响眼动行为11

我们的研究采用了一种方法,用于准确分类视频中的物体,并分析这些物体对人眼的可见程度。该方法为衡量眼动与感兴趣物体之间关联程度提供了一种途径。这使得在使用移动眼动仪比较不同受试者的眼动数据,或使用基于桌面的系统比较不同场景位置时,能够控制视野中感兴趣物体的存在程度。影响我们所采用的机器学习方法对物体进行自动分类效果的因素包括光照条件、被分类物体的形状特征等例如 不仅限于一种树木类型,还包括多种树木类型、它们在图像中的位置以及光照方式 等等。)、纹理和颜色。在确定帧数时,需考虑被分析视频中视觉条件的持续时间与变化程度,以...

访问受限。请登录或开始试用以查看此内容。

致谢

本工作得到了墨尔本市的财政支持,并部分获得了澳大利亚研究理事会(ARC DP 150103135)的资助。我们感谢 Eamonn Fennessy 提供的建议和合作支持。特别感谢研究助理 Isabelle Janecki 和 Ethan Chen,他们也协助了数据的收集与分析。所有错误均由作者负责。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
12 mm 镜头Olympus镜头
Panasonic GH4 Panasonic摄像机
Tobii Studio 版本 (2.1.14)  Tobii软件
Tobii x120 台式眼动仪Tobii眼动仪

参考文献

  1. Patrik, P., Stigsdotter, U. K. The relation between perceived sensory dimensions of urban green space and stress restoration. Landscape and Urban Planning. 94 (3-4), 264-275 (2010).
  2. Bjørn, G., Patil, G. G. Biophilia: does visual contact with nature impact on health and well-being? International Journal of Environmental Research and Public Health. 6 (9), 2332-2343 (2009).
  3. Velarde, M. aD., Fry, G., Tveit, M. Health effects of viewing landscapes-Landscape types in environmental psychology. Urban Forestry & Urban Greening. 6 (4), 199-212 (2007).
  4. Polat, A. T., Ahmet, A. Relationships between the visual preferences of urban recreation area users and various landscape design elements. Urban Forestry & Urban Greening. 14 (3), 573-582 (2015).
  5. Peter, P., Giannopoulos, I., Raubal, M. Where am I? Investigating map matching during self-localization with mobile eye tracking in an urban environment. Transactions in GIS. 18 (5), 660-686 (2014).
  6. Berto, R., Massaccesi, S., Pasini, M. Do Eye Movements Measured across High and Low Fascination Photographs Differ? Addressing Kaplan's Fascination Hypothesis. Journal of Environmental Psychology. 28 (2), 185-191 (2008).
  7. Kaplan, S. The restorative benefits of nature: Towards an integrative framework. Journal of Environmental Psychology. 15, 169-182 (1995).
  8. Duchowski, A. T. Eye Tracking Methodology: Theory and Practice. , 3rd ed, Springer International Publishing. London. (2017).
  9. Amati, M., Ghanbari Parmehr, E., McCarthy, C., Sita, J. How eye-catching are natural features when walking through a park? Eye- tracking responses to videos of walks? Urban Forestry and Urban Greening. 31, 67-78 (2018).
  10. Gould, S. D. A. R. W. I. N. A Framework for Machine Learning and Computer Vision Research and Development. Journal of Machine Learning Research. (Dec), 3533-3537 (2012).
  11. Richardson, D., Matlock, T. The integration of figurative language and static depictions: an eye movement study of fictive motion. Cognition. 102 (1), 129-138 (2007).
  12. Bojko, A. Eye Tracking the User Experience: A Practical Guide to Research. , Rosenfeld, New York. (2013).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签