本实验方案的目的是详细介绍如何在实验室中采集视频数据;如何记录参与者观看这些视频时的眼动数据;以及如何利用机器学习技术高效分析参与者所观看视频的内容。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本实验方案的目的是详细介绍如何在实验室中采集视频数据;如何记录参与者观看这些视频时的眼动数据;以及如何利用机器学习技术高效分析参与者所观看视频的内容。
随着越来越多的人生活在城市中,研究他们日常活动的方法以及可收集的数据变得日益重要和有价值。眼动追踪信息学已知与多种感觉、健康状况、心理状态和行为相关联。但由于视觉是持续眼球运动的结果,从噪声中区分出重要信息的过程复杂且需要大量数据。此外,一个重大挑战在于如何控制人们实际注视的内容与呈现给他们的内容之间的差异。
以下介绍一种将自然复杂场景视频的眼动追踪数据与用于分析视频内容的机器学习技术相结合并进行分析的方法。本实验方案重点阐述如何分析录制视频的数据,如何最佳利用视频记录参与者的眼动追踪数据,以及尤为重要的是,如何分析视频内容并将其与眼动追踪数据进行整合。我们简要总结了研究结果,并讨论了该方法在复杂环境进一步研究中的潜力。
我们日常所经历的城市环境对健康与福祉有着巨大影响。我们的福祉可能取决于所看到和体验到的绿地空间的多少1,2,3,而这些视觉体验可通过眼动追踪设备进行量化,从而为公园设计的决策提供依据。然而,眼动追踪数据生成量庞大,如何有效理解和分析这些数据成为一个难题。随着在实验室或自然环境中记录注视数据的设备变得越来越易于使用且功能更强大,研究人员需要思考如何有效收集和分析数据,以支持决策相关问题的研究。
迄今为止,大量眼动追踪研究在调查或实验室环境中使用静态照片4。尽管这种方法有助于结果的高度可重复性和控制性,却无法充分利用眼动追踪技术的最新进展,例如视频和可穿戴移动眼动仪的应用。此外,我们认为,行走和放松行为本质上是动态的,尤其是在涉及寻路等任务时尤为如此5。因此,对这些情境的全面科学理解应当在实验室之外进行。然而,目前在真实自然环境中进行眼动追踪,使得被试间体验的比较变得极为困难。例如,如果我们希望比较一名受访者是否比另一名更多地注视树木,如何控制他们视角持续变化、或头部可能发生转动所带来的差异?在现有分析技术下,此类条件下的详细分析几乎不可能实现。我们认为,有必要控制被试可观察的视野区域,并在分析中能够计入任意时刻所观察的整个场景。
存在一系列理论,将压力水平和安全感知与景观视野及经过充分验证的压力测量方法联系起来6,7。同时,用于测量注视行为的眼动追踪设备在技术上也迅速变得更加精密8。眼动追踪至关重要,因为非自主性的眼球运动可能比问卷调查以及侵入性的生理测试(如唾液皮质醇水平)更能可靠地反映个体偏好、压力状态及其他传统指标。本研究的目标是开发出能够对更接近自然环境中的眼动追踪数据进行更精确测量的工具,从而为长期指导公园设计的景观理论提供进一步的支持证据或提出反驳。
本项目旨在开发并测试一种新颖的分析技术,以生成与不同公园步行模拟视频相关的有效眼动追踪数据。我们在此及其他地方9所报告的研究,介于完全移动式眼动追踪系统所处的自然环境与上述基于实验室的静态图像研究之间。具体而言,我们聚焦于使用视频作为刺激材料,探索此类材料可用于检验墨尔本市不同公园所引发的吸引力程度。本研究基于以下假设:在对公园缓解压力潜力进行更全面、更贴近真实环境的评估之前,对视频进行细致分析是必不可少的前期步骤。
在本研究中,我们使用了一台台式眼动仪,并向参与者播放了穿过城市公园的步行视频,要求他们想象自己正在公园中进行一次放松的散步。我们描述了一种方法,使得参与者在不同公园中观察各类物体所花费的时间具有可比性。与移动式眼动追踪研究相比,台式研究通常更容易控制,且能够对每位受试者进行比较分析。
标准的眼动追踪软件使用手动兴趣区工具,操作者可在每个场景中手动绘制感兴趣物体的边界。这使得系统能够自动统计参与者观察不同物体所花费的时间。对于视频数据而言,该过程费时费力,且容易受到操作者主观判断和误差的影响。在后续版本的眼动追踪分析软件中,当视频中的物体大小保持不变时,兴趣区可自动跨帧追踪物体。这一改进虽有所提升,但仅适用于每幅图像中数量较少的刺激物,且每幅图像仍需人工检查和确认。
在图像中手动标记物体是常见的操作,可通过 GNU 图像处理程序(GIMP)等图像编辑软件实现。由于每秒会产生 30 帧或图像,因此对视频进行手动标记是不现实的。此外,通过在复杂物体(如树冠)边缘周围绘制矢量多边形来标记感兴趣区域(AOI)非常耗时。最后,尽管理论上可以使用矢量标记来计算视野中物体的尺寸,但目前尚无软件提供此功能。
我们在此报告的方法解决了上述局限性。本研究采用了对象的自动标注技术。该技术可通过一种称为语义标注的图像处理方法实现,即为视频中每一帧的每个像素分配一个指示对象类别的标签。通过机器学习为每个感兴趣的对象类别构建像素分类器。这些分类器为每个像素提供一个概率性标签(称为一元势),随后通过进一步的优化过程对这些标签进行精修,以获得最终的标注结果。这些分类器在从图像中提取的特征空间中学习各个对象类别之间的统计决策边界,所用特征包括纹理、边缘方向直方图、RGB 颜色值以及归一化图像坐标。该方法已在 DARWIN 机器学习工具箱10 中实现了适当的技术,下文将对此进行描述。
访问受限。请登录或开始试用以查看此内容。
该项目已获得澳大利亚天主教大学伦理委员会的伦理批准,批准编号为 #201500036E。该批准确保从所有参与者处获得知情同意,所有参与者均为自愿参与,且参与者的数据保持匿名和保密。此外,该批准还基于所采用的方法和设备符合澳大利亚标准安全法规。
1. 拍摄可用于眼动追踪研究的城市场景
2. 眼动仪设备的设置与桌面校准
3. 招募与伦理
4. 受试者实验设置
5. 将所观看的公园与视频印象关联起来
6. 用于感兴趣区域提取的自动视频分析
7. 将眼动追踪数据与视频内容进行配准
8. 显示参与者在视频中观察不同类别物体的时间长度
注意:由于眼动数据量巨大,建议使用 Python 编程语言完成第 8.4 步之前的所有步骤,尽管也可使用其他数据处理程序。
访问受限。请登录或开始试用以查看此内容。
图1 和 图2 展示了对所有参与者在整个视频过程中采集的眼动追踪数据生成的热图结果;这是眼动追踪软件包中常见的标准方法。图1 与 图2 相比,可以发现参与者在 图1 中沿视频的 x 坐标左右扫描的程度更明显,而 图2 则呈现出更圆润的形状。这是因为 图1 的视频中包含比 图2 公园场景更多的水平元素。热图背后的图像仅为单帧画面,无法充分反映视频的全部内容。
桌面眼动追踪系统及软件仅统计能够同时定位双眼的结果...
访问受限。请登录或开始试用以查看此内容。
通常,在用于分析眼动追踪数据的标准软件包中,会使用矢量兴趣区(AOI)。即使对于单张静态图像,矢量的大小也难以直接测量。此外,将图像中所有兴趣区全部纳入并计算其相对面积是一项繁琐的工作。如果没有类似本文所述的机器学习技术,几乎不可能手动完成视频中的此类分析。上述描述相对简单,适用于自由观看的情境。而更精确的实验情境可以被采用,并且在相同刺激呈现前给予不同的场景描述也会影响眼动行为11。
我们的研究采用了一种方法,用于准确分类视频中的物体,并分析这些物体对人眼的可见程度。该方法为衡量眼动与感兴趣物体之间关联程度提供了一种途径。这使得在使用移动眼动仪比较不同受试者的眼动数据,或使用基于桌面的系统比较不同场景位置时,能够控制视野中感兴趣物体的存在程度。影响我们所采用的机器学习方法对物体进行自动分类效果的因素包括光照条件、被分类物体的形状特征等例如 不仅限于一种树木类型,还包括多种树木类型、它们在图像中的位置以及光照方式 等等。)、纹理和颜色。在确定帧数时,需考虑被分析视频中视觉条件的持续时间与变化程度,以...
访问受限。请登录或开始试用以查看此内容。
本工作得到了墨尔本市的财政支持,并部分获得了澳大利亚研究理事会(ARC DP 150103135)的资助。我们感谢 Eamonn Fennessy 提供的建议和合作支持。特别感谢研究助理 Isabelle Janecki 和 Ethan Chen,他们也协助了数据的收集与分析。所有错误均由作者负责。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 12 mm 镜头 | Olympus | 镜头 | |
| Panasonic GH4 | Panasonic | 摄像机 | |
| Tobii Studio 版本 (2.1.14) | Tobii | 软件 | |
| Tobii x120 台式眼动仪 | Tobii | 眼动仪 |
访问受限。请登录或开始试用以查看此内容。