方法文章

通过狗的眼睛:基于犬类皮层fMRI对自然视频的解码

9.2K 次观看

DOI:

10.3791/64442

2022年9月13日

本文内容

摘要

机器学习算法已通过训练,利用大脑活动模式来“解码”呈现给人类的刺激。在此,我们证明了相同的技术能够从两只家犬的大脑中解码自然主义视频内容。我们发现,基于视频中动作的解码器在犬类中取得了成功。

摘要

近年来,利用机器学习和功能性磁共振成像(fMRI)从人类和非人类皮层解码视觉刺激的研究取得了新进展,为理解感知的本质提供了新的见解。然而,这一方法尚未被广泛应用于灵长类以外的动物,这引发了关于动物界中此类神经表征本质的疑问。本研究中,我们对两只家犬和两名人类受试者进行了清醒状态下的fMRI扫描,期间每位受试者均观看特制的、适合犬类的自然视频。随后,我们训练了一种神经网络(Ivis),利用每人和每只犬各90分钟的脑活动记录数据来分类视频内容。我们测试了两种分类器:一种基于物体的分类器,旨在区分“狗”“人”“汽车”等类别;另一种基于行为的分类器,旨在区分“进食”“嗅闻”“说话”等类别。与两名人类受试者相比(两种分类器的表现均显著高于随机水平),只有基于行为的分类器能够成功解码犬类的视频内容。这些结果展示了机器学习首次成功应用于解码食肉动物大脑中自然视频内容的案例,并表明狗所感知的世界图景可能与人类的体验大不相同。

引言

与其他灵长类动物一样,人类大脑表现出视觉通路在背侧和腹侧路径上的分区,各自具有明确且广为人知的功能——即物体的"是什么"与"在哪里"1。这种“是什么/在哪里”的二分法数十年来一直是一种有用的启发式模型,但其解剖学基础如今被认为要复杂得多,许多研究者更倾向于基于识别与动作("是什么" 对 "如何做")的分区方式2,3,4,5。此外,尽管我们对灵长类视觉系统组织结构的理解仍在不断深化和争论中,但对于其他哺乳动物物种的大脑如何表征视觉信息,目前仍有许多未知之处。部分原因在于视觉神经科学长期以来仅集中于少数几个物种。然而,新的脑成像方法正在为无创研究更广泛动物物种的视觉系统提供可能,这或将加深我们对哺乳动物神经系统组织结构的理解。

犬(Canis lupus familiaris)为研究在进化上远离灵长类的物种中视觉刺激的表征提供了丰富的研究机会,因为它们可能是唯一能够被训练以合作方式参与 MRI 扫描而无需镇静或束缚的动物6,7,8。由于在过去 15,000 年中与人类共同进化,犬也生活在我们的环境中,并接触到人类日常所遭遇的许多刺激,包括视频屏幕——这是在 MRI 扫描仪中呈现刺激的首选方式。即便如此,犬处理这些常见环境刺激的方式可能与人类大相径庭,这就引出了一个问题:它们的视觉皮层是如何组织的?一些基本差异——例如缺乏中央凹,或为二色视觉——可能不仅对低层次视觉感知,而且对高层次视觉表征产生显著的下游影响。已有若干项犬类 fMRI 研究表明,存在与面孔和物体处理相关的脑区,这些脑区似乎遵循灵长类中所见的背侧/腹侧通路总体架构,但目前尚不清楚犬是否真正具有专门的面孔处理脑区,或这些脑区是否仅对头部形态(例如犬与人类)具有选择性9,10,11,12,13。无论如何,犬的大脑比大多数灵长类小,因此预计其功能模块化程度较低14,这可能导致通路中不同类型信息的混合程度更高,甚至可能更偏好某些类型的信息,例如动作。例如,有研究提出,运动可能是犬类视觉感知中比纹理或颜色更显著的特征15。此外,由于犬没有手——这是我们与世界互动的主要方式之一——它们对物体的视觉处理可能与灵长类存在显著差异。与此一致的是,我们最近发现证据表明,用口而非用爪与物体互动会在犬脑的物体选择性区域引发更强的激活16

尽管狗可能已经适应了家庭环境中的视频屏幕,但这并不意味着它们会像人类一样习惯于在实验环境中观看图像。使用更接近自然的刺激材料可能有助于解决其中一些问题。在过去十年中,机器学习算法在从人类脑活动中解码自然视觉刺激方面取得了显著进展。早期的成功主要集中在将经典的区块化设计加以改进,利用脑活动来分类个体所看到的刺激类型以及编码这些表征的脑网络17,18,19。随着更强大算法(尤其是神经网络)的发展,研究者能够解码更复杂的刺激,包括自然视频20,21。这些分类器通常基于对视频的神经响应进行训练,能够泛化到新的刺激,从而识别出个体在fMRI响应时刻所观察的内容。例如,电影中的某些动作(如跳跃和转身)可以从人脑活动中被准确解码,而其他动作(如拖拽)则不能22。类似地,尽管许多类型的物体可以从fMRI响应中被解码,但一般类别似乎更难识别。脑解码不仅限于人类,它为理解其他物种大脑中信息的组织方式提供了有力工具。对非人灵长类动物进行的类似fMRI实验发现,其颞叶中存在关于生命性和面部/身体特征维度的独特表征,这与人类的情况相似23

为了初步理解犬类对自然视觉刺激的表征,本研究对两只高度适应磁共振成像(MRI)的家犬采用清醒状态下的功能性磁共振成像(fMRI),测量其大脑皮层对适合犬类观看的视频所产生神经反应。本研究选用自然视频,因其可能对犬类具有更高的生态效度,且已有研究证明此类视频在将视频内容映射到犬类行为的神经网络分析中具有成功应用24。在三次独立的实验会话中,分别采集了每只犬对256个不同视频片段反应的90分钟fMRI数据。作为对照,同样程序也在两名人类志愿者身上实施。随后,利用神经网络模型,我们训练并测试了分类器,以区分不同类别的"物体"(例如:人、狗、汽车)或"行为"(例如:说话、进食、嗅闻),并尝试了不同数量的分类类别。本研究的目标有两个:1)确定是否能够从犬类皮层解码出自然视频刺激的信息;2)若可行,则初步探究其皮层组织方式是否与人类相似。

方案

本犬类研究已获得埃默里大学动物护理和使用委员会(IACUC)的批准(批准号:PROTO201700572),所有犬主均已签署书面同意书,同意其犬只参与本研究。人类研究程序已获得埃默里大学机构审查委员会(IRB)的批准,所有受试者在扫描前均签署了书面知情同意书(批准号:IRB00069592)。

1. 参与者

  1. 选择此前未接触过本研究中所呈现刺激的参与者(狗和人类)。
    ​注:犬类参与者为两只由主人自愿提供的本地宠物犬,参与了与先前描述一致的fMRI训练和扫描7。Bhubo是一只4岁的雄性拳师犬混种,Daisy是一只11岁的雌性波士顿梗混种犬。两只狗此前均参与过多次fMRI研究(Bhubo:8项研究,Daisy:11项研究),其中部分研究涉及在扫描仪内观看投射到屏幕上的视觉刺激。选择它们的原因在于它们已表现出能够在扫描仪内长时间保持静止不动,且在此期间主人不在其视线范围内。另有两名人类(一名男性,34岁;一名女性,25岁)参与了本研究。无论是犬类还是人类参与者,此前均未接触过本研究中展示的刺激材料。

2. 刺激材料

  1. 使用手持稳定云台拍摄视频(1920 像素 × 1440 像素,每秒 60 帧 [fps])。
    注意:本研究中的视频于 2019 年在美国佐治亚州亚特兰大拍摄。
    1. 以约膝盖高度持握云台,从"狗的视角"拍摄自然场景视频。设计视频内容以捕捉狗日常生活中的各种情境。
      注意:这些场景包括行走、进食、玩耍、人类之间的互动(以及人类与狗之间的互动)、狗之间的互动、行驶中的车辆以及其他非犬类动物(图 1A补充影片 1)。在部分片段中,视频中的对象会直接与摄像机互动,例如抚摸、嗅闻或与摄像机玩耍;而在其他片段中,摄像机则被忽略。额外的鹿类影像来自本地布设的相机陷阱(1920 像素 × 1080 像素,30 fps)。
    2. 将视频剪辑为 256 个独立的 7 秒"场景"。每个场景描绘单一事件,例如人类拥抱、狗奔跑或鹿行走。根据内容为每个场景分配唯一编号并进行标注(见下文)。
  2. 将这些场景编辑为五部较长的合集视频,每部约 6 分钟。使用多个合集视频而非一部长片,以便按顺序呈现多种多样的刺激内容。
    注意:若视频以单次长镜头"拍摄"方式录制,则难以实现多样化刺激的呈现。这一做法与人类功能磁共振成像(fMRI)解码研究一致20,22。此外,采用短片段合集的方式更便于构建独立的测试集以评估训练后的算法性能(见下文第 7 节“分析”),因为可以保留个别片段作为测试集,而无需保留整部长视频。其中四部合集视频包含 51 个独立场景,另一部包含 52 个。各场景之间无中断或空白画面。
  3. 半随机选择场景,以确保每部视频均包含所有主要标签类别——狗、人类、车辆、非人类动物及互动行为的代表性示例。
    注意:在视频合成过程中,所有场景均被下采样至 1920 像素 × 1080 像素、30 fps,以匹配 MRI 投影仪的分辨率。

3. 实验设计

  1. 使用3T磁共振成像(MRI)扫描仪对受试者进行扫描,同时让其观看投影在MRI孔径后方屏幕上的视频合集。
  2. 播放视频时关闭声音。
  3. 对于犬类,通过预先训练使其将头部放置于定制的下颌托架中,该托架根据犬只从鼻中部至下颌后方的下颌形态定制,以实现头部的稳定定位。
    1. 将下颌托架固定于一块横跨线圈的木制平台,平台下方留有足够空间容纳犬的前爪,使每只犬均保持"狮身人面像"姿势(图1B)。实验过程中未使用任何束缚装置。有关训练方案的更多细节,请参见以往的清醒犬fMRI研究7
  4. 每节实验中让受试者完成五次扫描运行,每次运行包含完整观看一段视频合集,视频播放顺序随机。对于犬类,每次运行之间安排短暂休息,并在休息期间给予食物奖励。
  5. 让每位受试者在两周内完成三节实验。由此可使每位受试者完整观看五段不同的视频合集各三次,每位个体累计fMRI扫描时间为90分钟。

4. 成像

  1. 按照先前清醒犬类 fMRI 研究所采用的相同方案对参与实验的犬只进行扫描7,25
    1. 使用单次激发回波平面成像序列获取功能图像,采集22个连续的2.5 mm层厚切片(层间距20%),参数设置如下:TE = 28 ms,TR = 1,430 ms,翻转角 = 70°,矩阵大小为64 × 64,面内体素尺寸为2.5 mm,FOV = 160 mm。
    2. 对于犬只,切片方向应背侧对齐大脑,相位编码方向为从右到左,因为犬只在MRI扫描时以"sphinx"姿势就位,颈部与大脑保持在一条直线上。相位编码方向设为从右到左可避免颈部信号混叠至头部前部产生卷褶伪影。此外,犬只扫描中的主要磁敏感伪影来源于额窦,会导致额叶区域出现图像畸变。
  2. 对于人类受试者,获取轴向切片,相位编码方向设为前后方向。
    1. 为便于与犬只扫描数据进行比较(相同的TR/TE),对人类受试者使用多频带切片采集技术(CMRR,明尼苏达大学),多频带加速因子为2(GRAPPA = 2,TE = 28 ms,TR = 1,430 ms,翻转角 = 55°,矩阵大小为88 × 88,面内体素尺寸为2.5 mm,共44个2.5 mm切片,层间距20%)。
  3. 对于犬只,还需为每位参与者使用快速自旋回波序列采集全脑T2加权结构像,体素尺寸为1.5 mm各向同性。对于人类参与者,则使用T1加权MPRAGE序列,体素尺寸为1 mm各向同性。
    ​注:在三次扫描会话过程中,每位参与者大约获得了4,000个体功能像。

5. 刺激标签

  1. 为了训练模型对视频中呈现的内容进行分类,首先需要对场景进行标注。为此,将构成每个合集视频的 7 秒场景分割为 1.4 秒的短片段。应标注短片段而非单个帧,因为视频中某些元素无法通过静态帧捕捉,而这些元素可能对狗尤为显著,因此在解码时具有重要意义,例如运动信息。
    注:选择 1.4 秒的片段长度是因为该时长足以捕捉这些动态特征,并且与 1.43 秒的 TR(重复时间)非常接近,从而允许逐个体积进行分类。
  2. 将这些 1.4 秒的片段(n = 1,280)随机分配给实验室成员,使用预编程的复选框式提交表单手动标注每个片段。
    注:共选择了 94 个标签,以尽可能涵盖视频中的多种关键特征,包括主体(如狗、人、猫)、主体数量(1、2、3+)、物体(如汽车、自行车、玩具)、动作(如进食、嗅闻、说话)、互动(如人-人、人-狗)以及场景(室内、室外)等。这为每个片段生成了一个 94 维的标签向量(补充表 1)。
  3. 作为一致性检查,随机选取一个子集由第二位实验室成员重新标注。在此过程中,发现不同个体之间的标注高度一致(>95%)。对于不一致的标签,允许两位实验室成员重新观看相关片段并达成共识。
  4. 对于每次运行,使用带时间戳的日志文件确定视频刺激相对于首次扫描体积的起始时间。
  5. 为考虑刺激呈现与 BOLD 反应之间的时间延迟,使用双伽马血流动力学响应函数(HRF)对标签进行卷积,并利用 Python 函数 numpy.convolve() 和 interp() 将其插值到功能图像的 TR(1,430 ms)上。
    注:最终结果是一个矩阵,其行为卷积后的标签,列为每位受试者的总扫描体积数(Daisy、Bhubo、Human 1 和 Human 2 分别为 94 标签 × 3,932、3,920、3,939 和 3,925 个体积)。
  6. 在必要时对这些标签进行归类,以创建宏标签(macrolabels)用于进一步分析。例如,将所有行走实例(狗行走、人行走、驴行走)合并,生成一个 "行走"标签。
  7. 为进一步消除标签集中的冗余,计算每个标签的方差膨胀因子(VIF),但排除明显高度相关的宏标签。
    ​注:VIF 是衡量预测变量多重共线性的指标,通过将每个预测变量对所有其他变量进行回归计算得出。较高的 VIF 值表示预测变量之间相关性更强。本研究采用 VIF 阈值为 2,将 94 个标签减少至 52 个独特且基本不相关的标签(补充表 1)。

6. fMRI 数据预处理

  1. 预处理包括使用 AFNI 软件包(NIH)及其相关函数进行头动校正、数据剔除和标准化26,27。采用两步法、六参数刚体头动校正,将各扫描体积对齐至一个代表受试者在多次扫描中平均头位的目标体积。
  2. 执行数据剔除,去除扫描间位移超过 1 mm 的体积,以及体素信号强度异常值大于 0.1% 的体积。对于两只狗,剔除后保留了超过 80% 的体积数据;对于人类,保留了超过 90% 的体积数据。
  3. 为提高单个体素的信噪比,使用 3dmerge 进行轻度空间平滑处理,采用全宽半高为 4 mm 的高斯核。
  4. 为控制可能因刺激不同而异的低级视觉特征(如运动或速度)的影响,计算视频片段连续帧之间的光流22,28。在将帧率下采样至每秒 10 帧后,使用 OpenCV 中的 Farnebäck 算法计算光流29
  5. 为估计每帧中的运动能量,计算每个像素光流的平方和,并对结果取平方根,从而有效计算相邻帧之间的欧几里得平均光流28,30。此过程为每个视频合集生成运动能量的时间序列。
  6. 对这些时间序列进行重采样,以匹配 fMRI 数据的时间分辨率,并如前所述与双伽马血流动力学响应函数(HRF)进行卷积,然后拼接,以与每位受试者的刺激呈现时间对齐。
  7. 将此时间序列以及上述头动校正生成的头动参数,作为唯一回归变量,输入至针对每个体素使用 AFNI 的 3dDeconvolve 估计的一般线性模型(GLM)。将该模型的残差作为输入,用于下文所述的机器学习算法。

7. 分析

  1. 解码大脑中对视觉刺激分类有显著贡献的区域,为每位参与者训练一个模型,该模型随后可用于基于参与者的脑数据对视频内容进行分类。使用Ivis机器学习算法,这是一种基于孪生神经网络(Siamese Neural Networks, SNNs)的非线性方法,在高维生物数据上已显示出良好的效果31
    注意:SNN包含两个相同的子网络,用于在有监督或无监督模式下学习输入之间的相似性。尽管由于神经网络通常比支持向量机(SVM)等线性方法具有更强的性能,近年来在脑解码中越来越受欢迎,但此处我们选择SNN是因为其对类别不平衡具有鲁棒性,并且所需样本数量较少。与在同一数据上训练的支持向量机(SVM)和随机森林(RF)分类器相比,我们发现Ivis在多种标签组合下的脑数据分类中表现更优,评估指标包括平均F1分数、精确率、召回率和测试准确率(见下文)。
  2. 对每位参与者,将全脑残差数据转换为适合输入Ivis神经网络的格式。将其三次扫描会话中每次的五个运行数据进行拼接并掩膜处理,仅保留脑部体素。
  3. 展平空间维度,得到一个以体素为行、时间为列的二维矩阵。
  4. 将每次运行中所呈现视频的卷积标签进行拼接,使其与fMRI运行相对应。
  5. 根据预处理中标记的卷,对fMRI数据及相应标签进行剔除处理。
  6. 选择需要解码的目标标签——下文称为"类别"——并仅保留包含这些类别的卷。为简化起见,将类别视为互斥,不将属于多个类别的卷用于解码,仅保留纯粹的示例。
  7. 将数据划分为训练集和测试集。采用五折划分方式,随机选择20%的场景作为测试集。
    注意:这意味着,如果某个特定场景被选入测试集,则该场景期间获取的所有片段和功能卷都将从训练集中排除。如果划分不以场景为单位,则同一场景的功能卷可能同时出现在训练集和测试集中,分类器只需将其匹配到该特定场景即可成功分类。然而,要正确分类来自新场景的保留卷,分类器必须将其匹配到更通用的、与场景无关的类别。相比仅保留单个片段的方式,这种方法对分类器泛化能力的检验更为严格。
  8. 使用scikit-learn包中的imbalanced-learn工具,通过欠采样方式平衡训练集,使每个类别的卷数与最小类别相等。
  9. 对每位参与者,在100次迭代中训练并测试Ivis算法,每次使用不同的训练-测试划分(Ivis参数:k = 5,model = "maaten",n_epochs_without_progress = 30,supervision_weight = 1)。这些参数值主要根据数据集的规模和复杂性确定,参考了算法作者在其文档中的建议32。"无进展的训练轮数"和"监督权重"(无监督为0,有监督为1)经过额外的参数调优以优化模型性能。
  10. 为减少用于训练分类器的特征数量,将全脑数据缩减至仅保留信息量最高的体素,使用scikit-learn中的随机森林分类器(RFC)根据各体素的特征重要性对其进行排序。
    注意:尽管RFC本身的表现未超过随机水平,但它有效筛选出了非信息性体素,这些体素若保留将仅为Ivis算法引入噪声。这类似于在输入分类器前使用F检验进行特征选择33。训练和测试仅使用训练集中重要性排名前5%的体素。选择5%作为保守阈值,旨在训练神经网络前尽可能减少非信息性体素的数量。当使用更高比例的体素时,人类和犬类均获得了定性相似的结果。尽管人类大脑大于犬类大脑,但当人类模型训练所用的绝对体素数量与犬类模型相当时(远少于总脑体素的5%,约250个体素),模型仍表现成功(所有平均LRAP分数>第99百分位)。为保持一致性,本文结果均采用两个物种中信息量最高的前5%体素。
  11. 将所有100次运行中平均前5%最信息性体素进行归一化,转换至每位参与者的结构空间,再转换至群体图谱空间(图谱:人类34,犬类35),并在每个物种内对参与者进行叠加求和。使用ITK-SNAP36将特征重要性叠加至图谱上,并依据重要性得分进行着色。

结果

在机器学习分析中,评估模型性能最常用的指标包括精确率、准确率、召回率和F1分数。准确率是指模型预测结果中正确的预测所占的总体百分比,基于真实数据计算。精确率是指模型预测为阳性的样本中实际为阳性的比例(即真正例率),而召回率是指原始数据中真实阳性样本被模型成功预测出来的比例。F1分数是精确率和召回率的加权平均值,可作为对类别不平衡更具鲁棒性的准确率替代度量。然而,Ivis与其它常用的机器学习算法不同,其输出并非二值结果。对于给定的脑体素输入,每个输出元素代表对应各个类别的概率。针对这些输出计算准确率、精确率、召回率和F1分数时,需采用“胜者全得”的方式将其二值化,即认为概率最高的类别是该样本体积的预测类别。这种方法会丢失有关概率排序的重要信息,而这些信息对于评估模型质量具有重要意义。因此,尽管我们仍计算了这些传统指标,但主要采用标签排序平均精度(Label Ranking Average Precision, LRAP)分数作为衡量模型在测试集上准确性的主要指标。该指标本质上衡量了分类器在多大程度上为真实标签分配了更高的概率37

神经网络分类器在人类和狗身上均取得不同程度的成功。对于人类,该算法能够对物体和动作进行分类,两类三分类模型的平均准确率均达到70%。采用LRAP分数作为主要指标来计算模型在测试集上的准确性;该指标用于衡量分类器为真实标签分配更高概率的程度37。对于人类,所有被测试模型的中位LRAP分数均高于经随机置换标签集所得99百分位数(表1图2)。对于狗,仅动作模型在两名受试者中的中位LRAP百分位排名显著高于偶然水平(表1;物体的p = 0.13,动作的p < 0.001;狗的三分类动作模型LRAP分数平均为第78百分位)。这些结果在每个个体受试者中均成立,且在按物种分组时也一致成立。

鉴于分类器的成功,我们使用更多类别进行训练和测试,以确定该模型的适用边界。这包括利用 Python 软件包 scipy 中的层次聚类算法,计算全部 52 个潜在感兴趣类别的相异性矩阵,该算法根据个体对每个类别的脑响应之间的成对相关性所定义的相似性对类别进行聚类。在测试的额外模型中,在两只狗中均表现出最高中位数 LRAP 百分位排名的模型包含五个类别:原始的“说话”、“进食”和“嗅闻”,以及两个新增类别“抚摸”和“玩耍”(图 2)。该模型在所有受试者中的中位数 LRAP 百分位排名显著高于随机预测水平(表 1;两只狗和人类的 p 值均 < 0.001;狗的五类动作模型 LRAP 评分平均为第 81 百分位)。

当将体素的特征重要性分数回投到相应的大脑图谱时,发现狗和人类的枕叶、顶叶和颞叶皮层中均存在多个具有信息量的体素簇(图3)。在人类中,基于物体和基于动作的模型所揭示的模式比狗更为集中,且位于通常与物体识别相关的脑区,尽管基于物体的体素和基于动作的体素在空间位置上存在轻微差异。

我们验证了这些物种差异并非由任务相关运动引起,即狗对某些类型视频的运动反应是否比其他类型更强(例如,相对于狗的视频,对汽车等物体的视频反应更强)。我们计算了六个运动参数的欧几里得范数,并使用 R 软件包 lme4 拟合线性混合效应模型,其中将类别作为固定效应,每次运行编号作为每只狗的随机效应。对于最终的每个模型,我们发现类别类型对 Daisy(基于物体:F(2, 2252) = 0.83,p = 0.44;基于动作:F(4, 1235) = 1.87,p = 0.11)和 Bhubo(基于物体:F(2, 2231) = 1.71,p = 0.18;基于动作:F(4, 1221) = 0.94,p = 0.45)的运动均无显著影响。

图A:自然环境中犬类追踪研究;图B:带有环境刺激的fMRI实验装置。
图1:自然场景视频及其在MRI孔道内的呈现。A)向受试者播放的视频片段示例帧。(B)Bhubo,一只4岁的拳师犬混种,在清醒状态下接受fMRI扫描的同时观看视频。请点击此处查看该图的高清版本。

分析对象与动作类别频率分布的直方图,包含中位数线。
图2:犬类与人类的模型性能。 LRAP 分数的分布情况,以100次训练和测试Ivis机器学习算法所得零分布的百分位排名表示,涵盖三类对象模型、三类动作模型和五类动作模型,其中模型试图对获取的自然视频刺激下的BOLD反应进行分类 通过 犬类与人类的清醒状态功能性磁共振成像。评分按物种汇总。LRAP得分的百分位排名极高时,表明该模型偶然获得该LRAP得分的可能性极低。若模型表现不优于随机水平,则其中位LRAP得分百分位排名约为50。虚线表示每个物种在全部100次运行中的中位LRAP得分百分位排名。 请点击此处以查看此图的放大版本。

大脑活动分析示意图;特征重要性,物体与动作模型,SSM可视化。
图3:在三类物体和五类动作模型区分中具有重要作用的脑区。A)人类和(B)犬类受试者。体素根据随机森林分类器计算的特征重要性进行排序,并对模型所有迭代结果取平均。此处展示的是排名前5%的体素(即用于训练模型的体素),按物种聚合后转换至群体空间以供可视化(图谱:人类34 和犬类35)。标签显示了基于Johnson等35所鉴定出的、在犬类大脑中具有高特征重要性分数的脑区。缩写:SSM = 大脑外侧沟上方的脑回。 请点击此处查看该图的放大版本。

模型类型训练准确率测试准确率F1 分数精确率召回率LRAP 分数中位百分位
Human 1物体(3 类)0.980.690.480.520.49>99
动作(3 类)0.980.720.510.540.54>99
动作(5 类)0.970.510.280.370.27>99
Human 2物体(3 类)0.980.680.450.50.47>99
动作(3 类)0.980.690.460.50.48>99
动作(5 类)0.970.530.30.40.27>99
Bhubo物体(3 类)0.990.610.380.410.3957
动作(3 类)0.980.630.380.40.487
动作(5 类)0.990.450.160.290.1388
Daisy物体(3 类)10.610.380.430.3943
动作(3 类)0.970.620.350.380.3560
动作(5 类)0.990.440.160.270.1376

表1:Ivis机器学习算法在100次训练与测试迭代中对自然视频刺激诱发的BOLD反应的聚合指标 通过 犬类与人类的清醒状态功能性磁共振成像 目标模型包含三个类别(“狗”、“人”、“车”),动作模型包含三个或五个类别(三类别:“说话”、“进食”、“嗅闻”;五类别:“说话”、“进食”、“嗅闻”、“抚摸”、“玩耍”)。显著高于随机水平的数值以粗体显示。

补充表1:类别标签。 请点击此处下载该文件。

补充视频 1:样本视频片段。 请点击此处下载此文件。

讨论

本研究结果表明,自然视频可在狗的大脑中诱导出足够稳定的神经表征,这种表征在多次成像过程中保持稳定,能够通过功能性磁共振成像(fMRI)进行解码,这与在人类和猴子中获得的结果相似20,23。尽管以往关于犬类视觉系统的fMRI研究多采用简化的刺激材料(例如在中性背景下呈现单一面孔或物体),但本研究结果表明,包含多个人物和物体相互作用的自然视频,可在狗的大脑皮层中诱导出可解码的激活模式,其可靠性接近人类皮层中观察到的水平。该方法为研究犬类视觉系统的组织方式开辟了新的研究途径。

尽管犬类功能性磁共振成像(fMRI)领域发展迅速,但迄今为止,这些实验所依赖的刺激材料仍相对贫乏,例如在中性背景下呈现的人或物体的图片10,12,13。此外,尽管这些研究已开始识别出与灵长类梭状回面孔区(FFA)——参与面孔加工——以及外侧枕叶皮层(LOC)——参与物体加工——相对应的脑区,但对于这些表征的本质仍存在争议,例如犬类是否具有真正意义上的“面孔区”,能够对与灵长类相似的显著特征产生反应,或者它们是否分别对犬和人类、面孔和头部具有独立的表征9,13。当然,犬并非灵长类动物,我们尚不清楚它们如何理解脱离了声音和气味等通常多感官背景的此类人工刺激。一些证据表明,犬并不将物体的图像视为真实事物的表征12。尽管在扫描仪中无法创造出真正意义上的多感官体验,但使用自然情境视频可能有助于缓解部分人工性,为犬提供更接近真实世界的动态刺激。出于相同原因,自然情境刺激在人类fMRI研究中的应用也日益广泛,例如研究表明,电影中的事件序列在大脑皮层中以多种时间尺度进行表征,且电影能有效诱发稳定的情绪激活38。因此,尽管自然情境视频仍属于相对贫乏的刺激材料,但其在人类神经科学中的成功应用引发了一个问题:在犬类中是否也能获得类似的结果。

我们的结果表明,神经网络分类器能够成功地从狗的大脑活动中解码某些类型的自然刺激内容。考虑到刺激材料的复杂性,这一成功令人印象深刻。重要的是,由于分类器是在未见过的视频片段上进行测试的,因此解码模型识别的是跨视频片段可辨识的广泛类别,而非特定于个别场景的特征。需要注意的是,衡量机器学习分类器性能的指标有多种(表1)。由于自然主义视频本身不可能使所有类别的出现频率相等,我们采取了谨慎的方法,即通过对标签进行随机置换构建零分布,并以此为参照评估结果的显著性。随后我们发现,狗脑模型的解码表现具有统计学显著性,达到第75至第90百分位的得分,但这种情况仅在视频根据其中存在的行为(如玩耍或说话)进行编码时出现。

与训练集不同,测试集在各类别之间并未平衡。测试集仅占数据的20%,若对最小类别进行下采样,将导致每个类别的样本量极小,从而使得计算出的任何统计量都不可靠。为避免因这种不平衡导致准确率被高估,通过在每次模型迭代中对类别顺序进行1000次随机置换,计算LRAP的零分布。该零分布作为参照,用以评估模型随机情况下的预期表现。随后,将真实的LRAP值转换为该零分布中的百分位排名。例如,一个极高的百分位排名(如95%)表明,在1000次随机置换中,仅有5%的情况下会出现如此高的分数。因此,这样的模型可被认为显著优于随机水平。为了在统计上判断这些百分位排名是否显著高于随机预期(即第50百分位),计算了每个模型在全部100次迭代中LRAP百分位排名的中位数,并进行了单样本Wilcoxon符号秩检验。

尽管主要目标是为狗开发自然主义视觉刺激的解码器,但与人类的比较不可避免。在此,我们指出两个主要差异:对于每种类型的分类器,人类模型的表现均优于狗模型;此外,人类模型在基于物体和基于动作的模型上均表现良好,而狗模型仅在基于动作的模型上表现良好。人类模型的优越性能可能源于多种因素。人类大脑的体积大约是狗大脑的10倍,因此可用于构建分类器的体素更多。为了使模型具有可比性,应使用相同数量的体素,这可以是绝对数量或相对比例意义上的相同。尽管最终模型基于每个大脑中信息量最高的前5%体素(一种相对度量),但使用固定数量体素也得到了类似结果。因此,性能差异更可能与人类和狗感知视频刺激的方式有关。如上所述,虽然狗和人类在感知上都是多感官的,但对狗而言,这些刺激可能比对人类更贫乏。例如,尺寸线索可能丢失,导致一切看起来都像是真实世界的玩具版本。有证据表明,狗在对物体进行分类时优先依据大小和质地,其次才是形状,这几乎与人类相反39。此外,气味(本研究未予考虑)很可能是狗进行物体区分的重要信息来源,尤其是在识别同种个体或人类时尤为关键40,41,42。然而,即使在缺乏尺寸或气味线索的情况下,在功能性磁共振成像(fMRI)扫描仪这一非典型环境中,分类器仍能发挥作用的事实表明,仍存在与狗相关的信息可以从其大脑中被恢复出来。由于本研究仅包含两只狗和两个人类受试者,物种间的差异也可能源于个体差异。然而,这两只狗代表了经过MRI训练表现最佳的个体,在观看视频时能够出色地保持静止。尽管更大的样本量无疑有助于在物种间做出更可靠的区分,但能够完成清醒状态fMRI且愿意长时间观看视频的狗的数量始终有限,这将一直限制研究结果向所有狗的推广性。虽然不能排除某些特化犬种(如视觉猎犬)可能具有更精细调节的视觉脑响应,但我们认为,个体性情和训练更可能是决定从狗脑中可恢复信息的主要因素。

这些物种间的差异引发了一个问题:狗究竟关注视频中的哪些方面?回答这一问题的一种方法是依赖更简单的视频刺激材料。例如,通过使用孤立的图像——如单独或组合呈现的人类、狗和汽车,并将它们置于中性背景上,我们或许能够反向解析出对狗而言显著的感知维度。然而,这种方法在方法学上效率较低,并且进一步使刺激材料脱离真实世界的复杂性。注意力的问题可以通过解码方法单独解决,实际上就是利用模型的表现来确定被关注的内容43。据此思路,本研究的结果表明,尽管人类同时关注行为的执行者和行为本身,狗则更专注于行为动作本身。这种差异可能源于低层次运动特征的不同,例如个体在玩耍与进食时的运动频率差异;也可能源于对这些活动在更高层次上的范畴化表征。 informative 体素在狗大脑皮层中的广泛分布表明,这些表征并不仅限于通常局限于视觉区域的低层次特征。未来若采用更多样化的视频刺激材料进行研究,或将有助于阐明运动在狗进行范畴区分中的作用。

总之,本研究证明了使用功能性磁共振成像(fMRI)从狗的大脑皮层中恢复自然视觉信息的可行性,其方法与人类皮层的研究方式相同。该实验证明,即使在没有声音或气味的情况下,狗在观看视频时仍能编码复杂场景中的显著维度,并且这些维度可以从其大脑活动中被重建出来。其次,基于能够完成此类任务的狗数量较少这一事实,推测相关信息在皮层中的分布可能比在人类中更为广泛,且行为类型的重建似乎比对演员或物体身份的重建更为容易。这些结果为研究狗如何感知其与人类共享的环境(包括视频屏幕)开辟了新的途径,并为未来探索狗及其他非灵长类动物如何"观察"世界提供了丰富的研究方向。

致谢

我们感谢 Kate Revill、Raveena Chhibber 和 Jon King 在本分析方法开发过程中提供的有益见解,感谢 Mark Spivak 在招募和训练用于磁共振成像(MRI)的犬只方面给予的帮助,以及感谢 Phyllis Guo 在视频制作与标注方面的协助。我们还要感谢尽心尽力的犬主:Rebecca Beasley(Daisy)和 Ashwin Sakhardande(Bhubo)。本项人类研究得到了美国国家眼科研究所基金的资助(资助号 R01 EY029724,授予 D.D.D.)。

材料

本文使用的材料清单
姓名公司目录编号评论
3 T MRI 扫描仪SiemensTrio
扫描仪噪声的音频记录自制
相机云台HohemiSteady PRO 3
适合犬类的视频自制
fMRI 数据处理软件AFNI20.3.01
模拟扫描仪组件自制模拟头部线圈和扫描仪管
神经网络软件Ivis1.7.1
光流软件OpenCV4.2.0.34
扫描仪用投影系统自制
Trophy Cam HDBushnell119874
摄像机GoProHERO7
可视化软件ITK-SNAP3.6.0
Windows 视频编辑器MicrosoftWindows 11 版本

参考文献

  1. Mishkin, M., Ungerleider, L. G., Macko, K. A. Object vision and spatial vision: Two cortical pathways. Trends in Neurosciences. 6, 414-417 (1983).
  2. de Haan, E. H. F., Cowey, A. On the usefulness of 'what' and 'where' pathways in vision. Trends in Cognitive Sciences. 15 (10), 460-466 (2011).
  3. Freud, E., Plaut, D. C., Behrmann, M. What' is happening in the dorsal visual pathway. Trends in Cognitive Sciences. 20 (10), 773-784 (2016).
  4. Goodale, M. A., Milner, A. D. Separate visual pathways for perception and action. Trends in Neurosciences. 15 (1), 20-25 (1992).
  5. Schenk, T., McIntosh, R. D. Do we have independent visual streams for perception and action? Do we have independent visual streams for perception and action. Cognitive Neuroscience. 1 (1), 52-78 (2010).
  6. Andics, A., Gácsi, M., Faragó, T., Kis, A., Miklós, Á Report voice-sensitive regions in the dog and human brain are revealed by comparative fMRI. Current Biology. 24 (5), 574-578 (2014).
  7. Berns, G. S., Brooks, A. M., Spivak, M. Functional MRI in awake unrestrained dogs. PLoS One. 7 (5), 38027(2012).
  8. Karl, S., et al. Training pet dogs for eye-tracking and awake fMRI. Behaviour Research Methods. 52, 838-856 (2019).
  9. Bunford, N., et al. Comparative brain imaging reveals analogous and divergent patterns of species and face sensitivity in humans and dogs. Journal of Neuroscience. 40 (43), 8396-8408 (2020).
  10. Cuaya, L. V., Hernández-Pérez, R., Concha, L. Our faces in the dog's brain: Functional imaging reveals temporal cortex activation during perception of human faces. PLoS One. 11 (3), 0149431(2016).
  11. Dilks, D. D., et al. Awake fMRI reveals a specialized region in dog temporal cortex for face processing. PeerJ. 2015 (8), 1115(2015).
  12. Prichard, A., et al. 2D or not 2D? An fMRI study of how dogs visually process objects. Animal Cognition. 24 (5), 1143-1151 (2021).
  13. Thompkins, A. M., et al. Separate brain areas for processing human and dog faces as revealed by awake fMRI in dogs (Canis familiaris). Learning & Behavior. 46 (4), 561-573 (2018).
  14. Zhang, K., Sejnowski, T. J. A universal scaling law between gray matter and white matter of cerebral cortex. Proceedings of the National Academy of Sciences of the United States of America. 97 (10), 5621-5626 (2000).
  15. Bradshaw, J., Rooney, N. Dog Social Behavior and Communication. The Domestic Dog: Its Evolution, Behavior and Interactions with People. Serpell, J. , Cambridge University Press. Cambridge, UK. 133-160 (2017).
  16. Prichard, A., et al. The mouth matters most: A functional magnetic resonance imaging study of how dogs perceive inanimate objects. The Journal of Comparative Neurology. 529 (11), 2987-2994 (2021).
  17. Haxby, J. V., Connolly, A. C., Guntupalli, J. S. Decoding neural representational spaces using multivariate pattern analysis. Annual Review of Neuroscience. 37, 435-456 (2014).
  18. Kamitani, Y., Tong, F. Decoding the visual and subjective contents of the human brain. Nature Neuroscience. 8 (5), 679-685 (2005).
  19. Kay, K. N., Naselaris, T., Prenger, R. J., Gallant, J. L. Identifying natural images from human brain activity. Nature. 452 (7185), 352-355 (2008).
  20. Nishimoto, S., et al. Reconstructing visual experiences from brain activity evoked by natural movies. Current Biology. 21 (19), 1641-1646 (2011).
  21. vander Meer, J. N., Breakspear, M., Chang, L. J., Sonkusare, S., Cocchi, L. Movie viewing elicits rich and reliable brain state dynamics. Nature Communications. 11 (1), 5004(2020).
  22. Huth, A. G., De Heer, W. A., Griffiths, T. L., Theunissen, F. E., Gallant, J. L. Natural speech reveals the semantic maps that tile human cerebral cortex. Nature. 532 (7600), 453-458 (2016).
  23. Kriegeskorte, N., et al. Matching categorical object representations in inferior temporal cortex of man and monkey. Neuron. 60 (6), 1126-1141 (2008).
  24. Ehsani, K., Bagherinezhad, H., Redmon, J., Mottaghi, R., Farhadi, A. Who let the dogs out? Modeling dog behavior from visual data. Proceedings of the IEEE Conference on Computer Vision and Pattern. 2018, 4051-4060 (2018).
  25. Berns, G. S., Brooks, A., Spivak, M. Replicability and heterogeneity of awake unrestrained canine fMRI responses. PLoS One. 9 (5), 98421(2013).
  26. Cox, R. W. AFNI: Software for analysis and visualization of functional magnetic resonance neuroimages. Computers and Biomedical Research. 29 (3), 162-173 (1996).
  27. Prichard, A., Chhibber, R., Athanassiades, K., Spivak, M., Berns, G. S. Fast neural learning in dogs: A multimodal sensory fMRI study. Scientific Reports. 8, 14614(2018).
  28. Russ, B. E., Kaneko, T., Saleem, K. S., Berman, R. A., Leopold, D. A. Distinct fMRI responses to self-induced versus stimulus motion during free viewing in the macaque. The Journal of Neuroscience. 36 (37), 9580-9589 (2016).
  29. Farnebäck, G. Two-Frame Motion Estimation Based on Polynomial Expansion. In Image Analysis. Scandinavian Conference on Image Analysis. Lecture Notes in Computer Science. Bigun, J., Gustavsson, T. 2749, Springer. Berlin, Heidelberg. 363-370 (2003).
  30. Elias, D. O., Land, B. R., Mason, A. C., Hoy, R. R. Measuring and quantifying dynamic visual signals in jumping spiders). Journal of Comparative Physiology A. 192, 799-800 (2006).
  31. Szubert, B., Cole, J. E., Monaco, C., Drozdov, I. Structure-preserving visualisation of high dimensional single-cell datasets. Scientific Reports. 9, 8914(2019).
  32. Tian, H., Tao, P. IVIS dimensionality reduction framework for biomacromolecular simulations. Journal of Chemical Information and Modeling. 60 (10), 4569-4581 (2020).
  33. Hebart, M. N., Gorgen, K., Haynes, J. The decoding toolbox (TDT): A versatile software package for multivariate analyses of functional imaging data. Frontiers in Neuroinformatics. 8, 88(2015).
  34. Mazziotta, J., et al. A probabilistic atlas and reference system for the human brain: International Consortium for Brain Mapping (ICBM). Philosophical Transactions of the Royal Society B: Biological Sciences. 356 (1412), 1293-1322 (2001).
  35. Johnson, P. J., et al. Stereotactic cortical atlas of the domestic canine brain. Scientific Reports. 10, 4781(2020).
  36. Yushkevich, P. A., et al. User-guided 3D active contour segmentation of anatomical structures: Significantly improved efficiency and reliability. NeuroImage. 31 (3), 1116-1128 (2006).
  37. Fürnkranz, J., Hüllermeier, E., Loza Mencía, E., Brinker, K. Multilabel classification via calibrated label ranking. Machine Learning. 73 (2), 133-153 (2008).
  38. Sonkusare, S., Breakspear, M., Guo, C. Naturalistic stimuli in neuroscience: Critically acclaimed. Trends in Cognitive Sciences. 23 (8), 699-714 (2019).
  39. vander Zee, E., Zulch, H., Mills, D. Word generalization by a dog (Canis familiaris): Is shape important. PLoS One. 7 (11), 49382(2012).
  40. Bekoff, M. Observations of scent-marking and discriminating self from others by a domestic dog (Canis familiaris): Tales of displaced yellow snow. Behavioural Processes. 55 (2), 75-79 (2001).
  41. Berns, G. S., Brooks, A. M., Spivak, M. Scent of the familiar: An fMRI study of canine brain responses to familiar and unfamiliar human and dog odors. Behavioural Processes. 110, 37-46 (2015).
  42. Schoon, G. A. A., de Bruin, J. C. The ability of dogs to recognize and cross-match human odours. Forensic Science International. 69 (2), 111-118 (1994).
  43. Kamitani, Y., Tong, F. Decoding seen and attended motion directions from activity in the human visual cortex. Current Biology. 16 (11), 1096-1102 (2006).

重印与许可

标签

fMRI

本文已发表

视频即将推出