机器学习算法已通过训练,利用大脑活动模式来“解码”呈现给人类的刺激。在此,我们证明了相同的技术能够从两只家犬的大脑中解码自然主义视频内容。我们发现,基于视频中动作的解码器在犬类中取得了成功。
机器学习算法已通过训练,利用大脑活动模式来“解码”呈现给人类的刺激。在此,我们证明了相同的技术能够从两只家犬的大脑中解码自然主义视频内容。我们发现,基于视频中动作的解码器在犬类中取得了成功。
近年来,利用机器学习和功能性磁共振成像(fMRI)从人类和非人类皮层解码视觉刺激的研究取得了新进展,为理解感知的本质提供了新的见解。然而,这一方法尚未被广泛应用于灵长类以外的动物,这引发了关于动物界中此类神经表征本质的疑问。本研究中,我们对两只家犬和两名人类受试者进行了清醒状态下的fMRI扫描,期间每位受试者均观看特制的、适合犬类的自然视频。随后,我们训练了一种神经网络(Ivis),利用每人和每只犬各90分钟的脑活动记录数据来分类视频内容。我们测试了两种分类器:一种基于物体的分类器,旨在区分“狗”“人”“汽车”等类别;另一种基于行为的分类器,旨在区分“进食”“嗅闻”“说话”等类别。与两名人类受试者相比(两种分类器的表现均显著高于随机水平),只有基于行为的分类器能够成功解码犬类的视频内容。这些结果展示了机器学习首次成功应用于解码食肉动物大脑中自然视频内容的案例,并表明狗所感知的世界图景可能与人类的体验大不相同。
与其他灵长类动物一样,人类大脑表现出视觉通路在背侧和腹侧路径上的分区,各自具有明确且广为人知的功能——即物体的"是什么"与"在哪里"1。这种“是什么/在哪里”的二分法数十年来一直是一种有用的启发式模型,但其解剖学基础如今被认为要复杂得多,许多研究者更倾向于基于识别与动作("是什么" 对 "如何做")的分区方式2,3,4,5。此外,尽管我们对灵长类视觉系统组织结构的理解仍在不断深化和争论中,但对于其他哺乳动物物种的大脑如何表征视觉信息,目前仍有许多未知之处。部分原因在于视觉神经科学长期以来仅集中于少数几个物种。然而,新的脑成像方法正在为无创研究更广泛动物物种的视觉系统提供可能,这或将加深我们对哺乳动物神经系统组织结构的理解。
犬(Canis lupus familiaris)为研究在进化上远离灵长类的物种中视觉刺激的表征提供了丰富的研究机会,因为它们可能是唯一能够被训练以合作方式参与 MRI 扫描而无需镇静或束缚的动物6,7,8。由于在过去 15,000 年中与人类共同进化,犬也生活在我们的环境中,并接触到人类日常所遭遇的许多刺激,包括视频屏幕——这是在 MRI 扫描仪中呈现刺激的首选方式。即便如此,犬处理这些常见环境刺激的方式可能与人类大相径庭,这就引出了一个问题:它们的视觉皮层是如何组织的?一些基本差异——例如缺乏中央凹,或为二色视觉——可能不仅对低层次视觉感知,而且对高层次视觉表征产生显著的下游影响。已有若干项犬类 fMRI 研究表明,存在与面孔和物体处理相关的脑区,这些脑区似乎遵循灵长类中所见的背侧/腹侧通路总体架构,但目前尚不清楚犬是否真正具有专门的面孔处理脑区,或这些脑区是否仅对头部形态(例如犬与人类)具有选择性9,10,11,12,13。无论如何,犬的大脑比大多数灵长类小,因此预计其功能模块化程度较低14,这可能导致通路中不同类型信息的混合程度更高,甚至可能更偏好某些类型的信息,例如动作。例如,有研究提出,运动可能是犬类视觉感知中比纹理或颜色更显著的特征15。此外,由于犬没有手——这是我们与世界互动的主要方式之一——它们对物体的视觉处理可能与灵长类存在显著差异。与此一致的是,我们最近发现证据表明,用口而非用爪与物体互动会在犬脑的物体选择性区域引发更强的激活16。
尽管狗可能已经适应了家庭环境中的视频屏幕,但这并不意味着它们会像人类一样习惯于在实验环境中观看图像。使用更接近自然的刺激材料可能有助于解决其中一些问题。在过去十年中,机器学习算法在从人类脑活动中解码自然视觉刺激方面取得了显著进展。早期的成功主要集中在将经典的区块化设计加以改进,利用脑活动来分类个体所看到的刺激类型以及编码这些表征的脑网络17,18,19。随着更强大算法(尤其是神经网络)的发展,研究者能够解码更复杂的刺激,包括自然视频20,21。这些分类器通常基于对视频的神经响应进行训练,能够泛化到新的刺激,从而识别出个体在fMRI响应时刻所观察的内容。例如,电影中的某些动作(如跳跃和转身)可以从人脑活动中被准确解码,而其他动作(如拖拽)则不能22。类似地,尽管许多类型的物体可以从fMRI响应中被解码,但一般类别似乎更难识别。脑解码不仅限于人类,它为理解其他物种大脑中信息的组织方式提供了有力工具。对非人灵长类动物进行的类似fMRI实验发现,其颞叶中存在关于生命性和面部/身体特征维度的独特表征,这与人类的情况相似23。
为了初步理解犬类对自然视觉刺激的表征,本研究对两只高度适应磁共振成像(MRI)的家犬采用清醒状态下的功能性磁共振成像(fMRI),测量其大脑皮层对适合犬类观看的视频所产生神经反应。本研究选用自然视频,因其可能对犬类具有更高的生态效度,且已有研究证明此类视频在将视频内容映射到犬类行为的神经网络分析中具有成功应用24。在三次独立的实验会话中,分别采集了每只犬对256个不同视频片段反应的90分钟fMRI数据。作为对照,同样程序也在两名人类志愿者身上实施。随后,利用神经网络模型,我们训练并测试了分类器,以区分不同类别的"物体"(例如:人、狗、汽车)或"行为"(例如:说话、进食、嗅闻),并尝试了不同数量的分类类别。本研究的目标有两个:1)确定是否能够从犬类皮层解码出自然视频刺激的信息;2)若可行,则初步探究其皮层组织方式是否与人类相似。
本犬类研究已获得埃默里大学动物护理和使用委员会(IACUC)的批准(批准号:PROTO201700572),所有犬主均已签署书面同意书,同意其犬只参与本研究。人类研究程序已获得埃默里大学机构审查委员会(IRB)的批准,所有受试者在扫描前均签署了书面知情同意书(批准号:IRB00069592)。
1. 参与者
2. 刺激材料
3. 实验设计
4. 成像
5. 刺激标签
6. fMRI 数据预处理
7. 分析
在机器学习分析中,评估模型性能最常用的指标包括精确率、准确率、召回率和F1分数。准确率是指模型预测结果中正确的预测所占的总体百分比,基于真实数据计算。精确率是指模型预测为阳性的样本中实际为阳性的比例(即真正例率),而召回率是指原始数据中真实阳性样本被模型成功预测出来的比例。F1分数是精确率和召回率的加权平均值,可作为对类别不平衡更具鲁棒性的准确率替代度量。然而,Ivis与其它常用的机器学习算法不同,其输出并非二值结果。对于给定的脑体素输入,每个输出元素代表对应各个类别的概率。针对这些输出计算准确率、精确率、召回率和F1分数时,需采用“胜者全得”的方式将其二值化,即认为概率最高的类别是该样本体积的预测类别。这种方法会丢失有关概率排序的重要信息,而这些信息对于评估模型质量具有重要意义。因此,尽管我们仍计算了这些传统指标,但主要采用标签排序平均精度(Label Ranking Average Precision, LRAP)分数作为衡量模型在测试集上准确性的主要指标。该指标本质上衡量了分类器在多大程度上为真实标签分配了更高的概率37。
神经网络分类器在人类和狗身上均取得不同程度的成功。对于人类,该算法能够对物体和动作进行分类,两类三分类模型的平均准确率均达到70%。采用LRAP分数作为主要指标来计算模型在测试集上的准确性;该指标用于衡量分类器为真实标签分配更高概率的程度37。对于人类,所有被测试模型的中位LRAP分数均高于经随机置换标签集所得99百分位数(表1;图2)。对于狗,仅动作模型在两名受试者中的中位LRAP百分位排名显著高于偶然水平(表1;物体的p = 0.13,动作的p < 0.001;狗的三分类动作模型LRAP分数平均为第78百分位)。这些结果在每个个体受试者中均成立,且在按物种分组时也一致成立。
鉴于分类器的成功,我们使用更多类别进行训练和测试,以确定该模型的适用边界。这包括利用 Python 软件包 scipy 中的层次聚类算法,计算全部 52 个潜在感兴趣类别的相异性矩阵,该算法根据个体对每个类别的脑响应之间的成对相关性所定义的相似性对类别进行聚类。在测试的额外模型中,在两只狗中均表现出最高中位数 LRAP 百分位排名的模型包含五个类别:原始的“说话”、“进食”和“嗅闻”,以及两个新增类别“抚摸”和“玩耍”(图 2)。该模型在所有受试者中的中位数 LRAP 百分位排名显著高于随机预测水平(表 1;两只狗和人类的 p 值均 < 0.001;狗的五类动作模型 LRAP 评分平均为第 81 百分位)。
当将体素的特征重要性分数回投到相应的大脑图谱时,发现狗和人类的枕叶、顶叶和颞叶皮层中均存在多个具有信息量的体素簇(图3)。在人类中,基于物体和基于动作的模型所揭示的模式比狗更为集中,且位于通常与物体识别相关的脑区,尽管基于物体的体素和基于动作的体素在空间位置上存在轻微差异。
我们验证了这些物种差异并非由任务相关运动引起,即狗对某些类型视频的运动反应是否比其他类型更强(例如,相对于狗的视频,对汽车等物体的视频反应更强)。我们计算了六个运动参数的欧几里得范数,并使用 R 软件包 lme4 拟合线性混合效应模型,其中将类别作为固定效应,每次运行编号作为每只狗的随机效应。对于最终的每个模型,我们发现类别类型对 Daisy(基于物体:F(2, 2252) = 0.83,p = 0.44;基于动作:F(4, 1235) = 1.87,p = 0.11)和 Bhubo(基于物体:F(2, 2231) = 1.71,p = 0.18;基于动作:F(4, 1221) = 0.94,p = 0.45)的运动均无显著影响。

图1:自然场景视频及其在MRI孔道内的呈现。(A)向受试者播放的视频片段示例帧。(B)Bhubo,一只4岁的拳师犬混种,在清醒状态下接受fMRI扫描的同时观看视频。请点击此处查看该图的高清版本。

图2:犬类与人类的模型性能。 LRAP 分数的分布情况,以100次训练和测试Ivis机器学习算法所得零分布的百分位排名表示,涵盖三类对象模型、三类动作模型和五类动作模型,其中模型试图对获取的自然视频刺激下的BOLD反应进行分类 通过 犬类与人类的清醒状态功能性磁共振成像。评分按物种汇总。LRAP得分的百分位排名极高时,表明该模型偶然获得该LRAP得分的可能性极低。若模型表现不优于随机水平,则其中位LRAP得分百分位排名约为50。虚线表示每个物种在全部100次运行中的中位LRAP得分百分位排名。 请点击此处以查看此图的放大版本。

图3:在三类物体和五类动作模型区分中具有重要作用的脑区。(A)人类和(B)犬类受试者。体素根据随机森林分类器计算的特征重要性进行排序,并对模型所有迭代结果取平均。此处展示的是排名前5%的体素(即用于训练模型的体素),按物种聚合后转换至群体空间以供可视化(图谱:人类34 和犬类35)。标签显示了基于Johnson等35所鉴定出的、在犬类大脑中具有高特征重要性分数的脑区。缩写:SSM = 大脑外侧沟上方的脑回。 请点击此处查看该图的放大版本。
| 模型类型 | 训练准确率 | 测试准确率 | F1 分数 | 精确率 | 召回率 | LRAP 分数中位百分位 | |
| Human 1 | 物体(3 类) | 0.98 | 0.69 | 0.48 | 0.52 | 0.49 | >99 |
| 动作(3 类) | 0.98 | 0.72 | 0.51 | 0.54 | 0.54 | >99 | |
| 动作(5 类) | 0.97 | 0.51 | 0.28 | 0.37 | 0.27 | >99 | |
| Human 2 | 物体(3 类) | 0.98 | 0.68 | 0.45 | 0.5 | 0.47 | >99 |
| 动作(3 类) | 0.98 | 0.69 | 0.46 | 0.5 | 0.48 | >99 | |
| 动作(5 类) | 0.97 | 0.53 | 0.3 | 0.4 | 0.27 | >99 | |
| Bhubo | 物体(3 类) | 0.99 | 0.61 | 0.38 | 0.41 | 0.39 | 57 |
| 动作(3 类) | 0.98 | 0.63 | 0.38 | 0.4 | 0.4 | 87 | |
| 动作(5 类) | 0.99 | 0.45 | 0.16 | 0.29 | 0.13 | 88 | |
| Daisy | 物体(3 类) | 1 | 0.61 | 0.38 | 0.43 | 0.39 | 43 |
| 动作(3 类) | 0.97 | 0.62 | 0.35 | 0.38 | 0.35 | 60 | |
| 动作(5 类) | 0.99 | 0.44 | 0.16 | 0.27 | 0.13 | 76 |
表1:Ivis机器学习算法在100次训练与测试迭代中对自然视频刺激诱发的BOLD反应的聚合指标 通过 犬类与人类的清醒状态功能性磁共振成像 目标模型包含三个类别(“狗”、“人”、“车”),动作模型包含三个或五个类别(三类别:“说话”、“进食”、“嗅闻”;五类别:“说话”、“进食”、“嗅闻”、“抚摸”、“玩耍”)。显著高于随机水平的数值以粗体显示。
补充表1:类别标签。 请点击此处下载该文件。
补充视频 1:样本视频片段。 请点击此处下载此文件。
本研究结果表明,自然视频可在狗的大脑中诱导出足够稳定的神经表征,这种表征在多次成像过程中保持稳定,能够通过功能性磁共振成像(fMRI)进行解码,这与在人类和猴子中获得的结果相似20,23。尽管以往关于犬类视觉系统的fMRI研究多采用简化的刺激材料(例如在中性背景下呈现单一面孔或物体),但本研究结果表明,包含多个人物和物体相互作用的自然视频,可在狗的大脑皮层中诱导出可解码的激活模式,其可靠性接近人类皮层中观察到的水平。该方法为研究犬类视觉系统的组织方式开辟了新的研究途径。
尽管犬类功能性磁共振成像(fMRI)领域发展迅速,但迄今为止,这些实验所依赖的刺激材料仍相对贫乏,例如在中性背景下呈现的人或物体的图片10,12,13。此外,尽管这些研究已开始识别出与灵长类梭状回面孔区(FFA)——参与面孔加工——以及外侧枕叶皮层(LOC)——参与物体加工——相对应的脑区,但对于这些表征的本质仍存在争议,例如犬类是否具有真正意义上的“面孔区”,能够对与灵长类相似的显著特征产生反应,或者它们是否分别对犬和人类、面孔和头部具有独立的表征9,13。当然,犬并非灵长类动物,我们尚不清楚它们如何理解脱离了声音和气味等通常多感官背景的此类人工刺激。一些证据表明,犬并不将物体的图像视为真实事物的表征12。尽管在扫描仪中无法创造出真正意义上的多感官体验,但使用自然情境视频可能有助于缓解部分人工性,为犬提供更接近真实世界的动态刺激。出于相同原因,自然情境刺激在人类fMRI研究中的应用也日益广泛,例如研究表明,电影中的事件序列在大脑皮层中以多种时间尺度进行表征,且电影能有效诱发稳定的情绪激活38。因此,尽管自然情境视频仍属于相对贫乏的刺激材料,但其在人类神经科学中的成功应用引发了一个问题:在犬类中是否也能获得类似的结果。
我们的结果表明,神经网络分类器能够成功地从狗的大脑活动中解码某些类型的自然刺激内容。考虑到刺激材料的复杂性,这一成功令人印象深刻。重要的是,由于分类器是在未见过的视频片段上进行测试的,因此解码模型识别的是跨视频片段可辨识的广泛类别,而非特定于个别场景的特征。需要注意的是,衡量机器学习分类器性能的指标有多种(表1)。由于自然主义视频本身不可能使所有类别的出现频率相等,我们采取了谨慎的方法,即通过对标签进行随机置换构建零分布,并以此为参照评估结果的显著性。随后我们发现,狗脑模型的解码表现具有统计学显著性,达到第75至第90百分位的得分,但这种情况仅在视频根据其中存在的行为(如玩耍或说话)进行编码时出现。
与训练集不同,测试集在各类别之间并未平衡。测试集仅占数据的20%,若对最小类别进行下采样,将导致每个类别的样本量极小,从而使得计算出的任何统计量都不可靠。为避免因这种不平衡导致准确率被高估,通过在每次模型迭代中对类别顺序进行1000次随机置换,计算LRAP的零分布。该零分布作为参照,用以评估模型随机情况下的预期表现。随后,将真实的LRAP值转换为该零分布中的百分位排名。例如,一个极高的百分位排名(如95%)表明,在1000次随机置换中,仅有5%的情况下会出现如此高的分数。因此,这样的模型可被认为显著优于随机水平。为了在统计上判断这些百分位排名是否显著高于随机预期(即第50百分位),计算了每个模型在全部100次迭代中LRAP百分位排名的中位数,并进行了单样本Wilcoxon符号秩检验。
尽管主要目标是为狗开发自然主义视觉刺激的解码器,但与人类的比较不可避免。在此,我们指出两个主要差异:对于每种类型的分类器,人类模型的表现均优于狗模型;此外,人类模型在基于物体和基于动作的模型上均表现良好,而狗模型仅在基于动作的模型上表现良好。人类模型的优越性能可能源于多种因素。人类大脑的体积大约是狗大脑的10倍,因此可用于构建分类器的体素更多。为了使模型具有可比性,应使用相同数量的体素,这可以是绝对数量或相对比例意义上的相同。尽管最终模型基于每个大脑中信息量最高的前5%体素(一种相对度量),但使用固定数量体素也得到了类似结果。因此,性能差异更可能与人类和狗感知视频刺激的方式有关。如上所述,虽然狗和人类在感知上都是多感官的,但对狗而言,这些刺激可能比对人类更贫乏。例如,尺寸线索可能丢失,导致一切看起来都像是真实世界的玩具版本。有证据表明,狗在对物体进行分类时优先依据大小和质地,其次才是形状,这几乎与人类相反39。此外,气味(本研究未予考虑)很可能是狗进行物体区分的重要信息来源,尤其是在识别同种个体或人类时尤为关键40,41,42。然而,即使在缺乏尺寸或气味线索的情况下,在功能性磁共振成像(fMRI)扫描仪这一非典型环境中,分类器仍能发挥作用的事实表明,仍存在与狗相关的信息可以从其大脑中被恢复出来。由于本研究仅包含两只狗和两个人类受试者,物种间的差异也可能源于个体差异。然而,这两只狗代表了经过MRI训练表现最佳的个体,在观看视频时能够出色地保持静止。尽管更大的样本量无疑有助于在物种间做出更可靠的区分,但能够完成清醒状态fMRI且愿意长时间观看视频的狗的数量始终有限,这将一直限制研究结果向所有狗的推广性。虽然不能排除某些特化犬种(如视觉猎犬)可能具有更精细调节的视觉脑响应,但我们认为,个体性情和训练更可能是决定从狗脑中可恢复信息的主要因素。
这些物种间的差异引发了一个问题:狗究竟关注视频中的哪些方面?回答这一问题的一种方法是依赖更简单的视频刺激材料。例如,通过使用孤立的图像——如单独或组合呈现的人类、狗和汽车,并将它们置于中性背景上,我们或许能够反向解析出对狗而言显著的感知维度。然而,这种方法在方法学上效率较低,并且进一步使刺激材料脱离真实世界的复杂性。注意力的问题可以通过解码方法单独解决,实际上就是利用模型的表现来确定被关注的内容43。据此思路,本研究的结果表明,尽管人类同时关注行为的执行者和行为本身,狗则更专注于行为动作本身。这种差异可能源于低层次运动特征的不同,例如个体在玩耍与进食时的运动频率差异;也可能源于对这些活动在更高层次上的范畴化表征。 informative 体素在狗大脑皮层中的广泛分布表明,这些表征并不仅限于通常局限于视觉区域的低层次特征。未来若采用更多样化的视频刺激材料进行研究,或将有助于阐明运动在狗进行范畴区分中的作用。
总之,本研究证明了使用功能性磁共振成像(fMRI)从狗的大脑皮层中恢复自然视觉信息的可行性,其方法与人类皮层的研究方式相同。该实验证明,即使在没有声音或气味的情况下,狗在观看视频时仍能编码复杂场景中的显著维度,并且这些维度可以从其大脑活动中被重建出来。其次,基于能够完成此类任务的狗数量较少这一事实,推测相关信息在皮层中的分布可能比在人类中更为广泛,且行为类型的重建似乎比对演员或物体身份的重建更为容易。这些结果为研究狗如何感知其与人类共享的环境(包括视频屏幕)开辟了新的途径,并为未来探索狗及其他非灵长类动物如何"观察"世界提供了丰富的研究方向。
我们感谢 Kate Revill、Raveena Chhibber 和 Jon King 在本分析方法开发过程中提供的有益见解,感谢 Mark Spivak 在招募和训练用于磁共振成像(MRI)的犬只方面给予的帮助,以及感谢 Phyllis Guo 在视频制作与标注方面的协助。我们还要感谢尽心尽力的犬主:Rebecca Beasley(Daisy)和 Ashwin Sakhardande(Bhubo)。本项人类研究得到了美国国家眼科研究所基金的资助(资助号 R01 EY029724,授予 D.D.D.)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 3 T MRI 扫描仪 | Siemens | Trio | |
| 扫描仪噪声的音频记录 | 自制 | 无 | |
| 相机云台 | Hohem | iSteady PRO 3 | |
| 适合犬类的视频 | 自制 | 无 | |
| fMRI 数据处理软件 | AFNI | 20.3.01 | |
| 模拟扫描仪组件 | 自制 | 无 | 模拟头部线圈和扫描仪管 |
| 神经网络软件 | Ivis | 1.7.1 | |
| 光流软件 | OpenCV | 4.2.0.34 | |
| 扫描仪用投影系统 | 自制 | 无 | |
| Trophy Cam HD | Bushnell | 119874 | |
| 摄像机 | GoPro | HERO7 | |
| 可视化软件 | ITK-SNAP | 3.6.0 | |
| Windows 视频编辑器 | Microsoft | Windows 11 版本 |
本文已发表
视频即将推出