方法文章

跨模态多变量模式分析

21.1K 次观看

DOI:

10.3791/3307

2011年11月9日

本文内容

摘要

经典的多变量模式分析能够根据相应皮层中的神经活动来预测受试者所感知的感觉刺激(例如,根据视觉皮层的活动预测视觉刺激)。在此,我们采用跨模态的模式分析方法,分别从听觉皮层和体感皮层的活动来预测暗示声音和触觉的视觉刺激。

摘要

多变量模式分析(MVPA)是一种日益流行的分析功能磁共振成像(fMRI)数据的方法1-4。通常,该方法用于根据大脑特定区域的神经活动来识别受试者的感知体验。例如,已有研究利用早期视觉皮层的活动来预测受试者所感知的视觉光栅朝向5,或类似地,利用早期听觉皮层的活动来预测语音内容6

本文提出了一种经典多体素模式分析(MVPA)范式的扩展,该范式不再局限于在单一感觉系统内部预测感知刺激,而是跨感觉系统进行预测。具体而言,本文所描述的方法旨在探讨这样一个问题:当刺激通过某一感觉通道呈现时,若其在其他感觉模态中引发记忆联想,是否会在这些其他模态的感觉皮层中诱发内容特异性的神经活动模式?例如,观看一段静音的玻璃花瓶摔落在地的视频片段时,大多数观察者会自动在脑海中浮现出与之相关的破碎声的听觉意象;这种“心耳”中的听觉体验是否与早期听觉皮层中的特定神经活动模式相关?此外,如果受试者观看的是一段狼嚎的视频片段,其所对应的神经活动模式是否与前述花瓶破碎所诱发的模式存在差异?

在之前两项研究中7,8,我们能够分别基于早期听觉皮层和体感皮层的神经活动,预测暗示声音和触觉的视频片段。我们的结果与达马西奥提出的神经架构框架一致9,10,该框架认为,基于记忆的心理意象体验——例如在看到相应视频片段时在“心灵之耳”中听到花瓶破碎的声音——依赖于在早期感觉皮层中重建与特定内容相关的神经活动模式。

方案

1. 引言

多变量模式分析(MVPA)是一种日益流行的分析功能磁共振成像(fMRI)数据的方法1-4。通常,该方法用于从大脑特定区域的神经活动识别受试者的感知体验。例如,已有研究利用该方法根据早期视觉皮层的活动来预测受试者所感知的视觉光栅朝向5,或类似地,根据早期听觉皮层的活动来预测语音内容6。在本视频文章中,我们描述了一种MVPA的新应用,该应用为这种基本的模态内范式增添了新的变化。在此方法中,感知刺激的预测并非在单一感觉系统内部进行,而是在不同感觉系统之间跨模态进行。

2. 多变量模式分析

尽管多体素模式分析(MVPA)方法目前在神经影像学领域已得到广泛应用,我们仍首先指出MVPA与传统的单变量fMRI分析之间的关键区别。为此,请考虑以下示例,说明这两种方法在简单视觉任务期间如何检测视觉皮层中的神经活动(视频片段1):

  1. 向受试者呈现两种不同的视觉刺激,例如一张橙子的图像和一张苹果的图像。
  2. 这两种刺激均会在初级视觉皮层中引发特定的神经活动模式,此处以六个假设体素的激活水平来表示。(当然,现实中单次呈现橙子或苹果图像所诱发的活动模式会非常嘈杂;此处所示的模式可视为大量试验后的平均结果。)
  3. 在传统的功能性磁共振成像(fMRI)分析中,本质上可通过两种方式来分析这些模式。第一种方法是关注整个感兴趣区域内的平均激活水平。
  4. 在本示例中,平均激活水平的差异并不显著,因此从这一角度来看,无法区分对应于两种刺激的活动模式。
  5. 分析这两种模式的另一种方法是建立它们之间的减法对比:对每个体素,用“橙子”条件下的激活水平减去“苹果”条件下的激活水平。然后可在全脑对比图上可视化每个体素的差异结果。
  6. 然而,这些差异可能很小,仅在极少数体素上达到所需的统计学标准。
  7. 此时多体素模式分析(MVPA)的关键优势便显现出来:其更高的检测效能源于这样一个事实,即与单变量分析方法不同,MVPA 同时考虑所有体素的激活水平,因而能够检测其中存在的模式。尽管如前所述,单独考察时仅有少数激活差异具有显著性,但当整体考虑时,这两种模式在统计学上确实可能存在差异。

传统fMRI分析与MVPA之间存在第二个主要差异(视频片段2)。前一种方法通常试图以“正向方式”证明特定感觉刺激与特定脑活动模式之间的统计依赖性;换句话说,它提出的问题类型是:“两种不同的视觉刺激,例如人脸图像和房屋图像,是否会在特定感兴趣区域(如梭状回面孔区)引起不同的活动水平?” 相比之下,MVPA的成功通常以“逆向推断”或“解码”的形式表达;其典型问题是:“基于特定感兴趣区域(如初级视觉皮层)的神经活动模式,能否预测受试者所感知的是刺激A(例如橙子)还是刺激B(例如苹果)?” 然而需要注意的是,从统计学角度来看,感知刺激与脑活动之间相关性的映射方向并不重要:断言两种刺激在某一特定脑区产生不同的活动模式,与断言该脑区的活动模式可用于预测诱发刺激,两者在统计上是等价的11。换句话说,MVPA的敏感性优于单变量分析,是因为它同时考虑了多个体素,而不是因为它采用了逆向的分析方向。

以下步骤说明了典型的多体素模式分析(MVPA)范式如何解决这样一个问题:观察苹果是否比观察橙子在初级视觉皮层中引发不同的神经活动模式(视频片段 3):

  1. 在受试者观看大量苹果和橙子刺激材料的同时,采集其功能性磁共振成像(fMRI)数据。
  2. 采集到的数据被划分为训练数据集和测试数据集。与本示例不同的是,通常训练数据集的规模会大于测试数据集,因为可以预期分类器的性能会随着训练试验次数的增加而提高。
  3. 将训练集的数据输入模式分类器。分类器通过若干可能的数学算法之一,尝试检测神经活动模式中能够区分两种刺激类型的特征。一种常用的分类器(也在我们之前的研究中使用过)是所谓的支持向量机(support vector machines);更多细节请参见引言中提到的综述文献。
  4. 在利用训练试验数据完成分类器训练后,将其应用于测试数据。测试数据集中的各个试验均为无标签状态;换句话说,分类器并不“知道”某个神经活动模式来自“苹果”还是“橙子”试验。
  5. 基于在训练数据集中检测到的规律性,分类器为每个测试试验分配最可能的标签。
  6. 对于每个神经活动模式,可将分类器的“预测结果”与正确的刺激标签进行比较。
  7. 如果分类器未能检测到两种刺激所诱发神经活动模式之间的任何一致差异,则其分类正确率应处于随机水平;在本示例的二分类任务中,即为50%的正确率。若预测准确率显著高于该水平,则表明两种刺激类型之间确实存在一致性的神经活动差异。

需要注意的是,训练数据集和测试数据集必须相互独立。只有在满足这一条件的情况下,才能对从训练集中得出的模式的可推广性做出任何结论。多变量模式分析(MVPA)研究通常采用交叉验证范式来评估分类器的性能(视频片段 4)。假设一项MVPA实验包含8个功能扫描轮次。在第一次交叉验证步骤中,分类器使用第1至第7轮的数据进行训练,并在第8轮的数据上进行测试。在第二步中,分类器则使用第1至第6轮以及第8轮的数据进行训练,随后在第7轮数据上进行测试。按照此方案,共进行八次交叉验证步骤,每一轮数据恰好被用作一次测试数据。分类器的整体性能通过各次交叉验证步骤性能的平均值来计算。尽管该方法确保了每一步中的训练数据和测试数据相互独立,同时也最大化了总的测试试验次数,这在评估分类器性能的统计显著性时具有优势。

互联网上有一些可免费获取的软件包可用于执行多变量模式分析(MVPA);两个示例是 PyMVPA12(基于 Python;http://www.pymvpa.org)和普林斯顿神经科学研究所提供的工具箱(基于 Matlab;http://code.google.com/p/princeton-mvpa-toolbox/)。

3. 跨模态多体素模式分析与汇聚-发散区框架

如引言中所述,类似上述的实验范式已成功用于根据相应感觉皮层中的神经活动来预测感知刺激,换句话说,即基于视觉皮层活动预测视觉刺激,以及基于听觉皮层活动预测听觉刺激。在此,我们提出对这一基本概念的拓展。具体而言,我们假设不仅可以在同一感觉模态内,而且可以在不同模态之间预测感知刺激。感觉感知与记忆的回忆密切相关;例如,一个具有强烈听觉暗示的视觉刺激,比如看到一个玻璃花瓶摔碎在地的情景,会自动在我们的“内心听觉”中触发与先前经历玻璃破碎声音时相似的听觉表象。根据达马西奥(Damasio)二十多年前提出的一个理论框架9,10,花瓶的视觉与相应声音表象之间的记忆关联存储在所谓的汇聚-发散区(convergence-divergence zones, CDZs;视频片段 5)中。CDZs 是联合皮层中的神经元集合,它们通过多个层级接收来自各个初级皮层区域的自下而上的汇聚投射,并反过来向相同的皮层位点发出自上而下的发散投射。由于存在自下而上的汇聚投射,CDZs 可被多种模态的感知表征所激活——例如,既可以由破碎花瓶的视觉也可以由其声音所激活;又由于存在自上而下的发散投射,它们随后可通过向其他模态的初级皮层回传信号,促进相关表象的重建。达马西奥特别强调了后一点:仅激活联合皮层中的 CDZs 并不足以实现对记忆中表象的有意识回忆;只有当 CDZs 在初级感觉皮层中重建出明确的神经表征时,该表象才会被有意识地体验到。因此,该理论框架预测了在面对一个暗示声音的(纯粹)视觉刺激时,神经加工将遵循特定的时序过程(视频片段 6):

  1. 刺激首先在早期视觉皮层中诱导出特定模式的神经活动(红色矩形)。
  2. 通过汇聚性的自下而上投射,早期视觉皮层的神经元向前投射到第一级皮层分化区(CDZ1)。这种汇聚性的连接模式使得 CDZ1 能够检测早期视觉皮层中的某些活动模式。根据具体的活动模式,某个 CDZ 可能被激活,也可能不被激活。因此,CDZ 起到特征提取器的作用。在此示例中,两个 CDZ1 被激活(以红色表示),而第三个则未被对应早期视觉皮层区域的特定活动模式所触发。
  3. CDZ1 向 CDZ2 发出汇聚性的自下而上投射;因此,正如 CDZ1 能够检测早期视觉皮层中的特定活动模式一样,CDZ2 也能够检测 CDZ1 之间的活动模式。若干 CDZ2 可能因被激活的 CDZ1 的特定构型而被激活;为简化起见,此处仅描绘了一个 CDZ2。在本例中,CDZ1 间的活动模式足以激活该 CDZ2
  4. 值得注意的是,CDZ1 不仅向前投射至 CDZ2,还反向投射至早期皮层(蓝色箭头)。这些自上而下的信号可能补全最初由刺激诱导的(可能带有噪声的)活动模式(蓝色矩形)。通常,红色表示自下而上的激活,而蓝色表示自上而下的激活。
  5. 通过多个额外的 CDZ 层级,CDZ2 经由虚线箭头向前投射至高级联合皮层中的 CDZn。一个或多个 CDZn 可能对该特定视觉刺激产生响应(此处仅描绘一个)。
  6. 同样需要注意的是,CDZ2 也会向 CDZ1 发出反向信号,进而可能进一步修饰最初在早期视觉皮层中诱导的活动模式。
  7. CDZn 向所有感觉模态的 CDZ2 发出反向信号。在视觉皮层中,这可能导致低层级 CDZ 中活动模式的补全。在听觉皮层中,将构建出一种神经活动模式——首先出现在 CDZ2 和 CDZ1 层级,最终延伸至早期听觉皮层——从而使人产生与视觉呈现刺激相关联的听觉意象。需注意,也存在向体感模态的自上而下信号,但其强度弱于听觉模态。这反映出几乎所有视觉刺激都具有某种程度的触觉关联。然而,在当前示例中,由于所假设的视觉刺激明确暗示声音,因此向听觉皮层的自上而下信号更为广泛。

根据所提出的神经处理序列,该框架做出了一个具体预测:包含强烈暗示声音的物体和事件的视觉刺激应能在早期听觉皮层中引发神经活动。此外,这种听觉活动模式应具有刺激特异性;换句话说,一个花瓶破碎的视频片段所诱发的神经活动模式应不同于一只狗嚎叫的视频片段。如果这一预测成立,那么我们确实应能够进行跨模态的多体素模式分析(MVPA):例如,仅基于早期听觉皮层中的神经活动特征,就能判断一个人正在观看的是花瓶破碎的视频还是狗在嚎叫的视频(视频片段 7)。同理,涉及其他感觉模态之间信息传递的类似实验范式也应取得成功。例如,如果呈现给受试者的视频片段暗示的是触觉而非声音,那么我们应能够根据这些视频在早期躯体感觉皮层中引发的活动模式来预测其所对应的刺激内容。

4. 刺激材料

多体素模式分析(MVPA)研究的一般范式已在第2节中描述。我们的方法与以往研究不同,它试图在不同感觉系统之间进行MVPA,因此使用了特别设计的刺激材料,这些材料在其呈现的感觉模态之外的其他感觉模态中具有特定含义。例如,在之前的一项研究中,我们记录了受试者观看由人手操作日常物体的5秒视频片段时初级体感皮层的神经活动8视频片段8视频片段9)。在另一项研究中,我们让受试者观看描绘强烈暗示声音的物体和事件的视频片段,同时研究早期听觉皮层中的神经活动7视频片段10视频片段11)。然而,根据CDZ框架,只要某种感觉模态的刺激在其他模态中具有潜在含义,那么所有感觉模态的刺激都有可能被应用于这一通用范式中。

5. 感兴趣区域

通常,神经影像学研究中的感兴趣区域可以通过功能或解剖方式来确定。我们认为,在本文所描述的实验范式中,解剖定位更适合,原因有二。首先,对某一特定感觉模态的初级或早期皮层进行功能定义并非易事(初级视觉皮层可能除外),因为呈现给受试者的感知刺激在该模态下的加工通常不仅局限于这些区域。例如,通过触碰受试者的手部来定义初级躯体感觉皮层将十分困难,因为该操作所诱发的脑活动极有可能同时扩散至躯体感觉联合皮层。其次,功能定位可能无法标记出所有可能对分类器性能有贡献的体素:已有研究表明,那些在经典意义上对感觉刺激未表现出净激活的脑区(即在对比图像[刺激 vs. 休息]中不显著的区域)仍可能包含有关刺激的信息13,14。基于以上两点,我们建议在宏观解剖标志允许的情况下,优先使用解剖学定义的感兴趣区域;例如,中央后回的大体解剖结构可作为初级躯体感觉皮层的合理近似,我们在躯体感觉研究中即采用此方法定义感兴趣区域8(图1)。

6. 受试者

在MVPA研究中,受试者样本量通常比传统的fMRI研究更小,因为此类分析可以在单个受试者水平上进行。当然,这并不妨碍实验者随后在组水平上对个体受试者的结果进行进一步分析。例如,在前述的两项研究中,我们对各个受试者的结果进行了t检验,以评估其在组水平上的显著性。每项研究均包含八名受试者;尽管对于参数检验而言,这一样本量必须被视为非常小,但我们仍发现所评估的许多判别结果具有显著性(见下文)。

7. 代表性结果:

如前所述,在之前的两项研究中,我们尝试基于早期听觉皮层的神经活动来预测暗示声音的视频片段7(本研究所用掩模见图2),以及基于初级躯体感觉皮层的活动来预测暗示触觉的视频片段8。这一尝试取得了成功:在这两项研究中,多体素模式分析(MVPA)分类器在所有可能的刺激对两两区分任务中,其表现均超过50%的随机水平(听觉研究中有9种不同刺激,因此n = 36;躯体感觉研究中有5种不同刺激,因此n = 10)。在听觉研究中,36种区分中有26种达到了统计学显著性;在躯体感觉研究中,10种区分中有8种达到显著性(双尾t检验,两项研究的n均为8;见图3)。

脑成像显示绿色激活区域,视觉皮层分析,MRI扫描结果示意图。
图1. 初级躯体感觉皮层的解剖学定义掩模范围,如Meyer所用 ,2011年。一种分类算法能够根据局限于划定区域的大脑活动模式预测暗示触觉的视频片段。经牛津大学出版社许可转载。

MRI脑部扫描突出显示颞叶;诊断成像;脑部分析。
图2. 早期听觉皮层的解剖学定义掩模范围,如Meyer所用 ,2010年。一种分类算法能够根据限定区域内脑活动模式预测(无声的)暗示声音的视频片段。经自然出版集团许可转载。

分类器性能柱状图;听觉与体感显著性热图;p值结果。
图3. 我们此前跨模态多体素模式分析(MVPA)研究结果的汇总。分别使用分类器根据早期听觉皮层或初级体感皮层的神经活动,预测暗示声音或触觉的视觉刺激。上图:在两项研究中,所有刺激对之间的两两区分预测性能均高于0.5的机遇水平。下图:在听觉研究中,36种区分中有26种的分类器性能达到统计学显著性;在体感研究中,10种区分中有8种达到统计学显著性。经Nature出版集团和牛津大学出版社许可转载。

讨论

我们先前研究的结果表明,跨模态多体素模式分析(MVPA)是研究“心耳”和“心触”中所体验到的心像神经关联的有效工具。具体而言,结果表明,此类心像的内容分别与早期听觉皮层和躯体感觉皮层中的神经活动相关,从而为达马西奥的汇聚-发散区理论框架提供了直接的实证支持。

我们所描述的基本范式可以通过多种方式进行扩展。最明显的是,可以采用不同感觉模态的组合来开展类似研究。在这方面,实验前建立某些跨模态关联可能会提高成功的可能性。例如,为了研究嗅觉皮层中的跨模态表征,可以通过同时让受试者看到并闻到多种食物的视觉和气味刺激对其进行启动。随后,在进入fMRI扫描仪后,可通过视觉线索触发受试者对这些气味的嗅觉记忆,并尝试仅基于嗅觉皮层的神经活动,利用多体素模式分析(MVPA)将各个试验归类到正确的食物项目中。

另一个值得关注的问题是,跨模态诱发的早期感觉皮层活动模式是否与实际体验声音或触觉时诱发的活动模式具有相似性;换句话说,看到玻璃花瓶破碎是否会在早期听觉皮层中引发与实际听到该事件相似的神经活动模式?这一问题同样可以通过多变量模式分析(MVPA)来探讨:一个在受试者听到特定声音时记录的数据上进行训练的分类器,是否能够准确区分受试者观看相应视频片段时记录的数据?在我们的听觉研究中,我们曾尝试进行此类分类,但结果仅处于边缘显著水平(见参考文献7中的图3)。然而,在该研究中,我们并未以任何方式控制参与者的听觉关联;也就是说,我们并不清楚每位受试者在观看视频时所产生的听觉意象与用于训练分类器的音频片段之间的相似程度。同样,若如上文所述先对受试者进行特定的跨模态关联启动(例如视-嗅关联),再探讨这一问题,可能会更有意义。这种方法可以更可靠地控制受试者在观看视频时的心理体验,从而可能提高分类器的预测性能。

综上所述,我们通过证明刺激物不仅可以在同一感觉模式内,还可以在不同感觉模式之间进行预测,从而拓展了经典的多体素模式分析(MVPA)范式。因此,我们表明,MVPA的应用并不局限于研究由外部感觉刺激直接诱发的感知表征的神经相关性。相反,MVPA还能够评估由内部触发的心理意象的神经基础:根据达马西奥的汇聚-发散区框架,我们的研究结果提示,基于记忆重建的心理意象的意识体验与早期感觉皮层中的内容特异性神经表征相关。

披露

未声明任何利益冲突。

致谢

本工作由 Mathers 基金会和美国国立卫生研究院(资助号 5P50NS019632-27)向 Antonio 和 Hanna Damasio 提供资助。

参考文献

  1. Haynes, J. -D., Rees, G. Decoding mental states from brain activity in humans. Nat. Rev. Neurosci. 7, 523-534 (2006).
  2. Norman, K. A., Polyn, S. M., Detre, G. J., Haxby, J. V. Beyond mind-reading: multi-voxel pattern analysis of fMRI data. Trends. Cogn. Sci. 10, 424-430 (2006).
  3. Kriegeskorte, N., Bandettini, P. Analyzing for information, not activation, to exploit high-resolution fMRI. NeuroImage. 38, 649-662 (2007).
  4. Mur, M., Bandettini, P. A., Kriegeskorte, N. Revealing representational content with pattern-information fMRI - an introductory guide. Soc. Cogn. Affect. Neurosci. 4, 101-109 (2009).
  5. Kamitani, Y., Tong, F. Decoding the visual and subjective contents of the human brain. Nat. Neurosci. 8, 679-685 (2005).
  6. Formisano, E., De Martino, F., Bonte, M., Goebel, R. "Who" is saying "what"? Brain-based decoding of human voice and speech? Science. 322, 970-973 (2008).
  7. Meyer, K., Kaplan, J. T., Essex, R., Webber, C., Damasio, H., Damasio, A. Predicting visual stimuli on the basis of activity in auditory cortices. Nat. Neurosci. 13, 667-668 (2010).
  8. Meyer, K., Kaplan, J. T., Essex, R., Damasio, H., Damasio, A. Seeing touch is correlated with content-specific activity in primary somatosensory cortex. Cereb. Cortex. 21, 2113-2121 (2011).
  9. Damasio, A. R. Time-locked multiregional retroactivation: a systems-level proposal for the neural substrates of recall and recognition. Cognition. 33, 25-62 (1989).
  10. Meyer, K., Damasio, A. Convergence and divergence in a neural architecture for recognition and memory. Trends. Neurosci. 32, 376-382 (2009).
  11. Friston, K. J. Modalities, modes, and models in functional neuroimaging. Science. 326, 399-403 (2009).
  12. Hanke, M., Halchenko, Y. O., Sederberg, P. B., Hanson, S. J., Haxby, J. V., Pollmann, S. PyMVPA: a Python toolbox for multivariate pattern analysis of fMRI data. Neuroinformatics. 7, 37-53 (2009).
  13. Harrison, S. A., Tong, F. Decoding reveals the contents of visual working memory in early visual areas. Nature. 458, 632-635 (2009).
  14. Serences, J. T., Ester, E. F., Vogel, E. K., Awh, E. Stimulus-specific delay activity in human primary visual cortex. Psych Sci. 20, 207-214 (2009).

重印与许可

标签

跨模态多变量模式分析功能磁共振成像早期听觉皮层体感皮层模式分类交叉验证逆向推断感觉皮层神经活动模式