来源:南加州大学 Jonas T. Kaplan 与 Sarah I. Gimbel 实验室
想象一下铃声响起的声音。当我们通过“内心的听觉”构想这样的声音时,大脑中正在发生什么?越来越多的证据表明,大脑在进行想象时所使用的机制与其感知外界时的机制相同。1 例如,当人们想象视觉图像时,视觉皮层会被激…
1. 参与者招募
2. 扫描前准备步骤
3. 向参与者提供说明。
4. 将受试者放入扫描仪中。
5. 数据收集
6. 数据分析

图 1:感兴趣区域勾画。 本受试者的高分辨率解剖图像上已勾画出颞平面的表面区域,图中以蓝色显示。绿色区域为额极的对照掩模。这些体素将用于多体素模式分析(MVPA)。
听觉表象是一种即使在没有外部听觉刺激存在的情况下,也能产生听到声音体验的过程。
例如,想象一下听到手机铃声的情景。尽管这一想象事件依赖于记忆中的信息,但有证据表明,个体的大脑在进行想象时所使用的机制与实际感知过程中涉及的机制相同。
仅仅想象铃声响起时,听觉皮层内的区域就会被激活。然而,尽管这一现象在各种声学刺激中均成立,但声音是如何被编码以实现对不同声音的精细处理——例如区分门铃声和收音机中播放的歌曲——仍是一个重要的科学问题。
根据 Meyer 及其同事之前的研究,本视频演示了如何将功能磁共振成像(fMRI)与不同静音视频的呈现相结合,以研究大脑对听觉表象的反应方式。
我们还将介绍如何使用一种称为多体素模式分析(简称 MVPA)的方法,通过分析 fMRI 扫描期间获得的激活模式来预测受试者所想象的内容。
在本实验中,受试者将躺在一台fMRI扫描仪内,观看一系列无声视频。每一个视频——无论是公鸡打鸣、电锯砍树,还是人弹奏钢琴——都会引发独特而生动的听觉意象,受试者被要求在每次播放视频时均想象相应的声响。
成像采集过程依赖于稀疏的时间采样,即在每个刺激呈现后 4 到 5 秒采集一次 fMRI 体积数据。这种时间安排能够捕捉到血流动力学反应的峰值,并降低信号被扫描仪噪声掩盖的可能性。
每种想象的声音都可能在听觉皮层中引发微妙但独特的神经活动模式。此处,“模式”是关键词:分析这些数据的经典方法采用单变量方法,即将代表一定程度激活的各个体素合并为单一的平均值。
然后对不同声音下的这些数值进行比较,可能不会产生激活水平上的显著差异。
相反,通过多变量分析,每种声音对应多个体素,可以对所有体素的激活水平进行整体比较,从而为每种想象的声音形成独特的整体激活模式。
采用这种多体素模式分析(MVPA)方法,如果这些模式确实对特定内容敏感,那么就有可能利用它们来预测原始刺激。没错——MVPA 常被称为一种“读心”技术!
为了实现这一预测功能,在收集参与者的数据后必须进行更深入的处理,这些数据将被划分为训练集和测试集。
首先将训练集的标注数据进行机器学习计算,具体采用支持向量机算法。该过程通过识别神经活动模式中可能区分三种声音类型的特征,从而实现对数据的准确分类。
在分类器已学习到准确识别各类别的特征后,将向其提供测试集中的未标记数据,然后将其预测结果与正确的刺激标签进行比较。
在此情况下,分类性能作为因变量,以分类器的准确率进行记录,并与大脑其他区域(如额极)激活的体素进行比较。
该分类器有望预测听觉表象的识别,揭示了多变量模式分析(MVPA)在检测听觉皮层内内容特异性活动中的重要性。
出于实验和安全考虑,需确认所有参与者均为右利手,具有正常或矫正至正常的视力,无神经系统疾病或幽闭恐惧症病史,且体内无任何金属植入物。同时,应确保他们填写必要的知情同意书。
开始之前,向受试者说明他们将在扫描仪中观看多个简短的无声视频,这些视频可能会在他们脑海中引发声音联想。要求他们集中注意力于想象中的声音,尽可能清晰地“听”到这些声音,并在整个任务过程中保持静止不动。
现在,准备让受试者进入扫描仪。如需详细了解这些步骤,请参阅本系列中的另一部fMRI视频。
制备完成后,调整受试者位置并将其送入磁共振成像仪的孔洞中。在相邻的控制室内,首先采集高分辨率的解剖学图像,随后将静音视频播放的开始时间与功能成像扫描的启动时间同步。
为实现稀疏时间采样,将 MRI 体积的采集时间设置为 2 s,两次采集之间延迟 9 s。
重要的是,将每个5秒视频片段的开始时间与上一次MRI采集开始时间协调,使其在上一次采集开始后4秒启动,以捕捉与电影播放中期相对应的血流动力学活动。
以随机顺序播放每个视频10次,生成一个持续5.5分钟的扫描会话。重复此功能采集序列三次。
完成四次功能扫描后,将受试者从扫描仪中移出,并进行事后说明以结束研究。
为了定义感兴趣区域,使用每位参与者的高分辨率解剖扫描图像,并在颞叶表面勾画出对应于早期听觉皮层(也称为颞平面)的体素。此外,创建一个包含额叶内体素的掩模,该掩模将用作对照区域。
然后,通过进行运动校正以减少运动伪影,并进行时间滤波以消除信号漂移,对数据进行预处理。
接下来,将数据分为两组:训练集和测试集。在一个数据集中训练分类器——即支持向量机算法——并确保每位受试者的两个脑区数据保持分离。
在另一组中,评估分类器所学习到的内容——即其正确推测未标记数据身份的能力——并记录算法在多次运行中的准确率。总共执行此过程四次,每次将一个功能扫描数据作为测试数据排除在外,该过程称为交叉验证。
为了可视化数据,绘制每位参与者在四次交叉验证折中分类器准确率的平均值曲线图。
绘制主要感兴趣区域——颞平面——以及对照区域——额极——的平均值,以比较分类器的局部特异性,即特定区域(如听觉皮层)被选择性预测参与听觉想象的程度。
在此情况下,采用非参数统计方法——Wilcoxon 符号秩检验,以检验分类性能是否显著高于随机水平(33%)。需要注意的是,听觉皮层中的平均分类准确率为 59%,显著高于随机水平。
相比之下,额极掩模中的平均表现率为33%,与随机水平无显著差异。
此外,请注意分类器性能在不同个体间存在差异。通过置换检验计算出新的统计阈值为42%后,可见在20名受试者中有19名使用颞平面体素的准确率显著高于该阈值,而使用额极体素时,无人的表现优于随机水平。
总体而言,这些结果表明,基于神经活动模式,MVPA 技术能够准确预测参与者正在想象三种声音中的哪一种。此类预测仅在听觉皮层内实现,提示声学内容并非在整个大脑中全局表征。
现在您已经熟悉了如何应用多体素模式分析来研究听觉表象,接下来让我们看看神经心理学家如何在其他领域使用多变量技术来推进一种面向未来的心智解读方法——即对心理状态进行解码。
分类器已被用于分析从腹侧颞叶皮层获取的fMRI数据,以预测受试者所观看物体的类型,例如区分房屋和人脸。
更进一步,甚至可以预测个体是否会购买该房屋或对某人产生好感。尽管这听起来有些令人不安,但这些神经营销的推论并非天方夜谭!
类似的方法也可用于检测观看节目后的情绪状态——例如,识别出恐怖电影确实令人恐惧——甚至可用于识别电影类型;比如,令人恐惧的影片可能会比发人深省的影片更可预测地激活杏仁核,而后者则会稳定地涉及前额叶皮层。
此外,脑机接口可以将心理状态转化为信号,从而增强正在接受言语治疗的个体的交流能力,或帮助因肢体截肢而行动受限的患者恢复运动功能。
您刚刚观看了 JoVE 关于使用多体素模式分析理解听觉意象的视频。现在,您应该已经很好地掌握了如何设计和实施结合功能神经影像的听觉意象实验,以及最终如何分析和解释特定的大脑活动模式。
感谢观看!
View the full transcript and gain access to JoVE Science Education videos
Q1: What is auditory imagery and how does it activate the brain?
Auditory imagery is the experience of hearing sounds without external auditory stimuli present. When you imagine a sound like a ringing phone, your brain activates the same regions involved in actual sound perception. Specifically, the auditory cortex becomes engaged during auditory imagery, demonstrating that imagination and perception share similar neural mechanisms.
Q2: Why is multivoxel pattern analysis better than traditional univariate fMRI analysis?
Univariate analysis collapses individual voxels into a single average, often failing to detect significant differences across sounds. Multivoxel pattern analysis examines activation patterns across multiple voxels collectively, revealing unique overall patterns for each imagined sound. This multivariate approach is sensitive to content-specific activity that univariate methods miss, enabling studying brain activation and motor maps using fMRI principles across sensory domains.
Q3: How does sparse temporal sampling improve fMRI data collection during auditory imagery tasks?
Sparse temporal sampling acquires a single fMRI volume 4-5 seconds after each stimulus, capturing the peak of the hemodynamic response. This timing reduces signal masking by scanner noise, which is critical for auditory imagery studies where external sounds must not interfere with imagined auditory content. The approach allows cleaner detection of neural activity patterns.
Q4: What role does the Support Vector Machine algorithm play in predicting imagined sounds?
The Support Vector Machine is a machine-learning classifier trained on labeled fMRI data to recognize neural features distinguishing different sounds. After learning these features from training data, it predicts unlabeled test data by identifying which sound pattern matches the neural activity. Classification accuracy reveals whether the auditory cortex encodes sound-specific information.
Q5: Why is the planum temporale used as the region of interest in auditory imagery studies?
The planum temporale, located on the temporal lobe surface, is the early auditory cortex where sound processing occurs. Researchers trace voxels in this region to measure neural patterns during auditory imagery. The frontal pole serves as a control region to demonstrate that classifier accuracy is specific to auditory cortex rather than global brain activity.
Q6: What does cross-validation accomplish in MVPA analysis of auditory imagery data?
Cross-validation tests classifier performance by leaving out one functional scan as testing data while training on the remaining scans, repeated four times. This procedure prevents overfitting and provides robust accuracy estimates across different data subsets. The averaged accuracies across folds reveal whether the classifier reliably predicts imagined sounds based on auditory cortex patterns.
Q7: How can MVPA techniques extend beyond auditory imagery to other neuroscience applications?
MVPA classifiers have decoded visual objects from ventral temporal cortex, predicted consumer preferences, and identified emotional states from brain activity patterns. Brain-computer interfaces could convert mental states into signals for speech therapy or prosthetic control. These applications demonstrate that multivariate pattern analysis reveals information content across sensory and cognitive domains.