方法文章

神经影像数据中多变量分析的基础

DOI:

10.3791/1988

2010年7月24日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了多变量分析的基本原理,并将其与更常用的基于体素的单变量分析进行对比。这两种分析方法均应用于一个临床神经科学数据集。补充的半分模拟结果显示,多变量分析结果在独立数据集中的可重复性更优。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
神经影像数据的多变量分析技术近年来受到越来越多的关注,因为这些技术具有许多诱人的特点,而这些特点难以通过更为常用的单变量、体素级技术轻松实现。1,5,6,7,8,9. 多变量方法评估的是大脑不同区域激活之间的相关性/协方差,而不是以体素为单位逐一体检。因此,其结果更容易被解释为神经网络的特征性模式。相比之下,单变量方法无法直接探讨大脑区域间的相互关联。与单变量技术相比,多变量方法在统计效能上也可能更具优势,因为单变量方法必须对体素级别的多重比较进行极为严格的校正。此外,多变量技术也更适用于将某一数据集的分析结果前瞻性地应用于全新的数据集。因此,多变量方法不仅能够像单变量方法一样提供有关行为差异和相关性的信息,还可能具备更高的统计效能和更优的可重复性验证能力。然而,与这些优势相对的是,多变量方法的使用门槛较高,限制了其在科研群体中的广泛应用。对于正在熟悉多变量分析技术的神经科学家而言,初次接触该领域时可能会面对种类繁多的方法,这些方法尽管在算法上相似,但通常由具有数学背景的研究人员以不同的侧重点加以呈现,令人困惑。我们认为,多变量分析技术具有足够的潜力,值得更广泛的传播与推广。研究人员应当能够以知情且便捷的方式使用这些技术。本文旨在为初学者提供一个多变量技术的循序渐进式介绍。首先进行概念性讲解,随后以阿尔茨海默病神经影像倡议(Alzheimer s Disease Neuroimaging Initiative, ADNI)的一项诊断数据集进行极为简单的应用示例,清晰地展示了多变量方法的优越性能。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. 为了对多变量分析提供一个概念性概述,我们可以设想一个非常简单的情境:一个包含50名人类受试者的假设数据集,其中仅测量了大脑中的三个区域,这些区域在图1中表示为体素(=三维像素)。(在此插入图1,图注作为旁白阅读。)
  2. 多变量分析的总体目标是识别数据中方差的主要来源,然后根据这些方差来源描述数据中感兴趣的主要效应。图2展示了一个简化的示例。(在此插入图2,图注作为旁白阅读。)
  3. 我们现在将单变量和多变量分析均应用于一个临床数据集。我们从阿尔茨海默病神经影像倡议(Alzheimer's Disease Neuroimaging Initiative)网站(http://www.loni.ucla.edu/ADNI/)下载了95名早期阿尔茨海默病患者和102名年龄匹配的健康对照者的FDG-PET静息态扫描数据。我们随机选取了患者和对照者各20次扫描,并将其指定为推导样本。其余75次患者扫描和82次对照者扫描则构成我们的验证样本。单变量和多变量的阿尔茨海默病(AD)标志物将在推导样本中生成,并在验证样本中测试其诊断效能。
  4. 对于单变量标志物,我们在推导样本中将20例AD扫描与20例对照扫描进行对比,通过T检验找出AD患者PET信号下降最显著的脑区位置。为了测试该区域的诊断效能,我们在验证样本中检查该位置的数据,并将其PET信号按疾病状态作图。
  5. 对于多变量标志物,我们首先在推导样本中共40次扫描上进行主成分分析(PCA),然后基于前5个主成分构建一个协方差模式,其受试者缩放因子在AD患者与健康对照之间表现出最大的均值差异。(详细方法可参见以下代表性文献2。)从推导样本中获得的诊断性协方差模式随后被前瞻性地应用于验证样本。所得的受试者缩放因子按疾病状态作图。
  6. 为了更全面地比较第4步和第5步中的单变量与多变量方法,我们进行了一次“分样本”模拟,对重采样数据重复上述两个步骤共1,000次,每次均重新生成一个20/20的推导样本和一个75/82的验证样本(分别对应AD患者和健康对照)。从推导样本中计算单变量和多变量疾病标志物,并设定决策阈值,使得最多仅有1名健康对照被误分类为AD(=特异性95%)。随后,将带有特定决策阈值的疾病标志物前瞻性地应用于验证样本。记录每次重采样迭代中验证样本的分类错误率。

代表性结果

单变量性能 结果详见图3。阿尔茨海默病相关的最大FDG代谢减低区域位于颞上回,即布罗德曼38区。ROC曲线下面积达到AUC=0.90。该对比在复制样本中的泛化效果较好,ROC曲线下面积为AUC=0.84。

多变量性能 结果详见图4。在小脑区域发现具有正向载荷的区域,提示在疾病状态下信号相对保留;而在顶颞区、额叶区域以及后扣带 gyrus 则发现相关信号丢失。在推导样本和复制样本中,ROC曲线下面积分别为0.96和0.88,略优于单变量标志物。

分样本模拟 结果详见图5。该图显示,与单变量标志物相比,多变量标志物能更好地复现诊断性能。多变量标志物的平均总错误率为0.203,而单变量标志物的平均总错误率为0.307。

figure-protocol-1
图1. 该简图描述了单变量与多变量分析策略之间的差异:本图展示了一个假设的三维数据集。左侧显示所绘制的三个变量之间无相关性;而右侧则显示一个主要的方差来源,表明三个体素之间存在正相关。若采用仅基于体素逐个考虑均值的单变量分析方法,则无法区分这两种情况。相反,多变量分析在构建神经激活模式之前,会先识别数据中的主要方差来源(红色箭头所示)。

figure-protocol-2
图2. 此幻灯片以简化形式展示了神经影像数据中任何多变量分析的基本成果。依赖于受试者索引 s 和体素索引 x(表示脑内体素位置)的数据阵列 Y(s,x),被分解为若干项之和:第一项是仅依赖于受试者的因子得分 ssf(s) 与仅依赖于体素的协方差模式 v(x) 的乘积;第二项是无法由协方差模式解释的激活信号,由受试者和体素共同决定的噪声项 e(s,x) 表示。方程下方的两个图示分别给出了受试者缩放因子和协方差模式的示例。每位参与者均表现出该协方差模式,但程度不同,如受试者因子得分所示。协方差模式及其在受试者中的表达提供了一种简洁的总结方式,避免了需单独追踪每个体素行为的复杂性。当受试者缩放因子的数值增大时,协方差模式中蓝色区域对应的激活程度降低,而红色区域对应的激活程度则同步增强。受试者因子得分可与外部感兴趣的变量(如受试者年龄或认知任务中的行为表现)进行相关性分析,且该相关性分析无需进行多重比较校正。

此类分解方法有多种,但最常用的是主成分分析(Principal Components Analysis, PCA)。这也是我们的首选技术。需要注意的是,可以通过将协方差模式投影到任意具有相同维度的数据集中来获得被试的缩放因子,而不仅限于生成该协方差模式的原始数据集。这使得协方差模式适用于检验在一个数据集中观察到的脑-行为关系是否能在另一个不同的数据集中得到重复验证。

figure-protocol-3
图3. 本图展示了单变量分析的结果。左下图显示了在推导样本中表现出最显著阿尔茨海默病(AD)相关代谢减低区域的FDG信号值,其MNI坐标为X=2 mm,Y= -48 mm,Z= 30 mm(楔前叶/扣带后回,Brodmann 31区)。右下图显示了在验证样本中同一位置的FDG信号值。可以看出,在验证样本中,AD患者与对照组之间的FDG信号差异虽然总体上仍具有显著性,但组间重叠增多,差异程度有所减小。

figure-protocol-4
图4. 本图展示了多变量分析的结果。在上方面板中,我们显示了多个轴向切片,分别以红色和蓝色标示出协方差模式中显著正向和负向权重的区域(p<0.001)。请注意,每个扫描图像均已按其全局平均值进行标准化处理,因此红蓝颜色反映的是相对于疾病严重程度的PET信号相对增强或减弱,而非绝对变化。因此,红色区域提示在疾病影响下信号的相对保留,而蓝色区域则提示因疾病导致的信号丢失。红色区域主要位于小脑,而蓝色区域则出现在后扣带回、顶颞区和额叶区域。左下方面板:显示了在推导样本中与阿尔茨海默病(AD)相关的协方差模式的受试者因子得分。AD患者表现出更高的因子得分。右下方面板:展示了将AD相关协方差模式前瞻性应用于复制样本后所得的受试者因子得分。可以看出,在复制样本中诊断对比度略有下降,重叠程度有所增加,但与单变量情况相比,其诊断效能的泛化能力明显更优。

figure-protocol-5
图5. 该图展示了1,000次拆分样本模拟的结果。列出了在复制样本中单变量和多变量诊断错误率的均值及标准差。可以看出,尽管多变量标志物的性能表现变异性略高,但其泛化能力明显优于单变量标志物。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们希望让读者对多变量分析的基本原理有一个初步了解;有兴趣的读者可访问我们的网站以获取更多信息。在本研究的多变量分析中,我们对某些参数的选择可能引发较大争议。为避免分散对主要问题的讨论,本文未深入探讨这些争议。首先,我们选择前6个主成分来构建与阿尔茨海默病(AD)相关的协方差模式。这一选择具有一定的理论依据,但本文未予详述4。然而,具体选择6个主成分对我们的核心论点并非关键:在2至20个主成分的范围内任意选择,多变量标志物在分样本模拟中的泛化性能仍保持优越。研究结果对于推导样本和复制样本中受试者数量的选择同样具有稳健性。我们在复制样本中为两组各选择了20名受试者,但这完全是出于数学计算上的便利,以加快运算速度。即使增加推导样本中的受试者数量,两种技术相对优势的结论仍会保持一致。

其次,我们仅介绍了最基础的多元分析方法。实际上,还可以采用许多更为复杂的技术,例如借鉴机器学习文献中的方法、在主成分分析(PCA)之前进行线性和非线性变换,以及其他多种改进策略,这些都有可能进一步提升模型的泛化性能。为简洁起见,本文未涉及这些可能性。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

未声明任何利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢美国国立卫生研究院(NIH)基金的资助:

NIH/NIBIB 5R01EB006204-03 多变量神经影像分析方法

NIH/NIA 5R01AG026114-02 使用动脉自旋标记 MRI 与协方差分析进行早期阿尔茨海默病检测

ADNI: 影像数据由阿尔茨海默病神经影像倡议(Alzheimer's Disease Neuroimaging Initiative, ADNI)(美国国立卫生研究院 NIH U01AG024904)提供。本项目的数据收集与共享由阿尔茨海默病神经影像倡议(ADNI)(美国国立卫生研究院资助号 U01 AG024904)资助。ADNI 由美国国立衰老研究所、美国国立生物医学影像与生物工程研究所,以及以下机构的慷慨捐助共同资助:Abbott、AstraZeneca AB、Bayer Schering Pharma AG、Bristol-Myers Squibb、Eisai Global Clinical Development、Elan Corporation、Genentech、GE Healthcare、GlaxoSmithKline、Innogenetics、Johnson and Johnson、Eli Lilly and Co.、Medpace, Inc.、Merck and Co., Inc.、Novartis AG、Pfizer Inc、F. Hoffman-La Roche、Schering-Plough、Synarc, Inc. 和 Wyeth,以及非营利合作伙伴阿尔茨海默病协会(Alzheimer's Association)和阿尔茨海默病药物发现基金会(Alzheimer's Drug Discovery Foundation),并有美国食品药品监督管理局(U.S. Food and Drug Administration)参与。ADNI 的私营部门捐助由美国国立卫生研究院基金会(Foundation for the National Institutes of Health)负责协调(http://www.fnih.org)。项目承担机构为北加州研究院与教育中心(Northern California Institute for Research and Education),研究由加州大学圣地亚哥分校的阿尔茨海默病合作研究组(Alzheimer's Disease Cooperative Study)协调。ADNI 数据由加州大学洛杉矶分校神经影像实验室(Laboratory for Neuro Imaging)分发。本研究还获得了美国国立卫生研究院资助 P30 AG010129、K01 AG030514 以及达纳基金会(Dana Foundation)的支持。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moeller, J. R., Strother, S. C. A regional covariance approach to the analysis of functional patterns in positron emission tomographic data. J Cereb Blood Flow Metab. 11 (2), A121-A121 (1991).
  2. Scarmeas, N. Covariance PET patterns in early Alzheimer's disease and subjects with cognitive impairment but no dementia: utility in group discrimination and correlations with functional performance. Neuroimage. 23 (1), 35-35 (2004).
  3. Siedlecki, K. L. Examining the multifactorial nature of cognitive aging with covariance analysis of positron emission tomography data. J Int Neuropsychol Soc. 15 (6), 973-973 (2009).
  4. Burnham, K. P., Anderson, D. R. Model selection and multimodel inference a practical information-theoretic approach. , Springer. New York. Volume xxvi (2002).
  5. Moeller, J. R., Strother, S. C., Sidtis, J. J., Rottenberg, D. A. Scaled subprofile model: a statistical approach to the analysis of functional patterns in positron emission tomographic data. J Cereb Blood Flow Metab. 7 (5), 649-649 (1987).
  6. Habeck, C. Multivariate and univariate neuroimaging biomarkers of Alzheimer's disease. Neuroimage. 40 (4), 1503-1503 (2008).
  7. Habeck, C. A new approach to spatial covariance modeling of functional brain imaging data: ordinal trend analysis. Neural Comput. 17 (7), 1602-1602 (2005).
  8. McIntosh, A. R., Bookstein, F. L., Haxby, J. V., Grady, C. L. Spatial pattern analysis of functional brain images using partial least squares. Neuroimage. 3 Pt 1, 143-143 (1996).
  9. McIntosh, A. R., Lobaugh, N. J. Partial least squares analysis of neuroimaging data: applications and advances. Neuroimage. 23, Suppl 1. S250-S250 (2004).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

SPM FDG PET

相关文章