2010年7月24日
本文介绍了多变量分析的基本原理,并将其与更常用的基于体素的单变量分析进行对比。这两种分析方法均应用于一个临床神经科学数据集。补充的半分模拟结果显示,多变量分析结果在独立数据集中的可重复性更优。
本视频演示并比较了用于神经影像数据的多变量与单变量分析技术,并将其应用于阿尔茨海默病的诊断。首先,通过单变量分析对比20名早期阿尔茨海默病患者与20名年龄匹配的健康对照者的脑部活动。采用SPM方法识别阿尔茨海默病患者相对于对照组在FDG PET信号中表现出最显著相对缺陷的脑区。
对于多变量分析,采用主成分分析结合线性判别分析来推导标志物结果,表明多变量标志物相较于单变量标志物具有更优的诊断性能,并在独立数据上表现出更强的泛化能力。大家好,我是来自哥伦比亚大学医学中心神经科 TA 研究所的 Christian Halbeck。今天我们将向您展示一个神经影像数据多变量分析的示例。
我们在实验室中采用此方法研究如何从神经影像数据中最佳地检测早期阿尔茨海默病。现在让我们开始。首先对神经影像数据的多变量分析进行概念性概述。
多变量方法评估的是大脑不同区域之间活动的相关性,而不是像单变量分析那样逐体素进行分析。例如,我们可以设想一个包含50名人类被试的简单假设数据集,其中仅测量了大脑中的三个区域,以体素表示。多变量分析的主要目标是识别数据中主要的变异来源,然后描述数据中感兴趣的主效应。
就这些变异来源而言,单变量分析不考虑体素之间的相关性。无论体素之间是否存在相关性,单变量分析都会以相同的方式处理此处显示的两个图示。在本视频中,将基于一个临床数据集演示单变量和多变量分析的流程,该数据集包含95例早期阿尔茨海默病(AD)患者和102例健康对照者的FTG PET静息态扫描图像。在所有脑图像中,随机选取了20例患者和20例对照者作为衍生样本。
其余的75次和82次扫描分别构成复制样本。现在我们来看如何对该数据集应用单变量和多变量分析。首先采用单变量方法,使用SPM软件获取单变量阿尔茨海默病标志物。为了在衍生样本中对比20次阿尔茨海默病扫描与20次对照扫描,选择阿尔茨海默病患者相较于对照组正电子发射断层扫描(PET)信号下降最显著的脑区位置。
使用 T 检验评估该脑区的诊断效能,检验复制样本中相同脑区的数据,并绘制其 PET 信号随疾病状态的变化图。接下来,获取多变量标志物。可在线获取一个定制的 MATLAB 工具箱,用于通过该定制 MATLAB 工具箱进行多变量分析。
对衍生样本中合并的40次扫描进行主成分分析(PCA)。然后根据前六个主成分构建Covance模式,这些主成分的受试者评分在80名患者与健康对照之间显示出最大的平均差异。一旦从衍生样本中获得诊断性Covance模式,便将其应用于复制样本,绘制所得受试者评分随疾病状态变化的图形,并比较两个样本中的表现。
为了对单变量与多变量方法进行更全面的比较,执行分样本模拟,并在重采样的数据上重复前述步骤1000次,每次均重新生成一个20例患者与20例健康对照的推导样本,以及一个包含80例患者与健康对照、比例为75比82的复制样本。分样本模拟在方法学研究中较为常见,因其可通过记录推导样本中所得生物标志物在复制样本中的预测误差,从而简便地检验其性能。从推导样本中计算单变量与多变量疾病标志物,并设定决策阈值,使得至多一名健康对照被误判为阿尔茨海默病(AD),即特异性达到95%。随后,将具有特定决策阈值的疾病标志物应用于复制样本,并记录在所有重采样迭代过程中复制样本的分类错误率。接下来,我们将考察单变量与多变量分析以及分样本模拟的结果。
对于单变量区域分析,与广告相关的最大FDG减低区域位于楔前叶Brodmann 31区。曲线下面积达到0.90。
该对比在复制样本中的泛化效果相当理想,多元分析的 ROC 曲线下面积为 0.84。具有正向载荷的脑区提示在疾病背景下信号相对保留,这些区域位于小脑;而信号丢失则与颞叶、额叶及后扣带 gyrus 相关。在推导样本和复制样本中,ROC 曲线下面积分别为 0.96 和 0.88,均略优于单变量标志物。从 1000 次分样本模拟中记录的总分类错误率可以看出,多元标志物在诊断效能的复制方面优于单变量标志物。我们刚刚向您展示了如何将多元分析应用于阿尔茨海默病的 Ft.G PET 扫描诊断问题。
所有数据均可从阿尔茨海默病神经影像学倡议(Alzheimer's Disease Neuroimaging Initiative)的网站公开获取。在对真实数据执行此操作时,需牢记此前已应用常规的质量控制步骤。任何分析都无法对质量差的数据产生奇迹效果。
以上就是全部内容。感谢观看,祝您的分析工作顺利。
本文在阿尔茨海默病诊断的神经影像数据背景下,比较了多变量分析技术与单变量分析。重点阐述了多变量方法在提升诊断性能以及对独立数据集具有更好泛化能力方面的优势。
神经影像数据的多变量分析在神经退行性疾病研究中为目标验证提供了更强的统计效能和可重复性。通过评估脑区间相关性而非体素级信号,该方法能够提供更具生物学意义的神经网络改变特征。这种机制层面的风险降低策略有助于在早期发现阶段建立预测信心,尤其适用于阿尔茨海默病及相关疾病,其中网络水平的病理生理过程在疾病机制中起核心作用。
将多变量分析置于从假设检验到先导物识别的发现连续体中,支持神经退行性疾病项目中的生物学去风险化和预测建模。