2013年6月26日
包括主成分分析(PCA)在内的多变量技术已被用于识别功能脑成像中区域变化的特征模式。我们开发了一种算法,用于识别神经退行性疾病诊断、疾病进展评估以及患者群体治疗效果客观评价中的可重复性网络生物标志物。
本实验的总体目标是确定神经功能脑部疾病特有的科文斯模式成像生物标志物。首先,使用 PET、SPECT、A-S-L-F-M-R-I 或 V-B-M-M-R-I 等成像方式,获取一组临床预先诊断患者以及一组年龄(并尽可能性别)匹配的正常对照者的单个体积脑扫描图像,以实现上述目标。第二步是将这些图像进行空间标准化处理,使其与一个共同的立体定位模板对齐。
接下来,采用一种多变量分析技术。执行主成分分析的标准化亚分布模型(Scaled SubProfile Model of Principal Component Analysis,简称 S-S-M-P-C-A),并对输出的主成分(principle components,PCs)及其对应的受试者得分进行分析。最后一步是确定能够定义协方差模式(Covariance pattern)的最佳主成分(PC)或主成分组合,以区分患者与对照组。
最终,协方差模式可用于对个体受试者的疾病表达程度进行评分。与一些流行的单体素比较技术相比,该方法的优势在于能够识别和测量脑网络的活动,这些活动表现为大脑中分布的区域性协方差模式。
最重要的是,该方法能够测量大脑中特定神经网络的活动,并通过一个单一数值对其进行概括,这一数值是临床研究中的一个重要指标。该技术有助于回答神经科学领域的一些关键问题,例如识别在疾病进展早期阶段表现出相似症状的不同神经系统疾病的代谢网络。该技术的应用延伸至帕金森病等疾病的鉴别诊断和治疗规划,因为可以获得单个受试者的评分,并将其应用于鉴别诊断和治疗方案的制定。
尽管该方法可为帕金森综合征提供深入见解,但也适用于其他神经退行性疾病,如亨廷顿病和阿尔茨海默病。通常,初次接触该方法的人员会受限于既有的单一观念,即认为疾病的影响局限于孤立的区域簇。
James Moler 博士首次提出该方法的构想,是将其应用于研究艾滋病患者中的痴呆症。通过视觉化演示该方法,有助于理解网络分析中涉及的各个步骤。然而,实际使用我们程序的具体操作并不难掌握,因为这些程序具有高度自动化的特点。若要利用正电子发射断层扫描(PET)研究脑代谢,首先需在禁食至少12小时并停用药物后,向疾病组的每位患者以及每名正常对照者注射放射性核素示踪剂,例如18F-氟代脱氧葡萄糖。
让示踪剂在组织中达到平衡状态,需时45分钟。然后在受试者静息且睁眼状态下进行扫描,以获取模式数据。扫描完成后,对数量相等的性别和H匹配的患者与对照组进行扫描。
将图像数据传输至工作站,并将其转换为适合分析的格式。此处使用的基于 Windows 系统的 MATLAB 分析软件需要将 GE 高级格式转换为 Analyze 或 NIfTI 格式图像才能进行分析。接下来,使用 SPM 等标准神经影像分析软件包,将每位受试者的图像归一化至通用的立体定位空间,以确保不同受试者之间的体素值具有一一对应关系。
然后将灰质掩模应用于标准化后的图像,以限制分析范围至灰质区域。如果无可用的外部掩模,则通过排除低于指定阈值的信号值来创建每个受试者的个体掩模。取每个受试者最大信号值的一定百分比作为阈值,并将各掩模相乘,以定义用于分析的复合灰质体素空间。
为了进行多变量比例化亚轮廓模型主成分分析(S-S-M-P-C-A),请使用费因斯坦神经科学网站上提供的内部程序 scan VP。该程序也可作为统计参数映射工具箱使用,在 scan VP 菜单中选择统计,然后选择 SSM,再选择基于体素,最后选择 PCA。
接下来,检查菜单中的选定对照,并选择先前已归一化的对照图像。然后选择图像文件以导入归一化的患者图像。选择合适的掩模或阈值,并勾选菜单中的其他选项。
接下来,点击“处理”并为实验输出输入名称。等待显示,以查看主成分图像及其对应的可用于其他软件的得分文件。模拟上述自动处理所执行的算法。
为了实现这一目标,首先使用现有的0-1图像掩膜作为初始掩膜数据,以去除体素空间中不需要的区域,例如白质和脑室,具体操作如预处理步骤中所述。接下来,将每位受试者的三维掩膜图像体素数据转换为一个连续的行向量,方法是将连续切片平面上的扫描线依次连接,从而形成一个组数据矩阵,使得每位受试者的数据对应于该矩阵中的特定行。此时,每一列则代表了所有受试者中对应的特定体素。
每个样本载入矩阵后,将每个数据项转换为对数形式。然后通过从每行元素中减去各行的平均值或样本均值,对数据矩阵进行中心化处理。所有中心化行的平均值代表一个特征性的群体均值对数图像,即群体均值谱型或 GMP。
接下来,从对应的矩阵列元素中减去各列的均值。双中心化矩阵的每一行代表一个残差图像,称为被试残差谱型(subject residual profile, SRP),其元素表示相对于被试 S 和体素 V 的组均值的偏差,该过程遵循此处所示公式,其中 S-R-P-S-V 是对应于被试 S 和体素 V 的 SRP 矩阵中的一个元素。DSV 是原始数据值,mean S 是被试均值,GMPV 是体素 V 的组均值。接下来,通过计算被试残差谱型矩阵每一行之间的非标准化协方差,构建基于被试与被试的复合双中心化 SRP 数据矩阵的协方差矩阵 C。
使用此处所示的方程,其中 CIJ 是对称协方差矩阵 C 的一个元素,c、RRP IV 和 CRP JV 是 CRP 矩阵 rose INJ 中对应的体素元素,这些元素在所有体素上相乘并求和。然后对受试者间的协方差矩阵 C 进行主成分分析。结果将得到一组与相应特征值关联的受试者得分特征向量。接下来,将每个向量乘以其对应特征值的平方根进行加权。
得分特征向量的集合由此处所示矩阵 S 的列表示。接下来,通过将得分向量矩阵与受试者残差谱矩阵的转置相乘,计算相同特征值集合对应的体素特征向量。根据此处所示公式,这将生成一个体素模式特征向量数组 P,其中 P 按特征值降序排列,P 为 主成分体素特征向量矩阵。
SRPT 是 SRP 矩阵的转置,S 是得分向量矩阵,然后将每个向量转换为一个主成分图像。每个主成分图像对应于所解释总方差的百分比,即方差贡献率(VAF),该比率与其特征值的相对大小相对应。通过分析主成分分析的结果,确定与较高方差贡献率相关的模式。
体素模式向量及其得分经过Z变换,使其数值表示相对于均值的正负标准差。接下来,尝试识别与所研究疾病相关的区域偏离。然后检查对应于每个主成分模式的得分的散点图。
还可生成可选的受试者工作特征曲线图,以识别特定疾病的模式。通过检验相应双样本 T 检验的 P 值和曲线下面积值,评估患者与对照组之间受试者评分的区分度。随后对选定的主成分进行向量归一化并线性组合,以得到单一的与疾病相关的模式。
为实现这一目标,使用 MATLAB 函数 GLM fit,基于逻辑回归或其他回归模型对受试者评分进行拟合,以确定相应的系数。一旦识别出生物标志物模式,即可通过该个体的扫描数据评估其在前瞻性受试者中的评分表达,此操作可通过菜单中的 TPR 完成。实现该过程的方法是:对受试者的 SRP 向量与 GIS 模式向量进行内部点积的简单计算。
最后,通过使用外部软件进行重复抽样(bootstrap resampling)以及对独立受试者群体进行前瞻性验证,进一步验证所得的潜在模式生物标志物。前瞻性验证可通过使用真阳性率(TPR)来确定前瞻性队列的评分而得以实现。图中显示的是对10名临床诊断为帕金森病患者与10名年龄和性别匹配的对照个体进行SSM分析后,前四个主成分图像在原点处的轴向切面图。
暖色表示代谢活性的相对增加。根据该原则,各组分对整体受试者残差谱的贡献中,冷色表示代谢活性的相对降低。第一主成分具有最大的方差解释率(VAF值)和最小的P值,表明其高度显著,是唯一可单独视为潜在独立生物标志物的组分。
当以正交视图显示在 MRI 结构图像背景上时,对整体模式有贡献的显著变异区域清晰可见。可以通过结合主成分来尝试提高显著性,例如第一和第四主成分的组合可降低 P 值,提示显著性更高。这些图表仅显示第一主成分和第四主成分的推导受试者 Z 分数的独立柱状图及散点图。第一主成分能够显著区分患者与对照组。
尽管第四主成分显示了一种趋势。第一主成分与第四主成分的线性逻辑组合可提高区分能力。如前所述,在 Z 值阈值为 0.9 时,该组合模式实现了完全分离。
结合主成分三显示出比结合主成分一和四略高的区分能力,但由于主成分二缺乏区分能力,引入全部四个主成分并未改善数据的区分效果。此处展示了22名正常对照者和22名帕金森病(PD)患者在主成分一的模式、主成分一与四的组合模式、主成分一、三和四的组合模式,以及主成分1、2、3和4的组合模式下的前瞻性评分评估结果。曲线下面积值和敏感性在联合超过两个主成分时似乎有所下降。
尽管 P 值的稳健性趋于下降,但在 UC 和 P 值中,PC14 相较于单独使用 PC1 仅表现出不显著的改善,这与推导样本中预测的显著差异形成对比。当需要获取患病患者和对照受试者的扫描图像以识别和验证真实且有效的疾病模式时,使用该算法即可成为一种直接的流程。在疾病模式被识别并验证后,还可采用其他方法,例如将患者评分与独立的临床指标进行相关性分析,以回答进一步的科学问题。
例如,影像学生物标志物是反映疾病的运动症状还是认知症状,或疾病模式的表达是否有助于区分在难以诊断的临床病例中表现出相似症状的不同疾病。请勿忘记,由于功能磁共振成像信号存在动态波动以及信噪比较低,该方法无法直接应用于时间序列功能磁共振成像数据。
查看完整文字稿并访问数千部科学视频
本研究重点是利用多变量技术识别神经功能性脑疾病的影像学生物标志物。所开发的算法旨在根据脑成像数据区分患者与对照组。
从神经影像数据中识别与疾病相关的空间协变模式,可为神经退行性疾病提供客观的、网络水平的生物标志物。该方法通过将影像特征与临床表型相联系,支持靶点验证,提高早期发现阶段的预测可信度。同时,通过区分弥散性脑网络与局部效应,有助于降低机制层面的风险,为中枢神经系统药物研发中的项目组合决策提供依据。
该方法通过提供网络水平的读出结果,为靶点可信度和预测性建模提供依据,从而整合到从假设验证、先导物识别到临床前验证的整个发现流程中。