需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

DeepOmicsAE:利用蛋白质组学、代谢组学和临床数据的深度学习分析揭示阿尔茨海默病中的信号模块

2.3K 次观看

⸱

DOI:

10.3791/65910

⸱

2023年12月15日

本文内容

摘要

DeepOmicsAE 是一种以深度学习方法(即自编码器)为核心的工作流程,用于降低多组学数据的维度,为预测模型和代表多层组学数据的信号模块提供基础。

摘要

大规模组学数据正日益广泛地应用于人类健康研究。本文介绍了DeepOmicsAE,这是一种专为分析多组学数据集(包括 蛋白质组学、代谢组学和临床数据)而优化的工作流程。该工作流程采用一种称为自编码器(autoencoder)的神经网络,从高维度的多组学输入数据中提取出一组简洁的特征。此外,该工作流程还提供了一种优化自编码器实现所需关键参数的方法。为展示该工作流程的应用,我们分析了来自142名个体的临床数据,这些个体或为健康人,或被诊断为阿尔茨海默病,并结合了其死后脑组织样本的蛋白质组和代谢组数据。从自编码器隐含层提取的特征保留了区分健康与患病个体的生物学信息。此外,每个提取出的特征代表一个独立的分子信号模块,这些模块各自以独特的方式与个体的临床特征相互作用, 从而提供了一种整合 蛋白质组学、代谢组学和临床数据的方法。

引言

随着人口老龄化比例日益增加,神经退行性疾病等年龄相关疾病的负担预计将在未来几十年显著加重1。阿尔茨海默病是最常见的神经退行性疾病类型2。由于对驱动该疾病发生和进展的基本 分子机制理解尚浅,寻找有效治疗方法的进展一直较为缓慢。目前关于阿尔茨海默病的大多数信息均来自死后脑组织检查,这使得区分病因与结果变得十分困难3。宗教团体研究/记忆与老龄化项目(ROSMAP)是一项旨在更全面理解神经退行性变的宏大研究,涉及数千名参与者,他们承诺每年接受医学和心理学检查,并在去世后捐献脑组织用于科学研究4。该研究重点关注大脑从正常功能状态向阿尔茨海默病转变的过程2。在该项目中,研究人员对死后脑组织样本 采用了多种组学方法进行分析,包括基因组学、表观基因组学、转录组学、蛋白质组学5和代谢组学。

由于蛋白质和代谢物的丰度与细胞活动之间存在直接关联,能够提供细胞状态功能性读出的组学技术(即蛋白质组学和代谢组学)6,7 在疾病解读中至关重要8

访问受限。请登录或开始试用以查看此内容。

方案

注意:此处使用的数据为从阿尔茨海默病知识门户(AD Knowledge portal)下载的ROSMAP数据。下载和重复使用这些数据无需获得知情同意。本方案采用深度学习方法分析多组学数据,识别基于诊断等特征区分特定患者或样本组的信号模块。该方案还可输出一组数量较少的提取特征,用于概括原始的大规模数据,并可用于进一步分析,例如使用机器学习算法训练预测模型(图1)。在执行本方案之前,请参阅补充文件1和材料表,了解获取代码及设置计算环境的相关信息。以下步骤应按指定顺序依次进行。

DeepOmicsAE 示意图;自编码器流程;数据预处理、特征选择、生物学解释。
图 1:DeepOmicsAE 工作流程示意图。 使用该工作流程分析多组学数据的流程示意图。在自编码器示意图中,矩....

访问受限。请登录或开始试用以查看此内容。

结果

为了展示该方案,我们分析了一个数据集,该数据集包含来自142名个体死后脑组织的蛋白质组、代谢组以及临床信息,这些个体 either 健康或被诊断为阿尔茨海默病。

完成第1部分实验方案以对数据进行预处理后,数据集包含6,497种蛋白质、443种代谢物以及三项临床特征(性别、死亡时年龄和受教育程度)。目标特征为死亡时认知状态的临床共识诊断,编码为cogdx,其中1表示无认知障碍(CI),4表示阿尔茨海默病性痴呆合并其他认知障碍病因。80例患者被诊断为健康,62例被诊断为阿尔茨海默病。实施第2部分实验方案以确定参数kprot, kmet和latent的最优取值。该优化算法通过模型参数的不同组合进行特征选择与特征提取,并计算返回输入数据及提取特征的主成分分析(PCA)轮廓系数得分。优化结果表明,kprot与kmet的取值在.......

访问受限。请登录或开始试用以查看此内容。

讨论

数据集的结构对于实验方案的成功至关重要,应仔细检查。数据应按照方案第1节中的说明进行格式化。正确分配列位置对于方法的成功同样至关重要。由于蛋白质组学和代谢组学数据的性质不同,它们需要采用不同的预处理方法,并分别进行特征选择。因此,在方案步骤1.5、2.3和3.3中正确指定列位置尤为关键。

如果临床数据包含非数值类型的数据(既非连续值也非二元值),用户在执行第1节实验方案时可能会遇到错误。为解决此问题,用户可修改其数据集,仅保留数值型临床数据。例如,可将性别等分类数据转换为二元数值数据。另一个问题是数据预处理过程中可能出现的错误,这可能是由于数据集未按照第1节实验方案中规定的顺序排列所致:即蛋白质组学数据在前,随后是代谢组学数据,最后是临床数据。目标变量(如诊断结果、分级、分期、治疗方案)应位于数据集的最后一列。在开始实验方案前,请适当重新排列数据。对于信号模块的生物学解释,也可采用基因本体论(gene ontology)或基因集富集分析。然而,MetaboAnalyst 的优势在于可将代谢数据整合到分析中,从而提供更为全面的数据解读。

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在利益冲突。

致谢

本工作由美国国立卫生研究院(NIH)资助项目CA201402以及康奈尔脊椎动物基因组学中心(CVG)杰出学者奖支持。此处发表的结果全部或部分基于从阿尔茨海默病知识门户(AD Knowledge Portal,https://adknowledgeportal.org)获取的数据。研究数据通过阿尔茨海默病加速药物合作项目(Accelerating Medicine Partnership for AD,U01AG046161 和 U01AG061357)提供,样本来源于芝加哥拉什大学医学中心的拉什阿尔茨海默病中心。数据收集工作得到了美国国家老龄化研究所(NIA)资助项目P30AG10161、R01AG15819、R01AG17917、R01AG30146、R01AG36836、U01AG32984、U01AG46152、伊利诺伊州公共卫生部以及转化基因组学研究所的资助支持。代谢组学数据集由Metabolon公司生成,并由ADMC进行预处理。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
计算机AppleMac Studio配备 20 核 CPU、48 核 GPU、32 核神经网络引擎的 Apple M1 Ultra;64 GB 统一内存
Conda v23.3.1Anaconda, Inc.N/A包管理系统和环境管理器
conda 环境
DeepOmicsAE
N/ADeepOmicsAE_env.yml包含运行工作流程所需的软件包
GitHub 仓库 DeepOmicsAEMicrosofthttps://github.com/elepan84/DeepOmicsAE/提供脚本、Jupyter 笔记本和 conda 环境文件
Jupyter notebook v6.5.4Project JupyterN/A用于交互式数据科学与科学计算的平台
DT01-代谢组学数据N/AROSMAP_Metabolon_HD4_Brain
514_assay_data.csv
本数据用于生成文章中报告的结果。具体而言,DT01-DT04 通过 individualID 进行匹配合并。筛选“最终共识诊断”(cogdx)列,仅保留被分类为健康或阿尔茨海默病(AD)的患者。临床特征筛选后保留以下变量:死亡时年龄、性别和教育程度。最后,将报告为 90+ 的年龄设为 91,然后将年龄列转换为 float64 类型。
数据可在 https://adknowledgeportal.synapse.org 获取
DT02-TMT 蛋白质组学数据N/AC2.median_polish_corrected_log2
(abundanceRatioCenteredOn
MedianOfBatchMediansPer
Protein)-8817x400.csv
DT03-临床数据N/AROSMAP_clinical.csv
DT04-生物样本元数据N/AROSMAP_biospecimen_metadata
.csv
Python 3.11.3 Python Software FoundationN/A编程语言

参考文献

  1. Hou, Y., et al. Ageing as a risk factor for neurodegenerative disease. Nature Reviews Neurology. 15 (10), 565-581 (2019).
  2. Scheltens, P., et al. Alzheimer’s disease. The Lancet. 397 (10284), 1577-1590 (2021).
  3. Breijyeh, Z., Karaman, R.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

多组学分析深度学习自编码器蛋白质组学数据代谢组学数据临床数据整合特征提取通路富集Jupyter Notebook 工作流程