DeepOmicsAE 是一种以深度学习方法(即自编码器)为核心的工作流程,用于降低多组学数据的维度,为预测模型和代表多层组学数据的信号模块提供基础。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
DeepOmicsAE 是一种以深度学习方法(即自编码器)为核心的工作流程,用于降低多组学数据的维度,为预测模型和代表多层组学数据的信号模块提供基础。
大规模组学数据正日益广泛地应用于人类健康研究。本文介绍了DeepOmicsAE,这是一种专为分析多组学数据集(包括 蛋白质组学、代谢组学和临床数据)而优化的工作流程。该工作流程采用一种称为自编码器(autoencoder)的神经网络,从高维度的多组学输入数据中提取出一组简洁的特征。此外,该工作流程还提供了一种优化自编码器实现所需关键参数的方法。为展示该工作流程的应用,我们分析了来自142名个体的临床数据,这些个体或为健康人,或被诊断为阿尔茨海默病,并结合了其死后脑组织样本的蛋白质组和代谢组数据。从自编码器隐含层提取的特征保留了区分健康与患病个体的生物学信息。此外,每个提取出的特征代表一个独立的分子信号模块,这些模块各自以独特的方式与个体的临床特征相互作用, 从而提供了一种整合 蛋白质组学、代谢组学和临床数据的方法。
随着人口老龄化比例日益增加,神经退行性疾病等年龄相关疾病的负担预计将在未来几十年显著加重1。阿尔茨海默病是最常见的神经退行性疾病类型2。由于对驱动该疾病发生和进展的基本 分子机制理解尚浅,寻找有效治疗方法的进展一直较为缓慢。目前关于阿尔茨海默病的大多数信息均来自死后脑组织检查,这使得区分病因与结果变得十分困难3。宗教团体研究/记忆与老龄化项目(ROSMAP)是一项旨在更全面理解神经退行性变的宏大研究,涉及数千名参与者,他们承诺每年接受医学和心理学检查,并在去世后捐献脑组织用于科学研究4。该研究重点关注大脑从正常功能状态向阿尔茨海默病转变的过程2。在该项目中,研究人员对死后脑组织样本 采用了多种组学方法进行分析,包括基因组学、表观基因组学、转录组学、蛋白质组学5和代谢组学。
由于蛋白质和代谢物的丰度与细胞活动之间存在直接关联,能够提供细胞状态功能性读出的组学技术(即蛋白质组学和代谢组学)6,7 在疾病解读中至关重要8,9,10,11,12。蛋白质是细胞过程的主要执行者,而代谢物则是生化反应的底物和产物。多组学数据分析使得人们有可能理解蛋白质组学与代谢组学数据之间的复杂关系,而非孤立地看待它们。多组学是一门研究多层次高维生物数据的学科,包括分子数据(基因组序列与突变、转录组、蛋白质组、代谢组)、临床影像数据以及临床特征。特别是,多组学数据分析旨在整合这些层次的生物数据,理解其相互调控与动态互作,并对疾病的发生和发展提供整体性认识。然而,整合多组学数据的方法仍处于发展的早期阶段13。
自编码器(autoencoder)是一类无监督神经网络14,在多组学数据整合中是一种强大的工具。与有监督神经网络不同,自编码器并不将样本映射到特定的目标值(例如健康或患病状态),也不用于预测结果。其主要应用之一 在于降维。然而,与主成分分析(PCA)、t-分布随机邻域嵌入(tSNE)或统一流形近似与投影(UMAP)等较简单的降维方法相比,自编码器具有多个优势。不同于PCA,自编码器能够捕捉数据中的非线性关系;不同于tSNE和UMAP,由于其依赖于包含非线性激活函数的多层计算单元,自编码器能够检测数据中的层次结构和多模态关系。因此,它们是捕捉多组学数据复杂性的理想模型。最后,尽管PCA、tSNE和UMAP的主要用途是数据聚类,而自编码器则将输入数据压缩为提取出的特征,这些特征非常适合后续的预测任务15,16。
简而言之,神经网络由多个层组成,每层包含多个计算单元或“"神经元"。第一层和最后一层分别称为输入层和输出层。自编码器是一种具有沙漏结构的神经网络,由一个输入层、一到三个隐藏层以及一个通常包含两到六个神经元的小型“"潜在"”层组成。该结构的前半部分称为编码器,后半部分为与编码器对称的解码器。解码器以输出层结束,其神经元数量与输入层相同。自编码器将输入信息通过瓶颈层并重建于输出层,目标是使输出结果尽可能接近原始输入信息。这一目标通过数学方法最小化一个称为“"重构损失"”的参数来实现。输入由一组特征组成,在本文展示的应用中,这些特征包括蛋白质和代谢物的丰度以及临床特征(即性别、受教育程度和死亡年龄)。潜在层包含对输入信息的高度压缩且富含信息的表示,可用于后续应用,例如构建预测模型17,18。
本方案介绍了一种名为 DeepOmicsAE 的工作流程,包括以下步骤:1)对蛋白质组学、代谢组学和临床数据进行预处理(即归一化、标准化、离群值剔除),以获得适用于机器学习分析的统一量纲数据;2)选择合适的自编码器输入特征,因为特征过载可能掩盖与疾病相关的关键模式;3)优化并训练自编码器,包括确定应选择的最优蛋白质和代谢物数量,以及隐含层中神经元的最佳数量;4)从隐含层中提取特征;5)通过识别分子信号模块及其与临床特征的关系,对提取的特征进行生物学解释。
本方案旨在为具备基础 Python 编程知识但计算经验有限的生物学家提供一种简单且可操作的方法。 该方案侧重于分析多组学数据,包括蛋白质组学、代谢组学和临床特征,但也可扩展应用于其他类型的分子表达数据,如转录组学。本方案引入的一个重要新应用是将原始特征的重要性评分映射到隐层中的各个神经元上。因此,隐层中的每个神经元代表一个信号模块,详细描述特定分子改变与患者临床特征之间的相互作用。通过使用 MetaboAnalyst——一种公开可用的工具,可整合基因/蛋白和代谢物数据以推导富集的代谢通路和细胞信号通路,从而实现对分子信号模块的生物学解释17。
访问受限。请登录或开始试用以查看此内容。
注意:此处使用的数据为从阿尔茨海默病知识门户(AD Knowledge portal)下载的ROSMAP数据。下载和重复使用这些数据无需获得知情同意。本方案采用深度学习方法分析多组学数据,识别基于诊断等特征区分特定患者或样本组的信号模块。该方案还可输出一组数量较少的提取特征,用于概括原始的大规模数据,并可用于进一步分析,例如使用机器学习算法训练预测模型(图1)。在执行本方案之前,请参阅补充文件1和材料表,了解获取代码及设置计算环境的相关信息。以下步骤应按指定顺序依次进行。

图 1:DeepOmicsAE 工作流程示意图。 使用该工作流程分析多组学数据的流程示意图。在自编码器示意图中,矩形代表神经网络的层,圆形代表层内的神经元。 请点击此处查看该图的放大版本。
1. 数据预处理
注意:本节的目标是对数据进行预处理,包括处理缺失数据;对蛋白质组学、代谢组学表达数据及临床数据进行归一化和标准化;以及剔除异常值。该方案适用于包含以下类型数据的数据集:以 log2(ratio) 表示的蛋白质组学数据;以倍数变化(fold change)表示的代谢组学数据;以及包含连续型和分类型特征的临床特征数据。患者或样本应根据诊断结果或其他类似参数进行分组。样本或患者应位于行上,而特征应位于列上。
2. 自定义优化工作流程(可选)
注意:第2节为可选部分,因其计算量较大。如果用户决定不执行第2节,可直接跳至第4节。本方案将指导用户以自动化方式优化工作流程。具体而言,该方法可识别出使自编码器在生成可有效区分样本组的提取特征方面表现最佳的参数。输出的优化参数包括用于特征选择的特征数量(k_prot 和 k_met)以及自编码器隐含层中的神经元数量(latent)。这些参数随后可用于第3节所述方案中以构建模型。
3. 采用自定义优化参数的工作流程实施
注意:仅在完成方法优化(第2节)后执行本方案。如果用户选择不进行方法优化,请直接跳至第4节。本方案将指导用户使用第2节中获得的自定义优化参数来构建模型。该自编码器将:1)生成一组提取特征,以重构原始数据;2)识别驱动隐含层中每个神经元的重要特征,从而有效表征独特的信号模块。这些信号模块的解释将依据第5节提供的方案进行。
4. 使用预设参数实施工作流程
5. 使用 MetaboAnalyst 进行生物学解释
访问受限。请登录或开始试用以查看此内容。
为了展示该方案,我们分析了一个数据集,该数据集包含来自142名个体死后脑组织的蛋白质组、代谢组以及临床信息,这些个体 either 健康或被诊断为阿尔茨海默病。
完成第1部分实验方案以对数据进行预处理后,数据集包含6,497种蛋白质、443种代谢物以及三项临床特征(性别、死亡时年龄和受教育程度)。目标特征为死亡时认知状态的临床共识诊断,编码为cogdx,其中1表示无认知障碍(CI),4表示阿尔茨海默病性痴呆合并其他认知障碍病因。80例患者被诊断为健康,62例被诊断为阿尔茨海默病。实施第2部分实验方案以确定参数kprot, kmet和latent的最优取值。该优化算法通过模型参数的不同组合进行特征选择与特征提取,并计算返回输入数据及提取特征的主成分分析(PCA)轮廓系数得分。优化结果表明,kprot与kmet的取值在...
访问受限。请登录或开始试用以查看此内容。
数据集的结构对于实验方案的成功至关重要,应仔细检查。数据应按照方案第1节中的说明进行格式化。正确分配列位置对于方法的成功同样至关重要。由于蛋白质组学和代谢组学数据的性质不同,它们需要采用不同的预处理方法,并分别进行特征选择。因此,在方案步骤1.5、2.3和3.3中正确指定列位置尤为关键。
如果临床数据包含非数值类型的数据(既非连续值也非二元值),用户在执行第1节实验方案时可能会遇到错误。为解决此问题,用户可修改其数据集,仅保留数值型临床数据。例如,可将性别等分类数据转换为二元数值数据。另一个问题是数据预处理过程中可能出现的错误,这可能是由于数据集未按照第1节实验方案中规定的顺序排列所致:即蛋白质组学数据在前,随后是代谢组学数据,最后是临床数据。目标变量(如诊断结果、分级、分期、治疗方案)应位于数据集的最后一列。在开始实验方案前,请适当重新排列数据。对于信号模块的生物学解释,也可采用基因本体论(gene ontology)或基因集富集分析。然而,MetaboAnalyst 的优势在于可将代谢数据整合到分析中,从而提供更为全面的数据解读。
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
本工作由美国国立卫生研究院(NIH)资助项目CA201402以及康奈尔脊椎动物基因组学中心(CVG)杰出学者奖支持。此处发表的结果全部或部分基于从阿尔茨海默病知识门户(AD Knowledge Portal,https://adknowledgeportal.org)获取的数据。研究数据通过阿尔茨海默病加速药物合作项目(Accelerating Medicine Partnership for AD,U01AG046161 和 U01AG061357)提供,样本来源于芝加哥拉什大学医学中心的拉什阿尔茨海默病中心。数据收集工作得到了美国国家老龄化研究所(NIA)资助项目P30AG10161、R01AG15819、R01AG17917、R01AG30146、R01AG36836、U01AG32984、U01AG46152、伊利诺伊州公共卫生部以及转化基因组学研究所的资助支持。代谢组学数据集由Metabolon公司生成,并由ADMC进行预处理。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机 | Apple | Mac Studio | 配备 20 核 CPU、48 核 GPU、32 核神经网络引擎的 Apple M1 Ultra;64 GB 统一内存 |
| Conda v23.3.1 | Anaconda, Inc. | N/A | 包管理系统和环境管理器 |
| conda 环境 DeepOmicsAE | N/A | DeepOmicsAE_env.yml | 包含运行工作流程所需的软件包 |
| GitHub 仓库 DeepOmicsAE | Microsoft | https://github.com/elepan84/DeepOmicsAE/ | 提供脚本、Jupyter 笔记本和 conda 环境文件 |
| Jupyter notebook v6.5.4 | Project Jupyter | N/A | 用于交互式数据科学与科学计算的平台 |
| DT01-代谢组学数据 | N/A | ROSMAP_Metabolon_HD4_Brain 514_assay_data.csv | 本数据用于生成文章中报告的结果。具体而言,DT01-DT04 通过 individualID 进行匹配合并。筛选“最终共识诊断”(cogdx)列,仅保留被分类为健康或阿尔茨海默病(AD)的患者。临床特征筛选后保留以下变量:死亡时年龄、性别和教育程度。最后,将报告为 90+ 的年龄设为 91,然后将年龄列转换为 float64 类型。 数据可在 https://adknowledgeportal.synapse.org 获取 |
| DT02-TMT 蛋白质组学数据 | N/A | C2.median_polish_corrected_log2 (abundanceRatioCenteredOn MedianOfBatchMediansPer Protein)-8817x400.csv | |
| DT03-临床数据 | N/A | ROSMAP_clinical.csv | |
| DT04-生物样本元数据 | N/A | ROSMAP_biospecimen_metadata .csv | |
| Python 3.11.3 | Python Software Foundation | N/A | 编程语言 |
访问受限。请登录或开始试用以查看此内容。