我们介绍了 CorrelationCalculator 和 Filigree 两种用于代谢组学数据驱动网络构建与分析的工具。CorrelationCalculator 支持基于表达数据构建单一的代谢物相互作用网络,而 Filigree 则可用于构建差异网络,并进一步进行网络聚类和富集分析。
方法文章
我们介绍了 CorrelationCalculator 和 Filigree 两种用于代谢组学数据驱动网络构建与分析的工具。CorrelationCalculator 支持基于表达数据构建单一的代谢物相互作用网络,而 Filigree 则可用于构建差异网络,并进一步进行网络聚类和富集分析。
组学数据分析中的一个重大挑战是从中提取可操作的生物学知识,代谢组学也不例外。将单个代谢物水平的变化与特定生物学过程关联起来这一普遍问题,在非靶向液相色谱-质谱(LC-MS)研究中因存在大量未知代谢物而变得更加复杂。此外,现有的通路数据库对次级代谢和脂质代谢的覆盖程度较差。为克服这些局限性,我们课题组开发了多种用于数据驱动网络构建与分析的工具,包括 CorrelationCalculator 和 Filigree。当代谢物数量超过样本数量时,这两种工具均支持用户基于实验性代谢组学数据构建基于偏相关性的网络。CorrelationCalculator 支持构建单个网络,而 Filigree 则可利用两组样本的数据构建差异网络,并进一步进行网络聚类和富集分析。本文将介绍这两种工具在真实代谢组学数据分析中的应用价值与具体使用方法。
近十年来,随着气相色谱-质谱联用(GC-MS)和液相色谱-质谱联用(LC-MS)等分析技术的进步,代谢组学已发展成为一门组学科学。这些技术能够同时检测数百至数千种小分子代谢物,从而产生复杂的多维数据集。代谢组学实验可分为靶向和非靶向两种模式。靶向代谢组学实验针对特定类别的代谢物进行检测,通常以假设驱动为导向;而非靶向方法则力求检测尽可能多的代谢物,本质上具有生成假设的作用。靶向检测通常包含内标物,因而可实现对目标代谢物的绝对定量;相比之下,非靶向检测仅能进行相对定量,且包含大量未知代谢物1。
代谢组学数据分析是一个多步骤的过程,依赖于多种专用软件工具1。该过程可分为以下三个主要步骤:(1)数据处理与质量控制,(2)统计分析,(3)生物学数据解读。本文所描述的工具旨在支持分析的最后一步。
解释代谢组学数据的一种直观且常用的方法是将实验测量结果映射到代谢通路上。已有多种工具被设计用于实现这一目的2,3,4,5,其中包括由我们团队开发的Metscape6。通路映射通常与富集分析相结合,有助于识别最显著的代谢通路7,8。这些技术最初在基因表达数据的分析中崭露头角,并已成功应用于蛋白质组学和表观基因组学数据的分析9,10,11,12,13。然而,对于基于知识的分析方法而言,代谢组学数据的分析仍面临诸多挑战。首先,除了内源性代谢物外,代谢组学检测还会测量外源性化合物,包括来自营养和其他环境来源的物质。这些化合物以及由细菌产生的代谢物无法映射到人类或其他真核生物的代谢通路上。此外,目前对次级代谢和脂质代谢的通路覆盖尚不充分,难以在支持数据生物学解释所需的高分辨率水平上进行通路映射14,15。
基于数据的网络分析技术有助于克服这些挑战。例如,基于相关性的网络可帮助推导已知和未知代谢物之间的关系,并促进对未知代谢物的注释16。尽管计算皮尔逊相关系数是建立代谢物之间线性关系最直接的方法,但其缺点在于会同时捕获直接和间接关联17,18,19。另一种方法是计算偏相关系数,以区分直接与间接关联。高斯图模型(Gaussian graphical modeling, GGM)可用于估计偏相关网络。然而,GGM要求样本量与特征数量相当,这一条件在包含数千个代谢特征测量值的非靶向LC-MS数据中很少满足。可采用正则化技术来克服这一限制。图套索(graphical lasso, Glasso)和逐节点回归(nodewise regression)是用于正则化估计偏相关网络的常用方法16,20。
本文介绍的第一种生物信息学工具 CorrelationCalculator16 基于去偏稀疏部分相关(DSPC)算法。DSPC 依赖于去稀疏化图形套索(de-sparsified graphical lasso)建模。该算法的基本假设是:代谢物之间的连接数量远小于样本数量,即代谢物的部分相关网络是稀疏的。这一假设使得 DSPC 能够利用较少的样本发现大量代谢物之间的连接关系,并借助正则化回归技术实现。此外,通过对正则化回归估计值进行去偏处理,该方法可获得边参数的抽样分布,进而用于构建置信区间并检验感兴趣的假设(例如,单条边或一组边的存在性或不存在性)。因此,可通过计算得到的 p 值对部分相关网络中某条边的存在与否进行正式的统计检验。
CorrelationCalculator 在单组分析中被证明非常有用16;然而,许多代谢组学实验的目标是对两个或更多条件进行差异分析。虽然可以将 CorrelationCalculator 分别应用于各组,以生成每种条件下的偏相关网络,但这种方法限制了可用于网络构建的样本数量。由于足够大的样本量是数据驱动分析中最关键的考虑因素之一,因此能够利用数据中所有可用样本构建网络的方法具有很高的价值。这一方法已在本文介绍的第二个工具 Filigree21 中实现。Filigree 依赖于先前发表的差异网络富集分析(Differential Network Enrichment Analysis, DNEA)算法22。表1展示了这两种工具的应用场景与工作流程。
| 实验条件数量 (k) | k = 1 | k = 2 |
| 软件工具 | CorrelationCalculator | Filigree |
| 输入数据 | • 代谢物 × 样本数据矩阵 | • 代谢物 × 样本数据矩阵 • 实验分组 |
| 工作流程 • 预处理 • 网络估计 • 网络聚类 • 富集分析 | • 对数变换;自动缩放 • DSPC • 通过外部应用程序 • 无 | • 对数变换;自动缩放 • 联合网络估计 • 一致性聚类 • NetGSA |
| 数据可视化 | 通过外部应用程序,例如 Cytoscape | 通过外部应用程序,例如 Cytoscape |
| 检验代谢模块与关注结局的关联性(可选) | 通过外部应用程序 | 通过外部应用程序 |
表1:CorrelationCalculator 和 Filigree 的应用范围与工作流程。
访问受限。请登录或开始试用以查看此内容。
1. 相关性计算器
2. 丝网工艺
3. 其他注意事项
访问受限。请登录或开始试用以查看此内容。
为了说明 CorrelationCalculator 的使用方法, 我们使用 Krumsiek 等人描述的 KORA 群体研究中代谢组学数据的一个子集构建了偏相关网络。24该数据集包含151种代谢物和240个样本。 图1 显示了在 Cytoscape 中可视化的部分相关性网络。该网络包含 148 个节点和 272 条边。节点颜色代表属于不同化学类别的代谢物,边则代表部分相关系数的校正 p 值(校正 p 值 < 0.05)。值得注意的是,尽管未使用任何先验信息,CorrelationCalculator 仍能够将化学性质相关的代谢物归为一组。例如,在该网络中,磷脂酰胆碱和溶血磷脂酰胆碱彼此紧密关联。在该类网络背景下可视化代谢物的变化,有助于提出科学假设、指导后续实验设计,并推动论文撰写。为了展示利用偏相关代谢物网络的潜在工作流程,我们按照 Ma 等人的方法进行了共识网络聚类分析。22,从而鉴定出9个子网络或代谢模块。这些模块与化学类别具有良好的一致性,即属于同一...
访问受限。请登录或开始试用以查看此内容。
在 CorrelationCalculator 和 Filigree 中实现的基于偏相关性的网络分析方法有助于克服基于知识的代谢通路分析的一些局限性,尤其适用于未知代谢物比例较高且代谢通路覆盖有限的数据集(例如脂质组学数据)。这些工具已被研究界广泛用于分析多种代谢组学和脂质组学数据14,22,27,28,29,30。例如,CorrelationCalculator 已被用于分析来自多种生物系统的数据,范围涵盖微生物组、植物到人类疾病31,32,33,<...
访问受限。请登录或开始试用以查看此内容。
该 作者无竞争性财务利益。
本工作由美国国立卫生研究院(NIH)资助,资助编号为1U01CA235487。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 相关性计算器 | JAVA | http://metscape.med.umich.edu/calculator.html | |
| clusterNet | https://github.com/Karnovsky-Lab/clusterNet | ||
| Cytoscape | Cytoscape | https://cytoscape.org/ | |
| Filigree | JAVA | http://metscape.med.umich.edu/filigree.html | |
| MetScape | Cytoscape | https://apps.cytoscape.org/apps/metscape | Cytoscape 插件,支持相关性网络的构建与探索。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可