方法文章

CorrelationCalculator 和 Filigree:面向代谢组学数据的基于数据驱动的网络分析工具

DOI:

10.3791/65512

2023年11月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们介绍了 CorrelationCalculator 和 Filigree 两种用于代谢组学数据驱动网络构建与分析的工具。CorrelationCalculator 支持基于表达数据构建单一的代谢物相互作用网络,而 Filigree 则可用于构建差异网络,并进一步进行网络聚类和富集分析。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

组学数据分析中的一个重大挑战是从中提取可操作的生物学知识,代谢组学也不例外。将单个代谢物水平的变化与特定生物学过程关联起来这一普遍问题,在非靶向液相色谱-质谱(LC-MS)研究中因存在大量未知代谢物而变得更加复杂。此外,现有的通路数据库对次级代谢和脂质代谢的覆盖程度较差。为克服这些局限性,我们课题组开发了多种用于数据驱动网络构建与分析的工具,包括 CorrelationCalculator 和 Filigree。当代谢物数量超过样本数量时,这两种工具均支持用户基于实验性代谢组学数据构建基于偏相关性的网络。CorrelationCalculator 支持构建单个网络,而 Filigree 则可利用两组样本的数据构建差异网络,并进一步进行网络聚类和富集分析。本文将介绍这两种工具在真实代谢组学数据分析中的应用价值与具体使用方法。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

近十年来,随着气相色谱-质谱联用(GC-MS)和液相色谱-质谱联用(LC-MS)等分析技术的进步,代谢组学已发展成为一门组学科学。这些技术能够同时检测数百至数千种小分子代谢物,从而产生复杂的多维数据集。代谢组学实验可分为靶向和非靶向两种模式。靶向代谢组学实验针对特定类别的代谢物进行检测,通常以假设驱动为导向;而非靶向方法则力求检测尽可能多的代谢物,本质上具有生成假设的作用。靶向检测通常包含内标物,因而可实现对目标代谢物的绝对定量;相比之下,非靶向检测仅能进行相对定量,且包含大量未知代谢物1

代谢组学数据分析是一个多步骤的过程,依赖于多种专用软件工具1。该过程可分为以下三个主要步骤:(1)数据处理与质量控制,(2)统计分析,(3)生物学数据解读。本文所描述的工具旨在支持分析的最后一步。

解释代谢组学数据的一种直观且常用的方法是将实验测量结果映射到代谢通路上。已有多种工具被设计用于实现这一目的2,3,4,5,其中包括由我们团队开发的Metscape6。通路映射通常与富集分析相结合,有助于识别最显著的代谢通路7,8。这些技术最初在基因表达数据的分析中崭露头角,并已成功应用于蛋白质组学和表观基因组学数据的分析9,10,11,12,13。然而,对于基于知识的分析方法而言,代谢组学数据的分析仍面临诸多挑战。首先,除了内源性代谢物外,代谢组学检测还会测量外源性化合物,包括来自营养和其他环境来源的物质。这些化合物以及由细菌产生的代谢物无法映射到人类或其他真核生物的代谢通路上。此外,目前对次级代谢和脂质代谢的通路覆盖尚不充分,难以在支持数据生物学解释所需的高分辨率水平上进行通路映射14,15

基于数据的网络分析技术有助于克服这些挑战。例如,基于相关性的网络可帮助推导已知和未知代谢物之间的关系,并促进对未知代谢物的注释16。尽管计算皮尔逊相关系数是建立代谢物之间线性关系最直接的方法,但其缺点在于会同时捕获直接和间接关联17,18,19。另一种方法是计算偏相关系数,以区分直接与间接关联。高斯图模型(Gaussian graphical modeling, GGM)可用于估计偏相关网络。然而,GGM要求样本量与特征数量相当,这一条件在包含数千个代谢特征测量值的非靶向LC-MS数据中很少满足。可采用正则化技术来克服这一限制。图套索(graphical lasso, Glasso)和逐节点回归(nodewise regression)是用于正则化估计偏相关网络的常用方法16,20

本文介绍的第一种生物信息学工具 CorrelationCalculator16 基于去偏稀疏部分相关(DSPC)算法。DSPC 依赖于去稀疏化图形套索(de-sparsified graphical lasso)建模。该算法的基本假设是:代谢物之间的连接数量远小于样本数量,即代谢物的部分相关网络是稀疏的。这一假设使得 DSPC 能够利用较少的样本发现大量代谢物之间的连接关系,并借助正则化回归技术实现。此外,通过对正则化回归估计值进行去偏处理,该方法可获得边参数的抽样分布,进而用于构建置信区间并检验感兴趣的假设(例如,单条边或一组边的存在性或不存在性)。因此,可通过计算得到的 p 值对部分相关网络中某条边的存在与否进行正式的统计检验。

CorrelationCalculator 在单组分析中被证明非常有用16;然而,许多代谢组学实验的目标是对两个或更多条件进行差异分析。虽然可以将 CorrelationCalculator 分别应用于各组,以生成每种条件下的偏相关网络,但这种方法限制了可用于网络构建的样本数量。由于足够大的样本量是数据驱动分析中最关键的考虑因素之一,因此能够利用数据中所有可用样本构建网络的方法具有很高的价值。这一方法已在本文介绍的第二个工具 Filigree21 中实现。Filigree 依赖于先前发表的差异网络富集分析(Differential Network Enrichment Analysis, DNEA)算法22表1展示了这两种工具的应用场景与工作流程。

实验条件数量 (k)k = 1k = 2
软件工具CorrelationCalculatorFiligree
输入数据• 代谢物 × 样本数据矩阵• 代谢物 × 样本数据矩阵
• 实验分组
工作流程
• 预处理
• 网络估计
• 网络聚类
• 富集分析

• 对数变换;自动缩放
• DSPC
• 通过外部应用程序
• 无

• 对数变换;自动缩放
• 联合网络估计
• 一致性聚类
• NetGSA
数据可视化通过外部应用程序,例如 Cytoscape通过外部应用程序,例如 Cytoscape
检验代谢模块与关注结局的关联性(可选)通过外部应用程序通过外部应用程序

表1:CorrelationCalculator 和 Filigree 的应用范围与工作流程。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 相关性计算器

  1. 下载一个包含代谢物列表及其实验测量值的逗号分隔输入示例文件,地址为 http://metscape.med.umich.edu/kora_data_240.csv。
  2. 双击下载的示例文件以打开。
    1. 确保文件中包含样本和代谢物的标签。
    2. 由于样本位于行中,请确认第一列为样本名称,第一行为代谢物名称。
  3. 下载 CorrelationCalculator Java 应用程序(http://metscape.med.umich.edu/calculator.html)。双击下载的 .jar 文件以启动该应用程序。
  4. 输入 选项卡上,点击 浏览 按钮上传输入文件。
  5. 指定文件格式 下,使用下拉箭头选择适当的输入文件格式。选择 样本在行中 补充图 1)。
  6. 点击窗口右下角的 下一步 >> 按钮,进入 数据标准化 选项卡。
  7. 选择方法 下,勾选 Log2-转换数据 旁边的复选框。同时勾选 自动缩放数据 旁边的复选框。
  8. 标准化数据 下,点击 运行 按钮。
    注意:标准化完成后,点击 标准化数据 下的 查看标准化数据 按钮,查看更新后的数据集(补充图 2)。
  9. 标准化数据 下,点击 保存 按钮,并保存新的数据文件。
  10. 点击窗口右下角的 下一步 >> 按钮,进入 数据分析 选项卡。
  11. 计算 Pearson 相关性 下,点击 运行。确定适用于该数据的最佳 Pearson 相关性范围。
    1. 点击 查看直方图 按钮。查看每个特征的最大 Pearson 相关性得分的频率分布。
    2. 点击 查看热图 按钮。查看 Pearson 相关性矩阵的可视化表示。
  12. 按 Pearson 相关性筛选 下,保留默认数值,即筛选范围为 0.00 至 1.00。
    注意:可通过拖动右侧的小蓝色箭头从 1 开始、左侧的小蓝色箭头从 0 开始来调整筛选范围。也可在文本框中直接输入具体数值。
  13. 选择偏相关方法 下,选择所需方法 DSPC 方法
    注意:如果数据集中代谢物的数量少于样本数量,则只能使用 DSPC 方法。
  14. 计算偏相关性 下,点击 运行 按钮(补充图 3)。
  15. 点击 查看 CSV 文件 查看结果。点击 保存 按钮并保存结果。
  16. 点击 在 MetScape 中查看 按钮,以启动交互式相关性网络。
    有关 MetScape 的使用详情,请参见 Karnovsky, A. 等人6 的文献。
    ​注意:MetScape 是一个 Cytoscape 应用程序,可用于构建和探索相关性网络。

2. 丝网工艺

  1. 下载一个包含代谢物测量数据的逗号分隔示例输入文件,文件地址为 http://metscape.med.umich.edu/T1D_primaryMetabolites_noIS_log_scaled_sorted.csv。
  2. 双击下载的示例文件以打开。
    1. 确保文件第1列为样本名称,第2列为分组信息。确认其余各列包含代谢物/脂质数据。
    2. 确保每一行代表一个样本。
      注意:除非进行特征聚合分析,否则代谢物测量值应经过对数转换和自动缩放;若进行特征聚合,则仅需对数转换。
  3. 下载 Filigree Java 应用程序(http://metscape.med.umich.edu/filigree.html)。
    注意:详细用户手册可从 http://metscape.ncibi.org/v0.1.2Filigree_UserManual.pdf 获取。
  4. 双击下载的 .jar 文件以启动应用程序。
  5. 数据 选项卡中,点击 浏览 按钮上传输入文件。
  6. 指定列/行部分,点击 样本ID 旁边的下拉箭头,从输入文件中选择对应的列/行名称,选择 样本
  7. 指定列/行部分,点击 "分组" 旁边的下拉箭头,从输入文件中选择对应的列/行,选择 分组
  8. 指定样本分组部分,点击每个 分组 旁边的下拉箭头,从输入文件中选择对应的分组列。对于 分组1,选择 糖尿病;对于 分组2,选择 非糖尿病
  9. 特征分组部分,勾选所需方法旁边的复选框,即 计算特征组
  10. 点击 查看热图 按钮。查看热图并确定所需的特征减少百分比。
  11. 使用 特征缩减滑块选择所需的特征减少百分比。滑动小圆圈,直到特征减少百分比显示特征与样本的比例为1.25(补充图4)。
  12. 点击窗口右下角的 下一步 >> 按钮,切换到 分析 选项卡。
  13. 选择输出目录部分,点击浏览按钮,并选择用于存储生成输出文件的目标目录位置。
  14. 点击窗口左下角的 运行分析 按钮。每个分析组件的进度条将随之更新(补充图5)。在弹出窗口显示“分析成功完成”消息后,点击 确定 按钮。
  15. 分析 选项卡中,点击 浏览网络按钮,以在浏览器标签页中打开交互式 Filigree 子网络。
  16. 点击 子网络名称列下的 子网络1 链接。
  17. 使用各种按钮探索交互式子网络。点击 + 按钮并放大网络的某一部分;点击 - 按钮缩小视图(补充图6)。
  18. 点击一个 分组节点并拖动,以在子网络中重新定位该节点。
    注意:节点颜色表示上调或下调,颜色不透明度表示倍数变化的高低。边的颜色表示组间的差异状态。
  19. 点击页面右上角的 展开特征按钮,展开所有分组节点。查看构成这些分组节点的具体化合物。
  20. 点击页面右上角的 折叠特征按钮,折叠最近展开的分组节点。
  21. 点击页面右上角的 按样本分组按钮,将视图从单一子网络切换为按分组划分的多个子网络。使用此视图探索并比较各组(补充图7)。
  22. 点击 所有样本按钮,返回单一子网络视图。
  23. 点击页面右上角的 下一个 按钮,查看下一个子网络。
  24. 对每个子网络重复步骤 2.19–2.23。
  25. 点击窗口顶部中央的 差异网络富集分析结果链接,返回列出所有子网络的汇总表视图。
    ​注意:可将边和/或节点的输出文件导入其他软件工具(如 Cytoscape23),以生成额外的网络可视化图像。

3. 其他注意事项

  1. 对于运行 Big Sur(OSX 11.2)或更高版本的 Mac 计算机,请在 苹果菜单 > 系统偏好设置 > 安全 & 隐私 > 通用 并选择 允许 标签底部
  2. 此外,允许 Filigree 访问文件中的内容 苹果菜单 > 系统偏好设置 > 安全 & 隐私 > 隐私 通过选择 文件与文件夹 在左侧菜单中选择 纤细结构 在右侧菜单中。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

为了说明 CorrelationCalculator 的使用方法, 我们使用 Krumsiek 等人描述的 KORA 群体研究中代谢组学数据的一个子集构建了偏相关网络。24该数据集包含151种代谢物和240个样本。 图1 显示了在 Cytoscape 中可视化的部分相关性网络。该网络包含 148 个节点和 272 条边。节点颜色代表属于不同化学类别的代谢物,边则代表部分相关系数的校正 p 值(校正 p 值 < 0.05)。值得注意的是,尽管未使用任何先验信息,CorrelationCalculator 仍能够将化学性质相关的代谢物归为一组。例如,在该网络中,磷脂酰胆碱和溶血磷脂酰胆碱彼此紧密关联。在该类网络背景下可视化代谢物的变化,有助于提出科学假设、指导后续实验设计,并推动论文撰写。为了展示利用偏相关代谢物网络的潜在工作流程,我们按照 Ma 等人的方法进行了共识网络聚类分析。22,从而鉴定出9个子网络或代谢模块。这些模块与化学类别具有良好的一致性,即属于同一...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在 CorrelationCalculator 和 Filigree 中实现的基于偏相关性的网络分析方法有助于克服基于知识的代谢通路分析的一些局限性,尤其适用于未知代谢物比例较高且代谢通路覆盖有限的数据集(例如脂质组学数据)。这些工具已被研究界广泛用于分析多种代谢组学和脂质组学数据14,22,27,28,29,30。例如,CorrelationCalculator 已被用于分析来自多种生物系统的数据,范围涵盖微生物组、植物到人类疾病31,32,33,<...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该 作者无竞争性财务利益。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作由美国国立卫生研究院(NIH)资助,资助编号为1U01CA235487。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
相关性计算器JAVAhttp://metscape.med.umich.edu/calculator.html
clusterNethttps://github.com/Karnovsky-Lab/clusterNet
CytoscapeCytoscapehttps://cytoscape.org/
FiligreeJAVAhttp://metscape.med.umich.edu/filigree.html
MetScapeCytoscapehttps://apps.cytoscape.org/apps/metscapeCytoscape 插件,支持相关性网络的构建与探索。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Sas, K. M., Karnovsky, A., Michailidis, G., Pennathur, S. Metabolomics and diabetes: analytical and computational approaches. Diabetes. 64 (3), 718-732 (2015).
  2. Cottret, L., et al. MetExplore: Collaborative edition and exploration of metabolic networks. Nucleic Acids Research. 46 (W1), W495-W502 (2018).
  3. Garcia-Alcalde, F., Garcia-Lopez, F., Dopazo, J., Conesa, A. Paintomics: A web based tool for the joint visualization of transcriptomics and metabolomics data. Bioinformatics. 27 (1), 137-139 (2011).
  4. Kuo, T. C., Tian, T. F., Tseng, Y. J. 3Omics: A web-based systems biology tool for analysis, integration and visualization of human transcriptomic, proteomic and metabolomic data. BMC Systems Biology. 7, 64(2013).
  5. Paley, S. M., Karp, P. D. The pathway tools cellular overview diagram and Omics Viewer. Nucleic Acids Research. 34 (13), 3771-3778 (2006).
  6. Karnovsky, A., et al. Metscape 2 bioinformatics tool for the analysis and visualization of metabolomics and gene expression data. Bioinformatics. 28 (3), 373-380 (2012).
  7. Chong, J., Xia, J. Using MetaboAnalyst 4.0 for metabolomics data analysis, interpretation, and integration with other omics data. Methods in Molecular Biology. 2104, 337-360 (2020).
  8. Lopez-Ibanez, J., Pazos, F., Chagoyen, M. MBROLE 2.0-functional enrichment of chemical compounds. Nucleic Acids Research. 44 (W1), W201-W204 (2016).
  9. Cavalcante, R. G., et al. Broad-Enrich: Functional interpretation of large sets of broad genomic regions. Bioinformatics. 30 (17), i393-i400 (2014).
  10. Huang, D. W., et al. DAVID bioinformatics resources: Expanded annotation database and novel algorithms to better extract biology from large gene lists. Nucleic Acids Research. 35 (Web Server issue), W169-W175 (2007).
  11. Lee, P. H., O'Dushlaine, C., Thomas, B., Purcell, S. M. INRICH: interval-based enrichment analysis for genome-wide association studies. Bioinformatics. 28 (13), 1797-1799 (2012).
  12. Segre, A. V., Groop, L., Mootha, V. K., Daly, M. J., Altshuler, D. Common inherited variation in mitochondrial genes is not enriched for associations with type 2 diabetes or related glycemic traits. PLoS Genetics. 6 (8), e1001058(2010).
  13. Subramanian, A., et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proceedings of the National Academy of Sciences of the United States of America. 102 (43), 15545-15550 (2005).
  14. Afshinnia, F., et al. Lipidomic signature of progression of chronic kidney disease in the chronic renal insufficiency cohort. Kidney International Reports. 1 (4), 256-268 (2016).
  15. Barupal, D. K., et al. MetaMapp: Mapping and visualizing metabolomic data by integrating information from biochemical pathways and chemical and mass spectral similarity. BMC Bioinformatics. 13, 99(2012).
  16. Basu, S., et al. Sparse network modeling and Metscape-based visualization methods for the analysis of large-scale metabolomics data. Bioinformatics. 33 (10), 1545-1553 (2017).
  17. Krumsiek, J., Suhre, K., Illig, T., Adamski, J., Theis, F. J. Gaussian graphical modeling reconstructs pathway reactions from high-throughput metabolomics data. BMC Systems Biology. 5, 21(2011).
  18. Camacho, D., de la Fuente, A., Mendes, P. The origin of correlations in metabolomics data. Metabolomics. 1 (1), 53-63 (2005).
  19. Steuer, R., Kurths, J., Fiehn, O., Weckwerth, W. Observing and interpreting correlations in metabolomic networks. Bioinformatics. 19 (8), 1019-1026 (2003).
  20. Bühlmann, P., Van De Geer, S. Statistics for High-Dimensional Data: Methods, Theory and Applications. , Springer Berlin, Heidelberg. (2011).
  21. Iyer, G. R., et al. Application of differential network enrichment analysis for deciphering metabolic alterations. Metabolites. 10 (12), 479(2020).
  22. Ma, J., et al. Differential network enrichment analysis reveals novel lipid pathways in chronic kidney disease. Bioinformatics. 35 (18), 3441-3452 (2019).
  23. Shannon, P., et al. Cytoscape: a software environment for integrated models of biomolecular interaction networks. Genome Reserach. 13 (11), 2498-2504 (2003).
  24. Krumsiek, J., et al. Mining the unknown: a systems approach to metabolite identification combining genetic and metabolic information. PLoS Genetics. 8 (10), e1003005(2012).
  25. Fahrmann, J., et al. Systemic alterations in the metabolome of diabetic NOD mice delineate increased oxidative stress accompanied by reduced inflammation and hypertriglyceremia. American Journal of Physiology. Endocrinology and Metabolism. 308 (11), E978-E989 (2015).
  26. Grapov, D., et al. Diabetes associated metabolomic perturbations in NOD mice. Metabolomics. 11 (2), 425-437 (2015).
  27. Jin, Y., Bai, S., Huang, Z., You, L., Zhang, T. Technology characteristics and flavor changes of traditional green wheat product nian zhuan in Northern China. Frontiers in Nutrition. 9, 996337(2022).
  28. Lin, Y. S., et al. Probing folate-responsive and stage-sensitive metabolomics and transcriptional co-expression network markers to predict prognosis of non-small cell lung cancer patients. Nutrients. 15 (1), 3(2022).
  29. Pan, C., et al. Metabolomics study identified bile acids as potential biomarkers for gastric cancer: A case control study. Frontiers in Endocrinology (Lausanne). 13, 1039786(2022).
  30. Pancoro, A., Karima, E., Apriyanto, A., Effendi, Y. (1)H NMR metabolomics analysis of oil palm stem tissue infected by Ganoderma boninense based on field severity Indices. Scientific Reports. 12 (1), 21087(2022).
  31. Chele, K. H., et al. A global metabolic map defines the effects of a Si-based biostimulant on tomato plants under normal and saline conditions. Metabolites. 11 (12), 820(2021).
  32. Hubert, J., et al. The effect of residual pesticide application on microbiomes of the storage mite Tyrophagus putrescentiae. Microbial Ecology. 85 (4), 1527-1540 (2023).
  33. Li, K., et al. Metabolomic and exposomic biomarkers of risk of future neurodevelopmental delay in human milk. Pediatric Research. 93 (6), 1710-1720 (2023).
  34. Marino, C., et al. The metabolomic profile in amyotrophic lateral sclerosis changes according to the progression of the disease: An exploratory study. Metabolites. 12 (9), 837(2022).
  35. Ma, J., Shojaie, A., Michailidis, G. Network-based pathway enrichment analysis with incomplete network information. Bioinformatics. 32 (20), 3165-3174 (2016).
  36. Mahieu, N. G., Patti, G. J. Systems-level annotation of a metabolomics data set reduces 25000 features to fewer than 1000 unique metabolites. Analytical Chemistry. 89 (19), 10397-10406 (2017).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章