需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于FDR控制的非靶向代谢组学鉴定与定量一体化工作流程

3.3K 次观看

DOI:

10.3791/63625

2022年9月20日

* These authors contributed equally

本文内容

摘要

我们构建了一个整合了XY-Meta和metaX的非靶向代谢组学工作流程。在本方案中,我们展示了如何使用XY-Meta从开放获取的谱图参考数据库中生成诱饵谱图库,随后进行错误发现率(FDR)控制,并在完成代谢组学谱图鉴定后,利用metaX对代谢物进行定量分析。

摘要

近年来,非靶向代谢组学技术被广泛应用。然而,日益提高的通量和不断增加的样本数量产生了海量的谱图数据,给质谱数据的质量控制带来了巨大挑战。为了减少假阳性结果,必须进行错误发现率(FDR)质量控制。最近,我们开发了一款基于“目标-诱饵”(Target-Decoy)策略、名为 XY-Meta 的软件,用于非靶向代谢组鉴定中的 FDR 控制。在此,我们展示了一个完整的分析流程,将 XY-Meta 与 metaX 集成使用。本实验方案详细说明了如何利用 XY-Meta 从现有参考数据库生成诱饵数据库,并在开放获取数据集上应用目标-诱饵策略对大规模代谢组鉴定结果进行 FDR 控制。在使用 metaX 完成代谢物峰的检测与定量后,进一步开展了差异分析和代谢物注释。为了帮助更多研究人员,我们还开发了一个用户友好的基于云端的分析平台,无需具备生物信息学技能或任何编程语言基础即可完成上述分析。

引言

代谢物在生物过程中发挥着重要作用。代谢物通常是多种过程的调控因子,如能量转移、激素调节、神经递质调控、细胞间通讯以及蛋白质翻译后修饰等1,2,3,4。非靶向代谢组学可对大量代谢物提供全局性的视图5,6。随着质谱和色谱技术的进步,近年来代谢组MS/MS谱图的通量迅速增加7,8,9,10,11。为了从这些海量数据集中鉴定代谢物,已开发出多种注释软件11,例如MZmine12、MS-FINDER13、CFM-ID14、MetFrag15和SLAW16。然而,这些鉴定结果常包含大量假阳性。其原因包括:(1)MS/MS谱图中存在随机噪声,可能误导峰匹配;(2)同分异构体及碎片化能量的差异导致产生多种谱图指纹,从而增加了参考谱图库的规模;(3)参考谱图库的质量参差不齐。因此,建立构建高质量参考谱图库的合理标准十分必要。综上所述,在功能代谢组学研究中,对非靶向代谢组学实施系统的假发现率(FDR)控制至关重要7,8,9,17

经验贝叶斯方法和靶向-诱饵策略均从总体上解决了错误发现率(FDR)控制问题。Kerstin Scheubert 等人表明,在基于碎片树方法生成的诱饵数据库上应用靶向-诱饵策略是控制FDR的最佳方法9。Xusheng Wang 等人设计了一种基于化学中八隅体规则的诱饵生成方法,提高了FDR估计的准确性17。研究表明,使用谱图库生成诱饵数据库具有更优的性能表现18。本文中,我们改进了基于谱图库的方法,并开发了一款名为XY-Meta19的软件,可进一步提高FDR估计的精确度。该软件利用现有的参考谱图库生成诱饵库,用于在靶向-诱饵策略框架下进行FDR控制。XY-Meta支持其自身的谱图匹配和余弦相似性算法,允许采用常规搜索和迭代搜索模式。在FDR评估步骤中,支持靶向-诱饵合并模式和分离模式。为了提高灵活性,XY-Meta可接受外部诱饵库。

代谢物峰的检测与定量也是非靶向代谢组学分析的重要步骤。峰检测是代谢物鉴定的主要方法。通常,代谢物峰检测的准确性会受到多种因素的影响,例如质谱的噪声信号、代谢物丰度较低、污染物以及代谢物的降解产物20。当样本数量过大,或在非靶向代谢组学实验中更换了液相色谱柱时,可能会出现显著的批次效应,这是代谢物定量分析面临的主要挑战之一21,22,23。目前,XCMS24、Workflow4Metabolomic25、iMet-Q26 和 metaX19 等软件均可实现非靶向代谢组学的峰检测与定量分析,但我们建议 metaX 的分析流程更为完整且易于使用。本文中,我们以公开数据集 msv000084112 为例,演示如何使用 XY-Meta 进行代谢物鉴定与 FDR 控制,并使用 metaX 进行代谢物的峰检测与定量。该工作流程仅需包含两个组,每组至少两个样本。无论质谱仪平台、电离模式、电荷模式和样本类型如何,均需要提供 MS/MS 谱图数据,并支持基于样本的归一化和基于峰的归一化。通过本示例,研究人员可以便捷地开展代谢组学的鉴定与定量分析。使用该分析流程需要具备 R 编程能力。为帮助不具备任何编程基础的研究人员,我们还开发了一个用于代谢组学分析的云分析平台。该云分析平台的使用方法详见 补充材料5

访问受限。请登录或开始试用以查看此内容。

方案

1. 准备代谢组学数据集以进行分析

注意:本演示中使用的代谢组学数据集不含质控样本,需要提供病例组和对照组的数据。为便于演示,我们使用了 GNPS 数据库中的一个公开数据集27

  1. 访问网页 https://gnps.ucsd.edu/ProteoSAFe/static/gnps-splash.jsp,点击 浏览数据集
  2. 标题列中搜索关键词"msv000084112"。点击数据集编号以查看详细信息,并通过FTP下载该数据集。
  3. 将原始数据放入文件夹 /msv000084112。
    ​注:该数据集使用C18反相超高效液相色谱(RP-UHPLC)在Q Exactive平台上以正离子模式采集,代表一组尚未明确诊断的代谢性疾病的尿液样本数据,包括33个健康人样本、12个空白样本、2个混合样本和82个患者样本28补充材料8)。为演示本工作流程,我们随机选取6个健康人样本(NH)作为对照组,以及6个患病样本(NT)作为病例组进行流程操作。

2. 数据格式转换

注意:如果数据集是质谱仪直接生成的原始数据,通常为 .raw、.wiff 或 .cdf 格式,应将其转换为 mzXML 和 mgf 格式。本文使用 ProteoWizard29 软件包中的 msconvert 工具进行格式转换。

  1. 从 https://proteowizard.sourceforge.io/download.html 下载 ProteoWizard 并进行安装。
  2. 在 ProteoWizard 安装路径下使用 msconvert.exe 转换数据格式。
    1. 将原始数据转换为 mzXML 格式,并存储到 /mzXML 文件夹中:/msconvert.exe /raw/*.raw -o /raw/mzXML/ --filter "peakPicking true [1,2]" --filter "zeroSamples removeExtra" --mzML --zlib --mz64 --filter "msLevel 1-2" --filter "titleMaker <RunId>.<ScanNumber>.<ScanNumber>. <ChargeState>"。
    2. 将 raw/mzXML 数据转换为 mgf 格式,并存储到 /mgf 文件夹中:/msconvert.exe /msv000084112/*.raw -o /msv000084112/mgf/ --filter "peakPicking true [1,2]" --filter "zeroSamples removeExtra" --mgf --mz64 --filter "msLevel 1-2" --filter "titleMaker <RunId>.<ScanNumber>.<ScanNumber>. <ChargeState>"。

3. 准备代谢物的参考谱库

注意:XY-meta 仅支持 mgf 格式的参考谱库。

  1. 访问网页 https://gnps.ucsd.edu/ProteoSAFe/libraries.jsp,搜索关键词“NIST”以查找对应条目。点击 查看以获取详细信息并下载该谱库。
    注意:GNPS公共谱库收集了多种代谢物谱库,并按类型、来源、物种和采集模式进行分类。尽管其中仅有少量谱库是使用标准物质生成的,但对于大多数基础研究而言,这些数据通常已足够使用。
  2. 将下载的谱库文件 GNPS-NIST14-MATCHES.mgf 放入 /database 文件夹中。

4. 代谢物鉴定与假发现率控制

  1. 下载 XY-meta(Windows 版本)。在 /XY-Meta-Win/config/ 文件夹下找到参数配置文件 parameter.default,根据补充材料 1修改其内容。
    注意:在溶液中,代谢物常与阴离子或阳离子形成加合物,导致母离子质量发生偏移。因此,必须设置加合物类型。我们在 /adduct 文件夹中提供了正离子模式和负离子模式下离子交换柱及反相分析柱对应的加合物列表。用户也可根据研究项目自行编辑加合物列表,加合物列表应与所提供的格式一致。
  2. 使用 XY-Meta 进行代谢物鉴定和 FDR 控制:XY-Meta.exe -S /XY-Meta-Win/config/parameter.default -D /msv000084112/ pos_wt-1_a.mgf -R /database/GNPS-NIST14-MATCHES.mgf。
    ​注意:XY-Meta 不支持参数中的通配符。因此,每个 mgf 文件需使用单独的命令进行处理。若文件数量较多,建议使用批处理文件。

5. 差异分析

注意:metaX 是一个开源的 R 软件包。请根据 https://github.com/wenbostar/metaX 上的指南进行安装。本分析需要 8GB 内存。

  1. 编辑 sampleList.txt 文件,指定样本及其对应的质谱数据。请参考补充材料2
    注意:metaX 支持包含质控(QC)样本的数据集的定量分析。使用 QC 样本时,请将 QC 样本的 class 属性修改为 NA。
  2. 创建 /output 文件夹以存储定量分析结果。使用 R 运行补充材料3中的脚本,利用 metaX 对 MOCK 和 WT 组进行定量分析。
    ​注意:在运行补充材料3中的脚本之前,请将脚本中的路径修改为实际的本地路径。

6. 定性结果与定量结果的整合

  1. 运行补充材料4中的R脚本,利用代谢物鉴定结果对定性与定量分析中的峰进行注释。
    注意:在运行补充材料4中的脚本之前,请先将脚本中的路径修改为您的实际本地路径。

访问受限。请登录或开始试用以查看此内容。

结果

msv000084112 的原始数据通过 msconvert.exe 转换并生成了 mgf 文件(补充材料 S6)。

XY-Meta 在 /database 文件夹下生成了 GNPS-NIST14-MATCHES_Decoy.mgf 文件。该文件是由原始参考谱图库 GNPS-NIST14-MATCHES.mgf 生成的诱饵谱图库。此诱饵谱图库可重复使用。当重复使用该诱饵谱图库时,用户应在 parameter.default 文件中将 decoy_pattern 参数设置为 1,并将 decoyinput 设置为该诱饵谱图库的绝对路径。鉴定结果生成于 /mgf 文件夹下(文件后缀为 .meta),其中包含谱图匹配得分、错误发现率(FDR)、代谢物的 m/z 值、保留时间以及代谢物名称(补充材料 7)。

通过metaX进行的定量分析结果位于/output文件夹中。NH和NT的总体定量分布相似,均值波动较小(图1A

访问受限。请登录或开始试用以查看此内容。

讨论

对非靶向代谢物的错误发现率(FDR)控制一直是一个重大挑战。本文展示了一套完整的、可实现FDR控制的大规模非靶向代谢组学分析流程(包括定性和定量分析),可有效减少质谱分析中常见的假阳性结果。

为您的研究准备合适的参考谱图库至关重要。成功的、高灵敏度的串联质谱(MS/MS)鉴定不仅依赖于恰当的匹配算法,还需要高质量的参考谱图库。公共谱图库的应用受到以下因素的限制:(1)许多公共谱图库未包含完整的代谢物列表;(2)公共谱图库中的谱图来源于不同的质谱仪器和/或不同的碎裂条件30,31。因此,我们建议您使用标准代谢物,在相同的仪器和相同的碎裂条件下采集谱图,以构建一个"专属"谱图库,并在实际检测过程中保持这些条件一致。此外,在修改参数文件时,前体离子和碎片离子的容差应与仪器参数相匹配。通常情况下,前体离子容差范围应设置在10 ppm至20 ppm之间,碎片离子容差应设置在0.01 Da至0.5 Da之间。对于本数据集,仪器参数未知,但将碎片离子容差设为0.0...

访问受限。请登录或开始试用以查看此内容。

致谢

本工作由国家重点研发计划(2018YFC0910200/2017YFA0505001)和广东省重点研发计划资助&D 计划 (2019B020226001)

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
GNPS开源https://gnps.ucsd.edu/ProteoSAFe/static/gnps-splash.jsp
XY-Meta开源https://github.com/DLI-ShenZhen/XY-Meta
metaX开源https://github.com/wenbostar/metaX
ProteoWizard免费下载3.0.22116.18c918b-x86_64https://proteowizard.sourceforge.io/download.html
CHI.Client免费下载ndp48-x86-x64-allos-enuhttp://www.chi-biotech.com/technology.html?ty=ypt

参考文献

  1. Misra, B. B., Fahrmann, J. F., Grapov, D. Review of emerging metabolomic tools and resources: 2015-2016. Electrophoresis. 38 (18), 2257-2274 (2017).
  2. Idle, J. R., Gonzalez, F. J. Metabolomics. Cell Metabolism. 6 (5), 348-351 (2007).
  3. Fiehn, O. Metabolomics — the link between genotypes and phenotypes. Functional Genomics. Town, C. , Springer. Netherlands. Dordrecht. 155-171 (2002).
  4. Functional Genomics. Town, C. , Springer. Netherlands. Dordrecht. (2002).
  5. Dettmer, K., Aronov, P. A., Hammock, B. D. Mass spectrometry-based metabolomics. Mass Spectrometry Reviews. 26 (1), 51-78 (2007).
  6. Vinayavekhin, N., Saghatelian, A. Untargeted metabolomics. Current Protocols in Molecular Biology. , Chapter 30, Unit 30.1 1-24 (2010).
  7. Chaleckis, R., Meister, I., Zhang, P., Wheelock, C. E. Challenges, progress and promises of metabolite annotation for LC-MS-based metabolomics. Current Opinion in Biotechnology. 55, 44-50 (2019).
  8. Palmer, A., et al. FDR-controlled metabolite annotation for high-resolution imaging mass spectrometry. Nature Methods. 14 (1), 57-60 (2017).
  9. Scheubert, K., et al. Significance estimation for large scale metabolomics annotations by spectral matching. Nature Communications. 8 (1), 1494(2017).
  10. Schrimpe-Rutledge, A. C., Codreanu, S. G., Sherrod, S. D., McLean, J. A. Untargeted metabolomics strategies-challenges and emerging directions. Journal of the American Society for Mass Spectrometry. 27 (12), 1897-1905 (2016).
  11. Blaženović, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), (2018).
  12. Katajamaa, M., Miettinen, J., Oresic, M. MZmine: toolbox for processing and visualization of mass spectrometry based molecular profile data. Bioinformatics. 22 (5), Oxford, England. 634-636 (2006).
  13. Tsugawa, H., et al. Hydrogen rearrangement rules: computational MS/MS fragmentation and structure elucidation using MS-FINDER software. Analytical chemistry. 88 (16), 7946-7958 (2016).
  14. Wang, F., et al. CFM-ID 4.0: More accurate ESI-MS/MS spectral prediction and compound identification. Analytical Chemistry. 93 (34), 11692-11700 (2021).
  15. Ruttkies, C., Schymanski, E. L., Wolf, S., Hollender, J., Neumann, S. MetFrag relaunched: incorporating strategies beyond in silico fragmentation. Journal of Cheminformatics. 8, 3(2016).
  16. Delabriere, A., Warmer, P., Brennsteiner, V., Zamboni, N. SLAW: A scalable and self-optimizing processing workflow for untargeted LC-MS. Analytical chemistry. 93 (45), 15024-15032 (2021).
  17. Wang, X., et al. Target-decoy-based false discovery rate estimation for large-scale metabolite identification. Journal of Proteome Research. 17 (7), 2328-2334 (2018).
  18. Li, D., et al. XY-Meta: a high-efficiency search engine for large-scale metabolome annotation with accurate FDR estimation. Analytical Chemistry. 92 (8), 5701-5707 (2020).
  19. Wen, B., Mei, Z., Zeng, C., Liu, S. metaX: a flexible and comprehensive software for processing metabolomics data. BMC Bioinformatics. 18 (1), 183(2017).
  20. Aberg, K. M., Torgrip, R. J. O., Kolmert, J., Schuppe-Koistinen, I., Lindberg, J. Feature detection and alignment of hyphenated chromatographic-mass spectrometric data. Extraction of pure ion chromatograms using Kalman tracking. Journal of Chromatography. A. 1192 (1), 139-146 (2008).
  21. Liu, Q., et al. Addressing the batch effect issue for LC/MS metabolomics data in data preprocessing. Scientific Reports. 10 (1), 13856(2020).
  22. Han, W., Li, L. Evaluating and minimizing batch effects in metabolomics. Mass Spectrometry Reviews. 41 (3), 421-442 (2022).
  23. Fei, F., Bowdish, D. M. E., McCarry, B. E. Comprehensive and simultaneous coverage of lipid and polar metabolites for endogenous cellular metabolomics using HILIC-TOF-MS. Analytical and Bioanalytical Chemistry. 406 (15), 3723-3733 (2014).
  24. Smith, C. A., Want, E. J., O'Maille, G., Abagyan, R., Siuzdak, G. XCMS: processing mass spectrometry data for metabolite profiling using nonlinear peak alignment, matching, and identification. Analytical Chemistry. 78 (3), 779-787 (2006).
  25. Giacomoni, F., et al. Workflow4Metabolomics: a collaborative research infrastructure for computational metabolomics. Bioinformatics. 31 (9), Oxford, England. 1493-1495 (2015).
  26. Chang, H. -Y., et al. iMet-Q: A user-friendly tool for label-free metabolomics quantitation using dynamic peak-width determination. PloS One. 11 (1), 0146112(2016).
  27. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nature Biotechnology. 34 (8), 828-837 (2016).
  28. Schmid, R., et al. Ion identity molecular networking for mass spectrometry-based metabolomics in the GNPS environment. Nature Communications. 12 (1), 3832(2021).
  29. Kessner, D., Chambers, M., Burke, R., Agus, D., Mallick, P. ProteoWizard: open source software for rapid proteomics tools development. Bioinformatics. 24 (21), Oxford, England. 2534-2536 (2008).
  30. Johnson, S. R., Lange, B. M. Open-access metabolomics databases for natural product research: present capabilities and future potential. Frontiers in Bioengineering and Biotechnology. 3, 22(2015).
  31. Horai, H., et al. MassBank: a public repository for sharing mass spectral data for life sciences. Journal of Mass Spectrometry: JMS. 45 (7), 703-714 (2010).
  32. Rawlinson, C., et al. Hierarchical clustering of MS/MS spectra from the firefly metabolome identifies new lucibufagin compounds. Scientific Reports. 10 (1), 6043(2020).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签