IDBac 是一个开源的基于质谱的生物信息学分析流程,可整合从细菌菌落刮取的细胞材料中获得的完整蛋白质和特化代谢物谱图数据。该流程能够帮助研究人员快速将数百至数千个细菌菌落归类到假定的分类群,并根据其特化代谢物的产生情况进一步区分。
IDBac 是一个开源的基于质谱的生物信息学分析流程,可整合从细菌菌落刮取的细胞材料中获得的完整蛋白质和特化代谢物谱图数据。该流程能够帮助研究人员快速将数百至数千个细菌菌落归类到假定的分类群,并根据其特化代谢物的产生情况进一步区分。
为了可视化在营养琼脂上生长的细菌菌落在系统发育与特化代谢产物产生之间的关系,我们开发了IDBac——一种低成本、高通量的基质辅助激光解吸/电离飞行时间质谱(MALDI-TOF MS)生物信息学分析流程。IDBac软件面向非专业用户设计,可免费获取,能够分析从少数到数千个细菌菌落的数据。本文介绍了用于MALDI-TOF MS分析的细菌菌落制备、质谱仪操作,以及在IDBac中进行数据处理与可视化的具体步骤。特别地,我们指导用户如何基于蛋白质质谱指纹图谱将细菌聚类为系统发育树,并利用特化代谢产物数据交互式构建代谢产物关联网络(Metabolite Association Networks, MANs)。
研究细菌功能的科研人员面临的一个主要障碍是,难以快速且同时评估微生物的分类学身份及其产生特化代谢物的能力。这阻碍了人们对从环境中分离出的大多数细菌中细菌系统发育与特化代谢物产生之间关系的深入理解。尽管已有大量研究详细描述了基于质谱(MS)的方法,利用蛋白质指纹对细菌进行分组和鉴定1,2,3,4,但这些研究通常仅针对少量分离株,并以物种特异性方式进行。更重要的是,关于特化代谢物产生的信息——这一驱动微生物环境功能的关键因素——在上述研究中尚未被整合。Silva 等人5最近系统回顾了基质辅助激光解吸电离飞行时间质谱(MALDI-TOF MS)在分析特化代谢物方面的应用不足,并指出现有生物信息学软件的匮乏导致了当前的分析瓶颈。为解决这些问题,我们开发了 IDBac,这是一种生物信息学分析流程,可整合 MALDI-TOF MS 的线性模式和反射模式6,使用户能够分别基于蛋白质和特化代谢物的质谱指纹,快速可视化并区分细菌分离株。
IDBac 具有成本效益高、通量高且专为非专业用户设计的特点。该工具可免费获取(chasemc.github.io/IDBac),仅需使用 MALDI-TOF 质谱仪(若进行特化代谢物分析,则需反射模式)。样品制备采用简单的“扩展直接转移”方法7,8,并在单个 MALDI 目标位点上连续进行线性模式和反射模式的数据采集。利用 IDBac,可在四小时内完成数百个菌落的假定系统发育关系及特化代谢物产生的分析,包括样品制备、数据采集和数据可视化全过程。相较于传统的细菌鉴定方法(如基因测序)以及代谢产物分析方法(如液相色谱-质谱联用 [LCMS] 及其他类似色谱技术),该方法在时间和成本上具有显著优势。
利用线性模式分析获得的数据,IDBac 采用层次聚类方法来表征蛋白质谱之间的相关性。由于这些质谱主要代表电离的核糖体蛋白质,因此能够反映样本中存在的系统发育多样性。此外,IDBac 还整合了反射模式数据,以代谢物关联网络(Metabolite Association Networks, MANs)的形式展示特化代谢物的指纹图谱。MANs 是一种二分网络,可直观展示不同细菌分离株之间共有和特有的代谢物产生情况。IDBac 平台允许研究人员同时或单独分析蛋白质和特化代谢物数据,即使仅获得其中一类数据亦可进行分析。重要的是,IDBac 可直接处理来自 Bruker 和 Xiamen 仪器的原始数据,以及 txt、tab、csv、mzXML 和 mzML 格式的数据。这消除了手动转换和格式化数据集的需要,显著降低了用户操作错误或误处理质谱数据的风险。
1. 基质辅助激光解吸电离基质的制备
2. 基质辅助激光解吸电离靶板的制备
注意:详见 Sauer 等人7 的研究。

图1:MALDI靶板,显示添加甲酸和MALDI基质前的两种不同分离株(上方3个点位为Bacillus sp.;下方3个点位为Streptomyces sp.)。 对于两种菌株,第3列代表样本过量;第2列代表样本量适中;第1列代表样本量不足以进行MALDI分析。请点击此处查看该图的放大版本。
3. 数据采集
注意:数据采集的一般参数列于表1中。
| 参数 | 蛋白质 | 特化代谢物 |
| 起始质量 (Da) | 1920 | 60 |
| 终止质量 (Da) | 21000 | 2700 |
| 质量偏转 (Da) | 1900 | 50 |
| 激光脉冲次数 | 500 | 1000 |
| 频率 (Hz) | 2000 | 2000 |
| 激光光斑大小 | 大 | 中 |
| 最大标准偏差 (ppm) | 300 | 30 |
表1.

图2: 示例蛋白质谱图,显示调节激光功率和检测器增益的影响。 图中A面板的谱图质量最佳,随着参数调整,质量逐渐下降,至C和D面板时谱图质量已不足。尽管B面板中的谱图仍可能产生可用的峰信号,但A面板展示了最优的数据质量。请点击此处查看该图的放大版本。

图3: 示例性次级代谢物光谱,显示激光功率和检测器增益调整对光谱质量的影响。 光谱质量在图A中最佳,逐渐下降至图C和D时已不足以满足分析要求。尽管图B中的光谱可能仍能产生可用的峰信号,但图A展示了最优的数据质量。请点击此处查看该图的放大版本。
4. 清洁MALDI靶板(改编自Sauer等7)
5. 安装 IDBac 软件
6. 从原始数据开始
注意:每个数据处理步骤的详细说明和操作指南均已嵌入 IDBac 中,但主要分析步骤和交互式输入内容如下所述。

图4:IDBac 数据转换与预处理步骤。 IDBac 将原始质谱数据转换为开放的 mzML 格式,并将 mzML 文件、峰列表及样品信息存储于每个实验对应的数据库中。请点击此处查看该图的放大版本。
7. 与先前实验结合开展工作

图5:“使用先前实验”页面。 使用 IDBac 的“使用先前实验”页面来选择要分析或修改的实验。请点击此处查看此图的放大版本。

图6:输入样本信息。在“使用先前实验”页面中,用户可以输入有关样本的信息,例如分类学身份、采集地点、分离条件等。请点击此处查看此图的放大版本。

图7:数据转移。“与先前实验协作”页面提供了在已有实验之间以及向新实验转移数据的选项。请点击此处查看该图的放大版本。
8. 设置蛋白质数据分析并创建镜像图

图8:选择如何保留峰用于分析。选择要分析的实验后,进入“蛋白质数据分析”页面,随后打开“选择如何保留峰用于分析”菜单,用户可设置用于保留峰的信噪比等参数。显示的镜像图(或树状图)将自动更新以反映所选设置。请点击此处查看该图的放大版本。
9. 使用蛋白质数据对样本进行聚类

图9:从选定的实验中选择样本,以包含在显示的系统发育树中。 请点击此处查看该图的放大版本。
10. 自定义蛋白质树状图

图10: 调整树状图。IDBac 提供了若干选项用于修改树状图的显示方式,这些选项位于“调整树状图”菜单中。其中包括根据 k-means 聚类结果对分支和标签进行着色,或根据用户指定的高度“切割”树状图。请点击此处查看该图的放大版本。

图11:整合样本信息。在“调整树状图”菜单中,包含“整合样本信息”选项。选择此选项后,可在树状图旁绘制样本相关信息。样本信息需在“使用先前实验”页面中输入。请点击此处查看该图的放大版本。
11. 将来自独立实验的样本插入到系统发育树中

图12:从另一实验插入样本菜单。 有时比较来自其他实验的样本会有所帮助。使用“从另一实验插入样本”菜单选择要包含在当前显示的树状图中的样本。请点击此处查看该图的放大版本。
12. 分析特化代谢物数据及代谢物关联网络(MANs)

图13:小分子数据分析页面。 如果由蛋白质谱图生成了树状图,则该树状图将显示在“小分子数据分析”页面中。此页面还将显示小分子数据的代谢物关联网络(MANs)和主成分分析(PCA)。请点击此处查看此图的放大版本。
13. 共享数据
我们分析了6株Micromonospora chokoriensis和2株Bacillus subtilis,这些菌株此前已有表征6,所用数据来自DOI: 10.5281/zenodo.2574096。根据从原始数据开始标签页中的说明,我们选择单击此处转换Bruker文件选项,并按照IDBac提供的每套数据的说明进行操作(图14)。
在完成自动化转换及预处理/峰提取步骤后,我们通过将两个实验中的样本合并至一个新实验中,创建了一个新的联合 IDBac 实验,该实验同时包含 Bacillus 和 Micromonosopora 样本(图15)。随后的分析使用镜像图对蛋白质谱进行比较,如 图16 所示,该方法有助于评估谱图质量并调整峰提取参数。图17 展示了采用默认设置时蛋白质聚类结果的截图。通过调整图中的阈值(以虚线表示),可对树状图进行着色。值得注意的是,不同属之间具有明显的分离,M. chokoriensis 和 B. subtilis 的分离株均各自聚为独立的类群。
图18、图19 和 图20 展示了通过在蛋白质系统发育树上点击并拖动,即可生成用户自选区域的代谢关联网络(MANs)。利用该方法,我们能够快速构建仅比较 B. subtilis 菌株的 MAN(图18)、仅比较 M. chokoriensis 菌株的 MAN(图19),以及同时比较所有菌株的 MAN(图20)。这些网络的主要功能是为研究人员提供细菌之间特化代谢产物重叠程度的宏观概览。有了这些数据,研究人员现在仅需从细菌菌落中刮取少量材料,即可做出科学合理的判断。

图14:质谱数据处理。 下载的Bruker autoFlex质谱数据使用IDBac进行转换和处理。请点击此处查看该图的放大版本。

图15:联合IDBac实验。 因为 小单孢菌属 和 芽孢杆菌属 在不同的MALDI靶板上采集了谱图后,将两个实验随后合并为一个单一实验——“Bacillus_Micromonsopora”。此操作在“处理先前实验”选项卡中完成,按照菜单中“将样本从先前实验转移至新/其他实验”的指示进行。 请点击此处以查看此图的放大版本。

图16:比较结果。Micromonospora 与 Bacillus 的质谱图通过“蛋白质数据分析”页面中的镜像图进行比对。最终选择了默认的峰检测参数。请点击此处查看该图的放大版本。

图17:层次聚类分析。 使用默认参数进行的层次聚类分析正确地将芽孢杆菌属(Bacillus)和小单孢菌属(Micromonospora)的分离株归为相应类群。树状图通过在任意高度“切割”树状结构(以虚线表示)进行着色,并采用100次自举法(bootstrap)分析以显示分支的置信度。请点击此处查看该图的高清版本。

图18:通过从蛋白质系统发育树中选择芽孢杆菌属(Bacillus sp.)菌株构建的分子相互作用网络(MAN)显示出特化代谢产物的差异性产生。请点击此处查看该图的放大版本

图19:通过从蛋白质系统发育树中选择六株 Micromonospora sp. 菌株构建的分子网络分析(MAN)显示其在特化代谢产物的产生上存在差异。 请点击此处查看该图的放大版本。

图20:Bacillus sp. 与 Micromonospora sp. 菌株的代谢物分析图(MAN),显示其特化代谢产物的差异性产生。 请点击此处查看该图的放大版本。
IDBac 方案详细描述了单个研究人员在 4 小时内对多达 384 株细菌分离物进行蛋白质和特化代谢物数据采集与分析的方法。使用 IDBac 时,无需从细菌分离物中提取 DNA,也无需从液体发酵培养基中制备特化代谢物提取物并通过色谱方法进行分析。相反,只需将细菌菌落的材料直接涂布到 MALDI 目标靶板上,即可获取蛋白质和特化代谢物数据。这大大降低了与 16S rRNA 基因测序和液相色谱-质谱联用(LCMS9)等传统技术相关的时间和成本。
在MALDI板上添加基质空白对照和校准点非常重要,我们建议使用适当数量的重复样本来确保结果的可重复性和统计学置信度。重复样本的数量需根据具体实验而定。例如,如果用户希望区分来自环境多样性平板集合中的数千个菌落,则可能需要较少的重复(本实验室每个菌落采集三个技术重复);相反,如果用户希望建立特定细菌分类单元菌株的自定义数据库,以快速确定未知分离株的亚种分类,则应采用更多的重复样本(本实验室每个菌株采集八个生物学重复)。
IDBac 是一种基于推定的分类学信息和特殊代谢物产生情况,用于快速区分高度相关细菌分离株的工具。该工具可作为正交方法的补充,或作为其前期步骤,这些正交方法包括深入的遗传分析、涉及代谢物产生与功能的研究,或通过核磁共振波谱法和/或液相色谱-串联质谱法(LC-MS/MS)对特殊代谢物结构进行表征。
特化代谢物的产生(IDBac MANs)极易受到细菌生长条件的影响,尤其是使用不同培养基时,这是该方法的一个潜在局限性。然而,用户可利用这一特性,因为IDBac能够快速生成MANs,以展示在不同生长条件下特化代谢物产生的差异。需要注意的是,尽管特化代谢物的指纹图谱可能随生长条件而变化,但我们此前已证明,蛋白质指纹图谱在这些变量下相对稳定(参见Clark等人的研究6)。在处理环境多样性平板时,我们建议在分析前对细菌分离株进行纯化,以减少邻近细菌间交叉对话可能带来的干扰。
最后,缺乏可搜索的蛋白质质谱指纹公共数据库,是利用该方法对未知环境细菌进行分类的主要短板。基于这一考虑,我们开发了IDBac,并实现了将数据自动转换为社区公认的开源格式(mzML)10,11,12,同时设计了支持检索、共享和自定义数据库创建的软件功能。目前,我们正在构建一个大型公共数据库(>10,000 株经全面表征的菌株),该数据库将能够实现部分分离株的种水平分类,并在可用时提供与GenBank登录号的链接。
IDBac 是开源的,其代码可供任何人根据自身的数据分析和可视化需求进行定制。我们建议用户参考大量相关文献(Sauer 等人7,Silva 等人5),以帮助支持和设计其实验目标。我们提供一个讨论论坛,地址为:https://groups.google.com/forum/#!forum/idbac,以及一个报告软件问题的途径,地址为:https://github.com/chasemc/IDBacApp/issues。
作者无任何利益冲突需要披露。
本工作得到了美国国家普通医学科学研究所资助项目 R01 GM125943、国家地理学会资助项目 CP-044R-17、冰岛研究基金资助项目 152336-051 以及伊利诺伊大学芝加哥分校启动资金的支持。此外,我们感谢以下贡献者:Amanda Bulman 博士在 MALDI-TOF MS 蛋白质采集参数方面的协助;Terry Moore 博士和 Atul Jain 博士在重结晶 α-氰基-4-羟基肉桂酸基质(CHCA)方面的工作。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 乙腈 | Fisher | 60-002-65 | LC-MS Ultra CHROMASOLV |
| Autoflex Speed LEF MALDI-TOF 仪器 | Bruker Daltonics | ||
| Bruker Daltonics 细菌检测标准品 | Fisher | NC0884024 | Bruker Daltonics 8604530 |
| Bruker 肽段校准标准品 | Fisher | NC9846988 | Bruker Daltonics 8206195 |
| 甲酸 | Fisher Chemical | A117-50 | 99.5+%,Optima LC/MS 级 |
| MALDI-TOF 靶板 | Bruker Daltonics | ||
| 甲醇 | Fisher Chemical | A456-500 | Optima LC/MS 级 |
| 牙签 | 任意品牌均可 | ||
| 三氟乙酸 | Fisher | AC293810010 | 99.5%,用于生化实验,ACROS Organics |
| 水 | VWR | 7732-18-5 | LC-MS |
| α-氰基-4-羟基肉桂酸 | Sigma | 28166-41-8 | (C2020-25G) ≥98% (TLC),粉末 |