本文建立并描述了一种由质谱引导的基因组挖掘方案。该方案基于基因组序列信息和液相色谱-串联质谱(LC-MS/MS)分析,旨在促进从复杂的微生物和植物提取物中鉴定分子。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文建立并描述了一种由质谱引导的基因组挖掘方案。该方案基于基因组序列信息和液相色谱-串联质谱(LC-MS/MS)分析,旨在促进从复杂的微生物和植物提取物中鉴定分子。
天然产物所涵盖的化学空间极为广阔,且在很大程度上尚未被充分认识。因此,亟需便捷的方法来广泛评估其在自然界中的功能以及对人类潜在的益处(例如在药物发现中的应用)。本实验方案描述了基因组挖掘(GM)与分子网络(MN)相结合的方法,这两种现代技术可将全基因组测序中基因簇编码的注释信息与粗制代谢提取物中的化学结构特征相匹配,这是发现新型天然产物的第一步。本文将这两种方法的联合应用定义为质谱引导的基因组挖掘(MS-guided genome mining)。在该方法中,主要成分先前已通过分子网络(MN)确定,而结构相关的新候选分子则通过基因组挖掘(GM)与基因组序列注释相关联。结合基因组挖掘与分子网络是一种高效的策略,可用于靶向发现新分子骨架,或获取代谢谱以从已知化合物中鉴定出类似物。
次级代谢研究通常包括对粗提物进行特定生物活性的筛选,随后对活性组分中的化合物进行纯化、鉴定和表征。这一流程已被证明是高效的,促进了多种化学实体的分离。然而,如今这种方法被认为难以持续,主要原因是重复发现率过高。在制药工业发展的初期,由于缺乏对特化代谢物功能和作用机制的认识,其鉴定工作是在无法真实反映自然环境的实验室条件下进行的1。如今,人们对自然环境中信号调控、分泌机制以及大多数靶标分子在极低浓度下(难以检测)的存在状态有了更深入的理解。此外,对这些过程的调控将有助于学术界和制药行业充分利用这一知识,并推动与沉默生物合成基因簇(BGCs)相关的代谢物直接分离研究的发展2。
在此背景下,基因组测序技术的进步重新激发了人们对微生物代谢产物筛选的兴趣。这是因为分析尚未被揭示的生物合成基因簇的基因组信息,可以发现编码在实验室条件下未被观察到或未被产生的新型化合物的基因。如今已有大量微生物全基因组项目或草图可供利用,且数量逐年增长,为通过基因组挖掘发现新型生物活性分子提供了广阔前景3,4。
生物合成基因簇图谱(Atlas of Biosynthetic Gene Clusters)是联合基因组研究所综合微生物基因组平台(JGI IMG-ABC)中目前规模最大的自动挖掘基因簇集合2。最近,生物合成基因簇最小信息标准(Minimum Information for Biosynthetic Gene Clusters,MIBiG)标准化倡议推动了对生物合成基因簇(BGCs)的手动重新注释,提供了一个高度审编的参考数据集5。如今,已有大量工具可用于实现遗传数据的计算挖掘及其与已知次级代谢产物的关联分析。此外,研究人员已开发出多种策略以发现新的生物活性天然产物(例如异源表达、靶基因敲除、体外重建、基因组测序、同位素引导筛选[基因组-同位素联合方法]、局部及全局调控因子的调控、基于抗性靶标的挖掘、非培养依赖型挖掘,以及近年来兴起的质谱引导/编码方法2,6,7,8,9,10,11,12,13,14,15)。
作为一种单一策略,基因组挖掘需要投入大量工作来注释单个或少数几个分子,因此在新化合物的分离和结构解析优先级确定过程中仍存在空白。原则上,这些方法每次实验仅针对一条生物合成途径,导致发现速率较慢。从这一角度来看,将基因组挖掘(GM)与分子网络分析方法相结合,代表了天然产物研究领域的重要进展14,15。
液相色谱-质谱联用技术(LC-MS)因其多功能性、高准确性和高灵敏度,成为化合物鉴定的理想方法。目前,多个平台已开发并集成了用于非靶向代谢组学的算法和软件套件。16,17,18,19,20这些程序的核心包括特征检测(峰提取)21 峰对齐,可在一批样品中匹配相同的特征并搜索模式。基于质谱模式的算法22,23 比较特征性碎裂模式并匹配质谱2 通过生成具有结构特征的分子家族来揭示相似性。这些特征可被突出并聚类,从而赋予研究人员利用串联质谱技术从复杂的生物提取物中快速发现已知和未知分子的能力。2,24,25因此,串联质谱是一种多功能方法,可同时从大量数据中获取多种化学类型的结构信息。
全球天然产物社会分子网络(Global Natural Products Social Molecular Networking, GNPS)26 算法利用归一化的碎片离子强度构建多维向量,并通过余弦函数比较其相似性。不同母离子之间的关系以图示形式呈现,其中每个碎片化谱图被可视化为一个节点(圆形),而各节点之间的关联性由边(线条)定义。来自单一来源的分子的全局可视化被称为分子网络。结构差异较大的分子若具有独特的碎裂模式,将形成各自特有的簇或星群,而结构相关的分子则会聚集在一起。对化学类型进行聚类分析,有助于假定地将相似的结构特征与其生物合成起源相关联。
将化学型到基因型和基因型到化学型两种方法相结合,在建立生物合成基因簇(BGCs)与其小分子产物之间的生物信息学关联时具有强大优势27因此,质谱引导的基因组挖掘是一种快速且消耗材料少的方法,有助于在不同代谢和环境条件下,通过一种或多种菌株的全基因组测序将母离子与生物合成途径关联起来。
本实验方案的工作流程(图1)包括将全基因组测序数据(WGS)输入生物合成基因簇注释平台(如antiSMASH28,29,30),以评估基因组所编码的化合物种类及其化合物类别。需采用一种策略,靶向编码目标化学实体的生物合成基因簇,并可利用GNPS26,31对野生型菌株和/或含有该生物合成基因簇(BGC)的异源表达菌株的培养提取物进行分析,基于相似性对离子进行聚类。由此可鉴定出与目标BGC相关、但在数据库中尚未收录的新分子(主要是未知类似物,有时产量较低)。值得注意的是,用户可为这些平台贡献数据,且随着生物信息学与串联质谱(MS/MS)数据的迅速积累,推动了高效计算工具与算法的持续发展与升级,从而更有效地将复杂提取物与分子关联起来。

图1:整个工作流程的概述。 图示为生物信息学分析、克隆以及分子网络分析步骤的示意图,这些步骤属于所描述的质谱引导基因组挖掘方法,用于鉴定新的代谢产物。请点击此处查看该图的放大版本。
本方案描述了一种快速且高效的流程,将基因组挖掘与分子网络分析相结合,作为天然产物发现流程的起点。尽管已有多种应用能够在一个网络中可视化质谱可检测分子的组成及其相互关系,但本文采用了其中几种方法来可视化结构相似的聚类分子。利用该策略,成功鉴定出在Streptomyces sp. CBMAI 2042 的代谢提取物中观察到的新型环缩肽类产物。在基因组挖掘的指导下,识别出编码缬氨霉素的完整生物合成基因簇,并将其克隆至生产菌株Streptomyces coelicolor M1146 中。最后,基于质谱模式的分子网络分析将质谱检测到的分子与负责其生物合成的生物合成基因簇(BGCs)相关联32。
访问受限。请登录或开始试用以查看此内容。
1. 生物合成基因簇的基因组挖掘

图 2:antiSMASH 平台的输出结果。 基于全基因组序列注释的次级代谢途径的生物信息学分析。 请点击此处查看该图的放大版本。
2. 来自ESAC文库的整个生物合成基因簇的异源表达
3. 链霉菌/大肠杆菌 接合转化
4. 菌株培养
5. 质谱数据采集及GNPS分析前准备

图 3:使用 MsConvert 将质谱文件转换为 mzXML 扩展名。 图中显示了用于 GNPS 分析的正确参数。操作步骤如下:在框 1 中添加所有质谱文件,并在框 2 中添加峰提取滤波器;对于此滤波器,请使用厂商算法;点击开始,随后将执行转换过程。请点击此处查看该图的放大版本。
6. GNPS 分析

图 4:使用在线 GNPS 平台进行分子网络分析。 通过点击区域 1 完成 mzXML 文件的选择。在弹出的对话框中,可以从个人文件夹(区域 2)中选择文件,或在第二个标签页中使用拖放式文件上传器上传文件(小于 20 MB)。文件最多可分组为六组。 请点击此处查看此图的放大版本。

图5:使用GNPS进行分子网络分析(高级选项)。 最小配对余弦值(Min Pair Cos)将直接影响聚类的大小,较高的值会导致密切相关化合物被合并,而较低的值则会使远缘相关化合物被合并。应避免使用过低的数值。最小匹配碎片离子数表示两个碎片谱图在网络中连接所需共享的碎片数量。这两个参数共同决定了网络的结构:数值越低,越倾向于将远缘相关的化合物聚为一类,反之亦然。合理设置这些参数将极大有助于化合物的解析。请点击此处查看该图的放大版本。
7. GNPS 结果分析

图6:使用GNPS可视化分子网络结果。 所有相关的化合物簇可在“谱图家族”视图中查看(红框)。若仅可视化文库匹配结果,应选择“查看所有文库匹配”(蓝框)。为了更佳地图形化展示分子网络结果,应下载“直接Cytoscape预览”(黄框),并使用最新版本的Cytoscape软件。请点击此处查看此图的放大版本。

图 7:使用 GNPS 可视化分子聚类结果。 打开分子聚类以获得更好的数据可视化效果后,应选择以下选项:“Parent mass”作为节点标签(红色框);“DeltaMZ”作为边标签(黄色框);以及“Draw pies”作为节点着色(蓝色框)。浏览分子聚类图,并尝试注释所有节点。请点击此处查看该图的放大版本。
访问受限。请登录或开始试用以查看此内容。
本研究通过结合基因组挖掘、异源表达以及质谱引导/编码方法,成功实现了对新型缬氨霉素类似物分子的获取。目标分子缬氨霉素(VLM)的“从基因组到分子”工作流程如图8所示。Streptomyces sp. CBMAI 2042的基因组草图经计算机分析后,鉴定出VLM基因簇并将其转移至异源宿主中。异源表达菌株与野生型菌株在适当的发酵条件下进行三重复培养,经乙酸乙酯萃取并浓缩后获得粗提物。对产物进行MS/MS检测,以生成串联质谱代谢物谱图用于分子网络分析。图9展示了来自Streptomyces sp. CBMAI 2042粗提物的MS/MS数据所获得的聚类离子,其中特征性裂解模式及相应的质谱相似性提示存在具有共同结构特征的分子家族2。基于已知的生物合成逻辑和生物信息学分析,并结合基于模式的MS/MS谱图,解析了四种首次报道的环缩肽酯类化合物的结构,并将其来源关联至负责VLM组装的相同生物合成基因簇32
访问受限。请登录或开始试用以查看此内容。
该方案最主要的优点在于能够快速去除代谢谱中的重复信息,并将基因组信息与质谱数据相结合,从而阐明新分子的结构,特别是结构类似物2。基于基因组信息,可研究多种天然产物的化学类型,如聚酮类(PK)、非核糖体肽类(NRP)、糖基化天然产物(GNP)以及隐性生物合成基因簇(BGC)。代谢组学筛选可提供证据,显示特定菌株在实验室条件下激活的BGC谱型及其产生的化学多样性。因此,可通过分子网络分析发现的相似性,克隆相应的BGC以定向生产新化合物,或获得与已知BGC相关的未知类似物。该方法有助于区分天然来源中有价值的化合物,并可为天然产物研究流程中常见的后续分离步骤提供指导。
基于质谱的基因组挖掘最初在肽类基因组学41和糖类基因组学42领域被描述。为了评估肽类天然产物化学多样性的范围,Dorrestein 及其同事开发了一种自动化方法,结合质谱(MS)与基因组学,用于可视化已表达的天然产物(化学型)与其基因簇(基因型)之间的关联。随后,该基于质谱的基因组挖...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本研究的经费由圣保罗研究基金会 - FAPESP(项目编号:2019/10564-5、2014/12727-5 和 2014/50249-8,授予 L.G.O;项目编号:2013/12598-8 和 2015/01013-4,授予 R.S.;项目编号:2019/08853-9,授予 C.F.F.A)提供。B.S.P、C.F.F.A. 和 L.G.O. 获得了国家科学技术发展委员会 - CNPq 的博士后奖学金资助(项目编号:205729/2018-5、162191/2015-4 和 313492/2017-4)。L.G.O. 还感谢“女性参与科学计划”(2008 年巴西版)提供的项目资助。所有作者均感谢巴西高等教育人员改进协调办公室(CAPES)对巴西研究生项目的资助支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 乙腈 | Tedia | AA1120-048 | HPLC 级 |
| 琼脂 | Oxoid | LP0011 | NA |
| 阿普拉霉素 | Sigma Aldrich | A2024 | NA |
| 羧苄青霉素 | Sigma Aldrich | C9231 | NA |
| 离心机 | Eppendorf | NA | 5804 |
| 氯霉素 | Sigma Aldrich | C3175 | NA |
| C18 柱 | Agilent Technologies | NA | ZORBAX RRHD Extend-C18, 80Å, 2.1 x 50 mm, 1.8 µm, 1200 bar 压力上限 P/N 757700-902 |
| 卡那霉素 | Sigma Aldrich | K1377 | NA |
| 甘露醇 P.A.- A.C.S. | Synth | NA | NA |
| 微量离心机 | Eppendorf | NA | 5418 |
| 萘啶酸 | Sigma Aldrich | N4382 | NA |
| Phusion Flash 高保真 PCR 预混液 | ThermoFisher Scientific | F548S | NA |
| Q-TOF 质谱仪 | Agilent technologies | NA | 6550 iFunnel Q-TOF LC/MS |
| 蔗糖 P.A.- A.C.S. | Synth | NA | NA |
| 摇床/培养箱 | Marconi | MA420 | NA |
| 氯化钠 | Synth | NA | P. A. - ACS |
| 大豆提取物 | NA | NA | NA |
| 蔗糖 | Synth | NA | P. A. - ACS |
| 热循环仪 | Eppendorf | NA | Mastercycler Nexus Gradient |
| 硫链丝菌素 | Sigma Aldrich | T8902 | NA |
| 胰蛋白胨 | Oxoid | LP0042 | NA |
| 胰蛋白胨大豆肉汤 | Oxoid | CM0129 | NA |
| 超高效液相色谱 | Agilent Technologies | NA | 1290 Infinity LC 系统 |
| 酵母提取物 | Oxoid | LP0021 | NA |
访问受限。请登录或开始试用以查看此内容。