方法文章

噬菌体表型组学:通过生理学方法表征新型病毒蛋白

13.2K 次观看

DOI:

10.3791/52854

2015年6月11日

本文内容

摘要

本文介绍了用于假定噬菌体基因功能表征的表型组学方法。技术包括一种可监测宿主合成代谢的改良检测方法——多表型检测平板(MAPs),以及能够测量对分解代谢影响的既定代谢组学方法。

摘要

目前对噬菌体-宿主相互作用的研究依赖于从(宏)基因组数据中推断信息。有趣的是,所有噬菌体序列中约有60%至95%与当前已注释的蛋白质无同源性。因此,大量噬菌体基因被注释为假想蛋白。这一现状严重影响了结构基因和辅助代谢基因的注释准确性。本文介绍了旨在捕捉特定宿主在表达某个未知噬菌体基因时所产生生理反应的表型组学方法。多表型检测板(MAPs)用于监测宿主底物利用的多样性及其后续的生物量形成,而代谢组学则通过监测代谢物的丰度与多样性来提供副产物分析。这两种工具同时使用,以获得与单个假定噬菌体开放阅读框(ORF)表达相关的表型特征。本文比较了两种方法的代表性结果,突出了携带假定结构基因或代谢基因的噬菌体宿主在表型特征上的差异。此外,还展示了支持实验分析的可视化技术以及高通量计算分析流程。

引言

据估计,感染细菌的病毒(又称噬菌体或噬菌体病毒)在全球范围内以超过1031个病毒样颗粒(VLPs)的形式存在,其数量超过环境中所有其他生物体的总和1,2。首个针对海洋环境相关病毒群落的宏基因组学研究聚焦于病毒组分中多样性的量化分析3。此外,Breitbart 及其同事发现,超过65%的病毒群落序列与公共数据库中任何已知序列均无同源性。后续的宏基因组研究也发现了类似证据:来自美国加利福尼亚州圣迭戈海域沉积物的宏基因组中含有75%未知病毒序列4;来自索尔顿海高盐湖泊的宏基因组中含有98%未知病毒序列5;而与珊瑚相关的宏基因组中则含有95–98%未知病毒序列6。这些大量未注释的信息积累使得噬菌体的遗传物质被称为“生物学宇宙中的暗物质”7

噬菌体的基因组表征依赖于通过与现有的核酸和蛋白质数据库进行比对,识别序列相似性。由于噬菌体编码的遗传信息大部分未知,基于同源性的方法效果有限。在其基因组中,噬菌体通常编码三类主要基因:转录与复制基因、代谢基因以及结构基因。转录与复制基因(I/II类基因8)包括聚合酶、引物酶、内切/外切核酸酶和激酶。这些基因因其在噬菌体感染过程中对转录和复制遗传物质的重要作用而高度保守。噬菌体聚合酶由于在全球范围内具有高度保守性,可通过传统的序列同源性方法 readily 被识别9,并已被证明可作为有效的系统发育标记10。相比之下,噬菌体的代谢基因和结构基因(II/III类基因8)差异性日益增大,常被注释为假想基因。

噬菌体的代谢基因会影响宿主的代谢能力,但不一定为病毒复制所必需。这些基因通常被称为辅助代谢基因11(AMGs),似乎能够调节宿主的代谢过程,从而促进感染的顺利进行并提高病毒颗粒成熟的成功率。AMGs 已被发现与限制性营养物质的利用和吸收,或能量生成途径相关。一些实例包括在多种蓝藻噬菌体基因组中发现的光合作用系统基因12-16、与磷酸盐代谢相关并受其调控的基因17,18,以及利用戊糖磷酸途径合成噬菌体脱氧核苷三磷酸(dNTP)的基因18,19。相比之下,结构基因是在感染过程中中晚期表达的基因,其种类在不同的噬菌体-宿主系统中存在差异。结构蛋白的合成依赖于病毒 dNTP 的供应以及转录、翻译和组装所需的能量储备8。衣壳和尾部纤维结构蛋白被认为是所有病毒蛋白编码基因中最为多样的,且对成功产生病毒颗粒至关重要。其高度多样性通常归因于它们在塑造病毒与宿主共进化过程中所发挥的积极作用20。无论属于哪一类基因,高度分歧的蛋白质在使用传统的同源性分析和序列比对技术时都容易被忽视。为弥补严格序列比较所存在的局限性,研究人员已开发出能够利用序列特征来推断基因功能关联的生物信息学工具,例如人工神经网络21。人工神经网络(ANNs)可用于预测结构基因和代谢基因,但仍需通过下游实验验证以直接确定基因功能。

本文的目的是提供能够监测宿主细菌在表达通过人工神经网络(ANN)功能预测的新型噬菌体基因过程中分解代谢和合成代谢的表型组学实验方案。表型组学是与细胞表型相关的生物学领域,在系统生物学中已得到广泛应用,有助于研究功能未知或具有多效性的蛋白质。表型组学工具可用于关联表型信息与基因型信息。我们假设,对于假定的噬菌体基因,其功能可通过观察在噬菌体基因表达期间对宿主产生的生理效应来确定。为验证该假设,选择了两种定量方法:多表型检测平板(MAPs)用于监测宿主对底物的利用及其后续生物量的形成,而代谢组学则用于测定在特定环境条件下生长期间宿主代谢物的多样性及相对丰度。在大肠杆菌(Escherichia coli)中过表达假定的结构蛋白和代谢蛋白,并对两项实验的代表性结果进行比较。本文介绍了多种可视化技术及高通量数据处理流程,以促进实验的重复。最后,结合已注释的衣壳蛋白、噬菌体代谢蛋白硫氧还蛋白以及两个假定的辅助代谢基因(AMGs)所预期产生的生理效应,讨论了所展示方法的可重复性与准确性。

方案

1. 多表型检测平板(MAP)底物、基础培养基、预培养培养基和缓冲液的制备

  1. 制备 50 ml 浓度为 1.0 - 1.25% 的底物储备液。
    1. 将 1.0 - 1.25%(w/v)的固体底物溶解于无菌水中(必要时加热)。使用 0.22 µm 滤器过滤除菌,将储备液于室温保存。本实验中所用底物的示例见表 2
  2. 为所有底物类别(碳、氮、硫和磷)制备 250 ml 的 3 倍基础培养基。基于 MOPS(3-吗啉丙磺酸)的基础培养基22 包含以下成分:1× MOPS(40 mM MOPS + 10 mM Tricine)、0.4% 甘油*、9.5 mM NH4Cl*、0.25 mM NaSO4*、1.0 mM MgSO4*、1.32 mM K2HPO4*、10 mM KCl、0.5 µM CaCl2、5 mM NaCl、6 µM FeCl3 以及 0.1%(w/v)L-阿拉伯糖**(表 1 和表 2)。
    注意:*这些化合物根据基础培养基类型的不同而有所调整。例如,碳源基础培养基中不添加 0.4% 甘油;在硫源基础培养基中,1.0 mM MgSO4 被替换为 1.0 mM MgCl2。**L-阿拉伯糖用于诱导 pBAD 启动子载体 pEMB11,该载体已转化至 ara-E. coli K-12 菌株(BW 27784)中23
    1. 将基础培养基的各组分加入无菌烧瓶中,加水定容,充分混匀。使用 0.22 µm 滤器过滤除菌,将每种基础培养基滤入无菌瓶中。
  3. 制备 500 ml MOPS 预培养培养基。基于 MOPS 的预培养培养基22 包含以下成分:1× MOPS(40 mM MOPS + 10 mM Tricine)、0.4% 甘油、9.5 mM NH4Cl、0.25 mM NaSO4、1.0 mM MgSO4、1.32 mM K2HPO4、10 mM KCl、0.5 µM CaCl2、5 mM NaCl 和 6 µM FeCl3
    1. 将预培养培养基的各组分加入无菌烧瓶中,加水定容。使用 0.22 µm 滤器过滤除菌,然后加入氨苄青霉素至终浓度为 100 µg/ml。将溶液于 4 °C 保存。
  4. 制备 500 ml 的 0.5× Luria-Bertani(LB)琼脂平板。向无菌烧瓶中加入 LB 组分,配制成 0.5× 浓度(1.25 g 酵母提取物、2.5 g NaCl、2.5 g 胰蛋白胨、7.5 g 琼脂)。充分混匀后高压灭菌。
    1. 待琼脂冷却后,边搅拌边加入终浓度为 100 µg/ml 的抗生素氨苄青霉素。每块培养皿倒入约 25 ml 琼脂,凝固后于 4 °C 保存备用。
  5. 制备 250 ml 含 10 mM Tris(pH 7.4)和 10 mM MgSO4 的缓冲液。使用 0.22 µm 滤器过滤除菌,溶液于室温保存。

2. 细菌细胞悬液的制备

  1. 准备新鲜菌落。从12.5%甘油冻存菌种中,将新鲜的 E. coli 克隆接种至含有100 µg/ml 氨苄青霉素的0.5x LB 琼脂平板上。在37 °C下培养24小时。
  2. 制备液体培养物:
    1. 将3 ml含有100 µg/ml氨苄青霉素的预培养基加入培养管中。每个克隆设置三个生物学重复。
    2. 从步骤2.1中挑取独立菌落,分别接种至已准备好的培养管中。在37 °C下振荡培养22小时。
  3. 收集并洗涤细菌细胞:
    1. 将过夜培养物转移至1.7 ml微量离心管中。在微量离心机中以最大速度(16,900 × g)离心2分钟,沉淀细胞。弃去上清液,将细胞重悬于500 µl 10 mM Tris/10 mM MgSO4 缓冲液中进行洗涤。重复此步骤一次。
    2. 再次离心收集细胞,弃去上清液,将细胞重悬于1 ml 10 mM Tris/10 mM MgSO4 缓冲液中。
  4. 测定细胞密度并浓缩细胞(如需要):
    1. 将步骤2.3.3中的细胞用10 mM Tris/10 mM MgSO4 缓冲液稀释10倍,并将稀释后的样品转移至比色皿中。测定该稀释液在600 nm处的光密度(OD600 nm),并记录数值。
    2. 浓缩细胞,使其在MAPs中的终浓度达到0.07(OD600 nm)(当细胞加入MAPs时会被稀释15倍,因此初始细胞浓度需为OD600 nm = 1.05)。将浓缩后的细胞悬液转移至储液槽中,保存于室温,直至MAPs制备的步骤3.5使用。

3. 多表型检测板(MAPs)的制备

  1. 标记微孔阵列板(MAP)。用大肠杆菌(E. coli)克隆编号和MAP示意图类型标记无菌的96孔微孔板。
  2. 向MAP中分装无菌水。将无菌水无菌转移至液体储液槽中,使用多通道移液器向微孔板的每个孔中加入60 µl无菌水。
  3. 向MAP中分装基础培养基。将3倍浓度的基础培养基无菌转移至液体储液槽中,使用多通道移液器向微孔板的每个孔中加入50 µl。针对MAP示意图中使用的每种基础培养基,重复步骤3.2和3.3。
  4. 向MAP中分装底物。将每种底物各30 µl转移至MAP中相应的孔内。
  5. 向MAP中加入细菌悬液。使用多通道移液器,从第2.4.2节中取出10 µl细菌细胞加入MAP的每个孔中。在将移液器重新插入菌种储备液之前,需更换吸头。
  6. 用粘性封板膜覆盖MAP。每块板覆盖一张单独的粘性封板膜,用力按压膜的表面,使其紧贴微孔板的孔位及边缘,形成均匀且紧密的密封。使用无菌剃刀片去除微孔板边缘多余的封板膜。
  7. 测定MAP的光密度:
    1. 将准备好的MAP放入多板光谱光度计读板仪的“输入”插槽中。打开读板仪软件,建立一个检测程序:每30分钟测量一次吸光度(OD600 nm),持续共32小时,每次读数之间进行60秒振荡。
    2. 将仪器温度设定为37 °C。待MAP温度与设定值平衡后,启动检测程序。
    3. 32小时后,从读板仪的“输出”插槽中取出MAP。为每个数据文本文件命名,文件名应包含:大肠杆菌(E. coli)克隆编号、MAP运行日期以及MAP示意图类型。

4. 多表型检测板(MAPs)的处理与参数化

  1. 使用自动化质量评估流程测定生长曲线, 例如, PMAnalyzer24.
    1. 验证生长曲线的 OD 值600 nm < 0.20,在最初的2小时内。不要使用初始时间点(t0由于冷凝伪影导致滤膜中出现的异常,通常在 t 时消失1 (30 分钟)。
    2. 移除违反质量控制筛选条件的生长曲线。保存曲线信息(样品名称、孔位编号和OD600 nm 将数值保存至单独的输出文件中以供将来参考。若生长曲线通过质量控制筛选,则继续进行分析。
  2. 计算中位数生长曲线。根据每个孔的重复实验数据,通过取中位数光密度(OD)值来计算中位数生长曲线600 nm) 值。将生成的中位数生长曲线记录到一个独立的输出文件中,以供后续使用。
  3. 使用 Zwietering 提出的方程的改进形式,为每条生长曲线计算最佳拟合的逻辑斯蒂模型25。逻辑方程包含三个描述细菌生长的参数:滞后时间 λ(hr)、最大生长速率, µ最大值 (OD600 nm 100 -1),以及最终生物量产量 α(OD600 nm)。使用时间为 30 分钟时的数据(y1)作为初始值,以避免冷凝伪影的影响。
    Logistic growth model equation diagram; mathematical formula for population dynamics analysis. [1]
    1. 使用直接搜索法计算最大生长速率。在数据中记录90分钟时间间隔内的最大变化速率。
      Logarithmic growth rate formula, μmax calculation, mathematical equation for data analysis. [2]
    2. 通过搜索90分钟时间窗口内最大移动平均值的上渐近值来估算最终生物量产量。具体而言,将生长曲线的渐近线定义为该渐近值。
      Mathematical formula: A = max(sum yj/3), depicting a calculation for averages in a dataset. [3]
    3. 使用 µ最大 根据4.3.1和4.3.2中的A值,通过尝试所有λ值来确定λ值。
      Static equilibrium equations, λ=0.25K, K=1,2,...2n, formula, mathematical concept, analysis. [4]
      1. 使用每个 λ 值计算平方误差之和(SSE)。取最小的 SSE 作为 SSE(λS):
        Static equilibrium equation Σ for SSE; formula, research method, data fitting analysis. [5]

5. MAPs 的表型分析

  1. 计算每条生长曲线的生长水平(GL),以评估每个克隆在每种底物上的总体生长情况。将GL定义为经平移的逻辑斯蒂拟合值的调和平均数:
    Mathematical formula, GL equation, summation, fraction, statistical calculation diagram. [6]
  2. 根据GL值为每条生长曲线指定表型。此处使用的四种表型为:预期生长、无生长、功能获得和功能丧失。
    1. 通过比较所有克隆在特定底物上的生长情况,以与平均值相差的标准差数来确定表型。结合该统计值与最低生长阈值,判定生长曲线所呈现的表型图1A、B). 图1C 提供表型分配的示例。
    2. 定义生长为 GL ≥ 0.4(图1A,B). 定义功能获得(Gain of Function)图1C,绿色)具有GL > 均值以上两个标准差及均值 > 生长阈值。功能丧失(图1C,红色)被定义为具有 GL < 均值以下两个标准差和均值 > 生长阈值
  3. 根据表型和生长曲线创建数据集的可视化表示。
    1. 观察描绘光密度的生长动态600 nm 将数值以颜色形式呈现,以便快速比较多个克隆之间的生长曲线(图2).
    2. 根据生长条件查看所有克隆的表型分布图3).

6. 构建连续培养装置

  1. 反应器端口构建(图 4A,B)。在连续培养反应器的瓶盖上钻三个 1/4 英寸的孔,孔间距为 3/4 英寸。
    1. 对于端口 α:从瓶盖底部将一个带 1/16 英寸接头的雌性鲁尔螺纹面板安装件拧入,使接头朝上伸出瓶盖。使用 1/4 英寸面板安装锁紧螺母固定接头。
    2. 对于端口 β:将一个带 1/16 英寸接头的雌性鲁尔螺纹面板安装件拧入,使接头朝上伸出瓶盖。使用 1/4 英寸面板安装锁紧螺母固定接头。
    3. 对于端口 γ:从瓶盖底部将一个带 1/16 英寸接头的雌性鲁尔螺纹面板安装件拧入,使接头朝上伸出瓶盖。使用 1/4 英寸面板安装锁紧螺母固定接头。在瓶盖内侧的接头处,将一个带一体式锁环的雄性鲁尔接头连接至 1/8 英寸内径软管。
    4. 对于出流端口:在连续培养反应器的 75 ml 刻度处钻一个 5/16 英寸的孔。将 1/4 英寸带接头的贯通接头螺母端切去 3/4 英寸。将 1/4 英寸带接头的贯通接头旋入(垫圈位于瓶外侧,螺母位于瓶内侧,图 4B)。
  2. 进料瓶端口构建(图 4C)。在进料瓶的瓶盖上钻两个 1/4 英寸的孔,孔间距为 1 英寸。
    1. 对于端口 δ:将一个带 1/8 英寸接头的雌性鲁尔螺纹面板安装件拧入,使接头朝上伸出瓶盖。使用 1/4 英寸面板安装锁紧螺母固定接头。
    2. 对于端口 ε:将一个带 1/16 英寸接头的雌性鲁尔螺纹面板安装件拧入,使接头朝上伸出瓶盖。使用 1/4 英寸面板安装锁紧螺母固定接头。
      1. 在瓶盖内侧的接头处,将一个带一体式锁环的雄性鲁尔接头连接至 1/8 英寸内径软管。
  3. 进料管及延长管:
    1. 裁剪两段 1 英寸长的管路(外径 1/8 英寸,内径 1/16 英寸)。将这两段管路分别安装至 5.2 节中制备的连续培养反应器的端口 α 和 γ。
    2. 裁剪一段 1 英寸长的管路(外径 1/4 英寸,内径 1/8 英寸)。将该段管路安装至连续培养反应器的端口 β。
    3. 裁剪一段 3.5 英寸长的管路(外径 1/8 英寸,内径 1/16 英寸)。将该段管路连接至端口 γ 内侧的带一体式锁环的雄性鲁尔接头(1/8 英寸内径软管)。端口 γ 为连续培养反应器的取样口。
    4. 裁剪一段 1 英寸长的管路(外径 1/4 英寸,内径 1/8 英寸)。将该段管路安装至进料瓶的 δ 端口。
    5. 裁剪一段 11 英寸长的管路(外径 1/16 英寸,内径 1/8 英寸)。将该段管路连接至进料瓶端口 ε 内侧的带一体式锁环的雄性鲁尔接头(1/8 英寸内径软管)。
    6. 裁剪两段 18 英寸长的管路(外径 1/8 英寸,内径 1/16 英寸)。将其中一段连接至进料瓶的端口 ε。另一段保留用于第 7 节。

7. 用于代谢组学的连续培养运行

  1. 灭菌材料:
    1. 将干燥材料高压灭菌 30 分钟。确保将第 5 节中制备的喂养瓶瓶盖用铝箔包裹。保持连接的管路呈直线状态。
      1. 将第 5 节中制备的连续培养反应器瓶盖用铝箔包裹。保持连接的管路呈直线状态。将第 6.3.5 节中截取的 18 英寸管路以及最小的蠕动泵管路接头用铝箔包裹。保持管路呈直线状态。高压灭菌 30 分钟。
    2. 制备 2 L 的 0.5x LB 培养基。在喂养瓶中配制 0.5x LB 培养基。用铝箔覆盖喂养瓶。高压灭菌 1 小时。
    3. 制备 70 ml 的 0.5x LB 培养基。将培养基倒入连续培养反应器中。在连续培养反应器中放入一个搅拌子。用铝箔覆盖反应器,并高压灭菌 30 分钟。
  2. 连续培养体系的搭建:
    1. 细菌细胞悬液。
      1. 从 12.5% 甘油冷冻保藏菌种中,将新鲜的 E. coli 克隆接种至含有 100 µg/ml 氨苄青霉素的 0.5x LB 琼脂平板上。在 37 °C 下培养 24 小时。
      2. 挑取单菌落接种至 3 ml 含有 100 µg/ml 氨苄青霉素的 0.5x LB 培养基中。每个克隆设置三个生物学重复。在 37 °C 下振荡培养 22 小时。
    2. 连接各部件。
      1. 将所有高压灭菌后的材料放入生物安全柜中,并在培养基冷却期间开启紫外灯。待培养基冷却后,向所有 0.5x LB 培养基中加入 0.1% L-阿拉伯糖和 100 µg/ml 氨苄青霉素。
      2. 打开连续培养反应器瓶盖的铝箔包装,并将其旋紧至反应器上。避免触碰取样管。打开喂养瓶瓶盖的铝箔包装,并将其旋紧至喂养瓶上。避免触碰取样管。
      3. 保持连接在 ε 端口的 18 英寸管路处于无菌状态。拆开 18 英寸管路和蠕动泵管路接头的铝箔包装。
      4. 将 18 英寸管路的一端自由端连接至蠕动泵管路接头的一端。将蠕动泵管路接头的另一端连接至喂养瓶瓶盖 ε 端口所连接的 18 英寸管路上。
      5. 将 0.22 µm 滤器单元旋紧至连续培养反应器的 β 和 δ 端口。将一个 0.22 µm 滤器单元旋紧至 α 端口的接头上。将 18 英寸管路的自由端连接至该 0.22 µm 滤器单元上。
    3. 启动连续培养。
      1. 在生物安全操作台内,向连续培养反应器中接种 100 µl 第 7.2.1.1 节制备的过夜培养物。
      2. 在将连续培养体系转移至 37 °C 培养箱前,关闭系统。在培养箱内预先设置磁力搅拌器和微型蠕动泵。
      3. 将蠕动泵管路接头安装至蠕动泵中。来自喂养瓶的管路应连接至“进液”端,通向反应器的管路应连接至“出液”端。
      4. 将蠕动泵设置为“FAST”模式。通过切换至“FORWARD”启动蠕动泵。检查培养基是否开始在管路中流动。
      5. 将反应器置于磁力搅拌器上并开始搅拌。连续培养反应器需在取样前平衡 24 小时。
    4. 连续培养物的取样。将一个 5 ml 鲁尔锁注射器旋接至 γ 端口,并抽取 4.5 ml 培养物。
      1. 取 500 µl 培养物用于测定密度(OD600 nm)。稀释细胞,制备 4 份 1 ml 的培养物,使其 OD600 nm = 0.35。
      2. 将稀释后的培养物分装至 1.7 ml 微量离心管中。每 12 小时重复取样一次,持续 4 天。
    5. GC-TOFMS 样品制备:
      1. 通过离心(最大速度,16,900 x g)2 分钟收集细胞沉淀。弃去上清液。用 500 µl 磷酸盐缓冲液(PBS)洗涤细胞。重复此步骤一次。
      2. 最后一次弃去上清液后,将含有细胞沉淀的微量离心管浸入液氮中,直至气泡停止产生。将样品储存于 -80 °C 冰箱中。

8. 用于代谢组学的连续传代批量培养

  1. 制备细菌悬液。从12.5%甘油冷冻保藏菌种中,划线接种以获得新鲜单菌落 E. coli 克隆至含0.5倍浓度LB琼脂的培养基中 100 µg/ml 氨苄青霉素。在37°C下孵育 37 °C 24 小时。
    1. 将单个菌落接种至含有3 ml 0.5x LB肉汤培养基中 100 µg/ml 氨苄青霉素。每个克隆使用三个生物学重复。
  2. 连续传代批量培养
    1. 从8.1.1节中通过500倍稀释至含LB肉汤的3 ml中过夜培养 50 µg/ml 氨苄青霉素和0.1% L-阿拉伯糖。菌种继代培养物的OD600 nm < 0.005。在指定条件下孵育 37 °C 振荡条件下。
    2. 检测光密度(OD)600 nm) 在2小时和2.5小时。培养细胞至OD600 nm = 0.35.
      1. 通过500倍稀释至含有LB肉汤的3 ml培养基中进行传代培养 50 µg/ml 氨苄青霉素和0.1% L-阿拉伯糖。菌种继代培养物的OD600 nm < 0.005.
    3. 检测光密度(OD)600 nm) 在2小时和2.5小时。培养细胞至OD600 nm = 0.35.
  3. 连续传代批次培养物的取样
    1. 使用无菌镊子,放置一个 0.22 µm 将膜滤器置于滤器装置上方。取1 ml磷酸盐缓冲液(PBS)加入滤膜上,然后开启真空泵。
    2. 重复加入1 ml PBS。从8.2.3节中取出1 ml亚培养物转移至滤纸上。此后需迅速操作,立即将样品放入液氮中,整个过程需在1分钟内完成。
    3. 将1 ml PBS分装至滤纸上以洗涤样品。快速冲洗,避免样品溢出滤纸边缘。重复一次。
    4. 使用无菌镊子将滤膜小心折叠后放入1.7 ml 微量离心管中。将微量离心管浸入液氮中,直至气泡停止。将样品储存于 -80 °C 冷冻机

9. 代谢物分析与处理

  1. 将每个克隆的3个样本用干冰运输至代谢组学核心设施,进行样本处理、分析以及GC-TOFMS数据的标准化。
  2. 对于每个样本,利用重复实验数据计算各代谢物的均值、中位数、标准差和变异系数。
  3. 进行统计分析时,使用条件语句和重复执行手动编写质量控制分析流程26,以剔除不符合预设条件的代谢物。
    1. 条件1:剔除在超过2个样本中丰度为零的代谢物。从代谢组学谱图中移除内标物。
    2. 条件2:剔除在目标细胞中未检测到的代谢物。此处需移除以下代谢物:吲哚-3-乙酸、二氢松香酸、十九烷酸、水杨酸、水杨醛、胆固醇、苯酚、单硬脂酸甘油酯、十八醇、单棕榈酸甘油酯、十二烷、十二醇、1-十六醇、5-甲氧基色胺、苯甲酸、十五烷酸、磷酸、壬酸、棕榈酸、癸酸、羟胺、硬脂酸、肉豆蔻酸、马来酰亚胺、左旋葡聚糖和4-羟基丁酸。
    3. 条件3:剔除变异系数大于1的代谢物。
  4. 通过分析代谢物的相对丰度,捕捉整体代谢组学变化特征。
    1. 绘制每个克隆中各代谢物的中位数丰度的可视化图谱(图6)。
  5. 通过观察克隆-代谢物配对频率识别异常值。
    1. 计算每个克隆中每种代谢物中位数的Z分数。使用以下公式计算Z分数:
      Z分数公式,Zmx,用于统计数据分析和标准差计算的示意图。 [7]
      ​注:XMC 表示特定克隆中某一特定代谢物的丰度水平;µC 表示某一特定代谢物在所有克隆中的均值;σC 为对应的标准差。
    2. 绘制数据的可视化图谱,并突出显示异常值(数据未提供)。

结果

本研究中用于确定开放阅读框(ORFs)的所有样本均采集自莱恩群岛南部的圣诞岛7号站点(STAR7)和卡罗琳环礁9号站点(CAR9)。如先前所述5,使用舱底泵从珊瑚边界层下方采集了约100升海水。将泵中内容物通过大孔径滤膜进行分级过滤,以去除小型真核生物,随后使用100 kDa切向流滤膜浓缩,仅保留微生物和病毒样颗粒(VLPs)。为了分离VLPs,将剩余海水通过0.45 µm滤膜,从而获得病毒组(virome)。向该病毒组组分中加入氯仿以抑制任何残留细胞的生长,并在4 °C下保存。

使用氯化铯方法纯化VLP,该方法通过密度梯度离心分离,可在约1.35 g/ml至1.5 g/ml范围内回收病毒颗粒3。采用CTAB/苯酚:氯仿法提取病毒DNA,并利用Phi29试剂通过多重置换扩增进行扩增。病毒组测序采用 commercially available pyrosequencing technology 完成。

本研究中用于病毒ORF处理与筛选的生物信息学方法如下。对CAR9和STAR7病毒宏基因组进行了三个预处理步骤。首先,使用公开软件去除病毒DNA测序前扩增所产生的标签序列27。其次,通过另一生物信息学程序过滤掉常见的测序伪影,如序列重复和低拷贝数序列28。最后,对与以下数据库中序列具有≥90%覆盖度和≥94%同源性的序列进行外源序列污染去除29:RefSeq病毒基因组;人类——参考基因组GRCh37;人类——Celera Genomics;人类——Craig Venter(HuRef);人类——Seong-Jin Kim(韩国);人类——染色体7版本2(TCAG);以及人类——James Watson、YanHuang(YH;亚洲人)、Yoruba(NA18507;非洲人)参考序列21。经过上述处理后,CAR9样本的序列总数为591,600条,STAR7样本的序列总数为939,311条。这些序列被上传至MGRAST平台,并使用默认参数通过组装软件进行序列组装。将重叠群(contigs)翻译成6个阅读框,并如前所述使用脚本识别潜在的开放阅读框(pORFs)21

为了鉴定未知的开放阅读框(ORF),进行了多种基于相似性的搜索,以去除已知功能的ORF。简而言之,以下搜索及其相应的搜索标准被实施21

  1. 通过 MGRAST BLAT 在 M5NR 数据库中比对,至少 40 个碱基对(bp)范围内具有 ≥ 95% 的序列一致性。
  2. 利用 TBLASTN 与 My Metagenome Database Resource 中所有公开的宏基因组进行比对,具有显著相似性(e 值 ≤ 0.001)。
  3. 利用 BLASTP 和 TBLASTN 与 NR 数据库比对,具有显著相似性(e 值 ≤ 0.001)。
  4. 利用 RPS-BLAST 与保守结构域数据库(Conserved Domain Database)比对,具有显著相似性(e 值 ≤ 0.001)。
  5. 从每个数据集中选取部分序列进行蛋白质翻译,并与蛋白质数据库(Protein Data Bank)中的已解析蛋白质结构进行比对。
  6. 使用 Dinucleotide Signatures 软件包计算二核苷酸频率。

利用公开可用的基因设计软件,将获得的pORF设计用于在E. coli中表达。氨基酸序列的反向翻译采用通用密码子使用表,旨在适应E. coli中的表达,密码子最低使用频率阈值为2%。序列中排除了BamHI和HindIII的限制性酶切位点,以方便克隆。由外部公司合成改造后的基因序列30,随后通过标准的限制性酶切克隆方法将ORF克隆至中等拷贝数的pBAD启动子载体pEMB11中。所有克隆均转化至E. coli K-12菌株BW 2778423中。

多表型检测板(MAPs)

采用高通量且稳健的软件流程对微生物互作图谱(MAPs)进行分析,该流程为 PMAnalyzer24。该流程在 Linux 服务器环境中开发,可执行多个步骤,包括:解析光密度文件、将数据格式化为可读的文本文件、对生长曲线进行预处理以实现质量控制(QA),以及应用数学建模技术分析生长曲线。主要的建模脚本使用 Python 2.7.5 版本开发,以利用 PyLab 模块。

使用重复数据的标准误(SE)评估了MAPs的可重复性(图2A)。将原始生长曲线与逻辑生长曲线进行比较,以确定PMAnalyzer程序是否在实验过程中准确地对克隆生长进行了参数化和建模(数据未显示)。有关MAPs和PMAnalyzer的准确性与有效性的更多详细信息,请参见Cuevas 24

在方法验证完成后,使用分析流程提供的多个参数(如最大生长速率(µmax)和生长水平(GL))对MAPs数据进行分析。比较生长曲线的可视化方法常用于解读生长数据;然而,能够同时可视化用于比较的曲线数量存在局限性。为了能够同时分析大量生长曲线,采用了基于热图的图示方法,将数十个克隆在单一底物上的生长情况与其对应条件下的平均响应进行比较(图2B)。通过观察生长曲线参数的变化——特别是延滞期、指数生长期和最大生物量产量(渐近线)——可以评估过表达一种新型噬菌体蛋白所产生的影响。例如,衣壳蛋白生长曲线中从延滞期迅速进入指数生长期的陡峭上升趋势(图2A),在图2B的动态图中表现为同一克隆的颜色强度从黑色快速变为白色。

为了获得克隆在不同底物上分布的全局图景,采用了基于基因型-表型关联(GL)得出的表型分类(图3)。在此,四种表型分别展示于四个图表中,每个柱状图的高度代表在特定底物上表现出该表型的克隆数量。数据中的异常值被识别为属于“功能获得”或“功能丧失”类别的克隆。这些异常值可被单独筛选出来,并通过实验进行更深入的研究。此外,全局分析还能识别实验中对某些底物的偏好性。例如,苯丙氨酸、苹果酸和甘氨酸等底物导致了“无生长”的分类。在所有克隆中 consistently 被归类为“无生长”的底物,在后续的功能表征分析中不会被赋予较高的权重。

代谢组学

通过代谢组学方法鉴定表达未知噬菌体基因的克隆所产生的分解代谢产物。简言之,在送至代谢组学核心设施进行GC-TOFMS分析之前,克隆菌株在连续培养或分批培养的连续传代条件下进行培养。有关所选核心设施实施的样品处理、分析及GC-TOFMS归一化的详细信息,请参见Fiehn et al.31。简要步骤如下:向每个样品中加入1 ml冷提取溶剂,随后对样品进行涡旋振荡,并在低温水浴中超声处理5分钟。最后将样品离心,倾出一半上清液并干燥后用于分析。提取物经纯化后加入内标保留指数标记物,然后上样至气相色谱仪,再转移至质谱仪。对每个样品的数据进行分析,报告色谱图中所有检测到的信号的信号强度。归一化处理时,首先将每个样品中所有峰的丰度求和,然后计算该样品组中所有样品总峰丰度的平均值。每个样品中代谢物的丰度除以其自身的峰丰度总和,再乘以该样品组的平均峰丰度。所得数据用于本研究所述的代谢组学分析。

为确定每种培养方法的适当样本量,需要验证代谢组学结果的可重复性。为检测样本内部的精确度以及不同样本量之间的变异情况,采用均值标准误(SM对于 n = 3 和 n = 6 的数据集均进行了审查(图5B)。无论连续培养(CC)样本量大小,少于1%的数据其SM ≤ 1.5. 中位数 SM分别为221和300,数值范围为0至7.55 × 105 和 3.74 × 105,n 分别为 3 和 6。SM在连续培养(SC)方法中,也针对每组样本重复计算了标准差(S)。同样,少于1%的数据其S值M ≤ 1.5,中位数 SM 137,范围为 0 到 3.51 × 105. 为了比较 SM 每组样本之间的分布(CC,n = 3) CC n = 6,CC n = 3 SC n = 3,CC n = 6 SC n = 3)时进行了置换检验。对连续培养的SM 数值数据集与连续传代培养的S分布之间无显著差异M 值(p值 = 0.0)。然而,S的分布M 连续培养的数值 n = 3,数据与 S 组相比具有显著差异M 连续培养 n = 6 数据的数值(p 值 = 1.908804 × 10-49最后,比较了实施质量保证(QA)步骤前后每种代谢物的变异系数图5C)。总共在实施质量控制流程后移除了210种代谢物(占数据的40%)。被移除的数据中,少于1%的代谢物丰度为零,约2%为内标物数据,约5%为此前从未在样本中观测到的代谢物数据 E. coli,以及其余的代谢物(> 30% 的样本变异系数大于 1。

与MAPs分析类似,全局观察提供了对代谢组学所能提供的信息深度的初步理解。为了获得整体图景,根据各克隆相对代谢物丰度进行层次聚类,从而揭示克隆-代谢物谱型、功能可能相关的克隆以及克隆-代谢物中的异常值(图6)。为了突出蛋白质功能,将代谢物依据常见的代谢通路进行分离和分组。结合初步结果进行此项分析后明显发现,代谢组学能够区分来自不同类别的基因(图6,高亮显示的克隆)。此外,通过计算每个克隆-代谢物对的标准分数(z分数),确定了代谢组学数据中的异常值。为确保统计学显著性,将Z分数值为2的克隆-代谢物对定义为异常值,这类数据仅占全部数据的5%(数据未显示)。

生长速率与生长水平的散点图和箱形图;D-半乳糖实验中的表型分析图。
图 1. 表型分类的定义。A)生长水平(GL)与最大生长速率之间的关系。用红色圈出的数据点代表显示极少或无底物利用的生长曲线。(B)基于最低生长速率(< 0.15 OD/hr)的生长曲线分布所定义的生长阈值的箱形图表示。(C)计算底物 D-半乳糖的 GL 的方差和标准差。短虚线表示距离均值两个标准差的范围。请点击此处查看该图的放大版本。

生长分析图;OD600 nm 与时间关系;蔗糖、D-半乳糖、D-甘露糖;吸光度热图。
图2. 通过精确性和差异性验证MAPs。A)结构基因(衣壳蛋白)和代谢基因(硫氧还蛋白)注释克隆、两个新发现的代谢克隆(EDT2440、EDT2441),以及在MAPs中于蔗糖、D-半乳糖和D-甘露糖上生长的克隆平均反应的生长曲线。蓝色线条表示重复实验数据之间的标准误差(n = 3)。(B)47个不同克隆在蔗糖、D-半乳糖和D-甘露糖上的生长曲线以热图形式展示。已注释的结构克隆(绿色圆圈)和代谢克隆(橙色圆圈)、两个新发现的代谢克隆(深蓝色和浅蓝色圆圈)以及平均反应(红色圆圈)被突出显示。请点击此处查看该图的放大版本。

显示预期生长、功能获得或功能丧失的克隆计数的基因表达分析柱状图。
图 3. 多种底物上各表型的克隆分布。 47 个克隆在 72 种碳源特异性生长条件下的表型-克隆计数。表格中提供了每种表型的直接计数值。 请点击此处查看该图的放大版本。

反应器盖钻孔示意图;展示设备组装所需的孔径尺寸 1/4", 5/16", 1/8", 1/16"。
图4. 连续培养装置构建示意图。A)连续培养反应器 α-γ 端口的构建步骤,(B)连续培养反应器出流端口的构建步骤,以及(C)连续培养进样瓶 δ 和 ε 端口的构建步骤。请点击此处查看该图的放大版本。

多表型检测设置示意图;检测时长、代谢物变异性分析图表。
图 5. 所介绍的表型组学方法的比较。A)多表型检测板(MAPs)、连续培养和连续传代培养的制备流程。(B)针对代谢组学分析中连续培养(CC)和连续传代培养(SC)制备方法,在样本量 n = 3 和 n = 6 时,均值标准误(SM)所占百分比。y 轴采用对数刻度。(C)在实施质量控制流程前后,每种代谢物的变异系数(CV)分布情况。请点击此处查看该图的放大版本。

代谢物丰度热图、代谢通路图、糖酵解、三羧酸循环、氨基酸数据。
图6. 连续培养条件下克隆的代谢组学谱型。 展示了在连续培养条件下生长的84个克隆中一组代谢物的中位代谢物丰度。标注的结构蛋白类(衣壳蛋白)和代谢类克隆(硫氧还蛋白)、两个新发现的代谢类克隆(EDT2440、EDT2441)以及平均代谢响应的代谢物谱型以红色突出显示。请点击此处查看该图的高清版本。

化合物
Glycerol0.40%0.40%0.40%
Ammonium chloride9.5 mM9.5 mM9.5 mM
Sodium sulfate0.250 mM0.250 mM0.250 mM
Magnesium sulfate1.0 mM1.0 mM1.0 mM
Potassium phosphate1.32 mM1.32 mM1.32 mM
Magnesium chloride*
Potassium chloride10 mM10 mM10 mM10 mM
Calcium chloride0.5 µM0.5 µM0.5 µM0.5 µM
Sodium chloride5 mM5 mM5 mM5 mM
Ferric chloride6 µM6 µM6 µM6 µM
L- arabinose0.10%0.10%0.10%0.10%
MOPS pH 7.41x1x1x1x

表1. MAPs中使用的不同基础培养基的化合物及其浓度。 *以1.0 mM氯化镁替代。1x MOPS = 40 mM MOPS,4 mM Tricine。

碳源底物氮源底物硫源底物磷源底物
2-脱氧-D-核糖2-脱氧-D-核糖1-丁烷磺酸腺苷-5-单磷酸
4-羟基苯乙酸乙酰胺乙酰半胱氨酸β-甘油磷酸
乙酸腺嘌呤D-半胱氨酸磷酸肌酸
腺苷-5-单磷酸腺苷D-蛋氨酸D-葡萄糖-6-磷酸
阿东醇尿囊素二乙基二硫代磷酸盐二乙基二硫代磷酸盐
α-D-葡萄糖β-苯乙胺DL-乙硫氨酸DL-α-甘油磷酸
α-D-乳糖双缩脲谷胱甘肽磷酸钾
α-D-蜜二糖胞苷异乙酸焦磷酸钠
柠檬酸胞嘧啶L-半胱酸硫代磷酸钠
D-丙氨酸D-丙氨酸L-半胱氨酸
D-阿拉伯糖D-天冬酰胺L-二酮基酸
D-阿拉伯醇D-天冬氨酸L-蛋氨酸
D-天冬酰胺D-半胱氨酸硫酸镁
D-天冬氨酸D-葡糖胺甲烷磺酸
D-纤维二糖D-谷氨酸N-乙酰-DL-蛋氨酸
D-半胱氨酸DL-α-氨基丁酸N-乙酰-L-半胱氨酸
D-果糖D-蛋氨酸四硫代酸钾
D-半乳糖D-丝氨酸硫代硫酸钠
D-葡糖胺D-缬氨酸磺酸
D-葡萄糖γ-氨基丁酸牛磺酸
D-葡萄糖-6-磷酸甘氨酸牛磺胆酸
D-谷氨酸硫脲
D-甘露糖组胺
D-棉子糖肌苷
D-核糖L-丙氨酸
D-水杨苷L-精氨酸
D-丝氨酸L-天冬酰胺
D-海藻糖L-瓜氨酸
D-木糖L-半胱氨酸
卫矛醇L-谷氨酸
甘油L-谷氨酰胺
甘氨酸L-谷胱甘肽
内消旋-赤藓醇L-组氨酸
肌苷L-异亮氨酸
L-丙氨酸L-亮氨酸
L-阿拉伯糖L-赖氨酸
L-阿拉伯醇L-蛋氨酸
L-天冬酰胺L-鸟氨酸
L-天冬氨酸L-苯丙氨酸
L-半胱酸L-脯氨酸
L-半胱氨酸L-焦谷氨酸
L-岩藻糖L-丝氨酸;L-苏氨酸
L-谷氨酸L-色氨酸
L-谷氨酰胺L-缬氨酸
L-异亮氨酸N-乙酰-D-葡糖胺
L-亮氨酸腐胺
L-赖氨酸硫脲
L-蛋氨酸胸苷
L-苯丙氨酸胸腺嘧啶
L-焦谷氨酸酪胺
L-鼠李糖酪氨酸
L-丝氨酸尿苷
L-山梨糖
L-苏氨酸
L-色氨酸
L-缬氨酸
L-木糖
乳酸
乳果糖
苹果酸
肌醇
草酸
山梨酸钾
丙酸
腐胺
奎宁酸
丙酮酸钠
琥珀酸钠
蔗糖
胸苷
木糖醇

表2. MAP实验中使用的底物列表。

讨论

本文介绍了用于假定噬菌体基因功能表征的表型组学方法。这些技术包括一种可监测宿主合成代谢的改良检测方法——多表型检测平板(Multi-phenotype Assay Plates, MAPs),以及能够测量对分解代谢影响的成熟代谢组学方法。我们还提供了额外的工具,用于管理这些技术所产生的大规模数据集,从而实现高通量的数据处理与分析24。最后,通过比较已注释的噬菌体衣壳蛋白、噬菌体硫氧还蛋白、两个假定的代谢相关噬菌体基因以及平均实验响应,我们提出了多种策略,用于解读这两类数据集和基因类别,重点在于识别表型趋势和异常值。

如前所述,这两种方法在定量上仅能测量宿主代谢的一半。为了阐释所研究的任何新蛋白质的相对功能,需要结合两种方法的数据来提供功能证据。尽管这并非我们当前论文的重点,但每种表型组学方法产生的数据都会进行组合分析,重点采用随机森林和主成分分析等聚类技术。此外,组合分析得出的假设必须随后通过传统的遗传学方法加以验证。

最后,所介绍的方法在很大程度上受到细菌生理学的影响,因此遵循相同的标准。在实施任一方法时,必须考虑确保实验对象为独立的克隆群体;防止污染;仅测试单一变量;并同时运行适当的对照。若未考虑这些因素,将导致结果不明确,与其他任何生理学检测的结果类似。

多表型检测平板(MAPs)

与现有技术相比,MAPs 的开发提供了一种高通量且可灵活调整的检测方法(图5A表1、2)。该检测方法使用所有微生物学实验室中常见的耗材、设备和基本技术。通过整合用于后续数据处理与分析的计算流程 PMAnalyzer24,可确保快速解读数据。此外,该方法的实验和分析部分均可根据定制需求轻松调整或优化。例如,如果大部分数据未能通过第4节中所述的过滤标准,可手动检查生长曲线以识别问题所在。若问题源于过于严格的过滤参数,可对脚本进行相应调整;若问题与实验过程相关(例如,冷凝时间过长、细菌细胞转移不当等),则可方便地重复增加实验重复次数。

如 Cuevas 24 所述,PMAnalyzer 是一个用 bash 编写的单一程序,作为封装脚本运行,可将解析和分析脚本作为统一、自动化的流程执行。所有脚本均可从 Git 仓库免费获取25,通过计算三份重复数据中每个时间点的中位数值,进而对逻辑曲线进行参数化,以获得滞后期、最大生长速率、渐近值以及一个新提出的参数——生长水平(Growth Level)。在本研究中,我们选择中位数而非平均值,以减少显著离群值的影响;然而,该脚本可轻松修改以计算重复数据的平均值。由于在重复数据中观察到的变异程度较低(标准误差,SE)(图 2A),我们在 PMAnalyzer 中继续采用中位数来拟合逻辑曲线。此外,本研究中定义的生长阈值(GL ≥ 0.4)是通过比较生长水平与最大生长速率在数据分布上的分离情况而确定的(图 1A,B)。根据所使用的仪器和模型系统的不同,该阈值可能有所变化,需重新定义此截断值。

我们检测方法的一个主要优势在于能够利用一个表征微生物总体生长情况的单一参数来比较表型,我们将该参数定义为生长水平(Growth Level, GL)。GL 采用调和平均数计算,因此可减轻数据中较大离群值的影响。通过反复试验,最终确定使用经位移逻辑拟合值的调和平均数来综合反映生长状况。其他曾尝试用于区分生长情况的方法包括:达到特定曲线参数所需的时间(如半最大生长速率 µ)最大,µ最大,以及环境容纳量),决定系数(R2),以及R的组合2 乘以特定的曲线参数。在评估生长情况时,使用经平移的逻辑拟合值的调和平均数来计算GL,可提供最广泛的分析范围,因此成为首选方法。需要注意的一点是,当使用单一参数或拟合模型时,动态生长曲线模式的特征可能丢失。例如,逻辑曲线和GL的各个独立曲线参数无法反映双相生长。在单一碳源环境中,这种对生长的影响意味着病毒蛋白可能介导了底物的转化或底物利用方式的转变。若不考虑多个生长参数,还可能忽略其他潜在效应,包括:延长的滞后期,提示病毒机制或产物带来的负担增加;指数期快速加速,提示病毒蛋白与宿主能量生成通路相偶联;或生物量形成水平更高,暗示病毒在宿主营养摄取和合成代谢中起到支持作用(数据未显示)。因此,绘制新生长曲线(图2A、B) 提供了随时间变化的趋势信息,而GL则考虑了逻辑模型中的主要变量,提供一个单一的定量数值来表示克隆的整体成功程度。

在考虑MAP中结构基因与代谢基因所贡献的不同响应时,发现所研究的不同底物类别为蛋白质功能提供了最有力的证据。例如,代谢蛋白通常与获取限制性营养物质相关,而这些营养物质与宿主中心代谢无特异性关联16,32。初步的MAP实验显示,携带推测代谢功能噬菌体基因的克隆在利用中心代谢碳源生长时,滞后期显著延长(图2A)。相反,携带推测结构基因的克隆由于需要大量消耗宿主的能量和dNTP池,在中心代谢及氨基酸代谢碳源上的生长表现为假阳性反应。这可能是由于不溶性蛋白的积累导致宿主细胞丝状化和/或包涵体形成,显微观察结果支持这一推断(图2A及未展示数据)。尽管仍需进一步分析以验证这些初步结果,但MAP能够获取与特定噬菌体基因类别假设功能相对应的表型响应。

除了阐明未知病毒蛋白外,微生物培养平台(MAPs)还为研究单个细菌或细菌群落的功能与代谢多样性提供了新的资源。MAP 组件设计为易于调整,以支持多种细菌的生长,包括海洋细菌、营养缺陷型细菌以及厌氧微生物。为了实现这一目标,在 MAPs 中培养不同属的细菌之前,需要向已定义的基础培养基和预培养基中添加或调整特定的化学成分。使用 MAPs 时需要注意的是,必须保持培养基成分的明确性,禁止使用胰蛋白胨、酵母提取物和蛋白胨等成分。

代谢组学

代谢组学领域依赖于代谢物数据库,这些数据库包含通过质谱鉴定出的独立代谢物。此处选用的核心平台拥有规模最大的代谢组学数据库之一。有趣的是,我们实验中检测到的代谢物中超过一半无法被鉴定(约65%),其余部分则从未在我们的宿主Escherichia coli中被记录过(例如:吲哚-3-乙酸33、水杨酸34和二氢松香酸35)。这一现象可能归因于数据库对植物代谢物的强烈偏向,或与当前研究的特定蛋白质有关。无论原因如何,结果是可用于数据呈现与分析的已知代谢物数量有限。未来,结合多种代谢组学方法并利用不同的数据库,将有助于实现更全面的代谢物覆盖。

目前,在比较和分析我们发现的新型病毒蛋白时,会同时使用已知和未知的代谢物。基于这一方法,我们推测,携带功能相似蛋白的克隆株其整体代谢组学谱图也会表现出更高的相似性。初步的代谢组学分析显示,尽管结构基因与代谢基因之间没有明显的分离趋势,但那些在过表达时对宿主产生相似效应的基因确实存在相关性(图6)。例如,被注释为衣壳蛋白(Capsid)的基因与本研究中重点标注的假定代谢基因EDT2440和EDT2441聚类紧密。利用公开可用的跨膜拓扑结构和信号肽预测程序进行分析发现,这两个假定的代谢基因均含有一个跨膜结构域。有趣的是,在系统发育树左侧第一个聚类组的9个克隆中,有5个通过相同的拓扑结构预测程序显示出存在跨膜结构域。然而仍需进一步研究,但很可能这些克隆在过表达过程中所呈现的代谢物与细胞应激反应相关,这种应激可能源于膜结构或结构蛋白带来的负担。该证据表明,尽管代谢组学数据中存在一定水平的噪声,该方法仍能够识别出反映基因总体效应的信号,无论是在同一基因类别内部还是跨类别之间。为了确定该方法是否能够提取出基因功能的特异性信息,我们将代谢物归类到特定的代谢通路中。其假设是:如果某个克隆影响了某一通路中特异性的代谢物,则该过表达基因很可能参与该通路。在建立我们的代谢组学质量控制流程之前,初步数据显示,富集或耗竭的代谢物通常被标记为“未知”,因此难以判断其关联的代谢通路(数据未显示)。然而,经过预处理的代谢组学数据表明,大多数代谢物谱图相似,仅少数已知和未知代谢物的丰度在不同克隆间存在差异,例如腐胺(putrescine)和尿嘧啶(uracil)(图6)。为了更精确地解析蛋白功能,目前正致力于将新发现的噬菌体基因与已知功能的噬菌体基因进行实验性比对,从而填补基于代谢物的功能表征中存在的“空白”。通过该技术,已知病毒基因的功能可作为未知基因功能推断的参考依据。然而,代谢组学分析的局限性在于数据库的规模及其相关性。为克服这些限制,亟需建立与本研究相关的代谢组学数据库,例如针对E. coli ASKA克隆文库中单个ORF过表达条件下特异的代谢物及其丰度的数据库36。2013年,劳伦斯伯克利国家实验室的研究人员编制了首个针对模式细菌全突变体文库的综合性代谢物数据库,为这类数据库的必要性提供了证据37。该研究揭示了特定代谢物利用所必需的基因,明确了表型与基因型之间的清晰联系。

在将代谢组学作为研究工具时,明确核心设施所采用的处理流程至关重要。大多数实验流程都会产生一个常见的人为因素,即实验仪器在不同日期使用时带来的日常变异。迄今为止,所有气相色谱-质谱(GC-MS)分析均采用在每次分析运行中加入内标物的方法;然而,若在每一天的实验过程中额外加入项目特异性的内标样品,则可进一步消除额外的变异。这些因素必须在实验早期就予以考虑,以避免归一化过程中的问题和偏差。另一种解决方案是在同一核心设施中使用同一台仪器,并将所有样品作为单一批次进行处理,这一选项在任何核心设施中均可实现。

本文介绍并重新探索的各种工具为筛选和表征功能未知的噬菌体基因提供了新颖的方法。这些实验技术简单且具有良好的适应性,结合计算流程的高效使用,确保了这些方法可广泛应用于多种科研领域。我们的目标是,本文所呈现的表型组学方法将有助于进一步研究新型噬菌体蛋白,以及同样存在功能未知的其他系统。

披露

作者无任何利益冲突需要披露。

致谢

感谢 Benjamin Knowles、Yan Wei Lim、Andreas Haas 以及病毒暗物质联盟(Viral Dark Matter consortium)成员对本手稿提供的帮助和建设性意见。本研究由美国国家科学基金会(National Science Foundation,项目编号:DEB-1046413)资助,是“维度计划:揭示病毒暗物质”(Dimensions: Shedding Light on Viral Dark Matter)项目的一部分。

材料

本文使用的材料清单
姓名公司目录编号评论
0.22 µm 无菌滤膜(Sterivex 滤器)赛默飞世尔科技SVGP01050Millipore
0.22 µm Millex 滤器赛默飞世尔科技SLGV033RSMillipore
0.22 µm SteriCap 滤器赛默飞世尔科技SCGPS02REMillipore
0.22 µm Omnipore 膜滤器MilliporeJHWP02500Millipore
96 孔微孔板VWR82050-764标准 F 型底 96 孔微孔板
2 ml 96 孔板赛默飞世尔科技
微孔板粘性封板膜Sigma-AldrichZ369667
2 L Nalgene 方形瓶Cole ParmerT-06040-70
125 ml Nalgene 方形瓶Cole ParmerT-06040-50
1/4 英寸面板安装锁紧螺母,黑色尼龙材质Cole ParmerEW-45509-04
雌性鲁尔螺纹式面板安装接头转 200 系列卡套,1/16 英寸Cole ParmerEW-45500-30
雌性鲁尔螺纹式面板安装接头转 200 系列卡套,1/8 英寸Cole ParmerEW-45500-34
带锁环的雄性鲁尔接头转 500 系列卡套,适用于内径 1/16 英寸的管路Cole ParmerEW-45505-31
带锁环的雄性鲁尔接头与雌性鲁尔耦合器Cole ParmerT-45508-80
卡套式贯通接头,外径 1/4 英寸赛默飞世尔科技6149-0002
Sanipure 管路,内径 1/16 英寸 × 外径 1/8 英寸SaniPureAR400002
Sanipure 管路,外径 1/4 英寸 × 内径 1/8 英寸SaniPureAR400007
可调流速微型泵(蠕动泵)赛默飞世尔科技13-876-1
磁力搅拌器Velp ScientificaF203A0160
镊子赛默飞世尔科技14-512-141Millipore* 滤膜专用镊子
多孔板分光光度计读板仪Molecular Devices Analyst GT
滤膜真空过滤装置(滤器 manifold)赛默飞世尔科技XX10 025 02
软件:
Python 版本 2.7.5http://www.python.org/
PyLab 模块http://wiki.scipy.org/PyLab
R 版本 3.0.1http://www.r-project.org/
reshape2 程序包http://had.co.nz/reshape
ggplot2 程序包http://ggplot2.org/
Gene ComposerPSI 技术门户http://www.genecomposer.net
服务:
西海岸代谢组学中心加州大学戴维斯分校http://metabolomics.ucdavis.edu
DNA 2.0https://www.dna20.com

参考文献

  1. Wommack, K. E., Colwell, R. R. Virioplankton: Viruses in Aquatic Ecosystems. Microbiology and Molecular Biology Reviews. 64 (1), 69-114 (2000).
  2. Hendrix, R. W. Recoding in Bacteriophages. Recoding: Expansion of decoding rules enriches gene expression. 24, 249-258 (2010).
  3. Breitbart, M., et al. Genomic analysis of uncultured marine viral communities. Proceedings of the National Academy of Sciences. 99 (22), 14250-14255 (2002).
  4. Breitbart, M., et al. Diversity and population structure of a near-shore marine-sediment viral community. Proceedings. Biological sciences / The Royal Society. 271 (1539), 565-574 (2004).
  5. Dinsdale, E. A., et al. Functional metagenomic profiling of nine biomes. Nature. 452 (7187), 629-632 (2008).
  6. Vega Thurber, R. L., et al. Metagenomic analysis indicates that stressors induce production of herpes-like viruses in the coral Porites compressa. Proceedings of the National Academy of Sciences of the United States of America. 105 (47), 18413-18418 (2008).
  7. Pedulla, M. L., et al. Origins of highly mosaic mycobacteriophage genomes. Cell. 113 (2), 171-182 (2003).
  8. Calendar, R., Abedon, S. T. The bacteriophages. , Oxford Univeresity Press. (2006).
  9. Breitbart, M., Miyake, J. H., Rohwer, F. Global distribution of nearly identical phage-encoded DNA sequences. FEMS microbiology letters. 236 (2), 249-256 (2004).
  10. Klenk, H. -P., Palm, P., Zillig, W. DNA-Dependent RNA Polymerases as Phylogenetic Marker Molecules. Systematic and Applied Microbiology. 16 (4), 638-647 (1993).
  11. Breitbart, M., Thompson, L., Suttle, C., Sullivan, M. Exploring the Vast Diversity of Marine Viruses. Oceanography. 20 (2), 135-139 (2007).
  12. Mann, N. H., Cook, A., Millard, A., Bailey, S., Clokie, M. Marine ecosystems: bacterial photosynthesis genes in a virus. Nature. 424 (6950), 741(2003).
  13. Mann, N. H., et al. The genome of S-PM2, a “photosynthetic” T4-type bacteriophage that infects marine Synechococcus strains. Journal of bacteriology. 187 (9), 3188-3200 (2005).
  14. Lindell, D., et al. Transfer of photosynthesis genes to and from Prochlorococcus viruses. Proceedings of the National Academy of Sciences of the United States of America. 101 (30), 11013-11018 (2004).
  15. Millard, A., Clokie, M. R. J., Shub, D. A., Mann, N. H. Genetic organization of the psbAD region in phages infecting marine Synechococcus strains. Proceedings of the National Academy of Sciences of the United States of America. 101 (30), 11007-11012 (2004).
  16. Sullivan, M. B., Coleman, M. L., Weigele, P., Rohwer, F., Chisholm, S. W. Three Prochlorococcus cyanophage genomes: signature features and ecological interpretations. PLoS biology. 3 (5), e144(2005).
  17. Rohwer, F., et al. The complete genomic sequence of the marine phage Roseophage SIOI shares homology with nonmarine phages. Limnology and Oceanography. 45 (2), 408-418 (2000).
  18. Miller, E. S., et al. Complete genome sequence of the broad-host-range vibriophage KVP40: comparative genomics of a T4-related bacteriophage. Journal of bacteriology. 185 (17), 5220-5233 (2003).
  19. Thompson, L. R., et al. Phage auxiliary metabolic genes and the redirection of cyanobacterial host carbon metabolism. Proceedings of the National Academy of Sciences of the United States of America. 108 (39), E757-E764 (2011).
  20. Paterson, S., et al. Antagonistic coevolution accelerates molecular evolution. Nature. 464 (7286), 275-278 (2010).
  21. Seguritan, V., et al. Artificial neural networks trained to detect viral and phage structural proteins. PLoS computational biology. 8 (8), e1002657(2012).
  22. Neidhardt, F. C., Bloch, P. L., Smith, D. F. Culture Medium for Enterobacteria. Journal of Bacteriology. 119 (3), 736-747 (1974).
  23. Khlebnikov, A., Datsenko, K. A., Skaug, T., Wanner, B. L., Keasling, J. D. Homogeneous expression of the P(BAD) promoter in Escherichia coli by constitutive expression of the low-affinity high-capacity AraE transporter. Microbiology (Reading, England). 147 (Pt 2), 3241-3247 (2001).
  24. Cuevas, D. A., et al. Elucidating genomic gaps using phenotypic profiles. F1000Research. , (2014).
  25. Zwietering, M. H., Jongenburger, I., Rombouts, F. M., van’t Riet, K. Modeling of the bacterial growth curve. Applied and environmental microbiology. 56 (6), 1875-1881 (1990).
  26. Venables, W. N., Smith, D. M. An introduction to R. , Available from: http://cran.r-project.org/doc/manuals/R-intro.pdf (2014).
  27. Schmieder, R., Lim, Y. W., Rohwer, F., Edwards, R. TagCleaner: Identification and removal of tag sequences from genomic and metagenomic datasets. BMC bioinformatics. 11, 341(2010).
  28. Schmieder, R., Edwards, R. Quality control and preprocessing of metagenomic datasets. Bioinformatics (Oxford, England). 27 (6), 863-864 (2011).
  29. Schmieder, R., Edwards, R. Fast identification and removal of sequence contamination from genomic and metagenomic datasets. PloS One. 6 (3), e17288(2011).
  30. Welch, M., et al. Design parameters to control synthetic gene expression in Escherichia coli. PloS One. 4 (9), e7002(2009).
  31. Fiehn, O., et al. Quality control for plant metabolomics: reporting MSI-compliant studies. The Plant journal: for cell and molecular biology. 53 (4), 691-704 (2008).
  32. Zeng, Q., Chisholm, S. W. Marine viruses exploit their host’s two-component regulatory system in response to resource limitation. Current biology: CB. 22 (2), 124-128 (2012).
  33. Shindy, W. W., Smith, O. E. Identification of plant hormones from cotton ovules. Plant physiology. 55 (3), 550-554 (1975).
  34. Lee, H. I., Leon, J., Raskin, I. Biosynthesis and metabolism of salicylic acid. Proceedings of the National Academy of Sciences of the United States of America. 92 (10), 4076-4079 (1995).
  35. Chappell, J. The Biochemistry and Molecular Biology of Isoprenoid Metabolism. Plant Physiology. 107 (1), 1-6 (1995).
  36. Kitagawa, M., et al. Complete set of ORF clones of Escherichia coli ASKA library (a complete set of E. coli K-12 ORF archive): unique resources for biological research. DNA research: an international journal for rapid publication of reports on genes and genomes. 12 (5), 291-299 (2005).
  37. Baran, R., et al. Metabolic footprinting of mutant libraries to map metabolite utilization to genotype. ACS chemical biology. 8 (1), 189-199 (2013).

重印与许可

标签