本文介绍了用于假定噬菌体基因功能表征的表型组学方法。技术包括一种可监测宿主合成代谢的改良检测方法——多表型检测平板(MAPs),以及能够测量对分解代谢影响的既定代谢组学方法。
本文介绍了用于假定噬菌体基因功能表征的表型组学方法。技术包括一种可监测宿主合成代谢的改良检测方法——多表型检测平板(MAPs),以及能够测量对分解代谢影响的既定代谢组学方法。
目前对噬菌体-宿主相互作用的研究依赖于从(宏)基因组数据中推断信息。有趣的是,所有噬菌体序列中约有60%至95%与当前已注释的蛋白质无同源性。因此,大量噬菌体基因被注释为假想蛋白。这一现状严重影响了结构基因和辅助代谢基因的注释准确性。本文介绍了旨在捕捉特定宿主在表达某个未知噬菌体基因时所产生生理反应的表型组学方法。多表型检测板(MAPs)用于监测宿主底物利用的多样性及其后续的生物量形成,而代谢组学则通过监测代谢物的丰度与多样性来提供副产物分析。这两种工具同时使用,以获得与单个假定噬菌体开放阅读框(ORF)表达相关的表型特征。本文比较了两种方法的代表性结果,突出了携带假定结构基因或代谢基因的噬菌体宿主在表型特征上的差异。此外,还展示了支持实验分析的可视化技术以及高通量计算分析流程。
据估计,感染细菌的病毒(又称噬菌体或噬菌体病毒)在全球范围内以超过1031个病毒样颗粒(VLPs)的形式存在,其数量超过环境中所有其他生物体的总和1,2。首个针对海洋环境相关病毒群落的宏基因组学研究聚焦于病毒组分中多样性的量化分析3。此外,Breitbart 及其同事发现,超过65%的病毒群落序列与公共数据库中任何已知序列均无同源性。后续的宏基因组研究也发现了类似证据:来自美国加利福尼亚州圣迭戈海域沉积物的宏基因组中含有75%未知病毒序列4;来自索尔顿海高盐湖泊的宏基因组中含有98%未知病毒序列5;而与珊瑚相关的宏基因组中则含有95–98%未知病毒序列6。这些大量未注释的信息积累使得噬菌体的遗传物质被称为“生物学宇宙中的暗物质”7。
噬菌体的基因组表征依赖于通过与现有的核酸和蛋白质数据库进行比对,识别序列相似性。由于噬菌体编码的遗传信息大部分未知,基于同源性的方法效果有限。在其基因组中,噬菌体通常编码三类主要基因:转录与复制基因、代谢基因以及结构基因。转录与复制基因(I/II类基因8)包括聚合酶、引物酶、内切/外切核酸酶和激酶。这些基因因其在噬菌体感染过程中对转录和复制遗传物质的重要作用而高度保守。噬菌体聚合酶由于在全球范围内具有高度保守性,可通过传统的序列同源性方法 readily 被识别9,并已被证明可作为有效的系统发育标记10。相比之下,噬菌体的代谢基因和结构基因(II/III类基因8)差异性日益增大,常被注释为假想基因。
噬菌体的代谢基因会影响宿主的代谢能力,但不一定为病毒复制所必需。这些基因通常被称为辅助代谢基因11(AMGs),似乎能够调节宿主的代谢过程,从而促进感染的顺利进行并提高病毒颗粒成熟的成功率。AMGs 已被发现与限制性营养物质的利用和吸收,或能量生成途径相关。一些实例包括在多种蓝藻噬菌体基因组中发现的光合作用系统基因12-16、与磷酸盐代谢相关并受其调控的基因17,18,以及利用戊糖磷酸途径合成噬菌体脱氧核苷三磷酸(dNTP)的基因18,19。相比之下,结构基因是在感染过程中中晚期表达的基因,其种类在不同的噬菌体-宿主系统中存在差异。结构蛋白的合成依赖于病毒 dNTP 的供应以及转录、翻译和组装所需的能量储备8。衣壳和尾部纤维结构蛋白被认为是所有病毒蛋白编码基因中最为多样的,且对成功产生病毒颗粒至关重要。其高度多样性通常归因于它们在塑造病毒与宿主共进化过程中所发挥的积极作用20。无论属于哪一类基因,高度分歧的蛋白质在使用传统的同源性分析和序列比对技术时都容易被忽视。为弥补严格序列比较所存在的局限性,研究人员已开发出能够利用序列特征来推断基因功能关联的生物信息学工具,例如人工神经网络21。人工神经网络(ANNs)可用于预测结构基因和代谢基因,但仍需通过下游实验验证以直接确定基因功能。
本文的目的是提供能够监测宿主细菌在表达通过人工神经网络(ANN)功能预测的新型噬菌体基因过程中分解代谢和合成代谢的表型组学实验方案。表型组学是与细胞表型相关的生物学领域,在系统生物学中已得到广泛应用,有助于研究功能未知或具有多效性的蛋白质。表型组学工具可用于关联表型信息与基因型信息。我们假设,对于假定的噬菌体基因,其功能可通过观察在噬菌体基因表达期间对宿主产生的生理效应来确定。为验证该假设,选择了两种定量方法:多表型检测平板(MAPs)用于监测宿主对底物的利用及其后续生物量的形成,而代谢组学则用于测定在特定环境条件下生长期间宿主代谢物的多样性及相对丰度。在大肠杆菌(Escherichia coli)中过表达假定的结构蛋白和代谢蛋白,并对两项实验的代表性结果进行比较。本文介绍了多种可视化技术及高通量数据处理流程,以促进实验的重复。最后,结合已注释的衣壳蛋白、噬菌体代谢蛋白硫氧还蛋白以及两个假定的辅助代谢基因(AMGs)所预期产生的生理效应,讨论了所展示方法的可重复性与准确性。
1. 多表型检测平板(MAP)底物、基础培养基、预培养培养基和缓冲液的制备
2. 细菌细胞悬液的制备
3. 多表型检测板(MAPs)的制备
4. 多表型检测板(MAPs)的处理与参数化
[1]
[2]
[3]
[4]
[5]5. MAPs 的表型分析
[6]6. 构建连续培养装置
7. 用于代谢组学的连续培养运行
8. 用于代谢组学的连续传代批量培养
9. 代谢物分析与处理
[7]本研究中用于确定开放阅读框(ORFs)的所有样本均采集自莱恩群岛南部的圣诞岛7号站点(STAR7)和卡罗琳环礁9号站点(CAR9)。如先前所述5,使用舱底泵从珊瑚边界层下方采集了约100升海水。将泵中内容物通过大孔径滤膜进行分级过滤,以去除小型真核生物,随后使用100 kDa切向流滤膜浓缩,仅保留微生物和病毒样颗粒(VLPs)。为了分离VLPs,将剩余海水通过0.45 µm滤膜,从而获得病毒组(virome)。向该病毒组组分中加入氯仿以抑制任何残留细胞的生长,并在4 °C下保存。
使用氯化铯方法纯化VLP,该方法通过密度梯度离心分离,可在约1.35 g/ml至1.5 g/ml范围内回收病毒颗粒3。采用CTAB/苯酚:氯仿法提取病毒DNA,并利用Phi29试剂通过多重置换扩增进行扩增。病毒组测序采用 commercially available pyrosequencing technology 完成。
本研究中用于病毒ORF处理与筛选的生物信息学方法如下。对CAR9和STAR7病毒宏基因组进行了三个预处理步骤。首先,使用公开软件去除病毒DNA测序前扩增所产生的标签序列27。其次,通过另一生物信息学程序过滤掉常见的测序伪影,如序列重复和低拷贝数序列28。最后,对与以下数据库中序列具有≥90%覆盖度和≥94%同源性的序列进行外源序列污染去除29:RefSeq病毒基因组;人类——参考基因组GRCh37;人类——Celera Genomics;人类——Craig Venter(HuRef);人类——Seong-Jin Kim(韩国);人类——染色体7版本2(TCAG);以及人类——James Watson、YanHuang(YH;亚洲人)、Yoruba(NA18507;非洲人)参考序列21。经过上述处理后,CAR9样本的序列总数为591,600条,STAR7样本的序列总数为939,311条。这些序列被上传至MGRAST平台,并使用默认参数通过组装软件进行序列组装。将重叠群(contigs)翻译成6个阅读框,并如前所述使用脚本识别潜在的开放阅读框(pORFs)21。
为了鉴定未知的开放阅读框(ORF),进行了多种基于相似性的搜索,以去除已知功能的ORF。简而言之,以下搜索及其相应的搜索标准被实施21:
利用公开可用的基因设计软件,将获得的pORF设计用于在E. coli中表达。氨基酸序列的反向翻译采用通用密码子使用表,旨在适应E. coli中的表达,密码子最低使用频率阈值为2%。序列中排除了BamHI和HindIII的限制性酶切位点,以方便克隆。由外部公司合成改造后的基因序列30,随后通过标准的限制性酶切克隆方法将ORF克隆至中等拷贝数的pBAD启动子载体pEMB11中。所有克隆均转化至E. coli K-12菌株BW 2778423中。
多表型检测板(MAPs)
采用高通量且稳健的软件流程对微生物互作图谱(MAPs)进行分析,该流程为 PMAnalyzer24。该流程在 Linux 服务器环境中开发,可执行多个步骤,包括:解析光密度文件、将数据格式化为可读的文本文件、对生长曲线进行预处理以实现质量控制(QA),以及应用数学建模技术分析生长曲线。主要的建模脚本使用 Python 2.7.5 版本开发,以利用 PyLab 模块。
使用重复数据的标准误(SE)评估了MAPs的可重复性(图2A)。将原始生长曲线与逻辑生长曲线进行比较,以确定PMAnalyzer程序是否在实验过程中准确地对克隆生长进行了参数化和建模(数据未显示)。有关MAPs和PMAnalyzer的准确性与有效性的更多详细信息,请参见Cuevas 等24
在方法验证完成后,使用分析流程提供的多个参数(如最大生长速率(µmax)和生长水平(GL))对MAPs数据进行分析。比较生长曲线的可视化方法常用于解读生长数据;然而,能够同时可视化用于比较的曲线数量存在局限性。为了能够同时分析大量生长曲线,采用了基于热图的图示方法,将数十个克隆在单一底物上的生长情况与其对应条件下的平均响应进行比较(图2B)。通过观察生长曲线参数的变化——特别是延滞期、指数生长期和最大生物量产量(渐近线)——可以评估过表达一种新型噬菌体蛋白所产生的影响。例如,衣壳蛋白生长曲线中从延滞期迅速进入指数生长期的陡峭上升趋势(图2A),在图2B的动态图中表现为同一克隆的颜色强度从黑色快速变为白色。
为了获得克隆在不同底物上分布的全局图景,采用了基于基因型-表型关联(GL)得出的表型分类(图3)。在此,四种表型分别展示于四个图表中,每个柱状图的高度代表在特定底物上表现出该表型的克隆数量。数据中的异常值被识别为属于“功能获得”或“功能丧失”类别的克隆。这些异常值可被单独筛选出来,并通过实验进行更深入的研究。此外,全局分析还能识别实验中对某些底物的偏好性。例如,苯丙氨酸、苹果酸和甘氨酸等底物导致了“无生长”的分类。在所有克隆中 consistently 被归类为“无生长”的底物,在后续的功能表征分析中不会被赋予较高的权重。
代谢组学
通过代谢组学方法鉴定表达未知噬菌体基因的克隆所产生的分解代谢产物。简言之,在送至代谢组学核心设施进行GC-TOFMS分析之前,克隆菌株在连续培养或分批培养的连续传代条件下进行培养。有关所选核心设施实施的样品处理、分析及GC-TOFMS归一化的详细信息,请参见Fiehn et al.31。简要步骤如下:向每个样品中加入1 ml冷提取溶剂,随后对样品进行涡旋振荡,并在低温水浴中超声处理5分钟。最后将样品离心,倾出一半上清液并干燥后用于分析。提取物经纯化后加入内标保留指数标记物,然后上样至气相色谱仪,再转移至质谱仪。对每个样品的数据进行分析,报告色谱图中所有检测到的信号的信号强度。归一化处理时,首先将每个样品中所有峰的丰度求和,然后计算该样品组中所有样品总峰丰度的平均值。每个样品中代谢物的丰度除以其自身的峰丰度总和,再乘以该样品组的平均峰丰度。所得数据用于本研究所述的代谢组学分析。
为确定每种培养方法的适当样本量,需要验证代谢组学结果的可重复性。为检测样本内部的精确度以及不同样本量之间的变异情况,采用均值标准误(SM对于 n = 3 和 n = 6 的数据集均进行了审查(图5B)。无论连续培养(CC)样本量大小,少于1%的数据其SM ≤ 1.5. 中位数 SM分别为221和300,数值范围为0至7.55 × 105 和 3.74 × 105,n 分别为 3 和 6。SM在连续培养(SC)方法中,也针对每组样本重复计算了标准差(S)。同样,少于1%的数据其S值M ≤ 1.5,中位数 SM 137,范围为 0 到 3.51 × 105. 为了比较 SM 每组样本之间的分布(CC,n = 3) 与 CC n = 6,CC n = 3 与 SC n = 3,CC n = 6 与 SC n = 3)时进行了置换检验。对连续培养的SM 数值数据集与连续传代培养的S分布之间无显著差异M 值(p值 = 0.0)。然而,S的分布M 连续培养的数值 n = 3,数据与 S 组相比具有显著差异M 连续培养 n = 6 数据的数值(p 值 = 1.908804 × 10-49最后,比较了实施质量保证(QA)步骤前后每种代谢物的变异系数图5C)。总共在实施质量控制流程后移除了210种代谢物(占数据的40%)。被移除的数据中,少于1%的代谢物丰度为零,约2%为内标物数据,约5%为此前从未在样本中观测到的代谢物数据 E. coli,以及其余的代谢物(> 30% 的样本变异系数大于 1。
与MAPs分析类似,全局观察提供了对代谢组学所能提供的信息深度的初步理解。为了获得整体图景,根据各克隆相对代谢物丰度进行层次聚类,从而揭示克隆-代谢物谱型、功能可能相关的克隆以及克隆-代谢物中的异常值(图6)。为了突出蛋白质功能,将代谢物依据常见的代谢通路进行分离和分组。结合初步结果进行此项分析后明显发现,代谢组学能够区分来自不同类别的基因(图6,高亮显示的克隆)。此外,通过计算每个克隆-代谢物对的标准分数(z分数),确定了代谢组学数据中的异常值。为确保统计学显著性,将Z分数值为2的克隆-代谢物对定义为异常值,这类数据仅占全部数据的5%(数据未显示)。

图 1. 表型分类的定义。 (A)生长水平(GL)与最大生长速率之间的关系。用红色圈出的数据点代表显示极少或无底物利用的生长曲线。(B)基于最低生长速率(< 0.15 OD/hr)的生长曲线分布所定义的生长阈值的箱形图表示。(C)计算底物 D-半乳糖的 GL 的方差和标准差。短虚线表示距离均值两个标准差的范围。请点击此处查看该图的放大版本。

图2. 通过精确性和差异性验证MAPs。(A)结构基因(衣壳蛋白)和代谢基因(硫氧还蛋白)注释克隆、两个新发现的代谢克隆(EDT2440、EDT2441),以及在MAPs中于蔗糖、D-半乳糖和D-甘露糖上生长的克隆平均反应的生长曲线。蓝色线条表示重复实验数据之间的标准误差(n = 3)。(B)47个不同克隆在蔗糖、D-半乳糖和D-甘露糖上的生长曲线以热图形式展示。已注释的结构克隆(绿色圆圈)和代谢克隆(橙色圆圈)、两个新发现的代谢克隆(深蓝色和浅蓝色圆圈)以及平均反应(红色圆圈)被突出显示。请点击此处查看该图的放大版本。

图 3. 多种底物上各表型的克隆分布。 47 个克隆在 72 种碳源特异性生长条件下的表型-克隆计数。表格中提供了每种表型的直接计数值。 请点击此处查看该图的放大版本。

图4. 连续培养装置构建示意图。(A)连续培养反应器 α-γ 端口的构建步骤,(B)连续培养反应器出流端口的构建步骤,以及(C)连续培养进样瓶 δ 和 ε 端口的构建步骤。请点击此处查看该图的放大版本。

图 5. 所介绍的表型组学方法的比较。 (A)多表型检测板(MAPs)、连续培养和连续传代培养的制备流程。(B)针对代谢组学分析中连续培养(CC)和连续传代培养(SC)制备方法,在样本量 n = 3 和 n = 6 时,均值标准误(SM)所占百分比。y 轴采用对数刻度。(C)在实施质量控制流程前后,每种代谢物的变异系数(CV)分布情况。请点击此处查看该图的放大版本。

图6. 连续培养条件下克隆的代谢组学谱型。 展示了在连续培养条件下生长的84个克隆中一组代谢物的中位代谢物丰度。标注的结构蛋白类(衣壳蛋白)和代谢类克隆(硫氧还蛋白)、两个新发现的代谢类克隆(EDT2440、EDT2441)以及平均代谢响应的代谢物谱型以红色突出显示。请点击此处查看该图的高清版本。
| 化合物 | 碳 | 氮 | 硫 | 磷 |
| Glycerol | − | 0.40% | 0.40% | 0.40% |
| Ammonium chloride | 9.5 mM | − | 9.5 mM | 9.5 mM |
| Sodium sulfate | 0.250 mM | 0.250 mM | − | 0.250 mM |
| Magnesium sulfate | 1.0 mM | 1.0 mM | − | 1.0 mM |
| Potassium phosphate | 1.32 mM | 1.32 mM | 1.32 mM | − |
| Magnesium chloride | − | − | * | − |
| Potassium chloride | 10 mM | 10 mM | 10 mM | 10 mM |
| Calcium chloride | 0.5 µM | 0.5 µM | 0.5 µM | 0.5 µM |
| Sodium chloride | 5 mM | 5 mM | 5 mM | 5 mM |
| Ferric chloride | 6 µM | 6 µM | 6 µM | 6 µM |
| L- arabinose | 0.10% | 0.10% | 0.10% | 0.10% |
| MOPS pH 7.4 | 1x | 1x | 1x | 1x |
表1. MAPs中使用的不同基础培养基的化合物及其浓度。 *以1.0 mM氯化镁替代。1x MOPS = 40 mM MOPS,4 mM Tricine。
| 碳源底物 | 氮源底物 | 硫源底物 | 磷源底物 |
| 2-脱氧-D-核糖 | 2-脱氧-D-核糖 | 1-丁烷磺酸 | 腺苷-5-单磷酸 |
| 4-羟基苯乙酸 | 乙酰胺 | 乙酰半胱氨酸 | β-甘油磷酸 |
| 乙酸 | 腺嘌呤 | D-半胱氨酸 | 磷酸肌酸 |
| 腺苷-5-单磷酸 | 腺苷 | D-蛋氨酸 | D-葡萄糖-6-磷酸 |
| 阿东醇 | 尿囊素 | 二乙基二硫代磷酸盐 | 二乙基二硫代磷酸盐 |
| α-D-葡萄糖 | β-苯乙胺 | DL-乙硫氨酸 | DL-α-甘油磷酸 |
| α-D-乳糖 | 双缩脲 | 谷胱甘肽 | 磷酸钾 |
| α-D-蜜二糖 | 胞苷 | 异乙酸 | 焦磷酸钠 |
| 柠檬酸 | 胞嘧啶 | L-半胱酸 | 硫代磷酸钠 |
| D-丙氨酸 | D-丙氨酸 | L-半胱氨酸 | |
| D-阿拉伯糖 | D-天冬酰胺 | L-二酮基酸 | |
| D-阿拉伯醇 | D-天冬氨酸 | L-蛋氨酸 | |
| D-天冬酰胺 | D-半胱氨酸 | 硫酸镁 | |
| D-天冬氨酸 | D-葡糖胺 | 甲烷磺酸 | |
| D-纤维二糖 | D-谷氨酸 | N-乙酰-DL-蛋氨酸 | |
| D-半胱氨酸 | DL-α-氨基丁酸 | N-乙酰-L-半胱氨酸 | |
| D-果糖 | D-蛋氨酸 | 四硫代酸钾 | |
| D-半乳糖 | D-丝氨酸 | 硫代硫酸钠 | |
| D-葡糖胺 | D-缬氨酸 | 磺酸 | |
| D-葡萄糖 | γ-氨基丁酸 | 牛磺酸 | |
| D-葡萄糖-6-磷酸 | 甘氨酸 | 牛磺胆酸 | |
| D-谷氨酸 | 胍 | 硫脲 | |
| D-甘露糖 | 组胺 | ||
| D-棉子糖 | 肌苷 | ||
| D-核糖 | L-丙氨酸 | ||
| D-水杨苷 | L-精氨酸 | ||
| D-丝氨酸 | L-天冬酰胺 | ||
| D-海藻糖 | L-瓜氨酸 | ||
| D-木糖 | L-半胱氨酸 | ||
| 卫矛醇 | L-谷氨酸 | ||
| 甘油 | L-谷氨酰胺 | ||
| 甘氨酸 | L-谷胱甘肽 | ||
| 内消旋-赤藓醇 | L-组氨酸 | ||
| 肌苷 | L-异亮氨酸 | ||
| L-丙氨酸 | L-亮氨酸 | ||
| L-阿拉伯糖 | L-赖氨酸 | ||
| L-阿拉伯醇 | L-蛋氨酸 | ||
| L-天冬酰胺 | L-鸟氨酸 | ||
| L-天冬氨酸 | L-苯丙氨酸 | ||
| L-半胱酸 | L-脯氨酸 | ||
| L-半胱氨酸 | L-焦谷氨酸 | ||
| L-岩藻糖 | L-丝氨酸;L-苏氨酸 | ||
| L-谷氨酸 | L-色氨酸 | ||
| L-谷氨酰胺 | L-缬氨酸 | ||
| L-异亮氨酸 | N-乙酰-D-葡糖胺 | ||
| L-亮氨酸 | 腐胺 | ||
| L-赖氨酸 | 硫脲 | ||
| L-蛋氨酸 | 胸苷 | ||
| L-苯丙氨酸 | 胸腺嘧啶 | ||
| L-焦谷氨酸 | 酪胺 | ||
| L-鼠李糖 | 酪氨酸 | ||
| L-丝氨酸 | 尿苷 | ||
| L-山梨糖 | |||
| L-苏氨酸 | |||
| L-色氨酸 | |||
| L-缬氨酸 | |||
| L-木糖 | |||
| 乳酸 | |||
| 乳果糖 | |||
| 苹果酸 | |||
| 肌醇 | |||
| 草酸 | |||
| 山梨酸钾 | |||
| 丙酸 | |||
| 腐胺 | |||
| 奎宁酸 | |||
| 丙酮酸钠 | |||
| 琥珀酸钠 | |||
| 蔗糖 | |||
| 胸苷 | |||
| 木糖醇 |
表2. MAP实验中使用的底物列表。
本文介绍了用于假定噬菌体基因功能表征的表型组学方法。这些技术包括一种可监测宿主合成代谢的改良检测方法——多表型检测平板(Multi-phenotype Assay Plates, MAPs),以及能够测量对分解代谢影响的成熟代谢组学方法。我们还提供了额外的工具,用于管理这些技术所产生的大规模数据集,从而实现高通量的数据处理与分析24。最后,通过比较已注释的噬菌体衣壳蛋白、噬菌体硫氧还蛋白、两个假定的代谢相关噬菌体基因以及平均实验响应,我们提出了多种策略,用于解读这两类数据集和基因类别,重点在于识别表型趋势和异常值。
如前所述,这两种方法在定量上仅能测量宿主代谢的一半。为了阐释所研究的任何新蛋白质的相对功能,需要结合两种方法的数据来提供功能证据。尽管这并非我们当前论文的重点,但每种表型组学方法产生的数据都会进行组合分析,重点采用随机森林和主成分分析等聚类技术。此外,组合分析得出的假设必须随后通过传统的遗传学方法加以验证。
最后,所介绍的方法在很大程度上受到细菌生理学的影响,因此遵循相同的标准。在实施任一方法时,必须考虑确保实验对象为独立的克隆群体;防止污染;仅测试单一变量;并同时运行适当的对照。若未考虑这些因素,将导致结果不明确,与其他任何生理学检测的结果类似。
多表型检测平板(MAPs)
与现有技术相比,MAPs 的开发提供了一种高通量且可灵活调整的检测方法(图5A 和 表1、2)。该检测方法使用所有微生物学实验室中常见的耗材、设备和基本技术。通过整合用于后续数据处理与分析的计算流程 PMAnalyzer24,可确保快速解读数据。此外,该方法的实验和分析部分均可根据定制需求轻松调整或优化。例如,如果大部分数据未能通过第4节中所述的过滤标准,可手动检查生长曲线以识别问题所在。若问题源于过于严格的过滤参数,可对脚本进行相应调整;若问题与实验过程相关(例如,冷凝时间过长、细菌细胞转移不当等),则可方便地重复增加实验重复次数。
如 Cuevas 等24 所述,PMAnalyzer 是一个用 bash 编写的单一程序,作为封装脚本运行,可将解析和分析脚本作为统一、自动化的流程执行。所有脚本均可从 Git 仓库免费获取25,通过计算三份重复数据中每个时间点的中位数值,进而对逻辑曲线进行参数化,以获得滞后期、最大生长速率、渐近值以及一个新提出的参数——生长水平(Growth Level)。在本研究中,我们选择中位数而非平均值,以减少显著离群值的影响;然而,该脚本可轻松修改以计算重复数据的平均值。由于在重复数据中观察到的变异程度较低(标准误差,SE)(图 2A),我们在 PMAnalyzer 中继续采用中位数来拟合逻辑曲线。此外,本研究中定义的生长阈值(GL ≥ 0.4)是通过比较生长水平与最大生长速率在数据分布上的分离情况而确定的(图 1A,B)。根据所使用的仪器和模型系统的不同,该阈值可能有所变化,需重新定义此截断值。
我们检测方法的一个主要优势在于能够利用一个表征微生物总体生长情况的单一参数来比较表型,我们将该参数定义为生长水平(Growth Level, GL)。GL 采用调和平均数计算,因此可减轻数据中较大离群值的影响。通过反复试验,最终确定使用经位移逻辑拟合值的调和平均数来综合反映生长状况。其他曾尝试用于区分生长情况的方法包括:达到特定曲线参数所需的时间(如半最大生长速率 µ)最大,µ最大,以及环境容纳量),决定系数(R2),以及R的组合2 乘以特定的曲线参数。在评估生长情况时,使用经平移的逻辑拟合值的调和平均数来计算GL,可提供最广泛的分析范围,因此成为首选方法。需要注意的一点是,当使用单一参数或拟合模型时,动态生长曲线模式的特征可能丢失。例如,逻辑曲线和GL的各个独立曲线参数无法反映双相生长。在单一碳源环境中,这种对生长的影响意味着病毒蛋白可能介导了底物的转化或底物利用方式的转变。若不考虑多个生长参数,还可能忽略其他潜在效应,包括:延长的滞后期,提示病毒机制或产物带来的负担增加;指数期快速加速,提示病毒蛋白与宿主能量生成通路相偶联;或生物量形成水平更高,暗示病毒在宿主营养摄取和合成代谢中起到支持作用(数据未显示)。因此,绘制新生长曲线(图2A、B) 提供了随时间变化的趋势信息,而GL则考虑了逻辑模型中的主要变量,提供一个单一的定量数值来表示克隆的整体成功程度。
在考虑MAP中结构基因与代谢基因所贡献的不同响应时,发现所研究的不同底物类别为蛋白质功能提供了最有力的证据。例如,代谢蛋白通常与获取限制性营养物质相关,而这些营养物质与宿主中心代谢无特异性关联16,32。初步的MAP实验显示,携带推测代谢功能噬菌体基因的克隆在利用中心代谢碳源生长时,滞后期显著延长(图2A)。相反,携带推测结构基因的克隆由于需要大量消耗宿主的能量和dNTP池,在中心代谢及氨基酸代谢碳源上的生长表现为假阳性反应。这可能是由于不溶性蛋白的积累导致宿主细胞丝状化和/或包涵体形成,显微观察结果支持这一推断(图2A及未展示数据)。尽管仍需进一步分析以验证这些初步结果,但MAP能够获取与特定噬菌体基因类别假设功能相对应的表型响应。
除了阐明未知病毒蛋白外,微生物培养平台(MAPs)还为研究单个细菌或细菌群落的功能与代谢多样性提供了新的资源。MAP 组件设计为易于调整,以支持多种细菌的生长,包括海洋细菌、营养缺陷型细菌以及厌氧微生物。为了实现这一目标,在 MAPs 中培养不同属的细菌之前,需要向已定义的基础培养基和预培养基中添加或调整特定的化学成分。使用 MAPs 时需要注意的是,必须保持培养基成分的明确性,禁止使用胰蛋白胨、酵母提取物和蛋白胨等成分。
代谢组学
代谢组学领域依赖于代谢物数据库,这些数据库包含通过质谱鉴定出的独立代谢物。此处选用的核心平台拥有规模最大的代谢组学数据库之一。有趣的是,我们实验中检测到的代谢物中超过一半无法被鉴定(约65%),其余部分则从未在我们的宿主Escherichia coli中被记录过(例如:吲哚-3-乙酸33、水杨酸34和二氢松香酸35)。这一现象可能归因于数据库对植物代谢物的强烈偏向,或与当前研究的特定蛋白质有关。无论原因如何,结果是可用于数据呈现与分析的已知代谢物数量有限。未来,结合多种代谢组学方法并利用不同的数据库,将有助于实现更全面的代谢物覆盖。
目前,在比较和分析我们发现的新型病毒蛋白时,会同时使用已知和未知的代谢物。基于这一方法,我们推测,携带功能相似蛋白的克隆株其整体代谢组学谱图也会表现出更高的相似性。初步的代谢组学分析显示,尽管结构基因与代谢基因之间没有明显的分离趋势,但那些在过表达时对宿主产生相似效应的基因确实存在相关性(图6)。例如,被注释为衣壳蛋白(Capsid)的基因与本研究中重点标注的假定代谢基因EDT2440和EDT2441聚类紧密。利用公开可用的跨膜拓扑结构和信号肽预测程序进行分析发现,这两个假定的代谢基因均含有一个跨膜结构域。有趣的是,在系统发育树左侧第一个聚类组的9个克隆中,有5个通过相同的拓扑结构预测程序显示出存在跨膜结构域。然而仍需进一步研究,但很可能这些克隆在过表达过程中所呈现的代谢物与细胞应激反应相关,这种应激可能源于膜结构或结构蛋白带来的负担。该证据表明,尽管代谢组学数据中存在一定水平的噪声,该方法仍能够识别出反映基因总体效应的信号,无论是在同一基因类别内部还是跨类别之间。为了确定该方法是否能够提取出基因功能的特异性信息,我们将代谢物归类到特定的代谢通路中。其假设是:如果某个克隆影响了某一通路中特异性的代谢物,则该过表达基因很可能参与该通路。在建立我们的代谢组学质量控制流程之前,初步数据显示,富集或耗竭的代谢物通常被标记为“未知”,因此难以判断其关联的代谢通路(数据未显示)。然而,经过预处理的代谢组学数据表明,大多数代谢物谱图相似,仅少数已知和未知代谢物的丰度在不同克隆间存在差异,例如腐胺(putrescine)和尿嘧啶(uracil)(图6)。为了更精确地解析蛋白功能,目前正致力于将新发现的噬菌体基因与已知功能的噬菌体基因进行实验性比对,从而填补基于代谢物的功能表征中存在的“空白”。通过该技术,已知病毒基因的功能可作为未知基因功能推断的参考依据。然而,代谢组学分析的局限性在于数据库的规模及其相关性。为克服这些限制,亟需建立与本研究相关的代谢组学数据库,例如针对E. coli ASKA克隆文库中单个ORF过表达条件下特异的代谢物及其丰度的数据库36。2013年,劳伦斯伯克利国家实验室的研究人员编制了首个针对模式细菌全突变体文库的综合性代谢物数据库,为这类数据库的必要性提供了证据37。该研究揭示了特定代谢物利用所必需的基因,明确了表型与基因型之间的清晰联系。
在将代谢组学作为研究工具时,明确核心设施所采用的处理流程至关重要。大多数实验流程都会产生一个常见的人为因素,即实验仪器在不同日期使用时带来的日常变异。迄今为止,所有气相色谱-质谱(GC-MS)分析均采用在每次分析运行中加入内标物的方法;然而,若在每一天的实验过程中额外加入项目特异性的内标样品,则可进一步消除额外的变异。这些因素必须在实验早期就予以考虑,以避免归一化过程中的问题和偏差。另一种解决方案是在同一核心设施中使用同一台仪器,并将所有样品作为单一批次进行处理,这一选项在任何核心设施中均可实现。
本文介绍并重新探索的各种工具为筛选和表征功能未知的噬菌体基因提供了新颖的方法。这些实验技术简单且具有良好的适应性,结合计算流程的高效使用,确保了这些方法可广泛应用于多种科研领域。我们的目标是,本文所呈现的表型组学方法将有助于进一步研究新型噬菌体蛋白,以及同样存在功能未知的其他系统。
作者无任何利益冲突需要披露。
感谢 Benjamin Knowles、Yan Wei Lim、Andreas Haas 以及病毒暗物质联盟(Viral Dark Matter consortium)成员对本手稿提供的帮助和建设性意见。本研究由美国国家科学基金会(National Science Foundation,项目编号:DEB-1046413)资助,是“维度计划:揭示病毒暗物质”(Dimensions: Shedding Light on Viral Dark Matter)项目的一部分。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 0.22 µm 无菌滤膜(Sterivex 滤器) | 赛默飞世尔科技 | SVGP01050 | Millipore |
| 0.22 µm Millex 滤器 | 赛默飞世尔科技 | SLGV033RS | Millipore |
| 0.22 µm SteriCap 滤器 | 赛默飞世尔科技 | SCGPS02RE | Millipore |
| 0.22 µm Omnipore 膜滤器 | Millipore | JHWP02500 | Millipore |
| 96 孔微孔板 | VWR | 82050-764 | 标准 F 型底 96 孔微孔板 |
| 2 ml 96 孔板 | 赛默飞世尔科技 | ||
| 微孔板粘性封板膜 | Sigma-Aldrich | Z369667 | |
| 2 L Nalgene 方形瓶 | Cole Parmer | T-06040-70 | |
| 125 ml Nalgene 方形瓶 | Cole Parmer | T-06040-50 | |
| 1/4 英寸面板安装锁紧螺母,黑色尼龙材质 | Cole Parmer | EW-45509-04 | |
| 雌性鲁尔螺纹式面板安装接头转 200 系列卡套,1/16 英寸 | Cole Parmer | EW-45500-30 | |
| 雌性鲁尔螺纹式面板安装接头转 200 系列卡套,1/8 英寸 | Cole Parmer | EW-45500-34 | |
| 带锁环的雄性鲁尔接头转 500 系列卡套,适用于内径 1/16 英寸的管路 | Cole Parmer | EW-45505-31 | |
| 带锁环的雄性鲁尔接头与雌性鲁尔耦合器 | Cole Parmer | T-45508-80 | |
| 卡套式贯通接头,外径 1/4 英寸 | 赛默飞世尔科技 | 6149-0002 | |
| Sanipure 管路,内径 1/16 英寸 × 外径 1/8 英寸 | SaniPure | AR400002 | |
| Sanipure 管路,外径 1/4 英寸 × 内径 1/8 英寸 | SaniPure | AR400007 | |
| 可调流速微型泵(蠕动泵) | 赛默飞世尔科技 | 13-876-1 | |
| 磁力搅拌器 | Velp Scientifica | F203A0160 | |
| 镊子 | 赛默飞世尔科技 | 14-512-141 | Millipore* 滤膜专用镊子 |
| 多孔板分光光度计读板仪 | Molecular Devices Analyst GT | ||
| 滤膜真空过滤装置(滤器 manifold) | 赛默飞世尔科技 | XX10 025 02 | |
| 软件: | |||
| Python 版本 2.7.5 | http://www.python.org/ | ||
| PyLab 模块 | http://wiki.scipy.org/PyLab | ||
| R 版本 3.0.1 | http://www.r-project.org/ | ||
| reshape2 程序包 | http://had.co.nz/reshape | ||
| ggplot2 程序包 | http://ggplot2.org/ | ||
| Gene Composer | PSI 技术门户 | http://www.genecomposer.net | |
| 服务: | |||
| 西海岸代谢组学中心 | 加州大学戴维斯分校 | http://metabolomics.ucdavis.edu | |
| DNA 2.0 | https://www.dna20.com |