以囊性纤维化气道为例,该论文提出了一套综合性的实验流程,结合宏基因组学和宏转录组学方法,用于表征与动物相关的样本中的微生物和病毒群落。
方法文章
以囊性纤维化气道为例,该论文提出了一套综合性的实验流程,结合宏基因组学和宏转录组学方法,用于表征与动物相关的样本中的微生物和病毒群落。
高通量测序技术的普及已彻底改变了生物学的众多领域。为了更深入地理解宿主相关的病毒和微生物群落,研究人员开发了一套全面的DNA和RNA提取工作流程。该流程可从单个样本中同时生成病毒和微生物的宏基因组以及宏转录组,用于下一代测序。这些方法的结合可提供关于群落分类学特征及其编码功能的全面视图。所介绍的方法使用囊性纤维化(CF)痰液样本——一种具有挑战性的样本类型,因其极为黏稠,并含有大量黏蛋白、游离的中性粒细胞DNA以及其他未知污染物。此处描述的实验方案针对上述问题进行了优化,能够成功回收病毒和微生物DNA,同时最大限度减少人源DNA的污染。为补充宏基因组学研究,还优化了一项宏转录组学实验流程,用于回收微生物和宿主mRNA,其中核糖体RNA(rRNA)序列含量相对较少。本文提供了数据特征的概述,可作为评估方法成功与否的参考依据。此外,还收集了其他CF痰液样本,以(i)评估单个患者在连续七天内微生物组谱的稳定性,以及(ii)比较宏基因组学方法与基于16S核糖体RNA基因测序方法的一致性。结果表明,在未使用抗生素干扰的情况下,微生物谱的日间波动极小;且常见CF相关细菌的分类谱在低渗裂解(HL)来源DNA构建的16S rDNA文库与宏基因组之间高度相似。然而,由总DNA和HL来源DNA生成的16S rDNA分类谱之间的差异表明,低渗裂解及后续洗涤步骤不仅有助于去除人源DNA,还能去除可能歪曲真实微生物谱的微生物来源的胞外DNA。
过去十年中,通过应用测序技术,已对与人体相关的病毒和微生物群落进行了广泛研究1,2。这些研究结果促使人们认识到微生物在人类健康与疾病中的重要作用。其中主要推动力来自人类微生物组计划,该计划描述了存在于人体皮肤、口腔腔隙、呼吸道、泌尿生殖道以及胃肠道中的细菌(以及部分古菌)3。通过对健康人呼吸道开展的进一步微生物组研究,包括支气管肺泡灌洗(BAL)4,5 和鼻咽拭子采样4,发现肺部可作为环境采样装置,导致微生物在呼吸道中短暂定植。然而,微生物在受损呼吸道表面的定植可能引发严重且慢性的肺部感染,例如囊性纤维化(CF)患者中所观察到的情况。
囊性纤维化是一种由囊性纤维化跨膜调节因子(CFTR)基因突变引起的致死性遗传病6。这些突变导致CFTR蛋白功能缺陷,进而影响上皮细胞顶端表面的跨上皮离子转运。该疾病累及多个器官系统,但大多数病死率和发病率归因于囊性纤维化肺病7。囊性纤维化肺部为微生物定植提供了独特的生态系统。离子转运缺陷导致黏液在气道内积聚,形成以静止、富含营养的黏膜表面为锚定点的好氧、微需氧和厌氧微环境。这种环境促进了包括病毒、细菌和真菌在内的微生物定植与增殖。急性和慢性肺部微生物感染引发持续但无效的免疫反应,导致广泛的气道重塑、肺功能下降,最终发展为呼吸衰竭。
囊性纤维化(CF)肺部相关的细菌群落已通过依赖培养和不依赖培养的方法得到了充分描述,这些方法包括16S核糖体RNA(rRNA)基因测序8和宏基因组鸟枪法测序9,10。基于16S rRNA的方法能够表征多种微生物物种,并捕捉群落多样性的广泛变化。然而,该方法在解析群落结构方面的分辨率有限(详见Claesson et al. 201011的总结),且对代谢潜能的预测仅限于所鉴定分类单元已知的一般功能。因此,16S rRNA基因测序方法在分析CF肺部复杂微生物群落所需的分类学和功能分析精度方面存在不足。本文所述的宏基因组学方法可补充基于16S rRNA的分析,克服其局限性,并提供一种相对高效的方法,用于同时分析CF肺部微生物群落的分类组成和基因内容。
从与动物相关的样本中分离出的微生物DNA通常含有大量宿主DNA。囊性纤维化(CF)痰液或肺组织样本通常含有大量由免疫反应中性粒细胞释放的人源DNA,常占总DNA的99%以上12–14。尽管可能存在一些完整的宿主细胞,但大部分DNA以游离状态存在于溶液中,或吸附在微生物表面。此外,高度黏稠的黏液栓、细胞碎片以及其他未知污染物的存在,进一步增加了微生物细胞分离的难度。已有多种方法被尝试用于去除样本中的人源DNA,包括使用Percoll梯度离心分离人细胞与微生物细胞15、DNase I处理、溴化乙锭单叠氮化物选择性降解人源DNA16,以及MolYsis试剂盒,但效果均有限。迄今为止,针对CF痰液样本最有效的微生物DNA纯化方法是Breitenstein et al.(1995)17所描述方法的改进版本。该方法在此称为低渗裂解法(hypotonic lysis, HL),结合使用β-巯基乙醇断裂黏蛋白中的二硫键、低渗条件裂解真核细胞,以及DNase I降解游离DNA9。尽管尚无更优替代方案,HL方法仍引发了一些担忧:(i)可能因微生物非预期裂解而引入偏差;(ii)观察到的菌群组成波动9,10是否为样本处理过程中技术变异所导致的人工假象。除构建宏基因组测序文库外,本研究还通过分析同一患者连续七天采集的痰液样本,比较HL法提取的总DNA与微生物DNA的16S rRNA基因谱,以探讨上述问题。
与微生物群落相比,与动物相关的病毒群落特征研究仍较为有限18,19。囊性纤维化(CF)气道中的病毒群落仅得到初步表征20–22。首项针对CF气道病毒群落DNA的宏基因组学研究显示,与CF肺部相关的大多数病毒为噬菌体20。CF个体与非CF个体中噬菌体的代谢潜能存在显著差异。具体而言,CF个体中的噬菌体群落携带反映细菌宿主对CF气道生理环境适应性以及细菌毒力相关特征的基因20。后续针对CF肺组织中病毒的宏基因组学研究进一步揭示了不同解剖区域之间病毒群落在空间分布上的显著异质性22。此外,CF肺组织中病毒多样性为迄今在任何生态系统中观察到的最低水平22。所鉴定出的大多数病毒为噬菌体,具有感染CF致病菌的潜力。然而,也检测到真核病毒,如疱疹病毒、腺病毒和人乳头瘤病毒(HPV)。在一次解剖过程中观察到肺组织中存在囊肿时,即使该患者从未被诊断患有肺乳头瘤或癌,仍成功回收了超过99%的人乳头瘤病毒基因组。这表明,存在的病毒多样性不仅反映了组织损伤的严重程度,还可能揭示并解释一种尚未被认知的潜在疾病。本文所述方案提供了一种简单而有效的方法,用于从含有大量黏稠黏液、宿主与微生物细胞、游离DNA以及细胞碎片的样本中分离病毒样颗粒(VLPs)。
宏转录组学可补充宏基因组学,用于监测微生物群落及宿主中基因表达的动态变化9,23。在此情况下,需要优先富集微生物和宿主的mRNA。由于细菌mRNA不具有多聚腺苷酸化结构,因此无法采用基于寡核苷酸-dT的mRNA富集方法。如果已知宿主相关样本中含有大量真核生物mRNA,则也不能使用依赖多聚腺苷酸化的RNA扩增技术。许多与动物相关的样本(包括囊性纤维化痰液)除了含有高浓度的细胞外,还含有大量细胞碎片以及包括RNase在内的核酸酶。因此,另一项具有挑战性的任务是在宏转录组处理过程中防止RNA严重降解。在大多数情况下,从囊性纤维化痰液中提取的总RNA已发生部分降解,限制了后续应用及所获得RNA的利用价值。近年来,已有多种核糖体RNA(rRNA)去除方法被开发并整合到商业试剂盒中。然而,这些方法的效果有限,尤其是在处理部分降解的rRNA时效果更差9,24。本文所采用的方法能够获得部分降解但仍适用于高效去除总rRNA的总RNA。Lim et al.(2012)通过直接比较两种不同试剂盒在去除部分降解总RNA中的rRNA效率,对此进行了说明9。
总体而言,本论文的目标是提供一套完整的实验方案(图1),以诱导痰液样本为例,从单一的宿主相关样本中同时构建病毒和微生物的鸟枪法宏基因组以及宏转录组。分子生物学实验流程应设有独立的扩增前和扩增后操作区域,以最大限度减少交叉污染。本方法可轻松适用于其他类型的样本,如组织22、鼻咽和口咽拭子25、支气管肺泡灌洗液(BAL)以及珊瑚样本(未发表数据)。尤其在需要开展微生物宏基因组学和宏转录组学研究时,样本应在采集后立即处理。若样本经过冷冻,可能破坏微生物细胞的完整性,从而限制完整微生物细胞的分离,影响微生物宏基因组的构建。然而,冷冻并不完全排除开展宏转录组学研究或病毒分离的可能性,但冻融过程可能影响RNA的质量以及回收病毒颗粒的数量。值得注意的是,在多项与成年囊性纤维化(CF)患者及其他慢性肺部疾病相关的研究中,诱导痰液一直是主要的样本来源26,27,因为支气管肺泡灌洗可能具有较强侵入性。在我们的研究中,痰液样本采用谨慎且一致的采样方法收集,即,在采集前使用无菌生理盐水漱口并冲洗口腔,以将口腔微生物对痰液样本的污染降至最低。
注意:诱导痰样本由加州大学圣地亚哥分校(UCSD)成人囊性纤维化诊所的研究协调员根据加州大学机构审查委员会(HRPP 081500)和圣地亚哥州立大学机构审查委员会(SDSU IRB#2121)的规定采集。
1. 样本采集与预处理(采集后30分钟内进行样本预处理)
2. 病毒宏基因组的生成
3. 生成微生物宏基因组
4. 生成宏转录组
病毒宏基因组
囊性纤维化(CF)痰液极为黏稠,含有大量的黏蛋白和游离DNA(图2A);密度梯度超速离心有助于去除宿主来源的DNA(图2B)。此处总结了先前一项研究9的结果,该研究利用所述实验流程获得了八个病毒组(表1)。其中七个样本(CF1-D、CF1-E、CF1-F、CF4-B、CF4-C、CF5-A 和 CF5-B;表1)按第2节所述方法进行处理。所获得的病毒组中,除一个样本外(70%),人源序列含量均很低(0.02%–3.7%)。样本CF4-A未经过密度梯度超速离心步骤,由此样本生成的病毒组中人源序列占比>97%(表1)。图2展示了典型CF痰液样本在密度梯度超速离心前(图2A)和后(图2C)的荧光显微镜图像示例。密度梯度分离后的显微图像中可见清晰的病毒样颗粒(VLPs),且无大颗粒存在。在提取VLPs DNA后,通常在对VLPs DNA进行测序前,通过16S rDNA扩增检测是否存在细菌污染。
微生物宏基因组
本研究中提供的七份痰液样本来自一名囊性纤维化(CF)患者,采集时间为连续七天。该患者在第3天采集痰液样本后开始口服抗生素(环丙沙星和多西环素)。该患者在7天内每天采集的痰液样本体积均为15 ml,因此未向样本中添加PBS。本次采样的目的是通过以下两个方面评估本工作流程中所述方案的有效性:(i)评估微生物群落结构的每日波动情况;(ii)比较宏基因组测序与16S rDNA测序在微生物群落结构及其分辨率上的差异。因此,从每份样本中均提取了总DNA和HL-DNA。
各痰液样本在DNA提取后的HL-DNA浓度见表2。HL-DNA的总得率范围为210 ng至>5 μg。每个样本以1 ng总起始量构建Illumina测序文库(图3)。宏基因组数据的特征见表2。除一个文库外,其余所有文库均获得超过100万条序列,并在使用PRINSEQ29软件进行数据预处理后保留了超过85%的高质量序列。所有数据集首先经过预处理,以去除重复序列和低质量序列(最低质量值为25),随后使用DeconSeq30进一步筛选并去除人源序列。人源序列污染程度高度依赖于样本特性。本研究中,人源序列总量范围为14%-46%(表2)。预处理后的序列随后使用Metaphlan31分析流程及MG-RAST32服务器进行注释。
除了宏基因组外,还使用引物从总DNA和HL-DNA扩增16S rDNA文库,引物靶向16S rRNA基因V1-V2可变区约300 bp的片段33,34。来自各个样品的PCR产物经标准化后混合,并在MiSeq平台上使用Illumina 500循环双端测序进行测序。双端16S rDNA扩增子序列通过条形码使用Python脚本按样品分类,并利用phrap35,36对成对读段进行拼接。采用5 nt滑动窗口,对拼接后的序列末端进行修剪,直至平均质量值≥20。随后使用Uchime37比对SILVA38参考序列中无嵌合体的子集,去除潜在的嵌合序列。使用SINA39(版本1.2.11)比对SILVA38数据库中的418,497条细菌序列,对高质量读段进行分类学注释。具有相同分类学注释的序列被聚类为操作分类单元(OTUs)。该过程共生成16个样品的1,655,278条序列(平均每样品103,455条序列;最小值:72,603;最大值:127,113)。测序完整性的评估指标Goods覆盖度中位数≥99.9%。分析及图表生成使用软件包Explicet40(v2.9.4,www.explicet.org)。在Explicet中,以72,603条序列为稀疏化标准,进行100次bootstrap重采样,计算α多样性(样品内多样性)和β多样性(样品间多样性)。
本研究首先针对的问题是低渗裂解是否优先选择性地富集(即,优先保留或裂解特定类群的微生物。第一次低渗裂解后,从前两个样品(CF1-1A* 和 CF1-2A*)中重新悬浮的沉淀细胞被分出部分,用于与第二次低渗裂解后的相同样品(CF1-1 和 CF1-2)进行比较。所有样品均经过相同处理, 即,DNA提取前先用DNase I处理,随后进行DNA提取及测序流程。如图所示 图 4,经过两次低渗裂解处理后,各亚样品的微生物谱与样品的微生物谱高度相似。此外,第二次低渗裂解使宏基因组中非人源序列的比例增加了6–17%表 2).
为了检测基于宏基因组学和16S rDNA分析的微生物组成差异,以及在低渗裂解前后可能解释我们先前研究与其他研究之间差异的变化,分别从总DNA和低渗裂解(HL)获得的DNA制备了细菌16S rDNA测序文库(图4B)。在属水平上,常见囊性纤维化相关细菌(如Pseudomonas、Stenotrophomonas、Prevotella、Veillonella和Streptococcus)的分类谱在基于HL-DNA构建的16S rDNA文库与宏基因组之间高度相似。然而,Rothia在16S rDNA文库中的检出丰度低于宏基因组文库。当比较由总DNA和HL-DNA生成的16S rDNA分类谱时,自第3天起,Pseudomonas在总DNA中的代表性与HL-DNA中存在差异。
宏转录组
通常,从囊性纤维化(CF)痰液中提取的总RNA部分降解,其片段大小范围为25-4,000 bp(图5A 和 图5C)。此处展示的代表性结果此前已发表于Lim et al. 20129。在未去除rRNA的宏转录组中,rRNA所占比例范围为27-83%,且不同样本间rRNA的相对丰度存在差异(表3;数据来源于Lim et al.9)。然而,使用Ribo-Zero试剂盒进行去除后,除样本CF1-F外,rRNA的相对丰度均降至1-5%。rRNA去除效果的差异可能反映了提取RNA的质量,或样本中微生物群落组成的差异,从而影响rRNA与探针杂交的可及性9。使用Ribo-Zero rRNA去除试剂盒时,成功(图5B)与失败(图5D)的电泳图谱存在明显差异,其中去除失败的图谱中可见明显的rRNA峰。
所构建的cDNA文库的片段大小范围通常反映了起始RNA样本的大小范围。本文中展示的cDNA文库是在去除rRNA后,使用全转录组扩增试剂盒(WTA2)进行扩增,随后进行Roche-454测序文库制备9。所获得的cDNA片段长度范围为50–4,000 bp(图5E和图5F),且在不同样本之间具有高度一致性(Lim et al. 2012)9。目前已有多种针对不同测序平台的RNA-Seq文库制备试剂盒,为研究者提供了更多选择,可在最优条件下将cDNA合成与测序文库制备步骤相结合。截至目前,一种推荐的方案是ScriptSeq Complete Gold试剂盒,该试剂盒结合了上述推荐的rRNA去除试剂与RNA-Seq文库制备试剂盒。

图1:用于病毒组、微生物组和宏转录组测序的宿主相关样本(如痰液样本)制备工作流程。

图 2:氯化铯密度梯度超速离心可有效去除细胞外DNA和大颗粒物质(A),并实现从囊性纤维化(CF)痰液中最佳分离病毒样颗粒。在上样预处理样品之前,将每种梯度溶液各1毫升逐层叠加(B)。在完成颗粒的分离与纯化后,采用核酸染料(如SYBR Gold)进行落射荧光显微镜检测,以确认样品中病毒颗粒的存在及其纯度。经密度梯度分离后的CF痰液样本中可观察到清晰的病毒样颗粒(C)(白色箭头所示)。

图3:由1 ng HL-DNA生成的Nextera XT文库的片段大小分布示例,该样本来源于囊性纤维化患者痰液微生物组。 文库的标准化、混合及上样量均严格按照试剂盒制造商提供的操作手册进行,未作任何修改。

图 4:一名囊性纤维化患者纵向采集的九个样本中微生物群落的分类学分析。 (A) 基于低渗裂解法提取 DNA 构建的宏基因组文库所得的微生物谱。物种分类依据 Metaphlan 分析流程,在数据预处理中已去除重复序列、低质量序列以及与人类序列同源的序列。为了验证两步低渗裂解法并未选择性富集特定微生物类群,图中包含了第一步低渗裂解后获得的子样本(*)。(B) 基于总 DNA(T)和低渗裂解法提取 DNA(HL)的 16S rRNA 基因 V1V2 区域测序所得的微生物谱。这些数据此前尚未发表。

图 5: 使用Agilent 2100 Bioanalyzer对宏转录组文库生成的RNA(A-D)和cDNA(E-F)电泳图谱示例,分别采用RNA pico芯片和高灵敏度dsDNA芯片。(A) 和 (C) 显示了rRNA去除前的电泳图谱示例。(B) 和 (D) 分别为使用总rRNA去除试剂盒成功和失败的rRNA去除过程的电泳图谱,其中在去除失败的样本中可见rRNA峰。使用全转录组扩增试剂盒(Sigma-Aldrich)生成的cDNA (E-F) 片段大小范围与起始的rRNA去除后RNA的大小范围相似,并且在两个不同样本之间高度一致。请点击此处查看该图的放大版本。
| CF1-D | CF1-E | CF1-F | CF4-A | CF4-B | CF4-C | CF5-A | CF5-B | |
| 总读数 | 224,859 | 87,891 | 106,189 | 93,301 | 140,020 | 1,558 | 272,552 | 217,438 |
| 预处理后读数a | 109,389 | 73,624 | 67,070 | 82,011 | 68,617 | 1,137 | 215,808 | 158,432 |
| 49% | 84% | 63% | 88% | 49% | 73% | 79% | 73% | |
| 碱基数 | 47,239,573 | 33,351,525 | 28,922,479 | 27,667,695 | 29,386,841 | 243,986 | 95,205,805 | 69,581,811 |
| 平均读长 | 432 | 453 | 431 | 337 | 428 | 215 | 441 | 439 |
| 宿主序列b | 240 | 526 | 28 | 79,774 | 13 | 797 | 585 | 5,859 |
| 0.21% | 0.71% | 0.04% | 97.27% | 0.02% | 70.10% | 0.27% | 3.70% | |
| 病毒比对结果c | 7,214 | 23,550 | 4,070 | 737 | 4,642 | 22 | 6,466 | 5,981 |
| 6.59% | 31.99% | 6.07% | 0.90% | 6.77% | 1.93% | 3.00% | 3.78% | |
| 未分配读数d | 103,888 | 60,490 | 32,780 | 1,935 | 68,440 | 311 | 105,612 | 119,551 |
| 94.97% | 82.16% | 48.87% | 2.36% | 99.74% | 27.35% | 48.94% | 75.46% | |
| a 经PRINSEQ29数据预处理后的读数。 | ||||||||
| b 通过DeconSeq30鉴定的人源序列,以及在BLASTn比对(NCBI核苷酸数据库)中最佳比对结果属于脊索动物门的读数。 | ||||||||
| c 与内部病毒基因组数据库进行tBLASTx比对的结果。百分比基于预处理后读数总数计算。 | ||||||||
| d 在NCBI核苷酸数据库中无BLASTn比对结果的读数。百分比基于预处理后读数总数计算。部分在NCBI核苷酸数据库中无BLASTn比对结果的读数,在tBLASTx分析中于蛋白水平被鉴定为病毒序列。 | ||||||||
表1:采用本实验流程从痰液样本中获得的八个病毒组文库特征。 该表格摘自Lim 等(2012)9。七个样本(CF1-D、CF1-E、CF1-F、CF4-B、CF4-C、CF5-A 和 CF5-B)按第2节所述方法处理,所得病毒组中除一个样本含70%人类来源序列外,其余均仅含少量(0.02%–3.7%)人类来源序列。CF4-A 样本在密度梯度超速离心步骤中被省略(CF4-A),所得病毒组中含 > 97% 的人类来源序列。
| 样品 | 浓度 | 总得量 | 总读段数 | 总读段数(处理后b) | 非人源序列 |
| (ng/μl) | (ng) | (原始a) | (%) | ||
| CF1-1A* | 2.3 | 230 | 1,098,454 | 937,688 | 691,541 |
| 74% | |||||
| CF1-1 | 13 | 1,300 | 2,212,756 | 1,958,910 | 1,574,520 |
| 80% | |||||
| CF1-2A* | 2.1 | 210 | 672,878 | 588,106 | 407,530 |
| 69% | |||||
| CF1-2 | 5.2 | 520 | 1,944,012 | 1,697,010 | 1,455,174 |
| 86% | |||||
| CF1-3 | 28.8 | 2,880 | 1,048,304 | 896,756 | 560,852 |
| 63% | |||||
| CF1-4 | 24.1 | 2,410 | 1,154,922 | 984,702 | 621,098 |
| 63% | |||||
| CF1-5 | 33.6 | 3,360 | 1,029,622 | 888,630 | 481,548 |
| 54% | |||||
| CF1-6 | 43.2 | 4,320 | 1,434,016 | 1,256,504 | 725,858 |
| 58% | |||||
| CF1-7 | 57.8 | 5,780 | 1,000,174 | 872,036 | 565,376 |
| 65% | |||||
| * 在第二次低渗裂解步骤(步骤 3.1.5)之前,从 CF1-1 和 CF1-2 中取 1 ml 样品进行分样。细胞按 3.1.7 所述离心沉淀,并按剩余实验流程进行,无需任何修改。 | |||||
| a 来自 2 × 300 bp MiSeq 测序运行的未处理 Illumina 读段。 | |||||
| b 读段根据质量与长度进行评估、截短和剔除,具体方法见讨论部分。 | |||||
表2: 使用本方案从痰液样本生成的微生物组特征。 显示了各样本在100 μl洗脱缓冲液(5 mM Tris/HCl,pH 8.5)中的DNA浓度以及测序数据的特征。每个样本使用1 ng DNA,采用Nextera XT文库构建试剂盒制备个体文库。
| 样品 | CF1-D | CF1-F | CF4-B | CF4-C | ||||
| 处理方式 | 无 | Ribo-Zero | 无 | Ribo-Zero | 无 | Ribo-Zero | 无 | Ribo-Zero |
| 预处理后读段数 | 2,088 | 1,991 | 40,876 | 25,238 | 19,728 | 32,737 | 31,791 | 36,172 |
| 平均读段长度 | 275 | 245 | 262 | 270 | 233 | 259 | 240 | 267 |
| rRNA 总读段数 | 1,737 | 91 | 29,499 | 17,267 | 5,285 | 291 | 16,371 | 1,761 |
| 83.20% | 4.60% | 72.20% | 68.40% | 26.80% | 0.90% | 51.50% | 4.90% | |
| 微生物 rRNA | 1,414 | 32 | 19,978 | 12,035 | 23 | 227 | 6,916 | 1,076 |
| 67.70% | 1.60% | 48.90% | 47.70% | 0.10% | 0.70% | 21.80% | 3.00% | |
| 真核生物 rRNA | 323 | 59 | 9,520 | 5,232 | 5,262 | 64 | 9,455 | 683 |
| 15.50% | 3.00% | 23.30% | 20.70% | 26.70% | 0.20% | 29.70% | 1.90% | |
| % rRNA 去除率* | 0% | 95% | 0% | 5% | 0% | 97% | 0% | 91% |
| 非 rRNA 读段数 | 351 (16.8%) | 1,900 (95.4%) | 11,377 (27.8%) | 7,971 (31.6%) | 14,443 (73.2%) | 32,446 (99.1%) | 15,420 (48.5%) | 34,411 (95.1%) |
| NR 总比对数 | 102 (4.9%) | 691 (34.7%) | 3,327 (8.1%) | 2,857 (11.3%) | 4,938 (25.0%) | 10,751 (32.8%) | 5,905 (18.6%) | 15,766 (43.6%) |
| 真核生物 | 74 | 407 | 2,790 | 2,524 | 4,614 | 10,227 | 4,553 | 8,274 |
| 细菌 | 26 | 283 | 520 | 312 | 287 | 471 | 1,326 | 7,442 |
| 未分类读段数 | 249 (11.9%) | 1,209 (60.7%) | 8,050 (19.7%) | 5,114 (20.3%) | 9,505 (48.2%) | 21,695 (66.3%) | 9,515 (29.9%) | 18,645 (51.5%) |
| *rRNA 去除率以未去除非等分试样中 rRNA 含量的百分比表示。 | ||||||||
表3:有无rRNA去除的宏转录组文库特征。 数据来源于Lim et al. (2012)9,该研究还额外比较了其他rRNA去除试剂盒以及测序文库构建前cDNA雾化处理的效果。
病毒宏基因组学
使用聚乙二醇(PEG)沉淀法或小体积浓缩装置对病毒颗粒进行浓缩。在某些情况下可能无需浓缩,但需进行预过滤或低速离心以去除真核细胞和微生物细胞。病毒裂解物将进一步通过密度梯度超速离心9,41或小孔径滤膜(例如,0.45 μm)进行富集和纯化,以去除真核细胞及较大的微生物细胞25。密度梯度超速离心通常采用高密度但惰性的溶液(如蔗糖或氯化铯)来分离和浓缩病毒颗粒41。该物理分离方法基于病毒颗粒的大小和浮力密度。因此,正确选择滤膜孔径以及精确制备梯度对于分离特定的病毒群落至关重要,因为病毒样颗粒(VLPs)的物理回收效率直接决定了最终获得的病毒群落组成41 (即,无法通过滤膜或不在提取密度范围内的病毒颗粒将不会在宏基因组中被检测到)。在完成病毒的分离与浓缩后,样品中仍可能存在非病毒来源的基因组污染物,包括游离的核酸以及微生物和真核细胞。因此,验证样品中病毒颗粒的纯度极为关键(图1A和 图1B)。通常采用氯仿处理以裂解残留的细胞,随后进行核酸酶处理,以在核酸提取前降解游离的核酸。
本方案的一个局限性在于使用密度梯度离心法分离病毒颗粒,该方法可能排除因浮力过大而无法进入CsCl梯度的包膜病毒颗粒。一种可替代的“全捕获”方法是省略密度梯度离心步骤,直接从经氯仿和DNase I处理的0.45 μm滤液中提取群落DNA。该方法也适用于处理拭子或血浆等体积较小的样本。然而,这种方法可能导致耐氯仿的细菌污染以及较多的耐DNase I的细胞外DNA。
目前的测序方案在文库构建过程中需要1 ng至1 μg的核酸,其中较高的DNA得率可提供更广泛的测序选择。所获得病毒组(viromes)的DNA浓度通常介于检测限以下至超过200 ng/μl之间。回收的病毒核酸量可能不足以直接进行测序文库构建。在此类情况下,核酸扩增至关重要。连接子扩增鸟枪法文库(linker amplification shotgun libraries, LASLs)2,42,43 和基于多重置换扩增(multiple displacement amplification, MDA)的全基因组扩增是两种最常用于生成足够测序用DNA的方法。以Phi29 DNA聚合酶为基础的MDA方法已知存在扩增偏好性,可能优先扩增单链DNA(ssDNA)和环状DNA,从而导致分类学和功能特征的非定量分析44,45。LASLs方法的优化版本已被证明仅引入极低程度的偏差,具有更高的灵敏度(适用于起始材料量较少的情况),并可轻松适配于不同的测序平台43。然而,该方法步骤较多,需要专用设备以最大限度减少DNA损失,且仅适用于双链DNA(dsDNA)模板。在本实验室中,该方法已成功应用于扩增从支气管肺泡灌洗液、珊瑚及海水来源的病毒样颗粒(VLPs)中提取的可检测及不可检测量级的DNA(未发表数据及Hurwitz et al.46)。
由于病毒群落具有高度多样性和很大程度上未知的特性,开发数据分析流程一直是病毒宏基因组学分析中最具有挑战性的方面之一。尽管据估计生物圈中存在约108种病毒基因型,但迄今为止,现有的病毒数据库仅包含约4,000个病毒基因组,大约仅为该估计总病毒多样性的一万分之一。因此,基于相似性的搜索方法(如BLAST47)在病毒宏基因组中进行分类学和功能注释时面临固有的困难。许多序列无法在数据库中找到具有显著相似性的基因组,因而被归类为未知序列。尽管基于同源性的搜索仍是为序列数据分配分类和功能的最重要手段,但已发展出若干不依赖数据库的替代分析方法48-50。Fancello et al.51 对病毒宏基因组学中使用的计算工具和算法进行了全面综述。
微生物宏基因组学
通常,从低渗裂解处理的微生物群落(HL-DNA)中提取的总DNA量范围为20 ng至5 μg。产量高度依赖于患者的健康状况以及采集的痰液样本量,这解释了本研究中提取的HL-DNA总产量存在差异的原因(表2)。获得高质量测序数据的关键步骤取决于所构建测序文库的质量。图2展示了利用基于酶切的DNA片段化方法,从囊性纤维化(CF)痰液来源的微生物DNA构建的测序文库的典型片段大小范围。最佳文库片段大小取决于所选用的测序平台和应用目的,因此如有需要,可通过超声处理或雾化等替代方法优化片段化步骤。除本部分展示的代表性结果外,该方法在多个时间点采集的多位囊性纤维化患者痰液样本中的成功应用,还见于Lim et al. (2012)9 和 Lim et al. (2014)10。
既往研究9,10表明,每位患者均携带一组独特的微生物群落,该群落随时间发生动态变化,从而反映出群落中主要菌群的持续存在,而波动可能由抗生素治疗等干扰因素引起。这些波动是否在无外界干扰或采样及样本处理过程影响下仍每日发生,目前尚不明确。基于HL-DNA宏基因组和16S rDNA扩增子分析,为期7天的纵向采样显示,在未使用抗生素干扰的情况下(第1、2、3天),微生物谱的每日波动极小(图3A和 3B)。在第3天采样后立即开始口服抗生素治疗后,第4天微生物群落结构的变化变得明显。尽管抗生素环丙沙星可靶向多种已知细菌病原体,如P. aeruginosa、Staphylococcus aureus和Streptococcus pneumoniae,但治疗后P. aeruginosa的相对丰度增加,而Streptococcus spp.和P. melaninogenica的丰度则下降。至第6天,微生物群落逐渐恢复至初始状态的群落结构。结果提示,单个患者体内微生物谱的波动更可能源于呼吸道内微生物群落的扰动。
鉴于16S rDNA文库与HL提取DNA的宏基因组在微生物谱型上的一致性,我们排除了本研究中所用16S rRNA引物可能引入的偏差。从总DNA与HL提取DNA获得的16S rDNA分类谱型之间存在差异(图3B)的一个可能解释是,抗生素处理后环境中存在大量Pseudomonas spp.的胞外DNA。这一推论得到了以下发现的支持:这些差异在抗生素处理后的第7天最为显著,即治疗结束3天后,而该治疗方案除其他病原体外,也靶向Pseudomonas spp.。环丙沙星通常作为囊性纤维化(CF)患者合并慢性P. aeruginosa感染的一线治疗药物,尽管其抗菌谱覆盖了大多数与CF相关的病原体。我们推测,抗生素治疗清除了包括Streptococcus spp.在内的敏感菌群,从而为耐药性P. aeruginosa创造了生态位。Pseudomonas aeruginosa可能通过增强其生物膜群落获得耐药性,而研究表明其胞外DNA是生物膜结构的主要支撑成分52。即使微生物群落结构已开始恢复,胞外DNA仍可能残留在CF患者的痰液中。因此,这些数据表明,本实验流程中所采用的低渗裂解及洗涤步骤,不仅有助于去除人源DNA,还可能有效去除可能歪曲真实微生物谱型的微生物来源的胞外DNA。
宏转录组学
高质量的宏转录组应包含相对较少的核糖体RNA(rRNA)序列,并能够无偏地代表群落的转录本(mRNA)。由于mRNA的半衰期较短且含量有限,因此本方案的关键在于尽量减少样品操作步骤,以最大限度地回收转录本。
近年来,已开发出多种核糖体RNA(rRNA)去除方法,并被整合到商业试剂盒中。这些方法包括基于寡核苷酸杂交的 MICROBEnrich、Ribo-Zero 和样本特异性减法杂交技术53,以及基于外切酶酶活性、靶向含有5’单磷酸的RNA的 mRNA-ONLY 试剂盒。此外,还可使用若干mRNA富集方法,例如优先对线性RNA进行多聚腺苷酸化并扩增的 MessageAmp II-Bacteria 试剂盒。其中一些方法(例如,mRNA-ONLY、MICROBExpress 和 MessageAmp)可联合使用以达到最佳效率。然而,所有这些方法的效果均存在局限性,尤其是在处理部分降解的rRNA时——这在从囊性纤维化(CF)样本提取的总RNA中常有观察。依赖多聚腺苷酸化的RNA扩增技术无法用于生成同时包含真核和原核mRNA的宏转录组。此外,序列上添加的poly(A)尾可能会减少可用序列数据的量。含有同聚物重复序列的区域通常质量评分较低,导致测序及测序后分析软件过滤掉大量reads,且在切除poly(A)尾后,有效read长度将显著缩短54。
针对复杂的囊性纤维化(CF)微生物群落和部分降解的RNA(图4A和图4C),我们之前的研究表明,与使用其他试剂盒的联合处理方法相比,Ribo-Zero Gold试剂盒的杂交捕获法在去除人源和微生物核糖体RNA(rRNA)方面更为有效9(表3)。由此获得的数据可同时用于分析人宿主和微生物的转录本。根据RNA的得率和质量,以及最终选择的测序平台,许多实验步骤(包括cDNA合成)可与文库构建流程整合优化。例如,经Ribo-Zero处理的RNA可使用ScriptSeq RNA-Seq文库构建试剂盒制备宏转录组测序文库。
动物相关群落的宏基因组分析能够全面表征包含宿主及其相关群落的整体功能实体。本文所述的工作流程适用于多种复杂的动物相关样本,尤其适用于除目标病毒和微生物颗粒外,还含有较厚黏液、大量细胞碎片、胞外DNA、蛋白质和糖蛋白复合物以及宿主细胞的样本。尽管在每一步骤中都可能损失部分病毒和微生物颗粒,但颗粒的分离与纯化对于最大限度减少宿主DNA的干扰至关重要。宏基因组数据可提供所研究群落的代谢潜能信息,而宏转录组学则通过揭示编码功能的差异表达对其进行补充9。对基因组和转录组数据的综合评估,为群落相互作用的动态机制提供了新的见解,并有助于推动更优疗法的开发9,10,55。
作者无任何利益冲突需要披露。
本研究由美国国立卫生研究院(1 R01 GM095384-01)资助,授予 Forest Rohwer。我们感谢Illumina公司旗下的Epicentre公司提供了Ribo-Zero流行病学试剂盒的早期使用机会。我们感谢Mark Hatay设计并制作了超速离心管支架。我们感谢Andreas Haas和Benjamin Knowles对稿件提出的批判性审阅和讨论,以及Lauren Paul在拍摄过程中提供的协助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 基于异硫氰酸胍的RNA裂解缓冲液 | Life Technologies | 10296-028 | 本研究使用了TRIzol LS试剂 |
| 二氧化硅珠;0.1至0.15 mm | Cole-Parmer | YO-36270-62 | 本研究使用了硅酸锆珠 |
| 二硫苏糖醇,分子生物学级(干粉) | Promega | V3155 | 可从其他任意公司购买 |
| 无菌注射器滤器;0.45 µm孔径,亲水性PVDF膜 | Millipore | SLHV033RS | |
| DNase I酶 | Calbiochem | 260913 | |
| 无菌注射器滤器;0.02 µm孔径 | FisherScientific | 09-926-13 | 直径:25 mm |
| 超透明离心管 | Beckman | 344059 | 9/16 x 3 ½ 英寸(14 x 90 mm),适用于SW41 Ti转子及VLPs密度梯度超速离心 |
| SW41 Ti转子 | Beckman | 333790 | |
| SS-34固定角转子 | Thermo Scientific | 28020 | |
| Phi29 DNA聚合酶 | Monserate Biotech | 4001 | 10 U/µl |
| Phi29随机六聚体 | Thermo Scientific | S0181 | 此前购自Fidelity Systems |
| 带环形聚丙烯支撑环的氧化铝基质滤膜;0.02 µm孔径 | FisherScientific | 09-926-34 | 本研究使用了Whatman Anodisc滤膜;直径25 mm |
| SYBR Gold核酸凝胶染料 | Life Technologies | S-11494 | |
| 2-巯基乙醇 | Sigma-Aldrich | M6250-100ML | |
| 无RNase的DNase I | NEB | M0303S | 可从其他任意公司购买 |
| 糖原,RNA级 | FisherScientific | FERR0551 | 可从其他任意公司购买 |
| 橡树岭高速离心管 | FisherScientific | 05-562-16B | 用于大体积DNA提取程序,适用于SS-34固定角转子 |
| 总rRNA去除试剂盒 | Epicentre | MRZE724 | ScriptSeq Complete Gold试剂盒(流行病学)可用于将rRNA去除与测序文库制备相结合 |
| 氯化铯 | FisherScientific | BP1595-500 | |
| 十六烷基三甲基溴化铵(CTAB) | Sigma-Aldrich | H5882-100G |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可