采用宏基因组学方法研究青贮饲料中牛饲料的微生物组。通过鸟枪法测序进行分析,以表征牛饲料中微生物群落的组成。
采用宏基因组学方法研究青贮饲料中牛饲料的微生物组。通过鸟枪法测序进行分析,以表征牛饲料中微生物群落的组成。
宏基因组学被定义为对从环境样本中纯化的脱氧核糖核酸(DNA)进行直接分析,从而实现对其中存在的微生物群落进行分类学鉴定。目前主要有两种宏基因组学方法:一种是测序16S核糖体RNA(rRNA)基因编码区,该区域在不同分类单元之间具有足够的变异,可用于鉴定;另一种是鸟枪法测序,即对样本中存在生物体的基因组进行测序,并将其归类到“操作分类单元”中,具体可划分至物种、属或科的级别,取决于测序覆盖的深度。
本研究采用鸟枪法测序分析牛用青贮饲料中的微生物群落,并结合一系列生物信息学工具对DNA序列读段进行质量检查和过滤,对样品青贮料中存在的微生物种群进行分类学分类,并完成序列的功能注释。这些方法用于鉴定青贮饲料中可能存在的有害细菌,这些细菌是青贮饲料腐败的指示标志。若腐败青贮饲料未得到处理,牲畜摄入后可能造成致命后果。
宏基因组学是对环境样本中发现的生物群落所纯化的DNA进行直接分析的方法1,最初用于检测沉积物中不可培养的细菌2。宏基因组学已被广泛应用于多个领域,例如鉴定人类微生物组3、对海洋中的微生物种群进行分类4,甚至用于分析咖啡机表面形成的细菌群落5。新一代测序技术的出现显著提高了测序通量和产出,因此DNA测序变得更加经济6,可进行的测序深度也大幅增加,使得宏基因组学成为一种强大的分析工具。
"前端"在宏基因组测序的实际分子层面的技术进步推动了可用于DNA序列数据分类学分析7-9、功能注释10,11以及可视化呈现12,13的in silico生物信息学工具的发展。越来越多已测序的原核和真核生物14基因组的可用性,使得对微生物群落的分类更加准确,此类分析 invariably 都需比对一个"后端"测序基因组参考数据库15。宏基因组分析可采用两种主要方法。
较为传统的方法是分析细菌基因组中编码16S rRNA基因的区域。16S rRNA在原核生物物种之间高度保守,但包含九个高变区(V1 - V9),可用于物种鉴定16。随着更长读长测序技术(≤ 300 bp 双端测序)的出现,现已能够分析跨越两个高变区的DNA序列,尤其是V3 - V4区域17。其他测序技术的进步,例如Oxford Nanopore18和PacBIO19,使得对整个16S rRNA基因进行连续测序成为可能。
尽管基于16S rDNA的文库可针对物种鉴定提供一种靶向方法,并能够检测纯化样品中天然存在的低拷贝数DNA,但宏基因组测序(shotgun sequencing)文库则可用于检测那些可能含有无法通过所用16S rRNA标记引物序列扩增的DNA区域的物种,或因模板序列与扩增引物序列差异过大而难以扩增的物种20,21。此外,尽管DNA聚合酶具有较高的复制保真度,PCR扩增过程中仍可能发生碱基错误,这些被引入的错误可能导致原始物种的错误分类22。模板序列在PCR扩增过程中还可能出现偏倚;高GC含量的DNA序列在最终的扩增子文库中可能被低估23,同样,某些非天然碱基修饰(如胸腺嘧啶乙二醇)可阻断DNA聚合酶,导致DNA序列扩增失败24。相比之下,宏基因组测序DNA文库是通过提取样品中全部纯化的DNA,将其随机打断为较短的DNA片段后构建而成的测序文库。与16S rRNA扩增子测序相比,宏基因组测序所产生的DNA序列在分类学鉴定上更为准确25,但要达到可靠的测序深度所需的成本高于扩增子测序26。宏基因组测序的主要优势在于,一旦样本中各种基因组的测序区域完成分类学注释,即可用于基因挖掘研究27。
宏基因组测序数据正被日益增多的生物信息学工具进行分析。这些工具能够执行多种应用,例如对原始测序数据进行质量控制分析。 28,成对末端读段的重叠 29, 从头合成 将序列读段组装为重叠群和支架 30,31,序列读长和组装序列的分类学分类与可视化 7,12,32,33 组装序列的功能注释 34,35.
青贮饲料,由全球农民利用发酵的谷物(如玉米)制成(玉米(Zea mays)),主要用作牛饲料。青贮饲料会用细菌进行处理 乳酸杆菌 sp. 以促进发酵 36 但迄今为止,人们对青贮饲料中其他微生物种群的了解仍然有限。发酵过程可能导致不良甚至有害的微生物在青贮饲料中占据优势。 37除了酵母菌和霉菌外,细菌尤其适应青贮饲料发酵过程中的厌氧环境,且更常与家畜疾病相关,而非青贮饲料的降解。 38. 填装青贮饲料窖时,土壤残留物可能无意中带入丁酸菌,此类细菌可将厌氧消化产物乳酸转化为丁酸,从而提高青贮饲料的pH值 39pH 的升高可能导致腐败细菌大量增殖,而这些细菌在青贮发酵的最佳条件下通常无法持续生长。 38. 梭菌属 种(spp.)., 单核细胞增生李斯特菌 种(复数形式). 和 芽孢杆菌属 种(spp). 尤其令人关注的是用于奶牛饲料的青贮饲料,因为某些细菌孢子能够耐受胃肠道环境 40 可进入食物链,导致食物腐败,极少数情况下可引起动物和人类死亡 37,39,41-44此外,尽管难以准确估算青贮饲料腐败所导致的兽医治疗费用和牲畜损失对经济的具体影响,但如果发生此类疫情,很可能会对农场造成不利影响。
据推测,通过采用宏基因组学方法,我们能够对存在于青贮饲料样品中的微生物种群进行分类,并进一步鉴定与青贮饲料腐败相关的微生物群落,这些微生物群落可能对牲畜产生不利影响,从而可在青贮饲料用作食物来源之前采取补救措施。
1. 采样地点
2. DNA 提取
注意:DNA 提取采用商业试剂盒,按照制造商提供的说明书进行。在文库构建过程中,始终使用不含样品的阴性对照。
3. 使用DNA纯化磁珠进行DNA纯化
注意:在进行宏基因组文库构建之前,需使用纯化磁珠对提取的DNA进行纯化,以确保获得纯净的DNA样本。
4. 纯化DNA的定量
注意:根据制造商说明书,使用荧光计和双链(dsDNA)高灵敏度(HS)检测试剂盒对纯化的DNA进行定量。
5. 宏基因组霰弹枪测序文库制备
注意:采用商用文库制备试剂盒并按照制造商说明书进行鸟枪法测序文库的制备。
6. 文库数量与质量检测
注意:使用商业试剂盒和仪器对制备的文库的数量和质量进行了评估。
7. DNA测序
8. 原始序列数据的分析
注意:每个程序在 Linux 操作系统下的命令显示在相应操作步骤下方。序列数据分析所用的流程管线如图1所示。所有程序需由用户在分析前自行安装。此过程应对每个样本单独进行。
9. 序列数据的质量控制剪切与过滤
10. 宏基因组组装
11. 双端测序读段重叠
12. 分类学分类
13. 功能注释
14. 可视化CAZy注释
在进行生物信息学处理之前,使用 Trimmomatic 软件对原始序列读段进行修剪并去除接头序列 28在修剪和过滤步骤之后,序列读长数量减少至原始读长的50%表1)。平均碱基Phred分数为 >30,在质量控制后(图2).
使用 FLASH 软件29将具有重叠区域的 DNA 序列对进行合并,以生成更长的单条读段,非重叠的读段则保留在单独的文件中。共有 45.47% 的读段(105,343 条)成功合并。在使用 FLASH 完成读段重叠后,所得的延伸片段通过 Kraken 软件7进行细菌分类学分类,并利用 Krona 软件进行可视化展示(图 3)。
青贮饲料宏基因组中存在的大多数细菌物种属于4个原核生物门:厚壁菌门(34%)、放线菌门(28%)、变形菌门(27%)和拟杆菌门(7%)。这些门中各类群的分布情况见图4。宏基因组中最丰富的物种包括乳杆菌属(Lactobacillus spp.,24%;厚壁菌门)、棒状杆菌属(Corynebacterium spp.,8%;放线菌门)、丙酸杆菌属(Propionibacterium spp.,3%;放线菌门)和普雷沃氏菌属(Prevotella spp.,3%;拟杆菌门)。此外,还检测到一些与动物健康相关并可能参与致病的物种;预测青贮饲料样品中存在梭菌属(Clostridium spp.,1%)、芽孢杆菌属(Bacillus spp.,0.6%)和李斯特菌属(Listeria spp.,0.2%)。
对组装后的序列进行了功能注释。使用SPAdes组装软件30,基于经修剪和过滤的成对末端及非成对末端序列进行宏基因组组装,共获得92,284个支架序列。为鉴定纤维素酶,利用MG-RAST预测蛋白质,并通过碳水化合物活性酶数据库(CAZy)进行注释。在预测出的97,562个蛋白质中,有6,357个被注释为CAZy数据库中五类酶之一的潜在碳水化合物活性酶(图5)。使用InteractiVenn软件50将结果以维恩图形式可视化,展示蛋白质注释的分布情况,包括同时含有多个CAZy酶类注释的蛋白质。其中,3,861个蛋白质被预测具有糖苷水解酶活性,将在实验室中进一步表征以确认其功能。

图 1: 青贮饲料宏基因组学分析的生物信息学流程。 本研究采用两种主要方法对青贮饲料微生物组进行分析:分类学分类与功能注释。请点击此处查看该图的放大版本。

图2: 修剪与接头去除前后每碱基的序列质量。 来自FASTQC的每碱基序列质量图显示了在质量控制前后序列读段全长范围内的平均Phred评分。请点击此处查看该图的放大版本。

图3: 固体青贮饲料中细菌微生物组的分类学分类。 使用Kraken7对FLASH软件修剪并重叠后的序列读段进行分类,并通过krona进行可视化展示。请点击此处查看该图的放大版本。

图 4: 固体青贮饲料细菌微生物组中4个最丰富门的分类学纲级分布。 四个最丰富门中各细菌纲所占百分比。厚壁菌门:Clostridia(红色)和Bacilli(深蓝色);变形菌门:delta/epsilon(粉色)、alpha(浅蓝色)、gamma(橙色)和beta(青绿色);拟杆菌门:Flavobacteriia(深蓝色)和Bacteroidia(浅绿色);放线菌门:Coriobacteriia(深紫色)和其他Actinobacteria(深绿色)。请点击此处查看该图的放大版本。

图 5: 固体青贮微生物组中预测蛋白质组的CAZy注释。 维恩图显示了固体青贮微生物组预测蛋白质组中CAZy注释的五类酶的分布情况。请点击此处查看该图的放大版本。
| # 原始序列读数 | # 过滤后序列读数(成对) | # 过滤后序列读数 | # FLASH合并后序列读数 |
| (成对) | (未成对) | ||
| 2,374,949 x2 | 231,679 x2 | 1,892,534 | 105,343 |
表1:测序读段汇总表。
尽管in silico分析能够深入揭示环境样本中存在的微生物群落,但至关重要的是,所展示的分类学分类必须在适当的对照条件下进行,并且测序深度需达到足够水平,以全面捕获样本中存在的全部微生物种群51。
在任何计算分析中,都存在多种途径来实现相似的目标。本研究中所采用的方法是合适且直接的方法的示例,这些方法被整合在一起,以对青贮饲料微生物组进行一系列分析。目前已有多种且不断增长的生物信息学工具和技术可用于宏基因组数据的分析,例如 Phylosift 8 和 MetaPhlAn2 52,在开展研究之前应根据样本特性和所需分析内容评估这些工具的相关性53。宏基因组分析方法的局限性取决于用于分类的数据库、测序深度以及测序质量。
本文所示的生物信息学处理是在本地高性能计算机上完成的;但也可使用基于云的系统。这些基于云的服务允许租用必要的计算能力,而无需投入高额成本购置功能强大的本地工作站。该方法的一个潜在应用是在农业中使用青贮饲料前对其进行评估,以确保不存在潜在有害细菌,从而防止这些细菌进入食物链。
作者无任何利益冲突需要披露。
作者感谢 Andrew Bird 提供的青贮饲料样品,以及埃克塞特测序服务中心的 Audrey Farbos 在 DNA 测序文库制备过程中提供的帮助。本研究使用了埃克塞特大学的测序服务和计算核心设施。资助来源:英国医学研究理事会临床基础设施奖(MR/M008924/1);惠康信托机构战略支持基金(WT097835MF);惠康信托多用户设备奖(WT101650MA);英国生物技术和生物科学研究生院(BBSRC)LOLA 奖(BB/K003240/1)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| FastDNA SPIN Kit for Soil | MP Bio | 116560200 | DNA提取 |
| DNA FastPrep | MP Bio | 116004500 | DNA提取 |
| Agencourt AMPure XP 磁珠 | 贝克曼库尔特 | A63880 | DNA 纯化 |
| 洗脱缓冲液 | Qiagen | 19806 | DNA 纯化 |
| Qubit 荧光仪 | Thermo Fisher | Q33216 | DNA 定量 |
| Qubit dsDNA HS 检测试剂盒 | 赛默飞世尔科技 | Q32854 | DNA 定量 |
| Nextera XT DNA文库构建试剂盒 | Illumina | FC-131-1024 | 文库构建 |
| Nextera XT Index试剂盒 | Illumina | FC-131-1001 | 文库构建 |
| TapeStation 2200 | 安捷伦 | G2964AA | DNA 定量 |
| HS D100 ScreenTape | 安捷伦 | 5067-5584 | DNA 定量 |
| HS D100 ScreenTape 试剂 | 安捷伦 | 5067-5585 | DNA 定量 |
| TapeStation 使用技巧 | 安捷伦 | 5067-5153 | DNA 定量 |
| TapeStation 管 | 安捷伦 | 401428 和 401425 | DNA 定量 |
| HiSeq 2500 | Illumina | DNA测序——由测序服务提供 | |
| 高功率分析工作站 | 各种 | 本地或基于云的用户首选系统 |