方法文章

青贮饲料的宏基因组分析

18.9K 次观看

DOI:

10.3791/54936

2017年1月13日

本文内容

摘要

采用宏基因组学方法研究青贮饲料中牛饲料的微生物组。通过鸟枪法测序进行分析,以表征牛饲料中微生物群落的组成。

摘要

宏基因组学被定义为对从环境样本中纯化的脱氧核糖核酸(DNA)进行直接分析,从而实现对其中存在的微生物群落进行分类学鉴定。目前主要有两种宏基因组学方法:一种是测序16S核糖体RNA(rRNA)基因编码区,该区域在不同分类单元之间具有足够的变异,可用于鉴定;另一种是鸟枪法测序,即对样本中存在生物体的基因组进行测序,并将其归类到“操作分类单元”中,具体可划分至物种、属或科的级别,取决于测序覆盖的深度。

本研究采用鸟枪法测序分析牛用青贮饲料中的微生物群落,并结合一系列生物信息学工具对DNA序列读段进行质量检查和过滤,对样品青贮料中存在的微生物种群进行分类学分类,并完成序列的功能注释。这些方法用于鉴定青贮饲料中可能存在的有害细菌,这些细菌是青贮饲料腐败的指示标志。若腐败青贮饲料未得到处理,牲畜摄入后可能造成致命后果。

引言

宏基因组学是对环境样本中发现的生物群落所纯化的DNA进行直接分析的方法1,最初用于检测沉积物中不可培养的细菌2。宏基因组学已被广泛应用于多个领域,例如鉴定人类微生物组3、对海洋中的微生物种群进行分类4,甚至用于分析咖啡机表面形成的细菌群落5。新一代测序技术的出现显著提高了测序通量和产出,因此DNA测序变得更加经济6,可进行的测序深度也大幅增加,使得宏基因组学成为一种强大的分析工具。

"前端"在宏基因组测序的实际分子层面的技术进步推动了可用于DNA序列数据分类学分析7-9、功能注释10,11以及可视化呈现12,13in silico生物信息学工具的发展。越来越多已测序的原核和真核生物14基因组的可用性,使得对微生物群落的分类更加准确,此类分析 invariably 都需比对一个"后端"测序基因组参考数据库15。宏基因组分析可采用两种主要方法。

较为传统的方法是分析细菌基因组中编码16S rRNA基因的区域。16S rRNA在原核生物物种之间高度保守,但包含九个高变区(V1 - V9),可用于物种鉴定16。随着更长读长测序技术(≤ 300 bp 双端测序)的出现,现已能够分析跨越两个高变区的DNA序列,尤其是V3 - V4区域17。其他测序技术的进步,例如Oxford Nanopore18和PacBIO19,使得对整个16S rRNA基因进行连续测序成为可能。

尽管基于16S rDNA的文库可针对物种鉴定提供一种靶向方法,并能够检测纯化样品中天然存在的低拷贝数DNA,但宏基因组测序(shotgun sequencing)文库则可用于检测那些可能含有无法通过所用16S rRNA标记引物序列扩增的DNA区域的物种,或因模板序列与扩增引物序列差异过大而难以扩增的物种20,21。此外,尽管DNA聚合酶具有较高的复制保真度,PCR扩增过程中仍可能发生碱基错误,这些被引入的错误可能导致原始物种的错误分类22。模板序列在PCR扩增过程中还可能出现偏倚;高GC含量的DNA序列在最终的扩增子文库中可能被低估23,同样,某些非天然碱基修饰(如胸腺嘧啶乙二醇)可阻断DNA聚合酶,导致DNA序列扩增失败24。相比之下,宏基因组测序DNA文库是通过提取样品中全部纯化的DNA,将其随机打断为较短的DNA片段后构建而成的测序文库。与16S rRNA扩增子测序相比,宏基因组测序所产生的DNA序列在分类学鉴定上更为准确25,但要达到可靠的测序深度所需的成本高于扩增子测序26。宏基因组测序的主要优势在于,一旦样本中各种基因组的测序区域完成分类学注释,即可用于基因挖掘研究27

宏基因组测序数据正被日益增多的生物信息学工具进行分析。这些工具能够执行多种应用,例如对原始测序数据进行质量控制分析。 28,成对末端读段的重叠 29, 从头合成 将序列读段组装为重叠群和支架 30,31,序列读长和组装序列的分类学分类与可视化 7,12,32,33 组装序列的功能注释 34,35.

青贮饲料,由全球农民利用发酵的谷物(如玉米)制成(玉米(Zea mays)),主要用作牛饲料。青贮饲料会用细菌进行处理 乳酸杆菌 sp. 以促进发酵 36 但迄今为止,人们对青贮饲料中其他微生物种群的了解仍然有限。发酵过程可能导致不良甚至有害的微生物在青贮饲料中占据优势。 37除了酵母菌和霉菌外,细菌尤其适应青贮饲料发酵过程中的厌氧环境,且更常与家畜疾病相关,而非青贮饲料的降解。 38. 填装青贮饲料窖时,土壤残留物可能无意中带入丁酸菌,此类细菌可将厌氧消化产物乳酸转化为丁酸,从而提高青贮饲料的pH值 39pH 的升高可能导致腐败细菌大量增殖,而这些细菌在青贮发酵的最佳条件下通常无法持续生长。 38. 梭菌属 种(spp.)., 单核细胞增生李斯特菌 种(复数形式). 芽孢杆菌属 种(spp). 尤其令人关注的是用于奶牛饲料的青贮饲料,因为某些细菌孢子能够耐受胃肠道环境 40 可进入食物链,导致食物腐败,极少数情况下可引起动物和人类死亡 37,39,41-44此外,尽管难以准确估算青贮饲料腐败所导致的兽医治疗费用和牲畜损失对经济的具体影响,但如果发生此类疫情,很可能会对农场造成不利影响。

据推测,通过采用宏基因组学方法,我们能够对存在于青贮饲料样品中的微生物种群进行分类,并进一步鉴定与青贮饲料腐败相关的微生物群落,这些微生物群落可能对牲畜产生不利影响,从而可在青贮饲料用作食物来源之前采取补救措施。

方案

1. 采样地点

  1. 从合适的地点(如农场)采集青贮饲料样品。本研究中的农场位于爱尔兰科克郡巴利杜利(51°51'58.4"N 8°16'48.7"W)。

2. DNA 提取

注意:DNA 提取采用商业试剂盒,按照制造商提供的说明书进行。在文库构建过程中,始终使用不含样品的阴性对照。

  1. 在提供的裂解管中加入 100 - 400 mg 样品、978 µL 磷酸钠缓冲液和 122 µL 土壤裂解缓冲液。
  2. 将裂解管放入均质器中,以 6.0 m/s 的速度均质 40 秒,使样品充分裂解。
  3. 在 14,000 × g 条件下离心裂解液 15 分钟,将上清液转移至含有 250 µL 蛋白质沉淀溶液(PPS)的洁净微量离心管中。通过倒置混合 10 次,然后在 14,000 × g 条件下离心 5 分钟。
  4. 将上清液加入含有 1 mL DNA 结合基质的洁净 15 mL 离心管中。持续倒置混匀 3 分钟。静置 3 分钟后,弃去 500 µL 上清液,混匀剩余上清液。
  5. 取 600 µL 悬液转移至离心过滤柱中,在 14,000 × g 条件下离心 1 分钟。弃去滤液,并对剩余悬液重复此步骤。
  6. 向离心过滤柱内的 DNA 结合基质中加入 500 µL 洗涤缓冲液,用移液器吹打混匀,然后在 14,000 × g 条件下离心 1 分钟。
  7. 弃去滤液,再次在 14,000 × g 条件下离心离心过滤柱 2 分钟,以彻底去除残留洗涤缓冲液。在 23 ˚C 下干燥离心过滤柱 5 分钟。
  8. 预热(70 ˚C)无 DNase 水(DES),在离心过滤柱中用 100 µL DES 重悬 DNA 结合基质。将离心过滤柱转移至洁净的 1.5 mL 微量离心管中,在 14,000 × g 条件下离心 1 分钟以洗脱 DNA。将纯化的 DNA 储存于 -20 ˚C,直至进行后续分析。

3. 使用DNA纯化磁珠进行DNA纯化

注意:在进行宏基因组文库构建之前,需使用纯化磁珠对提取的DNA进行纯化,以确保获得纯净的DNA样本。

  1. 使用前将磁珠在 23 ˚C 下孵育 30 分钟。向 DNA 样品中加入 2 倍体积的磁珠,并在 23 ˚C 下孵育溶液 5 分钟。
  2. 将样品置于分离磁铁上 5 分钟,然后弃去上清液。用 200 µL 新鲜的 80% 乙醇(EtOH)洗涤磁珠两次。将磁珠在空气中干燥 10 分钟。
  3. 从分离磁铁上取下样品,加入 50 µL 洗脱缓冲液(EB),用移液器吹打混匀。
  4. 在 23 ˚C 下孵育悬浮液 5 分钟,随后将样品重新置于分离磁铁上 3 分钟。
  5. 将含有 DNA 的上清液转移至干净的离心管中。弃去磁珠。
  6. 按照第四部分所述方法对纯化的 DNA 进行定量。

4. 纯化DNA的定量

注意:根据制造商说明书,使用荧光计和双链(dsDNA)高灵敏度(HS)检测试剂盒对纯化的DNA进行定量。

  1. 使用缓冲液与试剂按199:1的比例配制工作液。
  2. 将每种DNA标准品各10 µL加入190 µL工作液中。
  3. 将10 µL纯化的DNA加入190 µL工作液中,终体积应为200 µL。将标准品和DNA样品在23 ˚C下孵育2分钟。
  4. 按照荧光计屏幕上的操作说明,先分析标准品,再分析DNA样品。

5. 宏基因组霰弹枪测序文库制备

注意:采用商用文库制备试剂盒并按照制造商说明书进行鸟枪法测序文库的制备。

  1. 将DNA样本稀释至0.2 ng/μLµL 使用 EB。任何浓度已低于此值的样品, 阴性对照保持其当前浓度不变。
  2. 混合 5 µL 的纯化 DNA 与 10 µL 缓冲液和 5 µL 酶混合液。将样品在 55 ˚5 分钟,C
  3. 加入 5 µL 中和缓冲液,23 ℃下孵育溶液 ˚C,5 分钟。
  4. 加入5 µ每种样本特异性测序索引的 L 以及 15 µL 的 PCR 预混液。
  5. 在PCR仪中,将样品于72℃孵育 ˚C,3 分钟,95 ˚C,持续30秒,随后进行12个循环的95 ˚C,10 秒,55 ˚C,30 秒,72 ˚C,30 秒。最后将样品在 72 ˚5 分钟,C
  6. 使用磁珠纯化法纯化已制备的DNA,方法同前,但最终洗脱体积为30 μL µL of EB

6. 文库数量与质量检测

注意:使用商业试剂盒和仪器对制备的文库的数量和质量进行了评估。

  1. 使用前将试剂盒组分在 23 ˚C 下孵育 30 分钟。
  2. 将 2 µL DNA 加入 2 µL 缓冲液中,于 2,000 rpm 涡旋振荡 1 分钟。
  3. 离心样品,确保其位于管底。
  4. 将样品管、分析胶带和吸头插入仪器,并按照软件提示进行分析。

7. DNA测序

  1. 将制备并定量的DNA测序文库样品转移至测序服务机构,使用300 bp双端测序进行测序45

8. 原始序列数据的分析

注意:每个程序在 Linux 操作系统下的命令显示在相应操作步骤下方。序列数据分析所用的流程管线如图1所示。所有程序需由用户在分析前自行安装。此过程应对每个样本单独进行。

  1. 通过在命令行中输入 /path-to-file/fastqc,后跟正向和反向原始序列文件 raw_read1.fastq raw_read2.fastq,使用 FastQC46 分析并可视化 DNA 序列数据。
  2. 通过输入 -o output_fastqc 指定输出文件夹,并通过 -f fastq 指定原始序列文件的文件格式。
  3. 查看输出文件(图 2)。
    path-to-file/fastqc raw_read1.fastq raw_read2.fastq -o output_directory -f fastq。

9. 序列数据的质量控制剪切与过滤

  1. 在命令行中输入 java -jar /path-to-file/trimmomatic-0.35.jar,运行剪切程序 Trimmomatic28
  2. 通过输入“PE”指定文件为双端测序文件;通过输入 -threads 16 指定程序使用 16 个中央处理器(CPUs)。
  3. 输入原始正向和反向测序文件的名称,以列出需要进行质量控制检查的两个文件;通过输入 -baseout silage 确定输出文件的前缀。
  4. 通过输入 ILLUMINACLIP:NexteraPE-PE.fa:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:20 CROP:200 HEADCROP:15 MINLEN:36,设定程序的参数选项。
  5. 完成后,如前所述使用 FastQC 分析剪切后的序列,并将结果与原始序列数据进行比较,以确认剪切操作已成功执行。
    注意:软件工具 Trimmomatic 进一步对读段进行剪切,去除前端低质量或 N 碱基(质量值低于 3)、末端低质量或 N 碱基(质量值低于 3),并使用 4 个碱基宽度的滑动窗口扫描每条读段。当每个碱基的平均质量值低于 20 时,设置参数进行截断,并丢弃长度短于 36 个碱基的读段。最后,从每条读段的头部切除 15 个碱基,并将读段截取为仅保留起始位置的 200 个碱基。此最终步骤旨在解决长读段(> 200 bp)测序时可能出现的部分质量问题。这些参数可根据具体样本进行调整28
    java -jar /path-to-file/trimmomatic-0.35.jar PE -threads 16 raw_read1.fastq raw_read2.fastq -baseout silage ILLUMINACLIP:NexteraPE-PE.fa:2:30:10 LEADING:3 TRAILING:3 SLIDINGWINDOW:4:20 CROP:200 HEADCROP:15 MINLEN:36

10. 宏基因组组装

  1. 通过输入 cat 命令,后接未配对的修剪后 reads:silage_read1_unpaired.fastq silage_read2_unpaired.fastq,将未配对的修剪后 reads 合并。通过输入以下命令将文件写入新文件 > silage_merged_unpaired.fastq
    cat silage_read1_unpaired.fastq silage_read2_unpaired.fastq > silage_merged_unpaired.fastq
  2. 为了 从头 组装测序得到的DNA,使用SPAdes(St. Petersburg基因组组装软件) 30 通过输入 /path-to-file/spades.py 指定路径。输入 -t 16 指定使用 16 个 CPU,输入 --meta 指定应用宏基因组参数。
  3. 使用 -1 silage_read1_paired.fastq 指定经修剪的正向序列,使用 -2 silage_read2_paired.fastq 指定反向序列。合并后的未配对序列由 -s silage_merged_unpaired.fastq 指定。
  4. 通过输入 -o silage_spades 来定义输出文件夹。
    path-to-file/spades.py -t 16 --meta -1 silage_read1_paired.fastq -2 silage_read2_paired.fastq -s silage_merged_unpaired.fastq -o silage_spades

11. 双端测序读段重叠

  1. 使用 FLASH(短读长快速长度校正)合并成对的 DNA 序列读段 29 通过在命令行中输入 /path-to-file/flash,指定使用 16 个 CPU(使用 -t 16 参数),并输入 -o silage 以设定输出文件前缀。
  2. 通过输入 silage_trimmed_R1.fastq silage_trimmed_R2.fastq 来识别经修剪的序列读段
    path-to-file/flash -t 16 -o FLASHed silage_read1_paired.fastq silage_read2_paired.fastq

12. 分类学分类

  1. 输入 /path-to-file/kraken,并通过输入 --db /path-to-file/standard 指定数据库。
  2. 指定使用 16 个 CPU,输入 --threads 16,并通过使用 --output FLASHed_silage_extendedFrags_kraken.txt 指定输出文件夹。输入文件名为 FLASHed_silage.extendedFrags.fastq
    path-to-file/kraken --db standard --thread 16 --output FLASHed_silage_extendedFrags_kraken.txt FLASHed_silage.extendedFrags.fastq
    注意:使用 Kraken 对组装的 DNA 序列 Scaffold 进行分类 7 使用了最新的标准 Kraken 数据库,该数据库包含了所有可获得的序列信息,比对工作已全部完成 原核生物 基因组序列
  3. 将输出文件中的第2列和第3列复制到新文件中,输入命令:cut -f2,3 FLASHed_silage_extendedFrags_kraken.txt > FLASHed_silage_extendedFrags_kraken.int
  4. 在网页浏览器中打开输出文件。
    cut -f2,3 FLASHed_silage_extendedFrags_kraken.txt > FLASHed_silage_extendedFrags_kraken.int
  5. 将新文件导入 Krona 12 通过输入 ktImportTaxonomy。指定输入文件为 FLASHed_silage_extendedFrags_kraken.int。通过输入 -o FLASHed_silage_extendedFrags_kraken.out.html 来确定输出文件。
    path-to-file/ktImportTaxonomy FLASHed_silage_extendedFrags_kraken.int -o FLASHed_silage_extendedFrags_kraken.out.html

13. 功能注释

  1. 前往 MG-RAST 47 网站,http://metagenomics.anl.gov/。如需注册,请注册为新用户。登录后,点击“上传”按钮。上传第10步中组装的scaffolds。
  2. 文件上传完成后,点击 "提交" 并遵循说明,等待分析完成。
  3. 分析完成后,查看发送的链接 通过 来自MG-RAST的电子邮件,或者 alternatively,点击 "进展". 已完成的工作列表。点击相关的工作编号,然后点击链接至 "下载页面".
  4. 在下载页面的标题下方 "蛋白质聚类 90%",点击蛋白按钮以下载预测的蛋白文件 550.cluster.aa90.faa。
  5. 将下载的蛋白质与CAZy数据库进行比对,以将其分类为可能属于某一特定CAZy酶类 48下载碳水化合物活性酶数据库(CAZy)的文件:AA.zip、CE.zip、GH.zip、GT.zip 和 PL.zip。这些文件分别代表以下酶类:辅助活性酶(AA)、碳水化合物酯酶(CE)、糖苷水解酶(GH)、糖基转移酶(GT)和多糖裂解酶(PL)。
  6. 解压数据库文件,并使用 USEARCH UBLAST 算法通过比对蛋白质与 CAZy 数据库中蛋白质的相似性来注释蛋白质 49. 使用 bash 循环(for i in *.txt)遍历 5 个数据库 .txt 文件 "for i in *.txt; do".
  7. 运行 USEARCH,输入 /path-to-file/usearch8 并加上参数 -ublast,以使用 ublast 算法。然后输入从 MG-RAST 下载的蛋白质序列文件的名称, "mgmXXXXXX.3.550.cluster.aa90.faa".
  8. 要指定要使用的数据库文件,请输入 "-db $i" 并指定E值阈值为1e-5类型 "-evalue 1e-5".
  9. 在发现目标序列后终止搜索,从而将该蛋白质序列归类为属于目标酶类, 例如 GH,类型 "-masaccepts 1".
  10. 要定义使用 16 个 CPU,请输入 "-threads 16" 并将输出文件的格式指定为制表符分隔的文本类型 "-blast6out". 确定输出文件类型 "$i.ublast"要终止 bash 循环,请输入 "已完成"
    对于所有以 .txt 结尾的文件
    /path-to-file/usearch8 -ublast ../mgmXXXXXX.3.550.cluster.aa90.faa -db $i -evalue 1e-5 -maxaccepts 1 -threads 16 -blast6out $i.ublast
    完成

14. 可视化CAZy注释

  1. 要将CAZy注释结果以维恩图形式可视化,使用bash循环为每个酶类生成蛋白质ID列表。输入“for i in *.ublast; do”。
  2. 要将输出文件中的第一列内容转移至新文件,请输入“cat $i | cut -f 1 >$i.list”。
  3. 结束循环,输入“; done”。
  4. 在文本编辑器中打开.list文件。访问网站,选择集合数量为5,将每个列表文件的内容分别粘贴到不同的输入框中。将生成的图表下载为.SVG文件。
    for i in *.ublast;
    do cat $i | cut -f 1 >$i.list;
    done

结果

在进行生物信息学处理之前,使用 Trimmomatic 软件对原始序列读段进行修剪并去除接头序列 28在修剪和过滤步骤之后,序列读长数量减少至原始读长的50%表1)。平均碱基Phred分数为 >30,在质量控制后(图2).

使用 FLASH 软件29将具有重叠区域的 DNA 序列对进行合并,以生成更长的单条读段,非重叠的读段则保留在单独的文件中。共有 45.47% 的读段(105,343 条)成功合并。在使用 FLASH 完成读段重叠后,所得的延伸片段通过 Kraken 软件7进行细菌分类学分类,并利用 Krona 软件进行可视化展示(图 3)。

青贮饲料宏基因组中存在的大多数细菌物种属于4个原核生物门:厚壁菌门(34%)、放线菌门(28%)、变形菌门(27%)和拟杆菌门(7%)。这些门中各类群的分布情况见图4。宏基因组中最丰富的物种包括乳杆菌属(Lactobacillus spp.,24%;厚壁菌门)、棒状杆菌属(Corynebacterium spp.,8%;放线菌门)、丙酸杆菌属(Propionibacterium spp.,3%;放线菌门)和普雷沃氏菌属(Prevotella spp.,3%;拟杆菌门)。此外,还检测到一些与动物健康相关并可能参与致病的物种;预测青贮饲料样品中存在梭菌属(Clostridium spp.,1%)、芽孢杆菌属(Bacillus spp.,0.6%)和李斯特菌属(Listeria spp.,0.2%)。

对组装后的序列进行了功能注释。使用SPAdes组装软件30,基于经修剪和过滤的成对末端及非成对末端序列进行宏基因组组装,共获得92,284个支架序列。为鉴定纤维素酶,利用MG-RAST预测蛋白质,并通过碳水化合物活性酶数据库(CAZy)进行注释。在预测出的97,562个蛋白质中,有6,357个被注释为CAZy数据库中五类酶之一的潜在碳水化合物活性酶(图5)。使用InteractiVenn软件50将结果以维恩图形式可视化,展示蛋白质注释的分布情况,包括同时含有多个CAZy酶类注释的蛋白质。其中,3,861个蛋白质被预测具有糖苷水解酶活性,将在实验室中进一步表征以确认其功能。

宏基因组数据分析流程图;步骤包括读长修剪、组装、蛋白质组预测。
图 1: 青贮饲料宏基因组学分析的生物信息学流程。 本研究采用两种主要方法对青贮饲料微生物组进行分析:分类学分类与功能注释。请点击此处查看该图的放大版本。

DNA测序质量评分图;原始与修剪后读段的比较;生物信息学分析。
图2: 修剪与接头去除前后每碱基的序列质量。 来自FASTQC的每碱基序列质量图显示了在质量控制前后序列读段全长范围内的平均Phred评分。请点击此处查看该图的放大版本。

微生物多样性分析示意图;基于105,343条经FLASH修剪并拼接的序列构建的系统发育树。
图3: 固体青贮饲料中细菌微生物组的分类学分类。 使用Kraken7对FLASH软件修剪并重叠后的序列读段进行分类,并通过krona进行可视化展示。请点击此处查看该图的放大版本。

细菌门分布柱状图;包含厚壁菌门、放线菌门;微生物组研究结果。
图 4: 固体青贮饲料细菌微生物组中4个最丰富门的分类学纲级分布。 四个最丰富门中各细菌纲所占百分比。厚壁菌门:Clostridia(红色)和Bacilli(深蓝色);变形菌门:delta/epsilon(粉色)、alpha(浅蓝色)、gamma(橙色)和beta(青绿色);拟杆菌门:Flavobacteriia(深蓝色)和Bacteroidia(浅绿色);放线菌门:Coriobacteriia(深紫色)和其他Actinobacteria(深绿色)。请点击此处查看该图的放大版本。

维恩图;数据集重叠分析;比较分组;研究数据的交集。
图 5: 固体青贮微生物组中预测蛋白质组的CAZy注释。 维恩图显示了固体青贮微生物组预测蛋白质组中CAZy注释的五类酶的分布情况。请点击此处查看该图的放大版本。

# 原始序列读数# 过滤后序列读数(成对)# 过滤后序列读数# FLASH合并后序列读数
(成对)(未成对)
2,374,949 x2231,679 x21,892,534105,343

表1:测序读段汇总表。

讨论

尽管in silico分析能够深入揭示环境样本中存在的微生物群落,但至关重要的是,所展示的分类学分类必须在适当的对照条件下进行,并且测序深度需达到足够水平,以全面捕获样本中存在的全部微生物种群51

在任何计算分析中,都存在多种途径来实现相似的目标。本研究中所采用的方法是合适且直接的方法的示例,这些方法被整合在一起,以对青贮饲料微生物组进行一系列分析。目前已有多种且不断增长的生物信息学工具和技术可用于宏基因组数据的分析,例如 Phylosift 8 和 MetaPhlAn2 52,在开展研究之前应根据样本特性和所需分析内容评估这些工具的相关性53。宏基因组分析方法的局限性取决于用于分类的数据库、测序深度以及测序质量。

本文所示的生物信息学处理是在本地高性能计算机上完成的;但也可使用基于云的系统。这些基于云的服务允许租用必要的计算能力,而无需投入高额成本购置功能强大的本地工作站。该方法的一个潜在应用是在农业中使用青贮饲料前对其进行评估,以确保不存在潜在有害细菌,从而防止这些细菌进入食物链。

披露

作者无任何利益冲突需要披露。

致谢

作者感谢 Andrew Bird 提供的青贮饲料样品,以及埃克塞特测序服务中心的 Audrey Farbos 在 DNA 测序文库制备过程中提供的帮助。本研究使用了埃克塞特大学的测序服务和计算核心设施。资助来源:英国医学研究理事会临床基础设施奖(MR/M008924/1);惠康信托机构战略支持基金(WT097835MF);惠康信托多用户设备奖(WT101650MA);英国生物技术和生物科学研究生院(BBSRC)LOLA 奖(BB/K003240/1)。

材料

本文使用的材料清单
姓名公司目录编号评论
FastDNA SPIN Kit for SoilMP Bio116560200DNA提取
DNA FastPrepMP Bio116004500DNA提取
Agencourt AMPure XP 磁珠贝克曼库尔特A63880DNA 纯化
洗脱缓冲液Qiagen19806DNA 纯化
Qubit 荧光仪Thermo FisherQ33216DNA 定量
Qubit dsDNA HS 检测试剂盒赛默飞世尔科技Q32854DNA 定量
Nextera XT DNA文库构建试剂盒IlluminaFC-131-1024文库构建
Nextera XT Index试剂盒IlluminaFC-131-1001文库构建
TapeStation 2200安捷伦G2964AADNA 定量
HS D100 ScreenTape安捷伦5067-5584DNA 定量
HS D100 ScreenTape 试剂安捷伦5067-5585DNA 定量
TapeStation 使用技巧安捷伦5067-5153DNA 定量
TapeStation 管安捷伦401428 和 401425DNA 定量
HiSeq 2500IlluminaDNA测序——由测序服务提供
高功率分析工作站各种本地或基于云的用户首选系统

参考文献

  1. Riesenfeld, C. S., Schloss, P. D., Handelsman, J. Metagenomics: genomic analysis of microbial communities. Annu. Rev. Genet. 38 (1), 525-552 (2004).
  2. Amann, R. I., Ludwig, W., Schleifer, K. H. Phylogenetic identification and in situ detection of individual microbial cells without cultivation. Microbiol. Rev. 59 (1), 143-169 (1995).
  3. Human Microbiome Project Consortium. Structure, function and diversity of the healthy human microbiome. Nature. 486 (7402), 207-214 (2012).
  4. Venter, J. C., et al. Environmental genome shotgun sequencing of the Sargasso Sea. Science. 304 (5667), 66-74 (2004).
  5. Vilanova, C., Iglesias, A., Porcar, M. The coffee-machine bacteriome: biodiversity and colonisation of the wasted coffee tray leach. Sci. Rep. 5, 17163(2015).
  6. Hayden, E. C. Technology: The $1,000 genome. Nature. 507 (7492), 294-295 (2014).
  7. Wood, D. E., Salzberg, S. L. Kraken: ultrafast metagenomic sequence classification using exact alignments. Gen. Biol. 15 (3), 46(2014).
  8. Darling, A. E., et al. PhyloSift: phylogenetic analysis of genomes and metagenomes. PeerJ. 2 (12), 243(2014).
  9. Buchfink, B., Xie, C., Huson, D. H. Fast and sensitive protein alignment using DIAMOND. Nat. Meth. 12 (1), 59-60 (2015).
  10. Moreno-Hagelsieb, G., Hudy-Yuffa, B. Estimating overannotation across prokaryotic genomes using BLAST+, UBLAST, LAST and BLAT. BMC Res Notes. 7 (1), 651(2014).
  11. Hauser, M., Steinegger, M., Söding, J. MMseqs software suite for fast and deep clustering and searching of large protein sequence sets. Bioinf. 32 (9), 1323-1330 (2016).
  12. Ondov, B. D., Bergman, N. H., Phillippy, A. M. Interactive metagenomic visualization in a Web browser. BMC Bioinf. 12, (2011).
  13. Kolde, R., Vilo, J. GOsummaries: an R Package for Visual Functional Annotation of Experimental Data. F1000Res. 4, 574(2015).
  14. Reddy, T. B. K., et al. The Genomes OnLine Database (GOLD) v.5: a metadata management system based on a four level (meta)genome project classification. Nuc. Aci. Res. 43 (1), 1099-1106 (2015).
  15. Camacho, C., et al. BLAST+: architecture and applications. BMC Bioinf. 10 (1), 421(2009).
  16. Chakravorty, S., Helb, D., Burday, M., Connell, N., Alland, D. A detailed analysis of 16S ribosomal RNA gene segments for the diagnosis of pathogenic bacteria. J. Micro. Met. 69 (2), 330-339 (2007).
  17. Fadrosh, D. W., et al. An improved dual-indexing approach for multiplexed 16S rRNA gene sequencing on the Illumina MiSeq platform. Microbiome. 2 (1), 6(2014).
  18. Mikheyev, A. S., Tin, M. M. Y. A first look at the Oxford Nanopore MinION sequencer. Molecular Ecology Resources. 14 (6), 1097-1102 (2014).
  19. Schadt, E. E., Turner, S., Kasarskis, A. A window into third generation sequencing. Hum. Mol. Genet. 20 (4), 853-853 (2011).
  20. Shapiro, B., Hofreiter, M. A Paleogenomic Perspective on Evolution and Gene Function: New Insights from Ancient DNA. Science. 343 (6169), 1236573(2014).
  21. Der Sarkissian, C., et al. Ancient genomics. Phil. Trans. R. Soc. B. 370 (1660), (2015).
  22. Patin, N. V., Kunin, V., Lidström, U., Ashby, M. N. Effects of OTU Clustering and PCR Artifacts on Microbial Diversity Estimates. Microb Ecol. 65 (3), 709-719 (2013).
  23. McInroy, G. R., Raiber, E. -A., Balasubramanian, S. Chemical biology of genomic DNA: minimizing PCR bias. Chem. Commun. 50 (81), 12047-12049 (2014).
  24. Aller, P., Rould, M. A., Hogg, M., Wallace, S. S., Doublié, S. A structural rationale for stalling of a replicative DNA polymerase at the most common oxidative thymine lesion, thymine glycol. Proc. Natl. Acad. Sci. U.S.A. 104 (3), 814-818 (2007).
  25. Ranjan, R., Rani, A., Metwally, A., McGee, H. S., Perkins, D. L. Analysis of the microbiome: Advantages of whole genome shotgun versus 16S amplicon sequencing. Biochem. Biophys. Res. Commun. 469 (4), 967-977 (2016).
  26. Sims, D., Sudbery, I., Ilott, N. E., Heger, A., Ponting, C. P. Sequencing depth and coverage: key considerations in genomic analyses. Nat Rev Genet. 15 (2), 121-132 (2014).
  27. Li, X., Rao, S., Wang, Y., Gong, B. Gene mining: a novel and powerful ensemble decision approach to hunting for disease genes using microarray expression profiling. Nuc. Aci. Res. 32 (9), 2685-2694 (2004).
  28. Bolger, A. M., Lohse, M., Usadel, B. Trimmomatic: a flexible trimmer for Illumina sequence data. Bioinf. 30 (15), 2114-2120 (2014).
  29. Magoc, T., Salzberg, S. L. FLASH: fast length adjustment of short reads to improve genome assemblies. Bioinf. 27 (21), 2957-2963 (2011).
  30. Bankevich, A., et al. SPAdes: a new genome assembly algorithm and its applications to single-cell sequencing. J. Comput. Biol. 19 (5), 455-477 (2012).
  31. Nurk, S., Meleshko, D., Korobeynikov, A. metaSPAdes: a new versatile de novo metagenomics assembler. , (2016).
  32. Altschul, S. F., Gish, W., Miller, W., Myers, E. W., Lipman, D. J. Basic local alignment search tool. J. Mol. Biol. 215 (3), 403-410 (1990).
  33. Tanaseichuk, O., Borneman, J., Jiang, T. Phylogeny-based classification of microbial communities. Bioinf. 30 (4), 449-456 (2014).
  34. Bose, T., Haque, M. M., Reddy, C., Mande, S. S. COGNIZER: A Framework for Functional Annotation of Metagenomic Datasets. PLoS ONE. 10 (11), 0142102(2015).
  35. Sharma, A. K., Gupta, A., Kumar, S., Dhakan, D. B., Sharma, V. K. Woods: A fast and accurate functional annotator and classifier of genomic and metagenomic sequences. Genomics. 106 (1), 1-6 (2015).
  36. Eikmeyer, F. G., et al. Metagenome analyses reveal the influence of the inoculant Lactobacillus buchneri CD034 on the microbial community involved in grass ensiling. J. Biotech. 167 (3), 334-343 (2013).
  37. Driehuis, F., Elferink, S. J. W. H. O. The impact of the quality of silage on animal health and food safety: A review. Vet. Quart. 22 (4), 212-216 (2000).
  38. Dunière, L., Sindou, J., Chaucheyras-Durand, F., Chevallier, I., Thévenot-Sergentet, D. Silage processing and strategies to prevent persistence of undesirable microorganisms. Anim Feed Sci Technol. 182 (1-4), 1-15 (2013).
  39. Vissers, M. M. M., et al. Minimizing the Level of Butyric Acid Bacteria Spores in Farm Tank Milk. J. of Dairy Sci. 90 (7), 3278-3285 (2007).
  40. Te Giffel, M. C., Wagendorp, A., Herrewegh, A. Bacterial spores in silage and raw milk. Antonie van. , (2002).
  41. Wiedmann, M. ADSA Foundation Scholar Award-An Integrated Science-Based Approach to Dairy Food Safety: Listeria monocytogenes as a Model System. J. of Dairy Sci. 86 (6), 1865-1875 (2003).
  42. Low, J. C., Donachie, W. A review of Listeria monocytogenes and listeriosis. Vet J. 153 (1), 9-29 (1997).
  43. Schoder, D., Melzner, D., Schmalwieser, A. Important vectors for Listeria monocytogenes transmission at farm dairies manufacturing fresh sheep and goat cheese from raw. J.Food. , (2011).
  44. Lindström, M., Myllykoski, J., Sivelä, S., Korkeala, H. Clostridium botulinumin Cattle and Dairy Products. Crit. Rev. Food Sci. Nutr. 50 (4), 281-304 (2010).
  45. Bentley, D. R., et al. Accurate whole human genome sequencing using reversible terminator chemistry. Nature. 456 (7218), 53-59 (2008).
  46. Andrews, S. Babraham Bioinformatic- FastQC: A Quality Control tool for High Throughput Sequence Data. , (2015).
  47. Keegan, K. P., Glass, E. M., Meyer, F. FMG-RAST, a Metagenomics Service for Analysis of Microbial Community Structure and Function. Methods Mol. Biol. 1399, Chapter 13 207-233 (2016).
  48. Cantarel, B. L., et al. The Carbohydrate-Active EnZymes database (CAZy): an expert resource for Glycogenomics. Nuc. Aci. Res. 37, Database issue 233-238 (2009).
  49. Edgar, R. C. Search and clustering orders of magnitude faster than BLAST. Bioinf. 26 (19), 2460-2461 (2010).
  50. Heberle, H., et al. InteractiVenn: a web-based tool for the analysis of sets through Venn diagrams. BMC Bioinf. 16 (1), 213(2015).
  51. Ni, J., Yan, Q., Yu, Y. How much metagenomic sequencing is enough to achieve a given goal. Sci. Rep. 3, 1968(2013).
  52. Truong, D. T., et al. MetaPhlAn2 for enhanced metagenomic taxonomic profiling. Nat. Meth. 12 (10), 902-903 (2015).
  53. Oulas, A., et al. Metagenomics: tools and insights for analyzing next-generation sequencing data derived from biodiversity studies. Bioinform Biol Insights. 9 (9), 75-88 (2015).

重印与许可

标签

DNA DNA