需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于线性判别分析效应量(LEfSe)的微生物组数据生物标志物辅助筛选

22K 次观看

DOI:

10.3791/61715

2022年5月16日

* These authors contributed equally

本文内容

Retraction Notice

The article <em>基于线性判别分析效应量(LEfSe)的微生物组数据生物标志物辅助筛选</em> (10.3791/61715) has been retracted by the journal upon the authors' request due to a conflict regarding the data and methodology.

摘要

LEfSe(LDA效应大小)是一种用于高维生物标志物挖掘的工具,可识别在微生物组数据中显著表征两个或多个组的基因组特征(如基因、通路和分类群)。

摘要

目前,人们对环境和健康中封闭生物基因组的关注日益增加。为了探索并揭示不同样本或环境之间的组间差异,发现具有统计学差异的生物标志物至关重要。应用线性判别分析效应量(LEfSe)方法有助于寻找优良的生物标志物。基于原始基因组数据,首先根据分类单元或基因对不同序列进行质量控制和定量分析。接着,采用Kruskal-Wallis秩和检验来识别统计学和生物学组之间的特异性差异;然后,在前一步获得的两组之间进行Wilcoxon秩和检验,以评估差异是否具有一致性;最后,通过线性判别分析(LDA)根据LDA得分评估生物标志物对显著不同组别的影响程度。综上所述,LEfSe为识别表征生物组间统计学差异的基因组生物标志物提供了便利。

引言

生物标志物是可以测量的生物学特征,能够指示某些现象,如感染、疾病或环境变化。其中,功能生物标志物可能为单一物种特有的生物学功能,或为某些物种共有的功能,例如基因、蛋白质、代谢物及代谢通路。此外,分类学生物标志物指示异常的物种、生物类群(界、门、纲、目、科、属、种)、扩增子序列变异体(ASV)1,或操作分类单元(OTU)2。为了更快速、准确地发现生物标志物,有必要使用一种用于分析生物数据的工具。类群丰度差异可通过LEfSe结合统计显著性标准检验,以及编码生物学一致性和效应相关性的附加检验加以解释3。LEfSe可作为Galaxy模块、Conda公式、Docker镜像使用,并集成于bioBakery(虚拟机和云平台)中4。通常,微生物多样性分析常采用非参数检验方法,以应对样本群落分布的不确定性。秩和检验是一种非参数检验方法,通过使用样本的秩次代替原始数值进行分析。根据样本组数的不同,可分为用于两组样本比较的Wilcoxon秩和检验,以及用于多组样本比较的Kruskal-Wallis检验5,6。值得注意的是,当多组样本间存在显著差异时,应进一步进行多组间的成对比较秩和检验。LDA(即线性判别分析,Linear Discriminant Analysis),由Ronald Fisher于1936年提出,是一种监督学习方法,亦称为Fisher线性判别7,是当前机器学习与数据挖掘领域中经典且广泛应用的算法。

此处,LEfSe 分析已通过 Conda 和 Galaxy 服务器进行了优化。分析了三组 16S rRNA 基因序列,以展示不同组间微生物群落的 LDA 分值差异及可视化结果。

访问受限。请登录或开始试用以查看此内容。

方案

注意:本实验方案源自 Segata 等人的研究3,并进行了修改。该方法可在 https://bitbucket.org/biobakery/biobakery/wiki/lefse 获取。

1. 分析用输入文件的准备

  1. 准备LEfSe的输入文件(表1),该文件可通过多种工作流程8或先前的实验方案9,利用原始文件(样本文件及相应的物种注释文件)轻松生成。

2. LEfSe 本地分析(仅限于 Linux 服务器)

  1. LEfSe 安装
    注意:建议使用 Conda10 安装 LEfSe 分析流程。
    1. 运行以下命令以排除依赖冲突的可能性。为 LEfSe 创建一个 conda 环境(此步骤为推荐操作,非必需)。-n 表示环境名称。
      $ conda create -n LEfSe-env
    2. 要激活已创建的 LEfSe 环境,请运行:
      $ source activate LEfSe-env
    3. 通过 bioBakery 通道安装 LEfSe,其中 -c 表示通道名称,请运行:
      $ conda install -c biobakery lefse
  2. 为 LEfSe 格式化数据
    1. 运行以下命令,将原始文件格式转换为 LEfSe 的内部格式。Table.txt 为输入文件,Table-reformat.in 为输出文件。-c 用于设置作为分类(默认值为 1)的特征,-o 用于设置标准化值(默认值为 -1.0,表示不进行标准化)。
      $ format_input.py Table.txt Table-reformat.in -c 1 -o 1000000
  3. 计算线性判别分析(LDA)效应量
    1. 运行以下命令。此步骤的目的是对上一步结果执行 LDA 分析,并生成用于可视化的结果文件。Table-reformat.in 由前一步生成,作为本步骤的输入文件,Table-reformat.res 为输出结果文件。
      $ run_lefse.py Table-reformat.in Table-reformat.res
  4. 绘图可视化
    1. 绘制 LEfSe 结果。将生物标志物的效应量绘制成 PDF 文件,Table-reformat.res 由上一步生成,LDA.pdf 为输出图形文件。--format 用于设置输出文件格式。
      $ plot_res.py Table-reformat.res LDA.pdf --format pdf
    2. 绘制进化分支图(cladogram)。用于绘制物种树并在进化分支图中展示生物标志物。cladogram.pdf 为输出文件。
      $ plot_cladogram.py Table-reformat.res cladogram.pdf --format pdf
    3. 绘制单个特征(可选) 用于绘制单个生物标志物在不同组之间的差异。-f 用于设置绘图特征。若设置为 one,则必须提供 --feature_name 参数。
      $ plot_features.py -f one --feature_name "k__Bacteria.p__Firmicutes.c__Bacilli.o__Bacillales" --format pdf Table-reformat.in Table-reformat.res Bacillales.pdf
    4. 绘制差异特征(可选),用于绘制所有特征,但内容较多需谨慎使用。--archive 用于选择是否压缩结果。./ 表示结果的存储路径。
      $ plot_features.py -f diff --archive none --format pdf Table-reformat.in Table-reformat.res ./

3. LEfSe 在线分析(galaxy)

  1. 访问 Huttenhower Galaxy 服务器11:http://huttenhower.sph.harvard.edu/galaxy。
  2. 上传文件。点击左侧窗格中的上传箭头按钮,上传文件。点击选择本地文件以选择输入文件,并将格式设置为表格形式(tabular),然后点击开始按钮。
    注意:参考网页(https://bitbucket.org/biobakery/biobakery/wiki/lefse),使用脚本(taxonomy_summary.R)生成 LEfSe 的输入文件,所需格式为(每一列对应一个组名,每一行以“|”分隔不同层级的注释信息),如表 1所示。上传过程的示意图见图 1
  3. 为 LEfSe 格式化数据。在左侧窗格中点击LEfSe | 为 LEfSe 格式化数据(Format Data for LEfSe)链接,选择文件中用于分类的特定行,然后点击执行(Execute)按钮。操作流程及所用参数的示意图见图 2
  4. 计算 LDA 效应值。在左侧窗格中点击LEfSe | LDA 效应大小(LEfSe)链接,根据分析需求设置参数值,然后点击执行(Execute)按钮。操作流程及所用参数的示意图见图 3
  5. 绘制 LEfSe 结果图。在左侧窗格中点击LEfSe | 绘制 LEfSe 结果(Plot LEfSe Results)链接,然后点击执行(Execute)按钮。操作流程及所用参数的示意图见图 4
  6. 绘制进化树图(cladogram)。在左侧窗格中点击绘制进化树(Plot Cladogram),设置参数值后点击执行(Execute)按钮。操作流程及所用参数的示意图见图 5
  7. 绘制单个特征图。在左侧窗格中点击绘制单个特征(Plot One Feature),设置参数值后点击执行(Execute)按钮。操作流程及所用参数的示意图见图 6
  8. 绘制差异特征图。在左侧窗格中点击绘制差异特征(Plot Differential Features),设置参数值后点击执行(Execute)按钮。操作流程及所用参数的示意图见图 7
    注意:生成的图像可在右侧窗格的结果输出中进行可视化查看并下载。

访问受限。请登录或开始试用以查看此内容。

结果

通过分析三个样本的16S rRNA基因序列,获得各组间存在显著差异的微生物群落的LDA得分,结果如图8所示。柱状图的颜色代表不同的组别,柱长表示LDA得分,反映的是不同组间具有显著差异物种的影响程度。图中展示的是LDA得分高于预设阈值的显著差异物种。默认的预设阈值为2.0,因此图中仅显示LDA得分绝对值(横坐标)大于2.0的结果。

不同分类层级间具有显著差异的生物标志物及物种树如图9所示。从内到外的同心圆环代表从门到属的分类层级(最内侧的黄色圆环为界)。在不同分类层级上每个小圆的直径表示其相对丰度的大小。无显著差异的物种统一用黄色表示,具有显著差异的物种生物标志物则以相应组别的颜色标注。A、B 和 C 类为所采集微生物样本的分组名称。红色节点表示在红色组(A)中起重要作用的微生物类群;绿色节点表示在绿色组(B)中起重要作用的微生物类群;蓝色节点表示在蓝色组(C)中起重要作用的微生物类群。图中未直接标出的生物标志物对应物种名称显示在右侧,字母编号与图中相对应(默认仅...

访问受限。请登录或开始试用以查看此内容。

讨论

本文描述了在不同组别中识别和表征生物标志物的实验方案。该方案可轻松适用于其他类型的样本,例如微生物的操作分类单元(OTUs)。LEfSe 统计方法可用于发现各组中的特征性微生物(默认为 LDA >2),即在该组中相对于其他组更为丰富的微生物12。LEfSe 提供本地版和基于网页的 Linux 版本,用户也可在网页上直接进行 LEfSe 分析。LEfSe 基于线性判别分析(LDA)算法,需要物种层级信息以构建物种进化树。通过该工具的应用,可比较组间的相对丰度。所有差异性生物标志物均可在同一张图中展示,也可批量绘制单个或全部生物标志物的图表。

无论通过本地服务器还是在线网站执行LEfSe分析,都需要设置大量可调节参数以生成所需的图表。由于输入文件结构复杂,且需要将其转换为LEfSe进一步分析所要求的数据格式,因此已开发出一些一站式服务工具。尽管如此,实现操作简便性的优化仍具有挑战性。另一方面,使用LEfSe分析复杂数据时存在一些局限性。线性判别分析(LDA)所投影的特征维度比类别数少一维,若需要更多特征,则需引入其他方法。LDA的...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本工作由中央级公益性科研院所基本科研业务费专项资金(TKS170205)、科学技术发展基金以及交通运输部天津水运工程科学研究院(TIWTE)(KJFZJJ170201)资助。

访问受限。请登录或开始试用以查看此内容。

参考文献

  1. Bolyen, E., et al. Reproducible, interactive, scalable and extensible microbiome data science using QIIME 2. Nature Biotechnology. 37 (8), 852-857 (2019).
  2. Knight, R., et al. Best practices for analysing microbiomes. Nature Reviews. Microbiology. 16 (7), 410-422 (2018).
  3. Segata, N., et al. Metagenomic biomarker discovery and explanation. Genome Biology. 12 (6), 60(2011).
  4. McIver, M., Sayoldin, B., Shafquat, A. Biobakery / lefse [tool]. , Available from: https://bitbucket.org/biobakery/biobakery/wiki/lefse (2019).
  5. Kruskal, W. H. A nonparametric test for the several sample problem. The Annals of Mathematical Statistics. 23 (4), 525-540 (1952).
  6. Wilcoxon, F. Individual comparisons by ranking methods. Biometrics Bulletin. 1 (6), 80-83 (1945).
  7. Fisher, R. A. The use of multiple measurements in taxonomic problems. Annals of Eugenics. 7 (1), 179-188 (1936).
  8. Liu, Y. X., et al. A practical guide to amplicon and metagenomic analysis of microbiome data. Protein and Cell. 41 (7), 1-16 (2020).
  9. Shahi, S. K., Zarei, K., Guseva, N. V., Mangalam, A. K. Microbiota analysis using two-step PCR and next-generation 16S rRNA gene sequencing. Journal of Visualized Experiments: JoVE. (152), e59980(2019).
  10. Grüning, B., et al. Bioconda: sustainable and comprehensive software distribution for the life sciences. Nature Methods. 15 (7), 475-476 (2018).
  11. Blankenberg, D., Chilton, J., Coraor, N. Galaxy external display applications: closing a dataflow interoperability loop. Nature Methods. 17 (2), 123-124 (2020).
  12. Langille, M. G. I., et al. Predictive functional profiling of microbial communities using 16S rRNA marker gene sequences. Nature Biotechnology. 31 (9), 814-821 (2013).
  13. Shilei, Z., et al. Reservoir water stratification and mixing affects microbial community structure and functional community composition in a stratified drinking reservoir. Journal of Environmental Management. 267, 110456(2020).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

Kruskal Wallis Wilcoxon LDA LEfSe Galaxy