Method Article

Unterstützte Auswahl von Biomarkern durch lineare Diskriminanzanalyse-Effektgröße (LEfSe) in Mikrobiomdaten

DOI:

10.3791/61715

May 16th, 2022

* These authors contributed equally

In This Article

Retraction Notice

The article <em>Unterstützte Auswahl von Biomarkern durch lineare Diskriminanzanalyse-Effektgröße (LEfSe) in Mikrobiomdaten</em> (10.3791/61715) has been retracted by the journal upon the authors' request due to a conflict regarding the data and methodology.

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

LEfSe (LDA Effect Size) ist ein Werkzeug für das hochdimensionale Biomarker-Mining zur Identifizierung genomischer Merkmale (wie Gene, Signalwege und Taxonomien), die zwei oder mehr Gruppen in Mikrobiomdaten signifikant charakterisieren.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Es gibt eine wachsende Aufmerksamkeit für geschlossene biologische Genome in der Umwelt und in der Gesundheit. Um die Unterschiede zwischen den Gruppen zwischen verschiedenen Proben oder Umgebungen zu untersuchen und aufzudecken, ist es wichtig, Biomarker mit statistischen Unterschieden zwischen den Gruppen zu entdecken. Die Anwendung der linearen Diskriminanzanalyse Effect Size (LEfSe) kann helfen, gute Biomarker zu finden. Basierend auf den ursprünglichen Genomdaten werden Qualitätskontrollen und Quantifizierungen verschiedener Sequenzen basierend auf Taxa oder Genen durchgeführt. Zunächst wurde der Kruskal-Wallis-Rangtest verwendet, um zwischen spezifischen Unterschieden zwischen statistischen und biologischen Gruppen zu unterscheiden. Dann wurde der Wilcoxon-Rangtest zwischen den beiden im vorherigen Schritt erhaltenen Gruppen durchgeführt, um zu beurteilen, ob die Unterschiede konsistent waren. Schließlich wurde eine lineare Diskriminanzanalyse (LDA) durchgeführt, um den Einfluss von Biomarkern auf signifikant unterschiedliche Gruppen basierend auf LDA-Scores zu bewerten. Zusammenfassend lässt sich sagen, dass LEfSe die Möglichkeit bot, genomische Biomarker zu identifizieren, die statistische Unterschiede zwischen biologischen Gruppen charakterisieren.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Biomarker sind biologische Eigenschaften, die gemessen werden können und auf einige Phänomene wie Infektionen, Krankheiten oder Umwelt hinweisen können. Unter ihnen können funktionelle Biomarker spezifische biologische Funktionen einzelner Spezies oder einiger Arten sein, wie Gen, Protein, Metabolit und Signalwege. Außerdem weisen taxonomische Biomarker auf eine ungewöhnliche Art, eine Gruppe von Organismen (Königreich, Stamm, Klasse, Ordnung, Familie, Gattung, Art), den Amplicon Sequence Varient (ASV)1 oder die Operational Taxonomic Unit (OTU)2 hin. Um Biomarker schneller und genauer zu finden, ist ein Werkzeug zur Analyse der biologischen Daten notwendig. Die Unterschiede zwischen den Klassen können durch LEfSe in Verbindung mit Standardtests für statistische Signifikanz und zusätzlichen Tests zur Kodierung biologischer Konsistenz und Effektrelevanzerklärt werden 3. LEfSe ist als Galaxiemodul, als Conda-Formel, als Docker-Image und in bioBakery (VM und Cloud)4 enthalten. Im Allgemeinen wird bei der Analyse der mikrobiellen Vielfalt häufig ein nicht-parametrischer Test für die unsichere Verteilung einer Stichprobengemeinschaft verwendet. Der Rangsummentest ist ein nichtparametrisches Testverfahren, bei dem der Rang von Stichproben verwendet wird, um den Wert von Stichproben zu ersetzen. Entsprechend der Differenz der Stichprobengruppen kann sie mit dem Wilcoxon-Rangsummentest in zwei Stichproben und mit dem Kruskal-Wallis-Test 5,6 in mehrere Stichproben unterteilt werden. Insbesondere wenn signifikante Unterschiede zwischen mehreren Gruppen von Stichproben bestehen, sollte ein Rangsummentest des paarweisen Vergleichs mehrerer Stichproben durchgeführt werden. LDA (was für Linear Discriminant Analysis steht), das 1936 von Ronald Fisher erfunden wurde, ist eine Art überwachtes Lernen, auch bekannt als Fisher's Linear Discriminant7. Es ist ein klassischer und beliebter Algorithmus im aktuellen Bereich des Machine Learning Data Mining.

Hier wurde der LEfSe-Assay von Conda- und Galaxy-Servern optimiert. Drei Gruppen von 16S rRNA-Gensequenzen werden analysiert, um die signifikanten Unterschiede zwischen verschiedenen Gruppen mit LDA-Scores mikrobieller Gemeinschaften und Visualisierungsergebnissen zu demonstrieren.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

HINWEIS: Das Protokoll wurde aus der Forschung von Segata et al.3 bezogen und modifiziert. Die Methode wird am https://bitbucket.org/biobakery/biobakery/wiki/lefse bereitgestellt.

1. Vorbereitung der Eingabedatei für die Analyse

  1. Bereiten Sie die Eingabedatei (Tabelle 1) von LEfSe vor, die von vielen Workflows8 oder früheren Protokollen9 mit den Originaldateien (Beispieldatei und entsprechende Speziesannotationsdatei) leicht generiert werden kann.

2. LEfSe native Analyse (beschränkt auf den Linux-Server)

  1. LEfSe Installation
    HINWEIS: Es wird empfohlen, die LEfSe-Rohrleitung mit Conda10 zu installieren.
    1. Führen Sie die folgenden Befehle aus, um die Möglichkeit eines Abhängigkeitskonflikts auszuschließen. Erstellen Sie eine Conda-Umgebung für LEfSe (Dieser Schritt wird empfohlen, ist aber nicht erforderlich.). -n steht für den Umgebungsnamen.
      $ conda create -n LEfSe-env
    2. Um die erstellte LEfSe-Umgebung zu aktivieren, führen Sie Folgendes aus:
      $ Quelle aktivieren LEfSe-env
    3. Um LEfSe mit Kanal bioBakery zu installieren, wobei -c für Kanalname steht, führen Sie Folgendes aus:
      $ conda install -c biobakery lefse
  2. Formatieren von Daten für LEfSe
    1. Führen Sie den folgenden Befehl aus, um die Originaldatei in das interne Format für LEfSe zu formatieren. Tabelle.txt ist die Eingabedatei und Table-reformat.in ist die Ausgabedatei. -c wird verwendet, um das Feature festzulegen, das als Klasse verwendet wird (Standard 1), und -o wird verwendet, um den Normalisierungswert festzulegen (Standard -1.0 bedeutet keine Normalisierung).
      $ format_input.py Tisch.txt Table-reformat.in -c 1 -o 1000000
  3. Berechnung der Effektgröße der linearen Diskriminanzanalyse (LDA)
    1. Führen Sie den folgenden Befehl aus. Der Zweck dieses Schritts besteht darin, LDA des vorherigen Ergebnisses durchzuführen und die Ergebnisdatei für die Visualisierung zu generieren. Table-reformat.in wird mit dem vorherigen Schritt generiert und in diesem Schritt als Eingabedatei verwendet. Table-reformat.res ist die Ergebnisdatei.
      $ run_lefse.py Table-reformat.in Table-reformat.res
  4. Visualisierung durch Plots
    1. Zeichnen Sie die LEfSe-Ergebnisse auf. Um die Effektgröße der Biomarker in einer PDF-Datei darzustellen, Table-reformat.res wird mit dem vorherigen Schritt generiert und LDA.pdf ist die Plotdatei. –format wird verwendet, um das Format der Ausgabedatei festzulegen.
      $ plot_res.py Table-reformat.res LDA.pdf --format pdf
    2. Zeichnen Sie das Kladogramm auf. Um den Artenbaum zu zeichnen und die Biomarker in einem Kladogramm anzuzeigen. cladogram.pdf ist die Ausgabedatei.
      $ plot_cladogram.py Table-reformat.res Kladogramm.pdf --format pdf
    3. Ein Feature plotten (optional) Darstellung der Unterschiede eines einzelnen Biomarkers zwischen verschiedenen Gruppen. -f wird verwendet, um die Features des Plots festzulegen. Wenn eins gesetzt wurde, muss das –feature_name angegeben werden.
      $ plot_features.py -f eins --feature_name "k__Bacteria.p__Firmicutes.c__Bacilli.o__Bacillales" --format pdf Table-reformat.in Table-reformat.res Bacillales.pdf
    4. Zeichnen Sie die differentiellen Features (optional), um alle Features zu zeichnen, aber es gibt zu viel mit Vorsicht zu tun. --archive wird verwendet, um auszuwählen, ob die Ergebnisse komprimiert werden sollen. ./ bezeichnet den Weg der Ergebnisse.
      $ plot_features.py -f diff --archive none --format pdf Table-reformat.in Table-reformat.res ./

3. LEfSe Online-Analyse (Galaxie)

  1. Gehe zum Huttenhower Galaxy Server 11:http://huttenhower.sph.harvard.edu/galaxy.
  2. Laden Sie die Dateien hoch. Klicken Sie im linken Bereich auf die Nach-oben-Taste und laden Sie die Datei hoch. Klicken Sie auf Lokale Datei auswählen , um die Eingabedatei auszuwählen und das Format tabellarisch auszuwählen, und klicken Sie dann auf die Schaltfläche Start .
    HINWEIS: Wenn Sie auf die Webseite (https://bitbucket.org/biobakery/biobakery/wiki/lefse) verweisen, verwenden Sie das Skript (taxonomy_summary. R) um die Eingabedatei von LEfSe zu generieren, und das Format (jede Spalte mit einem Gruppennamen, jede Zeile mit einer anderen Anmerkungsebene, getrennt durch "|") ist erforderlich, wie in Tabelle 1 gezeigt. Eine schematische Übersicht über den Upload-Prozess ist in Abbildung 1 dargestellt.
  3. Formatieren Sie die Daten für LEfSe. Klicken Sie auf die LEfSe-| Formatieren Sie Daten für LEfSe im linken Bereich, wählen Sie die spezifischen Zeilen für die Klasse in der Datei aus und klicken Sie auf die Schaltfläche Ausführen. Eine schematische Übersicht über den Betriebsablauf und die verwendeten Parameter ist in Abbildung 2 dargestellt.
  4. Berechnen Sie die LDA-Effektgröße. Klicken Sie auf die LEfSe | Link LDA Effect Size (LEfSe) im linken Bereich und wählen Sie Parameterwerte entsprechend den Analyseanforderungen aus. Klicken Sie auf Ausführen. Eine schematische Übersicht über den Betriebsablauf und die verwendeten Parameter ist in Abbildung 3 dargestellt.
  5. Zeichnen Sie die LEfSe-Ergebnisse auf. Klicken Sie auf die LEfSe-| Plotten Sie LEfSe-Ergebnisse im linken Bereich und klicken Sie auf die Schaltfläche Ausführen. Eine schematische Übersicht über den Betriebsablauf und die verwendeten Parameter ist in Abbildung 4 dargestellt.
  6. Zeichnen Sie das Kladogramm auf. Klicken Sie im linken Bereich auf Plot Cladogram und dann auf die Schaltfläche Ausführen, nachdem Sie die Parameterwerte ausgewählt haben. Eine schematische Übersicht über den Betriebsablauf und die verwendeten Parameter ist in Abbildung 5 dargestellt.
  7. Zeichnen Sie ein Feature, indem Sie im linken Bereich auf Plot One Feature (Ein Feature plotten ) klicken und nach der Auswahl der Parameterwerte auf die Schaltfläche Ausführen klicken. Eine schematische Übersicht über den Betriebsablauf und die verwendeten Parameter ist in Abbildung 6 dargestellt.
  8. Zeichnen Sie differenzielle KEs, indem Sie im linken Fensterausschnitt auf Differenzielle KEs plotten klicken und nach Auswahl der Parameterwerte auf die Schaltfläche Ausführen klicken. Eine schematische Übersicht über den Betriebsablauf und die verwendeten Parameter ist in Abbildung 7 dargestellt.
    HINWEIS: Diese generierten Zahlen können visualisiert und gegen die resultierende Ausgabe im rechten Bereich heruntergeladen werden.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die LDA-Scores von mikrobiellen Gemeinschaften mit signifikanten Unterschieden in jeder Gruppe durch Analyse der 16S rRNA-Gensequenzen von drei Proben sind in Abbildung 8 dargestellt. Die Farbe des Histogramms repräsentiert verschiedene Gruppen, während die Länge den LDA-Score darstellt, der den Einfluss der Spezies mit signifikanten Unterschieden zwischen verschiedenen Gruppen darstellt. Das Histogramm zeigt die Arten mit signifikanten Unterschieden, deren LDA-Wert größer als der voreingest...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier wird das Protokoll zur Identifizierung und Charakterisierung von Biomarkern innerhalb verschiedener Gruppen beschrieben. Dieses Protokoll kann leicht für andere Probentypen, wie OTUs von Mikroorganismen, angepasst werden. Die statistische Methode vonLEfSe kann die charakteristischen Mikroorganismen in jeder Gruppe finden (Standard ist LDA >2), dh die Mikroorganismen, die in dieser Gruppe im Vergleich zu den anderen 12 häufiger vorkommen. LEfSe ist sowohl in nativen als auch in Web-Linux-Versi...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Die Autoren haben nichts offenzulegen.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Diese Arbeit wurde durch ein Stipendium der Grundlagenforschungsfonds für die zentralen Forschungsinstitute des öffentlichen Wohlergehens (TKS170205) und der Stiftung für die Entwicklung von Wissenschaft und Technologie sowie des Tianjin Research Institute for Water Transport Engineering (TIWTE), M.O.T. (KJFZJJ170201) unterstützt.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Keine verwendeten
Materialien

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bolyen, E., et al. Reproducible, interactive, scalable and extensible microbiome data science using QIIME 2. Nature Biotechnology. 37 (8), 852-857 (2019).
  2. Knight, R., et al. Best practices for analysing microbiomes. Nature Reviews. Microbiology. 16 (7), 410-422 (2018).
  3. Segata, N., et al. Metagenomic biomarker discovery and explanation. Genome Biology. 12 (6), 60(2011).
  4. McIver, M., Sayoldin, B., Shafquat, A. Biobakery / lefse [tool]. , Available from: https://bitbucket.org/biobakery/biobakery/wiki/lefse (2019).
  5. Kruskal, W. H. A nonparametric test for the several sample problem. The Annals of Mathematical Statistics. 23 (4), 525-540 (1952).
  6. Wilcoxon, F. Individual comparisons by ranking methods. Biometrics Bulletin. 1 (6), 80-83 (1945).
  7. Fisher, R. A. The use of multiple measurements in taxonomic problems. Annals of Eugenics. 7 (1), 179-188 (1936).
  8. Liu, Y. X., et al. A practical guide to amplicon and metagenomic analysis of microbiome data. Protein and Cell. 41 (7), 1-16 (2020).
  9. Shahi, S. K., Zarei, K., Guseva, N. V., Mangalam, A. K. Microbiota analysis using two-step PCR and next-generation 16S rRNA gene sequencing. Journal of Visualized Experiments: JoVE. (152), e59980(2019).
  10. Grüning, B., et al. Bioconda: sustainable and comprehensive software distribution for the life sciences. Nature Methods. 15 (7), 475-476 (2018).
  11. Blankenberg, D., Chilton, J., Coraor, N. Galaxy external display applications: closing a dataflow interoperability loop. Nature Methods. 17 (2), 123-124 (2020).
  12. Langille, M. G. I., et al. Predictive functional profiling of microbial communities using 16S rRNA marker gene sequences. Nature Biotechnology. 31 (9), 814-821 (2013).
  13. Shilei, Z., et al. Reservoir water stratification and mixing affects microbial community structure and functional community composition in a stratified drinking reservoir. Journal of Environmental Management. 267, 110456(2020).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Linear Discriminant AnalysisBiomarker SelectionMicrobiome DataKruskal Wallis TestWilcoxon Rank TestLDA Effect SizeLEfSe AnalysisGalaxy ServerPrincipal Component AnalysisGenomic Biomarkers