Artykuł metodologiczny

Wspomagana selekcja biomarkerów za pomocą liniowej wielkości efektu analizy dyskryminacyjnej (LEfSe) w danych mikrobiomu

DOI:

10.3791/61715

16 maja 2022

* These authors contributed equally

W tym artykule

Retraction Notice

The article <em>Wspomagana selekcja biomarkerów za pomocą liniowej wielkości efektu analizy dyskryminacyjnej (LEfSe) w danych mikrobiomu</em> (10.3791/61715) has been retracted by the journal upon the authors' request due to a conflict regarding the data and methodology.

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

LEfSe (LDA Effect Size) to narzędzie do wysokowymiarowego poszukiwania biomarkerów w celu identyfikacji cech genomu (takich jak geny, szlaki i taksonomie), które znacząco charakteryzują dwie lub więcej grup w danych mikrobiomu.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Coraz częściej zwraca się uwagę na zamknięte genomy biologiczne w środowisku i zdrowiu. Aby zbadać i ujawnić różnice międzygrupowe między różnymi próbkami lub środowiskami, kluczowe jest odkrycie biomarkerów z różnicami statystycznymi między grupami. Zastosowanie liniowej analizy dyskryminacyjnej Effect Size (LEfSe) może pomóc w znalezieniu dobrych biomarkerów. Na podstawie oryginalnych danych genomu przeprowadzana jest kontrola jakości i kwantyfikacja różnych sekwencji na podstawie taksonów lub genów. Po pierwsze, test rang Kruskala-Wallisa został wykorzystany do rozróżnienia specyficznych różnic między grupami statystycznymi i biologicznymi. Następnie przeprowadzono test rang Wilcoxona między dwiema grupami uzyskanymi w poprzednim kroku, aby ocenić, czy różnice są spójne. Na koniec przeprowadzono liniową analizę dyskryminacyjną (LDA) w celu oceny wpływu biomarkerów na znacząco różniące się grupy na podstawie wyników LDA. Podsumowując, projekt LEfSe umożliwił identyfikację biomarkerów genomowych, które charakteryzują różnice statystyczne między grupami biologicznymi.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Biomarkery to cechy biologiczne, które mogą być mierzone i mogą wskazywać na pewne zjawiska, takie jak infekcja, choroba lub środowisko. Wśród nich biomarkery funkcjonalne mogą być specyficznymi funkcjami biologicznymi pojedynczych gatunków lub wspólnymi dla niektórych gatunków, takimi jak geny, białka, metabolity i szlaki. Poza tym biomarkery taksonomiczne wskazują na niezwykły gatunek, grupę organizmów (królestwo, gromadę, klasę, rząd, rodzinę, rodzaj, gatunek), Amplicon Sequence Varient (ASV)1, lub Operational Taxonomic Unit (OTU)2. Aby szybciej i dokładniej znaleźć biomarkery, niezbędne jest narzędzie do analizy danych biologicznych. Różnice między klasami można wyjaśnić za pomocą LEfSe w połączeniu ze standardowymi testami istotności statystycznej i dodatkowymi testami kodującymi spójność biologiczną i trafność efektów3. LEfSe jest dostępny jako moduł galaktyki, formuła conda, obraz dockera i zawarty w bioBakery (VM i chmura)4. Ogólnie rzecz biorąc, analiza różnorodności mikrobiologicznej często wykorzystuje test nieparametryczny do niepewnego rozmieszczenia społeczności próby. Test sumy rang jest nieparametryczną metodą testową, która wykorzystuje rangę próbek do zastąpienia wartości próbek. W zależności od różnicy grup próbek, można go podzielić na dwie próbki za pomocą testu sumy rang Wilcoxona i na wiele próbek za pomocą testu Kruskala-Wallisa5,6. W szczególności, gdy występują znaczne różnice między wieloma grupami próbek, należy przeprowadzić test sumy rang polegający na porównaniu parami wielu prób. LDA (skrót od Linear Discriminant Analysis) wynaleziony przez Ronalda Fishera w 1936 roku, jest rodzajem uczenia nadzorowanego, znanym również jako Fisher's Linear Discriminant7. Jest to klasyczny i popularny algorytm w obecnej dziedzinie eksploracji danych uczenia maszynowego.

Tutaj test LEfSe został zoptymalizowany przez serwery Conda i Galaxy. Trzy grupy sekwencji genu 16S rRNA są analizowane w celu wykazania istotnych różnic między różnymi grupami z wynikami LDA społeczności drobnoustrojów i wynikami wizualizacji.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

UWAGA: Protokół został zaczerpnięty i zmodyfikowany na podstawie badań Segata et al.3. Metoda jest dostępna pod adresem https://bitbucket.org/biobakery/biobakery/wiki/lefse.

1. Przygotowanie pliku wejściowego do analizy

  1. Przygotuj plik wejściowy (Tabela 1) LEfSe, który może być łatwo wygenerowany przez wiele przepływów pracy8 lub poprzednie protokoły9 z oryginalnymi plikami (przykładowy plik i odpowiadający mu plik adnotacji gatunków).

2. Natywna analiza LEfSe (ograniczona do serwera Linux)

  1. LEfSe Installation
    UWAGA: Zaleca się instalację potoku LEfSe z Conda10.
    1. Uruchom następujące polecenia, aby wykluczyć możliwość konfliktu zależności. Utwórz środowisko conda dla LEfSe (ten krok jest zalecany, ale nie jest wymagany). -n oznacza nazwę środowiska.
      $ conda create -n LEfSe-env
    2. Aby uaktywnić utworzone środowisko LEfSe, uruchom:
      $ source activate LEfSe-env
    3. Aby zainstalować LEfSe z kanałem bioBakery, gdzie -c oznacza nazwę kanału, uruchom:
      $ conda install -c biobakery lefse
  2. Formatowanie danych dla LEfSe
    1. Uruchom następujące polecenie, aby sformatować oryginalny plik do formatu wewnętrznego dla LEfSe. Table.txt jest plikiem wejściowym, a Table-reformat.in jest plikiem wyjściowym. -c służy do ustawiania funkcji, która jest używana jako klasa (domyślnie 1), a -o służy do ustawiania wartości normalizacji (domyślnie -1.0 oznacza brak normalizacji).
      $ format_input.py Table.txt Table-reformat.in -c 1 -o 1000000
  3. Obliczanie wielkości efektu liniowej analizy dyskryminacyjnej (LDA)
    1. Uruchom następujące polecenie. Celem tego kroku jest wykonanie LDA poprzedniego wyniku i wygenerowanie pliku wynikowego dla wizualizacji. Table-reformat.in jest generowany przy użyciu poprzedniego kroku i jest używany jako plik wejściowy w tym kroku. Table-reformat.res jest plikiem wynikowym.
      $ run_lefse.py Table-reformat.in Tabela-reformat.res
  4. Wizualizacja według wykresów
    1. Wykreśl wyniki LEfSe. Aby wykreślić wielkość efektu biomarkerów w pliku pdf,. Table-reformat.res jest generowany przy użyciu poprzedniego kroku, a LDA.pdf jest plikiem wykresu. –format służy do ustawiania formatu pliku wyjściowego.
      $ plot_res.py Tabela-reformat.res LDA.pdf --format pdf
    2. Narysuj kladogram. Narysuj drzewo gatunków i wyświetl biomarkery w kladogramie. cladogram.pdf jest plikiem wyjściowym.
      $ plot_cladogram.py Table-reformat.res cladogram.pdf --format pdf
    3. Wykreśl jedną cechę (opcjonalnie) Aby wykreślić różnice pojedynczego biomarkera między różnymi grupami. -f służy do ustawiania cech wykresu. Jeśli jeden z nich został ustawiony, należy podać –feature_name.
      $ plot_features.py -f jeden --feature_name "k__Bacteria.p__Firmicutes.c__Bacilli.o__Bacillales" --format pdf Table-reformat.in Table-reformat.res Bacillales.pdf
    4. Wykreśl cechy różnicowe (opcjonalnie), aby narysować wszystkie cechy, ale jest zbyt wiele, aby zrobić to ostrożnie. --archive służy do wyboru, czy wyniki mają być kompresowane. ./ oznacza ścieżkę wyników.
      $ plot_features.py -f diff --archive none --format pdf Table-reformat.in Tabela-reformat.res ./

3. Analiza online LEfSe (galaktyka)

  1. Przejdź do galaktyki huttenhowera server11: http://huttenhower.sph.harvard.edu/galaxy.
  2. Prześlij pliki. Naciśnij przycisk strzałki w górę w lewym okienku i prześlij plik. Kliknij Wybierz plik lokalny, aby wybrać plik wejściowy i wybierz format tabelaryczny, a następnie kliknij przycisk Start.
    UWAGA: Odwołując się do strony internetowej (https://bitbucket.org/biobakery/biobakery/wiki/lefse), użyj skryptu (taxonomy_summary. R) w celu wygenerowania pliku wejściowego LEfSe, a format (każda kolumna z nazwą grupy, każdy wiersz z innym poziomem adnotacji oddzielony znakiem "|") jest wymagany, jak pokazano w tabeli 1. Schematyczny przegląd procesu wgrywania jest pokazany w Rysunek 1.
  3. Sformatuj dane dla LEfSe. Kliknij na LEfSe | Formatuj dane dla LEfSe w lewym okienku i wybierz określone wiersze dla klasy w pliku, a następnie kliknij przycisk Wykonaj. Schematyczny przegląd procesu operacyjnego i zastosowanych parametrów przedstawiono na rysunku Rysunek 2.
  4. Oblicz wielkość efektu LDA. Kliknij na LEfSe | LDA Effect Size (LEfSe) w lewym okienku i wybierz wartości parametrów zgodnie z wymaganiami analizy. Kliknij Wykonaj. Schematyczny przegląd procesu operacyjnego i zastosowanych parametrów przedstawiono na Rysunek 3.
  5. Wykreśl wyniki LEfSe. Kliknij na LEfSe | Wykreśl link LEfSe Results w lewym okienku i kliknij przycisk Execute (Wykonaj). Schematyczny przegląd procesu operacyjnego i zastosowanych parametrów przedstawiono na Rysunek 4.
  6. Narysuj kladogram. Kliknij Plot Cladogram w lewym okienku, a następnie kliknij przycisk Execute po wybraniu wartości parametrów. Schematyczny przegląd procesu operacyjnego i zastosowanych parametrów przedstawiono w Rysunek 5.
  7. Wykreśl jeden obiekt, klikając opcję Kreśl jeden obiekt w lewym okienku, a następnie klikając przycisk Wykonaj po wybraniu wartości parametrów. Schematyczny przegląd procesu operacyjnego i zastosowanych parametrów przedstawiono na rysunku Rysunek 6.
  8. Wykreśl cechy różnicowe, klikając pozycję Cechy różnicowe wykresu w lewym okienku i klikając przycisk Wykonaj po wybraniu wartości parametrów. Schematyczny przegląd procesu operacyjnego i zastosowanych parametrów przedstawiono w Rysunek 7.
    UWAGA: Wygenerowane figury można wizualizować i pobierać z wynikowymi danymi wyjściowymi w prawym okienku.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyniki LDA społeczności mikrobiologicznych ze znaczącymi różnicami w każdej grupie, analizując sekwencje genu 16S rRNA trzech próbek, są pokazane w Rysunek 8. Kolor histogramu reprezentuje różne grupy, podczas gdy długość reprezentuje wynik LDA, który jest wpływem gatunku ze znacznymi różnicami między różnymi grupami. Histogram pokazuje gatunki o znaczących różnicach, których wynik LDA jest większy niż wartość ustawiona. Domyślna wartość predefiniowana to 2,0, więc na wykresie wyświetlane są tylko war...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tym miejscu opisano protokół identyfikacji i charakterystyki biomarkerów w różnych grupach. Protokół ten można łatwo dostosować do innych typów próbek, takich jak OTU mikroorganizmów. Metoda statystyczna LEfSe może znaleźć charakterystyczne mikroorganizmy w każdej grupie (domyślnie LDA >2), czyli mikroorganizmy, które są liczniejsze w tej grupie w stosunku do pozostałych12. LEfSe jest dostępny zarówno w natywnej, jak i internetowej wersji Linux, gdzie użytkownicy mogą również przeprowadzać anali...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta praca była wspierana przez grant z Funduszy Badań Podstawowych dla Centralnych Instytutów Badawczych Opieki Społecznej (TKS170205) i Fundacji Rozwoju Nauki i Technologii oraz Instytutu Badawczego Inżynierii Transportu Wodnego w Tianjin (TIWTE), M.O.T. (KJFZJJ170201).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Nie użyto
żadnych materiałów

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bolyen, E., et al. Reproducible, interactive, scalable and extensible microbiome data science using QIIME 2. Nature Biotechnology. 37 (8), 852-857 (2019).
  2. Knight, R., et al. Best practices for analysing microbiomes. Nature Reviews. Microbiology. 16 (7), 410-422 (2018).
  3. Segata, N., et al. Metagenomic biomarker discovery and explanation. Genome Biology. 12 (6), 60(2011).
  4. McIver, M., Sayoldin, B., Shafquat, A. Biobakery / lefse [tool]. , Available from: https://bitbucket.org/biobakery/biobakery/wiki/lefse (2019).
  5. Kruskal, W. H. A nonparametric test for the several sample problem. The Annals of Mathematical Statistics. 23 (4), 525-540 (1952).
  6. Wilcoxon, F. Individual comparisons by ranking methods. Biometrics Bulletin. 1 (6), 80-83 (1945).
  7. Fisher, R. A. The use of multiple measurements in taxonomic problems. Annals of Eugenics. 7 (1), 179-188 (1936).
  8. Liu, Y. X., et al. A practical guide to amplicon and metagenomic analysis of microbiome data. Protein and Cell. 41 (7), 1-16 (2020).
  9. Shahi, S. K., Zarei, K., Guseva, N. V., Mangalam, A. K. Microbiota analysis using two-step PCR and next-generation 16S rRNA gene sequencing. Journal of Visualized Experiments: JoVE. (152), e59980(2019).
  10. Grüning, B., et al. Bioconda: sustainable and comprehensive software distribution for the life sciences. Nature Methods. 15 (7), 475-476 (2018).
  11. Blankenberg, D., Chilton, J., Coraor, N. Galaxy external display applications: closing a dataflow interoperability loop. Nature Methods. 17 (2), 123-124 (2020).
  12. Langille, M. G. I., et al. Predictive functional profiling of microbial communities using 16S rRNA marker gene sequences. Nature Biotechnology. 31 (9), 814-821 (2013).
  13. Shilei, Z., et al. Reservoir water stratification and mixing affects microbial community structure and functional community composition in a stratified drinking reservoir. Journal of Environmental Management. 267, 110456(2020).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Linear Discriminant AnalysisBiomarker SelectionMicrobiome DataKruskal Wallis TestWilcoxon Rank TestLDA Effect SizeLEfSe AnalysisGalaxy ServerPrincipal Component AnalysisGenomic Biomarkers