Artykuł metodologiczny

Baza danych ITS2

DOI:

10.3791/3806

12 marca 2012

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Baza danych ITS2 to środowisko pracy służące do wnioskowania filogenetycznego z jednoczesnym uwzględnieniem sekwencji i struktury drugorzędowej wewnętrznego transkrybowanego odstępnika 2. Obejmuje ona gromadzenie danych z dokładną adnotacją, przewidywanie struktury, wielokrotne dopasowanie sekwencji i struktur oraz szybkie obliczanie drzew. W skrócie, to narzędzie sprowadza wstępne analizy filogenetyczne do kilku kliknięć.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wewnętrzny transkrybowany spacer 2 (ITS2) jest wykorzystywany jako marker filogenetyczny od ponad dwóch dekad. Ponieważ badania nad ITS2 koncentrowały się głównie na bardzo zmiennej sekwencji ITS2, marker ten ograniczano jedynie do filogenetyki niskiego poziomu. Jednakże połączenie sekwencji ITS2 i jej wysoce konserwatywnej struktury drugorzędowej poprawia rozdzielczość filogenetyczną1 i umożliwia wnioskowanie filogenetyczne na wielu poziomach taksonomicznych, w tym w zakresie delimitacji gatunków2-8.

Baza danych ITS29 przedstawia wyczerpujący zestaw danych sekwencji wewnętrznego transkrybowanego łącznika 2 pochodzących z NCBI GenBank11, które zostały precyzyjnie ponownie adnotowane10. Po adnotacji z wykorzystaniem profilowych ukrytych modeli Markowa (HMMs), przewidywana jest struktura drugorzędowa każdej sekwencji. Najpierw sprawdzane jest, czy fałdowanie oparte na minimalnej energii12 (fałdowanie bezpośrednie) prowadzi do prawidłowej konformacji czterech helis. Jeśli tak nie jest, struktura jest przewidywana za pomocą modelowania homologicznego13. W modelowaniu homologicznym znana już struktura drugorzędowa jest przenoszona na inną sekwencję ITS2, której struktura drugorzędowa nie mogła zostać prawidłowo sfałdowana w procesie fałdowania bezpośredniego.

Baza danych ITS2 nie służy jedynie do przechowywania i pobierania struktur sekwencji ITS2. Udostępnia ona również szereg narzędzi do przetwarzania własnych sekwencji ITS2, w tym adnotację, przewidywanie struktury, wykrywanie motywów oraz wyszukiwanie BLAST14 w oparciu o połączone informacje o sekwencji i strukturze. Ponadto integruje ona przycięte wersje programów 4SALE15,16 i ProfDistS17 do obliczania wielokrotnego dopasowania sekwencji i struktur oraz rekonstrukcji drzew metodą Neighbor Joining18. Wspólnie tworzą one spójny potok analizy, prowadzący od początkowego zestawu sekwencji do filogenezy opartej na sekwencji i strukturze drugorzędowej.

Mówiąc w skrócie, to środowisko pracy upraszcza wstępne analizy filogenetyczne do zaledwie kilku kliknięć myszą, zapewniając jednocześnie narzędzia i dane niezbędne do przeprowadzania kompleksowych analiz na dużą skalę.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Prawidłowa adnotacja sekwencji ITS2

  1. Przejdź do panelu filogenetycznego bazy danych ITS2 tutaj: http://its2.bioapps.biozentrum.uni-wuerzburg.de
  2. Rozpocznij analizę, klikając ikonę „Annotate” w sekcji „Tools”. Następnie wpisz lub wklej swoją sekwencję do edytora sekwencji u góry strony. Edytor sekwencji automatycznie sprawdza poprawność sekwencji ITS2.
  3. Wybierz model HMM odpowiedni dla Twoich sekwencji (np. Viridiplantae dla roślin).
  4. Uruchom proces, klikając „Annotate”.
  5. Po najechaniu kursorem na ikonę „Hybridize” można wyświetlić obraz hybrydy rRNA 5.8S i 28S w celu potwierdzenia dokładności adnotacji HMM.
  6. Kliknij zielony znak plus przy wynikowej sekwencji ITS2, aby wybrać metodę przewidywania struktury drugorzędowej: aby przewidzieć strukturę bez znanej matrycy, kliknij „Predict structure”. Jeśli chcesz użyć własnej matrycy do modelowania homologicznego, kliknij „Model structure”.

2. Przewidywanie struktury drugorzędowej

  1. Przewidywanie
    1. Adnotowana sekwencja ITS2 jest automatycznie wklejana do edytora sekwencji.
    2. Aby rozpocząć przewidywanie struktury drugorzędowej z ustawieniami domyślnymi, kliknij przycisk „Predict structures”.
    3. Zapisz wynikową sekwencję ITS2 wraz z wymodelowaną strukturą drugorzędową w puli danych, klikając zielony znak plusa, a następnie „Add to pool”. Alternatywnie można dodać ją do puli danych za pomocą funkcji przeciągnij i upuść (Rysunek 1).
    4. Jeśli sekwencja nie mogła zostać sfałdowana bezpośrednio, wyświetlane są najlepsze wyniki modelowania homologicznego. Zapisz najbardziej odpowiednią sekwencję i strukturę w puli danych za pomocą funkcji przeciągnij i upuść. Alternatywnie zapisz sekwencję i strukturę w puli danych, klikając prawym przyciskiem myszy, a następnie wybierając „Add to pool”.
  2. Modelowanie niestandardowe
    1. Wpisz lub wklej jeden lub więcej szablonów (o znanej strukturze) do górnego edytora sekwencji.
    2. Wpisz lub wklej jedną lub więcej sekwencji docelowych (bez struktury) do dolnego edytora sekwencji.
    3. Kliknij „Predict best template(s)”, aby rozpocząć modelowanie homologiczne z ustawieniami domyślnymi.
    4. Najlepsze kombinacje szablon-cel są wyświetlane w wynikowej liście.
    5. Zapisz wybrane wymodelowane sekwencje i struktury za pomocą funkcji przeciągnij i upuść do puli danych lub poprzez kliknięcie prawym przyciskiem myszy i wybranie „Add to pool”.

3. Wyszukiwanie motywów

  1. Wpisz lub wklej sekwencję zapytania w edytorze sekwencji u góry strony internetowej.
  2. Wybierz odpowiedni model HMM (np. Viridiplantae dla roślin). 3.3. Kliknij „Motif search”, aby rozpocząć proces.
  3. Sekwencje ITS2 z wyróżnionymi motywami są przedstawione na dole strony internetowej.
  4. Kliknij ikonę obok nagłówka sekwencji, aby wyświetlić motywy wyróżnione w strukturze drugorzędowej.

4. Wyszukiwanie i przeglądanie

  1. Wyszukiwanie
    1. Wpisz nazwę taksonu lub identyfikator GenBank (GI) w polu wyszukiwania u góry strony internetowej.
    2. Wyszukiwanie według nazwy taksonu jest wspomagane przez pojawiające się pole wyszukiwania na żywo.
    3. Można przeprowadzić wyszukiwanie wielokrotne, oddzielając zapytania przecinkami.
    4. Kliknij przycisk „Search”, aby wykonać wyszukiwanie.
    5. Wyniki zostaną wyświetlone na liście w nowej karcie.
    6. Kliknij nazwę kolumny, aby posortować wyniki według tej konkretnej kolumny. Możesz również dodawać lub usuwać wybrane kolumny za pomocą menu kolumn. Do menu kolumn można przejść, klikając ikonę strzałki pojawiającą się przy nazwie kolumny.
    7. Kliknij „Show details”, aby wyświetlić szczegóły struktury sekwencji.
    8. Zapisz wybraną strukturę lub struktury sekwencji, przeciągając je do puli danych lub klikając prawym przyciskiem myszy i wybierając „Add to pool”.
    9. Aby zapisać wyniki do pliku zewnętrznego, kliknij „Save selection” lub „Save all”.
  2. Przeglądanie
    1. Przeglądaj bazę danych ITS2, korzystając ze struktury drzewiastej po lewej stronie strony internetowej.
    2. Kliknij znak plus, aby wyświetlić taksony na niższym poziomie.
    3. Kliknij nazwę taksonu, aby otworzyć nową kartę zawierającą każdą strukturę sekwencji tego taksonu.
    4. Kliknij „Show details”, aby wyświetlić szczegóły pary struktur sekwencji.
    5. Zapisz wybraną strukturę lub struktury sekwencji, przeciągając je do puli danych lub klikając prawym przyciskiem myszy i wybierając „Add to pool”.
    6. Aby zapisać wyniki do pliku zewnętrznego, kliknij „Save selection” lub „Save all”.

5. Blast ITS2

  1. Wpisz lub wklej jedną lub więcej sekwencji zapytania do edytora sekwencji. Sekwencje mogą być zwykłymi sekwencjami nukleotydowymi lub parami sekwencja-struktura. Można również wpisać kilka struktur drugorzędowych poniżej jednej sekwencji. Po zaznaczeniu pola „Serialize XXFASTA sequences” struktury te są wykorzystywane kolejno jako oddzielne zapytania.
  2. Aby uruchomić BLAST z ustawieniami domyślnymi, kliknij „Blast”. W zależności od charakteru zapytania zostanie wykonany standardowy BLASTN lub BLAST sekwencji-struktury ITS2.
  3. W pojawiającej się karcie „BLAST Results” zostanie otwarta podkarta dla każdej sekwencji zapytania, a także wyświetlony zostanie przegląd przeprowadzonych wyszukiwań.
  4. Kliknij „Show Alignments”, aby wyświetlić obliczone dopasowania BLAST.
  5. Wybrane trafienia BLAST można zapisać, przeciągając je do puli danych (drag and drop) lub klikając prawym przyciskiem myszy i wybierając „Add to pool”.
  6. Aby zapisać wyniki do pliku zewnętrznego, kliknij „Save selection” lub „Save all”.

6. Wielokrotne dopasowanie sekwencji i struktur

  1. Przejrzyj pulę danych, klikając „Manage dataset”, a następnie symbol lupy znajdujący się bezpośrednio obok liczby sekwencji w puli. Alternatywnie można kliknąć ikonę puli danych w lewym dolnym rogu strony internetowej.
  2. Kliknij parę sekwencja-struktura w puli danych, aby wyświetlić jej szczegóły.
  3. Aby utworzyć wielokrotne dopasowanie sekwencji i struktur dla wszystkich par sekwencja-struktura w puli, kliknij „Analyze dataset”, a następnie „Sequence & Structure”.
  4. W tym momencie zostaniesz poproszony o wybranie trybu graficznego dopasowania. Jeśli dopasowanie zawiera tylko kilka sekwencji, odrzuć tryb kompaktowy (slim mode), klikając „No”. W przeciwnym razie wybierz tryb graficzny kompaktowy, klikając „Yes”.
  5. Po chwili dopasowanie zostanie wyświetlone w nowej karcie (Rysunek 2). Ponadto zostanie ono automatycznie zapisane w puli danych.
  6. Aby zapisać dopasowanie w pliku zewnętrznym, kliknij „Save alignment”.

7. Drzewo filogenetyczne

  1. Aby obliczyć drzewo Neighbor Joining na podstawie sekwencji i struktury dla dopasowania wielokrotnego, kliknij „Analyze Dataset”, a następnie „Neighbor Joining”.
  2. Wynikowe drzewo zostanie wyświetlone w nowej karcie (Rysunek 3).
  3. Skaluj drzewo dowolnie za pomocą paska przewijania „Zoom tree”.
  4. Zmień punkt zakorzenienia drzewa, klikając węzeł lub liść drzewa, a następnie wybierając „Reroot at this node”.
  5. Jeśli chcesz usunąć takson z puli danych, kliknij liść i wybierz „Remove this node from pool”. Teraz możesz ponownie obliczyć dopasowanie i drzewo z ograniczoną próbką taksonów.
  6. Kliknij „Save tree”, aby zapisać drzewo filogenetyczne jako końcowy wynik analizy w zewnętrznym pliku NEWICK.

8. Dodatkowe oprogramowanie

  1. Kliknij „About this website”-„Tools”, aby znaleźć dodatkowe informacje na temat samodzielnych narzędzi 4SALE oraz ProfDistS.
  2. Oprócz funkcji dopasowania sekwencji i metody Neighbor Joining dostępnych w interfejsie webowym bazy danych ITS2, można teraz korzystać z kilku nowych funkcji, np. delimitacji gatunków w oparciu o kompensacyjne zmiany zasad (CBCs).

9. Reprezentatywne wyniki

Opisany powyżej schemat pracy został z sukcesem zastosowany w kilku przeglądach typu open access3,4. Przykłady można wyświetlić za pomocą poniższych linków:

W tych badaniach na szeroką skalę udało nam się z wysoką rozdzielczością odtworzyć filogenezę Chlorophyta, jak również Hypnales (Bryophyta). W obu przypadkach zgromadzono wyczerpujący dobór taksonów z bazy danych ITS29, które następnie automatycznie wyrównano za pomocą 4SALE15,16, a na koniec przetworzono programem ProfDistS17 w drzewo filogenetyczne. Na wszystkich tych etapach jednocześnie wykorzystywano informacje o sekwencji i strukturze. Wsparcie bootstrap dla szkieletu filogenetycznego uzyskano metodą Profile Neighbor Joining (PNJ)19, która jest dostępna w samodzielnej wersji ProfDistS.

W przypadku mniejszego zestawu par sekwencja-struktura, rysunki 1 do 3 opisują kluczowe etapy tego zautomatyzowanego procesu 5 bezpośrednio w panelu roboczym nowej bazy danych ITS2: próbkowanie taksonów, wielosekwencyjne wyrównanie struktur, a ostatecznie obliczanie drzewa filogenetycznego.

Schemat predykcji struktury drugorzędowej ITS2; interfejs analizy fałdowania RNA i dopasowania sekwencji.
Rysunek 1. Pobieranie taksonów metodą przeciągnij i upuść. W dowolnym momencie do puli danych można dodać sekwencje lub pary sekwencja-struktura, na przykład za pomocą funkcji przeciągnij i upuść. Tutaj, po przeprowadzeniu predykcji struktury drugorzędowej, dodano parę sekwencja-struktura metodą przeciągnij i upuść. Niebieska elipsa zaznacza obszar, w którym para sekwencja-struktura zostaje przeniesiona do puli danych. Kliknij tutaj, aby wyświetlić obraz w pełnym rozmiarze.

Schemat wielokrotnego dopasowania sekwencji; porównanie sekwencji DNA; analiza bioinformatyczna.
Rysunek 2. Wielokrotne dopasowanie sekwencji i struktury w pełnym trybie graficznym. Dla niewielkiej liczby sekwencji w puli danych wybrano pełny tryb graficzny. Zasady są kolorowe; pary zasad można wyróżnić czerwonymi okręgami, klikając w jedną zasadę lub nawias pary zasad. Kliknij tutaj, aby wyświetlić obraz w pełnym rozmiarze.

Schemat drzewa filogenetycznego, gatunki chlorofitów, relacje ewolucyjne.
Rycina 3. Drzewo Neighbor Joining oparte na sekwencji i strukturze. Swobodnie skalowalne drzewo obliczone na podstawie wielokrotnego dopasowania sekwencji i struktur siedmiu taksonów może zostać zapisane w formacie NEWICK.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Baza danych ITS2 jest kompletnym i w pełni funkcjonalnym narzędziem do filogenetyki opartej na sekwencjach i strukturach wewnętrznego transkrybowanego odstępnika 2. Strona internetowa działa bardzo szybko i intuicyjnie. Podczas gdy inne internetowe narzędzia filogenetyczne, takie jak ARB20 czy Mobyle21, umożliwiają pracę jedynie na informacjach o sekwencjach i/lub strukturze konsensusowej, Baza danych ITS29 analizuje jednocześnie sekwencje i indywidualne struktury drugorzędowe dla każdego taksonu. Jednak ze względu na ograniczenia mocy obliczeniowej serwera WWW, w przypadku dużych zbiorów danych wysoce zaleca się stosowanie samodzielnych narzędzi do wyrównywania wielosekwencyjnego i obliczeń metodą Neighbor Joining18, odpowiednio 4SALE15,16 oraz ProfDistS17. Poza podstawowym schematem analizy filogenetycznej sekwencji i struktur ITS25, narzędzia te oferują kilka dodatkowych funkcji, takich jak obliczanie replik bootstrap, Profile Neighbor Joining (PNJ)19 czy delimitacja gatunków w oparciu o kompensacyjne zmiany zasad (CBCs)8. Są one dostępne do pobrania wraz ze szczegółowymi informacjami w sekcji „About this website”-„Tools”. Aby korzystać z 4SALE i ProfDistS, konieczne jest zawsze doprowadzenie plików do odpowiedniego formatu. Próbki taksonów przetwarzane przez 4SALE muszą posiadać rozszerzenie .fasta lub .txt, natomiast wyrównanie sekwencji i struktur stanowiące dane wejściowe dla ProfDistS musi kończyć się rozszerzeniem .xfasta.

Obecnie wdrażamy alternatywne metody rekonstrukcji drzew filogenetycznych w bazie danych ITS2, a także w powiązanych narzędziach. W związku z tym w przyszłości dostępne będą takie metody jak Maximum Parsimony22 i/lub Maximum Likelihood23 w oparciu o sekwencję i strukturę.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nie zgłoszono żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Serdecznie dziękujemy grupie ITS2 z Biocentrum Uniwersytetu w Würzburgu za obszerne i cenne uwagi. Dziękujemy również Niemieckiej Wspólnocie Badawczej (Deutsche Forschungsgemeinschaft, DFG; grant Mu-2831/1-1) za finansowanie.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Dostęp do InternetuPreferowany szybki dostęp
Baza danych ITS29Uniwersytet w WürzburguStrona internetowa: http://its2.bioapps.biozentrum.uni-wuerzburg.de
Oprogramowanie: 4SALE15,16Uniwersytet w WürzburguPobieranie: http://4sale.bioapps.biozentrum.uni-wuerzburg.de/
Oprogramowanie: ProfDistS17Uniwersytet w WürzburguPobieranie: http://profdist.bioapps.biozentrum.uni-wuerzburg.de/

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Keller, A. Including RNA secondary structures improves accuracy and robustness in reconstruction of phylogenetic trees. Biology Direct. 5, 4-4 (2010).
  2. Schultz, J., Maisel, S., Gerlach, D., Müller, T., Wolf, M. A common core of secondary structure of the internal transcribed spacer 2 (ITS2) throughout the Eukaryota. RNA. 11, 361-364 (2005).
  3. Buchheim, M. Internal Transcribed Spacer 2 (nu ITS2 rRNA) Sequence-Structure Phylogenetics: Towards an Automated Reconstruction of the Green Algal Tree of Life. PLoS ONE. 6, 16931-16931 (2011).
  4. Merget, B., Wolf, M. A molecular phylogeny of Hypnales (Bryophyta) inferred from ITS2 sequence-structure data. BMC Research Notes. 3, (2010).
  5. Schultz, J., Wolf, M. ITS2 sequence-structure analysis in phylogenetics: a how-to manual for molecular systematics. Molecular Phylogenetics and Evolution. 52, 520-523 (2009).
  6. Coleman, A. ITS2 is a double-edged tool for eukaryote evolutionary comparisons. Trends in Genetics. 19, 370-375 (2003).
  7. Coleman, A. The significance of a coincidence between evolutionary landmarks found in mating affinity and a DNA sequence. Protist. 151, 1-9 (2000).
  8. Müller, T., Philippi, N., Dandekar, T., Schultz, J., Wolf, M. Distinguishing species. RNA. 13, 1469-1472 (2007).
  9. Koetschan, C. The ITS2 Database III-sequences and structures for phylogeny. Nucleic Acids Research. 38, 275-279 (2010).
  10. Keller, A. 5.8 S-28S rRNA interaction and HMM-based ITS2 annotation. Gene. 430, 50-57 (2009).
  11. Benson, D., Karsch-Mizrachi, I., Lipman, D., Ostell, J., Sayers, E. GenBank. Nucleic Acids Research. 39, 32-37 (2011).
  12. Markham, N., Zuker, M. Software for nucleic acid folding and hybridization. Methods in Molecular Biology. , 453-453 (2008).
  13. Wolf, M., Achtziger, M., Schultz, J., Dandekar, T., Müller, T. Homology modeling revealed more than 20,000 rRNA internal transcribed spacer 2 (ITS2) secondary structures. RNA. 11, 1616-1623 (2005).
  14. Altschul, S. Gapped BLAST and PSI-BLAST: a new generation of protein database search programs. Nucleic Acids Research. 25, 3389-3402 (1997).
  15. Seibel, P., Müller, T., Dandekar, T., Wolf, M. Synchronous visual analysis and editing of RNA sequence and secondary structure alignments using 4 SALE. BMC Research Notes. 1, (2008).
  16. Seibel, P., Müller, T., Dandekar, T., Schultz, J., Wolf, M. 4 SALE - A tool for synchronous RNA sequence and secondary structure alignment and editing. BMC Bioinformatics. 7, (2006).
  17. Wolf, M., Ruderisch, B., Dandekar, T., Schultz, J., Müller, T. ProfDistS:(profile-) distance based phylogeny on sequence-structure alignments. Bioinformatics. 24, 2401-2402 (2008).
  18. Saitou, N., Nei, M. The neighbor-joining method: a new method for reconstructing phylogenetic trees. Molecular Biology and Evolution. 4, 406-425 (1987).
  19. Müller, T., Rahmann, S., Dandekar, T., Wolf, M. Accurate and robust phylogeny estimation based on profile distances: a study of the Chlorophyceae (Chlorophyta. BMC Evolutionary Biology. 4, (2004).
  20. Ludwig, W. olfgang ARB: a software environment for sequence data. Nucleic Acids Research. 32, 1363-1371 (2004).
  21. Néron, B. Mobyle: a new full web bioinformatics framework. Bioinformatics. 25, 3005-3011 (2009).
  22. Camin, J. H., Sokal, R. R. A method for deducing branching sequences in phylogeny. Evolution. 19, 311-326 (1965).
  23. Felsenstein, J. Evolutionary trees from DNA sequences: a maximum likelihood approach. Journal of Molecular Evolution. 17, 368-376 (1981).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Przewidywanie struktury drugorz dowejmodelowanie przez homologiadnotacja sekwencjiwykrywanie motyw wwyszukiwanie BLASTwielokrotne wyr wnanie sekwencjidrzewo Neighbor Joininganaliza filogenetycznawyr wnanie sekwencji i struktury

Powiązane artykuły