5 lutego 2014
Tutaj opisujemy krok po kroku proces generowania wiarygodnych filogenez z zestawów danych sekwencji nukleotydów lub aminokwasów. Niniejszy przewodnik ma na celu służyć naukowcom lub studentom, którzy nie mają doświadczenia w analizie filogenetycznej.
Ogólnym celem tego artykułu jest zrekonstruowanie wiarygodnego drzewa filogenetycznego na podstawie sekwencji DNA lub białek. Osiąga się to poprzez uprzednią identyfikację podobnych sekwencji za pomocą programów wybuchowych w NCBI. Drugim krokiem jest wyrównanie podobnych sekwencji.
Następnie, na podstawie wyrównania, określa się najlepiej dopasowany model ewolucji. Ostatnim krokiem jest wywnioskowanie pokrewieństwa filogenetycznego z wyrównanych sekwencji. Ostatecznie potok krok po kroku służy do pokazania, w jaki sposób użytkownicy mogą przejść od danych sekwencyjnych do wiarygodnych filogenez.
Metoda ta może pomóc odpowiedzieć na kluczowe pytania w różnych dziedzinach poprzez wnioskowanie o tożsamości i funkcji nowych sekwencji. Aby skorzystać z wersji online podstawowego narzędzia do wyszukiwania wyrównania lokalnego lub wybuchu, przejdź do National Center for Biotechnology Information lub serwera internetowego Blast firmy NNC. Kliknij na odpowiedni program obróbki strumieniowo-ściernej.
Wprowadź sekwencję tekstową sformatowaną w formacie FASTA, taką jak pokazana tutaj, w polu zapytania. Kliknij odpowiedni program do obróbki strumieniowo-ściernej, który ma zostać użyty w wyszukiwaniu, a następnie kliknij przycisk Śrut. Dane wyjściowe są domyślnie w formacie HTML i wyświetlają sekwencje najbardziej podobne do sekwencji tekstu wejściowego.
Następna sekcja dotyczy korzystania z lokalnego pliku wykonywalnego blast w systemie Windows Mac. Użytkownicy mogą przejść do następnej sekcji o nazwie Blast Local Executables for Macs x. Aby uruchomić program wiersza poleceń blast na komputerze z systemem Windows, pobierz odpowiedni plik wykonywalny systemu Windows ze strony internetowej NCBI blast.
Po zainstalowaniu programu Blast skonfiguruj zmienną środowiskową komputera w następujący sposób, kliknij przycisk Start komputera i kliknij prawym przyciskiem myszy komputer. Następnie kliknij przycisk Właściwości. W nowym oknie wybierz zaawansowane ustawienia systemu, a następnie na karcie zaawansowane nowego wyskakującego okienka kliknij przycisk zmiennych środowiskowych.
Następnie w sekcji zmienne użytkownika dla użytkownika kliknij nowy przycisk. W nowym wyskakującym okienku dodaj ścieżkę nazwy zmiennej i wartość zmiennej pokazaną tutaj. Następnie pobierz wstępnie sformatowaną bazę danych blastów, która jest codziennie aktualizowana ze strony internetowej NCBI lub genom konkretnego organizmu.
Następnie otwórz wiersz polecenia MS DOS, klikając start i wpisując CMD w pasku wyszukiwania i przejdź do folderu NCBI blast. Utwórz bazę danych za pomocą polecenia Make blast DB pokazanego tutaj. Utwórz sekwencję białka zapytania o nazwie test, wstawiając sekwencję tekstową białka w formacie FASTA do folderu bazy danych.
Następnie, aby zidentyfikować sekwencje najbardziej podobne do badanego białka, przeszukaj bazę danych za pomocą polecenia zapytania blast P. Poniższa sekcja powtarza te informacje dla użytkowników komputerów Mac. Użytkownicy systemu Windows mogą przejść do sekcji piątej generującej wiele wyrównań sekwencji.
Aby uruchomić program wiersza poleceń blast na komputerze Mac, pobierz odpowiedni plik wykonywalny MAC, uzyskując zdalny dostęp do witryny N-C-B-I-F-T-P. Aby to zrobić, otwórz wyszukiwarkę i wyszukaj terminal w oknie terminala, wpisz adres FTP witryny N-C-B-I-F-T-P. Wpisz anonymous jako nazwę i hasło, a następnie wpisz CD blast slash executables slash latest.
Wymień pliki wykonywalne, wpisując LS i pobierz najnowszą wersję, która spełnia Twoje wymagania systemowe, wpisując następujące polecenie. Teraz rozpakuj pobrane pliki. Teraz dodaj lokalizację plików binarnych dla pliku wykonywalnego blast do swojej ścieżki, aby powłoka mogła przeszukiwać ten katalog.
Szukając poleceń, pobierz wstępnie sformatowaną bazę danych blastów lub genom ze strony NCBI. Przeszukaj katalog genomów, wpisując genomy CD. Następnie pobierz interesujący Cię genom lub sekwencję w następujący sposób, a następnie wpisz quit, aby opuścić witrynę FTP.
Następnie utwórz bazę danych, wpisując instrukcję Make Blast DB. Wstaw sekwencję zapytania sformatowaną w formacie FASTA do folderu bin i przeszukaj bazę danych za pomocą polecenia zapytania blast P, aby znaleźć najbardziej podobną sekwencję do danych sekwencji testowej wśród powszechnie używanych programów do wyrównywania wielu sekwencji lub MSA, czyli herbata, kawa. Po wprowadzeniu sformatowanych danych sekwencji fasta do pola zapytania w witrynie z herbatą i kawą, dane wyjściowe wskazują podobne pozostałości za pomocą kodowania kolorami.
Innym powszechnie używanym programem MSA jest klastrowy MSA, który można pobrać jako wersję wiersza poleceń, CLUSTERAL W lub wersję graficzną CLUSTERAL X dla różnych systemów operacyjnych. Następnie załaduj dane do programu klastrowego tak szybko, jak sformatowany tekst sekwencji, wybierając kartę pliku. Następnie kliknij przycisk załaduj sekwencje.
Teraz przejdź do zakładki wyrównania i kliknij przycisk wykonaj całkowite wyrównanie, aby wyrównać sekwencje w celu uzyskania najlepiej dopasowanego modelu ewolucji. Pobierz program protestu. Po pobraniu protestu kliknij dwukrotnie na protest.
Po uruchomieniu protestu kliknij wybierz plik w polu wyrównania, aby załadować dane sekwencji. Następnie kliknij start, aby uruchomić program. Po zakończeniu przebiegu program wskazuje najlepszy model na podstawie kryteriów wnioskowania sekwencji.
Po pobraniu i uruchomieniu Phi ML załaduj sekwencję wejściową jako sekwencję sformatowaną z wargami pliku, wpisując nazwę pliku i PY. Następnie uruchom program, wpisując y. Po pobraniu programu do wnioskowania bayesowskiego ze strony internetowej Mr Bays, uruchom program, klikając plik wykonywalny. Następnie odczytaj dane sekwencji sformatowane w Nexusie do programu, wpisując nazwę pliku wykonania kropka NEX.
Następnie ustaw model ewolucyjny i wybierz liczbę pokoleń do uruchomienia. Po uruchomieniu analizy za pomocą polecenia mc mc podsumuj drzewa za pomocą polecenia sum T, aby wyświetlić drzewo filogenetyczne. Pobierz program do obsługi widoku drzewa.
Na koniec dodam, że stale pojawiają się nowe wersje oprogramowania, którego celem jest zapewnienie lepszych dopasowań, przewidywań podobieństwa lub drzew filogenetycznych. Chociaż przegląd w tym filmie obejmował popularne programy, widz jest zachęcany do zapoznania się z dodatkowymi opcjami. Algorytm blast wykonuje lokalne wyrównania, które wyszukują krótkie odcinki podobieństwa sekwencji.
Po tym, jak algorytm wyszuka wszystkie możliwe odcinki z sekwencji zapytania i maksymalnie rozszerzy te sekwencje, następnie montuje wyrównania. Dla każdej pary sekwencji zapytań wartość e wskazuje istotność statystyczną dopasowania. Im niższa wartość E, tym bardziej znaczące trafienie.
Na przykład wyrównanie sekwencji z wartością E równą 0,05 oznacza, że prawdopodobieństwo wystąpienia tego dopasowania wyłącznie przez przypadek wynosi pięć na 100. Wynik BIT wykorzystuje określoną macierz punktacji, aby wskazać, jak dobre jest wyrównanie. Im wyższy wynik BIT, tym lepsze wyrównanie.
Wyrównanie wielu sekwencji lub MSA to wyrównanie sekwencji trzech lub więcej sekwencji pierwszorzędowych złożonych z aminokwasów, DNA lub RNA. Widoczne tutaj wyjście z herbaty MSA i kawy koduje kolorami podobne pozostałości. Przykładowe wyrównanie sześciu sekwencji białek wyrównanych za pomocą klastra X pokazano tutaj dla dopasowań aminokwasów.
Program protest służy do określenia wyboru najlepiej dopasowanych modeli zamienników aminokwasów. W ramach danych program wyświetla listę modeli w miarę ich analizy i wyświetla najlepsze dopasowanie po zakończeniu programu, Phi ML szacuje filogenezę maksymalnego prawdopodobieństwa na podstawie dopasowań sekwencji nukleotydów lub aminokwasów. Zawiera dużą liczbę modeli podstawień sprzężonych z różnymi opcjami przeszukiwania przestrzeni topologii drzewa.
Pan Bayes wykorzystuje bayesowskie wnioskowanie CMC w wielu modelach ewolucyjnych do rekonstrukcji relacji filogenetycznych. Po uruchomieniu programu postęp można wyświetlać w określonych odstępach czasu, jak pokazano tutaj. Po wygenerowaniu drzewa filogenetycznego należy zobrazować topologię.
Na tym rysunku w oknie widoku drzewa wyświetlana jest próbka białka z muchy. Baza. Widok drzewa zawiera edytor drzewa, który umożliwia użytkownikowi przenoszenie gałęzi i przekierowywanie drzew. Próbując wykonać tę procedurę, należy pamiętać o dokładnym przeczytaniu instrukcji obsługi każdego programu.
Protokół ten stanowi praktyczny punkt wyjścia do zapoznania czytelnika z działaniem tych programów. Zachęcam jednak czytelnika do zabawy i zapoznania się z wieloma ustawieniami związanymi z każdym programem.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Ten artykuł przedstawia krok po kroku przepływ odbudowy rzetelnych drzew filogenetycznych na podstawie sekwencji DNA lub białek. Jest on przeznaczony dla badaczy i studentów, którzy zaczynają swoją przygodę z analizą filogenetyczną.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.