5 lutego 2014
Tutaj opisujemy krok po kroku proces generowania wiarygodnych filogenez z zestawów danych sekwencji nukleotydów lub aminokwasów. Niniejszy przewodnik ma na celu służyć naukowcom lub studentom, którzy nie mają doświadczenia w analizie filogenetycznej.
Ogólnym celem niniejszego artykułu jest rekonstrukcja wiarygodnego drzewa filogenetycznego na podstawie sekwencji DNA lub białek. Cel ten osiąga się poprzez wstępną identyfikację podobnych sekwencji przy użyciu programów blast w bazie NCBI. Drugim krokiem jest dopasowanie podobnych sekwencji.
Następnie na podstawie dopasowania wyznaczany jest najlepiej dopasowany model ewolucji. Ostatnim krokiem jest wnioskowanie o pokrewieństwie filogenetycznym z dopasowanych sekwencji. W rezultacie ten etapowy schemat postępowania służy do pokazania, w jaki sposób użytkownicy mogą przejść od danych sekwencyjnych do wiarygodnych drzew filogenetycznych.
Metoda ta może pomóc w udzieleniu odpowiedzi na kluczowe pytania w różnych dziedzinach poprzez wnioskowanie o tożsamości i funkcji nowych sekwencji. Aby skorzystać z wersji online podstawowego narzędzia do lokalnego wyszukiwania dopasowań, czyli BLAST, należy przejść do National Center for Biotechnology Information lub na serwer WWW BLAST NCBI. Następnie należy kliknąć odpowiedni program BLAST.
Wprowadź sekwencję tekstową w formacie FASTA, taką jak ta pokazana tutaj, do pola zapytania. Kliknij odpowiedni program BLAST do użycia w wyszukiwaniu, a następnie kliknij blast. Wyniki są domyślnie wyświetlane w formacie HTML i prezentują sekwencje najbardziej podobne do wprowadzonej sekwencji tekstowej.
Kolejna sekcja dotyczy korzystania z lokalnego pliku wykonywalnego blast w systemie Windows Mac. Użytkownicy mogą przejść bezpośrednio do następnej sekcji zatytułowanej Pliki wykonywalne Blast Local dla komputerów Mac x. Aby uruchomić program blast z linii komend na maszynie z systemem Windows, należy pobrać odpowiedni plik wykonywalny dla systemu Windows ze strony internetowej NCBI blast.
Po zainstalowaniu programu Blast skonfiguruj zmienne środowiskowe systemu PC w następujący sposób: kliknij przycisk Start, a następnie kliknij prawym przyciskiem myszy opcję komputer. Następnie wybierz właściwości. W nowym oknie wybierz zaawansowane ustawienia systemu, a w zakładce zaawansowane nowego okna kliknij przycisk zmienne środowiskowe.
Następnie w sekcji zmiennych użytkownika (user variables) kliknij przycisk „nowy” (new). W nowym oknie wyskakującym wpisz nazwę zmiennej „path” oraz wartość zmiennej wskazaną na ekranie. Następnie pobierz wstępnie sformatowaną bazę danych BLAST, która jest codziennie aktualizowana na stronie NCBI, lub genom konkretnego organizmu.
Następnie otwórz wiersz poleceń MS DOS, klikając start i wpisując CMD w pasku wyszukiwania, a następnie przejdź do folderu NCBI blast. Utwórz bazę danych za pomocą polecenia Make blast DB pokazanego tutaj. Utwórz zapytanie sekwencji białkowej o nazwie test, wstawiając sekwencję tekstową białka w formacie FASTA do folderu DB.
Następnie, aby zidentyfikować sekwencje najbardziej podobne do białka testowego, należy przeszukać bazę danych za pomocą polecenia zapytania blast P. Kolejna sekcja powtarza te informacje dla użytkowników systemu Mac. Użytkownicy systemu Windows mogą przejść bezpośrednio do sekcji piątej dotyczącej generowania wielosekwencyjnych dopasowań.
Aby uruchomić program wiersza poleceń blast na komputerze Mac, pobierz odpowiedni plik wykonywalny dla systemu MAC, uzyskując zdalny dostęp do witryny N-C-B-I-F-T-P. W tym celu otwórz Finder i wyszukaj Terminal; w oknie terminala wpisz adres FTP witryny N-C-B-I-F-T-P. Jako nazwę użytkownika i hasło wpisz anonymous, a następnie wpisz CD blast slash executables slash latest.
Wypisz pliki wykonywalne, wpisując LS, a następnie pobierz najnowszą wersję zgodną z wymaganiami Twojego systemu, wpisując poniższą komendę. Teraz rozpakuj pobrane pliki. Następnie dodaj lokalizację plików binarnych dla programu blast do zmiennej path, aby powłoka mogła przeszukiwać ten katalog.
W celu uzyskania poleceń, pobierz sformatowaną wcześniej bazę danych blast lub genom ze strony internetowej NCBI. Przeszukaj katalog genomów, wpisując CD genomes. Następnie pobierz interesujący Cię genom lub sekwencję w następujący sposób, a potem wpisz quit, aby wyjść z serwera FTP.
Następnie utwórz bazę danych, wpisując instrukcję Make Blast DB. Wprowadź sekwencję zapytania w formacie FASTA do folderu bin i przeszukaj bazę danych za pomocą polecenia blast P query, aby znaleźć sekwencję najbardziej podobną do danych sekwencji testowej; jednym z powszechnie stosowanych programów do wielosekwencyjnego dopasowania (MSA) jest T-Coffee. Po wprowadzeniu danych sekwencji w formacie FASTA do pola zapytania w serwisie T-Coffee, wynik wskazuje podobne reszty za pomocą kodowania kolorami.
Innym powszechnie używanym programem do MSA jest Clustal MSA, który można pobrać jako wersję wiersza poleceń, CLUSTAL W, lub wersję graficzną CLUSTAL X dla różnych systemów operacyjnych. Następnie załaduj dane do programu Clustal jako sformatowany tekst sekwencji, wybierając kartę pliku. Następnie kliknij przycisk ładuj sekwencje.
Przejdź teraz do karty align i kliknij przycisk do complete alignment, aby dopasować sekwencje dla modelu ewolucji o najlepszym dopasowaniu. Pobierz program protest. Po pobraniu programu protest, kliknij go dwukrotnie.
Po uruchomieniu programu Protest, kliknij przycisk „select file” w polu dopasowania, aby wczytać dane sekwencji. Następnie kliknij „start”, aby uruchomić program. Po zakończeniu analizy program wskaże najlepszy model na podstawie kryteriów wnioskowania sekwencji.
Po pobraniu i uruchomieniu programu Phi ML, wczytaj sekwencję wejściową jako plik z sekwencją w formacie lip, wpisując nazwę pliku oraz PY. Następnie uruchom program, wpisując y. Po pobraniu programu do wnioskowania bayesowskiego ze strony internetowej Mr Bays, uruchom program, klikając w plik wykonywalny. Następnie wczytaj do programu dane sekwencyjne w formacie Nexus, wpisując execute nazwapliku dot NEX.
Następnie należy ustawić model ewolucyjny i wybrać liczbę generacji do przeprowadzenia. Po uruchomieniu analizy za pomocą polecenia mc mc, podsumuj drzewa, używając polecenia sum T, aby wyświetlić drzewo filogenetyczne. Pobierz program do wizualizacji drzew.
Na koniec należy zaznaczyć, że stale pojawiają się nowe wersje oprogramowania, których celem jest zapewnienie lepszych dopasowań, przewidywań podobieństwa lub drzew filogenetycznych. Chociaż w niniejszym filmie przedstawiono popularne programy, zachęca się widza do zapoznania się z dodatkowymi opcjami. Algorytm blast wykonuje dopasowania lokalne, które polegają na wyszukiwaniu krótkich odcinków podobieństwa sekwencji.
Po tym, jak algorytm wyszukał wszystkie możliwe fragmenty z sekwencji zapytania i maksymalnie je rozszerzył, przystępuje do zestawiania dopasowań. Dla każdej pary sekwencji zapytania wartość e wskazuje na istotność statystyczną dopasowania. Im niższa wartość E, tym bardziej istotny jest wynik.
Na przykład dopasowanie sekwencji z wartością E równą 0,05 oznacza, że prawdopodobieństwo wystąpienia takiego dopasowania wyłącznie w wyniku przypadku wynosi pięć na 100. Wynik BIT wykorzystuje specyficzną macierz punktową, aby wskazać, jak dobre jest dopasowanie. Im wyższy wynik BIT, tym lepsze dopasowanie.
Wielokrotne dopasowanie sekwencji (ang. multiple sequence alignment, MSA) to dopasowanie trzech lub więcej sekwencji pierwotnych składających się z aminokwasów, DNA lub RNA. Wynik z programu MSA T-Coffee przedstawiony tutaj zawiera kodowanie kolorystyczne podobnych reszt. Przykładowe dopasowanie sześciu sekwencji białkowych wykonane za pomocą programu Clustal X jest tutaj pokazane dla dopasowań aminokwasowych.
Program protest służy do wyznaczania najlepiej dopasowanych modeli podstawień aminokwasów. W ramach przetwarzania danych program wyświetla analizowane modele, a po zakończeniu pracy wskazuje model o najlepszym dopasowaniu. Program Phi ML szacuje filogenie metodą maksymalnej wiarygodności na podstawie dopasowań sekwencji nukleotydowych lub aminokwasowych. Zawiera on dużą liczbę modeli podstawień wraz z różnymi opcjami przeszukiwania przestrzeni topologii drzew.
Program Mr.Bayes wykorzystuje bayesowską inferencję CMC w ramach wielu modeli ewolucyjnych do rekonstrukcji relacji filogenetycznych. Po uruchomieniu programu postępy można obserwować w określonych odstępach czasu, jak pokazano tutaj. Po wygenerowaniu drzewa filogenetycznego konieczna jest wizualizacja jego topologii.
Na tej ilustracji okno widoku drzewa wyświetla przykładowe drzewo białek z bazy fly.Base. Widok drzewa zawiera edytor drzew, który umożliwia użytkownikowi przesuwanie gałęzi i zmianę trasy drzew. Podczas wykonywania tej procedury ważne jest, aby dokładnie zapoznać się z instrukcjami obsługi każdego programu.
Niniejszy protokół stanowi praktyczny punkt wyjścia, który zapoznaje czytelnika z zasadami działania tych programów. Zachęcam jednak do samodzielnego testowania i zapoznania się z licznymi ustawieniami dostępnymi w każdym z programów.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Niniejszy artykuł przedstawia szczegółowy proces rekonstrukcji wiarygodnych drzew filogenetycznych na podstawie sekwencji DNA lub białek. Jest on przeznaczony dla badaczy oraz studentów rozpoczynających pracę z analizą filogenetyczną.
Analiza filogenetyczna umożliwia walidację celu oraz ograniczanie ryzyka mechanistycznego we wczesnej fazie odkrywania leków poprzez wnioskowanie o tożsamości funkcjonalnej i relacjach ewolucyjnych nowych sekwencji. Niniejszy proces wspiera pewność prognostyczną w identyfikacji leadów, wyjaśniając kontekst biologiczny i redukując niejednoznaczność w testowaniu hipotez dotyczących celu. Stanowi on pomost translacyjny między danymi sekwencyjnymi a adnotacją funkcjonalną, dostarczając informacji niezbędnych do triage'u portfolio i podejmowania decyzji o dalszym rozwoju projektów z uwzględnieniem ryzyka.
Metoda ta integruje się z ciągiem procesów odkrywania leków – od identyfikacji celu po optymalizację związku wiodącego – umożliwiając testowanie hipotez, biologiczną redukcję ryzyka oraz modelowanie predykcyjne w oparciu o pokrewieństwo ewolucyjne.