3 listopada 2011
Opisano wytyczne dotyczące komputerowej charakterystyki strukturalnej i funkcjonalnej białka z wykorzystaniem potoku I-TASSER. Wychodząc od sekwencji białka zapytania, generowane są modele 3D przy użyciu wielokrotnych dopasowań wątkowych oraz iteracyjnych symulacji montażu strukturalnego. Następnie wyciągane są wnioski funkcjonalne na podstawie dopasowań do białek o znanej strukturze i funkcjach.
Celem niniejszej procedury jest komputerowe przewidywanie struktur trójwymiarowych oraz funkcji biologicznych cząsteczek białek na podstawie ich sekwencji aminokwasowych. Jest to realizowane poprzez wstępne przewidywanie struktury drugorzędowej białek za pomocą uczenia maszynowego. Następnie sekwencje i przewidziana struktura drugorzędowa są dopasowywane do struktur rozwiązanych w bibliotece PDB w celu zidentyfikowania jak najlepszych szablonów strukturalnych.
Procedura ta nazywa się threadingiem. Po wykonaniu procedury threadingu program IT AER podzieli szablony na fragmenty na podstawie dopasowań sekwencji szablonów, a następnie w trzecim kroku ponownie złoży fragmenty w modele o pełnej długości. Pełne modele atomowe są konstruowane poprzez rafinację na poziomie atomowym w celu optymalizacji sieci wiązań wodorowych i usunięcia nakładających się sterycznie grup.
Ostatnim krokiem procedury jest identyfikacja funkcji biologicznej białek poprzez dopasowanie struktur przewidywanych do białek o znanej funkcji w bibliotece funkcji. Główną zaletą ITER w porównaniu z istniejącymi metodami modelowania struktur jest wbudowane podejście oparte na składaniu fragmentów struktury, które pozwala na konsekwentne przybliżanie wyrównań wątkujących do stanu natywnego. Te wysokiej jakości modele strukturalne stanowią również podstawę dokładnych adnotacji funkcjonalnych opartych na strukturze, co ma promować stosowanie ITER w społeczności naukowej.
Nasze laboratorium udostępniło witrynę internetową, do której można przesyłać sekwencje białek w celu przeprowadzenia analizy iter. Witryna ta służy jako węzeł, za pośrednictwem którego użytkownicy z całego świata mogą zarejestrować interfejs do klastra komputerowego, który zarządza i uruchamia symulacje ITER. Jedno zadanie symulacyjne ITER składa się z ponad tuzina mniejszych podsymulacji.
Symulacje te, uruchamiane na pojedynczym komputerze z jednym rdzeniem procesora, mogą trwać ponad sto godzin. Klaster komputerowy laboratorium Zang przejmuje te podsymulacje i rozdziela je pomiędzy setki komputerów, będąc zdolnym do uruchomienia ponad 2000 symulacji. Dzięki zastosowaniu klastra komputerowego jesteśmy w stanie codziennie przeprowadzać setki symulacji I taster.
Nawet przy takiej wydajności konieczne jest wykonanie wielu prac w celu optymalizacji systemu i zminimalizowania czasu oczekiwania dla użytkowników systemu IT AER online. Aby rozpocząć eksperyment modelowania struktury i funkcji, zaloguj się na stronę internetową IT AER. Adresy URL wszystkich istotnych stron internetowych omówionych w tym materiale znajdują się w protokole pisemnym.
Skopiuj i wklej sekwencję aminokwasów do odpowiedniego formularza lub prześlij sekwencję bezpośrednio, klikając przycisk przeglądaj. Podaj adres e-mail oraz nazwę zadania. Użytkownicy mogą opcjonalnie określić zewnętrzne ograniczenia kontaktu lub odległości między resztami.
Dodaj dodatkowy szablon lub wyklucz niektóre białka szablonowe podczas procesu modelowania struktury. Aby przesłać sekwencję, kliknij przycisk run it taser. Sprawdź status przesłanego zadania, odwiedzając stronę kolejki IT taser.
Kliknij kartę wyszukiwania i użyj numeru identyfikacyjnego zadania (job ID) lub sekwencji zapytania, aby wyszukać przesłane zadanie. Po zakończeniu modelowania struktury i funkcji na podany adres e-mail zostanie wysłana wiadomość z powiadomieniem, zawierająca obraz przewidywanych struktur oraz link do strony internetowej. Kliknij ten link, aby wyświetlić i pobrać wyniki.
Analizę struktury należy rozpocząć od zbadania przewidywanej struktury drugorzędowej, w której H oznacza alfa-helisę, S pasmo beta, a C pętlę. Należy również wziąć pod uwagę wskaźnik ufności przewidywania dla każdego aminokwasu. W celu oszacowania regionu rdzenia białka należy zidentyfikować obszary z długimi fragmentami regularnych struktur drugorzędowych.
Klasę strukturalną białka można również przeanalizować na podstawie rozkładu elementów struktury drugorzędowej. Należy sprawdzić przewidywaną dostępność dla rozpuszczalnika, aby zidentyfikować regiony ukryte i wystawione na działanie rozpuszczalnika. W zapytaniu wartości przewidywanej dostępności dla rozpuszczalnika wahają się od wyniku zero dla reszty ukrytej do wyniku dziewięć dla reszty wystawionej.
Regiony zawierające głównie reszty pogrzebane mogą służyć do wyznaczenia rdzenia białka, natomiast regiony z resztami hydrofilowymi, eksponowanymi na rozpuszczalnik, są potencjalnymi miejscami hydratacji lub centrami funkcjonalnymi. Aby wyświetlić przewidziane struktury trzeciorzędowe analizowanego białka, należy przewinąć stronę w dół do wyświetlonej po lewej stronie interaktywnej aplikacji JMO. Kliknij aplikację, aby zmienić wygląd wyświetlanej struktury.
Przybliż wybrany obszar, zaznacz konkretne typy reszt w przewidywanym modelu lub oblicz odległości między resztami. Przeanalizuj wyniki ufności modelowania strukturalnego, aby ocenić jakość przewidywanych struktur. Wartości Csco zazwyczaj mieszczą się w zakresie od minus pięciu do dwóch, przy czym wyższy wynik oznacza model lepszej jakości.
Szacowany wynik TM oraz RMSD pierwszego modelu są przedstawione jako szacowana dokładność modelu pierwszego. Kliknij łącze więcej informacji o csco. Aby przeanalizować rozmiar klastra i gęstość klastra csco dla wszystkich modeli, przeanalizuj 10 najlepszych szablonów threadingu białka zapytania, zidentyfikowanych przez programy threadingu low mets.
Przewijając stronę z wynikami w dół, należy sprawdzić znormalizowany wynik Z (Z-score), aby przeanalizować jakość dopasowań threadingowych. Dopasowania z znormalizowanym wynikiem csco większym niż jeden odzwierciedlają pewne dopasowanie i najprawdopodobniej posiadają taką samą strukturę trzeciorzędową jak białko zapytanie. Należy zbadać tożsamość sekwencji w regionie dopasowania threadingowego oraz dla całego łańcucha, aby ocenić homologię między białkiem zapytaniem a białkiem szablonem.
Wysoka tożsamość sekwencji wskazuje na pokrewieństwo ewolucyjne między białkiem zapytaniem a białkiem matrycą. Przeanalizuj kolorami zaznaczone reszty w wyrównaniu threadingowym, aby wizualnie zidentyfikować konserwatywne reszty lub motywy w białku zapytaniem i białku matrycy; wyższa tożsamość sekwencji w regionie wyrównania threadingowego w porównaniu z wyrównaniem całych łańcuchów wskazuje również na obecność konserwatywnych motywów lub domen strukturalnych w zapytaniu. Oceń zakres wyrównania threadingowego poprzez inspekcję wyrównania.
Jeśli pokrycie najlepszego dopasowania jest niskie i ograniczone do niewielkiego obszaru białka zapytania lub brakuje go dla długiego segmentu sekwencji zapytania, wskazuje to, że białko zapytania zawiera więcej niż jedną domenę. W takim przypadku zaleca się podzielenie sekwencji i modelowanie domen indywidualnie. Przejrzyj następującą tabelę na stronie wyników, aby określić 10 najlepszych analogów strukturalnych pierwszego przewidywanego modelu, zidentyfikowanych przez program dopasowania strukturalnego TM align.
Wartość TM score większa niż 0,5 wskazuje, że wykryty analog i model posiadają podobną topologię i mogą zostać wykorzystane do określenia klasy strukturalnej lub rodziny białek białka zapytania. Wartości TM score mniejsze niż 0,3 oznaczają przypadkowe podobieństwo strukturalne. Należy przeanalizować tożsamość sekwencji oraz RMSD w regionie wyrównania strukturalnego, aby ocenić konserwację motywów przestrzennych w modelu i analogu strukturalnym.
Przeprowadź inspekcję wizualną kolorowych i wyrównanych par reszt w dopasowaniu, aby zidentyfikować te strukturalnie zachowane reszty i motywy. Zapoznaj się z tabelą przewidywanych numerów EC, aby przejrzeć pięć potencjalnych grup ortologicznych (OG) enzymów dla białka zapytania. Poziom ufności przewidywania numeru EC z wykorzystaniem tych szablonów jest przedstawiony jako wynik EC (EC score) na podstawie analizy benchmarkowej.
Podobieństwo funkcjonalne między białkiem zapytaniem a białkiem szablonowym można wiarygodnie interpretować, stosując wynik EC większy niż 1,1. Następnie należy poszukać konsensusu funkcjonalnego pomiędzy szablonami, które posiadają podobną strukturę trzeciorzędową co białko zapytaniem. Jeśli wiele szablonów posiada ten sam numer EC, a wynik EC jest większy niż 1,1, poziom pewności predykcji jest bardzo wysoki.
Jeśli jednak wynik EC jest wysoki, ale brakuje konsensusu pomiędzy zidentyfikowanymi trafieniami, predykcja staje się mniej wiarygodna i użytkownikom zaleca się skorzystanie z ontologii genów. W widoku predykcji terminów należy przejrzeć tabelę przewidywanych terminów ontologii genów, aby zidentyfikować 10 głównych homologów białka zapytania w bibliotece PDB, opatrzonych terminami ontologii genów; każde białko jest zazwyczaj powiązane z wieloma terminami ontologii genów opisującymi jego funkcje molekularne, procesy biologiczne oraz lokalizację komórkową. Kliknij każdy termin, aby przejść do strony internetowej amigo i przeanalizować jego definicję oraz linię pokrewieństwa.
Przeanalizuj kolumnę wyniku homologii funkcjonalnej, aby ocenić podobieństwo funkcjonalne między białkiem zapytaniem a białkami szablonami. Można również oszacować poziom pewności przeniesienia adnotacji funkcjonalnych z tych białek. Przejrzyj tabelę konsensusu przewidywań terminów ontologii genów, aby przeanalizować zgodność funkcji między szablonami.
Te powszechnie stosowane funkcje służą do przewidywania terminów ontologii genów dla białka zapytania oraz do oceny poziomu ufności tych przewidywań. Na koniec należy przewinąć stronę na dół, aby wyświetlić 10 najlepszych przewidywań miejsc wiązania ligandów dla białka zapytania; przewidziane miejsca wiązania są szeregowane na podstawie liczby przewidzianych konformacji ligandów, które dzielą wspólną kieszeń wiążącą. Najlepiej zidentyfikowane miejsce wiązania jest już wyświetlone w aplikacji JMOL.
Kliknij przyciski opcji, aby przeanalizować inne przewidywania i zwizualizować reszty oddziałujące z ligandem. Wynik BS wskazuje lokalne podobieństwo między modelem a miejscem wiązania w szablonach. Wynik BS większy niż 1,1 świadczy o wysokim podobieństwie sekwencji i struktury w pobliżu przewidywanego miejsca wiązania.
W modelu, w porównaniu z znanym miejscem wiązania w szablonie, IT jest główną stroną internetową zawierającą linki do innych przydatnych funkcji. Funkcja forum umożliwia użytkownikowi utworzenie konta online i uzyskanie pomocy od innych użytkowników ITER w zakresie modelowania struktury lub interpretacji wyników. Funkcja pobierania pozwala użytkownikom na pobranie iter oraz powiązanych pakietów i zainstalowanie ich na komputerze.
Pomaga to skrócić czas wymagany do przeprowadzenia eksperymentów modelowania. Funkcja kolejki umożliwia podgląd statusu wszystkich przesłanych zadań na stronie IT a Q. Użytkownicy mogą również wizualnie sprawdzić obraz modelowanych struktur dla zakończonych zadań.
Na tej stronie przedstawiono również oczekiwany wynik TM w CSCO oraz oczekiwany RMSD pierwszego modelu; data przesłania znajduje się tutaj. Przedstawiono wycinek strony z wynikami IT AER, ukazujący sformatowaną sekwencję zapytania, przewidywaną strukturę drugorzędową, powiązane wyniki ufności oraz przewidywaną dostępność rozpuszczalnika poszczególnych reszt. Analizowany region rdzeniowy oraz potencjalne miejsce hydratacji w zapytaniu są wyróżnione odpowiednio w cyjanowych i czerwonych prostokątach. Tutaj pokazano przewidywania struktury trzeciorzędowej dla białek zapytania.
Przewidziane modele są wyświetlane w interaktywnym module aplikacji JML, co pozwala użytkownikowi na zmianę sposobu prezentacji cząsteczki. Modele można również pobrać, klikając w odpowiednie linki do pobierania; wynik pewności służący do oceny jakości modelu jest podawany jako csco. Przedstawiono przykład strony z wynikami itta A, pokazujący 10 najlepiej zidentyfikowanych szablonów threadingowych oraz dopasowań wygenerowanych przez programy do threadingu Loomis.
Jakość wyrównań metodą threadingu jest oceniana na podstawie znormalizowanego wyniku Z (Z-score), gdzie wartość większa od jeden świadczy o wiarygodnym wyrównaniu. Pozostałości w szablonie, które są identyczne z odpowiadającymi im pozostałościami w zapytaniu, zostały zaznaczone kolorem, aby wskazać obecność konserwatywnej pozostałości lub motywu. I odwrotnie, brak wyrównania w większości najlepszych szablonów wskazuje na obecność wielu domen w białku zapytania, a niewyrównane pozostałości odpowiadają regionom łączników domenowych.
W poniższej tabeli przedstawiono 10 najlepiej dopasowanych analogów strukturalnych oraz ich wyrównania strukturalne, zidentyfikowane przez program TM-align. Ranking analogów oparto na wyniku TM-score wyrównania strukturalnego. Wartość TM-score powyżej 0,5 wskazuje, że dwie porównywane struktury mają podobną topologię.
Wartość TM-score mniejsza niż 0,3 oznacza podobieństwo między dwiema losowymi strukturami. Strukturalnie wyrównane pary reszt są wyróżnione kolorami w zależności od właściwości aminokwasów, natomiast regiony niewyrównane są oznaczone kreską. Poniżej znajduje się przykład strony z wynikiem ITR, prezentujący zidentyfikowane homologi enzymatyczne białka zapytania w bibliotece PDB.
Poziom ufności przewidywania numeru EC analizuje się na podstawie wyniku EC, gdzie wynik EC większy niż 1,1 wskazuje na podobieństwo funkcjonalne między białkiem zapytania a białkiem szablonowym. Tabela przewidywania terminów ontologii genów dla białka zapytania zawiera homologów funkcjonalnych dla białka zapytania w bibliotece szablonów ontologii genów, uszeregowanych według ich wyniku homologii funkcjonalnej. Wspólne cechy funkcjonalne z tych najlepiej ocenianych trafień są wykorzystywane do wygenerowania końcowych przewidywań terminów ontologii genów dla białka zapytania.
Jakość przewidywanych terminów ontologii genów jest szacowana na podstawie wyniku geo, gdzie wynik geo większy od 0,5 wskazuje na wiarygodne przewidywanie, co przedstawiono tutaj na przykładzie strony z wynikiem IT AZA, ukazującej 10 najlepszych przewidywań miejsc wiązania ligandów białkowych z wykorzystaniem algorytmu kofaktora. Ranking przewidywanych miejsc wiązania opiera się na liczbie przewidywanych konformacji ligandów, które dzielą wspólną kieszeń wiążącą. W zapytaniu wynik BS jest miarą lokalnego podobieństwa sekwencji i struktury pomiędzy przewidywanym a szablonowym miejscem wiązania i jest użyteczny do analizy konserwacji kieszeni miejsc wiążących.
Chociaż ISER jest jednym z najefektywniejszych algorytmów do przewidywania struktury i funkcji białek, należy pamiętać, że jest to jedynie predykcja oparta na algorytmach komputerowych. Wszelkie dane eksperymentalne lub informacje o funkcjach, na przykład dane o wiązaniach kontaktów reszt, będą niezwykle pomocne w zwiększeniu dokładności przewidywań. Serwer IT AER posiada portal umożliwiający wprowadzenie tych informacji podczas procedury modelowania, aby sprostać rosnącemu zainteresowaniu tą funkcjonalnością.
Laboratorium Zanga udostępniło oprogramowanie IT AER bezpłatnie do niezależnych badań niekomercyjnych. Aktywnie pracujemy nad ulepszeniem IT AER oraz funkcji eye taster, mając nadzieję, że jego dostępność doprowadzi do szerokiego zastosowania poza laboratorium Zanga oraz przyniesie korzyści i zaktywizuje dalsze badania w społeczności naukowej.
Niniejszy artykuł opisuje potok I-TASSER służący do przewidywania struktur 3D oraz funkcji białek na podstawie ich sekwencji aminokwasowych. Proces ten obejmuje threading, składanie fragmentów oraz wnioskowanie funkcjonalne w oparciu o znane struktury białek.
Obliczeniowe przewidywanie struktury i funkcji białek umożliwia ograniczanie ryzyka związanego z wyborem celu w wczesnej fazie odkrywania leków, dostarczając informacji o mechanizmach działania białek nieopisanych eksperymentalnie. Program I-TASSER wspiera testowanie hipotez oraz adnotację funkcjonalną, zwiększając pewność predykcji w procesach wyboru celu i identyfikacji związków wiodących. Podejście to zmniejsza zależność od niskoprzepustowych metod eksperymentalnych i przyspiesza walidację celów w badaniach i rozwoju sektora biofarmaceutycznego.
Metoda I-TASSER integruje się z procesem odkrywania leków, od identyfikacji celu po optymalizację związku wiodącego, dostarczając informacji strukturalnych i funkcjonalnych, które wspierają podejmowanie decyzji na każdym z tych etapów.