Przegląd metody
Zgodnie z paradygmatem sekwencja-struktura-funkcja, procedura I-TASSER1-4 służąca do modelowania struktury i funkcji obejmuje cztery następujące po sobie kroki: (a) identyfikację szablonu za pomocą LOMETS5; (b) ponowne składanie struktury fragmentów poprzez symulacje Monte Carlo z wymianą replik6; (c) udoskonalenie struktury na poziomie atomowym przy użyciu REMO7 oraz FG-MD8; oraz (d) interpretację funkcji na podstawie struktury z wykorzystaniem COFACTOR9.
Identyfikacja matrycyW przypadku sekwencji zapytania przesłanej przez użytkownika, jest ona najpierw przepuszczana przez reprezentatywną bibliotekę struktur PDB za pomocą lokalnie zainstalowanego serwera meta-threadingu LOMETS. Threading jest procedurą dopasowania sekwencji do struktury, służącą do identyfikacji białek matrycowych, które mogą posiadać podobną strukturę lub zawierać podobny motyw strukturalny co białko zapytania. Aby zwiększyć zakres wykrywania homologicznych matryc, LOMETS łączy wiele nowoczesnych algorytmów obejmujących różne metodologie threadingu. Ponieważ różne programy do threadingu posiadają odmienne systemy punktacji i różną czułość dopasowania, jakość wygenerowanych dopasowań z każdego programu jest oceniana za pomocą znormalizowanych wynik Z (Z-score), co definiuje się jako:

gdzie wskaźnik Z wynik wyrażony w jednostkach odchylenia standardowego względem średniej statystycznej wszystkich dopasowań wygenerowanych przez program; a Z0 jest specyficzny dla programu wynik standaryzowany (Z-score) wartość odcięcia określona na podstawie wielkoskalowych testów benchmarkowych dla metody threadingu5 w celu odróżnienia szablonów „dobrych” od „złych”. Szablon o wysokim wyniku Z-score oznacza, że najlepsze szablony posiadają wynik dopasowania znacząco wyższy niż większość pozostałych szablonów, co zazwyczaj sugeruje, że dopasowanie odpowiada dobremu modelowi. Jeśli większość najlepszych szablonów threadingu wykazuje wysokie znormalizowane Kody Z (Z-scores)dokładność końcowego modelu I-TASSER jest zazwyczaj wysoka. Jednakże, w przypadku dużych białek, gdy pokrycie dopasowań threadingowych ogranicza się do niewielkiego regionu białka zapytania, wysoka znormalizowana wartość Z-score nie musi oznaczać wysokiej dokładności modelowania dla modelu pełnowymiarowego. Dwa najlepsze dopasowania threadingowe z każdego programu threadingowego są gromadzone i wykorzystywane w kolejnym kroku składania struktury.
Iteracyjna symulacja składania struktury: Po przeprowadzeniu procedury niciowania sekwencja zapytania zostaje podzielona na regiony wyrównane i niewyrównane w procesie niciowania. Ciągłe fragmenty z wyrównania niciowania są wycinane z matryc i wykorzystywane bezpośrednio do składania struktury, natomiast niewyrównane regiony pętli są budowane za pomocą modelowania ab initio. Procedura składania struktury jest przeprowadzana w układzie sieciowym z wykorzystaniem symulacji Monte Carlo z wymianą replik6. Pole siłowe I-TASSER obejmuje oddziaływania wiązań wodorowych10, oparte na wiedzy statystyczne człony energii wyprowadzone ze znanych struktur białek w PDB1, przewidywania kontaktów na podstawie sekwencji z SVMSEQ12 oraz ograniczenia przestrzenne zebrane z matryc niciowania LOMETS5. Przynęty konformacyjne generowane w replikach o niskiej temperaturze podczas symulacji są grupowane przez SPICKER13 w celu zidentyfikowania struktur o stanach niskiej energii swobodnej>. Centroidy klastrów z najlepszych grup są uzyskiwane poprzez uśrednianie współrzędnych 3D wszystkich zgrupowanych przynęt strukturalnych i wykorzystywane do generowania końcowego modelu. Procedura symulacji i klastrowania jest powtarzana dwukrotnie w celu usunięcia kolizji sterycznych i dalszego doprecyzowania topologii globalnej.
Budowa i rafinacja modelu na poziomie atomowym: Centroidy klastrów uzyskane po klastrowaniu SPICKER są zredukowanymi modelami białek (każdy resztą reprezentowaną przez Cα oraz środek masy łańcucha bocznego) i mają ograniczone zastosowanie biologiczne. Budowa modelu pełnoatomowego z modeli zredukowanych odbywa się w dwóch etapach. W pierwszym kroku program REMO7 jest wykorzystywany do budowy modeli pełnoatomowych ze śladów C-alfa poprzez optymalizację sieci wiązań wodorowych. W drugim kroku modele pełnoatomowe z REMO są dalej rafinowane przez FG-MD14, który poprawia kąty torsyjne szkieletu, długości wiązań i orientacje rotamerów łańcuchów bocznych za pomocą symulacji dynamiki molekularnej, kierowanych przez fragmenty strukturalne wyszukane w strukturach PDB za pomocą TM-align. Modele rafinowane przez FG-MD służą jako końcowe modele do przewidywania struktury trzeciorzędowej za pomocą I-TASSER.
Jakość wygenerowanych modeli szacowana jest na podstawie wyniku ufności (C-score), który jest definiowany w oparciu o wynik Z (Z-score) dopasowań nici LOMETS oraz zbieżność symulacji I-TASSER, sformułowany matematycznie jako:

gdzie M liczba pozornych struktur (decoys) w klastrach strukturalnych zidentyfikowanych przez program SPICKER13; Mtot jest całkowitą liczbą przynęt (decoys) poddanych klastrowaniu; jest średnim RMSD zgrupowanych pozornych ligandów (decoys) względem centroidów grup; Norm.Z-Score(i) czy znormalizowany wynik Z (równanie 1) dla najlepszego dopasowania wątkowego (threading alignment) uzyskano z iserwer wątkowania w LOMETS5; N jest liczbą serwerów wykorzystanych w systemie LOMETS.
C-score wykazuje silną korelację z jakością modeli I-TASSER. Poprzez połączenie C-score i długości białka można oszacować dokładność pierwszych modeli I-TASSER ze średnim błędem 0,08 dla TM-score i 2 Å dla RMSD15. Generalnie przyjmuje się, że modele z C-score > - 1,5 powinny posiadać poprawną strukturę trzeciorzędową (fold). RMSD i TM-score są powszechnie znanymi miarami podobieństwa topologicznego między modelem a strukturą natywną. Wartości TM-score mieszczą się w zakresie [0, 1], gdzie wyższy wynik wskazuje na lepsze dopasowanie struktury16,17. Jednak w przypadku modeli o niższym rankingu (tj. modeli od 2nd do 5th), korelacja C-score z TM-score i RMSD jest znacznie słabsza (~ 0,5) i nie może być wykorzystana do wiarygodnej oceny absolutnej jakości modelu.
Czy pierwszy model w symulacjach I-TASSER jest zawsze najlepszym modelem? Odpowiedź na to pytanie zależy od typu celu. W przypadku celów łatwych pierwszy model zazwyczaj jest najlepszy, a jego C-score jest zazwyczaj znacznie wyższy niż w pozostałych modelach. Jednak w przypadku celów trudnych, gdzie threading nie daje istotnych trafień szablonu, pierwszy model niekoniecznie musi być najlepszy, a I-TASSER ma w rzeczywistości trudności z wyborem najlepszego szablonu i modeli. Dlatego w przypadku trudnych celów zaleca się analizę wszystkich 5 modeli i ich wybór w oparciu o informacje eksperymentalne oraz wiedzę biologiczną.
Przewidywanie funkcji: W ostatnim kroku końcowe modele 3D wygenerowane za pomocą FG-MD są wykorzystywane do przewidywania trzech aspektów funkcji białka, mianowicie: (a) numerów Enzyme Commission (EC)18, (b) terminów Gene Ontology (GO)19 oraz (c) miejsc wiązania dla małych cząsteczek ligandów. Dla wszystkich trzech aspektów interpretacje funkcjonalne są generowane przy użyciu COFACTOR, który jest nowym podejściem do przewidywania funkcji białka w oparciu o globalne i lokalne podobieństwo do białek szablonowych w PDB o znanej strukturze i funkcjach. Najpierw globalna topologia przewidzianych modeli jest dopasowywana do funkcjonalnych bibliotek szablonów za pomocą programu do dopasowania strukturalnego TM-align20. Następnie z biblioteki wybierany jest zestaw białek najbardziej podobnych do modeli docelowych na podstawie ich globalnego podobieństwa strukturalnego, a następnie przeprowadzane jest szerokie przeszukiwanie lokalne w celu zidentyfikowania podobieństwa strukturalnego i sekwencyjnego w pobliżu regionu miejsca aktywnego/wiążącego. Wynikowe wartości podobieństwa globalnego i lokalnego służą do uszeregowania białek szablonowych (homologów funkcjonalnych) i przeniesienia adnotacji (numerów EC i terminów Gene Ontology19) na podstawie najlepiej dopasowanych wyników. Podobnie, reszty aminokwasowe miejsca wiązania ligandu oraz tryb wiązania ligandu są wnioskowane na podstawie lokalnego dopasowania zapytania do znanych reszt miejsca wiązania ligandu w najlepiej ocenianych szablonach funkcjonalnych9.
Jakość przewidywania funkcji (terminów EC i GO) w programie I-TASSER jest oceniana na podstawie wyniku homologii funkcjonalnej (Fh-score), który jest miarą globalnego i lokalnego podobieństwa między zapytaniem a wzorcem i jest definiowany jako:

gdzie C-score jest szacunkiem jakości przewidywanego modelu, zdefiniowanym w równaniu (2); TM-score mierzy globalne podobieństwo strukturalne między białkiem modelowym a matrycą; RMSDali RMSD pomiędzy strukturą modelu a strukturą szablonu w obszarze wyrównanym strukturalnie z programu TM-align20; Cov oznacza pokrycie dopasowania strukturalnego (tj. stosunek liczby strukturalnie dopasowanych reszt do długości zapytania); IDali jest tożsamość sekwencji w dopasowaniu TM-align. Szacowany wynik pewności dla przewidywań numerów EC obejmuje również człon służący do oceny dopasowania miejsca aktywnego (AcM) pomiędzy zapytaniem a szablonem w określonym regionie lokalnym, obliczany jako:

gdzie NProszę podać tekst do przetłumaczenia. oznacza liczbę reszt matrycowych znajdujących się w obszarze lokalnym, Nali jest liczbą dopasowanych par reszt zapytania i szablonu, dii czy jest Cα odległość między ipara wyrównanych reszt, d0 = 3,0 Å jest wartością graniczną odległości, Mii stanowi sumę wartości BLOSUM dla i-tej pary dopasowanych reszt. Generalnie wynik Fh mieści się w przedziale [0, 5], a wynik AcM w przedziale [0, 2], przy czym wyższe wartości wskazują na większą pewność przypisań funkcjonalnych. Wynik AcM jest również wykorzystywany do oceny lokalnego podobieństwa struktury i sekwencji w pobliżu miejsc wiązania ligandów, co określa się mianem wyniku BS.
1. Przesłanie sekwencji białka
- Odwiedź stronę internetową I-TASSER pod adresem http://zhanglab.ccmb.med.umich.edu/I-TASSER, aby rozpocząć eksperyment modelowania struktury i funkcji.
- Skopiuj i wklej sekwencję aminokwasową do odpowiedniego formularza lub prześlij ją bezpośrednio z komputera, klikając przycisk „Browse”. Serwer I-TASSER obecnie akceptuje sekwencje o długości do 1500 reszt. Białka dłuższe niż 1500 reszt są zazwyczaj białkami wielodomenowymi i zaleca się ich podział na poszczególne domeny przed przesłaniem do I-TASSER.
- Podaj swój adres e-mail (wymagane) oraz nazwę zadania (opcjonalnie).
- Użytkownicy mogą opcjonalnie określić zewnętrzne ograniczenia kontaktów/odległości między resztami, dodać dodatkowy szablon lub wykluczyć niektóre białka szablonowe podczas procesu modelowania struktury. Więcej informacji na temat korzystania z tych opcji znajduje się w sekcji „Dyskusja”.
- Aby przesłać sekwencję, kliknij przycisk „Run I-TASSER”. Przeglądarka zostanie przekierowana na stronę potwierdzenia wyświetlającą podane przez użytkownika informacje, numer identyfikacyjny zadania (Job ID) oraz link do strony internetowej, na której wyniki zostaną zamieszczone po zakończeniu zadania. Użytkownicy mogą dodać ten link do zakładek lub zapisać numer identyfikacyjny zadania do późniejszego wykorzystania.
2. Dostępność wyników
- Sprawdź status przesłanego zadania, odwiedzając stronę kolejki I-TASSER pod adresem http://zhanglab.ccmb.med.umich.edu/I-TASSER/queue.php. Kliknij zakładkę wyszukiwania i użyj numeru Job ID lub sekwencji zapytania, aby odnaleźć przesłane zadanie.
- Po zakończeniu modelowania struktury i funkcji otrzymasz powiadomienie e-mail zawierające obrazy przewidzianych struktur oraz link internetowy. Kliknij ten link lub otwórz link zapisany w kroku 1.5, aby przejrzeć i pobrać wyniki.
3. Przewidywanie struktury drugorzędowej i dostępności rozpuszczalnika
- Sprawdź sekwencję zapytania w formacie FASTA wyświetloną na górze strony z wynikami. Jeśli podczas przesyłania sekwencji określono dodatkowe ograniczenia lub szablon, widoczny będzie również link do strony internetowej z informacjami określonymi przez użytkownika (Rysunek 1A).
- Przeanalizuj przewidywaną strukturę drugorzędową wyświetlaną jako: helisa alfa (H), pasmo beta (S) lub pętla/zwój (C) oraz wynik pewności przewidywania (0 = niska, 9 = wysoka) dla każdego resztu. Poszukaj obszarów z długimi odcinkami regularnych struktur drugorzędowych (H lub S), aby oszacować region rdzenia białka. Na podstawie rozkładu elementów struktur drugorzędowych można również przeanalizować klasę strukturalną białka. Ponadto długie regiony elementów typu coil zazwyczaj wskazują na obszary nieustrukturyzowane lub nieuporządkowane.
- Przejrzyj przewidywaną dostępność rozpuszczalnika (Rysunek 1C), aby ustalić regiony ukryte i wystawione na działanie rozpuszczalnika w zapytaniu. Wartości przewidywanej dostępności rozpuszczalnika wahają się od 0 (resztu ukrytej) do 9 (resztu wystawionej). Region zawierający głównie reszty ukryte może służyć do wyznaczenia regionu rdzenia białka, natomiast regiony z resztami hydrofilowymi, wystawionymi na działanie rozpuszczalnika, są potencjalnymi miejscami hydratacji lub centrami funkcjonalnymi.
4. Przewidywanie struktury trzeciorzędowej
- Przewiń w dół, aby wyświetlić przewidywane struktury trzeciorzędowe białka zapytania, przedstawione w interaktywnej aplikacji Jmol (Rycina 2). Kliknij lewym przyciskiem myszy w aplikacji, aby zmienić wygląd wyświetlanej struktury, powiększyć wybrany obszar, zaznaczyć konkretne typy reszt w przewidzianym modelu lub obliczyć odległości między resztami.
- Przeanalizuj modele pod kątem obecności długich regionów nieustrukturyzowanych. Regiony te zazwyczaj odpowiadają obszarom nieuporządkowanym w białku lub wskazują na brak dopasowania matrycy. Regiony te zazwyczaj charakteryzują się niską dokładnością modelowania, a usunięcie ich z obszarów końców N i C poprawi dokładność modelowania.
- Pobierz pliki struktury modelu w formacie PDB, klikając łącza „Download Model”. Pliki te można otworzyć w dowolnym oprogramowaniu do wizualizacji molekularnej (np. Pymol, Rasmol itd.) w celu dalszej analizy cech strukturalnych.
- Przeanalizuj wynik ufności (C-score) modelowania struktury, aby ocenić jakość przewidzianych struktur. Wartości C-score (Równ. 2) zazwyczaj mieszczą się w zakresie [-5, 2], przy czym wyższy wynik odzwierciedla model lepszej jakości. Szacowany TM-score i RMSD pierwszego modelu są wyświetlone jako „Estimated accuracy of Model 1”. W przypadku długich białek zaleca się ocenę jakości modelu na podstawie TM-score, ponieważ TM-score jest bardziej czuły na zmiany topologiczne niż RMSD.
- Kliknij łącze „more about C-score”, aby przeanalizować C-score, rozmiar klastra i gęstość klastra dla wszystkich modeli. Szacowany TM-score i RMSD są przedstawione tylko dla pierwszego modelu I-TASSER, ponieważ C-score modeli o niższej randze nie jest silnie skorelowany z TM-score lub RMSD. Jakość modeli o niższej randze można częściowo ocenić na podstawie ich gęstości klastra i rozmiaru klastra w stosunku do pierwszego modelu, przy czym modele z większego klastra i o wyższej gęstości są średnio bliższe strukturze natywnej.
- Niskie wartości przewidywań C-score zazwyczaj wskazują na niską dokładność przewidywania. W większości takich przypadków białko zapytania nie posiada odpowiedniej matrycy w bibliotece i ma rozmiar wykraczający poza zakres modelowania ab initio (tj. >120 reszt). W takich przypadkach użytkownicy mogą poszukać dodatkowych więzów przestrzennych i wykorzystać je do ulepszenia modelowania I-TASSER (patrz sekcja Discussion). Zachęcamy również do przesyłania sekwencji do naszego serwera QUARK (http://zhanglab.ccmb.med.umich.edu/QUARK/) w celu czystego modelowania ab initio, jeśli rozmiar białka wynosi poniżej 20 reszt.
5. Dopasowanie matrycy docelowej LOMETS
- Przewiń w dół, aby przeanalizować dziesięć najlepszych szablonów threadingu dla białka zapytania, zidentyfikowanych przez programy threadingowe LOMETS (Rysunek 3). Sprawdź znormalizowany wynik Z (Eq. 1), widoczny w kolumnie „Norm. Z-score”, aby przeanalizować jakość dopasowań threadingowych. Dopasowania znormalizowanym wynikiem Z > 1 wskazują na wiarygodne dopasowanie i najprawdopodobniej mają taką samą strukturę drugorzędową (fold) jak białko zapytania.
- Przeanalizuj tożsamość sekwencji w regionie dopasowanym metodą threadingu (kolumna „Iden. 1”) oraz dla całego łańcucha (kolumna „Iden. 2”), aby ocenić homologię między białkiem zapytania a białkami szablonowymi. Wysoka tożsamość sekwencji jest wskaźnikiem pokrewieństwa ewolucyjnego między białkiem zapytania a białkami szablonowymi.
- Przejrzyj zaznaczone kolorami reszty dopasowane w procesie threadingu, aby wizualnie zidentyfikować konserwatywne reszty/motywy w białku zapytania i białkach szablonowych. Wyższa tożsamość sekwencji w regionie dopasowanym threadingiem w porównaniu do dopasowania całego łańcucha wskazuje również na obecność konserwatywnych motywów strukturalnych/domen w białku zapytania.
- Oceń pokrycie dopasowania threadingowego, sprawdzając kolumnę „Cov.” oraz analizując samo dopasowanie. Jeśli pokrycie najlepszych dopasowań jest niskie i ogranicza się tylko do niewielkiego regionu białka zapytania lub brakuje go dla długiego fragmentu sekwencji zapytania, zazwyczaj oznacza to, że białko zapytania zawiera więcej niż jedną domenę i zaleca się podzielenie sekwencji oraz modelowanie domen indywidualnie (Rysunek 3).
- Pobierz pliki dopasowania sekwencji do struktury w formacie PDB, klikając w linki „Download Align”. Pliki dopasowania te można otworzyć w dowolnym programie do wizualizacji molekularnej wymienionym w sekcji Materiały, a także wykorzystać do dodania dodatkowych więzów podczas modelowania struktury (Krok 1.4).
6. Analogi strukturalne w PDB
- Przejrzyj kolejną tabelę (Rysunek 4) na stronie wyników, aby określić dziesięć głównych analogów strukturalnych pierwszego przewidywanego modelu, zidentyfikowanych przez program do wyrównania strukturalnego TM-align20. Wartość TM-score >0,5 wskazuje, że wykryty analog i model mają podobną topologię i mogą zostać wykorzystane do określenia klasy strukturalnej/rodziny białek białka zapytania16, natomiast TM-score <0,3 oznacza przypadkowe podobieństwo strukturalne.
- Przeanalizuj identyczność sekwencji oraz RMSD w strukturalnie wyrównanym obszarze przedstawionym w kolumnach „IDENa” i „RMSDa”, aby ocenić konserwację motywów przestrzennych w modelu i analogu strukturalnym. Dokonaj wizualnej inspekcji kolorowych i wyrównanych par reszt w wyrównaniu, aby zidentyfikować te strukturalnie konserwatywne reszty i motywy.
- Kliknij kod PDB wyświetlany w kolumnie „PDB Hit”, aby przejść do strony internetowej RCSB i dowiedzieć się więcej o ich klasyfikacji strukturalnej (SCOP, CATH i PFAM) oraz informacjach funkcjonalnych (numer EC, powiązane terminy GO i związane ligandy).
7. Przewidywanie funkcji przy użyciu COFACTOR
- Przewiń stronę z wynikami w dół, aby przeanalizować interpretacje funkcjonalne dla białka zapytania. Funkcje białek są wyliczone w trzech tabelach kontekstowych, wyświetlających: numery Enzyme Commission (EC), terminy Gene Ontology (GO) oraz miejsca wiązania ligandów.
- Przeanalizuj kolumny „TM-score”, „RMSDa”, „IDENa” oraz „Cov.” w każdej tabeli, aby ocenić parametry globalnego podobieństwa strukturalnego i konserwację wzorców przestrzennych pomiędzy modelem a zidentyfikowanymi homologami funkcjonalnymi (szablonami).
8. Przewidywanie numeru Komisji Enzymologicznej
- Przejrzyj pięć potencjalnych homologów enzymatycznych białka zapytania przedstawionych w tabeli „Predicted EC numbers” (Rysunek 5). Poziom pewności przewidywania numeru EC z wykorzystaniem tych szablonów znajduje się w kolumnie „EC-Score”. Na podstawie analizy benchmarkowej23, podobieństwo funkcjonalne (pierwsze 3 cyfry numeru EC) między białkiem zapytania a białkiem szablonowym można wiarygodnie interpretować przy EC-score >1,1.
- Poszukaj konsensusu funkcji (numery EC) wśród szablonów, które posiadają podobne sfałdowanie (tzn. TM-score >0,5) co białko zapytania. Jeśli wiele szablonów posiada ten sam numer EC oraz EC-score > 1,1, poziom pewności przewidywania jest bardzo wysoki. Jednakże, jeśli EC-Score jest wysoki, ale brakuje konsensusu wśród zidentyfikowanych trafień, przewidywanie staje się mniej wiarygodne i zaleca się skorzystanie z przewidywań terminów GO.
- Kliknij w link przy numerach EC, aby przejść do bazy danych ExPASy Enzyme i szczegółowo przeanalizować funkcję białka szablonowego, w tym katalizowaną reakcję, wymagania dotyczące kofaktorów oraz szlak metaboliczny.
9. Przewidywanie terminów Gene Ontology (GO)
- Przejrzyj tabelę „Predicted GO terms” (Rysunek 6), aby zidentyfikować dziesięć głównych homologów białka zapytania w bibliotece PDB, opatrzonych terminami Gene Ontology (GO). Każde białko jest zazwyczaj powiązane z wieloma terminami GO, opisującymi jego funkcje molekularne (MF), procesy biologiczne (BP) i składniki komórkowe (CC). Kliknij każdy termin, aby przejść do strony internetowej Amigo i przeanalizować jego definicję oraz hierarchię.
- Przeanalizuj kolumnę Fh-score (wskaźnik homologii funkcjonalnej), aby ocenić podobieństwo funkcjonalne między białkiem zapytania a białkami matrycowymi oraz oszacować poziom pewności przeniesienia adnotacji funkcjonalnych z tych białek. W naszym badaniu porównawczym23, 50% natywnych terminów GO można było prawidłowo zidentyfikować na podstawie pierwszej zidentyfikowanej matrycy, stosując wartość graniczną Fh-score wynoszącą 0,8, przy ogólnej dokładności na poziomie 56%.
- Przejrzyj tabelę „Consensus prediction of GO terms”, aby przeanalizować zgodność funkcji między matrycami. Wspólne funkcje te są wykorzystywane do przewidywania terminów GO (MF, BP i CC) białka zapytania oraz oceny poziomu pewności (GO-score) przewidywań tych terminów. Na podstawie testu porównawczego23, najlepsze wskaźniki wyników fałszywie dodatnich i fałszywie ujemnych uzyskano dla przewidywań z wartością graniczną GO-score=0,5, przy jednoczesnym spadku zakresu przewidywań na głębszych poziomach ontologii.
10. Przewidywanie miejsc wiązania białko-ligand
- Przewiń stronę na dół, aby wyświetlić dziesięć najlepszych przewidywań miejsc wiązania ligandów dla białka zapytania. Przewidywane miejsca wiązania są uporządkowane według liczby przewidzianych konformacji ligandów, które dzielą wspólną kieszeń wiążącą. Najlepiej zidentyfikowane miejsce wiązania jest już wyświetlone w aplikacji Jmol. Kliknij przyciski opcji, aby przeanalizować pozostałe przewidywania i zwizualizować reszty oddziałujące z ligandem.
- Przeanalizuj kolumnę BS-score, aby ocenić lokalne podobieństwo między miejscem wiązania w modelu a miejscem wiązania w szablonie. Na podstawie punktu odniesienia9, BS-score > 1,1 wskazuje na wysokie podobieństwo sekwencji i struktury w pobliżu przewidywanego miejsca wiązania w modelu oraz znanego miejsca wiązania w szablonie.
- Pobierz plik struktury kompleksu w formacie PDB, klikając łącze „Download”. Użytkownicy mogą otwierać te pliki w dowolnym programie do wizualizacji molekularnej i interaktywnie przeglądać przewidywane miejsce wiązania oraz oddziaływania ligand-białko na swoim komputerze.
1. Reprezentatywne wyniki

Rysunek 1. Fragment strony z wynikami programu I-TASSER przedstawiający (A) sekwencję zapytania w formacie FASTA; (B) przewidywaną strukturę drugorzędową oraz powiązane z nią wskaźniki ufności; oraz (C) przewidywaną dostępność rozpuszczalnika dla poszczególnych reszt. Analizowany region rdzeniowy oraz potencjalne miejsce hydratacji w zapytaniu zostały zaznaczone odpowiednio cyjanowymi i czerwonymi prostokątami.

Rycina 2. Przykład strony z wynikami I-TASSER przedstawiający przewidywania struktury trzeciorzędowej białek zapytania. Przewidziane modele są wyświetlane w interaktywnej aplikacji Jmol, która umożliwia użytkownikowi zmianę sposobu prezentacji cząsteczki. Modele można również pobrać, klikając łącza „Download”. Wskaźnik ufności służący do oceny jakości modelu jest raportowany jako C-score.

Rysunek 3. Przykład strony z wynikami I-TASSER, przedstawiający dziesięć najlepiej zidentyfikowanych szablonów threadingu oraz dopasowania wykonane przez LOMETS5 programy threadingu. Jakość dopasowań threadingowych ocenia się na podstawie znormalizowanego wyniku Z (wyróżnionego na zielono), gdzie wartość >Wartość 1 odzwierciedla pewne dopasowanie. Dopasowane reszty w szablonie, które są identyczne z odpowiadającymi im resztami w zapytaniu, zostały wyróżnione kolorami, aby wskazać obecność konserwatywnej reszty/motywu, natomiast brak dopasowania w większości głównych szablonów wskazuje na obecność wielu domen w białku zapytania, a niedopasowane reszty odpowiadają regionom łączników domenowych. Kliknij tutaj, aby wyświetlić pełną wersję rysunku 3.

Rycina 4. Przykład strony z wynikami przedstawiającej dziesięć najlepiej dopasowanych analogów strukturalnych oraz dopasowania strukturalne, zidentyfikowane za pomocą programu TM-align20 program do wyrównywania struktur. Ranking analogów przedstawiony na rycinie opiera się na wartości TM-score (wyróżnionej na niebiesko) uzyskanej z wyrównania strukturalnego. TM-score >0,5 wskazuje, że dwie porównywane struktury mają podobną topologię, podczas gdy TM-score <0,3 oznacza podobieństwo między dwiema losowymi strukturami. Strukturalnie wyrównane pary reszt są wyróżnione kolorami w zależności od właściwości aminokwasów, natomiast regiony niewyrównane są oznaczone znakiem „-”. Kliknij tutaj, aby wyświetlić pełnowymiarową wersję rysunku 4.

Rysunek 5. Przykład strony z wynikami I-TASSER przedstawiający zidentyfikowane homologi enzymatyczne białka zapytania w bibliotece PDB. Poziom ufności predykcji numeru EC jest analizowany na podstawie wyniku EC-score (wyróżnionego na zielono), gdzie EC-score > 1,1 wskazuje na podobieństwo funkcjonalne (te same pierwsze 3 cyfry numeru EC) pomiędzy białkiem zapytaniem a białkiem matrycą.

Rycina 6. Przykład strony z wynikami I-TASSER przedstawiający przewidywania terminów GO dla białka zapytania. Homologi funkcjonalne dla białka zapytania w bibliotece szablonów Gene Ontology są rankingowane na podstawie ich wartości Fh-score (w pomarańczowym prostokącie). Wspólne cechy funkcjonalne pochodzące z tych najlepiej punktowanych trafień są wykorzystywane do wygenerowania końcowych przewidywań terminów GO dla białka zapytania. Jakość przewidzianych terminów GO jest szacowana na podstawie wartości GO-score (wyświetlanej na zielono), gdzie GO-score >Wartość 0,5 wskazuje na wiarygodną prognozę. Kliknij tutaj, aby wyświetlić pełnowymiarową wersję rysunku 6.

Rycina 7. Przykład strony z wynikami I-TASSER, przedstawiający dziesięć najlepszych przewidywań miejsc wiązania liganda w białku z wykorzystaniem programu COFACTOR9 algorytm. Ranking przewidywanych miejsc wiązania opiera się na liczbie przewidywanych konformacji ligandów, które dzielą wspólną kieszeń wiążącą w zapytaniu. Wynik BS (BS-score, wyróżniony na czerwono) jest miarą lokalnego podobieństwa sekwencji i struktury między przewidywanym a szablonowym miejscem wiązania i jest przydatny do analizy konserwacji kieszeni miejsc wiązania.

Rycina 8. Przykład zewnętrznych plików więzów wykorzystywanych do określania więzów kontaktu/odległości między resztami.

Rysunek 9. Przykład plików więzów używanych do określenia białka szablonowego dla serwera I-TASSER. Użytkownik może określić dopasowanie zapytania do szablonu albo w (A) formacie FASTA, albo w (B) formacie 3D.

Rycina 10. Przykładowy plik używany do wykluczania szablonów podczas procedury modelowania struktury w programie I-TASSER. Pierwsza kolumna zawiera identyfikatory PDB białek szablonowych, które mają zostać wykluczone. Druga kolumna służy do określenia progu identyczności sekwencji, który zostanie zastosowany do innych podobnych szablonów w bibliotece szablonów.