Przedstawiono protokół do badania online relacji sekwencja-struktura-dynamika białek za pomocą Bio3D-web.
Artykuł metodologiczny
* These authors contributed equally
Przedstawiono protokół do badania online relacji sekwencja-struktura-dynamika białek za pomocą Bio3D-web.
Demonstrujemy użycie Bio3D-web do interaktywnej analizy danych o strukturze biomolekularnej. Aplikacja internetowa Bio3D-web zapewnia funkcjonalność online dla: (1) Identyfikacja powiązanej struktury białka ustawia się na określone przez użytkownika progi podobieństwa; (2) Ich wielokrotne wyrównanie i superpozycja struktury; (3) Analiza zachowania sekwencji i struktury; (4) Mapowanie relacji między konformerami z analizą głównych składowych oraz (5) porównanie przewidywanej dynamiki wewnętrznej za pomocą zespołowej analizy w trybie normalnym. Ta zintegrowana funkcja zapewnia kompletny przepływ pracy online do badania zależności sekwencja-struktura-dynamika w rodzinach białek i nadrodzinach.
Bank danych o białkach (PDB) zawiera teraz ponad 120 000 struktur białkowych - wiele z nich należy do tej samej rodziny białek, ale zostały rozwiązane w różnych warunkach eksperymentalnych. Te wielorakie struktury stanowią nieocenione źródło informacji o zawiłościach formy i funkcji białek. Na przykład, rygorystyczne porównanie tych zespołów strukturalnych może ujawnić ważne mechanizmy molekularne 1,2,3 i informować o dynamice konformacyjnej związanej z procesami, w tym wiązaniem ligandów, katalizą enzymatyczną i rozpoznawaniem dwucząsteczkowym 4,5,6,7. Nowe informacje można często uzyskać dzięki szczegółowej analizie na dużą skalę sekwencji, struktury i dynamiki rodzin białek. Wymaga to jednak zazwyczaj znacznej wiedzy z zakresu bioinformatyki i programowania komputerowego oraz znajomości badanych układów białkowych. Na przykład pakiety oprogramowania, takie jak Bio3D, ProDy i Maven, wymagają programowania odpowiednio w R, Pythonie i Matlabie 8,9,10. Z drugiej strony, narzędzia online do analizy elastyczności strukturalnej są na ogół ograniczone do badania poszczególnych struktur 11,12. Wyjątkiem pod tym względem jest niedawno opracowany serwer WebNM@, który pozwala na porównanie wzorców elastyczności uzyskanych z analizy w trybie normalnym (NMA) kilku wstępnie wyrównanych struktur określonych przez użytkownika13. Serwer ten nie posiada jednak zautomatyzowanej procedury identyfikacji struktur do porównania, ich wyrównania lub dalszej analizy poza NMA. Innym najnowszym wkładem jest internetowa baza danych PDBFlex, która przedstawia wstępnie obliczoną analizę struktur PDB o łącznej tożsamości sekwencji 95% lub wyższej14. Jednak analiza bardziej zróżnicowanych zestawów konstrukcji nie jest obecnie dostępna.
Wcześniej prezentowaliśmy Bio3D-web - łatwą w użyciu aplikację internetową do analizy zależności sekwencja-struktura białka-dynamika15. Wyjątkowość Bio3D-web polega na dostarczaniu łatwej w użyciu, zintegrowanej funkcjonalności do identyfikacji, porównywania i szczegółowej analizy dużych zestawów struktur homologicznych online. W tym miejscu przedstawiamy szczegółowy protokół badania online relacji sekwencja-struktura-dynamika białek za pomocą Bio3D-web. Bio3D-web zapewnia różnorodne funkcje wspierające pięć głównych etapów analizy danych pokazanych na rysunku 1 i szczegółowo omówionych poniżej. Te kroki składają się na przepływ pracy, który rozciąga się od sekwencji zapytań lub danych wejściowych struktury, przez wiele poziomów analizy sekwencyjno-strukturalnej, aż po generowanie raportu podsumowującego. Wyniki są dostępne natychmiast za pośrednictwem rozbudowanych urządzeń do wizualizacji i wykresów w przeglądarce, a także poprzez pobieranie plików wyników w powszechnie używanych formatach. Oprócz wygodnego, łatwego w użyciu dynamicznego interfejsu do badania wpływu wyboru parametrów i metod, Bio3D-web rejestruje również pełne dane wejściowe użytkownika i późniejsze wyniki graficzne sesji użytkownika w postaci możliwego do udostępnienia powtarzalnego raportu w formatach PDF, DOC i HTML. Sesje użytkownika mogą być zapisywane i ponownie ładowane w przyszłości, a pełne wyniki mogą być pobierane i dalej interpretowane przez pakiet Bio3D R na komputerze lokalnym użytkownika.
Bio3D-web jest zasilany przez pakiet Bio3D R do analizy struktury biomolekularnej, sekwencji i danych symulacji molekularnej 8,16. W szczególności podstawą aplikacji są algorytmy Bio3D do identyfikacji rdzenia sztywnego 8, superpozycja, analiza głównych składowych (PCA) 8 oraz zespołowa analiza w trybie normalnym (eNMA) 16. Korzystamy również z protokołów Bio3D, które zależą od pHMMER 17 do identyfikacji powiązanych struktur białkowych, oraz MUSCLE 18 do wyrównania wielu sekwencji. Adnotacje dotyczące struktury i sekwencji są uzyskiwane za pomocą narzędzi Bio3D z baz danych RCSB PDB 19 i PFAM 20. Bio3D-web może być uruchomiony z naszego serwera online lub zainstalowany lokalnie na dowolnym komputerze z uruchomionym R. Bio3D-web jest otwarty dla wszystkich użytkowników i jest udostępniany bezpłatnie na licencji open source GPL-3 od: http://thegrantlab.org/bio3d/webapps
UWAGA: Typowa sesja internetowa Bio3D przechodzi przez pięć następujących po sobie i zależnych od siebie kroków (patrz Rysunek 1 dla schematycznej reprezentacji). Każdy krok jest zaimplementowany jako kolejna zakładka nawigacyjna aplikacji internetowej, a mianowicie SEARCH, ALIGN, FIT, PCA i eNMA.
1. Wyszukiwanie i wybór struktury (SEARCH)
2. Analiza wyrównania wielu sekwencji (ALIGN)
3. Dopasowanie i analiza konstrukcji (FIT)
4. Analiza głównych składowych (PCA)
5. Zespołowa analiza w trybie normalnym (eNMA)
Kinaza adenylanowa (Adk) jest powszechnie występującym enzymem, którego funkcją jest utrzymywanie równowagi między nukleotydami cytoplazmatycznymi, niezbędnymi dla wielu procesów komórkowych. Adk działa poprzez katalizowanie odwracalnego przeniesienia grupy fosforylowej z ATP na AMP. Reakcji tej towarzyszą dobrze przebadane, limitujące szybkość przejścia konformacyjne 3,21. W niniejszej pracy analizujemy wszystkie obecnie dostępne struktury Adk za pomocą Bio3D-web, aby ujawnić szczegółowe cechy i zasady mechanistyczne tych kluczowych przejść.
Analizę Bio3D-web dla Adk możemy rozpocząć od wprowadzenia kodu RCSB PDB dowolnej znanej struktury Adk. Na przykład wprowadzenie identyfikatora PDB 1AKE w panelu A karty SEARCH zwraca 167 struktur o podobnej sekwencji, z których 26 najlepszych zostaje automatycznie wybranych do dalszej analizy (patrz panel B). Adnotacje przedstawione w panelu C wskazują, że wszystkie wybrane struktury pochodzą z E. coli, zostały rozwiązane metodą dyfrakcji rentgenowskiej w różnych grupach przestrzennych, mają rozdzielczość w zakresie od 1,63 do 2,8 Å i zostały współkrystalizowane z różnymi ligandami (w tym bez ligandów, AMP, ADP, MG oraz inhibitorem AP5). Należy zauważyć, że dodatkowe szczegóły adnotacji można wyświetlić, klikając opcję „Show/Hide Columns” w panelu C.
Wielokrotne dopasowanie sekwencji jest wykonywane po wejściu w zakładkę ALIGN. Pierwszy panel zakładki ALIGN wyświetla podsumowanie dopasowania, podając szczegółowe informacje o liczbie wierszy sekwencji (odpowiadającej liczbie struktur PDB), a także o liczbie pozycji (t.j. kolumn dopasowania). Obejmuje to specyfikację liczby kolumn zawierających luki oraz kolumn bez luk. Rysunek po prawej stronie pierwszego wiersza przedstawia schematyczne ujęcie dopasowania sekwencji. Tutaj szare obszary reprezentują pozycje bez luk, natomiast białe obszary w dopasowaniu odpowiadają lukom. Przedstawienie konserwacji sekwencji widoczne jest nad dopasowaniem, gdzie czerwone obszary wskazują pozycje dobrze konserwowane, a białe – mniej konserwowane. Należy zauważyć, że sekwencje na tym rysunku są uporządkowane na podstawie ich podobieństwa określonego przez dendrogram klastrowania po lewej stronie. Drugi panel tej zakładki dodatkowo ułatwia klastrowanie wybranych struktur PDB na podstawie ich sparowanego podobieństwa sekwencji, co może być wizualizowane w formie dendrogramu lub mapy ciepła. Domyślnie wyświetlany jest dendrogram (lub diagram drzewiasty) przedstawiający układ klastrów. Oś y dendrogramu reprezentuje odległość (w kategoriach identyczności sekwencji) między klastrami.
Superpozycja struktur jest wykonywana automatycznie po wejściu w zakładkę FIT. Superponowane struktury, wyświetlane interaktywnie w panelu A, wskazują na obecność stosunkowo sztywnego regionu rdzenia (obejmującego reszty 1-29, 68-117 oraz 161-214; szczegóły znajdują się w panelu „optional core and RMSD details” na dole zakładki FIT). Wyraźnie widoczne są również dwa bardziej zmienne regiony wiążące nukleotydy (reszty 30-67 i 118-167) (Rycina 2). Klasteryzacja oparta na RMSD grupuje te struktury w dwie odrębne konformacje.
Kliknięcie karty PCA wyraźniej pokazuje relację między strukturami pod kątem przemieszczeń tych regionów, które efektywnie zamykają się nad związanymi gatunkami nukleotydów w pokrewnych strukturach (Rysunek 2B i 2C). Większość struktur występuje w formie „zamkniętej” (kolor niebieski na Rysunku 2C) i jest powiązana ze związanym ligandem lub inhibitorem. Z kolei konformacje bardziej „otwarte” są wolne od nukleotydów i inhibitorów. Jest to zgodne z obszernymi badaniami nad strukturą i dynamiką Adk, wskazującymi, że otwarta konfiguracja tych regionów jest niezbędna do wiązania nukleotydów, a konformacja zamknięta do efektywnego przeniesienia grupy fosforanowej i ograniczenia niekorzystnych zdarzeń hydrolizy. Warto zauważyć, że pojedyncza główna składowa (PC) obejmuje 97% całkowitego średniokwadratowego przemieszczenia w tym zestawie struktur Adk i dostarcza jasnego i przekonującego opisu przejścia z formy otwartej do zamkniętej wraz z wkładem poszczególnych reszt w to funkcjonalne przemieszczenie (panel C aplikacji oraz Rysunek 2).
Przejście do karty NMA i zwiększenie liczby struktur uwzględnionych w obliczeniach (poprzez zmniejszenie wartości odcięcia dla filtrowania podobnych struktur) wskazuje, że struktury w stanie otwartym wykazują zwiększoną dynamikę lokalną i globalną w porównaniu do struktur w formie zamkniętej (Rycina 2D oraz panel C aplikacji). Porównanie wyników PCA i NMA dla poszczególnych struktur (panel D) wskazuje, że pierwszy mod wszystkich struktur w formie otwartej wykazuje stosunkowo wysoki stopień pokrycia z PC1 (ze średnią wartością 0,37 ± 0,04). W przeciwieństwie do nich, struktury w formie zamkniętej wykazują niższe wartości (średnio 0,30 ± 0,01). Wartości RMSIP dla struktur w formie otwartej (0,62 ± 0,003) są również wyższe niż dla struktur zamkniętych (0,56 ± 0,008). Ponadto analiza pokrycia pokazuje, że pierwsze mody stanu otwartego są zgodne ze zmianą konformacyjną opisującą różnicę między stanami otwartym a zamkniętym (panel E). Klasteryzacja oparta na wartościach RMSIP ponownie wykazuje spójny podział struktur stanu otwartego i zamkniętego (panel F).
Wszystkie te wyniki łącznie wskazują na istnienie dwóch głównych, odrębnych stanów konformacyjnych Adk. Różnią się one zbiorowym przesunięciem o niskiej częstotliwości dwóch regionów miejsca wiązania nukleotydów, które wykazują różną elastyczność po związaniu nukleotydu.

Rycina 1: Przegląd Bio3D-web ze zrzutami ekranu kart PCA i NMA. Bio3D-web przyjmuje jako dane wejściowe dostarczoną przez użytkownika strukturę lub sekwencję białka w karcie SEARCH (1). Serwer wyświetla listę pokrewnych struktur, które można wybrać do dalszej analizy. (2) Karta ALIGN umożliwia dopasowanie sekwencji i analizę struktur wybranych w karcie SEARCH. (3) W karcie FIT wszystkie struktury są nakładane na siebie i wizualizowane w 3D wraz z wynikami konwencjonalnej analizy parowej struktur. (4) Analiza głównych składowych zestawu struktur jest przeprowadzana w karcie PCA w celu scharakteryzowania relacji między konformerami. (5) Analizę modów normalnych każdej struktury można przeprowadzić w karcie eNMA, aby zbadać trendy dynamiczne dla dostępnych stanów strukturalnych. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Rysunek 2: Wyniki analizy Bio3D-web kinazy adenylanowej. (A) Dostępne struktury PDB kinazy adenylanowej nałożone na zidentyfikowany rdzeń niezmienny. Struktury są zabarwione zgodnie z grupowaniem opartym na RMSD, dostępnym w zakładce FIT. (B) Wizualizacja głównych składowych jest dostępna w zakładce PCA w celu charakterystyki głównych wariacji konformacyjnych w zbiorze danych. Tutaj trajektoria odpowiadająca pierwszej głównej składowej jest przedstawiona w reprezentacji rurkowej, obrazując wielkoskalowy ruch zamykania białka. (C) Struktury są rzutowane na dwie pierwsze główne składowe na wykresie konformerów, przedstawiającym niskowymiarową reprezentację zmienności konformacyjnej. Każdy punkt (lub struktura) jest zabarwiony zgodnie z kryteriami określonymi przez użytkownika, w tym przypadku zgodnie z wynikami grupowania opartego na PCA. (D) Analiza modów normalnych w zakładce eNMA sugeruje zwiększoną dynamikę lokalną i globalną dla struktur w stanie otwartym (czerwony) w porównaniu ze strukturami w formie zamkniętej (niebieski). Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Bio3D-web może być używany do interaktywnego badania i mapowania stanów strukturalnych, dynamicznych i funkcjonalnych białek na podstawie dostępnych struktur krystalograficznych. Co więcej, wyniki grupowania oparte na NMA i PCA, wraz z adnotacjami i analizą opartą na sekwencjach, mogą być szczególnie przydatne do wyboru reprezentatywnych struktur do bardziej czasochłonnych analiz, takich jak dokowanie małych cząsteczek lub symulacje dynamiki molekularnej. W ten sposób Bio3D-web ułatwia zaawansowaną analizę bioinformatyczną strukturalną szerszemu gronu badaczy, zmniejszając wymagany poziom wiedzy technicznej. Obecny projekt Bio3D-web kładzie nacisk na prostotę, a nie na wyczerpujące włączenie wielu metod analizy dostępnych w pełnym, samodzielnym pakiecie Bio3D. W wielu przypadkach przewiduje się, że naukowcy będą korzystać z Bio3D-web w celu zrozumienia ogólnych trendów w ich rodzinie białek lub nadrodzinie białek, które mogą następnie dostarczyć informacji na temat bardziej specjalistycznych analiz. Bio3D-web został zatem zaprojektowany do szybkiego eksplorowania zestawów danych dotyczących struktury biomolekularnej i działania jako narzędzie do generowania hipotez. Zachęcamy użytkowników do dalszego eksplorowania swoich danych poprzez podanie przykładowego kodu Bio3D w powtarzalnym raporcie, który przechowuje również wszystkie szczegóły zapytania i wyniki analizy.
W powyższym reprezentatywnym przykładowym protokole pokazujemy zdolność Bio3D-web do ujawniania cech strukturalnych funkcjonalnych przejść konformacyjnych Adk. Dodatkowe zastosowania Bio3D-web obejmują analizę strukturalną i dynamiczną struktur PDB przesłanych przez użytkownika. Na przykład użytkownik może przesłać nowe struktury lub sekwencje białek do analizy. Wspomniane wcześniej etapy analizy, zwłaszcza etap eNMA, mogą ujawnić zarówno lokalne, jak i globalne trendy w ruchach białek, przy czym ruchy zbiorowe mają znaczenie funkcjonalne. Porównanie ze strukturami apo może również ujawnić cechy niezwiązanych z wiązanymi przejściami konformacyjnymi. Dodatkowe przykłady zastosowania do wielu różnych rodzin białek są dostępne w Internecie.
Chociaż wszystkie białka są elastycznymi i dynamicznymi jednostkami, nie wszystkie białka mają struktury o rozdzielczości atomowej dostępne w wielu różnych stanach (np. stanach aktywnych i nieaktywnych). Nasz pogląd na przestrzeń struktury białek jest zatem ograniczony, a zatem wgląd uzyskany za pomocą narzędzi takich jak Bio3D-web jest z konieczności ograniczony również w przypadku niektórych białek. Jednak przy obecnym postępie technologicznym i nowych inicjatywach w zakresie genomiki strukturalnej, przedstawiony tutaj protokół będzie coraz częściej stawał się ważną drogą do uzyskania wglądu w ważne relacje struktura-funkcja. Krytycznym krokiem, który jest szczególnie ważny przy analizie bardziej odległych spokrewnionych białek, jest potencjalne pojawienie się błędów dopasowania w zakładce ALIGN. Błędy wyrównania nieuchronnie wystąpią, gdy podobieństwo sekwencji spadnie poniżej 30% i w takich przypadkach użytkownik musi dokładnie sprawdzić i skorygować wyrównanie sekwencji w zakładce WYRÓWNAJ. Błędy wyrównania mogą skutkować nieprawidłowymi nałożonymi strukturami na karcie DOPASOWANIE i zamaskować najistotniejsze zmiany konformacyjne dla kolejnego PCA. Ponadto użytkownik powinien być świadomy brakujących reszt w wybranych strukturach PDB, ponieważ w obecnej implementacji PCA można wykonać tylko na resztach białkowych, w których wszystkie struktury mają odpowiadający im atom węgla alfa. W rezultacie, jeśli wybrany PDB ma nierozwiązane reszty dla określonego regionu białka, region ten zostanie pominięty w PCA.
Bio3D-web jest obecnie ograniczony do analizy jednołańcuchowych struktur PDB. W związku z tym ruchy funkcjonalne zachodzące na poziomie czwartorzędu nie mogą być badane przy użyciu obecnego protokołu. Chociaż obecnie opracowujemy nowe algorytmy, aby uwzględnić taką analizę w Bio3D-web, jedyną obecną opcją jest konwencjonalne wykorzystanie Bio3D.
Bio3D-web to jedyna aplikacja online, która umożliwia wyszukiwanie i identyfikowanie zbiorów struktur, interpretowanie ich wzorców sekwencji i zmienności strukturalnej oraz wydobywanie informacji mechanistycznych zarówno z analizy, jak i przewidywania ich plastyczności strukturalnej. Szeroka gama narzędzi do wizualizacji molekularnej i serwerów online umożliwia naukowcom badanie i analizowanie poszczególnych struktur biomolekularnych. Jednak istniejące narzędzia do analizy sekwencji, struktury i dynamiki dużych heterogenicznych rodzin białek często wymagają znacznej wiedzy obliczeniowej i zazwyczaj pozostają dostępne tylko dla użytkowników posiadających odpowiednie umiejętności programistyczne. Na przykład pakiet Bio3D wymaga R 8, ProDy wymaga Pythona, a Maven wymaga wiedzy o Matlabie 9,10. Z kolei Bio3D-web nie wymaga wiedzy programistycznej, a tym samym zwiększa dostępność i zmniejsza barierę wejścia do wykonywania zaawansowanych analiz porównawczych sekwencji, struktury i dynamiki. Ponadto przygotowanie, selekcja, adnotacja i czyszczenie struktur molekularnych, które są często niezbędne do efektywnej analizy, są zawarte w usłudze internetowej Bio3D. Dodatkowo, ograniczenie do wykonywania takiej analizy na zasobach obliczeniowych jest złagodzone przez naszą instancję serwerową, która umożliwia analizę wielu struktur na dużą skalę, które mogą być inicjowane i kontrolowane z dowolnej nowoczesnej przeglądarki internetowej.
Otwarty rozwój Bio3D-web jest w toku (patrz https://bitbucket.org/Grantlab/bio3d). Stale dodajemy nowe funkcje analizy i ulepszamy istniejące metody. Przyszły rozwój będzie koncentrował się na dodaniu PCA opartego na macierzy odległości i PCA skrętnego, bardziej rozległych podejściach do zachowania sekwencji, które obejmują komponent filogenetyczny, identyfikację miejsca wiązania zespołu oraz nowych podejściach do dynamicznej analizy sieci w różnych rodzinach białek. Pod tym względem obecna aplikacja internetowa stanowi punkt wyjścia dla wielu innych procesów pracy związanych ze współpracą w zakresie bioinformatycznej analizy strukturalnej, umożliwiając powtarzalne i możliwe do udostępnienia kroki na zdefiniowanych przez użytkownika zestawach struktur eksperymentalnych. Planujemy również w przyszłości wsparcie dla zrekonstruowanych zbiorów współrzędnych jednostek biologicznych oraz pojedynczych i wielokrotnych łańcuchów z jednostki asymetrycznej struktur PDB. Dodatkowe funkcje będą obejmować ulepszone zapisywanie i wczytywanie wspólnych przestrzeni roboczych wraz z możliwością cofania.
Bio3D-web to aplikacja online do interaktywnej analizy danych o strukturze biomolekularnej. Bio3D-web działa w każdej nowoczesnej przeglądarce internetowej i zapewnia funkcjonalność dla: (1) Identyfikacja powiązanych struktur białkowych ustawia się na określone przez użytkownika progi podobieństwa; (2) Ich wielokrotne wyrównanie i superpozycja struktury; (3) Analiza zachowania sekwencji i struktury; (4) Mapowanie relacji między konformerami z analizą głównych składowych oraz (5) porównanie przewidywanej dynamiki wewnętrznej za pomocą zespołowej analizy w trybie normalnym. Ta zintegrowana funkcja zapewnia kompletny przepływ pracy do badania relacji sekwencja-struktura-dynamika w rodzinach białek i nadrodzinach. Oprócz wygodnego, łatwego w użyciu dynamicznego interfejsu do badania efektów wyboru parametrów i metod, Bio3D-web rejestruje również pełne dane wejściowe użytkownika i późniejsze wyniki graficzne sesji użytkownika. Dzięki temu użytkownicy mogą łatwo udostępniać i odtwarzać sekwencję kroków analizy, które utworzyły ich wyniki. Bio3D-web jest zaimplementowany w całości w języku R i jest oparty na pakietach Bio3D i Shiny R. Można go uruchomić z naszego serwera online lub zainstalować lokalnie na dowolnym komputerze z uruchomionym językiem R. Obejmuje to instalację serwera lokalnego w celu zapewnienia dostosowanej instancji dla wielu użytkowników z dostępem do priorytetowych zestawów danych strukturalnych, takich jak te powszechne w przemyśle farmaceutycznym. Pełny kod źródłowy i obszerna dokumentacja są udostępniane na licencji open-source GPL-3 od: http://thegrantlab.org/bio3d/webapps
Autorzy oświadczają, że nie mają konkurencyjnych interesów finansowych.
Dziękujemy Dr. Guido Scarabelli i Hongyang Li za obszerne testy w trakcie rozwoju, a także społeczności użytkowników Bio3D i uczestnikom warsztatów bioinformatyki strukturalnej Uniwersytetu w Bergen za opinie i komentarze, które ulepszyły tę aplikację.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Bio3D-web | |||
| Strona internetowa | http://thegrantlab.org/bio3d-web/ | ||
| Wymagania | Przeglądarka |