Artykuł metodologiczny

Obliczeniowe przewidywanie preferencji aminokwasów potencjalnie wielospecyficznych domen wiążących peptydy zaangażowanych w interakcje białko-białko

3K wyświetleń

DOI:

10.3791/66314

26 stycznia 2024

W tym artykule

Podsumowanie

Opisujemy metodologię opartą na dywersyfikacji sekwencji w celu oszacowania preferencji aminokwasowych wielospecyficznych miejsc wiązania w interakcjach białko-białko (PPI). W ramach tej strategii tysiące potencjalnych ligandów peptydowych są generowane i badane in silico, pokonując w ten sposób niektóre ograniczenia dostępnych metod eksperymentalnych.

Streszczenie

Wiele interakcji białko-białko wiąże krótkie segmenty białka z domenami wiążącymi peptydy. Zazwyczaj takie oddziaływania wymagają rozpoznania motywów linearnych o zmiennej konserwacji. Połączenie wysoce konserwatywnych i bardziej zmiennych regionów w tych samych ligandach często przyczynia się do wielospecyficzności wiązania, co jest powszechną właściwością enzymów i białek sygnalizacji komórkowej. Charakterystyka preferencji aminokwasowych domen wiążących peptydy jest ważna dla projektowania mediatorów interakcji białko-białko (PPI). Metody obliczeniowe stanowią skuteczną alternatywę dla często kosztownych i kłopotliwych technik eksperymentalnych, umożliwiając projektowanie potencjalnych mediatorów, które można później zweryfikować w dalszych eksperymentach. W tym miejscu opisaliśmy metodologię wykorzystującą zastosowanie Pepspec w pakiecie do modelowania molekularnego Rosetta do przewidywania preferencji aminokwasowych domen wiążących peptydy. Metodologia ta jest przydatna, gdy struktura białka receptorowego i charakter liganda peptydowego są znane lub można je wywnioskować. Metodologia rozpoczyna się od dobrze scharakteryzowanej kotwicy z liganda, która jest przedłużana przez losowe dodawanie reszt aminokwasowych. Powinowactwo wiązania wytworzonych w ten sposób peptydów jest następnie oceniane za pomocą dokowania peptydów z elastycznym szkieletem w celu wybrania peptydów o najlepszych przewidywanych wynikach wiązania. Peptydy te są następnie wykorzystywane do obliczania preferencji aminokwasowych i opcjonalnie do obliczania macierzy pozycja-masa (PWM), którą można wykorzystać w dalszych badaniach. Aby zilustrować zastosowanie tej metodologii, wykorzystaliśmy interakcję między podjednostkami ludzkiego czynnika regulacyjnego interferonu 5 (IRF5), wcześniej znanego jako wielospecyficzny, ale globalnie kierowany przez krótki konserwatywny motyw zwany pLxIS. Oszacowane preferencje aminokwasowe były zgodne z wcześniejszą wiedzą na temat powierzchni wiązania IRF5. Pozycje zajmowane przez fosforylujące reszty seryny wykazywały wysoką częstotliwość asparaginianu i glutaminianu, prawdopodobnie dlatego, że ich ujemnie naładowane łańcuchy boczne są podobne do fosfoseryny.

Wprowadzenie

Oddziaływanie między dwoma białkami często obejmuje wiązanie krótkich odcinków aminokwasów z domenami wiążącymi peptydy, co przypomina interfejsy białko-peptyd. Białka receptorowe uczestniczące w takich oddziaływaniach białko-białko (PPI) często posiadają zdolność rozpoznawania określonego zestawu nakładających się, lecz zróżnicowanych sekwencji ligandów, co jest właściwością znaną jako wielospecyficzność1,2. Rozpoznawanie wielospecyficzne jest cechą wielu białek komórkowych, ale jest szczególnie wyraźne w przypadku enzymów i białek sygnałowych komórki3. Białka oddziałujące z wielospecyficznymi miejscami wiązania często posiadają w swojej sekwencji kombinację regionów bardziej i mniej konserwatywnych4,5,6. W takim scenariuszu bardziej konserwatywne motywy sekwencji biorą udział w rygorystycznych oddziaływaniach molekularnych. Z kolei sekwencje bardziej zmienne oddziałują z powierzchniami w miejscu wiązania receptora, które są w pewnym stopniu bardziej tolerancyjne. Zazwyczaj te mniej konserwatywne, lecz wciąż istotne funkcjonalnie segmenty są pętlami pozbawionymi zdefiniowanych wzorów struktury drugorzędowej lub przyjmują jeszcze bardziej dynamiczne konformacje, takie jak te typowe dla białek wewnętrznie nieuporządkowanych7.

Identyfikacja potencjalnych ligandów peptydowych miejsc wiązania jest zazwyczaj pierwszym krokiem w projektowaniu mediatorów zdolnych do zakłócania odpowiadających im PPI8. Jednakże w przypadku ligandów wielospecyficznych miejsc wiązania często mało prawdopodobne jest znalezienie jednego, najczęściej występującego reszty aminokwasowej w większości pozycji sekwencji. Zamiast tego miejsca te mogą wykazywać szczególne preferencje dla konkretnej klasy aminokwasów, w zależności od ich właściwości chemicznych, np. aminokwasów kwasowych i naładowanych ujemnie, takich jak asparaginian lub glutaminian, objętościowych aminokwasów aromatycznych, takich jak fenyloalanina, lub bardziej hydrofobowych reszt, takich jak alifatyczne aminokwasy alanina, walina, leucyna lub izoleucyna3. Kilka metod eksperymentalnych może dostarczyć informacji na temat preferencji aminokwasowych miejsc wiązania białek, w tym ewolucja sterowana9, mutageneza z wielokodonowym skanowaniem10 oraz głębokie skanowanie mutacyjne11. Wszystkie te metody opierają się na podejściu dywersyfikacji sekwencji, które polega na wprowadzaniu mutacji do oryginalnych ligandów i dalszej analizie ich wpływu na funkcję białka receptorowego (szeroki przegląd temu zagadnieniu poświęcono w pracy Bratulic i Badran12). Jednak metody te często wymagają analizy dużych bibliotek sekwencji, co czyni je bardziej uciążliwymi, kosztownymi i czasochłonnymi.

Metody obliczeniowe służące do wnioskowania o preferencjach aminokwasowych wielospecyficznych miejsc wiązania mają potencjał do obejścia ograniczeń metod laboratoryjnych. Wśród nich podejście polegające na dywersyfikacji sekwencji in silico ocenia wpływ energetyczny szerokiego zakresu zamian aminokwasowych w sekwencji ligandu w celu scharakteryzowania plastyczności strukturalnej PPI13. Metoda ta rozpoczyna się od struktury lub modelu ligandu peptydowego związanego z miejscem wiązania receptora, a następnie wprowadza mutacje do sekwencji ligandu. Następnie wykorzystuje się statystyczne i energetyczne funkcje oceny, aby przeanalizować wpływ tych mutacji na stabilność i powinowactwo wiązania. Zbiór najlepiej ocenionych sekwencji ligandów wynikający z fazy oceny może zostać następnie wykorzystany do obliczenia preferencji aminokwasowych. Strategia ta pozwala na efektywne przetwarzanie bardzo dużej liczby sekwencji ligandów. Dzięki temu może ona zapewnić pełniejsze i bardziej spójne wnioskowanie o preferencjach aminokwasowych w porównaniu z wynikami uzyskanymi z ograniczonej liczby sekwencji, które zazwyczaj można przetworzyć w podejściach laboratoryjnych.

Aplikacja Pepspec z pakietu modelowania molekularnego Rosetta14 jest narzędziem, które przeprowadza dywersyfikację sekwencji jako kluczowy krok w trybie projektowania peptydów. Aplikacja ta wymaga struktury lub modelu białka receptorowego z przyłączonym peptydem o długości nawet jednego aminokwasu, który służy jako kotwica dla kolejnych etapów. Sekwencja przyłączonego peptydu jest następnie przedłużana (jeśli to konieczne) i dywersyfikowana w celu wygenerowania licznej grupy domniemanych ligandów peptydowych. Powinowactwo wiązania tych peptydów jest następnie oceniane za pomocą dokowania peptydów z elastycznym szkieletem, aby wybrać te z najlepszymi przewidywanymi wynikami wiązania. Chociaż głównym wynikiem działania tej aplikacji są najlepsze kandydaty peptydowe wybrane na koniec fazy projektowania, znacznie większy zbiór peptydów zaakceptowanych w tej fazie może być również wykorzystany do obliczenia preferencji aminokwasowych w docelowym miejscu wiązania. Preferencje aminokwasowe oblicza się jako częstotliwość występowania każdego aminokwasu w danej pozycji sekwencji ligandu, przedstawiając je w formie macierzy wag pozycyjnych (PWM) lub bardziej wizualnego logo sekwencyjnego.

W niniejszym artykule opisujemy protokół służący do szacowania preferencji aminokwasowych powierzchni wiążącej białka receptorowego uczestniczącego w PPI. Protokół koncentruje się na PPI, w których wiadomo, że liniowy fragment białka-liganda wiąże się z białkiem receptorowym, zatem scenariusz ten można modelować jako interfejs białko-peptyd. W takim przypadku konserwowane motywy liganda zazwyczaj oddziałują z określonymi kieszeniami w miejscu wiązania receptora, choć cały segment liganda zaangażowany w PPI może zawierać obszary mniej konserwowane. Schemat blokowy podsumowujący główne etapy protokołu przedstawiono na Rysunku 1. Protokół rozpoczyna się od struktury 3D kompleksu białko-białko, a następnie redukuje białko-ligand do potencjalnie najlepiej oddziałującego segmentu, pozostawiając białko receptorowe w niezmienionej formie. Najlepiej oddziałujący segment jest wyznaczany przy użyciu serwera BUDE Alanine Scan15, który przeprowadza obliczeniowe skanowanie mutagenezą alaninową w celu zidentyfikowania reszt typu hot-spot pomiędzy dwiema oddziałującymi białkami. W tym podejściu reszty liganda są pojedynczo zastępowane alaniną, a oszacowana zmiana wolnej energii lub stabilności kompleksu (ΔΔG) jest następnie wykorzystywana do wnioskowania o znaczeniu odpowiadającej reszty dla docelowego PPI. Po wyznaczeniu najlepiej oddziałującego segmentu, jego kompleks z białkiem receptorowym jest wykorzystywany jako struktura bazowa przesyłana do Pepspec w celu przeprowadzenia dywersyfikacji sekwencji.

Modelowanie kompleksu białko-białko; identyfikacja peptydów; schemat dywersyfikacji sekwencji.
Rycina 1: Przegląd głównych etapów protokołu zaproponowanego w niniejszej pracy. Numery odpowiadają numerom kroków w sekcji protokołu. Ryciny zostały przygotowane z wykorzystaniem kompleksu białko-białko jako przykładu opisanego w tekście. W kompleksie tym łańcuch białkowy uznany za receptor jest pokazany na różowo, natomiast łańcuch uznany za ligand jest pokazany na jasnoniebiesko, z wyróżnionym na czerwono przewidywanym najlepiej oddziałującym segmentem. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Jednym z ograniczeń sugerowanego protokołu jest wymóg posiadania rozdzielonej struktury interfejsu białko-peptyd. Protokół może alternatywnie rozpocząć się od modelu docelowego interfejsu białko-peptyd, choć konkretne kroki modelowania nie zostały tutaj opisane. Ponadto, choć protokół można przeprowadzić na komputerze osobistym z dowolnym systemem operacyjnym, do kroków obejmujących aplikacje Rosetta wymagane jest środowisko Linux. Ze względu na dużą liczbę iteracji zazwyczaj wykonywanych przez program Pepspec, do etapu dywersyfikacji sekwencji wysoce zaleca się użycie klastra komputerowego.

Zastosowanie sugerowanego protokołu zilustrowano na przykładzie oceny preferencji aminokwasowych powierzchni wiążącej białka IRF5, należącego do ludzkiej rodziny czynników regulacyjnych interferonu (IRF). Wybrano to białko jako przykład, ponieważ podczas jego aktywacji dwie podjednostki wiążą się, tworząc dimer o dobrze scharakteryzowanej strukturze16. W dimerach IRF wiązanie można modelować jako interfejs białko-peptyd, w którym jedna podjednostka stanowi powierzchnię wiążącą, a druga oddziałuje poprzez region zawierający krótki konserwatywny motyw zwany pLxIS17,18. Ponadto wiązanie z podjednostkami IRF jest wielospecyficzne, w związku z czym mogą one tworzyć homodimery, heterodimery oraz kompleksy z innymi białkami komórkowymi, znanymi jako koaktywatory18.

Protokół

1. Wstępne przygotowanie interfejsu białko-peptyd

  1. Pobieranie struktury kompleksu białko-białko
    1. Przejdź do strony głównej Protein Data Bank (PDB) (https://www.rcsb.org/) i wpisz w głównym polu wyszukiwania identyfikator PDB dla struktury kompleksu białko-białko (Rysunek 2A). Identyfikator PDB dla struktury dimeru IRF5, wykorzystany jako przykład w tej pracy, to 3DSH19.
    2. Na stronie głównej wybranej struktury kliknij Download Files (Rysunek 2B), a następnie Biological Assembly 1 (PDB - gz) (Rysunek 2C).
      UWAGA: W bazie danych PDB struktury wielu kompleksów białkowych utworzonych z identycznych monomerów są reprezentowane jako zgrupowania biologiczne (biological assemblies), w których w pliku PDB zapisana jest struktura tylko jednego monomeru (jednostka asymetryczna). Strukturę multimeru, w tym przypadku dimeru IRF5, należy pobrać jako zgrupowanie biologiczne zawierające dwie kopie jednostki asymetrycznej. Aby ułatwić kolejne kroki tego protokołu, dwa monomery są najpierw rozdzielane, a następnie przypisuje się im różne identyfikatory łańcuchów.
    3. Otwórz pobraną strukturę w programie UCSF Chimera20 i kliknij Tools > Structure Editing > Change Chain IDs. W tym przykładzie oba łańcuchy w zgrupowaniu biologicznym nazywają się A. Zmień nazwę drugiego łańcucha (oznaczonego jako #0.2) na B i kliknij OK.
    4. Kliknij Favorites > Model Panel, a następnie wybierz model zawierający oba łańcuchy. Kliknij przycisk Group/Ungroup, aby rozdzielić każdy łańcuch do osobnego modelu. Następnie zaznacz oba modele i kliknij przycisk Copy/Combine. Wprowadź nową nazwę dla połączonego modelu, zaznacz opcję Close Source Models i kliknij OK.
    5. Kliknij Select > Chain i potwierdź, że każdy łańcuch w dimerze jest teraz zidentyfikowany inną literą, mianowicie A i B.
    6. Użyj funkcji File > Save PDB, aby zapisać zmodyfikowaną strukturę w nowym pliku PDB, który będzie wykorzystany w kolejnych krokach protokołu (tutaj zastosowano nazwę IRF5_dimer.pdb).

Interfejs pobierania struktury z PDB, prezentujący opcje formatów 3D modeli białek oraz powiązane dane.
Rycina 2: Strona Protein Data Bank (PDB) dla struktury wykorzystanej jako reprezentatywny przykład w niniejszej pracy. (A) Pole wyszukiwania do wprowadzenia kodu dostępu PDB docelowej struktury. (B) Menu umożliwiające pobranie struktury w kilku formatach. (C) Opcje pobierania zespołów biologicznych w przypadku, gdy struktura została zapisana jako jednostka asymetryczna (szczegóły w kroku 1.1.2). Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

  1. Identyfikacja docelowego segmentu w białku ligandu
    1. Przejdź do serwera BUDE Alanine Scan (https://pragmaticproteindesign.bio.ed.ac.uk/balas/). Kliknij przycisk Choose File w sekcji Structure Upload i wybierz plik PDB zapisany w kroku 1.1.6.
    2. Na następnej stronie sprawdź, czy struktura została poprawnie wczytana (Rycina 3A), a następnie wprowadź nazwę zadania w serwerze (Rycina 3B).
    3. Wyznacz łańcuchy z pliku PDB, które będą traktowane jako receptor (A) i ligand (B) (Rycina 3C). Następnie kliknij przycisk Start Scan, aby przesłać zadanie.
    4. Po zakończeniu zadania kliknij Show Results, aby otworzyć stronę z wynikami (Rycina 4).
      UWAGA: Na stronie wyników reszty struktury ligandu są pokolorowane zgodnie z szacowaną zmianą energii swobodnej (ΔΔG); reszty o wyższych wartościach są zaznaczone na czerwono.
    5. Z listy reszt wybierz odcinek aminokwasów, który według przewidywań będzie najlepiej oddziaływał z docelową powierzchnią wiązania. Upewnij się, że reszty te grupują najwyższe wartości różnicy energii swobodnej (ΔΔG). W tym przykładzie wybrano segment między resztami Leu424 a Ser436 (zaznaczony czerwoną ramką na prawym panelu Ryciny 4).
  2. Przygotowanie interfejsu białko-peptyd do dywersyfikacji sekwencji
    1. Otwórz w programie Chimera plik PDB zapisany w kroku 1.1.6 i upewnij się, że w strukturze podjednostek docelowych nie brakuje atomów ani wiązań.
    2. Usuń wszystkie małe cząsteczki, jony i rozpuszczalniki, które współkrystalizowały z oryginalną strukturą. Aby to zrobić, kliknij Select > Residues, a następnie zaznacz wszystkie cząsteczki inne niż standardowe aminokwasy. Następnie kliknij Actions > Atoms/Bonds i Delete.
    3. Przytnij łańcuch ligandu do najlepiej oddziałującego segmentu wybranego w kroku 1.2.5. Aby to zrobić, kliknij Favorites oraz Sequence , a następnie kliknij łańcuch uznany za ligand (B). W panelu Sequence przeciągnij myszą, aby zaznaczyć wszystkie reszty z wyjątkiem tych między pozycjami 424 a 436. Aby usunąć te reszty, kliknij Actions > Atoms/Bonds i Delete.
    4. Użyj opcji File > Save PDB, aby zapisać zmodyfikowaną strukturę w osobnym pliku PDB, który będzie wykorzystany w kolejnych krokach protokołu (tutaj użyto nazwy IRF5_interface.pdb).

Interfejs BUDE alanine scan, analiza struktury białka, narzędzie do przesyłania struktury i wyboru łańcucha.
Rysunek 3: Wybór receptora i liganda w serwerze BUDE Alanine Scan. (A) Graficzna reprezentacja kompleksu białko-białko. (B) Pole tekstowe do wprowadzenia nazwy zadania w serwerze. (C) Panel do interaktywnego wyboru łańcuchów, które zostaną uznane za receptor i ligand (szczegóły w kroku 1.2). Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Schemat skanowania alaniną BUDE; analiza struktury białka, tabela danych mutacji aminokwasowych.
Rycina 4: Strona wyników serwera BUDE Alanine Scan. Potencjalny najlepiej oddziałujący segment w sekwencji ligandu zaznaczono czerwoną ramką. W lewym panelu reszta o wyższym przewidywanym udziale energetycznym (Leu433) jest wyróżniona na zielono. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

2. Dywersyfikacja sekwencji

UWAGA: W poniższych krokach rosetta_main odnosi się do głównego katalogu instalacyjnego Rosetta, który zazwyczaj znajduje się w /opt/rosetta_src__bundle/main/, gdzie oznacza zainstalowaną wersję Rosetta. Zakłada się również, że aplikacje Rosetta są dostępne w całym systemie; jeśli tak nie jest, należy podać pełną ścieżkę do plików wykonywalnych. W przypadku kompilacji ze źródeł, pliki wykonywalne te znajdują się w katalogu /rosetta_main/source/bin/.

  1. Wstępna optymalizacja łańcuchów bocznych aminokwasów
    1. Skopiuj edytowaną strukturę zapisaną w kroku 1.3.4 do lokalizacji w systemie Linux dostępnej dla aplikacji Rosetta.
    2. Użyj aplikacji FixBB z pakietu Rosetta, aby przeprowadzić repakowanie (repack) wszystkich łańcuchów bocznych aminokwasów struktury bazowej przed dywersyfikacją sekwencji. W tej operacji orientacja wszystkich łańcuchów bocznych aminokwasów jest optymalizowana w celu zminimalizowania energii i poprawy stabilności kompleksu. Aby to zrobić, wykonaj następujące polecenie:
      Repakowanie struktury białka, wyjście wiersza poleceń, fixbb, repack_only, optymalizacja interfejsu
      UWAGA: To polecenie generuje plik PDB nazwany zgodnie z oryginalną strukturą z dodatkowym sufiksem numerycznym (IRF5_interface_0001.pdb w tym przykładzie).
    3. Aby ułatwić kolejny krok protokołu, zmień nazwę repakowanego pliku PDB, dodając sufiks _repack, korzystając z następującego polecenia:
      mv IRF5_interface_0001.pdb IRF5_repack.pdb
  2. Dywersyfikacja sekwencji
    1. Uruchom Pepspec w trybie projektowania (design mode), aby przeprowadzić właściwy etap dywersyfikacji sekwencji, używając następującego polecenia:
      Polecenie optymalizacji struktury białka w Rosetta.
      Poniżej znajdują się opcje ogólne:
      • -s wskazuje plik wejściowy (repakowany plik PDB wygenerowany w kroku 2.1.3).
      • -o wskazuje prefiks dla nazw plików wyjściowych.
      • - database wskazuje ścieżkę do głównej bazy danych Rosetta 3.
      • -ex1, -ex2 oraz extrachi_cutoff są opcjami biblioteki rotamerów (szczegóły znajdują się w dokumentacji Pepspec).
      • -overwrite instruuje aplikację, aby nadpisała ewentualne istniejące wyniki wygenerowane w poprzednich iteracjach.
      Poniżej znajdują się opcje odnoszące się bezpośrednio do dywersyfikacji sekwencji:
      • -pepspec:pep_chain wskazuje łańcuchy PDB uznane za ligand ('b' w tym przykładzie).
      • -pepspec:native_pep_anchor wskazuje resztę aminokwasową użytą jako kotwicę (w tym przykładzie resztę Leu w pozycji 10 peptydu ligandu).
      • -pepspec:n_peptides określa liczbę struktur peptydowych do wygenerowania.
      • -pepspec:no_prepack_prot instruuje aplikację, aby pominęła repakowanie w wejściowej strukturze bazowej (ponieważ zostało to wykonane wcześniej w kroku 2.1).
        UWAGA: Głównym wynikiem działania Pepspec jest katalog zawierający pliki PDB dla peptydów powstałych w fazie projektowania, nazwane przy użyciu prefiksu wyjściowego z sufiksem .pdbs (IRF5.pdbs w przykładzie). Dodatkowo Pepspec generuje wszystkie zaakceptowane sekwencje peptydowe przetestowane w kroku dywersyfikacji sekwencji oraz odpowiadające im wyniki energii Rosetta w pliku tekstowym z rozdzielaczem tabulacyjnym, nazwanym zgodnie z prefiksem wyjściowym z sufiksem .spec (IRF5.spec w przykładzie). Ponieważ protokół opisany w niniejszej pracy ma na celu oszacowanie preferencji aminokwasowych, a nie właściwe projektowanie peptydów, kolejne kroki wykorzystują plik IRF5.spec zamiast struktur PDB w katalogu .pdbs .

3. Ocena preferencji aminokwasowych

  1. Obliczanie PWM
    1. Aby wygenerować PWM, należy użyć skryptu gen_pepspec_pwm.py dołączonego do pakietu Rosetta. Aby uruchomić ten skrypt, należy użyć następującego polecenia:
      Wynik skryptu do analizy sekwencji genetycznych, pokazujący wynik interfejsu dla analizy specyficzności peptydów.
      gdzie:
      • IRF5.spec to plik wyjściowy Pepspec wygenerowany w kroku 2.2.
      • -1 wskazuje, że w sekwencji nie ma dodatkowych reszt N-końcowych, w związku z czym pozycje w PWM są indeksowane od 1.
      • 0.2 instruuje skrypt, aby uwzględnił tylko 20% najlepiej ocenianych peptydów z wyniku Pepspec (wartość domyślna to 0.1, co odpowiada 10%)
      • interface_score instruuje skrypt, aby uszeregował peptydy na podstawie wyniku interfejsu (interface score), który jest jedną z różnych punktacji Rosetta zawartych w pliku wyjściowym Pepspec.
        UWAGA: Skrypt ten generuje dwa pliki wyjściowe: jeden dla obliczonego PWM (z rozszerzeniem .pwm) oraz drugi dla sekwencji podzbioru peptydów użytych do obliczenia PWM (z rozszerzeniem .seq). Nazwy tych plików zawierają również wynik oraz ułamek peptydów użytych do rankingu. W tym przykładzie pliki te nazywają się odpowiednio IRF5_interface_score_0.2.pwm oraz IRF5_interface_score_0.2.seq.
  2. Generowanie logo sekwencji
    1. Przejdź do serwera WebLogo (https://weblogo.berkeley.edu/logo.cgi)21 i kliknij przycisk Choose File obok opcji Upload Sequence Data. Prześlij plik z sekwencjami peptydów wygenerowany w kroku 3.1.1 (w tym przykładzie IRF5_interface_score_0.2.seq).
    2. Wybierz żądany format i rozmiar logo zgodnie z długością danych wejściowych. W przykładzie zastosowano format PDF i rozmiar 15 cm x 12 cm. Kliknij Create Logo.

Wyniki

W niniejszym artykule opisano protokół służący do przewidywania preferencji aminokwasowych powierzchni wiążącej IRF5, białka należącego do rodziny czynników transkrypcyjnych znanych jako ludzkie czynniki regulacyjne interferonu. Białka te są regulatorami wrodzonych i nabytych odpowiedzi immunologicznych i uczestniczą w różnicowaniu oraz aktywacji wielu komórek odpornościowych. Podjednostki IRF posiadają wysoce plastyczne i wielospecyficzne powierzchnie wiążące, dzięki czemu są zdolne do tworzenia homodimerów, heterodimerów oraz kompleksów z innymi białkami komórkowymi17,18. Przyjmuje się, że dimeryzacja jest pierwszym etapem aktywacji tych czynników, a u większości członków tej rodziny jest ona wyzwalana przez fosforylację wielu reszt seryny/treoniny18. Podczas dimeryzacji każdy monomer oddziałuje z powierzchnią wiążącą drugiego monomeru poprzez wysoce konserwowany motyw zwany pLxIS, zlokalizowany w pobliżu regionu C-końca ich sekwencji. Skrót pLxIS częściowo odzwierciedla preferencje aminokwasowe powierzchni wiążącej, która sekwencyjnie rozpoznaje aminokwas polarny ('p'), a następnie dwie pozycje o wysokiej częstotliwości występowania leucyny ('L') i izoleucyny ('I'), oddzielone pozycją zajmowaną przez dowolny aminokwas ('x') i zakończone resztą seryny podatnej na fosforylację (w tym przykładzie Ser436). Fosforylacja kilku reszt seryny, w tym w motywie pLxIS, sprzyja zgięciu segmentu C-końca jednego monomeru i jego oddziaływaniu z powierzchnią wiążącą drugiego monomeru19,22.

Opisany tutaj protokół rozpoczęto od struktury 3D dimeru IRF519, w której jeden z monomerów przyjęto umownie za receptor w PPI, natomiast drugi uznano za ligand zawierający motyw pLxIS. Aby lepiej zdefiniować segment ligandu oddziałujący z miejscem wiązania receptora, przeprowadzono komputerową mutogenezę metodą skanowania alaniną (krok 1.2). Przewidywany segment składał się z 13 reszt aminokwasowych od pozycji 424 do 436, przy czym motyw pLxIS rozpoczynał się od Arg432. Następnie strukturę oryginalnego dimeru zredukowano do kompleksu peptyd-białko, w którym sekwencja monomeru uznanego za ligand została przycięta do przewidywanego, najlepiej oddziałującego segmentu, podczas gdy drugi monomer pozostawiono w całości (krok 1.3). Strukturę tę wykorzystano następnie jako dane wejściowe do strategii dywersyfikacji sekwencji (sekcja 2), wyznaczając resztę leucyny w motywie pLxIS (Leu433) jako kotwicę wymaganą przez Pepspec. Proces ten pozwolił na uzyskanie ponad 26 000 potencjalnych ligandów peptydowych. Górne 20% potencjalnych ligandów z najlepszymi wynikami energetycznymi (5 280) wykorzystano do oszacowania preferencji aminokwasowych powierzchni wiążącej w formie PWM (Rysunek 5A) oraz logo sekwencji (Rysunek 5B) (sekcja 3).

Analiza motywów sekwencji białkowej; mapa ciepła i logo motywu przedstawiające częstotliwość i konserwację aminokwasów.
Rysunek 5: Preferencje aminokwasowe powierzchni wiążącej IRF3. (A) PWM wskazująca częstotliwość każdego pozostałego aminokwasu (wiersze) na pozycję w sekwencji ligandu peptydowego (kolumny). (B) Logo sekwencji wizualnie reprezentujące odpowiadające im częstotliwości aminokwasów. Pozycje oryginalnej sekwencji IRF5 są podane w nawiasach pod każdą kolumną logo sekwencji. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

W macierzy PWM każdy wiersz odpowiada konkretnemu pozostałości aminokwasowej, natomiast każda kolumna reprezentuje pozycję w sekwencji. Każda komórka macierzy zawiera względną częstotliwość występowania każdego aminokwasu na danej pozycji, ważoną ogólnymi częstotliwościami tła. Logotypy sekwencji są konstruowane poprzez układanie liter aminokwasów w stosy, tak aby całkowita wysokość stosu w każdej pozycji wskazywała stopień konserwacji całej sekwencji w tym miejscu. Z kolei wysokość poszczególnych liter w stosie wskazuje częstotliwość występowania odpowiadającego im aminokwasu. W tym przykładzie zarówno PWM, jak i logotyp sekwencji są zgodne z wcześniejszą wiedzą na temat powierzchni wiążącej IRF5, wykazując większą preferencję dla aminokwasu polarnego (glutaminianu) w pozycji 432 ('p') oraz bardzo wysoką preferencję dla leucyny i izoleucyny odpowiednio w pozycjach 433 i 435. Co istotne, w przypadku pozycji 427, 429 i 436 przewidziano wyższą konserwację dla asparaginianu, mimo że w oryginalnej sekwencji IRF5 są one zajęte przez serynę. Wynik ten dowodzi znaczenia fosforylacji tych pozycji dla tworzenia dimeru IRF5, ponieważ ładunek ujemny w łańcuchach bocznych asparaginianu i glutaminianu przypomina ładunek fosfoseryny. W rzeczywistości wcześniejsze badanie wykazało, że peptyd pułapkowy zwany IRF5D, w którym pozostałości seryny zastąpiono asparaginianem, był w stanie hamować aktywność IRF523. Odwrotnie, dla pozycji 425 przewidziano bardzo wysoką preferencję dla seryny, co sugeruje, że pozostałość seryny w tej pozycji może uczestniczyć w PPI w swojej niefosforylowanej formie. Rzeczywiście, w przypadku innych IRF wcześniej zgłaszano, że fosforylacja równoważnej pozostałości seryny negatywnie wpływa na dimeryzację i wiązanie z innymi koaktywatorami16,24.

Dyskusja

W niniejszym artykule opisano protokół służący do oszacowania preferencji aminokwasowych potencjalnie wielospecyficznych miejsc wiązania w oparciu o dywersyfikację sekwencji in silico. Opracowano niewiele narzędzi obliczeniowych do oszacowania preferencji aminokwasowych granic faz białko-peptyd 14,25,26. Narzędzia te mają charakter predykcyjny, ale różnią się algorytmami obliczeniowymi używanymi do wykonywania ich przewidywań i poprawkami, które wdrażają w celu poprawy dokładności. W tej pracy wykorzystaliśmy aplikację Pepspec z zestawu14 do modelowania molekularnego Rosetta. Chociaż aplikacja ta jest zorientowana głównie na projektowanie peptydów, implementuje algorytm dywersyfikacji sekwencji, który można wykorzystać do przewidywania preferencji aminokwasów. Zgodnie z naszą najlepszą wiedzą, to narzędzie jest jedynym obecnie dostępnym, które zapewnia wbudowany skrypt do obliczania PWM bezpośrednio na podstawie wyników dywersyfikacji sekwencji. Należy zauważyć, że protokół koncentruje się na IPP, dlatego oczekuje się, że początkowa struktura będzie kompleksem dwóch podjednostek białkowych. Przed właściwym etapem dywersyfikacji sekwencji białko uważane za ligand jest przycinane do segmentu, który ma oddziaływać z białkiem receptorowym, a następnie jest traktowane jako peptyd. Jednak protokół może być również stosowany do kompleksów białkowo-peptydowych, w scenariuszu, w którym kroki 1.1-1.3 mogą nie być wymagane. Na etapie przygotowania (sekcja 1) konieczne jest również skorygowanie nieprawidłowo sformatowanych reszt i heteroatomów, a także modelowanie segmentów złożonej struktury istotnych dla docelowego miejsca wiązania, których nie można było prawidłowo rozwiązać. Poprawki te zależą od konkretnej badanej struktury i nie były wymagane dla struktury użytej jako przykład w niniejszym dokumencie.

Najbardziej krytycznymi krokami tego protokołu są te wykonywane za pomocą aplikacji Rosetta, które obejmują wstępne przepakowanie łańcuchów bocznych za pomocą FixBB (krok 2.1) i właściwą dywersyfikację sekwencji za pomocą Pepspec (krok 2.2). Ten początkowy etap przepakowywania, zwany wstępnym pakowaniem, jest wyraźnie wymieniony jako wymagany przez autorów Pepspec14. Chociaż może to być wykonane przez Pepspec, autorzy tej aplikacji zdecydowanie zalecają korzystanie z aplikacji FixBB, która została specjalnie zaprojektowana do optymalizacji rotamerów łańcucha bocznego w stałych szkieletach białkowych. Na etapie dywersyfikacji sekwencji ważne jest, aby wziąć pod uwagę, że aplikacja Pepspec jest zorientowana na projektowanie peptydów. W związku z tym domyślnie zgłasza kilku najlepiej ocenianych kandydatów na peptydy. Ponieważ celem przedstawionego tutaj protokołu jest wygenerowanie dużej liczby przypuszczalnych ligandów peptydowych, a nie kilku najlepiej punktowanych kandydatów, zmieniliśmy opcję "-pepspec:n_peptides" z 8 (domyślnie) na 200 (krok 2.2.1). Korzystając z tego ustawienia, Pepspec przewidział ponad 20 000 peptydów jako potencjalne ligandy. Ten zestaw przypuszczalnych peptydów zapewnił bardzo szeroki wgląd w krajobraz wiązania receptora, który następnie został pobrany pod kątem 20% najlepiej ocenianych peptydów w celu rzeczywistego oszacowania preferencji aminokwasów. Jeśli mniejsza liczba peptydów zostanie przekazana do "-pepspec:n_peptides", znacznie mniej kandydatów zostanie zaakceptowanych przez Pepspec. W tym scenariuszu próbkowanie zaproponowane w protokole może wychwycić wiele przypuszczalnych ligandów peptydowych o nieoptymalnych wynikach energetycznych, co potencjalnie może skutkować mniej wiarygodnymi szacunkami.

Jednym z głównych ograniczeń protokołu przedstawionego w tej pracy jest to, że opiera się on na wcześniejszej wiedzy na temat struktury białka zawierającego powierzchnię wiążącą. Jednak struktura ta niekoniecznie musi być określana doświadczalnie, ale może być modelowana ab initio lub przez modelowanie homologiczne14. Ponadto konieczna jest również znajomość trybu wiązania co najmniej jednej reszty aminokwasowej (kotwicy) ligandu peptydowego. Kotwica ta zostanie rozszerzona na określoną liczbę pozostałości za pomocą specjalnych opcji przedłużenia kotwicy firmy Pepspec w celu przeprowadzenia dywersyfikacji sekwencji. Jeżeli orientacja całego liganda w miejscu wiązania jest znana, jak ma to miejsce w przypadku reprezentatywnego przykładu tego badania, opcje związane z przedłużeniem kotwicy należy pozostawić jako domyślne (brak przedłużenia), chociaż reszta z peptydu musi być nadal określona jako kotwica, aby kierować algorytmem dywersyfikacji sekwencji. Aplikacja Pepspec nie obsługuje dokowania de novo możliwej pozostałości kotwicy, ale może wykorzystywać jako dane wejściowe dane wyjściowe innych aplikacji dokujących lub model homologicznego kompleksu białkowo-peptydowego do przeprowadzenia dokowania kotwicznego14; Chociaż te scenariusze wykraczają poza zakres tego artykułu.

Istotną wadą proponowanego protokołu jest jego nieodłączny predykcyjny charakter, na który bezpośredni wpływ ma rozdzielczość i dokładność początkowej struktury lub modelu kompleksu białko-białko. Jednak autorzy Pepspec stwierdzili, że dokładność tej aplikacji została znacznie poprawiona dzięki traktowaniu wejściowych współrzędnych szkieletowych jako zespołu struktur, a nie przy użyciu pojedynczej struktury białkowej i zastosowaniu normalizacji tła podczas obliczania PWM14. Co więcej, protokół stanowi alternatywę dla kłopotliwych i kosztownych metod eksperymentalnych do szacowania preferencji aminokwasów. Wszystkie te metody eksperymentalne opierają się na ocenie dużych bibliotek sekwencji uzyskanych przez wprowadzenie mutacji do sekwencji ligandów białkowych, a następnie na eksperymentalnej ocenie wpływu takich mutacji (patrz Bratulic i Badran12 w celu zapoznania się z przeglądem). Protokoły obliczeniowe, takie jak ten zaproponowany w tej pracy, pozwalają na badanie przesiewowe tysięcy przypuszczalnych ligandów peptydowych w bardzo efektywny sposób, potencjalnie zapewniając bardziej niezawodny zestaw do szacowania preferencji aminokwasowych 13,14,25. Proponowany przez nas protokół można zastosować do każdego IPP, który można zredukować do granicy faz białko-peptyd. Ponadto protokół ten może służyć jako wstępna strategia identyfikacji mediatorów IPP, takich jak potencjalne aktywatory lub inhibitory. Zidentyfikowane mediatory mogą być dalej wykorzystywane do badania tych IPP w laboratorium lub mogą być oceniane jako potencjalne środki terapeutyczne.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Podziękowania

Z wdzięcznością dziękujemy za wsparcie finansowe od Sistema Nacional de Investigación (SNI) (numery grantów SNI-043-2023 i SNI-170-2021), Secretaría Nacional de Ciencia, Tecnología e Innovación (SENACYT) z Panamy oraz Instituto para la Formación y Aprovechamiento de Recursos Humanos (IFARHU). Autorzy pragną podziękować dr Miguelowi Rodríguezowi za staranne przejrzenie manuskryptu.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
BUDE Alanine Scan ServerUniwersytet w Edynburguhttps://pragmaticproteindesign.bio.ed.ac.uk/balas/doi: 10.1021/acschembio.9b00560
Rosetta Modeling SoftwareRosetta Commonshttps://www.rosettacommons.org/softwaredoi: 10.1002/prot.22851
UCSF ChimeraUniwersytet Kalifornijski San Franciscohttps://www.cgl.ucsf.edu/chimera/doi: 10.1002/ JCC.20084

Bibliografia

  1. Kim, P. M., Lu, L. J., Xia, Y., Gerstein, M. B. Relating three-dimensional structures to protein networks provides evolutionary insights. Science. 314 (5807), 1938-1941 (2006).
  2. Schreiber, G., Keating, A. E. Protein binding specificity versus promiscuity. Current Opinion in Structural Biology. 21 (1), 50-61 (2011).
  3. Erijman, A., Aizner, Y., Shifman, J. M. Multispecific recognition: Mechanism, evolution, and design. Biochemistry. 50 (5), 602-611 (2011).
  4. Fromer, M., Shifman, J. M. Tradeoff between stability and multispecificity in the design of promiscuous proteins. PLoS Computational Biology. 5 (12), e1000627(2009).
  5. Xie, T., Zmyslowski, A. M., Zhang, Y., Radhakrishnan, I. Structural basis for multispecificity of MRG domains. Structure. 23 (6), London, England. 1049-1057 (2015).
  6. Hendler, A., et al. Human SIRT1 multispecificity is modulated by active-site vicinity substitutions during natural evolution. Molecular Biology and Evolution. 38 (2), 545-556 (2021).
  7. Teilum, K., Olsen, J. G., Kragelund, B. B. On the specificity of protein-protein interactions in the context of disorder. The Biochemical Journal. 478 (11), 2035-2050 (2021).
  8. Pelay-Gimeno, M., Glas, A., Koch, O., Grossmann, T. N. Structure-based design of inhibitors of protein-protein interactions: Mimicking peptide binding epitopes. Angewandte Chemie (International ed. in English). 54 (31), 8896-8927 (2015).
  9. Wang, Y., Xue, P., Cao, M., Yu, T., Lane, S. T., Zhao, H. Directed evolution: Methodologies and applications. Chemical Reviews. 121 (20), 12384-12444 (2021).
  10. Liu, J., Cropp, T. A. Rational protein sequence diversification by multi-codon scanning mutagenesis. Methods in Molecular Biology. 978, 217-228 (2013).
  11. Wei, H., Li, X. Deep mutational scanning: A versatile tool in systematically mapping genotypes to phenotypes. Frontiers in Genetics. 14, 1087267(2023).
  12. Bratulic, S., Badran, A. H. Modern methods for laboratory diversification of biomolecules. Current Opinion in Chemical Biology. 41, 50-60 (2017).
  13. Humphris, E. L., Kortemme, T. Prediction of protein-protein interface sequence diversity using flexible backbone computational protein design. Structure. 16 (12), 1777-1788 (2008).
  14. King, C. A., Bradley, P. Structure-based prediction of protein-peptide specificity in Rosetta. Proteins. 78 (16), 3437-3449 (2010).
  15. Ibarra, A. A., et al. Predicting and experimentally validating hot-spot residues at protein-protein interfaces. ACS Chemical Biology. 14 (10), 2252-2263 (2019).
  16. Chen, W., Srinath, H., Lam, S. S., Schiffer, C. A., Royer, W. E., Lin, K. Contribution of Ser386 and Ser396 to activation of interferon regulatory factor 3. Journal of Molecular Biology. 379 (2), 251-260 (2008).
  17. Mancino, A., Natoli, G. Specificity and function of IRF family transcription factors: Insights from genomics. Journal of Interferon & Cytokine Research. 36 (7), 462-469 (2016).
  18. Schwanke, H., Stempel, M., Brinkmann, M. M. Of keeping and tipping the balance: Host regulation and viral modulation of IRF3-dependent IFNB1 expression. Viruses. 12 (7), 33(2020).
  19. Chen, W., et al. Insights into interferon regulatory factor activation from the crystal structure of dimeric IRF5. Nature Structural & Molecular Biology. 15 (11), 1213-1220 (2008).
  20. Pettersen, E. F., et al. UCSF Chimera-A visualization system for exploratory research and analysis. Journal of Computational Chemistry. 25, 1605-1612 (2004).
  21. Crooks, G. E., Hon, G., Chandonia, J. -M., Brenner, S. E. WebLogo: a sequence logo generator. Genome Research. 14 (6), 1188-1190 (2004).
  22. Panne, D., McWhirter, S. M., Maniatis, T., Harrison, S. C. Interferon regulatory factor 3 is regulated by a dual phosphorylation-dependent switch. The Journal of Biological Chemistry. 282 (31), 22816-22822 (2007).
  23. Weihrauch, D., et al. An IRF5 decoy peptide reduces myocardial inflammation and fibrosis and improves endothelial cell function in tight-skin mice. PloS One. 11 (4), e0151999(2016).
  24. Mori, M., Yoneyama, M., Ito, T., Takahashi, K., Inagaki, F., Fujita, T. Identification of Ser-386 of interferon regulatory factor 3 as critical target for inducible phosphorylation that determines activation. The Journal of Biological Chemistry. 279 (11), 9698-9702 (2004).
  25. Smith, C. A., Kortemme, T. Predicting the tolerated sequences for proteins and protein interfaces using RosettaBackrub flexible backbone design. PloS One. 6 (7), e20451(2011).
  26. Rubenstein, A. B., Pethe, M. A., Khare, S. D. MFPred: Rapid and accurate prediction of protein-peptide recognition multispecificity using self-consistent mean field theory. PLoS Computational Biology. 13 (6), e1005614(2017).

Przedruki i uprawnienia

Tagi

Dywersyfikacja sekwencjiskanowanie alaninoweRosetta Pepspecmacierz wag pozycyjnychlogo sekwencyjnewiązanie IRF5