$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Tutaj opisujemy wysokoprzepustową metodę budowy i wyboru bibliotek złożonych i rozpuszczalnych domen białkowych z dowolnego źródła początkowego genicznego/genomowego. Podejście to łączy w sobie trzy różne technologie: wyświetlanie fagów, wykorzystanie składanego reportera i sekwencjonowanie nowej generacji (NGS) ze specjalnym narzędziem internetowym do analizy danych. Metody te mogą być stosowane w wielu różnych kontekstach badań opartych na białkach, do identyfikacji i adnotacji nowych białek/domen białkowych, charakterystyki właściwości strukturalnych i funkcjonalnych znanych białek, a także definiowania sieci interakcji białkowych.
Wiele otwartych pytań jest nadal obecnych w badaniach opartych na białkach, a rozwój metod optymalnej produkcji białka jest ważną potrzebą dla kilku dziedzin badań. Na przykład, pomimo dostępności tysięcy genomów prokariotycznych i eukariotycznych1, dla zdecydowanej większości organizmów nadal brakuje odpowiedniej mapy względnych proteomów z bezpośrednią adnotacją kodowanych białek i peptydów. Katalog kompletnych proteomów jawi się jako ambitny cel, wymagający ogromnego wysiłku pod względem czasu i zasobów. Złotym standardem w adnotacji eksperymentalnej pozostaje klonowanie wszystkich otwartych ramek odczytu (ORF) genomu, budując tak zwany "ORFeome". Zazwyczaj funkcja genu jest przypisywana na podstawie homologii do pokrewnych genów o znanej aktywności, ale to podejście jest słabo dokładne ze względu na obecność wielu nieprawidłowych adnotacji w referencyjnych bazach danych2,3,4,5. Co więcej, nawet w przypadku białek, które zostały zidentyfikowane i oznaczone, wymagane są dodatkowe badania, aby uzyskać charakterystykę pod względem liczebności, wzorców ekspresji w różnych kontekstach, w tym właściwości strukturalnych i funkcjonalnych, a także sieci interakcji.
Ponadto, ponieważ białka składają się z różnych domen, z których każda wykazuje specyficzne cechy i inaczej przyczynia się do funkcji białek, badanie i dokładna definicja tych domen może pozwolić na uzyskanie bardziej wszechstronnego obrazu, zarówno na poziomie pojedynczego genu, jak i na poziomie pełnego genomu. Wszystkie te niezbędne informacje sprawiają, że badania oparte na białkach są szeroką i wymagającą dziedziną.
Z tego punktu widzenia, ważnym wkładem mogłyby być bezstronne i wysokoprzepustowe metody produkcji białka. Jednak powodzenie takich podejść, oprócz wymaganych znacznych inwestycji, zależy od zdolności do produkcji rozpuszczalnych/stabilnych konstruktów białkowych. Jest to główny czynnik ograniczający, ponieważ szacuje się, że tylko około 30% białek może być z powodzeniem wyrażanych i wytwarzanych na wystarczających poziomach, aby były eksperymentalnie użyteczne6,7,8. Podejście mające na celu przezwyciężenie tego ograniczenia opiera się na wykorzystaniu losowo pofragmentowanego DNA do produkcji różnych polipeptydów, które razem zapewniają nakładającą się reprezentację fragmentów poszczególnych genów. Tylko niewielki procent losowo wygenerowanych fragmentów DNA to funkcjonalne ORF, podczas gdy zdecydowana większość z nich jest niefunkcjonalna (ze względu na obecność kodonów stop w ich sekwencjach) lub koduje nienaturalne (ORF w ramce innej niż oryginalna) polipeptydy bez znaczenia biologicznego.
Aby rozwiązać wszystkie te problemy, nasza grupa opracowała wysokoprzepustową platformę do analizy ekspresji i interakcji białek, która może być używana w skali genomicznej9,10,11,12. Platforma ta integruje następujące techniki: 1) metodę selekcji zbiorów prawidłowo sfałdowanych domen białkowych z kodującej części DNA z dowolnego organizmu; 2) technologia wyświetlania fagów do wyboru partnerów interakcji; 3) NGS w celu pełnego scharakteryzowania całego badanego interaktomii i zidentyfikowania klonów będących przedmiotem zainteresowania; oraz 4) narzędzie internetowe do analizy danych dla użytkowników bez żadnych umiejętności bioinformatycznych lub programistycznych, aby przeprowadzić analizę Interactome-Seq w łatwy i przyjazny dla użytkownika sposób.
Korzystanie z tej platformy oferuje ważne korzyści w porównaniu z alternatywnymi strategiami badawczymi; przede wszystkim metoda jest całkowicie bezstronna, wysokoprzepustowa i modułowa do badań od pojedynczego genu do całego genomu. Pierwszym krokiem jest stworzenie biblioteki z losowo pofragmentowanego badanego DNA, które jest następnie głęboko charakteryzowane przez NGS. Biblioteka ta jest generowana przy użyciu zmodyfikowanego wektora, w którym geny/fragmenty będące przedmiotem zainteresowania są klonowane między sekwencją sygnałową do wydzielania białka do przestrzeni peryplazmatycznej (tj. liderem Sec) a genem TEM1 β-laktamazy. Białko fuzyjne zapewni oporność na ampicylinę i zdolność do przetrwania pod ciśnieniem ampicyliny tylko wtedy, gdy sklonowane fragmenty znajdują się w ramce z obydwoma tymi elementami, a powstałe białko fuzyjne jest prawidłowo złożone10,13,14. Wszystkie klony uratowane po selekcji antybiotykowej, tak zwane "przefiltrowane klony", są ORFami i zdecydowana większość z nich (ponad 80%) pochodzi z prawdziwych genów9. Co więcej, siła tej strategii polega na odkryciach, że wszystkie klony przefiltrowane przez ORF kodują prawidłowo złożone/rozpuszczalne białka/domeny15. Ponieważ wiele klonów, obecnych w bibliotece i mapujących w tym samym regionie/domenie, ma różne punkty początkowe i końcowe, pozwala to na bezstronną, jednoetapową identyfikację minimalnych fragmentów, które mogą skutkować rozpuszczalnymi produktami.
Dalsze ulepszenie technologii jest możliwe dzięki zastosowaniu NGS do scharakteryzowania biblioteki. Połączenie tej platformy i specjalnego narzędzia internetowego do analizy danych dostarcza ważnych, bezstronnych informacji na temat dokładnych sekwencji nukleotydów oraz lokalizacji wybranych ORF na badanym referencyjnym DNA bez konieczności dalszych obszernych analiz lub wysiłków eksperymentalnych.
Biblioteki domenomowe mogą być przeniesione do kontekstu wyboru i używane jako uniwersalne narzędzie do przeprowadzania badań funkcjonalnych. Wysokoprzepustowa platforma do analizy ekspresji i interakcji białek, którą zintegrowaliśmy i którą nazwaliśmy Interactome-Seq, wykorzystuje technologię wyświetlania fagów, przenosząc przefiltrowany ORF do wektora fagowego i tworząc bibliotekę fagów-ORF. Po ponownym sklonowaniu do kontekstu wyświetlania faga, domeny białkowe są wyświetlane na powierzchni cząstek M13; W ten sposób biblioteki domenomowe mogą być bezpośrednio selekcjonowane pod kątem fragmentów genów kodujących domeny o określonych aktywnościach enzymatycznych lub właściwościach wiązania, co pozwala na profilowanie sieci interaktomowych. Podejście to zostało początkowo opisane przez Zacchi i wsp.16 i później używane w kilku innych kontekstach13,17,18.
W porównaniu z innymi technologiami używanymi do badania interakcji białko-białko (w tym drożdże dwa hybrydowe systemy i spektrometria masowa19,20), jedną z głównych zalet jest wzmocnienie partnera wiążącego, które występuje podczas wielu rund selekcji fagów. Zwiększa to czułość selekcyjną, umożliwiając w ten sposób identyfikację domen białek wiążących o niskiej obfitości obecnych w bibliotece. Efektywność selekcji przeprowadzanej za pomocą biblioteki filtrowanej przez ORF jest dodatkowo zwiększona ze względu na brak niefunkcjonalnych klonów. Wreszcie, technologia pozwala na przeprowadzenie selekcji zarówno w odniesieniu do przynęt białkowych, jak i niebiałkowych21,22,23,24,25.
Selekcja fagów przy użyciu biblioteki domainome-phage może być przeprowadzona przy użyciu przeciwciał pochodzących z surowic pacjentów z różnymi stanami patologicznymi, np. chorobami autoimmunologicznymi13, rak lub choroby infekcyjne jako przynęta. Podejście to służy do uzyskania tzw. "sygnatury przeciwciał" badanej choroby, co pozwala na masową identyfikację i charakterystykę antygenów/epitopów specyficznie rozpoznawanych przez przeciwciała pacjentów w tym samym czasie. W porównaniu z innymi metodami, zastosowanie wyświetlania fagów pozwala na identyfikację zarówno liniowych, jak i konformacyjnych epitopów antygenowych. Identyfikacja konkretnej sygnatury może potencjalnie mieć istotny wpływ na zrozumienie patogenezy, projektowania nowych szczepionek, identyfikacji nowych celów terapeutycznych oraz opracowania nowych i specyficznych narzędzi diagnostycznych i prognostycznych. Co więcej, gdy badanie koncentruje się na chorobach zakaźnych, główną zaletą jest to, że odkrycie białek immunogennych jest niezależne od hodowli patogenów.
Nasze podejście potwierdza, że składane reportery mogą być używane na skali genomowej do wyboru "domenomu": zbioru poprawnie złożonych, dobrze wyrażonych, rozpuszczalnych domen białkowych z kodującej części DNA i/lub cDNA z dowolnego organizmu. Po wyizolowaniu fragmenty białka są przydatne do wielu celów, dostarczając niezbędnych informacji eksperymentalnych do adnotacji genów, a także do badań strukturalnych, mapowania epitopów przeciwciał, identyfikacji antygenów itp. Kompletność danych o wysokiej przepustowości dostarczanych przez NGS umożliwia analizę bardzo złożonych próbek, takich jak biblioteki wyświetlania fagów, i ma potencjał do obejścia tradycyjnego pracochłonnego wybierania i testowania pojedynczych klonów uratowanych przez fagi.
Jednocześnie, dzięki cechom filtrowanej biblioteki oraz ekstremalnej czułości i mocy analizy NGS, możliwe jest zidentyfikowanie domeny białkowej odpowiedzialnej za każdą interakcję bezpośrednio w początkowym ekranie, bez potrzeby tworzenia dodatkowych bibliotek dla każdego związanego białka. NGS pozwala na uzyskanie kompleksowej definicji całego domomu dowolnego źródła wyjściowego genów/genomu, a narzędzie internetowe do analizy danych umożliwia uzyskanie wysoce specyficznej charakterystyki zarówno z jakościowego, jak i ilościowego punktu widzenia domen białek interaktomowych.