Jednym z podejść do odkrywania interakcji białek jest test 2-hybrydowy (Y2H) drożdży, który wykorzystuje zmodyfikowane komórki drożdży, które rosną tylko wtedy, gdy interesujące białko wiąże się z fragmentem oddziałującego partnera1. Wykrywanie wielu interakcji Y2H można teraz wykonać za pomocą masowego równoległego sekwencjonowania o wysokiej przepustowości. Opisano kilka formatów2,3,4,5, w tym jeden, który opracowaliśmy, gdzie populacje są hodowane w partiach w warunkach, które selekcjonują drożdże zawierające plazmidy, które wytwarzają dodatnią interakcję Y2H6. Opracowany przez nas przepływ pracy, nazwany DEEPN (Dynamic Enrichment for Evaluation of Protein Networks), identyfikuje zróżnicowane interakttomy z tych samych bibliotek ofiar w celu zidentyfikowania białek, które oddziałują z jednym białkiem (lub domeną) w porównaniu z jednym białkiem. inne białko lub konformacyjnie odrębną zmutowaną domenę. Jednym z głównych etapów tego przepływu pracy jest właściwe przetwarzanie i analiza danych sekwencjonowania DNA. Niektóre informacje można uzyskać, po prostu licząc liczbę odczytów dla każdego genu zarówno przed, jak i po selekcji interakcji Y2H w sposób analogiczny do eksperymentu z sekwencją RNA. Jednak z tych zbiorów danych można uzyskać znacznie bardziej szczegółowe informacje, w tym informacje na temat subdomeny danego białka, które jest zdolne do wytwarzania interakcji Y2H. Ponadto, mimo że podejście opracowane w ramach projektu DEEPN jest cenne, analiza wielu powtórzeń próbek może być kłopotliwa i kosztowna. Problem ten został rozwiązany dzięki zastosowaniu modelu statystycznego, który został opracowany specjalnie dla zestawów danych DEEPN, w których liczba powtórzeń jest ograniczona6. Aby przetwarzanie i analiza zestawów danych sekwencjonowania DNA były niezawodne, kompletne, solidne i dostępne dla badaczy bez wiedzy bioinformatycznej, opracowaliśmy pakiet programów, które obejmują wszystkie etapy analizy.
Ten zestaw samodzielnych programów, które działają na komputerach stacjonarnych, obejmuje MAPster, DEEPN i Stat_Maker. MAPster to graficzny interfejs użytkownika, który umożliwia każdemu plikowi fastq kolejkowanie do mapowania do genomu za pomocą HISAT2 program7, tworząc standardowy plik .sam do użytku w dalszych aplikacjach. DEEPN składa się z kilku modułów. Przypisuje i zlicza odczyty odpowiadające poszczególnym genom, podobnie jak w przypadku kwantyfikacji typu sekwencyjnego RNA za pomocą modułu "Liczba genów". Wyodrębnia również sekwencje odpowiadające złączu między domeną transkrypcyjną Gal4 a sekwencją ofiary i zestawia położenie tych połączeń, aby umożliwić ich inspekcję za pomocą tabel porównawczych i wykresów (przy użyciu modułu "Junction_Make") Moduł "Blast_Query" umożliwia łatwą kontrolę, kwantyfikację i porównanie sekwencji złączy Gal4 złącza. Stat_Maker ocenia statystycznie odczyty danych dotyczących wzbogacania genów jako sposób na ustalenie priorytetów prawdopodobnych trafień Y2H. Tutaj opisujemy, jak korzystać z tych programów i w pełni analizować dane sekwencji DNA z eksperymentu DEEPN Y2H. Wersje DEEPN są dostępne do uruchomienia na komputerach PC, Mac i systemach Linux. Inne programy, takie jak program do mapowania MAPster i moduł statystyk DEEPN, Stat_Maker polegać na podprogramach działających w systemie Unix i są dostępne tylko w systemach Mac i Linux.