$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
UWAGA: W tym protokole, użycie JUMPn jest zilustrowane wykorzystaniem opublikowanego zestawu danych profilowania całego proteomu podczas różnicowania limfocytów B, określonego ilościowo za pomocą odczynnika do etykiet izobarycznych TMT27.
1. Konfiguracja oprogramowania JUMPn
UWAGA: Dostępne są dwie opcje konfiguracji oprogramowania JUMPn: (i) instalacja na komputerze lokalnym do użytku osobistego; oraz (ii) wdrożenie JUMPn na zdalnym serwerze Shiny dla wielu użytkowników. W przypadku instalacji lokalnej wystarczy komputer osobisty z dostępem do Internetu i ≥4 GB pamięci RAM, aby uruchomić analizę JUMPn dla zestawu danych o małej wielkości próby (n < 30); do analizy dużych kohort potrzebna jest większa pamięć RAM (np. 16 Gb) (np. n = 200 próbek).
- Zainstaluj oprogramowanie na komputerze lokalnym. Po instalacji zezwól przeglądarce internetowej na uruchomienie JUMPn i pozwól analizie uruchomić się na komputerze lokalnym.
- Zainstaluj anaconda42 lub miniconda43 postępując zgodnie z instrukcjami online.
- Pobierz kod źródłowy JUMPn41. Kliknij dwukrotnie, aby rozpakować pobrany plik JUMPn_v_1.0.0.zip; Zostanie utworzony nowy folder o nazwie JUMPn_v_1.0.0.
- Otwórz terminal wiersza poleceń. W systemie Windows użyj wiersza polecenia Anaconda. W systemie MacOS użyj wbudowanej aplikacji Terminal.
- Utwórz środowisko JUMPn Conda: Pobierz ścieżkę bezwzględną folderu JUMPn_v_1.0.0 (np. /path/to/JUMPn_v_1.0.0). Aby utworzyć i aktywować puste środowisko Conda, wpisz następujące polecenia w terminalu
conda create -p /ścieżka/do/JUMPn_v_1.0.0/JUMPn -y
conda activate /ścieżka/do/JUMPn_v_1.0.0/JUMPn
- Zainstaluj zależności JUMPn: Zainstaluj R (na terminalu wpisz conda install -c conda-forge r=4.0.0 -y), zmień bieżący katalog na folder JUMPn_v_1.0.0 (w terminalu wpisz cd path/to/JUMPn_v_1.0.0) i zainstaluj pakiety zależności (w terminalu wpisz Rscript bootstrap. R)
- Uruchom JUMPn w przeglądarce internetowej: Zmień bieżący katalog na folder wykonania (w terminalu wpisz cd execution) i uruchom JUMPn (na terminalu wpisz R -e "shiny::runApp()")
- Po wykonaniu powyższej czynności na ekranie terminala pojawi się Nasłuchiwanie na http://127.0.0.1:XXXX (tutaj XXXX oznacza 4 losowe liczby). Skopiuj i wklej http://127.0.0.1:XXXX do przeglądarki internetowej, na której pojawi się strona powitalna JUMPn (Rysunek 2).
- Wdrożenie na błyszczącym serwerze. Przykładami serwerów Shiny Server są komercyjne serwery shinyapps.io lub dowolne serwery Shiny obsługiwane przez instytucję.
- Pobierz i zainstaluj program RStudio zgodnie z instrukcją44.
- Uzyskaj uprawnienie do wdrożenia serwera Shiny Server. W przypadku serwera shinyapps.io skonfiguruj konto użytkownika, postępując zgodnie z instrukcją45. W przypadku instytucjonalnego serwera Shiny skontaktuj się z administratorem serwera, aby poprosić o uprawnienia.
- Pobierz kod źródłowy JUMPn41 na komputer lokalny; instalacja nie jest konieczna. Otwórz jeden z serwerów. R lub ui. R w programie RStudio i kliknij menu rozwijane Publikuj na serwerze w prawym górnym rogu środowiska IDE programu RStudio.
- W panelu Publikuj na koncie wpisz adres serwera. Naciśnij przycisk Opublikuj. Pomyślne wdrożenie jest weryfikowane po automatycznym przekierowaniu z programu RStudio do serwera RShiny, na którym wdrożono aplikację.
2. Pokaz z wykorzystaniem przykładowego zestawu danych
UWAGA: JUMPn oferuje wersję demonstracyjną z wykorzystaniem opublikowanego zestawu danych proteomiki komórek B. Przebieg demonstracyjny ilustruje usprawniony przepływ pracy, który przyjmuje macierz kwantyfikacyjną białek o zróżnicowanej ekspresji jako dane wejściowe i sekwencyjnie przeprowadza grupowanie koekspresji, wzbogacanie szlaków i analizę sieci PPI.
- Na stronie głównej JUMPn (Rysunek 2) kliknij przycisk Rozpocznij analizę, aby rozpocząć analizę JUMPn.
- W lewym dolnym rogu strony Rozpocznij Analizę (Rysunek 3) kliknij przycisk Prześlij dane proteomiczne komórek B w wersji demonstracyjnej; pojawi się okno dialogowe informujące o powodzeniu przesyłania danych.
- W prawym dolnym rogu strony kliknij przycisk Prześlij analizę JUMPn, aby rozpocząć uruchomienie demonstracyjne przy użyciu parametrów domyślnych; pojawi się pasek postępu, który wskazuje przebieg analizy. Poczekaj, aż pasek postępu się wypełni (oczekiwane 3 minuty).
- Po zakończeniu przebiegu pokazu pojawi się okno dialogowe z komunikatem o powodzeniu uruchomienia i bezwzględną ścieżką do folderu wyników. Kliknij Przejdź do wyników, aby kontynuować.
- Strona internetowa najpierw poprowadzi użytkownika do wyników klastra koekspresji według WGCNA. Kliknij Wyświetl wyniki w oknie dialogowym, aby kontynuować.
- Znajdź wzorce koekspresji białek po lewej stronie Strona wyników 1: Strona wyjściowa WGCNA. Kliknij pole rozwijane Wybierz format wyrażenia, aby nawigować między dwoma formatami wykresów:
- Wybierz opcję Trendy, aby wyświetlić wykres trendów, przy czym każda linia reprezentuje liczebność poszczególnych białek w próbkach. Kolor każdej linii oznacza, jak blisko wzorca wyrażenia znajduje się konsensus klastra koekspresji (tj. "eigengene" zgodnie z definicją algorytmu WGCNA).
- Wybierz opcję Wykres skrzynkowy, aby wyświetlić wzorce współwyrażeń w formacie wykresu skrzynkowego dla każdej próbki.
- Wyświetl mapę cieplną wzbogacania ścieżki/ontologii po prawej stronie strony wyjściowej WGCNA. Najbardziej wzbogacone ścieżki dla każdej grupy są wyświetlane razem na mapie cieplnej, przy czym intensywność koloru odzwierciedla skorygowaną wartość p Benjaminiego-Hochberga.
- Przewiń stronę w dół, aby wyświetlić wzorzec ekspresji dla poszczególnych białek.
- Użyj listy rozwijanej Wybierz klaster koekspresji, aby wyświetlić białka z każdego klastra (wartość domyślna to Klaster 1). Wybierz określone białko w tabeli, na podstawie którego wykres słupkowy pod tabelą zostanie automatycznie zaktualizowany, aby odzwierciedlić jego obfitość w białko
.
- Wyszukaj określone nazwy białek za pomocą pola wyszukiwania po prawej stronie tabeli.
- Aby wyświetlić wyniki PPI, kliknij na Strona wyników 2: Wyjście PPI u góry.
- Kliknij pozycję Wybierz klaster współwyrażenia, aby wyświetlić wyniki dla określonego klastra współwyrażeń (wartość domyślna to klaster 1). Ekrany wszystkich paneli figur na tej stronie zostaną zaktualizowane dla nowo wybranego klastra.
- Wyświetl sieci PPI dla wybranego klastra koekspresji na lewym panelu rysunku:
- Kliknij listę rozwijaną Wybierz według grupy, aby wyróżnić poszczególne moduły PPI w sieci. Kliknij listę rozwijaną Wybierz format układu sieciowego, aby zmienić układ sieci (domyślnie jest to Fruchterman Reingold).
- Użyj myszy i gładzika, aby wykonać kroki 2.11.3-2.11.5.
- W razie potrzeby powiększ lub pomniejsz sieć PPI. Nazwy genów każdego węzła w sieci zostaną pokazane po wystarczającym powiększeniu.
- Po powiększeniu wybierz i kliknij określone białko, aby podświetlić to białko i jego sąsiadów w sieci.
- Przeciągnij określony węzeł (białko) w sieci, aby zmienić jego położenie w układzie; w ten sposób układ sieci może zostać zreorganizowany przez użytkownika.
- W prawym panelu strony wyników PPI wyświetl informacje na poziomie klastra współwyrażenia, które pomagają w interpretacji wyników PPI:
- Domyślnie wyświetla wzorzec współwyrażenia wybranego klastra jako wykres skrzynkowy.
- Kliknij pole rozwijane Wybierz format wyrażenia, aby uzyskać więcej informacji lub wyświetlić ekrany, jak wspomniano w krokach 2.12.3-2.12.5.
- Wybierz pozycję Trendy, aby wyświetlić wykres trendów dla wzorca współwyrażenia.
- Wybierz opcję Wykres słupkowy ścieżki, aby wyświetlić znacznie wzbogacone ścieżki dla klastra koekspresji.
- Wybierz opcję Wykres kołowy ścieżki, aby wyświetlić znacznie wzbogacone ścieżki dla klastra współwyrażeń w formacie wykresu kołowego.
- Przewiń w dół stronę internetową Strona wyników 2: Wyjście PPI, aby wyświetlić wyniki na poziomie poszczególnych modułów PPI. Kliknij listę rozwijaną Wybierz moduł, aby wybrać określony moduł PPI do wyświetlenia (Klaster 1: Moduł 1 jest wyświetlany domyślnie).
- Wyświetl moduł PPI na lewym panelu. Aby manipulować wyświetlaczem sieciowym, wykonaj kroki 2.11.2-2.11.5.
- Wyświetl wyniki wzbogacania ścieżki/ontologii w prawym panelu. Kliknij listę rozwijaną Wybierz styl adnotacji ścieżki, aby uzyskać więcej informacji i wyświetlić następujące informacje:
- Wybierz opcję Barplot, aby wyświetlić znacznie wzbogacone ścieżki dla wybranego modułu PPI.
- Wybierz opcję Wykres kołowy, aby wyświetlić znacznie wzbogacone ścieżki dla wybranego modułu PPI w formacie wykresu kołowego.
- Wybierz opcję Mapa cieplna, aby wyświetlić znacznie wzbogacone szlaki i powiązane nazwy genów z wybranego modułu PPI.
- Wybierz opcję Tabela, aby wyświetlić szczegółowe wyniki wzbogacania szlaków, w tym nazwy ścieżek/terminów ontologicznych, nazwy genów i wartość P według dokładnego testu Fishera.
- Wyświetl tabelę publikacji w formacie arkusza kalkulacyjnego: postępuj zgodnie ze ścieżką bezwzględną (wydrukowaną na górze obu stron wyników) i znajdź tabelę arkusza kalkulacyjnego publikacji o nazwie ComprehensiveSummaryTables.xlsx.
3. Przygotowanie pliku wejściowego i przesłanie go do JUMPn
UWAGA: JUMPn przyjmuje jako dane wejściowe matrycę kwantyfikacyjną białek o zróżnicowanej ekspresji (metoda nadzorowana) lub najbardziej zmiennych białek (metoda nienadzorowana). Jeśli celem projektu jest zrozumienie białek zmieniających się w wielu warunkach (np. różne grupy chorób lub analiza szeregów czasowych procesu biologicznego), preferowana jest nadzorowana metoda przeprowadzania analizy DE; W przeciwnym razie do celów eksploracyjnych można zastosować nienadzorowane podejście polegające na selekcji najbardziej zmiennych białek.
- Wygeneruj tabelę kwantyfikacji białka, z każdym białkiem jako wierszami, a każdą próbką jako kolumnami. Osiągnij to za pomocą nowoczesnego pakietu oprogramowania proteomicznego opartego na spektrometrii mas (np. JUMP suite13,14,39, Proteome Discoverer, Maxquant15,46).
- Zdefiniuj zmienny proteom.
- Wykorzystaj wyniki analizy statystycznej dostarczone przez pakiet oprogramowania proteomicznego, aby zdefiniować białka o zróżnicowanej ekspresji (DE) (na przykład ze skorygowaną wartością p < 0,05).
- Alternatywnie, użytkownicy mogą postępować zgodnie z przykładowym kodem R47, aby zdefiniować DE lub większość zmiennych białek.
- Sformatuj plik wejściowy przy użyciu zdefiniowanej zmiennej proteome.
UWAGA: Wymagany format pliku wejściowego (Rysunek 4) zawiera wiersz nagłówka; kolumny zawierają akcesję białka (lub wszelkie niepowtarzalne identyfikatory), GN (oficjalne symbole genów), opis białka (lub wszelkie informacje dostarczone przez użytkownika), a następnie oznaczanie ilościowe białek w poszczególnych próbkach.
- Postępuj zgodnie z kolejnością kolumn określoną w kroku 3.1, ale nazwy kolumn nagłówka są elastyczne dla użytkownika.
- W przypadku TPT (lub podobnego) określonego ilościowo proteomu należy użyć podsumowanej intensywności reportera TMT jako wejściowych wartości ilościowych. W przypadku danych bez znaczników należy użyć znormalizowanych liczb widmowych (np. NSAF48) lub metody opartej na intensywności (np. intensywność LFQ lub intensywność białka iBAQ zgłoszona przez Maxquant46).
- Brakujące wartości są dozwolone w analizie JUMPn. Upewnij się, że oznaczyłeś je jako NA w matrycy kwantyfikacji. Zaleca się jednak stosowanie wyłącznie białek z kwantyfikacją w ponad 50% próbek.
- Zapisz wynikowy plik wejściowy w formacie .txt, .xlsx lub .csv (wszystkie trzy są obsługiwane przez JUMPn).
- Prześlij plik wejściowy:
- Kliknij przycisk Przeglądarka i wybierz plik wejściowy (Rysunek 3, lewy panel); format pliku (obsługiwane są xlsx, csv i txt) zostanie automatycznie wykryty.
- Jeśli plik wejściowy zawiera wartości kwantyfikacji podobne do intensywności (np. te wygenerowane przez JUMP suite39) lub podobne do ilorazów (np. z Proteome Discoverer), wybierz Tak dla opcji Wykonaj transformację log2 danych; w przeciwnym razie dane mogły już zostać przekształcone logarytmicznie, więc wybierz opcję Nie dla tej opcji.
4. Analiza grupowania w koekspresji
UWAGA: Nasza grupa25,26,27 i inni28,29,31 udowodniły, że WGCNA49 jest skuteczną metodą analizy klastrów koekspresji w proteomice ilościowej. JUMPn postępuje zgodnie z 3-etapową procedurą analizy WGCNA25,50: (i) wstępna definicja klastrów genów/białek o koekspresji przez dynamiczne wycinanie drzew51 na podstawie topologicznej macierzy nakładania się (TOM; określona na podstawie ilościowych podobieństw między genami/białkami); (ii) łączenie podobnych klastrów w celu zmniejszenia redundancji (w oparciu o dendrogram podobieństw własnych); oraz (iii) ostateczne przypisanie genów/białek do każdego klastra, które przekraczają minimalną granicę korelacji Pearsona.
- Skonfiguruj parametry WGCNA (Rysunek 3, środkowy panel). Następujące trzy parametry sterują odpowiednio trzema krokami:
- Ustaw minimalny rozmiar klastra na 30. Ten parametr określa minimalną liczbę białek wymaganych dla każdego klastra koekspresji w początkowym etapie (i) hybrydowego dynamicznego cięcia drzew opartego na TOM. Im większa wartość, tym mniejsza liczba klastrów zwracanych przez algorytm.
- Ustaw minimalną odległość między klastrami na 0,2. Zwiększenie tej wartości (np. z 0,2-0,3) może spowodować więcej scalania klastrów w kroku (ii), co skutkuje mniejszą liczbą klastrów.
- Ustaw minimalną wartość kME na 0,7. Białka zostaną przypisane do najbardziej skorelowanego klastra zdefiniowanego w kroku (ii), ale tylko białka z korelacją Pearsona przekraczającą ten próg zostaną zachowane. Białka, które ulegną uszkodzeniu na tym etapie, nie zostaną przypisane do żadnego klastra ("NA" dla białek, które uległy uszkodzeniu w raporcie końcowym).
- Rozpocznij analizę. Istnieją dwa sposoby przesyłania analizy grupowania współwyrażeń:
- Kliknij przycisk Prześlij analizę JUMPn w prawym dolnym rogu, aby automatycznie rozpocząć kompleksową analizę WGCNA, a następnie analizę sieci PPI.
- Alternatywnie, wybierz wykonanie tylko kroku WGCNA (szczególnie w celu dostrajania parametrów; patrz kroki 4.2.3-4.2.4):
- Kliknij przycisk Parametry zaawansowane u dołu strony Rozpocznij analizę; pojawi się nowe okno parametrów. W dolnym widżecie wybierz Tryb analizy, wybierz Tylko WGCNA, a następnie kliknij Odrzuć, aby kontynuować.
- Na stronie Rozpocznij analizę kliknij przycisk Prześlij analizę JUMPn.
- W każdym z powyższych przypadków po przesłaniu analizy pojawi się pasek postępu.
UWAGA: Po zakończeniu analizy (zwykle < 1 minutę w przypadku analizy tylko WGCNA i <3 minuty w przypadku analizy kompleksowej) pojawi się okno dialogowe z komunikatem o powodzeniu uruchomienia i bezwzględną ścieżką do folderu wyników.
- Przeanalizuj wyniki WGCNA, jak pokazano w krokach 2.4-2.8 (Rysunek 5). Zwróć uwagę, że ścieżka bezwzględna do pliku co_exp_clusters_3colums.txt jest wyróżniona w górnej części strony wyników: Dane wyjściowe WGCNA, aby zarejestrować członkostwo w klastrze każdego białka i użyć go jako danych wejściowych do analizy tylko PPI.
- Rozwiązywanie problemów. Omówiono następujące trzy typowe przypadki. Po zaktualizowaniu parametrów, jak omówiono poniżej, wykonaj kroki 4.2.2-4.2.4, aby wygenerować nowe wyniki WGCNA.
- Jeśli na podstawie danych oczekiwany jest jeden ważny wzorzec współwyrażenia, ale algorytm go pominął, wykonaj kroki 4.4.2–4.4.4
- Brak klastra jest szczególnie prawdopodobny w przypadku małych klastrów o koekspresji, tj. tylko ograniczonej liczby (np. <30) białek wykazujących ten wzorzec. Przed ponowną analizą należy ponownie przeanalizować plik wejściowy matrycy kwantyfikacji białek i zlokalizować kilka dodatnich białek kontrolnych, które przylegają do tego ważnego wzorca koekspresji.
- Aby uratować małe klastry, zmniejsz minimalny rozmiar klastra (np. 10; rozmiar klastra mniejszy niż 10 może nie być solidny, więc nie jest to zalecane) i zmniejsz minimalną odległość klastra (np. 0,1; tutaj ustawienie na 0 jest również dozwolone, co oznacza, że automatyczne scalanie klastrów zostanie pominięte).
- Po wykonaniu kroku grupowania koekspresji ze zaktualizowanymi parametrami, najpierw sprawdź, czy klaster został uratowany z wykresów wzorca koekspresji, a następnie sprawdź kontrole pozytywne, przeszukując ich akcesje białek ze szczegółowej kwantyfikacji białek (upewnij się, że wybrałeś odpowiedni klaster koekspresji z widżetu rozwijanego po lewej stronie przed wyszukiwaniem).
UWAGA: Do uratowania może być potrzebnych wiele iteracji dostrajania parametrów i ponownego uruchamiania.
- Jeśli jest zbyt wiele białek, których nie można przypisać do żadnego klastra, wykonaj kroki 4.4.6-4.4.7.
UWAGA: Zazwyczaj niewielki procent (zwykle <10%) białek może nie być przypisany do żadnego klastra, ponieważ mogą to być białka odstające, które nie podążają za żadnym z typowych wzorców ekspresji zestawu danych. Jeśli jednak taki odsetek jest znaczący (np. >30%), sugeruje to, że istnieją dodatkowe wzorce koekspresji, których nie można zignorować.
- Zmniejsz zarówno parametry Minimalny rozmiar klastra, jak i Minimalna odległość klastra, aby złagodzić tę sytuację, wykrywając "nowe" klastry z koekspresją.
- Ponadto należy zmniejszyć parametr minimalnej korelacji Pearsona (kME), aby zmniejszyć te białka "klastra NA".
UWAGA: Dostrojenie tego parametru nie spowoduje wygenerowania nowych klastrów, ale zamiast tego zwiększy rozmiar "istniejących" klastrów poprzez akceptację większej liczby wcześniej uszkodzonych białek o niższym progu; Zwiększy to jednak również niejednorodność każdego klastra, ponieważ teraz dozwolone są bardziej hałaśliwe białka.
- Dwa klastry mają bardzo niewielką różnicę wzorców; połącz je w jeden klaster, wykonując kroki 4.4.9-4.4.11.
- Zwiększ parametr Minimalna odległość klastra, aby rozwiązać ten problem.
- Jednak w niektórych sytuacjach algorytm może nigdy nie zwrócić pożądanego wzorca; w takim momencie ręcznie dostosuj lub edytuj członkostwo w klastrze w pliku co_exp_clusters_3colums.txt (plik z kroku 4.3), aby scalić.
- Weź plik po edycji jako dane wejściowe do dalszej analizy sieci PPI. W przypadku edycji ręcznej należy uzasadnić kryteria przypisania do grupy i zapisać procedurę edycji ręcznej.
5. Analiza sieci interakcji białko-białko
UWAGA: Poprzez nałożenie klastrów koekspresji na sieć PPI, każdy klaster koekspresji jest dalej stratyfikowany na mniejsze moduły PPI. Analiza jest przeprowadzana dla każdego klastra koekspresji i obejmuje dwa etapy: w pierwszym etapie JUMPn nakłada białka z klastra koekspresji na sieć PPI i znajduje wszystkie połączone komponenty (tj. wiele klastrów połączonych węzłów/białek; jako przykład patrz Rysunek 6A); następnie społeczności lub moduły (gęsto połączonych węzłów) zostaną wykryte iteracyjnie dla każdego połączonego komponentu przy użyciu metody topologicznej macierzy nakładania się (TOM)52.
- Skonfiguruj parametry analizy sieci PPI (Rysunek 3, prawy panel).
- Ustaw minimalny rozmiar modułu PPI na 2. Ten parametr określa minimalny rozmiar odłączonych komponentów z pierwszego etapu analizy. Każdy składnik mniejszy niż określony parametr zostanie usunięty z wyników końcowych.
- Ustaw maksymalny rozmiar modułu PPI na 40. Duże, niepołączone komponenty, które przekroczą ten próg, zostaną poddane drugiemu etapowi analizy opartej na TOM. Drugi etap analizy pozwoli na dalsze podzielenie każdego dużego składnika na mniejsze moduły: każdy moduł prawdopodobnie zawiera białka gęściej połączone niż oryginalny składnik jako całość.
- Rozpocznij analizę. Istnieją dwa sposoby przesyłania analizy sieci PPI:
- Naciśnij przycisk Prześlij analizę JUMPn, aby domyślnie automatycznie przeprowadzić analizę PPI po analizie WGCNA.
- Alternatywnie prześlij niestandardowe wyniki klastra koekspresji i wykonaj analizę tylko PPI, wykonując kroki 5.2.3-5.2.5.
- Przygotuj plik wejściowy, postępując zgodnie z formatem pliku co_exp_clusters_3colums.txt (patrz podrozdział 4.4).
- Kliknij przycisk Parametry zaawansowane u dołu strony Rozpocznij analizę; pojawi się nowe okno parametrów. W górnej sesji Prześlij wynik klastra współwyrażeń dla analizy "Tylko PPI" kliknij przeglądarkę, aby przesłać plik wejściowy przygotowany w kroku 5.2.3.
- W dolnym widżecie wybierz Tryb analizy, wybierz tylko PPI, a następnie kliknij Odrzuć, aby kontynuować. Na stronie Rozpocznij analizę kliknij przycisk Prześlij analizę JUMPn.
- Po zakończeniu analizy (zwykle <3 min) sprawdź wyniki PPI, jak pokazano w krokach 2.10-2.15 (Rysunek 6).
- Opcjonalny krok zaawansowany) Dostosuj modularyzację PPI, dostrajając parametry:
- Zwiększ parametr Maksymalny rozmiar modułu, aby umożliwić uwzględnienie większej liczby białek w wynikach PPI. Prześlij niestandardową sieć PPI, aby objąć nieudokumentowane interakcje, wykonując kroki 5.4.2-5.4.3.
- Kliknij przycisk Parametry zaawansowane u dołu strony Rozpocznij analizę; pojawi się nowe okno parametrów. Przygotuj dostosowany plik PPI, który zawiera trzy kolumny w formacie , C onnection i ; Tutaj są przedstawione przez oficjalne nazwy genów każdego białka.
- W obszarze Prześlij bazę danych PPI kliknij przycisk Przeglądaj, aby przesłać dostosowany plik PPI.
6. Analiza wzbogacenia ścieżki
UWAGA: Struktury hierarchiczne pochodzące z JUMPn zarówno klastrów koekspresji, jak i modułów PPI w ich obrębie, są automatycznie opisywane nadreprezentowanymi ścieżkami przy użyciu dokładnego testu Fishera. Używane bazy danych ścieżek/topologii obejmują Gene Ontology (GO), KEGG, Hallmark i Reactome. Użytkownicy mogą korzystać z zaawansowanych opcji, aby przesyłać spersonalizowane bazy danych do analizy (np. w przypadku analizy danych dotyczących gatunków innych niż ludzie).
- Domyślnie analiza wzbogacania ścieżek jest inicjowana automatycznie z grupowaniem koekspresji i analizą sieci PPI.
- Wyświetlanie wyników wzbogacania ścieżki:
- Wykonaj kroki 2.7, 2.12 i 2.15, aby wyświetlić różne formaty na stronach wyników. Zobacz szczegółowe wyniki w tabeli publikacji arkusza kalkulacyjnego w pliku ComprehensiveSummaryTables.xlsx (krok 2.16).
- (Opcjonalny krok zaawansowany) Prześlij niestandardową bazę danych do analizy wzbogacania ścieżki:
- Przygotuj plik tła genów, który zazwyczaj zawiera oficjalne nazwy genów wszystkich genów danego gatunku.
- Przygotuj plik biblioteki ontologii, wykonując kroki 6.3.3-6.3.4.
- Pobierz pliki biblioteki ontologii z publicznych witryn internetowych, w tym EnrichR53 i MSigDB54. Na przykład pobierz ontologię z Drosophila ze strony internetowej EnrichR55.
- Edytuj pobrany plik pod kątem wymaganego formatu z dwiema kolumnami: nazwą ścieżki jako pierwszą kolumną, a następnie oficjalnymi symbolami genów (oddzielonymi znakiem "/") jako drugą kolumną. Szczegółowy format pliku jest opisany na stronie pomocy oprogramowania JUMPn R shiny.
UWAGA: Znajdź przykładowe pliki z tłem genów i biblioteką ontologii (z użyciem Drosophila jako instancji) w witrynie JUMPn GitHub56.
- Kliknij przycisk Parametry zaawansowane u dołu strony Rozpocznij analizę; pojawi się nowe okno parametrów.
- Znajdź element Prześlij plik tła do analizy wzbogacania ścieżki i kliknij Przeglądarka, aby przesłać plik tła przygotowany w kroku 6.3.1. Następnie w sesji wybierz tło, które ma być używane do analizy wzbogacania ścieżek, kliknij tło dostarczone przez użytkownika.
- Znajdź element Prześlij plik biblioteki ontologii do analizy wzbogacania ścieżki i kliknij przeglądarkę, aby przesłać plik biblioteki ontologii przygotowany w krokach 6.3.2-6.3.4. Następnie w sesji wybierz Bazy danych do analizy wzbogacania ścieżek, kliknij pozycję Baza danych dostarczona przez użytkownika w .xlsx formacie.
- Kliknij przycisk Prześlij analizę JUMPn w prawym dolnym rogu, aby rozpocząć analizę przy użyciu dostosowanej bazy danych.
7. Analiza zbioru danych z dużą próbą
UWAGA: JUMPn obsługuje analizę zbioru danych o dużej wielkości próbki (do 200 testowanych próbek). Aby ułatwić wizualizację dużego rozmiaru próby, potrzebny jest dodatkowy plik (o nazwie "meta file"), który określa grupę próbek, aby ułatwić wyświetlanie wyników grupowania współwyrażeń.
- Przygotuj i prześlij meta plik.
- Przygotuj plik meta, który określa informacje o grupie (np. grupie kontrolnej i chorobowej) dla każdej próbki, wykonując kroki 7.1.2-7.1.3.
- Upewnij się, że plik meta zawiera co najmniej dwie kolumny: kolumna 1 musi zawierać nazwy próbek identyczne z nazwami kolumn i uporządkować je w kolejności z pliku matrycy kwantyfikacji białek (przygotowanej w kroku 3.3); Kolumna 2 i następne będą używane do przypisywania grup dla dowolnej liczby obiektów zdefiniowanych przez użytkownika. Liczba kolumn jest elastyczna.
- Upewnij się, że pierwszy wiersz pliku meta zawiera nazwy kolumn dla każdej kolumny; począwszy od drugiego wiersza, powinny być wymienione informacje o poszczególnych próbkach grup lub innych cech (np. płeć, wiek, leczenie itp.).
- Prześlij plik meta, klikając przycisk Parametry zaawansowane na dole strony Rozpocznij analizę; pojawi się nowe okno parametrów. Przejdź do kroku 7.1.5
- Znajdź pozycję Prześlij plik meta i kliknij Przeglądarka, aby przesłać plik w tle. Jeśli nieoczekiwany format lub niedopasowane nazwy próbek zostaną wykryte przez JUMPn, pojawi się komunikat o błędzie w celu dalszego formatowania pliku meta (kroki 7.1.1-7.1.3).
- Dostosuj parametry analizy grupowania koekspresji: ustaw minimalną korelację Pearsona na 0,2. Ten parametr musi zostać złagodzony ze względu na większą wielkość próby.
- Kliknij przycisk Prześlij analizę JUMPn w prawym dolnym rogu, aby przesłać analizę.
- Wyświetlanie wyników analizy: wszystkie dane wyjściowe są takie same, z wyjątkiem wyświetlania wzorców klastrów współwyrażeń.
- Na stronie Wyniki 1: Dane wyjściowe WGCNA zwizualizuj klastry współwyrażeń jako wykresy skrzynkowe z próbkami stratyfikowanymi przez zdefiniowane przez użytkownika grupy próbek lub funkcje. Każda kropka na wykresie reprezentuje genę własną (tj. wzorzec konsensusu klastra) obliczoną przez algorytm WGCNA.
- Jeśli użytkownik podał wiele funkcji (np. wiek, płeć, leczenie itp.) w celu pogrupowania próbek, kliknij pole rozwijane Wybierz format wyrażenia, aby wybrać inną funkcję grupowania próbek.