Artykuł metodologiczny

Protokół wykorzystania analizy wzbogacenia zestawu genów w celu zidentyfikowania odpowiedniego modelu zwierzęcego do badań translacyjnych

DOI:

10.3791/55768

16 sierpnia 2017

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dostarczamy ustandaryzowany protokół do analizy wzbogacenia zestawu genów danych transkryptomicznych w celu zidentyfikowania idealnego modelu myszy do badań translacyjnych.
Protokół ten może być używany z danymi z mikromacierzy DNA i sekwencjonowania RNA, a następnie może być rozszerzony na inne dane omiczne, jeśli dane są dostępne.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ostatnie badania, które porównywały transkryptomiczne zestawy danych chorób ludzkich z zestawami danych z modeli mysich przy użyciu tradycyjnych technik porównywania genów z genami, doprowadziły do sprzecznych wniosków dotyczących znaczenia modeli zwierzęcych dla badań translacyjnych. Główną przyczyną rozbieżności między różnymi analizami ekspresji genów jest arbitralne filtrowanie genów o zróżnicowanej ekspresji. Co więcej, porównywanie pojedynczych genów między różnymi gatunkami i platformami jest często ograniczone przez wariancję techniczną, co prowadzi do błędnej interpretacji zgodności / rozbieżności między danymi z modeli ludzkich i zwierzęcych. W związku z tym potrzebne są ustandaryzowane podejścia do systematycznej analizy danych. Aby przezwyciężyć subiektywne filtrowanie genów i nieskuteczne porównania między genami, wykazaliśmy niedawno, że analiza wzbogacenia zestawu genów (GSEA) może potencjalnie uniknąć tych problemów. W związku z tym opracowaliśmy ustandaryzowany protokół korzystania z GSEA, aby odróżnić odpowiednie i nieodpowiednie modele zwierzęce do badań translacyjnych. Protokół ten nie jest odpowiedni do przewidywania, w jaki sposób projektować nowe systemy modelowe a priori, ponieważ wymaga istniejących eksperymentalnych danych omicznych. Protokół opisuje jednak, w jaki sposób interpretować istniejące dane w ustandaryzowany sposób, aby wybrać najbardziej odpowiedni model zwierzęcy, unikając w ten sposób niepotrzebnych eksperymentów na zwierzętach i wprowadzających w błąd badań translacyjnych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modele zwierzęce są powszechnie używane do badania ludzkich chorób, ze względu na ich domniemane podobieństwo do ludzi pod względem genetyki, anatomii i fizjologii. Co więcej, modele zwierzęce często służą jako strażnicy terapii klinicznych i mogą mieć ogromny wpływ na powodzenie badań translacyjnych. Staranny wybór optymalnego modelu zwierzęcego może zmniejszyć liczbę wprowadzających w błąd badań na zwierzętach. Ostatnio kontrowersyjnie dyskutowano o znaczeniu modeli zwierzęcych w badaniach translacyjnych, szczególnie dlatego, że analiza tych samych zestawów danych uzyskanych z ludzkich chorób zapalnych i powiązanych modeli mysich doprowadziła do sprzecznych wniosków 1,2. Dyskusja ta ujawniła podstawowy problem podczas analizy danych omicznych: potrzebne są ustandaryzowane podejścia do systematycznej analizy danych w celu zmniejszenia tendencyjnej selekcji genów i zwiększenia wiarygodności porównań międzygatunkowych 3.

Tradycyjnie, analiza danych transkryptomicznych (i innych danych omicznych) odbywa się na poziomie pojedynczego genu i obejmuje początkowy etap selekcji genów w oparciu o rygorystyczne parametry odcięcia (np. zmiana krotności >2,0, wartość p <0,05). Jednak ustawienie początkowych parametrów odcięcia często jest subiektywne, arbitralne i nieuzasadnione biologicznie, a nawet może prowadzić do przeciwnych wniosków1,2. Co więcej, początkowa selekcja genów na ogół ogranicza analizę do kilku genów o wysokiej i niskiej regulacji, a zatem nie jest wystarczająco czuła, aby objąć większość genów, które były wyrażane w różny sposób w mniejszym stopniu.

Wraz z nadejściem ery genomiki na początku lat 2000 i rosnącą wiedzą o szlakach i kontekstach biologicznych, opracowano alternatywne podejścia statystyczne, które pozwoliły obejść ograniczenia analiz na poziomie pojedynczego genu. Analiza wzbogacenia zestawu genów (GSEA)4, która jest jedną z powszechnie akceptowanych metod analizy danych transkryptomicznych, wykorzystuje a priori zdefiniowane grupy genów (np. szlaki sygnałowe, proksymalne położenie na chromosomie itp.). GSEA najpierw mapuje wszystkie wykryte niefiltrowane geny do zamierzonych zestawów genów (np. szlaków), niezależnie od ich indywidualnej zmiany ekspresji. Podejście to obejmuje zatem również umiarkowanie regulowane geny, które w przeciwnym razie zostałyby utracone w wyniku analiz na poziomie pojedynczego genu. Addytywna zmiana ekspresji w zestawach genów jest następnie wykonywana przy użyciu statystyki sumy bieżącej.

Pomimo szerokiego zastosowania w badaniach medycznych, GSEA i pokrewne podejścia do wzbogacania zbiorów nie są oczywiście brane pod uwagę przy analizie złożonych danych omicznych. W tym miejscu opisujemy protokół porównywania danych omicznych z próbek ludzkich z danymi z modeli mysich w celu zidentyfikowania idealnego modelu do badań translacyjnych. Wykazujemy możliwość zastosowania protokołu w oparciu o zbiór modeli mysich, które są używane do naśladowania ludzkich zaburzeń zapalnych. Jednak ten proces analizy nie ogranicza się do porównań człowieka i myszy i można go dostosować do dalszych pytań badawczych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Pobieranie oprogramowania GSEA i bazy sygnatur molekularnych

  1. Wejdź na oficjalną stronę GSEA Broad Institute (http://software.broadinstitute.org/gsea/index.jsp) i zarejestruj się, aby uzyskać dostęp do narzędzia programowego GSEA i bazy danych sygnatur molekularnych (MSigDB).
  2. Pobierz aplikację komputerową javaGSEA lub alternatywną opcję oprogramowania (np. skrypt R).
    UWAGA: Wszystkie opcje implementują dokładnie ten sam algorytm. Oprogramowanie GSEA jest bezpłatnie dostępne dla osób ze środowisk akademickich i przemysłu do wewnętrznych celów badawczych.
  3. Więcej informacji na temat oprogramowania GSEA można znaleźć na stronie internetowej dokumentacji (http://software.broadinstitute.org/cancer/software/gsea/wiki/index.php/Main_Page) oraz w podręczniku użytkownika GSEA (http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html).
  4. Pobierz bazę danych sygnatur molekularnych (MSigDB) ze strony internetowej GSEA, aby uzyskać dostęp do indywidualnych kolekcji zestawów genów.
    UWAGA: MSigDB to zbiór zestawów genów z adnotacjami do użytku z oprogramowaniem GSEA lub do innych celów. Zestawy genów można podzielić ze względu na szlaki sygnałowe, terminy ontologii genów, motywy cis-regulatorowe, sygnatury eksperymentalne i inne. Geny z MSigDB są zawsze nazywane oficjalnym symbolem genu HUGO (Human Genome Organisation). W celu porównania regulacji szlaku między danym zaburzeniem u człowieka a różnymi modelami myszy zaleca się pobranie pliku "wszystkie szlaki kanoniczne, symbole genów" (c2.cp.v5.2.symbols.gmt). Ten plik zawiera zestawy genów, które zostały oznaczone adnotacjami i zorganizowane w ścieżki sygnałowe przez KEGG 5,6, Reactome 7,8 i BioCarta 9. Ciąg "v5.2" reprezentuje informacje o wersji kolekcji. Upewnij się, że pobrałeś najnowszą wersję plików. Baza danych MSigDB jest swobodnie dostępna dla osób ze środowisk akademickich i przemysłu do wewnętrznych celów badawczych. Nie ma potrzeby pobierania bazy danych MSigDB, jeśli podczas analizy zapewnione jest połączenie z Internetem. W takim przypadku bazę danych MSigDB można wybrać bezpośrednio w interfejsie użytkownika GSEA.
  5. Pobierz pliki adnotacji chipów DNA (tablic) ze strony internetowej GSEA, aby przetłumaczyć identyfikatory sond specyficzne dla macierzy na ogólne symbole genów HUGO (np. Mouse430_2.chip).
    UWAGA: Nie ma potrzeby pobierania adnotacji na chipie DNA, jeśli podczas analizy zapewnione jest połączenie z Internetem. W takim przypadku adnotacje na chipie DNA można wybrać bezpośrednio w interfejsie użytkownika GSEA. Protokół może być również używany z danymi sekwencjonowania RNA. W takim przypadku nie jest konieczne pobieranie plików adnotacji. Zamiast tego użyj narzędzia GSEA do analizy danych dotyczących ekspresji genów (patrz krok 4.12).

2. Pobierz eksperymentalne dane dotyczące ekspresji genów dla choroby ludzkiej i odpowiednie modele zwierzęce

  1. Identyfikacja eksperymentalnych badań ekspresji genów (transkryptomika) dla wybranego zaburzenia u człowieka (np. profile ekspresji genów leukocytów pochodzących od pacjentów z zaburzeniami septycznymi GSE9960).
  2. Podobnie, poszukaj kilku modeli zwierzęcych, które mają być porównane z badaniami na ludziach (np. profile ekspresji genów komórek krwi pochodzących od myszy po wstrzyknięciu Staphylococcus aureus (S. aureus), GSE20524). Na tym etapie wykorzystaj wcześniejszą wiedzę do wstępnej selekcji modeli zwierzęcych, które mogą być odpowiednie do naśladowania sytuacji ludzkiej.
  3. W tym celu zapoznaj się z literaturą i bazami danych, takimi jak baza danych Gene Expression Omnibus (GEO) 10 lub ArrayExpress 11 i pobierz znormalizowane dane transkryptomiczne, które Cię interesują. Zapisz dane jako pliki tekstowe na lokalnym dysku twardym. W przypadku bazy danych GEO zaleca się pobieranie plików tekstowych macierzy szeregów rozdzielanych tabulatorami. Należy również zwrócić uwagę na platformę (typ matrycy) użytą w tym badaniu, ponieważ informacje te są potrzebne do translacji identyfikatorów sondy specyficznych dla macierzy na ogólne symbole genów HUGO.
    UWAGA: Upewnij się, że pamięć jest wystarczająca do przechowywania danych, ponieważ zestawy danych transkryptomicznych zwykle zawierają kilkaset MB.

3. Obsługa i formatowanie danych

  1. Przed zaimportowaniem eksperymentalnych danych dotyczących ekspresji genów do narzędzia programowego GSEA należy wziąć pod uwagę wymaganą strukturę danych. Dla każdego badania należy ręcznie utworzyć dwa różne pliki: 1) plik danych dotyczących ekspresji genów zawierający wartości pomiarowe dla różnych genów i próbek oraz 2) plik fenotypu zawierający etykiety próbek do grupowania poszczególnych próbek (np. do grup poddanych działaniu substancji).
    Więcej informacji i opcje struktury danych można znaleźć na stronie formatu danych GSEA (http://software.broadinstitute.org/cancer/software/gsea/wiki/index.php/Data_formats).
    UWAGA: Ogólnie rzecz biorąc, wszystkie formy danych transkryptomicznych są zgodne z protokołem, w tym eksperymenty z mikromacierzami DNA, badania sekwencyjne RNA lub sekwencyjne ChIP. W przypadku stosowania eksperymentów z mikromacierzą DNA, plik danych dotyczących ekspresji genów powinien zawierać specyficzny dla macierzy identyfikator sondy lub symbole genu HUGO dla każdego genu (identyfikatory sondy zostaną przetłumaczone na symbole genów HUGO podczas analizy, patrz kroki 1.5 i 4.10). W przypadku korzystania z danych sekwencyjnych RNA lub ChIP-seq należy użyć ręcznie obliczonych wskaźników grupowych dla danych dotyczących ekspresji genów (np. średniego stosunku grupy) zamiast danych dotyczących poszczególnych próbek. Te wskaźniki grupy należy następnie przeanalizować za pomocą narzędzia GSEA do wstępnej klasyfikacji (patrz krok 4.12). Dane dotyczące ekspresji genów muszą zostać znormalizowane w zwykły sposób przed zaimportowaniem do oprogramowania GSEA. Rodzaj normalizacji (np. krzywa kwartylowa lub sześcienna) jest na ogół pozostawiony badaczowi.
  2. Plik danych wyrażenia genów: Użyj formatu pliku tekstowego rozdzielanego tabulatorami (*.txt) do opisania zestawu danych wyrażeń, jak pokazano w Rysunek 1A. Zobacz również obsługiwany plik przykładowy GSE20524_expression.txt.
    UWAGA: Plik danych ekspresji genów zawiera wartości ekspresji dla wszystkich wykrywalnych genów (lub sond), również dla genów, które mogą nie być wyrażane w różny sposób. W związku z tym plik ten zazwyczaj składa się z wielu tysięcy genów. Jest on zorganizowany tak, jak pokazano w Rysunek 1A. Pierwszy wiersz zawiera nazwę etykiety (np. symbol genu lub identyfikator sondy), po której następuje identyfikator każdej próbki w zbiorze danych (np. próbka 1, próbka 2 itd.). Pozostała część pliku zawiera wartości wyrażeń dla każdego z genów i dla każdej próbki w zestawie danych. Narzędzie programowe GSEA wykonuje obliczenia dla metryk grupowych (np. stosunku średniej grupy lub stosunku sygnału do szumu), dlatego zaleca się dołączanie danych dla każdej pojedynczej próby. Alternatywnie, możliwe jest użycie zewnętrznie obliczonych metryk grupowych dla danych o ekspresji genów (patrz Rysunek 1B).
  3. Plik fenotypu: Utwórz osobny plik do definiowania i oznaczania grup, które składają się z poszczególnych próbek, jak pokazano na rysunku Rysunek 2. Użyj spacji lub tabulatorów, aby oddzielić pola. Zapisz go w formacie pliku CLS (C++ Class Definition). Zobacz również obsługiwany przykładowy plik GSE20524_pheno_infection.cls.
    UWAGA: Pierwszy wiersz zawiera całkowitą liczbę próbek, a dalej liczbę grup (Rysunek 2). Podczas gdy liczba próbek powinna odpowiadać plikowi danych dotyczących ekspresji genów (patrz 3.2), liczba grup zależy od projektu badania. Trzecim polem pierwszego wiersza jest zawsze '1'.
    Drugi wiersz w pliku CLS zawiera nazwę każdej grupy. Wiersz powinien zaczynać się od znaku funta (#), po którym następuje spacja (Rysunek 2).
    Trzeci wiersz zawiera etykietę grupy dla każdej próbki. Etykieta grupy może być dowolną liczbą lub tekstem. Tylko kolejność etykiet decyduje o skojarzeniu każdej próbki z grupami: pierwsza użyta etykieta jest przypisana do pierwszej grupy w drugim wierszu; Druga unikatowa etykieta jest przypisana do drugiej grupy i tak dalej. Upewnij się, że na tym etapie każda próbka z tej samej grupy ma tę samą etykietę i że liczba etykiet jest taka sama, jak liczba próbek określona w pierwszym wierszu. Na koniec zapisz plik jako plik tekstowy rozdzielany tabulatorami (*.txt) i ręcznie zmień rozszerzenie nazwy pliku na (*.cls).
  4. (opcjonalnie) Pliki bazy danych zestawów genów: Zdefiniuj niestandardowe zestawy genów. Użyj formatu pliku GMT (Gene Matrix Transposed) rozdzielanego tabulatorami dla zestawów genów, jak pokazano w Rysunek 3. Zobacz również obsługiwany przykładowy plik Gene_sets_Inflammation_BIOCARTA_KEGG_REACTOME.gmt.
    UWAGA: Definiowanie niestandardowych zestawów genów może być przydatne na przykład w celu ograniczenia analizy wzbogacania zestawu genów do szlaków o szczególnym znaczeniu (np. sygnalizacja immunologiczna w badaniach nad sepsą) lub do definiowania de novo własnych zestawów genów (np. geny aktywowane i hamowane w badaniach, które muszą być porównane). Plik jest zorganizowany tak, jak pokazano na rysunku Rysunek 3. W formacie GMT każdy wiersz reprezentuje zestaw genów (Rysunek 3). Każdy zestaw genów jest opisany przez nazwę, opis i geny w zestawie genów. Pierwsza kolumna zawiera unikalne nazwy zestawów genów. Drugi wiersz może opcjonalnie zawierać opis zestawu genów. Poniższe kolumny zawierają nazwy genów (oficjalne symbole genów HUGO) odpowiedniego zestawu genów. Na koniec zapisz plik jako plik tekstowy rozdzielany tabulatorami (*.txt) i ręcznie zmień rozszerzenie nazwy pliku na (*.gmt).

4. Wykonywanie GSEA

  1. Otwórz narzędzie programowe GSEA (patrz 1.2).
  2. Kliknij przycisk "załaduj dane" po lewej stronie okna głównego (Rysunek 4A). Otworzy się nowa zakładka do importowania wymaganych plików danych (Rysunek 4B). Przejdź do nowej karty do pliku z danymi o ekspresji genów (*.txt) (patrz 3.2), pliku fenotypu (*.cls) (patrz 3.3) i, opcjonalnie, do pliku niestandardowych zestawów genów (*.gmt) (Rysunek 4B).
    1. W przypadku, gdy GSEA nie może połączyć się z Internetem, załaduj również pobrane pliki MSigDB (*.gmt) (np. c2.cp.v5.2.symbols.gmt dla ścieżek, patrz 1.4) i pliki adnotacji chipa DNA (tablicy) (*.chip) (np. Mouse430_2.chip, patrz 1.5). Pomyślnie zaimportowane dane pojawiają się w sekcji "załaduj dane" (Rysunek 4C).
      UWAGA: Każde badanie ekspresji genów musi być analizowane indywidualnie za pomocą GSEA. Porównanie dwóch badań (np. zaburzenia u ludzi i model mysi) zostanie przeprowadzone w kroku 5.
  3. Kliknij przycisk "Uruchom GSEA" po lewej stronie okna głównego. Otworzy się nowa zakładka w celu ustawienia parametrów analizy (Rysunek 4D). Zakładka jest podzielona na trzy części: pola wymagane, pola podstawowe i pola zaawansowane.
  4. W wymaganych polach najpierw wybierz zestaw danych wyrażeń załadowany w kroku 4.2 (Rysunek 4D).
  5. Wybierz bazę danych zestawów genów z podłączonej strony internetowej lub z ręcznie zaimportowanego pliku zestawu genów (Rysunek 4D).
  6. Edytuj etykiety fenotypu, aby wybrać grupy próbek, które mają być ze sobą porównane (np. leczenie S. aureus vs. zdrowa kontrola) (Rysunek 4D).
  7. Zwiń zestaw danych do symboli genów (=true) w celu przetłumaczenia identyfikatorów sondy w zestawie danych wyrażeń na oficjalne symbole genów HUGO używane w bazie danych zestawów genów. Wybierz wartość false, jeśli zestaw danych wyrażeń zawiera już symbole genów HUGO (Rysunek 4D).
  8. Ustaw liczbę permutacji na domyślne ustawienie na 1,000 (Rysunek 4D).
    UWAGA: W przypadku wyższych liczb czas obliczeń znacznie się wydłuży.
  9. Zmień typ permutacji na "zestaw genów", ponieważ permutacja fenotypu jest zalecana tylko wtedy, gdy w każdym fenotypie jest więcej niż siedem próbek (Rysunek 4D).
  10. Na koniec wybierz platformę chipową używaną do generowania danych o ekspresji genów, albo z podłączonej strony internetowej, albo z ręcznie zaimportowanego pliku adnotacji chipa DNA (tablicy) (Rysunek 4D).
    UWAGA: Ten krok jest konieczny tylko wtedy, gdy identyfikatory sondy są używane w przekazanym zestawie danych wyrażeń.
  11. W podstawowych polach edytuj co najmniej nazwę analizy i sekcję zapisu wyników w tym folderze, aby ponownie znaleźć plik z wynikami (Rysunek 4D). Ponadto można zmieniać inne parametry statystyczne. Więcej informacji na temat parametrów i sekcji pól zaawansowanych można znaleźć w podręczniku użytkownika GSEA (http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html).
  12. (Opcjonalnie): W przypadku, gdy zamiast danych z poszczególnych prób konieczne jest użycie zewnętrznie obliczonych wskaźników grupowych dla danych dotyczących ekspresji genów (np. średniego stosunku grupy), należy użyć narzędzia GSEA. Analiza zostanie następnie przeprowadzona na podstawie prostej listy genów przypisanych ze wstępnie obliczonymi wskaźnikami grupowymi, które są używane do uszeregowania genów. Po załadowaniu alternatywnego pliku z ekspresją genów przejdź do głównego paska nawigacyjnego i kliknij Tools/GseaPreranked. Podobnie otworzy się nowa zakładka do ustawiania parametrów analizy (Rysunek 4E).
    UWAGA: Korzystanie z narzędzia GSEA jest zalecane w przypadku badań, które nie mają danych dotyczących ekspresji genów specyficznych dla danej próbki. Może tak być w przypadku, gdy na danych przeprowadzono specjalne statystyki lub procedury normalizacyjne prowadzące do średnich wartości grupowych, a nie danych z poszczególnych próbek. W przypadku danych sekwencjonowania RNA zaleca się korzystanie z narzędzia GSEA preranking. Znormalizuj dane ekspresji sekwencjonowania RNA i oblicz metryki grupowe dla próbek (np. log zmiany krotności), które można wykorzystać do uszeregowania genów zgodnie z ich ekspresją.
  13. Kliknij przycisk "Uruchom" w prawym dolnym rogu okna.
    UWAGA: Analiza może wtedy potrwać do kilku minut, w zależności od szybkości obliczeń. Śledź postęp analizy w sekcji Raporty GSEA w lewym dolnym rogu okna. Po zakończeniu analizy, w sekcji raportów GSEA pojawia się status 'success'.
  14. Kliknij pomyślną analizę w sekcji raportów GSEA, aby otworzyć wyniki analizy.
    UWAGA: W oknie przeglądarki otworzy się nowe menu nawigacyjne, które podsumowuje wszystkie wyniki i ustawienia parametrów (Rysunek 5). Dwie górne sekcje menu nawigacyjnego zawierają wyniki wzbogacania zestawu genów dla zdefiniowanych grup (np. wzbogacenie w próbkach traktowanych S. aureus lub zdrowych próbkach kontrolnych). Pierwsze wiersze obu sekcji pokazują podsumowanie wyników statystycznych. Zestawy genów, które są znacznie wzbogacone przy współczynniku fałszywych odkryć (FDR) poniżej 25%, są uważane za wzbogacone w następującej interpretacji. Więcej szczegółów na temat interpretacji analizy można znaleźć w podręczniku użytkownika GSEA (http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html).
  15. Kliknij szczegółowe wyniki wzbogacania w formacie Excel, aby wyeksportować wyniki analizy do arkusza kalkulacyjnego (Rysunek 6A). Wyeksportuj szczegółowe wyniki wzbogacania do programu Excel oddzielnie dla obu fenotypów (Rysunek 5) i połącz dane wyników w jednym pliku arkusza kalkulacyjnego. W celu późniejszego porównania danych dotyczących ekspresji genów z kilku badań, należy zachować co najmniej nazwę zestawu genów (kolumna A), jego znormalizowany wynik wzbogacenia (NES) (kolumna F) i jego wartość FDR (wskaźnik fałszywych odkryć) (kolumna H) (Rysunek 6B).
    UWAGA: Plik arkusza kalkulacyjnego zawiera ogromne dane dla każdego z analizowanych zestawów genów, w tym nazwę zestawu genów (kolumna A), jego rozmiar (czyli liczbę genów wykrytych w danych dotyczących ekspresji genów, kolumna D), jego NES (ilościowa miara kierunku i zakresu wzbogacenia, kolumna F), jego nominalną wartość p (nieskorygowana, kolumna G) i jej wartość FDR (skorygowana o testowanie wielu hipotez, kolumna H). Więcej informacji na temat interpretacji można znaleźć w podręczniku użytkownika GSEA (http://software.broadinstitute.org/gsea/doc/GSEAUserGuideFrame.html).
  16. Powtórzyć analizę wzbogacenia zestawu genów (kroki 4.1 do 4.15) dla drugiego badania (np. S. aureus GSE9960) oraz dla wszystkich dalszych badań, które mają być ze sobą porównane. Uwzględnij jak najwięcej badań klinicznych na ludziach i różnych modeli mysich, aby zidentyfikować optymalny model myszy dla pytania badawczego translacyjnego.

5. Porównywanie wyników GSEA

  1. Aby zidentyfikować optymalny model zwierzęcy do naśladowania sytuacji ludzkiej, należy porównać ze sobą wyniki GSEA wszystkich badań. Użyj wyników wzbogacenia i wartości FDR, aby sklasyfikować szlaki (zestawy genów) jako aktywowane (NES >0, FDR <25%), zahamowane (NES <0, FDR <25%) lub brak obu (FDR >25%). Dla każdego porównania dwóch badań policz liczbę realizacji dziewięciu możliwych kombinacji regulacji szlaku, jak wskazano w tabeli kontyngencji 3x3 (Rysunek 7A).
  2. Oceń korelację między dwoma badaniami, obliczając dodatnią wartość predykcyjną (ppv) i ujemną wartość predykcyjną (NPV), która z definicji jest częścią szlaków, które wykazują tę samą regulację (aktywowaną lub zahamowaną) w dwóch badaniach.
    1. Oblicz ppv i NPV według następujących wzorów (1) i (2):
      (1) figure-protocol-1
      (2) figure-protocol-2
      UWAGA: Ponieważ nakładanie się na siebie może być całkowicie przypadkowe, ppv i NPV muszą być dalej porównywane z wartościami oczekiwanymi przypadkowo. Takie podejście pozwala na oszacowanie ilości informacji, które można uzyskać z jednego badania w celu przewidywania skutków w innym badaniu. Na przykład, jeśli procesy regulacyjne w dwóch modelach były od siebie niezależne (i nakładały się na siebie tylko przypadkowo), a w pierwszym modelu 10% ścieżek było regulowanych w górę, to ppv do drugiego modelu również wynosiłoby 10% i nie byłoby dodatkowego przyrostu informacji. Z drugiej strony, gdyby oba modele były powiązane wspólnymi mechanizmami regulacyjnymi, wówczas ppv (i NPV) byłoby znacznie wyższe, niż oczekiwano przez przypadek. Na przykład, w celu przewidywania zmian ekspresji genów podczas ludzkiej sepsy (GSE9960) na podstawie efektów w mysim modelu iniekcji S. aureus (GSE20524), ppv wynosi 43% (6/(6+8+0)), a NPV wynosi 61% (11/(0+7+11)). Innymi słowy, 43% aktywowanych szlaków w mysim modelu iniekcji S. aureus (GSE20524) jest również aktywowanych podczas sepsy u ludzi (GSE9960). Podobnie, 61% hamowanych szlaków w mysim modelu wstrzykiwania S. aureus (GSE20524) jest również hamowanych podczas ludzkiej sepsy (GSE9960) (Figura 7B). PPV i NPV można również określić dla odwrotnej konstelacji (co oznacza przewidywanie od badania 1 do badania 2).
  3. Aby obliczyć przypadkowe nakładanie się, zapoznaj się z tabelą kontyngencji 3x3 (Rysunek 7) i oblicz ppvchance i npvchance zgodnie z następującymi wzorami (3) i (4):
    (3) figure-protocol-3
    (4) figure-protocol-4
    UWAGA: Na przykład dla przewidywania zmian ekspresji genów podczas ludzkiej sepsy (GSE9960) na podstawie efektów w mysim modelu iniekcji S. aureus (GSE20524) ppvchance wynosi 13% (8/64), a npvchance wynosi i 22% (14/64).
  4. Oblicz zysk ppv w stosunku do szansy, odejmując ppvchance od ppv. Oblicz odpowiednio dla NPV:
    (5) figure-protocol-5
    (6) figure-protocol-6
    UWAGA: Na przykład, w przypadku przewidywania zmian ekspresji genów podczas ludzkiej sepsy (GSE9960) na podstawie efektów w mysim modelu iniekcji S. aureus (GSE20524), zmiana PPV i NPV w funkcji szansy wynosi odpowiednio +30% (43% - 13%) i +39% (61% - 22%).
  5. Oblicz przyrost informacji, które można uzyskać z badania 2 dotyczącego badania 1, uśredniając ppvgain i npvgain:
    (7) figure-protocol-7
  6. Skorzystaj z tabeli kontyngencji zdefiniowanej w kroku 5.1 dla pary badań (badanie1.ścieżka, badanie2.ścieżka), aby obliczyć wartość p za pomocą testu chi-kwadrat.
    Przechowuj dane z tabeli kontyngencji w macierzy X. Wykonaj test chi-kwadrat, np. za pomocą funkcji R chisq.test.
    UWAGA: Na przykład, porównanie wybranego badania sepsy u ludzi (GSE9960) z mysim modelem iniekcji S. aureus (GSE20524) pokazuje statystycznie istotne nakładanie się regulacji szlaku zapalnego:
    > chisq.test(X,simulate.p.value=F)$p.value
    3.82e-07

6. Identyfikacja optymalnego modelu zwierzęcego

  1. Porównaj wyniki GSEA dla wszystkich kombinacji badań, które zostały wybrane do analizy.
    UWAGA: Zaleca się również porównanie (podobnych) badań na ludziach ze sobą, jak również różnych badań na zwierzętach. Porównanie to może dostarczyć informacji na temat wewnątrzgatunkowej wariancji badań klinicznych (lub zaburzeń) i różnych modeli zwierzęcych. Oczekuje się, że badania kliniczne powinny wykazać akceptowalne nakładanie się na siebie i znaczny przyrost informacji, ponieważ w przeciwnym razie badania kliniczne mogą być zbyt niejednorodne, aby znaleźć model zwierzęcy, który może naśladować sytuację człowieka. W takim przypadku zaleca się uwzględnienie tylko badań na ludziach, które są do siebie podobne w celu identyfikacji odpowiednich modeli zwierzęcych.
  2. Posortuj wszystkie kombinacje według przyrostu informacji (krok 5.5). Aby porównać wiele zestawów danych, użyj macierzy i zwizualizuj wyniki za pomocą kolorowej mapy cieplnej lub podobnego (Rysunek 8).
  3. Wybierz model zwierzęcy o największym zysku informacji. Aby ocenić znaczenie pozyskania informacji, należy również wziąć pod uwagę test chi-kwadrat (krok 5.6).
    UWAGA: Modele zwierzęce powinny być uznawane za odpowiednie tylko wtedy, gdy przyrost informacji jest znaczny i jeśli wartość p w teście chi-kwadrat jest niższa od poziomu istotności. Progi zdefiniowane przez użytkownika będą na ogół zależeć od kilku czynników: 1) wiedzy uzyskanej przed badaniem na temat możliwości przeniesienia wyników z modelu zwierzęcego na człowieka (np. podobna fizjologia), 2) oczekiwanych korzyści dla ludzi wynikających z domniemanego sukcesu, 3) praktycznego zastosowania tego eksperymentu na zwierzętach oraz 4) oczekiwanego bólu, cierpienia lub krzywdy wyrządzonej zwierzętom laboratoryjnym.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pokazano przepływ pracy GSEA i zrzuty ekranu z przykładowymi danymi. Rysunek 1 pokazuje plik z danymi o ekspresji genów, który zawiera interesujące nas dane transkryptomiczne. Dla każdego badania wymagany jest opisowy plik fenotypu, który jest pokazany w Rysunek 2. Adnotowane zestawy genów (np. szlaki) są zdefiniowane w pliku bazy danych zestawu genów (Rysunek 3). Rysune...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Modele zwierzęce od dawna są stosowane do badania mechanizmów chorobowych i opracowywania nowych strategii terapeutycznych. Jednak sceptycyzm co do przewidywalności modeli zwierzęcych zaczął się rozprzestrzeniać po niepowodzeniach badań klinicznych12. Co więcej, kontrowersyjne dyskusje na temat odpowiednich strategii analizy i interpretacji danych big omicznych z badań przedklinicznych zostały wywołane przez przeciwstawne wnioski wyciągnięte z tych samych danych po zastosowaniu różnych strategii a...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy oświadczają, że nie mają konkurencyjnych interesów finansowych.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ta praca została sfinansowana przez Niemiecki Federalny Instytut Oceny Ryzyka (BfR).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
ExcelMicrosoft Corporation

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Seok, J., et al. Genomic responses in mouse models poorly mimic human inflammatory diseases. Proc Natl Acad Sci U S A. 110 (9), 3507-3512 (2013).
  2. Takao, K., Miyakawa, T. Genomic responses in mouse models greatly mimic human inflammatory diseases. Proc Natl Acad Sci U S A. 112 (4), 1167-1172 (2015).
  3. Weidner, C., Steinfath, M., Opitz, E., Oelgeschläger, M., Schönfelder, G. Defining the optimal animal model for translational research using gene set enrichment analysis. EMBO Mol Med. 8 (8), 831-838 (2016).
  4. Subramanian, A., et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 102 (43), 15545-15550 (2005).
  5. Kanehisa, M., Sato, Y., Kawashima, M., Furumichi, M., Tanabe, M. KEGG as a reference resource for gene and protein annotation. Nucleic Acids Res. 44 (D1), D457-D462 (2016).
  6. Kanehisa, M., Goto, S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 28 (1), 27-30 (2000).
  7. Fabregat, A., et al. The Reactome pathway Knowledgebase. Nucleic Acids Res. 44 (D1), D481-D487 (2016).
  8. Croft, D., et al. The Reactome pathway knowledgebase. Nucleic Acids Res. 42 (Database issue), D472-D477 (2014).
  9. Nishimura, D. BioCarta. Biotech Software & Internet Report. 2 (3), 117-120 (2001).
  10. Edgar, R., Domrachev, M., Lash, A. E. Gene Expression Omnibus: NCBI gene expression and hybridization array data repository. Nucleic Acids Res. 30 (1), 207-210 (2002).
  11. Kolesnikov, N., et al. ArrayExpress update--simplifying data submissions. Nucleic Acids Res. 43 (Database issue), D1113-D1116 (2015).
  12. Cohen, J., et al. Sepsis: a roadmap for future research. Lancet Infect Dis. 15 (5), 581-614 (2015).
  13. Spinelli, L., Carpentier, S., Montanana Sanchis, F., Dalod, M., Vu Manh, T. P. BubbleGUM: automatic extraction of phenotype molecular signatures and comprehensive visualization of multiple Gene Set Enrichment Analyses. BMC Genomics. 16 (1), 814(2015).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Animal Model SelectionGSEA Software ToolMolecular Signature DatabaseNormalized Enrichment ScoreFDR ValueContingency Table AnalysisGain of InformationPathway Regulation Comparison

Powiązane artykuły