16 sierpnia 2017
Dostarczamy ustandaryzowany protokół do analizy wzbogacenia zestawu genów danych transkryptomicznych w celu zidentyfikowania idealnego modelu myszy do badań translacyjnych.
Protokół ten może być używany z danymi z mikromacierzy DNA i sekwencjonowania RNA, a następnie może być rozszerzony na inne dane omiczne, jeśli dane są dostępne.
Ogólnym celem tej procedury jest zidentyfikowanie odpowiedniego modelu zwierzęcego dla translacyjnych pytań badawczych. Ta metoda może pomóc odpowiedzieć na jedno kluczowe pytanie w badaniach translacyjnych, a mianowicie, jak mogę wybrać odpowiedni model zwierzęcy dla konkretnej choroby ludzkiej, którą chcę zbadać? Główną zaletą tej techniki jest to, że dane dotyczące całego genomu są porównywane między modelami zwierzęcymi a badaniami chorób u ludzi.
Tak więc takie podejście pozwala uniknąć tendencyjnej interpretacji odnoszącej się do porównań pojedynczych genów. Chociaż metoda ta zapewnia wgląd w przydatność modeli mysich do chorób zapalnych, można ją również zastosować do innych modeli chorób. GSEA pomaga w badaniu regulacji politycznych dotyczących badań nad ekspresją genów.
Wyniki każdego badania na modelu zwierzęcym i choroby stanowią podstawę do dalszych porównań. Rozpocznij tę procedurę od pobrania oprogramowania i danych, a następnie obsługi i formatowania danych zgodnie z opisem w protokole tekstowym. Następnie otwórz narzędzie programowe GSEA.
Kliknij przycisk Załaduj dane po lewej stronie okna głównego. Otworzy się nowa zakładka do importowania wymaganych plików danych. W nowej karcie przejdź do pliku danych ekspresji genów i pliku fenotypu.
W przypadku, gdy GSEA nie może połączyć się z Internetem, załaduj również pobrane pliki bazy danych sygnatur molekularnych i pliki adnotacji chipów DNA. Pomyślnie zaimportowane dane pojawią się w sekcji ładowania danych. Kliknij przycisk Uruchom GSEA po lewej stronie okna głównego.
Otworzy się nowa zakładka, w której można ustawić parametry analizy. Karta jest podzielona na trzy części: pola wymagane, pola podstawowe i pola zaawansowane. W wymaganych polach najpierw wybierz zestaw danych wyrażeń.
Następnie wybierz bazę danych zestawów genów z podłączonej strony internetowej lub z ręcznie zaimportowanego pliku zestawu genów. Edytuj etykiety fenotypów, aby wybrać grupy próbek, które mają być ze sobą porównane. Na przykład grupa chorobowa a zdrowa grupa kontrolna.
Następnie wybierz opcję zwiń zestaw danych do symboli genów równa się true, aby przetłumaczyć identyfikatory sondy w zestawie danych wyrażeń na oficjalne symbole genów Hugo używane w bazie danych zestawów genów. Wybierz wartość false, jeśli zestaw danych wyrażeń zawiera już symbole genów Hugo. Ustaw liczbę permutacji na ustawienie domyślne na 1 000.
Zmień typ permutacji na zestaw genów, ponieważ permutacja fenotypu jest zalecana tylko wtedy, gdy w każdym fenotypie jest więcej niż siedem próbek. Na koniec wybierz platformę chipową używaną do generowania danych o ekspresji genów z podłączonej strony internetowej lub z ręcznie zaimportowanego pliku adnotacji chipa DNA. W polach podstawowych edytuj nazwę analizy i sekcję Zapisz wyniki w tym folderze.
Ponadto można zmieniać inne parametry statystyczne. Więcej informacji na temat parametrów i sekcji pól zaawansowanych można znaleźć w podręczniku użytkownika GSEA. Jeśli stosowane są zewnętrznie obliczone metryki grupowe dla danych dotyczących ekspresji genów, należy użyć narzędzia GSEA wstępnie sklasyfikowanego.
Analiza ta jest przeprowadzana na podstawie prostej listy genów wstępnie przypisanych do wstępnie obliczonych wskaźników grupy, które są używane do klasyfikowania genów. Po załadowaniu alternatywnego pliku z ekspresją genów przejdź do głównego paska nawigacyjnego i kliknij Narzędzia, GseaPreranked. Podobnie otworzy się nowa zakładka do ustawiania parametrów analizy.
Następnie kliknij przycisk Uruchom w prawym dolnym rogu okna. Kliknij pomyślną analizę w sekcji raportu GSEA, aby otworzyć wyniki analizy. Następnie kliknij szczegółowe wyniki wzbogacania w formacie Excel, aby wyeksportować wyniki analizy do arkusza kalkulacyjnego.
Wyeksportuj wyniki oddzielnie dla obu fenotypów. W programie Excel połącz dane wyników w jednym pliku arkusza kalkulacyjnego. W celu późniejszego porównania danych dotyczących ekspresji genów z kilku badań, należy zachować co najmniej nazwę zestawu genów, jego znormalizowany wynik wzbogacenia i wartość FDR.
Powtórz analizę wzbogacenia zestawu genów dla drugiego badania i dla wszystkich dalszych badań, które mają być ze sobą porównane. Uwzględnij jak najwięcej badań klinicznych na ludziach i różnych modeli mysich, aby zidentyfikować optymalny model myszy dla pytania badawczego translacyjnego. Aby zidentyfikować optymalny model zwierzęcy do naśladowania sytuacji ludzkiej, należy porównać ze sobą wyniki GSEA ze wszystkich badań.
Użyj wyników wzbogacenia i wartości FDR, aby sklasyfikować szlaki jako aktywowane, hamowane lub żadne. W przypadku wielu badań, które mają być porównywane, zaleca się używanie skryptów języka R. Dla każdego porównania dwóch badań policz liczbę realizacji dziewięciu możliwych kombinacji regulacji szlaku, jak wskazano w tabeli kontyngencji trzy na trzy.
Oceń korelację między dwoma badaniami, obliczając dodatnią wartość predykcyjną i ujemną wartość predykcyjną, która z definicji jest częścią szlaków, które wykazują tę samą regulację w dwóch badaniach. Oszacuj również część ścieżek, które miały korelować tylko przez przypadek, reprezentowaną przez szansę ppv i szansę npv. Następnie oblicz przyrost informacji.
Wszystkie obliczenia można wykonać za pomocą programów do obsługi arkuszy kalkulacyjnych, ale zalecane jest korzystanie z funkcji R. Użyj tabeli kontyngencji pary badań, aby obliczyć wartość P za pomocą testu chi-kwadrat, na przykład za pomocą funkcji R, testu chi-kwadrat lub programów arkusza kalkulacyjnego. Przechowuj dane z tabeli kontyngencji w macierzy X.Następnie porównaj wyniki GSEA dla wszystkich kombinacji badań, które zostały wybrane do analizy.
Sortuj wszystkie kombinacje według przyrostu informacji. Aby porównać wiele zestawów danych, użyj macierzy i zwizualizuj wyniki za pomocą kolorowej mapy cieplnej. Wybierz model zwierzęcy o największym zysku informacji.
Aby ocenić znaczenie pozyskania informacji, należy również wziąć pod uwagę test chi-kwadrat. Przedstawiono tutaj macierz korelacji porównań ścieżek między badaniami na ludziach i myszach. Nakładanie się regulacji szlaku jest pokazane jako uzyskanie informacji, które można uzyskać z jednego badania w celu przewidzenia skutków w innym badaniu.
Kolor niebieski oznacza niską korelację, a czerwony oznacza wysoką korelację między danymi. Porównanie zestawów danych dotyczących ludzi i myszy ujawniło podgrupę modeli mysich, które były silnie skorelowane z badaniami na ludziach. Dlatego te modele myszy najlepiej nadają się do naśladowania sytuacji ludzkiej.
Natomiast badania siódme, ósme i dziewiąte nie wykazały korelacji z badaniami nad chorobami u ludzi. Po opanowaniu tej techniki można ją wykonać w ciągu kilku dni, jeśli zostanie wykonana prawidłowo. Zależy to od ilości danych i ich dostępności.
Podejmując się tej procedury, należy pamiętać, że ważność wyników zależy od jakości i trafności wybranych danych. Po obejrzeniu tego filmu powinieneś dobrze zrozumieć, jak wybrać odpowiedni model zwierzęcy dla konkretnej choroby ludzkiej na podstawie danych transkrypcyjnych.
Wyświetl pełny transkrypt i uzyskaj dostęp do tysięcy filmów naukowych
Ten artykuł przedstawia standaryzowany protokół analizy wzbogacania zestawów genów (GSEA) danych transkryptomowych w celu identyfikacji odpowiednich modeli mysich dla badań translacyjnych. Metoda porównuje dane z całego genomu między modelami zwierzęcymi a badaniami nad chorobami ludzkimi, dostarczając informacji na temat doboru modeli dla różnych chorób.
Selecting appropriate animal models remains a critical challenge in translational research, where model misalignment contributes to late-stage attrition. This protocol enables systematic evaluation of murine models using transcriptomic concordance with human disease data, reducing reliance on subjective gene filtering. By providing a standardized GSEA-based framework, it supports predictive confidence in model selection and informs go/no-go decisions early in discovery.
The method fits within the discovery continuum from target validation to preclinical model selection, enabling transcriptomic data to guide animal model choice before significant investment in screening or efficacy studies.