Artykuł metodologiczny

Analiza czynników ekspresji genów nowotworowych za pomocą portalu internetowego CorExplorer

DOI:

10.3791/60431

11 października 2019

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiamy portal internetowy CorExplorer, zasób do eksploracji czynników sekwencjonowania RNA nowotworów znalezionych przez algorytm uczenia maszynowego CorEx (Correlation Explanation) i pokazujemy, jak można analizować czynniki związane z przeżyciem, adnotacjami w bazie danych, interakcjami białko-białko i sobą nawzajem, aby uzyskać wgląd w biologię nowotworu i interwencje terapeutyczne.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Różnicowa analiza ekspresji genów jest ważną techniką dla zrozumienia stanów chorobowych. Algorytm uczenia maszynowego CorEx okazał się przydatny w analizie różnicowej ekspresji grup genów w sekwencyjnym RNA guza w sposób, który może być pomocny w rozwoju onkologii precyzyjnej. Jednak CorEx wytwarza wiele czynników, które mogą być trudne do przeanalizowania i połączenia z istniejącym zrozumieniem. Aby ułatwić takie połączenia, zbudowaliśmy stronę internetową CorExplorer, która umożliwia użytkownikom interaktywną eksplorację danych i odpowiadanie na często zadawane pytania związane z ich analizą. Przeszkoliliśmy CorEx na danych dotyczących ekspresji genów sekwencyjnych RNA dla czterech typów nowotworów: jajnika, płuc, czerniaka i jelita grubego. Następnie włączyliśmy do strony internetowej odpowiednie przeżycia, interakcje białko-białko, wzbogacenie szlaków Gene Ontology (GO) i Kyoto Encyclopedia of Genes and Genomes (KEGG) oraz mapy cieplne w celu powiązania z wizualizacją wykresu czynnikowego. W tym miejscu wykorzystujemy przykładowe protokoły, aby zilustrować wykorzystanie bazy danych do zrozumienia znaczenia poznanych czynników nowotworowych w kontekście tych danych zewnętrznych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Od czasu wprowadzenia nieco ponad dekadę temu, sekwencja RNA stała się wszechobecnym narzędziem do pomiaru ekspresji genów1. Dzieje się tak dlatego, że umożliwia szybkie i tanie profilowanie de novo całego transkryptomu próbki. Jednak dane dotyczące guza z sekwencją RNA odzwierciedlają podstawową biologię, która jest wewnętrznie złożona i często niedostatecznie próbkowana, podczas gdy same dane są wielowymiarowe i zaszumione. Stanowi to poważne wyzwanie dla ekstrakcji wiarygodnych sygnałów. Algorytm CorEx wykorzystuje wielowymiarowe informacje wzajemne, aby znaleźć subtelne wzorce w takich sytuacjach2,3 . Technika ta została wcześniej zaadaptowana do analizy próbek RNA guza jajnika z Atlasu Genomu Raka (TCGA) i w tym kontekście wydaje się, że ma znaczące zalety w porównaniu z częściej stosowanymi metodami analizy4.

Chociaż użycie sekwencjonowania RNA jest niezwykle rozpowszechnione w zastosowaniach badawczych, w tym w onkologii, wysiłki te nie doprowadziły do szerokiego zastosowania dla celów interwencji klinicznych5. Jednym z powodów takiego stanu rzeczy jest brak przyjaznych dla użytkownika algorytmów i oprogramowania ukierunkowanego na te konkretne problemy. Aby wypełnić tę lukę, zaprojektowaliśmy portal internetowy CorExplorer, aby umożliwić naukowcom z różnych środowisk badanie czynników ekspresji genów w próbkach sekwencyjnych RNA guza, znalezionych przez algorytm uczenia maszynowego CorEx. Portal CorExplorer obsługuje interaktywną wizualizację i odpytywanie czynników z kilku różnych typów nowotworów, w tym płuc, okrężnicy, czerniaka i jajnika6,7,8,9,10, z zamiarem pomocy badaczom w przesiewaniu korelacji danych i identyfikowaniu potencjalnych ścieżek stratyfikacji pacjentów do celów terapeutycznych.

Spodziewamy się, że portal CorExplorer może być przydatny dla kilku typów użytkowników. Portal został zaprojektowany z myślą o użytkownikach, którzy chcą zrozumieć szerokie czynniki wpływające na różnice w ekspresji genów nowotworowych w publicznych bazach danych, a być może także umieścić indywidualne profile ekspresji genów w kontekście nowotworów o podobnej charakterystyce. Oprócz przedstawionych tutaj reprezentatywnych protokołów, badania CorExplorer mogą służyć jako punkt wyjścia do sugerowania hipotez do dalszych testów, porównywania i kontrastowania wyników CorEx na zestawach danych poza CorExplorer oraz do łączenia patologicznych sygnatur ekspresji jednego lub kilku genów w pojedynczym guzie z większymi grupami, które mogą być skoordynowanie dotknięte. Wreszcie, może służyć jako przyjazne dla użytkownika wprowadzenie do zastosowania uczenia maszynowego do sekwencjonowania RNA dla osób rozpoczynających pracę w tej dziedzinie.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Badanie czynników zawierających interesujący nas gen

  1. Otwórz przeglądarkę internetową i przejdź do http://corex.isi.edu, strony głównej CorExplorer.
  2. Po prawej stronie, w sekcji Szybkie linki, kliknij przycisk + rozwiń obok pozycji Jajnik (TCGA-OV), aby wyświetlić podsumowanie wykresu czynnika CorEx, który został wytrenowany na danych dotyczących raka jajnika TCGA (pokazanych w Rysunek 1). Opcjonalnie kliknij inne, aby porównać.
  3. Po zakończeniu sprawdzania wykresów czynników kliknij Płuca (TCGA-LUAD), aby uzyskać dostęp do strony CorExplorer dla sekwencji RNA raka płuc.
    1. Zapoznaj się z wykresem czynnika CorEx dla interesującego genu za pomocą okna "Wykres czynnika" CorExplorer.
      1. Najedź kursorem myszy na okno wyświetlania wykresu czynnikowego. Powiększ wykres czynników za pomocą kółka przewijania myszy lub gładzika, aby zobaczyć szczegóły wykresu, takie jak najważniejsze geny w każdym czynniku i połączenia między węzłami na różnych warstwach. Możesz też kliknąć i przeciągnąć, aby przesunąć obszar obserwacji lub dowolny węzeł.
      2. Aby znaleźć gen docelowy (tutaj użyjemy BRCA1), kliknij menu rozwijane Gen w górnej części okna wykresu czynnikowego. Wpisz "BRCA1", aby wybrać go z listy rozwijanej i naciśnij Return, aby powiększyć widok do czynnika 26, współczynnika, z którym BRCA1 jest najsilniej skorelowany.
      3. Umieść kursor myszy na ekranie wykresu i przewiń, aby pomniejszyć, aby wyświetlić węzeł poziomu 2, L2_8 i skojarzone z nim czynniki, które są sąsiadami czynnika 26. Należy pamiętać, że wyświetlane są tylko geny o wadze większej niż próg wskazany na suwaku Min link weight.
      4. Aby zobaczyć wszystkie geny powiązane z tym czynnikiem, kliknij węzeł L1_26 i wybierz opcję Załaduj dodatkowe geny w wyskakującym okienku. Gdy pojawi się słowo "Gotowe", zamknij wyskakujące okienko.
      5. Teraz wróć do sekcji nagłówka nad oknem wykresu czynnikowego i chwyć i przeciągnij modyfikator Min. Teraz, gdy suwak wagi ogniwa zostanie przesunięty w dół do 0,05, inne geny czynnika L1_26, w tym BRCA2, pojawią się w kolejności wagowej. Opcjonalnie zmień położenie węzłów, chwytając i przeciągając, aby poprawić układ.
    2. Określ, w jaki sposób stratyfikacja pacjentów w odniesieniu do czynnika wpływa na przeżycie, pytając w oknie przeżycia.
      1. W oknie przeżycia odznacz opcję Sortuj według p-wartość, a następnie wybierz czynnik 26 z menu rozwijanego Pojedynczy czynnik, aby wyświetlić krzywe przeżycia dla czynnika 26.
      2. Przewiń w dół wykres przeżycia, aby pokazać liczbę zagrożonych pacjentów wzdłuż osi x.
    3. Znajdź powiązania z funkcją biologiczną, wysyłając zapytanie w oknie Adnotacja.
      1. W oknie adnotacji, aby posortować menu rozwijane Czynnik według numeru czynnika, a nie wskaźnika fałszywych wykryć (FDR), usuń zaznaczenie opcji Sortowanie FDR.
      2. Przewiń i kliknij, aby wybrać czynnik 26 z listy rozwijanej okna adnotacji, aby wyświetlić adnotacje wzbogacenia dla współczynnika.
      3. Przewiń listę adnotacji w dół, aż widoczna będzie naprawa DNA, a następnie kliknij ją, aby natychmiast zobaczyć powiązane geny podświetlone na żółto na ekranie wykresu. Zobacz środkowy panel Rysunek 2.
      4. Należy zauważyć, że czynniki znikają lub pojawiają się w miarę wybierania różnych terminów GO, w zależności od tego, czy są one wzbogacone o geny z wybraną adnotacją, np. "wewnętrzny apoptotyczny szlak sygnałowy w odpowiedzi na uszkodzenie DNA".
    4. Zapoznaj się z tymi czynnikami, dodając okna o różnych funkcjach.
      1. Na górnym pasku menu dodaj okno sieci interakcji białko-białko (PPI), wybierając PPI z listy rozwijanej Dodaj okno, a następnie kliknij przycisk Dodaj, aby dodać okno wykresu PPI do obszaru wyświetlania. W oknie wykresu PPI wybierz współczynnik "Warstwa1: 26", aby pokazać interakcje białko-białko. Zwróć uwagę na gęstość połączeń.
      2. Na górnym pasku menu, zamiast PPI, wybierz Mapa ciepła z listy rozwijanej Dodaj okno, a następnie kliknij przycisk Dodaj, aby dodać okno mapy ciepła do obszaru wyświetlania. W oknie mapy cieplnej wybierz współczynnik "Warstwa1: 26", aby wyświetlić wzorce ekspresji genów.
      3. Chwyć i zmień położenie okna mapy cieplnej tak, aby okno przetrwania było również widoczne. Wzdłuż górnej części mapy cieplnej obserwuj, jak pomarańczowy/niebieski/szary pasek odpowiada warstwom ryzyka pacjenta na wykresie przeżycia. Wyniki są pokazane na dole Rysunek 2.

2. Filtrowanie i interpretacja czynników CorEx na podstawie danych o wadze genów, przeżyciu i adnotacjach

  1. Filtrowanie pod kątem czynników zainteresowania przy użyciu przeżycia i jakości klastra.
    1. Z menu rozwijanego Dataset (Zestaw danych) u góry wybierz TCGA_OVCA, aby przejść do strony CorExplorer dla sekwencji RNA raka jajnika TCGA.
    2. Po załadowaniu strony należy zauważyć w oknie przeżycia, że współczynnik o największej różnicy przeżycia dla różnych warstw wynosi 114.
    3. W górnej części okna wykresu czynników wybierz "Warstwa1: 114" z listy rozwijanej Czynnik.
    4. Chwyć suwak wagi linku za pomocą myszy i przesuń go w górę do 0.5. Należy zauważyć, że duża liczba genów w czynniku 114 (1609), z których żaden nie ma masy >0,35, wskazuje na stosunkowo słabe grupowanie.
    5. Następnie należy rozwinąć listę czynników w oknie przeżycia i wybrać następny najlepszy czynnik z listy rozwijanej okna przeżycia, czynnik 39, aby wyświetlić powiązane z nim krzywe przeżycia.
    6. Wybierz czynnik 39 w oknie adnotacji, klikając na niego. Pokazane są znaczące adnotacje GO i KEGG.
  2. Aby lepiej zrozumieć biologiczną rolę genów w czynniku 39, zinterpretuj czynniki za pomocą informacji o adnotacjach sąsiedztwa w następujący sposób.
    1. W górnej części okna wykresu czynnika wybierz czynnik "Warstwa1: 39" z listy rozwijanej współczynnika. Następnie najedź myszką na okno wykresu czynnikowego i pomniejsz je, aby odsłonić cały klaster L2_14 z 6 czynnikami: 14, 32, 39, 42, 52 i 82 (pokazanymi w Rysunek 3).
    2. Aby zrozumieć względne znaczenie czynników związanych z węzłem L2_14, zacznij od wyświetlenia różnic w przeżywalności dla każdego z L2_14 czynników. Usuń zaznaczenie opcji Sortuj według p-val w oknie przetrwania, a następnie kliknij kolejno na każdą z liczb czynników. Robiąc to, zwróć uwagę, że tylko czynniki 14, 32 i 39 wykazują związek z przeżyciem.
    3. Teraz z górnego paska menu ponownie wybierz PPI z listy rozwijanej Dodaj okno. Naciśnij przycisk Dodaj, aby dodać okno wykresu PPI do obszaru wyświetlania. W oknie wykresu PPI wybierz współczynnik "Warstwa1: 52", aby pokazać interakcje białko-białko, które są istotne. Przykładowy układ okien w tym miejscu pokazany jest w Rysunek 3.
    4. Kliknij łącze View at StringDB (Wyświetl w bazie danych StringDB) u dołu okna PPI, aby połączyć się z internetową bazą danych StringDB. Kliknij przycisk Kontynuuj na pierwszym ekranie, a następnie wybierz kartę Analiza poniżej wykresu sieci, tak jak poprzednio, aby uzyskać analizę GO online dla genów sieci PPI. Najważniejszym składnikiem komórkowym jest "kompleks białkowy MHC klasy II".
    5. Wróć do zakładki CorExplorer i okna PPI i wybierz współczynnik 32, tym razem z listy rozwijanej współczynnika. Kliknij łącze Wyświetl w bazie danych StringDB do analizy bazy danych StringDB. Najważniejszym składnikiem komórkowym jest "kompleks białkowy MHC klasy I", w przeciwieństwie do klasy II dla czynnika 52 w poprzednim kroku!
    6. Na koniec wróć do okna PPI i wybierz "Warstwa 1: 39" z menu rozwijanego czynnika u góry. Kliknij łącze Wyświetl w bazie danych StringDB, aby utworzyć łącze do analizy bazy danych StringDB.
    7. Kliknij przycisk Kontynuuj na pierwszym ekranie, a następnie wybierz kartę Analiza poniżej wykresu sieci, aby uzyskać analizę GO online dla genów sieci PPI. Zauważ, że główną funkcją molekularną jest "wiązanie receptora chemokiny CXCR3".

3. Korzystanie z adnotacji o przeżyciu i bazie danych w celu poszukiwania obiecujących kombinacji terapeutycznych

  1. Przełącz się na CorExplorer czerniaka TCGA, wybierając TCGA_SKCM z menu rozwijanego Dataset (Zestaw danych).
  2. Należy zauważyć, że czynnikiem o największej różnicy przeżycia jest czynnik 171. Zbadaj adnotacje czynnika 171, przewijając i zauważ, że "odpowiedź immunologiczna" i "szlak sygnałowy za pośrednictwem cytokin" znajdują się na górze (tak jak w przypadku najwyższego czynnika jajnika).
  3. Aby znaleźć czynnik komplementarny, należy zapoznać się z najważniejszymi czynnikami związanymi z przeżyciem wraz z ich najważniejszymi terminami adnotacji. Aby to zrobić, kliknij link Przegląd zbioru danych na górnym pasku menu, aby otworzyć osobną zakładkę zawierającą tabelę ze szczegółami przetwarzania zbioru danych, a także podsumowanie najważniejszych czynników według wartości p różnicy przeżycia. Należy pamiętać, że pierwszym czynnikiem nieimmunologicznym jest 88.
  4. Wróć do karty przeglądarki TCGA_SKCM.
  5. Wybierz współczynnik 88 w oknach przeżycia, adnotacji i wykresu. Kilka najpopularniejszych terminów GO jest związanych z "przetwarzaniem rRNA" i "organizacją mitochondrium", co potwierdza, że różni się od czynników związanych z odpornością.
  6. W oknie przeżycia, na liście rozwijanej sparowanych czynników, wybierz "88_171", aby zobaczyć, jak poprawia się przeżycie pacjentów z warstwy środkowej dla połączonych czynników ekspresji 171 i 88. Adnotacje i porównania przeżycia są zilustrowane na Rysunek 4.

4. Znajdowanie podobieństw i różnic w zmienności ekspresji genów w różnych typach nowotworów za pomocą strony Szukaj

  1. Kliknij nagłówek CorExplorer, aby powrócić do strony głównej.
  2. Kliknij Szukaj na górnym pasku menu, aby przejść do strony umożliwiającej przeszukiwanie wszystkich zestawów danych w witrynie CorExplorer.
  3. W polu wyszukiwania genów wpisz "FLT1" (VEGFR1) i naciśnij Return lub naciśnij Szukaj. FLT1 występuje ze stosunkowo dużą masą w następujących czynnikach: OVCA - 76, LUAD - 162, SKCM - 195 i SKCM - 184, a także COAD - 112 i COAD - 74.
  4. Możesz też wyszukać powiązany termin języka GO we wszystkich zestawach danych. Spróbuj tego w polu "GO Search", wpisując "angiogeneza" i naciskając Return lub naciskając Szukaj. Wszystkie czynniki FLT1, z wyjątkiem SKCM-195, są wymienione jako statystycznie wzbogacone dla genów "angiogenezy" – czynnik 195 w rzeczywistości ma adnotację, ale poniżej domyślnego progu 10-8. Wyniki wyszukiwania dla tego i poprzedniego kroku są pokazane w Rysunek 5.
  5. Jako dalsze przykłady, w polu wyszukiwania GO najpierw wpisz "receptor naskórkowego czynnika wzrostu". Tylko LUAD jest wzbogacony o ten termin, dobrze znany czynnik stratyfikacji raka płuc. Następnie wpisz "mezenchymalny" w polu wyszukiwania. Termin ten jest wzbogacony w grupy ekspresji genów dla OVCA, gdzie jest dobrze zbadanym czynnikiem stratyfikacji.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wyszukiwanie genu 'BRCA1' w zestawie danych dotyczących raka płuc ujawnia, że jest on najsilniej związany z czynnikiem CorEx 26 (Rysunek 2). Uważa się, że wzbogacenie terminu GO dla tego czynnika jest niezwykle wysokie, a naprawa DNA wykazuje FDR tylko 1 x 10-19. Selekcja zwraca również uwagę na L2_8 klastra drugiego poziomu, który w dzieciństwie ma sześć ściśle powiązanych ze sobą czynników. Wybranie opcji "Naprawa DNA" w adnotacjach do terminów GO lub w menu rozwijanym wzbogaconym GO wykresu czynników podkreśla powiązane geny w każdym z czynników, przy czym czynnik 26 ma zdecydowanie najwięcej, zgodnie z oczekiwaniami11. Sieć interakcji białko-białko jest silnie powiązana, co dodatkowo wspiera ściśle powiązaną funkcjonalność genów czynnika 26. Powiązany wykres przeżycia sugeruje możliwy związek z przeżyciem pacjenta, ale musiałoby to zostać potwierdzone w większym zbiorze danych.

Zaczynając od przeżycia, można pozwolić na analizę przyczyn poprawy przeżywalności związanych z określonymi grupami ekspresji genów. Na przykład głównym czynnikiem wpływającym na przeżywalność raka jajnika jest liczba 39, która jest silnie wzbogacona o geny związane z układem odpornościowym (Ryc. 3). Pięć innych czynników związanych z tym samym węzłem poziomu 2 jest również wskazanych jako związane z odpornością, jednak wpływ na przeżycie wydaje się być wśród nich silnie zmienny, przy czym 39 oznacza najwyższy, a 52 najniższy. Dodanie okna interakcji białko-białko dla czynnika pokazuje sieć natychmiastowej interakcji i pozwala na połączenie ze stroną internetową StringDB12 w celu zapytania o różne wzbogacenia dla genów sieci PPI. Robiąc to dla każdego z L2_14 czynników po kolei, stwierdzamy, że wzbogacenie StringDB dla genów sieci PPI sugeruje następujące możliwe wyjaśnienie powiązań z przeżyciem. Czynnik 32 zawiera geny tworzące kompleks białkowy klasy I głównego kompleksu zgodności tkankowej (MHC), który jest rozpoznawany przez cytotoksyczne limfocyty T. Czynnik 39 odpowiada sygnalizacji cytokin i wiązaniu receptora CXCR3, związanym z limfocytami T CD8 +. Wydaje się, że oba te czynniki dają znaczną przewagę w zakresie przeżycia pacjentom wykazującym stosunkowo wysoką ekspresję odpowiednich genów. Cytotoksyczne limfocyty T CD8+ są przede wszystkim odpowiedzialne za odporność przeciwnowotworową. Z drugiej strony czynnik 52 składa się z genów kodujących białka w kompleksie MHC klasy II, które są rozpoznawane głównie przez limfocyty T CD4 +, a nie bezpośrednio przez cytotoksyczne limfocyty T. Pozostałe czynniki L2_14 odzwierciedlają uogólnioną aktywację układu odpornościowego, która nie różnicuje tych dwóch typów populacji limfocytów. Związek przeżycia specyficzny dla cytotoksycznego rozpoznawania antygenów komórkowych MCH klasy I przez limfocyty T jest zgodny z naszym zrozumieniem odporności przeciwnowotworowej w ogóle i z innych nowotworów, takich jak czerniak13,14.

Portal internetowy wspiera odkrywanie par czynników o uzupełniających się funkcjach, które mogą sugerować skuteczne terapie skojarzone specyficzne dla nowotworu. Przegląd zestawu danych można przeskanować pod kątem czynników, które wykazują korelację z przeżyciem, ale mają wyraźne wzbogacenia GO. W przypadku czerniaka (TCGA_SKCM; Rysunek 4), widać, że najwyższy czynnik przeżycia 171 jest związany z odpornością, podczas gdy czynnik 88 na dole listy pokazuje wzbogacenie genów związanych z organizacją mitochondrium. Rzeczywiście, zostało to zasugerowane jako cel w czerniaku15. Dodanie okien przeżycia do strony CorExplorer umożliwia porównanie stratyfikacji przy użyciu pary czynników z każdym czynnikiem z osobna, pokazując, że korzystne wzorce ekspresji genów z obu grup wykazują lepszy trend przeżycia niż dla każdego czynnika osobno. Wydaje się jednak, że górna warstwa nie uległa poprawie, co sugeruje, że tylko immunoterapia może być najlepszą opcją dla niektórych pacjentów.

Podobieństwa i różnice między nowotworami można zobaczyć, przeszukując zestawy danych pod kątem genów lub terminów GO (Rysunek 5). Na przykład FLT1 (znany również jako VEGFR1) jest dobrze przebadanym markerem proangiogennym16,17. Po umieszczeniu w pasku wyszukiwania, wszystkie nowotwory mają czynniki, w których FLT1 odgrywa główną rolę. I odwrotnie, gdy termin GO "angiogeneza" jest wprowadzany na stronie wyszukiwania, 5 z 6 grup FLT1 pojawia się z tym wzbogaceniem. Wszystkie czynniki FLT1, z wyjątkiem SKCM-195, są wymienione jako statystycznie wzbogacone dla genów "angiogenezy". Szósty czynnik faktycznie ma adnotację, ale poniżej domyślnego progu 10-8. Gdy waga na liście czynników jest wykorzystywana w alternatywnym kalkulatorze wzbogacenia, np. Analiza wzbogacenia zestawu genów (GSEA)18, okazuje się, że szósty czynnik jest również znacznie wzbogacony dla genów "angiogenezy".

Ważne jest, aby sprawdzić mapy cieplne, aby upewnić się, że wzór ekspresji genów jest odpowiedniej jakości, aby wspierać interpretacje biologiczne. Mapy cieplne, które pokazują silną, wyraźną zmienność, mogą wykazywać skoordynowaną ekspresję genów czynnika w zakresie od niskiego do wysokiego lub bardziej złożone wzorce, przy czym niektóre geny mają niską ekspresję skorelowaną z innymi o wysokiej (Rysunek 6). Kluczowym markerem wysokiej jakości grupowania jest obecność kilku genów o płynnej zmienności ekspresji w funkcji wyniku czynnikowego. Mapy cieplne czynników pokazują próbki uporządkowane według wyniku czynnika, dlatego powinien istnieć płynny gradient poruszający się od lewej do prawej. Może się to jednak nie zdarzyć na co najmniej dwa różne sposoby. Najczęściej korelacje mogą być bardzo hałaśliwe (Rysunek 5C), co stawia pod znakiem zapytania solidność i użyteczność jakichkolwiek wniosków dotyczących przeżycia i/lub funkcji biologicznych. Ponadto wzorce, które występują tylko w niewielkiej mniejszości próbek, mogą nie być zgodne z modelem trzech stanów wyrażeń przyjętych przez algorytm CorEx, co skutkuje mylącą klasyfikacją próbek (prawa strona Rysunek 5D).

figure-results-1
Rysunek 1: Strona główna CorExplorer. Po kliknięciu + obok Rak jajnika w sekcji Szybkie linki wyświetlane są szczegóły wykresu czynników. Model hierarchiczny CorEx składa się ze zmiennych wejściowych (w tym przypadku ekspresji genów) w dolnej warstwie i wywnioskowanych czynników utajonych w warstwach wyższych. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-2
Rysunek 2: Użycie nazwy genu do kierowania badaniami. Rysunek przedstawia serię zrzutów ekranu ilustrujących badanie czynników raka płuc CorEx silnie związanych z BRCA1. Po pierwsze, wybranie opcji "BRCA1" w polu rozwijanym Gen dla wykresu czynnika powoduje, że widok wykresu powiększa się o czynnik, dla którego BRCA1 ma największą wagę. Nieznaczne pomniejszenie kadruje węzeł warstwy drugiej L2_8 łącząc ten czynnik z innymi powiązanymi. Przeżycie i adnotacje można porównać: kliknięcie na termin GO Naprawa DNA podświetla oznaczone geny. Dodawane jest okno PPI, aby pokazać interakcje sieciowe dla genów w czynniku. Użycie przycisku Dodaj okno w celu dodania mapy cieplnej pokazuje powiązanie wzorców ekspresji z przeżyciem, co sugeruje, że zwiększona ekspresja genów naprawy DNA może być związana ze zmniejszonym przeżyciem. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-3
Rycina 3: Wykorzystanie danych klinicznych (przeżycia) do kierowania badaniami. Badanie najważniejszego czynnika związanego z przeżyciem (39) dla raka jajnika ujawnia interesujące relacje między sąsiednimi czynnikami. Po wybraniu czynnika 39 na wykresie czynnika i niewielkim pomniejszeniu, okazuje się, że czynnik warstwy drugiej powiązany z czynnikiem 39 ma pięć innych powiązanych czynników. Dodatkowy przedział czasu przeżycia umożliwia bezpośrednie porównanie powiązanych różnic w przeżywalności. Czynniki 39 i 32 wykazują dodatnią korelację przeżycia, w przeciwieństwie do czynnika 52, który jej nie wykazuje. Sieci interakcji białko-białko są dobrze zdefiniowane. Powiązanie z StringDB umożliwia porównanie adnotacji GO (nie pokazano): Czynnik 39 jest związany z siecią sygnalizacji cytokin związaną z cytotoksyczną aktywacją limfocytów T CD8 +, a czynnik 32 jest zdominowany przez białka prezentujące antygen MHC klasy I, które wywołują rozpoznawanie przez takie limfocyty; sąsiednie czynniki są jednak zdominowane przez inne składniki układu odpornościowego, takie jak limfocyty T pomocnicze CD4 + i nie wykazują korelacji w zakresie przeżycia. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-4
Rycina 4: Badanie najważniejszych czynników przeżycia sugeruje potencjalne kombinacje terapeutyczne. Link "Zestawy danych" na pasku menu strony głównej prowadzi do zwięzłej tabeli czynników przeżycia uporządkowanych według wartości p, wraz z adnotacją GO na górze (nie pokazaną). Wykorzystując te informacje w przypadku czerniaka, połączenie czynnika 171 dla funkcji immunologicznej z czynnikiem 88 dla organizacji mitochondriów wydaje się komplementarne. Na rysunku przedstawiono okna adnotacji dla każdego z czynników obok siebie, aby je skontrastować. Krzywe przeżycia dla pacjentów stratyfikowanych przez te dwa czynniki pojedynczo lub razem wskazują, że połączenie zwiększa różnicę w przeżyciu w porównaniu z każdym z tych czynników osobno. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-5
Ryc. 5: Strona wyszukiwania ułatwia analizę pan-raka. Geny lub terminy procesów biologicznych GO można wyszukiwać we wszystkich zestawach danych za pomocą linku Szukaj na stronie głównej. Rysunek przedstawia wyniki wyszukiwania dla genu FLT1 i terminu GO "angiogeneza". Wyniki wskazują na obecność FLT1 w czynnikach oznaczonych terminem "angiogeneza" w różnych nowotworach. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

figure-results-6
Rysunek 6: Mapy cieplne można wykorzystać do jakościowej oceny korelacji między genami i próbkami zgodnie z wynikiem czynnika. Wysokiej jakości relacje ekspresji genów są pokazane przez płynną gradację, gdy pacjenci są uporządkowani według wyniku czynnika na mapach cieplnych. Mapa cieplna po lewej stronie dla czynnika 18 jest jednym z przykładów. Wzorce mogą również obejmować złożone sygnatury ekspresji w górę i w dół, jak w środkowej dużej mapie cieplnej dla czynnika 11. Wzorce o niższej jakości czasami pokazują nagłe zmiany w ekspresji dla podgrupy pacjentów, jak na mapie cieplnej czynnika 9 po prawej stronie, lub proste, bardzo hałaśliwe korelacje, jak na mapie cieplnej czynnika 161 w prawym dolnym rogu. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zaprezentowaliśmy stronę CorExplorer, publicznie dostępny serwer WWW do interaktywnej eksploracji maksymalnie skorelowanych czynników ekspresji genów poznanych z sekwencji RNA guza za pomocą algorytmu CorEx. Pokazaliśmy, w jaki sposób strona internetowa może być wykorzystywana do stratyfikacji pacjentów według ekspresji genów nowotworowych oraz jak taka stratyfikacja odpowiada funkcji biologicznej i przeżyciu.

Zbudowano inne serwery sieciowe do analizy sekwencyjnej RNA. Analiza różnicowa i koekspresja nowotworów może być badana i integrowana z innymi typami danych w cbioPortal 19,20. Serwery GenePattern21, Mev22 i Morpheus23 zawierają sprawdzone techniki grupowania, takie jak analiza głównych składowych (PCA), kmeans lub samoorganizujące się mapy (SOM). Bardziej innowacyjne działania obejmują CamurWeb24, oparty na automatycznym klasyfikatorze generującym reguły, oraz TACCO25, który implementuje losowe klasyfikatory lasu i lasso. Zastosowany tutaj algorytm CorEx optymalizuje informacje wielowymiarowe w celu znalezienia hierarchii czynników, które wyjaśniają wzorce w danych. Wydaje się, że nieliniowe i hierarchiczne uczenie się czynników zapewnia lepszą interpretowalność w stosunku do liniowych czynników globalnych znalezionych za pomocą PCA4. Dodatkowo, precyzyjna analiza sygnałów próbek w ramach tej techniki umożliwia precyzyjne porównania guzów z częściej stosowanymi szerokimi podtypami. To połączenie nakładającej się i hierarchicznej analizy czynnikowej odróżnia CorExplorer od większości innych podejść i wymaga nowych narzędzi do wizualizacji i podsumowania.

Kluczową częścią analizy czynnikowej CorExplorer jest możliwość zbadania nie tylko kilku, ale ponad 100 czynników z informacyjnymi wzorcami genów, które są umieszczone w nakładającej się hierarchii. CorExplorer ułatwia eksplorację tych niezliczonych czynników w celu uzyskania powiązań biologicznych i klinicznych oraz pozwala na wyjątkowo szczegółową charakterystykę poszczególnych nowotworów. Nienadzorowane uczenie się tak dużej liczby czynników oznacza, że nie wszystkie będą miały znaczenie dla biologii choroby. W takim przypadku konieczne jest użycie adnotacji lub znanych genów w celu wyodrębnienia interesujących czynników lub wyszukania czynników związanych z danymi klinicznymi, takimi jak przeżycie. W ten sposób CorExplorer pozwala użytkownikom zaimplementować ten bardzo ważny krok filtrowania. Obecność wzorców genów czynnikowych w guzie może nawet sugerować podejście do spersonalizowanego leczenia onkologicznego. Co więcej, mnogość wyników czynników dla każdego nowotworu, która pozwala na odkrycie potencjalnie użytecznych kombinacji terapeutycznych.

Czasami zdarza się, że nie pojawiają się żadne znaczące adnotacje GO dla czynników silnie skorelowanych z przeżyciem. Chociaż może się to zdarzyć z powodu zaszumionych lub niedostatecznie pobranych próbek, istnieją inne możliwe przyczyny, takie jak rozmiar klastra, który jest zbyt mały, aby zarejestrować znaczące wyniki wzbogacenia lub grupa będąca "koszykiem" pojedynczych genów z różnych szlaków bez spójnego związku biologicznego. Ponadto odpowiednia może być kategoria adnotacji inna niż w procesie biologicznym KEGG i GO, np. kompartment komórkowy. Dostęp do nich można uzyskać, łącząc się z bazą danych StringDB, jak pokazano w protokole. Analiza wzbogacania ontologii genów na stronie CorExplorer obecnie nie uwzględnia wagi genów w czynniku, chociaż prawdopodobnie zostanie to naprawione w najbliższej przyszłości. Zwróć uwagę, że w oknie "Dodaj dostępną jest opcja listy genów", która umożliwia pobranie pełnej listy genów czynnika w celu dalszej analizy za pomocą narzędzi zewnętrznych.

Na potrzeby strony internetowej CorEx został uruchomiony na każdym ze zbiorów danych pięć razy, a przebieg, który doprowadził do największej ogólnej korelacji, został zachowany. Posiadanie statystycznej reprezentacji wyników wielu serii może być bardziej pouczające i stanowi cel przyszłych prac. Ponadto zestaw typów nowotworów dostępnych na serwerze jest raczej niewielki, ale spodziewamy się, że z czasem będzie się rozszerzał w zależności od zainteresowania użytkowników.

Jak opisano powyżej, CorExplorer wizualizuje relacje między czynnikami sekwencyjnymi RNA CorEx wraz z informacjami klinicznymi i informacjami z bazy danych, umożliwiając w ten sposób wiele różnych trybów zapytania. Mamy nadzieję, że to narzędzie doprowadzi do dalszych prac nad wykorzystaniem mocy analizy sekwencyjnej RNA do odkryć i zastosowań klinicznych w onkologii.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy oświadczają, że nie mają konkurencyjnych interesów finansowych.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

GV był wspierany przez DARPA award W911NF-16-0575.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Serwer publiczny dla strony CorExplorer USChttp://corex.isi.eduIntel Xeon E5-2690 4-rdzeniowy 2,6 GHz, 8GB RAM. Architektura backendowa to LAMP: Linux, Apache, MySQL, PHP.
Przeglądarka internetowa: Google/AppleChrome/SafariZweryfikowane przeglądarki internetowe.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Petryszak, R., et al. The RNASeq-er API-a gateway to systematically updated analysis of public RNA-seq data. Bioinformatics. 33, 2218-2220 (2017).
  2. Steeg, G. V., Galstyan, A. Maximally Informative Hierarchical Representations of High-Dimensional Data. Proceedings of the Eighteenth International Conference on Artificial Intelligence and Statistics (AISTATS). , San Diego, CA. (2015).
  3. Ver Steeg, G., Galstyan, A. Discovering structure in high-dimensional data through correlation explanation. Advances in Neural Information Processing Systems. , Montreal, Canada. (2014).
  4. Pepke, S., Ver Steeg, G. Comprehensive discovery of subsample gene expression components by information explanation: therapeutic implications in cancer. BMC medical Genomics. 10, 12(2017).
  5. Byron, S. A., Van Keuren-Jensen, K. R., Engelthaler, D. M., Carpten, J. D., Craig, D. W. Translating RNA sequencing into clinical diagnostics: opportunities and challenges. Nature Reviews Genetics. 17, 257(2016).
  6. Cancer Genome Atlas Research Network. Comprehensive molecular profiling of lung adenocarcinoma. Nature. 511, 543(2014).
  7. Cancer Genome Atlas Network. Comprehensive molecular characterization of human colon and rectal cancer. Nature. 487, 330(2012).
  8. Akbani, R., et al. Genomic classification of cutaneous melanoma. Cell. 161, 1681-1696 (2015).
  9. Cancer Genome Atlas Research Network. Integrated genomic analyses of ovarian carcinoma. Nature. 474, 609(2011).
  10. Grossman, R. L., et al. Toward a shared vision for cancer genomic data. New England Journal of Medicine. 375, 1109-1112 (2016).
  11. Moynahan, M. E., Chiu, J. W., Koller, B. H., Jasin, M. Brca1 controls homology-directed DNA repair. Molecular Cell. 4, 511-518 (1999).
  12. Szklarczyk, D., et al. STRING v11: protein–protein association networks with increased coverage, supporting functional discovery in genome-wide experimental datasets. Nucleic Acids Research. 47, 607-613 (2018).
  13. Durgeau, A., Virk, Y., Corgnac, S., Mami-Chouaib, F. Recent advances in targeting CD8 T-cell immunity for more effective cancer immunotherapy. Frontiers in Immunology. 9, 14(2018).
  14. Sato, E., et al. Intraepithelial CD8+ tumor-infiltrating lymphocytes and a high CD8+/regulatory T cell ratio are associated with favorable prognosis in ovarian cancer. Proceedings of the National Academy of Sciences of the United States of America. 102, 18538-18543 (2005).
  15. De Moura, M. B., et al. Mitochondrial respiration-an important therapeutic target in melanoma. PLoS One. 7, 40690(2012).
  16. Folkman, J., Merler, E., Abernathy, C., Williams, G. Isolation of a tumor factor responsible for angiogenesis. Journal of Experimental Medicine. 133, 275-288 (1971).
  17. Takahashi, S. Vascular endothelial growth factor (VEGF), VEGF receptors and their inhibitors for antiangiogenic tumor therapy. Biological and Pharmaceutical Bulletin. 34, 1785-1788 (2011).
  18. Subramanian, A., et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proceedings of the National Academy of Sciences of the United States of America. 102, 15545-15550 (2005).
  19. Cerami, E., et al. The cBio Cancer Genomics Portal: An Open Platform for Exploring Multidimensional Cancer Genomics Data. Cancer Discovery. 2, 401-404 (2012).
  20. Gao, J., et al. Integrative Analysis of Complex Cancer Genomics and Clinical Profiles Using the cBioPortal. Science Signalling. 6, 1(2013).
  21. Reich, M., et al. GenePattern 2.0. Nature Genetics. 38, 500(2006).
  22. Wang, Y. E., Kutnetsov, L., Partensky, A., Farid, J., Quackenbush, J. WebMeV: A Cloud Platform for Analyzing and Visualizing Cancer Genomic Data. Cancer Research. 77, 11-14 (2017).
  23. Morpheus. , Available from: https://software.broadinstitute.org/morpheus (2019).
  24. Weitschek, E., Lauro, S. D., Cappelli, E., Bertolazzi, P., Felici, G. CamurWeb: a classification software and a large knowledge base for gene expression data of cancer. BMC Bioinformatics. 19, 354(2018).
  25. Chou, P. -H., et al. tACCo, a Database Connecting transcriptome Alterations, pathway Alterations and Clinical outcomes in Cancers. Scientific Reports. 9, 3877(2019).

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Algorytm CorExanaliza RNA seqwizualizacja grafu czynnik wanaliza prze ywalno cioddzia ywania bia ko bia kowzbogacanie ontologii gen wanaliza szlak w KEGGwizualizacja mapy ciep a

Powiązane artykuły