11 października 2019
Przedstawiamy portal internetowy CorExplorer, zasób do eksploracji czynników sekwencjonowania RNA nowotworów znalezionych przez algorytm uczenia maszynowego CorEx (Correlation Explanation) i pokazujemy, jak można analizować czynniki związane z przeżyciem, adnotacjami w bazie danych, interakcjami białko-białko i sobą nawzajem, aby uzyskać wgląd w biologię nowotworu i interwencje terapeutyczne.
CorExplorer znajduje czynniki ekspresji genów związane z nowotworem w sposób, który jest matematycznie zasadniczy, za pomocą interaktywnych wizualizacji, a także informacji klinicznych i baz danych do odkryć biologicznych. CorEx maksymalizuje informacje w sposób, który wymaga stosunkowo niewielu próbek do znalezienia klastrów w danych wielowymiarowych. Hierarchia czynników utajonych, które wytwarza, ułatwia zrozumienie biologiczne.
Metoda ta okazała się już interesująca, gdy zostanie zastosowana w biologii raka. Jego podstawy teorii informacji sprawiają, że można go zastosować do każdego systemu z wieloma zmiennymi i niewielką wcześniejszą wiedzą na temat ich relacji. Zacznij od przejścia do strony głównej CorExplorer.
W sekcji Szybkie linki kliknij przycisk rozwijania plus, aby wyświetlić podsumowanie wykresu czynnika CorEx, który został wytrenowany na interesujących danych dotyczących raka. Na przykład w tym miejscu pokazane są wykresy czynników dla danych dotyczących raka jajnika TCGA. Po sprawdzeniu wykresów czynników kliknij płuca TCGA-LUAD, aby uzyskać dostęp do strony CorExplorer dotyczącej sekwencjonowania RNA raka płuc i użyj okna Wykres czynnika CorExplorer, aby zapoznać się z wykresem czynnika CorEx dla interesującego nas genu.
Przesuwając kursor myszy nad oknem wyświetlania wykresu czynników, powiększ wykres czynników za pomocą gładzika myszy, aby wyświetlić szczegóły wykresu, takie jak najważniejsze geny w każdym czynniku i połączenia między węzłami na różnych warstwach. Aby zlokalizować gen docelowy, kliknij menu Gen i wpisz nazwę genu, aby wybrać go z listy rozwijanej. Naciśnij Return na klawiaturze, aby powiększyć widok do czynnika, z którym gen zainteresowania jest najsilniej skorelowany.
Umieść kursor myszy na ekranie wykresu i przewiń, aby pomniejszyć, aby zobaczyć poziom węzła i powiązanych z nim czynników, które sąsiadują z najściślej powiązanym czynnikiem genowym. Należy pamiętać, że wyświetlane są tylko geny o wadze większej niż próg wskazany na suwaku minimalna waga linku. Aby wyświetlić wszystkie geny powiązane z czynnikiem, kliknij odpowiedni węzeł i wybierz opcję Załaduj dodatkowe geny w wyskakującym okienku.
Gdy pojawi się Gotowe, zamknij wyskakujące okienko. W sekcji nagłówka kliknij i przeciągnij modyfikator min Link Weight do 0.05, aby umożliwić pojawienie się genów w kolejności wagowej. Aby zidentyfikować powiązania z funkcją biologiczną, w oknie Adnotacja usuń zaznaczenie opcji Sortuj wskaźnik fałszywych odkryć, aby posortować menu rozwijane Czynnik według liczby czynnika, a nie współczynnika fałszywych odkryć.
Przewiń i kliknij, aby wybrać interesujący Cię czynnik w menu rozwijanym okna Adnotacja, aby wyświetlić adnotacje wzbogacenia dla tego czynnika. Następnie kliknij czynnik wzbogacenia, aby natychmiast wyświetlić powiązane geny, podświetlone na żółto na wykresie. Należy zauważyć, że czynniki, które znikają lub pojawiają się jako różne terminy GO, są wybierane w zależności od tego, czy są wzbogacone o geny z wybraną adnotacją, czy nie.
W przypadku filtrowania czynników zainteresowania, przy użyciu przeżycia i jakości klastra, z menu rozwijanego Zestaw danych wybierz TCGA_OVCA, aby przejść do strony CorExplorer sekwencjonowania RNA raka jajnika TCGA. Zanotować w oknie Przeżycie czynnik o największej różnicy przeżycia i wybrać ten czynnik w oknie Wykres czynnika z menu rozwijanego Czynnik. Kliknij i przeciągnij suwak Link Weight (Waga łącza) do pozycji 0,5 i zanotuj liczbę genów we współczynniku.
Rozwiń listę czynników w oknie Przetrwanie i kliknij następny najlepszy czynnik w menu rozwijanym Okno przetrwania, aby wyświetlić powiązane z nim krzywe przeżycia. Zostaną wyświetlone znaczące adnotacje GO i Kegg. Aby lepiej zrozumieć biologiczną rolę genów w tym czynniku, wybierz warstwę czynnika w górnej części okna Wykres czynnika i przesuń kursor myszy nad okno, jednocześnie pomniejszając, aby wyświetlić cały klaster i powiązane czynniki.
Aby zrozumieć względne znaczenie czynników powiązanych z węzłem klastra, odznacz opcję Sortuj według p-wartości w oknie Przeżycie i kliknij na każdy z numerów czynników po kolei, aby je wyświetlić, zwracając uwagę na czynniki, które wyświetlają powiązanie przeżycia. W menu Dodaj okno wybierz opcję PPI i kliknij przycisk Dodaj, aby dodać okno wykresu PPI do obszaru wyświetlania. W oknie wykresu PPI wybierz warstwę czynnika, która Cię interesuje, aby wyświetlić interakcje białko-białko, które są istotne.
Kliknij łącze Wyświetl w bazie danych StringDB, aby połączyć się z internetową bazą danych STRINGdb, a następnie kliknij przycisk Kontynuuj. Następnie otwórz zakładkę Anaylsis, aby uzyskać analizę GO online dla genów sieci PPI. Zostanie wyświetlony górny komponent komórkowy.
Wróć do zakładki CorExplorer i okna PPI i wybierz inny czynnik. Kliknij ponownie łącze Wyświetl w bazie danych StringDB. Zostanie wyświetlony inny górny komponent komórkowy.
Następnie w oknie PPI wybierz inny czynnik do analizy bazy danych STRING. Aby znaleźć podobieństwa i różnice w zmienności ekspresji genów w różnych typach nowotworów, kliknij nagłówek CorExplorer, aby powrócić do strony głównej, a następnie kliknij przycisk Szukaj, aby uzyskać dostęp do strony umożliwiającej przeszukiwanie wszystkich zestawów danych w witrynie CorExplorer. W polu Wyszukiwanie genów wprowadź nazwę genu, który Cię interesuje, a następnie kliknij przycisk Wyszukaj.
Na przykład, jak wykazano, FLT1 występuje ze stosunkowo dużą masą i wieloma różnymi czynnikami. Poszukiwanie genu BRCA1 w zbiorze danych dotyczących raka płuc ujawnia, że gen ten jest najsilniej związany z czynnikiem CorEx 26. Wzbogacenie terminu GO dla tego czynnika jest niezwykle wysokie, a naprawa DNA wykazuje wskaźnik fałszywych odkryć tylko jeden razy 10 do ujemnych 19.
Wybór zwraca również uwagę na L2_8 klastra drugiego poziomu, który w dzieciństwie ma sześć ściśle powiązanych ze sobą czynników. Sieć interakcji białko-białko naprawy DNA jest silnie powiązana, co dodatkowo wspiera ściśle powiązaną funkcjonalność genów czynnika 26. Powiązane wykresy przeżycia sugerują możliwy związek z przeżyciem pacjenta, który musiałby zostać potwierdzony w większym zbiorze danych.
Rozpoczęcie od oceny przeżycia może pozwolić na analizę czynników, które korelują z poprawą przeżycia w odniesieniu do określonych grup ekspresji genów. Dodanie okna interakcji białko-białko dla każdego czynnika ułatwia z kolei określenie możliwych wyjaśnień ich powiązań z przeżyciem. Ważne jest, aby sprawdzić mapy cieplne dla każdego czynnika, aby potwierdzić, że wzorzec ekspresji genów jest odpowiedniej jakości, aby wspierać interpretacje biologiczne.
Mapy cieplne, które pokazują silne, wyraźne różnice we wzorcach ekspresji genów, mogą wykazywać albo skoordynowaną ekspresję genów czynnika, od wysokiej do niskiej, albo bardziej złożone wzorce, przy czym niektóre geny mają niską ekspresję skorelowaną z innymi genami o wysokiej ekspresji. Nadrzędnym celem tej procedury jest ustalenie spersonalizowanej terapii poprzez mapowanie guza poza próbką do czynników CorExplorer w celu zidentyfikowania potencjalnych terapii specyficznych dla nowotworu.
Portal internetowy CorExplorer zostaje przedstawiony jako zasób służący do badania czynników sekwencjonowania RNA guzów, zidentyfikowanych przez algorytm uczenia maszynowego CorEx. Platforma ta umożliwia analizę czynników w odniesieniu do przeżywalności, adnotacji bazodanowych oraz oddziaływań białko-białko, co pozwala na lepsze zrozumienie biologii nowotworów.
CorExplorer umożliwia badaczom z sektora biofarmaceutycznego analizę czynników ekspresji genów w guzach, pochodzących z analizy CorEx, wspierając walidację celów terapeutycznych poprzez integracyjną wizualizację danych o przeżywalności, szlakach sygnałowych oraz oddziaływaniach białko-białko. Dzięki powiązaniu czynników latentnych z adnotacjami klinicznymi i funkcjonalnymi, platforma ta wspomaga minimalizację ryzyka mechanistycznego oraz generowanie hipotez w odkryciach onkologicznych. Ułatwia to zwiększenie pewności prognostycznej przy priorytetyzacji genów i szlaków do dalszych badań terapeutycznych.
CorExplorer wpisuje się w proces odkrywania, od identyfikacji celu po walidację przedkliniczną, umożliwiając iteracyjną eksplorację czynników nowotworowych przed wyłonieniem wiodących kandydatów.