Artykuł metodologiczny

Generowanie widoku regulacji transkrypcji cech transkryptomicznych na potrzeby zadania predykcyjnego i wykrywania ciemnych biomarkerów na małych zestawach danych

1.9K wyświetleń

DOI:

10.3791/66030

1 marca 2024

W tym artykule

Podsumowanie

Tutaj wprowadzamy protokół do przekształcania danych transkryptomicznych w widok mqTrans, umożliwiając identyfikację ciemnych biomarkerów. Chociaż biomarkery te nie są wyrażane różnicowo w konwencjonalnych analizach transkryptomicznych, wykazują różnicową ekspresję w ujęciu mqTrans. Podejście to służy jako technika uzupełniająca tradycyjne metody, odsłaniając wcześniej pomijane biomarkery.

Streszczenie

Transkryptom reprezentuje poziomy ekspresji wielu genów w próbce i jest szeroko stosowany w badaniach biologicznych i praktyce klinicznej. Naukowcy zwykle koncentrowali się na biomarkerach transkryptomicznych z różnicowymi reprezentacjami między grupą fenotypową a grupą kontrolną próbek. W badaniu tym przedstawiono wielozadaniową strukturę uczenia się graf-uwaga (GAT) w celu poznania złożonych interakcji międzygenowych próbek referencyjnych. Na zdrowych próbkach wytrenowano wstępnie demonstracyjny model referencyjny (HealthModel), który można bezpośrednio wykorzystać do wygenerowania opartego na modelu ilościowego obrazu regulacji transkrypcji (mqTrans) niezależnych transkryptomów testowych. Wygenerowany widok transkryptomów mqTrans zademonstrowano za pomocą zadań predykcyjnych i wykrywania ciemnych biomarkerów. Ukuty termin "ciemny biomarker" wywodzi się z jego definicji, zgodnie z którą ciemny biomarker wykazywał różnicową reprezentację w widoku mqTrans, ale nie wykazywał zróżnicowanej ekspresji na pierwotnym poziomie ekspresji. Ciemny biomarker był zawsze pomijany w tradycyjnych badaniach wykrywania biomarkerów ze względu na brak ekspresji różnicowej. Kod źródłowy i instrukcję obsługi potoku HealthModelPipe można pobrać ze strony http://www.healthinformaticslab.org/supp/resources.php.

Wprowadzenie

Transkryptom składa się z ekspresji wszystkich genów w próbce i może być profilowany za pomocą technologii wysokoprzepustowych, takich jak mikromacierze i RNA-seq1. Poziomy ekspresji jednego genu w zbiorze danych nazywa się cechą transkryptomiczną, a różnica w reprezentacji cechy transkryptomicznej pomiędzy grupą fenotypową a kontrolną definiuje ten gen jako biomarker danego fenotypu2,3. Biomarkery transkryptomiczne były szeroko wykorzystywane w badaniach nad diagnostyką chorób4, mechanizmami biologicznymi5 oraz analizą przeżywalności6,7 i tak dalej.

Wzorce aktywności genów w zdrowych tkankach niosą kluczowe informacje o organizmach8,9. Wzorce te dostarczają nieocenionych spostrzeżeń i stanowią idealne punkty odniesienia dla zrozumienia złożonych trajektorii rozwojowych łagodnych zaburzeń10,11 oraz śmiertelnych chorób12. Geny oddziałują na siebie, a transkryptomy reprezentują końcowe poziomy ekspresji po tych skomplikowanych oddziaływaniach. Takie wzorce są formułowane jako sieci regulacji transkrypcyjnej13, sieci metaboliczne14 i tym podobne. Ekspresja mRNA może być regulowana transkrypcyjnie przez czynniki transkrypcyjne (TFs) oraz długie międzygenowe niekodujące RNA (lincRNAs)15,16,17. Konwencjonalna analiza ekspresji różnicowej pomijała takie złożone interakcje genowe, przyjmując założenie o niezależności cech18,19.

Ostatnie postępy w dziedzinie grafowych sieci neuronowych (GNNs) wykazują nadzwyczajny potencjał w wyodrębnianiu istotnych informacji z danych omicznych na potrzeby badań nad nowotworami20, np. w identyfikacji modułów koekspresji21. Naturalne możliwości GNNs sprawiają, że są one idealne do modelowania złożonych relacji i zależności między genami22,23.

Badania biomedyczne często koncentrują się na dokładnym przewidywaniu fenotypu w odniesieniu do grupy kontrolnej. Takie zadania są powszechnie formułowane jako klasyfikacje binarne24,25,26. W tym przypadku dwie etykiety klas są zazwyczaj kodowane jako 1 i 0, prawda i fałsz, a nawet dodatni i ujemny27.

Celem niniejszego badania było opracowanie łatwego w użyciu protokołu generowania widoku regulacji transkrypcyjnej (mqTrans) dla zbioru danych transkryptomicznych w oparciu o wstępnie wytrenowany referencyjny model sieci uwagi grafowej (GAT). Wielozadaniowe środowisko GAT z wcześniej opublikowanej pracy26 zostało wykorzystane do przekształcenia cech transkryptomicznych w cechy mqTrans. Duży zbiór danych transkryptomów zdrowych osobników z platformy University of California, Santa Cruz (UCSC) Xena28 posłużył do wstępnego wytrenowania modelu referencyjnego (HealthModel), który ilościowo określił regulacje transkrypcyjne od czynników regulacyjnych (TFs i lincRNAs) do docelowych mRNA. Wygenerowany widok mqTrans może być wykorzystany do budowy modeli predykcyjnych i wykrywania ciemnych biomarkerów. W niniejszym protokole, jako przykład ilustracyjny, wykorzystano zbiór danych pacjentów z gruczolakorakiem okrężnicy (COAD) z bazy The Cancer Genome Atlas (TCGA)29. W tym kontekście pacjenci w stadium I lub II zostali sklasyfikowani jako próbki negatywne, natomiast pacjenci w stadium III lub IV jako próbki pozytywne. Porównano również rozkłady ciemnych i tradycyjnych biomarkerów w 26 typach nowotworów TCGA.

Opis potoku HealthModel
Metodologia zastosowana w niniejszym protokole opiera się na wcześniej opublikowanym schemacie26, przedstawionym na Rysunku 1. W pierwszej kolejności użytkownicy muszą przygotować zestaw danych wejściowych, wprowadzić go do proponowanego potoku HealthModel i uzyskać cechy mqTrans. Szczegółowe instrukcje dotyczące przygotowania danych znajdują się w sekcji 2 części protokołu. Następnie użytkownicy mają możliwość połączenia cech mqTrans z oryginalnymi cechami transkryptomicznymi lub kontynuowania analizy wyłącznie z wygenerowanymi cechami mqTrans. Powstały zestaw danych zostaje następnie poddany procesowi selekcji cech, przy czym użytkownicy mogą swobodnie wybrać preferowaną wartość k w k-krotnej walidacji krzyżowej dla klasyfikacji. Główną miarą oceny wykorzystaną w niniejszym protokole jest dokładność.

HealthModel26 kategoryzuje cechy transkryptomiczne w trzech odrębnych grupach: TF (czynnik transkrypcyjny), lincRNA (długi międzygenowy niekodujący RNA) oraz mRNA (posłańcowy RNA). Cechy TF są definiowane na podstawie adnotacji dostępnych w bazie Human Protein Atlas30,31. W niniejszej pracy wykorzystano adnotacje lincRNA z zestawu danych GTEx32. Geny należące do ścieżek trzeciego poziomu w bazie danych KEGG33 są traktowane jako cechy mRNA. Warto zauważyć, że jeśli cecha mRNA wykazuje role regulacyjne względem genu docelowego, zgodnie z dokumentacją w bazie danych TRRUST34, zostaje ona przeklasyfikowana do klasy TF.

Niniejszy protokół umożliwia również ręczne wygenerowanie dwóch przykładowych plików zawierających identyfikatory genów czynników regulacyjnych (regulatory_geneIDs.csv) oraz docelowego mRNA (target_geneIDs.csv). Macierz odległości parzystych pomiędzy cechami regulacyjnymi (TF i lincRNA) jest obliczana na podstawie współczynników korelacji Pearsona i grupowana za pomocą popularnego narzędzia do analizy ważonych sieci koekspresji genów (WGCNA)36 (adjacent_matrix.csv). Użytkownicy mogą bezpośrednio wykorzystać potok HealthModel wraz z tymi przykładowymi plikami konfiguracyjnymi, aby wygenerować widok mqTrans zestawu danych transkrypomicznych.

Szczegóły techniczne modelu HealthModel
HealthModel przedstawia złożone zależności między TF a lincRNA w formie grafu, w którym cechy wejściowe stanowią wierzchołki oznaczone jako V, a macierz krawędzi międzywierzchołkowych jako E. Każda próbka charakteryzuje się K cechami regulacyjnymi, symbolizowanymi jako VK×1. W szczególności zbiór danych obejmował 425 TF i 375 lincRNA, co przełożyło się na wymiarowość próbki K = 425 + 375 = 800. W celu utworzenia macierzy krawędzi E w niniejszej pracy wykorzystano popularne narzędzie WGCNA35. Para wag łącząca dwa wierzchołki przedstawione jako Równowaga statyczna; równanie, ΣFx=0; schemat edukacyjny, formuła fizyczna; kontekst wektorów sił. oraz symbol wektora prędkości, równanie fizyczne, schemat statyczny, koncepcja mechaniki, zasób edukacyjny, jest określana przez współczynnik korelacji Pearsona. Sieć regulacji genów wykazuje topologię bezskalową36, charakteryzującą się obecnością genów hubowych o kluczowych rolach funkcjonalnych. Korelację między dwiema cechami lub wierzchołkami, Równowaga statyczna; równanie, ΣFx=0; schemat edukacyjny, formuła fizyczna; kontekst wektorów sił. i symbol wektora prędkości, równanie fizyczne, schemat statyczny, koncepcja mechaniki, zasób edukacyjny, obliczamy za pomocą miary nakładania topologicznego (TOM) w następujący sposób:

Równanie transformacji danych, \(a_{ij} = power(S_{ij}, \beta)\), z wykorzystaniem metody funkcji potęgowej.     (1)

Równanie macierzy nakładania topologicznego (TOM) dla analizy sieci; wyrażenie matematyczne.     (2)

Miękki próg β jest obliczany przy użyciu funkcji „pickSoftThreshold” z pakietu WGCNA. Zastosowano funkcję wykładniczą potęgi aij, gdzie diagram równowagi statycznej, ΣFx=0, wektory sił, analiza stanu równowagi, edukacyjna ilustracja z fizyki reprezentuje gen z wyłączeniem i i j, a Równanie równowagi statycznej, przedstawione jako k=Σa_iu, stosowane w badaniach analizy matematycznej. reprezentuje łączność wierzchołków. WGCNA grupuje profile ekspresji cech transkryptomicznych w wiele modułów, wykorzystując powszechnie stosowaną miarę dyssymilarności (Równanie ilustrujące kryterium progu dla macierzy nakładania topologicznego (TOM) w analizie danych.37.

Struktura HealthModel została pierwotnie zaprojektowana jako architektura uczenia wielozadaniowego26. Niniejszy protokół wykorzystuje jedynie zadanie wstępnego trenowania modelu do konstrukcji transkrypcyjnego widoku mqTrans. Użytkownik może zdecydować się na dalsze doprecyzowanie wstępnie wytrenowanego modelu HealthModel w ramach wielozadaniowej sieci grafowej uwagi z wykorzystaniem dodatkowych, specyficznych dla danego zadania próbek transkrypcyjnych.

Szczegóły techniczne wyboru cech i klasyfikacji
Zbiór metod wyboru cech implementuje jedenaście algorytmów wyboru cech (FS). Wśród nich trzy są algorytmami FS opartymi na filtrach: wybór K najlepszych cech przy użyciu maksymalnego współczynnika informacji (SK_mic), wybór K cech w oparciu o FPR dla MIC (SK_fpr) oraz wybór K cech z najwyższym współczynnikiem fałszywych odkryć dla MIC (SK_fdr). Dodatkowo, trzy algorytmy FS oparte na drzewach oceniają poszczególne cechy za pomocą drzewa decyzyjnego z indeksem Giniego (DT_gini), adaptacyjnych wzmocnionych drzew decyzyjnych (AdaBoost) oraz lasu losowego (RF_fs). Zbiór zawiera również dwie metody opakowujące (wrapper): rekurencyjną eliminację cech z liniowym klasyfikatorem wektorów nośnych (RFE_SVC) oraz rekurencyjną eliminację cech z klasyfikatorem regresji logistycznej (RFE_LR). Na koniec uwzględniono dwa algorytmy osadzania (embedding): liniowy klasyfikator SVC z najwyższymi wartościami istotności cech L1 (lSVC_L1) oraz klasyfikator regresji logistycznej z najwyższymi wartościami istotności cech L1 (LR_L1).

Pula klasyfikatorów wykorzystuje siedem różnych klasyfikatorów do budowy modeli klasyfikacji. Klasyfikatory te obejmują liniową maszynę wektorów nośnych (SVC), gaussowski naiwny klasyfikator bayesowski (GNB), klasyfikator regresji logistycznej (LR), k-najbliższych sąsiadów z domyślnie ustawioną wartością k równą 5 (KNN), XGBoost, las losowy (RF) oraz drzewo decyzyjne (DT).

Losowy podział zbioru danych na podzbiory treningowy i testowy można ustawić w wierszu poleceń. W przedstawionym przykładzie zastosowano stosunek danych treningowych do testowych wynoszący 8: 2.

Protokół

UWAGA: Poniższy protokół opisuje szczegóły procedury analitycznej informatyki i poleceń Pythona głównych modułów. Rysunek 2 ilustruje trzy główne kroki za pomocą przykładowych poleceń używanych w tym protokole i odsyła do wcześniej opublikowanych prac26,38 po więcej szczegółów technicznych. Wykonaj następujące czynności przy użyciu normalnego konta użytkownika w systemie komputerowym i unikaj korzystania z konta administratora lub konta root. Jest to protokół obliczeniowy i nie zawiera żadnych biomedycznych czynników niebezpiecznych.

1. Przygotowanie środowiska Pythona

  1. Utwórz środowisko wirtualne.
    1. W badaniu wykorzystano język programowania Python i środowisko wirtualne Python (VE) z Pythonem 3.7. Wykonaj następujące kroki (Rysunek 3A):
      conda create -n healthmodel python=3.7
      conda create
      to polecenie służące do tworzenia nowego VE. Parametr -n określa nazwę nowego środowiska, w tym przypadku healthmodel. A python=3.7 określa wersję Pythona do zainstalowania. Wybierz dowolną preferowaną nazwę i wersję języka Python obsługującą powyższe polecenie.
    2. Po uruchomieniu polecenia dane wyjściowe są podobne do Rysunek 3B. Wpisz y i poczekaj na zakończenie procesu.
  2. Aktywowanie środowiska wirtualnego
    1. W większości przypadków aktywuj utworzony VE za pomocą następującego polecenia (Rysunek 3C):
      Conda Aktywuj HealthModel
    2. Postępuj zgodnie z instrukcjami specyficznymi dla platformy dla aktywacji VE, jeśli niektóre platformy wymagają od użytkownika przesłania plików konfiguracyjnych specyficznych dla platformy w celu aktywacji.
  3. Instalowanie platformy PyTorch 1.13.1
    1. PyTorch to popularny pakiet języka Python dla algorytmów sztucznej inteligencji (AI). Jako przykład użyj platformy PyTorch 1.13.1 opartej na platformie programowania procesora GPU CUDA 11.7. Znajdź inne wersje na https://pytorch.org/get-started/previous-versions/. Użyj następującego polecenia (Rysunek 3D):
      pip3 Zainstaluj latarkę TorchvisionAudio
      UWAGA: Zdecydowanie zaleca się korzystanie z platformy PyTorch w wersji 1.12 lub nowszej. W przeciwnym razie zainstalowanie wymaganego pakietu torch_geometric może być trudne, jak zaznaczono na oficjalnej stronie torch_geometric: https://pytorch-geometric.readthedocs.io/en/latest/install/installation.html.
  4. Zainstaluj dodatkowe pakiety dla torch-geometric
    1. Postępując zgodnie ze wskazówkami na https://pytorch-geometric.readthedocs.io/en/latest/install/installation.html, zainstaluj następujące pakiety: torch_scatter, torch_sparse, torch_cluster i torch_spline_conv za pomocą polecenia (Rysunek 3E):
      install pyg_lib torch_scatter torch_sparse torch_cluster torch_spline_conv -f https://data.pyg.org/whl/torch-1.13.0+cu117.html
  5. Zainstaluj pakiet torch-geometric.
    1. To badanie wymaga specyficznej wersji, 2.2.0, pakietu torch-geometric. Uruchom polecenie (Rysunek 3F):
      install torch_geometric==2.2.0
  6. Zainstaluj inne pakiety.
    1. Pakiety takie jak pandas są zwykle dostępne domyślnie. Jeśli nie, zainstaluj je za pomocą polecenia. Na przykład, aby zainstalować pandas i xgboost, uruchom:
      install pandas
      install xgboost (w języku angielskim
    2. )

2. Korzystanie z wstępnie wytrenowanego HealthModel do generowania funkcji mqTrans

  1. Pobierz kod i wstępnie wytrenowany model.
    1. Pobierz kod i wstępnie wytrenowany model HealthModel ze strony internetowej: http://www.healthinformaticslab.org/supp/resources.php, który nosi nazwę HealthModel-mqTrans-v1-00.tar.gz (Rysunek 4A). Pobrany plik można zdekompresować do ścieżki określonej przez użytkownika. Szczegółową formułę i dane pomocnicze wdrożonego protokołu można znaleźć w26.
  2. Wprowadź parametry, aby uruchomić HealthModel.
    1. Najpierw zmień katalog roboczy na folder HealthModel-mqTrans w wierszu poleceń. Użyj następującej składni do uruchamiania kodu:
      python main.py
      Szczegóły dotyczące każdego parametru oraz folderów danych, modelu i danych wyjściowych są następujące:
      Folder danych: Jest to folder danych źródłowych, a każdy plik danych jest w formacie csv. Ten folder danych zawiera dwa pliki (patrz szczegółowe opisy w krokach 2.3 i 2.4). Pliki te należy zastąpić danymi osobowymi.
      data.csv: Plik macierzy transkryptomicznej. Pierwszy wiersz zawiera listę identyfikatorów cech (lub genów), a pierwsza kolumna zawiera identyfikatory próbek. Lista genów obejmuje czynniki regulatorowe (TF i lincRNA) oraz regulowane geny mRNA.
      label.csv: Przykładowy plik etykiety. Pierwsza kolumna zawiera listę identyfikatorów próbek, a kolumna o nazwie "label" zawiera przykładową etykietę.
      folder modelu: Folder do zapisywania informacji o modelu:
      HealthModel.pth: wstępnie wytrenowany HealthModel.
      regulatory_geneIDs.csv: Identyfikatory genów regulatorowych użyte w tym badaniu.
      target_geneIDs.csv: Geny docelowe wykorzystane w tym badaniu.
      adjacent_matrix.csv: Sąsiednia matryca genów regulatorowych.
      folder wyjściowy: Pliki wyjściowe są zapisywane w tym folderze, utworzonym przez code.
      test_target.csv: Wartość ekspresji genów docelowych po normalizacji i imputacji Z.
      pred_target.csv: Przewidywana wartość ekspresji genów docelowych.
      mq_target.csv: Przewidywana wartość ekspresji genów docelowych.
  3. Przygotuj plik z macierzą transkryptomiczną w formacie csv.
    1. Każdy wiersz reprezentuje próbkę, a każda kolumna reprezentuje gen (Rysunek 4B). Nazwij plik transkryptomicznej macierzy danych jako data.csv w folderze danych.
      UWAGA: Ten plik może zostać wygenerowany przez ręczne zapisanie macierzy danych w formacie .csv z oprogramowania takiego jak Microsoft Excel. Macierz transkryptomiczna może być również generowana przez programowanie komputerowe.
  4. Przygotuj plik etykiety w formacie csv.
    1. Podobnie jak w przypadku pliku macierzy transkryptomicznej, nazwij plik etykiety jako label.csv w folderze danych (Rysunek 4C).
      UWAGA: Pierwsza kolumna zawiera nazwy próbek, a etykieta klasy każdej próbki jest podana w kolumnie zatytułowanej etykieta. Wartość 0 w kolumnie etykiety oznacza, że próbka jest ujemna, a 1 oznacza próbkę dodatnią.
  5. Wygeneruj cechy mqTrans.
    1. Uruchom następujące polecenie, aby wygenerować funkcje mqTrans i uzyskać dane wyjściowe pokazane w Rysunek 4D. Cechy mqTrans są generowane jako plik ./output/mq_targets.csv, a plik etykiety jest ponownie zapisywany jako plik ./output/label.csv. Dla wygody dalszej analizy, oryginalne wartości ekspresji genów mRNA są również ekstrahowane jako plik ./output/ test_target.csv.
      python ./Get_mqTrans/code/main.py ./data ./Get_mqTrans/model ./output

3. Wybierz funkcje mqTrans

  1. Składnia kodu wyboru elementu
    1. Najpierw zmień katalog roboczy na folder HealthModel-mqTrans. Użyj następującej składni:
      python ./FS_classification/testMain.py
      Szczegóły każdego parametru są następujące:
      in-data-file: Plik danych wejściowych
      in-label-file: etykieta pliku danych wejściowych
      Folder wyjściowy: W tym folderze zapisywane są dwa pliki wyjściowe, w tym Output-score.xlsx (metoda wyboru cech i dokładność odpowiedniego klasyfikatora) oraz Output-SelectedFeatures.xlsx (nazwy wybranych cech dla każdego algorytmu wyboru cech).
      1. select_feature_number: wybierz liczbę obiektów, z zakresu od 1 do liczby obiektów pliku danych.
      2. test_size: Ustaw stosunek próbki testowej do podziału. Na przykład 0,2 oznacza, że wejściowy zestaw danych jest losowo podzielony na podzbiory testowe pociągu: według stosunku 0,8:0,2.
      3. połącz: Jeśli wartość to prawda, połącz ze sobą dwa pliki danych w celu wyboru funkcji, tj. oryginalnych wartości wyrażeń i cech mqTrans. Jeśli wartość jest fałszywa, użyj tylko jednego pliku danych do wyboru funkcji, tj. oryginalnych wartości wyrażeń lub cech mqTrans.
      4. połącz plik: Jeśli wartość combine ma wartość true, podaj tę nazwę pliku, aby zapisać połączoną matrycę danych.
        UWAGA: Ten potok ma na celu zademonstrowanie, jak wygenerowane funkcje mqTrans działają w zadaniach klasyfikacji, i bezpośrednio używa pliku wygenerowanego przez sekcję 2 do następujących operacji.
  2. Uruchom algorytm wyboru funkcji dla wyboru funkcji mqTrans.
    1. Włącz opcję połącz =Fałsz, jeśli użytkownik wybierze funkcje mqTrans lub oryginalne funkcje.
    2. Najpierw wybierz 800 oryginalnych funkcji i podziel zestaw danych na pociąg: test=0.8:0.2:
      python ./FS_classification/testMain.py ./output/test_target.csv ./output/label.csv ./result 800 0.2 Fałsz
    3. Włącz opcję połącz =True, jeśli użytkownik chce połączyć cechy mqTrans z oryginalnymi wartościami wyrażeń, aby wybrać obiekty. W tym miejscu przykładem demonstracyjnym jest wybranie 800 funkcji i podzielenie zestawu danych na pociąg: test=0.8:0.2:
      python ./FS_classification/testMain.py ./output/mq_targets.csv ./output/label.csv ./result_combine 800 0.2 True ./output/test_target.csv
      UWAGA: Rysunek 5 pokazuje informacje wyjściowe. Pliki dodatkowe wymagane dla tego protokołu znajdują się w folderze HealthModel-mqTrans-v1-00.tar (Supplementary Coding File 1).

Wyniki

Ocena widoku mqTrans zbioru danych transkryptomicznych
Kod testowy wykorzystuje jedenaście algorytmów selekcji cech (FS) oraz siedem klasyfikatorów, aby ocenić, w jaki sposób wygenerowany widok mqTrans zbioru danych transkryptomicznych przyczynia się do zadania klasyfikacji (Rysunek 6). Zbiór danych testowych składa się z 317 próbek gruczolakoraka okrężnicy (COAD) z bazy danych The Cancer Genome Atlas (TCGA)29. Pacjenci z COAD w stopniu I lub II są uznawani za próbki negatywne, natomiast pacjenci w stopniu III lub IV za próbki pozytywne.

W kodzie testowym zaimplementowano jedenaście algorytmów FS. Dostępne są trzy algorytmy FS oparte na filtrach, obejmujące: wybór K najlepszych cech na podstawie MIC (SK_mic), wybór K cech na podstawie FPR dla MIC (SK_fpr) oraz wybór K cech na podstawie najwyższego FDR dla MIC (SK_fpr). Trzy algorytmy FS oparte na drzewach oceniają poszczególne cechy odpowiednio za pomocą drzewa decyzyjnego z indeksem Gini (DT_gini), adaptacyjnych wzmocnionych drzew decyzyjnych (AdaBoost) oraz lasów losowych (RF_fs). Pula FS w kodzie testowym ocenia również dwa wrappery: rekurencyjną eliminację cech (RFE) z liniowym klasyfikatorem wektorów nośnych (SVC) (RFE_SVC) oraz RFE z klasyfikatorem regresji logistycznej (RFE_LR), a także dwa algorytmy osadzania: liniowy klasyfikator SVC z najwyższymi wartościami istotności cech L1 (lSVC_L1) oraz klasyfikator regresji logistycznej z najwyższymi wartościami istotności cech L1 (LR_L1).

Kod testowy buduje modele klasyfikacji przy użyciu siedmiu klasyfikatorów, w tym liniowej maszyny wektorów nośnych (SVC), naiwnego klasyfikatora Bayesa z rozkładem Gaussa (GNB), regresji logistycznej (LR), k-najbliższych sąsiadów, domyślnie k-5 (KNN), XGBoost, lasów losowych (RF) oraz drzew decyzyjnych (DT).

Rysunek 6 przedstawia maksymalną dokładność testową cech mqTrans, oryginalnych cech mRNA oraz połączonego podzbioru cech mRNA i mqTrans zalecanego przez każdy z algorytmów FS.

Połączone podzbiory cech (mRNA+mqTrans) osiągnęły najwyższą dokładność 0,7656 przy zastosowaniu metody FS „SK_fpr”, co jest wynikiem lepszym niż w przypadku pojedynczych typów cech mqTrans (0,7188) oraz oryginalnego mRNA (0,7188). Podobne wzorce można zaobserwować dla pozostałych algorytmów FS. Użytkownik może sprawdzić wybrane cechy w pliku wyjściowym Output-SelectedFeatures.csv.

Wykrywanie ciemnych biomarkerów
Poprzednie badania wykazały istnienie genów o niezakłóconej ekspresji, które charakteryzują się istotnie różnymi wartościami mqTrans pomiędzy grupami fenotypowymi a kontrolnymi26,38,39. Geny te nazywa się ciemnymi biomarkerami, ponieważ tradycyjne badania nad wykrywaniem biomarkerów pomijają je ze względu na ich brak różnic w ekspresji. Funkcję analizy statystycznej t.test w programie Microsoft Excel można wykorzystać do zdefiniowania cechy jako różnicowo wyrażonej, jeśli jej statystyczna wartość p jest mniejsza niż 0,05.

Spośród 3062 cech z wygenerowanymi wartościami mqTrans wykryto 221 ciemnych biomarkerów (Rysunek 7). Gen zajmujący trzecie miejsce w rankingu ENSG00000163697 (APBB2, Amyloid Beta Precursor Protein Binding Family B Member 2) wykazuje istotnie różnicujące się wartości mqTrans (mqTrans.P = 2.03 x 10-4), podczas gdy jego pierwotny poziom ekspresji nie wykazuje różnic w ekspresji (mRNA.P = 3.80 x 10-1). Słowo kluczowe APBB2 pojawiło się w 27 publikacjach w bazie danych PubMed40, jednak nie wykryto powiązań z jelitem grubym ani cienkim.

Inny gen ENSG00000048052 (HDAC9, Histone Deacetylase 9) wykazuje różnicujące się wartości mqTrans (mqTrans.P = 6,09 x 10-3), przy jednoczesnym zachowaniu praktycznie takich samych rozkładów normalnych pomiędzy grupą fenotypową a kontrolną (mRNA.P = 9,62 x 10-1). Słowo kluczowe HDAC9 pojawiło się w 417 publikacjach w bazie danych PubMed. Trzy badania wspominały również w streszczeniach o słowach kluczowych „colon” (jelito grube) lub „intestine” (jelito)41,42,43. Żadne z nich nie badało jednak roli HDAC9 w raku jelita grubego.

Dane zasugerowały konieczność dalszej oceny tych ciemnych biomarkerów pod kątem ich aktywności potranskrypcyjnej, np. poziomów przetłumaczonych białek44,45.

Rozkład ciemnych i tradycyjnych biomarkerów związanych z metabolizmem w różnych typach nowotworów
Tradycyjne biomarkery związane z metabolizmem zostały wyselekcjonowane i porównane z ciemnymi biomarkerami w 26 typach nowotworów w zbiorze danych TCGA38. Obie kategorie biomarkerów poddano ocenie statystycznej w celu ustalenia poziomów istotności w wczesnych (stopnie I i II) oraz późnych (stopnie III i IV) stadiach nowotworu. W ocenie tej zastosowano testy t-Studenta do wyznaczenia wartości p, które następnie skorygowano pod kątem wielokrotnego testowania przy użyciu współczynnika odkryć fałszywie dodatnich (FDR). Szczegółowe dane dla każdego z 26 typów nowotworów przedstawiono na rysunku 8.

Geny, dla których skorygowane wartości p (FDR) były niższe niż 0,05, sklasyfikowano jako tradycyjne biomarkery. Z kolei ciemne biomarkery zdefiniowano jako te, które wykazywały skorygowane wartości p (FDR) poniżej 0,05 w widoku mqTrans, wykazując jednocześnie brak statystycznie istotnych różnic w poziomach ekspresji.

Rysunek 9 wykazuje ogólną rzadkość występowania ciemnych biomarkerów w porównaniu z tradycyjnymi biomarkerami w większości typów nowotworów. Godnymi uwagi wyjątkami są BRCA, MESO i TGCT, w których stwierdzono większą prewalencję ciemnych biomarkerów. Wykazano, że różne czynniki, w tym czynniki transkrypcyjne, wzorce metylacji, mutacje genowe oraz warunki środowiskowe, mogą modulować dysregulację transkrypcyjną tych ciemnych biomarkerów. Dalsza złożoność może wynikać z nakładających się transkryptów niekodującego RNA, które mogą zaburzać poziom ekspresji ciemnych biomarkerów. Dysregulacja transkrypcyjna niektórych ciemnych biomarkerów została potwierdzona przez ich zróżnicowane poziomy białek44,45. Ciemne biomarkery są często pomijane w tradycyjnych badaniach i stanowią intrygujące kierunki dla przyszłych analiz mechanistycznych.

Schemat HealthModel: WGCNA, GATConv, selekcja cech, pula klasyfikatorów, analiza danych mRNA.
Rysunek 1: Przegląd modułów HealthModel oraz selekcji cech w niniejszym protokole. Użytkownik znający programowanie w języku Python może zastąpić konkretne algorytmy w puli selekcji cech oraz w puli klasyfikatorów. Aby wyświetlić większą wersję tego rysunku, kliknij tutaj.

Konfiguracja środowiska Python dla uczenia maszynowego; tworzenie środowiska wirtualnego; przewodnik po instalacji pakietów.
Rysunek 2: Kompletny przepływ kodu dla niniejszego protokołu. (A) Przygotowanie środowiska Python. Na początek należy utworzyć środowisko wirtualne i zainstalować niezbędne pakiety. Szczegółowe instrukcje znajdują się w sekcji 1. (B) Generowanie cech mqTrans. Uzyskanie cech mqTrans poprzez krokowe wykonywanie dostarczonego kodu. Szczegółowe wyjaśnienia znajdują się w sekcji 2. (C) Wybór cech mqTrans. Ta sekcja skupia się na ocenie cech mqTrans. Szczegółowe informacje znajdują się w sekcji 3. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Schemat konfiguracji środowiska Python z poleceniami Conda, instalacją pakietów i konfiguracją PyTorch.
Rysunek 3: Przygotowanie środowiska dla języka Python. (A) Polecenie służące do utworzenia healthmodel. (B) Wprowadzenie y podczas procesu tworzenia VE. (C) Najczęściej stosowane polecenie aktywacji VE. (D) Polecenie instalacji torch 1.13.1. (E) Instalacja dodatkowych bibliotek dla pakietu torch-geometric. (F) Instalacja pakietu torch-geometric. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Analiza cech transkryptomicznych z wykorzystaniem HealthModel-mqTrans; tabele zbiorów danych i wyniki bioinformatyczne.
Rysunek 4: Uruchomienie modelu HealthModel w celu uzyskania cechy mqTrans. (A) Pobranie kodu. (B) Przykład pliku danych. Każda kolumna zawiera wszystkie wartości czynnika regulacyjnego, a pierwszym elementem jest ID genu. Każdy wiersz zawiera wartości dla danej próbki, przy czym pierwszym elementem jest nazwa próbki. (C) Przykład pliku etykiet. Pierwsza kolumna zawiera nazwy próbek, a etykieta klasy każdej próbki znajduje się w kolumnie zatytułowanej label. Wartość 0 w kolumnie label oznacza, że próbka pochodzi od organizmu żywego, 1 oznacza martwy. (D) Wyniki mqTrans. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Wynik uczenia maszynowego; kształty danych, wyniki selekcji cech i pliki wyjściowe wymienione w kodzie.
Rysunek 5: Uruchomienie algorytmu selekcji cech dla cechy mqTrans. Użytkownikowi są prezentowane wyniki działania algorytmu selekcji cech. Aby zobaczyć powiększoną wersję tego rysunku, kliknij tutaj.

Wykres słupkowy dokładności zbioru testowego z porównaniem algorytmów selekcji cech: mqTrans, mRNA, mRNA+mqTrans.
Rycina 6: Maksymalna dokładność zbioru testowego dla każdego algorytmu selekcji cech. Oś pozioma przedstawia algorytmy selekcji cech, a oś pionowa wartości dokładności. Histogramy ukazują dane eksperymentalne dla trzech ustawień, tj. mqTrans, mRNA oraz mRNA+mqTrans. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Tabela danych ekspresji genów, poziomy mRNA i białek, kolorowa mapa ciepła, analiza biomarkerów.
Rysunek 7: 50 najważniejszych ciemnych biomarkerów z najmniejszymi wartościami p w widoku mqTrans. Kolumna „Dark Biomarker” zawiera nazwy ciemnych biomarkerów. Kolumny „mRNA.P” i „mqTrans.P” przedstawiają statystyczne wartości p testu t pomiędzy grupą fenotypową a kontrolną. Kolory tła wartości p zmieniają się od 1,00 (niebieski) do 0,00 (czerwony), a kolor biały oznacza wartość p = 0,05. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Tabela rozkładu stadiów nowotworów; różne typy raka wymienione w stadiach I-IV; narzędzie analizy danych.
Rycina 8: Szczegółowe informacje na temat 26 nowotworów w bazie The Cancer Genome Atlas (TCGA) w różnych stadiach. Kolumny „Cohort” (Kohorta) i „Disease Tissue” (Tkanka chorobowa) opisują grupę pacjentów oraz tkanki objęte procesem chorobowym dla każdego zbioru danych. Cztery ostatnie kolumny podają liczbę próbek odpowiednio w stadiach rozwojowych I, II, III i IV. Aby wyświetlić powiększoną wersję tej ryciny, kliknij tutaj.

Porównanie ciemnych i tradycyjnych biomarkerów w 26 nowotworach; analiza wykresu słupkowego.
Rycina 9: Liczba ciemnych biomarkerów i tradycyjnych biomarkerów w 26 nowotworach. Oś pozioma wymienia 26 typów nowotworów. Oś pionowa podaje liczbę ciemnych biomarkerów i tradycyjnych biomarkerów dla tych typów nowotworów. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Uzupełniający plik z kodem 1: HealthModel-mqTrans-v1-00.tar Kliknij tutaj, aby pobrać ten plik.

Dyskusja

Sekcja 2 (Użyj wstępnie wytrenowanego modelu HealthModel do wygenerowania funkcji mqTrans) protokołu jest najbardziej krytycznym krokiem w ramach tego protokołu. Po przygotowaniu obliczeniowego środowiska roboczego w sekcji 1, sekcja 2 generuje widok mqTrans transkryptomicznego zestawu danych w oparciu o wstępnie wytrenowany duży model referencyjny. Sekcja 3 jest demonstracyjnym przykładem wyboru wygenerowanych cech mqTrans do wykrywania biomarkerów i zadań predykcyjnych. Użytkownicy mogą przeprowadzać inne analizy transkryptomiczne na tym zbiorze danych mqTrans przy użyciu własnych narzędzi lub kodów.

Oryginalna struktura HealthModel może dodatkowo uściślić wstępnie wytrenowany model HealthModel przy użyciu architektury wielozadaniowej, zgodnie z opisem w26. Protokół ten koncentruje się na wykorzystaniu wstępnie wytrenowanego modelu referencyjnego do generowania widoku mqTrans zestawu danych transkryptomicznych.

Domyślny, wstępnie wytrenowany model referencyjny został ustalony na zdrowych próbkach i może nie być dobrym wyborem do niektórych konkretnych zadań, np. badania między rakiem pierwotnym a przerzutowym. Szybkość obliczeń jest również niska w przypadku dużego zestawu danych transkryptomicznych.

Znaczenie tego protokołu polega na zapewnieniu komplementarnego spojrzenia mqTrans na najliczniej dostępny typ danych OMIC, tj. transkryptom. Ciemne biomarkery można ujawnić na podstawie genów o niezróżnicowanej ekspresji, ignorowanych przez konwencjonalną analizę transkryptomiczną. W niedawnym badaniu wykryto siedem ciemnych biomarkerów przerzutowego raka jelita grubego (mCC) na podstawie trzech niezależnych kohort 805 próbek w sumie44. Ciemne biomarkery poddano ograniczonym badaniom laboratoryjnym ze względu na ich niezróżnicowane ekspresje. Jednak jeden z wykrytych ciemnych biomarkerów mCC YTHDC2 koduje domenę białka YTH zawierającą 2, której poziomy białka zaobserwowano jako dodatnio skorelowane ze statusem przerzutów ludzkich komórek raka żołądka46 i raka jelita grubego47. Nowe informacje biologiczne dotyczące ciemnych biomarkerów nadal nie zostały rozwiązane za pomocą technologii in vitro i in vivo.

Ten protokół został zaprojektowany tak, aby był w pełni modułowy. Modele referencyjne wstępnie wytrenowane na innych dużych zbiorach danych, takich jak nowotwory pierwotne, ułatwią badanie przerzutów nowotworowych. Protokół ten będzie również badany pod kątem zastosowań w innych dziedzinach życia, w tym w roślinach, grzybach i mikroorganizmach.

Planuje się, że wydajność obliczeniowa tego protokołu zostanie zwiększona poprzez zrównoleglenie i optymalizację algorytmiczną.

Protokół ten opisuje procedurę przekształcania zestawu danych transkryptomicznych do nowego widoku mqTrans, a przekształcone wartości mqTrans genu ilościowo mierzą zmiany regulacji transkrypcji w porównaniu z próbkami referencyjnymi. Model domyślny został wstępnie wytrenowany na zdrowych transkryptomach i wydany jako referencyjny HealthModel.

Kod źródłowy dwóch dalszych zadań został dostarczony w celu ułatwienia łatwego wykorzystania tego protokołu przez badaczy biomedycznych. Dane eksperymentalne pokazują, że przekształcone cechy mqTrans mogą usprawnić zadania predykcyjne przy użyciu tylko oryginalnych poziomów wyrażeń. Widok mqTrans może również ujawnić utajone powiązania fenotypowe niektórych ciemnych biomarkerów bez różnicowej ekspresji w oryginalnych danych transkryptomicznych.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Podziękowania

Ta praca była wspierana przez Starszy i Młodszy Zespół ds. Innowacji Technologicznych (20210509055RQ), Projekty Naukowe i Technologiczne Prowincji Guizhou (ZK2023-297), Fundację Nauki i Technologii Komisji Zdrowia Prowincji Guizhou (gzwkj2023-565), Projekt Nauki i Technologii Departamentu Edukacji Prowincji Jilin (JJKH20220245KJ i JJKH20220226SK), Narodową Fundację Nauk Przyrodniczych Chin (U19A2061), Kluczowe Laboratorium Dużych Danych Prowincji Jilin Inteligentne Systemy Obliczeniowe (20180622002JC) oraz Podstawowe Fundusze Badawcze dla Uniwersytetów Centralnych, JLU. Wyrażamy nasze najszczersze uznanie dla redaktora recenzji i trzech anonimowych recenzentów za ich konstruktywną krytykę, która odegrała zasadniczą rolę w znacznym zwiększeniu rygoru i jasności tego protokołu.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
AnacondaAnacondawersja 2020.11Platforma programistyczna Python
KomputerNIEDOTYCZYNie dotyczy Dowolne komputery ogólnego przeznaczenia spełniają wymagania
Karta graficznaNIEDOTYCZYDowolne karty graficzne ogólnego przeznaczenia z biblioteką obliczeniową CUDA
pytorchPytorchw wersji 1.13.1Latarka
programowa geometrycznaOprogramowanie Pytorchw wersji 2.2.0

Bibliografia

  1. Mutz, K. -O., Heilkenbrinker, A., Lönne, M., Walter, J. -G., Stahl, F. Transcriptome analysis using next-generation sequencing. Curr Opin in Biotechnol. 24 (1), 22-30 (2013).
  2. Meng, G., Tang, W., Huang, E., Li, Z., Feng, H. A comprehensive assessment of cell type-specific differential expression methods in bulk data. Brief Bioinform. 24 (1), 516(2023).
  3. Iqbal, N., Kumar, P. Integrated COVID-19 Predictor: Differential expression analysis to reveal potential biomarkers and prediction of coronavirus using RNA-Seq profile data. Comput Biol Med. 147, 105684(2022).
  4. Ravichandran, S., et al. VB(10), a new blood biomarker for differential diagnosis and recovery monitoring of acute viral and bacterial infections. EBioMedicine. 67, 103352(2021).
  5. Lv, J., et al. Targeting FABP4 in elderly mice rejuvenates liver metabolism and ameliorates aging-associated metabolic disorders. Metabolism. 142, 155528(2023).
  6. Cruz, J. A., Wishart, D. S. Applications of machine learning in cancer prediction and prognosis. Cancer Inform. 2, 59-77 (2007).
  7. Cox, D. R. Analysis of Survival Data. , Chapman and Hall/CRC. London. (2018).
  8. Newman, A. M., et al. Robust enumeration of cell subsets from tissue expression profiles. Nat Methods. 12 (5), 453-457 (2015).
  9. Ramilowski, J. A., et al. A draft network of ligand-receptor-mediated multicellular signalling in human. Nat Commun. 6 (1), 7866(2015).
  10. Xu, Y., et al. MiR-145 detection in urinary extracellular vesicles increase diagnostic efficiency of prostate cancer based on hydrostatic filtration dialysis method. Prostate. 77 (10), 1167-1175 (2017).
  11. Wang, Y., et al. Profiles of differential expression of circulating microRNAs in hepatitis B virus-positive small hepatocellular carcinoma. Cancer Biomark. 15 (2), 171-180 (2015).
  12. Hu, S., et al. Transcriptional response profiles of paired tumor-normal samples offer novel. Oncotarget. 8 (25), 41334-41347 (2017).
  13. Xu, H., Luo, D., Zhang, F. DcWRKY75 promotes ethylene induced petal senescence in carnation (Dianthus caryophyllus L). Plant J. 108 (5), 1473-1492 (2021).
  14. Niu, H., et al. Dynamic role of Scd1 gene during mouse oocyte growth and maturation. Int J Biol Macromol. 247, 125307(2023).
  15. Aznaourova, M., et al. Single-cell RNA sequencing uncovers the nuclear decoy lincRNA PIRAT as a regulator of systemic monocyte immunity during COVID-19. Proc Natl Acad Sci U S A. 119 (36), 2120680119(2022).
  16. Prakash, A., Banerjee, M. An interpretable block-attention network for identifying regulatory feature interactions. Brief Bioinform. 24 (4), (2023).
  17. Zhai, Y., et al. Single-cell RNA sequencing integrated with bulk RNA sequencing analysis reveals diagnostic and prognostic signatures and immunoinfiltration in gastric cancer. Comput Biol Med. 163, 107239(2023).
  18. Duan, L., et al. Dynamic changes in spatiotemporal transcriptome reveal maternal immune dysregulation of autism spectrum disorder. Comput Biol Med. 151, 106334(2022).
  19. Zolotareva, O., et al. Flimma: a federated and privacy-aware tool for differential gene expression analysis). Genome Biol. 22 (1), 338(2021).
  20. Su, R., Zhu, Y., Zou, Q., Wei, L. Distant metastasis identification based on optimized graph representation of gene. Brief Bioinform. 23 (1), (2022).
  21. Xing, X., et al. Multi-level attention graph neural network based on co-expression gene modules for disease diagnosis and prognosis. Bioinformatics. 38 (8), 2178-2186 (2022).
  22. Bongini, P., Pancino, N., Scarselli, F., Bianchini, M. BioGNN: How Graph Neural Networks Can Solve Biological Problems. Artificial Intelligence and Machine Learning for Healthcare: Vol. 1: Image and Data Analytics. , Springer. Cham. (2022).
  23. Muzio, G., O'Bray, L., Borgwardt, K. Biological network analysis with deep learning. Brief Bioinform. 22 (2), 1515-1530 (2021).
  24. Luo, H., et al. Multi-omics integration for disease prediction via multi-level graph attention network and adaptive fusion. bioRxiv. , (2023).
  25. Feng, X., et al. Selecting multiple biomarker subsets with similarly effective binary classification performances. J Vis Exp. (140), e57738(2018).
  26. Duan, M., et al. Orchestrating information across tissues via a novel multitask GAT framework to improve quantitative gene regulation relation modeling for survival analysis. Brief Bioinform. 24 (4), (2023).
  27. Chicco, D., Starovoitov, V., Jurman, G. The benefits of the Matthews correlation Coefficient (MCC) over the diagnostic odds ratio (DOR) in binary classification assessment. IEEE Access. 9, 47112-47124 (2021).
  28. Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  29. Liu, J., et al. An integrated TCGA pan-cancer clinical data resource to drive high-quality survival outcome analytics. Cell. 173 (2), 400-416 (2018).
  30. Uhlen, M., et al. Towards a knowledge-based human protein atlas. Nat Biotechnol. 28 (12), 1248-1250 (2010).
  31. Hernaez, M., Blatti, C., Gevaert, O. Comparison of single and module-based methods for modeling gene regulatory. Bioinformatics. 36 (2), 558-567 (2020).
  32. Consortium, G. The genotype-tissue expression (GTEx) project. Nat Genet. 45 (6), 580-585 (2013).
  33. Kanehisa, M., et al. KEGG for taxonomy-based analysis of pathways and genomes. Nucleic Acids Res. 51, D587-D592 (2023).
  34. Han, H., et al. TRRUST v2: an expanded reference database of human and mouse transcriptional. Nucleic Acids Res. 46, D380-D386 (2018).
  35. Langfelder, P., Horvath, S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 9, 559(2008).
  36. Sulaimanov, N., et al. Inferring gene expression networks with hubs using a degree weighted Lasso. Bioinformatics. 35 (6), 987-994 (2019).
  37. Kogelman, L. J. A., Kadarmideen, H. N. Weighted Interaction SNP Hub (WISH) network method for building genetic networks. BMC Syst Biol. 8, 5(2014).
  38. Duan, M., et al. Pan-cancer identification of the relationship of metabolism-related differentially expressed transcription regulation with non-differentially expressed target genes via a gated recurrent unit network. Comput Biol Med. 148, 105883(2022).
  39. Duan, M., et al. Detection and independent validation of model-based quantitative transcriptional regulation relationships altered in lung cancers. Front Bioeng Biotechnol. 8, 582(2020).
  40. Fiorini, N., Lipman, D. J., Lu, Z. Towards PubMed 2.0. eLife. 6, 28801(2017).
  41. Liu, J., et al. Maternal microbiome regulation prevents early allergic airway diseases in mouse offspring. Pediatr Allergy Immunol. 31 (8), 962-973 (2020).
  42. Childs, E. J., et al. Association of common susceptibility variants of pancreatic cancer in higher-risk patients: A PACGENE study. Cancer Epidemiol Biomarkers Prev. 25 (7), 1185-1191 (2016).
  43. Wang, C., et al. Thailandepsins: bacterial products with potent histone deacetylase inhibitory activities and broad-spectrum antiproliferative activities. J Nat Prod. 74 (10), 2031-2038 (2011).
  44. Lv, X., et al. Transcriptional dysregulations of seven non-differentially expressed genes as biomarkers of metastatic colon cancer. Genes (Basel). 14 (6), 1138(2023).
  45. Li, X., et al. Undifferentially expressed CXXC5 as a transcriptionally regulatory biomarker of breast cancer. Advanced Biology. , (2023).
  46. Yuan, W., et al. The N6-methyladenosine reader protein YTHDC2 promotes gastric cancer progression via enhancing YAP mRNA translation. Transl Oncol. 16, 101308(2022).
  47. Tanabe, A., et al. RNA helicase YTHDC2 promotes cancer metastasis via the enhancement of the efficiency by which HIF-1α mRNA is translated. Cancer Lett. 376 (1), 34-42 (2016).

Przedruki i uprawnienia

Tagi

Sieć uwagi grafowejwybór cechekspresja mRNAdiagnostyka choróbprzesiewowe poszukiwanie biomarkerówmodel referencyjny