Ocena widoku mqTrans zbioru danych transkryptomicznych
Kod testowy wykorzystuje jedenaście algorytmów selekcji cech (FS) oraz siedem klasyfikatorów, aby ocenić, w jaki sposób wygenerowany widok mqTrans zbioru danych transkryptomicznych przyczynia się do zadania klasyfikacji (Rysunek 6). Zbiór danych testowych składa się z 317 próbek gruczolakoraka okrężnicy (COAD) z bazy danych The Cancer Genome Atlas (TCGA)29. Pacjenci z COAD w stopniu I lub II są uznawani za próbki negatywne, natomiast pacjenci w stopniu III lub IV za próbki pozytywne.
W kodzie testowym zaimplementowano jedenaście algorytmów FS. Dostępne są trzy algorytmy FS oparte na filtrach, obejmujące: wybór K najlepszych cech na podstawie MIC (SK_mic), wybór K cech na podstawie FPR dla MIC (SK_fpr) oraz wybór K cech na podstawie najwyższego FDR dla MIC (SK_fpr). Trzy algorytmy FS oparte na drzewach oceniają poszczególne cechy odpowiednio za pomocą drzewa decyzyjnego z indeksem Gini (DT_gini), adaptacyjnych wzmocnionych drzew decyzyjnych (AdaBoost) oraz lasów losowych (RF_fs). Pula FS w kodzie testowym ocenia również dwa wrappery: rekurencyjną eliminację cech (RFE) z liniowym klasyfikatorem wektorów nośnych (SVC) (RFE_SVC) oraz RFE z klasyfikatorem regresji logistycznej (RFE_LR), a także dwa algorytmy osadzania: liniowy klasyfikator SVC z najwyższymi wartościami istotności cech L1 (lSVC_L1) oraz klasyfikator regresji logistycznej z najwyższymi wartościami istotności cech L1 (LR_L1).
Kod testowy buduje modele klasyfikacji przy użyciu siedmiu klasyfikatorów, w tym liniowej maszyny wektorów nośnych (SVC), naiwnego klasyfikatora Bayesa z rozkładem Gaussa (GNB), regresji logistycznej (LR), k-najbliższych sąsiadów, domyślnie k-5 (KNN), XGBoost, lasów losowych (RF) oraz drzew decyzyjnych (DT).
Rysunek 6 przedstawia maksymalną dokładność testową cech mqTrans, oryginalnych cech mRNA oraz połączonego podzbioru cech mRNA i mqTrans zalecanego przez każdy z algorytmów FS.
Połączone podzbiory cech (mRNA+mqTrans) osiągnęły najwyższą dokładność 0,7656 przy zastosowaniu metody FS „SK_fpr”, co jest wynikiem lepszym niż w przypadku pojedynczych typów cech mqTrans (0,7188) oraz oryginalnego mRNA (0,7188). Podobne wzorce można zaobserwować dla pozostałych algorytmów FS. Użytkownik może sprawdzić wybrane cechy w pliku wyjściowym Output-SelectedFeatures.csv.
Wykrywanie ciemnych biomarkerów
Poprzednie badania wykazały istnienie genów o niezakłóconej ekspresji, które charakteryzują się istotnie różnymi wartościami mqTrans pomiędzy grupami fenotypowymi a kontrolnymi26,38,39. Geny te nazywa się ciemnymi biomarkerami, ponieważ tradycyjne badania nad wykrywaniem biomarkerów pomijają je ze względu na ich brak różnic w ekspresji. Funkcję analizy statystycznej t.test w programie Microsoft Excel można wykorzystać do zdefiniowania cechy jako różnicowo wyrażonej, jeśli jej statystyczna wartość p jest mniejsza niż 0,05.
Spośród 3062 cech z wygenerowanymi wartościami mqTrans wykryto 221 ciemnych biomarkerów (Rysunek 7). Gen zajmujący trzecie miejsce w rankingu ENSG00000163697 (APBB2, Amyloid Beta Precursor Protein Binding Family B Member 2) wykazuje istotnie różnicujące się wartości mqTrans (mqTrans.P = 2.03 x 10-4), podczas gdy jego pierwotny poziom ekspresji nie wykazuje różnic w ekspresji (mRNA.P = 3.80 x 10-1). Słowo kluczowe APBB2 pojawiło się w 27 publikacjach w bazie danych PubMed40, jednak nie wykryto powiązań z jelitem grubym ani cienkim.
Inny gen ENSG00000048052 (HDAC9, Histone Deacetylase 9) wykazuje różnicujące się wartości mqTrans (mqTrans.P = 6,09 x 10-3), przy jednoczesnym zachowaniu praktycznie takich samych rozkładów normalnych pomiędzy grupą fenotypową a kontrolną (mRNA.P = 9,62 x 10-1). Słowo kluczowe HDAC9 pojawiło się w 417 publikacjach w bazie danych PubMed. Trzy badania wspominały również w streszczeniach o słowach kluczowych „colon” (jelito grube) lub „intestine” (jelito)41,42,43. Żadne z nich nie badało jednak roli HDAC9 w raku jelita grubego.
Dane zasugerowały konieczność dalszej oceny tych ciemnych biomarkerów pod kątem ich aktywności potranskrypcyjnej, np. poziomów przetłumaczonych białek44,45.
Rozkład ciemnych i tradycyjnych biomarkerów związanych z metabolizmem w różnych typach nowotworów
Tradycyjne biomarkery związane z metabolizmem zostały wyselekcjonowane i porównane z ciemnymi biomarkerami w 26 typach nowotworów w zbiorze danych TCGA38. Obie kategorie biomarkerów poddano ocenie statystycznej w celu ustalenia poziomów istotności w wczesnych (stopnie I i II) oraz późnych (stopnie III i IV) stadiach nowotworu. W ocenie tej zastosowano testy t-Studenta do wyznaczenia wartości p, które następnie skorygowano pod kątem wielokrotnego testowania przy użyciu współczynnika odkryć fałszywie dodatnich (FDR). Szczegółowe dane dla każdego z 26 typów nowotworów przedstawiono na rysunku 8.
Geny, dla których skorygowane wartości p (FDR) były niższe niż 0,05, sklasyfikowano jako tradycyjne biomarkery. Z kolei ciemne biomarkery zdefiniowano jako te, które wykazywały skorygowane wartości p (FDR) poniżej 0,05 w widoku mqTrans, wykazując jednocześnie brak statystycznie istotnych różnic w poziomach ekspresji.
Rysunek 9 wykazuje ogólną rzadkość występowania ciemnych biomarkerów w porównaniu z tradycyjnymi biomarkerami w większości typów nowotworów. Godnymi uwagi wyjątkami są BRCA, MESO i TGCT, w których stwierdzono większą prewalencję ciemnych biomarkerów. Wykazano, że różne czynniki, w tym czynniki transkrypcyjne, wzorce metylacji, mutacje genowe oraz warunki środowiskowe, mogą modulować dysregulację transkrypcyjną tych ciemnych biomarkerów. Dalsza złożoność może wynikać z nakładających się transkryptów niekodującego RNA, które mogą zaburzać poziom ekspresji ciemnych biomarkerów. Dysregulacja transkrypcyjna niektórych ciemnych biomarkerów została potwierdzona przez ich zróżnicowane poziomy białek44,45. Ciemne biomarkery są często pomijane w tradycyjnych badaniach i stanowią intrygujące kierunki dla przyszłych analiz mechanistycznych.

Rysunek 1: Przegląd modułów HealthModel oraz selekcji cech w niniejszym protokole. Użytkownik znający programowanie w języku Python może zastąpić konkretne algorytmy w puli selekcji cech oraz w puli klasyfikatorów. Aby wyświetlić większą wersję tego rysunku, kliknij tutaj.

Rysunek 2: Kompletny przepływ kodu dla niniejszego protokołu. (A) Przygotowanie środowiska Python. Na początek należy utworzyć środowisko wirtualne i zainstalować niezbędne pakiety. Szczegółowe instrukcje znajdują się w sekcji 1. (B) Generowanie cech mqTrans. Uzyskanie cech mqTrans poprzez krokowe wykonywanie dostarczonego kodu. Szczegółowe wyjaśnienia znajdują się w sekcji 2. (C) Wybór cech mqTrans. Ta sekcja skupia się na ocenie cech mqTrans. Szczegółowe informacje znajdują się w sekcji 3. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 3: Przygotowanie środowiska dla języka Python. (A) Polecenie służące do utworzenia healthmodel. (B) Wprowadzenie y podczas procesu tworzenia VE. (C) Najczęściej stosowane polecenie aktywacji VE. (D) Polecenie instalacji torch 1.13.1. (E) Instalacja dodatkowych bibliotek dla pakietu torch-geometric. (F) Instalacja pakietu torch-geometric. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rysunek 4: Uruchomienie modelu HealthModel w celu uzyskania cechy mqTrans. (A) Pobranie kodu. (B) Przykład pliku danych. Każda kolumna zawiera wszystkie wartości czynnika regulacyjnego, a pierwszym elementem jest ID genu. Każdy wiersz zawiera wartości dla danej próbki, przy czym pierwszym elementem jest nazwa próbki. (C) Przykład pliku etykiet. Pierwsza kolumna zawiera nazwy próbek, a etykieta klasy każdej próbki znajduje się w kolumnie zatytułowanej label. Wartość 0 w kolumnie label oznacza, że próbka pochodzi od organizmu żywego, 1 oznacza martwy. (D) Wyniki mqTrans. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 5: Uruchomienie algorytmu selekcji cech dla cechy mqTrans. Użytkownikowi są prezentowane wyniki działania algorytmu selekcji cech. Aby zobaczyć powiększoną wersję tego rysunku, kliknij tutaj.

Rycina 6: Maksymalna dokładność zbioru testowego dla każdego algorytmu selekcji cech. Oś pozioma przedstawia algorytmy selekcji cech, a oś pionowa wartości dokładności. Histogramy ukazują dane eksperymentalne dla trzech ustawień, tj. mqTrans, mRNA oraz mRNA+mqTrans. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 7: 50 najważniejszych ciemnych biomarkerów z najmniejszymi wartościami p w widoku mqTrans. Kolumna „Dark Biomarker” zawiera nazwy ciemnych biomarkerów. Kolumny „mRNA.P” i „mqTrans.P” przedstawiają statystyczne wartości p testu t pomiędzy grupą fenotypową a kontrolną. Kolory tła wartości p zmieniają się od 1,00 (niebieski) do 0,00 (czerwony), a kolor biały oznacza wartość p = 0,05. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 8: Szczegółowe informacje na temat 26 nowotworów w bazie The Cancer Genome Atlas (TCGA) w różnych stadiach. Kolumny „Cohort” (Kohorta) i „Disease Tissue” (Tkanka chorobowa) opisują grupę pacjentów oraz tkanki objęte procesem chorobowym dla każdego zbioru danych. Cztery ostatnie kolumny podają liczbę próbek odpowiednio w stadiach rozwojowych I, II, III i IV. Aby wyświetlić powiększoną wersję tej ryciny, kliknij tutaj.

Rycina 9: Liczba ciemnych biomarkerów i tradycyjnych biomarkerów w 26 nowotworach. Oś pozioma wymienia 26 typów nowotworów. Oś pionowa podaje liczbę ciemnych biomarkerów i tradycyjnych biomarkerów dla tych typów nowotworów. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Uzupełniający plik z kodem 1: HealthModel-mqTrans-v1-00.tar Kliknij tutaj, aby pobrać ten plik.