$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Valutazione della vista mqTrans del dataset trascrittomico
Il codice di test utilizza undici algoritmi di selezione delle caratteristiche (FS) e sette classificatori per valutare in che modo la vista mqTrans generata del set di dati trascrittomico contribuisce all'attività di classificazione (Figura 6). Il set di dati del test è costituito da 317 adenocarcinoma del colon (COAD) dal database The Cancer Genome Atlas (TCGA)29. I pazienti COAD in stadio I o II sono considerati come i campioni negativi, mentre quelli in stadio III o IV sono quelli positivi.
Undici algoritmi FS sono implementati nel codice di test. Esistono tre algoritmi FS basati su filtri, tra cui, selezionare le migliori caratteristiche K in base al MIC (SK_mic), selezionare le caratteristiche K in base all'FPR del MIC (SK_fpr) e selezionare le caratteristiche K in base al più alto FDR del MIC (SK_fpr). Tre algoritmi FS basati su alberi valutano le singole caratteristiche in base a un albero decisionale con indice di Gini (DT_gini), rispettivamente gli alberi decisionali potenziati adattivi (AdaBoost) e la foresta casuale (RF_fs). Il pool FS del codice di test valuta anche due wrapper: l'eliminazione ricorsiva delle funzionalità (RFE) con il classificatore del vettore di supporto lineare (SVC)(RFE_SVC) e RFE con il classificatore di regressione logistica (RFE_LR) e due algoritmi di incorporamento, il classificatore SVC lineare con i valori di importanza delle funzionalità L1 (lSVC_L1) più in alto e il classificatore di regressione logistica con i valori di importanza delle funzionalità L1 (LR_L1) in cima alla classificazione.
Il codice di test compila i modelli di classificazione utilizzando sette classificatori, tra cui SVC (Linear Support Vector Machine), GNB (Gaussian Naïve Bayes), classificatore di regressione logistica (LR), k-nearest neighbor, k-5 per impostazione predefinita (KNN), XGBoost, foresta casuale (RF) e albero decisionale (DT).
La Figura 6 mostra l'accuratezza massima del test delle caratteristiche mqTrans, delle caratteristiche mRNA originali e del sottoinsieme combinato delle caratteristiche mRNA e mqTrans consigliate da ciascun algoritmo FS.
I sottoinsiemi di caratteristiche combinate (mRNA+mqTrans) hanno raggiunto la massima accuratezza di 0,7656 sul metodo FS "SK_fpr", migliore dei singoli tipi di caratteristiche mqTrans (0,7188) e mRNA originale (0,7188). Modelli simili possono essere osservati per gli altri algoritmi FS. L'utente può controllare le funzionalità selezionate nel file di output Output-SelectedFeatures.csv.
Rilevamento dei biomarcatori oscuri
Studi precedenti hanno dimostrato l'esistenza di geni espressi in modo indifferenziato con valori di mqTrans rappresentati in modo significativamente differenziato tra il gruppo fenotipico e il gruppo di controllo 26,38,39. Questi geni sono chiamati biomarcatori oscuri perché gli studi tradizionali di rilevamento dei biomarcatori li ignorano per le loro espressioni indifferenziali. La funzione di analisi statistica t.test in Microsoft Excel può essere utilizzata per definire una funzione espressa in modo differenziale se il suo valore p statistico è inferiore a 0,05.
Tra le 3062 caratteristiche con i valori mqTrans generati, sono stati rilevati 221 biomarcatori oscuri (Figura 7). Il terzo gene classificato ENSG00000163697 (APBB2, Amyloid Beta Precursor Protein Binding Family B Member 2) mostra valori di mqTrans rappresentati in modo significativamente differenziato (mqTrans.P = 2,03 x 10-4) mentre il suo livello di espressione originale non mostra alcuna espressione differenziale (mRNA.P = 3,80 x 10-1). La parola chiave APBB2 ha raggiunto 27 pubblicazioni nel database PubMed40, ma non sono state rilevate connessioni con il colon o l'intestino.
Un altro gene ENSG00000048052 (HDAC9, istone deacetilasi 9) ha i valori di mqTrans rappresentati in modo differenziato (mqTrans.P = 6.09 x 10-3) pur mantenendo praticamente le stesse distribuzioni normali tra il gruppo fenotipico e quello di controllo (mRNA.P = 9.62 x 10-1). La parola chiave HDAC9 ha raggiunto 417 pubblicazioni nel database PubMed. Tre studi hanno anche menzionato le parole chiave "colon" o "intestino" negli abstract 41,42,43. Ma nessuno di loro ha studiato il ruolo di HDAC9 nel cancro del colon.
I dati hanno suggerito la necessità di ulteriori valutazioni di questi biomarcatori oscuri dalle loro attività post-trascrizione, ad esempio, i livelli di proteina tradotta44,45.
Distribuzioni pan-tumorali dei biomarcatori oscuri e tradizionali correlati al metabolismo
I biomarcatori tradizionali correlati al metabolismo sono stati sottoposti a screening e confrontati con i biomarcatori scuri in 26 tipi di cancro nel set di dati TCGA38. Entrambe le categorie di biomarcatori sono state sottoposte a valutazione statistica per discernere i livelli di significatività negli stadi tumorali precoci (Stadio I e II) e tardivi (Stadi III e IV). Questa valutazione ha utilizzato i test t di Student per i valori p, successivamente corretti per test multipli utilizzando tassi di falsa scoperta (FDR). I dati dettagliati per ciascuno dei 26 tipi di cancro sono forniti nella Figura 8.
I geni che producono valori p corretti per FDR inferiori a 0,05 sono stati classificati come biomarcatori tradizionali. Al contrario, i biomarcatori scuri sono stati definiti come quelli con valori p corretti per FDR inferiori a 0,05 nella vista mqTrans, mentre contemporaneamente non mostravano differenze statisticamente significative nei livelli di espressione.
La Figura 9 rivela una generale scarsità di biomarcatori oscuri rispetto ai biomarcatori tradizionali nella maggior parte dei tipi di cancro. Eccezioni degne di nota includono BRCA, MESO e TGCT, che manifestano una maggiore prevalenza di biomarcatori oscuri. È stato rivelato che vari fattori, tra cui fattori di trascrizione, modelli di metilazione, mutazioni genetiche e condizioni ambientali, potrebbero modulare la disregolazione trascrizionale di questi biomarcatori oscuri. Un'ulteriore complessità può derivare dalla sovrapposizione di trascritti di RNA non codificanti che potrebbero confondere i livelli di espressione dei biomarcatori oscuri. Le disregolazioni della trascrizione di alcuni biomarcatori oscuri sono state supportate dai loro livelli differenziali di proteine44,45. I biomarcatori oscuri sono spesso trascurati negli studi tradizionali e presentano strade intriganti per future indagini meccanicistiche.

Figura 1: Panoramica di HealthModel e dei moduli di selezione delle funzionalità in questo protocollo. Sostituire gli algoritmi specifici nel pool di selezione delle funzionalità e nel pool di classificatori se l'utente ha familiarità con la programmazione Python. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 2: Flusso di codice completo per questo protocollo. (A) Preparare l'ambiente Python. Per iniziare, crea un ambiente virtuale e installa i pacchetti essenziali. Per istruzioni complete, fare riferimento alla Sezione 1. (b) Generare le caratteristiche mqTrans. Ottenere le funzionalità di mqTrans eseguendo passo dopo passo il codice fornito. Spiegazioni dettagliate sono disponibili nella Sezione 2. (C) Selezionare mqTrans Features. Questa sezione si concentra sulla valutazione delle funzionalità di mqTrans. Fare riferimento alla Sezione 3 per dettagli approfonditi. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 3: Preparare l'ambiente per Python. (A) Il comando per creare healthmodel. (B) Immettere y durante il processo di creazione di VE. (C) Il comando più comune per l'attivazione del VE. (D) Il comando per l'installazione della torcia 1.13.1. (E) Installare librerie aggiuntive per il pacchetto torch-geometrico . (F) Installare il pacchetto torch-geometrico . Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 4: Eseguire HealthModel per ottenere la funzionalità mqTrans. (A) Scaricare il codice. (B) L'esempio del file di dati. Ogni colonna contiene tutti i valori di un fattore regolatorio e il primo elemento è l'ID del gene. Ogni riga fornisce i valori di un determinato campione, con il primo elemento che è il nome del campione. (C) L'esempio di un file di etichette. La prima colonna fornisce i nomi dei campioni e l'etichetta di classe di ogni esempio è indicata nella colonna intitolata label. Il valore 0 nella colonna dell'etichetta indica che il campione è attivo, mentre 1 indica che è morto. (D) le uscite di mqTrans. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 5: Eseguire l'algoritmo di selezione delle caratteristiche per la funzione mqTrans. I risultati dell'algoritmo di selezione delle funzionalità vengono mostrati all'utente. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 6: Accuratezza massima del set di test di ciascun algoritmo di selezione delle funzionalità. L'asse orizzontale elenca gli algoritmi di selezione delle feature e l'asse verticale fornisce i valori di accuratezza. Gli istogrammi mostrano i dati sperimentali delle tre impostazioni, ovvero mqTrans, mRNA, mRNA+mqTrans. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 7: I primi 50 biomarcatori oscuri con i valori p più piccoli nella vista mqTrans. La colonna "Biomarcatore oscuro" fornisce i nomi dei biomarcatori scuri. Le colonne "mRNA.P" e "mqTrans.P" sono i valori p statistici del t-test tra il gruppo fenotipico e quello di controllo. I colori di sfondo dei valori p sono compresi tra i valori p 1,00 (blu) e 0,00 (rosso) e il colore bianco rappresenta il valore p = 0,05. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 8: I dettagli dei 26 tumori nell'Atlante del Genoma del Cancro (TCGA) in diversi stadi. Le colonne "Coorte" e "Tessuto della malattia" descrivono il gruppo di pazienti e i tessuti con malattia per ciascun set di dati. Le ultime quattro colonne forniscono rispettivamente il numero di campioni negli stadi di sviluppo I, II, III e IV. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 9: Il numero di biomarcatori oscuri e biomarcatori tradizionali in 26 tumori. L'asse orizzontale elenca i 26 tipi di cancro. L'asse verticale fornisce i numeri dei biomarcatori oscuri e dei biomarcatori tradizionali per questi tipi di cancro. Fare clic qui per visualizzare una versione più grande di questa figura.
File di codifica supplementare 1: HealthModel-mqTrans-v1-00.tar Fare clic qui per scaricare questo file.