Questo studio è stato approvato dal Consiglio di Revisione Istituzionale del Primo Ospedale Affiliato della Bengbu Medical University (Numero di approvazione: 2023YJS162). Il consenso informato scritto di tutti i partecipanti è stato ottenuto prima della raccolta del campione.
Raccolta dati
I dati trascritomici utilizzati in questo studio sono stati ottenuti dal database Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). Il dataset principale di addestramento, GSE150910, è stato generato utilizzando la piattaforma Illumina NovaSeq 6000 (GPL24676) e comprendeva 103 campioni di tessuto polmonare IPF e 103 di tessuto polmonare normale. Per convalidare i risultati, sono stati utilizzati dataset indipendenti GSE24206, GSE110147, GSE93606 e GSE38958. Informazioni dettagliate su ciascun dataset sono fornite nella Tabella 1. Inoltre, sono stati selezionati in totale 636 GRG da uno studioprecedentemente pubblicato 14.
Analisi dell'espressione differenziale e caratterizzazione funzionale dei DEG correlati alla glicosilazione
L'analisi di espressione differenziale tra campioni di tessuto polmonare IPF e normale dal dataset GSE150910 è stata condotta utilizzando il pacchetto R DESeq2 (RRID: SCR_015687). Geni con un valore P aggiustato (padj) < 0,05 e |log2FoldChange| > 0,5 sono stati considerati geni espressi differenzialmente (DEG). I DEG correlati alla glicosilazione (GR-DEG) sono stati identificati intersecando i DEG con un insieme predefinito di 636 GRG. Per approfondire i ruoli biologici di questi geni, sono state effettuate analisi di arricchimento Gene Ontology (GO) e analisi delle vie della Kyoto Encyclopedia of Genes and Genomes (KEGG) per chiarire i loro ruoli funzionali e il coinvolgimento delle vie di ricerca. È stata generata una rete di interazione proteina-proteina (PPI) utilizzando il database STRING (RRID: SCR_005223)15 con una soglia di punteggio di confidenza nell'interazione di > 0,7, per chiarire le interazioni molecolari e i potenziali meccanismi regolatori dei GR-DEG nell'IPF.
Screening dei geni chiave e costruzione di un modello diagnostico
Per selezionare i geni chiave per l'IPF dai GR-DEG, abbiamo impiegato diversi algoritmi di machine learning. Inizialmente, la regressione LASSO (RRID: SCR_003418) era dotata di regressione logistica binaria (famiglia = "binomiale") e il parametro di penalità ottimale λ veniva selezionato tramite validazione incrociata a 10 volte (nfold = 10). I risultati finali della selezione sono stati le caratteristiche con coefficienti diversi da zero corrispondenti a λ_(min) (0,01700442). Per SVM-RFE, veniva utilizzata la funzione rfe dal caret del pacchetto R. L'eliminazione ricorsiva delle caratteristiche è stata effettuata tramite validazione incrociata a 10 volte (metodo = "cv", numero = 10), filtrando progressivamente le caratteristiche da 1 a 126, utilizzando la precisione per determinare il sottoinsieme ottimale delle caratteristiche. In XGBoost, la funzione obiettivo era impostata su regressione logistica binaria (obiettivo = "binario: logistico"), con la metrica di valutazione impostata su perdita logaritmica (eval_metric = "logloss"), il numero di iterazioni (nround) impostato a 100 e la velocità di apprendimento (eta) impostata a 0,1. I primi 20 geni sono stati selezionati in base ai loro punteggi di importanza delle caratteristiche (Gain). Intersecando i risultati di questi metodi, è stato identificato un insieme raffinato di geni chiave. Sulla base di questo insieme genetico, è stato costruito un modello diagnostico XGBoost utilizzando il dataset di addestramento (GSE150910), e le sue prestazioni predittive sono state valutate utilizzando l'analisi delle caratteristiche operative del ricevitore (ROC) su dataset di validazione esterni (GSE110147, GSE24206, GSE93606 e GSE38958). Inoltre, è stato sviluppato un nomogramma per visualizzare il contributo di ciascun gene selezionato alla probabilità della malattia, e l'utilità clinica del modello è stata ulteriormente valutata tramite curve di calibrazione e analisi delle curve decisionali (DCA).
Esplorazione delle vie biologiche dei geni chiave
Esplorare il contesto biologico dei geni chiave identificati dal machine learning. L'Analisi di Arricchimento del Set Genico (GSEA)16 è stata eseguita sulla base delle liste geniche del Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17e le vie sono state selezionate per NES > 1. I percorsi arricchiti superiori sono stati visualizzati utilizzando la funzione enrichplot.
Esplorazione delle differenze nella funzione biologica e nel panorama immunitario nei sottotipi IPF basandosi sui punteggi genici chiave
Sulla base dei profili di espressione dei geni chiave identificati, sono stati calcolati e utilizzati punteggi di Enrichment Analysis a campione singolo (ssGSEA) per stratificare i pazienti IPF in gruppi con punteggio alto e basso in base al punteggio mediano. È stata effettuata un'analisi di espressione differenziale tra i due gruppi, seguita da GSEA (RRID: SCR_003199)18 per condurre analisi di arricchimento delle vie biologiche GO (GOBP) e KEGG sui DEG.
Analisi dell'infiltrazione delle cellule immunitarie e delle principali differenze nell'espressione genica
Dopo la stratificazione dei sottogruppi basata sui punteggi ssGSEA, sono state valutate le differenze nell'infiltrazione immunitaria tra i gruppi con punteggi alti e bassi. Per prima cosa, abbiamo calcolato le abbondanze relative di 22 tipi di cellule immunitarie nei campioni utilizzando l'algoritmo CIBERSORT (RRID: SCR_016955)19 in combinazione con la matrice di caratteristiche LM22. In particolare, per i calcoli è stata utilizzata la funzione deconv_tme nel pacchetto R IOBR (parametri: metodo = "cibersort", array = FALSE, perm = 200), e i box plot sono stati generati utilizzando il pacchetto ggpubr (RRID: SCR_021139) per valutare le differenze nell'infiltrazione delle cellule immunitarie tra i gruppi con punteggio alto e basso. Inoltre, la funzione gsva nel pacchetto R GSVA (utilizzando il metodo ssGSEA) è stata utilizzata per calcolare i punteggi di arricchimento di 28 tipi di cellule immunitarie. Questi punteggi sono stati poi normalizzati utilizzando la scala Min-Max per mappareli all'intervallo [0, 1], facilitando i confronti tra tipi di cellule. Infine, sono stati eseguiti test Wilcoxon a somma di rango per confrontare l'espressione dei geni chiave tra campioni normali e pazienti IPF nei dataset GSE150910 e GSE110147, fornendo un'analisi completa dell'infiltrazione delle cellule immunitarie e delle differenze di espressione genica tra i sottogruppi IPF.
Validazione dei geni chiave nei pazienti IPF tramite analisi RT-qPCR
Per validare la rilevanza diagnostica dei geni identificati, sei geni con i punteggi di importanza più alti dall'algoritmo XGBoost sono stati selezionati per la validazione dei livelli di espressione in pazienti IPF e controlli sani utilizzando la trascrizione inversa di PCR quantitativa (RT-qPCR). Sono stati prelevati in totale 20 campioni di sangue, inclusi 9 da pazienti IPF e 11 da individui sani, dal Primo Ospedale Affiliato della Bengbu Medical University. L'RNA totale è stato estratto dai campioni di sangue e la concentrazione di RNA è stata misurata utilizzando un lettore di microplacche multifunzionale. La qualità dell'RNA è stata valutata prima delle analisi a valle. Il DNA genomico è stato rimosso durante la trascrizione inversa, e le sequenze di primer utilizzate per la RT-qPCR sono elencate nella Tabella 2. La specificità del primer è stata verificata tramite analisi della curva di fusione. Il GAPDH veniva utilizzato come gene di riferimento interno. I livelli relativi di espressione genica sono stati calcolati utilizzando il metodo 2-ΔΔCt . Questo passaggio di validazione fornisce un supporto sperimentale preliminare per l'espressione differenziale e la potenziale rilevanza diagnostica dei geni identificati nell'IPF.
Analisi statistica
I dati sono stati analizzati in R, e il test di Wilcoxon è stato utilizzato per rilevare differenze tra i due gruppi. L'analisi di arricchimento GSEA, GO e KEGG è stata effettuata utilizzando il cluster Profiler del pacchetto R (RRID: SCR_016884). Un p-value < 0,05 era considerato significativo salvo diversa specificazione.