Lo studio è stato condotto in conformità con la Dichiarazione di Helsinki, e il protocollo è stato approvato dal Comitato Etico dell'Ospedale Toracico di Anhui (K2025-007) il 22 aprile 2025. Il consenso informato è stato ottenuto da tutti i soggetti coinvolti nello studio.
Estrazione e normalizzazione dei dati
I profili trascrittomici e i corrispondenti dataset clinici per il carcinoma polmonare a cellule adenoidi (LUAD) sono stati ottenuti dalle coorti TCGA e GEO. Il dataset TCGA-LUAD è stato designato come set di addestramento, mentre GSE72094, GSE31210 e GSE26939 sono stati utilizzati come coorti per la validazione esterna (Tabella 1). Inoltre, 900 geni correlati al metabolismo del colesterolo (MCRG) sono stati raccolti da uno studio precedente12 (Tabella Supplementare 1). I dati del trascrittoma sono stati annotati utilizzando GENCODE v36 o i file di annotazione della piattaforma GPL corrispondenti. Gli ID delle sonde sono stati convertiti in simboli genici, i geni duplicati sono stati uniti mediante la funzione avereps e sono stati conservati solo i geni codificanti proteine per generare matrici di espressione a livello genico. Per il set di addestramento TCGA-LUAD, i geni con Fragments per kilobase of exon model per million mapped fragments (FPKM) < 1 in più del 50% dei campioni sono stati eliminati, e i valori residui di espressione sono stati trasformati in log2 (log2[FPKM+1]). Per le coorti di validazione GEO, i dati grezzi di espressione sono stati scaricati, gli ID delle sonde sono stati mappati ai simboli genici utilizzando i file di annotazione della piattaforma corrispondente e le sonde multiple corrispondenti allo stesso gene sono state raggruppate calcolandone la media dei valori di espressione. Questi dataset sono stati trasformati in log2 quando necessario. Non è stata applicata alcuna correzione per l'effetto di lotto tra piattaforme diverse (TCGA e GEO), poiché abbiamo adottato una strategia di standardizzazione per coorte per garantire una comparabilità relativa. In particolare, per le coorti di addestramento e di validazione, i valori di espressione genica sono stati centrati e normalizzati (trasformazione z-score) utilizzando la media e la deviazione standard di ciascun dataset individualmente. Gli stessi coefficienti di regressione di Cox derivati dal set di addestramento sono stati quindi utilizzati per calcolare i punteggi di rischio per tutte le coorti. Per mantenere l'applicabilità clinica ed evitare l'overfitting su qualsiasi set di validazione, la mediana del punteggio di rischio della coorte di addestramento è stata utilizzata come soglia fissa per stratificare i pazienti in gruppi ad alto e basso rischio in tutte le coorti di validazione esterna. Le informazioni cliniche, incluse età, sesso, stadio patologico, stadio Tumor-Node-Metastasi (TNM), tipo istologico, tempo di sopravvivenza, stato di sopravvivenza e tipo di tessuto, sono state estratte quando disponibili. L'endpoint era la sopravvivenza complessiva (OS). Sono stati esclusi i campioni con informazioni incomplete sulla sopravvivenza o con tempo di sopravvivenza < 30 giorni. Il tempo di sopravvivenza è stato convertito in anni e lo stato di sopravvivenza è stato codificato come 0 per vivo e 1 per morto.
Identificazione e analisi funzionali di geni candidati
Il pacchetto Limma ha identificato i geni differenzialmente espressi (DEG) tra campioni tumorali e normali di adenocarcinoma polmonare (LUAD) nel set di addestramento13. I DEG sono stati definiti secondo i seguenti criteri: |log2FC| > 0,5 e valore p aggiustato < 0,05. Successivamente, l'algoritmo di clustering sfocato mfuzz nel pacchetto R ClusterGVis è stato utilizzato per suddividere i DEG in distinti cluster di espressione. È stata eseguita un'analisi dell'ontologia genica – processo biologico (GO-BP) sui cinque geni rappresentativi principali di ciascun cluster, in base ai loro punteggi di appartenenza. Un insieme di geni condivisi è stato ottenuto calcolando l'intersezione tra i DEG e i MCRG. Un'analisi di arricchimento funzionale mediante Ontologia Genica/Enciclopedia di Kyoto dei Geni e dei Genomi (GO/KEGG) ha valutato la rilevanza biologica dei geni sovrapposti. Le reti di interazione proteina-proteina (PPI) sono state ottenute dal database STRING14. Sono state mantenute solo le interazioni con punteggi di confidenza > 0,7 al fine di migliorare l'affidabilità della rete.
Selezione di geni prognostici
Il pacchetto Survival è stato utilizzato per effettuare un'analisi di regressione di Cox univariata al fine di identificare i geni probabilmente associati alla sopravvivenza complessiva nel carcinoma polmonare a cellule adenoidi (LUAD)15. I geni con un valore di p < 0,05 sono stati considerati possibili indicatori prognostici. La coorte di addestramento TCGA-LUAD comprendeva 500 pazienti con dati di sopravvivenza completi, tra cui 216 (43,2%) hanno avuto un evento di morte durante il follow-up. Il rapporto tra geni candidati (n = 108) ed eventi (n = 216) era di circa 1:2, valore accettabile per l'analisi di regressione di Cox. Successivamente, l'analisi di regressione con operatore di riduzione e selezione della norma L1 (LASSO) e il modello Extreme Gradient Boosting (XGBoost) hanno ulteriormente selezionato le caratteristiche. I modelli di rischio proporzionale di Cox sono stati costruiti con family = "cox" mediante la funzione cv.glmnet del pacchetto glmnet. Il parametro di regolarizzazione ottimale è stato identificato utilizzando una validazione incrociata a 10 ripiegamenti, in cui il valore λ.min rappresenta l'errore minimo di validazione incrociata ed è stato scelto come valore ottimale di λ. Sono stati estratti come caratteristiche candidati i geni con coefficienti di regressione diversi da zero. Per il modello XGBoost, il tempo di sopravvivenza e lo stato di sopravvivenza sono stati combinati in una singola variabile risultato, assegnando valori positivi agli eventi di morte e valori negativi ai casi censurati. I parametri sono stati impostati come objective = "survival: cox" e eval_metric = "cox-nloglik", con 100 iterazioni e un tasso di apprendimento di 0,1. Dopo l'addestramento del modello, i punteggi di importanza dei geni sono stati calcolati utilizzando i valori di guadagno delle caratteristiche. I primi 20 geni sono stati mantenuti ordinando i punteggi di importanza in ordine decrescente, al fine di ridurre la dimensionalità delle caratteristiche e la complessità del modello. I geni comuni ai risultati di LASSO e XGBoost sono stati identificati come geni prognostici candidati.
Costruzione e valutazione di un modello prognostico
È stato sviluppato un modello prognostico mediante analisi di regressione di Cox multivariata dei geni candidati identificati. I punteggi di rischio sono stati calcolati singolarmente come segue:
.
dove Coefi indica il coefficiente per il gene i e Expi indica il rispettivo valore di espressione genica. Gli individui sono stati successivamente suddivisi in due gruppi: ad alto rischio e a basso rischio, utilizzando il punteggio mediano di rischio come soglia di cutoff. Successivamente, sono state create curve ROC (receiver operating characteristic) dipendenti dal tempo. Per valutare il potenziale di overfitting, è stata eseguita una validazione interna con metodo bootstrap, comprensiva di 1.000 iterazioni di ricampionamento, al fine di calcolare l'indice C corretto per il bias e le AUC dipendenti dal tempo con intervalli di confidenza al 95%. Sono state generate curve di calibrazione per valutare la concordanza tra le probabilità di sopravvivenza previste e quelle osservate a 2, 3 e 5 anni. Inoltre, è stata effettuata un'analisi della curva decisionale (DCA) utilizzando il pacchetto ggDCA in R per valutare il beneficio clinico netto del modello ai tempi di 2, 3 e 5 anni, quantificando il potenziale valore del punteggio di rischio nel processo decisionale clinico in corrispondenza di diverse probabilità soglia. Le differenze di sopravvivenza tra i gruppi stratificati per rischio e tra altre categorie cliniche sono state confrontate mediante curve di sopravvivenza di Kaplan-Meier (KM) con test log-rank. Inoltre, per chiarire il contributo individuale dei geni alla performance del modello, è stata impiegata l'analisi SHAP (Shapley Additive exPlanations) per un'interpretazione esplicativa a posteriori.
Sviluppo e validazione esterna del nomogramma
Le relazioni tra i punteggi di rischio calcolati e diverse caratteristiche cliniche (inclusi sesso, età e stadio TNM) sono state analizzate mediante test di Wilcoxon rank-sum o test di Kruskal-Wallis per valutare l'applicabilità clinica del modello. Per verificare se il punteggio di rischio fungeva da fattore prognostico indipendente, le variabili cliniche insieme al punteggio di rischio sono state inserite in un modello di regressione di Cox multivariata. Successivamente, è stato costruito un nomogramma prognostico che combinava i fattori di rischio clinici indipendenti (ad esempio, Stadio) e il punteggio genetico di rischio, utilizzando il pacchetto R regplot, al fine di personalizzare le previsioni della probabilità di sopravvivenza. Le curve di calibrazione sono state utilizzate per valutare l'accordo tra la probabilità di sopravvivenza predetta dal nomogramma e gli esiti di sopravvivenza effettivi. Infine, la capacità predittiva finale e la generalizzabilità del sistema nomogramma integrato sono state rigorosamente validate mediante curve ROC dipendenti dal tempo e analisi comprehensive di sottogruppi clinici KM nelle coorti.
Analisi dell'infiltrazione immunitaria e dei sottotipi immunitari
È stato utilizzato CIBERSORT, con la matrice di firma genica dei leucociti (LM22), per stimare le proporzioni relative di 22 tipi di cellule immunitarie al fine di valutare l'infiltrazione di cellule immunitarie nei pazienti con adenocarcinoma polmonare (LUAD). Le relazioni tra i livelli di espressione genica prognostica e l'infiltrazione immunologica sono state valutate mediante analisi di correlazione di Spearman. I punteggi immunitario, stromale, di purezza del tumore e di stima (ESTIMATE) sono stati ottenuti tramite l'algoritmo ESTIMATE, e le differenze tra i gruppi a rischio sono state valutate con il test di Wilcoxon. I pazienti con LUAD sono stati assegnati a sei sottotipi immunitari utilizzando il pacchetto ImmuneSubtypeClassifier16. Il test di Wilcoxon è stato inoltre utilizzato per confrontare le distribuzioni dei sottotipi immunitari tra i gruppi a rischio.
Analisi dei checkpoint immunitari, del punteggio immunofenoscore e del ciclo dell'immunità antitumorale
In questo studio, il test del rango con segno di Wilcoxon è stato utilizzato per valutare 21 geni dei checkpoint immunitari17 in gruppi stratificati per rischio, al fine di caratterizzare il paesaggio immunitario del carcinoma polmonare a cellule non piccole di tipo adenocarcinoma (LUAD). La correlazione di Spearman ha collegato i geni prognostici candidati ai geni dei checkpoint immunitari. Per valutare le differenze nella risposta agli inibitori dei checkpoint immunitari (ICIs) nei pazienti con LUAD a diversi livelli di rischio, i dati del punteggio immunofenotipico (IPS) per i trattamenti anti-PD-1 e anti-CTLA-4 sono stati ottenuti da The Cancer Immunome Atlas (TCIA)18, e la base di dati Tracking Tumor Immunophenotype (TIP)19 è stata utilizzata per valutare l'attività del ciclo cancro-immunità, confrontando i punteggi corrispondenti tra i gruppi a rischio.
Analisi delle mutazioni somatiche e della sensibilità ai farmaci
Lo strumento TCGA mutations ha recuperato i profili di mutazioni somatiche per i casi TCGA-LUAD al fine di analizzare la variabilità nei modelli di mutazione tra i diversi gruppi di rischio. Il pacchetto maftools ha elaborato e visualizzato i dati sulle mutazioni. I livelli di carico mutazionale tumorale (TMB) sono stati determinati per ciascun campione e confrontati tra le due categorie di rischio. È stata condotta un'analisi della sensibilità farmacogenomica utilizzando il pacchetto pRRophetic in base al database Genomics of Drug Sensitivity in Cancer (GDSC)20. Sono stati predetti i valori di concentrazione inibitoria semimassimale (IC50) per farmaci antitumorali in ciascun paziente con LUAD, e le differenze tra i gruppi di rischio sono state quantificate mediante il test della somma dei ranghi di Wilcoxon.
Valutazione dei livelli di espressione dei geni prognostici
Ogni set di dati è stato utilizzato per valutare i livelli di trascritto di geni candidati selezionati correlati all'esito. Per collegare l'espressione genica alla prognosi del paziente, sono state determinate cutoff ottimali mediante la funzione surv_cutpoint nel pacchetto R survminer. Sulla base di queste soglie, i casi di LUAD sono stati suddivisi in sottogruppi ad alta e bassa espressione per l'analisi successiva della sopravvivenza.
Inoltre, sono stati ottenuti cinque campioni accoppiati di tumori di carcinoma polmonare a cellule adenocarcinoma (LUAD) e tessuti normali adiacenti dall'ospedale toracico dell'Anhui, e successivamente è stata eseguita la validazione mediante qPCR. Ogni partecipante ha fornito un consenso informato scritto. Sono stati selezionati sei geni prognostici candidati (PDGFB, LDHA, ZEB2, FKBP4, DMD e S100B) per la validazione mediante qPCR. L'RNA è stato estratto da campioni di tessuto omogeneizzati utilizzando un reagente per l'estrazione dell'RNA, seguito da estrazione con cloroformio e precipitazione con isopropanolo. Lo spettrofotometro ha permesso la misurazione della concentrazione e della purezza dell'RNA. La validazione mediante qPCR dei sei geni prognostici candidati è stata effettuata mediante mix master per PCR basato su SYBR Green su un sistema di PCR in tempo reale: denaturazione iniziale a 95 °C per 30 s, seguita da 40 cicli di 95 °C per 20 s, 55 °C per 20 s e 72 °C per 20 s. L'espressione relativa è stata calcolata e normalizzata rispetto a Glyceraldehyde-3-Phosphate Dehydrogenase (GAPDH) mediante la tecnica 2-ΔΔCt. I dettagli di tutti i reagenti e degli strumenti sono riportati nella Tabella dei Materiali.
Analisi statistica
Le analisi statistiche sono state condotte utilizzando software di calcolo e grafica statistica. La rete di interazioni proteina-proteina è stata visualizzata mediante software di analisi delle reti. Dopo la valutazione della normalità, il test t di Student è stato utilizzato per le variabili continue distribuite normalmente e il test U di Mann-Whitney per quelle non distribuite normalmente.