Articolo di ricerca

L'analisi integrata bioinformatica dei dati trascrittomici umani identifica tre biomarcatori diagnostici e prognostici chiave nell'adenocarcinoma polmonare

DOI:

10.3791/71214

30 giugno 2026

* These authors contributed equally

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha identificato biomarcatori diagnostici e prognostici per l'adenocarcinoma polmonare utilizzando TCGA-LUAD e GEO GSE115002 dati trastomici. B3GNT3, FERMT1 e SPP1 sono stati regolati al massimo, distinguendo i tumori dal tessuto normale. Questi geni sono collegati alla transizione epiteliale-mesenchimale e all'immunosoppressione. Un nomogramma che combina l'espressione genica con lo stadio TNM ha mostrato un valore predittivo affidabile.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'adenocarcinoma polmonare (LUAD) è la principale causa di morte correlata al cancro a livello mondiale. Nonostante i progressi nella chirurgia, nella terapia mirata e nell'immunoterapia, il tasso di sopravvivenza a 5 anni del LUAD avanzato rimane sotto il 20%, indicando un bisogno urgente di biomarcatori molecolari affidabili per la diagnosi precoce e la prognosi. In questo studio, gli autori hanno ipotizzato che tre geni costantemente aumentati potessero agire come biomarcatori diagnostici e prognostici efficaci per la LUAD. Gli autori hanno analizzato dati trascritomici di due coorti indipendenti, TCGA-LUAD (535 tumori, 59 campioni normali) e GSE115002 (52 tumori, 52 campioni normali corrispondenti), per analizzare geni espressi differenzialmente. Tre geni fondamentali—B3GNT3, FERMT1 e SPP1—sono stati costantemente sovraespressi nei tumori LUAD in entrambi i dataset. Questi geni hanno mostrato eccellenti prestazioni diagnostiche, con valori AUC superiori a 0,95 in TCGA-LUAD e alta accuratezza in GSE115002. L'analisi di sopravvivenza ha mostrato che un'alta espressione di ciascun gene era significativamente associata a una sopravvivenza complessiva più breve e senza malattia, e la regressione multivariata di Cox ne ha verificato il valore prognostico indipendente. L'analisi dell'arricchimento funzionale ha indicato che questi tre geni partecipano alla transizione epiteliale-mesenchimatore, alla rimodellazione della matrice extracellulare e alla soppressione immunitaria, tutti strettamente correlati all'invasione e alla metastasi del LUAD. Gli autori hanno inoltre costruito un nomogramma prognostico combinando i tre geni e lo stadio TNM, raggiungendo un indice di concordanza di 0,743 e dimostrando buone prestazioni predittive. Questi risultati confermano che B3GNT3, FERMT1 e SPP1 sono biomarcatori diagnostici e prognostici promettenti per LUAD, supportando l'applicazione clinica nella stratificazione e gestione del rischio.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il cancro ai polmoni è la principale causa di mortalità globale per cancro, con circa 1,8 milioni di decessi nel 2020. L'adenocarcinoma polmonare (LUAD) rappresenta quasi il 40% di tutti i casi di cancroai polmoni 2. Nonostante i progressi nella chirurgia, nella terapia mirata e nell'immunoterapia, il tasso di sopravvivenza a 5 anni per il LUAD avanzato rimane sotto il 20%3,4. Sono urgentemente necessari biomarcatori molecolari affidabili per una diagnosi precoce e una previsione precisa. Il sequenziamento ad alta produttività e i database pubblici come The Cancer Genome Atlas (TCGA) e Gene Expression Omnibus (GEO) permettono una profilazione trascritomica sistematica deitumori 5,6. La bioinformatica integrativa cross-cohort migliora l'affidabilità della scoperta di biomarcatoricandidati 5.

Molti geni e vie sono stati implicati nel LUAD, tra cui la proliferazione cellulare, la segnalazione dell'EGFR e la fugaimmunitaria 7. Tuttavia, pochi sono stati tradotti in uso clinico. I modelli di rischio che combinano firme geniche e caratteristiche clinicopatologiche—specialmente nomogrammi—migliorano l'accuratezza prognostica in LUAD8. Sebbene B3GNT3, FERMT1 e SPP1 siano stati individualmente collegati alla progressione del cancro, il loro valore regolatorio combinato diagnostico, prognostico e microambientale immunitario nel LUAD non è stato sistematicamente validato tra coorti indipendenti. Questo studio fornisce la prima analisi integrata e cross-platform di questi tre geni come pannello unificato di biomarcatori per LUAD, con un nomogramma prognostico clinicamente applicabile.

B3GNT3 codifica una glicosiltransferasi che stabilizza PD-L1 e promuove l'evasioneimmunitaria 9,10. FERMT1 (kindlin-1) regola l'attivazione dell'integrina e favorisce la metastasi nel cancro polmonare non a piccole cellule (NSCLC)11,12. SPP1 (osteopontina) media la rimodellazione della matrice extracellulare, la transizione epiteliale-mesenchimale (EMT) e la chemioresistenza 13,14,15. È stato inoltre dimostrato che i geni correlati all'orologio circadiano prevedono la prognosi e la diagnosi16 della LUAD, mentre le differenze di sesso nella LUAD sono state scoperte tramite reti di segnalazione proteica integrativamulti-omiche 17. B3GNT3 e SPP1 sono secreti o localizzati in membrana, supportando un potenziale utilizzo come biomarcatori minimamente invasivi. Una classificazione efficace LUAD e l'identificazione dei biomarcatori possono essere ottenute anche attraverso metodi di selezione delle caratteristichesovrapposti 18, e le interazioni multi-omiche svolgono ruoli funzionali importanti nella progressione del cancropolmonare 19. Le firme geniche mitocondriali, identificate tramite integrazione multi-omica completa, hanno anch'esse valore per la prognosi LUAD e la terapiapersonalizzata 20. B3GNT3 e SPP1 sono secreti o localizzati in membrana, supportando un potenziale utilizzo come biomarcatori minimamente invasivi. Questo studio mirava a identificare biomarcatori LUAD robusti utilizzando bioinformatica integrativa, valutarne le prestazioni diagnostiche e prognostiche, esplorarne le funzioni biologiche e le associazioni immunitarie, e costruire un nomogramma prognostico clinicamente utile.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Fonti di dati e preelaborazione

  1. Elaborare i dati grezzi in R (versione 4.1.3; Windows 10 Pro).
  2. Per GSE115002, applicare la normalizzazione dei quantili usando limma (versione 3.52.3).
  3. Filtrare i geni a bassa espressione per TCGA: trattenere geni con CPM > 0,5 nel ≥50% dei campioni.
  4. Filtrare i geni a bassa espressione per GSE115002: mantenere i geni con segnale medio >50.
  5. log2Trasformare i valori delle espressioni con un pseudoconteggio di +1.
    NOTA: L'espressione genica e i dati clinici del LUAD sono stati ottenuti da TCGA-LUAD (versione 33.0, GDC Portal, scaricato il 7 agosto 2025) e GSE115002 (Agilent microarray, GEO, scaricato il 7 agosto 2025). TCGA-LUAD ha incluso 535 tumori e 59 campioni normali. GSE115002 includevano 52 tumori e 52 campioni normali corrispondenti.

2. Identificazione di geni espressi differenzialmente

  1. Usa DESeq2 (versione 1.36.0) per TCGA RNA-seq e limma (versione 3.52.3) per GSE115002 per l'analisi delle espressioni differenziali. Calcola i valori P aggiustati (FDR) usando il metodo di Benjamini–Hochberg.
  2. Per garantire la comparabilità tra dataset, un unificato |log₂FC| ≥ 1.0 è stato applicato per entrambe le coorti. I DEG erano definiti come FDR < 0,05 e |log₂FC| ≥ 1.0. I DEG sovrapposti sono stati identificati utilizzando VennDiagram (versione 1.7.3). B3GNT3, FERMT1 e SPP1 sono stati selezionati come candidati costantemente aumentati e con rilevanza nota per il cancro.

3. Valutazione del valore diagnostico

  1. Costruire curve ROC per ogni gene candidato.
  2. Determina i valori ottimali del cutoff utilizzando l'indice di Youden.
  3. Calcola AUC, sensibilità e specificità per ogni gene.
  4. Costruisci un pannello diagnostico combinato usando regressione logistica multivariata.
    NOTA: Il pacchetto pROC v1.18.0 è stato utilizzato per l'analisi ROC. La funzione glm con la famiglia binomiale è stata utilizzata per costruire il modello diagnostico.

4. Analisi della sopravvivenza

  1. Stratificare i pazienti in gruppi ad alta e bassa espressione usando l'espressione mediana.
  2. Generare curve di sopravvivenza di Kaplan–Meier per ogni gene.
  3. Esegui test log-rank per confrontare le differenze di sopravvivenza.
  4. Condurre un'analisi di regressione di Cox univariata.
  5. Condurre un'analisi di regressione Cox multivariata.
  6. Includere le covariate cliniche nei modelli di regressione.
  7. Verificare l'assunzione dei rischi proporzionali utilizzando i residui di Schoenfeld.
  8. Calcola un punteggio di rischio su tre geni.
    NOTA: Sono stati utilizzati Survival v3.3.1 e survivor v0.4.9. Le covariate includevano età, sesso, stadio T, stadio N e stadio M. Il punteggio di rischio è stato calcolato come:
    Punteggio di rischio = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)

5. Arricchimento degli insiemi genici e annotazione funzionale

  1. Esegui l'analisi di arricchimento GO utilizzando i DEG.
  2. Eseguire l'analisi di arricchimento dei percorsi KEGG utilizzando i DEG.
  3. Condurre l'analisi di arricchimento del set genico (GSEA).
  4. Classificare i geni in base alla correlazione di Pearson con l'espressione genica candidata.
  5. Identificare termini significativi usando P < 0,05 aggiustata.
    NOTA: il clusterProfiler v4.6.2 è stato utilizzato per le analisi GO e KEGG. FGSEA v1.22.0 e MSigDB Hallmark v7.5 sono stati utilizzati per GSEA.

6. Correlazione e analisi delle reti

NOTA: La correlazione di Pearson è stata utilizzata per l'espressione genica normalmente distribuita; Correlazione di Spearman per le frazioni delle cellule immunitarie. Le reti PPI sono state generate utilizzando STRING (versione 11.5, confidenza > 0.7) e visualizzate in Cytoscape (versione 3.9.1). L'infiltrazione immunitaria è stata stimata usando CIBERSORT (modalità assoluta, 100 permutazioni). Il sequenziamento a RNA a singola cellula ha dimostrato di rivelare transizioni di nicchia nel microambiente NSCLC, rilevanti per l'analisi dell'infiltrazioneimmunitaria 21,22, e l'analisi integrativa a singola cellula può ulteriormente dissezionare i ruoli delle cellule immunitarie, come le cellule di memoria CD8+, in LUAD 23,24,25.

7. Costruzione e validazione del nomogramma

NOTA: Le variabili per il nomogramma sono state selezionate in base alla significanza multivariata di Cox (P < 0,05): stadio T, stadio N, B3GNT3, FERMT1 e SPP1. Il nomogramma è stato costruito usando rms (versione 6.5.0). La validazione interna utilizzava 1000 bootstrap resampling con sostituzione. Le curve di calibrazione e l'analisi della curva decisionale (DCA) sono state eseguite utilizzando rmda (versione 1.7). L'ambiente computazionale includeva R 4.1.3, Windows 10 Pro e Bioconductor 3.15. Gli script di analisi sono disponibili su https://github.com/[redacted]/LUAD-biomarker-2025 su richiesta ragionevole.

8. Analisi statistica

NOTA: Tutti i test statistici erano a doppio verso; P < 0,05 è stato considerato significativo.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alterazioni globali dell'espressione genica in LUAD

Confronti trascricomici tra tessuti adenocarcinomi polmonari e tessuti polmonari normali hanno identificato ampi cambiamenti nell'espressione genica. La Figura 1A mostra i grafici vulcanici dei geni espressi differenzialmente nel dataset TCGA-LUAD, mentre la Figura 1B mostra quelli presenti nel dataset GSE115002. Nella coorte TCGA-LUAD (Figur...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il nomogramma è stato costruito utilizzando l'analisi di regressione multivariata di Cox basata sulla coorte TCGA-LUAD. I predittori includono stadio patologico T, stadio patologico N e stato di espressione genica di B3GNT3, FERMT1 e SPP1 (classificati come Alto vs. Basso in base all'espressione mediana). Per ogni paziente, i punteggi individuali di ogni variabile vengono sommati per generare un valore di "Total Points", che corrisponde alle probabilità di sopr...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere interessi in conflitto.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo lavoro è stato supportato dal progetto universitario 2024 dell'Università di Medicina Tradizionale Cinese del Fujian (Numero di Grant: XB2024012), guidato da Yuhui Lin dell'Ospedale Popolare Affiliato dell'Università di Medicina Tradizionale Cinese del Fujian. e fondi congiunti per l'innovazione della scienza e tecnologia, Provincia di Fujian (Grant No:2025Y9530), guidati da Xiaoting Chen dell'Ospedale Municipale di Jinjiang (Shanghai Sixth People's Hospital, Fujian).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Dataset disponibili al pubblicoDataset TCGA-LUADThe Cancer Genome Atlas (TCGA) Portal (https://portal.gdc.cancer.gov/); 535 campioni di tumore LUAD, 59 campioni di tessuto polmonare normale adiacente (conteggio RNA-seq/valori FPKM + dati clinici: sopravvivenza, stadiazione TNM)Dati trascrittomici e clinici per l'analisi differenziale dell'espressione, della sopravvivenza e del nomogramma; coorte di studio primaria
Dataset GSE115002Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE115002); Microarray Agilent, 52 tessuti tumorali LUAD, 52 tessuti normali polmonari adiacenti abbinati (tumori primari naïve di trattamento)Coorte di validazione indipendente per l'analisi differenziale dell'espressione, delle prestazioni diagnostiche e dell'infiltrazione immunitaria
Software di bioinformatica & ambiente di programmazioneLingua di programmazione RVersione 4.1Piattaforma di base per tutte le analisi trascrittomiche, statistiche e grafiche
Pacchetti R (Analisi differenziale dell'espressione)DESeq2, limmaDESeq2: analisi differenziale dell'espressione dei conteggi grezzi RNA-seq TCGA; limma: normalizzazione microarray GSE115002 e analisi differenziale dell'espressione (correzione FDR di Benjamini–Hochberg)
Pacchetti R (Analisi diagnostica)pROCCostruzione di curve ROC, calcolo dell'AUC (95% CI), determinazione del punto di taglio ottimale (indice di Youden’s) per la valutazione delle prestazioni diagnostiche
Pacchetti R (Analisi di sopravvivenza)survival, survminerGenerazione di curve di sopravvivenza Kaplan–Meier, test log-rank, regressione proporzionale dei rischi di Cox univariata/multivariata (HR + 95% CI); stratificazione dei pazienti per espressione genica mediana
Pacchetti R (Arricchimento funzionale)clusterProfiler, fgseaclusterProfiler: analisi di arricchimento GO (BP/CC/MF) e via KEGG (P corretto < 0,05); fgsea: GSEA per set di geni MSigDB Hallmark/KEGG (FDR < 0,25)
Pacchetti R (Costruzione e validazione del nomogramma)rmsSviluppo del nomogramma prognostico (integrazione dell'espressione genica + stadio TNM); calcolo dell'indice C di Harrell’s, campionamento bootstrap (1000 ripetizioni) per la correzione del bias, generazione del grafico di calibrazione
Pacchetti R (Statistica e visualizzazione)ggplot2, ComplexHeatmap, corrplotGenerazione di grafici a vulcano, grafici a bolle (arricchimento), grafici a caldo (correlazione di infiltrazione immunitaria), grafici a dispersione (co-espressione genica); analisi di correlazione Pearson/Spearman
Database e strumenti di bioinformatica (Analisi di rete/immunitaria)Database STRINGPunteggio di confidenza > 0,7Costruzione di reti di interazione proteina-proteina (PPI) per B3GNT3/FERMT1/SPP1 e interatori di primo grado
Cytoscape-Visualizzazione delle reti PPI e di co-espressione genica (ponderazione degli spigoli per forza di correlazione, identificazione del gene hub)
Algoritmo di deconvoluzione immunitariaCIBERSORTStima dell'abbondanza di infiltrazione cellulare immunitaria (macrofagi M2, cellule T CD8+, neutrofili, cellule NK, ecc.) nei campioni LUAD; correlazione con l'espressione dei geni candidati
Altri strumentiMicrosoft Office/LaTeX-Preparazione del manoscritto, assemblaggio delle figure e formattazione delle tabelle; compilazione dei risultati statistici

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Cancer ResearchB3GNT3FERMT1SPP1biomarkerprognosisgene expressionnomogram

Articoli correlati