$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Fonti di dati e preelaborazione
- Elaborare i dati grezzi in R (versione 4.1.3; Windows 10 Pro).
- Per GSE115002, applicare la normalizzazione dei quantili usando limma (versione 3.52.3).
- Filtrare i geni a bassa espressione per TCGA: trattenere geni con CPM > 0,5 nel ≥50% dei campioni.
- Filtrare i geni a bassa espressione per GSE115002: mantenere i geni con segnale medio >50.
- log2Trasformare i valori delle espressioni con un pseudoconteggio di +1.
NOTA: L'espressione genica e i dati clinici del LUAD sono stati ottenuti da TCGA-LUAD (versione 33.0, GDC Portal, scaricato il 7 agosto 2025) e GSE115002 (Agilent microarray, GEO, scaricato il 7 agosto 2025). TCGA-LUAD ha incluso 535 tumori e 59 campioni normali. GSE115002 includevano 52 tumori e 52 campioni normali corrispondenti.
2. Identificazione di geni espressi differenzialmente
- Usa DESeq2 (versione 1.36.0) per TCGA RNA-seq e limma (versione 3.52.3) per GSE115002 per l'analisi delle espressioni differenziali. Calcola i valori P aggiustati (FDR) usando il metodo di Benjamini–Hochberg.
- Per garantire la comparabilità tra dataset, un unificato |log₂FC| ≥ 1.0 è stato applicato per entrambe le coorti. I DEG erano definiti come FDR < 0,05 e |log₂FC| ≥ 1.0. I DEG sovrapposti sono stati identificati utilizzando VennDiagram (versione 1.7.3). B3GNT3, FERMT1 e SPP1 sono stati selezionati come candidati costantemente aumentati e con rilevanza nota per il cancro.
3. Valutazione del valore diagnostico
- Costruire curve ROC per ogni gene candidato.
- Determina i valori ottimali del cutoff utilizzando l'indice di Youden.
- Calcola AUC, sensibilità e specificità per ogni gene.
- Costruisci un pannello diagnostico combinato usando regressione logistica multivariata.
NOTA: Il pacchetto pROC v1.18.0 è stato utilizzato per l'analisi ROC. La funzione glm con la famiglia binomiale è stata utilizzata per costruire il modello diagnostico.
4. Analisi della sopravvivenza
- Stratificare i pazienti in gruppi ad alta e bassa espressione usando l'espressione mediana.
- Generare curve di sopravvivenza di Kaplan–Meier per ogni gene.
- Esegui test log-rank per confrontare le differenze di sopravvivenza.
- Condurre un'analisi di regressione di Cox univariata.
- Condurre un'analisi di regressione Cox multivariata.
- Includere le covariate cliniche nei modelli di regressione.
- Verificare l'assunzione dei rischi proporzionali utilizzando i residui di Schoenfeld.
- Calcola un punteggio di rischio su tre geni.
NOTA: Sono stati utilizzati Survival v3.3.1 e survivor v0.4.9. Le covariate includevano età, sesso, stadio T, stadio N e stadio M. Il punteggio di rischio è stato calcolato come:
Punteggio di rischio = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)
5. Arricchimento degli insiemi genici e annotazione funzionale
- Esegui l'analisi di arricchimento GO utilizzando i DEG.
- Eseguire l'analisi di arricchimento dei percorsi KEGG utilizzando i DEG.
- Condurre l'analisi di arricchimento del set genico (GSEA).
- Classificare i geni in base alla correlazione di Pearson con l'espressione genica candidata.
- Identificare termini significativi usando P < 0,05 aggiustata.
NOTA: il clusterProfiler v4.6.2 è stato utilizzato per le analisi GO e KEGG. FGSEA v1.22.0 e MSigDB Hallmark v7.5 sono stati utilizzati per GSEA.
6. Correlazione e analisi delle reti
NOTA: La correlazione di Pearson è stata utilizzata per l'espressione genica normalmente distribuita; Correlazione di Spearman per le frazioni delle cellule immunitarie. Le reti PPI sono state generate utilizzando STRING (versione 11.5, confidenza > 0.7) e visualizzate in Cytoscape (versione 3.9.1). L'infiltrazione immunitaria è stata stimata usando CIBERSORT (modalità assoluta, 100 permutazioni). Il sequenziamento a RNA a singola cellula ha dimostrato di rivelare transizioni di nicchia nel microambiente NSCLC, rilevanti per l'analisi dell'infiltrazioneimmunitaria 21,22, e l'analisi integrativa a singola cellula può ulteriormente dissezionare i ruoli delle cellule immunitarie, come le cellule di memoria CD8+, in LUAD 23,24,25.
7. Costruzione e validazione del nomogramma
NOTA: Le variabili per il nomogramma sono state selezionate in base alla significanza multivariata di Cox (P < 0,05): stadio T, stadio N, B3GNT3, FERMT1 e SPP1. Il nomogramma è stato costruito usando rms (versione 6.5.0). La validazione interna utilizzava 1000 bootstrap resampling con sostituzione. Le curve di calibrazione e l'analisi della curva decisionale (DCA) sono state eseguite utilizzando rmda (versione 1.7). L'ambiente computazionale includeva R 4.1.3, Windows 10 Pro e Bioconductor 3.15. Gli script di analisi sono disponibili su https://github.com/[redacted]/LUAD-biomarker-2025 su richiesta ragionevole.
8. Analisi statistica
NOTA: Tutti i test statistici erano a doppio verso; P < 0,05 è stato considerato significativo.