$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Gegevensbronnen en voorverwerking
- Verwerk ruwe data in R (versie 4.1.3; Windows 10 Pro).
- Voor GSE115002 pas je kwantielnormalisatie toe met limma (versie 3.52.3).
- Filter genen met lage expressie voor TCGA: behoud genen met CPM > 0,5 in ≥50% van de monsters.
- Filter genen met lage expressie op GSE115002: behoud genen met gemiddeld signaal >50.
- log2Transformatie-expressiewaarden met een pseudocount van +1.
OPMERKING: LUAD-genexpressie en klinische gegevens zijn verkregen van TCGA-LUAD (versie 33.0, GDC Portal, gedownload op 7 augustus 2025) en GSE115002 (Agilent microarray, GEO, gedownload op 7 augustus 2025). TCGA-LUAD omvatte 535 tumoren en 59 normale monsters. GSE115002 omvatte 52 tumoren en 52 overeenkomende normale monsters.
2. Identificatie van differentieel tot expressie gebrachte genen
- Gebruik DESeq2 (versie 1.36.0) voor TCGA RNA-seq en limma (versie 3.52.3) voor GSE115002 voor differentiële expressieanalyse. Bereken aangepaste P-waarden (FDR) met behulp van de Benjamini–Hochberg-methode.
- Om cross-dataset-vergelijkbaarheid te waarborgen, is een uniforme |log₂FC| ≥ 1.0 werd toegepast voor beide cohorten. DEG's werden gedefinieerd als FDR < 0.05 en |log₂FC| ≥ 1.0. Overlapende DEG's werden geïdentificeerd met behulp van VennDiagram (versie 1.7.3). B3GNT3, FERMT1 en SPP1 werden geselecteerd als consequent opgereguleerde kandidaten met bekende kankerrelevantie.
3. Evaluatie van diagnostische waarde
- Bouw ROC-curves voor elk kandidaatgen.
- Bepaal optimale afkapwaarden met behulp van de Youden-index.
- Bereken AUC, gevoeligheid en specificiteit voor elk gen.
- Bouw een gecombineerd diagnostisch paneel met behulp van multivariate logistische regressie.
OPMERKING: Het pROC-pakket v1.18.0 werd gebruikt voor ROC-analyse. De glm-functie met de binomiale familie werd gebruikt om het diagnostisch model te construeren.
4. Overlevingsanalyse
- Laag patiënten in groepen met hoge en lage expressie op basis van mediane expressie.
- Genereer Kaplan–Meier-overlevingscurves voor elk gen.
- Voer log-rank tests uit om overlevingsverschillen te vergelijken.
- Voer univariate Cox-regressieanalyse uit.
- Voer multivariate Cox-regressieanalyse uit.
- Neem klinische covariaten op in regressiemodellen.
- Verifieer de aanname van proportionele gevaren met behulp van Schoenfeld-residuen.
- Bereken een risicoscore van drie genen.
OPMERKING: Survival v3.3.1 en survminer v0.4.9 werden gebruikt. Covariaten omvatten leeftijd, geslacht, T-fase, N-stadium en M-stadium. De risicoscore werd als volgt berekend:
Risicoscore = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)
5. Verrijking van genensets en functionele annotatie
- Voer GO-verrijkingsanalyse uit met behulp van DEGs.
- Voer KEGG-routeverrijkingsanalyse uit met behulp van DEGs.
- Voer gensetverrijkingsanalyse uit (GSEA).
- Rangschik genen op basis van Pearson-correlatie met kandidaatgenexpressie.
- Identificeer significante termen met aangepaste P < 0,05.
OPMERKING: clusterProfiler v4.6.2 werd gebruikt voor GO- en KEGG-analyses. FGSEA v1.22.0 en MSigDB Hallmark v7.5 werden gebruikt voor GSEA.
6. Correlatie en netwerkanalyse
OPMERKING: Pearson-correlatie werd gebruikt voor normaal verdeelde genexpressie; Spearman-correlatie voor immuuncelfracties. PPI-netwerken werden gegenereerd met STRING (versie 11.5, betrouwbaarheid > 0.7) en gevisualiseerd in Cytoscape (versie 3.9.1). De immuuninfiltratie werd geschat met behulp van CIBERSORT (absolute modus, 100 permutaties). Single-cell RNA-sequencing is aangetoond niche-overgangen te onthullen in de NSCLC-microomgeving, wat relevant is voor immuuninfiltratieanalyse21,22, en integratieve single-cell analyse kan de rollen van immuuncellen, zoals CD8+ geheugencellen, in LUAD 23,24,25 verder ontleden.
7. Nomogramconstructie en validatie
OPMERKING: Variabelen voor het nomogram zijn geselecteerd op basis van multivariate Cox-significantie (P < 0,05): T-fase, N-fase, B3GNT3, FERMT1 en SPP1. Het nomogram werd gebouwd met rms (versie 6.5.0). Interne validatie gebruikte 1000 bootstrap resampling met vervanging. Kalibratiecurves en beslissingscurveanalyse (DCA) werden uitgevoerd met behulp van RMDA (versie 1.7). De computationele omgeving omvatte R 4.1.3, Windows 10 Pro en Bioconductor 3.15. Analysescripts zijn beschikbaar op https://github.com/[redacted]/LUAD-biomarker-2025 op redelijk verzoek.
8. Statistische analyse
OPMERKING: Alle statistische tests waren tweezijdig; P < 0,05 werd als significant beschouwd.