De studie werd uitgevoerd in overeenstemming met de Verklaring van Helsinki, en het protocol werd op 22 april 2025 goedgekeurd door de ethische commissie van het Anhui Chest Hospital (K2025-007). Geïnformeerde toestemming werd verkregen van alle proefpersonen die aan de studie deelnamen.
Data-extractie en normalisatie
Transcriptomische profielen en overeenkomstige klinische datasets voor LUAD werden verkregen uit de TCGA- en GEO-cohorten. De TCGA-LUAD-dataset werd aangewezen als de trainingsset, waarbij GSE72094, GSE31210 en GSE26939 dienden als cohorten voor externe validatie (Tabel 1). Daarnaast werden 900 MCRG's verzameld uit een eerdere studie12(Aanvullende Tabel 1). Transcriptoomgegevens werden geannoteerd met behulp van GENCODE v36 of de overeenkomstige GPL-platform-annotatiebestanden. Probe-ID's werden omgezet in gensymbolen, gedupliceerde genen werden samengevoegd met de avereps-functie, en alleen proteïne-coderende genen werden behouden om expressiematrices op genniveau te genereren. Voor de TCGA-LUAD-trainingsset werden genen met Fragments per kilobase of exon model per million mapped fragments (FPKM) < 1 in meer dan 50% van de monsters gefilterd, en de overgebleven expressiewaarden werden log2-getransformeerd (log2[FPKM+1]). Voor de GEO-validatiecohorten werden ruwe expressiegegevens gedownload, werden probe-ID's gekoppeld aan gensymbolen met behulp van de respectievelijke platform-annotatiebestanden, en werden meerdere probes die overeenkwamen met hetzelfde gen samengevoegd door hun expressiewaarden te middelen. Deze datasets werden indien nodig log2-getransformeerd. Er werd geen cross-platform batch-effectcorrectie toegepast tussen TCGA en GEO, aangezien we een per-cohort standaardisatiestrategie hanteerden om relatieve vergelijkbaarheid te waarborgen. Specifiek werden voor zowel de trainings- als de validatiecohorten de genexpressiewaarden gecentreerd en geschaald (z-score transformatie) met gebruik van het gemiddelde en de standaarddeviatie van elke dataset afzonderlijk. Dezelfde Cox-regressiecoëfficiënten die uit de trainingsset waren afgeleid, werden vervolgens gebruikt om risicoscores voor alle cohorten te berekenen. Om de klinische toepasbaarheid te behouden en overfitting aan een validatieset te voorkomen, werd de mediaan risicoscore van de trainingscohort gebruikt als een vaste afkapwaarde om patiënten in hoog- en laagrisicogroepen in te delen over alle externe validatiecohorten. Klinische informatie, waaronder leeftijd, geslacht, pathologisch stadium, Tumor-Node-Metastasis (TNM) stadium, histologisch type, overlevingstijd, overlevingsstatus en weefseltype, werd geëxtraheerd wanneer beschikbaar. Het eindpunt was de algehele overleving (OS). Monsters met onvolledige overlevingsinformatie of een overlevingstijd < 30 dagen werden uitgesloten. Overlevingstijd werd omgezet in jaren, en overlevingsstatus werd gecodeerd als 0 voor in leven en 1 voor overleden.
Identificatie en functionele analyses van kandidaatgenen
Het Limma-pakket identificeerde differentieel tot expressie gebrachte genen (DEGs) tussen LUAD-tumor- en normaalmonsters in de trainingsset13. DEGs werden gedefinieerd aan de hand van de volgende criteria: |log2FC| > 0,5 en een gecorrigeerde p-waarde < 0,05. Vervolgens werd het mfuzz fuzzy clustering-algoritme in het R-pakket ClusterGVis gebruikt om de DEGs te verdelen in verschillende expressieclusters. Een Gene Ontology–Biological Process (GO-BP)-analyse werd uitgevoerd op de vijf meest representatieve genen in elk cluster op basis van hun membership scores. Een set gedeelde genen werd afgeleid door de intersectie van de DEGs met MCRGs te bepalen. Functionele verrijkingsanalyse met behulp van Gene Ontology/Kyoto Encyclopedia of Genes and Genomes (GO/KEGG) beoordeelde de biologische relevantie van de overlappende genen. Protein–protein interaction (PPI)-netwerken zijn afkomstig uit de STRING-database14. Alleen interacties met confidence scores > 0,7 werden behouden om de betrouwbaarheid van het netwerk te verbeteren.
Screening van prognostische genen
Het Survival-pakket werd gebruikt om een univariate Cox-regressieanalyse uit te voeren om waarschijnlijke genen te identificeren die gekoppeld zijn aan de algehele overleving bij LUAD15. Genen met een p-waarde < 0,05 werden beschouwd als potentiële prognostische indicatoren. De TCGA-LUAD trainingscohort omvatte 500 patiënten met volledige overlevingsgegevens, van wie 216 (43,2%) overleden waren tijdens de follow-up. De verhouding tussen kandidaatgenen (n = 108) en events (n = 216) was ongeveer 1:2, wat acceptabel is voor een Cox-regressieanalyse. Vervolgens werden kenmerken verder geselecteerd middels Least Absolute Shrinkage and Selection Operator (LASSO) regressieanalyse en een Extreme Gradient Boosting (XGBoost) model. Cox-proportional hazards modellen werden gebouwd met family = "cox" via de cv.glmnet-functie van het glmnet-pakket. De optimale regularisatieparameter werd bepaald met 10-voudige kruisvalidatie, waarbij de λ.min-waarde de minimale kruisvalidatiefout vertegenwoordigde en werd geselecteerd als de optimale λ-waarde. Genen met niet-nul regressiecoëfficiënten werden geëxtraheerd als kandidaatkenmerken. Voor het XGBoost-model werden de overlevingstijd en de overlevingsstatus gecombineerd als de uitkomstvariabele, waarbij positieve waarden werden toegekend aan sterfgevallen en negatieve waarden aan gecensureerde gevallen. De parameters werden ingesteld op objective = "survival: cox" en eval_metric = "cox-nloglik", met 100 iteraties en een learning rate van 0,1. Na de modeltraining werden de gen-belangrijkheidsscores berekend met behulp van feature gain-waarden. De top 20 genen werden behouden na het sorteren van de belangrijkheidsscores in aflopende volgorde om de dimensionaliteit van de kenmerken en de complexiteit van het model te verminderen. Genen die overlapten tussen de LASSO- en XGBoost-resultaten werden geïdentificeerd als kandidaat prognostische genen.
Constructie en beoordeling van een prognostisch model
Er is een prognostisch model ontwikkeld met behulp van multivariate Cox-regressieanalyse van de geïdentificeerde kandidaatgenen. Risicoscores werden als volgt individueel berekend:
.
waarbij Coefi verwijst naar de coëfficiënt voor gen i, en Expi de respectievelijke genexpressiewaarde aangeeft. Individuen werden vervolgens verdeeld in twee groepen: hoog risico en laag risico, waarbij de mediane risicoscore als afkapwaarde werd gebruikt. Daarna werden tijdsafhankelijke receiver operating characteristic (ROC)-curves opgesteld. Om de potentie voor overfitting te beoordelen, werd bootstrap interne validatie met 1.000 resamplingsiteraties uitgevoerd om de bias-gecorrigeerde C-index en tijdsafhankelijke AUC's met 95% betrouwbaarheidsintervallen te berekenen. Kalibratiecurves werden gegenereerd om de overeenkomst tussen de voorspelde en geobserveerde overlevingskansen na 2 jaar, 3 jaar en 5 jaar te evalueren. Verder werd een decision curve analysis (DCA) uitgevoerd met het ggDCA-pakket in R om het klinische netto voordeel van het model op tijdstippen van 2, 3 en 5 jaar te evalueren, waarbij de potentiële waarde van de risicoscore bij klinische besluitvorming over verschillende drempelwaarschijnlijkheden werd gekwantificeerd. Overlevingsverschillen tussen risicostratificatiegroepen en over andere klinische categorieën werden vergeleken met behulp van Kaplan–Meier(KM)-overlevingscurves met log-rank toetsing. Bovendien werd voor het verduidelijken van de individuele genbijdragen aan de modelprestatie gebruikgemaakt van Shapley Additive exPlanations (SHAP)-analyse voor post-hoc verklarende interpretatie.
Ontwikkeling en externe validatie van een nomogram
De relaties tussen de berekende risicoscores en diverse klinische kenmerken (waaronder geslacht, leeftijd en TNM-stadium) werden onderzocht met Wilcoxon rank-sum of Kruskal-Wallis testen om de klinische toepasbaarheid van het model te evalueren. Om vast te stellen of de risicoscore fungeerde als een onafhankelijke prognostische factor, werden klinische variabelen, samen met de risicoscore, opgenomen in multivariate Cox-regressiemodellering. Vervolgens werd een prognostisch nomogram geconstrueerd via het regplot R-pakket, waarbij de onafhankelijke klinische risicofactoren (bijv. stadium) en de genetische risicoscore werden gecombineerd om overlevingskansvoorspellingen te individualiseren. Kalibratiecurves werden gebruikt om de overeenkomst tussen de door het nomogram voorspelde overlevingskans en de werkelijke overlevingsuitkomsten te beoordelen. Ten slotte werden de uiteindelijke voorspellende capaciteit en generaliseerbaarheid van het geïntegreerde nomogramsysteem rigoureus gevalideerd via tijdsonafhankelijke ROC-curves en uitgebreide KM klinische subgroepanalyses over de cohorten heen.
Analyses van immuuninfiltratie en immuunsubtypes
CIBERSORT, met gebruik van de leukocyten-gen (LM22) signatuurmatrix, werd gebruikt om de relatieve proporties van 22 immuunceltypen te schatten om de infiltratie van immuuncellen bij LUAD-patiënten te beoordelen. De relaties tussen prognostische genexpressieniveaus en immunologische infiltratie werden geëvalueerd via Spearman-correlatieanalyse. Scores voor immuun-, stroma- en tumorzuiverheid, evenals ESTIMATE-scores, werden afgeleid via het ESTIMATE-algoritme, en de Wilcoxon-toets werd gebruikt om verschillen tussen risicogroepen te beoordelen. LUAD-patiënten werden toegewezen aan zes immuunsubtypen met behulp van het ImmuneSubtypeClassifier-pakket16. De Wilcoxon-toets werd bovendien gebruikt om de verdeling van immuunsubtypen tussen de risicogroepen te vergelijken.
Analyses van immuuncheckpoints, immunophenoscores en de immuuncyclus van kanker
In deze studie werd de Wilcoxon-rangsomtoets gebruikt om 21 immuuncheckpoint-genen17 in risicostratificatiegroepen te beoordelen, met als doel het immuunlandschap van LUAD te karakteriseren. De Spearman-correlatie koppelde kandidaat-prognostische genen aan immuuncheckpoint-genen. Om verschillen in de respons op immuuncheckpointremmers (ICIs) bij LUAD-patiënten met verschillende risiconiveaus te beoordelen, werden immunophenoscore (IPS)-gegevens voor anti-PD-1 en anti-CTLA-4 behandelingen verkregen uit The Cancer Immunome Atlas (TCIA)18, en werd de Tracking Tumor Immunophenotype (TIP)19 database gebruikt om de activiteit van de kanker-immuniteitscyclus te evalueren door de overeenkomstige scores tussen de risicogroepen te vergelijken.
Analyse van somatische mutaties en druggevoeligheid
De TCGA-mutatietool retrieve somatic mutatieprofielen voor TCGA-LUAD-gevallen om variaties in mutatiepatronen over risicogroepen te onderzoeken. Het maftools-pakket werd gebruikt voor het verwerken en visualiseren van de mutatiedata. De tumor-mutatiebelasting (TMB) werd voor elk specimen bepaald en vergeleken tussen de twee risicocategorieën. De farmacogenomische sensitiviteitsanalyse werd uitgevoerd met het pRRophetic-pakket op basis van de Genomics of Drug Sensitivity in Cancer(GDSC)-database20. De half-maximale inhiberende concentratie (IC50) waarden voor antikankergeneesmiddelen werden voorspeld voor elke LUAD-patiënt, en de verschillen tussen de risicogroepen werden gekwantificeerd met de Wilcoxon rank-sum test.
Evaluatie van expressieniveaus voor prognostische genen
Elke dataset diende om de transcriptieniveaus van geselecteerde kandidaatgenen die gerelateerd zijn aan de uitkomst te beoordelen. Om genexpressie te koppelen aan de prognose van de patiënt, werden optimale afkapwaarden afgeleid via de surv_cutpoint-functie in het survminer R-pakket. Op basis van deze drempelwaarden werden LUAD-gevallen gecategoriseerd in subsets met een hoge en lage expressie voor daaropvolgende overlevingsanalyses.
Daarnaast werden vijf gepaarde LUAD-tumoren en aangrenzende normale weefselparen verkregen van het Anhui Chest Hospital, waarna qPCR-validatie werd uitgevoerd. Elke deelnemer gaf schriftelijke geïnformeerde toestemming. Zes kandidaat-prognostische genen (PDGFB, LDHA, ZEB2, FKBP4, DMD en S100B) werden geselecteerd voor qPCR-validatie. RNA werd geëxtraheerd uit gehomogeniseerde weefselmonsters met behulp van een RNA-extractiereagens, gevolgd door chloroformextractie en isopropanolprecipitatie. Met de spectrofotometer werd de RNA-concentratie en -zuiverheid gemeten. qPCR-validatie van de zes kandidaat-prognostische genen werd uitgevoerd met een SYBR Green-gebaseerde PCR-mastermix op een real-time PCR-systeem: initiële denaturatie bij 95 °C gedurende 30 s, gevolgd door 40 cycli van 95 °C gedurende 20 s, 55 °C gedurende 20 s en 72 °C gedurende 20 s. De relatieve expressie werd berekend en genormaliseerd ten opzichte van Glyceraldehyde-3-Phosphate Dehydrogenase (GAPDH) met de 2-ΔΔCt-techniek. Details van alle reagentia en instrumenten zijn opgenomen in de Tabel met materialen.
Statistische analyse
Statistische analyses werden uitgevoerd met behulp van software voor statistische berekeningen en grafische weergave. Het netwerk van eiwit-eiwitinteracties werd gevisualiseerd met software voor netwerkanalyse. Na beoordeling van de normaliteit werd de t-toets van Student gebruikt voor normaal verdeelde continue variabelen en de Mann-Whitney U-toets voor niet-normaal verdeelde variabelen.