Verklaring van de ethische commissie
Deze studie is uitgevoerd in overeenstemming met de Verklaring van Helsinki. Het protocol is goedgekeurd door de Ethische Commissie van het Shenzhen Luohu Hospital of Traditional Chinese Medicine (goedkeuringsnummer 2024-LHQZYYYXLL-KY-039), en van alle deelnemers is voorafgaand aan de inschrijving schriftelijke geïnformeerde toestemming verkregen. Details over de gebruikte onderzoeksinstrumenten en materialen in dit protocol zijn terug te vinden in de Tabel met Materialen.
Gegevensbron en verwerking
Genexpressie-datasets gerelateerd aan COPD werden verkregen uit de Gene Expression Omnibus (GEO). De dataset GSE54837 werd gebruikt als transcriptome-dataset, en de dataset GSE112811 diende als validatieset (Tabel 1). De ac4C-RG's werden verzameld uit de literatuur18. DEGs tussen de COPD- en controlegroepen werden geïdentificeerd met behulp van het R-pakket limma. DEGs werden als statistisch significant beschouwd indien |log2FC| > 0 en p < 0,05. Volcano-plots werden gegenereerd om de algemene distributie van veranderingen in genexpressie te visualiseren.
Constructie van WGCNA
WGCNA werd uitgevoerd op de GSE54837-dataset met behulp van R om COPD-gerelateerde modules te identificeren. Voorafgaand aan de netwerkconstructie werden uitschieter-monsters geïdentificeerd en verwijderd via een hiërarchische clusteringanalyse met de hclust-functie, gebruikmakend van de average linkage-methode en een Euclidische afstandsterminologie. De optimale soft-thresholding power (β = 10) werd geselecteerd om een scale-free topology fit index R2 ≥ 0,85 te bereiken, waarbij een balans werd gezocht tussen de schaalvrije topologie en de gemiddelde connectiviteit. Er werd een adjacentiematrix opgesteld en getransformeerd naar een topologische overlapmatrix (TOM). Genmodules werden geïdentificeerd met het dynamic tree-cutting-algoritme (deepSplit = 2, minClusterSize = 50). Modules met eigengene-correlaties > 0,75 werden vervolgens samengevoegd met de mergeCloseModules-functie. De module-eigengenes werden daarna gecorreleerd met klinische kenmerken (COPD-status, leeftijd, geslacht en rookstatus) met behulp van Pearson-correlatiecoëfficiënten om COPD-geassocieerde modules voor verdere analyse te identificeren.
Screening, verrijkingsanalyse en PPI-netwerkanalyse van overlappende genen
Er werd een Venn-diagram gegenereerd met het R-pakket ggvenn om genen te identificeren die overlappen tussen de DEGs, MEsalmon-modulegenen en ac4C-RGs. Functionele verrijkingsanalyse van de overlappende genen werd uitgevoerd met behulp van de Gene Ontology (GO) en Kyoto Encyclopedia of Genes and Genomes (KEGG) databases met het R-pakket clusterProfiler. Informatie over eiwit-eiwitinteracties (PPI) werd verkregen uit de STRING-database (https://string-db.org/) om interacties op eiwitniveau tussen de overlappende genen te analyseren. Cytoscape-software werd gebruikt om het resulterende PPI-netwerk te visualiseren.
Identificatie van sleutelgenen via machine learning
Er werden drie machinelearningtechnieken toegepast: least absolute shrinkage and selection operator (LASSO)-regressie, extreme gradient boosting (XGBoost) en random forest (RF). LASSO-regressie werd geïmplementeerd met het glmnet-pakket, waarbij 10-voudige kruisvalidatie werd gebruikt om de optimale strafparameter λ te bepalen. De parameter type.measure werd ingesteld op "deviance" en de parameter family op "binomial". De optimale λ werd geselecteerd op basis van het λmin-criterium, dat de kruisgevalideerde deviantie minimaliseert, wat resulteerde in 17 genen. XGBoost werd uitgevoerd met het xgboost-pakket met de volgende hyperparameters: nrounds = 100, max_depth = 6, eta = 0,3, subsample = 0,8, colsample_bytree = 0,8 en eval_metric = "logloss". De belangrijkheid van kenmerken werd gerangschikt op basis van de gain-metriek, waarbij de top 30 genen werden geselecteerd. Random forest werd geïmplementeerd met het randomForest-pakket met ntree = 200. De belangrijkheid van kenmerken werd gerangschikt op basis van de gemiddelde afname in Gini, waarbij de top 30 genen werden geselecteerd. De door de drie machinelearningmethoden geselecteerde genen werden met elkaar gesneden om sleutelgenen te identificeren voor daaropvolgende analyses.
Het opbouwen en beoordelen van het logistische regressiemodel voor risicovoorspelling
De GSE54837-dataset werd willekeurig verdeeld in een trainingsset (70%) en een testset (30%). Er werd een logistisch regressiemodel opgebouwd op basis van de trainingsset met behulp van de glm-functie uit het MASS-pakket, waarbij de expressieniveaus van sleutelgenen als inputkenmerken dienden. De prestaties van het model werden geëvalueerd met ROC-curves die zijn gegenereerd met het pROC-pakket. De 95% betrouwbaarheidsintervallen voor de AUC werden berekend via 2.000 bootstrap-replicaten. De kalibratie van het model werd beoordeeld met kalibratiecurves die zijn gegenereerd met 1.000 bootstrap-resamples (rms-pakket). DCA werd uitgevoerd met het dca-pakket om het netto klinische voordeel over een reeks drempelwaarschijnlijkheden te evalueren. Er werd een nomogram geconstrueerd met behulp van de nomogram-functie uit het rms-pakket om geïndividualiseerde risicoschatting te vergemakkelijken.
De regressievergelijking was:
logit(P) = 0.5823 + 0.6010 × UPP1 - 0.6563 × PTRF + 0.3853 × B4GALT2 - 0.3972 × FAM168B + 0.1848 × PRKCDBP - 0.4787 × TOR3A. (1)
Hierbij staat P voor de voorspelde waarschijnlijkheid van COPD, en elke coëfficiënt staat voor de bijdrage van de overeenkomstige genexpressiewaarde aan de log odds van COPD.
Expressieanalyse, GeneMANIA-netwerk en moleculair regulatoir netwerk
Genexpressieniveaus tussen de COPD- en controlegroepen in de GSE54837-dataset werden vergeleken met behulp van de Wilcoxon rank-sum test. Boxplots werden gegenereerd met het ggplot2-pakket om de distributie van de expressieniveaus te visualiseren, waarbij de mediaan, het interkwartielbereik (IQR) en individuele datapunten werden weergegeven. GeneMANIA werd gebruikt om gennetwerken te construeren en functionele interacties te voorspellen. De zoekopdracht werd uitgevoerd met standaardparameters: species = Homo sapiens, maximum aantal gerelateerde genen = 20. Het resulterende netwerk werd gedownload en gevisualiseerd, waarbij de kleuren van de verbindingen de interactietypes aangeven. Er werd een competitief endogeen RNA (ceRNA)-netwerk geconstrueerd om post-transcriptionele regulatiemechanismen te onderzoeken. miRNA's die zich richten op de zes sleutelgenen werden voorspeld met behulp van twee onafhankelijke databases: DIANA-microT (score ≥ 0,8) en miRanda (score ≥ 140, energie ≤ −20 kcal/mol). De intersectie van miRNA's die door beide databases waren geïdentificeerd, werd gebruikt om miRNA-mRNA-paren te construeren. Vervolgens werden lncRNA's die zich richten op deze miRNA's voorspeld met behulp van de StarBase-database. Een lncRNA-miRNA-mRNA-regulatienetwerk werd geconstrueerd en gevisualiseerd met Cytoscape. Transcriptionele regulatierelaties werden voorspeld met behulp van ChIP-X Enrichment Analysis Version 3 (ChEA3). Voor elk sleutelgen met voorspelde TF's werden de top 10 transcriptiefactoren met de hoogste enrichment-scores geselecteerd. Er werd een TF-target-regulatienetwerk geconstrueerd in Cytoscape.
Gene set enrichment-analyse en beoordeling van immuuncelinfiltratie
Gene set enrichment analysis (GSEA) werd uitgevoerd met het clusterProfiler-pakket om de biologische functies van elk sleutelgen te onderzoeken. Voor elk sleutelgen werden de monsters verdeeld in groepen met een hoge en lage expressie op basis van de mediaanwaarde. Differentiele expressieanalyse tussen de twee groepen werd uitgevoerd met limma, en de resulterende genenlijst werd gerangschikt op basis van de signed log₂ fold-change. GSEA werd uitgevoerd met de gseGO-functie voor GO-biologische proces termen en de gseKEGG-functie voor KEGG-paden, met de volgende parameters: minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0,05 en nPerm = 1.000. De relatieve abundantie van 28 immuunceltypen werd geschat met single-sample gene set enrichment analysis (ssGSEA), geïmplementeerd in het GSVA-pakket. Een gecureerde genenset-signatuurmatrix bestaande uit markergenen voor 28 immuunceltypen werd verkregen uit eerdere literatuur19. Voor elk monster werd de gsva-functie toegepast met method = "ssgsea", ssgsea.norm = TRUE en kcdf = "Gaussian". Spearman-correlatiecoëfficiënten tussen de ssGSEA-enrichment scores en de expressieniveaus van de zes sleutelgenen werden berekend met de cor.test-functie. De p waarden werden gecorrigeerd voor meervoudig testen met de Benjamini-Hochberg-methode. De correlatiematrix werd gevisualiseerd als een heatmap met behulp van het pheatmap-pakket.
Medicijnvoorspelling, moleculaire docking en ziekteassociatieanalyse
Potentiële therapeutische verbindingen die zich richten op sleutelgenen werden geïdentificeerd met behulp van de DrugBank-database. Een interactienetwerk van "medicijnen gericht op sleutelgenen" werd geconstrueerd in Cytoscape om voorspelde interacties tussen medicijnen en genen te visualiseren. Moleculaire docking werd uitgevoerd met het CB-Dock2-platform om bindingsaffiniteiten te beoordelen. De 3D-proteïnestructuur van humaan UPP1 werd opgehaald uit de Protein Data Bank (PDB ID: 7B8T). Moleculaire structuren van medicijnen (SMILES-formaat) werden verkregen via PubChem. Docking werd uitgevoerd met de AutoDock Vina-engine en de resultaten werden gerangschikt op basis van de vrije bindingsenergie (ΔG, in kcal/mol). Dockingcomplexen werden gevisualiseerd met PyMOL. Associaties tussen sleutelgenen en menselijke ziekten gerelateerd aan blootstelling aan omgevingsfactoren werden onderzocht met behulp van de Comparative Toxicogenomics Database (CTD). Elk gen werd afzonderlijk opgevraagd, waarna de tien sterkst geassocieerde ziekten werden geëxtraheerd en gevisualiseerd met behulp van radardiagrammen.
RT-qPCR protocol
Perifere veneuze bloedmonsters werden verzameld van acht COPD-patiënten en acht gezonde controles in het Shenzhen Luohu Hospital of Traditional Chinese Medicine. COPD werd gediagnosticeerd volgens de criteria van de Global Initiative for Chronic Obstructive Lung Disease (GOLD), gedefinieerd als een post-bronchodilator FEV1/FVC < 0,70. De controlegroep bestond uit gezonde vrijwilligers, matchend op leeftijd en geslacht, zonder voorgeschiedenis van respiratoire aandoeningen en met normale longfunctietests (FEV1% voorspeld ≥ 80% en FEV1/FVC ≥ 0,70). De basisinformatie van de patiënten wordt weergegeven in Tabel 2. Totaal RNA werd geëxtraheerd uit de COPD-bloedmonsters met behulp van een blood RNA extraction kit. Voor de cDNA-synthese werden 500 ng totaal RNA reverse-getranscribeerd met een cDNA synthesis kit inclusief verwijdering van genomisch DNA, volgens het bijgeleverde protocol. Het resulterende cDNA werd verdund tot 150 ng/μL.
RT-qPCR werd uitgevoerd met een SYBR Green-gebaseerde qPCR master mix op een real-time PCR-systeem. Elke reactie van 10 μL bevatte 5 μL 2x SYBR Green master mix, 0,5 μL van respectievelijk de forward- en reverse-primers (10 μM), 1 μL verdund cDNA (15 ng/μL) en 3 μL nucleasevrij water. De cycluscondities bestonden uit een initiële denaturatie bij 95 °C gedurende 5 min, gevolgd door 40 cycli van 95 °C gedurende 10 s en 60 °C gedurende 30 s, met een uiteindelijke smeltcurve-analyse van 60 °C tot 95 °C om de specificiteit van de amplificatie te verifiëren. Alle reacties werden in technische triplicaten uitgevoerd. β-actin werd gebruikt als intern referentiegen. De primerefficiëntie voor elk doelgen werd gevalideerd met behulp van standaardcurve-verdunningsreeksen en varieerde van 90% tot 110%. Genexpressieniveaus werden genormaliseerd naar β-actin, en de relatieve expressie werd berekend met de 2-ΔΔCt methode. Statistische vergelijkingen tussen de COPD- en controlegroepen werden uitgevoerd met de Mann-Whitney U-toets.
Statistische analyse
Netwerkvisualisaties werden gemaakt met Cytoscape en statistische analyses werden uitgevoerd met R-software. Tenzij anders aangegeven, werd de Mann-Whitney U-toets gebruikt voor niet-normaal verdeelde gegevens en de t-toets van Student voor normaal verdeelde gegevens om twee groepen te vergelijken. Een waarde van p < 0,05 werd beschouwd als statistisch significant.