Stellungnahme der institutionellen Prüfkommission
Die Studie wurde gemäß der Deklaration von Helsinki durchgeführt. Das Protokoll wurde von dem Ethikkomitee des Shenzhen Luohu Krankenhauses für Traditionelle Chinesische Medizin genehmigt (Genehmigungsnummer 2024-LHQZYYYXLL-KY-039), und alle Teilnehmer gaben vor der Einschreibung ihre schriftliche informierte Einwilligung ab. Einzelheiten zu den in diesem Protokoll verwendeten Forschungsinstrumenten und Materialien sind in der Tabelle der Materialien enthalten.
Datenquelle und Datenverarbeitung
Genexpressionsdatensätze im Zusammenhang mit COPD wurden aus der Gene Expression Omnibus (GEO)-Datenbank bezogen. Der Datensatz GSE54837 wurde als Transkriptomdatensatz verwendet, und der Datensatz GSE112811 diente als Validierungsset (Tabelle 1). Die ac4C-regulierenden Gene (ac4C-RGs) wurden aus der Literatur zusammengestellt18. Differenziell exprimierte Gene (DEGs) zwischen den COPD- und Kontrollgruppen wurden mit dem R-Paket limma identifiziert. DEGs galten als statistisch signifikant, wenn |log2FC| > 0 und p < 0,05 waren. Volcano-Plots wurden erstellt, um die Gesamtverteilung der Genexpressionsänderungen zu visualisieren.
Aufbau der WGCNA
WGCNA wurde mit dem Datensatz GSE54837 unter Verwendung von R durchgeführt, um mit COPD assoziierte Module zu identifizieren. Vor dem Netzwerkaufbau wurden Ausreißerproben mittels hierarchischer Clusteranalyse unter Nutzung der Funktion hclust mit der Durchschnittsverknüpfungsmethode und einer euklidischen Distanzmetrik identifiziert und entfernt. Die optimale Soft-Thresholding-Potenz (β = 10) wurde gewählt, um einen skalenfreien Topologie-Anpassungsindex R2 ≥ 0,85 zu erreichen und dabei Skalenfreiheit und mittlere Verknüpfung auszugleichen. Eine Adjazenzmatrix wurde erstellt und in eine topologische Überlappungsmatrix (TOM) umgewandelt. Genmodule wurden mithilfe des dynamischen Baumzerschneidalgorithmus (deepSplit = 2, minClusterSize = 50) identifiziert. Module mit Eigenvektorkorrelationen > 0,75 wurden anschließend mit der Funktion mergeCloseModules zusammengeführt. Die Moduleigenvektoren wurden dann mittels Pearson-Korrelationskoeffizienten mit klinischen Merkmalen (COPD-Status, Alter, Geschlecht und Raucherstatus) korreliert, um COPD-assoziierte Module für die nachfolgende Analyse zu identifizieren.
Screening, Anreicherungsanalyse und PPI-Netzwerkanalyse überlappender Gene
Ein Venn-Diagramm wurde mit dem R-Paket ggvenn erstellt, um Gene zu identifizieren, die gemeinsam zwischen den DEGs, den MEsalmon-Modulgenen und den ac4C-RGs auftreten. Die funktionelle Anreicherungsanalyse der überlappenden Gene wurde mithilfe der Gene Ontology (GO) und der Kyoto Encyclopedia of Genes and Genomes (KEGG) mit dem R-Paket clusterProfiler durchgeführt. Protein-Protein-Interaktions-(PPI-)Informationen wurden aus der STRING-Datenbank (https://string-db.org/) abgerufen, um Interaktionen auf Proteinebene zwischen den überlappenden Genen zu analysieren. Die Software Cytoscape wurde verwendet, um das resultierende PPI-Netzwerk zu visualisieren.
Identifizierung wichtiger Gene mithilfe von maschinellem Lernen
Es wurden drei Machine-Learning-Methoden angewandt: die Regression mit der Least-Absolute-Shrinkage-and-Selection-Operator-Methode (LASSO), das extreme Gradient Boosting (XGBoost) und der Zufallswald (Random Forest, RF). Die LASSO-Regression wurde mit dem glmnet-Paket unter Verwendung einer 10-fachen Kreuzvalidierung durchgeführt, um den optimalen Bestrafungsparameter λ zu bestimmen. Der Parameter type.measure wurde auf „deviance“ und der Parameter family auf „binomial“ gesetzt. Der optimale λ-Wert wurde anhand des λmin-Kriteriums ausgewählt, das die kreuzvalidierte Devianz minimiert, wodurch 17 Gene ermittelt wurden. XGBoost wurde mit dem xgboost-Paket und folgenden Hyperparametern durchgeführt: nrounds = 100, max_depth = 6, eta = 0,3, subsample = 0,8, colsample_bytree = 0,8 und eval_metric = „logloss“. Die Wichtigkeit der Merkmale wurde anhand des Gain-Maßes bewertet, und die 30 wichtigsten Gene wurden ausgewählt. Der Zufallswald wurde mit dem randomForest-Paket mit ntree = 200 implementiert. Die Wichtigkeit der Merkmale wurde nach dem mittleren Abfall der Gini-Index bewertet, und erneut wurden die 30 wichtigsten Gene ausgewählt. Die von den drei Machine-Learning-Methoden identifizierten Gene wurden geschnitten, um Schlüsselgene für nachfolgende Analysen zu bestimmen.
Aufbau und Bewertung des logistischen Regressionsmodells zur Risikovorhersage
Der Datensatz GSE54837 wurde zufällig in einen Trainingsdatensatz (70 %) und einen Testdatensatz (30 %) aufgeteilt. Mithilfe der Funktion glm aus dem MASS-Paket wurde auf Basis des Trainingsdatensatzes ein logistisches Regressionsmodell erstellt, wobei die Expressionsniveaus der Schlüsselgene als Eingabemerkmale dienten. Die Modellleistung wurde anhand von ROC-Kurven bewertet, die mit dem pROC-Paket generiert wurden. Die 95-%-Konfidenzintervalle für die AUC wurden mittels 2.000 Bootstrap-Wiederholungen berechnet. Die Modellkalibrierung wurde anhand von Kalibrierungskurven überprüft, die mit 1.000 Bootstrap-Stichproben (rms-Paket) erstellt wurden. Die DCA wurde mit dem dca-Paket durchgeführt, um den klinischen Nutzen über einen Bereich von Schwellenwahrscheinlichkeiten hinweg zu bewerten. Ein Nomogramm wurde mithilfe der Funktion nomogram aus dem rms-Paket erstellt, um die individuelle Risikoeinschätzung zu erleichtern.
Die Regressionsgleichung lautete:
logit(P) = 0,5823 + 0,6010 × UPP1 - 0,6563 × PTRF + 0,3853 × B4GALT2 - 0,3972 × FAM168B + 0,1848 × PRKCDBP - 0,4787 × TOR3A. (1)
Hier steht P für die vorhergesagte Wahrscheinlichkeit einer COPD, und jeder Koeffizient repräsentiert den Beitrag des entsprechenden Genexpressionswerts zu den Log-Odds einer COPD.
Expressionsanalyse, GenMANIA-Netzwerk und molekulares regulatorisches Netzwerk
Die Genexpressionsniveaus zwischen den COPD- und Kontrollgruppen im GSE54837-Datensatz wurden mit dem Wilcoxon-Rangsummentest verglichen. Boxplots zur Visualisierung der Verteilung der Expressionsniveaus, mit Median, interquartilem Bereich (IQR) und überlagerten Einzeldatenpunkten, wurden mit dem ggplot2-Paket erstellt. GeneMANIA wurde verwendet, um Gen-Netzwerke aufzubauen und funktionelle Interaktionen vorherzusagen. Die Suche erfolgte mit Standardparametern: Spezies = Homo sapiens, maximale Anzahl verwandter Gene = 20. Das resultierende Netzwerk wurde heruntergeladen und visualisiert, wobei die Kantenfarben die Interaktionstypen anzeigten. Ein kompetitives endogenes RNA-Netzwerk (ceRNA) wurde konstruiert, um posttranskriptionelle regulatorische Mechanismen zu untersuchen. miRNAs, die die sechs Schlüsselgene targeten, wurden mithilfe zweier unabhängiger Datenbanken vorhergesagt: DIANA-microT (Score ≥ 0,8) und miRanda (Score ≥ 140, Energie ≤ −20 kcal/mol). Der Durchschnitt der von beiden Datenbanken identifizierten miRNAs wurde zur Erstellung von miRNA-mRNA-Paaren verwendet. Anschließend wurden lncRNAs, die diese miRNAs targeten, mittels der StarBase-Datenbank vorhergesagt. Ein lncRNA-miRNA-mRNA-regulatorisches Netzwerk wurde mit Cytoscape aufgebaut und visualisiert. Transkriptionelle regulatorische Beziehungen wurden mithilfe der ChIP-X Enrichment Analysis Version 3 (ChEA3) vorhergesagt. Für jedes Schlüsselgen mit vorhergesagten Transkriptionsfaktoren wurden die 10 Transkriptionsfaktoren mit den höchsten Anreicherungsscores ausgewählt. Ein TF-Ziel-Regulationsnetzwerk wurde in Cytoscape erstellt.
Analyse der Gen-Set-Anreicherung und Bewertung der Infiltration von Immunzellen
Die Analyse der Gen-Set-Enrichment (GSEA) wurde mit dem clusterProfiler-Paket durchgeführt, um die biologischen Funktionen jedes Schlüsselgens zu untersuchen. Für jedes Schlüsselgen wurden die Proben basierend auf dem Medianwert in Gruppen mit hoher und niedriger Expression unterteilt. Die differentielle Expressionsanalyse zwischen den beiden Gruppen wurde mit limma durchgeführt, und die resultierende Genliste wurde nach dem vorzeichenbehafteten log₂-Faltungsverhältnis (log₂ fold-change) sortiert. Die GSEA wurde mithilfe der Funktion gseGO für GO-Bioprozess-Terme und der Funktion gseKEGG für KEGG-Wege durchgeführt, mit folgenden Parametern: minGSSize = 10, maxGSSize = 500, pvalueCutoff = 0,05 und nPerm = 1.000. Die relative Häufigkeit von 28 Immunzelltypen wurde mittels single-sample Gene Set Enrichment Analysis (ssGSEA), wie sie im GSVA-Paket implementiert ist, geschätzt. Eine kuratierte Gen-Set-Signaturmatrix, die Marker-Gene für 28 Immunzelltypen umfasst, wurde aus früherer Literatur19 entnommen. Für jede Probe wurde die Funktion gsva mit method = „ssgsea“, ssgsea.norm = TRUE und kcdf = „Gaussian“ angewandt. Spearman-Korrelationskoeffizienten zwischen den ssGSEA-Enrichment-Scores und den Expressionsniveaus der sechs Schlüsselgene wurden mit der Funktion cor.test berechnet. Die p-Werte wurden mittels der Benjamini-Hochberg-Methode für Mehrfachvergleiche korrigiert. Die Korrelationsmatrix wurde als Heatmap mit dem pheatmap-Paket visualisiert.
Arzneimittelvorhersage, molekulares Docking und Analyse der Krankheitsassoziation
Mögliche therapeutische Wirkstoffe, die auf Schlüsselgene abzielen, wurden mithilfe der DrugBank-Datenbank identifiziert. Ein Interaktionsnetzwerk aus „Wirkstoffen, die auf Schlüsselgene abzielen“, wurde in Cytoscape erstellt, um vorhergesagte Wechselwirkungen zwischen Wirkstoffen und Genen zu visualisieren. Die molekulare Docking-Analyse wurde mit der CB-Dock2-Plattform durchgeführt, um Bindungsaffinitäten zu bewerten. Die dreidimensionale Proteinstruktur von menschlichem UPP1 wurde aus der Protein Data Bank abgerufen (PDB ID: 7B8T). Die molekularen Strukturen der Wirkstoffe (im SMILES-Format) stammten aus PubChem. Das Docking wurde mit der AutoDock Vina-Engine durchgeführt, und die Ergebnisse wurden nach Bindungsenergie (ΔG, in kcal/mol) sortiert. Die resultierenden Docking-Komplexe wurden mit PyMOL visualisiert. Zusammenhänge zwischen Schlüsselgenen und menschlichen Erkrankungen im Zusammenhang mit Umweltexpositionen wurden anhand der Comparative Toxicogenomics Database (CTD) untersucht. Jedes Gen wurde einzeln abgefragt, und die zehn am stärksten assoziierten Erkrankungen wurden extrahiert und mittels Radarplots dargestellt.
RT-qPCR-Protokoll
Periphere venöse Blutproben wurden von acht COPD-Patienten und acht gesunden Kontrollpersonen am Shenzhen Luohu Hospital of Traditional Chinese Medicine gesammelt. Die Diagnose COPD wurde gemäß den Kriterien der Global Initiative for Chronic Obstructive Lung Disease (GOLD) gestellt, definiert als FEV1/FVC nach Bronchodilatation < 0,70. Die Kontrollgruppe bestand aus alters- und geschlechtsangepassten gesunden Probanden ohne Anamnese respiratorischer Erkrankungen und normalen Lungenfunktionstests (vorhergesagtes FEV1% ≥ 80 % und FEV1/FVC ≥ 0,70). Die Basisinformationen der Patienten sind in Tabelle 2 dargestellt. Gesamt-RNA wurde aus den COPD-Blutproben mithilfe eines Blut-RNA-Extraktionskits isoliert. Für die cDNA-Synthese wurden 500 ng Gesamt-RNA unter Verwendung eines cDNA-Synthesekits und Entfernung genomischer DNA gemäß der beigefügten Anleitung revers transkribiert. Die erhaltene cDNA wurde auf 150 ng/μL verdünnt.
Die RT-qPCR wurde unter Verwendung eines auf SYBR Green basierenden qPCR-Mastermixes an einem Echtzeit-PCR-System durchgeführt. Jede 10 μL-Reaktion enthielt 5 μL 2x SYBR Green-Mastermix, jeweils 0,5 μL Vorwärts- und Rückwärtsprimer (10 μM), 1 μL verdünnte cDNA (15 ng/μL) und 3 μL nukleasefreies Wasser. Die Zyklierungsbedingungen bestanden aus einer initialen Denaturierung bei 95 °C für 5 min, gefolgt von 40 Zyklen mit 95 °C für 10 s und 60 °C für 30 s, sowie einer abschließenden Schmelzkurvenanalyse von 60 °C bis 95 °C zur Überprüfung der Amplifikationsspezifität. Alle Reaktionen wurden in technischen Triplikaten durchgeführt. β-Aktin wurde als endogenes Referenzgen verwendet. Die Primer-Effizienz für jedes Zielgen wurde mittels Standardkurven-Dilutionsreihen validiert und lag zwischen 90 % und 110 %. Die Genexpression wurde auf β-Aktin normalisiert, und die relative Expression wurde nach der 2-ΔΔCt-Methode berechnet. Statistische Vergleiche zwischen der COPD- und der Kontrollgruppe wurden mit dem Mann-Whitney-U-Test durchgeführt.
Statistische Analyse
Netzwerkvisualisierungen wurden mit Cytoscape erstellt und statistische Analysen mit der R-Software durchgeführt. Sofern nicht anders angegeben, wurde der Mann-Whitney-U-Test für nicht normalverteilte Daten und der t-Test nach Student für normalverteilte Daten zur Vergleichung von zwei Gruppen verwendet. Ein Wert von p < 0,05 galt als statistisch signifikant.