Die in dieser Studie analysierten öffentlichen Datensätze der Gene Expression Omnibus (GEO) enthielten anonymisierte transkriptomische Daten aus zuvor veröffentlichten Studien und erforderten keine zusätzliche ethische Genehmigung. Der Ethikausschuss der Huaihua University genehmigte die unabhängige Validierungsstudie mittels quantitativer reverser Transkriptions-PCR (qRT-PCR) an menschlichem Lungengewebe (Genehmigungsnummer 2024(A05112)). Von allen Teilnehmern oder deren gesetzlich bevollmächtigten Vertretern wurde vor der Probennahme schriftlich informierte Einwilligung eingeholt. Die Genehmigungs- und Einwilligungsverfahren galten für alle 20 Pulmonalarterienhypertonie-(PAH)- und 20 Kontroll-Lungengewebeproben, die in die qRT-PCR-Validierung eingeschlossen wurden. Die für dieses Protokoll verwendeten Forschungswerkzeuge sind in der Tabelle der Materialien aufgeführt.
1. Sammlung und Vorverarbeitung öffentlicher transkriptomischer Datensätze
Mikroarray-Datensätze im Zusammenhang mit pulmonaler Hypertonie (PH), GSE22356, GSE33463 und GSE48149, wurden aus der GEO-Datenbank bezogen. PH/pulmonal-arterielle Hypertonie (PAH)- und Kontrollproben wurden gemäß den ursprünglichen Phänotyp-Beschriftungen extrahiert. Expressionsmatrizen und Plattform-Annotationsdateien wurden mithilfe reproduzierbarer R-Skripte und des GEOquery-Pakets heruntergeladen.
Die Probennotation und Gen-Symbol-Zuordnung wurde einheitlich über alle Datensätze hinweg durchgeführt. Wenn mehrere Proben auf dasselbe Gen abgebildet wurden, wurde der mittlere Expressionswert berechnet. Es wurde eine Quantilnormalisierung durchgeführt, und Gene mit geringer Expression oder geringer Varianz wurden entfernt. Die Datensätze wurden zusammengeführt, und Batch-Effekte wurden mithilfe des ComBat-Algorithmus im sva-Paket8 korrigiert. Die Korrektur wurde anhand von Boxplots und der Hauptkomponentenanalyse evaluiert.
2. Identifizierung differentiell exprimierter Gene
Das limma-Paket wurde verwendet, um die Expressionsniveaus zwischen PH- und Kontrollproben in der batch-korrigierten Expressionsmatrix zu vergleichen9. Ein lineares Modell wurde angepasst, und empirische Bayes-Statistiken wurden angewendet. Differenziell exprimierte Gene wurden anhand eines adjustierten P-Werts <0,05 und einer absoluten log2-Fold-Change > 0,585 definiert. Die Ergebnisse wurden mithilfe von Volcano-Plots und Heatmaps visualisiert.
3. Konstruktion eines gewichteten genen Koregulationsnetzwerks
Ein gewichtetes Gen-Koexpressionsnetzwerk wurde unter Verwendung des WGCNA-Pakets10 konstruiert. Die Proben wurden mittels Clusteranalyse auf Ausreißer überprüft. Die Soft-Thresholding-Potenz wurde anhand des Fit-Index für die skalenfreie Topologie gewählt. Genmodule wurden mithilfe des dynamischen Baum-Schneide-Algorithmus identifiziert. Die Moduleigenvektoren wurden mit dem PH-Phänotyp korreliert, und das krankheitsassoziierte Modul mit der stärksten Korrelation wurde ausgewählt. Die Gene im Schlüsselmodul wurden mit den differentiell exprimierten Genen geschnitten, um Konsensgene zu erhalten.
4. Funktionsanreicherungsanalyse
Die biologischen Prozesse, zellulären Komponenten und molekularen Funktionen der Genontologie wurden mittels clusterProfiler11 analysiert. Eine Anreicherungsanalyse der Kyoto Encyclopedia of Genes and Genomes (KEGG) wurde durchgeführt, um Signalwege zu identifizieren12. Als Anreicherungsschwellenwerte dienten ein P-Wert < 0,05 und ein q-Wert < 0,2; die angereicherten Terme wurden mithilfe von Bubble-Plots visualisiert11.
5. Konstruktion des Protein-Protein-Interaktionsnetzwerks und Identifizierung von Hub-Genen
Die konsensierte Genliste wurde in die STRING-Datenbank eingereicht, wobei Homo sapiens als Spezies und eine Interaktionsvertrauensschwelle von > 0,413 ausgewählt wurde. Die Interaktionsdatei wurde in Cytoscape importiert, und das CytoHubba-Plug-in wurde verwendet, um Gene nach Knotengrad zu sortieren. Stark vernetzte Gene wurden als Hub-Gene definiert.
6. Auswahl diagnostischer Merkmal-Gene mithilfe maschinellen Lernens
Es wurden drei unabhängige Algorithmen zur Merkmalsauswahl angewendet. Zunächst wurde eine logistische Regression mit der Methode „Least Absolute Shrinkage and Selection Operator“ unter Verwendung des glmnet-Pakets und einer 10-fachen Kreuzvalidierung durchgeführt, um Gene mit von null verschiedenen Koeffizienten zu identifizieren14. Als Zweites wurde die schrittweise Merkmalseliminierung mittels Support-Vektor-Maschinen angewendet, um redundante Merkmale zu entfernen und diejenige Teilmengen von Merkmalen auszuwählen, die die höchste Genauigkeit in der Kreuzvalidierung erreichte15. Drittens wurde ein Random-Forest-Modell erstellt, und die Merkmale wurden nach dem mittleren Rückgang der Gini-Unreinheit sortiert16. Der Durchschnitt der aus den drei Algorithmen gewonnenen Genmengen wurde verwendet, um die endgültige Menge der zentralen Merkmalsgene festzulegen. Mit dem pROC-Paket wurden Receiver-Operating-Characteristic-Kurven erstellt und die Flächen unter der Kurve berechnet17.
7. Validierung der Kerngene mithilfe unabhängiger Bulk- und Einzelzell-Datensätze
GSE117261 wurde als unabhängige externe Validierungskohorte von Lungengewebe verwendet, die 58 PAH-Proben und 25 Kontrollproben von verstorbenen Spendern umfasst18. Dieser Datensatz wurde nicht für die Entdeckungsanalyse differentieller Expression, den Aufbau des gewichteten Gen-ko-Expressionsnetzwerks oder die Merkmalsauswahl mittels maschinellem Lernen herangezogen. Die Expressionsmatrix wurde normalisiert und annotiert, und die differentielle Expression wurde mit limma v3.68.0 analysiert. Die False-Discovery-Rate-Korrektur nach Benjamini-Hochberg wurde auf das gesamte annotierte Transkriptom angewandt. Einzelne ROC-Kurven (Receiver Operating Characteristic) wurden mit pROC v1.19.0.1, DeLong-95%-Konfidenzintervallen und Youden-Index-Schwellenwerten berechnet. Ein exploratives logistisches Regressionsmodell mit fünf Genen wurde innerhalb von GSE117261 angepasst, und seine interne Leistung zusätzlich mittels wiederholter geschachtelter Kreuzvalidierung bewertet.
GSE210248 (Tabelle 1) wurde als Einzelzell-Pulmonalarterien-Validierungsdatensatz verwendet, der Proben von drei Patienten mit PAH und drei gesunden Spendern umfasst19. Die Daten wurden mit Seurat v5.5.1 zur Qualitätskontrolle, Normalisierung, Dimensionsreduktion, Clusterung und Zellannotation verarbeitet20. Wichtige Zellpopulationen, darunter Endothelzellen, glatte Muskelzellen, Fibroblasten, Monozyten/Makrophagen sowie T- und natürliche Killerzellen, wurden identifiziert. Die Zell-Zell-Kommunikation wurde mit CellChat v2.1.2 und der Ligand-Rezeptor-Datenbank CellChatDB.human analysiert21. Ein CellChat-Objekt wurde aus der normalisierten Seurat-Expressionsmatrix und den Zelltyp-Metadaten erstellt. Überexprimierte Gene und Ligand-Rezeptor-Interaktionen wurden identifiziert; Kommunikationswahrscheinlichkeiten berechnet; Interaktionen, an denen Zellgruppen mit weniger als 10 Zellen beteiligt waren, entfernt; und auf Pfadwirkungsebene basierende Kommunikationsnetzwerke wurden abgeleitet und aggregiert. Dieser Datensatz wurde ausschließlich zur externen mechanistischen Validierung und nicht zum Modelltraining verwendet.
| Element | Beschreibung |
| Datensatz | GSE210248 |
| Datentyp | 10x Genomics/Tropfen-basierte Einzelzell-RNA-Sequenzierung; hochdurchsatzfähige transkriptomische Profilierung |
| Menschliche Proben | Drei pulmonalarterielle Proben von PAH-Patienten und drei pulmonalarterielle Proben von gesunden Spendern |
| Gewebekomponente | Ex-vivo-Pulmonalarterien-Gewebe, das hauptsächlich die zelluläre Ökologie der pulmonalen Gefäßwand und den Prozess der Gefäßumbildung widerspiegelt |
| Hauptanalytischer Zweck | Zelltyp-Lokalisierung, phänotypischer Übergang von glatten Muskelzellen, Kommunikation zwischen immunen und strukturellen Zellen sowie Validierung der mechanistischen Konsistenz von Kandidatengenen |
Tabelle 1: Grundlegende Informationen zum GSE210248 Einzelzell-Validierungsdatensatz. Die Tabelle fasst die Datensatz-ID, Sequenzierplattform, Gewebeprobe, Probenzusammensetzung und analytische Zielsetzung der Einzelzell-Analyse der Lungenarterie zur Validierung zusammen.
8. Validierung der Genexpression durch qRT-PCR
Die qRT-PCR-Validierung umfasste 20 biologisch unabhängige Lungenproben von Patienten mit PH/PAH und 20 biologisch unabhängige Kontroll-Lungenproben. Die Gesamt-RNA wurde mit dem Total RNA Extraction Kit extrahiert. Die RNA-Konzentration und -Reinheit wurden mithilfe eines Spektrophotometers bestimmt, und die RNA-Integrität wurde durch Agarose-Gelelektrophorese überprüft. Nur RNA-Proben mit A260/280-Werten zwischen 1,8 und 2,1 und ohne sichtbare Degradation wurden einbezogen.
Gleiche Mengen an RNA wurden mit dem Solarbio Universal RT-PCR Kit (AMV; Artikelnummer RP1200) in komplementäre DNA umgeschrieben. Die quantitative PCR für CXCL10, JUN, IFIH1, MX1 und TLR7 wurde unter Verwendung von SYBR Green PCR Master Mix auf einem Echtzeit-PCR-System durchgeführt. Jede biologische Probe wurde in drei technischen Wiederholungen analysiert, zusammen mit Kontrollen ohne Template und ohne Reverse Transkription. Der mittlere Ct-Wert der drei technischen Wiederholungen wurde für die nachfolgende Analyse verwendet; technische Wiederholungen wurden nicht als unabhängige Beobachtungen betrachtet. Es wurden Primer verwendet, die Exon-Intron-Übergänge überspannen und Amplikone von 80–200 bp erzeugen (Tabelle 2). Die Primer-Spezifität wurde mittels NCBI Primer-BLAST und Schmelzkurvenanalyse überprüft22.
β-Aktin (ACTB) wurde als internes Referenzgen verwendet, um die Expressionsniveaus der Zielgene zu normalisieren. Die relative Expression wurde mit der 2-ΔΔCt-Methode berechnet23. Für den Vergleich zwischen Gruppen wurden zweiseitige Mann-Whitney-U-Tests in Abhängigkeit von der Datenverteilung verwendet, und eine Falsch-Entdeckungs-Rate-Korrektur nach Benjamini-Hochberg wurde für die fünf Gene angewandt. Einzelne ROC-Kurven pro Gen wurden mit 95 % Konfidenzintervallen nach DeLong erstellt, und die optimalen Cut-offs wurden anhand des Youden-Index ausgewählt. Das logistische Regressionsmodell mit fünf Genen wurde zunächst an denselben 40 biologischen Proben angepasst und bewertet; diese Schätzung wurde daher als scheinbare In-Sample-Performance definiert. Um eine mögliche Überanpassung zu beurteilen, wurden 100 Wiederholungen einer stratifizierten fünffachen Kreuzvalidierung unter Verwendung eines L2-regulären logistischen Regressionsmodells durchgeführt, und die gepoolte ROC-Performance außerhalb der Folds wurde berechnet.
| Gen | RefSeq-Zugangsnummer | Forward-Primer (5′–3′) | Reverse-Primer (5′–3′) | Produktgröße (bp) | Tm (°C) | Exon-überspannend |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Ja |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Ja |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Ja |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Ja |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Ja |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Ja |
Tabelle 2: Primersequenzen für die quantitative reverse Transkriptions-PCR. Die Tabelle enthält die Zielgene, RefSeq-Zugangsnummern, Vorwärts- und Rückwärts-Primersequenzen, Produktgrößen, Schmelztemperaturen und Angaben dazu, ob die Primer auf Exon-Übergängen liegen, die bei der qRT-PCR verwendet wurden.
9. Screening von Wirkstoffkandidaten und molekulares Docking
Die hoch- und herunterregulierten Kern-Gen-Signaturen wurden in die Connectivity-Map-Datenbank eingegeben, um kleine Moleküle zu identifizieren, von denen vorhergesagt wird, dass sie das PH-assozierte Expressionsprofil umkehren7. Die Kandidaten wurden nach Logit-Score und Vorhersagewahrscheinlichkeit geordnet.
Die dreidimensionale Struktur von BRD-K91900765/VX-745 wurde aus PubChem unter CID 303852524 bezogen. Pharmakologische Informationen zum Wirkstoff wurden aus öffentlichen Arzneimitteldatenbanken zusammengestellt, und strukturelle Deskriptoren wurden mithilfe von DrugBank und SwissADME25,26 berechnet. Proteinstrukturen wurden aus der RCSB Protein Data Bank unter Verwendung der folgenden PDB-Identifikatoren bezogen: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; sowie MAPK14/p38α, 1OUK27. Die blinde Hohldetektion und molekulare Docking-Analysen wurden mit CB-Dock2 v2.0 unter Verwendung der AutoDock Vina v1.2.0 Scoring-Engine durchgeführt28,29. Protein- und Ligandendateien wurden auf CB-Dock2 hochgeladen, potenzielle Hohlräume automatisch detektiert, und das Docking wurde innerhalb der vom Server generierten hohlraumspezifischen Boxen durchgeführt. Für jedes Protein wurden der Hohlraum-Identifikator, der Vina-Score, das Hohlraumvolumen, der Mittelpunkt der Docking-Box, die Abmessungen der Docking-Box sowie die Datei des Protein-Ligand-Komplexes dokumentiert. Die Pose mit dem niedrigsten (negativsten) Vina-Score wurde als die am höchsten bewertete vorhergesagte Konformation ausgewählt. MAPK14/p38α wurde als etabliertes pharmakologisches Ziel und als positiver Referenz-Docking-Protein für VX-745 einbezogen. Das Docking an CXCL10, JUN, IFIH1, MX1 und TLR7 diente explorativen Zwecken und wurde nicht als Hinweis auf eine direkte pharmakologische Zielgerichtetheit, Bindung, Hemmung oder Wirksamkeit interpretiert.
10. Statistische Analyse und Reproduzierbarkeitskontrolle
Alle statistischen Analysen wurden in R durchgeführt, sofern nicht anders angegeben. Zweiseitige P-Werte < 0,05 wurden als statistisch signifikant betrachtet. Eine Korrektur für Mehrfachvergleiche wurde auf die Analysen zur differentiellen Expression, Anreicherung, externen Validierung und qRT-PCR wie oben beschrieben angewandt. Eine Kreuzvalidierung wurde verwendet, um die Stabilität der Machine-Learning- und kombinierten qRT-PCR-Modelle zu bewerten.