De publieke Gene Expression Omnibus (GEO) datasets die in deze studie zijn geanalyseerd, bevatten gede-identificeerde transcriptomische gegevens uit eerder gepubliceerde studies en vereisten geen aanvullende ethische goedkeuring. De ethische commissie van de Huaihua University heeft de onafhankelijke validatiestudie met kwantitatieve reverse transcriptie-PCR (qRT-PCR) op menselijk longweefsel goedgekeurd (goedkeuringsnr. 2024(A05112)). Vóór de monstername is schriftelijke geïnformeerde toestemming verkregen van alle deelnemers of hun wettelijk gemachtigde vertegenwoordigers. De goedkeurings- en toestemmingsprocedures waren van toepassing op alle 20 longweefselmonsters van patiënten met pulmonale arteriële hypertensie (PAH) en de 20 controlemonsters die zijn opgenomen in de qRT-PCR-validatie. De onderzoeksinstrumenten die voor dit protocol zijn gebruikt, staan vermeld in de Tabel met Materialen.
1. Verzameling en preprocessing van publieke transcriptomische datasets
Microarray-datasets GSE22356, GSE33463 en GSE48149 met betrekking tot pulmonale hypertensie (PH) zijn verkregen uit de GEO-database. PH/pulmonale arteriële hypertensie (PAH)- en controlemonsters werden geëxtraheerd op basis van de oorspronkelijke fenotype-annotaties. Expressiematrices en platformannotatiebestanden werden gedownload met behulp van reproduceerbare R-scripts en het GEOquery-pakket.
Probe-annotatie en mapping van gensymbolen werden consistent over de datasets uitgevoerd. Wanneer meerdere probes aan hetzelfde gen gekoppeld waren, werd de gemiddelde expressiewaarde berekend. Kwantielnormalisatie werd toegepast en genen met een lage expressie of lage variantie werden verwijderd. De datasets werden samengevoegd en batch-effecten werden gecorrigeerd met behulp van het ComBat-algoritme in het sva-pakket8. De correctie werd geëvalueerd met behulp van boxplots en principale componentenanalyse.
2. Identificatie van differentieel tot expressie gekomen genen
Het limma-pakket werd gebruikt om expressieniveaus tussen PH- en controlevoorbeelden in de batch-gecorrigeerde expressiematrix te vergelijken9. Er werd een lineair model gefit en empirische Bayes-statistieken werden toegepast. Differentieel tot expressie gebrachte genen werden gedefinieerd op basis van een gecorrigeerde P-waarde <0,05 en een absolute log2-fold change > 0,585. De resultaten werden gevisualiseerd met behulp van volcano plots en heatmaps.
3. Constructie van het gewogen gen-co-expressienetwerk
Een gewogen gen-co-expressienetwerk werd geconstrueerd met behulp van het WGCNA-pakket10. Er werd sampleclustering uitgevoerd om uitschieters te detecteren. De soft-thresholding power werd geselecteerd op basis van de scale-free topology fit index. Genmodules werden geïdentificeerd met behulp van het dynamische tree-cutting algoritme. Module eigengenes werden gecorreleerd met het PH-fenotype, en de ziekte-geassocieerde module met de sterkste correlatie werd geselecteerd. Genen in de sleutelmodule werden geïntersecteerd met de differentieel tot expressie gebrachte genen om consensusgenen te verkrijgen.
4. Functionele verrijkingsanalyse
Categorieën voor biologische processen, cellulaire componenten en moleculaire functies van de Gene Ontology werden geanalyseerd met behulp van clusterProfiler11. Voor de identificatie van signaleringsroutes werd een pathway-enrichmentanalyse uitgevoerd met de Kyoto Encyclopedia of Genes and Genomes12. Een P-waarde < 0,05 en een q-waarde < 0,2 werden gehanteerd als drempelwaarden voor verrijking, en de verrijkte termen werden gevisualiseerd met behulp van bubble plots11.
5. Constructie van het eiwit-eiwitinteractienetwerk en identificatie van hub-genen
De consensus-genenlijst werd ingediend bij de STRING-database, waarbij Homo sapiens als soort werd geselecteerd en een drempelwaarde voor interactiebetrouwbaarheid van > 0,4 werd gehanteerd13. Het interactiebestand werd geïmporteerd in Cytoscape, waarna de CytoHubba-plug-in werd gebruikt om genen te rangschikken op basis van de graad van de knoop. Sterk verbonden genen werden gedefinieerd als hub-genen.
6. Selectie van diagnostische kenmerkgenen met behulp van machine learning
Er werden drie onafhankelijke algoritmen voor kenmerkselectie toegepast. Ten eerste werd logistische regressie met de least absolute shrinkage and selection operator uitgevoerd met behulp van het glmnet-pakket en 10-voudige kruisvalidatie om genen met coëfficiënten ongelijk aan nul te identificeren14. Ten tweede werd recursieve kenmerkeliminatie met support vector machines toegepast om redundante kenmerken te verwijderen en de subset van kenmerken te selecteren die de hoogste nauwkeurigheid bij de kruisvalidatie behaalde15. Ten derde werd een random forest-model geconstrueerd, waarbij de kenmerken werden gerangschikt op basis van de gemiddelde afname in de Gini-onzuiverheid16. De intersectie van de genensets afgeleid van de drie algoritmen werd gebruikt om de uiteindelijke set kernkenmerk-genen te definiëren. Het pROC-pakket werd gebruikt voor het genereren van receiver operating characteristic-curven en het berekenen van de waarden voor de oppervlakte onder de curve17.
7. Validatie van kerngenen met behulp van onafhankelijke bulk- en single-cell-datasets
GSE117261 werd gebruikt als een onafhankelijke externe validatiecohort van longweefsel, bestaande uit 58 PAH-monsters en 25 controlemonsters van afgewezen donoren18. Deze dataset is niet gebruikt bij de discovery-analyse van differentiële expressie, de constructie van het gewogen gen-co-expressienetwerk of de feature-selectie via machine learning. De expressiematrix werd genormaliseerd en geannoteerd, en de differentiële expressie werd geanalyseerd met limma v3.68.0. De Benjamini-Hochberg-correctie voor de false-discovery-rate werd toegepast op het gehele geannoteerde transcriptoom. Receiver operating characteristic (ROC)-curves voor individuele genen werden berekend met pROC v1.19.0.1, DeLong 95% betrouwbaarheidsintervallen en Youden-index-afkapwaarden. Een verkennend logistisch regressiemodel met vijf genen werd gefit binnen GSE117261, en de interne prestaties hiervan werden aanvullend geëvalueerd met behulp van herhaalde nested cross-validatie.
GSE210248 (Tabel 1) werd gebruikt als validatiedataset voor single-cell longslagaderen, bestaande uit monsters van drie patiënten met PAH en drie gezonde donoren19. De gegevens werden verwerkt met Seurat v5.5.1 voor kwaliteitscontrole, normalisatie, dimensionaliteitsreductie, clustering en celannotatie20. De belangrijkste celpopulaties, waaronder endotheelcellen, gladde spiercellen, fibroblasten, monocyten/macrofagen en T/natural killer-cellen, werden geïdentificeerd. Cel-celcommunicatie werd geanalyseerd met CellChat v2.1.2 en de CellChatDB.human ligand-receptor-database21. Er werd een CellChat-object gemaakt van de genormaliseerde Seurat-expressiematrix en de metadata van de celtypen. Overexpressie-genen en ligand-receptor-interacties werden geïdentificeerd; communicatiewaarschijnlijkheden werden berekend; interacties met celgroepen van minder dan 10 cellen werden verwijderd; en communicatienetwerken op routeniveau werden afgeleid en geaggregeerd. Deze dataset werd uitsluitend gebruikt voor externe mechanistische validatie en niet voor modeltraining.
| Item | Beschrijving |
| Dataset | GSE210248 |
| Gegevenstype | 10x Genomics/druppelgebaseerde single-cell RNA-sequencing; high-throughput transcriptomische profilering |
| Menselijke monsters | Drie longslagadermonsters van patiënten met PAH en drie longslagadermonsters van gezonde donoren |
| Weefselbron | Ex vivo longslagaderweefsel, dat primair de cellulaire ecologie van de longvasculaire wand en het vasculaire remodelleringsproces weerspiegelt |
| Belangrijkste analytisch doel | Celtypelokalisatie, fenotypische switch van gladdespiercellen, communicatie tussen immuun- en structurele cellen en mechanistische consistentievalidatie van kandidaatgenen |
Tabel 1: Basisinformatie voor de GSE210248 single-cell validatiedataset. De tabel vat de dataset-accessienummer, het sequencersplatform, de weefselbron, de monstersamenstelling en het analytische doel van de single-cell validatieanalyse van de longslagader samen.
8. Validatie van genexpressie via qRT-PCR
De qRT-PCR-validatie omvatte 20 biologisch onafhankelijke PAH-longweefselmonsters van patiënten met PH/PAH en 20 biologisch onafhankelijke controlemonsters van longweefsel. Totaal RNA werd geëxtraheerd met gebruik van de Total RNA Extraction Kit. De RNA-concentratie en -zuiverheid werden bepaald met een spectrofotometer, en de RNA-integriteit werd geëvalueerd via agarosegelelektroforese. Alleen RNA-monsters met A260/280-waarden tussen 1,8 en 2,1 en zonder zichtbare degradatie werden opgenomen.
Gelijke hoeveelheden RNA werden omgezet in complementair DNA via reverse-transcriptie met behulp van de Solarbio Universal RT-PCR Kit (AMV; catalogusnr. RP1200). Kwantitatieve PCR voor CXCL10, JUN, IFIH1, MX1 en TLR7 werd uitgevoerd met SYBR Green PCR Master Mix op een Real-Time PCR-systeem. Elk biologisch monster werd geanalyseerd in drie technische replica's, samen met controles zonder template en zonder reverse-transcriptie. De gemiddelde Ct-waarde van de drie technische replica's werd gebruikt voor de daaropvolgende analyse; technische replica's werden niet als onafhankelijke waarnemingen beschouwd. Er werden primers gebruikt die exon-exonovergangen overspannen en amplicons van 80–200 bp produceren (Tabel 2). De primerspecificiteit werd geverifieerd met behulp van NCBI Primer-BLAST en smeltcurve-analyse22.
β-actine (ACTB) werd gebruikt als intern referentiegen om de expressieniveaus van de doelgenen te normaliseren. De relatieve expressie werd berekend met de 2-ΔΔCt methode23. Voor vergelijkingen tussen groepen werden tweezijdige Mann-Whitney U-toetsen gebruikt op basis van de datadistributie, en er werd een Benjamini-Hochberg-correctie voor de false-discovery-rate toegepast over de vijf genen. ROC-curves voor individuele genen werden gegenereerd met DeLong 95% betrouwbaarheidsintervallen, en optimale afkapwaarden werden geselecteerd met behulp van de Youden-index. Het logistische regressiemodel met vijf genen werd aanvankelijk gefit en geëvalueerd op dezelfde 40 biologische monsters; deze schatting werd daarom gedefinieerd als de schijnbare in-sample prestatie. Om mogelijke overfitting te beoordelen, werden 100 gestratificeerde five-fold cross-validatie herhalingen uitgevoerd met een L2-geregulariseerd logistisch regressiemodel, waarna de gepoolde out-of-fold ROC-prestatie werd berekend.
| Gen | RefSeq-toegangsnummer | Forward primer (5'′–3′) | Reverse primer (5'′–3′) | Productgrootte (bp) | Tm (°C) | Exon-overspanning |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Ja |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Ja |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Ja |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Ja |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Ja |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Ja |
Tabel 2: Primersequenties gebruikt voor kwantitatieve reverse transcriptie-PCR. De tabel vermeldt de doelgenen, RefSeq-accessienummers, forward- en reverse primersequenties, productgroottes, smelttemperaturen en de exon-overspanningstatus van de primers gebruikt voor qRT-PCR.
9. Screening van kandidaatverbindingen en moleculaire docking
De upgereguleerde en downgereguleerde core-gene signatures werden ingediend bij de Connectivity Map-database om kleine moleculen te identificeren die voorspeld werden het PH-geassocieerde expressieprofiel om te keren7. Kandidaten werden gerangschikt op basis van de Logit-score en de voorspellingswaarschijnlijkheid.
De driedimensionale structuur van BRD-K91900765/VX-745 is verkregen uit PubChem onder CID 303852524. Farmacologische informatie over de verbinding is gecureerd uit openbare medicatiedatabanken, en structurele descriptoren zijn berekend met behulp van DrugBank en SwissADME25,26. Proteïnestructuren zijn verkregen uit de RCSB Protein Data Bank met behulp van de volgende PDB-identificatoren: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; en MAPK14/p38α, 1OUK27. Blinde holte-detectie en moleculaire docking zijn uitgevoerd met CB-Dock2 v2.0 met de AutoDock Vina v1.2.0 scoring engine28,29. Proteïne- en ligandbestanden zijn geüpload naar CB-Dock2, kandidaat-holtes zijn automatisch gedetecteerd en docking is uitgevoerd binnen de holte-specifieke boxen die door de server zijn gegenereerd. Voor elk proteïne zijn de holte-identificator, Vina-score, holtevolume, het centrum van de docking-box, de afmetingen van de docking-box en het proteïne-ligandcomplexbestand geregistreerd. De pose met de meest negatieve Vina-score is geselecteerd als de best gerangschikte voorspelde conformatie. MAPK14/p38α is opgenomen als het gevestigde farmacologische doelwit en positieve referentiedocking-proteïne voor VX-745. Docking tegen CXCL10, JUN, IFIH1, MX1 en TLR7 was verkennend en werd niet geïnterpreteerd als bewijs voor directe farmacologische targeting, binding, inhibitie of effectiviteit.
10. Statistische analyse en reproduceerbaarheidscontrole
Alle statistische analyses werden uitgevoerd in R, tenzij anders aangegeven. Tweezijdige P-waarden < 0,05 werden beschouwd als statistisch significant. Correctie voor meervoudig testen werd toegepast op de analyses van differentiële expressie, verrijking, externe validatie en qRT-PCR, zoals hierboven gespecificeerd. Kruisvalidatie werd gebruikt om de stabiliteit van de machine-learningmodellen en de gecombineerde qRT-PCR-modellen te beoordelen.