Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Onderzoeksartikel

Bio-informatische en machine-learning-identificatie van biomarkers voor pulmonale hypertensie en kandidaat-therapeutische verbindingen

82 weergaven

⸱

DOI:

10.3791/73519

⸱

25 augustus 2026

In dit artikel

Samenvatting

Dit artikel presenteert een reproduceerbare bio-informatica-workflow die publieke transcriptomische datasets, machine learning, externe validatie, kwantitatieve reverse transcriptie PCR, Connectivity Map-screening en moleculaire docking integreert om biomarkers voor pulmonale hypertensie en potentiële therapeutische verbindingen te identificeren.

Samenvatting

Deze studie had als doel longhypertensie (PH)-geassocieerde moleculaire biomarkers en kandidaat kleine moleculaire verbindingen te identificeren met behulp van openbare transcriptomische gegevens en onafhankelijke validatiebronnen. Drie Gene Expression Omnibus-datasets (GSE22356, GSE33463 en GSE48149) werden geïntegreerd na normalisatie, probe-annotatie en ComBat batch-effectcorrectie. Voor de identificatie van kernkenmerkgenen werden differentieel expressieonderzoek, gewogen gen-coexpressienetwerkanalyse, functionele verrijkingsanalyse, eiwit-eiwitinteractienetwerkanalyse en drie machine-learning-algoritmen gebruikt. De diagnostische prestaties werden geëvalueerd met behulp van receiver operating characteristic-curves. Externe validatie omvatte een onafhankelijke longweefselcohort (GSE117261), een single-cell RNA-sequencing dataset van de longslagader (GSE210248) en kwantitatieve reverse transcription PCR-validatie in onafhankelijke longweefselmonsters. Op Connectivity Map gebaseerde drug repositioning en moleculaire docking werden gebruikt om kandidaatverbindingen te screenen. Achtentachtig differentieel tot expressie gebrachte genen werden geïdentificeerd, waarbij CXCL10, JUN, IFIH1, MX1 en TLR7 werden geselecteerd als kernkenmerkgenen. In de onafhankelijke GSE117261 longweefselcohort vertoonde JUN de sterkste externe ondersteuning, terwijl de replicatie van de andere genen variabel was. Kwantitatieve reverse transcription PCR in 20 biologisch onafhankelijke monsters van pulmonale arteriële hypertensie en 20 controlemonsters bevestigde de upregulatie van alle vijf de genen. Zowel het schijnbare vijf-gen qRT-PCR-model als 100 herhaalde gestratificeerde five-fold cross-validatieanalyses leverden een area under the curve van 1,000 op, hoewel de kleine cohort een voorzichtige interpretatie en onafhankelijke prospectieve validatie vereist. Single-cell-analyse van GSE210248 ondersteunde een veranderde communicatie tussen immuun- en structurele cellen en fenotypische switching van gladde spiercellen. BRD-K91900765/VX-745 scoorde het hoogst in de Connectivity Map-screening. MAPK14/p38α, het vastgestelde farmacologische doelwit, werd opgenomen als een positief referentiedocking-eiwit, terwijl docking tegen de vijf biomarker-geassocieerde eiwitten als verkennend werd beschouwd. Deze bevindingen ondersteunen de vijf genen als kandidaat PH-biomarkers en VX-745 als een computationele drug-repositioning hypothese die experimentele validatie vereist.

Inleiding

Pulmonale hypertensie (PH) is een progressief cardiopulmonaal syndroom dat wordt gekenmerkt door een aanhoudend verhoogde pulmonale arteriële druk, een toegenomen pulmonale vasculaire weerstand en uiteindelijk falen van de rechterventrikel. Huidige hemodynamische criteria definiëren PH als een gemiddelde pulmonale arteriële druk in rust van >20 mmHg, gemeten via rechterhartkatheterisatie1. Onder de verschillende klinische subtypen is pulmonale arteriële hypertensie (PAH) een van de ernstigste vormen en wordt deze gekenmerkt door progressieve pulmonale vasculaire remodellering. De pathologische kenmerken omvatten endotheliale dysfunctie, abnormale proliferatie en migratie van gladde spiercellen in de pulmonale arteriën, activatie van adventitiële fibroblasten, depositie van de extracellulaire matrix, infiltratie van inflammatoire cellen en vernauwing of obliteratie van de distale pulmonale arteriën2. Deze veranderingen geven aan dat PH/PAH niet alleen een stoornis van vasoconstrictie is, maar ook een complexe vasculaire remodelleringsziekte die wordt gedreven door gecoördineerde moleculaire, cellulaire en immuun-inflammatoire mechanismen.

Huidige PAH-therapieën richten zich voornamelijk op de pathways van prostacycline, endotheline, stikstofoxide–oplosbaar guanylaatcyclase en fosfodiësterase type 53˒4. Hoewel deze behandelingen de symptomen, de inspanningscapaciteit en hemodynamische parameters verbeteren, blijven hun effecten grotendeels vasodilatatoir en hemodynamisch. Hun vermogen om gevestigde pulmonale vasculaire remodellering omkeerbaar te maken is beperkt, en veel patiënten blijven ziekteprogressie ervaren ondanks combinatietherapie. Daarom is het identificeren van nieuwe moleculaire biomarkers en therapeutische kandidaten die het remodelleringsproces weerspiegelen een belangrijke onvervulde behoefte. In het bijzonder zijn immuun-inflammatoire activatie, interferon-gerelateerde signalering, Toll-like receptor-pathways, chemokine-gemedieerde immuunrekrutering en fenotypische switching van gladde spiercellen naar voren gekomen als potentiële bijdragers aan de progressie van PH/PAH5˒6.

Transcriptomische datasets met een hoge doorvoer bieden waardevolle bronnen voor het identificeren van ziekte-geassocieerde moleculaire signaturen bij PH/PAH. Echter, studies gebaseerd op een enkele dataset worden vaak beperkt door kleine steekproefgroottes, batcheffecten, platformheterogeniteit en onvoldoende validatie. Differentieel expressie-analyse kan genen met een veranderde expressie identificeren, maar legt mogelijk niet volledig de ziekte-gerelateerde co-expressiemodules of interacties op netwerkniveau vast. Weighted gene co-expression network analysis (WGCNA) kan genmodules identificeren die geassocieerd zijn met ziektekenmerken, terwijl proteïne-proteïne interactie (PPI) netwerkanalyse sterk verbonden genen binnen biologische netwerken kan onthullen. Machine-learning methoden kunnen daarnaast genen met diagnostische of classificatiewaarde prioriteren. Echter, vertrouwen op een enkel algoritme kan model-specifieke bias introduceren. Het integreren van differentieel expressie-analyse, WGCNA, PPI netwerkanalyse en meerdere machine-learning algoritmen kan daarom de robuustheid van biomarker-ontdekking verbeteren.

Een andere grote uitdaging bij transcriptomische biomarkerstudies is de biologische interpretatie. Bulk-weefselsignalen kunnen wijzigingen in genexpressie binnen residente vasculaire cellen, infiltratie van immuuncellen of veranderde proporties van meerdere celpopulaties weerspiegelen. Single-cell RNA-sequencing biedt de mogelijkheid om uit bulk-data afgeleide kandidaatgenen in een cellulaire context te plaatsen. Bij PH/PAH omvat pulmonale vasculaire remodellering endotheelcellen, gladde spiercellen, fibroblasten, monocyten/macrofagen, lymfocyten en andere immuun- of structurele cellen. Ziekteprogressie is bovendien geassocieerd met veranderde cel-celcommunicatie en fenotypische switching van gladde spiercellen. Daarom kan het combineren van bulk-transcriptomische screening met single-cell validatie helpen bepalen of kandidaatbiomarkers geassocieerd zijn met immuunactivatie, vasculaire structurele remodellering of een onbalans in multicellulaire communicatie.

Naast de ontdekking van biomarkers kunnen transcriptomische signatures worden gebruikt voor computationele drug repositioning. De Connectivity Map (CMap) koppelt ziekte-geassocieerde genexpressieprofielen aan kleine moleculen die deze signatures kunnen omkeren of moduleren7. In combinatie met compound-curatie en moleculaire docking kan deze strategie experimenteel testbare therapeutische hypothesen genereren. Hoewel CMap-voorspellingen en moleculaire docking de werkzaamheid van een geneesmiddel niet kunnen vaststellen, kunnen ze kandidaat-verbindingen prioriteren voor toekomstige target-bindingassays, celgebaseerde experimenten en validatie in diermodellen.

Er is een geïntegreerde en reproduceerbare workflow ontwikkeld om biomarkers voor PH/PAH en kandidaat-therapeutische verbindingen te identificeren. Drie openbare transcriptomische datasets van de Gene Expression Omnibus werden geïntegreerd na normalisatie en correctie voor batch-effecten. Voor het screenen van robuuste kenmerkgenen werden differentiële expressieanalyse, WGCNA, functionele verrijkingsanalyse, PPI-netwerkanalyse en drie machine-learning-algoritmen gebruikt. ROC-analyse (receiver operating characteristic), een onafhankelijke validatiecohort van longweefsel, bewijs uit single-cell RNA-sequencing van de longslagader en kwantitatieve reverse transcription PCR-validatie in onafhankelijke monsters werden gebruikt om de geselecteerde genen verder te evalueren. Tot slot werden CMap-gebaseerde geneesmiddel-repositionering en moleculaire docking toegepast om kandidaat-verbindingen te identificeren. De nieuwheid van deze studie ligt in het gelaagde validatiekader, dat bulk-transcriptomische ontdekking, prioritering via machine-learning, onafhankelijke validatie, experimentele bevestiging via kwantitatieve reverse transcription PCR, mechanistische interpretatie op single-cell-niveau en computationele screening van verbindingen met elkaar verbindt. De hypothese van de studie was dat PH/PAH wordt aangestuurd door een gecoördineerd immuun-inflammatoir en vasculair remodelleringsprogramma, en dat robuuste genen binnen dit programma kunnen dienen als kandidaat-biomarkers en mogelijkheden bieden voor geneesmiddel-repositionering.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

De publieke Gene Expression Omnibus (GEO) datasets die in deze studie zijn geanalyseerd, bevatten gede-identificeerde transcriptomische gegevens uit eerder gepubliceerde studies en vereisten geen aanvullende ethische goedkeuring. De ethische commissie van de Huaihua University heeft de onafhankelijke validatiestudie met kwantitatieve reverse transcriptie-PCR (qRT-PCR) op menselijk longweefsel goedgekeurd (goedkeuringsnr. 2024(A05112)). Vóór de monstername is schriftelijke geïnformeerde toestemming verkregen van alle deelnemers of hun wettelijk gemachtigde vertegenwoordigers. De goedkeurings- en toestemmingsprocedures waren van toepassing op alle 20 longweefselmonsters van patiënten met pulmonale arteriële hypertensie (PAH) en de 20 controlemonsters die zijn opgenomen in de qRT-PCR-validatie. De onderzoeksinstrumenten die voor dit protocol zijn gebruikt, staan vermeld in de Tabel met Materialen.

1. Verzameling en preprocessing van publieke transcriptomische datasets

Microarray-datasets GSE22356, GSE33463 en GSE48149 met betrekking tot pulmonale hypertensie (PH) zijn verkregen uit de GEO-database. PH/pulmonale arteriële hypertensie (PAH)- en controlemonsters werden geëxtraheerd op basis van de oorspronkelijke fenotype-annotaties. Expressiematrices en platformannotatiebestanden werden gedownload met behulp van reproduceerbare R-scripts en het GEOquery-pakket.

Probe-annotatie en mapping van gensymbolen werden consistent over de datasets uitgevoerd. Wanneer meerdere probes aan hetzelfde gen gekoppeld waren, werd de gemiddelde expressiewaarde berekend. Kwantielnormalisatie werd toegepast en genen met een lage expressie of lage variantie werden verwijderd. De datasets werden samengevoegd en batch-effecten werden gecorrigeerd met behulp van het ComBat-algoritme in het sva-pakket8. De correctie werd geëvalueerd met behulp van boxplots en principale componentenanalyse.

2. Identificatie van differentieel tot expressie gekomen genen

Het limma-pakket werd gebruikt om expressieniveaus tussen PH- en controlevoorbeelden in de batch-gecorrigeerde expressiematrix te vergelijken9. Er werd een lineair model gefit en empirische Bayes-statistieken werden toegepast. Differentieel tot expressie gebrachte genen werden gedefinieerd op basis van een gecorrigeerde P-waarde <0,05 en een absolute log2-fold change > 0,585. De resultaten werden gevisualiseerd met behulp van volcano plots en heatmaps.

3. Constructie van het gewogen gen-co-expressienetwerk

Een gewogen gen-co-expressienetwerk werd geconstrueerd met behulp van het WGCNA-pakket10. Er werd sampleclustering uitgevoerd om uitschieters te detecteren. De soft-thresholding power werd geselecteerd op basis van de scale-free topology fit index. Genmodules werden geïdentificeerd met behulp van het dynamische tree-cutting algoritme. Module eigengenes werden gecorreleerd met het PH-fenotype, en de ziekte-geassocieerde module met de sterkste correlatie werd geselecteerd. Genen in de sleutelmodule werden geïntersecteerd met de differentieel tot expressie gebrachte genen om consensusgenen te verkrijgen.

4. Functionele verrijkingsanalyse

Categorieën voor biologische processen, cellulaire componenten en moleculaire functies van de Gene Ontology werden geanalyseerd met behulp van clusterProfiler11. Voor de identificatie van signaleringsroutes werd een pathway-enrichmentanalyse uitgevoerd met de Kyoto Encyclopedia of Genes and Genomes12. Een P-waarde < 0,05 en een q-waarde < 0,2 werden gehanteerd als drempelwaarden voor verrijking, en de verrijkte termen werden gevisualiseerd met behulp van bubble plots11.

5. Constructie van het eiwit-eiwitinteractienetwerk en identificatie van hub-genen

De consensus-genenlijst werd ingediend bij de STRING-database, waarbij Homo sapiens als soort werd geselecteerd en een drempelwaarde voor interactiebetrouwbaarheid van > 0,4 werd gehanteerd13. Het interactiebestand werd geïmporteerd in Cytoscape, waarna de CytoHubba-plug-in werd gebruikt om genen te rangschikken op basis van de graad van de knoop. Sterk verbonden genen werden gedefinieerd als hub-genen.

6. Selectie van diagnostische kenmerkgenen met behulp van machine learning

Er werden drie onafhankelijke algoritmen voor kenmerkselectie toegepast. Ten eerste werd logistische regressie met de least absolute shrinkage and selection operator uitgevoerd met behulp van het glmnet-pakket en 10-voudige kruisvalidatie om genen met coëfficiënten ongelijk aan nul te identificeren14. Ten tweede werd recursieve kenmerkeliminatie met support vector machines toegepast om redundante kenmerken te verwijderen en de subset van kenmerken te selecteren die de hoogste nauwkeurigheid bij de kruisvalidatie behaalde15. Ten derde werd een random forest-model geconstrueerd, waarbij de kenmerken werden gerangschikt op basis van de gemiddelde afname in de Gini-onzuiverheid16. De intersectie van de genensets afgeleid van de drie algoritmen werd gebruikt om de uiteindelijke set kernkenmerk-genen te definiëren. Het pROC-pakket werd gebruikt voor het genereren van receiver operating characteristic-curven en het berekenen van de waarden voor de oppervlakte onder de curve17.

7. Validatie van kerngenen met behulp van onafhankelijke bulk- en single-cell-datasets

GSE117261 werd gebruikt als een onafhankelijke externe validatiecohort van longweefsel, bestaande uit 58 PAH-monsters en 25 controlemonsters van afgewezen donoren18. Deze dataset is niet gebruikt bij de discovery-analyse van differentiële expressie, de constructie van het gewogen gen-co-expressienetwerk of de feature-selectie via machine learning. De expressiematrix werd genormaliseerd en geannoteerd, en de differentiële expressie werd geanalyseerd met limma v3.68.0. De Benjamini-Hochberg-correctie voor de false-discovery-rate werd toegepast op het gehele geannoteerde transcriptoom. Receiver operating characteristic (ROC)-curves voor individuele genen werden berekend met pROC v1.19.0.1, DeLong 95% betrouwbaarheidsintervallen en Youden-index-afkapwaarden. Een verkennend logistisch regressiemodel met vijf genen werd gefit binnen GSE117261, en de interne prestaties hiervan werden aanvullend geëvalueerd met behulp van herhaalde nested cross-validatie.

GSE210248 (Tabel 1) werd gebruikt als validatiedataset voor single-cell longslagaderen, bestaande uit monsters van drie patiënten met PAH en drie gezonde donoren19. De gegevens werden verwerkt met Seurat v5.5.1 voor kwaliteitscontrole, normalisatie, dimensionaliteitsreductie, clustering en celannotatie20. De belangrijkste celpopulaties, waaronder endotheelcellen, gladde spiercellen, fibroblasten, monocyten/macrofagen en T/natural killer-cellen, werden geïdentificeerd. Cel-celcommunicatie werd geanalyseerd met CellChat v2.1.2 en de CellChatDB.human ligand-receptor-database21. Er werd een CellChat-object gemaakt van de genormaliseerde Seurat-expressiematrix en de metadata van de celtypen. Overexpressie-genen en ligand-receptor-interacties werden geïdentificeerd; communicatiewaarschijnlijkheden werden berekend; interacties met celgroepen van minder dan 10 cellen werden verwijderd; en communicatienetwerken op routeniveau werden afgeleid en geaggregeerd. Deze dataset werd uitsluitend gebruikt voor externe mechanistische validatie en niet voor modeltraining.

ItemBeschrijving
DatasetGSE210248
Gegevenstype10x Genomics/druppelgebaseerde single-cell RNA-sequencing; high-throughput transcriptomische profilering
Menselijke monstersDrie longslagadermonsters van patiënten met PAH en drie longslagadermonsters van gezonde donoren
WeefselbronEx vivo longslagaderweefsel, dat primair de cellulaire ecologie van de longvasculaire wand en het vasculaire remodelleringsproces weerspiegelt
Belangrijkste analytisch doelCeltypelokalisatie, fenotypische switch van gladdespiercellen, communicatie tussen immuun- en structurele cellen en mechanistische consistentievalidatie van kandidaatgenen

Tabel 1: Basisinformatie voor de GSE210248 single-cell validatiedataset. De tabel vat de dataset-accessienummer, het sequencersplatform, de weefselbron, de monstersamenstelling en het analytische doel van de single-cell validatieanalyse van de longslagader samen.

8. Validatie van genexpressie via qRT-PCR

De qRT-PCR-validatie omvatte 20 biologisch onafhankelijke PAH-longweefselmonsters van patiënten met PH/PAH en 20 biologisch onafhankelijke controlemonsters van longweefsel. Totaal RNA werd geëxtraheerd met gebruik van de Total RNA Extraction Kit. De RNA-concentratie en -zuiverheid werden bepaald met een spectrofotometer, en de RNA-integriteit werd geëvalueerd via agarosegelelektroforese. Alleen RNA-monsters met A260/280-waarden tussen 1,8 en 2,1 en zonder zichtbare degradatie werden opgenomen.

Gelijke hoeveelheden RNA werden omgezet in complementair DNA via reverse-transcriptie met behulp van de Solarbio Universal RT-PCR Kit (AMV; catalogusnr. RP1200). Kwantitatieve PCR voor CXCL10, JUN, IFIH1, MX1 en TLR7 werd uitgevoerd met SYBR Green PCR Master Mix op een Real-Time PCR-systeem. Elk biologisch monster werd geanalyseerd in drie technische replica's, samen met controles zonder template en zonder reverse-transcriptie. De gemiddelde Ct-waarde van de drie technische replica's werd gebruikt voor de daaropvolgende analyse; technische replica's werden niet als onafhankelijke waarnemingen beschouwd. Er werden primers gebruikt die exon-exonovergangen overspannen en amplicons van 80–200 bp produceren (Tabel 2). De primerspecificiteit werd geverifieerd met behulp van NCBI Primer-BLAST en smeltcurve-analyse22.

β-actine (ACTB) werd gebruikt als intern referentiegen om de expressieniveaus van de doelgenen te normaliseren. De relatieve expressie werd berekend met de 2-ΔΔCt methode23. Voor vergelijkingen tussen groepen werden tweezijdige Mann-Whitney U-toetsen gebruikt op basis van de datadistributie, en er werd een Benjamini-Hochberg-correctie voor de false-discovery-rate toegepast over de vijf genen. ROC-curves voor individuele genen werden gegenereerd met DeLong 95% betrouwbaarheidsintervallen, en optimale afkapwaarden werden geselecteerd met behulp van de Youden-index. Het logistische regressiemodel met vijf genen werd aanvankelijk gefit en geëvalueerd op dezelfde 40 biologische monsters; deze schatting werd daarom gedefinieerd als de schijnbare in-sample prestatie. Om mogelijke overfitting te beoordelen, werden 100 gestratificeerde five-fold cross-validatie herhalingen uitgevoerd met een L2-geregulariseerd logistisch regressiemodel, waarna de gepoolde out-of-fold ROC-prestatie werd berekend.

GenRefSeq-toegangsnummerForward primer (5'′–3′)Reverse primer (5'′–3′)Productgrootte (bp)Tm (°C)Exon-overspanning
CXCL10NM_001565.4GTCAAGCCAT
AATTGTTC
ATAGTGCCAG
GGTAGAGT
14146.1Ja
JUNNM_002228.4ACAAGTGGCA
GAGTCCCG
CGCCCAAGTT
CAACAACC
15254.5Ja
IFIH1NM_022168GCACAGAGCG
GTAGACCCT
GCCCTGAAGC
ACGAGATG
18254.7Ja
MX1NM_002462.5TTAGCCGTGG
TGATTTAGC
CAAGGTGGAG
CGATTCTG
15652.3Ja
TLR7NM_016562.4ATTGCCCTCGT
TGTTATA
TTCCTGGAGTT
TGTTGAT
17948.1Ja
ACTBNM_001101.3CTCACCATGGAT
GATGATATCGC
AGGAATCCTTCT
GACCCATGC
19456.2Ja

Tabel 2: Primersequenties gebruikt voor kwantitatieve reverse transcriptie-PCR. De tabel vermeldt de doelgenen, RefSeq-accessienummers, forward- en reverse primersequenties, productgroottes, smelttemperaturen en de exon-overspanningstatus van de primers gebruikt voor qRT-PCR.

9. Screening van kandidaatverbindingen en moleculaire docking

De upgereguleerde en downgereguleerde core-gene signatures werden ingediend bij de Connectivity Map-database om kleine moleculen te identificeren die voorspeld werden het PH-geassocieerde expressieprofiel om te keren7. Kandidaten werden gerangschikt op basis van de Logit-score en de voorspellingswaarschijnlijkheid.

De driedimensionale structuur van BRD-K91900765/VX-745 is verkregen uit PubChem onder CID 303852524. Farmacologische informatie over de verbinding is gecureerd uit openbare medicatiedatabanken, en structurele descriptoren zijn berekend met behulp van DrugBank en SwissADME25,26. Proteïnestructuren zijn verkregen uit de RCSB Protein Data Bank met behulp van de volgende PDB-identificatoren: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; en MAPK14/p38α, 1OUK27. Blinde holte-detectie en moleculaire docking zijn uitgevoerd met CB-Dock2 v2.0 met de AutoDock Vina v1.2.0 scoring engine28,29. Proteïne- en ligandbestanden zijn geüpload naar CB-Dock2, kandidaat-holtes zijn automatisch gedetecteerd en docking is uitgevoerd binnen de holte-specifieke boxen die door de server zijn gegenereerd. Voor elk proteïne zijn de holte-identificator, Vina-score, holtevolume, het centrum van de docking-box, de afmetingen van de docking-box en het proteïne-ligandcomplexbestand geregistreerd. De pose met de meest negatieve Vina-score is geselecteerd als de best gerangschikte voorspelde conformatie. MAPK14/p38α is opgenomen als het gevestigde farmacologische doelwit en positieve referentiedocking-proteïne voor VX-745. Docking tegen CXCL10, JUN, IFIH1, MX1 en TLR7 was verkennend en werd niet geïnterpreteerd als bewijs voor directe farmacologische targeting, binding, inhibitie of effectiviteit.

10. Statistische analyse en reproduceerbaarheidscontrole

Alle statistische analyses werden uitgevoerd in R, tenzij anders aangegeven. Tweezijdige P-waarden < 0,05 werden beschouwd als statistisch significant. Correctie voor meervoudig testen werd toegepast op de analyses van differentiële expressie, verrijking, externe validatie en qRT-PCR, zoals hierboven gespecificeerd. Kruisvalidatie werd gebruikt om de stabiliteit van de machine-learningmodellen en de gecombineerde qRT-PCR-modellen te beoordelen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Preprocessing van openbare transcriptomische gegevens en identificatie van differentieel tot expressie gebrachte genen

Integratie en ComBat-correctie van GSE22356, GSE33463 en GSE48149 verminderden de systematische verschillen tussen de datasets. Boxplots lieten zien dat de expressieverdelingen van de monsters consistenter werden na correctie. Principale componentenanalyse wees uit dat de monsters vóór correctie voornamelijk clusterden op basis van de bron van de dataset, maar...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Er is een geïntegreerde en reproduceerbare workflow ontwikkeld om moleculaire biomarkers en kandidaat-therapeutische verbindingen geassocieerd met PH/PAH te identificeren door een combinatie van publieke transcriptomics, gewogen gen-co-expressienetwerkanalyse, functionele verrijking, eiwit-eiwitinteractienetwerkanalyse, drie machine-learningalgoritmen, externe validatie, interpretatie van single-cell transcriptomics, bevestiging via kwantitatieve reverse transcriptie-PCR, Connectivity Map-screening en moleculaire docking...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs verklaren dat er geen concurrerende belangen zijn.

Dankbetuigingen

Deze studie werd ondersteund door het Hunan Innovative Province Construction Project (Nr. 2022JJ30465).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
2× SYBR Green PCR MastermixBeijing Solarbio Science & Technology Co., Ltd.Catalogusnr. SR1110Kleurstofgebaseerde kwantitatieve real-time PCR-amplificatie en fluorescentiedetectie
AI21.msvmRFE.R en e1071Aangepast R-script met het CRAN e1071-pakketAI21.msvmRFE.R; e1071 v1.7-17Support vector machine-recursieve kenmerkeliminatie
AgaroseBeijing Solarbio Science & Technology Co., Ltd.Catalogusnr. A8201; CAS 9012-36-6Beoordeling van de integriteit van totaal RNA middels agarosegelelektroforese
Apparatuur voor agarosegelelektroforeseBeijing Liuyi Biotechnology Co., Ltd.Model DYCZ-24DNElektroforetische beoordeling van RNA-integriteit
AutoDock Vina-scoremoduleCenter for Computational Structural Biology, Scripps Researchv1.2.0; RRID: SCR_011958Scoring van eiwit-ligandposities binnen de CB-Dock2-workflow
CB-Dock2Cao Laboratory, CB-Dock2 webserverv2.0; geraadpleegd juli 2026Blinde holte-detectie en moleculaire docking van VX-745 met de geselecteerde proteïnestructuren
CellChatCellChat R-pakketv2.1.2Afleiding en visualisatie van cel-celcommunicatie vanuit de single-cell expressiematrix
CellChatDB.humanGeleverd met het CellChat R-pakketCellChatDB.human; subset uitgescheiden signalering; minimale celdrempel = 10Menselijke ligand-receptor interactiedatabase voor CellChat
clusterProfilerBioconductor R-pakketv4.20.0; Bioconductor release 3.23Verrijkingsanalyses van de Gene Ontology en de Kyoto Encyclopedia of Genes and Genomes
Connectivity Map (CMap/CLUE)Broad InstituteL1000/CLUE-bron; RRID: SCR_016204; geraadpleegd in juli 2026Computationele analyse voor drug-repositioning
Op maat gemaakte oligonucleotide-primersBeijing Solarbio Science & Technology Co., Ltd.Op maat gesynthetiseerd; primersequenties vermeld in Tabel 2Amplificatie van ACTB, CXCL10, JUN, IFIH1, MX1 en TLR7
cytoHubbaCytoscape App Storev0.1Rangschikking van hub-genen op basis van graad in het proteïne-proteïne interactienetwerk
CytoscapeCytoscape Consortiumv3.10.4; RRID: SCR_003032Visualisatie en analyse van eiwit-eiwitinteractienetwerken
DrugBankDrugBank Kennisbankv6.0; RRID: SCR_002700Curatie van verbindingidentiteit en farmacologische informatie
Gel-documentatiesysteemBeijing Liuyi Biotechnology Co., Ltd.Model WO-9413BVisualisatie en registratie van resultaten van de RNA-integriteit op agarosegel
Gene Expression Omnibus (GEO)National Center for Biotechnology InformationGSE22356, GSE33463, GSE48149, GSE117261 en GSE210248; RRID: SCR_005012Ophalen van bulk- en single-cell transcriptomische datasets
GEOqueryBioconductor R-pakketv2.80.0; Bioconductor release 3.23Programmatisch downloaden en importeren van GEO-expressie- en fenotypedata
glmnetCRAN R-pakketv5.0Logistische regressie via de least absolute shrinkage and selection operator en geregulariseerde logistische modellering
limmaBioconductor R-pakketv3.68.0; Bioconductor release 3.23; RRID: SCR_010943Analyse van differentiële expressie en empirische Bayes-statistiek
NanoDrop-spectrofotometerThermo Fisher ScientificNanoDrop ND-1000; software v3.8Meting van de RNA-concentratie en de A260/280 en A260/230 zuiverheidsratio's
NCBI Primer-BLASTNational Center for Biotechnology InformationWebtool; RRID: SCR_003095; geraadpleegd juli 2026Verificatie van primerspecificiteit
pROCCRAN R-pakketv1.19.0.1; RRID: SCR_024286Receiver operating characteristic-analyse, DeLong-betrouwbaarheidsintervallen en Youden-index-afkapwaarden
Protein Data Bank (PDB)RCSB Protein Data BankCXCL10: 1LV9; JUN: 1JUN; IFIH1: 3B6E; MX1: 5GTM; TLR7: 7CYN; MAPK14/p38α: 1OUK; RRID: SCR_012820Ophalen van experimenteel bepaalde eiwitstructuren voor moleculaire docking
PubChemNational Center for Biotechnology InformationPubChem CID 3038525; RRID: SCR_004284Ophalen van de driedimensionale structuur en chemische identificatoren van BRD-K91900765/VX-745
RR Foundation for Statistical Computingv4.6.1; RRID: SCR_001905Statistische informatica, gegevensverwerking, machine learning en visualisatie
randomForestCRAN R-pakketv4.7-1.2Featureselectie en rangschikking van variabele-belangrijkheid met Random Forest
Real-time PCR-systeemStratagene, nu Agilent TechnologiesMx3000P Real-Time PCR-systeemqRT-PCR-amplificatie, fluorescentieacquisitie, smeltcurve-analyse en Ct-export
SeuratCRAN R-pakket; Satija Laboratoryv5.5.1; RRID: SCR_016341Kwaliteitscontrole, normalisatie, dimensionaliteitsreductie, clustering en annotatie van single-cell RNA-sequencing
Kopieer de gewenste hoeveelheid van de oplossing in een steriele centrifugebuis met behulp van een micropipet. Draai de buis centrifugeer voor 30 seconden bij 10.000 x g om eventuele onopgeloste resten te bezinken. Pipetteer vervolgens het supernatant voorzichtig over in een nieuwe, steriele buis en discard de pellet. Bewaar de gefilterde oplossing bij 4 °C voor onmiddellijk gebruik of bij -20 °C voor langdurige bewaring.STRING-consortiumv12.0; RRID: SCR_005223Constructie van een eiwit-eiwitinteractienetwerk
sva (ComBat)Bioconductor R-pakketv3.60.0; Bioconductor release 3.23Correctie van batch-effecten tussen datasets
SwissADMESwiss Institute of BioinformaticsWebserver; geraadpleegd in juli 2026Prescreening van drug-likeness, fysisch-chemische eigenschappen en ADME
Kit voor totale RNA-extractieBeijing Solarbio Science & Technology Co., Ltd.Catalogusnr. R1200Extractie en purificatie van totaal RNA uit longweefselmonsters
Universele RT-PCR Kit (AMV)Beijing Solarbio Science & Technology Co., Ltd.Catalogusnr. RP1200Omzetting van totaal RNA in complementair DNA via reverse transcriptie
WGCNA (Weighted Gene Co-expression Network Analysis)CRAN R-pakketv1.74Constructie van gewogen gen-co-expressienetwerken en module-trait-analyse

Referenties

  1. Simonneau G, et al. Haemodynamic definitions and updated clinical classification of pulmonary hypertension. Eur Respir J. 2019;53(1):1801913. doi: 10.1183/13993003.01913-2018.
  2. Rabinovitch M, Guignabert C, Humbert M, Nicolls MR. Inflammation and immunity in the pathogenesis of pulmonary arterial hypertension. Circ Res. 2014;115(1):165–175.
  3. Humbert M, et al. 2022 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Heart J. 2022;43(38):3618–3731.
  4. Galiè N, et al. 2015 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Respir J. 2015;46(4):903–975.
  5. Soon E, et al. Elevated levels of inflammatory cytokines predict survival in idiopathic and familial pulmonary arterial hypertension. Circulation. 2010;122(9):920–927.
  6. George PM, et al. Evidence for the involvement of type I interferon in pulmonary arterial hypertension. Circ Res. 2014;114(4):677–688.
  7. Subramanian A, et al. A next-generation Connectivity Map: L1000 platform and the first 1,000,000 profiles. Cell. 2017;171(6):1437–1452.e17.
  8. Leek JT, et al. The sva package for removing batch effects and other unwanted variation in high-throughput experiments. Bioinformatics. 2012;28(6):882–883.
  9. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47. doi: 10.1093/nar/gkv007.
  10. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559. doi: 10.1186/1471-2105-9-559.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–287.
  12. Kanehisa M, Goto S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 2000;28(1):27–30.
  13. Szklarczyk D, et al. The STRING database in protein–protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638–D646.
  14. Friedman J, Hastie T, Tibshirani R. Regularization paths for generalized linear models via coordinate descent. J Stat Softw. 2010;33(1):1–22.
  15. Guyon I, Weston J, Barnhill S, Vapnik V. Gene selection for cancer classification using support vector machines. Mach Learn. 2002;46:389–422.
  16. Breiman L. Random forests. Mach Learn. 2001;45(1):5–32.
  17. Robin X, et al. pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics. 2011;12:77. doi: 10.1186/s12859-011-0077-8.
  18. Stearman RS, et al. Systems analysis of the human pulmonary arterial hypertension lung transcriptome. Am J Respir Cell Mol Biol. 2019;60(6):637–649.
  19. Crnkovic S, et al. Single-cell transcriptomics reveals skewed cellular communication and phenotypic shift in pulmonary artery remodeling. JCI Insight. 2022;7(20):e153471. doi: 10.1172/jci.insight.153471.
  20. Hao Y, et al. Integrated analysis of multimodal single-cell data. Cell. 2021;184(13):3573–3587.e29.
  21. Jin S, et al. Inference and analysis of cell–cell communication using CellChat. Nat Commun. 2021;12(1):1088. doi: 10.1038/s41467-021-21246-9.
  22. Bustin SA, et al. MIQE 2.0: revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments guidelines. Clin Chem. 2025;71(6):634–651.
  23. Livak KJ, Schmittgen TD. Analysis of relative gene expression data using real-time quantitative PCR and the 2−ΔΔCt method. Methods. 2001;25(4):402–408.
  24. Kim S, et al. PubChem 2023 update. Nucleic Acids Res. 2023;51(D1):D1373–D1380.
  25. Knox C, et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res. 2024;52(D1):D1265–D1275.
  26. Daina A, Michielin O, Zoete V. SwissADME: a free web tool to evaluate pharmacokinetics, drug-likeness, and medicinal chemistry friendliness of small molecules. Sci Rep. 2017;7:42717. doi: 10.1038/srep42717.
  27. Burley SK, et al. RCSB Protein Data Bank: powerful new tools for exploring 3D structures of biological macromolecules for basic and applied research and education. Nucleic Acids Res. 2021;49(D1):D437–D451. doi: 10.1093/nar/gkaa1038.
  28. Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: new docking methods, expanded force field, and Python bindings. J Chem Inf Model. 2021;61(8):3891–3898. doi: 10.1021/acs.jcim.1c00203.
  29. Liu Y, et al. CB-Dock2: improved protein-ligand blind docking by integrating cavity detection, docking, and homologous template fitting. Nucleic Acids Res. 2022;50(W1):W159–W164. doi: 10.1093/nar/gkac394.
  30. Duffy JP, et al. The discovery of VX-745: a novel and selective p38α kinase inhibitor. ACS Med Chem Lett. 2011;2(10):758–763.
  31. Sheng Y, et al. Crocin inhibits neutrophil migration and activation to treat hypoxic pulmonary hypertension through targeting HCK. Phytomedicine. 2025;148:157334. doi: 10.1016/j.phymed.2025.157334.
  32. Cui H, et al. Leonurine ameliorates hypoxic pulmonary hypertension by inhibiting cross-talk between neutrophils and endothelial cells via SERPINB3 targeting. Int Immunopharmacol. 2026;176:116467. doi: 10.1016/j.intimp.2026.116467.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Tags

Identificatie van biomarkerstranscriptomische gegevensdifferentiële expressiegen-co-expressieproteïne-interactienetwerksingle-cell RNA-sequencingdrug repositioningkwantitatieve PCR