È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo di ricerca

Identificazione di biomarcatori per l'ipertensione polmonare e di composti terapeutici candidati tramite bioinformatica e apprendimento automatico

82 visualizzazioni

⸱

DOI:

10.3791/73519

⸱

25 agosto 2026

In questo articolo

Sommario

Questo articolo presenta un flusso di lavoro bioinformatico riproducibile che integra set di dati trascrittomici pubblici, apprendimento automatico, validazione esterna, PCR quantitativa a retrotrascrizione, screening della Connectivity Map e docking molecolare per identificare biomarcatori dell'ipertensione polmonare e composti terapeutici candidati.

Abstract

Questo studio ha avuto lo scopo di identificare biomarcatori molecolari associati all'ipertensione polmonare (PH) e composti di piccole molecole candidati, utilizzando dati trascrittomici pubblici e risorse indipendenti di validazione. Tre dataset del Gene Expression Omnibus (GSE22356, GSE33463 e GSE48149) sono stati integrati dopo normalizzazione, annotazione delle sonde e correzione dell'effetto batch con ComBat. Sono state impiegate analisi di espressione differenziale, analisi di rete co-espressiva pesata dei geni, analisi di arricchimento funzionale, analisi di rete di interazione proteina-proteina e tre algoritmi di apprendimento automatico per identificare i geni chiave. Le prestazioni diagnostiche sono state valutate mediante curve ROC (receiver operating characteristic). La validazione esterna ha incluso una coorte indipendente di tessuto polmonare (GSE117261), un dataset di sequenziamento dell'RNA a singola cellula dell'arteria polmonare (GSE210248) e una validazione mediante PCR quantitativa a retrotrascrizione inversa su campioni di tessuto polmonare indipendenti. La riposizionamento di farmaci basato sulla Connectivity Map e il docking molecolare sono stati utilizzati per selezionare composti candidati. Sono stati identificati 78 geni differenzialmente espressi, e CXCL10, JUN, IFIH1, MX1 e TLR7 sono stati selezionati come geni chiave. Nella coorte indipendente di tessuto polmonare GSE117261, JUN ha mostrato il supporto esterno più forte, mentre la replicazione degli altri geni è risultata variabile. La PCR quantitativa a retrotrascrizione inversa su 20 campioni biologicamente indipendenti di ipertensione arteriosa polmonare e 20 campioni di controllo ha confermato l'upregolazione di tutti e cinque i geni. Il modello apparente di qRT-PCR a cinque geni e le analisi di cross-validazione stratificata ripetuta cinque volte per 100 volte hanno entrambi prodotto un'area sotto la curva di 1,000, sebbene la piccola dimensione del campione richieda un'interpretazione cauta e una validazione prospettica indipendente. L'analisi a singola cellula del dataset GSE210248 ha supportato un'alterata comunicazione tra cellule immunitarie e cellule strutturali e un cambiamento fenotipico delle cellule muscolari lisce. BRD-K91900765/VX-745 ha ottenuto il punteggio più alto nel screening della Connectivity Map. MAPK14/p38α, il suo noto bersaglio farmacologico, è stato incluso come proteina di riferimento positiva per il docking, mentre il docking contro le cinque proteine associate ai biomarcatori è stato considerato esplorativo. Questi risultati supportano i cinque geni come biomarcatori candidati per la PH e VX-745 come ipotesi di riposizionamento farmacologico computazionale da validare sperimentalmente.

Introduzione

L'ipertensione polmonare (PH) è un disturbo cardiopolmonare progressivo caratterizzato da una pressione arteriosa polmonare persistentemente elevata, da un aumento della resistenza vascolare polmonare e da un'insufficienza ventricolare destra conclamata. I criteri emodinamici attuali definiscono la PH come una pressione arteriosa polmonare media a riposo pari o superiore a >20 mmHg, misurati mediante cateterizzazione del cuore destro1Tra i diversi sottotipi clinici, l'ipertensione arteriosa polmonare (PAH) è una delle forme più gravi ed è caratterizzata da un rimodellamento progressivo dei vasi polmonari. Le sue caratteristiche patologiche includono disfunzione endoteliale, proliferazione e migrazione anomala delle cellule muscolari lisce arteriose polmonari, attivazione dei fibroblasti avventiziali, deposizione della matrice extracellulare, infiltrazione di cellule infiammatorie e restringimento o occlusione delle arterie polmonari distali.2Questi cambiamenti indicano che l'ipertensione polmonare/ipertensione arteriosa polmonare (PH/PAH) non è soltanto un disturbo della vasocostrizione, ma anche una malattia complessa di rimodellamento vascolare determinata da meccanismi molecolari, cellulari e infiammatori-immunitari coordinati.

Le attuali terapie per l'ipertensione arteriosa polmonare (PAH) mirano principalmente alle vie del prostaciclina, endotelina, ossido nitrico–guanilato ciclasi solubile e fosfodiesterasi di tipo 53˒4. Sebbene questi trattamenti migliorino i sintomi, la capacità di esercizio e i parametri emodinamici, i loro effetti rimangono prevalentemente vasodilatatori ed emodinamici. La loro capacità di invertire il rimodellamento vascolare polmonare già instaurato è limitata e molti pazienti continuano a presentare un progressivo aggravamento della malattia nonostante la terapia combinata. Pertanto, l'identificazione di nuovi biomarcatori molecolari e di potenziali bersagli terapeutici che riflettano il processo di rimodellamento rappresenta un importante bisogno insoddisfatto. In particolare, l'attivazione immunitario-infiammatoria, i segnali correlati agli interferoni, le vie dei recettori tipo Toll, il reclutamento immunitario mediato da chemochine e il passaggio fenotipico delle cellule muscolari lisce si sono rivelati possibili fattori coinvolti nella progressione dell'ipertensione polmonare (PH)/PAH5˒6.

I dataset trascrittomici ad alto rendimento forniscono risorse preziose per l'identificazione di firme molecolari associate a malattie nell'ipertensione polmonare (PH/PAH). Tuttavia, gli studi basati su un singolo dataset sono spesso limitati da piccole dimensioni del campione, effetti di lotto, eterogeneità delle piattaforme e validazione insufficiente. L'analisi dell'espressione differenziale può identificare geni con espressione alterata, ma potrebbe non cogliere pienamente i moduli di co-espressione correlati alla malattia o le interazioni a livello di rete. L'analisi della rete di co-espressione genica pesata (WGCNA) può identificare moduli genici associati a caratteristiche della malattia, mentre l'analisi della rete di interazione proteina-proteina (PPI) può rivelare geni altamente connessi all'interno delle reti biologiche. I metodi di apprendimento automatico (machine learning) possono inoltre selezionare geni con valore diagnostico o di classificazione. Tuttavia, il ricorso a un singolo algoritmo potrebbe introdurre un bias specifico del modello. L'integrazione dell'analisi dell'espressione differenziale, della WGCNA, dell'analisi della rete PPI e di più algoritmi di machine learning potrebbe quindi migliorare la robustezza nella scoperta di biomarcatori.

Un'altra sfida importante negli studi sui biomarcatori trascrittomici è l'interpretazione biologica. I segnali derivanti da tessuti bulk possono riflettere cambiamenti nell'espressione genica all'interno delle cellule vascolari residenti, l'infiltrazione di cellule immunitarie o proporzioni alterate di diverse popolazioni cellulari. Il sequenziamento dell'RNA a singola cellula offre l'opportunità di collocare i geni candidati derivati dai dati bulk in un contesto cellulare. Nell'IP/AIP, il rimodellamento vascolare polmonare coinvolge cellule endoteliali, cellule muscolari lisce, fibroblasti, monociti/macrophagi, linfociti e altre cellule immunitarie o strutturali. Alla progressione della malattia è inoltre associata una comunicazione alterata tra le cellule e il passaggio fenotipico delle cellule muscolari lisce. Pertanto, combinare lo screening trascrittomico bulk con una validazione a singola cellula può aiutare a determinare se i biomarcatori candidati siano associati all'attivazione immunitaria, al rimodellamento strutturale vascolare o a uno squilibrio nella comunicazione multicellulare.

Oltre alla scoperta di biomarcatori, le firme trascrittomiche possono essere utilizzate per il riposizionamento computazionale di farmaci. La mappa di connettività (Connectivity Map, CMap) collega profili di espressione genica associati a malattie con piccole molecole che potrebbero invertire o modulare tali firme7. Quando combinata con la cura dei composti e il docking molecolare, questa strategia può generare ipotesi terapeutiche verificabili sperimentalmente. Sebbene le previsioni di CMap e il docking molecolare non possano stabilire l'efficacia di un farmaco, possono selezionare composti candidati da sottoporre a futuri saggi di legame al bersaglio, esperimenti su cellule e validazione in modelli animali.

È stato sviluppato un flusso di lavoro integrato e riproducibile per identificare biomarcatori e composti terapeutici candidati per l'ipertensione polmonare (PH)/ipertensione arteriosa polmonare (PAH). Tre dataset trascrittomici pubblici del Gene Expression Omnibus sono stati integrati dopo normalizzazione e correzione degli effetti di batch. Sono state utilizzate analisi di espressione differenziale, WGCNA, analisi di arricchimento funzionale, analisi della rete di interazione proteina-proteina (PPI) e tre algoritmi di apprendimento automatico (machine learning) per selezionare geni caratteristici robusti. L'analisi della curva ROC (receiver operating characteristic), un coorte di validazione indipendente su tessuto polmonare, evidenze da sequenziamento dell'RNA a singola cellula dell'arteria polmonare e la validazione mediante PCR quantitativa a retrotrascrizione inversa su campioni indipendenti sono state impiegate per ulteriori valutazioni dei geni selezionati. Infine, il riposizionamento di farmaci basato su CMap e il docking molecolare sono stati applicati per identificare composti candidati. La novità dello studio risiede nel suo schema di validazione multilivello, che collega la scoperta trascrittomica su popolazione cellulare eterogenea (bulk), la priorizzazione mediante apprendimento automatico, la validazione indipendente, la conferma sperimentale con PCR quantitativa a retrotrascrizione inversa, l'interpretazione meccanicistica a singola cellula e lo screening computazionale di composti. L'ipotesi dello studio era che la PH/PAH sia determinata da un programma coordinato di infiammazione-immunitaria e rimodellamento vascolare e che geni robusti all'interno di questo programma possano fungere da biomarcatori candidati e offrire opportunità di riposizionamento di farmaci.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

I set di dati pubblici del Gene Expression Omnibus (GEO) analizzati in questo studio contenevano dati trascrittomici anonimi provenienti da studi precedentemente pubblicati e non richiedevano ulteriore approvazione etica. Il comitato etico dell'Università di Huaihua ha approvato lo studio indipendente di validazione mediante PCR quantitativa a retrotrascrizione inversa (qRT-PCR) su tessuti polmonari umani (numero di approvazione: 2024(A05112)). Il consenso informato scritto è stato ottenuto da tutti i partecipanti o dai loro rappresentanti legalmente autorizzati prima della raccolta dei campioni. Le procedure di approvazione e consenso si sono applicate a tutti i 20 campioni di tessuto polmonare provenienti da pazienti con ipertensione arteriosa polmonare (PAH) e ai 20 campioni di controllo inclusi nella validazione mediante qRT-PCR. Gli strumenti di ricerca utilizzati per questo protocollo sono elencati nella Tabella dei materiali.

1. Raccolta e preelaborazione di dataset trascrittomici pubblici

I set di dati microarray relativi all'ipertensione polmonare (PH) GSE22356, GSE33463 e GSE48149 sono stati ottenuti dal database GEO. I campioni di PH/ipertensione arteriosa polmonare (PAH) e i campioni di controllo sono stati estratti in base alle annotazioni fenotipiche originali. Le matrici di espressione e i file di annotazione della piattaforma sono stati scaricati utilizzando script R riproducibili e il pacchetto GEOquery.

L'annotazione delle sonde e l'associazione ai simboli genici sono state eseguite in modo coerente tra i diversi set di dati. Quando più sonde corrispondevano allo stesso gene, è stato calcolato il valore medio di espressione. È stata applicata la normalizzazione quantile e sono stati rimossi i geni con espressione bassa o varianza ridotta. I set di dati sono stati uniti e gli effetti di batch sono stati corretti utilizzando l'algoritmo ComBat nel pacchetto sva8. La correzione è stata valutata mediante boxplot e analisi delle componenti principali.

2. Identificazione dei geni differenzialmente espressi

Il pacchetto limma è stato utilizzato per confrontare i livelli di espressione tra campioni di PH e controlli nella matrice di espressione corretta per il batch9. È stato adattato un modello lineare e sono state applicate statistiche bayesiane empiriche. I geni differenzialmente espressi sono stati definiti utilizzando un valore di P corretto <0,05 e un cambio di fold log2 assoluto > 0,585. I risultati sono stati visualizzati mediante plot a vulcano e mappe termiche.

3. Costruzione della rete di co-espressione genica pesata

È stata costruita una rete di co-espressione genica pesata utilizzando il pacchetto WGCNA10. È stata eseguita la clusterizzazione dei campioni per rilevare valori anomali. La potenza di soglia morbida è stata scelta in base all'indice di adattamento alla topologia senza scala. I moduli genici sono stati identificati utilizzando l'algoritmo di taglio dinamico dell'albero. Gli eigengeni dei moduli sono stati correlati al fenotipo di ipertensione polmonare (PH), e il modulo associato alla malattia con la correlazione più forte è stato selezionato. I geni nel modulo chiave sono stati incrociati con i geni differenzialmente espressi per ottenere i geni in consenso.

4. Analisi del riparrimento funzionale

Le categorie del processo biologico, della componente cellulare e della funzione molecolare della Gene Ontology sono state analizzate utilizzando clusterProfiler11. È stata eseguita un'analisi di arricchimento dei percorsi della Kyoto Encyclopedia of Genes and Genomes per identificare i percorsi di segnalazione12. Sono stati utilizzati un valore di P < 0,05 e un valore di q < 0,2 come soglie di arricchimento, e i termini arricchiti sono stati visualizzati mediante grafici a bolle11.

5. Costruzione della rete di interazione proteina-proteina e identificazione dei geni hub

L'elenco genico consensuale è stato inviato al database STRING, selezionando Homo sapiens come specie e una soglia di confidenza dell'interazione > 0,413. Il file delle interazioni è stato importato in Cytoscape e il plug-in CytoHubba è stato utilizzato per ordinare i geni in base al grado del nodo. I geni altamente connessi sono stati definiti geni hub.

6. Selezione di geni caratteristici diagnostici mediante apprendimento automatico

Sono stati applicati tre algoritmi indipendenti di selezione delle caratteristiche. In primo luogo, è stata eseguita una regressione logistica con operatore di riduzione e selezione della norma L1 utilizzando il pacchetto glmnet e una validazione incrociata a 10 ripetizioni, al fine di identificare i geni con coefficienti diversi da zero14. In secondo luogo, è stata applicata l'eliminazione ricorsiva delle caratteristiche mediante macchine a vettori di supporto per rimuovere le caratteristiche ridondanti e selezionare il sottoinsieme di caratteristiche che ha ottenuto la massima accuratezza nella validazione incrociata15. In terzo luogo, è stato costruito un modello di foresta casuale e le caratteristiche sono state ordinate in base alla riduzione media dell'impurità di Gini16. L'intersezione degli insiemi di geni ottenuti dai tre algoritmi è stata utilizzata per definire l'insieme finale dei geni caratteristici principali. Il pacchetto pROC è stato utilizzato per generare le curve caratteristiche operative del ricevitore e calcolare i valori dell'area sotto la curva17.

7. Validazione dei geni fondamentali mediante set di dati indipendenti in bulk e singola cellula

GSE117261 è stato utilizzato come coorte esterna indipendente di validazione su tessuto polmonare, contenente 58 campioni di ipertensione arteriosa polmonare (PAH) e 25 campioni di controllo da donatori non idonei18Questo set di dati non è stato utilizzato nell'analisi differenziale di espressione per la scoperta, nella costruzione della rete di co-espressione genica pesata o nella selezione delle caratteristiche mediante apprendimento automatico. La matrice di espressione è stata normalizzata e annotata, e l'espressione differenziale è stata analizzata utilizzando limma v3.68.0. È stata applicata la correzione del tasso di falsa scoperta di Benjamini-Hochberg sull'intero trascrittoma annotato. Le curve ROC (caratteristica operativa del ricevitore) per singolo gene sono state calcolate utilizzando pROC v1.19.0.1, intervalli di confidenza al 95% di DeLong e soglie basate sull'indice di Youden. È stato costruito un modello esplorativo di regressione logistica a cinque geni all'interno di GSE117261, e le sue prestazioni interne sono state ulteriormente valutate mediante validazione incrociata annidata ripetuta.

GSE210248 (Tabella 1) è stato utilizzato come dataset di validazione singola cellula dell'arteria polmonare contenente campioni di tre pazienti con ipertensione arteriosa polmonare (PAH) e di tre donatori sani19. I dati sono stati elaborati utilizzando Seurat v5.5.1 per il controllo di qualità, la normalizzazione, la riduzione della dimensionalità, il clustering e l'annotazione cellulare20. Sono state identificate le principali popolazioni cellulari, inclusi cellule endoteliali, cellule muscolari lisce, fibroblasti, monociti/macrophagi e cellule T/cellule natural killer. La comunicazione intercellulare è stata analizzata utilizzando CellChat v2.1.2 e il database di ligandi-recettori CellChatDB.human21. È stato creato un oggetto CellChat a partire dalla matrice di espressione normalizzata di Seurat e dai metadati relativi ai tipi cellulari. Sono stati identificati geni sovraespressi e interazioni ligando-recettore; sono state calcolate le probabilità di comunicazione; sono state eliminate le interazioni che coinvolgevano gruppi cellulari con meno di 10 cellule; e sono state inferite e aggregate reti di comunicazione a livello di pathway. Questo dataset è stato utilizzato esclusivamente per la validazione meccanicistica esterna e non per l'addestramento del modello.

ElementoDescrizione
DatasetGSE210248
Tipo di datiSequenziamento dell'RNA monocellulare basato su goccioline 10x Genomics; profilazione trascrittomica ad alto rendimento
Campioni umaniTre campioni di arteria polmonare da pazienti con ipertensione arteriosa polmonare (PAH) e tre campioni di arteria polmonare da donatori sani
Origine del tessutoTessuto arterioso polmonare ex vivo, che riflette principalmente l'ecologia cellulare della parete vascolare polmonare e il processo di rimodellamento vascolare
Scopo principale dell'analisiLocalizzazione dei tipi cellulari, transizione fenotipica delle cellule muscolari lisce, comunicazione tra cellule immunitarie e strutturali, e validazione della coerenza meccanicistica dei geni candidati

Tabella 1: Informazioni di base per il set di dati di convalida single-cell GSE210248. La tabella riassume l'accession del set di dati, la piattaforma di sequenziamento, la fonte del tessuto, la composizione del campione e lo scopo analitico dell'analisi di convalida single-cell dell'arteria polmonare.

8. Validazione dell'espressione genica mediante qRT-PCR

La validazione mediante qRT-PCR ha incluso 20 campioni di tessuto polmonare da pazienti con ipertensione polmonare/ipertensione arteriosa polmonare (PAH), biologicamente indipendenti, e 20 campioni di controllo di tessuto polmonare, altrettanto biologicamente indipendenti. L'RNA totale è stato estratto utilizzando il Kit per l'estrazione di RNA totale. La concentrazione e la purezza dell'RNA sono state valutate mediante spettrofotometro, mentre l'integrità dell'RNA è stata verificata tramite elettroforesi su gel di agarosio. Sono stati inclusi soltanto campioni di RNA con valori A260/280 compresi tra 1,8 e 2,1 e privi di degradazione visibile.

Quantità uguali di RNA sono state retrotrascritte in DNA complementare utilizzando il kit Solarbio Universal RT-PCR (AMV; numero di catalogo RP1200). La PCR quantitativa per CXCL10, JUN, IFIH1, MX1 e TLR7 è stata eseguita utilizzando il SYBR Green PCR Master Mix su un sistema di PCR in tempo reale. Ogni campione biologico è stato analizzato in tre replicati tecnici, insieme a controlli senza stampo e senza retrotrascrizione. Il valore medio di Ct dei tre replicati tecnici è stato utilizzato per l'analisi successiva; i replicati tecnici non sono stati considerati osservazioni indipendenti. Sono stati utilizzati primer che attraversano i giunti esone-esone e producono ampliconi di 80–200 bp (Tabella 2). La specificità dei primer è stata verificata mediante l'analisi NCBI Primer-BLAST e l'analisi della curva di denaturazione22.

β-actina (ACTB) è stata utilizzata come gene di riferimento interno per normalizzare i livelli di espressione dei geni bersaglio. L'espressione relativa è stata calcolata utilizzando il metodo 2-ΔΔCt23. Per i confronti tra gruppi, in base alla distribuzione dei dati, sono stati utilizzati test U di Mann-Whitney a due code, e la correzione del tasso di falsa scoperta di Benjamini-Hochberg è stata applicata su tutti e cinque i geni. Sono state generate curve ROC per singolo gene con intervalli di confidenza al 95% di DeLong, e le soglie ottimali sono state selezionate utilizzando l'indice di Youden. Il modello di regressione logistica a cinque geni è stato inizialmente adattato e valutato sugli stessi 40 campioni biologici; questa stima è stata pertanto definita come prestazione apparente all'interno del campione. Per valutare un potenziale overfitting, sono state effettuate 100 ripetizioni di una cross-validation stratificata a cinque fold utilizzando un modello di regressione logistica regolarizzato con L2, e la prestazione ROC aggregata fuori-fold è stata calcolata.

GeneAccesso RefSeqPrimer diretto (5′–3′)Primer inverso (5′–3′)Dimensione del prodotto (bp)Tm (°C)Attraversamento di esoni
CXCL10NM_001565.4GTCAAGCCAT
AATTGTTC
ATAGTGCCAG
GGTAGAGT
14146.1Sì
JUNNM_002228.4ACAAGTGGCA
GAGTCCCG
CGCCCAAGTT
CAACAACC
15254.5Sì
IFIH1NM_022168GCACAGAGCG
GTAGACCCT
GCCCTGAAGC
ACGAGATG
18254.7Sì
MX1NM_002462.5TTAGCCGTGG
TGATTTAGC
CAAGGTGGAG
CGATTCTG
15652.3Sì
TLR7NM_016562.4ATTGCCCTCGT
TGTTATA
TTCCTGGAGTT
TGTTGAT
17948.1Sì
ACTBNM_001101.3CTCACCATGGAT
GATGATATCGC
AGGAATCCTTCT
GACCCATGC
19456.2Sì

Tabella 2: Sequenze dei primer utilizzate per la PCR quantitativa di retrotrascrizione. La tabella elenca i geni bersaglio, i numeri di accesso RefSeq, le sequenze dei primer forward e reverse, le dimensioni dei prodotti, le temperature di fusione e lo stato di attraversamento degli esoni dei primer utilizzati per la qRT-PCR.

9. Screening di composti candidati e docking molecolare

Le firme geniche centrali upregolate e downregolate sono state sottoposte al database Connectivity Map per identificare piccole molecole predette per invertire il profilo di espressione associato alla PH7. I candidati sono stati classificati in base al punteggio Logit e alla probabilità di previsione.

La struttura tridimensionale del BRD-K91900765/VX-745 è stata ottenuta da PubChem con il codice CID 303852524. Le informazioni farmacologiche relative al composto sono state raccolte da database pubblici di farmaci, mentre i descrittori strutturali sono stati calcolati utilizzando DrugBank e SwissADME25,26. Le strutture proteiche sono state ottenute dalla RCSB Protein Data Bank utilizzando i seguenti identificatori PDB: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; e MAPK14/p38α, 1OUK27. La rilevazione cieca delle cavità e il docking molecolare sono stati eseguiti utilizzando CB-Dock2 v2.0 con il motore di punteggio AutoDock Vina v1.2.028,29. I file della proteina e del ligando sono stati caricati su CB-Dock2, le cavità candidate sono state rilevate automaticamente e il docking è stato effettuato all'interno delle box specifiche per ciascuna cavità generate dal server. Per ogni proteina sono stati registrati l'identificatore della cavità, il punteggio Vina, il volume della cavità, il centro della box di docking, le dimensioni della box di docking e il file del complesso proteina-ligando. La conformazione con il punteggio Vina più negativo è stata selezionata come la previsione di conformazione principale. MAPK14/p38α è stata inclusa come bersaglio farmacologico accertato e proteina di riferimento positivo per il docking di VX-745. Il docking contro CXCL10, JUN, IFIH1, MX1 e TLR7 è stato di tipo esplorativo e non è stato interpretato come evidenza di un targeting farmacologico diretto, legame, inibizione o efficacia.

10. Analisi statistica e controllo della riproducibilità

Tutte le analisi statistiche sono state eseguite in R, salvo diversamente specificato. I valori di P a due code < 0,05 sono stati considerati statisticamente significativi. È stata applicata la correzione per confronti multipli alle analisi di espressione differenziale, arricchimento, validazione esterna e qRT-PCR come specificato in precedenza. È stata utilizzata la validazione incrociata per valutare la stabilità dei modelli di apprendimento automatico e combinati di qRT-PCR.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Preelaborazione dei dati transcriptomici pubblici e identificazione dei geni differenzialmente espressi

L'integrazione e la correzione con ComBat dei dataset GSE22356, GSE33463 e GSE48149 hanno ridotto le differenze sistematiche tra i set di dati. I boxplot hanno mostrato che le distribuzioni dell'espressione campionaria sono diventate più coerenti dopo la correzione. L'analisi delle componenti principali ha indicato che i campioni si raggruppavano principalmente in base alla ...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

È stato sviluppato un flusso di lavoro integrato e riproducibile per identificare biomarcatori molecolari associati all'ipertensione polmonare (PH/PAH) e composti terapeutici candidati, combinando trascrittomica pubblica, analisi della rete di co-espressione genica pesata, arricchimento funzionale, analisi della rete di interazione proteina-proteina, tre algoritmi di apprendimento automatico, validazione esterna, interpretazione trascrittomica a singola cellula, conferma mediante PCR quantitativa a retrotrascrizione, scr...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori dichiarano di non avere interessi concorrenti.

Ringraziamenti

Questo studio è stato sostenuto dal progetto di costruzione della provincia innovativa di Hunan (n. 2022JJ30465).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
2× SYBR Green PCR MastermixBeijing Solarbio Science & Technology Co., Ltd.Catalog no. SR1110Amplificazione PCR quantitativa in tempo reale basata su colorante e rilevamento della fluorescenza
AI21.msvmRFE.R e e1071Script R personalizzato con il pacchetto CRAN e1071AI21.msvmRFE.R; e1071 v1.7-17Eliminazione ricorsiva delle caratteristiche mediante macchina a vettori di supporto
AgarosioBeijing Solarbio Science & Technology Co., Ltd.Catalog no. A8201; CAS 9012-36-6Valutazione dell'integrità dell'RNA totale mediante elettroforesi su gel di agarosio
Apparecchiatura per elettroforesi su gel di agarosioBeijing Liuyi Biotechnology Co., Ltd.Modello DYCZ-24DNValutazione elettroforetica dell'integrità dell'RNA
Motore di punteggio AutoDock VinaCenter for Computational Structural Biology, Scripps Researchv1.2.0; RRID: SCR_011958Valutazione della posa del legame proteina-ligando all'interno del flusso di lavoro CB-Dock2
CB-Dock2Cao Laboratory, server web CB-Dock2v2.0; accesso luglio 2026Rilevamento cieco delle cavità e docking molecolare di VX-745 con le strutture proteiche selezionate
CellChatPacchetto R CellChatv2.1.2Inferenza e visualizzazione della comunicazione tra cellule a partire dalla matrice di espressione monocellulare
CellChatDB.humanDistribuito con il pacchetto R CellChatCellChatDB.human; sottoinsieme di segnalazione secreta; soglia minima di cellule = 10Database umano di interazioni ligando-recettore per CellChat
clusterProfilerPacchetto R Bioconductorv4.20.0; rilascio Bioconductor 3.23Analisi di arricchimento per Gene Ontology e Kyoto Encyclopedia of Genes and Genomes
Connectivity Map (CMap/CLUE)Broad InstituteRisorsa L1000/CLUE; RRID: SCR_016204; accesso luglio 2026Analisi computazionale per il riposizionamento dei farmaci
Primer oligonucleotidici personalizzatiBeijing Solarbio Science & Technology Co., Ltd.Sintetizzati su misura; sequenze dei primer fornite nella Tabella 2Amplificazione di ACTB, CXCL10, JUN, IFIH1, MX1 e TLR7
cytoHubbaNegozio di app per Cytoscapev0.1Classificazione dei geni centrali (hub) basata sul grado nella rete di interazione proteina-proteina
CytoscapeConsorzio Cytoscapev3.10.4; RRID: SCR_003032Visualizzazione e analisi della rete di interazione proteina-proteina
DrugBankDatabase DrugBankv6.0; RRID: SCR_002700Cura delle informazioni sull'identità del composto e sulle proprietà farmacologiche
Sistema di documentazione elettroforeticaBeijing Liuyi Biotechnology Co., Ltd.Modello WO-9413BVisualizzazione e registrazione dei risultati dell'integrità dell'RNA su gel di agarosio
Gene Expression Omnibus (GEO)National Center for Biotechnology InformationGSE22356, GSE33463, GSE48149, GSE117261 e GSE210248; RRID: SCR_005012Recupero di dataset trascrittomici bulk e monocellulari
GEOqueryPacchetto R Bioconductorv2.80.0; rilascio Bioconductor 3.23Download e importazione automatizzati dei dati di espressione e fenotipici da GEO
glmnetPacchetto R CRANv5.0Regressione logistica con operatore di riduzione e selezione assoluta (lasso) e modellizzazione logistica regolarizzata
limmaPacchetto R Bioconductorv3.68.0; rilascio Bioconductor 3.23; RRID: SCR_010943Analisi dell'espressione differenziale e statistiche bayesiane empiriche
Spettrofotometro NanoDropThermo Fisher ScientificNanoDrop ND-1000; software v3.8Misurazione della concentrazione dell'RNA e dei rapporti di purezza A260/280 e A260/230
NCBI Primer-BLASTNational Center for Biotechnology InformationStrumento web; RRID: SCR_003095; accesso luglio 2026Verifica della specificità dei primer
pROCPacchetto R CRANv1.19.0.1; RRID: SCR_024286Analisi della caratteristica operativa del ricevitore (ROC), intervalli di confidenza di DeLong e soglie basate sull'indice di Youden
Protein Data Bank (PDB)RCSB Protein Data BankCXCL10: 1LV9; JUN: 1JUN; IFIH1: 3B6E; MX1: 5GTM; TLR7: 7CYN; MAPK14/p38α: 1OUK; RRID: SCR_012820Recupero di strutture proteiche determinate sperimentalmente per il docking molecolare
PubChemNational Center for Biotechnology InformationPubChem CID 3038525; RRID: SCR_004284Recupero della struttura tridimensionale e degli identificatori chimici di BRD-K91900765/VX-745
RR Foundation for Statistical Computingv4.6.1; RRID: SCR_001905Calcolo statistico, elaborazione dei dati, apprendimento automatico e visualizzazione
randomForestPacchetto R CRANv4.7-1.2Selezione delle caratteristiche e classificazione dell'importanza delle variabili mediante foresta casuale
Sistema di PCR in tempo realeStratagene, ora Agilent TechnologiesMx3000P Real-Time PCR SystemAmplificazione qRT-PCR, acquisizione della fluorescenza, analisi della curva di denaturazione ed esportazione dei valori Ct
SeuratPacchetto R CRAN; Satija Laboratoryv5.5.1; RRID: SCR_016341Controllo di qualità, normalizzazione, riduzione della dimensionalità, raggruppamento e annotazione dei dati di sequenziamento dell'RNA monocellulare
STRINGConsorzio STRINGv12.0; RRID: SCR_005223Costruzione della rete di interazione proteina-proteina
sva (ComBat)Pacchetto R Bioconductorv3.60.0; rilascio Bioconductor 3.23Correzione degli effetti di lotto tra dataset
SwissADMEIstituto Svizzero di BioinformaticaServer web; accesso luglio 2026Prevalutazione di somiglianza ai farmaci, proprietà fisico-chimiche e ADME
Kit per l'estrazione di RNA totaleBeijing Solarbio Science & Technology Co., Ltd.Catalog no. R1200Estrazione e purificazione dell'RNA totale da campioni di tessuto polmonare
Kit RT-PCR Universale (AMV)Beijing Solarbio Science & Technology Co., Ltd.Catalog no. RP1200Trascrizione inversa dell'RNA totale in DNA complementare
WGCNAPacchetto R CRANv1.74Costruzione della rete di co-espressione genica pesata e analisi dei moduli in relazione ai tratti

Riferimenti

  1. Simonneau G, et al. Haemodynamic definitions and updated clinical classification of pulmonary hypertension. Eur Respir J. 2019;53(1):1801913. doi: 10.1183/13993003.01913-2018.
  2. Rabinovitch M, Guignabert C, Humbert M, Nicolls MR. Inflammation and immunity in the pathogenesis of pulmonary arterial hypertension. Circ Res. 2014;115(1):165–175.
  3. Humbert M, et al. 2022 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Heart J. 2022;43(38):3618–3731.
  4. Galiè N, et al. 2015 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Respir J. 2015;46(4):903–975.
  5. Soon E, et al. Elevated levels of inflammatory cytokines predict survival in idiopathic and familial pulmonary arterial hypertension. Circulation. 2010;122(9):920–927.
  6. George PM, et al. Evidence for the involvement of type I interferon in pulmonary arterial hypertension. Circ Res. 2014;114(4):677–688.
  7. Subramanian A, et al. A next-generation Connectivity Map: L1000 platform and the first 1,000,000 profiles. Cell. 2017;171(6):1437–1452.e17.
  8. Leek JT, et al. The sva package for removing batch effects and other unwanted variation in high-throughput experiments. Bioinformatics. 2012;28(6):882–883.
  9. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47. doi: 10.1093/nar/gkv007.
  10. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559. doi: 10.1186/1471-2105-9-559.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–287.
  12. Kanehisa M, Goto S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 2000;28(1):27–30.
  13. Szklarczyk D, et al. The STRING database in protein–protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638–D646.
  14. Friedman J, Hastie T, Tibshirani R. Regularization paths for generalized linear models via coordinate descent. J Stat Softw. 2010;33(1):1–22.
  15. Guyon I, Weston J, Barnhill S, Vapnik V. Gene selection for cancer classification using support vector machines. Mach Learn. 2002;46:389–422.
  16. Breiman L. Random forests. Mach Learn. 2001;45(1):5–32.
  17. Robin X, et al. pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics. 2011;12:77. doi: 10.1186/s12859-011-0077-8.
  18. Stearman RS, et al. Systems analysis of the human pulmonary arterial hypertension lung transcriptome. Am J Respir Cell Mol Biol. 2019;60(6):637–649.
  19. Crnkovic S, et al. Single-cell transcriptomics reveals skewed cellular communication and phenotypic shift in pulmonary artery remodeling. JCI Insight. 2022;7(20):e153471. doi: 10.1172/jci.insight.153471.
  20. Hao Y, et al. Integrated analysis of multimodal single-cell data. Cell. 2021;184(13):3573–3587.e29.
  21. Jin S, et al. Inference and analysis of cell–cell communication using CellChat. Nat Commun. 2021;12(1):1088. doi: 10.1038/s41467-021-21246-9.
  22. Bustin SA, et al. MIQE 2.0: revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments guidelines. Clin Chem. 2025;71(6):634–651.
  23. Livak KJ, Schmittgen TD. Analysis of relative gene expression data using real-time quantitative PCR and the 2−ΔΔCt method. Methods. 2001;25(4):402–408.
  24. Kim S, et al. PubChem 2023 update. Nucleic Acids Res. 2023;51(D1):D1373–D1380.
  25. Knox C, et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res. 2024;52(D1):D1265–D1275.
  26. Daina A, Michielin O, Zoete V. SwissADME: a free web tool to evaluate pharmacokinetics, drug-likeness, and medicinal chemistry friendliness of small molecules. Sci Rep. 2017;7:42717. doi: 10.1038/srep42717.
  27. Burley SK, et al. RCSB Protein Data Bank: powerful new tools for exploring 3D structures of biological macromolecules for basic and applied research and education. Nucleic Acids Res. 2021;49(D1):D437–D451. doi: 10.1093/nar/gkaa1038.
  28. Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: new docking methods, expanded force field, and Python bindings. J Chem Inf Model. 2021;61(8):3891–3898. doi: 10.1021/acs.jcim.1c00203.
  29. Liu Y, et al. CB-Dock2: improved protein-ligand blind docking by integrating cavity detection, docking, and homologous template fitting. Nucleic Acids Res. 2022;50(W1):W159–W164. doi: 10.1093/nar/gkac394.
  30. Duffy JP, et al. The discovery of VX-745: a novel and selective p38α kinase inhibitor. ACS Med Chem Lett. 2011;2(10):758–763.
  31. Sheng Y, et al. Crocin inhibits neutrophil migration and activation to treat hypoxic pulmonary hypertension through targeting HCK. Phytomedicine. 2025;148:157334. doi: 10.1016/j.phymed.2025.157334.
  32. Cui H, et al. Leonurine ameliorates hypoxic pulmonary hypertension by inhibiting cross-talk between neutrophils and endothelial cells via SERPINB3 targeting. Int Immunopharmacol. 2026;176:116467. doi: 10.1016/j.intimp.2026.116467.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Identificazione dei biomarcatoridati trascrittomiciespressione differenzialeco-espressione genicarete di interazione proteicasequenziamento dell'RNA a singola cellulariposizionamento dei farmaciPCR quantitativa