I set di dati pubblici del Gene Expression Omnibus (GEO) analizzati in questo studio contenevano dati trascrittomici anonimi provenienti da studi precedentemente pubblicati e non richiedevano ulteriore approvazione etica. Il comitato etico dell'Università di Huaihua ha approvato lo studio indipendente di validazione mediante PCR quantitativa a retrotrascrizione inversa (qRT-PCR) su tessuti polmonari umani (numero di approvazione: 2024(A05112)). Il consenso informato scritto è stato ottenuto da tutti i partecipanti o dai loro rappresentanti legalmente autorizzati prima della raccolta dei campioni. Le procedure di approvazione e consenso si sono applicate a tutti i 20 campioni di tessuto polmonare provenienti da pazienti con ipertensione arteriosa polmonare (PAH) e ai 20 campioni di controllo inclusi nella validazione mediante qRT-PCR. Gli strumenti di ricerca utilizzati per questo protocollo sono elencati nella Tabella dei materiali.
1. Raccolta e preelaborazione di dataset trascrittomici pubblici
I set di dati microarray relativi all'ipertensione polmonare (PH) GSE22356, GSE33463 e GSE48149 sono stati ottenuti dal database GEO. I campioni di PH/ipertensione arteriosa polmonare (PAH) e i campioni di controllo sono stati estratti in base alle annotazioni fenotipiche originali. Le matrici di espressione e i file di annotazione della piattaforma sono stati scaricati utilizzando script R riproducibili e il pacchetto GEOquery.
L'annotazione delle sonde e l'associazione ai simboli genici sono state eseguite in modo coerente tra i diversi set di dati. Quando più sonde corrispondevano allo stesso gene, è stato calcolato il valore medio di espressione. È stata applicata la normalizzazione quantile e sono stati rimossi i geni con espressione bassa o varianza ridotta. I set di dati sono stati uniti e gli effetti di batch sono stati corretti utilizzando l'algoritmo ComBat nel pacchetto sva8. La correzione è stata valutata mediante boxplot e analisi delle componenti principali.
2. Identificazione dei geni differenzialmente espressi
Il pacchetto limma è stato utilizzato per confrontare i livelli di espressione tra campioni di PH e controlli nella matrice di espressione corretta per il batch9. È stato adattato un modello lineare e sono state applicate statistiche bayesiane empiriche. I geni differenzialmente espressi sono stati definiti utilizzando un valore di P corretto <0,05 e un cambio di fold log2 assoluto > 0,585. I risultati sono stati visualizzati mediante plot a vulcano e mappe termiche.
3. Costruzione della rete di co-espressione genica pesata
È stata costruita una rete di co-espressione genica pesata utilizzando il pacchetto WGCNA10. È stata eseguita la clusterizzazione dei campioni per rilevare valori anomali. La potenza di soglia morbida è stata scelta in base all'indice di adattamento alla topologia senza scala. I moduli genici sono stati identificati utilizzando l'algoritmo di taglio dinamico dell'albero. Gli eigengeni dei moduli sono stati correlati al fenotipo di ipertensione polmonare (PH), e il modulo associato alla malattia con la correlazione più forte è stato selezionato. I geni nel modulo chiave sono stati incrociati con i geni differenzialmente espressi per ottenere i geni in consenso.
4. Analisi del riparrimento funzionale
Le categorie del processo biologico, della componente cellulare e della funzione molecolare della Gene Ontology sono state analizzate utilizzando clusterProfiler11. È stata eseguita un'analisi di arricchimento dei percorsi della Kyoto Encyclopedia of Genes and Genomes per identificare i percorsi di segnalazione12. Sono stati utilizzati un valore di P < 0,05 e un valore di q < 0,2 come soglie di arricchimento, e i termini arricchiti sono stati visualizzati mediante grafici a bolle11.
5. Costruzione della rete di interazione proteina-proteina e identificazione dei geni hub
L'elenco genico consensuale è stato inviato al database STRING, selezionando Homo sapiens come specie e una soglia di confidenza dell'interazione > 0,413. Il file delle interazioni è stato importato in Cytoscape e il plug-in CytoHubba è stato utilizzato per ordinare i geni in base al grado del nodo. I geni altamente connessi sono stati definiti geni hub.
6. Selezione di geni caratteristici diagnostici mediante apprendimento automatico
Sono stati applicati tre algoritmi indipendenti di selezione delle caratteristiche. In primo luogo, è stata eseguita una regressione logistica con operatore di riduzione e selezione della norma L1 utilizzando il pacchetto glmnet e una validazione incrociata a 10 ripetizioni, al fine di identificare i geni con coefficienti diversi da zero14. In secondo luogo, è stata applicata l'eliminazione ricorsiva delle caratteristiche mediante macchine a vettori di supporto per rimuovere le caratteristiche ridondanti e selezionare il sottoinsieme di caratteristiche che ha ottenuto la massima accuratezza nella validazione incrociata15. In terzo luogo, è stato costruito un modello di foresta casuale e le caratteristiche sono state ordinate in base alla riduzione media dell'impurità di Gini16. L'intersezione degli insiemi di geni ottenuti dai tre algoritmi è stata utilizzata per definire l'insieme finale dei geni caratteristici principali. Il pacchetto pROC è stato utilizzato per generare le curve caratteristiche operative del ricevitore e calcolare i valori dell'area sotto la curva17.
7. Validazione dei geni fondamentali mediante set di dati indipendenti in bulk e singola cellula
GSE117261 è stato utilizzato come coorte esterna indipendente di validazione su tessuto polmonare, contenente 58 campioni di ipertensione arteriosa polmonare (PAH) e 25 campioni di controllo da donatori non idonei18Questo set di dati non è stato utilizzato nell'analisi differenziale di espressione per la scoperta, nella costruzione della rete di co-espressione genica pesata o nella selezione delle caratteristiche mediante apprendimento automatico. La matrice di espressione è stata normalizzata e annotata, e l'espressione differenziale è stata analizzata utilizzando limma v3.68.0. È stata applicata la correzione del tasso di falsa scoperta di Benjamini-Hochberg sull'intero trascrittoma annotato. Le curve ROC (caratteristica operativa del ricevitore) per singolo gene sono state calcolate utilizzando pROC v1.19.0.1, intervalli di confidenza al 95% di DeLong e soglie basate sull'indice di Youden. È stato costruito un modello esplorativo di regressione logistica a cinque geni all'interno di GSE117261, e le sue prestazioni interne sono state ulteriormente valutate mediante validazione incrociata annidata ripetuta.
GSE210248 (Tabella 1) è stato utilizzato come dataset di validazione singola cellula dell'arteria polmonare contenente campioni di tre pazienti con ipertensione arteriosa polmonare (PAH) e di tre donatori sani19. I dati sono stati elaborati utilizzando Seurat v5.5.1 per il controllo di qualità, la normalizzazione, la riduzione della dimensionalità, il clustering e l'annotazione cellulare20. Sono state identificate le principali popolazioni cellulari, inclusi cellule endoteliali, cellule muscolari lisce, fibroblasti, monociti/macrophagi e cellule T/cellule natural killer. La comunicazione intercellulare è stata analizzata utilizzando CellChat v2.1.2 e il database di ligandi-recettori CellChatDB.human21. È stato creato un oggetto CellChat a partire dalla matrice di espressione normalizzata di Seurat e dai metadati relativi ai tipi cellulari. Sono stati identificati geni sovraespressi e interazioni ligando-recettore; sono state calcolate le probabilità di comunicazione; sono state eliminate le interazioni che coinvolgevano gruppi cellulari con meno di 10 cellule; e sono state inferite e aggregate reti di comunicazione a livello di pathway. Questo dataset è stato utilizzato esclusivamente per la validazione meccanicistica esterna e non per l'addestramento del modello.
| Elemento | Descrizione |
| Dataset | GSE210248 |
| Tipo di dati | Sequenziamento dell'RNA monocellulare basato su goccioline 10x Genomics; profilazione trascrittomica ad alto rendimento |
| Campioni umani | Tre campioni di arteria polmonare da pazienti con ipertensione arteriosa polmonare (PAH) e tre campioni di arteria polmonare da donatori sani |
| Origine del tessuto | Tessuto arterioso polmonare ex vivo, che riflette principalmente l'ecologia cellulare della parete vascolare polmonare e il processo di rimodellamento vascolare |
| Scopo principale dell'analisi | Localizzazione dei tipi cellulari, transizione fenotipica delle cellule muscolari lisce, comunicazione tra cellule immunitarie e strutturali, e validazione della coerenza meccanicistica dei geni candidati |
Tabella 1: Informazioni di base per il set di dati di convalida single-cell GSE210248. La tabella riassume l'accession del set di dati, la piattaforma di sequenziamento, la fonte del tessuto, la composizione del campione e lo scopo analitico dell'analisi di convalida single-cell dell'arteria polmonare.
8. Validazione dell'espressione genica mediante qRT-PCR
La validazione mediante qRT-PCR ha incluso 20 campioni di tessuto polmonare da pazienti con ipertensione polmonare/ipertensione arteriosa polmonare (PAH), biologicamente indipendenti, e 20 campioni di controllo di tessuto polmonare, altrettanto biologicamente indipendenti. L'RNA totale è stato estratto utilizzando il Kit per l'estrazione di RNA totale. La concentrazione e la purezza dell'RNA sono state valutate mediante spettrofotometro, mentre l'integrità dell'RNA è stata verificata tramite elettroforesi su gel di agarosio. Sono stati inclusi soltanto campioni di RNA con valori A260/280 compresi tra 1,8 e 2,1 e privi di degradazione visibile.
Quantità uguali di RNA sono state retrotrascritte in DNA complementare utilizzando il kit Solarbio Universal RT-PCR (AMV; numero di catalogo RP1200). La PCR quantitativa per CXCL10, JUN, IFIH1, MX1 e TLR7 è stata eseguita utilizzando il SYBR Green PCR Master Mix su un sistema di PCR in tempo reale. Ogni campione biologico è stato analizzato in tre replicati tecnici, insieme a controlli senza stampo e senza retrotrascrizione. Il valore medio di Ct dei tre replicati tecnici è stato utilizzato per l'analisi successiva; i replicati tecnici non sono stati considerati osservazioni indipendenti. Sono stati utilizzati primer che attraversano i giunti esone-esone e producono ampliconi di 80–200 bp (Tabella 2). La specificità dei primer è stata verificata mediante l'analisi NCBI Primer-BLAST e l'analisi della curva di denaturazione22.
β-actina (ACTB) è stata utilizzata come gene di riferimento interno per normalizzare i livelli di espressione dei geni bersaglio. L'espressione relativa è stata calcolata utilizzando il metodo 2-ΔΔCt23. Per i confronti tra gruppi, in base alla distribuzione dei dati, sono stati utilizzati test U di Mann-Whitney a due code, e la correzione del tasso di falsa scoperta di Benjamini-Hochberg è stata applicata su tutti e cinque i geni. Sono state generate curve ROC per singolo gene con intervalli di confidenza al 95% di DeLong, e le soglie ottimali sono state selezionate utilizzando l'indice di Youden. Il modello di regressione logistica a cinque geni è stato inizialmente adattato e valutato sugli stessi 40 campioni biologici; questa stima è stata pertanto definita come prestazione apparente all'interno del campione. Per valutare un potenziale overfitting, sono state effettuate 100 ripetizioni di una cross-validation stratificata a cinque fold utilizzando un modello di regressione logistica regolarizzato con L2, e la prestazione ROC aggregata fuori-fold è stata calcolata.
| Gene | Accesso RefSeq | Primer diretto (5′–3′) | Primer inverso (5′–3′) | Dimensione del prodotto (bp) | Tm (°C) | Attraversamento di esoni |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Sì |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Sì |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Sì |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Sì |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Sì |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Sì |
Tabella 2: Sequenze dei primer utilizzate per la PCR quantitativa di retrotrascrizione. La tabella elenca i geni bersaglio, i numeri di accesso RefSeq, le sequenze dei primer forward e reverse, le dimensioni dei prodotti, le temperature di fusione e lo stato di attraversamento degli esoni dei primer utilizzati per la qRT-PCR.
9. Screening di composti candidati e docking molecolare
Le firme geniche centrali upregolate e downregolate sono state sottoposte al database Connectivity Map per identificare piccole molecole predette per invertire il profilo di espressione associato alla PH7. I candidati sono stati classificati in base al punteggio Logit e alla probabilità di previsione.
La struttura tridimensionale del BRD-K91900765/VX-745 è stata ottenuta da PubChem con il codice CID 303852524. Le informazioni farmacologiche relative al composto sono state raccolte da database pubblici di farmaci, mentre i descrittori strutturali sono stati calcolati utilizzando DrugBank e SwissADME25,26. Le strutture proteiche sono state ottenute dalla RCSB Protein Data Bank utilizzando i seguenti identificatori PDB: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; e MAPK14/p38α, 1OUK27. La rilevazione cieca delle cavità e il docking molecolare sono stati eseguiti utilizzando CB-Dock2 v2.0 con il motore di punteggio AutoDock Vina v1.2.028,29. I file della proteina e del ligando sono stati caricati su CB-Dock2, le cavità candidate sono state rilevate automaticamente e il docking è stato effettuato all'interno delle box specifiche per ciascuna cavità generate dal server. Per ogni proteina sono stati registrati l'identificatore della cavità, il punteggio Vina, il volume della cavità, il centro della box di docking, le dimensioni della box di docking e il file del complesso proteina-ligando. La conformazione con il punteggio Vina più negativo è stata selezionata come la previsione di conformazione principale. MAPK14/p38α è stata inclusa come bersaglio farmacologico accertato e proteina di riferimento positivo per il docking di VX-745. Il docking contro CXCL10, JUN, IFIH1, MX1 e TLR7 è stato di tipo esplorativo e non è stato interpretato come evidenza di un targeting farmacologico diretto, legame, inibizione o efficacia.
10. Analisi statistica e controllo della riproducibilità
Tutte le analisi statistiche sono state eseguite in R, salvo diversamente specificato. I valori di P a due code < 0,05 sono stati considerati statisticamente significativi. È stata applicata la correzione per confronti multipli alle analisi di espressione differenziale, arricchimento, validazione esterna e qRT-PCR come specificato in precedenza. È stata utilizzata la validazione incrociata per valutare la stabilità dei modelli di apprendimento automatico e combinati di qRT-PCR.