Lo studio è stato condotto in conformità con la Dichiarazione di Helsinki. Il protocollo è stato approvato dal Comitato Etico dell'Anhui Public Health Clinical Center il 19 settembre 2025 (ID approvazione: PJ-YX2025-062). È stato ottenuto un consenso informato scritto da tutti i partecipanti prima del prelievo del sangue. La coorte locale includeva otto pazienti con infarto miocardico acuto (IAM) e otto controlli sani. Gli strumenti di ricerca utilizzati nel protocollo sono elencati nella Tabella dei Materiali.
1. Fonti di dati ed elaborazione
I dataset di sequenziamento di RNA in massa relativi all'infarto miocardico sono stati ottenuti dal Gene Expression Omnibus (GEO). I dataset GSE59867 e GSE48060 sono stati utilizzati per analisi trascristatiche di massa, mentre il dataset di sequenziamento di RNA a GSE269269 singola cellula è stato utilizzato per analisi a livello cellulare (Tabella 1). Un insieme di 255 geni correlati alla calmodulina è stato ottenuto dall'Human Protein Atlas per analisi successive del set genico.
| Dataset | Tipo di campione | Campione (controlli) | Campione (pazienti) | Piattaforma di sequenziamento |
| GSE59867 | RNA-seq di fascia | 46 | 111 | GPL6244 |
| GSE48060 | RNA-seq di fascia | 21 | 31 | GPL570 |
| GSE269269 | scRNA-seq (sangue periferico) | | 10 | GPL24676 |
Tabella 1: Caratteristiche dei dataset utilizzati nello studio. La tabella elenca i numeri di accessione al dataset, i tipi di campioni, il numero di campioni di controllo e di pazienti, e le piattaforme di sequenziamento per i dataset di sequenziamento di RNA in blocco e RNA a cellula singola. RNA-seq, sequenziamento RNA; scRNA-seq, sequenziamento dell'RNA a singola cellula.
La variabilità intercampione nei dataset trascrittomici di massa è stata corretta utilizzando la funzione normalizeBetweenArrays nel pacchetto limma, versione 3.60.6. Successivamente è stata eseguita un'analisi differenziale dell'espressione genica utilizzando limma. I geni espressi differenzialmente (DEG) sono stati definiti usando le soglie P < 0,05 e |log₂ cambiamento di piegatura| > 0,5. I DEG risultanti sono stati visualizzati utilizzando grafici vulcanici e heatmap e classificati come significativamente al rialzo, significativamente al ribasso o non significativamente modificati.
2. Analisi dell'arricchimento del set genico a campione singolo e analisi della rete di coespressione genica pesata
L'analisi di arricchimento del set genico a campione singolo (ssGSEA) è stata effettuata utilizzando i 255 geni correlati alla calmodulina. Il pacchetto GSVA veniva utilizzato per calcolare un punteggio genico correlato alla calmodulina, designato Calmodulin_score, per ogni campione AMI e di controllo. Le differenze di Calmodulin_score tra i gruppi AMI e di controllo sono state valutate utilizzando il test di somma dei rangi di Wilcoxon.
L'analisi pesata della rete di co-espressione genica (WGCNA) è stata effettuata utilizzando i dati trascritomici massivi di pazienti con IAM. I geni con un valore medio di frammenti per kilobase di trascrizione per milione di letture mappate di ≤0,5 sono stati esclusi. I campioni sono stati raggruppati per identificare ed eliminare gli outlier.
È stata selezionata una potenza soft-thresholding che ha ottenuto un adattamento topologico senza scala di R² > 0,8. Fu quindi costruita una matrice di sovrapposizione topologica. I moduli genici sono stati identificati utilizzando l'algoritmo dinamico di taglio a albero con una dimensione minima di 200. I moduli con autogeni altamente simili sono stati uniti utilizzando una soglia di correlazione di >0,75, corrispondente a una soglia di fusione moduli di 0,25.
Le relazioni tra autogeni del modulo e tratti clinici, inclusa la Calmodulin_score, sono state valutate tramite analisi di correlazione di Pearson. Le relazioni modulo-tratto risultanti sono state visualizzate in una heatmap annotata con coefficienti di correlazione e corrispondenti valori P. Per ciascun gene sono stati calcolati l'appartenenza ai moduli e il significato genico. Sono stati generati diagrammi a scatter dell'appartenenza ai moduli rispetto alla significanza genica per identificare geni con alta connettività intramodulare e rilevanza per i tratti.
3. Identificazione di geni correlati alla calmodulina associati all'AMI
I geni correlati alla calmodulina associati all'AMI sono stati identificati intersecando i DEG con geni provenienti da moduli WGCNA significativamente correlati con Calmodulin_score. I geni sovrapposti sono stati mantenuti per le analisi a valle.
L'analisi di arricchimento funzionale veniva eseguita utilizzando il pacchetto clusterProster. Gene Ontology e Kyoto Encyclopedia of Genes and Genomes Annotations sono stati utilizzati per identificare processi biologici, funzioni molecolari, componenti cellulari e vie di segnalazione associate ai geni sovrapposti.
4. Identificazione e validazione di geni chiave tramite machine learning
È stata effettuata un'analisi di regressione logistica univariata utilizzando i geni sovrapposti. Tre algoritmi di machine learning sono stati poi applicati indipendentemente utilizzando i seguenti pacchetti e parametri R: foresta casuale, XGBoost e macchina a vettori di supporto.
Ogni algoritmo veniva utilizzato per dare priorità ai geni con valore predittivo per l'AMI. I geni chiave candidati sono stati definiti come i geni identificati da tutti e tre gli algoritmi. I geni che hanno anche mostrato un'espressione differenziale significativa e direzionalmente coerente sia nel dataset di addestramento GSE59867 sia nel dataset di validazione esterna GSE48060 sono stati mantenuti come geni chiave finali.
5. Costruzione e valutazione di modelli diagnostici
È stato costruito un modello di regressione logistica utilizzando i geni chiave identificati e la funzione lrm. Un nomogramma veniva generato utilizzando la funzione regplot per mostrare il contributo di ciascun gene caratteristico alla probabilità prevista di AMI.
La discriminazione del modello è stata valutata tramite analisi delle caratteristiche operative del ricevitore utilizzando il pacchetto pROC. L'area sotto la curva caratteristica operativa del ricevitore è stata calcolata per valutare la capacità del modello di distinguere AMI da campioni di controllo.
Sono state generate curve di calibrazione per confrontare le probabilità previste con gli esiti osservati. È stata effettuata un'analisi della curva decisionale per stimare il beneficio clinico netto del modello su un intervallo di probabilità soglia.
6. Analisi dell'arricchimento dei set genici e costruzione di reti endogene a RNA concorrenti
L'analisi di arricchimento del set genico è stata eseguita separatamente per ciascun gene chiave utilizzando la sua matrice di correlazione genica e il pacchetto clusterProfer. I risultati dell'arricchimento delle vie delle vie della Kyoto Encyclopedia of Genes and Genomes sono stati classificati in base al punteggio assoluto di arricchimento normalizzato. Le cinque vie di grado più alto sono state visualizzate per ciascun gene.
Le associazioni funzionali e le reti di interazione genica sono state esaminate utilizzando GeneMANIA. I potenziali regolatori microRNA dei geni chiave sono stati previsti utilizzando miRanda, miRTarBase, TargetScan e miRDB. Le interazioni candidate microRNA-mRNA sono state identificate intersecando le previsioni provenienti dai quattro database.
Lunghe interazioni RNA-microRNA non codificanti sono state ottenute da spongeScan. Le lunghe relazioni RNA-microRNA e microRNA-mRNA non codificanti sono state quindi integrate per costruire una rete regolatoria endogena concorrente dell'RNA. La rete è stata visualizzata come un diagramma di Sankey utilizzando il pacchetto ggalluviale.
7. Previsione dei farmaci e aggancio molecolare
Le interazioni farmaco-gene sono state previste utilizzando il Drug-Gene Interaction Database. La rete di interazione risultante è stata visualizzata utilizzando software di analisi di rete.
L'identificatore della proteina UniProt per CCL4 è stato recuperato come P13236. La corrispondente struttura proteica tridimensionale è stata ottenuta in formato Protein Data Bank (PDB) con il numero di accessione 1HUM (MIP-1β umano, struttura di diffrazione a raggi X), selezionata per l'aggancio. La catena A, che rappresenta il monomero biologicamente rilevante, è stata selezionata per l'attracco. La preparazione delle proteine è stata eseguita utilizzando il modulo Prepare Protein in CB-Dock2, che include la rimozione delle molecole d'acqua, l'aggiunta di idrogeni polari e l'assegnazione delle cariche di Gasteiger. Le strutture chimiche tridimensionali dei composti candidati (acido clodronico ed epoetina alfa) sono state recuperate dal database PubChem in formato Structure-Data File (SDF). Le simulazioni di attracco venivano eseguite utilizzando la piattaforma online CB-Dock2, che impiega l'algoritmo AutoDock Vina per l'aggancio cieco. Il sito di attracco era impostato per coprire l'intera superficie proteica per consentire un'identificazione imparziale delle potenziali sacche di legame. L'affinità di legame è stata calcolata come l'energia libera di legame prevista (ΔG) in kcal/mol. Le pose finali di attracco e le interazioni proteina-ligando (ad esempio, legami idrofobi, contatti idrofobi) sono state visualizzate utilizzando PyMOL e il visualizzatore di interazione integrato di CB-Dock2.
8. Preprocessing dei dati per sequenziamento RNA a singola cellula
Il controllo qualità è stato effettuato prima dell'analisi del sequenziamento a valle dell'RNA a singola cellula. Le cellule sono state mantenute quando il numero di geni rilevati era tra 200 e 10.000, il conteggio totale di identificatori molecolari unici era ≥1.000 e la proporzione di trascritti mitocondriali era del ≤20%.
Le cellule che esprimevano meno di 200 geni e i geni rilevati in meno di tre cellule sono state escluse. Questi filtri sono stati applicati per ridurre l'inclusione di celle di bassa qualità e il rumore tecnico. I valori di espressione genica sono stati normalizzati utilizzando la funzione NormalizeData nel pacchetto Seurat. Geni altamente variabili sono stati identificati utilizzando la funzione FindVariableFeatures. I valori di espressione per i geni altamente variabili sono stati centrati e standardizzati utilizzando la funzione ScaleData.
Gli effetti batch associati a variazioni sperimentali o di sequenziamento sono stati corretti utilizzando la funzione RunHarmony dal framework di integrazioneHarmony 17.
9. Riduzione della dimensionalità a cella singola, clustering e annotazione
L'analisi a componenti principali è stata applicata per la prima volta per ridurre la dimensionalità del dataset di sequenziamento RNA a singola cellula. L'approssimazione e proiezione uniforme della varietà, e l'incorporamento stocastico dei vicini distribuiti a t, furono successivamente utilizzati per visualizzare l'eterogeneità cellulare.
Cellule trascrizionalmente simili sono state raggruppate utilizzando le funzioni FindNeighbors e FindClusters in Seurat. I geni marker espressi differenzialmente per ciascun cluster sono stati identificati utilizzando la funzione FindAllMarkers confrontando ogni cluster con tutti i cluster rimanenti.
I tipi cellulari sono stati assegnati utilizzando geni marcatori canonici ottenuti dalla letteratura pubblicata e dai database consolidati di marcatori cellulari. La distribuzione spaziale e i livelli di espressione dei geni chiave sono stati visualizzati utilizzando la funzioneFeaturePlot 18.
10. Analisi quantitativa della reazione a catena della polimerasi
Sono stati prelevati campioni di sangue periferico da 8 pazienti con AMI e 8 controlli sani presso il Centro Clinico di Sanità Pubblica dell'Anhui. Il gruppo AMI includeva pazienti diagnosticati secondo la Quarta Definizione Universale di Infarto Miocardico, con sintomi compatibili con ischemia miocardica e livelli elevati di troponina I cardiaca sopra il limite superiore di riferimento del 99° percentile. Il gruppo di controllo era composto da individui sani di età e sesso, senza storia di malattie cardiovascolari, elettrocardiogrammi normali e senza anomalie negli esami del sangue di routine, nella funzione epatica o renale. Per i pazienti con IAM, sono stati prelevati 3 mL di sangue etilendediaminetico-acido anticoagulante tetraacetico entro 24 ore dal ricovero. Lo stesso volume è stato raccolto da controlli sani durante il corrispondente periodo dello studio.
L'RNA totale è stato isolato dal sangue periferico secondo il protocollo fornito con il kit di isolamento dell'RNA del sangue. La concentrazione e la purezza dell'RNA sono state valutate utilizzando uno spettrofotometro NanoDrop, e l'integrità dell'RNA è stata verificata tramite elettroforesi su gel di agarosio. Solo campioni con un rapporto A260/A280 tra 1,8 e 2,1 sono stati utilizzati per le analisi successive. Un totale di 500 ng di RNA è stato trascritto inversamente in DNA complementare utilizzando un reagente di sintesi complementare del DNA a primo filamento. Il DNA complementare risultante è stato diluito fino a una concentrazione finale di 150 ng/mL. L'amplificazione quantitativa della reazione a catena della polimerasi è stata eseguita in un volume totale di reazione di 10 μL utilizzando un master mix a base di SYBR Green senza colorante di riferimento passivo. Tutte le reazioni qPCR sono state eseguite in duplicati tecnici due volte, e i calcoli successivi si sono basati sui valori medi di Ct.
L'amplificazione è stata eseguita utilizzando uno strumento di reazione a catena della polimerasi in tempo reale. Le condizioni di ciclaggio consistevano in una denaturazione iniziale a 95 °C per 5 minuti, seguita da 40 cicli di denaturazione a 95 °C per 10 secondi, ricottura a 60 °C per 30 secondi ed estensione a 72 °C per 30 secondi. L'analisi della curva di fusione veniva eseguita dopo l'amplificazione.
I livelli di espressione genica sono stati normalizzati in β-actina. L'espressione relativa è stata calcolata utilizzando il metodo 2−ΔΔCt .
11. Analisi statistica
Le analisi statistiche sono state effettuate in R. Le visualizzazioni di rete sono state generate utilizzando software di analisi di rete. Le differenze tra i due gruppi sono state valutate utilizzando il test di Wilcoxon, salvo diversa specificazione. Le variabili continue con distribuzione normale sono state confrontate utilizzando il test t di Student. Le variabili continue non normalmente distribuite venivano confrontate utilizzando il test Mann-Whitney U, noto anche come test della somma dei rangi di Wilcoxon. Tutti i test statistici erano a doppia coda. Un valore P di <0,05 è stato considerato statisticamentesignificativo 19.