El estudio se llevó a cabo de acuerdo con la Declaración de Helsinki. El protocolo fue aprobado por el Comité de Ética del Centro Clínico de Salud Pública de Anhui el 19 de septiembre de 2025 (ID de aprobación: PJ-YX2025-062). Se obtuvo el consentimiento informado por escrito de todos los participantes antes de la extracción de sangre. La cohorte local incluyó ocho pacientes con infarto agudo de miocardio (IAM) y ocho controles sanos. Las herramientas de investigación utilizadas en el protocolo se enumeran en la Tabla de Materiales.
1. Fuentes de datos y procesamiento
Se obtuvieron conjuntos de datos de secuenciación de ARN a granel relacionados con el infarto de miocardio del Gene Expression Omnibus (GEO). Los conjuntos de datos GSE59867 y GSE48060 se utilizaron para análisis transcriptómicos masivos, y el conjunto de datos GSE269269 de secuenciación de ARN unicelular se empleó para análisis a nivel celular (Tabla 1). Se obtuvo un conjunto de 255 genes relacionados con la calmodulina del Human Protein Atlas para análisis posteriores del conjunto de genes.
| Conjunto de datos | Tipo de muestra | Muestra (controles) | Muestra (pacientes) | Plataforma de secuenciación |
| GSE59867 | RNA-seq a granel | 46 | 111 | GPL6244 |
| GSE48060 | RNA-seq a granel | 21 | 31 | GPL570 |
| GSE269269 | SCRNA-seq (sangre periférica) | | 10 | GPL24676 |
Tabla 1: Características de los conjuntos de datos utilizados en el estudio. La tabla enumera los números de acceso al conjunto de datos, tipos de muestras, números de muestras de control y de pacientes, y plataformas de secuenciación para los conjuntos de datos de secuenciación de ARN a granel y ARN unicelular. RNA-seq, secuenciación de ARN; scRNA-seq, secuenciación de ARN unicelular.
La variabilidad entre muestras en los conjuntos de datos transcriptómicos masivos se corrigió utilizando la función normalizeBetweenArrays en el paquete limma, versión 3.60.6. A continuación, se realizó un análisis diferencial de expresión génica utilizando limma. Los genes diferencialmente expresados (DEGs) se definieron usando los umbrales P < 0,05 y |log₂ cambio de plegamiento| > 0,5. Los DEGs resultantes se visualizaron mediante gráficos de volcáns y mapas de calor, y se clasificaron como significativamente regulados al alza, significativamente a la baja o no significativamente modificados.
2. Análisis de enriquecimiento de conjuntos génicos con muestra única y análisis de redes de coexpresións génicas ponderadas
Se realizó un análisis de enriquecimiento de conjuntos génicos con muestra única (ssGSEA) utilizando los 255 genes relacionados con la calmodulina. El paquete GSVA se utilizó para calcular una puntuación génica relacionada con la calmodulina, designada Calmodulin_score, para cada AMI y muestra de control. Las diferencias en Calmodulin_score entre los grupos AMI y control se evaluaron utilizando la prueba de suma de rangos de Wilcoxon.
Se realizó el análisis ponderado de la red de coexpresión génica (WGCNA) utilizando los datos transcriptómicos en volumen de pacientes con IAM. Se excluyeron genes con un valor medio de fragmentos por kilobase de transcrito por millón de lecturas mapeadas de ≤0,5. Se agruparon muestras para identificar y eliminar valores atípicos.
Se seleccionó una potencia de umbral suave que lograra un ajuste topológico sin escala de R² > 0,8. A continuación, se construyó una matriz de solapamiento topológico. Los módulos génicos se identificaron usando el algoritmo de corte dinámico de árbol con un tamaño mínimo de módulo de 200. Los módulos con autogenes muy similares se fusionaron usando un umbral de correlación de >0,75, correspondiente a un umbral de fusión de módulos de 0,25.
Las relaciones entre los eigengenes del módulo y los rasgos clínicos, incluyendo Calmodulin_score, se evaluaron mediante análisis de correlación de Pearson. Las relaciones resultantes entre módulos y rasgos se mostraron en un mapa de calor anotado con coeficientes de correlación y valores P correspondientes. Se calcularon la pertenencia a módulos y la significación génica para cada gen. Se generaron diagramas de dispersión de la pertenencia a módulos con la significación génica para identificar genes con alta conectividad intramodular y relevancia de rasgos.
3. Identificación de genes relacionados con la calmodulina asociados a la AMI
Se identificaron genes relacionados con calmodulina asociados a la AMI al intersectar los DEGs con genes de módulos WGCNA significativamente correlacionados con Calmodulin_score. Los genes superpuestos se conservaron para análisis posteriores.
El análisis de enriquecimiento funcional se realizó utilizando el paquete clusterProfiler. Se utilizaron anotaciones de Gene Ontology y Kyoto Encyclopedia of Genes and Genomes para identificar procesos biológicos, funciones moleculares, componentes celulares y vías de señalización asociadas con los genes superpuestos.
4. Identificación y validación de genes clave mediante aprendizaje automático
Se realizó un análisis de regresión logística univariante utilizando los genes superpuestos. Tres algoritmos de aprendizaje automático se aplicaron de forma independiente utilizando los siguientes paquetes y parámetros R: bosque aleatorio, XGBoost y máquina de vectores de soporte.
Cada algoritmo se utilizó para priorizar genes con valor predictivo para la AMI. Los genes clave candidatos se definieron como los genes identificados por los tres algoritmos. Los genes que también mostraron expresión diferencial significativa y direccionalmente consistente tanto en el conjunto de datos de entrenamiento GSE59867 como en el conjunto de datos de validación externa GSE48060 se mantuvieron como genes clave finales.
5. Construcción y evaluación de modelos diagnósticos
Se construyó un modelo de regresión logística utilizando los genes clave identificados y la función lrm. Se generó un nomograma utilizando la función regplot para mostrar la contribución de cada gen de característica a la probabilidad predicha de AMI.
La discriminación del modelo se evaluó mediante análisis de características operativas del receptor utilizando el paquete pROC. El área bajo la curva característica de funcionamiento del receptor se calculó para evaluar la capacidad del modelo para distinguir AMI de muestras de control.
Se generaron curvas de calibración para comparar las probabilidades predichas con los resultados observados. Se realizó un análisis de la curva de decisión para estimar el beneficio clínico neto del modelo en un rango de probabilidades umbral.
6. Análisis de enriquecimiento de conjuntos génicos y construcción de redes endógenas de ARN competidoras
El análisis de enriquecimiento de conjuntos génicos se realizó por separado para cada gen clave utilizando su matriz de correlación génica y el paquete clusterProfer. Los resultados del enriquecimiento de vías de la Enciclopedia de Genes y Genomas de Kioto se clasificaron según la puntuación absoluta de enriquecimiento normalizado. Se mostraron las cinco vías de mayor rango para cada gen.
Se examinaron asociaciones funcionales y redes de interacción génica utilizando GeneMANIA. Se predijeron posibles reguladores de microARN de los genes clave utilizando miRanda, miRTarBase, TargetScan y miRDB. Se identificaron interacciones candidatas microARN-ARNm intersectando las predicciones de las cuatro bases de datos.
Se obtuvieron largas interacciones ARN-microARN no codificantes a partir de spongeScan. Las largas relaciones ARN-microARN y microARN-m no codificantes se integraron para construir una red reguladora endógena de ARN en competencia. La red se visualizó como un diagrama de Sankey usando el paquete ggalluvial.
7. Predicción de fármacos y acoplamiento molecular
Las interacciones fármaco-gen se predijeron utilizando la Base de Datos de Interacciones Fármaco-Génico. La red de interacción resultante se visualizó mediante software de análisis de red.
El identificador de proteína UniProt para CCL4 fue recuperado como P13236. La estructura proteica tridimensional correspondiente se obtuvo en formato de Banco de Datos de Proteínas (PDB) bajo el número de acceso 1HUM (MIP-1β humano, estructura de difracción de rayos X), que fue seleccionado para acoplamiento. La cadena A, que representa el monómero biológicamente relevante, fue seleccionada para acoplamiento. La preparación de proteínas se realizó utilizando el módulo Prepare Protein en CB-Dock2, que incluye la eliminación de moléculas de agua, la adición de hidrógenos polares y la asignación de cargas de Gasteiger. Las estructuras químicas tridimensionales de los compuestos candidatos (ácido clodrónico y epoetina alfa) se recuperaron de la base de datos PubChem en formato Structure-Data File (SDF). Las simulaciones de acoplamiento se realizaron utilizando la plataforma online CB-Dock2, que emplea el algoritmo AutoDock Vina para acoplamiento a ciegas. El sitio de acoplamiento estaba configurado para cubrir toda la superficie de la proteína y permitir la identificación imparcial de posibles bolsas de unión. La afinidad de unión se calculó como la energía libre de unión prevista (ΔG) en kcal/mol. Las posturas finales de acoplamiento y las interacciones proteína-ligando (por ejemplo, enlaces de hidrógeno, contactos hidrofóbicos) se visualizaron usando PyMOL y el visor de interacción integrado de CB-Dock2.
8. Preprocesamiento de datos de secuenciación de ARN de célula única
El control de calidad se realizó antes del análisis posterior de secuenciación de ARN unicelular. Las células se retuvieron cuando el número de genes detectados estaba entre 200 y 10.000, el recuento total de identificadores moleculares únicos era de ≥1.000 y la proporción de transcritos mitocondriales era del ≤20%.
Se excluyeron las células que expresaban menos de 200 genes y los genes detectados en menos de tres células. Estos filtros se aplicaban para reducir la inclusión de células de baja calidad y el ruido técnico. Los valores de expresión génica se normalizaron usando la función NormalizeData en el paquete Seurat. Se identificaron genes altamente variables utilizando la función FindVariableFeatures. Los valores de expresión de los genes altamente variables se centraron y estandarizaron utilizando la función ScaleData.
Los efectos por lotes asociados a variaciones experimentales o de secuenciación se corrigieron utilizando la función RunHarmony del marco de integraciónHarmony 17.
9. Reducción de dimensionalidad en una sola celda, agrupamiento y anotación
El análisis de componentes principales se aplicó primero para reducir la dimensionalidad del conjunto de datos de secuenciación de ARN de célula única. Posteriormente se utilizaron aproximaciones y proyecciones uniformes de variedades, así como la incrustación estocástica de vecinos distribuidos por t, para visualizar la heterogeneidad celular.
Células transcripcionalmente similares se agruparon usando las funciones FindNeighbors y FindClusters en Seurat. Se identificaron genes marcadores expresados diferencialmente para cada grupo utilizando la función FindAllMarkers comparando cada grupo con todos los demás grupos.
Los tipos celulares se asignaron utilizando genes marcadores canónicos obtenidos de la literatura publicada y de bases de datos establecidas de marcadores celulares. La distribución espacial y los niveles de expresión de genes clave se visualizaron utilizando la funciónFeaturePlot 18.
10. Análisis cuantitativo de la reacción en cadena de la polimerasa
Se obtuvieron muestras de sangre periférica de 8 pacientes con AMI y 8 controles sanos en el Centro Clínico de Salud Pública de Anhui. El grupo de AMI incluyó pacientes diagnosticados según la Cuarta Definición Universal de Infarto de Miocardio, con síntomas compatibles con isquemia miocárdica y niveles elevados de troponina cardíaca I por encima del límite superior de referencia del percentil 99. El grupo de control estaba formado por individuos sanos de edad y sexo, sin antecedentes de enfermedades cardiovasculares, electrocardiogramas normales y sin anomalías en análisis de sangre rutinarios, función hepática o renal. En pacientes con IAM, se recogieron 3 mL de sangre con ácido etilendediaminéstico tetraacético y anticoagulado en menos de 24 horas tras su ingreso hospitalario. El mismo volumen se recogió de controles sanos durante el periodo correspondiente del estudio.
El ARN total se aisló de la sangre periférica según el protocolo suministrado con el kit de aislamiento de ARN sanguíneo. Se evaluaron la concentración y pureza del ARN utilizando un espectrofotómetro NanoDrop, y la integridad del ARN se verificó mediante electroforesis en gel de agarosa. Solo se utilizaron muestras con una relación A260/A280 entre 1,8 y 2,1 para análisis posteriores. Un total de 500 ng de ARN se transcribieron inversamente en ADN complementario utilizando un reactivo de síntesis de ADN complementario de primera cadena. El ADN complementario resultante se diluyó hasta una concentración final de 150 ng/mL. La amplificación cuantitativa de la reacción en cadena de la polimerasa se realizó en un volumen total de reacción de 10 μL utilizando una mezcla maestra basada en SYBR Green sin colorante de referencia pasivo. Todas las reacciones qPCR se realizaron en duplicados técnicos dos veces, y los cálculos posteriores se basaron en los valores medios de Ct.
La amplificación se realizó utilizando un instrumento de reacción en cadena de la polimerasa en tiempo real. Las condiciones de ciclismo consistieron en una desnaturalización inicial a 95 °C durante 5 minutos, seguida de 40 ciclos de desnaturalización a 95 °C durante 10 s, recocido a 60 °C durante 30 s y extensión a 72 °C durante 30 s. El análisis de curva de fusión se realizó tras la amplificación.
Los niveles de expresión génica se normalizaron a β-actina. La expresión relativa se calculó usando el método 2−ΔΔCt .
11. Análisis estadístico
Se realizaron análisis estadísticos en R. Las visualizaciones de red se generaron utilizando software de análisis de red. Las diferencias entre dos grupos se evaluaron utilizando la prueba de Wilcoxon, salvo que se especifique lo contrario. Las variables continuas con distribución normal se compararon utilizando la prueba t de Student. Se compararon variables continuas no distribuidas normalmente utilizando la prueba U de Mann-Whitney, también conocida como prueba de suma de rangos de Wilcoxon. Todas las pruebas estadísticas fueron de dos colas. Se consideró estadísticamente significativo un valor de P de <0,0519.