$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El estudio se realizó conforme a la Declaración de Helsinki, y el protocolo fue aprobado por el Comité de Ética del Tercer Hospital de la Universidad Médica de Hebei (W2025-065-1) en noviembre de 2024. Se obtuvo el consentimiento informado de todos los sujetos implicados en el estudio.
Fuente de datos y preprocesamiento
Se obtuvieron datos de RNA-seq asociados con HF, incluyendo dos conjuntos de datos de microarrays del Gene Expression Omnibus (https://www.ncbi.nlm.nih.gov/geo/). Se seleccionaron dos conjuntos de datos de microarrays de sangre periférica: GSE59867 (34 muestras de IC y 30 controles) como conjunto de datos de entrenamiento; GSE57338 (177 muestras de HF y 136 controles) se utilizó como conjunto de datos de validación. La información clínica disponible para GSE57338, incluyendo edad, género y estado de la enfermedad, fue obtida de GEO y se resume en la Tabla Suplementaria 1. Además, se obtuvieron un total de 3.893 genes relacionados con la SUMOilación (SRGs) de la base de datos dbPTM (https://awi.cuhk.edu.cn/dbPTM/index.php) (Tabla Suplementaria 2), mientras que se recogieron 2.030 genes relacionados con mitocondrias (MRGs) basados en un estudioprevio 24 (Tabla Suplementaria 3). A continuación, se utilizó el paquete R GEOquery (v 2.72.0)25 para descargar conjuntos de datos de la base de datos GEO, extraer la matriz de expresión y obtener la información fenotípica de la muestra. La anotación se realizaba mapeando el archivo de anotación y comparando los identificadores de gens. Se eliminaron identificadores génicos inválidos y se conservaron las sondas más expresadas.
Selección de genes clave mediante aprendizaje automático
Se utilizó un enfoque de varios pasos para seleccionar los genes relacionados con la HF, la SUMOilación y las mitocondrias. En primer lugar, se identificaron los genes comunes entre el conjunto de datos de entrenamiento, los SRGs y los MRGs mediante análisis de intersección. La función potencial de genes comunes fue identificada mediante el análisis de enriquecimiento de Gene Ontology (GO) y la Kyoto Encyclopedia of Genes and Genomes (KEGG) utilizando el paquete R ClusterProfiler (v 4.12.6)26. Después, se emplearon tres enfoques de aprendizaje automático, a saber, regresión LASSO, XGBoost y bosque aleatorio (RF), para filtrar aún más los genes. En la regresión LASSO, se seleccionó el parámetro óptimo de regularización λ mediante validación cruzada para identificar las características genéticas con mayor valor predictivo. Los genes con coeficientes distintos de cero fueron seleccionados para su análisis posterior. Luego, se utilizaron algoritmos XGBoost y RF para calcular las puntuaciones de importancia de las características y analizar los 20 genes principales.
Construcción y evaluación de modelos diagnósticos
Se construyó un modelo diagnóstico utilizando regresión logística basado en el conjunto de datos GSE59867. El modelo se aplicó entonces para predecir el estado de la enfermedad y calcular puntuaciones de probabilidad. Para validar el modelo, se extrajeron los mismos genes clave del conjunto de datos GSE57338, se normalizaron para coincidir con el conjunto de datos de entrenamiento y se utilizaron para predicciones externas. El rendimiento del modelo se evaluó utilizando curvas de Característica de Operación del Receptor (ROC), Matriz de Confusión, Curva de Calibración y Análisis de Curva de Decisión (DCA).
Análisis de enriquecimiento de conjuntos génicos (GSEA) y localización subcelular
El análisis de correlación de Spearman se utilizó para identificar genes correlacionados para cada gen clave. El análisis GSEA se realizó utilizando el paquete R ClusterProfiler (v 4.12.6) sobre los genes relacionados con los genes clave. Mientras tanto, para determinar la localización subcelular precisa de los genes clave dentro de la célula, se determinó su localización subcelular utilizando la base de datos GeneCards (https://www.genecards.org/).
Asociación gen-enfermedad y predicción de fármacos
Para evaluar la relevancia clínica de los genes clave identificados, se realizaron análisis sistemáticos de asociación de enfermedades e interacción medicamentosa. Las asociaciones enfermedad-gen fueron analizadas utilizando la Base de Datos Comparativa de Toxicogenómica (CTD; https://ctdbase.org/), con resultados clasificados tanto por puntuaciones de inferencia como por recuento de referencias (las 10 principales asociaciones reportadas). Los datos de interacción génico-fármaco para genes clave se obtuvieron de la base de datos Drug-Gene Interaction (DGIdb), y los fármacos se excluyeron basándose en una puntuación de interacción < 0,5. Posteriormente, descargamos las estructuras 3D de proteínas correspondientes a genes clave de la base de datos PDB (https://www.rcsb.org/) y las estructuras moleculares de fármacos potenciales de PubChem (https://pubchem.ncbi.nlm.nih.gov/). A continuación, se realizó un análisis de acoplamiento molecular utilizando CB-Dock227 (https://cadd.labshare.cn/cb-dock2/php/index.php) para calcular las puntuaciones de unión entre los fármacos potenciales y las proteínas. Una energía libre de unión más baja indica una interacción más estable, lo que sugiere que el compuesto podría tener un mayor potencial de dirigimiento.
Análisis de infiltración inmune
La infiltración de células inmunitarias se evaluó utilizando tres métodos complementarios: contador de poblaciones celulares de microambiente (contador MCP)28, identificación de tipos celulares mediante la estimación de subconjuntos relativos de transcritos de ARN (CIBERSORT)29 y análisis de enriquecimiento de muestra única (ssGSEA)30. El análisis con contador MCP y CIBERSORT se realizó utilizando el paquete R IOBR (v 0.99.0)31. El contador MCP se utilizó para estimar la abundancia de células inmunitarias y estromales, mientras que CIBERSORT se empleó para cuantificar las proporciones relativas de 22 tipos de células inmunitarias. ssGSEA se realizó utilizando el paquete GSVA (v1.52.3)32 para evaluar el enriquecimiento a nivel muestral de subtipos de células inmunitarias.
Construcción de la red reguladora de ARN endógeno (ceRNA) competidora
Para investigar los posibles roles regulatorios miARN–lncRNA asociados con genes clave previamente identificados, se construyó una red reguladora de ceRNA. El paquete R multiMiR (v 1.26.0)33 se utilizó para predecir posibles interacciones microARN (miARN)–ARNm para genes clave, integrando datos de PITA (https://omictools.com/pita-tool/) y la base de datos miRDB (https://mirdb.org/). Se seleccionaron pares miARN–mRNA con alta confianza y consistencia. Posteriormente, las interacciones lncRNA–miARN fueron recuperadas de la base de datos StarBase (https://rnasysu.com/encori/) y filtradas para detectar interacciones soportadas por ≥ 10 experimentos CLIP-seq y categorizadas como lincRNAs. Se construyó una red de ceRNA integrando interacciones lncRNA-miARNm.
Validación qPCR
Para validar la expresión de genes clave, se recogieron muestras de sangre de pacientes con IC y controles sanos de la cohorte clínica (n = 6 por grupo) en el Tercer Hospital de la Universidad Médica de Hebei (W2025-065-1) bajo protocolos aprobados y consentimiento informado. El ARN total fue aislado utilizando el reactivo TRIzol junto con cloroformo e isopropanol. Tras la extracción, el ARN se disolvió en agua tratada con DEPC, y su concentración y pureza se evaluaron utilizando un espectrofotómetro NanoDrop. Para el análisis transcripcional, el ARN se transcribió inversamente en cDNA usando la mezcla rápida de síntesis de cDNA de primera cadena para RT (con dsDNasa). Posteriormente se realizó una PCR cuantitativa utilizando la Fast Taq qPCR SYBR Green Mix. Las secuencias específicas de cebadores se detallan en la Tabla de Materiales. Los niveles relativos de expresión génica se calcularon utilizando el método 2-ΔΔCT , con la normalización adecuada.
Análisis estadístico
Todos los análisis estadísticos se realizaron utilizando el software R y GraphPad Prism. Se realizaron comparaciones estadísticas entre dos grupos independientes utilizando la prueba t de Student o la prueba U de Mann-Whitney, dependiendo de la distribución de datos. Se consideró que un valor p inferior a 0,05 indicaba significancia estadística.