O estudo foi conduzido de acordo com a Declaração de Helsinque. O protocolo foi aprovado pelo Comitê de Ética do Centro Clínico de Saúde Pública de Anhui em 19 de setembro de 2025 (ID de aprovação: PJ-YX2025-062). Foi obtido consentimento informado por escrito de todos os participantes antes da coleta de sangue. A coorte local incluiu oito pacientes com infarto agudo do miocárdio (IAM) e oito controles saudáveis. As ferramentas de pesquisa usadas no protocolo estão listadas na Tabela de Materiais.
1. Fontes de dados e processamento
Conjuntos de dados de sequenciamento de RNA em massa relacionados ao infarto do miocárdio foram obtidos a partir do Gene Expression Omnibus (GEO). Os conjuntos de dados GSE59867 e GSE48060 foram usados para análises transcriptômicas em massa, e o GSE269269 conjunto de dados de sequenciamento de RNA de célula única foi usado para análises em nível celular (Tabela 1). Um conjunto de 255 genes relacionados à calmodulina foi obtido do Human Protein Atlas para análises subsequentes do conjunto de genes.
| Conjunto de dados | Tipo de amostra | Exemplo (controles) | Amostra (pacientes) | Plataforma de sequenciamento |
| GSE59867 | RNA-seq em granel | 46 | 111 | GPL6244 |
| GSE48060 | RNA-seq em granel | 21 | 31 | GPL570 |
| GSE269269 | scRNA-seq (sangue periférico) | | 10 | GPL24676 |
Tabela 1: Características dos conjuntos de dados utilizados no estudo. A tabela lista os números de acesso ao conjunto de dados, tipos de amostras, números de amostras controle e de pacientes, e plataformas de sequenciamento para os conjuntos de dados de sequenciamento de RNA em massa e RNA de célula única. RNA-seq, sequenciamento de RNA; scRNA-seq, sequenciamento de RNA de célula única.
A variabilidade entre amostras nos conjuntos de dados transcriptômicos em massa foi corrigida usando a função normalizeBetweenArrays no pacote limma, versão 3.60.6. A análise diferencial de expressão gênica foi então realizada usando limma. Genes diferencialmente expressos (DEGs) foram definidos usando os limiares P < 0,05 e |log₂ de mudança de dobra| > 0,5. Os DEGs resultantes foram visualizados usando gráficos de vulcões e mapas de calor e classificados como significativamente aumentados, significativamente reduzidos ou não significativamente alterados.
2. Análise de enriquecimento de conjuntos gênicos de amostra única e análise de rede de coexpressão gênica ponderada
A análise de enriquecimento de conjuntos gênicos com amostra única (ssGSEA) foi realizada utilizando os 255 genes relacionados à calmodulina. O pacote GSVA foi usado para calcular um escore gênico relacionado à calmodulina, designado Calmodulin_score, para cada AMI e amostra controle. As diferenças de Calmodulin_score entre os grupos AMI e controle foram avaliadas usando o teste de soma de ranks de Wilcoxon.
A análise ponderada da rede de coexpressão gênica (WGCNA) foi realizada utilizando dados transcriptômicos em massa de pacientes com IAM. Genes com valor médio de fragmentos por kilobase de transcrito por milhão de leituras mapeadas de ≤0,5 foram excluídos. As amostras foram agrupadas para identificar e remover valores atípicos.
Foi selecionada uma potência de limiar suave que alcançou um ajuste topológico sem escala de R² > 0,8. Uma matriz de sobreposição topológica foi então construída. Módulos gênicos foram identificados usando o algoritmo de corte de árvore dinâmica com tamanho mínimo de módulo de 200. Módulos com autogênios altamente semelhantes foram fundidos usando um limiar de correlação de >0,75, correspondente a um limiar de fusão de módulos de 0,25.
As relações entre autogênios do módulo e características clínicas, incluindo Calmodulin_score, foram avaliadas por meio da análise de correlação de Pearson. As relações resultantes entre módulos e características foram exibidas em um mapa de calor anotado com coeficientes de correlação e valores P correspondentes. A pertença ao módulo e a significância gênica foram calculadas para cada gene. Foram gerados gráficos de dispersão da pertença aos módulos em relação à significância gênica para identificar genes com alta conectividade intramodular e relevância de características.
3. Identificação de genes relacionados à calmodulina associados à AMI
Genes relacionados à calmodulina associados à AMI foram identificados pela interseção dos DEGs com genes de módulos WGCNA significativamente correlacionados com Calmodulin_score. Os genes sobrepostos foram mantidos para análises posteriores.
A análise de enriquecimento funcional foi realizada usando o pacote clusterProfer. A Ontologia Genética e a Enciclopédia de Genes e Genomas de Kyoto foram usadas para identificar processos biológicos, funções moleculares, componentes celulares e vias de sinalização associadas aos genes sobrepostos.
4. Identificação e validação de genes-chave usando aprendizado de máquina
A análise de regressão logística univariada foi realizada usando genes sobrepostos. Três algoritmos de aprendizado de máquina foram então aplicados independentemente usando os seguintes pacotes e parâmetros R: random forest, XGBoost e support vector machine.
Cada algoritmo foi usado para priorizar genes com valor preditivo para IAM. Genes candidatos à chave foram definidos como os genes identificados pelos três algoritmos. Genes que também apresentaram expressão diferencial significativa e direcionalmente consistente tanto no conjunto de dados de treinamento GSE59867 quanto no conjunto de dados externo de validação GSE48060 foram mantidos como genes-chave finais.
5. Construção e avaliação de modelos diagnósticos
Um modelo de regressão logística foi construído usando os genes-chave identificados e a função lrm. Um nomograma foi gerado usando a função regplot para exibir a contribuição de cada gene de característica para a probabilidade prevista de AMI.
A discriminação do modelo foi avaliada por análise de características operacionais do receptor usando o pacote pROC. A área sob a curva característica operacional do receptor foi calculada para avaliar a capacidade do modelo de distinguir AMI de amostras controle.
Curvas de calibração foram geradas para comparar probabilidades previstas com os resultados observados. Foi realizada uma análise da curva de decisão para estimar o benefício clínico líquido do modelo em uma faixa de probabilidades limiar.
6. Análise de enriquecimento de conjuntos gênicos e construção de redes endógenas de RNA concorrentes
A análise de enriquecimento de conjuntos gênicos foi realizada separadamente para cada gene-chave usando sua matriz de correlação gênica e o pacote clusterProfer. Os resultados do enriquecimento de vias da Enciclopédia de Genes e Genomas de Kyoto foram classificados pela pontuação absoluta de enriquecimento normalizado. As cinco vias de maior classificação foram exibidas para cada gene.
Associações funcionais e redes de interação gênica foram examinadas usando o GeneMANIA. Potenciais reguladores de microRNA dos genes-chave foram previstos usando miRanda, miRTarBase, TargetScan e miRDB. Interações candidatas microRNA-mRNA foram identificadas ao intersectar as previsões dos quatro bancos de dados.
Longas interações RNA-microRNA não codificantes foram obtidas a partir do spongeScan. As longas relações não codificantes RNA-microRNA e microRNA-mRNA foram então integradas para construir uma rede reguladora endógena concorrente de RNA. A rede foi visualizada como um diagrama de Sankey usando o pacote ggalluvial.
7. Previsão de fármacos e acoplamento molecular
As interações fármaco-gene foram previstas usando o Banco de Dados de Interação Medicamento-Gênico. A rede de interação resultante foi visualizada usando software de análise de rede.
O identificador da proteína UniProt para CCL4 foi recuperado como P13236. A estrutura proteica tridimensional correspondente foi obtida no formato de Banco de Dados de Proteínas (PDB) sob o número de acesso 1HUM (MIP-1β humano, estrutura de difração de raios X), que foi selecionado para acoplamento. A Chain A, representando o monômero biologicamente relevante, foi selecionada para acoplamento. A preparação de proteínas foi realizada usando o módulo Prepare Protein no CB-Dock2, que inclui remoção de moléculas de água, adição de hidrogênios polares e atribuição de cargas de Gasteiger. As estruturas químicas tridimensionais dos compostos candidatos (ácido clodrônico e epoetina alfa) foram recuperadas do banco de dados PubChem no formato Structure-Data File (SDF). As simulações de acoplamento foram realizadas usando a plataforma online CB-Dock2, que emprega o algoritmo AutoDock Vina para acoplamento às cegas. O local de acoplamento foi configurado para cobrir toda a superfície da proteína, permitindo a identificação imparcial de possíveis bolsões de ligação. A afinidade de ligação foi calculada como a energia livre de ligação prevista (ΔG) em kcal/mol. As poses finais de acoplamento e as interações proteína-ligando (por exemplo, ligações de hidrogênio, contatos hidrofóbicos) foram visualizadas usando o PyMOL e o visualizador de interação embutido do CB-Dock2.
8. Pré-processamento de dados de sequenciamento de RNA de célula única
O controle de qualidade foi realizado antes da análise posterior do sequenciamento de RNA de célula única. As células foram retidas quando o número de genes detectados estava entre 200 e 10.000, a contagem total de identificadores moleculares únicos era ≥1.000 e a proporção de transcritos mitocondriais era ≤20%.
Células com menos de 200 genes e genes detectados em menos de três células foram excluídas. Esses filtros foram aplicados para reduzir a inclusão de células de baixa qualidade e ruído técnico. Os valores de expressão gênica foram normalizados usando a função NormalizeData no pacote Seurat. Genes altamente variáveis foram identificados usando a função FindVariableFeatures. Os valores de expressão dos genes altamente variáveis foram centralizados e padronizados usando a função ScaleData.
Efeitos em lote associados à variação experimental ou sequenciante foram corrigidos usando a função RunHarmony do framework de integraçãoHarmony 17.
9. Redução de adimensionalidade em célula única, agrupamento e anotação
A análise de componentes principais foi aplicada pela primeira vez para reduzir a dimensionalidade do conjunto de dados de sequenciamento de RNA de célula única. Aproximação e projeção uniforme de variedades, e imersão estocástica de vizinhos distribuídos por t foram posteriormente usados para visualizar a heterogeneidade celular.
Células transcricionalmente semelhantes foram agrupadas usando as funções FindNeighbors e FindClusters em Seurat. Genes marcadores diferencialmente expressos para cada cluster foram identificados usando a função FindAllMarkers, comparando cada cluster com todos os clusters restantes.
Os tipos celulares foram atribuídos usando genes marcadores canônicos obtidos da literatura publicada e bancos de dados estabelecidos de marcadores celulares. A distribuição espacial e os níveis de expressão dos genes-chave foram visualizados usando a funçãoFeaturePlot 18.
10. Análise quantitativa da reação em cadeia da polimerase
Foram obtidas amostras de sangue periférico de 8 pacientes com AMI e 8 controles saudáveis no Centro Clínico de Saúde Pública de Anhui. O grupo AMI incluiu pacientes diagnosticados de acordo com a Quarta Definição Universal de Infarto do Miocárdio, com sintomas compatíveis com isquemia miocárdica e níveis elevados de troponina cardíaca I acima do limite superior de referência do percentil 99. O grupo controle era composto por indivíduos saudáveis com pareamento de idade e sexo, sem histórico de doença cardiovascular, eletrocardiogramas normais e sem anormalidades nos exames de sangue rotineiros, função hepática ou função renal. Para pacientes com IMA, 3 mL de sangue com ácido anticoagulante etilendediaminetetraacético foram coletados dentro de 24 horas após a internação. O mesmo volume foi coletado de controles saudáveis durante o período correspondente do estudo.
O RNA total foi isolado do sangue periférico de acordo com o protocolo fornecido com o kit de isolamento de RNA sanguíneo. A concentração e pureza do RNA foram avaliadas usando um espectrofotômetro NanoDrop, e a integridade do RNA foi verificada por eletroforese em gel de agarosa. Apenas amostras com razão A260/A280 entre 1,8 e 2,1 foram usadas para análises subsequentes. Um total de 500 ng de RNA foi transcrito reversamente em DNA complementar usando um reagente de síntese complementar de DNA de primeira fita. O DNA complementar resultante foi diluído até uma concentração final de 150 ng/mL. A amplificação quantitativa da reação em cadeia da polimerase foi realizada em um volume total de reação de 10 μL usando uma mistura mestre à base de SYBR Green, sem corante de referência passivo. Todas as reações qPCR foram realizadas em duplicados técnicos duas vezes, e os cálculos subsequentes foram baseados nos valores médios de Ct.
A amplificação foi realizada usando um instrumento de reação em cadeia da polimerase em tempo real. As condições de ciclagem consistiram em desnaturação inicial a 95 °C por 5 minutos, seguida por 40 ciclos de desnaturação a 95 °C por 10 segundos, recozimento a 60 °C por 30 segundos e extensão a 72 °C por 30 segundos. A análise da curva de fusão foi realizada após amplificação.
Os níveis de expressão gênica foram normalizados para β-actina. A expressão relativa foi calculada usando o método 2−ΔΔCt .
11. Análise estatística
Análises estatísticas foram realizadas em R. Visualizações de rede foram geradas usando software de análise de rede. As diferenças entre os dois grupos foram avaliadas usando o teste de Wilcoxon, salvo especificação em contrário. Variáveis contínuas com distribuição normal foram comparadas usando o teste t de Student. Variáveis contínuas não normalmente distribuídas foram comparadas usando o teste Mann-Whitney U, também conhecido como teste de soma de ranks de Wilcoxon. Todos os testes estatísticos foram de duas caras. Um valor P de <0,05 foi considerado estatisticamentesignificativo 19.