本研究结合 bulk 转录组学和单细胞转录组学与机器学习,鉴定出 CCL4 及其他五个基因可能作为急性心肌梗死的诊断生物标志物,揭示了免疫-代谢间的相互作用及细胞类型特异性的表达模式。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本研究结合 bulk 转录组学和单细胞转录组学与机器学习,鉴定出 CCL4 及其他五个基因可能作为急性心肌梗死的诊断生物标志物,揭示了免疫-代谢间的相互作用及细胞类型特异性的表达模式。
急性心肌梗死(AMI)是全球范围内发病率和死亡率的主要原因,凸显了对新型互补生物标志物的需求。通过整合批量和单细胞转录组数据与机器学习方法,鉴定出与AMI相关的钙调蛋白相关基因,并探索了其免疫-代谢特征。差异表达和加权共表达分析揭示了60个钙调蛋白相关基因,从中通过多种机器学习算法筛选出六个关键基因(SOCS3、GBP4、ST14、KPNA5、STAB1 和 CCL4),并在独立数据集中进行了验证。功能分析表明,这些基因在免疫、炎症和代谢通路中显著富集。免疫浸润和单细胞转录组学显示了细胞类型特异性的表达模式,其中CCL4主要在T细胞和NK细胞中表达,并在AMI样本中显著降低。qPCR验证证实了本地队列中六个基因中有四个基因的表达发生显著变化。药物-基因相互作用和分子对接分析提示了可用于进一步研究的候选化合物。综上所述,研究结果表明CCL4可能作为AMI的潜在诊断生物标志物,而观察到的免疫-代谢关联为未来的机制和转化研究提供了基础。
急性心肌梗死(AMI)由持续的心肌缺血引起,是全球最致命的心血管疾病之一1˒2。其发病机制具有多因素性,主要因素包括动脉粥样硬化、血栓形成、冠状动脉痉挛和心律失常3˒4。高血压、糖尿病、高脂血症、吸烟、肥胖和心理压力也被认为是重要的危险因素5。尽管介入技术、抗血小板治疗和溶栓策略的进步已显著改善了短期生存率,但AMI的总体发病率仍在持续上升,尤其是在年轻人群中6。心肌肌钙蛋白(cTn)目前是诊断AMI的金标准生物标志物。它是一种在心肌细胞坏死后释放入血液循环的结构蛋白,具有高敏感性和特异性。然而,cTn水平可能受到肾功能和采样时间的影响7˒8。因此,仍需开发新的互补性生物标志物。
钙调蛋白(CaM)是一种小分子、广泛表达且高度保守的钙结合蛋白,作为细胞内钙信号的关键转导分子,参与多种生物学过程9˒10。通过感知细胞内Ca2⁺浓度的变化,CaM可与多种靶蛋白相互作用,包括激酶、磷酸酶和离子通道,从而调控细胞增殖、凋亡、代谢、肌肉收缩以及炎症反应11。在心血管系统中,CaM在调控心肌细胞收缩力、心率、电稳定性以及血管平滑肌张力方面发挥核心作用12˒13。越来越多的证据表明,CaM功能障碍或CaM相关信号通路的失调与多种心血管疾病相关,包括心律失常、心力衰竭、高血压和心肌肥厚14˒15。此外,CaM还参与心肌细胞对缺血、氧化应激和炎症刺激的响应,提示其可能在急性心肌梗死(AMI)的病理进展中发挥作用16。因此,针对心血管疾病背景下CaM的研究具有重要的科学和临床意义。
通过整合批量RNA测序(bulk RNA-seq)和单细胞RNA测序(single-cell RNA-seq)数据集,系统性地鉴定出与CaM评分显著相关的差异表达基因(DEGs)。采用加权基因共表达网络分析(WGCNA)进一步识别与急性心肌梗死(AMI)相关的CaM候选基因。随后应用多种机器学习算法筛选关键基因,并构建用于评估个体AMI风险的预测模型。同时整合转录组特征、免疫浸润谱以及竞争性内源RNA(ceRNA)调控网络,以探究这些关键基因在免疫调控及潜在药物靶点相互作用中的作用机制。研究结果表明,多个核心基因参与免疫代谢交互作用通路,具有预测价值和治疗潜力。该整合性方法深化了对AMI分子机制的理解,为生物标志物的开发和靶向干预提供了理论依据。
访问受限。请登录或开始试用以查看此内容。
本研究遵循《赫尔辛基宣言》的规定进行。研究方案于2025年9月19日获得安徽公共卫生临床中心伦理委员会批准(批准号:PJ-YX2025-062)。在采集血液样本前,已从所有参与者处获得书面知情同意书。本地队列包括八名急性心肌梗死(AMI)患者和八名健康对照者。本方案中使用的研究工具列于材料表中。
1. 数据来源与处理
与心肌梗死相关的批量RNA测序数据集来自基因表达综合数据库(Gene Expression Omnibus, GEO)。GSE59867和GSE48060数据集用于批量转录组分析,GSE269269单细胞RNA测序数据集用于细胞水平的分析(表1)。从人类蛋白质图谱(Human Protein Atlas)获取了一组包含255个钙调蛋白相关基因的基因集,用于后续的基因集分析。
| 数据集 | 样本类型 | 样本(对照组) | 样本(患者) | 测序平台 |
| GSE59867 | Bulk RNA-seq | 46 | 111 | GPL6244 |
| GSE48060 | Bulk RNA-seq | 21 | 31 | GPL570 |
| GSE269269 | scRNA-seq (外周血) | 10 | GPL24676 |
表1:研究中使用的数据集特征。 该表列出了批量RNA测序和单细胞RNA测序数据集的数据库编号、样本类型、对照样本与患者样本数量以及测序平台。RNA-seq,RNA测序;scRNA-seq,单细胞RNA测序。
使用 limma 软件包(版本 3.60.6)中的 normalizeBetweenArrays 函数校正批量转录组数据集的样本间变异。随后使用 limma 进行差异基因表达分析。差异表达基因(DEGs)的筛选阈值定义为 P < 0.05 且 |log₂ fold change| > 0.5。将获得的差异表达基因通过火山图和热图进行可视化,并分类为显著上调、显著下调或无显著变化。
2. 单样本基因集富集分析与加权基因共表达网络分析
使用255个钙调蛋白相关基因进行单样本基因集富集分析(ssGSEA)。采用GSVA软件包计算每个急性心肌梗死(AMI)样本和对照样本的钙调蛋白相关基因评分,记为Calmodulin_score。采用Wilcoxon秩和检验评估AMI组与对照组之间Calmodulin_score的差异。
采用急性心肌梗死(AMI)患者的批量转录组数据进行加权基因共表达网络分析(WGCNA)。排除每百万映射读段中每千碱基转录本的平均片段数(fragments per kilobase of transcript per million mapped reads)值≤0.5的基因。对样本进行聚类以识别并剔除离群值。
选择一个实现无尺度拓扑拟合且 R² > 0.8 的软阈值幂参数。随后构建拓扑重叠矩阵。使用动态树剪切算法识别基因模块,最小模块大小设定为 200。对于特征基因高度相似的模块,采用相关性阈值 > 0.75 进行合并,该值对应于 0.25 的模块合并阈值。
采用皮尔逊相关性分析评估模块特征基因与包括钙调蛋白评分(Calmodulin_score)在内的临床特征之间的关系。结果以热图形式展示模块与性状之间的关联,并标注相关系数及相应的 P 值。对每个基因计算其模块成员度和基因显著性。绘制模块成员度与基因显著性的散点图,以识别具有高模块内连接度和性状相关性的基因。
3. 急性心肌梗死相关钙调蛋白基因的鉴定
通过将差异表达基因(DEGs)与WGCNA模块中与钙调蛋白评分(Calmodulin_score)显著相关的基因取交集,鉴定出与急性心肌梗死(AMI)相关的钙调蛋白基因。重叠的基因被保留用于后续分析。
使用 clusterProfiler 软件包进行功能富集分析。通过基因本体(Gene Ontology)和京都基因与基因组百科全书(Kyoto Encyclopedia of Genes and Genomes)注释,鉴定与重叠基因相关的生物过程、分子功能、细胞组分以及信号通路。
4. 使用机器学习鉴定和验证关键基因
使用重叠基因进行单变量逻辑回归分析。随后,独立应用以下三种机器学习算法及其对应的 R 软件包和参数:随机森林、XGBoost 和支持向量机。
采用每种算法对具有急性心肌梗死(AMI)预测价值的基因进行优先排序。候选关键基因定义为三种算法共同识别出的基因。在GSE59867训练数据集和GSE48060外部验证数据集中均表现出显著且表达方向一致的差异表达的基因,被保留为最终的关键基因。
5. 诊断模型的构建与评估
使用鉴定出的关键基因和 lrm 函数构建了逻辑回归模型。通过 regplot 函数生成列线图,以展示每个特征基因对急性心肌梗死(AMI)预测概率的贡献。
采用 pROC 软件包进行受试者工作特征分析,以评估模型区分急性心肌梗死(AMI)样本与对照样本的能力。计算受试者工作特征曲线下面积,用于评价模型的区分效能。
通过生成校准曲线,比较预测概率与实际观察结果。采用决策曲线分析法,评估模型在不同阈值概率范围内的净临床获益。
6. 基因集富集分析与竞争性内源RNA网络构建
针对每个关键基因,分别使用其基因相关性矩阵和 clusterProfiler 软件包进行基因集富集分析。京都基因与基因组百科全书(KEGG)通路富集结果按绝对归一化富集评分排序。对每个基因展示排名前五的通路。
使用 GeneMANIA 分析功能关联和基因相互作用网络。利用 miRanda、miRTarBase、TargetScan 和 miRDB 预测关键基因的潜在 microRNA 调控因子。通过整合这四个数据库的预测结果,鉴定候选的 microRNA-mRNA 相互作用。
长链非编码RNA与miRNA的相互作用信息来自spongeScan。随后整合长链非编码RNA-miRNA以及miRNA-mRNA关系,构建竞争性内源RNA调控网络。该网络使用ggalluvial软件包以桑基图形式进行可视化展示。
7. 药物预测与分子对接
使用药物-基因相互作用数据库预测了药物与基因之间的相互作用。利用网络分析软件对所得的相互作用网络进行了可视化。
CCL4 的 UniProt 蛋白质标识符为 P13236。相应的三维蛋白质结构以蛋白质数据库格式(PDB)从数据库中获取,登录号为 1HUM(人源 MIP-1β,X 射线衍射结构),并选定用于分子对接。选择代表生物学相关单体的 A 链进行对接。使用 CB-Dock2 中的 Prepare Protein 模块对蛋白质进行预处理,包括去除水分子、添加极性氢原子以及分配 Gasteiger 电荷。候选化合物(氯膦酸和依泊汀 α)的三维化学结构从 PubChem 数据库中以结构数据文件(SDF)格式获取。分子对接模拟使用 CB-Dock2 在线平台进行,该平台采用 AutoDock Vina 算法执行盲对接。对接位点设定为覆盖整个蛋白质表面,以无偏倚地识别潜在的结合口袋。结合亲和力以预测的结合自由能(ΔG,单位为 kcal/mol)表示。最终的对接构象及蛋白质-配体相互作用(如氢键、疏水接触)使用 PyMOL 和 CB-Dock2 内置的相互作用查看器进行可视化分析。
8. 单细胞RNA测序数据预处理
在进行下游单细胞RNA测序分析之前执行了质量控制。当检测到的基因数量在200至10,000之间、总唯一分子标识符计数≥1,000且线粒体转录本比例≤20%时,保留相应细胞。
表达基因少于200个的细胞以及在少于三个细胞中被检测到的基因均被剔除。应用这些过滤条件以减少低质量细胞和技术噪声的影响。基因表达值使用Seurat软件包中的NormalizeData函数进行标准化。通过FindVariableFeatures函数鉴定高变基因。高变基因的表达值使用ScaleData函数进行中心化和标准化处理。
使用Harmony整合框架中的RunHarmony函数校正了与实验或测序变异相关的批次效应17。
9. 单细胞降维、聚类与注释
首先应用主成分分析来降低单细胞RNA测序数据集的维度。随后使用均匀流形近似与投影以及t分布随机邻域嵌入方法来可视化细胞异质性。
使用 Seurat 中的 FindNeighbors 和 FindClusters 函数对转录组相似的细胞进行分组。通过将每个簇与所有其余簇进行比较,利用 FindAllMarkers 函数鉴定各簇差异表达的标志基因。
使用来自已发表文献和已建立的细胞标志物数据库的经典标志基因对细胞类型进行注释。利用FeaturePlot功能可视化关键基因的空间分布和表达水平18。
10. 定量聚合酶链式反应分析
在中国安徽公共卫生临床中心,采集了8名急性心肌梗死(AMI)患者和8名健康对照者的外周血样本。AMI组患者根据第四版心肌梗死全球定义进行诊断,表现为符合心肌缺血的症状,且心肌肌钙蛋白I水平高于第99百分位参考上限。对照组包括年龄和性别匹配的健康个体,无心血管疾病病史,心电图正常,且常规血液检查、肝功能和肾功能均无异常。对于AMI患者,在入院后24小时内采集3 mL乙二胺四乙酸抗凝血。在相同的研究期间,从健康对照者采集相同体积的血液样本。
根据血液RNA提取试剂盒提供的说明书,从外周血中提取总RNA。使用NanoDrop分光光度计测定RNA浓度和纯度,并通过琼脂糖凝胶电泳检测RNA完整性。仅A260/A280比值在1.8至2.1之间的样品用于后续分析。取500 ng RNA,利用第一链cDNA合成试剂将其逆转录为互补DNA。将所得互补DNA稀释至终浓度为150 ng/mL。采用不含被动参比染料的SYBR Green预混液,在总反应体积10 µL的体系中进行定量聚合酶链式反应扩增。所有qPCR反应均设置两次技术重复,后续计算基于平均Ct值进行。
使用实时聚合酶链式反应仪器进行扩增。循环条件包括:95 °C 预变性 5 分钟,随后进行 40 个循环,每个循环为 95 °C 变性 10 秒,60 °C 退火 30 秒,72 °C 延伸 30 秒。扩增结束后进行熔解曲线分析。
基因表达水平以β-actin为内参进行标准化,相对表达量采用2−ΔΔCt法计算。
11. 统计学分析
统计分析在 R 中进行。网络可视化使用网络分析软件生成。组间差异采用 Wilcoxon 检验进行评估,除非另有说明。符合正态分布的连续变量采用 Student t 检验进行比较。不符合正态分布的连续变量采用 Mann-Whitney U 检验(也称为 Wilcoxon 秩和检验)进行比较。所有统计检验均为双侧检验。P 值 <0.05 被认为具有统计学显著性19。
访问受限。请登录或开始试用以查看此内容。
与急性心肌梗死相关的钙调蛋白相关基因的鉴定及富集分析
首先对GSE59867数据集进行批次效应校正,以确保不同样本间的可比性(图1A)。随后共鉴定出168个差异表达基因(DEGs),其中在急性心肌梗死样本中,77个基因上调,91个基因下调(图1B)。单样本基因集富集分析表明,急性心肌梗死组与对照组之间的钙调蛋白评分(Calmodulin_score)存在显著差异(图1C)。
使用加权基因共表达网络分析(WGCNA)构建共表达网络。根据无尺度拓扑准则(R² ≈ 0.8),软阈值幂次参数设定为 β = 17(图1D)。随后,基于特征基因相似性对模块进行层次聚类,合并模块间相关系数较低的模块。 >0.75 被合并(图1E–1F).
访问受限。请登录或开始试用以查看此内容。
急性心肌梗死(AMI)由急性冠状动脉闭塞引起,导致心肌缺血性坏死,在全球范围内具有较高的发病率和死亡率。钙调蛋白是一种钙依赖性调节蛋白,在细胞内信号转导中发挥关键作用。既往研究表明,钙调蛋白在AMI期间调控心肌细胞凋亡、炎症反应及钙稳态,提示其可能是AMI发病机制中的一个重要分子20。在本研究中,通过分析三个独立数据集,共鉴定出60个与钙调蛋白相关的差异表达基因,并采用加权基因共表达网络分析识别与AMI相关联的基因模块,最终筛选出六个关键基因。多种机器学习模型验证了这些基因的诊断价值,并在GSE48060数据集中通过表达趋势进一步得到支持。基因集富集分析显示,这些基因主要富集于免疫和代谢相关通路。免疫浸润分析表明,AMI患者体内免疫细胞群体存在显著异常,包括T细胞和自然杀伤细胞。单细胞转录组分析进一步显示,这些关键基因主要在CD8⁺ T细胞、自然杀伤细胞和促炎性单核细胞中表达。最后,通过药物预测与分子对接分析,鉴定出多个潜在的治疗化合物,为AMI的早期诊断和靶向治疗提供了新的见解。
在GSE59867数据集中,差异表达基因与模块相关基...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
本工作得到安徽医科大学研究基金(项目编号:2022xkj059)和安徽省转化医学研究院(项目编号:2021zhyx-C71)的资助。作者感谢所有在研究过程中提供协助和支持的同事。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| β-肌动蛋白引物 | Tsingke | N/A | 正向引物:5′-CATGTACGTTGCTATCCAGGC-3′ 反向引物:5′-CTCCTTAATGTCACGCACGAT-3′ |
| 校准 | rms | N/A | 参数:lrmModel,method = "boot",B = 1000 |
| CB-Dock2 | CB-Dock2 服务器 | 在线工具 | https://cadd.labshare.cn/cb-dock2/ |
| CCL4 引物 | Tsingke | N/A | 正向引物:5′-CTGTGCTGATCCCAGTGAATC-3′ 反向引物:5′-TCAGTTCAGTTCCAGGTCATACA-3′ |
| CIBERSORT | 斯坦福大学 | 在线工具 | 参数:function(sig_matrix, mixture_file, perm = 0, QN = TRUE)。采用Spearman相关性分析评估免疫细胞丰度与基因表达之间的关系。 |
| clusterProfiler | Bioconductor | 4.12.6 | https://bioconductor.org/packages/clusterProfiler |
| Cytoscape | Cytoscape 联盟 | 3.9.1 | https://cytoscape.org/ |
| 药物-基因相互作用数据库 | DGIdb | 在线数据库 | https://www.dgidb.org/ |
| 基因表达综合数据库 | NCBI | 在线数据库 | https://www.ncbi.nlm.nih.gov/geo/ |
| 基因本体数据库 | 基因本体联盟 | 在线数据库 | http://geneontology.org/ |
| GeneMANIA | 多伦多大学 | 在线工具 | https://genemania.org/ |
| GBP4 引物 | Tsingke | N/A | 正向引物:5′-AGGCTGCTAAAACACAAGCTG-3′ 反向引物:5′-CCCCAGGTAGAGTGACAATCAT-3′ |
| ggalluvial | CRAN | 0.12.5 | 桑基图生成 |
| GSVA | Bioconductor | 1.52.3 | 参数:P < 0.05 |
| Harmony 整合框架 | CRAN | 1.2.0 | https://github.com/immunogenomics/harmony |
| Hifair III 第一链 cDNA 合成超混合液 | YEASEN | 11141ES10 | 逆转录试剂 |
| Hieff qPCR SYBR Green Master Mix | YEASEN | 11201ES | qPCR 试剂 |
| 人类蛋白质图谱 | 人类蛋白质图谱联盟 | 在线数据库 | https://www.proteinatlas.org/ |
| KPNA5 引物 | Tsingke | N/A | 正向引物:5′-TCAAGAGATGCGTAGACGAAGA-3′ 反向引物:5′-ACATTTCTGCGTTTGAACAACTG-3′ |
| 京都基因与基因组百科全书数据库 | Kanehisa 实验室 | 在线数据库 | https://www.kegg.jp/ |
| LightCycler 480 仪器 II | 罗氏 | LightCycler 480 II | 实时 PCR 仪器 |
| limma | Bioconductor | 3.60.6 | 差异表达基因筛选 |
| lrm | rms | N/A | 参数:Type ~ SOCS3 + GBP4 + ST14 + KPNA5 + STAB1 + CCL4,data = aSAH,maxit = 100 |
| miRanda | MicroRNA.org | 在线工具 | http://www.microrna.org/microrna/home.do |
| miRDB | miRDB | 在线工具 | http://mirdb.org/ |
| miRTarBase | 台湾交通大学 | 在线数据库 | https://mirtarbase.cuhk.edu.cn/ |
| 蛋白质数据库 | RCSB | 在线数据库 | https://www.rcsb.org/ |
| PubChem | NCBI | 在线数据库 | https://pubchem.ncbi.nlm.nih.gov/ |
| PyMOL | Schrödinger, LLC | 2.5.4 | 分子对接结果的可视化 |
| pROC | CRAN | 1.18.5 | 受试者工作特征曲线生成与可视化 |
| 随机森林包 | CRAN | 3.3.1 | 参数:ntree = 100,seed = 200 |
| R 软件 | R 基金会 | 4.2.2 | 生物信息学与统计分析 |
| regplot | CRAN | 1.1 | 参数:glm(Status ~ gene, family = binomial(), data = merged_data);lrm(Type ~ SOCS3 + GBP4 + ST14 + KPNA5 + STAB1 + CCL4, data = aSAH, maxit = 100) |
| rmda | CRAN | 1.6 | 参数:decision_curve(Type ~ SOCS3 + GBP4 + ST14 + KPNA5 + STAB1 + CCL4, data = aSAH, family = binomial(link = "logit"),thresholds = seq(0, 1, by = 0.01),confidence.intervals = 0.95) |
| RNA 提取试剂盒 MolPure 血液 RNA 提取试剂盒 | YEASEN | 19241ES50 | RNA 提取试剂盒 |
| Seurat | Satija 实验室 | 5.1.0 | 用于细胞注释的标记基因:单核细胞:FCN1, S100A9, S100A8;B 细胞:CD79B, MS4A1;T 细胞:LDHB, CD4, CD3D;NK 细胞:FGFBP2, GZMB, NKG7, KLRD1;巨核细胞:CD163, CD36, PF4, PPBP;血细胞:ALAS2, AHSP, CA1;浆细胞:IGHA1, CD79A, MZB1, JCHAIN;树突状细胞:HLA-DMB, HLA-DPA1, HLA-DQB1;肥大细胞:FCER1A, MS4A2 |
| SOCS3 引物 | Tsingke | N/A | 正向引物:5′-CCTGCGCCTCAAGACCTTC-3′ 反向引物:5′-GTCACTGCGCTCCAGTAGAA-3′ |
| spongeScan | spongeScan | 在线工具 | http://spongescan.rc.ufl.edu/ |
| ST14 引物 | Tsingke | N/A | 正向引物:5′-TTCCTGCCAGTCAACAACGTC-3′ 反向引物:5′-GGTACTGCAAATGCCACACC-3′ |
| STAB1 引物 | Tsingke | N/A | 正向引物:5′-CCGGGAAATCCTTACCACAGC-3′ 反向引物:5′-ACCTTCGTGTTTGTTGGGTCC-3′ |
| 支持向量机包 | CRAN | 1.7-13 | 参数:input, k = 10, halve.above = 100 |
| survminer | CRAN | 0.5.0 | 生存曲线绘制 |
| TargetScan | TargetScan | 在线工具 | http://www.targetscan.org/ |
| UniProt | UniProt 联盟 | 在线数据库 | https://www.uniprot.org/ |
| 加权基因共表达网络分析包 | CRAN | 1.73 | 参数:R² > 0.8,minModuleSize = 200 |
| XGBoost 包 | CRAN | 1.7.8.1 | 参数:nrounds = c(50, 200),max_depth = c(3, 8),eta = c(0.01, 0.3) |
访问受限。请登录或开始试用以查看此内容。