$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
分析工作流程概述
本研究基于转录组和机器学习的整体分析设计如 图1所示,涵盖关键步骤:采集肾素-血管紧张素系统相关基因(RASRGs);从高血压数据集中筛选RAS相关差异表达基因(RASRDEGs);功能富集分析(GO/KEGG/GSEA);免疫浸润分析(CIBERSORT);构建蛋白质间相互作用(PPI)及调控网络;基于机器学习的关键基因选择(逻辑回归、随机森林[RF]);以及高血压诊断模型的评估。本研究中使用的完整软件、数据库和在线工具清单见 材料表。
数据下载
高血压数据集GSE753608和GSE74144(智人)通过R软件包GEOquery9从GEO数据库10获取。来自外周血单核细胞的产GSE75360(平台:GPL10558)包括10个高血压样本和11个对照样本;GSE74144来自白细胞(平台:GPL13497)包括14个高血压样本和8个对照样本(见表1)。最初通过GeneCards11(关键词:“Renin-Angiotensin System”)和PubMed(关键词:“Renin-Angiotensin System”)12,13识别出编码蛋白的RASRGs(1,264)。这些RASRG与GSE75360/GSE74144基因的交汇产生了1,159个最终RASRG14。这两个数据集分别处理,因为它们是在不同的微阵列平台上生成的。探针注释根据对应的GPL平台注释文件进行,下游分析则使用归一化的基因表达矩阵。使用箱形图比较归一化前后表达式分布。
高血压相关肾素-血管紧张素相关差异表达基因
GSE75360数据集中的样本被分为高血压组和对照组。Limma软件被用于两组之间的差异基因表达分析14,差异表达基因(DEGs)通过|logFC|的阈值识别。>0.45,p值<0.05。该差分分析结果通过火山图(使用R ggplot2软件生成)可视化。
为获得RASRDEGs,满足上述阈值(|logFC| > 0.45,p值<0.05)的DEGs与RAS相关基因(RASRGs)交叉比对,交叉结果通过维恩图呈现。随后,利用R包热点图将已鉴定的RASRDEG表达图可视化为热图,RASRDEGs的染色体定位则通过R包RCircos15生成的染色体图显示。
差异表达基因验证与ROC曲线分析
构建组间图以分析GSE7536016中高血压与对照组间RASRDEG表达差异,使用R包装pROC绘制ROC曲线并计算RASRDEG诊断效能的AUC(0.5–0.7:低准确率;0.7–0.9:中等;>0.9:高)。
相关分析
Spearman的相关分析对GSE75360中RASRDEG表达进行了;结果通过热图(R 包 ggplot2)可视化(|r| < 0.3:无/弱相关;0.3–0.5:弱;0.5–0.8:中等;>0.8:强)。
GO和KEGG的浓缩分析
GO(基因本体,2024年发布,http://geneontology.org/)是一个广泛用于大规模功能富集的资源,涵盖三个领域:生物过程(BP)、细胞组分(CC)和分子功能(MF)17。KEGG(京都基因与基因组百科全书,2024年第109.0版,https://www.genome.jp/kegg/)存储有关基因组、生物通路、疾病和药物的数据18。
RASRDEGs通过R套件clusterProfiler19对GO注释和KEGG通路富集分析进行了分析。富集测试方法:超几何测试;多重测试校正法:Benjamini-Hochberg(BH)方法。筛选标准:调整后的p值<0.05。
基因集富集分析(GSEA)
对于队列级GSEA,所有在差异表达GSE75360分析中检测的基因均按logFC降序排序,并作为clusterProfiler19的输入基因列表。在GSEA之前,没有进行DEG预过滤。来自MSigDB20的c2基因集。参数:种子 = 2022,每组10–500个基因;筛查标准:校正p < 0.05(Benjamini-Hochberg,BH方法),FDR < 0.2521.
高血压诊断模型的构建
为了识别与高血压相关的关键基因,我们采用了两种机器学习算法:逻辑回归和随机森林(RF)。逻辑回归(二元因变量:高血压/对照组)筛查p <0.05的RASRDEGs。随机森林(RF,R package randomForest):参数 set.seed(520), ntree = 1000;提取了MeanDecreaseGino(变量重要性指标),并选定了前15名RASRDEGs。RASRDEG的标准值为0.05<筛查。
RF(随机森林)算法是一种属于Bagging类别的集合学习方法(集成多重决策树),通过R包randomForest22 (参数:set.seed(520),ntree = 1000)应用。提取了特征基因的MeanDecreaseGini(通过节点分裂时平均纯度下降反映变量重要性),并选出了前15个RASRDEGs。最后,绘制了通过逻辑回归和射频过滤的基因维恩图,以识别与高血压相关的关键基因。
高血压诊断模型的验证
基于关键基因构建了逻辑回归模型;线性预测值(η)的计算方式如下:

使用R套件pROC16 绘制ROC曲线并评估模型在预测高血压风险方面的有效性。通过R软件包rms23 构建了一组名录图,以可视化每个关键基因对逻辑回归模型的贡献(反映关键基因与高血压风险之间的关联)。生成校准曲线以评估预测高血压概率与实际高血压概率之间的一致性;进行了决策曲线分析(DCA,R 套件 ggDCA24)以评估模型在GSE75360和GSE74144中的临床效用(净收益)。
单基因 GSEA
GSEA通过分析特定基因的表达,探讨与特定基因相关的基因在生物过程/通路/疾病中的作用,有助于理解该基因的功能作用。GSE75360中每个焦点基因,样本在中位数被分为高表达组和低表达组。随后对所有检测基因进行了差异表达分析,并在GSEA前使用clusterProfiler19从高到低对全基因组logFC值进行排名。在GSEA之前,没有进行DEG预过滤。参数:seed = 2020,每组10–500个基因(来自MSigDB21的c2基因集集合)。筛查标准:p < 0.05(通过BH法修正的p)。
免疫浸润分析(CIBERSORT)
CIBERSORT算法25 (基于线性支持向量回归)对转录组矩阵进行了去卷积,以估算混合样本中的免疫细胞组成(选取免疫细胞富集得分为>0的数据)。通过比例条形图可视化了GSE75360的最终免疫细胞浸润矩阵。斯皮尔曼相关分析被用于分析免疫细胞-免疫细胞及关键基因-免疫细胞的关联,结果分别以相关热图(R 包热图)和相关气泡图(R 包 ggplot2)呈现。
蛋白质间相互作用(PPI)网络
PPI网络是由相互连接的蛋白质组成,通过相互作用调控生物过程。利用STRING数据库26,构建了关键基因的PPI网络(最低交互得分:0.150,置信度低)。通过筛选相互作用基因,筛选了与肾素-血管紧张素相关的枢纽基因。GeneMANIA数据库27利用基因组和蛋白质组数据集识别功能相似基因,用于预测关键RAS基因的功能相似基因,并构建蛋白质相互作用网络。
监管网络的构建
mRNA-TF网络:转录因子(TFs)通过转录后与目标基因的相互作用调控基因表达。从ChIPBase数据库检索了针对枢纽基因及其调控关系的转录因子(TFs),并利用Cytoscape29可视化了mRNA-TF网络。
mRNA-miRNA网络:miRNA调控多个靶基因(单个靶点可能被多个miRNA共同调控)。使用StarBase v3.030 识别与RASRDEG相关的miRNA,并通过Cytoscape可视化mRNA-miRNA网络。
mRNA-药物网络:使用31 个毒理基因组数据库预测枢纽基因的直接/间接药物靶点。用Cytoscape可视化了mRNA-药物网络(显示基因-药物相互作用),完成了网络构建。
Ang II诱导的HUVEC模型
人类脐静脉内皮细胞(HUVECs)在含5%CO2的加湿培养箱中保持在37°C。细胞按照供应商指示,在完整的内皮细胞培养基中保存,并补充胎儿牛血清和抗生素。为建立体外高血压相关内皮损伤模型,HUVECs接受血管紧张素II(Ang II;100 nM)治疗48小时。使用车辆处理细胞作为对照组。
在基因干预实验中,利用商用转染试剂(oe-CST3和oe-FURIN)靶向CST3或FURIN的小干扰RNA(si-CST3和si-FURIN)、对应的负面对照siRNA(si-NC)、CST3或Furin过表达质粒(oe-CST3和oe-FURIN)及相应的空载体对照(oe-NC)转染到HUVEC中。转染后,细胞暴露于Ang II,然后采集以进行表达验证和功能检测。qRT-PCR和西方墨迹法证实了敲低和过表达效率。
qRT-PCR
使用标准RNA提取试剂从HUVECs中分离出总RNA,并利用逆转录试剂盒生成互补DNA。SYBR绿色化学用于qRT-PCR。LRP1、CTSD、MTHFR、AUTS2、FURIN、CST3、FCER1G、TBXAS1、IL-6、TNF-α、VCAM1、ICAM1和eNOS的表达水平均归一为GAPDH,并采用2−ΔΔCt方法计算。
西部污点
对于西部墨迹分析,蛋白质通过RIPA溶解缓冲液提取,并用BCA检测法定量。等量蛋白质通过SDS-PAGE分辨并转移到PVDF膜上。阻断后,膜与针对CST3、FURIN、TBXAS1或GAPDH的初级抗体一起孵育,随后与合适的二级抗体一起孵育。通过化学发光检测到条带,密度测量结果归一为GAPDH。培养上清液中分泌的CST3,按照制造商的方案使用ELISA试剂盒进行定量。
细胞存活率
细胞存活率使用细胞计数套件-8(CCK-8)检测法进行评估。简要地,转染和Ang II处理的HUVEC被植入96孔板中,加入CCK-8试剂后0、24、48和72小时测量了450纳米处的吸收率。细胞迁移使用透孔腔评估。在所指示的干预措施后,细胞被播种到上腔,移动到下膜表面的细胞被固定、染色,并在随机选定的田野中显微镜下计数。
炎症测试
评估炎症激活、氧化应激和内皮功能,IL-6、TNF-α、VCAM1、ICAM1和 eNOS。mRNA水平通过qRT-PCR检测。使用商业一氧化氮检测试剂盒测量培养上清液中的一氧化氮(NO)水平,并根据制造商说明使用DCF荧光检测细胞内活性氧(ROS)水平。
统计分析
在R中进行了转录组处理和建模。连续变量使用Shapiro-Wilk检验评估其正常性。对于两组比较,正态分布变量使用独立样本t检验,而非正态变量则使用Wilcoxon秩和检验。对于三组或更多组,当方差假设的正态性和均匀性均成立时,采用了适当的事后检验进行方差单向分析;否则,则采用Kruskal-Wallis检验。CCK-8时间程数据采用双向方差分析进行分析。计算了斯皮尔曼相关系数以进行关联分析。除非另有说明,实验结果均值显示为平均值±标准差,双尾p<0.05被视为显著。