$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
本项基于数据库的计算研究不涉及人类受试者、动物实验或临床样本。根据中国《涉及人的生命科学和医学研究伦理审查办法》第三十二条,使用合法获取的公开数据、不会对受试者造成伤害、不涉及敏感个人信息且无商业利益的研究,可免除伦理审查。因此,本研究无需获得伦理批准。
本研究的实验设计和分析流程如流程图所示(图1)。

图1:本研究的整体工作流程。 该流程图展示了网络药理学与分子对接分析的逐步流程,包括四神汤(SSD)活性成分及其靶点的获取、痛风相关靶点的收集、共同靶点的识别、药物-成分-靶点-疾病网络及蛋白质-蛋白质相互作用(PPI)网络的构建、基因本体(GO)与京都基因与基因组百科全书(KEGG)富集分析,以及分子对接模拟。请点击此处查看该图的放大版本。
SSD 活性成分及靶蛋白的获取
2026年1月2日,从中药系统药理学数据库(TCMSP)中检索了构成 SSD 的五味中药——黄芪(Huangqi)、远志(Yuanzhi)、怀牛膝(Huainiuxi)、石斛(Shihu)和金银花(Jinyinhua)的活性化学成分21。根据药代动力学特性设定筛选标准:口服生物利用度(OB)≥30%,类药性(DL)≥0.1822。符合上述标准的成分为潜在活性成分。随后收集各成分对应的作用靶点。由于 TCMSP 数据库中远志和石斛的数据不完整,于同日从 Herb 2.0 数据库中补充检索这两种药材的化学成分。获得成分名称后,以成分名称及其对应的 CAS 号作为关键词,在 TCMSP 数据库中进行反向检索以获取靶点信息。对于从 Herb 数据库中获得的化合物,仅保留能通过成分名称或 CAS 号成功匹配至 TCMSP 条目的化合物。将匹配成功的化合物利用 TCMSP 数据进行相同的药代动力学筛选(OB ≥ 30%,DL ≥ 0.18),缺乏完整 OB 或 DL 数据的化合物予以剔除。所有经匹配和筛选后的化合物均通过人工核对原始 Herb 2.0 记录,以防止误判。随后,将来自 Herb 数据库的靶点信息与其余药材的靶点信息合并,构建 SSD 完整的活性成分作用靶点集合。
所有检索到的靶蛋白均使用 UniProt 数据库标准化为官方基因符号。通过仅保留经人工审阅的人类条目(Swiss-Prot)并排除未经审阅的条目(TrEMBL),建立了一一对应关系。当多个同工型对应同一基因符号时,选择经典同工型。标准化后的靶蛋白数据集被保留用于后续的交叉基因分析。
痛风相关靶点的收集
2026年1月2日,以“痛风”为疾病关键词,在GeneCards数据库和OMIM数据库中系统性检索,获取与痛风相关的疾病靶点。将两个数据库获得的靶点导出至WPS表格(版本12.1.0)。将OMIM数据库的“Gene Symbol”列与GeneCards数据库的“Gene Symbol”列并列放置,通过“删除重复项”功能,基于官方基因符号进行不区分大小写的精确匹配,去除重复靶点。随后合并两个数据库的靶点,构建一套全面的痛风相关疾病靶点集合。
药物-疾病共同靶点的鉴定
将通过活性成分筛选获得的药物靶点集合与痛风相关疾病靶点集合置于同一项目文件夹(D:\Venn)中。启动R软件(版本4.4.0),使用readxl包导入包含靶点列表的Excel(.xlsx)文件。利用dplyr包进行数据处理,包括在交集分析前对列进行筛选和重命名。随后将两个靶点集转换为字符向量,并使用VennDiagram包中的calculate.overlap()函数识别重叠靶点。VennDiagram包通过命令install.packages("VennDiagram")从CRAN安装,并存储于R默认的库路径中。若出现提示该包已安装的消息,则视为安装成功。使用命令setwd("D:\\Venn")设置工作目录,指定为包含输入文件的文件夹,并作为输出目录。随后运行R脚本,计算药物靶点集与痛风相关疾病靶点集之间的交集。所得的共同靶点被定义为 SSD 治疗痛风的潜在治疗靶点。
构建“药物-成分-靶点-疾病”网络
通过SSD靶点与痛风相关靶点的交集所确定的交集基因保存为overlapping_targets.txt文件,SSD的活性成分信息保存为drug_components.txt文件。这两个文件均放置于项目文件夹(D:\Network)中,该文件夹作为分析的工作目录。为确保可重复性,本分析使用R语言完成。数据读取、筛选和合并操作结合使用了R基础函数(包括read.table()、write.table()和merge())以及dplyr包进行数据框处理。执行命令setwd("D:\Network")以明确设定工作目录。
graph_from_data_frame() 函数被用作核心整合函数。drug_components.txt 文件的每一行使用官方基因符号将一个活性成分与其对应的目标基因进行关联。仅保留出现在 overlapping_targets.txt 中的目标基因,除交集要求外未进行任何额外筛选。最终生成的网络数据集以边列表格式导出为 network.txt。每一行包含两列(node1 和 node2),其中 node1 表示 SSD 处方或某个活性成分,node2 表示某个活性成分或目标基因。疾病节点(“痛风”)通过一条独立的边与 SSD 处方相连。未设置边的权重,所有边均被同等对待(边宽 = 0.8)。
将 network.txt 文件导入 Cytoscape(版本 3.7.2)网络可视化软件中。通过 工具 → 网络分析 → 分析网络 调用内置的 NetworkAnalyzer 工具,以获取基本网络结构,并选择“度分布”作为分析框架。根据节点类型设定节点的形状和颜色:蓝色菱形代表 SSD 处方,蓝色矩形代表活性成分,橙色椭圆代表疾病靶点基因,红色八边形代表痛风疾病实体。节点大小与节点度数成正比(节点大小 = 30 + 度数 × 5,最大大小为 100)。
蛋白质-蛋白质相互作用(PPI)网络的构建
于2026年1月2日,将筛选后获得的交集靶基因集合导入STRING数据库(版本12.0)。限定物种为Homo sapiens,最低相互作用置信度阈值设为高置信度(0.700),隐藏无连接的蛋白质,相互作用来源包含所有可用的证据通道,其余参数均保持默认设置,以获取已知和预测的蛋白质-蛋白质相互作用。使用默认导出选项,将所得网络数据以制表符分隔值(TSV)格式导出。
导出的网络被导入网络可视化软件中进行可视化和拓扑分析。使用内置的 NetworkAnalyzer 工具(工具 → 网络分析 → 分析网络)计算网络属性。计算的指标包括度值、介数中心性以及接近中心性。节点大小通过连续映射函数与度值关联(节点大小 = 20 + 度 × 3,最大大小 = 80)。
通过将所有节点按度值降序排列来确定枢纽靶点。度值较高的节点被认为在网络中更为中心。孤立节点(度值 = 0)被排除在可视化之外。网络布局根据节点连接性从中心向外呈同心圆排列,节点颜色使用从蓝色到青色的渐变表示度值的增加。该网络用于识别与 SSD 抗痛风潜在治疗作用相关的核心枢纽靶点。
基因本体(GO)富集分析
基于鉴定出的重叠靶基因,使用 R 语言进行基因本体(GO)功能富集分析。将所需的 Bioconductor 软件包安装至默认的 R 库路径,并加载到分析环境中。交集基因文件保存在项目目录(D:\GO)中,并使用 setwd() 函数设定工作目录。
基因标识符的转换与注释使用 Bioconductor 软件包 org.Hs.eg.db(版本 3.20.0)完成。利用 clusterProfiler 富集分析包(版本 4.21.0)中的 bitr() 函数,将官方基因符号转换为 Entrez 基因 ID。仅保留具有一一对应唯一映射关系的基因用于后续分析,而存在歧义或无法映射的条目则被排除。
使用富集分析软件包进行GO富集分析。采用enrichGO()函数对生物过程(BP)、细胞组分(CC)和分子功能(MF)三个本体类别进行分析。通过Benjamini–Hochberg多重检验校正方法确定统计学显著性,以校正后P值< 0.05作为显著性阈值。
对于每个本体类别,根据富集因子对显著富集的条目进行排序:
EF = (基因计数 / 背景基因总数)÷ (条目大小 / 基因组基因总数)
选择前 10 个术语进行详细分析。当富集因子相同时,以较低的校正 P 值者优先排序。
使用 ggplot2(版本 3.5.1)和 enrichplot(版本 1.24.0)对富集结果进行可视化。通过 dotplot() 和 barplot() 函数生成气泡图和条形图。气泡大小表示富集基因的数量,颜色则对应以 −log10(校正后 P 值) 表示的富集显著性。所有图表均采用默认绘图参数。
KEGG通路富集分析
使用R语言及前述富集分析软件包,对SSD与痛风交集靶点进行KEGG通路富集分析。利用富集分析软件包提供的bitr()函数,将基因符号转换为KEGG兼容的标识符,并以KEGG作为注释资源。通过enrichKEGG()函数基于超几何检验进行通路富集分析。采用Benjamini–Hochberg(BH)多重检验校正方法确定统计学显著性,以校正后P值< 0.05的通路为显著富集通路。
使用 openxlsx 软件包(版本 4.2.8.1)中的 write.xlsx() 函数,将富集结果导出为与 Microsoft Excel 兼容的工作簿文件,用于后续审阅和图表制作。
随后使用网络可视化软件构建了多层次靶点-通路相互作用网络。通过“文件 → 导入 → 从文件导入网络”功能导入网络数据。节点包括靶基因节点和显著富集的KEGG通路节点(BH校正后P值 < 0.05),边则表示富集分析过程中识别出的靶基因与富集通路之间的已知关联关系。网络可视化通过网络可视化软件的“样式”面板完成,其中靶基因以灰色椭圆表示,通路以青色矩形表示。未使用任何附加插件。该网络根据富集分析结果表格手动构建,用于展示核心靶点与显著富集通路之间的关系。
分子对接验证
从TCMSP数据库下载了“药物–成分–靶点–疾病”网络中按靶点连接度排序的前10个活性成分的三维结构文件(MOL2格式)。靶点连接度定义为节点度(即网络中某一活性成分与靶基因之间直接连接的数量)。根据节点度值从高到低对活性成分进行排序,并选取前10个成分进行分子对接分析。
从PPI网络中鉴定出的前10个核心靶标蛋白的晶体结构于2026年1月23日从RCSB蛋白质数据库(PDB)获取,物种限定为Homo sapiens。针对每个靶标蛋白,优先选择晶体分辨率最高(Å值最低)、无突变、并与天然配体或抑制剂共结晶的结构。若多个结构均满足上述条件,则选择分辨率最高且蛋白序列覆盖度最完整的结构。所使用的PDB结构如下:1GKC(MMP9)、5WHH(BCL2)、2P33(JUN)、1RHJ(CASP3)、1WT5(EGFR)、7APJ(AKT1)、1DU3(TNF)、1T4Q(IL1B)、4NI9(IL6)和9CKJ(TP53)。
采用 CB-Dock 2 在线服务器(网页版,访问时间:2026 年 1 月 23 日)进行分子对接模拟,该服务器以 AutoDock Vina 作为对接引擎。蛋白质结构由服务器自动预处理,包括去除异质原子和受体结构的准备。配体以 MOL2 格式上传。采用无需模板的空腔检测方法,每种蛋白质结构自动识别出五个潜在的结合空腔。对接计算使用对接引擎的默认参数:搜索穷尽性(exhaustiveness)= 8,能量范围(energy range)= 4,最大结合构象数(maximum number of binding modes)= 9。
针对每个靶标-化合物对,分别在所检测到的五个空腔中的每一个内独立进行分子对接。使用对接引擎的打分函数评估对接构象,并保留每个空腔内结合能最低的构象作为该空腔的代表性构象。在五个代表性构象中,选择全局结合能最低的对接构象作为该靶标-化合物对的最终对接结果,并用于后续分析。
将每次分子对接结果所得的最低结合能数值记录在电子表格中,并导入至微生信在线绘图平台(访问时间:2026年1月23日),使用默认参数生成热图。该热图采用从黄色到红色的渐变色,聚类方法为完全连接层次聚类,聚类距离度量为欧氏距离。
氢键相互作用由对接服务器分析模块根据几何标准自动识别。氢键定义为供体-受体距离 ≤ 3.5 Å 且供体-氢-受体角度 ≥ 120° 的相互作用。在二维和三维相互作用图中,氢键以虚线表示。在所有对接组合中,选择结合能全局最低的目标蛋白-活性成分对进行详细的相互作用分析。该选择基于单一的目标-化合物对,而非单个对接构象,旨在识别网络中预测最强的相互作用。最终代表性的对接构象对应于此目标-化合物对,用于可视化和相互作用分析。
分别使用 ChimeraX 版本 1.5 和 LigPlot+ 版本 2.2 生成三维和二维相互作用图。在 ChimeraX 中,蛋白质采用默认的卡通表示模式显示,配体以棍状模式显示,氢键以虚线表示,并应用默认配色方案。在 LigPlot+ 中,使用 HBPLUS 算法进行氢键识别,供体–受体距离阈值设为 3.9 Å,角度阈值设为 90°。所有其他可视化参数均保持其默认设置。