我们通过计算分析网络毒理学和转录组学数据,以鉴定对乙酰氨基酚诱导肝损伤的生物标志物,揭示雌激素受体1和嘌呤核苷磷酸化酶作为诊断靶点。
研究文章
我们通过计算分析网络毒理学和转录组学数据,以鉴定对乙酰氨基酚诱导肝损伤的生物标志物,揭示雌激素受体1和嘌呤核苷磷酸化酶作为诊断靶点。
对乙酰氨基酚引起的肝损伤是一个重要的公共卫生问题,但目前尚缺乏可靠的早期生物标志物。本研究旨在通过整合网络毒理学、转录组学和机器学习的计算方法,识别对乙酰氨基酚诱导肝毒性的候选生物标志物。利用在线平台预测潜在的对乙酰氨基酚作用靶点,获得140个候选基因。从GeneCards数据库中检索到与肝毒性相关的基因(n = 657),并鉴定出38个重叠基因。分析了GSE74000数据集中差异表达的基因(n = 1,978)。通过功能富集分析确定相关通路。采用随机森林模型筛选出20个特征基因,并通过分子对接评估这些基因编码蛋白与对乙酰氨基酚的结合亲和力。差异表达基因主要与线粒体功能障碍和核糖体生物合成相关。功能富集分析突出显示了外源性物质代谢和氧化应激通路。雌激素受体1(Estrogen receptor 1)和嘌呤核苷磷酸化酶(purine nucleoside phosphorylase)为排名最高的特征基因,显示出显著的表达差异以及与对乙酰氨基酚较强的分子对接相互作用。该计算流程系统地预测了对乙酰氨基酚诱导肝损伤的候选生物标志物,为后续实验验证提供了分子机制见解和候选基因。
对乙酰氨基酚(APAP)是一种广泛使用的退热镇痛药,但过量摄入可导致严重肝毒性,甚至可能引发肝功能衰竭1,2肝脏损伤预计在药物代谢后发生,其后续产生的毒性代谢产物为N-乙酰基-p-苯醌亚胺(NAPQI),可导致线粒体氧化应激、线粒体呼吸功能改变以及线粒体通透性转换,最终引发坏死性而非凋亡性的肝细胞死亡。3,4对乙酰氨基酚(APAP)过量仍是许多国家急性肝衰竭(ALF)的首要原因。流行病学数据显示,在美国,APAP毒性几乎占ALF病例的50%,每年导致数千例急诊入院。全球范围内也报告了类似趋势,与APAP相关的肝毒性构成了药物性肝损伤(DILI)病例的主要部分。5,6高发病率、肝移植风险及沉重的医疗负担凸显了对乙酰氨基酚(APAP)所致肝损伤的诊断生物标志物和作用机制研究的迫切需求。具体而言,APAP被吸收后主要在肝脏通过葡萄糖醛酸化和硫酸化代谢,生成水溶性结合物并经尿液排出。其中少量(10–15%)经细胞色素P450(CYP450)介导的羟基化反应代谢。通过 酶(如CYP1A2、CYP2E1和CYP3A4)生成活性中间产物NAPQI,后者与谷胱甘肽结合后经胆汁排泄7,8由于葡萄糖醛酸化和硫酸化途径的代谢能力有限,过量给药会导致NAPQI生成增加,同时耗竭肝内谷胱甘肽储备9一旦谷胱甘肽耗竭至临界水平,NAPQI 即开始共价结合于细胞大分子,导致肝细胞损伤10对乙酰氨基酚(APAP)过量相关的毒性事件日益增加,仅在美国每年就有约50,000至80,000例急诊就诊。11由于氧化应激和线粒体功能障碍在对乙酰氨基酚(APAP)诱导的肝毒性中起核心作用,ESR1的失调可能间接影响APAP损伤过程中肝细胞的存活及炎症反应。APAP毒性可诱导肝细胞产生代谢应激和炎症激活。PNP表达水平的变化可能反映了APAP诱导肝损伤期间核苷酸代谢及免疫相关反应的改变。
关于对乙酰氨基酚(APAP)诱导肝毒性的早期报道主要关注肝脏和肾脏的临床症状及病理改变,为后续研究APAP毒性中细胞死亡和炎症的机制奠定了基础12,13。其中一项关键突破是发现血清转氨酶(如ALT和AST)可作为肝损伤的生物标志物。随着细胞培养模型和生物信息学工具的出现,当前对APAP肝毒性的研究已扩展至包括诊断性、预后性和机制性生物标志物在内的多个方面14,15,16。然而,获取足量的APAP过量患者血清或血浆样本,尤其是非存活患者的样本,仍然具有挑战性17。因此,迫切需要采用新方法探索新的诊断性、预后性和机制性生物标志物,以更深入地研究APAP诱导的肝毒性。
网络毒理学是一个新兴领域,通过构建网络模型来分析来自化合物数据库的毒理学数据18,19。该方法有助于表征物质的毒性、揭示毒性机制并预测关键靶点20,21。目前,网络毒理学已被广泛认为是科学研究中一种有价值的工具。例如,Tengjiao Qu 等人将网络毒理学与转录组学相结合,识别出2,2',4,4'-四溴二苯醚(一种常见的阻燃剂)新的神经毒性机制及其潜在生物标志物22。近期研究也强调了该方法在评估天然产物毒性的应用中的重要性23。然而,这一创新的研究范式尚未被用于探索对乙酰氨基酚(APAP)诱导肝毒性的潜在机制,也未用于识别与其毒性相关的新生物标志物。
IntelliGenes 是一种用于多基因组生物标志物发现的机器学习分析流程24。该流程结合统计学方法与先进的机器学习技术,用于计算 I-Gene 评分并生成个体化的生物标志物谱型。研究结果表明,其在复杂性状预测和实现个性化疾病洞察方面具有更高的准确性。局限性包括对数据质量的依赖性、在不同人群中的验证有限,以及需要更广泛的临床测试。
重点在于目前胰腺导管腺癌(PDAC)的生物标志物尚不充分,因此提出将患者来源的类器官(PDOs)作为生物标志物开发的功能性平台25。本文评估了基于PDO的药物表型分析、化疗耐药建模、共培养系统以及蛋白质组学/代谢组学分析。研究结果表明,PDO能更准确地捕捉与治疗相关的生物学特征,但其局限性包括技术上的变异性、对微环境模拟有限、培养周期较长,以及在常规临床应用中整合困难26,27。
本研究旨在评估蛋白质组学分析方法以及生物信息学在生物标志物鉴定中的作用28。研究评价了计算工具在数据解读中的辅助作用,并考察了基于质谱(MS)的蛋白质分析技术。结果表明,生物标志物的发现能力得到提升,并揭示了新的治疗靶点,但也明确指出极低丰度蛋白质的鉴定仍具挑战性,从而限制了现有蛋白质组学技术的灵敏度。尽管对乙酰氨基酚(APAP)诱导肝毒性的多种诊断性、机制性和预后性生物标志物已被充分确立,但这些标志物主要反映的是毒性发生后的肝细胞损伤或线粒体功能障碍29,30。相比之下,本研究旨在鉴定可能调节个体对APAP暴露易感性或宿主反应的转录组调控因子。因此,ESR1和PNP被作为探索性调控标志物而非经典的诊断性生物标志物进行研究。
为解决现有方法学中存在的固有局限性——特别是类器官(PDO)培养的变异性以及蛋白质组学的灵敏度问题——本研究采用了一种整合的计算框架,该框架包含网络毒理学、转录组学、机器学习和分子对接技术。这一多层次策略通过计算预测与多组学交叉验证,避免了对大规模队列或复杂实验系统的依赖。该组合策略的理论依据在于,各项技术相互支持,以最大限度减少假阳性结果:首先,网络毒理学从系统层面预测与对乙酰氨基酚(APAP)相关的靶点及毒性通路;随后,转录组分析验证这些预测基因中哪些在肝毒性过程中确实发生异常调控;接着,机器学习算法从高置信度候选集中优先筛选出最具信息价值的生物标志物;最后,分子对接通过确认APAP与已鉴定蛋白靶点之间直接相互作用的可行性,提供机制层面的支持。
综上所述,这些步骤共同构建了一个连贯且基于证据的生物标志物预测流程。这四种策略的结合可最大限度地减少假阳性预测,并提高将ESR1和PNP识别为对乙酰氨基酚(APAP)诱导肝毒性的强有力靶点的可信度。在本研究中,需要使用具有足够统计效能的GSE74000基因表达数据集,每种实验条件下至少包含三个生物学重复,并具备完整的元数据。原始表达数据文件需以标准方式处理,包括背景校正、标准化(如分位数标准化等)以及过滤低表达基因。所有分析均使用R语言完成,所用软件包包括limma,以及GeneCards和Cytoscape等外部工具,用于构建网络。尽管该流程可通过系统性分析促进生物标志物的优先排序,但其结果仍受限于数据集质量、批次效应以及缺乏实验和体内验证,这些因素可能影响结果的普适性。
访问受限。请登录或开始试用以查看此内容。
本方案概述了一种利用网络毒理学、转录组学、机器学习和分子对接技术来确定对乙酰氨基酚诱导肝损伤潜在生物标志物的计算方法(图1)。该方案面向具备生物信息学工具、转录组数据集以及分子对接软件使用条件的研究人员。
步骤
步骤 1:对乙酰氨基酚靶点的鉴定
从 PubChem 获取对乙酰氨基酚(APAP)的 SMILES 表示。利用在线平台(ChEMBL、SwissTargetPrediction、STITCH、SEA)预测 APAP 的潜在分子靶点。整合并去重预测得到的靶点,生成包含 140 个高置信度 APAP 靶点的列表。
步骤 2:肝毒性靶点的鉴定
从 GeneCards 数据库中获取与肝毒性相关的基因。整合并去除重复项,生成包含 657 个非冗余肝毒性相关基因的基因列表。利用维恩图鉴定对乙酰氨基酚(APAP)靶基因与肝毒性相关基因之间的重叠基因。
步骤 3:转录组数据预处理
从 GEO 下载 GSE74000 数据集。使用 DESeq2 对原始表达数据进行预处理:去除低表达基因,利用大小因子进行标准化,并应用方差稳定转换(VST)。使用 Limma 和 DESeq2 进行差异表达分析,筛选阈值为校正后 p 值 < 0.05 且 |log2FC| > 1。
步骤 4:功能富集分析
将重叠基因上传至 STRING 数据库,进行基因本体(GO)、KEGG 通路、组织表达及疾病相关性分析。使用气泡图和热图可视化功能富集分析结果。
步骤5:用于特征基因筛选的机器学习
应用随机森林分类器(n_estimators=500,max_depth=10)对重叠的APAP和肝毒性基因中的特征基因进行优先排序。使用袋外(Out-of-Bag, OOB)误差和特征重要性评分评估模型性能。选取排名前20的特征基因用于进一步分析。
步骤6:分子对接
从PubChem获取APAP结构(CID 1983),从PDB获取蛋白质受体(ESR1:PDB ID 1SJ0,PNP:PDB ID 1V2H)。准备配体和受体文件:转换为PDB格式,添加极性氢原子,分配电荷,并保存为PDBQT文件。在AutoDock Tools中定义对接网格,覆盖蛋白质的活性位点。使用AutoDock Vina进行分子对接,设置exhaustiveness为8,并分析结合亲和力及相互作用。利用PyMOL可视化对接结果,分析结合构象及关键相互作用。
步骤 7:统计分析
使用 t 检验确定统计显著性,并采用 Benjamini-Hochberg 方法对多重比较进行 p 值校正31。通过热图和散点图可视化具有统计显著性的关联关系。
材料与方法
对乙酰氨基酚靶点的鉴定
为了鉴定对乙酰氨基酚(APAP)潜在的分子靶点,我们首先从 PubChem 数据库中获取了其 SMILES 表示形式。随后,我们利用多个在线平台,包括欧洲分子生物学实验室化学数据库(ChemBL)32、Swiss Target Prediction33、化学与靶点相互作用搜索工具(STITCH)34以及相似性集合方法(SEA)35,预测其可能的作用靶点。在整合了这些工具的预测结果后,我们筛选出一组高置信度的 APAP 靶点。表 1 定义了本研究中使用的关键基因类别,阐明了它们在数据分析和生物学解释中的作用。这些术语的一致使用确保了研究结果的清晰传达。
肝毒性靶点的鉴定
从 GeneCards 数据库中检索与潜在肝毒性相关的基因。整合所有鉴定出的基因,去除重复项,并生成非冗余基因列表用于后续分析。GSE74000 数据集于 2024 年 3 月 15 日从 GEO 数据库下载。使用 limma 软件包对原始表达数据进行处理和标准化(分位数标准化)。采用线性模型结合经验贝叶斯收缩法进行差异表达分析。筛选标准为调整后 p 值 < 0.05(Benjamini-Hochberg FDR 校正)且 |log₂FC| > 1 的基因被视为具有显著差异表达。使用 ggplot2 生成的火山图和热图对差异表达基因(DEGs)进行可视化展示。
数据预处理
使用 DESeq2 对原始计数数据进行预处理。通过检测阈值在至少 70% 的样本中 CPM >1 的条件去除低表达基因。使用 DESeq2 的大小因子进行文库大小标准化,如公式 (1) 所定义:
(1)
其中中位数比率大小因子用 sj 表示。为稳定均值-方差关系,在公式 (2) 中采用了方差稳定化转换(VST):
(2)
使用 Wald 检验结合 Benjamini-Hochberg 校正来鉴定差异表达基因(DEGs),若基因满足方程(3)中的条件,则视为显著:
(3)
DESeq2 衍生的差异表达基因集定义为公式(4):
(4)
该数据集(X)与 Limma Trend(Y)和 Limma Voom(Z)一同用于共识策略分析。
蛋白质-蛋白质相互作用网络构建
采用维恩图鉴定APAP与肝毒性靶标之间的共有基因。随后将重叠基因上传至相互作用基因/蛋白质检索工具(STRING)数据库,以构建蛋白质-蛋白质相互作用(PPI)网络。
多维功能富集分析
我们首先利用 STRING 网站对乙酰氨基酚(APAP)与肝毒性之间的重叠基因进行基因本体(GO)、京都基因与基因组百科全书(KEGG)、组织表达以及疾病相关功能分析。随后,我们使用 Sendo 学术工具对肝毒性的差异基因进行 GO、KEGG 以及基因集富集分析(GSEA)(REACTOME)富集分析。
随机森林分析
我们应用机器学习方法,从对乙酰氨基酚(APAP)诱导的肝毒性转录组数据中重叠的APAP相关基因和肝毒性基因中鉴定出前20个特征基因。采用随机森林分类器,设置500棵树(n_estimators=500),最大树深度为10(max_depth=10),分裂一个节点所需的最小样本数为2(min_samples_split=2),并使用基尼不纯度准则(criterion='gini')36。模型性能通过袋外(Out-of-Bag, OOB)误差进行评估,OOB误差值越接近0,表示预测准确性越高。基于随机森林分析计算并可视化各基因的特征重要性得分,以评估每个基因的贡献度,如公式(5)所示。
(5)
N 为样本总数,yi 是 1(·) 为指示函数,当条件成立时为 1,否则为 0;
表示仅使用未将样本 iii 包含在训练集中的树对样本 iii 的预测标签。
已鉴定基因的差异表达
采用小提琴图对转录组数据中特征基因的表达差异进行可视化分析。筛选出具有统计学显著性差异的生物标志物,作为对乙酰氨基酚(APAP)诱导肝毒性的潜在新型生物标志物,供进一步研究。
分子对接
小分子化合物(CID 1983)从 PubChem 数据库中获取,蛋白受体 ESR1 和 PNP(PDB 编号分别为 1SJ0 和 1V2H)从蛋白质数据库(Protein Data Bank)下载。使用 OpenBabel 将配体结构转换为 PDB 格式,并在 AutoDock Tools 中进行预处理,包括添加极性氢原子、分配 Gasteiger 电荷、定义可旋转键,并保存为 PDBQT 格式。使用 PyMOL 对蛋白受体进行准备,去除水分子和共结晶配体后,通过 AutoDock Tools 添加极性氢原子并分配 Kollman 电荷,最终保存为 PDBQT 文件。
在分子对接中,使用 AutoDock 软件定义覆盖蛋白质活性位点的对接网格37。网格盒的中心坐标为(x = XX·XX, y = YY·YY, z = ZZ·ZZ),尺寸为 40 × 40 × 40 Å,网格间距为 0.375 Å,以确保完全覆盖结合口袋。采用 AutoDock Vina 计算配体-蛋白质的结合模式和结合亲和力,穷举性参数设置为 8,并为每个配体生成前九个结合构象。
通过将共结晶配体重新对接至活性位点来验证对接方案,所得 RMSD 值< 2.0 Å,证实了对接流程的可靠性。使用 PyMOL 可视化对接结果,以分析结合构象及关键相互作用,包括氢键作用。
对接模拟预测化合物X可结合到蛋白质Y的结合位点,形成潜在的氢键和疏水相互作用,预测结合能为-8.5 kcal/mol。
故障排除与潜在改进
为提高所提出工作流程的稳健性和可重复性,需注意若干故障排除事项及潜在改进方法。若鉴定出的差异表达基因(DEGs)数量意外偏低,建议用户验证标准化流程,确认分组标签准确无误,并在保持适当的错误发现率(FDR)控制的前提下,考虑调整|log2倍数变化|的阈值。相反,若获得的DEGs数量过多,可在差异表达分析前采用更严格的FDR截断值或过滤低方差基因,以提高特异性。
批次效应可能影响探索性分析(如主成分分析,PCA)中的聚类模式。如果样本主要按批次聚类而非生物学条件聚类,则应应用批次校正方法(例如,经验贝叶斯方法,如 ComBat),并仔细重新评估样本元数据的一致性。
在基于随机森林的特征选择中,较高的袋外(OOB)误差率或不稳定的特征排序可能表明模型配置次优。此时,可通过增加决策树数量、调整 mtry 参数,或进行多次模型运行并结合共识特征选择,以提高模型的稳定性与预测可靠性。此外,还可采用交叉验证策略进一步评估模型的稳健性。
为了提高可靠性,用户可选择使用不同的差异表达基因阈值或机器学习参数设置重复分析,并比较所识别特征基因的一致性。此类敏感性分析有助于确保关键结果不受特定参数选择的影响,并支持该工作流程在相似转录组数据集中的可重复性。
统计学分析
采用t检验确定统计学显著性,并报告p值用于比较。根据数据的正态性,使用Pearson或Spearman相关系数评估基因表达水平与肝毒性相关表型之间的统计学相关性。采用Benjamini-Hochberg方法对多重比较进行p值校正。通过热图和散点图可视化显著关联,以对转录组学关系进行稳健评估。
访问受限。请登录或开始试用以查看此内容。
APAP 与肝毒性重叠基因的鉴定及其功能分析
为确定 APAP 的潜在分子靶点并研究其生物学作用,使用四种计算工具(ChEMBL、SwissTargetPrediction、STITCH 和 SEA)进行了预测。在去除重复条目并整合重叠结果后,共获得包含 140 个候选靶点的非冗余列表。此外,从 GeneCards 数据库中提取了 657 个与肝毒性相关的基因。通过将 140 个 APAP 靶点与 657 个肝毒性相关基因取交集,我们鉴定了 38 个重叠基因(图 2A)。这 38 个重叠基因包括 ESR1 和 PNP,它们表现出最显著的差异表达(校正后 p 值 < 0.05,|log₂FC| > 1),被优先用于后续分析(表 2)。随后,我们利用 STRING 构建了 APAP-肝毒性相互作用网络,以可视化这些靶点之间的相互作用关系(图 2B)。
为了阐明这38个共有基因的功能...
访问受限。请登录或开始试用以查看此内容。
对乙酰氨基酚(APAP)是一种常用镇痛药和解热药;然而,过量摄入可导致显著的肝毒性,有时甚至发展为急性肝衰竭38。尽管在阐明APAP所致肝损伤的病理生理机制方面已取得进展,但仍缺乏可用于准确诊断、预后评估和机制研究的可靠生物标志物。因此,迫切需要发现潜在的新型生物标志物和研究方法,以进一步探讨APAP引起的肝毒性。本研究结合网络毒理学与转录组学,探究了APAP诱导肝毒性的潜在机制,并鉴定了两个潜在的新型生物标志物ESR1和PNP。这些发现为理解APAP所致肝毒性的机制及潜在治疗靶点提供了新的视角。
在本研究的初步阶段,我们采用了四种广泛认可的在线工具——ChemBL39,40、SwissTargetPrediction41、STITCH42 和 SEA,这些工具常用于药物靶点预测及化学物质的生物活性分析。在整合结果并去除重复...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者感谢天津中医药大学提供的机构支持。我们向公共数据库(GeneCards、PubChem、STRING)和开源工具的开发者致以诚挚谢意,这些资源为本研究提供了支持。特别感谢中药学院和中西医结合学院的同事们在讨论和技术方面提供的宝贵帮助。同时,我们感谢GSE74000数据集的贡献者公开共享其数据。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| <强>数据库 &和 Web 服务器 | |||
| STRING | https://cn.string-db.org/ | PPI网络构建;功能富集 | |
| 学术工具 | https://www.xiantaozi.com/ | GO、KEGG 和 GSEA 富集分析 | |
| PubChem | https://pubchem.ncbi.nlm.nih.gov/ | 化学结构的提取(APAP) | |
| GeneCards | https://www.genecards.org/ | 肝毒性相关基因的获取 | |
| GEO数据库 | https://www.ncbi.nlm.nih.gov/geo/ | 转录组数据集获取(GSE74000) | |
| ChEMBL | https://www.ebi.ac.uk/chembl/ | 靶点预测 | |
| SwissTargetPrediction | http://www.swisstargetprediction.ch/ | 靶点预测 | |
| STITCH | http://stitch.embl.de/ | 相互作用预测 | |
| 海洋环境分析 | http://sea.bkslab.org/ | 相似性整合方法用于靶点预测 | |
| 蛋白质数据库(PDB) | https://www.rcsb.org/ | 蛋白质结构检索(ESR1,PNP) | |
| <强>软件 | |||
| R(版本 4.x.x) | https://www.r-project.org/ | 统计分析与数据处理 | |
| AutoDock Tools / Vina | http://autodock.scripps.edu/ | 分子对接准备与模拟 | |
| PyMOL | https://pymol.org/ | 分子结构的可视化 | |
| Cytoscape | https://cytoscape.org/ | 网络可视化 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可