需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

基于可解释性机器学习模型的乳腺癌数据驱动药物发现优化

918 次观看

⸱

DOI:

10.3791/68705

⸱

2025年9月12日

本文内容

摘要

本方案介绍了一种利用XGBoost和SHAP进行乳腺癌药物敏感性预测的机器学习流程。该工作流程包括数据预处理、混合建模、基于SHAP的解释、协同作用评分以及PCA聚类,旨在识别高效药物并深入理解影响治疗反应的关键生物学因素。

摘要

乳腺癌仍然是全球最常见的恶性肿瘤之一,由于肿瘤异质性和药物耐药性,其治疗面临重大挑战。本研究提出了一种可重复的、基于数据的机器学习方案,用于预测乳腺癌细胞系对药物的敏感性,旨在识别高效的单药治疗药物以及具有协同作用的药物组合。利用癌症药物敏感性基因组学(Genomics of Drug Sensitivity in Cancer, GDSC)数据库中的精选数据集,实施了两种预测方法:独立的XGBoost回归模型和混合型自编码器- XGBoost流程。预处理步骤包括标签编码、独热编码、Z分数标准化、缺失值填补以及通过主成分分析(PCA)进行降维。模型评估结果显示,XGBoost模型表现更优(均方误差 MSE = 1.3789,决定系数 R2 = 0.8145),优于混合模型(MSE = 4.0322,R2 = 0.4577)。通过使用SHapley加性解释(SHAP)方法提升模型可解释性,识别出TARGET_PATHWAY、DRUG_ID、TARGET和CELL_LINE_NAME为关键预测特征,这些结果与已知的药理学机制一致。通过整合模型输出与DrugComb及SynergyDB数据库信息,计算得出的协同作用评分揭示了若干有前景的药物组合,如硼替佐米 + 罗米地辛以及紫杉醇 + 硼替佐米。基于PCA的药理学聚类分析进一步支持了这些发现,揭示了具有相似作用机制的药物在生物学上合理的聚类分组。该方案为精准肿瘤学研究提供了一个透明且可灵活调整的框架,兼顾预测准确性与生物学可解释性。通过整合严格的预处理、模型验证、可解释性分析及药物协同作用评估,该工作流程为乳腺癌治疗中的转化药物发现与老药新用研究提供了可扩展的基础。

引言

乳腺癌仍然是全球女性中最常见的癌症诊断类型,也是女性癌症相关死亡的第二大原因1。仅在美国,乳腺癌就占所有新发女性恶性肿瘤的近30%,每年新增病例超过28万例2。尽管在HER2阳性及激素受体阳性亚型的治疗方面取得了进展,但治疗耐药性和复发仍是临床上的关键挑战,尤其是对于三阴性乳腺癌(TNBC)等侵袭性亚型,目前尚缺乏靶向治疗手段3,4。这凸显了迫切需要基于精准医学的药物研发策略,以识别针对个体分子特征的高效治疗药物及其组合方案。传统的药物发现主要依赖实验和试错方法,而随着机器学习(ML)技术的引入,该领域已实现显著加速5,6。机器学习能够对高维生物医学数据中复杂的非线性关系进行建模,在靶点识别、生物标志物发现、药物敏感性预测以及联合治疗方案设计等方面提供支持7,8。然而,机器学习模型在肿瘤学中的实际应用仍面临诸多障碍,包括模型的可解释性、可重复性、在稀疏数据集上的过拟合问题,以及在不同癌症亚型间的泛化能力等9,

访问受限。请登录或开始试用以查看此内容。

方案

1. 数据集获取

  1. 从 GDSC 下载药物敏感性数据(https://www.cancerrxgene.org/downloads/drug_data)。所用数据集的摘要见表 1。使用的文件包括 gdsc_drug_data.csv(药物反应数据)、gdsc_expression_data.csv(基因表达数据)和 gdsc_cell_metadata.csv(细胞系信息)。
    ​图 1 展示了本工作流程中所用数据集结构的示例。
  2. 使用 Python(Pandas 库)对数据集进行筛选,仅保留乳腺癌细胞系。
    1. 选择 TCGA_DESC 列等于 "Breast" 的记录。
    2. 提取对应的 CELL_LINE_NAME 值。
    3. 具体实现方法参见补充代码 1(补充文件 1)。
      注意:将数据集限制为乳腺癌细胞系可确保模型训练的领域特异性,并提高生物学有效性。本研究采用的数据集来自癌症药物敏感性基因组学(Genomics of Drug Sensitivity in Cancer, GDSC)数据库,其主要特征见表 2。

....

访问受限。请登录或开始试用以查看此内容。

结果

本研究聚焦于利用先进的机器学习模型优化乳腺癌药物选择并预测联合用药的疗效。数据集包含经过精心筛选和过滤的乳腺癌细胞系、药物敏感性指标(LN_IC50、AUC、Z-Score)以及分子描述符,如拷贝数变异(CNA)、甲基化、基因表达、组织描述符和药物靶点。主要目标是预测单个药物在不同细胞系中的LN_IC50(半数抑制浓度的自然对数),识别具有协同作用的药物组合,并通过SHAP可解释性方法提供模型解释。研究采用独立的机器学习模型(XGBoost)以及混合型自编码器-XGBoost流程构建模型。整体工作流程如图1所示。

模型性能评估
XGBoost 模型在预测准确性和泛化能力方面均优于混合的自编码器-XGBoost 流程。XGBoost 模型的均方误差(MSE)为 1.3789,决定系数(R² 分数)为 0.8145,表明其在整个数据集上具有良好的预测性能,如表 5所示。相比之下,混合模型的 MSE 为 4.0322,R² 为 0.4577,这表明在此案.......

访问受限。请登录或开始试用以查看此内容。

讨论

本研究提出了一种集成的机器学习流程,用于适应药物选择、预测协同作用的药物组合,并识别药物重定位的可能性。整合了GDSC数据库和协同作用数据库(如SynergyDB、DrugComb)的数据,构建了一个全面的药物-细胞系相互作用数据集,涵盖分子特征(如基因表达、拷贝数变异)和药理学反应31。本研究的主要目的是准确预测细胞系对药物的敏感性,利用已建立的模型(如ZIP、Bliss、Loewe和HSA)对最有效的药物进行排序,并评估有前景的药物组合的协同能力。

XGBOOST 模型表现出最佳的整体性能,其均方误差(MSE)为 1.3789,R2 为 0.8145,相较于 Hybrid Authen Koder-XGBOOST 流程(MSE = 4.0322,R2 = 0.4577)有所提升。XGBOOST 的更优表现表明其在处理高维、非线性生物医学数据方面具有优势32。散点图与残差图显示,预测的 LN_IC50 值与真实值高度吻合,残差分布中未见系统性.......

访问受限。请登录或开始试用以查看此内容。

披露

作者声明本研究不存在任何利益冲突。我们确认,在稿件撰写的早期阶段,有限地使用了大语言模型(LLM)技术(由 OpenAI 开发的 ChatGPT)。具体而言,ChatGPT 仅用于构思生成和概念框架的初步头脑风暴,相关内容随后均由作者进行完善、验证并完全重写。所有核心科学内容、数据分析、结果解释及最终文稿撰写均由作者独立完成。所有来自 ChatGPT 的输出内容在纳入前均经过严格审查,以确保其准确性、连贯性和完整性,符合期刊的透明度与伦理指南要求。所有作者均已审阅并同意本稿件的最终版本,并确认不存在可能影响本出版物内容的财务、个人或专业关系。

致谢

作者衷心感谢基督大学计算机科学系提供的机构支持,该支持为开展本研究提供了必要的计算资源和学术环境。我们还感谢同事和导师在整个研究过程中给予的合作指导与鼓励。

作者贡献:
Dyuti Banerjee 提出了研究构想,设计了研究方法,并对数据集进行了整理。Sivaneesan Bala Krishnan 和 Kamal Upreti 实现了机器学习模型并完成了计算分析。Sumegh Shrikant Tharewal 和 Uma Shankar 参与了数据预处理、特征工程及结果验证。Pravin Kshirsagar 进行了协同效应分析和基于主成分分析(PCA)的聚类分析。Manoj Kumar 协助完成了文献综述、研究结果的解读以及初稿撰写。所有作者均参与了稿件的修改,批准了最终版本,并同意对工作的各个方面承担责任。

....

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
自编码器(深度学习模型)TensorFlow (Google)https://www.tensorflow.org用于药物反应建模的降维与特征编码
BortezomibSelleck ChemicalsS1013用于协同作用分析的药物
DactinomycinSigma-AldrichD1037用于协同作用分析的药物
DocetaxelSigma-AldrichD1080用于基于机制聚类验证的药物
Matplotlib 库Python 软件包索引 (PyPI)https://matplotlib.orgPython 中的数据可视化与绘图
NumPy 库Python 软件包索引 (PyPI)https://numpy.org数值计算与矩阵运算
PaclitaxelSigma-AldrichT7191用于基于机制聚类验证的药物
Pandas 库Python 软件包索引 (PyPI)https://pandas.pydata.org数据操作与处理
Python 3.10Python 软件基金会https://www.python.org主要编程语言
RomidepsinSelleck ChemicalsS3020用于协同作用分析的药物
Scikit-learn 库Python 软件包索引 (PyPI)https://scikit-learn.org机器学习建模与预处理工具
Seaborn 库Python 软件包索引 (PyPI)https://seaborn.pydata.org数据可视化与统计绘图
SHAP 库Python 软件包索引 (PyPI)https://shap.readthedocs.io可解释人工智能模型的可解释性分析
协同作用数据(DrugComb)FIMM, 芬兰https://drugcomb.fimm.fi药物协同作用参考数据集
协同作用数据(SynergyDB)格罗宁根大学https://synergy.bioinformatics.nl药物协同作用参考数据集
TensorFlow 2.11Googlehttps://www.tensorflow.org自编码器深度学习模型的实现
VinblastineSigma-AldrichV1377用于协同作用分析的药物
XGBoost 库Python 软件包索引 (PyPI)https://xgboost.readthedocs.io梯度提升回归建模

参考文献

  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev.

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

药物敏感性XGBoost 模型自编码器流程药物协同作用SHAP 分析精准肿瘤学药理学聚类