该协议提出了一个使用 XGBoost 和 SHAP 来预测乳腺癌药物敏感性的机器学习管道。该工作流程包括数据预处理、混合建模、基于 SHAP 的解释、协同评分和 PCA 聚类,以识别强效药物并了解影响治疗反应的关键生物学因素。
方法文章
该协议提出了一个使用 XGBoost 和 SHAP 来预测乳腺癌药物敏感性的机器学习管道。该工作流程包括数据预处理、混合建模、基于 SHAP 的解释、协同评分和 PCA 聚类,以识别强效药物并了解影响治疗反应的关键生物学因素。
乳腺癌仍然是全球最常见的恶性肿瘤之一,由于肿瘤异质性和耐药性,给治疗带来了重大挑战。本研究提出了一种可重复的、数据驱动的机器学习方案,用于预测乳腺癌细胞系的药物敏感性,其双重目标是识别有效的单一药物和协同药物组合。使用来自癌症药物敏感性基因组学 (GDSC) 的精选数据集,实施了两种预测方法:独立的 XGBoost 回归器和混合 Autoencoder-XGBoost 管道。预处理包括标签编码、单热编码、Z 分数标准化、缺失值插补和通过 PCA 降维。模型评估表明,与混合模型(MSE = 1.3789,R2 = 0.8145)相比,XGBoost 取得了优异的性能(MSE = 4.0322,R2 = 0.4577)。使用 SHapley Additive exPlanations (SHAP) 解决可解释性问题,该解释将 TARGET_PATHWAY、DRUG_ID、TARGET 和 CELL_LINE_NAME 确定为关键预测特征,与既定的药理学机制保持一致。通过将模型输出与 DrugComb 和 SynergyDB 数据相结合得出的预测协同分数,突出了有前途的药物对,例如硼替佐米 + 罗米地辛和紫杉醇 + 硼替佐米。这些发现得到了基于 PCA 的药理学聚类的进一步支持,揭示了具有相似作用机制的生物学相关药物组。所提出的协议为精准肿瘤学研究提供了一个透明且适应性强的框架,从而实现预测准确性和生物学可解释性。通过集成严格的预处理、模型验证、可解释性和药物协同分析,该工作流程为转化药物发现和乳腺癌治疗的再利用提供了可扩展的基础。
乳腺癌仍然是全球女性最常被诊断出的癌症,也是癌症相关死亡的第二大原因1.仅在美国,它就占所有新发女性恶性肿瘤的近 30%,每年诊断出超过 280,000 例新病例2。尽管治疗取得了进展,特别是在 HER2 阳性和激素受体阳性亚型中,但对治疗的耐药性和复发仍然是关键挑战,特别是对于缺乏靶向治疗的三阴性乳腺癌 (TNBC) 等侵袭性亚型 3,4。这凸显了迫切需要精确驱动的药物发现,以确定针对个体分子谱量身定制的有效治疗药物和组合。传统上以实验和试错方法为指导的药物发现,通过机器学习 (ML) 技术的集成,药物发现取得了显着的加速 5,6。机器学习能够对高维生物医学数据的复杂、非线性关系进行建模,并有助于靶点识别、生物标志物发现、药物敏感性预测和联合治疗设计 7,8。然而,ML 模型在肿瘤学中的实际部署面临着几个障碍,包括模型可解释性、可重复性、稀疏数据集的过拟合以及跨癌症亚型的泛化 9,10,11。
为了克服这些限制,最近的研究重点是将用于特征提取的深度学习与用于稳健预测的集成学习相结合。在评估多种算法的研究中,人工神经网络 (ANN) 等模型的准确率高达 93.2%,优于朴素贝叶斯和决策树等传统分类器12。此外,综合特征挖掘技术通过GEO(基因表达综合)和GSE45827等数据库发现了关键驱动基因和分子靶标,识别了多达1,700个差异表达基因,其中一些表现出已知的药物相互作用13。此外,新的药物再利用研究表明,骨化三醇等非肿瘤化合物比来那替尼等标准治疗更有效地降低乳腺癌细胞活力的潜力,尤其是在 HER2+ 细胞系中14。对Akt信号通路的研究也显示出克服曲妥珠单抗耐药性的希望,表明分子通路靶向是受体聚焦治疗的替代方法15,16。然而,尽管取得了这些进步,但当前文献中仍然没有充分探索能够预测连续药物反应值、对有效药物组合进行排名和可视化药理学相似性的系统且可解释的框架。许多模型要么基于分类,要么缺乏转化清晰度,尤其是在应用于真实世界的药物基因组数据集时。
机器学习 (ML) 可以改进药物发现和决策,机器学习为高质量数据提供了工具。药物发现的所有阶段,包括靶点验证、生物标志物鉴定和临床试验分析,都可以从机器学习的使用中受益。机器学习生成的结果的可解释性和可重复性也是障碍17.通过解决这些问题和提高对验证变量的了解,可以降低失败率并加快流程。研究人员使用机器学习算法评估了癌症不同阶段的活检样本。研究结果显示,测试准确率很高,ANN 为 93.2%,朴素贝叶斯 (NB) 为 90.4%,决策树 (DT) 为 87.8%,RF 为 85.9%。通过结合 Rakhshaninejad 等人的 GEO 数据库,共发现了 350 个预测基因和 164 个差异表达基因。18.在组合数据集中,二元灰狼优化与模拟退火集成(BGWO_SA_Ens)算法发现了1404个基因,而在GSE45827数据集中,发现了1710个基因。发现了大约 35 个优越基因,以及它们在重要途径中的作用以及优越基因与抗癌药物之间的关系。为了从表皮生长因子受体(EGFR(EGFR)过表达信号通路及其相关家族成员中寻找靶基因,Nagaraj等人进行了分子网络研究。19 一种名为骨化三醇的药物被授权用于治疗与癌症无关的疾病,与四种受体中的每一种都具有很强的结合亲和力。根据 in vitro 细胞毒性研究显示,骨化三醇以剂量依赖性方式降低了 SK-BR-3 细胞活力,表明与来那替尼相比,细胞毒性更优越,乳腺癌细胞增殖减少。Jernström 等人提出了一种活性且可成药的 Akt 信号通路。20 两种对曲妥珠单抗不敏感的细胞系对 Akt1/2 激酶抑制剂有反应。该研究建议在做出治疗决策时靶向 Akt 信号通路并考虑分子方面,而不是关注 HER2 扩增或表达。在美国,30% 的新发女性恶性肿瘤是乳腺癌,使其成为女性中最常见的恶性疾病。Witt 和 Tollefsbol 的目标21 是开发一种基本工具,帮助研究人员选择用于异种移植实验、癌症预防和表观遗传发现等领域的乳腺癌细胞系。还涵盖了关于特定乳腺癌细胞系的来源以及采用患者来源的异种移植物 (PDX) 而不是细胞来源的异种移植物 (CDX) 的优势的争论。Gruener 等人研究了使用药物预测技术提供新药物发现假设的情况。22,重点关注三阴性乳腺癌 (TNBC)。在细胞系转录组数据的基础上,构建药物反应的机器学习模型,然后应用于患者肿瘤数据。研究结果表明,Wee1 抑制剂 AZD-1775 在 TNBC 中具有优先作用,并且 TP53 突变与其有效性密切相关。为了预测乳腺癌研究中未知的药物靶点相互作用,Song等人23 提出了一种基于特征的方法,称为用于药物靶点相互作用预测的伪位置特异性物理化学性质衍生组合物 (PsePDC-DTIs),该方法利用蛋白质序列、深度典型相关分析 (DCCA) 系数和分子指纹描述符。该技术使用随机森林分类器预测四个黄金标准数据集的 DTI,并使用 SMOTE 处理不平衡数据。此外,该模型使用来自全基因组遗传学研究的风险基因来研究治疗乳腺癌的新靶点。该模型的优越性和有效性通过它为治疗提供的十种可能的 DTI 得到了证明。10% 到 20% 的乳腺癌病例是三阴性乳腺癌 (TNBC)。尽管 HER2+ 和激素受体 + 治疗取得了进展,但目前尚无针对 TNBC 的靶向疗法24.尽管大多数患者表达 EGFR,但早期研究没有发现任何可辨别的活性。最近的发现和临床进展建议了未来 TNBC 的实验性治疗方法25.
尽管机器学习在药物发现中的集成越来越多,但当前的模型往往缺乏可解释性和可重复性,限制了其转化应用。虽然先前的研究已经探索了分类准确性和基因挖掘,但很少有人使用混合可解释模型系统地预测连续药物敏感性(如LN_IC50)。此外,在乳腺癌治疗的背景下,降维技术与稳健回归因子的结合仍然没有得到充分探索。本研究通过引入和评估双管道策略(XGBoost 和 Autoencoder-XGBoost)来解决这一差距,以实现药物反应的高保真预测,并结合可解释性和协同映射工具,以实现现实世界的临床适用性。
访问受限。请登录或开始试用以查看此内容。
1. 数据集获取
2. 数据预处理
3. 建模框架

是相应的预测值,n 是观测总数。对于自动编码器,重建损耗由下式给出,

是药物 1 的预测LN_IC50。访问受限。请登录或开始试用以查看此内容。
本研究的重点是使用先进的机器学习模型优化药物选择和预测乳腺癌的组合疗效。该数据集包括一组精选和过滤的乳腺癌细胞系、药物敏感性指标(LN_IC50、AUC、Z 分数)和分子描述符,例如 CNA、甲基化、基因表达、组织描述符和药物靶标。主要目的是预测单个药物跨细胞系的LN_IC50(半最大抑制浓度的自然对数),识别协同组合,并使用 SHAP 可解释性提供可解释性。模型是使用独立机器学习 (XGBoost) 和混合 Autoencoder-XGBoost 管道开发的。总体工作流程如图 1 所示
模型性能评估
XGBoost 模型在预测准确性和泛化方面优于混合 Autoencoder-XGBoost 管道。XGBoost模型报告的均方误差(MSE)为1.3789,决定系数(R²分数)为0.8145,反映了整个数据集的良好预测性能,如 表5所示。另一方面,混合模型的MSE为4.0322,R²为0.4577,这表明在这种情况下,通过自动编码降维可能导致输出和特征...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一个集成的机器学习管道,以适应药物的选择,预测协同组合,并确定药物再利用的可能性。来自GDSC数据库和协同存储库(例如SynergyDB、DrugComb)的数据被整合,以管理一个全面的药物-细胞系相互作用,包括分子特征(例如,基因表达,拷贝数改变)和药理学反应31。这里的主要目的是准确预测细胞系中的药物敏感性,对最有效的药物进行排名,并使用 ZIP、Bliss、Lowe 和 HSA 等已安装模型评估有希望的组合的协调能力。
XGBOOST模型总体性能最佳,MSE为1.3789,R2 为0.8145,Hybrid Authen Koder-XGBOOST管线(MSE = 4.0322,R2 = 0.4577)得到改进。XGBOOST的更好性能揭示了其在处理高维、非维生物医学数据方面的优势32。散点图和残差图证实了近似值和正确LN_IC50值之间紧密一致,并且剩余分布...
访问受限。请登录或开始试用以查看此内容。
作者声明,不存在与这项工作相关的利益冲突。我们确认,大型语言模型(LLM)技术(ChatGPT,由OpenAI开发)在稿件准备的早期阶段被以有限的能力使用。具体来说,ChatGPT 被用于概念框架的想法生成和初步头脑风暴,随后作者对其进行了完善、验证和完全重写。所有核心科学内容、数据分析、解释和最终起草均由作者独家完成。ChatGPT 的输出在纳入之前经过了严格审查,以确保准确性、连贯性和完整性,符合期刊的透明度和道德准则。所有作者都已审查并批准了稿件的最终版本,并确认不存在任何可能被解释为影响本出版物内容的财务、个人或专业关系。
作者衷心感谢基督大学计算机科学系提供的机构支持,该系为开展这项研究提供了必要的计算资源和学术环境。我们也感谢我们的同事和导师在整个工作过程中给予的协作指导和鼓励。
作者贡献:
Dyuti Banerjee 构思了这项研究,设计了方法,并整理了数据集。Sivaneasan Bala Krishnan 和 Kamal Upreti 实施了机器学习模型并进行了计算分析。Sumegh Shrikant Tharewal 和 Uma Shankar 为数据预处理、特征工程和结果验证做出了贡献。Pravin Kshirsagar 进行了协同分析和基于 PCA 的聚类。Manoj Kumar 协助进行文献综述、研究结果解释和手稿起草。所有作者都为稿件修改做出了贡献,批准了最终版本,并同意对工作的各个方面负责。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 自动编码器(深度学习模型) | TensorFlow (谷歌) | https://www.tensorflow.org | 药物反应建模的降维和特征编码 |
| 硼替佐米 | 塞莱克化学 | S1013 | 用于协同分析的药物 |
| 放线菌素 | 西格玛-奥尔德里奇 | D1037 | 用于协同分析的药物 |
| 多西紫杉醇 | 西格玛-奥尔德里奇 | D1080型 | 用于基于机制的聚类验证的药物 |
| Matplotlib 库 | Python 包索引 (PyPI) | https://matplotlib.org | Python 中的数据可视化和绘图 |
| NumPy 库 | Python 包索引 (PyPI) | https://numpy.org | 数值计算和矩阵运算 |
| 紫杉醇 | 西格玛-奥尔德里奇 | T7191型 | 用于基于机制的聚类验证的药物 |
| 熊猫图书馆 | Python 包索引 (PyPI) | https://pandas.pydata.org | 数据作和处理 |
| Python 3.10 中文文档 | Python 软件基础 | https://www.python.org | 主要编程语言 |
| 罗米地辛 | 塞莱克化学 | S3020 | 用于协同分析的药物 |
| Scikit-learn 库 | Python 包索引 (PyPI) | https://scikit-learn.org | 机器学习建模和预处理工具 |
| Seaborn 图书馆 | Python 包索引 (PyPI) | https://seaborn.pydata.org | 数据可视化和统计绘图 |
| SHAP 库 | Python 包索引 (PyPI) | https://shap.readthedocs.io | 可解释的 AI 模型可解释性 |
| 协同数据 (DrugComb) | FIMM, 芬兰 | https://drugcomb.fimm.fi | 药物协同参考数据集 |
| 协同数据 (SynergyDB) | 格罗宁根大学 | https://synergy.bioinformatics.nl | 药物协同参考数据集 |
| 张量流 2.11 | 谷歌 | https://www.tensorflow.org | 自动编码器深度学习模型实现 |
| 长春碱 Vinblastine | 西格玛-奥尔德里奇 | V1377 | 用于协同分析的药物 |
| XGBoost 库 | Python 包索引 (PyPI) | https://xgboost.readthedocs.io | 梯度提升回归建模 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可