方法文章

使用可解释机器学习模型对乳腺癌进行数据驱动的药物发现优化

DOI:

10.3791/68705

2025年9月12日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

该协议提出了一个使用 XGBoost 和 SHAP 来预测乳腺癌药物敏感性的机器学习管道。该工作流程包括数据预处理、混合建模、基于 SHAP 的解释、协同评分和 PCA 聚类,以识别强效药物并了解影响治疗反应的关键生物学因素。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳腺癌仍然是全球最常见的恶性肿瘤之一,由于肿瘤异质性和耐药性,给治疗带来了重大挑战。本研究提出了一种可重复的、数据驱动的机器学习方案,用于预测乳腺癌细胞系的药物敏感性,其双重目标是识别有效的单一药物和协同药物组合。使用来自癌症药物敏感性基因组学 (GDSC) 的精选数据集,实施了两种预测方法:独立的 XGBoost 回归器和混合 Autoencoder-XGBoost 管道。预处理包括标签编码、单热编码、Z 分数标准化、缺失值插补和通过 PCA 降维。模型评估表明,与混合模型(MSE = 1.3789,R2 = 0.8145)相比,XGBoost 取得了优异的性能(MSE = 4.0322,R2 = 0.4577)。使用 SHapley Additive exPlanations (SHAP) 解决可解释性问题,该解释将 TARGET_PATHWAY、DRUG_ID、TARGET 和 CELL_LINE_NAME 确定为关键预测特征,与既定的药理学机制保持一致。通过将模型输出与 DrugComb 和 SynergyDB 数据相结合得出的预测协同分数,突出了有前途的药物对,例如硼替佐米 + 罗米地辛和紫杉醇 + 硼替佐米。这些发现得到了基于 PCA 的药理学聚类的进一步支持,揭示了具有相似作用机制的生物学相关药物组。所提出的协议为精准肿瘤学研究提供了一个透明且适应性强的框架,从而实现预测准确性和生物学可解释性。通过集成严格的预处理、模型验证、可解释性和药物协同分析,该工作流程为转化药物发现和乳腺癌治疗的再利用提供了可扩展的基础。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳腺癌仍然是全球女性最常被诊断出的癌症,也是癌症相关死亡的第二大原因1.仅在美国,它就占所有新发女性恶性肿瘤的近 30%,每年诊断出超过 280,000 例新病例2。尽管治疗取得了进展,特别是在 HER2 阳性和激素受体阳性亚型中,但对治疗的耐药性和复发仍然是关键挑战,特别是对于缺乏靶向治疗的三阴性乳腺癌 (TNBC) 等侵袭性亚型 3,4。这凸显了迫切需要精确驱动的药物发现,以确定针对个体分子谱量身定制的有效治疗药物和组合。传统上以实验和试错方法为指导的药物发现,通过机器学习 (ML) 技术的集成,药物发现取得了显着的加速 5,6。机器学习能够对高维生物医学数据的复杂、非线性关系进行建模,并有助于靶点识别、生物标志物发现、药物敏感性预测和联合治疗设计 7,8。然而,ML 模型在肿瘤学中的实际部署面临着几个障碍,包括模型可解释性、可重复性、稀疏数据集的过拟合以及跨癌症亚型的泛化 9,10,11

为了克服这些限制,最近的研究重点是将用于特征提取的深度学习与用于稳健预测的集成学习相结合。在评估多种算法的研究中,人工神经网络 (ANN) 等模型的准确率高达 93.2%,优于朴素贝叶斯和决策树等传统分类器12。此外,综合特征挖掘技术通过GEO(基因表达综合)和GSE45827等数据库发现了关键驱动基因和分子靶标,识别了多达1,700个差异表达基因,其中一些表现出已知的药物相互作用13。此外,新的药物再利用研究表明,骨化三醇等非肿瘤化合物比来那替尼等标准治疗更有效地降低乳腺癌细胞活力的潜力,尤其是在 HER2+ 细胞系中14。对Akt信号通路的研究也显示出克服曲妥珠单抗耐药性的希望,表明分子通路靶向是受体聚焦治疗的替代方法15,16。然而,尽管取得了这些进步,但当前文献中仍然没有充分探索能够预测连续药物反应值、对有效药物组合进行排名和可视化药理学相似性的系统且可解释的框架。许多模型要么基于分类,要么缺乏转化清晰度,尤其是在应用于真实世界的药物基因组数据集时。

机器学习 (ML) 可以改进药物发现和决策,机器学习为高质量数据提供了工具。药物发现的所有阶段,包括靶点验证、生物标志物鉴定和临床试验分析,都可以从机器学习的使用中受益。机器学习生成的结果的可解释性和可重复性也是障碍17.通过解决这些问题和提高对验证变量的了解,可以降低失败率并加快流程。研究人员使用机器学习算法评估了癌症不同阶段的活检样本。研究结果显示,测试准确率很高,ANN 为 93.2%,朴素贝叶斯 (NB) 为 90.4%,决策树 (DT) 为 87.8%,RF 为 85.9%。通过结合 Rakhshaninejad 等人的 GEO 数据库,共发现了 350 个预测基因和 164 个差异表达基因。18.在组合数据集中,二元灰狼优化与模拟退火集成(BGWO_SA_Ens)算法发现了1404个基因,而在GSE45827数据集中,发现了1710个基因。发现了大约 35 个优越基因,以及它们在重要途径中的作用以及优越基因与抗癌药物之间的关系。为了从表皮生长因子受体(EGFR(EGFR)过表达信号通路及其相关家族成员中寻找靶基因,Nagaraj等人进行了分子网络研究。19 一种名为骨化三醇的药物被授权用于治疗与癌症无关的疾病,与四种受体中的每一种都具有很强的结合亲和力。根据 in vitro 细胞毒性研究显示,骨化三醇以剂量依赖性方式降低了 SK-BR-3 细胞活力,表明与来那替尼相比,细胞毒性更优越,乳腺癌细胞增殖减少。Jernström 等人提出了一种活性且可成药的 Akt 信号通路。20 两种对曲妥珠单抗不敏感的细胞系对 Akt1/2 激酶抑制剂有反应。该研究建议在做出治疗决策时靶向 Akt 信号通路并考虑分子方面,而不是关注 HER2 扩增或表达。在美国,30% 的新发女性恶性肿瘤是乳腺癌,使其成为女性中最常见的恶性疾病。Witt 和 Tollefsbol 的目标21 是开发一种基本工具,帮助研究人员选择用于异种移植实验、癌症预防和表观遗传发现等领域的乳腺癌细胞系。还涵盖了关于特定乳腺癌细胞系的来源以及采用患者来源的异种移植物 (PDX) 而不是细胞来源的异种移植物 (CDX) 的优势的争论。Gruener 等人研究了使用药物预测技术提供新药物发现假设的情况。22,重点关注三阴性乳腺癌 (TNBC)。在细胞系转录组数据的基础上,构建药物反应的机器学习模型,然后应用于患者肿瘤数据。研究结果表明,Wee1 抑制剂 AZD-1775 在 TNBC 中具有优先作用,并且 TP53 突变与其有效性密切相关。为了预测乳腺癌研究中未知的药物靶点相互作用,Song等人23 提出了一种基于特征的方法,称为用于药物靶点相互作用预测的伪位置特异性物理化学性质衍生组合物 (PsePDC-DTIs),该方法利用蛋白质序列、深度典型相关分析 (DCCA) 系数和分子指纹描述符。该技术使用随机森林分类器预测四个黄金标准数据集的 DTI,并使用 SMOTE 处理不平衡数据。此外,该模型使用来自全基因组遗传学研究的风险基因来研究治疗乳腺癌的新靶点。该模型的优越性和有效性通过它为治疗提供的十种可能的 DTI 得到了证明。10% 到 20% 的乳腺癌病例是三阴性乳腺癌 (TNBC)。尽管 HER2+ 和激素受体 + 治疗取得了进展,但目前尚无针对 TNBC 的靶向疗法24.尽管大多数患者表达 EGFR,但早期研究没有发现任何可辨别的活性。最近的发现和临床进展建议了未来 TNBC 的实验性治疗方法25.

尽管机器学习在药物发现中的集成越来越多,但当前的模型往往缺乏可解释性和可重复性,限制了其转化应用。虽然先前的研究已经探索了分类准确性和基因挖掘,但很少有人使用混合可解释模型系统地预测连续药物敏感性(如LN_IC50)。此外,在乳腺癌治疗的背景下,降维技术与稳健回归因子的结合仍然没有得到充分探索。本研究通过引入和评估双管道策略(XGBoost 和 Autoencoder-XGBoost)来解决这一差距,以实现药物反应的高保真预测,并结合可解释性和协同映射工具,以实现现实世界的临床适用性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 数据集获取

  1. 从 GDSC (https://www.cancerrxgene.org/downloads/drug_data) 下载药物敏感性数据。表 1 提供了所用数据集的摘要。使用的文件是gdsc_drug_data.csv(药物反应)、gdsc_expression_data.csv(基因表达)和gdsc_cell_metadata.csv(细胞系信息)。
    有关此工作流程中使用的数据集结构的示例,请参见 图 1
  2. 使用 Python(Pandas 库)过滤数据集以仅包含乳腺癌细胞系。
    1. 选择TCGA_DESC列等于“乳房”的记录。
    2. 提取相应的CELL_LINE_NAME值。
    3. 有关实施,请参阅补充代码 1(补充文件 1)。
      注意:将数据集限制为乳腺癌细胞系可确保领域特异性模型训练并提高生物学有效性。本研究中使用的数据集取自癌症药物敏感性基因组学 (GDSC) 数据库,其主要特征如 表 2 所示。

2. 数据预处理

  1. 预处理流水线:
    1. 使用 LabelEncoder 对分类变量(例如 DRUG_ID、CELL_LINE_NAME 和 TARGET_PATHWAY)进行编码,以将其转换为适合 XGBoost 输入的基于整数的格式。
    2. 使用 Z 分数标准化 (StandardScaler) 对数值特征进行归一化,包括基因表达数据、拷贝数改变 (CNA) 和甲基化特征,以确保均值和单位方差为零。
    3. 删除缺失特征超过 30% 的样品。
    4. 使用 SimpleImputer(strategy='median') 使用每个相应特征列的中位数插补剩余缺失值。
    5. 使用 scikit-learn 中的 OneHotEncoder 将单热编码应用于分类变量(DRUG_ID 和 TARGET_PATHWAY)。
    6. 使用主成分分析 (PCA) 对基因表达特征进行降维,以减少特征空间,同时保留方差。
    7. 使用 scikit-learn 的train_test_split将最终清理的数据集拆分为训练 (80%) 和测试 (20%) 集,保持药物-细胞对的分布。
      注意:讨论部分讨论了每个预处理步骤和生成的数据集维度的详细原理。
  2. 处理分类变量
    1. 使用 Pandas 识别分类变量(CELL_LINE_NAME、DRUG_NAME、TARGET_PATHWAY)。
    2. 使用 scikit-learn 的 LabelEncoder 将标签编码应用于这些变量。
    3. 以编程方式实现此步骤,如补充代码 2(补充文件 1)所示。
      注意:机器学习算法需要数字输入;标签编码将分类变量转换为整数格式,同时保留类区别。
  3. 标准化数值特征
    1. 识别基因表达、拷贝数改变 (CNA) 和甲基化特征的数值变量。
    2. 应用 StandardScaler 将特征归一化为零均值和单位方差。
      注意:标准化通过重新缩放所有数值特征以使其具有零均值和单位方差来确保所有数值特征对模型的贡献相同。这可以防止具有更大尺度的特征主导模型训练,并提高优化算法的收敛性。
  4. 处理缺失值
    1. 检测所有要素中缺少的条目。
    2. 删除缺失数据超过 30% 的记录。
    3. 使用中值插补策略插补剩余缺失值。
      注意:不完整的数据可能会引入偏差并降低模型鲁棒性。删除严重缺失的记录可确保数据可靠性,而中位数插补提供了一种稳定且抗异常值的方法来保留可用信息,而无需引入强分布假设。
  5. 拆分数据集
    1. 使用自动化方法(例如,来自 sikit-learn 的train_test_split)将最终清理的数据集划分为训练和测试子集。
    2. 指定随机种子(例如,random_state=42)以确保可重复性。
    3. 将 80% 的数据分配给训练集,将 20% 分配给测试集。
    4. 有关完整的代码实现,请参阅补充代码 3(补充文件 1)。
      注意:将数据划分为训练子集和测试子集可以对模型的泛化性进行公正的评估。

3. 建模框架

  1. 定义回归目标
    1. 将预测任务构建为回归问题,以估计每个药物细胞系对的半最大抑制浓度 (LN_IC50) 的自然对数。
    2. 选择LN_IC50作为目标变量以稳定方差并改进模型。
      注意:将 IC50 转换为 LN_IC50 可减少偏度并提高模型性能。
  2. 训练 XGBoost 回归器(模型 1)
    1. 选择 XGBoost 作为主要模型,因为它在结构化药物基因组学数据集上表现出色,并且能够通过正则化对非线性特征相互作用进行建模以防止过度拟合。
    2. 使用 xgboost 库中的 XGBRegressor 类以编程方式初始化模型。指定通过交叉验证确定的调整超参数(学习率、最大深度、估计器数量和随机种子)。
    3. 使用 fit() 方法在训练子集(X_train、y_train)上训练模型。
    4. 使用 predict() 方法生成对测试子集 (X_test) 的预测。
    5. 使用均方误差 (MSE) 和 R² 分数以及 scikit-learn 的 mean_squared_error 和 r2_score 函数来评估性能。
      注意:有关完整实施,请参阅补充代码 4(补充文件 1)。
  3. 考虑替代模型
    1. 评估支持向量回归 (SVR) 在小样本、高维数据设置中的鲁棒性。
    2. 通过深度潜在特征提取和非线性建模,评估 Autoencoder-XGBoost 混合体的潜在性能提升。
    3. 使用相同的评估指标和交叉验证比较模型之间的性能。
      注意:由于与 XGBoost 相比,SVR 的预测准确性较低,因此被排除在最终结果之外,而 Autoencoder-XGBoost 混合体被保留用于深度学习和机器学习方法的比较。
  4. 模型 1:XGBoost 回归器
    1. 选择 XGBoost 作为基线模型,因为它在结构化生物医学数据上表现出色,能够对非线性特征交互进行建模,并且内置的正则化可以减少过度拟合。
    2. 使用超参数配置 XGBoost 模型 learning_rate = 0.05、max_depth = 6 和 n_estimators = 100。
    3. 使用网格搜索优化超参数,并通过 5 倍交叉验证验证性能。
    4. 在准备好的训练数据集(X_train、y_train)上训练模型。
    5. 使用均方误差 (MSE) 和使用 scikitlearn 的 mean_squared_error 和 r2_score 函数计算的 R² 分数评估预测性能。
      注意:先前的研究26 表明,XGBoost 在表格生物医学数据集上始终优于深度学习模型,计算成本较低。
  5. 构建混合自动编码器 + XGBoost 模型(模型 2)
    1. 设计用于无监督降维的自动编码器
      注意:编码器将输入特征压缩为低维潜在表示。解码器重建输入以最大程度地减少重建错误。
    2. 在完整特征矩阵上训练自动编码器以提取潜在特征。
    3. 将编码器的输出(潜在特征)作为输入传递给 XGBoost 回归器,如补充代码 5A(补充文件 1)所示。
    4. 在编码的特征集上训练 XGBoost 回归器,以 LN_IC50 为目标变量,如补充代码 5B(补充文件 1)所示。
    5. 使用与模型 1 相同的指标评估模型性能,以便进行直接比较。
      注意:这种混合方法利用了基于深度学习的表示学习和 XGBoost 强大的回归能力,为高维生物数据提供了优势。
  6. 模型评估
    1. 通过在测试数据集 (X_test) 上使用 predict() 方法预测目标值来评估训练的回归模型。
    2. 计算均方误差 (MSE),以使用 scikit-learn 的 mean_squared_error(y_test, y_pred) 测量预测值和实际LN_IC50值之间的平均平方差。
      注意:这些模型共同结合了可解释性和精确性,形成了预测乳腺癌研究中药物敏感性的强大框架27,28
      figure-protocol-1
      其中 yi 表示第 i 对药物细胞的真实LN_IC50, figure-protocol-2是相应的预测值,n 是观测总数。对于自动编码器,重建损耗由下式给出,
      figure-protocol-3
      其中 X 是输入特征矩阵,E(·) 是将 X 映射到潜在表示的编码器函数,D(·) 是从潜在空间重建 X 的解码器函数。
    3. 计算 R2 分数,以确定模型使用 scikit-learn 中的 r2_score(y_test, y_pred) 解释的目标变量的方差比例。
    4. 记录计算的 MSE 和 R2 值以进行报告。 表3汇 总了计算出的MSE和R²值,以清晰地呈现并直接比较不同模型的性能。
    5. 解释评估指标:MSE 越低表示预测准确率越高,R2 分数越接近 1 表示模型的解释力越强,泛化能力越好。
  7. SHAP 可解释性
    1. 安装并导入 SHAP 库(导入 shap)。确保版本为 0.41.0 以实现可重复性。
    2. 按照补充代码 6(补充文件 1)使用经过训练的 XGBoost 模型初始化 SHAP 解释器。
    3. 计算测试数据集的 SHAP 值以获得特征贡献分数。
    4. 生成全局特征重要性汇总图,以可视化哪些特征对预测的贡献最大。
    5. 使用 SHAP 瀑布图为所选样本创建单独的预测解释。
    6. 解释图以确定影响预测的关键特征。如 表4所示,关键特征包括TARGET_PATHWAY、DRUG_ID、CELL_LINE_NAME、TARGET蛋白和筛选培养基,表明药物特异性和细胞特异性特性显着影响药物反应预测。
      注意:SHAP 值是使用 shap 计算的。TreeExplainer() 用于 XGBoost 模型。使用shap.summary_plot()可视化全局特征重要性,并使用shap.dependence_plot()和shap.waterfall_plot()生成每个样本的解释(SHAP v0.41.0)如 表4所示,最有影响力的特征包括TARGET_PATHWAY、DRUG_ID和CELL_LINE_NAME,表明药物特异性和细胞特异性特性在确定药物反应方面都至关重要。其他主要贡献者是 TARGET 蛋白和筛选培养基,进一步强调了该模型与癌症药物基因组学中领域相关因素的一致性。
  8. 药物协同和聚类
    1. 下载协同数据
      1. 从公开可用的存储库下载药物组合协同数据:
        药物梳:https://drugcomb.fimm.fi
        SynergyDB:https://synergy.bioinformatics.nl
    2. 将协同数据与预测响应合并。
      1. 使用药物-细胞系组合作为唯一键,将下载的协同评分(ZIP、Bliss、Loewe、HSA)与预测的药物反应值(LN_IC50)合并。
      2. 在合并之前,确保数据集之间的药物标识符和细胞系名称对齐。
    3. 计算基于模型的协同分数。
      1. 对于每个药物对,使用单个模型预测LN_IC50值的平均值计算组合预测疗效:
        figure-protocol-4
        其中, Scomb 表示药物对的组合预测LN_IC50分数, figure-protocol-5 是药物 1 的预测LN_IC50。
      2. 根据协同分数对药物组合进行排名。
      3. 确定表现出最低协同得分的顶级组合(例如,硼替佐米 + 罗米地辛、长春碱 + 放线菌素),表明预测有效性较高。
        注意:较低的协同分数反映了更大的预测治疗潜力,使这些药物对成为进一步实验验证的候选者。按照补充代码 7A 和补充代码 7B(补充文件 1)中给出的步骤进行作。
  9. 协同排名和基于 PCA 的聚类
    1. 按协同分数对药物对进行排名。
      1. 使用药物-细胞系组合作为唯一键,将协同分数(ZIP、Bliss、Loewe、HSA)与预测的LN_IC50值合并。
      2. 使用平均预测LN_IC50值计算每个药物对的协同分数:
      3. 根据计算的协同分数对药物对进行排名。
      4. 将得分最低(最负)的药物对确定为潜在的协同组合(例如,硼替佐米 + 罗米地辛、长春碱 + 放线菌素)。
    2. 对药物反应矩阵进行PCA。
      1. 按照补充代码 8(补充文件 1)中所示的步骤,使用预测的LN_IC50值构建药物反应矩阵,其中药物为行,细胞系为列。
      2. 使用 zscore 归一化标准化矩阵。
      3. 使用两个主成分 (n_components = 2) 执行主成分分析 (PCA),以减少维数并捕获主要方差。
    3. 可视化 PCA 集群
      1. 使用 Matplotlib 或 Seaborn 绘制二维 PCA 投影。
      2. 确认具有相似作用机制的药物(例如多西紫杉醇和紫杉醇)聚集在一起,验证模型捕获具有生物学意义的关系的能力。
    4. 模型稳定性和特征平衡
      1. 在编码过程中过滤不常见的分类变量,以避免稀疏性问题。
      2. 调整自动编码器学习率并包含辍学层以防止收敛问题。
      3. 将 SHAP 分析限制在前 100 个特征,以减少内存开销并确保计算效率。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究的重点是使用先进的机器学习模型优化药物选择和预测乳腺癌的组合疗效。该数据集包括一组精选和过滤的乳腺癌细胞系、药物敏感性指标(LN_IC50、AUC、Z 分数)和分子描述符,例如 CNA、甲基化、基因表达、组织描述符和药物靶标。主要目的是预测单个药物跨细胞系的LN_IC50(半最大抑制浓度的自然对数),识别协同组合,并使用 SHAP 可解释性提供可解释性。模型是使用独立机器学习 (XGBoost) 和混合 Autoencoder-XGBoost 管道开发的。总体工作流程如图 1 所示

模型性能评估
XGBoost 模型在预测准确性和泛化方面优于混合 Autoencoder-XGBoost 管道。XGBoost模型报告的均方误差(MSE)为1.3789,决定系数(R²分数)为0.8145,反映了整个数据集的良好预测性能,如 表5所示。另一方面,混合模型的MSE为4.0322,R²为0.4577,这表明在这种情况下,通过自动编码降维可能导致输出和特征...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一个集成的机器学习管道,以适应药物的选择,预测协同组合,并确定药物再利用的可能性。来自GDSC数据库和协同存储库(例如SynergyDB、DrugComb)的数据被整合,以管理一个全面的药物-细胞系相互作用,包括分子特征(例如,基因表达,拷贝数改变)和药理学反应31。这里的主要目的是准确预测细胞系中的药物敏感性,对最有效的药物进行排名,并使用 ZIP、Bliss、Lowe 和 HSA 等已安装模型评估有希望的组合的协调能力。

XGBOOST模型总体性能最佳,MSE为1.3789,R2 为0.8145,Hybrid Authen Koder-XGBOOST管线(MSE = 4.0322,R2 = 0.4577)得到改进。XGBOOST的更好性能揭示了其在处理高维、非维生物医学数据方面的优势32。散点图和残差图证实了近似值和正确LN_IC50值之间紧密一致,并且剩余分布...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,不存在与这项工作相关的利益冲突。我们确认,大型语言模型(LLM)技术(ChatGPT,由OpenAI开发)在稿件准备的早期阶段被以有限的能力使用。具体来说,ChatGPT 被用于概念框架的想法生成和初步头脑风暴,随后作者对其进行了完善、验证和完全重写。所有核心科学内容、数据分析、解释和最终起草均由作者独家完成。ChatGPT 的输出在纳入之前经过了严格审查,以确保准确性、连贯性和完整性,符合期刊的透明度和道德准则。所有作者都已审查并批准了稿件的最终版本,并确认不存在任何可能被解释为影响本出版物内容的财务、个人或专业关系。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢基督大学计算机科学系提供的机构支持,该系为开展这项研究提供了必要的计算资源和学术环境。我们也感谢我们的同事和导师在整个工作过程中给予的协作指导和鼓励。

作者贡献:
Dyuti Banerjee 构思了这项研究,设计了方法,并整理了数据集。Sivaneasan Bala Krishnan 和 Kamal Upreti 实施了机器学习模型并进行了计算分析。Sumegh Shrikant Tharewal 和 Uma Shankar 为数据预处理、特征工程和结果验证做出了贡献。Pravin Kshirsagar 进行了协同分析和基于 PCA 的聚类。Manoj Kumar 协助进行文献综述、研究结果解释和手稿起草。所有作者都为稿件修改做出了贡献,批准了最终版本,并同意对工作的各个方面负责。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
自动编码器(深度学习模型)TensorFlow (谷歌)https://www.tensorflow.org药物反应建模的降维和特征编码
硼替佐米塞莱克化学S1013用于协同分析的药物
放线菌素西格玛-奥尔德里奇D1037用于协同分析的药物
多西紫杉醇西格玛-奥尔德里奇D1080型用于基于机制的聚类验证的药物
Matplotlib 库Python 包索引 (PyPI)https://matplotlib.orgPython 中的数据可视化和绘图
NumPy 库Python 包索引 (PyPI)https://numpy.org数值计算和矩阵运算
紫杉醇西格玛-奥尔德里奇T7191型用于基于机制的聚类验证的药物
熊猫图书馆Python 包索引 (PyPI)https://pandas.pydata.org数据作和处理
Python 3.10 中文文档Python 软件基础https://www.python.org主要编程语言
罗米地辛塞莱克化学S3020用于协同分析的药物
Scikit-learn 库Python 包索引 (PyPI)https://scikit-learn.org机器学习建模和预处理工具
Seaborn 图书馆Python 包索引 (PyPI)https://seaborn.pydata.org数据可视化和统计绘图
SHAP 库Python 包索引 (PyPI)https://shap.readthedocs.io可解释的 AI 模型可解释性
协同数据 (DrugComb)FIMM, 芬兰https://drugcomb.fimm.fi药物协同参考数据集
协同数据 (SynergyDB)格罗宁根大学https://synergy.bioinformatics.nl药物协同参考数据集
张量流 2.11谷歌https://www.tensorflow.org自动编码器深度学习模型实现
长春碱 Vinblastine西格玛-奥尔德里奇V1377用于协同分析的药物
XGBoost 库Python 包索引 (PyPI)https://xgboost.readthedocs.io梯度提升回归建模

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

相关文章