研究文章

基于机器学习的他莫昔芬耐药相关基因鉴定及其在乳腺癌预后建模中的应用

DOI:

10.3791/71327

2026年6月26日

* These authors contributed equally

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们开发了一种基于机器学习的六基因他莫昔芬耐药特征,可按生存风险对乳腺癌患者进行分层,或可为临床实践中个体化的预后评估和治疗决策提供支持。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

他莫昔芬是雌激素受体阳性(ER+)乳腺癌的重要内分泌治疗药物,但获得性耐药限制了其长期疗效。其分子机制复杂,且缺乏可预测的生物标志物。与他莫昔芬耐药相关的基因表达数据来自GEO数据库(GSE67916),使用limma算法鉴定出差异表达基因(DEGs)。功能富集分析(GO和KEGG)显示,这些基因参与免疫过程、抗病毒反应、内吞作用、溶酶体通路以及雌激素信号通路。通过三种机器学习算法(LASSO、SVM-RFE和RF)筛选出六个核心基因(CAMK1D、CHAC1、KIAA0513、MED13、NDRG1、STXBP5)。基于这些基因,利用TCGA-BRCA数据构建了一个预后风险模型,能够有效将患者分为高风险和低风险组,两组间的总生存期存在显著差异。该模型表现出良好的预测准确性(AUC = 0.70),并在时间依赖性ROC分析中展现出稳定的性能,且在独立队列中得到验证。本研究提供了一个稳健的与他莫昔芬耐药相关的基因特征及多基因预后模型,为理解耐药机制提供了新见解,并为ER+乳腺癌的个体化预后评估和治疗策略提供了潜在指导。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳腺癌是全球女性中最常见的癌症,也是癌症相关死亡的主要原因之一1。根据分子分型,约60%-70%的患者表现为雌激素受体阳性(ER+)亚型,该亚型通常对初始内分泌治疗反应良好。在多种内分泌治疗药物中,他莫昔芬——一种选择性雌激素受体调节剂(SERM)——长期以来一直是ER+乳腺癌辅助治疗和转移性治疗的标准方案,在大规模随机试验中显著改善了患者的生存结局2

尽管他莫昔芬具有明确的临床疗效,但仍有相当一部分患者最终会产生获得性耐药,导致疾病复发和进展3。因此,他莫昔芬耐药已成为乳腺癌长期治疗中的关键瓶颈。既往研究表明,驱动耐药的机制具有高度异质性,涉及雌激素受体(ER)信号通路异常、替代性生长因子通路(如PI3K/AKT、MAPK)的激活、细胞凋亡失调以及代谢重编程4

近年来,肿瘤微环境(TME),特别是免疫微环境,在治疗反应和耐药性中的作用受到越来越多关注。免疫细胞浸润和炎症信号通路与乳腺癌的进展及治疗敏感性密切相关。新兴证据表明,免疫相关过程可能调节细胞应激反应并促进免疫逃逸,从而导致内分泌耐药5。然而,与他莫昔芬耐药相关的特定免疫图谱仍有待全面阐明。

随着高通量测序和生物信息学的发展,转录组数据分析为解析药物耐药性的分子基础提供了强有力的手段。与单基因生物标志物相比,多基因特征能够更有效地捕捉肿瘤异质性,在预后判断中具有更高的稳定性和准确性。机器学习算法,如LASSO回归、支持向量机(SVM)和随机森林(RF),已成为精准医学中识别可靠生物标志物和构建预测模型的重要工具6。尽管已有若干基因特征被提出7,8,9,但往往缺乏充分的验证。

尽管先前的研究已探索了他莫昔芬耐药基因,但很少有研究系统地整合多种机器学习策略来构建经过独立队列验证的稳健预后模型。在本研究中,我们整合了来自GEO和TCGA的转录组数据,筛选与他莫昔芬耐药相关的基因。通过应用多种机器学习算法的集成方法,我们鉴定了核心耐药基因并构建了预后风险模型。我们进一步评估了该模型与免疫微环境的关联性,并在独立队列中验证了其预测价值,旨在为个体化治疗策略提供新的理论依据。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究中使用的所有数据均来自公开可访问的数据库(TCGA、GEO 和 METABRIC)。未涉及人类参与者或动物,因此无需机构审查委员会批准和知情同意。

数据采集与预处理

与他莫昔芬耐药相关的基因表达数据来自基因表达综合数据库(Gene Expression Omnibus, GEO)10。GSE67916 数据集(Affymetrix Human Genome U133 Plus 2.0 Array)包含 18 个乳腺癌细胞样本:8 个未经处理的对照样本和 10 个通过长期药物暴露诱导产生的他莫昔芬耐药样本。乳腺浸润性癌队列(TCGA-BRCA)的RNA测序数据及相应的临床随访信息从癌症基因组图谱(The Cancer Genome Atlas, TCGA)11下载获得。

使用R语言(版本4.4.2)中的affy包处理原始微阵列CEL文件。采用稳健多阵列平均值(Robust Multi-array Average, RMA)算法进行背景校正和标准化,包括log2转换和分位数归一化。利用平台注释文件将探针ID映射到基因符号;对于具有多个探针的基因,采用其平均表达值。对于TCGA的RNA测序数据,将每百万转录本数(transcripts per million, TPM)进行log2转换处理[log2(TPM + 1)]。排除生存信息不完整或临床变量缺失的样本。

差异表达基因的鉴定

使用limma R软件包12结合经验贝叶斯方法对他莫昔芬耐药样本与对照样本之间的差异表达进行评估。以|log2倍数变化| > 1且经调整的P值 < 0.05(Benjamini–Hochberg FDR)的基因为差异表达基因(DEGs)。

功能富集分析

使用 clusterProfiler15 R 软件包进行基因本体(Gene Ontology, GO)13和京都基因与基因组百科全书(Kyoto Encyclopedia of Genes and Genomes, KEGG)14分析。GO 分类包括生物过程(biological process, BP)、细胞组分(cellular component, CC)和分子功能(molecular function, MF)。校正后的 P 值< 0.05 被认为具有显著性。

基于机器学习的特征选择

采用三种机器学习算法来识别枢纽基因:(1)LASSO 回归16(glmnet 软件包),通过 10 折交叉验证选择最优惩罚参数(lambda.min);(2)支持向量机-递归特征消除(SVM-RFE)17(e1071 软件包),采用五折交叉验证识别分类误差最小的最小基因子集;(3)随机森林(RF)18(randomForest 软件包),构建 500 棵树(ntree = 500);基因根据 MeanDecreaseGini 指标进行排序。被三种方法共同识别出的基因被定义为枢纽基因。

预后风险模型的构建

利用TCGA-BRCA基因表达和生存数据构建了一个多基因预后风险模型。首先通过单变量Cox回归筛选与生存相关的基因,随后采用多变量Cox回归建立最终的基因特征。风险评分公式计算如下:风险评分 = (0.01297 × CAMK1D) + (0.03021 × CHAC1) + (0.02018 × KIAA0513) + (0.00647 × MED13) + (0.00108 × NDRG1) + (0.04551 × STXBP5)。根据中位风险评分将患者分为高风险组和低风险组。

预后模型的评估与验证

采用Kaplan–Meier分析和log-rank检验评估各组之间的总生存率差异。使用ROC曲线(pROC软件包)和时间依赖性ROC分析(timeROC软件包)评价预测性能。利用rms软件包构建整合风险评分和临床变量的列线图。通过校准曲线评估预测生存概率与实际观察生存概率之间的一致性。使用相同的公式和截断值,在独立的乳腺癌国际联盟分子分类队列(Molecular Taxonomy of Breast Cancer International Consortium, METABRIC)中进行外部验证19

免疫浸润分析

基于TCGA数据,采用CIBERSORT20并设置1,000次置换来估算免疫细胞浸润情况。纳入P < 0.05的样本。使用Wilcoxon秩和检验评估高风险组与低风险组之间免疫细胞组成的差异,采用Spearman秩相关分析评估枢纽基因表达水平与免疫细胞丰度之间的相关性。

统计学分析

所有分析均在 R 中进行。连续变量采用 Wilcoxon 秩和检验进行比较,分类变量采用卡方检验。双侧 P < 0.05 被认为具有统计学显著性。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

鉴定与他莫昔芬耐药相关的差异表达基因

在他莫昔芬耐药样本与对照样本之间共鉴定出854个差异表达基因(DEGs),其中包括556个上调基因和298个下调基因。差异表达基因的分布显示,耐药样本中以上调基因为主,提示与他莫昔芬耐药相关的广泛转录激活(图1)。

差异表达基因的功能富集分析

GO 富集分析显示,差异表达基因(DEGs)主要参与免疫和防御相关的生物学过程,包括对病毒的防御反应、I 型干扰素信号通路以及细胞对干扰素的反应。细胞组分分析表明,这些基因在膜结构和囊泡相关结构中显著富集,例如内吞囊泡膜、吞噬囊泡和早期内体。分子功能分析则揭示了其在结合功能和转运体相关活性方面的富集。

KEGG通路分析进一步显示,差异表达基因(DEGs)在免疫相关通路中显著富集,包括病毒致癌、EB病毒(Epstei...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

他莫昔芬耐药性仍是治疗ER+乳腺癌的关键障碍。尽管ER突变等机制已被广泛认知,但长期治疗所引发的系统性分子适应性变化仍不甚明确。在本研究中,我们整合了转录组学与机器学习方法,鉴定出一个稳定的六基因特征(CAMK1D、CHAC1、KIAA0513、MED13、NDRG1、STXBP5),可同时预测他莫昔芬耐药性及患者预后。

我们的功能分析表明,耐药性伴随着广泛的转录组重塑,尤其体现在免疫应答以及细胞内运输通路(溶酶体/吞噬体)中。这些通路的富集 "病毒防御" 和 "I型干扰素" 通路的激活更可能反映了耐药细胞中增强的无菌性炎症状态或应激反应,而非真正的病毒感染21这与新兴证据一致,即慢性应激信号可重塑肿瘤微环境,以支持肿瘤在药物压力下的存活。

已鉴定的六个基因在生物学上与耐药性具有合理的关联。NDRG1:NDRG1 是一个功能明确的应激反应基因,在缺氧适应和治疗耐药中发挥重要作用。该基因主要受缺氧诱导因子(HIFs)调控,后者协...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究由江苏省肿瘤分子靶向治疗与伴随诊断工程研究中心项目(SGK2202319)、江苏省高等教育机构科学技术创新研究团队项目(2021)、江苏省高职院校工程技术研究开发中心项目(2023)、中国江苏省高等教育机构自然科学重点基金(项目编号:24KJA310008)、苏州卫生职业技术学院重点项目(szwzy szwzy202406)、苏州大学放射医学与防护国家重点实验室项目(编号:GZK1202506)、江苏省肿瘤分子靶向治疗与伴随诊断工程研究中心项目(SGK1202413)以及东吴卫生人才计划(DWWS2024002,DWWS2025001)资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Affy 软件包Bioconductor-芯片数据处理
clusterProfiler 软件包Bioconductorv4.4.2GO 和 KEGG 富集分析
CIBERSORT 算法Newman 等-免疫细胞浸润估计
e1071 软件包(SVM-RFE)CRAN-支持向量机递归特征消除
基因表达综合数据库(GEO)NCBIGSE67916他莫昔芬耐药数据集
glmnet 软件包CRAN / Bioconductor-LASSO 回归
limma 软件包Bioconductor-差异表达分析
METABRIC 数据集cBioPortal / Curtis 等-验证队列
pROC 软件包CRAN-ROC 曲线分析
R 软件R Core Teamv4.4.2统计计算环境
随机森林软件包CRAN-随机森林算法
rms 软件包CRAN-列线图构建
TCGA-BRCA 队列癌症基因组图谱(TCGA)-训练队列 RNA-seq 数据
timeROC 软件包CRAN-时间依赖性 ROC 分析

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

232 232 ER

相关文章