研究文章

与慢性阻塞性肺疾病相关的PANoptosis基因可预测肺鳞状细胞癌的预后及化疗敏感性

45 次观看

DOI:

10.3791/71489

2026年7月7日

* These authors contributed equally

本文内容

摘要

本研究从公共转录组数据中提取与慢性阻塞性肺疾病(COPD)相关的PANoptosis基因集,并将其应用于肺鳞状细胞癌队列,以回顾性方式构建预后标志物。该标志物与免疫细胞浸润相关,并可计算预测药物敏感性,为未来的风险分层研究提供了具有假设生成价值的候选生物标志物。

摘要

慢性阻塞性肺疾病(COPD)是一种进行性炎症性疾病,可增加肺鳞状细胞癌(LUSC)的发病风险。PANoptosis整合了细胞焦亡、细胞凋亡和坏死性凋亡,但COPD相关PANoptosis基因与LUSC预后之间的关系尚不明确。本研究中,我们首先通过比较COPD肺组织与正常肺组织,从GSE57148数据集中获取COPD相关差异表达基因,并将这些基因与人工整理的PANoptosis相关基因列表取交集。所得基因集随后应用于TCGA-LUSC、GSE30219和GSE37745数据集,这些数据集作为未明确标注患者水平COPD共病情况的LUSC队列进行分析。我们评估了PANoptosis基因的表达模式,进行了无监督聚类,表征了不同聚类间的免疫浸润差异,并构建了一个经外部验证的预后标志物。我们共鉴定出38个在不同组织类型中差异表达的COPD相关PANoptosis基因。两种分子亚型表现出不同的免疫微环境特征、免疫检查点表达水平以及总体生存率。通过单变量Cox回归和LASSO Cox回归筛选出的12个基因风险模型可将患者分为高风险组和低风险组,在TCGA-LUSC、GSE30219和GSE37745队列中表现出中等至适度的预测效能。高风险患者对多种药物的计算预测IC50值更高,提示其药物敏感性较低,但尚未通过实验确认其对化疗药物耐药。这些结果表明,COPD相关的PANoptosis基因与LUSC的预后、免疫微环境重塑以及药物敏感性预测相关,可能为后续研究提供可验证的假设生成型生物标志物。

引言

肺鳞状细胞癌(LUSC)是非小细胞肺癌(NSCLC)的一种亚型,其特征是肺部鳞状细胞异常增殖。尽管在手术、以铂类为基础的化疗、免疫治疗、放疗以及部分分子靶向治疗策略方面已取得进展,但LUSC的整体治愈率仍然较低,尤其是在晚期疾病患者中1,2。由于肿瘤异质性显著以及存在多种耐药机制,提高治疗疗效仍面临巨大挑战3,4

程序性细胞死亡(PCD)对于维持组织稳态和整体健康至关重要。PANoptosis 是一种特定的协调性炎症性细胞死亡程序,整合了细胞焦亡、细胞凋亡和坏死性凋亡的特征5,6,7。PANoptosome 复合物包含上游感应和信号分子,如黑色素瘤缺失蛋白 2(AIM2)、Z-DNA 结合蛋白 1(ZBP1)和受体相互作用丝氨酸/苏氨酸蛋白激酶 1(RIPK1),这些分子能够感知特定刺激,触发 PANoptosome 的组装,并激活多种 PCD 通路8

异常的致癌信号通路(包括丝裂原活化蛋白激酶(MAPK)通路活性)参与了肺鳞状细胞癌(LUSC)的异质性及治疗耐药性9。然而,相较于肺腺癌,针对LUSC的靶向治疗选择仍较为有限,许多患者仍接受化疗、免疫治疗、放疗或联合治疗方案10。由于逃避程序性细胞死亡是治疗耐药的机制之一,对PANoptosis相关通路进行协同分析可能有助于提出关于LUSC治疗脆弱性的假设11

获得性耐药是肺鳞状细胞癌(LUSC)治疗失败的主要原因。这种耐药性可能与基因突变、信号通路异常、细胞死亡信号的改变以及肿瘤微环境的变化相关12。研究表明,凋亡参与了多种抗癌药物的疗效机制13。因此,参与凋亡、焦亡和坏死性凋亡的基因可能标记了与治疗反应相关的细胞死亡调控状态。然而,本研究为计算性分析,未直接验证这些基因是否导致对PANoptosis的耐药性14,15,16

在本研究中,我们使用操作性术语“PANoptosis相关基因”来描述从凋亡、焦亡、坏死性凋亡以及PANoptosis相关文献中整理出的基因17,18,19,20,21。该术语表示通路关联性,而非在慢性阻塞性肺疾病(COPD)相关肺鳞状细胞癌(LUSC)中经实验证实的抵抗功能。通过将COPD相关的转录组变化与此PANoptosis基因集整合,我们旨在鉴定与公共LUSC队列中预后、免疫特征及预测药物敏感性相关的候选基因和表达模式。

慢性阻塞性肺疾病(COPD)是一种以气道阻塞和肺功能下降为特征的慢性肺部疾病,是肺鳞状细胞癌(LUSC)的重要风险因素22。COPD患者肺部的慢性炎症环境可能为癌症的发生发展提供有利条件2324。此外,由于呼吸功能受损可能限制治疗选择,COPD还可能影响治疗方案的选取及其耐受性25–27。同时,与COPD相关的炎症反应可能改变肿瘤免疫微环境,从而影响对免疫治疗的应答28–30。本研究未直接分析临床确诊的COPD共病LUSC病例;而是从非恶性COPD肺组织中推导出一个与COPD相关的基因表达特征,并在公开的LUSC队列中评估其预后意义及与免疫特征的关联。

访问受限。请登录或开始试用以查看此内容。

方案

本研究仅使用公开的、去标识化的数据集,未涉及直接的人类或动物实验;因此,无需额外的伦理委员会批准和知情同意。

数据下载与处理
肺鳞状细胞癌(LUSC)的RNA测序数据及相应的临床信息通过基因组数据共享中心数据门户(Genomic Data Commons data portal)的TCGA-LUSC项目从癌症基因组图谱(The Cancer Genome Atlas, TCGA)数据库获取。本研究使用的TCGA-LUSC表达矩阵基于FPKM值。基因表达值在进行下游分析前已进行转换和标准化处理。可用的临床变量包括年龄、性别、肿瘤分期、病理TNM分期、分级、生存时间和生存状态。最初共检索到489例TCGA-LUSC病例,其中381例具有完整表达谱和总生存信息的患者被纳入预后模型构建及内部验证。

独立验证数据集于2026年1月3日从基因表达综合数据库(Gene Expression Omnibus,GEO)下载。GSE30219基于GPL570平台,包含307例肺鳞状细胞癌(LUSC)患者的基因表达数据及总生存信息。GSE37745同样基于GPL570平台,包含196例LUSC患者的基因表达数据及总生存信息。GSE57148基于GPL11154平台,包含91例正常肺组织和98例慢性阻塞性肺疾病(COPD)患者的肺组织样本,共计189例样本。GSE57148用于鉴定与COPD相关的差异表达基因,而GSE30219和GSE37745则作为独立的外部验证队列使用。

对于GEO数据集,探针注释使用相应的R注释包和平台注释文件进行。将探针标识符转换为官方基因符号。当多个探针映射到同一基因时,保留平均表达值最高的探针以代表该基因。在基因符号匹配后,验证数据集中未发现缺失的模型基因。TCGA-LUSC、GSE30219和GSE37745被分析为总体LUSC队列,因为本分析所使用的注释中未确认患者的COPD合并症状态。

由于TCGA和GEO数据集是使用不同的表达平台生成的,因此在应用模型之前,采用基于R的标准预处理方法对数据进行了跨平台标准化和批次效应校正。风险模型在TCGA-LUSC队列中进行训练,随后在各个独立的外部GEO队列中进行验证,而非直接合并所有队列进行分析。差异表达分析使用limma R软件包完成。在GSE57148中筛选与慢性阻塞性肺疾病(COPD)相关的差异表达基因时,采用|log2FC| > 0.263且P < 0.05作为筛选条件。该log2FC阈值对应约1.2倍的变化,被用作探索性筛选标准,以保留潜在相关的PANoptosis相关基因。共从已发表的关于细胞凋亡、细胞焦亡、坏死性凋亡及PANoptosis的相关研究中整理出277个PANoptosis相关基因,详见补充表1

基因功能富集分析
为了阐明所选与慢性阻塞性肺疾病(COPD)相关的PANoptosis基因的功能意义,使用clusterProfiler R软件包和org.Hs.eg.db注释包进行了基因本体(GO)和京都基因与基因组百科全书(KEGG)的富集分析。评估了GO的生物过程、细胞组分和分子功能三个类别。同时进行了KEGG通路富集分析,以鉴定与所选基因相关的信号通路。在适用情况下,采用Benjamini-Hochberg错误发现率法对P值进行多重检验校正。在此探索性分析中,富集项的P值< 0.05被视为具有统计学显著性。富集图使用ggplot2生成。

基于PAN凋亡相关基因表达模式的无监督聚类分析
为探究肺鳞状细胞癌(LUSC)中与PAN凋亡相关基因表达相关的分子异质性,采用ConsensusClusterPlus R软件包进行一致性聚类分析。根据与生存相关的PAN凋亡基因的表达谱对LUSC样本进行聚类。层次聚类采用Pearson相关距离。最大聚类数设定为6,并进行1,000次重采样迭代以评估聚类的稳健性。通过评估共识矩阵、累积分布函数曲线、delta面积图以及所得分组的生物学可解释性来确定最优聚类数目。根据上述标准,选择k = 2用于后续分析。采用Kaplan-Meier分析和log-rank检验评估两个分子组之间的生存差异。

不同亚型间免疫微环境差异的分析
为比较分子亚型间免疫微环境特征,采用CIBERSORT反卷积算法结合LM22白细胞特征矩阵来估算免疫细胞浸润水平。分析在R语言环境中使用e1071和preprocessCore软件包完成。记录CIBERSORT置换P值以评估反卷积估算结果的可靠性。由于本研究为探索性研究,且基于回顾性转录组数据,因此对免疫细胞差异的解读视为计算推断的免疫浸润模式,而非直接的细胞测量结果。

采用ESTIMATE算法计算每个肿瘤样本的基质评分、免疫评分、ESTIMATE评分及肿瘤纯度。应用GSVA基于选定的基因集估算通路水平的富集评分。使用非参数检验评估免疫细胞组分、免疫检查点基因、HLA家族基因以及ESTIMATE衍生评分在组间差异。对于多项免疫相关比较,适当时采用Benjamini-Hochberg校正;以名义P值报告的分析被视为探索性结果。采用Spearman秩相关分析评估基因表达与免疫相关标志物之间的关联,相关系数和P值在适用时均予报告。HLA转录本的差异被解释为与抗原呈递相关的转录变化,而非抗原呈递能力增强的直接功能证据。

构建与PAN凋亡相关基因的预后特征
采用具有完整表达谱和总生存信息的TCGA-LUSC队列进行预后模型构建。在最初获取的489例TCGA-LUSC病例中,纳入381例具有完整总生存数据的患者进行预后分析。这些患者按7:3的比例被随机分为训练队列和内部验证队列。根据生存状态进行分层随机化,以确保训练队列与验证队列之间的生存事件分布具有可比性。

在训练队列中,首先采用单变量Cox比例风险回归分析评估每个候选PANoptosis相关基因与总生存期之间的关联。将P < 0.05的基因视为候选预后基因,并随后纳入基于glmnet R软件包的LASSO Cox回归分析。采用十折交叉验证法选择最优惩罚参数并减少过拟合。根据LASSO Cox回归的系数及其对应的标准化基因表达值,使用以下公式计算每位患者的个体化风险评分:

风险评分 = Σ(coefi × Xi)

其中 coefi 表示每个选定基因的回归系数,Xi 表示相应基因的标准化表达值。最终的预后模型包含 12 个基因:GSDMD、IL18、NFKBIA、PIK3CA、IL1B、BIRC3、MCL1、PSMB10、LMNA、CFLAR、IL1R1 和 AKT3。基于系数的完整风险评分方程见补充表 2

训练队列中的中位风险评分被用作分界值,将患者分为高风险组和低风险组。相同的风险评分公式被应用于内部测试队列以及外部验证队列GSE30219和GSE37745。采用Kaplan-Meier生存分析、log-rank检验和时间依赖性受试者工作特征曲线分析来评估模型性能。由于验证数据集是通过微阵列平台生成的,且不包含经临床确认的慢性阻塞性肺疾病(COPD)共病注释信息,因此外部验证被解释为在独立的肺鳞状细胞癌(LUSC)队列中的回顾性评估,而非在经临床确诊的合并COPD的LUSC患者中的验证。

药物敏感性预测分析
使用 pRRophetic R 软件包评估药物敏感性,该软件包基于癌症药物敏感性基因组学数据库(Genomics of Drug Sensitivity in Cancer database)的药物基因组学参考数据,利用肿瘤基因表达谱预测药物反应。针对每个患者样本计算了预测的半数最大抑制浓度(IC50)值。表达矩阵根据 pRRophetic 的输入要求进行处理,并采用标准的 pRRophetic 兼容流程进行批次效应校正。预测的 IC50 值以 pRRophetic 输出尺度报告。

作为探索性药物敏感性检测小组,评估了八种候选药物,包括索拉非尼、吉非替尼、博来霉素、博舒替尼、依托泊苷、来那度胺、喜树碱和甲氨蝶呤。采用Wilcoxon秩和检验比较高风险组与低风险组之间预测IC50值的差异。这些结果被解释为计算得出的药物敏感性估计值,而非实测的临床化疗反应或经实验验证的药物耐药性。

统计学分析
所有统计学分析均使用 R 软件进行。两组之间的连续变量比较采用 Wilcoxon 秩和检验,而多个组之间的比较则在适当情况下采用 Kruskal-Wallis 检验。总生存期被定义为主要生存终点。采用 Kaplan-Meier 法绘制生存曲线以比较组间的生存差异,并使用对数秩检验评估统计学显著性。进行单变量和多变量

采用Cox比例风险回归分析评估临床变量、风险分组与总生存期之间的预后关联。在单变量Cox分析中具有临床相关性或统计学意义的变量被纳入多变量Cox回归分析。使用Schoenfeld残差检验比例风险假设。对于Cox回归分析和列线图构建,缺失的临床变量采用完整病例分析法处理。在进行多变量建模前,对临床变量间的共线性进行了评估。

采用时间依赖性受试者工作特征(ROC)曲线评估风险模型对1年、3年和5年总生存率的预测效能。使用多变量模型中保留的变量或具有充分临床可及性的变量构建列线图。通过校准图比较预测与观察的总生存概率。采用决策曲线分析作为探索性评估,在选定的阈值概率范围内评估潜在的净获益。

采用Spearman秩相关分析评估基因表达与免疫相关特征之间的关联。在适用的情况下报告相关系数和P值。对于多重比较,在适当情况下应用Benjamini-Hochberg错误发现率校正。使用名义P值报告的分析被视为探索性分析。双侧P值< 0.05被认为具有统计学显著性。

访问受限。请登录或开始试用以查看此内容。

结果

肺鳞状细胞癌中 PANoptosis 相关基因的表达模式及功能注释
对来自 GSE57148 的转录组数据进行分析,其中包括 91 例正常肺组织和 98 例慢性阻塞性肺疾病(COPD)肺组织,以鉴定与 COPD 相关的差异表达基因。共鉴定出 2,182 个 COPD 相关基因,其中 38 个基因与已整理的 PANoptosis 相关基因集重叠(图 1A 和 1B)。这 38 个基因的染色体分布情况如 图 1C 所示。随后在 TCGA-LUSC 肿瘤及正常组织中评估了这些基因的表达模式,多个基因在肿瘤与正常样本之间表现出显著的差异表达(图 1D)。蛋白质-蛋白质相互作用分析鉴定出多个高度连接的基因,包括 STAT3、NFKBIA、MAPK3、IL1B 和 MTOR(图 1E)。功能富集分析显示,这些基因主要参与凋亡、PI3K/A...

访问受限。请登录或开始试用以查看此内容。

讨论

慢性阻塞性肺疾病(COPD)与肺鳞状细胞癌(LUSC)在临床上和生物学上通过共同的炎症机制、吸烟相关因素以及气道损伤相关的致病过程相互关联。尽管免疫检查点抑制剂和其他全身性治疗手段已改善了LUSC的治疗选择,但由于肿瘤异质性、生物标志物分层不完善以及治疗耐药性,许多患者的持久获益仍然有限31,32,33

PAN凋亡为解释细胞死亡调控提供了一个有用的框架,因为它通过共享的信号机制整合了焦亡、凋亡和坏死性凋亡34。在本研究中,与慢性阻塞性肺疾病(COPD)相关的PAN凋亡基因在公共的肺鳞状细胞癌(LUSC)队列中与生存异质性、亚型分层以及免疫微环境特征相关。由于该分析为回顾性且基于计算,因此这些发现应被解读为关联性结果,而非表明这些基因直接赋予PAN凋亡抵抗性的直接证据35,

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

致谢

作者感谢癌症基因组图谱(The Cancer Genome Atlas)、基因表达综合数据库(Gene Expression Omnibus)以及癌症药物敏感性基因组学项目(Genomics of Drug Sensitivity in Cancer)提供了本研究中使用的开放获取数据集。本研究未获得外部资金支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
AnnotationDbi R 包BioconductorN/A用于基因注释和标识符转换。来源:https://bioconductor.org/packages/AnnotationDbi/
caret R 包CRANN/A用于将 TCGA-LUSC 队列可重复地按分层随机方法划分为训练集和测试集。来源:https://cran.r-project.org/package=caret
CIBERSORT 算法CIBERSORT 资源N/A使用 LM22 特征矩阵进行免疫细胞去卷积分析。访问和授权需遵循原始资源提供方的规定。来源:https://cibersortx.stanford.edu/
clusterProfiler R 包BioconductorN/A用于 GO 和 KEGG 富集分析。来源:https://bioconductor.org/packages/clusterProfiler/
ConsensusClusterPlus R 包BioconductorN/A用于 PANoptosis 相关基因表达模式的一致性聚类。来源:https://bioconductor.org/packages/ConsensusClusterPlus/
e1071 R 包CRANN/A作为基于 CIBERSORT 的去卷积分析的依赖包使用。来源:https://cran.r-project.org/package=e1071
edgeR R 包BioconductorN/A在需要基于计数进行归一化时,用于 RNA-seq 计数数据处理。来源:https://bioconductor.org/packages/edgeR/
ESTIMATE R 包MD 安德森癌症中心 / SourceForgeN/A用于计算基质评分、免疫评分、ESTIMATE 评分和肿瘤纯度。来源:https://sourceforge.net/projects/estimateproject/
基因组数据共享门户美国国家癌症研究所TCGA-LUSCTCGA-LUSC RNA 测序数据和临床注释的来源。来源:https://portal.gdc.cancer.gov/
癌症药物敏感性基因组学数据库GDSC 项目N/A通过与 pRRophetic 兼容的参考数据使用的药物反应参考数据集。来源:https://www.cancerrxgene.org/
GEOquery R 包BioconductorN/A用于下载和解析 GEO 系列矩阵文件。来源:https://bioconductor.org/packages/GEOquery/
ggplot2 R 包CRANN/A用于数据可视化和图表生成。来源:https://cran.r-project.org/package=ggplot2
ggpubr R 包CRANN/A用于出版级绘图和组间比较。来源:https://cran.r-project.org/package=ggpubr
glmnet R 包CRANN/A用于 LASSO Cox 回归和预后模型构建。来源:https://cran.r-project.org/package=glmnet
GSE30219 数据集NCBI 基因表达综合数据库GSE30219包含表达数据和生存信息的外部 LUSC 验证队列。来源:https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE30219
GSE37745 数据集NCBI 基因表达综合数据库GSE37745包含表达数据和生存信息的外部 LUSC 验证队列。来源:https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE37745
GSE57148 数据集NCBI 基因表达综合数据库GSE57148用于获取 COPD 相关差异表达基因的 COPD 与正常肺组织转录组数据集。来源:https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE57148
limma R 包BioconductorN/A用于差异表达分析。来源:https://bioconductor.org/packages/limma/
org.Hs.eg.db 注释包BioconductorN/A用于富集分析中的人类基因注释。来源:https://bioconductor.org/packages/org.Hs.eg.db/
preprocessCore R 包BioconductorN/A用于表达数据预处理和兼容 CIBERSORT 的工作流程。来源:https://bioconductor.org/packages/preprocessCore/
pRRophetic R 包CRANN/A用于基于基因表达数据探索性预测药物 IC50 值。来源:https://cran.r-project.org/package=pRRophetic
R 软件统计计算 R 基金会版本 4.1.0用于所有统计分析和图表生成。来源:https://www.r-project.org/
STRINGdb R 包BioconductorN/A在适用情况下用于蛋白质-蛋白质相互作用相关分析。来源:https://bioconductor.org/packages/STRINGdb/
SummarizedExperiment R 包BioconductorN/A用于处理通过 TCGAbiolinks 下载的 TCGA 表达数据对象。来源:https://bioconductor.org/packages/SummarizedExperiment/
survival R 包CRANN/A用于 Cox 回归和 Kaplan-Meier 生存分析。来源:https://cran.r-project.org/package=survival
survminer R 包CRANN/A用于可视化 Kaplan-Meier 生存曲线和风险表。来源:https://cran.r-project.org/package=survminer
TCGAbiolinks R 包BioconductorN/A用于下载和准备 TCGA-LUSC 表达数据和临床数据。来源:https://bioconductor.org/packages/TCGAbiolinks/
timeROC R 包CRANN/A用于预后模型的时间依赖性 ROC 分析。来源:https://cran.r-project.org/package=timeROC

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 233

相关文章