本方案提出了一种利用TCGA和GEO数据集,用于识别子宫内膜癌中与烟酰胺代谢相关的基因的计算方法。为促进子宫内膜癌生物标志物的发现和风险估计,本研究描述了不同表达的分析、通路增强、预后模型设计及评估程序。
研究文章
本方案提出了一种利用TCGA和GEO数据集,用于识别子宫内膜癌中与烟酰胺代谢相关的基因的计算方法。为促进子宫内膜癌生物标志物的发现和风险估计,本研究描述了不同表达的分析、通路增强、预后模型设计及评估程序。
子宫内膜癌(EC)是全球妇科肿瘤中最不常见的疾病之一,由于年龄增长和肥胖,发病率正在上升。淋巴结转移在子宫内膜癌(UCEC)中仍然常见,因此需要新的预后生物标志物来指导治疗。在这项研究中,分析了癌症基因组图谱(TCGA)中的UCEC信息,并通过基因表达综合图(GEO)验证了结果。共鉴定出18种与尼古丁酰胺代谢相关的差异表达遗传因子(NMRDEGs)。基因集富集分析(GSEA)显示其在氧化应激、缺氧、糖酵解和凋亡过程中的作用。单变量Cox回归识别出六个关键基因(AURKA、CDKN3、FOXM1、CDKN2A、TK1和CDK1),用于发展危害预测框架。蛋白质-蛋白质相互作用(PPI)分析发现了额外的枢纽基因,如CDK2、CCNA2、TP53和FOXM1。这六个关键基因显示出强烈的预后价值,研究的风险模型可能指导临床决策。研究发现,烟酰胺代谢与电征进展有显著关联。本研究为烟酰胺代谢在电征中的作用提供了新认识,并提出了治疗进展的可能途径。
子宫内膜癌(EC)在女性患者中较为常见1.EC可分为激素依赖型和非激素非依赖型2型。2020年,EC患者管理指南更新,包括分子标志物检测和分子分型,显著影响了EC3的术后辅助治疗和临床预后。EC的发病机制多方面,涉及多个致癌基因和/或肿瘤抑制基因的突变或丧失,以及多条信号通路的异常,这些都可能影响疾病进展和结局。寻找新的生物标志物和识别有效的治疗靶点至关重要。这一研究旨在深化对EC发病机制和潜在预后生物标志物的理解,为早期检测和靶向治疗奠定基础。
烟酰胺类似于烟酸,参与脂肪吸收和糖原分解。它作为人体重要的辅酶成分至关重要。烟酰胺代谢涵盖人体吸收、转化和利用烟酰胺的过程。
烟酰胺的代谢始于吸收。它可以通过摄入食物或体内氨基酸转化获得,并被肠道黏膜上皮细胞吸收。随后它转变为更复杂的形态,这在许多生化过程中至关重要。此外,烟酰胺还可转化为其他化合物,包括 通过 烟酰胺腺嘌呤二核苷酸甲基转移酶(NMT)转化为代谢物1-甲基烟酰胺。这些转变可能影响各种代谢疾病的发生和进展。据报道,补充烟酰胺具有多种益处,包括预防和治疗肿瘤4。当前研究证实,它可能下调肺癌细胞中STAT3Y705的磷酸化水平5。一项研究发现,单独使用烟酰胺可能抑制高风险患者的浸润性非黑色素瘤膜肿瘤6。Kourtzidis 等人发现 ,补充烟酰胺可以抑制大鼠的体重增加,增强转酮酶(TK)和红细胞 Na+-K+-ATPase 的活性,并影响体内的能量代谢。此前一项研究已确认尼古丁酰胺N-甲基转移酶(NNMT)是一种甲基转移酶,是癌症相关成纤维细胞活性的重要因素8。此外,烟酰胺磷酸核糖转移酶已被证明有助于复发的严重骨髓性白血病干部对维奈托克抗药性9。因此,目标是全面识别与EC风险相关的NAD+代谢相关基因(NMRG)。
访问受限。请登录或开始试用以查看此内容。
本研究使用了公开可得的去识别化临床和转录组数据,均来自《癌症基因组图谱》和《基因表达综合集》。所有贡献研究均获得机构审查委员会的事前批准和知情同意。由于仅进行了匿名化数据的二次分析,因此无需额外的伦理审批。所使用的数据库和软件列于 材料表中。
1. 数据下载
研究利用了EC(TCGA-子宫小体子宫内膜癌,TCGA-UCEC)数据集10,共589个样本,其中包括554个来自UCEC患者(UCEC组)的肿瘤组织样本和35个相邻正常组织(正常组)的测序数据。利用UCSC Xena数据库恢复了相应的临床数据11,排除了缺乏完整临床信息的部分。最终,共有577个包含临床数据的样本可供分析。详细基线信息见 表1。
通过GEOquery包13下载了与EC、GSE115810和GSE6367812相关的额外数据集。GSE115810数据集和GSE63678合并,形成了用于进一步分析的联合数据集(见表2)。
NAD+代谢相关基因(NMRGs)位于GeneCards记录14 和相关文献15之后。在GeneCards中使用“烟酰胺代谢”作为搜索词,识别出345个相关性评分高于4的NMRG。从文献中发现的42个NMRG中合并并去除重复,总共汇总出371个NMRG(补充表1)。临床数据以.tsv表型文件形式获取;数据以HTSeq-FPKM格式下载。被排除的样本缺失了超过20%的临床数据。FPKM经过log2变换并转换为TPM(每百万转录本数)。探针ID映射到GEO数据集的基因符号,重复探针被取平均。
2. 烟酰胺代谢的差异表达基因
研究开始时,应用R集sva16 去除GSE115810和GSE63678数据集后的集合所有权,形成包含31个EC(UCEC)和8个相邻正态样本的互数据集。接着,利用 limma集17 对TCGA-UCEC数据集进行基因表达差异研究。
TCGA-UCEC分析中的DEG与337个NMRG的交叉,以精准定位与尼古丁酰胺代谢相关的DEGs。这生成了一份与烟酰胺代谢相关的差异表达基因(NMRDEGs)列表,并配有文恩的插图。差异外观检查的结果由ggplot2 R package18展示,同时使用pheatmapset 19生成NMRDEG热图。通过使用ComBat(经验贝叶斯)批量校正消除数据集间方差。LIMMA经验贝叶斯线性模型框架被用于DEG分析。显式应用的差分表达阈值:
|日志2FC|≥ 1
FDR低于0.05。
NMRG名单仅与满足这两种要求的DEG相交。用ggplot2和pheatmap制作的火山图和热力图。
3. NMRDEG功能(GO)、通路(KEGG)增强检查
GO20 和KEGG21增强测试由 clusterProfiler集22完成。两种分析均以p调整0.05和FDR(q值)0.25<<显著性阈值识别。研究还将logFC值整合进富集分析中,结果以圆图和弦图表示。浓缩显著性阈值:p值调整后<0.05 FDR <0.25(q值)。集群剖析器用于去氧和KEGG研究。基因方向性通过包含对数2 重变化数据的弦图和圆图显示。
4. 基因集富集分析(GSEA)
通过GSEA23可以识别对表型贡献最大的遗传因子集合类型。在本次分析中,TCGA-UCEC数据集基于logFC值进行排名,并使用 clusterProfiler 软件包进行了改进性检查。主要限制包括种子值为2022年和10,000种排列组合。MSigDB基因集“c2.all.v2022.1.Hs.symbols.gmt”被使用了24个。通过山地图可视化了最富集的通路,包括Manalo缺氧诱导基因、氧化应激诱发的衰老、糖酵解和凋亡通路。在GSEA之前,基因按log2 倍变化排序。分析中使用了10,000个排列。c2.all.v2022.1.Hs.symbols.gmt是MSigDB集合。为了提高可重复性,采用了固定随机种子(2022年)。显著通路为p < 0.05和q < 0.25。
5. Cox模型构建及相关预后检查
为了确定子宫内膜癌(UCEC)中与硝酸酯代谢相关差异表达基因(NMRDEGs)的预测价值,研究人员使用单变量Cox回归分析首次分类候选人遗传因素;风险比例(HR)>1,p值<0.1的受试者被确定适合多变量Cox相对风险框架。
单变量Cox选择标准:p < 0.10,心率>1。多变量Cox模型采用了Log2-TPM归一化表达值。采用Cox系数×基因表达的线性组合来确定风险评分。在命名图校准中采用了1年、3年和5年OS概率。时间依赖ROC中采用了1年、3年和5年AUC值。采用surv_cutpoint最大统计量方法来确定生存阈值。KM和ROC分析使用相同的阈值。
基于多变量Cox模型构建了一种法则图,以评估其准确性或预测能力,并计算1年、3年和5年总存在的概率。标准化弧被用于评估预测前景与实际结果之间的稳定性,决策曲线分析(DCA)被用于衡量结构的医疗帮助性25。
mRNA表达水平通过DESeq2软件包以归一化log₂转化记录每百万(TPM)值确定。TPM考虑测序复杂性和基因测量,以提供样本间表达水平的稳健且无偏估计。
利用多元Cox模型的系数,确定了每位患者的预后危险等级如下:
riskScore = Σi 系数(基因i) *mRNA表达(基因i)(1)
Kaplan-Meier(KM)存在弧被制备,以评估在确定危险等级下形成的高风险和低危险集群的总体耐久能力。在评估框架在1年、3年和5年周期时的例行分析中,产生了时间依赖接收机工作特征(ROC)弧,时间观念26,27。
为了通过高表达和低表达集合分类基因表达以进行生存分层,采用survminer R包后的surv_cut点角色。该函数通过最大化标准化对数秩统计量来确定最大截断值,从而得到一个无偏且统计上最优的截止点。
每个预后基因的截止值以虚线表示在ROC曲线中。研究对所有生存和ROC分析采用相同的阈值。
TCGA RNA-seq 以 HTSeq-FPKM 格式下载;临床数据以TSV表型文件导入;FPKM 转换为 TPM 并进行了 log₂ 变换;GEO数据集通过平台注释从探针ID映射到基因符号;重复探针对单个基因值进行平均;排除缺失超过20%临床信息的样本;ComBat(经验贝叶斯)用于GSE数据集的批量校正;使用PCA和箱形图验证批次校正是否成功。使用标准表达式变换技术进行TPM规范化;使用ComBat进行批量校正,数据集来源为批处理变量;通过利马线性建模计算的差异表达(肿瘤与正常设计矩阵);基于 log₂ 重变化生成的排名基因列表,用于 GSEA 输入;以及使用生存分析工具进行的单变量和多元Cox回归
6. 基因组变异分析(GSVA)
GSVA28 被用于测量集群间的增强情况。在TCGA-UCEC数据集中,50条标志性通路被富集,其中41条在二元组装间表现出重要变化。GSVA与标志基因组结合使用,以获取每个样本的通路活性;STRING蛋白相互作用数据被导入Cytoscape;MCC算法用于识别枢纽基因;风险评分以基因表达值乘以Cox系数的总和计算;利用生存时间ROC程序生成了时间依赖的ROC曲线。对每个样本,GSVA计算了通路水平富集得分。Wilcoxon秩和检验用于评估标志通路活性的差异。在50条特征通路中,有41条显著不同(调整p < 0.05)。
7. 蛋白质间相互作用(PPI)系统
利用STRING文件29和0.70的通信值阈值创建了包含重要基因(AURKA、CDKN3、FOXM1、CDKN2A、TK1和CDK1)的PPI系统,显示高度置信度。该网络利用Cytoscape30构建,突出了可能在UCEC致病机制中起关键作用的相互作用。最大集团中心性(MCC)方法31 用于对他们在网络中交互得分产生的遗传因子进行排序。识别出界面评分最高的前10条蛋白序列,包括CDK2、CDK4、CCNA2、CCNB1、CCNE1、CDK1、TP53和FOXM1。这些基因在关键生物过程中的作用被进一步分析。GeneMANIA平台32 还被用于预测更多蛋白质相互作用,并为关键基因在UCEC进展中的作用提供更广泛的背景。STRING置信度分数阈值:>0.70(高置信度)。Cytoscape显示网络。最大团中心性(MCC)技术用于对枢纽基因进行排序。MCC排名用于识别最强的相互作用基因(CDK2、CCNA2、TP53等)。额外的相互作用预测则使用GeneMANIA进行。
8. 技术路线图
本研究的整体工作流程和方法总结于 图1所示的技术路线图中。本路线图概述了从数据集获取和差分表达分析到构建预后模型和富集分析的步骤。
9. 统计分析
数据处理和统计估计使用R程序(v4.3.0)完成。两组比较使用了曼-惠特尼U检验或独立学生t检验;Kruskal-Wallis测试已被应用于三次或更多次组装。描述性数据采用卡方检验或费舍尔精确检验进行评估。此外,还进行了斯皮尔曼相关和卡普兰-迈尔生存分析;p < 0.05被认为具有显著性。
根据数据分布应用统计检验:使用学生t检验的正态数据。曼-惠特尼U检验数据不常态。Kruskal-Wallis检验涵盖三个以上组。范畴数据的费舍尔精确方和卡方。统计显著性定义为p < 0.05。
数据可靠性由处理前检查点维持,箱型图应显示样本间表达方差一致,PCA图应显示ComBat调整后无批次特定簇。展示肿瘤-正常分组的热图和清晰展示基因上下调控的火山图对于DEG验证是必要的。对于预测Cox模型,校准图应匹配预测与实际存活率,ROC的AUC值应大于0.65,KM弧必须显示显著的生存差异。GSVA分析应显示风险组间不同的路径活动,符合如扩展或细胞周期路径等既定机制。为了验证网络韧性,PPI网络中高度耦合的节点必须集中出现,且由MCC确定的枢纽基因应与生理学上重要的调控因子匹配。
访问受限。请登录或开始试用以查看此内容。
合并GEO数据集的校正
研究使用SVA R集精确处理GSE115810和GSE63678数据集中的批量所有权,形成了一个统一数据集,称为联合数据集。通过循环箱形图(图2A,B)和主理性分析图(图2C,D)验证了组结果消除结果,证明批量效应基本消除。归一化后,PCA图应清晰区分肿瘤样本与正常样本,展示高效的批次校正和均匀的样本分组。
差分表达分析
499个DEG符合标准,其中184个上调基因和315个下调基因(见图3A,B)。我们通过将337个公共NMRG与499个DEG相交,识别出18个NMRDEG(
访问受限。请登录或开始试用以查看此内容。
能量代谢在癌细胞微环境中的作用近年来引起了广泛关注。研究表明,参与烟酰胺代谢的基因与各种恶性肿瘤的进展密切相关。一旦被人体吸收,烟酰胺会转化为NAD和NADP,这两种物质在众多癌症相关过程中起着关键作用。因此,NAD代谢正逐渐成为肿瘤治疗的一个有前景的目标。它在多种细胞活动中至关重要,包括转录后调控、细胞存活、能量代谢、细胞周期进展、凋亡、DNA修复、昼夜节律、染色体动态和端粒酶激活。越来越多的证据表明,NAD代谢产生的基因特征在不同癌症类型中表现出强烈的预测能力,包括卵巢癌和宫颈癌(33,34)。具体来说,研究指出Nampt在子宫内膜腺癌中的表达显著高于正常子宫内膜组织,暗示其参与子宫内膜癌(EC)的发展35。此外,先前的研究鉴定出六种NMRG(SLC22A13、CYP8B1、NMRK1、NAXE、NT5E和NT5M)作为EC患者预测遗传因子符号的预测因子36
访问受限。请登录或开始试用以查看此内容。
作者没有什么可透露的。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| clusterProfiler 包 | 生物导体 | v4.8.0 | GO和KEGG浓缩分析 |
| 细胞景象 | Cytoscape联盟 | v3.9.1 | PPI网络可视化 |
| DESeq2 封装 | 生物导体 | v1.40.0 | 归一化与表达式分析 |
| GeneCards数据库 | 基因卡套件 | 无 | 尼古丁酰胺代谢相关基因的来源 |
| GeneMANIA 平台 | genemania.org | 无 | 基因功能与相互作用预测 |
| GEO数据集(GSE115810,GSE63678) | 基因表达全集(GEO) | 无 | EC的公开基因表达数据集 |
| ggplot2 包 | 克兰 | 3.4.2版本 | 数据可视化 |
| Limma包裹 | 生物导体 | v3.54.0(示例) | 差分表达分析 |
| Pheatmap 包 | 克兰 | v1.0.12 | 热图绘制 |
| R 软件(v4.3.0) | R统计计算基金会 | 版本 4.3.0 | 数据分析平台 |
| STRING 数据库 | 弦(string-db.org) | v11.5 | 蛋白质-蛋白质相互作用分析 |
| SurvMiner 软件包 | 克兰 | v0.4.9 | 生存分析 |
| SVA包 | 生物导体 | v3.46.0 | 批次效应去除 |
| TCGA-UCEC 数据集 | 癌症基因组图谱(TCGA) | 无 | UCEC患者的转录组和临床数据 |
| 加州大学圣克鲁斯分校泽纳分校 | 加州大学圣克鲁兹分校 | 无 | 临床/基因组数据下载平台 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可