本文介绍了一种基于对来自多种公开数据库的合并临床数据集进行综合分析,以逐步开展表达、相关性及生存分析策略,探索乳腺癌生物标志物和生存预测因子的实验方案。
方法文章
本文介绍了一种基于对来自多种公开数据库的合并临床数据集进行综合分析,以逐步开展表达、相关性及生存分析策略,探索乳腺癌生物标志物和生存预测因子的实验方案。
近年来,新兴数据库的开发旨在降低获取复杂癌症基因组数据集的门槛,从而帮助研究人员分析和解读多种癌症类型的基因、样本及临床数据。本文以ID1(DNA结合蛋白抑制因子1)为例,介绍一种实用的操作流程,基于来自ONCOMINE、bcGenExMiner v4.0(乳腺癌基因表达矿工v4.0)、GOBO(基于基因表达的乳腺癌预后在线分析平台)、HPA(人类蛋白质图谱)和Kaplan-Meier绘图仪等在线数据库整合的临床数据集,刻画乳腺癌生物标志物及生存预测因子的表达模式。分析首先比较目标基因(如ID1)在癌组织样本与正常组织样本中的表达模式;随后,开展ID1与乳腺癌临床病理特征之间的相关性分析;接着,根据不同的亚组对ID1的表达谱进行分层;最后,分析ID1表达水平与生存结局之间的关联。该操作流程简化了整合来自不同数据库的多维度基因水平数据的概念,并可用于检验关于乳腺癌中基因改变事件的复发风险及基因组背景的假设。该方法可提高结论的可信度与代表性,从而为关注的基因提供富有信息量的研究视角。
乳腺癌是一种异质性疾病,不同分子亚型的预后和治疗策略各不相同,其发病机制和发展过程可能与不同的分子机制相关1,2,3。然而,从基础研究中的初步发现到临床应用,确定一个治疗靶点通常需要数年甚至数十年时间4。癌症基因组中高通量测序技术的全基因组应用极大地推动了寻找有价值的生物标志物或治疗靶点的进程5。
来自大规模癌症基因组学平台(如国际癌症基因组联盟 ICGC 和癌症基因组图谱 TCGA)产生的海量癌症基因组数据,给研究人员在数据探索、整合与分析方面带来了巨大挑战,尤其对于缺乏生物信息学和计算技术深入训练的用户而言更是如此6,7,8,9,10。近年来,一些新兴数据库(例如 ONCOMINE、bcGenExMiner v4.0 和 Kaplan-Meier plotter 等)被设计和开发出来,旨在降低访问复杂癌症基因组数据集的门槛,从而帮助研究人员分析和解读多种癌症类型中的基因、样本及临床数据11。本实验方案的目标是描述一种研究策略,该策略整合了多个广泛被研究人员认可的开放获取数据库中的多层次基因信息,用于鉴定乳腺癌的潜在生物标志物和预后因素。
ONCOMINE 数据库是一个基于网络的数据挖掘平台,包含癌症微阵列信息,旨在促进新型生物标志物和治疗靶点的发现11。目前,该数据库收录了来自65个基因表达数据集的超过4800万个基因表达测量值11,12。bcGenExMiner v4.0(非营利机构可免费使用的工具),又称乳腺癌基因表达分析器,是一个用户友好的基于网络的应用程序,整合了3,414例乳腺癌患者的DNA微阵列结果,其中1,209例患者发生过不良事件13。该工具旨在利用R统计软件及其相关软件包提升基因预后分析的性能。
GOBO 是一个多功能且用户友好的在线工具,整合了来自包含 51 个样本的乳腺癌细胞系数据集和包含 1881 个样本的乳腺肿瘤数据集的微阵列信息(例如 Affymetrix U133A),支持多种分析14。GOBO 数据库提供多种应用功能,包括对不同分子亚型的乳腺肿瘤和细胞系中基因表达谱进行快速分析、筛选共表达基因以构建潜在的元基因(metagenes),以及在乳腺癌数据集中对单个基因、基因集合或基因特征的表达水平与临床预后之间的相关性进行分析15。
人类蛋白质图谱是一个开放获取的项目,旨在帮助科学家探索人类蛋白质组,目前已为人类生物学和疾病领域的大量出版物做出了贡献。人类蛋白质图谱被公认为是生命科学界的一项欧洲核心资源16,17。
Kaplan-Meier 生存曲线绘图工具是一种在线工具,可同时整合基因表达数据和临床数据,用于评估 54,675 个基因 的预后效应,其数据基于 10,461 例癌症样本 ,其中包括 1,065 例胃癌 、2,437 例肺癌 、1,816 例卵巢癌和 5,143 例乳腺癌患者,中位随访时间分别为 33/49/40/69 个月18。该数据库提供基因表达、 无复发生存期(RFS)和总生存期(OS)信息的下载功能19,20。
本文介绍了一种利用多个公开数据库进行实际操作的方法,用于比较、分析和可视化目标基因在多种癌症研究中的表达改变模式,旨在总结其在乳腺癌中的表达谱、预后价值及潜在生物学功能。例如,近期研究表明,ID蛋白在肿瘤中具有促癌特性,并与恶性特征相关,包括细胞转化、永生化、增殖增强以及转移21,22,23。然而,ID家族的各个成员在不同类型的实体瘤中发挥着不同的作用,其在乳腺癌中的功能尚不明确24。在先前通过该方法开展的研究中,我们发现ID1是乳腺癌中一个有意义的预后指标25。因此,本实验方案将以ID1为例,介绍数据挖掘方法。
分析首先从在 ONCOMINE 中查询目的基因在癌组织样本与正常组织样本中的表达模式开始。随后,利用 bc-GenExMiner v4.0、GOBO 和 ONCOMINE 对目的基因在乳腺癌中的表达相关性进行分析。接着,使用上述三个数据库根据不同的亚组对 ID1 的表达谱进行分层。最后,利用 bc-GenExMiner v4.0、人类蛋白质图谱(the human protein atlas)和 Kaplan-Meier plotter 分析 ID1 表达与生存结局之间的关联。操作流程如 图1 所示的流程图。
访问受限。请登录或开始试用以查看此内容。
1. 表达模式分析
2. 表达相关性分析
3. 亚组分析
4. 生存分析
访问受限。请登录或开始试用以查看此内容。
使用ID1(DNA结合蛋白家族抑制因子成员之一)对乳腺癌生物标志物进行数据挖掘与整合分析的代表性结果,已在先前的研究中报道25。
如图2所示,使用ONCOMINE数据库分析了多种癌症中肿瘤组织与正常组织之间ID1 mRNA表达的差异,该数据库共包含445项独立分析。其中5项研究显示,ID1的mRNA表达水平在正常组织中显著高于乳腺癌组织。这些数据表明ID1在乳腺癌中存在表达失调。图3展示了通过bc-GenExMiner v4.0分析获得的与ID1正相关和负相关的最显著基因。为确定ID1 mRNA表达水平与乳腺癌患者临床病理参数之间的相关性,使用了bc-GenExMiner v4.0数据库进行分析。如图4所示,与存在淋巴结转移的患...
访问受限。请登录或开始试用以查看此内容。
对公共数据库的综合分析可能揭示目的基因的潜在功能,并阐明该基因与特定癌症临床病理参数之间的潜在关联27,31。仅基于单一数据库的探索与分析可能因潜在的选择偏倚,或在一定程度上受数据质量差异的影响(包括数据采集方法及数据库分析算法的不同),而提供有限或孤立的视角19。本方案最关键的步骤是选择合适的数据库,所选数据库应被大量科研人员广泛认可,并具有足够的代表性。研究者应利用多个数据库验证假设,并相互印证来自不同数据库的结果,而非依赖单一数据库。
本文所述方案是一种便于研究者操作的实验流程。该方法的优势在于,能够快速可视化并解析某个基因在乳腺癌中的潜在作用。此外,通过该流程获得的所有结果均可通过直接访问相应的网站进行即时验证和重复实验。该方法的局限性在于,基于数据库综合分析所得出的结论可能无法完全反映临床实际情况中的真实功能或关联性。这可能源于数据库存在的系统性偏差,在某些情况下,也可能由于样本量不足所致
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露
本工作部分得到了中国广东省自然科学基金(编号 2018A030313562)、广东省临床教学基地教学改革项目(编号 2016JDB092)、国家自然科学基金(81600358)以及中国广东省高等院校青年创新人才项目的资助(编号 2017KQNCX073)
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 配备支持 JavaScript 的 Internet 浏览器的个人计算机或计算设备 | Microsoft | 051690762553 | 我们支持并测试以下浏览器:Google Chrome、Firefox 3.0 及以上版本、Safari 以及 Internet Explorer 9.0 及以上版本 |
| Adobe Flash 播放器 | Adobe Systems Inc. | 可从 http://get.adobe.com/flashplayer/ 免费下载 | 在“网络 分析”标签页中可视化网络时,需要此浏览器插件 |
| Chrome 浏览器 | Google Inc. | 可从 https://www.google.cn/chrome/ 免费下载 | 查看病理报告以及许多 可下载文件时必需 |
| Java 运行时环境 | Oracle Corporation | 可从 http://www.java.com/getjava/ 下载 | |
| 适用于教职员工的 Office 365 ProPlus | Microsoft | 2003BFFD8117EA68 | 查看病理报告以及许多 可下载文件时必需 |
| Vectr 在线工具 | Vectr Labs Inc. | 可从 https://vectr.com/new 免费使用 | 可视化和编辑许多 可下载文件及图片时必需 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可