方法文章

利用多个公开数据库对乳腺癌生物标志物进行数据挖掘与整合分析

DOI:

10.3791/59238

2019年5月17日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种基于对来自多种公开数据库的合并临床数据集进行综合分析,以逐步开展表达、相关性及生存分析策略,探索乳腺癌生物标志物和生存预测因子的实验方案。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

近年来,新兴数据库的开发旨在降低获取复杂癌症基因组数据集的门槛,从而帮助研究人员分析和解读多种癌症类型的基因、样本及临床数据。本文以ID1(DNA结合蛋白抑制因子1)为例,介绍一种实用的操作流程,基于来自ONCOMINE、bcGenExMiner v4.0(乳腺癌基因表达矿工v4.0)、GOBO(基于基因表达的乳腺癌预后在线分析平台)、HPA(人类蛋白质图谱)和Kaplan-Meier绘图仪等在线数据库整合的临床数据集,刻画乳腺癌生物标志物及生存预测因子的表达模式。分析首先比较目标基因(如ID1)在癌组织样本与正常组织样本中的表达模式;随后,开展ID1与乳腺癌临床病理特征之间的相关性分析;接着,根据不同的亚组对ID1的表达谱进行分层;最后,分析ID1表达水平与生存结局之间的关联。该操作流程简化了整合来自不同数据库的多维度基因水平数据的概念,并可用于检验关于乳腺癌中基因改变事件的复发风险及基因组背景的假设。该方法可提高结论的可信度与代表性,从而为关注的基因提供富有信息量的研究视角。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳腺癌是一种异质性疾病,不同分子亚型的预后和治疗策略各不相同,其发病机制和发展过程可能与不同的分子机制相关1,2,3。然而,从基础研究中的初步发现到临床应用,确定一个治疗靶点通常需要数年甚至数十年时间4。癌症基因组中高通量测序技术的全基因组应用极大地推动了寻找有价值的生物标志物或治疗靶点的进程5

来自大规模癌症基因组学平台(如国际癌症基因组联盟 ICGC 和癌症基因组图谱 TCGA)产生的海量癌症基因组数据,给研究人员在数据探索、整合与分析方面带来了巨大挑战,尤其对于缺乏生物信息学和计算技术深入训练的用户而言更是如此6,7,8,9,10。近年来,一些新兴数据库(例如 ONCOMINE、bcGenExMiner v4.0 和 Kaplan-Meier plotter 等)被设计和开发出来,旨在降低访问复杂癌症基因组数据集的门槛,从而帮助研究人员分析和解读多种癌症类型中的基因、样本及临床数据11。本实验方案的目标是描述一种研究策略,该策略整合了多个广泛被研究人员认可的开放获取数据库中的多层次基因信息,用于鉴定乳腺癌的潜在生物标志物和预后因素。

ONCOMINE 数据库是一个基于网络的数据挖掘平台,包含癌症微阵列信息,旨在促进新型生物标志物和治疗靶点的发现11。目前,该数据库收录了来自65个基因表达数据集的超过4800万个基因表达测量值11,12。bcGenExMiner v4.0(非营利机构可免费使用的工具),又称乳腺癌基因表达分析器,是一个用户友好的基于网络的应用程序,整合了3,414例乳腺癌患者的DNA微阵列结果,其中1,209例患者发生过不良事件13。该工具旨在利用R统计软件及其相关软件包提升基因预后分析的性能。

GOBO 是一个多功能且用户友好的在线工具,整合了来自包含 51 个样本的乳腺癌细胞系数据集和包含 1881 个样本的乳腺肿瘤数据集的微阵列信息(例如 Affymetrix U133A),支持多种分析14。GOBO 数据库提供多种应用功能,包括对不同分子亚型的乳腺肿瘤和细胞系中基因表达谱进行快速分析、筛选共表达基因以构建潜在的元基因(metagenes),以及在乳腺癌数据集中对单个基因、基因集合或基因特征的表达水平与临床预后之间的相关性进行分析15

人类蛋白质图谱是一个开放获取的项目,旨在帮助科学家探索人类蛋白质组,目前已为人类生物学和疾病领域的大量出版物做出了贡献。人类蛋白质图谱被公认为是生命科学界的一项欧洲核心资源16,17

Kaplan-Meier 生存曲线绘图工具是一种在线工具,可同时整合基因表达数据和临床数据,用于评估 54,675 个基因 的预后效应,其数据基于 10,461 例癌症样本 ,其中包括 1,065 例胃癌 、2,437 例肺癌 、1,816 例卵巢癌和 5,143 例乳腺癌患者,中位随访时间分别为 33/49/40/69 个月18。该数据库提供基因表达、 无复发生存期(RFS)和总生存期(OS)信息的下载功能19,20

本文介绍了一种利用多个公开数据库进行实际操作的方法,用于比较、分析和可视化目标基因在多种癌症研究中的表达改变模式,旨在总结其在乳腺癌中的表达谱、预后价值及潜在生物学功能。例如,近期研究表明,ID蛋白在肿瘤中具有促癌特性,并与恶性特征相关,包括细胞转化、永生化、增殖增强以及转移21,22,23。然而,ID家族的各个成员在不同类型的实体瘤中发挥着不同的作用,其在乳腺癌中的功能尚不明确24。在先前通过该方法开展的研究中,我们发现ID1是乳腺癌中一个有意义的预后指标25。因此,本实验方案将以ID1为例,介绍数据挖掘方法。

分析首先从在 ONCOMINE 中查询目的基因在癌组织样本与正常组织样本中的表达模式开始。随后,利用 bc-GenExMiner v4.0、GOBO 和 ONCOMINE 对目的基因在乳腺癌中的表达相关性进行分析。接着,使用上述三个数据库根据不同的亚组对 ID1 的表达谱进行分层。最后,利用 bc-GenExMiner v4.0、人类蛋白质图谱(the human protein atlas)和 Kaplan-Meier plotter 分析 ID1 表达与生存结局之间的关联。操作流程如 图1 所示的流程图。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 表达模式分析

  1. 访问 ONCOMINE 网络界面26
  2. 搜索框 中输入 ID1,获取 ID1 基因在多种恶性肿瘤中的相对表达水平。
  3. 主要筛选条件 菜单中选择 分析类型,然后依次选择 癌症与正常组织分析乳腺癌与正常组织分析
  4. 其他视图 菜单中选择 基因汇总视图,将 P 值阈值设为 0.01,并下载图像。
    注意:倍数变化的阈值为 2,如先前研究中所述27

2. 表达相关性分析

  1. 进入 bc-GenExMiner v4.0 网络界面28
  2. ANALYSIS 菜单中选择 CORRELATION,点击 EXHAUSTIVE 按钮。在搜索框中输入 ID1,然后点击 Submit 按钮和 Start analysis 按钮。
    注意:默认设置显示所有患者的表达相关性分析结果;通过点击 Molecule subtype 筛选器,可在不同乳腺癌亚型中获得更精确的分析结果。

3. 亚组分析

  1. 在 bc-GenExMiner v4.0 中进行亚组分析
    1. 进入 bc-GenExMiner v4.0 网络界面28
    2. ANALYSIS 菜单中选择 EXPRESSION,点击 EXHAUSTIVE 按钮。在搜索框中输入 ID1,然后点击 Submit 按钮和 Start analysis 按钮。
    3. 点击 淋巴结状态(LN)Scarff Bloom & Richardson 分级状态(SBR) 缩略图以查看完整图像。在 SBR 图像中,点击下方按钮以显示图形的 P 值。下载这些图像。
  2. 在乳腺癌基因表达结果在线分析工具(GOBO)中进行亚组分析
    1. 进入 GOBO 网络界面14
    2. 在屏幕上的 upload the gene set 区域输入目标基因符号 ID1
    3. Define gene/probe identifiers 的搜索范围设置为 Gene Symbol。在 Tumor selection 中选择 All。在 Multivariate parameters 中选择 Node statusGrade stratified。其余选项保持默认设置。提交查询并下载图像。

4. 生存分析

  1. 在 bc-GenExMiner v4.0 中进行生存分析
    1. 访问 bc-GenExMiner v4.0 网络界面28
    2. ANALYSIS 菜单中选择 PROGNOSTIC,点击 EXHAUSTIVE 按钮。在搜索框中输入 ID1,然后点击 Submit 按钮和 Start analysis 按钮。
    3. 在全面预后分析中,在 Population and event criteria 下选择 Nm, ERm, MR,然后点击 Submit 按钮以获取更多信息。点击 Kaplan-Meier曲线 缩略图以导出完整图表。
      注:N (+, -, m):淋巴结状态(+:阳性,-:阴性,m:混合);ER (+, -, m):雌激素受体状态(+:阳性,-:阴性,m:混合);MR:转移性复发
  2. 在人类蛋白质图谱(HPA)中进行生存分析
    1. 访问人类蛋白质图谱网络界面29
    2. 在搜索框中输入 ID1,点击 Search 按钮,选择 Pathology 子图谱。
      注:17种癌症类型的mRNA表达水平显示在RNA表达概览部分。箱形图中的每种癌症组织标签均可点击,以进入提供生存分析数据和RNA表达水平的详细页面。
    3. 点击 乳腺癌 标签,进入详细页面查看交互式生存散点图和生存分析结果,并下载图像。
  3. 在Kaplan-Meier Plotter生存分析工具中进行生存分析
    1. 访问Kaplan-Meier Plotter网络界面30,在mRNA基因芯片区域点击 Start KM plotter for breast cancer
    2. 在搜索栏中输入 ID1,并在候选菜单中选择绿色项目。
    3. 选择 RFS 作为生存类型,其余选项保持默认设置。点击 Draw Kaplan-Meier plot 并下载图像。
      注:可根据需要更改生存类型、截断类型、随访阈值以及探针集选项。通过修改 Restrict analysis to subtypes 框中的设置,可获得包括ER、PR、HER-2、淋巴结、分级、Tp53状态和分子亚型在内的亚组预后分析结果1。同样,可在 Restrict analysis to selected cohorts’ 框中设置治疗过滤条件。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

使用ID1(DNA结合蛋白家族抑制因子成员之一)对乳腺癌生物标志物进行数据挖掘与整合分析的代表性结果,已在先前的研究中报道25

图2所示,使用ONCOMINE数据库分析了多种癌症中肿瘤组织与正常组织之间ID1 mRNA表达的差异,该数据库共包含445项独立分析。其中5项研究显示,ID1的mRNA表达水平在正常组织中显著高于乳腺癌组织。这些数据表明ID1在乳腺癌中存在表达失调。图3展示了通过bc-GenExMiner v4.0分析获得的与ID1正相关和负相关的最显著基因。为确定ID1 mRNA表达水平与乳腺癌患者临床病理参数之间的相关性,使用了bc-GenExMiner v4.0数据库进行分析。如图4所示,与存在淋巴结转移的患...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

对公共数据库的综合分析可能揭示目的基因的潜在功能,并阐明该基因与特定癌症临床病理参数之间的潜在关联27,31。仅基于单一数据库的探索与分析可能因潜在的选择偏倚,或在一定程度上受数据质量差异的影响(包括数据采集方法及数据库分析算法的不同),而提供有限或孤立的视角19。本方案最关键的步骤是选择合适的数据库,所选数据库应被大量科研人员广泛认可,并具有足够的代表性。研究者应利用多个数据库验证假设,并相互印证来自不同数据库的结果,而非依赖单一数据库。

本文所述方案是一种便于研究者操作的实验流程。该方法的优势在于,能够快速可视化并解析某个基因在乳腺癌中的潜在作用。此外,通过该流程获得的所有结果均可通过直接访问相应的网站进行即时验证和重复实验。该方法的局限性在于,基于数据库综合分析所得出的结论可能无法完全反映临床实际情况中的真实功能或关联性。这可能源于数据库存在的系统性偏差,在某些情况下,也可能由于样本量不足所致

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作部分得到了中国广东省自然科学基金(编号 2018A030313562)、广东省临床教学基地教学改革项目(编号  2016JDB092)、国家自然科学基金(81600358)以及中国广东省高等院校青年创新人才项目的资助(编号 2017KQNCX073)

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
配备支持 JavaScript 的 Internet 浏览器的个人计算机或计算设备
Microsoft051690762553我们支持并测试以下浏览器:Google Chrome、Firefox 3.0 及以上版本、Safari 以及 Internet Explorer 9.0 及以上版本
Adobe Flash 播放器Adobe Systems Inc.可从 http://get.adobe.com/flashplayer/ 免费下载在“网络
分析”标签页中可视化网络时,需要此浏览器插件
Chrome 浏览器Google Inc.可从 https://www.google.cn/chrome/ 免费下载查看病理报告以及许多
可下载文件时必需
Java 运行时环境Oracle Corporation可从 http://www.java.com/getjava/ 下载
适用于教职员工的 Office 365 ProPlusMicrosoft2003BFFD8117EA68查看病理报告以及许多
可下载文件时必需
Vectr 在线工具Vectr Labs Inc.可从 https://vectr.com/new 免费使用可视化和编辑许多
可下载文件及图片时必需

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. van 't Veer, L. J., et al. Gene expression profiling predicts clinical outcome of breast cancer. Nature. 415 (6871), 530-536 (2002).
  2. Loi, S., et al. Definition of clinically distinct molecular subtypes in estrogen receptor-positive breast carcinomas through genomic grade. Journal of Clinical Oncology. 25 (10), 1239-1246 (2007).
  3. Cancer Genome Atlas, N. Comprehensive molecular portraits of human breast tumours. Nature. 490 (7418), 61-70 (2012).
  4. Emerson, J. W., Dolled-Filhart, M., Harris, L., Rimm, D. L., Tuck, D. P. Quantitative assessment of tissue biomarkers and construction of a model to predict outcome in breast cancer using multiple imputation. Cancer Informatics. 7, 29-40 (2009).
  5. Yu, H., et al. Integrative genomic and transcriptomic analysis for pinpointing recurrent alterations of plant homeodomain genes and their clinical significance in breast cancer. Oncotarget. 8 (8), 13099-13115 (2017).
  6. He, W., et al. TCGA datasetbased construction and integrated analysis of aberrantly expressed long noncoding RNA mediated competing endogenous RNA network in gastric cancer. Oncology Reports. , (2018).
  7. Liu, J., et al. An Integrated TCGA Pan-Cancer Clinical Data Resource to Drive High-Quality Survival Outcome Analytics. Cell. 173 (2), e411 400-416 (2018).
  8. Esgueva, R., et al. Next-generation prostate cancer biobanking: toward a processing protocol amenable for the International Cancer Genome Consortium. Diagnostic Molecular Pathology. 21 (2), 61-68 (2012).
  9. Joly, Y., Dove, E. S., Knoppers, B. M., Bobrow, M., Chalmers, D. Data sharing in the post-genomic world: the experience of the International Cancer Genome Consortium (ICGC) Data Access Compliance Office (DACO). PLoS Computational Biology. 8 (7), e1002549(2012).
  10. Zhang, J., et al. International Cancer Genome Consortium Data Portal--a one-stop shop for cancer genomics data. Database (Oxford). 2011, bar026 (2011).
  11. Rhodes, D. R., et al. ONCOMINE: a cancer microarray database and integrated data-mining platform. Neoplasia. 6 (1), 1-6 (2004).
  12. Rhodes, D. R., et al. Oncomine 3.0: genes, pathways, and networks in a collection of 18,000 cancer gene expression profiles. Neoplasia. 9 (2), 166-180 (2007).
  13. Jezequel, P., et al. bc-GenExMiner: an easy-to-use online platform for gene prognostic analyses in breast cancer. Breast Cancer Research and Treatment. 131 (3), 765-775 (2012).
  14. , Available from: http://co.bmc.lu.se/gobo/gsa.plb (2018).
  15. Ringner, M., Fredlund, E., Hakkinen, J., Borg, A., Staaf, J. GOBO: gene expression-based outcome for breast cancer online. PLoS One. 6 (3), e17911(2011).
  16. Ponten, F., Jirstrom, K., Uhlen, M. The Human Protein Atlas--a tool for pathology. Journal of Pathology. 216 (4), 387-393 (2008).
  17. Ponten, F., Schwenk, J. M., Asplund, A., Edqvist, P. H. The Human Protein Atlas as a proteomic resource for biomarker discovery. Journal of Internal Medicine. 270 (5), 428-446 (2011).
  18. Gyorffy, B., et al. An online survival analysis tool to rapidly assess the effect of 22,277 genes on breast cancer prognosis using microarray data of 1,809 patients. Breast Cancer Research and Treatment. 123 (3), 725-731 (2010).
  19. Stevinson, C., Lawlor, D. A. Searching multiple databases for systematic reviews: added value or diminishing returns? Complementary Therapies in Medicine. 12 (4), 228-232 (2004).
  20. Yin, J., et al. Integrating multiple genome annotation databases improves the interpretation of microarray gene expression data. BMC Genomics. 11, 50(2010).
  21. Patel, D., Morton, D. J., Carey, J., Havrda, M. C., Chaudhary, J. Inhibitor of differentiation 4 (ID4): From development to cancer. Biochimica et Biophysica Acta. 1855 (1), 92-103 (2015).
  22. Kamalian, L., et al. Increased expression of Id family proteins in small cell lung cancer and its prognostic significance. Clinical Cancer Research. 14 (8), 2318-2325 (2008).
  23. Cruz-Rodriguez, N., et al. High expression of ID family and IGJ genes signature as predictor of low induction treatment response and worst survival in adult Hispanic patients with B-acute lymphoblastic leukemia. Journal of Experimental and Clinical Cancer Research. 35, 64(2016).
  24. Yang, H. Y., et al. Expression and prognostic value of Id protein family in human breast carcinoma. Oncology Reports. 23 (2), 321-328 (2010).
  25. Zhou, X. L., et al. Prognostic values of the inhibitor of DNAbinding family members in breast cancer. Oncology Reports. 40 (4), 1897-1906 (2018).
  26. , Available from: https://www.oncomine.org (2018).
  27. Lin, H. Y., Zeng, L., iang, Y. K., Wei, X. L., Chen, C. F. GATA3 and TRPS1 are distinct biomarkers and prognostic factors in breast cancer: database mining for GATA family members in malignancies. Oncotarget. 8 (21), 34750-34761 (2017).
  28. , Available from: http://bcgenex.centregauducheau.fr/BCGEM/GEM-requete.php (2018).
  29. , Available from: https://www.proteinatlas.org (2018).
  30. , Available from: http://kmplot.com/analysis (2018).
  31. Zhu, Y. F., Dong, M. Expression of TUSC3 and its prognostic significance in colorectal cancer. Pathology-Research and Practice. 214 (9), 1497-1503 (2018).
  32. Nelson, J. C., et al. Validation sampling can reduce bias in health care database studies: an illustration using influenza vaccination effectiveness. Journal of Clinical Epidemiology. 66 (8 Suppl), S110-S121 (2013).
  33. Haibe-Kains, B., Desmedt, C., Sotiriou, C., Bontempi, G. A comparative study of survival models for breast cancer prognostication based on microarray data: does a single gene beat them all? Bioinformatics. 24 (19), 2200-2208 (2008).
  34. Yang, C., et al. Understanding genetic toxicity through data mining: the process of building knowledge by integrating multiple genetic toxicity databases. Toxicology Mechanisms and Methods. 18 (2-3), 277-295 (2008).
  35. Cannata, N., Merelli, E., Altman, R. B. Time to organize the bioinformatics resourceome. PLoS Computational Biology. 1 (7), e76(2005).
  36. Wren, J. D., Bateman, A. Databases, data tombs and dust in the wind. Bioinformatics. 24 (19), 2127-2128 (2008).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

ONCOMINE bcGenExMiner GOBO Human Protein Atlas Kaplan Meier Plotter

相关文章