本方案描述了一种用于识别癌症中重要分子变化的有效工具,有助于开发食管鳞状细胞癌的新型诊断和治疗方法。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了一种用于识别癌症中重要分子变化的有效工具,有助于开发食管鳞状细胞癌的新型诊断和治疗方法。
食管癌(EC)位居全球癌症发病率第8位th 最具侵袭性的恶性肿瘤之一,由于缺乏有助于早期检测的生物标志物,其治疗仍然具有挑战性。食管癌(EC)主要表现为两种组织学类型——腺癌(EAD)和鳞状细胞癌(ESCC),其发病率在不同地理区域的人群中存在显著差异。高通量技术正在深刻改变包括癌症在内的疾病认知。科学界面临的一个重大挑战是文献中数据的分散性。为此,本文提出一种简易分析流程,用于分析公开可用的微阵列数据集,并收集癌症与正常状态之间差异表达的分子。该流程可作为差异基因表达分析的标准方法,用于鉴定癌症与正常组织之间,或不同癌症亚型之间差异表达的基因。该流程包含多个步骤:数据预处理(包括对原始基因表达数据进行质量控制和标准化,以消除样本间的技术性差异)、差异表达分析(利用统计学方法,如t检验或方差分析等,识别两个或多个样本组之间差异表达的基因)。 t检验,方差分析(ANOVA)或线性模型)、功能分析(利用生物信息学工具识别差异表达基因中富集的生物学通路和功能)以及验证(通过独立数据集或qPCR、免疫组织化学等实验方法进行验证)。利用该分析流程,可针对任何类型的癌症(包括食管癌)生成一组差异表达分子(DEMs)。该分子集合可用于识别癌症的潜在生物标志物和药物靶点,并加深对疾病分子机制的理解。此外,利用该流程对中国台湾人群进行食管癌特异性筛查,将有助于识别不同人群中的特异性药物靶点,从而实现疾病的个体化治疗。
令人担忧的是,食管癌(EC)是全球第八常见的癌症,也是全球第六大癌症致死原因。中国、印度和伊朗的发病率和死亡率尤其高。食管癌主要有两种类型:食管腺癌(EAC 或 EAD)和食管鳞状细胞癌(ESCC)1。EAC 在西方国家更为常见,而 ESCC 在东方国家更为普遍,尤其是中国和伊朗2。多种因素与食管癌的发生相关,包括吸烟和饮酒、肥胖以及胃食管反流病(GERD)。此外,在高发地区,饮食因素如水果和蔬菜摄入不足、饮用过热的饮料和食用过热的食物也与 ESCC 的风险相关。早期诊断和治疗对于改善食管癌患者的预后至关重要3,4。因此,提高公众对食管癌危险因素、体征和症状的认识,并鼓励高危人群定期筛查十分重要。此外,针对可改变的危险因素(如吸烟、饮酒和不健康的饮食习惯)采取干预措施,可能有助于降低食管癌的发病率。EAD 发生于食管下段靠近胃部的黏液分泌腺细胞中,常与胃食管反流病相关,后者是指胃酸和胃内容物反流入食管。相比之下,ESCC 起源于食管上段扁平的鳞状上皮细胞5。在吸烟和饮酒普遍的地区,如中国和伊朗,ESCC 更为常见。
在与食管相关的多种疾病中,巴雷特食管(Barrett's esophagus, BE)是一种食管内膜被腺细胞取代的病变,已知是食管腺癌(EAC)的癌前病变6。值得注意的是,BE 可在无胃食管反流病(GERD)的情况下发生,但 GERD 的存在会使 BE 的发病风险增加 3 至 5 倍。此外,BE 患者发生 EAC 的风险增加 50 至 100 倍7。另外,食用过热或辛辣的食物和液体与食管鳞状细胞癌(ESCC)相关,但与 EAC 无关。了解食管癌(EC)的危险因素对于其预防和早期发现至关重要。通过干预可改变的危险因素,例如吸烟、饮酒、肥胖和不健康的饮食习惯,可能有助于降低 EC 的发病率。此外,对高危人群(如有吞咽困难或 BE 的个体)进行常规筛查和监测,有助于实现早期发现和治疗,从而改善预后。
毫无疑问,组学驱动的研究(包括基因组学、转录组学、蛋白质组学、甲基化组学、miRNA组学和代谢组学)极大地促进了我们对食管癌(ECs)尤其是食管鳞状细胞癌(ESCC)的理解8,9,10,11,12,13。这些研究使得研究人员能够识别出新的生物标志物、潜在的治疗靶点以及参与ESCC发生和进展的新通路。然而,这些研究产生的数据分散在大量文献中,导致科学界难以获取和有效利用这些信息。因此,建立一个整合特定癌症的高通量或低通量研究数据的数据库或资源库显得尤为重要。此类资源库的构建可通过遵循一些基本准则来实现和优化。这些准则包括筛选相关研究、从这些研究中提取并整理数据,以及确保数据的质量和一致性。此外,该资源库应定期更新,以纳入新发表的研究和数据。通过构建整合了多项研究数据的资源库或数据库,研究人员可在单一平台上检索和分析特定癌症的相关数据。这将有助于加快科研进程,并最终推动更有效的癌症治疗手段的发展,改善癌症患者的预后。
癌症文库的构建整合了来自低通量和高通量研究的数据。该文库将为致力于发现癌症潜在诊断或治疗靶点的研究人员提供宝贵的资源。构建此类文库的一种方法是检索公共数据库(如基因表达综合数据库 Gene Expression Omnibus, GEO)中可获取的微阵列研究。微阵列研究能够提供关于癌细胞中基因表达水平的信息,这些数据可用于鉴定在癌症发生与进展过程中可能发挥作用的差异表达基因(DEGs)。
然而,需要注意的是,不同的研究可能采用了不同的方法来分析其数据,这可能导致鉴定出不同的差异表达基因(DEGs)。因此,在整合数据构建文库时,仔细审阅每项研究并考虑其潜在的偏倚或局限性非常重要。一旦数据在统一的平台上汇集,研究人员便可利用这些数据识别出值得进一步研究的潜在分子靶点。这些研究包括在临床样本中检测特定基因的表达水平,或开展机制性研究以阐明特定基因或蛋白质在癌症发生和发展中的作用。总体而言,癌症数据集的建立将为癌症研究人员提供宝贵的资源,并有助于发现用于诊断和治疗干预的新靶点。
访问受限。请登录或开始试用以查看此内容。
1. 食管鳞状细胞癌中差异表达分子的人工整理
2. 使用PubMed查找相关研究
3. 利用基因表达综合数据库(GEO)查找相关研究
注意:基因表达综合数据库(Gene Expression Omnibus,GEO)是一个免费开放的存储DNA微阵列数据的资源库。GEO中丰富的数据是进行数据挖掘以识别癌症/疾病与正常条件下差异表达分子的良好资源。
4. 使用 GEO2R 进行微阵列分析
注意:首先需要使用布尔运算符(AND、OR、NOT)查找相关研究,这些运算符将与关键词“esophageal squamous cell carcinoma”、“ESCC”或“oesophageal squamous cell carcinoma”组合使用。GEO2R(见材料表)是一个免费提供的R语言软件包,与GEO集成,使用户能够以用户友好的方式分析来自微阵列研究的数据。它可与GEO条目ID交互,并提供一个界面,用于执行基于R的复杂分析,后端使用Bioconductor R软件包来识别差异表达基因(DEGs) 。该软件包不仅可转换GEO数据,还可将结果以.txt表格形式呈现,用户可根据需要进一步修改16。GEO2R根据p值的统计学显著性对基因进行排序,但也可按log2倍数变化进行重新排序。此外,用户可将基因表达谱以GEO谱图形式查看。与其他分析工具不同,GEO2R不依赖于所选数据集的记录,可直接分析研究人员提交的原始数据。超过90%的GEO研究可通过此方法进行分析17。使用GEO2R分析微阵列数据的工作流程及具体步骤如图1所示。
5. 查找基因/蛋白的别名
6. 查找差异表达基因的官方基因符号
7. 查找差异表达基因的基因座
8. 在OMIM页面上查找DEG的基因座信息
9. 查找基因编码蛋白的定位、结构域、基序及分泌特性
10. 针对目标恶性肿瘤的验证以及诊断或预后评估进行蛋白质的筛选
注意:一旦鉴定出独特的分子,最大的挑战便是如何对其进行验证。通常,微阵列研究提供的是mRNA水平的表达信息,但对于疾病诊断或预后而言,蛋白质水平的检测至关重要。为此,必须对患者样本、患者来源的样本或同种癌症的细胞系进行筛查,以确认该分子是否确实在其中表达,以及其是否能够有效区分癌症与正常组织。 与 正常,或良好 与 预后不良,或区分疾病的早期与晚期阶段。为了验证候选分子,采用蛋白质印迹法(Western blot)和酶联免疫吸附测定法 即, ELISA、免疫沉淀、免疫组织化学、免疫细胞化学或检测是有效的技术18,19,20同时,所有这些检测都需要使用抗体来检测样品中存在的抗原。抗体属于高成本试剂,因此最好根据以下几点来选择抗体:
访问受限。请登录或开始试用以查看此内容。
以GEO登录号GSE161533为例,用于研究食管鳞状细胞癌(ESCC)中差异表达的基因。分析的代表性结果如图3所示。GEO2R生成的火山图有助于识别两组实验对象之间存在显著差异的事件。火山图在y轴上显示经-log10转换的显著性水平(p值),在x轴上显示倍数变化(经log2转换的倍数变化)(图3A),可用于直观展示差异表达的基因。被标记的基因在默认的adj. p值截断值0.05水平上显著差异表达(蓝色表示下调,红色表示上调)。
均差(MD)图显示对数2 倍数变化 与. 平均对数2 表达值,有助于可视化差异表达的基因。在MD图中,log2 y轴为转换后的倍数变化,x轴为平均表达值的对数图3B)。加粗的基因在默认的adj.水平上显著差异表达。 <...
访问受限。请登录或开始试用以查看此内容。
自从高通量组学技术被应用于癌症生物学以来,数据的生成速度显著加快。这对研究人员,尤其是不熟悉计算机技术的研究人员,构成了挑战。为应对这一问题,多年来生物信息学家提出了建立数据库的构想,以系统化的方式提供数据。这一举措得到了研究人员的积极回应,特别是那些对技术不感兴趣的研究者。此外,散落在文献各处的组学数据对任何人都没有实际用途。因此,为了充分有效地利用这些数据,始终需要一个共用平台,使具有特定研究兴趣的科研人员能够前往并获取所需数据。目前已有多个针对不同癌症类型的数据库,包括 ONCOMINE38、ESCC ATLAS39、胰腺癌数据库(PCD)40 和 DDEC41。
差异表达基因(DEGs)的概念源于RNA测序数据的分析,指在两种或多种不同条件下(如癌症与正常组织)表达水平发生显著变化的基因。 与 正常,或处理 与 对照)被识别。目前已开发出多种工具用于...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
MKK 获得了印度科学与工程研究委员会(SERB)、科学技术部以及印度医学研究理事会(ICMR)的外部资助,分别为 TARE 奖学金(资助号:TAR/2018/001054)和外部资助项目(资助号:5/13/55/2020/NCD-III),上述机构均隶属于印度政府,新德里。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| NCBI-PUBMED | NCBI | https://ncbi.nlm.nih.gov/pubmed | 参见第1节,用于文献检索 |
| 配备互联网连接和网络浏览器的笔记本电脑/MacBook 或个人计算机。 | |||
| g:Profiler | ELIXIR 基础设施 | https://biit.cs.ut.ee/gprofiler/gost | 参见第4.10节,用于GO:MF、GO:BP和GO:CC的功能富集分析 |
| 基因表达综合数据库(Gene Expression Omnibus) | NCBI | https://www.ncbi.nlm.nih.gov/geo/ | 参见第3.1节,用于检索微阵列研究数据库 |
| GEO2R | NCBI | https://www.ncbi.nlm.nih.gov/geo/geo2r/ | 参见第3.2节,用于使用GEO2R工具分析数据 |
| https://www.google.com | 参见第1.1节,用于文献检索 | ||
| HGNC | HGNC 是人类基因组组织(HUGO)的委员会 | https://www.genenames.org | 参见第6.1节,用于获取差异表达基因(DEGs)的官方基因符号 |
| HPRD | 班加罗尔生物信息学研究所(Institute of Bioinformatics, Bangluru) | http://hprd.org | 参见第5.1节,用于获取蛋白质结构信息 |
| OMIM | 约翰·霍普金斯大学(Johns Hopkins University),巴尔的摩 | http://www.omim.org/entry | 参见第8.1节,用于获取特定基因或差异表达基因(DEG)的OMIM编号 |
| Pangloss 程序 | 由 Chris Seidel 开发 | http://www.pangloss.com/seidel/Protocols/venn.cgi | 参见第4.9节,用于生成维恩图 |
| PANTHER | 南加州大学 Thomas 实验室 | http://www.pantherdb.org/geneListAnalysis.do | 参见第4.10节,用于GO:MF、GO:BP和GO:CC的功能富集分析 |
| ShinyGO | 南达科他州立大学 | http://bioinformatics.sdstate.edu/go | 参见第4.10节,用于将差异表达基因(DEGs)定位至染色体上 |
访问受限。请登录或开始试用以查看此内容。