方法文章

食管鳞状细胞癌图谱的开发

1.1K 次观看

DOI:

10.3791/65480

2024年4月12日

本文内容

摘要

本方案描述了一种用于识别癌症中重要分子变化的有效工具,有助于开发食管鳞状细胞癌的新型诊断和治疗方法。

摘要

食管癌(EC)位居全球癌症发病率第8位th 最具侵袭性的恶性肿瘤之一,由于缺乏有助于早期检测的生物标志物,其治疗仍然具有挑战性。食管癌(EC)主要表现为两种组织学类型——腺癌(EAD)和鳞状细胞癌(ESCC),其发病率在不同地理区域的人群中存在显著差异。高通量技术正在深刻改变包括癌症在内的疾病认知。科学界面临的一个重大挑战是文献中数据的分散性。为此,本文提出一种简易分析流程,用于分析公开可用的微阵列数据集,并收集癌症与正常状态之间差异表达的分子。该流程可作为差异基因表达分析的标准方法,用于鉴定癌症与正常组织之间,或不同癌症亚型之间差异表达的基因。该流程包含多个步骤:数据预处理(包括对原始基因表达数据进行质量控制和标准化,以消除样本间的技术性差异)、差异表达分析(利用统计学方法,如t检验或方差分析等,识别两个或多个样本组之间差异表达的基因)。 t检验,方差分析(ANOVA)或线性模型)、功能分析(利用生物信息学工具识别差异表达基因中富集的生物学通路和功能)以及验证(通过独立数据集或qPCR、免疫组织化学等实验方法进行验证)。利用该分析流程,可针对任何类型的癌症(包括食管癌)生成一组差异表达分子(DEMs)。该分子集合可用于识别癌症的潜在生物标志物和药物靶点,并加深对疾病分子机制的理解。此外,利用该流程对中国台湾人群进行食管癌特异性筛查,将有助于识别不同人群中的特异性药物靶点,从而实现疾病的个体化治疗。

引言

令人担忧的是,食管癌(EC)是全球第八常见的癌症,也是全球第六大癌症致死原因。中国、印度和伊朗的发病率和死亡率尤其高。食管癌主要有两种类型:食管腺癌(EAC 或 EAD)和食管鳞状细胞癌(ESCC)1。EAC 在西方国家更为常见,而 ESCC 在东方国家更为普遍,尤其是中国和伊朗2。多种因素与食管癌的发生相关,包括吸烟和饮酒、肥胖以及胃食管反流病(GERD)。此外,在高发地区,饮食因素如水果和蔬菜摄入不足、饮用过热的饮料和食用过热的食物也与 ESCC 的风险相关。早期诊断和治疗对于改善食管癌患者的预后至关重要3,4。因此,提高公众对食管癌危险因素、体征和症状的认识,并鼓励高危人群定期筛查十分重要。此外,针对可改变的危险因素(如吸烟、饮酒和不健康的饮食习惯)采取干预措施,可能有助于降低食管癌的发病率。EAD 发生于食管下段靠近胃部的黏液分泌腺细胞中,常与胃食管反流病相关,后者是指胃酸和胃内容物反流入食管。相比之下,ESCC 起源于食管上段扁平的鳞状上皮细胞5。在吸烟和饮酒普遍的地区,如中国和伊朗,ESCC 更为常见。

在与食管相关的多种疾病中,巴雷特食管(Barrett's esophagus, BE)是一种食管内膜被腺细胞取代的病变,已知是食管腺癌(EAC)的癌前病变6。值得注意的是,BE 可在无胃食管反流病(GERD)的情况下发生,但 GERD 的存在会使 BE 的发病风险增加 3 至 5 倍。此外,BE 患者发生 EAC 的风险增加 50 至 100 倍7。另外,食用过热或辛辣的食物和液体与食管鳞状细胞癌(ESCC)相关,但与 EAC 无关。了解食管癌(EC)的危险因素对于其预防和早期发现至关重要。通过干预可改变的危险因素,例如吸烟、饮酒、肥胖和不健康的饮食习惯,可能有助于降低 EC 的发病率。此外,对高危人群(如有吞咽困难或 BE 的个体)进行常规筛查和监测,有助于实现早期发现和治疗,从而改善预后。

毫无疑问,组学驱动的研究(包括基因组学、转录组学、蛋白质组学、甲基化组学、miRNA组学和代谢组学)极大地促进了我们对食管癌(ECs)尤其是食管鳞状细胞癌(ESCC)的理解8,9,10,11,12,13。这些研究使得研究人员能够识别出新的生物标志物、潜在的治疗靶点以及参与ESCC发生和进展的新通路。然而,这些研究产生的数据分散在大量文献中,导致科学界难以获取和有效利用这些信息。因此,建立一个整合特定癌症的高通量或低通量研究数据的数据库或资源库显得尤为重要。此类资源库的构建可通过遵循一些基本准则来实现和优化。这些准则包括筛选相关研究、从这些研究中提取并整理数据,以及确保数据的质量和一致性。此外,该资源库应定期更新,以纳入新发表的研究和数据。通过构建整合了多项研究数据的资源库或数据库,研究人员可在单一平台上检索和分析特定癌症的相关数据。这将有助于加快科研进程,并最终推动更有效的癌症治疗手段的发展,改善癌症患者的预后。

癌症文库的构建整合了来自低通量和高通量研究的数据。该文库将为致力于发现癌症潜在诊断或治疗靶点的研究人员提供宝贵的资源。构建此类文库的一种方法是检索公共数据库(如基因表达综合数据库 Gene Expression Omnibus, GEO)中可获取的微阵列研究。微阵列研究能够提供关于癌细胞中基因表达水平的信息,这些数据可用于鉴定在癌症发生与进展过程中可能发挥作用的差异表达基因(DEGs)。

然而,需要注意的是,不同的研究可能采用了不同的方法来分析其数据,这可能导致鉴定出不同的差异表达基因(DEGs)。因此,在整合数据构建文库时,仔细审阅每项研究并考虑其潜在的偏倚或局限性非常重要。一旦数据在统一的平台上汇集,研究人员便可利用这些数据识别出值得进一步研究的潜在分子靶点。这些研究包括在临床样本中检测特定基因的表达水平,或开展机制性研究以阐明特定基因或蛋白质在癌症发生和发展中的作用。总体而言,癌症数据集的建立将为癌症研究人员提供宝贵的资源,并有助于发现用于诊断和治疗干预的新靶点。

方案

1. 食管鳞状细胞癌中差异表达分子的人工整理

  1. 使用 PubMed 查找相关的低通量研究
    注意:理解低通量与高通量技术之间的基本差异非常重要。在低通量方法中,仅研究有限数量的样本,且该过程通常耗时较长;相比之下,高通量方法速度更快,能够在一次实验中分析的样本数量显著高于低通量方法。例如,Northern 印迹和 Western 印迹属于低通量技术,而 cDNA 微阵列以及基于 LC-MS/MS 的定量蛋白质组学则属于高通量技术14。像 NCBI-PubMed(见材料表)这样的搜索引擎是查找与任何癌症相关研究的良好资源,因为它是生物医学科研人员用于查找包括食管鳞状细胞癌(ESCC)在内的各种疾病文献的公开资源。为找到相关研究,需遵循以下步骤。
    1. 点击Google 搜索引擎(见材料表)以打开它。研究人员也可使用该工具,因为有些期刊未被 PubMed 收录,但仍包含高质量的文章。为降低遗漏重要文献的可能性,建议同时使用多个搜索引擎进行检索。
    2. PubMed的搜索栏中使用布尔运算符(AND、OR、NOT)。布尔运算符可帮助研究人员通过关键词优化检索,使结果更加相关。

2. 使用PubMed查找相关研究

  1. 输入NCBI 网站地址(参见材料表),然后点击打开。
  2. 从左侧边栏菜单的所有数据库选项卡中选择PubMed
  3. 在搜索栏中输入相关关键词,以获取相关文献。关键词必须结合布尔运算符使用,这有助于获取与所研究癌症/疾病(例如,食管鳞状细胞癌)密切相关的文章。

3. 利用基因表达综合数据库(GEO)查找相关研究

注意:基因表达综合数据库(Gene Expression Omnibus,GEO)是一个免费开放的存储DNA微阵列数据的资源库。GEO中丰富的数据是进行数据挖掘以识别癌症/疾病与正常条件下差异表达分子的良好资源。

  1. 类型 GEO 网址(参见 材料表),然后点击打开。
  2. 类型 食管鳞状细胞癌 AND Homo sapiens 并按下 输入.
    注意:为了构建癌症差异表达基因的汇编,重要的是要从相关研究中进行选择,研究人员将从中筛选在癌症与正常条件下差异表达的分子 与 正常条件下。主要方面是根据倍数变化设定分子筛选标准。倍数变化将指示基因/蛋白质是上调还是下调。倍数变化与 p-值的截断阈值会显著改变特定实验中数据的含义,包括微阵列、RNA测序或蛋白质组学研究15.

4. 使用 GEO2R 进行微阵列分析

注意:首先需要使用布尔运算符(AND、OR、NOT)查找相关研究,这些运算符将与关键词“esophageal squamous cell carcinoma”、“ESCC”或“oesophageal squamous cell carcinoma”组合使用。GEO2R(见材料表)是一个免费提供的R语言软件包,与GEO集成,使用户能够以用户友好的方式分析来自微阵列研究的数据。它可与GEO条目ID交互,并提供一个界面,用于执行基于R的复杂分析,后端使用Bioconductor R软件包来识别差异表达基因(DEGs) 。该软件包不仅可转换GEO数据,还可将结果以.txt表格形式呈现,用户可根据需要进一步修改16。GEO2R根据p值的统计学显著性对基因进行排序,但也可按log2倍数变化进行重新排序。此外,用户可将基因表达谱以GEO谱图形式查看。与其他分析工具不同,GEO2R不依赖于所选数据集的记录,可直接分析研究人员提交的原始数据。超过90%的GEO研究可通过此方法进行分析17。使用GEO2R分析微阵列数据的工作流程及具体步骤如图1所示。

  1. 打开 GEO2R 网站。
  2. 在标记为"GEO accession"的搜索框中输入GSE accession,然后点击Set按钮。创建标签癌症正常
  3. 根据样本类型进行分类,先分配癌症,再分配正常
  4. 点击Analyze按钮,不更改任何默认参数。
  5. 点击完整基因列表,并以 .tsv 文件格式下载数据。在进一步处理数据之前,必须将 .tsv 文件转换为 .xlsx 格式。
  6. 在 Excel 中使用公式 [=(2)^(Nx),其中 N 为单元格位置] 将 log2 折叠变化值转换为折叠变化值。
  7. 对步骤 4.6 获得的数据进一步处理,通过应用 5% 的错误发现率(FDR)或调整后的 p 值(adj. p-value)<0.05,以及上调基因的折叠变化 >2.0 倍、下调基因的折叠变化 <0.5 倍的条件,筛选差异表达基因(DEGs)。
    注:FDR 是对p-值进行多重检验校正的方法,二者不可视为同义。在进行大量假设检验时,FDR 校正对于控制假阳性发现率至关重要。
  8. 将获得的差异表达基因与先前已发表的研究进行比较,使用在线免费的维恩图生成工具(Pangloss)生成维恩图,以区分共有和特有的差异表达基因(见材料表)。
  9. 进一步对特有基因列表进行基因本体(Gene Ontology)分析。
    注:可使用 g: Profiler(见材料表)或 PANTHER(见材料表)等在线免费程序生成不同的 GO 功能,包括基因本体:分子功能(GO: MF)、基因本体:生物过程(GO: BP)和基因本体:细胞组分(GO: CC)。本研究中基于 GO 的分析使用 g: Profiler 完成。
  10. 为获得差异表达基因在各条染色体上的基因组分布情况,使用 ShinyGO(见材料表)。
  11. 将从 GEO2R 获得的完整特有基因列表粘贴至 ShinyGO 的搜索选项卡中,选择最匹配的物种Homo sapiens,所用 FDR 截断值为 5%。
  12. 从 GEO2R 获得的差异表达基因中筛选出用于后续蛋白质水平验证研究的基因。提取差异表达基因额外关键信息的工作流程如图 2所示。

5. 查找基因/蛋白的别名

  1. 打开 HPRD 页面(参见材料表),然后点击查询按钮。
  2. 在相应的搜索标签页中输入蛋白质名称或 HPRD 标识符,然后按下底部的搜索按钮
    注意:将会打开一个页面,其中包含一个标为"ALTERNATE NAMES"的标签,点击该标签即可显示此基因或蛋白质的别名。

6. 查找差异表达基因的官方基因符号

  1. 要查找官方基因符号,请打开 HUGO 基因命名委员会(HGNC)网站(参见材料表)。
  2. 在 HGNC 页面的搜索栏中输入 GEO2R 分析中获得的名称,然后点击搜索图标。搜索结果将显示该术语精确匹配的官方基因符号。
  3. 点击该链接,并在页面中找到所述的官方"基因符号"。

7. 查找差异表达基因的基因座

  1. 访问 NCBI 网站上的链接,打开基因页面。
  2. 输入该基因的官方基因符号,然后点击 搜索
  3. 在结果中仔细核对基因及其所属生物体。确认匹配无误后,点击 链接 并继续下一步。
    注意:综上所述,在“"基因组上下文"”标题下会显示位置信息,即为基因座。

8. 在OMIM页面上查找DEG的基因座信息

  1. 打开 OMIM 页面(参见 材料表)。
  2. 输入基因的 名称基因符号,特别是 "基因-表型"相关信息。
  3. 点击 搜索 按钮,目标基因的结果将显示出来。结果显示有关 "基因-表型关系"的信息。

9. 查找基因编码蛋白的定位、结构域、基序及分泌特性

  1. 打开 HPRD 页面(参见 材料表)。
  2. 打开后,在相应的搜索标签页中输入 蛋白名称HPRD 标识符,然后点击页面底部的 搜索 按钮。
  3. 页面打开后会有一个标为 "摘要" 的标签页。向下滚动至页面底部,查看 定位 标签,以了解该蛋白的主要及替代的 "次级" 定位信息。
    注意:在同一页面中,“"定位"”下方有一个名为 "结构域与基序" 的标签页,其中列出了目标蛋白的结构域和基序(如有)。在同一页面中,“"结构域与基序"”标签旁还有一个 "表达" 标签,其下设有子标签 "表达部位"。若某蛋白曾被报道在任何生物体液中被检测到,则可认为其具有 "分泌性" 特征。若目标蛋白曾在血浆、血清、精液、泪液等生物体液中被报道,相关信息将列于该处。

10. 针对目标恶性肿瘤的验证以及诊断或预后评估进行蛋白质的筛选

注意:一旦鉴定出独特的分子,最大的挑战便是如何对其进行验证。通常,微阵列研究提供的是mRNA水平的表达信息,但对于疾病诊断或预后而言,蛋白质水平的检测至关重要。为此,必须对患者样本、患者来源的样本或同种癌症的细胞系进行筛查,以确认该分子是否确实在其中表达,以及其是否能够有效区分癌症与正常组织。 正常,或良好 预后不良,或区分疾病的早期与晚期阶段。为了验证候选分子,采用蛋白质印迹法(Western blot)和酶联免疫吸附测定法 即, ELISA、免疫沉淀、免疫组织化学、免疫细胞化学或检测是有效的技术18,19,20同时,所有这些检测都需要使用抗体来检测样品中存在的抗原。抗体属于高成本试剂,因此最好根据以下几点来选择抗体:

  1. 检查该抗体是否已在其他恶性肿瘤的既往发表研究论文中被报道过。
  2. 若无,查阅抗体供应商公司,查看其是否提供包含蛋白印迹、免疫细胞化学或免疫组织化学结果图片的数据表。
    注意:若拟进行免疫组织化学实验,但该抗体仅标明适用于ELISA检测,则使用该抗体可能存在风险,特别是当靶分子为跨膜结构域蛋白而非信号肽时。此外,若抗体为单克隆或多克隆,建议优先选择单克隆抗体。

结果

以GEO登录号GSE161533为例,用于研究食管鳞状细胞癌(ESCC)中差异表达的基因。分析的代表性结果如图3所示。GEO2R生成的火山图有助于识别两组实验对象之间存在显著差异的事件。火山图在y轴上显示经-log10转换的显著性水平(p值),在x轴上显示倍数变化(经log2转换的倍数变化)(图3A),可用于直观展示差异表达的基因。被标记的基因在默认的adj. p值截断值0.05水平上显著差异表达(蓝色表示下调,红色表示上调)。

均差(MD)图显示对数2 倍数变化 . 平均对数2 表达值,有助于可视化差异表达的基因。在MD图中,log2 y轴为转换后的倍数变化,x轴为平均表达值的对数图3B)。加粗的基因在默认的adj.水平上显著差异表达。 p-值阈值为 0.05(蓝色表示下调,红色表示上调)。火山图在同时展示仅两个处理组的信息时,会遇到与 MA 图相同的问题。21.

此外,均匀流形近似与投影(UMAP)22 用于评估食管鳞状细胞癌样本与正常样本之间的相关性(图3C尽管大多数样本均属于各自的类别,但在正常样本中发现了两例ESCC样本。

GEO2R 提供了一个二维交互式表达密度图(图3D),可有效展示数据集中基因表达的密度分布。该图可用于判断差异表达基因(DEGs)分析是否需要进行标准化处理。在该图中,纵轴表示密度,横轴表示食管鳞状细胞癌(ESCC,绿色)和正常组织(violet,紫色)的信号强度。

在箱线图中展示了包括食管鳞状细胞癌(ESCC)和正常样本在内的不同样本中数值的分布情况。这些分布可以提示样本是否真正适用于差异表达分析。以中位数为中心的数值明显表明数据已经过标准化处理,具有可比性(图3E)。

根据 p 值 < 0.05 和倍数变化标准对鉴定出的基因进行筛选。将无显著变化的基因(倍数变化介于 <2.0 至 >0.50 之间)从分析中剔除。此外,与先前已发表的研究相比,共有基因仅有 514 个,而获得的独特基因数量为 1193 个。值得注意的是,利用 GEO2R 鉴定独特基因不仅有助于减少冗余,还能丰富基因数据库。

差异表达基因(DEGs)的部分列表见表1,完整的DEGs列表见补充文件1。部分上调基因属于细胞外基质,例如MMP18,23,24MMP1223,25SPP18,26POSTN9VCAN8,27表1中所列的其他基因包括上调的CMPK2AURKA28,29CHEK127CDK130,以及在食管鳞状细胞癌(ESCC)中下调的EMP127PTK631,32GPX327DPT33FHL134,35CRNN8,36。与正常上皮组织相比,POSTN(Periostin)在ESCC中表达上调,且在食管腺癌中也有报道。既往关于ESCC的研究报道,POSTN蛋白不仅在间质区域表达,也在肿瘤细胞中表达,提示肿瘤与微环境之间存在相互作用9。Periostin是一种主要由间充质细胞分泌的蛋白质,在成骨细胞的调控、黏附和分化以及伤口修复过程中发挥关键作用。此外,Periostin已被发现参与多种癌症(包括ESCC)的肿瘤进展和转移过程。研究表明,Periostin参与癌症中的上皮-间质转化(EMT)和肿瘤血管生成,促进细胞迁移、运动性、黏附以及肿瘤的转移性生长。在巴雷特食管(食管的癌前病变)中,编码Periostin的POSTN基因相较于正常食管组织显著上调37。在嗜酸性食管炎(一种食管炎症性疾病)中,Periostin的mRNA和蛋白表达水平均较正常食管上皮升高。同样,在ESCC中,基因表达分析显示POSTN的表达水平上调达11倍9。这些发现表明,POSTN可能作为ESCC及其他癌症的潜在生物标志物。此外,已有报道显示,在伴有骨转移的乳腺癌患者血清中POSTN水平升高,提示POSTN也可进一步研究作为ESCC患者血清中潜在的转移性生物标志物。总体而言,POSTN在肿瘤进展中发挥重要作用,可能对癌症的诊断、预后评估和治疗具有潜在的临床意义。

差异表达基因在各条染色体上的分布显示,染色体1-6及X染色体上的基因数量最多(图4)。基于ShinyGO的通路分析表明,在差异表达基因分析中,多个关键通路显著富集,其中包括IL-17信号通路、蛋白质消化与吸收、细胞外基质-受体相互作用、TNF信号通路、Toll样受体信号通路、趋化因子信号通路、细胞因子-细胞因子受体相互作用、酒精性肝病、癌症中的microRNA、癌症中的转录失调、细胞周期以及食管鳞状细胞癌(ESCC)中的NONO样受体信号通路。此外,采用g: Profiler分析对差异表达基因中的GO术语进行了富集分析,结果显示分子功能(GO: MF)、细胞组分(GO: CC)和生物过程(GO: BP)相关的不同GO术语均显著富集(图5)。这些GO术语的详细列表见表2

基因表达分析示意图;微阵列研究、差异表达基因鉴定、数据筛选流程。
图1:利用 GEO2R 程序处理基因表达综合数据库中食管鳞状细胞癌研究的流程示意图。 该示意图展示了鉴定差异表达基因(DEGs)或差异表达分子(DEMs)所涉及的各个步骤,包括基于以下标准筛选 DEGs:上调基因的倍数变化 >2.0 倍且 p < 0.05,下调基因的倍数变化 <0.5 且 p 值 < 0.05。请点击此处查看该图的放大版本。

基因信息流程图;别名搜索、基因符号、染色体位置、蛋白质定位、生物标志物发现的步骤。
图2:利用其他公开可用资源获取食管鳞状细胞癌中差异表达基因的附加信息的示意图。 此外,差异表达基因(DEGs)的相关信息对于决定哪些DEGs需要在临床环境中进一步验证和评估至关重要。可通过不同的在线资源获取诸如基因别名、官方基因符号、染色体位置/基因位点、OMIM、结构域/基序、蛋白质的分泌特性以及可用于蛋白水平验证的特异性抗体等信息。请点击此处查看该图的放大版本。

基因表达分析;图表包括火山图、MA图、UMAP图、密度图、箱线图;食管鳞状细胞癌 vs 正常组织
图3:利用GEO2R程序分析GEO编号GSE161533的研究数据,鉴定食管鳞状细胞癌(ESCC)中的差异表达基因 正常 GEO2R 程序采用默认参数进行分析,这些参数可导致(A火山图表示基因分布情况,横坐标为 -log10 转化显著性(p在 y 轴上为 -值,折叠变化(以 log 表示)2 转换后的倍数变化)在 x 轴上,(BMD-图,展示对数2 倍数变化 平均对数2 用于可视化差异表达基因的表达值,(C) UMAP(均匀流形近似与投影)显示了样本根据其类型进行的分离,(D表达密度图可用于在差异表达分析前检验数据的标准化情况,作为补充手段,E箱线图显示了各样本经中位数标准化后的数值,以表明数据的标准化处理具有跨样本可比性。 请点击此处以查看此图的放大版本。

显示差异表达基因分析、染色体分布及食管鳞状细胞癌通路富集的维恩图与图表
图4使用 ShinyGO 富集工具分析差异表达基因在不同染色体位点上的分布。 (A通过生成维恩图比较现有数据以鉴定独特基因 先前已发表的研究。B) 基因组中不同染色体上差异表达基因(DEGs)的分布情况。C基于ShinyGO的差异表达基因通路富集分析 请点击此处以查看此图的放大版本。

基因富集分析;气泡图;生物学过程;功能类别;统计显著性。
图5:使用g: Profiler进行目标基因GO术语富集的曼哈顿图。 通过g: Profiler对差异表达基因进行分析,并以曼哈顿图形式展示GO术语(MF:分子功能;BP:生物过程;CC:细胞组分)以及KEGG通路、Reactome通路(REAC)、WikiPathways(WP)、转录因子(TF)和microRNA靶标数据库(MIRNA)的富集结果,其中横轴为按类别着色的GO功能术语。每个彩色圆点代表一个GO术语。纵轴显示校正后的-log10p值。在横轴上标出了与ESCC具有统计学显著性的GO术语。MF:分子功能;BP:生物过程;CC:细胞组分;MIRNA:microRNA;HP:人类表型。 请点击此处查看该图的放大版本。

表1:食管鳞状细胞癌中差异表达基因的部分列表。 请点击此处下载该表格。

表2:使用g: Profiler对食管鳞状细胞癌(ESCC)中GO术语的富集分析。 请点击此处下载该表格。

补充文件1:食管鳞状细胞癌中差异表达基因的完整列表。 请点击此处下载该文件。

讨论

自从高通量组学技术被应用于癌症生物学以来,数据的生成速度显著加快。这对研究人员,尤其是不熟悉计算机技术的研究人员,构成了挑战。为应对这一问题,多年来生物信息学家提出了建立数据库的构想,以系统化的方式提供数据。这一举措得到了研究人员的积极回应,特别是那些对技术不感兴趣的研究者。此外,散落在文献各处的组学数据对任何人都没有实际用途。因此,为了充分有效地利用这些数据,始终需要一个共用平台,使具有特定研究兴趣的科研人员能够前往并获取所需数据。目前已有多个针对不同癌症类型的数据库,包括 ONCOMINE38、ESCC ATLAS39、胰腺癌数据库(PCD)40 和 DDEC41

差异表达基因(DEGs)的概念源于RNA测序数据的分析,指在两种或多种不同条件下(如癌症与正常组织)表达水平发生显著变化的基因。 正常,或处理 对照)被识别。目前已开发出多种工具用于确定差异表达基因(DEGs),这些工具基于对基因表达量的量化进行统计检验,而基因表达量数据来源于对原始RNA-seq测序读段的计算分析,或来源于癌症样本中探针与靶序列之间生成的信号强度比值的计算分析。 正常组。这些工具可提供每个基因的表达水平及其成对差异倍数的相关信息。差异基因表达(DGE)分析有助于理解导致生物体表型差异的遗传机制。DGE分析已被应用于研究多种生物过程,包括肿瘤起源检测和/或微生物组分析。通过鉴定差异表达基因(DEGs),该分析可揭示参与食管鳞状细胞癌(ESCC)发生过程中的潜在遗传因素。21.

GEO2R 工具方法是公开可用的,也是最受青睐的方法,因为文献中大多数研究使用了不同的算法进行分析,导致数据分析存在巨大差异;因此,为避免这些差异,采用了这一用户友好的平台,因为它免费且易于使用。该工具支持不同条件之间的比较,例如“癌症 vs. 正常”或“治疗 vs. 无治疗”。

本研究选择食管鳞状细胞癌(ESCC),因为它是胃肠道(GI)中一种新近出现的癌症 在印度和中国。我们选择 GEO 登录号 GSE161533,利用 GEO2R 进行分析,以鉴定食管鳞状细胞癌(ESCC)中的差异表达基因(DEGs) 正常。选择该研究是因为其中未纳入既往接受过化疗或放疗治疗的食管鳞状细胞癌(ESCC)患者。若可获得配对样本(即来自同一患者的ESCC组织及癌旁正常组织),则建议在任何分析中优先使用配对样本。原因是,来自同一患者的ESCC组织与正常组织具有相同的遗传背景,且处于相似的微环境,其基因组预期高度相似。使用配对样本有助于避免因比较不同遗传背景患者之间的ESCC与正常组织而可能引入的分析偏倚。通过使用配对样本,可更准确地识别同一患者体内ESCC组织与正常组织间的基因表达差异,从而提高研究结果的特异性。 该方法在基因表达研究中常被用于控制个体差异并提高分析效能。

我们收集了研究中所有受试者的样本数据,并使用 GEO2R 平台分析基因表达数据。首先,我们将癌组织样本进行归类,随后归类正常组织样本。完成样本分配后,采用 GEO2R 数据库中的默认参数来区分癌组织或处理组样本与正常或对照组样本。为了区分癌组织与正常组织样本,设定差异表达基因的筛选阈值如下:上调基因的调整后 p-值(adj. P Val)小于 0.05,且倍数变化(fold-change)阈值大于 >2.0;下调基因的调整后 p-值(adj. P Val)小于 0.05,且倍数变化阈值小于 <0.5。这些阈值在基因表达研究中被广泛用于识别癌组织与正常组织之间的差异表达基因。需要注意的是,显著性阈值的选择会影响被鉴定为差异表达基因的数量和种类。此外,应仔细评估所鉴定基因的生物学意义,并开展进一步的验证实验以确认研究结果。

在文献中,通常只报告上调基因中变化倍数至少为2倍的结果, <下调基因的0.5倍变化,尤其在微阵列和蛋白质组学研究中42在早期研究中,变化倍数为 >1.5 倍被视为上调 <下调基因的0.67倍变化43,44,但过去十年的文献趋势明确表明,人们更倾向于选择较高的倍数变化,因为对倍数变化较低的候选基因进行验证实验时,mRNA水平与蛋白质水平的数据之间通常表现出微弱的相关性或无相关性45选择较高的倍数变化(fold change)存在一个弊端,即有时会遗漏一些在疾病或癌症中具有生物学意义的分子,仅仅因为所设定的筛选阈值而被排除在差异表达基因/差异表达分子(DEGs/DEMs)列表之外。此外,文献报道存在偏向性,尤其倾向于报告上调或过表达的分子,而非低表达的分子。如果某些分子的表达在多个研究中呈现出一致的上调或过表达模式,无论这些研究是否针对同一种癌症或疾病,这种模式都会受到科学家的青睐。此外,若相同的过表达模式在多种疾病中被观察到并见于文献报道,则更易被科学界广泛接受。

此外,疾病之间的相似性取决于采用微阵列数据还是文献数据进行比较。最后,文献中对差异表达幅度的描述通常较为模糊,其与微阵列的倍数变化数据仅表现出有限的相关性46

此外,文集可以提供来自数据库的额外信息,例如 NCBI Entrez gene47、HGNC48、OMIM49、HPRD5051、Ensemble52、KEGG53、WikiPathways54、GO55、miRBase56 和 DGV57。在使用 GEO2R 时,通过 UMAP 的评估可以显示样本之间的关系。在当前分析中,两个 ESCC 样本与正常样本聚类在一起,提示可能存在取样误差,或者 ESCC 样本具有足够的异质性,以致其出现在正常样本组中。

GEO2R 工具具有良好的用户友好性和易访问性,但也存在一些局限性。GEO2R 无法生成主成分分析(PCA)图和热图,也无法在质量控制后对样本进行筛选。它仅能为同一系列内的样本比较提供一个维恩图。GEO2R 仅限于分析系列矩阵文件,因此无法实现跨系列的比较。此外,GEO2R 仅能分析微阵列数据,且缺乏对样本正态性或可比性的质量控制功能。GEO2R 不支持无限数量的搜索结果,对于数据集中任意两两比较,仅显示排名前 250 的基因。它还会对样本重复数不足的数据集进行分析,难以支持稳健的统计分析。GEO2R 提供的数据为对数倍数变化(log fold change),需通过 R 语言或 Excel 表格将其转换为倍数变化(fold-change)。此外,若要展示上调和下调基因,还需借助其他软件或在线工具生成热图58,59,60

综上所述,本文提供了一个简单的流程,经过少量修改后即可用于构建任何类型恶性肿瘤的文库。此类文库是当前所需,可为生物医学科学家提供候选分子,支持其在临床环境中进行验证,用于预后或诊断目的的生物标志物发现。

披露

作者无任何利益冲突需要披露。

致谢

MKK 获得了印度科学与工程研究委员会(SERB)、科学技术部以及印度医学研究理事会(ICMR)的外部资助,分别为 TARE 奖学金(资助号:TAR/2018/001054)和外部资助项目(资助号:5/13/55/2020/NCD-III),上述机构均隶属于印度政府,新德里。

材料

本文使用的材料清单
姓名公司目录编号评论
NCBI-PUBMEDNCBIhttps://ncbi.nlm.nih.gov/pubmed参见第1节,用于文献检索
配备互联网连接和网络浏览器的笔记本电脑/MacBook 或个人计算机。
g:ProfilerELIXIR 基础设施https://biit.cs.ut.ee/gprofiler/gost参见第4.10节,用于GO:MF、GO:BP和GO:CC的功能富集分析
基因表达综合数据库(Gene Expression Omnibus)NCBIhttps://www.ncbi.nlm.nih.gov/geo/参见第3.1节,用于检索微阵列研究数据库
GEO2RNCBIhttps://www.ncbi.nlm.nih.gov/geo/geo2r/参见第3.2节,用于使用GEO2R工具分析数据
GoogleGooglehttps://www.google.com参见第1.1节,用于文献检索
HGNCHGNC 是人类基因组组织(HUGO)的委员会https://www.genenames.org参见第6.1节,用于获取差异表达基因(DEGs)的官方基因符号 
HPRD班加罗尔生物信息学研究所(Institute of Bioinformatics, Bangluru) http://hprd.org参见第5.1节,用于获取蛋白质结构信息 
OMIM 约翰·霍普金斯大学(Johns Hopkins University),巴尔的摩http://www.omim.org/entry参见第8.1节,用于获取特定基因或差异表达基因(DEG)的OMIM编号
Pangloss 程序由 Chris Seidel 开发http://www.pangloss.com/seidel/Protocols/venn.cgi参见第4.9节,用于生成维恩图
PANTHER南加州大学 Thomas 实验室http://www.pantherdb.org/geneListAnalysis.do参见第4.10节,用于GO:MF、GO:BP和GO:CC的功能富集分析
ShinyGO 南达科他州立大学http://bioinformatics.sdstate.edu/go参见第4.10节,用于将差异表达基因(DEGs)定位至染色体上

参考文献

  1. Zeng, H., et al. Esophageal cancer statistics in China, 2011: Estimates based on 177 cancer registries. Thorac Cancer. 7 (2), 232-237 (2016).
  2. Zhang, H., Jin, G., Shen, H. Epidemiologic differences in esophageal cancer between Asian and Western populations. Chin J Cancer. 31 (6), 281-286 (2012).
  3. Chen, C., et al. Consumption of hot beverages and foods and the risk of esophageal cancer: a meta-analysis of observational studies. BMC Cancer. 15, 449(2005).
  4. Yousefi, M., et al. Esophageal cancer in the world: incidence, mortality and risk factors. Biomedical Research and Therapy. 5 (7), 2504-2517 (2018).
  5. Jemal, A., Center, M. M., DeSantis, C., Ward, E. M. Global patterns of cancer incidence and mortality rates and trends. Cancer Epidemiol Biomarkers Prev. 19 (8), 1893-1907 (2010).
  6. Kambhampati, S., Tieu, A. H., Luber, B., Wang, H., Meltzer, S. J. Risk factors for progression of barrett's esophagus to high grade dysplasia and esophageal adenocarcinoma. Sci Rep. 10 (1), 4899(2020).
  7. Schuchert, M. J., Luketich, J. D. Management of Barrett's esophagus. Oncology (Williston Park). 21 (11), 1382-1389 (2007).
  8. Kashyap, M. K., et al. Genomewide mRNA profiling of esophageal squamous cell carcinoma for identification of cancer biomarkers. Cancer Biol Ther. 8 (1), 36-46 (2009).
  9. Kashyap, M. K., et al. Overexpression of periostin and lumican in esophageal squamous cell carcinoma. Cancers (Basel). 2 (1), 133-142 (2010).
  10. Zhu, Z. J., et al. Untargeted metabolomics analysis of esophageal squamous cell carcinoma discovers dysregulated metabolic pathways and potential diagnostic biomarkers. J Cancer. 11 (13), 3944-3954 (2020).
  11. Wang, H., et al. DNA methylation markers in esophageal cancer: an emerging tool for cancer surveillance and treatment. Am J Cancer Res. 11 (11), 5644-5658 (2021).
  12. Wu, B. L., et al. MiRNA profile in esophageal squamous cell carcinoma: downregulation of miR-143 and miR-145. World J Gastroenterol. 17 (1), 79-88 (2011).
  13. Meng, X. R., Lu, P., Mei, J. Z., Liu, G. J., Fan, Q. X. Expression analysis of miRNA and target mRNAs in esophageal cancer. Braz J Med Biol Res. 47 (9), 811-817 (2014).
  14. Churko, J. M., Mantalas, G. L., Snyder, M. P., Wu, J. C. Overview of high throughput sequencing technologies to elucidate molecular pathways in cardiovascular diseases. Circ Res. 112 (12), 1613-1623 (2013).
  15. Dalman, D. A., Nimishakavi, G., Duan, Z. H. Fold change and p-value cutoffs significantly alter microarray interpretations. BMC Bioinformatics. 13, 11(2012).
  16. Gentleman, R. C., et al. Bioconductor: open software development for computational biology and bioinformatics. Genome Biol. 5 (10), 80(2004).
  17. Barrett, T., et al. NCBI GEO: archive for high-throughput functional genomic data. Nucleic Acids Res. 37, D885-D890 (2009).
  18. Kume, H., et al. Discovery of colorectal cancer biomarker candidates by membrane proteomic analysis and subsequent verification using selected reaction monitoring (SRM) and tissue microarray (TMA) analysis. Mol Cell Proteomics. 13 (6), 1471-1484 (2014).
  19. Jin, G., Wong, S. T. C. Chapter 3 - Proteomics-Based Theranostics. , (2014).
  20. Del Campo, M., et al. Facilitating the validation of novel protein biomarkers for dementia: an optimal workflow for the development of sandwich immunoassays. Front Neurol. 6, 202(2015).
  21. McDermaid, A., Monier, B., Zhao, J., Liu, B., Ma, Q. Interpretation of differential gene expression results of RNA-seq data: review and integration. Brief Bioinform. 20 (6), 2044-2054 (2019).
  22. McInnes, L., Healy, J., Saul, N., Großberger, L. UMAP: Uniform Manifold Approximation and Projection. Journal of Open Source Software. 3 (29), 861(2018).
  23. Xu, G., et al. Upregulated expression of MMP family genes is associated with poor survival in patients with esophageal squamous cell carcinoma via regulation of proliferation and epithelial-mesenchymal transition. Oncol Rep. 44 (1), 29-42 (2020).
  24. Chen, Y. K., et al. Plasma matrix metalloproteinase 1 improves the detection and survival prediction of esophageal squamous cell carcinoma. Sci Rep. 6, 30057(2016).
  25. Han, F., Zhang, S., Zhang, L., Hao, Q. The overexpression and predictive significance of MMP-12 in esophageal squamous cell carcinoma. Pathol Res Pract. 213 (12), 1519-1522 (2017).
  26. Kita, Y., et al. Expression of osteopontin in oesophageal squamous cell carcinoma. Br J Cancer. 95 (5), 634-638 (2006).
  27. Chen, F. F., Zhang, S. R., Peng, H., Chen, Y. Z., Cui, X. B. Integrative genomics analysis of hub genes and their relationship with prognosis and signaling pathways in esophageal squamous cell carcinoma. Mol Med Rep. 20 (4), 3649-3660 (2019).
  28. Tong, T., et al. Overexpression of Aurora-A contributes to malignant development of human esophageal squamous cell carcinoma. Clin Cancer Res. 10 (21), 7304-7310 (2004).
  29. Du, R., et al. Bioinformatics and experimental validation of an AURKA/TPX2 axis as a potential target in esophageal squamous cell carcinoma. Oncol Rep. 49 (6), 116(2023).
  30. Zhang, H. J., et al. Overexpression of cyclin-dependent kinase 1 in esophageal squamous cell carcinoma and its clinical significance. FEBS Open Bio. 11 (11), 3126-3141 (2021).
  31. Ma, S., et al. Identification of PTK6, via RNA sequencing analysis, as a suppressor of esophageal squamous cell carcinoma. Gastroenterology. 143 (3), 675-686 (2012).
  32. Chen, Y. F., et al. Downregulated expression of PTK6 is correlated with poor survival in esophageal squamous cell carcinoma. Med Oncol. 31 (12), 317(2014).
  33. Tao, Y., et al. Identification of distinct gene expression profiles between esophageal squamous cell carcinoma and adjacent normal epithelial tissues. Tohoku J Exp Med. 226 (4), 301-311 (2012).
  34. Kashyap, M. K., et al. Evaluation of protein expression pattern of stanniocalcin 2, insulin-like growth factor-binding protein 7, inhibin beta A and four and a half LIM domains 1 in esophageal squamous cell carcinoma. Cancer Biomark. 12 (1), 1-9 (2013).
  35. Wei, X., Zhang, H. Four and a half LIM domains protein 1 can be as a double-edged sword in cancer progression. Cancer Biol Med. 17 (2), 270-281 (2020).
  36. Pawar, H., et al. Downregulation of cornulin in esophageal squamous cell carcinoma. Acta Histochem. 115 (2), 89-99 (2013).
  37. Hao, Y., et al. Gene expression profiling reveals stromal genes expressed in common between Barrett's esophagus and adenocarcinoma. Gastroenterology. 131 (3), 925-933 (2006).
  38. Rhodes, D. R., et al. ONCOMINE: a cancer microarray database and integrated data-mining platform. Neoplasia. 6 (1), 1-6 (2004).
  39. Tungekar, A., et al. ESCC ATLAS: A population wide compendium of biomarkers for Esophageal Squamous Cell Carcinoma. Sci Rep. 8 (1), 12715(2018).
  40. Thomas, J. K., et al. Pancreatic cancer database: an integrative resource for pancreatic cancer. Cancer Biol Ther. 15 (8), 963-967 (2014).
  41. Essack, M., et al. DDEC: Dragon database of genes implicated in esophageal cancer. BMC Cancer. 9, 219(2009).
  42. Sharma, L., Kashyap, M. K., Sharma, D. Non-alcoholic Fatty Liver Disease (NAFLD): A systematic review and meta-analysis from an omics perspective. Gene Expression. 22 (2), 79-91 (2023).
  43. Mamber, S. W., Gurel, V., Rhodes, R. G., McMichael, J. Effects of Streptolysin O on extracellular matrix gene expression in normal human epidermal keratinocytes. Dose Response. 9 (4), 554-578 (2011).
  44. Pang, S., et al. Differential expression of long non-coding RNA and mRNA in children with Henoch-Schönlein purpura nephritis. Exp Ther Med. 17 (1), 621-632 (2019).
  45. Tan, P. K., et al. Evaluation of gene expression measurements from commercial microarray platforms. Nucleic Acids Res. 31 (19), 5676-5684 (2003).
  46. Rodriguez-Esteban, R., Jiang, X. Differential gene expression in disease: a comparison between high-throughput studies and the literature. BMC Med Genomics. 10 (1), 59(2017).
  47. Maglott, D., Ostell, J., Pruitt, K. D., Tatusova, T. Entrez Gene: gene-centered information at NCBI. Nucleic Acids Res. 3535, D26-D31 (2007).
  48. Gray, K. A., Yates, B., Seal, R. L., Wright, M. W., Bruford, E. A. Genenames.org: the HGNC resources in 2015. Nucleic Acids Res. 43, Database issue D1079-D1085 (2015).
  49. McKusick, V. A. Mendelian Inheritance in Man and its online version, OMIM. Am J Hum Genet. 80 (4), 588-604 (2007).
  50. Keshava Prasad, T. S., et al. Human Protein Reference Database--2009 update. Nucleic Acids Res. 37, Database issue D767-D772 (2009).
  51. Peri, S., et al. Human protein reference database as a discovery resource for proteomics. Nucleic Acids Res. 32, Database issue D497-D501 (2004).
  52. Hubbard, T., et al. The Ensembl genome database project. Nucleic Acids Res. 30 (1), 38-41 (2002).
  53. Kanehisa, M., Goto, S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 28 (1), 27-30 (2000).
  54. Pico, A. R., et al. WikiPathways: pathway editing for the people. PLoS Biol. 6 (7), 184(2008).
  55. Ashburner, M., et al. Gene ontology: tool for the unification of biology. The Gene Ontology Consortium. Nat Genet. 25 (1), 25-29 (2000).
  56. Griffiths-Jones, S., Grocock, R. J., van Dongen, S., Bateman, A., Enright, A. J. miRBase: microRNA sequences, targets and gene nomenclature. Nucleic Acids Res. 34, Database issue D140-D144 (2006).
  57. MacDonald, J. R., Ziman, R., Yuen, R. K., Feuk, L., Scherer, S. W. The Database of Genomic Variants: a curated collection of structural variation in the human genome. Nucleic Acids Res. 42, Database issue D986-D992 (2014).
  58. Amaral, M. L., Erikson, G. A., Shokhirev, M. N. BART: bioinformatics array research tool. BMC Bioinformatics. 19 (296), 2018(2018).
  59. Wiese, L., Wiese, I., Lietz, K. Software quality assessment of a web application for biomedical data analysis. 25th International Database Engineering & Applications Symposium. , 84-93 (2021).
  60. Davis, S., Meltzer, P. S. GEOquery: a bridge between the Gene Expression Omnibus (GEO) and BioConductor. Bioinformatics. 23 (14), 1846-1847 (2007).

重印与许可

标签

差异基因表达微阵列分析生物信息学分析流程差异表达基因生物标志物鉴定功能通路分析人群特异性筛查癌症生物标志物高通量技术