需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

C. elegans RNA测序数据通过Galaxy平台上的Tuxedo软件套件进行转录组分析

16.8K 次观看

DOI:

10.3791/55473

2017年4月8日

本文内容

摘要

Galaxy 和 DAVID 已成为广受欢迎的工具,使没有生物信息学背景的研究人员也能够分析和解读 RNA-Seq 数据。本文描述了一项针对 C. elegans 研究人员的实验方案,用于开展 RNA-Seq 实验,利用 Galaxy 获取并处理数据集,并通过 DAVID 从基因列表中获得有意义的生物学信息。

摘要

下一代测序(NGS)技术彻底改变了生物学研究的性质。其中,RNA测序(RNA-Seq)已成为基因表达分析和转录组定位的有力工具。然而,处理RNA-Seq数据集需要复杂的计算专业知识,对生物学研究人员而言存在固有的挑战。这一瓶颈已通过开放获取的Galaxy项目得到缓解,该平台使不具备生物信息学技能的用户也能分析RNA-Seq数据;此外,功能注释、可视化与集成发现数据库(DAVID)是一套基因本体(GO)术语分析工具,有助于从大规模数据集中提取生物学意义。然而,对于初次使用者和生物信息学初学者而言,自主学习并熟悉这些平台可能耗时且令人望而生畏。本文描述了一种简明的工作流程,旨在帮助C. elegans研究人员分离线虫RNA,开展RNA-Seq实验,并利用Galaxy和DAVID平台进行数据分析。本实验方案提供了逐步操作指南,介绍如何使用Galaxy的各种模块来获取原始NGS数据、进行质量控制检查、序列比对以及差异基因表达分析,并在每一步中为用户提供参数设置指导,最终生成基因列表,随后可在DAVID中筛选特定基因类别或生物学过程的富集情况。总体而言,我们预期本文将为首次开展RNA-Seq实验的C. elegans研究人员以及需处理少量样本的常规使用者提供实用参考。

引言

利用弗雷德·桑格(Fred Sanger)的双脱氧核苷酸测序法完成的首次人类基因组测序耗时10年,耗资约30亿美元1,2。然而,自下一代测序(NGS)技术问世以来短短十余年,现已能够在两周内完成整个人类基因组的测序,成本仅为1000美元。新型NGS仪器以极高的效率实现了测序数据采集速度的持续提升,同时成本显著降低,正以前所未有的方式推动现代生物学的变革,使基因组测序项目迅速普及。此外,这些进展还极大地促进了其他多个领域的研究进展,例如通过RNA测序(RNA-Seq)进行基因表达分析、全基因组表观遗传修饰研究、DNA-蛋白质相互作用分析,以及对人类宿主中微生物多样性的筛查。基于NGS的RNA-Seq尤其能够以高准确性和高灵敏度全面识别和绘制转录组图谱,已取代微阵列技术成为表达谱分析的首选方法。尽管微阵列技术已被广泛使用,但其应用受限于依赖已知基因组信息的预设芯片,且存在交叉杂交、可可靠检测的表达变化范围有限等其他缺陷。相比之下,RNA-Seq能够检测已知和未知的转录本,同时由于其明确的DNA比对特性,背景噪声极低。RNA-Seq结合酵母、果蝇、线虫、鱼类和小鼠等模式生物所提供的丰富遗传工具,已成为近年来众多重要生物医学发现的基础。然而,仍存在诸多挑战限制了NGS在更广泛科学界的应用,包括数据存储、处理能力的局限,尤其是对海量测序数据进行有意义的生物信息学分析的困难。

测序技术的快速发展和数据的指数级积累,使得科研人员迫切需要能够访问、分析并理解这些信息的计算平台。早期的系统高度依赖计算机编程知识,而像美国国家生物技术信息中心(NCBI)这样的基因组浏览器虽然允许非编程人员访问和可视化数据,却无法进行复杂的分析。基于网络、开放获取的平台 Galaxy(https://galaxyproject.org/)填补了这一空白,已成为一个有价值的分析流程,使研究人员能够处理高通量测序(NGS)数据,并执行从简单到复杂的多种生物信息学分析。Galaxy 最初由宾夕法尼亚州立大学的 Anton Nekrutenko 实验室和约翰斯·霍普金斯大学的 James Taylor 实验室建立并持续维护3。Galaxy 提供了广泛的计算任务,使其成为满足无数生物信息学需求的“一站式平台”,包括 RNA-Seq 研究中的所有步骤。用户可以在 Galaxy 的服务器上或本地计算机上进行数据处理。数据和工作流程可被重复使用和共享。在线教程、帮助页面以及专为 Galaxy 项目设立的 wiki 页面https://wiki.galaxyproject.org/Support)提供了持续的支持。然而,对于初次使用的用户,尤其是那些没有接受过生物信息学培训的用户,该分析流程可能显得复杂难懂,自学和熟悉过程可能耗时较长。此外,所研究的生物系统以及实验设计和方法的具体细节,会影响多个分析步骤中的决策,若无指导,这些环节可能难以掌握。

整体RNA-Seq Galaxy工作流程包括数据上传和质量检查,随后使用Tuxedo Suite4,5,6,7,8,9进行分析,该套件包含RNA-Seq数据分析各个阶段所需的一系列工具10,11,12,13,14。一个典型的RNA-Seq实验包括实验部分(样品制备、mRNA分离和cDNA文库构建)、下一代测序(NGS)以及生物信息学数据分析。这些部分的概述以及Galaxy流程中的具体步骤如图1所示。

figure-introduction-1
图1:RNA-Seq 工作流程概览。 本图展示了用于比较两种线虫品系(A 和 B,分别以橙色和绿色线条及箭头表示)基因表达谱的 RNA-Seq 实验所涉及的实验与计算步骤。图中用方框标出了所使用的 Galaxy 不同模块,并以红色标注了本实验方案中对应的步骤。各项操作的输出结果以灰色文字表示,文件格式以蓝色显示。请点击此处查看该图的放大版本。

Tuxedo 软件套件中的第一个工具是一个名为“Tophat”的比对程序。它将高通量测序(NGS)输入的读段拆分为较小的片段,然后将其比对到参考基因组上。这种两步法过程确保了跨越内含子区域的读段(其比对可能因序列中断而被遗漏或失败)能够被识别并正确比对。这提高了测序覆盖度,并有助于发现新的剪接位点。Tophat 的输出结果包含两个文件:一个 BED 文件(包含剪接位点信息,包括基因组位置)和一个 BAM 文件(包含每条读段的比对细节)。接下来,使用 Tuxedo 软件套件中的下一个工具“Cufflinks”,将 BAM 文件与参考基因组进行比对,以估算每个样本内各个转录本的丰度。Cufflinks 通过扫描比对结果,报告跨越每个基因所有可能剪接异构体的全长转录片段(即“transfrags”),从而为每个测序样本生成一个“转录组”(即每个基因所产生的所有转录本的集合)。随后,这些 Cufflinks 生成的转录组组装结果与参考基因组合并,利用下一个工具“Cuffmerge”生成一个统一的注释文件,用于后续的差异分析。最后,“Cuffdiff”工具通过将各个样本的 TopHat 输出结果与最终的 Cuffmerge 输出文件进行比较,来检测样本之间的差异基因表达(图1)。Cufflinks 使用 FPKM/RPKM(每百万比对读段中每千碱基转录本所对应的片段数/读段数)值来报告转录本丰度。这些数值对原始 NGS 数据进行了深度(来自样本并比对到参考基因组的平均读段数)和基因长度(不同基因长度不同,因此必须对基因长度进行标准化,才能比较不同基因间的表达水平)的归一化处理。FPKM 和 RPKM 本质上相同,其中 RPKM 用于单端 RNA-Seq(每个读段对应一个片段),而 FPKM 用于双端 RNA-Seq,因为它考虑了两个读段可能来自同一片段的情况。最终,这些分析的结果是一份在不同实验条件和/或菌株之间差异表达的基因列表。

当一次成功的 Galaxy 运行完成并生成“基因列表”后,下一步的合理操作是进行更深入的生物信息学分析,以从数据集中推导出有意义的知识。为此,已涌现出多种软件包,其中包括公开可用的基于网络的计算工具,例如 DAVID(功能注释、可视化与综合发现数据库)15。DAVID 通过将上传的基因列表与其整合的生物学知识库进行比对,揭示与该基因列表相关的生物学注释,从而帮助研究人员为高通量研究产生的大规模基因列表赋予生物学意义。随后进行富集分析, 统计学检验,以确定在基因列表中是否存在显著过表达的生物学过程或基因类别。由于具备广泛整合的知识库和强大的分析算法,DAVID 能够帮助研究人员识别基因组学衍生“基因列表”中显著富集的生物学主题,因而成为广受欢迎的选择10,16。其额外优势还包括能够处理来自任意测序平台生成的基因列表,以及提供高度用户友好的操作界面。

线虫 Caenorhabditis elegans 是一种遗传学研究的模式生物,以其诸多优势而广为人知,例如个体小、身体透明、体型结构简单、易于培养,并且非常适合进行遗传学和分子生物学的解析。该线虫具有一个基因组小、结构简单且注释完善的特点,其中多达40%的基因与已知的人类同源基因保守17。事实上,C. elegans 是首个完成全基因组测序的多细胞真核生物18,也是最早利用RNA-Seq技术绘制生物体转录组的物种之一19,20。早期的线虫研究涉及多种高通量RNA捕获、文库构建与测序方法以及生物信息学分析流程的实验,推动了该技术的发展21,22。近年来,基于RNA-Seq的线虫实验已变得普遍。然而,对于传统的线虫生物学家而言,RNA-Seq数据的计算分析仍构成主要障碍,限制了该技术更广泛和更深入的应用。

本文介绍了一种利用 Galaxy 平台分析来自 C. elegans 的高通量 RNA-Seq 数据的实验方案。对于许多初次使用或小规模用户而言,开展 RNA-Seq 实验最具成本效益且最直接的方法是在实验室中提取 RNA,并利用商业机构(或内部)的下一代测序(NGS)平台完成测序 cDNA 文库的构建及测序工作。因此,我们首先详细描述了用于 RNA-Seq 的 C. elegans RNA 样本的提取、定量和质量评估步骤。接着,我们提供了使用 Galaxy 界面对 NGS 数据进行分析的逐步操作指南,包括测序后质量控制检测、序列比对、转录本组装以及基因表达差异定量。此外,我们还提供了利用 DAVID 工具对 Galaxy 分析所得基因列表进行生物学功能富集研究的操作说明。作为工作流程的最后一步,我们介绍了将 RNA-Seq 数据上传至公共数据库(如 NCBI 的 Sequence Read Archive(SRA))(http://www.ncbi.nlm.nih.gov/sra)的方法,以便科研界自由访问。总体而言,我们期望本文能为首次开展 RNA-Seq 实验的线虫生物学家以及常规进行少量样本分析的用户,提供全面且充分的技术指导。

访问受限。请登录或开始试用以查看此内容。

方案

1. RNA 提取

  1. 预防措施
    1. 使用市售的RNase喷雾剂擦拭整个工作台面、仪器和移液器,以去除可能存在的任何RNase。
    2. 始终佩戴手套,并在实验方案的不同步骤中定期更换为新手套。
    3. 使用带滤芯的吸头,并尽可能将所有样品置于冰上,以防止RNA降解。
      注意:为了从高通量测序(NGS)平台获得最佳数据,起始使用高质量的RNA至关重要。RNA的分离与制备方法因样本来源、测序方法及研究者偏好而异。可采用多种 commercially available kits 进行RNA提取,也可使用标准的苯酚-氯仿法进行RNA提取。无论采用何种方法,均应全程遵循上述预防措施,以最大限度减少污染,获得纯净的RNA样本。
  2. 收获线虫
    1. 通过次氯酸盐漂白处理同步线虫种群23 以获得1,000–1,500名年龄匹配的 秀丽隐杆线虫 每品系成虫数量
    2. 使用M9缓冲液冲洗平板上的线虫,在台式离心机上以325 × g离心30秒。吸除M9缓冲液,留下线虫沉淀。重复此步骤至少三次,以消除细菌残留。
    3. 向线虫沉淀中加入约~ 500 µL 裂解缓冲液(若使用商业试剂盒)或Trizol(苯酚与异硫氰酸胍的单相溶液;若进行1.3.3中所述的苯酚:氯仿抽提)以破坏线虫组织、灭活RNase并稳定核酸。
      注意:此时可通过液氮速冻样品,随后于-80°C长期保存,暂停实验流程。80 °C.
  3. RNA提取
    1. 将线虫样品置于冰上,以45%的振幅进行超声处理,每次超声20秒,间隔40秒(每品系8-12个循环)。处理过程中始终保持样品处于冰上。
      注意:确保超声波探头浸入缓冲液中,并在整个过程中保持恒定深度。避免样品产生泡沫,且在处理不同样品之间需彻底清洁探头。超声处理的循环参数可能因所用超声仪型号不同而有所差异。建议在正式实验开始前,先在测试样品上优化超声处理条件。
    2. 若使用商业试剂盒,请按照指定方案进行RNA提取。若采用苯酚-氯仿法提取RNA,请执行以下步骤。
    3. 将超声处理后的样品在16,000 × g 离心10分钟。 4° C.
    4. 将上清液转移至一个1.5 mL无RN酶的微量离心管中,并加入 100 µL 氯仿(1/5)th RNA/DNA 提取试剂的体积
      注意:氯仿具有毒性。操作时应在化学通风橱中进行,以尽量减少接触并避免吸入。
    5. 将样品充分涡旋振荡30 - 60秒,并在室温下静置3分钟。
    6. 在 11,750 × g 条件下离心 15 分钟 4 °C仅将上层水相转移至新的无RNase的微量离心管中,注意避免吸入含有DNA的白色界面。重复步骤1.3.4至1.3.6。
    7. 添加 250 µL (加入相当于水相体积的70%或RNA/DNA提取试剂体积的1/2)的2-丙醇,倒置离心管以混匀。室温静置10分钟,或于-20°C过夜。80 °C.
    8. 在 11,750 × g 条件下离心样品 10 分钟。 4 °C. 小心地倾去上清液,留下少量 µL 在离心管底部,以免扰动沉淀。
    9. 用……洗涤沉淀 500 µL 75% 乙醇(使用无 RNase 水配制)中,16,000 × g 离心 5 分钟。 4 °C.
    10. 尽可能吸除上清液,避免扰动沉淀。将沉淀在通风橱中晾干数分钟。
    11. 添加 30 µL RNase-free水,并通过加热10分钟帮助溶解RNA沉淀。 60 °C.
    12. 使用生物分析仪检测RNA的质与量。
      注意:Bioanalyzer 生成一个 RNA I完整性 NRIN(RNA完整性数)作为评估RNA质量的指标。进行RNA-Seq时,建议RNA样本的RIN值至少达到8(数值越高越好)。RNA的浓度和纯度可通过分光光度法检测,但也应结合对RNA完整性的可视化评估。为此,将样本在1.2%琼脂糖凝胶上电泳,时间需足够长,以实现28S和18S核糖体RNA条带的良好分离。应观察到两条清晰的条带(对于18S rRNA为1.75 kb,28S rRNA为3.5 kb的情况) 秀丽隐杆线虫) 是可接受的 RNA 质量评估指标。
    13. 使用约 100 ng/µL 将RNA运送至供应商/NGS测序机构以制备测序文库。
      注意:RNA 样本应使用干冰运输至测序服务提供商。大多数供应商会在文库构建前进行独立的 RNA 质量控制检测。

2. RNA-Seq 数据分析

  1. 原始测序数据下载
    1. 下载压缩的原始数据 fastq 以序列数据编码的 fastq.gz 使用NGS供应商提供的格式 "文件传输协议" (ftp)

figure-protocol-1
图2:Galaxy 用户界面面板及关键 RNA-Seq 功能布局。 页面的关键特征已展开并高亮显示。(A)高亮显示网页头部中的“分析数据”功能,用于访问分析主页视图。(B)为“进度条”,用于指示操作所占用的 Galaxy 服务器存储空间。(C)为“工具”区域,列出可在 Galaxy 界面上运行的所有工具。(D)显示用于 RNA-Seq 分析的“NGS:RNA 分析”工具模块。(E)展示“历史记录”面板,列出通过 Galaxy 生成的所有文件。(F)显示点击历史记录区域中任意文件时弹出的对话框示例。在(F)中,蓝色框高亮的图标可用于查看、编辑属性删除数据集;紫色框高亮的图标可用于编辑数据集标签或注释;红色框则指示用于下载数据、查看任务详细信息或重新运行操作的图标。请点击此处查看此图的放大版本。

  1. 开始使用 Galaxy
    注意:Galaxy 可通过基于网络的平台在免费公共服务器上运行,该平台提供云访问和有限的免费存储空间。此外,Galaxy 也可下载并在用户本地计算机或机构托管的计算集群上本地运行,但本地处理可能受限于用户设备的数据存储容量和计算能力。有关下载和安装的详细信息,请访问 https://wiki.galaxyproject.org/Admin/GetGalaxy在本方案中,我们描述了Galaxy流程的基于网络的使用方法。
    1. 在用户计算机上下载并存储NGS数据后,访问Galaxy平台 https://usegalaxy.org/.
    2. 通过点击注册用户账户 用户 在页面顶部,登录后请先熟悉用户界面面板。
      注意:建议首次使用者采用该方法 从这里开始 主页上的教程可帮助您熟悉 Galaxy 的基本设置https://github.com/nekrut/galaxy/wiki/Galaxy101-1).
    3. 点击 分析数据 (图2A) 在页眉面板中以访问 分析主页视图 这也是 Galaxy 上的启动屏幕。
      注意:页眉还包含其他链接,将鼠标指针悬停在其上方可查看详细信息。页眉右上角有一个进度条,用于监控任务所占用的空间情况图2B).
    4. 点击“NGS:RNA分析任务在 工具菜单 左侧面板上(图 2C) 以获取进行 RNA-seq 数据分析所需的所有工具。
      注意: 工具菜单 目录列出了 Galaxy 提供的全部操作。该菜单按任务类型划分,点击任一类别将展开完成该任务所需的所有工具列表。
    5. 通过点击“历史右侧面板(图2E)。选择“新建弹出菜单中选择“选项”。为此“历史用于标识该分析的合适名称。
      注意: “历史”面板显示了为分析上传的所有文件,以及在 Galaxy 上运行任务生成的所有输出文件。点击该面板中的文件名,将弹出一个对话框,其中包含有关执行任务的详细信息以及数据集的片段图 2F)此框中的图标可让用户“查看', '编辑属性删除数据集(图 2F(以蓝色标出)。此外,用户还可以编辑数据集标签或注释(图 2F,以紫色突出显示)下载数据,查看详细信息任务的'重新运行任务,甚至可视化此对话框中的数据集(图2F(以红色标出)
    6. 点击“上传文件 功能在“下获取数据 在“工具菜单上传原始数据 fastq 文件。
      注意:单击此工具或任何其他工具,将在页面中央打开该操作及测试本身的简要说明 分析界面 面板。该面板将各部分连接在一起 工具 来自左侧面板和 输入文件 从右侧历史' 面板(图2E)。此处,来自“历史“被选中,其他参数也被定义以运行特定任务。每次测试生成的结果数据集将被保存回”历史'. 包含在测试中的“分析界面" 面板包含运行特定工具时所有可用参数的说明,以及该工具生成的所有输出文件的详细列表。
    7. 任务在 分析界面,点击“选择本地文件选择 FTP 文件 (更快的上传),导航至包含测序文件的文件夹,并选择要上传的适当数据集。
    8. 允许 Galaxy 执行自动检测“上传的文件类型(默认设置)。选择”秀丽隐杆线虫在基因组的下拉菜单中
    9. 点击“开始“以启动数据上传。文件上传完成后,将保存在“历史面板中,可从该位置访问。
    10. 如果单个样本生成了多个测序数据文件,请使用以下方法将它们合并:连接工具。为此,请打开“文本操作 选项在 工具菜单.
    11. 点击 连接 工具,从中间下拉框中选择需要合并的文件分析界面 并点击“执行.
      注意:使用此任务生成的输出文件将在 fastq 格式. 该比对程序每批次最多可处理 16,000,000 条序列 fastq 文件,当达到该限制时,将创建一个新文件 fastq 文件为剩余序列生成。 连接 此时需要使用工具来整合数据集。
    12. 转换已上传的 fastq 将文件格式转换为所需的 fastqsanger 使用“Galaxy RNA-Seq 分析的格式”fastq 修剪工具 工具位于“NGS:质控与操作部分(参见补充文件)。
    13. 选择合适的 fastq 数据集位于“文件整理 选项并使用默认参数运行该工具。
      注意:使用此任务生成的输出文件为 fastqsanger 格式.
  2. fastqsanger 数据质量控制测试
    1. 检查上传内容的质量 fastqsanger 使用“读取”功能FastQC 位于“下方的工具NGS:质控与操作“工具”菜单中的“
    2. 选择经过修剪的 fastqsanger 下拉菜单中选择数据文件以用于“当前文库的短读长数据 使用默认参数运行该工具。
      注意:请特别关注测序读段的质量以及是否存在任何接头序列。接头通常会在下一代测序(NGS)服务提供商进行的RNA-Seq数据后续处理过程中被去除,但在某些情况下可能仍有残留。有关质量标准的说明,请参见 http://www.bioinformatics.babraham.ac.uk/projects/fastqc/.
    3. 与NGS服务提供商确认,如果存在接头序列,请使用“夹子 工具来自“NGS:质控与操作 任务菜单
      注意:使用此任务生成的输出文件将以纯文本(txt)格式以及 html 可在任何网页浏览器中打开.
  3. 使用Tuxedo套件进行数据分析
    1. TopHat
      1. 下载最新版本的 秀丽隐杆线虫 参考基因组 fastagtf (基因转移格式)文件来自 上传文件 如上文 2.2.6 所述
      2. 打开 NGS:RNA分析 部分并点击“TopHat 用于将测序读段比对至下载的参考基因组的工具。
      3. 从下拉菜单中选择问题的正确答案 这是单端测序数据还是双端测序数据?
      4. 选择合适的 fastq 文件。
      5. 选择 使用历史基因组 在下一个下拉菜单中,选择在步骤 2.4.1.1 中下载的参考基因组。
      6. 其他参数选择“Default”,然后点击“执行.
        注意:使用此任务生成的输出文件中,‘已接受的命中结果“文件将用于后续步骤。
    2. Cufflinks 和 Cuffmerge
      1. 选择 Cufflinks 工具在“NGS:RNA分析 组装转录本、估计其丰度并检测差异表达。
      2. 在第一个下拉菜单中,选择已映射的“已接受的比对结果(BAM 格式)来自获取的文件 TopHat 分析。
      3. 在第二个下拉菜单中,将参考注释设置为 gtf 步骤 2.4.1.1 中下载的文件
      4. 选择“是”作为“执行偏倚校正 选择该选项,并使用其他所有参数的默认设置运行任务。
        注意:在此任务生成的输出文件中,‘已接受的转录本 文件用于后续步骤。
      5. 开放 Cuffmerge 工具在“NGS:RNA分析 合并“组装转录本为所有RNA-Seq样本制备。
        注意:工具中的第一个框会自动填充,列出所有内容 gtf 由……产生的文件 Cufflinks.
      6. 选择 组装转录本 所有测试菌株/条件的文件,包括同一菌株/条件的生物学重复(生物学重复详见讨论部分)。
      7. 选择“是”作为“使用参考注释 并选择 gtf 步骤 2.4.1.1 中下载的文件
      8. 在下方的框中,再次为“是否”选择“是”使用序列数据“选项并选择全基因组” fasta 步骤 2.4.1.1 中下载的文件
      9. 保持其他参数为默认值,点击“Execute”。
        注意:Cuffmerge 会生成一个单一的 gtf 输出文件。
    3. Cuffdiff
      1. 导航至“Cuffdiff工具在“NGS:RNA分析 部分。在“转录本 菜单中,选择合并后的输出文件 Cuffmerge
      2. 用两种菌株/条件的名称标记条件1和条件2。
        注意: Cuffdiff 可对两个以上菌株或条件进行比较,并可开展时间序列实验。只需使用“添加新条件 根据需要,可选择添加每种新菌株或条件。
      3. 每种菌株/条件下,于“重复组 选择单个已接受的命中结果 输出文件来自 TopHat 对应于该菌株/条件的不同生物学重复。按住“cmd 键,如果使用 Macintosh 计算机,以及 'ctrl 键,如果使用PC,可选择多个文件。
      4. 保留所有其他选项为默认参数。点击 执行 执行该任务。
        注意: Cuffdiff 以表格格式生成大量输出文件,作为RNA-Seq分析的最终读出结果。这些文件包括转录本的FPKM追踪文件、基因(共享同一基因标识的转录本的合并FPKM值)、初级转录本以及编码序列。所有生成的数据文件均可在任意电子表格应用程序中查看,且包含类似的属性,如基因名称、位点、倍数变化(以log2为尺度)以及不同菌株/条件间比较的统计学数据,包括p值和q值。用户可根据基因表达差异的统计学显著性或倍数变化(变化的幅度与方向,例如上调或下调基因)对这些文件中的数据进行排序,并根据需要进行进一步处理。如需在不同基因标识符之间进行转换(例如,Wormbase 基因 ID cosmid 编号),Biomart 上可用的工具(http://www.biomart.org/)可以被利用。

3. 使用 DAVID 进行基因本体(GO)术语分析

  1. 从网站 https://david.ncifcrf.gov/ 访问 DAVID。点击 开始分析 在网页页眉中,“步骤1”将从Galaxy获得的基因列表复制并粘贴到A框中。“步骤2”选择“Wormbase基因ID”作为输入基因的标识符。
    注意:DAVID 可识别大多数公开的注释类别,因此也可使用其他基因标识符(如 Entrez 基因 ID 或基因符号)。
  2. 在“步骤3”中,在“列表类型”下选择“基因列表”(待分析基因),然后单击 提交列表 图标。
    注意:分析向导,将展开列出所有可对上传的基因列表运行的超链接 DAVID 工具(图3)。单击这些链接,可根据用户需求访问相应的模块。为确定适用于特定任务的工具,请单击“应该使用哪些 DAVID 工具?“链接在‘分析向导 页。点击 开始分析 页眉中的链接可返回到“分析向导 分析过程中可随时返回主页。

figure-protocol-2
图3:DAVID 分析向导 网页布局及操作结果示例。分析向导”网页用户界面列出了用于根据各种参数分析上传基因列表富集情况的工具。点击这些工具将在新网页中显示分析后的数据。图中插图(箭头所示)展示了由“基因功能分类”、“功能注释图表”和“功能注释聚类”生成的表格报告示例。请点击此处查看该图的放大版本。

  1. 功能注释工具 1:功能注释聚类
    1. 点击“Functional Annotation Clustering”模块进入摘要页面。保留默认的注释类别,然后点击“Functional Annotation Clustering”以生成按富集得分排序的相似注释术语聚类。
    2. 点击每个术语的超链接名称以查看其详细信息,并点击“RT”(相关术语)以列出与该类别相关的其他相似术语。
    3. 点击紫色条形以列出与某一术语相关的基因,点击红色的“G”以列出该聚类中所有术语所关联的全部基因。
    4. 点击绿色图标以查看聚类中所有基因和术语的二维视图。
      注:最后三列列出了每个术语的分析和统计结果。本工具及所有其他分析的结果均可通过点击“Download File”链接下载为 .txt 格式文件。
  2. 功能注释工具 2:功能注释图表
    1. 返回摘要页面,点击“Functional Annotation Chart”以识别与基因列表显著相关的生物学术语(例如 转录因子活性或激酶活性)。
    2. 点击术语名称以获取更详细的信息,并点击“RT”(相关术语)以列出其他相关术语。
    3. 点击紫色条形以列出相应类别的所有关联基因。
      注:最后两列列出了每个类别的统计检验结果。
  3. 功能注释工具 3:功能注释表格
    1. 返回摘要页面,点击“Functional Annotation Table”以查看与基因列表中基因相关的所有注释,且不进行任何统计计算。
      注:该工具可用于对基因列表进行逐个基因分析,或用于查看特定的、高度感兴趣的基因。
  4. 基因功能分类工具
    1. 返回“Analysis Wizard”页面,点击“Gene Functional Classification”模块,将输入的基因列表划分为按“富集得分”排序的功能相关基因组,该得分用于衡量基因组在列表中的整体富集程度。
    2. 点击术语名称以获取更详细的信息,并点击“RG”以显示该基因组中功能相关的基因。
    3. 点击红色的“T”(术语报告)以列出相关生物学信息,点击绿色图标以查看所有基因和术语的二维视图。
  5. 基因名称批量查看器
    1. 返回“Analysis Wizard”页面,点击“Gene-name Batch Viewer”以将“Wormbase 基因 ID”转换为其对应的基因名称(例如 WBGene00022855 = tcer-1)。
    2. 点击基因名称以获取更多基因特异性信息。
    3. 点击每个基因旁边的“RG”(相关基因)链接,以显示预测与目标基因功能相关的基因。

4. 将原始数据上传至 NCBI 序列读取档案库(SRA)

  1. 访问 SRA 网页 登录 NCBI 链接或注册一个新账户。
  2. 点击“生物项目
  3. 点击“投稿 在“使用 Bioproject 左侧标题
  4. 选择“选项”新投稿. 更新提交者详细信息。继续完成剩余的七个选项卡,填写正在上传的实验和数据的详细信息。点击“提交 完成后。
    注意:在第五个“生物样本 标签,保留“生物样本 空。
  5. 点击以刷新结果页面 我的投稿 链接。提交的数据将列出相应的提交编号、简要描述和上传状态。
  6. 点击 生物样本 页面顶部的 开始新的投稿 盒并创建一个 新投稿每个样本请分别提交。
  7. 与……情况相同 生物项目 在 4.4 中,更新提交者信息,并继续完成其余标签页中的各项内容填写。完成后进行审核并点击“提交.
  8. 导航至 http://www.ncbi.nlm.nih.gov/sra 以创建最终的“序列读取存档(SRA)”提交。
  9. 点击下方的“登录 SRA” 入门指南
  10. 在下一页点击“NCBI PDA”链接。一个 更新首选项 链接将打开。填写表格并点击 保存偏好设置
  11. 在结果页面上,点击 创建新投稿 链接。在“名称”下输入一个合适的名称别名 并单击 保存 将创建一个包含投稿编号及其他详细信息的表格。
  12. 单击“新建实验”,并为每个样本注册至少一个独特的测序文库 生物样本.
  13. 指定并链接先前创建的 BioProject生物样本 投稿编号。A 新实验 将被创建。
  14. 点击 新运行 在完成SRA实验后,于页面底部识别出需要链接到该实验的数据文件。
  15. 计算每个数据文件的 MD5 校验和。在 MacIntosh 终端中执行此操作时,需导航至 应用程序/实用工具/终端在终端中输入“md5”(不含引号),然后输入一个空格。从访达中将需要上传的文件拖放到终端窗口,然后单击 回车
  16. 终端将返回一个字母数字组成的MD5校验和。在文件上传的提交过程中输入此校验和。使用系统提供的用户名和密码通过FTP上传文件。

访问受限。请登录或开始试用以查看此内容。

结果

C. elegans 中,消除生殖系干细胞(GSCs)可延长寿命、增强应激耐受性,并提高体脂含量24,28。GSCs 的缺失(无论是通过激光消融还是如 glp-1 等突变引起)可通过激活一系列转录因子网络来延长寿命29。其中一个因子 TCER-1 编码人类转录延伸和剪接因子 TCERG1 的线虫同源蛋白30。以下代表性结果展示了在我们近期发表的研究中31,如何利用 RNA-Seq 鉴定在生殖系缺失后受 TCER-1/TCERG1 调控的基因表达变化。我们比较了年龄匹配的第2天成虫 glp-1tcer-1;glp-1 突变体的转录组。对于每种品系,使用第1节所述方案从两个生物学重复样本(共四个样本)中分离 mRNA。RNA 样本被送往商...

访问受限。请登录或开始试用以查看此内容。

讨论

现代生物学中Galaxy测序平台的重要性

Galaxy 项目在帮助没有生物信息学背景的生物学家快速高效地处理和分析高通量测序数据方面发挥了关键作用。这一公开可用的平台曾被认为是一项艰巨的任务,如今却使运行复杂的生物信息学算法来分析 NGS 数据变得简单、可靠且易于操作。除了提供广泛的生物信息学工具外,Galaxy 成功的关键还在于其用户界面的简洁性,能够以直观且无缝的方式整合复杂测序分析的各个方面。由于这些特点,Galaxy 分析流程已在生物学家群体中得到广泛应用,包括 C. elegans 研究人员。除了帮助用户熟悉 RNA-Seq 分析流程外,Galaxy 还有助于为初级生物学家建立数据分析的基本概念,并理解所涉及工具的原理。这些知识为用户进一步学习更复杂的生物信息学平台(如“R”和“Python”)奠定了基础。除 Galaxy 外,目前还有其他商业软件和开源工具可用于 RNA-Seq 分析。商业软件通常是独立的、易于使用的软件包,但对于不常使用 NGS 的个体研究者而言,费用可能较高。而开源平台(如 BioWadrobe34

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

作者谨向开发 Galaxy 和 DAVID 的实验室、团队及个人致以诚挚感谢,正是他们的工作使新一代测序技术(NGS)在科学界得以广泛应用。同时感谢匹兹堡大学同事在我们进行生物信息学培训期间所提供的帮助与建议。本研究由艾略特医学基金会衰老领域新学者奖(AG-NS-0879-12)以及美国国立卫生研究院资助项目(R01AG051659)支持,资助对象为 AG。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
RNase 喷雾剂 Fisher Scientific21-402-178
Trizol Ambion15596026
超声波破碎仪Sonics Vibra Cell VCX130
离心机 Eppendorf5415C
氯仿 Sigma Aldrich288306
2-丙醇 Fisher ScientificA416P-4
乙醇Decon Labs2705HC
无RNase水 Fisher ScientificBP561-1
生物分析仪 AgilentG2940CA
Mac/PC

参考文献

  1. Venter, J. C., et al. The sequence of the human genome. Science. 291 (5507), 1304-1351 (2001).
  2. Lander, E. S., et al. Initial sequencing and analysis of the human genome. Nature. 409 (6822), 860-921 (2001).
  3. Afgan, E., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2016 update. Nucleic Acids Res. 44 (W1), W3-W10 (2016).
  4. Trapnell, C., Pachter, L., Salzberg, S. L. TopHat: discovering splice junctions with RNA-Seq. Bioinformatics. 25 (9), 1105-1111 (2009).
  5. Trapnell, C., et al. Transcript assembly and quantification by RNA-Seq reveals unannotated transcripts and isoform switching during cell differentiation. Nat Biotechnol. 28 (5), 511-515 (2010).
  6. Roberts, A., Trapnell, C., Donaghey, J., Rinn, J. L., Pachter, L. Improving RNA-Seq expression estimates by correcting for fragment bias. Genome Biol. 12 (3), R22(2011).
  7. Roberts, A., Pimentel, H., Trapnell, C., Pachter, L. Identification of novel transcripts in annotated genomes using RNA-Seq. Bioinformatics. 27 (17), 2325-2329 (2011).
  8. Trapnell, C., et al. Differential gene and transcript expression analysis of RNA-seq experiments with TopHat and Cufflinks. Nat Protoc. 7 (3), 562-578 (2012).
  9. Trapnell, C., et al. Differential analysis of gene regulation at transcript resolution with RNA-seq. Nat Biotechnol. 31 (1), 46-53 (2013).
  10. Huang da, W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using DAVID bioinformatics resources. Nat Protoc. 4 (1), 44-57 (2009).
  11. Giardine, B., et al. Galaxy: a platform for interactive large-scale genome analysis. Genome Res. 15 (10), 1451-1455 (2005).
  12. Han, Y., Gao, S., Muegge, K., Zhang, W., Zhou, B. Advanced Applications of RNA Sequencing and Challenges. Bioinform Biol Insights. 9 (1), 29-46 (2015).
  13. Mardis, E. R. Next-generation sequencing platforms. Annu Rev Anal Chem (Palo Alto Calif). 6, 287-303 (2013).
  14. Yang, I. S., Kim, S. Analysis of Whole Transcriptome Sequencing Data: Workflow and Software. Genomics Inform. 13 (4), 119-125 (2015).
  15. Khatri, P., Draghici, S. Ontological analysis of gene expression data: current tools, limitations, and open problems. Bioinformatics. 21 (18), 3587-3595 (2005).
  16. Huang da, W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Res. 37 (1), 1-13 (2009).
  17. Shaye, D. D., Greenwald, I. OrthoList: a compendium of C. elegans genes with human orthologs. PLoS One. 6 (5), e20085(2011).
  18. Consortium, C. eS. Genome sequence of the nematode C. elegans: a platform for investigating biology. Science. 282 (5396), 2012-2018 (1998).
  19. Agarwal, A., et al. Comparison and calibration of transcriptome data from RNA-Seq and tiling arrays. BMC Genomics. 11, 383(2010).
  20. Mortazavi, A., et al. Scaffolding a Caenorhabditis nematode genome with RNA-seq. Genome Res. 20 (12), 1740-1747 (2010).
  21. Bohnert, R., Ratsch, G. rQuant.web: a tool for RNA-Seq-based transcript quantitation. Nucleic Acids Res. 38, Web Server issue W348-W351 (2010).
  22. Lamm, A. T., Stadler, M. R., Zhang, H., Gent, J. I., Fire, A. Z. Multimodal RNA-seq using single-strand, double-strand, and CircLigase-based capture yields a refined and extended description of the C. elegans transcriptome. Genome Res. 21 (2), 265-275 (2011).
  23. Amrit, F. R., Ratnappan, R., Keith, S. A., Ghazi, A. The C. elegans lifespan assay toolkit. Methods. 68 (3), 465-475 (2014).
  24. Hsin, H., Kenyon, C. Signals from the reproductive system regulate the lifespan of C. elegans. Nature. 399 (6734), 362-366 (1999).
  25. Alper, S., et al. The Caenorhabditis elegans germ line regulates distinct signaling pathways to control lifespan and innate immunity. J Biol Chem. 285 (3), 1822-1828 (2010).
  26. Steinbaugh, M. J., et al. Lipid-mediated regulation of SKN-1/Nrf in response to germ cell absence. Elife. 4, (2015).
  27. Lapierre, L. R., Gelino, S., Melendez, A., Hansen, M. Autophagy and lipid metabolism coordinately modulate life span in germline-less. C. elegans. Curr Biol. 21 (18), 1507-1514 (2011).
  28. Rourke, E. J., Soukas, A. A., Carr, C. E., Ruvkun, G. C. elegans major fats are stored in vesicles distinct from lysosome-related organelles. Cell Metab. 10 (5), 430-435 (2009).
  29. Ghazi, A. Transcriptional networks that mediate signals from reproductive tissues to influence lifespan. Genesis. 51 (1), 1-15 (2013).
  30. Ghazi, A., Henis-Korenblit, S., Kenyon, C. A transcription elongation factor that links signals from the reproductive system to lifespan extension in Caenorhabditis elegans. PLoS Genet. 5 (9), e1000639(2009).
  31. Amrit, F. R., et al. DAF-16 and TCER-1 Facilitate Adaptation to Germline Loss by Restoring Lipid Homeostasis and Repressing Reproductive Physiology in C. elegans. PLoS Genet. 12 (2), e1005788(2016).
  32. Wang, M. C., O'Rourke, E. J., Ruvkun, G. Fat metabolism links germline stem cells and longevity in C. elegans. Science. 322 (5903), 957-960 (2008).
  33. McCormick, M., Chen, K., Ramaswamy, P., Kenyon, C. New genes that extend Caenorhabditis elegans' lifespan in response to reproductive signals. Aging Cell. 11 (2), 192-202 (2012).
  34. Kartashov, A. V., Barski, A. BioWardrobe: an integrated platform for analysis of epigenomics and transcriptomics data. Genome Biol. 16, 158(2015).
  35. Goncalves, A., Tikhonov, A., Brazma, A., Kapushesky, M. A pipeline for RNA-seq data processing and quality assessment. Bioinformatics. 27 (6), 867-869 (2011).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

RNA Galaxy Project DAVID NGS Cufflinks