April 8th, 2017
银河和大卫已经成为流行的工具,让没有生物信息学培训调查分析和解释RNA-Seq的数据。我们描述了一种协议,用于秀丽隐杆线虫的研究人员进行RNA测序实验,访问和使用银河处理数据集,并获得从使用DAVID的基因列表有意义的生物信息。
该协议的总体目标是帮助没有生物信息学专业知识的秀丽隐杆线虫研究人员进行 RNA 测序实验并使用开放访问平台 Galaxy 分析数据。该方法可以帮助分析复杂高 through put 测序数据,以深入了解秀丽隐杆线虫表型背后的转录组特征。这项技术的主要优点是,它使之前没有接受过生物信息学培训的科学家能够分析原始测序数据并生成差异表达基因列表,以及它们相关的基因本体术语。
虽然这种方法专门针对秀丽隐杆线虫测序数据的细微差别,但它也可以应用于需要检查基因组关键转录变化的其他生物体和生物环境。此视频介绍了 Galaxy 管道的基于 Web 的使用。如果可行,请在本地运行工作流。
根据 wiki 页面上的说明下载并安装 Galaxy。使用 Galaxy 主页上提供的从这里开始教程后,请观看此视频。用户熟悉并适应 Galaxy 用户界面和工作流程中使用的工具至关重要。
首先,单击标题面板中的 analyze data 以访问分析主视图。右上角的进度条监视已使用的磁盘空间量。接下来,访问左侧面板上的工具菜单,然后单击 NGS RNA 分析。
这提供了使用 RNA 序列数据分析所需的所有工具的选项。现在,开始新的分析历史记录。转到右侧的历史记录面板。
单击齿轮图标,然后从弹出菜单中选择 create new 选项。然后,在 history (历史记录) 下提供一个名称以标识分析。要继续,请转到 工具 菜单,然后在 获取数据 下,单击 上传文件 功能以上传原始快速队列文件。
在分析界面中打开任务后,单击 Choose local file(选择本地文件),或选择 FTP file(FTP 文件)以导航到并选择适当的序列数据。默认情况下,Galaxy 会自动检测文件类型。然后从下拉菜单中选择生物体,在本例中为 C.elegans。
接下来,单击 start 开始以启动数据上传。上传文件后,该作将保存在历史记录面板中,从中可以选择和访问数据。现在,通过访问 NGS QC 和作菜单,选择快速队列整理器,在文件下选择要整理的文件,一次将一个文件从快速队列格式转换为快速队列桑格格式。
选择适当的输入快速相等分数类型,然后使用默认参数运行该工具。现在可以分析数据文件。请特别注意整个协议中使用的文件格式和测试参数。
此知识对于排查失败的测试和其他问题非常有价值。在继续之前,可以使用质量控制测试。文本协议中提供了有关运行它们的详细信息。
准备好分析文件后,首先打开 NGS RNA 分析部分,然后单击顶帽工具,以绘制测序数据。从下拉菜单中,填写以下问题的答案:这是单个还是成对的结束数据?接下来,选择适当的快速队列文件。
在下一个下拉菜单中选择 use a built in genome (使用内置基因组),然后选择参考秀丽隐杆线虫基因组数据。为所有其他参数选项选择 default,然后单击 execute。要估计数据集中转录本的相对丰度,请在 NGS RNA 分析部分选择袖带链接工具,然后从第一个下拉菜单中选择从顶帽分析中获得的映射的接受命中 bam 格式文件。
从第二个下拉菜单中,将参考注释设置为包含当前基因组数据的 GTF 文件。当显示 perform bias correction (执行偏差校正) 选项时,选择 yes (是) 并使用默认设置运行任务。接下来,从 NGS RNA 分析菜单中打开袖带合并工具,以合并为所有 RNA 序列样品生成的组装转录本。
该工具中的第一个框将加载在上一步中使用袖口链接生成的所有 GTF 文件。现在,为测试的每个菌株或条件选择组装的转录本文件,包括相同菌株条件的生物学重复。为用户参考注释选择 yes,然后选择参考基因组数据文件。
接下来,为 use sequence data 选项选择 yes。这将自动检测并选择合适的参考基因组。将所有其他参数保留为默认设置,然后单击 execute。
将生成单个 GTF 文件。要比较多个菌株或条件,请返回 NGS RNA 分析部分并选择袖带 div 工具。然后,从 cuff div 工具的转录文本菜单中选择 cuff merge 中的合并输出文件。
然后为这两个条件输入标签。对于每个条件,转到 Duplicatetes(重复),然后从 Top hat 中选择与该条件的不同生物学重复相对应的单个接受的 hits 输出文件。要同时选择多个文件,请按住 Command 或 Control 键。
选择文件后,使用默认参数设置并单击 execute 以运行任务。通过单击历史记录面板中生成的基因差异检测框中的保存图标来下载差异表达数据。首先,从网站访问 David。
从网页的标题中,选择 Start analysis (开始分析)。将从 Galaxy 获得的基因列表复制到框 A 中,在本例中选择基因标识符作为蠕虫碱基基因 ID。然后在问题 3 的列表类型下选择基因列表并单击提交列表图标。现在,分析向导主页将打开,可以从中选择 David 任务。
此视频片段介绍了其中的一些选项。首先,选择 functional annotation clustering (功能注释集群) 以转到摘要页面。将 annotation 类别保留为默认设置,然后单击 functional annotation clustering。
此选项会生成按其扩充分数排名的相似注释词的群集。现在,返回分析向导,并选择功能注释图选项,以识别与基因列表相关的明显过度表达的生物学术语。一个有价值的 David 功能是制作功能注释表的选项。
这列出了与基因相关的所有注释,但没有显示任何统计计算。这对于逐个基因分析和查找感兴趣的特定基因非常有用。另一个有用的 David 工具是基因功能分类。
此选项将基因分离到功能相关的组列表中,这些组按其富集分数排序。所描述的方案用于鉴定种系丢失后表达受 tcer-1 调节的基因。将长寿命种系列表 glp-1 突变体的转录组与我们的种系列表但没有表现出寿命延长的 tcer-1 glp-1 双突变体进行了比较。
对序列进行质量检查,没有质量差的读数,GC 含量为 48% 至 49%,并且序列读数长度恒定为 51 个碱基对。样本的基因组覆盖率估计在 7 到 11 倍之间。Galaxy 能够将每个菌株的两个重复的 NGS 数据进行组合,并进行差异分析以生成突出显示全基因组表达谱的基因列表。
总体而言,使用 0.05 的 P 值截留,两个菌株之间有 835 个基因差异表达。上调基因的功能注释分析揭示了四个具有高富集分数的注释簇。最高的包括细胞色素 P450 和外源性反应基因,其次是与脂质修饰有关的基因。
下调目标的功能注释聚类也确定了各种注释集群。这些包括富含细胞骨架功能的簇,生长、繁殖和衰老的正调节。Galaxy 管道为广泛生物学科的研究人员铺平了道路,以快速有效地分析大规模基因表达变化。
观看此视频后,您应该能够进行 RNA 搜索实验,并使用 Galaxy 管道通过 put 测序数据分析原始高。您还应该能够使用 David 平台从 Galaxy 数据中提取生物学相关信息。
View the full transcript and gain access to thousands of scientific videos
本协议协助秀丽隐杆线虫研究者进行RNA测序实验并使用Galaxy平台分析数据。它使没有生物信息学培训的人能够有效解释复杂的测序数据。
Accessible transcriptomic analysis platforms like Galaxy enable discovery teams to interrogate gene expression changes without requiring deep bioinformatics expertise, accelerating early-stage target validation and mechanistic de-risking. By streamlining RNA-Seq data processing and functional annotation, this workflow supports rapid hypothesis testing and portfolio triage in model systems such as C. elegans. The approach enhances reproducibility and scalability for both novice and experienced R&D teams handling small-scale transcriptomic studies.
This workflow positions RNA-Seq analysis from raw data through differential expression and functional annotation within the early discovery to preclinical continuum, supporting both target validation and mechanistic studies.