2017年5月9日
该协议概述了生物信息学新手的比较从头转录组组装和注释工作流程。该工作流完全通过 CyVerse 免费提供,并通过 Data Store 连接。使用命令行和图形用户界面,但所需的所有代码都可供复制和粘贴。
该程序的总体目标是从原始 FASTQ 文件开始,通过 De Novo 转录组学评估、组装、注释和比较差异基因表达。这种方法可以帮助回答比较生物学和分子生物学中的问题,包括哪些转录本在生物体内,这些转录本在这些生物体内做什么,以及实验条件之间的差异。这种技术的主要优点是它提供了一个交互式环境。
它提供按需计算资源,并允许研究人员立即开始分析他们的 RNA-Seq 数据。这种方法对于研究人员比较涉及多个组织、条件、时间点的单个生物体内的实验以了解生物系统如何变化特别有用。这种方法侧重于没有基因组的非模式生物,但也可以应用于具有基因组组装的生物,甚至是那些组装中有数万或数十万个支架的生物。
首先,在 Discovery Environment 中访问 Atmosphere。导航到注册页面,申请免费的 CyVerse 账户。使用机构电子邮件注册账户。
接下来,导航到 apps and services 选项卡并请求访问 Atmosphere。将自动授予对 Discovery Environment 的访问权限。登录到 Discovery Environment,缩写为 DE。然后,选择 Data 选项卡以显示包含数据存储中所有文件夹的菜单。
创建一个主项目文件夹,该文件夹将包含与项目关联的所有数据。找到数据窗口顶部的工具栏,然后选择 File (文件)、New Folder (新建文件夹)。请勿在文件夹名称或任何输入输出文件名中使用空格或特殊字符。
相反,请在适当的情况下使用下划线或破折号。将原始 FASTQ 序列文件和文件夹 1_Raw_Sequence 上传到名为 Folder A_Raw_Reads 的子文件夹中。对于小于 2 Gb 的文件,使用数据存储的简单上传功能,通过单击主 DE 桌面中的 Data 按钮导航到数据窗口工具栏。
依次选择 Upload (上传)、Simple Upload from desktop (从桌面简单上传)。然后,选择 Browse (浏览) 按钮以导航到本地计算机上的原始 FASTQ 排序文件。使用 DE 中的 FastQC 应用程序评估上传的原始测序读数。选择 DE 主桌面上的 Apps 按钮,打开一个窗口,其中包含 DE 中可用的所有分析应用程序。在窗口顶部的搜索工具栏中搜索 FastQC 工具。
如果有多个 FASTQ 文件,请打开多文件版本。选择 文件 并创建一个新文件夹,然后选择此文件夹作为输出文件夹。将 FASTQ 读取文件加载到名为 Select Input Data 的工具窗口中,然后选择 Launch Analysis (启动分析)。
在 DE 中搜索可编程 Trimmomatic 应用程序并打开它。将原始 FASTQ 读取文件的文件夹上传到设置部分。选择排序文件是单端还是双端。
使用通过选择 Browse 按钮并将文件路径粘贴到查看框中提供的标准控制文件。选择 Trimmomatic 控制文件并启动分析。对于高质量的修剪序列读取,请在 DE 中搜索并打开 Sickle 应用程序。选择修剪的 FASTQ 读取作为输入读取并重命名输出文件。
在选项中包括质量设置。导航到 Wiki 页面,打开最新版本的 Atmosphere 实例。选择最新版本的 Trinity 和 Trinotate 图像的链接。
选择 Login To Launch 按钮,然后为 Atmosphere 实例命名。选择 medium3 或 large3 的实例大小。启动实例并等待其构建。
如果 Atmosphere 映像无法启动,您可以尝试申请较小的实例,也可以申请 Jetstream 以获得更大的分配。所有详细信息都在配套 wiki 上。将 Trinity 输出文件移动到 DE 中的 3_Assembly 文件夹中,并将文件夹标记为 A_Trinity_de_novo_assembly。
运行 Trinity 需要命令行知识,并且需要几天或几周才能完成大型分析。Wiki 上提供了一些免费资源,这些资源有助于理解命令行。在 A_Trinity_de_novo_assembly 文件夹中为每个组装的转录组提供一个子文件夹。
使用唯一名称,包括与每个转录组相关的生物体和处理的科学名称,然后在 3_Assembly 文件夹中创建另一个名为 Folder B_rnaQUAT_Output 的子文件夹。打开名为 De Novo rnaQUAST 的应用程序。为分析命名并选择 Folder B_rnaQUAST_Output 作为输出文件夹。
在 Discovery Environment 中搜索 transcript decoder 并在 De Novo Trinity Assembly output fasta 文件上运行 transdecoder。在分析 DE.Name 中打开 deseq2 应用程序,然后选择输出文件夹作为 4_Differential_Expresssion。在输入部分中,从 Trinity 装配体运行中选择计数表文件。
此外,选择可以找到重叠群名称的列。输入 counts 数据表文件中的列标题,以确定要比较的列。在每个条件之间包含逗号。
不要包含包含 contig 名称的第一个列标题。对于仿行,请重复相同的名称。在第二行中,提供要比较的两个条件的名称。
匹配第一行中提供的列标题名称。此处显示的是每个预处理步骤后测序读数的系统比较。修剪后,读取应具有较少的偏斜 GC 内容和序列内容,并且与质量分数较高的读取相比,读取的比例更大。
高质量的 reads 是组装 De Novo 转录组所必需的。快速 QC 的结果取决于被测序的生物体和样品。通过对下游进行比较的所有样品的均匀性是预处理读数的主要目标。
rnaQUAST 利用 boost 代码根据分类进化枝中的已知核心基因生成有关组装的摘要统计数据。组装器的准确性由每个转录本的不匹配数量以及与经典基因匹配的转录本数量来揭示。此处提供的最后四个子图提供了重叠群和亚型长度的汇总统计数据,以及预期亚型的覆盖率。
NAx 表示长度大于 y 轴长度的重叠群的百分比。组装分数是最长的单个组装转录本除以其长度。其中,覆盖的分数是来自 BUSCO 的核心原核或真核基因所期望的完全组装的转录本亚型的百分比。
看完这个视频后,你应该对如何组装和输入转录组有了很好的了解。此外,该实验步骤将允许您检测两种条件之间的差异基因表达。通常,个人会为生物信息学包而苦恼,因为它们太多了,有很多与之相关的设置和变量,通常您必须了解命令行才能实际执行。
标记和组织您的数据输入和分析输出非常重要,以便其他研究人员可以了解所做的工作。您应该包括已完成的订单步骤、程序版本和样品信息。此外,请省略文件夹或文件名中的任何空格。
新工具和新版本的工具不断集成,但旧版本的工具也被保留。所有更改都将记录在配套 wiki 上。按照此程序,可以执行其他生物信息学方法,如网络分析、GO 富集和代谢途径鉴定,以帮助回答表型变异、改变表达谱的条件以及识别功能基因组学感兴趣的基因等问题。
本方案概述了一种从头转录组组装与注释的工作流程,专为生物信息学初学者设计。该流程通过CyVerse提供一个用于分析RNA-Seq数据的交互式环境。
该工作流程可帮助生物制药研发团队从非模式生物中生成高质量的转录组数据,支持在尚未充分研究的生物系统中进行靶点验证。通过提供用于从头组装和差异表达分析的交互式云环境,该方法降低了早期发现阶段机制性去风险化的障碍。该方法在研究生物体特异性对实验扰动的响应时,可提高预测的可信度,从而为项目组合的优先级排序提供依据。
该方法适用于早期发现阶段,可在先导化合物筛选之前支持假设验证和通路阐明。