本方案概述了一种比较方法 从头合成 面向初学者的生物信息学研究人员的转录组组装与注释工作流程。该工作流程可通过CyVerse完全免费获取,并通过数据存储系统进行连接。本流程采用命令行和图形用户界面,但所需全部代码均可直接复制粘贴使用。
方法文章
本方案概述了一种比较方法 从头合成 面向初学者的生物信息学研究人员的转录组组装与注释工作流程。该工作流程可通过CyVerse完全免费获取,并通过数据存储系统进行连接。本流程采用命令行和图形用户界面,但所需全部代码均可直接复制粘贴使用。
该工作流程可使初级研究人员利用云计算等先进的计算资源开展成对比较转录组学分析,同时也为生物学家培养数据科学家所需的计算技能提供了入门指导。 例如 执行 bash 命令、大规模数据集的可视化与管理。所有命令行代码以及每个命令或步骤的进一步说明均可在 wiki 上找到https://wiki.cyverse.org/wiki/x/dgGtAQ)。Discovery Environment 平台与 Atmosphere 平台通过 CyVerse 数据存储系统相互连接。因此,一旦原始测序数据上传完成,便无需再通过互联网传输大型数据文件,从而最大限度地减少了开展分析所需的时间。本实验方案仅适用于分析两种实验处理或条件。差异基因表达分析通过成对比较进行,不适合用于检验多个因素。该工作流程设计为手动操作而非自动化流程。用户必须亲自执行并检查每一步操作,从而更深入地理解数据和分析结果,进而获得更优的分析成效。完成本方案后,将获得 从头合成 为缺乏研究资源的非模式生物组装转录组,无需比对到先前已组装的参考基因组(此类参考基因组在缺乏研究资源的生物中通常不可获得)。这些 从头合成 转录组进一步用于成对差异基因表达分析,以研究两种实验条件下存在差异的基因。随后对差异表达基因进行功能注释,以理解生物体对实验条件产生的遗传响应。总体而言,本方案所获得的数据可用于检验有关非模式生物生物学响应的假设。
Homo sapiens 以及若干关键的模式动物物种,例如 Drosophila melanogaster、Mus musculus 和 Danio rerio,代表了当前及以往功能基因组学研究的主体。然而,随着高通量测序技术成本的迅速降低,非模式(又称"被忽视的"或"研究不足的")动物物种的功能基因组学研究正迎来新的机遇1。这一转变在基因组学领域具有重要意义,因为非模式生物常常代表具有重要经济价值的物种(例如牡蛎、虾、蟹),并为探索超出模式物种范围的新表型和生物系统提供了可能。
尽管非模式生物为研究独特的生物系统提供了极具吸引力的机会,但研究人员在进行生物信息学分析时仍面临诸多挑战。其中一些挑战源于大规模数据集处理本身固有的困难,而另一些则来自于研究人员可利用的遗传资源匮乏,例如参考基因组、物种特异的本体数据库等(etc.)。与数据分析的复杂性相比,核酸提取与测序操作通常属于常规流程;因此,生物信息学分析往往是测序项目中最被低估的成本2。例如,一项基础的高通量测序生物信息学分析可能包括以下步骤:原始测序读段的质量过滤与修剪、将短读段拼接为更长的连续序列(contigs),以及通过注释和/或与其他系统进行比较以获得生物学意义。尽管这一工作流程看似简单,但它所需的专业知识和计算资源通常远超普通实验室台式计算机的能力范围,从而使许多从事非模式生物研究的科研人员难以开展此类分析。
先天性挑战可能源于基础设施或知识方面的不足。典型的基础设施挑战是无法获得适当的计算资源。例如,基因组组装和注释依赖于计算密集型算法,需要配备大容量内存(256 GB–1 TB)和多个处理器/核心的高性能计算机或计算机集群才能运行。遗憾的是,许多研究人员要么无法获得此类计算资源,要么缺乏操作这些系统所需的知识。另一些研究人员可能通过其大学或机构能够访问高性能计算集群,但对这些资源的访问可能受到限制,有时还会按计算时长收费,即 CPU处理器数量乘以这些处理器实际运行的"时钟小时"数。利用由美国国家科学基金会资助的网络基础设施系统(例如CyVerse3),可为美国及全球研究人员免费提供计算资源,有助于缓解基础设施方面的挑战,本文将对此进行演示。
典型的基于知识的挑战之一是理解完成完整分析所需的软件。为了有效开展基于测序的研究项目,研究人员需要熟悉为生物信息学分析而开发的大量软件工具。学习每一个软件包本身已属不易,而由于这些软件包不断升级、重新发布、整合为新的工作流程,有时还因新许可证的限制而无法自由使用,这一难度进一步加剧。此外,连接这些工具的输入与输出有时需要转换数据类型以确保兼容性,从而不得不在工作流程中额外引入其他工具。最后,确定哪种软件包在特定分析中“最优”也十分困难,通常在特定实验条件下选择最佳软件依赖于细微的差异。在某些情况下,虽然已有对软件的有用综述,但由于新版本和新软件选项持续发布,这些综述很快就会过时。
对于研究非模式生物的研究人员而言,这些固有挑战还叠加了分析新型生物数据所带来的困难。这些针对非模式生物的特有挑战在基因注释过程中表现得尤为突出。例如,非模式生物通常缺乏亲缘关系较近的模式生物,因而难以合理地用于鉴定基因的直系同源关系及其功能例如 海洋无脊椎动物和 果蝇)。许多生物信息学工具还要求 "训练" 用于识别可指示基因功能的结构基序。然而,训练数据通常仅适用于模式生物,且训练隐马尔可夫模型(HMMs)超出了生物学家甚至许多生物信息学研究人员的能力范围。最后,即使能够利用模式生物的数据进行注释,当考虑到非模式生物的生物学特性与自然史时,某些与模式生物相关的基因本体术语也不再适用(例如,将信息从 果蝇 对虾
鉴于这些挑战,需要开发供研究人员使用的生物信息学资源 从头合成 特别针对非模式生物的功能基因组测序项目。未来几年的功能基因组测序计划将有助于缩小模式生物与非模式生物之间的差距(https://genome10k.soe.ucsc.edu/),但仍需开发大量工具以应对上述挑战。CyVerse 致力于构建互操作性生态系统,通过连接现有的网络基础设施和第三方应用程序,为生命科学家提供数据管理、生物信息学分析工具和数据可视化服务。互操作性通过提供可扩展的计算资源,减少生物信息学应用与平台之间的文件格式转换以及跨平台数据传输量,从而简化各应用与平台间的过渡流程。CyVerse 提供多个平台,包括发现环境(Discovery Environment, DE)4,大气5,以及数据存储3. DE 是基于网络的平台,将许多常用的生物信息学分析工具转换为用户友好的点击式操作格式(称为 "应用程序"),是数据存储库(Data Store)的图形用户界面(GUI),用于管理大型数据集(即 原始测序数据、组装基因组)的存储与管理。Atmosphere 是一种云计算服务,为研究人员提供使用虚拟机计算资源的更高灵活性,其预装了多种生物信息学工具。这两个平台均与数据存储库(Data Store)相连接,可结合使用以构建如本文所述的工作流程。本报告重点介绍一种 从头合成 转录组组装与差异基因表达分析的工作流程,并进一步探讨了开展生物信息学分析时相关的一些最佳实践。对CyVerse更广泛使命的说明http://www.cyverse.org/about) 以及详细的平台描述(http://www.cyverse.org/learning-center)均公开可获取。本文所述的所有分析均使用 Discovery Environment 进行4 (DE)与大气5,并以适合所有计算水平研究人员理解的方式进行呈现。DE工作流程和Atmosphere镜像可通过URL直接引用,以确保其长期可追溯性、可重用性和可重复性。
注意:整个实验方案的编号将根据步骤1.2中创建并命名的文件夹进行。图1 和 2)。本方案代表了一种标准的比较方法 从头合成 转录组分析,此处详述的每一步骤并非对所有研究人员都必要。该工作流程在配套的教学维基中有详细记录,其中还包含所有附加文件及相关的文档链接3rd 各分析软件包的开发人员表1)。本方案中将包含指向该资料的链接,以便用户轻松访问相关信息。最佳实践是以注释形式在方案中向用户提供完成任务的最佳方法建议或注意事项。示例数据输入及分析结果文件夹已向用户公开提供,并按照本方案中的建议方式进行组织(从头合成 转录组组装与分析
1. 建立项目、上传原始测序读段并使用 FastQC 评估读段质量

图1:De Novo 转录组组装与分析工作流程及项目文件夹组织的总体概述。用户需将原始测序读段上传至数据存储区的主项目文件夹中,然后将每一步骤的结果分别存入不同的文件夹。请点击此处查看该图的放大版本。

图 2:在 CyVerse 网络基础设施内进行的从头转录组组装与分析工作流程的详细概述。整个组装与分析工作流程将分为五个步骤完成,每个步骤对应一个独立文件夹(加粗并编号的文件夹图标)。这五个编号的工作流程步骤文件夹各自包含生物信息学分析结果的子文件夹(文件夹图标)。分析的输入数据来自某一子文件夹,经分析程序处理后生成输出数据,并移至另一个文件夹(矩形框)。前三个步骤的最终数据将被比较并整理,以备发表。最终,该方案生成一个主项目文件夹,使合作者和/或论文审稿人能够快速理解工作流程,并在必要时通过各个文件重复该流程。请点击此处查看此图的放大版本。
2. 修剪并质控过滤原始读段以获得高质量序列
注意:使用 Trimmomatic 应用程序或 Sickle 应用程序。
3. 从头合成 使用 Trinity 在 Atmosphere 中进行转录组组装
4. 在差异表达分析中使用 DESeq2 进行成对差异表达
5. 使用 Trinotate 进行注释
项目组织文件创建完成后(图1 和 2),该工作流程的首要任务是评估原始测序文件,然后通过截短(trimming)和质量过滤对其进行清洗。FastQC 将生成关于 FASTQ 文件格式中序列质量得分和长度的人类可读摘要统计信息。随后比较截短前后的 FastQC 图表,以评估最终的测序读段(reads)是否为高质量,从而适合用于拼接(assemble)。“每个碱基的序列质量”(Per base sequence quality)显示了测序中每个碱基位置上读段的平均质量。在 FastQC 图表中,Phred 质量得分最好高于 20–28,该范围由颜色指示。“每个序列的质量得分”(Per sequence quality score)用于判断是否需要对读段进行质量过滤。如果大量读段的平均得分低于 20–25,则可能需要基于平均读段质量进行过滤。“每个碱基的序列组成”(Per base sequence content)应显示四种核苷酸碱基的均匀分布。若显示核苷酸组成存在偏差,则可能需要对末端进行截短处理。“每个碱基的 GC 含量”(Per base GC content)也应在所有位置上保持均匀。若出现波动,则可能需要按照 1.4.4.3 中的方法对读段进行截短。“每个序列的 GC 含量”(Per sequence GC content)应呈正态分布。接头(Adapter)或聚合酶链式反应(PCR)产物可能污染测序文库,导致正态分布偏移。在此情况下,可能需要进行接头截短。“序列长度分布”(Sequence length distribution)提供所有读段的平均长度。通常会过滤掉长度小于 35–45 个碱基对的读段。“序列重复水平”(Sequence duplication levels)显示特定读段序列在文库中出现的频率。高度重复的读段序列及其数量将在“过表达序列”(Overrepresented sequences)部分中列出。FastQC 还会尝试识别这些重复读段是否为接头序列,或与测序平台相关的其他已知序列。“无匹配”(No Hit)标签表示该序列应进一步使用 NCBI BLAST6 进行分析,以确定其是否为具有生物学意义的序列,或是否应予以去除。DE 平台也提供多个版本的 BLAST 工具。DE 的 BLASTn 应用程序地址为:https://de.iplantcollaborative.org/de/?type=apps&app-id=6f94cc92-6d28-45c6-aef1-036be697671d。
在对原始测序数据进行筛选以获得高质量的测序读段后,需要将这些读段进行拼接,以生成连续的序列(contigs)。简而言之,拼接过程是通过比对所有短序列读段,寻找其中的相似序列来实现的。当相似序列区域的长度超过某一特定阈值时,即被视为同一序列,因为随机出现如此长度的相似序列的概率几乎为零。Trinity 将输出拼接过程中每一步的日志文件和 fasta 文件。然而,最重要的输出是包含 contigs 的最终拼接文件,该文件被命名为“Trinity.fasta”,位于主文件夹中。该文件包含了所有拼接得到的 contigs,其本身并不具备实际意义上的“可读性”。因此,可以使用 rnaQUAST 工具对拼接结果进行更深入的理解。rnaQUAST 工具将生成一系列图表,帮助用户比较不同拼接结果,以判断其完整性(图 4)。有关 rnaQUAST 输出的每张图表的更多详细信息,可参见其 wiki 页面(https://wiki.cyverse.org/wiki/x/fwuEAQ)。如果运行了 BUSCO7,则需特别关注 specificity.txt 文件,该文件显示了完整和部分 BUSCO 基因的数量,以及 GeneMarkS-T 基因预测的数量。BUSCO 基因是一组经过审编的、在某一类生物中普遍存在的基因集合,可用于评估拼接结果在多大程度上捕获了预期存在于特定生物类群中的基因集合,其评估依据为系统发育分支。此外,CyVerse 数据环境(DE)中也提供独立的 BUSCO 应用程序(https://de.iplantcollaborative.org/de/?type=apps&app-id=112b8a52-efd8-11e5-a15c-277125fcb1b1)。
差异基因表达分析可识别在不同处理条件下表达模式存在差异的转录本,其数据来源于每个组装转录本的简单计数表。DESeq2 使用广义线性模型(GLM)来确定相对于标准化均值的变异。建议实验设置重复样本,以便 DESeq2 算法能够对测序过程中的技术变异进行标准化。DESeq2 差异表达基因(DEG)分析将生成图表以及一个 .html 报告文件,其中包含所有输出图表及相应说明。或者,也可使用 EdgeR 替代 DESeq2,此时将生成相同的 .html 报告文件,但其中的可视化图表由 EdgeR 生成。研究人员可根据需要同时运行 DESeq2 和 EdgeR,以筛选在特定实验中被两种算法共同识别出的差异表达基因。Trinotate 将生成一个输出的 .xls 文件,可在任意电子表格软件中打开。这些差异表达基因的 .txt 文件和注释用的 .xls 文件可在 CyVerse 平台之外的多种下游分析与可视化应用中进一步处理。

图 3:原始测序读段、修剪后读段及最终修剪和过滤后读段的 FastQC 报告。 对每个预处理步骤后的测序读段进行系统性比较。高质量的读段对于从头(de novo)转录组组装至关重要。FastQC 可帮助研究人员了解测序数据的初始质量,并追踪读段预处理的效率。FastQC 的结果取决于正在测序的生物体和样本,但在所有后续比较分析所用样本中保持一致性是读段预处理的主要目标。FastQC 的作者和开发者提供了教程视频和相关文档。请点击此处查看该图的高清版本。

图 4:三个独立组装结果的 rnaQUAST 报告。rnaQUAST 可用于比较使用相同组装软件的多个测序读段组装结果,或使用相同初始读段的多个不同组装软件的结果。rnaQUAST 利用 BUSCO,基于分类群中已知的核心基因生成有关组装结果的汇总统计信息。每条转录本的错配数量以及与经典基因匹配的转录本比例(即匹配比例)可反映组装工具的准确性。此处展示的最后四个子图提供了关于重叠群(contig)和异构体长度以及预期异构体覆盖情况的汇总统计数据。NAx 表示长度超过纵坐标(bp)的重叠群所占百分比(x)。组装比例定义为最长单一组装转录本与其全长的比值。覆盖比例表示根据 BUSCO 提供的核心原核或真核基因所预期的完整组装转录本/异构体所占的百分比。所有由 rnaQUAST 生成图形的详细说明可在此获取(https://wiki.cyverse.org/wiki/x/fwuEAQ)。请点击此处查看该图的放大版本。
| 应用程序名称 | CyVerse 平台 | 第三方文档 | CyVerse 文档 | 样本数据集的预计运行时间 | 链接到应用程序 |
| FastQC | DE | http://www.bioinformatics. babraham.ac.uk/projects/fastqc/ https://www.youtube.com/watch?v=bz93ReOv87Y | https://wiki.cyverse.org/wiki/pages/viewpage.action?pageId=9316768 | 15 分钟 | https://de.iplantcollaborative. org/de/?type=apps&app-id=112b9aa8-c4a7-11e5-8209- 5f3310948295 |
| Trimmomatic v0.33 | 德国 | https://github.com/timflutre/trimmomatic | https://wiki.cyverse.org/wiki/display/DEapps/Trimmomatic-programmable-0.33 | 30 分钟 | https://de.iplantcollaborative. org/de/?type=apps&app-id=9c2a30dc-028d 11e6-a915-ab4311791e69 |
| 镰状 | 德国 | https://github.com/najoshi/sickle | https://wiki.cyverse.org/wiki/display/DEapps/Sickle-基于质量的修剪 | 30 分钟 | https://de.iplantcollaborative. org/de/?type=apps&app-id=68b278f8-d4d6-414d-9a64-b685a7714f7c |
| Trinity | 大气 | https://github.com/trinityrnaseq/trinityrnaseq/wiki | https://pods.iplantcollaborative. org/wiki/display/atmman/Trinity - Trinotate Atmosphere 镜像 | 1 周 | https://atmo.iplantcollaborative. org/application/images/1261 |
| 德国 | https://wiki.cyverse.org/wiki/display/DEapps/Trinity-64GB-2.1.1 | 2-5 天 | https://wiki.cyverse.org/wiki/display/DEapps/Trinity-64GB-2.1.1 | ||
| rnaQUAST v1.2.0 | DE,大气 | http://spades.bioinf.spbau.ru/rnaquast/release1.2.0/manual.html | https://pods.iplantcollaborative. org/wiki/display/TUT/rnaQUAST 1.2.0(基于denovo)使用DE | 30 分钟 | https://de.iplantcollaborative. org/de/?type=apps&app-id=980dd11a-1666 11e6-9122-930 ba8f23352 |
| TransDecoder | 德国 | https://transdecoder.github.io | https://wiki.cyverse.org/wiki/display/DEapps/转录解码器 2.0 | 2-3 小时 | https://de.iplantcollaborative. org/de/?type=apps&app-id=5a0ba87e-b0fa-4994-92a2- 0d48ee881179 |
| DESeq2 | 德国 | https://bioconductor.org/packages/release/bioc/html/DESeq2.html | https://pods.iplantcollaborative. org/wiki/pages/viewpage.action?pageId=28115142 | 2-3 小时 | https://de.iplantcollaborative. org/de/?type=apps&app-id=9574e87c-4f90- 11e6-a594-008 cfa5ae621 |
| EdgeR | 德国 | https://bioconductor.org/packages/release/bioc/vignettes/edgeR/inst/doc/edgeR.pdf | https://wiki.cyverse.org/wiki/pages/viewpage.action?pageId=28115144 | 2-3 小时 | https://de.iplantcollaborative. org/de/?type=apps&app-id=4a08ceda-54fe 11e6-862f-008 cfa5ae621 |
| Trinotate | 大气 | https://trinotate.github.io/ | https://pods.iplantcollaborative. org/wiki/display/atmman/Trinity+-+Trinotate+Atmosphere+Image | 1 周 | https://atmo.iplantcollaborative. org/application/images/1261 |
表1:分析程序、可用平台以及按首次出现顺序列出的工作流程相关附加资源。 所有软件包版本均截至2016年4月。
本实验方案中有五个关键步骤,每个步骤将在主项目文件夹内创建一个独立的子文件夹(图1 和 图2)。所有原始测序数据均为不可更改的原始资料:应将其上传并保存在标记为 "1_Raw_Sequence" 的第一个文件夹中,且不得以任何方式修改。数据可通过以下三种方式之一上传:可通过 Discovery Environment(DE)界面直接上传文件,这是最简便的上传方式,但数据传输耗时最长;Cyberduck 提供图形化界面,允许用户通过拖放文件的方式向 DE 传输数据;iCommands 是一种命令行工具,可用于在本地与 Data Store 之间传输数据、创建目录以及管理数据集,通常是传输数据文件最快的方式。Data Store 中的所有数据均可与其他 CyVerse 用户共享(https://wiki.cyverse.org/wiki/display/DEmanual/Sharing+Data+Files+and+Folders+Via+the+Discovery+Environment),也可通过生成的 URL 设为公开访问(https://wiki.cyverse.org/wiki/display/DEmanual/Sharing+Data+Files+Via+Public+Links),或作为公开且匿名(无需用户名)的社区数据进行托管(http://data.iplantcollaborative.org;http://mirrors.cyverse.org)。在该文件夹内,原始序列读段将使用 FastQC(http://www.bioinformatics.bbsrc.ac.uk/projects/fastqc/)进行分析,以评估如何修剪和过滤读段,从而获得高质量的读段数据。在完成修剪和质量过滤后,建议比较 FastQC 的输出结果,以判断读段质量是否有所改善,同时确保未丢失重要信息(图3)。需注意,FastQC 的横坐标并非线性,而是对多个输出图进行了分箱处理,这可能导致结果被误读。经过修剪和过滤后的读段将用于在 Atmosphere 云计算实例上进行 de novo 转录组组装。该云计算机使用本地计算机的屏幕、键盘和鼠标,但拥有独立的软件(Trinity 和 Trinotate)和硬件配置。在云计算机实例上运行程序不会对本地计算机造成任何影响。De novo 组装及其后续注释很可能是本工作流程中耗时最长的两个步骤。因此,这些步骤在 Atmosphere 上完成,以避免因实验室共用计算机可能出现的断电、深夜自动更新后的重启或其他用户操作导致的程序中断等问题。Trinotate 注释使用了 BLAST+8、HMMER9、tmHMM10 和 PFAM11。注释的最终输出结果为一个 SQLite 数据库和一个 .xls 文件。这些输出结果可在 CyVerse 之外的下游分析平台(如 KEGG12,13)中使用。
该工作流程可直接在DE和Atmosphere中使用,无需花费时间安装、配置和调试每个分析软件包及其所需的各种依赖项。这简化了研究人员的分析过程,最大限度地减少了重复劳动,并降低了众多科研人员的使用门槛。该工作流程专门用于组装来自Illumina测序平台的单端或双端测序读长,但DE和Atmosphere中也提供了多种工具以支持其他类型的测序技术。此工作流程中的工具可轻松替换为相应的替代工具,以处理任意类型的输入测序数据。对于分析工具的新版本或全新的工具,同样适用此替换原则。
该工作流程专门设计用于每次仅组装、比较和注释少数几个转录组。因此,用户在为比较群体遗传学研究组装多个转录组时,可能会发现此过程耗时较长。面向群体遗传学用户的分析流程将在不久的将来上线,相关链接可在维基页面 ( https://wiki.cyverse.org/wiki/x/dgGtAQ) 上找到。差异基因表达分析步骤可处理重复样本,但其为成对比较,无法准确评估多个因素(例如,随时间变化的条件、超过两种的处理方式)。对于具有参考基因组的生物体,已有自动化工作流程可用(例如,TRAPLINE14)。尽管自动化工作流程对初学者而言最容易使用,但从头组装仍需对本文所述的每一步骤进行评估和考量。此外,用户必须按照既定结构使用自动化流程,因此其本身在灵活性上受限,难以满足用户不断变化的需求。
由于本方案的大部分操作均通过互联网进行,用户可能会遇到浏览器设置相关的问题。首先,弹出窗口拦截器可能会阻止窗口打开,或需在浏览器中授予 CyVerse 权限后才能打开窗口。Atmosphere 使用 VNC 访问远程桌面,但也可使用其他软件。本方案全程在 Firefox 版本 45.0.2 中完成,应可在所有主流互联网浏览器中正常运行,但可能出现某些不一致情况。随着 Trinity 发布新版本,该工作流程将进行更新(https://github.com/trinityrnaseq/trinityrnaseq/wiki)。有关该工作流程的最新版本和最新信息,请参见维基教程页面(表 1,https://wiki.cyverse.org/wiki/x/dgGtAQ)。用户可直接联系技术支持,或在 Ask CyVerse(ask.cyverse.org/)上提交问题,以解决工作流程中的任何问题。
在发现环境(DE)中,存在多个应用程序可用于完成本方案的各个步骤。例如,用户可能希望使用 Scythe(https://github.com/najoshi/sickle)替代 Trimmomatic15 进行测序读段修剪,或使用 EdgeR16 替代 DESeq17,18。尽管这些内容超出了本文的范围,但用户可以复制、编辑并发布 DE 应用程序(https://wiki.cyverse.org/wiki/display/DEmanual/Creating,+Copying,+and+Editing+DE+Apps),或添加新的应用程序(https://wiki.cyverse.org/wiki/display/DEmanual/Dockerizing+Your+Tools+for+the+CyVerse+Discovery+Environment)。此外,Atmosphere 镜像也可被修改并重新生成,以创建更符合用户特定需求的新工作流程或改进型工作流程(https://wiki.cyverse.org/wiki/x/TwHX)。本研究旨在介绍如何利用命令行移动数据并执行分析。用户可进一步考虑使用更高级的命令行资源,例如 CyVerse 应用编程接口(API)(http://www.cyverse.org/science-apis),或设计自定义的 DE 应用程序,后者需要掌握分析工具在命令行中的运行方式(https://wiki.cyverse.org/wiki/display/DEmanual/Creating+a+New+App+Interface)。
作者无任何利益冲突需要披露。
作者感谢美国农业部-国家食品与农业研究所(USDA-NIFA)资助项目 2013-00984、美国国家科学基金会(NSF)资助项目 IOS - 1339156、IOS - 1444490 以及 CyVerse(NSF:DBI - 1265383)提供的经费支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Trimmomatic v0.33 | USADELLAB.org | https://github.com/timflutre/trimmomatic | https://de.iplantcollaborative.org/de/?type=apps&app-id=9c2a30dc-028d-11e6-a915-ab4311791e69 |
| Sickle | Joshi 和 Fass | https://github.com/najoshi/sickle | https://de.iplantcollaborative.org/de/?type=apps&app-id=68b278f8-d4d6-414d-9a64-b685a7714f7c |
| Trinity | 布罗德研究所和耶路撒冷希伯来大学 | https://github.com/trinityrnaseq/trinityrnaseq/wiki | https://atmo.iplantcollaborative.org/application/images/1261 |
| rnaQUAST v1.2.0 | 俄罗斯科学院圣彼得堡学术大学算法生物学实验室 | http://spades.bioinf.spbau.ru/rnaquast/release1.2.0/manual.html | https://de.iplantcollaborative.org /de/?type=apps&app- id=980dd11a-1666-11e6-9122- 930ba8f23352 |
| Transdecoder | 布罗德研究所和英联邦科学与工业研究组织 | https://transdecoder.github.io | https://de.iplantcollaborative.org/de/?type=apps&app-id=5a0ba87e-b0fa-4994-92a2-0d48ee881179 |
| EdgeR | Robinson 等,2010 年 | https://bioconductor.org/packages/release/bioc/vignettes/edgeR/inst/doc/edgeR.pdf | https://de.iplantcollaborative.org/de/?type=apps&app-id=5aa9e294-6f95-42f9-98e9-c9c96b44f499 |
| Trinotate | 布罗德研究所和耶路撒冷希伯来大学 | https://trinotate.github.io/ | https://atmo.iplantcollaborative.org/application/images/1261 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可