一种名为miRDeep-P2(简称miRDP2)的生物信息学分析流程,采用了更新的植物miRNA标准并重构了算法,能够准确高效地分析植物中的microRNA转录组,尤其适用于基因组复杂且庞大的物种。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
方法文章
* These authors contributed equally
一种名为miRDeep-P2(简称miRDP2)的生物信息学分析流程,采用了更新的植物miRNA标准并重构了算法,能够准确高效地分析植物中的microRNA转录组,尤其适用于基因组复杂且庞大的物种。
microRNA(miRNA)是一类长度为20至24个核苷酸(nt)的内源性小RNA(sRNA),广泛存在于植物和动物中,在转录后水平上对基因表达起着重要的调控作用。过去十年中,通过高通量测序(NGS)方法对sRNA文库进行测序已被广泛用于鉴定和分析miRNA转录组,从而极大地促进了miRNA的发现。然而,随着sRNA测序文库深度的增加以及植物基因组在大小和复杂性上的提升,植物miRNA注释面临两个主要挑战。首先,许多其他类型的sRNA,特别是来自sRNA文库的短干扰RNA(siRNA),常被多种计算工具错误地注释为miRNA。其次,对于具有大而复杂基因组的植物物种,miRNA转录组的分析过程变得极为耗时。为应对这些挑战,我们近期将广泛使用的miRNA转录组分析工具miRDeep-P升级为miRDeep-P2(简称miRDP2),通过引入新的过滤策略、全面优化打分算法,并整合最新更新的植物miRNA注释标准。我们在五种基因组复杂性逐步增加的代表性植物——拟南芥、水稻、番茄、玉米和小麦的sRNA测序数据上测试了miRDP2。结果表明,miRDP2能够以极高的效率完成这些分析任务。此外,在灵敏度和准确性方面,miRDP2的表现优于其他预测工具。综上所述,我们的研究结果证明miRDP2是一种快速且准确的植物miRNA转录组分析工具,有助于科研界更精准地完成植物miRNA的注释工作。
过去二十年中,生物学领域最令人振奋的发现之一是sRNA在调控基因组多种功能方面日益凸显的作用1。其中,miRNA是真核生物中一类重要的20至24个核苷酸长度的sRNA,主要作为关键的基因调控因子,在整个生命周期的发育阶段以及对刺激和胁迫反应中发挥转录后水平的调控作用2,3。在植物中,miRNA来源于被称为pri-miRNA的初级转录本,这些转录本通常由RNA聚合酶II作为独立的转录单位进行转录4,5。pri-miRNA通过进化上保守的细胞机制(动物中为Drosha RNase III,植物中为DICER-like蛋白)进行加工,被剪切为直接的miRNA前体pre-miRNA,后者包含可形成分子内茎环结构的序列6,7。随后,pre-miRNA被进一步加工为双链中间产物,即miRNA双链体(miRNA duplex),由具有功能的成熟miRNA链和较少发挥功能的互补链miRNA*组成2,8。成熟miRNA被装载到RNA诱导的沉默复合体(RISC)后,可通过序列互补性识别其mRNA靶标,从而实现负向调控功能2,8。miRNA可通过使靶标转录本不稳定或抑制靶标翻译来发挥作用,但在植物中以前者为主8,9。
自从在秀丽线虫中偶然发现第一个miRNA以来 秀丽隐杆线虫10,11,大量研究致力于miRNA的鉴定及其功能分析,尤其是在高通量测序(NGS)技术出现之后。NGS方法的广泛应用极大地推动了计算工具的使用,这些工具旨在捕捉miRNA的独特特征,例如前体的茎环结构以及测序读段在成熟miRNA及其互补链miRNA*上的优先富集。因此,研究人员已在多种物种中成功鉴定了大量miRNA。基于先前描述的概率模型12我们开发了miRDeep-P13,这是首个用于从高通量测序(NGS)数据中发现植物miRNA的计算工具。miRDeep-P 特别针对植物miRNA前体长度变异较大以及存在大量同源基因家族等解析难题而设计13,14,15该程序发布后已被下载数千次,并用于注释超过40种植物物种的miRNA转录组16得益于基于NGS的工具(如miRDeep-P)的推动,公共miRNA数据库miRBase中注册的miRNA数量显著增加17,目前收录了超过 38,000 个 miRNA 条目(版本 22.1),而 2008 年仅收录约 500 个 miRNA 条目(版本 2.0)18.
然而,植物miRNA注释面临两个新的挑战。首先,过高的假阳性率严重影响了植物miRNA注释的质量16,19,原因如下:1)由于缺乏严格的miRNA注释标准,NGS sRNA文库中大量内源性小干扰RNA(siRNAs)被错误地注释为miRNA;2)对于缺乏先验miRNA信息的物种,基于NGS数据预测出的假阳性结果难以排除。以miRBase为例,Taylor等20发现公共数据库21(第21版)中约三分之一的植物miRNA条目缺乏令人信服的支持证据,甚至高达四分之三的植物miRNA家族存疑。其次,对具有大而复杂基因组的植物进行miRNA预测变得极为耗时16。为应对这些挑战,我们通过引入新的过滤策略、全面改进评分算法并整合植物miRNA注释的新标准,对miRDeep-P进行了升级,并发布了新版本miRDP2。此外,我们使用基因组大小逐步增加的NGS sRNA数据集对miRDP2进行了测试,包括拟南芥、水稻、番茄、玉米和小麦。与其他五种广泛使用的工具及其旧版本相比,miRDP2能够更快地解析这些sRNA数据,并以更高的准确性和灵敏度分析miRNA转录组。
miRDP2 软件包的内容
miRDP2 软件包包含六个有文档说明的 Perl 脚本,应由准备好的 bash 脚本按顺序运行。这六个脚本中有三个(convert_bowtie_to_blast.pl、filter_alignments.pl 和 excise_candidate.pl)继承自 miRDeep-P。其余脚本则在原始版本基础上进行了修改。以下是对这六个脚本功能的描述:
preprocess_reads.pl 对输入的序列读段进行过滤,包括过长或过短的读段(<19 nt 或 >25 nt)、与 Rfam ncRNA 序列匹配的读段,以及每百万读段数(RPM, Reads Per Million)小于 5 的读段。随后,该脚本提取与已知 miRNA 成熟序列匹配的读段。输入文件为原始的 FASTA/FASTQ 格式读段数据,以及使用 bowtie2 将读段比对至 miRNA 和 ncRNA 序列所生成的输出结果。
计算转速(RPM)的公式如下:

convert_bowtie_to_blast.pl 将 bowtie 格式转换为 BLAST 解析格式。BLAST 解析格式是一种自定义的制表符分隔格式,源自标准的 NCBI BLAST 输出格式。
filter_alignments.pl 用于筛选深度测序读段与基因组之间的比对结果,可过滤部分比对以及多次比对的读段(用户指定的频率阈值)。其基本输入为 BLAST 解析格式的文件。
excise_candidate.pl 利用比对好的测序读段作为指导,从参考序列中切除潜在的前体序列。基本输入为BLAST解析格式的文件和FASTA文件。输出为所有潜在前体序列的FASTA格式结果。
mod-miRDP.pl 需要两个输入文件:特征文件和结构文件,该程序通过使用植物特异性参数修改打分系统,对核心 miRDeep-P 算法进行了改进。输入文件为点括号表示的前体结构文件和读段分布特征文件。
mod-rm_redundant_meet_plant.pl 需要三个输入文件:chromosome_length、precursors 和由 mod-miRDP.pl 生成的 original_prediction。该程序生成两个输出文件:非冗余预测文件和根据最新更新的植物 miRNA 标准筛选后的预测文件。输出文件格式的详细信息见第 1.4 节。
访问受限。请登录或开始试用以查看此内容。
1. 安装与测试
2. 鉴定新miRNA
3. 使用 miRDP2 的修改说明与注意事项
访问受限。请登录或开始试用以查看此内容。
本文所述的miRNA注释流程miRDP2应用于来自5种植物物种的10个公开sRNA-seq文库,这些物种的基因组长度逐步增加,包括Arabidopsis thaliana、Oryza sativa(水稻)、Solanum lycopersicum(番茄)、Zea mays(玉米)和Triticum aestivum(小麦)(图1A)。总体而言,对每个物种,选择来自不同组织的两个代表性sRNA文库(合并为唯一序列,详见方案部分)及其索引的基因组序列作为两种输入数据(表1)。为进行比较,选用了五种miRNA计算预测工具:miRDeep-P13、miRPlant25、miR-PREFeR26、miRA27和miReNA
访问受限。请登录或开始试用以查看此内容。
随着下一代测序技术(NGS)的发展,从多种物种日益增长的小RNA测序数据中已鉴定出大量miRNA位点29,30。在集中管理的社区数据库miRBase21中,过去十年间收录的miRNA条目几乎增长了100倍。然而,与动物miRNA相比,植物miRNA具有许多独特特征,使得其鉴定和注释更为复杂13,14。
首先,植物miRNA前体在长度和结构上具有更高的变异性(补充文件2)16。与动物miRNA前体相对均一的长度(约70–90 nt)不同,植物前体的长度可相差数倍,甚至可达数百nt13,31。这种差异在预测mi...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本工作得到了北京市农林科学院(项目编号:KJCX201917、KJCX20180425 和 KJCX20180204)对 XY 的资助,以及国家自然科学基金(项目编号:31621001)对 LL 的资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机/计算节点 | N/A | N/A | 需要 Perl;建议至少 8 GB 内存和 100 GB 存储空间 |
访问受限。请登录或开始试用以查看此内容。