需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

mirMachine:植物miRNA注释的一站式平台

2.4K 次观看

DOI:

10.3791/62430

2021年5月1日

本文内容

摘要

本文介绍了一种全新且完全自动化的miRNA分析流程——mirMachine,该流程具有以下优势:1)能够更准确地识别已知和新miRNA;2)完全自动化且免费开放。用户现在只需运行一个简短的提交脚本,即可启动完全自动化的mirMachine分析流程。

摘要

在各类非编码RNA中,microRNA(miRNA)在过去十年中 arguably 成为研究焦点。作为基因表达的转录后调控因子,miRNA在多种细胞通路中发挥关键作用,包括发育过程以及对生物和非生物胁迫(如干旱和病害)的响应。高质量参考基因组序列的获得使得在多个植物物种中能够鉴定并注释miRNA,其中miRNA序列高度保守。由于计算预测miRNA及其注释的过程通常容易产生错误,基于同源性的预测方法可提高预测准确性。在过去十年中,我们开发并不断完善了miRNA注释流程SUmir,该流程已被应用于多个植物基因组的研究。

本研究提出了一种完全自动化的新型miRNA分析流程——mirMachine(miRNA Machine),其创新之处在于:(i)在二级结构预测中增加额外的过滤步骤,(ii)实现全流程自动化,以及(iii)引入新功能,可基于同源性预测已知miRNA,或利用小RNA测序数据基于前一版本流程预测新miRNA。该新型miRNA分析流程mirMachine已通过拟南芥信息资源TAIR10版本进行测试 拟南芥 基因组和国际小麦基因组测序联盟(IWGSC)小麦参考基因组v2.

引言

新一代测序技术的进步加深了人们对RNA结构和调控元件的理解,揭示了具有重要功能的非编码RNA(ncRNA)。在不同类型的ncRNA中,微小RNA(miRNA)是一类基本的调控性小RNA,在植物中长度介于19至24个核苷酸之间1,2。自从在线虫Caenorhabditis elegans中发现第一个miRNA以来3,miRNA的存在与功能已在动物和植物基因组中得到广泛研究4,5,6。miRNA通过靶向mRNA使其发生切割或翻译抑制而发挥作用7。越来越多的证据还表明,miRNA参与植物中多种生物学过程,包括生长与发育8、自体生物合成9以及多种生物和非生物胁迫响应10

在植物中,miRNA最初由长链初级转录本(称为pri-miRNA)加工而来11。这些pri-miRNA由细胞核内的RNA聚合酶II生成,是形成不完全发夹结构的长链转录本12。随后,pri-miRNA经历剪切过程,产生内源性的单链(ss)发夹前体miRNA,即pre-miRNA11。pre-miRNA形成发夹样结构,其中单链折叠成双链结构,以切除miRNA双链体(miRNA/miRNA*)13。Dicer样蛋白切割miRNA/miRNA*双链体的两条链,留下2个核苷酸的3'突出端14,15。miRNA双链体在细胞核内被甲基化,从而保护miRNA的3'末端免受降解和尿苷化作用的影响16,17。在输出到细胞质后,解旋酶解开甲基化的miRNA双链体,使成熟miRNA暴露于细胞质中的RNA诱导沉默复合物(RISC)18。双链体中的一条链为成熟miRNA,被整合进RISC,而另一条链miRNA*则被降解。miRNA-RISC复合物结合靶序列,若完全互补则导致mRNA降解,若部分互补则引起翻译抑制13

根据miRNA的表达和生成特征,已有相关指南用于miRNA注释15,19。依据这些明确的指南,Lucas和Budak开发了SUmir流程,用于在植物中进行基于同源性的in silico miRNA鉴定9。SUmir流程包含两个脚本:SUmirFind和SUmirFold。SUmirFind通过美国国家生物技术信息中心(National Center for Biotechnology Information, NCBI)的局部比对基本搜索工具(Basic Local Alignment Search Tool, BLAST),在已知miRNA数据集中进行相似性搜索,其参数经过调整,以包含仅含2个或更少错配的匹配结果,并避免对较短匹配结果产生偏好(blastn-short -ungapped -penalty -1 -reward 1)。SUmirFold则利用UNAfold21对BLAST20结果中假定miRNA序列的二级结构进行评估。SUmirFold通过识别发夹结构的特征,将miRNA与小干扰RNA(small interfering RNAs)区分开来。此外,它还通过最低折叠自由能指数> 0.67以及GC含量在24%-71%之间的参数,将miRNA与其他单链RNA(如tRNA和rRNA)区分开来。该流程最近已更新,新增了两个步骤,旨在(i)提高灵敏度,(ii)提高注释准确性,以及(iii)提供预测miRNA基因的基因组分布信息22。鉴于植物miRNA序列的高度保守性23,该流程最初是为基于同源性的miRNA预测而设计的。然而,由于该生物信息学分析严重依赖于近缘物种间miRNA序列的保守性,因此难以准确识别新miRNA。

本文介绍了一种全新且完全自动化的miRNA分析流程——mirMachine,该流程具有以下两个特点:1)能够更准确地识别已知和新miRNA(例如,该流程目前结合了基于sRNA-seq的新miRNA预测方法以及基于同源性的miRNA识别方法);2)完全自动化且免费开放使用。输出结果还包括预测miRNA的基因组分布信息。mirMachine已在小麦和Arabidopsis基因组中分别测试了基于同源性和基于sRNA-seq的预测性能。尽管UNAfold最初作为免费软件发布,但在过去十年中已转为商业软件。此次升级将二级结构预测工具由UNAfold更换为RNAfold,从而确保mirMachine的完全免费开放。用户现在只需运行一个简短的提交脚本即可启动全自动化的mirMachine流程(示例见https://github.com/hbusra/mirMachine.git)。

访问受限。请登录或开始试用以查看此内容。

方案

1. 软件依赖项与安装

  1. 从其官网或使用 conda 安装软件依赖项。
    1. 如果尚未安装,请从其官网(https://www.perl.org/get.html)下载并安装 Perl。
      注意:所示结果使用 Perl v5.32.0 预测。
    2. 从其官网(https://www.ncbi.nlm.nih.gov/books/NBK279671/)下载 Blast+(一种比对程序)的可执行文件和源代码。
      注意:所示结果使用 BLAST 2.6.0+ 预测。
    3. 从 https://www.tbi.univie.ac.at/RNA/ 下载 RNAfold 的预编译包。
    4. 或者,使用以下 conda 命令安装这些软件:i) conda install -c bioconda blast;ii) conda install -c bioconda viennarna

2. mirMachine 的设置与测试

  1. 从 GitHub 下载最新版本的 mirMachine 脚本及 mirMachine 提交脚本,网址为 https://github.com/hbusra/mirMachine.git,然后将脚本路径添加到 PATH 环境变量中。
  2. 使用 GitHub 上提供的测试数据,确认 mirMachine 及其所有依赖项均已正确下载。
  3. 在以下所示的测试数据上运行 mirMachine。
    bash mirMachine_submit.sh -f iwgsc_v2_chr5A.fasta -i mature_high_conf_v22_1.fa.filtered.fasta -n 10
    注意:由于测试数据仅包含小麦基因组的一条染色体,因此将 -n 参数设置为 10。默认情况下,-n 参数值为 20。
  4. 检查 hairpins.tbl.out.tbl 输出文件,查看预测的成熟 miRNA、其预测的前体序列以及它们在染色体上的位置信息。
  5. 查看日志文件中的程序输出结果和警告信息。

3. 基于同源性的miRNA鉴定

  1. 使用以下所示的 bash 脚本运行 mirMachine:
    bash mirMachine_submit.sh -f $genome_file -i $input_file -m $mismatches -n $number_of_hits
  2. 检查预测的 miRNA。查找名为 $input_file.results.tbl.hairpins.tbl.out.tbl 的输出文件以获取预测的 miRNA 结果,查找名为 $input_file.results.tbl.hairpins.fsa 的输出文件以获取 pre-miRNA 的 FASTA 序列,查找名为 $input_file.results.tbl.hairpins.log 的输出文件以获取发夹结构的日志文件。

4. 新型miRNA鉴定

  1. 将sRNA-seq的FASTQ文件预处理为标准的FASTA格式。如有需要,切除接头序列;不要修剪低质量读段,而应直接去除。删除包含N的读段。将FASTQ文件转换为FASTA文件($input_file)。
  2. 使用如下所示的bash脚本运行mirMachine。
    bash mirMachine_submit.sh -f $genome_file -i $input_file -n $number_of_hits -sRNAseq -lmax $lmax -lmin $lmin -rpm $rpm
    注意:$mismatches在基于sRNA-seq的预测中被设置为0。
  3. 检查预测出的miRNA。查找名为$input_file.results.tbl.hairpins.tbl.out.tbl的输出文件以获取预测的miRNA结果;查找名为$input_file.results.tbl.hairpins.fsa的输出文件以获取pre-miRNA的FASTA序列;查找名为$input_file.results.tbl.hairpins.log的输出文件以获取发夹结构的日志文件。

5. 高级参数

注意:除基因组文件和输入的miRNA文件外,所有参数均已定义默认值。

  1. -db 选项设置为一个 blast 数据库,以跳过流程中参考数据库的构建。
  2. -m 选项设置为允许的错配数。
    注意:默认情况下,基于同源性的预测中 -m 选项设为 1,而基于 sRNA-seq 的预测中设为 0。
  3. -n 设置为比对后要剔除的命中序列数量(默认为 20)。根据物种不同可进行调整。
  4. 使用 -long 选项评估候选列表中序列的二级结构。
  5. 使用 -s 选项激活基于 sRNA-seq 数据的新 miRNA 预测功能。
  6. -lmax 选项设置为纳入筛选的 sRNA-seq 读段的最大长度。
  7. -lmin 选项设置为纳入筛选的 sRNA-seq 读段的最小长度。
  8. 使用 -rpm 选项设置每百万读段(Reads Per Million, RPM)的阈值。
    注意:对于 pri-miRNA/pre-miRNA 长度等高级参数,建议有经验的用户根据自身研究需求修改脚本。此外,如果用户希望跳过某些步骤或使用自定义的中间输出结果,可通过在相应行的开头添加 # 来注释掉提交脚本中的对应行,从而实现跳过。

访问受限。请登录或开始试用以查看此内容。

结果

上述描述的miRNA分析流程mirMachine已应用于测试数据,以快速评估该流程的性能。仅将miRBase v22.1中收录的高置信度植物miRNA序列与IWGSC小麦RefSeq基因组v2的5A染色体进行比对筛选24。在允许最多1个错配的条件下,mirMachine_find在189条非冗余的高置信度miRNA序列中返回了312个匹配结果(表1)。mirMachine_fold根据二级结构评估,将其中49条分类为候选miRNA。鉴定出数量最多的miRNA家族为miR9666,共发现18条miRNA(图1)。部分miRNA具有相同的成熟miRNA序列,但来源于不同的前体miRNA序列。这些miRNA被重新命名为miRNA家族名称后接唯一编号,例如miR156-5p-1和miR156-5p-2。在49条候选miRNA中,共鉴定出20条非冗余的成熟miRNA序列。某些miRNA可从多个基因座转录,导致其代表的miRNA数量较多。在测试数据中,miR9666-3p-5出现了两次:一次位于正义链(位置6...

访问受限。请登录或开始试用以查看此内容。

讨论

在过去十年中,我们的miRNA分析流程SUmir已被用于鉴定多种植物的miRNA。在此,我们开发了一种新的、完全自动化且免费的miRNA鉴定与注释流程——mirMachine。此外,包括此前流程在内的多个miRNA鉴定流程曾依赖于UNAfold软件21,该软件最初可免费使用,但后来转为商业软件。而这一全新的、完全自动化的mirMachine不再依赖UNAfold,取而代之的是采用维也纳RNA软件包(ViennaRNA package)中免费提供的RNAfold27进行二级结构预测。此外,mirMachine的全部脚本已整合为一个包含可调参数的bash脚本,从而使mirMachine成为一个完全自动化且免费的miRNA预测与注释工具。

mirMachine 利用了植物 miRNA 及其生物发生过程的特性。与动物 pre-miRNA 不同,植物 pre-miRNA 在长度和结构特征上具有高度可变性15。因此,已建立一种基于 miRNA 及其生物...

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
https://www.ncbi.nlm.nih.gov/books/NBK279671/Blast+
https://github.com/hbusra/mirMachine.gitmirMachine 提交脚本
https://www.perl.org/get.htmlPerl
https://www.tbi.univie.ac.at/RNA/RNAfold
Arabidopsis TAIR10
Triticum aestivum(小麦,IWGSC RefSeq v2)

参考文献

  1. Voinnet, O. Origin, biogenesis, and activity of plant microRNAs. Cell. 136 (4), 669-687 (2009).
  2. Budak, H., Akpinar, B. A. Plant miRNAs: biogenesis, organization and origins. Functional & Integrative Genomics. 15 (5), 523-531 (2015).
  3. Lee, R. C., Feinbaum, R. L., Ambros, V. The C. elegans heterochronic gene lin-4 encodes small RNAs with antisense complementarity to lin-14. Cell. 75 (5), 843-854 (1993).
  4. Zhang, L., et al. Exogenous plant MIR168a specifically targets mammalian LDLRAP1: evidence of cross-kingdom regulation by microRNA. Cell Research. 22 (1), 107-126 (2012).
  5. Pang, K. C., Frith, M. C., Mattick, J. S. Rapid evolution of noncoding RNAs: Lack of conservation does not mean lack of function. Trends in Genetics. 22 (1), 1-5 (2006).
  6. Guleria, P., Mahajan, M., Bhardwaj, J., Yadav, S. K. Plant small RNAs: biogenesis, mode of action and their roles in abiotic stresses. Genomics, Proteomics and Bioinformatics. 9 (6), 183-199 (2011).
  7. Jones-Rhoades, M. W., Bartel, D. P., Bartel, B. MicroRNAs and their regulatory roles in plants. Annual Review of Plant Biology. 57, 19-53 (2006).
  8. Singh, A., et al. Plant small RNAs: advancement in the understanding of biogenesis and role in plant development. Planta. 248 (3), 545-558 (2018).
  9. Lucas, S. J., Budak, H. Sorting the wheat from the chaff: identifying miRNAs in genomic survey sequences of Triticum aestivum chromosome 1AL. PloS One. 7 (7), 40859(2012).
  10. Li, S., Castillo-González, C., Yu, B., Zhang, X. The functions of plant small RNAs in development and in stress responses. Plant Journal. 90 (4), 654-670 (2017).
  11. Lee, Y., Jeon, K., Lee, J. T., Kim, S., Kim, V. N. MicroRNA maturation: Stepwise processing and subcellular localization. EMBO Journal. 21 (17), 4663-4670 (2002).
  12. Lee, Y., et al. MicroRNA genes are transcribed by RNA polymerase II. EMBO Journal. 23 (2), 4051-4060 (2004).
  13. Bartel, D. P. MicroRNAs: Genomics, biogenesis, mechanism, and function. Cell. 116 (2), 281-297 (2004).
  14. Lee, Y., et al. The nuclear RNase III Drosha initiates microRNA processing. Nature. 425 (6956), 415-419 (2003).
  15. Meyers, B. C., et al. Criteria for annotation of plant microRNAs. Plant Cell. 20 (12), 3186-3190 (2008).
  16. Sanei, M., Chen, X. Mechanisms of microRNA turnover. Current Opinion in Plant Biology. 27, 199-206 (2015).
  17. Li, J., Yang, Z., Yu, B., Liu, J., Chen, X. Methylation protects miRNAs and siRNAs from a 3′-end uridylation activity in Arabidopsis. Current Biology. 15 (16), 1501-1507 (2005).
  18. Rogers, K., Chen, X. Biogenesis, turnover, and mode of action of plant microRNAs. Plant Cell. 25 (7), 2383-2399 (2013).
  19. Axtell, M. J., Meyers, B. C. Revisiting criteria for plant microRNA annotation in the Era of big data. Plant Cell. 30 (2), 272-284 (2018).
  20. Camacho, C., et al. BLAST+: architecture and applications. BMC Bioinformatics. 10 (1), 421(2009).
  21. Markham, N. R. N., Zuker, M. UNAFold: Software for nucleic acid folding and hybridization. Methods in Molecular Biology. 453, 3-31 (2008).
  22. Alptekin, B., Akpinar, B. A., Budak, H. A comprehensive prescription for plant miRNA identification. Frontiers in Plant Science. 7, 2058(2017).
  23. Zhang, B., Pan, X., Cannon, C. H., Cobb, G. P., Anderson, T. A. Conservation and divergence of plant microRNA genes. Plant Journal. 46 (2), 243-259 (2006).
  24. Appels, R., et al. Shifting the limits in wheat research and breeding using a fully annotated reference genome. Science. 361 (6403), 7191(2018).
  25. Wang, Y., Kuang, Z., Li, L., Yang, X. A bioinformatics pipeline to accurately and efficiently analyze the microRNA transcriptomes in plants. Journal of Visualized Experiments: JoVE. (155), e59864(2020).
  26. Kozomara, A., Griffiths-Jones, S. MiRBase: Annotating high confidence microRNAs using deep sequencing data. Nucleic Acids Research. 42, 68-73 (2014).
  27. Lorenz, R., et al. ViennaRNA Package 2.0. Algorithms for Molecular Biology. 6 (1), 26(2011).
  28. Wicker, T., et al. Impact of transposable elements on genome structure and evolution in bread wheat. Genome Biology. 19 (1), 103(2018).
  29. Flavell, R. B., Bennett, M. D., Smith, J. B., Smith, D. B. Genome size and the proportion of repeated nucleotide sequence DNA in plants. Biochemical Genetics. 12 (4), 257-269 (1974).
  30. Wicker, T., et al. The repetitive landscape of the 5100 Mbp barley genome. Mobile DNA. 8, 22(2017).
  31. Yang, Q., Ye, Q. A., Liu, Y. Mechanism of siRNA production from repetitive DNA. Genes and Development. 29 (5), 526-537 (2015).
  32. Lam, J. K. W., Chow, M. Y. T., Zhang, Y., Leung, S. W. S. siRNA versus miRNA as therapeutics for gene silencing. Molecular Therapy. Nucleic Acids. 4 (9), 252(2015).
  33. Bartel, B. MicroRNAs directing siRNA biogenesis. Nature Structural and Molecular Biology. 12 (7), 569-571 (2005).
  34. Meng, Y., Shao, C., Wang, H., Chen, M. Are all the miRBase-registered microRNAs true? A structure- and expression-based re-examination in plants. RNA Biology. 9 (3), 249-253 (2012).
  35. Berezikov, E., et al. Evolutionary flux of canonical microRNAs and mirtrons in Drosophila. Nature Genetics. 42 (1), author reply 9-10 6-9 (2010).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

基于同源性的miRNA预测小RNA测序miRNA分析流程全基因组miRNA二级结构预测miRNA鉴定拟南芥基因组小麦基因组