本文介绍了一种全新且完全自动化的miRNA分析流程——mirMachine,该流程具有以下优势:1)能够更准确地识别已知和新miRNA;2)完全自动化且免费开放。用户现在只需运行一个简短的提交脚本,即可启动完全自动化的mirMachine分析流程。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种全新且完全自动化的miRNA分析流程——mirMachine,该流程具有以下优势:1)能够更准确地识别已知和新miRNA;2)完全自动化且免费开放。用户现在只需运行一个简短的提交脚本,即可启动完全自动化的mirMachine分析流程。
在各类非编码RNA中,microRNA(miRNA)在过去十年中 arguably 成为研究焦点。作为基因表达的转录后调控因子,miRNA在多种细胞通路中发挥关键作用,包括发育过程以及对生物和非生物胁迫(如干旱和病害)的响应。高质量参考基因组序列的获得使得在多个植物物种中能够鉴定并注释miRNA,其中miRNA序列高度保守。由于计算预测miRNA及其注释的过程通常容易产生错误,基于同源性的预测方法可提高预测准确性。在过去十年中,我们开发并不断完善了miRNA注释流程SUmir,该流程已被应用于多个植物基因组的研究。
本研究提出了一种完全自动化的新型miRNA分析流程——mirMachine(miRNA Machine),其创新之处在于:(i)在二级结构预测中增加额外的过滤步骤,(ii)实现全流程自动化,以及(iii)引入新功能,可基于同源性预测已知miRNA,或利用小RNA测序数据基于前一版本流程预测新miRNA。该新型miRNA分析流程mirMachine已通过拟南芥信息资源TAIR10版本进行测试 拟南芥 基因组和国际小麦基因组测序联盟(IWGSC)小麦参考基因组v2.
新一代测序技术的进步加深了人们对RNA结构和调控元件的理解,揭示了具有重要功能的非编码RNA(ncRNA)。在不同类型的ncRNA中,微小RNA(miRNA)是一类基本的调控性小RNA,在植物中长度介于19至24个核苷酸之间1,2。自从在线虫Caenorhabditis elegans中发现第一个miRNA以来3,miRNA的存在与功能已在动物和植物基因组中得到广泛研究4,5,6。miRNA通过靶向mRNA使其发生切割或翻译抑制而发挥作用7。越来越多的证据还表明,miRNA参与植物中多种生物学过程,包括生长与发育8、自体生物合成9以及多种生物和非生物胁迫响应10。
在植物中,miRNA最初由长链初级转录本(称为pri-miRNA)加工而来11。这些pri-miRNA由细胞核内的RNA聚合酶II生成,是形成不完全发夹结构的长链转录本12。随后,pri-miRNA经历剪切过程,产生内源性的单链(ss)发夹前体miRNA,即pre-miRNA11。pre-miRNA形成发夹样结构,其中单链折叠成双链结构,以切除miRNA双链体(miRNA/miRNA*)13。Dicer样蛋白切割miRNA/miRNA*双链体的两条链,留下2个核苷酸的3'突出端14,15。miRNA双链体在细胞核内被甲基化,从而保护miRNA的3'末端免受降解和尿苷化作用的影响16,17。在输出到细胞质后,解旋酶解开甲基化的miRNA双链体,使成熟miRNA暴露于细胞质中的RNA诱导沉默复合物(RISC)18。双链体中的一条链为成熟miRNA,被整合进RISC,而另一条链miRNA*则被降解。miRNA-RISC复合物结合靶序列,若完全互补则导致mRNA降解,若部分互补则引起翻译抑制13。
根据miRNA的表达和生成特征,已有相关指南用于miRNA注释15,19。依据这些明确的指南,Lucas和Budak开发了SUmir流程,用于在植物中进行基于同源性的in silico miRNA鉴定9。SUmir流程包含两个脚本:SUmirFind和SUmirFold。SUmirFind通过美国国家生物技术信息中心(National Center for Biotechnology Information, NCBI)的局部比对基本搜索工具(Basic Local Alignment Search Tool, BLAST),在已知miRNA数据集中进行相似性搜索,其参数经过调整,以包含仅含2个或更少错配的匹配结果,并避免对较短匹配结果产生偏好(blastn-short -ungapped -penalty -1 -reward 1)。SUmirFold则利用UNAfold21对BLAST20结果中假定miRNA序列的二级结构进行评估。SUmirFold通过识别发夹结构的特征,将miRNA与小干扰RNA(small interfering RNAs)区分开来。此外,它还通过最低折叠自由能指数> 0.67以及GC含量在24%-71%之间的参数,将miRNA与其他单链RNA(如tRNA和rRNA)区分开来。该流程最近已更新,新增了两个步骤,旨在(i)提高灵敏度,(ii)提高注释准确性,以及(iii)提供预测miRNA基因的基因组分布信息22。鉴于植物miRNA序列的高度保守性23,该流程最初是为基于同源性的miRNA预测而设计的。然而,由于该生物信息学分析严重依赖于近缘物种间miRNA序列的保守性,因此难以准确识别新miRNA。
本文介绍了一种全新且完全自动化的miRNA分析流程——mirMachine,该流程具有以下两个特点:1)能够更准确地识别已知和新miRNA(例如,该流程目前结合了基于sRNA-seq的新miRNA预测方法以及基于同源性的miRNA识别方法);2)完全自动化且免费开放使用。输出结果还包括预测miRNA的基因组分布信息。mirMachine已在小麦和Arabidopsis基因组中分别测试了基于同源性和基于sRNA-seq的预测性能。尽管UNAfold最初作为免费软件发布,但在过去十年中已转为商业软件。此次升级将二级结构预测工具由UNAfold更换为RNAfold,从而确保mirMachine的完全免费开放。用户现在只需运行一个简短的提交脚本即可启动全自动化的mirMachine流程(示例见https://github.com/hbusra/mirMachine.git)。
访问受限。请登录或开始试用以查看此内容。
1. 软件依赖项与安装
2. mirMachine 的设置与测试
3. 基于同源性的miRNA鉴定
4. 新型miRNA鉴定
5. 高级参数
注意:除基因组文件和输入的miRNA文件外,所有参数均已定义默认值。
访问受限。请登录或开始试用以查看此内容。
上述描述的miRNA分析流程mirMachine已应用于测试数据,以快速评估该流程的性能。仅将miRBase v22.1中收录的高置信度植物miRNA序列与IWGSC小麦RefSeq基因组v2的5A染色体进行比对筛选24。在允许最多1个错配的条件下,mirMachine_find在189条非冗余的高置信度miRNA序列中返回了312个匹配结果(表1)。mirMachine_fold根据二级结构评估,将其中49条分类为候选miRNA。鉴定出数量最多的miRNA家族为miR9666,共发现18条miRNA(图1)。部分miRNA具有相同的成熟miRNA序列,但来源于不同的前体miRNA序列。这些miRNA被重新命名为miRNA家族名称后接唯一编号,例如miR156-5p-1和miR156-5p-2。在49条候选miRNA中,共鉴定出20条非冗余的成熟miRNA序列。某些miRNA可从多个基因座转录,导致其代表的miRNA数量较多。在测试数据中,miR9666-3p-5出现了两次:一次位于正义链(位置6...
访问受限。请登录或开始试用以查看此内容。
在过去十年中,我们的miRNA分析流程SUmir已被用于鉴定多种植物的miRNA。在此,我们开发了一种新的、完全自动化且免费的miRNA鉴定与注释流程——mirMachine。此外,包括此前流程在内的多个miRNA鉴定流程曾依赖于UNAfold软件21,该软件最初可免费使用,但后来转为商业软件。而这一全新的、完全自动化的mirMachine不再依赖UNAfold,取而代之的是采用维也纳RNA软件包(ViennaRNA package)中免费提供的RNAfold27进行二级结构预测。此外,mirMachine的全部脚本已整合为一个包含可调参数的bash脚本,从而使mirMachine成为一个完全自动化且免费的miRNA预测与注释工具。
mirMachine 利用了植物 miRNA 及其生物发生过程的特性。与动物 pre-miRNA 不同,植物 pre-miRNA 在长度和结构特征上具有高度可变性15。因此,已建立一种基于 miRNA 及其生物...
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| https://www.ncbi.nlm.nih.gov/books/NBK279671/ | Blast+ | ||
| https://github.com/hbusra/mirMachine.git | mirMachine 提交脚本 | ||
| https://www.perl.org/get.html | Perl | ||
| https://www.tbi.univie.ac.at/RNA/ | RNAfold | ||
| Arabidopsis TAIR10 | |||
| Triticum aestivum(小麦,IWGSC RefSeq v2) |
访问受限。请登录或开始试用以查看此内容。