核糖体在翻译过程中以每密码子三个核苷酸的规律解码生成肽链。核糖体沿mRNA移动的过程通过核糖体谱型分析(ribosome profiling)得以捕获,产生具有典型三联体周期性的足迹信号。本实验方案介绍如何利用RiboCode从核糖体谱型数据中解析这一显著特征,从而在全转录组水平上鉴定处于活跃翻译状态的开放阅读框。
方法文章
* These authors contributed equally
核糖体在翻译过程中以每密码子三个核苷酸的规律解码生成肽链。核糖体沿mRNA移动的过程通过核糖体谱型分析(ribosome profiling)得以捕获,产生具有典型三联体周期性的足迹信号。本实验方案介绍如何利用RiboCode从核糖体谱型数据中解析这一显著特征,从而在全转录组水平上鉴定处于活跃翻译状态的开放阅读框。
鉴定开放阅读框(ORF),特别是那些编码小肽且在特定生理条件下处于活跃翻译状态的ORF,对于全面注释依赖于特定条件的翻译组至关重要。 核糖体谱分析(ribosome profiling)是一种用于检测核糖体在RNA上的结合位置和密度的技术,可实现全基因组范围内翻译事件发生位置的快速发现。然而,在生物信息学分析中,如何高效且全面地从核糖体谱数据中识别正在翻译的ORF仍非易事。本文介绍了一个易于使用的分析工具包RiboCode,该工具包旨在从核糖体谱数据中扭曲且模糊的信号里搜索任意大小的活跃翻译ORF。以我们先前发表的数据集为例,本文逐步演示了RiboCode完整分析流程的操作步骤,涵盖从原始数据预处理到最终输出结果文件的解读。此外,为评估已注释ORF的翻译水平,本文还详细描述了对每个ORF上核糖体密度进行可视化和定量分析的具体方法。总之,本文为翻译、小ORF及小肽相关研究领域提供了实用且及时的技术指南。
近年来,越来越多的研究揭示了由编码基因的开放阅读框(ORFs)以及先前被注释为非编码的基因(如长链非编码RNA(lncRNAs))广泛翻译产生多肽的现象1,2,3,4,5,6,7,8。这些被翻译的ORF受到细胞调控或诱导,以响应环境变化、应激以及细胞分化过程1,8,9,10,11,12,13。一些ORF的翻译产物已被证实可在发育和生理过程中参与多种生物学过程的调控。例如,Chng等人14发现了一种名为Elabela(Ela,亦称为Apela/Ende/Toddler)的肽类激素,其对心血管系统的发育至关重要。Pauli等人提出,Ela还具有促有丝分裂原功能,可促进早期鱼类胚胎中的细胞迁移15。Magny等人报道了两种长度小于30个氨基酸的微肽,它们可调控果蝇心脏中的钙离子转运并影响正常的肌肉收缩10。
目前尚不清楚基因组编码了多少此类肽段,以及它们是否具有生物学意义。因此,系统性地鉴定这些潜在的编码开放阅读框(ORF)显得尤为重要。然而,使用传统的研究方法(如进化保守性16,17和质谱分析18,19)直接确定这些ORF的产物(即蛋白质或肽段)仍面临挑战,因为这两种方法的检测效率均依赖于所产生蛋白质或肽段的长度、丰度及氨基酸组成。核糖体谱分析(ribosome profiling)技术的出现为在核苷酸分辨率上识别mRNA上的核糖体占据情况提供了精确手段,从而能够不受转录本长度和组成限制地评估其编码潜力3,20,21。利用核糖体谱分析鉴定活跃翻译ORF的一个重要且常用特征,是核糖体在mRNA上从起始密码子到终止密码子之间所形成的三核苷酸(3-nt)周期性足迹模式。然而,核糖体谱分析数据常存在若干问题,包括沿ORF分布的测序读段稀少且覆盖度低、测序噪声较高以及核糖体RNA(rRNA)污染等。因此,此类数据产生的畸变和模糊信号会削弱核糖体在mRNA上足迹的3-nt周期性模式,最终导致高置信度翻译ORF的鉴定变得困难。
名为 "RiboCode" 采用了一种改进的 Wilcoxon 符号秩检验与 P 值整合策略,以检验开放阅读框(ORF)中的同相核糖体保护片段(RPFs)是否显著多于异相 RPFs22已证明该方法高效、灵敏且准确。 从头合成 在模拟和真实核糖体谱型数据中对翻译组进行注释。本文介绍了如何利用该工具从先前研究产生的原始核糖体谱型测序数据集中检测潜在的翻译开放阅读框23这些数据集已被用于探索EIF3亚基的功能 "E" 通过比较转染了对照(si-Ctrl)和 EIF3E 的 MCF-10A 细胞的核糖体占据谱,研究 EIF3E 在翻译过程中的作用 EIF3E (si-eIF3e) 小干扰RNA(siRNA)。通过将RiboCode应用于这些示例数据集,我们检测到5,633个可能编码小肽或蛋白质的新型开放阅读框(ORF)。这些ORF根据其相对于编码区的位置被分为多种类型,包括上游开放阅读框(uORF)、下游开放阅读框(dORF)、重叠开放阅读框、来自新型蛋白编码基因(novel PCGs)的开放阅读框以及来自新型非蛋白编码基因(novel NonPCGs)的开放阅读框。在EIF3E缺陷细胞中,uORF上的核糖体保护片段(RPF)读数密度相较于对照细胞显著增加,这可能至少部分归因于活跃翻译核糖体的富集。核糖体在25th 至 75th EIF3E 缺陷细胞中的密码子表明翻译延伸在早期阶段受阻。本方案还展示了如何可视化目标区域的 RPF 密度,以检测核糖体足迹在已鉴定 ORF 上的 3-nt 周期性模式。这些分析展示了 RiboCode 在鉴定翻译 ORF 及研究翻译调控方面的强大作用。
访问受限。请登录或开始试用以查看此内容。
1. 环境配置与 RiboCode 安装
2. 数据准备
3. 切除接头并去除rRNA污染
4. 将干净的测序读段比对到基因组
5. RPF 片段的大小筛选及其 P 位点的鉴定
6. 从头合成 注释翻译中的开放阅读框
7. (可选)ORF 定量与统计分析
8. (可选)预测 ORF 的可视化
9. (可选)使用 RiboMiner 进行基因组平均分析
注意:按照以下步骤进行基因集分析,以评估EIF3E基因敲低对已鉴定注释ORF翻译的影响:
访问受限。请登录或开始试用以查看此内容。
示例核糖体谱分析数据集已存入 GEO 数据库,登录号为 GSE131074。本方案中使用的所有文件和代码均可从以下获取: 补充文件 1-4通过将 RiboCode 应用于一组已发表的核糖体谱型分析数据集23,我们在经对照处理的MCF-10A细胞中鉴定了新开放阅读框的活跃翻译 EIF3E siRNA。为了筛选出最可能由翻译核糖体结合的RPF测序读段,对测序读段的长度进行了分析,并利用比对到已知翻译基因上的RPF进行全基因平均分析(metagene分析)。读段长度的频率分布显示,大多数RPF的长度为25–35 nt图1A),对应于核糖体所覆盖的核苷酸序列,符合预期。通过分别检查不同长度RPFs的5'端到注释的起始密码子和终止密码子之间的距离,确定其P位点位置(图1B)。28-32nt范围内的RPF读段显示出强烈的3-nt周期性,其P位点位于+12位置
访问受限。请登录或开始试用以查看此内容。
核糖体谱分析为在基因组尺度上研究细胞中核糖体的活动提供了前所未有的机会。精确解读核糖体谱数据所携带的信息,有助于揭示基因或转录本的哪些区域正处于活跃翻译状态。本逐步操作方案详细指导如何使用 RiboCode 分析核糖体谱数据,包括软件包安装、数据准备、命令执行、结果解释以及数据可视化。RiboCode 的分析结果表明,翻译现象广泛存在,不仅发生在已知编码基因的未注释开放阅读框(ORF)上,也发生在许多此前被认为是非编码的转录本上。下游分析进一步提供了证据,显示核糖体在预测的 ORF 上以每三个核苷酸为一步的方式移动,符合翻译过程的特征;然而,目前尚不清楚这一翻译过程本身或所产生的多肽是否具有生物学功能。尽管如此,对基因组上正在翻译的 ORF 进行准确注释,将为探索此前未被表征的转录本功能带来令人振奋的新机遇31。
利用核糖体谱分析数据预测每个开放阅读框(ORF)的编码潜力,高度依赖于从ORF起始密码子到终止密码子范围内每个密码子上P位点密度的3-核苷酸周期性。因此,该方法需要精确确定不同长度测序读段的P位点位置。此类信息并非核糖体谱分...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
作者感谢西安交通大学高性能计算中心(HPCC)平台提供的计算资源支持。Z.X. 衷心感谢西安交通大学青年拔尖人才支持计划的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 运行 Linux 的计算机/服务器 | 任意 | - | - |
| Anaconda 或 Miniconda | Anaconda | - | Anaconda: https://www.anaconda.com; Miniconda:https://docs.conda.io/en/latest/miniconda.html |
| R | R 基金会 | - | https://www.r-project.org/ |
| Rstudio | Rstudio | - | https://www.rstudio.com/ |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可