需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

嵌合小非编码RNA靶标RNA测序文库的计算分析教程

1.6K 次观看

⸱

DOI:

10.3791/65779

⸱

2023年12月1日

本文内容

摘要

本文介绍了一种生物信息学分析流程的安装与使用方案,用于分析嵌合RNA测序数据,该数据应用于相关研究中 体内 RNA:RNA 相互作用

摘要

对……的理解 体内 小非编码RNA(sncRNA),例如microRNA(miRNA),与其靶标RNA之间的基因调控相互作用近年来通过生化方法取得了进展,这些方法利用交联后连接技术捕获sncRNA与靶标RNA的相互作用,形成嵌合RNA,并构建测序文库进行后续分析。尽管嵌合RNA测序产生的数据集能够提供全基因组范围的信息,且相比miRNA预测软件结果具有更低的不确定性,但将此类数据转化为有意义且可操作的信息仍需进一步分析,这可能使缺乏计算生物学背景的研究人员望而却步。本报告提供一份教程,旨在帮助初级计算生物学家安装并应用一种新近开发的开源软件工具:小嵌合RNA分析流程(Small Chimeric RNA Analysis Pipeline, SCRAP)。文中详细说明了平台需求、软件更新内容,以及流程各步骤的解释和关键用户输入参数的调整方法。降低生物学家在解析嵌合RNA测序数据方面的技术门槛,有望推动在多种生物学背景下对调控性sncRNA:靶标RNA相互作用的发现性研究。 小非编码RNA,microRNA,嵌合RNA,交联连接,测序文库,计算生物学,SCRAP,基因调控,靶标RNA,生物信息学分析

引言

小分子非编码RNA因其在多种生物学过程(如分化与发育、信号转导及疾病)中协调基因表达的转录后调控作用而受到广泛关注1,2,3准确确定基因调控性小非编码RNA(sncRNA),包括微小RNA(miRNA)的靶转录本,对于在基础和转化层面开展RNA生物学研究具有重要意义。目前常采用生物信息学算法,通过分析miRNA种子序列与其潜在靶标之间的预期互补性,来预测miRNA与靶RNA之间的相互作用。尽管这些生物信息学算法已取得一定成功,但如其他文献所综述,仍可能存在假阳性与假阴性结果。4,5,6近年来,已设计并实施了多种生化方法,可实现明确且半定量的测定 体内 sncRNA:靶标RNA相互作用通过 体内 交联及随后引入连接步骤,以将小非编码RNA(sncRNA)与其靶标物理连接,形成单一的嵌合RNA4,5,7,8,9,10随后从嵌合RNA构建测序文库,可通过测序数据的计算分析评估小非编码RNA与靶RNA之间的相互作用。本视频提供了小型嵌合RNA分析流程(small chimeric RNA analysis pipeline, SCRAP)的安装与使用教程,该计算流程专为实现嵌合RNA测序文库中sncRNA:靶RNA相互作用的稳健且可重复分析而设计。6.

本教程的目标是帮助研究人员降低对纯预测性生物信息学算法的过度依赖,通过简化对生化方法所产生的数据的分析门槛,以获得sncRNA:靶RNA相互作用的嵌合分子读数。本教程提供了实用的步骤和建议,指导初级计算科学家使用一种名为SCRAP的分析流程,该流程用于分析嵌合RNA测序数据,这些数据可由多种现有的生化实验方案生成,包括杂交链交联、连接与测序(CLASH)以及内源性Argonaute结合RNA的共价连接—交联与免疫沉淀(CLEAR-CLIP)7,9。

与其它计算分析流程相比,使用 SCRAP 分析嵌合 RNA 测序数据具有多项优势6。其中一个显著优势在于其广泛的注释功能,以及在流程中整合了对经过充分验证且定期更新的生物信息学脚本的调用,而其他替代流程通常依赖于自定义和/或缺乏支持的脚本完成流程中的各个步骤。这一特性增强了 SCRAP 的稳定性,使研究人员更值得投入时间熟悉该流程,并将其整合到自身的研究工作流中。此外,已有先前研究详细表明,SCRAP 在识别小非编码 RNA(sncRNA)与靶标 RNA 相互作用的峰位点方面优于其他替代流程,并具备跨平台运行的功能6。

本教程结束时,用户将能够:(i)了解 SCRAP 的平台要求并安装 SCRAP 分析流程,(ii)安装参考基因组并为 SCRAP 设置命令行参数,以及(iii)理解峰识别标准,并执行峰识别与峰注释。

本视频将详细介绍研究RNA生物学的科研人员如何安装并优化使用计算分析流程SCRAP,以分析小非编码RNA(sncRNA)与靶标RNA(如信使RNA)在嵌合RNA测序数据中的相互作用。这些测序数据来源于文中所述的某一种生物化学方法构建测序文库。

SCRAP 是一个命令行工具。通常,按照以下指南,用户需要执行以下步骤:(i)下载并安装 SCRAP(https://github.com/Meffert-Lab/SCRAP),(ii)安装参考基因组并运行 SCRAP,以及(iii)进行峰识别(peak calling)和注释。

有关本实验流程中计算步骤的更多详细信息,请访问 https://github.com/Meffert-Lab/SCRAP。本文将提供必要的配置和背景信息,使具备基础计算技能的研究人员能够安装、优化并使用 SCRAP 分析嵌合 RNA 测序文库数据集。

访问受限。请登录或开始试用以查看此内容。

方案

注意:本实验方案将从下载和安装使用 SCRAP 分析嵌合 RNA 测序文库所需的软件开始。

1. 安装

  1. 在安装 SCRAP 之前,需在用于分析的机器上安装依赖程序 Git 和 Miniconda。Git 很可能已预先安装。例如,在 Mac OSX 平台上,可使用以下命令验证 哪个 git 以观察到该 "git" 实用程序已存在并安装在此目录中。使用以下方法检查 Miniconda 是否已安装 哪个 conda如果未返回任何内容,则安装 Miniconda。Miniconda 安装需要 400 MB 的磁盘空间。
    1. 安装 Miniconda 有多种方法,具体取决于平台。请参考 平台设置 位于 Meffert 实验室 GitHub 仓库的 markdown 文件 [https://github.com/Meffert-Lab/SCRAP/blob/main/PLATFORM-SETUP.md] 中提供了有关在 Windows、MacOS 和 Ubuntu 系统上安装的进一步说明。对于 Linux 用户,Linux 拥有其默认的包管理器(apt)。在本研究特定情况下,请使用以下命令 brew install Miniconda 使用现有的包管理器 brew 安装 Miniconda。
      注意:“Homebrew”(简称“brew”)是一个开源软件包管理系统,可简化在苹果操作系统 macOS 上的软件安装。
    2. 如果首次安装 conda,请运行 conda init 对于当前正在使用的特定 shell。在此示例中,正在使用的 shell 是 zsh。然后,关闭并重新打开终端。如果 conda 安装成功,终端将 基础 终端会话中激活的环境将可见。
  2. 下载 SCRAP 源代码并安装其依赖项。
    1. 获取 SCRAP 源代码的首选方法是使用 Git。通过运行 git clone 获取 https://github.com/Meffon-Lab/SCRAP 获取源代码的最新版本。
    2. 安装 mamba(conda 的改进型包求解器),并使用以下命令从 SCRAP_environment.yml 文件将 SCRAP 的所有依赖项安装到其独立的 conda 环境中:
      conda install -n base conda-forge::mamba
      mamba env create -f SCRAP/SCRAP_environment.yml -n SCRAP
  3. 接下来,运行 SCRAP 的参考安装。参考安装中使用的参数将针对正在分析其小非编码 RNA-信使 RNA 相互作用的生物体而设定。
    bash SCRAP/bin/参考基因组安装.sh -r full/path/to/SCRAP/ -m hsa -g hg38 -s human
    1. 提供 SCRAP 源文件夹的目录以供参考安装。随后的安装步骤将使用该文件夹内的文件进行 fasta 和 注释 文件夹。列出完整路径,不得使用任何缩写。以斜杠结尾。
    2. 参见表格中的内容 README.md 请参考 miRBase 物种缩写以获取正确的物种简称。最新的参考基因组可于 https://genome.ucsc.edu/ 或 https://www.ncbi.nlm.nih.gov/data-hub/genome/ 查询。在本示例中, hg38 将用于小鼠GRCm38基因组。
    3. 目前包含用于注释的物种有 人,小鼠,以及 蠕虫. 查看相应的 物种注释.bed 文件中的 注释 SCRAP 源文件夹中的目录。如果希望使用其他物种进行分析,请提供一个遵循相同命名方案的 annotation.bed 文件 物种注释.bed.

2. 运行 SCRAP

  1. 在安装完依赖项和 SCRAP 后,运行脚本 SCRAP.sh
    bash SCRAP/bin/SCRAP.sh -d full/path/to/CLASH_Human/ -a full/path/to/CLASH_Human/CLASH_Human_Adapters.txt -p no -f yes -r full/path/to/SCRAP/ -m hsa -g hg38
    1. 列出样本目录的完整路径,不得使用任何简写形式。样本目录的文件夹名称必须与样本名称完全一致,如 图 1 所示。
    2. 注意,所列出的路径是包含所有样本文件夹的父目录路径,而非指向任意单个样本文件夹或样本文件的路径(参见步骤 2.1 中的命令行)。
    3. 接着,列出适配子文件的完整路径。确保适配子文件中的样本名称与前述的文件夹名称和文件名称完全匹配(参见步骤 2.1 中的命令行)。
    4. 指明样本是否为双端测序,并确定是否对前体 miRNA 和/或 tRNA 进行过滤。如有需要,可添加 rRNA 清除过滤(参见步骤 2.1 中的命令行)。
      NOTE:用户可根据样本类型和实验目标决定是否使用这些过滤步骤。根据实验设计,前体 miRNA、tRNA 和 rRNA 可能会占用实际 sncRNA:靶标 RNA 嵌合体的有效测序深度,因此用户可使用过滤步骤将其排除。但在某些情况下,用户可能希望避免此类过滤(例如,当将 sncRNA 靶标比对至线粒体基因组时,该基因组包含线粒体 rRNA)。
    5. 接下来,列出参考基因组目录的完整路径、miRBase 缩写以及参考基因组的缩写(参见步骤 2.1 中的命令行)。
      ​NOTE:脚本的运行时间可能需要数小时,具体取决于数据集大小和所用计算机的 CPU 性能。

3. 峰值识别与注释

  1. SCRAP 运行完成后,检查输出结果是否包含除其他文件外的 SAMPLE.aligned.unique.bam 文件。这是一个二进制文件,包含目标 RNA 在用户提供的参考基因组上的比对结果。
  2. 现在通过运行 Peak_Calling.sh 执行峰检测。
    bash SCRAP/bin/Peak_Calling.sh -d CLASH_Human/ -a CLASH_Human/CLASH_Human_Adapters.txt -c 3 -l 2 -f no -r SCRAP/ -m hsa -g hg38
    注意:峰检测是 SCRAP 的一项功能,旨在帮助研究人员快速评估其嵌合 RNA 文库中最显著且可重复的小非编码 RNA 与靶 RNA 相互作用。例如,该功能可帮助研究人员识别出可能需要进一步研究的相互作用。下文步骤 3.2.2 将描述用户如何设置用于定义峰检测严格程度的标准——包括必须达到的唯一相互作用数量(或测序读段数)以及该特定相互作用必须在多少个文库中出现。
    1. 再次列出包含样本文件夹的目录的完整路径以及接头文件的完整路径(参见步骤 3.2 中的命令行)。
    2. 接下来,设置峰检测所需的最小测序读段数(参见步骤 3.2 中的命令行)。
    3. 设置峰检测所需的最少独立测序文库数量(参见步骤 3.2 中的命令行)。
      注意:3.2.2 和 3.2.3 中参数值的选择取决于所测序样本的性质以及样本或样本类型的数量。此处要求一个样本中至少有 3 条嵌合测序读段才能定义为峰,且该峰必须在至少 2 个样本中被支持。例如,若研究人员分析的数据集中某一条件具有多个测序文库重复,则可能决定要求该峰在更多样本测序文库中出现。
    4. 指明同一小非编码 RNA 家族中的成员是否需共同贡献于同一峰。例如,由于同一家族的 miRNA 具有相同的种子序列,这些 miRNA 可结合共同且重叠的基因靶标;用户可能希望通过评估它们的联合峰来识别整个家族对这些靶标的影响(参见步骤 3.2 中的命令行)。
    5. 接下来,指明参考目录的完整路径、miRBase 缩写以及参考基因组缩写(参见步骤 3.2 中的命令行)。
  3. 峰检测完成后,运行峰注释。
    ​bash SCRAP/bin/Peak_Annotation.sh -p CLASH_Human/peaks.bed -r SCRAP/ -s human
    1. 列出峰检测生成的 peaks.bed(或 peaks.family.bed)文件的完整路径、参考目录的完整路径,以及用于注释的目标物种。

4. 数据可视化

注意:使用 SCRAP 进行分析的所有步骤现已完成。对于数据的可视化,建议采用以下几种方法:

  1. 合并所有需要一起可视化显示的 .bam(二进制 SAM 文件)(samtools merge)。
  2. 对合并后的 .bam 文件进行排序(samtools sort)。文件内容按行排序,以便 samtools 能够建立索引。
  3. 对排序后的 .bam 文件建立索引(samtools index)。生成一个 BAI(二进制 samtools 格式索引)文件,以便在整合基因组学浏览器(IGV)中进行可视化。
  4. 最后,在 IGV 中打开排序后的 .bam 文件及其对应的索引 .bai 文件。
    注意:感兴趣的 sncRNA:靶标 RNA 相互作用可根据具体研究需求以多种方式优先选择进行后续分析。一种通用的初步方法是评估由最多嵌合测序读段支持的相互作用。还可以通过 RNAstructure 软件包中的 DuplexFold 网络服务器输入检测到的相互作用中 sncRNA 和靶标 RNA 的序列来可视化感兴趣的相互作用11。对于每个峰,在峰注释步骤生成的 peaks.bed.species.annotation.txt 文件中可找到其染色体(第一列)和基因组坐标(起始:第一列;终止:第二列)。特别是对于 miRNA,尽管可重复且具有功能的相互作用可能缺乏广泛的种子区匹配结合(例如,可能依赖 3' 补偿性结合),但仍可将靶标 RNA 的对应结合基序中是否存在种子区匹配位点作为验证所检测到的重要功能相互作用的参考特征4,12。辅助数据分析可能包括比较不同生物学条件下峰之间读段覆盖度的差异,并可使用通路分析工具评估受调控基因在生物学通路中的富集情况。

访问受限。请登录或开始试用以查看此内容。

结果

使用经修改的SCRAP方法(SCRAP 2.0版本,包含rRNA过滤的改进)对先前发表的采用CLEAR-CLIP9构建的测序数据集进行sncRNA:靶标RNA相互作用分析的结果如图2和表1所示。用户可观察到,在SCRAP中通过峰识别(peak calling)筛选出高置信度相互作用后,miRNA与内含子区域相互作用的相对比例有所降低。有关使用SCRAP分析的其他数据也可在该分析流程的初始发表文献中获取6。根据实验策略的不同,可能需要对构建的嵌合RNA文库测序数据进行过滤,以减少结果中的假象。测序文库生化制备不理想和/或测序数据过滤不充分,可能导致错误地纳入并非来源于Argonaute蛋白结合的sncRNA与靶标RNA连接事件的测序读段。这些假象读段可能包括引物二聚体或接头二聚体、rRNA以及pre-miRNA。表2列出了结果中可能出现的假象类型及相应的解决方案。

访问受限。请登录或开始试用以查看此内容。

讨论

本实验方案旨在介绍如何使用 SCRAP 分析流程分析小非编码 RNA(sncRNA)与靶 RNA 的相互作用,以帮助初涉计算分析的研究人员。完成本教程后,具备初级或更高水平计算经验的研究人员将能够掌握该流程的安装与使用步骤,并将其应用于分析来自嵌合 RNA 测序文库的数据。本方案成功实施的关键步骤包括正确安装参考数据及运行 SCRAP,这些步骤耗时较长,若在使用 Anaconda 安装依赖项或输入命令行参数时未加注意,容易出现错误。

本文重点介绍了使用 SCRAP 分析流程对嵌合体小非编码 RNA(sncRNA)与靶标 RNA 测序文库进行实际分析时的技巧与操作步骤。研究表明,SCRAP 在检测 sncRNA 与靶标 RNA 相互作用方面优于其他嵌合 RNA 分析平台6,13。这可能归因于 SCRAP 所特有的峰识别(peak calling)功能,该功能专门设计用于识别在嵌合 RNA 形成过程中因生化步骤而产生的特征(例如 3' 肩状峰)。针对其他不同生化方法(如...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

我们感谢Meffert实验室成员的有益讨论,特别是BH Powell和WT Mills IV,他们对描述本流程的安装与实施提供了宝贵的反馈意见。本研究工作得到了Braude基金会奖项、马里兰干细胞研究基金启动计划、Blaustein疼痛研究与教育基金奖,以及美国国立神经疾病与中风研究所(NINDS RO1NS103974)和美国国立精神卫生研究所(NIMH RO1MH129292)向M.K.M.提供的资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
基因组UCSC 基因组浏览器无https://genome.ucsc.edu/ 或 https://www.ncbi.nlm.nih.gov/data-hub/genome/
LinuxLinux推荐使用 Ubuntu 20.04 或 22.04 LTS
MacAppleMac OSX (>11)
平台设置GitHub无https://github.com/Meffert-Lab/SCRAP/blob/main/PLATFORM-SETUP.md]
SCRAP 分析流程GitHub无https://github.com/Meffert-Lab/SCRAP
Unix shellUnix 操作系统bash >=5.0
Unix shellUnix 操作系统zsh(推荐版本 5.9)
WindowsWindowsWSL Ubuntu 20.04 或 22.04 LTS

参考文献

  1. Morris, K. V., Mattick, J. S. The rise of regulatory RNA. Nature Reviews Genetics. 15 (6), 423-437 (2014).
  2. Li, X., Jin, D. S., Eadara, S., Caterina, M. J., Meffert, M. K. Regulation by noncoding RNAs of local translation, injury responses, and pain in the peripheral nervous system. Neurobiology of Pain (Cambridge, Mass.). 13, 100119(2023).
  3. Shi, J., Zhou, T., Chen, Q. Exploring the expanding universe of small RNAs. Nature Cell Biology. 24 (4), 415-423 (2022).
  4. Broughton, J. P., Lovci, M. T., Huang, J. L., Yeo, G. W., Pasquinelli, A. E. Pairing beyond the seed supports microRNA targeting specificity. Molecular Cell. 64 (2), 320-333 (2016).
  5. Grosswendt, S., et al. Unambiguous identification of miRNA:target site interactions by different types of ligation reactions. Molecular Cell. 54 (6), 1042-1054 (2014).
  6. Mills, W. T., Eadara, S., Jaffe, A. E., Meffert, M. K. SCRAP: a bioinformatic pipeline for the analysis of small chimeric RNA-seq data. RNA. 29 (1), 1-17 (2023).
  7. Helwak, A., Kudla, G., Dudnakova, T., Tollervey, D. Mapping the human miRNA interactome by CLASH reveals frequent noncanonical binding. Cell. 153 (3), 654-665 (2013).
  8. Hoefert, J. E., Bjerke, G. A., Wang, D., Yi, R. The microRNA-200 family coordinately regulates cell adhesion and proliferation in hair morphogenesis. Journal of Cell Biology. 217 (6), 2185-2204 (2018).
  9. Moore, M. J., Zhang, C., Gantman, E. C., Mele, A., Darnell, J. C., Darnell, R. B. Mapping Argonaute and conventional RNA-binding protein interactions with RNA at single-nucleotide resolution using HITS-CLIP and CIMS analysis. Nature Protocols. 9 (2), 263-293 (2014).
  10. Bjerke, G. A., Yi, R. Integrated analysis of directly captured microRNA targets reveals the impact of microRNAs on mammalian transcriptome. RNA. 26 (3), 306-323 (2020).
  11. Reuter, J. S., Mathews, D. H. RNAstructure: software for RNA secondary structure prediction and analysis. BMC Bioinformatics. 11 (1), 129(2010).
  12. Moore, M. J., et al. miRNA-target chimeras reveal miRNA 3′-end pairing as a major determinant of Argonaute target specificity. Nature Communications. 6 (1), 8864(2015).
  13. Travis, A. J., Moody, J., Helwak, A., Tollervey, D., Kudla, G. Hyb: a bioinformatics pipeline for the analysis of CLASH (crosslinking, ligation and sequencing of hybrids) data. Methods (San Diego, Calif.). 65 (3), 263-273 (2014).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

嵌合RNA测序靶RNA相互作用计算分析流程SCRAP软件峰识别参考基因组miRNA相互作用基因组可视化