本方案描述了一种用于绘制前体mRNA 3'端加工位点的方法。
本方案描述了一种用于绘制前体mRNA 3'端加工位点的方法。
过去十年的研究揭示了前体mRNA切割和多聚腺苷酸化反应的复杂性和动态多样性。在分化细胞中会产生具有较长3'非翻译区(UTR)的mRNA,而增殖细胞则优先表达具有较短3'UTR的转录本。本文介绍了A-seq方案(现为第二版),该方案旨在全基因组范围内定位多聚腺苷酸化位点,并研究前体mRNA 3'端加工的调控机制。本方案还利用了在大多数哺乳动物mRNA生物合成过程中添加的多聚腺苷酸(poly(A))尾,以富集完全加工成熟的mRNA。一种在第四个位置含有脱氧尿嘧啶的DNA接头,可实现mRNA 3'端片段在测序前的精确处理。不包括细胞培养和过夜连接步骤,该实验方案约需8小时的动手操作时间。同时,我们还提供了一套易于使用的软件工具包,用于分析所产生的测序数据。A-seq2及其配套分析软件为在多种实验条件下(低至106个或更少的细胞)高效、可靠地绘制前体mRNA 3'端图谱提供了完整的解决方案。
捕获并测序 mRNA 的 3' 末端可用于研究 mRNA 的加工过程以及基因表达水平的定量。由于具有 poly(A) 尾巴,真核生物的 mRNA 可通过连接在磁珠上的寡聚脱氧胸苷酸(oligo(dT))分子从全细胞裂解液中高效富集,这类分子还可作为 cDNA 合成的引物。然而,该方法存在两个缺点:第一,转录本内部存在的连续 A 序列也可能引发 cDNA 合成,导致出现虚假的 poly(A) 位点;第二,均一的 poly(A) 序列在测序过程中会带来特殊挑战,且对转录本的鉴定并无信息价值。为克服这些局限性,已提出多种方法,例如:通过 poly(A) 尾巴进行逆转录后使用 RNase H 消化(3P-seq 1)、采用末端含有 20 个 T 的定制测序引物(2P-seq 2)、利用 CU5T45 引物预先筛选 poly(A) 尾巴长度超过 50 个核苷酸的 RNA 片段,随后进行 RNase H 消化(3'READS 3),以及使用包含 3' 接头的发夹结构 oligo-dT 引物(A-seq 4)。
最近开发的 A-seq2 方法5旨在避免对poly(A)尾进行测序,同时最大限度地减少接头自连所形成的二聚体比例,尤其是在接头摩尔浓度过高而超过插入片段浓度时容易发生此类问题。在A-seq2中,两个接头均连接到相同类型的多核苷酸末端,即3'接头连接至RNA片段的5'端,5'接头则在逆转录后连接至cDNA的5'端,从而消除了这一问题。该方法比我们先前提出的A-seq更为便捷——在A-seq中测序方向为5'到3',因此需要精确控制RNA的片段化程度——同时仍保持了较高的poly(A)位点鉴定准确性。在典型样本中,约80%的测序读段可唯一比对到基因组,能够鉴定出超过20,000个poly(A)位点簇,其中超过70%与已注释的3'非翻译区(3'UTR)重叠。
简而言之,A-seq2 实验流程首先对 mRNA 进行片段化,然后将反向互补的 3' 接头连接至 RNA 片段的 5' 端。接着,使用一段长度为 25 个核苷酸(nt)的寡聚(dT)引物对含有 poly(A) 的 RNA 进行逆转录,该引物在 3' 端含有一个锚定核苷酸,在第 4 位含有一个 dU,5' 端带有生物素,从而使 cDNA 能够结合到磁性链霉亲和素珠上。通过 USER 酶混合物(包含尿嘧啶 DNA 糖基化酶(UDG)和 DNA 糖基化酶-裂解酶 VIII)在 dU 位点进行切割,可将包括生物素在内的大部分引物从 cDNA 上去除。该反应保留了完整的末端,以便连接 5' 接头,而切割后留下的三个 T 则标记了 poly(A) 尾的位置。由于 5' 和 3' 接头均通过连接反应连接至受体 RNA 片段的 5' 端,因此不会产生接头二聚体。在测序读段起始处引入的四核苷酸随机序列可帮助在当前最先进的测序仪器上实现簇识别,也可作为唯一的分子标识符(UMI),用于识别并去除 PCR 扩增过程中产生的假象。UMI 的长度还可进一步增加,如其他研究中所采用的方法6。该流程生成的测序读段与 mRNA 的 3' 末端呈反向互补关系,所有读段均以一个随机四聚体开头,随后是三个 T。对于 5' 端含有这三个特征性 T 的读段,其分析流程首先利用 UMI 校正 PCR 扩增假象,随后去除 3' 接头序列,并进行反向互补转换。那些可能源于寡聚(dT)在内部富含 A 位点发生非特异性引物结合的读段,也可通过计算方法识别并予以剔除。这些非特异性位点通常缺少 18 个已被充分表征且保守的 poly(A) 信号之一,而这些信号应位于明显切割位点上游约 21 个核苷酸处7。
该实验方案需要约8小时的动手操作时间,不包括细胞培养和过夜连接反应。配套的读段分析软件能够实现高精度的poly(A)位点鉴定。基于本文进一步重点分析的4个样本(对照siRNA和si-HNRNPC处理细胞的两个生物学重复)所生成的poly(A)位点簇中,84%与已注释的基因重叠;在这些位点中,75%与3'非翻译区(3' UTR)重叠,86%与3' UTR或末端外显子重叠。重复样本间3'端表达水平的皮尔逊相关系数为0.92,该方法通常可获得高于0.9的相关性值。因此,A-seq2是一种操作便捷且结果高度可重复的方法。
1. 细胞培养与 mRNA 分离
2. 5'端磷酸化与DNase处理
3. 使用虫草素三磷酸阻断3'末端
注意:必须封闭RNA片段的3'末端,以避免其在后续连接反应中发生串联连接。对于水解后尚未被(环状)磷酸基团封闭的3'末端,可在多聚(A)聚合酶的作用下,通过添加3'脱氧腺苷三磷酸(虫草素三磷酸)链终止核苷酸来实现封闭。本实验中使用的酵母多聚(A)聚合酶(yPAP)按文献8所述方法表达并纯化,使用浓度为0.5 mg/mL。酵母或E. coli的PAP在添加3'dATP方面具有几乎相同的活性,均可从商业途径获得(见材料表)。
4. 将反向3'接头连接至RNA片段的5'端
5. 逆转录(RT)
6. 使用尿嘧啶DNA糖基化酶酶混合物进行消化
7. 将5'接头连接至cDNA的5'末端
8. 预实验PCR、文库扩增与片段大小筛选
9. 数据处理
注意:所获得的测序数据(fastq 格式)需使用 GitLab 仓库(https://git.scicore.unibas.ch/zavolan_public/A-seq2-processing)中提供的软件进行处理。分析包括四个主要步骤:(1)下载 Git 仓库,(2)建立虚拟环境,(3)在配置文件中设置特定参数,以及(4)通过 ‘snakemake’ 启动分析10。第 4 步中的全部分析仅需执行一条命令即可完成。详细的逐步操作说明可在 GitLab 仓库的 README 文件中找到,以下提供简要说明。所有独立的数据处理步骤均通过执行公开可用的工具完成,这些工具或来自外部资源,或为实验室内部开发。该计算流程依赖于基于 anaconda11 的 Python 3 虚拟环境,并需安装 snakemake 软件包10。该流程可在运行类 Unix 操作系统的计算机上执行,已在安装 CentOS 6.5 操作系统并配备 40 GB 内存的 Linux 环境中完成测试。软件依赖项由虚拟环境自动管理。以下公开可用的软件工具为必需组件,将在环境配置过程中一并安装:snakemake (v3.9.1)10、fastx toolkit (v0.0.14)12、STAR (v2.5.2a)13、cutadapt (v1.12)14、samtools (v1.3.1)14,15、bedtools (v2.26.0)16,17。
从培养细胞中分离出含 poly(A) 的 RNA,通过碱性水解将其片段化,并使用寡核苷酸(dT)引物通过逆转录合成 cDNA。将所得 cDNA 固定在链霉亲和素磁珠上,在尿嘧啶特异性切除反应中切除 dU,将接头连接至切割片段的 5' 和 3' 末端,然后对插入片段进行测序。图 1 展示了该实验的图解流程。
对于 HeLa 和 HEK293 细胞,106 个细胞足以在实验结束时鉴定出绝大多数蛋白质编码基因的 poly(A) 位点。然而,对于其他细胞类型或组织,可能需要检测随着实验中使用细胞数量的增加,所鉴定出的 poly(A) 位点数量是否达到饱和。测序前样本的初步 PCR 步骤及 DNA 片段分析的代表性结果见图 2。
图3展示了计算分析的预处理步骤,从测序仪获得的fastq文件开始,到经过质量检查和接头序列修剪后可用于基因组比对的测序读段结束。图4展示了分析步骤,从将测序读段比对到相应基因组开始,最终生成在特定样本中鉴定出的mRNA 3'端加工位点目录。当分析多个样本时,还需进行额外步骤,以匹配各个样本中发现的3'端加工位点,并报告其在不同样本间的丰度。这些步骤如图5所示。
因此,一旦样本完成测序,通过现有的数据处理流程对产生的测序读段文件(fastq 格式)进行分析就十分直接。在将样本相关信息添加至配置文件后,执行该流程将生成两类主要的输出文件:1)BED 文件,包含在各个样本中鉴定出的所有 3' 端加工位点;例如 “sample1.3pSites.noIP.bed.gz”)以及一个包含研究中所有样本的全部poly(A)位点簇的BED文件(clusters.merged.bed)。输出结果还包括来自每个独立样本的所有测序读段的基因组坐标例如 “sample1.STAR_out/Aligned.sortedByCoord.out.bam”,之后可在IGV等基因组浏览器中查看16通过目视检查读长谱图,通常可以初步了解基因组中 poly(A) 位点的分布情况,以及在研究中实施特定扰动后发生的变化。例如,在 图6 HNRNPC 蛋白敲低对特定基因的响应情况如图所示。
这些基因组范围分布的汇总信息也已提供(表1)。具体而言,“counts/annotation_overlap”目录中的输出文件包含与特定注释特征重叠的位点比例(来自作为输入提供的gtf文件;注释类别包括:3'非翻译区、末端外显子、外显子、内含子、基因间区)。此外,对于每个样本,各个处理步骤的结果也被保存(例如“sample1.summary.tsv”),其中包括以下各项的数量:每个样本中的原始读段数、具有预期5'端结构的读段数、去除完整PCR重复序列后剩余的读段数、根据步骤9.2中定义的标准筛选出的高质量读段数、唯一比对到基因组的读段数(在去除了由测序错误导致的重复读段后,参见步骤9.5)、多重比对读段数(同样在去除了由测序错误导致的重复读段后,参见步骤9.5)、每个样本中原始的(未聚类的)3'端加工位点数、排除潜在内部引物结合候选位点后的原始3'端加工位点数、来自所有样本且排除内部引物结合候选位点的唯一3'端加工位点数,以及最终的多聚腺苷酸化位点簇集合。

图1:A-seq2方案的主要步骤。 各个步骤在图的左侧标出。插入的RNA片段用绿色线条表示,在逆转录生成cDNA后变为红色;接头以浅蓝色或橙色表示。请点击此处查看该图的放大版本。

图2:初步PCR及最终产物分析图谱。 (a)在不同循环阶段取PCR反应等分试样,并在2%琼脂糖凝胶上进行分离。左侧数字表示DNA标准片段长度(单位:核苷酸)。本实验中选择12个循环(*)用于大规模PCR反应。(b)经片段大小选择后,使用片段分析仪检测样品的示例,结果显示平均长度约为280个核苷酸。左侧数字[FU]表示相对信号强度。请点击此处查看该图的放大版本。

图 3:测序读段预处理流程示意图。 由测序仪器配套软件生成的 fastq 文件经过处理,以识别出可用于比对至相应基因组的高质量读段。该图展示了流程中各个步骤的输入/输出规范,并链接至“数据处理”部分所述实验方案的各个具体步骤。请点击此处查看此图的放大版本。

图4:序列读段处理流程概览,从基因组比对到生成个体3'端加工位点。 该图展示了流程中各个步骤的输入/输出规范,并链接至“数据处理”部分所述协议的各个具体步骤。提供给用户的主要输出文件以粗体标出。 请点击此处查看该图的放大版本。

图5:生成共调控3'端测序位点聚类的步骤概览。 该图展示了流程中各个步骤的输入/输出规范,并链接至“数据处理”部分所述方案中的各个具体步骤。主要输出文件以粗体标出。 请点击此处查看该图的放大版本。

图6:NUP214 基因末端外显子上 3'端加工读段分布的示例结果,显示于 IGV 16 基因组浏览器中。A-seq2 读段来自两份 HEK 293 细胞样本,分别用对照 siRNA 或 HNRNPC siRNA 处理。分析流程中注释的多聚腺苷酸化位点对应的读段以 BAM 格式保存,并作为输入载入 IGV 基因组浏览器。读段峰的 3'端对应于 Ensembl 数据库中注释的 mRNA 3'端。图示谱表明,在 HNRNPC 敲低后,长 3'非翻译区(UTR)异构体的使用增加。请点击此处查看该图的放大版本。
| 对照 siRNA 重复 1 | 对照 siRNA 重复 2 | |
| 编号: 29765 | 编号: 32682 | |
| 原始读段数量 | 44210258 | 68570640 |
| 剪切与过滤后有效读段数量 | 14024538 | 21211793 |
| 唯一比对读段数量 | 6953674 | 13946436 |
| 比对至多个位点的读段数量 | 2040646 | 2925839 |
| 独立的 3' 端加工位点数量 | 1107493 | 1710353 |
表1:分析流程的示例输出结果。 各个步骤中获得的读段数据汇总。
参与pre-mRNA 3'端加工的大量核心和辅助因子反映在相应复杂的多聚腺苷酸化图谱中。此外,多聚腺苷酸化还对转录和剪接等其他过程的变化产生响应。pre-mRNA中的3'端切割位点通常基于添加到5'切割产物上的特征性poly(A)尾来鉴定。大多数方法使用长度可变的oligo(dT)引物,在逆转录反应中特异性地将含有poly(A)的mRNA转化为cDNA。该方法的一个常见问题是由于内部引物与富含A的序列结合,导致产生人为的切割位点。已有两种旨在在样品制备阶段规避此人为效应的方法被提出。在3P-seq方法1中,借助splint寡核苷酸将接头特异性连接至poly(A)尾末端,随后进行部分RNase T1消化,并在仅含有TTP作为脱氧核苷酸的条件下进行逆转录。所形成的poly(A)-poly(dT)异源双链随后被RNase H消化,剩余的RNA片段被分离、连接接头并进行测序。同一批研究人员报道了一种更简单且巧妙的方法——2P-seq,该方法使用定制的测序引物,在测序反应中跳过残留的oligo(dT)序列2。在另一种相关方法3'READS3中,使用一条异常长的引物(5个U和45个T),该引物还含有生物素,与片段化的RNA退火,随后通过严格洗涤筛选出具有超过50个核苷酸poly(A)尾的RNA分子。尽管3'READS显著降低了内部引物结合的频率,但并未完全消除该问题3。也有研究提出了直接RNA测序的方案,但所产生的读长较短且错误率较高,因此该方法未被进一步发展18,19,20。PolyA-Seq和商业化Quant Seq方案将基于oligo(dT)的引物与cDNA第二链合成中的随机引物步骤相结合20。在PAS-Seq和SAPAS方法中,使用Moloney Murine Leukemia Virus(MMLV)逆转录酶进行模板转换逆转录反应,可在单步中生成带有连接子的cDNA,从而避免产生接头二聚体21,22。
本文介绍的 A-seq2 方法具有显著特点,即在生物素标记的寡核苷酸(dT)引物中使用了一种可切割的核苷酸(dU)。该修饰结合了富集与寡核苷酸(dT)杂交的polyadenylated靶标的优势,并在文库构建前去除了大部分寡核苷酸(dT)25序列,同时保留了三个T碱基,以指示此前存在poly(A)尾的特征。相比之下,使用RNase H去除RNA分子中poly(A)尾的方法会随机残留多个A碱基。由于在A-seq2中测序是从反义链的3'端开始的,因此切割位点预计位于原始测序读段起始处NNNNTTT基序之后。随机四聚体不仅有助于碱基识别,还可消除PCR扩增过程中产生的假象。该方法也可容纳更长的UMI序列。A-seq2中仍存在内部引物结合的可能性,需通过计算方法加以处理:首先剔除基因组编码的、下游富含A序列的3'端;然后进一步剔除可由富含A的poly(A)信号本身发生内部引物结合所解释的3'端簇。最近一项基于多种实验方案推断poly(A)位点的研究表明,仅由A-seq2特有检测到的位点在基因中的核苷酸分布和位置均符合预期,与其他3'端测序方法相似。
A-seq2 中的一个关键步骤是选择带有聚腺苷酸尾的 RNA,并去除核糖体 RNA 和各种小 RNA。这最简便的方法是使用含寡聚(dT)25 磁珠的 mRNA 分离试剂盒。原则上,用含苯酚溶液提取的总 RNA 也能获得高质量的 RNA,可进一步通过 mRNA 分离试剂盒或寡聚(dT) 琼脂糖进行筛选。A-seq2 中可以调整的一个步骤是碱性水解处理,通过缩短或延长该步骤可获得不同大小的 RNA 片段。另一个关键点是,多聚(A)聚合酶将 3' dATP 有效添加到 RNA 片段 3' 末端的效率。在本方案中,该处理应用于所有 RNA 片段,以避免连接反应过程中发生串联连接。最后需要指出的是,尽管 RNA 连接酶 1 通常作为 RNA 连接酶使用,但它也能高效连接单链 DNA,正如我们在本实验中将接头连接至 cDNA 分子 5' 末端所采用的方法。
因此,A-seq2 是一种高效且易于实施的前体mRNA 3'端加工位点鉴定方案。未来的发展方向可能包括进一步降低该方案的复杂性以及减少所需材料用量。配套的一套计算数据分析工具还可实现对采用多种不同方案获得的3'端测序读段进行一致性处理。
作者无任何利益冲突需要披露。
作者感谢Béatrice Dimitriades女士在细胞培养方面的帮助。本工作由瑞士国家科学基金会资助,资助编号为#31003A_170216和51NF40_141735(NCCR RNA & Disease)。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 材料 | |||
| 琼脂糖,超纯 | Invitrogen | 16500-500 | |
| 2100 Bioanalyzer | 安捷伦 | G2940CA | |
| 虫草素三磷酸(3’ dATP | SIGMA | C9137 | |
| DNA低吸附离心管,1.5 ml | Eppendorf | 22431021 | |
| 杜尔贝科’磷酸盐缓冲液 | SIGMA | D8637 | |
| Dynabeads mRNA-DIRECT 试剂盒 | Ambion | AM61012 | |
| GR-绿色染料 | Excellgen | EG-1071 | 使用1:10,000稀释度 |
| HiSeq 2500 或 NextSeq 500 高通量测序仪 | Illumina | 咨询供应商 | |
| KAPA HiFi Hotstart DNA 聚合酶混合物 | KAPA/Roche | KK2602 | |
| 无核酸酶水 | Ambion | AM9937 | |
| 酵母多聚腺苷酸聚合酶 | Thermo Fisher Scientific | 74225Z25KU | |
| 大肠杆菌多聚腺苷酸聚合酶 | New England Biolabs | M0276L | |
| 多核苷酸激酶 | Thermo Fisher Scientific | EK0032 | |
| QIAEX II 琼脂糖凝胶回收试剂盒 | Qiagen | 20021 | |
| QIAquick PCR 纯化试剂盒 | Qiagen | 28104 | |
| QIAquick Gel Extraction Kit | Qiagen | 28704 | |
| RNA连接酶1,高浓度 | New England Biolabs | M0437M | 包含 PEG-8000 |
| RNeasy MinElute RNA 纯化试剂盒 | Qiagen | 74204 | |
| RNase H | New England Biolabs | M0279 | |
| RNasin Plus,核糖核酸酶抑制剂 | Promega | N2618 | |
| Superscript IV 逆转录酶 | Thermo Fisher Scientific | 18090050 | |
| Turbo DNase | Ambion | AM2238 | |
| USER 酶混合物 | New England Biolabs | M5505 | |
| Dyna-Mag-2 磁力架 | Thermo Fisher Scientific | 12321D | |
| Thermomixer C | Eppendorf | 5382000015 | 带加热盖的加热混匀仪 |
| MicroSpin 柱 | GE-Healthcare | 27-5325-01 | |
| 名称 | 公司 | 目录号 | 评论 |
| 缓冲液 | |||
| 1.5 倍碱性水解缓冲液 | 将1份0.1 M Na2CO3与9份0.1 M NaHCO3混合,加入EDTA至终浓度1 mM,调节pH至9.2。分装后于-20 °C. | ||
| 5x 多聚腺苷酸聚合酶缓冲液 | Thermo Fisher Scientific | 100 mM Tris-HCl,pH 7.0,3 mM MnCl₂,0.1 mM EDTA,1 mM DTT,0.5 mg/ml 乙酰化 BSA,50% 甘油 | |
| 生物素结合缓冲液 | 20 mM TrisCl pH 7.5,2 M NaCl,0.1% NP40 | ||
| TEN缓冲液 | 10 mM TrisCl,pH 7.5,1 mM EDTA,0.02% NP40 | ||
| 名称 | 公司 | 目录号 | 序列 |
| 根据Illumina TruSeq Small RNA Sample Prep试剂盒设计的寡核苷酸,适用于GA-IIx和Hiseq2000/2500测序仪 | Microsynth | ||
| revRA3(RNA) | Microsynth | 5’ 氨基 CCUUGGCACCCGAGAAUUCCA 3’ | |
| revDA5 | Microsynth | 5’ 氨基 GTTCAGAGTTCTACAGTCCGAC GATCNNNN-3’ | |
| 生物素-dU-dT25,逆转录引物 | Microsynth | 5' 生物素-TTTTTTTTTTTTTTTTTTTTTTTTTT-dU-TTTVN 3'(V = G、A 或 C) | |
| PCR 引物 正向,RP1 | Microsynth | 5' AATGATACGGCGACCACCGAGA TCTACACGTTCAGAGTTCTACAG TCCGA 3' | |
| PCR 引物,反向,RPI1,条形码加粗 | Microsynth | 5' CAAGCAGAAGACGGCATACGAG ATCGTGATGTGACTGGAGTTCCT TGGCACCCGAGAATTCCA 3' | |
| 名称 | 公司 | 目录号 | 评论 |
| 根据Illumina TruSeq HT-Small RNA Sample Prep试剂盒设计的寡核苷酸,适用于HiSeq2000/2500和NextSeq500测序仪 | |||
| HT-rev3A(DNA/RNA) | Microsynth | 5'-氨基-GTGACTGGAGTTCAGACGTGTG CTCTTCCrGrAUrC-3' | |
| HT-rev5A | Microsynth | 5' 氨基-ACACTCTTTCCCTACACGACGCT CTTCCGATCTNNNN 3' | |
| 生物素-dU-dT25,逆转录引物 | Microsynth | 5' 生物素-TTTTTTTTTTTTTTTTTTTTTTTTTT-dU-TTTVN 3' | |
| PCR引物 正向(D501-506) | Microsynth 或 Illumina | 5'-AATGATACGGCGACCACCGAGAT CTACAC[i5]ACACTCTTTCCCTACA CGACGCTCTTCCGATCT -3' | |
| PCR引物 反向(D701-D712) | Microsynth 或 Illumina | 5'-CAAGCAGAAGACGGCATACGAG A[i7]GTGACTGGAGTTCAGACGTG TGCTCTTCCGATC-3' | |
| Illumina 多重测序的说明文档: | Illumina | https://support.illumina.com/content/dam/illumina-support/documents/documentation/chemistry_documentation/experiment-design/illumina-adapter-sequences_1000000002694-01.pdf |