方法文章

使用 A-seq2 进行 3' 端测序文库构建

13.7K 次观看

DOI:

10.3791/56129

2017年10月10日

本文内容

摘要

本方案描述了一种用于绘制前体mRNA 3'端加工位点的方法。

摘要

过去十年的研究揭示了前体mRNA切割和多聚腺苷酸化反应的复杂性和动态多样性。在分化细胞中会产生具有较长3'非翻译区(UTR)的mRNA,而增殖细胞则优先表达具有较短3'UTR的转录本。本文介绍了A-seq方案(现为第二版),该方案旨在全基因组范围内定位多聚腺苷酸化位点,并研究前体mRNA 3'端加工的调控机制。本方案还利用了在大多数哺乳动物mRNA生物合成过程中添加的多聚腺苷酸(poly(A))尾,以富集完全加工成熟的mRNA。一种在第四个位置含有脱氧尿嘧啶的DNA接头,可实现mRNA 3'端片段在测序前的精确处理。不包括细胞培养和过夜连接步骤,该实验方案约需8小时的动手操作时间。同时,我们还提供了一套易于使用的软件工具包,用于分析所产生的测序数据。A-seq2及其配套分析软件为在多种实验条件下(低至106个或更少的细胞)高效、可靠地绘制前体mRNA 3'端图谱提供了完整的解决方案。

引言

捕获并测序 mRNA 的 3' 末端可用于研究 mRNA 的加工过程以及基因表达水平的定量。由于具有 poly(A) 尾巴,真核生物的 mRNA 可通过连接在磁珠上的寡聚脱氧胸苷酸(oligo(dT))分子从全细胞裂解液中高效富集,这类分子还可作为 cDNA 合成的引物。然而,该方法存在两个缺点:第一,转录本内部存在的连续 A 序列也可能引发 cDNA 合成,导致出现虚假的 poly(A) 位点;第二,均一的 poly(A) 序列在测序过程中会带来特殊挑战,且对转录本的鉴定并无信息价值。为克服这些局限性,已提出多种方法,例如:通过 poly(A) 尾巴进行逆转录后使用 RNase H 消化(3P-seq 1)、采用末端含有 20 个 T 的定制测序引物(2P-seq 2)、利用 CU5T45 引物预先筛选 poly(A) 尾巴长度超过 50 个核苷酸的 RNA 片段,随后进行 RNase H 消化(3'READS 3),以及使用包含 3' 接头的发夹结构 oligo-dT 引物(A-seq 4)。

最近开发的 A-seq2 方法5旨在避免对poly(A)尾进行测序,同时最大限度地减少接头自连所形成的二聚体比例,尤其是在接头摩尔浓度过高而超过插入片段浓度时容易发生此类问题。在A-seq2中,两个接头均连接到相同类型的多核苷酸末端,即3'接头连接至RNA片段的5'端,5'接头则在逆转录后连接至cDNA的5'端,从而消除了这一问题。该方法比我们先前提出的A-seq更为便捷——在A-seq中测序方向为5'到3',因此需要精确控制RNA的片段化程度——同时仍保持了较高的poly(A)位点鉴定准确性。在典型样本中,约80%的测序读段可唯一比对到基因组,能够鉴定出超过20,000个poly(A)位点簇,其中超过70%与已注释的3'非翻译区(3'UTR)重叠。

简而言之,A-seq2 实验流程首先对 mRNA 进行片段化,然后将反向互补的 3' 接头连接至 RNA 片段的 5' 端。接着,使用一段长度为 25 个核苷酸(nt)的寡聚(dT)引物对含有 poly(A) 的 RNA 进行逆转录,该引物在 3' 端含有一个锚定核苷酸,在第 4 位含有一个 dU,5' 端带有生物素,从而使 cDNA 能够结合到磁性链霉亲和素珠上。通过 USER 酶混合物(包含尿嘧啶 DNA 糖基化酶(UDG)和 DNA 糖基化酶-裂解酶 VIII)在 dU 位点进行切割,可将包括生物素在内的大部分引物从 cDNA 上去除。该反应保留了完整的末端,以便连接 5' 接头,而切割后留下的三个 T 则标记了 poly(A) 尾的位置。由于 5' 和 3' 接头均通过连接反应连接至受体 RNA 片段的 5' 端,因此不会产生接头二聚体。在测序读段起始处引入的四核苷酸随机序列可帮助在当前最先进的测序仪器上实现簇识别,也可作为唯一的分子标识符(UMI),用于识别并去除 PCR 扩增过程中产生的假象。UMI 的长度还可进一步增加,如其他研究中所采用的方法6。该流程生成的测序读段与 mRNA 的 3' 末端呈反向互补关系,所有读段均以一个随机四聚体开头,随后是三个 T。对于 5' 端含有这三个特征性 T 的读段,其分析流程首先利用 UMI 校正 PCR 扩增假象,随后去除 3' 接头序列,并进行反向互补转换。那些可能源于寡聚(dT)在内部富含 A 位点发生非特异性引物结合的读段,也可通过计算方法识别并予以剔除。这些非特异性位点通常缺少 18 个已被充分表征且保守的 poly(A) 信号之一,而这些信号应位于明显切割位点上游约 21 个核苷酸处7

该实验方案需要约8小时的动手操作时间,不包括细胞培养和过夜连接反应。配套的读段分析软件能够实现高精度的poly(A)位点鉴定。基于本文进一步重点分析的4个样本(对照siRNA和si-HNRNPC处理细胞的两个生物学重复)所生成的poly(A)位点簇中,84%与已注释的基因重叠;在这些位点中,75%与3'非翻译区(3' UTR)重叠,86%与3' UTR或末端外显子重叠。重复样本间3'端表达水平的皮尔逊相关系数为0.92,该方法通常可获得高于0.9的相关性值。因此,A-seq2是一种操作便捷且结果高度可重复的方法。

方案

1. 细胞培养与 mRNA 分离

  1. 根据实验设计在6孔板中培养细胞,使每孔细胞数量达到约1 × 106 个,细胞融合度约为80%。
  2. 吸除培养基,用磷酸盐缓冲液清洗细胞一次。直接向孔板中加入mRNA提取试剂盒提供的1 mL裂解缓冲液进行细胞裂解。使用1 mL移液器吸头将黏稠的裂解液转移至15 mL塑料离心管中,并用橡胶刮刀彻底刮下孔板表面的细胞材料。
  3. 使用连接23 G皮下注射针头的1 mL注射器对含有黏稠DNA的裂解液进行剪切,通过活塞反复快速上下推动数次,直至裂解液不再黏稠。操作时将针头指向离心管底部中央,避免裂解液喷出管外。
  4. 用注射器将裂解液转移至1.5 mL离心管中。在4 °C条件下以20,000 × g离心5分钟,以去除碎片。整个操作流程中均应使用DNA低吸附的1.5 mL离心管。
  5. 在离心过程中,将300 µL重悬的oligo (dT)25 磁珠置于磁力架上,加入500 µL裂解缓冲液洗涤。在磁力架上混匀2–3次。待溶液澄清后吸除缓冲液。收集步骤1.4中所得澄清上清液并加入磁珠中。充分重悬后,将离心管置于旋转仪上孵育10分钟。
  6. 将离心管置于磁力架上,2分钟后吸除上清液。加入0.8 mL mRNA提取试剂盒中的缓冲液A。在磁力架上将离心管翻转180°,混匀2–3次。重复使用缓冲液A洗涤一次。
  7. 按照步骤1.6所述方法,使用0.8 mL缓冲液B对磁珠进行两次洗涤。
  8. 为洗脱结合在磁珠上的mRNA,加入33 µL H2O并重悬磁珠。在加热模块中75 °C孵育5分钟。立即短暂离心1秒后置于磁力架上。将上清液转移至新的离心管中。样品可于-80 °C保存,待后续使用。
  9. 向33 µL mRNA(见步骤1.8)中加入66 µL碱性水解缓冲液,混匀后在加热模块中精确95 °C孵育5分钟。立即置于冰上冷却。
  10. 使用RNA纯化试剂盒进行RNA纯化。
    注意:确认总体积应为100 µL。
    1. 加入试剂盒提供的350 µL RLT缓冲液和250 µL乙醇。将混合液上样至离心柱中,在室温(RT)下以8,000 × g离心30秒。用试剂盒提供的500 µL RPE缓冲液洗涤一次,再用500 µL 80%乙醇洗涤一次。以20,000 × g离心5分钟以彻底干燥离心柱。向离心柱中加入36 µL H2O,以20,000 × g离心1分钟。弃去离心柱,保留洗脱液。

2. 5'端磷酸化与DNase处理

  1. 向样品中加入 5 µL 多核苷酸激酶缓冲液、5 µL 10 mM ATP、1 µL 核糖核酸酶抑制剂、1 µL DNase 和 2 µL 多核苷酸激酶,混匀后于 37 °C 孵育 30 分钟。可选:在整个实验流程中,可通过将每种组分按 1.1 倍体积乘以 n(n = 样品数量)混合,制备主反应混合液。
  2. 使用离心柱更换缓冲液并去除 ATP,以防止下一步发生 poly(A) 加尾反应。
    1. 将离心柱在 735 × g 下预离心 1 分钟。将柱子转移至新的 1.5 mL 离心管中,将激酶反应液上样至柱子中。在 735 × g 下离心 2 分钟。弃去柱子,将收集到反应液的离心管置于冰上或保存于 -80 °C。

3. 使用虫草素三磷酸阻断3'末端

注意:必须封闭RNA片段的3'末端,以避免其在后续连接反应中发生串联连接。对于水解后尚未被(环状)磷酸基团封闭的3'末端,可在多聚(A)聚合酶的作用下,通过添加3'脱氧腺苷三磷酸(虫草素三磷酸)链终止核苷酸来实现封闭。本实验中使用的酵母多聚(A)聚合酶(yPAP)按文献8所述方法表达并纯化,使用浓度为0.5 mg/mL。酵母或E. coli的PAP在添加3'dATP方面具有几乎相同的活性,均可从商业途径获得(见材料表)。

  1. 向步骤 2.2.1 的反应体系中加入 13.5 µL 5 倍浓度的 poly(A) 聚合酶反应缓冲液、2 µL 10 mM 3' dATP、1 µL RNase 抑制剂和 1 µL poly(A) 聚合酶。混匀后瞬时离心 1 秒。在 37 °C 下孵育 30 分钟。向每份反应体系中加入 32.5 µL H2O。按照步骤 1.10.1 的方法纯化 RNA。用 14 µL H2O 洗脱 RNA。

4. 将反向3'接头连接至RNA片段的5'端

  1. 将反应物置于真空浓缩仪中处理 10 分钟,使体积减少至 6 µL。加入 3 µL 10x T4 RNA 连接酶缓冲液、3 µL 10 mM ATP、15 µL PEG­-8000、1 µL RNase 抑制剂、1 µL 0.1 mM 反向互补 3' 接头 "revRA3"(参见材料表)以及 1 µL 高浓度 RNA 连接酶 1,混匀。
  2. 在加热振荡器中于 24 °C 孵育反应体系 16 小时,期间以 1,000 rpm 间歇性混匀。向每个反应体系中加入 70 µL H2O 并混匀。按步骤 1.10.1 的方法纯化 RNA,用 14 µL H2O 洗脱 RNA。样品可在此时于 -80 °C 保存。

5. 逆转录(RT)

  1. 将洗脱液置于真空浓缩仪中浓缩3分钟,使体积减少至11 µL。将反应液转移至200 µL PCR管中。加入1 µL 0.05 mM RT引物"Bio-dU-dT25"。在PCR仪中于70 °C加热5分钟,随后在室温下放置5分钟。
  2. 加入1 µL 10 mM dNTPs、4 µL 5×逆转录酶缓冲液、1 µL 0.1 M DTT、1 µL RNase抑制剂和1 µL逆转录酶。混匀后,在PCR仪中先于55 °C加热10分钟,再于80 °C加热10分钟。反应完成后置于冰上,或长期保存时置于-80 °C。

6. 使用尿嘧啶DNA糖基化酶酶混合物进行消化

  1. 用移液器将100 µL链霉亲和素磁珠加入1.5 mL离心管中,加入800 µL生物素结合缓冲液重悬,并置于磁力架上。上下颠倒离心管2–3次。待溶液澄清后弃去上清液。重复洗涤步骤一次。将磁珠重悬于200 µL生物素结合缓冲液中。
  2. 将反转录反应液加入磁珠悬液中,在4 °C旋转仪上孵育20分钟。参照步骤6.1的方法,用生物素结合缓冲液洗涤磁珠2次,再用TEN缓冲液在磁力架上洗涤2次。将磁珠重悬于50 µL TEN缓冲液中,加入2 µL尿嘧啶DNA糖基化酶酶混合液,在37 °C混合仪中孵育1小时,期间间歇性混匀。
  3. 向反应体系中加入50 µL H2O、11 µL RNase H缓冲液和1 µL RNase H。在37 °C孵育20分钟。将离心管置于磁力架上,将含有切割后cDNA的液体转移至新的离心管中。
  4. 纯化切割后的cDNA。
    1. 向切割反应液中加入550 µL PCR纯化试剂盒中的PB缓冲液。加入10 µL 3 M乙酸钠(pH 5.2)以降低pH值。将反应液加载至最小洗脱体积的离心柱中,在17,000 × g离心1分钟。
    2. 向离心柱中加入750 µL PE缓冲液,在17,000 × g离心1分钟。弃去穿流液。再次在17,000 × g离心1分钟以干燥离心柱。将离心柱转移至1.5 mL离心管中,加入16 µL H2O,在17,000 × g离心1分钟。将收集的反应液置于真空浓缩仪中浓缩8分钟,使终体积约为7 µL。

7. 将5'接头连接至cDNA的5'末端

  1. 向分离的 cDNA 中加入 3 µL 10x T4 RNA 连接酶 1 缓冲液、3 µL 10 mM ATP、15 µL PEG­-8000、1 µL 50 µM "revDA5" 寡核苷酸和 1 µL 高浓度 T4 RNA 连接酶 1。在 24 °C 下孵育 20 小时。每项反应中加入 70 µL H2O。样品可在此时于 -20 °C 保存。

8. 预实验PCR、文库扩增与片段大小筛选

  1. 在预实验中,确定使文库扩增处于指数扩增阶段的最佳PCR循环数。
    1. 移液25 µL DNA聚合酶混合液、20 µL连接反应液、2 µL H2O,将1.5 µL 10 µM 正向PCR引物(RP1)和1.5 µL 10 µM 反向PCR索引引物加入200 µL PCR管中。
    2. 使用以下程序运行PCR仪:95 °C 3分钟,随后进行20个循环,每循环包括98 °C 20秒、67 °C 20秒和72 °C 30秒。在第6、8、10、12、14、16和18个循环后,直接从PCR仪中取出7 µL等分试样。每份试样加入1 µL 10x上样缓冲液(50%甘油,0.05%二甲苯蓝腈)。 注意:若在组合条形码时使用多重扩增,请遵循试剂供应商的建议。
    3. 在含有1:10,000稀释的荧光绿色染料的1x TBE缓冲液中,用2%琼脂糖凝胶将产物在小孔中分离。
      1. 将等份样品加入2%琼脂糖凝胶中,以100伏电压电泳15分钟。使用凝胶成像系统观察PCR产物的迁移情况。
  2. 使用预实验反应中指数扩增初期的循环数,进行大规模PCR反应,其反应体系体积为预实验反应的两倍(图2).
    1. 对于大规模PCR反应,首先使用PCR纯化试剂盒对反应产物进行浓缩和脱盐,然后在1x TBE缓冲液中的2%琼脂糖凝胶的宽样品孔中分离产物。
  3. 切下含有200–350 nt DNA产物的凝胶片段。在变性缓冲液中室温下溶解凝胶,时间不超过30分钟。使用凝胶回收试剂盒从凝胶片段中提取DNA。避免加热至50 °C,以防止富含A的DNA在结合过程中产生偏好性偏差。 9.
  4. 提交测序。
    注意:通常,50个循环的单端测序(SR50)已足够(参见, 例如,https://www.illumina.com/technology/next-generation-sequencing.html)

9. 数据处理

注意:所获得的测序数据(fastq 格式)需使用 GitLab 仓库(https://git.scicore.unibas.ch/zavolan_public/A-seq2-processing)中提供的软件进行处理。分析包括四个主要步骤:(1)下载 Git 仓库,(2)建立虚拟环境,(3)在配置文件中设置特定参数,以及(4)通过 ‘snakemake’ 启动分析10。第 4 步中的全部分析仅需执行一条命令即可完成。详细的逐步操作说明可在 GitLab 仓库的 README 文件中找到,以下提供简要说明。所有独立的数据处理步骤均通过执行公开可用的工具完成,这些工具或来自外部资源,或为实验室内部开发。该计算流程依赖于基于 anaconda11 的 Python 3 虚拟环境,并需安装 snakemake 软件包10。该流程可在运行类 Unix 操作系统的计算机上执行,已在安装 CentOS 6.5 操作系统并配备 40 GB 内存的 Linux 环境中完成测试。软件依赖项由虚拟环境自动管理。以下公开可用的软件工具为必需组件,将在环境配置过程中一并安装:snakemake (v3.9.1)10、fastx toolkit (v0.0.14)12、STAR (v2.5.2a)13、cutadapt (v1.12)14、samtools (v1.3.1)14,15、bedtools (v2.26.0)16,17

  1. 从测序读段到cDNA的数据预处理
    注意:测序深度在不同运行之间可能有所不同,且根据所用仪器的不同,一个样本的数据可能分布在多个序列文件中。如果出现这种情况,请将对应于同一样本的文件合并为一个输入文件,用于后续步骤。
    1. 将文件从fastq格式转换为fasta格式。
    2. 提取具有正确结构的读段(读段第5、6和第7位为三个胸腺嘧啶)。
      注意:根据上述实验方案正确制备的读段应具有如下结构(从5'端开始):4个核苷酸的条形码 - 3个胸腺嘧啶 - 转录本3'端的反向互补序列。
    3. 将起始四聚体的信息存储在序列描述行中。
      注意:该四聚体作为唯一的分子标识符(UMI),有助于在后续分析中校正扩增伪影。
    4. 从读段的5'端去除前七个核苷酸。
    5. 通过仅保留具有相同插入序列和UMI的读段的一个拷贝,校正扩增伪影。
    6. 去除与接头序列匹配的3'端部分,然后对序列进行反向互补。仅保留最小长度以上的读段(默认值:15 nt)。
      注意:根据原始mRNA片段的长度和测序循环次数,读段的3'端可能包含部分3'接头序列,此步骤将去除该部分。
  2. 提取满足以下所有条件的读段:最多包含2个未知核苷酸('N'),A碱基比例不超过80%,且读段最后一个核苷酸不是A。这些读段被认为质量足够高,可用于分析。
  3. 使用能够处理剪接读段并生成BAM格式输出文件的工具将读段比对到基因组。
    1. 如果使用STAR,需创建一个包含待比对基因组索引的文件。对于人类基因组,此步骤需要35 GB内存(RAM)。
    2. 将读段比对到基因组。
      注意:(STAR特异性说明)禁用软剪切(soft-clipping),以强制每个读段的3'端完成比对,因为该核苷酸紧邻切割位点的上游。
  4. 将BAM文件转换为BED文件。如果一个读段比对到多个位置,仅保留编辑距离最小的比对结果。
    注意:以比对到特定位置的读段拷贝数作为评分。对于比对到多个位置的读段,在每个位置按权重1/比对位置总数进行分数分配,即在各位置上分数为分数的分数形式。
  5. 合并可能由测序错误导致差异的读段。若两个不同的读段比对到相同位置(比对的起始和终止位置完全一致)且具有相同的UMI,则视为PCR重复,仅保留其中一个。
  6. 推断所有独立的pre-mRNA 3'端加工位点。
    注意:当一个读段的最后四个核苷酸无错配地比对到基因组时,即为3'端存在的证据。读段3'端比对到的基因组位置被记录为切割位点。
  7. 检测可能由内部引物引发产生的3'端位点。若切割位点下游10个核苷酸满足以下任一条件,则定义为内部引物伪影:包含超过六个A碱基、包含连续六个A碱基,或以以下四聚体之一开头:AAAA、AGAA、AAGA、AAAG。
  8. 生成以BED格式表示的独立3'端加工位点表格。
  9. 识别独立调控的多聚腺苷酸化(poly(A))位点簇。
    注意:此处描述的步骤遵循先前发表的研究中提出的方法5
    1. 首先收集本研究中所有样本获得的独立3'端加工位点。
    2. 在每个独立3'端加工位点上下游-60至+10核苷酸区域内注释已知的poly(A)信号7
    3. 按如下方式识别在各样本中表达水平高于背景的poly(A)位点。
      1. 按当前样本中的原始表达量对位点进行排序。从列表顶部到底部遍历,若低排名位点与高排名位点在基因组上的距离在预设范围内(默认值:上游或下游25 nt以内),则将其归入该高排名位点所属的簇。
        注意:所有与高排名位点关联的低排名位点共同定义一个簇,其表达量为支持所有这些位点的读段总数。
      2. 按表达量对这些簇进行排序,并从高到低遍历簇列表,确定当具有注释poly(A)信号的簇所占百分比降至预设阈值以下(默认值:90%)时的表达量阈值c
      3. 剔除低于该阈值的任何簇中的位点。
    4. 跨样本聚类空间上邻近的3'端位点。
      注意:首先按支持该位点的样本数量排序,然后按跨样本标准化读段数(每百万读段数,RPM)之和排序3'端加工位点。从列表顶部到底部遍历,当低排名位点与高排名位点的距离不超过预设限值(默认值:12 nt)时,将其归入该高排名位点的簇。若任一组成3'端位点与注释的poly(A)信号重叠,或其紧邻下游存在poly(A)信号,则将相应簇标记以进一步检查是否存在内部引物伪影。
    5. 合并poly(A)位点簇。
      注意:若一个簇被标记为潜在的内部引物候选,则:若两个簇共享相同的poly(A)信号,则将其合并至下游簇;否则,若该簇中最下游的位点其poly(A)信号位于其上游至少一定距离处(默认值:15 nt),则保留该簇。最后,若满足以下任一条件,则合并空间上邻近的簇:(i) 它们共享相同的poly(A)信号;(ii) 合并后簇的跨度不超过最大值(默认值:25 nt)。
    6. 以BED文件格式存储簇,每个簇的评分为其包含的所有3'端位点的总标准化读段数。

结果

从培养细胞中分离出含 poly(A) 的 RNA,通过碱性水解将其片段化,并使用寡核苷酸(dT)引物通过逆转录合成 cDNA。将所得 cDNA 固定在链霉亲和素磁珠上,在尿嘧啶特异性切除反应中切除 dU,将接头连接至切割片段的 5' 和 3' 末端,然后对插入片段进行测序。图 1 展示了该实验的图解流程。

对于 HeLa 和 HEK293 细胞,106 个细胞足以在实验结束时鉴定出绝大多数蛋白质编码基因的 poly(A) 位点。然而,对于其他细胞类型或组织,可能需要检测随着实验中使用细胞数量的增加,所鉴定出的 poly(A) 位点数量是否达到饱和。测序前样本的初步 PCR 步骤及 DNA 片段分析的代表性结果见图 2

图3展示了计算分析的预处理步骤,从测序仪获得的fastq文件开始,到经过质量检查和接头序列修剪后可用于基因组比对的测序读段结束。图4展示了分析步骤,从将测序读段比对到相应基因组开始,最终生成在特定样本中鉴定出的mRNA 3'端加工位点目录。当分析多个样本时,还需进行额外步骤,以匹配各个样本中发现的3'端加工位点,并报告其在不同样本间的丰度。这些步骤如图5所示。

因此,一旦样本完成测序,通过现有的数据处理流程对产生的测序读段文件(fastq 格式)进行分析就十分直接。在将样本相关信息添加至配置文件后,执行该流程将生成两类主要的输出文件:1)BED 文件,包含在各个样本中鉴定出的所有 3' 端加工位点;例如 “sample1.3pSites.noIP.bed.gz”)以及一个包含研究中所有样本的全部poly(A)位点簇的BED文件(clusters.merged.bed)。输出结果还包括来自每个独立样本的所有测序读段的基因组坐标例如 “sample1.STAR_out/Aligned.sortedByCoord.out.bam”,之后可在IGV等基因组浏览器中查看16通过目视检查读长谱图,通常可以初步了解基因组中 poly(A) 位点的分布情况,以及在研究中实施特定扰动后发生的变化。例如,在 图6 HNRNPC 蛋白敲低对特定基因的响应情况如图所示。

这些基因组范围分布的汇总信息也已提供(表1)。具体而言,“counts/annotation_overlap”目录中的输出文件包含与特定注释特征重叠的位点比例(来自作为输入提供的gtf文件;注释类别包括:3'非翻译区、末端外显子、外显子、内含子、基因间区)。此外,对于每个样本,各个处理步骤的结果也被保存(例如“sample1.summary.tsv”),其中包括以下各项的数量:每个样本中的原始读段数、具有预期5'端结构的读段数、去除完整PCR重复序列后剩余的读段数、根据步骤9.2中定义的标准筛选出的高质量读段数、唯一比对到基因组的读段数(在去除了由测序错误导致的重复读段后,参见步骤9.5)、多重比对读段数(同样在去除了由测序错误导致的重复读段后,参见步骤9.5)、每个样本中原始的(未聚类的)3'端加工位点数、排除潜在内部引物结合候选位点后的原始3'端加工位点数、来自所有样本且排除内部引物结合候选位点的唯一3'端加工位点数,以及最终的多聚腺苷酸化位点簇集合。

RNA测序流程图,显示片段化、接头连接、逆转录和PCR。
图1:A-seq2方案的主要步骤。 各个步骤在图的左侧标出。插入的RNA片段用绿色线条表示,在逆转录生成cDNA后变为红色;接头以浅蓝色或橙色表示。请点击此处查看该图的放大版本。

PCR扩增结果;凝胶电泳图谱与荧光强度图;DNA分析。
图2:初步PCR及最终产物分析图谱。a)在不同循环阶段取PCR反应等分试样,并在2%琼脂糖凝胶上进行分离。左侧数字表示DNA标准片段长度(单位:核苷酸)。本实验中选择12个循环(*)用于大规模PCR反应。(b)经片段大小选择后,使用片段分析仪检测样品的示例,结果显示平均长度约为280个核苷酸。左侧数字[FU]表示相对信号强度。请点击此处查看该图的放大版本。

FASTQ 转 FASTA 流程;用于序列处理和 UMI 处理的生物信息学工作流程图
图 3:测序读段预处理流程示意图。 由测序仪器配套软件生成的 fastq 文件经过处理,以识别出可用于比对至相应基因组的高质量读段。该图展示了流程中各个步骤的输入/输出规范,并链接至“数据处理”部分所述实验方案的各个具体步骤。请点击此处查看此图的放大版本。

RNA测序工作流程图:比对、BAM转BED、UMI合并、数据输出、引物结合位点。
图4:序列读段处理流程概览,从基因组比对到生成个体3'端加工位点。 该图展示了流程中各个步骤的输入/输出规范,并链接至“数据处理”部分所述协议的各个具体步骤。提供给用户的主要输出文件以粗体标出。 请点击此处查看该图的放大版本。

多聚(A)位点加工示意图,展示样本合并、信号分配和聚类脚本。
图5:生成共调控3'端测序位点聚类的步骤概览。 该图展示了流程中各个步骤的输入/输出规范,并链接至“数据处理”部分所述方案中的各个具体步骤。主要输出文件以粗体标出。 请点击此处查看该图的放大版本。

RNA-seq 分析图,对照组 vs HNRPNC-siRNA;基因表达比较;Ensembl 注释。
图6:NUP214 基因末端外显子上 3'端加工读段分布的示例结果,显示于 IGV 16 基因组浏览器中。A-seq2 读段来自两份 HEK 293 细胞样本,分别用对照 siRNA 或 HNRNPC siRNA 处理。分析流程中注释的多聚腺苷酸化位点对应的读段以 BAM 格式保存,并作为输入载入 IGV 基因组浏览器。读段峰的 3'端对应于 Ensembl 数据库中注释的 mRNA 3'端。图示谱表明,在 HNRNPC 敲低后,长 3'非翻译区(UTR)异构体的使用增加。请点击此处查看该图的放大版本。

对照 siRNA 重复 1对照 siRNA 重复 2
编号: 29765编号: 32682
原始读段数量4421025868570640
剪切与过滤后有效读段数量1402453821211793
唯一比对读段数量695367413946436
比对至多个位点的读段数量20406462925839
独立的 3' 端加工位点数量11074931710353

表1:分析流程的示例输出结果。 各个步骤中获得的读段数据汇总。

讨论

参与pre-mRNA 3'端加工的大量核心和辅助因子反映在相应复杂的多聚腺苷酸化图谱中。此外,多聚腺苷酸化还对转录和剪接等其他过程的变化产生响应。pre-mRNA中的3'端切割位点通常基于添加到5'切割产物上的特征性poly(A)尾来鉴定。大多数方法使用长度可变的oligo(dT)引物,在逆转录反应中特异性地将含有poly(A)的mRNA转化为cDNA。该方法的一个常见问题是由于内部引物与富含A的序列结合,导致产生人为的切割位点。已有两种旨在在样品制备阶段规避此人为效应的方法被提出。在3P-seq方法1中,借助splint寡核苷酸将接头特异性连接至poly(A)尾末端,随后进行部分RNase T1消化,并在仅含有TTP作为脱氧核苷酸的条件下进行逆转录。所形成的poly(A)-poly(dT)异源双链随后被RNase H消化,剩余的RNA片段被分离、连接接头并进行测序。同一批研究人员报道了一种更简单且巧妙的方法——2P-seq,该方法使用定制的测序引物,在测序反应中跳过残留的oligo(dT)序列2。在另一种相关方法3'READS3中,使用一条异常长的引物(5个U和45个T),该引物还含有生物素,与片段化的RNA退火,随后通过严格洗涤筛选出具有超过50个核苷酸poly(A)尾的RNA分子。尽管3'READS显著降低了内部引物结合的频率,但并未完全消除该问题3。也有研究提出了直接RNA测序的方案,但所产生的读长较短且错误率较高,因此该方法未被进一步发展18,19,20。PolyA-Seq和商业化Quant Seq方案将基于oligo(dT)的引物与cDNA第二链合成中的随机引物步骤相结合20。在PAS-Seq和SAPAS方法中,使用Moloney Murine Leukemia Virus(MMLV)逆转录酶进行模板转换逆转录反应,可在单步中生成带有连接子的cDNA,从而避免产生接头二聚体21,22

本文介绍的 A-seq2 方法具有显著特点,即在生物素标记的寡核苷酸(dT)引物中使用了一种可切割的核苷酸(dU)。该修饰结合了富集与寡核苷酸(dT)杂交的polyadenylated靶标的优势,并在文库构建前去除了大部分寡核苷酸(dT)25序列,同时保留了三个T碱基,以指示此前存在poly(A)尾的特征。相比之下,使用RNase H去除RNA分子中poly(A)尾的方法会随机残留多个A碱基。由于在A-seq2中测序是从反义链的3'端开始的,因此切割位点预计位于原始测序读段起始处NNNNTTT基序之后。随机四聚体不仅有助于碱基识别,还可消除PCR扩增过程中产生的假象。该方法也可容纳更长的UMI序列。A-seq2中仍存在内部引物结合的可能性,需通过计算方法加以处理:首先剔除基因组编码的、下游富含A序列的3'端;然后进一步剔除可由富含A的poly(A)信号本身发生内部引物结合所解释的3'端簇。最近一项基于多种实验方案推断poly(A)位点的研究表明,仅由A-seq2特有检测到的位点在基因中的核苷酸分布和位置均符合预期,与其他3'端测序方法相似。

A-seq2 中的一个关键步骤是选择带有聚腺苷酸尾的 RNA,并去除核糖体 RNA 和各种小 RNA。这最简便的方法是使用含寡聚(dT)25 磁珠的 mRNA 分离试剂盒。原则上,用含苯酚溶液提取的总 RNA 也能获得高质量的 RNA,可进一步通过 mRNA 分离试剂盒或寡聚(dT) 琼脂糖进行筛选。A-seq2 中可以调整的一个步骤是碱性水解处理,通过缩短或延长该步骤可获得不同大小的 RNA 片段。另一个关键点是,多聚(A)聚合酶将 3' dATP 有效添加到 RNA 片段 3' 末端的效率。在本方案中,该处理应用于所有 RNA 片段,以避免连接反应过程中发生串联连接。最后需要指出的是,尽管 RNA 连接酶 1 通常作为 RNA 连接酶使用,但它也能高效连接单链 DNA,正如我们在本实验中将接头连接至 cDNA 分子 5' 末端所采用的方法。

因此,A-seq2 是一种高效且易于实施的前体mRNA 3'端加工位点鉴定方案。未来的发展方向可能包括进一步降低该方案的复杂性以及减少所需材料用量。配套的一套计算数据分析工具还可实现对采用多种不同方案获得的3'端测序读段进行一致性处理。

披露

作者无任何利益冲突需要披露。

致谢

作者感谢Béatrice Dimitriades女士在细胞培养方面的帮助。本工作由瑞士国家科学基金会资助,资助编号为#31003A_170216和51NF40_141735(NCCR RNA & Disease)。

材料

本文使用的材料清单
姓名公司目录编号评论
材料
琼脂糖,超纯Invitrogen16500-500
2100 Bioanalyzer安捷伦G2940CA
虫草素三磷酸(3’ dATPSIGMAC9137
DNA低吸附离心管,1.5 mlEppendorf22431021
杜尔贝科’磷酸盐缓冲液SIGMAD8637
Dynabeads mRNA-DIRECT 试剂盒AmbionAM61012
GR-绿色染料ExcellgenEG-1071使用1:10,000稀释度
HiSeq 2500 或 NextSeq 500 高通量测序仪Illumina咨询供应商
KAPA HiFi Hotstart DNA 聚合酶混合物KAPA/RocheKK2602
无核酸酶水AmbionAM9937
酵母多聚腺苷酸聚合酶Thermo Fisher Scientific74225Z25KU
大肠杆菌多聚腺苷酸聚合酶New England BiolabsM0276L
多核苷酸激酶Thermo Fisher ScientificEK0032
QIAEX II 琼脂糖凝胶回收试剂盒Qiagen20021
QIAquick PCR 纯化试剂盒Qiagen28104
QIAquick Gel Extraction KitQiagen28704
RNA连接酶1,高浓度New England BiolabsM0437M包含 PEG-8000
RNeasy MinElute RNA 纯化试剂盒Qiagen74204
RNase HNew England BiolabsM0279
RNasin Plus,核糖核酸酶抑制剂PromegaN2618
Superscript IV 逆转录酶Thermo Fisher Scientific18090050
Turbo DNaseAmbionAM2238
USER 酶混合物New England BiolabsM5505
Dyna-Mag-2 磁力架Thermo Fisher Scientific12321D
Thermomixer CEppendorf5382000015带加热盖的加热混匀仪
MicroSpin 柱GE-Healthcare27-5325-01
名称公司目录号评论
缓冲液
1.5 倍碱性水解缓冲液将1份0.1 M Na2CO3与9份0.1 M NaHCO3混合,加入EDTA至终浓度1 mM,调节pH至9.2。分装后于-20 °C.
5x 多聚腺苷酸聚合酶缓冲液Thermo Fisher Scientific100 mM Tris-HCl,pH 7.0,3 mM MnCl₂,0.1 mM EDTA,1 mM DTT,0.5 mg/ml 乙酰化 BSA,50% 甘油
生物素结合缓冲液20 mM Tris­Cl pH 7.5,2 M NaCl,0.1% NP­40
TEN缓冲液10 mM Tris­Cl,pH 7.5,1 mM EDTA,0.02% NP­40
名称公司目录号序列
根据Illumina TruSeq Small RNA Sample Prep试剂盒设计的寡核苷酸,适用于GA-IIx和Hiseq2000/2500测序仪Microsynth
revRA3(RNA)Microsynth5’ 氨基­ CCUUGGCACCCGAGAAUUCCA­ 3’
revDA5Microsynth5’ 氨基­ GTTCAGAGTTCTACAGTCCGAC GATCNNNN-3’
生物素-dU-dT25,逆转录引物Microsynth5' 生物素-TTTTTTTTTTTTTTTTTTTTTTTTTT-dU-TTTVN 3'(V = G、A 或 C)
PCR 引物 正向,RP1Microsynth5' AATGATACGGCGACCACCGAGA TCTACACGTTCAGAGTTCTACAG
TCCGA 3'
PCR 引物,反向,RPI1,条形码加粗Microsynth5' CAAGCAGAAGACGGCATACGAG
ATCGTGATGTGACTGGAGTTCCT
TGGCACCCGAGAATTCCA 3'
名称公司目录号评论
根据Illumina TruSeq HT-Small RNA Sample Prep试剂盒设计的寡核苷酸,适用于HiSeq2000/2500和NextSeq500测序仪
HT-rev3A(DNA/RNA)Microsynth5'-氨基-GTGACTGGAGTTCAGACGTGTG
CTCTTCCrGrAUrC-3'
HT-rev5AMicrosynth5' 氨基-ACACTCTTTCCCTACACGACGCT
CTTCCGATCTNNNN 3'
生物素-dU-dT25,逆转录引物Microsynth5' 生物素-TTTTTTTTTTTTTTTTTTTTTTTTTT-dU-TTTVN 3'
PCR引物 正向(D501-506)Microsynth 或 Illumina5'-AATGATACGGCGACCACCGAGAT
CTACAC[i5]ACACTCTTTCCCTACA
CGACGCTCTTCCGATCT -3'
PCR引物 反向(D701-D712)Microsynth 或 Illumina5'-CAAGCAGAAGACGGCATACGAG A[i7]GTGACTGGAGTTCAGACGTG TGCTCTTCCGATC-3'
Illumina 多重测序的说明文档:Illuminahttps://support.illumina.com/content/dam/illumina-support/documents/documentation/chemistry_documentation/experiment-design/illumina-adapter-sequences_1000000002694-01.pdf

参考文献

  1. Jan, C. H., Friedman, R. C., Ruby, J. G., Bartel, D. P. Formation, regulation and evolution of Caenorhabditis elegans 3'UTRs. Nature. 469 (7328), 97-101 (2011).
  2. Spies, N., Burge, C. B., Bartel, D. P. 3' UTR-isoform choice has limited influence on the stability and translational efficiency of most mRNAs in mouse fibroblasts. Genome Res. 23 (12), 2078-2090 (2013).
  3. Hoque, M., Ji, Z., et al. Analysis of alternative cleavage and polyadenylation by 3' region extraction and deep sequencing. Nat. methods. 10 (2), 133-139 (2013).
  4. Martin, G., Gruber, A. R., Keller, W., Zavolan, M. Genome-wide analysis of pre-mRNA 3’ end processing reveals a decisive role of human cleavage factor I in the regulation of 3' UTR length. Cell Rep. 1 (6), 753-763 (2012).
  5. Gruber, A. R., Martin, G., et al. Global 3' UTR shortening has a limited effect on protein abundance in proliferating T cells. Nat. Commun. 5, 5465(2014).
  6. Kivioja, T., Vähärautio, A., et al. Counting absolute numbers of molecules using unique molecular identifiers. Nat. methods. 9 (1), 72-74 (2011).
  7. Gruber, A. J., Schmidt, R., et al. A comprehensive analysis of 3' end sequencing data sets reveals novel polyadenylation signals and the repressive role of heterogeneous ribonucleoprotein C on cleavage and polyadenylation. Genome Res. 26 (8), 1145-1159 (2016).
  8. Lingner, J., Keller, W. 3'-end labeling of RNA with recombinant yeast poly(A) polymerase. Nucleic Acids Res. 21 (12), 2917-2920 (1993).
  9. Quail, M. A., Kozarewa, I., et al. A large genome center's improvements to the Illumina sequencing system. Nat. methods. 5 (12), 1005-1010 (2008).
  10. Rahmann, S. Snakemake--a scalable bioinformatics workflow engine. Bioinformatics. 28 (19), 2520-2522 (2012).
  11. Analytics, C. Anaconda Software Distribution. , Available from: https://continuum.io (2016).
  12. Lab, H. FASTX-Toolkit - Hannon Lab. , Available from: http://hannonlab.cshl.edu/fastx_toolkit/index.html (2017).
  13. Dobin, A., Davis, C. A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  14. Martin, M. Cutadapt removes adapter sequences from high-throughput sequencing reads. EMBnet.journal. 17 (1), 10-12 (2011).
  15. Li, H., Handsaker, B., et al. The Sequence Alignment/Map format and SAMtools. Bioinformatics. 25 (16), 2078-2079 (2009).
  16. Robinson, J. T., Thorvaldsdóttir, H., et al. Integrative genomics viewer. Nat. Biotechnol. 29 (1), 24-26 (2011).
  17. Quinlan, A. R., Hall, I. M. BEDTools: a flexible suite of utilities for comparing genomic features. Bioinformatics. 26 (6), 841-842 (2010).
  18. Ozsolak, F., Platt, A. R., et al. Direct RNA sequencing. Nature. 461 (7265), 814-818 (2009).
  19. Yao, C., Biesinger, J., et al. Transcriptome-wide analyses of CstF64-RNA interactions in global regulation of mRNA alternative polyadenylation. Proc. Natl. Acad. Sci. U. S. A. 109 (46), 18773-18778 (2012).
  20. Lin, Y., Li, Z., et al. An in-depth map of polyadenylation sites in cancer. Nucleic Acids Res. 40 (17), 8460-8471 (2012).
  21. Shepard, P. J., Choi, E. -A., Lu, J., Flanagan, L. A., Hertel, K. J., Shi, Y. Complex and dynamic landscape of RNA polyadenylation revealed by PAS-Seq. RNA. 17 (4), 761-772 (2011).
  22. Fu, Y., Sun, Y., et al. Differential genome-wide profiling of tandem 3' UTRs among human breast cancer and normal cells by high-throughput sequencing. Genome Res. 21 (5), 741-747 (2011).

重印与许可

标签

A-seq2 实验方案mRNA 3'端加工多聚腺苷酸化位点作图寡聚 d(T) 磁珠碱性水解RNA连接酶预混液逆转录链霉亲和素磁珠预实验PCR