本文介绍一种基于T7线性RNA扩增的Illumina mRNA-Seq测序文库制备方法,适用于基因表达分析,可制备单端读取和双端读取文库。该方案仅需10纳克起始总RNA,即可生成高度一致、代表完整转录本的文库。
本文介绍一种基于T7线性RNA扩增的Illumina mRNA-Seq测序文库制备方法,适用于基因表达分析,可制备单端读取和双端读取文库。该方案仅需10纳克起始总RNA,即可生成高度一致、代表完整转录本的文库。
通过mRNA-Seq进行的全转录组测序现已被广泛用于全局基因表达、突变、等位基因特异性表达及其他全基因组分析。mRNA-Seq甚至为未测序基因组的基因表达分析打开了大门。mRNA-Seq具有高灵敏度、宽动态范围,并可实现对样本中转录本拷贝数的定量。Illumina基因组分析仪能够对大量(> 107)相对较短的序列读长(< 150 bp)进行测序。采用“成对末端”("paired end")策略,即对单个长片段的两端分别测序,可追踪可变剪接位点、插入和缺失事件,并有助于从头(de novo)转录组组装。
研究人员面临的主要挑战之一是起始材料的量有限。例如,在通过激光显微切割获取细胞的实验中,可获得的总起始RNA量可能仅有数纳克。已有文献描述了从此类样本制备mRNA-Seq文库的方法1, 2,但该方法需要进行显著的PCR扩增,可能引入偏差。其他PCR扩增程度较低的RNA-Seq文库构建方法已有报道3, 4,但需要微克量级的起始总RNA。
本文介绍了一种用于Illumina Genome Analyzer II平台的mRNA-Seq测序文库构建方案,该方案避免了显著的PCR扩增,仅需10纳克总RNA。尽管该方案此前已有报道并已验证可用于单端测序5,且被证明可生成无明显扩增偏差的链特异性文库,但本文进一步验证了其作为双端测序方案的适用性。我们采用基于T7的Eberwine线性扩增方法(简称"T7LA",即T7线性扩增)从起始总RNA中选择性扩增带有聚腺苷酸尾的信使RNA。扩增后的poly-A mRNA经过片段化、逆转录及接头连接,最终构建测序文库。对于单端读取和双端读取测序,序列均比对至人类转录组6,并进行标准化处理,以便对多次测序运行的数据进行比较。我们以每百万转录本数(TPM)为单位报告基因表达量,该指标在样本间比较时优于RPKM7。
1. 提取总RNA
2. 准备双链 cDNA
孵育 2 小时,温度为 16 °C 然后加入 1 μl T4 DNA聚合酶,于37°C额外孵育10分钟 16 °C.
3. 通过以下步骤扩增poly-A mRNA 体外 转录
4. 扩增的poly-A mRNA的片段化
5. RNA 纯化
6. cDNA 合成
单端文库的第一链合成:
在PCR仪中于70 °C孵育5分钟,然后迅速置于冰上冷却。NotI九聚体引物(5'- TGAATTCGCGGCCGCTCAAGCAGAAGACGGCATACGAGCTCTTCCGATCT NNNNNNNNN -3')。5'端邻近序列为NotI限制性酶切位点,随后至随机区域之前的序列是Illumina Chip-Seq试剂盒中接头B序列的反向互补序列。
将反应体系置于热循环仪中,在 42°C 下孵育 2 分钟,加入 1 μl SuperScript III 逆转录酶,然后在 42 °C 下孵育 1 小时。
*dNTP 混合物中使用5-甲基-dCTP代替dCTP。
双端文库的第一链合成:
在PCR仪中65 °C孵育5分钟,然后迅速置于冰上冷却。
将反应体系置于热循环仪中,在 45 °C 下孵育 1 分钟,加入 1 μl SuperScript III 逆转录酶,然后在 45 °C 下继续孵育 1 小时。
第二链合成(适用于两个文库):
将试管颠倒混匀,短暂离心,于16 °C孵育2小时。
7. 纯化 cDNA
8. 末端修复
对于单端测序文库:
(使用Illumina Chip-Seq样品制备试剂盒)
在20 °C下于热循环仪中孵育30分钟。
对于成对末端文库:
(使用Illumina配对末端样品制备试剂盒)
在20 °C下于热循环仪中孵育30分钟。
9. cDNA 纯化
10. 在 DNA 片段的 3' 端添加 'A' 碱基
对于单端测序文库:
在 37 °C 下孵育 30 分钟。
对于成对末端文库:
在 37 °C 下孵育 30 分钟。
11. cDNA 纯化
12. 接头连接
对于单端测序文库:
(使用Illumina Chip-Seq样品制备试剂盒)
室温孵育15分钟。接头应在冰上解冻,并按1:20比例稀释。
对于成对末端文库:
(使用Illumina paired end样本制备试剂盒)
在 20 °C 下孵育 15 分钟。接头应在冰上解冻,并按 1:20 的比例稀释。
13. 连接反应纯化
仅对单端文库进行 NotI 消化
在37 °C下孵育2小时至过夜,使用Zymo柱纯化反应产物。先用6 μl洗脱缓冲液EB洗脱,再用5 μl EB进行第二次洗脱。
14. 大小筛选/凝胶纯化
使用 Invitrogen 的 2% Sybr Safe E-Gel 进行以下操作。
15. 从凝胶切片中洗脱 DNA
16. PCR
对于单端测序文库:
(使用Illumina Chip-Seq样品制备试剂盒)
使用以下 PCR 程序:
*首次使用试剂盒时,用 EB 缓冲液将 PCR 引物按 1:2 的比例稀释。
对于成对末端文库:
(使用Illumina配对末端样品制备试剂盒)
使用以下PCR程序进行扩增:
*首次使用试剂盒时,用 EB 缓冲液将 PCR 引物按 1:2 比例稀释。
17. 文库纯化
18. 文库定量
19. 数据分析
使用 Bowtie6 将测序读段比对至 RefSeq 基因集(NCBI Build 36.1)。单端读段(30 个核苷酸)和成对末端读段(42 个核苷酸)在允许最多 10 个比对位置且每条读段最多允许两个错配的条件下进行比对。采用 RSEM7(基于期望最大化算法的 RNA-Seq 分析方法)计算每百万转录本数(Transcripts Per Million, TPM)以量化基因表达水平。
20. 代表性结果:我们使用1 μg、100 μg、10 μg、1 μg和100 pg起始总RNA,分别构建了用于单端测序和双端测序的T7LA文库(图1)。为评估本方案,我们还从10 μg总RNA起始,构建了未经过T7 RNA扩增的单端和双端测序文库。这些对照文库被称为“MinAmp”,其扩增程度最低。它们所经历的唯一扩增步骤是在实验流程末期进行的10个循环的PCR,以连接Illumina测序接头,该步骤为所有文库构建所共有。所有使用的RNA均提取自H14人类胚胎干细胞8。
我们首先评估了不同文库所鉴定出的基因数量(表1和补充表1)。对于单端读取和双端读取文库,10 ng T7LA文库鉴定出的TPM值≥10的基因数量几乎与10 μg MinAmp文库相当。在单端读取文库中,10 ng T7LA文库鉴定出了10 μg未扩增文库所鉴定出的8500个基因的100%。对于双端读取文库,10 ng T7LA文库鉴定出了10 μg未扩增文库所鉴定出的9267个基因中的86%(即7961个基因)。起始材料少于10 ng所构建的文库无法鉴定出同样数量的基因。例如,在单端读取实验方案中,1 ng文库仅鉴定出10 μg MinAmp文库所鉴定基因的大约50%,这促使我们将T7LA实验方案所需的总RNA最低用量限定为10 ng。此外,看家基因GAPDH的比对结果(图2)显示,所有起始RNA量至少为10 ng的T7LA文库均能鉴定出全部外显子,包括最远端的5'端外显子。将10 ng T7LA单端读取和双端读取文库与MinAmp文库进行比较,结果显示高度相似性(Spearman相关系数分别为R = 0.90和0.95,图3a和3b)。我们还比较了由10 ng总RNA构建的两种单端读取和双端读取文库,二者具有极高的相关系数(R = 0.92),表明采用T7LA实验方案构建的这两类文库可产生非常相似的基因表达特征(图3c)。因此,T7LA方法能够以比MinAmp方法少1000倍的起始材料,生成同样可靠且全面的测序文库。

图1 配对末端与单端读段文库制备流程示意图。

图 2 所有单端读长与双端测序文库中看家基因GAPDH的基因组浏览器图像。左侧单端文库的标尺表示总共350条读长,中间双端文库的标尺表示总共5000条读长。横轴代表GAPDH的基因组序列。

图3 不同文库间基因表达的相关性(Spearman相关系数):A. 单端测序的10 ng T7LA文库与10 μg MinAmp文库之间的比较显示,这两个文库具有非常相似的基因表达模式(R = 0.90)。B. 双端测序的10 ng T7LA文库与10 μg MinAmp文库之间的比较表明,它们的基因表达谱也高度相似(R = 0.95)。C. 采用T7LA方法构建的10 ng双端测序文库与10 ng单端测序文库之间的基因表达相关性分析显示,二者具有高度相似性(R = 0.92)。

图4 基于所有单端读长和成对末端文库鉴定的人类胚胎干细胞特异性基因5。
| 文库 | 类型° | 原始簇数 | 通过过滤的簇比例 (%) | 比对到基因组的比例 (%) | 错误率 (%) | 鉴定出的基因数 |
| MinAmp 10ug | 单端读长 | 225602 +/- 4952 | 65.48 +/- 2.58 | 47.61 +/- 0.53 | 0.62 +/- 0.06 | 8500 |
| 1ug T7LA | 单端读长 | 144818 +/- 6513 | 82.21 +/- 6.45 | 48.09 +/- 0.27 | 0.42 +/- 0.03 | 8757 |
| 100ng T7LA | 单端读长 | 27385 +/- 1818 | 81.33 +/- 11.75 | 44.46 +/- 4.53 | 0.49 +/- 0.10 | 8709 |
| 10ng T7LA | 单端读长 | 11184 +/- 985 | 60.70 +/- 3.70 | 14.96 +/- 1.15 | 0.99 +/- 0.30 | 8589 |
| 1ng T7LA | 单端读长 | 12695 +/- 1365 | 53.27 +/- 16.76 | 4.08 +/- 0.79 | 2.25 +/- 1.56 | 4720 |
| 100pg T7LA | 单端读长 | 10390 +/- 1398 | 72.99 +/- 2.90 | 1.48 +/- 0.20 | 1.51 +/- 0.39 | 1121 |
| MinAmp 10ug | 双端读长 R1 | 95786 +/- 12937 | 90.77 +/- 2.79 | 58.50 +/- 0.95 | 0.94 +/- 0.38 | 9267 |
| 双端读长 R2 | 95786 +/- 12937 | 90.77 +/- 2.79 | 58.13 +/- 1.13 | 0.99 +/- 0.37 | ||
| 1ug T7LA | 双端读长 R1 | 297669 +/- 10196 | 91.35 +/- 0.36 | 46.89 +/- 0.14 | 0.47 +/- 0.01 | 7334 |
| 双端读长 R2 | 297669 +/- 10196 | 91.35 +/- 0.36 | 45.52 +/- 0.12 | 0.51 +/- 0.01 | ||
| 100ng T7LA | 双端读长 R1 | 205602 +/- 9932 | 90.53 +/- 0.76 | 63.44 +/- 1.00 | 0.48 +/- 0.02 | 8011 |
| 双端读长 R2 | 205602 +/- 9932 | 90.53 +/- 0.76 | 61.80 +/- 8.09 | 0.60 +/- 0.36 | ||
| 10ng T7LA | 双端读长 R1 | 214622 +/- 11155 | 89.98 +/- 1.13 | 56.32 +/- 1.94 | 0.80 +/- 0.26 | 7961 |
| 双端读长 R2 | 214622 +/- 11155 | 89.98 +/- 1.13 | 46.41 +/- 18.39 | 2.48 +/- 2.68 | ; | |
| 1ng T7LA | 双端读长 R1 | 144951 +/- 19841 | 90.54 +/- 1.19 | 3.91 +/- 0.16 | 8.71 +/- 0.86 | 8124 |
| 双端读长 R2 | 144951 +/- 19841 | 90.54 +/- 1.19 | 3.27 +/- 1.21 | 9.11 +/- 3.52 | ||
| 100pg T7LA | 双端读长 R1 | 187600 +/- 11759 | 89.52 +/- 1.11 | 1.78 +/- 0.05 | 13.42 +/- 0.50 | 6623 |
| 双端读长 R2 | 187600 +/- 11759 | 89.52 +/- 1.11 | 1.99 +/- 0.23 | 15.29 +/- 0.96 | ||
° R1 和 R2 分别为标签的正向和反向序列
* ≥10 TPM
表1. 关于簇数量、鉴定出的基因、错误率、单端读段和双端读段文库比对百分比的信息。
补充表1. 所有样本(单端测序和双端测序)中全部基因及其每百万转录本计数(TPM)值的列表。
目前构建双端测序文库的标准方案需要起始总量为1 μg9至2.5 μg10的总RNA。本文中,我们介绍了一种基于线性T7扩增(T7LA)的方法,用于制备Illumina单端读长和双端读长测序文库,并证明该方法仅需低至10 ng的总RNA即可构建文库,所获得的数据与使用多1000倍起始材料(10 μg总RNA)制备的最小程度扩增(MinAmp)文库相当。10 ng起始量构建的文库不仅检出的基因总数相似,而且产生的基因表达谱也高度一致(图3a和3b)。此外,T7LA方法制备的单端读长和双端读长文库彼此之间也非常相似(图3c),这使得研究人员能够直接比较由不同建库方案生成的数据。由于这些文库均使用人胚胎干细胞RNA制备,我们进一步在文库中检测了30个干细胞特异性基因,发现几乎所有这些基因(93–100%)均可在起始总RNA至少为10 ng的文库中被检出(图4),从而验证了本方案的有效性。我们认为,本方案对科研人员具有重要价值,尤其适用于起始材料有限的情况,例如流式分选细胞或激光显微切割组织。在这些情况下,本方案能够产生与使用大量起始RNA构建的文库相媲美的基因表达数据,因为本方案生成的表达谱在至少跨越3个数量级的起始RNA量范围内均具有可比性。
作者声明,J.A.T. 是 Cellular Dynamics International(CDI)的创始人、股东、顾问及董事会成员。他同时还担任 Tactics II Stem Cell Ventures 的科学顾问,并在该公司拥有财务利益。
本工作获得了Morgridge研究所研究基金和威斯康星大学基金会的资助。我们感谢Krista Eastman提供的编辑协助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 片段化试剂 | Ambion | AM8740 | |
| 线性丙烯酰胺 | Ambion | AM9520 | |
| MEGAscript T7 试剂盒 | Ambion | AM1334 | |
| 未经 DEPC 处理的无核酸酶水 | Ambion | AM9932 | |
| dNTP 混合物 | Fermentas | R0181 | |
| 甲基化 dNTPs | Fermentas | R0431 | 仅用于单端测序样本制备 |
| TruSeq SR Cluster Generation kit v5 | Illumina | GD-203-5001 | 仅用于单端测序样本制备 |
| TruSeq Seq Kit v5 36 个循环 | Illumina | FC-104-5001 | |
| Chip Seq 样本制备试剂盒 | Illumina | IP-102-1001 | 仅用于单端测序样本制备。可替换为 NEB DNA 样本制备主混合液套装 1 货号 E6040S |
| TruSeq PE Cluster Generation kit v5 | Illumina | PE-203-5001 | 仅用于双端测序样本制备 |
| 双端样本制备试剂盒 | Illumina | PE-102-1001 | 仅用于双端测序样本制备 |
| 1kb Plus DNA 标准分子量标记 | Invitrogen | 10787-018 | |
| E. coli RNase H | Invitrogen | 18021-014 | |
| RNase 抑制剂 | Invitrogen | 10777-019 | |
| 第二链缓冲液(5×) | Invitrogen | 10812-014 | |
| E. coli DNA 聚合酶 | Invitrogen | 18010-017 | |
| E-gel SYBR Safe 2% | Invitrogen | G521802 | |
| Superscript III(含 5× FS 缓冲液和 0.1M DTT) | Invitrogen | 18080-085 | |
| Trizol | Invitrogen | 12183555 | |
| RNA Qubit 定量检测试剂盒 | Invitrogen | Q32852 | |
| dsDNA HS Qubit 定量检测试剂盒 | Invitrogen | Q32851 | |
| E. coli DNA 连接酶 | Invitrogen | 18052-019 | |
| T4 DNA 聚合酶 | Invitrogen | 18005-025 | |
| Ultra Pure 无 DNase/RNase 水 | Invitrogen | 10977-015 | |
| Superscript II 双链 cDNA 合成试剂盒 | Invitrogen | 11917-020 | |
| 随机引物(Invitrogen) | Invitrogen | 48190-011 | 仅用于双端测序样本制备 |
| Not1Nonamer B 引物 | IDT | N/A | 仅用于单端测序样本制备 |
| Oligo dT T7 | IDT | N/A | |
| Not1 消化试剂盒 | New England Biolabs | R0189S | 仅用于单端测序样本制备 |
| RNeasy MinElute 试剂盒 | Qiagen | 74204 | |
| RNeasy Mini 试剂盒(50) | Qiagen | 74104 | |
| 凝胶回收试剂盒 | Qiagen | 28604 | |
| DNase 试剂盒 | Qiagen | 79254 | |
| RNeasy MinElute 试剂盒 | Qiagen | 74204 | |
| DNA 纯化与浓缩试剂盒(250X) | Zymo Research Corp. | D4014 |