增强型简化表示亚硫酸氢盐测序是一种基于限制性内切酶消化结合胞嘧啶亚硫酸氢盐转化的DNA甲基化分析测序文库制备方法。该方案需要50 ng起始材料,可获得在基因组GC富集区域的碱基对分辨率数据。
方法文章
* These authors contributed equally
增强型简化表示亚硫酸氢盐测序是一种基于限制性内切酶消化结合胞嘧啶亚硫酸氢盐转化的DNA甲基化分析测序文库制备方法。该方案需要50 ng起始材料,可获得在基因组GC富集区域的碱基对分辨率数据。
DNA甲基化模式图谱在正常组织和病变组织中均受到广泛研究。目前已建立多种方法用于检测细胞中的胞嘧啶甲基化模式。简化基因组重亚硫酸盐测序(Reduced representation of whole genome bisulfite sequencing)旨在检测富含GC的基因组位点上具有单碱基分辨率的定量胞嘧啶甲基化模式。该方法通过结合限制性内切酶消化与重亚硫酸盐转化来实现。增强型简化基因组重亚硫酸盐测序(Enhanced Reduced Representation Bisulfite Sequencing, ERRBS)可提高生物学相关基因组位点的覆盖范围,已被用于分析人、小鼠及其他生物DNA中的胞嘧啶甲基化谱。ERRBS首先对DNA进行限制性内切酶消化,以产生低分子量的片段用于文库构建。这些片段随后进行标准的下一代测序文库制备流程。在最终扩增步骤前,对未甲基化的胞嘧啶进行重亚硫酸盐转化,从而实现对覆盖区域内胞嘧啶甲基化水平的单碱基定量解析。该实验方案可在四天内完成。尽管测序前三个碱基复杂度较低,ERRBS文库在使用指定测序对照通道时仍可获得高质量数据。随后进行序列比对与生物信息学分析,所得数据可轻松整合至多种全基因组分析平台。ERRBS仅需少量起始材料,因此适用于处理人类临床样本,并广泛适用于各类科研应用。本视频展示了ERRBS实验方案中的关键步骤。
胞嘧啶上的DNA甲基化(5-甲基胞嘧啶)是一种在哺乳动物细胞中至关重要的表观遗传标记,参与多种生物学过程,包括但不限于基因组印记、X染色体失活、发育以及基因表达调控1-8。对恶性肿瘤及其他疾病中DNA甲基化模式的研究已确定了与特定疾病相关的甲基化特征,增进了对疾病发病机制的理解,并推动了潜在生物标志物的发现9-17。 目前已有多种用于检测表观基因组中DNA甲基化状态的实验方案。这些方法可分为基于亲和富集、基于限制性内切酶以及基于亚硫酸氢盐转化的检测技术,后续通常结合微阵列或测序平台进行分析。此外,还有一些方法跨越了上述分类,包括但不限于联合亚硫酸氢盐限制性内切酶分析法18和简化基因组亚硫酸氢盐测序(RRBS19)。
RRBS 最初由 Meissner 等人19,20 描述。该方案引入了一个富集基因组中 GC 富集区域的步骤,随后进行亚硫酸氢盐测序,从而获得具有单碱基分辨率且成本效益较高的定量数据21,22。GC 富集区域通过 MspI(C^CGG)限制性内切酶进行靶向,胞嘧啶甲基化状态则通过亚硫酸氢盐转化(未修饰的胞嘧啶脱氨为尿嘧啶)后经聚合酶链式反应(PCR)扩增来解析。RRBS 能够覆盖大部分基因启动子和 CpG 岛,仅需全基因组测序一小部分的测序量;然而,其对 CpG 海岸区及其他具有生物学意义的基因间区域的覆盖有限。自最初报道以来,多个研究团队已发表更新的 RRBS 方案,改进了方法学并提升了对这些基因组区域的覆盖度23-25。增强型简化基因组亚硫酸氢盐测序(Enhanced Reduced Representation Bisulfite Sequencing, ERRBS)相较于 RRBS,在文库构建步骤和数据分析比对策略方面进行了优化26。ERRBS 能在生成的数据中呈现更多的 CpG 位点,并显著提高所有被检测基因组区域的覆盖度26。该方法已被用于解析人类患者及其他动物样本中的 DNA 甲基化模式26-30。
本文所述的ERRBS方案详细介绍了完成实验所需的全部步骤,所用数据通过代表性的人类DNA生成(样本来源于先前报道的、去标识化的患者样本31,以及一名正常人类供体的CD34+骨髓样本)。该方案包含自动化的片段大小筛选步骤,可缩短每个样本的处理时间,并提高文库片段大小选择的准确性。本方案结合了一系列成熟的分子生物学技术:首先使用对甲基化不敏感的限制性内切酶(MspI)消化高分子量DNA,随后进行末端修复、A尾添加以及甲基化接头的连接;接着对富含GC的片段进行大小筛选,再经亚硫酸氢盐转化和PCR扩增后用于测序。亚硫酸氢盐转化方法此前已有描述32,而数据分析与应用的详细综述不在本文范围内,但为读者提供了相关建议和参考文献。该方案可在四天内完成,适用于微量起始材料(50 ng或更少)。按本方案操作可获得每个CpG位点的高覆盖度数据,不仅足以进行差异甲基化位点和区域的鉴定,还可用于检测表观遗传多态性,如Landan et al.33 所述。
注意:本研究已获得威尔康奈尔医学院机构审查委员会的批准(方案编号 0805009783),并按照赫尔辛基宣言的规定进行。
注意:使用前请查阅相关材料的安全数据表(在本方案中以“注意”标示)。所用的多种试剂具有毒性,建议采取适当的安全防护措施(包括个人防护装备和通风橱)。
注意:除非另有说明,本方案中的所有步骤均在室温下进行
1. 基因组DNA的制备与消化
2. 末端修复
3. A尾添加
4. 连接接头
5. 大小筛选
注意:根据 DNA 起始量选择第 5.1 节中的自动化片段筛选方案或第 5.2 节中的手动凝胶回收片段筛选方案。对于起始 DNA 量为 25 ng 或以上的样本,可采用自动化片段筛选方案(使用如 Pippin Prep 等仪器)。当 DNA 起始量较低(5–10 ng)时,必须采用手动凝胶回收方法。
6. 亚硫酸氢盐转化
7. 扩增 PCR
8. 纯化 PCR 反应产物
9. 文库质量控制
10. 准备测序文库
11. 数据分析
注意:有关推荐使用的命令和脚本的完整详细信息,请参阅补充代码文件 1 和 2。
图1 概述了ERRBS流程,突出了关键步骤,这些步骤将在下文所述方案中详细说明。ERRBS文库使用50 ng输入DNA制备。
评估所制备文库的质量。文库制备通常会产生 150-250 bp 和 250-400 bp 的片段(图 3A-C)。不同样本之间的文库片段大小分布存在轻微差异是正常的。请注意,在较小和较大的文库片段中均会出现非常强的 DNA 条带,提示特定序列的富集。MspI 消化可导致在人类基因组中以 190 bp、250 bp 和 310 bp 存在的一类重复 DNA 序列在 ERRBS 文库中富集。这三个重复序列构成了 ERRBS 文库的特征性标志20(见 图 3A-C 和 图 3G)。代表性文库使用单端读长在新一代测序仪上进行测序。当在 Illumina HiSeq 2500 测序仪上以推荐的文库浓度上样时,预期簇密度为每 mm2 500,000–700,000。在此簇密度下,81.6% ± 3.14%(n = 81)的簇能够通过过滤(图 4A)。由于文库插入片段末端复杂度较低(MspI 识别位点:C^CGG),测序过程中前三个碱基的荧光强度值和质量分数变化较大(图 4B-C);然而,若包含独立的对照通道(见讨论部分),85% 的碱基质量分数将达到 30 或以上(Q30 值;图 4D)。
按照本方案所述进行数据比对和胞嘧啶甲基化检测,可获得单碱基分辨率的数据(表7)。对于人类基因组,在HiSeq 2500高通量模式下,一个ERRBS文库在单个测序通道中进行51个循环的单端测序,通常可产生153,194,882 ± 12,918,302条总读段,经质量过滤和接头序列修剪后,可用于分析流程的读段数为152,231,183 ± 13,189,678条。ERRBS文库的平均比对效率通常为62.95% ± 5.92%,可检测到3,183,594 ± 713,547个CpG位点,每个CpG位点的最低覆盖深度为10x,平均覆盖深度为84.94 ± 16.29(n = 100)。
ERRBS 方案适用于多重测序(参见补充文件1:多重测序的方案优化)。代表性测序运行的数据汇总见图5。将多重测序运行的数据(51个循环的单端测序;每泳道两个文库,n = 128;每泳道三个文库,n = 11;每泳道四个文库,n = 11)与ERRBS文库的整泳道测序(51个循环的单端测序,n = 100)进行比较,同时也对单个泳道数据进行下采样,以模拟每泳道50%、33%和25%的读长(即每泳道分别对应2、3和4个样本的多重测序,n = 3)。随着每个样本的测序读长数量随多重因子增加而减少,覆盖度不低于10×的CpG位点数量以及每个CpG位点的平均覆盖度也随之降低(图5和表8)。非CpG位点的平均转化率预期为99.85% ± 0.04%(n = 400)。若转化率低于99%,可能提示亚硫酸氢盐转化不充分,从而导致假阳性甲基化水平升高。
使用 R 2.15.245 中的 methylKit 软件包26(命令详情见补充代码文件 1)分析了从代表性人基因组 DNA 制备的 ERRBS 文库数据。该数据可在常用的基因组浏览器中进行可视化展示(图 6A)。胞嘧啶甲基化数据均等地来源于两条链(图 6B),并覆盖了所有可能的胞嘧啶甲基化水平范围(图 6C)。对代表性人 DNA 样本的技术重复进行分析,结果显示数据结果之间具有高度一致性(图 6D),并覆盖了广泛基因组位点中的 CpG 位点(图 6E 和 图 6F),这与先前报道的结果一致26。技术重复通常产生较高的 R2 值(大于 97%),而生物学重复的 R2 值范围为 0.92 至 0.9626,不同人细胞类型之间的比较则会产生低于 0.86 的 R2 值(数据未显示)。

图1:ERRBS实验流程步骤流程图。图表所示步骤可在常规工作日内完成。 * 表示一个潜在的暂停节点(连接反应纯化后、片段大小选择前,即实验步骤5),在此处样品可在继续后续流程前于 -20 °C 冻存。

图 2: 片段大小选择流程。(A) ERRBS Pippin Prep 流程中所用设置的截图(参见实验方案第 5.1.2–5.1.6 节):(1)选择胶块类型;(2)选择所用标准品;(3)为每条泳道选择收集模式;(4)输入收集的碱基对范围;(5)保存该流程。(B) 第 5.2 节实验方案中所用手动凝胶提取步骤:(1)电泳后可见的 DNA 分子量标记;(2)使用刀片标记用于片段大小选择的范围;(3)切下的样品图像(较低片段:150–250 bp,较高片段:250–400 bp)。请点击此处查看此图的放大版本。

图3: 使用生物分析仪对人源DNA样本制备的代表性ERRBS文库进行质量控制的结果。(A) 类似凝胶的图像,显示标准分子量标记(1)、较低文库组分(Pippin Prep分离的135-240 bp组分);2)以及较高文库组分(Pippin Prep分离的240-410 bp组分);3)。(B) 预期较低文库组分的生物分析仪电泳图。 (C) 预期较高文库组分的生物分析仪电泳图。 D-F) 低质量文库制备的代表性数据。标准分子量标记(1)、较低文库组分(2)和较高文库组分(3)的类凝胶图像(D)。箭头标记的150 bp处条带显示接头过量。较低(E)和较高文库组分(F)的电泳图,150 bp处出现过量接头峰(箭头标记)。(G) 用于测序的混合ERRBS文库的生物分析仪电泳图。红色曲线代表高质量的混合文库,其中较高和较低组分比例均等;蓝色曲线代表混合文库质量不达标,无法用于测序,因其较高和较低组分比例不均。 请点击此处查看该图的放大版本。

图4: 在HiSeq 2500测序仪高输出模式下进行的代表性ERRBS 51个循环单端测序运行的测序图谱。(A) 两个载有ERRBS文库泳道中的簇密度(K/mm2 = 每平方毫米1,000个簇;蓝色)以及通过过滤的簇密度(绿色)。(B) 在一个载有ERRBS文库的泳道中,前30个循环中观察到的典型荧光强度。注意前三个循环荧光强度中来自MspI酶切的CGG特征信号。(C) 一个ERRBS泳道中每个循环碱基质量值达到或超过30(%>Q30)的比例。(D) 一个ERRBS泳道中所有循环的碱基质量值分布。蓝色表示低于Q30,绿色表示大于或等于Q30。在此泳道中,84.7%的碱基质量值达到或超过30。

图5: 测序输出结果。多重测序和每泳道单样本测序运行的实验数据(以绿色方框表示)以及通过对三个ERRBS文库的测序运行进行模拟下采样获得的数据(以蓝色方框表示;每次测序运行采样五次)的箱线图,测序运行来自51个循环的单端测序。 多重因子对应于每泳道测序的ERRBS文库数量。1 = 整个泳道或100%的读段,代表每泳道一个ERRBS文库的数据;2 = 50%泳道,代表每泳道两个ERRBS文库的数据;3 = 33%泳道,代表每泳道三个ERRBS文库的数据;4 = 25%泳道,代表每泳道四个ERRBS文库的数据。(A) 每个多重因子对应的读段数,即分析的序列数量。(B) 每个多重因子对应的测序数据覆盖的CpG位点数量。(C) 每个多重因子对应的每个CpG位点的平均覆盖深度。请点击此处查看该图的放大版本。

图6: 由人基因组DNA制备的ERRBS文库的代表性数据。 (A) 加州大学圣克鲁兹分校(UCSC)基因组浏览器43中一条ERRBS测序通道的代表性数据图像。y轴标尺表示每个胞嘧啶的甲基化水平(0–100%),覆盖深度至少为10倍。上方自定义轨道代表正链,下方自定义轨道代表负链。图示区域为chr12:6,489,523-6,802,422(hg19),包含该基因组区域内的refseq基因及CpG岛。(B) 来自代表性人CD34+骨髓样本中正链和负链上CpG覆盖度的分布直方图。(C) 来自代表性人CD34+骨髓样本中两条链上CpG甲基化水平的分布直方图。(D) 人DNA样本代表性技术重复之间的CpG甲基化水平相关性散点图。(E) 饼状图,展示由人基因组DNA制备的代表性样本中,在ERRBS中被覆盖的CpG位点注释到CpG岛(浅绿色)、CpG岸区(灰色)及其他区域(白色)的比例。(F) 饼状图,展示在ERRBS中被覆盖的CpG位点注释到基因启动子区(红色)、外显子(绿色)、内含子(蓝色)及基因间区(紫色)的比例。请点击此处查看此图的放大版本。
| 试剂 | 体积 | 备注 |
| 10x T4 DNA连接酶反应缓冲液 | 10 µl | |
| 脱氧核苷三磷酸(dNTP)溶液混合物 | 4 µl | 每种核苷酸浓度为10 mM的混合液 |
| T4 DNA聚合酶 | 5 µl | 3,000 单位/ml |
| DNA聚合酶I大(Klenow)片段 | 1 µl | 5,000 单位/ml |
| T4多核苷酸激酶 | 5 µl | 10,000 单位/ml |
| 无DNase水 | 45 µl |
表1:末端修复反应试剂。 末端修复反应中使用的试剂名称及用量(实验步骤2.1)。
| 试剂 | 体积 | 备注 |
| 10x 反应缓冲液 | 5 µl | 例如,NEBuffer 2 |
| 1 mM 2'-脱氧腺苷-5'-三磷酸 (dATP) | 10 µl | |
| Klenow 片段 (3’→5’ 外切酶缺陷型) | 3 µl | 5,000 单位/ml |
表2: A加尾反应试剂。 A加尾反应中使用的试剂名称及用量(实验步骤3.1)。
| 试剂 | 体积 | 备注 |
| 15 µM 变性接头(溶于无DNase水) | 3 µl | PE接头1.0和PE接头2.0;序列和参考信息见表4 |
| 10x T4 DNA连接酶反应缓冲液 | 5 µl | |
| T4 DNA连接酶 | 1 µl | 2,000,000 单位/ml |
| 无DNase水 | 31 µl |
表3:接头连接反应试剂。 接头连接反应中使用的试剂名称及用量(实验步骤4.2)。

表 4:ERRBS 实验方案中所用的寡核苷酸。 在 ERRBS 实验方案的连接反应(实验步骤 4)和 PCR 扩增步骤(实验步骤 7)中所使用的寡核苷酸列表。请点击此处查看此表格的放大版本。
| 试剂 | 体积 | 备注 |
| 含 18 mM 氯化镁的 10x FastStart High Fidelity 反应缓冲液 | 20 µl | |
| 10 mM dNTP 溶液混合物 | 5 µl | |
| 25 µM PCR PE 引物 1.0 | 4 µl | 参见 表 4 |
| 25 µM PCR PE 引物 2.0 | 4 µl | 参见 表 4 |
| FastStart High Fidelity 酶 | 2 µl | 5 单位/µl FastStart Taq DNA 聚合酶 |
| 无 DNase 水 | 125 µl |
表4:ERRBS实验方案中使用的寡核苷酸。 在ERRBS实验方案的连接反应(方案步骤4)和PCR扩增步骤(方案步骤7)中所用寡核苷酸的列表。
| 试剂 | 体积 | 备注 |
| 含 18 mM 氯化镁的 10x FastStart High Fidelity 反应缓冲液 | 20 µl | |
| 10 mM dNTP 溶液混合物 | 5 µl | |
| 25 µM PCR PE 引物 1.0 | 4 µl | 参见 表 4 |
| 25 µM PCR PE 引物 2.0 | 4 µl | 参见 表 4 |
| FastStart High Fidelity 酶 | 2 µl | 5 单位/µl FastStart Taq DNA 聚合酶 |
| 无 DNase 水 | 125 µl |
表5: PCR反应试剂。 PCR扩增反应中使用的试剂名称及用量(实验步骤7.1)。
| 实验步骤 | 试剂/方案细节 | 输入DNA量 | ||
| 5-10 ng | 25 ng | 50 ng | ||
| 1 | MspI酶 | 1 µl | 2 µl | 2 µl |
| MspI消化反应体积 | 50 | 100 | 100 | |
| 4 | 连接反应中的接头 | 1 µl | 2 µl | 3 µl |
| 连接反应体积 | 20 µl | 25 µl | 50 µl | |
| 5 | 片段大小选择方案 | 仅手工凝胶 | Pippin Prep或手工凝胶 | Pippin Prep或手工凝胶 |
| 7 | PCR引物浓度 | 25 µM | 25 µM | 14个循环使用10 µM;18个循环使用25 µM |
| PCR循环数 | 18 | 18 | 14-18 | |
表6: 起始材料量在5-50 ng范围内的实验方案步骤调整。 本实验方案中的多个步骤需根据起始材料量调整试剂使用量,以从不同量的起始材料中生成高质量文库。此处列出了关键试剂用量的调整。请相应调整反应中缓冲液和水的体积。
| 染色体 | 碱基位置 | 链 | 覆盖度 | freqC | freqT |
| chr1 | 10564 | R | 366 | 85.52 | 14.48 |
| chr1 | 10571 | F | 423 | 91.25 | 8.75 |
| chr1 | 10542 | F | 432 | 91.2 | 8.8 |
| chr1 | 10563 | F | 429 | 94.64 | 5.36 |
| chr1 | 10572 | R | 366 | 96.99 | 3.01 |
| chr1 | 10590 | R | 370 | 88.11 | 11.89 |
| chr1 | 10526 | R | 350 | 92 | 8 |
| chr1 | 10543 | R | 368 | 92.93 | 7.07 |
| chr1 | 10525 | F | 433 | 91.92 | 8.08 |
| chr1 | 10497 | F | 435 | 88.74 | 11.26 |
表7: 代表性ERRBS数据。在完成数据比对和胞嘧啶甲基化水平测定后,可获得碱基对数据。 对于每个被覆盖的CpG位点,如上所述的比对流程将确定其基因组坐标(列:chr = 染色体,Base 和 Strand)、特定位点的覆盖度(Coverage),以及检测到的胞嘧啶与胸腺嘧啶的百分比(分别为 freqC 和 freqT)。
| 每通道 ERRBS 文库数量 | 唯一比对读段的平均数量 | 覆盖的 CpG 位点平均数量 | 每个 CpG 位点的平均测序深度 |
| 1 | 152,231,184 ± 13,189,678 | 3,183,594 ± 713,547 | 85 ± 16 |
| 2 | 77,680,837 ± 7,657,058 | 2,674,823 ± 153,494 | 49 ± 9 |
| 3 | 49,938,156 ± 2,436,865 | 2,552,186 ±- 76,624 | 39 ± 2 |
| 4 | 34,457,208 ± 4,441,686 | 1,814,461 ± 144,339 | 28 ± 4 |
表8: 单样本与多重ERRBS文库测序的代表性参数。 显示的是每通道51个循环的单端测序运行所得数据:每通道唯一比对的读段数、覆盖的CpG位点数量以及每个CpG位点的平均覆盖深度,数据来源于每通道测序单个ERRBS文库(n = 100)、每通道两个ERRBS文库(n = 128)、每通道三个ERRBS文库(n = 11)以及每通道四个ERRBS文库(n = 11)的结果,数值以均值±标准差表示。
本方案可获得生物相关基因组区域胞嘧啶甲基化的碱基对分辨率数据。当前方案已针对50 ng起始材料进行优化,但亦可调整以适用于不同量的输入材料(5 ng或以上)。26这将需要对方案中的某些步骤进行调整,如所示。 表6ERRBS文库适用于双端测序,通过超过51个循环的读长测序可进一步提高基因组覆盖度。多重测序可降低每个样本的测序成本,但会导致数据中每个CpG位点的覆盖深度降低图5 和 表8),无法提供足够的覆盖深度,以进行需要每个CpG位点高覆盖度的分析(例如 如Landan所述 等33最后,本实验方案(或任何基于亚硫酸氢盐的方案)无法区分甲基化胞嘧啶与羟甲基化胞嘧啶。46,47然而,所生成的数据可与其他实验方案的结果进行整合48,49 以阐明不同的修饰类型,以及最近报道的其他胞嘧啶修饰50,如果这些内容会引起兴趣的话。
高质量的文库如图3A-C所示,合并后进行测序时会产生如图3G(红色轨迹)所示的峰图,表明两个文库组分的摩尔浓度相等。文库构建失败可能发生在实验流程的任何步骤中。若使用降解的DNA进行处理,则所得文库中MspI片段不会富集,从而导致按照本方案所述测序参数获得的CpG覆盖度较低。若某一酶失活或意外遗漏于某一步反应中,将无法获得预期的文库。若连接反应效率低下、接头浓度高于预期和/或引物浓度在最终扩增步骤中成为限制性因素,均可能导致文库构建失败。文库中过量的接头(在生物分析仪结果中表现为约150 bp处的峰;图3D-F)也会干扰测序,因为文库和过量接头会无差别地发生簇生成。尽管此类文库可能表现出看似正常的测序结果,但其中相当一部分测序读段仅为接头序列。若在文库中观察到过量接头,最好在材料允许的情况下,使用最佳输入量与接头比例重新进行文库构建。最后,为确保文库的PCR扩增效率,在整个亚硫酸氢盐转化和PCR富集步骤中,应将较小和较大的文库组分保持为独立的样品。若未如此操作,则在PCR扩增过程中,大小不同的文库组分扩增效率将出现差异(如图3G蓝色轨迹所示),并可能导致测序时各文库组分所覆盖的基因组位点代表性不均。用户可选择在亚硫酸氢盐转化后立即加入定量PCR步骤,以进一步确定扩增所构建文库所需的最优PCR循环数。
ERRBS 文库构建方案包含多个关键步骤,各步骤中建议使用特定的试剂。在末端修复步骤中,使用四种核苷酸的 dNTP 混合物可对不含 CG 突出末端的产物进行末端修复,例如由 MspI 酶的星号活性产生的片段或原始 DNA 样本中存在的机械剪切 DNA 片段,从而提高结果中 CpG 位点的代表性。在连接步骤中,必须使用高浓度连接酶(2,000,000 单位/mL)和甲基化接头,以确保连接反应高效,并防止后续的亚硫酸氢盐转化影响接头序列——这些序列对数据的准确比对至关重要。在 PCR 步骤中,必须使用能够扩增经亚硫酸氢盐处理的富含 GC 的 DNA 片段的聚合酶,以实现高特异性。最后,为彻底去除多余的接头和引物,建议采用 SPRI 磁珠纯化法(例如:Agencourt AMPure XP),而非基于离心柱的纯化方法,用于连接产物和 PCR 产物的分离。
为了获得高质量的数据,确保高效的亚硫酸氢盐转化至关重要。所提供的对照使用户能够在测序前评估转化效率。作为替代方案,可使用非人类来源的DNA(如λ DNA)作为内参对照(spike-in)。由于物种差异,此类对照可直接用于后续测序分析例如 如 Yu 所用 等34然而,如果使用了外源添加的对照序列(spike-in),则除非在文库测序之前对其进行特异性扩增并独立测序,否则无法用于测定文库测序前的转化效率。所测定的转化率基于非CpG位点的甲基化状态,因此在非CpG背景下胞嘧啶甲基化水平较高的情况下(例如胚胎干细胞),该方法可能不适用;此时可采用平行样本或其他方法来评估转化效率。
ERRBS文库测序存在一些独特的注意事项。由于MspI识别切割位点(C^CGG;见图4B、C),所测序的文库片段前三个碱基几乎完全非随机,这可能导致测序过程中尽管表观簇密度较高,但因簇定位不佳而导致低质量读段,进而造成显著的数据丢失。为克服这一障碍,建议在独立通道中加入高复杂度文库作为专用对照(如PhiX对照或其他类型文库)。高复杂度文库在测序前四个碱基中具有均衡的A、C、T和G分布。合适的对照通道可包括RNA-seq、ChIP-seq、全基因组测序文库,或测序仪制造商提供的对照(例如 PhiX Control v3)。当指定为相应测序运行的对照通道时,该对照可用于生成测序前四个碱基的矩阵,以实现簇位置的准确识别。由此获得的高质量读段可使每个CpG位点的平均覆盖度提高5.2倍(n = 4)。此外,也可采用此前描述的“暗测序”(dark sequencing)方法来克服这一技术难题23。其他测序参数应遵循制造商标准操作程序。最后,数据分析中选择的每个CpG位点的覆盖度将由用户根据具体研究需求决定。10x覆盖度阈值可支持高覆盖度分析策略,但若研究需要,该阈值也可适当降低。
对ERRBS数据分析的全面讨论超出了本文的范围,但可以使用开源工具来确定差异甲基化的胞嘧啶和区域31,51-53。其他分析注意事项和方法已有详尽描述54,55,建议读者查阅相关文献,选择最适合计划中分析工作的工具。
与其他已发表的方法相比,ERRBS 提供了一个为期四天的实验流程,按照所述方法操作可获得高重复性。该方法已通过与金标准 MassARRAY EpiTYPER26 的对比验证,具有成本效益,适用于高覆盖度测序数据,并可根据不同起始材料量(有利于临床样本处理及低丰度细胞类型)和测序策略进行灵活调整。ERRBS 能在生物学相关位点提供单碱基分辨率,可用于与其他全基因组技术(如转录因子结合、染色质重塑、表观遗传标记及其他感兴趣的胞嘧啶修饰谱型分析)联合的整合分析。在这些研究中使用 ERRBS 数据有助于构建全面的分子研究策略,支持对生物模型和人类疾病的高维度分析。
作者声明无利益冲突。
我们感谢原始ERRBS报告的所有作者。感谢Mame Fall提供的技术协助。我们感谢威尔康奈尔医学院表观基因组学核心实验室提供的技术服务和帮助。本工作获得了Sass基金会Judah Folkman奖学金、NCI K08CA169055和ASH-AMFDP12005(授予FGB)、NIH R01HG006798和R01NS076465、Irma T. Hirschl和Monique Weill-Caulier慈善信托基金以及STARR联盟(I7-A765)(授予CEM)的资助,以及LLS SCORE基金(7006-13,授予AMM)的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| MspI | New England Biolabs | R0106M | 100,000 单位/毫升 |
| NEBuffer 2 | New England Biolabs | B7002S | MspI 酶的反应缓冲液;方案步骤 1.2 |
| 苯酚溶液 | Sigma-Aldrich | P4557 | 用 10 mM Tris HCl(pH 8.0)平衡;参见 http://www.sigmaaldrich.com/catalog/product/sigma/p4557 上的安全与操作说明 |
| 氯仿 | Sigma-Aldrich | C2432 | 参见 http://www.sigmaaldrich.com/catalog/product/sial/c2432 上的安全与操作说明 |
| 糖原 | Sigma-Aldrich | G1767 | 19–22 毫克/毫升 |
| NaOAc | Sigma-Aldrich | S7899 | 3 M,pH 5.2 |
| 乙醇 | Sigma-Aldrich | E7023 | 200 证明,用于分子生物学 |
| Buffer EB | Qiagen | 19086 | 10 mM Tris-Cl,pH 8.5 |
| 三(羟甲基)氨基甲烷(Tris) | Sigma-Aldrich | T1503 | 配制 1 M、pH 8.5 的溶液 |
| Tris-乙二胺四乙酸(TE) | Sigma-Aldrich | T9285 | 按制造商推荐稀释为 1× 缓冲液 |
| T4 DNA 连接酶反应缓冲液 | New England Biolabs | B0202S | 10× 浓度 |
| 脱氧核苷三磷酸(dNTP)溶液混合物 | New England Biolabs | N0447L | 每种核苷酸 10 mM |
| T4 DNA 聚合酶 | New England Biolabs | M0203L | 3,000 单位/毫升 |
| DNA 聚合酶 I 大片段(Klenow 片段) | New England Biolabs | M0210L | 5,000 单位/毫升 |
| T4 多核苷酸激酶 | New England Biolabs | M0201L | 10,000 单位/毫升 |
| QIAquick PCR 纯化试剂盒 | Qiagen | 28104 | 用于方案步骤 2.3 中的 DNA 产物纯化 |
| 2'-脱氧腺苷-5'-三磷酸(dATP) | Promega | U1201 | 100 mM |
| Klenow 片段(3'→5' 外切酶缺陷型) | New England Biolabs | M0212L | 5,000 单位/毫升 |
| MinElute PCR 纯化试剂盒 | Qiagen | 28004 | 用于方案步骤 3.3 中的 DNA 产物纯化 |
| T4 DNA 连接酶 | New England Biolabs | M0202M | 2,000,000 单位/毫升 |
| 甲基化接头寡核苷酸试剂盒 | Illumina | ME-100-0010 | |
| Agencourt AMPure XP | Beckman Coulter | A63881 | 用于实施磁珠纯化步骤的方案部分(步骤 4.3 和 8.2)。使用前平衡至室温。 |
| Pippin Prep 凝胶盒,2% 琼脂糖,无染料 | Sage Science | CDF2010 | 含内部标准品 |
| 认证低分子量超纯琼脂糖 | Bio-Rad | 161-3106 | |
| Tris-硼酸-EDTA(TBE)缓冲液 | Sigma-Aldrich | T4415 | |
| 溴化乙锭溶液 | Sigma-Aldrich | E1510 | 10 毫克/毫升 |
| 50 bp DNA 标准分子量标记 | NEB | N3236S | |
| 100 bp DNA 标准分子量标记 | NEB | N3231S | |
| 凝胶上样染料,橙色(6×) | NEB | B7022S | |
| 手术刀 刀片 编号 11 | Fisher Scientific | 3120030 | |
| QIAquick 凝胶回收试剂盒 | Qiagen | 28704 | |
| EZ DNA 甲基化试剂盒 | Zymo Research | D5001 | 用于方案步骤 6.2 |
| EZ DNA 甲基化-快速试剂盒 | Zymo Research | D5030 | 步骤 6.2 的替代方案 |
| 通用甲基化人 DNA 标准品 | Zymo Research | D5011 | 用作亚硫酸氢盐转化对照 |
| FastStart 高保真 PCR 系统 | Roche | 03553426001 | |
| Qubit dsDNA 高灵敏度检测试剂盒 | Life Technologies | Q32854 | 基于荧光的 DNA 定量检测;用于方案步骤 1.1、9.1 和 10.1 |
| DynaMag-2 磁力架 | Life Technologies | 12321D | |
| 高灵敏度 DNA 检测试剂盒 | Agilent Technologies | 5067-4626 | |
| 2100 Bioanalyzer | Agilent Technologies | ||
| PhiX Control v3 | Illumina | FC-110-3001 | |
| HiSeq 2500 | Illumina | ||
| Pippin Prep | Sage Science | ||
| Qubit 2.0 荧光计 | Life Technologies | Q32872 | |
| TruSeq SR Cluster Kit v3-cBot-HS | Illumina | GD-401-3001 | |
| TruSeq SBS Kit v3-HS | Illumina | FC-401-3002 | |
| TruSeq RNA 样品制备 | Illumina | RS-122-2001 | 用于文库多重分析的条形码接头;多重分析方案见补充文件。 |
| 微量离心机 | |||
| 涡旋混合器 | |||
| 干式恒温金属浴 | |||
| 热循环仪 | |||
| 水浴锅 | |||
| 凝胶电泳系统 | |||
| 电泳电源 | |||
| 凝胶成像系统 | |||
| 紫外或蓝光透射仪 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可