方法文章

利用纠错型DNA和RNA测序进行稀有事件检测

14.8K 次观看

DOI:

10.3791/57509

2018年8月3日

* These authors contributed equally

本文内容

摘要

下一代测序(NGS)是一种强大的基因组表征工具,但其应用受到该平台较高错误率(约0.5–2.0%)的限制。我们介绍了错误校正测序的方法,可消除NGS的错误率影响,检测到低至0.0001变异等位基因分数的突变。

摘要

传统的下一代测序技术(NGS)在过去十多年中实现了大规模的基因组特征分析。特别是,NGS已被用于分析恶性肿瘤中克隆性突变的谱系。尽管NGS比传统的Sanger测序方法高效得多,但由于其较高的错误率(约0.5–2.0%),在识别罕见的克隆和亚克隆突变方面仍存在困难。因此,标准NGS对突变的检测下限为>0.02变异等位基因频率(VAF)。尽管在无已知疾病的患者中,如此罕见突变的临床意义尚不明确,但在白血病患者中,当通过流式细胞术检测到的残留病灶水平低于<0.0001时,其治疗预后显著改善。为了降低NGS产生的这类人为背景噪音,已开发出多种方法。本文介绍一种错误校正的DNA和RNA测序(ECS)方法,该方法通过对单个分子标记一个16 bp的随机索引用于错误校正,同时标记一个8 bp的患者特异性索引以实现多重检测。我们的方法能够检测并追踪变异等位基因频率(VAF)比NGS检测限低两个数量级的克隆突变,最低可至0.0001 VAF。

引言

随着年龄增长,暴露于诱变剂以及细胞分裂过程中的随机错误会导致基因组中体细胞异常的累积,这是恶性转化、神经发育性疾病、儿科疾病以及正常衰老基本发病机制的基础1,2。具有致病潜力的体细胞突变是早期检测和风险评估中重要的诊断与预后生物标志物3,4,5。为了更好地理解生理性的克隆形成过程,从而为临床和科研决策提供依据,准确量化和表征这些突变至关重要。目前,下一代测序技术(NGS)被用于研究异质性DNA样本中的克隆突变;然而,由于测序平台本身存在0.5–2.0%的固有错误率,NGS仅能检测变异等位基因频率(VAF)高于>0.02的突变6,7,8。因此,使用标准NGS方法无法追踪VAF较低但具有诊断和预后意义的体细胞变异。

近年来,为了克服高通量测序(NGS)的错误率,已开发出多种方法8,9,10,11。这些方法利用分子标记技术,可在测序后进行错误校正。在测序文库中,每条分子或基因组片段都被标记上一个随机的、专属于该分子的唯一分子标识符(Unique Molecular Identifier, UMI)。UMI由一段随机核苷酸序列(8–16 N)的不同排列组合构成。此外,流程中还整合了第二个样本特异性条形码,使得多个样本可在同一次NGS测序运行中实现多重检测。对分子标记后的文库进行PCR扩增,随后送入测序环节。在文库构建过程中,PCR扩增和测序阶段预期会随机引入基因组片段的错误8。为了去除随机测序错误,原始测序读段将根据其UMI进行分组。由于错误的引入具有随机性,测序产生的假象(artifacts)不太可能在同一基因组位置、具有相同UMI的所有读段中同时出现;而真实的变异则会在所有共享相同UMI的读段中被一致地扩增和测序。这些假象可通过生物信息学方法予以剔除。本文中,我们描述了三种在实验室中优化的错误校正测序(Error-corrected Sequencing, ECS)方法,分别用于DNA样本中单核苷酸变异(SNVs)和小片段插入缺失(Indels)的检测,以及RNA样本中低于NGS测序错误阈值水平的基因表达定量分析。

第一种方法描述了如何使用研究人员设计的基因特异性引物来检测罕见的体细胞事件。在文库构建之前,研究人员应设计引物以靶向感兴趣的片段。我们使用了网络应用程序 Primer3(http://bioinfo.ut.ee/primer3-0.4.0/)。对于聚合酶链式反应(PCR)而言,200–250 bp 的扩增子是理想的,因为这些扩增子在引入分子标签(UMI)后,使用 150 bp 的双端测序即可产生重叠的成对末端读段。引物设计的最佳条件如下:引物最小长度 = 19;引物最佳长度 = 25;引物最大长度 = 30;最小退火温度(Tm)= 64 °C;最佳退火温度(Tm)= 70 °C;最大退火温度(Tm)= 74 °C;引物对间最大 Tm 差异 = 5 °C;最小 GC 含量 = 45;最大 GC 含量 = 80;返回引物数量 = 20;3' 端最大稳定性 = 100。

在方法2中,我们描述了一种将ECS-DNA方案与Illumina测序化学技术相结合的方法,利用市售的包含数百个扩增子的基因检测面板,检测频率低至0.0001 VAF的克隆性单核苷酸变异(SNVs)和小片段插入缺失(Indels)。在实验中,我们采用了Illumina公司的TruSight Myeloid测序面板,并设计了一个扩展面板,以纳入更多与儿童髓系疾病相关的感兴趣基因。这些面板未提供可用于辅助错误校正的独特分子标识符(UMIs),因此我们为这些面板添加了自主设计的接头策略。ECS方法同样适用于其他旨在富集与不同疾病相关基因的检测面板。在从目标组织或样本中完成DNA提取及定量后,建议每个样本至少准备500 ng的储备DNA。我们常规使用250 ng DNA构建单个测序文库,以尽可能捕获更多的独特基因组片段,用于后续的读段去重和VAF计算。剩余的250 ng DNA可选用于构建重复测序文库。我们始终为每个样本构建两个重复文库,并仅将两个重复中均独立检测到的变异视为真实阳性事件。此外,我们还采用了一种基因组位置特异性的二项式错误模型,以提高变异检测的准确性4,13

最后,我们介绍一种将ECS与RNA测序相结合的方法,用于转录本定量分析,该方法使用现成的QIAseq靶向RNA试剂盒(Qiagen)。用于去重和错误校正的分子标签(UMI)已整合在试剂盒中,研究人员可按照制造商的建议构建文库。在生物信息学分析方面,研究人员可遵循ECS-DNA部分所述的分析流程,该流程将在“实验方案”部分详细说明。

方案

1. DNA 靶向纠错测序

  1. 目的基因组片段的 PCR 扩增
    1. 使用高保真DNA聚合酶扩增扩增子(材料表,第1项)。在PCR仪中按以下条件扩增PCR反应:30秒,98°C; 98 °C;18–40 个循环,每个循环 10 秒,95°C 98 °C,30 秒于 66 °C,以及30秒 72 °C;2 分钟 72 °C;保持在 4 °C.
    2. 使用磁性 beads 纯化 PCR 产物(材料表,项目2)。根据生产商说明书,按1:1.8的比例(PCR反应液体积:磁珠体积)将PCR反应液加入磁珠中。洗脱时使用 20 µL 去离子水2O.
    3. 定量测定DNA浓度(材料表,项目3)以确定DNA的最终浓度。
    4. 将DNA样品取一部分在2%琼脂糖凝胶上电泳材料表,第4项)以确认扩增子的大小。
      注意:研究人员也可选择对PCR产物进行Bioanalyzer分析,以确定扩增的基因组片段大小及产物浓度。
  2. 测序接头退火
    1. 获取 i7 接头(adapter)材料表,第5项)。在后续步骤中直接使用所提供的试剂。
    2. 购买市售的16N i5接头,其寡核苷酸序列为(材料表项目6):AATGATACGGCGACCACCGAGATCTACAC(N1:25252525)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)(N1)ACACTCTTTCCCTACACGACGCTCTTCCGATCT
      注意:16N i5接头替代标准i5接头,其为含有16个随机核苷酸序列的接头,用于促进ECS。
    3. 制备16N i5接头工作液: 40 µL 的 100 µM 16N i5接头储备液, 10 µL TE 缓冲液,以及 10 µL 的 500 µM NaCl 溶液
    4. 等分试样 7.5 µL 将第1.2.3步制备的i5工作溶液分别加入不同的PCR孔中。
    5. 添加 5 µL 将样本特异性的 i7 接头加入对应的孔中。
    6. 孵育于 95 °C 5 分钟,然后冷却 1 °C 每30秒 4 °C 在热循环仪中。
    7. 保持在 4 °C.
  3. 末端修复 & 文库的dA加尾
    注意:在进行接头退火的同时,可对步骤1.1中的PCR扩增产物进行末端修复和dA加尾。完成这些步骤后,将步骤1.2中已退火的接头连接至经过末端修复和dA加尾的PCR扩增产物上。接头连接完成后,ECS文库构建即告完成。
    1. 最多从以下开始 1 µg 起始DNA量(最低约200 ng)
    2. 对扩增子进行末端修复和加dA尾(材料表,项目 7)。
      1. 添加 3.0 µL 末端修复酶混合物 6.5 µL 末端修复缓冲液
      2. 37 °C下孵育混合物30分钟 20 °C,然后在 65 °C 并保持在 4 °C.
    3. 对退火后的接头进行连接反应(材料表,项目 8)。
      1. 添加 2.5 µL 步骤2中退火接头的 15 µL Blunt/TA连接酶主混合液,以及 1 µL 连接增强剂
      2. 在37°C下孵育混合物15分钟 20 °C,然后在 37 °C.
    4. 使用磁珠纯化文库(材料表项目2):将PCR反应产物与磁珠按改良的1:0.75比例(PCR反应体积:磁珠体积)加入。
      1. 移液器 62.6 µL 磁珠溶液 83.5 µL 第1.2.7步中PCR产物的
      2. 将混合物转移至一个1.5 mL低吸附离心管中。
      3. 用移液器上下吹打至少10次,充分混匀。
      4. 将混合物在室温下静置5分钟。
      5. 将试管置于磁力架上,在室温下孵育2分钟,或直至上清液变澄清。
      6. 移除上清液。
      7. 洗涤珠子 200 µL 70% 乙醇
      8. 孵育30秒,去除乙醇。
      9. 重复乙醇洗涤步骤一次。
      10. 将珠子风干。
      11. 用……洗脱 20 µL 去离子水2O.
        注意:这种对PCR反应与磁珠比例的调整将优先去除小于200 bp的DNA片段。
  4. 微滴数字PCR定量
    注意:精确的突变定量需要严格控制加载到测序仪上的每个文库的分子数量。为实现这一点,使用 QX200 微滴数字 PCR(ddPCR)平台对单位体积内各单个文库的分子数进行定量——定量 PCR 可作为替代方案。完成 ddPCR 分析后,结果将提供每微升的分子数 µL 每个文库
    1. 将ECS文库在PCR条状管中按10倍梯度稀释,最终稀释至1:1,000。
    2. 在1.5 mL离心管中配制以下数字PCR反应主混合液: 10 µL PCR混合液材料表,项目 9), 0.2 µL P5 引物 0.2 µL P7引物 5 µL 步骤1.4.1中经ECS纯化后的产品, 4.5 µL 去离子水2O.
    3. 等分试样 20 µL 将主混合液加入每个样品孔中,确保数量为8的倍数。
      1. 等分试样 70 µL 液滴生成油(材料表,第10项)加入每个油井中。用橡胶垫片密封盒盖。
    4. 使用液滴发生器制备液滴(材料表,项目11)。
    5. 使用多通道移液器,将步骤 1.4.4 中生成的液滴缓慢加入 PCR 板中,移液过程需持续约 5 秒,以避免剪切 DNA。
    6. 在热循环仪中使用以下条件对液滴中的信号扩增40个循环:5分钟,95 °C; 95 °C;40个循环,每个循环30秒 95 °C1分钟 63 °C;5 分钟 4 °C,5 分钟 90 °C;然后保持在 4 °C.
    7. 准备ddPCR模板液滴读取仪机器(材料表,项目11)。确保参数的规格要求 绝对定量 并使用 QX200 ddPCR Eva Green Supermix
    8. 数字PCR分析完成后,务必在所有样本中设置相同的分割阈值。
    9. 根据 QX200 微滴读取仪的浓度读数,分装适当体积,以在后续步骤中引入所需数量的分子。
  5. 用于测序的文库PCR扩增
    1. 从第1.4.9步中确定所需分子数,配制以下主混合液: 25 µL Q5 Mastermix 的材料表,项目1), 2.5 µL P5引物(10 µM), 2.5 µL P7引物的10 µM),X µL DNA,20-X µL 去离子水2O.
    2. 从步骤1.5.1中扩增文库,使用以下条件在热循环仪中进行:30秒, 98 °C;20个循环,每次10秒 98 °C,30 秒 63 °C,30 秒 72 °C;2 分钟 72 °C;然后保持在 4 °C.
    3. 使用磁珠纯化文库(材料表,项目2):将PCR反应产物按1:0.75的改良比例(PCR反应体积:磁珠体积)加入磁珠中。
      1. 移液器 37.5 µL 磁珠溶液加入到 50 µL 步骤1.5.2中的PCR产物
      2. 将混合物转移至1.5 mL低吸附离心管中。
      3. 用移液器上下吹打至少10次,充分混匀。
      4. 将混合物在室温下静置5分钟。
      5. 将试管置于磁力架上,在室温下孵育2分钟,或直至上清液变澄清。
      6. 移除上清液。
      7. 洗涤珠子 200 µL 70% 乙醇
      8. 孵育30秒。去除乙醇。
      9. 重复乙醇洗涤步骤一次。
      10. 将珠子风干。
      11. 用……洗脱 20 µL 去离子水2O.
    4. 取部分DNA样品在2%琼脂糖凝胶上电泳,以确认扩增片段的大小。
    5. 定量 DNA 浓度(材料表,项目3)以确定独立的ECS文库的浓度。
    6. 将文库等摩尔量混合。
      注意:例如,研究人员可以将八个文库以等摩尔比例混合为一组4 使用可输出高达4亿条读段的测序平台进行测序,起始分子数为400万。保守估计,建议每个分子平均使用10条原始读段用于纠错。这将占用3.6亿条读段(400万分子 × 8个文库 × 10条纠错读段)。每个文库含有400万个独特分子,研究人员可预期每个扩增子获得理论平均共识读段覆盖深度为7042x(400万/基因 panel 中的568个扩增子)。
    7. 测定 DNA 浓度材料表,项目 3)以测定混合ECS文库的浓度。
    8. 提交混合后的ECS文库,浓度约为4 nM。
    9. 向Illumina测序平台(MiSeq、HiSeq或NextSeq)提供以下测序设置:2×144双端读长,Index 1为8个循环,Index 2为16个循环。

2. 基于DNA错误校正测序的基因 panel

  1. 基因面板寡核苷酸的杂交
    注意:在此步骤中,将使用改良的 Illumina TruSight 或 TruSeq 方案构建测序文库,以引入分子标签(UMI)材料表,项目 17)。
    1. 按照制造商说明书将寡核苷酸杂交至基因组片段。使用250 ng DNA(或任意所需起始量的材料)。
    2. 按照制造商说明书去除未结合的寡核苷酸。
    3. 按照制造商说明书进行连接延伸反应。
      注意:以下从制造商说明书的修改开始。
  2. 通过PCR整合i5和i7接头
    1. 通过移液将以下试剂加入适当体积的离心管中,制备PCR预混液: 37.5 µL Q5预混液(材料表,项目 1), 6 µL 的 10 µM 16N i5接头(详见方法1,步骤1.2.2), 6 µL i7接头(用于多重测序的不同样本需使用不同的i7接头),以及 22 µL 含步骤 2.1.3 中磁珠的连接延伸溶液
      注意:Q5预混液可替代Illumina提供的聚合酶预混液。Q5聚合酶在扩增基因组片段时具有更高的保真度,且引入的错误更少。
    2. 在热循环仪上运行 PCR 程序,参数设置如下:98 °C 30 秒;随后进行 4–6 个循环:98 °C 10 秒,66 °C 30 秒,72 °C 30 秒;最后 72 °C 2 分钟,并于 4 °C 保存。
      注意:循环次数取决于基因 panel 的大小。根据我们的经验,如果基因 panel 包含约 1,500 对不同的基因特异性寡核苷酸,则进行 4 个 PCR 循环已足够;而包含 500–600 对寡核苷酸的 panel 则需要 6 个 PCR 循环。
    3. 使用磁珠纯化PCR反应(材料表,项目2):将PCR反应产物加入经改良的1个PCR反应体系中,磁珠比例为0.75
      1. 移液器 56.25 µL 磁珠溶液加入到 75 µL 第2.2.2步PCR产物的
      2. 将混合物转移至1.5 mL低吸附离心管中。
      3. 用移液器上下吹打至少10次,充分混匀。
      4. 室温下静置混合物5分钟。
      5. 将离心管置于磁力架上,在室温下孵育2分钟,或直至上清液变澄清。
      6. 移除上清液。
      7. 洗涤珠子 200 µL 70% 乙醇
      8. 孵育30秒,去除乙醇。
      9. 重复乙醇洗涤步骤一次。
      10. 将珠子风干。
      11. 用……洗脱 20 µL 去离子水2O.
  3. 使用 QX200 ddPCR 平台对文库进行定量。
    1. 遵循方法1中的步骤1.4。
      注意:每个样本文库均标准化为400万条分子4 在代表性结果中(图2)以获得每个基因特异性寡核苷酸对应的理论平均值为7,042个唯一索引分子(400万除以568个基因特异性寡核苷酸)。
  4. 扩增并标准化用于测序的文库。
    1. 使用以下总反应体系进行最终PCR,扩增所需数量的分子 50 µL: 25 µL Q5预混液 2 µL P5引物(1 µM), 2 µL P7引物的1 µM),以及 21 µL DNA分子
    2. 在PCR仪上运行PCR程序,参数如下:30 s,95 °C 98 °C;16个循环,每个循环10秒 98 °C,30 秒 66 °C,30 秒 72 °C;2 分钟 72 °C;然后保持在 4 °C.
    3. 使用磁珠纯化测序文库(材料表,项目2):将PCR反应产物加入磁珠中,磁珠用量为改良后的1个PCR反应体系:0.75倍磁珠比例:
      1. 移液器 37.5 µL 磁珠溶液的 50 µL 步骤 2.4.2 中的 PCR 产物
      2. 将混合物转移至1.5 mL低吸附离心管中。
      3. 用移液器上下吹打至少10次,充分混匀。
      4. 室温下静置混合物5分钟。
      5. 将试管置于磁力架上,在室温下孵育2分钟,或直至上清液变澄清。
      6. 移除上清液。
      7. 洗涤珠子 200 µL 70% 乙醇
      8. 孵育30秒。去除乙醇。
      9. 重复乙醇洗涤步骤一次。
      10. 将珠子风干。
      11. 用……洗脱 20 µL 去离子水2O.
    4. 运行一份洗脱的DNA等分试样(~3 µL在2%琼脂糖凝胶上进行电泳,以确认扩增片段的大小。
    5. 测定 DNA 浓度材料表,项目3)以确定独立ECS文库的浓度。
    6. 将文库等摩尔量混合。有关混合的更多细节,请参见方法1步骤1.5.6以及讨论部分。
    7. 以约 4 nM 的浓度提交合并的 ECS 文库。
    8. 向Illumina测序平台(MiSeq、HiSeq或NextSeq)提供以下测序设置:2×144双端读长,Index 1为8个循环,Index 2为16个循环。
  5. ECS 生物信息学处理与分析
    1. 从测序仪获取样本解复用后的序列读段,或使用定制脚本根据i7接头序列通过生物信息学方法将原始序列读段解复用为不同样本。
    2. 切除每条解复用序列的前 30 个核苷酸,以去除基因 panel 中的寡核苷酸序列。
    3. 将具有相同UMI的序列读段相互比对,以形成读段家族。
      注意:研究人员可以使用支持UMI的软件,例如MAGERI13 提取读段家族。本实验中,UMI序列内部不允许存在汉明距离,以提高方法的特异性。
    4. 使用以下推荐参数进行去重和纠错。
      1. 使用不少于5对同一读段家族中的读段,建议至少使用3对读段。
      2. 比较同一读段家族中所有读段在每个位点的核苷酸,若特定核苷酸的读段间一致性至少达到90%,则生成该位点的共识核苷酸;若某核苷酸位点的一致性低于90%,则记为N。
      3. 丢弃具有共识的读段 >被判定为 N 的一致核苷酸占核苷酸总数的 10%。
    5. 使用研究者偏好的比对工具(如 Bowtie2 和 BWA),将所有保留的共识序列局部比对至 hg19 或 hg38 人类参考基因组。
    6. 使用参数 –BQ0 –d 10,000,000,000,000 对比对后的序列进行 Mpileup 处理,以消除覆盖深度阈值,确保无论变异等位基因频率(VAF)如何,均能获得准确的 pileup 输出。
    7. 过滤掉共识读段覆盖深度低于1000x的位点。
      注意:研究人员可自行确定每个核苷酸位点的最低覆盖深度,但建议在后续分析中至少达到 500x 的共识读取覆盖深度。
    8. 使用二项分布对步骤 2.5.7 保留的数据中的单核苷酸变异(SNPs)进行检测,参数如下。二项统计量将基于基因组位置特异性的错误模型。每个基因组位置在对该位置所有样本的错误率求和后,独立建模。参考如下示例:
      给定基因组位置的核苷酸谱型概率, p
      ∑ 变体 RF2 ∑ 总 RFs
      = 26/255505
      = 0.000101759
      35911 个总 RF 中出现 24 个变异 RF 的二项概率, P样本 K 中的(X ≥ x)
      = 1 - 二项分布(24, 35911, 0.000101759)
      = 2.26485E-13
      注意:对于查询的每个基因组位置,可能存在三种可能的突变变化(即,A>T,A>C,A>G),每个都会被视作背景伪影。在经过邦弗罗尼校正后,若体细胞事件与背景存在显著差异,则予以保留。在所示示例中 表1,进行的检验次数为11次,因此采用Bonferroni校正 p- 值需 ≤0.00454545(0.05/11)才能判定该事件具有统计学显著性。
    9. 体细胞事件需在同一标本的两个重复样本中均出现;否则应视为假阳性。

显示核苷酸变化 G>A、变异 RF 值及各样本中 p 值的基因组分析表格。
表 1:构建位点特异性二项误差模型方法的示例。

3. RNA 的纠错测序

  1. 除了在DNA水平上检测突变外,还可将ECS与多种靶向RNA测序 panel 结合,用于在RNA水平上检测稀有或低丰度的转录本。通过将ECS与商用的Qiagen RNA测序 panel 结合,我们实现了对低至仅含十个拷贝的转录本进行数字化定量分析,且无需对看家基因进行标准化。用于纠错的UMI已整合入该 panel 中。
    1. 进行总RNA提取(材料表,项目20)。
    2. 根据生产商的说明书进行ECS-RNA文库构建(材料表,项目19)。
    3. 按照前文所述方法2中的步骤2.5.1–2.5.6执行生物信息学分析流程。在完成步骤2.5.6后,每个基因的比对一致性读段数即代表该基因的表达水平,无需进行基因长度标准化。

结果

在DNA靶向错误校正测序中,我们通过将突变患者DNA稀释于商业基因组DNA中进行了原理验证实验。该患者在GATA1基因(chrX:48650264,C>G)存在突变,原始等位基因突变频率(VAF)为0.19。如图1所示,ECS对单核苷酸变异的定量能力可达1:10,000水平。

GATA1 稀释系列图;ECS 与肿瘤 DNA 的 VAF 对比;线性拟合 y=0.1864x,R²=0.99885。
图1:GATA1 SNV 的稀释系列,证明 ECS 的定量水平可达 1:10,000请点击此处查看此图的放大版本。

我们还证明,ECS-DNA 能够可靠地检测健康老年人群中反复发生于成人急性髓系白血病(AML)相关基因的罕见克隆突变4。我们从护士健康研究(Nurse's Health Study)的样本库中获取了20名健康个体的血沉棕黄层样本,这些样本采集时间相隔约10年。我们对这些样本应用了ECS-DNA panel检测方案。在本实验中,我们采用了Illumina TruSight Myeloid测序Panel,该Panel包含568个扩增子(基因列表的更多信息见 https://www.illumina.com/products/by-type/clinical-research-products/trusight-myeloid.html),并使用Illumina NextSeq平台对来自20名个体的80个文库进行测序(每名个体在两个不同时间点各采集一次样本,每个时间点设两个重复),共获得平均4770万条成对末端测序读长,每个文库平均生成340万条纠错后的共识序列4。每个文库的平均核苷酸覆盖深度约为6,000x(340万除以568)。对于每个样本,我们利用非同一样本的测序文库构建了位点特异性的错误谱。我们共发现109个克隆性体细胞突变,这些突变在至少一个时间点的两个重复样本中均被检出,其变异等位基因频率(VAF)范围为0.0003–0.1451。我们从中筛选出21个在COSMIC数据库中有已知记录的突变,并使用数字微滴PCR(ddPCR)对这21个突变在一次或两次采集时间点中进行了验证(n = 34,图2,改编自Young et al. 20164)。

ECS与ddPCR之间的VAF相关性图,线性回归,R²=0.9965,实验数据。
图2:通过ddPCR验证ECS检测到的突变,VAF高度一致。 (n=34,修改自Young et al. 20164)。 请点击此处查看该图的放大版本。

关于采用ECS-RNA方案进行误差校正后的表达水平检测,我们基于QIAseq化学方法定制了一个包含416个已知与多种癌症相关基因的基因 panel(改编自QIAseq人癌症转录组 panel),并对每个基因中最常表达的外显子进行了扩增(基因列表见补充材料1)。我们使用Illumina MiSeq平台对文库进行双端测序,每个文库平均获得830万条读长,成功捕获平均约41.7万条误差校正后的共识序列。结果显示,低丰度转录本(在50 ng总RNA中转录本数量<1,000)的表达水平在重复样本间具有高度可重复性(数据点n = 300,图3)。通过数字滴定PCR(ddPCR)对六个不同表达水平的基因进行验证表明,ECS方案能够准确捕获基因的表达水平,且无需进行标准化处理。

ECS-RNA转录本计数的散点图,与ddPCR的对数相关性,显示线性回归。
图3:上图,同一样本重复实验中ECS-RNA检测的转录本计数之间的相关性(n = 300)。下图,通过ddPCR验证ECS鉴定出的转录本计数(n = 6)。请点击此处查看该图的放大版本。

讨论

本文展示了一系列可轻松实施的纠错测序方案,可用于研究不同疾病中变异等位基因频率(VAF)较低的突变。其中最重要的因素是在测序前为每个分子引入唯一分子标识符(UMI),因为UMI能够对原始测序读长进行纠错。本文所述方法使研究人员能够将定制的UMI整合到 commercially available基因检测面板或自行设计的基因特异性寡核苷酸中。

标准的高通量测序(NGS)方案由于测序错误率的存在,难以检测变异等位基因频率(VAF)低于2%的突变,这限制了NGS在需要检测稀有变异的研究中的应用。通过克服标准NGS的测序错误率,ECS能够灵敏地检测这些低频原始变异。例如,在致病性突变最初出现时(因此VAF较低)即进行检测,对于指导疾病的早期干预至关重要14,15。在白血病研究中,检测微小残留病灶(治疗后残留的白血病细胞)有助于风险分层,并可为治疗方案的选择提供依据,这是传统的二元流式细胞术评估无法实现的。此外,ECS还可用于检测循环肿瘤核酸,并通过检测某些具有原发肿瘤特征的突变的存在与否及其变异负荷,评估实体瘤患者的转移潜能16

表1所示,基于二项分布的位点特异性错误模型在变异检测中的效能,在很大程度上取决于用于构建错误模型的文库数量以及测序深度。错误模型的稳健性随着样本数量的增加和测序深度的提高而增强。建议至少使用10个已测序的样本,每个样本平均错误校正后读长覆盖深度达到3000x,以构建每个样本的错误谱型。该位点特异性方法与MAGERI类似,但不同于将六种不同的碱基替换类型(A>C/T>G、A>G/T>C、A>T/T>A、C>A/G>T、C>G/G>C、C>T/G>A)的错误率进行合并计算的方法13,我们对每个位点上的每种替换类型独立建模。例如,某一基因组位点的C>T错误率可能与其他位点不同。我们的方法还考虑了测序批次效应,因为在一次测序运行中观察到的碱基替换率可能与另一次运行不同。因此,当合并来自不同测序批次的样本以构建模型时,尤其需要对所有替换类型在每个位点分别建模。

设计ECS实验时,一个重要的考虑因素是所需的检测阈值。NGS研究的优势在于,其在目标基因/靶点数量、检测阈值(由测序深度决定)以及检测个体数量方面均可灵活扩展。例如,若研究人员希望以0.0001的检测阈值检测两个扩增子中的稀有突变,则可使用MiSeq V2化学试剂,在单次测序运行中最多混合75个样本,该试剂最多可产生1500万条读长(2个扩增子 × 10,000个分子 × 用于纠错的10次读取 × 75个样本 = 1500万条测序读长)。研究人员可通过调整进入测序的分子数量或单次测序运行中混合的样本数量,来调节检测阈值。在我们的研究中,目标是使用Illumina基因 panel 以0.0001 VAF(1:10,000)的检测阈值检测突变。我们通常使用250 ng起始DNA,以确保捕获足够数量的分子,从而达到上述检测阈值。如果研究人员期望的检测限高于>0.001 VAF,可选择起始使用较少的DNA量(建议为50 ng)。

由于UMI被添加到i5索引上,测序设置需相应调整。例如,我们使用了16个N的UMI,测序设置为2×144的双端读长,Index 1为8个循环,Index 2为16个循环,而不是通常的Index 2 8个循环。Index 2循环数的增加通过减少分配给读长的总循环数来补偿。如果研究人员选择使用12N的UMI10,17,则应将设置更改为Index 2 12个循环。

这种基于UMI的测序方法经过优化,可校正测序错误。但在应对PCR扩增偏差(jackpotting)方面仍不够理想,这是所有基于扩增的方法共有的问题。我们通过数字滴定PCR(ddPCR)进行了多轮测序后及生物信息学分析后的验证,几乎未检测到由PCR扩增偏差导致的假阳性结果。尽管如此,仍建议研究人员使用高保真聚合酶进行实验,以确保扩增错误率较低。

披露

作者无任何利益冲突需要披露。

致谢

感谢儿童肿瘤学组 AAML1531 研究和护士健康研究的参与者提供患者样本。本研究由美国国立卫生研究院(UM1 CA186107、RO1 CA49449 和 RO1 CA149445)、华盛顿大学与圣路易斯儿童医院儿童发现研究所(MC-II-2015-461)以及 Eli Seth Matthews 白血病基金会资助。

材料

本文使用的材料清单
姓名公司目录编号评论
Q5 高保真热启动预混液New England BioLabsM0492S
Agencourt AMPure XPBeckman CoulterA63880
Qubit dsDNA HS 检测试剂盒Thermo Fisher ScientificQ32854
SYBR Safe DNA 凝胶染料Thermo Fisher ScientificS33102
Truseq 定制扩增子索引试剂盒IlluminaFC-130-1003
UMI i5 接头序列Integrated DNA Technologies-
NEBNext Ultra 末端修复/dA加尾模块New England BioLabsE7442S
NEBNext Ultra II 连接模块New England BioLabsE7595S
QX200 ddPCR EvaGreen 超混液Bio-Rad1864034
QX200 微滴生成油(用于 EvaGreen)Bio-Rad1864005
QX200 微滴数字 PCR 系统Bio-Rad1864001
ddPCR 96 孔板Bio-Rad12001925
QX200/QX100 微滴生成仪用 DG8 羧夹Bio-Rad1864008
QX200/QX100 微滴生成仪用 DG8 垫圈Bio-Rad1863009
生物分析仪Agilent GenomicsG2939BA
TapeStationAgilent GenomicsG2991AA
TruSight 髓系测序面板IlluminaFC-130-1010
Bowtie 2Johns Hopkins University-
定制 QIAseq 靶向 RNA 面板Qiagen-
RNeasy Plus Mini Kit (50)Qiagen74134

参考文献

  1. Hoang, M. L., et al. Genome-wide quantification of rare somatic mutations in normal tissues using massively parallel sequencing. Proceedings of the National Academy of Sciences USA. 113, 9846-9851 (2016).
  2. O'Roak, B. J., et al. Sporadic autism exomes reveal a highly interconnected protein network of de novo mutations. Nature. 485, 246-250 (2012).
  3. Young, A. L., et al. Quantifying ultra-rare pre-leukemic clones via targeted error-corrected sequencing. Leukemia. 29 (7), 1608-1611 (2015).
  4. Young, A. L., Challen, G. A., Birmann, B. M., Druley, T. E. Clonal hematopoiesis harbouring AML-associated mutations is ubiquitous in healthy adults. NatureCommunications. 7, 12484(2016).
  5. Patel, J. P., et al. Prognostic relevance of integrated genetic profiling in acute myeloid leukemia. New England Journal of Medicine. 366, 1079-1089 (2012).
  6. Shendure, J., Ji, H. Next-generation DNA sequencing. Nature Biotechnology. 26 (10), 1135-1145 (2008).
  7. Kohlmann, A., et al. Monitoring of residual disease by next-generation deep-sequencing of RUNX1 mutations can identify acute myeloid leukemia patients with resistant disease. Leukemia. 28, 129-137 (2014).
  8. Luthra, R., et al. Next-generation sequencing-based multigene mutational screening for acute myeloid leukemia using MiSeq: applicability for diagnostics and disease monitoring. Haematologica. 99, 465-473 (2014).
  9. Kinde, I., Wu, J., Papadopoulos, N., Kinzler, K. W., Vogelstein, B. Detection and quantification of rare mutations with massively parallel sequencing. Proceedings of the National Academy of Sciences USA. 108 (23), 9530-9535 (2011).
  10. Schmitt, M., et al. Detection of ultra-rare mutations by next-generation sequencing. Proceedings of the National Academy of Sciences USA. 109 (36), 14508-14513 (2012).
  11. Vander Heiden, J. A., et al. pRESTO: a toolkit for processing high-throughput sequencing raw reads of lymphocyte receptor repertoires. Bioinformatics. 30 (13), 1930-1932 (2014).
  12. Newman, A. M., et al. Integrated digital error suppression for improved detection of circulating tumor DNA. NatureBiotechnology. 34, 547-555 (2016).
  13. Shugay, M., et al. MAGERI: Computational pipeline for molecular-barcoded targeted resequencing. PLOSComputationalBiology. 13 (5), e1005480(2017).
  14. Wong, T. N., et al. Role of TP53 mutations in the origin and evolution of therapy-related acute myeloid leukaemia. Nature. 518, 552-555 (2014).
  15. Krimmel, J. D., et al. Ultra-deep sequencing detects ovarian cancer cells in peritoneal fluid and reveals somatic TP53 mutations in noncancerous tissues. Proceedings of the National Academy of Sciences USA. 113 (21), 6005-6010 (2016).
  16. Phallen, J., et al. Direct detection of early-stage cancers using circulating tumor DNA. ScienceTranslationalMedicine. 9, eaan2415(2017).
  17. Egorov, E. S., et al. Quantitative profiling of immune repertoires for minor lymphocyte counts using unique molecular identifiers. The Journal of Immunology. 194 (12), 6155-6163 (2015).

重印与许可

标签

PCR Illumina panel