下一代测序(NGS)是一种强大的基因组表征工具,但其应用受到该平台较高错误率(约0.5–2.0%)的限制。我们介绍了错误校正测序的方法,可消除NGS的错误率影响,检测到低至0.0001变异等位基因分数的突变。
下一代测序(NGS)是一种强大的基因组表征工具,但其应用受到该平台较高错误率(约0.5–2.0%)的限制。我们介绍了错误校正测序的方法,可消除NGS的错误率影响,检测到低至0.0001变异等位基因分数的突变。
传统的下一代测序技术(NGS)在过去十多年中实现了大规模的基因组特征分析。特别是,NGS已被用于分析恶性肿瘤中克隆性突变的谱系。尽管NGS比传统的Sanger测序方法高效得多,但由于其较高的错误率(约0.5–2.0%),在识别罕见的克隆和亚克隆突变方面仍存在困难。因此,标准NGS对突变的检测下限为>0.02变异等位基因频率(VAF)。尽管在无已知疾病的患者中,如此罕见突变的临床意义尚不明确,但在白血病患者中,当通过流式细胞术检测到的残留病灶水平低于<0.0001时,其治疗预后显著改善。为了降低NGS产生的这类人为背景噪音,已开发出多种方法。本文介绍一种错误校正的DNA和RNA测序(ECS)方法,该方法通过对单个分子标记一个16 bp的随机索引用于错误校正,同时标记一个8 bp的患者特异性索引以实现多重检测。我们的方法能够检测并追踪变异等位基因频率(VAF)比NGS检测限低两个数量级的克隆突变,最低可至0.0001 VAF。
随着年龄增长,暴露于诱变剂以及细胞分裂过程中的随机错误会导致基因组中体细胞异常的累积,这是恶性转化、神经发育性疾病、儿科疾病以及正常衰老基本发病机制的基础1,2。具有致病潜力的体细胞突变是早期检测和风险评估中重要的诊断与预后生物标志物3,4,5。为了更好地理解生理性的克隆形成过程,从而为临床和科研决策提供依据,准确量化和表征这些突变至关重要。目前,下一代测序技术(NGS)被用于研究异质性DNA样本中的克隆突变;然而,由于测序平台本身存在0.5–2.0%的固有错误率,NGS仅能检测变异等位基因频率(VAF)高于>0.02的突变6,7,8。因此,使用标准NGS方法无法追踪VAF较低但具有诊断和预后意义的体细胞变异。
近年来,为了克服高通量测序(NGS)的错误率,已开发出多种方法8,9,10,11。这些方法利用分子标记技术,可在测序后进行错误校正。在测序文库中,每条分子或基因组片段都被标记上一个随机的、专属于该分子的唯一分子标识符(Unique Molecular Identifier, UMI)。UMI由一段随机核苷酸序列(8–16 N)的不同排列组合构成。此外,流程中还整合了第二个样本特异性条形码,使得多个样本可在同一次NGS测序运行中实现多重检测。对分子标记后的文库进行PCR扩增,随后送入测序环节。在文库构建过程中,PCR扩增和测序阶段预期会随机引入基因组片段的错误8。为了去除随机测序错误,原始测序读段将根据其UMI进行分组。由于错误的引入具有随机性,测序产生的假象(artifacts)不太可能在同一基因组位置、具有相同UMI的所有读段中同时出现;而真实的变异则会在所有共享相同UMI的读段中被一致地扩增和测序。这些假象可通过生物信息学方法予以剔除。本文中,我们描述了三种在实验室中优化的错误校正测序(Error-corrected Sequencing, ECS)方法,分别用于DNA样本中单核苷酸变异(SNVs)和小片段插入缺失(Indels)的检测,以及RNA样本中低于NGS测序错误阈值水平的基因表达定量分析。
第一种方法描述了如何使用研究人员设计的基因特异性引物来检测罕见的体细胞事件。在文库构建之前,研究人员应设计引物以靶向感兴趣的片段。我们使用了网络应用程序 Primer3(http://bioinfo.ut.ee/primer3-0.4.0/)。对于聚合酶链式反应(PCR)而言,200–250 bp 的扩增子是理想的,因为这些扩增子在引入分子标签(UMI)后,使用 150 bp 的双端测序即可产生重叠的成对末端读段。引物设计的最佳条件如下:引物最小长度 = 19;引物最佳长度 = 25;引物最大长度 = 30;最小退火温度(Tm)= 64 °C;最佳退火温度(Tm)= 70 °C;最大退火温度(Tm)= 74 °C;引物对间最大 Tm 差异 = 5 °C;最小 GC 含量 = 45;最大 GC 含量 = 80;返回引物数量 = 20;3' 端最大稳定性 = 100。
在方法2中,我们描述了一种将ECS-DNA方案与Illumina测序化学技术相结合的方法,利用市售的包含数百个扩增子的基因检测面板,检测频率低至0.0001 VAF的克隆性单核苷酸变异(SNVs)和小片段插入缺失(Indels)。在实验中,我们采用了Illumina公司的TruSight Myeloid测序面板,并设计了一个扩展面板,以纳入更多与儿童髓系疾病相关的感兴趣基因。这些面板未提供可用于辅助错误校正的独特分子标识符(UMIs),因此我们为这些面板添加了自主设计的接头策略。ECS方法同样适用于其他旨在富集与不同疾病相关基因的检测面板。在从目标组织或样本中完成DNA提取及定量后,建议每个样本至少准备500 ng的储备DNA。我们常规使用250 ng DNA构建单个测序文库,以尽可能捕获更多的独特基因组片段,用于后续的读段去重和VAF计算。剩余的250 ng DNA可选用于构建重复测序文库。我们始终为每个样本构建两个重复文库,并仅将两个重复中均独立检测到的变异视为真实阳性事件。此外,我们还采用了一种基因组位置特异性的二项式错误模型,以提高变异检测的准确性4,13。
最后,我们介绍一种将ECS与RNA测序相结合的方法,用于转录本定量分析,该方法使用现成的QIAseq靶向RNA试剂盒(Qiagen)。用于去重和错误校正的分子标签(UMI)已整合在试剂盒中,研究人员可按照制造商的建议构建文库。在生物信息学分析方面,研究人员可遵循ECS-DNA部分所述的分析流程,该流程将在“实验方案”部分详细说明。
1. DNA 靶向纠错测序
2. 基于DNA错误校正测序的基因 panel

表 1:构建位点特异性二项误差模型方法的示例。
3. RNA 的纠错测序
在DNA靶向错误校正测序中,我们通过将突变患者DNA稀释于商业基因组DNA中进行了原理验证实验。该患者在GATA1基因(chrX:48650264,C>G)存在突变,原始等位基因突变频率(VAF)为0.19。如图1所示,ECS对单核苷酸变异的定量能力可达1:10,000水平。

图1:GATA1 SNV 的稀释系列,证明 ECS 的定量水平可达 1:10,000。 请点击此处查看此图的放大版本。
我们还证明,ECS-DNA 能够可靠地检测健康老年人群中反复发生于成人急性髓系白血病(AML)相关基因的罕见克隆突变4。我们从护士健康研究(Nurse's Health Study)的样本库中获取了20名健康个体的血沉棕黄层样本,这些样本采集时间相隔约10年。我们对这些样本应用了ECS-DNA panel检测方案。在本实验中,我们采用了Illumina TruSight Myeloid测序Panel,该Panel包含568个扩增子(基因列表的更多信息见 https://www.illumina.com/products/by-type/clinical-research-products/trusight-myeloid.html),并使用Illumina NextSeq平台对来自20名个体的80个文库进行测序(每名个体在两个不同时间点各采集一次样本,每个时间点设两个重复),共获得平均4770万条成对末端测序读长,每个文库平均生成340万条纠错后的共识序列4。每个文库的平均核苷酸覆盖深度约为6,000x(340万除以568)。对于每个样本,我们利用非同一样本的测序文库构建了位点特异性的错误谱。我们共发现109个克隆性体细胞突变,这些突变在至少一个时间点的两个重复样本中均被检出,其变异等位基因频率(VAF)范围为0.0003–0.1451。我们从中筛选出21个在COSMIC数据库中有已知记录的突变,并使用数字微滴PCR(ddPCR)对这21个突变在一次或两次采集时间点中进行了验证(n = 34,图2,改编自Young et al. 20164)。

图2:通过ddPCR验证ECS检测到的突变,VAF高度一致。 (n=34,修改自Young et al. 20164)。 请点击此处查看该图的放大版本。
关于采用ECS-RNA方案进行误差校正后的表达水平检测,我们基于QIAseq化学方法定制了一个包含416个已知与多种癌症相关基因的基因 panel(改编自QIAseq人癌症转录组 panel),并对每个基因中最常表达的外显子进行了扩增(基因列表见补充材料1)。我们使用Illumina MiSeq平台对文库进行双端测序,每个文库平均获得830万条读长,成功捕获平均约41.7万条误差校正后的共识序列。结果显示,低丰度转录本(在50 ng总RNA中转录本数量<1,000)的表达水平在重复样本间具有高度可重复性(数据点n = 300,图3)。通过数字滴定PCR(ddPCR)对六个不同表达水平的基因进行验证表明,ECS方案能够准确捕获基因的表达水平,且无需进行标准化处理。

图3:上图,同一样本重复实验中ECS-RNA检测的转录本计数之间的相关性(n = 300)。下图,通过ddPCR验证ECS鉴定出的转录本计数(n = 6)。请点击此处查看该图的放大版本。
本文展示了一系列可轻松实施的纠错测序方案,可用于研究不同疾病中变异等位基因频率(VAF)较低的突变。其中最重要的因素是在测序前为每个分子引入唯一分子标识符(UMI),因为UMI能够对原始测序读长进行纠错。本文所述方法使研究人员能够将定制的UMI整合到 commercially available基因检测面板或自行设计的基因特异性寡核苷酸中。
标准的高通量测序(NGS)方案由于测序错误率的存在,难以检测变异等位基因频率(VAF)低于2%的突变,这限制了NGS在需要检测稀有变异的研究中的应用。通过克服标准NGS的测序错误率,ECS能够灵敏地检测这些低频原始变异。例如,在致病性突变最初出现时(因此VAF较低)即进行检测,对于指导疾病的早期干预至关重要14,15。在白血病研究中,检测微小残留病灶(治疗后残留的白血病细胞)有助于风险分层,并可为治疗方案的选择提供依据,这是传统的二元流式细胞术评估无法实现的。此外,ECS还可用于检测循环肿瘤核酸,并通过检测某些具有原发肿瘤特征的突变的存在与否及其变异负荷,评估实体瘤患者的转移潜能16。
如表1所示,基于二项分布的位点特异性错误模型在变异检测中的效能,在很大程度上取决于用于构建错误模型的文库数量以及测序深度。错误模型的稳健性随着样本数量的增加和测序深度的提高而增强。建议至少使用10个已测序的样本,每个样本平均错误校正后读长覆盖深度达到3000x,以构建每个样本的错误谱型。该位点特异性方法与MAGERI类似,但不同于将六种不同的碱基替换类型(A>C/T>G、A>G/T>C、A>T/T>A、C>A/G>T、C>G/G>C、C>T/G>A)的错误率进行合并计算的方法13,我们对每个位点上的每种替换类型独立建模。例如,某一基因组位点的C>T错误率可能与其他位点不同。我们的方法还考虑了测序批次效应,因为在一次测序运行中观察到的碱基替换率可能与另一次运行不同。因此,当合并来自不同测序批次的样本以构建模型时,尤其需要对所有替换类型在每个位点分别建模。
设计ECS实验时,一个重要的考虑因素是所需的检测阈值。NGS研究的优势在于,其在目标基因/靶点数量、检测阈值(由测序深度决定)以及检测个体数量方面均可灵活扩展。例如,若研究人员希望以0.0001的检测阈值检测两个扩增子中的稀有突变,则可使用MiSeq V2化学试剂,在单次测序运行中最多混合75个样本,该试剂最多可产生1500万条读长(2个扩增子 × 10,000个分子 × 用于纠错的10次读取 × 75个样本 = 1500万条测序读长)。研究人员可通过调整进入测序的分子数量或单次测序运行中混合的样本数量,来调节检测阈值。在我们的研究中,目标是使用Illumina基因 panel 以0.0001 VAF(1:10,000)的检测阈值检测突变。我们通常使用250 ng起始DNA,以确保捕获足够数量的分子,从而达到上述检测阈值。如果研究人员期望的检测限高于>0.001 VAF,可选择起始使用较少的DNA量(建议为50 ng)。
由于UMI被添加到i5索引上,测序设置需相应调整。例如,我们使用了16个N的UMI,测序设置为2×144的双端读长,Index 1为8个循环,Index 2为16个循环,而不是通常的Index 2 8个循环。Index 2循环数的增加通过减少分配给读长的总循环数来补偿。如果研究人员选择使用12N的UMI10,17,则应将设置更改为Index 2 12个循环。
这种基于UMI的测序方法经过优化,可校正测序错误。但在应对PCR扩增偏差(jackpotting)方面仍不够理想,这是所有基于扩增的方法共有的问题。我们通过数字滴定PCR(ddPCR)进行了多轮测序后及生物信息学分析后的验证,几乎未检测到由PCR扩增偏差导致的假阳性结果。尽管如此,仍建议研究人员使用高保真聚合酶进行实验,以确保扩增错误率较低。
作者无任何利益冲突需要披露。
感谢儿童肿瘤学组 AAML1531 研究和护士健康研究的参与者提供患者样本。本研究由美国国立卫生研究院(UM1 CA186107、RO1 CA49449 和 RO1 CA149445)、华盛顿大学与圣路易斯儿童医院儿童发现研究所(MC-II-2015-461)以及 Eli Seth Matthews 白血病基金会资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Q5 高保真热启动预混液 | New England BioLabs | M0492S | |
| Agencourt AMPure XP | Beckman Coulter | A63880 | |
| Qubit dsDNA HS 检测试剂盒 | Thermo Fisher Scientific | Q32854 | |
| SYBR Safe DNA 凝胶染料 | Thermo Fisher Scientific | S33102 | |
| Truseq 定制扩增子索引试剂盒 | Illumina | FC-130-1003 | |
| UMI i5 接头序列 | Integrated DNA Technologies | - | |
| NEBNext Ultra 末端修复/dA加尾模块 | New England BioLabs | E7442S | |
| NEBNext Ultra II 连接模块 | New England BioLabs | E7595S | |
| QX200 ddPCR EvaGreen 超混液 | Bio-Rad | 1864034 | |
| QX200 微滴生成油(用于 EvaGreen) | Bio-Rad | 1864005 | |
| QX200 微滴数字 PCR 系统 | Bio-Rad | 1864001 | |
| ddPCR 96 孔板 | Bio-Rad | 12001925 | |
| QX200/QX100 微滴生成仪用 DG8 羧夹 | Bio-Rad | 1864008 | |
| QX200/QX100 微滴生成仪用 DG8 垫圈 | Bio-Rad | 1863009 | |
| 生物分析仪 | Agilent Genomics | G2939BA | |
| TapeStation | Agilent Genomics | G2991AA | |
| TruSight 髓系测序面板 | Illumina | FC-130-1010 | |
| Bowtie 2 | Johns Hopkins University | - | |
| 定制 QIAseq 靶向 RNA 面板 | Qiagen | - | |
| RNeasy Plus Mini Kit (50) | Qiagen | 74134 |