混合DNA测序是一种快速且经济高效的策略,可用于在大样本队列中检测与复杂表型相关的罕见变异。本文介绍了利用SPLINTER软件包对32个癌症相关基因进行混合的下一代测序数据进行计算分析的方法。该方法具有可扩展性,适用于任何感兴趣的表型研究。
混合DNA测序是一种快速且经济高效的策略,可用于在大样本队列中检测与复杂表型相关的罕见变异。本文介绍了利用SPLINTER软件包对32个癌症相关基因进行混合的下一代测序数据进行计算分析的方法。该方法具有可扩展性,适用于任何感兴趣的表型研究。
近年来,随着DNA测序技术的显著进步2,人们越来越清楚地认识到,任意两个个体之间的遗传变异程度远超以往认知3。相比之下,基于芯片的基因分型技术未能发现常见序列变异对常见疾病表型变异具有显著贡献4,5。综合这些观察结果,推动了“常见疾病/罕见变异”假说的发展,该假说认为,常见且复杂表型中大部分“缺失的遗传力”实际上源于个体所特有的罕见或私有DNA变异谱6-8。然而,要阐明罕见变异如何影响复杂表型,就需要在大量基因组位点上分析大量患病个体,并最好与未患病队列中的类似调查进行比较。尽管当前测序平台提供了强大的测序能力,但对于许多研究者而言,开展基于人群的多个基因组位点的大规模调查及后续所需的计算分析仍然难以承受。
为满足这一需求,我们开发了一种混合测序方法1,9和一种新型软件包1,用于从测序数据中高精度地检测稀有变异。该方法可将大量患病个体的基因组混合后,在单个测序文库中对多个靶向区域的遗传变异程度进行检测,相比传统的单样本测序方法,显著节省了成本和时间。在每个等位基因平均测序深度为25倍的条件下,我们自主研发的SPLINTER算法采用内部变异检测对照策略,能够以高灵敏度和高特异性,从最多含1个突变等位基因/500个个体的混合样本中,检测出长度达4个碱基的插入、缺失和替换变异。本文详细描述了混合测序文库的制备方法,并逐步说明如何使用SPLINTER软件包进行混合测序数据分析(http://www.ibridgenetwork.org/wustl/splinter)。我们展示了对947名个体进行混合测序的结果,这些个体均同时接受了全基因组芯片分型,每人测序区域超过20 kb。在混合样本中检测到的已知标签变异和新发变异与芯片分型结果高度一致。该方法可轻松扩展至任意数量的基因组位点和任意数量的个体。通过在扩增子中加入模拟研究人群比例的内部阳性和阴性对照,可对算法进行校准以实现最佳性能。该策略还可进行调整,用于杂交捕获或个体特异性条形码实验,并适用于天然异质性样本(如肿瘤DNA)的测序分析。
该方法已用于Vallania FML 等在2010年发表于《基因组研究》的研究中。
1. 样本混合与靶向基因组位点的PCR捕获
2. 混合PCR文库制备与测序
3. 测序读段比对与分析
4. 使用 SPLINTER 进行罕见变异检测
5. 代表性结果
我们汇集了947名个体的群体,并针对超过20 kb的区域进行测序。我们按照标准操作流程应用SPLINTER方法检测稀有变异。此前,每个个体均已通过全基因组芯片进行过基因分型。汇集样本中检测到的已知标记变异和新发现变异的基因分型结果与先前数据高度一致(图6)。根据测序结果,共鉴定出3个新生变异(de novo),其中两个(rs3822343和rs3776110)在人群中属于稀有变异,并通过个体焦磷酸测序得到验证。该群体中各变异的次要等位基因频率(MAF)与dbSNP 129版本数据库中记录的MAF相近。焦磷酸测序与汇集测序所获得的MAF结果高度一致(表3)。

表 1. 阳性对照用DNA寡核苷酸序列。每条序列均包含一个与野生型参考序列相比存在两个替换,或一个插入和一个缺失的DNA片段。 点击此处查看大图。

表 2. SPLINTER 输出结果示例。前两行表示替换或缺失变异的标准 SPLINTER 输出结果(蓝色表头),最后一行表示插入变异的标准 SPLINTER 输出结果(紫色表头)。点击此处查看大图。

表 3. 从大规模人群中鉴定出五个已知变异和三个新变异,并通过个体基因分型验证。个体验证通过焦磷酸测序(第1-3行)、TaqMan检测(第4-6行)或Sanger测序(第7、8行)完成。在广泛的等位基因频率范围内,包括五个MAF <1% 的位点,混合测序等位基因频率估计值与个体基因分型结果之间具有高度一致性。标有星号(*)的位点数据引自先前报道的研究9。

图 1. 混合DNA测序与SPLINTER分析概述。将患者DNA在选定的基因座处进行混合并扩增。最终的PCR产物以等摩尔比例与阳性和阴性对照混合。混合后的样本随后进行测序,所得的测序读段被回贴至参考序列。利用比对到阴性对照的读段生成特定测序运行的错误模型。随后,SPLINTER可结合该错误模型和阳性对照的信息,用于检测稀有SNP和插入缺失突变。[改编自Vallania FLM et al, Genome Research 2010] 点击此处查看大图。

图 2. PCR扩增子混合连接与超声片段化。为展示文库构建流程中的连接和随机片段化步骤,将pUC19载体通过酶切处理生成如第2泳道所示的片段。这些片段按分子数均一化后,按照上述步骤1.7进行混合并随机连接。连接后形成的较大串联多联体如第3泳道所示。将连接产物均分为两份,并按照上述步骤1.8进行超声处理。每个技术重复产生的DNA片段弥散条带分别显示在第4和第5泳道。括号标示了用于胶回收及测序文库构建的片段大小范围。

图 3. 在混合样本中单个等位基因检测准确率随覆盖度的变化。准确率以受试者操作特征曲线(ROC)的曲线下面积(AUC)来估计,AUC 范围为 0.5(随机)至 1.0(完全准确)。AUC 作为每个等位基因覆盖度的函数,用于检测包含 200、500 和 1000 个等位基因的混合样本中的单个突变等位基因(A)。AUC 也作为总覆盖度的函数,用于检测替换、插入和缺失变异(B)。[改编自 Vallania FLM 等,Genome Research 2010]。
图 4. 错误率图显示了在特定位置掺入错误碱基的概率。错误谱显示错误率较低,且随着测序读长向3'端延伸呈逐渐上升趋势。值得注意的是,不同的参考核苷酸表现出不同的错误概率(例如,当参考碱基为G时掺入C的概率)。[改编自Vallania FLM 等,Genome Research 2010]。

图5. 在每个等位基因测序深度大于25倍的位点,SPLINTER估计等位基因频率的准确性。根据图3中A部分的结果,当测序深度≥25倍时,单个变异检测具有最佳灵敏度,使用SPLINTER对混合DNA样本估计的等位基因频率与通过GWAS实测的等位基因计数之间表现出极高的相关性(r = 0.999)。[改编自Vallania FLM et al, Genome Research 2010]。

图6. 通过GWAS检测的等位基因频率与基于974个个体混合测序获得的SPLINTER估计值之间的比较。用于比较的基因分型位点与测序区域之间共有19个常见位置。两者之间的相关性极高(r = 0.99538)。 点击此处查看高清大图。
越来越多的证据表明,肥胖8、高胆固醇血症4、高血压7等常见复杂表型和疾病的发病率及治疗反应可能受到个体罕见变异谱的影响。确定这些变异在患病人群中富集的基因和通路,将对诊断和治疗产生深远影响;但对患病个体逐一进行分析可能耗时且成本高昂。基于人群的分析为在多个基因位点上调查遗传变异提供了一种更高效的手段。
我们提出了一种新型的混合DNA测序方案,并结合SPLINTER软件包,旨在在群体中识别此类遗传变异。我们验证了该方法在包含947个个体的大规模混合群体中识别和定量稀有等位基因的准确性,其中包括通过混合测序从头(de novo)检测出的罕见变异,并经个体焦磷酸测序验证。我们的策略与其他方案的主要区别在于,每次实验均包含阳性对照和阴性对照,从而使SPLINTER相比其他方法具有更高的准确性和检测效能1。每等位基因25倍的最优测序深度与混合样本的规模无关,该要求仅随样本池大小线性增长,因此使得大规模样本池的分析成为可能。我们的方法具有高度灵活性,不仅适用于任何感兴趣的表型,还可应用于天然异质性的样本,例如混合细胞群体和肿瘤活检组织。鉴于目前对来自外显子组或全基因组等大目标区域的混合测序兴趣日益增加,我们的文库构建及SPLINTER分析方法兼容定制捕获和全外显子组测序;但SPLINTER软件包中的比对工具未针对大参考序列设计。因此,我们已成功采用动态规划比对工具Novoalign进行全基因组范围的序列比对,随后从混合样本中进行变异检测(Ramos et al.,已投稿)。因此,我们的混合测序策略可随着目标序列长度的增加,成功扩展至更大规模的样本池。
未声明任何利益冲突。
本工作得到了儿童发现研究所资助项目 MC-II-2006-1(RDM 和 TED)、NIH 表观遗传学路线图资助项目 [1R01DA025744-01 和 3R01DA025744-02S1](RDM 和 FLMV)、U01AG023746(SC)、Saigh 基金会(FLMV 和 TED)以及 1K08CA140720-01A1 和 Alex's Lemonade Stand “A” 奖项资助(TED)的支持。我们感谢华盛顿大学医学院遗传学系基因组技术应用中心在基因组分析方面提供的帮助。该中心的部分支持来自国家癌症研究所癌症中心支持资助项目 #P30 CA91842(Siteman 癌症中心)以及美国国立卫生研究院(NIH)下属国立研究资源中心(NCRR)的 ICTS/CTSA 资助项目 #UL1RR024992,以及 NIH 医学研究路线图计划。本出版物的内容 solely 由作者负责,不一定代表 NCRR 或 NIH 的官方观点。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| PfuUltra 高保真 DNA 聚合酶 | Agilent | 600384 | 1.4 |
| 甜菜碱 | SIGMA | B2629 | 1.4 |
| M13mp18 单链 DNA 载体 | NEB | N4040S | 1.5 |
| pGEM-T Easy 载体 | Promega | A1360 | 1.5 |
| T4 多核苷酸激酶 | NEB | M0201S | 2.2 |
| T4 DNA 连接酶 | NEB | M0202S | 2.2 |
| 聚乙二醇 8000 分子量 | SIGMA | P5413 | 2.2 |
| Bioruptor 超声破碎仪 | Diagenode | UCD-200-TS | 2.3 |