2012年6月23日
混合DNA测序是一种快速且经济高效的策略,可用于在大样本队列中检测与复杂表型相关的罕见变异。本文介绍了利用SPLINTER软件包对32个癌症相关基因进行混合的下一代测序数据进行计算分析的方法。该方法具有可扩展性,适用于任何感兴趣的表型研究。
本实验的总体目标是鉴定在表现出大量罕见功能变异的个体群体中存在的基因。该目标首先通过汇集一组DNA样本实现,第二步是构建并测序新一代测序文库。
随后将测序读段比对至参考序列,并建立误差模型。最后一步是使用 splinter 算法进行计算分析。最终,通过对合并的下一代测序数据进行 splinter 分析,揭示在群体中携带大量罕见功能性变异的基因,从而演示该实验流程。
今天将由 Francesco Vilania 演示,他是我的导师兼合作者 Rob Mitra 实验室的一名研究生,他将与我实验室的研究生 Enrique Ramos 共同完成实验。该技术相较于现有的单一个体基因型分析方法,其主要优势在于无需任何先验信息,即可在混合的 DNA 分子群体中非常精确地检测出稀有序列变异。该方法有助于回答遗传学与基因组学领域中的关键问题,例如如何在大规模队列研究中确定新型致病性稀有变异的频率。
每次裂解实验都需要设置阴性对照和阳性对照,以获得最佳的准确性。使用PFU超保真DNA聚合酶制备PCR反应混合液。阴性对照采用任何已知无遗传变异的DNA序列的PCR产物,例如克隆载体骨架。
此处使用来自 M13 MP18 载体的 1,934 个碱基对的扩增子。阳性对照可以是整个群体中已知存在的任何一组先前已验证的序列变异。如果此类数据不可用,本实验室设计了一种人工阳性对照,其包含来自 PGMT easy 载体中克隆的工程化序列混合物的 331 个碱基对的 PCR 产物,如本表所列。
这些序列经过组合,以模拟患者群体中真实变异位点的不同次要等位基因频率。按照本视频配套书面方案所述,对样本进行PCR扩增后,使用Kyogen Kayak快速柱纯化试剂盒或配备真空 manifold 的96孔滤板去除多余的引物,后者适用于大规模纯化。纯化完成后,采用标准方法对每份PCR产物进行定量。
准备将所有PCR产物及对照按分子数归一化后合并成一个文库。若按浓度进行文库合并,会导致较小的扩增片段在文库中比例过高。相反,应按每个扩增片段的归一化分子数进行合并。
选择足够大的任意数值,以确保移液过程中的准确性。取出PCR产物和对照品。必须对PCR产物进行连接,因为小片段PCR产物的断裂可能会导致其末端区域的代表性偏倚。
由于这一原因,我们在对扩增产物进行片段化之前,先将其连接至大载体中。根据方案中所列,使用T4连接酶、T4多核苷酸激酶(PNK)和PEG配制平末端连接反应体系。在22摄氏度下孵育反应17小时。
随后在65摄氏度孵育20分钟,并在4摄氏度下保存。之后,取50纳克样品上样至琼脂糖凝胶,检测连接效果。成功连接将在泳道中出现高分子量条带。
通过将样品用Qiagen PB缓冲液按10:1稀释,降低其黏稠度,为采用随机超声处理策略进行DNA片段化做好准备。随后使用24孔对角线探头生物破碎仪对大量PCR产物进行片段化处理,在25分钟内以高功率超声处理,每分钟循环40秒开启、20秒关闭。在琼脂糖凝胶上检测DNA片段化结果,并按照文中所述进行高通量测序。
开始测序时,需进行读段比对。可将原始测序读段文件转换为scarf格式,或对其进行压缩。压缩为可选步骤。
在不丢失任何相关信息的情况下,为后续分析步骤节省了时间和空间。使用附带的比对工具,将原始读段比对至已注释的快速参考序列。针对特定区域,包括PCR反应以及阳性和阴性对照。
输入格式必须为 scarf 格式或压缩格式。接下来,按照文中所述进行文件标记。每次运行都会生成独特的测序错误谱型,需对其进行表征,以准确建模每次运行的错误,从而实现精确的变异检测。
每个池样本文库中均包含一个已知存在序列变异的内参。从比对后的带标签文件中,使用所包含的工具,以阴性对照参考序列为基准生成错误模型文件,可使用全部阴性对照序列,或根据其5'端和3'端指定的区域仅使用其中一部分。应始终应用唯一读段(unique reads)和伪计数(pseudo counts)。
该工具将生成三个文件,文件名以输出文件名参数命名,结尾分别为零、一或二。这些文件分别对应使用 splinter 进行变异检测时的零阶、一阶和二阶误差模型。在可视化运行误差率曲线时,应始终使用二阶误差模型。
可用于绘制误差模型图的 Pearl 脚本,也可用于在零级误差模型文件上生成 PDF 误差图。该图文件将揭示特定运行的误差趋势,并可用于推断分析中读段的最大碱基数。以下部分将演示如何在比对后的文件上运行 splinter,利用误差模型检测稀有序列变异。
分析的第一步是使用参考序列和错误模型在比对好的文件上运行 splinter。如果发现单个读段的碱基存在缺陷,可将其从分析中排除。P 值截断值决定了变异检测分析的严格程度。
最低截断值设为 -1.301 是一个良好的起点。池大小选项通过排除实际样本池中等位基因频率低于单个等位基因频率的潜在变异,从而优化算法的信号与噪声区分能力。池大小选项应设置为大于实验中分析的等位基因实际数量的最接近数值。
在较低频率下检测到的变异将被视为噪声而忽略。输入所有参数和文件名后,运行 splinter。该文件将返回在样本中具有统计学显著性的所有变异位点,并包含变异位置和变异类型的描述。
该变异位点在每条DNA链中的频率对应的P值,以及每条DNA链的总覆盖深度。该列表小瓶由splinter用于对样本间的覆盖深度进行标准化。第一个字段表示感兴趣的扩增子,第二个字段表示突变所在的位置。
N 表示该序列的其余部分不包含任何突变。标准化过程中,阳性对照的分析对于提高特定实验的灵敏度和特异性至关重要。这一点非常重要,因为最初的 -1.301 截断值很可能不足以完全消除所有假阳性结果。
每次裂解分析都会显示每个已识别变异的实际 P 值,而该值无法在事先预测。然而,可以通过使用初始输出中已知真实阳性碱基位置所显示的最宽松 P 值来重复整个分析。这样做可以在保留所有真实阳性结果的同时,排除大部分(即使不是全部)假阳性结果,因为假阳性结果的 P 值通常远不如真实阳性结果显著。
为了自动化此过程,可以使用截断值测试脚本。该脚本需要一个裂解物输出文件,以及一个以制表符分隔的阳性对照命中结果列表文件(格式与归一化所用文件相同)。输出结果将是一个逐步接近最优值的截断值列表。
最后一行代表该次运行的最优截断值,因此可用于数据分析。理想的结果是达到1的敏感性和特异性。然而,如果未达到理想结果,可通过改变整合的读取碱基数量来优化碎片分析。
可以使用 cutoff cut 脚本对数据应用最终的截断值,该脚本将过滤掉低于最优截断值的 splinter 输出文件中的命中结果。此步骤将生成最终的 splinter 输出文件,其中包含样本中存在的 snips 和 indels。请注意,插入片段的输出结果与替换或缺失片段的输出结果略有不同。
此类图表展示了在混合样本中单个等位基因的检测准确率随测序深度的变化情况。准确率通过受试者工作特征曲线下面积(简称AUC)进行估计,其取值范围从随机水平的0.5到完全准确的1.0。本示例中,AUC被绘制成在包含200、501和1000个等位基因的混合样本中检测单个突变等位基因时,各等位基因测序深度的函数。
此处将插入、缺失和替换的总错误数(UC)绘制成函数图像。该错误图显示了在特定位置掺入错误碱基的概率。错误谱显示错误率较低,且随着测序读段向3'端延伸,错误率呈逐渐上升趋势。
值得注意的是,不同的参考核苷酸表现出不同的错误概率。该图展示了在每个等位基因测序深度超过25倍时,Splinter在估计等位基因频率方面的准确性。图中比较了Splinter估算的混合DNA等位基因频率与全基因组关联研究(GWAS)实测的等位基因计数结果。
在高度相关的样本中,针对超过20千碱基的区域,选取了974名个体进行测序。使用Splinter工具检测稀有变异。根据标准流程,每个个体此前均已通过全基因组关联研究(GWAS)完成基因分型,并对已标记变异与新发现变异的基因分型结果进行了一致性验证。
在混合样本中检测到的结果非常理想。通过测序结果鉴定出三个变异位点,其中两个在人群中较为罕见,并被判定为新生突变(denovo),随后通过个体焦磷酸测序、次要等位基因频率分析或焦磷酸测序与混合测序之间的数学一致性验证了这些结果,各项数据的一致性表现优异。在完成混合样本中稀有变异的鉴定后,许多研究者希望进一步了解所发现变异的功能性影响。
因此,在发育研究之后,对变异进行注释便成为接下来的关键步骤。该技术为DNA测序领域的研究人员提供了研究稀有变异的新途径,使其能够以快速且经济高效的方式在大规模人群研究中对稀有变异进行表征。观看本视频后,您应能够充分掌握如何利用SplintR技术在DNA样本池中检测稀有序列变异。
混合DNA测序是在大群体中鉴定与复杂性状相关的罕见遗传变异的有效方法。本文详细介绍了利用SPLINTER软件包对32个癌症相关基因的混合测序数据进行的计算分析。
在复杂疾病研究中,常见变异无法解释表型变异,因此在大群体中检测稀有基因组变异对于靶点验证至关重要。基于SPLINTER技术的混合测序方法提供了一种经济高效、可扩展的策略,能够在无需预先了解变异信息的情况下识别低频功能变异,从而验证治疗假设。该方法通过在与疾病相关的队列中进行等位基因频率估计和变异确认,支持早期发现阶段的风险降低,直接为项目组合优先级排序和后续机制研究提供依据。
该方法适用于从假设生成到先导物鉴定的整个发现流程,所提供的变异检测结果可用于指导靶点选择和检测方法的建立。