June 23rd, 2012
汇集DNA测序检测与大同伙的复杂表型相关的罕见的变异是一个快速和具有成本效益的战略。在这里,我们描述的汇集,32个癌症相关的基因,利用分裂软件包下一代测序的计算分析。这种方法可扩展性,适用于任何利益型。
该程序的总体目标是识别个体群体中表现出罕见功能变异优势的基因。这是通过首先汇集一组 DNA 样本来实现的。第二步是创建下一代测序文库并对其进行测序。
接下来是将读取与参考序列对齐并创建错误模型。最后一步是使用 splinter 算法进行计算分析。最终,混合下一代测序的碎片分析用于显示具有罕见功能变异优势的种群中的基因 演示该程序。
今天是 Francesco Vilania,他是我的导师和我们的合作者 Rob Mitra 实验室的研究生,我实验室的研究生 Enrique Ramos 将加入他的行列。与现有方法(如单个基因型)相比,该技术的主要优点是,它允许您非常精确地检测混合 DNA 分子群体中的稀有序列变异,而无需任何先验信息。这种方法可以帮助回答遗传学和基因组学领域的关键问题,例如如何在大型队列研究中确定导致罕见变异的新型疾病的频率。
每个碎片实验都需要存在阴性和阳性对照,以获得最佳准确性,使用 PFU 超高保真度制备 PCR 反应混合物。DNA 聚合酶。阴性对照是来自任何已知没有遗传变异的 DNA 序列的 PCR 产物,例如克隆的载体骨架。
这里使用来自 M 13 MP 18 载体的 1, 934 碱基对扩增子。阳性对照可以是整个群体中存在的一组先前验证的序列变异。如果无法获得这些数据,本实验室设计了一种人工阳性对照,该对照由每个 PCR 产物 331 个碱基组成,该化合物来自克隆到 PGMT easy 载体中的工程序列混合物,如下表所示。
这些序列被组合起来以模拟患者群体中真实变异的各种次要等位基因频率。按照本视频随附的书面方案对样品进行 PCR 扩增后,使用 kyogen kayak 快速柱纯化或带有真空歧管的 96 孔滤板清洁过量引物的每个 PCR 产物,以进行大规模纯化。纯化后,使用标准技术定量每个 PCR 产物。
准备将所有 PCR 产物和对照合并到按分子数标准化的池中。按浓度混合将导致小扩增子的比例过高,而不是大产品。相反,汇集每个扩增子的标准化分子数量。
选择足够大的任意数字,以便在移液过程中保持准确性。拉出 PCR 产物和对照。PCR 产物的连接是必要的,因为小 PCR 申请人的片段化可能会使表示偏向于其末端。
因此,我们在 PCR 产物片段化之前将其连接成 Large con。使用 T 4 连接酶、T 4 PNK 和 PEG 制备用于平末端连接的混合物,如方案中所列。在 22 摄氏度下孵育反应 17 小时。
然后在 65 摄氏度下孵育 20 分钟,然后在 4 摄氏度下保持。通过将 50 ng 样品上样到 arose 凝胶中来检查连接。成功连接将导致泳道中出现高分子量条带。
通过在 Qiagen PB 缓冲液中将样品稀释 10 比 1,以降低样品的粘度,通过随机超声处理策略制备 DNA 片段化。然后使用 24 个样品的对角节点生物破裂装置碎裂 PCR 产物的大圆锥,在 25 分钟内以高功率超声处理,每分钟开 40 秒,关 20 秒。检查 DNA 片段化的结果在农用凝胶上,并按照文中的描述进行 illuminous 测序。
要开始测序,请阅读 alignment。转换原始排序、将文件读取为 scarf 格式或压缩它们。压缩是可选的。
它为后续分析步骤节省了时间和空间,而不会丢失任何相关信息。使用随附的对齐工具,将原始读数与带注释的快速参考序列对齐。特异性目标区域包括 PCR 反应以及阳性和阴性对照。
输入格式必须为 scarf 格式或压缩格式。接下来,按照文本中的说明执行文件标记。每次运行都会生成一个独特的测序误差图谱,以便对每次运行进行准确的变体检出模型误差。
每个池样品库中都包含一个已知部署的序列变异的内部对照来自对齐的标记文件。使用包含的带有阴性对照参考序列的工具生成错误模型文件,可以使用所有阴性对照序列,或者当由其五个质数和三个质数端指定时,可以使用一个子集。应始终应用唯一读取和伪计数。
该工具将生成三个文件,命名为输出文件名参数,以 0、1 或 2 结尾。这些文件分别对应于使用 splinter 进行变体调用的零一阶和二阶错误模型。二阶误差模型应始终用于运行错误率曲线的可视化。
用于绘制误差模型图的 Pearl 脚本可用于在零阶误差模型文件上生成 PDF 误差图。该绘图文件将显示特定于运行的错误趋势,并可用于推断分析的最大读取碱基数。以下部分将演示如何使用错误模型在对齐的文件上运行 splinter 来检测罕见的序列变体。
分析的第一步是使用参考序列和误差模型在对齐的文件上运行 splinter。如果发现单个读长碱基有缺陷,则可以从分析中排除。P 值截止值决定了变体检出分析的严格程度。
负 1.301 的最小截止值是一个好的开始。pool size 选项通过消除较小等位基因频率小于实际池中单个等位基因频率的潜在方差来优化算法信噪比鉴别。pool size 选项应设置为最接近的值,该值大于实验中分析的实际等位基因数。
在较低频率下调用的方差将作为噪声忽略。输入所有参数和文件名后,运行 splinter。此文件返回样本中具有统计显著性的所有点击,并描述变体类型的位置。
每条 DNA 链的 P 值、变异的频率和每条 DNA 链的总覆盖率。splinter 使用列表样品瓶来标准化整个样品的覆盖率。第一个字段表示感兴趣的扩增子,而第二个字段表示突变存在的位置。
N 表示序列的其余部分不包含任何突变。归一化,阳性对照的分析是最大限度地提高特定运行的灵敏度和特异性的关键。这很重要,因为负 1.301 的初始截止值很可能不足以消除所有假阳性。
每个 splinter 分析都会显示每个被调用变体的实际 P 值,这无法预测优先级。但是,对于已知的真阳性碱基位置,可以使用初始输出上显示的最不严格的 P 值来重复整个分析。这将有助于保留所有真阳性,同时排除大多数(如果不是全部)假阳性,与真阳性相比,假阳性的 P 值通常要低得多。
要自动执行此过程,可以使用 cutoff tester 脚本。cutoff tester 脚本需要一个 splinter 输出文件和一个制表符分隔文件形式的阳性对照命中列表,作为用于归一化的文件。生成的输出将是一个逐渐达到最佳截止值的 Cutoff 列表。
最后一行表示运行的最佳截止值,因此可用于数据分析。最佳结果是达到 1 的灵敏度和特异性。但是,如果未达到,则可以通过更改合并的 read base 的数量来优化 splinter 分析。
可以使用截止剪切脚本将最终截止应用于数据,该脚本将从低于最佳截止的点击中筛选出 splinter 输出文件。此步骤将生成最终的 splinter 输出文件,该文件将包含样本中存在的 snips 和 indel。请注意,插入的输出与替换或删除的输出略有不同。
在这种类型的图中,作为混合样本中单个等位基因覆盖率的函数的准确性可视化。准确度估计为曲线下面积缩写为接收者作员曲线的 UC,范围从 0.5 的随机准确度到 1.0 的完美准确度。在此示例中,将 UC 绘制为每个等位基因覆盖率的函数,用于检测 200 501, 000 个等位基因池中的单个突变等位基因。
这里将 UC 绘制为插入、删除和替换总数的函数。该误差图显示了在给定位置掺入错误碱基的概率。错误曲线显示低错误率,并且向测序 read 的三个主要端增加。
值得注意的是,不同的参考核苷酸显示不同的错误概率。该图揭示了 splinter 在估计每个等位基因覆盖率大于 25 倍的位置的等位基因频率的准确性。通过分裂估计的合并 DNA 等位基因频率与通过全基因组关联研究或 GWAS 结果测量的等位基因计数之间的比较。
在非常高的相关性中,提取了 974 个个体的种群,并靶向超过 20 kb 进行测序。Splinter 用于检测稀有变异。按照标准方案,每个个体都进行了先前通过标记和新变体的基因分型之间的 gwas 一致性进行的基因分型。
在混合样本中调用的样本非常好。从测序结果来看,三个变体(其中两个在人群中很少见)称为 denovo,并通过单个焦磷酸测序、次要等位基因频率或焦磷酸测序和拉动测序之间的数学一致性进行了验证。在合并样本中完成查找稀有方差后,许多人想知道已识别的方差的功能后果是什么。
因此,对你的 variance 进行注释成为开发之后流程的下一步。这项技术为 DNA 测序领域的研究人员铺平了道路,以快速且经济高效的方式研究稀有变异,以表征大规模群体研究中的稀有变异。看完这个视频后,您应该对如何使用 splinter 检测池中的稀有序列变异有了很好的了解,DNA 样品。
DNA池合成测序是一种高效的方法,用于识别大型群体中与复杂性状相关的罕见遗传变异。本文详细介绍了使用SPLINTER软件包对来自32个癌症相关基因的池合成测序数据进行的计算分析。
Detecting rare genomic variants in large populations is critical for target validation in complex disease research, where common variants fail to explain phenotypic variability. The SPLINTER-enabled pooled sequencing approach provides a cost-effective, scalable method to interrogate therapeutic hypotheses by identifying low-frequency functional variants without prior variant knowledge. This supports early discovery de-risking by enabling allele frequency estimation and variant confirmation in disease-relevant cohorts, directly informing portfolio prioritization and mechanistic follow-up.
The method fits within the discovery continuum from hypothesis generation to lead identification, providing variant detection outputs that inform target selection and assay readiness.