方法文章

使用 SPLINTER 检测池化测序中的稀有基因组变异

16.7K 次观看

DOI:

10.3791/3943

2012年6月23日

本文内容

摘要

混合DNA测序是一种快速且经济高效的策略,可用于在大样本队列中检测与复杂表型相关的罕见变异。本文介绍了利用SPLINTER软件包对32个癌症相关基因进行混合的下一代测序数据进行计算分析的方法。该方法具有可扩展性,适用于任何感兴趣的表型研究。

摘要

近年来,随着DNA测序技术的显著进步2,人们越来越清楚地认识到,任意两个个体之间的遗传变异程度远超以往认知3。相比之下,基于芯片的基因分型技术未能发现常见序列变异对常见疾病表型变异具有显著贡献4,5。综合这些观察结果,推动了“常见疾病/罕见变异”假说的发展,该假说认为,常见且复杂表型中大部分“缺失的遗传力”实际上源于个体所特有的罕见或私有DNA变异谱6-8。然而,要阐明罕见变异如何影响复杂表型,就需要在大量基因组位点上分析大量患病个体,并最好与未患病队列中的类似调查进行比较。尽管当前测序平台提供了强大的测序能力,但对于许多研究者而言,开展基于人群的多个基因组位点的大规模调查及后续所需的计算分析仍然难以承受。

为满足这一需求,我们开发了一种混合测序方法1,9和一种新型软件包1,用于从测序数据中高精度地检测稀有变异。该方法可将大量患病个体的基因组混合后,在单个测序文库中对多个靶向区域的遗传变异程度进行检测,相比传统的单样本测序方法,显著节省了成本和时间。在每个等位基因平均测序深度为25倍的条件下,我们自主研发的SPLINTER算法采用内部变异检测对照策略,能够以高灵敏度和高特异性,从最多含1个突变等位基因/500个个体的混合样本中,检测出长度达4个碱基的插入、缺失和替换变异。本文详细描述了混合测序文库的制备方法,并逐步说明如何使用SPLINTER软件包进行混合测序数据分析(http://www.ibridgenetwork.org/wustl/splinter)。我们展示了对947名个体进行混合测序的结果,这些个体均同时接受了全基因组芯片分型,每人测序区域超过20 kb。在混合样本中检测到的已知标签变异和新发变异与芯片分型结果高度一致。该方法可轻松扩展至任意数量的基因组位点和任意数量的个体。通过在扩增子中加入模拟研究人群比例的内部阳性和阴性对照,可对算法进行校准以实现最佳性能。该策略还可进行调整,用于杂交捕获或个体特异性条形码实验,并适用于天然异质性样本(如肿瘤DNA)的测序分析。

方案

该方法已用于Vallania FML 在2010年发表于《基因组研究》的研究中。

1. 样本混合与靶向基因组位点的PCR捕获

  1. 将每个池中各个个体的标准化量基因组DNA混合。每个PCR反应中每人的DNA用量为0.3 ng,可使每个PCR反应中包含约50个二倍体基因组,从而提高池中每个等位基因扩增的均一性。
  2. 基因组序列可从NCBI(http://www.ncbi.nlm.nih.gov/)或UCSC基因组浏览器(http://genome.ucsc.edu/index.html)获取。获取序列时务必使用“RepeatMasker”(标记为“N”),以避免在重复区域设计引物
  3. 使用基于网页的Primer3工具(http://frodo.wi.mit.edu/primer3/input.htm)设计引物,将感兴趣的基因组区域及其侧翼序列剪切粘贴至输入框(通常600–2000 bp的扩增子最为理想)。Primer3推荐的最佳引物设计参数10如下:引物最小长度 = 19;最佳长度 = 25;最大长度 = 30;最小Tm值 = 64 °C;最佳Tm值 = 70 °C;最大Tm值 = 74 °C;引物间最大Tm差值 = 5 °C;最小GC含量 = 45%;最大GC含量 = 80%;返回引物数量 = 20(此值可任意设定);3'端最大稳定性 = 100。设计引物以扩增所有感兴趣的基因组位点。收到引物后,将冻干的引物原液用含10 mM Tris(pH 7.5)和0.1 mM EDTA的溶液稀释至终浓度100 μM,再用ddH2O进一步稀释10倍至10 μM。
  4. PCR扩增:由于高保真DNA聚合酶具有较低的错误率(10-7)并可产生平末端产物(这对后续连接步骤至关重要),我们推荐使用此类酶扩增较大的基因组扩增子。我们曾使用PfuUltra High-Fidelity酶,但具有类似特性的其他酶(如Phusion)也应能获得可比结果。每个PCR反应体系终体积为50 μL,包含终浓度为2.5 U的PfuUltra High-Fidelity聚合酶、1 M Betaine、每种引物400 nM、dNTPs 200 μM、1× PfuUltra缓冲液(或含≥ 2 mM Mg2+的缓冲液以维持酶的保真性)以及5–50 ng的混合DNA。PCR反应条件如下:1. 93–95 °C 预变性2分钟;2. 93–95 °C 变性30秒;3. 58–60 °C 退火30秒;4. 65–70 °C 延伸60–90秒(适用于250–500 bp扩增子)/ 1.5–3分钟(适用于500–1000 bp扩增子)/ 3–5分钟(适用于>1 kb扩增子);5. 重复步骤2–4共25–40个循环;6. 65 °C 延伸10分钟;7. 4 °C 保存。如有需要,可通过以下方式优化PCR结果:1)降低小扩增子的退火温度;2)提高大扩增子的退火温度;3)延长任意扩增子的延伸时间。
  5. SPLINTER对照的制备:每次SPLINTER实验均需设置阴性对照和阳性对照,以获得最佳准确性。阴性对照可选用先前已测序的任意个体(如HapMap样本)条形码标记样本中所有纯合碱基位点。阳性对照则由两个或多个此类样本混合而成。本报告中,阴性对照为M13mp18单链DNA载体骨架上一段1,934 bp的扩增区域。该PCR产物在使用前已通过Sanger测序验证,确认其序列与原始材料或PCR扩增过程无任何变异。阳性对照由一组pGEM-T Easy载体构成,其中克隆了含特定插入、缺失和替换的72 bp插入片段(表1)。我们将这些载体以野生型背景按一定摩尔比例混合,使各突变在混合物中的频率相当于池中单个等位基因的频率(例如,在100等位基因的池中,单个等位基因频率为1%)。随后使用pGEM-T Easy载体上的M13 PUC引物位点对混合对照模板进行PCR扩增,获得长度为355 bp的最终PCR产物。

2. 混合PCR文库制备与测序

  1. PCR产物混合: 每个PCR产物应去除多余的引物。我们使用Qiagen Qiaquick柱纯化法或96孔滤板配合真空 manifold 进行大规模纯化。纯化后,应使用标准技术对每个PCR产物进行定量。将所有PCR产物(包括对照)按照分子数量进行等量混合,因为若按浓度混合会导致较小的扩增子相对于较大的扩增子被过度代表。通过以下公式将浓度转换为每体积DNA分子的绝对数量:(g / μL) × (1 mol × bp / 660 g) × (1 / 扩增子中的bp数) × (6 × 1023 分子 / 1 mol) = 分子数 / μL。然后我们计算每个反应所需取用的体积,以确保每个扩增子在混合池中具有标准化的分子数。该数值是任意的,可根据需要调整,主要取决于移液操作中能保持准确性的最小体积。我们通常每个扩增子混合1-2 × 1010个分子。
  2. PCR产物连接: 此步骤对于实现均匀的测序覆盖度至关重要,因为对小的PCR扩增子进行超声打断会导致其末端区域被过度代表。为克服此问题,我们在打断前先将混合后的PCR产物连接成大的串联多联体(>= 10 Kb)。Pfu Ultra HF聚合酶产生平末端,有利于高效连接(基于Taq的聚合酶会在3'端添加“A”突出,若不预先补平或钝化则无法连接)。如有需要,该反应可放大2-3倍。连接反应体系包含:10 U T4多核苷酸激酶、200 U T4 DNA连接酶、15% w/v聚乙二醇、1× T4连接酶缓冲液、8000 MW的乙二醇,以及最多2 μg的混合PCR产物,总体积为50 μL。反应在22 °C孵育16小时,随后在65 °C加热20分钟,之后保存于4 °C。可通过将50 ng样品上样至1%琼脂糖凝胶来检测此步骤是否成功。成功连接会在泳道中出现高分子量条带(见图2,第3泳道)。
  3. DNA片段化:此时应已获得较大的PCR产物串联多联体(>10 kb)。我们采用24样本Diagenode Bioruptor超声仪进行随机打断,可在25分钟内完成(每分钟40秒“开启”/20秒“关闭”)。由于PEG引入的黏度会抑制超声效率,可通过将样品以10:1比例稀释于Qiagen PB缓冲液中来克服。结果可在2%琼脂糖凝胶上检测(见图2,第4和第5泳道)。
  4. 样品现已准备好,可直接进入Illumina基因组文库构建流程,从“末端修复”步骤开始。本文所报告的数据来自Illumina Genome Analyzer IIx平台的单端测序,但我们亦使用过HiSeq 2000平台,并进行了单端或双端测序,结果相当。鉴于所建文库的规模,我们还使用了定制的带条形码接头,以便将多个混合文库多重化,充分利用HiSeq平台的通量(数据未显示)。请遵循试剂盒附带的制造商说明书及推荐方案。为实现变异检测的最佳灵敏度和特异性,建议每个等位基因的靶向覆盖深度达到25倍或更高(图3)。该估算与混合池大小及待检测变异类型无关。如有需要,可合并多个通道和测序运行以达到足够的覆盖深度。

3. 测序读段比对与分析

  1. 文件压缩与格式化:原始测序读段文件应转换为 SCARF 格式或进行压缩。压缩是可选步骤,可在不丢失任何相关信息的前提下节省后续分析的时间和存储空间。可通过使用附带的脚本 RAPGAP_read_compressor_v2.pl 执行以下命令实现:
    ./RAPGAP_read_compressor_v2.pl [读段文件] > [压缩后的读段文件]
    支持的读段文件输入格式包括 SCARF 和 FASTQ,可为 gzipped 压缩或未压缩格式:
    SCARF 格式示例:
    HWI-EAS440:7:1:0:316#0/1:NTCGATTCACTGCCCAACAACACCAGCTCCTCTCCC:DNWUQSPWWWWUVVPVVWVVVUVVUUPUUWWWWWUW
    FASTQ 格式示例:
    @HWI-EAS440_7_1_0_410#0/1
    NGTGGTTTCTTCTTTGGCTGGGGAGAGGAGCTGGTG
    +
    &/8888888888888888888854588767777666!
  2. 原始读段比对:现在可将原始读段比对至针对 PCR 反应中目标区域设计的注释 FASTA 参考序列,以及阳性与阴性对照序列。比对可通过附带的比对工具 RAPGAPHASH5d 完成。此步骤的输入格式必须为 SCARF 或压缩格式。比对命令如下:
    ./RAPGAPHASH5d [压缩后的读段文件] [FASTA 文件] [允许的编辑数] > [比对后文件]
    每条读段相对于参考序列允许的错配数量由用户自定义。超出该错配数阈值的读段将被丢弃。我们建议:对于 36 bp 的读段允许 2 个错配,76 bp 的读段允许 4 个错配,101 bp 的读段允许 5 个错配。允许更多错配会增加将过多测序错误引入比对数据的风险。随着读段长度持续增加,该值可进一步上调。
  3. 为来自同一测序芯片的比对文件添加标签:此时应对整个比对后的读段文件赋予唯一标识符(“标签”),以识别属于同一次测序运行的读段文件(例如,来自同一测序芯片的多个通道可被合并并赋予单一标签)。该标签是必要的,因为每次仪器运行都会产生独特的错误谱型,可通过标签进行表征。标签为字母数字字符串,用于区分一组读段(为避免解析问题,不应使用下划线字符“_”)。不同测序芯片或仪器运行生成的比对读段文件应使用不同的标签。可通过附带的工具 RAPGAP_alignment_tagger.pl 使用以下命令添加标签:
    ./RAPGAP_alignment_tagger.pl [比对后文件] [标签] > [带标签的比对后文件]
    此后,来自同一文库但在不同测序芯片上生成的比对文件可合并处理,因其各自标签将保持其独立性。
  4. 错误模型生成:如上所述,每次仪器运行都会产生独特的测序错误谱型,需对其进行表征以实现准确的变异检测。为对每次运行的错误建模,每个混合样本文库中均包含一段已知无序列变异的内参对照序列。基于带标签的比对文件,可使用附带工具 EMGENERATOR4 结合阴性对照参考序列生成错误模型文件。可使用全部阴性对照序列,或仅使用由输入参数指定的 5' 和 3' 端部分序列。应始终使用唯一读段和伪计数:
    ./EMGENERATOR4 [带标签的比对文件] [阴性对照序列] [输出文件名] [阴性对照中使用的最 5' 端碱基] [阴性对照中使用的最 3' 端碱基] [仅包含唯一读段?= Y] [比对编辑数截断值] [输入伪计数?=Y]
    EMGENERATOR4 工具将生成三个文件,文件名以输出文件名参数为基础,分别附加 _0、_1 或 _2,对应零阶、一阶和二阶错误模型。在使用 SPLINTER 进行变异检测时,应始终采用二阶错误模型。
  5. 为可视化某次运行的错误率谱型,可使用 error_model_tabler_v4.pl 工具基于零阶错误模型文件生成 PDF 格式的错误图(图 4):
    ./error_model_tabler_v4.pl [零阶错误模型文件] [输出文件名]
    该图可揭示特定运行的错误趋势,并可用于推断分析中可使用的最大读段碱基数,具体解释见下一部分。

4. 使用 SPLINTER 进行罕见变异检测

  1. 通过SPLINTER进行变异检测 分析的第一步是运行 SPLINTER 使用错误模型和参考序列在比对文件上运行工具。执行此操作的命令为:
    ./SPLINTER6r [比对后的带标签文件] [FASTA 文件] [二阶误差模型文件] [用于分析的测序读段碱基数] [需排除的读段碱基或循环数] [p值截断值 = -1.301] [使用唯一读段 = Y] [比对编辑次数截断值] [从可用选项中选择的池大小] [输出每条链的绝对覆盖度 = Y] > [SPLINTER 文件]
    用于分析的读取碱基数因运行而异,需根据每次运行的具体情况进行评估。我们通常建议使用读取序列的前2/3,因为这部分代表了质量最高的数据(例如,对于长度为36 bp的读取序列,使用前24个碱基)。若发现个别碱基存在缺陷,可在分析中将其排除(以逗号或N分隔,例如5,7,11或N)。p值截断值决定了变异检测分析的严格程度。我们通常以-1.301作为最低截断值开始分析(对应于以log10为尺度的p值 ≤ 0.05)。池大小选项通过排除那些等位基因频率低于实际样本池中单个等位基因频率的潜在变异,优化算法对“信号-噪声”的区分能力。例如,在包含50个个体的样本池中,最低可观察到的变异频率为0.01,即每100个等位基因中出现1次。因此,池大小选项应设置为最接近该理论值的数值 大于 实验中实际分析的等位基因数量(例如,若调查了40人,则预期有80个等位基因,因此最接近的选项为100的池大小)。以特定频率检出的变异 <0.01 的值将被视为噪声而被忽略。该文件返回样本中所有具有统计学显著性的检测结果,包括变异位点的位置、变异类型、每条DNA链的p值、变异频率以及每条DNA链的总覆盖度(表2).
  2. 对检出的变异进行覆盖度标准化: 样本中覆盖度的波动可能产生假阳性结果。可通过应用以下方法进行校正: splinter_filter_v3.pl 脚本如下:
    ./splinter_filter_v3.pl [SPLINTER 文件] [列表文件] [严格度] > [SPLINTER 标准化文件]
    其中列表文件是以制表符分隔格式呈现的阳性对照命中结果列表。
    第一个字段表示感兴趣的扩增子,第二个字段表示发生突变的位置。N 表示序列其余部分不含任何突变。
  3. 利用阳性对照数据确定最佳 p 值阈值: 归一化后,分析阳性对照对于最大化特定样本分析的灵敏度和特异性至关重要。可通过利用阳性对照的信息确定最优的 p 值截断值来实现这一目标。通常情况下,初始 p 值 -1.301 的筛选标准可能不够严格,若如此,将导致在阳性或阴性对照中检出假阳性结果。每次 SPLINTER 分析均会显示每个被检出变异位点的实际 p 值(参见第 5 和第 6 列) 表 2),这是无法预测的 先验的然而,可以通过使用初始输出中已知真实阳性位点所显示的最宽松的 p 值来重复整个分析。这种方法能够在保留所有真实阳性结果的同时,排除大部分(即使不是全部)假阳性结果,因为假阳性结果的 p 值通常远不如真实阳性结果显著。为了自动化这一过程, cutoff_tester.pl 可以使用。 cutoff_tester.pl 需要一个 SPLINTER 输出文件以及以制表符分隔的阳性对照命中结果列表文件,格式与用于归一化的文件相同:
    ./cutoff_tester.pl [SPLINTER 筛选后文件] [列表文件]
    最终输出将是一系列逐步逼近最优值的截断点(参见 表3)。格式为:
    [最大敏感性和特异性距离] [敏感性] [特异性] [截断值]
    例如:
    7.76946294170104e-07 1 0.999118554429264 -16.1019999999967
    最后一行代表该次运行的最优截断值,因此可用于数据分析。理想结果是达到1的灵敏度和特异性。如果未达到此结果,则 SPLINTER 可通过改变掺入的测序读长碱基数重复分析,直至达到最佳条件。
  4. 最终变异位点筛选 可使用最终截断值对数据进行处理 cutoff_cut.pl 脚本,该脚本将进行筛选 SPLINTER 低于最佳截断值的命中结果输出文件,
    ./cutoff_cut.pl [SPLINTER 筛选后文件] [阈值] > [SPLINTER 最终文件]
    此步骤将生成最终产物 SPLINTER 输出文件,其中将包含样本中存在的SNP和Indel。请注意,插入变异的输出格式与替换或缺失变异略有不同(表2).

5. 代表性结果

我们汇集了947名个体的群体,并针对超过20 kb的区域进行测序。我们按照标准操作流程应用SPLINTER方法检测稀有变异。此前,每个个体均已通过全基因组芯片进行过基因分型。汇集样本中检测到的已知标记变异和新发现变异的基因分型结果与先前数据高度一致(图6)。根据测序结果,共鉴定出3个新生变异(de novo),其中两个(rs3822343和rs3776110)在人群中属于稀有变异,并通过个体焦磷酸测序得到验证。该群体中各变异的次要等位基因频率(MAF)与dbSNP 129版本数据库中记录的MAF相近。焦磷酸测序与汇集测序所获得的MAF结果高度一致(表3)。

合成DNA突变表格;基因编辑结果;插入缺失和替换分析;序列数据。
表 1. 阳性对照用DNA寡核苷酸序列。每条序列均包含一个与野生型参考序列相比存在两个替换,或一个插入和一个缺失的DNA片段。 点击此处查看大图

基因组数据表;核苷酸分析;对照变异;统计值;插入序列。
表 2. SPLINTER 输出结果示例。前两行表示替换或缺失变异的标准 SPLINTER 输出结果(蓝色表头),最后一行表示插入变异的标准 SPLINTER 输出结果(紫色表头)。点击此处查看大图

比较个体与混合样本的次要等位基因频率(MAF)及混合样本规模的基因分型数据表
表 3. 从大规模人群中鉴定出五个已知变异和三个新变异,并通过个体基因分型验证。个体验证通过焦磷酸测序(第1-3行)、TaqMan检测(第4-6行)或Sanger测序(第7、8行)完成。在广泛的等位基因频率范围内,包括五个MAF <1% 的位点,混合测序等位基因频率估计值与个体基因分型结果之间具有高度一致性。标有星号(*)的位点数据引自先前报道的研究9

显示样本混合、测序、比对和错误分析的DNA测序工作流程示意图
图 1. 混合DNA测序与SPLINTER分析概述。将患者DNA在选定的基因座处进行混合并扩增。最终的PCR产物以等摩尔比例与阳性和阴性对照混合。混合后的样本随后进行测序,所得的测序读段被回贴至参考序列。利用比对到阴性对照的读段生成特定测序运行的错误模型。随后,SPLINTER可结合该错误模型和阳性对照的信息,用于检测稀有SNP和插入缺失突变。[改编自Vallania FLM et al, Genome Research 2010] 点击此处查看大图

凝胶电泳,DNA Ladder,质粒分析,泳道显示消化、连接、超声处理的样品。
图 2. PCR扩增子混合连接与超声片段化。为展示文库构建流程中的连接和随机片段化步骤,将pUC19载体通过酶切处理生成如第2泳道所示的片段。这些片段按分子数均一化后,按照上述步骤1.7进行混合并随机连接。连接后形成的较大串联多联体如第3泳道所示。将连接产物均分为两份,并按照上述步骤1.8进行超声处理。每个技术重复产生的DNA片段弥散条带分别显示在第4和第5泳道。括号标示了用于胶回收及测序文库构建的片段大小范围。

等位基因覆盖度与AUC关系图;插入、缺失、替换的数据分析;教育用途。
图 3. 在混合样本中单个等位基因检测准确率随覆盖度的变化。准确率以受试者操作特征曲线(ROC)的曲线下面积(AUC)来估计,AUC 范围为 0.5(随机)至 1.0(完全准确)。AUC 作为每个等位基因覆盖度的函数,用于检测包含 200、500 和 1000 个等位基因的混合样本中的单个突变等位基因(A)。AUC 也作为总覆盖度的函数,用于检测替换、插入和缺失变异(B)。[改编自 Vallania FLM 等,Genome Research 2010]。

错误率与循环次数关系图;显示不同引物序列的DNA扩增数据分析。 图 4. 错误率图显示了在特定位置掺入错误碱基的概率。错误谱显示错误率较低,且随着测序读长向3'端延伸呈逐渐上升趋势。值得注意的是,不同的参考核苷酸表现出不同的错误概率(例如,当参考碱基为G时掺入C的概率)。[改编自Vallania FLM 等,Genome Research 2010]。

GWAS与SPLINTER频率的散点图;相关系数r=0.999;数据分析。
图5. 在每个等位基因测序深度大于25倍的位点,SPLINTER估计等位基因频率的准确性。根据图3中A部分的结果,当测序深度≥25倍时,单个变异检测具有最佳灵敏度,使用SPLINTER对混合DNA样本估计的等位基因频率与通过GWAS实测的等位基因计数之间表现出极高的相关性(r = 0.999)。[改编自Vallania FLM et al, Genome Research 2010]。

GWAS与混合测序散点图,N=974,等位基因频率相关性r=0.995。
图6. 通过GWAS检测的等位基因频率与基于974个个体混合测序获得的SPLINTER估计值之间的比较。用于比较的基因分型位点与测序区域之间共有19个常见位置。两者之间的相关性极高(r = 0.99538)。 点击此处查看高清大图

讨论

越来越多的证据表明,肥胖8、高胆固醇血症4、高血压7等常见复杂表型和疾病的发病率及治疗反应可能受到个体罕见变异谱的影响。确定这些变异在患病人群中富集的基因和通路,将对诊断和治疗产生深远影响;但对患病个体逐一进行分析可能耗时且成本高昂。基于人群的分析为在多个基因位点上调查遗传变异提供了一种更高效的手段。

我们提出了一种新型的混合DNA测序方案,并结合SPLINTER软件包,旨在在群体中识别此类遗传变异。我们验证了该方法在包含947个个体的大规模混合群体中识别和定量稀有等位基因的准确性,其中包括通过混合测序从头(de novo)检测出的罕见变异,并经个体焦磷酸测序验证。我们的策略与其他方案的主要区别在于,每次实验均包含阳性对照和阴性对照,从而使SPLINTER相比其他方法具有更高的准确性和检测效能1。每等位基因25倍的最优测序深度与混合样本的规模无关,该要求仅随样本池大小线性增长,因此使得大规模样本池的分析成为可能。我们的方法具有高度灵活性,不仅适用于任何感兴趣的表型,还可应用于天然异质性的样本,例如混合细胞群体和肿瘤活检组织。鉴于目前对来自外显子组或全基因组等大目标区域的混合测序兴趣日益增加,我们的文库构建及SPLINTER分析方法兼容定制捕获和全外显子组测序;但SPLINTER软件包中的比对工具未针对大参考序列设计。因此,我们已成功采用动态规划比对工具Novoalign进行全基因组范围的序列比对,随后从混合样本中进行变异检测(Ramos et al.,已投稿)。因此,我们的混合测序策略可随着目标序列长度的增加,成功扩展至更大规模的样本池。

披露

未声明任何利益冲突。

致谢

本工作得到了儿童发现研究所资助项目 MC-II-2006-1(RDM 和 TED)、NIH 表观遗传学路线图资助项目 [1R01DA025744-01 和 3R01DA025744-02S1](RDM 和 FLMV)、U01AG023746(SC)、Saigh 基金会(FLMV 和 TED)以及 1K08CA140720-01A1 和 Alex's Lemonade Stand “A” 奖项资助(TED)的支持。我们感谢华盛顿大学医学院遗传学系基因组技术应用中心在基因组分析方面提供的帮助。该中心的部分支持来自国家癌症研究所癌症中心支持资助项目 #P30 CA91842(Siteman 癌症中心)以及美国国立卫生研究院(NIH)下属国立研究资源中心(NCRR)的 ICTS/CTSA 资助项目 #UL1RR024992,以及 NIH 医学研究路线图计划。本出版物的内容 solely 由作者负责,不一定代表 NCRR 或 NIH 的官方观点。

材料

本文使用的材料清单
姓名公司目录编号评论
PfuUltra 高保真 DNA 聚合酶Agilent6003841.4
甜菜碱SIGMAB26291.4
M13mp18 单链 DNA 载体NEBN4040S1.5
pGEM-T Easy 载体PromegaA13601.5
T4 多核苷酸激酶NEBM0201S2.2
T4 DNA 连接酶NEBM0202S2.2
聚乙二醇 8000 分子量SIGMAP54132.2
Bioruptor 超声破碎仪DiagenodeUCD-200-TS2.3

参考文献

  1. Vallania, F. L. M., Druley, T. E., Ramos, E., Wang, J., Borecki, I., Province, M., Mitra, R. D. High-throughput discovery of rare insertions and deletions in large cohorts. Genome Research. 20, 1391-1397 (2010).
  2. Shendure, J., Mitra, R., Varma, C., Church, G. M. Advanced Sequencing Technologies: Methods and Goals. Nature Reviews of Genetics. 5, 335-344 (2004).
  3. The 1000 Genomes Project Consortium. A map of human genome variation from population-scale sequencing. Nature. 467, 1061-1073 (2010).
  4. Manolio, T. A., Collins, F. S., Cox, N. J., Goldstein, D. B., Hindorff, L. A., Hunter, D. J., McCarthy, M. I., Ramos, E. M., Cardon, L. R. Finding the missing heritability of complex diseases. Nature. 461, 747-753 (2009).
  5. Reich, D. E., Lander, E. S. On the allelic spectrum of human disease. Trends Genet. 17, 502-510 (2001).
  6. Cohen, J. C., Kiss, R. S., Pertsemlidis, A., Marcel, Y. L., McPherson, R., Hobbs, H. H. Multiple rare alleles contribute to low plasma levels of HDL cholesterol. Science. 305, 869-872 (2004).
  7. Ji, W., Foo, J. N., O'Roak, B. J., Zhao, H., Larson, M. G., Simon, D. B., Newton-Cheh, C., State, M. W., Levy, D., Lifton, R. P. Rare independent mutations in renal salt handling genes contribute to blood pressure variation. Nat. Genet. 40, 592-599 (2008).
  8. Ahituv, N., Kavaslar, N., Schackwitz, W., Ustaszewska, A., Martin, J., Hebert, S., Doelle, H., Ersoy, B., Kryukov, G., Schmidt, S. Medical sequencing at the extremes of human body mass. Am. J. Hum. Genet. 80, 779-791 (2007).
  9. Druley, T. E., Vallania, F. L., Wegner, D. J., Varley, K. E., Knowles, O. L., Bonds, J. A., Robison, S. W., Doniger, S. W., Hamvas, A., Cole, F. S., Fay, J. C., Mitra, R. D. Quantification of rare allelic variants from pooled genomic DNA. Nat. Methods. 6, 263-265 (2009).
  10. Mitra, R. D., Butty, V., Shendure, J., Housman, D., Church, G. M. Digital Genotyping and Haplotyping with Polymerase Colonies. Proc. Natl. Acad. Sci. 100, 5926-5931 (2003).

重印与许可

标签

SPLINTER DNA PCR