方法文章

靶向二代测序与生物信息学分析流程用于评估先天性疾病的遗传决定因素

DOI:

10.3791/57266

2018年4月4日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

靶向二代测序是一种高效且经济的方法,正日益广泛应用于疾病研究和临床诊断。本文所述方案介绍了用于测序的复杂工作流程,以及用于识别致病遗传变异的生物信息学分析过程。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

下一代测序(NGS)正在迅速变革对先天性疾病遗传决定因素的研究方式。该技术效率极高,可在较短时间内以相对较低的成本产生数百万条测序读长。特别是靶向NGS能够将研究聚焦于与特定疾病相关的基因组区域。这不仅进一步降低了成本并加快了分析速度,还减轻了通常伴随NGS而来的计算负担。尽管靶向NGS仅限于基因组的特定区域,因而无法发现潜在的新功能位点,但对于已知存在遗传关联且表型和遗传异质性较强的疾病而言,该技术是一种极为有效的手段。由于测序技术本身具有复杂性,因此必须严格遵循实验方案和方法,以获得高覆盖度和高质量的测序读长。此外,在获得测序读长后,需采用复杂的生物信息学流程,将读长准确比对至参考基因组、识别变异位点,并确保这些变异通过质量评估指标。变异还需根据其临床意义进行注释和审编,这一过程可通过应用美国医学遗传学与基因组学学会(ACMG)致病性指南实现标准化。本文所述方法将以ONDRISeq神经退行性疾病测序 panel 为模型,展示利用靶向测序 panel 生成和分析NGS数据的各个步骤,以识别可能具有临床意义的变异位点。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着确定各类疾病的遗传决定因素在科研和临床实践中日益受到重视,新一代测序技术(NGS)正成为实现这一目标的高通量且经济高效的重要工具1,2,3。近40年来,桑格测序一直是鉴定遗传变异的金标准4;然而,对于具有遗传异质性或遗传病因尚未明确的疾病,往往需要同时评估大量可能的候选基因。在此情况下,桑格测序变得昂贵且耗时。相比之下,NGS通过对数百万条DNA片段进行大规模并行测序,能够在全基因组多个区域同时高效、低成本地检测多种类型的遗传变异。

DNA测序的下一代测序(NGS)技术有三种类型:1)全基因组测序(WGS),2)全外显子组测序(WES),以及3)靶向测序5。WGS用于评估个体的全部基因组内容,而WES仅对基因组中的蛋白质编码区域进行测序6。相比之下,靶向测序则聚焦于基因组中特定的区域,这些区域通常基于少数由共同病理机制或已知临床表型关联的特定基因。通过该方法,可以指定一个或一组特定基因的外显子、内含子或任何基因间区域。因此,当已有明确的候选基因与目标疾病相关时,靶向测序可成为一种极佳的选择。通过靶向基因组的特定区域,能够排除冗余和无关的遗传变异,从而避免对临床解读造成干扰或混淆。尽管WGS和WES均可产生大量高质量的数据,但数据量可能过于庞大。这不仅需要计算密集型的生物信息学分析,还常常带来数据存储方面的难题7。数据存储的挑战也进一步增加了WGS和WES的额外成本,而这一点在计算测序费用时往往未被充分考虑。此外,尽管成本正在下降,WGS和WES的费用仍然相对较高。相比之下,当需要对大量个体进行测序时,靶向测序可能是一种更具成本效益的选择。

安大略神经退行性疾病研究计划(Ontario Neurodegenerative Disease Research Initiative, ONDRI)是一项多平台、覆盖全省的观察性队列研究,旨在对五种神经退行性疾病进行表征,包括:1)阿尔茨海默病与轻度认知障碍,2)肌萎缩侧索硬化症,3)额颞叶痴呆,4)帕金森病,以及 5)血管性认知障碍8。ONDRI 基因组学小组致力于在该队列基线特征描述中阐明常被忽视却极为重要的遗传背景,这些疾病在表型和遗传上均具有高度异质性。因此,神经退行性疾病是下一代测序(NGS)技术,尤其是靶向测序方法的适宜研究对象。

我们专门设计了一种靶向NGS panel——ONDRISeq,用于对参与ONDRI项目的528名受试者进行测序,覆盖了先前与五种目标疾病相关的80个基因的蛋白质编码区。通过该方法,我们能够以集中且高效的方式利用高质量的NGS数据。ONDRISeq panel的设计及验证已通过多项一致性研究进行过描述,在用于panel验证的216个病例中,ONDRISeq panel能够识别出72.2%的具有潜在临床意义的新型罕见变异9。尽管近年来NGS技术取得了迅速而显著的进步,许多研究人员在将原始数据处理为可用的、带有注释的变异列表时仍面临挑战10。此外,变异的解读可能十分复杂,尤其是当面对大量罕见或新型变异时11

本文以 ONDRISeq 研究为例,逐步介绍靶向高通量测序(NGS)的方法学以及相关的生物信息学工作流程,该流程用于重测序、变异检测和变异注释。在生成 NGS 数据后,必须将原始测序文件比对至人类参考基因组,以准确识别变异。随后需对变异进行注释,以便开展后续的变异审编。我们还将阐述如何应用美国医学遗传学学会(American College of Medical Genetics)的标准与指南,以准确分类变异的致病性。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

针对ONDRI项目,伦理协议和知情同意书的获取依据以下机构的研究伦理委员会规定:加拿大安大略省多伦多的贝克斯特老年护理中心(Baycrest Centre for Geriatric Care);加拿大安大略省多伦多的成瘾与心理健康中心(Centre for Addiction and Mental Health);加拿大安大略省渥太华的伊丽莎白·布吕耶尔医院(Elizabeth Bruyère Hospital);加拿大安大略省汉密尔顿的汉密尔顿综合医院(Hamilton General Hospital);加拿大安大略省伦敦的伦敦健康科学中心(London Health Sciences Centre);加拿大安大略省汉密尔顿的麦克马斯特大学(McMaster);加拿大安大略省渥太华的渥太华医院(The Ottawa Hospital);加拿大安大略省伦敦的帕克伍德医院(Parkwood Hospital);加拿大安大略省多伦多的圣迈克尔医院(St Michael's Hospital);加拿大安大略省多伦多的森尼布鲁克健康科学中心(Sunnybrook Health Sciences Centre);以及加拿大安大略省多伦多的大学健康网络-多伦多西区医院(University Health Network-Toronto Western Hospital)。

1. 从人血样本中分离DNA

  1. 根据适当的伦理规范和知情同意书,从测序参与者中采集样本。
    1. 为获得高质量的DNA,采集血液样本用于提取。
      注意:也可使用唾液或口腔黏膜细胞提取DNA,但需确保使用适当的DNA提取试剂盒。
    2. 若从血液中提取DNA,为获得较高的DNA得率,应使用三根4 mL的EDTA K2采血管采集样本,总采血量约为12 mL。
    3. 将血液样本在750 × g条件下离心20分钟,分离为上层血浆、中间薄层的白细胞层和下层的红细胞层。
  2. 使用一次性移液管吸取并移除血液样本中的血浆。妥善丢弃血浆,或将其分装为多个500 µL等分试样,于-80 °C保存,以备后续生化分析。确保每个样本均使用新的无菌移液管。
  3. 按照制造商说明书,使用血液DNA提取试剂盒12材料表)从血液样本中提取DNA。
    注意:若获得上述体积的样本,可得到约3 mL的白细胞用于DNA提取。
  4. 按照制造商说明书,使用全光谱分光光度计13材料表)测定初始DNA浓度(单位:ng/µL)。
  5. 直接进入第2步。或者,将DNA在4 °C条件下保存。

2. 测序文库制备

  1. 在三天内对DNA样本进行系列稀释,以获得最终浓度为5.0 ± 1.0 ng/µL的溶液。
    1. 用去离子水将1 M Tris缓冲液(pH 8.5)稀释至10 µM。
      注意:稀释的体积取决于后续步骤中需要稀释的DNA样本数量。
    2. 如果在完成步骤1.4后立即进行DNA稀释,则进入下一步。如果不是在同一天操作,则需按照步骤1.4的方法重新测定DNA浓度。
    3. 根据测得的浓度,使用10 µM Tris缓冲液(pH 8.5)将40 µL的DNA稀释至约10 ng/µL,并将样本在4 °C下静置过夜。
    4. 按照制造商说明,使用适用于DNA定量的荧光计14测定DNA浓度(材料表)。
      注意:由于此前使用的分光光度计灵敏度较低,样本浓度应>10 ng/µL。
    5. 根据测得的浓度,使用10 µM Tris缓冲液(pH 8.5)将20 µL的DNA稀释至10 ng/µL,并将样本在4 °C下静置过夜。
    6. 按照制造商说明,使用荧光计14测定DNA浓度。
    7. 根据测得的浓度,使用10 µM Tris-HCl缓冲液(pH 8.5)将10 µL的DNA稀释至5 ng/µL,并将样本在4 °C下静置过夜。
  2. 根据制造商说明,使用适用于目标NGS面板的目标富集试剂盒15(材料表)制备测序文库。确保所选富集试剂盒适用于所使用的NGS平台。
    1. 遵循制造商说明16中关于文库多重性(plexity)和文库混合(pooling)的操作。
      注意:对于ONDRISeq,每个文库包含12个DNA样本,每两个样本为一组进行混合,并在NGS台式仪器(材料表)上运行。单次反应可运行的样本数量取决于所使用的测序试剂盒和平台。
    2. 为获得更高质量的测序数据,可选择性执行文库质量验证步骤,即在片段化(tagmentation)后按照目标富集试剂盒的制造商说明15进行文库质量检测。
      1. 对每个文库进行三份重复分析,以确保文库产量的质量。
    3. 若需混合文库,请按照制造商说明使用荧光计14测定DNA浓度。根据该浓度确定各DNA文库的混合体积,以达到所用目标富集试剂盒推荐的等摩尔比例。

3. 下一代测序

  1. 根据NGS台式仪器配套试剂盒制造商的说明对文库进行测序17,18(材料表)。
    1. 使用适当的NGS技术软件(材料表)按照制造商说明18准备样本表,该样本表将被导入NGS台式仪器的工作流程中。
      注:对于ONDRISeq的应用目的,应选择“其他”应用选项,并仅请求生成FASTQ文件(图1)。后续步骤将处理这些FASTQ文件,以便完全自定义比对和质量参数。然而,如果选择靶向测序,某些NGS仪器可自行将测序数据处理为VCF文件。有关完整选项列表,请参考制造商说明18
    2. 若使用基于云的计算环境19材料表),在设置测序运行时登录。此操作应在NGS台式仪器主页点击“测序”后进行。
    3. 按照制造商说明18完成文库变性后,使用荧光计14测定DNA文库浓度。
    4. 按照制造商说明,使用合适的自动化电泳系统和DNA质量分析试剂盒20材料表)验证DNA文库质量。
    5. 为将DNA浓度从ng/µL转换为nM,请使用以下公式16
      DNA浓度计算公式;将ng/µl转换为nM;分子生物学背景下的方程。
      注:平均文库大小取决于所使用的靶向富集试剂盒,可通过步骤3.1.4中观察到的电泳图谱获得。
    6. 根据制造商说明21,将测序文库稀释至适当的终浓度(6–20 pM)和体积(600 μL)。
      注:所需确切浓度取决于所用测序试剂盒。请咨询富集试剂盒制造商以确定合适的上样浓度。
    7. 根据制造商说明,对阳性对照测序文库进行稀释、变性并加入测序反应中21
    8. 记录每次测序运行的日志,内容应包括上样的DNA文库浓度(pM)、添加的阳性对照百分比、试剂盒条形码、步骤3.1.1中选择的应用、index读取数、所用富集试剂盒、读长以及样本表名称。
      注:NGS台式仪器的运行时间取决于仪器型号、所用富集试剂盒及选择的读长(本实验所用测序仪的运行时间为4–56小时22)。
  2. 测序运行完成后,通过访问NGS台式仪器主页并点击“管理文件”,进入“运行文件夹”以获取所有输出文件。将文件移至本地驱动器以便后续访问。另一种方式是在计算机上通过导航面板选择“运行”,在基于云的计算环境19中查找相应文件。选择适当的测序运行以进入运行摘要页面,点击“下载”以从云端获取数据。在弹出的对话框中,选择FASTQ文件作为要下载的文件类型,然后点击“下载”。
  3. 在基于云的计算环境19,23的运行摘要页面中,点击“图表”以分析测序运行质量,查看计算环境生成的各种图形。有关各图形的详细信息,请参阅制造商说明23
    1. 在“运行图表”页面中,找到标注为“按循环数据”的图表。在图表类型中选择“强度”,在通道中选择“所有通道”。确保生成的信号强度图与以往使用相同富集试剂盒和NGS台式仪器进行的测序运行结果相似。
      注:该图反映每个碱基在全部150个循环中的信号强度百分比。图形可能因所用富集试剂盒不同而有较大差异,因此必须与同一批次以往测序运行结果进行比较。
    2. 在运行导航面板中选择“Indexing QC”标签页,查看位于页面右侧的index质量控制(QC)直方图。确保所有样本的% Reads Identified (PF) 分布相对均匀。
      注:若某些样本的% Reads Identified (PF) 显著低于其他样本,需注意测序数据质量可能受到影响。
  4. 在基于云的计算环境的运行摘要页面中,点击运行导航面板中的“指标”以查看质量指标。
    注:指标的阈值取决于所使用的测序平台和富集试剂盒。根据制造商说明23,可使用多种指标进行质量评估,以下步骤重点介绍三个强烈推荐用于质量控制的指标。
    1. 在“DENSITY (K/MM2)”项下,确保簇密度处于所用富集试剂盒推荐的范围内(本例中为1,200–1,400 K/mm2)。
    2. 在总“%≥Q30”项下,确保数值≥85%,以反映测序读段的质量。
      注:若低于85%的阈值,需注意测序质量可能受损。
    3. 在“ALIGNED (%)”项下,确保该值与测序运行中加入的阳性对照百分比相近。
      注:此指标用于评估阳性对照的表现,表示仅有该百分比的总读段比对到阳性对照基因组。例如,若使用了1%的阳性对照,则预期“ALIGNED (%)”值约为1–5%。

用于选择类别和应用的测序软件界面;选项包括 RNA、ChIP-Seq。
图 1:NGS 技术软件(材料表)中样本表创建器的应用选项截图。 在 ONDRISeq 中,仅使用“仅生成 FASTQ”应用。然而,如果用户希望生成其他类型的文件(例如 VCF 文件),建议选择靶向重测序类别中的相应应用。请点击此处查看此图的放大版本。

4. 重测序与变异检测

  1. 进行数据预处理时,选择合适的软件将原始 FASTQ 文件比对至人类参考基因组并进行变异检测(材料表)。
  2. 将 FASTQ 测序读段导入数据预处理软件。
    注意:对于 ONDRISeq 的目的,单次测序运行产生的 24 个样本共 48 个 FASTQ 文件将被导入并经由该软件处理。一次处理的样本数量可根据研究人员的需求和 NGS 面板的大小而变化。
    1. 在“导航区域”内右键单击,选择“新建文件夹”。将文件夹命名以明确标识所执行的测序运行。
    2. 从顶部工具栏中选择“导入”。从显示的测序平台下拉列表中选择实际用于测序的平台。
      注意:对于 ONDRISeq 的目的,选择“Illumina”。但如果使用其他测序平台,请参考制造商说明完成后续 FASTQ 文件导入步骤24
    3. 在弹出的对话框中,浏览并选择当前处理的测序运行所产生的 FASTQ 文件。若计算机具有多个服务器,请确保要导入的文件存储在本地磁盘中,并从本地磁盘导入。
    4. 在对话框的“常规选项”中,如果测序使用了双端测序化学方法,则勾选“配对读段”复选框。
      注意:在此情况下,每个样本应导入两个 FASTQ 文件——一个正向读段和一个反向读段。
    5. 在对话框的“配对读段信息”部分,若文件列表中正向读段 FASTQ 文件位于反向读段之前,请选择“双端测序(正向-反向)”;若顺序相反,则选择“成对测序(反向-正向)”。将配对读段最小距离设为 1,最大距离设为 1000,以便检测样本序列中的小规模结构重排。
    6. 在对话框的“Illumina 选项”部分,选择“移除失败读段”,以剔除测序失败的读段。如果 NGS 台式仪器在导出 FASTQ 文件前已完成数据去多重化,则不要勾选“MiSeq 去多重化”选项。
    7. 在“质量评分”下拉列表中,选择用于测序的 NGS 测序流程。点击对话框底部的“下一步”。
      注意:所选流程将影响 FASTQ 文件质量评分的格式。有关应选择哪个流程的更多信息,请参阅制造商说明24
    8. 在新弹出的对话框中,选择“保存”并“为每个批次单元创建子文件夹,以将每个样本的 FASTQ 文件分别存入独立的文件夹中”。点击对话框底部的“下一步”。
    9. 在新弹出的对话框中,选择步骤 4.2.1 中创建的文件夹,作为导入 FASTQ 文件的目标位置。点击对话框底部的“完成”,等待 FASTQ 文件导入完成。点击“进程”标签页以查看文件导入状态。
  3. 根据制造商说明,在软件中设计一个用于重测序和变异检测的工作流程。
    注意:该工作流程可根据研究人员的具体需求进行调整,但以下步骤涵盖了 ONDRISeq 所采用的内容(图 2)。这些步骤可根据需要适用于其他 NGS 重测序和变异检测软件。为保证数据处理与分析的一致性,ONDRI 的所有生物信息学处理均以人类参考基因组 GRCH37/hg19 为参照。
    1. 将测序读段比对至参考基因组。
      1. 配置时,选择适当的参考基因组,并确保其与所有生物信息学步骤所使用的参考基因组一致。
      2. 从“屏蔽模式”下拉列表中选择“无屏蔽”,以确保参考序列中没有任何区域被屏蔽。
      3. 使用软件默认分配的比对参数。查阅制造商说明24,确认这些参数是否符合研究目的。
    2. 在工作流程中加入局部重比对步骤,以校正任何读段比对错误,特别是围绕插入-缺失变异的比对错误。
      1. 使用软件默认分配的局部重比对参数。查阅制造商说明24,确认这些参数是否符合研究目的。
    3. 移除 NGS 协议中因 PCR 扩增产生的重复比对读段,以减少 PCR 扩增偏差的影响,避免产生假阳性结果25
      1. 根据研究需求设置“少数序列最大占比(%)”。
        注意:ONDRISeq 采用较为宽松的设置为 5%;然而,软件默认设置更为严格,为 20%。当两条读段非常相似时,此参数决定是否将读段数较少的序列视为由 PCR 扩增偏差引起的测序错误。因此,设置为 5% 时,少数读段数必须 ≤ 主要读段数的 5%,才会被校正为与主要读段一致。
    4. 从步骤 4.3.3 生成的读段轨迹中导出目标区域的统计信息,形式为覆盖度汇总文本文件。在设置中忽略非特异性匹配和断裂配对。选择本地磁盘上的目标路径存储这些文件。
    5. 从步骤 4.3.3 生成的读段轨迹中为每个样本导出二进制序列比对图(BAM)文件。该文件包含序列比对数据,可用于后续分析。选择本地磁盘上的目标路径存储这些文件。
    6. 选择一种变异检测方法以识别序列中的变异。
      注意:当可对样本的倍性做出假设时,建议使用固定倍性变异检测算法,ONDRISeq 即采用此方法。若无法做出该假设,请参考制造商说明24,确定适用于研究目的的最佳算法。
      1. 配置时,在固定倍性变异参数选项中,根据样本生物体设置适当的倍性。将“所需变异概率”(即变异被正确识别并保留的概率)设为 90.0%。
      2. 使用以下推荐的通用过滤器设置:“最小覆盖度”为 10x,“最小计数”为 2,“最小读段频率”为 20%,“忽略断裂配对”,基于“读段”忽略非特异性匹配,“最小读段长度”为 20。
        注意:这些参数基于 ONDRISeq 的研究目的。请参考制造商说明24,确保其适用于当前研究。
      3. 使用以下推荐的噪声过滤器设置:“碱基质量过滤器”中“邻域半径”映射质量评分为 5,“中心最小质量”映射评分为 20,“邻域最小质量”映射评分为 15;“读段方向过滤器”为 5.0%;“相对读段方向过滤器”显著性为 1.0%。
        注意:这些参数基于 ONDRISeq 的研究目的。请参考制造商说明24,确保其适用于当前研究。
    7. 根据变异与靶向 NGS 面板目标区域的重叠情况(由 Browser Extensible Data(BED)文件指定)对已识别的变异进行过滤,仅保留发生在靶向 NGS 面板所选基因组区域内的变异。
      注意:BED 文件因所使用的靶向 NGS 面板而异,取决于该面板所能覆盖的基因组区域。
    8. 从步骤 4.3.7 生成的变异轨迹中导出变异报告,格式为变异调用格式(VCF)文件。选择本地磁盘上的目标路径存储这些文件。
    9. 根据制造商说明24保存并安装该工作流程,使其出现在软件的“工具箱”中。确保工作流程命名清晰,以便未来明确其适用的 NGS 面板。
      1. 在安装过程中出现的“导出参考数据”选项对话框中,将所有选项设为“捆绑”。
      2. 在安装过程中出现的“安装位置”选项对话框中,点击“在本地计算机上安装工作流程”。
  4. 根据制造商说明24,将导入的 FASTQ 测序读段文件通过步骤 4.3 中设计的定制化生物信息学工作流程进行运行。
    1. 在软件的“工具箱”中找到步骤 4.3 中设计的工作流程,双击打开。
    2. 在弹出的对话框中,定位到步骤 4.2 中导入的 FASTQ 文件所在的文件夹(位于“导航区域”内)。通过在“导航区域”中选择所有文件夹,然后点击“批次”复选框,使用右向箭头将文件移至“已选元素”。点击对话框底部的“下一步”。
    3. 在对话框中,查看“批次概览”,确认已正确选择 FASTQ 文件,然后点击“下一步”。
    4. 在对话框中逐项检查工作流程的以下步骤,确保在步骤 4.3 设计工作流程时已正确选择文件和导出路径:“将读段比对至参考序列”;“移除重复比对读段”;“为目标区域生成统计信息”;“导出 BAM”;“导出制表符分隔文本”;“基于重叠进行过滤”;以及“导出 VCF”。
    5. 在对话框的最后一步——“结果处理”中,选择“保存至输入文件夹”选项。点击对话框底部的“完成”。
      注意:这意味着每个样本生成的文件将被保存至数据预处理软件中存储 FASTQ 文件的同一文件夹内。

基因组数据分析工作流程图,将测序读段比对至参考序列,变异检测过程。
图 2:在数据预处理软件(材料表)中为 ONDRISeq 目的定制的 FASTQ 文件重测序与变异检测工作流程。 该工作流程中的步骤可根据研究人员的需求,应用于其他二代测序(NGS)重测序与变异检测软件。 请点击此处查看此图的放大版本。

5. 变异注释

  1. 下载并自定义 Annotate Variation (ANNOVAR)26 脚本,以对每个样本的 VCF 文件进行变异注释。
    1. 从 ANNOVAR 下载以下数据库用于注释:1) RefSeq27(2015 年 8 月更新);2) dbSNP13828(2014 年 9 月更新);3) 外显子组聚合联盟29(ExAC,版本 0.3,2015 年 11 月更新);4) 国家心肺血液研究所外显子组测序项目欧洲队列30(ESP,2015 年 3 月更新);5) 1000 基因组计划欧洲队列31(1KGP,2015 年 8 月更新);6) ClinVar32(2016 年 3 月更新);以及 7) 综合注释依赖性耗竭33(CADD)、耐受性排序预测34(SIFT)和 PolyPhen-235
      注意:ANNOVAR 引用的基因组坐标及所有数据库均基于人类基因组版本 GRCh37/hg19。此外,所列数据库版本为 ONDRISeq 研究所用版本;下载时应使用各数据库最新可用版本。
    2. 如需要,可自定义 ANNOVAR 以输出完整的注释变异列表,以及使用 --filter 操作26生成的简化版注释变异汇总。
      注意:简化列表可根据研究人员需求进行定制。对于 ONDRISeq 的目的,简化注释变异列表不包含距离最近外显子超过 15 个碱基的变异,或在以下任一三个数据库中次要等位基因频率(MAF)>3% 的任何变异:1) ExAC;2) ESP;和 3) 1KGP。强烈建议执行此步骤。
    3. 如需要,可根据研究人员需求自定义 ANNOVAR,以单独识别特定等位基因调用26
      注意:对于 ONDRISeq 的目的,ANNOVAR 会评估 APOE 风险等位基因 rs429358(C>T):p.C130R 和 rs7412(C>T):p.R176C 的测序结果,以输出整体 APOE 基因型,共有六种可能组合,包括:1) E2/E2;2) E3/E2;3) E4/E2;4) E3/E3;5) E4/E3;6) E4/E4。在这六种可能的 APOE 基因型中,E4/E4 是晚发性阿尔茨海默病最广泛认可的遗传风险因素36
  2. 查询疾病突变数据库(材料表),以确定变异是否已有合理证据表明与疾病相关。将此前未报道的任何变异视为新发变异。
    1. 评估 ANNOVAR 来自 ClinVar 的注释,使与疾病相关的变异包括被分类为可能致病或致病的所有变异。
  3. 通过 in silico 预测工具 Splicing-based Analysis of Variants37(SPANR)和 Human Splicing Finder38(HSF,版本 3.0)分析剪接变异。
  4. 若处理大量样本,应比较各样本间的变异调用,以确定哪些变异在多个样本中共享。可通过手动方式或自定义脚本完成,以便检测可能的测序伪影和污染事件。
    注意:对于 ONDRI 的目的,使用自定义脚本通过相互比对 ANNOVAR 输出文件进行注释。该脚本为每个变异添加注释,记录研究队列中携带相同变异的其他样本的受试者 ID,即该变异在研究队列中的历史记录。
  5. 根据美国医学遗传学与基因组学学会(ACMG)致病性指南39对变异进行分类,将每个变异归类为以下之一:1) 致病;2) 可能致病;3) 意义未明变异;4) 可能良性;或 5) 良性。
    注意:对于 ONDRI 的目的,使用内部开发的 Python 脚本半自动执行 ACMG 分类。尽管本研究未使用,InterVar40 是功能类似工具,可类似方式应用。
  6. 对测序覆盖度 <30x 和/或在研究队列中识别出比例超过 >10% 的变异进行 Sanger 测序,以验证其非测序伪影41

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文所述方法应用于已加入ONDRI的528名参与者的DNA样本。这些样本使用ONDRISeq panel进行检测,共运行22批,每批24个样本。总体而言,测序数据质量较高,样本平均覆盖深度为78 ± 13x,所有单个运行批次的平均样本覆盖深度均>30x。此外,平均有94%的目标区域覆盖深度至少达到20x(表1)。

平均有 95.6% 的测序读段比对到参考序列,所有 ONDRISeq 运行中均有 >90% 的读段成功比对(表 1)。在比对成功的读段中,92.0% 的 Phred 质量值 ≥Q30,仅有一个运行的比对读段中达到此质量标准的比例 <80%。然而,该运行仍表现出平均 79x 的覆盖深度,且 93% 的目标区域覆盖深度至少达到 20x。

参数平均值 (±标准差)最佳表现最差表现
簇密度 (x103/mm2)1424 (±269)13471835
总读段数 (106)43.1 (±6.0)48.747.4
比对读段数 (106)40.1 (±6.0)47.125.7
比对读段数 (%)95.6 (±1.3)96.892.6
Phred 质量评分 ≥Q30 (%)92.0 (±6.0)9268.3
样本覆盖深度 (x)78 (±13)9951

表1:ONDRISeq 平台22次运行的测序质量指标。

病例研究:帕金森病患者中罕见变异的鉴定。

为了展示我们靶向下一代测序(NGS)工作流程的实用性,我们以一名68岁男性帕金森病患者为例进行说明。该DNA样本与其他23个ONDRI样本一起,在NGS台式仪器(材料表)上使用ONDRISeq检测 panel 进行测序。此次测序运行的簇密度为1,555 × 103/mm2。该患者的样本平均覆盖深度为76×,其中93.9%的目标区域覆盖深度至少达到20×。

在使用定制的生物信息学流程进行变异检测和注释后,发现该患者在ONDRISeq检测面板所包含的80个基因的外显子及其上下游250 bp范围内共有1351个变异位点。然而,如上所述,ANNOVAR分析流程通过考虑变异的序列本体(sequence ontology)和等位基因频率(MAF),成功减少了需分析的变异数量,最终得到7个需进行人工审校的变异位点(图3)。在这7个变异中,有两个被认定可能具有临床意义。该筛选流程针对ONDRI的具体需求而设计,筛选标准包括:在普通人群中相对罕见、在本体上为非同义突变(nonsynonymous),因而会导致蛋白质序列改变。此外,还综合考虑了该变异是否曾被报道与疾病相关、in silico 预测其对蛋白质功能的有害性,以及根据ACMG标准对变异进行的致病性分类。

从筛选后的列表中首先识别出的一个变异是杂合变异,即 LRRK2:c.T3939A,导致无义变异 p.C1313*。LRRK2 编码富含亮氨酸重复序列的激酶2(Leucine-Rich Repeat Kinase 2),该蛋白具有GTP酶和激酶活性42。此外,已知该基因内的突变是家族性帕金森病的主要致病原因之一43。该变异在 LRRK2 基因中引入了一个提前终止密码子,从而缺失了第1314–2527位的氨基酸残基。这阻碍了蛋白的Ras of complex proteins(Roc)、Roc的C端(COR)以及蛋白激酶结构域的翻译,这些结构域分别参与作为非典型Rho GTP酶、GTP结合蛋白和蛋白激酶的功能。该变异经CADD(CADD Phred = 36)生成的in silico分析预测为有害。该变异极为罕见,在ExAC和ESP数据库中的等位基因频率(MAF)分别为0.004%和0.01%,且在1000G数据库中未见记录。此外,在所有528例测序患者中,仅此一例携带该变异,且该变异为新发,此前未在疾病突变数据库中报道过(材料表)。该变异检测结果的可信度由其109倍的高深度测序覆盖得以确认。最后,根据AMCG致病性评估标准与指南,该变异被归类为致病性变异。

该患者还携带一个杂合性变异, NR4A2:c.C755A,导致错义改变p.P252Q。该突变影响由 NR4A2,核受体亚家族4组A成员2,是一种参与多巴胺能神经元生成的转录因子44 该基因内的突变此前已被关联到帕金森病45将非极性的脯氨酸替换为极性的谷氨酰胺,据预测具有破坏性 in silico 通过CADD(CADD Phred = 21.1)预测分析提示该变异可能具有致病性,但SIFT和PolyPhen-2分析未提示致病性。该变异罕见,在ExAC数据库中的等位基因频率(MAF)为0.004%,在ESP和1000G数据库中均未检出。该变异亦在一名被诊断为血管性认知障碍的ONDRI参与者中被发现,但此前未在疾病突变数据库中报道。该变异的测序覆盖深度仅为18x,因此将进行Sanger测序以确认其序列准确性。最后,根据ACMG致病性评估标准与指南,该变异被判定为临床意义未明。

ONDRISeq 面板和生物信息学分析流程还能够确定每个样本的APOE基因型。该患者被确定为具有APOE E3/E3 基因型。

基因突变数据表、染色体分析、基因变异鉴定、结果比较
图3:ANNOVAR 显示经人工审校并注释的变异位点的简化输出示例。 该输出来自一名68岁男性帕金森病患者的案例研究。经注释的变异位点经过人工筛选,以识别最可能具有临床意义的变异,如红色框所示。 请点击此处查看该图的放大版本。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

从DNA样本提取到识别可能与患者诊断、疾病进展及潜在治疗方案相关的变异位点的过程中,必须认识到测序及正确数据处理所需方法的多样性。本文所述方案即为靶向高通量测序(NGS)及其后续生物信息学分析的应用实例,这对于识别具有潜在临床意义的罕见变异至关重要。具体而言,我们介绍了ONDRI基因组学小组在使用ONDRISeq定制设计的NGS panel时所采用的技术路线。

众所周知,这些方法是基于特定的下一代测序(NGS)平台开发的,而其他测序平台和靶向富集试剂盒也可能被使用。然而,本研究所选用的NGS平台及台式仪器(材料表)因其较早获得美国食品药品监督管理局(FDA)批准46而被选定。该授权反映了所选NGS方案能够实现高质量的测序,以及测序读长具有高度可靠性。

尽管获得具有足够覆盖深度的准确测序读段非常重要,但最终稀有变异分析所需的生物信息学处理同样关键,且可能需要大量计算资源。由于测序过程中可能存在多种错误来源,一个稳健的生物信息学流程必须能够校正可能引入的各种不准确性。这些错误可能源于比对过程中的错配、文库制备中PCR扩增引入的扩增偏好性,以及测序技术本身产生的测序假象47。无论使用何种软件进行读段比对和变异检测,都存在一些通用的方法来减少这些错误,包括局部重比对、去除重复比对的读段,以及在变异检测时设置适当的质控参数。此外,变异检测过程中选择的参数可能因具体研究需求的不同而有所调整11。本文所采用的变异位点及其周围核苷酸的最低覆盖深度和质量分数,旨在在特异性和灵敏度之间取得合理平衡。这些参数已通过与三种独立遗传学技术的变异检测结果一致性分析在ONDRISeq panel上得到验证,如前所述,包括:1)基于芯片的基因分型;2)等位基因 discrimination 检测;以及 3)Sanger测序9

在准确的变异检测之后,为了确定具有潜在临床意义的变异,注释和审编至关重要。由于其开放获取的平台,ANNOVAR 是进行变异注释以及初步筛选或排除变异的优秀工具。除了易于获取之外,无论使用何种测序平台生成的数据,ANNOVAR 均可应用于任何 VCF 文件,并且可根据研究需求进行定制26

注释完成后,必须对变异进行解读,以确定其是否具有临床意义。这一过程不仅复杂,而且常常容易受到主观判断和人为错误的影响。为此,美国医学遗传学与基因组学学会(ACMG)制定了评估任何变异致病性证据的指导原则。我们采用一种基于非同义、罕见变异的手动人工审编方法,该方法依据上述指南构建,并通过定制设计的Python脚本对能够通过分析流程的每一个变异进行 individually 评估,从而根据指南对变异进行分类,确保审编过程的安全性。通过这种方式,每个变异将被赋予“致病性”、“可能致病性”、“意义未明”、“可能良性”或“良性”的评级,从而使变异审编过程实现标准化和透明化。需要认识到的是,变异审编的具体细节在生物信息学流程之外,将根据研究的具体需求进行个性化调整,因此超出了本文所介绍方法学的范围。

尽管本文介绍的方法是针对ONDRI的,但所述步骤在考虑大量感兴趣的遗传性疾病时同样适用。随着许多表型相关的基因关联数量不断增加,靶向NGS能够采用一种基于假设的研究方法,充分利用该领域已有的前期研究成果。然而,靶向NGS及其所采用的方法仍存在局限性。由于仅聚焦于基因组的特定区域,其发现范围仅限于目标区域内的新等位基因。因此,那些未被测序靶点覆盖的新基因或其他基因组位点——这些可能通过全基因组测序(WGS)或全外显子组测序(WES)方法被发现——将无法被识别。此外,基因组中某些区域使用NGS技术进行准确测序仍存在困难,例如含有高度重复序列48的区域或富含GC碱基的区域49。幸运的是,在使用靶向NGS时,通常事先对正在测序的基因组区域已有较深入的了解,因此可以预判这些区域是否可能带来技术挑战。最后,目前从NGS数据中检测拷贝数变异尚未实现标准化50。然而,针对这些问题的生物信息学解决方案可能即将出现;新的计算工具或将有助于分析ONDRI患者中这些额外类型的遗传变异。

尽管存在一定的局限性,靶向高通量测序(NGS)在假设驱动的研究框架下仍能获得高质量的数据,且成本低于全基因组测序(WGS)和全外显子组测序(WES)。该方法不仅适用于高效、定向的研究,其在临床中的应用也正呈指数级增长。该技术被用于探究多种疾病相关分子通路中的诸多问题,并正在发展成为一种相较于WES和WGS成本较低但准确性高的诊断工具。即使与作为金标准的Sanger测序相比,靶向NGS在时间和成本效率方面也具有竞争优势。因此,对于接收并使用NGS数据的科研人员或临床医生而言——例如在实验室或临床报告中以文本形式呈现的数据——理解其结果背后复杂的"黑箱"过程至关重要。本文所介绍的方法将有助于用户理解NGS数据生成与解读背后的基本流程。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们感谢所有ONDRI参与者同意并配合本研究。感谢ONDRI研究人员(www.ONDRI.ca/people),包括我们的主要研究者(MJS)以及ONDRI管理委员会:执行委员会、指导委员会、出版委员会、招募委员会、评估平台团队和项目管理团队。我们还感谢伦敦区域基因组中心提供的专业技术支持。AAD获得了伦敦及米德尔塞克斯阿尔茨海默病协会硕士研究生研究奖学金的资助。SMKF获得了加拿大肌萎缩侧索硬化症协会Tim E. Noël博士后奖学金的资助。

材料

本文使用的材料清单
姓名公司目录编号评论
4 mL EDTA K2 管Fisher Scientific02-689-4
1 M Tris 缓冲液Bio Basic Canada Inc.SD8141
Gentra Puregene 血液试剂盒Qiagen1583891,000 mL 试剂盒。此为步骤 1.3 中提到的血液提取试剂盒。
NanoDrop-1000 分光光度计Thermo Fisher ScientificND-2000已被 NanoDrop-2000 分光光度计取代。此为全光谱分光光度计,见于步骤 1.4 和 2.1.2。
Qubit 2.0 荧光计InvitrogenQ32866适用于 DNA 定量的荧光计,见于步骤 2.1.4、2.1.6、2.2.3 和 3.1.3。
Nextera Rapid Custom Capture 富集试剂盒Illumina, Inc.FC-140-1009专为 ONDRISeq 面板设计,用于测序 80 个基因的外显子,产生长度为 150 个碱基的双端读长,共 971,388 个碱基对序列;每试剂盒可处理 288 个样本。此为目标富集试剂盒,见于步骤 2.2、2.2.2、2.2.3、3.1.5、3.1.6、3.4.1 及讨论部分。
2100 BioAnalyzerAgilent TechnologiesG2939BA自动化电泳系统,见于步骤 3.1.4。
高灵敏度 DNA 试剂盒Agilent Technologies5067-4626每试剂盒可处理 110 个样本;此为 DNA 质量分析试剂盒,见于步骤 3.1.4。 
MiSeq 试剂盒 v3Illumina, Inc.MS-102-3003600 个循环试剂盒;此为 NGS 台式仪器试剂盒,见于步骤 3.1。
MiSeq 个人基因组测序仪Illumina, Inc.SY-410-1003NGS 台式仪器,见于步骤 2.2.1、3.1、3.1.1、3.1.2、3.1.8、3.2、4.2.6、代表性结果及讨论部分。
Experiment ManagerIllumina, Inc.NGS 技术软件,见于步骤 3.1.1 及 图 1。https://support.illumina.com/sequencing/sequencing_software/experiment_manager/downloads.html
BaseSpaceIllumina, Inc.SW-410-1000基于云的计算环境,见于步骤 3.1.2、3.2、3.3、3.3.1、3.3.2、3.4、3.4.1、3.4.2 和 3.4.3。https://basespace.illumina.com/
CLC Genomics Workbench 10.1.1Qiagen832000也可使用开源选项进行数据预处理,以模拟本方案中的工作流程。此为用于数据预处理的软件,见于第 4 步全过程及 图 2。 
Annotate Variationhttp://annovar.openbioinformatics.org/en/latest/user-guide/download/
RefSeq美国国家生物技术信息中心https://www.ncbi.nlm.nih.gov/refseq/
dbSNP138美国国家生物技术信息中心https://www.ncbi.nlm.nih.gov/projects/SNP/snp_summary.cgi?view+summary=view+summary&build_id=138
外显子组聚合联盟Broad 研究所http://exac.broadinstitute.org/
美国国家心肺血液研究所外显子组测序项目欧洲队列华盛顿大学和 Broad 研究所http://evs.gs.washington.edu/EVS/
ClinVar美国国家生物技术信息中心https://www.ncbi.nlm.nih.gov/clinvar/
联合注释依赖性耗竭评分(CADD)华盛顿大学和 Hudson-Alpha 生物技术研究所http://cadd.gs.washington.edu/
从耐受性中区分不耐受变异(SIFT)J. Craig Venter 研究所http://sift.jcvi.org/
PolyPhen-2Brigham and Women's 医院,哈佛医学院http://genetics.bwh.harvard.edu/pph2/
人类基因突变数据库Qiagen834050疾病突变数据库,见于步骤 5.2 和代表性结果部分。https://portal.biobase-international.com/cgi-bin/portal/login.cgi?redirect_url=/hgmd/pro/start.php
基于剪接的变异分析工具多伦多大学 Frey 实验室http://tools.genes.toronto.edu/
人类剪接位点分析工具(Human Splicing Finder)Aix Marseille Universitéhttp://www.umd.be/HSF3/HSF.shtml
其他材料
离心机
一次性移液管

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Metzker, M. L. Sequencing technologies - the next generation. Nat Rev Genet. 11 (1), 31-46 (2010).
  2. Mardis, E. R. Next-generation DNA sequencing methods. Annu Rev Genomics Hum Genet. 9, 387-402 (2008).
  3. Shendure, J., Ji, H. Next-generation DNA sequencing. Nat Biotechnol. 26 (10), 1135-1145 (2008).
  4. Sanger, F., Nicklen, S., Coulson, A. R. DNA sequencing with chain-terminating inhibitors. Proc Natl Acad Sci U S A. 74 (12), 5463-5467 (1977).
  5. Farhan, S. M. K., Hegele, R. A. Exome Sequencing: New Insights into Lipoprotein Disorders. Current Cardiology Reports. 16 (7), (2014).
  6. Choi, M., et al. Genetic diagnosis by whole exome capture and massively parallel DNA sequencing. Proc Natl Acad Sci U S A. 106 (45), 19096-19101 (2009).
  7. Mardis, E. R. DNA sequencing technologies: 2006-2016. Nat Protoc. 12 (2), 213-218 (2017).
  8. Farhan, S. M., et al. The Ontario Neurodegenerative Disease Research Initiative (ONDRI). Can J Neurol Sci. 44 (2), 196-202 (2017).
  9. Farhan, S. M. K., et al. The ONDRISeq panel: custom-designed next-generation sequencing of genes related to neurodegeneration. NPJ Genom Med. (16032), 1-11 (2016).
  10. El-Metwally, S., Hamza, T., Zakaria, M., Helmy, M. Next-generation sequence assembly: four stages of data processing and computational challenges. PLoS Comput Biol. 9 (12), e1003345(2013).
  11. Yohe, S., Thyagarajan, B. Review of Clinical Next-Generation Sequencing. Arch Pathol Lab Med. , (2017).
  12. Qiagen. Gentra Puregene Handbook. , 4th edn, (2014).
  13. NanoDrop Technologies, Inc. Spectrophotometer V3.5 User's Manual. , (2007).
  14. Invitrogen by Life Technologies. Qubit 2.0 Fluorometer User Manual. Vol. Q32866. , (2010).
  15. Illumina, Inc. Nextera Rapid Capture Enrichment Guide. , Vol. 15037436 v01 (2016).
  16. Illumina, Inc. Nextera Rapid Capture Enrichment Reference Guide. , Vol. 15037436 v01 (2016).
  17. Rev. B. Illumina, Inc. MiSeq Reagent Kit v3 Reagent Preparation Guide. , Vol. 15044932 Rev. B (2013).
  18. Illumina, Inc. MiSeq System Guide. , Vol. 15027617 v01 (2015).
  19. BaseSpace Sequence Hub. , https://basespace.illumina.com/dashboard (2017).
  20. Rev. B. Agilent Technologies. Agilent High Sensitivity DNA Kit Guide. , Vol. G2938-90321 (2013).
  21. Illumina, Inc. MiSeq System Denature and Dilute Libraries Guide. , Vol. 15039740 v01 (2016).
  22. Illumina, Inc. System Specification Sheet: MiSeq System. , (2016).
  23. BaseSpace Sequence Hub Help Center. , Available from: https://help.basespace.illumina.com/ (2017).
  24. Qiagen. Genomics Workbench 10.1.1 User Manual. , (2017).
  25. Ebbert, M. T., et al. Evaluating the necessity of PCR duplicate removal from next-generation sequencing data and a comparison of approaches. BMC Bioinformatics. 17, Suppl 7. 239(2016).
  26. Wang, K., Li, M., Hakonarson, H. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data. Nucleic Acids Res. 38 (16), e164(2010).
  27. Leary, N. A., et al. Reference sequence (RefSeq) database at NCBI: current status, taxonomic expansion, and functional annotation. Nucleic Acids Res. 44 (D1), D733-D745 (2016).
  28. Kitts, A., Phan, L., Ward, M., Bradley Holmes, J. The Database of Short Genetic Variation (dbSNP). , National Center for Biotechnology Information. Bethesda, MD. (2013).
  29. Lek, M., et al. Analysis of protein-coding genetic variation in 60,706 humans. Nature. 536 (7616), 285-291 (2016).
  30. Exome Variant Server, NHLBI GO Exome Sequencing Project (ESP). , http://evs.gs.washington.edu/EVS/ (2017).
  31. Auton, A., et al. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  32. Landrum, M. J., et al. ClinVar: public archive of interpretations of clinically relevant variants. Nucleic Acids Res. 44 (D1), D862-D868 (2016).
  33. Kircher, M., et al. A general framework for estimating the relative pathogenicity of human genetic variants. Nat Genet. 46 (3), 310-315 (2014).
  34. Kumar, P., Henikoff, S., Ng, P. C. Predicting the effects of coding non-synonymous variants on protein function using the SIFT algorithm. Nat Protoc. 4 (7), 1073-1081 (2009).
  35. Adzhubei, I. A., et al. A method and server for predicting damaging missense mutations. Nat Methods. 7 (4), 248-249 (2010).
  36. Bertram, L., McQueen, M. B., Mullin, K., Blacker, D., Tanzi, R. E. Systematic meta-analyses of Alzheimer disease genetic association studies: the AlzGene database. Nat Genet. 39 (1), 17-23 (2007).
  37. Xiong, H. Y., et al. The human splicing code reveals new insights into the genetic determinants of disease. Science. 347 (6218), (2015).
  38. Desmet, F. O., et al. Human Splicing Finder: an online bioinformatics tool to predict splicing signals. Nucleic Acids Res. 37 (9), e67(2009).
  39. Richards, S., et al. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology. Genet Med. 17 (5), 405-424 (2015).
  40. Li, Q., Wang, K. InterVar: Clinical Interpretation of Genetic Variants by the 2015 ACMG-AMP Guidelines. Am J Hum Genet. 100 (2), 267-280 (2017).
  41. Yang, Z. L., Sun, G. L. High-frequency, low-coverage "false positives" mutations may be true in GS Junior sequencing studies. Scientific Reports. 7, (2017).
  42. Gandhi, P. N., Wang, X., Zhu, X., Chen, S. G., Wilson-Delfosse, A. L. The Roc domain of leucine-rich repeat kinase 2 is sufficient for interaction with microtubules. J Neurosci Res. 86 (8), 1711-1720 (2008).
  43. Goldwurm, S., et al. The G6055A (G2019S) mutation in LRRK2 is frequent in both early and late onset Parkinson's disease and originates from a common ancestor. J Med Genet. 42 (11), e65(2005).
  44. Caiazzo, M., et al. Direct generation of functional dopaminergic neurons from mouse and human fibroblasts. Nature. 476 (7359), 224-227 (2011).
  45. Grimes, D. A., et al. Translated mutation in the Nurr1 gene as a cause for Parkinson's disease. Mov Disord. 21 (7), 906-909 (2006).
  46. Collins, F. S., Hamburg, M. A. First FDA authorization for next-generation sequencer. N Engl J Med. 369 (25), 2369-2371 (2013).
  47. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinformatics. 43, 11-33 (2013).
  48. Treangen, T. J., Salzberg, S. L. Repetitive DNA and next-generation sequencing: computational challenges and solutions. Nat Rev Genet. 13 (1), 36-46 (2011).
  49. Shin, S., Park, J. Characterization of sequence-specific errors in various next-generation sequencing systems. Mol Biosyst. 12 (3), 914-922 (2016).
  50. Povysil, G., et al. panelcn.MOPS: Copy-number detection in targeted NGS panel data for clinical diagnostics. Hum Mutat. 38 (7), 889-897 (2017).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

ONDRISeq FASTQ

相关文章