方法文章

靶向二代测序与生物信息学分析流程用于评估先天性疾病的遗传决定因素

36.3K 次观看

DOI:

10.3791/57266

2018年4月4日

本文内容

摘要

靶向二代测序是一种高效且经济的方法,正日益广泛应用于疾病研究和临床诊断。本文所述方案介绍了用于测序的复杂工作流程,以及用于识别致病遗传变异的生物信息学分析过程。

摘要

下一代测序(NGS)正在迅速变革对先天性疾病遗传决定因素的研究方式。该技术效率极高,可在较短时间内以相对较低的成本产生数百万条测序读长。特别是靶向NGS能够将研究聚焦于与特定疾病相关的基因组区域。这不仅进一步降低了成本并加快了分析速度,还减轻了通常伴随NGS而来的计算负担。尽管靶向NGS仅限于基因组的特定区域,因而无法发现潜在的新功能位点,但对于已知存在遗传关联且表型和遗传异质性较强的疾病而言,该技术是一种极为有效的手段。由于测序技术本身具有复杂性,因此必须严格遵循实验方案和方法,以获得高覆盖度和高质量的测序读长。此外,在获得测序读长后,需采用复杂的生物信息学流程,将读长准确比对至参考基因组、识别变异位点,并确保这些变异通过质量评估指标。变异还需根据其临床意义进行注释和审编,这一过程可通过应用美国医学遗传学与基因组学学会(ACMG)致病性指南实现标准化。本文所述方法将以ONDRISeq神经退行性疾病测序 panel 为模型,展示利用靶向测序 panel 生成和分析NGS数据的各个步骤,以识别可能具有临床意义的变异位点。

引言

随着确定各类疾病的遗传决定因素在科研和临床实践中日益受到重视,新一代测序技术(NGS)正成为实现这一目标的高通量且经济高效的重要工具1,2,3。近40年来,桑格测序一直是鉴定遗传变异的金标准4;然而,对于具有遗传异质性或遗传病因尚未明确的疾病,往往需要同时评估大量可能的候选基因。在此情况下,桑格测序变得昂贵且耗时。相比之下,NGS通过对数百万条DNA片段进行大规模并行测序,能够在全基因组多个区域同时高效、低成本地检测多种类型的遗传变异。

DNA测序的下一代测序(NGS)技术有三种类型:1)全基因组测序(WGS),2)全外显子组测序(WES),以及3)靶向测序5。WGS用于评估个体的全部基因组内容,而WES仅对基因组中的蛋白质编码区域进行测序6。相比之下,靶向测序则聚焦于基因组中特定的区域,这些区域通常基于少数由共同病理机制或已知临床表型关联的特定基因。通过该方法,可以指定一个或一组特定基因的外显子、内含子或任何基因间区域。因此,当已有明确的候选基因与目标疾病相关时,靶向测序可成为一种极佳的选择。通过靶向基因组的特定区域,能够排除冗余和无关的遗传变异,从而避免对临床解读造成干扰或混淆。尽管WGS和WES均可产生大量高质量的数据,但数据量可能过于庞大。这不仅需要计算密集型的生物信息学分析,还常常带来数据存储方面的难题7。数据存储的挑战也进一步增加了WGS和WES的额外成本,而这一点在计算测序费用时往往未被充分考虑。此外,尽管成本正在下降,WGS和WES的费用仍然相对较高。相比之下,当需要对大量个体进行测序时,靶向测序可能是一种更具成本效益的选择。

安大略神经退行性疾病研究计划(Ontario Neurodegenerative Disease Research Initiative, ONDRI)是一项多平台、覆盖全省的观察性队列研究,旨在对五种神经退行性疾病进行表征,包括:1)阿尔茨海默病与轻度认知障碍,2)肌萎缩侧索硬化症,3)额颞叶痴呆,4)帕金森病,以及 5)血管性认知障碍8。ONDRI 基因组学小组致力于在该队列基线特征描述中阐明常被忽视却极为重要的遗传背景,这些疾病在表型和遗传上均具有高度异质性。因此,神经退行性疾病是下一代测序(NGS)技术,尤其是靶向测序方法的适宜研究对象。

我们专门设计了一种靶向NGS panel——ONDRISeq,用于对参与ONDRI项目的528名受试者进行测序,覆盖了先前与五种目标疾病相关的80个基因的蛋白质编码区。通过该方法,我们能够以集中且高效的方式利用高质量的NGS数据。ONDRISeq panel的设计及验证已通过多项一致性研究进行过描述,在用于panel验证的216个病例中,ONDRISeq panel能够识别出72.2%的具有潜在临床意义的新型罕见变异9。尽管近年来NGS技术取得了迅速而显著的进步,许多研究人员在将原始数据处理为可用的、带有注释的变异列表时仍面临挑战10。此外,变异的解读可能十分复杂,尤其是当面对大量罕见或新型变异时11

本文以 ONDRISeq 研究为例,逐步介绍靶向高通量测序(NGS)的方法学以及相关的生物信息学工作流程,该流程用于重测序、变异检测和变异注释。在生成 NGS 数据后,必须将原始测序文件比对至人类参考基因组,以准确识别变异。随后需对变异进行注释,以便开展后续的变异审编。我们还将阐述如何应用美国医学遗传学学会(American College of Medical Genetics)的标准与指南,以准确分类变异的致病性。

方案

对于ONDRI项目,伦理协议和知情同意书的获取依据以下机构的研究伦理委员会规定:Baycrest老年护理中心(加拿大安大略省多伦多市);成瘾与心理健康中心(加拿大安大略省多伦多市);Elizabeth Bruyère医院(加拿大安大略省渥太华市);Hamilton综合医院(加拿大安大略省汉密尔顿市);London健康科学中心(加拿大安大略省伦敦市);麦克马斯特大学(加拿大安大略省汉密尔顿市);渥太华医院(加拿大安大略省渥太华市);Parkwood医院(加拿大安大略省伦敦市);圣迈克尔医院(加拿大安大略省多伦多市);Sunnybrook健康科学中心(加拿大安大略省多伦多市);以及大学健康网络-多伦多西区医院(加拿大安大略省多伦多市)。

1. 从人血样本中分离DNA

  1. 根据适当的伦理协议和知情同意书,从测序参与者中采集样本。
    1. 为获得高质量的DNA,采集血液样本用于提取。
      注意:DNA也可从唾液或口腔黏膜细胞中提取,需确保使用适当的DNA提取试剂盒。
    2. 若从血液中提取,为获得较高的DNA得率,应使用三根4 mL的EDTA K2采血管采集样本,总样本体积约为12 mL。
    3. 将血液样本在750 × g条件下离心20分钟,分离为上层血浆、中间薄层的白细胞层和下层的红细胞层。
  2. 使用一次性移液管将血浆从血液样本顶部吸除。妥善丢弃血浆,或将其分装为多个500 µL等分试样,于-80 °C保存,以备将来进行生化分析。确保每个样本均使用新的无菌移液管。
  3. 按照制造商说明书,使用血液DNA提取试剂盒12材料表)从血液样本中提取DNA。
    注意:若获得上述体积的样本,可得到约3 mL的白细胞用于DNA提取。
  4. 按照制造商说明书,使用全光谱分光光度计13材料表)测定初始DNA浓度(单位:ng/µL)。
  5. 直接进入第2步。或者,将DNA在4 °C条件下保存。

2. 测序文库制备

  1. 在三天内对DNA样本进行连续稀释,以获得5.0的最终浓度 ± 1.0 ng/µL.
    1. 将 1 M Tris 缓冲液(pH 8.5)稀释至 10 µM 用去离子水。
      注意:稀释的体积取决于后续步骤中需要稀释的DNA样本数量。
    2. 若在步骤1.4之后直接进行DNA稀释,请继续执行以下步骤。若不在同一天进行,则需按照步骤1.4中的方法重新测定DNA浓度。
    3. 根据测得的浓度进行稀释 40 µL DNA 的量约为 10 ng/µL 使用 10 µM Tris 缓冲液 pH 8.5,将样品在该缓冲液中室温静置过夜 4 °C.
    4. 使用荧光计测定DNA浓度14 适用于DNA的定量材料表),按照制造商的说明进行。
      注意:样品的浓度应为 >10 ng/µL 由于先前使用的分光光度计灵敏度较低。
    5. 根据测得的浓度进行稀释 20 µL DNA 的量至 10 ng/µL 使用 10 µM Tris 缓冲液 pH 8.5,于该缓冲液中室温静置过夜 4 °C.
    6. 使用荧光计测定DNA浓度14,按照制造商的说明进行。
    7. 根据测得的浓度进行稀释 10 µL DNA 的量至 5 ng/µL 使用 10 µM Tris-HCl pH 8.5 中孵育,4℃过夜 4 °C.
  2. 根据目标NGS panel配套的目标富集试剂盒的制造商说明书制备测序文库15 (材料表)。确保所用富集试剂盒适用于正在使用的NGS平台。
    1. 遵循制造商的说明16 关于文库的复杂性与合并。
      注意:对于 ONDRISeq,文库由 12 个 DNA 样本组成,每两个样本为一组进行混合,并在 NGS 台式仪器上运行材料表单次反应中可运行的样本数量取决于所使用的测序试剂盒和测序平台。
    2. 为获得更高质量的测序数据,请根据目标富集试剂盒的说明书,选择性执行标签化(tagmentation)后DNA文库质量验证的可选步骤。15.
      1. 每个文库均需进行三次重复分析,以确保文库产量的质量。
    3. 若合并文库,使用荧光计测量DNA浓度14,按照制造商说明书操作。使用该浓度确定每种DNA文库的混合体积,以获得目标富集试剂盒推荐的等摩尔比例。

3. 下一代测序

  1. 根据NGS台式仪器配套试剂盒制造商的说明对文库进行测序17,18(材料表)。
    1. 使用适当的NGS技术软件(材料表)按照制造商说明18准备样本表,并将其导入NGS台式仪器的工作流程中。
      注:对于ONDRISeq而言,应选择“其他”应用选项,并仅请求生成FASTQ文件(图1)。后续步骤将处理这些FASTQ文件,以便完全自定义比对和质量参数。然而,如果选择靶向测序,某些NGS仪器可自行将测序数据处理为VCF文件。有关完整选项,请参考制造商说明18
    2. 若使用基于云的计算环境19材料表),在设置测序运行时进行登录。此操作应在NGS台式仪器主页点击“测序”后进行。
    3. 按照制造商说明18完成文库变性后,使用荧光计14测定DNA文库浓度。
    4. 按照制造商说明,使用合适的自动电泳系统和DNA质量分析试剂盒20材料表)验证DNA文库质量。
    5. 为将DNA浓度从ng/µL转换为nM,请使用以下公式16
      figure-protocol-1
      注:平均文库大小取决于所使用的靶向富集试剂盒,可通过步骤3.1.4中观察到的电泳图谱获得。
    6. 根据制造商说明21,将测序文库稀释至适当的终浓度(6–20 pM)和体积(600 μL)。
      注:所需确切浓度取决于所用测序试剂盒。请咨询富集试剂盒制造商以确定合适的上样浓度。
    7. 按照制造商说明21,对阳性对照测序文库进行稀释、变性并加入测序反应中。
    8. 记录每次测序运行的详细信息,包括上样的DNA文库浓度(pM)、添加的阳性对照百分比、试剂盒条形码、步骤3.1.1中选择的应用、index读取数、所用富集试剂盒、读长以及样本表名称。
      注:NGS台式仪器的运行时间取决于仪器型号、所用富集试剂盒及选择的读长(本实验所用测序仪的运行时间为4–56小时22)。
  2. 测序运行完成后,通过访问NGS台式仪器主页并点击“管理文件”,进入“运行文件夹”以获取所有输出文件。将文件移至本地驱动器以便后续访问。另一种方式是在计算机上通过导航面板选择“运行”,在基于云的计算环境中19查找相应文件。选择适当的测序运行以进入运行摘要页面,点击“下载”以从云端获取数据。在弹出的对话框中,选择FASTQ文件作为下载文件类型,然后点击“下载”。
  3. 在基于云的计算环境的运行摘要页面19,23,点击“图表”以分析由计算环境生成的各种图形,评估测序运行的质量。有关各图形的详细信息,请参阅制造商说明23
    1. 在运行图表页面,找到标注为“按循环数据”的图表。在图表类型中选择“强度”,在通道中选择“所有通道”。确保生成的信号强度图与以往使用相同富集试剂盒和NGS台式仪器进行的测序运行结果相似。
      注:该图反映每个碱基在全部150个循环中的信号强度百分比。由于不同富集试剂盒可能导致显著差异,因此必须与同一批次以往测序运行结果进行比较。
    2. 在运行导航面板中选择“Indexing QC”标签,查看位于页面右侧的indexing质量控制(QC)直方图。确保所有样本的% Reads Identified (PF) 分布相对均匀。
      注:若某些样本的% Reads Identified (PF) 显著低于其他样本,需注意测序数据质量可能受到影响。
  4. 在基于云的计算环境的运行摘要页面,点击运行导航面板中的“指标”以查看质量指标。
    注:指标的阈值取决于所使用的测序平台和富集试剂盒。根据制造商说明23,可使用多种指标进行质量评估,以下步骤重点介绍三个强烈推荐用于质量控制的指标。
    1. 在“密度(K/MM2)”项下,确保簇密度处于所用富集试剂盒推荐范围内(本例中为1,200–1,400 K/mm2)。
    2. 在总“%≥Q30”项下,确保数值≥85%,以反映测序读段的质量。
      注:若低于85%的阈值,需注意测序质量可能受损。
    3. 在“比对率(%)”项下,确保该值与测序运行中加入的阳性对照百分比相近。
      注:此指标用于评估阳性对照的表现,表示仅有该比例的总读段能比对到阳性对照基因组。例如,若使用了1%的阳性对照,则预期比对率(%)约为1–5%。

figure-protocol-2
图1:NGS 技术软件(材料表)样本表创建器应用程序选项的截图。 针对 ONDRISeq 的应用,仅使用 FASTQ 文件生成选项。然而,如果用户希望生成其他类型的文件(例如 VCF 文件),建议选择靶向重测序类别中的某个应用程序。请点击此处查看此图的放大版本。

4. 重测序与变异检测

  1. 数据预处理时,选择合适的软件将原始 FASTQ 文件比对至人类参考基因组并进行变异检测(材料表)。
  2. 将 FASTQ 测序读段导入数据预处理软件。
    注意:对于 ONDRISeq,单次测序运行产生的 24 个样本共 48 个 FASTQ 文件将被导入并经由该软件处理。一次处理的样本数量可根据研究人员需求及 NGS 面板的大小而变化。
    1. 在“导航区”中右键单击,选择“新建文件夹”。将文件夹命名以清晰反映所执行的测序运行信息。
    2. 从顶部工具栏中选择“导入”。在显示的测序平台下拉列表中,选择实际使用的测序平台。
      注意:对于 ONDRISeq,选择“Illumina”。若使用其他测序平台,请参考制造商说明完成后续 FASTQ 文件导入步骤24
    3. 在弹出的对话框中,浏览并选择当前处理的测序运行所产生的 FASTQ 文件。若计算机包含多个服务器,请确保待导入文件存储于本地驱动器并从本地驱动器导入。
    4. 在对话框的“常规选项”中,若测序采用双端测序化学方法,则勾选“配对读段”选项。
      注意:在此情况下,每个样本应导入两个 FASTQ 文件——一个正向读段和一个反向读段。
    5. 在对话框的“配对读段信息”部分,若文件列表中正向读段 FASTQ 文件位于反向读段之前,则选择“双端(正向-反向)”;若顺序相反,则选择“成对(反向-正向)”。将配对读段最小距离设为 1,最大距离设为 1000,以便检测样本序列中的小规模结构重排。
    6. 在对话框的“Illumina 选项”中,选择“去除失败读段”,以移除测序失败的读段。若 NGS 台式仪器在导出 FASTQ 文件前已完成数据解复用,则不要勾选“MiSeq 解复用”选项。
    7. 在“质量评分”下拉列表中,选择用于测序的 NGS 流程。点击对话框底部的“下一步”。
      注意:所选流程将影响 FASTQ 文件质量评分的格式。有关应选择哪个流程的更多信息,请参阅制造商说明24
    8. 在新弹出的对话框中,选择“保存”并“为每个批次单元创建子文件夹,以将每个样本的 FASTQ 文件分别存入独立文件夹”。点击对话框底部的“下一步”。
    9. 在新弹出的对话框中,选择步骤 4.2.1 中创建的文件夹,作为 FASTQ 文件的导入位置。点击对话框底部的“完成”,等待 FASTQ 文件导入完成。点击“进程”标签页以查看文件导入状态。
  3. 根据制造商说明,在软件中设计一个用于重测序和变异检测的工作流程。
    注意:该工作流程可根据研究人员需求调整,但以下步骤涵盖了 ONDRISeq 所采用的内容(图 2)。这些步骤可酌情应用于其他 NGS 重测序和变异检测软件。为保证数据处理与分析的一致性,ONDRI 的所有生物信息学处理均基于人类参考基因组 GRCh37/hg19 进行。
    1. 将测序读段比对至参考基因组。
      1. 配置时选择适当的参考基因组,并确保其与所有生物信息学步骤所用参考基因组一致。
      2. 从“屏蔽模式”下拉列表中选择“无屏蔽”,以确保参考序列中无任何区域被屏蔽。
      3. 使用软件预设的默认比对参数。查阅制造商说明24,确认该设置是否符合研究目的。
    2. 在工作流程中加入局部重比对步骤,以校正读段比对错误,特别是在插入-缺失变异周围区域。
      1. 使用软件预设的默认局部重比对参数。查阅制造商说明24,确认该设置是否符合研究目的。
    3. 去除 NGS 实验流程中 PCR 扩增产生的重复比对读段,以减少 PCR 扩增偏差的影响,避免产生假阳性结果25
      1. 根据研究需求设置“少数序列最大占比(%)”。
        注意:ONDRISeq 采用较宽松的设置为 5%;然而,软件默认设置更为严格,为 20%。当两条读段高度相似时,此参数决定是否将读段数较少的序列视为由 PCR 扩增偏差引起的测序错误。因此,设置为 5% 时,少数读段数必须 ≤ 主要读段数的 5%,才会被修正为与主要读段一致。
    4. 从步骤 4.3.3 生成的读段轨道中导出目标区域的统计信息,格式为覆盖度摘要文本文件。在设置中忽略非特异性匹配和断裂配对。选择本地驱动器上的目标路径存储这些文件。
    5. 从步骤 4.3.3 生成的读段轨道中为每个样本导出二进制序列比对图(BAM)文件。该文件包含序列比对数据,以备将来分析使用。选择本地驱动器上的目标路径存储这些文件。
    6. 选择一种变异检测方法以识别序列中的变异。
      注意:当可对样本倍性做出假设时,建议使用固定倍性变异检测算法,如 ONDRISeq 所采用的方法。若无法做出此假设,请参考制造商说明24,确定最适合研究目的的算法。
      1. 配置时,在固定倍性变异参数选项中,根据样本生物设置适当的倍性。将“所需变异概率”(即变异被正确识别后予以保留的概率)设为 90.0%。
      2. 使用以下推荐的通用过滤器设置:“最小覆盖度”为 10x,“最小计数”为 2,“最小读段频率”为 20%,“忽略断裂配对”,基于“读段”忽略非特异性匹配,以及“最小读段长度”为 20。
        注意:这些参数基于 ONDRISeq 的研究目的设定。请参考制造商说明24,确保其适用于当前研究。
      3. 使用以下推荐的噪声过滤器设置:“碱基质量过滤器”中“邻域半径”映射质量评分为 5,“中心最小质量”映射评分为 20,“邻域最小质量”映射评分为 15;“读段方向过滤器”设为 5.0%;“相对读段方向过滤器”显著性设为 1.0%。
        注意:这些参数基于 ONDRISeq 的研究目的设定。请参考制造商说明24,确保其适用于当前研究。
    7. 根据变异与靶向 NGS 面板目标区域的重叠情况(由 Browser Extensible Data(BED)文件指定)对已识别的变异进行过滤,仅保留出现在靶向 NGS 面板所选基因组区域内的变异。
      注意:BED 文件因所使用的靶向 NGS 面板而异,取决于该面板所能覆盖的基因组区域。
    8. 从步骤 4.3.7 生成的变异轨道中导出变异报告,格式为变异调用格式(VCF)文件。选择本地驱动器上的目标路径存储这些文件。
    9. 根据制造商说明24保存并安装工作流程,使其可在软件的“工具箱”中使用。确保工作流程命名清晰,以便未来明确其适用的 NGS 面板。
      1. 在安装过程中出现包含“导出参考数据”选项的对话框时,将所有选项设置为“捆绑”。
      2. 在安装过程中出现包含“安装位置”选项的对话框时,点击“将工作流程安装到本地计算机”。
  4. 根据制造商说明24,将导入的 FASTQ 测序读段文件运行于步骤 4.3 中定制的生物信息学工作流程中。
    1. 在软件的“工具箱”中找到步骤 4.3 设计的工作流程,并双击启动。
    2. 在弹出的对话框中,于“导航区”内定位步骤 4.2 中导入的 FASTQ 文件文件夹。在“导航区”中选中所有文件夹,然后点击“批次”旁的复选框。使用右向箭头将文件移至“已选元素”。点击对话框底部的“下一步”。
    3. 在对话框中查看“批次概览”,确认已正确选择 FASTQ 文件,然后点击“下一步”。
    4. 在对话框中逐项检查工作流程的以下步骤,确保在步骤 4.3 设计工作流程时已正确选择文件及导出路径:“将读段比对至参考序列”;“去除重复比对读段”;“为目标区域生成统计信息”;“导出 BAM”;“导出制表符分隔文本”;“基于重叠进行过滤”;以及“导出 VCF”。
    5. 在对话框的最后一步——“结果处理”中,选择“保存至输入文件夹”选项。点击对话框底部的“完成”。
      注意:这意味着每个样本生成的文件将被保存至数据预处理软件中存储其对应 FASTQ 文件的同一文件夹内。

figure-protocol-3
图2:在数据预处理软件(材料表)中针对ONDRISeq需求定制的FASTQ文件重测序与变异检测工作流程。 该工作流程中的步骤可根据研究人员的需求,应用于其他NGS重测序和变异检测软件。请点击此处查看此图的放大版本。

5. 变异注释

  1. 下载并自定义注释变异(ANNOVAR)26 用于对每个样本的VCF文件进行变异注释的脚本。
    1. 下载以下 ANNOVAR 数据库以作为注释信息:1) RefSeq27 (2015年8月更新);2) dbSNP13828 (2014年9月更新);3)外显子组聚合联盟29 (ExAC,0.3 版,2015 年 11 月更新);4)美国国家心肺血液研究所外显子测序项目欧洲队列30 (ESP,2015年3月更新);5)1000基因组计划欧洲队列31 (1KGP,2015年8月更新);6)ClinVar32 (2016年3月更新);以及7)联合注释依赖性耗竭33 (计算机辅助药物设计),从耐受性中筛选不耐受性34 (SIFT)和 PolyPhen-235.
      注意:ANNOVAR 引用的基因组坐标及所有数据库均基于人类基因组版本 GRCh37/hg19。此外,所列出的数据库版本为 ONDRISeq 项目使用时的版本;下载数据库时,应使用可获取的最新版本。
    2. 如需,可自定义 ANNOVAR 以输出全部注释变异列表,以及使用 --filter 操作生成的注释变异简化汇编。26.
      注意:该简化列表可根据研究人员的需求进行定制。对于 ONDRISeq 而言,注释变异位点的简化列表中不包含距离最近外显子超过 15 个碱基的变异,或任何次要等位基因频率(MAF) >在以下三个数据库中的任意一个中频率均不超过3%:1) ExAC;2) ESP;和 3) 1KGP。强烈建议执行此步骤。
    3. 如有需要,可根据研究人员的具体需求,自定义 ANNOVAR 以筛选特定的等位基因变异调用26.
      注意:对于 ONDRISeq 而言,ANNOVAR 用于评估所生成的测序结果 APOE 风险等位基因 rs429358(C>T):p.C130R 和 rs7412(C>T):p.R176C 以输出整体结果 APOE 基因型,共有六种可能的组合,包括:1) E2/E2;2) E3/E2;3) E4/E2;4) E3/E3;5) E4/E3;6) E4/E4。在这六种可能中 APOE 基因型中,E4/E4 是晚发性阿尔茨海默病最常见的公认遗传风险因素36.
  2. 查询疾病突变数据库(材料表)以确定变异是否已有合理证据表明与疾病相关。将任何先前未报道过的变异视为新发变异。
    1. 评估来自 ClinVar 的 ANNOVAR 注释,使得与疾病相关的变异包括所有被分类为可能致病或致病的变异。
  3. 通过剪接变体处理 计算机模拟 基于剪接的变异分析预测工具37 (SPANR)和人类剪接位点预测工具38 (HSF,版本 3.0)
  4. 若处理大量样本,应比较各样本间的变异检出结果,以确定不同样本间共有的变异。可通过人工方式或使用自定义脚本完成此步骤,从而有助于识别可能的测序伪影及污染事件。
    注意:针对ONDRI项目,使用自定义脚本通过相互比对ANNOVAR输出文件对其进行注释。该脚本为每个变异位点添加注释,记录研究队列中携带相同变异位点的其他样本的受试者ID,此信息亦称为该变异位点在研究队列中的历史记录。
  5. 根据美国医学遗传学学会(ACMG)致病性指南对变异进行分类39,将每个变异分类为以下之一:1)致病性;2)可能致病性;3)意义未明变异;4)可能良性;或5)良性。
    注意:对于ONDRI项目,使用内部设计的Python脚本在半自动基础上进行ACMG分类。尽管本研究未使用InterVar40 是一种设计相似且可类似使用的工具。
  6. 对测序覆盖度为的任何变异进行Sanger测序 <30x 及/或已鉴定出的变异体 > 研究队列的10%用于验证其并非测序错误产物41.

结果

本文所述方法应用于来自ONDRI研究项目的528名参与者的DNA样本。样本通过ONDRISeq检测面板进行测序,共运行22批,每批24个样本。总体而言,测序数据质量较高,样本平均覆盖深度为78 ± 13倍及所有单个运行的平均样本覆盖度 >30倍。此外,所有目标区域平均有94%被覆盖至少20倍(表1).

平均有95.6%的读段比对到参考序列,所有ONDRISeq运行均具有 >90%的读段比对成功表1。在已比对的读段中,92.0% 的 Phred 质量值 ≥Q30,仅有一个测序运行 <80%的比对读段达到该质量标准。然而,此次测序运行仍显示出平均覆盖深度为79x,且93%的目标区域覆盖深度至少达到20x。

参数平均值 (±标准差)最佳表现最差表现
簇密度 (x103/mm2)1424 (±269)13471835
总读段数 (106)43.1 (±6.0)48.747.4
比对读段数 (106)40.1 (±6.0)47.125.7
比对读段数 (%)95.6 (±1.3)96.892.6
Phred 质量评分 ≥Q30 (%)92.0 (±6.0)9268.3
样本覆盖深度 (x)78 (±13)9951

表1:ONDRISeq上22次测序运行的质量指标。

案例研究:帕金森病患者中罕见变异的鉴定。

为了展示我们靶向下一代测序(NGS)工作流程的实用性,我们以一名68岁男性帕金森病患者为例进行说明。该DNA样本与其他23个ONDRI样本一同在NGS台式仪器(材料表)上使用ONDRISeq panel进行测序。此次测序运行的簇密度为1,555 × 103/mm2。该患者的样本平均覆盖深度为76×,其中93.9%的目标区域覆盖深度至少达到20×。

在使用定制的生物信息学流程进行变异检测和注释后,发现该患者在ONDRISeq检测面板所包含的80个基因的外显子及其上下游250 bp范围内共有1351个变异位点。然而,如上所述,ANNOVAR分析流程通过考虑变异的序列本体(sequence ontology)和等位基因频率(MAF),有效减少了需分析的变异数量,最终获得一个包含7个变异位点的候选列表,这些变异位点随后进行了人工审校(图3)。在这7个变异位点中,有两个被认定可能具有临床意义。该筛选流程针对ONDRI的具体需求而设计,筛选标准包括:在普通人群中相对罕见、在本体上为非同义突变(nonsynonymous),因而会导致蛋白质序列改变。此外,还综合考虑了该变异是否曾被报道与疾病相关、in silico 预测其对蛋白质功能的有害性,以及根据ACMG标准对变异进行的致病性分类。

从筛选后的列表中首先识别出的一个变异为杂合变异,即LRRK2:c.T3939A,导致无义变异p.C1313*。LRRK2编码富含亮氨酸重复序列的激酶2(Leucine-Rich Repeat Kinase 2),该蛋白具有GTP酶和激酶活性42。此外,已知该基因内的突变是家族性帕金森病的主要致病原因之一43。该变异在LRRK2基因中引入了一个提前终止密码子,从而导致第1,314至2,527位氨基酸残基的缺失。这阻碍了蛋白的Ras-like结构域(Roc)、Roc的C端结构域(COR)以及蛋白激酶结构域的翻译,而这些结构域分别参与作为非典型Rho GTP酶、GTP结合蛋白和蛋白激酶的功能。CADD(CADD Phred = 36)的in silico分析预测该变异具有破坏性。该变异极为罕见,在ExAC和ESP数据库中的等位基因频率(MAF)分别为0.004%和0.01%,且在1000G数据库中未见记录。此外,在全部528例测序患者中,仅此一名患者携带该变异,且该变异为新发变异,在既往疾病突变数据库中未有报道(材料表)。该变异检测结果的可信度已通过其高达109x的深度测序覆盖得到确认。最后,根据AMCG致病性评估标准与指南,该变异被归类为致病性变异。

该患者还携带一个杂合性变异, NR4A2:c.C755A,导致错义突变p.P252Q。该突变影响由 NR4A2,核受体亚家族4组A成员2,是一种参与多巴胺能神经元生成的转录因子44 该基因内的突变此前已被关联到帕金森病45将非极性的脯氨酸替换为极性的谷氨酰胺,据预测具有破坏性 计算机模拟 通过CADD(CADD Phred值=21.1)预测分析得出该变异具有潜在功能影响,但SIFT或PolyPhen-2分析未提供支持。该变异罕见,在ExAC数据库中的等位基因频率(MAF)为0.004%,在ESP和1000G数据库中均未检出。该变异亦在一名被诊断为血管性认知障碍的ONDRI参与者中被发现,但此前未在疾病突变数据库中报道。然而,该变异的测序覆盖深度仅为18x,因此将进行Sanger测序以确认其序列准确性。最后,根据ACMG致病性评估标准与指南,该变异被判定为临床意义未明。

ONDRISeq 面板及生物信息学分析流程还能够确定每个样本的 APOE 基因型。该患者被确定为具有 APOE E3/E3 基因型。

figure-results-1
图3:ANNOVAR输出结果的简化示例,显示经人工审校并注释的变异位点。 来自一名68岁男性帕金森病患者病例研究的简化ANNOVAR输出结果。经注释的变异位点经过人工筛选,以识别最可能具有临床意义的变异,如红色框所示。请点击此处查看该图的放大版本。

讨论

从DNA样本提取到识别可能与患者诊断、疾病进展及潜在治疗方案相关的变异位点的过程中,必须认识到测序及正确数据处理所需方法的多样性。本文所述方案即为靶向高通量测序(NGS)及其后续生物信息学分析的应用实例,这对于识别具有潜在临床意义的罕见变异至关重要。具体而言,我们介绍了ONDRI基因组学小组在使用ONDRISeq定制设计的NGS panel时所采用的技术路线。

众所周知,这些方法是基于特定的下一代测序(NGS)平台开发的,而其他测序平台和靶向富集试剂盒也可能被使用。然而,本研究所选用的NGS平台及台式仪器(材料表)因其较早获得美国食品药品监督管理局(FDA)批准46而被选定。该授权反映了所选NGS方案能够实现高质量的测序,以及测序读长具有高度可靠性。

尽管获得具有足够覆盖深度的准确测序读段非常重要,但最终稀有变异分析所需的生物信息学处理同样关键,且可能需要大量计算资源。由于测序过程中可能存在多种错误来源,一个稳健的生物信息学流程必须能够校正可能引入的各种不准确性。这些错误可能源于比对过程中的错配、文库制备中PCR扩增引入的扩增偏好性,以及测序技术本身产生的测序假象47。无论使用何种软件进行读段比对和变异检测,都存在一些通用的方法来减少这些错误,包括局部重比对、去除重复比对的读段,以及在变异检测时设置适当的质控参数。此外,变异检测过程中选择的参数可能因具体研究需求的不同而有所调整11。本文所采用的变异位点及其周围核苷酸的最低覆盖深度和质量分数,旨在在特异性和灵敏度之间取得合理平衡。这些参数已通过与三种独立遗传学技术的变异检测结果一致性分析在ONDRISeq panel上得到验证,如前所述,包括:1)基于芯片的基因分型;2)等位基因 discrimination 检测;以及 3)Sanger测序9

在准确的变异检测之后,为了确定具有潜在临床意义的变异,注释和审编至关重要。由于其开放获取的平台,ANNOVAR 是进行变异注释以及初步筛选或排除变异的优秀工具。除了易于获取之外,无论使用何种测序平台生成的数据,ANNOVAR 均可应用于任何 VCF 文件,并且可根据研究需求进行定制26

注释完成后,必须对变异进行解读,以确定其是否具有临床意义。这一过程不仅复杂,而且常常容易受到主观判断和人为错误的影响。为此,美国医学遗传学与基因组学学会(ACMG)制定了评估任何变异致病性证据的指导原则。我们采用一种基于非同义、罕见变异的手动人工审编方法,该方法依据上述指南构建,并通过定制设计的Python脚本对能够通过分析流程的每一个变异进行 individually 评估,从而根据指南对变异进行分类,确保审编过程的安全性。通过这种方式,每个变异将被赋予“致病性”、“可能致病性”、“意义未明”、“可能良性”或“良性”的评级,从而使变异审编过程实现标准化和透明化。需要认识到的是,变异审编的具体细节在生物信息学流程之外,将根据研究的具体需求进行个性化调整,因此超出了本文所介绍方法学的范围。

尽管本文介绍的方法是针对ONDRI的,但所述步骤在考虑大量感兴趣的遗传性疾病时同样适用。随着许多表型相关的基因关联数量不断增加,靶向NGS能够采用一种基于假设的研究方法,充分利用该领域已有的前期研究成果。然而,靶向NGS及其所采用的方法仍存在局限性。由于仅聚焦于基因组的特定区域,其发现范围仅限于目标区域内的新等位基因。因此,那些未被测序靶点覆盖的新基因或其他基因组位点——这些可能通过全基因组测序(WGS)或全外显子组测序(WES)方法被发现——将无法被识别。此外,基因组中某些区域使用NGS技术进行准确测序仍存在困难,例如含有高度重复序列48的区域或富含GC碱基的区域49。幸运的是,在使用靶向NGS时,通常事先对正在测序的基因组区域已有较深入的了解,因此可以预判这些区域是否可能带来技术挑战。最后,目前从NGS数据中检测拷贝数变异尚未实现标准化50。然而,针对这些问题的生物信息学解决方案可能即将出现;新的计算工具或将有助于分析ONDRI患者中这些额外类型的遗传变异。

尽管存在一定的局限性,靶向高通量测序(NGS)在假设驱动的研究框架下仍能获得高质量的数据,且成本低于全基因组测序(WGS)和全外显子组测序(WES)。该方法不仅适用于高效、定向的研究,其在临床中的应用也正呈指数级增长。该技术被用于探究多种疾病相关分子通路中的诸多问题,并正在发展成为一种相较于WES和WGS成本较低但准确性高的诊断工具。即使与作为金标准的Sanger测序相比,靶向NGS在时间和成本效率方面也具有竞争优势。因此,对于接收并使用NGS数据的科研人员或临床医生而言——例如在实验室或临床报告中以文本形式呈现的数据——理解其结果背后复杂的"黑箱"过程至关重要。本文所介绍的方法将有助于用户理解NGS数据生成与解读背后的基本流程。

披露

作者无任何利益冲突需要披露。

致谢

我们感谢所有ONDRI参与者同意并配合本研究。感谢ONDRI研究人员(www.ONDRI.ca/people),包括我们的主要研究者(MJS)以及ONDRI管理委员会:执行委员会、指导委员会、出版委员会、招募委员会、评估平台团队和项目管理团队。我们还感谢伦敦区域基因组中心提供的专业技术支持。AAD获得了伦敦及米德尔塞克斯阿尔茨海默病协会硕士研究生研究奖学金的资助。SMKF获得了加拿大肌萎缩侧索硬化症协会Tim E. Noël博士后奖学金的资助。

材料

本文使用的材料清单
姓名公司目录编号评论
4 mL EDTA K2 管Fisher Scientific02-689-4
1 M Tris 缓冲液Bio Basic Canada Inc.SD8141
Gentra Puregene 血液试剂盒Qiagen1583891,000 mL 试剂盒。此为步骤 1.3 中提到的血液提取试剂盒。
NanoDrop-1000 分光光度计Thermo Fisher ScientificND-2000已被 NanoDrop-2000 分光光度计取代。此为全光谱分光光度计,见于步骤 1.4 和 2.1.2。
Qubit 2.0 荧光计InvitrogenQ32866适用于 DNA 定量的荧光计,见于步骤 2.1.4、2.1.6、2.2.3 和 3.1.3。
Nextera Rapid Custom Capture 富集试剂盒Illumina, Inc.FC-140-1009专为 ONDRISeq 面板设计,用于测序 80 个基因的外显子,产生长度为 150 个碱基的双端读长,共 971,388 个碱基对序列;每试剂盒可处理 288 个样本。此为目标富集试剂盒,见于步骤 2.2、2.2.2、2.2.3、3.1.5、3.1.6、3.4.1 及讨论部分。
2100 BioAnalyzerAgilent TechnologiesG2939BA自动化电泳系统,见于步骤 3.1.4。
高灵敏度 DNA 试剂盒Agilent Technologies5067-4626每试剂盒可处理 110 个样本;此为 DNA 质量分析试剂盒,见于步骤 3.1.4。 
MiSeq 试剂盒 v3Illumina, Inc.MS-102-3003600 个循环试剂盒;此为 NGS 台式仪器试剂盒,见于步骤 3.1。
MiSeq 个人基因组测序仪Illumina, Inc.SY-410-1003NGS 台式仪器,见于步骤 2.2.1、3.1、3.1.1、3.1.2、3.1.8、3.2、4.2.6、代表性结果及讨论部分。
Experiment ManagerIllumina, Inc.NGS 技术软件,见于步骤 3.1.1 及 图 1。https://support.illumina.com/sequencing/sequencing_software/experiment_manager/downloads.html
BaseSpaceIllumina, Inc.SW-410-1000基于云的计算环境,见于步骤 3.1.2、3.2、3.3、3.3.1、3.3.2、3.4、3.4.1、3.4.2 和 3.4.3。https://basespace.illumina.com/
CLC Genomics Workbench 10.1.1Qiagen832000也可使用开源选项进行数据预处理,以模拟本方案中的工作流程。此为用于数据预处理的软件,见于第 4 步全过程及 图 2。 
Annotate Variationhttp://annovar.openbioinformatics.org/en/latest/user-guide/download/
RefSeq美国国家生物技术信息中心https://www.ncbi.nlm.nih.gov/refseq/
dbSNP138美国国家生物技术信息中心https://www.ncbi.nlm.nih.gov/projects/SNP/snp_summary.cgi?view+summary=view+summary&build_id=138
外显子组聚合联盟Broad 研究所http://exac.broadinstitute.org/
美国国家心肺血液研究所外显子组测序项目欧洲队列华盛顿大学和 Broad 研究所http://evs.gs.washington.edu/EVS/
ClinVar美国国家生物技术信息中心https://www.ncbi.nlm.nih.gov/clinvar/
联合注释依赖性耗竭评分(CADD)华盛顿大学和 Hudson-Alpha 生物技术研究所http://cadd.gs.washington.edu/
从耐受性中区分不耐受变异(SIFT)J. Craig Venter 研究所http://sift.jcvi.org/
PolyPhen-2Brigham and Women's 医院,哈佛医学院http://genetics.bwh.harvard.edu/pph2/
人类基因突变数据库Qiagen834050疾病突变数据库,见于步骤 5.2 和代表性结果部分。https://portal.biobase-international.com/cgi-bin/portal/login.cgi?redirect_url=/hgmd/pro/start.php
基于剪接的变异分析工具多伦多大学 Frey 实验室http://tools.genes.toronto.edu/
人类剪接位点分析工具(Human Splicing Finder)Aix Marseille Universitéhttp://www.umd.be/HSF3/HSF.shtml
其他材料
离心机
一次性移液管

参考文献

  1. Metzker, M. L. Sequencing technologies - the next generation. Nat Rev Genet. 11 (1), 31-46 (2010).
  2. Mardis, E. R. Next-generation DNA sequencing methods. Annu Rev Genomics Hum Genet. 9, 387-402 (2008).
  3. Shendure, J., Ji, H. Next-generation DNA sequencing. Nat Biotechnol. 26 (10), 1135-1145 (2008).
  4. Sanger, F., Nicklen, S., Coulson, A. R. DNA sequencing with chain-terminating inhibitors. Proc Natl Acad Sci U S A. 74 (12), 5463-5467 (1977).
  5. Farhan, S. M. K., Hegele, R. A. Exome Sequencing: New Insights into Lipoprotein Disorders. Current Cardiology Reports. 16 (7), (2014).
  6. Choi, M., et al. Genetic diagnosis by whole exome capture and massively parallel DNA sequencing. Proc Natl Acad Sci U S A. 106 (45), 19096-19101 (2009).
  7. Mardis, E. R. DNA sequencing technologies: 2006-2016. Nat Protoc. 12 (2), 213-218 (2017).
  8. Farhan, S. M., et al. The Ontario Neurodegenerative Disease Research Initiative (ONDRI). Can J Neurol Sci. 44 (2), 196-202 (2017).
  9. Farhan, S. M. K., et al. The ONDRISeq panel: custom-designed next-generation sequencing of genes related to neurodegeneration. NPJ Genom Med. (16032), 1-11 (2016).
  10. El-Metwally, S., Hamza, T., Zakaria, M., Helmy, M. Next-generation sequence assembly: four stages of data processing and computational challenges. PLoS Comput Biol. 9 (12), e1003345(2013).
  11. Yohe, S., Thyagarajan, B. Review of Clinical Next-Generation Sequencing. Arch Pathol Lab Med. , (2017).
  12. Qiagen. Gentra Puregene Handbook. , 4th edn, (2014).
  13. NanoDrop Technologies, Inc. Spectrophotometer V3.5 User's Manual. , (2007).
  14. Invitrogen by Life Technologies. Qubit 2.0 Fluorometer User Manual. Vol. Q32866. , (2010).
  15. Illumina, Inc. Nextera Rapid Capture Enrichment Guide. , Vol. 15037436 v01 (2016).
  16. Illumina, Inc. Nextera Rapid Capture Enrichment Reference Guide. , Vol. 15037436 v01 (2016).
  17. Rev. B. Illumina, Inc. MiSeq Reagent Kit v3 Reagent Preparation Guide. , Vol. 15044932 Rev. B (2013).
  18. Illumina, Inc. MiSeq System Guide. , Vol. 15027617 v01 (2015).
  19. BaseSpace Sequence Hub. , https://basespace.illumina.com/dashboard (2017).
  20. Rev. B. Agilent Technologies. Agilent High Sensitivity DNA Kit Guide. , Vol. G2938-90321 (2013).
  21. Illumina, Inc. MiSeq System Denature and Dilute Libraries Guide. , Vol. 15039740 v01 (2016).
  22. Illumina, Inc. System Specification Sheet: MiSeq System. , (2016).
  23. BaseSpace Sequence Hub Help Center. , Available from: https://help.basespace.illumina.com/ (2017).
  24. Qiagen. Genomics Workbench 10.1.1 User Manual. , (2017).
  25. Ebbert, M. T., et al. Evaluating the necessity of PCR duplicate removal from next-generation sequencing data and a comparison of approaches. BMC Bioinformatics. 17, Suppl 7. 239(2016).
  26. Wang, K., Li, M., Hakonarson, H. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data. Nucleic Acids Res. 38 (16), e164(2010).
  27. Leary, N. A., et al. Reference sequence (RefSeq) database at NCBI: current status, taxonomic expansion, and functional annotation. Nucleic Acids Res. 44 (D1), D733-D745 (2016).
  28. Kitts, A., Phan, L., Ward, M., Bradley Holmes, J. The Database of Short Genetic Variation (dbSNP). , National Center for Biotechnology Information. Bethesda, MD. (2013).
  29. Lek, M., et al. Analysis of protein-coding genetic variation in 60,706 humans. Nature. 536 (7616), 285-291 (2016).
  30. Exome Variant Server, NHLBI GO Exome Sequencing Project (ESP). , http://evs.gs.washington.edu/EVS/ (2017).
  31. Auton, A., et al. A global reference for human genetic variation. Nature. 526 (7571), 68-74 (2015).
  32. Landrum, M. J., et al. ClinVar: public archive of interpretations of clinically relevant variants. Nucleic Acids Res. 44 (D1), D862-D868 (2016).
  33. Kircher, M., et al. A general framework for estimating the relative pathogenicity of human genetic variants. Nat Genet. 46 (3), 310-315 (2014).
  34. Kumar, P., Henikoff, S., Ng, P. C. Predicting the effects of coding non-synonymous variants on protein function using the SIFT algorithm. Nat Protoc. 4 (7), 1073-1081 (2009).
  35. Adzhubei, I. A., et al. A method and server for predicting damaging missense mutations. Nat Methods. 7 (4), 248-249 (2010).
  36. Bertram, L., McQueen, M. B., Mullin, K., Blacker, D., Tanzi, R. E. Systematic meta-analyses of Alzheimer disease genetic association studies: the AlzGene database. Nat Genet. 39 (1), 17-23 (2007).
  37. Xiong, H. Y., et al. The human splicing code reveals new insights into the genetic determinants of disease. Science. 347 (6218), (2015).
  38. Desmet, F. O., et al. Human Splicing Finder: an online bioinformatics tool to predict splicing signals. Nucleic Acids Res. 37 (9), e67(2009).
  39. Richards, S., et al. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology. Genet Med. 17 (5), 405-424 (2015).
  40. Li, Q., Wang, K. InterVar: Clinical Interpretation of Genetic Variants by the 2015 ACMG-AMP Guidelines. Am J Hum Genet. 100 (2), 267-280 (2017).
  41. Yang, Z. L., Sun, G. L. High-frequency, low-coverage "false positives" mutations may be true in GS Junior sequencing studies. Scientific Reports. 7, (2017).
  42. Gandhi, P. N., Wang, X., Zhu, X., Chen, S. G., Wilson-Delfosse, A. L. The Roc domain of leucine-rich repeat kinase 2 is sufficient for interaction with microtubules. J Neurosci Res. 86 (8), 1711-1720 (2008).
  43. Goldwurm, S., et al. The G6055A (G2019S) mutation in LRRK2 is frequent in both early and late onset Parkinson's disease and originates from a common ancestor. J Med Genet. 42 (11), e65(2005).
  44. Caiazzo, M., et al. Direct generation of functional dopaminergic neurons from mouse and human fibroblasts. Nature. 476 (7359), 224-227 (2011).
  45. Grimes, D. A., et al. Translated mutation in the Nurr1 gene as a cause for Parkinson's disease. Mov Disord. 21 (7), 906-909 (2006).
  46. Collins, F. S., Hamburg, M. A. First FDA authorization for next-generation sequencer. N Engl J Med. 369 (25), 2369-2371 (2013).
  47. Van der Auwera, G. A., et al. From FastQ data to high confidence variant calls: the Genome Analysis Toolkit best practices pipeline. Curr Protoc Bioinformatics. 43, 11-33 (2013).
  48. Treangen, T. J., Salzberg, S. L. Repetitive DNA and next-generation sequencing: computational challenges and solutions. Nat Rev Genet. 13 (1), 36-46 (2011).
  49. Shin, S., Park, J. Characterization of sequence-specific errors in various next-generation sequencing systems. Mol Biosyst. 12 (3), 914-922 (2016).
  50. Povysil, G., et al. panelcn.MOPS: Copy-number detection in targeted NGS panel data for clinical diagnostics. Hum Mutat. 38 (7), 889-897 (2017).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

ONDRISeq FASTQ

相关文章