靶向二代测序是一种高效且经济的方法,正日益广泛应用于疾病研究和临床诊断。本文所述方案介绍了用于测序的复杂工作流程,以及用于识别致病遗传变异的生物信息学分析过程。
方法文章
靶向二代测序是一种高效且经济的方法,正日益广泛应用于疾病研究和临床诊断。本文所述方案介绍了用于测序的复杂工作流程,以及用于识别致病遗传变异的生物信息学分析过程。
下一代测序(NGS)正在迅速变革对先天性疾病遗传决定因素的研究方式。该技术效率极高,可在较短时间内以相对较低的成本产生数百万条测序读长。特别是靶向NGS能够将研究聚焦于与特定疾病相关的基因组区域。这不仅进一步降低了成本并加快了分析速度,还减轻了通常伴随NGS而来的计算负担。尽管靶向NGS仅限于基因组的特定区域,因而无法发现潜在的新功能位点,但对于已知存在遗传关联且表型和遗传异质性较强的疾病而言,该技术是一种极为有效的手段。由于测序技术本身具有复杂性,因此必须严格遵循实验方案和方法,以获得高覆盖度和高质量的测序读长。此外,在获得测序读长后,需采用复杂的生物信息学流程,将读长准确比对至参考基因组、识别变异位点,并确保这些变异通过质量评估指标。变异还需根据其临床意义进行注释和审编,这一过程可通过应用美国医学遗传学与基因组学学会(ACMG)致病性指南实现标准化。本文所述方法将以ONDRISeq神经退行性疾病测序 panel 为模型,展示利用靶向测序 panel 生成和分析NGS数据的各个步骤,以识别可能具有临床意义的变异位点。
随着确定各类疾病的遗传决定因素在科研和临床实践中日益受到重视,新一代测序技术(NGS)正成为实现这一目标的高通量且经济高效的重要工具1,2,3。近40年来,桑格测序一直是鉴定遗传变异的金标准4;然而,对于具有遗传异质性或遗传病因尚未明确的疾病,往往需要同时评估大量可能的候选基因。在此情况下,桑格测序变得昂贵且耗时。相比之下,NGS通过对数百万条DNA片段进行大规模并行测序,能够在全基因组多个区域同时高效、低成本地检测多种类型的遗传变异。
DNA测序的下一代测序(NGS)技术有三种类型:1)全基因组测序(WGS),2)全外显子组测序(WES),以及3)靶向测序5。WGS用于评估个体的全部基因组内容,而WES仅对基因组中的蛋白质编码区域进行测序6。相比之下,靶向测序则聚焦于基因组中特定的区域,这些区域通常基于少数由共同病理机制或已知临床表型关联的特定基因。通过该方法,可以指定一个或一组特定基因的外显子、内含子或任何基因间区域。因此,当已有明确的候选基因与目标疾病相关时,靶向测序可成为一种极佳的选择。通过靶向基因组的特定区域,能够排除冗余和无关的遗传变异,从而避免对临床解读造成干扰或混淆。尽管WGS和WES均可产生大量高质量的数据,但数据量可能过于庞大。这不仅需要计算密集型的生物信息学分析,还常常带来数据存储方面的难题7。数据存储的挑战也进一步增加了WGS和WES的额外成本,而这一点在计算测序费用时往往未被充分考虑。此外,尽管成本正在下降,WGS和WES的费用仍然相对较高。相比之下,当需要对大量个体进行测序时,靶向测序可能是一种更具成本效益的选择。
安大略神经退行性疾病研究计划(Ontario Neurodegenerative Disease Research Initiative, ONDRI)是一项多平台、覆盖全省的观察性队列研究,旨在对五种神经退行性疾病进行表征,包括:1)阿尔茨海默病与轻度认知障碍,2)肌萎缩侧索硬化症,3)额颞叶痴呆,4)帕金森病,以及 5)血管性认知障碍8。ONDRI 基因组学小组致力于在该队列基线特征描述中阐明常被忽视却极为重要的遗传背景,这些疾病在表型和遗传上均具有高度异质性。因此,神经退行性疾病是下一代测序(NGS)技术,尤其是靶向测序方法的适宜研究对象。
我们专门设计了一种靶向NGS panel——ONDRISeq,用于对参与ONDRI项目的528名受试者进行测序,覆盖了先前与五种目标疾病相关的80个基因的蛋白质编码区。通过该方法,我们能够以集中且高效的方式利用高质量的NGS数据。ONDRISeq panel的设计及验证已通过多项一致性研究进行过描述,在用于panel验证的216个病例中,ONDRISeq panel能够识别出72.2%的具有潜在临床意义的新型罕见变异9。尽管近年来NGS技术取得了迅速而显著的进步,许多研究人员在将原始数据处理为可用的、带有注释的变异列表时仍面临挑战10。此外,变异的解读可能十分复杂,尤其是当面对大量罕见或新型变异时11。
本文以 ONDRISeq 研究为例,逐步介绍靶向高通量测序(NGS)的方法学以及相关的生物信息学工作流程,该流程用于重测序、变异检测和变异注释。在生成 NGS 数据后,必须将原始测序文件比对至人类参考基因组,以准确识别变异。随后需对变异进行注释,以便开展后续的变异审编。我们还将阐述如何应用美国医学遗传学学会(American College of Medical Genetics)的标准与指南,以准确分类变异的致病性。
针对ONDRI项目,伦理协议和知情同意书的获取依据以下机构的研究伦理委员会规定:加拿大安大略省多伦多的贝克斯特老年护理中心(Baycrest Centre for Geriatric Care);加拿大安大略省多伦多的成瘾与心理健康中心(Centre for Addiction and Mental Health);加拿大安大略省渥太华的伊丽莎白·布吕耶尔医院(Elizabeth Bruyère Hospital);加拿大安大略省汉密尔顿的汉密尔顿综合医院(Hamilton General Hospital);加拿大安大略省伦敦的伦敦健康科学中心(London Health Sciences Centre);加拿大安大略省汉密尔顿的麦克马斯特大学(McMaster);加拿大安大略省渥太华的渥太华医院(The Ottawa Hospital);加拿大安大略省伦敦的帕克伍德医院(Parkwood Hospital);加拿大安大略省多伦多的圣迈克尔医院(St Michael's Hospital);加拿大安大略省多伦多的森尼布鲁克健康科学中心(Sunnybrook Health Sciences Centre);以及加拿大安大略省多伦多的大学健康网络-多伦多西区医院(University Health Network-Toronto Western Hospital)。
1. 从人血样本中分离DNA
2. 测序文库制备
3. 下一代测序


图 1:NGS 技术软件(材料表)中样本表创建器的应用选项截图。 在 ONDRISeq 中,仅使用“仅生成 FASTQ”应用。然而,如果用户希望生成其他类型的文件(例如 VCF 文件),建议选择靶向重测序类别中的相应应用。请点击此处查看此图的放大版本。
4. 重测序与变异检测

图 2:在数据预处理软件(材料表)中为 ONDRISeq 目的定制的 FASTQ 文件重测序与变异检测工作流程。 该工作流程中的步骤可根据研究人员的需求,应用于其他二代测序(NGS)重测序与变异检测软件。 请点击此处查看此图的放大版本。
5. 变异注释
本文所述方法应用于已加入ONDRI的528名参与者的DNA样本。这些样本使用ONDRISeq panel进行检测,共运行22批,每批24个样本。总体而言,测序数据质量较高,样本平均覆盖深度为78 ± 13x,所有单个运行批次的平均样本覆盖深度均>30x。此外,平均有94%的目标区域覆盖深度至少达到20x(表1)。
平均有 95.6% 的测序读段比对到参考序列,所有 ONDRISeq 运行中均有 >90% 的读段成功比对(表 1)。在比对成功的读段中,92.0% 的 Phred 质量值 ≥Q30,仅有一个运行的比对读段中达到此质量标准的比例 <80%。然而,该运行仍表现出平均 79x 的覆盖深度,且 93% 的目标区域覆盖深度至少达到 20x。
| 参数 | 平均值 (±标准差) | 最佳表现 | 最差表现 |
| 簇密度 (x103/mm2) | 1424 (±269) | 1347 | 1835 |
| 总读段数 (106) | 43.1 (±6.0) | 48.7 | 47.4 |
| 比对读段数 (106) | 40.1 (±6.0) | 47.1 | 25.7 |
| 比对读段数 (%) | 95.6 (±1.3) | 96.8 | 92.6 |
| Phred 质量评分 ≥Q30 (%) | 92.0 (±6.0) | 92 | 68.3 |
| 样本覆盖深度 (x) | 78 (±13) | 99 | 51 |
表1:ONDRISeq 平台22次运行的测序质量指标。
病例研究:帕金森病患者中罕见变异的鉴定。
为了展示我们靶向下一代测序(NGS)工作流程的实用性,我们以一名68岁男性帕金森病患者为例进行说明。该DNA样本与其他23个ONDRI样本一起,在NGS台式仪器(材料表)上使用ONDRISeq检测 panel 进行测序。此次测序运行的簇密度为1,555 × 103/mm2。该患者的样本平均覆盖深度为76×,其中93.9%的目标区域覆盖深度至少达到20×。
在使用定制的生物信息学流程进行变异检测和注释后,发现该患者在ONDRISeq检测面板所包含的80个基因的外显子及其上下游250 bp范围内共有1351个变异位点。然而,如上所述,ANNOVAR分析流程通过考虑变异的序列本体(sequence ontology)和等位基因频率(MAF),成功减少了需分析的变异数量,最终得到7个需进行人工审校的变异位点(图3)。在这7个变异中,有两个被认定可能具有临床意义。该筛选流程针对ONDRI的具体需求而设计,筛选标准包括:在普通人群中相对罕见、在本体上为非同义突变(nonsynonymous),因而会导致蛋白质序列改变。此外,还综合考虑了该变异是否曾被报道与疾病相关、in silico 预测其对蛋白质功能的有害性,以及根据ACMG标准对变异进行的致病性分类。
从筛选后的列表中首先识别出的一个变异是杂合变异,即 LRRK2:c.T3939A,导致无义变异 p.C1313*。LRRK2 编码富含亮氨酸重复序列的激酶2(Leucine-Rich Repeat Kinase 2),该蛋白具有GTP酶和激酶活性42。此外,已知该基因内的突变是家族性帕金森病的主要致病原因之一43。该变异在 LRRK2 基因中引入了一个提前终止密码子,从而缺失了第1314–2527位的氨基酸残基。这阻碍了蛋白的Ras of complex proteins(Roc)、Roc的C端(COR)以及蛋白激酶结构域的翻译,这些结构域分别参与作为非典型Rho GTP酶、GTP结合蛋白和蛋白激酶的功能。该变异经CADD(CADD Phred = 36)生成的in silico分析预测为有害。该变异极为罕见,在ExAC和ESP数据库中的等位基因频率(MAF)分别为0.004%和0.01%,且在1000G数据库中未见记录。此外,在所有528例测序患者中,仅此一例携带该变异,且该变异为新发,此前未在疾病突变数据库中报道过(材料表)。该变异检测结果的可信度由其109倍的高深度测序覆盖得以确认。最后,根据AMCG致病性评估标准与指南,该变异被归类为致病性变异。
该患者还携带一个杂合性变异, NR4A2:c.C755A,导致错义改变p.P252Q。该突变影响由 NR4A2,核受体亚家族4组A成员2,是一种参与多巴胺能神经元生成的转录因子44 该基因内的突变此前已被关联到帕金森病45将非极性的脯氨酸替换为极性的谷氨酰胺,据预测具有破坏性 in silico 通过CADD(CADD Phred = 21.1)预测分析提示该变异可能具有致病性,但SIFT和PolyPhen-2分析未提示致病性。该变异罕见,在ExAC数据库中的等位基因频率(MAF)为0.004%,在ESP和1000G数据库中均未检出。该变异亦在一名被诊断为血管性认知障碍的ONDRI参与者中被发现,但此前未在疾病突变数据库中报道。该变异的测序覆盖深度仅为18x,因此将进行Sanger测序以确认其序列准确性。最后,根据ACMG致病性评估标准与指南,该变异被判定为临床意义未明。
ONDRISeq 面板和生物信息学分析流程还能够确定每个样本的APOE基因型。该患者被确定为具有APOE E3/E3 基因型。

图3:ANNOVAR 显示经人工审校并注释的变异位点的简化输出示例。 该输出来自一名68岁男性帕金森病患者的案例研究。经注释的变异位点经过人工筛选,以识别最可能具有临床意义的变异,如红色框所示。 请点击此处查看该图的放大版本。
从DNA样本提取到识别可能与患者诊断、疾病进展及潜在治疗方案相关的变异位点的过程中,必须认识到测序及正确数据处理所需方法的多样性。本文所述方案即为靶向高通量测序(NGS)及其后续生物信息学分析的应用实例,这对于识别具有潜在临床意义的罕见变异至关重要。具体而言,我们介绍了ONDRI基因组学小组在使用ONDRISeq定制设计的NGS panel时所采用的技术路线。
众所周知,这些方法是基于特定的下一代测序(NGS)平台开发的,而其他测序平台和靶向富集试剂盒也可能被使用。然而,本研究所选用的NGS平台及台式仪器(材料表)因其较早获得美国食品药品监督管理局(FDA)批准46而被选定。该授权反映了所选NGS方案能够实现高质量的测序,以及测序读长具有高度可靠性。
尽管获得具有足够覆盖深度的准确测序读段非常重要,但最终稀有变异分析所需的生物信息学处理同样关键,且可能需要大量计算资源。由于测序过程中可能存在多种错误来源,一个稳健的生物信息学流程必须能够校正可能引入的各种不准确性。这些错误可能源于比对过程中的错配、文库制备中PCR扩增引入的扩增偏好性,以及测序技术本身产生的测序假象47。无论使用何种软件进行读段比对和变异检测,都存在一些通用的方法来减少这些错误,包括局部重比对、去除重复比对的读段,以及在变异检测时设置适当的质控参数。此外,变异检测过程中选择的参数可能因具体研究需求的不同而有所调整11。本文所采用的变异位点及其周围核苷酸的最低覆盖深度和质量分数,旨在在特异性和灵敏度之间取得合理平衡。这些参数已通过与三种独立遗传学技术的变异检测结果一致性分析在ONDRISeq panel上得到验证,如前所述,包括:1)基于芯片的基因分型;2)等位基因 discrimination 检测;以及 3)Sanger测序9。
在准确的变异检测之后,为了确定具有潜在临床意义的变异,注释和审编至关重要。由于其开放获取的平台,ANNOVAR 是进行变异注释以及初步筛选或排除变异的优秀工具。除了易于获取之外,无论使用何种测序平台生成的数据,ANNOVAR 均可应用于任何 VCF 文件,并且可根据研究需求进行定制26。
注释完成后,必须对变异进行解读,以确定其是否具有临床意义。这一过程不仅复杂,而且常常容易受到主观判断和人为错误的影响。为此,美国医学遗传学与基因组学学会(ACMG)制定了评估任何变异致病性证据的指导原则。我们采用一种基于非同义、罕见变异的手动人工审编方法,该方法依据上述指南构建,并通过定制设计的Python脚本对能够通过分析流程的每一个变异进行 individually 评估,从而根据指南对变异进行分类,确保审编过程的安全性。通过这种方式,每个变异将被赋予“致病性”、“可能致病性”、“意义未明”、“可能良性”或“良性”的评级,从而使变异审编过程实现标准化和透明化。需要认识到的是,变异审编的具体细节在生物信息学流程之外,将根据研究的具体需求进行个性化调整,因此超出了本文所介绍方法学的范围。
尽管本文介绍的方法是针对ONDRI的,但所述步骤在考虑大量感兴趣的遗传性疾病时同样适用。随着许多表型相关的基因关联数量不断增加,靶向NGS能够采用一种基于假设的研究方法,充分利用该领域已有的前期研究成果。然而,靶向NGS及其所采用的方法仍存在局限性。由于仅聚焦于基因组的特定区域,其发现范围仅限于目标区域内的新等位基因。因此,那些未被测序靶点覆盖的新基因或其他基因组位点——这些可能通过全基因组测序(WGS)或全外显子组测序(WES)方法被发现——将无法被识别。此外,基因组中某些区域使用NGS技术进行准确测序仍存在困难,例如含有高度重复序列48的区域或富含GC碱基的区域49。幸运的是,在使用靶向NGS时,通常事先对正在测序的基因组区域已有较深入的了解,因此可以预判这些区域是否可能带来技术挑战。最后,目前从NGS数据中检测拷贝数变异尚未实现标准化50。然而,针对这些问题的生物信息学解决方案可能即将出现;新的计算工具或将有助于分析ONDRI患者中这些额外类型的遗传变异。
尽管存在一定的局限性,靶向高通量测序(NGS)在假设驱动的研究框架下仍能获得高质量的数据,且成本低于全基因组测序(WGS)和全外显子组测序(WES)。该方法不仅适用于高效、定向的研究,其在临床中的应用也正呈指数级增长。该技术被用于探究多种疾病相关分子通路中的诸多问题,并正在发展成为一种相较于WES和WGS成本较低但准确性高的诊断工具。即使与作为金标准的Sanger测序相比,靶向NGS在时间和成本效率方面也具有竞争优势。因此,对于接收并使用NGS数据的科研人员或临床医生而言——例如在实验室或临床报告中以文本形式呈现的数据——理解其结果背后复杂的"黑箱"过程至关重要。本文所介绍的方法将有助于用户理解NGS数据生成与解读背后的基本流程。
作者无任何利益冲突需要披露。
我们感谢所有ONDRI参与者同意并配合本研究。感谢ONDRI研究人员(www.ONDRI.ca/people),包括我们的主要研究者(MJS)以及ONDRI管理委员会:执行委员会、指导委员会、出版委员会、招募委员会、评估平台团队和项目管理团队。我们还感谢伦敦区域基因组中心提供的专业技术支持。AAD获得了伦敦及米德尔塞克斯阿尔茨海默病协会硕士研究生研究奖学金的资助。SMKF获得了加拿大肌萎缩侧索硬化症协会Tim E. Noël博士后奖学金的资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 4 mL EDTA K2 管 | Fisher Scientific | 02-689-4 | |
| 1 M Tris 缓冲液 | Bio Basic Canada Inc. | SD8141 | |
| Gentra Puregene 血液试剂盒 | Qiagen | 158389 | 1,000 mL 试剂盒。此为步骤 1.3 中提到的血液提取试剂盒。 |
| NanoDrop-1000 分光光度计 | Thermo Fisher Scientific | ND-2000 | 已被 NanoDrop-2000 分光光度计取代。此为全光谱分光光度计,见于步骤 1.4 和 2.1.2。 |
| Qubit 2.0 荧光计 | Invitrogen | Q32866 | 适用于 DNA 定量的荧光计,见于步骤 2.1.4、2.1.6、2.2.3 和 3.1.3。 |
| Nextera Rapid Custom Capture 富集试剂盒 | Illumina, Inc. | FC-140-1009 | 专为 ONDRISeq 面板设计,用于测序 80 个基因的外显子,产生长度为 150 个碱基的双端读长,共 971,388 个碱基对序列;每试剂盒可处理 288 个样本。此为目标富集试剂盒,见于步骤 2.2、2.2.2、2.2.3、3.1.5、3.1.6、3.4.1 及讨论部分。 |
| 2100 BioAnalyzer | Agilent Technologies | G2939BA | 自动化电泳系统,见于步骤 3.1.4。 |
| 高灵敏度 DNA 试剂盒 | Agilent Technologies | 5067-4626 | 每试剂盒可处理 110 个样本;此为 DNA 质量分析试剂盒,见于步骤 3.1.4。 |
| MiSeq 试剂盒 v3 | Illumina, Inc. | MS-102-3003 | 600 个循环试剂盒;此为 NGS 台式仪器试剂盒,见于步骤 3.1。 |
| MiSeq 个人基因组测序仪 | Illumina, Inc. | SY-410-1003 | NGS 台式仪器,见于步骤 2.2.1、3.1、3.1.1、3.1.2、3.1.8、3.2、4.2.6、代表性结果及讨论部分。 |
| Experiment Manager | Illumina, Inc. | NGS 技术软件,见于步骤 3.1.1 及 图 1。https://support.illumina.com/sequencing/sequencing_software/experiment_manager/downloads.html | |
| BaseSpace | Illumina, Inc. | SW-410-1000 | 基于云的计算环境,见于步骤 3.1.2、3.2、3.3、3.3.1、3.3.2、3.4、3.4.1、3.4.2 和 3.4.3。https://basespace.illumina.com/ |
| CLC Genomics Workbench 10.1.1 | Qiagen | 832000 | 也可使用开源选项进行数据预处理,以模拟本方案中的工作流程。此为用于数据预处理的软件,见于第 4 步全过程及 图 2。 |
| Annotate Variation | http://annovar.openbioinformatics.org/en/latest/user-guide/download/ | ||
| RefSeq | 美国国家生物技术信息中心 | https://www.ncbi.nlm.nih.gov/refseq/ | |
| dbSNP138 | 美国国家生物技术信息中心 | https://www.ncbi.nlm.nih.gov/projects/SNP/snp_summary.cgi?view+summary=view+summary&build_id=138 | |
| 外显子组聚合联盟 | Broad 研究所 | http://exac.broadinstitute.org/ | |
| 美国国家心肺血液研究所外显子组测序项目欧洲队列 | 华盛顿大学和 Broad 研究所 | http://evs.gs.washington.edu/EVS/ | |
| ClinVar | 美国国家生物技术信息中心 | https://www.ncbi.nlm.nih.gov/clinvar/ | |
| 联合注释依赖性耗竭评分(CADD) | 华盛顿大学和 Hudson-Alpha 生物技术研究所 | http://cadd.gs.washington.edu/ | |
| 从耐受性中区分不耐受变异(SIFT) | J. Craig Venter 研究所 | http://sift.jcvi.org/ | |
| PolyPhen-2 | Brigham and Women's 医院,哈佛医学院 | http://genetics.bwh.harvard.edu/pph2/ | |
| 人类基因突变数据库 | Qiagen | 834050 | 疾病突变数据库,见于步骤 5.2 和代表性结果部分。https://portal.biobase-international.com/cgi-bin/portal/login.cgi?redirect_url=/hgmd/pro/start.php |
| 基于剪接的变异分析工具 | 多伦多大学 Frey 实验室 | http://tools.genes.toronto.edu/ | |
| 人类剪接位点分析工具(Human Splicing Finder) | Aix Marseille Université | http://www.umd.be/HSF3/HSF.shtml | |
| 其他材料 | |||
| 离心机 | |||
| 一次性移液管 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可