2018年4月4日
靶向二代测序是一种高效且经济的方法,正日益广泛应用于疾病研究和临床诊断。本文所述方案介绍了用于测序的复杂工作流程,以及用于识别致病遗传变异的生物信息学分析过程。
靶向二代测序的总体目标是通过聚焦特定基因组区域,阐明多种遗传性疾病的遗传决定因素。当某种疾病已知存在特定的遗传关联时,该方法有助于回答其遗传学机制中的关键问题。该技术具有高度的效率。
该技术可在短时间内产生数百万条测序读长,且成本相对较低,计算负担也相对较轻,尤其是与其他新一代测序方法相比。该技术的应用意义延伸至神经退行性疾病的诊断,这类疾病在表型和遗传上均具有高度异质性,但已有许多已知的相关遗传位点。尽管该方法主要针对神经退行性疾病,但也可应用于其他各类已知基因组感兴趣区域的先天性疾病。
通常,初次接触该方法的研究人员会遇到困难,因为最终的罕见变异分析所需的生物信息学处理可能计算量巨大,并产生多种误差来源。在本实验流程中,采集人体血液样本至三支四毫升的EDTA K2试管中,以获得约12毫升的总血量。将血液样本以750 × g离心20分钟。
这将使每个样本分为上层的血浆、中间薄层的白细胞以及底层的红细胞。使用一次性移液管吸取血液样本顶部的血浆。将其分装为多个500微升的等分试样,并于-80摄氏度保存,以备后续生化分析。
根据制造商说明书,使用血液提取试剂盒从血液样本中提取DNA。提取的DNA随后用于制备下一代测序文库。测序运行完成后,在计算机上通过导航面板选择“Runs”选项,于基于云的计算环境中查找相关文件。
选择适当的测序运行以进入运行摘要页面。点击“下载”以从云端获取数据。在弹出的对话框中,选择 FASTQ 文件作为要下载的文件类型,然后点击“下载”。
在基于云的计算环境的运行摘要页面中,导航至“图表”部分,利用计算环境生成的各类图表分析测序运行的质量。在“运行图表”页面中,找到标注为“按循环数据”的图表,图表类型选择“信号强度”,通道选择“所有通道”,以生成信号强度图。在“运行导航”面板中,选择“索引质量控制”标签,可查看位于页面右侧的索引质量控制直方图。
在基于云的计算环境的运行摘要页面中,单击运行导航面板中的“Metrics”(指标)以进入质量指标页面。在“Density kelvin per millimeter squared”(每平方毫米开尔文簇密度)下,确保测序运行的簇密度处于所用富集试剂盒推荐的范围内。本例中,该范围为每平方毫米 1,200 至 1,400 开尔文。
在“总百分比大于或等于Q30”项下,确保该值大于或等于85%,以反映测序读长的质量。在“比对率”项下,确保该值与测序运行中所用阳性对照的百分比相近。例如,如果使用了1%的阳性对照,则预期的比对百分比约为1%至5%,且在小数点后几位范围内的波动是可接受的。
首先将FASTQ测序读段导入数据处理软件中。在导航区域,右键单击并选择“新建文件夹”。将文件夹命名以明确标识所进行的测序运行。
从顶部的工具栏中选择“导入”,然后从下拉列表中选择执行测序的平台。对于 ONDRISeq,选择 Ilumina。在对话框中,浏览并选择正在处理的测序运行中的 FASTQ 文件。
在对话框的“常规选项”中,如果测序使用了双端测序技术,请勾选“配对读取”旁边的复选框。在对话框的“配对读取信息”部分,如果文件列表中正向读取的FASTQ文件位于反向读取之前,请选择“双端测序”。将配对读取的最小距离设置为1,最大距离设置为1000。
在对话框的 Ilumina 选项中,选择“移除测序失败的读段”。在“质量分数”下拉列表中,选择用于测序的 NGS 流程。然后点击对话框底部的“下一步”。
选择“保存并按批次单位创建子文件夹”。在对话框底部选择“下一步”。选择之前创建的文件夹。
FASTQ 文件将在此处导入。选择对话框底部的“完成”,并等待 FASTQ 文件导入完成。单击“进程”标签以查看文件导入状态。
接下来,在软件中设计一个重测序和变异检测的工作流程,以遵循制造商的说明。设计重测序与变异检测的工作流程是本实验中最困难的部分。我们的团队通过研究最佳实践,并结合反复试验,最终确定了最稳健且符合我们需求的工作流程。
要将导入的FASTQ测序读长文件运行于定制的生物信息学工作流程中,请首先在软件的工具箱中找到该工作流程并双击。在弹出的对话框中,定位导航区域中已导入的FASTQ文件所在的文件夹。在导航区域中选中所有文件夹,然后点击“批量”(Batch)旁边的复选框。
使用向右箭头将文件移至选定的元素。单击对话框底部的“下一步”。在对话框中,查看批次概览以确认已选择正确的 FASTQ 文件,然后单击“下一步”。
在对话框中查看工作流程的各个步骤,以确保设计工作流程时已正确选择相应的文件和导出位置。这些步骤包括将测序读段比对至参考序列、去除重复比对的读段、生成目标区域的统计信息、导出 BAM 文件、导出制表符分隔的文本文件、基于重叠进行过滤,以及导出 VCF 文件。在对话框的最后一步“结果处理”中,选择“保存至输入文件夹”选项。
单击对话框底部的“Finish”。最后一步是按照文本方案中所述,对每个样本的VCF文件进行变异注释。本视频中演示的方法已应用于ONDRI项目中招募的528名参与者的DNA样本。
在22次运行中,每次运行24个样本,使用ONDRISeq panel进行测序。总体而言,测序数据质量较高,平均样本覆盖深度为78倍。平均有95.6%的读段比对至参考序列,所有ONDRISeq运行中比对上的读段均超过90%。
在比对上的读段中,92.0% 的读段 Phred 质量评分大于或等于 Q30。为了展示该靶向 NGS 工作流程的应用价值,本文提供了一名 68 岁男性帕金森病患者的示例,结果显示 N 值输出降低。所有注释的变异均经过审慎筛选,以识别出最可能具有临床意义的变异,这些变异以红色方框标示。
在执行该实验流程时,重要的是需根据所使用的测序平台、富集试剂盒以及具体研究需求,对各个步骤进行适当的调整。该技术在开发后,为遗传学领域的研究人员提供了高质量、特定区域的测序数据,同时相较于全外显子组和全基因组测序方法,成本更低。
靶向二代测序是一种经济高效的方法,可用于识别与疾病相关的遗传变异,特别是神经退行性疾病。本方案概述了测序流程及相关的生物信息学分析步骤。
采用稳健的生物信息学流程进行靶向下一代测序(NGS),可对已知的遗传决定因素在先天性疾病和神经退行性疾病中的作用进行精确分析。该方法能够高置信度地识别变异,支持早期发现和转化研究,同时优化资源分配。其高效性和可扩展性使其成为以项目组合为导向的研发机构获取可操作遗传信息的战略性工具。
这一靶向NGS与生物信息学工作流程整合了从早期发现到转化研究的全过程,实现了从变异识别到功能验证的衔接。