2020年3月11日
我们此前已验证了一种基于扩增子的乌苏图病毒(USUV)全基因组测序方案,该方案在纳米孔测序平台上进行。本文中,我们对所使用的方法进行了更详细的描述,并确定了纳米孔R10流通池的错误率。
我们利用病毒基因测序来探究病毒的来源及其传播方式。为了能够实时使用这些数据(例如在疫情暴发期间),我们必须准确了解所提供数据的精确程度。这些技术的主要优势在于成本相对较低、速度快,并且能够实现实时碱基编码,可用于现场测序。
该方法可用于及时生成序列数据,例如用于确定多种病原体的来源。对于初次使用者而言,该技术可能较为复杂,需要具备基本的 Unix 知识,尤其是在安装不同软件包时。
本方法的可视化将帮助用户确定其特定测序方案的错误率,并解答科研问题。测序运行在连接至 MinIT 的 MinION 上启动。
在 Nanopore 平台上完成测序后,将数据加载到 Porechop 中。为防止污染并提高准确性,使用 require_two_barcodes 标志,并按照所示命令输入。去多重后,使用 cutadapt 去除引物序列以及长度短于 75 个核苷酸的序列,具体命令如所示。
使用 Minimap2 将去多重化的序列读段比对到不同参考株的面板上。然后使用 Samtools 生成一致性序列。对于基于参考序列的比对,必须使用生成的一致性序列进行 blast 搜索,以鉴定最接近的参考株。
然后以最接近的参考菌株作为参考序列,重复基于参考的比对。为了确定为补偿Nanopore测序错误谱所需的测序深度,选择比对到一个扩增子的序列,并使用Minimap2将Nanopore测序读段比对至该扩增子。使用Samtools仅筛选比对到Amplicon26的读段,并按照所示命令将bam文件转换为fastq格式。
例如,随机选择 200 条序列读长的子集,重复一千次。将所有随机选出的序列读长比对至 Amplicon26。使用 KMA 软件,依据 BC nano 标志所示的 Nanopore 测序优化参数,对序列读长进行比对并立即生成一致性序列。
要检查生成的共识序列,请使用所示命令。要显示统计信息文件(stats dot txt)中“错误率:错配碱基/比对”标题下的错误率,请使用所示命令。要显示“每循环插入缺失数”标题下的插入缺失数量,请使用所示命令。
使用新型流动池结合碱基颜色翻转技术,40倍测序深度的结果与Illumina测序结果一致。30倍测序深度的错误率为0.02%,相当于每测序585,000个核苷酸出现一个错误。而20倍测序深度则相当于每测序63,529个核苷酸出现一个错误。
10 倍的测序深度会导致每 3,312 个测序的核苷酸中出现一个错误,这意味着每四个乌苏图病毒基因组中就有超过 3 个核苷酸被错误识别。当测序深度超过 30 倍时,则不会观察到插入缺失突变(indels)。
20倍的测序深度可检测到1个插入缺失位点,而10倍的测序深度则可检测到29个插入缺失位点。需要牢记最重要的一点是,尽管软件更新并不总是显而易见,但其更新频繁,可能对结果产生影响。目前有多种可用的软件选择。
我们已经演示了最常用的程序。但不同的软件以及同一软件的不同版本可能会导致不同的结果。我们向您展示了一个示例,说明如何检查我们生成的序列数据的质量。
这对于可靠的疫情应对至关重要。
本研究详细介绍了一种经过验证的基于扩增子的乌苏图病毒(USUV)全基因组测序方案,采用纳米孔测序平台进行。文中详细描述了实验方法,重点在于确定与纳米孔R10流通池相关的错误率。
准确的病毒基因组测序对于实时疫情应对和基因组流行病学至关重要。了解不同测序平台特有的错误率有助于为公共卫生决策生成可靠的数据。通过与已建立的测序平台进行比对验证纳米孔测序结果,可确保病原体追踪和传播分析的可靠性。
该方法适用于从初始检测到基因组表征的病毒发现工作流程,通过精确的毒株追踪,支持抗病毒药物研发中的先导化合物鉴定。