4.15
生物体的整个基因组无法被测序为连续的序列——即使是最新一代的测序技术,也会从数千个长度为50-1000 bp的短DNA片段中产生断裂的数据。
这些短的DNA序列——称为reads——需要经过组装,以重建基因组的完整序列,该过程称为基因组组装。
任何新一代基因组组装主要包括四个步骤:原始数据分析、重叠群组装、序列挂载,最后是填补空缺。
第一步是分析获取的原始数据质量,然后剔除任何受污染、存在偏差或质量较差的序列读长,特别是那些含有大量未知核苷酸的读长。
接下来,对干净的 reads 进行修剪,以去除其末端的接头序列。同时,片段末端未达到质量阈值的任何碱基也会被修剪掉。
然后,使用一种合适的组装工具,根据重叠的DNA片段将测序读段组装成连续的序列——称为重叠群(contigs)。
当存在近缘物种的参考基因组时,可采用比较基因组组装方法来指导新基因组的重建。在此方法中,测序读段被比对到参考基因组上,从而为基因组组装的后续步骤提供框架。
或者, 从头合成 在缺乏参考基因组的情况下,需要进行基因组组装。在此过程中,利用重叠的测序读段将序列定向排列成更长的重叠群(contigs)。
下一步,成对的短序列读段——即重叠群末端突出的读段—— 用于基因组的支架构建。
当相邻的重叠群之间的序列未知时,其间隙会用 N 填充。然而,如果使用长度超过 1 kb 的长读长序列将重叠群连接在一起,则这些间隙可以用实际的序列填充。
结果是获得一个组装完成的基因组,随后需要借助自动化工具对其进行注释,这一过程称为基因组注释。
基因组注释的两个主要目标是基因结构和基因功能预测,通常分别称为结构注释和功能注释。
结构注释可识别基因组元件,如编码区、调控基序等;而功能注释则有助于准确确定这些结构元件的生物学功能,特别是蛋白质编码基因的功能。
基因组注释工具利用现有数据作为新注释的参考,这些数据包括已知的转录本、蛋白质或信号序列、来自其他已测序基因组的预测基因,以及保守结构域的特征信号。
一旦软件将这些可用数据比对到草图基因组上,就需要通过人工或使用注释工具进行过滤和优化,以获得最终的基因注释集合。