2019年1月25日
本实验方案的目的是结合计算研究与实验研究,寻找那些难以从共纯化序列中分离出来的新型序列,这些序列可能仅有部分被知晓。
本方案的重要意义在于,可用于鉴定那些无法从共纯化序列中分离出来的基因组序列,而这些共纯化序列本身可能也仅有部分信息是已知的。该技术的主要优势在于成本低廉,主要使用可免费下载的开源软件,且具有高度灵活性。您可将该方法应用于多种生物学问题的研究中。
潜在应用包括鉴定细菌疫苗靶点,以及鉴定序列与已知微生物差异极大的病毒。只要能够获得不含基因组目标序列的参考序列,该方法即可应用于任何无法通过实验手段将未知成分分离的体系。该技术需要经过一定的尝试与优化,因此耐心至关重要。
您可能需要对程序进行故障排查。您可以使用与本文所述不同的程序。请尽可能参考用户手册。
该方法的可视化演示非常有帮助,因为计算工作依赖于对命令行编程结构的基本理解。首先,使用 Trimmomatic 0.32 去除 illumina 接头序列和低质量碱基。然后,使用 Pear 0.9.11 版本,以默认参数将 Trimmomatic 输出的成对读段合并,生成高质量的拼接读段。
然后使用 Reptile 1.1 版本对通过 Pear 生成的测序读段进行纠错。最后在默认模式下使用 Trinity 2.4.0 版本对纠错后的序列进行拼接。对于链特异性文库,请使用 SS_lib_type 参数。
输出为一个 FASTA 文件,将被保存至名为 trinity_output 的新目录中。在命令行中为参考序列 nucleotide_reference.fasta 建立一个 BLAST 数据库。
BLAST 将查询序列与参考数据库进行比对。要获得输出文件,请使用 BLAST_results.txt。为生成后续 Python 脚本处理步骤所需的表格格式输出,请使用 outfmt 6。为提高比对严格性,可使用组装得到的蛋白序列作为 BLAST 查询序列,并采用翻译核酸 BLAST(translated nucleotide BLAST),后者会对核酸数据库进行六框翻译。
为了获得查询序列的蛋白质序列,运行 TransDecoder.LongOrfs 命令以识别从组装好的查询序列中得到的最长开放阅读框。然后运行 tblastn。
如有必要,使用 db_gencode 并选择适当的编码选项,确保为所研究的生物体选择正确的遗传密码。如果有高质量的蛋白质参考序列,应使用 blastp 进行蛋白质-蛋白质比对,而不是 tblastn。建立该蛋白质参考序列的 BLAST 数据库。务必将结果保存为文件以供后续分析,并使用表格格式输出,以确保 Python 脚本能够正确解析结果。
现在,使用减法 Python 脚本去除任何匹配的序列。为了将测序读段比对到组装结果上,可使用 BWA-MEM Version 0.7.12 或 bowtie 2 将下载的原始测序读段比对到查询组装序列上。首先,对组装序列进行索引,然后将读段进行比对。
输出结果为 SAM 格式。使用 SAM 文件作为输入,运行 Python 脚本 removeUnmapped.py。
该步骤可识别出无匹配读段的查询序列名称,并将其保存至一个新的文本文件中。上一步骤的输出结果为一个包含序列名称的 txt 文件。从中提取出这些序列,生成一个 FASTA 文件。
输出结果将是一个fasta文件。使用Genius手动确定最佳引物序列。为正向引物选择一段21至28个碱基对的候选序列,避免出现四个或更多相同碱基的连续序列。
尽量选择一个碱基对组成相对均匀的区域。在3'端有一个单独的G或C是有利的,有助于引物的结合。在屏幕右侧点击“统计”标签,当候选区域被高亮显示时,可查看该序列的估计熔解温度。
引物的熔解温度应控制在55至60摄氏度之间,避免出现重复序列以及连续的G或C碱基。反向引物的设计原则相同,应位于正向引物3'端下游150至250个碱基对范围内。引物长度不必完全一致,但预测的熔解温度应尽可能与正向引物接近。在Genius软件中选中序列后,通过右键菜单中的选项对序列进行反向互补操作。
另一种方法是使用序列窗口顶部工具栏中的引物设计(Primer Design)功能。在“目标区域”(Target Region)下插入需要扩增的区域。在“特性”(characteristics)选项卡下,输入所需的引物长度、熔解温度(melting temperature)以及 G-C 含量百分比(per cent G C),然后点击“确定”(OK)以生成引物。
为了对剩余序列进行定量PCR验证,首先为每个模板准备三份反应混合液,包含SYBR Green Master Mix、正向引物和反向引物以及水,总体积为25 µL。根据先前已验证的退火温度和延伸时间设置qPCR程序。首次使用引物进行qPCR时,至少应生成最终的熔解曲线,以确认扩增产物为单一DNA片段。
通过Ct值将qPCR SYBR Green信号相对于肌动蛋白(Actin)进行测量。在所有情况下,计算相对于肌动蛋白的2的Ct次方的平均值和标准偏差。进行终点凝胶电泳,以确认qPCR检测到的产物大小正确。在此,将25微升qPCR产物与5微升6X Glitterol染料混合后,于2% TAE琼脂糖凝胶中以200伏电压电泳20分钟。
如果您的 qPCR 结果显示未鉴定到目标序列,请使用新的参考序列重复整个流程,新参考序列可从在线数据库中获取。本案例中的消减文库项目始于对成年雄性和雌性斑胸草雀生殖系组织 RNA 的测序。最终,共鉴定出 935 个此前未被纳入全基因组注释的体细胞基因。
经过计算过滤后,定量 PCR 可能产生阴性结果,即在不同鸟类组织间的检测无差异。相反,当基因组 DNA 的 qPCR 显示目标组织中的检测信号显著高于参照组织时,则确认为阳性结果,代表已鉴定出真实靶序列。在此案例中,alpha snap 基因被验证为生殖系限制性基因,因其在体细胞组织中的含量相对于睾丸 DNA 显著降低,而在睾丸 DNA 中其含量与肌动蛋白(Actin)相当。
在进行每一步计算时,务必记住使用正确的输入。可能需要多次重复循环减法步骤,才能获得目标序列或多个目标序列。可对发现的基因进行多种系统发育、结构和功能分析。
这些附加方法有助于深入了解基因的进化和功能作用。我们鉴定了鸣禽生殖系限制性染色体上的首个基因,这一发现使人们对这一出人意料的基因组元件产生了更广泛的关注。后续研究显示,在许多鸣禽物种中存在类似的染色体,并包含大量其他基因。
查看完整文字稿并访问数千部科学视频
本方案能够实现对难以从共纯化序列中分离的基因组序列进行鉴定。该方法结合了计算分析与实验操作技术,可广泛应用于多种生物学研究。
减法基因组学能够识别出无法从复杂混合物中物理分离的新型基因组序列,解决了疫苗开发和抗病毒研究中靶点发现的关键瓶颈问题。该方法通过在计算中将已知的参考序列从混合基因组数据中扣除,可在物理纯化不可行或成本过高的情况下支持早期靶点验证。此方法通过提供一种可扩展且低成本的途径来发现病毒抗原或细菌毒力因子等具有生物学意义的序列,从而提高先导靶点识别的预测可信度。
该方法适用于早期发现阶段,可在先导化合物生成和临床前评估之前,实现以假设为驱动的靶点鉴定,尤其适用于基因组复杂性掩盖靶点序列的情况。