本文介绍了一种从核苷酸或氨基酸序列数据集中生成可靠系统发育树的逐步分析流程。本指南旨在为初次接触系统发育分析的研究人员或学生提供帮助。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种从核苷酸或氨基酸序列数据集中生成可靠系统发育树的逐步分析流程。本指南旨在为初次接触系统发育分析的研究人员或学生提供帮助。
许多研究人员在极为多样的研究领域中都将系统发育学应用于其研究问题。然而,许多研究人员对该主题尚不熟悉,因此会面临固有的困难。本文为非专业人士汇编了一份系统发育学的实用入门指南。 我们以逐步说明的方式,介绍了一套从基因序列数据集生成可靠系统发育树的分析流程。首先提供通过在线界面及本地可执行程序进行相似性搜索工具的用户指南;接着探讨用于生成多序列比对的程序,随后介绍使用软件确定最优进化模型的方案;然后概述通过最大似然法和贝叶斯准则重建系统发育关系的协议 ,最后描述可视化系统发育树的工具。尽管本文远非对系统发育方法的全面综述,但它为读者提供了系统发育学家常用关键软件应用的实用入门信息。本文的目标是为刚开始进行系统发育研究的研究人员提供一种实用的培训工具 ,同时也可作为可融入课堂或教学实验室的教育资源。
为了理解两个(或更多)物种是如何进化的,首先需要从每个样本中获取序列或形态学数据;这些数据代表了可用于衡量它们在进化空间中相互关系的量化信息。就像测量线性距离一样,可获得的数据越多(例如 英里、英寸、微米),测量结果就越精确。因此,研究人员推断进化距离的准确性在很大程度上取决于可用于衡量关系的信息数据量。此外,由于不同样本以不同的速率和不同的机制进化,我们用来衡量两个分类单元之间关系的方法也直接影响进化测量的准确性。 因此,由于进化关系并非直接观察所得,而是从序列或形态学数据中推断出来的,推断进化关系的问题就成为一个统计学问题。系统发育学是生物学的一个分支,致力于将统计模型应用于进化模式,以最优地重建分类单元之间的进化历史。这种分类单元之间的重建称为该分类单元的系统发育关系(phylogeny)。
为了帮助弥合分子生物学家与进化生物学家之间的专业知识差距,本文介绍了一套从序列集合推断系统发育关系的逐步操作流程。首先,我们详细描述了如何通过网络界面以及使用本地可执行程序,利用基本局部比对搜索工具(Basic Local Alignment Search Tool, BLAST1)算法进行数据库检索的各个步骤;这通常是获取与未知查询序列相似的一组序列列表的第一步。尽管如此,部分研究人员也可能希望通过Phylota等网络接口(http://www.phylota.net/)收集特定类群的数据。BLAST是一种用于将原始氨基酸或核苷酸序列数据与序列数据库进行比对,以搜索与查询序列相似的“匹配”序列的算法。该程序由美国国立卫生研究院(National Institutes of Health, NIH)的Stephen Altschul et al. 设计开发1。BLAST服务器包含多个不同的程序,以下是一些最常用的BLAST程序列表:
i) 核苷酸-核苷酸BLAST(blastn):该程序需要输入一段DNA序列,并返回用户指定的DNA数据库中最相似的DNA序列(例如,针对某一特定生物体)。
ii) 蛋白质-蛋白质BLAST(blastp): 此处用户输入一条蛋白质序列,程序将从用户指定的蛋白质数据库中返回最相似的蛋白质序列。
iii) 位点特异性迭代 BLAST (PSI-BLAST) (blastpgp):用户输入一条蛋白质序列,程序返回一组密切相关蛋白质,并基于该数据集生成一个保守的序列谱型。随后,仅使用这些保守的“基序”生成新的查询序列,用于搜索蛋白质数据库,从而获得更大范围的蛋白质序列;从中提取出新的一组保守“基序”,再次用于数据库搜索。此过程不断重复,直至获得更广泛的蛋白质序列并生成新的谱型。通过在每一步迭代中将相关蛋白质纳入查询序列,该程序可帮助用户识别出序列差异更大的同源序列。
iv) 核苷酸六框翻译-蛋白质(blastx): 此处用户提供核苷酸序列输入,该序列被转换为六框概念翻译产物(即两条链)并与蛋白质序列数据库进行比对。
v) 核苷酸六框翻译-核苷酸六框翻译(tblastx):该程序以DNA核苷酸序列为输入,将输入序列翻译成所有六个阅读框的理论翻译产物,并将其与核苷酸序列数据库的六框翻译产物进行比对。
vi) 蛋白质-核苷酸六框翻译(tblastn):该程序使用蛋白质序列作为输入,与核苷酸序列数据库的所有六个阅读框进行比对。
接下来,我们介绍从序列数据集中生成多序列比对(Multiple Sequence Alignment, MSA)的常用程序,随后提供用于确定序列数据集最优进化模型的程序使用指南。系统发育重建是一个统计学问题,因此系统发育分析方法需要纳入统计学框架。该统计学框架即为进化模型,用于描述数据集中序列的变化过程。该进化模型包含一组关于核苷酸或氨基酸替换过程的假设,针对特定数据集的最优模型可通过统计检验来选择。通过似然比检验(LRTs)或信息准则,可比较不同模型对数据的拟合优度,从而在一组可能的模型中选出最优模型。两种常用的信息准则为赤池信息准则(Akaike information criterion, AIC)2和贝叶斯信息准则(Bayesian information criterion, BIC)3。在获得最优比对结果后,可采用多种不同方法基于比对数据构建系统发育树。推断进化关系的方法众多,大致可分为两类:基于距离的方法和基于序列的方法。基于距离的方法通过计算序列间的成对距离,再利用这些距离构建系统发育树;基于序列的方法则直接使用序列比对结果,通常依据某种最优性标准搜索树空间。本文概述两种基于序列的系统发育关系重建方法:其一是实现最大似然法框架的 PhyML4,其二是采用贝叶斯马尔可夫链蒙特卡洛(Bayesian Markov Chain Monte Carlo)推断的 MrBayes5。最大似然法与贝叶斯方法为系统发育重建提供了统计学框架。通过向读者介绍常用的建树工具及其使用方法,我们阐明了推断系统发育关系所需的关键数据信息。
访问受限。请登录或开始试用以查看此内容。
1. 基本局部比对搜索工具(BLAST):在线界面
2. 基本局部比对搜索工具(BLAST):本地可执行程序
3. 生成多序列比对
4. 确定最优进化模型
5. 基于最大似然法或贝叶斯推断推断序列系统发育树
6. 系统发育树的可视化
访问受限。请登录或开始试用以查看此内容。
寻找与查询序列的相似性可使研究人员为新序列赋予潜在身份,并推断序列之间的关系。BLAST1的文件输入类型为FASTA格式的文本序列或GenBank登录号。FASTA格式的序列以一个由“>”符号标记的描述行开头(图2)。描述内容必须紧接在“>”符号之后,序列(即核苷酸或氨基酸)则位于下一行。在保存和编辑序列文件时,最好使用文本编辑器,例如PC上的“记事本”或Mac上的TextWrangler(http://www.barebones.com/products/textwrangler/)。BLAST算法执行“局部”比对,即搜索短片段序列的相似性。算法首先查找查询序列中所有可能的“片段”,并尽可能延伸这些序列,然后为每对查询序列构建比对结果。理解这些比对结果的可靠性至关重要,因此BLAST对每个匹配结果应用统计学评估,包括期望值(E值)和比特分值(bit score)。E值用于指示匹配结果的统计学显著性,E值越低,匹配结果越显著。例如,E值为0....
访问受限。请登录或开始试用以查看此内容。
本文旨在为系统发育学领域的新手研究人员或学生提供一个入门起点。近年来,基因组测序项目的成本不断降低,导致对该技术的用户需求持续增长,如今小型实验室生成大规模序列数据集已成为常态。这些数据集通常为研究人员提供一系列基因,而要初步理解其功能,则需要借助系统发育框架。此外,由于系统发育学正被越来越多的研究实验室所采用,本文也希望作为对生物学研究广泛感兴趣的学生的一种教育工具。通过向用户提供常用建树工具在“为何使用”、“如何使用”以及“在何处使用”方面的信息,我们为读者熟悉这些应用及其工作原理提供了基本框架。然而,我们建议读者尝试调整每种工具中的各项设置,以理解不同参数如何影响其序列数据,并确保在每种情况下平台与软件之间的兼容性。上述分析是在一台配备 Intel Core i7 处理器的 Dell Optiplex 990 台式机和一台配备 Intel Core 2 Duo 处理器的 MacBook 笔记本电脑上完成的,但分析速度以及具体的二进制版本(例如 32 位或 64 位)将取决于用户的平台。
编写系统发育学这类用户指南面临的一个挑战是,系统发育学以及整个生物信息学...
访问受限。请登录或开始试用以查看此内容。
我们没有需要披露的内容。
感谢O’Halloran实验室成员对本文稿的评论。感谢乔治华盛顿大学生物科学系以及哥伦布艺术与科学学院为D. O’Halloran提供的经费支持。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。