需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

适用于非专业人士的系统发育学实用指南

35.4K 次观看

DOI:

10.3791/50975

2014年2月5日

本文内容

摘要

本文介绍了一种从核苷酸或氨基酸序列数据集中生成可靠系统发育树的逐步分析流程。本指南旨在为初次接触系统发育分析的研究人员或学生提供帮助。 

摘要

许多研究人员在极为多样的研究领域中都将系统发育学应用于其研究问题。然而,许多研究人员对该主题尚不熟悉,因此会面临固有的困难。本文为非专业人士汇编了一份系统发育学的实用入门指南。 我们以逐步说明的方式,介绍了一套从基因序列数据集生成可靠系统发育树的分析流程。首先提供通过在线界面及本地可执行程序进行相似性搜索工具的用户指南;接着探讨用于生成多序列比对的程序,随后介绍使用软件确定最优进化模型的方案;然后概述通过最大似然法和贝叶斯准则重建系统发育关系的协议 ,最后描述可视化系统发育树的工具。尽管本文远非对系统发育方法的全面综述,但它为读者提供了系统发育学家常用关键软件应用的实用入门信息。本文的目标是为刚开始进行系统发育研究的研究人员提供一种实用的培训工具 ,同时也可作为可融入课堂或教学实验室的教育资源。

引言

为了理解两个(或更多)物种是如何进化的,首先需要从每个样本中获取序列或形态学数据;这些数据代表了可用于衡量它们在进化空间中相互关系的量化信息。就像测量线性距离一样,可获得的数据越多(例如 英里、英寸、微米),测量结果就越精确。因此,研究人员推断进化距离的准确性在很大程度上取决于可用于衡量关系的信息数据量。此外,由于不同样本以不同的速率和不同的机制进化,我们用来衡量两个分类单元之间关系的方法也直接影响进化测量的准确性。 因此,由于进化关系并非直接观察所得,而是从序列或形态学数据中推断出来的,推断进化关系的问题就成为一个统计学问题。系统发育学是生物学的一个分支,致力于将统计模型应用于进化模式,以最优地重建分类单元之间的进化历史。这种分类单元之间的重建称为该分类单元的系统发育关系(phylogeny)。

为了帮助弥合分子生物学家与进化生物学家之间的专业知识差距,本文介绍了一套从序列集合推断系统发育关系的逐步操作流程。首先,我们详细描述了如何通过网络界面以及使用本地可执行程序,利用基本局部比对搜索工具(Basic Local Alignment Search Tool, BLAST1)算法进行数据库检索的各个步骤;这通常是获取与未知查询序列相似的一组序列列表的第一步。尽管如此,部分研究人员也可能希望通过Phylota等网络接口(http://www.phylota.net/)收集特定类群的数据。BLAST是一种用于将原始氨基酸或核苷酸序列数据与序列数据库进行比对,以搜索与查询序列相似的“匹配”序列的算法。该程序由美国国立卫生研究院(National Institutes of Health, NIH)的Stephen Altschul et al. 设计开发1。BLAST服务器包含多个不同的程序,以下是一些最常用的BLAST程序列表:

i) 核苷酸-核苷酸BLAST(blastn):该程序需要输入一段DNA序列,并返回用户指定的DNA数据库中最相似的DNA序列(例如,针对某一特定生物体)。

ii) 蛋白质-蛋白质BLAST(blastp): 此处用户输入一条蛋白质序列,程序将从用户指定的蛋白质数据库中返回最相似的蛋白质序列。

iii) 位点特异性迭代 BLAST (PSI-BLAST) (blastpgp):用户输入一条蛋白质序列,程序返回一组密切相关蛋白质,并基于该数据集生成一个保守的序列谱型。随后,仅使用这些保守的“基序”生成新的查询序列,用于搜索蛋白质数据库,从而获得更大范围的蛋白质序列;从中提取出新的一组保守“基序”,再次用于数据库搜索。此过程不断重复,直至获得更广泛的蛋白质序列并生成新的谱型。通过在每一步迭代中将相关蛋白质纳入查询序列,该程序可帮助用户识别出序列差异更大的同源序列。

iv) 核苷酸六框翻译-蛋白质(blastx): 此处用户提供核苷酸序列输入,该序列被转换为六框概念翻译产物(两条链)并与蛋白质序列数据库进行比对。

v) 核苷酸六框翻译-核苷酸六框翻译(tblastx):该程序以DNA核苷酸序列为输入,将输入序列翻译成所有六个阅读框的理论翻译产物,并将其与核苷酸序列数据库的六框翻译产物进行比对。

vi) 蛋白质-核苷酸六框翻译(tblastn):该程序使用蛋白质序列作为输入,与核苷酸序列数据库的所有六个阅读框进行比对。

接下来,我们介绍从序列数据集中生成多序列比对(Multiple Sequence Alignment, MSA)的常用程序,随后提供用于确定序列数据集最优进化模型的程序使用指南。系统发育重建是一个统计学问题,因此系统发育分析方法需要纳入统计学框架。该统计学框架即为进化模型,用于描述数据集中序列的变化过程。该进化模型包含一组关于核苷酸或氨基酸替换过程的假设,针对特定数据集的最优模型可通过统计检验来选择。通过似然比检验(LRTs)或信息准则,可比较不同模型对数据的拟合优度,从而在一组可能的模型中选出最优模型。两种常用的信息准则为赤池信息准则(Akaike information criterion, AIC)2和贝叶斯信息准则(Bayesian information criterion, BIC)3。在获得最优比对结果后,可采用多种不同方法基于比对数据构建系统发育树。推断进化关系的方法众多,大致可分为两类:基于距离的方法和基于序列的方法。基于距离的方法通过计算序列间的成对距离,再利用这些距离构建系统发育树;基于序列的方法则直接使用序列比对结果,通常依据某种最优性标准搜索树空间。本文概述两种基于序列的系统发育关系重建方法:其一是实现最大似然法框架的 PhyML4,其二是采用贝叶斯马尔可夫链蒙特卡洛(Bayesian Markov Chain Monte Carlo)推断的 MrBayes5。最大似然法与贝叶斯方法为系统发育重建提供了统计学框架。通过向读者介绍常用的建树工具及其使用方法,我们阐明了推断系统发育关系所需的关键数据信息。

访问受限。请登录或开始试用以查看此内容。

方案

1. 基本局部比对搜索工具(BLAST):在线界面

  1. 点击此链接访问美国国家生物技术信息中心(NCBI)的 BLAST1 网络服务器。 - http://blast.ncbi.nlm.nih.gov/Blast.cgi (图 1)。
  2. 将一条 FASTA 格式的文本序列(示例见图 2)输入到查询框中。
  3. 选择适当的 BLAST 程序以及用于搜索的相关数据库或特定物种,然后点击“BLAST”。
    注意:FASTA 格式的序列以一条描述行开始,该行以“>”符号标识;描述内容必须紧随“>”符号之后,序列(核苷酸或氨基酸)则位于下一行。BLAST 搜索结果可显示为 HTML、纯文本、XML 或命中表格(文本或 csv 格式),默认输出格式为 HTML(图 3)。

2. 基本局部比对搜索工具(BLAST):本地可执行程序

  1. 从以下链接下载最新的 BLAST 命令行可执行程序:
    ftp://ftp.ncbi.nlm.nih.gov/blast/executables/blast+/LATEST/ -
  2. em>对于 PC 用户:双击最新的 blast win32.exe 文件,接受许可协议并点击安装。
    注意:默认安装目录为 C:\ncbi-blast-2.2.27+。
  3. 按如下方式配置 PC 环境变量:
    1. 点击 PC 的“开始”按钮,然后右键单击“计算机”;
    2. 点击“属性”,在弹出窗口中点击“高级”选项卡;
    3. 点击“环境变量”按钮,在新弹出窗口的“用户变量”部分点击“新建”按钮;
    4. 在弹出窗口中添加变量名为“Path”,变量值为“C:\ncbi-blast-2.2.27+\bin。
      注意: bin 目录包含可执行文件( blastp、 )。
  4. em>对于 Mac 用户:打开终端应用程序(只需打开“Finder”并搜索“Terminal”,即可显示“terminal”图标)。在终端窗口中输入:
    >ftp ftp.ncbi.nih.gov
    注意:也可输入上述 PC 示例中使用的 URL
  5. 访问 NCBI ftp 站点时,在 Name 和 Password 处输入“anonymous”,然后输入:
    >cd blast/executables/LATEST
  6. 通过输入以下命令列出可执行文件:
    >ls
  7. 输入以下命令(或当前最新的版本号)获取最新版本:
    >get ncbi-blast-2.2.7-macosx.tar.gz
  8. 输入“exit”退出 NCBI ftp 服务器站点。
  9. 通过输入以下命令解压已下载的文件:
    >tar -xzf ncbi-blast-2.2.7-macosx.tar.gz
  10. 将 blast 可执行文件的二进制文件所在路径添加到您的 PATH 中,以便 shell 在查找命令时能搜索该目录,输入:
    >PATH=$PATH:new_folder_location
  11. 通过输入以下命令检查是否已将路径添加至 PATH:
    >echo $PATH
  12. 点击此处下载已预格式化的 BLAST 数据库(每日更新):
    ftp://ftp.ncbi.nlm.nih.gov/blast/db/
  13. 将数据库放入“db”文件夹中。
  14. em>在 PC 上:打开 MS-DOS 命令提示符(点击“开始”并在搜索栏中输入“cmd”),然后输入以下命令将目录更改为 ncbi-blast 文件夹:
    C:\Users>cd ..\ [向上移动一个文件夹]
    C:\>cd ncbi-blast-2.2.27+
    这将把目录更改为:
    C:\ncbi-blast-2.2.27+>
  15. 使用以下“makedb”命令创建数据库:
    >makedb –in db/briggsae.fasta –dbtype prot –out db/briggsae
    注意: 在下文示例(图 4)中,数据库命名为“briggsae”,由生物体 Caenorhabditis briggsae 的一条连锁群组成。
  16. 通过将一条 FASTA 格式的蛋白质序列文本插入“db”文件夹中,创建一个名为“test”的查询蛋白序列。
  17. 通过输入以下命令执行 blastp 搜索以查询数据库:
    >blastp –query db/test.txt –db db/briggsae –out text.txt
  18. em>在 Mac 上:通过按照上述说明(步骤 2.4)访问 NCBI ftp 网站,下载用于本地 Blast 搜索的数据库,然后输入:
    >lcd ../databases/
  19. 输入以下命令下载感兴趣的基因组或序列:
    >get NC_[Accession #].fna
    注意: “.fna”表示 FASTA 格式的核苷酸序列,“.faa”表示 FASTA 格式的氨基酸序列。
  20. 输入“quit”退出 ftp 站点。
  21. 输入以下命令创建数据库:
    >makeblastdb -in db/mouse.faa -out mouse -dbtype prot
  22. 将一条 FASTA 格式的查询序列插入“bin”文件夹,并使用以下命令查询数据库:
    > blastp -query “your query.fasta” -db ”your database” -out results.txt

3. 生成多序列比对

  1. 点击以下链接以访问常用的多序列比对(MSA)程序:
    ClustalW6 http://www.clustal.org/
    Kalign7 http://msa.sbc.su.se/cgi-bin/msa.cgi
    MAFFT8,9 http://mafft.cbrc.jp/alignment/software/
    MUSCLE10 http://www.drive5.com/muscle/
    T-Coffee11 http://www.tcoffee.org/Projects/tcoffee/
    PROBCONS12 http://toolkit.tuebingen.mpg.de/probcons
  2. 点击此链接 - http://tcoffee.crg.cat/apps/tcoffee/do:regular - 并将FASTA格式的序列数据输入查询框中
    注: T-Coffee的示例输出见图5,相似残基以颜色编码。
  3. 点击此链接下载Clustal MSA的命令行版本(ClustalW)或图形化版本(ClustalX):http://www.clustal.org/clustal2/ - 然后点击相应的可执行文件(例如 win、Linux、Mac OS X)。
  4. 上传FASTA格式的序列文本数据并进行比对(图6)。

4. 确定最优进化模型

  1. 单击此处下载 ProtTest13 程序:
    http://darwin.uvigo.es/our-software/
  2. ProtTest 下载完成后,双击 ProtTest.jar 文件
  3. 启动 ProtTest 后,单击“select file”并加载序列数据(图7).
  4. 然后点击“start”,程序将开始运行(图8).
    注意: 运行结束后(图8),程序将根据标准指示最佳模型 例如 根据AIC的最佳模型:WAG+I+G

5. 基于最大似然法或贝叶斯推断推断序列系统发育树

  1. 在此处下载 PhyML4
    https://code.google.com/p/phyml/
  2. 双击相应的应用程序(例如 phyml Windows、phyml Linux, 等等)启动可执行文件,界面窗口将弹出(图9)。
  3. 通过输入以下命令加载 PHYLIP 格式的输入序列:
    >“文件名”.phy
    注意: 如需在不同序列格式之间转换,请使用位于以下网址的“Readseq”网络程序:http://iubio.bio.indiana.edu/cgi-bin/readseq.cgi
  4. 输入“Y”以启动程序。
  5. 在此处下载 MrBayes5
    http://mrbayes.sourceforge.net/download.php
  6. 单击可执行文件以启动程序,并通过输入以下命令将 NEXUS 格式的序列数据读入程序:
    >execute “文件名”.nex
  7. 设定进化模型。
  8. 通过输入以下命令设置运行的代数:
    >mcmcp ngen = 1000000 [此命令将运行代数设为 1000000]
    >sump burnin =10000 [此命令将 burnin 设为 10000]
  9. 通过输入以下命令在结果文件中保存分支长度:
    >mcmcp savebrlens = yes 
  10. 输入以下命令运行分析:
    >mcmc
  11. 使用“sumt”命令对生成的树进行汇总。

6. 系统发育树的可视化

  1. 在此查看树形图查看程序列表:
    http://www.treedyn.org/overview/editors.html
  2. 在此下载 TreeView14 程序:
    http://taxonomy.zoology.gla.ac.uk/rod/treeview.html

访问受限。请登录或开始试用以查看此内容。

结果

寻找与查询序列的相似性可使研究人员为新序列赋予潜在身份,并推断序列之间的关系。BLAST1的文件输入类型为FASTA格式的文本序列或GenBank登录号。FASTA格式的序列以一个由“>”符号标记的描述行开头(图2)。描述内容必须紧接在“>”符号之后,序列(核苷酸或氨基酸)则位于下一行。在保存和编辑序列文件时,最好使用文本编辑器,例如PC上的“记事本”或Mac上的TextWrangler(http://www.barebones.com/products/textwrangler/)。BLAST算法执行“局部”比对,即搜索短片段序列的相似性。算法首先查找查询序列中所有可能的“片段”,并尽可能延伸这些序列,然后为每对查询序列构建比对结果。理解这些比对结果的可靠性至关重要,因此BLAST对每个匹配结果应用统计学评估,包括期望值(E值)和比特分值(bit score)。E值用于指示匹配结果的统计学显著性,E值越低,匹配结果越显著。例如,E值为0....

访问受限。请登录或开始试用以查看此内容。

讨论

本文旨在为系统发育学领域的新手研究人员或学生提供一个入门起点。近年来,基因组测序项目的成本不断降低,导致对该技术的用户需求持续增长,如今小型实验室生成大规模序列数据集已成为常态。这些数据集通常为研究人员提供一系列基因,而要初步理解其功能,则需要借助系统发育框架。此外,由于系统发育学正被越来越多的研究实验室所采用,本文也希望作为对生物学研究广泛感兴趣的学生的一种教育工具。通过向用户提供常用建树工具在“为何使用”、“如何使用”以及“在何处使用”方面的信息,我们为读者熟悉这些应用及其工作原理提供了基本框架。然而,我们建议读者尝试调整每种工具中的各项设置,以理解不同参数如何影响其序列数据,并确保在每种情况下平台与软件之间的兼容性。上述分析是在一台配备 Intel Core i7 处理器的 Dell Optiplex 990 台式机和一台配备 Intel Core 2 Duo 处理器的 MacBook 笔记本电脑上完成的,但分析速度以及具体的二进制版本(例如 32 位或 64 位)将取决于用户的平台。

编写系统发育学这类用户指南面临的一个挑战是,系统发育学以及整个生物信息学...

访问受限。请登录或开始试用以查看此内容。

披露

我们没有需要披露的内容。 

致谢

感谢O’Halloran实验室成员对本文稿的评论。感谢乔治华盛顿大学生物科学系以及哥伦布艺术与科学学院为D. O’Halloran提供的经费支持。

访问受限。请登录或开始试用以查看此内容。

材料

参考文献

  1. Altschul, S. F., Carroll, R. J., Lipman, D. J. Weights for data related by a tree. J. Mol. Biol. 207 (4), 647-653 (1989).
  2. Akaike, H. A new look at the statistical model identification. IEEE Trans. Automat. Contr. 19 (6), 706-723 (1974).
  3. Schwarz, G. Estimating the dimension of a model. Ann. Stat. 6 (2), 461-464 (1978).
  4. Guindon, S., Gascuel, O. A simple, fast, and accurate algorithm to estimate large phylogenies by maximum likelihood. Syst. Biol. 52 (5), 696-704 (2003).
  5. Huelsenbeck, J. P., Ronquist, F. MRBAYES: Bayesian inference of phylogenetic trees. Bioinformatics. 17 (8), 754-755 (2001).
  6. Thompson, J. D., Higgins, D. G., Gibson, T. J. CLUSTAL W: Improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and weight matrix choice. Nucleic Acids Res. 22 (22), 4673-4680 (1994).
  7. Lassmann, T., Sonnhammer, E. L. Kalign--an accurate and fast multiple sequence alignment algorithm. BMC Bioinformatics. 6, 298 (2005).
  8. Katoh, K., Kuma, K., Toh, H., Miyata, T. MAFFT version 5: Improvement in accuracy of multiple sequence alignment. Nucleic Acids Res. 33 (2), 511-518 (2005).
  9. Katoh, K., Misawa, K., Kuma, K., Miyata, T. MAFFT: A novel method for rapid multiple sequence alignment based on fast fourier transform. Nucleic Acids Res. 30 (14), 3059-3066 (2002).
  10. Edgar, R. C. MUSCLE: Multiple sequence alignment with high accuracy and high throughput. Nucleic Acids Res. 32 (5), 1792-1797 (2004).
  11. Notredame, C., Higgins, D. G., Heringa, J. T-coffee: A novel method for fast and accurate multiple sequence alignment. J. Mol. Biol. 302 (1), 205-217 (2000).
  12. Do, C. B., Mahabhashyam, M. S., Brudno, M., Batzoglou, S. ProbCons: Probabilistic consistency-based multiple sequence alignment. Genome Res. 15 (2), 330-340 (2005).
  13. Darriba, D., Taboada, G. L., Doallo, R., Posada, D. ProtTest 3: Fast selection of best-fit models of protein evolution. Bioinformatics. 27 (8), 1164-1165 (2011).
  14. Page, R. D. TreeView: An application to display phylogenetic trees on personal computers. Comput. Appl. Biosci. 12 (4), 357-358 (1996).
  15. Darriba, D., Taboada, G. L., Doallo, R., Posada, D. jModelTest 2: More models, new heuristics and parallel computing. Nat. Methods. 9 (8), 772 (2012).
  16. Chevenet, F., Brun, C., Banuls, A. L., Jacq, B., Christen, R. TreeDyn: Towards dynamic graphics and annotations for analyses of trees. BMC Bioinformatics. 7, 439 (2006).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

序列比对Blast 搜索最大似然法贝叶斯推断多序列比对系统发育树可视化模型选择进化分析基因序列