方法文章

ITS2 数据库

33.5K 次观看

DOI:

10.3791/3806

2012年3月12日

本文内容

摘要

ITS2数据库是一个用于系统发育推断的工作平台,可同时分析内转录间隔区2(ITS2)的序列及其二级结构。该平台包含数据收集与精确注释、结构预测、序列-结构多序列比对以及快速建树等功能。简而言之,该工作平台将初步的系统发育分析简化为几次简单的点击操作。

摘要

内转录间隔区2(ITS2)作为系统发育标记已被使用了二十多年。由于ITS2研究主要集中在高度变异的ITS2序列上,这使得该标记仅限于低分类阶元的系统发育分析。然而,将ITS2序列与其高度保守的二级结构相结合,能够提高系统发育分辨率1,并可在多个分类等级上进行系统发育推断,包括物种界定2-8

ITS2数据库9提供了一个来自NCBI GenBank11的内部转录间隔区2(ITS2)序列的详尽数据集,并进行了准确的重新注释10。在通过轮廓隐马尔可夫模型(HMMs)进行注释后,预测每条序列的二级结构。首先,检测基于最小自由能的折叠方法12(直接折叠)是否能形成正确的四螺旋构型。若不能,则采用同源建模方法13预测其结构。在同源建模中,将已知的二级结构迁移至另一条ITS2序列,该序列无法通过直接折叠形成正确的二级结构。

ITS2 数据库不仅是一个用于存储和检索 ITS2 序列-结构的数据库,还提供了多种工具来处理您自己的 ITS2 序列,包括基于序列-结构联合信息的注释、结构预测、基序检测以及 BLAST14 搜索。此外,该数据库整合了 4SALE15,16 和 ProfDistS17 的精简版本,用于进行多序列-结构比对计算以及邻接法18 系统发育树的构建。这些工具共同构成了一个连贯的分析流程,可从一组初始序列出发,基于序列和二级结构信息推导出系统发育关系。

简而言之,该工作平台将最初的系统发育分析简化为仅需几次鼠标点击即可完成的操作,同时还提供了用于全面大规模分析的工具和数据。

方案

1. ITS2序列的正确注释

  1. 在此处访问 ITS2 数据库系统发育工作台:http://its2.bioapps.biozentrum.uni-wuerzburg.de
  2. 在“工具”部分点击“注释”图标以开始分析。然后,在网站顶部的序列编辑器中输入或粘贴您的序列。序列编辑器将自动检查您的 ITS2 序列是否有效。
  3. 选择适用于您序列的 HMM 模型(例如,植物选择 Viridiplantae)。
  4. 点击“注释”以启动流程。
  5. 将鼠标悬停在“杂交”图标上,可查看 5.8S 与 28S rRNA 杂交结构的图像,以验证 HMM 注释的准确性。
  6. 点击结果 ITS2 序列旁的绿色加号,选择二级结构预测方式:若无需已知模板进行结构预测,请点击“预测结构”;若希望使用自定义模板进行同源建模,请点击“建模结构”。

2. 二级结构预测

  1. 预测
    1. 已注释的 ITS2 序列将自动粘贴到序列编辑器中。
    2. 若要使用默认设置开始二级结构预测,请点击“Predict structures”按钮。
    3. 通过点击绿色加号,然后选择“Add to pool”,将生成的包含建模二级结构的 ITS2 序列保存至数据池。或者,您也可以通过拖放方式将其添加至数据池(图 1)。
    4. 如果序列无法直接折叠,则会显示同源建模的最佳结果。请通过拖放方式将最合适的序列-结构组合保存至数据池。或者,通过右键点击,然后选择“Add to pool”来保存该序列-结构组合。
  2. 自定义建模
    1. 在上方的序列编辑器中输入或粘贴一个或多个具有已知结构的模板序列。
    2. 在下方的序列编辑器中输入或粘贴一个或多个无结构的靶序列。
    3. 点击“Predict best template(s)”以使用默认设置启动同源建模。
    4. 结果列表中将显示最佳的模板-靶序列组合。
    5. 可通过拖放至数据池,或通过右键点击后选择“Add to pool”,将您选定的建模后的序列-结构保存至数据池。

3. 模体搜索

  1. 在网站顶部的序列编辑器中输入或粘贴您的查询序列。
  2. 选择正确的 HMM 模型(例如,植物选择 Viridiplantae)。 3.3. 点击“Motif search”以启动流程。
  3. 带有高亮显示基序的 ITS2 序列将在网站底部展示。
  4. 点击序列标题旁的图标,以在二级结构中显示高亮的基序。

4. 搜索与浏览

  1. 搜索
    1. 在网站顶部的搜索框中输入分类单元名称或 GenBank 标识符(GI)。
    2. 输入分类单元名称时,系统将自动弹出实时搜索框以提供支持。
    3. 可通过逗号分隔多个查询词进行批量搜索。
    4. 点击“搜索”按钮以执行搜索。
    5. 搜索结果将在新标签页中以列表形式显示。
    6. 点击某一列的列名可按该列对结果进行排序。您也可通过列菜单添加或移除指定的列,列菜单可通过点击列名旁出现的箭头图标进入。
    7. 点击“显示详情”以查看某条序列-结构对的详细信息。
    8. 可通过拖放至数据池,或右键点击后选择“添加到池”来保存您选定的序列-结构对。
    9. 若要将结果保存至外部文件,请点击“保存所选”或“保存全部”。
  2. 浏览
    1. 通过网站左侧的树状结构导航,浏览 ITS2 数据库。
    2. 点击加号可展开下一级分类单元。
    3. 点击分类单元名称,将在新标签页中打开该分类单元包含的所有序列-结构对。
    4. 点击“显示详情”以查看某对序列-结构的详细信息。
    5. 可通过拖放至数据池,或右键点击后选择“添加到池”来保存您选定的序列-结构对。
    6. 若要将结果保存至外部文件,请点击“保存所选”或“保存全部”。

5. ITS2 Blast

  1. 在序列编辑器中输入或粘贴一条或多条查询序列。您的序列可以是普通的核苷酸序列,也可以是序列-结构对。您也可以在一条序列下方输入多个二级结构。勾选“序列化 XXFASTA 序列”复选框后,这些结构将被用作独立的查询项。
  2. 若要使用默认设置启动 BLAST,请点击“Blast”按钮。根据您的查询类型,系统将执行标准的 BLASTN 或 ITS2 序列-结构 BLAST。
  3. 在出现的“BLAST 结果”标签页内,每条查询序列都会生成一个子标签页,同时还会显示已执行搜索的概览。
  4. 点击“显示比对结果”以查看计算得到的 BLAST 比对结果。
  5. 通过拖放操作将您选择的 BLAST 结果保存至数据池,或通过右键点击并选择“添加到池中”进行保存。
  6. 若要将结果保存为外部文件,请点击“保存选中项”或“保存全部”。

6. 多序列-结构比对

  1. 点击“管理数据集”,然后点击数据池中序列数量旁边的放大镜图标,查看您的数据池。或者,您也可以点击网站左下角的数据池标志。
  2. 点击数据池中的一个序列-结构对,以查看其详细信息。
  3. 若要对数据池中所有序列-结构对创建多序列-结构比对,请点击“分析数据集”,然后选择“序列与结构”。
  4. 此时系统将提示您选择比对的图形显示模式。如果您的比对仅包含少量序列,请点击“否”以取消简洁模式;否则,请点击“是”选择简洁图形模式。
  5. 片刻之后,您的比对结果将在新标签页中显示(图2)。此外,该比对结果将自动保存至数据池中。
  6. 若要将比对结果保存为外部文件,请点击“保存比对”。

7. 系统发育树

  1. 要基于多序列比对结果计算序列-结构的邻接树,请点击“Analyze Dataset”,然后选择“Neighbor Joining”。
  2. 生成的系统发育树将在新标签页中显示(图3)。
  3. 可通过滚动条“Zoom tree”自由调整树状图的缩放比例。
  4. 通过点击树中的某个节点或叶节点,然后选择“Reroot at this node”,可对系统发育树重新定根。
  5. 若要从数据集中移除某一分类单元,请点击对应的叶节点并选择“Remove this node from pool”。随后,您可基于减少分类单元后的取样重新计算比对结果和系统发育树。
  6. 点击“Save tree”,可将系统发育树作为分析的最终结果保存为外部的 NEWICK 文件。

8. 其他软件

  1. 点击“关于本网站”-“工具”,以获取有关独立工具 4SALE 和 ProfDistS 的更多详细信息。
  2. 除了 ITS2 数据库网页界面提供的比对和邻接法功能外,您现在还可以使用多种新功能,例如基于互补碱基变化(CBCs)的物种界定。

9. 代表性结果

上述工作流程已成功应用于多项开放获取调查3,4。示例可通过以下链接查看:

在这些大规模研究中,我们能够以高分辨率解析绿藻门(Chlorophyta)以及灰藓目(Hypnales,苔藓植物门)的系统发育关系。在这两个案例中,均从 ITS2 数据库9中获取了全面的分类单元取样,使用 4SALE15,16 进行自动序列-结构比对,最后通过 ProfDistS17 构建系统发育树。所有这些步骤均同时利用了序列与结构信息。系统发育骨架的自展支持率通过轮廓邻接法(Profile Neighbor Joining, PNJ)19 获得,该方法可在 ProfDistS 的独立版本中使用。

对于少量序列-结构配对,图1至图3在新的ITS2数据库工作台上演示了该自动化工作流程5的关键步骤:物种取样、多序列-结构比对,以及最终的系统发育树构建。

figure-protocol-1
图1. 通过拖放进行分类单元取样。在任何时候,均可通过拖放等方式将序列或序列-结构对添加至数据池中。此处是在完成二级结构预测后,通过拖放方式添加一个序列-结构对。蓝色椭圆标示了将序列-结构对拖入数据池的区域。 点击此处查看该图像的完整尺寸版本。

figure-protocol-2
图2. 全图形模式下的多序列-结构比对。对于数据池中的少数序列,选择了全图形模式。碱基以不同颜色显示;通过点击碱基对中的一个碱基或括号,可用红色圆圈高亮显示该碱基对。点击此处查看该图像的完整尺寸版本。

figure-protocol-3
图3. 序列-结构邻接树。基于七个分类单元的多序列-结构比对所计算出的可自由缩放的系统发育树,可保存为NEWICK格式。

讨论

ITS2 数据库是一个完整且功能完备的基于内转录间隔区 2(ITS2)序列-结构的系统发育学工作平台。该网站操作极为快速且直观。与其他仅能处理序列和/或共识结构信息的基于网页的系统发育工作平台(如 ARB20 或 Mobyle21)不同,ITS2 数据库9能够同时考虑每个分类单元的序列及其各自的二级结构。然而,由于网页服务器计算能力的限制,对于大规模数据集,强烈建议分别使用独立工具 4SALE15,16 和 ProfDistS17 进行多序列比对和邻接法(Neighbor Joining)18 分析。除了基本的 ITS2 序列-结构系统发育分析流程5 外,这些工具还具备多种附加功能,例如计算自举重复值(bootstrap replicates)、轮廓邻接法(Profile Neighbor Joining, PNJ)19,或基于互补碱基变化(compensatory base changes, CBCs)8 的物种界定分析。这些工具可通过“关于本网站”-“工具”部分进行下载并获取详细信息。使用 4SALE 和 ProfDistS 时,必须始终将文件转换为正确的格式。供 4SALE 处理的分类单元采样文件必须以 .fasta 或 .txt 为扩展名,而作为 ProfDistS 输入的序列-结构比对文件则必须以 .xfasta 为扩展名。

我们目前正在 ITS2 数据库及相关工具中实施用于系统发育树构建的替代方法。因此,基于序列-结构的简约法22和/或最大似然法23将在未来提供使用。

披露

未声明任何利益冲突。

致谢

我们诚挚感谢维尔茨堡大学生物中心ITS2团队提供的丰富而宝贵的反馈。同时感谢德国研究基金会(DFG;资助号 Mu-2831/1-1)提供的经费支持。

材料

本文使用的材料清单
姓名公司目录编号评论
互联网接入建议使用高速网络
ITS2 数据库9维尔茨堡大学网站:http://its2.bioapps.biozentrum.uni-wuerzburg.de
软件:4SALE15,16维尔茨堡大学下载地址:http://4sale.bioapps.biozentrum.uni-wuerzburg.de/
软件:ProfDistS17维尔茨堡大学下载地址:http://profdist.bioapps.biozentrum.uni-wuerzburg.de/

参考文献

  1. Keller, A. Including RNA secondary structures improves accuracy and robustness in reconstruction of phylogenetic trees. Biology Direct. 5, 4-4 (2010).
  2. Schultz, J., Maisel, S., Gerlach, D., Müller, T., Wolf, M. A common core of secondary structure of the internal transcribed spacer 2 (ITS2) throughout the Eukaryota. RNA. 11, 361-364 (2005).
  3. Buchheim, M. Internal Transcribed Spacer 2 (nu ITS2 rRNA) Sequence-Structure Phylogenetics: Towards an Automated Reconstruction of the Green Algal Tree of Life. PLoS ONE. 6, 16931-16931 (2011).
  4. Merget, B., Wolf, M. A molecular phylogeny of Hypnales (Bryophyta) inferred from ITS2 sequence-structure data. BMC Research Notes. 3, (2010).
  5. Schultz, J., Wolf, M. ITS2 sequence-structure analysis in phylogenetics: a how-to manual for molecular systematics. Molecular Phylogenetics and Evolution. 52, 520-523 (2009).
  6. Coleman, A. ITS2 is a double-edged tool for eukaryote evolutionary comparisons. Trends in Genetics. 19, 370-375 (2003).
  7. Coleman, A. The significance of a coincidence between evolutionary landmarks found in mating affinity and a DNA sequence. Protist. 151, 1-9 (2000).
  8. Müller, T., Philippi, N., Dandekar, T., Schultz, J., Wolf, M. Distinguishing species. RNA. 13, 1469-1472 (2007).
  9. Koetschan, C. The ITS2 Database III-sequences and structures for phylogeny. Nucleic Acids Research. 38, 275-279 (2010).
  10. Keller, A. 5.8 S-28S rRNA interaction and HMM-based ITS2 annotation. Gene. 430, 50-57 (2009).
  11. Benson, D., Karsch-Mizrachi, I., Lipman, D., Ostell, J., Sayers, E. GenBank. Nucleic Acids Research. 39, 32-37 (2011).
  12. Markham, N., Zuker, M. Software for nucleic acid folding and hybridization. Methods in Molecular Biology. , 453-453 (2008).
  13. Wolf, M., Achtziger, M., Schultz, J., Dandekar, T., Müller, T. Homology modeling revealed more than 20,000 rRNA internal transcribed spacer 2 (ITS2) secondary structures. RNA. 11, 1616-1623 (2005).
  14. Altschul, S. Gapped BLAST and PSI-BLAST: a new generation of protein database search programs. Nucleic Acids Research. 25, 3389-3402 (1997).
  15. Seibel, P., Müller, T., Dandekar, T., Wolf, M. Synchronous visual analysis and editing of RNA sequence and secondary structure alignments using 4 SALE. BMC Research Notes. 1, (2008).
  16. Seibel, P., Müller, T., Dandekar, T., Schultz, J., Wolf, M. 4 SALE - A tool for synchronous RNA sequence and secondary structure alignment and editing. BMC Bioinformatics. 7, (2006).
  17. Wolf, M., Ruderisch, B., Dandekar, T., Schultz, J., Müller, T. ProfDistS:(profile-) distance based phylogeny on sequence-structure alignments. Bioinformatics. 24, 2401-2402 (2008).
  18. Saitou, N., Nei, M. The neighbor-joining method: a new method for reconstructing phylogenetic trees. Molecular Biology and Evolution. 4, 406-425 (1987).
  19. Müller, T., Rahmann, S., Dandekar, T., Wolf, M. Accurate and robust phylogeny estimation based on profile distances: a study of the Chlorophyceae (Chlorophyta. BMC Evolutionary Biology. 4, (2004).
  20. Ludwig, W. olfgang ARB: a software environment for sequence data. Nucleic Acids Research. 32, 1363-1371 (2004).
  21. Néron, B. Mobyle: a new full web bioinformatics framework. Bioinformatics. 25, 3005-3011 (2009).
  22. Camin, J. H., Sokal, R. R. A method for deducing branching sequences in phylogeny. Evolution. 19, 311-326 (1965).
  23. Felsenstein, J. Evolutionary trees from DNA sequences: a maximum likelihood approach. Journal of Molecular Evolution. 17, 368-376 (1981).

重印与许可

标签

二级结构预测同源建模序列注释基序检测BLAST 搜索多序列比对邻接法进化树系统发育分析序列-结构比对