2014年2月5日
这里,我们描述了一步一步管道,用于从核苷酸或氨基酸序列数据集可靠的系统发育。本指南的目的是服务于研究人员或学生对新的系统发育分析。
本文的总体目标是从 DNA 或蛋白质序列重建可靠的系统发育树。这是通过首先使用 NCBI 的 blast 程序识别相似序列来实现的。第二步是对齐相似的序列。
接下来,根据比对确定最适合的进化模型。最后一步是从比对的序列中推断系统发育关系。最终,分步管道用于展示用户如何从序列数据转向可靠的系统发育。
这种方法可以通过推断新序列的身份和功能来帮助回答不同领域的关键问题。要使用基本本地比对搜索工具或 BLAST 的在线版本,请导航到国家生物技术信息中心或 NNC B 的 Blast Web 服务器。单击相应的 blast 程序。
在查询框中输入 FASTA 格式的文本序列,如此处所示的文本序列。单击要在搜索中使用的相应 blast 程序,然后单击 blast。默认情况下,输出为 HTML 格式,并显示与输入文本序列最相似的序列。
下一部分介绍如何在 Windows Mac 上使用本地 blast 可执行文件。用户可以跳到以下名为 Blast Local executables for Macs x 的部分。要在 Windows 计算机上运行 blast 命令行程序,请从 NCBI blast 网站下载相应的 Windows 可执行文件。
安装 Blast 程序后,按照如下方式配置 PC 环境变量,点击 PCs start 按钮,然后右键单击 computer。然后单击 properties.在新窗口中,选择 advanced system settings,然后在新弹出窗口的 advanced 选项卡中,单击 environment variables 按钮。
然后在 user variables for user 部分,单击 new 按钮。在新弹出窗口中,添加变量名称 path 和此处显示的变量值。接下来,下载预先格式化的 Blast 数据库,该数据库每天从 NCBI 网站或特定生物体的基因组更新。
然后通过单击开始并在搜索栏中键入 CMD 打开 MS DOS 提示符,然后切换到 NCBI blast 文件夹。使用此处显示的 Make blast DB 命令创建数据库。通过将 FASTA 格式的蛋白质文本序列插入 DB 文件夹,创建名为 test 的查询蛋白质序列。
然后,为了识别与测试蛋白最相似的序列,通过 blast P 查询命令查询数据库。以下部分为 Mac 用户重复此信息。Windows 用户可以跳到生成多个序列比对的第 5 部分。
要在 Mac 上运行 blast 命令行程序,请通过远程访问 N-C-B-I-F-T-P 站点下载相应的 MAC 可执行文件。为此,请打开 finder 并在终端窗口中搜索 terminal,键入 N-C-B-I-F-T-P 站点的 FTP 地址。键入 anonymous 作为名称和密码,然后键入 CD blast slash executables slash latest。
键入 LS 列出可执行文件,然后键入以下内容下载符合您的系统要求的最新版本。现在,解压缩下载的文件。现在,将 blast 可执行文件的二进制文件的位置添加到您的路径中,以便 shell 可以搜索此目录。
查找命令时,请从 NCBI 网站下载预先格式化的 blast 数据库或基因组。通过键入 CD genomes 搜索 genomes 目录。然后按如下方式下载感兴趣的基因组或序列,然后键入 quit 退出 FTP 站点。
接下来,通过键入 Make Blast DB 指令创建数据库。将 FASTA 格式的查询序列插入 bin 文件夹,并使用 blast P 查询命令查询数据库,以在常用的多序列比对或 MSA 程序中找到与测试序列数据最相似的序列是茶咖啡。在 tea coffee site 的查询框中输入 fasta 格式化的序列数据后,输出通过颜色编码表示相似的残基。
另一个常用的 MSA 程序是 clusteral MSA,它可以作为命令行版本、CLUSTERAL W 或图形版本 CLUSTERAL X 下载,适用于各种作系统。接下来,通过选择 file 选项卡,以格式化序列文本的速度将数据加载到群集程序中。然后单击 load sequences 按钮。
现在切换到 align 选项卡,然后单击 do complete alignment 按钮以对齐序列以获得最佳拟合的进化模型。下载抗议程序。下载 protest 后,双击 protest。
启动抗议后,单击对齐框中的 select file 以加载序列数据。然后点击 Start 开始 运行程序。完成运行后,程序会根据推理序列的标准指示最佳模型。
下载并启动 Phi ML 后,通过键入文件名和 PY 将输入序列加载为文件 lip 格式序列。然后键入 y 启动程序。从 Mr Bays 网站下载贝叶斯推理程序后,单击可执行文件启动该程序。然后通过键入 execute file name dot NEX 将 Nexus 格式的序列数据读入程序。
接下来,设置进化模型并选择要运行的代数。使用 mc mc 命令运行分析后,使用 sum T 命令汇总树以查看系统发育树。下载树状视图程序。
最后一点,不断发布旨在提供更好的比对、相似性预测或系统发育树的新软件。虽然此视频中的概述涵盖了热门程序,但鼓励观众探索其他选项。Blast 算法执行局部比对,从而搜索短段序列相似性。
在算法从查询序列中查找所有可能的 stretch 并最大限度地扩展这些序列后,它会组装比对。对于每个查询序列对,e 值表示匹配的统计显著性。E 值越低,命中越显著。
例如,E 值为 0.05 的序列对齐意味着此匹配仅偶然发生的可能性为 100 分之 5。BIT 分数使用特定的评分矩阵来指示对齐的好坏。BIT 分数越高,对齐效果越好。
多序列比对或 MSA 是由氨基酸、DNA 或 RNA 组成的三个或多个一级序列的序列比对。这里看到的 MSA 茶咖啡的输出,颜色编码了类似的残留物。此处显示了使用簇 X 比对的 6 个蛋白质序列的样品比对,用于氨基酸比对。
程序抗议用于确定氨基酸替代的最佳拟合模型的选择。在数据中,该程序列出了正在分析的模型,并在程序完成后显示最佳拟合,Phi ML 根据核苷酸或氨基酸序列的比对估计最大可能性系统发育。它包含大量与各种选项耦合的替换模型,以搜索树拓扑空间。
贝叶斯先生在许多进化模型中利用贝叶斯 CMC 推理来重建系统发育关系。程序运行后,可以按特定时间间隔查看进度,如下所示。生成系统发育树后,需要对拓扑进行可视化。
在此图中,树视图窗口显示了来自果蝇的蛋白质样本树。基础。树视图包括一个树编辑器,允许用户移动分支和重新路由树。在尝试此过程时,请务必记住仔细阅读每个程序的用户指南。
该协议提供了一个实用的起点,向读者介绍这些程序是如何工作的。但是,我鼓励读者尝试并熟悉与每个程序相关的许多设置。
查看完整文字稿并访问数千部科学视频
本文介绍了从DNA或蛋白质序列重建可靠系统发育树的逐步管道。它专为新接触系统发育分析的研究人员和学生设计。
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.