本文描述了一种基于真核生物SWEET蛋白与原核生物SemiSWEET蛋白序列同源性构建系统发育树的方法。系统发育分析是揭示不同生物类群间同源蛋白或基因进化关系的有力工具。
方法文章
* These authors contributed equally
本文描述了一种基于真核生物SWEET蛋白与原核生物SemiSWEET蛋白序列同源性构建系统发育树的方法。系统发育分析是揭示不同生物类群间同源蛋白或基因进化关系的有力工具。
系统发育分析利用核苷酸或氨基酸序列或其他参数(如结构域序列和三维结构)构建系统发育树,以展示不同分类单元(分类单位)在分子水平上的进化关系。系统发育分析还可用于研究单个分类单元内部的结构域关系,尤其适用于那些在形态学和生理学上发生显著变化但缺乏化石证据的生物体,这可能是因为这些生物具有漫长的进化历史或化石保存极为稀少。
本文详细描述了一种使用系统发育方法的实验方案,包括利用 Clustal Omega 进行氨基酸序列比对,以及随后采用分子进化遗传学分析软件(MEGA)的最大似然法(ML)和通过 MrBayes 实现的贝叶斯推断法构建系统发育树。为探究真核生物Sugars Will Eventually be Exported Transporters(SWEET)基因的起源,共分析了228个SWEET蛋白,其中包括来自单细胞真核生物的35个SWEET蛋白和来自原核生物的57个SemiSWEET蛋白。有趣的是,SemiSWEET仅存在于原核生物中,而SWEET则存在于真核生物中。采用理论上不同的两种方法构建的系统发育树均一致 表明,首个真核生物SWEET基因可能起源于细菌SemiSWEET基因与古菌SemiSWEET基因的融合。 值得注意的是,尽管系统发育分析有助于解释不同分类单元之间难以甚至无法通过实验手段揭示的内在关系,但在仅基于系统发育分析时应谨慎得出结论。
DNA 或 RNA 序列携带了决定表型的遗传信息,这些信息可通过生理学和生物化学方法进行分析,或通过形态学及化石证据加以观察。从某种意义上说,遗传信息比评估外部表型更为可靠,因为前者是后者的根本基础。在进化研究中,化石证据非常直接且具有说服力。然而,许多生物体(如微生物)在漫长的地质年代中极难形成化石。因此,来自现存相关生物的分子信息,例如核苷酸序列和氨基酸序列,在探索进化关系方面具有重要价值1。本研究为需要自行构建系统发育树的新手提供了基础系统发育学知识的简要介绍以及易于掌握的操作流程。
DNA(核苷酸)序列和蛋白质(氨基酸)序列均可用于推断同源基因、细胞器甚至生物体之间的系统发育关系2。在进化过程中,DNA序列更易发生改变。相比之下,由于核苷酸序列中的同义突变不会导致氨基酸序列的改变,因此氨基酸序列更为稳定。因此,DNA序列适用于亲缘关系较近的生物体之间同源基因的比较,而氨基酸序列则适用于亲缘关系较远的生物体之间同源基因的比较3。
系统发育分析始于氨基酸或核苷酸序列的比对4 从注释基因组测序数据库中获取5 以 FASTA 格式列出, 即,推定或已表达的蛋白质序列、RNA序列或DNA序列。值得注意的是,获取高质量的序列对分析至关重要,且仅能使用同源序列来分析系统发育关系。多种不同平台可用于序列比对,例如Clustal W、Clustal X、Muscle、T-coffee、MAFFT等,其中应用最广泛的是Clustal Omega6,7 (http://www.ebi.ac.uk/Tools/msa/clustalo/),可在线使用或免费下载。该比对工具提供多种参数供用户在开始比对前进行调整,但在大多数情况下,默认参数已能获得良好结果。比对完成后,应以正确格式保存比对后的序列。随后需使用序列编辑软件(如 BioEdit)对序列进行编辑或修剪,因为 MEGA 构建系统发育树要求所有序列长度相等(包括氨基酸缩写和连字符)。在比对序列中,任何不含氨基酸或核苷酸的位置均以连字符表示。 "-")。通常应去除比对结果两端所有突出的氨基酸或核苷酸。此外,比对中包含序列错配严重的列也可删除,因为这些列提供的信息价值很低,有时甚至会产生混淆或错误的信息3含有一个或多个连字符的列可在此时或后续建树阶段删除,也可保留用于系统发育分析。完成序列比对与修剪后,应将比对好的序列以FASTA格式或所需格式保存,以供后续使用。
许多软件平台提供了基于不同方法或算法的系统发育树构建功能。通常,这些方法可分为距离矩阵法和离散数据法两类。距离矩阵法计算简单且快速,而离散数据法较为复杂且耗时。对于序列相似性较高、氨基酸或核苷酸序列同源性较强的近缘分类单元,适合采用距离矩阵法(如邻接法:NJ;非加权组平均法:UPGMA);而对于远缘相关的分类单元,则以离散数据法(如最大似然法:ML;最大简约法:MP;贝叶斯推断法)为最优选择3,8。在本研究中,采用 MEGA(6.0.6)中的最大似然法(ML)和贝叶斯推断法(MrBayes 3.2)构建系统发育树9。理想情况下,当使用合适的模型和参数时,不同方法所得结果可能一致,因而更具可靠性与说服力。
使用 MEGA10 构建最大似然法(ML)系统发育树时,必须将 FASTA 格式的比对序列文件上传至程序。第一步是为上传的数据选择最优的核苷酸或氨基酸替换模型。程序会根据上传的序列对所有可用的替换模型进行比较,并在结果表中显示各自的评分。选择贝叶斯信息准则(BIC)得分最小的模型(表中列在首位的模型),按照推荐模型设置 ML 参数,然后开始计算。计算时间从几分钟到数天不等,具体取决于所加载数据的复杂程度(序列长度和分类单元数量)以及运行程序的计算机性能。计算完成后,系统发育树将在新窗口中显示。将文件保存为 "FileName.mat"。在设置参数以确定系统发育树的显示样式后,再次保存文件。通过此方法,MEGA 可生成适用于发表的高质量系统发育树图件。
使用 MrBayes11 构建系统发育树的第一步是将比对后的序列(通常以 FASTA 格式列出)转换为 nexus 格式(文件类型为 .nex)。FASTA 文件向 nexus 格式的转换可在 MEGA 软件中完成。随后,可将 nexus 格式的比对序列上传至 MrBayes。文件成功上传后,需为系统发育树的计算指定详细参数。这些参数包括氨基酸替代模型、变异速率、马尔可夫链蒙特卡洛(MCMC)耦合的链数、ngen 数、分割频率的平均标准差等。在设定好这些参数后,启动计算。最终,屏幕上将显示两个以 ASCII 代码表示的树状图,其中一个显示分支支持度(clade credibility),另一个显示分支长度。
系统将自动保存树状图结果为"FileName.nex.con"文件。该树状图文件可用FigTree打开并编辑,且在FigTree中显示的图像可进一步修改,以使其更适用于发表。
本研究以228种SWEET蛋白为例进行了分析,其中包括来自单细胞真核生物的35种SWEET蛋白和来自原核生物的57种SemiSWEET蛋白。SWEET蛋白和SemiSWEET蛋白均被鉴定为能够跨膜转运葡萄糖、果糖或蔗糖的转运蛋白12,13。系统发育分析表明,含有两个MtN3/saliva结构域的SWEET蛋白可能起源于细菌SemiSWEET与古菌的进化融合事件14。
访问受限。请登录或开始试用以查看此内容。
1. 序列比对
2. 系统发育树的计算
3. 系统发育树的展示
注意:使用 MEGA 完成计算后,将显示系统发育 ML 树(图 10)。
4. 利用序列比对分析SWEETs与SemiSWEETs之间的关系
注意:此步骤在常规序列分析中可能不需要。
5. 使用 MrBayes 构建系统发育树
访问受限。请登录或开始试用以查看此内容。
系统发育树显示,35个SWEET序列的全部第一个MtN3/唾液酸域聚为一个分支,而SWEET序列的第二个MtN3/唾液酸域则聚为另一个分支。此外,SWEET与SemiSWEET序列的比对结果表明,来自α-变形菌纲(α-Proteobacteria)的一些SemiSWEET与SWEET序列的第一个MtN3/唾液酸域对齐,而来自甲烷杆菌纲(Methanobacteria,古菌)的SemiSWEET则与SWEET序列的第二个MtN3/唾液酸域对齐。这些结果共同提示,含有两个MtN3/唾液酸域的SWEET蛋白可能起源于一种细菌SemiSWEET与一种古菌SemiSWEET在进化过程中的融合事件14。
访问受限。请登录或开始试用以查看此内容。
在生物学研究中,基于核苷酸或氨基酸 序列构建系统发育树的方法正变得越来越普遍8。通常,该过程包括三个关键步骤:序列比对、采用合适的方法或算法对比对后的序列进行评估,以及将计算结果以系统发育树的形式进行可视化。在本研究中,共进行了三轮序列比对:首先,对SWEET蛋白序列(包含第一和第二MtN3/saliva结构域)进行比对;其次,将SWEET蛋白中各个独立的MtN3/saliva结构域序列作为独立分类单元进行收集并联合比对;最后,将SemiSWEET序列与SWEET序列共同进行联合比对。通常情况下,构建系统发育树仅需进行一轮序列比对即可。
在初步阶段,可以从NCBI或其他数据库下载同源序列。如果这些下载的序列注释不完整,可能需要进行筛选。在第一和第二阶段,如果序列格式不正确,则无法启动比对和计算。例如,Clustal Omega将拒绝任何不符合FASTA格式的序列文件。在计算阶段,需注意在使用MEGA进行评估之前,序列长度(包括氨基酸或核苷酸以及连字符)必须相等。
尽管现...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本工作得到国家自然科学基金(31371596)、三峡大学生物技术研究中心(2016KBC04)和中国江苏省自然科学基金(BK20151424)的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Adobe Illustrator | 由 Adobe Systems Software Ireland Ltd. 开发的图形工具。版权所有 © 2017 | ||
| BioEdit | 为 Windows 95/98/NT/2000/XP/7 系统编写的生物序列比对编辑器。版权所有 © Tom Hall | ||
| Clustal Omega | 用于进行氨基酸或核苷酸序列多序列比对的软件包。 http://www.clustal.org/ | ||
| CorelDRAW | 一款图形设计软件。版权所有 © 2017 Corel Corporation | ||
| FigTree | 由爱丁堡大学设计的系统发育树图形可视化工具 | ||
| MEGA | 分子进化遗传学分析软件 6.0 版 http://www.megasoftware.net/home | ||
| MrBayes | 一种基于贝叶斯推断的系统发育分析工具 | ||
| NVIDIA | 一家为游戏和专业市场设计图形处理器(GPU)的公司。版权所有 © 2017 Corporation | ||
| PAUP | 基于最大简约法的系统发育分析软件。David Swofford 开发的程序在多种核苷酸模型下实现了最大似然法 | ||
| Photoshop | 由 Adobe Systems Software Ireland Ltd. 开发和发布的位图图形编辑器。版权所有 © 2017 | ||
| RHYTHM | 一种基于知识的六螺旋接触预测工具。Charité Berlin – 蛋白质信息学小组 - 版权所有 2007-2009 | ||
| TMHMM | 一种用于预测蛋白质中跨膜螺旋的工具。http://www.cbs.dtu.dk/services/TMHMM/ | ||
| 计算机 | 4 GB 内存,Core 2 或更高版本的 CPU,Windows 7 或 Windows 10 操作系统 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可