需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

利用系统发育分析研究真核生物基因的起源

14.5K 次观看

DOI:

10.3791/56684

2018年8月14日

* These authors contributed equally

本文内容

摘要

本文描述了一种基于真核生物SWEET蛋白与原核生物SemiSWEET蛋白序列同源性构建系统发育树的方法。系统发育分析是揭示不同生物类群间同源蛋白或基因进化关系的有力工具。

摘要

系统发育分析利用核苷酸或氨基酸序列或其他参数(如结构域序列和三维结构)构建系统发育树,以展示不同分类单元(分类单位)在分子水平上的进化关系。系统发育分析还可用于研究单个分类单元内部的结构域关系,尤其适用于那些在形态学和生理学上发生显著变化但缺乏化石证据的生物体,这可能是因为这些生物具有漫长的进化历史或化石保存极为稀少。

本文详细描述了一种使用系统发育方法的实验方案,包括利用 Clustal Omega 进行氨基酸序列比对,以及随后采用分子进化遗传学分析软件(MEGA)的最大似然法(ML)和通过 MrBayes 实现的贝叶斯推断法构建系统发育树。为探究真核生物Sugars Will Eventually be Exported Transporters(SWEET)基因的起源,共分析了228个SWEET蛋白,其中包括来自单细胞真核生物的35个SWEET蛋白和来自原核生物的57个SemiSWEET蛋白。有趣的是,SemiSWEET仅存在于原核生物中,而SWEET则存在于真核生物中。采用理论上不同的两种方法构建的系统发育树均一致 表明,首个真核生物SWEET基因可能起源于细菌SemiSWEET基因与古菌SemiSWEET基因的融合。 值得注意的是,尽管系统发育分析有助于解释不同分类单元之间难以甚至无法通过实验手段揭示的内在关系,但在仅基于系统发育分析时应谨慎得出结论。

引言

DNA 或 RNA 序列携带了决定表型的遗传信息,这些信息可通过生理学和生物化学方法进行分析,或通过形态学及化石证据加以观察。从某种意义上说,遗传信息比评估外部表型更为可靠,因为前者是后者的根本基础。在进化研究中,化石证据非常直接且具有说服力。然而,许多生物体(如微生物)在漫长的地质年代中极难形成化石。因此,来自现存相关生物的分子信息,例如核苷酸序列和氨基酸序列,在探索进化关系方面具有重要价值1。本研究为需要自行构建系统发育树的新手提供了基础系统发育学知识的简要介绍以及易于掌握的操作流程。

DNA(核苷酸)序列和蛋白质(氨基酸)序列均可用于推断同源基因、细胞器甚至生物体之间的系统发育关系2。在进化过程中,DNA序列更易发生改变。相比之下,由于核苷酸序列中的同义突变不会导致氨基酸序列的改变,因此氨基酸序列更为稳定。因此,DNA序列适用于亲缘关系较近的生物体之间同源基因的比较,而氨基酸序列则适用于亲缘关系较远的生物体之间同源基因的比较3

系统发育分析始于氨基酸或核苷酸序列的比对4 从注释基因组测序数据库中获取5 以 FASTA 格式列出, ,推定或已表达的蛋白质序列、RNA序列或DNA序列。值得注意的是,获取高质量的序列对分析至关重要,且仅能使用同源序列来分析系统发育关系。多种不同平台可用于序列比对,例如Clustal W、Clustal X、Muscle、T-coffee、MAFFT等,其中应用最广泛的是Clustal Omega6,7 (http://www.ebi.ac.uk/Tools/msa/clustalo/),可在线使用或免费下载。该比对工具提供多种参数供用户在开始比对前进行调整,但在大多数情况下,默认参数已能获得良好结果。比对完成后,应以正确格式保存比对后的序列。随后需使用序列编辑软件(如 BioEdit)对序列进行编辑或修剪,因为 MEGA 构建系统发育树要求所有序列长度相等(包括氨基酸缩写和连字符)。在比对序列中,任何不含氨基酸或核苷酸的位置均以连字符表示。 "-")。通常应去除比对结果两端所有突出的氨基酸或核苷酸。此外,比对中包含序列错配严重的列也可删除,因为这些列提供的信息价值很低,有时甚至会产生混淆或错误的信息3含有一个或多个连字符的列可在此时或后续建树阶段删除,也可保留用于系统发育分析。完成序列比对与修剪后,应将比对好的序列以FASTA格式或所需格式保存,以供后续使用。

许多软件平台提供了基于不同方法或算法的系统发育树构建功能。通常,这些方法可分为距离矩阵法和离散数据法两类。距离矩阵法计算简单且快速,而离散数据法较为复杂且耗时。对于序列相似性较高、氨基酸或核苷酸序列同源性较强的近缘分类单元,适合采用距离矩阵法(如邻接法:NJ;非加权组平均法:UPGMA);而对于远缘相关的分类单元,则以离散数据法(如最大似然法:ML;最大简约法:MP;贝叶斯推断法)为最优选择3,8。在本研究中,采用 MEGA(6.0.6)中的最大似然法(ML)和贝叶斯推断法(MrBayes 3.2)构建系统发育树9。理想情况下,当使用合适的模型和参数时,不同方法所得结果可能一致,因而更具可靠性与说服力。

使用 MEGA10 构建最大似然法(ML)系统发育树时,必须将 FASTA 格式的比对序列文件上传至程序。第一步是为上传的数据选择最优的核苷酸或氨基酸替换模型。程序会根据上传的序列对所有可用的替换模型进行比较,并在结果表中显示各自的评分。选择贝叶斯信息准则(BIC)得分最小的模型(表中列在首位的模型),按照推荐模型设置 ML 参数,然后开始计算。计算时间从几分钟到数天不等,具体取决于所加载数据的复杂程度(序列长度和分类单元数量)以及运行程序的计算机性能。计算完成后,系统发育树将在新窗口中显示。将文件保存为 "FileName.mat"。在设置参数以确定系统发育树的显示样式后,再次保存文件。通过此方法,MEGA 可生成适用于发表的高质量系统发育树图件。

使用 MrBayes11 构建系统发育树的第一步是将比对后的序列(通常以 FASTA 格式列出)转换为 nexus 格式(文件类型为 .nex)。FASTA 文件向 nexus 格式的转换可在 MEGA 软件中完成。随后,可将 nexus 格式的比对序列上传至 MrBayes。文件成功上传后,需为系统发育树的计算指定详细参数。这些参数包括氨基酸替代模型、变异速率、马尔可夫链蒙特卡洛(MCMC)耦合的链数、ngen 数、分割频率的平均标准差等。在设定好这些参数后,启动计算。最终,屏幕上将显示两个以 ASCII 代码表示的树状图,其中一个显示分支支持度(clade credibility),另一个显示分支长度。

系统将自动保存树状图结果为"FileName.nex.con"文件。该树状图文件可用FigTree打开并编辑,且在FigTree中显示的图像可进一步修改,以使其更适用于发表。

本研究以228种SWEET蛋白为例进行了分析,其中包括来自单细胞真核生物的35种SWEET蛋白和来自原核生物的57种SemiSWEET蛋白。SWEET蛋白和SemiSWEET蛋白均被鉴定为能够跨膜转运葡萄糖、果糖或蔗糖的转运蛋白12,13。系统发育分析表明,含有两个MtN3/saliva结构域的SWEET蛋白可能起源于细菌SemiSWEET与古菌的进化融合事件14

访问受限。请登录或开始试用以查看此内容。

方案

1. 序列比对

  1. 分别在独立文档中收集真核生物SWEET和原核生物SemiSWEET的氨基酸序列,并以FASTA格式列出。通过使用基本局部比对搜索工具(BLAST)在国家生物技术信息中心(NCBI)、欧洲分子生物学实验室(EMBL)和日本DNA数据库(DDBJ)中进行相似性搜索,下载相关序列。
    1. 在示例文件中,收集228条推测的真核生物SWEET蛋白序列(每条包含两个MtN3/saliva结构域,共7个跨膜螺旋)以及57条推测的原核生物SemiSWEET蛋白序列(每条包含一个MtN3/saliva结构域,共3个跨膜螺旋)13
    2. 为简化流程,从228条推测的SWEET序列中选取35条来自单细胞真核生物的候选SWEET蛋白用于构建系统发育树。这些序列已附上,供读者使用真实数据集进行练习。
  2. 将35条SWEET序列输入Clustal Omega(http://www.ebi.ac.uk/Tools/msa/clustalo/)进行比对。
    1. 将FASTA格式的蛋白序列复制粘贴至输入框,或上传FASTA格式的序列文件。在“STEP 1”部分的下拉菜单中点击图标,指定其为 氨基酸序列。
    2. 如有需要,在“STEP 2”部分设置输出格式及其他参数。本研究中,将输出格式设为"clustal w/o number",其余参数保持默认。大多数情况下,默认参数已足够适用,无需额外设置。
  3. 在“STEP 3”部分提交并运行比对。比对完成可能需要数秒至数分钟。在"Result Summary"面板中,右键单击"Alignment in CLUSTAL format"下的链接,将比对后的序列另存为"35.clustal"(图1)。
  4. 在BioEdit中打开比对结果文件。
    1. 在BioEdit主界面中,点击"Sequence",在第一个下拉菜单中选择"Edit Mood",然后在子菜单中点击"Edit Residues"(图2)。
    2. 使用光标选中比对序列左侧突出的序列部分(被选中的序列将以黑色显示),然后点击"Edit"菜单下的"Delete"图标,删除所选序列(图3)。
    3. 选中并删除第一个MtN3/saliva结构域右侧突出的序列,将裁剪后的第一个MtN3/saliva结构域序列保存为35-I.fas(图4)。同样地,删除第二个MtN3/saliva结构域左右两侧突出的序列,并将其保存为35-II.fas。第一个和第二个MtN3/saliva结构域的位置可预先通过RHYTHM(http://proteinformatics.charite.de/rhythm/inndex.php?site=helix)或TMHMM(http://www.cbs.dtu.dk/services/TMHMM/)进行预测。
  5. 在MEGA中打开文件35-I.fas,提示时点击"align"。在"Edit"菜单下,点击"Select All",然后点击"Select Sequence(s)";分类单元的名称和序列将以黑色选中(图5)。
    1. 在"Edit"菜单中选择"Copy",将序列复制到剪贴板,然后粘贴至文档文件中。
    2. 在文档文件中,将所有"#"替换为“>”,删除无关字符,转换为FASTA格式。在每个分类单元名称末尾添加"-I",以标记其为第一个MtN3/saliva结构域序列。对第二个MtN3/saliva结构域序列采用相同方法处理,并在每个分类单元名称后添加"-II"。
  6. 在文档文件中合并第一个和第二个MtN3/saliva结构域的FASTA格式序列。
    1. 将合并后的序列再次载入Clustal Omega,按上述方法进行比对。将结果保存为"35 realigned.clustal"。
    2. 在BioEdit中打开"35 realigned.clustal"文件,删除比对序列两端不整齐(突出)的氨基酸残基,然后将序列保存为"35 realigned.fas"。当提示某些非标准字符无法保存时,点击"Yes"确认。

2. 系统发育树的计算

  1. 打开 "35 realigned.fas" 在 MEGA 中。
    1. 点击 "数据" 菜单并选择 "导出比对结果",并将比对结果以PAUP格式(nexus)保存为 "35.nex" 以备后续在 MrBayes 中使用(图6).
    2. 同时,单击 "模型" 主面板上的 MEGA 图标,选择 "寻找最佳DNA/蛋白质模型(机器学习)",然后单击 "好的" 在弹出窗口中。点击 "计算" 开始模型搜索过程(图7将打开一个新的进度面板;此过程持续数分钟至数天不等,具体时长取决于所加载序列的复杂程度及计算机性能。
      注意:模型搜索过程结束后,将打开一个显示结果的表格( 图8)。BIC 分数最小的模型将排在首位,随后是一系列 BIC 分数逐渐增加的不同模型。第一个模型 "LG+G+F" BIC 分数最小的模型是基于 ML 树的推荐模型 "35 realigned.fas" 文件。
  2. 点击 "系统发育" 主面板上的 MEGA 图标,单击 "构建/检验最大似然树",然后单击 "是" 在弹出面板上。将打开一个新窗口,显示需要指定的不同参数(图9).
    1. 首先,在系统发育分析框的检验中设置自举值;大多数情况下,500 或 1,000 已足够。在替换模型下选择 "氨基酸" 作为替换类型。选择替换模型的目的是根据序列的当前状态来估计它们之间的真实差异。3.
    2. 选择 "LG加频率(+F)模型" (LG+F)在模型/方法框中。在速率和模式框中,选择 "伽马分布" (G) 用于描述位点间的速率变异, ,从而对进化较慢位点上的变化赋予更高的权重3在数据子集框中,选择 "完全缺失" 删除所有包含连字符的列。
    3. 保持所有其他参数为默认状态(图9)。设置这些参数后,单击 "计算" 单击图标以开始计算。

3. 系统发育树的展示

注意:使用 MEGA 完成计算后,将显示系统发育 ML 树(图 10)。

  1. 在树状面板的 "文件" 下拉菜单中,选择 "保存当前会话" 以保存结果(默认文件类型为 .mas)。在本研究中,结果保存为 "35.mas"。在树状面板中,可显示并设置多种参数,包括分支长度、树形样式、系统发育树拓扑结构、分类单元名称的字体、大小和颜色等。
  2. 单击图像图标以保存最终的树文件,并以不同格式保存图像,或复制图像作为图像编辑的源文件。

4. 利用序列比对分析SWEETs与SemiSWEETs之间的关系

注意:此步骤在常规序列分析中可能不需要。

  1. 按照上述方法在 Clustal Omega 中对 228 个真核生物 SWEET 蛋白和 57 个原核生物 SemiSWEET 蛋白进行比对。比对结果可在 Clustal Omega 集成的 Jalview 中显示,并复制保存至图像编辑软件中(图 11)。
    注意:在示例比对中,来自 α-变形菌(α-Proteobacteria)的一些 SemiSWEET 蛋白与 SWEET 序列的第一个 MtN3/saliva 结构域对齐,而来自甲烷杆菌(Methanobacteria,古菌)的 SemiSWEET 蛋白则与 SWEET 序列的第二个 MtN3/saliva 结构域对齐。

5. 使用 MrBayes 构建系统发育树

  1. 对于使用 MrBayes 进行贝叶斯推断,打开 MrBayes 可执行文件后,新窗口中将弹出一个 DOS 界面。第一步是读取 Nexus 数据文件。输入 "执行 35.nex" 提示之后(记得将35.nex文件保存在与MrBayes可执行文件相同的目录中,或在上传前指明该文件的路径)。A "成功读取矩阵" 在列出的分类单元最后一项之后将显示消息图12). 35.nex 文件已准备并保存在 MEGA 中(见上述 2.1 节)。
  2. 设置进化模型。
    1. 提示后输入 "prset aamodelpr = fixed(lg); lset rates = g"。该 "lg" 和 "g" 对应于 "LG" 和 "G" 在 MEGA 中设置模型后,成功设置模型,输入 "mcmc nchains = 4 ngen = 5,000,000" 提示之后。使用该 "nchains=4" 条目表示Metropolis耦合中包含一条冷链和三条热门链的总数。 "ngen = 5,000,000" 表示使用Metropolis耦合运行5,000,000代,以实现冷链与热链的收敛。本研究中,将分频率的平均标准偏差低于0.01视为冷链与热链达到收敛。
    2. 请注意,在分析开始阶段无法准确预测ngen值,通常需要根据分割频率的平均标准偏差的变化进行调整。此外,即使使用相同数据运行程序,每次达到收敛所需的ngen值也可能不同。
  3. 运行分析: 此步骤持续时间从几分钟到数天不等,具体取决于输入数据的复杂程度和计算机的性能。完成预设计算后,系统将弹出提示 "继续进行分析(是/否)?" 如果 "无" 在提示后输入后,计算将停止(图13),否则在输入进一步的世代数后,计算将继续进行。当计算完成时(分频率的平均标准差达到稳定) <0.01 或 0.05),通过输入命令终止计算 "无" 在查询提示之后。
    注意:0.01 是一个严格的标准,0.05 为中等标准,通常情况下已足够。
  4. 总结样本: 类型 "集液槽" 在提示对模型参数的样本进行汇总后(图14)。然后输入 "sumt relburnin=yes burninfrac=0.25" 在提示总结树样本后,将显示有关系统发育树构建的详细信息,如 图15,随后屏幕上将显示两个以ASCII码形式呈现的树状图,一个显示分支可信度,另一个显示分支长度。同时,会生成一个树文件,文件名为 "35.nex.con" 将自动保存。
  5. 为了更好地展示系统发育树,打开 "35.nex.con" 使用 FigTree 工具(http://tree.bio.ed.ac.uk/software/figtree/)打开树文件,选择一种样式或尺寸以显示结果(图16),甚至可以在图像编辑软件中进行修改,以提高可读性。

访问受限。请登录或开始试用以查看此内容。

结果

系统发育树显示,35条SWEET序列的全部第一个MtN3/saliva结构域聚为一个分支,而SWEET序列的第二个MtN3/saliva结构域则聚为另一个分支。此外,SWEETs与SemiSWEETs的比对结果表明,来自α-变形菌纲(α-Proteobacteria)的一些SemiSWEETs与SWEET序列的第一个MtN3/saliva结构域对齐,而来自甲烷杆菌(Methanobacteria,古菌)的SemiSWEETs则与SWEET序列的第二个MtN3/saliva结构域对齐。这些结果共同提示,含有两个MtN3/saliva结构域的SWEETs可能起源于一种细菌SemiSWEET与一种古菌SemiSWEET在进化过程中的融合事件14

访问受限。请登录或开始试用以查看此内容。

讨论

在生物学研究中,基于核苷酸或氨基酸 序列构建系统发育树的方法正变得越来越普遍8。通常,该过程包括三个关键步骤:序列比对、采用合适的方法或算法对比对后的序列进行评估,以及将计算结果以系统发育树的形式进行可视化。在本研究中,共进行了三轮序列比对:首先,对SWEET蛋白序列(包含第一和第二MtN3/saliva结构域)进行比对;其次,将SWEET蛋白中各个独立的MtN3/saliva结构域序列作为独立分类单元进行收集并联合比对;最后,将SemiSWEET序列与SWEET序列共同进行联合比对。通常情况下,构建系统发育树仅需进行一轮序列比对即可。

在初步阶段,可以从NCBI或其他数据库下载同源序列。如果这些下载的序列注释不完整,可能需要进行筛选。在第一和第二阶段,如果序列格式不正确,则无法启动比对和计算。例如,Clustal Omega将拒绝任何不符合FASTA格式的序列文件。在计算阶段,需注意在使用MEGA进行评估之前,序列长度(包括氨基酸或核苷酸以及连字符)必须相等。

尽管现...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本工作得到国家自然科学基金(31371596)、三峡大学生物技术研究中心(2016KBC04)和中国江苏省自然科学基金(BK20151424)的支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
Adobe Illustrator由 Adobe Systems Software Ireland Ltd. 开发的图形工具。版权所有 © 2017
BioEdit为 Windows 95/98/NT/2000/XP/7 系统编写的生物序列比对编辑器。版权所有 © Tom Hall
Clustal Omega用于进行氨基酸或核苷酸序列多序列比对的软件包。  http://www.clustal.org/
CorelDRAW一款图形设计软件。版权所有 © 2017 Corel Corporation
FigTree由爱丁堡大学设计的系统发育树图形可视化工具
MEGA分子进化遗传学分析软件 6.0 版 http://www.megasoftware.net/home
MrBayes一种基于贝叶斯推断的系统发育分析工具
NVIDIA一家为游戏和专业市场设计图形处理器(GPU)的公司。版权所有 © 2017 Corporation
PAUP基于最大简约法的系统发育分析软件。David Swofford 开发的程序在多种核苷酸模型下实现了最大似然法
Photoshop由 Adobe Systems Software Ireland Ltd. 开发和发布的位图图形编辑器。版权所有 © 2017
RHYTHM一种基于知识的六螺旋接触预测工具。Charité Berlin – 蛋白质信息学小组 - 版权所有 2007-2009
TMHMM一种用于预测蛋白质中跨膜螺旋的工具。http://www.cbs.dtu.dk/services/TMHMM/
计算机4 GB 内存,Core 2 或更高版本的 CPU,Windows 7 或 Windows 10 操作系统

参考文献

  1. Nei, M., Kumar, S. Molecular Evolution and Phylogenetics. , Oxford University Press. Oxford. (2000).
  2. Foth, B. J. Phylogenetic analysis to uncover organellar origins of nuclear-encoded genes. Methods Mol Biol. 390, 467-488 (2007).
  3. Baldauf, S. L. Phylogeny for the faint of heart: a tutorial. Trends Genet. 19, 345-351 (2003).
  4. Feng, D. F., Doolittle, R. F. Progressive sequence alignment as a prerequisite to correct phylogenetic trees. J Mol Evol. 25, 351-360 (1987).
  5. Persson, B. Bioinformatics in protein analysis. EXS. 88, 215-231 (2000).
  6. Sievers, F., et al. Fast, scalable generation of high-quality protein multiple sequence alignments using Clustal Omega. Mol Syst Biol. 7, 539(2011).
  7. Sievers, F., Higgins, D. G. Clustal omega. Curr Protoc Bioinformatics. 48, 1-16 (2014).
  8. Yang, Z., Rannala, B. Molecular phylogenetics: principles and practice. Nat Rev Genet. 13, 303-314 (2012).
  9. Hall, B. G. Comparison of the accuracies of several phylogenetic methods using protein and DNA sequences. Mol Biol Evol. 22, 792-802 (2005).
  10. Tamura, K., Stecher, G., Peterson, D., Filipski, A., Kumar, S. MEGA6: Molecular Evolutionary Genetics Analysis version 6.0. Mol Biol Evol. 30, 2725-2729 (2013).
  11. Ronquist, F., et al. MrBayes 3.2: efficient Bayesian phylogenetic inference and model choice across a large model space. Syst Biol. 61, 539-542 (2012).
  12. Chen, L. Q., et al. Sugar transporters for intercellular exchange and nutrition of pathogens. Nature. 468, 527-532 (2010).
  13. Xuan, Y., et al. Functional role of oligomerization for bacterial and plant SWEET sugar transporter family. Proc Natl Acad Sci USA. 110, 3685-3694 (2013).
  14. Hu, Y., et al. Phylogenetic evidence for a fusion of archaeal and bacterial SemiSWEETs to form eukaryotic SWEETs and identification of SWEET hexose transporters in the amphibian chytrid pathogen Batrachochytrium dendrobatidis. FASEB J. 30, 3644-3654 (2016).
  15. Holder, M. T., Zwickl, D. J., Dessimoz, C. Evaluating the robustness of phylogenetic methods to among-site variability in substitution processes. Philos Trans R Soc Lond B Biol Sci. 363, 4013-4021 (2008).
  16. Alfaro, M. E., Holder, M. T. The Posterior and the Prior in Bayesian Phylogenetics. Annu Rev Ecol Evol Syst. 37, 19-42 (2006).
  17. Suchard, M., Rambaut, A. Many-core algorithms for statistical phylogenetics. Bioinformatics. 25, 1370-1376 (2009).
  18. Zierke, S., Bakos, J. FPGA acceleration of the phylogenetic likelihood function for Bayesian MCMC inference methods. BMC Bioinformatics. 11, 184(2010).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

SWEET基因进化Clustal Omega比对最大似然树贝叶斯推断MEGA软件MrBayes方法氨基酸序列SemiSWEET蛋白