2018年8月14日
本文描述了一种基于真核生物SWEET蛋白与原核生物SemiSWEET蛋白序列同源性构建系统发育树的方法。系统发育分析是揭示不同生物类群间同源蛋白或基因进化关系的有力工具。
该方法有助于回答植物系统发育领域中的关键问题,例如如何收集序列数据以及如何选择正确的计算模型。该技术的主要优势在于其易于学习。通常,初学者可能遇到困难,仅仅是因为他们缺乏系统发育学基本原理和方法的知识,从而不知道如何处理数据。
该方法最初是在我们分析真核生物SWEET基因的比对时建立的。由于该比对在不同方面存在大量选择和参数设置,因此本方法的可视化演示至关重要。请按照文本方案中的描述,从单细胞真核生物中选取35个候选SWEET蛋白,以此开始本实验流程。
将35个SWEET序列输入Clustal Omega进行比对。将FASTA格式的蛋白质序列复制粘贴到输入框中,或上传FASTA格式的序列文件。在第一步部分的下拉菜单下方,点击图标指定其为氨基酸序列。
如有需要,可在第二步中指定输出格式和其他参数。本研究中,将输出格式设置为不带编号的 Clustal 格式,其余参数保持默认设置。大多数情况下,使用默认参数即可获得良好结果,无需另行设定。
在第三步部分提交并运行比对。比对完成可能需要几秒到几分钟不等。在结果摘要面板中,右键单击CLUSTAL格式比对下方的链接,并将比对后的序列保存为35.clustal。
要在 BioEdit 中打开比对结果文件,单击“Sequence”,然后在 BioEdit 主面板的第一个下拉菜单中选择“Edit Mood”。接着在子菜单中单击“Edit Residues”。使用光标选中比对左侧突出的序列,然后单击“Edit”菜单下的删除图标,以移除所选序列。
选择并删除第一个 MtN3 唾液域右侧的序列,将截短后的第一个 MtN3 唾液域序列保存为 35-1.fas。同样,删除第二个 MtN3 唾液域左右两侧的序列,并将其保存为 35-2.fas。第一个和第二个 MtN3 唾液域序列可预先使用 Rhythm 或 TMHMM 进行预测。
使用 MEGA 打开文件 35-1.fas,出现提示时点击 Align。在 Edit 菜单下,点击 Select All。
然后点击“选择序列”。分类单元的名称和序列将以黑色选中。从“编辑”菜单中选择“复制”,将序列复制到剪贴板,然后将复制的序列粘贴到文档文件中。
在文档文件中,将所有数字符号替换为大于号,然后删除所有无关字符,以转换为 FASTA 格式。在每个分类单元名称的末尾添加 1,以标记为第一个 MtN3 唾液域序列。采用相同方法处理第二个 MtN3 唾液域序列,并在每个分类单元名称后添加 2。
现在将MtN3唾液酸结构域的第一和第二序列以FASTA格式合并到一个文档文件中。为此,再次将合并后的序列载入Clustal Omega,并像之前一样对序列进行比对。将结果保存为35realigned.clustal。
在 BioEdit 中打开 35realigned.clustal 文件。删除比对序列两端不整齐的氨基酸残基,然后将序列另存为 35realigned.fas。
当提示某些非标准字符无法保存时,点击“是”。在 MEGA 中打开 35realigned.fas。
单击“数据”菜单,选择“导出比对结果”。然后将比对结果以 POP 格式保存为 35,供后续在 MR Base 中使用。
同时,点击 MEGA 主面板上的“Models”图标。选择“Find Best DNA Protein Models”,然后在弹出窗口中点击“OK”。点击“Compute”以开始模型搜索过程。
一个新的进度面板将会打开。此过程持续数分钟至数天不等,具体时长取决于所加载序列的复杂程度以及计算机的性能。模型搜索过程结束后,将打开一个显示结果的表格。
最小的BIC得分将列在首位,随后是一系列BIC得分逐渐增加的不同模型。第一个模型LG+G+F具有最小的BIC得分,是基于35realigned.fas文件推荐用于构建ML树的模型。
接下来,在 MEGA 主面板上点击系统发育(Phylogeny)图标。点击“构建/检验最大似然树(Construct/Test the Maximum Likelihood Tree)”,然后在弹出面板上点击“是(Yes)”。随后将打开一个新窗口,显示需要设置的不同参数。
首先,在系统发育分析框的检验中设置自举值,大多数情况下 500 或 1,000 即可。在替换模型下,选择氨基酸作为替换类型。
选择替换模型的目的是根据序列的当前状态来估计它们之间的真实差异。在“模型与方法”框中选择LG加Freqs模型。在“速率与模式”框中,选择伽马分布以描述位点间速率的变化,例如对缓慢进化位点上的变化赋予更高的权重。
在数据子集框中,选择完全删除以移除所有包含连字符的列。保持所有其他参数为默认设置。在指定这些参数后,单击计算图标以开始计算。
使用 MEGA 完成计算后,将显示系统发育 ML 树。在树形面板的文件图标下拉菜单中,选择“保存当前会话”以保存结果。在本研究中,结果被保存为 35.mas。
在“树”面板中,可显示并设置多种参数,包括分支长度、树形样式、系统发育树拓扑结构、分类单元名称的字体、大小和颜色等。点击图像图标保存最终的树文件,并以不同格式保存图像,或复制图像作为图像编辑的源文件。按照文本方案中所述,使用 MR Base 结合序列比对进行 SWEET 蛋白与 semiSWEET 蛋白关系的分析及系统发育树构建。
系统发育树显示,35个SWEET序列的全部第一个MtN3唾液域聚为一个分支,而SWEET序列的第二个MtN3唾液域则聚为另一个分支。此外,SWEETs与semiSWEETs的比对结果表明,来自α-变形菌(Alpha-Proteobacteria)的一些semiSWEETs与SWEET序列的第一个MtN3唾液域对齐,而来自甲烷杆菌(Methanobacteria)的semiSWEETs则与SWEET序列的第二个MtN3唾液域对齐。这些结果共同表明,含有两个MtN3唾液域的SWEETs可能起源于一种细菌semiSWEET与一种古菌的进化融合。
一旦掌握,该技术可在一小时到数天内完成,具体时间取决于数据的复杂程度。在实施该方案时,提前获取高质量的序列至关重要。该方案建立后,为进化研究领域的科研人员探索同源基因之间的关系奠定了基础。
观看本视频后,您应该能够充分理解如何构建系统发育树。
查看完整文字稿并访问数千部科学视频
本文介绍了一种基于真核生物SWEET蛋白与原核生物SemiSWEET蛋白序列同源性构建系统发育树的方法。该技术操作简便,有助于理解同源蛋白或基因之间的进化关系。
对SWEET转运蛋白等蛋白质家族进行系统发育分析,可通过阐明其进化起源和功能分化,从而在早期发现阶段实现机制层面的风险降低。该方法通过区分保守结构域与谱系特异性创新,支持靶点验证,减少假设生成中的不确定性。关于基因融合事件的深入认识,有助于指导与转运相关通路的转化生物标志物策略及临床前模型选择。
该方法通过提供蛋白质功能的进化背景,将目标假设验证到先导物鉴定的发现过程整合为一体。