需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

创建并应用参考体系以促进对多样化蛋白质组的讨论与分类

7K 次观看

DOI:

10.3791/56107

2017年8月16日

本文内容

摘要

本实验方案的目的是为缺乏统一命名和分类标准的蛋白质群组建立一个参考体系。该参考体系将有助于对整个群组进行分析和讨论,并可与已确立的名称一并使用。

摘要

不同实验室利用不同生物体研究的相关蛋白质可能缺乏统一的命名和分类体系,导致难以整体讨论该蛋白家族,也难以将新发现的序列归入适当的分类背景中。建立一种以与结构和/或功能相关的重要序列特征为优先的参考体系,可作为既有名称的补充,为多样化的蛋白质家族提供一定的系统性。本文以半胱氨酸稳定α-螺旋(CS-αβ)超家族为例,说明如何构建此类参考体系 电子表格软件可以阐明该超家族中现有蛋白质之间的关系,并有助于添加新的序列。它还展示了参考序列如何帮助优化在常用软件中生成的序列比对结果,从而影响系统发育分析的可靠性。对于包含来自广泛分类群的高度分歧序列、且其特征难以通过分子分析充分捕捉的蛋白质组而言,使用参考序列可能尤为有益。

引言

蛋白质的名称应反映其特性以及与其他蛋白质的关系。然而,蛋白质的名称通常在发现时即被确定,随着研究的深入,人们对更大背景的理解可能会发生变化。这可能导致同一蛋白质被多个实验室独立鉴定而出现多个名称,或导致命名规则的变更,或导致当初命名时被认为具有决定性的特征发生变化,从而使该名称不再能充分区分该蛋白质与其他蛋白质。

无脊椎动物防御素为命名法和分类学中的混乱现象提供了一个很好的例子。最早的无脊椎动物防御素报道来源于昆虫,其名称 "昆虫防御素" 基于与哺乳动物防御素的表观同源性而提出1,2术语“防御素”仍在使用,尽管现已明确无脊椎动物和哺乳动物的防御素并不具有共同的祖先。3,4. 根据物种的不同,一种无脊椎动物 "防御素" 可能含有六个或八个半胱氨酸(形成三对或四对二硫键),并具有多种抗菌活性。更复杂的是,具有防御素相同特征的蛋白质并不总是被称为 "防御素," 例如最近发现的 cremycins 来自 秀丽隐杆线虫5此外,无脊椎动物的大防御素在进化上更可能与脊椎动物的β-防御素相关,而非其他无脊椎动物防御素6尽管如此,研究人员有时仍依赖名称 "防御素" 在确定哪些序列应纳入分析时。

结构研究表明,昆虫防御素与蝎毒素具有相似性7,随后CS-αβ折叠被确立为昆虫防御素的特征性结构特征8。该折叠结构定义了蛋白质结构分类数据库(SCOP)中的蝎毒素样(CS-αβ)超家族9,该超家族目前包含五个家族:昆虫防御素、短链蝎毒素、长链蝎毒素、MGD-1(来自软体动物)以及植物防御素。此超家族与近期描述的cis-防御素4以及CATH/Gene 3D数据库中的超家族3.30.30.10为同义术语10,11。来自多种无脊椎动物类群、植物和真菌的研究表明,具有该折叠结构的蛋白质名称与其半胱氨酸数目或二硫键连接模式、抗菌活性或进化历史并无明确关联12

由于缺乏一致性和明确的标准,为该超家族中新发现的序列命名和分类变得十分困难。比较该超家族中蛋白质的主要障碍在于,半胱氨酸的编号是相对于各个独立序列进行的(每个序列中的第一个半胱氨酸为C1),而无法体现其结构功能。这意味着只能比较具有相同数量半胱氨酸的序列。除形成CS-αβ折叠的半胱氨酸外,序列间保守性很低,这使得序列比对和系统发育分析难以进行。通过建立一种优先考虑结构特征的编号系统,可更方便地对超家族序列进行比较和比对。保守特征以及定义亚群的特征能够被快速可视化,新序列也能更容易地被归入适当的分类背景中。

本文使用电子表格软件(例如,Excel)为 CS-αβ 超家族建立一种参考编号系统。该方法展示了如何通过该系统明确地进行序列间的比较,并将其应用于从缓步动物中新鉴定出的 CS-αβ 序列。尽管本方案以 CS-αβ 超家族为例撰写,旨在为研究感兴趣的序列时提供指导,但其并不局限于该超家族或富含半胱氨酸的序列。该方法可能最适用于那些在不同分类群中被独立研究、整体序列同源性较低、且具有某些不易被分子分析软件识别的离散特征的蛋白质家族。该方法需要事先对重要特征做出一些a priori 判断,因此若尚未确定任何重要特征,则其应用价值有限。主要目标是展示如何实现序列关系的简单可视化。这种可视化可进一步用于指导序列比对与分析;但如果比对与分析是主要目标,则条形码方法是一种更适用于自动化、且更具扩展性的替代方案13。当前方法以线性形式展示每条肽段的特征,因此无法直接用于三维结构的可视化。

访问受限。请登录或开始试用以查看此内容。

方案

1. 确定目标蛋白质组的特征

  1. 查阅以往的文献,确定关于被归入该类群所需具备的特征是否存在共识。注意不同研究团队之间存在的任何不一致或观点差异,并纳入可能用于区分不同亚群的特征。
  2. 若先前文献未涉及定义性特征,可选用被公认为代表该类群的序列作为起点,以识别保守特征。

2. 收集相关序列

  1. 如果已有综述文献包含了代表该类群的序列分析,应将这些序列纳入原始数据集。根据文献中引用的登录号获取序列,并保存至标准的序列编辑软件中。例如, Lasergene 软件套件中的 EditSeq 或许多可在线免费获取的软件之一。
  2. 如果相关分组已在某个结构数据库中定义,则应包含该数据库列出的属于该分组的所有序列。 使用数据库中提供的登录号获取序列,并以上述方法保存至标准的序列编辑软件中。
    注意:例如,SCOP 数据库中归类于 CS-αβ(蝎毒素样)超家族的序列可在此处找到:http://scop.mrc-lmb.cam.ac.uk/scop/data/scop.b.h.c.h.html。 
  3. 执行基本局部比对搜索工具(BLAST)14 通过美国国家生物技术信息中心(NCBI)提供的公共在线数据库进行检索,以查找可能未被文献或结构数据库收录的序列。为获得最完整的检索结果,应同时使用蛋白质BLAST(blastp)和以蛋白质为查询序列的翻译BLAST(tblastn)程序;这两个工具均可在以下网址获取:https://blast.ncbi.nlm.nih.gov/Blast.cgi
    1. 使用已知属于目标类群的序列作为查询序列。将序列复制并粘贴到顶部的搜索框中,或提供 GenBank 登录号或 gi 标识符(如可用)。
    2. 从下拉菜单中选择数据库。对于 blastp,选择非冗余蛋白序列(nr);对于 tblastn,选择表达序列标签。
    3. 在生物体设置中,通过输入生物体或分类群名称并从输入时出现的列表中选择,以搜索特定分类群的结果。如需添加额外的生物体或分类群进行排除,请点击 "+" 按钮,此时将出现另一个字段。在生物体框中,通过输入生物体或分类群名称来排除不需要的分类群,输入时从自动显示的列表中选择,并勾选 "排除" 右侧的盒子
    4. 通过点击访问更多参数 "算法参数" 位于页面底部。除非有充分理由,否则请保持默认设置。
    5. 点击 "BLAST" 点击按钮运行分析;结果可能需要一些时间才能显示。通常,应获取期望值(或 e 值)符合要求的匹配结果。 "-05" 或进行优化,并在标准的序列编辑程序中保存。
      1. 如果所有命中结果均高于此阈值,请重新运行搜索,并增加目标序列的数量(在算法参数部分),以获得所有相关序列。
  4. 如有必要,剪裁序列以排除无关信息(例如, CS-αβ折叠仅适用于成熟肽。使用ProP识别并去除信号肽和前体肽15 (在线提供),或使用 SignalP 进行更复杂的信号肽预测16 (可在线获取)

3. 根据已确定的重要特征在电子表格中生成参考

  1. 确定目标类群的定义特征。例如,使用来自Phormia terraenovae的昆虫防御素A的溶液结构所明确建立的CS-αβ折叠(图18
    1. 该折叠包含一个称为半胱氨酸稳定螺旋(CSH)的较小模体17;通过位于CXC上游的CXXXC序列(其中X为任意氨基酸)来识别该模体,这两个序列形成两个二硫键(图1,实心粉线)。
      注:为完成CS-αβ模体,第三个二硫键由位于CSH模体两半部分之前的额外半胱氨酸形成(图1,虚线粉线)。
  2. 将这些定义特征输入电子表格中。参见图2
    1. 使用列来表示保守特征及其之间的间隔。确保列宽足够容纳数字,并保持列宽一致。使用"格式|列宽"功能设置列宽(图2,粉红色箭头)。
    2. 使用行来表示序列名称。
    3. 当某序列具有某一特征时,使用填充功能在对应框中填色(图2,粉色方块)。对于特征之间的间隔,在中间的框中填入氨基酸数目,不具特征的框则留空。例如,使用昆虫防御素序列可得到一个包含六个半胱氨酸的参考序列,并在C2与C3以及C5与C6之间具有确定的间隔。
  3. 根据结构数据库和文献中已确认属于该类群的代表性序列进行添加。
    注:例如,已有文献和SCOP数据库识别出多个应纳入的类群:昆虫防御素、短链蝎毒素、长链蝎毒素、MGD-1、植物防御素、线虫ABFs、果蝇(Drosophila)中的drosomycins以及macins。文献还发现一个仅含四个半胱氨酸的细菌序列,可能代表该超家族的祖先序列18。添加这些序列后,参考序列中的半胱氨酸数量从六个增加到十个,但关键结构特征的排列仍得以保持(图3)。
    1. 若需添加可能定义某个亚类群的特征(例如额外的半胱氨酸),使用"插入"功能(图3,粉红色箭头)。
    2. 若某序列缺少某些特征,则将对应框留空,并将其与代表中间氨基酸的框合并。如有必要,使用合并居中功能进行单元格合并(图3,粉色框)。
  4. 继续向类群中添加序列,以更全面地了解该超家族各子类群的变异情况。总结各类群特征以便进行比较(图4)。
    1. 当主要特征之间的氨基酸数目存在变化时,使用连字符表示范围,如6 - 12(表示6至12个氨基酸),使用斜杠表示“或”的关系,如7/10(表示7或10个氨基酸)。
    2. 选择一种方式标注可能相关但出现频率不足以纳入参考的序列特征。例如,由于半胱氨酸在该超家族中具有重要性,可对额外的半胱氨酸进行标注(图4,粉色框)。
  5. 以已建立的序列为参考,将新发现的序列添加至电子表格中。例如,添加来自缓步动物(黄色)的序列显示,这些缓步动物序列归属于该超家族的多个不同类群(图5出于空间考虑展示的是汇总信息,而非每条序列单独成行)。
  6. 通过重新排列行顺序来展示某一分类群内部的变异性(图6)。

4. 利用参考序列优化氨基酸比对

注意:可用于多序列比对的软件有很多,但本演示将使用分子进化遗传分析软件(Molecular Evolutionary Genetics Analysis,MEGA6)19,因其可免费下载使用。

  1. 下载并安装软件。
  2. 在 MEGA 中,通过点击“Align”选项卡下的 "Edit/Build Alignment" 开始新建比对。在弹出的窗口中选择 "Create a new alignment",然后点击 "OK"。随后选择 "Protein"。
  3. 在 "Edit" 菜单中选择 "Insert Sequence from File" 以导入序列。
    注意:序列需为 FASTA 格式才能导入 MEGA。默认情况下会使用不同颜色背景表示不同类型的氨基酸,但可在 "Display" 菜单中关闭此选项。
  4. 所有序列输入完成后,点击弯曲手臂图标,然后选择 "Align Protein",使用 MUSCLE 算法进行序列比对20
    注意:也可使用 ClustalW 算法。
    1. 如果弹出提示“未选择任何内容”并询问是否选择全部,请点击 "OK"。
    2. 注意:这将打开一个可修改部分参数的窗口,但除非有充分理由,否则不应更改这些参数。本分析使用了先前研究中分析序列的一个子集12
  5. 根据关键特征检查比对结果;注意序列上方的顶部条形图会显示完全保守的氨基酸列(以 * 表示)。参见 图7。可见初始比对仅显示了四个保守半胱氨酸中的三个(图7,粉色框);沿列向下观察,AlCRP 序列明显错位(图7,粉色箭头)。
  6. 为消除 I 与保守 C 之间的大段空隙,选中连字符并按下 "delete" 键。注意不要选中任何氨基酸,否则这些氨基酸也将被删除。
  7. 若需将氨基酸向右移动,请选中后按空格键。
    1. 注意 AlCRP 的结构半胱氨酸现已正确比对,且 CXXXC 模体的最后一个 C 在整个比对中保持保守(图8)。根据需要调整比对,优先保证序列中最重要特征的准确性。

5. 使用参考数据比对群体与系统发育分析结果

  1. 根据初步比对结果,确定应纳入系统发育分析的序列;若序列数量较少,此步骤可能无需进行。
    1. 保留包含所有序列的比对文件,但在进行系统发育分析时,应去除冗余序列(图9,粉色框表示成对的冗余序列。
    2. 如果数据集包含大量序列,可先进行初步分析,并从始终聚为一支的类群中选取代表性序列。
  2. 确定最佳氨基酸替代模型。
    1. 在数据选项卡下,以 MEGA 格式导出比对结果。
    2. 转到“模型”菜单并选择 "寻找最佳DNA/蛋白质模型。" 选择刚刚保存的文件并打开;这将打开一个包含若干可修改参数的窗口。
    3. 除非有更改的理由,否则使用默认参数。点击 "计算" 开始分析。
  3. 在 MEGA 中运行最大似然法(ML)分析。
    1. 选择 "构建/检验最大似然树" 从系统发育菜单中。
    2. 从第5.2步确定最适合数据的模型中进行选择(输出结果将提供替换模型以及最优模型) "位点间的速率差异" 参数
    3. 选择1,000次自举重复以获得系统发育树的支持率。
    4. 点击 "计算" 运行分析;MEGA 具有 "树状图浏览器" 以可视化该树状结构。
  4. 在 MrBayes 开源软件中运行贝叶斯分析21.
    注意:该网站还提供一份 MrBayes 使用手册。本文旨在提供基本操作步骤,并非贝叶斯系统发育分析的完整指南。
    1. 将MEGA比对结果以PAUP(Nexus)格式导出至与MrBayes程序相同的文件夹中。
    2. 打开 MrBayes 并输入 "exe 文件名" (例如, "exe Alignment.nex").
    3. 指定模型和分析参数。选择步骤 5.2 中指定的模型,或选择 "混合的" 将尝试多种模型,并报告在具有最佳后验概率的树中各模型的出现频率(prset aamodelpr=mixed)。输入 "showmodel" 报告当前模型设置并 "帮助 mcmc" 显示当前参数设置,并对每一项进行简要说明。
    4. 使用以下方法设置世代数 "mcmcp ngen=" 命令(通常为100万)
    5. 类型 "mcmc" 开始分析。
    6. 当完成设定的世代数后,程序将提示是否添加更多世代。如果分割频率的平均标准差小于0.1,则输入“no”;如果大于0.1,则应继续运行分析,或调整某些参数(参见使用手册)。
    7. 使用 "sumt" 生成树文件的命令。
    8. 分析完成后,若已生成共识树,则可在 FigTree 软件(可在线获取)中查看该树状图。
  5. 比较这些树,以判断不同方法是否产生一致的结果。
    注意:某些序列提供的信息量较少:所得的系统发育树可能分辨率较低,且分支支持率可能极低(图10).
  6. 将构建的系统发育树与参考中确定的分类群进行比较,以检验系统发育分析是否支持这些分组。

访问受限。请登录或开始试用以查看此内容。

结果

文献中报道的CS-αβ超家族中的序列分组如图4所示。根据每条序列编号所推断的半胱氨酸配对模式,可将其分为五个基本组(表1,中间列)。第1组包含六个半胱氨酸,形成三个二硫键,其序列来源于昆虫、蛛形纲动物、软体动物、线虫和真菌。第2、3和4组均含有八个半胱氨酸,形成四个二硫键。第2组包括昆虫、蛛形纲动物和植物的序列;第3组包括蛛形纲动物、软体动物和线虫的序列;第4组包括刺胞动物、环节动物、软体动物和真菌的序列。第5组为含有十个半胱氨酸的macin类序列。部分序列不完全符合上述模式,但通常更接近于其中某一组。

第1组和第2组似乎共享两个二硫键:C2-C5 和 C3-C6;然而,若将每个序列的编号从其第一个半胱氨酸开始,则无法体现这些二硫键的结构背景。在第1组序列中,C2-C5 形成了CSH模体中的两个二硫键之一,而在第2组序列中,C2-C5 则构成了稳定CS-αβ折...

访问受限。请登录或开始试用以查看此内容。

讨论

对某一类蛋白质命名的标准应当明确,但实际情况并非总是如此。具有CS-αβ折叠结构的序列已在多个实验室中利用多种生物体进行了研究,导致命名系统各不相同,且表征程度也存在差异。试图强加一种全新的命名法是不合理的,这会在查阅以往文献时造成极大混乱。可在蛋白质名称之外使用参考编号系统,以阐明该蛋白质相对于超家族的特征。

具有明确命名和分类标准的蛋白质组可能无需通过电子表格生成参考信息,尽管这种方法可用于汇总大量序列并可视化重要特征。序列比对和序列标志图有助于研究每个位点的保守程度,但无法主动突出对结构或功能至关重要的序列特征。以CS-αβ为例的分析重点关注了结构特征,但也可将构成结合位点的特定氨基酸作为定义性特征纳入。随着赋予CS-αβ肽特定抗菌/毒性活性的序列特征被鉴定出来,这些特征可被添加至参考体系中,以基于活性进一步明确分组。本示例中仅使用了预测的成熟肽序列,但如果信号肽或前肽的存在具有重要意义,则可为每条序列补充该信息。若特定的插入或缺失事件以及内含子位置具有信息价值,也可一并纳入。使用MrBayes进行系统发育分析的一个优势在于其不仅限于分子数据——它还可分析编码其他可能具有进化...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

正在进行的缓步动物抗菌肽研究得到了中西部大学研究与资助项目办公室(ORSP)院内资金的支持。ORSP 在研究设计、数据收集、分析、解释以及论文撰写方面均未发挥作用。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
BLAST 网页https://blast.ncbi.nlm.nih.gov/Blast.cgi
EditSeq (Lasergene 套件)DNASTARhttps://www.dnastar.com/t-allproducts.aspx
Excel 2013Microsoft
FigTree http://tree.bio.ed.ac.uk/software/figtree/
MEGAwww.megasoftware.net
MrBayeshttp://mrbayes.sourceforge.net/
SCOP 数据库http://scop.mrc-lmb.cam.ac.uk/scop/

参考文献

  1. Matsuyama, K., Natori, S. Purification of Three Antibacterial Proteins from the Culture Medium of NIH-Sape-4, an Embryonic Cell Line of Sarcophaga peregrina. J Biol Chem. 263 (32), 17112-17116 (1988).
  2. Lambert, J., et al. Insect immunity: Isolation from immune blood of the dipteran Phormia terranovae. of two insect antibacterial peptides with sequence homology to rabbit lung macrophage bactericidal peptides. PNAS. 86 (262-266), (1989).
  3. Dimarcq, J. -L., Bulet, P., Hetru, C., Hoffmann, J. Cysteine-rich antimicrobial peptides in invertebrates. Biopolymers. 47, 465-477 (1998).
  4. Shafee, T. M. A., Lay, F. T., Hulett, M. D., Anderson, M. A. The Defensins Consist of Two Independent, Convergent Protein Superfamilies. Mol Biol Evol. 33 (9), 2345-2356 (2016).
  5. Zhu, S., Gao, B. Nematode-derived drosomycin-type antifungal peptdies provide evidence for plant-to-ecdysozoan horizontal transfer of a disease resistance gene. Nat Commun. 5, (2014).
  6. Zhu, S., Gao, B. Evolutionary origin of b-defensins. Dev. Comp. Immunol. 39, 79-84 (2013).
  7. Bonmatin, J. -M., et al. Two-dimensional 1H NMR study of recombinant insect defensin A in water: Resonance assignments, secondary structure and global folding. J Biomol NMR. 2 (3), 235-256 (1992).
  8. Cornet, B., et al. Refined three-dimensional solution structure of insect defensin A. Structure. 3 (5), 435-448 (1995).
  9. Murzin, A. G., Brenner, S. E., Hubbard, T., Chothia, C. SCOP: a structural classification of proteins database for the investigations of sequences and structures. J Mol Biol. 247, 536-540 (1995).
  10. Sillitoe, I., et al. CATH: comprehensive structural and functional annotations for genome sequences. Nucleic Acids Res. 43, (Database issue) 376-381 (2015).
  11. Lam, S. D., et al. Gene3D: expanding the utility of domain assignments. Nucleic Acids Res. 44, (Database issue) 404-409 (2016).
  12. Tarr, D. E. K. Establishing a reference array for the CS-ab superfamily of defensive peptides. BMC Res Notes. 9, 490(2016).
  13. Shafee, T. M. A., Robinson, A. J., van der Weerden, N., Anderson, M. A. Structural homology guided alignment of cysteine rich proteins. SpringerPlus. 5 (27), (2016).
  14. Altschul, S. F., Gish, W., Miller, W., Myers, E. W., Lipman, D. J. Basic Local Alignment Search Tool. J Mol Biol. 215 (3), 403-410 (1990).
  15. Duckert, P., Brunak, S., Blom, N. Prediction of proprotein convertase cleavage sites. Protein Eng Des Sel. 17 (1), 107-112 (2004).
  16. Petersen, T. N., Brunak, S., von Heijne, G., Nielsen, H. SignalP 4.0:discriminating signal peptides from transmembrane regions. Nat Methods. 8, 785-786 (2011).
  17. Kobayashi, Y., et al. The cysteine-stabilized a-helix: A common structural motif of ion-channel blocking neurotoxic peptides. Biopolymers. 31, 1213-1220 (1991).
  18. Gao, B., del Carmen Rodriguez, M., Lanz-Mendoza, H., Zhu, S. AdDLP, a bacterial defensin-like peptide, exhibits anti-Plasmodium. activity. Biochem Biophys Res Commun. 387, 393-398 (2009).
  19. Tamura, K., Stecher, G., Peterson, D., Filipski, A., Kumar, S. MEGA6: Molecular Evolutionary Genetics Analysis. Mol Biol Evol. 30 (12), 2725-2729 (2013).
  20. Edgar, R. C. MUSCLE: multiple sequence alignment with high accuracy and high throughput. Nucleic Acids Res. 32 (5), 1792-1797 (2004).
  21. Ronquist, F., Huelsenbeck, J. P. MrBayes 3: Bayesian phylogenetic inference under mixed models. Bioinformatics. 19 (12), 1572-1574 (2003).
  22. Altschul, S. F., et al. Gapped BLAST and PSI-BLAST: a new generation of protein database search programs. Nucleic Acids Res. 25 (17), 3389-3402 (1997).
  23. Zhang, Z., et al. Protein sequence similarity searches using patterns as seeds. Nucleic Acids Res. 26 (17), 3986-3990 (1998).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

蛋白质分类电子表格软件半胱氨酸稳定型α-β超家族序列比对系统发育分析结构特征氨基酸间距MEGA 6 软件蛋白质命名法分歧序列