方法文章

蛋白质-蛋白质相互作用中潜在多特异性肽结合结构域的氨基酸偏好计算预测

3K 次观看

DOI:

10.3791/66314

2024年1月26日

本文内容

摘要

我们描述了一种基于序列多样化的研究方法,用于估算蛋白质-蛋白质相互作用(PPIs)中多特异性结合位点的氨基酸偏好性。该策略通过生成并筛选数千种潜在的肽配体来实现 计算机模拟从而克服了现有实验方法的一些局限性。

摘要

许多蛋白质-蛋白质相互作用涉及短肽段与肽结合结构域的结合。通常,此类相互作用需要识别具有可变保守性的线性基序。在同一配体中,高度保守区域与较可变区域的组合常常导致结合的多特异性,这是酶和细胞信号传导蛋白的常见特性。表征肽结合结构域的氨基酸偏好对于设计蛋白质-蛋白质相互作用(PPIs)的调控分子至关重要。计算方法是对通常成本高昂且操作繁琐的实验技术的一种高效替代方案,能够设计出潜在的调控分子,并可在后续实验中进行验证。本文介绍了一种利用Rosetta分子建模软件包中的Pepspec应用程序来预测肽结合结构域氨基酸偏好的方法。当受体蛋白的结构和肽配体的性质均已知或可推断时,该方法尤为适用。该方法首先从配体中一个特征明确的锚定残基开始,通过随机添加氨基酸残基进行延伸。随后通过柔性骨架肽段对接评估所生成肽段的结合亲和力,以筛选出预测结合评分最优的肽段。这些肽段可用于计算氨基酸偏好,并可选择性地构建位置权重矩阵(PWM),供后续研究使用。为展示该方法的应用,我们研究了人干扰素调节因子5(IRF5)亚基之间的相互作用。该相互作用此前已知具有多特异性,但整体上由一个称为pLxIS的短保守基序引导。所预测的氨基酸偏好与先前关于IRF5结合表面的知识一致。可被磷酸化的丝氨酸残基所在位置表现出天冬氨酸和谷氨酸的高频出现,这很可能是因为它们带负电荷的侧链与磷酸化丝氨酸相似。

引言

两种蛋白质之间的相互作用通常涉及短肽段氨基酸与肽结合结构域的结合,类似于蛋白质-肽界面。参与此类蛋白质-蛋白质相互作用(PPI)的受体蛋白通常能够识别一组部分重叠但各不相同的配体序列,这一特性称为多特异性1,2。多特异性识别是许多细胞蛋白的特征,但在酶和细胞信号传导蛋白中尤为显著3。与多特异性结合位点相互作用的蛋白质,其序列中通常包含保守程度较高和较低区域的组合4,5,6。在此情况下,更保守的序列模体参与严格的分子相互作用;相反,可变性较高的序列则与受体结合位点中具有一定宽容性的表面发生相互作用。通常,这些保守性较低但仍具有功能相关性的片段为缺乏明确二级结构模式的环状区域,或具有更高动态构象,例如典型内在无序蛋白所具有的构象7

鉴定结合位点的潜在肽配体通常是设计能够干扰相应蛋白质相互作用(PPIs)的介导分子的第一步8。然而,在多特异性结合位点的配体中,大多数序列位置上通常难以找到单一出现频率最高的氨基酸残基。相反,这些位点可能根据氨基酸的化学性质,对特定类别的氨基酸具有偏好性,例如带负电荷的酸性氨基酸(如天冬氨酸或谷氨酸)、具有大体积芳香环的氨基酸(如苯丙氨酸),或更疏水的残基(如脂肪族氨基酸丙氨酸、缬氨酸、亮氨酸或异亮氨酸)3。已有多种实验方法可用于揭示蛋白质结合位点的氨基酸偏好性,包括定向进化9、多密码子扫描突变10和深度突变扫描11。这些方法均基于序列多样化策略,即对原始配体引入突变,并进一步分析其对受体蛋白功能的影响(详见Bratulic和Badran12的综述)。然而,这些方法通常需要检测大规模的序列文库,因而更加繁琐、成本较高且耗时较长。

推断多特异性结合位点氨基酸偏好的计算方法有望克服湿实验方法的局限性。其中,计算机序列多样化方法通过评估配体序列中大量氨基酸替换的能量效应,来表征蛋白质-蛋白质相互作用(PPI)的结构可塑性13。该方法首先以肽配体与受体结合位点的复合结构或模型为起点,随后对配体序列引入突变。接着利用统计学和能量评分函数评估这些突变对稳定性和结合亲和力的影响。通过评估阶段获得的一组高分配体序列可用于计算氨基酸偏好。该策略能够以高效的方式处理大量配体序列,因此相较于湿实验方法通常所能处理的有限序列数量,可提供更全面且一致的氨基酸偏好推断结果。

Rosetta 分子建模套件中的 Pepspec 应用程序14 是一种在肽设计模式中将序列多样化作为关键步骤的工具。该应用程序需要一个受体蛋白的结构或模型,其中结合有一个长度至少为单个氨基酸残基的肽,该肽将作为后续步骤的锚定点。随后,结合肽的序列会被延伸(如有必要)并进行多样化,以生成大量假定的肽配体。接着通过柔性骨架肽对接来评估这些肽的结合亲和力,从而筛选出预测结合评分最优的肽。尽管该应用程序的主要输出结果是设计阶段末期筛选出的最佳肽候选物,但在该阶段接受的更大规模的肽集合也可用于计算靶标结合位点的氨基酸偏好性。氨基酸偏好性通过配体序列每个位置上各氨基酸残基出现的频率来计算,可表示为位置权重矩阵(PWM)或更直观的序列标志图(sequence logo)。

本文描述了一种用于估算参与蛋白质-蛋白质相互作用(PPI)的受体蛋白结合表面氨基酸偏好的实验方案。该方案适用于已知蛋白配体的线性片段与受体蛋白结合的情形,因此可将该相互作用建模为蛋白-肽界面。在此类情形中,配体中的保守基序通常与受体结合位点内的特定口袋相互作用,尽管参与PPI的整个配体片段可能包含保守性较低的区域。方案主要步骤的流程图见图1。该方案从蛋白-蛋白复合物的三维结构出发,将配体蛋白进一步缩减为最有可能发生强相互作用的片段,而保持受体蛋白结构不变。最有可能发生强相互作用的片段通过BUDE Alanine Scan服务器15推断得出,该服务器通过计算丙氨酸扫描突变分析,识别两个相互作用蛋白之间的热点残基。在此方法中,配体中的残基被逐一替换为丙氨酸,随后根据复合物自由能或稳定性的预测变化值(ΔΔG)来推断相应残基在目标PPI中的重要性。确定最有可能发生强相互作用的片段后,将其与受体蛋白形成的复合物作为基础结构提交至Pepspec,以进行序列多样化分析。

蛋白质-蛋白质复合物示意图;展示序列多样化过程;肽段分析结果。
图1:本研究提出的实验方案主要步骤概览。 图中标注的数字与方案部分的步骤编号相对应。图中所用示例为文中描述的蛋白质-蛋白质复合物。在此复合物中,被视为受体的蛋白质链以粉红色显示,而被视为配体的链以浅蓝色显示,其中预测的最适相互作用片段以红色突出显示。请点击此处查看该图的放大版本。

该建议方案的一个局限性在于需要已解析的蛋白质-肽段相互作用结构。该方案也可从目标蛋白质-肽段相互作用的模型开始,但本文未描述具体的建模步骤。此外,尽管该方案可在任何操作系统的个人计算机上运行,但涉及 Rosetta 应用程序的步骤需要 Linux 环境。由于 Pepspec 通常需要执行大量迭代,因此强烈建议在序列多样化步骤中使用计算机集群。

通过估算人干扰素调节因子(IRF)家族成员IRF5结合表面的氨基酸偏好性,展示了本建议方案的应用。我们选择该蛋白作为示例,是因为在其激活过程中,两个亚基结合形成二聚体,其结构已被充分表征16。在IRF二聚体中,结合可被建模为一种蛋白-肽界面,其中一个亚基提供结合表面,另一个亚基则通过一段包含称为pLxIS的短保守基序的区域进行相互作用17,18。此外,与IRF亚基的结合具有多特异性,因此它们可以形成同源二聚体、异源二聚体,以及与其他已知为共激活因子的细胞蛋白形成的复合物18

方案

1. 蛋白质-肽段相互作用界面的初始准备

  1. 下载蛋白质-蛋白质复合物的结构
    1. 进入蛋白质数据库(Protein Data Bank,PDB)主页(https://www.rcsb.org/),在主搜索框中输入目标蛋白质-蛋白质复合物结构的PDB编号(图2A)。本文示例所用的IRF5二聚体结构的PDB编号为3DSH19
    2. 在目标结构的主页面上,点击Download Files图2B),然后选择Biological Assembly 1 (PDB - gz)图2C)。
      注意:在PDB数据库中,许多由相同单体组成的蛋白质复合物结构以生物组装体(biological assembly)形式呈现,其中PDB文件仅存储一个单体的结构(即非对称单元)。对于多聚体结构(如本例中的IRF5二聚体),必须下载包含两个非对称单元实例的生物组装体文件。为便于本实验方案后续步骤的操作,需首先将两个单体分离,并为它们分配不同的链标识(chain ID)。
    3. 在UCSF Chimera20中打开下载的结构文件,点击Tools > Structure Editing > Change Chain IDs。本示例中,生物组装体中的两条链初始均标记为A。将第二条链(标记为#0.2)重命名为B,然后点击OK
    4. 点击Favorites > Model Panel,然后选择包含两条链的模型。点击Group/Ungroup按钮,将每条链分离为独立的模型。随后,选中这两个模型,点击Copy/Combine按钮。输入合并后模型的新名称,勾选Close Source Models,然后点击OK
    5. 点击Select > Chain,确认二聚体中的每条链现在均已用不同字母标识,分别为AB
    6. 使用File > Save PDB将编辑后的结构保存为新的PDB文件,供本实验方案后续步骤使用(本例中命名为IRF5_dimer.pdb)。

显示二聚体干扰素晶体结构的蛋白质数据库界面,文件下载选项。
图2:本研究中用作代表性示例的结构在蛋白质数据库(PDB)中的页面。A)用于输入目标结构PDB登录号的搜索框。(B)以多种格式下载该结构的菜单。(C)当结构以非对称单元形式保存时,下载其生物组装体的选项(详见步骤1.1.2)。请点击此处查看此图的放大版本。

  1. 确定配体蛋白中的目标片段
    1. 进入 BUDE 丙氨酸扫描服务器(https://pragmaticproteindesign.bio.ed.ac.uk/balas/)。在结构上传部分点击选择文件按钮,并选择步骤 1.1.6 中保存的 PDB 文件。
    2. 在下一页中,确认结构已正确加载(图 3A),并在服务器中为该任务输入一个名称(图 3B)。
    3. 设置 PDB 文件中将被作为受体(A)和配体(B)的链(图 3C)。然后点击开始扫描按钮以提交任务。
    4. 任务完成后,点击显示结果以打开结果页面(图 4)。
      注意:在结果页面中,配体结构中的残基根据其自由能变化估计值(ΔΔG)着色,数值较高的残基显示为红色。
    5. 从残基列表中选择一段预测与目标结合表面相互作用最佳的残基区域。确保这些残基在自由能差异(ΔΔG)上具有较高的数值聚集。在本示例中,选择了残基 Leu424 至 Ser436 之间的片段(在 图 4 右侧面板中用红色框标出)。
  2. 准备用于序列多样化的蛋白-肽界面
    1. 在 Chimera 中打开步骤 1.1.6 中保存的 PDB 文件,并检查目标亚基结构中是否存在缺失的原子或键。
    2. 删除所有与原始结构共结晶的小分子、离子和溶剂。操作方法为:点击选择 > 残基,然后选择除标准氨基酸外的所有分子。接着点击操作 > 原子/键并选择删除
    3. 将配体链裁剪至步骤 1.2.5 中选定的最佳相互作用片段。操作方法为:点击收藏夹序列,然后点击被视作配体的链(B)。在序列面板中,拖动鼠标选择除第 424 至 436 位以外的所有残基。删除这些残基的方法是点击操作 > 原子/键并选择删除
    4. 使用文件 > 保存 PDB将编辑后的结构保存为一个新的 PDB 文件,用于后续实验步骤(此处使用的文件名为 IRF5_interface.pdb)。

用于蛋白质结构分析的BUDE丙氨酸扫描软件界面,包括IRF5二聚体可视化。
图3:在BUDE丙氨酸扫描服务器中选择受体和配体。A)蛋白质-蛋白质复合物的图形表示。(B)在服务器中输入任务名称的文本框。(C)用于交互式选择将作为受体和配体的链的面板(详见步骤1.2)。请点击此处查看该图的放大版本。

BUDE丙氨酸扫描示意图;用于残基影响评估的蛋白质结构分析及数据表。
图4:BUDE丙氨酸扫描服务器的结果页面。 配体序列中潜在的最佳相互作用区段以红色框标出。在左侧面板中,具有较高预测能量贡献的残基(Leu433)以绿色高亮显示。 请点击此处查看该图的放大版本。

2. 序列多样化

注意:在以下步骤中,rosetta_main 指的是 Rosetta 的主安装目录,通常位于 /opt/rosetta_src__bundle/main/,其中 表示已安装的 Rosetta 版本。此外,假设 Rosetta 应用程序可在系统范围内访问;如果情况并非如此,则必须提供可执行文件的完整路径。当从源代码编译时,这些可执行文件位于 /rosetta_main/source/bin/ 目录中。

  1. 氨基酸侧链的初步优化
    1. 将步骤 1.3.4 中保存的编辑后结构复制到 Rosetta 应用程序可访问的 Linux 位置。
    2. 使用 Rosetta 的 FixBB 应用程序对序列多样化前的基础结构中所有氨基酸侧链进行重新包装(repack)。在此操作中,所有氨基酸侧链的取向将被优化,以最小化能量并提高复合物的稳定性。运行以下命令:
      用于 IRF5 界面包装分析的蛋白质结构优化命令行。
      注意:该命令会输出一个以原始结构命名并附加数字后缀的 PDB 文件(在本示例中为 IRF5_interface_0001.pdb)。
    3. 为便于进行下一步操作,使用以下命令将重新包装后的 PDB 文件重命名为带有 _repack 后缀的文件:
      mv IRF5_interface_0001.pdb IRF5_repack.pdb
  2. 序列多样化
    1. 以设计模式运行 Pepspec,执行实际的序列多样化步骤,使用以下命令:
      用于蛋白质结构预测分析的 pep: IRF5 repack 命令行代码片段
      以下是通用选项:
      • -s 表示输入文件(即步骤 2.1.3 中生成的重新包装后的 PDB 文件)。
      • -o 表示输出文件的前缀名称。
      • -database 表示主 Rosetta 3 数据库的路径。
      • -ex1、-ex2extrachi_cutoff 是 rotamer 库选项(详见 Pepspec 文档)。
      • -overwrite 指示应用程序覆盖先前迭代可能生成的已有输出。
      以下是与序列多样化本身相关的选项:
      • -pepspec:pep_chain 指定被视为配体的 PDB 链(本示例中为 'b')。
      • -pepspec:native_pep_anchor 指定用作锚点的氨基酸残基(本示例中为配体肽第 10 位的 Leu 残基)。
      • -pepspec:n_peptides 指定要输出的肽结构数量。
      • -pepspec:no_prepack_prot 指示应用程序跳过对输入基础结构的重新包装(因为此步骤已在步骤 2.1 中完成)。
        注意:Pepspec 的主要输出是一个目录,其中包含设计阶段生成的肽的 PDB 文件,文件名以输出前缀加 .pdbs 后缀命名(本示例中为 IRF5.pdbs)。此外,Pepspec 还会输出在序列多样化步骤中所有被接受的肽序列及其对应的 Rosetta 能量评分,保存在一个以输出前缀命名、后缀为 .spec 的制表符分隔文本文件中(本示例中为 IRF5.spec)。由于本研究中描述的方案旨在评估氨基酸偏好性,而非实际的肽设计,后续步骤将使用 IRF5.spec 文件,而不是 .pdbs 目录中的 PDB 结构。

3. 氨基酸偏好性的估算

  1. 计算 PWM
    1. 要生成 PWM,请使用 Rosetta 套件中包含的 gen_pepspec_pwm.py 脚本。运行该脚本的命令如下:
      用于蛋白质相互作用分析的 Python 脚本片段;Rosetta 命令行与界面评分。
      其中:
      • IRF5.spec 是步骤 2.2 中生成的 Pepspec 输出文件。
      • -1 表示序列中没有额外的 N 末端残基,因此 PWM 中的位置采用从 1 开始的编号方式。
      • 0.2 告诉脚本仅考虑 Pepspec 输出结果中得分最高的前 20% 肽段(默认值为 0.1,对应前 10%)。
      • interface_score 告诉脚本根据界面评分对肽段进行排序,界面评分是 Pepspec 输出文件中包含的多种 Rosetta 评分之一。
        注意:该脚本会生成两个输出文件,一个为计算得到的 PWM 文件(后缀为 .pwm),另一个为用于计算 PWM 的肽段子集的序列文件(后缀为 .seq)。这些文件的名称还包括用于排序的评分方法及所用肽段的比例。在本示例中,这两个文件分别命名为 IRF5_interface_score_0.2.pwmIRF5_interface_score_0.2.seq
  2. 生成序列标志图(sequence logo)
    1. 访问 WebLogo 服务器(https://weblogo.berkeley.edu/logo.cgi)21,点击 Upload Sequence Data 旁边的 Choose File 按钮。上传步骤 3.1.1 中生成的肽段序列文件(本示例中为 IRF5_interface_score_0.2.seq)。
    2. 根据输入序列长度选择所需的标志图格式和尺寸。本示例使用 PDF 格式,尺寸为 15 cm × 12 cm。点击 Create Logo

结果

本文描述了一种用于预测干扰素调节因子5(IRF5)结合表面氨基酸偏好的实验方案。IRF5属于干扰素调节因子家族,该家族是一类被称为人干扰素调节因子的转录因子。这些蛋白质是先天性和适应性免疫应答的调控因子,参与多种免疫细胞的分化与活化过程。IRF亚基具有高度可塑且多特异性的结合表面,能够形成同源二聚体、异源二聚体以及与其他细胞蛋白的复合物17,18。二聚化被认为是这些因子活化的第一步,在大多数家族成员中,该过程由多个丝氨酸/苏氨酸残基的磷酸化所触发18。在二聚化过程中,每个单体通过其序列C端区域附近一个高度保守的基序pLxIS与另一个单体的结合表面相互作用。pLxIS这一缩写部分代表了结合表面的氨基酸偏好,其顺序识别一个极性氨基酸(“p”),随后是两个富含亮氨酸(“L”)和异亮氨酸(“I”)的位置,这两个位置之间由任意氨基酸占据的一个位置(“x”)隔开,并最终接一个可磷酸化的丝氨酸残基(在此例中为Ser436)。包括pLxIS基序在内的多个丝氨酸残基的磷酸化,可促进一个单体C端片段的弯曲,并促使其与另一个单体的结合表面发生相互作用19,22

本方案从IRF5二聚体的三维结构开始19,其中将其中一个单体任意视为蛋白质相互作用(PPI)中的受体,另一个单体则视为含有pLxIS基序的配体。为了更精确地确定与受体结合位点相互作用的配体片段,我们进行了计算性丙氨酸扫描突变分析(步骤1.2)。预测得到的片段包含从第424至436位共13个氨基酸残基,其中pLxIS基序从Arg432开始。随后,将原始二聚体结构简化为一个肽-蛋白复合物,即将被视为配体的单体序列截取为预测出的最佳相互作用片段,而另一个单体保持完整(步骤1.3)。该结构随后被用作序列多样化策略的输入(第2节),并将pLxIS基序中的亮氨酸残基(Leu433)指定为Pepspec所要求的锚定残基。此过程产生了超过26,000种潜在的肽配体。选取能量评分最优的前20%潜在配体(共5,280种)用于估计结合表面的氨基酸偏好性,并以PWM(图5A)和序列标志图(图5B)的形式展示(第3节)。

pLxIS基序分析的氨基酸频率矩阵和序列标志图;蛋白质结合研究结果。
图5:IRF3结合表面的氨基酸偏好性。A)PWM图,表示肽配体序列中每个位置(列)对应的各氨基酸残基(行)出现频率。(B)以序列标志图形式直观展示相应的氨基酸频率。序列标志图每列下方括号内显示了原始IRF5序列的位置。请点击此处查看该图的放大版本。

在PWM中,每一行对应一个特定的氨基酸残基,每一列代表序列中的一个位置。矩阵中的每个单元格包含该位置每种氨基酸的相对频率,该频率经整体背景频率加权。序列标志图(sequence logos)通过堆叠氨基酸字母来构建,其中每个位置处堆叠的总高度表示该位置序列整体的保守性;相反,堆叠中各个字母的高度则表示相应氨基酸的频率。在此示例中,PWM和序列标志图均与先前关于IRF5结合表面的知识一致:在第432位('p')更倾向于极性氨基酸(谷氨酸),而在第433位和第435位则分别对亮氨酸和异亮氨酸表现出极高的偏好。值得注意的是,尽管原始IRF5序列中第427、429和436位被丝氨酸占据,但模型均预测这些位置对天冬氨酸具有更高的保守性。这一发现表明这些位点的磷酸化在IRF5二聚体形成中具有重要作用,因为天冬氨酸和谷氨酸侧链所带的负电荷与磷酸化丝氨酸相似。事实上,已有研究报道一种称为IRF5D的诱饵肽——其中这些丝氨酸残基被替换为天冬氨酸——能够抑制IRF5的活性23。相反,第425位被预测对丝氨酸具有极高的偏好,提示该位置的丝氨酸残基可能以其未磷酸化形式参与蛋白质相互作用(PPI)。实际上,先前已有研究报道,在其他IRF家族蛋白中,相应丝氨酸残基的磷酸化会负向影响二聚化及其与其他共激活因子的结合16,24

讨论

本文介绍了一种基于计算机序列多样化方法来估算潜在多特异性结合位点氨基酸偏好的实验方案。目前已有少数计算工具被开发用于预测蛋白质-肽相互作用界面的氨基酸偏好14,25,26。这些工具具有预测性质,但在用于预测的计算算法以及为提高准确性所采用的校正方法上有所不同。在本研究中,我们使用了Rosetta分子建模套件中的Pepspec应用程序14。尽管该程序主要面向肽的设计,但它实现了一种序列多样化算法,可用于预测氨基酸偏好。据我们所知,该工具是目前唯一提供内置脚本、可直接从序列多样化结果中计算PWM(位置权重矩阵)的可用工具。需要特别指出的是,本方案聚焦于蛋白质-蛋白质相互作用(PPIs),因此初始结构应为两个蛋白质亚基形成的复合物。在实际进行序列多样化步骤之前,需将被视为配体的蛋白质截取为预期与受体蛋白发生相互作用的片段,并进一步将其作为肽处理。然而,该方案也可应用于蛋白质-肽复合物,在此类情况下,步骤1.1–1.3可能无需执行。在准备阶段(第1节),还需纠正错误格式的残基和异源原子,并对复合物结构中与目标结合位点相关但未能清晰解析的区域进行建模。这些修正依赖于具体研究的结构,在本文所用示例结构中并未需要此类修正。

本方案中最关键的步骤是使用 Rosetta 应用程序执行的操作,包括使用 FixBB 进行初始侧链重打包(步骤 2.1)以及使用 Pepspec 进行实际的序列多样化(步骤 2.2)。Pepspec 的作者明确指出,序列多样化前必须进行这一初始重打包步骤(称为预打包)14。尽管该步骤可由 Pepspec 自身完成,但该程序的作者强烈推荐使用专门设计用于在固定蛋白质主链上优化侧链构象的 FixBB 应用程序。在序列多样化步骤中,需注意 Pepspec 应用程序主要面向肽段设计,因此默认仅报告少数得分最高的肽段候选物。由于本方案的目标是生成大量潜在的肽配体,而非仅少数高分候选物,因此我们将 "-pepspec:n_peptides" 参数从默认值 8 调整为 200(步骤 2.2.1)。在此设置下,Pepspec 预测出超过 20,000 种肽段作为潜在配体。这一庞大的假定肽段集合全面展示了受体的结合空间特征,随后我们从中选取得分最高的前 20% 肽段,用于实际的氨基酸偏好性评估。如果传递给 "-pepspec:n_peptides" 的肽段数量较少,Pepspec 接受的候选肽段将显著减少。在此情况下,本方案所建议的采样策略可能包含大量能量评分次优的潜在肽配体,从而可能导致评估结果的稳健性降低。

本研究中所述方案的一个主要局限性在于,它依赖于对含有结合表面的蛋白质结构的先验知识。然而,该结构不一定需要通过实验测定,也可以通过从头建模(ab initio)或同源建模方法获得14。此外,还需要至少知道肽配体中一个氨基酸残基(锚点)的结合模式。该锚点将通过Pepspec中的特定锚点扩展选项,延伸至一定数量的残基,以实现序列多样化。如果已知整个配体在结合位点中的取向(如本研究代表性示例的情况),则应保留与锚点扩展相关的选项为默认设置(不进行扩展),尽管仍需指定肽中的一个残基作为锚点,以引导序列多样化算法。Pepspec应用程序不支持对可能的锚点残基进行从头对接,但它可以利用其他对接程序的输出结果,或同源蛋白质-肽复合物的模型作为输入,来执行锚点对接14;不过这些情况超出了本文的讨论范围。

所建议方案的一个重要缺点是其固有的预测性质,这直接受到蛋白质-蛋白质复合物初始结构或模型的分辨率和准确性的影响。然而,Pepspec 的作者们指出,该应用的准确性 通过将输入的骨架坐标视为一组结构,而非仅使用单一蛋白质结构,并在计算PWM时应用背景归一化,显著提升了结果。14此外,该方案为评估氨基酸偏好的繁琐且昂贵的实验方法提供了一种替代选择。所有这些实验方法均依赖于通过向蛋白质配体序列引入突变来获得大量序列文库,随后实验评估这些突变的影响(参见 Bratulic 和 Badran)12 有关综述,请参见相关文献)。本文提出的计算方案可高效地筛选成千上万种潜在的肽配体,从而有望提供更可靠的氨基酸偏好性估计数据集。13,14,25我们提出的方案可应用于任何可简化为蛋白质-肽段相互作用界面的蛋白质相互作用(PPI)。此外,该方案还可作为初步策略,用于鉴定PPI的调控分子,例如潜在的激活剂或抑制剂。所鉴定出的调控分子可用于在实验室中进一步研究这些PPI,或被评估为潜在的治疗剂。

披露

作者无任何利益冲突需要披露。

致谢

感谢巴拿马国家研究系统(SNI)(资助编号 SNI-043-2023 和 SNI-170-2021)、巴拿马国家科学技术与创新秘书处(SENACYT)以及人力资源培训与利用研究所(IFARHU)提供的经费支持。作者谨此感谢 Miguel Rodríguez 博士对稿件的仔细审阅。

材料

本文使用的材料清单
姓名公司目录编号评论
BUDE丙氨酸扫描服务器爱丁堡大学https://pragmaticproteindesign.bio.ed.ac.uk/balas/doi: 10.1021/acschembio.9b00560
Rosetta建模软件Rosetta Commonshttps://www.rosettacommons.org/softwaredoi: 10.1002/prot.22851
UCSF Chimera加州大学旧金山分校https://www.cgl.ucsf.edu/chimera/doi: 10.1002/jcc.20084

参考文献

  1. Kim, P. M., Lu, L. J., Xia, Y., Gerstein, M. B. Relating three-dimensional structures to protein networks provides evolutionary insights. Science. 314 (5807), 1938-1941 (2006).
  2. Schreiber, G., Keating, A. E. Protein binding specificity versus promiscuity. Current Opinion in Structural Biology. 21 (1), 50-61 (2011).
  3. Erijman, A., Aizner, Y., Shifman, J. M. Multispecific recognition: Mechanism, evolution, and design. Biochemistry. 50 (5), 602-611 (2011).
  4. Fromer, M., Shifman, J. M. Tradeoff between stability and multispecificity in the design of promiscuous proteins. PLoS Computational Biology. 5 (12), e1000627(2009).
  5. Xie, T., Zmyslowski, A. M., Zhang, Y., Radhakrishnan, I. Structural basis for multispecificity of MRG domains. Structure. 23 (6), London, England. 1049-1057 (2015).
  6. Hendler, A., et al. Human SIRT1 multispecificity is modulated by active-site vicinity substitutions during natural evolution. Molecular Biology and Evolution. 38 (2), 545-556 (2021).
  7. Teilum, K., Olsen, J. G., Kragelund, B. B. On the specificity of protein-protein interactions in the context of disorder. The Biochemical Journal. 478 (11), 2035-2050 (2021).
  8. Pelay-Gimeno, M., Glas, A., Koch, O., Grossmann, T. N. Structure-based design of inhibitors of protein-protein interactions: Mimicking peptide binding epitopes. Angewandte Chemie (International ed. in English). 54 (31), 8896-8927 (2015).
  9. Wang, Y., Xue, P., Cao, M., Yu, T., Lane, S. T., Zhao, H. Directed evolution: Methodologies and applications. Chemical Reviews. 121 (20), 12384-12444 (2021).
  10. Liu, J., Cropp, T. A. Rational protein sequence diversification by multi-codon scanning mutagenesis. Methods in Molecular Biology. 978, 217-228 (2013).
  11. Wei, H., Li, X. Deep mutational scanning: A versatile tool in systematically mapping genotypes to phenotypes. Frontiers in Genetics. 14, 1087267(2023).
  12. Bratulic, S., Badran, A. H. Modern methods for laboratory diversification of biomolecules. Current Opinion in Chemical Biology. 41, 50-60 (2017).
  13. Humphris, E. L., Kortemme, T. Prediction of protein-protein interface sequence diversity using flexible backbone computational protein design. Structure. 16 (12), 1777-1788 (2008).
  14. King, C. A., Bradley, P. Structure-based prediction of protein-peptide specificity in Rosetta. Proteins. 78 (16), 3437-3449 (2010).
  15. Ibarra, A. A., et al. Predicting and experimentally validating hot-spot residues at protein-protein interfaces. ACS Chemical Biology. 14 (10), 2252-2263 (2019).
  16. Chen, W., Srinath, H., Lam, S. S., Schiffer, C. A., Royer, W. E., Lin, K. Contribution of Ser386 and Ser396 to activation of interferon regulatory factor 3. Journal of Molecular Biology. 379 (2), 251-260 (2008).
  17. Mancino, A., Natoli, G. Specificity and function of IRF family transcription factors: Insights from genomics. Journal of Interferon & Cytokine Research. 36 (7), 462-469 (2016).
  18. Schwanke, H., Stempel, M., Brinkmann, M. M. Of keeping and tipping the balance: Host regulation and viral modulation of IRF3-dependent IFNB1 expression. Viruses. 12 (7), 33(2020).
  19. Chen, W., et al. Insights into interferon regulatory factor activation from the crystal structure of dimeric IRF5. Nature Structural & Molecular Biology. 15 (11), 1213-1220 (2008).
  20. Pettersen, E. F., et al. UCSF Chimera-A visualization system for exploratory research and analysis. Journal of Computational Chemistry. 25, 1605-1612 (2004).
  21. Crooks, G. E., Hon, G., Chandonia, J. -M., Brenner, S. E. WebLogo: a sequence logo generator. Genome Research. 14 (6), 1188-1190 (2004).
  22. Panne, D., McWhirter, S. M., Maniatis, T., Harrison, S. C. Interferon regulatory factor 3 is regulated by a dual phosphorylation-dependent switch. The Journal of Biological Chemistry. 282 (31), 22816-22822 (2007).
  23. Weihrauch, D., et al. An IRF5 decoy peptide reduces myocardial inflammation and fibrosis and improves endothelial cell function in tight-skin mice. PloS One. 11 (4), e0151999(2016).
  24. Mori, M., Yoneyama, M., Ito, T., Takahashi, K., Inagaki, F., Fujita, T. Identification of Ser-386 of interferon regulatory factor 3 as critical target for inducible phosphorylation that determines activation. The Journal of Biological Chemistry. 279 (11), 9698-9702 (2004).
  25. Smith, C. A., Kortemme, T. Predicting the tolerated sequences for proteins and protein interfaces using RosettaBackrub flexible backbone design. PloS One. 6 (7), e20451(2011).
  26. Rubenstein, A. B., Pethe, M. A., Khare, S. D. MFPred: Rapid and accurate prediction of protein-peptide recognition multispecificity using self-consistent mean field theory. PLoS Computational Biology. 13 (6), e1005614(2017).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Rosetta Pepspec IRF5

相关文章