我们描述了一种基于序列多样化的研究方法,用于估算蛋白质-蛋白质相互作用(PPIs)中多特异性结合位点的氨基酸偏好性。该策略通过生成并筛选数千种潜在的肽配体来实现 计算机模拟从而克服了现有实验方法的一些局限性。
方法文章
我们描述了一种基于序列多样化的研究方法,用于估算蛋白质-蛋白质相互作用(PPIs)中多特异性结合位点的氨基酸偏好性。该策略通过生成并筛选数千种潜在的肽配体来实现 计算机模拟从而克服了现有实验方法的一些局限性。
许多蛋白质-蛋白质相互作用涉及短肽段与肽结合结构域的结合。通常,此类相互作用需要识别具有可变保守性的线性基序。在同一配体中,高度保守区域与较可变区域的组合常常导致结合的多特异性,这是酶和细胞信号传导蛋白的常见特性。表征肽结合结构域的氨基酸偏好对于设计蛋白质-蛋白质相互作用(PPIs)的调控分子至关重要。计算方法是对通常成本高昂且操作繁琐的实验技术的一种高效替代方案,能够设计出潜在的调控分子,并可在后续实验中进行验证。本文介绍了一种利用Rosetta分子建模软件包中的Pepspec应用程序来预测肽结合结构域氨基酸偏好的方法。当受体蛋白的结构和肽配体的性质均已知或可推断时,该方法尤为适用。该方法首先从配体中一个特征明确的锚定残基开始,通过随机添加氨基酸残基进行延伸。随后通过柔性骨架肽段对接评估所生成肽段的结合亲和力,以筛选出预测结合评分最优的肽段。这些肽段可用于计算氨基酸偏好,并可选择性地构建位置权重矩阵(PWM),供后续研究使用。为展示该方法的应用,我们研究了人干扰素调节因子5(IRF5)亚基之间的相互作用。该相互作用此前已知具有多特异性,但整体上由一个称为pLxIS的短保守基序引导。所预测的氨基酸偏好与先前关于IRF5结合表面的知识一致。可被磷酸化的丝氨酸残基所在位置表现出天冬氨酸和谷氨酸的高频出现,这很可能是因为它们带负电荷的侧链与磷酸化丝氨酸相似。
两种蛋白质之间的相互作用通常涉及短肽段氨基酸与肽结合结构域的结合,类似于蛋白质-肽界面。参与此类蛋白质-蛋白质相互作用(PPI)的受体蛋白通常能够识别一组部分重叠但各不相同的配体序列,这一特性称为多特异性1,2。多特异性识别是许多细胞蛋白的特征,但在酶和细胞信号传导蛋白中尤为显著3。与多特异性结合位点相互作用的蛋白质,其序列中通常包含保守程度较高和较低区域的组合4,5,6。在此情况下,更保守的序列模体参与严格的分子相互作用;相反,可变性较高的序列则与受体结合位点中具有一定宽容性的表面发生相互作用。通常,这些保守性较低但仍具有功能相关性的片段为缺乏明确二级结构模式的环状区域,或具有更高动态构象,例如典型内在无序蛋白所具有的构象7。
鉴定结合位点的潜在肽配体通常是设计能够干扰相应蛋白质相互作用(PPIs)的介导分子的第一步8。然而,在多特异性结合位点的配体中,大多数序列位置上通常难以找到单一出现频率最高的氨基酸残基。相反,这些位点可能根据氨基酸的化学性质,对特定类别的氨基酸具有偏好性,例如带负电荷的酸性氨基酸(如天冬氨酸或谷氨酸)、具有大体积芳香环的氨基酸(如苯丙氨酸),或更疏水的残基(如脂肪族氨基酸丙氨酸、缬氨酸、亮氨酸或异亮氨酸)3。已有多种实验方法可用于揭示蛋白质结合位点的氨基酸偏好性,包括定向进化9、多密码子扫描突变10和深度突变扫描11。这些方法均基于序列多样化策略,即对原始配体引入突变,并进一步分析其对受体蛋白功能的影响(详见Bratulic和Badran12的综述)。然而,这些方法通常需要检测大规模的序列文库,因而更加繁琐、成本较高且耗时较长。
推断多特异性结合位点氨基酸偏好的计算方法有望克服湿实验方法的局限性。其中,计算机序列多样化方法通过评估配体序列中大量氨基酸替换的能量效应,来表征蛋白质-蛋白质相互作用(PPI)的结构可塑性13。该方法首先以肽配体与受体结合位点的复合结构或模型为起点,随后对配体序列引入突变。接着利用统计学和能量评分函数评估这些突变对稳定性和结合亲和力的影响。通过评估阶段获得的一组高分配体序列可用于计算氨基酸偏好。该策略能够以高效的方式处理大量配体序列,因此相较于湿实验方法通常所能处理的有限序列数量,可提供更全面且一致的氨基酸偏好推断结果。
Rosetta 分子建模套件中的 Pepspec 应用程序14 是一种在肽设计模式中将序列多样化作为关键步骤的工具。该应用程序需要一个受体蛋白的结构或模型,其中结合有一个长度至少为单个氨基酸残基的肽,该肽将作为后续步骤的锚定点。随后,结合肽的序列会被延伸(如有必要)并进行多样化,以生成大量假定的肽配体。接着通过柔性骨架肽对接来评估这些肽的结合亲和力,从而筛选出预测结合评分最优的肽。尽管该应用程序的主要输出结果是设计阶段末期筛选出的最佳肽候选物,但在该阶段接受的更大规模的肽集合也可用于计算靶标结合位点的氨基酸偏好性。氨基酸偏好性通过配体序列每个位置上各氨基酸残基出现的频率来计算,可表示为位置权重矩阵(PWM)或更直观的序列标志图(sequence logo)。
本文描述了一种用于估算参与蛋白质-蛋白质相互作用(PPI)的受体蛋白结合表面氨基酸偏好的实验方案。该方案适用于已知蛋白配体的线性片段与受体蛋白结合的情形,因此可将该相互作用建模为蛋白-肽界面。在此类情形中,配体中的保守基序通常与受体结合位点内的特定口袋相互作用,尽管参与PPI的整个配体片段可能包含保守性较低的区域。方案主要步骤的流程图见图1。该方案从蛋白-蛋白复合物的三维结构出发,将配体蛋白进一步缩减为最有可能发生强相互作用的片段,而保持受体蛋白结构不变。最有可能发生强相互作用的片段通过BUDE Alanine Scan服务器15推断得出,该服务器通过计算丙氨酸扫描突变分析,识别两个相互作用蛋白之间的热点残基。在此方法中,配体中的残基被逐一替换为丙氨酸,随后根据复合物自由能或稳定性的预测变化值(ΔΔG)来推断相应残基在目标PPI中的重要性。确定最有可能发生强相互作用的片段后,将其与受体蛋白形成的复合物作为基础结构提交至Pepspec,以进行序列多样化分析。

图1:本研究提出的实验方案主要步骤概览。 图中标注的数字与方案部分的步骤编号相对应。图中所用示例为文中描述的蛋白质-蛋白质复合物。在此复合物中,被视为受体的蛋白质链以粉红色显示,而被视为配体的链以浅蓝色显示,其中预测的最适相互作用片段以红色突出显示。请点击此处查看该图的放大版本。
该建议方案的一个局限性在于需要已解析的蛋白质-肽段相互作用结构。该方案也可从目标蛋白质-肽段相互作用的模型开始,但本文未描述具体的建模步骤。此外,尽管该方案可在任何操作系统的个人计算机上运行,但涉及 Rosetta 应用程序的步骤需要 Linux 环境。由于 Pepspec 通常需要执行大量迭代,因此强烈建议在序列多样化步骤中使用计算机集群。
通过估算人干扰素调节因子(IRF)家族成员IRF5结合表面的氨基酸偏好性,展示了本建议方案的应用。我们选择该蛋白作为示例,是因为在其激活过程中,两个亚基结合形成二聚体,其结构已被充分表征16。在IRF二聚体中,结合可被建模为一种蛋白-肽界面,其中一个亚基提供结合表面,另一个亚基则通过一段包含称为pLxIS的短保守基序的区域进行相互作用17,18。此外,与IRF亚基的结合具有多特异性,因此它们可以形成同源二聚体、异源二聚体,以及与其他已知为共激活因子的细胞蛋白形成的复合物18。
1. 蛋白质-肽段相互作用界面的初始准备

图2:本研究中用作代表性示例的结构在蛋白质数据库(PDB)中的页面。(A)用于输入目标结构PDB登录号的搜索框。(B)以多种格式下载该结构的菜单。(C)当结构以非对称单元形式保存时,下载其生物组装体的选项(详见步骤1.1.2)。请点击此处查看此图的放大版本。

图3:在BUDE丙氨酸扫描服务器中选择受体和配体。(A)蛋白质-蛋白质复合物的图形表示。(B)在服务器中输入任务名称的文本框。(C)用于交互式选择将作为受体和配体的链的面板(详见步骤1.2)。请点击此处查看该图的放大版本。

图4:BUDE丙氨酸扫描服务器的结果页面。 配体序列中潜在的最佳相互作用区段以红色框标出。在左侧面板中,具有较高预测能量贡献的残基(Leu433)以绿色高亮显示。 请点击此处查看该图的放大版本。
2. 序列多样化
注意:在以下步骤中,rosetta_main 指的是 Rosetta 的主安装目录,通常位于 /opt/rosetta_src__bundle/main/,其中 表示已安装的 Rosetta 版本。此外,假设 Rosetta 应用程序可在系统范围内访问;如果情况并非如此,则必须提供可执行文件的完整路径。当从源代码编译时,这些可执行文件位于 /rosetta_main/source/bin/ 目录中。


3. 氨基酸偏好性的估算

本文描述了一种用于预测干扰素调节因子5(IRF5)结合表面氨基酸偏好的实验方案。IRF5属于干扰素调节因子家族,该家族是一类被称为人干扰素调节因子的转录因子。这些蛋白质是先天性和适应性免疫应答的调控因子,参与多种免疫细胞的分化与活化过程。IRF亚基具有高度可塑且多特异性的结合表面,能够形成同源二聚体、异源二聚体以及与其他细胞蛋白的复合物17,18。二聚化被认为是这些因子活化的第一步,在大多数家族成员中,该过程由多个丝氨酸/苏氨酸残基的磷酸化所触发18。在二聚化过程中,每个单体通过其序列C端区域附近一个高度保守的基序pLxIS与另一个单体的结合表面相互作用。pLxIS这一缩写部分代表了结合表面的氨基酸偏好,其顺序识别一个极性氨基酸(“p”),随后是两个富含亮氨酸(“L”)和异亮氨酸(“I”)的位置,这两个位置之间由任意氨基酸占据的一个位置(“x”)隔开,并最终接一个可磷酸化的丝氨酸残基(在此例中为Ser436)。包括pLxIS基序在内的多个丝氨酸残基的磷酸化,可促进一个单体C端片段的弯曲,并促使其与另一个单体的结合表面发生相互作用19,22。
本方案从IRF5二聚体的三维结构开始19,其中将其中一个单体任意视为蛋白质相互作用(PPI)中的受体,另一个单体则视为含有pLxIS基序的配体。为了更精确地确定与受体结合位点相互作用的配体片段,我们进行了计算性丙氨酸扫描突变分析(步骤1.2)。预测得到的片段包含从第424至436位共13个氨基酸残基,其中pLxIS基序从Arg432开始。随后,将原始二聚体结构简化为一个肽-蛋白复合物,即将被视为配体的单体序列截取为预测出的最佳相互作用片段,而另一个单体保持完整(步骤1.3)。该结构随后被用作序列多样化策略的输入(第2节),并将pLxIS基序中的亮氨酸残基(Leu433)指定为Pepspec所要求的锚定残基。此过程产生了超过26,000种潜在的肽配体。选取能量评分最优的前20%潜在配体(共5,280种)用于估计结合表面的氨基酸偏好性,并以PWM(图5A)和序列标志图(图5B)的形式展示(第3节)。

图5:IRF3结合表面的氨基酸偏好性。(A)PWM图,表示肽配体序列中每个位置(列)对应的各氨基酸残基(行)出现频率。(B)以序列标志图形式直观展示相应的氨基酸频率。序列标志图每列下方括号内显示了原始IRF5序列的位置。请点击此处查看该图的放大版本。
在PWM中,每一行对应一个特定的氨基酸残基,每一列代表序列中的一个位置。矩阵中的每个单元格包含该位置每种氨基酸的相对频率,该频率经整体背景频率加权。序列标志图(sequence logos)通过堆叠氨基酸字母来构建,其中每个位置处堆叠的总高度表示该位置序列整体的保守性;相反,堆叠中各个字母的高度则表示相应氨基酸的频率。在此示例中,PWM和序列标志图均与先前关于IRF5结合表面的知识一致:在第432位('p')更倾向于极性氨基酸(谷氨酸),而在第433位和第435位则分别对亮氨酸和异亮氨酸表现出极高的偏好。值得注意的是,尽管原始IRF5序列中第427、429和436位被丝氨酸占据,但模型均预测这些位置对天冬氨酸具有更高的保守性。这一发现表明这些位点的磷酸化在IRF5二聚体形成中具有重要作用,因为天冬氨酸和谷氨酸侧链所带的负电荷与磷酸化丝氨酸相似。事实上,已有研究报道一种称为IRF5D的诱饵肽——其中这些丝氨酸残基被替换为天冬氨酸——能够抑制IRF5的活性23。相反,第425位被预测对丝氨酸具有极高的偏好,提示该位置的丝氨酸残基可能以其未磷酸化形式参与蛋白质相互作用(PPI)。实际上,先前已有研究报道,在其他IRF家族蛋白中,相应丝氨酸残基的磷酸化会负向影响二聚化及其与其他共激活因子的结合16,24。
本文介绍了一种基于计算机序列多样化方法来估算潜在多特异性结合位点氨基酸偏好的实验方案。目前已有少数计算工具被开发用于预测蛋白质-肽相互作用界面的氨基酸偏好14,25,26。这些工具具有预测性质,但在用于预测的计算算法以及为提高准确性所采用的校正方法上有所不同。在本研究中,我们使用了Rosetta分子建模套件中的Pepspec应用程序14。尽管该程序主要面向肽的设计,但它实现了一种序列多样化算法,可用于预测氨基酸偏好。据我们所知,该工具是目前唯一提供内置脚本、可直接从序列多样化结果中计算PWM(位置权重矩阵)的可用工具。需要特别指出的是,本方案聚焦于蛋白质-蛋白质相互作用(PPIs),因此初始结构应为两个蛋白质亚基形成的复合物。在实际进行序列多样化步骤之前,需将被视为配体的蛋白质截取为预期与受体蛋白发生相互作用的片段,并进一步将其作为肽处理。然而,该方案也可应用于蛋白质-肽复合物,在此类情况下,步骤1.1–1.3可能无需执行。在准备阶段(第1节),还需纠正错误格式的残基和异源原子,并对复合物结构中与目标结合位点相关但未能清晰解析的区域进行建模。这些修正依赖于具体研究的结构,在本文所用示例结构中并未需要此类修正。
本方案中最关键的步骤是使用 Rosetta 应用程序执行的操作,包括使用 FixBB 进行初始侧链重打包(步骤 2.1)以及使用 Pepspec 进行实际的序列多样化(步骤 2.2)。Pepspec 的作者明确指出,序列多样化前必须进行这一初始重打包步骤(称为预打包)14。尽管该步骤可由 Pepspec 自身完成,但该程序的作者强烈推荐使用专门设计用于在固定蛋白质主链上优化侧链构象的 FixBB 应用程序。在序列多样化步骤中,需注意 Pepspec 应用程序主要面向肽段设计,因此默认仅报告少数得分最高的肽段候选物。由于本方案的目标是生成大量潜在的肽配体,而非仅少数高分候选物,因此我们将 "-pepspec:n_peptides" 参数从默认值 8 调整为 200(步骤 2.2.1)。在此设置下,Pepspec 预测出超过 20,000 种肽段作为潜在配体。这一庞大的假定肽段集合全面展示了受体的结合空间特征,随后我们从中选取得分最高的前 20% 肽段,用于实际的氨基酸偏好性评估。如果传递给 "-pepspec:n_peptides" 的肽段数量较少,Pepspec 接受的候选肽段将显著减少。在此情况下,本方案所建议的采样策略可能包含大量能量评分次优的潜在肽配体,从而可能导致评估结果的稳健性降低。
本研究中所述方案的一个主要局限性在于,它依赖于对含有结合表面的蛋白质结构的先验知识。然而,该结构不一定需要通过实验测定,也可以通过从头建模(ab initio)或同源建模方法获得14。此外,还需要至少知道肽配体中一个氨基酸残基(锚点)的结合模式。该锚点将通过Pepspec中的特定锚点扩展选项,延伸至一定数量的残基,以实现序列多样化。如果已知整个配体在结合位点中的取向(如本研究代表性示例的情况),则应保留与锚点扩展相关的选项为默认设置(不进行扩展),尽管仍需指定肽中的一个残基作为锚点,以引导序列多样化算法。Pepspec应用程序不支持对可能的锚点残基进行从头对接,但它可以利用其他对接程序的输出结果,或同源蛋白质-肽复合物的模型作为输入,来执行锚点对接14;不过这些情况超出了本文的讨论范围。
所建议方案的一个重要缺点是其固有的预测性质,这直接受到蛋白质-蛋白质复合物初始结构或模型的分辨率和准确性的影响。然而,Pepspec 的作者们指出,该应用的准确性 通过将输入的骨架坐标视为一组结构,而非仅使用单一蛋白质结构,并在计算PWM时应用背景归一化,显著提升了结果。14此外,该方案为评估氨基酸偏好的繁琐且昂贵的实验方法提供了一种替代选择。所有这些实验方法均依赖于通过向蛋白质配体序列引入突变来获得大量序列文库,随后实验评估这些突变的影响(参见 Bratulic 和 Badran)12 有关综述,请参见相关文献)。本文提出的计算方案可高效地筛选成千上万种潜在的肽配体,从而有望提供更可靠的氨基酸偏好性估计数据集。13,14,25我们提出的方案可应用于任何可简化为蛋白质-肽段相互作用界面的蛋白质相互作用(PPI)。此外,该方案还可作为初步策略,用于鉴定PPI的调控分子,例如潜在的激活剂或抑制剂。所鉴定出的调控分子可用于在实验室中进一步研究这些PPI,或被评估为潜在的治疗剂。
作者无任何利益冲突需要披露。
感谢巴拿马国家研究系统(SNI)(资助编号 SNI-043-2023 和 SNI-170-2021)、巴拿马国家科学技术与创新秘书处(SENACYT)以及人力资源培训与利用研究所(IFARHU)提供的经费支持。作者谨此感谢 Miguel Rodríguez 博士对稿件的仔细审阅。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| BUDE丙氨酸扫描服务器 | 爱丁堡大学 | https://pragmaticproteindesign.bio.ed.ac.uk/balas/ | doi: 10.1021/acschembio.9b00560 |
| Rosetta建模软件 | Rosetta Commons | https://www.rosettacommons.org/software | doi: 10.1002/prot.22851 |
| UCSF Chimera | 加州大学旧金山分校 | https://www.cgl.ucsf.edu/chimera/ | doi: 10.1002/jcc.20084 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可