我们开发了计算方法 从头合成 能够应对蛋白质设计多个重要领域的蛋白质设计方法。为了推广这些方法,我们推出了 Protein WISDOM,一种在线蛋白质设计工具http://www.proteinwisdom.org从一个结构模板出发,可设计出稳定性增强的单体蛋白以及结合亲和力增强的复合物。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
我们开发了计算方法 从头合成 能够应对蛋白质设计多个重要领域的蛋白质设计方法。为了推广这些方法,我们推出了 Protein WISDOM,一种在线蛋白质设计工具http://www.proteinwisdom.org从一个结构模板出发,可设计出稳定性增强的单体蛋白以及结合亲和力增强的复合物。
本研究的目的是 从头合成 蛋白质设计旨在寻找能够折叠成具有特定三维结构的氨基酸序列,并在结合亲和力、激动或拮抗行为、稳定性等特性上相较于天然序列有所改进。蛋白质设计处于当前药物设计与发现前沿进展的核心位置。它不仅为潜在的有用药物靶点提供预测,还加深了我们对蛋白质折叠过程及蛋白质-蛋白质相互作用的理解。实验方法如定向进化在蛋白质设计中已取得成功,但这些方法受限于可有效搜索的序列空间有限。相比之下,计算设计策略能够筛选更大范围的序列,涵盖多种多样的性质与功能。我们已开发出一系列计算 从头合成 能够应对蛋白质设计多个重要领域的蛋白质设计方法。这些领域包括用于提高稳定性的单体蛋白质设计以及用于提高结合亲和力的复合物设计。
为了推广这些方法的广泛应用,我们推出了 Protein WISDOM(http://www.proteinwisdom.org),该工具为多种蛋白质设计问题提供了自动化解决方案。用户提交结构模板以启动设计流程。设计的第一阶段是序列优化选择阶段,旨在通过最小化序列空间中的势能来提高蛋白质的稳定性。所选出的序列随后进入折叠特异性阶段和结合亲和力阶段。系统为每一步骤提供按优先级排序的序列列表以及相应的设计结构,使用户能够对设计方案进行全面的定量评估。本文详细介绍了每种设计方法,并列举了若干通过这些方法取得的显著实验成果。
从头蛋白质设计旨在发现能够形成具有理想三级结构并具备更优性质或功能的蛋白质序列。由于蛋白质的天然折叠构象处于自由能最低状态,从头蛋白质设计的目标是寻找在目标折叠构象下具有自由能最低点的序列。这一问题最早由 Drexler1 和 Pabo2 提出,被称为“逆向折叠问题”。然而,与蛋白质折叠问题(一个序列通常只对应一种折叠结构)不同,从头蛋白质设计问题具有简并性,即多种不同的氨基酸序列可能产生相同的三级结构和功能。
尽管蛋白质设计传统上通过理性设计和定向进化等实验方法进行,但近年来计算方法已被用于克服实验方法固有的有限搜索空间问题。已采用多种计算方法,包括确定性方法、随机方法和概率方法3,4。早期的计算方法使用固定骨架模板以简化问题求解5-7。随着更快的处理器、高性能计算以及更高效算法的出现,可通过使用一组固定骨架模板的集合8-14,或通过以原子间距离范围和二面角范围来表示模板从而引入真正的骨架柔性15,16。
本文详细介绍了 Protein WISDOM,这是一个面向学术界公开提供的在线工具,可供研究人员使用我们的计算方法 从头合成 蛋白质设计框架。该框架已被应用于设计多种用于治疗疾病的蛋白质,这些疾病包括艾滋病病毒(HIV)、癌症、补体系统相关疾病及其他自身免疫性疾病。许多预测出的多肽已通过实验验证,展示了该方法的强大能力。 表1 提供了所设计的不同蛋白质的概述,包括蛋白质或肽的大小、预测次数以及实验验证结果。
| 蛋白质设计 | 蛋白质长度 | 计算预测次数 | 实验验证次数 | 参考文献 |
| 人β-防御素-2的全长序列设计 | 41 | 340 | (17) | |
| 人C3补体蛋白的Compstatin抑制剂 | 13 | 28 | 3/3 | (18, 19) |
| 结合大鼠C3c的Compstatin类似物 | 13 | 5 | (20) | |
| 含双丝氨酸延伸的Compstatin类似物 | 15 | 8 | ||
| Compstatin类似物W4A9的稳定结构 | 13 | 18 | ||
| C3a受体激动剂与拮抗剂 | 77 | 20 | 4/7 | (21) |
| C5a受体激动剂与拮抗剂 | 74 | 61 | 2/61 | |
| HIV-1 gp14抑制剂 | 12 | 6 | 4/5 | (22) |
| HIV-1 gp120抑制剂 | 9 | 14 | ||
| Bak对Bcl-xL和Bcl-2的抑制剂 | 16-18 | 10 | 5/5 | (23) |
| ERK2抑制剂 | 11 | 25 | ||
| EZH2抑制剂 | 21 | 17 | 10/10 | (24) |
| LSD1和LSD2抑制剂 | 16 | 41 | 17/20 | |
| HLA-DR1抑制剂 | 13 | 6 | (25) | |
| PNP抑制剂 | 5 | 13 |
表1. 使用设计的蛋白质和多肽汇总 从头合成 蛋白质设计框架 计算预测的数量以有利预测的数量表示(即 折叠特异性高于某一阈值或近似结合亲和力高于天然序列的预测结果。实验验证次数包含两个数值:第一个数值表示经过实验验证的预测数量,第二个数值表示经过实验测试的预测总数。
设计人β-防御素-2(hβD-2)旨在增强该肽的抗菌特性。17 在本设计中,我们考虑了两种情况:1)在hβD-2中引入最多10个突变;2)除半胱氨酸(位置8、15、20、30、37和38)外,对hβD-2所有残基位置进行全序列设计。设计过程中采用了三种不同的设计模板和三种不同的序列筛选模型。在10个突变的设计和全序列设计中,加权平均模型与距离区间模型在突变位点上均表现出高度相似性。此外,大量设计序列的计算折叠特异性值优于天然序列。
针对 C3、C3a 和 C5a 的补体系统抑制剂被设计用于对抗多种免疫性疾病,例如中风、心肌梗死、阿尔茨海默病、哮喘、类风湿性关节炎、异种移植排斥反应、成人呼吸窘迫综合征、银屑病以及克罗恩病。通过蛋白质设计框架预测出的三种 C3c 的 compstatin 抑制剂,以及另外三种合理设计的序列,经实验验证其结合能力优于天然 compstatin。18,19
后续研究考察了 compstatin 对非灵长类动物 C3c 活性的丧失情况,并设计了多种候选的大鼠和小鼠 C3c 抑制剂。五种序列显示出比已知可抑制 C3c 的 W4A9 compstatin 突变体更有利于与大鼠 C3c 结合的关联自由能。这归因于 Arg1 形成的新盐桥作用20。预测八种带有 N 端延伸的序列比带有双丝氨酸延伸的 W4A9 具有更强的结合能力。最后,预测有 18 种 compstatin 序列可稳定 W4A9 的结合构象,为灵长类和非灵长类动物 C3c 抑制剂提供了强有力的候选分子。
除了C3c抑制剂外,还根据C3a和C5a的结构设计了C3a和C5a受体激动剂与拮抗剂。模型预测的七条C3a序列进行了实验验证,其中两条序列为强效激动剂,另外两条为部分激动剂。21 这两条强效激动剂相较于此前发现的“超级激动剂”活性提高了58倍。C5a受体激动剂与拮抗剂的设计共获得61条序列,所有序列均被合成,其中两条被证实为新型C5a激动剂。
HIV-1融合抑制剂是针对引起艾滋病的病毒HIV-1而设计的,旨在阻止HIV-1感染细胞。第一项设计靶向HIV-1的包膜糖蛋白gp41。蛋白质设计框架预测出六个比天然序列结合能力更强的序列。其中四个预测序列经实验验证可抑制HIV-1,最佳序列的IC50低至29 μM。该序列相较于天然序列抑制效果提高了3至15倍,且对恩夫韦肽耐药性病毒株仍保持活性,未出现活性下降。22 第二项设计靶向HIV-1的另一包膜糖蛋白gp120。共预测出十四个可与gp120结合的序列,有望提供额外的HIV-1融合抑制剂候选分子。
许多与癌症相关的蛋白质为癌症治疗提供了有前景的靶点。Bcl-2 和 Bcl-xL 是抗凋亡蛋白,能够抑制细胞死亡。针对这两种蛋白的抑制剂被设计用于诱导癌细胞死亡。有十个序列被预测比天然序列具有更强的结合能力,这些结果与先前的实验和诱变研究结果一致23。另一个靶点蛋白 ERK2 参与信号转导级联反应,使其成为抗增殖癌症治疗的潜在靶标。有二十五个序列被预测为 ERK2 的抑制剂。
组蛋白甲基转移酶和去甲基化酶可动态调控组蛋白甲基化,这种修饰与多种癌症类型相关,包括前列腺癌、乳腺癌、淋巴瘤、骨髓瘤、膀胱癌、结肠癌、皮肤癌、肝癌、子宫内膜癌、肺癌和胃癌。de novo 蛋白质设计框架鉴定了17种EZH2(赖氨酸甲基转移酶)抑制剂,在实验验证的10种化合物中,均被证实可抑制EZH2活性。24 其中活性最强的多肽IC50约为13 μM,在酶浓度升高时仍保持同等抑制效果,且不与辅因子竞争。这些多肽是首例被发现的EZH2抑制剂。该框架还预测了53种LSD1(去甲基化酶)抑制剂,在实验验证的20种化合物中,17种为LSD1抑制剂,18种为LSD2抑制剂。其中最佳抑制剂的IC50值低于1 μM,成为迄今发现的最高效的肽类抑制剂。
最后两种蛋白质系统为治疗多种自身免疫性疾病提供了靶点,这些疾病包括乳糜泻、1型糖尿病、系统性红斑狼疮、干燥综合征、嗜酸性肉芽肿性多血管炎、桥本甲状腺炎、格雷夫斯病、特发性血小板减少性紫癜、类风湿关节炎以及过敏性疾病。尽管这些潜在抑制剂尚未经过实验验证,但该框架预测了六条可结合HLA-DR1的序列和十三条可结合PNP的序列。
表 2 总结了通过实验验证的抑制剂和激动剂,这些分子是使用以下方法预测的 从头合成 蛋白质设计框架。采用近似结合亲和力指标预测了九条序列(人源C3c、HIV-1 gp41、EZH2、LSD1和LSD2的抑制剂),而采用折叠特异性指标鉴定了四条序列(C3aR的激动剂/拮抗剂)。这些多肽凸显了该方法的成功 从头合成 蛋白质设计框架,特别是新增的近似结合亲和力度量指标。该框架具有极高的适用灵活性。已有六种与二十五种不同疾病相关的蛋白质被成功设计并经过实验验证。
| 名称 | IC50 | EC50 | 靶向蛋白 | 适用疾病 |
| SQ027 | 0.94 μM | 人 C3c | 中风、心肌梗死、阿尔茨海默病、哮喘、类风湿性关节炎、系统性红斑狼疮、多发性硬化症、银屑病、I型糖尿病、克罗恩病、胰腺炎以及囊性纤维化 | |
| SQ086 | 1.98 μM | 人 C3c | ||
| SQ059 | 4.73 μM | 人 C3c | ||
| SQ110-4 | 15.2 nM | C3aR | ||
| SQ060-4 | 36.4 nM | C3aR | ||
| SQ007-5 | 15.4 nM | C3aR | ||
| SQ002-5 | 26.1 nM | C3aR | ||
| SQ435 | 29 - 253 μM | HIV-1 gp41 | 艾滋病 | |
| SQ037 | 13.57 μM | EZH2 | 前列腺癌、乳腺癌、淋巴瘤、骨髓瘤、膀胱癌、结肠癌、皮肤癌、肝癌、子宫内膜癌、肺癌以及胃癌 | |
| SQ011-1 | 0.521 μM | LSD1 | ||
| SQ016-1 | 0.249 μM | LSD1 | ||
| SQ026-1 | 2.51 μM | LSD2 | ||
| SQ015-1 | 1.332 μM | LSD2 |
表2. 针对多种疾病的计算预测及实验验证的多肽。
访问受限。请登录或开始试用以查看此内容。
方法概述
的 从头合成 Protein WISDOM 所采用的设计框架包含两个阶段。第一阶段生成一个按优先级排序的氨基酸序列列表,这些序列将折叠成给定的模板结构。第二阶段通过计算折叠特异性或近似结合亲和力,或两者兼而有之,对这些序列进行验证。前者主要用于单个蛋白质的设计,而后者则用于复合物(肽段与靶蛋白结合)的设计。 图1 概述了该框架所涉及的各个步骤。
设计输入: 需要定义多个输入参数 从头合成 蛋白质设计框架。第一部分是设计模板。这是一种三维(3D)蛋白质结构,包含蛋白质中所有原子的坐标信息。该结构可以是刚性的或柔性的。刚性模板是一组固定的原子坐标,通常来源于X射线晶体学结构。柔性模板可以是一组固定的原子坐标,或为原子坐标设定上下限范围,通常来源于核磁共振(NMR)溶液结构、分子动力学模拟或对接模拟。
设计模板用于生成目标蛋白的允许突变集合。该集合定义了序列中哪些位置可以发生突变,以及可突变为哪些氨基酸。突变集合通过计算设计模板中每个残基的溶剂可及表面积(SASA)来生成。如果残基暴露于溶剂的程度超过50%,则允许突变为一组亲水性氨基酸(D、E、G、H、K、N、P、Q、R、S、T);如果残基暴露程度低于20%,则允许突变为一组疏水性氨基酸(A、F、I、L、M、V、W、Y);若残基的暴露程度介于20%至50%之间,则允许突变为所有氨基酸。通常情况下,半胱氨酸(Cysteine)被排除在突变集合之外,除非有实验或文献数据支持其引入。小分子氨基酸(A、G、T)通常被包含在所有突变集合中。在有实验或文献依据的情况下,可手动调整特定氨基酸位点的突变集合。
选择一种力场来计算设计模板中序列之间的成对相互作用能。de novo 设计框架内可适配任何力场,但已有两种依赖距离的力场被开发出来,并在该框架中得到广泛应用。第一种是高分辨率的 Cα-Cα 力场26,其距离定义为残基的 Cα 碳原子之间的距离。第二种是高分辨率的质心-质心力场27,其距离定义为残基质心之间的距离。力场中的能量参数通过求解线性规划参数估计问题获得,该估计过程要求在大量蛋白质训练集上,低能量高分辨率的非天然构象在能量上劣于其天然构象。高分辨率质心-质心力场和 Cα-Cα 力场均已在先前针对人β-防御素-2的研究中经过测试和验证17。通过将力场按距离区间离散化,模型中引入了真实的主链柔性。一对氨基酸之间的距离将对应一个距离区间,使得一定范围内的距离具有相同的能量值。这使得序列选择优化模型能够考虑主链的运动。
用户可手动将生物学限制(如电荷限制或组分限制)作为额外的设计输入纳入。电荷限制用于指定设计序列或其部分区域必须满足的特定电荷值或电荷范围。电荷的计算方式为:带正电荷残基(K 和 R)的总数减去带负电荷残基(D 和 E)的总数。组分限制则规定了某个特定氨基酸在序列中出现频率的上下限。生物学限制通常通过与天然序列进行广泛的序列比对来定义,以捕捉自然界中某类蛋白质家族在电荷和氨基酸组成方面已知的生物学限制。进一步的限制则通过分析已知的实验数据手动设定。
第一阶段:序列选择:原始的序列选择方法最初由 Klepeis 等15,16 开发。该方法使用整数线性优化(ILP)模型,根据氨基酸序列在设计模板中的能量对其进行选择和排序。随后,该方法通过采用计算效率更高的序列选择模型得以改进,适用于刚性(单一)模板,并通过开发柔性模板模型进一步扩展。这种全局优化方法不依赖随机突变,理论上可确保搜索完整的序列空间并确定全局最优解。与所有其他现有方法相比,这是本方法的一个显著优势。
单结构模型:由 Klepeis 等15,16 提出的序列选择模型最初形式,后经 Fung 等28 进一步优化。其最终形式见公式 1。

设 i=1,...,n 表示设计模板中的残基位置。在每个位置 i 上,突变由 j{i}=1,...,mi 表示,其中当位置 i 允许突变为20种天然氨基酸中的任意一种时,mi=20。引入别名集合 k≡i 和 l≡j(其中 k>i),用于表示所有唯一的成对相互作用。引入二元变量
和
来建模氨基酸突变。
变量在模型将氨基酸 j 分配给位置 i 时取值为1,否则为0(
同理)。目标函数表示设计模板中所有成对能量相互作用的总和。参数
表示位置 i 上由氨基酸 j 占据与位置 i 上由氨基酸 l 占据之间的能量相互作用,其值取决于两个位置处α-碳原子或侧链质心之间的距离(xi,xj,),以及氨基酸 j 和 l 的类型。仅当
和
均等于1时,该参数才对目标函数产生贡献。
Fung et al.28 发现,在用于序列选择的十二种其他等效的二次指派类模型中,公式(1)在计算效率上显著更高28,29。特别是,在针对人β-防御素-2的两个序列选择问题上,该公式优于Klepeis et al.15,16 提出的原始模型:一个问题的复杂度为3.4×1045,另一个问题的复杂度为6.4×1037,并额外包含49个线性生物学约束条件。研究发现,使用Pentium IV 3.2 GHz处理器上的CPLEX 9.030 求解器,Klepeis et al.15,16 提出的原始模型分别需要53,263中央处理器(CPU)秒和4,578 CPU秒才能将这两个问题求解至全局最优。而公式(1)仅需649 CPU秒和14 CPU秒即可完成相同任务,计算效率分别提高了82倍和327倍。
加权平均模型: Fung 等.28 建立了两种模型以处理典型情况 从头合成 采用柔性设计模板(包含一组结构)的蛋白质设计。加权平均模型使用加权平均能量,
,代替能量参数
(xi,xk)在单结构模型中(公式1)。权重wt(xi,xkd) 由距离的频率决定 xi 和 xk 落入距离区间 d 在模板结构中。加权平均模型的最终形式见公式2。

距离区间模型: 针对柔性模板结构的第二种序列选择模型通过引入二元变量 bikd 来整合多个结构中的距离信息。当 xi 与 xk 之间的距离落入距离区间 d 时,该变量取值为 1,否则为 0。另一个引入的参数 disbin(xi, xk, d),当任意模板结构中 xi 与 xk 之间的距离落入距离区间 d 时取值为 1,否则为 0。由于每对氨基酸仅有一个距离区间对总能量有贡献,目标函数中的
被替换为
。然而,这会使目标函数出现非线性。有关该模型线性化的更多细节以及为保证可行性所需添加的额外约束条件,可参见 Fung et al.28 距离区间模型见公式 3。

上述建立的任一整数线性规划(ILP)问题15-17均可通过分支定界法严格求解28-30。该方法可确保一致且可靠地收敛至全局最低能量序列。
第二阶段:验证: 图2 详细概述了第二阶段的两种方法。该图展示了计算最终排序指标所需的各个步骤,以及每一步生成的结构数量。
折叠特异性:折叠特异性是一种用于对第一阶段生成的初步设计进行排序的指标。该计算的目的是基于能量计算,评估每个序列相对于模板原始序列在折叠成模板结构时的优劣程度。实现这一目标有两种方法,其计算需求各不相同。
第一种方法由 Klepeis 等人et al.15,16 实现。该方法利用基于确定性全局优化的蛋白质结构预测框架 ASTRO-FOLD26,27,31-47。由于该方法计算量极大,目前在 Protein WISDOM 的实现中并未采用。考虑到计算资源的限制,以及在设计过程中可能需要对数百至数千条序列进行计算,Fung 等人et al.17 提出了一种更高效的方法,使用 TINKER/CYANA48-50。该方法涉及定义一个结构的柔性模板。柔性模板可通过 Cα 原子间距离的上下限以及残基的 ϕ 和 ψ 二面角来定义。对于单一结构,使用初始的距离和二面角,并将界限定义为固定距离或百分比。默认界限为 Cα 距离的 ±10% 或二面角的 ±10°。对于柔性模板,界限可根据作为设计输入的所有模板结构中观察到的最大值和最小值确定。在为每条序列定义初始界限后,使用 CYANA 2.148,49 生成包含数百个构象体的集合。这些构象体通过 CYANA 中的扭转角动力学模拟退火协议生成,该协议快速加热蛋白质并缓慢冷却,同时追踪采样的构象。模拟退火后,进行局部能量最小化,以减少范德华半径重叠引起的位阻以及距离和角度约束的违反。默认情况下,生成 500 个最终结构。针对每条序列的集合中的每个结构,在 TINKER 3.650 中使用 AMBER 力场51 进行局部最小化。记录每个最小化结构的最终势能。该整体方法同样应用于起始序列及每个候选突变序列。随后,可使用以下玻尔兹曼分布(公式 4)相对于天然序列计算每个突变序列对目标折叠的折叠特异性。

近似结合亲和力: 近似结合亲和力计算方法用于对与靶标蛋白形成复合物的设计序列进行排序。这些计算可直接在第一阶段获得的序列上进行,也可在折叠特异性步骤中获得的高折叠特异性序列上进行。
Lilien et al.52 提出了一种用于计算蛋白质-配体复合物近似结合亲和力的方法。该方法基于生成蛋白质、配体以及蛋白质-配体复合物的以旋转异构体为基础的系综,并利用这些系综计算配分函数。该近似的结合亲和力记为 K*,其定义见公式 5。
这里 qPL 是蛋白质-配体复合物的分配函数, qb 是游离蛋白质的配分函数,以及 qL 是游离配体的配分函数。配分函数在公式6中定义,其中各集合 B,F 和 L 分别包含结合态蛋白-配体复合物、游离蛋白和游离配体的基于旋转异构体的构象。 En 是构象的能量 n,R 是气体常数,以及 T 是温度。

结构预测: 为了开始计算 K*,需要每条序列的三维结构。这通过使用 Rosetta 软件包中的 AbRelax 功能实现53-55,该功能属于 Rosetta 3.4 软件版本。AbRelax 算法的设计策略基于实验观察结果,即蛋白质的局部结构受其局部序列影响,但并不完全由其决定。该方法采用蒙特卡洛算法,用基于序列的结构片段替换局部蛋白质结构。此方法可生成最终的紧凑蛋白质结构,能够反映非局部相互作用,如埋藏的疏水残基、成对的β链以及特异性的侧链相互作用。
聚类: 利用OREO56,57根据AbRelax得到的结构的φ和ψ角进行聚类。该聚类方法可揭示整个结构集合中具有代表性的主链结构。从十个最大聚类中获得的平均结构以及总体能量最低的结构被选用于与靶标蛋白进行对接。这为每条肽序列提供了11个独特的主链结构,在集合生成过程中纳入了主链的柔性。
对接预测:对接预测使用 RosettaDock 进行58-60。对于每条序列,将11种肽主链结构分别与靶蛋白进行对接。本例中,由于结合位点已知,将肽置于结合位点附近,并允许其在垂直于结合位点方向上平移 3 Å,在平行于结合位点方向上平移 8 Å,并旋转 8°。RosettaDock 采用蒙特卡洛算法实现低分辨率和高分辨率的对接运动。每次对接运行会生成大量复合物结构。在每轮11次运行中,能量最低的10个复合物结构将被用作最终基于rotamer的构象集合生成的起始结构(每条序列共110个起始结构)。
最终构象集合的生成:采用 RosettaDesign61 生成基于侧链旋转异构体的最终构象集合,因为它可通过 fixbb 功能仅调整侧链上的旋转异构体来生成多种结构。RosettaDesign 接收若干初始结构,对每个结构随机选择一个残基,并通过蒙特卡洛算法改变其旋转异构体。该过程重复进行,直至尝试数千次旋转异构体替换,从而获得最终的低能构象,该构象在配分函数中具有显著贡献。
为生成多肽集合,从十个最大簇中各选取能量最低的十个多肽结构,并结合总体能量最低的十个多肽结构,作为RosettaDesign的起始结构(共100个起始结构)。对每个起始结构生成200个侧链构象异构体,最终得到包含22,000个结构的集合(即公式6中的集合L)。该集合同时考虑了主链的柔性和侧链构象的柔性。
通过从对接预测步骤中选取110个起始结构,并为每个起始结构生成200个侧链构象异构体,以类似方式生成该复合物的集合。最终集合包含22,000个结构(式6中的集合B)。该方法通过采用不同的肽主链结构、不同的对接构象以及每个起始结构对应的侧链构象异构体来考虑分子的柔性。
通过仅对目标蛋白质结构运行 RosettaDesign 来生成蛋白质集合。在此情况下,单个起始结构生成了 2,000 种侧链二面角构象,因此最终的集合包含 2,000 个结构(对应公式 6 中的集合 F)。
蛋白质 WISDOM
蛋白质WISDOM,即蛋白质工作台(Protein Workbench for 计算机模拟从头合成 生物分子设计(design Of bioMolecules)是一个在线工具,可让学术界访问我们的 从头合成 以用户友好的方式实现蛋白质设计框架。该框架能够处理多种常见的设计目标,从设计单条蛋白质链以采用特定模板折叠结构,到设计可与靶标蛋白结合的新型多肽。接下来的两个部分将分别描述 Protein WISDOM 在应对两类主要蛋白质设计问题时的功能。第一类问题通过序列选择方法,筛选出在给定设计模板中具有优势的全新序列,然后利用折叠特异性验证这些新序列。第二类问题则通过序列选择方法,筛选出在复合物中结合状态下的多肽全新序列,并结合折叠特异性与近似结合亲和力计算,对这些新序列进行验证。
用户注册
请访问 Protein WISDOM 网站:http://www.proteinwisdom.org。
点击页面右上角的用户登录按钮。点击“此处”进行注册。
填写与电子邮件地址和请求的用户名相关的信息,然后点击继续。
填写姓名、机构、团队、地址等附加信息。勾选复选框以同意使用条款。点击“提交注册”按钮。
第一阶段:序列选择
提交蛋白质序列及模板结构
单击“用户登录”按钮以开始蛋白质设计实验。用户将进入其“用户主页”(图3),页面显示用户已提交的任务数量、已上传的结构(模板)数量,以及截至目前已上传的所有结构列表。
单击“创建新任务”以开始一项新的设计任务。用户将进入“任务提交”页面(图4)。为该任务命名,并指明其是否基于先前的任务(即 可将相同的设计模板、突变集和生物学约束导入新任务中,但用户可对突变集和生物学约束进行修改)。单击“继续”。
上传设计模板的蛋白质结构(图5)。该模板必须为标准的蛋白质数据库(PDB)格式。模板可以是刚性模板(每个原子只有一组坐标),也可以是柔性模板(包含多个模型,例如来自核磁共振溶液结构的模型)。在设计单个蛋白质的情况下,模板中只能包含一条链。用户可以上传新的模板,或从此前已上传的模板中进行选择。如有,可选择性地注明模板的 PDB 编号。如果上传多个模板,请确保每个模型均以“MODEL #”开始,并以“ENDMDL”结束。确保每个残基均被指定为天然氨基酸。点击“继续”。
模板成功上传后,Protein WISDOM 将显示其在模板中找到的残基数、链数和模型数,列出序列,并提示用户验证模板。若模板结构已正确输入,请确认该模板结构,然后点击“Continue”。
模板成功上传并确认后,用户将进入“主控制页面”(图6)。在此页面上,用户可查看任务状态,修改突变集和生物学约束条件,并提交任务以进入第一阶段:序列筛选。此时,由于第一阶段尚未完成,第二阶段的相关选项尚不可用;待第一阶段结果生成后,第二阶段的选项才会显示。
突变集的选择
在“主控页面”上点击“突变集”链接以定义突变集。
选择允许发生突变的残基,并选择它们允许突变为哪些氨基酸(图7)。默认情况下,每个位置允许的氨基酸是基于溶剂可及表面积(SASA)来确定的。必须设置突变集合。
选择突变集后,点击“保存更改”。用户可选择继续编辑突变集。完成突变集编辑后,点击返回“主控制页面”。
生物约束条件的选择
在“主控页面”上点击“生物约束”链接以定义生物约束条件。
指定整个蛋白质或蛋白质部分的电荷或氨基酸含量限制(图8)。
如有需要,可限制允许发生的突变总数。生物学约束为可选项。完成后,单击返回“主控制页面”。
第一阶段提交:序列选择
单击“开始第一阶段”链接,将用户引导至“提交第一阶段”页面。
选择要设计的链(图9)、生成序列的数量、依赖距离的力场以及模型。如果正在设计一个复合物,并且希望进行折叠特异性计算,则必须仅选择一条链进行设计。如果上传的模板是单一结构或“刚性模板”,则只允许使用单一结构模型。如果上传的模板具有柔性,用户可选择三种模型中的任意一种:单一结构模型、加权平均模型或距离分箱模型。请注意待求解优化问题的计算复杂度。允许的计算复杂度上限为2025。
提交任务。用户将被重定向回“主控制页面”(图10)。任务状态将更新,以显示当前任务的进度。提交后,该任务将被锁定,无法编辑。
任务完成后,用户将收到一封包含结果的电子邮件,结果内容为设计出的序列列表。这些结果也可在“主控制页面”上查看。页面上会显示第二阶段:折叠特异性的操作框,以便用户执行此验证步骤。
第二阶段:折叠特异性计算
折叠特异性投稿
单击“开始第二阶段:折叠特异性”以进入“构建第二阶段”页面。通过将模板灵活性因子指定为距离的百分比或固定距离,来定义上、下Cα-Cα距离边界。通过将模板灵活性因子指定为百分比,来定义φ和ψ二面角的上、下角度边界。请注意,当使用柔性模板时,上、下距离边界取自所有模板模型中距离值的最小值和最大值;同样,上、下角度边界取自所有模型中角度值的最大值和最小值。
点击“提交”按钮。
指定每条序列要生成的结构数量,然后点击“Continue”。请注意,每条序列最多可生成 500 个结构。
单击“继续”以确认提交折叠验证的意图。在第二阶段完成之前,第一阶段和第二阶段将锁定,无法编辑。
任务完成后,系统会向用户发送一封包含结果的电子邮件。用户可在 Protein WISDOM 的“主控制页面”(图11)查看结果。在此页面上,可查看并下载包含设计序列的文本文件,以及第一阶段对应的能量值和第二阶段的折叠特异性值。此外,用户还可点击“查看结果”链接,浏览器将显示一个表格,其中包含第一阶段的排名和能量值,以及第二阶段的排名和折叠特异性值。
第三阶段:蛋白质-肽复合物的近似结合亲和力计算
近似结合亲和力计算用于评估所设计的配体蛋白/多肽与复合物其余部分之间的亲和力。这些计算可在第一阶段完成后直接进行,也可在完成折叠特异性计算后进行。
单击“序列 #”以选择要开始近似结合亲和力计算的序列。用户将被引导至“选择序列”页面,该页面列出了设计的序列及其序列选择性和折叠特异性排名。由于计算对计算资源要求极高,每次只能选择一个序列进行近似结合亲和力计算。完成一个序列的计算后,用户可选择另一个序列进行近似结合亲和力计算,新结果将添加到先前结果中,显示所有已完成序列的近似结合亲和力。一旦序列被选择并保存,用户将被重定向至“主控制页面”。
点击“开始第二阶段:近似结合亲和力”以提交任务。任务完成后,结果将通过电子邮件发送给用户,其中包含一个附件,该附件含有序列编号、近似结合亲和力以及公式6中分配函数的值。对于每一个后续的近似结合亲和力任务,此文件均包含所有已完成序列的结果。完整结果(来自序列选择、折叠特异性和近似结合亲和力)也可通过访问该任务的“主控页面”进行查看(图12)。
访问受限。请登录或开始试用以查看此内容。
De Novo 设计 HIV-1 进入抑制剂
的 从头合成 Protein WISDOM 中实施的设计框架已被用于多种重要治疗系统的抑制肽设计(表1和表2)。一个值得注意的系统是设计用于抑制 HIV-1 进入宿主细胞受体 CD4 的多肽,本文以此作为代表性系统,用以展示 Protein WISDOM 界面的实际应用。这些多肽被设计用于靶向跨膜亚基 gp41,后者在 HIV-1 与宿主辅助性 T 细胞的融合及入侵过程中发挥关键作用。需要注意的是,所得结果未必与原始发表文献中的结果完全相同,这是由于本方法所采用的 Rosetta 方法具有随机性,且自原始文献发表以来,Rosetta 软件已从版本 2.3 更新至版本 3.4。
初始化任务时,用户需提供一个有效的蛋白质设计模板。该模板可以是用于折叠设计的单个蛋白质结构,或用于结合设计的复合物。针对HIV-1进入抑制剂的设计模板是C14linkmid(一种14个残基的交联肽)与gp41核心形成的复合物的晶体结构,PDB:1...
访问受限。请登录或开始试用以查看此内容。
从头蛋白质设计框架包含两个阶段:序列筛选阶段和验证阶段。该框架具有足够的鲁棒性,可处理刚性和柔性设计模板,并可用于单个蛋白质设计或复杂蛋白质设计。该框架已成功应用于多种蛋白质系统,并涉及数十种疾病的治疗。其中多个设计已通过实验验证,成为迄今发现的某些蛋白质最具效力的抑制剂或激动剂。目前,该框架已通过 Protein WISDOM 向学术界开放使用。
该方法包含三个关键步骤。第一步是序列筛选阶段,采用全局优化技术进行蛋白质设计。蛋白质设计问题具有很高的复杂性(对于 n 个可突变位点,存在 20n 种可能的序列)。这一数量远超实验设计方法所能考虑的序列数目。进一步引入突变和生物学约束条件可通过降低复杂性来加速优化过程。总体而言,该方法能够快速识别出具有全局最低势能的生物学相关序列。
该方法的第二个关键步骤是折叠特异性。在此阶段,计算在序列选择中设计的序列相较于天然序列,折叠成目标模板结构的效果如何。该阶段通过确定并最小化突变结构,进一步提高计算的严谨性,从而对设计的序列进行...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在任何竞争性经济利益。
CAF 感谢美国国家科学基金会(NSF)、美国国立卫生研究院(NIH,项目编号 R01 GM52032;R24 GM069736)以及美国环境保护局(EPA,项目编号 R832721-010)提供的支持。本研究的部分工作获得了美国国防部(DoD)、空军科学研究办公室的政府资助。JS 感谢美国国立卫生研究院(NIH,项目编号 P50GM071508-06)提供的支持。MLBP 感谢美国国家国防科学与工程研究生(NDSEG)奖学金(32 CFR 168a)提供的支持。GAK 感谢美国国家科学基金会研究生研究奖学金(项目编号 DGE-1148900)提供的支持。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。