方法文章

一种基于计算机的蛋白质结构与功能预测方案

70.5K 次观看

DOI:

10.3791/3259

2011年11月3日

本文内容

摘要

本文描述了使用I-TASSER流程对蛋白质进行基于计算机的结构与功能表征的指南。从目标蛋白质序列出发,通过多序列 threading 比对和迭代的结构组装模拟生成三维模型。随后,基于与已知结构和功能的蛋白质的匹配结果,进行功能推断。

摘要

基因组测序项目已解析出数百万种蛋白质序列,要深入理解它们的生物学功能,需要了解其结构与功能信息。尽管实验方法可为其中一小部分蛋白质提供详细信息,但大多数蛋白质分子仍需依赖计算建模进行研究。I-TASSER 服务器是一个用于高分辨率蛋白质结构与功能建模的在线工作平台。给定一条蛋白质序列后,I-TASSER 服务器的典型输出结果包括:二级结构预测、每个残基的预测溶剂可及性、通过穿线法和结构比对检测到的同源模板蛋白、最多五个全长的三级结构模型,以及基于结构的功能注释,如酶分类、基因本体(Gene Ontology)术语和蛋白质-配体结合位点。所有预测结果均附带一个置信度评分,用于在未知实验数据的情况下评估预测结果的准确性。为满足用户的特殊需求,该服务器提供通道,允许用户输入指定的残基间距离和接触图谱,以交互式地调整 I-TASSER 的建模过程;同时允许用户指定任意蛋白质作为模板,或在结构组装模拟过程中排除特定模板蛋白。用户可根据实验依据或生物学见解收集结构信息,以提升 I-TASSER 预测的质量。在最近的全球性 CASP 实验评估中,该服务器被评价为蛋白质结构与功能预测领域性能最佳的程序之一。目前,来自100多个国家的注册用户科学家已超过>20,000名,正在使用在线 I-TASSER 服务器。

方案

方法概述

遵循“序列到结构再到功能”的研究范式,I-TASSER 进行结构与功能建模的过程1-4 包含以下四个连续步骤:(a)通过 LOMETS5 进行模板识别;(b)利用副本交换蒙特卡洛模拟6 进行片段结构重装;(c)使用 REMO7 和 FG-MD8 进行原子水平的结构优化;以及(d)利用 COFACTOR9 进行基于结构的功能注释。

模板识别:对于用户提交的查询序列,首先通过本地安装的LOMETS多线程服务器将该序列穿过多套代表性PDB结构数据库。穿线法(threading)是一种序列-结构比对方法,用于识别可能与查询蛋白具有相似结构或包含相似结构模体的模板蛋白。为了提高同源模板检测的覆盖率,LOMETS整合了多种先进的算法,涵盖不同的穿线方法。由于不同的穿线程序具有不同的评分系统和比对灵敏度,因此通过归一化的Z分数来评估每个穿线程序生成的比对质量,其定义为:
归一化Z分数方程公式,Norm. Z-score=(Z-score)/(Z0),用于统计分析。
其中Z分数表示相对于该程序生成的所有比对结果统计均值的标准差单位得分;Z0是基于大规模穿线基准测试5确定的程序特异性Z分数阈值,用于区分“优质”和“劣质”模板。模板的Z分数越高,表明其比对得分显著高于大多数其他模板,通常意味着该比对对应一个高质量的模型。如果大多数排名靠前的穿线模板均具有较高的归一化Z分数,则最终I-TASSER模型的准确性通常较高。然而,若蛋白较大且穿线比对的覆盖范围仅限于查询蛋白的局部区域,则高归一化Z分数并不一定意味着全长模型具有高建模准确性。从每个穿线程序中选取排名前两位的穿线比对结果,并用于下一步的结构组装。

迭代结构组装模拟:在穿线法(threading)程序之后,将查询序列划分为穿线法比对区域和未比对区域。从模板中提取穿线法比对中的连续片段并直接用于结构组装,而未比对的环状区域则通过从头建模(ab initio modeling)构建。结构组装过程在格点系统上进行,并由副本交换蒙特卡洛模拟(replica exchange Monte Carlo simulations)6引导。I-TASSER 力场包含氢键相互作用10、从 PDB 中已知蛋白质结构导出的基于知识的统计能量项11、来自 SVMSEQ12的基于序列的接触预测,以及从 LOMETS5穿线模板收集的空间约束。在模拟过程中低温副本生成的构象去折叠体(decoys)通过 SPICKER13进行聚类,以识别低自由能状态的结构。通过平均所有聚类内结构去折叠体的三维坐标,获得前几个聚类的中心结构,并用于最终模型的生成。该模拟与聚类过程重复两次,以消除空间位阻冲突并进一步优化全局拓扑结构。

原子水平模型构建与优化:经过 SPICKER 聚类后获得的聚类中心是简化蛋白质模型(每个残基由其 Cα 和侧链质心表示),其生物学应用有限。从简化模型构建全原子模型分为两个步骤。第一步,使用 REMO7 通过优化氢键网络,从 C-alpha 轨迹构建全原子模型。第二步,利用 FG-MD14 对 REMO 生成的全原子模型进一步优化,通过分子动力学模拟改善主链扭转角、键长和侧链构象取向,该过程由 TM-align 从 PDB 结构中搜索到的结构片段指导。经 FG-MD 优化后的模型作为 I-TASSER 进行三级结构预测的最终模型。

生成模型的质量通过置信度评分(C-score)进行评估,该评分基于LOMETS折叠识别比对的Z-score以及I-TASSER模拟的收敛性,其数学表达式为:
统计分析公式,C值计算;用于科研数据分析的方程
其中 M 是SPICKER识别的结构簇中结构诱饵的多样性13; M总数 是提交给聚类的诱饵总数; 是聚类后诱饵结构相对于聚类中心的平均RMSD; 标准化Z得分(i) 是来自最优穿线比对的标准化Z分数(公式1) iLOMETS 中的 threading 服务器5; N LOMETS 中使用的服务器数量。

C-score 与 I-TASSER 模型的质量具有强相关性。结合 C-score 和蛋白质长度,可对首个 I-TASSER 模型的准确性进行估计,其 TM-score 的平均误差为 0.08,RMSD 的平均误差为 2 Å15. 通常情况下,C-score 较高的模型 > 预计有1.5个模型具有正确的折叠结构。此处,RMSD和TM-score均为衡量模型结构与天然结构之间拓扑相似性的常用指标。TM-score的取值范围为[0, 1],分数越高表示结构匹配度越好。16,17。然而对于排名较低的模型(即第2名nd-5th 模型),C值与TM值及RMSD的相关性较弱(约0.5),无法用于可靠估计模型的绝对质量。

在 I-TASSER 模拟中,第一个模型是否总是最优模型?这个问题的答案取决于目标蛋白的类型。对于容易的目标,第一个模型通常是最优模型,其 C-score 通常显著高于其他模型。然而,对于困难的目标,当折叠识别(threading)未能找到显著的模板匹配时,第一个模型未必是最优模型,此时 I-TASSER 在选择最佳模板和模型方面实际上存在困难。因此,建议对困难目标的全部 5 个模型进行分析,并结合实验信息和生物学知识来选择最优模型。

功能预测:在最后一步中,使用由 FG-MD 生成的最终三维模型来预测蛋白质功能的三个方面,即:(a) 酶学委员会(EC)编号18;(b) 基因本体(GO)19术语;以及 (c) 小分子配体的结合位点。对于这三个方面,均采用 COFACTOR 方法进行功能注释,该方法是一种基于预测蛋白模型与 PDB 中已知结构和功能的模板蛋白在全局和局部相似性基础上预测蛋白质功能的新策略。首先,使用结构比对程序 TM-align20 将预测模型的全局拓扑结构与功能模板文库进行比对。随后,根据全局结构相似性从文库中选取与目标模型最相似的一组蛋白质,并在活性位点/结合位点区域附近进行广泛的局部搜索,以识别结构和序列的局部相似性。基于获得的全局与局部相似性得分,对模板蛋白(功能同源物)进行排序,并依据得分最高的匹配结果转移功能注释(EC 编号和基因本体19术语)。类似地,配体结合位点残基及配体结合模式则通过查询序列与高分功能模板中已知配体结合位点残基的局部比对结果进行推断9

I-TASSER 中功能(EC 和 GO 术语)预测的质量通过功能同源性评分(Fh-score)进行评估,该评分是衡量查询序列与模板之间全局和局部相似性的指标,其定义如下:
Fh-score 计算公式,包含变量、系数;酶学分析的数学公式。
其中,C-score 是如公式 (2) 所定义的对预测模型质量的估计值;TM-score 衡量模型蛋白与模板蛋白之间的全局结构相似性;RMSDali 是来自 TM-align20 的结构比对区域中模型与模板结构之间的 RMSD;Cov 表示结构比对的覆盖率(即结构比对的残基数除以查询序列长度的比值);IDali 是 TM-align 比对中的序列一致性。EC 编号预测的置信度评分还包含一项用于评估查询序列与模板在特定局部区域内活性位点匹配程度(AcM)的项,其计算公式为:
静态平衡公式 AcM 方程;平衡分析方法;公式推导图示。
其中 Nt 表示局部区域内存在的模板残基数目,Nali 表示比对的查询-模板残基对数目,dii 表示第 i 对比对残基之间的 Cα 距离,d0 = 3.0 Å 为距离截断值,Mii 表示第 i 对比对残基之间的 BLOSUM 得分。通常,Fh-score 的取值范围为 [0, 5],AcM 评分为 [0, 2],评分越高表示功能注释的置信度越高。AcM 评分也用于评估配体结合位点附近的局部结构与序列相似性,该评分称为 BS-score。

1. 提交蛋白质序列

  1. 访问 I-TASSER 网站 http://zhanglab.ccmb.med.umich.edu/I-TASSER,开始进行结构与功能建模实验。
  2. 将氨基酸序列复制粘贴至提供的表单中,或通过点击“Browse”按钮从您的计算机直接上传。I-TASSER 服务器目前最多可接受包含 1500 个残基的序列。长度超过 1500 个残基的蛋白质通常为多结构域蛋白,建议在提交至 I-TASSER 前将其拆分为独立的结构域。
  3. 提供您的电子邮件地址(必填)以及任务名称(可选)。
  4. 用户可选择性地指定外部残基间接触/距离约束,在结构建模过程中添加额外模板或排除某些模板蛋白。有关这些选项的更多使用说明,请参见“讨论”部分。
  5. 点击“Run I-TASSER”按钮提交序列。浏览器将跳转至确认页面,显示用户指定的信息、任务标识(Job ID)编号,以及一个指向结果存储网页的链接。用户可收藏此链接或记录任务标识号以供后续查询。

2. 结果的可获得性

  1. 通过访问 I-TASSER 队列页面 http://zhanglab.ccmb.med.umich.edu/I-TASSER/queue.php 查看已提交任务的状态。点击搜索标签,使用任务编号或查询序列来查找您已提交的任务。
  2. 结构与功能建模完成后,您将收到一封通知电子邮件,其中包含预测结构的图像和一个网页链接。点击此链接,或打开步骤 1.5 中收藏的链接,以查看和下载结果。

3. 二级结构与溶剂可及性预测

  1. 检查结果显示页面顶部显示的 FASTA 格式查询序列。如果在提交序列时指定了任何额外的限制/模板,则还可以看到指向显示用户指定信息网页的链接(图 1A)。
  2. 查看以以下形式显示的二级结构预测结果:α螺旋(H)、β折叠(S)或卷曲(C),以及每个残基预测的置信度评分(0 = 低,9 = 高)。寻找具有较长连续规则二级结构(H 或 S)预测的区域,以估计蛋白质中的核心区域。还可根据二级结构元件的分布分析蛋白质的结构类别。此外,蛋白质中较长的卷曲区域通常表明无序或未折叠区域。
  3. 查看预测的溶剂可及性(图 1C),以确定查询序列中被埋藏和暴露于溶剂的区域。预测的溶剂可及性值范围为 0(被埋藏的残基)到 9(暴露的残基)。主要由被埋藏残基组成的区域可用于界定蛋白质中的核心区域,而含有溶剂暴露且亲水性残基的区域则可能是水合/功能位点。

4. 三级结构预测

  1. 向下滚动以查看查询蛋白的预测三级结构,结构显示在交互式 Jmol 小程序中(图 2)。在小程序上单击鼠标左键,可更改显示结构的外观、放大至特定区域、选择预测模型中的特定残基类型,或计算残基间的距离。
  2. 分析模型中是否存在长的无序区域。这些区域通常对应于蛋白质中的无序区,或表明缺乏模板比对。这些区域通常建模准确性较低,若在建模过程中去除 N 端和 C 端的这些区域,将有助于提高建模准确性。
  3. 通过点击“Download Model”链接下载模型的 PDB 格式结构文件。您可在任何分子可视化软件(例如 Pymol、Rasmol 等)中打开这些文件,以进一步分析其结构特征。
  4. 分析结构建模的置信度评分(C-score),以评估预测结构的质量。C-score(公式 2)的值通常在 [-5, 2] 范围内,分数越高表示模型质量越好。“Model 1”的估计 TM-score 和 RMSD 显示为“Estimated accuracy of Model 1”。对于较长的蛋白质,建议基于 TM-score 评估模型质量,因为 TM-score 对拓扑结构变化的敏感性高于 RMSD。
  5. 点击“more about C-score”链接,可查看所有模型的 C-score、聚类大小和聚类密度。仅对第一个 I-TASSER 模型提供估计的 TM-score 和 RMSD,因为排名较低模型的 C-score 与 TM-score 或 RMSD 无强相关性。排名较低模型的质量可部分依据其相对于第一个模型的聚类密度和聚类大小进行评估,来自更大聚类且密度更高的模型平均而言更接近天然结构。
  6. 低 C-score 预测通常表明预测准确性较低。在大多数此类情况下,查询蛋白在数据库中缺乏良好的模板,且其长度超出从头建模(ab initio modeling)的适用范围(即 >120 个残基)。在此类情况下,用户可尝试获取额外的空间约束信息,并将其用于改进 I-TASSER 建模(参见讨论部分)。此外,若蛋白长度小于 200 个残基,建议将序列提交至我们的 QUARK 服务器(http://zhanglab.ccmb.med.umich.edu/QUARK/)进行纯从头建模(ab initio modeling)。

5. LOMETS 目标模板比对

  1. 向下滚动以分析由LOMETS穿线程序确定的查询蛋白的前十位穿线模板(图3)。通过查看“归一化Z分数”(Norm. Z-score)列中的归一化Z分数(公式1),评估穿线比对的质量。归一化Z分数高于特定阈值的比对表明具有较高的可靠性。 > 1 表明具有高度可信的比对结果,且很可能与查询蛋白具有相同的折叠结构。
  2. 分析穿线比对区域的序列一致性(“Iden. 1”列)以及整个链的序列一致性(“Iden. 2”列),以评估目标蛋白与模板蛋白之间的同源性。较高的序列一致性表明目标蛋白与模板蛋白之间存在较近的进化关系。
  3. 查看以彩色显示的穿线比对残基,可直观识别查询蛋白与模板蛋白中的保守残基/基序。相较于全链比对,穿线比对区域中更高的序列一致性也表明查询序列中存在保守的结构基序/结构域。
  4. 通过查看“Cov.”列并检查比对结果来评估穿线比对的覆盖度。如果最佳比对的覆盖度较低,且仅局限于查询蛋白的很小区域,或在查询序列的较长片段中无覆盖,则通常表明该查询蛋白包含多个结构域,建议将序列拆分后分别对各结构域进行建模(图3)。
  5. 单击“Download Align”链接,下载PDB格式的序列-结构比对文件。这些比对文件可在材料部分列出的任何分子可视化程序中打开,并可用于结构建模过程中添加额外的约束条件(步骤1.4)。

6. PDB 中的结构类似物

  1. 查看结果页面的下表(图4),以确定由结构比对程序 TM-align20 识别出的第一个预测模型的前十种结构类似物。TM-score >0.5 表明所检测到的类似物与模型具有相似的拓扑结构,可用于确定查询蛋白的结构分类/蛋白家族16;而 TM-score <0.3 则表示结构相似性为随机水平。
  2. 分析“IDENa”和“RMSDa”列中显示的结构比对区域内的序列同一性与均方根偏差(RMSD),以评估模型与结构类似物之间空间模体的保守性。通过目视检查比对图中着色并比对的残基对,识别这些结构上保守的残基和模体。
  3. 点击“PDB Hit”列中显示的 PDB 编号,访问 RCSB 网站,进一步了解其结构分类(SCOP、CATH 和 PFAM)以及功能信息(EC 编号、相关 GO 术语和结合配体)。

7. 使用 COFACTOR 进行功能预测

  1. 在结果页面中向下滚动,以分析查询蛋白的功能注释。蛋白功能在三个上下文表格中列出,分别显示:酶学委员会(EC)编号、基因本体(GO)术语以及配体结合位点。
  2. 查看每个表格中的“TM-score”、“RMSDa”、“IDENa”和“Cov.”列,以分析模型与已识别的功能同源物(模板)之间整体结构相似性及空间模式保守性的参数。

8. 酶学委员会编号预测

  1. 查看“预测的 EC 号”表格中显示的查询蛋白的前五个潜在酶同源物(图 5)。使用这些模板预测 EC 号的置信度水平在“EC-Score”列中显示。根据基准分析23,当 EC-score >1.1 时,可可靠地解释查询蛋白与模板蛋白之间的功能相似性(EC 号的前三位数字)。
  2. 在具有与查询蛋白相似折叠结构(即 TM-score >0.5)的模板中,寻找功能(EC 号)的一致性。如果多个模板具有相同的 EC 号且 EC-score >1.1,则预测的置信度非常高。然而,如果 EC-Score 较高,但在鉴定出的匹配结果中缺乏一致性,则预测的可靠性降低,建议用户参考 GO 术语预测结果。
  3. 点击 EC 号旁边的链接,访问 ExPASy 酶数据库,详细分析模板蛋白的功能,包括其催化的反应、辅因子需求以及参与的代谢通路。

9. 基因本体(GO)术语预测

  1. 查看“预测的 GO 术语”表格(图6),以识别 PDB 库中查询蛋白的前十个同源蛋白,这些蛋白均以基因本体(GO)术语进行注释。每个蛋白通常与多个 GO 术语相关联,描述其分子功能(MF)、生物过程(BP)和细胞组分(CC)。点击每个术语可访问 Amigo 网站,分析其定义与谱系。
  2. 分析 Fh-score(功能同源性评分)列,以评估查询蛋白与模板蛋白之间的功能相似性,并估计从这些模板蛋白转移功能注释的置信度水平。在我们的基准研究23中,当 Fh-score 截断值设为 0.8 时,通过首个识别出的模板可正确识别 50% 的原始 GO 术语,总体准确率为 56%。
  3. 查看“GO 术语的一致性预测”表格,以分析各模板之间功能的一致性。这些共同功能用于预测查询蛋白的 GO 术语(MF、BP 和 CC),并评估 GO 术语预测的置信度水平(GO-score)。根据基准测试23,当 GO-score 截断值为 0.5 时,预测的假阳性率和假阴性率最佳,但在更深层的本体层级中预测覆盖率有所下降。

10. 蛋白质-配体结合位点预测

  1. 滚动至页面底部,查看查询蛋白的前十个配体结合位点预测结果。预测的结合位点根据共享相同结合口袋的预测配体构象数量进行排序。最佳识别的结合位点已在 Jmol 小程序中显示。点击单选按钮以分析其他预测结果,并可视化配体相互作用的残基。
  2. 分析 BS-score 列,以评估模型与模板结合位点之间的局部相似性。根据基准测试9,BS-score > 1.1 表示模型中预测结合位点附近与模板中已知结合位点在序列和结构上具有高度相似性。
  3. 点击“Download”链接下载 PDB 格式的复合物结构文件。用户可在任何分子可视化程序中打开这些文件,并在其本地计算机上交互式查看预测的结合位点及配体-蛋白相互作用。

11. 代表性结果

显示预测二级结构和溶剂可及性图的蛋白质序列分析。
图 1. I-TASSER 结果页面的节选,显示(A)FASTA 格式的查询序列;(B)预测的二级结构及其相应的置信度得分;以及(C)残基的预测溶剂可及性。查询序列中的分析核心区域和潜在水合位点分别用青色和红色矩形标出。

由 I-TASSER 预测的蛋白质三维结构,显示前 5 个模型的示意图,结构生物学。
图 2. I-TASSER 结果页面示例,展示对查询蛋白质的三级结构预测。预测模型通过交互式 Jmol 小程序显示,用户可调整分子的显示方式。点击“下载”链接还可下载模型。模型质量的置信度评分以 C-score 表示。

使用 I-TASSER 进行蛋白质结构预测比对图;折叠识别,保守残基高亮显示。
图3. I-TASSER 结果页面示例,显示 LOMETS 鉴定出的前十位穿线模板及比对结果5 穿线程序。穿线比对的质量根据标准化的Z分数(以绿色突出显示)进行评估,其中数值 >1 表示高度可信的比对结果。在模板中与查询序列相应残基相同的比对残基以颜色标出,以指示保守残基/基序的存在;而多数高排名模板中缺乏比对,则表明查询蛋白含有多个结构域,未比对上的残基对应于结构域间的连接区域。 单击此处查看图3的完整尺寸版本。

通过TM-align进行的蛋白质结构比对表,展示空间保守性分析及RMSD得分。
图4. 显示由TM-align20结构比对程序识别出的前十名结构类似物及其结构比对结果的示例页面。所展示类似物的排序依据为结构比对的TM-score(以蓝色高亮显示)。TM-score >0.5 表示两个比对结构具有相似的拓扑结构,而TM-score <0.3 则表示两个结构之间的相似性与随机结构相当。结构比对中的残基对根据其氨基酸性质以颜色高亮显示,未比对区域以“-”表示。点击此处查看图4的完整尺寸版本。

预测的EC编号表格,显示蛋白质排名、EC评分、DNA解旋酶、RNA解旋酶结果。
图5. I-TASSER结果页面示例,显示在PDB数据库中识别出的查询蛋白质的酶同源物。EC编号预测的置信度基于EC评分(以绿色突出显示)进行分析,其中EC评分 > 1.1 表示查询蛋白与模板蛋白之间具有功能相似性(EC编号前三位数字相同)。

基因本体术语预测表,GO术语,蛋白质功能,生物过程,细胞定位。
图6. I-TASSER结果页面示例,显示查询蛋白质的GO术语预测结果。在基因本体模板库中,查询蛋白质的功能同源物根据其Fh得分(橙色矩形框内)进行排序。通过这些高分匹配结果中的共同功能特征,推导出查询蛋白质的最终GO术语预测。预测GO术语的可靠性基于GO得分(绿色显示),GO得分 >0.5 表示预测结果可靠。点击此处查看图6的完整尺寸版本。

预测的蛋白质结合位点图示,以表格形式展示结构类似物及结合位点评分。
图7. I-TASSER结果页面示例,显示使用COFACTOR9算法预测的前十名蛋白质配体结合位点。预测结合位点的排序依据是,在查询结构中共享相同结合口袋的预测配体构象数量。BS-score(以红色突出显示)用于衡量预测结合位点与模板结合位点之间的局部序列和结构相似性,有助于分析结合位点口袋的保守性。

原子距离分析表格;接触与距离数据,图中分子相互作用。
图8. 用于指定残基-残基接触/距离约束的外部约束文件示例。

蛋白质序列比对与结构建模,显示残基位置及坐标细节。
图9. 用于向 I-TASSER 服务器指定模板蛋白的限制文件示例。用户可通过以下任一格式指定查询序列与模板的比对:(A)FASTA 格式;或(B)3D 格式。

显示PDB编号和序列同一性截断值的蛋白质结构比对示意图。
图10. 在I-TASSER结构建模过程中用于排除模板的一个示例文件。第一列包含需要排除的模板蛋白的PDB编号。第二列用于指定序列同一性截断值,该值将应用于模板库中其他相似的模板。

讨论

上述方案是使用 I-TASSER 服务器进行结构与功能建模的通用指南。尽管该自动化流程对大多数蛋白质效果良好,但人为干预通常有助于显著提高建模准确性,特别是对于在 PDB 数据库中缺乏相近模板的蛋白质。用户可在 I-TASSER 建模过程中通过以下方式介入:(a)拆分多结构域蛋白质;(b)提供外部约束以优化结构组装;(c)在建模过程中移除模板。

切割多结构域蛋白:

许多长蛋白序列通常包含多个由柔性连接区连接的结构域,这使得利用实验和计算技术解析其结构变得困难。然而,由于结构域是独立折叠的实体,并能执行不同的分子功能,因此最好将长的多结构域蛋白拆分,并对各个结构域分别进行建模。单独建模各个结构域不仅能加快预测过程,还能提高查询序列与模板之间的比对质量,从而获得更可靠的结构和功能预测结果。

可以使用免费的外部在线程序(如 NCBI CDD24、PFAM25 或 InterProScan26)预测蛋白质序列中的结构域边界。此外,如果查询蛋白已有 LOMETS 穿线比对结果,则可通过在顶级穿线模板中目视识别未比对残基的长片段来确定结构域边界(参见步骤 5.4)。这些未比对区域通常对应于结构域之间的连接区。如果在模板 PDB 数据库中已存在包含所有查询蛋白结构域比对的多结构域模板,则可对查询蛋白进行全长建模。

提供外部约束

I-TASSER 中的结构组装模拟主要由来自 LOMETS 穿线模板的空间约束信息引导。对于在模板库中具有较好穿线命中结果(Norm. Z-score > 1)的查询蛋白,所获得的空间约束通常具有较高的准确性,I-TASSER 能够为这些蛋白生成高分辨率的结构模型。相反,对于穿线命中较弱或无穿线命中(Norm. Z-score < 1)的查询蛋白,由于模板和序列比对的不确定性,所收集的空间约束常含有错误。针对这类蛋白靶标,用户指定的空间信息可显著提高预测模型的质量。用户可通过以下两种方式向 I-TASSER 服务器提供外部约束信息:

指定接触/距离约束

可通过上传限制文件来指定实验测定的残基间接触或距离,例如来自核磁共振(NMR)或交联实验的数据。图8展示了一个示例文件,其中第1列指定限制类型,即“DIST”或“CONTACT”。对于距离限制(DIST),第2列和第4列包含残基位置(i, j),第3列和第5列包含残基中的原子类型,第6列指定两个指定原子之间的距离。对于接触限制(CONTACT),第2列和第3列包含应发生接触的残基位置(i, j)。这些接触残基对侧链中心之间的距离将根据PDB中已知结构中观察到的距离确定。在结构精修模拟过程中,I-TASSER会尝试使这些原子对的距离接近指定值。

B. 指定蛋白质结构模板

LOMETS 穿线程序使用具有代表性的 PDB 文库来为查询蛋白寻找可能的折叠结构。尽管使用代表性结构文库有助于减少计算序列-结构比对所需的时间,但仍有可能在文库中遗漏合适的模板蛋白,或者即使模板存在于文库中,LOMETS 穿线程序也可能未能识别出该模板。在此类情况下,用户应指定目标蛋白结构作为模板。

若要将蛋白质结构指定为额外的模板,用户可以上传一个符合 PDB 格式的结构文件,或指定 PDB 数据库中已收录蛋白质结构的 PDB ID。I-TASSER 将使用 MUSTER 程序23生成查询序列与模板的比对结果,并整合用户指定的模板以及 LOMETS 模板所提供的空间约束信息,以指导结构组装模拟过程。由于 LOMETS 约束的准确性因不同目标蛋白而异,因此在基准训练中已系统性地调整了其权重:对于较容易的(同源)目标,LOMETS 约束的权重较强;而对于较难的(非同源)目标,其权重则较弱。

用户还可以指定自己的查询-模板比对。服务器接受两种格式的比对:FASTA 格式(图 9A)和 3D 格式(图 9B)。FASTA 格式为标准格式,详见 http://zhanglab. ccmb.med.umich.edu/FASTA/。3D 格式类似于标准 PDB 格式(http://www.wwpdb.org/documentation/format32/sect9.html),但在 ATOM 记录中增加了两列来自模板的信息(见图 9B):

第1-30列:查询序列的原子(仅C-alpha)和残基名称。
第31-54列:从模板中相应原子复制的查询序列C-alpha原子坐标。
第55-59列:基于序列比对的模板中相应残基编号
第60-64列:模板中相应的残基名称

排除模板蛋白

蛋白质是具有柔性的分子,能够采取多种构象状态以改变其生物学活性。例如,许多蛋白激酶和膜蛋白的结构已被解析出其活性非活性构象。此外,配体的结合或缺失也可能引起显著的结构变化。尽管对于穿线程序而言,模板的所有构象状态均相似,但理想情况下应仅使用处于某一特定状态的模板来对目标序列进行建模。服务器上新增了一个选项,允许用户在结构建模过程中排除特定的模板蛋白。该功能还允许用户选择用于建模的模板的同源水平。用户可通过以下方式从 I-TASSER 库中排除模板蛋白:

A. 指定序列同一性阈值

用户可使用此选项从 I-TASSER 模板库中排除同源蛋白质。同源性水平基于序列同一性截断值设定,即查询序列与模板蛋白质之间相同残基数除以查询序列的长度。例如,若用户在表单中输入“70%”,则所有与目标蛋白质序列同一性>70% 的模板蛋白质将被排除在 I-TASSER 模板库之外。

B. 排除特定的模板蛋白

通过上传包含要排除结构的 PDB 编号列表,可以将特定的模板蛋白从 I-TASSER 模板库中排除。图 10 展示了一个示例文件。由于同一蛋白质在 PDB 库中可能对应多个条目,I-TASSER 服务器默认会排除指定的模板(第一列),同时也会排除数据库中与这些指定模板序列同一性 >90% 的所有其他模板。用户还可以指定不同的同一性阈值,例如 70%,此时将排除与指定模板蛋白序列同一性 >70% 的所有模板。

披露

未声明任何利益冲突。

致谢

该项目部分得到了阿尔弗雷德·P·斯隆基金会、美国国家科学基金会职业奖(DBI 1027394)以及美国国家普通医学科学研究所(GM083107,GM084222)的支持。

材料

本文使用的材料清单
姓名公司目录编号评论
材料名称类型公司目录编号
待建模蛋白质的FASTA格式氨基酸序列(参见,http://www.ncbi.nlm.nih.gov/BLAST/fasta.shtml)。
一台可连接互联网并配备网页浏览器的个人计算机。
分子可视化软件,例如RASMOL或PYMOL,用于分析预测的三级结构和功能位点。

参考文献

  1. Zhang, Y. Template-based modeling and free modeling by I-TASSER in CASP7. Proteins. 69, 108-117 (2007).
  2. Zhang, Y. I-TASSER: Fully automated protein structure prediction in CASP8. Proteins. 77, 100-113 (2009).
  3. Wu, S., Skolnick, J., Zhang, Y. Ab initio modeling of small proteins by iterative TASSER simulations. BMC Biol. 5, 17-17 (2007).
  4. Roy, A., Kucukural, A., Zhang, Y. I-TASSER: a unified platform for automated protein structure and function prediction. Nat Protoc. 5, 725-738 (2010).
  5. Wu, S., Zhang, Y. LOMETS: a local meta-threading-server for protein structure prediction. Nucleic Acids Res. 35, 3375-3382 (2007).
  6. Zhang, Y., Kihara, D., Skolnick, J. Local energy landscape flattening: parallel hyperbolic Monte Carlo sampling of protein folding. Proteins. 48, 192-201 (2002).
  7. Li, Y., Zhang, Y. REMO: A new protocol to refine full atomic protein models from C-alpha traces by optimizing hydrogen-bonding networks. Proteins. 76, 665-676 (2009).
  8. Zhang, J., Zhang, Y. High-resolution protein structure refinement using fragment guided molecular dynamics simulations. , (2011).
  9. Roy, A., Zhang, Y. COFACTOR: protein-ligand binding site predictions by global structure similarity match and local geometry refinement. , Forthcoming (2011).
  10. Zhang, Y., Hubner, I. A., Arakaki, A. K., Shakhnovich, E., Skolnick, J. On the origin and highly likely completeness of single-domain protein structures. Proc. Natl. Acad. Sci. U. S. A. 103, 2605-2610 (2006).
  11. Zhang, Y., Kolinski, A., Skolnick, J. TOUCHSTONE II: a new approach to ab initio protein structure prediction. Biophys. J. 85, 1145-1164 (2003).
  12. Wu, S., Zhang, Y. A comprehensive assessment of sequence-based and template-based methods for protein contact prediction. Bioinformatics. 24, 924-931 (2008).
  13. Zhang, Y., Skolnick, J. SPICKER: a clustering approach to identify near-native protein folds. J. Comput. Chem. 25, 865-871 (2004).
  14. Zhang, J., Zhang, Y. High-resolution protein structure refinement using fragment guided molecular dynamics simulations. , Forthcoming (2010).
  15. Zhang, Y. I-TASSER server for protein 3D structure prediction. BMC Bioinformatics. 9, 40-40 (2008).
  16. Xu, J., Zhang, Y. How significant is a protein structure similarity with TM-score = 0.5? Bioinformatics. 26, 889-895 (2010).
  17. Zhang, Y., Skolnick, J. Scoring function for automated assessment of protein structure template quality. Proteins. 57, 702-710 (2004).
  18. Barrett, A. J. Nomenclature Committee of the International Union of Biochemistry and Molecular Biology (NC-IUBMB). Enzyme Nomenclature. Recommendations 1992. Supplement 4: corrections and additions (1997). Eur J Biochem. 250, 1-6 (1997).
  19. Ashburner, M. Gene ontology: tool for the unification of biology. The Gene Ontology Consortium. Nat. Genet. 25, 25-29 (2000).
  20. Zhang, Y., Skolnick, J. TM-align: a protein structure alignment algorithm based on the TM-score. Nucleic. Acids. Res. 33, 2302-2309 (2005).
  21. Xu, D., Zhang, Y. RK Ab Intio Protein Structure Prediction. , Forthcoming (2011).
  22. Kim, D. E., Chivian, D., Baker, D. Protein structure prediction and analysis using the Robetta server. Nucleic. Acids. Res. 32, W526-W531 (2004).
  23. Roy, A., Mukherjee, S., Hefty, P. S., Zhang, Y. Inferring protein function by global and local similarity of structural analogs. , Forthcoming (2011).
  24. Marchler-Bauer, A., Bryant, S. H. CD-Search: protein domain annotations on the fly. Nucleic. Acids. Res. 32, W327-W331 (2004).
  25. Finn, R. D. The Pfam protein families database. Nucleic. Acids. Res. 38, D211-D222 (2010).
  26. Zdobnov, E. M., Apweiler, R. InterProScan--an integration platform for the signature-recognition methods in InterPro. Bioinformatics. 17, 847-848 (2001).

重印与许可

标签

I TASSER