本文描述了使用I-TASSER流程对蛋白质进行基于计算机的结构与功能表征的指南。从目标蛋白质序列出发,通过多序列 threading 比对和迭代的结构组装模拟生成三维模型。随后,基于与已知结构和功能的蛋白质的匹配结果,进行功能推断。
本文描述了使用I-TASSER流程对蛋白质进行基于计算机的结构与功能表征的指南。从目标蛋白质序列出发,通过多序列 threading 比对和迭代的结构组装模拟生成三维模型。随后,基于与已知结构和功能的蛋白质的匹配结果,进行功能推断。
基因组测序项目已解析出数百万种蛋白质序列,要深入理解它们的生物学功能,需要了解其结构与功能信息。尽管实验方法可为其中一小部分蛋白质提供详细信息,但大多数蛋白质分子仍需依赖计算建模进行研究。I-TASSER 服务器是一个用于高分辨率蛋白质结构与功能建模的在线工作平台。给定一条蛋白质序列后,I-TASSER 服务器的典型输出结果包括:二级结构预测、每个残基的预测溶剂可及性、通过穿线法和结构比对检测到的同源模板蛋白、最多五个全长的三级结构模型,以及基于结构的功能注释,如酶分类、基因本体(Gene Ontology)术语和蛋白质-配体结合位点。所有预测结果均附带一个置信度评分,用于在未知实验数据的情况下评估预测结果的准确性。为满足用户的特殊需求,该服务器提供通道,允许用户输入指定的残基间距离和接触图谱,以交互式地调整 I-TASSER 的建模过程;同时允许用户指定任意蛋白质作为模板,或在结构组装模拟过程中排除特定模板蛋白。用户可根据实验依据或生物学见解收集结构信息,以提升 I-TASSER 预测的质量。在最近的全球性 CASP 实验评估中,该服务器被评价为蛋白质结构与功能预测领域性能最佳的程序之一。目前,来自100多个国家的注册用户科学家已超过>20,000名,正在使用在线 I-TASSER 服务器。
方法概述
遵循“序列到结构再到功能”的研究范式,I-TASSER 进行结构与功能建模的过程1-4 包含以下四个连续步骤:(a)通过 LOMETS5 进行模板识别;(b)利用副本交换蒙特卡洛模拟6 进行片段结构重装;(c)使用 REMO7 和 FG-MD8 进行原子水平的结构优化;以及(d)利用 COFACTOR9 进行基于结构的功能注释。
模板识别:对于用户提交的查询序列,首先通过本地安装的LOMETS多线程服务器将该序列穿过多套代表性PDB结构数据库。穿线法(threading)是一种序列-结构比对方法,用于识别可能与查询蛋白具有相似结构或包含相似结构模体的模板蛋白。为了提高同源模板检测的覆盖率,LOMETS整合了多种先进的算法,涵盖不同的穿线方法。由于不同的穿线程序具有不同的评分系统和比对灵敏度,因此通过归一化的Z分数来评估每个穿线程序生成的比对质量,其定义为:

其中Z分数表示相对于该程序生成的所有比对结果统计均值的标准差单位得分;Z0是基于大规模穿线基准测试5确定的程序特异性Z分数阈值,用于区分“优质”和“劣质”模板。模板的Z分数越高,表明其比对得分显著高于大多数其他模板,通常意味着该比对对应一个高质量的模型。如果大多数排名靠前的穿线模板均具有较高的归一化Z分数,则最终I-TASSER模型的准确性通常较高。然而,若蛋白较大且穿线比对的覆盖范围仅限于查询蛋白的局部区域,则高归一化Z分数并不一定意味着全长模型具有高建模准确性。从每个穿线程序中选取排名前两位的穿线比对结果,并用于下一步的结构组装。
迭代结构组装模拟:在穿线法(threading)程序之后,将查询序列划分为穿线法比对区域和未比对区域。从模板中提取穿线法比对中的连续片段并直接用于结构组装,而未比对的环状区域则通过从头建模(ab initio modeling)构建。结构组装过程在格点系统上进行,并由副本交换蒙特卡洛模拟(replica exchange Monte Carlo simulations)6引导。I-TASSER 力场包含氢键相互作用10、从 PDB 中已知蛋白质结构导出的基于知识的统计能量项11、来自 SVMSEQ12的基于序列的接触预测,以及从 LOMETS5穿线模板收集的空间约束。在模拟过程中低温副本生成的构象去折叠体(decoys)通过 SPICKER13进行聚类,以识别低自由能状态的结构。通过平均所有聚类内结构去折叠体的三维坐标,获得前几个聚类的中心结构,并用于最终模型的生成。该模拟与聚类过程重复两次,以消除空间位阻冲突并进一步优化全局拓扑结构。
原子水平模型构建与优化:经过 SPICKER 聚类后获得的聚类中心是简化蛋白质模型(每个残基由其 Cα 和侧链质心表示),其生物学应用有限。从简化模型构建全原子模型分为两个步骤。第一步,使用 REMO7 通过优化氢键网络,从 C-alpha 轨迹构建全原子模型。第二步,利用 FG-MD14 对 REMO 生成的全原子模型进一步优化,通过分子动力学模拟改善主链扭转角、键长和侧链构象取向,该过程由 TM-align 从 PDB 结构中搜索到的结构片段指导。经 FG-MD 优化后的模型作为 I-TASSER 进行三级结构预测的最终模型。
生成模型的质量通过置信度评分(C-score)进行评估,该评分基于LOMETS折叠识别比对的Z-score以及I-TASSER模拟的收敛性,其数学表达式为:

其中 M 是SPICKER识别的结构簇中结构诱饵的多样性13; M总数 是提交给聚类的诱饵总数; 是聚类后诱饵结构相对于聚类中心的平均RMSD; 标准化Z得分(i) 是来自最优穿线比对的标准化Z分数(公式1) iLOMETS 中的 threading 服务器5; N LOMETS 中使用的服务器数量。
C-score 与 I-TASSER 模型的质量具有强相关性。结合 C-score 和蛋白质长度,可对首个 I-TASSER 模型的准确性进行估计,其 TM-score 的平均误差为 0.08,RMSD 的平均误差为 2 Å15. 通常情况下,C-score 较高的模型 > 预计有1.5个模型具有正确的折叠结构。此处,RMSD和TM-score均为衡量模型结构与天然结构之间拓扑相似性的常用指标。TM-score的取值范围为[0, 1],分数越高表示结构匹配度越好。16,17。然而对于排名较低的模型(即第2名nd-5th 模型),C值与TM值及RMSD的相关性较弱(约0.5),无法用于可靠估计模型的绝对质量。
在 I-TASSER 模拟中,第一个模型是否总是最优模型?这个问题的答案取决于目标蛋白的类型。对于容易的目标,第一个模型通常是最优模型,其 C-score 通常显著高于其他模型。然而,对于困难的目标,当折叠识别(threading)未能找到显著的模板匹配时,第一个模型未必是最优模型,此时 I-TASSER 在选择最佳模板和模型方面实际上存在困难。因此,建议对困难目标的全部 5 个模型进行分析,并结合实验信息和生物学知识来选择最优模型。
功能预测:在最后一步中,使用由 FG-MD 生成的最终三维模型来预测蛋白质功能的三个方面,即:(a) 酶学委员会(EC)编号18;(b) 基因本体(GO)19术语;以及 (c) 小分子配体的结合位点。对于这三个方面,均采用 COFACTOR 方法进行功能注释,该方法是一种基于预测蛋白模型与 PDB 中已知结构和功能的模板蛋白在全局和局部相似性基础上预测蛋白质功能的新策略。首先,使用结构比对程序 TM-align20 将预测模型的全局拓扑结构与功能模板文库进行比对。随后,根据全局结构相似性从文库中选取与目标模型最相似的一组蛋白质,并在活性位点/结合位点区域附近进行广泛的局部搜索,以识别结构和序列的局部相似性。基于获得的全局与局部相似性得分,对模板蛋白(功能同源物)进行排序,并依据得分最高的匹配结果转移功能注释(EC 编号和基因本体19术语)。类似地,配体结合位点残基及配体结合模式则通过查询序列与高分功能模板中已知配体结合位点残基的局部比对结果进行推断9。
I-TASSER 中功能(EC 和 GO 术语)预测的质量通过功能同源性评分(Fh-score)进行评估,该评分是衡量查询序列与模板之间全局和局部相似性的指标,其定义如下:

其中,C-score 是如公式 (2) 所定义的对预测模型质量的估计值;TM-score 衡量模型蛋白与模板蛋白之间的全局结构相似性;RMSDali 是来自 TM-align20 的结构比对区域中模型与模板结构之间的 RMSD;Cov 表示结构比对的覆盖率(即结构比对的残基数除以查询序列长度的比值);IDali 是 TM-align 比对中的序列一致性。EC 编号预测的置信度评分还包含一项用于评估查询序列与模板在特定局部区域内活性位点匹配程度(AcM)的项,其计算公式为:

其中 Nt 表示局部区域内存在的模板残基数目,Nali 表示比对的查询-模板残基对数目,dii 表示第 i 对比对残基之间的 Cα 距离,d0 = 3.0 Å 为距离截断值,Mii 表示第 i 对比对残基之间的 BLOSUM 得分。通常,Fh-score 的取值范围为 [0, 5],AcM 评分为 [0, 2],评分越高表示功能注释的置信度越高。AcM 评分也用于评估配体结合位点附近的局部结构与序列相似性,该评分称为 BS-score。
1. 提交蛋白质序列
2. 结果的可获得性
3. 二级结构与溶剂可及性预测
4. 三级结构预测
5. LOMETS 目标模板比对
6. PDB 中的结构类似物
7. 使用 COFACTOR 进行功能预测
8. 酶学委员会编号预测
9. 基因本体(GO)术语预测
10. 蛋白质-配体结合位点预测
11. 代表性结果

图 1. I-TASSER 结果页面的节选,显示(A)FASTA 格式的查询序列;(B)预测的二级结构及其相应的置信度得分;以及(C)残基的预测溶剂可及性。查询序列中的分析核心区域和潜在水合位点分别用青色和红色矩形标出。

图 2. I-TASSER 结果页面示例,展示对查询蛋白质的三级结构预测。预测模型通过交互式 Jmol 小程序显示,用户可调整分子的显示方式。点击“下载”链接还可下载模型。模型质量的置信度评分以 C-score 表示。

图3. I-TASSER 结果页面示例,显示 LOMETS 鉴定出的前十位穿线模板及比对结果5 穿线程序。穿线比对的质量根据标准化的Z分数(以绿色突出显示)进行评估,其中数值 >1 表示高度可信的比对结果。在模板中与查询序列相应残基相同的比对残基以颜色标出,以指示保守残基/基序的存在;而多数高排名模板中缺乏比对,则表明查询蛋白含有多个结构域,未比对上的残基对应于结构域间的连接区域。 单击此处查看图3的完整尺寸版本。

图4. 显示由TM-align20结构比对程序识别出的前十名结构类似物及其结构比对结果的示例页面。所展示类似物的排序依据为结构比对的TM-score(以蓝色高亮显示)。TM-score >0.5 表示两个比对结构具有相似的拓扑结构,而TM-score <0.3 则表示两个结构之间的相似性与随机结构相当。结构比对中的残基对根据其氨基酸性质以颜色高亮显示,未比对区域以“-”表示。点击此处查看图4的完整尺寸版本。

图5. I-TASSER结果页面示例,显示在PDB数据库中识别出的查询蛋白质的酶同源物。EC编号预测的置信度基于EC评分(以绿色突出显示)进行分析,其中EC评分 > 1.1 表示查询蛋白与模板蛋白之间具有功能相似性(EC编号前三位数字相同)。

图6. I-TASSER结果页面示例,显示查询蛋白质的GO术语预测结果。在基因本体模板库中,查询蛋白质的功能同源物根据其Fh得分(橙色矩形框内)进行排序。通过这些高分匹配结果中的共同功能特征,推导出查询蛋白质的最终GO术语预测。预测GO术语的可靠性基于GO得分(绿色显示),GO得分 >0.5 表示预测结果可靠。点击此处查看图6的完整尺寸版本。

图7. I-TASSER结果页面示例,显示使用COFACTOR9算法预测的前十名蛋白质配体结合位点。预测结合位点的排序依据是,在查询结构中共享相同结合口袋的预测配体构象数量。BS-score(以红色突出显示)用于衡量预测结合位点与模板结合位点之间的局部序列和结构相似性,有助于分析结合位点口袋的保守性。

图8. 用于指定残基-残基接触/距离约束的外部约束文件示例。

图9. 用于向 I-TASSER 服务器指定模板蛋白的限制文件示例。用户可通过以下任一格式指定查询序列与模板的比对:(A)FASTA 格式;或(B)3D 格式。

图10. 在I-TASSER结构建模过程中用于排除模板的一个示例文件。第一列包含需要排除的模板蛋白的PDB编号。第二列用于指定序列同一性截断值,该值将应用于模板库中其他相似的模板。
上述方案是使用 I-TASSER 服务器进行结构与功能建模的通用指南。尽管该自动化流程对大多数蛋白质效果良好,但人为干预通常有助于显著提高建模准确性,特别是对于在 PDB 数据库中缺乏相近模板的蛋白质。用户可在 I-TASSER 建模过程中通过以下方式介入:(a)拆分多结构域蛋白质;(b)提供外部约束以优化结构组装;(c)在建模过程中移除模板。
切割多结构域蛋白:
许多长蛋白序列通常包含多个由柔性连接区连接的结构域,这使得利用实验和计算技术解析其结构变得困难。然而,由于结构域是独立折叠的实体,并能执行不同的分子功能,因此最好将长的多结构域蛋白拆分,并对各个结构域分别进行建模。单独建模各个结构域不仅能加快预测过程,还能提高查询序列与模板之间的比对质量,从而获得更可靠的结构和功能预测结果。
可以使用免费的外部在线程序(如 NCBI CDD24、PFAM25 或 InterProScan26)预测蛋白质序列中的结构域边界。此外,如果查询蛋白已有 LOMETS 穿线比对结果,则可通过在顶级穿线模板中目视识别未比对残基的长片段来确定结构域边界(参见步骤 5.4)。这些未比对区域通常对应于结构域之间的连接区。如果在模板 PDB 数据库中已存在包含所有查询蛋白结构域比对的多结构域模板,则可对查询蛋白进行全长建模。
提供外部约束
I-TASSER 中的结构组装模拟主要由来自 LOMETS 穿线模板的空间约束信息引导。对于在模板库中具有较好穿线命中结果(Norm. Z-score > 1)的查询蛋白,所获得的空间约束通常具有较高的准确性,I-TASSER 能够为这些蛋白生成高分辨率的结构模型。相反,对于穿线命中较弱或无穿线命中(Norm. Z-score < 1)的查询蛋白,由于模板和序列比对的不确定性,所收集的空间约束常含有错误。针对这类蛋白靶标,用户指定的空间信息可显著提高预测模型的质量。用户可通过以下两种方式向 I-TASSER 服务器提供外部约束信息:
指定接触/距离约束
可通过上传限制文件来指定实验测定的残基间接触或距离,例如来自核磁共振(NMR)或交联实验的数据。图8展示了一个示例文件,其中第1列指定限制类型,即“DIST”或“CONTACT”。对于距离限制(DIST),第2列和第4列包含残基位置(i, j),第3列和第5列包含残基中的原子类型,第6列指定两个指定原子之间的距离。对于接触限制(CONTACT),第2列和第3列包含应发生接触的残基位置(i, j)。这些接触残基对侧链中心之间的距离将根据PDB中已知结构中观察到的距离确定。在结构精修模拟过程中,I-TASSER会尝试使这些原子对的距离接近指定值。
B. 指定蛋白质结构模板
LOMETS 穿线程序使用具有代表性的 PDB 文库来为查询蛋白寻找可能的折叠结构。尽管使用代表性结构文库有助于减少计算序列-结构比对所需的时间,但仍有可能在文库中遗漏合适的模板蛋白,或者即使模板存在于文库中,LOMETS 穿线程序也可能未能识别出该模板。在此类情况下,用户应指定目标蛋白结构作为模板。
若要将蛋白质结构指定为额外的模板,用户可以上传一个符合 PDB 格式的结构文件,或指定 PDB 数据库中已收录蛋白质结构的 PDB ID。I-TASSER 将使用 MUSTER 程序23生成查询序列与模板的比对结果,并整合用户指定的模板以及 LOMETS 模板所提供的空间约束信息,以指导结构组装模拟过程。由于 LOMETS 约束的准确性因不同目标蛋白而异,因此在基准训练中已系统性地调整了其权重:对于较容易的(同源)目标,LOMETS 约束的权重较强;而对于较难的(非同源)目标,其权重则较弱。
用户还可以指定自己的查询-模板比对。服务器接受两种格式的比对:FASTA 格式(图 9A)和 3D 格式(图 9B)。FASTA 格式为标准格式,详见 http://zhanglab. ccmb.med.umich.edu/FASTA/。3D 格式类似于标准 PDB 格式(http://www.wwpdb.org/documentation/format32/sect9.html),但在 ATOM 记录中增加了两列来自模板的信息(见图 9B):
第1-30列:查询序列的原子(仅C-alpha)和残基名称。
第31-54列:从模板中相应原子复制的查询序列C-alpha原子坐标。
第55-59列:基于序列比对的模板中相应残基编号
第60-64列:模板中相应的残基名称
排除模板蛋白
蛋白质是具有柔性的分子,能够采取多种构象状态以改变其生物学活性。例如,许多蛋白激酶和膜蛋白的结构已被解析出其活性和非活性构象。此外,配体的结合或缺失也可能引起显著的结构变化。尽管对于穿线程序而言,模板的所有构象状态均相似,但理想情况下应仅使用处于某一特定状态的模板来对目标序列进行建模。服务器上新增了一个选项,允许用户在结构建模过程中排除特定的模板蛋白。该功能还允许用户选择用于建模的模板的同源水平。用户可通过以下方式从 I-TASSER 库中排除模板蛋白:
A. 指定序列同一性阈值
用户可使用此选项从 I-TASSER 模板库中排除同源蛋白质。同源性水平基于序列同一性截断值设定,即查询序列与模板蛋白质之间相同残基数除以查询序列的长度。例如,若用户在表单中输入“70%”,则所有与目标蛋白质序列同一性>70% 的模板蛋白质将被排除在 I-TASSER 模板库之外。
B. 排除特定的模板蛋白
通过上传包含要排除结构的 PDB 编号列表,可以将特定的模板蛋白从 I-TASSER 模板库中排除。图 10 展示了一个示例文件。由于同一蛋白质在 PDB 库中可能对应多个条目,I-TASSER 服务器默认会排除指定的模板(第一列),同时也会排除数据库中与这些指定模板序列同一性 >90% 的所有其他模板。用户还可以指定不同的同一性阈值,例如 70%,此时将排除与指定模板蛋白序列同一性 >70% 的所有模板。
未声明任何利益冲突。
该项目部分得到了阿尔弗雷德·P·斯隆基金会、美国国家科学基金会职业奖(DBI 1027394)以及美国国家普通医学科学研究所(GM083107,GM084222)的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 材料名称 | 类型 | 公司 | 目录编号 |
| 待建模蛋白质的FASTA格式氨基酸序列(参见,http://www.ncbi.nlm.nih.gov/BLAST/fasta.shtml)。 | |||
| 一台可连接互联网并配备网页浏览器的个人计算机。 | |||
| 分子可视化软件,例如RASMOL或PYMOL,用于分析预测的三级结构和功能位点。 |