2011年11月3日
本文描述了使用I-TASSER流程对蛋白质进行基于计算机的结构与功能表征的指南。从目标蛋白质序列出发,通过多序列 threading 比对和迭代的结构组装模拟生成三维模型。随后,基于与已知结构和功能的蛋白质的匹配结果,进行功能推断。
本实验的目的是从蛋白质分子的氨基酸序列出发,通过计算方法预测其三维结构和生物学功能。首先通过机器学习预测蛋白质的二级结构,然后将氨基酸序列及预测的二级结构与PDB数据库中已解析的结构进行比对,以确定最合适的结构模板。
该过程称为“穿线”(threading)。完成穿线过程后,IT AER 程序将根据序列模板比对结果将模板拆分为片段,并在第三步中将这些片段重新组装为全长模型。通过原子水平的精细优化,构建全原子模型,以优化氢键网络并消除空间位阻重叠。
该流程的最后一步是通过将预测结构与功能库中已知功能的蛋白质进行比对,从而确定蛋白质的生物学功能。ITER 相较于现有结构建模方法的主要优势在于其内在的结构片段组装策略,该策略能够持续推动穿线比对结果更接近天然构象。这些高质量的结构模型也为基于结构的精确功能注释奠定了基础,从而促进 ITER 在科学界的应用。
我们的实验室已提供一个网站,可将蛋白质序列提交至 iter。该网站作为一个中心枢纽,供全球用户注册并接入管理及运行 ITER 模拟的计算机集群。一次 ITER 模拟任务包含十余个较小的子模拟。
这些模拟若在单台计算机的单个处理器核心上运行,可能需要超过一百小时。臧实验室的计算机集群能够将这些子模拟分发到数百台计算机上,并可同时运行超过2000个模拟。借助我们的计算机集群,并行运行的情况下,每天能够完成数百个I型味觉模拟。
尽管具备这一能力,仍需开展大量工作以优化系统并尽量缩短在线 IT AER 用户的等待时间。要开始结构与功能建模实验,请登录 IT AER 网页。此处讨论的所有相关网页的 URL 地址均可在书面实验方案中找到。
将氨基酸序列复制粘贴到提供的表单中,或通过点击浏览按钮直接上传序列。请提供电子邮件地址以及任务名称。用户可选择性地指定外部残基间的接触或距离约束。
在结构建模过程中添加额外的模板或排除某些模板蛋白。点击“运行 IT Taser”按钮以提交序列。通过访问 IT Taser 队列页面查看已提交任务的状态。
点击搜索标签,使用作业编号或查询序列来查找已提交的作业。结构与功能建模完成后,系统将向提供的电子邮件地址发送通知邮件,邮件中包含预测结构的图像以及一个网页链接。点击此链接以查看并下载结果。
通过分析二级结构预测开始结构分析,其中 H 表示α螺旋,S 表示β链,C 表示无规卷曲。同时,需考虑每个残基预测的置信度得分。寻找具有较长规则二级结构预测的区域,以估计蛋白质中的核心区域。
还可以根据二级结构元件的分布来分析蛋白质的结构类别。查看预测的溶剂可及性,以确定被埋藏的区域和暴露于溶剂的区域。在查询值中,预测的溶剂可及性评分范围从0分(对应被埋藏的残基)到9分(对应暴露的残基)。
主要包含埋藏残基的区域可用于界定蛋白质中的核心区域,而含有溶剂暴露且亲水性残基的区域则可能是水合位点或功能位点。要查看查询蛋白的预测三级结构,请向下滚动至左侧显示的交互式 JMO 小程序。点击该小程序可更改所显示结构的外观。
放大至特定区域,选择预测模型中的特定残基类型,或计算残基间的距离。通过分析结构建模的置信度得分来评估预测结构的质量。Csco 值通常在负五到二的范围内,得分越高表明模型质量越好。
第一个模型的预测 TM 得分和 RMSD 显示为模型一的预测准确性。点击关于 csco 的更多链接。为分析所有模型的 csco 聚类大小和聚类密度,需分析由低 mets 穿线程序识别出的查询蛋白的前 10 个穿线模板。
通过向下滚动结果页面,查看归一化的Z分数以分析穿线比对的质量。归一化分数大于1的比对结果表明比对具有较高可信度,且该比对模型最可能与查询蛋白具有相同的折叠结构。检查穿线比对区域内的序列一致性以及整个肽链的序列一致性,以评估查询蛋白与模板蛋白之间的同源性。
高序列一致性是查询蛋白与模板蛋白之间进化相关性的指标。通过观察以颜色标示的穿线比对残基,可直观识别查询蛋白和模板蛋白中的保守残基或基序;相较于全长链比对,穿线比对区域更高的序列一致性还表明查询蛋白中存在保守的结构基序或结构域。通过检查比对情况来评估穿线比对的覆盖度。
如果顶部比对的覆盖范围较低,且仅局限于查询蛋白的很小区域,或在查询序列的较长片段中缺失,则表明该查询蛋白包含多个结构域。此时建议将序列拆分,并对各个结构域分别进行建模。查看结果页面的下一个表格,以确定由结构比对程序 TM align 鉴定出的第一个预测模型的前 10 个结构类似物。
TM 分数大于 0.5 表明检测到的结构类似物与模型具有相似的拓扑结构,可用于确定目标蛋白的结构类别或蛋白家族。TM 分数小于 0.3 则表示结构相似性为随机水平。通过分析结构比对区域中的序列同一性及 RMSD,评估模型与结构类似物中空间模体的保守性。
通过目视检查比对结果中着色并比对的残基对,识别这些结构保守的残基和基序。查看预测的 EC 号码表格,以了解查询蛋白最可能的前五个酶学分类(OG)。利用这些模板进行 EC 号码预测的置信度水平,以基于基准分析的 EC 分数形式展示。
当EC评分大于1.1时,可可靠地解释查询蛋白与模板蛋白之间的功能相似性。接下来,需查找与查询蛋白具有相似折叠结构的模板蛋白之间的功能一致性。若多个模板蛋白具有相同的EC编号且EC评分大于1.1,则预测的置信度非常高。
然而,如果 EC 评分较高,但在已鉴定出的匹配结果中缺乏一致性,则该预测的可靠性会降低,建议用户参考基因本体数据库。在术语预测中,可查看预测的基因本体术语表格,以识别在 PDB 数据库中注释了基因本体术语的查询蛋白的前 10 个同源蛋白;每个蛋白通常与多个基因本体术语相关联,这些术语描述其分子功能、生物过程和细胞定位。点击每个术语可访问 AmiGO 网站,以分析其定义和谱系信息。
分析功能同源性评分列,以评估查询蛋白与模板蛋白之间的功能相似性。也可据此估计从这些蛋白转移功能注释的置信度。查看基因本体术语的共识预测表格,以分析各模板之间功能的一致性。
这些常用功能用于预测查询蛋白的基因本体论(gene ontology)术语,并评估 geo 术语预测的置信水平。最后,向下滚动至页面底部,查看查询蛋白的前 10 个配体结合位点预测结果;预测的结合位点根据共享同一结合口袋的预测配体构象数量进行排序。最佳识别出的结合位点已在 JM OL 应用程序中显示。
点击单选按钮以分析其他预测结果,并可视化配体相互作用的残基。BS 分数反映了模型与模板结合位点之间的局部相似性。BS 分数大于 1.1 表示在预测的结合位点附近具有较高的序列和结构相似性。
与模板中的已知结合位点相比,该模型中的 IT 是一个主网页,包含指向其他有用功能的链接。论坛功能允许用户创建在线账户,并向其他 ITER 用户寻求有关结构建模或结果解读方面的帮助。下载功能允许用户下载 ITER 及相关软件包,并将其安装到计算机上。
这有助于缩短建模实验所需的时间。队列功能允许用户在 IT a Q 页面上查看所有已提交任务的状态。用户还可以直观检查已完成任务的建模结构图像。
在此页面上,同时显示了CSCO的首个模型预期TM得分和预期RMSD,以及提交日期;此处展示的是IT AER结果页面的节选,内容包括格式化加速后的查询序列、预测的二级结构,以及各残基对应的置信度分数和预测的溶剂可及性。分析的核心区域和查询序列中潜在的水合位点分别用青色和红色矩形标出。此处展示了查询蛋白的三级结构预测结果。
预测的模型显示在交互式 JML 应用程序界面中,用户可据此更改分子的显示方式。用户还可通过点击下载链接来下载模型,模型质量的置信度评分以 csco 形式报告。此处展示了一个 itta A 结果页面的示例,其中列出了 Loomis 穿线程序识别出的前 10 个穿线模板及其比对结果。
根据归一化的 Z 分数评估序列比对的质量,其中大于 1 的值表示可靠的比对。在模板中与查询序列相应残基相同的比对残基以颜色突出显示,以表明存在保守残基或基序。相反,若在大多数排名靠前的模板中均缺乏比对,则表明查询蛋白包含多个结构域,而未比对上的残基对应于结构域之间的连接区域。
本表格列出了由 TM 比对结构比对程序鉴定出的前 10 个结构类似物及结构比对结果。类似物的排序基于结构比对的 TM 分数。当 TM 分数大于 0.5 时,表明所比较的两个结构具有相似的拓扑结构。
当 TM 得分小于 0.3 时,表示两个结构之间的相似性处于随机水平。结构比对的残基对根据其氨基酸性质以颜色高亮显示,未比对的区域则用短横线表示。以下是 ITR 结果页面的一个示例,展示在 PDB 数据库中找到的查询蛋白的酶同源物。
EC 编号预测的置信度基于 EC 分数进行分析,其中 EC 分数大于 1.1 表示查询蛋白与模板蛋白之间具有功能相似性。查询蛋白的基因本体术语预测表包含基因本体模板文库中基于功能同源性分数排序的查询蛋白功能同源物。通过分析这些高分匹配结果中的常见功能特征,生成对查询蛋白的最终基因本体术语预测。
基于 geo 分数来估计预测基因本体术语的质量,其中 geo 分数大于 0.5 表示可靠的预测,此处以 IT AZA 结果页面为例,展示使用辅因子算法预测的前 10 个蛋白配体结合位点。预测结合位点的排序依据是共享同一结合口袋的预测配体匹配数量。查询中的 BS 分数用于衡量预测结合位点与模板结合位点之间的局部序列和结构相似性,有助于分析结合位点口袋的保守性。
尽管ISER是蛋白质结构与功能预测中最高效的算法之一,但需要牢记的是,它仅基于计算机算法的预测结果。任何实验数据或功能信息,例如残基接触或结合信息,都将对提高预测准确性极为有益。IT AER服务器提供了一个门户,可在建模过程中纳入这些信息,以满足日益增长的研究需求。
此外,臧实验室已免费发布IT AER软件,供非商业性研究使用。我们正在积极开发并改进IT AER以及眼动追踪器,希望该软件的公开可用性能够推动其在臧实验室以外的大规模应用,并促进科学界进一步的研究与进步。
本文介绍了I-TASSER管道,该管道用于根据氨基酸序列预测蛋白质的三维结构和功能。该过程包括基于已知蛋白质结构的序列比对(threading)、片段组装和功能推断。
计算蛋白质结构与功能预测可通过为尚未通过实验表征的蛋白质提供机制性见解,在早期药物发现中实现靶点去风险化。I-TASSER 分析流程支持假设检验与功能注释,提高靶点选择和先导化合物识别流程中的预测可信度。该方法减少了对低通量实验方法的依赖,加快了生物制药研发中的靶点验证进程。
I-TASSER 方法通过提供结构和功能方面的深入见解,将目标识别到先导化合物优化的整个发现过程整合在一起,为每个阶段的决策提供依据。