本文介绍了一种利用 Bio3D-web 在线研究蛋白质序列-结构-动力学关系的实验方案。
方法文章
* These authors contributed equally
本文介绍了一种利用 Bio3D-web 在线研究蛋白质序列-结构-动力学关系的实验方案。
我们展示了如何使用 Bio3D-web 进行生物分子结构数据的交互式分析。Bio3D-web 应用程序提供以下在线功能:(1)根据用户设定的相似性阈值,识别相关的蛋白质结构集合;(2)对这些结构进行多序列比对和结构叠合;(3)序列与结构保守性分析;(4)通过主成分分析绘制构象间关系图;以及(5)通过集合态正则模式分析比较预测的内部动力学特性。这一集成化功能为研究蛋白质家族及超家族中的序列-结构-动力学关系提供了完整的在线工作流程。
蛋白质数据库(PDB)目前包含超过 120,000 个蛋白质结构——其中许多属于同一蛋白质家族,但在不同的实验条件下解析得到。这些多重结构为理解蛋白质结构与功能的复杂性提供了宝贵的资源。例如,对这些结构集合进行严格比较,可以揭示重要的分子机制1,2,3,并阐明配体结合、酶催化以及双分子识别等过程中涉及的构象动态4,5,6,7。通过对蛋白质家族的序列、结构和动力学进行详细的规模化分析,常常可以获得新的见解。然而,这通常需要具备相当的生物信息学和计算机编程专业知识,并熟悉所研究的蛋白质系统。例如,Bio3D、ProDy 和 Maven 等软件包分别要求使用 R、Python 和 Matlab 进行编程8,9,10。相反,在线的结构柔性分析工具通常仅限于对单个结构进行研究11,12。在这方面的一个例外是最近开发的 WebNM@ 服务器,它允许比较由用户指定的多个预对齐结构经正常模式分析(NMA)得到的柔性模式13。然而,该服务器缺乏自动识别用于比较的结构、进行结构比对或在 NMA 之外进一步分析的功能。另一个近期的贡献是在线 PDBFlex 数据库,它提供了对序列同一性达到 95% 或更高的 PDB 结构的预计算分析14。然而,目前尚无法对更为多样化的结构集合进行分析。
我们此前已介绍过 Bio3D-web——一个易于使用的网络应用程序,用于分析蛋白质序列-结构-动力学之间的关系15。Bio3D-web 的独特之处在于,它在线提供了简便的一体化功能,可用于识别、比较和深入分析大型同源结构集合。本文介绍了一种利用 Bio3D-web 在线研究蛋白质序列-结构-动力学关系的详细实验方案。Bio3D-web 提供多种功能,以支持如图1所示并下文详述的数据分析五大主要步骤。这些步骤构成一个完整的工作流程,从输入查询序列或结构开始,经过多个层次的序列-结构-动力学分析,最终生成总结性报告。分析结果可通过浏览器内丰富的可视化和绘图工具即时获取,也可通过下载常用格式的结果文件获得。除了提供便捷易用的动态界面以探索参数和方法选择的影响外,Bio3D-web 还会将用户会话中的全部输入信息及后续图形结果记录下来,生成可在 PDF、DOC 和 HTML 格式之间共享且可重复的报告。用户会话可被保存,并在将来重新加载;完整的结果也可下载并在用户本地计算机上通过 Bio3D R 软件包进行进一步分析与解读。
Bio3D-web 由 Bio3D R 软件包驱动,用于分析生物分子结构、序列及分子模拟数据8,16。特别是,Bio3D 中用于刚性核心识别 8、结构叠合、主成分分析(PCA) 8 和集合态正常模式分析(eNMA)16 的算法构成了该应用的基础。我们还采用了依赖 pHMMER 17 来识别相关蛋白质结构的 Bio3D 协议,以及利用 MUSCLE 18 进行多序列比对的协议。结构与序列注释通过 Bio3D 工具从 RCSB PDB 19 和 PFAM 数据库 20 获取。Bio3D-web 可在我们的在线服务器上运行,也可在任何安装了 R 的计算机上本地部署。Bio3D-web 向所有用户开放,并依据 GPL-3 开源许可证免费提供,访问地址为:http://thegrantlab.org/bio3d/webapps
注意:一次典型的 Bio3D-web 会话包含五个连续且相互关联的步骤(示意图参见图1)。每个步骤在网页应用中均以连续的导航标签实现,分别为 SEARCH、ALIGN、FIT、PCA 和 eNMA。
1. 结构搜索与选择(SEARCH)
2. 多序列比对分析(ALIGN)
3. 结构拟合与分析(FIT)
4. 主成分分析(PCA)
5. 集合正则模式分析(eNMA)
腺苷酸激酶(Adk)是一种普遍存在的酶,其功能是维持细胞质核苷酸之间的平衡,这对于许多细胞过程至关重要。Adk 通过催化 ATP 向 AMP 转移磷酸基团的可逆反应发挥作用。该反应伴随着已被深入研究的限速构象转变3,21。本文中,我们利用 Bio3D-web 分析所有目前可获得的 Adk 结构,以揭示这些关键转变的详细特征和作用机制。
我们可以通过输入任意已知Adk结构的RCSB PDB编号,开始在Bio3D-web中对Adk进行分析。例如,在“SEARCH”选项卡的A面板中输入PDB ID 1AKE,将返回167个序列相似的结构,其中排名前26的结构会被自动选中用于进一步分析(见B面板)。C面板中的注释信息显示,这些被选中的结构均来源于E. coli,通过X射线衍射法解析,属于多种不同的空间群,分辨率范围为1.63至2.8 Å,并与多种不同的配体共结晶(包括无配体、AMP、ADP、MG以及抑制剂AP5)。请注意,通过点击C面板中的“Show/Hide Columns”选项,可显示更多注释详情。
在进入 ALIGN 标签页后执行多序列比对。ALIGN 标签页的第一个面板显示比对结果的摘要,提供序列行数(等同于 PDB 结构的数量)以及位点数的详细信息即 比对列),包括含空位和不含空位列的数量说明。首行右侧的图示为序列比对的示意图,其中灰色区域代表无空位的位置,白色区域代表比对中的空位。比对上方展示了序列保守性,红色区域表示高度保守的位置,白色区域表示保守性较低。请注意,本图中的序列根据左侧聚类树状图所提供的相似性进行排序。该标签页的第二个面板进一步支持基于所选 PDB 结构之间的两两序列相似性进行聚类分析,结果可显示为树状图或热图。默认显示表示聚类排列的树状图(或称树形图),树状图的 y 轴表示聚类之间的距离(以序列一致性为度量)。
进入“FIT”选项卡后,结构叠合将自动执行。在面板A中交互式显示的叠合结构表明存在一个相对刚性的核心区域(包含残基1-29、68-117和161-214;详见FIT选项卡底部的“可选核心区域及RMSD细节”面板)。两个更具变异性的核苷酸结合区域(残基30-67和118-167)也清晰可见(图2)。基于RMSD的聚类分析将这些结构分为两种不同的构象。
点击PCA标签可更清晰地展示这些结构区域在空间位移上的关系,这些位移有效闭合了结合的核苷酸物种所在的区域(图2B和图2C)。大多数结构处于“闭合”构象(图2C中蓝色部分),并与结合的配体或抑制剂相关;相比之下,更“开放”的构象则不结合核苷酸和抑制剂。这与大量关于Adk结构与动力学的研究结果一致,表明这些区域的开放构型有利于核苷酸结合,而闭合构象则有利于高效的磷酸基团转移并抑制有害的水解反应。值得注意的是,在该Adk结构集中,仅第一个主成分(PC)就捕捉到了97%的总均方位移,清晰且有力地描述了从开放到闭合的构象转变过程,以及各个残基在这一功能位移中的贡献(应用程序的C面板及图2)。
访问 NMA 选项卡并增加用于计算的结构数量(通过降低过滤相似结构的截断值)表明,与闭合态结构相比,开放态结构表现出增强的局部和全局动力学特征(图 2D 及应用程序中的面板 C)。比较单个结构的 PCA 与 NMA 结果(面板 D)显示,所有开放态结构的第一模式与 PC1 具有相对较高的重叠度(平均值为 0.37 ± 0.04);相比之下,闭合态结构的该值较低(平均值为 0.30 ± 0.01)。开放态结构的 RMSIP 值(0.62 ± 0.003)也高于闭合态结构(0.56 ± 0.008)。此外,重叠分析表明,开放态的第一模式与描述开放态和闭合态之间构象变化的模式具有良好一致性(面板 E)。基于 RMSIP 值的聚类分析再次显示出对开放态和闭合态结构的一致划分(面板 F)。
总体而言,这些结果表明腺苷酸激酶(Adk)存在两种主要的、截然不同的构象状态。这两种状态在核苷酸结合位点区域表现出不同的柔性,并且在核苷酸结合时发生集体的低频位移。

图 1: Bio3D-web 概览,附 PCA 和 NMA 选项卡的屏幕截图。 Bio3D-web 在 SEARCH 选项卡中接收用户提供的蛋白质结构或序列作为输入(1)。服务器提供一组相关结构列表,可供用户选择以进行进一步分析(2)。ALIGN 选项卡提供对在 SEARCH 选项卡中选定结构的序列比对与分析(3)。在 FIT 选项卡中,所有结构被叠加并以 3D 形式可视化,同时显示传统两两结构分析的结果(4)。在 PCA 选项卡中对结构集合执行主成分分析,以表征构象间的关系(5)。在 eNMA 选项卡中可对每个结构进行正常模式分析,以探究可用结构状态的动态趋势。请点击此处查看此图的放大版本。

图 2: 腺苷酸激酶的 Bio3D-web 分析结果。 (A)腺苷酸激酶的可用 PDB 结构叠加在已鉴定的不变核心上。结构根据“拟合”(FIT)选项卡中提供的基于 RMSD 的聚类结果进行着色。(B)“主成分分析”(PCA)选项卡可提供主成分的可视化,用于表征数据集中主要的构象变化。此处显示的是对应第一主成分的轨迹,以管状表示,展示蛋白质的大尺度闭合运动。(C)结构在构象图中投影到其前两个主成分上,展示构象可变性的低维表示。每个点(或结构)根据用户指定的标准着色,本例中为基于 PCA 的聚类结果。(D)“增强型正态模式分析”(eNMA)选项卡中的分析表明,与闭合态(蓝色)结构相比,开放态(红色)结构表现出增强的局部和全局动力学特性。请点击此处查看该图的放大版本。
Bio3D-web 可用于交互式地探索和绘制现有晶体结构中蛋白质的结构、动态及功能状态。此外,基于 NMA 和 PCA 的聚类结果,结合注释信息和基于序列的分析,对于选择代表性结构以进行更耗时的分析(如集合小分子对接或分子动力学模拟)尤其有帮助。因此,Bio3D-web 通过降低所需的技术门槛,促进了更广泛研究人员开展高级结构生物信息学分析。当前 Bio3D-web 的设计更注重简洁性,而非全面涵盖完整独立版 Bio3D 软件包中的所有分析方法。在许多情况下,研究人员可先使用 Bio3D-web 理解其感兴趣的蛋白家族或超家族中的总体趋势,进而指导后续更专门化的分析。因此,Bio3D-web 被设计为一种快速探索生物分子结构数据集并生成科学假说的工具。我们鼓励用户进一步深入分析其数据,为此我们在可重复性报告中提供了示例 Bio3D 代码,该报告同时保存了所有查询细节和分析结果。
在上述代表性实验方案中,我们展示了 Bio3D-web 揭示腺苷酸激酶(Adk)功能构象转变结构特征的能力。Bio3D-web 的其他应用还包括对用户上传的 PDB 结构进行结构与动力学分析。例如,用户可上传新的结构,甚至蛋白质序列用于分析。前文提到的分析步骤,尤其是弹性网络模型分析(eNMA)步骤,能够揭示蛋白质运动中的局部和全局趋势,其中协同运动具有功能意义。与无配体(apo)结构的比较还可揭示从非结合态到结合态构象转变的特征。更多针对不同蛋白质家族的应用实例可在线获取。
尽管所有蛋白质都是具有柔韧性和动态性的实体,但并非所有蛋白质在多种不同状态(例如 活性与非活性状态)下都有可用的原子分辨率结构。因此,我们对蛋白质结构空间的认识是有限的,从而通过 Bio3D-web 等工具获得的洞察也必然在某些蛋白质上受到限制。然而,随着当前技术的进步以及结构基因组学新计划的推进,本文所介绍的方案将日益成为揭示重要结构-功能关系的重要途径。一个关键步骤是在分析进化上较远源的蛋白质时尤为重要的问题,即 ALIGN 标签页中可能出现的比对错误。当序列相似性低于 30% 时,比对错误不可避免,用户在此类情况下必须仔细检查并修正 ALIGN 标签页中的序列比对。比对错误可能导致 FIT 标签页中结构叠加结果不正确,并掩盖后续主成分分析(PCA)中最相关的构象变化。此外,用户应注意所选 PDB 结构中是否存在残基缺失,因为在当前实现中,PCA 仅能对所有结构均具有对应碳α原子解析的蛋白质残基进行。因此,若某个选定的 PDB 结构在蛋白质的特定区域中存在未解析的残基,则该区域将被排除在 PCA 之外。
Bio3D-web 目前仅限于分析单链 PDB 结构。因此,无法使用当前协议探索发生在四级结构水平上的功能运动。尽管我们目前正在开发新算法以在 Bio3D-web 中包含此类分析,但目前唯一可行的选择是通过传统的 Bio3D 使用方式实现。
Bio3D-web 是唯一一款能够在线查询和识别结构集合、解读其序列与结构变异模式,并通过分析和预测其结构可塑性来提取机制信息的应用程序。目前已有大量分子可视化工具和在线服务器,可帮助研究人员探索和分析单个生物分子结构。然而,针对大规模异源蛋白家族的序列、结构与动力学分析工具,通常需要较高的计算技术背景,且往往仅对具备相关编程技能的用户开放。例如,Bio3D 软件包需要掌握 R 语言8,ProDy 需要 Python 编程基础,而 Maven 则要求具备 Matlab 使用经验9,10。相比之下,Bio3D-web 无需任何编程知识,从而显著提升了高级比较性序列、结构与动力学分析的可及性,并降低了使用门槛。此外,Bio3D-web 服务还集成了分子结构的准备、整理、注释和清理等常规分析前所需的处理步骤。同时,依托服务器端的计算实例,用户可通过任意现代网页浏览器启动并控制对大量结构的分析,从而摆脱了本地需具备高性能计算资源的限制。
Bio3D-web 的开放开发正在进行中(参见 https://bitbucket.org/Grantlab/bio3d)。我们持续添加新的分析功能并改进现有方法。未来的发展重点将包括基于距离矩阵的主成分分析(PCA)和扭转角主成分分析(torsional PCA)、引入系统发育成分的更全面的序列保守性分析方法、集合结合位点识别,以及跨蛋白质家族的动态网络分析新方法。在此意义上,当前的网络应用为许多其他协作式结构生物信息学分析工作流提供了起点,支持在用户自定义的实验结构集上实现可重复和可共享的分析步骤。我们还计划未来支持PDB结构中除不对称单元中的单条或多条链外的生物大分子组装体(biological unit)坐标集。其他新增功能将包括增强的协作工作区保存与加载功能,以及撤销操作的可能性。
Bio3D-web 是一个用于生物分子结构数据交互式分析的在线应用程序。Bio3D-web 可在任何现代网络浏览器上运行,提供以下功能:(1)根据用户设定的相似性阈值,识别相关的蛋白质结构集合;(2)进行多序列比对和结构叠合;(3)序列与结构保守性分析;(4)通过主成分分析绘制构象间关系图;以及(5)通过集合态正则模式分析比较预测的内部动力学特性。该集成化功能为研究蛋白质家族及超家族中的序列-结构-动力学关系提供了完整的工作流程。除了提供便捷、易于使用的动态界面以探索参数和方法选择的影响外,Bio3D-web 还会完整记录用户的输入内容及会话过程中生成的图形结果。这使得用户能够轻松共享并复现生成其结果的分析步骤序列。Bio3D-web 完全使用 R 语言实现,基于 Bio3D 和 Shiny R 软件包开发。用户可通过我们的在线服务器使用该程序,也可在任何安装了 R 的计算机上本地安装运行。这包括在本地服务器上部署,以建立可定制的多用户实例,并访问制药行业常用的专属结构数据集。完整的源代码和详尽的文档依据 GPL-3 开源许可证提供,获取地址:http://thegrantlab.org/bio3d/webapps
作者声明不存在任何竞争性财务利益。
我们感谢 Guido Scarabelli 博士和 Hongyang Li 在开发过程中进行的大量测试,同时也感谢 Bio3D 用户社区以及卑尔根大学结构生物信息学研讨会的参与者所提供的反馈和意见,这些反馈和意见极大地改进了本应用程序。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Bio3D-web | |||
| 网站 | http://thegrantlab.org/bio3d-web/ | ||
| 系统要求 | 网页浏览器 |