靶向交联质谱技术利用最多三种不同采集方法获得的质谱数据,构建蛋白质四级结构模型。当在 Cheetah-MS 网络服务器上以简化工作流程执行时,结果将以 Jupyter Notebook 形式呈现。本文演示了如何扩展 Jupyter Notebook 以实现更深入分析的技术细节。
靶向交联质谱技术利用最多三种不同采集方法获得的质谱数据,构建蛋白质四级结构模型。当在 Cheetah-MS 网络服务器上以简化工作流程执行时,结果将以 Jupyter Notebook 形式呈现。本文演示了如何扩展 Jupyter Notebook 以实现更深入分析的技术细节。
蛋白质-蛋白质相互作用的研究具有挑战性,但能为生物系统的功能机制提供重要见解。靶向交联质谱法(TX-MS)结合了蛋白质四级结构建模与化学交联质谱技术,能够利用来自复杂且未经分级处理的样品数据构建高精度的结构模型。该方法克服了蛋白质复合物结构分析中的一个主要障碍,即不再需要大量纯化目标蛋白质。为此开发的 Cheetah-MS 网络服务器,旨在使该实验流程的简化版本更易于被科研社区使用。Cheetah-MS 可基于串联质谱(MS/MS)数据生成 Jupyter Notebook,其中包含以图形化方式呈现的关键分析结果汇总报告。通过扩展该 Jupyter Notebook,研究人员可获得更深入的分析洞见,从而更好地理解结构模型及其所依据的质谱数据。本文介绍的技术方案展示了若干最常见的扩展功能,并说明了可从中获取的信息类型。这些扩展模块有助于分析串联质谱(MS/MS)采集数据,以及已鉴定交联肽段(XLs)对所报告的四级结构模型的整体影响。此类分析结果可通过嵌入 Notebook 的 NGLView 工具直观展示于结构模型中。
蛋白质-蛋白质相互作用是生物系统结构与功能的基础。获得蛋白质的四级结构有助于揭示两个或多个蛋白质如何相互作用形成高级结构。然而,获取四级结构仍然具有挑战性;这一点体现在蛋白质数据库(Protein DataBank, PDB)中包含多个多肽链的条目数量相对较少1 。蛋白质-蛋白质相互作用可通过X射线晶体学、核磁共振(NMR)和冷冻电镜(cryo-EM)等技术进行研究,但在适用这些方法的条件下获得足量纯化蛋白质可能耗时较长。
化学交联质谱技术的发展旨在以更少的样品制备限制来获取蛋白质-蛋白质相互作用的实验数据,因为质谱技术可用于获取任意复杂样品的数据2,3,4,5,6,7,8,9。然而,由于数据分析具有组合性特征,且交联肽段数量相对较少,因此样品在分析前需要进行分级分离。为解决这一不足,我们开发了TX-MS方法,该方法将计算建模与化学交联质谱技术相结合10。TX-MS可用于任意复杂程度的样品,且相较于以往方法显著提高了灵敏度10。其实现方式是将与特定蛋白质-蛋白质相互作用相关的所有数据作为一个整体进行评分,而非独立解析每一张质谱图谱。TX-MS还最多采用三种不同的质谱采集模式:高分辨率MS1(hrMS1)、数据依赖性采集(DDA)和数据非依赖性采集(DIA),从而通过整合多种观测结果进一步提高交联肽段的鉴定机会。TX-MS的计算工作流程较为复杂,原因有三:第一,该流程依赖于多个质谱分析软件程序11,12,13 来构建蛋白质结构模型14,15;第二,数据量可能非常庞大;第三,建模步骤可能消耗大量的计算机处理资源。
因此,TX-MS 最好通过 Cheetah-MS 网络服务器16 作为自动化、简化的计算流程来使用,该服务器运行于大型计算基础设施(如计算机云或集群)之上。为了便于结果的解读,我们开发了一个交互式 Jupyter Notebook17。本文将演示如何扩展 Jupyter Notebook 报告,以对特定结果进行更深入的分析。
1. 在 https://txms.org 提交工作流程。
2. 运行 Cheetah-MS。
注意:使用 ProteoWizard MSConvert 软件将供应商特定的格式转换为 mzML 或 MGF19。
3. 安装 JupyterHub。
4. 下载报告。
5. 扩展报告。
交联质谱(TX-MS)通过质谱衍生的实验约束提供结构信息。其原理是将不同类型的质谱数据采集方式与计算建模相结合。因此,分别解析每种质谱数据并可视化输出结构具有重要意义。补充数据 1 包含一个示例笔记本,可用于解析作为 TX-MS 输出结果的 DDA 和 DIA 数据。用户可选择感兴趣的交联肽段(XL)。运行该笔记本后,将显示该交联肽段的 MS2 谱图,其中不同颜色有助于区分与第一条肽段、第二条肽段以及组合碎片离子相关的碎片信号。此外,还可利用嵌入 Jupyter Notebook 中的 NGLView 组件将交联肽段映射到结构上。
该笔记本中的另一个单元格可帮助用户解析和可视化DIA数据。然而,由于分析后的数据需要以正确的格式进行准备,因此DIA数据的可视化更为困难。
图1展示了M1与白蛋白的示例结构,其中已将主要交联位点映射到该结构上。通过解析hrMS1、DDA和DIA数据,TX-MS获得了所有交联位点,而RosettaDock流程则提供了相应的计算模型。
由于本报告为 Jupyter Notebook,可在新的 Notebook 单元格中添加任意有效的 Python 代码。例如,以下代码将对 MS2 计数绘制直方图,以显示每个交联位点在原始数据中的支持程度。
import seaborn as sns
sns.distplot(ms2['count']);

图1:结构模型 Streptococcus pyogenes M1 蛋白质及人血清白蛋白,其交联位点在结构上已定位。 M1 蛋白以灰色显示,构成同源二聚体。六个白蛋白分子以不同深浅的蓝色成对呈现。交联位点及距离以红色线条表示,数值以黑色文字标注。 请点击此处查看此图的放大版本。
补充文件。Jupyter notebook 数据。 请点击此处下载该文件。
现代计算工作流程通常十分复杂,涉及来自多个不同供应商的多种工具、复杂的相互依赖关系、庞大的数据量以及多方面的结果。因此,准确记录获得某一结果所需的所有步骤变得越来越困难,这使得重现特定结果也极具挑战性。在此,我们展示了一种通用策略,该策略结合了自动化工作流程的便捷性与生成通用报告的能力,同时具备以可重现方式自定义报告的灵活性。
要使该实验方案成功实施,需满足三个条件:首先,所选用于分析的蛋白质必须以某种方式相互作用,使得化学交联实验能够产生足够高浓度的交联产物,从而被质谱仪检测到;不同的质谱仪具有不同的检测灵敏度,且检测效果还依赖于采集方案以及交联试剂的选择。当前版本的 TX-MS 方案仅支持 DSS,即一种赖氨酸-赖氨酸同源双功能交联试剂。这一限制主要源于机器学习步骤可能需要针对其他试剂进行调整。该限制已在 Cheetah-MS 网络服务器中得到改进,可额外支持两种交联试剂,但这三种试剂均为不可裂解型交联试剂。其次,两个相互作用的蛋白质必须具有已通过实验测定的结构,或可通过同源建模技术或从头建模(de novo)技术进行建模。并非所有蛋白质都可成功建模,但随着软件性能的提升以及蛋白质数据库(PDB)中实验结构的持续积累,可建模的蛋白质数量正在不断增加。第三,相互作用的蛋白质在其结合态与非结合态下应保持足够高的结构相似性,以便 TX-MS 和 Cheetah-MS 所采用的分子对接算法能够生成足够高质量的四级结构,从而支持后续评分。这一要求相对模糊,因为可接受的质量标准高度依赖于具体体系:通常而言,结构已知的小分子蛋白质比结构未知的大分子蛋白质更容易进行有效比对。
如果结果为阴性,首先检查 TX-MS 是否检测到分子内交联,即同一多肽链内残基之间的交联。若未发现此类交联,最可能的原因是样品制备或数据采集过程中出现了问题。如果多个距离约束条件均不支持所构建的模型,应目视检查模型,确保其构象得到交联残基的支持。若无法在不破坏至少一个交联的情况下明显地旋转其中一个互作蛋白,则提示模型可能合理。若存在超过所用交联试剂允许距离的交联,可尝试通过整合交联数据来优化互作蛋白的建模。
只要所选软件的灵敏度与TX-MS相当,即可使用其他软件应用程序获得等效结果。例如,RosettaDock、HADDOCK等软件均有在线版本。此外,还可通过xQuest/xProphet5,6、plink7和SIM-XL26分析化学交联数据。
我们正在持续将 TX-MS 和 Cheetah-MS 应用于新的项目27,28,29,从而不断改进这些方法生成的报告,以实现对结果更详细的分析,同时不增加报告的篇幅。
作者无任何利益冲突需要披露。
本工作由克努特和爱丽丝·瓦伦贝里基金会(资助编号:2016.0023)和瑞士国家科学基金会(资助编号:P2ZHP3_191289)资助。此外,我们感谢苏黎世大学S3IT提供的计算基础设施和技术支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 目标蛋白的两个 Protein DataBank 文件。 | N/A | N/A | 示例文件可在 txms.org 和 zenodo.org 获取,DOI 10.5281/zenodo.3361621 |
| 在目标蛋白发生交联的样品上获得的 mzML 数据文件。 | N/A | N/A | 示例文件可在 txms.org 或 zenodo.org 获取,DOI 10.5281/zenodo.3361621 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可