方法文章

通过化学交联质谱法进行四级结构建模:扩展 TX-MS Jupyter 报告

2.5K 次观看

DOI:

10.3791/60311

2021年10月20日

本文内容

摘要

靶向交联质谱技术利用最多三种不同采集方法获得的质谱数据,构建蛋白质四级结构模型。当在 Cheetah-MS 网络服务器上以简化工作流程执行时,结果将以 Jupyter Notebook 形式呈现。本文演示了如何扩展 Jupyter Notebook 以实现更深入分析的技术细节。

摘要

蛋白质-蛋白质相互作用的研究具有挑战性,但能为生物系统的功能机制提供重要见解。靶向交联质谱法(TX-MS)结合了蛋白质四级结构建模与化学交联质谱技术,能够利用来自复杂且未经分级处理的样品数据构建高精度的结构模型。该方法克服了蛋白质复合物结构分析中的一个主要障碍,即不再需要大量纯化目标蛋白质。为此开发的 Cheetah-MS 网络服务器,旨在使该实验流程的简化版本更易于被科研社区使用。Cheetah-MS 可基于串联质谱(MS/MS)数据生成 Jupyter Notebook,其中包含以图形化方式呈现的关键分析结果汇总报告。通过扩展该 Jupyter Notebook,研究人员可获得更深入的分析洞见,从而更好地理解结构模型及其所依据的质谱数据。本文介绍的技术方案展示了若干最常见的扩展功能,并说明了可从中获取的信息类型。这些扩展模块有助于分析串联质谱(MS/MS)采集数据,以及已鉴定交联肽段(XLs)对所报告的四级结构模型的整体影响。此类分析结果可通过嵌入 Notebook 的 NGLView 工具直观展示于结构模型中。

引言

蛋白质-蛋白质相互作用是生物系统结构与功能的基础。获得蛋白质的四级结构有助于揭示两个或多个蛋白质如何相互作用形成高级结构。然而,获取四级结构仍然具有挑战性;这一点体现在蛋白质数据库(Protein DataBank, PDB)中包含多个多肽链的条目数量相对较少1 。蛋白质-蛋白质相互作用可通过X射线晶体学、核磁共振(NMR)和冷冻电镜(cryo-EM)等技术进行研究,但在适用这些方法的条件下获得足量纯化蛋白质可能耗时较长。

化学交联质谱技术的发展旨在以更少的样品制备限制来获取蛋白质-蛋白质相互作用的实验数据,因为质谱技术可用于获取任意复杂样品的数据2,3,4,5,6,7,8,9。然而,由于数据分析具有组合性特征,且交联肽段数量相对较少,因此样品在分析前需要进行分级分离。为解决这一不足,我们开发了TX-MS方法,该方法将计算建模与化学交联质谱技术相结合10。TX-MS可用于任意复杂程度的样品,且相较于以往方法显著提高了灵敏度10。其实现方式是将与特定蛋白质-蛋白质相互作用相关的所有数据作为一个整体进行评分,而非独立解析每一张质谱图谱。TX-MS还最多采用三种不同的质谱采集模式:高分辨率MS1(hrMS1)、数据依赖性采集(DDA)和数据非依赖性采集(DIA),从而通过整合多种观测结果进一步提高交联肽段的鉴定机会。TX-MS的计算工作流程较为复杂,原因有三:第一,该流程依赖于多个质谱分析软件程序11,12,13 来构建蛋白质结构模型14,15;第二,数据量可能非常庞大;第三,建模步骤可能消耗大量的计算机处理资源。

因此,TX-MS 最好通过 Cheetah-MS 网络服务器16 作为自动化、简化的计算流程来使用,该服务器运行于大型计算基础设施(如计算机云或集群)之上。为了便于结果的解读,我们开发了一个交互式 Jupyter Notebook17。本文将演示如何扩展 Jupyter Notebook 报告,以对特定结果进行更深入的分析。

方案

1. 在 https://txms.org 提交工作流程。

  1. 访问 https://txms.org 并点击 "使用 Cheetah-MS。"
  2. 提交工作流程时,您需要提供两个 PDB 文件和一个 MS/MS mzML 或 MGF 文件。您也可以点击 "加载示例数据"以查看该工作流程的演示版本。
    注意:有关如何提交任务的详细信息,请参阅该网络服务器的手册页面。该服务器支持多种不可裂解交联剂、最多 12 种翻译后修饰(PTMs),以及与计算建模和质谱数据分析相关的选项。提交页面上还设计有小型帮助按钮,用于显示各个选项的更多信息。

2. 运行 Cheetah-MS。

注意:使用 ProteoWizard MSConvert 软件将供应商特定的格式转换为 mzML 或 MGF19

  1. 将质谱数据上传至 https://txms.org。然后点击 "选择文件",并选择质谱数据文件,文件格式必须为 mzML 或 MGF18
    注意:示例数据可在 https://txms.org 获取,这些数据也可通过 zenodo.org 访问,DOI 10.5281/zenodo.3361621。
  2. 上传两个 PDB 文件至 https://txms.org。点击 "选择文件",选择要上传的 PDB 文件。
    注意:若无实验测定的结构,可使用 SWISS-MODEL20 (当存在同源结构时),或使用 trRosetta21,22 或 Robetta23,24 等在线服务器进行从头(de novo)结构预测来构建模型。
  3. 提交新工作流程。点击 "提交" 以获取作业标识标签。随后,使用该标签在表单中导航至结果部分。
    注意:结果计算需要一定时间,请耐心等待工作流程完成,并保存作业标识标签以便返回结果页面。计算在远程计算基础设施上执行。如需在本地运行 TX-MS,请参考 Hauri 等人10 的研究。
  4. 使用在线查看器检查 Jupyter Notebook 报告。然后,使用作业标识标签在结果部分中向下滚动至 "报告"。

3. 安装 JupyterHub。

  1. 请按照以下网址的说明安装 Docker: https://docs.docker.com/install/。
  2. 下载带有 Jupyter openBIS25 扩展的 JupyterHub Docker 容器。通用命令为 "docker pull malmstroem/jove:latest",但在其他平台上可能有所不同。
    注意:有关如何下载容器的一般性说明,请参阅 https://www.docker.com/get-started。也可从 zenodo.org 下载该容器,DOI 10.5281/zenodo.3361621。
    注意:Jupyter openBIS 扩展的源代码可在此处获取: https://pypi.org/project/jupyter-openbis-extension/。
  3. 启动 Docker 容器:docker run -p 8178:8000 malmstroem/jove:latest。
    注意:JupyterHub 默认使用的端口为 8000。该端口可配置,若更改端口,则上述命令需相应调整。8178 端口为任意选择,可更改。下文提供的示例 URL 也需相应调整。
  4. 访问以下地址:http://127.0.0.1:8178。使用用户名 "user" 和密码 "user" 登录。
    注意:地址 http://127.0.0.1 表示 Docker 容器在本地计算机上运行。若 Docker 容器在服务器上运行,请使用服务器的 IP 地址或 URL(例如 https://example.com)。该 Docker 容器基于 Ubuntu Bionic 18.04、JupyterHub 0.9.6 和 Jupyter openBIS 扩展 0.2。可在其他操作系统中安装,但尚未经过测试。

4. 下载报告。

  1. 点击页面右上角附近的菜单中的新建| Python 3 创建一个新的笔记本。这将打开一个名为未命名(或类似名称)的新标签页。
  2. 在 Jupyter 工具菜单中点击"配置 openBIS 连接"。
  3. 填写名称:txms;URL: https://txms.org;用户:guest;密码:guestpasswd。
  4. 点击"连接。"
  5. 选择新建立的连接,然后点击"选择连接。"
  6. 搜索报告模板(例如 /CHEETAH/WF70),然后点击下载
    注意:您需要根据在 Cheetah-MS 网络服务器上运行任务后获得的结果和报告,调整相应的报告模板。
  7. 通过点击单元格 | 运行全部重新运行报告。

5. 扩展报告。

  1. 在底部添加一个新单元格:单元格 | 在下方插入
  2. 输入所需的代码。示例请参见下方的代表性结果部分。
  3. 按下"Shift-Enter"执行该单元格。

结果

交联质谱(TX-MS)通过质谱衍生的实验约束提供结构信息。其原理是将不同类型的质谱数据采集方式与计算建模相结合。因此,分别解析每种质谱数据并可视化输出结构具有重要意义。补充数据 包含一个示例笔记本,可用于解析作为 TX-MS 输出结果的 DDA 和 DIA 数据。用户可选择感兴趣的交联肽段(XL)。运行该笔记本后,将显示该交联肽段的 MS2 谱图,其中不同颜色有助于区分与第一条肽段、第二条肽段以及组合碎片离子相关的碎片信号。此外,还可利用嵌入 Jupyter Notebook 中的 NGLView 组件将交联肽段映射到结构上。

该笔记本中的另一个单元格可帮助用户解析和可视化DIA数据。然而,由于分析后的数据需要以正确的格式进行准备,因此DIA数据的可视化更为困难。

图1展示了M1与白蛋白的示例结构,其中已将主要交联位点映射到该结构上。通过解析hrMS1、DDA和DIA数据,TX-MS获得了所有交联位点,而RosettaDock流程则提供了相应的计算模型。

由于本报告为 Jupyter Notebook,可在新的 Notebook 单元格中添加任意有效的 Python 代码。例如,以下代码将对 MS2 计数绘制直方图,以显示每个交联位点在原始数据中的支持程度。
import seaborn as sns
sns.distplot(ms2['count']);

figure-results-1
图1:结构模型 Streptococcus pyogenes M1 蛋白质及人血清白蛋白,其交联位点在结构上已定位。 M1 蛋白以灰色显示,构成同源二聚体。六个白蛋白分子以不同深浅的蓝色成对呈现。交联位点及距离以红色线条表示,数值以黑色文字标注。 请点击此处查看此图的放大版本。

补充文件。Jupyter notebook 数据。 请点击此处下载该文件。

讨论

现代计算工作流程通常十分复杂,涉及来自多个不同供应商的多种工具、复杂的相互依赖关系、庞大的数据量以及多方面的结果。因此,准确记录获得某一结果所需的所有步骤变得越来越困难,这使得重现特定结果也极具挑战性。在此,我们展示了一种通用策略,该策略结合了自动化工作流程的便捷性与生成通用报告的能力,同时具备以可重现方式自定义报告的灵活性。

要使该实验方案成功实施,需满足三个条件:首先,所选用于分析的蛋白质必须以某种方式相互作用,使得化学交联实验能够产生足够高浓度的交联产物,从而被质谱仪检测到;不同的质谱仪具有不同的检测灵敏度,且检测效果还依赖于采集方案以及交联试剂的选择。当前版本的 TX-MS 方案仅支持 DSS,即一种赖氨酸-赖氨酸同源双功能交联试剂。这一限制主要源于机器学习步骤可能需要针对其他试剂进行调整。该限制已在 Cheetah-MS 网络服务器中得到改进,可额外支持两种交联试剂,但这三种试剂均为不可裂解型交联试剂。其次,两个相互作用的蛋白质必须具有已通过实验测定的结构,或可通过同源建模技术或从头建模(de novo)技术进行建模。并非所有蛋白质都可成功建模,但随着软件性能的提升以及蛋白质数据库(PDB)中实验结构的持续积累,可建模的蛋白质数量正在不断增加。第三,相互作用的蛋白质在其结合态与非结合态下应保持足够高的结构相似性,以便 TX-MS 和 Cheetah-MS 所采用的分子对接算法能够生成足够高质量的四级结构,从而支持后续评分。这一要求相对模糊,因为可接受的质量标准高度依赖于具体体系:通常而言,结构已知的小分子蛋白质比结构未知的大分子蛋白质更容易进行有效比对。

如果结果为阴性,首先检查 TX-MS 是否检测到分子内交联,即同一多肽链内残基之间的交联。若未发现此类交联,最可能的原因是样品制备或数据采集过程中出现了问题。如果多个距离约束条件均不支持所构建的模型,应目视检查模型,确保其构象得到交联残基的支持。若无法在不破坏至少一个交联的情况下明显地旋转其中一个互作蛋白,则提示模型可能合理。若存在超过所用交联试剂允许距离的交联,可尝试通过整合交联数据来优化互作蛋白的建模。

只要所选软件的灵敏度与TX-MS相当,即可使用其他软件应用程序获得等效结果。例如,RosettaDock、HADDOCK等软件均有在线版本。此外,还可通过xQuest/xProphet5,6、plink7和SIM-XL26分析化学交联数据。

我们正在持续将 TX-MS 和 Cheetah-MS 应用于新的项目27,28,29,从而不断改进这些方法生成的报告,以实现对结果更详细的分析,同时不增加报告的篇幅。

披露

作者无任何利益冲突需要披露。

致谢

本工作由克努特和爱丽丝·瓦伦贝里基金会(资助编号:2016.0023)和瑞士国家科学基金会(资助编号:P2ZHP3_191289)资助。此外,我们感谢苏黎世大学S3IT提供的计算基础设施和技术支持。

材料

本文使用的材料清单
姓名公司目录编号评论
目标蛋白的两个 Protein DataBank 文件。N/AN/A示例文件可在 txms.org 和 zenodo.org 获取,DOI 10.5281/zenodo.3361621
在目标蛋白发生交联的样品上获得的 mzML 数据文件。N/AN/A示例文件可在 txms.org 或 zenodo.org 获取,DOI 10.5281/zenodo.3361621

参考文献

  1. Berman, H. M., et al. The Protein Data Bank. Acta Crystallographica Section D: Biological Crystallography. 58 (6), 899-907 (2002).
  2. Herzog, F., et al. Structural Probing of a Protein Phosphatase 2A Network by Chemical Cross-Linking and Mass Spectrometry. Science. 337 (6100), 1348-1352 (2012).
  3. Hoopmann, M. R., et al. Kojak: efficient analysis of chemically cross-linked protein complexes. Journal of Proteome Research. 14 (5), 2190-2198 (2015).
  4. Seebacher, J., et al. Protein cross-linking analysis using mass spectrometry, isotope-coded cross-linkers, and integrated computational data processing. Journal of Proteome Research. 5 (9), 2270-2282 (2006).
  5. Rinner, O., et al. Identification of cross-linked peptides from large sequence databases. Nature Methods. 5 (4), 315-318 (2008).
  6. Walzthoeni, T., et al. False discovery rate estimation for cross-linked peptides identified by mass spectrometry. Nature Methods. 9 (9), 901-903 (2012).
  7. Yang, B., et al. Identification of cross-linked peptides from complex samples. Nature Methods. 9 (9), 904-906 (2012).
  8. Chu, F., Baker, P. R., Burlingame, A. L., Chalkley, R. J. Finding Chimeras: a Bioinformatics Strategy for Identification of Cross-linked Peptides. Molecular & Cellular Proteomics. 9 (1), 25-31 (2010).
  9. Holding, A. N., Lamers, M. H., Stephens, E., Skehel, J. M. Hekate: Software Suite for the Mass Spectrometric Analysis and Three-Dimensional Visualization of Cross-Linked Protein Samples. Journal of Proteome Research. 12 (12), 5923-5933 (2013).
  10. Hauri, S., et al. Rapid determination of quaternary protein structures in complex biological samples. Nature Communications. 10 (1), 192(2019).
  11. Röst, H. L., et al. OpenSWATH enables automated, targeted analysis of data-independent acquisition MS data. Nature Biotechnology. 32 (3), 219-223 (2014).
  12. Röst, H. L., et al. OpenMS: a flexible open-source software platform for mass spectrometry data analysis. Nature Methods. 13 (9), 741-748 (2016).
  13. Quandt, A., et al. Using synthetic peptides to benchmark peptide identification software and search parameters for MS/MS data analysis. EuPA Open Proteomics. 5, 21-31 (2014).
  14. Bradley, P., et al. Free modeling with Rosetta in CASP6. Proteins: Structure, Function, and Bioinformatics. 61 (S7), 128-134 (2005).
  15. Gray, J. J. High-resolution protein-protein docking. Current Opinion in Structural Biology. 16 (2), 183-193 (2006).
  16. Khakzad, H., et al. Cheetah-MS: a web server to model protein complexes using tandem cross-linking mass spectrometry data. Bioinformatics. , (2021).
  17. Malmström, L. Chapter 15: Computational Proteomics with Jupyter and Python. Methods in Molecular Biology. 15, Clifton, N.J. 237-248 (1977).
  18. Martens, L., et al. mzML--a community standard for mass spectrometry data. Molecular & Cellular Proteomics. 10 (1), (2011).
  19. Chambers, M. C., et al. A cross-platform toolkit for mass spectrometry and proteomics. Nature Biotechnology. 30 (10), 918-920 (2012).
  20. Waterhouse, A., et al. SWISS-MODEL: homology modelling of protein structures and complexes. Nucleic Acids Research. 46 (W1), W296-W303 (2018).
  21. Yang, J., et al. Improved protein structure prediction using predicted interresidue orientations. Proceedings of the National Academy of Sciences. 117 (3), 1496-1503 (2020).
  22. Koehler Leman, J., et al. Macromolecular modeling and design in Rosetta: recent methods and frameworks. Nature Methods. 17 (7), 665-680 (2020).
  23. Chivian, D., et al. Prediction of CASP6 structures using automated Robetta protocols. Proteins: Structure, Function, and Bioinformatics. 61 (S7), 157-166 (2005).
  24. Chivian, D., et al. Automated prediction of CASP-5 structures using the Robetta server. Proteins: Structure, Function, and Bioinformatics. 53 (S6), 524-533 (2003).
  25. Bauch, A., et al. openBIS: a flexible framework for managing and analyzing complex data in biology research. BMC Bioinformatics. 12, 468(2011).
  26. Lima, D. B., et al. SIM-XL: A powerful and user-friendly tool for peptide cross-linking analysis. Journal of Proteomics. 129, 51-55 (2015).
  27. Happonen, L., et al. A quantitative Streptococcus pyogenes-human protein-protein interaction map reveals localization of opsonizing antibodies. Nature Communications. 10, 2727(2019).
  28. Khakzad, H., et al. Structural determination of Streptococcus pyogenes M1 protein interactions with human immunoglobulin G using integrative structural biology. PLOS Computational Biology. 17 (1), E1008169(2021).
  29. Khakzad, H., et al. In vivo cross-linking MS of the complement system MAC assembled on live Gram-positive bacteria. Frontiers in Genetics. 11, (2020).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Cheetah MS Jupyter Notebook NGLView RosettaDock

相关文章