我们介绍一种用于定量蛋白质组学数据分析和可视化网络分析的系统生物学工具 JUMPn,并提供了详细的操作流程,包括数据预处理、共表达聚类、通路富集分析以及蛋白质-蛋白质相互作用网络分析。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
我们介绍一种用于定量蛋白质组学数据分析和可视化网络分析的系统生物学工具 JUMPn,并提供了详细的操作流程,包括数据预处理、共表达聚类、通路富集分析以及蛋白质-蛋白质相互作用网络分析。
随着基于质谱的蛋白质组学技术的最新进展,对数百个蛋白质组进行深度分析已变得越来越可行。然而,从这些宝贵的數據集中获得生物学见解仍具挑战性。本文介绍了一种基于系统生物学的软件 JUMPn 及其相关实验方案,该方案可将蛋白质组按样本间的蛋白质共表达聚类以及通过模块(例如蛋白质复合物)连接的蛋白质-蛋白质相互作用(PPI)网络进行组织。JUMPn 软件基于 R/Shiny 平台,集成了数据可视化功能和用户友好的界面,可简化共表达聚类、通路富集分析和 PPI 模块检测的分析流程。本实验方案的主要步骤包括 JUMPn 软件的安装、差异表达蛋白质或(失调)蛋白质组的定义、有意义的共表达聚类和 PPI 模块的确定,以及结果的可视化。尽管本方案以基于同重标记的蛋白质组谱图为例进行演示,但 JUMPn 普遍适用于多种定量数据集(例如,无标记蛋白质组学)。因此,JUMPn 软件及其实验方案为定量蛋白质组学中的生物学解释提供了强有力的工具。
基于质谱的鸟枪法蛋白质组学已成为分析复杂样品蛋白质组多样性的关键方法1。随着质谱仪器技术2,3、色谱技术4,5、离子淌度检测6、采集方法(数据非依赖型7和数据依赖型采集8)、定量策略(多重等重肽段标记法,例如 TMT9,10,以及无标记定量11,12)以及数据分析方法/软件开发13,14,15,16,17,18的最新进展,对整个蛋白质组(例如,超过 10,000 种蛋白质)进行定量现已常规实现19,20,21。然而,如何从如此深度的定量数据集中获得机制性见解仍然具有挑战性22。早期对这些数据集的研究主要依赖于对数据中各个元素的单独注释,将每个组分(蛋白质)视为独立存在。然而,生物系统及其行为无法仅通过分析单个组分来完全解释23。因此,将定量的生物分子置于相互作用网络背景下的系统性方法,对于理解复杂系统及其相关过程(如胚胎发育、免疫应答以及人类疾病的发病机制)至关重要24。
基于网络的系统生物学已成为分析大规模定量蛋白质组学数据的强大范式25,26,27,28,29,30,31,32,33。从概念上讲,哺乳动物细胞等复杂系统可被建模为分层网络34,35,其中整个系统以层级方式表示:首先由若干大型组分构成,每个大型组分再通过更小的子系统进行迭代建模。从技术上讲,蛋白质组动态结构可通过共表达蛋白簇的互连网络(因为共表达的基因/蛋白质通常具有相似的生物学功能或调控机制36)以及物理相互作用的蛋白质-蛋白质相互作用(PPI)模块37来呈现。最近的一个例子中25,我们生成了T细胞活化过程中全蛋白质组和磷酸化蛋白质组的时间动态谱,并结合蛋白质相互作用信息,利用整合的共表达网络识别介导T细胞脱离静息状态的功能模块。多个与生物能量相关的模块被识别并经实验验证(例如线粒体核糖体和复合物IV模块25,以及一碳代谢模块38)。在另一项研究中26,我们进一步扩展该方法用于研究阿尔茨海默病的发病机制,并成功优先筛选出与疾病进展相关的蛋白质模块及分子。重要的是,我们的许多无偏倚发现已通过独立的患者队列26,29和/或疾病小鼠模型26得到验证。这些实例展示了系统生物学方法在结合定量蛋白质组学及其他组学整合数据以解析分子机制方面的强大能力。
本文介绍了 JUMPn,这是一款采用基于网络的系统生物学方法分析定量蛋白质组学数据的简化软件。JUMPn 是成熟的 JUMP 蛋白质组学软件套件的下游组成部分13,14,39,旨在通过系统生物学方法,填补从单个蛋白质定量结果到具有生物学意义的通路和蛋白质模块之间的分析空白。JUMPn 以差异表达(或变异性最大)蛋白质的定量矩阵作为输入,将蛋白质组组织为分层的蛋白质聚类层级结构,这些聚类在不同样本中共同表达,并形成紧密连接的蛋白质-蛋白质相互作用(PPI)模块(例如蛋白质复合物),并通过富集分析利用公共通路数据库对这些模块进行功能注释(图1)。JUMPn 基于 R/Shiny 平台开发40,提供用户友好的操作界面,集成了三大核心功能模块:共表达聚类分析、通路富集分析和 PPI 网络分析(图1)。每次分析完成后,结果将自动可视化,并可通过 R/Shiny 小部件函数进行调整,同时可直接下载为适用于发表的 Microsoft Excel 格式表格。在下文的实验方案中,我们以定量全蛋白质组数据为例,详细描述使用 JUMPn 的主要步骤,包括 JUMPn 软件的安装、差异表达蛋白质或(失调)蛋白质组的定义、共表达网络分析、PPI 模块分析、结果的可视化与解读,以及常见问题的排查。JUMPn 软件可在 GitHub 上免费获取41。
访问受限。请登录或开始试用以查看此内容。
注意:在本方案中,通过使用已发表的数据集来说明 JUMPn 的用法,该数据集利用 TMT 同重标记试剂对 B 细胞分化过程中的全蛋白质组谱进行定量分析27。
1. JUMPn 软件的设置
注意:JUMPn 软件的设置提供两种选项:(i)在本地计算机上安装,供个人使用;(ii)在远程 Shiny 服务器上部署 JUMPn,供多位用户使用。对于本地安装,一台具备互联网连接且内存 ≥4 Gb 的个人计算机即可满足小样本量数据集(n < 30)的 JUMPn 分析需求;而大样本队列分析(例如 n = 200 个样本)则需要更大的内存(例如 16 Gb)。
2. 使用示例数据集进行演示运行
注意:JUMPn 提供使用已发表的 B 细胞蛋白质组学数据集的演示运行。该演示运行展示了一个简化的流程,以差异表达蛋白质的定量矩阵作为输入,依次进行共表达聚类、通路富集分析和蛋白质-蛋白质相互作用(PPI)网络分析。
3. 输入文件的准备及上传至 JUMPn
注意:JUMPn 的输入为差异表达蛋白(有监督方法)或最可变蛋白(无监督方法)的定量矩阵。如果项目的目标是理解在多个条件下发生变化的蛋白(例如,不同疾病组,或生物过程的时间序列分析),则优先采用进行差异表达分析的有监督方法;否则,可采用选择最可变蛋白的无监督方法进行探索性分析。
4. 共表达聚类分析
注意:我们课题组25,26,27及其他研究者28,29,31已证实WGCNA49是一种用于定量蛋白质组学共表达聚类分析的有效方法。JUMPn采用三步流程进行WGCNA分析25,50:(i)基于拓扑重叠矩阵(TOM;由基因/蛋白质间的定量相似性确定)通过动态树切割法51初步定义共表达基因/蛋白质簇;(ii)合并相似的簇以减少冗余(依据特征基因相似性的系统发育树);(iii)将超过最小Pearson相关系数阈值的基因/蛋白质最终分配至各簇中。
5. 蛋白质-蛋白质相互作用网络分析
注意:通过将共表达簇叠加到蛋白质-蛋白质相互作用(PPI)网络上,每个共表达簇可进一步细分为更小的PPI模块。该分析针对每个共表达簇分两个阶段进行:第一阶段,JUMPn将共表达簇中的蛋白质叠加到PPI网络上,并找出所有连通组分(即多个相互连接的节点/蛋白质簇;示例见图6A);随后,将使用拓扑重叠矩阵(TOM)方法迭代地检测每个连通组分中的社区或模块(即高度连接的节点群)52。
6. 通路富集分析
注意:基于 JUMPn 的共表达簇和蛋白质相互作用模块内的层级结构,将使用 Fisher 精确检验自动注释富集的通路。所使用的通路/拓扑数据库包括基因本体(GO)、KEGG、Hallmark 和 Reactome。用户可使用高级选项上传自定义数据库以进行分析(例如,在分析非人类物种数据时)。
7. 大样本量数据集的分析
注意:JUMPn 支持对大样本量数据集的分析(已测试样本量可达 200 个)。为了便于大样本量的可视化展示,需要提供一个额外的文件(名为 "meta file"),用于指定样本分组,以促进共表达聚类结果的展示。
访问受限。请登录或开始试用以查看此内容。
我们利用已发表的深度蛋白质组学数据集25,26,27,30(图5 和 图6)以及数据模拟结果57(表1)来优化并评估 JUMPn 的性能。在通过 WGCNA 进行共表达蛋白聚类分析时,我们建议将样本间显著变化的蛋白质作为输入(例如,通过统计分析检测到的差异表达(DE)蛋白)。尽管在分析中纳入非DE蛋白可能会导致程序返回更多的共表达簇(由于输入数据量更大),但我们推测,在系统水平分析中将真实信号(例如DE蛋白)与背景信号(其余非DE蛋白)混合可能会稀释信号,从而掩盖潜在的网络结构。为验证这一点,我们在两种不同条件下进行了模拟分析:i)高度动态的蛋白质组(例如,在T细胞激活过程中有50%的...
访问受限。请登录或开始试用以查看此内容。
本文介绍了我们的JUMPn软件及其配套分析流程,该软件和流程已应用于多个研究项目,用于利用深度定量蛋白质组学数据解析分子机制25,26,27,30,64。JUMPn软件及分析流程已实现全面优化,包括在共表达网络分析中纳入差异表达蛋白、整合高质量且全面的蛋白质-蛋白质相互作用(PPI)网络、采用严格的统计分析方法(例如考虑多重假设检验校正),并配备简洁直观的用户界面。JUMPn鉴定出的多个蛋白模块已通过功能实验研究25,27或独立的患者队列26得到验证,表明JUMPn是一种有效识别多种生物学过程关键分子与通路的分析工具。
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
本研究获得了美国国立卫生研究院(NIH)(R01AG047928、R01AG053987、RF1AG064909、RF1AG068581 和 U54NS110435)以及 ALSAC(美国黎巴嫩叙利亚联合慈善协会)的资助支持。质谱分析在圣裘德儿童研究医院的蛋白质组学与代谢组学中心完成,该中心部分由 NIH 癌症中心支持基金(P30CA021765)资助。本内容仅由作者负责,不代表美国国立卫生研究院的官方观点。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 配备 2.3 GHz 四核处理器并运行 OS 10.15.7 操作系统的 MacBook Pro。 | Apple Inc. | MacBook Pro 13'' | 用于软件开发和测试的硬件 |
| Anaconda | Anaconda, Inc. | 版本 4.9.2 | https://docs.anaconda.com/anaconda/install/ |
| miniconda | Anaconda, Inc. | 版本 4.9.2 | https://docs.conda.io/en/latest/miniconda.html |
| RStudio | RStudio Public-benefit corporation | 版本 4.0.3 | https://www.rstudio.com/products/rstudio/download/ |
| Shiny Server | RStudio Public-benefit corporation | https://shiny.rstudio.com/articles/shinyapps.html |
访问受限。请登录或开始试用以查看此内容。