需要JoVE订阅才能观看此内容。 请登录或开始免费试用

方法文章

JUMPn:一种用于蛋白质组学中蛋白质共表达聚类与网络分析的简化应用程序

2.9K 次观看

⸱

DOI:

10.3791/62796

⸱

2021年10月19日

本文内容

摘要

我们介绍一种用于定量蛋白质组学数据分析和可视化网络分析的系统生物学工具 JUMPn,并提供了详细的操作流程,包括数据预处理、共表达聚类、通路富集分析以及蛋白质-蛋白质相互作用网络分析。

摘要

随着基于质谱的蛋白质组学技术的最新进展,对数百个蛋白质组进行深度分析已变得越来越可行。然而,从这些宝贵的數據集中获得生物学见解仍具挑战性。本文介绍了一种基于系统生物学的软件 JUMPn 及其相关实验方案,该方案可将蛋白质组按样本间的蛋白质共表达聚类以及通过模块(例如蛋白质复合物)连接的蛋白质-蛋白质相互作用(PPI)网络进行组织。JUMPn 软件基于 R/Shiny 平台,集成了数据可视化功能和用户友好的界面,可简化共表达聚类、通路富集分析和 PPI 模块检测的分析流程。本实验方案的主要步骤包括 JUMPn 软件的安装、差异表达蛋白质或(失调)蛋白质组的定义、有意义的共表达聚类和 PPI 模块的确定,以及结果的可视化。尽管本方案以基于同重标记的蛋白质组谱图为例进行演示,但 JUMPn 普遍适用于多种定量数据集(例如,无标记蛋白质组学)。因此,JUMPn 软件及其实验方案为定量蛋白质组学中的生物学解释提供了强有力的工具。

引言

基于质谱的鸟枪法蛋白质组学已成为分析复杂样品蛋白质组多样性的关键方法1。随着质谱仪器技术2,3、色谱技术4,5、离子淌度检测6、采集方法(数据非依赖型7和数据依赖型采集8)、定量策略(多重等重肽段标记法,例如 TMT9,10,以及无标记定量11,12)以及数据分析方法/软件开发13,14,15,16,17,18的最新进展,对整个蛋白质组(例如,超过 10,000 种蛋白质)进行定量现已常规实现19,20,21。然而,如何从如此深度的定量数据集中获得机制性见解仍然具有挑战性22。早期对这些数据集的研究主要依赖于对数据中各个元素的单独注释,将每个组分(蛋白质)视为独立存在。然而,生物系统及其行为无法仅通过分析单个组分来完全解释23。因此,将定量的生物分子置于相互作用网络背景下的系统性方法,对于理解复杂系统及其相关过程(如胚胎发育、免疫应答以及人类疾病的发病机制)至关重要24。

基于网络的系统生物学已成为分析大规模定量蛋白质组学数据的强大范式25,26,27,28,29,30,31,32,33。从概念上讲,哺乳动物细胞等复杂系统可被建模为分层网络34,35,其中整个系统以层级方式表示:首先由若干大型组分构成,每个大型组分再通过更小的子系统进行迭代建模。从技术上讲,蛋白质组动态结构可通过共表达蛋白簇的互连网络(因为共表达的基因/蛋白质通常具有相似的生物学功能或调控机制36)以及物理相互作用的蛋白质-蛋白质相互作用(PPI)模块37来呈现。最近的一个例子中25,我们生成了T细胞活化过程中全蛋白质组和磷酸化蛋白质组的时间动态谱,并结合蛋白质相互作用信息,利用整合的共表达网络识别介导T细胞脱离静息状态的功能模块。多个与生物能量相关的模块被识别并经实验验证(例如线粒体核糖体和复合物IV模块25,以及一碳代谢模块38)。在另一项研究中26,我们进一步扩展该方法用于研究阿尔茨海默病的发病机制,并成功优先筛选出与疾病进展相关的蛋白质模块及分子。重要的是,我们的许多无偏倚发现已通过独立的患者队列26,29和/或疾病小鼠模型26得到验证。这些实例展示了系统生物学方法在结合定量蛋白质组学及其他组学整合数据以解析分子机制方面的强大能力。

本文介绍了 JUMPn,这是一款采用基于网络的系统生物学方法分析定量蛋白质组学数据的简化软件。JUMPn 是成熟的 JUMP 蛋白质组学软件套件的下游组成部分13,14,39,旨在通过系统生物学方法,填补从单个蛋白质定量结果到具有生物学意义的通路和蛋白质模块之间的分析空白。JUMPn 以差异表达(或变异性最大)蛋白质的定量矩阵作为输入,将蛋白质组组织为分层的蛋白质聚类层级结构,这些聚类在不同样本中共同表达,并形成紧密连接的蛋白质-蛋白质相互作用(PPI)模块(例如蛋白质复合物),并通过富集分析利用公共通路数据库对这些模块进行功能注释(图1)。JUMPn 基于 R/Shiny 平台开发40,提供用户友好的操作界面,集成了三大核心功能模块:共表达聚类分析、通路富集分析和 PPI 网络分析(图1)。每次分析完成后,结果将自动可视化,并可通过 R/Shiny 小部件函数进行调整,同时可直接下载为适用于发表的 Microsoft Excel 格式表格。在下文的实验方案中,我们以定量全蛋白质组数据为例,详细描述使用 JUMPn 的主要步骤,包括 JUMPn 软件的安装、差异表达蛋白质或(失调)蛋白质组的定义、共表达网络分析、PPI 模块分析、结果的可视化与解读,以及常见问题的排查。JUMPn 软件可在 GitHub 上免费获取41。

访问受限。请登录或开始试用以查看此内容。

方案

注意:在本方案中,通过使用已发表的数据集来说明 JUMPn 的用法,该数据集利用 TMT 同重标记试剂对 B 细胞分化过程中的全蛋白质组谱进行定量分析27。

1. JUMPn 软件的设置

注意:JUMPn 软件的设置提供两种选项:(i)在本地计算机上安装,供个人使用;(ii)在远程 Shiny 服务器上部署 JUMPn,供多位用户使用。对于本地安装,一台具备互联网连接且内存 ≥4 Gb 的个人计算机即可满足小样本量数据集(n < 30)的 JUMPn 分析需求;而大样本队列分析(例如 n = 200 个样本)则需要更大的内存(例如 16 Gb)。

  1. 在本地计算机上安装软件。安装完成后,允许网页浏览器启动 JUMPn,并在本地计算机上运行分析。
    1. 按照在线说明安装 anaconda42 或 miniconda43。
    2. 下载 JUMPn 源代码41。双击解压下载的文件 JUMPn_v_1.0.0.zip;将创建一个名为 JUMPn_v_1.0.0 的新文件夹。
    3. 打开命令行终端。在 Windows 系统中,使用 Anaconda Prompt;在 macOS 系统中,使用系统自带的终端应用程序。
    4. 创建 JUMPn Conda 环境:获取 JUMPn_v_1.0.0 文件夹的绝对路径(例如 /path/to/JUMPn_v_1.0.0)。在终端中输入以下命令以创建并激活一个空的 Conda 环境:
      conda create -p /path/to/JUMPn_v_1.0.0/JUMPn -y
      ​conda activate /path/to/JUMPn_v_1.0.0/JUMPn
    5. 安装 JUMPn 依赖项:安装 R(在终端中输入 conda install -c conda-forge r=4.0.0 -y),将当前目录更改为 JUMPn_v_1.0.0 文件夹(在终端中输入 cd path/to/JUMPn_v_1.0.0),然后安装依赖包(在终端中输入 Rscript bootstrap.R)
    6. 在网页浏览器中启动 JUMPn:将当前目录更改为 execution 文件夹(在终端中输入 cd execution),然后启动 JUMPn(在终端中输入 R -e "shiny::runApp()")
    7. 上述步骤执行完毕后,终端屏幕将显示 Listening on http://127.0.0.1:XXXX(其中 XXXX 表示 4 个随机数字)。复制并粘贴 http://127.0.0.1:XXXX 到网页浏览器地址栏,即可看到 JUMPn 的欢迎页面(图 2)。
  2. 在 Shiny Server 上部署。Shiny Server 的示例包括商业化的 shinyapps.io 服务器或任何机构支持的 Shiny 服务器。
    1. 按照说明下载并安装 RStudio44。
    2. 获取 Shiny Server 的部署权限。对于 shinyapps.io 服务器,请按照说明45设置用户账户;对于机构内部的 Shiny 服务器,请联系服务器管理员申请权限。
    3. 将 JUMPn 源代码41下载到本地计算机;无需安装。在 RStudio 中打开 server.R 或 ui.R 文件,点击 RStudio IDE 右上角的 Publish to Server 下拉菜单。
    4. 在 Publish to Account 面板中输入服务器地址,然后点击 Publish 按钮。部署成功后,RStudio 将自动跳转至所部署的 RShiny 服务器页面,以此验证部署结果。

2. 使用示例数据集进行演示运行

注意:JUMPn 提供使用已发表的 B 细胞蛋白质组学数据集的演示运行。该演示运行展示了一个简化的流程,以差异表达蛋白质的定量矩阵作为输入,依次进行共表达聚类、通路富集分析和蛋白质-蛋白质相互作用(PPI)网络分析。

  1. 在 JUMPn 首页(图 2)上,点击 开始分析 按钮以启动 JUMPn 分析。
  2. 在 开始分析 页面的左下角(图 3),点击 上传示例 B 细胞蛋白质组数据 按钮;将弹出一个对话框,提示数据上传成功。
  3. 在页面的右下角,点击 提交 JUMPn 分析 按钮,使用默认参数启动示例运行;将出现一个进度条,表示分析的进程。请等待进度条完成(预计 3 分钟)。
  4. 示例运行完成后,将弹出一个对话框,显示运行成功的消息以及结果文件夹的绝对路径。点击 继续查看结果 以继续。
  5. 网页将首先引导用户查看 WGCNA 生成的共表达聚类结果。在对话窗口中点击 查看结果 以继续。
  6. 在 结果页面 1:WGCNA 输出 页面左侧查看蛋白质共表达模式。点击 选择表达格式 下拉框,在两种图形格式之间切换:
    1. 选择 趋势图 以显示趋势图,每条线代表一个蛋白质在各样本中的丰度变化。每条线的颜色表示其表达模式与共表达聚类共识模式(即 WGCNA 算法定义的"特征基因")的接近程度。
    2. 选择 箱形图 以箱形图格式显示各样本中的共表达模式。
  7. 在 WGCNA 输出页面右侧查看通路/本体富集热图。每个聚类中最显著富集的通路以热图形式集中展示,颜色强度反映经 Benjamini-Hochberg 校正后的 p 值。
  8. 向下滚动网页以查看单个蛋白质的表达模式。
    1. 使用下拉框 选择共表达聚类 查看各聚类中的蛋白质(默认为聚类 1)。在表格中选择特定蛋白质,表格下方的柱状图将自动更新以反映该蛋白质的丰度。
    2. 使用表格右侧的 搜索 框搜索特定蛋白质名称。
  9. 要查看 PPI 结果,请点击顶部的 结果页面 2:PPI 输出。
  10. 点击 选择共表达聚类 以查看特定共表达聚类的结果(默认为聚类 1)。本页所有图形面板的显示将更新为新选聚类的结果。
  11. 在左侧图形面板查看所选共表达聚类的 PPI 网络:
    1. 点击 按组选择 下拉框,以突出显示网络中的各个 PPI 模块。点击 选择网络布局格式 下拉框以更改网络布局(默认为 Fruchterman Reingold)。
    2. 使用鼠标和触控板执行步骤 2.11.3–2.11.5。
    3. 根据需要放大或缩小 PPI 网络。当充分放大时,网络中各节点的基因名称将显示出来。
    4. 放大后,选择并点击某个蛋白质,以突出显示该蛋白质及其网络邻近节点。
    5. 拖动网络中的某个节点(蛋白质)以改变其在布局中的位置;用户可借此重新组织网络布局。
  12. 在 PPI 结果页面的右侧面板查看有助于解释 PPI 结果的共表达聚类层级信息:
    1. 默认以箱形图形式查看所选聚类的共表达模式。
    2. 点击 选择表达格式 下拉框,获取更多详细信息或显示方式,如步骤 2.12.3–2.12.5 所述。
    3. 选择 趋势图 以显示共表达模式的趋势图。
    4. 选择 通路柱状图 以显示该共表达聚类中显著富集的通路。
    5. 选择 通路圆形图 以圆形图格式显示该共表达聚类中显著富集的通路。
  13. 向下滚动 结果页面 2:PPI 输出 网页,查看个体 PPI 模块层级的结果。点击 选择模块 下拉框以选择特定 PPI 模块进行展示(默认显示 聚类1:模块 1)。
  14. 在左侧面板查看 PPI 模块。如需操作网络显示,请遵循步骤 2.11.2–2.11.5。
  15. 在右侧面板查看通路/本体富集结果。点击 选择通路注释样式 下拉框以获取更多信息和显示选项:
    1. 选择 柱状图 以显示所选 PPI 模块中显著富集的通路。
    2. 选择 圆形图 以圆形图格式显示所选 PPI 模块中显著富集的通路。
    3. 选择 热图 以显示所选 PPI 模块中显著富集的通路及其相关基因名称。
    4. 选择 表格 以显示详细的通路富集结果,包括通路/本体术语名称、基因名称以及 Fisher 精确检验的 P 值。
  16. 以电子表格格式查看发表用数据表:根据两个结果页面顶部打印的绝对路径,查找名为 ComprehensiveSummaryTables.xlsx 的综合汇总表格文件。

3. 输入文件的准备及上传至 JUMPn

注意:JUMPn 的输入为差异表达蛋白(有监督方法)或最可变蛋白(无监督方法)的定量矩阵。如果项目的目标是理解在多个条件下发生变化的蛋白(例如,不同疾病组,或生物过程的时间序列分析),则优先采用进行差异表达分析的有监督方法;否则,可采用选择最可变蛋白的无监督方法进行探索性分析。

  1. 生成蛋白质定量表格,以每种蛋白质作为行,每个样本作为列。可通过现代基于质谱的蛋白质组学软件套件实现(例如 JUMP suite13,14,39、Proteome Discoverer、Maxquant15,46)。
  2. 定义可变蛋白质组。
    1. 利用蛋白质组学软件套件提供的统计分析结果,确定差异表达(DE)蛋白质(例如,以校正后 p 值 < 0.05 为标准)。
    2. 或者,用户可参考示例 R 代码47 来定义差异表达蛋白或最具变异性的蛋白质。
  3. 使用已定义的可变蛋白质组格式化输入文件。
    注意:所需输入文件格式(图 4)应包含表头行;各列依次为蛋白质登录号(或任意唯一标识符)、GN(官方基因符号)、蛋白质描述(或用户提供的任意信息),随后为各个样本的蛋白质定量值。
    1. 按照步骤 3.1 中指定的列顺序排列,但表头中的列名称可由用户自定义。
    2. 对于 TMT(或类似)定量的蛋白质组数据,使用汇总的 TMT 报告离子强度作为输入定量值;对于无标记数据,可使用归一化的谱计数(例如 NSAF48)或基于强度的方法(例如 Maxquant46 报告的 LFQ 强度或 iBAQ 蛋白质强度)。
    3. JUMPn 分析允许存在缺失值。请确保在定量矩阵中将这些值标记为 NA。但建议仅使用在超过 50% 样本中具有定量值的蛋白质。
    4. 将最终的输入文件保存为 .txt、.xlsx 或 .csv 格式(JUMPn 支持全部三种格式)。
  4. 上传输入文件:
    1. 点击 Browser 按钮并选择输入文件(图 3,左侧面板);系统将自动检测文件格式(支持 xlsx、csv 和 txt 格式)。
    2. 如果输入文件包含类似强度的定量值(例如由 JUMP suite39 生成的数据)或类似比值的数据(例如来自 Proteome Discoverer 的数据),请在 执行数据的 Log2 转换选项 中选择 是;否则,若数据可能已经过对数转换,请选择 否。

4. 共表达聚类分析

注意:我们课题组25,26,27及其他研究者28,29,31已证实WGCNA49是一种用于定量蛋白质组学共表达聚类分析的有效方法。JUMPn采用三步流程进行WGCNA分析25,50:(i)基于拓扑重叠矩阵(TOM;由基因/蛋白质间的定量相似性确定)通过动态树切割法51初步定义共表达基因/蛋白质簇;(ii)合并相似的簇以减少冗余(依据特征基因相似性的系统发育树);(iii)将超过最小Pearson相关系数阈值的基因/蛋白质最终分配至各簇中。

  1. 配置WGCNA参数(图3,中间面板)。以下三个参数分别控制三个步骤:
    1. 将最小簇大小设置为30。该参数定义了基于TOM的混合动态树切割初始步骤(i)中每个共表达簇所需的最少蛋白质数量。该值越大,算法返回的簇数量越少。
    2. 将最小簇距离设置为0.2。增加该值(例如从0.2增至0.3)可能在步骤(ii)中导致更多的簇合并,从而产生更少的簇数量。
    3. 将最小kME设置为0.7。蛋白质将被分配到步骤(ii)中定义的最相关簇,但只有皮尔逊相关性超过此阈值的蛋白质才会被保留。在此步骤中未通过的蛋白质将不会被分配到任何簇(最终报告中这些失败的蛋白质标记为“NA”簇)。
  2. 启动分析。有两种方式提交共表达聚类分析:
    1. 点击右下角的提交JUMPn分析按钮,自动启动WGCNA的综合分析,随后进行PPI网络分析。
    2. 或者,选择仅执行WGCNA步骤(特别适用于参数调优;参见步骤4.2.3-4.2.4):
    3. 在启动分析页面底部点击高级参数按钮,将弹出新的参数窗口。在底部小部件中,选择分析模式,选择仅WGCNA,然后点击关闭继续。
    4. 在启动分析页面,点击提交JUMPn分析按钮。
    5. 在上述任一情况下,提交分析后将出现进度条。
      注意:一旦分析完成(通常仅WGCNA分析耗时<1分钟,综合分析耗时<3分钟),将弹出一个对话框,显示运行成功消息以及结果文件夹的绝对路径。
  3. 检查WGCNA结果,如步骤2.4-2.8所示(图5)。请注意,在结果页面:WGCNA输出顶部会高亮显示文件co_exp_clusters_3colums.txt的绝对路径,用于记录每个蛋白质的簇成员关系,并将其作为仅PPI分析的输入。
  4. 故障排除。讨论以下三种常见情况。一旦按以下说明更新参数,请遵循步骤4.2.2-4.2.4生成新的WGCNA结果。
    1. 如果数据中预期存在一个重要共表达模式但被算法遗漏,请遵循步骤4.4.2-4.4.4
    2. 小的共表达簇尤其容易出现簇遗漏情况,即仅有少量蛋白质(例如<30)表现出该模式。在重新分析之前,请重新检查蛋白质定量矩阵输入文件,并定位几个符合该重要共表达模式的阳性对照蛋白质。
    3. 为恢复小簇,可降低最小簇大小(例如设为10;小于10的簇大小可能不够稳健,因此不推荐),并降低最小簇距离(例如设为0.1;此处允许设为0,表示跳过自动簇合并)。
    4. 使用更新后的参数执行共表达聚类步骤后,首先检查共表达模式图中是否已恢复该簇,然后通过在详细蛋白质定量中搜索其蛋白质登录号来验证阳性对照(搜索前请确保从左侧下拉小部件中选择适当的共表达簇)。
      注意:可能需要多次迭代参数调整和重新运行才能成功恢复。
    5. 如果大量蛋白质无法被分配到任何簇,请遵循步骤4.4.6-4.4.7。
      注意:通常会有少量比例(通常<10%)的蛋白质未被分配到任何簇,这些可能是偏离数据集中任何常见表达模式的异常值蛋白质。然而,如果该比例显著(例如>30%),则表明存在不可忽略的额外共表达模式。
    6. 通过降低最小簇大小 和最小簇距离 参数,检测“新”的共表达簇以缓解此情况。
    7. 此外,降低最小皮尔逊相关性(kME)参数以减少这些“NA簇”蛋白质的数量。
      注意:调整此参数不会生成新簇,而是通过降低阈值接纳更多先前未通过的蛋白质,从而增加“现有”簇的大小;但这也同时会增加每个簇的异质性,因为允许了更多噪声蛋白质进入。
    8. 两个簇的模式差异极小;请遵循步骤4.4.9-4.4.11将它们合并为一个簇。
    9. 增加最小簇距离 参数以解决此问题。
    10. 然而,在某些情况下,算法可能始终无法返回期望的模式;此时可手动调整或编辑文件co_exp_clusters_3colums.txt(步骤4.3中的文件)中的簇成员关系以实现合并。
    11. 将编辑后的文件作为下游PPI网络分析的输入。若进行手动编辑,需说明簇分配的标准,并记录手动编辑的过程。

5. 蛋白质-蛋白质相互作用网络分析

注意:通过将共表达簇叠加到蛋白质-蛋白质相互作用(PPI)网络上,每个共表达簇可进一步细分为更小的PPI模块。该分析针对每个共表达簇分两个阶段进行:第一阶段,JUMPn将共表达簇中的蛋白质叠加到PPI网络上,并找出所有连通组分(即多个相互连接的节点/蛋白质簇;示例见图6A);随后,将使用拓扑重叠矩阵(TOM)方法迭代地检测每个连通组分中的社区或模块(即高度连接的节点群)52。

  1. 配置蛋白质-蛋白质相互作用(PPI)网络分析参数(图3,右侧面板)。
    1. 将最小PPI模块大小设置为2。此参数定义了第一阶段分析中不连通组分的最小尺寸。任何小于指定参数的组分都将从最终结果中移除。
    2. 将最大PPI模块大小设置为40。超过此阈值的大型不连通组分将进入第二阶段基于TOM的分析。第二阶段分析会将每个大型组分进一步划分为更小的模块:每个模块可能包含比原始整体组分连接更紧密的蛋白质。
  2. 启动分析。提交PPI网络分析有两种方式:
    1. 点击提交JUMPn分析按钮,默认情况下将自动在WGCNA分析之后执行PPI分析。
    2. 或者,上传自定义的共表达聚类结果,并按照步骤5.2.3–5.2.5执行PPI仅分析。
    3. 按照文件co_exp_clusters_3colums.txt的格式准备输入文件(见第4.4小节)。
    4. 点击启动分析页面底部的高级参数按钮,将弹出一个新的参数窗口。在上方会话上传用于“仅PPI”分析的共表达聚类结果中,点击浏览按钮,上传由步骤5.2.3准备的输入文件。
    5. 在底部控件选择分析模式中,选择PPI仅分析,然后点击关闭继续。在启动分析页面上,点击提交JUMPn分析按钮。
  3. 分析完成后(通常<3分钟),按照步骤2.10–2.15所示检查PPI结果(图6)。
  4. 可选高级步骤)通过调整参数优化PPI模块化:
    1. 增加最大模块大小参数,以允许更多蛋白质被包含在PPI结果中。按照步骤5.4.2–5.4.3上传自定义PPI网络,以涵盖未记录的相互作用。
    2. 点击启动分析页面底部的高级参数按钮,将弹出一个新的参数窗口。准备自定义PPI文件,该文件应包含三列,格式为<Protein_A>、连接和<Protein_B>;其中<Protein_X>使用各蛋白质的官方基因名称表示。
    3. 在上传PPI数据库中,点击浏览按钮上传自定义PPI文件。

6. 通路富集分析

注意:基于 JUMPn 的共表达簇和蛋白质相互作用模块内的层级结构,将使用 Fisher 精确检验自动注释富集的通路。所使用的通路/拓扑数据库包括基因本体(GO)、KEGG、Hallmark 和 Reactome。用户可使用高级选项上传自定义数据库以进行分析(例如,在分析非人类物种数据时)。

  1. 默认情况下,通路富集分析将自动启动,并同时进行共表达聚类和蛋白质相互作用网络(PPI)分析。
  2. 查看通路富集分析结果:
    1. 按照步骤 2.7、2.12 和 2.15,在结果页面上查看不同格式的可视化结果。在 ComprehensiveSummaryTables.xlsx 文件中的电子表格出版表格中查看详细结果(步骤 2.16)。
  3. (可选高级步骤)上传自定义数据库用于通路富集分析:
    1. 准备基因背景文件,该文件通常包含某一物种所有基因的官方基因名称。
    2. 按照步骤 6.3.3–6.3.4 准备本体库文件。
    3. 从公共网站下载本体库文件,包括 EnrichR53 和 MSigDB54。例如,从 EnrichR 网站55 下载果蝇(Drosophila)的本体信息。
    4. 将下载的文件编辑为所需格式,包含两列:第一列为通路名称,第二列为官方基因符号(以 "/" 分隔)。详细的文件格式说明见 JUMPn R shiny 软件的 帮助 页面。
      注意:可在 JUMPn GitHub 网站56 上找到基因背景文件和本体库文件的示例(以果蝇为例)。
    5. 点击“开始分析”页面底部的 高级参数 按钮,将弹出新的参数设置窗口。
    6. 找到 上传用于通路富集分析的背景文件 项,点击 浏览 按钮上传步骤 6.3.1 中准备的背景文件。随后在该会话中,于 选择用于通路富集分析的背景 选项下,点击选择 用户提供的背景。
    7. 找到 上传用于通路富集分析的本体库文件 项,点击 浏览 按钮上传步骤 6.3.2–6.3.4 中准备的本体库文件。随后在该会话中,于 选择用于通路富集分析的数据库 选项下,点击选择 用户提供的 .xlsx 格式数据库。
  4. 点击右下角的 提交 JUMPn 分析 按钮,以使用自定义数据库启动分析。

7. 大样本量数据集的分析

注意:JUMPn 支持对大样本量数据集的分析(已测试样本量可达 200 个)。为了便于大样本量的可视化展示,需要提供一个额外的文件(名为 "meta file"),用于指定样本分组,以促进共表达聚类结果的展示。

  1. 准备并上传元文件。
    1. 按照步骤 7.1.2–7.1.3 的说明,准备指定每个样本分组信息(例如对照组和疾病组)的元文件。
    2. 确保元文件至少包含两列:第 1 列必须包含样本名称,且与蛋白定量矩阵文件中的列名及顺序完全一致(该文件在步骤 3.3 中已准备);从第 2 列开始,可用于用户自定义的任意数量特征的分组分配。列数可根据需要灵活设置。
    3. 确保元文件的第一行为各列的列名;从第二行开始,逐行列出各样本的分组或其他特征信息(例如性别、年龄、处理方式等)。
    4. 在开始分析页面底部点击高级参数按钮,将弹出一个新的参数设置窗口。然后进入步骤 7.1.5。
    5. 找到上传元文件选项,点击浏览以上传背景文件。如果 JUMPn 检测到文件格式异常或样本名称不匹配,将弹出错误提示,需进一步按照步骤 7.1.1–7.1.3 修改元文件格式。
  2. 调整共表达聚类分析参数:将最小皮尔逊相关系数设置为 0.2。由于样本量较大,该参数需适当放宽。
  3. 点击右下角的提交 JUMPn 分析按钮以提交分析任务。
  4. 查看分析结果:除展示共表达聚类模式外,所有数据输出内容保持不变。
    1. 在结果页面 1:WGCNA 输出页面中,以箱线图形式可视化共表达聚类结果,并根据用户自定义的样本分组或特征进行分层展示。图中每个点代表由 WGCNA 算法计算得到的特征基因(即聚类的共识表达模式)。
    2. 若用户提供了多个特征(例如年龄、性别、处理方式等)用于样本分组,可点击选择表达格式下拉框,选择其他特征重新对样本进行分组展示。

访问受限。请登录或开始试用以查看此内容。

结果

我们利用已发表的深度蛋白质组学数据集25,26,27,30(图5 和 图6)以及数据模拟结果57(表1)来优化并评估 JUMPn 的性能。在通过 WGCNA 进行共表达蛋白聚类分析时,我们建议将样本间显著变化的蛋白质作为输入(例如,通过统计分析检测到的差异表达(DE)蛋白)。尽管在分析中纳入非DE蛋白可能会导致程序返回更多的共表达簇(由于输入数据量更大),但我们推测,在系统水平分析中将真实信号(例如DE蛋白)与背景信号(其余非DE蛋白)混合可能会稀释信号,从而掩盖潜在的网络结构。为验证这一点,我们在两种不同条件下进行了模拟分析:i)高度动态的蛋白质组(例如,在T细胞激活过程中有50%的...

访问受限。请登录或开始试用以查看此内容。

讨论

本文介绍了我们的JUMPn软件及其配套分析流程,该软件和流程已应用于多个研究项目,用于利用深度定量蛋白质组学数据解析分子机制25,26,27,30,64。JUMPn软件及分析流程已实现全面优化,包括在共表达网络分析中纳入差异表达蛋白、整合高质量且全面的蛋白质-蛋白质相互作用(PPI)网络、采用严格的统计分析方法(例如考虑多重假设检验校正),并配备简洁直观的用户界面。JUMPn鉴定出的多个蛋白模块已通过功能实验研究25,27或独立的患者队列26得到验证,表明JUMPn是一种有效识别多种生物学过程关键分子与通路的分析工具。

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

致谢

本研究获得了美国国立卫生研究院(NIH)(R01AG047928、R01AG053987、RF1AG064909、RF1AG068581 和 U54NS110435)以及 ALSAC(美国黎巴嫩叙利亚联合慈善协会)的资助支持。质谱分析在圣裘德儿童研究医院的蛋白质组学与代谢组学中心完成,该中心部分由 NIH 癌症中心支持基金(P30CA021765)资助。本内容仅由作者负责,不代表美国国立卫生研究院的官方观点。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
配备 2.3 GHz 四核处理器并运行 OS 10.15.7 操作系统的 MacBook Pro。Apple Inc.MacBook Pro 13''用于软件开发和测试的硬件
AnacondaAnaconda, Inc.版本 4.9.2https://docs.anaconda.com/anaconda/install/
minicondaAnaconda, Inc.版本 4.9.2https://docs.conda.io/en/latest/miniconda.html
RStudioRStudio Public-benefit corporation版本 4.0.3https://www.rstudio.com/products/rstudio/download/
Shiny ServerRStudio Public-benefit corporationhttps://shiny.rstudio.com/articles/shinyapps.html

参考文献

  1. Aebersold, R., Mann, M. Mass-spectrometric exploration of proteome structure and function. Nature. 537, 347-355 (2016).
  2. Senko, M. W., et al. Novel parallelized quadrupole/linear ion trap/orbitrap tribrid mass spectrometer improving proteome coverage and peptide identification rates. Analytical Chemistry. 85, 11710-11714 (2013).
  3. Eliuk, S., Makarov, A. Evolution of orbitrap mass spectrometry instrumentation. Annual Review of Analytical Chemistry. 8, 61-80 (2015).
  4. Wang, H., et al. Systematic optimization of long gradient chromatography mass spectrometry for deep analysis of brain proteome. Journal of Proteome Research. 14, 829-838 (2015).
  5. Blue, L. E. Recent advances in capillary ultrahigh pressure liquid chromatography. Journal of Chromatography A. 1523, 17-39 (2017).
  6. Meier, F., et al. Online parallel accumulation-serial fragmentation (PASEF) with a novel trapped ion mobility mass spectrometer. Molecular & Cellular Proteomics. 17, 2534-2545 (2018).
  7. Ludwig, C., et al. Data-independent acquisition-based SWATH-MS for quantitative proteomics: a tutorial. Molecular Systems Biology. 14 (8), 8126(2018).
  8. Zhang, Y. Y., Fonslow, B. R., Shan, B., Baek, M. C., Yates, J. R. Protein analysis by shotgun/bottom-up proteomics. Chemical Reviews. 113, 2343-2394 (2013).
  9. Wang, Z., et al. 27-Plex tandem mass tag mass spectrometry for profiling brain proteome in Alzheimer's disease. Analytical Chemistry. 92, 7162-7170 (2020).
  10. Li, J. M., et al. TMTpro reagents: a set of isobaric labeling mass tags enables simultaneous proteome-wide measurements across 16 samples. Nature Methods. 17 (4), 399-404 (2020).
  11. Collins, B. C., et al. Multi-laboratory assessment of reproducibility, qualitative and quantitative performance of SWATH-mass spectrometry. Nature Communications. 8 (1), 291(2017).
  12. Navarro, P., et al. A multicenter study benchmarks software tools for label-free proteome quantification. Nature Biotechnology. 34, 1130(2016).
  13. Wang, X. S., et al. A tag-based database search tool for peptide identification with high sensitivity and accuracy. Molecular & Cellular Proteomics. 13, 3663-3673 (2014).
  14. Li, Y. X., et al. JUMPg: An integrative proteogenomics pipeline identifying unannotated proteins in human brain and cancer cells. Journal of Proteome Research. 15, 2309-2320 (2016).
  15. Cox, J., Mann, M. MaxQuant enables high peptide identification rates, individualized p.p.b.-range mass accuracies and proteome-wide protein quantification. Nature Biotechnology. 26, 1367-1372 (2008).
  16. Kong, A. T., Leprevost, F. V., Avtonomov, D. M., Mellacheruvu, D., Nesvizhskii, A. I. MSFragger: ultrafast and comprehensive peptide identification in mass spectrometry-based proteomics. Nature Methods. 14, 513(2017).
  17. Chi, H., et al. Comprehensive identification of peptides in tandem mass spectra using an efficient open search engine. Nature Biotechnology. 36, 1059(2018).
  18. Demichev, V., Messner, C. B., Vernardis, S. I., Lilley, K. S., Ralser, M. DIA-NN neural networks and interference correction enable deep proteome coverage in high throughput. Nature Methods. 17, 41(2020).
  19. High, A. A., et al. Deep proteome profiling by isobaric labeling, extensive liquid chromatography, mass spectrometry, and software-assisted quantification. Journal of Visualized Experiments: JoVE. (129), e56474(2017).
  20. Wang, Z., et al. High-throughput and deep-proteome profiling by 16-plex tandem mass tag labeling coupled with two-dimensional chromatography and mass spectrometry. Journal of Visualized Experiments: JoVE. (162), e61684(2020).
  21. Meier, F., Geyer, P. E., Winter, S. V., Cox, J., Mann, M. BoxCar acquisition method enables single-shot proteomics at a depth of 10,000 proteins in 100 minutes. Nature Methods. 15, 440(2018).
  22. Sinitcyn, P., Rudolph, J. D., Cox, J. Computational methods for understanding mass spectrometry-based shotgun proteomics data. Annual Review of Biomedical Data Science. 1, 207-234 (2018).
  23. Ideker, T., Galitski, T., Hood, L. A new approach to decoding life: Systems biology. Annual Review of Genomics and Human Genetics. 2, 343-372 (2001).
  24. Barabasi, A. L., Oltvai, Z. N. Network biology: understanding the cell's functional organization. Nature Reviews Genetics. 5, 101-113 (2004).
  25. Tan, H., et al. Integrative proteomics and phosphoproteomics profiling reveals dynamic signaling networks and bioenergetics pathways underlying T cell activation. Immunity. 46, 488-503 (2017).
  26. Bai, B., et al. Deep multilayer brain proteomics identifies molecular networks in alzheimer's disease progression. Neuron. 105, 975-991 (2020).
  27. Zeng, H., et al. Discrete roles and bifurcation of PTEN signaling and mTORC1-mediated anabolic metabolism underlie IL-7-driven B lymphopoiesis. Science Advances. 4, 5701(2018).
  28. Seyfried, N. T., et al. A multi-network approach identifies protein-specific co-expression in asymptomatic and symptomatic Alzheimer's disease. Cell Systems. 4, 60-72 (2017).
  29. Johnson, E. C. B., et al. Large-scale proteomic analysis of Alzheimer's disease brain and cerebrospinal fluid reveals early changes in energy metabolism associated with microglia and astrocyte activation. Nature Medicine. 26, 769-780 (2020).
  30. Stewart, E., et al. Identification of therapeutic targets in rhabdomyosarcoma through integrated genomic, epigenomic, and proteomic analyses. Cancer Cell. 34, 411-426 (2018).
  31. Rudolph, J. D., Cox, J. A network module for the perseus software for computational proteomics facilitates proteome interaction graph analysis. Journal of Proteome Research. 18, 2052-2064 (2019).
  32. Zhang, B., et al. Proteogenomic characterization of human colon and rectal cancer. Nature. 513, 382(2014).
  33. Petralia, F., et al. Integrated proteogenomic characterization across major histological types of pediatric brain cancer. Cell. 183, 1962(2020).
  34. Dutkowski, J., et al. A gene ontology inferred from molecular networks. Nature Biotechnology. 31, 38(2013).
  35. Yu, M. K., et al. Translation of genotype to phenotype by a hierarchy of cell subsystems. Cell Systems. 2, 77-88 (2016).
  36. Jansen, R., Greenbaum, D., Gerstein, M. Relating whole-genome expression data with protein-protein interactions. Genome Research. 12, 37-46 (2002).
  37. Huttlin, E. L., et al. Architecture of the human interactome defines protein communities and disease networks. Nature. 545, 505-509 (2017).
  38. Ron-Harel, N., et al. Mitochondrial biogenesis and proteome remodeling promote one-carbon metabolism for T cell activation. Cell Metabolism. 24, 104-117 (2016).
  39. Niu, M. M., et al. Extensive peptide fractionation and y(1) ion-based interference detection method for enabling accurate quantification by isobaric labeling and mass spectrometry. Analytical Chemistry. 89, 2956-2963 (2017).
  40. Chang, W. shiny: Web Application Framework for. Nature Protocols. 11, Anaconda. miniconda (2021). RStudio (2021) Shiny Server 2301-2319 (2021).
  41. JUMPn. , Available from: https://github.com/VanderwallDavid/JUMPn_1.0.0 (2021).
  42. Anaconda. , Available from: https://docs.anaconda.com/anaconda/install/ (2021).
  43. miniconda. , Available from: https://docs.conda.io/en/latest/miniconda.html (2021).
  44. RStudio. , Available from: https://www.rstudio.com/products/rstudio/download/ (2021).
  45. Shiny Server. , Available from: https://shiny.rstudio.com/articles/shinyapps.html (2021).
  46. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nature Protocol. 11, 2301-2319 (2016).
  47. R code. , Available from: https://github.com/VanderwallDavid/JUMPn_1.0.0/tree/main/JUMPn_preprocessing (2021).
  48. Florens, L., et al. Analyzing chromatin remodeling complexes using shotgun proteomics and normalized spectral abundance factors. Methods. 40, 303-311 (2006).
  49. Zhang, B., Horvath, S. A general framework for weighted gene co-expression network analysis. Statistical Applications in Genetics and Molecular Biology. 4, Article 17 (2005).
  50. Voineagu, I., et al. Transcriptomic analysis of autistic brain reveals convergent molecular pathology. Nature. 474, 380(2011).
  51. Langfelder, P., Zhang, B., Horvath, S. Defining clusters from a hierarchical cluster tree: the Dynamic Tree Cut package for R. Bioinformatics. 24, 719-720 (2008).
  52. Ravasz, E., Somera, A. L., Mongru, D. A., Oltvai, Z. N., Barabasi, A. L. Hierarchical organization of modularity in metabolic networks. Science. 297, 1551-1555 (2002).
  53. Kuleshov, M. V., et al. Enrichr: a comprehensive gene set enrichment analysis web server 2016 update. Nucleic Acids Research. 44, 90-97 (2016).
  54. Liberzon, A., et al. Molecular signatures database (MSigDB) 3.0. Bioinformatics. 27, 1739-1740 (2011).
  55. FlyEn rich r. , Available from: https://maayanlab.cloud/FlyEnrichr/#stats (2021).
  56. JUMPn GitHub. , Available from: https://github.com/VanderwallDavid/JUMPn_1.0.0/tree/main/resources/example_fly_ (2021).
  57. Langfelder, P., Horvath, S. Eigengene networks for studying the relationships between co-expression modules. BMC Systems Biology. 1, 54(2007).
  58. Benjamini, Y., Hochberg, Y. Controlling the false discovery rate - a practical and powerful approach to multiple testing. Journal of the Royal Statistical Society: Series B. 57, 289-300 (1995).
  59. Szklarczyk, D., et al. STRING v10: protein-protein interaction networks, integrated over the tree of life. Nucleic Acids Research. 43, 447-452 (2015).
  60. Szklarczyk, D., et al. STRING v11: protein-protein association networks with increased coverage, supporting functional discovery in genome-wide experimental datasets. Nucleic Acids Research. 47, 607-613 (2019).
  61. Huttlin, E. L., et al. The BioPlex network: A systematic exploration of the human interactome. Cell. 162, 425-440 (2015).
  62. Huttlin, E. L., et al. Dual proteome-scale networks reveal cell-specific remodeling of the human interactome. Cell. 184, 3022-3040 (2021).
  63. Li, T., et al. A scored human protein-protein interaction network to catalyze genomic interpretation. Nature Methods. 14, 61-64 (2017).
  64. Wang, H., et al. Deep multiomics profiling of brain tumors identifies signaling networks downstream of cancer driver genes. Nature Communications. 10, 3718(2019).
  65. Gerstein, M. B., et al. Architecture of the human regulatory network derived from ENCODE data. Nature. 489, 91-100 (2012).
  66. Yu, J., Peng, J., Chi, H. Systems immunology: Integrating multi-omics data to infer regulatory networks and hidden drivers of immunity. Current Opinion in Systems Biology. 15, 19-29 (2019).
  67. Califano, A., Alvarez, M. J. The recurrent architecture of tumour initiation, progression and drug sensitivity. Nature Reviews Cancer. 17, 116-130 (2017).
  68. Hein, M. Y., et al. A human interactome in three quantitative dimensions organized by stoichiometries and abundances. Cell. 163, 712-723 (2015).
  69. Liang, Z., Xu, M., Teng, M. K., Niu, L. W. Comparison of protein interaction networks reveals species conservation and divergence. BMC Bioinformatics. 7, 457(2006).
  70. Shou, C., et al. Measuring the evolutionary rewiring of biological networks. PLOS Computational Biology. 7, 1001050(2011).
  71. Zhou, Y., et al. Metascape provides a biologist-oriented resource for the analysis of systems-level datasets. Nature Communications. 10, 1523(2019).
  72. Cline, M. S., et al. Integration of biological networks and gene expression data using Cytoscape. Nature Protocols. 2, 2366-2382 (2007).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签

蛋白质组学聚类蛋白质相互作用网络通路富集PPI模块检测定量蛋白质组学R Shiny平台质谱蛋白质组学