方法文章

在Galaxy生物信息学平台内实施的临床宏蛋白质组学工作流程用于分析人类疾病中宿主-微生物组相互作用

1.6K 次观看

DOI:

10.3791/67581

2025年1月10日

本文内容

摘要

临床宏蛋白质组学为研究人类微生物组及其在疾病中的作用提供了深入见解。我们利用 Galaxy 平台的计算能力,开发了一种模块化的生物信息学工作流程,该流程可促进基于质谱的复杂宏蛋白质组学分析,并实现对多种与疾病研究相关的临床样本类型的表征。

摘要

临床宏蛋白质组学揭示了宿主-微生物组相互作用在疾病中的基础作用。然而,该方法仍面临诸多挑战。特别是,相对于宿主蛋白,丰度较低的微生物蛋白的表征十分困难。另一个重要挑战源于使用非常庞大的蛋白质序列数据库,这不仅在从质谱数据中进行肽段和蛋白质鉴定时降低了灵敏度和准确性,还影响了分类学与功能注释的获取以及统计分析的执行。为解决这些问题,我们提出了一种整合的生物信息学工作流程,用于基于质谱的宏蛋白质组学分析,该流程结合了自定义蛋白质序列数据库构建、肽谱匹配生成与验证、定量分析、分类学和功能注释以及统计分析。该工作流程同时支持人类蛋白质的表征(在优先关注微生物蛋白质的前提下),从而提供对疾病中宿主-微生物相互作用动态的深入理解。这些工具和流程部署于Galaxy生态系统中,有助于开发、优化和共享这些计算资源。我们已将该工作流程应用于多种临床样本类型的宏蛋白质组学分析,例如鼻咽拭子和支气管肺泡灌洗液。在此,我们通过分析宫颈拭子残留液体来展示其应用价值。完整的工作流程及配套培训资源均可在Galaxy培训网络获取,旨在为非专业人员和经验丰富的研究人员提供分析其数据所需的知识与工具。

引言

基于质谱(MS)的宏蛋白质组学可从临床样本中鉴定并定量微生物和人类蛋白质。该方法为理解微生物组对疾病反应提供了新的视角,并揭示了宿主-微生物组相互作用的潜在介质1,2。尽管临床样本的宏蛋白质组学分析能够揭示微生物组与其宿主环境之间的相互作用,但该领域仍面临诸多挑战。其中一个主要挑战是宿主(人类)蛋白质的相对丰度较高,这会阻碍对低丰度微生物蛋白质的鉴定。此外,基于质谱的宏蛋白质组学依赖于非常大的蛋白质序列数据库。这些数据库包含样本中存在的微生物蛋白组,可能导致数据库规模庞大,包含数百万条序列。在通过胰蛋白酶消化蛋白质生成串联质谱(MS/MS)谱图后,需将这些MS/MS谱图与大型蛋白质序列数据库进行比对,为每张谱图匹配相应的肽段序列(即肽段-谱图匹配,PSM)。然而,随着宏蛋白质组学所用数据库规模的增大,检测灵敏度下降,假阳性风险也随之增加3。此外,不同分类群间保守的蛋白质序列以及对编码蛋白质注释的不足,限制了对检测到的肽段和蛋白质进行分类学和功能注释的准确性4,5。本文提出了一种用于临床样本高效宏蛋白质组学分析的生物信息学工作流程,可应对上述诸多挑战,并为研究人员提供易于使用的软件资源,以探究人类疾病中宿主-微生物组动态关系的机制。

临床宏蛋白质组学已被用于研究多种样本类型,包括粪便和阴道拭子等,以解析疾病和病理状态中的致病机制6,7,8,9,10,11,12,13,14,15,16,17,18,19,20。本文中,我们采用宏蛋白质组学生物信息学工作流程,分析来自卵巢癌(OVCA)患者和非OVCA患者的宫颈脱落细胞检测液(PTF)样本中的一部分MS/MS数据21。所使用的软件工具和工作流程可通过Galaxy平台获取,该平台可简化复杂临床宏蛋白质组学工作流程的开发与执行22,23,24,25。Galaxy是一个开源平台,专为生物信息学和计算生物学设计,提供基于网络的环境,供学术研究人员使用开源工具和工作流程进行并共享复杂的数据分析。一个活跃的全球性软件开发者、数据科学家和终端用户社区维护着Galaxy生态系统,其中包括Galaxy培训网络(GTN;https://training.galaxyproject.org/), 该网络提供在线和按需培训资源22,23,24,25,26,27。我们的工作流程旨在揭示临床样本中宿主-微生物相互作用的新认知,并生成新颖且特征明确的肽段靶标,用于开发基于质谱的靶向临床检测方法,以进一步研究临床样本6,20,28。此外,本论文旨在突出展示临床宏蛋白质组学工作流程的方法学。GTN(https://training.galaxyproject.org/)提供了更详细且适合初学者的指南,作为本论文的补充资源,供需要额外解释的用户并行参考。Galaxy社区已撰写大量论文,以帮助初学者更好地使用Galaxy平台20,21,22,23,24,25,26,27

本论文的所有补充表格(例如,工具参数)和图示(例如,示例图表)均已作为单独文件提供,并在文中相应位置引用。本论文使用的是 Galaxy 版本 2.3.0 中的当前工具版本,因此结果可能因 Galaxy 平台或工具版本的更新而略有差异。Galaxy 平台及其工具为开源软件,可用于学术研究目的。

访问受限。请登录或开始试用以查看此内容。

方案

MS/MS 质谱数据来自去标识化的残余 PTF 样本,这些样本的采集过程遵循机构审查委员会批准的指南和规定,如前所述21,29,30

注意:图1 展示了完整工作流程的概览,该流程包含五个模块。补充表1 总结了所有输入、输出及软件工具。

临床宏蛋白质组学工作流程图;数据库生成、发现、验证、定量。
图1:Galaxy平台内临床宏蛋白质组学工作流程模块概览。 完整的临床宏蛋白质组学工作流程包含五个模块:数据库生成、发现、验证、定量和数据解读。(A) 大型综合数据库包括被认为存在于样本中的微生物物种、人类以及常见污染物的蛋白质序列。MetaNovo软件工具将MS/MS谱图数据直接与肽段匹配,并基于原始质谱数据和大型输入蛋白质序列数据库推断出蛋白质及其来源生物体,从而构建一个缩减版数据库33。MetaNovo生成的缩减数据库随后与人类和污染物蛋白序列合并,形成用于肽段发现的数据库。(B) 两种肽段鉴定算法SearchGUI/PeptideShaker和MaxQuant将肽段序列与MS/MS谱图及目标-诱饵蛋白质数据库进行比对49。(C) SearchGUI/PeptideShaker和MaxQuant鉴定出的肽段接下来由PepQuery2进行验证。PepQuery2严格地重新检查假定鉴定的微生物肽段序列及其匹配的MS/MS谱图,排除与人类宿主蛋白质组和/或污染物可能存在的其他匹配,从而确认高可信度的微生物匹配结果40,41。经验证的肽段用于构建经验证的蛋白质序列数据库,该数据库将用于后续的肽段和蛋白质定量。(D) MaxQuant42利用经验证的蛋白质序列数据库对MS/MS数据进行搜索,并对微生物肽段及推断出的蛋白质以及人类蛋白质进行定量。(E) 在最后一步中,使用Unipept45和MSstatsTMT46对蛋白质进行注释,提供分类学信息和功能信息(酶学委员会登录号),并生成火山图和比较图。 请点击此处查看此图的放大版本。

1. TMT 标记及 MS/MS 谱图的生成

  1. 为准备质谱分析,请按照相关指南和法规进行临床样本采集。
    注意:由于本方案重点在于生物信息学工作流程,临床样本采集的具体步骤可能与本文所用方法有所不同。在此,蛋白质经胰蛋白酶消化生成肽段混合物,随后进行标记、分级,并通过质谱分析以产生用于后续 Galaxy 平台分析的 MS/MS 谱图数据。详细的样本处理步骤此前已由 Boylan 等人29 和 Afiuni-Zadel 等人30 描述。
  2. 从临床样本中分离蛋白质,并使用胰蛋白酶将其消化为肽段29,30
  3. 使用串联质谱标签(Tandem Mass Tag, TMT)-11-plex 试剂对蛋白质进行标记。该标记试剂有助于肽段和蛋白质的定量31,32
    1. 将标记后的样本随机且均等地分为四个基于 TMT 的实验组。
    2. 在每个实验组中,包含一个使用独特 TMT 标签标记的混合参考样本,作为共同参考,用于与四个实验组中的各个单独样本进行比较31,32
  4. 对混合样本进行高 pH 反相液相色谱(RPLC)离线分级29,30
  5. 通过杂交四极杆-Orbitrap 质谱仪进行液相色谱-串联质谱(LC-MS/MS)分析29,30。将生成的 MS/MS 谱图数据保存为 Thermo Raw 格式(thermo.raw)。
    注意:根据需要,Thermo Raw 文件将被转换为 Mascot 通用格式(.mgf),以兼容多种软件。在本文中,缩写“RAW”和“MGF”表示输入 MS/MS 数据集的文件格式。在图示中,MS/MS 数据集为简化起见均以相同的 RAW 图标表示。

2. 模块设置

注意:按钮/菜单选择项以粗体标出。示例文件、工作流程及工具参数可通过补充表格获取。有关如何使用 Galaxy 的更多信息,请访问 GTN 常见问题页面(https://training.galaxyproject.org/training-material/faqs/galaxy/)。

  1. Galaxy 欧洲服务器
    1. 访问 Galaxy 欧洲服务器(Galaxy EU;https://usegalaxy.eu/)。
    2. 创建账户或登录。创建新账户需要提供有效的电子邮件地址。以用户身份登录以使用 Galaxy。
  2. 准备 Galaxy 历史记录
    1. 如果用户从 补充表 2 导入示例输入,请执行步骤 2.2.1.1–2.2.1.3。
      1. 使用 补充表 2 中提供的链接打开示例 Galaxy 历史记录。
      2. 点击(中心)面板左上角的灰色 导入此历史记录 按钮。重命名历史记录并点击 复制历史记录。如需,可通过点击最左侧面板中的 上传 按钮并添加待上传文件,将用户的数据集添加到该历史记录中。
      3. 点击 开始 > 关闭。上传的文件将出现在右侧的历史记录面板中。在使用前,请等待数据集颜色变为绿色。
        注意:如果导入(复制)现有历史记录,则无需创建单独的(新)历史记录。
    2. 如果用户正在创建新历史记录并上传其数据,请执行步骤 2.2.2.1–2.2.2.2。
      1. 在历史记录面板(右侧),点击 +(加号)图标 一次,创建一个名为“未命名历史记录”的新历史记录。点击历史记录旁边的 铅笔图标,然后点击 保存。向现有(示例)历史记录添加数据集的相同步骤也适用于上传用户自己的数据。
      2. 在最左侧面板中,点击 上传 并添加待上传文件。点击 开始 > 关闭。上传的文件将出现在新历史记录中。请等待数据集颜色变为绿色。
    3. 如果用户同时分析多个 MS/MS 文件,请执行步骤 2.2.3.1–2.2.3.3。
      1. 将它们放入数据集集合中,以便将其作为一个输入进行选择。点击历史记录面板上的 勾选图标 并选择(勾选)数据集。
      2. 点击显示已选数据集数量的按钮(例如,“8 个中已选 4 个”),在下拉菜单中点击 构建数据集列表。在弹出窗口中,为集合输入名称(例如,MGF 数据、RAW 数据)。如需,可选择在集合创建后是否隐藏原始数据集。
      3. 点击弹出窗口右下角的蓝色 创建集合 按钮。点击历史记录面板中的 勾选图标 以取消选择数据集。
        注意:为提升用户体验,每个五个模块应在各自独立的(导入或新建的)Galaxy 历史记录中运行。为避免重复,后续模块说明将省略设置步骤,仅聚焦于工作流操作。
  3. 导入并运行工作流
    注意:强烈建议所有用户(无论使用示例数据还是自身数据)使用和/或调整带有预设参数的模块化工作流(补充表 2)。这样做可避免用户逐一查找并设置每个工具的参数。如需,用户可通过点击最左侧面板的 工具 按钮,并在相邻面板的搜索栏中尽可能准确地输入工具名称来查找工具。匹配的工具将自动弹出。点击正确的搜索结果并设置相应参数(参见 补充文件 1)。在运行工具前,用户可通过选择参数末尾附近的按钮设置电子邮件通知,以便在任务完成后收到提醒。为方便起见,有两个 运行 按钮:一个位于中心面板的右上角,另一个位于参数字段之后。补充表 3 提供了额外的培训资源。工具版本及数据库在撰写本文时(2024 年 6 月)为当前且可正常运行,但随着 Galaxy 及相关工具和数据库的更新,可能会发生变化。
    1. 使用 补充表 2 中的链接在新标签页中打开工作流。
      1. 点击面板右上角的 导入 按钮。将打开一个新标签页,其中出现一个绿色确认框,表明工作流已成功导入。绿色框中还将包含两个选项:立即开始使用此工作流 返回上一页
      2. 点击第一个按钮(“立即开始使用此工作流…”),以在界面中心面板中打开 工作流 标签页,该页面显示所有已存储的工作流。找到刚刚导入的工作流,点击蓝色 播放(三角形)按钮。这将显示输入字段。
        ​注意:对于每个提供的工作流,输入字段对应于示例输入(补充表 2)。如果用户正在分析自身数据,应相应命名其输入,以确保每个模块使用正确的文件。
    2. 如果用户希望在 Galaxy EU 服务器上查看工作流,请执行步骤 2.3.2.1–2.3.2.4。
      1. 点击 Galaxy 网站顶部栏中的 工作流 按钮。在此标签页内,点击子标签页 我的工作流 以显示所有已导入的工作流。要查看某个工作流,点击带有 铅笔 图标的 编辑 按钮以打开工作流编辑器。
      2. 在工作流编辑器中,可与工作流进行交互,例如点击并拖动以重新排列、点击工具以查看其设置、更改参数等。完成修改后,通过点击右侧面板顶部的 磁盘图标 保存已编辑的工作流;如需,可通过点击右侧面板顶部的 播放图标 运行工作流。
      3. 创建用户特定的工作流以分析自定义输入数据。根据用户对宏蛋白质组学的了解程度及使用 Galaxy 平台的经验,构建工作流并分析数据。
      4. 如果用户经验较少,可在历史记录中测试各种工具,然后从已完成的分析中提取工作流。
        注意:此提取的工作流可扩展、修订和重复使用,使用户能够准确复现其工作。更详细的说明可在 GTN 网站的工作流常见问题解答部分找到(https://training.galaxyproject.org/training-material/faqs/galaxy/#workflows)。
    3. 点击每个输入字段并选择适当的输入。第 3 至第 7 节描述了各模块的输入。检查所有输入是否为可接受格式,以避免错误。点击每个输入字段下方的 可接受格式 以确认所有文件是否与工具兼容。完成后,点击 运行工作流
      注意:如果用户更倾向于手动设置工具,GTN 网站(https://gxy.io/GTN:P00019)提供了本临床宏蛋白质组学工作流各模块的教程材料。补充表 2 中列出了关键工具的预计运行时间,但实际运行时间取决于输入数据大小、工具依赖项(如内存需求与分配内存的比较)、计划维护时间、错误等因素。作业状态通过数据集颜色表示:当选择(点击)数据集时,将显示一条消息,说明作业处于等待排队(灰色)、运行中(橙色)或失败(红色)状态。作业完成后,数据集将变为绿色(无确认消息)。用户可选择启用电子邮件通知以在作业完成时收到提醒(参见步骤 2.3 开头的注意说明)。以下模块说明将省略明确的设置步骤(因其对每个模块均相同,如有需要可参见第 2 节及 GTN 常见问题解答),仅描述各模块的关键工具。完整工具列表见 补充表 1。工具名称已加粗。作为参考,所有工具名称、版本和描述均包含在 材料表 中。如果用户运行来自 补充表 2 的示例工作流,请参考每步末尾括号中包含的示例文件名。如果用户独立运行工具,则可忽略示例文件名。要重命名数据集,请点击数据集右上角的 铅笔图标。在“名称”字段中输入新名称,然后点击 保存

3. 模块1:蛋白质序列数据库生成

注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块1,请导入用于数据库生成的输入和工作流程。补充表2的输出列中包含已完成的输出历史记录示例,可供参考。对于所有模块,相应的GTN教程可在补充表3中找到。

  1. 整理与目标疾病或状况和/或样本采集部位相关的物种列表。
    1. 通过文献回顾获取该物种列表。或者,如果样本已被先前分析过,则从 16S rRNA 或宏基因组测序结果中获取该物种列表。
    2. 将该物种列表保存为表格文件(例如,Species.tabular)。
      注意:利用该物种列表,将生成一个包含已知致病微生物蛋白序列的大型综合数据库;随后使用 MetaNovo,将此包含数百万条蛋白序列的大型数据库缩减为一个更易于处理的数据库,仅保留样本中存在的蛋白。数据库缩减步骤至关重要,因为许多数据库搜索工具无法处理数百万条序列。缩减后的数据库将与人源蛋白和污染蛋白合并,生成一个紧凑型数据库,用于下一模块(第4节)中的肽段鉴定。
  2. 以物种列表(Species.tabular)作为输入,用于 UniProt (下载蛋白质组 fasta 格式),生成蛋白序列数据库(Species UniProt FASTA.fasta)。
  3. 运行 Protein Database Downloader ,生成另外两个蛋白序列数据库:人源 SwissProt(仅限已审阅条目)和污染蛋白数据库(Human SwissProt Protein Database.fasta, Contaminants [cRAP] Protein Database.fasta)。污染蛋白也称为常见外源蛋白库(common Repository of Adventitious Proteins),简称 cRAP。
  4. 将上述三个蛋白数据库作为输入,用于 FASTA Merge Files and Filter Unique Sequences,去除重复序列,生成一个大型蛋白序列数据库(Human UniProt Microbial Proteins cRAP for MetaNovo.fasta)。
  5. 以第3.4步生成的大型(综合)数据库和质谱数据集(MGF)作为输入,运行 MetaNovo33,生成一个缩减后的数据库(MetaNovo Compact Database.fasta)。
  6. 对 MetaNovo 生成的数据库、人源 SwissProt(仅限已审阅条目)以及 cRAP 数据库运行 FASTA Merge Files and Filter Unique Sequences,生成一个缩减后的(目标)数据库,包含微生物、人源及污染蛋白序列,用于后续肽段检测(Human UniProt Microbial Proteins [from MetaNovo] and cRAP.fasta)。

4. 模块2:通过数据库搜索进行肽段发现

注意:如果用户希望使用示例输入和工作流程 补充表 2,务必遵循第2节中的说明。对于模块2,导入DISCOVERY的输入数据和工作流程。所有模块对应的GTN教程均可在 补充表3. SearchGUI34,35,36 和 PeptideShaker37 是独立的软件,但由于它们通常配合使用,因此被视为一个肽段鉴定与分析程序。为确保软件兼容性,将使用 msconvert 工具(在提供的工作流程中)将 MS/MS 数据集从 RAW 格式转换为 SearchGUI/PeptideShaker 可用的 MGF 格式。MaxQuant38 能够处理 RAW 文件。

  1. 运行 FastaCLI ,将诱饵蛋白序列添加到缩减后的(目标)数据库中,以生成目标-诱饵蛋白序列数据库(FastaCLI MetaNovo Human SwissProt cRAP with decoys.fasta)。
    注意:FastaCLI 仅在使用 SearchGUI/PeptideShaker 时需要运行。MaxQuant 可以自行向蛋白序列数据库中添加诱饵序列和污染物序列。此处的缩减数据库已包含污染物序列(cRAP),因此 MaxQuant 已设置为仅添加诱饵序列。
  2. 运行 SearchGUI/PeptideShaker MaxQuant ,将质谱数据集与缩减数据库进行比对,以鉴定肽段,并最终通过数据库搜索将其归属至相应的蛋白序列。工具参数详见 补充表 4
    注意:本研究将使用两个肽段鉴定程序(SearchGUI/PeptideShaker 和 MaxQuant),通过序列数据库搜索来鉴定肽段和蛋白序列。这些程序可在 MS/MS 谱图中识别肽段,并在蛋白序列数据库中进行搜索,匹配观测到的与理论上的肽段数据,包括肽段质量及谱图信息。在后续模块中,将使用 PepQuery2 对已鉴定的肽段进行验证,以确认获得的是微生物来源的肽段(第 5 节)。
    1. 运行 SearchGUI ,生成包含肽段谱图匹配(PSM)的归档文件(Search GUI on data [#].searchgui_archive)。
    2. 将 SearchGUI 生成的归档文件作为输入,用于 PeptideShaker,以生成 PSM 报告、肽段报告和蛋白报告(Peptide Shaker on data [#]: [report name].tabular)。
    3. 运行 MaxQuant ,生成 Protein Groups 和 Peptides 文件(MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular)。
      注意:MaxQuant 需要一个实验设计文件,其中包含实验条件、样本分组以及样本之间的关系(Experimental Design Discovery MaxQuant.tabular)。该文件用于指导 MaxQuant 如何组织和分析质谱数据。示例文件见 补充表 5。若使用用户自身的数据,用户必须修改此文件以匹配其质谱数据集。
  3. 使用文本处理工具管理两个程序的输出结果。查看 补充表 2 中的 DISCOVERY 工作流程,了解适用于 SearchGUI/PeptideShaker 和 MaxQuant 的具体工具。
    注意:以下文本处理工具均在 Galaxy 平台中实现。关键工具已在下文标出,强烈建议用户参考 DISCOVERY 工作流程,以了解本文未涵盖的其他可用工具。查看工作流程的操作说明见第 2 节。
    1. 选择 微生物匹配结果(从 SGPS 中选择微生物 PSMs.tabular,选择微生物肽段 (MQ).tabular)。
    2. 使用 Filter Query Tabular39 筛选高置信度 PSM,并查询其蛋白登录号(Filter confident microbial PSMs.tabular,query results on data [# and #].tabular)。
    3. 使用 Cut 提取肽段序列,形成新的数据集(Cut on data [#].tabular)。
    4. 使用 Group 获取每个程序的唯一条目(例如,唯一的肽段序列)(MQ Peptides.tabular, SGPS Distinct Peptides.tabular)。
  4. 合并 两个肽段列表,形成单一数据集(SGPS-MQ Peptides.tabular)。
  5. 分组 以去除重复的肽段序列。最终得到的非冗余微生物肽段列表将用于 PepQuery2 验证(Distinct Peptides.tabular)。

5. 模块3:微生物肽的验证

注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块2,需导入用于验证(VERIFICATION)的输入文件和工作流程。对于所有模块,相应的GTN教程可在补充表3中找到。

  1. 使用以下内容作为 PepQuery240,41 的输入:不同的微生物肽列表(Distinct Peptides for PepQuery.tabular);质谱数据集(MGF);人类 UniProt 参考数据库(包含异构体)(Human UniProt+Isoforms FASTA.fasta)以及 cRAP 蛋白质序列数据库(cRAP.fasta)。参见补充表6中的参数。
    注意:验证肽段和蛋白质的存在对于获得准确数据并深入理解生物系统的蛋白质组至关重要。PepQuery2 能够以高灵敏度和特异性验证感兴趣的新型、疾病特异性肽段。已鉴定的微生物肽段(来自模块2)将比对人类和污染物蛋白序列,以确认其微生物来源(避免将人类肽段错误指认)。经验证的肽段将用于构建已验证蛋白的序列数据库,这对于在后续模块(第6节)进行蛋白定量时减少假阳性至关重要。
    1. 每个作为输入的 MS/MS 数据集将生成一个 PSM 排名文件(PepQuery2 on collection [#]: psm_rank.tabular)。对所有 PSM 排名文件运行合并集合(Collapse Collection),生成一个整合的数据集(Collapse Collection on data [#] .tabular),然后使用筛选(Filter)保留可信的 PSM(Filter on [PSM rank collection].tabular)。
    2. 运行移除开头(Remove beginning)以排除列标题,并使用切割(Cut)提取已验证的肽段序列,形成新的数据集。
  2. 对 SearchGUI/PeptideShaker 和 MaxQuant 生成的肽段报告(SGPS Peptide Report.tabular, MaxQuant Peptide Report.tabular)运行切割(Cut),分别提取肽段序列和蛋白条目,形成新的肽-蛋白数据集(每个程序各一个),并使用移除开头(Remove beginning)排除列标题。
  3. 合并(Concatenate)两个程序的肽段序列和蛋白条目,创建一个新的(整合)肽-蛋白数据集。
  4. 在整合的肽-蛋白数据集和已验证肽段之间运行查询表格(Query Tabular),以将已验证的肽段与其对应的蛋白条目进行关联(Peptide and Protein from Peptide Reports.tabular)。蛋白条目以其蛋白登录号(即 UniProt ID)进行编目。
  5. 分组(Group)以保留唯一的已验证肽段及其对应的 UniProt ID。
  6. 运行查询表格(Query Tabular)提取 UniProt ID(UniProt-ID from verified Peptides.tabular)。
  7. 将 UniProt ID 输入UniProt,获取其对应的蛋白序列,构建新的数据库(UniProt.fasta)。
  8. 对由 UniProt 生成的蛋白序列数据库、人类 UniProt 数据库(含异构体)以及污染物数据库运行FASTA 文件合并与唯一序列筛选(FASTA Merge Files and Filter Unique Sequences),生成用于肽段定量的已验证数据库(Quantitation Database for MaxQuant.fasta)。

6. 模块4:MaxQuant 定量分析

注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块2,请导入用于定量分析(QUANTIFICATION)的输入文件和工作流程。对于所有模块,相应的GTN教程可在补充表3中找到。

  1. 使用已验证的蛋白质序列数据库和质谱数据集(RAW)作为 MaxQuant42 的输入。
    注意:请记住,MaxQuant 需要实验设计文件,该文件可与用于肽段鉴定的文件(步骤 4.2)相同。根据需要更改文件名。必须使用前一模块中生成的已验证数据库,以减少蛋白质定量过程中的假阳性结果。蛋白质定量使研究人员能够测量并比较生物样本中肽段和蛋白质的丰度。此步骤对于理解不同条件下蛋白质表达差异至关重要,有助于揭示定量变化的规律。
    1. 生成证据文件、蛋白质组文件和肽段文件(MaxQuant Evidence.tabular,MaxQuant Protein Groups.tabular,MaxQuant Peptides.tabular)。
  2. 选择 MaxQuant 肽段文件中的微生物肽段(Select microbial peptides.tabular)。
  3. 截取 仅包含微生物肽段序列的数据(Cut on data [#].tabular)。
  4. 分组 以获得定量的微生物肽段列表(Quantified Peptides.tabular)。

7. 模块5:数据分析与解释

注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块2,需导入用于数据解读(DATA INTERPRETATION)的输入文件和工作流程。对于所有模块,相应的GTN教程可在补充表3中找到。本模块将使用上一模块中MaxQuant定量分析的输出结果,通过Unipept进行分类学和功能注释,并利用MSstatsTMT进行统计分析。Unipept可帮助研究人员识别和量化多种环境中的微生物,并能与公共数据库(如UniProt)整合以获取最新的注释信息。MSstatsTMT则专为基于TMT标记的质谱定量蛋白质组学数据的稳健统计分析而设计。

  1. 将定量的微生物肽段列表(Quantified Peptides.tabular)作为输入 Unipept43,44,45 进行分类学和功能注释。参见 补充表7 用于参数和输出列表。
  2. Unipept 输出的相关结果包括微生物分类树和微生物酶委员会(EC)蛋白质树(Microbial Taxonomy Tree.d3_hierarchy,Microbial EC Proteins Tree.d3_hierarchy)。
    1. 要查看树状图,点击数据集以打开选项。然后点击 可视化 (4th 左侧的选项 > Unipept 分类学查看器.
    2. 要查看表格中的分类学和功能注释(Unipept peptinfo.tabular):单击 眼睛图标 在数据集的右上角。滚动查看每一行对应的肽段及其在不同列中的信息。
  3. 在使用 MSstatsTMT 进行统计分析之前,运行 选择 在 MaxQuant 蛋白质组文件上操作,生成两个新的数据集:微生物蛋白和人类蛋白(Microbial Proteins.tabular,Human Proteins.tabular)。蛋白质具有标明其来源的分类学标签。
    1. 通过标签排除污染物蛋白con_."
    2. 保留指定为微生物(例如,“_9LACO”)和人类(“_HUMAN”)标签的微生物和人类蛋白质(Microbial-Proteins.tabular,Human-Proteins.tabular)。
  4. MSstatsTMT42,46,47 将用于进行统计分析。使用 MaxQuant Evidence 文件(来自模块 4)以及上一步筛选出的微生物蛋白(或人类蛋白)作为输入。该工作流程优先分析微生物蛋白,但也提供对人类蛋白进行表征的选项。参见 补充表 8 用于参数和输出列表。
    注意:MSstatsTMT 需要一个注释文件和一个比较矩阵(也称为对比矩阵)。注释文件将决定定量数据的合并方式,而比较矩阵将用于容纳不同的样本组。这些文件的示例已包含在内(Annotation.tabular,Comparison Matrix.tabular) 补充表 9 补充表10.
  5. MSstatsTMT 输出结果中的关键内容是微生物蛋白的火山图和比较图(Microbial Proteins Volcano Plot.pdf,Microbial Proteins Comparison.pdf)。通过点击可查看这些图表 眼睛图标 数据集的右上角

访问受限。请登录或开始试用以查看此内容。

结果

本文所述通用方案已在从部分 PTF 样本获得的 MS/MS 文件上进行了验证21。Do 等人21分析了四个 PTF 样本的 MS/MS 文件,这些样本的采集遵循了 Boylan 等人29以及 Afiuni-Zadel 等人30所描述的操作流程。该工作流程优先关注微生物蛋白,但同时具备并行分析人类蛋白与微生物蛋白的灵活性21。该工作流程及其多种变体已在其他研究中得到应用6,20

为了整理一份相关物种的列表,Do 等人从一项先前研究中选取了118个分类学物种,该研究曾探讨宫颈-阴道微生物组30。该列表包含117种细菌以及酵母菌Candida albicans

访问受限。请登录或开始试用以查看此内容。

讨论

临床宏蛋白质组学研究为临床研究提供了潜在的突破,但其实施过程中仍存在诸多挑战。在大多数样本中,微生物蛋白的丰度远低于宿主蛋白,这阻碍了非宿主蛋白的检测与表征6,10。准确鉴定和定量肽段及蛋白质依赖于庞大的蛋白质序列数据库,同时在对已鉴定的肽段和蛋白质进行分类学和功能注释以实现定量和统计分析时也面临复杂性,这些均构成了技术障碍1,3。本研究在Galaxy生物信息学平台中建立的临床宏蛋白质组学工作流程,可有效应对上述多项挑战。该流程使研究人员能够分析其质谱(MS)数据,生成针对其临床样本定制的蛋白质序列数据库,并利用多种搜索算法将MS/MS数据与蛋白质序列数据库进行匹配。通过纳入对假定微生物肽段匹配结果与MS/MS谱图的验证步骤,提高了所鉴定肽段及推断蛋白质的可信度,并支持其定量、可视化以及分类学归属和功能注释的分配,进而开展统计分析。

串联质谱标签(T...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明无利益冲突。

致谢

我们感谢明尼苏达大学的 Amy Skubitz 博士和 Kristin Boylan 博士提供的初步数据集,以及美国西北太平洋国家实验室(PNNL)的 Paul Piehowski 博士、Tao Liu 博士和 Karin Rodland 博士在样本采集、PTF 样本处理以及本研究中所用 TMT 标记质谱数据生成方面的专业支持。本项目部分由明尼苏达卵巢癌联盟(MOCA)、美国国立卫生研究院/国家癌症研究所资助,资助编号:5R01CA262153(A.P.N.S.)、1R21CA267707(P.D.J. 和 T.J.G.),以及美国国立卫生研究院/国家癌症研究所资助编号:P30CA077598(P.D.J. 和 T.J.G.)支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
合并数据集列表集合为单个文件(按列表顺序)GalaxyPGalaxy 版本 5.1.1将数据集列表集合合并为一个文件(按列表顺序)
连接数据集GalaxyPGalaxy 版本 0.1.1将文件首尾相连进行拼接
剪切GalaxyPGalaxy 版本 1.0.2从文件中剪切(选择)指定的列
FASTA 合并文件并筛选唯一序列GalaxyPGalaxy 版本 1.2.0将多个 FASTA 数据库文件合并在一起
FastaCLIGalaxyPGalaxy 版本 4.0.41+galaxy1向 FASTA 文件追加诱饵序列
FASTA 转表格GalaxyPGalaxy 版本 1.1.0将 FASTA 格式的序列转换为制表符分隔格式
筛选GalaxyPGalaxy 版本 1.1.1使用简单表达式筛选列
筛选表格文件GalaxyPGalaxy 版本 3.3.0通过行筛选条件过滤表格文件
Galaxy 欧洲(EU)服务器GalaxyPhttps://usegalaxy.eu/
分组GalaxyPGalaxy 版本 2.1.4按特定列对文件进行分组并执行聚合函数
鉴定参数设置GalaxyPGalaxy 版本 4.0.41+galaxy1为 SearchGUI/PeptideShaker 设置鉴定参数
学习路径:Galaxy 中的临床宏蛋白质组学工作流程GalaxyPhttps://training.galaxyproject.org/training-material/learning-pathways/clinical-metaproteomics.html
MaxQuantGalaxyPGalaxy 版本 2.0.3.0+galaxy0(发现模块);Galaxy 版本 1.6.17.0+galaxy4(定量模块)用于分析大规模质谱数据文件的定量蛋白质组学软件包
MetaNovoGalaxyPGalaxy 版本 1.9.4+galaxy4将 MS/MS 数据与已知蛋白质的 FASTA 数据库进行比对,生成用于质谱分析的靶向数据库(匹配的蛋白质)
msconvertGalaxyPGalaxy 版本 3.0.20287.2转换和/或过滤质谱文件
MSstatsTMTGalaxyPGalaxy 版本 2.0.0+galaxy1基于 R 的软件包,用于在基于串联质谱标签(TMT)标记的 shotgun 质谱蛋白质组学实验中检测差异丰度蛋白
PepQuery2GalaxyPGalaxy 版本 2.0.2+galaxy0以肽段为中心的搜索引擎,用于鉴定和/或验证目标已知或新肽段
PeptideShakerGalaxyPGalaxy 版本 2.0.33+galaxy1解析 SearchGUI 的结果以实现蛋白质鉴定
蛋白质数据库下载器GalaxyPGalaxy 版本 0.3.4将指定的蛋白质序列下载为 FASTA 文件
查询表格文件GalaxyPGalaxy 版本 3.3.0将表格文件加载到 SQLite 数据库中
移除开头部分GalaxyPGalaxy 版本 1.0.0从文件中移除指定数量的(标题)行
SearchGUIGalaxyPGalaxy 版本 4.0.41+galaxy1在 MGF 峰值列表上运行搜索引擎,并将结果准备为 PeptideShaker 的输入
选择GalaxyPGalaxy 版本 1.0.4选择匹配表达式的行
UnipeptGalaxyPGalaxy 版本 4.5.1检索胰蛋白酶肽段对应的 UniProt 条目及分类学信息
UniProtGalaxyPGalaxy 版本 2.3.0从 UniProtKB 下载蛋白质组为 XML(UniProtXML)或 FASTA 文件

参考文献

  1. Zhang, X., Li, L., Butcher, J., Stintzi, A., Figeys, D. Advancing functional and translational microbiome research using meta-omics approaches. Microbiome. 7 (1), 154(2019).
  2. Van Den Bossche, T., et al. The Metaproteomics Initiative: a coordinated approach for propelling the functional characterization of microbiomes. Microbiome. 9 (1), 243(2021).
  3. Tanca, A., et al. Evaluating the impact of different sequence databases on metaproteome analysis: insights from a lab-assembled microbial mixture. PloS One. 8 (12), e82981(2013).
  4. Seifert, J., et al. Bioinformatic progress and applications in metaproteogenomics for bridging the gap between genomic sequences and metabolic functions in microbial communities. Proteomics. 13 (18-19), 2786-2804 (2013).
  5. Muth, T., Renard, B. Y., Martens, L. Metaproteomic data analysis at a glance: advances in computational microbial community proteomics. Expert Rev Proteomics. 13 (8), 757-769 (2016).
  6. Bihani, S., et al. Metaproteomic analysis of nasopharyngeal swab samples to identify microbial peptides in COVID-19 patients. J Proteome Res. 22 (8), 2608-2619 (2023).
  7. Ayan, E., DeMirci, H., Serdar, M. A., Palermo, F., Baykal, A. T. Bridging the Gap between Gut Microbiota and Alzheimer's Disease: A metaproteomic approach for biomarker discovery in transgenic mice. Int J Mol Sci. 24 (16), 12819(2023).
  8. Levi Mortera, S., et al. A metaproteomic-based gut microbiota profiling in children affected by autism spectrum disorders. J Proteomics. 251, 104407(2022).
  9. Long, S., et al. Metaproteomics characterizes human gut microbiome function in colorectal cancer. NPJ Biofilms Microbiomes. 6 (1), 14(2020).
  10. Hardouin, P., Chiron, R., Marchandin, H., Armengaud, J., Grenga, L. Metaproteomics to Decipher CF Host-Microbiota interactions: Overview, challenges and future perspectives. Genes (Basel). 12 (6), 892(2021).
  11. Levi Mortera, S., et al. Functional and taxonomic traits of the gut microbiota in Type 1 diabetes children at the onset: A metaproteomic study. Int J Mol Sci. 23 (24), 15982(2022).
  12. Gonzalez, C. G., et al. Location-specific signatures of Crohn's disease at a multi-omics scale. Microbiome. 10 (1), 133(2022).
  13. Thuy-Boun, P. S., et al. Metaproteomics analysis of SARS-CoV-2-infected patient samples reveals presence of potential coinfecting microorganisms. J Proteome Res. 20 (2), 1451-1454 (2021).
  14. Grenga, L., et al. Taxonomical and functional changes in COVID-19 faecal microbiome could be related to SARS-CoV-2 faecal load. Environ Microbiol. 24 (9), 4299-4316 (2022).
  15. Biemann, R., et al. Fecal metaproteomics reveals reduced gut inflammation and changed microbial metabolism following lifestyle-induced weight loss. Biomolecules. 11 (5), 726(2021).
  16. Gómez-Varela, D., Xian, F., Grundtner, S., Sondermann, J. R., Carta, G., Schmidt, M. Increasing taxonomic and functional characterization of host-microbiome interactions by DIA-PASEF metaproteomics. Front Microbiol. 14, 1258703(2023).
  17. Jagtap, P. D., et al. BAL fluid metaproteome in acute respiratory failure. Am J Respir Cell Mol Biol. 59 (5), 648-652 (2018).
  18. Masson, L., Wilson, J., Amir Hamzah, A. S., Tachedjian, G., Payne, M. Advances in mass spectrometry technologies to characterize cervicovaginal microbiome functions that impact spontaneous preterm birth. Am J Reprod Immunol Microbiol. 90 (2), e13750(2023).
  19. Bankvall, M., et al. Metataxonomic and metaproteomic profiling of the oral microbiome in oral lichen planus - a pilot study. J Oral Microbiol. 15 (1), 2161726(2023).
  20. Kruk, M. E., et al. An integrated metaproteomics workflow for studying host-microbe dynamics in bronchoalveolar lavage samples applied to cystic fibrosis disease. mSystems. 9 (7), e0092923(2024).
  21. Do, K., et al. A novel clinical metaproteomics workflow enables bioinformatic analysis of host-microbe dynamics in disease. mSphere. 9 (6), e00793-e00823 (2024).
  22. Batut, B., et al. Community-driven data analysis training for biology. Cell Syst. 6 (6), 752-758.e1 (2018).
  23. Hiltemann, S., et al. Galaxy Training: A powerful framework for teaching. PLoS Comput Biol. 19 (1), e1010752(2023).
  24. Galaxy Community. The Galaxy platform for accessible, reproducible, and collaborative data analyses: 2024 update. Nucleic Acids Res. 52 (W1), W83-W94 (2024).
  25. Blankenberg, D., et al. Dissemination of scientific software with Galaxy ToolShed. Genome Biol. 15 (2), 403(2014).
  26. Blank, C., et al. Disseminating metaproteomic informatics capabilities and knowledge using the Galaxy-P framework. Proteomes. 6 (1), E7(2018).
  27. Mehta, S., et al. A Galaxy of informatics resources for MS-based proteomics. Expert Rev Proteomics. 20 (11), 251-266 (2023).
  28. Armengaud, J. Metaproteomics to understand how microbiota function: The crystal ball predicts a promising future. Environ Microbiol. 25 (1), 115-125 (2023).
  29. Boylan, K. L., et al. A feasibility study to identify proteins in the residual Pap test fluid of women with normal cytology by mass spectrometry-based proteomics. Clin Proteomics. 11 (1), 30(2014).
  30. Afiuni-Zadeh, S., et al. Evaluating the potential of residual Pap test fluid as a resource for the metaproteomic analysis of the cervical-vaginal microbiome. Sci Rep. 8 (1), 10868(2018).
  31. Rauniyar, N., Yates, J. R. Isobaric labeling-based relative quantification in shotgun proteomics. J Proteome Res. 13 (12), 5293-5309 (2014).
  32. Sivanich, M. K., Gu, T. -J., Tabang, D. N., Li, L. Recent advances in isobaric labeling and applications in quantitative proteomics. Proteomics. 22 (19-20), e2100256(2022).
  33. Potgieter, M. G., et al. MetaNovo: An open-source pipeline for probabilistic peptide discovery in complex metaproteomic datasets. PLoS Comput Biol. 19 (6), e1011163(2023).
  34. Vaudel, M., Barsnes, H., Berven, F. S., Sickmann, A., Martens, L. SearchGUI: An open-source graphical user interface for simultaneous OMSSA and X!Tandem searches. Proteomics. 11 (5), 996-999 (2011).
  35. Kim, S., Pevzner, P. A. MS-GF+ makes progress towards a universal database search tool for proteomics. Nat Commun. 5, 5277(2014).
  36. Barsnes, H., Vaudel, M. SearchGUI: A highly adaptable common interface for proteomics search and de novo engines. J Proteome Res. 17 (7), 2552-2555 (2018).
  37. Vaudel, M., et al. PeptideShaker enables reanalysis of MS-derived proteomics data sets. Nature Biotechnol. 33 (1), 22-24 (2015).
  38. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  39. Johnson, J. E., et al. Improve your Galaxy text life: The Query Tabular Tool. F1000Res. 7, 1604(2018).
  40. Wen, B., Wang, X., Zhang, B. PepQuery enables fast, accurate, and convenient proteomic validation of novel genomic alterations. Genome Res. 29 (3), 485-493 (2019).
  41. Wen, B., Zhang, B. PepQuery2 democratizes public MS proteomics data for rapid peptide searching. Nat Commun. 14 (1), 2213(2023).
  42. Pinter, N., et al. MaxQuant and MSstats in Galaxy enable reproducible cloud-based analysis of quantitative proteomics experiments for everyone. J Proteome Res. 21 (6), 1558-1565 (2022).
  43. Mesuere, B., Willems, T., Van Der Jeugt, F., Devreese, B., Vandamme, P., Dawyndt, P. Unipept web services for metaproteomics analysis. Bioinformatics. 32 (11), 1746-1748 (2016).
  44. Gurdeep Singh, R., et al. Unipept 4.0: Functional analysis of metaproteome data. J Proteome Res. 18 (2), 606-615 (2019).
  45. Verschaffelt, P., Collier, J., Botzki, A., Martens, L., Dawyndt, P., Mesuere, B. Unipept Visualizations: an interactive visualization library for biological data. Bioinformatics. 38 (2), 562-563 (2022).
  46. Huang, T., et al. MSstatsTMT: Statistical detection of differentially abundant proteins in experiments with isobaric labeling and multiple mixtures. Mol Cell Proteomics. 19 (10), 1706-1723 (2020).
  47. Choi, M., et al. MSstats: an R package for statistical analysis of quantitative mass spectrometry-based proteomic experiments. Bioinformatics. 30 (17), 2524-2526 (2014).
  48. Jagtap, P., et al. Workflow for analysis of high mass accuracy salivary data set using MaxQuant and ProteinPilot search algorithm. Proteomics. 12 (11), 1726-1730 (2012).
  49. Eng, J. K., Searle, B. C., Clauser, K. R., Tabb, D. L. A face in the crowd: recognizing peptides through database search. Mol Cell Proteomics. 10 (11), R111.009522(2011).
  50. Bihani, S., et al. Metaproteomics for coinfections in the upper respiratory tract: The case of COVID-19. Methods Mol Biol. 2820, 165-185 (2024).
  51. Jagtap, P., et al. A two-step database search method improves sensitivity in peptide sequence matches for metaproteomics and proteogenomics studies. Proteomics. 13 (8), 1352-1357 (2013).
  52. O'Bryon, I., Jenson, S. C., Merkley, E. D. Flying blind, or just flying under the radar? The underappreciated power of de novo methods of mass spectrometric peptide identification. Protein Sci. 29 (9), 1864-1878 (2020).
  53. Elias, J. E., Gygi, S. P. Target-decoy search strategy for increased confidence in large-scale protein identifications by mass spectrometry. Nat Methods. 4 (3), 207-214 (2007).
  54. Kumar, D., Yadav, A. K., Dash, D. Choosing an optimal database for protein identification from tandem mass spectrometry data. Proteome Bioinformatics. 1549, 17-29 (2017).
  55. He, T., et al. Comparative evaluation of Proteome Discoverer and FragPipe for the TMT-based proteome quantification. J Proteome Res. 21 (12), 3007-3015 (2022).
  56. Searle, B. C., et al. Generating high quality libraries for DIA MS with empirically corrected peptide predictions. Nat Commun. 11 (1), 1548(2020).
  57. Easterly, C. W., et al. metaQuantome: An integrated, quantitative metaproteomics approach reveals connections between taxonomy and protein function in complex microbiomes. Mol Cell Proteomics. 18 (8 suppl 1), S82-S91 (2019).
  58. Lewis, M., et al. A Quantitative synthesis of early language acquisition using meta-analysis. , (2016).
  59. Bergmann, C., et al. Promoting replicability in developmental research through meta-analyses: Insights from language acquisition research. Child Dev. 89 (6), 1996-2009 (2018).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章