临床宏蛋白质组学为研究人类微生物组及其在疾病中的作用提供了深入见解。我们利用 Galaxy 平台的计算能力,开发了一种模块化的生物信息学工作流程,该流程可促进基于质谱的复杂宏蛋白质组学分析,并实现对多种与疾病研究相关的临床样本类型的表征。
临床宏蛋白质组学为研究人类微生物组及其在疾病中的作用提供了深入见解。我们利用 Galaxy 平台的计算能力,开发了一种模块化的生物信息学工作流程,该流程可促进基于质谱的复杂宏蛋白质组学分析,并实现对多种与疾病研究相关的临床样本类型的表征。
临床宏蛋白质组学揭示了宿主-微生物组相互作用在疾病中的基础作用。然而,该方法仍面临诸多挑战。特别是,相对于宿主蛋白,丰度较低的微生物蛋白的表征十分困难。另一个重要挑战源于使用非常庞大的蛋白质序列数据库,这不仅在从质谱数据中进行肽段和蛋白质鉴定时降低了灵敏度和准确性,还影响了分类学与功能注释的获取以及统计分析的执行。为解决这些问题,我们提出了一种整合的生物信息学工作流程,用于基于质谱的宏蛋白质组学分析,该流程结合了自定义蛋白质序列数据库构建、肽谱匹配生成与验证、定量分析、分类学和功能注释以及统计分析。该工作流程同时支持人类蛋白质的表征(在优先关注微生物蛋白质的前提下),从而提供对疾病中宿主-微生物相互作用动态的深入理解。这些工具和流程部署于Galaxy生态系统中,有助于开发、优化和共享这些计算资源。我们已将该工作流程应用于多种临床样本类型的宏蛋白质组学分析,例如鼻咽拭子和支气管肺泡灌洗液。在此,我们通过分析宫颈拭子残留液体来展示其应用价值。完整的工作流程及配套培训资源均可在Galaxy培训网络获取,旨在为非专业人员和经验丰富的研究人员提供分析其数据所需的知识与工具。
基于质谱(MS)的宏蛋白质组学可从临床样本中鉴定并定量微生物和人类蛋白质。该方法为理解微生物组对疾病反应提供了新的视角,并揭示了宿主-微生物组相互作用的潜在介质1,2。尽管临床样本的宏蛋白质组学分析能够揭示微生物组与其宿主环境之间的相互作用,但该领域仍面临诸多挑战。其中一个主要挑战是宿主(人类)蛋白质的相对丰度较高,这会阻碍对低丰度微生物蛋白质的鉴定。此外,基于质谱的宏蛋白质组学依赖于非常大的蛋白质序列数据库。这些数据库包含样本中存在的微生物蛋白组,可能导致数据库规模庞大,包含数百万条序列。在通过胰蛋白酶消化蛋白质生成串联质谱(MS/MS)谱图后,需将这些MS/MS谱图与大型蛋白质序列数据库进行比对,为每张谱图匹配相应的肽段序列(即肽段-谱图匹配,PSM)。然而,随着宏蛋白质组学所用数据库规模的增大,检测灵敏度下降,假阳性风险也随之增加3。此外,不同分类群间保守的蛋白质序列以及对编码蛋白质注释的不足,限制了对检测到的肽段和蛋白质进行分类学和功能注释的准确性4,5。本文提出了一种用于临床样本高效宏蛋白质组学分析的生物信息学工作流程,可应对上述诸多挑战,并为研究人员提供易于使用的软件资源,以探究人类疾病中宿主-微生物组动态关系的机制。
临床宏蛋白质组学已被用于研究多种样本类型,包括粪便和阴道拭子等,以解析疾病和病理状态中的致病机制6,7,8,9,10,11,12,13,14,15,16,17,18,19,20。本文中,我们采用宏蛋白质组学生物信息学工作流程,分析来自卵巢癌(OVCA)患者和非OVCA患者的宫颈脱落细胞检测液(PTF)样本中的一部分MS/MS数据21。所使用的软件工具和工作流程可通过Galaxy平台获取,该平台可简化复杂临床宏蛋白质组学工作流程的开发与执行22,23,24,25。Galaxy是一个开源平台,专为生物信息学和计算生物学设计,提供基于网络的环境,供学术研究人员使用开源工具和工作流程进行并共享复杂的数据分析。一个活跃的全球性软件开发者、数据科学家和终端用户社区维护着Galaxy生态系统,其中包括Galaxy培训网络(GTN;https://training.galaxyproject.org/), 该网络提供在线和按需培训资源22,23,24,25,26,27。我们的工作流程旨在揭示临床样本中宿主-微生物相互作用的新认知,并生成新颖且特征明确的肽段靶标,用于开发基于质谱的靶向临床检测方法,以进一步研究临床样本6,20,28。此外,本论文旨在突出展示临床宏蛋白质组学工作流程的方法学。GTN(https://training.galaxyproject.org/)提供了更详细且适合初学者的指南,作为本论文的补充资源,供需要额外解释的用户并行参考。Galaxy社区已撰写大量论文,以帮助初学者更好地使用Galaxy平台20,21,22,23,24,25,26,27。
本论文的所有补充表格(例如,工具参数)和图示(例如,示例图表)均已作为单独文件提供,并在文中相应位置引用。本论文使用的是 Galaxy 版本 2.3.0 中的当前工具版本,因此结果可能因 Galaxy 平台或工具版本的更新而略有差异。Galaxy 平台及其工具为开源软件,可用于学术研究目的。
访问受限。请登录或开始试用以查看此内容。
MS/MS 质谱数据来自去标识化的残余 PTF 样本,这些样本的采集过程遵循机构审查委员会批准的指南和规定,如前所述21,29,30。
注意:图1 展示了完整工作流程的概览,该流程包含五个模块。补充表1 总结了所有输入、输出及软件工具。

图1:Galaxy平台内临床宏蛋白质组学工作流程模块概览。 完整的临床宏蛋白质组学工作流程包含五个模块:数据库生成、发现、验证、定量和数据解读。(A) 大型综合数据库包括被认为存在于样本中的微生物物种、人类以及常见污染物的蛋白质序列。MetaNovo软件工具将MS/MS谱图数据直接与肽段匹配,并基于原始质谱数据和大型输入蛋白质序列数据库推断出蛋白质及其来源生物体,从而构建一个缩减版数据库33。MetaNovo生成的缩减数据库随后与人类和污染物蛋白序列合并,形成用于肽段发现的数据库。(B) 两种肽段鉴定算法SearchGUI/PeptideShaker和MaxQuant将肽段序列与MS/MS谱图及目标-诱饵蛋白质数据库进行比对49。(C) SearchGUI/PeptideShaker和MaxQuant鉴定出的肽段接下来由PepQuery2进行验证。PepQuery2严格地重新检查假定鉴定的微生物肽段序列及其匹配的MS/MS谱图,排除与人类宿主蛋白质组和/或污染物可能存在的其他匹配,从而确认高可信度的微生物匹配结果40,41。经验证的肽段用于构建经验证的蛋白质序列数据库,该数据库将用于后续的肽段和蛋白质定量。(D) MaxQuant42利用经验证的蛋白质序列数据库对MS/MS数据进行搜索,并对微生物肽段及推断出的蛋白质以及人类蛋白质进行定量。(E) 在最后一步中,使用Unipept45和MSstatsTMT46对蛋白质进行注释,提供分类学信息和功能信息(酶学委员会登录号),并生成火山图和比较图。 请点击此处查看此图的放大版本。
1. TMT 标记及 MS/MS 谱图的生成
2. 模块设置
注意:按钮/菜单选择项以粗体标出。示例文件、工作流程及工具参数可通过补充表格获取。有关如何使用 Galaxy 的更多信息,请访问 GTN 常见问题页面(https://training.galaxyproject.org/training-material/faqs/galaxy/)。
3. 模块1:蛋白质序列数据库生成
注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块1,请导入用于数据库生成的输入和工作流程。补充表2的输出列中包含已完成的输出历史记录示例,可供参考。对于所有模块,相应的GTN教程可在补充表3中找到。
4. 模块2:通过数据库搜索进行肽段发现
注意:如果用户希望使用示例输入和工作流程 补充表 2,务必遵循第2节中的说明。对于模块2,导入DISCOVERY的输入数据和工作流程。所有模块对应的GTN教程均可在 补充表3. SearchGUI34,35,36 和 PeptideShaker37 是独立的软件,但由于它们通常配合使用,因此被视为一个肽段鉴定与分析程序。为确保软件兼容性,将使用 msconvert 工具(在提供的工作流程中)将 MS/MS 数据集从 RAW 格式转换为 SearchGUI/PeptideShaker 可用的 MGF 格式。MaxQuant38 能够处理 RAW 文件。
5. 模块3:微生物肽的验证
注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块2,需导入用于验证(VERIFICATION)的输入文件和工作流程。对于所有模块,相应的GTN教程可在补充表3中找到。
6. 模块4:MaxQuant 定量分析
注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块2,请导入用于定量分析(QUANTIFICATION)的输入文件和工作流程。对于所有模块,相应的GTN教程可在补充表3中找到。
7. 模块5:数据分析与解释
注意:如果用户希望使用补充表2中的示例输入和工作流程,请务必遵循第2节中的说明。对于模块2,需导入用于数据解读(DATA INTERPRETATION)的输入文件和工作流程。对于所有模块,相应的GTN教程可在补充表3中找到。本模块将使用上一模块中MaxQuant定量分析的输出结果,通过Unipept进行分类学和功能注释,并利用MSstatsTMT进行统计分析。Unipept可帮助研究人员识别和量化多种环境中的微生物,并能与公共数据库(如UniProt)整合以获取最新的注释信息。MSstatsTMT则专为基于TMT标记的质谱定量蛋白质组学数据的稳健统计分析而设计。
访问受限。请登录或开始试用以查看此内容。
本文所述通用方案已在从部分 PTF 样本获得的 MS/MS 文件上进行了验证21。Do 等人21分析了四个 PTF 样本的 MS/MS 文件,这些样本的采集遵循了 Boylan 等人29以及 Afiuni-Zadel 等人30所描述的操作流程。该工作流程优先关注微生物蛋白,但同时具备并行分析人类蛋白与微生物蛋白的灵活性21。该工作流程及其多种变体已在其他研究中得到应用6,20。
为了整理一份相关物种的列表,Do 等人从一项先前研究中选取了118个分类学物种,该研究曾探讨宫颈-阴道微生物组30。该列表包含117种细菌以及酵母菌Candida albicans(
访问受限。请登录或开始试用以查看此内容。
临床宏蛋白质组学研究为临床研究提供了潜在的突破,但其实施过程中仍存在诸多挑战。在大多数样本中,微生物蛋白的丰度远低于宿主蛋白,这阻碍了非宿主蛋白的检测与表征6,10。准确鉴定和定量肽段及蛋白质依赖于庞大的蛋白质序列数据库,同时在对已鉴定的肽段和蛋白质进行分类学和功能注释以实现定量和统计分析时也面临复杂性,这些均构成了技术障碍1,3。本研究在Galaxy生物信息学平台中建立的临床宏蛋白质组学工作流程,可有效应对上述多项挑战。该流程使研究人员能够分析其质谱(MS)数据,生成针对其临床样本定制的蛋白质序列数据库,并利用多种搜索算法将MS/MS数据与蛋白质序列数据库进行匹配。通过纳入对假定微生物肽段匹配结果与MS/MS谱图的验证步骤,提高了所鉴定肽段及推断蛋白质的可信度,并支持其定量、可视化以及分类学归属和功能注释的分配,进而开展统计分析。
串联质谱标签(T...
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
我们感谢明尼苏达大学的 Amy Skubitz 博士和 Kristin Boylan 博士提供的初步数据集,以及美国西北太平洋国家实验室(PNNL)的 Paul Piehowski 博士、Tao Liu 博士和 Karin Rodland 博士在样本采集、PTF 样本处理以及本研究中所用 TMT 标记质谱数据生成方面的专业支持。本项目部分由明尼苏达卵巢癌联盟(MOCA)、美国国立卫生研究院/国家癌症研究所资助,资助编号:5R01CA262153(A.P.N.S.)、1R21CA267707(P.D.J. 和 T.J.G.),以及美国国立卫生研究院/国家癌症研究所资助编号:P30CA077598(P.D.J. 和 T.J.G.)支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 合并数据集列表集合为单个文件(按列表顺序) | GalaxyP | Galaxy 版本 5.1.1 | 将数据集列表集合合并为一个文件(按列表顺序) |
| 连接数据集 | GalaxyP | Galaxy 版本 0.1.1 | 将文件首尾相连进行拼接 |
| 剪切 | GalaxyP | Galaxy 版本 1.0.2 | 从文件中剪切(选择)指定的列 |
| FASTA 合并文件并筛选唯一序列 | GalaxyP | Galaxy 版本 1.2.0 | 将多个 FASTA 数据库文件合并在一起 |
| FastaCLI | GalaxyP | Galaxy 版本 4.0.41+galaxy1 | 向 FASTA 文件追加诱饵序列 |
| FASTA 转表格 | GalaxyP | Galaxy 版本 1.1.0 | 将 FASTA 格式的序列转换为制表符分隔格式 |
| 筛选 | GalaxyP | Galaxy 版本 1.1.1 | 使用简单表达式筛选列 |
| 筛选表格文件 | GalaxyP | Galaxy 版本 3.3.0 | 通过行筛选条件过滤表格文件 |
| Galaxy 欧洲(EU)服务器 | GalaxyP | https://usegalaxy.eu/ | |
| 分组 | GalaxyP | Galaxy 版本 2.1.4 | 按特定列对文件进行分组并执行聚合函数 |
| 鉴定参数设置 | GalaxyP | Galaxy 版本 4.0.41+galaxy1 | 为 SearchGUI/PeptideShaker 设置鉴定参数 |
| 学习路径:Galaxy 中的临床宏蛋白质组学工作流程 | GalaxyP | https://training.galaxyproject.org/training-material/learning-pathways/clinical-metaproteomics.html | |
| MaxQuant | GalaxyP | Galaxy 版本 2.0.3.0+galaxy0(发现模块);Galaxy 版本 1.6.17.0+galaxy4(定量模块) | 用于分析大规模质谱数据文件的定量蛋白质组学软件包 |
| MetaNovo | GalaxyP | Galaxy 版本 1.9.4+galaxy4 | 将 MS/MS 数据与已知蛋白质的 FASTA 数据库进行比对,生成用于质谱分析的靶向数据库(匹配的蛋白质) |
| msconvert | GalaxyP | Galaxy 版本 3.0.20287.2 | 转换和/或过滤质谱文件 |
| MSstatsTMT | GalaxyP | Galaxy 版本 2.0.0+galaxy1 | 基于 R 的软件包,用于在基于串联质谱标签(TMT)标记的 shotgun 质谱蛋白质组学实验中检测差异丰度蛋白 |
| PepQuery2 | GalaxyP | Galaxy 版本 2.0.2+galaxy0 | 以肽段为中心的搜索引擎,用于鉴定和/或验证目标已知或新肽段 |
| PeptideShaker | GalaxyP | Galaxy 版本 2.0.33+galaxy1 | 解析 SearchGUI 的结果以实现蛋白质鉴定 |
| 蛋白质数据库下载器 | GalaxyP | Galaxy 版本 0.3.4 | 将指定的蛋白质序列下载为 FASTA 文件 |
| 查询表格文件 | GalaxyP | Galaxy 版本 3.3.0 | 将表格文件加载到 SQLite 数据库中 |
| 移除开头部分 | GalaxyP | Galaxy 版本 1.0.0 | 从文件中移除指定数量的(标题)行 |
| SearchGUI | GalaxyP | Galaxy 版本 4.0.41+galaxy1 | 在 MGF 峰值列表上运行搜索引擎,并将结果准备为 PeptideShaker 的输入 |
| 选择 | GalaxyP | Galaxy 版本 1.0.4 | 选择匹配表达式的行 |
| Unipept | GalaxyP | Galaxy 版本 4.5.1 | 检索胰蛋白酶肽段对应的 UniProt 条目及分类学信息 |
| UniProt | GalaxyP | Galaxy 版本 2.3.0 | 从 UniProtKB 下载蛋白质组为 XML(UniProtXML)或 FASTA 文件 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可