2025年1月10日
临床宏蛋白质组学为研究人类微生物组及其在疾病中的作用提供了深入见解。我们利用 Galaxy 平台的计算能力,开发了一种模块化的生物信息学工作流程,该流程可促进基于质谱的复杂宏蛋白质组学分析,并实现对多种与疾病研究相关的临床样本类型的表征。
我们的研究重点是检测和定量微生物蛋白质,并阐明其在临床疾病中的作用。这一研究领域被称为临床宏蛋白质组学。在本研究中,我们开发了一种生物信息学分析流程,可帮助研究人员理解细菌活性如何影响疾病进展。
临床样本的宏蛋白质组学分析面临诸多挑战,包括处理庞大的蛋白质序列数据库,以从质谱数据中灵敏且准确地鉴定微生物肽段和蛋白质,此外还需对定量得到的肽段和蛋白质进行分类学和功能注释,从而实现对结果的生物学解读。该工作流程具有多项优势,包括利用我们的数据库缩减流程实现数据库的简化、采用多种搜索算法进行微生物肽段的检索、验证质谱数据中检测到的微生物肽段、对微生物蛋白与宿主蛋白同时进行定量,以及通过统计分析和可视化分析实现数据的生物学解读。我们已应用临床宏蛋白质组学工作流程,鉴定用于囊性纤维化疾病进展研究的微生物肽段组合,并用于研究新冠大流行期间的共感染状态。
这些研究已发表在经过同行评审的学术期刊上。目前,我们正在将此工作流程应用于一项正在进行的研究,旨在开发用于卵巢癌的预测性靶向肽面板。Galaxy P 团队参与了多组学研究,我们正在开发多个用于蛋白质基因组学和宏蛋白质组学分析的高级工作流程。
目前,我们还在致力于开发用于免疫肽组学的工作流程,该流程将使研究人员能够检测并表征呈递给免疫系统的肽段,其中一些在癌症进展过程中出现,被称为新抗原,此外还包括其他疾病中可能存在的微生物来源肽段。首先,获取与目标疾病或状况相关的物种列表。使用名为 Species 的物种列表文件。
以表格形式作为UniProt的输入。下载FASTA格式的蛋白质组以生成蛋白质序列数据库。运行蛋白质数据库下载器,生成另外两个蛋白质序列数据库:一个仅包含已审阅条目的人源Swiss-Prot数据库,以及一个包含常见外源性蛋白质公共库(cRAP)的污染物蛋白质数据库。
将三个蛋白质数据库作为输入生成FASTA合并文件,并筛选唯一序列以排除重复项。以生成的大规模数据库和质谱数据集作为输入,运行MetaNovo以生成缩减的蛋白质序列数据库,随后对该MetaNovo生成的数据库、人源Swiss-Prot数据库以及cRAP数据库执行FASTA合并文件操作并筛选唯一序列,从而构建一个包含微生物、人类及污染物蛋白质序列的缩减目标数据库,用于肽段检测。运行Search GUI以生成包含肽段谱图匹配结果(PSMs)的归档文件。
使用 Search GUI 的“archive 文件作为 Peptide-Shaker 输入”来生成 PSM、肽段和蛋白质报告。运行 MaxQuant 以生成蛋白质组和肽段文件。利用文本处理工具,对 Search GUI、Peptide-Shaker 和 MaxQuant 获得的输出结果进行整理。
将两个肽段列表合并为一个标记为 SGPS-MQ-Peptides.tabular 的单一数据集。对合并后的肽段列表进行分组,以消除重复的肽段序列,获得唯一的微生物肽段最终列表。用于 PepQuery2 验证时,输入不同的微生物肽段列表、质谱谱图数据集、含异构体的人类 UniProt 参考数据库以及污染物蛋白质序列数据库。
使用“Run Cut”处理来自 Search GUI、Peptide-Shaker 和 MaxQuant 的肽段报告,以提取肽段序列及其相关的蛋白质条目。将两个程序输出的肽段序列和蛋白质条目合并,创建一个新的整合肽段-蛋白质数据集,然后在该整合数据集与已验证肽段之间运行“Query Tabular”,为每个已验证肽段分配其对应的蛋白质条目。按唯一已验证肽段及其对应的 UniProt ID 进行分组保留。
接下来,运行“查询表格”工具以提取 UniProt ID,从已验证的肽段文件 Peptides.tabular 中生成一个标记为 Uniprot-ID 的列表。将这些 UniProt ID 上传至 UniProt,以获取相应的蛋白质序列,并将其保存为新的 UniProt FASTA 文件。对新生成的 UniProt FASTA 文件、含异构体的人类 UniProt 数据库以及 cRAP 污染物数据库,运行 FASTA 文件合并并筛选唯一序列,从而构建用于肽段定量的验证数据库。
使用经过验证的蛋白质序列数据库和质谱数据集作为 MaxQuant 的输入。从 MaxQuant 的“peptides”文件中仅选择微生物肽段,并运行 Cut 工具以从该选择文件中提取出仅包含微生物肽段的序列。对 Cut 工具生成的文件进行分组,以汇总获得一份定量的微生物肽段列表。
使用已定量的微生物肽列表文件作为输入,导入 Unipept 以进行分类学和功能注释。提取 Unipept 的输出结果,特别是微生物分类树和微生物酶委员会蛋白树。要查看微生物分类树和 EC 蛋白树,请选择数据集并打开选项。
单击“可视化”,然后选择“Unipept 分类学查看器”。如需以表格形式查看分类学和功能注释,请单击名为 Unipept_peptinfo 的表格数据集旁边的“眼睛”图标。向下滚动,逐行查看每种肽及其对应的信息列。
在使用 MSstatsTMT 进行统计分析之前,对 MaxQuant 的“protein groups”文件运行“Select”操作,以分别生成微生物和人类蛋白质的数据集。这些蛋白质包含指示其来源的分类学标签。排除任何带有 con_ 标签标记的污染蛋白质。
在“Microbial_Proteins”表格中仅保留带有类似 _9laco 标签的微生物蛋白质,在“Human_Proteins”表格中仅保留带有 _human 标签的人类蛋白质。最后,使用 MSstatsTMT,结合 MaxQuant 的 evidence 文件以及筛选后的微生物或人类蛋白质进行统计分析。单击眼睛图标以查看生成的图表。
共收集了 2,595,745 条蛋白质序列,构建了一个综合数据库,随后将其缩减为包含 21,289 条蛋白质序列的更特异的数据库,以实现有效的肽段鉴定。利用 Search GUI、Peptide-Shaker 和 MaxQuant,共鉴定出 196 种不同的微生物肽段。PepQuery2 验证了与 73 条蛋白质序列相关的 134 种微生物肽段,构建了一个用于定量分析的已验证数据库。
MaxQuant分析提供了一个包含3,203个肽段的文件,其中155个为定量的微生物肽段。Unipept分析显示,在155个定量的微生物肽段中,乳杆菌属(Lactobacillus)为最丰富的属,II类转移酶为最丰富的酶类别。MSstatsTMT分析生成了火山图和比较图,以展示差异表达的蛋白质,结果表明,在卵巢癌病例中,三种乳杆菌蛋白的表达水平较良性病例下调。
查看完整文字稿并访问数千部科学视频
本研究聚焦于临床宏蛋白质组学,该领域为人类微生物组及其在疾病中的作用提供了深入见解。为此开发了一套生物信息学工作流程,以促进对临床样本中微生物蛋白质的分析。
整合质谱数据与高级生物信息学的临床宏蛋白质组学工作流程,对于阐明疾病中宿主-微生物组相互作用至关重要。该基于Galaxy的分析流程能够对复杂临床样本中的微生物蛋白质进行高灵敏度检测与定量,直接支持转化研究中的靶点验证和机制性风险降低。该方法在发现到临床前的衔接阶段提高了预测可信度,为微生物组相关治疗项目的风险调整型组合决策提供依据。
该工作流程通过在统一的Galaxy平台内整合质谱数据处理、肽段验证和统计分析,连接了早期发现、筛选和转化研究。