基于质谱的蛋白质组学数据可从开放数据库中获取,并可通过免费工具进行访问。鉴于数据库搜索和描述的复杂性,许多生物学家缺乏利用这些数据集的知识。本文提供了一份使用免费工具进行基本蛋白质组学数据搜索的指南。
基于质谱的蛋白质组学数据可从开放数据库中获取,并可通过免费工具进行访问。鉴于数据库搜索和描述的复杂性,许多生物学家缺乏利用这些数据集的知识。本文提供了一份使用免费工具进行基本蛋白质组学数据搜索的指南。
基于质谱(MS)的蛋白质组学数据,包括依赖数据采集(DDA)和非依赖数据采集(DIA),在生物研究中被广泛应用。然而,由于缺乏关于如何有效搜索和分析蛋白质组学数据的清晰示范,这些数据集在验证研究中的应用仍然有限。为填补这一空白,我们从PRoteomics IDEntifications数据库(PRIDE)数据存储库中选取了一个DDA和一个DIA数据集,以更清晰地展示蛋白质组学数据分析流程以及蛋白质搜索结果的下游后处理过程。为演示目的,我们使用了两款免费的计算工具:FragPipe(v22.0)用于DDA数据集,DIA-NN(2.1.0)用于DIA数据集。使用R代码演示了后续处理步骤,例如生成火山图和差异表达蛋白质列表。本研究提供了搜索和分析蛋白质组学数据的基本操作流程,可作为有效处理蛋白质组数据集的入门必备指南。通过本工作,我们旨在为研究人员提供必要的知识,使其能够在生物学研究中充分利用蛋白质组学数据。
蛋白质组学领域因开放获取数据存储库和免费软件工具的广泛应用而发生了革命性变化1,这些资源在提升研究能力以及推动数据共享文化方面发挥了关键作用。诸如PRIDE2等集中式资源的建立,以及人类蛋白质组组织(HUPO)蛋白质组学标准倡议(PSI)制定的标准化数据格式3,为数据的重用与整合创造了前所未有的机遇。然而,蛋白质组学数据的分析与解读仍存在显著的技术障碍,尤其对于希望对其自身实验结果进行正交验证的生物学家和临床科研人员而言尤为如此4。本文通过提出一种不依赖仪器厂商的计算工作流程,直接应对这一挑战,为研究人员提供一个可及的框架,使其能够独立查询、分析并整合公共蛋白质组学数据与自身研究成果,从而在无需额外湿实验的情况下实现可靠的正交验证。本方法特别适用于希望对其自身实验中鉴定出的特定蛋白质差异表达进行正交验证,并通过探索其关注蛋白质在大量已发表研究中的表达模式来提出新假说的研究人员。通过提供逐步操作指南,我们旨在使更广泛的研究人员能够充分挖掘公共蛋白质组学数据的潜力,最终增强其研究的稳健性与影响力。
在基于质谱(MS)的蛋白质组学中,MS1和MS2扫描是数据采集的基础。MS1扫描(又称全扫描)用于检测和测量样品中所有离子的质荷比(m/z),从而提供离子群体的全面概览5。MS2扫描(也称为碎裂扫描)则选择MS1扫描中特定的前体离子进行分离和碎裂,生成碎片离子谱图,用于肽段鉴定6。
数据依赖性采集(DDA)从 MS1 扫描中选择丰度最高的离子进行 MS2 碎裂,产生更简单的谱图,从而简化分析过程。然而,DDA 可能导致在复杂样品中出现随机采样和缺失值,限制了结果的可重复性7。相比之下,数据非依赖性采集(DIA)系统性地对预设 m/z 窗口内的所有离子进行碎裂,确保全面覆盖并最大限度减少缺失值。这提高了定量的准确性和可重复性8,但 DIA 需要先进的计算工具来解析其高度复杂的 MS2 谱图9。
PRIDE(https://www.ebi.ac.uk/pride)2是 ProteomeXchange联盟 (https://www.proteomexchange.org)10内的主要数据库,该联盟是一个用于共享蛋白质组学数据的全球性平台。用户可通过关键词搜索高效地浏览这一庞大资源,以查找感兴趣的数据集。
DIA-NN11 是一款利用深度神经网络的软件套件,是分析数据非依赖性采集(DIA)蛋白质组学数据的金标准工具。其在肽段鉴定与定量准确性方面表现卓越,特别适用于处理复杂的 DIA 数据集12。对于数据依赖性采集(DDA)工作流程,集成于 FragPipe 分析流程中的 MSFragger13 可实现超快速肽段鉴定。该工具创新的碎片离子索引方法可实现快速谱图匹配,在速度上比传统工具快出逾 100 倍。
凭借这些全面的数据库和先进工具,研究人员能够轻松地重用蛋白质组学数据,以进行跨研究验证和发现新的生物学信息。这种可及性推动了在多种疾病中识别出大量蛋白质生物标志物14,15,改善了预后预测16,并实现了基于蛋白质组谱的分子亚型分类17。
注意:工作流程概览见图1,所用软件的详细说明见材料表。

图1:研究设计概览。 请点击此处查看此图的放大版本。
1. 示例文件和软件设置
注意:所有应用程序均可免费用于个人研究用途,并可在个人计算机上运行(支持 Windows 和 Linux 系统)。
使用 DIA-NN 进行 DIA 数据分析
3. 使用 FragPipe 进行 DDA 数据分析
4. DIA-NN/FragPipe 下游分析
注意:本研究中使用的详细代码包含在补充文件1和补充文件2中。本研究中使用的软件包版本信息可在补充文件3中找到。
为了更好地说明蛋白质组学数据集的检索过程,我们为本次分析选取了两种类型的数据集。为展示临床背景下差异表达的蛋白质,我们使用“clinic”等关键词在PRIDE数据库中进行检索。具体而言,我们从临床蛋白质组肿瘤分析联盟(Clinical Proteomic Tumor Analysis Consortium, CPTAC)21中选择了一个适用于DIA分析的数据集,以及从中国人类蛋白质组计划(Chinese Human Proteome Project, CNHPP)22中选择了一个适用于DDA分析的数据集。这些数据集的选取有助于全面评估和展示该软件在分析健康与疾病相关蛋白质组数据方面的功能。
图中所示的火山图对正常个体与胰腺导管腺癌(PDAC)患者血清蛋白的差异表达,以及肝细胞癌(HCC)肿瘤样本与其配对组织之间的差异表达进行了全面分析(图7A)。这些图利用Log2倍数变化(Log2FC)和p值来确定蛋白表达中具有统计学意义的变化。蛋白质根据其显著性以不同颜色标注。在PDAC背景下,红色表示表达发生显著变化的蛋白质。例如,丝氨酸蛋白酶抑制剂A族成员5(SERPINA5)和乙酰肝素酶(HPSE)在患者血清中表达下调,而富含半胱氨酸的分泌蛋白3(CRISP3)和纤维蛋白原β链(FGB)则表达上调。在图7B中采用了更细致的颜色策略:绿色表示超过特定Log2FC阈值的蛋白质,蓝色表示超过p值阈值的蛋白质,红色表示同时满足两个标准的蛋白质。值得注意的是,如Pleckstrin 3(PLS3)、烯醇化酶3(ENO3)、甲硫基转移酶α1(MTAP)、丝氨酸蛋白酶抑制剂B族成员9(SERPINB9)和肌醇-1,4,5-三磷酸受体2型(ITPR2)等蛋白质在HCC肿瘤样本中表达下调,而苹果酸脱氢酶1(ME1)、细胞色素P450家族27亚家族A成员1(CYP27A1)、核糖体蛋白S16(RPS16)以及ATP合酶H+转运线粒体Fo复合体亚基F(ATP5PF)则表达上调。该分析有助于识别PDAC和HCC诊断与治疗的潜在生物标志物,为深入理解这些疾病的潜在分子机制提供了重要线索。
热图有效展示了正常个体和胰腺导管腺癌(PDAC)患者血清中显著蛋白质的表达水平,以及配对组织和肝细胞癌(HCC)肿瘤样本中的表达情况(图8A-B)。热图采用从蓝色到红色的渐变色,揭示了这些组别之间不同的表达模式。某些蛋白质在PDAC患者血清和HCC肿瘤中的表达水平持续较高。热图左侧的树状图显示了相关蛋白质的聚类情况,提示其表达谱具有相似性。同时,热图顶部的排列方式突出了各组内部的变异性以及潜在亚组识别的可能性。
采用了两种不同的热图展示策略。对于胰腺导管腺癌(PDAC)血清蛋白,该方法能够成功区分PDAC血清与正常血清;而对于肝细胞癌(HCC)肿瘤,差异表达蛋白在配对组织中的分类能力较弱。这一观察结果凸显了肿瘤的异质性以及肿瘤与邻近组织之间可能存在的密切关系。可视化分析有助于理解PDAC血清和HCC肿瘤中蛋白质的异质性,并评估潜在的亚组分类策略。
对胰腺导管腺癌(PDAC)患者血清和肝细胞癌(HCC)肿瘤样本中显著上调的基因分别进行了基因本体(GO)生物学过程富集分析(图8C-D)。横轴上的GeneRatio表示每个生物学过程中上调基因占所有注释基因的比例,颜色梯度代表校正后的p值,红色表示显著性更高。根据GO富集分析结果,PDAC与HCC的分子机制似乎由不同的生物学过程驱动。在PDAC血清中,参与凝血和止血调控的上调基因显著富集,表明机体的凝血系统和伤口愈合系统是该疾病发病机制中的关键环节。相比之下,HCC肿瘤样本呈现出不同的生物学特征,其嘌呤核苷酸代谢过程和核苷酸代谢过程显著富集,提示HCC的癌细胞内部发生了深刻的代谢重编程,可能旨在支持其快速生长与增殖。
散点图展示了胰腺导管腺癌(PDAC)患者血清中显著上调基因(图8E)以及肝细胞癌(HCC)患者肿瘤样本中显著上调基因(图8F)的京都基因与基因组百科全书(KEGG)通路富集分析结果。横轴表示基因比值(GeneRatio),即与特定通路相关的上调基因数量与注释到该通路的总基因数量之比23。图中每个点代表一个特定的KEGG通路,点的大小表示参与该通路的基因数量,颜色表示p值,其中红色表示富集更显著(p值更低),蓝色表示富集较不显著(p值更高)。PDAC血清和HCC肿瘤的KEGG通路富集分析揭示了不同的生物学特征。对于PDAC,最显著的结果是补体和凝血级联通路的高度富集,同时检测到糖胺聚糖降解通路的富集。该发现提示存在系统性高凝状态和炎症状态,这是该疾病已知的临床特征24。相比之下,HCC肿瘤的分析突出了另一组生物学过程,显示过氧化物酶体增殖物激活受体(PPAR)信号通路、碳代谢以及帕金森病和阿尔茨海默病等多种神经退行性疾病相关通路的富集。这表明HCC的特征是细胞代谢和能量代谢的广泛重编程,以支持肿瘤生长,尽管这些通路的统计学显著性低于PDAC分析中的结果。
图8G展示了胰腺导管腺癌(PDAC)血清中显著上调蛋白的蛋白质-蛋白质相互作用网络。该网络通过在STRING数据库中查询置信度得分至少为400的相互作用生成,并使用visNetwork库进行可视化。每个节点代表一种特定蛋白质,标注为其UniProt标识符,连接线表示这些蛋白质之间的相互作用。该从PDAC患者血清中鉴定出的蛋白质-蛋白质相互作用网络揭示了一个核心功能簇以及若干与癌症生物学相关的孤立蛋白质。凝血因子XI(P03951)、纤维蛋白原β链(P02675)和血浆丝氨酸蛋白酶抑制剂(P05154)构成了一个中心相互作用群,其核心相互作用组由凝血因子XI(P03951)、纤维蛋白原β链(P02675)和血浆丝氨酸蛋白酶抑制剂(P05154)组成。它们之间的强相互连接至关重要,因为这些蛋白参与凝血和炎症通路,而已知这些通路在PDAC肿瘤微环境中存在失调25。该主要簇还包括与免疫球蛋白重链可变区3-15(A0A0B4J1V0)的连接。此外,网络中还显示了若干作为孤立节点的蛋白质:乙酰肝素酶(Q9Y251)、CD5抗原样蛋白(O43866)和富含半胱氨酸的分泌蛋白3(P54108)。这些单独的蛋白质因其在肿瘤侵袭和转移(乙酰肝素酶)、免疫调节(CD5抗原样蛋白)以及炎症(富含半胱氨酸的分泌蛋白3)中的各自作用而值得关注26,表明即使在此可视化网络中无直接相互作用,它们在PDAC中仍可能具有重要意义。

图 2:PRIDE 中关键词搜索的示例。 请点击此处查看此图的放大版本。

图 3:使用 DIA-NN 进行数据分析。 (A)UniProt 中参考蛋白质组(Homo sapiens,版本 2024/12/12)的示例。(B)准备预测谱图库时 DIA-NN 设置的示例。(C)对原始格式数据进行分析运行时 DIA-NN 设置的示例。请点击此处查看该图的放大版本。

图4:FragPipe 设置。(A)分析前 FragPipe 配置选项卡设置的示例。(请确保所有主要工具均已下载。)(B)FragPipe 工作流程选项卡常规设置的示例。(C)FragPipe 数据库选项卡常规设置的示例。(参考蛋白质组可在此处轻松下载。)请点击此处查看该图的放大版本。

图 5:FragPipe 设置。(A)FragPipe MSFragger 选项卡常规设置示例。(B)FragPipe Validation 选项卡常规设置示例。请点击此处查看该图的放大版本。

图6:FragPipe 运行时设置。 (A)FragPipe Quant(MS1)选项卡常规设置示例。(B)FragPipe RUN 选项卡常规设置示例。 请点击此处查看该图的放大版本。

图 7:火山图。(A)PDAC 患者血清蛋白质与正常血清蛋白质的火山图。(B)HCC 肿瘤组织蛋白质与配对正常组织蛋白质的火山图。请点击此处查看该图的放大版本。

图 8:蛋白质-蛋白质分析的热图、GO 富集和 KEGG 通路图。 (A)正常血清蛋白与胰腺导管腺癌(PDAC)患者血清蛋白的热图。(B)配对组织蛋白与肝细胞癌(HCC)肿瘤蛋白的热图。(C)PDAC 血清中显著上调基因的 GO 富集分析。(D)HCC 肿瘤中显著上调基因的 GO 富集分析。(E)PDAC 血清中显著上调基因的 KEGG 通路富集分析。(F)HCC 肿瘤中显著上调基因的 KEGG 通路富集分析。(G)PDAC 血清中显著上调蛋白的蛋白质-蛋白质相互作用网络 请点击此处查看该图的放大版本。
补充文件 1:DIA-NN 输出数据的分析流程。请点击此处下载该文件。
补充文件 2:FragPipe 输出数据分析流程。 请点击此处下载该文件。
补充文件 3:使用 R 进行数据分析的环境要求 请点击此处下载该文件。
本方案通过整合DIA-NN和FragPipe等免费工具,展示了蛋白质组学数据分析的方法。成功的关键在于若干重要步骤,例如在DIA-NN中生成谱图库时,需精确选择前体离子并设置质量精度(步骤2.3)27,这些参数依赖于仪器类型,对实现完整的肽段鉴定至关重要。同样,在FragPipe中细致地设置数据库(步骤3.4),包括诱饵库的生成和污染物过滤,对于控制错误发现率(FDR)也极为关键。
修改和故障排除通常涉及验证软件依赖项(例如,MSFileReader 所需的 .NET,FragPipe 所需的 Java)以及管理计算资源,尤其是对于大型数据集,可能需要为 MSFragger 增加内存,或对 DIA-NN 使用高性能计算(HPC)。社区论坛(例如 GitHub)可提供有价值的、持续更新的故障排除支持。
主要局限性包括该方案仅适用于无标记的DIA和DDA工作流程,无法进行全面的翻译后修饰(PTM)分析28或基于标记的定量分析,尽管MSFragger具备开放搜索功能13。下游分析(步骤4)依赖R脚本编写,可能对非编程人员构成障碍,尽管已有DIAgui29和FragPipe-Analyst30等工具正在开发以解决此问题。此外,即使在无谱图库的DIA方法中,完全新颖肽段的发现仍受限于对序列数据库的依赖10,28。代表性结果中可能显示的小样本量也限制了在可靠生物标志物发现方面的统计效能。
相较于现有方法,DIA-NN 和 FragPipe 的优势在于其更高的速度、灵敏度以及数据完整性。MSFragger 的碎片离子索引技术显著加快了肽段匹配速度。诸如 MSFragger-DDA+ 等创新方法进一步提升了共碎裂肽段的鉴定能力31。结合 DIA-NN 基于神经网络的数据处理能力,该方法相较于许多传统的数据依赖采集(DDA)方法,能够实现更深度的蛋白质组覆盖和更一致的定量结果,尤其适用于复杂数据集以及 dia-PASEF 等先进的采集技术32。
未来应用前景广阔,尤其在临床蛋白质组学的大队列生物标志物发现31,33和药物筛选34方面,可充分利用其高通量和稳定定量的优势。该工作流程的模块化设计使其能够适应多组学整合35,以及单细胞蛋白质组学36和翻译后修饰分析(PTM分析)37等专门领域。用户友好的图形界面(GUI)和基于云的分析流程的持续开发38将进一步提升可及性,并有效应对计算资源需求39。这一发展有助于构建更加开放、可重复的科研环境,从而加速基础研究和转化研究的进程。
F.Z. 是 Molemuse Biotech Studio 的创始人。
本项目由Molemuse Biotech Studio提供支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| .NET SDK v. 9.0.203 | 微软 | https://dotnet.microsoft.com/zh-cn/download | |
| DIA-NN v. 2.1.0 | https://github.com/vdemichev/DiaNN/releases/tag/2.0 | ||
| FragPipe v. 22.0 | https://github.com/Nesvilab/FragPipe/releases | ||
| MSFileReader 版本 3.1 | 赛默飞世尔科技 | https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe | |
| R 4.5.0 | https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe | ||
| Rstudio v. 2024.12.1+563 | https://posit.co/download/rstudio-desktop/ |