2025年8月19日
基于质谱的蛋白质组学数据可在开放数据库中找到,并可使用免费工具进行访问。鉴于数据库搜索和描述的复杂性,许多生物学家缺乏利用这些数据集的知识。在这里,我们提供了使用免费工具进行基本蛋白质组学数据搜索的指南。
我们的工作为生物学家使用免费工具分析复杂蛋白质组学数据提供了指南。我们的目标是使他们能够验证发现并探索公共数据集。由于缺乏明确的指导,许多生物学家无法使用公开的蛋白质组数据。
我们的工作弥合了这一点,无需任何新的野生动物实验即可进行验证。我们的工作使用与供应商无关的免费最先进的软件。与许多传统工具相比,这些工具更快、更灵敏,并提供更精确的蛋白质组发现。
首先,从 UniProt 数据库下载参考蛋白质组 FASTA 文件。单击添加 FASTA 按钮将参考蛋白质组文件加载到 DIA-NN 软件中。选择两个选项,用于文库自由搜索文库生成的 FASTA 摘要,以及母离子生成部分下的基于深度学习的光谱、RT 和 IM 预测。
然后,单击运行按钮以生成预测的光谱库。取消选择母离子生成部分下的两个选项。单击输入部分下与文件格式相对应的类型按钮以加载 DIA 数据。
现在,在算法部分下将质量精度和 MS1 精度设置为百万分之零。根据实验设置调整母离子生成部分下的母离子和碎片质量范围设置。保持其他软件设置不变。
接下来,单击运行按钮。作界面显示“等待完成”,表示分析完成。安装后单击位于 bin 文件夹中的碎片管道图标。
导航到配置选项卡以查看所有依赖设置。检查您的系统上是否提供 MSFragger、IonQuant、diaTracer、DIA-NN 和 Python 模块。如果缺少任何模块,请单击下载更新或下载以检索它们。
现在,切换到工作流选项卡。从工作流下拉列表中选择默认值,然后单击加载工作流。然后,单击添加文件以输入文件路径。
在分配文件下分配实验名称和生物重复编号或留空。接下来,单击数据库选项卡以切换到它。从磁盘加载 FASTA 文件或下载与样品物种相对应的文件。
在下载过程中,选择仅查看序列的选项,添加诱饵,并添加常见污染物以进行简单的运行。单击 MSFragger 选项卡以更改视图。选择封闭搜索默认配置,然后单击加载。
在峰值匹配设置下,保留所有默认值。对于校准和优化,请选择“无”以减少处理时间。对于蛋白质消化,请根据实验要求调整参数并保持其余默认设置。
现在,切换到验证选项卡。取消选中预测RT和预测谱图,因为这些选项适用于与数据无关的采集工作流程。单击量化 MS1 选项卡。
选择运行 MS1 quant,然后单击加载量化默认值。选择离子量并将所有其他设置保留为默认值。最后,单击运行选项卡继续。
选择所需的输出目录,然后单击运行开始分析数据。在胰腺导管腺癌 (PDAC) 患者中,与正常个体相比,SERPINA5 和 HPSE 的表达显着降低,而 FGB 在血清中的表达增加。在肝细胞癌肿瘤样本中,ENO3、PLS3、MTAP、SERPINB9和ITPR2相对于配对组织的表达降低,而ME1、CYP27A1、RPS16和ATP5PF显著升高。
热图可视化显示,与正常个体相比,PDAC 患者血清中的蛋白质表达持续升高。PDAC血清基因本体富集分析显示,凝血和止血相关过程显著上调。肝细胞癌肿瘤的GO分析确定了核苷酸和代谢过程的富集,包括嘌呤核苷酸代谢和NAD代谢途径。
PDAC血清的KEGG通路富集分析显示,补体和凝血级联通路显著激活,糖胺聚糖降解。肝细胞癌肿瘤样本中的 KEG 分析发现 PPAR 信号传导、碳代谢和神经退行性疾病途径富集,但统计学意义较低。上调PDAC血清蛋白的蛋白质-蛋白质相互作用网络揭示了一个中心簇,涉及凝血因子11、纤维蛋白原β链和血浆丝氨酸蛋白酶抑制剂,以及几种分离的蛋白质,包括HPSE、CD5抗原样和CRISP3。
查看完整文字稿并访问数千部科学视频
本研究为生物学家提供了使用免费的前沿工具分析复杂蛋白质组学数据的全面指南。
基于质谱的蛋白质组学在早期发现和转化研究中正变得日益重要,然而数据的复杂性以及缺乏便捷可用的工作流程限制了其在生物制药研发中的广泛应用。本文展示了如何利用免费的、与厂商无关的计算工具,对公开的蛋白质组学数据集进行可靠的数据解析和验证,从而在无需新增实验负担的情况下支持以假设为导向的研究。简化的数据分析流程可提高预测的可信度,并促进跨研究的比较,直接推动靶点验证和生物标志物发现的进程。
该工作流程利用公共数据库和免费计算工具,将质谱数据分析贯穿于早期发现、先导物鉴定及转化研究的全过程。