Article de méthode

Naviguer dans les données protéomiques basées sur la spectrométrie de masse à l’aide d’outils de calcul gratuits

DOI :

10.3791/68707

19 août 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les données protéomiques basées sur la spectrométrie de masse sont disponibles dans des bases de données ouvertes et accessibles à l’aide d’outils gratuits. Compte tenu de la complexité des recherches et des descriptions dans les bases de données, de nombreux biologistes n’ont pas les connaissances nécessaires pour utiliser ces ensembles de données. Nous vous proposons ici un guide sur l’utilisation d’outils gratuits pour les recherches de données protéomiques de base.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les données protéomiques basées sur la spectrométrie de masse (MS), y compris l’acquisition dépendante des données (DDA) et l’acquisition indépendante des données (DIA), sont largement utilisées dans la recherche biologique. Cependant, l’application de ces ensembles de données dans les études de validation est encore limitée en raison du manque de démonstrations claires sur la façon de rechercher et d’analyser efficacement les données protéomiques. Pour combler cette lacune, nous avons sélectionné un ensemble de données DDA et un ensemble de données DIA déposés dans le référentiel de données PRURE (PRED Database PRoteomics IDEntifications Database) afin de mieux illustrer le flux de travail d’analyse des données protéomiques et le post-traitement en aval des résultats de recherche de protéines. À des fins de démonstration, nous avons utilisé deux outils de calcul gratuits : FragPipe (v22.0) pour les ensembles de données DDA et DIA-NN (2.1.0) pour les ensembles de données DIA. Les étapes de post-traitement, telles que la génération de graphiques volcaniques et de listes de protéines dérégulées, ont été démontrées à l’aide du code R. Cette étude fournit des protocoles de base pour la recherche et l’analyse des données protéomiques, servant de guide essentiel pour le débutant pour gérer efficacement les ensembles de données protéomiques. Grâce à ce travail, nous visons à donner aux chercheurs les connaissances nécessaires pour exploiter les données protéomiques dans leurs investigations biologiques.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le domaine de la protéomique a été révolutionné par l’adoption généralisée de dépôts de données en libre accès et d’outils logiciels libres1, qui ont joué un rôle déterminant dans l’avancement des capacités de recherche et la promotion d’une culture de partage des données. La mise en place de ressources centralisées, telles que PRIDE2, et le développement de formats de données normalisés par l’Initiative de normes de protéomique (PSI)3 de la Human Proteome Organization (HUPO) ont créé une opportunité sans précédent pour la réutilisation et l’intégration des données. Cependant, l’analyse et l’interprétation des données protéomiques présentent encore des obstacles techniques importants, en particulier pour les biologistes et les médecins-chercheurs qui souhaitent effectuer une validation orthogonale de leurs propres résultats expérimentaux4. Ce manuscrit s’attaque directement à ce défi en présentant un flux de travail informatique indépendant du fournisseur afin de fournir un cadre accessible aux chercheurs pour interroger, analyser et intégrer indépendamment des données protéomiques publiques à leurs propres résultats, facilitant ainsi une validation orthogonale robuste sans avoir besoin d’expériences supplémentaires en laboratoire humide. Ce travail est particulièrement approprié pour les chercheurs cherchant à valider orthogonalement l’expression différentielle de protéines spécifiques identifiées dans leurs propres expériences et à générer de nouvelles hypothèses en explorant les modèles d’expression de leurs protéines d’intérêt à travers un large éventail d’études publiées. En fournissant un guide étape par étape, nous visons à donner à un plus grand nombre de scientifiques les moyens d’exploiter tout le potentiel des données protéomiques publiques, améliorant ainsi la robustesse et l’impact de leurs recherches.

En protéomique basée sur la spectrométrie de masse (MS), les balayages MS1 et MS2 sont fondamentaux pour l’acquisition des données. Les balayages MS1, ou balayages d’arpentage, détectent et mesurent les rapports masse/charge (m/z) de tous les ions d’un échantillon, fournissant ainsi une vue d’ensemble complète de la population d’ions5. Les balayages MS2, également appelés balayages de fragmentation, consistent à isoler et à fragmenter des ions précurseurs spécifiques choisis dans le balayage MS1, générant des spectres d’ions fragmentaires pour l’identification des peptides6.

L’acquisition dépendante des données (DDA) sélectionne les ions les plus abondants des balayages MS1 pour la fragmentation de MS2, produisant des spectres plus simples qui simplifient l’analyse. Cependant, la DDA peut conduire à un échantillonnage stochastique et à des valeurs manquantes dans des échantillons complexes, limitant ainsi la reproductibilité7. En revanche, l’acquisition indépendante des données (DIA) fragmente systématiquement tous les ions dans des fenêtres m/z prédéfinies, assurant une couverture complète et minimisant les valeurs manquantes. Cela améliore la précision quantitative et la reproductibilité8, bien que DIA exige des outils de calcul avancés pour déconvolution de ses spectres MS2 très complexes9.

PRIDE (https://www.ebi.ac.uk/pride)2est un référentiel de premier plan au sein du ProteomeXchange Consortium (https://www.proteomexchange.org)10, une plateforme mondiale de partage de données protéomiques. Les utilisateurs peuvent naviguer efficacement dans cette vaste ressource à l’aide de recherches par mots-clés pour localiser les ensembles de données qui les intéressent.

DIA-NN11, une suite logicielle exploitant des réseaux neuronaux profonds, est un outil de référence pour l’analyse des données protéomiques d’acquisition indépendante des données (DIA). Il excelle dans la précision de l’identification et de la quantification, ce qui le rend particulièrement efficace pour le traitement d’ensembles de données DIA complexes12. Pour les flux de travail d’acquisition dépendante des données (DDA), MSFragger13, intégré au pipeline FragPipe, offre une identification ultra-rapide des peptides. Son approche innovante d’indexation par fragments permet une correspondance spectrale rapide, surpassant les outils traditionnels de plus de 100 fois en vitesse.

Équipés de ces bases de données complètes et d’outils avancés, les chercheurs peuvent facilement réutiliser les données protéomiques pour la validation d’études croisées et de nouvelles découvertes biologiques. Cette accessibilité a permis l’identification de nombreux biomarqueurs protéiques dans diverses maladies14,15, l’amélioration de la prédiction du pronostic16 et la classification des sous-types moléculaires basée sur les profils protéomiques17.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

REMARQUE : Voir la figure 1pour une vue d’ensemble du flux de travail et la table des matériaux pour une description détaillée du logiciel utilisé.

figure-protocol-1
Figure 1 : Vue d’ensemble de la conception de l’étude. Veuillez cliquer ici pour voir une version agrandie de cette figure.

1. Exemple de configuration de fichier et de logiciel

REMARQUE : Toutes les applications sont gratuites pour une utilisation de recherche individuelle et peuvent être exécutées sur un ordinateur personnel (Windows et Linux sont pris en charge).

  1. Créez un répertoire pour un projet.
  2. Télécharger JMU_LM2_8526_55.raw, JMU_LM2_8568_51.raw, JMU_LM2_8696_37.raw, JMU_LM2_2112_87.raw, JMU_LM2_2195_91.raw, JMU_LM2_2377_73.raw, 20150127_liver_XH03_T_01.raw, 20150127_liver_XH03_T_02.raw, 20150127_liver_XH03_T_03.raw, 20150127_liver_XH03_P_01.raw, 20150127_liver_XH03_P_02.raw, 20150127_liver_XH03_P_03.raw de PRIDE.
    REMARQUE : les deux groupes de fichiers peuvent être téléchargés à partir de https://www.ebi.ac.uk/pride/archive/projects/PXD039273 et https://www.ebi.ac.uk/pride/archive/projects/PXD006512 séparément (Figure 2).
  3. Téléchargez et installez les outils logiciels requis.
    1. Téléchargez la dernière version de DIA-NN sous forme de fichier .msi. DIA-NN est disponible gratuitement sous forme de fichier .msi pour Windows ou de fichier .zip pour Linux à partir de https://github.com/vdemichev/DiaNN/releases/tag/2.0
    2. Téléchargez la dernière version de MSFileReader sous forme de fichier .exe. MSFileReader est disponible gratuitement sous forme de fichier .exe de https://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe, qui est nécessaire pour traiter les données DIA Thermo Fisher formatées brutes.
    3. Téléchargez la dernière version du SDK .NET sous forme de fichier .exe. Le SDK .NET est disponible gratuitement sous la forme d’un fichier .exe à partir de https://dotnet.microsoft.com/en-us/download, qui est requis dans Windows pour exécuter MSFileReader.
    4. Téléchargez la dernière version de FragPipe sous forme de fichier .zip. FragPipe est disponible gratuitement sous forme de fichier .zip à partir de https://github.com/Nesvilab/FragPipe/releases. Le fichier zip avec jre est recommandé car il contient un runtime Java pour Windows, qui est nécessaire pour exécuter FragPipe. MSFragger est intégré dans le FragPipe.
  4. Téléchargez la dernière version des fichiers R et Rstudio et R script à partir du Fichier supplémentaire 1 et du Fichier supplémentaire 2. R et RStudio peuvent être téléchargés gratuitement à partir de https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe et https://posit.co/download/rstudio-desktop/.
  5. Décompressez les fichiers compressés et cliquez sur l’icône . exe ou .msi pour installer les applications.

2. Analyse des données DIA à l’aide de DIA-NN

  1. Téléchargez le fichier de référence proteome fasta d’UniProt. Pour télécharger le protéome de référence de l’Homo sapiens (informations sur les isoformes non incluses), rendez-vous sur https://www.uniprot.org/proteomes/UP000005640 (Figure 3A).
  2. Cliquez sur le bouton Ajouter FASTA pour charger le fichier de protéome de référence dans DIA-NN.
  3. Sélectionnez les deux options FASTA digest pour la recherche sans bibliothèque / génération de bibliothèque et Spectres basés sur l’apprentissage profond, prédiction des RT et des lMs sous la partie Génération d’ions précurseurs. Cliquez sur le bouton Exécuter pour générer une bibliothèque spectrale prédite (Figure 3B).
    1. Une fois que le fichier de la bibliothèque spectrale prédite a été généré, réutilisez-le pour d’autres expériences dans les mêmes paramètres d’acquisition expérimentale en cliquant sur le bouton Spectral pour ajouter la bibliothèque prédite.
  4. Désélectionnez les deux options sous la partie Génération d’ions précurseurs et cliquez sur le bouton Type qui correspond au format de fichier sous la partie Entrée pour charger les données DIA.
  5. Définissez la précision de masse et la précision MS1 sous l’algorithme sur 0,0 ppm.
  6. Ajustez les paramètres de plage de masse des précurseurs et des fragments sous Génération d’ions précurseurs en fonction des paramètres expérimentaux.
  7. Conservez les autres paramètres par défaut.
    1. La génération de précurseurs de DIA-NN utilise la trypsine/P (clivage après K/R à moins qu’il ne soit suivi de proline) avec 1 clivage manqué pour modéliser la digestion partielle ; désactiver l’excision M à terme N pour les peptides non canoniques (par exemple, immunopeptidomiques) ou augmenter les clivages manqués à 2 pour les peptides plus longs.
    2. Activez explicitement les modifications de variables (désactivées par défaut) pour les études de modification post-traductionnelle (PTM) (par exemple, Ox (M) pour l’oxydation, K-GG pour l’ubiquitination), et étendez les filtres peptidiques (longueur : 7-30 aa ; charge : 1-4+ ; précurseur m/z : 300-1800) en fonction des paramètres expérimentaux (par exemple, longueur : 5-50 aa, charge = 1-6) pour les PTM de grande taille ou les digestions non tryptiques.
    3. Les paramètres de l’algorithme exploitent l’étalonnage automatique (précision de masse = 0,0 ppm) pour un alignement précis de la masse (remplacement par des tolérances manuelles (par exemple, 10 ppm) pour les instruments à basse résolution, et la fonction MBR (Match Between Runs) transfère les ID entre les cycles (désactivée pour les échantillons hétérogènes).
    4. La notation du réseau neuronal renforce la confiance dans l’identification (à moins que la qualité des données ne soit médiocre), tandis que la spectrométrie de masse quantitative non étiquetée (UMS) permet une quantification de haute précision sans marquage ; passer à la quantification MS2 pour les marqueurs isobares (par exemple, TMT). Utilisez la recherche sans bibliothèque uniquement avec des données DIA haute résolution pour contourner les exigences de la bibliothèque spectrale.
  8. Cliquez sur le bouton Exécuter . Attendez les résultats jusqu’à ce que l’option Terminé s’affiche dans l’interface de fonctionnement pour indiquer que l’exécution est terminée (Figure 3C).

3. Analyse des données DDA à l’aide de FragPipe

  1. Cliquez sur l’icône Fragpipe dans le dossier ~\FragPipe\fragpipe\bin après l’installation. Tous les paramètres dépendants peuvent être consultés dans l’onglet Config. Vérifiez si les trois modules (MSFragger, IonQuant, diaTracer, DIA-NN et Python) existent sur votre ordinateur. Si ce n’est pas le cas, téléchargez-les en cliquant sur Télécharger/Mettre à jour ou Télécharger (Figure 4A).
  2. Passez à l’onglet suivant, Workflow. Sélectionnez Par défaut pour le flux de travail et cliquez sur Charger le flux de travail. Cliquez sur Ajouter des fichiers pour ajouter des chemins d’accès aux fichiers. Attribuez le nom de l’expérience et le numéro de bioréplication sous Attribuer des fichiers ou laissez-le simplement (Figure 4B).
  3. Maintenant, cliquez sur Base de données et tournez-vous vers cet onglet. Chargez un fichier fasta ou téléchargez n’importe quel fichier fasta en fonction de l’espèce des échantillons. Lors du téléchargement, choisissez les options Séquences examinées uniquement, Ajouter des leurres et Ajouter des contaminants courants pour une exécution simple (Figure 4C).
  4. Cliquez ensuite sur MSFragger pour changer d’onglet. Choisissez la configuration par défaut de la recherche fermée et cliquez sur Charger.
    REMARQUE : La recherche fermée est essentiellement une recherche des modifications que vous avez définies, tandis que la recherche ouverte explorera toutes les modifications possibles à partir des données, ce qui prend plus de temps et de mémoire.
  5. Pour l’appariement des pics, conservez les paramètres par défaut, sauf qu’il est recommandé de choisir Aucun pour l’étalonnage et l’optimisation, car cela vous fera gagner du temps.
  6. Pour la digestion des protéines, ajustez les paramètres en fonction des conditions expérimentales. Conservez les paramètres par défaut suivants (Figure 5A).
    REMARQUE : Les tolérances de masse des précurseurs et des fragments (± 20 ppm) définissent l’erreur de masse maximale autorisée pour l’appariement des spectres expérimentaux aux peptides théoriques, avec des valeurs plus strictes recommandées pour les instruments à haute résolution. Les règles enzymatiques (trypsine stricte) spécifient la spécificité du clivage (après K/R, sauf si suivi de P), les clivages manqués (2) permettant des peptides partiellement digérés. Les filtres de longueur (5 à 50 résidus) et de masse (500 à 5000 Da) des peptides excluent les candidats improbables. Les modifications variables (par exemple, +15,9949 Da sur la méthionine pour l’oxydation, +79,96633 Da sur S/T/Y pour la phosphorylation) permettent de détecter les altérations chimiques, tandis que les combinaisons Max (5) limitent les modifications simultanées par peptide pour gérer l’espace de recherche. Le nombre maximum de mods variables par site (par exemple, 3 sur M) contrôle la fréquence de modification. La base de données divisée améliore l’efficacité des grands protéomes, et l’erreur isotopique (0/1/2) tient compte des pics isotopiques mal attribués. Ces paramètres équilibrent collectivement la sensibilité, la spécificité et la charge de calcul dans l’identification des peptides.
  7. Passez à l’onglet Validation. Désélectionnez Prédire RT et Prédire les spectres, qui s’applique aux données DIA (Figure 5B).
  8. Cliquez sur l’onglet Quant (MS1). Sélectionnez Exécuter MS1 quant et cliquez sur Charger les paramètres par défaut de Quant. Sélectionnez IonQuant et conservez les paramètres par défaut (Figure 6A). Désactivez MBR pour les temps de rétention instables ou désactivez la normalisation de l’intensité si des biais de mise à l’échelle globaux en résultent ; activez l’option Conserver l’index sur le disque pour économiser la RAM avec des jeux de données volumineux.
    REMARQUE : Par défaut, Quant (MS1) optimise la quantification sans marquage à l’aide de MaxLPQ (MaxLFQ-based Protein Quantification, un algorithme étendant la méthode MaxLFQ aux groupes de protéines), nécessitant ≥1 ion unique par protéine (augmentation à ≥2 pour une plus grande rigueur au détriment de la couverture). La correspondance entre les cycles (MBR) transfère les identifications entre les exécutions à l’aide de la tolérance de temps de rétention (RT) (par défaut 0,4 min ; serrage à 0,2 min pour la chromatographie stable ou desserrage pour la variabilité du gradient) et de la tolérance de mobilité ionique (IM) (par défaut 0,05 1/k0 [mobilité réduite inverse] ; ajustement en fonction de la précision de l’IM), filtrée par ≤1 % FDR (taux de fausses découvertes ; MBR par défaut FDR = 0,01 ; inférieur à 0,005 pour la rigueur). L’inférence protéique utilise uniquer+rascor (attribution de peptides de rasoir pour le regroupement des protéines). La détection des caractéristiques utilise une tolérance de masse de 10 ppm (augmentation à 20 ppm pour la spectrométrie de masse basse résolution ou diminution à 5 ppm pour la haute résolution).
  9. Maintenant, cliquez sur l’onglet Exécuter . Sélectionnez Répertoire de sortie. Cliquez sur RUN pour commencer à analyser les données (Figure 6B).
    REMARQUE : Pour les données protéomiques sans marquage qui ne se concentrent pas sur les modifications ou n’utilisent pas la quantification basée sur l’étiquette, les onglets PTM, Glyco et Quant (isobarique) ne sont pas utilisés.

4. Analyse en aval DIA-NN/FragPipe

REMARQUE : Les codes détaillés utilisés dans cette étude sont inclus dans le Fichier supplémentaire 1 et le Fichier supplémentaire 2. Les versions des progiciels utilisées dans cette étude se trouvent dans le Dossier supplémentaire 3.

  1. Ouvrez RStudio et lisez les données d’expression protéique générées par DIA-NN ou FragPipe. Les données de matrice de groupes de protéines se terminant par .pg_matrix.tsv de DIA-NN et les données de protéines combinées se terminant par .tsv de FragPipe sont normalement utilisées pour l’analyse.
  2. Supprimer les valeurs manquantes sans renseigner NA et filtrer les groupes protéiques identifiés et quantifiés avec moins de deux peptides uniques.
    REMARQUE : Les chiffres de la DIA dans cette étude ont été générés par des groupes de protéines filtrées, tandis que les chiffres de la DDA provenaient de groupes de protéines non filtrées.
  3. Normalisez l’intensité des protéines à l’aide de la mise à l’échelle médiane ou de la normalisation quantile sur les échantillons. Les données DIA de cette étude ont été normalisées par la normalisation médiane, tandis que les données DDA ont été normalisées par normalisation quantile pour mieux illustrer les deux méthodes.
    REMARQUE : La normalisation médiane est robuste contre les valeurs aberrantes et convient aux scénarios où la majorité des protéines restent inchangées dans les échantillons, ce qui fait de l’abondance médiane des protéines un point de référence stable. Cependant, il peut échouer dans les scénarios où les protéines sont fortement exprimées de manière différentielle18. La normalisation quantile assure une distribution uniforme des abondances de protéines entre les échantillons, ce qui est utile lorsque l’on compare des échantillons ayant des distributions disparates. Il a été démontré qu’elle réduit la puissance statistique et peut surnormaliser les données, masquant potentiellement les véritables différences biologiques18. En protéomique, la normalisation médiane est largement utilisée dans les études sans marquage pour éliminer les biais systématiques liés à la performance des instruments MS. La normalisation quantile est préférée pour les jeux de données à grande échelle, l’analyse d’expression différentielle et l’analyse de cluster19,20.
  4. Calculez les variations de multiplication log2 (p. ex., PDAC sérique par rapport à normale) et les valeurs p du test t. Calculez les valeurs p corrigées à l’aide de la méthode de Benjamini-Hochberg. Définissez des seuils de signification (p. ex., |log2FC| > 1, p_adj (FDR) < 0,05).
    REMARQUE : Les valeurs seuils de p utilisées dans les chiffres de cette étude représentent des valeurs brutes, car l’utilisation de valeurs de p ajustées (p_adj) éliminerait toutes les protéines détectables dans la limite de la puissance statistique de ces ensembles de données limités.
  5. Vérifiez l’existence de valeurs manquantes/NA et excluez-les. Générez un graphique du volcan pour visualiser les impacts significatifs.
  6. Sélectionnez des protéines significativement dérégulées. Appliquez la normalisation du score Z aux valeurs d’expression des protéines. Tracez une carte thermique en cluster avec des annotations de groupe d’échantillons.
  7. Mappez les protéines aux Entrez ID à l’aide de org. Hs.eg.db. Effectuer l’enrichissement GO (procédé biologique) et l’analyse de la voie KEGG.
    REMARQUE : Les catégories de processus biologiques (BP) sont couramment sélectionnées dans l’analyse de l’ontologie génétique (GO) car elles décrivent les processus plus vastes ou les programmes biologiques accomplis par plusieurs activités moléculaires20. Ces termes se concentrent sur les fonctions cellulaires qui se dérèglent dans des maladies comme le cancer, y compris les processus essentiels tels que la régulation du cycle cellulaire, les processus métaboliques, etc. En plus de la BP, l’analyse GO comprend également les catégories de fonction moléculaire (MF) et de composant cellulaire (CC). Les termes MF décrivent les activités biochimiques des produits géniques, tels que le transport d’ions ou les capacités de liaison à l’ADN. Les termes CC définissent les emplacements cellulaires où les produits géniques remplissent leurs fonctions, tels que le noyau, la membrane mitochondriale ou le cytosquelette.
  8. Interrogez STRINGdb pour les interactions (score de confiance ≥ 400). Générez un réseau interactif à l’aide de visNetwork.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Pour mieux illustrer la recherche d’ensembles de données protéomiques, nous avons sélectionné deux types d’ensembles de données pour cette analyse. Dans le but de démontrer des protéines dérégulées dans des contextes cliniques, nous avons effectué une recherche dans PRIDE en utilisant des mots-clés tels que clinique. Plus précisément, nous avons sélectionné un ensemble de données adapté à l’analyse DIA du Consortium d’analyse clinique des tumeurs protéomiques (CPTAC)21

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le protocole présenté illustre l’analyse protéomique des données en intégrant des outils gratuits comme DIA-NN et FragPipe. Le succès dépend d’étapes critiques telles que la sélection précise des ions précurseurs et les paramètres de précision de masse pour la génération de bibliothèques spectrales dans DIA-NN (étape 2.3)27, qui dépendent de l’instrument et sont cruciales pour l’identification complète des peptides. De même, la configuration méticuleuse de la base...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

F.Z. est le fondateur de Molemuse Biotech Studio.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce projet est soutenu par Molemuse Biotech Studio.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Kit de développement logiciel (SDK) .NET v. 9.0.203Microsofthttps://dotnet.microsoft.com/en-us/download
DIA-NN v. 2.1.0https://github.com/vdemichev/DiaNN/releases/tag/2.0  ;
FragPipe v. 22.0https://github.com/Nesvilab/FragPipe/releases
MSFileReader v. 3.1  ;Thermo Fisherhttps://github.com/thermofisherlsms/MSFileReader/blob/main/MSFileReader_x64.exe
R 4.5.0https://cran.rstudio.com/bin/windows/base/R-4.5.0-win.exe
Rstudio c. 2024.12.1+563https://posit.co/download/rstudio-desktop/

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pedrioli, P. G. A., et al. A common open representation of mass spectrometry data and its application to proteomics research. Nat Biotechnol. 22 (11), 1459-1466 (2004).
  2. Perez-Riverol, Y., et al. The PRIDE database at 20 years: 2025 update. Nucl Acids Res. 53 (D1), D543-D553 (2025).
  3. Deutsch, E. W., et al. Proteomics Standards Initiative at Twenty Years: Current Activities and Future Work. J Proteome Res. 22 (2), 287-301 (2023).
  4. Schubert, O. T., Röst, H. L., Collins, B. C., Rosenberger, G., Aebersold, R. Quantitative proteomics: challenges and opportunities in basic and applied research. Nat Protoc. 12 (7), 1289-1294 (2017).
  5. Wang, X., Shen, S., Rasam, S. S., Qu, J. MS1 ion current-based quantitative proteomics: A promising solution for reliable analysis of large biological cohorts. Mass Spectro Rev. 38 (6), 461-482 (2019).
  6. Vaudel, M. MS2-Based Quantitation. Proteome Inform. , 155-177 (2016).
  7. Meyer, J. G. Qualitative and Quantitative Shotgun Proteomics Data Analysis from Data-Dependent Acquisition Mass Spectrometry. Shotgun Proteomics. 2259, 297-308 (2021).
  8. Fröhlich, K., et al. Data-Independent Acquisition: A Milestone and Prospect in Clinical Mass Spectrometry-Based Proteomics. Mol Cell Proteomics. 23 (8), 100800(2024).
  9. Zhang, F., Ge, W., Ruan, G., Cai, X., Guo, T. Data-Independent Acquisition Mass Spectrometry-Based Proteomics and Software Tools: A Glimpse in 2020. Proteomics. 20 (17-18), 1900276(2020).
  10. Deutsch, E. W., et al. The ProteomeXchange consortium at 10 years: 2023 update. Nucl Acids Res. 51 (D1), D1539-D1548 (2023).
  11. Demichev, V., Messner, C. B., Vernardis, S. I., Lilley, K. S., Ralser, M. DIA-NN:neural networks and interference correction enable deep proteome coverage in high throughput. Nat Meth. 17 (1), 41-44 (2020).
  12. Zhang, F., et al. A Comparative Analysis of Data Analysis Tools for Data-Independent Acquisition Mass Spectrometry. Mol Cell Proteomics. 22 (9), 100623(2023).
  13. Kong, A. T., Leprevost, F. V., Avtonomov, D. M., Mellacheruvu, D., Nesvizhskii, A. I. MSFragger: ultrafast and comprehensive peptide identification in mass spectrometry-based proteomics. Nat Meth. 14 (5), 513-520 (2017).
  14. Anderson, N. L., Anderson, N. G. The Human Plasma Proteome. Mol Cell Proteomics. 1 (11), 845-867 (2002).
  15. Kowal, J., et al. Proteomic comparison defines novel markers to characterize heterogeneous populations of extracellular vesicle subtypes. Proc Natl Acad Sci. 113 (8), E968-E977 (2016).
  16. Cao, L., et al. Proteogenomic characterization of pancreatic ductal adenocarcinoma. Cell. 184 (19), 5031-5052.e26 (2021).
  17. Dong, L., et al. Proteogenomic characterization identifies clinically relevant subgroups of intrahepatic cholangiocarcinoma. Cancer Cell. 40 (1), 70-87.e15 (2022).
  18. Dubois, E., Galindo, A. N., Dayon, L., Cominetti, O. Comparison of normalization methods in clinical research applications of mass spectrometry-based proteomics. 2020 IEEE Conf Computat Intelligence Bioinfo Computat Biol. , 1-10 (2020).
  19. Dressler, F. F., Brägelmann, J., Reischl, M., Perner, S. Normics: Proteomic Normalization by Variance and Data-Inherent Correlation Structure. Mol Cell Proteomics. 21 (9), 100269(2022).
  20. Dimmer, E. C., et al. The Gene Ontology - Providing a Functional Role in Proteomic Studies. Proteomics. 8 (23-24), pmic.200800002(2008).
  21. Lih, T. M., et al. Detection of Pancreatic Ductal Adenocarcinoma-Associated Proteins in Serum. Mol Cell Proteomics. 23 (1), 100687(2024).
  22. Chinese Human Proteome Project (CNHPP) Consortium. Proteomics identifies new therapeutic targets of early-stage hepatocellular carcinoma. Nature. 567 (7747), 257-261 (2019).
  23. Kanehisa, M., Furumichi, M., Sato, Y., Matsuura, Y., Ishiguro-Watanabe, M. KEGG: biological systems database as a model of the real world. Nucl Acids Res. 53 (D1), D672-D677 (2025).
  24. Campello, E., Ilich, A., Simioni, P., Key, N. S. The relationship between pancreatic cancer and hypercoagulability: a comprehensive review on epidemiological and biological issues. Br J Cancer. 121 (5), 359-371 (2019).
  25. Fang, L., Xu, Q., Qian, J., Zhou, J. Y. Aberrant Factors of Fibrinolysis and Coagulation in Pancreatic Cancer. OncoTargets Ther. 14, 53-65 (2021).
  26. Vlodavsky, I., Elkin, M., Ilan, N. Impact of heparanase and the tumor microenvironment on cancer metastasis and angiogenesis: basic aspects and clinical applications . Rambam Maimonides Med J. 2 (1), (2011).
  27. Fröhlich, K., et al. Benchmarking of analysis strategies for data-independent acquisition proteomics using a large-scale dataset comprising inter-patient heterogeneity. Nat Comm. 13 (1), 2622(2022).
  28. Polasky, D. A., et al. MSFragger-Labile: A Flexible Method to Improve Labile PTM Analysis in Proteomics. Mol Cell Proteomics. 22 (5), 100538(2023).
  29. Gerault, M. A., Camoin, L., Granjeaud, S. DIAgui: a Shiny application to process the output from DIA-NN. Bioinfo Adv. 4 (1), (2024).
  30. Hsiao, Y., et al. Analysis and Visualization of Quantitative Proteomics Data Using FragPipe-Analyst. J Proteome Res. 23 (10), 4303-4315 (2024).
  31. Yu, F., Deng, Y., Nesvizhskii, A. I. MSFragger-DDA+ enhances peptide identification sensitivity with full isolation window search. Nat Comm. 16 (1), 3329(2025).
  32. Li, K., Teo, G. C., Yang, K. L., Yu, F., Nesvizhskii, A. I. diaTracer enables spectrum-centric analysis of diaPASEF proteomics data. Nat Comm. 16 (1), 95(2025).
  33. Qiao, R., Li, H., Bian, H., Xin, L., Shan, B. De Novo sequencing-assisted homology search for DIA data analysis enables low abundance peptide variants discovery. Biorvix. 10, (2025).
  34. Meissner, F., Geddes-McAlister, J., Mann, M., Bantscheff, M. The emerging role of mass spectrometry-based proteomics in drug discovery. Nat Rev Drug Disc. 21 (9), 637-654 (2022).
  35. Zheng, Y., et al. Multi-omics data integration using ratio-based quantitative profiling with Quartet reference materials. Nat Biotechnol. 42 (7), 1133-1149 (2024).
  36. Bubis, J. A., et al. Challenging the Astral mass analyzer to quantify up to 5,300 proteins per single cell at unseen accuracy to uncover cellular heterogeneity. Nat Meth. 22 (3), 510-519 (2025).
  37. Leutert, M., Entwisle, S. W., Villén, J. Decoding Post-Translational Modification Crosstalk With Proteomics. Mol Cell Proteomics. 20, 100129(2021).
  38. Schneider, M., et al. A Scalable, Web-Based Platform for Proteomics Data Processing, Result Storage and Analysis. Proteome Res. 24 (3), 1241-1249 (2025).
  39. Jalili, V., et al. The Galaxy platform for accessible, reproducible and collaborative biomedical analyses: 2020 update. Nucl Acids Res. 48 (W1), W395-W402 (2020).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Analyse de donn es prot omiquesacquisition d pendante des donn esacquisition ind pendante des donn esquantification des prot inesgraphique en volcananalyse de l ontologie g niqueanalyse des voies KEGGr seau d interaction prot ique

Articles connexes