$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Le domaine de la protéomique a été révolutionné par l’adoption généralisée de dépôts de données en libre accès et d’outils logiciels libres1, qui ont joué un rôle déterminant dans l’avancement des capacités de recherche et la promotion d’une culture de partage des données. La mise en place de ressources centralisées, telles que PRIDE2, et le développement de formats de données normalisés par l’Initiative de normes de protéomique (PSI)3 de la Human Proteome Organization (HUPO) ont créé une opportunité sans précédent pour la réutilisation et l’intégration des données. Cependant, l’analyse et l’interprétation des données protéomiques présentent encore des obstacles techniques importants, en particulier pour les biologistes et les médecins-chercheurs qui souhaitent effectuer une validation orthogonale de leurs propres résultats expérimentaux4. Ce manuscrit s’attaque directement à ce défi en présentant un flux de travail informatique indépendant du fournisseur afin de fournir un cadre accessible aux chercheurs pour interroger, analyser et intégrer indépendamment des données protéomiques publiques à leurs propres résultats, facilitant ainsi une validation orthogonale robuste sans avoir besoin d’expériences supplémentaires en laboratoire humide. Ce travail est particulièrement approprié pour les chercheurs cherchant à valider orthogonalement l’expression différentielle de protéines spécifiques identifiées dans leurs propres expériences et à générer de nouvelles hypothèses en explorant les modèles d’expression de leurs protéines d’intérêt à travers un large éventail d’études publiées. En fournissant un guide étape par étape, nous visons à donner à un plus grand nombre de scientifiques les moyens d’exploiter tout le potentiel des données protéomiques publiques, améliorant ainsi la robustesse et l’impact de leurs recherches.
En protéomique basée sur la spectrométrie de masse (MS), les balayages MS1 et MS2 sont fondamentaux pour l’acquisition des données. Les balayages MS1, ou balayages d’arpentage, détectent et mesurent les rapports masse/charge (m/z) de tous les ions d’un échantillon, fournissant ainsi une vue d’ensemble complète de la population d’ions5. Les balayages MS2, également appelés balayages de fragmentation, consistent à isoler et à fragmenter des ions précurseurs spécifiques choisis dans le balayage MS1, générant des spectres d’ions fragmentaires pour l’identification des peptides6.
L’acquisition dépendante des données (DDA) sélectionne les ions les plus abondants des balayages MS1 pour la fragmentation de MS2, produisant des spectres plus simples qui simplifient l’analyse. Cependant, la DDA peut conduire à un échantillonnage stochastique et à des valeurs manquantes dans des échantillons complexes, limitant ainsi la reproductibilité7. En revanche, l’acquisition indépendante des données (DIA) fragmente systématiquement tous les ions dans des fenêtres m/z prédéfinies, assurant une couverture complète et minimisant les valeurs manquantes. Cela améliore la précision quantitative et la reproductibilité8, bien que DIA exige des outils de calcul avancés pour déconvolution de ses spectres MS2 très complexes9.
PRIDE (https://www.ebi.ac.uk/pride)2est un référentiel de premier plan au sein du ProteomeXchange Consortium (https://www.proteomexchange.org)10, une plateforme mondiale de partage de données protéomiques. Les utilisateurs peuvent naviguer efficacement dans cette vaste ressource à l’aide de recherches par mots-clés pour localiser les ensembles de données qui les intéressent.
DIA-NN11, une suite logicielle exploitant des réseaux neuronaux profonds, est un outil de référence pour l’analyse des données protéomiques d’acquisition indépendante des données (DIA). Il excelle dans la précision de l’identification et de la quantification, ce qui le rend particulièrement efficace pour le traitement d’ensembles de données DIA complexes12. Pour les flux de travail d’acquisition dépendante des données (DDA), MSFragger13, intégré au pipeline FragPipe, offre une identification ultra-rapide des peptides. Son approche innovante d’indexation par fragments permet une correspondance spectrale rapide, surpassant les outils traditionnels de plus de 100 fois en vitesse.
Équipés de ces bases de données complètes et d’outils avancés, les chercheurs peuvent facilement réutiliser les données protéomiques pour la validation d’études croisées et de nouvelles découvertes biologiques. Cette accessibilité a permis l’identification de nombreux biomarqueurs protéiques dans diverses maladies14,15, l’amélioration de la prédiction du pronostic16 et la classification des sous-types moléculaires basée sur les profils protéomiques17.