19 août 2025
Les données protéomiques basées sur la spectrométrie de masse sont disponibles dans des bases de données ouvertes et accessibles à l’aide d’outils gratuits. Compte tenu de la complexité des recherches et des descriptions dans les bases de données, de nombreux biologistes n’ont pas les connaissances nécessaires pour utiliser ces ensembles de données. Nous vous proposons ici un guide sur l’utilisation d’outils gratuits pour les recherches de données protéomiques de base.
Notre travail fournit un guide aux biologistes pour analyser des données protéomiques complexes à l’aide d’outils gratuits. Notre objectif est de leur donner les moyens de valider les résultats et d’explorer des ensembles de données publics. De nombreux biologistes ne peuvent pas utiliser les données publiques sur le protéome en raison d’un manque de guide clair.
Notre travail permet de faire le lien entre ces deux dernières et de valider sans nouvelles expériences sur la faune. Notre travail utilise des logiciels gratuits de pointe qui sont indépendants des fournisseurs. Ces outils sont plus rapides, plus sensibles et offrent une découverte plus précise du protéome que de nombreux outils traditionnels.
Pour commencer, téléchargez le fichier FASTA du protéome de référence à partir de la base de données UniProt. Cliquez sur le bouton ajouter FASTA pour charger le fichier de protéome de référence dans le logiciel DIA-NN. Sélectionnez les deux options suivantes : FASTA digest pour la génération de bibliothèques de recherche gratuite et Spectres, RT et IM basés sur l’apprentissage profond dans la section Génération d’ions précurseurs.
Ensuite, cliquez sur le bouton Exécuter pour générer une bibliothèque spectrale prédite. Désélectionnez les deux options dans la section Génération d’ions précurseurs. Cliquez sur le bouton de type qui correspond au format de fichier sous la section d’entrée pour charger les données DIA.
Maintenant, réglez la précision de masse et la précision MS1 à zéro partie par million dans la section algorithme. Ajustez les paramètres de plage de masse des précurseurs et des fragments dans la section de génération d’ions précurseurs en fonction de la configuration expérimentale. Conservez les autres paramètres du logiciel inchangés.
Ensuite, cliquez sur le bouton Exécuter. Attendre jusqu’à ce que terminé s’affiche sur l’interface de fonctionnement, indiquant que l’analyse est terminée. Cliquez sur l’icône du tuyau de fragmentation située dans le dossier bin après l’installation.
Accédez à l’onglet de configuration pour afficher tous les paramètres dépendants. Vérifiez si les modules MSFragger, IonQuant, diaTracer, DIA-NN et Python sont disponibles sur votre système. S’il manque des modules, cliquez sur télécharger, mettre à jour ou télécharger pour les récupérer.
Maintenant, passez à l’onglet du flux de travail. Sélectionnez par défaut dans la liste déroulante du flux de travail et cliquez sur charger le flux de travail. Ensuite, cliquez sur ajouter des fichiers pour saisir les chemins d’accès aux fichiers.
Attribuez le nom de l’expérience et le numéro de la répétition biologique sous Attribuer des fichiers ou laissez-le vide. Ensuite, cliquez sur l’onglet de la base de données pour y accéder. Chargez un fichier FASTA à partir du disque ou téléchargez-en un qui correspond à l’espèce de l’échantillon.
Pendant le téléchargement, sélectionnez les options séquences examinées uniquement, ajoutez des leurres et ajoutez des contaminants courants pour une exécution simple. Cliquez sur l’onglet MSFragger pour changer d’affichage. Sélectionnez la configuration par défaut de la recherche fermée et cliquez sur charger.
Sous les paramètres de correspondance maximale, conservez toutes les valeurs par défaut. Pour l’étalonnage et l’optimisation, sélectionnez aucun pour réduire le temps de traitement. Pour la digestion des protéines, ajustez les paramètres en fonction des exigences de votre expérience et conservez les autres paramètres par défaut.
Maintenant, passez à l’onglet de validation. Décochez les options Prédire RT et Prédire les spectres, car ces options sont destinées aux flux de travail d’acquisition indépendants des données. Cliquez sur l’onglet quantitatif MS1.
Sélectionnez exécuter MS1 quant, puis cliquez sur charger les paramètres par défaut du quant. Choisissez ion quant et laissez tous les autres paramètres aux valeurs par défaut. Enfin, cliquez sur l’onglet Exécuter pour continuer.
Sélectionnez le répertoire de sortie souhaité et cliquez sur exécuter pour commencer l’analyse des données. Chez les patients atteints d’adénocarcinome canalaire pancréatique, ou PDAC, SERPINA5 et HPSE ont montré une expression significativement réduite, tandis que FGB a montré une expression sérique accrue par rapport aux individus normaux. Dans les échantillons de tumeurs de carcinome hépatocellulaire, ENO3, PLS3, MTAP, SERPINB9 et ITPR2 ont montré une expression réduite par rapport aux tissus appariés, tandis que ME1, CYP27A1, RPS16 et ATP5PF ont été significativement augmentés.
La visualisation de la carte thermique a révélé une expression sérique constamment élevée des protéines chez les patients atteints de PDAC par rapport aux individus normaux. L’analyse de l’enrichissement de l’ontologie génétique du sérum PDAC a révélé une régulation positive significative des processus liés à la coagulation et à l’hémostase. L’analyse GO des tumeurs du carcinome hépatocellulaire a identifié un enrichissement des processus nucléotidiques et métaboliques, y compris le métabolisme des nucléotides puriques et les voies métaboliques du NAD.
L’analyse de l’enrichissement de la voie KEGG du sérum PDAC a révélé une activation significative de la voie des cascades du complément et de la coagulation, ainsi qu’une dégradation des glycosaminoglycanes. L’analyse KEG dans des échantillons de tumeurs de carcinome hépatocellulaire a identifié un enrichissement de la signalisation PPAR, du métabolisme du carbone et des voies de maladies neurodégénératives, bien qu’avec une signification statistique plus faible. Le réseau d’interaction protéine-protéine pour les protéines sériques PDAC régulées à la hausse a révélé un cluster central impliquant le facteur de coagulation 11, la chaîne bêta du fibrinogène et l’inhibiteur de la sérine protéase plasmatique, ainsi que plusieurs protéines isolées, notamment HPSE, CD5 antigen-like et CRISP3.
Consultez la transcription complète et accédez à des milliers de vidéos scientifiques
Cette étude fournit un guide complet aux biologistes pour analyser des données protéomiques complexes à l'aide d'outils gratuits et à la pointe de la technologie.
La protéomique basée sur la spectrométrie de masse occupe une place de plus en plus centrale dans la recherche fondamentale et translationnelle, mais la complexité des données et l'absence de flux de travail accessibles limitent son adoption plus large dans la R&D biopharmaceutique. Cet article montre comment des outils informatiques gratuits et indépendants des fournisseurs permettent une interrogation et une validation rigoureuses des jeux de données protéomiques publics, soutenant ainsi une recherche fondée sur des hypothèses sans alourdir la charge expérimentale. Des flux de travail d'analyse de données simplifiés renforcent la confiance prédictive et facilitent les comparaisons entre études, influant directement sur les voies de validation de cibles et de découverte de biomarqueurs.
Ce flux de travail positionne l'analyse des données de spectrométrie de masse, depuis la découverte précoce jusqu'à l'identification de candidats thérapeutiques et la recherche translationnelle, en s'appuyant sur des référentiels publics et des outils informatiques gratuits.