$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Ce protocole décrit une méthode computationnelle pour définir les biomarqueurs possibles des lésions hépatiques induites par l’acétaminophène, qui tire parti de la toxicologie des réseaux, de la transcriptomique, de l’apprentissage automatique et du docking moléculaire (Figure 1). Le protocole s’adresse aux chercheurs ayant accès à des outils de bioinformatique, des ensembles de données transcriptomiques et des logiciels d’amarrage moléculaire.
Procédure
Étape 1 : Identification des cibles de l’acétaminophène
Récupérez la représentation SMILES de l’acétaminophène (APAP) sur PubChem. Utilisez des plateformes en ligne (ChEMBL, SwissTargetPrediction, STITCH, SEA) pour prédire les cibles moléculaires potentielles de l’APAP. Intégrez et dédupliquez les cibles prédites pour générer une liste de 140 cibles APAP à haute confiance.
Étape 2 : Identification des cibles d’hépatotoxicité
Récupérer les gènes liés à l’hépatotoxicité à partir de la base de données GeneCards. Compiler et dédupliquer la liste pour générer un ensemble non redondant de 657 gènes liés à l’hépatotoxicité. Identifier les gènes qui se chevauchent entre les cibles APAP et les gènes liés à l’hépatotoxicité à l’aide d’un diagramme de Venn.
Étape 3 : Prétraitement des données transcriptomiques
Téléchargez le jeu de données GSE74000 depuis GEO. Prétraiter les données brutes d’expression à l’aide de DESeq2 : retirer les gènes de basse expression, normaliser en utilisant les facteurs de taille, et appliquer la transformation stabilisatrice de variance (VST). Effectuer une analyse d’expression différentielle en utilisant Limma et DESeq2, avec des seuils de valeur p ajustée < 0,05 et |log 2FC| > 1.
Étape 4 : Analyse de l’enrichissement fonctionnel
Téléverser les gènes qui se chevauchent dans STRING pour les analyses de l’ontologie génique (GO), de la voie KEGG, de l’expression tissulaire et de la corrélation de la maladie. Visualisez les résultats de l’enrichissement fonctionnel à l’aide de diagrammes de bulles et de cartes thermiques.
Étape 5 : Apprentissage automatique pour la sélection des gènes de fonctionnalités
Appliquer un classificateur de forêt aléatoire (n_estimators=500, max_depth=10) pour prioriser les gènes caractéristiques issus des gènes APAP et d’hépatotoxicité qui se chevauchent. Évaluer la performance du modèle en utilisant l’erreur Hors de Sac (OOB) et les scores d’importance des caractéristiques. Sélectionnez les 20 principaux gènes caractéristiques pour une analyse approfondie.
Étape 6 : Amarrage moléculaire
Récupérer la structure APAP (CID 1983) à partir de PubChem et des récepteurs protéiques (ESR1 : PDB ID 1SJ0, PNP : PDB ID 1V2H) à partir de PDB. Préparez les fichiers ligands et récepteurs : convertissez en format PDB, ajoutez des hydrogènes polaires, attribuez des charges et enregistrez en fichiers PDBQT. Définissez la grille d’amarrage dans AutoDock Tools, couvrant le site actif de la protéine. Effectuer un docking moléculaire à l’aide d’AutoDock Vina, avec une exhaustivité réglée à 8, et analyser les affinités et interactions de liaison. Visualisez les résultats de l’amarrage en utilisant PyMOL pour analyser les conformations de liaison et les interactions de clés.
Étape 7 : Analyse statistique
Déterminer la signification statistique à l’aide des tests t et ajuster les valeurs p pour les comparaisons multiples à l’aide de la méthodede Benjamini-Hochberg 31. Visualisez des associations statistiquement significatives à l’aide de cartes thermiques et de nuages de points.
Matériaux et méthodes
Identification des cibles de l’acétaminophène
Pour identifier les cibles moléculaires potentielles d’APAP, nous avons d’abord récupéré sa représentation SMILES à partir de la base de données PubChem. Nous avons ensuite utilisé plusieurs plateformes en ligne, dont le Laboratoire européen de biologie moléculaire chimique (ChemBL)32, Swiss TargetPrediction 33, l’outil de recherche pour l’interaction des produits chimiques et des cibles (STITCH)34, et l’approche d’ensemble de similarité (SEA)35, pour prédire ses cibles potentielles. Après avoir intégré les résultats de ces outils, nous avons sélectionné un ensemble de cibles à haute confiance pour APAP. Le tableau 1 définit les principales catégories de gènes utilisées dans cette étude, clarifiant leur rôle dans l’analyse des données et l’interprétation biologique. L’utilisation régulière de ces termes garantit une communication claire de nos résultats.
Identification des cibles d’hépatotoxicité
Des gènes potentiellement associés à l’hépatotoxicité ont été extraits de la base de données GeneCards. Tous les gènes identifiés ont été compilés, les doublons supprimés, et une liste non redondante a été générée pour les analyses en aval. Le jeu de données GSE74000 a été téléchargé depuis le dépôt GEO le 15 mars 2024. Les données brutes d’expression étaient traitées et normalisées à l’aide du package limma (normalisation quantile). L’analyse différentielle de l’expression a été réalisée à l’aide de modélisation linéaire avec un retrait bayesien empirique. Gènes respectant la valeur p ajustée < 0,05 (Benjamini-Hochberg FDR) et |log₂FC| > 1 étaient considérés comme significatifs. La visualisation des DEG a été réalisée à l’aide de diagrammes volcaniques et de cartes thermiques générées avec ggplot2.
Prétraitement des données
Les données brutes de comptage étaient prétraitées à l’aide de DESeq2. Les gènes à faible expression ont été retirés en utilisant un seuil de détection de CPM >1 dans au moins 70 % des échantillons. La normalisation de la taille de la bibliothèque a été réalisée à l’aide des facteurs de taille DESeq2, tels que définis dans l’équation (1) :
(1)
Où le facteur de taille du rapport médian est noté sj. Pour stabiliser les relations moyenne-variance, une transformation stabilisatrice de la variance (VST) a été utilisée dans l’équation (2) :
(2)
Les DEG ont été identifiés à l’aide du test de Wald avec correction de Benjamini-Hochberg, en considérant les gènes significatifs s’ils étaient utilisés dans l’équation (3) :
(3)
L’ensemble DEG dérivé de DESeq2 a été défini comme équation (4) :
(4)
Cet ensemble (X) a été utilisé dans la stratégie de consensus avec la tendance de Limma (Y) et la Limma Voom (Z).
Construction du réseau PPI
Des diagrammes de Venn ont été utilisés pour identifier les gènes communs entre les cibles APAP et d’hépatotoxicité. Les gènes qui se chevauchent ont ensuite été téléchargés dans la base de données Search Tool for the Retrieval of Interacting Genes/Proteins (STRING) afin de construire des réseaux PPI.
Analyse d’enrichissement fonctionnel multidimensionnel
Nous avons d’abord mené l’Ontologie Génique (GO), l’Encyclopédie des Gènes et Génomes de Kyoto (KEGG), l’expression tissulaire et des analyses fonctionnelles liées à la maladie des gènes chevauchants pour l’APAP et l’hépatotoxicité via le site web STRING. Ensuite, nous avons réalisé des analyses d’enrichissement GO, KEGG et Gene Set Enrichment Analysis (GSEA) (REACTOME) des gènes différentiels pour l’hépatotoxicité à l’aide des outils académiques de Sendo.
Analyse de la forêt aléatoire
Nous avons appliqué l’apprentissage automatique pour identifier les 20 principaux gènes caractéristiques à partir des gènes APAP et d’hépatotoxicité qui se chevauchent dans les données du transcriptome d’hépatotoxicité induite par l’APAP. Un classificateur de forêt aléatoire a été implémenté, avec 500 arbres (n_estimators=500), une profondeur maximale d’arbre de 10 (max_depth=10), un minimum de 2 échantillons nécessaires pour diviser un nœud (min_samples_split=2), et le critère d’impureté de Gini (critère ='gini')36. La performance du modèle a été évaluée à l’aide de l’erreur Out-of-Bag (OOB), où une valeur proche de 0 indique une précision prédictive plus élevée. Les scores d’importance des caractéristiques ont été calculés et visualisés à partir de l’analyse de la forêt aléatoire pour classer la contribution de chaque gène, comme dans l’équation (5).
(5)
N était le nombre total d’échantillons, yi était la fonction 1(·) une fonction indicatrice, 1 si la condition était vraie et 0 sinon ;
était l’étiquette prédite de l’échantillon III utilisant uniquement des arbres où III n’était pas inclus dans l’entraînement.
Expression différentielle des gènes caractérisés
Les différences d’expression des gènes caractéristiques dans les données transcriptomiques ont été visualisées à l’aide de graphiques de violon. Des biomarqueurs présentant des différences statistiquement significatives ont été identifiés comme de nouveaux biomarqueurs potentiels de l’hépatotoxicité induite par l’APAP pour une investigation plus approfondie.
Amarrage moléculaire
Des composés moléculaires de petite taille (CID 1983) ont été extraits de la base de données PubChem, et les récepteurs protéiques ESR1 et PNP (IDs PDB 1SJ0 et 1V2H) ont été téléchargés depuis la Protein Data Bank. Les structures de ligands ont été converties au format PDB grâce à OpenBabel et prétraitées dans AutoDock Tools en ajoutant des hydrogènes polaires, en attribuant des charges de Gasteiger, en définissant des liaisons rotatives et en économisant en format PDBQT. Les récepteurs protéiques ont été préparés à l’aide de PyMOL en retirant les molécules d’eau et les ligands co-cristallisés, suivis de l’ajout d’hydrogènes polaires et de l’attribution des charges de Kollman à l’aide d’AutoDock Tools, puis enregistrés sous forme de fichiers PDBQT.
En amarrage moléculaire, un logiciel AutoDock a été utilisé pour définir la grille d’amarrage couvrant le site actif de la protéine37. La boîte de grille était centrée aux coordonnées (x = XX·XX, y = YY· YY,z = ZZ· ZZ) avec des dimensions de 40 × 40 × 40 Å et un espacement de la grille de 0,375 Å, assurant une couverture complète de la poche de liaison. AutoDock Vina a été utilisé pour calculer les modes de liaison ligand-protéine et les affinités de liaison, avec le paramètre d’exhaustivité fixé à 8, et les neuf premières poses de liaison ont été générées pour chaque ligand.
La validation du protocole d’amarrage a été effectuée en réamarrant le ligand co-cristallisé sur le site actif, obtenant une valeur RMSD de < 2,0 Å, confirmant la fiabilité de la procédure d’amarrage. Les résultats de l’amarrage ont été visualisés à l’aide de PyMOL pour analyser les conformations de liaison et les interactions clés, y compris la liaison hydrogène.
Les simulations d’amarrage ont prédit que le composé X s’insère dans le site de liaison de la protéine Y, formant des liaisons hydrogène potentielles et des contacts hydrophobes, avec une énergie de liaison prévue de -8,5 kcal/mol.
Dépannage et modifications potentielles
Pour améliorer la robustesse et la reproductibilité du flux de travail proposé, plusieurs considérations de dépannage et modifications potentielles doivent être prises en compte. Si un nombre inattendu de gènes différenciellement exprimés (DEG) est identifié, il est conseillé aux utilisateurs de vérifier la procédure de normalisation, de confirmer l’identification exacte du marquage des groupes, et d’envisager d’ajuster le changement de pliage |log2| seuil tout en maintenant un contrôle approprié du taux de fausses découvertes (FDR). Inversement, si un nombre excessif de DEG est obtenu, appliquer des seuils FDR plus stricts ou filtrer les gènes à faible variance avant l’analyse d’expression différentielle peut améliorer la spécificité.
Les effets des lots peuvent influencer les schémas de regroupement dans les analyses exploratoires telles que l’analyse des composantes principales (ACP). Si les échantillons se regroupent principalement par lot plutôt que par condition biologique, des méthodes de correction par lots (par exemple, des approches bayiennes empiriques telles que ComBat) doivent être appliquées, et les métadonnées d’échantillons doivent être soigneusement réévaluées pour assurer la cohérence.
Pour la sélection des caractéristiques basée sur la Forêt Aléatoire, des taux d’erreur élevés hors de sac (OOB) ou des classements instables des caractéristiques peuvent indiquer une configuration sous-optimale du modèle. Dans de tels cas, augmenter le nombre d’arbres, ajuster le paramètre mtry ou effectuer des exécutions répétées avec sélection de caractéristiques par consensus peut améliorer la stabilité du modèle et la fiabilité prédictive. De plus, des stratégies de validation croisée peuvent être employées pour évaluer davantage la robustesse des modèles.
Pour renforcer la fiabilité, les utilisateurs peuvent éventuellement répéter l’analyse en utilisant des seuils DEG alternatifs ou des paramètres d’apprentissage automatique et comparer la cohérence des gènes de caractéristiques identifiés. Ces analyses de sensibilité permettent de garantir que les résultats clés ne sont pas dictés par des choix de paramètres spécifiques et soutiennent la reproductibilité du flux de travail à travers des ensembles de données transcriptomiques similaires.
Analyses statistiques
La signification statistique a été déterminée à l’aide d’un test t, avec des valeurs p rapportées pour comparaison. Les corrélations statistiques entre les niveaux d’expression génique et les phénotypes liés à l’hépatotoxicité ont été évaluées à l’aide des coefficients de corrélation de Pearson et Spearman, selon la normalité des données. Les valeurs p ont été ajustées pour des comparaisons multiples à l’aide de la méthode de Benjamini-Hochberg. Des associations significatives ont été visualisées avec des cartes thermiques et des nuages de points, fournissant une évaluation robuste des relations transcriptomiques.