Article de méthode

Prédiction par apprentissage automatique de protéines d’échange de domaines 3D dans les plantes médicinales

DOI :

10.3791/68519

15 août 2025

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude examine les protéines impliquées ou prédites dans l’échange de domaines 3D à partir de divers génomes de plantes médicinales. Il utilise des modèles d’apprentissage automatique pour prédire avec précision les protéines d’échange de domaines 3D et anticiper leurs fonctions et leur pertinence pour la production de métabolites secondaires.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’échange de domaines 3D est un phénomène structurel protéique dans lequel deux sous-unités protéiques ou plus échangent des sous-unités structurelles identiques et forment des oligomères. Les protéines qui présentent un échange de domaine 3D jouent un rôle crucial dans diverses fonctions biologiques, telles que la biosynthèse des métabolites secondaires, et dans la gestion de plusieurs stress biotiques et abiotiques chez les plantes médicinales. Cette étude examine la capacité de prédire les modèles d’échange de domaines 3D entre les génomes de plantes médicinales à l’aide de modèles de forêt aléatoire et de classificateurs du voisin K, démontrant des précisions de 91,6 % et 88,7 %, respectivement. Au total, 420 (31 %) séquences ont été prédites comme étant présumées impliquées dans l’échange de domaines 3D. Une étude d’enrichissement a également été menée sur les séquences protéiques 3D prédites de diverses plantes médicinales pour l’annotation de fonction basée sur les termes de l’ontologie génétique (GO), l’analyse des voies de l’Encyclopédie de Kyoto des gènes et des génomes (KEGG) et leur distribution de domaine dans les voies de biosynthèse des métabolites secondaires. L’annotation fonctionnelle des séquences prédites déduit que les séquences 3D échangées étaient impliquées dans diverses fonctions moléculaires telles que le transport d’électrons photosynthétiques dans le photosystème II et les transporteurs d’électrons, le transfert d’électrons dans la voie cyclique de transport d’électrons de l’activité de photosynthèse, la phosphorylation oxydative et la régulation génique des stress environnementaux (biotiques et abiotiques) en synthétisant des métabolites secondaires (terpénoïdes, alcaloïdes et polyamines). Ces résultats soulignent la capacité de l’apprentissage automatique à prédire l’implication des protéines dans le phénomène d’échange de domaines 3D, leur fonction respective et leur potentiel à faciliter la découverte de médicaments et les initiatives de bio-ingénierie.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les méthodes informatiques ont révolutionné la recherche sur les protéines en permettant une analyse et des prédictions détaillées sur les structures, les fonctions et les interactions des protéines. L’identification et l’annotation précises des fonctions protéiques sont essentielles pour démêler les mécanismes moléculaires de la vie et revêtent une importance profonde pour les progrès de la médecine et le développement de médicaments. Cependant, la complexité et le coût inhérents aux méthodes expérimentales limitent leur évolutivité pour s’adapter aux données de grandes séquences. En conséquence, le développement de méthodes informatiques pour la prédiction de la fonction des protéines est devenu un domaine pivot de la biologie computationnelle et moléculaire, comblant cette lacune grâce à des approches innovantes à grande échelle1.

L’échange de domaines 3D2 est un phénomène structurel dans les protéines où des segments d’une structure partagée sont échangés entre des chaînes individuelles. En 1994, la documentation introductive sur le mécanisme d’échange de domaine 3D a été trouvée dans le dimère3 de la toxine diphtérique. Cependant, les principes fondamentaux de l’échange de domaine 3D remontent à quatre décennies. On a observé que la ribonucléase pancréatique bovine A (RNase A) formait des dimères lors de la lyophilisation de l’acide acétique, grâce à des expériences sophistiquées de modification chimique4. Dans l’oligomérisation des protéines, deux ou plusieurs chaînes protéiques échangent des éléments structurels identiques par le biais de régions charnières flexibles. La partie de la protéine échangée entre les sous-unités monomères est appelée domaine échangé, qui peut consister en un domaine globulaire entier, une boucle ou un élément structurel secondaire dans certaines protéines. Inversement, les régions qui restent inchangées dans leurs positions d’origine au sein des monomères sont appelées domaines non échangés5. Un couplage entre des domaines non échangés est défini comme une interface de domaine non échangée (NSDI) illustrée à la figure 1. Dans l’échange de domaine 3D, la relation entre le domaine non échangé d’une sous-unité protéique et le domaine déjà échangé d’une autre sous-unité est appelée interface de domaine échangé (SDI). Un autre aspect important de ce phénomène est la région charnière, un segment de liaison flexible qui relie les domaines non échangés et échangés. Cette région charnière joue un rôle essentiel dans l’aide au mouvement de l’échange de domaine 3D et sert de commutateur conformationnel, permettant la reconfiguration structurelle nécessaire à l’échange de domaine. L’échange de domaines 3D a été impliqué dans divers processus biologiques, notamment l’assemblage des protéines et la régulation fonctionnelle5. Il est également associé à certaines maladies de mauvais repliement des protéines, où un échange aberrant peut entraîner la formation d’agrégats ou de fibrilles amyloïdes.

figure-introduction-1
Figure 1 : Représentation structurelle de l’échange de domaines 3D. La représentation illustre l’échange d’éléments structurels identiques entre deux monomères protéiques via une région charnière flexible, entraînant la formation d’un assemblage dimérique ou oligomérique à domaines échangés. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Différents types d’échange de domaines 3D ont été identifiés en fonction de la nature des domaines échangés et des structures oligomères résultantes6. En 2002, Eisenberg et leur collègue ont identifié trois types d’échange de domaines 3D : l’échange de domaines de bonne foi (BDS), l’échange de quasi-domaines (QDS) et le candidat à l’échange de domaines 3D (CDS)7. La classe de protéines la plus courante est l’échange de domaine de bonne foi. Il fait référence à un état où les molécules de dimères et de monomères sont présentes sous une forme stable, où le dimère est censé adopter une configuration à domaine échangé tandis que le monomère est censé adopter une configuration fermée. Dans le quasi-échange de domaine, une protéine est connue pour être présente à l’état oligomère, mais sa structure homologue est connue pour être présente à l’état monomère. Dans le CDS, il ne fait que confirmer la classification des protéines dans les catégories d’échange de domaines, alors que l’information structurelle des monomères impliqués ou de leurs homologues monomères n’est pas présente8. Dans cette procédure, les monomères ou leurs homologues monomères sont absents ; au contraire, des molécules de protéines hétérologues sont présentes. Le tableau 1 donne un exemple de ces trois catégories9.

Tableau 1 : Types d’échange de domaines 3D avec exemple. Veuillez cliquer ici pour télécharger ce tableau.

Des études ultérieures ont révélé de nombreuses structures d’échange de domaines, ouvrant la voie à la compréhension du concept d’échange de domaines 3D. La première preuve structurale soutenant ce phénomène a été observée dans la molécule de la protéine répressive Cro du bactériophage λ, qui forme une structure dimérique par l’échange de ses brins C-terminaux. En 1996, le chercheur a découvert que la molécule monomère Cro était impliquée dans l’échange de domaines3D 10. D’autres structures11, telles que la βB2-cristalline12, la CksHs213 humaine, la catalase14 du foie de bœuf et l’interleukine-515 humaine recombinante, ont également été signalées comme des structures possibles d’échange de domaines 3D. Sur la base de la position du domaine échangé au sein des molécules de protéines, l’échange de domaines 3D est classé en trois types : l’échange de domaines C-terminal, l’échange de domaines N-terminal et l’échange de domaine central relativement rare. Les auteurs utilisent un génome humain complet pour prédire un cas d’échange de domaines. Ils utilisent Random Forest et Support Vector Machine comme classificateurs binaires avec des précisions de 81,7 % et 73,9 %, respectivement. Près de 44 % de la séquence protéique a été prédite comme un domaine 3D échangé dans le génome humain6. Une analyse d’enrichissement a été effectuée sur des cas prédits pour leur distribution de domaine, leur distribution de maladie et leur annotation fonctionnelle basée sur l’ontologie génétique (GO). Une autre approche étudie l’analyse complète à l’échelle du génome d’Ocimum tenuiforum en utilisant l’approche de la forêt aléatoire et a révélé que près de 25 % des séquences protéiques d’Ocimum tenuiforum devraient être impliquées dans l’échange de domaines 3D. Les chercheurs effectuent également des annotations fonctionnelles en utilisant l’association de termes GO et leur association de famille de domaines protéiques et ont constaté que seules 1158 séquences étaient impliquées dans le stress abiotique16.

Les plantes présentent une variété de familles de protéines distinctives, avec des protéines spécifiques reconnues pour leur capacité à subir des réarrangements structurels, y compris l’échange de domaines 3D. L’échange de domaines 3D peut influencer les conditions de stress biotiques et abiotiques avec la production de métabolites secondaires ou d’autres voies biologiquement pertinentes qui ont plusieurs applications pharmacologiques ; Par conséquent, ils constituent un point central important pour cette enquête. La structure cristalline de Wal1 a démontré une configuration dimérique à domaines échangés, avec deux dimères au sein de l’unité asymétrique et le réarrangement structurel trouvé dans la cystatine C. Les phytocystatines jouent un rôle important dans le stress abiotique, et elles améliorent également la résistance des cultures. Un total de 20 121 protéines prédites à domaine 3D a été identifié à partir de la littérature disponible et de divers dépôts pertinents, dont 17 552 sont d’origine végétale et 2569 proviennent d’organismes non végétaux17,18.

Dans la littérature, divers autres exemples de prédiction d’échange de domaines 3D de différentes plantes à l’aide d’une approche d’apprentissage automatique ont été rapportés. Par exemple, Arabidopsis thaliana (33,7 % (4058 séquences sur 12 033 examinées), Medicago truncatula 20,9 % (39 séquences sur 186 examinées), Solanum tuberosum 36,5 % (146 séquences sur 400 examinées), Solanum lycopersicum 25,5 % (108 sur 423 séquences examinées) et Ocimum tenuiforum 15,5 % (5706 sur 36841 séquences examinées)6. Les méthodes informatiques sont devenues inestimables pour explorer les aspects structurels et fonctionnels des protéines 3D échangées de domaine. Ces approches facilitent la prédiction de séquences sur la base des meilleures caractéristiques possibles19, l’annotation et l’analyse d’enrichissement, offrant un aperçu des mécanismes moléculaires fondamentaux. La prédiction de l’échange de domaines 3D dans diverses séquences de protéines a été réalisée à l’aide d’un classificateur basé sur une machine à vecteurs de support (SVM). Cette approche a été développée en intégrant des caractéristiques de séquence et de structure, ce qui a donné des précisions de prédiction de 76,33 % sur l’ensemble de données d’entraînement et de 73,81 % sur l’ensemble de données de test, ce qui signifie son potentiel dans l’identification des tendances d’échange de domaines dans les protéines20. La principale raison de choisir KNN plutôt que SVM est que KNN a un processus de formation beaucoup plus simple. Il n’a besoin que d’un seul paramètre principal, K (c’est le nombre de voisins les plus proches pris en compte lors d’une prédiction), pour être défini, tandis que SVM nécessite un réglage minutieux de plusieurs paramètres comme le type de noyau, C et gamma. De plus, KNN gère plus facilement la classification multiclasse, alors que SVM nécessite généralement des stratégies plus complexes, comme les stratégies un contre un.

L’apprentissage automatique pour la prédiction structurelle des protéines
La prédiction de la structure d’une protéine implique l’inférence de la forme tridimensionnelle d’une protéine à partir de sa séquence FATA. Les progrès récents dans ce domaine ont été considérablement stimulés par l’application de diverses techniques d’apprentissage automatique aux données évolutives21,22. Les premières approches d’extraction d’informations à partir de données co-évolutives reposaient sur des méthodes d’apprentissage automatique. Cependant, des stratégies plus récentes, en particulier celles utilisant des réseaux résiduels profonds, ont démontré des performances supérieures dans la prédiction de la ciblepotentielle 23. Alphafold est une base de données basée sur l’apprentissage profond, tandis que Rosetta est un outil de fonction énergétique basé sur la physique. Ces outils sont utilisés pour prédire la structure atomique 3D complète qui peut être approchée des structures expérimentales. Ils ne fournissent que des coordonnées structurelles de résolution atomique, mais ces outils ne spécifient pas les événements d’échange de domaine 3D. En revanche, l’approche suggérée n’est pas un prédicteur de structure 3D complet, mais seulement si une protéine est susceptible de subir un échange de domaine 3D ou non24,25.

Les plantes médicinales sont utilisées depuis des siècles comme ressources naturelles pour la prévention et le traitement de diverses maladies, attribuées à leurs composés bioactifs. Ils sont essentiels en médecine traditionnelle et contribuent au développement des médicaments pharmaceutiques modernes. Cependant, aucun travail significatif n’a été mené dans le domaine de l’échange de domaines protéiques de plantes médicinales pour la découverte de médicaments. Les algorithmes, y compris l’apprentissage automatique et leurs modèles d’ensemble, reconnaissent des modèles et des relations dans les données de séquence pour prédire l’échange de domaines en 3D. La raison du choix des plantes médicinales pour cette étude est qu’elles peuvent détecter la diversité fonctionnelle d’une protéine chez les plantes impliquées dans l’échange de domaines 3D, ce qui permet de comprendre la réponse au stress, la défense contre les agents pathogènes et la biosynthèse métabolique. Les défis techniques associés à la détermination de l’échange de domaines 3D des protéines en grand nombre et aux conformations oligomériques complexes et avancées à l’aide de techniques de RMN ou de cristallographie soulignent la nécessité de développer des approches informatiques avancées.

L’objectif global des travaux de recherche proposés est d’utiliser une méthodologie informatique en utilisant les algorithmes Random Forest (RF)26 et K-nearest neighbor (KNN)27 pour leur tâche de prédiction de la structure des séquences protéiques et l’analyse complète à l’échelle du génome des cas échangés dans diverses séquences de plantes médicinales. La forêt aléatoire (RF) est un classificateur binaire ; Il s’agit d’un algorithme d’apprentissage automatique robuste et polyvalent largement utilisé dans l’analyse des séquences de protéines. Il fonctionne en construisant un ensemble d’arbres de décision (DT) et atteint une précision assez élevée dans les ensembles de données d’entraînement et de test. Pour les tâches de séquençage de protéines, la RF peut analyser une variété de caractéristiques, y compris les propriétés physicochimiques, la composition des séquences, la structure secondaire et les informations évolutives dérivées des alignements ou des profils de séquences. Il excelle dans la gestion de grands ensembles de données bruyants et fournit des mesures d’importance des fonctionnalités28. Le classificateur K-Nearest Neighbors (KNN) est un algorithme d’apprentissage automatique simple mais efficace largement utilisé dans l’analyse des séquences de protéines. Il fonctionne en classant une séquence d’entrée en fonction de la classe majoritaire de ses k voisins les plus proches dans l’espace des caractéristiques. Dans l’analyse des séquences protéiques, KNN peut être utilisé pour prédire les catégories fonctionnelles, les propriétés structurelles et la localisation subcellulaire. Les caractéristiques de la classification KNN comprennent souvent la composition en acides aminés, les motifs de séquence, les profils évolutifs ou les attributs physicochimiques. KNN est un choix populaire pour l’analyse des protéines en raison de sa simplicité ; L’intelligibilité et l’efficacité en font un outil précieux pour l’analyse des séquences de protéines29. Ensemble, ces algorithmes fournissent des forces complémentaires, permettant un cadre de calcul complet pour l’étude de l’échange de domaines 3D dans diverses séquences de plantes médicinales. Ces deux modèles ne prédisent que les cas possibles qui peuvent subir un échange de domaine ; il ne prédit pas les coordonnées structurelles 3D complètes ou quelle pièce ou résidu est particulièrement impliqué dans ce processus d’échange. Il s’agit d’une question de recherche plus approfondie, car l’identification de régions ou de résidus spécifiques impliqués dans l’échange afin de clarifier le mécanisme et les aspects fonctionnels de l’échange de domaines 3D events.3D l’échange de domaines comprend une variété de phénomènes structurellement distincts, tels que des configurations en boucle fermée, des échanges ouverts et d’autres différences qui incluent différentes régions de charnière et architectures de domaine. À la lumière de cela, l’approche suggérée ne catégorise que tous les types d’événements d’échange de domaine 3D sous une classification unifiée. Cette sélection a été initialement motivée par la disponibilité limitée de données annotées pouvant spécifier une classe particulière d’échange de domaines 3D. Il s’agit du premier type de tentatives sur divers ensembles de données à base de plantes médicinales, et nous pensons que la distinction entre les différents mécanismes d’échange pourrait améliorer la précision prédictive du modèle.

Une analyse d’enrichissement dans les plantes médicinales permet d’identifier les gènes, les protéines et les voies clés impliqués dans la synthèse des composés bioactifs et la réponse au stress. Il donne un aperçu des mécanismes moléculaires. Ces analyses chez les plantes médicinales étudient les gènes, les protéines et les processus biologiques essentiels associés à la synthèse de produits chimiques bioactifs, à la résilience au stress et à la résistance aux maladies. L’annotation fonctionnelle de protéines sélectionnées, telle que l’ontologie génétique (GO) et l’analyse de la voie KEGG, révèle les mécanismes moléculaires sous-jacents à la production de métabolites secondaires et aux réponses au stress environnemental. Cette approche contribue considérablement à la découverte de médicaments, améliore la résilience des cultures et élucide les voies métaboliques des plantes pour l’agriculture durable et les progrès médicinaux.

Contributions novatrices de l’étude
Cette étude met en évidence les capacités de l’apprentissage automatique à promouvoir des modèles plus précis et plus efficaces pour prédire les modèles structurels des protéines dans les ensembles de données biologiques.

Cette recherche intègre de nouvelles fonctionnalités dans les algorithmes d’apprentissage automatique, améliorant ainsi leur capacité à prédire les fonctions des protéines avec une plus grande clarté. Ces caractéristiques permettent de mieux comprendre les relations structure-fonction des protéines, ce qui contribue à une conception et à une optimisation plus précises des protéines en ingénierie des protéines.

L’analyse de l’enrichissement des protéines prédites permet de découvrir les principales voies biologiques, les processus cellulaires et les fonctions moléculaires, fournissant des cibles précieuses pour la découverte de biomarqueurs, la conception de médicaments et la compréhension du mécanisme de la maladie. Cette analyse améliore la précision des interventions basées sur les voies et de l’identification des cibles thérapeutiques.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

REMARQUE : Ce segment fournit un aperçu complet de la méthodologie suggérée, qui comprend six étapes principales : (a) la collecte de données, (b) la sélection des caractéristiques, (c) le prétraitement des données, (d) le post-traitement des données, (e) l’élaboration du modèle, (f) l’évaluation des résultats du modèle proposé et, (g) l’analyse d’enrichissement à différents niveaux des séquences prédites positivement. Le Core i5-10500 est un processeur de 10e génération qui a été utilisé dans ce travail de recherche. Il dispose de six cœurs et 12 threads, avec une fréquence de base de 3.10 GHz et une vitesse turbo maximale de 4.50 GHz. Il est équipé de 12 Mo d’Intel Smart Cache, prend en charge la mémoire DDR4-2666 et inclut UHD Graphics 630 pour des visuels intégrés. Conçu pour le multitâche et la productivité efficaces, il est compatible avec la prise LGA 1200 et fonctionne à un TDP de 65 W.

1. Collecte de données

  1. Use3d3dswap-pred (https://caps.ncbs.res.in/3dswap-pred/3dswap-pred.html) et 3DSwap+ (https://caps.ncbs.res.in/3Dswapplus/index.html)30 30 Tableau supplémentaire 1, Tableau supplémentaire 2, Fichier supplémentaire 1, Fichier supplémentaire 2). Utilisez un total de 573 entrées PDB organisées manuellement de molécules 3D échangées en domaines, principalement à partir de plantes médicinales.
  2. Utilisez la méthode du meilleur profil représentatif (BRP) pour construire l’ensemble de données négatives en attribuant une séquence la plus représentative (BRS) à chaque famille de protéines Pfam31 (http://pfam.xfam.org/). Rechercher un total de 10 112 séquences structurales par rapport à tous les BRP de Pfam à l’aide de HMMER32 (https://www.ebi.ac.uk/Tools/hmmer/) avec un seuil de valeur E de 0,001. Traitez la séquence résultante à l’aide de DIAL pour identifier les domaines structurels(https://bioinformaticshome.com/db/tool/DIAL). Inclure 575 entrées PDB en tant qu’ensemble de données négatives (entraînement).
  3. Inclure 314 séquences protéiques dérivées de la méthode BRP et 261 séquences non 3D échangées manuellement identifiées par 3DSwap+ comme un ensemble de données négatives.
  4. Récupérez un total de 1 355 entrées de séquences protéiques examinées de diverses plantes médicinales à partir d’UniProt33 (https://www.uniprot.org/). Inclure 13 plantes médicinales dans cette étude (ensemble de données de test/prédiction) : Citrus sinensis (RS-102), Vitis vinifera (RS-226), Mentha (RS-28), Cannabis sativa (RS-21), Acorus clamus (RS-511), Coffea arabica (RS-104), Papaver somniferum (RS-58), Hibiscus (RS-88), Jasmin (RS-89), Thyme (RS-30), Thymus (RS-14), Illicium oligandrum (RS-72) et Citrus limon (RS-12). L’arbre phylogénétique est donné dans la figure supplémentaire 1.

2. Utilisation de la fonctionnalité pour la création de modèles

  1. Utilisez un ensemble complet de fonctionnalités comprenant 453 fonctionnalités pour prédire les séquences de protéines dans les plantes médicinales. Inclure 439 longs métrages établis et 16 nouveaux longs-métrages, soigneusement sélectionnés sur la base d’une revue de littérature approfondie.
  2. Utilisez la base de donnéesAAindex 34(https://www.genome.jp/aaindex/) pour déterminer les propriétés physicochimiques des acides aminés. Appliquez la plateforme d’apprentissage automatique WEKA35 (https://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/) pour la sélection des fonctionnalités. Reportez-vous au tableau 2 pour les nouvelles fonctionnalités intégrées.

Tableau 2 : Liste des entités nouvellement ajoutées avec leurs descriptions. Ce tableau récapitule les nouvelles fonctionnalités conçues au cours de la phase d’extraction de caractéristiques pour améliorer les performances du modèle dans la prédiction de l’échange de domaines 3D. Chaque caractéristique capture des propriétés spécifiques basées sur la séquence, physicochimiques ou structurelles des protéines qui sont supposées influencer leur propension à l’échange de domaines. Des descriptions détaillées sont fournies pour clarifier la pertinence biologique et la dérivation computationnelle de chaque caractéristique. Veuillez cliquer ici pour télécharger ce tableau.

3. Pré et post-traitement des données

REMARQUE : Prétraitement des données. Le prétraitement des données est une étape essentielle de l’apprentissage automatique qui consiste à préparer les données brutes pour l’analyse. Cela inclut le nettoyage des données (par exemple, la suppression des doublons, la gestion des valeurs manquantes, etc.).

  1. Utilisez le fichier de codage supplémentaire 1 pour coder les variables catégorielles sous forme numérique, qui comprend quatre étapes principales : (1) Définir des dictionnaires de score, (2) Traiter la séquence fasta par seq I0. analyser, (3) créer un cadre de données, (4) analyse numérique des entités 3D échangées de domaine.
  2. Affinez et interprétez la sortie du modèle grâce au post-traitement des données. Recalibrez les prédictions, agrégez les résultats et appliquez un seuil de classification. Classez l’ensemble de données d’échange de domaine 3D bimodal à l’aide d’une valeur de seuil β = 0,5 (plage 0-1), comme le soutiennent les études précédentes 36,37,38.
  3. Partitionnez l’ensemble de données avec une répartition 70:30 entre l’apprentissage et le test, en allouant 70 % à l’entraînement du modèle et 30 % à l’évaluation indépendante.
  4. Standardisez les données d’entraînement à l’aide de la méthode Standard Scaler pour ajuster les valeurs des caractéristiques à une moyenne de 0 et à un écart type de 1, garantissant ainsi une meilleure compatibilité avec les estimateurs de machine learning. Effectuez la sélection des fonctionnalités pour identifier les variables les plus importantes.
    REMARQUE : La standardisation d’un ensemble de données est une condition préalable largement utilisée pour de nombreux algorithmes d’apprentissage automatique afin de garantir des performances optimales. Les données qui sont loin d’être distribuées normalement peuvent affecter négativement les performances des modèles d’apprentissage automatique39.
  5. Faites de la validation. Afin d’assurer une évaluation robuste et impartiale du modèle, une validation croisée par pliage K a également été mise en œuvre. Tableau supplémentaire 3.
  6. Partitionnez le jeu de données en K sous-ensembles. Entraînez et évaluez le modèle de manière itérative sur des sous-ensembles K=5 tout en utilisant le sous-ensemble restant pour des tests indépendants.

4. Création et mise en œuvre du modèle

  1. Implémentez et affinez les algorithmes RF (Random Forest) et K-Nearest Neighbors (KNN) pour optimiser les performances prédictives. Entraînez, validez et testez les modèles à l’aide de séquences de protéines 573 et 575 pour l’entraînement et de 1 355 séquences de protéines pour les tests.
  2. Utilisez un script Python (Supplementary Coding File 1) pour extraire des valeurs de caractéristiques numériques basées sur la séquence de protéines sélectionnée. Enregistrez ces valeurs numériques pour les deux ensembles de données dans des fichiers CSV et soumettez-les aux classificateurs RF et KNN pour la génération de modèles de classification binaire.
  3. Utilisez ces modèles pour distinguer les protéines à domaine 3D échangé et les protéines non échangées en 3D. Reportez-vous à la figure 2 et à la figure 3 pour le cadre généralisé de prédiction de l’échange de domaine 3D.
  4. Appliquez des paramètres hyper tels que n_estimators=20, max_depth=4 et random_state=42 pour le modèle RF.
  5. Appliquez l’hyperparamètre neighbors=5 pour le modèle de classificateur KNN.
    REMARQUE : Ces paramètres ont été affinés pour améliorer les performances des modèles sur l’ensemble de données de plantes médicinales organisées manuellement.

figure-protocol-1
Figure 2 : Représentation schématique illustrative. La représentation montre les modèles d’apprentissage automatique Random Forest et K-Nearest Neighbor (KNN), mettant en évidence leur structure algorithmique et leur flux de travail fonctionnel dans le contexte de tâches de classification binaire. Veuillez cliquer ici pour voir une version plus grande de cette figure.

figure-protocol-2
Figure 3 : Flux de travail basé sur l’apprentissage automatique. Le diagramme illustre un flux de travail basé sur l’apprentissage automatique pour prédire l’échange de domaines 3D dans les protéines de plantes médicinales. Le processus commence par l’acquisition d’un ensemble de données, en combinant les ensembles de données de référence et les méta-ensembles de données. L’extraction de caractéristiques consiste à dériver des caractéristiques existantes et nouvelles à partir de séquences de protéines. Dans le prétraitement des ensembles de données, les séquences FASTA sont converties en valeurs numériques à l’aide de l’analyse des séquences et du mappage du dictionnaire pour créer des trames de données structurées, y compris des fonctionnalités spécifiques d’échange de domaine 3D. Le post-traitement comprend l’attribution de l’état d’échange de domaine à l’aide d’un seuil (β = 0,5), la division des données en ensembles d’entraînement et de test (rapport 70-30), la standardisation des fonctionnalités et la sélection des fonctionnalités avec validation k-fold. Deux modèles d’apprentissage automatique, Random Forest (RF) et K-Nearest Neighbors (KNN), sont entraînés et leurs performances sont évaluées à l’aide de métriques de modèle avec AUROC et AUPRC pour évaluer la précision et la robustesse prédictives Veuillez cliquer ici pour voir une version plus grande de cette figure.

5. Évaluation statique et évaluations de modèles de classificateurs ML

  1. Implémentez et affinez les algorithmes RF (Random Forest) et K-Nearest Neighbors (KNN) pour optimiser les performances prédictives. Entraînez, validez et testez les modèles à l’aide de séquences de protéines 573 et 575 pour l’entraînement et de 1 355 séquences de protéines pour les tests.
    figure-protocol-3(1)
    figure-protocol-4(2)
    figure-protocol-5(3)
    figure-protocol-6(4)
    figure-protocol-7(5)
    figure-protocol-8(6)
    REMARQUE : Définissez TP (True Positive) comme le pourcentage de séquences correctement prédites comme échangées par les modèles. Définissez TN (True Negative) comme le pourcentage de séquences correctement prédites comme n’étant pas permutées par domaine. Définissez les faux positifs (FP) comme les cas où les protéines non échangées sont prédites de manière incorrecte comme étant échangées de domaine. Définissez les faux négatifs (FN) comme les cas où les protéines dont le domaine est échangé sont prédits de manière incorrecte comme n’étant pas échangées.
  2. Calculez Xsen comme le rapport des vrais positifs identifiés avec précision, et Xspe comme le rapport des vrais négatifs correctement identifiés par le modèle.
    REMARQUE : Utilisez le MCC pour évaluer la qualité des classifications binaires en analysant les vrais positifs, les vrais négatifs, les faux positifs et les faux négatifs de la matrice de confusion.
  3. Calculer la précision (ACC) pour mesurer la proportion de prédictions correctes parmi le total des prédictions.
    REMARQUE : La précision évalue une proportion de positifs correctement identifiés parmi tous les positifs prédits, tandis que le score F1 est la moyenne harmonique de la précision et de la sensibilité, équilibrant les faux positifs et les faux négatifs.
  4. Utilisez AUC pour évaluer les performances des modèles de classification dans les tâches de classification binaire. Calculez l’AUC (Area Under the Curve) à l’aide de la bibliothèque Python Scikit-learn40, basée sur les protéines classées positivement et négativement.
  5. Utilisez les données de test pour évaluer ces paramètres.

6. Mise en œuvre d’un modèle de prédiction de l’échange de domaines 3D sur diverses espèces de plantes médicinales

  1. Appliquez RF et KNN sur un total de 1 355 séquences examinées (ensemble de données de prédiction) de 13 plantes médicinales différentes, dont Citrus sinensis, Mentha, Vitis vinifera, Thyme, Thymus vulgaris, Jasmine, Hibiscus, Papaver somniferum, Illicium oligandrum, Citrus limon, Acorus calamus, Cannabis sativa et Coffea arabica.
    REMARQUE : Ces protéines sont associées à diverses fonctions comme Citrus sinensis, Mentha, le thym aide à l’indigestion. Vitis vinifera, jasmin, hibiscus sont une source très riche en antioxydants et ils améliorent également la santé de la peau. Illicium oligandrum est connu pour ses propriétés antifongiques et antibactériennes, etc.

7. Étude d’enrichissement de protéines échangées de domaine 3D à partir de plantes médicinales

  1. Associez les codes d’accession de ces séquences protéiques aux catégories de métabolites secondaires à l’aide des données d’UniProt.
  2. Extrayez l’ID du gène à partir des séquences prédites.
  3. Ouvrez le serveur Web en ligne KEGG41 (https://www.genome.jp/kegg/) pour effectuer une analyse d’enrichissement des voies KEGG en collant l’ID de gène individuel ou le nom de la protéine pour vérifier leurs voies respectives.
  4. Effectuez une analyse comparative en comparant les protéines d’échange de domaines 3D prédites à un ensemble de données de prédiction afin de détecter une surreprésentation statistiquement significative de termes spécifiques d’ontologie génétique (GO) et de voies biologiques. Collez l’ID de gène de la séquence prédite dans ShinyGO v0.742 (https://bioinformatics.sdstate.edu/go74/) et sélectionnez la fonction ou la catégorie de voie souhaitée (fonction biologique, composant cellulaire, fonction moléculaire, KEGG, etc.).
    REMARQUE : Visualisez ces annotations à l’aide d’une plate-forme en ligne basée sur le cloud43 qui permet aux utilisateurs d’écrire et d’exécuter du code Python.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les protéines présentant un échange de domaine 3D sont souvent liées à une variété de fonctions biologiques. Cependant, une analyse systématique à l’échelle du génome des séquences protéiques impliquées dans l’échange de domaines 3D reste largement inexplorée. Dans cette recherche, nous avons mené une enquête initiale pour prédire de manière présumée les protéines 3D échangées de domaines de 13 plantes médicinales, en nous concentrant sur leur association avec les domaines métabolites secondaires, les voies KEGG et les t...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La compréhension de l’échange de domaines 3D dans les protéines à travers leur génome complet revêt une importance significative dans divers domaines. Des approches d’apprentissage automatique, en particulier la forêt aléatoire et le voisin le plus proche K26,27, ont été utilisées pour prédire l’échange de domaines 3D directement à partir des données de séquence de protéines au niveau du génome. Ces deux modèles ML incluent diver...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs déclarent qu’ils n’ont pas d’intérêts financiers concurrents connus ou de relations personnelles qui auraient pu sembler influencer les travaux rapportés dans cet article.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aucun financement n’a été reçu pour cette recherche.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
3DSwap+https://caps.ncbs.res.in/3Dswapplus/index.html  ;
PfamEMBL-EBIhttp://pfam.xfam.org/:  ;
HMMEREMBL-EBI ;
Aaindexhttps://www.genome.jp/aaindex/ :
DIALBioinformaticshome.comhttps://bioinformaticshome.com/db/tool/DIAL:  ;
WEKAL’Université de Wekatohttps://www.waikato.ac.nz/int/research/institutes-centres-entities/institutes/artificial-intelligence-institute/research/software/
  ; KEGGhttps://www.genome.jp/kegg/ :
ShinyGOhttps://bioinformatics.sdstate.edu/go/ :
uniprotUniprothttps://www.uniprot.org/ :
https://www.ebi.ac.uk/Tools/hmmer/:  

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Radivojac, P., et al. A large-scale evaluation of computational protein function prediction. Nat Methods. 10 (3), 221-227 (2013).
  2. Bennett, M. J., et al. 3D domain swapping: a mechanism for oligomer assembly. Protein Sci. 4, 2455-2468 (1995).
  3. Bennett, M. J., et al. Domain swapping: entangling alliances between proteins. Proc Natl Acad Sci U S A. 91, 3127-3131 (1994).
  4. Liu, Y., et al. The crystal structure of a 3D domain-swapped dimer of RNase A at a 2.1-Å resolution. Proc Natl Acad Sci U S A. 95 (7), 3437-3442 (1998).
  5. Straub, J. E., et al. Principles governing oligomer formation in amyloidogenic peptides. Curr Opin Struct Biol. 20, 187-195 (2010).
  6. Upadhyay, A. K., et al. Genome-wide prediction and analysis of 3D domain-swapped proteins in the human genome from sequence information. PLoS One. 11 (7), e0159627(2016).
  7. Liu, Y., et al. 3D domain swapping: as domains continue to swap. Protein Sci. 11, 1285-1299 (2002).
  8. Schlunegger, M. P., et al. Oligomer formation by 3D domain swapping: a model for protein assembly and misassembly. Adv Protein Chem. 50, 61-122 (1997).
  9. Rousseau, F., et al. Implications of 3D domain swapping for protein folding, misfolding and function. Adv Exp Med Biol. 747, 137-152 (2012).
  10. Anderson, W. F., et al. Structure of the Cro repressor from bacteriophage λ and its interaction with DNA. Nature. 290 (5809), 754-758 (1981).
  11. Albright, R. A., et al. High-resolution structure of an engineered Cro monomer shows changes in conformation relative to the native dimer. Biochemistry. 35, 735-742 (1996).
  12. Bax, B., et al. X-ray analysis of beta B2-crystallin and evolution of oligomeric lens proteins. Nature. 347, 776-780 (1990).
  13. Parge, H. E., et al. Human CksHs2 atomic structure: A role for its hexameric assembly in cell cycle control. Science. 262, 387-395 (1993).
  14. Fita, I., et al. The NADPH binding site on beef liver catalase. Proc Natl Acad Sci U S A. 82 (6), 1604-1608 (1985).
  15. Milburn, M. V., et al. A novel dimer configuration revealed by the crystal structure at 2.4 Å resolution of human interleukin-5. J Biol Chem. 268, 2117-2120 (1993).
  16. Upadhyay, A. K., et al. Genome-wide analysis of domain-swap predicted products in the genome of anti-stress medicinal plant: Ocimum tenuiflorum. Bioinformat Biol Insights. 13, 1177932218821362(2019).
  17. Simpson, G. A., et al. Crystal structure and interconversion of monomers and domain-swapped dimers of the walnut tree phytocystatin. Biochim Biophys Acta Prot Proteom. 1872 (2), 140975(2024).
  18. Tran, L. H., et al. 3D domain swapping dimerization of the receiver domain of cytokinin receptor CRE1 from Arabidopsis thaliana and Medicago truncatula. Front Plant Sci. 24 (12), 756341(2021).
  19. Shameer, K., et al. Insights into protein sequence and structure-derived features mediating 3D domain swapping mechanism using support vector machine-based approach. J Bioinform Comput Biol. 4, 33-42 (2010).
  20. Shameer, K., et al. 3dswap-pred: prediction of 3D domain swapping from protein sequence using Random Forest approach. Protein Pept Lett. 19, 1010-1020 (2012).
  21. Tasnim, F. Protein sequence classification through deep learning and encoding strategies. Proc Comp Sci. 238, 876-881 (2024).
  22. Xu, Y., et al. Deep dive into machine learning models for protein engineering. J Chem Info Modeling. 60 (6), 2773-2790 (2020).
  23. Lilhore, U. K., et al. Optimizing protein sequence classification: integrating deep learning models with Bayesian optimization for enhanced biological analysis. BMC Med Inform Decis Mak. 24, 236(2024).
  24. Jumper, J., et al. Highly accurate protein structure prediction with AlphaFold. Nature. 596 (7873), 583-589 (2021).
  25. Du, Z., et al. The trRosetta server for fast and accurate protein structure prediction. Nat Protoc. 16 (12), 5634-5651 (2021).
  26. Genuer, R., et al. Random forests: Some methodological insights. arXiv. , (2008).
  27. Guo, G., et al. KNN model-based approach in classification. Lect Notes Comput Sci. 2888, 986-996 (2003).
  28. Kathuria, C., et al. Predicting the protein structure using random forest approach. Procedia Comput Sci. 132, 1654-1662 (2018).
  29. Gui, Y., et al. Application of K-nearest neighbors in protein-protein interaction prediction. Highlights Sci Eng Technol. 2, 125-131 (2022).
  30. Joseph, A. P., Shingate, P., Upadhyay, A. K., Sowdhamini, R. 3PFDB+: improved search protocol and update for the identification of representatives of protein sequence domain families. Database. 2014, bau026(2014).
  31. Finn, R. D., et al. The Pfam protein families database. Nucl Acids Res. 41, D211-D222 (2013).
  32. Mistry, J., et al. Challenges in homology search: HMMER3 and convergent evolution of coiled-coil regions. Nucl Acid Res. 41, e121(2013).
  33. Apweiler, A. UniProt: The universal protein knowledgebase. Nucl Acids Res. 46 (5), 2699-2699 (2018).
  34. Kawashima, S., et al. AAindex: amino acid index database, progress report 2008. Nucl Acids Res. 36, D202-D205 (2008).
  35. Frank, E., et al. Data mining in bioinformatics using WEKA. Bioinformatics. 20, 2479-2481 (2004).
  36. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  37. Wu, C., et al. Prediction of DNA methylation site status based on fusion deep learning algorithm. IEEE AEMCSE Proc. 5, 180-183 (2022).
  38. Wilhelm, T., et al. Phenotype prediction based on genome-wide DNA methylation data. BMC Bioinform. 15, 1-15 (2014).
  39. Uddin, S., et al. Dataset meta-level and statistical features affect machine learning performance. Sci Rep. 14 (1), 1F670(2024).
  40. Pedregosa, F., et al. Scikit-learn: Machine Learning in Python. J Mach Learn Res. 12, 2825-2830 (2011).
  41. Kanehisa, M., et al. Kyoto encyclopedia of genes and genomes. Nucl Acid Res. 28 (1), 27-30 (2000).
  42. Ge, S. X., et al. ShinyGO: a graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  43. Bisong, E. Google Colaboratory. Building Machine Learning and Deep Learning Models on Google Cloud Platform. , Apress. Berkeley, CA. (2019).
  44. Kirby, G. W. Biosynthesis of the morphine alkaloids. Science. 155 (3759), 170-173 (1967).
  45. Toffolatti, S. L., et al. Role of terpenes in plant defence to biotic stress. Biocont Agents Sec Metabol. , 401-417 (2021).
  46. Boncan, D. A. T., et al. Terpenes and terpenoids in plants: interactions with environment and insects. Int J Mol Sci. 21 (19), 7382(2020).
  47. Mansouri, H., et al. The response of terpenoids to exogenous gibberellic acid in Cannabis sativa L. at vegetative stage. Acta Physiol. Plant.33, 1085-1091 (2011).
  48. Pál, M., et al. Speculation: Polyamines are important in abiotic stress signalling. Plant Sci. 237, 16-23 (2015).
  49. Mattoo, A. K., et al. Higher polyamines restore and enhance metabolic memory in ripening fruit. Plant Sci. 174 (4), 386-393 (2008).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

change de domaines 3Doligom risation des prot inesfor t d arbres d cisionnelsk plus proches voisinsannotation fonctionnellebiosynth se de m tabolites secondairesontologie des g nesvoies KEGG
Vidéo bientôt disponible

Articles connexes