3 novembre 2011
Lignes directrices pour l'informatique basée caractérisation structurale et fonctionnelle de protéines en utilisant le pipeline I-Tasser est décrite. A partir de la séquence protéique de requête, les modèles 3D sont générés à l'aide de plusieurs alignements de filetage et itératif des simulations assemblage structural. Inférences fonctionnelles sont ensuite tirées à partir des matches à protéines avec une structure connue et fonctions.
L'objectif de cette procédure est de prédire par calcul informatique les structures tridimensionnelles et la fonction biologique de molécules protéiques à partir de leurs séquences d'acides aminés. Cela est réalisé en prédisant d'abord la structure secondaire des protéines par apprentissage automatique. Les séquences et la structure secondaire prédite sont ensuite comparées aux structures résolues de la bibliothèque PDB afin d'identifier les meilleurs modèles structuraux possibles.
Cette procédure est appelée « threading ». Après la procédure de threading, le programme IT AER divisera les modèles en fragments selon les alignements de séquences des modèles, puis réassemblera les fragments en modèles complets à l'étape trois. Des modèles atomiques complets sont construits par des affinements au niveau atomique afin d'optimiser les réseaux de liaisons hydrogène et d'éliminer les chevauchements stériques.
La dernière étape de la procédure consiste à identifier la fonction biologique des protéines en appariant les structures prédites avec celles de protéines de fonction connue dans la bibliothèque fonctionnelle. Le principal avantage d'ITER par rapport aux méthodes existantes de modélisation de structure réside dans son approche intrinsèque d'assemblage de fragments structuraux, qui peut systématiquement rapprocher les alignements par report de l'état natif. Ces modèles structuraux de haute qualité constituent également la base d'annotations fonctionnelles précises fondées sur la structure, favorisant ainsi l'utilisation d'ITER au sein de la communauté scientifique.
Notre laboratoire a mis à disposition un site web sur lequel les séquences protéiques peuvent être soumises à iter. Ce site web sert de nœud central permettant aux utilisateurs du monde entier d’enregistrer une interface vers un cluster informatique, qui gère et exécute les simulations ITER. Une tâche de simulation ITER comprend une douzaine de sous-simulations plus petites.
Ces simulations, lorsqu'elles sont exécutées sur un seul ordinateur doté d'un seul cœur de processeur, peuvent prendre plus de cent heures. Le cluster informatique du laboratoire Zang prend en charge ces sous-simulations et les répartit sur des centaines d'ordinateurs, ce qui lui permet d'exécuter plus de 2000 simulations. Grâce à notre cluster informatique, nous sommes capables d'effectuer des centaines de simulations I taster chaque jour.
Même avec cette capacité, beaucoup de travail reste à faire pour optimiser le système et minimiser le temps d'attente pour les utilisateurs en ligne de l'IT AER. Pour commencer l'expérience de modélisation de la structure et de la fonction, connectez-vous à la page web de l'IT AER. Les adresses URL de toutes les pages web pertinentes abordées ici sont disponibles dans le protocole écrit.
Copiez et collez la séquence en acides aminés dans le formulaire fourni, ou téléversez directement la séquence en cliquant sur le bouton parcourir. Indiquez une adresse électronique et un nom pour la tâche. Les utilisateurs peuvent éventuellement spécifier des contacts inter-résidus ou des contraintes de distance externes.
Ajoutez un modèle supplémentaire ou excluez certaines protéines modèles au cours du processus de modélisation de la structure. Pour soumettre la séquence, cliquez sur le bouton exécuter taser. Vérifiez l'état de la tâche soumise en consultant la page de la file d'attente IT taser.
Cliquez sur l'onglet de recherche et utilisez le numéro d'identification du travail ou la séquence interrogée pour rechercher le travail soumis. Une fois la modélisation de la structure et de la fonction terminée, un courriel de notification contenant une image des structures prédites et un lien web sera envoyé à l'adresse électronique fournie. Cliquez sur ce lien pour visualiser et télécharger les résultats.
Commencez l'analyse de la structure en examinant la prédiction de la structure secondaire, affichée sous la forme H pour l'hélice alpha, S pour le brin bêta ou C pour le coil. Prenez également en compte le score de confiance de la prédiction pour chaque résidu. Recherchez les régions présentant de longues séquences de structures secondaires régulières afin d'estimer la région centrale de la protéine.
La classe structurale de la protéine peut également être analysée en fonction de la répartition des éléments de structure secondaire. Examinez l'accessibilité prévue au solvant afin d'identifier les régions enterrées et celles exposées au solvant. Dans les valeurs de requête, l'accessibilité prévue au solvant varie d'un score de zéro pour un résidu enterré à un score de neuf pour un résidu exposé.
Les régions contenant principalement des résidus enfouis peuvent être utilisées pour délimiter la région centrale de la protéine, tandis que les régions présentant des résidus exposés au solvant et hydrophiles correspondent à des sites potentiels d'hydratation ou fonctionnels. Pour visualiser les structures tertiaires prédites de la protéine cible, faites défiler la page vers le bas jusqu'à l'applet interactif JMO affiché à gauche. Cliquez sur l'applet pour modifier l'apparence de la structure affichée.
Zoomer sur une région spécifique, sélectionner des types de résidus particuliers dans le modèle prédit ou calculer les distances entre résidus. Analyser les scores de confiance du modèle structural afin d'estimer la qualité des structures prédites. Les valeurs Csco se situent généralement entre moins cinq et deux ; une valeur plus élevée indique un modèle de meilleure qualité.
Le score TM estimé et le RMSD du premier modèle sont indiqués comme exactitude estimée du modèle un. Cliquez sur le lien en savoir plus sur csco. Pour analyser la taille du cluster csco et la densité du cluster de l'ensemble des modèles, analysez les 10 meilleurs modèles de transfert de séquence du protéine cible identifiés par les programmes de transfert de séquence à faible valeur de mets.
En faisant défiler vers le bas la page des résultats, examinez le Z-score normalisé pour analyser la qualité des alignements par threadings. Les alignements dont le score normalisé est supérieur à un reflètent un alignement fiable et sont très probablement dotés du même repliement que la protéine cible. Examinez l'identité de séquence dans la région alignée par threading ainsi que pour toute la chaîne afin d'évaluer l'homologie entre les protéines cible et matrice.
Une forte identité de séquence est un indicateur de parenté évolutive entre les protéines cibles et les protéines modèles. Examinez les résidus alignés par chevauchement colorés afin d'identifier visuellement les résidus ou motifs conservés dans la protéine cible et la protéine modèle. Une identité de séquence plus élevée dans la région alignée par chevauchement, comparée à un alignement de toute la chaîne, indique également la présence de motifs ou de domaines structuraux conservés dans la protéine cible. Évaluez la couverture de l'alignement par chevauchement en examinant attentivement l'alignement.
Si la couverture de l'alignement supérieur est faible et limitée à une petite région de la protéine cible ou absente sur un long segment de la séquence cible, cela indique que la protéine cible contient plus d'un domaine. Dans ce cas, il est recommandé de diviser la séquence et de modéliser les domaines individuellement. Consultez le tableau suivant de la page de résultats pour déterminer les 10 analogues structuraux les plus proches du premier modèle prédit, tels qu'identifiés par le programme d'alignement structural TM align.
Un score TM supérieur à 0,5 indique que l'analogue détecté et le modèle possèdent une topologie similaire et peuvent être utilisés pour déterminer la classe structurale ou la famille de protéines de la protéine interrogée. Ceux ayant un score TM inférieur à 0,3 indiquent une similarité aléatoire de structure. Analysez l'identité de séquence et le RMSD dans la région alignée sur le plan structural afin d'évaluer la conservation des motifs spatiaux dans le modèle et l'analogue structural.
Examinez visuellement les paires de résidus colorées et alignées dans l'alignement afin d'identifier les résidus et motifs structurellement conservés. Consultez le tableau des numéros EC prédits pour visualiser les cinq groupes d'organismes enzymatiques (OG) les plus probables pour la protéine cible. Le niveau de confiance de la prédiction du numéro EC à l'aide de ces modèles est indiqué par le score EC, basé sur une analyse comparative.
La similarité fonctionnelle entre la protéine cible et la protéine modèle peut être interprétée de façon fiable à l'aide d'un score CE supérieur à 1,1. Ensuite, recherchez un consensus fonctionnel parmi les modèles présentant un repliement similaire à celui de la protéine cible. Si plusieurs modèles possèdent le même numéro CE et que le score CE est supérieur à 1,1, le niveau de confiance de la prédiction est très élevé.
Cependant, si le score EC est élevé, mais qu'il n'existe pas de consensus parmi les résultats identifiés, la prédiction devient moins fiable et les utilisateurs sont invités à consulter l'ontologie génique. La vue des prédictions de termes affiche le tableau des termes d'ontologie génique prédits afin d'identifier les 10 homologues principaux de la protéine cible dans la banque PDB, annotés avec des termes d'ontologie génique ; chaque protéine est généralement associée à plusieurs termes d'ontologie génique décrivant ses fonctions moléculaires, ses processus biologiques et sa localisation cellulaire. Cliquez sur chaque terme pour accéder au site web AmiGO et analyser sa définition et sa lignée.
Analysez la colonne du score d'homologie fonctionnelle pour évaluer la similarité fonctionnelle entre les protéines cibles et les modèles. Le niveau de confiance dans le transfert de l'annotation fonctionnelle à partir de ces protéines peut également être estimé. Consultez le tableau de prédiction consensuelle des termes de l'ontologie génique pour analyser la concordance fonctionnelle entre les modèles.
Ces fonctions courantes sont utilisées pour prédire les termes de l'ontologie génique de la protéine cible et pour évaluer le niveau de confiance des prédictions de termes d'ontologie génique. Enfin, faites défiler la page jusqu'en bas pour afficher les 10 meilleures prédictions de sites de liaison de ligands pour la protéine cible. Les sites de liaison prédits sont classés selon le nombre de confirmations de ligands prédits qui partagent un même site de liaison. Le meilleur site de liaison identifié est déjà affiché dans l'application JM OL.
Cliquez sur les boutons radio pour analyser d'autres prédictions et visualiser les résidus d'interaction du ligand. Le score BS indique la similarité locale entre le site de fixation du modèle et celui des modèles. Un score BS supérieur à 1,1 indique une forte similarité de séquence et de structure au voisinage du site de fixation prédit.
Dans le modèle, par rapport au site de liaison connu dans le gabarit, l'IT est une page web principale contenant des liens vers d'autres fonctionnalités utiles. La fonction forum permet à l'utilisateur de créer un compte en ligne et de demander de l'aide à d'autres utilisateurs d'ITER concernant la modélisation de structures ou l'interprétation des résultats. La fonction de téléchargement permet aux utilisateurs de télécharger iter et les packages associés, puis de les installer sur leur ordinateur.
Ceci permet de réduire le temps nécessaire pour effectuer les expériences de modélisation. La fonction de file d'attente permet de visualiser l'état de toutes les tâches soumises sur la page IT a Q. Les utilisateurs peuvent également examiner visuellement l'image des structures modélisées pour les tâches terminées.
Sur cette page, également affichés à côté du score TM attendu et du RMSD attendu du premier modèle et de la date de soumission, figure un extrait de la page de résultats IT AER montrant la séquence de requête formatée plus rapidement, la structure secondaire prédite, ainsi que les scores de confiance associés et l'accessibilité prévue au solvant des résidus. La région centrale analysée et le site d'hydratation potentiel dans la requête sont respectivement mis en évidence par des rectangles cyan et rouges. Ici, les prédictions de structure tertiaire pour les protéines cibles sont affichées.
Les modèles prévus sont affichés dans une fenêtre interactive JML, permettant à l'utilisateur de modifier l'affichage de la molécule. Les modèles peuvent également être téléchargés en cliquant sur les liens de téléchargement ; le score de confiance permettant d'estimer la qualité du modèle est indiqué sous le nom de csco. Un exemple de la page de résultats de itta A, montrant les 10 meilleurs modèles de repliement identifiés et leurs alignements obtenus par les programmes de repliement de Loomis, est présenté.
La qualité des alignements d'alignement est évaluée selon le Z-score normalisé, où une valeur supérieure à un reflète un alignement fiable. Les résidus alignés dans le modèle qui sont identiques aux résidus correspondants de la requête sont mis en évidence en couleur afin d'indiquer la présence d'un résidu ou d'un motif conservé. Inversement, l'absence d'alignement dans la majorité des meilleurs modèles indique la présence de plusieurs domaines dans la protéine requête, et les résidus non alignés correspondent aux régions de liaison entre les domaines.
Ce tableau présente les 10 analogues structuraux et alignements structuraux identifiés par le programme d'alignement structural TM alignés. Le classement des analogues repose sur le score TM de l'alignement structural. Un score TM supérieur à 0,5 indique que les deux structures comparées possèdent une topologie similaire.
Un score TM inférieur à 0,3 indique une similarité entre deux structures aléatoires. Les paires de résidus alignés sur le plan structural sont surlignées en couleur selon leurs propriétés en acides aminés, tandis que les régions non alignées sont indiquées par un tiret. Voici un exemple de page de résultats ITR montrant les homologues d'enzymes identifiés pour la protéine cible dans la bibliothèque PDB.
Le niveau de confiance de la prédiction du numéro EC est analysé à partir du score EC, où un score EC supérieur à 1,1 indique une similarité fonctionnelle entre la protéine cible et la protéine modèle. Le tableau de prédiction des termes de l'ontologie génique pour la protéine cible inclut les homologues fonctionnels de cette protéine présents dans la bibliothèque de modèles d'ontologie génique, classés selon leur score d'homologie fonctionnelle. Les caractéristiques fonctionnelles communes issues de ces correspondances ayant les scores les plus élevés sont utilisées pour établir les prédictions finales des termes d'ontologie génique pour la protéine cible.
La qualité des termes prédits d'ontologie génique est estimée à partir du score geo, où un score geo supérieur à 0,5 indique une prédiction fiable, comme illustré ici par un exemple de page de résultats IT AZA affichant les 10 meilleures prédictions de sites de liaison pour des ligands protéiques obtenues à l'aide de l'algorithme de cofacteur. Le classement des sites de liaison prédits repose sur le nombre de confirmations de ligands prédits partageant un même site de liaison. Le score BS de la requête constitue une mesure de la similarité locale de séquence et de structure entre le site de liaison prédit et les sites témoins, et s'avère utile pour analyser la conservation des poches de liaison.
Bien qu'ISER soit l'un des algorithmes les plus efficaces pour la prédiction de la structure et de la fonction des protéines, il est important de se rappeler qu'il ne s'agit que d'une prédiction issue d'algorithmes informatiques. Toute donnée expérimentale ou information fonctionnelle, par exemple les contacts entre résidus ou les données de liaison, sera extrêmement utile pour améliorer la précision des prédictions. Le serveur IT AER dispose d'un portail permettant d'inclure ces informations au cours de la procédure de modélisation, afin de répondre à l'intérêt croissant qu'il suscite.
Aer, le laboratoire de Zang a publié le logiciel IT AER gratuitement pour la recherche à but non lucratif. Nous développons activement IT AER et améliorons l'eye taster, dans l'espoir que sa disponibilité permettra des applications à grande échelle en dehors du laboratoire de Zang et profitera, ainsi que stimulera, des recherches ultérieures au sein de la communauté scientifique.
Cet article décrit le pipeline I-TASSER pour prédire les structures tridimensionnelles et les fonctions des protéines à partir de leurs séquences d'acides aminés. Le processus implique le repliement par alignement, l'assemblage de fragments et l'inférence fonctionnelle basée sur des structures protéiques connues.
La prédiction computationnelle de la structure et de la fonction des protéines permet de réduire les risques liés à la cible en découverte précoce de médicaments, en fournissant des éclairages mécanistiques pour les protéines non caractérisées expérimentalement. Le pipeline I-TASSER soutient la vérification d'hypothèses et l'annotation fonctionnelle, améliorant la confiance prédictive dans les processus de sélection des cibles et d'identification des composés leaders. Cette approche diminue la dépendance aux méthodes expérimentales à faible débit et accélère la validation des cibles en recherche et développement biopharmaceutique.
La méthode I-TASSER s'intègre au continuum de découverte allant de l'identification de la cible jusqu'à l'optimisation du composé précurseur, en fournissant des informations structurales et fonctionnelles qui éclairent la prise de décision à chaque étape.