Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Protéines SAGESSE: un plan de travail pour

16.4K vues

DOI :

10.3791/50476

25 juillet 2013

Dans cet article

Résumé

Nous avons développé des méthodes de conception de protéines computationnelles de novo capables de s’attaquer à plusieurs domaines importants de la conception de protéines. Pour diffuser ces méthodes, nous présentons Protein WISDOM, un outil en ligne pour la conception de protéines (http://www.proteinwisdom.org). À partir d’un modèle structurel, il est possible de concevoir des protéines monomères pour une stabilité accrue et des complexes pour une affinité de liaison accrue.

Résumé

Le but de la conception des protéines de novo est de trouver les séquences d'acides aminés qui se replier dans une structure trois dimensions souhaitée avec améliorations des propriétés spécifiques, telles que l'affinité de liaison, un agoniste ou un comportement antagoniste, ou la stabilité, par rapport à la séquence native. la conception des protéines se trouve au centre de la conception de médicaments des progrès actuels et de la découverte. Non seulement la conception des protéines ne fournit prédictions pour cibles des médicaments potentiellement utiles, mais il améliore aussi notre compréhension du processus de repliement des protéines et des interactions protéine-protéine. Méthodes expérimentales telles que l'évolution dirigée ont connu le succès dans la conception des protéines. Toutefois, ces méthodes sont limitées par l'espace de séquence limitée qui peut être consulté docilement. En revanche, les stratégies de conception informatiques permettent la projection d'un ensemble beaucoup plus vaste de séquences couvrant une grande variété de propriétés et fonctionnalités. Nous avons développé une gamme de calcul de novo de protéines conception méthods capables de s'attaquer à plusieurs secteurs importants de la conception des protéines. Ceux-ci comprennent la conception de protéines monomères pour une meilleure stabilité et complexes pour une meilleure affinité de liaison.

Pour diffuser ces méthodes pour utiliser plus large, nous présentons SAGESSE de protéines ( http://www.proteinwisdom.org ), un outil qui fournit des méthodes automatisées pour une variété de problèmes de conception de protéines. Modèles structurels sont soumis à initialiser le processus de conception. La première phase de conception est une étape de sélection de la séquence d'optimisation qui vise à améliorer la stabilité grâce à la minimisation de l'énergie potentielle dans l'espace de séquence. Séquences sélectionnées sont alors soumis à une étape de spécificité de pliage et un étage d'affinité de liaison. Une liste de classement ordonné des séquences pour chaque étape du procédé, ainsi que les structures destinées pertinentes, fournit à l'utilisateur une évaluation quantitative complète de la conception. Ici, nous fournissons les détails of chaque méthode de conception, ainsi que plusieurs succès notables expérimentaux obtenus grâce à l'utilisation de ces méthodes.

Introduction

La conception de protéines de novo est l’identification de séquences protéiques qui produiront une structure tertiaire souhaitée avec des propriétés ou une fonction améliorées. Étant donné que le repliement natif d’une protéine est la conformation qui se situe au minimum d’énergie libre, la conception de protéines de novo recherche des séquences qui auront un minimum d’énergie libre dans le pli cible. Ce problème a été décrit pour la première fois par Drexler1 et Pabo2 et a été appelé le « problème de repliement inverse ». Cependant, contrairement au problème de repliement des protéines, où une séquence ne peut produire qu’une seule solution de structure repliée, le problème de conception de protéines de novo présente une dégénérescence. De nombreuses séquences d’acides aminés différentes peuvent donner la même structure et la même fonction tertiaires.

Alors que la conception des protéines a traditionnellement été réalisée expérimentalement par la conception rationnelle et l’évolution dirigée, des méthodes de calcul ont plus récemment été employées pour surmonter l’espace de recherche limité inhérent aux méthodes expérimentales. Diverses méthodes de calcul ont été utilisées, notamment des méthodes déterministes, des méthodes stochastiques et des méthodes probabilistes. 3,4 Les premières méthodes de calcul utilisaient des modèles de base fixe pour faciliter la résolution du problème. 5-7 Avec l’avènement de processeurs plus rapides, d’un calcul haute performance et d’algorithmes plus efficaces, la flexibilité de la dorsale a été incorporée en utilisant un ensemble de modèles de base fixe8-14 ou en incorporant une véritable flexibilité de la dorsale en exprimant le modèle en termes de plages de distances d’atome à atome et d’angles dièdres. 15,16

Cet article décrit en détail Protein WISDOM, un outil en ligne qui a été mis à la disposition de la communauté universitaire pour utiliser notre cadre de conception computationnelle de novo des protéines. Ce cadre a été appliqué à la conception de nombreuses protéines, à des fins thérapeutiques ciblant des maladies telles que le VIH, le cancer, les maladies du complément et d’autres troubles auto-immuns. De nombreux peptides prédits ont été validés expérimentalement, démontrant la puissance de la méthode. Le tableau 1 fournit un résumé des différentes protéines qui ont été conçues, y compris la taille de la protéine ou du peptide, le nombre de prédictions et la validation expérimentale.

Conception de protéinesLongueur des protéines# de prédictions computationnelles# de validations expérimentalesréférence
Conception de séquence complète de bêta-défensine-2 humaine41340 (17)
Inhibiteurs de la comstatine du C3 humain13283/3(18, 19)
Analogues de la comstatine qui se lient à la C3c du rat135 (20)
Analogues de la comstatine avec extension de la di-sérine158  
Structure stabilisatrice de l’analogue de la compstatine W4A91318  
agonistes et antagonistes des récepteurs C3a77204/7(21)
agonistes et antagonistes des récepteurs C5a74612/61 
Inhibiteurs de la gp14 du VIH-11264/5(22)
Inhibiteurs du VIH-1 gp120914  
Inhibiteurs de Bak de Bcl-x L et Bcl-216 à 18105/5(23)
Inhibiteurs d’ERK21125  
Inhibiteurs d’EZH2211710/10(24)
Inhibiteurs de LSD1 et LSD2164117/20 
Inhibiteurs de HLA-DR1136 (25)
Inhibiteurs de la PNP513  

Table 1. Résumé des protéines et des peptides conçus à l’aide du cadre de conception de protéines de novo. Le # de prédictions computationnelles est présenté comme le nombre de prédictions favorables (c’est-à-dire des spécificités de pliage au-dessus d’un certain seuil ou des affinités de liaison approximatives supérieures à la séquence native). Le # de validations expérimentales donne deux nombres : le premier est le nombre de prédictions qui ont été validées expérimentalement tandis que le second est le nombre total de prédictions qui ont été testées expérimentalement.

La conception de la bêta-défensine-2 humaine (hβD-2) a été réalisée pour améliorer la propriété antimicrobienne du peptide. 17 Pour ce plan, nous avons considéré deux cas : 1) jusqu’à 10 mutations le long de hβD-2 et 2) plan de séquence complète de toutes les positions de résidus hβD-2 à l’exception des cystéines (8, 15, 20, 30, 37 et 38). Trois modèles de conception différents et trois modèles de sélection de séquence différents ont été utilisés dans la conception. Des niveaux élevés de similitude dans les mutations ont été observés entre les modèles de moyenne pondérée et de distance pour le plan de 10 mutations et le plan de séquence complète. De plus, un grand nombre de séquences ont des valeurs de spécificité de pliage calculées plus favorables que la séquence native.

Les inhibiteurs du système du complément (de C3, C3a et C5a) ont été conçus pour lutter contre un certain nombre de maladies immunitaires telles que les accidents vasculaires cérébraux, les crises cardiaques, la maladie d’Alzheimer, l’asthme, la polyarthrite rhumatoïde, le rejet de la xénotransplantation, les maladies respiratoires de l’adulte, le psoriasis et la maladie de Crohn. Trois inhibiteurs de la compstatine C3c prédits par le cadre de conception des protéines et trois séquences rationnellement conçues ont été validés expérimentalement comme étant de meilleurs liants que la compstatine native. 18,19

D’autres études ont examiné la perte d’activité de la compstatine contre les C3c non primates et ont conçu un certain nombre d’inhibiteurs candidats de C3c chez le rat et la souris. Il a été démontré que cinq séquences avaient des énergies libres d’association plus favorables avec le C3c du rat que le mutant de la compstatine W4A9 connu pour inhiber le C3c. Cela est dû à la formation d’un nouveau pont salin par Arg1. 20 Huit séquences avec une extension N-terminale ont été prédites comme étant de meilleurs liants que W4A9 avec une extension di-sérine. Enfin, 18 séquences de compstatine ont été prédites pour stabiliser la conformation liée de W4A9, fournissant de solides candidats pour les inhibiteurs de C3c chez les primates et les non-primates.

En plus des inhibiteurs de C3c, les agonistes et antagonistes des récepteurs C3a et C5a ont été conçus sur la base des structures de C3a et C5a. Sept séquences C3a prédites par le modèle ont été testées expérimentalement. Deux des séquences étaient des agonistes puissants tandis que deux autres étaient des agonistes partiels. Les deux agonistes puissants ont montré une amélioration de 58 fois par rapport à un « superagoniste » précédemment découvert. La conception des agonistes et des antagonistes des récepteurs C5a a fourni un ensemble de 61 séquences. Toutes les séquences ont été synthétisées et deux se sont avérées être de nouveaux agonistes du C5a.

Les inhibiteurs de fusion du VIH-1, le virus qui cause le sida, ont été conçus pour empêcher le VIH-1 d’infecter les cellules. La première conception ciblait gp41, une glycoprotéine d’enveloppe du VIH-1. Le cadre de conception des protéines a prédit six séquences qui étaient de meilleurs liants que la séquence native. Quatre de ces séquences prédites ont été validées expérimentalement pour inhiber le VIH-1, la meilleure séquence ayant une CI50 aussi faible que 29 μM. Cette séquence a montré une amélioration de 3 à 15 fois par rapport à la séquence native et n’a eu aucune perte d’activité contre une souche virale résistante à l’Enfuvirtide. 22 Le deuxième modèle ciblait gp120, une autre glycoprotéine d’enveloppe du VIH-1. Quatorze séquences ont été prédites comme étant des liants de gp120 et fournissant des inhibiteurs potentiels supplémentaires de la fusion du VIH-1.

De nombreuses protéines liées au cancer ont fourni des cibles prometteuses pour les thérapies anticancéreuses. Bcl-2 etBcl-x L sont des protéines anti-apoptotiques qui empêchent la mort cellulaire. Les inhibiteurs de ces deux protéines ont été conçus pour induire la mort cellulaire dans les cellules cancéreuses. Dix séquences ont été prédites comme étant de meilleurs liants que l’indigènes, et ces résultats ont capturé les résultats expérimentaux et de mutagénèse précédents. Une autre protéine cible, ERK2, est impliquée dans les cascades de transduction du signal qui en font une cible prometteuse pour les thérapies antiprolifératives contre le cancer. Vingt-cinq séquences ont été prédites comme étant des inhibiteurs d’ERK2.

Les méthyltransférases et déméthylases des histones contrôlent dynamiquement la méthylation des histones, qui a été liée à de nombreux types de cancer, notamment la prostate, le sein, le lymphome, le myélome, la vessie, le côlon, la peau, le foie, l’endomètre, le poumon et l’estomac. Le cadre de conception de protéines de novo a identifié 17 inhibiteurs d’EZH2 (une lysine méthyltransférase) et sur les dix testés expérimentalement, tous se sont avérés inhiber EZH2. 24 Le peptide le plus puissant avait une CI50 d’environ 13 μM, était tout aussi efficace avec des concentrations enzymatiques élevées et n’était pas en compétition avec le cofacteur. Ces peptides étaient le premier ensemble d’inhibiteurs d’EZH2. 53 inhibiteurs de la LSD1 (une déméthylase) ont été prédits par le cadre et sur les 20 testés expérimentalement, 17 étaient des inhibiteurs de la LSD1 et 18 étaient des inhibiteurs de la LSD2. Les meilleurs inhibiteurs avaient des valeurs IC50 inférieures à 1 μM, ce qui en fait les inhibiteurs peptidiques les plus puissants découverts à ce jour.

Les deux derniers systèmes protéiques ont fourni des cibles pour le traitement de diverses maladies auto-immunes telles que la maladie cœliaque, le diabète sucré de type 1, le lupus érythémateux disséminé, le syndrome de Sjögren, le syndrome de Churg-Strauss, la thyroïdite de Hashimoto, la maladie de Basedow, le purpura thrombocytopénique idiopathique, la polyarthrite rhumatoïde et les allergies. Aucun de ces inhibiteurs potentiels n’a été validé expérimentalement, mais le cadre a prédit six séquences qui se lient à HLA-DR1 et 13 séquences qui se lient à PNP.

Le tableau 2 résume les inhibiteurs et agonistes validés expérimentalement prédits à l’aide du cadre de conception de protéines de novo. La mesure de l’affinité de liaison approximative a été utilisée pour prédire neuf des séquences (inhibiteurs du C3c humain, VIH-1 gp41, EZH2, LSD1 et LSD2), tandis que la mesure de la spécificité du pli a été utilisée pour identifier quatre des séquences (agonistes/antagonistes du C3aR). Ces peptides mettent en évidence le succès du cadre de conception des protéines de novo, en particulier la métrique d’affinité de liaison approximative ajoutée. Le cadre est extrêmement polyvalent dans son applicabilité. Six protéines différentes liées à vingt-cinq maladies différentes ont été conçues avec succès et validées expérimentalement.

nomIC50EC50Cible protéiqueMaladies applicables
Réf. SQ0270,94 μM humain C3cAVC, crise cardiaque, maladie d’Alzheimer, asthme, polyarthrite rhumatoïde, lupus érythémateux disséminé, sclérose en plaques, psoriasis, diabète de type I, maladie de Crohn, pancréatite et fibrose kystique
Réf. SQ0861,98 μM humain C3c
Réf. SQ0594,73 μM humain C3c
Réf. SQ110-4 15,2 nMC3aR
Réf. SQ060-4 36,4 nMC3aR
Réf. SQ007-515,4 nM C3aR
Réf. SQ002-526,1 nM C3aR
Réf. SQ43529 à 253 μM VIH-1 gp41SIDA
Réf. SQ03713,57 μM EZH2cancers de la prostate, du sein, lymphome, myélome, vessie, côlon, peau, foie, endomètre, poumon et gastrique
Réf. SQ011-10,521 μM LSD1
Réf. SQ016-10,249 μM LSD1
Réf. SQ026-12,51 μM LSD2
Réf. SQ015-11,332 μM LSD2

Tableau 2. Peptides prédits par ordinateur et validés expérimentalement ciblant diverses maladies.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Aperçu de la méthode

Le cadre de conception de novo utilisé dans Protein WISDOM comprend deux étapes. La première étape produit une liste classée de séquences d'acides aminés qui se replieront selon une structure modèle donnée. La deuxième étape valide ces séquences en calculant soit la spécificité de repliement, soit l'affinité de liaison approximative, ou les deux. La première est principalement utilisée lorsque la conception concerne une protéine unique, tandis que la seconde est employée lorsque la conception concerne un complexe (un peptide se liant à une protéine cible). Figure 1 présente un aperçu des étapes impliquées dans ce cadre.

Entrées de conception : Un certain nombre d'entrées doivent être définies pour le cadre de conception de protéines de novo. La première est le modèle de conception. Il s'agit d'une structure tridimensionnelle (3D) de protéine contenant les coordonnées de tous les atomes de la protéine. La structure peut être rigide ou flexible. Les modèles rigides correspondent à un ensemble de coordonnées atomiques fixes, obtenues à partir de structures déterminées par cristallographie aux rayons X. Les modèles flexibles peuvent être un ensemble de coordonnées atomiques fixes ou des limites supérieures et inférieures pour ces coordonnées. Ces modèles peuvent être obtenus à partir de structures en solution par RMN, de dynamique moléculaire ou de simulations de docking.

Le modèle de conception est utilisé pour générer l'ensemble de mutations autorisées de la protéine conçue. Cet ensemble définit quelles positions de la séquence peuvent muter et en quels acides aminés. L'ensemble de mutations est généré en calculant la surface accessible au solvant (SASA) de chaque résidu dans le modèle de conception. Si le résidu est exposé au solvant à plus de 50 %, un ensemble d'acides aminés hydrophiles est autorisé (D, E, G, H, K, N, P, Q, R, S, T). Si le résidu est exposé au solvant à moins de 20 %, un ensemble d'acides aminés hydrophobes est autorisé (A, F, I, L, M, V, W, Y). Si l'exposition du résidu se situe entre 20 % et 50 %, tous les acides aminés sont autorisés. L'acide aminé cystéine est généralement exclu de l'ensemble de mutations, sauf si des données expérimentales ou de la littérature le justifient. Les acides aminés petits (A, G, T) sont généralement inclus dans tous les ensembles de mutations. Lorsqu'elles sont disponibles, des données expérimentales ou de la littérature peuvent être utilisées pour modifier manuellement les ensembles de mutations de positions spécifiques.

Un champ de forces est choisi pour calculer l'énergie d'interaction par paires des séquences dans le modèle de conception. Bien que tout champ de forces puisse être adapté pour être utilisé dans ce cadre, deux champs de forces dépendants de la distance ont été développés et sont largement utilisés dans le cadre de conception de novo. Le premier est un champ de forces haute résolution Cα-Cα26, où les distances correspondent à celles entre les carbones Cα des résidus. Le second est un champ de forces haute résolution centroïde-centroïde27, où les distances sont mesurées entre les centroïdes des résidus. Les paramètres énergétiques des champs de forces ont été obtenus en résolvant un problème d'estimation de paramètres par programmation linéaire, qui exigeait que les conformations faible énergie et haute résolution d'un grand ensemble d'apprentissage de protéines soient énergétiquement moins favorables que leurs conformations natives. Le champ de forces centroïde-centroïde haute résolution ainsi que le champ de forces Cα-Cα ont tous deux été testés et validés dans des études antérieures sur la bêta-défensine-2 humaine17. La flexibilité réelle de la chaîne principale est intégrée au modèle en discrétisant les champs de forces en intervalles de distance. La distance entre une paire d'acides aminés correspondra à un intervalle de distance, attribuant ainsi la même valeur énergétique à une plage de distances. Ceci permet au modèle d'optimisation de sélection de séquence de prendre en compte les mouvements de la chaîne principale.

Les contraintes biologiques, sous forme de contraintes de charge ou de contraintes de composition, peuvent être incluses manuellement par l'utilisateur comme entrée supplémentaire de conception. Les contraintes de charge spécifient une charge particulière ou un intervalle de charges qui doivent être respectés pour la séquence conçue ou pour une partie de celle-ci. La charge est calculée comme la somme des résidus chargés positivement (K et R) moins la somme des résidus chargés négativement (D et E). Les contraintes de composition définissent des limites supérieures et inférieures concernant la fréquence d'apparition d'un acide aminé particulier dans la séquence. Les contraintes biologiques sont généralement définies à partir d'un alignement de séquences approfondi avec la séquence native, afin de tenir compte des limites biologiques connues concernant la charge et la composition en acides aminés observées dans la nature pour une famille de protéines. D'autres contraintes sont définies manuellement à partir de l'analyse de données expérimentales connues.

Première étape : sélection de séquence : La méthode initiale de sélection de séquence a été d'abord développée par Klepeis et al.15,16. Elle sélectionne et classe les séquences d'acides aminés selon leurs énergies dans le gabarit de conception en utilisant un modèle d'optimisation linéaire en nombres entiers (ILP). La méthode a ensuite été améliorée grâce à l'utilisation d'un modèle de sélection de séquence plus efficace sur le plan computationnel pour les gabarits rigides (uniques) et étendue par le développement de modèles pour les gabarits flexibles. Cette méthode d'optimisation globale ne repose pas sur des mutations aléatoires et garantit théoriquement l'exploration de l'espace complet des séquences afin de déterminer une solution globale. Il s'agit d'un avantage majeur de notre approche par rapport à toutes les autres approches existantes.

Modèle de structure unique : La forme initiale du modèle de sélection de séquence proposé par Klepeis et al.15,16 a été affinée ultérieurement par Fung et al.28. Sa forme finale est donnée par l'équation 1.

Problème d'optimisation avec équations, contraintes ; optimisation mathématique, notations symboliques.
L'ensemble i=1,...,n définit les positions des résidus dans le modèle de conception. À chaque position i, les mutations sont représentées par j{i}=1,...,mi, où mi=20 si la position i peut muter en l'un des vingt acides aminés naturels. Les ensembles d'alias k≡i et l≡j, avec k>i, sont utilisés pour représenter toutes les interactions par paires uniques. Des variables binaires yj indice i exposant j, notation mathématique, variables dans les équations. et Notation de dérivée première y'_k, équation, concept de calcul, formule pédagogique. sont introduites pour modéliser les mutations d'acides aminés. La variable yj indice i exposant j, notation mathématique, variables dans les équations. prendra la valeur un si le modèle attribue l'acide aminé j à la position i, et la valeur zéro dans le cas contraire (de même pour Notation de dérivée première y'_k, équation, concept de calcul, formule pédagogique.). La fonction objectif représente la somme de toutes les interactions énergétiques par paires dans le modèle de conception. Le paramètre Exemple de notation tensorielle en algèbre abstraite ; expression mathématique illustrant la notation par indices., qui correspond à l'interaction énergétique entre la position i occupée par l'acide aminé j et la position i occupée par l'acide aminé l, dépend de la distance entre les α-carbones ou les centroïdes des chaînes latérales aux deux positions (xi,xj,) ainsi que du type des acides aminés j et l. Il contribue à la fonction objectif uniquement si les deux variables yj indice i exposant j, notation mathématique, variables dans les équations. et Notation de dérivée première y'_k, équation, concept de calcul, formule pédagogique. sont égales à un.

Fung et al.28 ont découvert que la formulation (1) est nettement plus efficace sur le plan computationnel que douze autres modèles quadratiques équivalents de type affectation pour la sélection de séquences.28,29 En particulier, elle a surpassé le modèle initial proposé par Klepeis et al.15,16 sur deux problèmes de sélection de séquences pour la bêta-défensine-2 humaine : l’un à un niveau de complexité de 3,4×1045 et l’autre à 6,4×1037, avec 49 contraintes biologiques linéaires supplémentaires. On a constaté que le modèle initial proposé par Klepeis et al.15,16 nécessitait respectivement 53 263 secondes d’unité centrale de traitement (CPU) et 4 578 secondes de CPU pour résoudre les deux problèmes jusqu’à l’optimalité globale à l’aide de CPLEX 9.030 sur un processeur Pentium IV 3,2 GHz. La formulation (1) n’a nécessité que 649 secondes de CPU et 14 secondes de CPU pour accomplir les mêmes tâches, ce qui correspond à une amélioration de l’efficacité computationnelle par un facteur 82 et 327 respectivement.

Modèle de la moyenne pondérée : Fung et al.28 ont développé deux modèles pour traiter le cas typique de la conception de novo de protéines, dans lequel le gabarit de conception est flexible et comprend un ensemble de structures. Le modèle de la moyenne pondérée utilise une énergie moyenne pondérée, Formule d'équilibre statique ΣE_ik^jl(x_i,x_k)wt(x_i,x_k,d), concept mathématique. , en remplacement du paramètre d'énergie Exemple de notation tensorielle en algèbre abstraite ; expression mathématique illustrant la notation par indices.(xi,xk) dans le modèle à structure unique (Éq. 1). Les poids wt(xi,xk,d) sont déterminés par les fréquences de la distance entre xi et xk tombant dans l'intervalle de distance d dans les structures gabarits. La forme finale du modèle de la moyenne pondérée est donnée dans l'Éq. 2.

Équations du problème d'optimisation ; modèle de programmation linéaire ; contraintes et variables binaires ; formulation mathématique.
Modèle par classes de distance : Le deuxième modèle de sélection de séquence pour les structures de gabarits flexibles intègre les informations de distance provenant de plusieurs structures en introduisant une variable binaire bikd. Cette variable vaut un si la distance entre xi et xk tombe dans la classe de distance d, et zéro sinon. Un autre paramètre introduit, disbin(xi, xk, d), vaut un si la distance entre xi et xk dans l'une des structures gabarits tombe dans la classe de distance d, et zéro sinon. Étant donné qu'une seule classe de distance par paire d'acides aminés contribuera à l'énergie totale, Exemple de notation tensorielle en algèbre abstraite ; expression mathématique illustrant la notation par indices. dans la fonction objectif est remplacé par Équation mathématique Σ E(x) diagramme ; équilibre statique, formule de sommation pour analyse de recherche.. Toutefois, cela introduit une non-linéarité dans la fonction objectif. Des détails supplémentaires sur la linéarisation du modèle et les contraintes additionnelles nécessaires pour assurer la faisabilité sont disponibles dans Fung et al.28 Le modèle par classes de distance est donné dans l'équation 3.

Équations du problème d'optimisation ; modèle de programmation linéaire ; contraintes et variables binaires ; formulation mathématique.
N'importe lequel des problèmes de programmation linéaire en nombres entiers (PLNE) formulés ci-dessus15-17 peut être résolu rigoureusement à l'aide de techniques de branch-and-bound28-30. Ces techniques garantissent une convergence cohérente et fiable vers la séquence d'énergie minimale globale.

Deuxième étape : Validation : Figure 2 fournit un aperçu détaillé des deux approches de la deuxième étape. La figure illustre les étapes nécessaires pour calculer la métrique de classement finale et le nombre de structures générées à chaque étape.

Spécificité du repliement : La spécificité du repliement est une métrique utilisée pour classer les conceptions préliminaires obtenues à l'étape une. L'objectif du calcul est d'évaluer dans quelle mesure chaque séquence se replie dans la structure du modèle par rapport à la séquence d'origine du modèle, en se basant sur des calculs d'énergie. Deux approches permettent de réaliser cela, chacune ayant des exigences computationnelles différentes.

La première approche a été mise en œuvre par Klepeis et al.15,16. Cette approche utilise le cadre de prédiction de structure protéique ASTRO-FOLD, 26,27,31-47 basé sur une optimisation globale déterministe. Cette approche n'est actuellement pas utilisée dans l'implémentation de Protein WISDOM, car elle est très exigeante en ressources de calcul. Compte tenu des limites des ressources informatiques et de la nécessité d'effectuer ce calcul sur potentiellement des centaines, voire des milliers de séquences lors de la conception, Fung et al.17 ont proposé une approche plus efficace utilisant TINKER/CYANA.48-50. L'approche consiste à définir un modèle flexible de la structure. Le modèle flexible peut être défini à l'aide de bornes supérieures et inférieures sur les distances entre les atomes Cα , ainsi que sur les angles ϕ et ψ des résidus. Pour une structure unique, les distances initiales et les angles dièdres sont utilisés, et les bornes sont définies soit comme une distance fixe, soit comme un pourcentage. Les bornes par défaut sont de ±10 % pour les distances Cα ou ±10° pour les angles dièdres. Pour un modèle flexible, les bornes peuvent être obtenues à partir des valeurs maximales et minimales observées dans l'ensemble des structures modèles fournies en entrée pour la conception. Une fois les bornes initiales définies pour chaque séquence, des ensembles contenant des centaines de conformères sont générés à l'aide de CYANA 2.1.48,49. Les conformères sont générés à l'aide d'un protocole de recuit simulé par dynamique des angles de torsion dans CYANA, qui chauffe rapidement la protéine puis la refroidit lentement, en suivant les conformations échantillonnées. Après le recuit simulé, une minimisation locale de l'énergie est effectuée afin de réduire les chevauchements des rayons de Van der Waals, ainsi que les violations des contraintes de distance et d'angle. Par défaut, 500 structures finales sont générées. Chaque structure de l'ensemble pour chaque séquence fait l'objet d'une minimisation locale dans TINKER 3.6,50 en utilisant le champ de force AMBER.51 . L'énergie potentielle finale de chaque structure minimisée est consignée dans un tableau. Cette approche globale est appliquée à la séquence initiale ainsi qu'à chaque séquence mutante candidate. Ensuite, la spécificité de repliement de chaque séquence mutante vis-à-vis du repliement cible peut être calculée par rapport à la séquence native à l'aide de la distribution de Boltzmann suivante (Éq. 4).

Équation d'équilibre statique Σ(e^(-βEi)) pour les états natif et nouveau ; formule mathématique.
Affinité de liaison approximative : La méthode de calcul de l'affinité de liaison approximative est utilisée pour classer les séquences conçues qui sont en complexe avec une protéine cible. Ces calculs peuvent être effectués directement sur les séquences issues de la première étape ou sur les séquences présentant une forte spécificité de repliement obtenues à l'étape de spécificité de repliement.

Lilien et al.52 ont proposé une approche pour le calcul des affinités de liaison approximatives des complexes protéine-ligand. Elle repose sur la génération d'ensembles basés sur les rotamères de la protéine, du ligand et du complexe protéine-ligand, et sur l'utilisation de ces ensembles pour calculer les fonctions de partition. Cette affinité de liaison approximative est notée K* et est définie par l'équation 5.

Ici qPL est la fonction de partition du complexe protéine-ligand, qb est la fonction de partition de la protéine libre, et qL est la fonction de partition du ligand libre. Les fonctions de partition sont définies dans l'équation 6, où les ensembles B, F et L contiennent respectivement les conformations basées sur les rotamères du complexe protéine-ligand lié, de la protéine libre et du ligand libre. En est l'énergie de conformation n, R est la constante des gaz, et T est la température.

Équations d'équilibre thermodynamique ; Σe^(-Eb/RT) ; formule scientifique de l'énergie interne.
Prédiction de la structure : Afin de commencer le calcul de K*, une structure tridimensionnelle de chaque séquence est nécessaire. Celle-ci est obtenue à l’aide de la fonction Rosetta AbRelax53-55, incluse dans le logiciel Rosetta 3.4. La stratégie sous-jacente à l’algorithme AbRelax repose sur l’observation expérimentale selon laquelle la structure locale de la protéine est influencée, mais non déterminée de façon unique, par la séquence locale de la protéine. Un algorithme de Monte Carlo est utilisé pour remplacer les structures locales de la protéine par des fragments structuraux dérivés de la séquence. Cette méthode permet d’obtenir des structures protéiques compactes finales qui tiennent compte d’interactions non locales, telles que les résidus hydrophobes enfouis, les brins β appariés et les interactions spécifiques entre chaînes latérales.

Regroupement : Les structures issues de AbRelax sont ensuite regroupées en fonction de leurs angles φ et ψ à l'aide de OREO.56,57 Cette méthode de regroupement permet de mettre en évidence des structures de squelette représentatives de l'ensemble structural complet. Les structures moyennes des dix plus grands groupes ainsi que la structure présentant l'énergie globalement la plus basse sont sélectionnées pour l'accolement à la protéine cible. Cela fournit 11 structures de squelette uniques pour chaque séquence peptidique, intégrant ainsi la flexibilité du squelette dans la génération de l'ensemble.

Prédiction de dockage : La prédiction de dockage est réalisée à l'aide de RosettaDock.58-60 Pour chaque séquence, chacune des 11 structures peptidiques de l'ossature est associée au niveau de la protéine cible. Dans ce cas, étant donné que le site de liaison est connu, les peptides sont placés à proximité du site de liaison et autorisés à se translater de 3 Å perpendiculairement au site de liaison, de 8 Å parallèlement au site de liaison, et à tourner de 8°. RosettaDock utilise un algorithme de type Monte Carlo pour les mouvements de dockage à basse et haute résolution. Chaque simulation de dockage génère un grand ensemble de structures complexes. Les dix complexes présentant l'énergie la plus faible parmi chacune des 11 simulations sont utilisés comme structures initiales pour la génération finale de l'ensemble conformationnel basé sur les rotamères (110 structures initiales par séquence).

Génération de l'ensemble final : RosettaDesign61 est utilisé pour générer l'ensemble final de conformations basé sur les rotamères, car il permet de produire un certain nombre de structures en ajustant uniquement les rotamères des chaînes latérales à l'aide de la fonction fixbb. RosettaDesign reçoit plusieurs structures initiales, et pour chaque structure, un résidu est choisi aléatoirement et son rotamère est modifié selon un algorithme de Monte Carlo. Ce processus est répété jusqu'à ce que des milliers de substitutions de rotamères aient été tentées, produisant ainsi une conformation finale à basse énergie qui contribuera fortement à la fonction de partition.

Pour générer l'ensemble de peptides, les dix structures peptidiques de plus basse énergie provenant de chacun des dix plus grands groupes, ainsi que les dix structures peptidiques globalement de plus basse énergie, sont utilisées comme structures initiales pour RosettaDesign (110 structures initiales au total). Pour chaque structure initiale, 200 conformères de rotamères sont générés, produisant un ensemble final de 22 000 structures (ensemble L dans l'équation 6). Cet ensemble intègre à la fois la flexibilité de la chaîne principale et la flexibilité des rotamères.

L'ensemble complexe est généré de manière similaire en prenant les 110 structures initiales issues de l'étape de prédiction par docking et en générant 200 conformères de rotamères par structure initiale. La taille finale de l'ensemble est de 22 000 structures (ensemble B dans l'équation 6). La flexibilité est prise en compte grâce aux différentes structures du squelette peptidique utilisées, aux diverses conformations dockées et aux conformères de rotamères pour chaque structure initiale.

L'ensemble de protéines est généré en exécutant RosettaDesign uniquement sur la structure de la protéine cible. Dans ce cas, 2 000 conformations de rotamères sont générées à partir de la structure initiale unique, de sorte que la taille finale de l'ensemble est de 2 000 structures (ensemble F dans l'équation 6).

Protéine WISDOM

Protein WISDOM, qui signifie Protein Workbench for In Silico De novo design Of bioMolecules, est un outil en ligne qui donne à la communauté académique un accès convivial à notre cadre de conception de novo de protéines. Il peut gérer plusieurs objectifs de conception couramment rencontrés, allant de la conception de chaînes protéiques uniques adoptant un repliement donné à la conception de nouveaux peptides capables de se lier à une protéine cible. Les deux sections suivantes décrivent les fonctionnalités de Protein WISDOM en ce qui concerne les deux principaux types de problèmes de conception de protéines rencontrés. Le premier type applique une sélection de séquence pour choisir de nouvelles séquences favorables au sein du modèle de conception donné, puis utilise la spécificité du repliement pour valider ces séquences. Le second type utilise la sélection de séquence pour choisir de nouvelles séquences d'un peptide lié dans un complexe, puis recourt à la fois à la spécificité du repliement et à des calculs approximatifs d'affinité de liaison pour valider les séquences obtenues.

Inscription de l'utilisateur

Visitez la page web de Protein WISDOM à l'adresse http://www.proteinwisdom.org.

Cliquez sur le bouton Connexion utilisateur en haut à droite de la page. Cliquez sur « Cliquez ici » pour vous inscrire.

Saisissez les informations relatives à l'adresse électronique et au nom d'utilisateur demandé, puis cliquez sur continuer.

Remplissez les informations supplémentaires concernant le nom, l'établissement, le groupe et l'adresse. Cochez la case pour accepter les conditions d'utilisation. Cliquez sur le bouton « Soumettre l'inscription ».

Étape une : sélection de la séquence

Soumission de la séquence protéique et des structures(s) modèles

Cliquez sur le bouton Connexion utilisateur pour commencer l'expérience de conception de protéines. L'utilisateur voit apparaître sa « Page d'accueil utilisateur » (Figure 3) qui indique le nombre de travaux soumis, le nombre de structures (modèles) téléchargées et une liste des structures téléchargées jusqu'à présent.

Commencez un nouveau travail de conception en cliquant sur « Créer un nouveau travail ». L'utilisateur est redirigé vers la page « Soumission du travail » (Figure 4). Donnez un nom au travail et indiquez s'il est basé sur un travail précédent (c.-à-d. le même modèle de conception, les mêmes ensembles de mutations et les mêmes contraintes biologiques peuvent être importés dans un nouveau travail, bien que l'utilisateur puisse modifier les ensembles de mutations et les contraintes biologiques). Cliquez sur « continuer ».

Téléversez la ou les structures protéiques du modèle de conception (Figure 5). Ce modèle doit être au format standard de la banque de données des protéines (PDB). Il peut s'agir d'un modèle rigide (un seul ensemble de coordonnées pour chaque atome) ou d'un modèle flexible (plusieurs modèles, comme ceux obtenus à partir de structures en solution par RMN). Dans le cas de la conception d'une seule protéine, le modèle ne peut contenir qu'une seule chaîne. L'utilisateur peut téléverser un nouveau modèle ou choisir parmi les modèles existants qu'il a précédemment téléchargés. Indiquez éventuellement l'identifiant PDB du modèle, s'il est disponible. Si plusieurs modèles sont téléchargés, veillez à ce que chaque modèle commence par « MODEL # » et se termine par « ENDMDL ». Assurez-vous que chaque résidu est désigné par un acide aminé naturel. Cliquez sur « Continuer ».

Une fois le modèle téléchargé avec succès, Protein WISDOM affichera le nombre de résidus, de chaînes et de modèles qu'il a détectés dans le modèle, listera la séquence et demandera à l'utilisateur de vérifier le modèle. Confirmez la structure du modèle s'il a été saisi correctement, puis cliquez sur « Continuer ».

Une fois le modèle correctement téléchargé et confirmé, l'utilisateur accède à la « page de contrôle principale » (Figure 6). Sur cette page, l'utilisateur peut consulter l'état de la tâche, modifier les jeux de mutations et les contraintes biologiques, puis soumettre la tâche pour la phase un : sélection de la séquence. À ce stade, comme la phase un n'est pas encore terminée, aucune option pour la phase deux n'est disponible. Celles-ci apparaissent uniquement lorsque les résultats de la phase un sont disponibles.

Sélection des ensembles de mutations

Cliquez sur le lien « Mutation Sets » dans la « Main Control Page » pour définir les jeux de mutations.

Sélectionnez les résidus qui pourront muter et indiquez les acides aminés auxquels ils peuvent muter (Figure 7). Par défaut, les acides aminés autorisés à une position donnée sont choisis en fonction de la surface accessible au solvant (SASA). Les jeux de mutations sont obligatoires.

Cliquez sur « Enregistrer les modifications » une fois les jeux de mutations sélectionnés. L'utilisateur peut choisir de continuer à modifier le jeu de mutations. Une fois la modification du jeu de mutations terminée, cliquez pour revenir à la « Page de contrôle principale ».

Sélection des contraintes biologiques

Cliquez sur le lien « Contraintes biologiques » dans la « Page de contrôle principale » pour définir les contraintes biologiques.

Spécifiez les contraintes relatives à la charge ou à la teneur en acides aminés sur l'ensemble de la protéine ou sur une partie de celle-ci (Figure 8).

Limiter, si nécessaire, le nombre total de mutations pouvant survenir. Les contraintes biologiques sont facultatives. Cliquer pour revenir à la « Page de contrôle principale » une fois terminé.

Soumission de la première étape : sélection de la séquence

Cliquez sur le lien « Commencer l'étape 1 » pour diriger l'utilisateur vers la page « Soumettre l'étape 1 ».

Sélectionnez la chaîne à concevoir (Figure 9), le nombre de séquences à générer, le champ de force dépendant de la distance et le modèle. Si une conception de complexe est en cours et qu'un calcul de spécificité de repliement est souhaité, il faut choisir une seule chaîne à concevoir. Si le modèle téléchargé était une structure unique ou un « modèle rigide », seul le modèle de structure unique est autorisé. Si le modèle téléchargé est flexible, l'utilisateur peut choisir parmi les trois modèles suivants : structure unique, moyenne pondérée et bin de distance. Prenez note de la complexité computationnelle de l'optimisation à résoudre. Une limite supérieure de 2025 est imposée pour la complexité computationnelle autorisée.

Soumettez la tâche. L'utilisateur est redirigé vers la « page de contrôle principale » (Figure 10). Le statut de la tâche sera mis à jour pour indiquer l'avancement en cours. La tâche sera verrouillée pour modification après soumission.

Une fois le travail terminé, l'utilisateur reçoit un courriel contenant les résultats, qui consistent en une liste de séquences conçues. Les résultats sont également consultables sur la « page de contrôle principal ». Une boîte pour l'étape 2 : « Spécificité du repliement » apparaît sur la page afin de permettre à l'utilisateur d'effectuer cette validation.

Deuxième étape : Calculs de la spécificité du repliement

Soumission de la spécificité du repliement

Cliquez sur « Commencer l'étape 2 : Spécificité du repliement » pour accéder à la page « Construire l'étape 2 ». Définissez les limites supérieure et inférieure des distances Cα-Cα en précisant le facteur de flexibilité du modèle soit en pourcentage de la distance, soit en distance fixe. Définissez les limites angulaires supérieure et inférieure pour les angles dièdres φ et ψ en spécifiant le facteur de flexibilité du modèle en pourcentage. Notez que lorsqu'un modèle flexible est utilisé, les limites de distance supérieure et inférieure correspondent respectivement aux valeurs minimale et maximale de distance parmi tous les modèles du modèle. De même, les limites angulaires supérieure et inférieure sont déterminées à partir des valeurs angulaires maximale et minimale observées sur l'ensemble des modèles.

Cliquez sur le bouton « Soumettre ».

Spécifiez le nombre de structures à générer par séquence, puis cliquez sur « Continuer ». Notez qu'une limite supérieure de 500 structures par séquence à générer est imposée.

Cliquez sur « Continuer » pour confirmer l'intention de soumettre la validation du repliement. L'Étape un et l'Étape deux sont verrouillées pour modification jusqu'à l'achèvement de l'Étape deux.

Une fois le travail terminé, un courriel contenant les résultats est envoyé à l'utilisateur. Consultez les résultats sur Protein WISDOM depuis la « Page de contrôle principale » (Figure 11). Les fichiers texte contenant les séquences conçues, les valeurs d'énergie correspondantes issues de la première étape et les valeurs de spécificité de repliement issues de la deuxième étape peuvent être consultés et téléchargés. En outre, l'utilisateur peut cliquer sur le lien « Voir les résultats », qui affiche dans le navigateur un tableau comprenant les classements et les valeurs d'énergie de la première étape, ainsi que les classements et les valeurs de spécificité de repliement de la deuxième étape.

Troisième étape : Calculs approximatifs de l'affinité de liaison pour les complexes protéine-peptide

Les calculs d'affinité de liaison approximative évaluent l'affinité de la protéine ou du peptide ligand conçu vis-à-vis du reste du complexe. Ces calculs peuvent être effectués directement après la première étape, ou après l'achèvement des calculs de spécificité de repliement.

Cliquez sur « Sequence # » pour sélectionner la séquence à partir de laquelle effectuer le calcul approximatif de l'affinité de liaison. L'utilisateur sera redirigé vers la page « Select Sequence », qui présente une liste des séquences conçues ainsi que leurs rangs de sélection de séquence et de spécificité de repliement. Une seule séquence peut être sélectionnée à la fois pour le calcul approximatif de l'affinité de liaison, car ces calculs sont très exigeants en termes de puissance de calcul. Une fois le calcul pour une séquence terminé, l'utilisateur peut sélectionner une autre séquence afin de calculer son affinité de liaison approximative, et ce résultat s'ajoute au résultat précédent, affichant ainsi l'affinité de liaison approximative pour l'ensemble des séquences traitées. Une fois qu'une séquence est sélectionnée et enregistrée, l'utilisateur est redirigé vers la « Main Control Page ».

Cliquez sur « Commencer l'étape 2 : Affinité de liaison approximative » pour soumettre la tâche. Une fois terminée, les résultats sont envoyés par courriel à l'utilisateur, incluant une pièce jointe contenant le numéro de séquence, l'affinité de liaison approximative et les valeurs des fonctions de partition dans l'équation 6. Pour chaque tâche ultérieure d'affinité de liaison approximative, ce fichier contient les résultats de toutes les séquences terminées. Les résultats complets (provenant de la sélection des séquences, de la spécificité de repliement et de l'affinité de liaison approximative) peuvent également être consultés en accédant à la « Page de contrôle principale » de la tâche (Figure 12).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Conception De Novo d'inhibiteurs de l'entrée pour le VIH-1

Le cadre de conception de novo mis en œuvre dans Protein WISDOM a été utilisé pour concevoir des peptides inhibiteurs pour plusieurs systèmes thérapeutiques importants (tableaux 1 et 2). L'un des systèmes remarquables est la conception de peptides destinés à inhiber l'entrée du VIH-1 dans le récepteur cellulaire hôte CD4, qui est utilisé ici comme un système représentatif afin de démontrer l'utilisation ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Le cadre de conception de protéines de novo se compose de deux étapes, une étape de sélection de séquence et une étape de validation. Le cadre est suffisamment robuste pour gérer des modèles de conception rigides et flexibles, et peut être appliqué à la conception de protéines uniques ou à la conception de protéines complexes. Le cadre a été appliqué avec succès à de nombreux systèmes protéiques avec des applications à des dizaines de maladies. Un certain nombre de conceptions ont été validées expérimentalement,...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont pas d’intérêts financiers concurrents.

Remerciements

CAF remercie la NSF et le NIH pour leur soutien (R01 GM52032 ; R24 GM069 736), et l’Agence américaine de protection de l’environnement, EPA (R 832721-010). Une partie de cette recherche a été rendue possible grâce au soutien du gouvernement par le DoD, Air Force Office of Scientific Research. JS remercie les NIH pour leur soutien (P50GM071508-06). Le MLBP remercie le soutien d’une bourse d’études supérieures en sciences et ingénierie de la défense nationale (NDSEG), 32 CFR 168a. GAK remercie le soutien d’une bourse de recherche supérieure de la National Science Foundation sous le numéro de subvention DGE-1148900.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Références

  1. Drexler, K. Molecular engineering: An approach to the development of general capabilities for molecular manipulation. Proc. Natl Acad. Sci. U.S.A. 78, 5275-5278 (1981).
  2. Pabo, C. Molecular technology: Designing proteins and peptides. Nature. 301, 200(1983).
  3. Floudas, C. A. Research challenges, opportunities and synergism in systems engineering and computational biology. AIChE J. 51, 1872-1884 (2005).
  4. Fung, H. K., Welsh, W. J., Floudas, C. A. Computational de novo peptide and protein design: Rigid templates versus flexible templates. Ind. Eng. Chem. Res. 47, 993-1001 (2008).
  5. Ponder, J., Richards, F. Tertiary templates for proteins. J. Mol. Biol. 193, 775-791 (1987).
  6. Dahiyat, B. I., Mayo, S. L. Protein design automation. Protein Sci. 5, 895-903 (1996).
  7. Dahiyat, B. I., Gordon, D. B., Mayo, S. L. Automated design of the surface positions of protein helices. Protein Sci. 6, 1333-1337 (1997).
  8. Su, A., Mayo, S. L. Coupling backbone flexibility and amino acid sequence selection in protein design. Protein Sci. 6, 1701-1707 (1997).
  9. Desjarlais, J., Handel, T. Side chain and backbone flexibility in protein core design. J. Mol. Biol. 290, 305-318 (1999).
  10. Farinas, E., Regan, L. The de novo design of a rubredoxin-like Fe site. Protein Sci. 7, 1939-1946 (1998).
  11. Harbury, P. B., Plecs, J. J., Tidor, B., Alber, T., Kim, P. S. High-resolution protein design with backbone freedom. Science. 282, 1462-1467 (1998).
  12. Koehl, P., Levitt, M. De novo protein design: I. In search of stability and specificity. J. Mol. Biol. 293, 1161-1181 (1999).
  13. Koehl, P., Levitt, M. De novo protein design. II. Plasticity in sequence space. J. Mol. Biol. 293, 1183-1193 (1999).
  14. Kuhlman, B., Dantae, G., Ireton, G., Verani, G., Stoddard, B., Baker, D. Design of a novel globular protein fold with atomic-level accuracy. Science. 302, 1364-1368 (2003).
  15. Klepeis, J. L., Floudas, C. A. Integrated structural, computational and experimental approach for lead optimization: Design of compstatin variants with improved activity. J. Am. Chem. Soc. 125, 8422-8423 (2003).
  16. Klepeis, J. L., Floudas, C. A., Morikis, D., Tsokos, C. G., Lambris, J. D. Design of peptide analogs with improved activity using a novel de novo protein design approach. Ind. Eng. Chem. Res. 43, 3817-3826 (2004).
  17. Fung, H. K., Floudas, C. A., Taylor, M. S., Zhang, L., Morikis, D. Toward full-sequence de novo protein design with flexible templates for human beta-defensin-2. Biophys. J. 94, 584-599 (2008).
  18. Bellows, M. L., Fung, H. K., Floudas, C. A., López de Victoria, A., Morikis, D. New compstatin variants through two de novo protein design frameworks. Biophys. J. 98, 2337-2346 (2010).
  19. López de Victoria, A., Gorham, R. D. Jr A new generation of potent complement inhibitors of the compstatin family. Chem. Biol. Drug Des. 77, 431-440 (2011).
  20. Tamamis, P., López de Victoria, A. Molecular dynamics in drug design: New generations of compstatin analogs. Chem. Biol. Drug Des. 79, 703-718 (2012).
  21. Bellows-Peterson, M. L., Fung, H. K. De novo peptide design with c3a receptor agonist and antagonist activities: Theoretical predictions and experimental validation. J. Med. Chem. 55, 4159-4168 (2012).
  22. Bellows, M. L., Taylor, M. S. Discovery of entry inhibitors for HIV-1 via a new de novo protein design framework. Biophys. J. 99, 3445-3453 (2010).
  23. Sun, J. -J., Abdeljabbar, D. M., Clarke, N. L., Bellows, M. L., Floudas, C. A., Link, A. J. Reconstitution and engineering of apoptotic protein interactions on the bacterial cell surface. J. Mol. Biol. 394, 297-305 (2009).
  24. Smadbeck, J., Bellows-Peterson, M. L. De novo protein design and validation of histone methyltranferase inhibitors. , In Preparation (2013).
  25. Bellows, M. L., Fung, H. K., Floudas, C. A. Molecular Systems Engineering, Process Systems Engineering. Adjiman, C. S., Galindo, A. 6, Wiley-VCH Verlag GmbH & Co. KGaA. 207-232 (2010).
  26. Rajgaria, R., McAllister, S. R., Floudas, C. A. A novel high resolution Cα-Cα distance dependent force field based on a high quality decoy set. Proteins. 65, 726-741 (2006).
  27. Rajgaria, R., McAllister, S. R., Floudas, C. A. Distance dependent centroid to centroid force fields using high resolution decoys. Proteins. 70, 950-970 (2008).
  28. Fung, H. K., Taylor, M. S., Floudas, C. A. Novel formulations for the sequence selection problem in de novo protein design with flexible templates. Optim. Method. Softw. 22, 51-71 (2007).
  29. Fung, H. K., Rao, S., Floudas, C. A., Prokopyev, O., Pardalos, P. M., Rendl, F. Computational comparison studies of quadratic assignment like formulations for the in silico sequence selection problem in de novo protein design. J. Comb. Optim. 10, 41-60 (2005).
  30. CPLEX. Using the CPLEX Callable Library. , ILOG, Inc. (1997).
  31. Klepeis, J. L., Floudas, C. A. Free energy calculations for peptides via deterministic global optimization. J. Chem. Phys. 110, 7491-7512 (1999).
  32. Klepeis, J. L., Floudas, C. A., Morikis, D., Lambris, J. D. Predicting peptide structures using NMR data and deterministic global optimization. J. Comput. Chem. 20, 1354-1370 (1999).
  33. Klepeis, J. L., Schafroth, H. D., Westerberg, K. M., Floudas, C. A. Deterministic global optimization and ab initio approaches for the structure prediction of polypeptides, dynamics of protein folding and protein-protein interactions. Adv. Chem. Phys. 120, 265-457 (2002).
  34. Klepeis, J. L., Floudas, C. A. Ab initio prediction of helical segments of polypeptides. J. Comput. Chem. 23, 246-266 (2002).
  35. Klepeis, J. L., Floudas, C. A. Prediction of beta-sheet topology and disulfide bridges in polypeptides. J. Comput. Chem. 24, 191-208 (2003).
  36. Klepeis, J. L., Floudas, C. A. ASTRO-FOLD: A combinatorial and global optimization framework for ab initio prediction of three-dimensional structures of proteins from the amino acid sequence. Biophys. J. 85, 2119-2146 (2003).
  37. Klepeis, J. L., Pieja, M. T., Floudas, C. A. A new class of hybrid global optimization algorithms for peptide structure prediction: Integrated hybrids. Comput. Phys. Commun. 151, 121-140 (2003).
  38. Klepeis, J., Pieja, M., Floudas, C. Hybrid global optimization algorithms for protein structure prediction : Alternating hybrids. Biophys. J. 84, 869-882 (2003).
  39. Klepeis, J. L., Floudas, C. Analysis and prediction of loop segments in protein structures. Comput. Chem. Eng. 29, 423-436 (2005).
  40. Mo¨nnigmann, M., Floudas, C. Protein loop structure prediction with flexible stem geometries. Proteins. 61, 748-762 (2005).
  41. McAllister, S. R., Mickus, B. E., Klepeis, J. L., Floudas, C. A. A novel approach for alpha-helical topology prediction in globular proteins: Generation of interhelical restraints. Proteins. 65, 930-952 (2006).
  42. Floudas, C. A., Fung, H. K., McAllister, S. R., Mönnigmann, M., Rajgaria, R. Advances in protein structure prediction and de novo protein design: A review. Chem. Eng. Sci. 61, 966-988 (2006).
  43. Subramani, A., Wei, Y., Floudas, C. A. ASTRO-FOLD 2.0: An enhanced framework for protein structure prediction. AIChE J. 58, 1619-1637 (2012).
  44. Wei, Y., Thompson, J., Floudas, C. Concord: a consensus method for protein secondary structure prediction via mixed integer linear optimization. P. Roy. Soc. A-Math. Phy. 468, 831-850 (2011).
  45. Subramani, A., Floudas, C. β-sheet topology prediction with high precision and recall for β and mixed α/β proteins. PLoS One. 7, e32461(2012).
  46. Rajgaria, R., Wei, Y., Floudas, C. A. Contact prediction for beta and alpha-beta proteins using integer linear optimization and its impact on the first principles 3D structure prediction method ASTRO-FOLD. Proteins. 78, 1825-1846 (2010).
  47. Subramani, A., Floudas, C. A. Structure prediction of loops with fixed and flexible stems. J. Phys. Chem. B. 116, 6670-6682 (2012).
  48. Güntert, P., Mumenthaler, C., Wüthrich, K. Torsion angle dynamics for NMR structure calculation with the new program DYANA. J. Mol. Biol. 273, 283-298 (1997).
  49. Güntert, P. Automated NMR structure calculation with CYANA. Methods Mol. Biol. 278, 353-378 (2004).
  50. Ponder, J. TINKER, software tools for molecular design. , Department of Biochemistry and Molecular Biophysics, Washington University School of Medicine. Louis, MO. (1998).
  51. Cornell, W. D., Cieplak, P. A 2nd generation forcefield for the simulation of proteins, nucleic acids, and organic molecules. J. Am. Chem. Soc. 117, 5179-5197 (1995).
  52. Lilien, R. H., Stevens, B. W., Anderson, A. C., Donald, B. R. A novel ensemble-based scoring and search algorithm for protein redesign and its application to modify the substrate specificity of the gramicidin synthetase a phenylalanine adenylation enzyme. J. Comput. Biol. 12, 740-761 (2005).
  53. Lee, M. R., Baker, D., Kollman, P. A. 2.1 and 1.8 A°Cα RMSD structure predictions on two small proteins, HP-36 and S15. J. Am. Chem. Soc. 123, 1040-1046 (2001).
  54. Rohl, C. A., Baker, D. De novo determination of protein backbone structure from residual dipolar couplings using rosetta. J. Am. Chem. Soc. 124, 2723-2729 (2002).
  55. Rohl, C. A., Strauss, C. E. M., Misura, K. M. S., Baker, D. Protein structure prediction using rosetta. Methods Enzymol. 383, 66-93 (2004).
  56. DiMaggio, P. A., McAllister, S. R., Floudas, C. A., Feng, X. J., Rabinowitz, J. D., Rabitz, H. A. Biclustering via optimal re-ordering of data matrices in systems biology: Rigorous methods and comparative studies. BMC Bioinformatics. 9 (458), (2008).
  57. DiMaggio, P. A., McAllister, S. R., Floudas, C. A., Feng, X. J., Rabinowitz, J. D., Rabitz, H. A. A network flow model for biclustering via optimal re-ordering of data matrices. J Global Optimization. 47, 343-354 (2010).
  58. Daily, M. D., Masica, D., Sivasubramanian, A., Somarouthu, S., Gray, J. J. CAPRI rounds 3-5 reveal promising successes and future challenges for RosettaDock. Proteins. 60, 181-186 (2005).
  59. Gray, J. J., Moughon, S., et al. Protein-protein docking with simultaneous optimization of rigid-body displacement and side-chain conformations. J. Mol. Biol. 331, 281-299 (2003).
  60. Gray, J. J., Moughon, S. E., et al. Protein-protein docking predictions for the CAPRI experiment. Proteins. 52, 118-122 (2003).
  61. Kuhlman, B., Baker, D. Native protein sequences are close to optimal for their structures. Proc. Natl Acad. Sci. U.S.A. 97, 10383-10388 (2000).
  62. Jmol: an open-source java viewer for chemical structures in 3d. , Available from: http://www.jmol.org (2013).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Conception de prot inesconception computationnelle de prot iness lection de s quencessp cificit du repliementaffinit de liaisonsoumission de mod lesensembles de mutationscontraintes biologiques