5 février 2014
Nous décrivons ici un pipeline étape-par-étape pour générer phylogénies fiables de nucléotides ou d'acides aminés des ensembles de données de séquence. Ce guide vise à servir les chercheurs ou les étudiants nouveaux à l'analyse phylogénétique.
L’objectif général de cet article est de reconstruire un arbre phylogénétique fiable à partir de séquences d’ADN ou de protéines. Ceci est accompli en identifiant d’abord des séquences similaires à l’aide de programmes de dynamitage au NCBI. La deuxième étape consiste à aligner des séquences similaires.
Ensuite, le modèle d’évolution le mieux ajusté est déterminé à partir de l’alignement. La dernière étape consiste à déduire la relation phylogénétique à partir des séquences alignées. En fin de compte, le pipeline étape par étape est utilisé pour montrer comment les utilisateurs peuvent passer des données de séquence à des phylogénies fiables.
Cette méthode peut aider à répondre à des questions clés dans divers domaines en déduisant l’identité et la fonction de nouvelles séquences. Pour utiliser la version en ligne de l’outil de recherche d’alignement local de base ou BLAST, accédez au National Center for Biotechnology Information ou au serveur Web Blast de NNC B. Cliquez sur le programme de sablage approprié.
Entrez une séquence de texte au format FASTA telle que celle illustrée ici dans la zone de requête. Cliquez sur le programme de sablage approprié à utiliser dans la recherche, puis cliquez sur Blast (Blast). La sortie est au format HTML par défaut et affiche les séquences les plus similaires à la séquence de texte d’entrée.
La section suivante traite de l’utilisation d’un exécutable local blast sur Windows Mac. Les utilisateurs peuvent passer à la section suivante appelée Exécutables Blast Local pour Macs x. Pour exécuter le programme de ligne de commande blast sur une machine Windows, téléchargez l’exécutable Windows approprié à partir du site Web NCBI blast.
Après avoir installé le programme Blast, configurez la variable d’environnement PC comme suit, cliquez sur le bouton de démarrage du PC et cliquez avec le bouton droit de la souris sur l’ordinateur. Cliquez ensuite sur propriétés. Dans la nouvelle fenêtre, sélectionnez Paramètres système avancés, puis dans l’onglet Avancé de la nouvelle fenêtre contextuelle, cliquez sur le bouton Variables d’environnement.
Ensuite, dans la section Variables utilisateur pour l’utilisateur, cliquez sur le bouton Nouveau. Dans la nouvelle fenêtre contextuelle, ajoutez le chemin du nom de la variable et la valeur de la variable affichée ici. Ensuite, téléchargez une base de données préformatée sur les explosions, qui est mise à jour quotidiennement à partir du site Web du NCBI ou d’un génome d’un organisme particulier.
Ouvrez ensuite une invite MS DOS en cliquant sur démarrer et en tapant CMD dans la barre de recherche, puis passez au dossier NCBI blast. Créez la base de données à l’aide de la commande Make blast DB illustrée ici. Créez une séquence de protéines de requête appelée test en insérant une séquence de texte de protéine au format FASTA dans le dossier DB.
Ensuite, pour identifier les séquences les plus similaires à la protéine test, interrogez la base de données via une commande blast P query. La section suivante répète ces informations pour les utilisateurs de Mac. Les utilisateurs de Windows peuvent passer à la section cinq générant plusieurs alignements de séquence.
Pour exécuter le programme de ligne de commande blast sur un Mac, téléchargez l’exécutable MAC approprié en accédant à distance au site N-C-B-I-F-T-P. Pour ce faire, ouvrez le Finder et recherchez terminal dans la fenêtre du terminal, tapez l’adresse FTP du site N-C-B-I-F-T-P. Tapez anonymous pour le nom et le mot de passe, puis tapez CD blast slash executables slash lastest.
Listez les exécutables en tapant LS et téléchargez la dernière version qui correspond à la configuration requise pour votre système en tapant ce qui suit. Maintenant, décompressez les fichiers téléchargés. Ajoutez maintenant l’emplacement des binaires de l’exécutable blast à votre chemin d’accès afin que le shell puisse effectuer une recherche dans ce répertoire.
Lorsque vous recherchez des commandes, téléchargez une base de données de dynamitage préformatée ou un génome à partir du site Web du NCBI. Recherchez dans le répertoire des génomes en tapant CD genomes. Téléchargez ensuite le génome ou la séquence d’intérêt comme suit, puis tapez quit pour quitter le site FTP.
Ensuite, créez la base de données en tapant l’instruction Make Blast DB. Insérez une séquence de requête au format FASTA dans le dossier bin et interrogez la base de données avec la commande blast P query pour trouver la séquence la plus similaire aux données de la séquence de test parmi les programmes d’alignement de séquences multiples ou MSA couramment utilisés est le thé café. Après avoir saisi des données de séquence au format fasta dans la boîte de requête sur le site du café thé, la sortie indique des résidus similaires par le codage couleur.
Un autre programme MSA couramment utilisé est le MSA clusteral, qui peut être téléchargé en tant que version de ligne de commande, CLUSTERAL W, ou une version graphique CLUSTERAL X pour divers systèmes d’exploitation. Ensuite, chargez les données dans le programme clusteral aussi rapidement qu’un texte de séquence formaté en sélectionnant l’onglet fichier. Cliquez ensuite sur le bouton de chargement des séquences.
Passez maintenant à l’onglet d’alignement et cliquez sur le bouton Terminer l’alignement pour aligner les séquences pour un modèle d’évolution le mieux adapté. Téléchargez le programme de la manifestation. Une fois la protestation téléchargée, double-cliquez sur protestation.
Une fois la protestation lancée, cliquez sur sélectionner un fichier dans la boîte d’alignement pour charger les données de séquence. Cliquez ensuite sur démarrer pour exécuter le programme. Une fois l’exécution terminée, le programme indique le meilleur modèle en fonction des critères d’inférence de séquences.
Après avoir téléchargé et lancé Phi ML, chargez la séquence d’entrée en tant que séquence de fichier au format lip en tapant le nom du fichier et PY. Lancez ensuite le programme en tapant y. Après avoir téléchargé un programme d’inférence bayésienne à partir du site Web de Mr Bays, démarrez le programme en cliquant sur le fichier exécutable. Ensuite, lisez les données de séquence formatées Nexus dans le programme en tapant le nom du fichier d’exécution point NEX.
Ensuite, définissez le modèle évolutif et sélectionnez le nombre de générations à exécuter. Après avoir exécuté l’analyse avec la commande mc mc, résumez les arbres à l’aide de la commande sum T pour afficher un arbre phylogénétique. Téléchargez le programme d’arborescence.
Enfin, il y a des versions constantes de nouveaux logiciels visant à fournir de meilleurs alignements, des prédictions de similitude ou des arbres phylogénétiques. Bien que l’aperçu de cette vidéo couvre les programmes populaires, le spectateur est encouragé à explorer des options supplémentaires. L’algorithme de dynamitage effectue des alignements locaux, ce qui permet de rechercher de courtes périodes de similitude de séquence.
Une fois que l’algorithme a recherché tous les étirements possibles de la séquence de requête et étendu au maximum ces séquences, il assemble ensuite les alignements. Pour chaque paire de séquences de requête, la valeur e donne une indication de la signification statistique d’une correspondance. Plus la valeur E est faible, plus l’impact est important.
Par exemple, un alignement de séquence avec une valeur E de 0,05 signifie que la probabilité que cette correspondance se produise par hasard seul est de cinq sur 100. Le score BIT utilise une matrice de notation spécifique pour fournir une indication de la qualité de l’alignement. Plus le score BIT est élevé, meilleur est l’alignement.
Un alignement de séquences multiples ou MSA est un alignement de séquences de trois séquences primaires ou plus composées d’acides aminés, d’ADN ou d’ARN. La sortie du café au thé MSA vu ici, code couleur des résidus similaires. Un exemple d’alignement de six séquences de protéines alignées à l’aide du cluster X est montré ici pour les alignements d’acides aminés.
Le programme de protestation est utilisé pour déterminer la sélection des modèles les mieux adaptés de remplacement des acides aminés. Dans les données, le programme répertorie les modèles au fur et à mesure de leur analyse et affiche le meilleur ajustement après l’achèvement du programme, Phi ML estime les phylogénies de vraisemblance maximale à partir d’alignements de séquences de nucléotides ou d’acides aminés. Il intègre un grand nombre de modèles de substitution couplés à diverses options pour rechercher l’espace de topologie de l’arbre.
M. Bayes utilise l’inférence CMC bayésienne à travers un certain nombre de modèles évolutifs pour reconstruire les relations phylogénétiques. Une fois le programme en cours d’exécution, la progression peut être visualisée à des intervalles spécifiques, comme indiqué ici. Une fois qu’un arbre phylogénétique est généré, la topologie doit être visualisée.
Dans cette figure, la fenêtre d’arborescence affiche un échantillon d’arbre de protéines de fly. Base. L’arborescence comprend un éditeur d’arborescence qui permet à l’utilisateur de déplacer des branches et de réacheminer des arbres. Lors de cette procédure, il est important de ne pas oublier de lire attentivement les guides d’utilisation de chaque programme.
Ce protocole fournit un point de départ pratique pour présenter au lecteur le fonctionnement de ces programmes. Cependant, j’encourage le lecteur à jouer et à se familiariser avec les nombreux paramètres associés à chaque programme.
Consultez la transcription complète et accédez à des milliers de vidéos scientifiques
Cet article présente un pipeline étape par étape pour reconstruire des arbres phylogénétiques fiables à partir de séquences d'ADN ou de protéines. Il est conçu pour les chercheurs et les étudiants nouveaux dans l'analyse phylogénétique.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.