February 5th, 2014
Qui si descrive un oleodotto step-by-step per la generazione di filogenesi affidabili da nucleotidiche o aminoacidiche set di dati di sequenza. Questa guida si propone di servire i ricercatori o studenti nuovi ad analisi filogenetica.
L'obiettivo generale di questo articolo è quello di ricostruire un albero filogenetico affidabile a partire da sequenze di DNA o proteine. Ciò si ottiene identificando prima sequenze simili utilizzando programmi di esplosione presso NCBI. Il secondo passo consiste nell'allineare sequenze simili.
Successivamente, il modello di evoluzione più adatto viene determinato dall'allineamento. Il passo finale consiste nel dedurre la relazione filogenetica dalle sequenze allineate. In definitiva, la pipeline passo-passo viene utilizzata per mostrare come gli utenti possono passare dai dati di sequenza a filogenesi affidabili.
Questo metodo può aiutare a rispondere a domande chiave in diversi campi, deducendo identità e funzione da nuove sequenze. Per utilizzare la versione online dello strumento di ricerca di base per l'allineamento locale, accedere al National Center for Biotechnology Information o al server Web Blast di NNC B. Fare clic sul programma di brillamento appropriato.
Inserire una sequenza di testo formattata FASTA come quella mostrata qui nella casella di query. Fare clic sul programma di brillazione appropriato da utilizzare nella ricerca, quindi fare clic su esplosione. Per impostazione predefinita, l'output è in formato HTML e visualizza le sequenze più simili alla sequenza di testo in ingresso.
La sezione successiva illustra l'utilizzo di un eseguibile blast locale su Mac Windows. Gli utenti possono passare alla sezione successiva chiamata Eseguibili locali Blast per Macs x. Per eseguire il programma della riga di comando blast su un computer Windows, scaricare l'eseguibile di Windows appropriato dal sito Web NCBI blast.
Dopo aver installato il programma Blast, configurare la variabile di ambiente del PC come segue, fare clic sul pulsante di avvio del PC e fare clic con il pulsante destro del mouse sul computer. Quindi fare clic su Proprietà. Nella nuova finestra, seleziona le impostazioni di sistema avanzate e nella scheda avanzate del nuovo pop-up, fai clic sul pulsante delle variabili di ambiente.
Quindi, nella sezione variabili utente per utente, fai clic sul pulsante nuovo. Nel nuovo popup, aggiungi il percorso del nome della variabile e il valore della variabile mostrato qui. Successivamente, scarica un database di esplosioni preformattato, che viene aggiornato quotidianamente dal sito Web dell'NCBI o un genoma per un particolare organismo.
Quindi apri un prompt di MS DOS facendo clic su Start e digitando CMD nella barra di ricerca e passa alla cartella NCBI blast. Creare il database utilizzando il comando Make blast DB illustrato di seguito. Creare una sequenza proteica di query denominata test inserendo una sequenza di testo proteica formattata FASTA nella cartella DB.
Quindi, per identificare le sequenze più simili alla proteina in esame, interrogare il database tramite un comando di query blast P. La sezione seguente ripete queste informazioni per gli utenti Mac. Gli utenti Windows possono passare alla sezione cinque generando più allineamenti di sequenze.
Per eseguire il programma a riga di comando blast su un Mac, scaricare l'eseguibile MAC appropriato accedendo in remoto al sito N-C-B-I-F-T-P. Per fare ciò, apri il Finder e cerca il terminale nella finestra del terminale, digita l'indirizzo FTP per il sito N-C-B-I-F-T-P. Digitare anonymous per nome e password, quindi digitare CD blast slash exlash exlash exlash latest.
Elenca gli eseguibili digitando LS e scarica l'ultima versione che corrisponde ai tuoi requisiti di sistema digitando quanto segue. Ora decomprimi i file scaricati. Ora aggiungi la posizione dei binari per l'eseguibile blast al tuo percorso in modo che la shell possa cercare in questa directory.
Quando cerchi i comandi, scarica un database di esplosioni preformattato o un genoma dal sito Web dell'NCBI. Cerca nella directory dei genomi digitando CD, genomi. Quindi scarica il genoma o la sequenza di interesse come segue, quindi digita quit per uscire dal sito FTP.
Quindi, crea il database digitando l'istruzione Make Blast DB. Inserire una sequenza di query formattata FASTA nella cartella bin e interrogare il database con il comando blast P query per trovare la sequenza più simile ai dati della sequenza di test tra i programmi di allineamento di sequenze multiple o MSA comunemente usati è il tè, il caffè. Dopo aver inserito i dati della sequenza formattata fasta nella casella di interrogazione presso il sito del tè e del caffè, l'output indica residui simili dalla codifica a colori.
Un altro programma MSA comunemente usato è il clusteral MSA, che può essere scaricato come versione della riga di comando, CLUSTERAL W, o come versione grafica CLUSTERAL X per vari sistemi operativi. Quindi, caricare i dati nel programma cluster come un testo di sequenza formattato veloce selezionando la scheda file. Quindi fare clic sul pulsante delle sequenze di caricamento.
Ora passa alla scheda di allineamento e fai clic sul pulsante Completa allineamento per allineare le sequenze per un modello di evoluzione più adatto. Scarica il programma delle proteste. Una volta scaricato il protesto, fai doppio clic su protesta.
Una volta avviata la protesta, fare clic su seleziona file nella casella di allineamento per caricare i dati della sequenza. Quindi fare clic su Avvia per eseguire il programma. Dopo aver completato l'esecuzione, il programma indica il modello migliore in base ai criteri per la deduzione delle sequenze.
Dopo aver scaricato e avviato Phi ML, caricare la sequenza di input come sequenza formattata con labbro di file digitando il nome del file e PY. Quindi avvia il programma digitando y. Dopo aver scaricato un programma di inferenza bayesiana dal sito Web di Mr Bays, avviare il programma facendo clic sul file eseguibile. Quindi leggere i dati della sequenza formattata Nexus nel programma digitando execute file name dot NEX.
Successivamente, imposta il modello evolutivo e seleziona il numero di generazioni da eseguire. Dopo aver eseguito l'analisi con il comando mc mc, riepiloga gli alberi utilizzando il comando sum T per visualizzare un albero filogenetico. Scarica il programma di visualizzazione ad albero.
Come nota finale, ci sono rilasci costanti di nuovi software volti a fornire migliori allineamenti, previsioni di somiglianza o alberi filogenetici. Sebbene la panoramica in questo video riguardi i programmi più diffusi, lo spettatore è incoraggiato a esplorare opzioni aggiuntive. L'algoritmo blast esegue allineamenti locali, che cercano brevi tratti di somiglianza di sequenza.
Dopo che l'algoritmo ha cercato tutti i possibili tratti dalla sequenza di query e ha esteso al massimo queste sequenze, assembla gli allineamenti. Per ogni coppia di sequenze di query, il valore e fornisce un'indicazione della significatività statistica di una corrispondenza. Più basso è il valore E, più significativo è l'hit.
Ad esempio, un allineamento di sequenza con un valore E di 0,05 significa che la probabilità che questa corrispondenza si verifichi solo per caso è cinque su 100. Il punteggio BIT utilizza una matrice di punteggio specifica per fornire un'indicazione della qualità dell'allineamento. Più alto è il punteggio BIT, migliore è l'allineamento.
Un allineamento di sequenze multiple o MSA è un allineamento di sequenze di tre o più sequenze primarie composte da amminoacidi, DNA o RNA. L'output del caffè da tè MSA visto qui, codifica a colori residui simili. Un esempio di allineamento di sei sequenze proteiche allineate utilizzando il cluster X è mostrato qui per gli allineamenti degli amminoacidi.
La protesta del programma viene utilizzata per determinare la selezione dei modelli più adatti di sostituti degli aminoacidi. All'interno dei dati, il programma elenca i modelli man mano che vengono analizzati e mostra il miglior adattamento dopo il completamento del programma, Phi ML stima le filogenesi di massima verosimiglianza dagli allineamenti di sequenze di nucleotidi o amminoacidi. Incorpora un gran numero di modelli di sostituzione accoppiati a varie opzioni per la ricerca nello spazio della topologia ad albero.
Bayes utilizza l'inferenza CMC bayesiana attraverso una serie di modelli evolutivi per ricostruire le relazioni filogenetiche. Una volta che il programma è in esecuzione, l'avanzamento può essere visualizzato a intervalli specifici, come mostrato qui. Una volta generato un albero filogenetico, la topologia deve essere visualizzata.
In questa figura, la finestra di visualizzazione ad albero mostra un albero campione di proteine provenienti da mosca. Base. La visualizzazione ad albero include un editor ad albero che consente all'utente di spostare i rami e reindirizzare gli alberi. Durante il tentativo di eseguire questa procedura, è importante ricordarsi di leggere attentamente le guide per l'utente di ciascun programma.
Questo protocollo fornisce un punto di partenza pratico per introdurre il lettore al funzionamento di questi programmi. Tuttavia, incoraggio il lettore a giocare e a familiarizzare con le numerose impostazioni associate a ciascun programma.
View the full transcript and gain access to thousands of scientific videos
Questo articolo presenta una pipeline passo-passo per la ricostruzione di alberi filogenetici affidabili da sequenze di DNA o proteine. È progettato per ricercatori e studenti alle prime armi nell'analisi filogenetica.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.