5 febbraio 2014
Qui si descrive un oleodotto step-by-step per la generazione di filogenesi affidabili da nucleotidiche o aminoacidiche set di dati di sequenza. Questa guida si propone di servire i ricercatori o studenti nuovi ad analisi filogenetica.
L'obiettivo generale di questo articolo è ricostruire un albero filogenetico affidabile a partire da sequenze di DNA o proteiche. Questo risultato si ottiene innanzitutto identificando sequenze simili mediante programmi blast presso il NCBI. Il secondo passaggio consiste nell'allineare le sequenze simili.
Successivamente, il modello di evoluzione che meglio si adatta viene determinato allineando le sequenze. L'ultimo passaggio consiste nel dedurre la relazione filogenetica a partire dalle sequenze allineate. In definitiva, la procedura passo dopo passo viene utilizzata per mostrare come gli utenti possano passare da dati di sequenza a filogenie affidabili.
Questo metodo può contribuire a rispondere a domande fondamentali in diversi campi, inferendo identità e funzione di sequenze nuove. Per utilizzare la versione online dello strumento di ricerca allineamento locale di base, o blast, accedere al server web Blast del National Center for Biotechnology Information o NNC B'S. Fare clic sul programma blast appropriato.
Inserire una sequenza di testo in formato FASTA, come quella mostrata qui, nella casella di ricerca. Fare clic sul programma blast appropriato da utilizzare per la ricerca, quindi fare clic su blast. L'output è in formato HTML per impostazione predefinita e mostra le sequenze più simili alla sequenza di testo inserita.
La sezione successiva tratta dell'utilizzo di un eseguibile blast locale su Windows e Mac. Gli utenti possono passare direttamente alla sezione successiva intitolata Eseguibili Blast locali per Mac x. Per eseguire il programma blast da riga di comando su una macchina Windows, scaricare l'eseguibile Windows appropriato dal sito web NCBI blast.
Dopo aver installato il programma Blast, configurare la variabile d'ambiente del PC come segue: fare clic sul pulsante di avvio del PC e fare clic con il tasto destro del mouse su Computer. Quindi fare clic su Proprietà. Nella nuova finestra, selezionare Impostazioni avanzate del sistema e, nella scheda Avanzate della nuova finestra di pop-up, fare clic sul pulsante Variabili d'ambiente.
Quindi, nella sezione delle variabili utente, fare clic sul pulsante nuovo. Nella nuova finestra popup, aggiungere il nome della variabile path e il valore della variabile mostrato qui. Successivamente, scaricare un database blast preformattato, aggiornato quotidianamente dal sito web del NCBI, oppure un genoma per un organismo specifico.
Quindi aprire un prompt MS DOS facendo clic su Start e digitando CMD nella barra di ricerca, quindi passare alla cartella NCBI blast. Creare il database utilizzando il comando Make blast DB mostrato qui. Creare una sequenza proteica di interrogazione denominata test inserendo una sequenza di testo proteico in formato FASTA nella cartella del database.
Quindi, per identificare le sequenze più simili alla proteina in esame, interrogare il database mediante un comando di ricerca blast P. La sezione seguente ripete queste informazioni per gli utenti Mac. Gli utenti Windows possono passare direttamente alla sezione cinque, dedicata alla generazione di allineamenti multipli di sequenze.
Per eseguire il programma da riga di comando blast su un Mac, scaricare l'eseguibile MAC appropriato accedendo in remoto al sito N-C-B-I-F-T-P. A tale scopo, aprire Finder e cercare terminale nella finestra del terminale, digitare l'indirizzo FTP per il sito N-C-B-I-F-T-P. Digitare anonymous come nome utente e password, quindi digitare CD blast slash executables slash latest.
Elencare gli eseguibili digitando LS e scaricare l'ultima versione compatibile con i requisiti del sistema digitando quanto segue. A questo punto, decomprimere i file scaricati. Aggiungere quindi il percorso dei file binari dell'eseguibile blast al proprio path in modo che la shell possa cercare in questa directory.
Quando si cercano comandi, scaricare un database blast preformattato o un genoma dal sito web del NCBI. Cercare nella directory dei genomi digitando CD genomes. Successivamente, scaricare il genoma o la sequenza di interesse come segue, quindi digitare quit per uscire dal sito FTP.
Successivamente, crea il database digitando l'istruzione Make Blast DB. Inserisci una sequenza query in formato FASTA nella cartella bin e interroga il database con il comando blast P query per trovare la sequenza più simile ai dati della sequenza test; tra i programmi comunemente usati per l'allineamento multiplo di sequenze o MSA, vi è tea coffee. Dopo aver inserito i dati della sequenza in formato fasta nel campo query sul sito tea coffee, l'output indica i residui simili mediante un codice a colori.
Un altro programma di MSA comunemente utilizzato è clusteral MSA, scaricabile come versione da riga di comando, CLUSTERAL W, o come versione grafica CLUSTERAL X per diversi sistemi operativi. Successivamente, caricare i dati nel programma clusteral come testo di sequenza in formato fasta selezionando la scheda file. Quindi fare clic sul pulsante per caricare le sequenze.
Ora passare alla scheda allinea e fare clic sul pulsante esegui allineamento completo per allineare le sequenze in un modello di evoluzione migliore. Scaricare il programma protest. Una volta scaricato protest, fare doppio clic su protest.
Una volta avviata la procedura, fare clic su "seleziona file" nella casella di allineamento per caricare i dati della sequenza. Quindi fare clic su "inizia" per eseguire il programma. Al termine dell'esecuzione, il programma indica il modello migliore in base ai criteri per l'inferenza delle sequenze.
Dopo aver scaricato ed eseguito Phi ML, caricare la sequenza di input come sequenza nel formato file lip digitando il nome del file e PY. Avviare quindi il programma digitando y. Dopo aver scaricato un programma di inferenza bayesiana dal sito web Mr Bays, avviare il programma facendo clic sul file eseguibile. Quindi leggere i dati di sequenza nel formato Nexus all'interno del programma digitando execute nome_file punto NEX.
Successivamente, impostare il modello evolutivo e selezionare il numero di generazioni da eseguire. Dopo aver eseguito l'analisi con il comando mc mc, riassumere gli alberi utilizzando il comando sum T per visualizzare un albero filogenetico. Scaricare il programma per la visualizzazione degli alberi.
Come nota finale, vengono costantemente rilasciati nuovi software volti a fornire allineamenti migliori, previsioni di similarità o alberi filogenetici più accurati. Sebbene questa video presentazione abbia trattato programmi diffusi, si incoraggia lo spettatore a esplorare ulteriori opzioni. L'algoritmo blast esegue allineamenti locali, che cercano brevi tratti di similarità nella sequenza.
Dopo che l'algoritmo ha cercato tutti i possibili tratti della sequenza in interrogazione ed esteso al massimo queste sequenze, assembla quindi gli allineamenti. Per ogni coppia di sequenze in interrogazione, il valore e fornisce un'indicazione del significato statistico di un riscontro. Più basso è il valore E, più significativo è il riscontro.
Ad esempio, un allineamento di sequenza con un valore E di 0,05 indica che la probabilità che questo riscontro avvenga per caso è di cinque su cento. Il punteggio BIT utilizza una specifica matrice di punteggio per fornire un'indicazione della qualità dell'allineamento. Maggiore è il punteggio BIT, migliore sarà l'allineamento.
Allineamento multiplo di sequenze o MSA è un allineamento di sequenze di tre o più sequenze primarie composte da amminoacidi, DNA o RNA. L'output dell'MSA tea coffee mostrato qui codifica con colori i residui simili. Qui viene mostrato un esempio di allineamento di sei sequenze proteiche allineate mediante cluster X per allineamenti di amminoacidi.
Il programma protest viene utilizzato per determinare la selezione dei modelli di sostituzione degli amminoacidi che meglio si adattano ai dati. Durante l'analisi, il programma elenca i modelli man mano che vengono esaminati e visualizza il modello migliore al termine dell'esecuzione. Phi ML stima le filogenesi mediante il metodo della massima verosimiglianza a partire da allineamenti di sequenze nucleotidiche o amminoacidiche. Il programma incorpora un ampio numero di modelli di sostituzione abbinati a diverse opzioni per la ricerca dello spazio delle topologie dell'albero filogenetico.
Mr.Bayes utilizza l'inferenza bayesiana CMC attraverso diversi modelli evolutivi per ricostruire le relazioni filogenetiche. Una volta avviato il programma, l'andamento può essere visualizzato a intervalli specifici come mostrato qui. Dopo che viene generato un albero filogenetico, la topologia deve essere visualizzata.
In questa figura, la finestra della vista ad albero mostra un albero campione di proteine provenienti da fly.Base. La vista ad albero include un editor di alberi che consente all'utente di spostare i rami e ripercorrere gli alberi. Durante il tentativo di questa procedura, è importante ricordare di leggere attentamente le guide utente di ciascun programma.
Questo protocollo fornisce un punto di partenza pratico per illustrare al lettore il funzionamento di questi programmi. Tuttavia, incoraggio il lettore a sperimentare e a prendere familiarità con le numerose impostazioni associate a ciascun programma.
Visualizza la trascrizione completa e accedi a migliaia di video scientifici
Questo articolo presenta una procedura passo dopo passo per ricostruire alberi filogenetici affidabili a partire da sequenze di DNA o proteiche. È stato progettato per ricercatori e studenti alle prime armi con l'analisi filogenetica.
L'analisi filogenetica consente la validazione del bersaglio e la riduzione dei rischi meccanicistici nella fase iniziale della scoperta, inferendo l'identità funzionale e le relazioni evolutive di sequenze nuove. Questa procedura supporta la fiducia predittiva nell'identificazione dei candidati principali chiarificando il contesto biologico e riducendo l'ambiguità nei test delle ipotesi sui bersagli. Fornisce un collegamento traslazionale dai dati di sequenza all'annotazione funzionale, orientando la selezione del portafoglio e le decisioni di avanzamento corrette in base al rischio.
Il metodo si integra nel percorso di scoperta, dall'identificazione del bersaglio all'ottimizzazione del composto leader, consentendo la verifica delle ipotesi, la riduzione del rischio biologico e la modellizzazione predittiva basata su relazioni evolutive.