5 de fevereiro de 2014
Aqui nós descrevemos um gasoduto passo-a-passo para a geração de filogenias confiáveis de nucleotídeos ou aminoácidos conjuntos de dados de seqüência. Este guia destina-se a servir os investigadores ou alunos novos para a análise filogenética.
O objetivo geral deste artigo é reconstruir uma árvore filogenética confiável a partir de sequências de DNA ou proteínas. Isso é realizado primeiramente identificando sequências semelhantes usando programas blast no NCBI. O segundo passo é alinhar as sequências semelhantes.
Em seguida, o modelo de evolução com melhor ajuste é determinado a partir do alinhamento. O passo final é inferir a relação filogenética a partir das sequências alinhadas. Em última análise, o fluxo de trabalho em etapas é utilizado para demonstrar como os usuários podem partir de dados de sequência para obter filogenias confiáveis.
Este método pode ajudar a responder perguntas fundamentais em diversas áreas ao inferir identidade e função de sequências novas. Para utilizar a versão online da ferramenta básica de busca por alinhamento local ou blast, acesse o servidor web do blast do Centro Nacional de Informação Biotecnológica ou NNC B'S. Clique no programa blast apropriado.
Digite uma sequência de texto no formato FASTA, como a mostrada aqui, na caixa de consulta. Clique no programa BLAST apropriado para uso na pesquisa e, em seguida, clique em BLAST. A saída é exibida em formato HTML por padrão e apresenta as sequências mais semelhantes à sequência de texto inserida.
A próxima seção aborda o uso de um executável local do blast no Windows e Mac. Os usuários podem pular para a seção seguinte chamada Executáveis locais do Blast para Macs x. Para executar o programa de linha de comando blast em uma máquina Windows, baixe o executável apropriado para Windows no site do blast do NCBI.
Após instalar o programa Blast, configure a variável de ambiente do PC da seguinte forma: clique no botão iniciar do PC e clique com o botão direito no computador. Em seguida, clique em propriedades. Na nova janela, selecione configurações avançadas do sistema e, na guia avançado da nova janela pop-up, clique no botão variáveis de ambiente.
Em seguida, na seção de variáveis de usuário, clique no botão novo. Na nova janela pop-up, adicione o nome da variável como path e o valor da variável conforme mostrado aqui. Em seguida, faça o download de um banco de dados blast pré-formatado, que é atualizado diariamente no site do NCBI, ou de um genoma para um organismo específico.
Em seguida, abra um prompt do MS DOS clicando em iniciar e digitando CMD na barra de pesquisa, e altere para a pasta NCBI blast. Crie a base de dados utilizando o comando Make blast DB mostrado aqui. Crie uma sequência proteica de consulta chamada test inserindo uma sequência proteica em formato FASTA na pasta DB.
Em seguida, para identificar as sequências mais semelhantes à proteína-teste, consulte o banco de dados por meio de um comando de consulta blast P. A seção a seguir repete essas informações para usuários de Mac. Usuários de Windows podem pular para a seção cinco, sobre a geração de alinhamentos múltiplos de sequências.
Para executar o programa da linha de comando blast em um Mac, baixe o executável apropriado para MAC acessando remotamente o site do N-C-B-I-F-T-P. Para fazer isso, abra o Finder e procure por Terminal na janela do Terminal, digite o endereço FTP do site do N-C-B-I-F-T-P. Digite anonymous como nome e senha, e depois digite CD blast barra executables barra latest.
Liste os executáveis digitando LS e baixe a versão mais recente que corresponda aos requisitos do seu sistema digitando o seguinte. Agora, descompacte os arquivos baixados. Em seguida, adicione o local dos binários do executável blast ao seu caminho, para que o shell possa procurar neste diretório.
Ao procurar comandos, faça o download de um banco de dados blast pré-formatado ou de um genoma do site do NCBI. Acesse o diretório de genomas digitando CD genomes. Em seguida, faça o download do genoma ou da sequência de interesse conforme descrito a seguir e depois digite quit para sair do site FTP.
Em seguida, crie o banco de dados digitando o comando Make Blast DB. Insira uma sequência de consulta formatada em FASTA na pasta bin e consulte o banco de dados com o comando de consulta blast P para encontrar a sequência mais semelhante aos dados da sequência teste. Entre os programas comumente usados de alinhamento múltiplo de sequências ou AMS, destaca-se o tea coffee. Após inserir os dados da sequência formatados em FASTA na caixa de consulta no site do tea coffee, a saída indica os resíduos semelhantes por meio de codificação por cores.
Outro programa de MSA frequentemente utilizado é o clusteral MSA, que pode ser baixado como uma versão de linha de comando, CLUSTERAL W, ou como uma versão gráfica, CLUSTERAL X, para diversos sistemas operacionais. Em seguida, carregue os dados no programa clusteral como um texto de sequência formatado em formato FASTA, selecionando a aba de arquivo. Depois, clique no botão carregar sequências.
Agora, alterne para a aba alinhar e clique no botão fazer alinhamento completo para alinhar as sequências segundo um modelo de evolução de melhor ajuste. Baixe o programa Protest. Após o download do Protest, clique duas vezes sobre ele.
Uma vez iniciado o protesto, clique em selecionar arquivo na caixa de alinhamento para carregar os dados de sequência. Em seguida, clique em iniciar para executar o programa. Após concluir a execução, o programa indica o melhor modelo com base nos critérios para inferir sequências.
Após baixar e iniciar o Phi ML, carregue a sequência de entrada como uma sequência formatada em arquivo lip digitando o nome do arquivo e PY. Em seguida, inicie o programa digitando y. Após baixar um programa de inferência bayesiana do site Mr Bays, inicie o programa clicando no arquivo executável. Depois, leia os dados de sequência no formato Nexus no programa digitando execute nome_do_arquivo ponto NEX.
Em seguida, defina o modelo evolutivo e selecione o número de gerações para execução. Após realizar a análise com o comando mc mc, resuma as árvores utilizando o comando sum T para visualizar uma árvore filogenética. Faça o download do programa para visualização da árvore.
Como observação final, há lançamentos constantes de novos softwares destinados a fornecer melhores alinhamentos, previsões de similaridade ou árvores filogenéticas. Embora a visão geral deste vídeo tenha abrangido programas populares, o espectador é incentivado a explorar opções adicionais. O algoritmo blast realiza alinhamentos locais, que buscam trechos curtos de similaridade de sequência.
Depois que o algoritmo procurou todos os trechos possíveis na sequência da consulta e estendeu ao máximo essas sequências, ele então monta os alinhamentos. Para cada par de sequências de consulta, o valor de e indica a significância estatística de uma correspondência. Quanto menor o valor de E, mais significativo é o acerto.
Por exemplo, um alinhamento de sequência com um valor E de 0,05 significa que a probabilidade de esse correspondência ocorrer por acaso é de cinco em 100. O escore BIT utiliza uma matriz de pontuação específica para indicar quão bom é o alinhamento. Quanto maior o escore BIT, melhor será o alinhamento.
O alinhamento múltiplo de sequências ou AMS é um alinhamento de sequências de três ou mais sequências primárias compostas por aminoácidos, DNA ou RNA. A saída do AMS chá café visto aqui codifica em cores os resíduos semelhantes. Um alinhamento amostra de seis sequências proteicas alinhadas usando o Cluster X é mostrado aqui para alinhamentos de aminoácidos.
O programa protest é usado para determinar a seleção dos modelos de substituição de aminoácidos que melhor se ajustam. Nos dados, o programa lista os modelos conforme são analisados e exibe o modelo com melhor ajuste após a conclusão do programa. Phi ML estima filogenias de máxima verossimilhança a partir de alinhamentos de sequências de nucleotídeos ou aminoácidos. Ele incorpora um grande número de modelos de substituição associados a várias opções para explorar o espaço de topologias de árvores.
O Mr.Bayes utiliza inferência bayesiana CMC em diversos modelos evolutivos para reconstruir relações filogenéticas. Uma vez que o programa está em execução, o progresso pode ser visualizado em intervalos específicos, conforme mostrado aqui. Após a geração de uma árvore filogenética, é necessário visualizar a topologia.
Nesta figura, a janela de visualização em árvore exibe uma árvore de exemplo de proteínas do fly.Base. A visualização em árvore inclui um editor de árvores que permite ao usuário mover ramificações e reorganizar as árvores. Ao realizar este procedimento, é importante lembrar-se de ler atentamente os guias do usuário para cada programa.
Este protocolo fornece um ponto de partida prático para apresentar ao leitor como esses programas funcionam. No entanto, encorajo o leitor a experimentar e familiarizar-se com as diversas configurações associadas a cada programa.
Veja a transcrição completa e aceda a milhares de vídeos científicos
Este artigo apresenta um fluxo de trabalho passo a passo para reconstruir árvores filogenéticas confiáveis a partir de sequências de DNA ou proteínas. Foi elaborado para pesquisadores e estudantes novos na análise filogenética.
A análise filogenética permite a validação de alvos e a redução de riscos mecanicistas na fase inicial de descoberta, inferindo identidade funcional e relações evolutivas de sequências novas. Este fluxo de trabalho apoia a confiança preditiva na identificação de candidatos principais ao esclarecer o contexto biológico e reduzir a ambiguidade nos testes de hipóteses sobre alvos. Ele fornece uma ponte translacional entre dados de sequência e anotação funcional, orientando a triagem de portfólios e decisões de avanço ajustadas ao risco.
O método se integra ao continuum de descoberta, desde a identificação do alvo até a otimização do composto inicial, permitindo testes de hipóteses, desvio biológico de riscos e modelagem preditiva com base em relações evolutivas.