5 de fevereiro de 2014
Aqui nós descrevemos um gasoduto passo-a-passo para a geração de filogenias confiáveis de nucleotídeos ou aminoácidos conjuntos de dados de seqüência. Este guia destina-se a servir os investigadores ou alunos novos para a análise filogenética.
O objetivo geral deste artigo é reconstruir uma árvore filogenética confiável a partir de sequências de DNA ou proteínas. Isso é feito identificando primeiro sequências semelhantes usando programas de blast no NCBI. O segundo passo é alinhar sequências semelhantes.
Em seguida, o modelo de evolução de melhor ajuste é determinado a partir do alinhamento. A etapa final é inferir a relação filogenética a partir das sequências alinhadas. Por fim, o pipeline passo a passo é usado para mostrar como os usuários podem ir de dados de sequência para filogenias confiáveis.
Este método pode ajudar a responder a questões-chave em diversos campos, inferindo identidade e função para novas sequências. Para usar a versão online da ferramenta básica de pesquisa de alinhamento local ou blast, navegue até o National Center for Biotechnology Information ou o Blast Web Server do NNC B. Clique no programa de explosão apropriado.
Insira uma sequência de texto formatada em FASTA, como a mostrada aqui, na caixa de consulta. Clique no programa de explosão apropriado para uso na pesquisa e, em seguida, clique em explosão. A saída está no formato HTML por padrão e exibe as sequências mais semelhantes à sequência de texto de entrada.
A próxima seção aborda o uso de um executável blast local no Windows Mac. Os usuários podem pular para a seção a seguir chamada Executáveis Blast Local para Macs x. Para executar o programa de linha de comando blast em uma máquina Windows, baixe o executável apropriado do Windows no site do NCBI blast.
Depois de instalar o programa Blast, configure a variável de ambiente do PC da seguinte forma, clique no botão Iniciar do PC e clique com o botão direito do mouse em computador. Em seguida, clique em propriedades. Na nova janela, selecione configurações avançadas do sistema e, na guia avançada do novo pop-up, clique no botão variáveis de ambiente.
Em seguida, na seção variáveis de usuário para usuário, clique no botão novo. No novo pop-up, adicione o caminho do nome da variável e o valor da variável mostrado aqui. Em seguida, baixe um banco de dados de blastos pré-formatado, que é atualizado diariamente no site do NCBI ou em um genoma de um organismo específico.
Em seguida, abra um prompt do MS DOS clicando em iniciar e digitando CMD na barra de pesquisa e mude para a pasta NCBI blast. Crie o banco de dados usando o comando Make blast DB mostrado aqui. Crie uma sequência de proteína de consulta chamada test inserindo uma sequência de texto de proteína formatada em FASTA na pasta DB.
Em seguida, para identificar as sequências mais semelhantes à proteína de teste, interrogue o banco de dados por meio de um comando de consulta blast P. A seção a seguir repete essas informações para usuários de Mac. Os usuários do Windows podem pular para a seção cinco, gerando vários alinhamentos de sequência.
Para executar o programa de linha de comando blast em um Mac, baixe o executável MAC apropriado acessando remotamente o site N-C-B-I-F-T-P. Para fazer isso, abra o localizador e procure o terminal na janela do terminal, digite o endereço FTP do site NCBIFTP. Digite anônimo para nome e senha e, em seguida, digite CD blast slash executables slash latest.
Liste os executáveis digitando LS e baixe a versão mais recente que corresponda aos requisitos do sistema digitando o seguinte. Agora, descompacte os arquivos baixados. Agora adicione a localização dos binários para o executável blast ao seu caminho para que o shell possa pesquisar por meio desse diretório.
Ao procurar comandos, baixe um banco de dados de blast pré-formatado ou um genoma do site do NCBI. Pesquise o diretório de genomas digitando genomas de CD. Em seguida, baixe o genoma ou a sequência de interesse da seguinte maneira e digite quit para sair do site FTP.
Em seguida, crie o banco de dados digitando a instrução Make Blast DB. Insira uma sequência de consulta formatada FASTA na pasta bin e interrogue o banco de dados com o comando blast P query para encontrar a sequência mais semelhante aos dados da sequência de teste entre os programas de alinhamento de sequência múltipla ou MSA comumente usados é chá café. Depois de inserir dados de sequência formatados fasta na caixa de consulta no site de chá e café, a saída indica resíduos semelhantes pelo código de cores.
Outro programa MSA comumente usado é o clusteral MSA, que pode ser baixado como uma versão de linha de comando, CLUSTERAL W, ou uma versão gráfica CLUSTERAL X para vários sistemas operacionais. Em seguida, carregue os dados no programa clusteral com a mesma rapidez de um texto de sequência formatado selecionando a guia arquivo. Em seguida, clique no botão carregar sequências.
Agora mude para a guia alinhar e clique no botão fazer alinhamento completo para alinhar as sequências para um modelo de evolução de melhor ajuste. Baixe o programa de protesto. Depois que o protesto for baixado, clique duas vezes em protesto.
Assim que o protesto for iniciado, clique em selecionar arquivo na caixa de alinhamento para carregar os dados da sequência. Em seguida, clique em iniciar para executar o programa. Depois de concluir a execução, o programa indica o melhor modelo com base nos critérios para inferir sequências.
Depois de baixar e iniciar o Phi ML, carregue a sequência de entrada como uma sequência formatada em lábio de arquivo digitando o nome do arquivo e o PY. Em seguida, inicie o programa digitando y. Depois de baixar um programa de inferência bayesiana do site do Mr Bays, inicie o programa clicando no arquivo executável. Em seguida, leia os dados de sequência formatados do Nexus no programa digitando execute file name dot NEX.
Em seguida, defina o modelo evolutivo e selecione o número de gerações a serem executadas. Depois de executar a análise com o comando mc mc, resuma as árvores usando o comando sum T para visualizar uma árvore filogenética. Baixe o programa de visualização em árvore.
Como nota final, há lançamentos constantes de novos softwares destinados a fornecer melhores alinhamentos, previsões de similaridade ou árvores filogenéticas. Embora a visão geral neste vídeo tenha abordado programas populares, o espectador é incentivado a explorar opções adicionais. O algoritmo de explosão executa alinhamentos locais, que procuram trechos curtos de similaridade de sequência.
Depois que o algoritmo pesquisou todos os trechos possíveis da sequência de consulta e estendeu ao máximo essas sequências, ele monta alinhamentos. Para cada par de sequência de consulta, o valor e fornece uma indicação da significância estatística de uma correspondência. Quanto menor o valor E, mais significativo é o acerto.
Por exemplo, um alinhamento de sequência com um valor E de 0,05 significa que a probabilidade de essa correspondência ocorrer apenas por acaso é de cinco em 100. A pontuação BIT usa uma matriz de pontuação específica para fornecer uma indicação de quão bom é o alinhamento. Quanto maior a pontuação do BIT, melhor o alinhamento.
Um alinhamento de sequência múltipla ou MSA é um alinhamento de sequência de três ou mais sequências primárias compostas de aminoácidos, DNA ou RNA. A saída do café de chá MSA visto aqui, codifica por cores resíduos semelhantes. Um alinhamento de amostra de seis sequências de proteínas alinhadas usando o cluster X é mostrado aqui para alinhamentos de aminoácidos.
O protesto do programa é usado para determinar a seleção dos modelos de reposição de aminoácidos mais adequados. Dentro dos dados, o programa lista os modelos à medida que estão sendo analisados e exibe o melhor ajuste após a conclusão do programa, o Phi ML estima as filogenias de máxima verossimilhança a partir de alinhamentos de sequências de nucleotídeos ou aminoácidos. Ele incorpora um grande número de modelos de substituição acoplados a várias opções para pesquisar o espaço de topologia em árvore.
O Sr. Bayes utiliza a inferência CMC bayesiana em vários modelos evolutivos para reconstruir as relações filogenéticas. Depois que o programa estiver em execução, o progresso poderá ser visualizado em intervalos específicos, conforme mostrado aqui. Uma vez que uma árvore filogenética é gerada, a topologia precisa ser visualizada.
Nesta figura, a janela de visualização em árvore exibe uma árvore de amostra de proteínas da mosca. Base. A visualização em árvore inclui um editor de árvore que permite ao usuário mover galhos e redirecionar árvores. Ao tentar este procedimento, é importante lembrar de ler atentamente os guias do usuário de cada programa.
Este protocolo fornece um ponto de partida prático para apresentar ao leitor como esses programas funcionam. No entanto, encorajo o leitor a brincar e se familiarizar com as muitas configurações associadas a cada programa.
Veja a transcrição completa e aceda a milhares de vídeos científicos
Este artigo apresenta um pipeline passo a passo para reconstruir árvores filogenéticas confiáveis a partir de sequências de DNA ou proteínas. Ele é projetado para pesquisadores e estudantes que estão começando na análise filogenética.
Phylogenetic analysis enables target validation and mechanistic de-risking in early discovery by inferring functional identity and evolutionary relationships of novel sequences. This pipeline supports predictive confidence in lead identification by clarifying biological context and reducing ambiguity in target hypothesis testing. It provides a translational bridge from sequence data to functional annotation, informing portfolio triage and risk-adjusted advancement decisions.
The method integrates into the discovery continuum from target identification through lead optimization, enabling hypothesis testing, biological de-risking, and predictive modeling based on evolutionary relationships.