3 de novembro de 2011
Diretrizes para computador baseado caracterização estrutural e funcional da proteína usando o pipeline I-TASSER é descrito. A partir de seqüência de proteína de consulta, os modelos 3D são gerados usando vários alinhamentos threading e iterativo simulações de montagem estrutural. Inferências funcionais são posteriormente elaborado com base em correspondências às proteínas com estrutura conhecida e funções.
O objetivo deste procedimento é prever computacionalmente estruturas tridimensionais e a função biológica de moléculas proteicas a partir de suas sequências de aminoácidos. Isso é realizado primeiramente prevendo a estrutura secundária das proteínas por meio de aprendizado de máquina. As sequências e a estrutura secundária prevista são então comparadas com as estruturas determinadas na biblioteca PDB para identificar os melhores modelos estruturais possíveis.
Este procedimento é chamado de alinhamento. Após o procedimento de alinhamento, o programa IT AER dividirá os modelos em fragmentos com base nos alinhamentos das sequências dos modelos e, em seguida, remontará os fragmentos em modelos completos na terceira etapa. Modelos atômicos completos são construídos por refinamentos em nível atômico para otimizar as redes de ligações de hidrogênio e remover sobreposições estéricas.
O último passo do procedimento é identificar a função biológica das proteínas comparando as estruturas preditas com proteínas de função conhecida na biblioteca de funções. A principal vantagem do ITER em relação aos métodos existentes de modelagem estrutural é a abordagem inerente de montagem de fragmentos estruturais, que pode consistentemente direcionar os alinhamentos por threading para estados próximos ao nativo. Esses modelos estruturais de alta qualidade também constituem a base para anotações funcionais precisas baseadas em estrutura, promovendo o uso do ITER na comunidade científica.
O nosso laboratório disponibilizou um site onde as sequências proteicas podem ser submetidas ao iter. Este site atua como um núcleo central por meio do qual usuários de todo o mundo podem registrar uma interface com um cluster de computadores, que gerencia e executa simulações ITER. Uma tarefa de simulação ITER consiste em mais de uma dúzia de sub-simulações menores.
Essas simulações, quando executadas em um único computador com um único núcleo de processador, podem levar mais de cem horas. O cluster de computadores do laboratório Zang distribui essas sub-simulações por centenas de computadores e é capaz de executar mais de 2000 simulações. Em paralelo com o nosso cluster de computadores, somos capazes de concluir centenas de simulações I taster por dia.
Apesar dessa capacidade, muito trabalho ainda precisa ser feito para otimizar o sistema e minimizar o tempo de espera para os usuários online do IT AER. Para iniciar o experimento de modelagem de estrutura e função, acesse a página da web do IT AER. Os endereços URL de todas as páginas web relevantes discutidas aqui podem ser encontrados no protocolo escrito.
Copie e cole a sequência de aminoácidos no formulário fornecido ou faça upload direto da sequência clicando no botão de navegação. Forneça um endereço de e-mail e um nome para a tarefa. Os usuários podem opcionalmente especificar restrições externas de contato entre resíduos ou distâncias.
Adicione um modelo adicional ou exclua algumas proteínas modelo durante o processo de modelagem da estrutura. Para enviar a sequência, clique no botão executar o taser. Verifique o status do trabalho enviado visitando a página da fila do IT taser.
Clique na guia de pesquisa e utilize o número de ID do trabalho ou a sequência de consulta para procurar o trabalho submetido. Após a conclusão da modelagem da estrutura e função, um e-mail de notificação contendo uma imagem das estruturas previstas e um link da web será enviado para o endereço de e-mail fornecido. Clique neste link para visualizar e baixar os resultados.
Inicie a análise da estrutura examinando a predição da estrutura secundária, exibida como H para hélice alfa, S para fita beta ou C para bobina. Além disso, considere a pontuação de confiança da predição para cada resíduo. Procure regiões com estruturas longas de predições regulares de estrutura secundária para estimar a região central da proteína.
A classe estrutural da proteína também pode ser analisada com base na distribuição dos elementos de estrutura secundária. Visualize a acessibilidade ao solvente prevista para determinar as regiões enterradas e expostas ao solvente. Nos valores da consulta, a acessibilidade ao solvente prevista varia de uma pontuação de zero para um resíduo enterrado a uma pontuação de nove para um resíduo exposto.
Regiões contendo principalmente resíduos enterrados podem ser usadas para delimitar a região central da proteína, enquanto regiões com resíduos expostos ao solvente e hidrofílicos são sítios potenciais de hidratação ou funcionais. Para visualizar as estruturas terciárias previstas da proteína consultada, role a página até o aplicativo interativo JMO exibido à esquerda. Clique no aplicativo para alterar a aparência da estrutura exibida.
Aproxime-se de uma região específica, selecione tipos específicos de resíduos no modelo previsto ou calcule as distâncias entre resíduos. Analise os escores de confiança da modelagem estrutural para estimar a qualidade das estruturas previstas. Os valores de Csco geralmente estão na faixa de menos cinco a dois, em que um escore mais alto reflete um modelo de melhor qualidade.
A pontuação TM estimada e o RMSD do primeiro modelo são mostrados como a precisão estimada do modelo um. Clique no link mais sobre csco. Para analisar o tamanho do agrupamento csco e a densidade do agrupamento de todos os modelos, analise os 10 principais modelos de alinhamento do programa da proteína consultada, conforme identificado pelos programas de alinhamento de baixos mets.
Ao rolar para baixo na página de resultados, visualize o Z-score normalizado para analisar a qualidade dos alinhamentos por threading. Alinhamentos com um csco normalizado maior que um refletem um alinhamento confiável e têm grande probabilidade de apresentar o mesmo dobramento da proteína da consulta. Examine a identidade de sequência na região alinhada por threading e em toda a cadeia para avaliar a homologia entre as proteínas da consulta e do molde.
Uma alta identidade de sequência é um indicador de parentesco evolutivo entre as proteínas da consulta e do modelo. Visualize os resíduos alinhados por encaixe mostrados em cores para identificar visualmente resíduos ou motivos conservados nas proteínas da consulta e do modelo; uma identidade de sequência mais elevada na região alinhada por encaixe, em comparação com o alinhamento de toda a cadeia, também indica a presença de motivos ou domínios estruturais conservados na consulta. Avalie a cobertura do alinhamento por encaixe examinando o alinhamento.
Se a cobertura do alinhamento superior for baixa e restrita a apenas uma pequena região da proteína da consulta ou ausente em um longo segmento da sequência da consulta, isso indica que a proteína da consulta contém mais de um domínio. Nesse caso, recomenda-se dividir a sequência e modelar os domínios individualmente. Veja a próxima tabela da página de resultados para determinar os 10 análogos estruturais principais do primeiro modelo previsto, conforme identificado pelo programa de alinhamento estrutural TM align.
Um valor TM superior a 0,5 indica que o análogo detectado e o modelo possuem uma topologia semelhante e podem ser usados para determinar a classe estrutural ou a família proteica da proteína em análise. Valores TM inferiores a 0,3 indicam uma semelhança estrutural aleatória. Analise a identidade de sequência e o RMSD na região alinhada estruturalmente para avaliar a conservação dos motivos espaciais no modelo e no análogo estrutural.
Inspecione visualmente os pares de resíduos coloridos e alinhados no alinhamento para identificar esses resíduos e motivos estruturalmente conservados. Examine a tabela de números EC preditos para visualizar os cinco principais OGs de enzimas potenciais da proteína da consulta. O nível de confiança da predição do número EC utilizando esses modelos é mostrado como o escore EC com base na análise de referência.
A similaridade funcional entre a proteína da consulta e o modelo pode ser interpretada com confiabilidade usando uma pontuação EC superior a 1,1. Em seguida, verifique o consenso de função entre os modelos, que possuem uma estrutura tridimensional semelhante à da proteína da consulta. Se múltiplos modelos apresentarem o mesmo número EC e a pontuação EC for superior a 1,1, o nível de confiança da previsão será muito alto.
No entanto, se o valor do escore EC for alto, mas houver falta de consenso entre os acertos identificados, a previsão torna-se menos confiável e recomenda-se que os usuários consultem a ontologia genética. A visualização das previsões de termos exibe a tabela de termos de ontologia genética previstos para identificar os 10 melhores homólogos da proteína consultada na biblioteca PDB anotados com termos de ontologia genética; cada proteína geralmente está associada a múltiplos termos de ontologia genética que descrevem suas funções moleculares, processos biológicos e localização celular. Clique em cada termo para visitar o site amigo e analisar sua definição e linhagem.
Analise a coluna de pontuação de homologia funcional para acessar a similaridade funcional entre as proteínas da consulta e do modelo. O nível de confiança na transferência de anotação funcional a partir dessas proteínas também pode ser estimado. Visualize a tabela de predição por consenso de termos de ontologia genética para analisar a concordância funcional entre os modelos.
Essas funções comuns são usadas para prever os termos de ontologia gênica da proteína consultada e para avaliar o nível de confiança das previsões de termos de geo. Por fim, role até a parte inferior da página para visualizar as 10 principais previsões de sítios de ligação de ligantes; os sítios de ligação previstos são classificados com base no número de confirmações de ligantes previstas que compartilham um mesmo bolsão de ligação. O melhor sítio de ligação identificado já é exibido no aplicativo JM OL.
Clique nos botões de opção para analisar outras previsões e visualizar os resíduos do ligante que interagem. A pontuação BS revela a similaridade local entre o modelo e o sítio de ligação dos modelos. Uma pontuação BS maior que 1,1 indica alta similaridade de sequência e estrutura próxima ao sítio de ligação previsto.
No modelo, em comparação com o sítio de ligação conhecido no modelo, o IT é uma página da web principal que contém links para outras funcionalidades úteis. O recurso de fórum permite que o usuário crie uma conta online e solicite ajuda de outros usuários do ITER sobre modelagem de estruturas ou auxílio na interpretação dos resultados. O recurso de download permite que os usuários baixem o iter e pacotes relacionados e os instalem em seus computadores.
Isso ajuda a reduzir o tempo necessário para realizar os experimentos de modelagem. O recurso de fila permite que o status de todas as tarefas enviadas seja visualizado na página IT a Q. Os usuários também podem inspecionar visualmente a imagem das estruturas modeladas para as tarefas concluídas.
Nesta página, também são exibidos a pontuação TM esperada e o RMSD esperado do primeiro modelo e a data de envio mostrados aqui, que correspondem a um trecho da página de resultados do IT AER, apresentando a sequência da consulta formatada mais rapidamente, a estrutura secundária prevista e as pontuações de confiança associadas e a acessibilidade prevista ao solvente dos resíduos. A região central analisada e o sítio de hidratação potencial na consulta são destacados por retângulos ciano e vermelhos, respectivamente. Aqui são mostradas as previsões de estrutura terciária para as proteínas da consulta.
Os modelos previstos são exibidos em uma saída interativa do aplicativo JML, permitindo ao usuário alterar a exibição da molécula. Os modelos também podem ser baixados clicando nos links de download; a pontuação de confiança para estimar a qualidade do modelo é informada como csco. Um exemplo da página de resultados do itta A mostrando os 10 principais modelos de encaixe e alinhamentos identificados pelos programas de encaixe Loomis é apresentado.
A qualidade dos alinhamentos por modelagem por homologia é avaliada com base no escore Z normalizado, em que um valor superior a um indica um alinhamento confiável. Os resíduos alinhados no modelo que são idênticos aos resíduos correspondentes na sequência consultada são destacados em cor para indicar a presença de um resíduo ou motivo conservado. Por outro lado, a ausência de alinhamento na maioria dos modelos superiores indica a presença de múltiplos domínios na proteína consultada, e os resíduos não alinhados correspondem a regiões conectoras entre domínios.
Esta tabela exibe os 10 principais análogos estruturais e alinhamentos estruturais identificados pelo Programa de Alinhamento Estrutural TM. A classificação dos análogos baseia-se na pontuação TM do alinhamento estrutural. Uma pontuação TM superior a 0,5 indica que as duas estruturas comparadas possuem uma topologia semelhante.
Embora uma pontuação TM inferior a 0,3 indique uma semelhança entre duas estruturas aleatórias. Os pares de resíduos alinhados estruturalmente são destacados em cores com base em sua propriedade de aminoácido, enquanto as regiões não alinhadas são indicadas por um traço. A seguir, há um exemplo da página de resultados do ITR mostrando homólogos enzimáticos identificados da proteína consultada na biblioteca PDB.
O nível de confiança da predição do número EC é analisado com base na pontuação EC, em que uma pontuação EC superior a 1,1 indica similaridade funcional entre a proteína da consulta e a proteína modelo. A tabela de predição de termos de Gene Ontology para a proteína da consulta inclui homólogos funcionais da proteína da consulta na biblioteca de modelos de Gene Ontology, classificados com base em suas pontuações de homologia funcional. Características funcionais comuns dessas ocorrências com as pontuações mais altas são utilizadas para gerar as predições finais de termos de Gene Ontology para a proteína da consulta.
A qualidade dos termos de ontologia genética preditos é estimada com base na pontuação geo, na qual uma pontuação geo maior que 0,5 indica uma predição confiável, mostrada aqui como exemplo da página de resultados IT AZA exibindo as 10 principais predições de sítios de ligação de ligantes proteicos utilizando o algoritmo de cofator. A classificação dos sítios de ligação preditos baseia-se no número de confirmações de ligantes preditos que compartilham um mesmo sítio de ligação. Na consulta, a pontuação BS é uma medida da similaridade local de sequência e estrutura entre o sítio de ligação predito e os modelos de sítios de ligação, sendo útil para analisar a conservação dos bolsões de sítios de ligação.
Embora o ISER seja um dos algoritmos mais eficientes para a predição de estrutura e função de proteínas, é importante lembrar que se trata apenas de uma previsão feita por algoritmos computacionais. Quaisquer dados experimentais ou informações sobre a função, por exemplo, contatos entre resíduos ou dados sobre ligação, serão extremamente úteis para aumentar a precisão das predições. O servidor IT AER possui um portal para incluir essas informações durante o procedimento de modelagem, a fim de atender ao crescente interesse nessa ferramenta.
Aer, o laboratório Zang disponibilizou gratuitamente o software IT AER para pesquisa sem fins comerciais. Estamos ativamente desenvolvendo e aprimorando o IT AER e o eye taster, na esperança de que sua disponibilidade leve a aplicações em larga escala fora do laboratório Zang e beneficie, além de estimular, pesquisas adicionais na comunidade científica.
Este artigo descreve o pipeline I-TASSER para prever as estruturas tridimensionais e funções de proteínas a partir de suas sequências de aminoácidos. O processo envolve alinhamento por modelagem, montagem de fragmentos e inferência funcional com base em estruturas proteicas conhecidas.
A previsão computacional da estrutura e função de proteínas permite a redução de riscos em alvos no início da descoberta de fármacos, fornecendo subsídios mecanicistas para proteínas não caracterizadas experimentalmente. O pipeline I-TASSER apoia a verificação de hipóteses e a anotação funcional, aumentando a confiança preditiva nos fluxos de trabalho de seleção de alvos e identificação de compostos iniciais. Essa abordagem reduz a dependência de métodos experimentais de baixo rendimento e acelera a validação de alvos na pesquisa e desenvolvimento biofarmacêuticos.
O método I-TASSER integra-se ao continuum de descoberta, desde a identificação do alvo até a otimização do composto líder, fornecendo informações estruturais e funcionais que orientam a tomada de decisões em cada etapa.