9 de maio de 2011
Apresentamos um sítio web público computacional para análise de seqüências genômicas. Ele detecta padrões de seqüência de DNA com vários não-aleatória composições de nucleotídeos. Este recurso também gera sequências ao acaso, com diversos níveis de complexidade.
O objetivo geral deste procedimento é explorar a não aleatoriedade em faixa intermediária, também chamada de heterogeneidade, de uma sequência genômica especificada pelo usuário. Isso é realizado primeiramente examinando a composição de oligonucleotídeos de uma sequência de entrada e gerando uma tabela de frequência dos oligonucleotídeos que compõem a sequência. Esse objetivo é alcançado invocando o programa SRI Analyzer.
O segundo passo é produzir sequências aleatórias que tenham exatamente a mesma composição de oligonucleotídeos da sequência de entrada. Isso é obtido invocando o programa gerador SRI. O terceiro passo do procedimento é encontrar segmentos dentro das sequências de entrada e aleatorizadas que estejam significativamente enriquecidos com um determinado nucleotídeo ou combinação de nucleotídeos, por exemplo, GC ou ag.
Esse objetivo é alcançado pelo programa MRI Analyzer. O passo final do procedimento é baixar os arquivos contendo as sequências de todas as regiões MRI detectadas pelo programa. Em última análise, podem-se obter resultados que mostram que a maioria das regiões genômicas de árias multicelulares está significativamente enriquecida por segmentos contendo extremos na composição de bases detectados para cada um dos quatro nucleotídeos ou qualquer combinação deles.
Essas regiões homogêneas estão associadas a conformações incomuns do DNA e/ou a propriedades particulares do DNA. Este método pode ajudar a responder perguntas fundamentais no campo da genômica, como a identificação de elementos de DNA potencialmente funcionais dentro de vastas áreas de sequências não codificantes, incluindo regiões intergênicas ou regiões regulatórias. Embora este método possa fornecer informações sobre genomas de mamíferos, ele também pode ser aplicado a outros organismos, como invertebrados, plantas, fungos e bactérias.
Abra a página inicial do pacote online GRI (genomic mid-range in homogeneity ou G GM I) em www.bioinfo.utoledo.edu/gri/, o recurso da web. Também fornece informações detalhadas sobre os programas no link de ajuda Como Ler.
Embora todos os materiais publicados sobre MRI genômica e algoritmos semelhantes estejam listados nos links para recursos relevantes, crie um arquivo com uma sequência formatada rapidamente para iniciar uma sessão de análise A-G-M-R-I. Uma sequência formatada rapidamente começa com um circunflexo ou com o símbolo de maior que, seguido por um identificador único ou nome e a sequência nas linhas seguintes. Apenas nucleotídeos T, G, A e C serão processados pela MRI genômica, embora outros caracteres de entrada sejam permitidos.
O arquivo de sequência do gene PKD1 é utilizado. Para demonstrar a sessão, pressione o botão iniciar. Isso abre uma nova página da web, que oferece a opção de copiar e colar a sequência de entrada na janela fornecida, ou caso o arquivo seja grande.
Para fazer o upload, clique no botão escolher arquivo para carregar um arquivo. Navegue até o arquivo desejado. Em seguida, clique no botão iniciar esta sessão com este arquivo. Uma confirmação de que o arquivo foi carregado com sucesso será exibida na parte superior da página abaixo.
Esta mensagem é um identificador da sessão atual, que neste caso é C oito EP zero seis. Para analisar a baixa homogeneidade do intervalo curto da sequência de entrada, clique no botão analisar baixa homogeneidade do intervalo curto. O programa abre uma nova página, especificamente projetada para a execução do programa SRI Analyzer.
Aqui, precisamos escolher o comprimento máximo dos oligonucleotídeos a serem examinados. Como nossas sequências de entrada têm tamanho médio de aproximadamente 50.000 nucleotídeos, selecionamos os formadores como o comprimento máximo de oligonucleotídeos para os quais as frequências serão calculadas. Por fim, precisamos pressionar imediatamente o botão analisar arquivo.
O programa calcula as frequências de todos os oligonucleotídeos do comprimento escolhido e de comprimentos menores dentro da sequência de entrada. Para visualizar as frequências de todos os oligonucleotídeos, clique no link baixar arquivo de composição. Este arquivo é nomeado arquivo do usuário.
com representa uma tabela com três colunas. A primeira coluna especifica os oligonucleotídeos. A segunda representa suas frequências relativas, e a terceira representa o número de ocorrências de oligonucleotídeos na sequência de entrada.
Para gerar sequências randomizadas com a mesma composição de oligonucleotídeos do arquivo de entrada, clique na aba gerador SRI. Na nova página, escolha o número de amostras de sequências aleatórias a serem geradas. Cada uma dessas amostras conterá sequências aleatórias com o mesmo número e comprimento das sequências de entrada no arquivo do usuário.
Neste exemplo, o arquivo do usuário é a sequência do gene PKD1. Em seguida, escolha o comprimento mais longo de oligonucleotídeos para o qual as frequências serão aproximadas nas sequências randomizadas, selecionando o botão de opção para formadores, que representa oligonucleotídeos de quatro bases. Em seguida, escolha dois como o número de amostras de sequências randomizadas a serem geradas.
Por fim, inicie o programa clicando no botão gerar arquivo para as sequências de entrada de centenas de milhares de nucleotídeos. Pode levar alguns minutos para gerar sequências aleatórias. Portanto, aguarde até que links de download azuis apareçam na parte inferior desta página.
Para analisar a homogeneidade na faixa intermediária de sequências de entrada e aleatórias, clique na guia analisador de RMI. Na nova página, selecione uma sequência a ser analisada na caixa de listagem de arquivos para análise. Em seguida, escolha conteúdo de GC a partir da lista de sete tipos de conteúdo.
O conteúdo GC representa a composição de G mais C. O campo de tamanho da janela permite a seleção do comprimento da janela para a qual serão examinadas sequências ricas e pobres em conteúdo. Mantenha o tamanho padrão da janela de 50 nucleotídeos.
Por fim, escolha os limites superior e inferior para regiões ricas em conteúdo e pobres em conteúdo, respectivamente. Esses limites podem ser definidos pelo número de nucleotídeos específicos na janela atual ou pela porcentagem desses nucleotídeos na janela. Neste caso, vamos inicialmente escolher valores aleatórios de 60% para o limite superior e 30% para o limite inferior.
Em seguida, pressione o botão para analisar o arquivo. Após isso, um link para o arquivo de saída aparece e uma representação gráfica dos resultados é exibida. Todas as regiões ricas em conteúdo ao longo da sequência de entrada são marcadas como picos azuis ascendentes e as regiões pobres em conteúdo como picos vermelhos descendentes. O gráfico mostra que há muitos picos azuis que indicam regiões ricas em GC e muito menos picos vermelhos que indicam regiões pobres em GC.
Isso significa que os parâmetros escolhidos não são ideais. Para a próxima iteração, utilize um limite superior de 75% e um limite inferior de 32%. Novamente, inicie o analisador de RNM clicando no botão analisar arquivo.
O novo gráfico mostra que, mesmo para os novos parâmetros muito mais rigorosos, existem centenas de picos azuis. Portanto, aumente o limite superior para 80% e repita os cálculos. O novo gráfico mostra que 62 regiões ricas em GC possuem conteúdo de GC maior ou igual a 80% e 28 regiões pobres em GC com conteúdo de GC abaixo de 32%. Em seguida, compare os resultados do arquivo de entrada com as duas sequências randomizadas que possuem a mesma composição de oligonucleotídeos que o gene PKD1.
Para fazer isso, altere a sequência do gene PKD um para a aleatória usando a caixa de seleção do arquivo a ser analisado, mantendo os mesmos parâmetros para regiões ricas em GC e pobres em GC. A nova exibição gráfica para a sequência aleatorizada número um ilustra que essa sequência aleatória possui apenas uma região pobre em GC e 31 regiões ricas em GC. Outra sequência aleatorizada pode apresentar alguma flutuação no número de regiões ricas e pobres em conteúdo, mas a tendência deve ser a mesma.
Sequências aleatórias para o gene PKD possuem várias vezes menos regiões ricas em GC. Regiões pobres em GC são mais de 10 vezes mais abundantes do que as ricas em GC. A próxima demonstração utiliza outro tipo de conteúdo de RNM.
No mesmo pacote, os íntrons de um gene humano contêm várias regiões ricas em purinas associadas às estruturas de DNAex. Na página da web do analisador de MRI, altere o conteúdo de DNA para nucleotídeos de ag, que representam purinas. Mantenha o tamanho da janela igual a 50 bases e modifique o limite superior para 80% e o limite inferior para 10%. Em seguida, pressione o botão analisar arquivo para invocar o programa.
O gráfico exibido mostra que este gene possui seis regiões ricas em AG, indicadas por picos verticais azuis, e 14 regiões pobres em AG, indicadas por picos vermelhos. Em seguida, compare esses resultados obtidos para o gene PKD1 com os dados das sequências randomizadas que possuem a mesma composição de oligonucleotídeos do gene em estudo: primeiro mude para a sequência randomizada, por exemplo a número dois, e mantenha os mesmos parâmetros do teste anterior. O gráfico para essa sequência aleatória mostra que ela contém apenas uma região rica em AG e nenhuma região pobre em AG.
Todos os dados gerados durante a sessão são salvos em arquivos especiais que podem ser acessados por meio da guia "arquivos para download" no canto superior direito de cada página da web. Após abrir este link, baixe a sequência de entrada, bem como todas as sequências randomizadas geradas. Abaixo dessa lista de arquivos, há um link para a tabela de frequência de oligonucleotídeos gerada pelo programa analisador SRI.
Em seguida, há links para todos os resultados gerados pelo programa analisador de MRI durante a sessão. Por exemplo, clique no arquivo usuário um arquivo RAND um quatro AGCO 50 32 14, que representa os resultados obtidos para a sequência randomizada. Número um com os seguintes parâmetros, conteúdo de AG 50, janela de comprimento em nucleotídeos, limite superior, 32 nucleotídeos e limite inferior 14 nucleotídeos.
Neste arquivo, todos os segmentos de sequência de nucleotídeos que correspondem aos critérios de conteúdo rico ou pobre, bem como suas coordenadas, estão disponíveis como uma lista de acordo com suas posições consecutivas ao longo da sequência de entrada. Após assistir a este vídeo, você deverá ter uma boa compreensão de como navegar pelo MRI genômico, recurso computacional.
Este artigo apresenta um recurso computacional baseado na web projetado para a análise de sequências genômicas, com foco na detecção de composições de nucleotídeos não aleatórias. A ferramenta gera sequências randomizadas com composições de oligonucleotídeos semelhantes, facilitando a exploração de heterogeneidades genômicas.
O MRI genômico fornece uma abordagem computacional para detectar padrões não aleatórios de nucleotídeos no DNA não codificante, auxiliando na validação de alvos ao identificar elementos reguladores com significado funcional potencial. Isso permite a redução de riscos mecanicistas na fase inicial de descoberta, associando a heterogeneidade de sequência a processos biológicos como expressão gênica e recombinação. O recurso aumenta a confiança preditiva na identificação de compostos líderes ao priorizar regiões genômicas com composição de bases extrema para o desenvolvimento de ensaios subsequentes.
O método integra-se ao continuum de descoberta, desde a validação do alvo até a identificação de compostos promissores e trabalhos pré-clínicos, fornecendo saídas quantitativas sobre o enriquecimento de sequências que orientam decisões de desvio de risco biológico.