April 8th, 2017
Galaxy e David surgiram como ferramentas populares que permitem que os investigadores sem formação bioinformática para analisar e interpretar dados de RNA-Seq. Descreve-se um protocolo para C. elegans investigadores para executar ARN-Seq experiências, o acesso e processar o conjunto de dados usando Galaxy e obter informação biológica significativa a partir das listas de genes utilizando DAVID.
O objetivo geral deste protocolo é ajudar os pesquisadores de C. elegans sem experiência em bioinformática a realizar um experimento de sequenciamento de RNA e analisar os dados usando a plataforma de acesso aberto Galaxy. Este método pode ajudar a analisar dados complexos de alta por meio de sequenciamento de colocação para fornecer informações sobre as assinaturas transcriptômicas por trás dos fenótipos em C. elegans. A principal vantagem dessa técnica é que ela permite que cientistas sem treinamento prévio em bioinformática analisem dados brutos de sequenciamento e produzam uma lista de genes diferencialmente expressos, juntamente com seus termos de ontologia gênica associados.
Embora este método seja especificamente voltado para as nuances dos dados de sequenciamento de C. elegans, ele também pode ser aplicado a outros organismos e contexto biológico onde as principais alterações de transcrição dos genomas precisam ser examinadas. Este vídeo trata do uso baseado na web do pipeline Galaxy. Se possível, execute o fluxo de trabalho localmente.
Baixe e instale o Galaxy de acordo com as instruções na página wiki. Depois de utilizar o tutorial de início fornecido na página inicial do Galaxy, siga este vídeo. É fundamental que o usuário se familiarize e se oriente para a interface do usuário do Galaxy e as ferramentas usadas no fluxo de trabalho.
Para começar, clique em analisar dados no painel de cabeçalho para acessar a visualização inicial da análise. A barra de progresso no canto superior direito monitora quanto espaço em disco foi usado. Em seguida, acesse o menu de ferramentas no painel esquerdo e clique em Análise de RNA NGS.
Isso fornece opções para usar todas as ferramentas necessárias para a análise de dados de sequência de RNA. Agora, inicie um novo histórico de análise. Vá para o painel de histórico à direita.
Clique no ícone de engrenagem e escolha a opção criar novo no menu pop-up. Em seguida, forneça um nome no histórico para identificar a análise. Para continuar, vá para o menu de ferramentas e, em obter dados, clique na função de upload de arquivo para carregar arquivos brutos de fila rápida.
Depois que a tarefa for aberta na interface de análise, clique em escolher arquivo local ou escolha arquivo FTP para navegar e selecionar os dados de sequência apropriados. Por padrão, o Galaxy detectará automaticamente o tipo de arquivo. Em seguida, selecione o organismo no menu suspenso que, neste caso, é C.elegans.
Em seguida, clique em iniciar para iniciar o upload de dados. Depois que o arquivo é carregado, a ação é salva no painel de histórico a partir do qual os dados podem ser selecionados e acessados. Agora, converta os arquivos do formato de fila rápida, um de cada vez, para o formato de sanger de fila rápida acessando o menu NGS QC e manipulação, selecionando o aparador de fila rápida, escolhendo o arquivo em arquivo para limpar.
Selecione o tipo de pontuação de igualdade rápida de entrada apropriado e execute a ferramenta usando os parâmetros padrão. O arquivo de dados agora pode ser analisado. Preste atenção especial aos formatos de arquivo e parâmetros de teste usados em todo o protocolo.
Esse conhecimento é valioso para solucionar problemas de testes com falha e outros problemas. Os testes de controle de qualidade podem ser usados antes de prosseguir. Detalhes sobre como executá-los são fornecidos no protocolo de texto.
Quando um arquivo estiver pronto para análise, mapeie os dados de sequenciamento abrindo primeiro a seção de análise de RNA NGS e clicando na ferramenta de cartola. No menu suspenso, preencha a resposta para a pergunta são dados finais únicos ou emparelhados? Em seguida, escolha o arquivo de fila rápida apropriado.
Selecione usar um genoma integrado no próximo menu suspenso e escolha os dados do genoma de referência de C.elegans. Selecione o padrão para todas as outras opções de parâmetro e clique em executar. Para estimar a abundância relativa de transcritos no conjunto de dados, selecione a ferramenta de abotoaduras na seção de análise de RNA NGS e, no primeiro menu suspenso, escolha o arquivo de formato bam de hits aceitos mapeados obtido da análise de cartola.
No segundo menu suspenso, defina a anotação de referência para o arquivo GTF que contém os dados do genoma atual. Quando for apresentada a opção executar correção de viés, selecione sim e execute a tarefa usando as configurações padrão. Em seguida, no menu de análise de RNA NGS, abra a ferramenta de mesclagem de manguito para mesclar os transcritos montados produzidos para todas as amostras de sequência de RNA.
A primeira caixa da ferramenta carrega todos os arquivos GTF produzidos usando abotoaduras na etapa anterior. Agora, selecione o arquivo de transcrições montado para cada uma das cepas ou condições testadas, incluindo as réplicas biológicas da mesma condição de cepa. Selecione sim para a anotação de referência do usuário e escolha o arquivo de dados do genoma de referência.
Em seguida, selecione sim para a opção usar dados de sequência. Isso detectará e escolherá automaticamente o genoma de referência apropriado. Deixe todos os outros parâmetros em sua configuração padrão e clique em executar.
Um único arquivo GTF será produzido. Para comparar várias cepas ou condições, volte para a seção de análise de RNA NGS e selecione a ferramenta div do manguito. Em seguida, no menu de transcrições na ferramenta div do manguito, selecione o arquivo de saída mesclado da mesclagem do manguito.
Em seguida, insira rótulos para as duas condições. Para cada condição, vá para replicates e selecione os arquivos de saída de hits aceitos individuais da cartola que correspondem às diferentes réplicas biológicas dessa condição. Para selecionar vários arquivos simultaneamente, mantenha pressionada a tecla de comando ou controle.
Depois de selecionar os arquivos, use as configurações de parâmetro padrão e clique em executar para executar a tarefa. Baixe dados expressos diferencialmente clicando no ícone salvar na caixa de teste diferencial de genes gerada no painel de histórico. Para começar, acesse David no site.
No cabeçalho da página da Web, escolha iniciar análise. Copie a lista de genes obtidos do Galaxy na caixa A e, neste exemplo, selecione o identificador do gene como ID do gene base do verme. Agora, a página inicial do assistente de análise será aberta, na qual as tarefas de David podem ser selecionadas.
Este segmento de vídeo descreve algumas dessas opções. Primeiro, escolha o agrupamento de anotações funcionais para ir para a página de resumo. Deixe as categorias de anotação em suas configurações padrão e clique em agrupamento de anotações funcionais.
Essa opção gera clusters de termos de anotação semelhantes classificados por sua pontuação de enriquecimento. Agora, retorne ao assistente de análise e selecione a opção de gráfico de anotação funcional para identificar termos biológicos significativamente super-representados associados à lista de genes. Um recurso valioso de David é a opção de fazer uma tabela de anotações funcional.
Isso lista todas as anotações associadas aos genes sem mostrar nenhum cálculo estatístico. Isso pode ser útil para análise gene por gene e para encontrar genes específicos de interesse. Outra ferramenta útil de David para revisar é a classificação funcional do gene.
Esta opção segrega os genes em uma lista de grupos funcionalmente relacionados classificados por sua pontuação de enriquecimento. O protocolo descrito foi utilizado para identificar genes cuja expressão é modulada pelo tcer-1 após a perda da linha germinativa. O transcriptoma de mutantes glp-1 da lista de linhas germinativas de longa duração foi comparado com mutantes duplos tcer-1 glp-1 que nossa linha germinativa lista, mas não exibem extensão de vida útil.
Uma verificação de qualidade das sequências não encontrou leituras de baixa qualidade, conteúdo de 48 a 49% de GC e um comprimento de leitura de sequência constante de 51 pares de bases. A cobertura do genoma das amostras foi estimada entre sete e 11 vezes. O Galaxy permitiu a combinação dos dados NGS das duas réplicas de cada cepa e a realização de análises diferenciais para gerar listas de genes destacando o perfil de expressão do genoma amplo.
No geral, 835 genes foram expressos diferencialmente entre as duas cepas usando um valor de P de 0,05. A análise de anotação funcional dos genes regulados positivamente revelou quatro grupos de anotação com altos escores de enriquecimento. O mais alto inclui o citocromo P450 e genes de resposta xenobiótica, seguidos por genes implicados em modificações lipídicas.
O agrupamento de anotações funcionais dos alvos regulados para baixo também identificou uma variedade de clusters de anotações. Estes incluíram clusters enriquecidos para a função do citoesqueleto, regulação positiva do crescimento, reprodução e envelhecimento. O pipeline Galaxy abriu caminho para pesquisadores em uma ampla gama de disciplinas biológicas analisarem mudanças de expressão gênica em larga escala de forma rápida e eficiente.
Depois de assistir a este vídeo, você poderá realizar um experimento de busca de RNA e analisar a alta bruta por meio de dados de sequenciamento usando o pipeline Galaxy. Você também deve ser capaz de extrair informações biologicamente relevantes dos dados do Galaxy usando a plataforma David.
View the full transcript and gain access to thousands of scientific videos
Este protocolo auxilia pesquisadores de C.elegans na realização de experimentos de sequenciamento de RNA e na análise dos dados usando a plataforma Galaxy. Ele permite que aqueles sem treinamento em bioinformática interpretem dados de sequenciamento complexos de forma eficaz.
Accessible transcriptomic analysis platforms like Galaxy enable discovery teams to interrogate gene expression changes without requiring deep bioinformatics expertise, accelerating early-stage target validation and mechanistic de-risking. By streamlining RNA-Seq data processing and functional annotation, this workflow supports rapid hypothesis testing and portfolio triage in model systems such as C. elegans. The approach enhances reproducibility and scalability for both novice and experienced R&D teams handling small-scale transcriptomic studies.
This workflow positions RNA-Seq analysis from raw data through differential expression and functional annotation within the early discovery to preclinical continuum, supporting both target validation and mechanistic studies.