28 de junho de 2018
Sequenciamento profundo das populações de leveduras selecionadas para interações de 2-híbrido de levedura positivos potencialmente produz uma riqueza de informações sobre interação proteínas do parceiro. Aqui, descrevemos o funcionamento das ferramentas de Bioinformática específicos e software atualizado personalizado para analisar os dados de sequência de tais telas.
Este método pode ajudar a responder a perguntas-chave sobre a natureza dos interactomas proteicos. A principal vantagem desta técnica é que todo o processamento de bioinformática é operado por uma interface fácil de usar. Este software emprega uma interface gráfica de usuário amigável que biólogos moleculares, biólogos celulares e bioquímicos que não têm muita experiência em bioinformática podem usar para concluir facilmente suas análises.
Geralmente, os indivíduos novos no processamento de dados de sequência lutam porque os programas de computador são confusos e complicados. Achamos que facilitar a informática tornaria toda a técnica muito mais acessível e útil. A primeira etapa deste procedimento é baixar e instalar o programa de software MAPster conforme descrito no protocolo de texto.
Em seguida, insira os arquivos e parâmetros necessários por meio da guia Principal. Selecione o botão Emparelhar apropriado para inserir os arquivos para análise DEEPN. Desative a opção Emparelhar para executar no formato de leitura única.
Carregue arquivos no MAPster arrastando e soltando na janela apropriada. Nos genomas indexados listados na caixa Genoma, selecione uma fonte de genoma de DNA de referência que corresponda à fonte das inserções da biblioteca de presas Y2H. Como o HISAT2 suporta multi-threading, na caixa Threads, indique o número de processos de computador a serem dedicados ao programa de mapeamento.
Especifique um nome de arquivo de saída, um nome curto, mas descritivo, sem espaço ou caracteres especiais, é recomendado, pois esse nome de arquivo será usado em todo o processo DEEPN. Usando o botão Abrir diretório de saída, especifique uma pasta para gerar os arquivos mapeados. Depois que os arquivos e parâmetros apropriados forem selecionados, use o botão Adicionar à fila para adicionar o trabalho de mapeamento à fila de trabalhos.
Depois que todos os trabalhos forem inseridos na fila de trabalhos, clique no botão Executar Fila. Comece esta análise abrindo o software DEEPN. Na janela principal, selecione as informações da biblioteca de presas correspondentes na caixa de seleção superior.
Selecione uma pasta para onde os arquivos processados podem ir clicando no botão Pasta de Trabalho e navegando até o diretório da pasta. Uma vez selecionada uma pasta de trabalho, o DEEPN criará três subpastas com os nomes indicados. Para uma análise bem-sucedida, certifique-se de colocar os arquivos SAM corretos nas pastas corretas e saber quais arquivos têm leituras mapeadas e não mapeadas.
Se estiver usando arquivos sam contendo leituras mapeadas e não mapeadas, como aquelas produzidas com as configurações padrão do programa MAPster, coloque-os na pasta sam_files. Inicie o processamento clicando no botão Contagem de genes mais Junção Make. O tempo de processamento depende do tamanho e do número de arquivos de dados de sequência e da velocidade de processamento do computador usado.
Depois que o DEEPN processar os dados, um conjunto completo de pastas será criado. O próximo passo é realizar a análise no Stat Maker. Abra Stat_Maker e clique no botão Verificar instalação.
Se estiver executando pela primeira vez, o Stat_Maker instalará automaticamente o R, o JAGS e o Bioconductor extraindo esses recursos da Internet. Assim que R, JAGS e Bioconductor forem detectados, Stat_Maker se tornarão ativos e permitirão mais entrada do usuário. Clique no botão Escolher pasta para navegar até a pasta de trabalho que o DEEPN processou.
Stat_Maker encontrará e listará automaticamente os arquivos para análise estatística na janela. Arraste e solte os arquivos apropriados da janela da lista de arquivos acima para as janelas de arquivos abaixo para cada conjunto de dados de vetor e isca e para cada condição de crescimento, não selecionado e selecionado. É importante ressaltar que Stat_Maker requer conjuntos de dados duplicados apenas para vetores vazios, duas amostras de populações não selecionadas e duas amostras de selecionadas.
Isso fornece uma estimativa da variabilidade dentro do experimento. Clique no botão Executar. Dependendo da velocidade do computador, a computação levará de cinco a 15 minutos.
Os resultados da saída Stat_Maker são colocados em uma nova subpasta dentro da pasta de trabalho principal rotulada Stat_Maker Resultados. Revise os resultados. Para revisar os dados de cada candidato em potencial, abra o software DEEPN, selecione as informações da biblioteca de presas correspondentes e, em seguida, selecione a pasta de trabalho correta usando a pasta de trabalho.
Clique no botão Blast Query para carregar uma nova janela. Na caixa de texto superior, digite o nome do gene ou o número NM do GenBank para selecionar o gene candidato de interesse. O nome do gene corresponde ao nome listado no arquivo de saída do Stat Maker.
Digite Enter ou Return, que inicia a recuperação do gene de interesse. Selecione quais conjuntos de dados serão usados para a análise usando os menus Selecionar conjunto de dados. Normalmente, isso inclui apenas as amostras de vetor e isca cultivadas em condições não seletivas e a amostra de isca cultivada em condições de seleção.
Inicialmente, carregar os dados e o nome do gene pode demorar um pouco com o programa Blast Query, mas uma vez que o conjunto de dados é carregado, ele será muito mais rápido. Blast_Query exibirá os pontos de fusão ao longo da sequência de interesse e quão abundante é cada ponto de fusão. Isso pode ser exibido em um formato de tabela usando a guia Resultados ou em um formato gráfico usando a guia Plotar.
Para exportar esses resultados para um arquivo csv, clique no botão Salvar csv no canto superior direito. Na janela DEEPN, clique no botão Profundidade de leitura em Analisar dados. Quando a janela Profundidade de leitura estiver aberta, digite o número NM na caixa de texto superior.
Use o menu suspenso para selecionar o conjunto de dados relevante que contém o gene enriquecido de interesse. Use a tabela à esquerda e a exibição de gráficos à direita para determinar quantas leituras foram encontradas nos dados que correspondem ao gene de interesse. O programa Stat Maker produz um arquivo visível no Excel que resume as informações pertinentes necessárias para identificar proteínas candidatas que interagem.
Também é mostrada a análise correspondente para saber se os plasmídeos correspondentes à presa candidata contêm o quadro de leitura aberto adequado. O Blast Query avalia cada gene e ordena as diferentes posições de acordo com sua abundância no conjunto de dados quantificado pelo ppm do número total de junções encontradas no banco de dados. Neste exemplo, a posição mais abundante que é In ORF e In Frame é a posição 867, indicando que o nucleotídeo 867 do GenBank NCBI Reference Sequence NM_019648 é o início do fragmento da presa.
Este gráfico mostra uma sequência hipotética e como projetar o oligo de cinco primos para capturar o quadro correto e o ponto de fusão entre o domínio de ativação Gal4 e a sequência de presas de interesse. Esta janela de profundidade de leitura mostra quantas sequências foram encontradas nos dados que correspondem às posições dos nucleotídeos da sequência de interesse. Uma vez dominado, o processamento de dados pode ser feito em 10 a 20 horas, na maioria das vezes sem supervisão.
As telas DEEPN e a análise informática correspondente abrirão caminho para que investigadores em uma ampla gama de campos explorem redes de interação com sua proteína de interesse. O programa MAPster foi projetado para facilitar o mapeamento de arquivos de sequência de experimentos DEEPN. Ele também fornece um método amigável para mapear arquivos de sequência para referenciar DNA para uma variedade de aplicações, como RNA-Seq ou ChIP-Seq.
Embora o software DEEPN seja construído especificamente para processar dados de dois híbridos de levedura em lote, ele também pode ser usado para processar dados de RNA-Seq. O programa Stat Maker não apenas prevê quais genes fornecem uma interação autêntica de dois híbridos de levedura, mas também reúne vários outros parâmetros, como a leitura de informações do quadro, permitindo que os investigadores filtrem rapidamente seus resultados candidatos. Uma vez que as proteínas candidatas a interagir são identificadas, é importante validar as interações usando ensaios padrão de dois híbridos de levedura, ensaios bioquímicos pull-down ou métodos relacionados.
Veja a transcrição completa e aceda a milhares de vídeos científicos
Este artigo discute um método para analisar interatômios proteicos por meio do sequenciamento profundo de populações de leveduras selecionadas por interações positivas no sistema de duplo híbrido em levedura. Destaca o uso de ferramentas bioinformáticas de fácil utilização que simplificam o processo de análise para pesquisadores sem experiência extensa em bioinformática.
Este método permite a identificação de alto rendimento de interações proteína-proteína por meio de telas de duplo híbrido em levedura acopladas à sequenciação profunda, fornecendo dados quantitativos de enriquecimento que apoiam a validação de alvos e a redução de riscos mecanicistas na fase inicial de descoberta. O fluxo de trabalho bioinformático integrado reduz a dependência de expertise especializada, acelerando a progressão de hits a compostos líderes ao fornecer mapas de interação reprodutíveis e resolvidos por quadro. Esta abordagem aumenta a confiança preditiva na seleção de alvos e sustenta campanhas de triagem escaláveis em diferentes áreas terapêuticas.
O método insere-se na fase inicial da descoberta, apoiando a identificação de alvos por meio do perfil de interações e contribuindo para a identificação de compostos promissores por meio de redes de interação validadas.