É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de método

Análise informática de dados da sequência do lote levedura híbrida-2 telas

6.8K vistas

DOI:

10.3791/57802

28 de junho de 2018

Neste artigo

Resumo

Sequenciamento profundo das populações de leveduras selecionadas para interações de 2-híbrido de levedura positivos potencialmente produz uma riqueza de informações sobre interação proteínas do parceiro. Aqui, descrevemos o funcionamento das ferramentas de Bioinformática específicos e software atualizado personalizado para analisar os dados de sequência de tais telas.

Resumo

Adaptámos o ensaio 2-híbrido de levedura para descobrir simultaneamente dezenas de interações proteína transitória e estático dentro de um único ecrã utilizando o sequenciamento de DNA do elevado-throughput curto-leitura. Os conjuntos de dados sequência resultante podem não só acompanhar que genes em uma população que são enriquecidos durante a selecção para interações de 2-híbrido de levedura positivas, mas também fornecem informações detalhadas sobre os subdomínios relevantes de proteínas suficientes para interação. Aqui, descrevemos um conjunto completo de programas de software stand-alone que permitem que não-especialistas para executar todas as bioinformática e estatísticos passos para processar e analisar arquivos de fastq de sequência de DNA de um ensaio de 2-híbrido do fermento de lote. As etapas de processamento abrangidas por estes programas incluem: 1) mapeamento e contagem leituras sequência correspondente a cada proteína candidato codificada dentro de uma biblioteca de rapina 2-híbrido do fermento; 2) um programa de análise estatística que avalia os perfis de enriquecimento; e 3) ferramentas para examinar o quadro translacional e posição dentro da região de codificação de cada enriquecido plasmídeo que codifica as proteínas interagindo de interesse.

Introdução

Uma abordagem para descobrir as interações da proteína é o ensaio (Y2H) 2-híbrido do fermento, quais façanhas engenharia de células de levedura que crescem somente quando uma proteína de interesse vincula-se a um fragmento de uma interação sócio1. Deteção de múltiplas interações Y2H agora pode ser feita com a ajuda de sequenciamento de elevado-throughput maciço paralelo. Vários formatos foram descritas2,3,4,5 , incluindo uma que desenvolvemos onde as populações são cultivadas no lote sob condições que seleciona para levedura, que contém plasmídeos que produzem um positivos da interação do Y2H6. O fluxo de trabalho desenvolvido, denominado DEEPN (enriquecimento dinâmico para avaliação de redes de proteína), identifica o diferencial interactomes das bibliotecas de rapina mesmo para identificar as proteínas que interagem com uma proteína (ou domínio) vs. outra proteína ou um domínio mutante conformationally distinto. Um dos passos importantes para este fluxo de trabalho é adequado processamento e análise dos dados de sequenciamento de DNA. Algumas informações podem ser recolhidas contando apenas o número de leituras para cada gene antes e depois da seleção de interações Y2H de forma análoga a um experimento de RNA-seq. No entanto, informações muito mais detalhadas podem ser extraídas desses conjuntos de dados, incluindo informações sobre o subdomínio de uma determinada proteína que é capaz de produzir uma interação Y2H. Além disso, Considerando que a abordagem DEEPN é valiosa, analisar muitas repetições de amostra pode ser complicado e caro. Este problema é aliviado usando um modelo estatístico que foi desenvolvido especificamente para conjuntos de dados DEEPN onde o número de repetições é limitada6. Para fazer processamento e análise de conjuntos de dados de sequenciamento de DNA confiável, completo, robusto e acessível para os investigadores sem especialização bioinformática, desenvolvemos um conjunto de programas de software que cobrem todas as etapas de análise.

Esta suite de programas de software stand-alone que são executados em computadores desktop inclui MAPster, DEEPN e Stat_Maker. MAPster é uma interface gráfica de usuário que permite que cada arquivo de fastq na fila para mapear o genoma usando o programa HISAT27, produzindo um arquivo Sam padrão para uso em aplicações a jusante. DEEPN tem vários módulos. Ele atribui e conta leituras correspondentes a determinado gene semelhante a uma quantificação de RNA-seq tipo usando o módulo 'Gene contagem'. Também extrai as sequências correspondentes a junção entre o domínio transcriptional Gal4 e a sequência de rapina e agrupa a posição desses cruzamentos para permitir a sua inspecção pelos quadros comparativos e gráficos (usando o módulo 'Junction_Make') O módulo 'Blast_Query' permite fácil inspeção, quantificação e comparação de sequências de junção de Gal4 de junção. Stat_Maker avalia as leituras por dados de enriquecimento gene estatisticamente como uma maneira de priorizar provável Y2H sucessos. Aqui, descrevemos como usar esses programas de software e totalmente analisar dados de um Y2H DEEPN experimentar a sequência de DNA. Versões do DEEPN estão disponíveis para rodar em sistemas Linux, Mac e PC. Outros programas, como o programa de mapeamento MAPster e o módulo de estatísticas DEEPN Stat_Maker dependem de sub-rotinas que executado sob Unix e estão disponíveis apenas em sistemas Mac e linux.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

1. mapeamento de arquivos de Fastq

Nota: DEEPN software, bem como muitos programas de Bioinformática usam dados de sequência de DNA onde cada sequência ler foi mapeada para a sua posição em referência DNA. Uma variedade de programas de mapeamento pode ser usada para esta incluindo a interface MAPster aqui que usa o programa HISTAT2 para produzir arquivos Sam usados em etapas subsequentes.

  1. Mapear os dados de sequência para a versão correta do genoma. Para bibliotecas de Y2H de origem do mouse, use o genoma de mm10 UCSC; para aqueles que utilizam os genes humanos, uso o genoma de referência UCSC hg38, para genes de Saccharomyces cerevisiae , o genoma de referência de UCSC SacCer3.
  2. Instale o MAPster.
    1. Baixar software MAPster e instalar. O software pode ser encontrado usando um navegador da web para o seguinte: https://github.com/emptyewer/MAPster/releases. HISAT2 é executado em sistemas baseados em Unix como um Apple Macintosh. Por causa disso, o programa MAPster só vai funcionar em sistemas compatíveis, como o Apple Macintosh e linux.
      Nota: Requisitos do sistema para um Mac da Apple são: OSX 10,10 +, > 4 Gb de RAM, > 500 Gb de espaço em disco e acesso à internet para download de genomas de referência. Os usuários podem precisar de o consultar com um institucional pessoa se sua empresa tem protocolos de segurança Restringindo permissões e direitos de administrador.
  3. Insira arquivos necessários e parâmetros através da guia "Main" (Figura 1). Selecione o botão "Pairwise" apropriado para inserir arquivos ou como pares ou não pareado com FASTQ como o formato de arquivo padrão.
    1. Para análise DEEPN, ativar a opção de "Pairwise" para "Off" para ser executado em um único formato de leitura.
    2. Carregar arquivos em MAPster bastando arrastar-e-soltar para a janela apropriada.
    3. Selecione uma fonte de DNA/genoma que corresponde à fonte das pastilhas Y2H rapina biblioteca de referência. Indexado genomas de diversos organismos modelo são listadas na caixa "Genoma" e podem ser automaticamente baixadas da Johns Hopkins University Center for Computational Biology. Genomas de referência serão armazenadas localmente para uso posterior.
    4. Indica o número de processos do computador para ser dedicado ao programa de mapeamento sob a caixa de "Threads", desde HISAT2 suporta multi-threading. MAPster irá Pesquisar o computador e sugerir o número máximo de processadores disponíveis por padrão.
    5. Especifique um nome de arquivo de saída. Este nome de arquivo será usado durante todo o processo DEEPN então recomenda-se um nome curto mas descritivo sem espaço ou caracteres especiais. Especifique uma pasta para os arquivos mapeados usando o botão "Abrir pasta de saida" de saída.
    6. Uma vez que os arquivos apropriados e parâmetros foram selecionados, adicione o trabalho de mapeamento para a fila de trabalhos usando o botão "Adicionar a fila". Os nomes de arquivo na janela principal podem ser eliminados e substituídos com os arquivos correspondentes a uma nova amostra e podem ser adicionados para a fila depois de fornecer um nome de arquivo de saída correspondente.
    7. Clique no botão "Executar fila", uma vez que todos os trabalhos são inseridos na fila de trabalho.
      Nota: Uma vez que um trabalho de mapeamento foi colocado na fila, selecionar esse trabalho faz com que as configurações de parâmetro a ser exibido na janela "Parâmetros de trabalho" e a instrução de linha de comando com todos os argumentos para ser exibido na janela do "Comando de trabalho". As opções de saída incluem dirigindo-se a manter leituras que não conseguem alinhar e especificando o número de alinhamentos primários permitidos para cada leitura. O arquivo de saída padrão de MAPster é em formato de SAM (por exemplo, um arquivo de 'Sam'). Ele conterá todas as leituras de sequência de arquivos fastq especificado para aquela amostra, incluindo aqueles que foram (mapeado) e não foram mapeadas com sucesso para o especificado geome (desmapeadas).

2. Bioinformatic processamento usando Software DEEPN

Nota: Software de DEEPN atualmente é compilado para uso com bibliotecas de rapina contendo sequências de cDNA de rato, sequências de cDNA humano ou sequências de DNA genômicas de S. cerevisiae . DEEPN aceita o formato de arquivo padrão Sam e pode aceitar um arquivo SAM (Sam) contendo leituras mapeadas e não mapeadas ou arquivos separados para cada um do lê não mapeado e mapeado.

  1. Download de software DEEPN e instalar. O software pode ser encontrado usando um navegador da web para o seguinte: https://github.com/emptyewer/DEEPN/releases. Selecione qual versão corresponde a plataforma de computação e o descarregamento. Para instalar, abra o pacote de instalação baixado.
    Nota: As versões do DEEPN estão disponíveis para PC, Mac e Linux sysrems. Devem ter sistemas Mac e PC > espaço no disco rígido de 500 Gb e > 4 Gb de RAM.
  2. Abra o software DEEPN. Selecione as informações de biblioteca de rapina correspondente da caixa de seleção superior a janela principal (Figura 2). Selecione uma pasta onde os arquivos processados podem ir clicando no botão "Pasta de trabalho" e navegando para a pasta/diretório. Uma pessoa pode criar um novo pasta/diretório se necessário. Uma vez que uma "pasta de trabalho" está selecionada, DEEPN criará três subpastas, intitulado unmapped_sam_files, mapped_sam_files e sam_files.
    1. Se usando arquivos Sam contendo leituras mapeadas e não mapeadas, tais como aqueles produzidos com as configurações padrão do programa MAPster, coloque-os na pasta 'sam_files'. Caso contrário coloque arquivos Sam no unmapped_sam_files e mapped_sam_files em conformidade.
  3. Inicie o processamento clicando no botão "Gene Count + junção fazer".
    Nota: O processamento começará com o módulo de contagem de Gene que usará as posições de mapeamento para contar quantas leituras correspondem a cada gene. Make de junção, em seguida, extrair sequências de junção (as sequências fundiram diretamente a jusante do domínio de Gal4-ativação) do lê e identificá-los usando o algoritmo de explosão. Isto irá criar um conjunto de pastas retratado na Figura 3. Tempo de processamento depende do tamanho e número de sequência de arquivos de dados e velocidade de processamento do computador usado. Lê vezes típicas variam de 12 a 30 h para um conjunto de dados experimental de 250 milhões. O procedimento de Gene contagem e o procedimento Junction_Make podem ser iniciados individualmente clicando no botão "Gene contagem" ou o botão "Fazer junção".
  4. Baixe e instale o Stat_Maker (https://github.com/emptyewer/DEEPN/releases). Este é um pacote de análise estatística, projetado para conjuntos de dados DEEPN que atualmente só funciona em sistemas Unix Mac.
    1. Abra Stat_Maker e clique no botão "Verificar a instalação" (Figura 4). Se executando pela primeira vez, Stat_Maker instalará automaticamente R, JAGS e Bioconductor puxando esses recursos da internet. Uma vez que R e JAGS Bioconductor são detectados, Stat_Maker se tornará ativo e permitir a entrada do usuário.
    2. Clique no botão "Escolher pasta" para navegar até a pasta de trabalho que DEEPN processado. Stat_Maker automaticamente encontrar e listar os arquivos para a análise estatística na janela.
    3. Arraste e solte os arquivos apropriados da janela de lista de arquivo acima no windows arquivo abaixo para cada conjunto de dados vetoriais e isca e para cada condições de crescimento: não selecionado (a + mídia) e selecionado (a mídia). Importante, Stat_Maker requer conjuntos de dados duplicados para vazio vector em paz, duas amostras de populações não selecionadas e duas amostras de selecionado. Isto dá uma estimativa de variabilidade dentro do experimento.
    4. Clique no botão "Executar". Dependendo da velocidade do computador, computação levará entre 5 a 15 min.
  5. Rever os resultados da saída do Stat_Maker, que são colocados em uma nova subpasta dentro da pasta de trabalho principal rotulada "Stat_Maker resultados".
    Nota: Os resultados são encontrados em um arquivo CSV (valores separados por vírgula) que pode ser aberto, em comum, programas de planilha eletrônica. Stat_Maker irá classificar hits de gene que são susceptíveis de ser diferencialmente enriquecida em seleção com a isca de interesse sobre o vazio pTEF-GBD (Figura 5). Também tabulados é a percentagem de leituras para cada conjunto de dados onde a inserção do gene encontra-se a montante, a jusante, ou dentro do frame de leitura aberto e se o gene também é encontrado dentro do quadro de leitura correta de translação. Muitas vezes, DEEPN irá capturar robustas interações Y2H de uma isca com porções de um cDNA dado que são fora do quadro de leitura adequada da proteína correspondente ou a uma parte do cDNA que está a jusante do seu quadro de leitura aberta correspondente. A saída combinada de Stat_Maker de digitalização agiliza deteção e eliminação destes sucessos irrelevantes.
  6. Para rever os dados sobre cada candidato em potencial, abra o software DEEPN, selecione as informações de biblioteca de rapina correspondente e, em seguida, a pasta de trabalho correto usando a "pasta de trabalho".
    1. Clique no botão "Consulta de explosão". Isso carrega uma nova janela (Figura 6). Na caixa de texto superior, digite o nome do gene ou o número do GenBank NM para selecionar o gene candidato de interesse. Esses nomes de gene correspondem aos nomes listados no arquivo de saída de StatMaker. Tipo entrar ou retornar, que inicia a recuperação do gene de interesse.
    2. Selecione quais conjuntos de dados serão utilizados para a análise usando os menus "Selecione Dataset". Normalmente, estes incluem o vetor somente e isca amostras crescidas sob condições não-seletivo e a amostra de isca cultivadas sob condições de seleção. Inicialmente, os conjuntos de dados irão levar alguns momentos para carregar, no entanto, a consulta subsequentes dos mesmos conjuntos de dados com genes diferentes vai rapidamente. Blast_Query irá exibir os pontos de fusão junto a sequência de interesse e abundante como cada ponto de fusão é. Isto pode ser exibido em um formato gráfico usando a guia de "Conspiração" ou um formato de tabela, usando a guia "Resultados". Estes resultados podem ser exportados para um arquivo. csv, clicando no botão "Salvar. csv" no canto superior direito.

3. verificação de candidatos identificados por DEEPN

Nota: O propósito de DEEPN e Stat_Maker é identificar genes candidatos que dão uma interação positiva de Y2H. Verificar tais interações de Y2H pode ser feito usando um formato tradicional de Y2H binário usando o plasmídeo isca de interesse emparelhado com o plasmídeo de rapina' domínio' Gal4-ativação vazio bem como emparelhado com o plasmídeo de rapina carregando o fragmento do gene/do cDNA de interesse. Não é viável para isolar o plasmídeo real de interesse dentro da mistura de DNA isolado da população de leveduras submetida a seleção Y2H. No entanto, um pode computacionalmente reconstruir o que o fragmento do gene/cDNA é que produz a interação Y2H, projetar primers para a 5' e 3' extremidades desse fragmento e amplificar o fragmento de DNA isolado da população de leveduras. Esta seção descreve como localizar a extremidade 5' e 3' do fragmento de rapina do candidato.

  1. Abra o software DEEPN e escolher os parâmetros "Parâmetro Select" e a pasta de trabalho "Selecione trabalho pasta" correspondente ao projeto. Lançar o módulo Blast_Query clicando no botão "Consulta de explosão".
  2. Digite o nome do gene de interesse ou sua GenBank "NM" número na caixa de texto superior. Selecione o menu pull-down do conjunto de dados que corresponde à população levedura selecionada para a isca de interesse para recuperar a tabela de posições da junção na aba 'Resultados'. Por padrão, Blast_Query requisitará as diferentes posições de acordo com a sua abundância no dataset, quantificada pelo ppm do número total dos cruzamentos encontrados dentro do banco de dados.
    1. Encontrar uma posição da mais abundante, que é "no ORF" e "no quadro". O valor de posição corresponde à posição de nucleotídeos do gene com a sequência de referência NCBI (número de 'NM') encontrada na caixa de texto superior. Essa sequência pode ser Obtida de GenBank (https://www.ncbi.nlm.nih.gov/nuccore/) ou copiada da caixa de texto inferior na janela Blast_Query.
      Nota: Um exemplo pode ser encontrado na Figura 6, painel do meio. No centro conjunto de dados, os 'resultados' mostraram como a junção de mais abundante: 'Posição': 867; '#Junctions': 20033.821; 'Início da consulta', 1; CDS: No ORF; e 'Frame': no quadro. 867 de nucleótidos da sequência de referência NCBI GenBank NM_019648 é o início do fragmento de rapina.
  3. Se começar a consulta for 1, desenha a extremidade 5' do primer para incluir o nucleotídeo correspondente ao número de posição e estender 25 nucleotídeos a jusante da posição (Figura 7). Se começar a consulta é mais do que 1, indica que há nucleotídeos extras entre o domínio de activação de Gal4 e a sequência de presas de interesse e que a primeira demão deve começar mais a jusante de acordo com o valor do início da consulta.
  4. Da janela DEEPN clique no botão de "Profundidade de leitura" sob "Analisar dados". Uma vez que a janela de leitura de profundidade é aberta, digite o NCBI referência sequência (NM) número ou gene nome na caixa de texto superior. Use o menu pull-down para selecionar o conjunto de dados relevante que contém o gene enriquecido de interesse. Utilize a tabela do lado esquerdo e os gráficos exibir à direita para determinar quantas leituras foram encontradas nos dados que correspondem ao gene de interesse (Figura 7-B).
  5. Desenha uma cartilha da extremidade 3' que irá capturar a sequência do fragmento do gene calculado pela profundidade de leitura. Se a abundância de leituras ultrapassa a ORF e pare de códon, desenha a primeira demão para que inclui o códon de parada e a região só montante do códon de parada. Se as sequências do gene não ultrapassam o codão stop, use a tabela de resultados para localizar a região 3' mais distante que pode ser detectada e use esta posição como o mais distante 3' posição para colocar o primer.
    Nota: O programa de leitura de profundidade verifica em intervalos para encontrar as sequências que correspondem o especificado gene/do cDNA de interesse. Isto ajuda a prever onde o final 5' e 3' do fragmento de rapina mais abundante é para esse gene na amostra. Flutuações na profundidade ao longo do comprimento da sequência de leitura são normais, como pode ser visto na Figura 7. Se a profundidade de leitura é claramente passado o códon de parada, ele indica que o fragmento de rapina se estende além do códon de parada e, portanto, o 3' primer pode simplesmente correspondem a região em torno do códon de parada.
  6. Realize uma reação de PCR de 50 µ l por gene. Cada reação contém 25 pmol de cada primer frente e verso, combinando o plasmídeo de rapina-biblioteca (ver tabela de materiais). Reações também contem 25 µ l de alta-fidelidade 2 x PCR Master Mix, 5 µ g de amostra de DNA e a água até 50 µ l.
    1. Amplificar as reações para 25 ciclos com tempos de extensão de 3 min a 72 ° C, recozimento a temperatura de 55 ° C por 30 s e desnaturando a 98 ° C, durante 10 s. Precede a bicicleta por uma desnaturação s 30 a 98 ° C e siga com uma incubação de 5 min a 72 ° C.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Mapeamento de dados de fastq: o primeiro passo
Em praticamente todas as aplicações de NGS incluindo DEEPN a saída inicial é um arquivo de leituras de pequena sequência deve ser mapeada pelo alinhamento de genômica, transcriptomic, ou outra referência de DNA8. Recentemente, o programa de alinhamento de HISAT2 foi desenvolvido que usa algoritmos de indexação de estado-da-arte para aumentar drasticamente a velocidade de mapeamento...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

O pacote de software aqui descrito permite completamente processar e analisar dados de sequenciamento de DNA de alto throughput de uma experiência de DEEPN. O primeiro programa usado é o MAPster, que leva as leituras de sequência de DNA em arquivos padrão fastq e mapas de sua posição para uma referência de DNA para processamento a jusante, por uma série de programas de informática, incluindo o software DEEPN. O utilitário da interface MAPster e sua capacidade de enfileirar vários trabalhos, combinar arquivos de entrada, ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores não têm nada a divulgar

Agradecimentos

Este trabalho foi financiado pelo National Institutes of Health: R21 NIH EB021870-01A1 e pelo NSF Grant de projeto de pesquisa: 1517110.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Mapsterhttps://github.com/emptyewer/MAPster/releases
softwarehttps://github.com/emptyewer/DEEPN/releases
Statmakerhttps://github.com/emptyewer/DEEPN/releases
Sistema de computador mínimoAppleMac Intel Core i5 ou superior
-4 Gb RAM ou
Gb Disk spce ou
melhor-OS10.10 ou superior
DellIntel i5-7400 ou
superior-4Gb RAM ou
melhor-500Gb Disk spce ou
melhor-Windows7 ou superior
DEEPN melhor-500

Referências

  1. Fields, S., Song, O. A novel genetic system to detect protein-protein interactions. Nature. 340 (6230), 245-246 (1989).
  2. Rajagopala, S. V. Mapping the Protein-Protein Interactome Networks Using Yeast Two-Hybrid Screens. Advances in Experimental Medicine and Biology. 883, 187-214 (2015).
  3. Weimann, M., et al. A Y2H-seq approach defines the human protein methyltransferase interactome. Nature Methods. 10 (4), 339-342 (2013).
  4. Yachie, N., et al. Pooled-matrix protein interaction screens using Barcode Fusion Genetics. Molecular Systems Biology. 12 (4), 863(2016).
  5. Trigg, S. A., et al. CrY2H-seq: a massively multiplexed assay for deep-coverage interactome mapping. Nature Methods. , (2017).
  6. Pashkova, N., et al. DEEPN as an Approach for Batch Processing of Yeast 2-Hybrid Interactions. Cell Reports. 17 (1), 303-315 (2016).
  7. Kim, D., Langmead, B., Salzberg, S. L. HISAT: a fast spliced aligner with low memory requirements. Nature Methods. 12 (4), 357-360 (2015).
  8. Reinert, K., Langmead, B., Weese, D., Evers, D. J. Alignment of Next-Generation Sequencing Reads. Annual Review of Genomics and Human Genetics. 16, 133-151 (2015).
  9. Pertea, M., Kim, D., Pertea, G. M., Leek, J. T., Salzberg, S. L. Transcript-level expression analysis of RNA-seq experiments with HISAT, StringTie and Ballgown. Nature Protocols. 11 (9), 1650-1667 (2016).
  10. Conesa, A., et al. A survey of best practices for RNA-seq data analysis. Genome Biology. 17, 13(2016).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Etiquetas

Duplo H brido de LeveduraAn lise de Dados de SequenciamentoSoftware MAPsterAn lise DEEPNPrograma Stat MakerRedes de Intera o ProteicaProcessamento Bioinform ticoTriagem de Alto RendimentoPerfil de Enriquecimento G nicoAn lise de Matriz de Leitura Translacional