December 10th, 2012
Nosso ponto de mudança Bayesiana (BCP) algoritmo baseia-se no estado-da-arte avanços em modelagem de mudanças de pontos através de modelos ocultos de Markov e os aplica a cromatina imunoprecipitação seqüenciamento (ChIPseq) análise de dados. BCP executa bem em tipos de dados ampla e pontuada, mas supera em identificar com precisão robustos, ilhas reproduzíveis de enriquecimento histona difusa.
O objetivo geral do experimento a seguir é utilizar a densidade das posições de leitura mapeadas a partir dos dados de sequenciamento de imunoprecipitação da cromatina para estimar a densidade média de leitura posterior em todo o genoma. Isso é obtido por pré-processamento. O ChIP-seq mapeado lê em perfis de densidade bloqueados com o mesmo número de leituras que se enquadram em 200 compartimentos não sobrepostos de pares de bases.
Quaisquer caixas adjacentes com a mesma densidade são mescladas em um bloco maior como uma segunda etapa, as densidades médias posteriores de cada bloco são calculadas recursivamente dentro do contexto de todos os blocos circundantes usando um modelo bayesiano com filtros para frente e para trás. Onde a contagem de leitura para um bloco é modelada com uma distribuição de Poisson com um parâmetro que assume uma distribuição gama anterior com parâmetros alfa e beta. Em seguida, as estimativas de densidade média posterior de cada bloco são avaliadas quanto à significância com base no fato de exceder ou não o 90º quantil em relação à densidade de fundo de controle de entrada, a fim de gerar os segmentos finais do genoma enriquecido, são obtidos resultados que ilustram a progressão de leituras sequenciadas brutas para estimativas de densidade de leitura média posterior, e, finalmente, ilhas enriquecidas em dados ChIP-seq durante a análise BCP.
Além disso, os resultados mostram que o BCP supera um fabricante de ferramentas concorrente. A principal vantagem dessa técnica sobre os métodos existentes, como o CER, é que o BCP usou os avanços A mais recentes em modelos de marcadores ocultos, portanto, caracteriza melhor as nuances da análise de dados chipsy do que os métodos heurísticos anteriores. Este método pode ajudar questões-chave no campo da epigenômica, como o papel das modificações histológicas por meio da caracterização de seus padrões de enriquecimento genômico.
Embora este método de paciente possa fornecer informações sobre a análise de dados ChIP-seq, a estrutura básica também pode ser aplicada a outras análises de dados de sequenciamento de próxima geração, como a identificação de regiões diferencialmente metiladas em dados de sequenciamento sufi bis, novos loci de transcrição em RNA-Seq, variação do número de cópias ou qualquer número de dados de mosaico de microarray. A demonstração visual desse método é fundamental para uma compreensão clara da metodologia e beneficia as coisas. As vantagens teóricas estão ocultas no software.
Todas as etapas processuais demonstradas aqui foram empacotadas em um único executável no pacote de software BCP, que está disponível para download neste vídeo. As etapas executadas pelo programa são descritas para executar o software. Três parâmetros são necessários.
Um arquivo contendo leituras mapeadas exclusivamente de uma amostra de chip e um arquivo semelhante para leituras de controle de entrada, bem como um nome de arquivo de saída para preparar arquivos de entrada para análise BCP. Primeiro, alinhe as leituras curtas produzidas a partir de execuções de sequenciamento com o genoma de referência apropriado usando o software de alinhamento de leitura curta preferido. Os locais mapeados devem ser convertidos para os dados extensíveis do navegador de seis colunas ou formato BED, uma linha delimitada por tabulação por leitura mapeada indicando a posição inicial do cromossomo mapeado, posição final, nome de leitura, pontuação e fita.
Estenda os locais do mapa de chip e entrada para um comprimento de fragmento predeterminado. Por exemplo, o tamanho do fragmento direcionado durante a digestão enzimática ou sonicação do DNA, geralmente em torno de 200 pares de bases. As contagens de fragmentos são então agregadas em compartimentos adjacentes.
Por padrão, o tamanho do compartimento é definido como o comprimento estimado do fragmento de 200 pares base. Quaisquer possíveis pontos de mudança em um conjunto de caixas com recontagens idênticas provavelmente cairão nos limites mais externos. Consequentemente, é improvável que um ponto de alteração ocorra em um limite interno entre dois compartimentos com as mesmas contagens de leitura.
Portanto, agrupe compartimentos adjacentes com leituras idênticas por compartimento em um único bloco. Depois de preparar os arquivos de entrada, chame a estimativa de BCP simplesmente digitando o comando mostrado na parte inferior da tela. A densidade de leitura de cada bloco é modelada como uma distribuição de poisson com um parâmetro médio seguindo uma mistura de distribuições gama com parâmetros alfa e beta e uma probabilidade prévia de um ponto de mudança ocorrer em qualquer bloco.
O limite de P condicionando cada bloco dessa maneira efetivamente renderiza um modelo de Markov oculto de estado infinito ou HMM. Os hiperparâmetros alfa, beta e P são estimados usando a máxima verossimilhança posterior. As estimativas de baias são explicitamente calculadas para cada bloco theta sub T como a expectativa de theta sub T, dado por que sub T os filtros para frente e para trás mais tradicionais, mas demorados, frequentemente usados no HMS são substituídos pela aproximação de mistura de complexidade limitada mais eficiente computacionalmente para estimar médias posteriores theta hat sub T. portanto, blocos com theta hat sub T idênticos devem ser bloqueados junto com coordenadas de limite atualizadas.
O BCP usa o número de leituras de entrada por bloco como a taxa de fundo e determina o enriquecimento. Usando um teste de hipótese simples baseado em se a densidade média da posição do chip para um bloco excede algum limite de significância. O 90º quantil é o limite padrão e é apropriado na maioria dos casos.
O BCP então mescla blocos de densidade média posterior adjacentes que excedem o enriquecimento em uma única região e relata as coordenadas mescladas no navegador. Formato de dados extensível O BCP se destaca na identificação de regiões de amplo enriquecimento em dados de modificação de histonas. Aqui. Os resultados do BCP são comparados aos do cser, uma ferramenta existente que demonstrou forte desempenho antes do trabalho deste laboratório estudando H três K 36 trimetilação demonstrou uma tendência para um tamanho de ilha muito maior no BCP do que cer.
Ilhas maiores estão mais alinhadas com a expectativa convencional de ilhas difusas amplas de enriquecimento de trimetilação H três K 36. Ilhas maiores não indicam precisão por si só. Portanto, a associação conhecida de H três K 36 Trimethylation Islands com corpos de genes ativamente transcritos, bem como sua exclusividade mútua com H três K 27 Trimethylation Islands, foi usada para avaliar o desempenho de BCP e CER em comparação com CER BCP chamadas de ilhas contíguas maiores que capturam melhor os corpos gênicos sem sacrificar o aumento da sobreposição com H três K 27, ilhas de trimetilação.
O BCP mantém a alta sobreposição de genes ativos por H três K 36 Ilhas de Trimetilação com limites estreitamente alinhados aos corpos gênicos sem aumentar o grau de sobreposição de falsos positivos com genes espaciais intergênicos com transcrição reprimida ou a marca repressiva H três K 27 TRIMETILAÇÃO enquanto avalia a reprodutibilidade das chamadas da Ilha BCP em dois conjuntos de dados replicados, observou-se que o BCP não sofria de uma forte dependência da profundidade de cobertura do junco no algoritmo concorrente cer evidência adicional de robustez e reprodutibilidade do BCPS é fornecida examinando regiões distintas adicionais, demonstrando limites de ilha consistentes, apesar da profundidade de cobertura reduzida. Para demonstrar plenamente a versatilidade do BCP, um amplo espectro de dados de modificação de histonas foi obtido, incluindo as marcas pontilhadas H três K 27 acetilação, H três K nove acetilação e H três K quatro trimetilação, e a marca difusa H três K nove trimetilação, além de H três K 27 trimetilação e H três K 36 trimetilação. Esses conjuntos de dados foram analisados usando as configurações de parâmetros padrão para BCP e cser.
No centro encontra-se o enriquecimento de trimetilação H três K 36 no gene PX DN marcando a transcrição ativa caindo esperadamente no local de início da transcrição estão as marcas ativas pontilhadas adicionais H três K 27 acetilação, H três K nove acetilação e H três K quatro trimetilação. Logo a jusante do PXDN está o espaço intergênico reprimido marcado pelo enriquecimento de trimetilação H três K 27 no flanco oposto encontra-se um gene reprimido H três K 27 TRIMETILAÇÃO. Movendo-se mais um passo para fora.
Nossa cromatina silenciada, conforme indicado pela presença de enriquecimento de trimetilação H três K nove, o que parece indicar silenciamento de SN TG dois e MYT um L, talvez em um sentido menos transitório do que a repressão de trimetilação H três K 27. Esta região engloba a maioria dos fenômenos encontrados em ChIPseek de modificações de histonas. Ele ilustra como a natureza dinâmica do BCP pode identificar tanto a acetilação pontilhada quanto as marcas de trimetilação H três K quatro, ao mesmo tempo em que distingue grandes ilhas contíguas de repressão de trimetilação H três K 27 e repressão de trimetilação H três K nove, bem como a transcrição ativa de trimetilação H três K 36.
Este algoritmo pode ser executado por cerca de 30 minutos, dependendo do número de leituras e do resultado dos sinais do genoma. Qualquer otimização significativa, como geralmente é necessária com outros métodos Seguindo este procedimento. Muitas proteínas-alvo diferentes da imunoprecipitação da cromatina podem ser estudadas usando BBCP, incluindo várias outras modificações de histona, bem como fatores de transcrição de ligação ao DNA para responder a perguntas adicionais sobre mecanismos epigenômicos e regulação gênica
.Depois de assistir a este vídeo, você deve ter uma boa compreensão de como o BCP é usado para identificar regiões ao alcance de marcas difusas de histona na análise de dados chipsy.
View the full transcript and gain access to thousands of scientific videos
Este estudo apresenta um algoritmo de Ponto de Mudança Bayesiano (BCP) que aprimora a análise de dados de sequenciamento de imunoprecipitação de cromatina (ChIP-seq). Ao utilizar Modelos de Markov Oculto, o BCP identifica efetivamente regiões de enriquecimento de histona em tipos de dados amplos e pontuais.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.