December 10th, 2012
Nuestro punto de cambio bayesiano (BCP) algoritmo se basa en los avances del estado de la técnica de modelado en los puntos de cambio a través de modelos ocultos de Markov y los aplica a la cromatina immunoprecipitation secuenciación (ChIPseq) el análisis de datos. BCP funciona bien en ambos tipos de datos amplios y punteada, pero sobresale en la identificación precisa de las islas robustas, reproducibles de enriquecimiento histona difusa.
El objetivo general del siguiente experimento es utilizar la densidad de las posiciones de lectura mapeadas de los datos de secuenciación de inmunoprecipitación de cromatina para estimar la densidad de lectura media posterior en todo el genoma. Esto se logra mediante el preprocesamiento. El ChIP-seq mapeado lee en perfiles de densidad bloqueados con el mismo número de lecturas que se encuentran dentro de 200 bins no superpuestos de pares de bases.
Cualquier bins adyacente con la misma densidad se fusiona en un bloque más grande como segundo paso; las densidades medias posteriores de cada bloque se calculan recursivamente dentro del contexto de todos los bloques circundantes utilizando un modelo bayesiano con filtros hacia adelante y hacia atrás. Donde el recuento de lecturas de un bloque se modela con una distribución de Poisson con un parámetro theta que adopta una distribución gamma previa con parámetros alfa y beta. A continuación, se evalúan las estimaciones de la densidad media posterior de cada bloque en función de si supera o no el cuantil 90 con respecto a la densidad de fondo del control de entrada para generar los segmentos finales del genoma enriquecido. Se obtienen resultados que ilustran la progresión de las lecturas secuenciadas sin procesar a las estimaciones de densidad de lectura media posterior. y, por último, islas enriquecidas en los datos de ChIP-seq durante el análisis de BCP.
Además, los resultados muestran que el BCP supera a una herramienta de la competencia. La principal ventaja de esta técnica sobre los métodos existentes como CER es que BCP utilizó los avances A más recientes en modelos de marcadores ocultos, por lo que caracteriza mejor los matices del análisis de datos chipsy que los métodos heurísticos anteriores. Este método puede ayudar a preguntas clave en el campo de la epigenómica, como el papel de las modificaciones histológicas mediante la caracterización de sus patrones de enriquecimiento en todo el genoma.
Aunque este método del paciente puede proporcionar información sobre el análisis de datos ChIP-seq, el marco básico también se puede aplicar a otros análisis de datos de secuenciación de próxima generación, como la identificación de regiones metiladas diferencialmente en datos de secuenciación bis sufíes, nuevos loci de transcripción en RNA-Seq, variación del número de copias o cualquier número de datos de mosaico de microarrays. La demostración visual de este método es fundamental para una comprensión clara de la metodología y es beneficiosa. Las ventajas teóricas están ocultas dentro del software.
Todos los pasos de procedimiento que se muestran aquí se han empaquetado en un solo ejecutable en el paquete de software BCP, que está disponible para su descarga en este video. Se describen los pasos ejecutados por el programa para ejecutar el software. Se requieren tres parámetros.
Un archivo que contiene lecturas asignadas de forma única de una muestra de chip y un archivo similar para lecturas de control de entrada, así como un nombre de archivo de salida para preparar archivos de entrada para el análisis BCP. En primer lugar, alinee las lecturas cortas producidas a partir de las secuenciaciones con el genoma de referencia adecuado utilizando el software de alineación de lecturas cortas preferido. Las ubicaciones mapeadas deben convertirse al formato de datos extensibles del navegador de seis columnas o BED, una línea delimitada por tabulaciones por lectura mapeada que indique la posición inicial, la posición final, el nombre de lectura, la puntuación y la hebra del cromosoma mapeado.
Amplíe las ubicaciones del chip y del mapa de entrada a una longitud de fragmento predeterminada. Por ejemplo, el tamaño del fragmento objetivo durante la digestión enzimática o la sonicación del ADN, normalmente en torno a los 200 pares de bases. A continuación, los recuentos de fragmentos se agregan en bins adyacentes.
De forma predeterminada, el tamaño de bin se establece en la longitud de fragmento estimada de 200 pares de bases. Lo más probable es que los posibles puntos de cambio en un conjunto de bins con recuentos idénticos caigan en los límites más exteriores. En consecuencia, es improbable que se produzca un punto de cambio en un límite interno entre dos bins con los mismos recuentos de lectura.
Por lo tanto, agrupe las agrupaciones adyacentes con lecturas idénticas por ubicación en un solo bloque. Después de preparar los archivos de entrada, invoque la estimación BCP simplemente escribiendo el comando que se muestra en la parte inferior de la pantalla. La densidad de lectura de cada bloque se modela como una distribución de Poisson con un parámetro medio theta que sigue una mezcla de distribuciones gamma con parámetros alfa y beta y una probabilidad previa de que ocurra un punto de cambio en cualquier bloque.
El límite de P condiciona cada bloque de esta manera y genera efectivamente un modelo de Markov oculto de estado infinito o HMM. Los hiperparámetros alfa, beta y P se estiman utilizando la máxima probabilidad posterior. Las estimaciones de las bahías se calculan explícitamente para cada bloque theta sub T como la expectativa de theta sub T dado que sub T los filtros de avance y retroceso más tradicionales pero lentos que se utilizan a menudo en HMS se reemplazan con la aproximación de mezcla de complejidad acotada más eficiente computacionalmente para estimar las medias posteriores theta hat sub T. Las medias posteriores resultantes se suavizarán en un perfil constante aproximado por partes, por lo tanto, los bloques con theta hat sub T idénticos deben bloquearse aún más junto con coordenadas de límite actualizadas.
BCP utiliza el número de lecturas de entrada por bloque como tasa de fondo y determina el enriquecimiento. Usando una prueba de hipótesis simple basada en si la densidad media de la posición del chip para un bloque excede algún umbral de significación. El cuantil 90 es el umbral predeterminado y es apropiado en la mayoría de los casos.
A continuación, BCP fusiona los bloques de densidad media posteriores adyacentes que superan el enriquecimiento en una sola región e informa de las coordenadas fusionadas en el navegador. Formato de datos extensible BCP sobresale en la identificación de regiones de amplio enriquecimiento en datos de modificación de histonas. Aquí. Los resultados de BCP se comparan con los de cser, una herramienta existente que ha demostrado un gran rendimiento. El trabajo previo de este laboratorio que estudia la trimetilación de H, tres K 36 demostró una tendencia a un tamaño de isla mucho mayor en BCP que en cer.
Las islas más grandes están más en línea con la expectativa convencional de islas amplias y difusas de enriquecimiento de trimetilación de H 3 K 36. Las islas más grandes no indican por sí solas precisión. Por lo tanto, se utilizó la asociación conocida de las islas de trimetilación H tres K 36 con cuerpos de genes transcritos activamente, así como su exclusividad mutua con las islas de trimetilación H three K 27 para evaluar el rendimiento de BCP y CER en comparación con CER BCP llamadas islas contiguas más grandes que capturan mejor los cuerpos de genes sin sacrificar una mayor superposición con H tres K 27. Islas de trimetilación.
BCP mantiene la alta superposición de genes activos por H tres islas de trimetilación K 36 con límites estrechamente alineados con los cuerpos de genes sin aumentar el grado de superposición de falsos positivos con genes del espacio intergénico con transcripción reprimida o la marca represiva de TRIMETILACIÓN H tres K 27 mientras evalúa la reproducibilidad de las llamadas de la isla BCP en dos conjuntos de datos replicados, se observó que el BCP no sufría de una fuerte dependencia de la profundidad de cobertura de la caña en el algoritmo competidor cer evidencia adicional de la robustez y reproducibilidad del BCPS mediante el examen de regiones distintas adicionales, demostrando límites de islas consistentes a pesar de la profundidad de cobertura reducida. Para demostrar completamente la versatilidad del BCP, se obtuvo un amplio espectro de datos de modificación de histonas, incluidas las marcas de puntuación H tres K 27 acetilación, H tres K nueve acetilación y H tres K cuatro trimetilación, y la marca difusa H tres K nueve trimetilación además de la trimetilación H tres K 27 y H tres K 36 trimetilación. Estos conjuntos de datos se analizaron utilizando la configuración de parámetros predeterminada para BCP y cser.
En el centro se encuentra el enriquecimiento de trimetilación H tres K 36 en el gen PX DN que marca la transcripción activa que cae esperadamente en el sitio de inicio de la transcripción están las marcas activas punteadas adicionales H tres K 27 acetilación, H tres K nueve acetilación y H tres K cuatro trimetilación. Justo aguas abajo de PXDN se encuentra el espacio intergénico reprimido marcado por el enriquecimiento de trimetilación de H 3 K 27 en el flanco opuesto se encuentra un gen reprimido de trimetilación H three K 27. Dando un paso más.
Nuestra cromatina silenciada como lo indica la presencia de enriquecimiento de trimetilación de H tres K nine, que parece indicar el silenciamiento de SN TG dos y MYT uno L, quizás en un sentido menos transitorio que la represión de trimetilación de H tres K 27. Esta región abarca la mayoría de los fenómenos encontrados en ChIPseek de modificaciones de histonas. Ilustra cómo la naturaleza dinámica de BCP puede identificar tanto la acetilación punteada como las marcas de trimetilación H three K four, mientras que al mismo tiempo distingue grandes islas contiguas de trimetilación H tres K 27 y H tres K nueve represión de trimetilación, así como la transcripción activa de trimetilación H tres K 36.
Este algoritmo se puede realizar aproximadamente 30 minutos, dependiendo del número de lecturas y del resultado de los signos del genoma. Cualquier optimización significativa, como a menudo se requiere con otros métodos siguiendo este procedimiento. Muchas proteínas diana diferentes de la inmunoprecipitación de cromatina se pueden estudiar utilizando BBCP, incluidas otras modificaciones de hisona, así como factores de transcripción de unión al ADN, para responder preguntas adicionales sobre los mecanismos epigenómicos y la regulación génica.
Después de ver este video, debería tener una buena comprensión de cómo se usa BCP para identificar regiones al alcance de las marcas difusas de hisone en el análisis de datos chipsy.
View the full transcript and gain access to thousands of scientific videos
Este estudio presenta un algoritmo de Punto de Cambio Bayesiano (BCP) que mejora el análisis de datos de secuenciación de inmunoprecipitación de cromatina (ChIP-seq). Mediante el uso de Modelos de Markov Ocultos, BCP identifica eficazmente regiones de enriquecimiento de histonas en tipos de datos tanto amplios como puntuales.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.