December 10th, 2012
Notre point de changement bayésien (BCP) algorithme s'appuie sur l'état de l'art des progrès de la modélisation ruptures par modèles de Markov cachés et les applique à immunoprécipitation de la chromatine séquençage (ChIPseq) l'analyse des données. BCP se comporte bien dans les types de données à la fois larges et ponctuées, mais il excelle dans l'identification précise robustes, reproductibles îles de l'enrichissement d'histone diffuse.
L’objectif global de l’expérience suivante est d’utiliser la densité des positions de lecture cartographiées à partir des données de séquençage de l’immunoprécipitation de la chromatine pour estimer la densité de lecture moyenne a posteriori sur le génome. Ceci est réalisé par prétraitement. Le ChIP-seq mappé lit dans des profils de densité bloqués avec le même nombre de lectures se situant dans des bacs de 200 paires de bases non chevauchantes.
Tous les groupes adjacents de même densité sont fusionnés en un bloc plus grand comme deuxième étape Les densités moyennes postérieures de chaque bloc sont calculées de manière récursive dans le contexte de tous les blocs environnants à l’aide d’un modèle bayésien avec des filtres avant et arrière. Où le nombre de lectures d’un bloc est modélisé avec une distribution de Poisson avec un paramètre thêta qui prend une distribution gamma a priori avec des paramètres alpha et bêta. Les estimations de la densité moyenne a posteriori suivante de chaque bloc sont évaluées pour leur signification selon qu’elles dépassent ou non le 90e quantile par rapport à la densité de fond du contrôle d’entrée afin de générer les segments finaux enrichis du génome. Les résultats sont obtenus qui illustrent la progression des lectures séquencées brutes aux estimations de la densité de lecture moyenne a posteriori, et enfin enrichi les îlots sur les données ChIP-seq lors de l’analyse BCP.
De plus, les résultats montrent que BCP surpasse un outil concurrent. Le principal avantage de cette technique par rapport aux méthodes existantes comme CER est que BCP a utilisé les avancées A les plus récentes dans les modèles de marqueurs cachés, de sorte qu’elle caractérise mieux la nuance de l’analyse de données chipsy que les méthodes heuristiques précédentes. Cette méthode peut aider à des questions clés dans le domaine de l’épigénomique, telles que le rôle des modifications de histo en caractérisant leurs modèles d’enrichissement à l’échelle du génome.
Bien que cette méthode patiente puisse fournir un aperçu de l’analyse des données ChIP-seq, le cadre de base peut également être appliqué à d’autres analyses de données de séquençage de nouvelle génération, telles que l’identification de régions différentiellement méthylées dans les données de séquençage bis soufi, de nouveaux loci de transcription dans RNA-Seq, la variation du nombre de copies ou un certain nombre de données de pavage de microréseaux. La démonstration visuelle de cette méthode est essentielle pour une compréhension claire de la méthodologie et elle présente des avantages. Les avantages théoriques sont cachés dans le logiciel.
Toutes les étapes procédurales présentées ici ont été regroupées dans un seul exécutable dans le progiciel BCP, qui peut être téléchargé dans cette vidéo. Les étapes exécutées par le programme sont décrites pour exécuter le logiciel. Trois paramètres sont requis.
Fichier contenant des lectures mappées de manière unique à partir d’un échantillon de puce et un fichier similaire pour les lectures de contrôle d’entrée, ainsi qu’un nom de fichier de sortie pour préparer les fichiers d’entrée pour l’analyse BCP. Tout d’abord, alignez les lectures courtes produites à partir des cycles de séquençage sur le génome de référence approprié à l’aide du logiciel d’alignement à lecture courte préféré. Les emplacements cartographiés doivent être convertis au format de données extensibles du navigateur à six colonnes ou au format BED, une ligne délimitée par une tabulation par lecture mappée indiquant la position de départ du chromosome cartographié, la position finale, le nom de lecture, le score et le brin.
Étendez les emplacements de la puce et de la carte d’entrée à une longueur de fragment prédéterminée. Par exemple, la taille du fragment ciblée lors de la digestion enzymatique ou de la sonication de l’ADN, généralement autour de 200 paires de bases. Le nombre de fragments est ensuite agrégé dans des groupes adjacents.
Par défaut, la taille du groupe est définie sur la longueur estimée du fragment de 200 paires de bases. Tous les points de changement possibles dans un ensemble de groupes avec des recomptages identiques tomberont très probablement aux limites les plus extérieures. Par conséquent, il est peu probable qu’un point de changement se produise à une limite interne entre deux groupes ayant le même nombre de lectures.
Par conséquent, regroupez les groupes adjacents avec des lectures identiques par groupe dans un seul bloc. Après avoir préparé les fichiers d’entrée, appelez l’estimation BCP en tapant simplement la commande affichée en bas de l’écran. La densité de lecture de chaque bloc est modélisée comme une distribution de Poisson avec un paramètre moyen thêta suivant un mélange de distributions gamma avec des paramètres alpha et bêta et une probabilité a priori qu’un point de changement se produise à n’importe quel bloc.
Limite de P, conditionnant chaque bloc de cette façon, rend effectivement un modèle de Markov caché à l’état infini ou HMM. Les hyperparamètres alpha, bêta et P sont estimés à l’aide du maximum de vraisemblance a posteriori. Les estimations des baies sont explicitement calculées pour chaque bloc thêta indice T comme l’attente de thêta indice T, étant donné pourquoi sub T, les filtres avant et arrière plus traditionnels mais chronophages souvent utilisés dans HMS sont remplacés par l’approximation de mélange de complexité bornée, plus efficace sur le plan du calcul, pour estimer les moyennes postérieures thêta hat sub T. Les moyennes a posteriori résultantes seront lissées en un profil constant approximatif par morceaux, ainsi, les blocs avec un thêta identique indice T devraient être bloqués davantage avec des coordonnées de limite mises à jour.
BCP utilise le nombre de lectures d’entrée par bloc comme taux d’arrière-plan et détermine l’enrichissement. À l’aide d’un test d’hypothèse simple, on sait si la densité moyenne de la position de la puce pour un bloc dépasse un certain seuil de signification. Le quantile 90 est le seuil par défaut et convient dans la plupart des cas.
BCP fusionne ensuite les blocs de densité moyenne postérieure adjacents qui dépassent l’enrichissement en une seule région et signale les coordonnées fusionnées dans le navigateur. Le format de données extensible BCP excelle dans l’identification des régions d’enrichissement large des données de modification des histones. Ici. Les résultats de la PCB sont comparés à ceux du CSER, un outil existant qui a démontré de solides performances avant les travaux de ce laboratoire sur l’étude de la triméthylation de H trois K 36 qui a démontré une tendance à une taille d’îlot beaucoup plus grande dans la PCB que dans le cer.
Les îlots plus grands sont plus conformes à l’attente conventionnelle de larges îlots diffus d’enrichissement en triméthylation de H three K 36. Les îles plus grandes n’indiquent pas à elles seules l’exactitude. Par conséquent, l’association connue des îlots de triméthylation H 33 K 36 avec des corps de gènes activement transcrits ainsi que leur exclusivité mutuelle avec les îlots de triméthyle H trois K 27 a été utilisée pour évaluer la performance du BCP et du CER par rapport au BCP CER appelés îlots contigus plus grands qui capturent mieux les corps de gènes sans sacrifier le chevauchement accru avec H three K 27, Îles de triméthylation.
La BCP maintient le chevauchement élevé des gènes actifs par les îlots de triméthylation H trois K 36 avec des limites étroitement alignées sur les corps de gènes sans augmenter le degré de chevauchement faux positif avec les gènes de l’espace intergénique avec transcription réprimée ou la marque répressive de triméthylation H three K 27 tout en évaluant la reproductibilité des appels d’îlots BCP dans deux ensembles de données répétées, Il a été observé que le BCP ne souffrait pas d’une forte dépendance à l’égard de la profondeur de couverture des roseaux dans l’algorithme concurrent. Pour démontrer pleinement la polyvalence de la PCB, un large éventail de données de modification des histones a été obtenu, y compris les marques ponctuées H trois K 27 acétylation, H trois K neuf acétylation et H trois K quatre triméthylation, et la marque diffuse H trois K neuf triméthylation en plus de H trois K 27 triméthylation et H trois K 36 triméthylation. Ces ensembles de données ont été analysés à l’aide des paramètres par défaut pour BCP et cser.
Au centre se trouve l’enrichissement de la triméthylation H trois K 36 au niveau du gène PX DN marquant la transcription active qui diminue de manière attendue au site de début de la transcription sont les marques actives ponctuées supplémentaires H trois K 27 acétylation, H trois K neuf acétylation et H trois K quatre triméthylation. Juste en aval de PXDN se trouve un espace intergénique réprimé marqué par l’enrichissement en triméthylation H trois K 27 sur le flanc opposé se trouve un gène réprimé H trois K 27 TRIMETHYLATION. Reculant d’un pas.
Notre chromatine réduite au silence, comme l’indique la présence d’un enrichissement en triméthylation de H trois K neuf, ce qui semble indiquer un silence de SN TG deux et MYT un L, peut-être dans un sens moins transitoire que la répression de la triméthylation H trois K 27. Cette région englobe la majorité des phénomènes rencontrés dans la recherche de modifications d’histones. Il illustre comment la nature dynamique de la PCB permet d’identifier à la fois l’acétylation ponctuée et les marques de triméthylation H trois K quatre, tout en distinguant en même temps de grands îlots contigus de triméthylation H trois K 27 et H trois K neuf répression de triméthylation, ainsi que H trois K 36 transcription active de triméthylation.
Cet algorithme peut être effectué environ 30 minutes en fonction du nombre de lectures et du résultat des signes du génome. Toute optimisation significative comme cela est souvent nécessaire avec d’autres méthodes En suivant cette procédure. De nombreuses protéines cibles différentes de l’immunoprécipitation de la chromatine peuvent être étudiées à l’aide de BBCP, y compris diverses autres modifications de l’hisone ainsi que des facteurs de transcription de liaison à l’ADN pour répondre à des questions supplémentaires sur les mécanismes épigénomiques et la régulation des gènes.
Après avoir regardé cette vidéo, vous devriez avoir une bonne compréhension de la façon dont le BCP est utilisé pour identifier les régions à portée de marques d’hisone diffuses dans l’analyse des données chipsy.
View the full transcript and gain access to thousands of scientific videos
Cette étude présente un algorithme de Point de Changement Bayésien (BCP) qui améliore l'analyse des données de séquençage d'immunoprécipitation de la chromatine (ChIP-seq). En utilisant des Modèles de Markov Cachés, le BCP identifie efficacement les régions d'enrichissement des histones dans les types de données à la fois larges et ponctuelles.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.