10 décembre 2012
Notre point de changement bayésien (BCP) algorithme s'appuie sur l'état de l'art des progrès de la modélisation ruptures par modèles de Markov cachés et les applique à immunoprécipitation de la chromatine séquençage (ChIPseq) l'analyse des données. BCP se comporte bien dans les types de données à la fois larges et ponctuées, mais il excelle dans l'identification précise robustes, reproductibles îles de l'enrichissement d'histone diffuse.
L'objectif général de l'expérience suivante est d'utiliser la densité des positions de lecture cartographiées issues de données de séquençage après immunoprécipitation de chromatine pour estimer la densité moyenne a posteriori des lectures à travers le génome. Ceci est réalisé par un prétraitement. Les lectures ChIP-séq cartographiées sont converties en profils de densité par blocs, avec le même nombre de lectures tombant dans des fenêtres non chevauchantes de 200 paires de bases.
À une deuxième étape, toutes les classes adjacentes ayant la même densité sont fusionnées en un bloc plus grand ; ensuite, les densités moyennes a posteriori de chaque bloc sont calculées de manière récursive dans le contexte de tous les blocs environnants à l’aide d’un modèle bayésien comportant des filtres avant et arrière. Le nombre de lectures pour un bloc est modélisé selon une distribution de Poisson avec un paramètre thêta qui suit une loi a priori gamma de paramètres alpha et beta. Ensuite, les estimations de la densité moyenne a posteriori de chaque bloc sont évaluées quant à leur signification statistique selon qu’elles dépassent ou non le quantile 90 par rapport à la densité de fond du contrôle d’entrée, afin de produire les segments génomiques enrichis finaux. Les résultats obtenus illustrent la progression allant des lectures brutes séquencées aux estimations de densité moyenne a posteriori, puis aux îlots enrichis sur des données ChIP-séquençage durant l’analyse BCP.
En outre, les résultats montrent que BCP surpasse un outil concurrent, cer. Le principal avantage de cette technique par rapport aux méthodes existantes comme CER est que BCP utilise les avancées les plus récentes en matière de modèles de marqueurs cachés, ce qui lui permet de mieux caractériser les subtilités de l'analyse de données chipsy par rapport aux méthodes heuristiques antérieures. Cette méthode peut aider à répondre à des questions clés dans le domaine de l'épigénomique, telles que le rôle des modifications histones grâce à la caractérisation de leurs profils d'enrichissement à l'échelle du génome.
Bien que cette méthode rigoureuse puisse offrir des aperçus utiles pour l'analyse de données ChIP-séq, le cadre de base peut également s'appliquer à l'analyse d'autres données de séquençage de nouvelle génération, comme l'identification de régions différentiellement méthylées dans des données de séquençage bis-Séfi, de nouveaux locus de transcription dans des données ARN-Séq, de variations du nombre de copies ou de tout type de données de puces à ADN par balayage. La démonstration visuelle de cette méthode est essentielle pour bien comprendre la méthodologie et ses avantages. Les avantages théoriques sont intégrés au logiciel.
Toutes les étapes procédurales présentées ici ont été regroupées en un seul exécutable inclus dans le logiciel BCP, disponible au téléchargement dans cette vidéo. Les étapes exécutées par le programme sont décrites afin de permettre l'utilisation du logiciel. Trois paramètres sont requis.
Un fichier contenant les lectures uniques mappées provenant d'un échantillon chip et un fichier similaire pour les lectures de contrôle d'entrée, ainsi qu'un nom de fichier de sortie pour préparer les fichiers d'entrée destinés à l'analyse BCP. Tout d'abord, alignez les lectures courtes produites par les séries de séquençage sur le génome de référence approprié à l'aide du logiciel d'alignement de lectures courtes privilégié. Les positions mappées doivent être converties au format BED (données extensibles pour navigateur) à six colonnes, chaque lecture mappée étant représentée par une ligne séparée par des tabulations indiquant le chromosome, la position de départ, la position d'arrivée, le nom de la lecture, le score et le brin.
Étendez les positions du puces et de la carte d'entrée à une longueur de fragment prédéterminée. Par exemple, la taille de fragment visée lors de la digestion enzymatique ou de la sonication de l'ADN, généralement d'environ 200 paires de bases. Les décomptes de fragments sont ensuite regroupés dans des intervalles adjacents.
Par défaut, la taille des classes est définie sur la longueur estimée des fragments, soit 200 paires de bases. Tout point de changement possible dans un ensemble de classes ayant des nombres identiques de lectures se situera très probablement aux limites les plus externes. Par conséquent, il est improbable qu'un point de changement se produise à une limite interne entre deux classes ayant le même nombre de lectures.
Par conséquent, regroupez les compartiments adjacents ayant un nombre identique de lectures par compartiment en un seul bloc. Après avoir préparé les fichiers d'entrée, lancez l'estimation BCP en tapant simplement la commande indiquée au bas de l'écran. La densité de lectures de chaque bloc est modélisée selon une distribution de Poisson avec un paramètre moyen theta suivant un mélange de distributions gamma ayant des paramètres alpha et beta, ainsi qu'une probabilité a priori de présence d'un point de rupture à n'importe quel bloc.
La délimitation de P conditionnant chaque bloc de cette manière rend effectivement un modèle de Markov caché à état infini, ou HMM. Les hyperparamètres alpha, beta et P sont estimés à l'aide du maximum de vraisemblance a posteriori. Les estimations bayésiennes sont explicitement calculées pour chaque bloc theta indice T comme l'espérance de theta indice T étant donné y indice T ; les filtres avant et arrière plus traditionnels, mais chronophages, souvent utilisés dans les HMM, sont remplacés par une approximation de mélange à complexité bornée, plus efficace sur le plan computationnel, afin d'estimer les moyennes a posteriori theta chapeau indice T. Les moyennes a posteriori obtenues seront lissées en un profil approximativement constant par morceaux, de sorte que les blocs ayant des valeurs identiques de theta chapeau indice T doivent être regroupés davantage, avec des coordonnées de frontières mises à jour.
BCP utilise le nombre de lectures d'entrée par bloc comme taux de fond et détermine l'enrichissement. À l'aide d'un test d'hypothèse simple basé sur le fait que la densité moyenne de la position chip pour un bloc dépasse un certain seuil de significativité. Le quantile 90e est le seuil par défaut et convient dans la plupart des cas.
BCP fusion ensuite des blocs adjacents de densité moyenne postérieure dépassant l'enrichissement en une seule région et signale les coordonnées fusionnées dans le navigateur. Le format de données extensible BCP excelle à identifier des régions d'enrichissement large dans les données de modification des histones. Ici, les résultats de BCP sont comparés à ceux de cser, un outil existant qui a démontré de bonnes performances ; des travaux antérieurs de ce laboratoire étudiant la triméthylation de H trois K 36 ont révélé une tendance à des îlots beaucoup plus grands avec BCP qu'avec cer.
Les îlots plus grands sont plus conformes à l'attente classique d'îlots larges et diffus d'enrichissement en triméthylation de H3K36. La taille des îlots, prise isolément, n'indique pas à elle seule la précision. Par conséquent, l'association connue entre les îlots de triméthylation de H3K36 et les régions codantes de gènes activement transcrits, ainsi que leur caractère mutuellement exclusif par rapport aux îlots de triméthylation de H3K27, ont été utilisés pour évaluer les performances de BCP et de CER par rapport à CER. BCP a appelé des îlots contigus plus grands qui représentent mieux les régions codantes des gènes, sans pour autant augmenter le recouvrement avec les îlots de triméthylation de H3K27.
BCP maintient un fort recouvrement des gènes actifs par les îlots de triméthylation de la lysine 36 de l'histone H3, dont les limites sont étroitement alignées sur les régions codantes des gènes, sans augmenter le taux de faux positifs dans les régions intergéniques associées à une transcription réprimée ou à la marque répressive de triméthylation de la lysine 27 de l'histone H3. Lors de l'évaluation de la reproductibilité des appels d'îlots BCP sur deux jeux de données répliqués, on a observé que BCP ne présentait pas une forte dépendance à la profondeur de couverture, contrairement à l'algorithme concurrent cser. Des preuves supplémentaires de la robustesse et de la reproductibilité de BCP sont apportées par l'analyse de régions distinctes supplémentaires, démontrant des limites d'îlots cohérentes malgré une réduction de la profondeur de couverture. Pour illustrer pleinement la polyvalence de BCP, un large éventail de données sur les modifications histoniques a été obtenu, incluant les marques ponctuelles que sont l'acétylation de la lysine 27 de l'histone H3, l'acétylation de la lysine 9 de l'histone H3 et la triméthylation de la lysine 4 de l'histone H3, ainsi que la marque diffuse que constitue la triméthylation de la lysine 9 de l'histone H3, en plus de la triméthylation de la lysine 27 de l'histone H3 et de la triméthylation de la lysine 36 de l'histone H3. Ces jeux de données ont été analysés à l'aide des paramètres par défaut pour BCP et cser.
Au centre se trouve un enrichissement en triméthylation de H3K36 au niveau du gène PXDN, marquant une transcription active, avec une chute attendue au site de démarrage de la transcription, où apparaissent des marques actives ponctuelles supplémentaires : acétylation de H3K27, acétylation de H3K9 et triméthylation de H3K4. Juste en aval de PXDN s'étend une région intergénique réprimée, marquée par un enrichissement en triméthylation de H3K27 ; sur le flanc opposé se trouve un gène réprimé porteur de la marque triméthylation de H3K27. En s'éloignant encore d'un pas.
Notre chromatine silencieuse, indiquée par la présence d'un enrichissement en triméthylation de la lysine 9 de l'histone H3, semble indiquer un silençage de SN TG2 et de MYT1L, peut-être de manière moins transitoire que le répresseur constitué par la triméthylation de la lysine 27 de l'histone H3. Cette région englobe la majorité des phénomènes observés dans l'analyse ChIPseek des modifications histoniques. Elle illustre comment la nature dynamique de BCP permet d'identifier à la fois des marques d'acétylation ponctuelles et de triméthylation de la lysine 4 de l'histone H3, tout en distinguant simultanément de grandes îles contiguës de répression par triméthylation de la lysine 27 ou de la lysine 9 de l'histone H3, ainsi que la triméthylation de la lysine 36 de l'histone H3 associée à une transcription active.
Cet algorithme peut être effectué en environ 30 minutes, selon le nombre de lectures et le résultat des signes du génome. Aucune optimisation importante n'est requise, contrairement à ce qui est souvent nécessaire avec d'autres méthodes suivant cette procédure. De nombreuses protéines cibles différentes de l'immunoprécipitation de la chromatine peuvent être étudiées à l'aide de BBCP, y compris diverses autres modifications des histones ainsi que les facteurs de transcription liant l'ADN, afin de répondre à des questions supplémentaires sur les mécanismes épigénomiques et la régulation des gènes.
Après avoir visionné cette vidéo, vous devriez bien comprendre comment le BCP est utilisé pour identifier des régions accessibles aux marques histones diffuses dans l'analyse de données chipsy.
Consultez la transcription complète et accédez à des milliers de vidéos scientifiques
Cette étude présente un algorithme bayésien de détection de points de rupture (BCP) qui améliore l'analyse des données de séquençage après immunoprécipitation de la chromatine (ChIP-seq). En utilisant des modèles de Markov cachés, BCP identifie efficacement les régions d'enrichissement des histones dans les deux types de données, étendues et ponctuelles.
L'algorithme bayésien de détection des points de rupture (BCP) offre une approche unifiée et peu dépendante des paramètres pour identifier des régions génomiques enrichies à partir de divers types de données ChIP-séq, allant des liaisons ponctuelles de facteurs de transcription à des îlots diffus de modifications histoniques. En réduisant la dépendance aux seuils heuristiques et aux changements de modèle, BCP améliore la reproductibilité et la comparabilité entre laboratoires lors de la validation de cibles épigénomiques. Cela permet une détection mécanistique des risques en phase précoce de découverte, en fournissant des profils quantitatifs de densité de lecture statistiquement fondés, qui éclairent la confiance dans les cibles et l'analyse des voies biologiques.
L'algorithme BCP s'inscrit dans le continuum de la découverte, allant des données brutes de séquençage à l'interprétation biologique, en soutenant la validation ciblée orientée par hypothèse, le profilage épigénomique reproductible et l'intégration des données à travers les étapes de dépistage précoce et de validation préclinique.