December 10th, 2012
我们的贝叶斯变点(BCP)算法的基础上通过隐马尔可夫模型的造型变化点的国家的最先进的进步和应用染色质免疫沉淀测序(ChIPseq)数据分析。 BCP执行在广泛和点状数据类型,但擅长准确地识别健壮的,可重复的岛屿弥漫组蛋白富集。
以下实验的总体目标是利用染色质免疫沉淀测序数据中映射的读取位置的密度来估计整个基因组的后验平均读取密度。这是通过预处理实现的。映射的 ChIP-seq 读长进入阻塞的密度曲线,相同的读长数落在 200 个碱基对非重叠 bin 内。
第二步,具有相同密度的任何相邻 bin 都会合并成一个更大的块,使用带有前向和后向滤波器的贝叶斯模型,在所有周围块的上下文中递归计算每个块的后验平均密度。其中,块的读取计数使用泊松分布建模,该分布具有 theta 参数,该参数采用具有 alpha 和 beta 参数的 gamma 先验分布。接下来,根据每个块的后验平均密度估计值是否超过输入对照背景密度的第 90 个分位数来评估其显着性,以便生成最终丰富的基因组片段结果,该结果说明了从原始测序读取到后验平均读取密度估计的过程, 最后在 BCP 分析期间富集了 ChIP-seq 数据上的岛屿。
此外,结果表明 BCP 优于竞争对手的工具 cer。与 CER 等现有方法相比,该技术的主要优点是 BCP 在隐藏标记模型中使用了最新的 A 进展,因此与以前的启发式方法相比,它更好地表征了 chipsy 数据分析的细微差别。这种方法可以帮助表观基因组学领域的关键问题,例如通过表征其全基因组富集模式来研究组织修饰的作用。
虽然这种患者方法可以深入了解 ChIP-seq 数据分析,但基本框架也可以应用于其他下一代测序数据分析,例如识别 bis Sufi 测序数据中的差异甲基化区域、RNA-Seq 中的新转录位点、拷贝数变异或任意数量的微阵列平铺数据。这种方法的可视化演示对于清楚地理解该方法至关重要,并且它有优势。理论优势隐藏在软件中。
此处演示的所有过程步骤都已打包到 BCP 软件包中的单个可执行文件中,该软件包可在此视频中下载。描述了程序执行的步骤以运行软件。需要三个参数。
一个文件,包含来自芯片样本的唯一映射读数和一个用于输入控制读数的类似文件,以及用于准备用于 BCP 分析的输入文件的输出文件名。首先,使用首选的短读长比对软件将测序运行产生的短读长与适当的参考基因组进行比对。映射的位置应转换为六列浏览器可扩展数据或 BED 格式,每个映射读取都有一条制表符分隔的线,指示映射的染色体起始位置、结束位置、读取名称、分数和链。
将芯片和输入映射位置扩展到预定的片段长度。例如,在酶切或 DNA 超声处理过程中靶向的片段大小,通常约为 200 个碱基对。然后,片段计数将聚合到相邻的 bin 中。
默认情况下,bin 大小设置为 200 个碱基对的估计片段长度。一组具有相同 recount 的区间中任何可能的变化点都很可能位于最外层边界。因此,更改点不太可能出现在具有相同读取计数的两个 bin 之间的内部边界处。
因此,将每个 bin 具有相同读取数的相邻 bin 分组到一个块中。准备好输入文件后,只需键入屏幕底部显示的命令即可调用 BCP 估计。每个块的读取密度被建模为具有均值参数 theta 的泊松分布,该分布遵循具有 alpha 和 beta 参数的 gamma 分布的混合,以及任何块上发生变化点的先验概率。
以这种方式对每个块进行条件限制的 Boundary 可以有效地呈现无限状态隐马尔可夫模型或 HMM。超参数 alpha 、 beta 和 P 使用最大后验似然估计。对于每个块 theta sub T 的海湾估计值是显式计算的,因为 theta sub T 的期望值,给定为什么 sub T HMS 中经常使用的更传统但耗时的前向和后向滤波器被替换为计算效率更高的有界复杂度混合近似值来估计后验均值 theta hat sub T.得到的后验均值将被平滑成近似的分段常数轮廓, 因此,具有相同 theta hat sub T 的块应该与更新的边界坐标一起进一步被阻止。
BCP 使用每个块的输入读取数作为后台速率并确定富集。使用基于块的芯片位置平均密度是否超过某个显著性阈值的简单假设检验。第 90 个分位数是默认阈值,在大多数情况下是合适的。
然后,BCP 将超过富集的相邻后验平均密度块合并为单个区域,并在浏览器中报告合并的坐标。可扩展数据格式 BCP 擅长识别组蛋白修饰数据中广泛富集的区域。这里。将 BCP 结果与 cser 的结果进行了比较,cser 是一种现有工具,在该实验室研究 H 3 K 36 三甲基化的工作之前已显示出强大的性能,表明 BCP 中的岛大小比 cer 大得多。
较大的岛更符合对 H 3 K 36 三甲基化富集的广泛弥散岛的常规期望。较大的岛屿并不能单独表示准确性。因此,H 三个 K 36 三甲基化岛与主动转录基因体的已知关联以及它们与 H 三个 K 27 三甲基化岛的相互排他性用于评估 BCP 和 CER 的性能,与 CER BCP 相比,称为更大的连续岛,可以更好地捕获基因体而不会牺牲与 H 三个 K 27 的增加重叠, 三甲基化群岛。
BCP 通过边界与基因体紧密对齐的 H 三个 K 36 三甲基化岛维持活性基因的高度重叠,而不会增加与具有抑制转录或 H 三个 K 27 三甲基化抑制标记的基因间空间基因的假阳性重叠程度,同时评估两个重复数据集中 BCP 岛调用的可重复性, 据观察,BCP 在竞争算法中并不严重依赖簧片覆盖深度,通过检查其他不同区域提供了 BCPS 稳健性和可重复性的额外证据,证明了尽管覆盖深度减小,但岛屿边界一致。为了充分证明 BCP 的多功能性,获得了广泛的组蛋白修饰数据,包括点状标记 H 3 K 27 乙酰化、H 3 K 9 乙酰化和 H 3 K 4 三甲基化,以及扩散标记 H 3 K 9 三甲基化以及 H 3 K 27 三甲基化和 H 3 K 36 三甲基化。使用 BCP 和 cser 的默认参数设置对这些数据集进行了分析。
中心位于 H 3 K 36 三甲基化富集在 PX DN 基因标记活性转录的预期落在转录起始位点的是额外的点状活性标记 H 3 K 27 乙酰化、H 3 K 9 乙酰化和 H 3 K 4 三甲基化。PXDN 的下游是被抑制的基因间空间,以 H 3 K 27 三甲基化富集为标志,在另一侧有一个 H 3 K 27 三甲基化被抑制的基因。再向前迈一步。
我们的沉默染色质由 H 3 K 9 三甲基化富集的存在表明,这似乎表明 SN TG 2 和 MYT 1 L 沉默,可能比 H 3 K 27 三甲基化抑制的短暂性更弱。该区域包含在组蛋白修饰的 ChIPseek 中遇到的大多数现象。它说明了 BCP 的动态性质如何识别点状乙酰化和 H 3 K 4 三甲基化标记,同时区分 H 3 K 27 三甲基化和 H 3 K 9 三甲基化抑制的大连续岛,以及 H 3 K 36 三甲基化活性转录。
该算法可以执行大约 30 分钟,具体取决于读取次数和基因组体征结果。其他方法通常需要的任何重大优化 遵循此过程。可以使用 BBCP 研究染色质免疫沉淀的许多不同靶蛋白,包括各种其他组蛋白修饰以及 DNA 结合转录因子,以回答有关表观基因组机制和基因调控的其他问题。
观看此视频后,您应该对 BCP 如何用于识别 chipsy 数据分析中弥散性组蛋白标记的可触及区域有很好的了解。
View the full transcript and gain access to thousands of scientific videos
本研究提出了一种贝叶斯变点(BCP)算法,可增强染色质免疫沉淀测序(ChIP-seq)数据的分析。通过利用隐马尔可夫模型,BCP有效地识别广泛和点状数据类型中的组蛋白富集区域。
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.