我们的贝叶斯变点(BCP)算法基于利用隐马尔可夫模型对变点建模的前沿进展,并将其应用于染色质免疫沉淀测序(ChIPseq)数据分析。BCP在宽峰和尖峰数据类型中均表现良好,尤其擅长准确识别弥散型组蛋白富集的稳定且可重复的区域。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
我们的贝叶斯变点(BCP)算法基于利用隐马尔可夫模型对变点建模的前沿进展,并将其应用于染色质免疫沉淀测序(ChIPseq)数据分析。BCP在宽峰和尖峰数据类型中均表现良好,尤其擅长准确识别弥散型组蛋白富集的稳定且可重复的区域。
ChIPseq 是一种广泛用于研究蛋白质-DNA 相互作用的技术。通过下一代测序对蛋白质结合的 DNA 进行测序,并将短序列读段比对到参考基因组,从而生成读段密度谱。富集区域表现为峰,其峰形通常因靶蛋白的不同而存在显著差异1。例如,转录因子通常以位点和序列特异性的方式结合,往往产生尖锐的峰;而组蛋白修饰则更为广泛,其特征是出现宽广、弥散的富集岛2。可靠地识别这些区域正是我们工作的重点。
用于分析ChIPseq数据的算法采用了多种方法,从启发式方法到3-5 到更严格的统计模型, 例如 隐马尔可夫模型(HMMs)6-8我们寻求一种解决方案,以最大限度地减少对难以定义的临时参数的依赖,这些参数往往会降低分辨率,并削弱工具的直观可用性。针对基于隐马尔可夫模型(HMM)的方法,我们的目标是简化参数估计流程,并避免常被采用的简单有限状态分类。
此外,传统的ChIPseq数据分析需要将预期的读段密度分布特征归类为点状或弥散状,然后分别应用相应的分析工具。我们进一步旨在用一种更通用的单一模型取代上述两种独立模型,该模型能够有效应对各种类型的数据。
为实现这些目标,我们首先构建了一个统计框架,该框架利用隐马尔可夫模型(HMM)领域的前沿进展9,以自然的方式对ChIP-seq数据结构进行建模,且仅使用显式公式——这一创新对其性能优势至关重要。相较于启发式模型,我们的HMM通过贝叶斯模型容纳了无限隐状态。我们将该模型应用于识别读段密度中的合理变点,从而进一步定义富集区域的片段。分析结果表明,我们的贝叶斯变点(BCP)算法具有较低的计算复杂度,表现为运行时间缩短和内存占用减少。BCP算法在尖峰状峰(punctate peak)和弥散岛状区域(diffuse island)识别中均成功应用,具备稳健的准确性且所需用户自定义参数较少。这体现了该算法的多功能性和易用性。因此,我们认为该方法可便捷地应用于多种数据类型和广泛的终端用户,且结果易于进行比较与对照,使其成为一种有助于不同研究团队之间协作与验证的优秀ChIP-seq数据分析工具。本文中,我们通过将BCP应用于已有的转录因子10,11和表观遗传数据12,展示了其实际应用价值。
1. 为 BCP 分析准备输入文件
2a. 弥散型读段分布:弥散数据中富集区域检测的ChIP读段密度预处理
2b. 点状读段分布:点状数据中峰区域检测的ChIP与Input BED文件预处理
3. 使用我们的 BCMIX 近似方法估计每个区块的后验均值读段密度
4a. 弥散型读段分布:将后验均值后处理为弥散富集区段
4b. 点状读段分布:将后验均值后处理为峰候选区域
访问受限。请登录或开始试用以查看此内容。
BCP 在识别组蛋白修饰数据中的广泛富集区域方面表现出色。作为参考,我们此前将我们的结果与现有工具 SICER3 的结果进行了比较,该工具已展现出较强的性能。为了充分展示 BCP 的优势,我们选择了一种已被深入研究的组蛋白修饰,以建立评估成功率的基础。基于此,我们分析了 H3K36me3,因其已被证实与活跃转录的基因体密切相关(图 1)。相比之下,H3K36me3 还被证明与抑制性标记 H3K27me3 呈互斥关系。我们进一步利用这些已知的关联关系,通过确定 BCP 所识别出的“岛区”与已知正相关和负相关区域的重叠比例,来展示其在识别准确性方面的优势。在此,我们通过更多高性能实例进一步证实 BCP 的优势。
我们先前的研究表明,BCP 检测出的富集岛尺寸(23.9 至 25.8 kb)明显大于 SICER 检测出的尺寸(2.7 至 10.7 kb);较大的富集岛更符合 H3K36me3 富集区域通常呈广泛弥散型富集岛的传统预期 (PLoS Comp Bio, submi...
访问受限。请登录或开始试用以查看此内容。
我们着手开发一种用于分析ChIPseq数据的模型,该模型能够同样有效地识别点状和弥散状的数据结构。迄今为止,富集区域(特别是弥散区域)的识别一直较为困难,而这些区域反映了对较大岛屿尺寸的先验预期。为解决这些问题,我们采用了隐马尔可夫模型(HMM)技术的最新进展,该技术相较于现有的启发式模型以及创新性较弱的HMM具有诸多优势。
我们的模型采用具有显式公式的贝叶斯框架。这一特点与其他隐马尔可夫模型(HMM)有本质区别,使我们能够通过简单计算直接获得后验均值,即各片段的预期读段密度,而无需依赖耗时且计算成本高昂的模拟方法(如马尔可夫链蒙特卡洛方法)。因此,我们的计算时间和内存需求显著降低。在使用配备双核、2.0 GHz 节点及 2 GB 64 位内存的高性能计算集群分析约 2300 万条 H3K27me3 读段或约 2100 万条 H3K36me3 读段时,BCP 完成全基因组分析耗时不到一小时,而其他方法则需数小时至数天。这种时间节省仅需 2 GB 的 modest 内存即可实现。
此外,我们的模型对每个片段的各种均值进行条件...
访问受限。请登录或开始试用以查看此内容。
STARR 基金会奖项(MQZ),美国国立卫生研究院(NIH)资助项目 ES017166(MQZ),美国国家科学基金会(NSF)资助项目 DMS0906593(HX)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 基于 Linux 的工作站 |
访问受限。请登录或开始试用以查看此内容。