2025年10月28日
本方案提供了一条简化的计算流程,用于定量新生增强子转录本。通过整合染色质可及性、染色质特征和转录数据,该方法能够在复杂的基因内区域实现对增强子活性的准确检测和链特异性分析,同时适用于不具备深入生物信息学训练背景的研究人员。
本研究团队致力于增强子表观遗传学与表观转录组学研究,重点在于开发准确的方法,以定量增强子RNA作为增强子激活的指标。由于基因内增强子位于宿主转录本内部,区分增强子差异表达信号并对其进行精确定量具有挑战性。请首先打开终端,输入命令以准备用于增强子鉴定所需的文件和参考数据。
在终端中输入命令以进入工作目录。然后运行命令,将增强子鉴定脚本复制到当前目录。接着运行相应的命令,利用基因编码注释生成启动子区域、基因体和蛋白质编码基因的 BED 文件。
为进行增强子鉴定,准备ATAC-seq和组蛋白ChIP-seq文件。在终端中输入相应的预处理命令。接着,运行命令以利用染色质峰数据定义并分类增强子。
输入命令,将临时链信息分配给基因间增强子BED文件。接着,输入命令以确定与位于两条链上的基因重叠的基因间增强子的正确链方向。随后,计算与增强子在同一链上重叠基因的链特异性RPKM值。
然后输入命令以完成基因间增强子的链分配。将最终的链信息分配给所有基因间增强子及其对应的峰区域。在终端中输入命令,进入流程的根目录。
然后使用适当的命令复制用于准备下游分析的脚本。使用适当的命令,准备增强子聚合、GRO-seq 信号处理和增强子 RNA 定量所需的所有文件。接下来,输入脚本以进入工作目录,然后复制下游分析所需的必要脚本。为创建聚合图,显示每种类型增强子峰周围染色质信号模式。
在终端中输入相应的命令。当提示符返回后,输入命令以使用 feature counts 从 GRO-seq 数据中量化增强子 RNA 的表达水平。最后,运行脚本来可视化并比较 GRO-seq 数据集中不同增强子组之间的增强子 RNA 表达水平。
在修剪前存在多核苷酸尾部,应用修剪参数后成功去除了受损的末端ATAC-seq数据集中的接头序列。在修剪前,成对的红色读段中均检测到NextEra接头序列,经预处理后已去除。H3K27乙酰化的ChIP-seq数据集显示接头污染极少,仅需默认修剪即可。对ATAC-seq数据进行过滤后,共获得71,165个非启动子开放染色质区域,其中包括47,317个增强子区域;根据与组蛋白修饰标记的重叠情况,这些增强子区域中有23,147个被归类为活性增强子,24,170个为非活性增强子。在所有增强子区域中,45.2%位于基因间区,54.8%位于基因内区。这一分布特征在非活性和活性增强子类别中相似。
NENO基因上游的一个基因间增强子在ATAC-seq、H3K4单甲基化、H3K27乙酰化和GRO-seq信号中显示出强烈的富集。CHD2基因附近的一个基因内增强子表现出与NENOG增强子相似的染色质和转录特征,在全部四个数据集中均有清晰的信号。整合分析图显示,活性增强子在ATAC-seq、H3K4单甲基化和H3K27乙酰化信号上具有协调性的富集。
非活性增强子缺乏H3K27乙酰化富集,但仍保留较强的ATAC-seq和H3K4单甲基化信号。在基因间区和基因内区,活性增强子的GRO-seq衍生转录水平均显著高于非活性增强子。我们整合了这一趋势感知的eRNA计算流程,并通过基因间或基因内环境中依赖于活性的转录进行了验证。
我们致力于解决标准化且可及的eRNA定量分析中的差异表达问题,特别是针对受宿主基因组干扰的基因内增强子。我们将改进自驱动识别方法,从基因组组装、实验方案和细胞类型等多个趋势中分离出独立运行的转录本,并建立跨平台的基准分析流程。
查看完整文字稿并访问数千部科学视频
本方案提供了一条简化的计算流程,用于定量新生增强子转录本。通过整合染色质可及性、染色质特征和转录数据,该方法能够在复杂的基因内区域实现对增强子活性的准确检测和链特异性分析。
定量增强子RNA(eRNA)分析对于降低早期发现阶段的靶点验证风险以及阐明调控机制至关重要。该计算流程能够对新生RNA测序数据中的eRNA进行可重复的、链特异性的定量分析,从而解决宿主基因转录重叠带来的干扰效应。标准化的增强子活性测量有助于提升基因调控研究中的预测可信度和项目组合筛选效率。
该流程可整合到从早期增强子鉴定到先导序列优先排序及临床前验证的整个发现过程中,支持基因间和基因内增强子的分析。