本方案提供了一条简化的计算流程,用于定量新生增强子转录本。通过整合染色质可及性、染色质特征和转录数据,该方法能够在复杂的基因内区域实现对增强子活性的准确检测和链特异性分析,同时适用于不具备深入生物信息学训练背景的研究人员。
方法文章
* These authors contributed equally
本方案提供了一条简化的计算流程,用于定量新生增强子转录本。通过整合染色质可及性、染色质特征和转录数据,该方法能够在复杂的基因内区域实现对增强子活性的准确检测和链特异性分析,同时适用于不具备深入生物信息学训练背景的研究人员。
核心顺式调控元件(cis-regulatory elements)被称为增强子,在实现对靶基因的精确转录调控中发挥中心作用,从而控制多种细胞功能和发育过程。这些增强子通常在两个方向上都被转录,产生被称为增强子RNA(enhancer RNAs, eRNAs)的长链非编码转录本。eRNAs的表达与活跃的染色质特征(如H3K27ac修饰和共激活因子的招募)密切相关,并在功能上促进靶基因的转录激活。然而,eRNAs的检测与定量仍然具有挑战性,尤其是在其转录区域与宿主基因重叠的情况下。为解决这一问题,我们提出了一种标准化且用户友好的计算流程,用于从新生RNA测序数据中分析增强子的转录活性。该方案指导用户完成数据预处理、读段比对和质量控制,随后进行增强子相关转录的链特异性定量,并针对信号归属复杂的基因内增强子(intragenic enhancers)提供了专门的处理步骤。可视化模块可清晰展示增强子在不同基因组背景下的活性,内置选项支持对基因间和基因内增强子的分析。本流程专为生物信息学经验有限的研究人员设计,为开展一致、可重复且可扩展的增强子转录研究提供了实用框架,有助于在多种生物系统中更广泛地应用增强子生物学研究。
增强子是一类顺式调控DNA元件,通过介导染色质成环并招募转录机器来调控靶基因的转录1,2,3。其组织特异性活性使得在发育过程和细胞谱系决定中实现精确调控成为可能4,5,6,7,8。活跃的增强子具有特征性的染色质修饰,如H3K4me1(组蛋白H3第4位赖氨酸单甲基化)和H3K27ac(组蛋白H3第27位赖氨酸乙酰化),并且通常位于DNase I超敏感区域,这些区域标志着开放的染色质结构9,10,11,12。这些特征使转录因子和RNA聚合酶II能够结合DNA,从而在增强子位点启动新生转录13,14,15,16。
这一连续的生物学过程会产生来源于增强子的转录本,称为eRNA。eRNA具有双向性、非编码性,通常不带有poly(A)尾13,14,15,16。eRNA不仅可作为增强子活性的标志物,其本身也具有效应分子的功能16,17,18,19,20,21,22,23,24。它们可通过释放停滞的RNA聚合酶II上的负延伸因子(NELF),促进有效的转录延伸16,19,并有助于稳定增强子-启动子之间的环状结构17,18,20。此外,eRNA还可能通过m6A(N6-甲基腺苷)修饰参与转录凝聚体的形成21,22,23。
然而,由基因体内调控元件启动的基因内增强子转录功能仍存在争议。一些研究表明,来自基因内增强子的增强子RNA(eRNA)可增强宿主基因的表达25,其机制可能涉及促进NELF释放以及刺激依赖性的有效延伸过程26,27。相反,其他研究则认为,此类转录可能通过RNA聚合酶II的碰撞或转录干扰阻碍宿主基因,导致转录衰减或提前终止28,29。这些相互矛盾的观察结果,加上eRNA兼具标记物与调控因子的双重作用,凸显了对其进行精确量化和功能解析的必要性。然而,检测基因内eRNA十分困难,因为它们通常与正义链的宿主转录本存在重叠13,25,26,30。当增强子位于具有嵌套基因或双链均存在重叠转录的区域时,这一挑战进一步加剧,导致增强子特异性信号难以分辨。
为了克服这些挑战,我们开发了一种生物信息学分析流程,用于检测、定量和可视化与增强子相关的转录本,特别关注基因内区域。该流程整合了转座酶可及染色质测序(ATAC-seq)、染色质免疫沉淀测序(ChIP-seq)、全局延伸测序(GRO-seq)以及基因组注释信息,即使在复杂的基因组背景下,也能实现增强子水平的分辨率。
该流程包含四个主要步骤:(i)预处理、比对、峰识别和信号生成31;(ii)利用染色质特征识别增强子;(iii)链方向分配,特别是在基因体内部;(iv)新生增强子转录本的定量与可视化。该框架特别适用于具有高分辨率测序数据的系统,例如本研究中分析的小鼠胚胎干细胞,当具备合适的数据集时,也可扩展至其他生物体。通过在现有流程难以实现的增强子特异性定量方面提供支持,该工作流程为在不同基因组背景下对基因内eRNA转录进行基准评估和深入研究提供了一种实用工具。
访问受限。请登录或开始试用以查看此内容。
注意:工作流程中使用的所有原始数据集均列于表1中。生物信息学工具的详细信息见材料表。本流程中使用的线程数可通过修改每个脚本顶部定义的THREADS变量进行调整。用户可根据自身的CPU资源增加线程数以加快分析速度。
每一步完成后都会生成一个日志文件。为快速检查是否失败,可使用如下命令:cat StepXX_log.txt; grep -qF "ERROR" StepXX_log.txt && echo "ERROR found. Fix before next step." || echo "OK: no ERROR markers"。若出现任何ERROR提示,应视为该步骤失败,需先解决问题后再继续下一步。
1. 从 GitHub 仓库下载完整分析流程
(https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/)
2. 为分析流程设置 mamba/conda 环境
3. 从 SRA(序列读取存档)下载公开可用的 ChIP-seq、ATAC-seq 和 GRO-seq 数据集
4. 对原始测序读段进行质量控制与修剪
5. 准备 Bowtie2 参考索引
6. 将修剪后的序列比对至 mm10 参考基因组
7. 合并 H3K27ac ChIP-seq 数据的技术重复
8. 去除重复序列和非必需染色体
9. 对每个数据集进行峰检测
10. 合并 ChIP-seq 和 ATAC-seq BAM 文件的生物学重复样本以进行下游信号分析
11. 从比对后的序列读段生成标签目录和信号 bigWig 文件
12. 准备用于增强子鉴定的文件
13. 从注释中鉴定启动子候选区和基因体
14. 处理峰以进行增强子鉴定
15. 鉴定并分类增强子
16. 为基因内增强子分配临时链信息
17. 对重叠双向基因的增强子优先进行链分配
18. 计算与PCG优先的基因内增强子重叠基因的链特异性每百万映射读段每千碱基读段数(RPKM)值
19. 基于重叠基因表达(RPKM)的最终链分配
20. 为基因内增强子及增强子峰分配链信息
21. 准备用于增强子验证、eRNA定量和可视化的输入文件
22. 生成增强子验证的聚合图
23. 定量与可视化增强子RNA表达
访问受限。请登录或开始试用以查看此内容。
增强子转录本定量分析流程的示意图
公开可用的 ChIP-seq(H3K27ac、H3K4me1)、ATAC-seq 和 GRO-seq 数据集(表 1)通过一个标准化流程进行处理,主要用于验证。使用 Trim Galore 和 Cutadapt 进行接头序列修剪和质量过滤,随后利用 Bowtie2 将测序数据比对至 mm10 参考基因组(详见实验方案步骤 6)。对于 ChIP-seq 和 ATAC-seq 数据,采用 MACS3 鉴定峰值区域,并使用 HOMER 和 ucsc-bedgraphtobigwig 生成信号强度轨迹文件(bigWig 文件),用于下游可视化和定量分析(图 1A)。该一致性的预处理流程可确保数据兼容性,最大限度减少不同实验方法带来的偏差,并为下游增强子定量提供可靠的分析框架。
增强子的鉴定基于...
访问受限。请登录或开始试用以查看此内容。
在发现增强子来源的转录本后13,14,15,准确量化增强子RNA(eRNA)仍是一个重大挑战,尤其是在基因内环境中,eRNA常与宿主基因的转录本发生重叠。这种重叠使得链的分配和信号归属变得复杂,难以区分真正的增强子转录与背景基因表达13,25,26,30。尽管eRNA increasingly被认可为增强子活性的功能性指标,但该领域一直缺乏标准化且易于获取的增强子转录本量化框架。为满足这一需求,我们开发了一种模块化且具备链特异性的分析流程,该流程整合染色质可及性与组蛋白修饰数据以识别增强子,并利用新生RNA测序技术高精度地量化增强子来源的转录。该流程在设计时注重易用性,使不具备深厚计算背景的研究人员...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需披露。
本研究由韩国忠南国立大学研究基金资助[2022-0582-01(S.-K.K.)和2023-0545-01(S.-K.K.)]。图1使用BioRender(https://biorender.com/)制作。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| bedtools | Quinlan 实验室,犹他大学 | v2.31.1 | 用于编辑 BED 文件的工具集 |
| bowtie2 | Langmead 实验室,约翰斯·霍普金斯大学 | v2.5.4 | 用于将测序读段比对至参考基因组的多线程比对工具 |
| cowplot | Wilke 实验室,德克萨斯大学 | v1.2.0 | 用于组合和对齐基于 ggplot2 的图形的工具 |
| cutadapt | 斯德哥尔摩大学,生命科学中心 | v5.1 | 接头序列及 poly-A/G 尾剪切工具 |
| deeptools | 马克斯·普朗克研究所,生物信息学平台 | v3.5.6 | 用于量化特定基因组区域中测序读段数量的工具 |
| fastqc | Babraham 生物信息学团队,Babraham 研究所 | v0.12.1 | 测序读段的质量控制分析工具 |
| featureCounts (subread) | Shi 实验室,蒙纳士大学 | v2.1.1 | 针对指定基因组区域的原始读段计数工具 |
| homer | Benner 实验室,加州大学圣地亚哥分校(UCSD) | v5.1 | 用于 ChIP-seq、ATAC-seq 和新生 RNA 分析的工具包;包含标签目录构建和信号谱分析功能 |
| macs3 | Chan Zuckerberg 倡议组织 | v3.0.3 | 用于 ChIP-seq 和 ATAC-seq 数据集的峰识别分析 |
| pigz | . | v2.8 | 用于生成 gzip 压缩文件的多线程压缩工具 |
| sambamba | 圣彼得堡州立大学 | v1.0.1 | 多线程 SAM/BAM 文件处理工具包 |
| samtools | 惠康信托桑格研究所 | v1.22.1 | 用于处理和操作 SAM/BAM 文件的工具集 |
| sra-tools | 美国国家生物技术信息中心(NCBI) | v3.2.0 | 用于从 NCBI SRA 数据库下载 SRR 文件 |
| tidyverse | Posit PBC | v2.0.0 | 用于数据处理与可视化的 R 软件包集合 |
| trim-galore | Altos Labs,剑桥科学研究所 | v0.6.10 | 基于多线程的接头序列及低质量碱基剪切工具 |
| Ubuntu 20.04 | 用于流程的开发与测试 | ||
| ucsc-bedgraphtobigwig | Kent 实验室,加州大学圣克鲁兹分校 | v482 | 用于生成 bigWig 信号轨道的工具 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可