我们提供一种无需编程的生物学家工作流程,仅使用基于浏览器的工具即可识别组织特异性基因增强子。本方案利用公共的H3K4me1/H3K27ac组蛋白修饰标记和Hi-C数据,使不具备编程经验的研究人员也能够获取、分析并识别与其目标基因相关的潜在调控元件。
我们提供一种无需编程的生物学家工作流程,仅使用基于浏览器的工具即可识别组织特异性基因增强子。本方案利用公共的H3K4me1/H3K27ac组蛋白修饰标记和Hi-C数据,使不具备编程经验的研究人员也能够获取、分析并识别与其目标基因相关的潜在调控元件。
增强子是调控基因表达的DNA区域。增强子内部的突变可能导致基因调控异常,从而引发疾病。因此,鉴定在特定组织中调控基因活性的增强子,对于理解疾病的遗传基础至关重要。然而,由于增强子不编码蛋白质,其识别较为困难。尽管目前已存在大量增强子数据库及识别工具,但这些工具的复杂性可能为生物学家带来使用上的挑战。为了帮助生物学家更便捷地利用这些资源,我们提供了一套面向生物学家的友好型实验流程(https://github.com/Ramialison-Lab/EnhancerWorkflow),该流程利用现有的基于网页的基因组学数据,如H3K4me1和H3K27ac组蛋白修饰标记以及染色质构象分析(Hi-C)数据,用于发现与目标组织中处于活性状态的感兴趣基因(GoI)相关的增强子。本流程完全基于网页操作,终端用户无需具备编程技能。我们通过鉴定调控 TBX5(一个对心脏发育至关重要的基因)的候选增强子,验证了该方法的有效性。该流程有助于识别在左心室中与该基因相关的增强子。
增强子是一类调控基因转录、发育及细胞分化的非编码DNA区域1,2。增强子的突变可导致多种疾病,包括发育障碍、癌症及其他遗传性疾病3,4,5,6。因此,理解增强子对于阐明基因表达、突变及疾病机制至关重要。
为了理解增强子如何与其靶基因相互作用,确定其在基因组中的位置至关重要。然而,识别增强子的位置并不总是直接的,因为增强子既可以位于转录起始位点(TSS)附近,也可以远在数十至数百千碱基之外2,7,8,9。
尽管增强子的基因组位置难以预测,但它们具有独特的生物化学和结构特征,因此可以进行系统性追踪。通常,增强子富集于基因间区和内含子区域,仅有少数位于外显子内2,8。它们通常带有特定的组蛋白修饰和转录因子结合位点,这些特征决定了其调控功能,并在不同发育阶段和组织中决定其时空活性10,11。
ChIP-seq 用于鉴定转录因子结合位点(TFBSs)以及组蛋白修饰标记,例如增强子的标志性修饰 H3K4me1、活性增强子标记 H3K27ac 和富集于启动子区域的 H3K4me3 标记1,12,13,14,15。染色质构象捕获技术(3C)及其衍生技术,如 4C、5C、Hi-C 和 ChIA-PET,可用于绘制远端基因组区域之间的物理相互作用图谱。3C 技术针对特定组织中的特定相互作用,而 Hi-C 则可提供跨细胞类型的全基因组架构信息16,17。
除了现有方法外,研究人员还开发了专门用于表征增强子的方法,包括整合型增强子数据库,如 EnhancerAtlas 或 EnhancerFinder18,19。然而,这些工具通常要求研究者整合多个数据集,以在多种组织中研究多个增强子,这对于缺乏生物信息学和数据挖掘经验的生物学家而言可能难以应对。
本文介绍了一种完全基于现有网络工具的用户友好型增强子筛选方案。该方案允许研究人员查询目标基因(GoI),并获取相应的增强子。本方案根据一组特定标准筛选增强子:组蛋白修饰、染色质相互作用以及组织特异性1,12,13,14,15,16,17,20,21。位于内含子内的增强子相比基因间区增强子(位于基因间基因组区域)更可能表现出组织特异性活性22。为确保尽可能全面地覆盖潜在的活性增强子,我们将搜索范围定义在两个相邻目标基因之间,以提高捕获基因体外调控元件的可能性。我们利用增强子特异性的表观遗传标志H3K4me1和活性增强子标志H3K27ac来列出增强子候选区域。随后,基于Hi-C数据对这些候选区域进行进一步筛选,仅保留与相应启动子存在物理相互作用的增强子。本方案旨在指导生物学家仅使用公开可用的基于网络的工具完成增强子鉴定过程。通过整合表观遗传学和染色质相互作用数据,本文所述方法为提出有关潜在增强子的假设提供了实用框架,可用于后续实验验证。
注意:分步操作指南可在 https://github.com/Ramialison-Lab/EnhancerWorkflow 获取。本方案中使用的数据总结于表1和表2中。故障排除方法参见补充文件1。
1. 定位目的基因(图1)
2. 定义增强子检测区域(图2)
3. 组蛋白修饰分析(图3)
4. 染色质构象捕获(Hi-C)分析(图4)
为了说明本方案的应用,我们研究了人类心脏中的 TBX5 基因,利用包含 H3K4me1、H3K27ac 和 Hi-C 数据的综合工作流程,探索与 TBX5 相关的增强子。TBX5 是一个参与肢体和心脏发育的基因,包括心脏四个腔室的形成以及室间隔的分隔24。该基因的突变是导致霍尔特-奥拉姆综合征(Holt-Oram syndrome, HOS)的主要原因,该综合征可引起肢体异常和先天性心脏病(congenital heart disease, CHD),包括室间隔缺损24。与 TBX5 相关的心脏增强子发生突变可能对先天性心脏病产生关键影响24。先前一项研究在人类心脏特异性组织中发现了三个已知的 TBX5 增强子——分别为“Enhancer 2”、“Enhancer 9”和“Enhancer 16”(补充文件 2),并在转基因小鼠中证实其具有相似的表型23。
我们在人类中位于RBM19和TBX3这两个分别位于TBX5下游和上游的邻近基因之间,研究了H3K4me1和H3K27ac富集的区域,以获取TBX5位点的潜在增强子(图1和图2)。为了鉴定心脏特异性增强子,我们选择了心肌细胞。潜在的TBX5心脏增强子区域以坐标形式(chr12:起始-终止)提取,共鉴定出22个同时与H3K4me1和H3K27ac相关的区域(图3和补充文件3)。从EnsEMBL基因组数据库中提取潜在的TBX5心脏增强子区域,并与4DNucleome数据库中的Hi-C数据进行交叉比对(图4),以评估这些潜在增强子与TBX5心脏启动子之间可能存在的相互作用。根据本文所述的实验流程,在心肌细胞中确认了22个基因组区域中有21个与TBX5启动子(chr12: 114400143-114410103)存在相互作用(补充文件4)。有一个区域未检测到与启动子的物理相互作用(图4,步骤4.8)。最后,我们将本方案鉴定出的结果与已通过生物学验证的增强子以及当前心脏增强子的金标准数据库VISTA Cardiac Enhancers Browser进行比较,发现了一些该数据库尚未收录的额外增强子25。
我们对21进行了交叉比较 TBX5 通过本方案从现有数据库中检索到的增强子。我们检索到了4 TBX5 来自VISTA心脏增强子浏览器的增强子(补充文件 5)25在VISTA鉴定出的4个心脏增强子中,有3个增强子hs2329、mm1282和m370与本基于网络的增强子检测方案所鉴定出的区域重叠图5)。每个预测的增强子还与 Smemo 等人先前通过实验验证的增强子共享基因组区域。23增强子2(chr12:114025907-114026275,GRCh38)和增强子16(chr12:114415466-114420433,GRCh38),但它们与增强子9(chr12:114263402-114266886,GRCh38)无重叠。VISTA鉴定出的增强子之一, hs498 未与本方案预测的任何增强子或 Smemo 等人实验验证的增强子重叠23 (图5),尽管该区域与H3K4me1标记显示出部分重叠图5)。类似地,增强子9并未与该分析流程预测的增强子区域重叠,但与H3K4me1标记相关联(图5).

图1:在Ensembl基因组浏览器中定位目的基因(GoI)的分步指南。用户首先打开Ensembl主页(1.1),选择物种(人),并在搜索栏中输入目标基因(1.2–1.3)。在结果列表中选择正确的基因ID(1.4),进入该基因的摘要页面。随后,用户点击“区域详情”超链接(1.5),以可视化目的基因周围区域的基因组结构,包括邻近元件和调控特征。请点击此处查看该图的放大版本。

图2:利用Ensembl基因组浏览器定义目标基因(GoI)周围的增强子检测区域。为定义增强子检测区域,需使用GENCODE基础基因注释轨迹,识别位于目标基因两侧的相邻基因,这些基因以深黄色方块表示,并标注有合并的Ensembl/Havana注释。每个基因的转录方向由其基因名称旁的箭头符号(< 或 >)指示(2.1)。为选择相邻基因之间的基因间区域,点击并拖动选中目标区域,然后在弹出框中选择跳转至该区域以放大显示(2.2)。为添加调控或增强子相关注释,点击添加/移除轨迹(2.3)。请点击此处查看该图的放大版本。

图3:使用EnsEMBL基因组浏览器在增强子检测区域中配置组蛋白修饰轨迹。 在左侧工具栏中,点击 配置此页面(3.1)以进入轨迹配置面板,并在“调控”部分下导航至“按细胞/组织的活性”(3.2)。在打开的标签页中,选择“实验”部分(3.3),并使用细胞/组织搜索栏查找并选择目标组织(心肌细胞)(3.4)。在组蛋白标记面板中(3.5),启用 H3K4me1 和 H3K27ac 作为活性增强子标记,H3K4me3 作为启动子标记,然后点击“配置轨迹显示”(3.6)。确认轨迹选择后,点击“查看轨迹”(3.7)返回基因组浏览器视图。此时,组蛋白标记峰将以彩色块的形式显示在检测区域中(3.8),位于相应组织标签下方(黄色:H3K4me1,蓝色:H3K27ac,橙色:H3K4me3)。“Hists & Pols”弹出窗口包含该区域以碱基对表示的基因组坐标(chr:start-end),可复制并保存用于下游分析。点击轨迹中的彩色元素后,将弹出“Hists & Pols”窗口,其中包含该区域的基因组坐标(例如,启动子区域为 chr12:11443450-114451611),可复制并保存用于下游分析(3.8)。同样,为提取候选增强子,应优先选择 H3K4me1 和 H3K27ac 峰重叠的区域,如各轨迹中峰与方框的垂直对齐所示(3.9)。可通过点击其方框或手动点击并拖拽跨越对齐的峰来直接选择重叠区域(例如,活性候选区域为 chr12:114400143-114410103)。弹出窗口中显示的坐标应以 BED 格式保存,用于后续验证或可视化分析。 请点击此处查看该图的放大版本。

图 4:利用来自4D核组数据门户的Hi-C热图可视化启动子-增强子染色质相互作用。 4D核组数据门户主页显示了一个堆叠条形图,按生物体总结了可用的实验类型。“人类样本”的“原位 Hi-C”数据集通过点击条形图的相应部分被选中(4.1)。系统显示相关数据集的筛选列表;选择一个来源于H9细胞分化为心肌母细胞的Hi-C数据集(4.2)。通过“探索数据”按钮(4.4)在HiGlass浏览器中打开所选数据集(4.3)。在坐标输入框中输入感兴趣的基因组区域(4.5),接触矩阵以颜色标度的热图形式呈现。较深的颜色(深红至黑色)表示更强的染色质接触频率,而较浅的颜色(白色至橙色)代表较弱的相互作用。在启动子坐标处放置一条水平线,并在三个经实验验证的对照增强子位置绘制垂直线(4.6)。这些交点用于定义严格的相互作用阈值,该阈值由启动子-增强子接触中最强的可见信号(最深颜色)设定(4.7)。在候选H3K27ac和H3K4me1标记的增强子位置(来自步骤3.8)绘制额外的垂直线。保留其启动子-增强子交点颜色等于或深于阈值的候选区域,而信号较弱(颜色较浅的方块)的候选区域则被排除(4.8)。保留的坐标手动提取并以BED格式保存,用于后续分析。(a. 增强子2,b. 增强子9,和c. 增强子16) 请点击此处查看该图的放大版本。

图5:预测的TBX5增强子与VISTA验证的心脏增强子及对照增强子的基因组浏览器视图比较。基因组浏览器截图展示了增强子搜索范围(步骤2),将基于网络协议检索到的预测增强子(底部)与VISTA验证的增强子(顶部)以及实验验证的对照增强子(中部)进行比较。主图显示了完整的基因组位点,包含已注释的调控元件,如心肌细胞特异性的H3K4me1(黄色)、H3K27ac(蓝色)和H3K4me3峰(橙色)。三个放大图展示了由本协议检索到的增强子、VISTA增强子和对照增强子之间的比对情况。与对照增强子的重叠区域用红色框标出。各子区域的坐标显示在下方的浏览器面板中。请点击此处查看该图的高清版本。
表1:本研究中使用数据。 请点击此处下载本表格。
表2:本研究中使用的基于网络的工具。 请点击此处下载该表格。
补充文件1:EnsEMBL基因组浏览器故障排除指南。请点击此处下载该文件。
补充文件 2:以 GRCh38 格式提供的 BED 文件,包含经实验验证的 TBX5 心脏调控增强子23。 请点击此处下载该文件。
补充文件 3:以 GRCh38 格式提供的 BED 文件,TBX5 心脏增强子由 STEP3 从 EnsEMBL 中检索获得。 请点击此处下载该文件。
补充文件4:以GRCh38格式提供的BED文件,TBX5心脏增强子由STEP4从EnsEMBL中检索获得。 请点击此处下载该文件。
补充文件5:以GRCh38格式提供的BED文件,TBX5心脏增强子数据来自VISTA心脏增强子浏览器25。 请点击此处下载该文件。
本文所述的基于网络的方案旨在实现增强子的检索,而非增强子的预测。通过利用公开可用的组织特异性数据集、组蛋白修饰(H3K4me1 和 H3K27ac)以及 Hi-C 相互作用数据,该方法可缩小与目的基因(GoI)相关的潜在增强子范围。与依赖机器学习或基于序列模型的计算预测工具不同,我们的方法仅基于实验数据进行增强子的检索。EnsEMBL 基因组浏览器的故障排除说明详见补充文件 1。
该工作流程整合了组蛋白修饰和染色质相互作用数据等关键要素,类似于ChIA-PET和PLAC-seq等先进方法,能够以更高精度绘制增强子-启动子相互作用图谱10,11。然而,当高分辨率实验技术不可行时,该方法具有优势,因为其操作流程对资源需求较低,且可显著节省时间。
上述方法的主要局限性在于其依赖现有数据集的可获得性和质量,这可能影响所检索到的相互作用的精确性。在与TBX5相关的遗传突变背景下研究心脏发育过程中的增强子活性,需要达到组织特异性的分辨率。对于此类分析,胚胎心脏组织因其与发育调控密切相关而最为合适。然而,在分析时,尚无公开可用的包含组蛋白修饰数据的胚胎数据集。为弥补这一不足,整合ENCODE、Enhancer Atlas 2.0或EnhancerFinder等替代资源,可通过提供额外的增强子识别与验证数据集,从而扩展该分析流程的适用性18,19。
在 TBX5 REPFIX 中,基于 H3K4me1 的分析揭示了 22 个假定的增强子,可作为进一步研究的起点。随后的 Hi-C 分析显示,在基于先前组蛋白修饰标记所鉴定的 22 个增强子候选区域中,有 21 个与心肌细胞中的 TBX5 启动子存在相互作用(图 5)。这支持了基于组蛋白修饰标记的方法在预测功能区域方面的可靠性。
在本方案中,我们未将跨物种序列保守性作为优先考虑的标准,尽管这是识别增强子的常用标准。因为此前的研究表明,该标准在鉴定组织或物种特异性增强子时效果较差,而许多此类增强子在进化过程中并不具有高度保守性26。鉴于此,我们选择聚焦于基于染色质的标记,这些标记更能直接反映增强子的功能活性。然而,在特定情况下,序列保守性仍可能具有研究价值,例如在研究具有进化意义的增强子时。在此情形下,可将其作为可选步骤,供关注保守性调控元件的用户添加使用。
该方案已成功从EnsEMBL网站检索到21个心脏特异性增强子,这些增强子针对TBX5基因,而此前在现有平台VISTA Cardiac Enhancers Browser中未能被识别。尽管本方案未能检索到其中一个增强子hs498,提示其检测能力可能存在一定局限性,但该方法仍发现了一些VISTA Cardiac Enhancers Browser未能检测到的增强子。然而,对所获得的增强子仍需进一步验证,因为该方案产生的候选区域数量较经人工审编的VISTA数据库更多。较高的数量增加了假阳性风险,而预测增强子数量的增加并不一定意味着特异性或功能相关性的提升。正如Smemoet al.的研究中所采用的方法23,整合额外的实验数据集或功能检测手段,如基因表达分析、CRISPR扰动实验或报告基因检测,对于确认这些候选增强子的生物学有效性至关重要。
与三个经过实验验证的增强子进行交叉比较,结果显示预测区域与这些增强子存在部分重叠(图5)。预测的增强子"e1"比已验证的增强子2定位范围更广,而"e18"与增强子16存在部分重叠(图5)。这些结果表明,该方法能够成功识别具有已知调控活性的区域,尽管预测增强子范围较广,可能反映了增强子边界的灵活性。增强子通常作为模块化元件发挥作用,其活性可能依赖于染色质环境、细胞类型以及发育时机2,27。因此,预测区域可能包含核心活性位点以及对调控功能有贡献的邻近序列,但仍需通过实验验证来确定这些较宽泛预测区域中哪些部分在特定组织或发育背景下具有功能性活性。尽管VISTA心脏增强子浏览器在定义范围内识别出四个区域,但仅有一个增强子mm370与实验验证的增强子16存在部分重叠,且该重叠仅发生在H3K4me1标记的区域(图5)23。增强子mm370中未与增强子16重叠的其余部分,可能代表该增强子中的非功能性或失活亚区28,29。
作者声明无竞争利益。
感谢Ramialison实验室(转录组学与生物信息学,reNEW生物信息学中心)成员的有益讨论。MR和HTN的研究由澳大利亚国家健康与医学研究委员会(NHMRC) Ideas项目基金(APP1180905)资助。感谢Richard Saffery提供的支持。MR由心脏基金会未来领袖奖学金(107328)资助。默多克儿童研究所的额外基础设施经费由澳大利亚政府国家健康与医学研究委员会独立研究机构基础设施支持计划提供。澳大利亚再生医学研究所由维多利亚州政府和澳大利亚政府的资助项目支持。诺和诺德基金会干细胞医学中心由诺和诺德基金会基金(NNF21CC0073729)支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机工作站 | N/A | N/A | 具备网页浏览功能的计算机,支持 Windows/Mac/Linux 操作系统 |
| 4DN 数据门户 | 4DN 数据门户 | https://data.4dnucleome.org/ | |
| Galaxy | Galaxy | https://usegalaxy.org/published/history?id=aff5db4e07064445 | |
| Github | Github | https://github.com/Ramialison-Lab/EnhancerWorkflow | |
| VISTA | VISTA 心脏增强子浏览器 | https://portal.nersc.gov/dna/RD/heart/ |