DNA 调控元件(如增强子)通过与靶基因启动子发生物理接触来调控基因表达,这种接触通常通过跨越较大基因组距离的长距离染色体相互作用实现。启动子捕获 Hi-C(PCHi-C)可鉴定启动子与远端区域之间的显著相互作用,从而能够将潜在的调控序列与其靶基因相对应。
方法文章
* These authors contributed equally
DNA 调控元件(如增强子)通过与靶基因启动子发生物理接触来调控基因表达,这种接触通常通过跨越较大基因组距离的长距离染色体相互作用实现。启动子捕获 Hi-C(PCHi-C)可鉴定启动子与远端区域之间的显著相互作用,从而能够将潜在的调控序列与其靶基因相对应。
基因组的三维结构与其功能密切相关。例如,转录增强子等调控元件通过物理接触控制其靶基因在时空上的表达,常常跨越相当长的基因组距离(在某些情况下可达数百千碱基),并跳过邻近的基因。人类基因组中估计存在约一百万个增强子,其中绝大多数的靶基因尚不明确。因此,将远端调控区域与其靶基因进行匹配,对于理解基因表达调控至关重要。我们开发了启动子捕获 Hi-C(Promoter Capture Hi-C, PCHi-C)技术,可在单次实验中全基因组范围内检测所有启动子的远端互作区域(PIRs)。在 PCHi-C 中,利用数千条与所有含启动子的限制性酶切片段末端互补的生物素化 RNA 探针,通过溶液中的杂交富集方法,特异性富集复杂度极高的 Hi-C 文库中的启动子序列。其目标是捕获启动子序列及其频繁互作的伙伴,例如增强子及其他潜在的调控元件。在高通量双端测序之后,对每个与启动子连接的限制性酶切片段进行统计学分析,以在限制性酶切片段水平上鉴定出具有显著意义的 PIRs。我们已利用 PCHi-C 生成了数十种人和小鼠细胞类型的长距离启动子互作图谱。这些启动子互作图谱通过将潜在的调控区域分配给其靶基因,并揭示出启动子-启动子之间优先发生的空间互作网络,增进了人们对哺乳动物基因表达调控机制的理解。此外,这些信息在解析人类遗传疾病方面也具有重要意义,可通过将位于调控序列内部或附近的非编码疾病相关序列变异与其靶基因关联起来,帮助识别潜在的致病基因。
越来越多的证据表明,基因组的三维结构在多种细胞核过程中发挥着重要的功能作用,包括基因激活1,2,3、抑制4,5,6,7,8、重组9,10、DNA修复11、DNA复制12,13以及细胞衰老14。远端增强子与其调控的启动子在空间上处于紧密邻近的位置15,16,17,这对于精确的时空基因表达调控至关重要。增强子缺失实验表明,远端增强子对靶基因的转录至关重要18,19,20,21,22;而“强制染色质成环”实验则证明,在Hbb基因座中人为连接增强子与其靶启动子足以驱动转录激活23。此外,导致基因被异位增强子控制的基因组重排可引发异常的基因激活并导致疾病24,25,26。这些实例共同说明,启动子-增强子相互作用对基因调控至关重要,并且需要严格的调控以确保基因的正确表达。据估计,人类和小鼠基因组中各自含有约一百万个增强子。对于其中绝大多数增强子而言,其靶基因尚不明确,启动子与增强子之间的“作用规则”也仍不清楚。因此,将转录增强子准确指派至其靶基因,仍是解析哺乳动物基因表达调控机制的一项重大挑战。
由于染色体构象捕获技术 3C27(chromosome conformation capture)及其多种变体28,29,30,31 的出现,我们对三维基因组结构的理解发生了革命性变化。在这些技术中,最强大的是 Hi-C(高通量染色体构象捕获),其设计目的是鉴定细胞群体中全部的染色体相互作用。Hi-C 文库通常由数百万个细胞构建,复杂度极高,在人类基因组中约 4 kb 片段之间估计存在 1011 个独立的连接产物32。因此,除非对 Hi-C 文库进行超深度测序,否则从 Hi-C 数据中可靠且可重复地鉴定单个限制性酶切片段(例如包含启动子或增强子的片段)之间的相互作用是不可行的,而超深度测序对于常规制备 Hi-C 文库的实验室而言并非经济可行的方案。为克服这一局限,我们开发了启动子捕获 Hi-C(Promoter Capture Hi-C)技术,以特异性富集 Hi-C 文库中包含启动子的连接产物。我们选择启动子作为目标基于两个原因:第一,大量研究已表明启动子与增强子之间的相互作用对基因表达水平的精确调控至关重要(参见上述参考文献);第二,由于启动子在不同细胞类型之间具有高度保守性,因此可使用相同的捕获探针系统,在多种细胞类型和条件下研究调控网络。该方法依赖于将 Hi-C 文库与数万个生物素标记的 120 核苷酸长 RNA 探针在溶液中进行杂交,这些探针与包含启动子的 Hi-C 连接产物互补,随后通过链霉亲和素包被的磁珠进行富集。该过程获得的 PCHi-C 文库相较于原始 Hi-C 文库复杂度显著降低,仅聚焦于鉴定那些以较高频率与启动子发生连接的片段。
我们已在多种人类和小鼠细胞类型中应用PCHi-C技术,以增进对基因表达调控的理解,揭示具有潜在调控功能的远端启动子相互作用区域,以及细胞核三维空间中非随机的启动子-启动子接触。这些研究已在多种细胞类型中绘制出数十万个启动子-增强子相互作用图谱33,34,35,36,37,38,39,鉴定了小鼠胚胎干细胞中由Polycomb抑制复合物介导的基因组空间结构7,揭示了细胞分化过程中启动子相互作用组的大规模重连现象37,38,39,并将非编码区的疾病相关序列变异与基因启动子联系起来35。
PCHi-C 是一种非常适合用于绘制与启动子相互作用的全基因组DNA序列集合的方法。相关技术,例如连续基因组区域的Capture Hi-C(见讨论),则是获取特定基因组区域高分辨率相互作用图谱的首选方法。从实验角度来看,PCHi-C 与 Capture Hi-C 极为相似(唯一的区别在于捕获系统的选择),因此我们提供的建议和指导原则适用于这两种方法。本文中,我们详细描述了PCHi-C技术,概述了PCHi-C实验的设计原理,提供了逐步的PCHi-C文库构建方案,并说明了如何在实验流程的各个步骤中监测PCHi-C文库的质量,以获得高质量的数据。
1. 甲醛固定
2. 细胞裂解
3. HindIII 消化
4. 限制性片段突出端的生物素标记
5. 核内连接
6. 交联逆转
7. DNA 纯化
8. 质量控制
9. DNA 片段化
10. 双侧 SPRI 磁珠片段筛选
11. 连接产物的生物素/链霉亲和素下拉实验
12. 非连接DNA末端的末端修复及生物素去除
13. dATP加尾
14. 接头连接
15. Hi-C 文库扩增
16. 溶液杂交捕获
注意:以下封闭剂和缓冲液(SHS1-4)溶液来自 SureSelect 试剂盒(参见材料表)。
17. 含启动子片段连接产物的分离
注意:建议使用 SureSelect 接头试剂盒和文库(参见材料表)进行以下步骤。
18. PCHi-C 文库扩增
启动子捕获 Hi-C 已被用于富集小鼠7,34,36,39 和人类33,35,37,38 用于启动子相互作用的Hi-C文库。Sandberg课题组已描述过一种类似方案(名为HiCap)。40. 图1A 展示了启动子捕获Hi-C(Promoter Capture Hi-C)的示意图工作流程。在本方案中,Hi-C文库通过细胞核内连接(in-nucleus ligation)方法构建41,从而显著减少非特异性连接产物的数量42对于PCHi-C,使用分别针对小鼠或人类启动子区域的复杂Hi-C文库进行溶液内杂交和捕获。具体而言,采用39,021条生物素标记的RNA探针靶向22,225个包含小鼠启动子的HindIII限制性片段,或采用37,608条生物素标记的RNA探针靶向22,076个包含人类启动子的HindIII限制性片段。每条生物素标记的RNA探针可靶向启动子所在限制性片段的一端或两端。图1B)。我们发现,同时捕获两端可改善各个启动子的覆盖度(图1C;原始序列读长)几乎增加了一倍,符合预期。因此,只要可能(即, 在非重复区域,建议使用与待捕获限制性片段两端互补的生物素标记RNA。
为在文库构建早期阶段评估 PCHi-C 文库质量,我们在 DNA 连接与纯化后进行两项对照,方法如前所述31第一种方法是使用特异性引物对扩增连接产物,如 3C 所用27我们使用引物对(表1)以扩增细胞类型不变的长距离连接产物,例如两者之间的 Myc 基因及其位于约 2 Mb 远处的已知增强子(图 2A或基因之间的 组蛋白1 位点(相距1.5 Mb)之间,以及位于线性位置邻近的两个区域之间(“短程调控”)。
第二次质量控制用于测定在Klenow酶介导下,利用生物素标记的dATP填补限制性酶切位点突出末端时生物素掺入的效率。成功的Klenow填补反应及随后的平末端连接会导致连接产物中DNA分子之间的原始限制性酶切位点消失,以HindIII为例,会形成一个新的NheI识别位点(图2B)。HindIII与NheI消化连接产物的比例可直接反映生物素掺入的效率。质量较差的Hi-C文库会表现出较高水平的HindIII消化,而高质量文库的连接产物则几乎完全被NheI消化(图2B)。
Hi-C文库构建后(即, 在对经大小选择的Hi-C连接产物进行生物素-链霉亲和素下拉、接头连接和捕获前PCR后,通过Bioanalyzer评估Hi-C文库的完整性和片段大小分布图2C)。相同的对照在PCHi-C文库构建结束时进行(即, 在杂交捕获含有启动子的连接产物及捕获后PCR完成后,对Hi-C与PCHi-C的Bioanalyzer图谱进行比较。结果显示,与预期一致,Hi-C文库的浓度显著高于相应的PCHi-C文库,但两者文库的片段大小分布高度相似,表明PCHi-C中的捕获步骤未引入片段大小偏好性。图2C, D).
双端测序完成后,使用 HiCUP 流程对 PCHi-C 读段进行比对、质量控制和过滤43高质量的 PCHi-C 文库包含 70–90% 的“有效配对”即, 线性基因组图谱上非相邻的两个限制性片段之间的成对末端测序读段; 图 3A, B)。采用细胞核内连接反应方案41,42,百分比 转 成对读段(即, 位于不同染色体上的两个限制性片段之间的成对末端序列读长(即染色体间有效配对)通常比例较低,介于5%至25%之间,这反映了染色体疆域的存在,也表明文库质量良好。对Hi-C文库与其相应的PCHi-C文库之间“有效配对”比例进行直接比较35,表明在所有情况下,PCHi-C文库中有效配对的比例均高于图3B伴随PCHi-C中非有效“相同片段内”reads百分比的降低(图3C)。这是预料之中的,因为捕获步骤不仅富集含有启动子的连接产物,还会富集限制性片段末端,这是由于捕获寡核苷酸在限制性片段上的位置所致(参见 图1B).
HiCUP 过滤后,我们确定捕获效率。PCHi-C 文库在 HiCUP 过滤后包含三种类型的有效序列读段:
1.) 启动子:基因组读段(即, 基因组中任意位置的非启动子 HindIII 限制性片段与捕获的启动子片段之间的测序读段
2.) 启动子:启动子区读段(位于两个捕获的启动子片段之间的读段)
3.) 基因组:基因组读段(捕获的启动子中,连接产物的两端均未比对到任何捕获启动子的背景Hi-C连接产物)。此类读段在下游分析前予以剔除。
高质量的 PCHi-C 文库的捕获效率(上述第 1 类和第 2 类之和)介于 65–90% 之间(图 3D)。与 Hi-C 文库的直接比较表明,PCHi-C 在含有启动子的连接产物上实现了约 15 倍的富集(图 3D),在某些情况下可达 17 倍。这一数值接近 PCHi-C 的理论最大富集倍数(19.6 倍),该理论值取决于捕获系统所覆盖的基因组限制性片段的比例。通过设计靶向更少限制性片段的捕获系统,可实现更高的富集倍数44,45,46。
启动子相互作用组的分析表明其具有细胞类型和谱系特异性33,34,35,并在细胞分化过程中表现出显著变化37,38,39。图 4 和图 5 展示了特定启动子在谱系特异性和分化动态方面的示例。例如,ALAD 在所有细胞中均组成型表达,但在成红细胞中其表达上调47。ALAD 启动子在所有造血细胞中均与多个远端片段发生接触,并在成红细胞中特异性地形成额外的相互作用(图 4)。IL-8 在B细胞中无统计学显著的相互作用,在T细胞中相互作用极少,但在髓系细胞中存在数十个相互作用,包括在单核细胞、中性粒细胞和巨核细胞中的细胞类型特异性相互作用(图 5)。这些示例展示了如何利用PCHi-C技术解析细胞类型特异的相互作用组,并鉴定具有调控潜力的启动子互作区域。

图1:启动子捕获Hi-C原理及捕获探针设计。 (A) PCHi-C的示意图工作流程。在细胞核内连接的Hi-C方法41,42(I)之后,进行溶液中杂交,使用生物素标记的RNA探针(II)靶向所有人类(图中所示)或小鼠基因启动子的限制性酶切片段(III)。(B) PCHi-C的探针设计。针对含有启动子的限制性酶切片段末端设计生物素标记的RNA捕获探针(红色曲线),这些片段以灰色表示(注意:仅当启动子序列本身(红色)位于限制性酶切片段末端时,才会被RNA捕获探针靶向)。如图A所示,通过RNA探针与DNA靶标的序列互补杂交,随后进行生物素-链霉亲和素富集,分离出由含启动子的限制性酶切片段(灰色)及其相互作用的限制性酶切片段(黄色和绿色)组成的连接产物。(C) 比较使用一个RNA探针与两个RNA探针靶向含启动子的限制性酶切片段时PCHi-C的捕获效率(见B图示意图)。请点击此处查看该图的放大版本。

图 2:PCHi-C 测序前质量控制。 (A) 左图,启动子与 PIR 在空间上的邻近关系示意图,导致形成 Hi-C 连接产物,该产物由包含启动子的限制性片段(灰色;启动子序列以红色表示)和 PIR 限制性片段(黄色)组成。右图,通过特异性引物对(如左图示意图所示)扩增 Hi-C 连接产物的 DNA 凝胶电泳结果示例。 (B) 左图,Hi-C 连接产物(即 A 中所示 PCR 产物)经 HindIII、NheI 及 HindIII/NheI 限制性酶切的代表性结果。右图,Hi-C 连接后 DNA 序列的示意图,显示限制性连接处经 Klenow 酶 dNTP 填补连接不成功(上)或成功(下)后的序列结构。 (C) 代表性 Hi-C 文库 Bioanalyzer 谱图(稀释 1/5)。 (D) 代表性 PCHi-C 文库 Bioanalyzer 谱图(未稀释)。 请点击此处查看该图的放大版本。

图3:PCHi-C测序后质量控制。(A)PCHi-C与相应Hi-C文库在经过HiCUP43处理后有效序列读段对百分比的比较(数据来自Javierre et al., 201635)。(B)典型的HiCUP PCHi-C结果,显示有效读段对以及其他在下游分析前被剔除的序列类别(数据来自Javierre et al., 201635)。(C)PCHi-C与相应Hi-C文库在经过HiCUP处理后“同一片段内部”读段百分比的比较(数据来自Javierre et al., 201635)。(D)PCHi-C与相应Hi-C文库中涉及捕获启动子片段的序列读段百分比(捕获效率)比较(数据来自Javierre et al., 201635)。请点击此处查看该图的放大版本。

图 4:ALAD 基因在人类造血细胞中的 PCHi-C 谱图。 髓系细胞类型的启动子相互作用以蓝色拱形表示,淋巴系细胞类型的启动子相互作用以紫色拱形表示。红细胞前体细胞特异性的相互作用由红色箭头标示(数据来自 Javierre 等,201635)。请点击此处查看此图的放大版本。

图5: IL8 在人类造血细胞中的PCHi-C图谱。 髓系细胞类型的启动子相互作用以蓝色弧线表示,淋系细胞类型的启动子相互作用以紫色弧线表示。单核细胞特异性相互作用由绿色箭头指示,中性粒细胞特异性相互作用由红色箭头指示,巨核细胞特异性相互作用由棕色箭头指示(数据来自Javierre et al., 201635)。请点击此处查看该图的放大版本。
| 人 | ||||||||
| 名称 | 序列 | 染色体 | 链 | 起始位置 GRCh38/hg38 | 终止位置 GRCh38/hg38 | 用于检测 3C 相互作用和生物素掺入的引物组合 | ||
| hs AHF64 Dekker | GCATGCATTAGCCTCTGCTGTTCTCTGAAATC | 11 | + | 116803960 | 116803991 | 需与 hs AHF66 Dekker 联用 | ||
| hs AHF66 Dekker | CTGTCCAAGTACATTCCTGTTCACAAACCC | 11 | + | 116810219 | 116810248 | 需与 hs AHF64 Dekker 联用 | ||
| hs MYC 位点 | GGAGAACCGGTAATGGCAAA | 8 | - | 127733814 | 127733833 | 需与 hs MYC +1820 或 hs MYC -538 联用 | ||
| hs MYC +1820 | AAAATGCCCATTTCCTTCTCC | 8 | + | 129554527 | 129554547 | 需与 hs MYC 位点联用 | ||
| hs MYC -538 | TGCCTGATGGATAGTGCTTTC | 8 | - | 127195696 | 127195716 | 需与 hs MYC 位点联用 | ||
| hs HIST1 F | AAGCAGGAAAAGGCATAGCA | 6 | + | 26207174 | 26207193 | 需与 hs HIST1 R 联用 | ||
| hs HIST1 R | TCTTGGGTTGTGGGACTTTC | 6 | + | 27771575 | 27771594 | 需与 hs HIST1 F 联用 | ||
| 小鼠 | ||||||||
| 序列 | 染色体 | 链 | 起始位置 GRCm38/mm10 | 终止位置 GRCm38/mm10 | 用于检测 3C 相互作用和生物素掺入的引物组合 | |||
| TCATGAGTTCCCCACATCTTTG | 8 | + | 84841090 | 84841111 | 需与 mm Calr2 联用 | |||
| CTGTGGGCACCAGATGTGTAAAT | 8 | + | 84848519 | 84848541 | 需与 mm Calr1 联用 | |||
| TATCAAGGGTGCCCGTCACCTTCAGC | 6 | + | 125163098 | 125163123 | 需与 Gapdh4 Dekker 联用 | |||
| GGGCTTTTATAGCACGGTTATAAAGT | 6 | + | 125163774 | 125163799 | 需与 Gapdh3 Dekker 联用 | |||
| GGAGGAGGGAAAAGGAGTGATT | 6 | + | 52212829 | 52212850 | 需与 mm Hoxa13 联用 | |||
| CAGGCATTATTTGCTGAGAACG | 6 | - | 52253490 | 52253511 | 需与 mm Hoxa7 联用 | |||
| GGGTAATGGTGTCACTAACTGG | 13 | + | 23571284 | 23571305 | 需与 mm Hist1h3e 或 mm Hist1h4i 联用 | |||
| GGGTTTGATGAGTTGGTGAAG | 13 | + | 23566541 | 23566561 | 需与 mm Hist1h2ae 联用 | |||
| TTGGGCCAAAGCCTATATGA | 13 | + | 22043085 | 22043104 | 需与 mm Hist1h2ae 联用 | |||
表1:人和小鼠Hi-C文库质量控制的引物序列。
启动子捕获 Hi-C 的模块化设计
启动子捕获 Hi-C 旨在特异性富集涉及启动子的 Hi-C 文库中的相互作用。这些相互作用仅占 Hi-C 文库中存在连接产物的一个子集。
通过改变捕获系统,染色体构象捕获技术(Capture Hi-C)可轻松地对任何感兴趣的基因组区域或多个区域进行富集。捕获区域可以是连续的基因组片段44,45,46,48、在PCHi-C中已鉴定出的增强子(“反向捕获Hi-C”35),或DNase I超敏感位点49。捕获系统的规模可根据实验范围进行调整。例如,Dryden et al. 针对与乳腺癌相关的三个基因沙漠中的519个诱饵片段进行捕获44。Martin et al. 的捕获系统则同时靶向连续的基因组片段(“区域捕获”:共211个基因组区域,包含2,131个限制性酶切片段)和选定的启动子(3,857个基因启动子)45。
SureSelect文库提供多种不同的大小范围:1 kb至499 kb(5,190–4,806)、500 kb至2.9 Mb(5,190–4,816)以及3 Mb至5.9 Mb(5,190–4,831)。由于每条捕获用的生物素化RNA长度为120个核苷酸,这些捕获系统分别最多可容纳4,158、24,166和49,166条独立的捕获探针。这分别对应2,079、12,083和24,583个靶向的限制性酶切片段(注意:限制性酶切片段的数量是基于每个限制性酶切片段可设计两条独立捕获探针的假设得出的下限值——实际上,由于重复序列的存在,并非每个限制性酶切片段都能设计出两条探针(另见图1B、C),因此在捕获探针数量固定的情况下,实际可靶向的限制性酶切片段数量会更高)。
本文所述方案基于使用识别位点为6 bp的限制性内切酶来揭示远距离相互作用。使用识别位点为4 bp的限制性内切酶以获得更高分辨率的邻近相互作用也是可行的40,49。
PCHi-C 的局限性
所有染色体构象捕获检测方法的一个固有局限性在于,其分辨率取决于文库构建过程中所使用的限制性内切酶。位于同一限制性片段上的DNA元件之间的相互作用在“C型”检测中是不可见的。此外,在PCHi-C中,某些情况下同一个包含启动子的限制性片段上可能含有多个转录起始位点,且某些PIR区域同时带有激活和抑制性的组蛋白修饰标记,这使得难以确定是哪些调控元件介导了这些相互作用,也难以预测启动子相互作用的调控结果。使用识别位点为4 bp的限制性内切酶可在一定程度上缓解这一问题,但代价是显著增加Hi-C文库的复杂性(使用识别位点为4 bp的限制性内切酶构建的Hi-C文库,其复杂性至少是使用识别位点为6 bp的限制性内切酶构建的Hi-C文库的100倍),并相应提高下一代测序的成本。
另一个局限性在于,目前的PCHi-C方案需要以数百万个细胞作为起始材料,从而无法对稀有细胞类型中的启动子相互作用进行分析。因此,若能对PCHi-C进行改进,使其可用于10,000至100,000个细胞的细胞群体(例如早期胚胎发育过程中的细胞或造血干细胞)来检测启动子互作,则将是对Capture Hi-C技术工具箱的一项重要补充。
最后,与所有依赖甲醛固定的实验方法一样,PCHi-C 仅能记录在固定时间点被“冻结”的相互作用。因此,要研究启动子相互作用的动力学和动态变化,还需结合超分辨率活细胞显微镜等技术与 PCHi-C 一同使用。
高分辨率解析空间染色体结构的方法
染色体相互作用文库的高度复杂性使得在统计学上可靠地鉴定两个特定限制性片段之间的相互作用产物变得极为困难。为解决这一问题,已采用序列捕获技术来富集特定的相互作用,包括Hi-C33,34,40,44或3C50,51文库。在富集步骤中,使用Hi-C文库相较于3C文库的主要优势在于,Hi-C在实验流程中包含对真实连接产物的富集步骤,而3C则不具备这一特性。因此,PCHi-C文库中有效读段的比例比Capture-C文库高出约10倍;后者在经过HiCUP过滤后仅包含约5–8%的有效读段50。Sahlen et al. 直接比较了Capture-C与HiCap,其中HiCap与PCHi-C类似,均使用Hi-C文库进行捕获富集,而Capture-C则使用3C文库。与我们的研究结果一致,他们发现Capture-C文库主要由未连接的片段组成40。此外,HiCap文库的复杂性也高于Capture-C文库40。
一种Capture-C的变体,称为下一代Capture-C52(NG Capture-C),与原始Capture-C方案50中使用的重叠探针不同,其采用每个限制性酶切片段末端对应一条寡核苷酸探针的设计,该策略此前已在PCHi-C33,34中建立。这种方法相较于传统的Capture-C仅适度提高了有效读段的比例,但NG Capture-C采用了两轮连续的捕获富集步骤,并进行了相对较多的PCR循环(总共20至24个循环,而PCHi-C通常为11个循环),这不可避免地导致序列重复数增加以及文库复杂度降低。在PCHi-C优化过程中的试验实验中,我们发现当使用19个PCR循环(捕获前13个循环 + 捕获后6个循环;数据未显示)时,唯一(即非重复)读段对的比例仅约为15%;然而,通过优化减少PCR循环次数,通常可获得75–90%的唯一读段对。因此,降低PCR循环次数可显著增加信息性序列数据的产量。
一种近期方法将染色质免疫沉淀(ChIP)与Hi-C技术相结合,以聚焦于由特定目标蛋白介导的染色体相互作用(HiChIP)53)。与 ChIA-PET 相比54,其原理类似,HiChIP 数据包含更多的有效序列读段,从而能够更可靠地识别相互作用53一旦相应的HiChIP和Capture Hi-C数据集可获取时(例如使用针对黏连蛋白亚基Smc1a的抗体进行的HiChIP),直接比较这些数据集将非常有意义。53 使用Capture Hi-C对所有Smc1a结合的限制性片段进行检测,并与之并列比较。这两种方法的一个内在差异在于,Capture Hi-C不依赖染色质免疫沉淀,因此能够检测染色体相互作用,而无需考虑蛋白质占据情况。这使得可以在特定因子结合存在或缺失的情况下比较三维基因组结构,正如先前研究所示,该方法已被用于鉴定PRC1是小鼠ESC空间基因组结构的关键调控因子。7.
PCHi-C 与 GWAS
全基因组关联研究(GWAS)表明,超过95%的疾病相关序列变异位于基因组的非编码区,且通常距离蛋白质编码基因较远55。GWAS发现的变异位点常位于DNase I超敏感位点附近,而后者是具有潜在调控活性序列的特征标志。PCHi-C和Capture Hi-C已被广泛用于将启动子与乳腺癌44、结直肠癌48以及自身免疫性疾病35,45,46相关的GWAS风险位点进行连接。一项针对17种不同人类造血细胞类型的PCHi-C研究发现,与自身免疫性疾病相关的单核苷酸多态性(SNPs)在淋巴样细胞的启动子互作区域(PIRs)中富集,而与血小板和红细胞特异性性状相关的序列变异则主要分别出现在巨噬细胞和成红细胞中35,56。因此,通过PCHi-C揭示的组织类型特异性启动子互作组,有助于理解非编码区疾病相关序列变异的功能,并识别可用于治疗干预的新潜在致病基因。
启动子相互作用区域的特征
多项证据表明启动子互作组与基因表达调控相关。首先,多项PCHi-C研究显示,与(高)表达基因的启动子发生互作的基因组区域富集了与增强子活性相关的标记,例如H3K27乙酰化和p300结合33,34,37。我们发现基因表达水平与互作增强子的数量呈正相关,提示增强子的累加效应可导致基因表达水平升高34,35。其次,自然发生的表达数量性状位点(eQTLs)在与受其影响基因相连接的启动子互作区域(PIRs)中显著富集35。第三,通过整合TRIP57与PCHi-C数据,Cairns et al. 发现,在小鼠胚胎干细胞(ESCs)中,定位至PIRs的TRIP报告基因比整合到非启动子互作区域的报告基因表现出更强的表达活性58,表明PIRs具有转录调控功能。综上所述,这些发现提示,通过PCHi-C在多种小鼠和人类细胞类型中揭示的启动子互作组包含了基因表达调控的关键调控模块。
值得注意的是,在PCHi-C技术所发现的所有成对相互作用区域(PIR)中,增强子仅占一小部分(约20%)33,34。其他PIR可能具有结构或拓扑学功能,而非直接的转录调控作用。然而,也有证据表明,PCHi-C可能识别出不携带经典增强子标记但具有调控功能的DNA元件。在一种人类淋巴样细胞系中,BRD7 启动子被发现与一个缺乏增强子标记的区域发生相互作用,而该区域在报告基因实验中表现出增强子活性33。具有类似特征的调控元件可能比目前所认识到的更为丰富。例如,一项基于CRISPR的调控DNA元件筛选研究鉴定出一类无标记调控元件(UREs),这类元件能够调控基因表达,但并不具备增强子标记59。
在其他情况下,PIR被发现带有与转录抑制相关的染色质标记。在小鼠胚胎干细胞中,与PRC1结合的PIR及其相互作用的启动子参与了一个广泛的空间网络,该网络包含带有抑制性标记H3K27me3的被抑制基因7。在人类淋巴母细胞系中,一个与BCL6启动子相互作用的远端元件抑制了转基因报告基因的表达33,提示该元件在其天然环境中可能具有抑制BCL6转录的功能。
在人类ESC和NEC中,富含染色质绝缘蛋白CTCF占据的PIR37可能代表另一类PIR。总体而言,这些结果表明,PIR包含一系列尚未在功能上被表征的基因调控活性。
作者无任何利益冲突需要披露。
感谢 Valeriya Malysheva 对本文手稿的审阅以及对图1提供的专业帮助。本工作得到英国医学研究理事会(MR/L007150/1)和英国生物技术和生物科学研究所(BB/J004480/1)的支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 16% (体积/体积) 多聚甲醛溶液 | Agar Scientific | R1026 | |
| 杜尔贝科改良伊格尔培养基 (DMEM) 1x | Life Technologies | 41965-039 | |
| 胎牛血清 (FBS),无菌过滤 | Sigma | F9665 | |
| 低吸附滤芯吸头 | Starlab | S1180-3810, S1180-1810, S1180-8810 和 S1182-1830 | |
| 10x PBS,pH 7.4 | Life Technologies | 70011-036 | |
| 分子生物学级水 | Sigma-Aldrich | W4502 | |
| 1 M Tris-HCl,pH 8.0 | Life Technologies | 15568-025 | |
| IGEPAL CA-630 | Sigma-Aldrich | I8896 | |
| 5 M NaCl | Life Technologies | 24740-011 | |
| 蛋白酶抑制剂混合物(不含EDTA) | Roche Diagnostics | 11873580001 | |
| 限制性酶切缓冲液2 (10x NEBuffer 2) | New England Biolabs | B7002 | |
| DNA LoBind 管,1.5 mL | Eppendorf | 0030 108.051 | |
| DNA LoBind 管,2 mL | Eppendorf | 30108078 | |
| 20% (质量/体积) SDS | Bio-Rad Laboratories | 161-0418 | |
| 20% (体积/体积) Triton X-100 | Sigma-Aldrich | T8787 | |
| HindIII,100 U/μL | New England Biolabs | R0104 | |
| 10 mM dCTP | Life Technologies | 18253-013 | |
| 10 mM dGTP | Life Technologies | 18254-011 | |
| 10 mM dTTP | Life Technologies | 18255-018 | |
| 0.4 mM Biotin-14-dATP | Life Technologies | 19524-016 | |
| DNA聚合酶I大片段(Klenow片段),5000 单位/mL | New England Biolabs | M0210 | |
| 10x T4 DNA连接酶反应缓冲液 | New England Biolabs | B0202 | |
| 100x 10 mg/mL 牛血清白蛋白 | New England Biolabs | B9001 | |
| T4 DNA连接酶,1 U/μLμL | Invitrogen | 15224-025 | |
| 核糖核酸酶A | Roche | 10109142001 | |
| 蛋白酶K,重组型,PCR级 | Roche | 3115836001 | |
| 20 000×g 50 mL 离心管 | VWR | 525-0156 | |
| 0.5 M EDTA,pH 8.0 | Life Technologies | 15575-020 | |
| 苯酚,pH 8.0 | Sigma | P4557 | |
| 苯酚:氯仿:异戊醇 25:24:1 | Sigma | P3803 | |
| 乙酸钠,pH 5.2 | Sigma | S7899 | |
| Quant-iT PicoGreen | Invitrogen | P7589 | |
| QIAquick 凝胶回收试剂盒 | Qiagen | 28704 | |
| QIAquick PCR 纯化试剂盒 | Qiagen | 28104 | |
| 限制性酶切缓冲液2.1 (10x NEBuffer 2.1) | New England Biolabs | B7202 | |
| NheI,100 U/μL | New England Biolabs | R0131 | |
| Micro TUBE AFA 纤维预切带卡扣盖 6x16 mm 管 | Covaris | 520045 | 用于超声处理 |
| SPRI 磁珠(Agencourt AMPure XP) | Beckman Coulter | A63881 | |
| Dynabeads MyOne 链霉亲和素C1磁珠 | Invitrogen | 65001 | |
| Tween 20 | Sigma | P9416 | |
| 10 mM dATP | Life Technologies | 18252-015 | |
| T4 DNA聚合酶,3000 单位/mL | New England Biolabs | M0203 | |
| T4 多核苷酸激酶(PNK),10000 单位/mL | New England Biolabs | M0201 | |
| Klenow exo minus,5000 单位/mL | New England Biolabs | M0212 | |
| 快速连接反应缓冲液 | New England Biolabs | B6058 | |
| NEB DNA 快速连接酶 | New England Biolabs | M2200 | |
| PE接头1.0 (5'-P-GATCGGAAGAGCGGTTCAGC AGGAATGCCGAG-3') | Illumina | ||
| PE接头2.0 (5'-ACACTCTTTCCCTACACGACGCT CTTCCGATCT-3') | Illumina | ||
| NEB Phusion PCR 试剂盒 | New England Biolabs | M0530 | |
| PE PCR 引物1.0 (5'-AATGATACGGCGACCACCGA GATCTACACTCTTTCCCTAC ACGACGCTCTTCCGATCT-3') | Illumina | ||
| PE PCR 引物2.0 (5'-CAAGCAGAAGACGGCATACGA GATCGGTCTCGGCATTCCT GCTGAACCGCTCTTCCGATCT-3') | Illumina | ||
| PCR 排管 | Agilent Technologies | 410022 和 401425 | |
| SureSelect SSEL TE 试剂 ILM PE 全接头试剂盒 | Agilent Technologies | 931108 | |
| SureSelect 定制 3-5.9 Mb 文库 | Agilent Technologies | 5190-4831 | 定制设计的小鼠或人类PCHi-C系统 |
| Dynabeads MyOne 链霉亲和素T1磁珠 | Invitrogen | 65601 | |
| E220 高性能聚焦超声破碎仪 | Corvaris | E220 |