方法文章

启动子捕获Hi-C:启动子相互作用的高分辨率全基因组分析

35K 次观看

⸱

DOI:

10.3791/57320

⸱

2018年6月28日

* These authors contributed equally

本文内容

摘要

DNA 调控元件(如增强子)通过与靶基因启动子发生物理接触来调控基因表达,这种接触通常通过跨越较大基因组距离的长距离染色体相互作用实现。启动子捕获 Hi-C(PCHi-C)可鉴定启动子与远端区域之间的显著相互作用,从而能够将潜在的调控序列与其靶基因相对应。

摘要

基因组的三维结构与其功能密切相关。例如,转录增强子等调控元件通过物理接触控制其靶基因在时空上的表达,常常跨越相当长的基因组距离(在某些情况下可达数百千碱基),并跳过邻近的基因。人类基因组中估计存在约一百万个增强子,其中绝大多数的靶基因尚不明确。因此,将远端调控区域与其靶基因进行匹配,对于理解基因表达调控至关重要。我们开发了启动子捕获 Hi-C(Promoter Capture Hi-C, PCHi-C)技术,可在单次实验中全基因组范围内检测所有启动子的远端互作区域(PIRs)。在 PCHi-C 中,利用数千条与所有含启动子的限制性酶切片段末端互补的生物素化 RNA 探针,通过溶液中的杂交富集方法,特异性富集复杂度极高的 Hi-C 文库中的启动子序列。其目标是捕获启动子序列及其频繁互作的伙伴,例如增强子及其他潜在的调控元件。在高通量双端测序之后,对每个与启动子连接的限制性酶切片段进行统计学分析,以在限制性酶切片段水平上鉴定出具有显著意义的 PIRs。我们已利用 PCHi-C 生成了数十种人和小鼠细胞类型的长距离启动子互作图谱。这些启动子互作图谱通过将潜在的调控区域分配给其靶基因,并揭示出启动子-启动子之间优先发生的空间互作网络,增进了人们对哺乳动物基因表达调控机制的理解。此外,这些信息在解析人类遗传疾病方面也具有重要意义,可通过将位于调控序列内部或附近的非编码疾病相关序列变异与其靶基因关联起来,帮助识别潜在的致病基因。

引言

越来越多的证据表明,基因组的三维结构在多种细胞核过程中发挥着重要的功能作用,包括基因激活1,2,3、抑制4,5,6,7,8、重组9,10、DNA修复11、DNA复制12,13以及细胞衰老14。远端增强子与其调控的启动子在空间上处于紧密邻近的位置15,16,17,这对于精确的时空基因表达调控至关重要。增强子缺失实验表明,远端增强子对靶基因的转录至关重要18,19,20,21,22;而“强制染色质成环”实验则证明,在Hbb基因座中人为连接增强子与其靶启动子足以驱动转录激活23。此外,导致基因被异位增强子控制的基因组重排可引发异常的基因激活并导致疾病24,25,26。这些实例共同说明,启动子-增强子相互作用对基因调控至关重要,并且需要严格的调控以确保基因的正确表达。据估计,人类和小鼠基因组中各自含有约一百万个增强子。对于其中绝大多数增强子而言,其靶基因尚不明确,启动子与增强子之间的“作用规则”也仍不清楚。因此,将转录增强子准确指派至其靶基因,仍是解析哺乳动物基因表达调控机制的一项重大挑战。

由于染色体构象捕获技术 3C27(chromosome conformation capture)及其多种变体28,29,30,31 的出现,我们对三维基因组结构的理解发生了革命性变化。在这些技术中,最强大的是 Hi-C(高通量染色体构象捕获),其设计目的是鉴定细胞群体中全部的染色体相互作用。Hi-C 文库通常由数百万个细胞构建,复杂度极高,在人类基因组中约 4 kb 片段之间估计存在 1011 个独立的连接产物32。因此,除非对 Hi-C 文库进行超深度测序,否则从 Hi-C 数据中可靠且可重复地鉴定单个限制性酶切片段(例如包含启动子或增强子的片段)之间的相互作用是不可行的,而超深度测序对于常规制备 Hi-C 文库的实验室而言并非经济可行的方案。为克服这一局限,我们开发了启动子捕获 Hi-C(Promoter Capture Hi-C)技术,以特异性富集 Hi-C 文库中包含启动子的连接产物。我们选择启动子作为目标基于两个原因:第一,大量研究已表明启动子与增强子之间的相互作用对基因表达水平的精确调控至关重要(参见上述参考文献);第二,由于启动子在不同细胞类型之间具有高度保守性,因此可使用相同的捕获探针系统,在多种细胞类型和条件下研究调控网络。该方法依赖于将 Hi-C 文库与数万个生物素标记的 120 核苷酸长 RNA 探针在溶液中进行杂交,这些探针与包含启动子的 Hi-C 连接产物互补,随后通过链霉亲和素包被的磁珠进行富集。该过程获得的 PCHi-C 文库相较于原始 Hi-C 文库复杂度显著降低,仅聚焦于鉴定那些以较高频率与启动子发生连接的片段。

我们已在多种人类和小鼠细胞类型中应用PCHi-C技术,以增进对基因表达调控的理解,揭示具有潜在调控功能的远端启动子相互作用区域,以及细胞核三维空间中非随机的启动子-启动子接触。这些研究已在多种细胞类型中绘制出数十万个启动子-增强子相互作用图谱33,34,35,36,37,38,39,鉴定了小鼠胚胎干细胞中由Polycomb抑制复合物介导的基因组空间结构7,揭示了细胞分化过程中启动子相互作用组的大规模重连现象37,38,39,并将非编码区的疾病相关序列变异与基因启动子联系起来35。

PCHi-C 是一种非常适合用于绘制与启动子相互作用的全基因组DNA序列集合的方法。相关技术,例如连续基因组区域的Capture Hi-C(见讨论),则是获取特定基因组区域高分辨率相互作用图谱的首选方法。从实验角度来看,PCHi-C 与 Capture Hi-C 极为相似(唯一的区别在于捕获系统的选择),因此我们提供的建议和指导原则适用于这两种方法。本文中,我们详细描述了PCHi-C技术,概述了PCHi-C实验的设计原理,提供了逐步的PCHi-C文库构建方案,并说明了如何在实验流程的各个步骤中监测PCHi-C文库的质量,以获得高质量的数据。

方案

1. 甲醛固定

  1. 细胞准备:每个实验至少从 2 × 107 个细胞开始。
    1. 对于培养的细胞,将其重悬于培养基中;对于离体(ex vivo)细胞,则重悬于含 10%(体积比)胎牛血清(FBS)的 1× Dulbecco 改良 Eagle 培养基(DMEM)中。
    2. 对于贴壁细胞,吸除培养基,加入 30.625 mL 含 10%(体积比)FBS 的新鲜培养基于室温(RT;20–25 °C)。
    3. 对于悬浮细胞,以 400 × g、20 °C 离心 3 分钟收集细胞,吸除上清液,将细胞沉淀重悬于 30.625 mL 含 10%(体积比)FBS 的培养基于室温(RT)。
    4. 对于实体组织,使用胰蛋白酶(终浓度 0.05% 至 2.5%,根据细胞类型而定)或 Dounce 匀浆器制备单细胞悬液。完成此额外步骤后,按悬浮细胞方式处理细胞。
  2. 加入 4.375 mL 16% 无甲醇多聚甲醛(使用前立即打开安瓿),使终浓度为 2%(体积比)。在摇床上室温(RT)轻柔混匀固定 10 分钟。
    注意:多聚甲醛为危险化学品,请遵守相应的健康与安全规定。
  3. 加入 5 mL 新鲜配制的冰冻 1 M 甘氨酸以终止反应。室温下轻柔振荡混匀 5 分钟,随后冰上孵育 15 分钟,期间偶尔颠倒混匀。
  4. 洗涤并收集固定后的细胞。
    1. 对于贴壁细胞,吸除上清液,在培养皿壁加入 10 mL 冰冻 1× PBS(pH 7.4),再吸除;加入 1 mL 冰冻 1× PBS(pH 7.4),用细胞刮刀刮下细胞并转移至 50 mL 离心管中。重复两次以尽可能收集全部细胞,最后用冰冻 PBS 定容至 50 mL。
    2. 对于悬浮细胞,以 760 × g、4 °C 离心 5 分钟,吸除上清液,将细胞沉淀重悬于 50 mL 冰冻 PBS(pH 7.4)中。
  5. 以 400 × g、4 °C 离心 10 分钟,小心吸除上清液。细胞沉淀可迅速在液氮中冷冻,随后于 -80 °C 保存数月。

2. 细胞裂解

  1. 将细胞沉淀重悬于50 mL新配制的预冷裂解缓冲液(10 mM Tris-HCl pH 8,0.2% (vol/vol) Igepal CA-630,10 mM NaCl,以及一片蛋白酶抑制剂混合物)中并混匀。冰上孵育30分钟,期间偶尔颠倒混匀。在4 °C、760 × g 条件下离心5分钟,沉淀细胞核,弃去上清液。

3. HindIII 消化

  1. 用1.25倍限制性缓冲液2洗涤细胞核。将细胞沉淀重悬于1 mL冰浴的1.25倍限制性缓冲液2中,转移至1.5 mL离心管。在4 °C、760 × g条件下离心5分钟,弃去上清液。
  2. 将细胞沉淀重悬于1790 µL的1.25倍限制性缓冲液2中。分装成5份等分试样,每份含500万至1000万个细胞,体积为358 µL的1.25倍限制性缓冲液2。
  3. 每份等分试样中加入11 µL 10%(wt/vol)SDS,在37 °C下以950转/分钟(rpm)在恒温混匀仪中振荡30分钟。若出现细胞团块,通过移液器吹打使其分散,避免产生气泡。
  4. 每份等分试样中加入75 µL 10% Triton X-100(vol/vol),在37 °C下以950 rpm在恒温混匀仪中振荡15分钟。若出现细胞团块,通过移液器吹打使其分散,避免产生气泡。
  5. 每份等分试样中加入12 µL 100 U/µL HindIII(总量1200单位),在恒温混匀仪中以950 rpm振荡,37 °C过夜(O/N)。
    1. 用于消化对照:在加入酶之前,从每份等分试样中取5 µL,共25 µL样本转移至新离心管(未消化对照);加入酶后重复相同操作(已消化对照)。将两个对照管与Hi-C文库样品在相同条件下孵育。
  6. 次日早晨,每份等分试样中加入5 µL 100 U/µL HindIII(总量500单位),在恒温混匀仪中以950 rpm振荡,37 °C孵育2小时。
  7. 消化对照:对已消化和未消化对照样品(见步骤3.5.1),进行交联逆转(步骤6)、苯酚:氯仿抽提及DNA沉淀(步骤7)。
    1. 设计一对跨越HindIII位点的引物。在同一区域设计另一对不跨越HindIII位点的引物。使用Primer3(http://bioinfo.ut.ee/primer3-0.4.0/)设计定量PCR(Q-PCR)引物,参数如下:
      引物长度:最佳20(最小18,最大27);引物Tm值:最佳60(最小57,最大63);引物GC%含量:最小20,最大80;扩增子大小:实时PCR约100 bp(常规PCR约300 bp);错配引物库:人源(人引物)或啮齿类与简单序列(小鼠引物)。
    2. 进行Q-PCR,获得4个平均Ct值(阈值循环数):Ct[D;H]来自已消化样本[D]与跨越HindIII位点[H]的引物对;Ct[D;-]来自已消化样本[D]与不跨越HindIII位点[-]的引物对;Ct[U;H]来自未消化样本[U]与跨越HindIII位点[H]的引物对;Ct[U;-]来自未消化样本[U]与不跨越HindIII位点[-]的引物对。计算消化百分比公式为:% 消化 = 100 - 100 / 2(Ct[D,H] - Ct[D,-]) - (Ct[U,H] - Ct[U,-])。

4. 限制性片段突出端的生物素标记

  1. 配制生物素标记主混合液:10x 限制性酶切缓冲液 2 30.6 µL,分子生物学级 H2O 10.2 µL,10 mM dCTP 7.65 µL,10 mM dGTP 7.65 µL,10 mM dTTP 7.65 µL,0.4 mM 生物素-14-dATP 191.25 µL,以及 5,000 U/mL DNA 聚合酶 I 大片段(Klenow 片段)51 µL。
  2. 每份样品中加入 60 µL 生物素标记主混合液,混匀后置于 37 °C 条件下孵育 1 小时,以 700 rpm(恒温混匀仪)每 30 秒振荡 5 秒。孵育 1 小时后,将样品置于冰上。

5. 核内连接

  1. 配制连接反应主混合液:510 µL 10x T4 DNA连接酶缓冲液、51 µL 10 mg/mL 牛血清白蛋白(100x BSA)、1754.4 µL 分子生物学级水和 127.5 µL 1 U/µL T4 DNA连接酶(参见材料表)。
  2. 每份分装混合物中加入 479 µL 连接反应主混合液,在恒温混匀仪中于 16 °C 孵育 4 小时,每 2 分钟以 700 rpm 振荡 5 秒。
  3. 在室温下孵育 30 分钟。

6. 交联逆转

  1. 将所有等分试样合并至一个50 mL离心管中(适用于高速离心)。
  2. 加入62.5 µL 10 mg/mL的RNase A,混匀,并在37 °C孵育30分钟。
  3. 加入300 µL 10 mg/mL的Proteinase K,混匀,并在37 °C孵育30分钟。
  4. 在65 °C孵育反应过夜(或至少4小时)。次日早晨,加入300 µL 10 mg/mL的Proteinase K,混匀,并在65 °C孵育1小时。

7. DNA 纯化

  1. 加入 4337.5 µL TLE 缓冲液(10 mM Tris-HCl pH 8.0;0.1 mM EDTA pH 8.0),混匀。
  2. 加入 1 体积(10 mL)pH 8.0 的苯酚,涡旋振荡 10 秒,然后在室温下以 20,000 × g 离心 3 分钟。将上层(水相)9 mL 转移至新的 50 mL 离心管中。
    注意:苯酚为危险化学品,请遵守相应的健康与安全规定。
  3. 向剩余的水相中加入 2 mL TLE 缓冲液,涡旋振荡 10 秒,然后在室温下以 20,000 × g 离心 3 分钟。将 2.5 mL 水相转移至步骤 7.2 中的新离心管中,最终体积为 11.5 mL。弃去含有下层(有机相)的离心管。
  4. 加入 1 体积(11.5 mL)苯酚:氯仿:异戊醇(25:24:1),涡旋振荡 10 秒,然后在室温下以 20,000 × g 离心 3 分钟。将上层(水相)11 mL 转移至新的 50 mL 离心管中。重复步骤 7.3,此时总样品体积为 13.5 mL。
  5. 加入 1.35 mL 3 M 乙酸钠(pH 5.2)和 33.75 mL 冰冷的 100% 乙醇,混匀后于 -80 °C 孵育 45 分钟,或 alternatively 在 -20 °C 过夜。
  6. 在 4 °C 下以 20,000 × g 离心 10 分钟,弃去上清液,将沉淀重悬于 1 mL 新配制的 70%(体积比)乙醇中,并转移至新离心管中。
  7. 在 4 °C 下使用台式离心机全速离心 3 分钟,然后弃去上清液。
  8. 将沉淀重悬于 1 mL 冰冷的 70%(体积比)乙醇中,并重复步骤 7.7。将沉淀在 37 °C 下干燥 10 分钟,然后重悬于 650 µL TLE 缓冲液中。使用基于荧光的检测方法测定双链 DNA 含量以确定 DNA 产量。
    注意:本实验流程可在该步骤暂停,将样品速冻后于 -80 °C 保存数月,或于 -20 °C 短期保存。

8. 质量控制

  1. 通过DNA电泳监测文库完整性和连接效果。取200 ng文库样品在0.8%琼脂糖/1x TBE凝胶上电泳,DNA应呈现大于10 kb的条带。
  2. 通过常规PCR检测已知的细胞类型不变的短程和远程相互作用。每个PCR反应使用100 ng模板DNA。根据上述说明(见3.7.1),设计靠近限制性酶切位点且朝向该位点的PCR引物。用于小鼠和人Hi-C文库质量控制的引物序列列于表1中。
  3. 填补和连接对照:切下对照8.2中含扩增产物的凝胶条带,从凝胶中回收DNA,并将该DNA作为模板,使用相同的引物组合进行4个独立的PCR反应。
    1. 使用PCR纯化试剂盒纯化扩增产物,并测定DNA浓度。
    2. 为每个扩增产物准备四个消化反应(HindIII [a]、NheI [b]、HindIII + NheI [c] 和无酶 [d]),终体积为15 µL:500 ng扩增产物、1.5 µL 10x限制性酶缓冲液2.1、0.15 µL 10 mg/mL牛血清白蛋白(100x BSA)以及0.1 µL(10单位)酶(HindIII [a]、NheI [b]、HindIII + NheI [c] 或水 [d])。
    3. 37 °C孵育1小时后,将消化反应产物在1.5%(wt/vol)琼脂糖/1x TBE凝胶上电泳。

9. DNA 片段化

  1. 将50.5 µg样品转移至新离心管中,并加入TLE缓冲液至终体积为655 µL。将样品均分为5份,每份130 µL(含10 µg文库),分别加入超声破碎管(见材料表)中。使用超声破碎仪(见材料表),在以下参数下将DNA剪切至约400 bp:占空比:10%;峰值入射功率(w):140;每脉冲循环数:200;时间:55 s。
  2. 将超声处理后的样品收集至一个新的2 mL离心管中。

10. 双侧 SPRI 磁珠片段筛选

  1. 通过倒置充分混匀 SPRI(固相可逆固定化)磁珠溶液,取 1.85 mL 磁珠溶液转移至新管中,并在室温下放置 15 分钟。
  2. 向样品中加入 350 µL 分子生物学级水(终体积为 1 mL)。
  3. 向样品中加入 600 µL SPRI 磁珠溶液(总体积为 1.6 mL;SPRI 溶液与 DNA 的比例为 0.6:1),在室温下孵育 5 分钟,然后在台式离心机中离心 2–3 秒以收集样品。
  4. 打开管盖,将样品置于磁力分离架上静置 5 分钟,小心转移上清液至新管中,弃去磁珠。
  5. 浓缩用于第二次片段大小选择的 SPRI 磁珠:将 930 µL SPRI 磁珠转移至新管中,置于磁力分离架上静置 5 分钟,弃去上清液,再用 310 µL SPRI 磁珠溶液重悬磁珠。
  6. 向样品中加入 300 µL 浓缩后的 SPRI 磁珠(步骤 10.5),混匀(总体积为 1.9 mL;此时 SPRI 溶液与 DNA 的比例为 0.9:1),在室温下孵育 5 分钟,然后在台式离心机中离心 2–3 秒。小心打开管盖,将管子置于磁力分离架上静置 5 分钟,弃去上清液。
  7. 向置于磁力分离架上的样品管中加入 1 mL 新配制的 70% 乙醇(体积比),孵育 30 秒后弃去上清液。重复此步骤两次。
  8. 在 37 °C 的恒温混匀仪中开盖干燥磁珠,时间不超过 5 分钟。向样品中加入 300 µL TLE 缓冲液,混匀后在室温下孵育 10 分钟。
  9. 在台式离心机中离心样品 2–3 秒,打开管盖后将管子置于磁力分离架上静置 5 分钟。将澄清的上清液转移至新管中,弃去磁珠。

11. 连接产物的生物素/链霉亲和素下拉实验

  1. 配制缓冲液:1× TB 缓冲液(5 mM Tris-HCl,pH 8.0;0.5 mM EDTA;1 M NaCl;0.05% Tween 20);2× NTB 缓冲液(10 mM Tris-HCl,pH 8.0;1 mM EDTA;2 M NaCl);1× NTB 缓冲液(5 mM Tris-HCl,pH 8.0;0.5 mM EDTA;1 M NaCl)。
  2. 将 200 µL 链霉亲和素偶联磁珠(见材料表)加入新离心管中,置于磁力分离架上静置 1 分钟,吸除上清液。
  3. 用 500 µL 1× TB 缓冲液洗涤磁珠两次。
    1. 在生物素下拉、末端修复、非连接 DNA 末端去生物素化、dATP 加尾以及接头连接等各步骤的每次洗涤过程中,均需将磁珠重悬于相应缓冲液中,在室温下以 15 rpm 转速旋转 3 分钟,随后在台式离心机中离心 2–3 秒,再将离心管置于磁力分离架上静置 3 分钟,吸除上清液。
  4. 将磁珠重悬于 300 µL 2× NTB 缓冲液中。混合磁珠与样品(总体积为 600 µL),在 3 rpm 转速的旋转仪上室温孵育 15 分钟。
  5. 将磁珠置于磁力分离架上回收 3 分钟,吸除澄清上清液。先用 500 µL 1× NTB 缓冲液洗涤磁珠两次,再用 200 µL 1× 连接缓冲液洗涤一次。最后将磁珠重悬于 50 µL 10× 连接缓冲液中。

12. 非连接DNA末端的末端修复及生物素去除

  1. 将样品(总共 50 µL)与 50 µL 的 2.5 mM dNTP 混合液(每种 10 mM dNTP 各 12.5 µL)、18.1 µL 的 3,000 U/mL T4 DNA 聚合酶、18.1 µL 的 10,000 U/mL T4 多核苷酸激酶(PNK)、3.7 µL 的 5,000 U/mL DNA 聚合酶 I 大片段(Klenow 片段)以及 360.1 µL 的 H2O 混合。
  2. 混匀后,在恒温混匀仪中于 20 °C 孵育 1 小时,每 2 分钟以 700 rpm 震荡 5 秒。
  3. 将磁珠置于磁力分离架上,吸除澄清上清液,并用 500 µL 的 1x TB 缓冲液洗涤磁珠两次。
  4. 用 500 µL 的 1x NTB 缓冲液洗涤磁珠,随后用 500 µL 的 1x TLE 缓冲液洗涤一次。
  5. 将磁珠置于磁力分离架上,吸除澄清上清液,然后将磁珠重悬于 415 µL 的 1x TLE 缓冲液中。

13. dATP加尾

  1. 将样品(415 µL)与50 µL 10x限制性酶缓冲液2、5 µL 10 mM dATP以及30 µL 5 U/µL的Klenow exo-minus混合。
  2. 混匀后置于37 °C孵育30分钟,每2分钟在恒温混匀仪中以700 rpm振荡5秒。
  3. 将磁珠置于磁力分离架上回收,弃去上清液,并用500 µL 1x TB缓冲液洗涤磁珠两次。
  4. 用500 µL 1x NTB缓冲液洗涤磁珠一次。

14. 接头连接

  1. 用 200 µL 1× 连接反应缓冲液(参见材料表)洗涤磁珠。
  2. 将磁珠重悬于 200 µL 1× 连接反应缓冲液中,加入 4 µL DNA 连接酶(参见材料表)和 16 µL 15 µM 预退火的 PE 接头(通过等体积混合 PE 接头 1 和 PE 接头 2(均为 30 µM)进行预退火,并在室温下孵育数分钟)。室温孵育 15 分钟。
  3. 将磁珠置于磁力分离架上回收,弃去上清液,并用 500 µL 1× TB 缓冲液洗涤磁珠两次。
  4. 用 500 µL 1× NTB 缓冲液洗涤磁珠,随后用 100 µL 1× 限制性酶切缓冲液 2 洗涤磁珠,再将磁珠重悬于 50 µL 1× 限制性酶切缓冲液 2 中,转移至新管中。

15. Hi-C 文库扩增

  1. 配制PCR主混合液:100 µL 5x Phusion缓冲液;6 µL 25 µM PE PCR引物1.0;6 µL 25 µM PE PCR引物2.0;14 µL dNTP混合液(每种10 mM);6 µL Phusion聚合酶;318 µL H2O。
  2. 将PCR主混合液与磁珠混合(总体积500 µL),分装为10份,每份50 µL,并按以下条件进行PCR扩增:
    98 °C下30秒
    7个循环:98 °C下10秒;65 °C下30秒;72 °C下30秒
    72 °C下7分钟
  3. 将PCR反应产物收集至新离心管中,在磁力架上回收磁珠,转移上清液(500 µL)至新离心管中。
  4. 使用SPRI磁珠纯化文库DNA。
    1. 混匀SPRI磁珠,取460 µL磁珠转移至新离心管中,室温平衡15分钟。向PCR反应产物中加入450 µL SPRI磁珠(终体积950 µL),室温孵育5分钟,然后在台式离心机中离心2–3秒以收集样品。
    2. 打开管盖,将样品置于磁力架上5分钟,移除上清液。
    3. 保持磁珠在磁力架上,向样品管中无磁珠区域加入1 mL 70%乙醇(体积比),静置30秒,弃去上清液。
    4. 重复步骤15.4.3两次。
    5. 在恒温混匀仪中37 °C干燥磁珠(管盖打开),时间不超过5分钟。
    6. 向样品中加入51 µL TLE缓冲液,混匀后于37 °C孵育10分钟,同时以950 rpm振荡。
    7. 在台式离心机中离心2–3秒,打开管盖,将离心管置于磁力架上5分钟。将澄清的上清液转移至新离心管中,弃去磁珠。
    8. 定量Hi-C文库的浓度。经过7轮PCR扩增后,通常可获得500–1,500 ng的Hi-C文库。

16. 溶液杂交捕获

注意:以下封闭剂和缓冲液(SHS1-4)溶液来自 SureSelect 试剂盒(参见材料表)。

  1. 将 500 ng 至 1 µg 的 Hi-C 文库转移至新离心管中,并使用真空浓缩仪(见材料表;45 °C;真空压力:30.0 档,斜坡 5)抽干样品。
  2. 通过加入 3.6 µL 分子生物学级 H2O、2.5 µL blocker 1、2.5 µL blocker 2 和 0.6 µL 定制 blocker,重新悬浮干燥的 Hi-C 文库。
  3. 将样品转移至新的 PCR 板条管的一个孔中,用 PCR 盖板条密封后置于冰上。标记为 "D"(代表 Hi-C DNA)。
  4. 配制杂交缓冲液:12.5 µL SHS1 缓冲液;0.5 µL SHS2 缓冲液;5 µL SHS3 缓冲液;6.5 µL SHS4 缓冲液。
  5. 在恒温混匀仪中 65 °C 孵育 5 分钟。转移至新的 PCR 板条管的一个孔中,用 PCR 盖板条密封后于室温保存。标记为 "H"(代表杂交缓冲液)。
  6. 在新的 PCR 板条管的一个孔中,混合 5 µL 浓度为 100 ng/µL 的生物素化 RNA 探针(储存于 -80 °C,使用前在冰上解冻);0.5 µL SRNase B(RNase 抑制剂)和 1.5 µL 分子生物学级 H2O。
  7. 用 PCR 盖板条密封 PCR 板条管,置于冰上。标记为 "R"(代表 RNA)。
  8. 设置 PCR 仪参数如下:
    95 °C 孵育 5 分钟;65 °C 孵育 25 小时;加热盖开启;PCR 反应体积为 29 µL。
    注意:PCR 仪运行期间的所有操作应尽快完成,以避免样品蒸发。
  9. 将标记为 "D" 的 PCR 板条管放入 PCR 仪中,关闭热盖并启动 PCR 反应。当 PCR 程序达到 65 °C 时,打开热盖,将标记为 "H" 的 PCR 板条管放入 PCR 仪中,关闭热盖并孵育 3 分钟。再次打开热盖,将标记为 "R" 的 PCR 板条管放入 PCR 仪中,关闭热盖。
  10. 2 分钟后,打开 PCR 仪热盖及所有 PCR 板条管盖。将 "H" 孔中的 13 µL 转移至 "R" 孔中,然后将 "D" 孔中的全部体积转移至 "R" 孔中。用移液器吹打混匀 3 次,密封 PCR 板条管,移除 "H" 和 "D" PCR 板条管,关闭 PCR 仪热盖。在 65 °C 下孵育反应 24 小时。

17. 含启动子片段连接产物的分离

注意:建议使用 SureSelect 接头试剂盒和文库(参见材料表)进行以下步骤。

  1. 提前将每份样品 1.5 mL 洗涤缓冲液 2 在 65 °C 预热。
  2. 将 60 µL 链霉亲和素偶联磁珠(参见 材料表)加入新离心管中,置于磁力分离架上 1 分钟,弃上清液。
  3. 用 200 µL 1× 结合缓冲液洗涤磁珠三次。
    注意:在捕获后分离含启动子的连接产物过程中,每次洗涤步骤均需将磁珠重悬于相应缓冲液中,在室温下以 15 rpm 在旋转仪上旋转 3 分钟,短暂离心(台式离心机)2–3 秒以收集样品,置于磁力分离架上 3 分钟,然后弃去上清液。
  4. 将磁珠重悬于 200 µL 1× 结合缓冲液中。打开 PCR 仪和 PCR 管条(PCR 程序仍在运行时),将杂交反应液转移至含有磁珠的离心管中。在旋转仪上以 3 rpm 于室温孵育 30 分钟。
  5. 将磁珠置于磁力分离架上回收,弃去澄清上清液。将磁珠重悬于 500 µL 洗涤缓冲液 1 中,混匀,并在恒温混匀仪中以 950 rpm 振荡,于 20 °C 孵育 15 分钟。
  6. 将磁珠置于磁力分离架上静置 3 分钟,回收磁珠并弃去澄清上清液。将磁珠重悬于 500 µL 洗涤缓冲液 2 中,混匀,并在恒温混匀仪中以 950 rpm 振荡,于 65 °C 孵育 10 分钟。重复步骤 17.5 两次。
  7. 将磁珠置于磁力分离架上回收,弃去上清液,将磁珠重悬于 200 µL 1× 限制性酶切缓冲液 2 中。再次将磁珠置于磁力分离架上回收,弃去上清液,将磁珠重悬于 30 µL 1× 限制性酶切缓冲液 2 中。

18. PCHi-C 文库扩增

  1. 配制PCR主混合液:60 µL 5x PCR缓冲液(Phusion缓冲液),3.6 µL 25 µM PE PCR引物1.0,3.6 µL 25 µM PE PCR引物2.0,8.4 µL dNTP混合液(每种10 mM),3.6 µL Phusion DNA聚合酶,以及190.8 µL H2O。
  2. 将PCR主混合液与磁珠混合(总体积300 µL),均分为6份,每份50 µL,并按照以下条件进行PCR扩增:
    98 °C下30秒
    4个循环:98 °C下10秒,65 °C下30秒,72 °C下30秒
    72 °C下7分钟
  3. 将所有PCR反应产物收集至新离心管中,将磁珠置于磁力架上回收,转移上清液(300 µL;含有PCHi-C文库)至新离心管中。
  4. 使用SPRI磁珠纯化PCHi-C文库,操作步骤同上文15.4节所述。
  5. 定量测定PCHi-C文库的浓度。

结果

启动子捕获 Hi-C 已被用于富集小鼠7,34,36,39 和人类33,35,37,38 用于启动子相互作用的Hi-C文库。Sandberg课题组已描述过一种类似方案(名为HiCap)。40. 图1A 展示了启动子捕获Hi-C(Promoter Capture Hi-C)的示意图工作流程。在本方案中,Hi-C文库通过细胞核内连接(in-nucleus ligation)方法构建41,从而显著减少非特异性连接产物的数量42对于PCHi-C,使用分别针对小鼠或人类启动子区域的复杂Hi-C文库进行溶液内杂交和捕获。具体而言,采用39,021条生物素标记的RNA探针靶向22,225个包含小鼠启动子的HindIII限制性片段,或采用37,608条生物素标记的RNA探针靶向22,076个包含人类启动子的HindIII限制性片段。每条生物素标记的RNA探针可靶向启动子所在限制性片段的一端或两端。图1B)。我们发现,同时捕获两端可改善各个启动子的覆盖度(图1C;原始序列读长)几乎增加了一倍,符合预期。因此,只要可能(即, 在非重复区域,建议使用与待捕获限制性片段两端互补的生物素标记RNA。

为在文库构建早期阶段评估 PCHi-C 文库质量,我们在 DNA 连接与纯化后进行两项对照,方法如前所述31第一种方法是使用特异性引物对扩增连接产物,如 3C 所用27我们使用引物对(表1)以扩增细胞类型不变的长距离连接产物,例如两者之间的 Myc 基因及其位于约 2 Mb 远处的已知增强子(图 2A或基因之间的 组蛋白1 位点(相距1.5 Mb)之间,以及位于线性位置邻近的两个区域之间(“短程调控”)。

第二次质量控制用于测定在Klenow酶介导下,利用生物素标记的dATP填补限制性酶切位点突出末端时生物素掺入的效率。成功的Klenow填补反应及随后的平末端连接会导致连接产物中DNA分子之间的原始限制性酶切位点消失,以HindIII为例,会形成一个新的NheI识别位点(图2B)。HindIII与NheI消化连接产物的比例可直接反映生物素掺入的效率。质量较差的Hi-C文库会表现出较高水平的HindIII消化,而高质量文库的连接产物则几乎完全被NheI消化(图2B)。

Hi-C文库构建后(即, 在对经大小选择的Hi-C连接产物进行生物素-链霉亲和素下拉、接头连接和捕获前PCR后,通过Bioanalyzer评估Hi-C文库的完整性和片段大小分布图2C)。相同的对照在PCHi-C文库构建结束时进行(即, 在杂交捕获含有启动子的连接产物及捕获后PCR完成后,对Hi-C与PCHi-C的Bioanalyzer图谱进行比较。结果显示,与预期一致,Hi-C文库的浓度显著高于相应的PCHi-C文库,但两者文库的片段大小分布高度相似,表明PCHi-C中的捕获步骤未引入片段大小偏好性。图2C, D).

双端测序完成后,使用 HiCUP 流程对 PCHi-C 读段进行比对、质量控制和过滤43高质量的 PCHi-C 文库包含 70–90% 的“有效配对”即, 线性基因组图谱上非相邻的两个限制性片段之间的成对末端测序读段; 图 3A, B)。采用细胞核内连接反应方案41,42,百分比 转 成对读段(即, 位于不同染色体上的两个限制性片段之间的成对末端序列读长(即染色体间有效配对)通常比例较低,介于5%至25%之间,这反映了染色体疆域的存在,也表明文库质量良好。对Hi-C文库与其相应的PCHi-C文库之间“有效配对”比例进行直接比较35,表明在所有情况下,PCHi-C文库中有效配对的比例均高于图3B伴随PCHi-C中非有效“相同片段内”reads百分比的降低(图3C)。这是预料之中的,因为捕获步骤不仅富集含有启动子的连接产物,还会富集限制性片段末端,这是由于捕获寡核苷酸在限制性片段上的位置所致(参见 图1B).

HiCUP 过滤后,我们确定捕获效率。PCHi-C 文库在 HiCUP 过滤后包含三种类型的有效序列读段:
1.) 启动子:基因组读段(即, 基因组中任意位置的非启动子 HindIII 限制性片段与捕获的启动子片段之间的测序读段
2.) 启动子:启动子区读段(位于两个捕获的启动子片段之间的读段)
3.) 基因组:基因组读段(捕获的启动子中,连接产物的两端均未比对到任何捕获启动子的背景Hi-C连接产物)。此类读段在下游分析前予以剔除。

高质量的 PCHi-C 文库的捕获效率(上述第 1 类和第 2 类之和)介于 65–90% 之间(图 3D)。与 Hi-C 文库的直接比较表明,PCHi-C 在含有启动子的连接产物上实现了约 15 倍的富集(图 3D),在某些情况下可达 17 倍。这一数值接近 PCHi-C 的理论最大富集倍数(19.6 倍),该理论值取决于捕获系统所覆盖的基因组限制性片段的比例。通过设计靶向更少限制性片段的捕获系统,可实现更高的富集倍数44,45,46。

启动子相互作用组的分析表明其具有细胞类型和谱系特异性33,34,35,并在细胞分化过程中表现出显著变化37,38,39。图 4 和图 5 展示了特定启动子在谱系特异性和分化动态方面的示例。例如,ALAD 在所有细胞中均组成型表达,但在成红细胞中其表达上调47。ALAD 启动子在所有造血细胞中均与多个远端片段发生接触,并在成红细胞中特异性地形成额外的相互作用(图 4)。IL-8 在B细胞中无统计学显著的相互作用,在T细胞中相互作用极少,但在髓系细胞中存在数十个相互作用,包括在单核细胞、中性粒细胞和巨核细胞中的细胞类型特异性相互作用(图 5)。这些示例展示了如何利用PCHi-C技术解析细胞类型特异的相互作用组,并鉴定具有调控潜力的启动子互作区域。

染色体构象捕获示意图;过程包括交联、限制性消化、连接。
图1:启动子捕获Hi-C原理及捕获探针设计。 (A) PCHi-C的示意图工作流程。在细胞核内连接的Hi-C方法41,42(I)之后,进行溶液中杂交,使用生物素标记的RNA探针(II)靶向所有人类(图中所示)或小鼠基因启动子的限制性酶切片段(III)。(B) PCHi-C的探针设计。针对含有启动子的限制性酶切片段末端设计生物素标记的RNA捕获探针(红色曲线),这些片段以灰色表示(注意:仅当启动子序列本身(红色)位于限制性酶切片段末端时,才会被RNA捕获探针靶向)。如图A所示,通过RNA探针与DNA靶标的序列互补杂交,随后进行生物素-链霉亲和素富集,分离出由含启动子的限制性酶切片段(灰色)及其相互作用的限制性酶切片段(黄色和绿色)组成的连接产物。(C) 比较使用一个RNA探针与两个RNA探针靶向含启动子的限制性酶切片段时PCHi-C的捕获效率(见B图示意图)。请点击此处查看该图的放大版本。

基因编辑工作流程与分析;DNA 填补法、凝胶电泳、Bioanalyzer 谱图。
图 2:PCHi-C 测序前质量控制。 (A) 左图,启动子与 PIR 在空间上的邻近关系示意图,导致形成 Hi-C 连接产物,该产物由包含启动子的限制性片段(灰色;启动子序列以红色表示)和 PIR 限制性片段(黄色)组成。右图,通过特异性引物对(如左图示意图所示)扩增 Hi-C 连接产物的 DNA 凝胶电泳结果示例。 (B) 左图,Hi-C 连接产物(即 A 中所示 PCR 产物)经 HindIII、NheI 及 HindIII/NheI 限制性酶切的代表性结果。右图,Hi-C 连接后 DNA 序列的示意图,显示限制性连接处经 Klenow 酶 dNTP 填补连接不成功(上)或成功(下)后的序列结构。 (C) 代表性 Hi-C 文库 Bioanalyzer 谱图(稀释 1/5)。 (D) 代表性 PCHi-C 文库 Bioanalyzer 谱图(未稀释)。 请点击此处查看该图的放大版本。

基因测序数据分析中PCHi-C与Hi-C相互作用的柱状图和饼图比较。
图3:PCHi-C测序后质量控制。(A)PCHi-C与相应Hi-C文库在经过HiCUP43处理后有效序列读段对百分比的比较(数据来自Javierre et al., 201635)。(B)典型的HiCUP PCHi-C结果,显示有效读段对以及其他在下游分析前被剔除的序列类别(数据来自Javierre et al., 201635)。(C)PCHi-C与相应Hi-C文库在经过HiCUP处理后“同一片段内部”读段百分比的比较(数据来自Javierre et al., 201635)。(D)PCHi-C与相应Hi-C文库中涉及捕获启动子片段的序列读段百分比(捕获效率)比较(数据来自Javierre et al., 201635)。请点击此处查看该图的放大版本。

染色体相互作用图;基因定位;细胞类型分析;基因组结构特征。
图 4:ALAD 基因在人类造血细胞中的 PCHi-C 谱图。 髓系细胞类型的启动子相互作用以蓝色拱形表示,淋巴系细胞类型的启动子相互作用以紫色拱形表示。红细胞前体细胞特异性的相互作用由红色箭头标示(数据来自 Javierre 等,201635)。请点击此处查看此图的放大版本。

基因组表达示意图,免疫细胞中基因调控图谱,细胞类型分化分析。
图5: IL8 在人类造血细胞中的PCHi-C图谱。 髓系细胞类型的启动子相互作用以蓝色弧线表示,淋系细胞类型的启动子相互作用以紫色弧线表示。单核细胞特异性相互作用由绿色箭头指示,中性粒细胞特异性相互作用由红色箭头指示,巨核细胞特异性相互作用由棕色箭头指示(数据来自Javierre et al., 201635)。请点击此处查看该图的放大版本。

人
名称序列染色体链起始位置 GRCh38/hg38终止位置 GRCh38/hg38用于检测 3C 相互作用和生物素掺入的引物组合
hs AHF64 DekkerGCATGCATTAGCCTCTGCTGTTCTCTGAAATC11+116803960116803991需与 hs AHF66 Dekker 联用
hs AHF66 DekkerCTGTCCAAGTACATTCCTGTTCACAAACCC11+116810219116810248需与 hs AHF64 Dekker 联用
hs MYC 位点GGAGAACCGGTAATGGCAAA8-127733814127733833需与 hs MYC +1820 或 hs MYC -538 联用
hs MYC +1820AAAATGCCCATTTCCTTCTCC8+129554527129554547需与 hs MYC 位点联用
hs MYC -538TGCCTGATGGATAGTGCTTTC8-127195696127195716需与 hs MYC 位点联用
hs HIST1 FAAGCAGGAAAAGGCATAGCA6+2620717426207193需与 hs HIST1 R 联用
hs HIST1 RTCTTGGGTTGTGGGACTTTC6+2777157527771594需与 hs HIST1 F 联用
小鼠
序列染色体链起始位置 GRCm38/mm10终止位置 GRCm38/mm10用于检测 3C 相互作用和生物素掺入的引物组合
TCATGAGTTCCCCACATCTTTG8+8484109084841111需与 mm Calr2 联用
CTGTGGGCACCAGATGTGTAAAT8+8484851984848541需与 mm Calr1 联用
TATCAAGGGTGCCCGTCACCTTCAGC6+125163098125163123需与 Gapdh4 Dekker 联用
GGGCTTTTATAGCACGGTTATAAAGT6+125163774125163799需与 Gapdh3 Dekker 联用
GGAGGAGGGAAAAGGAGTGATT6+5221282952212850需与 mm Hoxa13 联用
CAGGCATTATTTGCTGAGAACG6-5225349052253511需与 mm Hoxa7 联用
GGGTAATGGTGTCACTAACTGG13+2357128423571305需与 mm Hist1h3e 或 mm Hist1h4i 联用
GGGTTTGATGAGTTGGTGAAG13+2356654123566561需与 mm Hist1h2ae 联用
TTGGGCCAAAGCCTATATGA13+2204308522043104需与 mm Hist1h2ae 联用

表1:人和小鼠Hi-C文库质量控制的引物序列。

讨论

启动子捕获 Hi-C 的模块化设计

启动子捕获 Hi-C 旨在特异性富集涉及启动子的 Hi-C 文库中的相互作用。这些相互作用仅占 Hi-C 文库中存在连接产物的一个子集。

通过改变捕获系统,染色体构象捕获技术(Capture Hi-C)可轻松地对任何感兴趣的基因组区域或多个区域进行富集。捕获区域可以是连续的基因组片段44,45,46,48、在PCHi-C中已鉴定出的增强子(“反向捕获Hi-C”35),或DNase I超敏感位点49。捕获系统的规模可根据实验范围进行调整。例如,Dryden et al. 针对与乳腺癌相关的三个基因沙漠中的519个诱饵片段进行捕获44。Martin et al. 的捕获系统则同时靶向连续的基因组片段(“区域捕获”:共211个基因组区域,包含2,131个限制性酶切片段)和选定的启动子(3,857个基因启动子)45。

SureSelect文库提供多种不同的大小范围:1 kb至499 kb(5,190–4,806)、500 kb至2.9 Mb(5,190–4,816)以及3 Mb至5.9 Mb(5,190–4,831)。由于每条捕获用的生物素化RNA长度为120个核苷酸,这些捕获系统分别最多可容纳4,158、24,166和49,166条独立的捕获探针。这分别对应2,079、12,083和24,583个靶向的限制性酶切片段(注意:限制性酶切片段的数量是基于每个限制性酶切片段可设计两条独立捕获探针的假设得出的下限值——实际上,由于重复序列的存在,并非每个限制性酶切片段都能设计出两条探针(另见图1B、C),因此在捕获探针数量固定的情况下,实际可靶向的限制性酶切片段数量会更高)。

本文所述方案基于使用识别位点为6 bp的限制性内切酶来揭示远距离相互作用。使用识别位点为4 bp的限制性内切酶以获得更高分辨率的邻近相互作用也是可行的40,49。

PCHi-C 的局限性

所有染色体构象捕获检测方法的一个固有局限性在于,其分辨率取决于文库构建过程中所使用的限制性内切酶。位于同一限制性片段上的DNA元件之间的相互作用在“C型”检测中是不可见的。此外,在PCHi-C中,某些情况下同一个包含启动子的限制性片段上可能含有多个转录起始位点,且某些PIR区域同时带有激活和抑制性的组蛋白修饰标记,这使得难以确定是哪些调控元件介导了这些相互作用,也难以预测启动子相互作用的调控结果。使用识别位点为4 bp的限制性内切酶可在一定程度上缓解这一问题,但代价是显著增加Hi-C文库的复杂性(使用识别位点为4 bp的限制性内切酶构建的Hi-C文库,其复杂性至少是使用识别位点为6 bp的限制性内切酶构建的Hi-C文库的100倍),并相应提高下一代测序的成本。

另一个局限性在于,目前的PCHi-C方案需要以数百万个细胞作为起始材料,从而无法对稀有细胞类型中的启动子相互作用进行分析。因此,若能对PCHi-C进行改进,使其可用于10,000至100,000个细胞的细胞群体(例如早期胚胎发育过程中的细胞或造血干细胞)来检测启动子互作,则将是对Capture Hi-C技术工具箱的一项重要补充。

最后,与所有依赖甲醛固定的实验方法一样,PCHi-C 仅能记录在固定时间点被“冻结”的相互作用。因此,要研究启动子相互作用的动力学和动态变化,还需结合超分辨率活细胞显微镜等技术与 PCHi-C 一同使用。

高分辨率解析空间染色体结构的方法

染色体相互作用文库的高度复杂性使得在统计学上可靠地鉴定两个特定限制性片段之间的相互作用产物变得极为困难。为解决这一问题,已采用序列捕获技术来富集特定的相互作用,包括Hi-C33,34,40,44或3C50,51文库。在富集步骤中,使用Hi-C文库相较于3C文库的主要优势在于,Hi-C在实验流程中包含对真实连接产物的富集步骤,而3C则不具备这一特性。因此,PCHi-C文库中有效读段的比例比Capture-C文库高出约10倍;后者在经过HiCUP过滤后仅包含约5–8%的有效读段50。Sahlen et al. 直接比较了Capture-C与HiCap,其中HiCap与PCHi-C类似,均使用Hi-C文库进行捕获富集,而Capture-C则使用3C文库。与我们的研究结果一致,他们发现Capture-C文库主要由未连接的片段组成40。此外,HiCap文库的复杂性也高于Capture-C文库40。

一种Capture-C的变体,称为下一代Capture-C52(NG Capture-C),与原始Capture-C方案50中使用的重叠探针不同,其采用每个限制性酶切片段末端对应一条寡核苷酸探针的设计,该策略此前已在PCHi-C33,34中建立。这种方法相较于传统的Capture-C仅适度提高了有效读段的比例,但NG Capture-C采用了两轮连续的捕获富集步骤,并进行了相对较多的PCR循环(总共20至24个循环,而PCHi-C通常为11个循环),这不可避免地导致序列重复数增加以及文库复杂度降低。在PCHi-C优化过程中的试验实验中,我们发现当使用19个PCR循环(捕获前13个循环 + 捕获后6个循环;数据未显示)时,唯一(即非重复)读段对的比例仅约为15%;然而,通过优化减少PCR循环次数,通常可获得75–90%的唯一读段对。因此,降低PCR循环次数可显著增加信息性序列数据的产量。

一种近期方法将染色质免疫沉淀(ChIP)与Hi-C技术相结合,以聚焦于由特定目标蛋白介导的染色体相互作用(HiChIP)53)。与 ChIA-PET 相比54,其原理类似,HiChIP 数据包含更多的有效序列读段,从而能够更可靠地识别相互作用53一旦相应的HiChIP和Capture Hi-C数据集可获取时(例如使用针对黏连蛋白亚基Smc1a的抗体进行的HiChIP),直接比较这些数据集将非常有意义。53 使用Capture Hi-C对所有Smc1a结合的限制性片段进行检测,并与之并列比较。这两种方法的一个内在差异在于,Capture Hi-C不依赖染色质免疫沉淀,因此能够检测染色体相互作用,而无需考虑蛋白质占据情况。这使得可以在特定因子结合存在或缺失的情况下比较三维基因组结构,正如先前研究所示,该方法已被用于鉴定PRC1是小鼠ESC空间基因组结构的关键调控因子。7.

PCHi-C 与 GWAS

全基因组关联研究(GWAS)表明,超过95%的疾病相关序列变异位于基因组的非编码区,且通常距离蛋白质编码基因较远55。GWAS发现的变异位点常位于DNase I超敏感位点附近,而后者是具有潜在调控活性序列的特征标志。PCHi-C和Capture Hi-C已被广泛用于将启动子与乳腺癌44、结直肠癌48以及自身免疫性疾病35,45,46相关的GWAS风险位点进行连接。一项针对17种不同人类造血细胞类型的PCHi-C研究发现,与自身免疫性疾病相关的单核苷酸多态性(SNPs)在淋巴样细胞的启动子互作区域(PIRs)中富集,而与血小板和红细胞特异性性状相关的序列变异则主要分别出现在巨噬细胞和成红细胞中35,56。因此,通过PCHi-C揭示的组织类型特异性启动子互作组,有助于理解非编码区疾病相关序列变异的功能,并识别可用于治疗干预的新潜在致病基因。

启动子相互作用区域的特征

多项证据表明启动子互作组与基因表达调控相关。首先,多项PCHi-C研究显示,与(高)表达基因的启动子发生互作的基因组区域富集了与增强子活性相关的标记,例如H3K27乙酰化和p300结合33,34,37。我们发现基因表达水平与互作增强子的数量呈正相关,提示增强子的累加效应可导致基因表达水平升高34,35。其次,自然发生的表达数量性状位点(eQTLs)在与受其影响基因相连接的启动子互作区域(PIRs)中显著富集35。第三,通过整合TRIP57与PCHi-C数据,Cairns et al. 发现,在小鼠胚胎干细胞(ESCs)中,定位至PIRs的TRIP报告基因比整合到非启动子互作区域的报告基因表现出更强的表达活性58,表明PIRs具有转录调控功能。综上所述,这些发现提示,通过PCHi-C在多种小鼠和人类细胞类型中揭示的启动子互作组包含了基因表达调控的关键调控模块。

值得注意的是,在PCHi-C技术所发现的所有成对相互作用区域(PIR)中,增强子仅占一小部分(约20%)33,34。其他PIR可能具有结构或拓扑学功能,而非直接的转录调控作用。然而,也有证据表明,PCHi-C可能识别出不携带经典增强子标记但具有调控功能的DNA元件。在一种人类淋巴样细胞系中,BRD7 启动子被发现与一个缺乏增强子标记的区域发生相互作用,而该区域在报告基因实验中表现出增强子活性33。具有类似特征的调控元件可能比目前所认识到的更为丰富。例如,一项基于CRISPR的调控DNA元件筛选研究鉴定出一类无标记调控元件(UREs),这类元件能够调控基因表达,但并不具备增强子标记59。

在其他情况下,PIR被发现带有与转录抑制相关的染色质标记。在小鼠胚胎干细胞中,与PRC1结合的PIR及其相互作用的启动子参与了一个广泛的空间网络,该网络包含带有抑制性标记H3K27me3的被抑制基因7。在人类淋巴母细胞系中,一个与BCL6启动子相互作用的远端元件抑制了转基因报告基因的表达33,提示该元件在其天然环境中可能具有抑制BCL6转录的功能。

在人类ESC和NEC中,富含染色质绝缘蛋白CTCF占据的PIR37可能代表另一类PIR。总体而言,这些结果表明,PIR包含一系列尚未在功能上被表征的基因调控活性。

披露

作者无任何利益冲突需要披露。

致谢

感谢 Valeriya Malysheva 对本文手稿的审阅以及对图1提供的专业帮助。本工作得到英国医学研究理事会(MR/L007150/1)和英国生物技术和生物科学研究所(BB/J004480/1)的支持。

材料

本文使用的材料清单
姓名公司目录编号评论
16% (体积/体积) 多聚甲醛溶液Agar ScientificR1026
杜尔贝科改良伊格尔培养基 (DMEM) 1xLife Technologies41965-039
胎牛血清 (FBS),无菌过滤Sigma F9665
低吸附滤芯吸头 StarlabS1180-3810, S1180-1810, S1180-8810 和 S1182-1830
10x PBS,pH 7.4Life Technologies70011-036
分子生物学级水Sigma-AldrichW4502
1 M Tris-HCl,pH 8.0Life Technologies15568-025
IGEPAL CA-630 Sigma-AldrichI8896
5 M NaCl Life Technologies24740-011
蛋白酶抑制剂混合物(不含EDTA) Roche Diagnostics11873580001
限制性酶切缓冲液2 (10x NEBuffer 2)New England BiolabsB7002
DNA LoBind 管,1.5 mL Eppendorf0030 108.051
DNA LoBind 管,2 mLEppendorf30108078
20% (质量/体积) SDS  Bio-Rad Laboratories161-0418
20% (体积/体积) Triton X-100 Sigma-AldrichT8787
HindIII,100 U/μLNew England BiolabsR0104
10 mM dCTP Life Technologies18253-013
10 mM dGTPLife Technologies18254-011
10 mM dTTP Life Technologies18255-018
0.4 mM Biotin-14-dATPLife Technologies19524-016
DNA聚合酶I大片段(Klenow片段),5000 单位/mLNew England BiolabsM0210
10x T4 DNA连接酶反应缓冲液 New England BiolabsB0202
100x 10 mg/mL 牛血清白蛋白 New England BiolabsB9001
T4 DNA连接酶,1 U/μLμL Invitrogen15224-025
核糖核酸酶A Roche10109142001
蛋白酶K,重组型,PCR级 Roche3115836001
20 000×g 50 mL 离心管VWR525-0156
0.5 M EDTA,pH 8.0 Life Technologies15575-020
苯酚,pH 8.0 SigmaP4557
苯酚:氯仿:异戊醇 25:24:1 SigmaP3803
乙酸钠,pH 5.2 SigmaS7899
Quant-iT PicoGreen InvitrogenP7589
QIAquick 凝胶回收试剂盒Qiagen28704
QIAquick PCR 纯化试剂盒Qiagen28104
限制性酶切缓冲液2.1 (10x NEBuffer 2.1)New England BiolabsB7202
NheI,100 U/μLNew England BiolabsR0131
Micro TUBE AFA 纤维预切带卡扣盖 6x16 mm 管 Covaris520045用于超声处理
SPRI 磁珠(Agencourt AMPure XP) Beckman CoulterA63881
Dynabeads MyOne 链霉亲和素C1磁珠 Invitrogen65001
Tween 20 SigmaP9416
10 mM dATP Life Technologies18252-015
T4 DNA聚合酶,3000 单位/mLNew England BiolabsM0203
T4 多核苷酸激酶(PNK),10000 单位/mLNew England BiolabsM0201
Klenow exo minus,5000 单位/mL New England BiolabsM0212
快速连接反应缓冲液 New England BiolabsB6058
NEB DNA 快速连接酶 New England BiolabsM2200
PE接头1.0 (5'-P-GATCGGAAGAGCGGTTCAGC
AGGAATGCCGAG-3')
Illumina
PE接头2.0 (5'-ACACTCTTTCCCTACACGACGCT
CTTCCGATCT-3')
Illumina
NEB Phusion PCR 试剂盒 New England BiolabsM0530
PE PCR 引物1.0 (5'-AATGATACGGCGACCACCGA
GATCTACACTCTTTCCCTAC
ACGACGCTCTTCCGATCT-3')
Illumina
PE PCR 引物2.0 (5'-CAAGCAGAAGACGGCATACGA
GATCGGTCTCGGCATTCCT
GCTGAACCGCTCTTCCGATCT-3') 
Illumina
PCR 排管 Agilent Technologies410022 和 401425
SureSelect SSEL TE 试剂 ILM PE 全接头试剂盒 Agilent Technologies931108
SureSelect 定制 3-5.9 Mb 文库 Agilent Technologies5190-4831定制设计的小鼠或人类PCHi-C系统
Dynabeads MyOne 链霉亲和素T1磁珠 Invitrogen65601
E220  高性能聚焦超声破碎仪CorvarisE220

参考文献

  1. Osborne, C. S., et al. Active genes dynamically colocalize to shared sites of ongoing transcription. Nature Genetics. 36, 1065-1071 (2004).
  2. Schoenfelder, S., et al. Preferential associations between co-regulated genes reveal a transcriptional interactome in erythroid cells. Nature Genetics. 42, 53-61 (2010).
  3. de Wit, E., et al. The pluripotent genome in three dimensions is shaped around pluripotency factors. Nature. 501, 227-231 (2013).
  4. Bantignies, F., et al. Polycomb-dependent regulatory contacts between distant Hox loci in Drosophila. Cell. 144, 214-226 (2011).
  5. Engreitz, J. M., et al. The Xist lncRNA exploits three-dimensional genome architecture to spread across the X chromosome. Science. 341, 1237973(2013).
  6. Denholtz, M., et al. Long-range chromatin contacts in embryonic stem cells reveal a role for pluripotency factors and polycomb proteins in genome organization. Cell Stem Cell. 13, 602-616 (2013).
  7. Schoenfelder, S., et al. Polycomb repressive complex PRC1 spatially constrains the mouse embryonic stem cell genome. Nature Genetics. 47, 1179-1186 (2015).
  8. Kundu, S., et al. Polycomb Repressive Complex 1 generates discrete compacted domains that change during differentiation. Molecular Cell. 65, 432-446 (2017).
  9. Skok, J. A., Gisler, R., Novatchkova, M., Farmer, D., de Laat, W., Busslinger, M. Reversible contraction by looping of the Tcra and Tcrb loci in rearranging thymocytes. Nature Immunology. 8, 378-387 (2007).
  10. Zhang, Y., et al. Spatial organization of the mouse genome and its role in recurrent chromosomal translocations. Cell. 148, 908-921 (2012).
  11. Aymard, F., et al. Genome-wide mapping of long-range contacts unveils clustering of DNA double-strand breaks at damaged active genes. Nature Structural & Molecular Biology. 24, 353-361 (2017).
  12. Ryba, T., et al. Evolutionarily conserved replication timing profiles predict long-range chromatin interactions and distinguish closely related cell types. Genome Research. 20, 761-770 (2010).
  13. Pope, B. D., et al. Topologically associating domains are stable units of replication-timing regulation. Nature. 515, 402-405 (2014).
  14. Chandra, T., et al. Global reorganization of the nuclear landscape in senescent cells. Cell Reports. 10, 471-483 (2015).
  15. Carter, D., Chakalova, L., Osborne, C. S., Dai, Y. F., Fraser, P. Long-range chromatin regulatory interactions in vivo. Nature Genetics. 32, 623-626 (2002).
  16. Tolhuis, B., Palstra, R. J., Splinter, E., Grosveld, F., de Laat, W. Looping and interaction between hypersensitive sites in the active beta-globin locus. Molecular Cell. 10, 1453-1465 (2002).
  17. Amano, T., Sagai, T., Tanabe, H., Mizushina, Y., Nakazawa, H., Shiroishi, T. Chromosomal dynamics at the Shh locus: limb bud-specific differential regulation of competence and active transcription. Developmental Cell. 16, 47-57 (2009).
  18. Zuniga, A., et al. Mouse limb deformity mutations disrupt a global control region within the large regulatory landscape required for Gremlin expression. Genes & Development. 18, 1553-1564 (2004).
  19. Sagai, T., Hosoya, M., Mizushina, Y., Tamura, M., Shiroishi, T. Elimination of a long-range cis-regulatory module causes complete loss of limb-specific Shh expression and truncation of the mouse limb. Development. 132, 797-803 (2005).
  20. D'Haene, B., et al. Disease-causing 7.4 kb cis-regulatory deletion disrupting conserved non-coding sequences and their interaction with the FOXL2 promotor: implications for mutation screening. PLoS Genet. 5, e1000522(2009).
  21. Sur, I. K., et al. Mice lacking a Myc enhancer that includes human SNP rs6983267 are resistant to intestinal tumors. Science. 338, 1360-1363 (2012).
  22. Herranz, D., et al. A NOTCH1-driven MYC enhancer promotes T cell development, transformation and acute lymphoblastic leukemia. Nature Medicine. 20, 1130-1137 (2014).
  23. Deng, W., et al. Controlling long-range genomic interactions at a native locus by targeted tethering of a looping factor. Cell. 149, 1233-1244 (2012).
  24. Groschel, S., et al. A single oncogenic enhancer rearrangement causes concomitant EVI1 and GATA2 deregulation in leukemia. Cell. 157, 369-381 (2014).
  25. Lupianez, D. G., et al. Disruptions of topological chromatin domains cause pathogenic rewiring of gene-enhancer interactions. Cell. 161, 1012-1025 (2015).
  26. Franke, M., et al. Formation of new chromatin domains determines pathogenicity of genomic duplications. Nature. 538, 265-269 (2016).
  27. Dekker, J., Rippe, K., Dekker, M., Kleckner, N. Capturing chromosome conformation. Science. 295, 1306-1311 (2002).
  28. Simonis, M., et al. Nuclear organization of active and inactive chromatin domains uncovered by chromosome conformation capture-on-chip (4C). Nature Genetics. 38, 1348-1354 (2006).
  29. Zhao, Z., et al. Circular chromosome conformation capture (4C) uncovers extensive networks of epigenetically regulated intra- and interchromosomal interactions. Nature Genetics. 38, 1341-1347 (2006).
  30. Dostie, J., et al. Chromosome Conformation Capture Carbon Copy (5C): A massively parallel solution for mapping interactions between genomic elements. Genome Research. 16, 1299-1309 (2006).
  31. Lieberman-Aiden, E., et al. Comprehensive mapping of long-range interactions reveals folding principles of the human genome. Science. 326, 289-293 (2009).
  32. Belton, J. M., McCord, R. P., Gibcus, J. H., Naumova, N., Zhan, Y., Dekker, J. Hi-C: a comprehensive technique to capture the conformation of genomes. Methods. 58, 268-276 (2012).
  33. Mifsud, B., et al. Mapping long-range promoter contacts in human cells with high-resolution capture Hi-C. Nature Genetics. 47, 598-606 (2015).
  34. Schoenfelder, S., et al. The pluripotent regulatory circuitry connecting promoters to their long-range interacting elements. Genome Res. 25, 582-597 (2015).
  35. Javierre, B. M., et al. Lineage-specific genome architecture links enhancers and non-coding disease variants to target gene promoters. Cell. 167, 1369-1384 (2016).
  36. Wilson, N. K., et al. Integrated genome-scale analysis of the transcriptional regulatory landscape in a blood stem/progenitor cell model. Blood. 127, e12-e23 (2016).
  37. Freire-Pritchett, P., et al. Global reorganisation of cis-regulatory units upon lineage commitment of human embryonic stem cells. Elife. 6, (2017).
  38. Rubin, A. J., et al. Lineage-specific dynamic and pre-established enhancer-promoter contacts cooperate in terminal differentiation. Nature Genetics. 49, 1522-1528 (2017).
  39. Siersbaek, R., et al. Dynamic rewiring of promoter-anchored chromatin loops during adipocyte differentiation. Molecular Cell. 66, 420-435 (2017).
  40. Sahlen, P., et al. Genome-wide mapping of promoter-anchored interactions with close to single-enhancer resolution. Genome Biology. 16, 156(2015).
  41. Nagano, T., et al. Single-cell Hi-C reveals cell-to-cell variability in chromosome structure. Nature. 502, 59-64 (2013).
  42. Nagano, T., Varnai, C., Schoenfelder, S., Javierre, B. M., Wingett, S. W., Fraser, P. Comparison of Hi-C results using in-solution versus in-nucleus ligation. Genome Biology. 16, 175(2015).
  43. Wingett, S., et al. HiCUP: pipeline for mapping and processing Hi-C data. F1000 Res. 4, 1310(2015).
  44. Dryden, N. H., et al. Unbiased analysis of potential targets of breast cancer susceptibility loci by Capture Hi-C. Genome Research. 24, 1854-1868 (2014).
  45. Martin, P., et al. Capture Hi-C reveals novel candidate genes and complex long-range interactions with related autoimmune risk loci. Nature Communications. 6, 10069(2015).
  46. McGovern, A., et al. Capture Hi-C identifies a novel causal gene, IL20RA, in the pan-autoimmune genetic susceptibility region 6q23. Genome Biol.ogy. 17, 212(2016).
  47. Hodge, D., et al. A global role for EKLF in definitive and primitive erythropoiesis. Blood. 107, 3359-3370 (2006).
  48. Jager, R., et al. Capture Hi-C identifies the chromatin interactome of colorectal cancer risk loci. Nature Communications. 6, 6178(2015).
  49. Joshi, O., et al. Dynamic reorganization of extremely long-range promoter-promoter Interactions between two states of pluripotency. Cell Stem Cell. 17, 748-757 (2015).
  50. Hughes, J. R., et al. Analysis of hundreds of cis-regulatory landscapes at high resolution in a single, high-throughput experiment. Nature Genetics. 46, 205-212 (2014).
  51. Kolovos, P., et al. Targeted Chromatin Capture (T2C): A novel high-resolution high-throughput method to detect genomic interactions and regulatory elements. Epigenetics Chromatin. 7, 10(2014).
  52. Davies, J. O., et al. Multiplexed analysis of chromosome conformation at vastly improved sensitivity. Nature Methods. 13, 74-80 (2016).
  53. Mumbach, M. R., et al. HiChIP: efficient and sensitive analysis of protein-directed genome architecture. Nature Methods. 13, 919-922 (2016).
  54. Fullwood, M. J., et al. An oestrogen-receptor-alpha-bound human chromatin interactome. Nature. 462, 58-64 (2009).
  55. Maurano, M. T., et al. Systematic localization of common disease-associated variation in regulatory DNA. Science. 337, 1190-1195 (2012).
  56. Petersen, R., et al. Platelet function is modified by common sequence variation in megakaryocyte super enhancers. Nat. Commun. 8, 16058(2017).
  57. Akhtar, W., et al. Chromatin position effects assayed by thousands of reporters integrated in parallel. Cell. 154, 914-927 (2013).
  58. Cairns, J., et al. CHiCAGO: Robust detection of DNA looping interactions in Capture Hi-C data. Genome Biology. 17, 127(2016).
  59. Rajagopal, N., et al. High-throughput mapping of regulatory DNA. Nature Biotechnology. 34, 167-174 (2016).

重印与许可

标签

Hi-C文库溶液中杂交富集生物素化RNA诱饵限制性片段分析统计检验应用启动子互作区域细胞类型图谱