Hi-C 方法能够无偏倚地在全基因组范围内鉴定染色质相互作用(1)。Hi-C 结合了邻近连接和大规模并行测序技术。由此产生的数据可用于在多个尺度上研究基因组结构:早期结果鉴定了染色体疆域、开放与封闭染色质的分离以及兆碱基尺度的染色质结构等特征。
Hi-C 方法能够无偏倚地在全基因组范围内鉴定染色质相互作用(1)。Hi-C 结合了邻近连接和大规模并行测序技术。由此产生的数据可用于在多个尺度上研究基因组结构:早期结果鉴定了染色体疆域、开放与封闭染色质的分离以及兆碱基尺度的染色质结构等特征。
染色体的三维折叠使基因组形成区室化结构,并可将远端的功能元件(如启动子和增强子)在空间上拉近 2-6。解析染色体结构与基因组活性之间的关系,将有助于理解转录和复制等基因组过程。然而,目前对染色体如何折叠仍知之甚少。显微镜技术无法同时或在高分辨率下区分大量基因座。迄今为止,利用染色体构象捕获技术(3C)及其后续改进方法检测染色体相互作用时,必须预先选定一组目标基因座,因而无法实现全基因组范围的研究 7-10。
我们开发了Hi-C技术,这是3C技术的一种延伸,能够以无偏倚、全基因组范围的方式识别长距离相互作用。在Hi-C实验中,细胞首先用甲醛固定,使发生相互作用的基因位点通过共价的DNA-蛋白质交联而彼此结合。随后使用限制性内切酶对DNA进行切割时,这些相互作用的位点仍保持连接状态。在补平5'突出末端的过程中,引入生物素标记的核苷酸残基。接下来,在稀释条件下进行平末端连接,有利于发生交联的DNA片段之间的连接反应。由此生成一个全基因组范围的连接产物文库,其中每个连接产物对应于细胞核中原本空间位置相近的两个DNA片段。每个连接产物在其连接位点处均带有生物素标记。随后将文库片段化,并利用链霉亲和素磁珠富集含有连接位点的片段。纯化后的连接片段可进一步通过高通量测序仪进行分析,从而获得一份完整的相互作用DNA片段目录。
对所得接触矩阵的直接分析揭示了基因组结构的多种特征,例如染色体疆域的存在以及富含基因的小染色体之间的优先关联。对接触矩阵进行相关性分析表明,人类基因组被划分为两个区室:一个为结构较松散的区室,包含开放、可接近且具有活性的染色质;另一个为结构更致密的区室,包含闭合、不可接近且无活性的染色质区域。最后,结合理论推导和计算模拟对接触矩阵进行系综分析发现,在兆碱基尺度上,Hi-C 揭示的特征与分形球状构象相符。
本方法已用于所报告的研究中 Lieberman-Aiden 等,Science 326,289-293(2009).
一、交联、消化、DNA 末端标记及平末端连接
II. 剪切与片段大小选择
III. 生物素下拉与成对末端测序
IV. Hi-C 结果的代表性示例

图1. Hi-C技术概述。细胞用甲醛进行交联,使空间上相邻的染色质片段之间形成共价连接(DNA片段:深蓝色、红色;介导此类相互作用的蛋白质以浅蓝色和青色表示)。使用限制性内切酶(此处为HindIII;限制性位点:虚线,见插图)消化染色质。将产生的黏性末端用核苷酸填补,其中一种核苷酸被生物素标记(紫色点)。在极稀释条件下进行连接反应,以促进分子内连接事件;此时HindIII位点丢失,并形成一个新的NheI位点(插图)。随后纯化DNA并进行片段化处理,利用链霉亲和素磁珠富集带有生物素标记的连接位点。通过双端测序鉴定相互作用的DNA片段。

图 2. Hi-C 文库质量控制。(A) 将不同量的 3C 对照和 Hi-C 文库在 0.8% 琼脂糖凝胶上进行电泳分离。两个文库均呈现为略大于 10 kb 的较紧密条带。Hi-C 文库中的典型连接效率略低于 3C 模板中的连接效率,这可通过 Hi-C 泳道中出现的弥散条带(smear)来体现。(B) PCR 消化对照。使用标准 3C PCR 条件扩增由两个邻近片段形成的连接接头。通过消化连接位点可区分 Hi-C 与传统 3C 产生的连接产物。Hi-C 接头可被 NheI 切割,但不能被 HindIII 切割;而 3C 接头则相反。70% 的 Hi-C 扩增子被 NheI 切割,证实连接接头被有效标记。为确保定量结果可靠,实验设置了两个重复。

图 3. Hi-C 读段质量控制。(A)来源于染色体内(蓝色)和染色体间(红色)相互作用片段的读段,相较于随机生成的读段(绿色),在HindIII限制性酶切位点附近显著更密集地比对。染色体内读段和染色体间读段的曲线均随着与HindIII位点距离的增加而迅速下降,直至在约500 bp处达到平台期。该距离对应于用于测序的最大片段大小。(B)通常情况下,可比对读段对中约55%代表染色体间相互作用,15%代表间隔小于20 kb的染色体内相互作用,30%为间隔大于20 kb的染色体内读段对。该分布可在高通量测序前通过取样进行质量控制评估;通常克隆并进行约100个克隆的Sanger测序即已足够。

图4. 相关性分析表明细胞核被划分为两个区室。(A) 染色体14上染色体内相互作用对应的热图。每个像素代表一个1-Mb位点与另一个1-Mb位点之间的所有相互作用;颜色强度对应于测序读段总数(范围:0–200条读段)。刻度标记每10 Mb出现一次。该热图呈现出明显的结构特征,包括一条强烈的对角线以及一系列较大的区块。(染色体14为近端着丝粒染色体;短臂未显示。)利用Hi-C数据集计算在特定基因组距离下两个位点之间的平均接触概率,可生成一个期望矩阵(B),该矩阵表示在不存在长距离结构情况下的预期结果。上述两个矩阵的商即为观测值/期望值矩阵(C),其中蓝色表示信号耗竭,红色表示信号富集[范围:0.2(蓝色)至5(红色)]。区块模式在此图中更加清晰。相关性矩阵(D)展示了染色体14上每一对位点的染色体内相互作用谱之间的相关性[范围:-1(蓝色)至1(红色)]。明显的格纹模式表明染色体内存在两个区室。

图5. 染色体区域的存在及其组织方式。(A)染色体1上接触概率随基因组距离增加而下降,最终在约90 Mb处达到平台期(蓝色)。不同染色体对之间的染色体间接触水平存在差异;染色体1上的位点最可能与染色体10上的位点相互作用(绿色虚线),而最不可能与染色体21上的位点相互作用(红色虚线)。相对于染色体内相互作用,染色体间相互作用减少。(B)所有染色体对之间染色体间接触的观测值/期望值。红色表示富集,蓝色表示耗竭[范围:0.5(蓝色)至2(红色)]。较小且基因富集的染色体倾向于彼此之间发生更多相互作用。

图6. 染色质的局部堆积方式与分形球状结构的行为一致。(A)全基因组平均的接触概率随基因组距离的变化关系(蓝色)。在500 kb至7 Mb范围内(阴影区域)观察到显著的幂律标度行为,斜率为-1.08(青色线为拟合结果)。(B)平衡球状结构(红色)和分形球状结构(蓝色)的模拟结果,显示接触概率随距离的变化关系。分形球状结构的斜率接近-1(青色),验证了我们提出的新理论预测1。平衡球状结构的斜率为-3/2,符合以往的理论预期。分形球状结构的斜率与Hi-C实验结果中观察到的斜率非常相似,而平衡球状结构的斜率在Hi-C数据中并未出现。(C)上图:一条展开的聚合物链,包含4000个单体。颜色表示距离链一端的距离,从蓝色到青色、绿色、黄色、橙色,再到红色。中图:从我们的系综中生成的一个典型的分形球状结构示例。分形球状结构无缠结现象。沿着链轮廓相近的位点在三维空间中也倾向于靠近,从而形成大块的单色区域,在表面和截面中均清晰可见。下图:一个平衡球状结构。该结构高度缠结;沿着链轮廓相近的位点(颜色相似)在三维空间中不一定靠近。
我们介绍一种通过无偏倚、全基因组范围的染色质相互作用作图来研究基因组三维结构的方法。最关键的实验步骤——也是使该技术区别于以往工作的核心环节——是在交联片段的限制性酶切末端连接之前,引入生物素标记的核苷酸。成功完成这一步骤可实现对所有连接位点的深度测序,从而赋予Hi-C技术广泛的覆盖范围和强大的分析能力。
测序读段的数量最终将决定相互作用图谱的分辨率。此处展示的是利用约3000万条可比对读段绘制的人类基因组1 Mb分辨率的相互作用图谱。为了将“通用”分辨率提高一个数量级 n,测序读段数量必须增加一个倍数 n2.
Hi-C 技术可轻松与其他技术结合使用,例如在文库构建后进行杂交捕获(以靶向基因组的特定区域),或在连接反应后进行染色质免疫沉淀(以研究与特定蛋白质相关的区域的染色质环境)。
一种关于Hi-C方法的临时专利(编号61/100,151)正在审查中。
感谢 A. Kosmrlj 提供的讨论和代码;感谢 A. P. Aiden、X. R. Bao、M. Brenner、D. Galas、W. Gosper、A. Jaffer、A. Melnikov、A. Miele、G. Giannoukos、C. Nusbaum、A. J. M. Walhout、L. Wood 和 K. Zeldovich 提供的讨论;感谢 L. Gaffney 和 B. Wong 在可视化方面提供的帮助。
本研究得到了Fannie和John Hertz基金会研究生奖学金、国家国防科学与工程研究生奖学金、美国国家科学基金会(NSF)研究生奖学金、国家太空生物医学研究所、美国国家人类基因组研究所(NHGRI)资助项目编号T32 HG002295(E.L.);i2b2(生物与临床信息整合信息学)项目及美国国立卫生研究院(NIH)资助的布莱根妇女医院生物医学计算中心(L.A.M.);NHGRI资助项目编号HG003143以及Keck基金会杰出青年学者奖(J.D.)的支持。原始及比对后的Hi-C测序数据已存入GEO数据库(www.ncbi.nlm.nih.gov/geo/),登录号GSE18199。更多可视化数据可访问http://hic.umassmed.edu。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 蛋白酶抑制剂 | Sigma-Aldrich | P8340-5ml | 步骤 1.2 |
| 生物素-14-dCTP | Invitrogen | 19518-018 | 步骤 1.6 |
| Klenow | New England Biolabs | M0210 | 步骤 1.6 和 2.2 |
| T4 DNA 连接酶 | Invitrogen | 15224 | 步骤 1.9 |
| T4 DNA 聚合酶 | New England Biolabs | M0203 | 步骤 1.17 和 2.2 |
| 10x 连接缓冲液 | New England Biolabs | B0202 | 步骤 2.2 和 3.4 |
| T4 多核苷酸激酶(T4 PNK) | New England Biolabs | M0201 | 步骤 2.2 |
| Klenow (exo-) | New England Biolabs | M0212 | 步骤 2.3 |
| Dynabeads MyOne Streptavidin C1 磁珠 | Invitrogen | 650.01 | 步骤 3.2 |
| T4 DNA 连接酶 HC | Enzymatics | L603-HC-L | 步骤 3.5 |
| Phusion HF 预混液 | New England Biolabs | F531 | 步骤 3.8 |
| Ampure 磁珠 | Beckman Coulter Inc. | A2915 | 步骤 3.9 |