本方案描述了染色质捕获结合高通量测序(Capture Hi-C)方法,用于在高分辨率下表征数兆碱基大小的靶向基因组区域的三维结构,包括拓扑关联结构域(TADs)的边界以及调控元件与其他DNA序列元件之间的长程染色质相互作用。
本方案描述了染色质捕获结合高通量测序(Capture Hi-C)方法,用于在高分辨率下表征数兆碱基大小的靶向基因组区域的三维结构,包括拓扑关联结构域(TADs)的边界以及调控元件与其他DNA序列元件之间的长程染色质相互作用。
基因组的空间组织在其功能和调控中发挥重要作用,涉及转录、复制、重组和修复等多种生物学过程。因此,明确基因组拓扑结构与功能之间的精确因果关系至关重要,也正日益成为深入研究的热点。染色体构象捕获技术(3C)通过测量基因组任意区域之间的相互作用频率,可推断染色质的三维结构。本文介绍了一种快速且简便的Capture Hi-C实验方案,该方法基于3C技术,通过靶向富集策略,能够在高分辨率下解析长达兆碱基规模的基因组靶区的等位基因特异性三维结构。在Capture Hi-C中,靶区域在后续高通量测序之前,由一组生物素标记的探针进行富集捕获,从而在提高技术时效性和经济性的同时,实现更高的分辨率和等位基因特异性。为展示该方法的优势,我们将Capture Hi-C应用于小鼠X染色体失活中心(Xic),即X染色体失活(XCI)的核心调控位点。
线性基因组包含了一个生物体进行胚胎发育并在成年期存活所需的所有信息。然而,指导遗传上完全相同的细胞执行不同功能,是精确调控在特定背景下(包括不同组织和/或发育阶段)使用哪些信息的基础。人们认为,基因组的三维结构通过促进或阻止在线性基因组中相距可达数百千碱基的调控元件之间的物理相互作用,参与了基因活性的这种精确时空调控(综述见1,2,3)。在过去的20年中,我们对基因组折叠与功能之间相互关系的理解迅速加深,这主要得益于染色体构象捕获技术(3C)的发展(综述见4,5,6,7)。这些方法通过检测基因组任意区域之间相互作用的频率,依赖于细胞核内空间上邻近的DNA序列的连接。最常见的3C实验流程首先使用甲醛等交联剂对细胞群体进行固定。接着,使用限制性内切酶消化交联的染色质,尽管也有研究采用MNase进行消化8,9。消化完成后,空间上邻近的游离DNA末端被重新连接,随后解除交联。此步骤产生3C“文库”或“模板”,即一种混合的杂交片段库,其中在细胞核内三维空间上邻近的序列更有可能被连接到同一DNA片段中。对这些杂交片段进行后续定量分析,可推断在线性基因组中相距数千个碱基对的基因组区域在三维空间中的构象。
已开发出多种不同的方法来表征3C文库,这些方法在所分析的连接片段子集以及用于下游定量的技术方面均有所不同。原始的3C方案依赖于选择两个感兴趣的区域,并通过PCR定量它们之间的“一对一”相互作用频率10,11。4C方法(环状染色体构象捕获)用于测量一个特定基因座(即“视角位点”)与基因组其余部分之间的相互作用(“一对全”)12,13,14。在4C中,3C文库经历第二轮酶切和重新连接,以生成小的环状DNA分子,随后使用特异性针对视角位点的引物进行PCR扩增15。5C技术(染色体构象捕获碳拷贝)能够表征更大区域内染色质的三维相互作用,从而揭示该区域内高级染色质折叠的信息(“多对多”)16。在5C中,3C文库与一组覆盖限制性酶切位点的寡核苷酸探针杂交,随后通过通用引物进行多重PCR扩增15。在4C和5C中,最初使用微阵列对有信息价值的DNA片段进行定量,之后转为使用高通量测序(NGS)17,18,19。这些策略可用于研究特定目标区域,但无法用于全基因组范围的相互作用图谱绘制。这一目标可通过Hi-C实现,Hi-C是一种基于3C的高通量策略,通过对3C模板进行大规模并行测序,无偏倚地在全基因组水平上表征染色质折叠(“全对全”)20。Hi-C方案包括在酶切后的片段末端引入生物素标记残基,随后利用链霉亲和素磁珠富集连接产物,以提高连接片段的回收率20。
Hi-C 技术揭示了哺乳动物基因组在三维细胞核中具有多层次的结构组织。在兆碱基尺度上,基因组被划分为活性染色质和非活性染色质区域,分别称为 A 和 B 区室20,21。后续研究还表明,存在由不同染色质状态和活性状态代表的进一步亚区室22。在更高分辨率下,基因组被进一步划分为亚兆碱基大小的自相互作用结构域,称为拓扑关联结构域(topologically associating domains, TADs),该结构域最初通过人类和小鼠基因组的 Hi-C 和 5C 分析被发现23,24。与具有组织特异性变化的区室不同,TADs 通常较为保守(尽管存在许多例外情况)。重要的是,TAD 边界在不同物种间具有保守性25。在哺乳动物细胞中,TADs 常包含共享相同调控环境的基因,并已被证明代表一种结构框架,有助于基因共调控,同时限制与邻近调控区域的相互作用(综述见3,26,27,28)。此外,在 TADs 内部,由于黏连蛋白挤出环底部的 CTCF 位点所介导的相互作用,可能增加启动子-增强子或增强子-增强子之间相互作用的概率(综述见29)。
在Hi-C技术中,可以在1 Mb至40 kb的分辨率下检测到染色质区室(compartments)和拓扑关联结构域(TADs),但通过提高分辨率,还可进一步表征更小尺度的染色质相互作用,例如在5–10 kb尺度上远端元件之间的成环互作。然而,为了高效检测此类成环结构而提高Hi-C分辨率,需要显著增加测序深度,从而导致测序成本大幅上升。若分析还需实现等位基因特异性,则这一问题将更加突出。实际上,分辨率提高X倍,所需的测序深度需增加X2倍,这意味着高分辨率且等位基因特异性的全基因组研究方法可能因成本过高而难以实施30。
为了在保持高分辨率的同时提高成本效益和可负担性,可在下游测序之前,通过互补的生物素标记寡核苷酸探针与全基因组范围的 3C 或 Hi-C 文库杂交,将目标兴趣区域从文库中物理性地富集下来。这类靶向富集策略被称为 Capture-C 方法,可实现对遍布基因组的数百个靶位点相互作用的检测(例如启动子捕获(PC)Hi-C;下一代(NG)Capture-C;低起始量(LI)Capture-C;细胞核滴定(NuTi)Capture-C;Tri-C)31,32,33,34,35,36,37,38,39,40,或跨越长达数兆碱基区域的相互作用(例如 Capture Hi-C;杂交捕获 Hi-C(Hi-C2);Tiled-C)41,42,43。基于捕获的方法中存在两个可变方面:(1)生物素化寡核苷酸的性质与设计(例如 RNA 或 DNA,单个寡核苷酸用于捕获分散的基因组靶点,或多个寡核苷酸拼接覆盖某一特定区域);(2)用于富集靶标的模板,可以是 3C 或 Hi-C 文库本身,后者由从 3C 文库中富集得到的生物素化限制性酶切片段组成。
本文描述了一种基于从3C文库中富集目标互作的Capture Hi-C实验方案。该方案依赖于定制的生物素化RNA探针平铺阵列的设计,从3C文库制备到高通量测序可在1周内完成。该方法快速、简便,能够在5 kb分辨率下表征兆碱基大小的目标区域的高级别三维基因组结构,同时在时间效率和成本效益方面优于其他3C类方法。本Capture Hi-C方案已应用于X染色体失活(XCI)的主调控位点——X失活中心(Xic),该区域包含Xist非编码RNA。此前,Xic已接受过广泛地结构与功能研究(综述见44,45)。在哺乳动物中,XCI通过转录沉默雌性细胞(XX)中两条X染色体之一的绝大部分基因,以平衡雌雄(XY)之间X连锁基因的剂量差异。Xic已成为研究三维基因组拓扑结构及其与基因调控关系的强大且被广泛认可的标准位点44。在小鼠胚胎干细胞(mESCs)中对Xic进行的5C分析促成了拓扑相关结构域(TADs)的发现与命名,首次揭示了基因组拓扑分区与基因共调控的功能意义24。后续研究表明,Xic的拓扑结构在Xist基因的适时上调及XCI的正常发育时序中起关键作用46,并且最近在Xic区域内还发现了可影响TAD内及TAD间基因活性的未知顺式调控元件47,48,49。将Capture Hi-C应用于跨越Xic的小鼠X染色体上约3 Mb的区域,展示了该方法在高分辨率下解析大规模染色质折叠结构的强大能力。本文提供了从目标区域每个DpnII限制性酶切位点处设计生物素化探针阵列,到全基因组3C文库构建、目标互作的杂交与富集,以及后续数据分析的详细且易于操作的实验流程。同时概述了适当的质控指标和预期结果,并结合现有类似方法,讨论了该技术的优势与局限性。
本研究中使用的小鼠胚胎干细胞(mESCs)是根据法国居里研究所(巴黎)的动物护理指南51,通过将一只 TX/TX R26rtTA/rtTA 雌鼠50 与一只 Mus musculus castaneus 雄鼠杂交获得的。
1. 探针设计
2. 实验步骤
3. 数据分析
所描述的Capture Hi-C方案基于使用四碱基切割酶(DpnII)制备全基因组范围的3C模板。随后通过一组连续覆盖目标基因组区域的RNA探针进行杂交,并利用本研究中所用目标富集系统的链霉亲和素介导捕获方法,实现对目标区域连接片段的富集图1)。选择生物素标记的RNA探针,因为与DNA探针相比,其对靶标的结合亲和力更强52,60捕获的文库随后进行加索引和混合,用于多重高通量测序。捕获型Hi-C数据可被可视化为高分辨率的Hi-C相互作用图谱,也可呈现为类似4C的单视角接触图谱,以特异性展示整个捕获区域内较小序列(如启动子或增强子)的相互作用。本方案的工作流程如图所示。 图4测序前质量控制如图所示 图2 并包括对3C模板的适当消化与重新连接,以及在方案不同步骤中对其有效剪切和纯化的评估。剪切后的3C模板DNA片段大小应在150至700 bp之间,且无片段富集现象 >应检测到 2 kb。在后续步骤中,将进行若干基于磁珠的 DNA 纯化和片段大小选择步骤,分别在片段打断后、捕获前 PCR 后以及捕获后 PCR 后进行。经纯化的文库在高灵敏度 DNA 生物分析仪上可观察到明显的片段富集图谱图2。在文库构建过程中,由于接头、测序引物和索引引物的连接,片段的平均长度逐渐增加。测序后的质量控制数据可获得 通过 Hi-C Pro 并展示于 图3已有多种不同的生物信息学软件被提出用于 3C 类数据的处理与分析。其中,HiC-Pro 分析流程是最为流行的解决方案之一,能够将原始测序数据处理生成不同分辨率的最终互作图谱55HiC-Pro 采用两步映射策略,将测序读段比对到参考基因组上。随后重建并过滤 3C 产物,以去除无信息量的接触对,并生成接触图谱。此外,该工具能够利用已知多态性位点列表进行等位基因特异性分析,将来自两个亲本等位基因的接触信号分别分配到不同的接触图谱中。最近,HiC-Pro 已被纳入并扩展至 nf-core 框架(nf-core-hic),形成了一个高度可扩展、可重复且由社区驱动的分析流程。61,62.
为了捕获小鼠 Xic 区域,设计了一组包含 28,913 个 RNA 探针的芯片,覆盖 X 染色体上 3 Mb 的区域。该区域包括 X 染色体失活(XCI)的关键基因——长链非编码基因 Xist 及其已知的约 800 kb 的调控区域(图 5)。这约 800 kb 的区域被划分为两个拓扑关联结构域(TAD):其中一个包含 Xist 启动子及其已知的正向调控因子(即非编码转录本 Ftx、Jpx、Xert 以及蛋白编码基因 Rnf12),另一个相邻的 TAD 则包含 Xist 的负向顺式调控因子(即其反义转录本 Tsix、增强子元件 Xite 和非编码转录本 Linx)(综述见44,45)。
通过将所述的捕获Hi-C(Capture Hi-C)技术应用于Xic,获得了该基因座前所未有的高分辨率拓扑结构(图6 和 图7)。当将捕获Hi-C图谱与先前发表的5C47(图6 和 图7;补充表1)以及Hi-C61(图6 和 图7;补充表1)图谱进行比较时,这一优势尤为明显。例如,亚拓扑关联结构域(sub-TAD)的结构更加清晰——包含Xist启动子的TAD(Xist-TAD)被明确划分为两个更小的结构域(图6A,蓝色箭头)。此前,仅能从5C图谱中视觉上“推测”该区域存在边界(图6B),尽管绝缘评分算法(insulation score algorithm)已可检测到该区域的边界。同样,捕获Hi-C图谱的分辨率使得在邻近的TAD中也能识别出两个更小的结构域(图6A、B),该TAD包含Tsix基因座的启动子(Tsix-TAD);而此前使用5C技术未能实现这一分辨(图6B)。值得注意的是,基于捕获Hi-C和5C数据通过绝缘评分所确定的拓扑边界,通常在位置上略有差异,且相对强度也有所不同。
此外,从Capture Hi-C数据中还可以清晰地观察到其他亚TAD结构,例如Xist与Ftx之间的染色质环(图7A),该结构此前已通过Capture-C技术被鉴定63;以及Xist与Xert之间的染色质环(图7B),该结构最近利用类似的Capture Hi-C实验方案被发现48。由于Capture Hi-C图谱分辨率的提高,其他染色质相互作用也可被更精确地定位,例如在Tsix-TAD区域内Linx、Chic1和Xite位点之间形成的已知相互作用热点(图7A)。
与图7所示的Hi-C数据相比,Capture Hi-C 的分辨率提高了四倍,但仅需四分之一的测序深度(即 126 M 条序列读长对比 571 M)(补充表1)。分辨率的提高使得能够检测到在图6和图7所示测序深度下通过Hi-C无法检测到的亚拓扑关联结构域(subTADs)以及染色质环互作。因此,本研究所描述的Capture Hi-C 实验方案相较于以往方法,能够对感兴趣的较大基因组区域进行更为详细和高分辨率的表征。

图1:探针设计。探针设计策略的示意图。 在3 Mb目标区域内的每个DpnII限制性酶切位点上下游各300 bp的区域被选中,并用重叠的生物素化RNA探针进行覆盖。图中显示其中一个选定区域,chrX: 102,474,805-102,475,500。每个探针中重复序列长度不得超过40个碱基。请点击此处查看该图的放大版本。

图 2:Capture Hi-C 测序前质量控制。(A)3C 模板质量控制的代表性示例。将 200 ng DNA 上样至 1% 琼脂糖凝胶。第 1 泳道:1 kb DNA 标准分子量标记。第 2 泳道:未消化、交联且完整的染色质以一条清晰条带迁移,大小为 >10 kb。第 3 泳道:经 DpnII 消化后的交联染色质,呈弥散条带,大小在 1 kb 至 3 kb 之间。第 4 泳道:最终的 3C 文库或模板;消化后的交联 DNA 片段的游离末端被重新连接。低分子量的 DNA 弥散条带几乎不可见,连接产物表现为一条大小为 >10 kb 的条带。(B)高灵敏度生物分析仪 DNA 谱图的代表性示例。左上图:成功剪切的 3C 文库,片段大小分布在 150 bp 至 700 bp 之间。右上图:剪切效果不理想的 3C 文库。未剪切的 DNA 表现为片段大小 >2 kb 的宽峰富集。(C)左下图:使用 SPRI 磁珠进行 1:1 左侧片段大小选择后的剪切 DNA 样品,~300 bp 的片段得到富集。中下图:按照试剂盒说明书连接双端接头后的捕获前 PCR 谱图。右下图:最终的 Capture Hi-C 文库,包含接头、测序引物和用于多重测序的索引引物。缩写:bp = 碱基对,FU = 荧光相对单位。请点击此处查看该图的放大版本。

图 3:使用 HiC-Pro 进行染色质捕获 Hi-C 测序后的质量控制。 (A)测序双端读段中第一端在参考基因组上的比对率示例。浅蓝色部分表示由 HiC-Pro 比对并跨越连接位点的读段。因此,该指标可用于验证实验中的连接步骤。(B)当测序配对读段在基因组上完成比对后,仅保留唯一比对的读段对用于后续分析。(C)无效配对(红色部分),如悬垂末端、自环化或再连接产物,将从分析中剔除。有效配对所占比例是评估连接效率和富集效率的良好指标。(D)有效配对可进一步划分为染色体内/染色体间以及短距离/长距离相互作用。可能代表 PCR 扩增伪影的重复读段对将被剔除。(E)在等位基因特异性分析中,HiC-Pro 报告支持每个亲本基因组(即 C57BL/6J × CASTEi/J)中单个或两个配对读段的等位基因读段数量。预期分配至母源和父源等位基因的读段比例相近。(F)最后,仅选择覆盖捕获区域的有效配对用于构建相互作用图谱。捕获-捕获配对代表靶向区域内的相互作用,而捕获-报告配对则涉及靶向区域与非靶向区域之间的相互作用。请点击此处查看该图的放大版本。

图4:Capture Hi-C 实验流程图。 不同实验步骤的示意图。为构建全基因组范围的3C模板,首先使用甲醛交联染色质,随后用DpnII限制性内切酶进行消化。接着将游离的DNA末端重新连接,逆转交联,并纯化DNA。为了富集包含目标区域的DNA片段,使用一组生物素标记的RNA探针与3C模板杂交,并通过链霉亲和素介导的pull-down方法进行捕获。捕获文库经多重测序处理后,通过定量有效的连接片段来推断目标区域内染色质相互作用的频率,并以高分辨率的相互作用图谱形式呈现。 请点击此处查看该图的放大版本。

图5:小鼠X染色体上包含Xic区域的概览。小鼠X染色体的示意图及所捕获的3 Mb区域(ChrX: 102,475,000-105,475,000)的放大图。目标区域包含约800 kb的DNA,对应于X染色体失活中心(Xic),即X染色体失活(XCI)的主调控位点。Xic包含长链非编码基因Xist(XCI的关键因子)及其调控区域。Xist的正向调控因子以绿色表示,负向调控因子以紫色表示。请点击此处查看该图的放大版本。

图 6:跨越 3 Mb 捕获区域的染色体捕获 Hi-C、5C 和 Hi-C 相互作用图谱。 (A)本研究中以 10 kb 分辨率绘制的小鼠 Xic 所在 3 Mb 目标区域的染色体捕获 Hi-C 相互作用图谱。(B)与(A)中相同目标区域的 6 kb 分辨率 5C 相互作用图谱(数据来自文献47的重新处理)。分析中未包含的重复区域以白色遮蔽。5C 数据需独立的生物信息学处理流程(参见文献47)。在完成数据清洗与比对后,基于引物分辨率的 5C 图谱通过滑动中位数法(窗口大小 = 30 kb,步长 = 5)进行分箱,最终达到 6 kb 分辨率。(C)与(A)和(B)相同基因组区域的 40 kb 分辨率 Hi-C 相互作用图谱(数据来自文献64的重新处理)。所有相互作用图谱均来源于小鼠胚胎干细胞(ESCs)。绝缘分数使用 cooltools 计算,并以直方图形式展示,TAD 边界对应于绝缘分数的最小值。TAD 边界在图谱下方以垂直线表示,每条线的高度反映边界的强度。基因以指示转录方向的箭头表示。仅在染色体捕获 Hi-C 图谱中特异性检测到或定位更精确的亚 TAD 边界,分别用洋红色和蓝色箭头标出,分别对应 Tsix 和 Xist 所在的 TAD 内的亚 TAD。 请点击此处查看该图的放大版本。

图 7:在捕获区域内跨越 1 Mb 的捕获 Hi-C、5C 和 Hi-C 相互作用图谱。(A)包含小鼠 Xic 的 1 Mb 基因组区域在 5 kb 分辨率下的捕获 Hi-C 相互作用图谱(本研究)。(B)与(A)相同基因组区域在 6 kb 分辨率下的 5C 相互作用图谱(数据来自文献47的重新处理)。分析中未包含的重复区域以白色遮蔽。需要注意的是,5C 数据需要独立的生物信息学处理(参见文献47)。在完成数据清洗和比对后,以引物分辨率为单位的 5C 图谱通过滑动中位数法进行分箱(窗口大小 = 30 kb,步长 = 5),最终达到 6 kb 的分辨率。(C)与(A)和(B)相同基因组区域在 20 kb 分辨率下的 Hi-C 相互作用图谱(数据来自文献64的重新处理)。所有相互作用图谱均来源于小鼠胚胎干细胞(mESCs)。绝缘得分使用 cooltools 计算,并以直方图形式展示,TAD 边界处对应绝缘得分的最小值。TAD 边界在图谱下方以垂直线表示,每条线的高度反映边界的强度。基因以指示转录方向的箭头表示。仅在捕获 Hi-C 中特异性检测到或定位更精确的染色质互作环,在 Tsix 和 Xist TAD 中分别用洋红色和蓝色星号标出。请点击此处查看该图的放大版本。
补充表 1:本论文所用数据集的测序后统计信息:染色质相互作用捕获测序(本研究)、Hi-C64 和 5C47。 请点击此处下载该文件。
本文介绍了一种相对快速且简便的染色质捕获技术(Capture Hi-C),用于在5–10 kb分辨率下表征兆碱基大小的基因组区域的高级空间组织结构。Capture Hi-C属于Capture-C技术家族,旨在从全基因组范围的3C或Hi-C文库中富集特定目标染色质相互作用。迄今为止,大多数Capture-C应用主要用于绘制遍布整个基因组的较小调控元件的染色质互作图谱。在首个Capture-C实验方案中,研究人员使用多个重叠的生物素化RNA探针,从红系细胞构建的3C文库中捕获了>400个预先选定的启动子31。该策略随后在下一代(NG)和核滴定(NuTi)Capture-C中得到改进,通过使用跨越单一限制性酶切位点的120 bp DNA捕获探针,并进行两轮连续捕获,以最大化富集具有信息量的连接片段,从而实现了对>8,000个启动子的高分辨率互作分析32,40。这些方法已在多种生物学背景下推动了对顺式作用元件的功能解析,包括小鼠胚胎发育、细胞分化、X染色体失活以及病理条件下基因表达失调等过程46,63,65,66,67,68,69,70,71。
在启动子捕获 Hi-C(PCHi-C)技术中,通过在限制性酶切片段的一端或两端杂交单链 120-mer 生物素化 RNA 探针,从 Hi-C 文库中富集了超过 22,000 个已注释的含有限制性酶切片段的启动子>22,00034,72。该方法使得在越来越多的细胞类型中解析数千个启动子的相互作用组成为可能,包括小鼠胚胎干细胞、胎肝细胞和脂肪细胞34,35,72,73,以及人类淋巴母细胞系、造血祖细胞、表皮角质形成细胞和多能细胞37,74,75,76,77。
与这些靶向富集技术相比,Capture Hi-C 可靶向连续的基因组区域,范围可达兆碱基(megabase)尺度,从而跨越一个或多个拓扑关联结构域(TAD),并涵盖基因的调控区域。目标区域内所有 DpnII 限制性酶切位点均需被一系列生物素标记的探针覆盖,以实现对整个目标区域的完整铺排。生物素化探针阵列与 3C 模板的杂交、随后基于链霉亲和素的捕获以及用于多重测序的处理,均通过适用于Illumina双端多重测序的目标富集系统完成。整个实验流程快速,从 3C 文库构建到下一代测序(NGS)可在 1 周内完成,且仅需少量调整或针对特定情况的故障排查。
与其它基于3C的方法相比,该方案还具有优势。为了获得5-10 kb分辨率的相互作用图谱,我们测序了1亿至1.2亿条成对末端读长。作为对比,本研究中使用了一个包含5.71亿条读长的Hi-C数据集以达到20 kb的分辨率64(GSM2053973),而若要通过全染色体范围的Hi-C达到5 kb分辨率,则至少需要10亿条读长22。
本研究中使用的Capture Hi-C技术相比先前基于6-bp切割限制性内切酶的5C方法具有更高的分辨率47(补充表1)。重要的是,5C技术中用于富集和扩增目标相互作用的策略无法实现染色质相互作用的等位基因特异性分析。相反,Capture Hi-C数据可进行等位基因特异性比对,从而能够解析同源染色体对的三维结构图谱,例如在人类细胞或通过遗传背景不同的小鼠品系杂交获得的F1杂合细胞系中78。为了在5 kb分辨率下生成等位基因特异性的Capture Hi-C相互作用图谱,我们对150 bp的双端测序读长进行测序,以提高单核苷酸多态性(SNP)的覆盖度。类似等位基因特异性的方法也可应用于已有SNP注释的人类细胞系22。
重要的是,尽管染色质相互作用捕获测序(Capture Hi-C)通常能在提高测序成本效益的同时保证高分辨率,但定制化的生物素化寡核苷酸的合成确实会影响该方法的整体成本。因此,针对不同应用场景,最合适的 3C 方法的选择会有所不同,具体取决于所研究的生物学问题、所需的分辨率以及目标区域的大小。其他已开发的 Capture Hi-C 方案与本文所述方案具有关键共性。例如,已有研究采用 Capture Hi-C 策略对与乳腺癌和结直肠癌风险相关的非编码变异区域(跨度约为 50 kb 至 1 Mb)进行表征;在该方案中,通过使用覆盖目标区域达 3 倍深度的 120-mer RNA 捕获探针,从 Hi-C 文库中富集目标区域33,38,79。类似地,杂交捕获 Hi-C(HYbrid Capture Hi-C,Hi-C2)被用于靶向富集最大达 2 Mb 的目标区域内的染色质相互作用80。在这两种方案中,利用富含生物素的 Hi-C 模板对连接片段进行富集,从而提高了总有效读段的比例,相较于本方案更具优势。例如,在本研究用于比较的 Hi-C 数据集64(GSM2053973)中,去除重复后有效配对读段的比例比本文所述 Capture Hi-C 实验获得的有效配对读段高出 4.8 倍(见图 3和补充表 1)。然而,连续进行生物素化连接片段和杂交探针的富集步骤显著增加了实验的复杂性和耗时,同时可能降低捕获区域的文库复杂度。
另一种可用于通过平铺探针富集3C模板的方法是Tiled-C,该方法已被应用于研究小鼠红系分化过程中具有高空间和时间分辨率的染色质结构43。在Tiled-C中,使用一组70 bp的生物素化探针,通过连续两轮捕获来富集大范围区域内的相互作用,从而生成靶向相互作用的极高分辨率图谱43,81。双重捕获富集也使得该实验流程相较于Capture Hi-C更长且更复杂。然而,与靶向单个限制性酶切位点的Capture-C策略不同,在Tiled-C中第二轮捕获似乎并未显著提高捕获效率,因此可能可以省略43。最后,一种类似的平铺探针策略基于本研究中所使用的相同靶向富集方法,已被应用于解析先天性畸形患者中描述并在转基因小鼠中重建的结构变异所涉及的调控区域41,42。在该研究中,探针的平铺阵列设计覆盖了整个靶区域,而非局限于DpnII限制性酶切位点附近41。尽管如此,这项工作具有开创性意义,突显了该策略在不同背景下实现大片段基因组区域高分辨率表征的灵敏度与强大能力41,42,48。
综上所述,本文所述方案代表了一种简便、稳健且功能强大的策略,可用于对任何感兴趣的基因组区域进行高分辨率的三维表征。将该方法应用于不同的模式系统、细胞类型、发育调控的染色质景观以及健康与疾病状态下的基因调控,有望促进我们对基因组拓扑结构与基因调控之间相互作用及其因果关系的理解,这是表观遗传学领域中一个根本性的未解问题。此外,应用Capture Hi-C技术来绘制全基因组关联研究(GWAS)所鉴定的风险变异位点的长程相互作用和高级染色质折叠结构,有望揭示与人类疾病相关的非编码基因组位点在不同背景下的功能意义,从而为潜在致病机制的解析提供新的见解。
Kai Hauschulz 是安捷伦科技公司诊断与基因组学部门的现场应用科学家。其他所有作者均声明不存在竞争利益。
Heard 实验室的工作得到了欧洲研究理事会高级研究员奖(XPRESS - AdG671027)的支持。A.L. 受欧盟玛丽·斯克沃多夫斯卡-居里行动计划个体奖学金(IF-838408)资助。A.H. 受玛丽·斯克沃多夫斯卡-居里资助协议 813327 项下的创新与跨学科网络 ChromDesign(ITN)支持。作者感谢 Daniel Ibrahim(柏林马克斯·普朗克分子遗传学研究所)提供的有益技术建议,感谢巴黎居里研究所 NGS 平台,以及感谢 Vladimir Benes 和欧洲分子生物学实验室(海德堡)基因组核心设施提供的支持与协助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 10x PBS,pH 7.4 | Gibco | 10010-023 | |
| 37%(体积比)多聚甲醛溶液 | Electron Microscopy Sciences | 15686 | 一次性玻璃小瓶;禁止重复使用 |
| 50 mL 聚丙烯锥形管 | Falcon | 352070 | |
| 琼脂糖 | Sigma | A9539-500g | |
| 生物分析仪(Bioanalyzer) | Agilent | G2939BA | |
| 细胞刮刀 - 25 cm 手柄,3.0 cm 刀片 | Falcon | 353089 | |
| CHIR99021 | Axon Medchem BV | Axon 1386 | |
| cOmplete Mini 蛋白酶抑制剂混合物(无EDTA) | Merck | 11836170001 | |
| Countess 细胞计数板载玻片 | Invitrogen | C10228 | |
| Countess II FL | Invitrogen | ZGEXSCCOUNTESS2FL | 全自动细胞计数仪 |
| Covaris S2 | Covaris | 500217 | 超声破碎仪 |
| DNA LoBind 管,1.5 mL | Eppendorf | 30108051 | |
| DpnII(50000 单位/mL) | New England Biolabs | R0543M | |
| 杜尔贝科改良伊格尔培养基(DMEM) | Merck | D6429 | |
| 乙醇(100%) | Merck | 1.00983.2500 | |
| 胎牛血清(FBS) | Thermo Scientific | 10270106 | |
| 猪皮明胶 | Sigma | G1890 | |
| GeneRuler 1 kb Plus DNA Marker | Thermo Scientific | SM0313 | |
| GlycoBlue | Thermo Scientific | AM9516 | 共沉淀剂 |
| 高灵敏度 Bioanalyzer 芯片 | Agilent | 5067-4626 | |
| 大型冷冻离心机 5920 R | Eppendorf | 5948000018 | |
| 白血病抑制因子(LIF) | Merck | ESG1107 | |
| Liquiport | KNF | NF300 | 台式抽吸系统 |
| 低吸附滤芯吸头 | Biozym | VT0260U, VT0240, VT0220, VT0200U | |
| 分子生物学级水 | Merck | W3500-6x500ML | |
| Next Seq 500 | Illumina | SY-415-1001 | |
| Next Seq 500 高输出 v2 试剂盒(300 个循环) | Illumina | FC-404-2004 | |
| Nonidet P40 替代物(NP40) | Merck | 11332473001 | |
| PD0325901 | Axon Medchem BV | Axon 1408 | |
| 蛋白酶抑制剂混合物(无EDTA) | Merck | 11873580001 | |
| 蛋白酶K - 重组,PCR级(20 mg/mL) | Thermo Scientific | EO0491 | |
| Qubit 2.0 | Thermo Scientific | Q32871 | |
| Qubit 检测管 | Thermo Scientific | Q32856 | |
| Qubit dsDNA 高灵敏度检测试剂盒 | Thermo Scientific | Q32851 | |
| RNase A(10 mg/mL) | Thermo Scientific | EN0531 | |
| 乙酸钠 pH 5.2(3 M) | Merck | S7899 | |
| 真空离心浓缩仪 | Eppendorf | EP5305000100-1EA | |
| Agencourt AMPureXP | Beckman Coulter | A63881 | SPRI 磁珠 |
| SureSelect 靶向富集试剂盒 1 | Agilent | 5190-8645 | |
| SureSelect 靶向富集试剂盒 ILM 索引杂交模块 2 | Agilent | 5190-4455 | |
| SureSelect XT 文库制备试剂盒 ILM | Agilent | 5500-0132 | |
| T4 连接酶(30 单位/µL) | Thermo Scientific | EL0013 | |
| 台式离心机 5427 R | Eppendorf | 5409000012 | |
| Triton-X-100(500 mL) | Merck | X100-500ML | |
| 台盼蓝 | Invitrogen | T10282 | |
| 胰蛋白酶 | Thermo Scientific | 25300054 | |
| UltraPure 甘氨酸 | Thermo Scientific | 15527013 | |
| β-巯基乙醇 | Thermo Scientific | 31350010 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可