Het beschreven Capture Hi-C-protocol is gebaseerd op de voorbereiding van het genoombrede 3C-sjabloon met behulp van een vier-base cutter (DpnII). De daaropvolgende verrijking van ligatiefragmenten over het genomische gebied van belang wordt verkregen door hybridisatie van een reeks betegelde RNA-sondes en hun op streptavidin gebaseerde vangst volgens het doelverrijkingssysteem dat in deze studie wordt gebruikt (figuur 1). Gebiotinyleerde RNA-sondes werden geselecteerd omdat ze een nauwere bindingsaffiniteit vertonen met hun doelen in vergelijking met DNA-sondes52,60. Vastgelegde bibliotheken worden vervolgens geïndexeerd en gepoold voor multiplexed high-throughput sequencing. Capture Hi-C-gegevens kunnen worden gevisualiseerd als Hi-C-interactiekaarten met hoge resolutie, maar ook als 4C-achtige single view-point contactkaarten om specifiek de interacties van kleinere sequenties zoals promotors of versterkers binnen het hele vastgelegde gebied te visualiseren. De workflow van het protocol is weergegeven in figuur 4. Pre-sequencing kwaliteitscontroles zijn weergegeven in figuur 2 en omvatten de beoordeling van de juiste vertering en herligatie van de 3C-sjabloon en de efficiënte afschuiving en zuivering ervan in de verschillende stappen van het protocol. Het geschoren 3C-sjabloon-DNA zal naar verwachting tussen 150 en 700 bp lopen en er mag geen verrijking van fragmenten >2 kb worden gedetecteerd. Tijdens de volgende stappen worden verschillende op kralen gebaseerde DNA-opschonings- en grootteselectiestappen uitgevoerd, eerst na het scheren, vervolgens na de PCR's vóór en na de vangst. Gereinigde bibliotheken tonen een duidelijk fragmentverrijkingsprofiel zoals gevisualiseerd op een hooggevoelige DNA-bioanalysator (figuur 2). De gemiddelde fragmentgrootte neemt toe in de loop van de bibliotheekvoorbereiding als gevolg van de ligatie van adapters, sequencing en indexeringsprimers. Post-sequencing kwaliteitscontroles worden verkregen via Hi-C Pro en weergegeven in figuur 3. Veel verschillende bioinformatica software toepassingen zijn voorgesteld voor 3C-achtige gegevensverwerking en -analyse. Onder hen is de HiC-Pro-pijplijn een van de meest populaire oplossingen, waardoor onbewerkte sequencinggegevens kunnen worden verwerkt tot de uiteindelijke contactkaarten met verschillende resoluties55. HiC-Pro maakt gebruik van een tweestaps mappingstrategie om de sequencing reads af te stemmen op het referentiegenoom. De 3C-producten worden vervolgens gereconstrueerd en uitgefilterd om niet-informatieve contactparen te verwijderen en de contactkaarten te genereren. Bovendien is het in staat om een lijst met bekende polymorfismen te gebruiken om allelspecifieke analyse uit te voeren en om de contacten afkomstig van de twee ouderlijke allelen in verschillende contactkaarten te scheiden. Meer recent is HiC-Pro opgenomen en uitgebreid in het nf-core framework (nf-core-hic), waardoor een zeer schaalbare en reproduceerbare community-driven pipeline61,62 wordt geboden.
Om de xic van de muis vast te leggen, werd een array van 28.913 RNA-sondes ontworpen die 3 Mb van het X-chromosoom betegelen. Deze regio omvat de belangrijkste speler in XCI, het lange niet-coderende gen Xist, en het bekende ~ 800 kb regulerende landschap (figuur 5). Dit ~ 800 kb-gebied is verdeeld in twee TAD's: één inclusief de Xist-promotor en zijn bekende positieve regulatoren (d.w.z. de niet-coderende transcripten Ftx, Jpx en Xert en het eiwitcoderende gen Rnf12), en de naburige TAD die de negatieve cis-regulatoren van Xist omvat (d.w.z. zijn antisense-transcript Tsix, het versterkerelement Xite en het niet-coderende transcript Linx) (voor beoordeling44,45).
Door het beschreven Capture Hi-C protocol toe te passen op de Xic werd de topologische organisatie van deze locus verkregen met een ongekende resolutie (Figuur 6 en Figuur 7). Dit is vooral duidelijk wanneer het Capture Hi-C-profiel wordt vergeleken met eerder gepubliceerde 5C47 (figuur 6 en figuur 7; Aanvullende tabel 1) en Hi-C61 (figuur 6 en figuur 7; Aanvullende tabel 1) Profielen. Sub-TAD-structuren zijn bijvoorbeeld duidelijker - de TAD met de Xist-promotor ( Xist-TAD ) is duidelijk onderverdeeld in twee kleinere domeinen (figuur 6A, blauwe pijlpunt). Voorheen kon dit alleen visueel worden "geraden" uit het 5C-profiel (figuur 6B), zij het de detectie van een grens in dit gebied met behulp van het isolatiescore-algoritme. Evenzo maakt de resolutie van het Capture Hi-C-profiel de identificatie mogelijk van twee kleinere domeinen in de naburige TAD (figuur 6A, B), die de promotor van de Tsix-locus ( Tsix-TAD ) bevat; dit werd eerder niet bereikt met 5C (figuur 6B). Van belang is dat topologische grenzen die worden bepaald door de isolatiescore van de Capture Hi-C- en 5C-gegevens over het algemeen worden gedetecteerd op enigszins verschillende locaties en met verschillende relatieve sterktes.
Bovendien zijn andere sub-TAD-structuren zoals contactlussen duidelijk zichtbaar in de Capture Hi-C-gegevens, zoals de lus tussen Xist en Ftx (figuur 7A), eerder geïdentificeerd met Capture-C63, en de lus tussen Xist en Xert (figuur 7B), onlangs geïdentificeerd met behulp van een vergelijkbaar protocol voor Capture Hi-C48. Andere contacten kunnen ook nauwkeuriger in kaart worden gebracht door de verhoogde resolutie van de Capture Hi-C-profielen, zoals die welke de bekende contacthotspots vormen binnen de Tsix-TAD tussen de Linx-, Chic1- en Xite-loci (figuur 7A).
In vergelijking met de Hi-C-gegevens in figuur 7 zorgde Capture Hi-C voor een viervoudige toename van de resolutie, maar het vereiste slechts een vierde van de sequencingdiepte (d.w.z. 126 M leest versus 571 M) (aanvullende tabel 1). Deze toename in resolutie maakt de detectie mogelijk van subTADs en looping-interacties die niet door Hi-C konden worden gedetecteerd op de sequencingdiepte die wordt weergegeven in figuur 6 en figuur 7. Het beschreven protocol voor Capture Hi-C maakt dus een veel gedetailleerdere karakterisering met hoge resolutie van een groot genomisch gebied van belang mogelijk, in vergelijking met eerdere benaderingen.

Figuur 1: Sondeontwerp. Schematische weergave van de strategie die wordt gebruikt voor het ontwerp van de sonde. Regio's van 300 bp stroomopwaarts en stroomafwaarts van elke DpnII-beperkingslocatie in het doelgebied van 3 Mb werden geselecteerd en betegeld met overlappende gebiotinyleerde RNA-sondes. Een van deze geselecteerde regio's wordt getoond, chrX: 102.474.805-102.475.500. Niet meer dan 40 basen van repetitieve sequenties zijn toegestaan in elke sonde. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Hi-C pre-sequencing kwaliteitscontroles vastleggen . (A) Representatief voorbeeld van kwaliteitscontroles van 3C-sjablonen. 200 ng DNA werd geladen op een 1% agarose gel. Baan 1: 1 kb ladder. Baan 2: Onverteerd, verknoopt en intact chromatine loopt als een scherpe band op >10 kb. Baan 3: DpnII-verteerd cross-linked chromatine loopt als een uitstrijkje tussen 1 kb en 3 kb groot. Baan 4: Laatste 3C-bibliotheek of -sjabloon; vrije uiteinden van verteerde verknoopte DNA-fragmenten worden opnieuw geligeerd. Het DNA-uitstrijkje van lagere moleculaire grootte is bijna niet detecteerbaar en het ligatieproduct wordt gedetecteerd als een band van > 10 kb. (B) Representatieve voorbeelden van hooggevoelige bioanalysator-DNA-profielen. Linksboven: succesvol geschoren 3C-bibliotheek met een verdeling van fragmentgrootte tussen 150 bp en 700 bp. Rechtsboven: onbevredigende geschoren 3C-bibliotheek. Ongehoord DNA wordt gedetecteerd als brede verrijking van fragmenten >2 kb. (C) Linksonder: geschoren DNA-monster na een selectie van 1:1 linkerzijde met behulp van SPRI-kralen. Fragmenten van ~300 bp worden verrijkt. Middenonder: Pcr-profiel vooraf vastleggen na ligatie van gekoppelde adapters volgens het protocol van de fabrikant. Rechtsonder: definitieve Capture Hi-C-bibliotheek inclusief adapters, sequencing en indexeringsprimers voor multiplexed sequencing. Afkortingen: bp = baseparen, FU = willekeurige fluorescentie-eenheid. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Leg Hi-C post-sequencing kwaliteitscontroles vast met HiC-Pro . (A) Voorbeeld van mapping rate op het referentiegenoom voor de eerste mate van de sequencingparen. De lichtblauwe fractie vertegenwoordigt de waarden die door HiC-Pro zijn uitgelijnd en een ligatiekruising overspannen. Deze metriek kan dus worden gebruikt om de experimentele ligatiestap te valideren. (B) Zodra sequencing mates zijn uitgelijnd op het genoom, worden alleen uniek uitgelijnde leesparen bewaard voor analyse. (C) Niet-geldige paren (in rood) zoals bungelende uiteinden, zelfcirkels of herligatie worden uit de analyse verwijderd. De fractie van geldige paren is een goede indicator van de ligatie en pull-down efficiëntie. (D) De geldige paren kunnen verder worden onderverdeeld in intra-/interchromosomale en korte/lange-afstandscontacten. Gedupliceerde leesparen die waarschijnlijk PCR-artefacten vertegenwoordigen, worden uit de analyse verwijderd. (E) Voor allel-specifieke analyse rapporteert HiC-Pro het aantal allelische reads ondersteund door een of twee partners voor elk ouderlijk genoom (d.w.z. C57BL / 6J x CASTEi / J). Dezelfde fractie van de lezingen toegewezen aan het moederlijke en vaderlijke allel wordt verwacht. (F) Ten slotte worden alleen geldige paren geselecteerd die het opnamegebied overlappen om de contactkaarten te maken. Capture-capture-paren vertegenwoordigen contacten binnen het beoogde gebied, terwijl capture-reporter-paren interactie tussen de beoogde regio en een off-target regio omvatten. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Workflow van het Capture Hi-C-protocol. Schematische weergave van verschillende protocolstappen. Om de genoombrede 3C-sjabloon te genereren, wordt chromatine eerst verknoopt met formaldehyde en vervolgens verteerd met het DpnII-restrictie-enzym. Vrije DNA-uiteinden worden dan opnieuw geligeerd, cross-linking wordt omgekeerd en DNA wordt gezuiverd. Om fragmenten die het doelgebied omvatten te verrijken, wordt een reeks gebiotinyleerde RNA-sondes gehybridiseerd naar de 3C-sjabloon en gevangen door streptavidin-gemedieerde pull-down. Capture-bibliotheken worden verwerkt voor multiplexed sequencing en geldige ligatiefragmenten worden gekwantificeerd om de frequentie van chromatinecontacten over het doel af te leiden, die worden gevisualiseerd als interactiekaarten met hoge resolutie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Overzicht van het gebied dat de Xic op het X-chromosoom van de muis omvat. Schematische weergave van het X-chromosoom van de muis en inzoomen van het 3 Mb vastgelegde gebied (ChrX: 102.475.000-105.475.000). Het beoogde gebied bevat ~800 kb DNA dat overeenkomt met de Xic, de master regulatory locus van XCI. De Xic bevat de lange niet-coderende genen, Xist, een belangrijke speler van XCI, en zijn regelgevende landschap. Positieve regulatoren van Xist worden weergegeven in het groen en negatieve regulatoren in paars. Klik hier om een grotere versie van deze figuur te bekijken.

Afbeelding 6: Leg Hi-C-, 5C- en Hi-C-interactiekaarten vast in het vastgelegde gebied van 3 Mb. (A) Leg Hi-C-interactiekaart vast van het 3 Mb-doel dat de muis Xic omvat met een resolutie van 10 kb (deze studie). (B) 5C-interactiekaart van hetzelfde doelgebied als in A met een resolutie van 6 kb (gegevens opnieuw verwerkt vanaf47). Repetitieve gebieden die niet in de analyses zijn opgenomen, worden in het wit gemaskeerd. De 5C-gegevens vereisen hun eigen bioinformatica-verwerking (zie47). Na het reinigen en uitlijnen worden de 5C-kaarten met de primerresolutie in de prullenbak gegooid met behulp van een lopende mediaan (venster = 30 kb, stap = 5) om een uiteindelijke resolutie van 6 kb te bereiken. (C) Hi-C-interactiekaart van hetzelfde genomische gebied als in A en B met een resolutie van 40 kb (gegevens opnieuw verwerkt vanaf64). Alle interactiekaarten zijn gegenereerd op basis van muis-SER's. De isolatiescore is berekend met behulp van cooltools en wordt weergegeven als histogrammen met isolatieminima's aan TAD-grenzen. TAD-grenzen worden weergegeven als verticale lijnen onder de kaart. De hoogte van elke lijn geeft de grenssterkte aan. Genen worden weergegeven als pijlen die in de richting van transcriptie wijzen. Sub-TAD-grenzen die uitsluitend of nauwkeuriger worden gedetecteerd in Capture Hi-C-kaarten worden aangegeven met magenta en blauwe pijlpunten voor sub-TAD's in respectievelijk de Tsix- en Xist-TAD's. Klik hier om een grotere versie van deze figuur te bekijken.

Afbeelding 7: Leg Hi-C-, 5C- en Hi-C-interactiekaarten vast over 1 Mb binnen het vastgelegde gebied. (A) Leg Hi-C-interactiekaart vast van het 1 Mb genomische gebied dat de muis Xic omvat met een resolutie van 5 kb (deze studie). (B) 5C-interactiekaart van hetzelfde genomische gebied als in A. bij een resolutie van 6 kB (gegevens opnieuw verwerkt vanaf47). Repetitieve gebieden die niet in de analyses zijn opgenomen, worden in het wit gemaskeerd. Van belang is dat de 5C-gegevens hun eigen bioinformatica-verwerking vereisen (zie47). Na het reinigen en uitlijnen worden de 5C-kaarten met de primerresolutie in de prullenbak gegooid met behulp van een lopende mediaan (venster = 30 kb, stap = 5) om een uiteindelijke resolutie van 6 kb te bereiken. (C) Hi-C-interactiekaart van hetzelfde genomische gebied als in A en B van Hi-C met een resolutie van 20 kb (gegevens opnieuw verwerkt vanaf64). Alle interactiekaarten zijn gegenereerd vanuit mESC's. De isolatiescore is berekend met behulp van cooltools en wordt weergegeven als histogrammen met isolatieminima's aan TAD-grenzen. TAD-grenzen worden weergegeven als verticale lijnen onder de kaart. De hoogte van elke lijn geeft de grenssterkte aan. Genen worden weergegeven als pijlen die wijzen naar de richting van transcriptie. Contactlussen die uitsluitend of nauwkeuriger worden gedetecteerd in Capture Hi-C worden aangegeven met magenta en blauwe sterretjes voor lussen in respectievelijk de Tsix en Xist TAD's. Klik hier om een grotere versie van deze figuur te bekijken.
Aanvullende tabel 1: Post-sequencing statistieken voor de datasets gebruikt in dit manuscript: Capture Hi-C (deze studie), Hi-C64, en 5C47. Klik hier om dit bestand te downloaden.