$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Il protocollo Capture Hi-C descritto si basa sulla preparazione del modello 3C genome-wide utilizzando un cutter a quattro basi (DpnII). Il successivo arricchimento dei frammenti di legatura attraverso la regione genomica di interesse è ottenuto mediante ibridazione di una serie di sonde di RNA piastrellate e la loro cattura basata sulla streptavidina secondo il sistema di arricchimento target utilizzato in questo studio (Figura 1). Le sonde di RNA biotinilato sono state selezionate in quanto mostrano un'affinità di legame più stretta ai loro bersagli rispetto alle sonde di DNA52,60. Le librerie acquisite vengono quindi indicizzate e raggruppate per la sequenziazione multiplex a throughput elevato. I dati Hi-C di acquisizione possono essere visualizzati come mappe di interazione Hi-C ad alta risoluzione, ma anche come mappe di contatto a punto di vista singolo simili a 4C per visualizzare in modo specifico le interazioni di sequenze più piccole come promotori o potenziatori all'interno dell'intera regione acquisita. Il flusso di lavoro del protocollo è illustrato nella Figura 4. I controlli di qualità pre-sequenziamento sono mostrati nella Figura 2 e includono la valutazione della corretta digestione e re-ligazione del modello 3C e la sua efficiente suddivisione e purificazione nelle diverse fasi del protocollo. Il DNA modello 3C tranciato dovrebbe funzionare tra 150 e 700 bp e non dovrebbe essere rilevato alcun arricchimento di frammenti >2 kb. Durante le fasi successive, vengono eseguite diverse fasi di pulizia del DNA basate su perline e selezione delle dimensioni, prima dopo la tosatura, poi dopo le PCR pre-cattura e post-cattura. Le librerie pulite mostrano un profilo di arricchimento dei frammenti distinto come visualizzato su un bioanalizzatore di DNA ad alta sensibilità (Figura 2). La dimensione media dei frammenti aumenta nel corso della preparazione della libreria a causa della legatura degli adattatori, del sequenziamento e dei primer di indicizzazione. I controlli di qualità post-sequenziamento sono ottenuti tramite Hi-C Pro e mostrati nella Figura 3. Sono state proposte molte diverse applicazioni software bioinformatiche per l'elaborazione e l'analisi dei dati simili a 3C. Tra questi, la pipeline HiC-Pro è una delle soluzioni più popolari, consentendo l'elaborazione di dati di sequenziamento grezzi alle mappe di contatto finali a varie risoluzioni55. HiC-Pro utilizza una strategia di mappatura in due fasi per allineare le letture di sequenziamento sul genoma di riferimento. I prodotti 3C vengono quindi ricostruiti e filtrati per rimuovere coppie di contatti non informative e generare le mappe dei contatti. Inoltre, è in grado di utilizzare un elenco di polimorfismi noti per eseguire analisi allele-specifiche e per separare i contatti provenienti dai due alleli parentali in mappe di contatto distinte. Più recentemente, HiC-Pro è stato incluso ed esteso nel framework nf-core (nf-core-hic), fornendo una pipeline altamente scalabile e riproducibile guidata dalla comunità61,62.
Per catturare il topo Xic, è stato progettato un array di 28.913 sonde di RNA che piastrellano 3 Mb del cromosoma X. Questa regione include l'attore chiave in XCI, il gene lungo non codificante Xist, e il suo noto panorama normativo di ~ 800 kb (Figura 5). Questa regione ~800 kb è partizionata in due TAD: uno che include il promotore Xist e i suoi regolatori positivi noti (cioè i trascritti non codificanti Ftx, Jpx e Xert e il gene codificante la proteina Rnf12), e il TAD vicino che comprende i regolatori cis negativi di Xist (cioè il suo trascritto antisenso Tsix, l'elemento enhancer Xite e il trascritto non codificante Linx) (per la revisione44, 45).
Applicando il protocollo Capture Hi-C descritto allo Xic, l'organizzazione topologica di questo locus è stata ottenuta con una risoluzione senza precedenti (Figura 6 e Figura 7). Ciò è particolarmente evidente quando si confronta il profilo Capture Hi-C con 5C47 pubblicato in precedenza (Figura 6 e Figura 7; Tabella supplementare 1) e Hi-C61 (Figura 6 e Figura 7; Tabella supplementare 1) Profili. Ad esempio, le strutture sub-TAD sono più evidenti: il TAD contenente il promotore Xist ( Xist-TAD ) è chiaramente suddiviso in due domini più piccoli (Figura 6A, punta di freccia blu). In precedenza, questo poteva essere solo visivamente "indovinato" dal profilo 5C (Figura 6B), sebbene il rilevamento di un confine in questa regione utilizzando l'algoritmo del punteggio di isolamento. Allo stesso modo, la risoluzione del profilo Capture Hi-C consente l'identificazione di due domini più piccoli nel TAD vicino (Figura 6A, B), che contiene il promotore del locus Tsix ( Tsix-TAD ); questo non è stato precedentemente raggiunto con 5C (Figura 6B). Da notare che i confini topologici determinati dal punteggio di isolamento dai dati Capture Hi-C e 5C vengono generalmente rilevati in posizioni leggermente diverse e con diversi punti di forza relativi.
Inoltre, altre strutture sub-TAD come i loop di contatto sono chiaramente visibili dai dati di Capture Hi-C, come il loop tra Xist e Ftx (Figura 7A), precedentemente identificato con Capture-C63, e il loop tra Xist e Xert (Figura 7B), recentemente identificato utilizzando un protocollo simile per Capture Hi-C48. Altri contatti possono anche essere mappati in modo più preciso grazie alla maggiore risoluzione dei profili Capture Hi-C, come quelli che formano gli hotspot di contatto noti all'interno del Tsix-TAD tra i loci Linx, Chic1 e Xite (Figura 7A).
Rispetto ai dati Hi-C mostrati nella Figura 7, Capture Hi-C ha permesso un aumento di quattro volte della risoluzione, ma ha richiesto solo un quarto della profondità di sequenziamento (cioè 126 M letture contro 571 M) (Tabella supplementare 1). Questo aumento della risoluzione consente il rilevamento di subTAD e interazioni cicliche che non possono essere rilevate da Hi-C alla profondità di sequenziamento mostrata in Figura 6 e Figura 7. Il protocollo descritto per Capture Hi-C consente quindi una caratterizzazione molto più dettagliata e ad alta risoluzione di una grande regione genomica di interesse, rispetto agli approcci precedenti.

Figura 1: Progettazione della sonda. Rappresentazione schematica della strategia utilizzata per la progettazione della sonda. Le regioni di 300 bp a monte e a valle di ciascun sito di restrizione DpnII attraverso la regione target di 3 Mb sono state selezionate e affiancate con sonde di RNA biotinilato sovrapposte. Viene mostrata una di queste regioni selezionate, chrX: 102.474.805-102.475.500. Non sono consentite più di 40 basi di sequenze ripetitive in ogni sonda. Fare clic qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Acquisizione dei controlli di qualità di pre-sequenziamento Hi-C. (A) Esempio rappresentativo di controlli di qualità del modello 3C. 200 ng di DNA sono stati caricati su un gel di agarosio all'1%. Corsia 1: scala da 1 kb. Corsia 2: La cromatina non digerita, reticolata e intatta corre come una banda affilata a >10 kb. Corsia 3: la cromatina reticolata digerita con DpnII funziona come uno striscio di dimensioni comprese tra 1 kb e 3 kb. Corsia 4: libreria o modello 3C finale; le estremità libere dei frammenti di DNA reticolato digeriti vengono ri-legate. Lo striscio di DNA di dimensioni molecolari inferiori è quasi impercettibile e il prodotto di legatura viene rilevato come una banda di >10 kb. (B) Esempi rappresentativi di profili DNA di bioanalizzatori ad alta sensibilità. In alto a sinistra: libreria 3C tagliata con successo che mostra una distribuzione della dimensione del frammento tra 150 bp e 700 bp. In alto a destra: libreria 3C tranciata insoddisfacente. Il DNA non tagliato viene rilevato come ampio arricchimento di frammenti >2 kb. (C) In basso a sinistra: campione di DNA tranciato a seguito di una selezione 1:1 delle dimensioni del lato sinistro utilizzando perline SPRI. Frammenti di ~ 300 bp sono arricchiti. In basso al centro: profilo PCR pre-acquisizione dopo la legatura degli adattatori accoppiati secondo il protocollo del produttore. In basso a destra: libreria finale Capture Hi-C che include adattatori, sequenziamento e primer di indicizzazione per il sequenziamento multiplexato. Abbreviazioni: bp = coppie di basi, FU = unità di fluorescenza arbitraria. Fare clic qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Acquisizione di controlli di qualità post-sequenziamento Hi-C con HiC-Pro . (A) Esempio di velocità di mappatura sul genoma di riferimento per il primo ufficiale delle coppie di sequenziamento. La frazione azzurra rappresenta le letture allineate da HiC-Pro e che attraversano una giunzione di legatura. Questa metrica può quindi essere utilizzata per convalidare la fase sperimentale di legatura. (B) Una volta che i compagni di sequenziamento sono allineati sul genoma, solo le coppie di lettura allineate in modo univoco vengono conservate per l'analisi. (C) Le coppie non valide (in rosso) come l'estremità penzolante, l'autocerchio o la legatura vengono scartate dall'analisi. La frazione di coppie valide è un buon indicatore dell'efficienza di legatura e pull-down. (D) Le coppie valide possono essere ulteriormente suddivise in contatti intra/intercromosomici e contatti a corto/lungo raggio. Le coppie di lettura duplicate che potrebbero rappresentare artefatti PCR vengono eliminate dall'analisi. (E) Per l'analisi allele-specifica, HiC-Pro riporta il numero di letture alleliche supportate da uno o due compagni per ciascun genoma parentale (cioè C57BL / 6J x CASTEi / J). Sono attese la stessa frazione di letture assegnate all'allele materno e paterno. (F) Infine, vengono selezionate solo coppie valide che si sovrappongono alla regione di acquisizione per costruire le mappe di contatto. Le coppie acquisizione-acquisizione rappresentano i contatti all'interno della regione di destinazione, mentre le coppie acquisizione-reporter implicano l'interazione tra la regione di destinazione e una fuori bersaglio. Fare clic qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Flusso di lavoro del protocollo Capture Hi-C. Rappresentazione schematica di diversi passaggi del protocollo. Per generare il modello 3C dell'intero genoma, la cromatina viene prima reticolata con la formaldeide e poi digerita con l'enzima di restrizione DpnII. Le estremità libere del DNA vengono quindi ri-legate, la reticolazione viene invertita e il DNA viene purificato. Per arricchire i frammenti che comprendono la regione bersaglio, una serie di sonde di RNA biotinilato viene ibridata al modello 3C e catturata mediante pull-down mediato dalla streptavidina. Le librerie di acquisizione vengono elaborate per il sequenziamento multiplex e i frammenti di legatura validi vengono quantificati per dedurre la frequenza dei contatti della cromatina attraverso il bersaglio, che vengono visualizzati come mappe di interazione ad alta risoluzione. Fare clic qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Panoramica della regione che comprende lo Xic sul cromosoma X del topo. Rappresentazione schematica del cromosoma X del topo e zoom della regione catturata di 3 Mb (ChrX: 102.475.000-105.475.000). La regione bersaglio include ~ 800 kb di DNA corrispondente allo Xic, il locus regolatore principale di XCI. Xic include i lunghi geni non codificanti, Xist, un attore chiave di XCI, e il suo panorama regolatorio. I regolatori positivi di Xist sono mostrati in verde e i regolatori negativi in viola. Fare clic qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Acquisizione di mappe di interazione Hi-C, 5C e Hi-C nella regione catturata di 3 Mb. (A) Cattura la mappa di interazione Hi-C del target da 3 Mb che comprende il mouse Xic con una risoluzione di 10 kb (questo studio). (B) Mappa di interazione 5C della stessa regione target di A con risoluzione di 6 kb (dati rielaborati da47). Le regioni ripetitive non incluse nelle analisi sono mascherate in bianco. I dati 5C richiedono una propria elaborazione bioinformatica (cfr.47). Dopo la pulizia e l'allineamento, le mappe 5C alla risoluzione di primer vengono binned utilizzando una mediana corrente (finestra = 30 kb, passo = 5) per raggiungere una risoluzione finale di 6 kb. (C) Mappa di interazione Hi-C della stessa regione genomica di A e B con risoluzione di 40 kb (dati rielaborati da64). Tutte le mappe di interazione sono state generate da ESC del mouse. Il punteggio di isolamento è stato calcolato utilizzando cooltools ed è rappresentato come istogrammi con minimi di isolamento ai confini TAD. I confini TAD sono mostrati come linee verticali sotto la mappa. L'altezza di ogni linea indica la resistenza al limite. I geni sono mostrati come frecce che puntano nella direzione della trascrizione. I confini sub-TAD rilevati esclusivamente o più precisamente nelle mappe Capture Hi-C sono indicati da punte di freccia magenta e blu per i sub-TAD rispettivamente nei TAD Tsix e Xist. Fare clic qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Cattura di mappe di interazione Hi-C, 5C e Hi-C su 1 Mb all'interno della regione acquisita. (A) Capture Hi-C interaction map della regione genomica di 1 Mb comprendente il topo Xic con una risoluzione di 5 kb (questo studio). (B) Mappa di interazione 5C della stessa regione genomica di cui ad A. con risoluzione di 6 KB (dati rielaborati da47). Le regioni ripetitive non incluse nelle analisi sono mascherate in bianco. Da notare che i dati 5C richiedono una propria elaborazione bioinformatica (cfr.47). Dopo la pulizia e l'allineamento, le mappe 5C alla risoluzione di primer vengono binned utilizzando una mediana corrente (finestra = 30 kb, passo = 5) per raggiungere una risoluzione finale di 6 kb. (C) Mappa di interazione Hi-C della stessa regione genomica di A e B di Hi-C con risoluzione di 20 kb (dati rielaborati da64). Tutte le mappe di interazione sono state generate da mESC. Il punteggio di isolamento è stato calcolato utilizzando cooltools ed è rappresentato come istogrammi con minimi di isolamento ai confini TAD. I confini TAD sono mostrati come linee verticali sotto la mappa. L'altezza di ogni linea indica la resistenza al limite. I geni sono mostrati come frecce che indicano la direzione della trascrizione. I loop di contatto rilevati esclusivamente o più precisamente in Capture Hi-C sono indicati da magenta e asterischi blu per i loop rispettivamente nei TAD Tsix e Xist. Fare clic qui per visualizzare una versione ingrandita di questa figura.
Tabella supplementare 1: Statistiche post-sequenziamento per i set di dati utilizzati in questo manoscritto: Capture Hi-C (questo studio), Hi-C64 e 5C47. Clicca qui per scaricare questo file.