$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El protocolo Capture Hi-C descrito se basa en la preparación de la plantilla 3C de todo el genoma utilizando un cortador de cuatro bases (DpnII). El enriquecimiento posterior de fragmentos de ligadura a través de la región genómica de interés se obtiene mediante la hibridación de una matriz de sondas de ARN de mosaico y su captura basada en estreptavidina de acuerdo con el sistema de enriquecimiento objetivo utilizado en este estudio (Figura 1). Se seleccionaron sondas de ARN biotiniladas ya que muestran una afinidad de unión más estrecha a sus objetivos en comparación con las sondas de ADN52,60. Las bibliotecas capturadas se indexan y agrupan para una secuenciación multiplexada de alto rendimiento. Los datos de captura de Hi-C se pueden visualizar como mapas de interacción Hi-C de alta resolución, pero también como mapas de contacto de punto de vista único similares a 4C para visualizar específicamente las interacciones de secuencias más pequeñas, como promotores o potenciadores, dentro de toda la región capturada. El flujo de trabajo del protocolo se muestra en la figura 4. Los controles de calidad previos a la secuenciación se muestran en la Figura 2 e incluyen la evaluación de la digestión y religación adecuadas de la plantilla 3C y su cizallamiento y purificación eficientes en los diferentes pasos del protocolo. Se espera que el ADN de la plantilla 3C cortado funcione entre 150 y 700 pb, y no se debe detectar ningún enriquecimiento de fragmentos >2 kb. Durante los siguientes pasos, se realizan varios pasos de limpieza y selección de tamaño de ADN basados en perlas, primero después del cizallamiento, luego después de las PCR previas y posteriores a la captura. Las bibliotecas limpias muestran un perfil de enriquecimiento de fragmentos distinto como se visualiza en un bioanalizador de ADN de alta sensibilidad (Figura 2). El tamaño medio del fragmento aumenta en el transcurso de la preparación de la biblioteca debido a la ligadura de adaptadores, secuenciación e indexación de cebadores. Los controles de calidad posteriores a la secuenciación se obtienen a través de Hi-C Pro y se muestran en la Figura 3. Se han propuesto muchas aplicaciones de software bioinformático diferentes para el procesamiento y análisis de datos similares a 3C. Entre ellas, el pipeline HiC-Pro es una de las soluciones más populares, permitiendo el procesamiento de datos de secuenciación sin procesar a los mapas de contacto finales en varias resoluciones55. HiC-Pro utiliza una estrategia de mapeo de dos pasos para alinear las lecturas de secuenciación en el genoma de referencia. Los productos 3C se reconstruyen y filtran para eliminar pares de contactos no informativos y generar los mapas de contacto. Además, es capaz de utilizar una lista de polimorfismos conocidos para realizar análisis alelo-específicos y separar los contactos procedentes de los dos alelos parentales en distintos mapas de contacto. Más recientemente, HiC-Pro se ha incluido y extendido al marco nf-core (nf-core-hic), proporcionando una canalización impulsada por la comunidad altamente escalable y reproducible61,62.
Para capturar el ratón Xic, se diseñó una matriz de 28.913 sondas de ARN en mosaico de 3 Mb del cromosoma X. Esta región incluye el jugador clave en XCI, el gen largo no codificante Xist, y su conocido panorama regulatorio de ~800 kb (Figura 5). Esta región de ~800 kb se divide en dos TAD: uno que incluye el promotor Xist y sus reguladores positivos conocidos (es decir, las transcripciones no codificantes Ftx, Jpx y Xert y el gen codificador de proteínas Rnf12), y el TAD vecino que abarca los reguladores cis negativos de Xist (es decir, su transcripción antisentido Tsix, el elemento potenciador Xite y la transcripción no codificante Linx) (para la revisión44, 45).
Al aplicar el protocolo Capture Hi-C descrito al Xic, la organización topológica de este locus se obtuvo a una resolución sin precedentes (Figura 6 y Figura 7). Esto es particularmente claro cuando se compara el perfil Capture Hi-C con 5C47 publicado anteriormente (Figura 6 y Figura 7; Cuadro complementario 1) y Hi-C61 (Figura 6 y Figura 7; Cuadro complementario 1) Perfiles. Por ejemplo, las estructuras sub-TAD son más evidentes: el TAD que contiene el promotor Xist ( Xist-TAD ) se subdivide claramente en dos dominios más pequeños (Figura 6A, punta de flecha azul). Anteriormente, esto solo se podía "adivinar" visualmente a partir del perfil 5C (Figura 6B), aunque la detección de un límite en esta región utilizando el algoritmo de puntuación de aislamiento. Asimismo, la resolución del perfil Capture Hi-C permite la identificación de dos dominios más pequeños en el TAD vecino (Figura 6A, B), que contiene el promotor del locus Tsix (Tsix-TAD ); esto no se lograba anteriormente con 5C (Figura 6B). Cabe destacar que los límites topológicos determinados por la puntuación de aislamiento de los datos Capture Hi-C y 5C generalmente se detectan en ubicaciones ligeramente diferentes y con diferentes resistencias relativas.
Además, otras estructuras sub-TAD como los bucles de contacto son claramente visibles a partir de los datos de Capture Hi-C, como el bucle entre Xist y Ftx (Figura 7A), previamente identificado con Capture-C63, y el bucle entre Xist y Xert (Figura 7B), recientemente identificado utilizando un protocolo similar para Capture Hi-C48. Otros contactos también se pueden mapear con mayor precisión debido a la mayor resolución de los perfiles Capture Hi-C, como los que forman los puntos de contacto conocidos dentro del Tsix-TAD entre los loci Linx, Chic1 y Xite (Figura 7A).
En comparación con los datos de Hi-C que se muestran en la Figura 7, Capture Hi-C permitió un aumento de cuatro veces en la resolución, sin embargo, requirió solo una cuarta parte de la profundidad de secuenciación (es decir, 126 M lecturas frente a 571 M) (Tabla complementaria 1). Este aumento en la resolución permite la detección de subTADs e interacciones de bucle que Hi-C no pudo detectar a la profundidad de secuenciación que se muestra en la Figura 6 y la Figura 7. El protocolo descrito para Capture Hi-C permite una caracterización mucho más detallada y de alta resolución de una gran región genómica de interés, en comparación con los enfoques anteriores.

Figura 1: Diseño de la sonda. Representación esquemática de la estrategia utilizada para el diseño de sondas. Se seleccionaron regiones de 300 pb aguas arriba y aguas abajo de cada sitio de restricción de DpnII en la región objetivo de 3 Mb y se embalsaron con sondas de ARN biotiniladas superpuestas. Se muestra una de estas regiones seleccionadas, chrX: 102,474,805-102,475,500. No se permiten más de 40 bases de secuencias repetitivas en cada sonda. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Capture los controles de calidad de presecuenciación Hi-C . (A) Ejemplo representativo de controles de calidad de plantillas 3C. Se cargaron 200 ng de ADN en un gel de agarosa al 1%. Carril 1: escalera de 1 kb. Carril 2: La cromatina no digerida, reticulada e intacta funciona como una banda afilada a >10 kb. Carril 3: La cromatina reticulada digerida por DpnII se ejecuta como un frotis de entre 1 kb y 3 kb de tamaño. Carril 4: Biblioteca o plantilla 3C final; los extremos libres de los fragmentos de ADN reticulados digeridos se vuelven a ligar. El frotis de ADN de menor tamaño molecular es casi indetectable, y el producto de ligadura se detecta como una banda de >10 kb. (B) Ejemplos representativos de perfiles de ADN bioanalizadores de alta sensibilidad. Arriba a la izquierda: biblioteca 3C cortada con éxito que muestra una distribución del tamaño del fragmento entre 150 pb y 700 pb. Arriba a la derecha: biblioteca 3C cortada insatisfactoria. El ADN no cortado se detecta como un amplio enriquecimiento de fragmentos >2 kb. (C) Abajo a la izquierda: muestra de ADN cortada siguiendo una selección de tamaño de lado izquierdo 1:1 utilizando perlas SPRI. Se enriquecen fragmentos de ~300 pb. Parte inferior central: perfil de PCR previo a la captura después de la ligadura de adaptadores de extremo emparejado de acuerdo con el protocolo del fabricante. Abajo a la derecha: biblioteca final de Capture Hi-C que incluye adaptadores, secuenciación y cebadores de indexación para secuenciación multiplexada. Abreviaturas: bp = pares de bases, FU = unidad de fluorescencia arbitraria. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Captura de controles de calidad posteriores a la secuenciación Hi-C con HiC-Pro . (A) Ejemplo de tasa de mapeo en el genoma de referencia para el primer compañero de los pares de secuenciación. La fracción azul claro representa las lecturas alineadas por HiC-Pro y que abarcan una unión de ligadura. Por lo tanto, esta métrica se puede utilizar para validar el paso de ligadura experimental. (B) Una vez que los compañeros de secuenciación están alineados en el genoma, solo se mantienen los pares de lectura alineados de forma única para su análisis. (C) Los pares no válidos (en rojo) como el extremo colgante, el autocírculo o la religación se descartan del análisis. La fracción de pares válidos es un buen indicador de la eficiencia de ligadura y pull-down. (D) Los pares válidos se pueden dividir en contactos intra/intercromosómicos y de corto/largo alcance. Los pares de lectura duplicados que probablemente representen artefactos de PCR se descartan del análisis. (E) Para el análisis específico de alelos, HiC-Pro informa el número de lecturas alélicas apoyadas por uno o dos compañeros para cada genoma parental (es decir, C57BL / 6J x CASTEi / J). Se espera la misma fracción de lecturas asignadas al alelo materno y paterno. (F) Finalmente, solo se seleccionan pares válidos que se superponen a la región de captura para construir los mapas de contacto. Los pares captura-captura representan contactos dentro de la región objetivo, mientras que los pares captura-reportero implican la interacción entre la región objetivo y una fuera del objetivo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Flujo de trabajo del protocolo Capture Hi-C. Representación esquemática de diferentes pasos del protocolo. Para generar la plantilla 3C de todo el genoma, la cromatina se reticula primero con formaldehído y luego se digiere con la enzima de restricción DpnII. Los extremos libres de ADN se vuelven a ligar, la reticulación se invierte y el ADN se purifica. Para enriquecer los fragmentos que abarcan la región objetivo, una serie de sondas de ARN biotiniladas se hibridan a la plantilla 3C y se capturan mediante una reducción mediada por estreptavidina. Las bibliotecas de captura se procesan para la secuenciación multiplexada, y los fragmentos de ligadura válidos se cuantifican para inferir la frecuencia de los contactos de cromatina a través del objetivo, que se visualizan como mapas de interacción de alta resolución. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Descripción general de la región que abarca el Xic en el cromosoma X del ratón. Representación esquemática del cromosoma X del ratón y zoom de la región capturada de 3 Mb (ChrX: 102.475.000-105.475.000). La región objetivo incluye ~800 kb de ADN correspondiente al Xic, el locus regulador maestro de XCI. El Xic incluye los genes largos no codificantes, Xist, un jugador clave de XCI, y su panorama regulatorio. Los reguladores positivos de Xist se muestran en verde y los reguladores negativos en púrpura. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Capture mapas de interacción Hi-C, 5C y Hi-C en la región capturada de 3 Mb. (A) Capturar el mapa de interacción Hi-C del objetivo de 3 Mb que abarca el Xic del ratón con una resolución de 10 kb (este estudio). (B) Mapa de interacción 5C de la misma región objetivo que en A a una resolución de 6 kb (datos reprocesados a partir de47). Las regiones repetitivas no incluidas en los análisis están enmascaradas en blanco. Los datos 5C requieren su propio procesamiento bioinformático (ver47). Después de la limpieza y alineación, los mapas 5C en la resolución de cebador se agrupan utilizando una mediana de ejecución (ventana = 30 kb, paso = 5) para alcanzar una resolución final de 6 kb. (C) Mapa de interacción Hi-C de la misma región genómica que en A y B a una resolución de 40 kb (datos reprocesados a partir de64). Todos los mapas de interacción se generaron a partir de ESC de ratón. La puntuación de aislamiento se calculó utilizando cooltools y se representa como histogramas con mínimos de aislamiento en los límites TAD. Los límites TAD se muestran como líneas verticales debajo del mapa. La altura de cada línea indica la fuerza límite. Los genes se muestran como flechas que apuntan en la dirección de la transcripción. Los límites sub-TAD que se detectan exclusivamente o con mayor precisión en los mapas Capture Hi-C se indican con puntas de flecha magenta y azul para los sub-TAD en los TAD Tsix y Xist, respectivamente. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Capture mapas de interacción Hi-C, 5C y Hi-C en 1 Mb dentro de la región capturada. (A) Capturar el mapa de interacción Hi-C de la región genómica de 1 Mb que abarca el ratón Xic a una resolución de 5 kb (este estudio). (B) Mapa de interacción 5C de la misma región genómica que en A. A una resolución de 6 KB (datos reprocesados a partir de47). Las regiones repetitivas no incluidas en los análisis están enmascaradas en blanco. Cabe destacar que los datos de 5C requieren su propio procesamiento bioinformático (ver47). Después de la limpieza y alineación, los mapas 5C en la resolución de cebador se agrupan utilizando una mediana de ejecución (ventana = 30 kb, paso = 5) para alcanzar una resolución final de 6 kb. (C) Mapa de interacción Hi-C de la misma región genómica que en A y B de Hi-C a una resolución de 20 kb (datos reprocesados a partir de64). Todos los mapas de interacción se generaron a partir de mESCs. La puntuación de aislamiento se calculó utilizando cooltools y se representa como histogramas con mínimos de aislamiento en los límites TAD. Los límites TAD se muestran como líneas verticales debajo del mapa. La altura de cada línea indica la fuerza límite. Los genes se muestran como flechas que apuntan a la dirección de la transcripción. Los bucles de contacto que se detectan exclusivamente o con mayor precisión en Capture Hi-C se indican con asteriscos magenta y azul para bucles en los TAD Tsix y Xist, respectivamente. Haga clic aquí para ver una versión más grande de esta figura.
Tabla complementaria 1: Estadísticas posteriores a la secuenciación para los conjuntos de datos utilizados en este manuscrito: Capture Hi-C (este estudio), Hi-C64 y 5C47. Haga clic aquí para descargar este archivo.