$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O protocolo Capture Hi-C descrito é baseado na preparação do modelo 3C do genoma usando um cortador de quatro bases (DpnII). O subsequente enriquecimento de fragmentos de ligadura através da região genômica de interesse é obtido pela hibridização de um arranjo de sondas de RNA em mosaico e sua captura baseada em estreptavidina de acordo com o sistema de enriquecimento alvo utilizado neste estudo (Figura 1). Sondas de RNA biotinilado foram selecionadas por apresentarem afinidade de ligação mais estreita a seus alvos em comparação com sondas de DNA52,60. As bibliotecas capturadas são então indexadas e agrupadas para sequenciamento multiplexado de alta taxa de transferência. Os dados Hi-C de captura podem ser visualizados como mapas de interação Hi-C de alta resolução, mas também como mapas de contato de ponto de vista único semelhantes a 4C para visualizar especificamente as interações de sequências menores, como promotores ou intensificadores em toda a região capturada. O fluxo de trabalho do protocolo é mostrado na Figura 4. Os controles de qualidade pré-seqüenciamento são mostrados na Figura 2 e incluem a avaliação da digestão e religadura adequadas do molde 3C e sua eficiente cisalhamento e purificação nas diferentes etapas do protocolo. Espera-se que o DNA do molde 3C cortado funcione entre 150 e 700 pb, e nenhum enriquecimento de fragmentos >2 kb deve ser detectado. Durante as etapas seguintes, várias etapas de limpeza de DNA baseadas em contas e seleção de tamanho são realizadas, primeiro após o cisalhamento, depois após as PCRs pré-captura e pós-captura. O tamanho médio dos fragmentos aumenta ao longo da preparação da biblioteca devido à ligadura dos adaptadores, sequenciamento e iniciadores de indexação. Os controles de qualidade pós-seqüenciamento são obtidos via Hi-C Pro e mostrados na Figura 3. Muitos softwares de bioinformática têm sido propostos para processamento e análise de dados do tipo 3C. Entre elas, o pipeline HiC-Pro é uma das soluções mais populares, permitindo o processamento de dados brutos de sequenciamento até os mapas de contato finais em diversas resoluções55. O HiC-Pro usa uma estratégia de mapeamento em duas etapas para alinhar as leituras de sequenciamento no genoma de referência. Os produtos 3C são então reconstruídos e filtrados para remover pares de contato não informativos e gerar os mapas de contato. Além disso, é capaz de usar uma lista de polimorfismos conhecidos para realizar análises alelo-específicas e separar os contatos provenientes dos dois alelos parentais em mapas de contatos distintos. Mais recentemente, o HiC-Pro foi incluído e estendido na estrutura nf-core (nf-core-hic), fornecendo um pipeline altamente escalável e reprodutível orientado pela comunidade61,62.
Para capturar o camundongo Xic, um conjunto de 28.913 sondas de RNA til 3 Mb do cromossomo X foi projetado. Essa região inclui o jogador-chave no XCI, o longo gene não codificante Xist, e seu conhecido cenário regulatório de ~800 kb (Figura 5). Esta região de ~800 kb é particionada em dois TADs: um incluindo o promotor Xist e seus reguladores positivos conhecidos (ou seja, os transcritos não-codificantes Ftx, Jpx e Xert e o gene codificador de proteínas Rnf12), e o TAD vizinho englobando os cis-reguladores negativos de Xist (ou seja, seu transcrito antisenso Tsix, o elemento intensificador Xite, e o transcrito não-codificante Linx) (para a revisão 44,45).
Aplicando-se o protocolo Capture Hi-C descrito ao Xic, obteve-se a organização topológica deste locus em resolução inédita (Figura 6 e Figura 7). Isso fica particularmente claro quando se compara o perfil Capture Hi-C com o 5C47 publicado anteriormente (Figura 6 e Figura 7; Quadro Complementar 1) e Hi-C61 (Figura 6 e Figura 7; Quadro Complementar 1) Perfis. Por exemplo, as estruturas sub-TAD são mais evidentes — o TAD contendo o promotor Xist ( Xist-TAD ) é claramente subdividido em dois domínios menores (Figura 6A, ponta de seta azul). Anteriormente, isso só podia ser visualmente "adivinhado" a partir do perfil 5C (Figura 6B), embora a detecção de um limite nessa região usasse o algoritmo de escore de isolamento. Da mesma forma, a resolução do perfil Capture Hi-C permite a identificação de dois domínios menores no TAD vizinho (Figura 6A, B), que contém o promotor do locus Tsix ( Tsix-TAD ); isso não foi obtido anteriormente com 5C (Figura 6B). É importante notar que os limites topológicos determinados pela pontuação de isolamento dos dados Capture Hi-C e 5C são geralmente detectados em locais ligeiramente diferentes e com diferentes forças relativas.
Além disso, outras estruturas sub-TAD, como loops de contato, são claramente visíveis a partir dos dados do Capture Hi-C, como o loop entre Xist e Ftx (Figura 7A), previamente identificado com o Capture-C63, e o loop entre Xist e Xert (Figura 7B), recentemente identificado usando um protocolo semelhante para o Capture Hi-C48. Outros contatos também podem ser mapeados com mais precisão devido ao aumento da resolução dos perfis Capture Hi-C, como aqueles que formam os hotspots de contato conhecidos dentro do Tsix-TAD entre os loci Linx, Chic1 e Xite (Figura 7A).
Em comparação com os dados Hi-C mostrados na Figura 7, o Capture Hi-C permitiu um aumento de quatro vezes na resolução, mas exigiu apenas um quarto da profundidade de sequenciamento (ou seja, 126 M leituras versus 571 M) (Tabela Suplementar 1). Esse aumento na resolução permite a detecção de subTADs e interações de looping que não puderam ser detectadas pelo Hi-C na profundidade de sequenciamento mostrada na Figura 6 e na Figura 7. O protocolo descrito para Capture Hi-C permite, portanto, uma caracterização muito mais detalhada e de alta resolução de uma grande região genômica de interesse, quando comparado a abordagens anteriores.

Figura 1: Projeto da sonda. Representação esquemática da estratégia utilizada para o projeto da sonda. Regiões de 300 pb a montante e a jusante de cada sítio de restrição de DpnII ao longo da região alvo de 3 Mb foram selecionadas e agrupadas com sondas de RNA biotinilado sobrepostas. Uma dessas regiões selecionadas é mostrada, chrX: 102.474.805-102.475.500. Não são permitidas mais de 40 bases de sequências repetitivas em cada sonda. Clique aqui para ver uma versão maior desta figura.

Figura 2: Captura de controles de qualidade de pré-seqüenciamento Hi-C. (A) Exemplo representativo de controles de qualidade de modelo 3C. 200 ng de DNA foram carregados em gel de agarose a 1%. Faixa 1: escada de 1 kb. Faixa 2: Cromatina não digerida, reticulada e intacta funciona como uma banda afiada a >10 kb. Faixa 3: A cromatina reticulada digerida por DpnII funciona como um esfregaço entre 1 kb e 3 kb de tamanho. Faixa 4: Biblioteca ou modelo 3C final; extremidades livres de fragmentos de DNA reticulados digeridos são religadas. O esfregaço de DNA de menor tamanho molecular é quase indetectável, e o produto da ligadura é detectado como uma banda de >10 kb. (B) Exemplos representativos de perfis de DNA de bioanalisadores de alta sensibilidade. Canto superior esquerdo: biblioteca 3C cortada com sucesso mostrando uma distribuição de tamanho de fragmento entre 150 pb e 700 pb. Canto superior direito: biblioteca 3C cortada insatisfatória. DNA não cisalhado é detectado como amplo enriquecimento de fragmentos >2 kb. (C) Parte inferior esquerda: amostra de DNA cisalhada após uma seleção de tamanho do lado esquerdo de 1:1 usando contas SPRI. Fragmentos de ~300 pb são enriquecidos. Meio inferior: Perfil de PCR pré-captura após ligadura de adaptadores de extremidade pareada de acordo com o protocolo do fabricante. Canto inferior direito: biblioteca final do Capture Hi-C, incluindo adaptadores, sequenciamento e primers de indexação para sequenciamento multiplexado. Abreviações: bp = pares de bases, FU = unidade de fluorescência arbitrária. Clique aqui para ver uma versão maior desta figura.

Figura 3: Captura de controles de qualidade pós-seqüenciamento Hi-C com HiC-Pro . (A) Exemplo de taxa de mapeamento no genoma de referência para o primeiro parceiro dos pares de sequenciamento. A fração azul claro representa as leituras alinhadas por HiC-Pro e abrangendo uma junção de ligadura. Essa métrica pode, portanto, ser utilizada para validar a etapa experimental de ligadura. (B) Uma vez que os parceiros de sequenciamento estejam alinhados no genoma, apenas pares de leitura alinhados exclusivamente são mantidos para análise. (C) Pares não válidos (em vermelho), como pendurados, autocírculos ou religaduras, são descartados da análise. A fração de pares válidos é um bom indicador da eficiência da ligadura e do pull-down. (D) Os pares válidos podem ser divididos em contatos intra/intercromossômicos e de curto/longo alcance. Pares de leitura duplicados que provavelmente representam artefatos de PCR são descartados da análise. (E) Para análise alelo-específica, HiC-Pro relata o número de leituras alélicas suportadas por um ou dois parceiros para cada genoma parental (ou seja, C57BL/6J x CASTEi/J). A mesma fração de leituras atribuídas ao alelo materno e paterno é esperada. (F) Finalmente, apenas pares válidos sobrepostos à região de captura são selecionados para construir os mapas de contato. Os pares captura-captura representam contatos dentro da região de destino, enquanto os pares captura-repórter envolvem interação entre a região de destino e uma fora do alvo. Clique aqui para ver uma versão maior desta figura.

Figura 4: Fluxo de trabalho do protocolo Capture Hi-C. Representação esquemática de diferentes etapas do protocolo. Para gerar o modelo 3C do genoma, a cromatina é primeiro reticulada com formaldeído e, em seguida, digerida com a enzima de restrição DpnII. As extremidades livres do DNA são então religadas, as ligações cruzadas são revertidas e o DNA é purificado. Para enriquecer fragmentos que abrangem a região alvo, uma matriz de sondas de RNA biotinilado é hibridizada ao molde 3C e capturada por pull-down mediado por estreptavidina. Bibliotecas de captura são processadas para sequenciamento multiplexado, e fragmentos de ligadura válidos são quantificados para inferir a frequência de contatos de cromatina através do alvo, que são visualizados como mapas de interação de alta resolução. Clique aqui para ver uma versão maior desta figura.

Figura 5: Visão geral da região que engloba o Xic no cromossomo X do camundongo. Representação esquemática do cromossomo X do mouse e zoom in da região capturada de 3 Mb (ChrX: 102.475.000-105.475.000). A região alvo inclui ~800 kb de DNA correspondente ao Xic, o locus regulador mestre do XCI. O Xic inclui os longos genes não codificantes, Xist, um jogador-chave do XCI, e seu cenário regulatório. Os reguladores positivos do Xist são mostrados em verde e os reguladores negativos em roxo. Clique aqui para ver uma versão maior desta figura.

Figura 6: Capture mapas de interação Hi-C, 5C e Hi-C na região capturada de 3 Mb. (A) Capturar mapa de interação Hi-C do alvo de 3 Mb englobando o mouse Xic com resolução de 10 kb (este estudo). (B) Mapa de interação 5C da mesma região alvo que em A com resolução de 6 kb (dados reprocessados a partir de47). As regiões repetitivas não incluídas nas análises são mascaradas em branco. Os dados 5C requerem o seu próprio processamento de bioinformática (ver47). Após a limpeza e alinhamento, os mapas 5C na resolução do primer são agrupados usando uma mediana de corrida (janela = 30 kb, passo = 5) para atingir uma resolução final de 6 kb. (C) Mapa de interação Hi-C da mesma região genômica de A e B com resolução de 40 kb (dados reprocessados a partir de64). Todos os mapas de interação foram gerados a partir de CTEs de camundongos. O escore de isolamento foi calculado usando cooltools e é representado como histogramas com mínimos de isolamento nos limites do TAD. Os limites do TAD são mostrados como linhas verticais abaixo do mapa. A altura de cada linha indica a força de contorno. Os genes são mostrados como setas apontando na direção da transcrição. Os limites de sub-TAD que são detectados exclusivamente ou mais precisamente em mapas Capture Hi-C são indicados por pontas de seta magenta e azul para sub-TADs nos TADs Tsix e Xist, respectivamente. Clique aqui para ver uma versão maior desta figura.

Figura 7: Capture mapas de interação Hi-C, 5C e Hi-C em 1 Mb dentro da região capturada. (A) Capturar mapa de interação Hi-C da região genômica de 1 Mb englobando o camundongo Xic com resolução de 5 kb (este estudo). (B) Mapa de interação 5C da mesma região genômica de A. Com resolução de 6 kb (dados reprocessados a partir de47). As regiões repetitivas não incluídas nas análises são mascaradas em branco. É importante notar que os dados 5C requerem o seu próprio processamento de bioinformática (ver47). Após a limpeza e alinhamento, os mapas 5C na resolução do primer são agrupados usando uma mediana de corrida (janela = 30 kb, passo = 5) para atingir uma resolução final de 6 kb. (C) Mapa de interação Hi-C da mesma região genômica de A e B de Hi-C com resolução de 20 kb (dados reprocessados a partir de64). Todos os mapas de interação foram gerados a partir de mESCs. O escore de isolamento foi calculado usando cooltools e é representado como histogramas com mínimos de isolamento nos limites do TAD. Os limites do TAD são mostrados como linhas verticais abaixo do mapa. A altura de cada linha indica a força de contorno. Os genes são mostrados como setas apontando para a direção da transcrição. Os loops de contato que são detectados exclusivamente ou mais precisamente no Capture Hi-C são indicados por asteriscos magenta e azul para loops nos TADs Tsix e Xist, respectivamente. Clique aqui para ver uma versão maior desta figura.
Tabela Suplementar 1: Estatísticas pós-seqüenciamento para os conjuntos de dados utilizados neste manuscrito: Capture Hi-C (este estudo), Hi-C64 e 5C47. Clique aqui para baixar este arquivo.