$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A Figura 1 apresenta uma visão geral do ERRBS, destacando etapas fundamentais, que são explicados ao longo do protocolo descrito. ERRBS bibliotecas foram preparadas utilizando 50 ng de ADN de entrada.
Avaliar a qualidade das bibliotecas preparadas. Biblioteca produção rotineiramente produz fracções de tamanhos 150-250 pb e 250-400 pb (Figura 3A-C). As pequenas diferenças entre as distribuições de tamanho de biblioteca amostras são esperados. Note-se que em ambas as fracções da biblioteca mais baixas e mais altas não são muito intensas tamanhos de ADN, indicativo de enriquecimento de uma sequência particular. MspI resultados de digestão no enriquecimento de uma família de sequências repetitivas de ADN presente no genoma humano de 190 pb, 250 pb e 310 pb nas bibliotecas ERRBS. Estes três repetições representar uma assinatura característica de uma biblioteca ERRBS 20 (ver Figuras 3A-C e 3G). Bibliotecas representativos foram sequenciados em uma seqüência de próxima geraçãor utilizando-end único lê. Ao carregar na concentração recomendada biblioteca em um Illumina HiSeq 2500 sequenciador, são esperados densidades de cluster de 500,000-700,000 por mm 2. Neste densidade de agrupamento, 81,6% ± 3,14% (n = 81) dos aglomerados de passar filtro (Figura 4A). Devido ao baixo final complexidade das inserções de biblioteca (MspI local de reconhecimento: C ^ CGG), os valores de intensidade e índices de qualidade gravados durante o seqüenciamento são altamente variáveis nos primeiros três bases (Figura 4B-C), no entanto, se uma pista de controlo independente está incluído (ver discussão), 85% das bases terá pontuação de 30 ou maior qualidade (valores Q30; Figura 4D).
Alinhamento de dados e determinação metilação da citosina como descrito nos dados de resolução rendimentos protocolo de pares de bases (Tabela 7). Para o genoma humano, uma seqüência de execução single-51 leia-ciclo de uma biblioteca ERRBS em uma pista de um HiSeq 2500 em modo de alto rendimento normally gera 153.194.882 ± 12918302 total de lê-se que após a filtragem de qualidade e adaptador de aparar rendimentos 152.231.183 ± 13189678 lê para entrada no pipeline de análise. Eficiência média de mapeamento para uma biblioteca ERRBS é tipicamente 62,95% ± 5,92%, com representação de 3.183.594 ± 713.547 CpGs com uma cobertura mínima per CpG de 10x e um rendimento médio per CpG de 84,94 ± 16,29 (n = 100).
O protocolo ERRBS é passível de multiplexação (veja o arquivo Suplementar 1: adaptação protocolo para seqüenciamento multiplexado). Os dados do sequenciamento representante é executado é resumidos na Figura 5 Dados de corridas de sequenciação multiplexados (51 de ciclo único de leitura run sequenciamento;. N = 128 para duas bibliotecas por pista; n = 11 para três bibliotecas por pista; n = 11 para quatro bibliotecas por pista) foram comparados a um sequenciamento pista cheia de uma biblioteca ERRBS (51 de ciclo único de leitura é executado sequenciamento; n = 100), bem como redução da resolução, uma única pista para SIMULAÇÃOe 50%, 33% e 25% de leituras por pista (2, 3, 4 e multiplexagem amostra por pista, respectivamente; n = 3). À medida que o número de leituras por amostra diminui com o factor de multiplexagem, o número de CpGs cobertos com uma cobertura mínima de 10x e a cobertura por CpG também diminui (Figura 5 e Tabela 8). Taxas de conversão média de locais não-CpG esperados são 99,85% ± 0,04% (n = 400). Baixas taxas de conversão de 99% pode indicar menos de conversão bissulfito ideal que pode resultar em altos índices de níveis de metilação falsos.
Os dados de uma biblioteca ERRBS preparado a partir de um DNA genómico humano representante foi analisada em R 2.15.2 45 usando o pacote methylKit 26 (ver arquivo de código Suplementar 1 para detalhes de comando). Os dados podem ser visualizados em navegadores genoma vulgarmente utilizadas (Figura 6A). A metilação da citosina dados é igualmente derivada de ambas as cadeias (Figura 6B) e varia a todaespectro de potenciais níveis de metilação da citosina (Figura 6C). Análise de repetições técnicas de um representante rendimentos amostra de ADN humano alta concordância entre os resultados de dados (Figura 6D) e abrange CpGs em um amplo espectro de loci genômica (Figura 6E e F e, como descrito anteriormente 26). Enquanto réplicas técnicos irão produzir grandes valores de R 2 (superior a 97%), réplicas biológicas produzirá valores de R 2 que variam 0,92-0,96 26, e comparando diferentes tipos de células humanas produzirá valores de R 2 mais baixa do que 0,86 (dados não mostrados).

Figura 1: Gráfico das etapas do protocolo ERRBS fluxo. Gráfico representa etapas, que podem ser concluídos em um dia de trabalho tradicional. * Indica um potencial ponto de pausa (siga imediatamente ing ligadura limpar e antes de seleção de tamanho, protocolo passo 5) em que as amostras podem ser congeladas a -20 ° C antes de prosseguir com a duração do protocolo.

Figura 2: protocolo de seleção Size. (A) Captura de tela de configurações usadas no protocolo ERRBS Pippin Prep (ver seção de protocolo 5.1.2 - 5.1.6): (1) Selecione o tipo de cassete. (2) Selecione o padrão a ser usado. (3) Selecione o modo de coleta para cada pista. (4) Entre as faixas coleção pb. (5) Salve o protocolo (B) Estágios de extração manual do gel usado na seção de protocolo 5.2:. (1) escadas gel visualizadas. (2) Marcado Tamanhos para seleção de tamanho usando uma lâmina de barbear. (3) Imagem de amostras excisadas (fração menor: 150-250 bp e maior fração: 250-400 pb)."> Por favor, clique aqui para ver uma versão maior desta figura.

Figura 3: resultados do controlo de qualidade para bibliotecas representativos ERRBS preparados a partir de amostras de DNA humano, utilizando uma máquina Bioanalyzer. (A) Gel-like imagem que mostra uma escada padrão (1), menor fração de biblioteca (135-240 fração bp de Pippin Prep); 2) e a fracção da biblioteca mais elevada (fracção 240-410 pb do Pepino Prep); . 3) (B) Bioanalyzer electroferograma da fracção biblioteca inferior esperado (C) Bioanalyzer electroferograma da fracção biblioteca superior esperado. D -. F) Os dados representativos a partir de uma biblioteca de qualidade pobre prep. Imagem do tipo gel (D) da escada padrão (1), fracção biblioteca inferior (2) e a fracção biblioteca superior (3). A banda de 150 pb marcada com um arrow indica quantidades excessivas de adaptador. Electroferograma da parte inferior (E) e as fracções da biblioteca superiores (F) com os picos de adaptador em excesso de 150 pb (marcados com setas). (G) Bioanalyzer electroferograma de uma biblioteca ERRBS reunidas para sequenciação. Traço vermelho representa uma biblioteca agrupada de alta qualidade com igualdade de representação de frações superiores e inferiores. Traço azul representa uma biblioteca de pool não adequada para a sequenciação devido a uma falta de igualdade de representação das frações superiores e inferiores. Por favor, clique aqui para ver uma versão maior desta figura.

Figura 4: Seqüenciamento paradas por um representante ERRBS 51 de sequenciação de ciclo único de leitura de execução em um seqüenciador HiSeq 2500 em alto rendimentomodo. (A) as densidades de cluster (K / mm 2 = 1.000 aglomerados por milímetro quadrado; azul). E densidades de cluster passando filtro (verde) em duas pistas com bibliotecas ERRBS (B) intensidades típicas observados nos primeiros 30 ciclos em uma pista com um biblioteca ERRBS. Note-se a assinatura CGG da digestão MspI nas intensidades dos três primeiros ciclos. (C) Percentagem de bases com um índice de qualidade de 30 ou mais (%> Q30) para cada ciclo em uma pista ERRBS. (D) a distribuição do escore de qualidade para todos os ciclos em uma pista ERRBS. Azul = menos de Q30, Verde = maior ou igual a Q30. Nesta faixa, 84,7% das bases apresentaram escores de 30 ou superior qualidade.

Figura 5: Sequenciação resultados de saída. Os diagramas de caixa de dados experimentais de amostra multiplexados e única por faixa sequenciamento ru ns (apresentado como caixas verdes) e de dados provenientes de uma redução da resolução simulado de corridas de sequenciação de três ERRBS bibliotecas (apresentado como caixas azuis; amostrados cinco vezes para cada corrida seqüenciamento) a partir de 51 de sequenciação de ciclo único de leitura corre O fator de multiplexação corresponde. o número de bibliotecas ERRBS sequenciado por pista. 1 = inteiro pista ou 100% de leituras e representa os dados a partir de uma única biblioteca ERRBS por pista; 2 = 50% de pista e representa os dados de duas bibliotecas ERRBS por pista; 3 = 33% de uma pista e representa os dados a partir de três bibliotecas ERRBS por pista; e, 4 = 25% de uma pista e representa dados de quatro ERRBS bibliotecas por faixa. (A) A contagem de ler, ou o número de sequências analisadas, por fator de multiplexação. (B) O número de CpG do coberto pelos dados de sequenciamento por multiplexação fator. (C) A cobertura média per CpG por fator de multiplexação._blank "> Clique aqui para ver uma versão maior desta figura.

Figura 6: Dados representativos de uma biblioteca ERRBS preparado a partir de DNA genómico humano (A) da Universidade da Califórnia, Santa Cruz (UCSC) navegador genoma 43 imagem de dados representativos de uma pista ERRBS seqüenciamento.. A barra de escala do eixo y representa 0-100% de metilação em cada citosina coberto com um mínimo de 10x. A pista costume superior representa a vertente para a frente e menor faixa personalizada representa a cadeia reversa. É mostrado chr12:.. 6,489,523-6,802,422 (hg19) inclusive de genes RefSeq e ilhas CpG dentro desta região genômica histogramas (B) distribuição de cobertura CpG juntamente frente e costas reverter em um CD34 humano + medula óssea amostra representativa (C) Distribuição histogramade níveis de metilação CpG ao longo dos dois fios de uma CD34 humano + medula óssea amostra representativa. (D) curva de correlação de níveis de metilação CpG de uma réplica técnico representante de uma amostra de ADN humano. chart (E) Pie ilustrando as proporções de CpGs cobertas de ERRBS que anotação de ilhas CpG (verde claro), o CPG margens (cinza) e outras regiões (branco) em uma amostra representativa a partir de ADN genómico humano. chart (F) Pie ilustrando as proporções de CpGs cobertas de ERRBS que anotados para promotores de genes (vermelho ), exons (verde), íntrons (azul) e regiões intergênicas (roxo). Por favor, clique aqui para ver uma versão maior desta figura.
| Reagente | Volume | Comentário |
| T4 ADN ligase 10x Tampão de Reacção | 10 ul | |
| Trifosfato desoxinucleotídeo (dNTP) Solution Mix | 4 ul | Mistura de 10 mM de cada nucleotídeo |
| T4 ADN polimerase | 5 ul | 3000 unidades / ml |
| ADN Polimerase I Grande (Klenow) Fragmento | 1 ul | 5000 unidades / ml |
| Quinase de polinucleótido T4 | 5 ul | 10000 unidades / ml |
| Água livre de DNase | 45 ul | |
Tabela 1: reagentes de reacção. End reparação nomes e quantidades de reagentes usados na reacção de reparação final (protocolo passo 2.1).
| Reagente | Volume | Comentário |
| Tampão de reacção 10x | 5 ul | por exemplo, 2 NEBuffer |
| 1 mM de 2'-desoxiadenosina 5'-trifosfato (dATP) | 10 ul | |
| Fragmento Klenow (3 '→ 5' exo) | 3 ul | 5000 unidades / ml |
Tabela 2: A-tailing. Reagentes de reacção nomes de reagentes e quantidades usadas na reacção-tailing A (protocolo passo 3.1).
| Reagente | Volume | Comentário |
| 15 mM adaptadores recozidos em água livre de DNase | 3 ul | Adaptador de 1.0 e PE PE adaptador de 2,0; ver Tabela 4 para sequências e referência |
| T4 DNA ligase 10x Tampão de Reacção | 581; l | |
| T4 DNA ligase | 1 ul | 2.000.000 unidades / ml |
| Água livre de DNase | 31 ul | |
Tabela 3: Adaptador reagentes reacção de ligação nomes de reagentes e quantidades utilizadas na reação adaptador de ligação (protocolo passo 4.2)..

Tabela 4:. Os oligos utilizados no protocolo ERRBS Lista de oligos utilizados durante todo o protocolo ERRBS na reacção de ligação (protocolo passo 4) e as etapas de amplificação por PCR (protocolo de passo 7).
| Reagente | Volume | Comentário |
| 10x FastStart High Fidelity Reaction Buffer with cloreto de magnésio 18 mM | 20 ul | |
| DNTP 10 mM Solução Mistura | 5 ul | |
| 25 uM de iniciadores de PCR PE 1.0 | 4 ul | Ver Tabela 4 |
| 25 uM de iniciadores de PCR PE 2.0 | 4 ul | Ver Tabela 4 |
| FastStart High Fidelity Enzyme | 2 ul | 5 unidades / mL FastStart Taq DNA polimerase |
| Água livre de DNase | 125 ul | |
Tabela 5: reagentes de reacção de PCR nomes de reagentes e as quantidades utilizadas na reacção de amplificação por PCR (protocolo passo 7.1)..
| Protocolo passo | Reagente / detail protocolo | Quantidade de DNA de entrada |
| 5-10 ng | 25 ng | 50 ng |
| 1 | Enzima MspI | 1 ul | 2 ul | 2 ul |
| Volume de reação MspI digest | 50 | 100 | 100 |
| 4 | Adaptadores em reacção de ligação | 1 ul | 2 ul | 3 ul |
| Volume de reacção de ligação | 20 ul | 25 ul | 50 ul |
| 5 | Protocolo de seleção Tamanho | Só gel manual | Pippin Prep ou gel Manual | Pippin Prep ou gel Manual |
| 7 | PCR concentração do primário | 25 uM | 25 uM | 10 uM durante 14 ciclos; 25 uM para 18 ciclos |
| Número de ciclos de PCR | 18 | 18 | 14-18 |
Tabela 6: Protocolo. Modificações passo para a entrada de quantidades de materiais que vão 5-50 ng Várias etapas durante todo o protocolo exigir a modificação das quantidades de reagentes usados para gerar bibliotecas de qualidade de diversas quantidades de matérias-primas. Mudanças a quantidades importantes de reagentes estão incluídos aqui. Ajustar o volume de água e tampão nas reacções em conformidade.
| Chr | Base | Costa | Cobertura | freqC | freqT |
| Chr1 | 10564 | R | 366 | 85,52 | 14.48 |
| Chr1 | 10571 | F | 423 | 91.25 | 8,75 |
| Chr1 | 10542 | F | 432 | 91,2 | 8,8 |
| Chr1 | 10563 | F | 429 | 94.64 | 5,36 |
| Chr1 | 10572 | R | 366 | 96.99 | 3.01 |
| Chr1 | 10590 | R | 370 | 88.11 | 11.89 |
| Chr1 | 10526 | R | 350 | 92 | 8 |
| Chr1 | 10543 | R | 368 | 92,93 | 7,07 |
| Chr1 | 10525 | F | 433 | 91,92 | 8,08 |
| Chr1 | 10497 | F | 435 | 88,74 | 11.26 |
Tabela 7: dados ERRBS representativos. Após o alinhamento de dados e citosina determinação metilação, dados par de bases é obtida Para cada CpG coberto, o protocolo de alinhamento como descrito irá determinar a genômica coordenada (colunas: chr = cromossomo, Base e Strand)., A taxa de cobertura do locus específico (Coverage ), e a taxa de citosina detecção com timidina como percentagem (freqC e freqT respectivamente).
| Número de bibliotecas ERRBS por pista | Número médio de alinhados exclusivamente lê | O número médio de CpGs coberta | Cobertura por CpG média |
| 1 | 152231184 ± 13189678 | 3.183.594 ± 713.547 | 85 ± 16 |
| 2 | 77680837 ± 7657058 | 2674823± 153494 | 49 ± 9 |
| 3 | 49938156 ± 2436865 | 2.552.186 ± - 76624 | 39 ± 2 |
| 4 | 34457208 ± 4441686 | 1.814.461 ± 144.339 | 28 ± 4 |
Tabela 8:. Parâmetros representativos de seqüenciamento bibliotecas individuais e multiplexados ERRBS É mostrado dados por faixa de 51 de ciclo único de leitura corridas de sequenciamento: média e desvios-padrão dos alinhado exclusivamente lê, número de CpGs cobertas e cobertura por site CpG obtido a partir de sequenciamento único bibliotecas ERRBS por pista (n = 100), dois ERRBS bibliotecas por pista (n = 128), três ERRBS bibliotecas por pista (n = 11), e quatro ERRBS bibliotecas por pista (n = 11).