$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La calidad y el recorte del adaptador conservan las lecturas con alta calidad de secuenciación
Las técnicas de secuenciación de alto rendimiento son propensas a generar errores de secuenciación, como "mutaciones" de secuencia en las lecturas. Además, los dímeros del adaptador de secuenciación se pueden enriquecer en conjuntos de datos de secuenciación debido a una mala extracción del adaptador durante la preparación de la biblioteca. Los errores de secuenciación excesivos, como las mutaciones de lectura, la generación de lecturas más cortas de lo necesario para un mapeo adecuado y el enriquecimiento de los dímeros adaptadores, pueden aumentar el tiempo de mapeo de lectura y pueden producir lecturas mapeadas falsas positivas que distorsionan los resultados del análisis bioinformático posterior. Por lo tanto, se requiere un filtrado de calidad y un ajuste del adaptador para retener lecturas de alta calidad para el análisis y la interpretación posteriores.
Para retener lecturas de alta calidad para el análisis, esta canalización de análisis CUT&RUN (Figura 2) emplea FastQC26 y Trim Galore27. El script de shell "Script_03_fastQC.sh" ejecuta FastQC para todos los archivos fastq dentro del directorio de trabajo. Los resultados (Figura 3) de este paso utilizando el conjunto de datos CTCF CUT&RUN disponible públicamente de GSE126612 (SRR8581589) identifican algunas lecturas con bases de puntuación de baja calidad (Figura 3A, C) y algunos grados de desajuste en la distribución de los contenidos de GC por secuencia entre la estimación teórica y las lecturas reales (Figura 3E).
La ejecución del script "Script_04_trimming.sh" para ejecutar Trim Galore elimina con éxito aquellas lecturas con bases de puntuación de baja calidad (por debajo de 20 en la Figura 3A) y cualidades de secuencia medias bajas evidentes antes del recorte (Figura 3B-D). Además, "Script_04_trimming.sh" también elimina con éxito el 55 ~ 60% de enriquecimiento medio del contenido de GC que se muestra en la distribución de GC de 'pre-recorte' en el gráfico de secuencia (Figura 3E, F). Estos resultados demuestran que esta línea de análisis CUT&RUN filtra las lecturas de alta calidad para facilitar un mapeo de lectura rápido y preciso con el genoma de referencia.
La distribución del tamaño de la inserción puede proporcionar una estimación de los resultados máximos de las llamadas
Debido al uso de MNasa en CUT&RUN (Figura 1), se espera que las lecturas mapeadas de CUT&RUN exhiban picos de tamaño de fragmentos de ADN mono- (~200 pb) y di-nucleosomales (~350 pb) dentro de los gráficos de distribución de tamaño de inserción (Figura 4). Los problemas con la detección de algunos objetivos pueden dar lugar a inserciones cortas (< 100 pb) (Figura 4C). El alto nivel de lecturas cortas reduce el número de lecturas que se pueden usar para las llamadas máximas de alta confianza, lo que reduce los números máximos y afecta al análisis posterior. En esta canalización de análisis CUT&RUN, "Script_10_insert-size-analysis.sh" opera la función "picard.jar CollectInsertSizeMetrics" para realizar el análisis de distribución del tamaño de la inserción y exportar histogramas como salida de visualización (Figura 2). En los gráficos de salida (Figura 4A-C), el eje x muestra el rango de tamaño de inserción, el lado izquierdo del eje y y el histograma relleno representa el número de inserciones con el valor en el eje x, y el lado derecho del eje y muestra y la línea discontinua la fracción acumulada de plaquitas con un tamaño de inserción igual o mayor que el valor en el eje x. Por lo tanto, tanto la ubicación en el eje X con el cambio más drástico en la pendiente de la línea discontinua que se cruza con el nivel de máximos en el histograma identifica el tamaño de inserción principal en la muestra. Entre las lecturas mapeadas en el genoma de referencia de interés (humano, hg19), los fragmentos de muestra de H3K27Ac (marca de histonas activas) exhiben la distribución de tamaño de inserto CUT&RUN esperada con el tamaño mononucleosomal más alto y picos de tamaño dinucleosomal detectables (Figura 4B). Los fragmentos de muestra de CTCF mostraron grupos adicionales en regiones de longitud de fragmento de 100 ~ 200 pb (Figura 4A). En conjunto, la canalización de análisis CUT&RUN proporciona scripts de shell fáciles de usar para realizar análisis de distribución de tamaño de inserción después de las lecturas de mapeo en genomas de referencia. Estos análisis se vuelven importantes a la hora de estimar la eficiencia de las llamadas máximas antes del análisis posterior.
La canalización de análisis CUTnRUN de Easy Shells proporciona opciones de filtración y normalización para crear recuentos de lecturas confiables
Uno de los puntos críticos del análisis CUT&RUN es obtener pares de lectura mapeados adecuados mediante el filtrado de pares de lectura problemáticos de las salidas de mapeo iniciales y la normalización de los recuentos de lecturas mapeados filtrados con un método de cálculo de normalización específico que pueda cumplir con los objetivos/necesidades del análisis del usuario. La línea de análisis CUT&RUN discutida en este estudio incluye el script "Script_07_filter-sort-bam.sh" para eliminar pares de lectura que están mapeados en cromosomas no canónicos, regiones de lista negra anotadas públicamente23 y TA repite regiones18,22 de pares de lectura que fueron mapeados por bowtie2 usando "Script_06_bowtie2-mapping.sh". Estas filtraciones son necesarias para eliminar los pares de lectura que pueden producir falsos positivos, señales de picos atípicos y picos llamados en el análisis posterior (Figura 5; regiones de caja amarilla).
Además de las filtraciones, la aplicación del método de normalización correcto es un factor importante para visualizar con precisión la diferencia de señal entre las muestras. Por lo tanto, la canalización de análisis CUT&RUN incluye scripts "Script_09_normalization_SFRC.sh" y "Script_09_normalization_SRPMC.sh" para proporcionar dos métodos de normalización verificados públicamente: la lectura fraccional escalada (SFRC)22 y las lecturas normalizadas por millón de picos en el control negativo (SRPMC)24,25 (Figura 5A-D). Dado que la SFRC no incluye el control (por ejemplo, IgG) ni la muestra de pico en la fórmula, la normalización de la SFRC se puede utilizar para muestras que no incluyen ninguna muestra de control o que se espera que muestren diferencias de señal solo en regiones locales sin diferencia a escala de todo el genoma. Las muestras normalizadas de SFRC procesadas por la tubería de análisis CUT&RUN (Figura 5A-D; pistas rojas) producen los mismos patrones de distribución de señal que las lecturas mapeadas disponibles públicamente de GEO (Figura 5A-D; pistas negras), lo que sugiere que esta tubería puede reproducir los resultados de la publicación.
El método SRPMC es útil para normalizar muestras que incluyen muestras de control y de pico y se espera que muestren una diferencia de señal global entre las muestras (Figura 5A-D; pistas verdes). Dado que una muestra de H3K27Ac (SRR8581599) exhibe una relación mucho más alta "(lecturas reales de CUT&RUN)/(lecturas de pico)" (RPS de muestra; 997) que otras réplicas (237, 175 y 161), las señales relativas de H3K27Ac parecen diferentes entre las réplicas en muestras normalizadas de SFRC y SRPMC (Figura 5A-D; H3K27Ac comparado en todas las pistas). Las muestras de RNAPII-S5P exhiben un RPS de muestra relativamente más bajo (1.7, 0.8, 2.1) que el control de IgG (259), por lo que las muestras de RNAPII-S5P exhiben una señal más baja que el control de IgG después de la normalización de SRPMC (Figura 5A-D; Comparación de RNAPII-S5P en todas las pistas). Por lo tanto, la canalización de análisis CUT&RUN que se analiza aquí recomienda utilizar el método SRPMC solo para las muestras que tienen suficientes lecturas en muestras experimentales en relación con las lecturas de control de IgG y las lecturas de control de pico.
La comparación del diagrama de Venn puede dar ideas para elegir un mejor método y opciones de llamada de picos
Múltiples programas de llamada de picos permiten la identificación de la ocupación de proteínas significativamente enriquecidas en todo el genoma. Los programas empleados para el análisis CUT&RUN incluyen los programas de la familia MACS2 y SEACR4 como métodos principales hasta el momento. Sin embargo, puede ser un desafío, especialmente para los principiantes en bioinformática, identificar el método de detección de picos más apropiado y las opciones para un proyecto CUT&RUN determinado. Por lo tanto, la canalización de análisis CUT&RUN incluye pasos de análisis del diagrama de Venn para dar a los usuarios la oportunidad de comparar la similitud y la diferencia de los resultados de las llamadas máximas entre varias opciones de llamadas máximas (opciones Script_17_intervene) y programas de llamadas máximas (Script_19_intervene_methods.sh) (Figura 6A-H).
De acuerdo con la comparación, los picos fusionados CTCF, H3K27ac y RNAPII-S5P que se denominan con y sin opción de control de IgG durante el paso de llamada de picos, MACS2 y MACS3 llamaron más picos con la opción de control de IgG (Figura 6A), pero SEACR llamó a más picos sin opción de control de IgG tanto en opciones estrictas como relajadas (Figura 6B-D). Por lo tanto, la canalización de análisis de CUT&RUN sugiere (1) aplicar la opción de control de IgG para MACS2 y MACS3, (2) llamar a los picos para las muestras experimentales de CUT&RUN y las muestras de control de IgG por separado, y luego filtrar los picos de IgG más tarde para el llamador de picos de SEACR. Entre MACS2 y MACS3, MACS3 tuvo un poco más de picos (Figura 6A).
Además, la comparación de los picos llamados por MACS2 y MACS3 con la opción de control de IgG y SEACR sin la opción de control de IgG muestra que los picos de SEACR llamados con la opción estricta se superponen con los picos de MACS 2 y MACS3 más que los picos de SEACR llamados con la opción relajada (Figura 6E, F). Por lo tanto, los resultados de la canalización de análisis CUT&RUN sugieren que la opción estricta maximiza la coherencia de SEACR con las llamadas máximas de MACS. Por último, el diagrama de Venn para comparar la superposición de picos convocados por SEACR con normalización para los archivos bedGraph CUT&RUN readcounts sin procesar y sin normalización para los archivos bedGraph CUT&RUN readcounts normalizados no revela ninguna diferencia entre los métodos SFRC y SRPMC para SEACR con la opción strictent. Los picos de SFRC exhiben números de pico mucho más altos y se superponen mejor con los picos de opciones normalizados ('norma' en la Figura 6) que los picos de SRPMC para SEACR con opciones relajadas (Figura 6G, H).
Comparaciones estadísticas entre réplicas y muestras
Sacar conclusiones precisas a través de múltiples réplicas requiere una evaluación de la similitud de las réplicas. La canalización de análisis CUT&RUN utilizada aquí emplea el cálculo del coeficiente de correlación estadística basado en Deeptools215, la agrupación en clústeres de mapas de calor y el análisis de componentes principales (PCA) para facilitar la identificación de muestras y réplicas apropiadas para un análisis posterior válido. El agrupamiento del mapa de calor basado en el coeficiente de correlación de Pearson mostró una correlación estadísticamente significativa entre las réplicas para CTCF, H3K27Ac y RNAPII-S5P en sus regiones pico llamadas (Figura 7A-C). Sin embargo, el PCA mostró que una muestra de CTCF (SRR8581590) y H3K27Ac (SRR8581608) se encuentra relativamente lejos de otras réplicas (Figura 7D) en todas las regiones CTCF, H3K27Ac y RNAPII-S5P llamadas pico.
De acuerdo con el diagrama de Venn para comparar entre picos entre réplicas, los picos de CTCF (SRR8581590) mostraron la menor superposición con otras réplicas en los tres resultados de la llamada máxima (Figura 7E-G), y los picos H3K27Ac (SRR8581608) mostraron la menor superposición con otras réplicas en los resultados de llamadas máximas de SEACR (Figura 7F). los picos H3K27Ac (SRR8581608) no mostraron una superposición mínima con otras réplicas en los resultados de llamada de picos de MACS2 y MACS3 (Figura 7F), lo que puede sugerir que la distancia entre réplicas en PCA no es suficiente para definir una muestra atípica. Por lo tanto, la línea de análisis CUT&RUN propone definir la replicación de valores atípicos como "la muestra que muestra un coeficiente de correlación de Pearson bajo en el grupo de agrupamiento de mapas de calor, una larga distancia en el gráfico de PCA con otras réplicas y una superposición de picos más baja entre las réplicas".
La llamada de picos facilita la visualización e interpretación de los datos de CUT&RUN
La línea de análisis de CUT&RUN detallada en este estudio emplea dos tipos de llamadas máximas disponibles públicamente: la familia MACS y SEACR. Para optimizar la visualización de los picos llamados, esta canalización selecciona el intervalo de señal más alto como centro de picos para los análisis de mapas de calor y metagráficos. Todos los picos CTCF, H3K27Ac y RNAPII-S5P llamados por los llamadores de picos MACS3 y SEACR mostraron un patrón de distribución de picos más nítido en el centro de los intervalos de señal más altos (Figura 8A-F, gráficos 'enfocados') que en el centro de regiones de picos completas (Figura 8A-F, gráficos 'completos'). Las muestras CUT&RUN procesadas por la tubería de análisis CUTnRUN de Easy Shells con normalización SFRC (Figura 8 A-F, gráficos 'SFRC') exhiben patrones de distribución de señal similares a los de las muestras normalizadas SFRC de las cuales los pares de lectura mapeados sin procesar están disponibles públicamente en GEO (Figura 8A-F, gráficos 'públicos') en los picos llamados por la tubería de análisis. Por lo tanto, el canal de análisis CUT&RUN puede reproducir con éxito los resultados de la publicación.

Figura 1: Esquema del procedimiento experimental CUT&RUN. CUT&RUN es un enfoque basado en enzimas para detectar las interacciones proteína-ADN en todo el genoma. El procedimiento CUT&RUN comienza con la unión de las células (o núcleos aislados) a la concanavalina A conjugada con perlas magnéticas para permitir el aislamiento y la manipulación de números bajos de células durante todo el procedimiento. Las células aisladas se permeabilizan utilizando un detergente suave para facilitar la introducción de un anticuerpo que se dirige a la proteína de interés. A continuación, la nucleasa microcócica (MNasa) unida a la proteína A o a la proteína A/G se introduce en la célula permeabilizada. La pA-MNasa (o pAG-MNasa) se recluta para el anticuerpo unido mediante una etiqueta de proteína A o proteína A/G. Una vez que la MNasa se localiza en los sitios objetivo, la nucleasa se activa brevemente mediante la introducción de calcio para digerir el ADN alrededor de la proteína objetivo. La digestión de MNasa da lugar a complejos mononucleosomales de ADN-proteína. Posteriormente, el calcio se quela para finalizar la reacción de digestión, y los fragmentos cortos de ADN de la digestión de la MNasa se liberan de los núcleos mediante una incubación corta a 37 °C, y luego se someten a purificación de ADN, preparación de bibliotecas y secuenciación de alto rendimiento1. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Resumen esquemático de la canalización de análisis CUT&RUN de Easy-Shell. La canalización de análisis CUT&RUN de Easy-Shell está diseñada en tres secciones principales: (1) control de calidad y mapeo de archivos de lectura sin procesar (izquierda; morado), (2) normalización de lecturas mapeadas y recuentos de lecturas y llamadas máximas (centro; verde), y (3) validación de lecturas mapeadas y picos llamados (derecha; rosa). En cada paso, se proporciona el número de script de shell correspondiente, una breve descripción y la herramienta de programa utilizada en ese paso (entre paréntesis). Las flechas de Plaine muestran flujos directos entre pasos. Esta canalización de análisis CUT&RUN proporciona dos métodos de normalización de lecturas que pueden satisfacer las necesidades de los usuarios con y sin lecturas de control, procesos de validación multicapa para identificar réplicas adecuadas para el análisis posterior e identificación de picos enfocados para la creación de resultados de mapas de calor y metagráficos bien enfocados. Este canal de análisis está escrito en scripts de shells fáciles de usar de manera paso a paso para proporcionar a los principiantes en bioinformática la oportunidad de aprender y practicar el análisis básico de datos de CUT&RUN mediante la lectura y edición de los propios scripts. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Comparación de los resultados del control de calidad antes y después del recorte de calidad. Las salidas del informe de control de calidad seleccionadas de FastQC muestran el efecto del recorte de calidad mediante lecturas de SRR8581589 (GSM3609748, CTCF). Los resultados que se muestran incluyen: (A) Puntuación de calidad en las bases antes del recorte. (B) La misma lectura que A) después del recorte. (C) Distribución de la puntuación de calidad en todas las secuencias antes del recorte. (D) La misma lectura que C) después del recorte. (E) Distribución de GC en todas las secuencias antes del recorte. (F) La misma lectura que E) después del recorte. La puntuación de calidad mínima en cada posición dentro de las lecturas de secuenciación (A, B) y la calidad media mínima de la secuencia (C, D) aumentan después del recorte de calidad. Además, este paso puede reducir la diferencia entre la distribución teórica de los recuentos de GC y el recuento real de GC por base en las lecturas (E, F) al eliminar los pares de lecturas que tienen una alta tasa de discrepancia de bases. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Análisis de la distribución del tamaño de la plaquita. Histograma del tamaño del inserto para (A) CTCF, (B) H3K27Ac, y (C) serina 5 ARN polimerasa II fosforilada (RNAPII-S5P). Los histogramas muestran diferencias relativas en la distribución del tamaño de la plaquita entre las muestras. La línea discontinua en el histograma representa la fracción acumulada de lecturas con un tamaño de inserción mayor o igual que el valor en el eje x. n: número de lecturas únicas asignadas concordantemente por muestra después de la filtración. FR: fragmentos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Vista general panorámica de las muestras de CUT&RUN. Las lecturas mapeadas de CUT&RUN disponibles públicamente normalizadas por el conteo fraccional escalado (SFRC) sin filtración adicional (pistas negras), las muestras de CUT&RUN procesadas por la tubería de análisis CUTnRUN de Easy Shells con normalización de SFRC (pistas rojas) y las lecturas mapeadas normalizadas de picos por millón en el control negativo (SRPMC; pistas verdes)' se muestran en (A) región del grupo de genes histonas, y (B-D) otras tres regiones con picos CTCF, H3K27Ac y RNAPII-S5P llamados por todos los llamadores de picos MACS2, MACS3 y SEACR. Los recuadros amarillos resaltan la ubicación de las señales de pico filtradas durante el paso de filtración en la canalización de análisis CUTnRUN de Easy Shells. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Diagrama de Venn para comparar entre los picos llamados por diferentes llamadas de pico y las opciones de llamada de pico. (A) Comparación entre los picos llamados por MACS2 y MACS3 con y sin opción de entrada IgG durante la llamada de pico. (B-D) Comparación entre picos llamados por SEACR con y sin opción de entrada IgG, opciones 'estrictas' y 'relajadas', y con opción de normalización usando archivos de pares de lectura sin procesar (B), sin opción de normalización usando archivos de recuentos de lecturas normalizados SFRC (C) o archivos de recuentos de lecturas normalizados SRPMC (D). (E,F) Comparación entre los picos llamados por MACS2, MACS3 con opción de entrada IgG y SEACR con opción estricta (E) o relajada (F). (G,H) Comparación entre picos llamados por SEACR sin opción de entrada de IgG y con opciones estrictas (G) o relajadas (H). con IgG: picos llamados con la opción de entrada de IgG. sin IgG: picos llamados sin la opción de entrada de IgG. norma: picos llamados con la opción de normalización. non: picos llamados sin la opción de normalización. SFRC: picos llamados por archivos de recuentos de lecturas normalizados por el método de 'conteo fraccional escalado (SFRC)'. SRPMC: picos llamados por los archivos readcounts normalizados por el método 'Spike-in normalized Reads Per Million mapped reads in the negative Control (SRPMC)'. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Correlación de Pearson, análisis de componentes principales y diagrama de Venn para validar la similitud entre réplicas. (A-C) La agrupación de mapas de calor con valores de coeficiente de correlación de Pearson muestra el grado de similitud entre las réplicas en los picos llamados por MACS2 (A), MACS3 (B) y SEACR (C). El coeficiente de correlación de Pearson se encuentra en un valor entre -1 y 1. Un valor más alto del coeficiente de correlación de Pearson absoluto indica una correlación más fuerte entre dos variables, y un valor positivo del coeficiente de correlación de Pearson indica una correlación positiva, donde las dos variables se mueven en la misma dirección. Por lo tanto, las muestras con mayor similitud exhiben un pedigrí más cercano en el agrupamiento de mapas de calor y un valor de coeficiente de Pearson más alto. (D) El análisis de componentes principales (PCA) muestra el grado de similitud entre las réplicas y las muestras en todas las regiones de pico CTCF, H3K27Ac y RNAPII-S5P que son llamadas por MACS2 (izquierda), MACS3 (centro) y SEACR (derecha). Las muestras con mayor similitud se colocan más juntas en la gráfica PCA. (E-G) Análisis de diagrama de Venn para comparar los picos encontrados en cada réplica por MACS2 (E), MACS3 (F) y SEACR (G). La línea de análisis CUT&RUN de Easy-Shell propuso aplicar los tres métodos para identificar réplicas con alta similitud que pueden ser adecuadas para fusionar los picos llamados para el análisis posterior. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Visualización de mapa de calor y metagráficos de la distribución de la señal en los picos. El mapa de calor y los metagráficos muestran la distribución del enriquecimiento alrededor de los centros de picos llamados mediante diferentes llamadores de picos. (A,B) Picos de CTCF CUT&RUN llamados desde una réplica (SRR8581589) por MACS3 (A) y SEACR (B). (C,D) Picos de H3K27Ac CUT&RUN llamados desde una réplica (SRR8581607) utilizando MACS3 (C) y SEACR (D). (E,F) Picos RNAPII CUT&RUN llamados desde una réplica (SRR8581589) por MACS3 (E) y SEACR (F). Los pares de lectura mapeados disponibles públicamente ('Público' en la Figura 8) y los fragmentos mapeados por la canalización de análisis CUTnRUN de Easy Shells ('SFRC' en la Figura 8) se comparan después de la normalización del 'conteo fraccional escalado (SFRC)'. Los picos son llamados por MACS3 con la opción de entrada de IgG ('MACS3 w/ IgG' en la Figura 8) y SEACR sin entrada de IgG y sin opción de normalización utilizando archivos de recuentos de lecturas normalizados SFRC en modo estricto ('SEACR sin IgG no SFRC estricto' en la Figura 8). Se preparan dos versiones de los archivos de coordenadas de los picos llamados: desde el inicio hasta el final de los picos llamados ('completos' en la Figura 8) y la ubicación del bin con la señal más alta dentro de los picos llamados (cumbres en MACS3 llamadas picos; 'enfocado' en la Figura 8). Haga clic aquí para ver una versión más grande de esta figura.
Tabla 1: Información sobre los archivos fastq de CUT&RUN en GSE126612. Todos los archivos fastq de lecturas sin procesar que se incluyen en GSE126612 y se seleccionan como conjunto de datos de ejemplo para la canalización de análisis CUTnRUN de Easy Shells se enumeran como una tabla. La columna 'Nombre de archivo' muestra los nombres de los archivos sin procesar que CUT & RUN lee los archivos fastq que se mostrarán en '~/Desktop/GSE126612/fastq' después de ejecutar 'Script_02_download-fastq.sh'. 'md5sum' comparte MD5 (Message-Digest Algorithm 5) para el conjunto de datos de ejemplo, que se puede utilizar para verificar la integridad de los archivos después de descargar el conjunto de datos mediante la ejecución de 'Script_02_download-fastq.sh'. La última columna describe el objetivo de CUT&RUN para cada muestra. Haga clic aquí para descargar esta tabla.