$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La expresión génica debe estar estrictamente regulada para que las células establezcan y mantengan su correcta función biológica. Es bien sabido que la expresión génica aberrante subyace en la patogénesis de muchas enfermedades y, por lo tanto, gran parte del interés de la investigación radica en la comprensión de los mecanismos de la regulación génica1. La expresión génica se ve facilitada por elementos reguladores como promotores y potenciadores. Dentro de su secuencia, estos elementos contienen sitios de unión al factor de transcripción (TF), que, cuando están activos, proporcionan una plataforma para la unión de TF. La unión de TFs en estos sitios da como resultado un desplazamiento de los nucleosomas, lo que resulta en un aumento en la accesibilidad al ADN y un aumento posterior en la permisibilidad a la maquinaria transcripcional. Como resultado de esta mayor accesibilidad, estas regiones del ADN son más sensibles a las nucleasas y transposasas como la DNasa y la Tn5, una propiedad bioquímica que ha sido explotada por los investigadores que investigan la regulación transcripcional 2,3.
DNase-seq y ATAC-seq permiten a los investigadores mapear regiones de cromatina abierta, sitios de unión de TF y posicionamiento nucleosomal en todo el genoma. De estas dos técnicas, ATAC-seq ha crecido en popularidad en la última década debido al sencillo protocolo de dos pasos y a un bajo requisito de número de células (50.000 células en comparación con 1 millón por réplica para DNase-seq). Si bien ATAC-seq proporciona una visión general del panorama general de la cromatina en una población de células, es en gran medida independiente de qué proteínas específicas se unen al genoma 4,5. Con el fin de identificar los lugares donde una proteína específica está interactuando con el genoma, la técnica de referencia es la inmunoprecipitación de cromatina (ChIP). ChIP-seq implica la fijación química de las interacciones proteína-ADN en una célula, seguida de inmunoprecipitación ("pull-down") utilizando un anticuerpo específico de la proteína de interés para seleccionar fragmentos de ADN unidos a la proteína de interés (POI). Estos fragmentos de ADN se pueden secuenciar para revelar las ubicaciones de unión genómica de proteínas específicas, como TF, o sitios que contienen modificaciones específicas de histonas1. Mediante la combinación de conjuntos de datos ATAC-seq y ChIP-seq, se puede obtener una imagen detallada del panorama regulatorio para una población de células.
El flujo de trabajo básico requerido para el análisis es el siguiente: las lecturas de secuenciación en bruto deben ser controladas antes de la alineación con un genoma de referencia ("mapeo"). A continuación, las lecturas asignadas correctamente se pueden filtrar para eliminar tanto las lecturas de baja calidad como los duplicados de PCR. Para visualizar estas lecturas mapeadas y filtradas, es necesario calcular la "cobertura" de estas lecturas en todo el genoma. Esto genera un archivo que se puede cargar en un navegador de genoma, como la vista multi-locus (MLV) o el navegador de genoma UCSC como una "pista"6,7. La identificación de picos, o "llamada de picos" de estas pistas de cobertura se logra típicamente utilizando herramientas como LanceOtron o MACS2 8,9. Finalmente, a través del análisis de la ubicación de los picos, se pueden hacer comparaciones de forma y tamaño entre muestras o condiciones biológicas. El análisis e integración de estos conjuntos de datos es un proceso complejo de varios pasos en el que se pueden implementar diferentes combinaciones de herramientas bioinformáticas. Las diferentes versiones de las herramientas pueden ser incompatibles entre sí y pueden cambiar el resultado del procesamiento de datos. También existe una amplia variedad en la potencia computacional y la competencia del usuario requerida para implementar diferentes partes del procesamiento de datos, como se muestra en las tuberías nf-core10, panpipes11, genpipes12, PEPATAC13 o ChIP-AP14.
En general, esto ha dado lugar a inconsistencias tanto en el análisis como en el informe del análisis, lo que, a su vez, ha dado lugar a una redunda en reproducibilidad, accesibilidad y conveniencia para cualquier persona con conocimientos limitados de bioinformática. Abordamos todos estos problemas con CATCH-UP (canalización ascendente completa de ATAC-seq y ChIP-seq), una canalización fácil de usar, flexible y modular para procesar datos de ChIP-seq y ATAC/DNase-seq. La implementación de CATCH-UP requiere una experiencia mínima en bioinformática; Se puede ejecutar en varias infraestructuras informáticas y permite el análisis de datos reproducibles dentro de los grupos de investigación y entre ellos.
CATCH-UP es una canalización de Snakemake basada en Python creada para estandarizar el análisis de datos ChIP-seq y ATAC-seq. Toma datos de secuenciación sin procesar (archivos fastq.gz) como entrada y genera una salida en forma de archivos de pico (.bed) que proporcionan el resultado respectivo para cada paso. Proporcionamos un archivo de configuración en formato yaml (config.yaml), en el que el usuario puede editar los parámetros de cada paso de análisis. El sistema de gestión implementado dentro de snakemake permite el uso de diferentes infraestructuras informáticas (como servidores, clústeres, sistemas en la nube u ordenadores personales) y en paralelo si el usuario proporciona una gran cantidad de datos.
A continuación, proporcionamos una descripción detallada de cada paso del flujo de trabajo (consulte la Figura 1 para ver la ilustración del flujo de trabajo). Esta explicación es esencial para seguir el paso a paso en el apartado de protocolo:
Mover fastq: el primer paso de la canalización es copiar los archivos fastq sin procesar en el directorio de análisis con nombre. Esto deja los datos originales intactos para evitar corromper o modificar los archivos de datos sin procesar.
Concatenación: si los datos de secuenciación sin procesar contienen varios carriles, este paso es necesario para concatenar los carriles antes del análisis. De forma predeterminada, la canalización maneja todos los archivos fastq como muestras individuales. Este paso de concatenación debe definirse en el archivo de configuración.
Recorte: paso opcional de limpieza de datos. Esto permite el recorte de lecturas de baja calidad o secuencias de adaptadores mediante el uso de trimmomatic15. El usuario puede proporcionar archivos fasta personalizados de secuencias de adaptadores; Se proporciona un ejemplo en el directorio del adaptador. Los parámetros de recorte adicionales se pueden definir en el archivo de configuración. De forma predeterminada, el flujo de trabajo omite esta regla.
Alineador: para la alineación, Bowtie216 se aplica de forma predeterminada; También se pueden especificar herramientas de alineación alternativas como BWA-MEM217 . La herramienta de alineación Bowtie2 se selecciona de forma predeterminada, ya que es particularmente hábil para alinear lecturas relativamente cortas con genomas relativamente grandes y, por lo tanto, es muy adecuada para la alineación de datos ChIP-seq y ATAC-seq con genomas de mamíferos. Para evitar cualquier archivo intermedio, el alineador se canaliza a la vista samtools para guardar el archivo bam en la salida. Para esta regla, el usuario debe especificar la compilación del genoma preferida en la que mapear las lecturas, por ejemplo, hg19/hg38 (humano), mm10/mm39 (ratón).
Filtrado: se conservan las lecturas asignadas correctamente y se filtran las lecturas de baja calidad. Predeterminado: vista samtools, con parámetros: -bShuF 4 -f 3 -q 30.
Ordenar: las lecturas alineadas se ordenan en orden de la coordenada más a la izquierda. Predeterminado: samtools sort (envoltorio de serpiente), con parámetro: -m 4G.
Marcar duplicados: todas las lecturas duplicadas se identifican y marcan. El usuario puede decidir eliminarlos cambiando el parámetro del archivo de configuración. Predeterminado: Picard MarkDuplicates (envoltorio de snakemade), con el parámetro: --REMOVE_DUPLICATES False para marcar y retener duplicados.
Fusionar bahía: si los datos de secuenciación se componen de réplicas o muestras, es posible que el usuario desee fusionarlos en una sola mezcla. En este caso, el usuario puede optar por fusionar los archivos bams o mantener los archivos bam separados durante todo el análisis. Si el usuario elige fusionar bams (empleando samtools merge), se debe especificar un prefijo común para los bams combinados.
Índice: este paso indexa las coordenadas ordenadas. Valor predeterminado: índice de samtools (contenedor de snakemake), utilizando los parámetros predeterminados especificados por samtools.
BamCoverage: esta regla crea una pista de cobertura de peluche grande a partir de lecturas alineadas. Se aplica la herramienta bamCoverage de deepTools y la cobertura se calcula como el número de lecturas por bin, en el que el bin representa una ventana de un tamaño especificado. En esta canalización, bamCoverage se aplica con los siguientes parámetros establecidos como predeterminados: -bs 1 -normalizeUsing RPKM -extendReads.
Llamada de pico: se seleccionó LanceOtron8 como el llamador de pico predeterminado para esta canalización. A diferencia de los llamadores de picos tradicionales, que en su mayoría se basan en pruebas estadísticas, LanceOtron es un llamador de picos basado en el aprendizaje profundo, que incorpora mediciones de enriquecimiento genómico y pruebas estadísticas y se ha demostrado que supera al llamador de picos estándar de la industria, MACS29. Para que los peces gordos sean compatibles con LanceOtron, la cobertura debe calcularse por par de bases y normalizarse en RPKM; esto se refleja en la configuración predeterminada del paso BamCoverage. MACS2 se puede seleccionar como un llamador de pico alternativo. La versión de los nuevos llamadores de picos se supervisará e incorporará según corresponda para mantener y optimizar el rendimiento de esta canalización de análisis.
TrackDb: crea una asociación de pares clave-valor de archivos bigwig para cargarlos y visualizarlos en herramientas como las plataformas MLV6 o UCSC Genome Browser18 .
Además de los datos de salida, cada paso de la canalización genera un archivo de registro y se proporcionan las comprobaciones de control de calidad adecuadas para que el usuario pueda realizar un seguimiento del progreso del análisis. FastQC19 se aplica a los datos de secuenciación sin procesar y recortados (si se selecciona) (pasos 1 - Mover fastq y 2- Recortar). Las estadísticas de Samtools más MultiQC20 se utilizan para recopilar, producir y visualizar informes de control de calidad en archivos bam en la salida en los pasos 3 - Alineador, 6 - Marcar duplicados y 7 - Fusionar bam. Para obtener más información sobre cada una de las herramientas aplicadas en los pasos anteriores, consulte la Tabla 1.