Artículo de método

Una canalización computacional para la cuantificación de ARN potenciador intergénico / intragénico en células madre embrionarias de ratón

DOI:

10.3791/69400

28 de octubre de 2025

* These authors contributed equally

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo proporciona una canalización computacional optimizada para cuantificar las transcripciones de potenciadores nacientes. Al integrar la accesibilidad de la cromatina, la característica de la cromatina y los datos transcripcionales, permite una detección precisa y un análisis específico de la actividad potenciadora de la hebra en regiones intragénicas complejas, sin dejar de ser accesible para los investigadores sin una amplia formación en bioinformática.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los elementos reguladores cis básicos conocidos como potenciadores juegan un papel central en permitir una regulación transcripcional precisa de los genes diana que controlan diversas funciones celulares y procesos de desarrollo. Estos potenciadores a menudo se transcriben en ambas direcciones, produciendo transcripciones largas no codificantes denominadas ARN potenciadores (eRNA). La expresión de eRNAs está estrechamente relacionada con las características activas de la cromatina, como H3K27ac y el reclutamiento de coactivadores, y contribuye funcionalmente a la activación transcripcional de genes diana. Sin embargo, la detección y cuantificación de los eRNAs sigue siendo un reto, especialmente cuando se solapan con la transcripción del gen huésped. Para abordar esto, presentamos un flujo de trabajo computacional estandarizado y fácil de usar para analizar la transcripción de potenciadores a partir de datos de secuenciación de ARN nacientes. El protocolo guía a los usuarios a través del preprocesamiento de datos, el mapeo de lectura y el control de calidad, seguido de la cuantificación específica de la transcripción asociada al potenciador, con procedimientos dedicados para potenciadores intragénicos donde la asignación de señales es compleja. Los módulos de visualización permiten una inspección clara de la actividad de los potenciadores en contextos genómicos, y las opciones integradas admiten análisis de potenciadores intergénicos e intragénicos. Diseñado para investigadores con experiencia limitada en bioinformática, este flujo de trabajo proporciona un marco práctico para estudios consistentes, reproducibles y escalables de transcripción de potenciadores, lo que facilita una aplicación más amplia de la biología de potenciadores en diversos sistemas.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los potenciadores son elementos de ADN reguladores cis que controlan la transcripción del gen diana organizando el bucle de cromatina y reclutando la maquinaria transcripcional 1,2,3. Su actividad específica del tejido permite una regulación precisa durante el desarrollo y el compromiso del linaje 4,5,6,7,8. Los potenciadores activos muestran características de la cromatina como H3K4me1 (monometilación de la histona H3 lisina 4) y H3K27ac (acetilación de la histona H3 lisina 27) y generalmente se encuentran en regiones hipersensibles a la ADNasa I que marcan la cromatina abierta 9,10,11,12. Estas características permiten que los factores de transcripción y la ARN polimerasa II accedan al ADN, iniciando la transcripción naciente en los loci potenciadores 13,14,15,16.

Este proceso biológico secuencial produce transcripciones derivadas de potenciadores, llamadas eRNA, que son ARN bidireccionales, no codificantes y, por lo general, no poliadenilados 13,14,15,16. Los eRNAs sirven como marcadores de actividad potenciadora y funcionan como efectores por derecho propio 16,17,18,19,20,21,22,23,24. Promueven el alargamiento productivo al liberar el factor de elongación negativo (NELF) de la ARN polimerasa II 16,19 en pausa y ayudan a estabilizar los bucles potenciador-promotor 17,18,20. También apoyan la formación de condensados transcripcionales, potencialmente a través de la modificación de m6A (N 6-metiladenosina) 21,22,23.

Aún así, la función de la transcripción del potenciador intragénico, iniciada a partir de elementos reguladores dentro de los cuerpos génicos, sigue siendo controvertida. Algunos estudios informan que los eRNA de los potenciadores intragénicos aumentan la expresión génica del huésped25, potencialmente al promover la liberación de NELF y el alargamiento productivo dependiente del estímulo26,27. Por el contrario, otros trabajos sugieren que esta transcripción puede impedir los genes del huésped a través de colisiones de ARN polimerasa II o interferencia transcripcional, lo que lleva a la atenuación o terminación prematura28,29. Estas observaciones contradictorias, junto con el doble papel de los eRNAs como marcadores y reguladores, resaltan la necesidad de una cuantificación cuidadosa y una disección funcional. Sin embargo, medir los eRNA intragénicos es difícil porque a menudo se superponen a las transcripciones del huésped de la cadena sensorial 13,25,26,30. El desafío se amplifica cuando los potenciadores residen en regiones con genes anidados o transcripción superpuesta en ambas hebras, lo que oscurece las señales específicas del potenciador.

Para superar estos desafíos, desarrollamos una línea de bioinformática para detectar, cuantificar y visualizar transcripciones asociadas a potenciadores, con un enfoque particular en las regiones intragénicas. La canalización integra el ensayo para la cromatina accesible a la transposasa mediante secuenciación (ATAC-seq), secuenciación por inmunoprecipitación de cromatina (ChIP-seq), secuenciación global (GRO-seq) y anotaciones genómicas para lograr una resolución a nivel de potenciador incluso en contextos genómicos complejos.

La canalización comprende cuatro pasos principales: (i) preprocesamiento, alineación, llamada de pico y generación de señales31; ii) identificación de potenciadores mediante características de cromatina; (iii) asignación de orientación de hebras, particularmente dentro de cuerpos genéticos; y (iv) cuantificación y visualización de transcripciones de potenciadores nacientes. Este marco es particularmente útil para sistemas con datos de secuenciación de alta resolución, como las células madre embrionarias de ratón analizadas en este estudio, y se puede extender a otros organismos cuando se disponga de conjuntos de datos adecuados. Al permitir la cuantificación específica del potenciador donde las canalizaciones existentes se quedan cortas, este flujo de trabajo ofrece una herramienta práctica para comparar y estudiar la transcripción de ARNe intragénico en diversos contextos genómicos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NOTA: Todos los conjuntos de datos sin procesar utilizados en el flujo de trabajo se enumeran en la Tabla 1. Los detalles de las herramientas bioinformáticas se proporcionan en la Tabla de materiales. El número de subprocesos utilizados en esta canalización se puede ajustar modificando la variable THREADS definida en la parte superior de cada script. Los usuarios pueden aumentar el número para acelerar el análisis en función de los recursos de CPU del usuario.
Después de cada paso, se genera un archivo de registro. Para comprobaciones rápidas de fallos, use comandos como cat StepXX_log.txt; grep -qF "ERROR" StepXX_log.txt && echo "ERROR encontrado. Arreglar antes del siguiente paso". echo "OK: no hay marcadores de ERROR". Si aparece algún ERROR, trate el paso como fallido y resuélvalo primero.

1. Descarga de la canalización de análisis completa desde el repositorio de GitHub

(https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/)

  1. Inicie la interfaz de línea de comandos (CLI) adecuada para el sistema operativo utilizado.
    1. Windows: configure un entorno Linux mediante el Subsistema de Windows para Linux (WSL). Siga las instrucciones oficiales para instalar y configurar WSL antes de continuar32.
    2. macOS: Continúe sin configuración adicional, ya que macOS está basado en Unix. Consulte la guía oficial para abrir la terminal33.
    3. Usuarios de Linux, particularmente aquellos que usan Ubuntu: Abra una terminal como se describe en las instrucciones a las que se hace referencia34.
  2. Ejecute wget https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/archive/refs/heads/main.zip -O ~/pipeline.zip   en terminal para descargar la canalización para la identificación del potenciador y la cuantificación del ARN potenciador.
  3. Escriba unzip ~/pipeline.zip -d ~/ en la terminal. Esto extraerá todos los archivos necesarios al directorio de inicio.
  4. Ejecute rm ~/pipeline.zip y escriba mv ~/Enhancer-transcript-identification-from-read-to-visualization-main ~/Enhancer-transcript-identification-from-read-to-visualization para eliminar el archivo y cambiar el nombre de la carpeta extraída.
  5. Escriba cd ~/Enhancer-transcript-identification-from-read-to-visualization/, y ejecute chmod +x scripts/* para hacer que todos los scripts en el directorio "scripts/" sean ejecutables.

2. Configuración del entorno mamba/conda para la canalización de análisis

  1. Escriba bash scripts/Step1_conda_environment_formation.sh para crear y ejecutar un entorno virtual de mamba. Si se le solicita durante la ejecución, escriba Y y presione Entrar para confirmar las instalaciones del paquete. Para macOS, siga el paso 2.1.1; para sistemas con Mamba o Conda ya instalados, siga el paso 2.1.2.
    1. MacOS: abra el script y reemplace el enlace de descarga de miniconda por la versión de macOS:
      https://repo.anaconda.com/miniconda/Miniconda3-latest-MacOSX-x86_64.sh
      Luego, siga el paso 2.1.
    2. Una vez que (enhancer-env) aparezca en el indicador, escriba bash scripts/Step2_package_installation.sh para instalar los paquetes necesarios para los análisis posteriores. Escriba Y y pulse Intro si se le solicita durante la instalación.
    3. Después de ejecutar el paso 2.2, compruebe si hay mensajes de error en la salida del terminal. Resuelva cualquier problema; luego vuelva a ejecutar el Paso 2.2.
    4. (OPCIONAL) Ejecute mamba list para confirmar que todos los paquetes administrados por mamba en la tabla de materiales están instalados. HOMER se instala manualmente y no aparecerá en la lista de mamba. Verifique HOMER comprobando que existe el directorio "~/homer/".

3. Descargue conjuntos de datos ChIP-seq, ATAC-seq y GRO-seq disponibles públicamente desde SRA (Archivo de lectura de secuencias)

  1. Ejecute cp scripts/Step{3..12}_*.sh ./ para copiar los scripts de shell necesarios para el procesamiento de lectura sin procesar.
  2. Escriba bash Step3_download_file_list.sh > Step3_log.txt 2>&1 y presione la tecla Intro para descargar y procesar datos de secuenciación sin procesar de SRA.
    NOTA: Este script automatiza la descarga y preparación de datos de secuenciación públicos para su análisis. Crea una estructura de carpetas estandarizada en "MATERIAL/", organizada por tipo de ensayo y replicada (biológica: rep1/rep2; técnica: trep1/trep2). Una lista integrada de números de acceso SRA impulsa la recuperación con prefetch (v3.2.0), la conversión a FASTQ con fasterq-dump (v3.2.0) (paired-end: --split-files) y la compresión con pigz (v2.8) para reducir el almacenamiento. El procesamiento sigue a prefetch, fasterq-dump, pigz, con salidas escritas en los directorios "00.Rawdata/" correspondientes.

4. Realice el control de calidad y el recorte de lecturas sin procesar

  1. Escriba bash Step4_read_trimming_and_QC.sh > Step4_log.txt 2>&1 para realizar el recorte de lectura y el control de calidad de los archivos FASTQ sin procesar.
    NOTA: Este script procesa archivos FASTQ sin procesar de GRO-seq, ATAC-seq y ChIP-seq (H3K27ac, H3K4me1) con los controles de entrada correspondientes. Ejecuta FastQC (v0.12.1)35 en lecturas sin procesar, luego recorta los adaptadores con Trim Galore (v0.6.10)36 utilizando parámetros específicos del ensayo. Para GRO-seq, primero elimina las colas NextSeq G y las lecturas muy cortas (--nextseq 20, --length 20), luego usa Cutadapt (v5.1)37 para eliminar tractos poli-A largos mientras conserva lecturas de más de 20 nucleótidos ( -a A{15}, -m 20). Para ATAC-seq, procesa bibliotecas de extremos emparejados y se dirige a adaptadores Tn5/Nextera (--paired, --nextera). Para H3K27ac y la entrada correspondiente, maneja bibliotecas ChIP-seq de extremo emparejado (--paired). Para H3K4me1 y su entrada, realiza un recorte estándar de un solo extremo (predeterminado). FastQC se ejecuta nuevamente en lecturas recortadas. Las salidas se escriben en el directorio "01.Clean/" de cada ensayo y se eliminan los archivos intermedios recortados por adaptador GRO-seq.

5. Prepare el índice de referencia de Bowtie2

  1. Elija una de las dos opciones siguientes para preparar el índice del genoma de Bowtie2 (v2.5.4)38 para el genoma de referencia mm10 (Mus musculus).
    1. Ejecute bash Step5_1_download_reference_index.sh > Step5_1_log.txt 2>&1 para usar el índice Bowtie2 preconstruido proporcionado por los desarrolladores.
    2. Correr golpea Step5_2_download_reference_make_index_with_
      bowtie2.sh > Step5_2_log.txt 2>&1
      para descargar la secuencia del genoma MM10 sin procesar y construir el índice manualmente.
      NOTA: Ambos enfoques generan un archivo de índice en el directorio "reference_index/" y son funcionalmente equivalentes para la alineación estándar.

6. Alinear las lecturas recortadas con el genoma de referencia mm10

  1. Escriba bash Step6_alignment_to_make_bam.sh > Step6_log.txt 2>&1 para alinear las lecturas de cada ensayo con la referencia y generar archivos BAM.
    NOTA: Este paso asigna las lecturas de cada ensayo a la referencia mm10 previamente indexada. H3K27ac ChIP-seq y la entrada correspondiente utilizan la asignación de extremos emparejados para una precisión equilibrada (-1, -2) con sensibilidad predeterminada. H3K4me1 ChIP-seq y la entrada correspondiente utilizan la asignación de un solo extremo en la configuración predeterminada (-U). ATAC-seq utiliza el mapeo de alta sensibilidad para acomodar fragmentos variables y largos derivados de Tn5 (--very-sensitive, -X 2000) con entrada de extremo emparejado (-1, -2). GRO-seq utiliza mapeo de alta sensibilidad para ubicar mejor lecturas cortas y recortadas (--muy-sensitive) con entrada de un solo extremo (-U). Los archivos SAM se convierten a BAM y se filtran con la vista samtools (v1.22.1)39 , utilizando MAPQ moderado para ChIP/input (-b, -q 10) y umbrales más estrictos para ATAC-seq y GRO-seq (-b, -q 30); los archivos BAM finales se escriben en el directorio "02.Align/" de cada conjunto de datos.

7. Fusionar réplicas técnicas de datos H3K27ac ChIP-seq

  1. Ejecute bash Step7_merge_trep.sh > Step7_log.txt 2>&1 para fusionar réplicas técnicas de H3K27ac ChIP-seq y los archivos BAM de entrada correspondientes.
    NOTA: Este script ordena los archivos BAM para las réplicas técnicas con la ordenación sambamba (v1.0.1)40 y, a continuación, combina H3K27ac ChIP-seq y las réplicas de entrada correspondientes en BAM consolidados con la combinación de samamba. Si el conjunto de datos del usuario no contiene ninguna réplica técnica, omita este paso y continúe con los archivos BAM individuales.

8. Eliminar duplicados y cromosomas no esenciales

  1. Elimine los duplicados y ordene las lecturas asignadas para ChIP-seq y GRO-seq.
    1. Escriba bash Step8_1_duplicate_removal_sorting-ChIP_GRO.sh > Step8_1_log.txt 2>&1 para eliminar duplicados de los conjuntos de datos ChIP-seq de histonas y ordenar los BAM de salida ChIP-seq y GRO-seq.
      NOTA: Este script elimina los duplicados de PCR con marcado sambamba (-r) y las ordenaciones de coordenadas con la ordenación de samamba. Para H3K27ac, el procesamiento se dirige a los BAM de réplicas técnicas combinadas, manejando ChIP y entrada por separado. Para H3K4me1, cada réplica y entrada coincidente se procesan individualmente. Para GRO-seq, se omite la eliminación de duplicados y solo se aplica la ordenación de coordenadas. Las salidas se guardan en el directorio "02.Align/" de cada conjunto de datos.
  2. Elimine los duplicados y filtre las lecturas mapeadas de cromosomas mitocondriales de ATAC-seq.
    1. Escriba bash Step8_2_duplicate_chrM_removal_sorting_ATAC.sh > Step8_2_log.txt 2>&1 para eliminar duplicados de PCR, filtrar lecturas mitocondriales (chrM) y ordenar BAM ATAC-seq.
      NOTA: Este script hace referencia a las recomendaciones de canalización de ENCODE para el procesamiento de datos ATAC-seq. Comienza realizando la clasificación de nombres con sambamba sort (-n) y corrigiendo la información de pares de relaciones de posición usando samtools fixmate (-m). Este paso garantiza que la información de relación de posición se asigne correctamente antes de marcar duplicados. Posteriormente, los duplicados de PCR se eliminan utilizando el marcado sambamba (-r). Las lecturas mitocondriales se eliminan generando una lista de mantenimiento de samtools idxstats (excluye chrM y *) y conservando solo las referencias enumeradas con samtools view (-b). La clasificación final de coordenadas se realiza con la clasificación sambamba. Los BAM limpios se escriben en el directorio "02.Align/" de cada réplica.

9. Realice llamadas máximas para cada conjunto de datos

  1. Ejecute el script del paso 9 escribiendo bash Step9_peak_calling.sh > Step9_log.txt 2>&1 para realizar llamadas máximas para los datos ChIP-seq y ATAC-seq.
    NOTA: Este script realiza llamadas máximas con MACS3 (v3.0.3)41 para ATAC-seq y ChIP-seq (H3K27ac, H3K4me1). ATAC-seq genera picos suministrando todos los BAM replicados como señal en modo sin modelo con desplazamiento/extensión (-f BAMPE, --nomodel, --shift -100, --extsize 200, -q 0.01). H3K27ac llama a picos amplios de réplicas técnicas combinadas con entrada coincidente (-f BAMPE, --broad). H3K4me1 procesa cada réplica individualmente con su entrada coincidente en modo amplio de un solo extremo (-f BAM, --broad), y los picos superpuestos se obtienen con bedtools (v2.31.1)42 intersectar. Las salidas se escriben en el directorio "peak_calling/" de cada conjunto de datos, con picos H3K4me1 de alta confianza en "peak_calling/overlapped_peak/".

10. Fusionar réplicas biológicas de archivos BAM ChIP-seq y ATAC-seq para el análisis de señales aguas abajo

  1. Ejecute bash Step10_merge_rep_forMakingSignal.sh > Step10_log.txt 2>&1 para fusionar archivos BAM de réplicas biológicas de ATAC-seq y H3K4me1 ChIP-seq.
    NOTA: Este script combina BAM replicados con sambamba merge para ATAC-seq, H3K4me1 ChIP-seq y la entrada H3K4me1 correspondiente. Los BAM fusionados admiten análisis posteriores (por ejemplo, generación de señales bigWig, normalización). Los BAM de salida se guardan en los directorios "merge/02.Align/" debajo de cada ruta de muestra.

11. Generar directorios de etiquetas y señalar archivos bigWig a partir de lecturas mapeadas

  1. Ejecute bash Step11_make_tag_to_signal.sh > Step11_log.txt 2>&1 para crear directorios de etiquetas y generar archivos de señales bigWig para lecturas mapeadas de cada conjunto de datos.
    NOTA: Este script crea directorios de etiquetas HOMER con makeTagDirectory y luego genera pistas de señal bigWig con el comando makeUCSCfile usando los paquetes HOMER (v5.1)43 y ucsc-bedgraphtobigwig (v482)44 . Todas las pistas de señal se crean utilizando archivos de tamaño de cromosoma de UCSC Genome Browser (https://hgdownload.soe.ucsc.edu/goldenPath/mm10/). GRO-seq produce pistas de señal específicas de hebra (-style rnaseq, -strand + / -, -bigWig). ATAC-seq produce pistas no normalizadas a partir de BAM fusionados (-bigWig). ChIP-seq (H3K27ac, H3K4me1) produce pistas normalizadas de entrada con un pseudo-recuento de 1 (-bigWig, -i, -pseudo 1). Los resultados se organizan en "03.TagDir/" y "04.bigwig/".

12. Preparar archivos para la identificación del potenciador

  1. Escriba bash Step12_E_identification_material.sh > Step12_log.txt 2>&1 en la terminal para preparar los archivos necesarios y la referencia para la identificación del potenciador.
    NOTA: Este paso recopila todos los archivos necesarios para la identificación del potenciador en las carpetas "01.E_identification/material/", organizadas en las carpetas "ATAC/", "Histone/" y "Annotation/". Copia los archivos pico (ATAC-seq, H3K27ac, H3K4me1) en los directorios apropiados. El archivo de anotación GENCODE M23 (mm10) se descarga automáticamente y los archivos de referencia, incluida la lista negra ENCODE45 (mm10-blacklist.v2.bed) y el archivo de tamaño de cromosoma (mm10.chrom.sizes) se copian desde una ruta predefinida.

13. Identificar candidatos promotores y cuerpos de genes a partir de la anotación

  1. Escriba cd 01.E_identification/ para ingresar al directorio de trabajo, luego ejecute cp .. /scripts/Step{13..20}_*.sh ./ para copiar scripts de identificación de potenciadores.
  2. Ejecute bash Step13_promoter_candidates_genebody_identification.sh > Step13_log.txt 2>&1 para generar archivos BED para regiones promotoras, cuerpos de genes y genes codificadores de proteínas (PCG) utilizando la anotación GENCODE.
    NOTA: Este script procesa el formato de transferencia de genes (GTF) GENCODE M23 descargado para crear archivos BED para candidatos promotores, todos los cuerpos de genes y cuerpos PCG, guardando las salidas en "material/Anotación/". Los promotores se definen como una ventana de 2 kb alrededor del TSS (sitio de inicio de la transcripción) de cada transcripción con slop de herramientas de cama (-b 2000, -g mm10.chrom.sizes). Los genes y los cuerpos que codifican proteínas se derivan de las entradas GTF anotadas como genes, y las entradas que codifican proteínas se filtran aún más por "gene_type = protein_coding".

14. Picos de proceso para la identificación del potenciador

  1. Ejecute bash Step14_ATAC_ChIP-seq_processing.sh > Step14_log.txt 2>&1 para preprocesar los archivos ATAC-seq y histone ChIP-seq peak para la identificación del potenciador.
    NOTA: Este script preprocesa los conjuntos de picos para la llamada de potenciador. Para ATAC-seq, elimina las regiones que se superponen a las regiones de la lista negra con la resta de herramientas de cama (-A) y luego excluye los candidatos a promotores superpuestos de picos con la resta de herramientas de cama (-A); para las marcas de histonas (H3K27ac, H3K4me1), expande simétricamente cada pico en 1 kb a cada lado con la inclinación de los bedtools (-b 1000 -g mm10.chrom.sizes) y luego elimina las superposiciones del promotor con la resta de los bedtools.

15. Identificar y clasificar potenciadores

  1. Ejecute bash Step15_inter_intragenic_E_sets_identification.sh > Step15_log.txt 2>&1 para definir y clasificar potenciadores utilizando datos de picos de cromatina.
    NOTA: Este paso define y anota los potenciadores utilizando bedtools. Las superposiciones entre los picos ATAC-seq y los picos H3K4me1 expandidos por pendiente se obtienen con intersección (-wa, -u), y las regiones que también se superponen a los picos H3K27ac flanqueados se clasifican como potenciadores activos con intersección (-wa, -u); Los potenciadores no activos se obtienen eliminando regiones activas del conjunto completo de potenciadores con resta. Las cumbres ATAC-seq que se superponen a cada conjunto de potenciadores se recolectan con intersect (-u), luego las cumbres se dividen en intergénicas e intragénicas con intersect (-v o -u) contra el cuerpo del gen. Los intervalos de potenciadores finalmente se asignan a clases intergénicas / intragénicas en función de la cumbre asociada del pico con la intersección (-u). Todos los resultados se guardan en "01.E_identification/" en "01.allE/", "02.interE/" y "03.intraE/".

16. Asignar información temporal de hebras a potenciadores intragénicos

  1. Escriba bash Step16_assign_temp_strand_from_gene_overlap.sh > Step16_log.txt 2>&1 para asignar información temporal de hebra al BED potenciador intragénico.
    NOTA: Este paso asigna etiquetas de cadenas de genes a potenciadores intragénicos superponiendo intervalos de potenciadores con cuerpos de genes utilizando la intersección de herramientas de lecho (-wa, -wb). Las columnas 1, 2, 3, 4, 5, 16 se conservan con awk, luego los registros se ordenan y deduplican. La salida se guarda como "03.intraE/strand_designation/01.overlapped_gene_strand/ES_E_intragenic_strand_with_dup.bed".

17. Priorizar la asignación de hebras para potenciadores que se superponen a los genes de ambas hebras

  1. Escriba bash Step17_initial_strand_assignment_for_both_strand_enhancers_PCG_based.sh > Step17_log.txt 2>&1 para resolver la dirección de la hebra para los potenciadores intragénicos que se superponen en ambas hebras.
    NOTA: Este script resuelve la ambigüedad de la hebra para los potenciadores intragénicos que se superponen a los genes en ambas hebras al priorizar las superposiciones de PCG. Los potenciadores presentes en ambas hebras se aíslan primero (agrupación awk por chrom / start / end / id / strand), los casos superpuestos de PCG en la misma hebra se seleccionan con la intersección de bedtools (-s, -wa, -u) y los casos que no son de PCG se retienen con la intersección de bedtools (-v). Los conjuntos seleccionados y retenidos se concatenan y ordenan. Salida: "03.intraE/strand_designation/02.enhancer_with_PCG_priority/ES_E_intragenic_PCG_priority.bed".

18. Calcule los valores de lecturas por kilobase por millón de lecturas mapeadas (RPKM) específicas de la hebra para los genes que se superponen a los potenciadores intragénicos priorizados por PCG

  1. Escriba bash Step18_RPKM_cal_from_partially_strand_assigned_enhancers.sh > Step18_log.txt 2>&1 para calcular RPKM específicos de la hebra para los potenciadores de superposición de genes en la misma hebra.
    NOTA: Este paso utiliza "ES_E_intragenic_PCG_priority.bed" del Paso 17, que contiene potenciadores que (i) se superpusieron a una PCG en una hebra y recibieron una hebra, (ii) se superpusieron a las PCG en ambas hebras y permanecieron ambiguas, o (iii) no tuvieron superposición de PCG y retuvieron ambas hebras. Los genes superpuestos de la misma hebra se seleccionan con la intersección de bedtools (-s, -wa, -u), se convierten a GTF a través de awk y se cuantifican a partir de GRO-seq con el modo de conteo específico de la hebra featureCounts (v2.1.1)46 (-s 1, gen -t, -g gene_id, -O, --fraction). Las lecturas totales mapeadas se obtienen con sambamba flagstat, y RPKM se calcula a partir de la longitud del gen, los recuentos y los totales. Las salidas se escriben en "03.intraE/strand_designation/03.RPKM_calculation_of_overlapped_gene/".

19. Asignación final de hebras basada en la expresión génica (RPKM) de genes superpuestos

  1. Escriba bash Step19_second_strand_assignment_by_RPKM.sh > Step19_log.txt 2>&1 para finalizar la asignación de hebras para potenciadores intragénicos.
    NOTA: Este paso asigna hebras a potenciadores intragénicos utilizando el soporte de expresión génica del Paso 18. Las superposiciones de la misma hebra entre los potenciadores (ES_E_intragenic_PCG_priority.bed) y los genes se encuentran con la intersección de los bedtools (-s, -wa, -wb). Los valores de RPKM de genes se unen a intervalos de genes a través de awk / sort / join, produciendo BED de RPKM de genes. Para cada potenciador, se selecciona el gen superpuesto con el RPKM más alto y el potenciador hereda la hebra de ese gen. Los resultados se guardan en "03.intraE/strand_designation/04.enhancer_strand_designation_by_RPKM_of_gene/ES_E_intragenic_PCG_priority_strand_by_gene_RPKM.bed".

20. Asignar información de hebras a potenciadores intragénicos y cumbres de potenciadores

  1. Escriba bash Step20_strand_assignment_for_intragenicE_and_summits.sh > Step20_log.txt 2>&1 para asignar información de hebra decidida a todos los potenciadores intragénicos y a cada cumbre.
    NOTA: Este paso finaliza la asignación de hebras para potenciadores intragénicos y cumbres coincidentes utilizando bedtools. Los intervalos de hebras opuestas se eliminan con subtract (-S), los potenciadores designados por hebras se intersecan con conjuntos activos y no activos usando intersect (-wa, -u), y los archivos de cumbres se vuelven a anotar superponiendo cumbres con potenciadores designados por hebras a través de intersect (-wa, -wb) y get strand con awk. Los resultados se guardan en "03.intraE/final_strand_IntragenicE/" y su subcarpeta "summit/".

21. Preparar archivos de entrada para la validación del potenciador, la cuantificación del ARNe y la visualización

  1. Tipo cd .. / o cd ~/Enhancer-transcript-identification-from-read-to-visualization para pasar a la raíz de la canalización, luego escriba cp scripts/Step21_preparing_quantification_and_visualization.sh ./ para copiar el script para la preparación del análisis posterior.
  2. Ejecute bash Step21_preparing_quantification_and_visualization.sh > Step21_log.txt 2>&1 para preparar todos los archivos necesarios para la agregación de potenciadores, el procesamiento de señales GRO-seq y la cuantificación de eRNA.
    NOTA: Este paso prepara los archivos de entrada y la estructura de directorios para la validación del potenciador, la cuantificación de ARNe y la visualización de señales en "02.E_visualization_quantification/". Las subcarpetas se crean para archivos bigWig, BEDs potenciadores, BAMs, matrices de señales, recuentos y gráficos. Las entradas clave, como los BED de la cumbre, los peces gordos, las listas de potenciadores y los BAM de GRO-seq, se copian en las ubicaciones adecuadas.

22. Generar gráficos de agregación para la validación del potenciador

  1. Escriba cd 02.E_visualization_quantification/ para ingresar al directorio de trabajo, luego escriba cp .. /scripts/Step{22..24}_*.* ./ para copiar los scripts necesarios para el análisis posterior.
  2. Ejecute bash Step22_generation_of_aggregation_plot.sh > Step22_log.txt 2>&1 para generar gráficos de agregación de señales de cromatina alrededor de cada tipo de cumbre de potenciador.
    NOTA: Este paso visualiza el enriquecimiento de la señal de cromatina promedio centrado en las cumbres de potenciadores utilizando computeMatrix y plotProfile de deepTools (v3.5.6)47. Para cada conjunto de potenciadores definido, computeMatrix reference-point (--referencePoint center, -a 5000, -b 5000, --missingDataAsZero) calcula la densidad de la señal dentro de una ventana de 10 kb alrededor de las cumbres de potenciadores utilizando archivos bigWig para ATAC-seq, H3K27ac y H3K4me1. La matriz de salida se pasa a plotProfile, que genera curvas de agregación de señales para la comparación entre grupos de potenciadores. Los gráficos de agregación se guardan en el directorio "01.Profiling/04_1.aggregation/".

23. Cuantificar y visualizar la expresión de ARN potenciador

  1. Ejecute bash Step23_quantifing_eRNA_RPKM.sh > Step23_log.txt 2>&1 para cuantificar los niveles de expresión de ARNe de GRO-seq usando featureCounts.
    NOTA: Este paso cuantifica la transcripción de eRNA de regiones potenciadoras definidas de una manera específica de la hebra utilizando GRO-seq. Los potenciadores intergénicos se cuentan con featureCounts en modo no trenzado (-s 0, -t enhancer, -g gene_id, -O, --fraction), y los potenciadores intragénicos se cuantifican en modo antisentido (-s 2) para excluir la señal de la transcripción de genes superpuestos. Las regiones BED se convierten a GTF con awk antes de contar. El total de lecturas asignadas proviene de sambamba flagstat y los recuentos se normalizan a RPKM mediante la longitud del potenciador, los recuentos de lectura y el total de lecturas asignadas. Los productos se organizan en "02.eRNA_quantification/03.count_normalized_with_RPKM/" por "inter/" e "intra/".
  2. Ejecute Rscript Step24_visualization_of_enhancer_transcript. R > Step24_log.txt 2>&1 para visualizar y comparar los niveles de expresión de ARNe en los grupos de potenciadores utilizando R.
    NOTA: El script R utiliza los paquetes ggplot2 (v3.5.2)48 y cowplot (v1.2.0)49 para generar gráficos de violín y caja que comparan la expresión del potenciador activo y no activo en función de los valores RPKM. Para la visualización y las pruebas estadísticas, los valores de RPKM se transforman en log2 (RPKM + 1). La significación estadística se evalúa mediante la prueba de suma de rangos de Wilcoxon. Tanto los gráficos de resumen como la tabla de valores p se guardan en "03.eRNA_visualization/" para su interpretación posterior.
    NOTA: Si se produce un error en algún paso de esta canalización y persiste incluso después de volver a ejecutarlo, informe del problema en https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to visualización/problemas. Indicar claramente el paso fallido y adjuntar el archivo de registro garantiza un soporte preciso para la resolución de problemas.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Flujo de trabajo esquemático para la canalización de cuantificación de transcripciones de potenciadores
Los conjuntos de datos ChIP-seq (H3K27ac, H3K4me1), ATAC-seq y GRO-seq disponibles públicamente (Tabla 1) se procesaron con una canalización estandarizada diseñada principalmente para la validación. El recorte del adaptador y el filtrado de calidad se realizaron con Trim Galore y Cutadapt, seguidos de la alineación con el genoma de referencia mm10 us...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tras el descubrimiento de las transcripciones derivadas de potenciadores 13,14,15, la cuantificación precisa de los eRNA ha seguido siendo un desafío importante, particularmente en contextos intragénicos donde los eRNA a menudo se superponen con las transcripciones de genes del huésped. Esta superposición complica la asignación de hebras y la atribución de señales, lo que dificulta distinguir la...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de intereses que divulgar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio fue apoyado por el fondo de investigación de la Universidad Nacional de Chungnam [2022-0582-01 (S.-K.K.) y 2023-0545-01 (S.-K.K.)], Corea del Sur. La Figura 1 se creó con BioRender (https://biorender.com/).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Herramientas de camaQuinlan Lab, Universidad de Utah y nbsp;v2.31.1Utilidades para editar archivos BED
Pajarita2Laboratorio Langmead, Universidad Johns Hopkinsv2.5.4Alineador multihilo para mapeo de lecturas a un genoma de referencia
CowplotWilke Lab, Universidad de Texasv1.2.0Herramientas para combinar y alinear figuras basadas en ggplot2
cutadaptLaboratorio de Ciencia para la Vida, Universidad de Estocolmov5.1Adaptador y descortacola poli-A/G
Herramientas profundasInstalación de Bioinformática, Instituto Max Planckv3.5.6Herramienta de conteo de lecturas para cuantificar lecturas en regiones genómicas definidas
fastQCBabraham Bioinformática, Instituto Babrahamv0.12.1Control de calidad para las lecturas de secuenciación
FeatureCounts (subleído)Laboratorio Shi, Universidad Monashv2.1.1Herramientas de conteo de lecturas en bruto para regiones genómicas específicas
HomeroLaboratorio Benner, Universidad de California San Diego (UCSD)v5.1Kit de herramientas para análisis de ChIP-seq, ATAC-seq y ARN incipiente; incluye creación de directorios de etiquetas y perfilado de señales
Macs3Iniciativa Chan Zuckerbergv3.0.3Llamadas de pico para conjuntos de datos ChIP-seq y ATAC-seq
Pigz.v2.8Herramienta de compresión multihilo para generar archivos comprimidos en gzip
SamambaUniversidad Estatal de Petersburgv1.0.1Kit de herramientas para procesamiento de archivos SAM/BAM multihilo
samtoolsInstituto Wellcome Trust Sangerv1.22.1Herramientas para procesar y manipular archivos SAM/BAM
SRA-herramientasCentro Nacional de Información Biotecnológica (NCBI)v3.2.0Para descargar archivos SRR desde la base de datos NCBI SRA
tidyversePosit PBCv2.0.0Colección de paquetes R para manipulación y visualización de datos
Trim-MoloreAltos Labs, Instituto de Ciencias de Cambridgev0.6.10Adaptador y recorte de base de baja calidad usando multirosco
Ubuntu 20.04Desarrollo y pruebas de la tubería
ucsc-bedgraphtobigwig Kent Lab, Universidad de California Santa Cruzev482Herramientas para generar pistas de señal de los grandes

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bulger, M., Groudine, M. Functional and mechanistic diversity of distal transcription enhancers. Cell. 144 (3), 327-339 (2011).
  2. Smith, E., Shilatifard, A. Enhancer biology and enhanceropathies. Nat Struct Mol Biol. 21 (3), 210-219 (2014).
  3. Li, W., Notani, D., Rosenfeld, M. G. Enhancers as non-coding RNA transcription units: recent insights and future perspectives. Nat Rev Genet. 17 (4), 207-223 (2016).
  4. Whyte, W. A., et al. transcription factors and mediator establish super-enhancers at key cell identity genes. Cell. 153 (2), 307-319 (2013).
  5. Plank, J. L., Dean, A. Enhancer function: mechanistic and genome-wide insights come together. Mol Cell. 55 (1), 5-14 (2014).
  6. Alexander, J. M., et al. Brg1 modulates enhancer activation in mesoderm lineage commitment. Development. 142 (8), 1418-1430 (2015).
  7. Huang, J., et al. Dynamic control of enhancer repertoires drives lineage and stage-specific transcription during hematopoiesis. Dev Cell. 36 (1), 9-23 (2016).
  8. Xiong, L., et al. Genome-wide identification and characterization of enhancers across 10 human tissues. Int J Biol Sci. 14 (10), 1321-1332 (2018).
  9. Heintzman, N. D., et al. Histone modifications at human enhancers reflect global cell-type-specific gene expression. Nature. 459 (7243), 108-112 (2009).
  10. Creyghton, M. P., et al. Histone H3K27ac separates active from poised enhancers and predicts developmental state. Proc Natl Acad Sci. 107 (50), 21931-21936 (2010).
  11. Calo, E., Wysocka, J. Modification of enhancer chromatin: what, how, and why. Mol Cell. 49 (5), 825-837 (2013).
  12. Barakat, T. S., et al. Functional dissection of the enhancer repertoire in human embryonic stem cells. Cell Stem Cell. 23 (2), 276-288 (2018).
  13. Kim, T. -K., et al. Widespread transcription at neuronal activity-regulated enhancers. Nature. 465 (7295), 182-187 (2010).
  14. Melgar, M. F., Collins, F. S., Sethupathy, P. Discovery of active enhancers through bidirectional expression of short transcripts. Genome Biol. 12 (11), R113(2011).
  15. Djebali, S., et al. Landscape of transcription in human cells. Nature. 489 (7414), 101-108 (2012).
  16. Gorbovytska, V., et al. Enhancer RNAs stimulate Pol II pause release by harnessing multivalent interactions to NELF. Nat Commun. 13 (1), 2429(2022).
  17. Mousavi, K., et al. eRNAs promote transcription by establishing chromatin accessibility at defined genomic loci. Mol Cell. 51 (5), 606-617 (2013).
  18. Hsieh, C. -L., et al. Enhancer RNAs participate in androgen receptor-driven looping that selectively enhances gene activation. Proc Natl Acad Sci. 111 (20), 7319-7324 (2014).
  19. Schaukowitch, K., et al. Enhancer RNA facilitates NELF release from immediate early genes. Mol Cell. 56 (1), 29-42 (2014).
  20. Pnueli, L., Rudnizky, S., Yosefzon, Y., Melamed, P. RNA transcribed from a distal enhancer is required for activating the chromatin at the promoter of the gonadotropin α-subunit gene. Proc Natl Acad Sci. 112 (14), 4369-4374 (2015).
  21. Sabari, B. R., et al. Coactivator condensation at super-enhancers links phase separation and gene control. Science. 361 (6400), eaar3958(2018).
  22. Nair, S. J., et al. Phase separation of ligand-activated enhancers licenses cooperative chromosomal enhancer assembly. Nat Struct Mol Biol. 26 (3), 193-203 (2019).
  23. Lee, J. -H., et al. Enhancer RNA m6A methylation facilitates transcriptional condensate formation and gene activation. Mol Cell. 81 (16), 3368-3385 (2021).
  24. Chen, Q., et al. Enhancer RNAs in transcriptional regulation: recent insights. Front Cell Dev Biol. 11, 1205540(2023).
  25. Moon, J., et al. Embryonic stem cell-specific intragenic enhancer RNA essential for NSUN2-mediated stem cell fate regulation. Int J Biol Macromol. 245, 470(2025).
  26. Tuvikene, J., et al. Intronic enhancer region governs transcript-specific Bdnf expression in rodent neurons. Elife. 10, e65161(2021).
  27. Cheng, F., et al. Intronic enhancers of the human SNCA gene predominantly regulate its expression in brain in vivo. Sci Adv. 8 (47), eabq6324(2022).
  28. Hobson, D. J., Wei, W., Steinmetz, L. M., Svejstrup, J. Q. RNA polymerase II collision interrupts convergent transcription. Mol Cell. 48 (3), 365-374 (2012).
  29. Cinghu, S., et al. Intragenic enhancers attenuate host gene expression. Mol Cell. 68 (1), 104-117 (2017).
  30. Bressin, A., et al. High-sensitive nascent transcript sequencing reveals BRD4-specific control of widespread enhancer and target gene transcription. Nat Commun. 14 (1), 4971(2023).
  31. Lee, J., et al. Introductory analysis and validation of CUT&RUN sequencing data. J Vis Exp. (214), e67359(2024).
  32. How to install Linux on Windows with WSL. , Microsoft. https://learn.microsoft.com/en-us/windows/wsl/install (2025).
  33. Terminal user guide. , Apple. https://support.apple.com/guide/terminal/welcome/mac (2025).
  34. How to open terminal in Linux. , GeeksforGeeks. https://www.geeksforgeeks.org/linux-unix/how-to-open-terminal-in-linux/ (2025).
  35. Simon, A. FastQC: a quality control tool for high throughput sequence data. Version 0.10.1, (2010).
  36. Krueger, F. Trim Galore!: a wrapper around Cutadapt and FastQC to consistently apply adapter and quality trimming to FastQ files, with extra functionality for RRBS data. Babraham Inst. , (2015).
  37. Martin, M. Cutadapt removes adapter sequences from high-throughput sequencing reads. EMBnet J. 17 (1), 3(2011).
  38. Langmead, B., Salzberg, S. L. Fast gapped-read alignment with Bowtie 2. Nat Methods. 9 (4), 357-359 (2012).
  39. Li, H., et al. The sequence alignment/map format and SAMtools. Bioinformatics. 25 (16), 2078-2079 (2009).
  40. Tarasov, A., Vilella, A. J., Cuppen, E., Nijman, I. J., Prins, P. Sambamba: fast processing of NGS alignment formats. Bioinformatics. 31 (12), 2032-2034 (2015).
  41. Zhang, Y., et al. Model-based analysis of ChIP-Seq (MACS). Genome Biol. 9 (9), R137(2008).
  42. Quinlan, A. R., Hall, I. M. BEDTools: a flexible suite of utilities for comparing genomic features. Bioinformatics. 26 (6), 841-842 (2010).
  43. Heinz, S., et al. Simple combinations of lineage-determining transcription factors prime cis-regulatory elements required for macrophage and B cell identities. Mol Cell. 38 (4), 576-589 (2010).
  44. Kent, W. J., Zweig, A. S., Barber, G., Hinrichs, A. S., Karolchik, D. BigWig and BigBed: enabling browsing of large distributed datasets. Bioinformatics. 26 (17), 2204-2207 (2010).
  45. Amemiya, H. M., Kundaje, A., Boyle, A. P. The ENCODE blacklist: identification of problematic regions of the genome. Sci Rep. 9 (1), 9354(2019).
  46. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  47. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44, W160(2016).
  48. Wickham, H. ggplot2: elegant graphics for data analysis. , Springer. 189-201 (2016).
  49. Wilke, C. O. cowplot: streamlined plot theme and plot annotations for ggplot2. CRAN Contrib. Packages. , (2015).
  50. Andersson, R., et al. An atlas of active enhancers across human cell types and tissues. Nature. 507 (7493), 455-461 (2014).
  51. Spicuglia, S., Vanhille, L. Chromatin signatures of active enhancers. Nucleus. 3 (2), 126-131 (2012).
  52. Zentner, G. E., Tesar, P. J., Scacheri, P. C. Epigenetic signatures distinguish multiple classes of enhancers with distinct cellular functions. Genome Res. 21 (8), 1273-1283 (2011).
  53. Blinka, S., Reimer, M. H., Pulakanti, K., Rao, S. Super-enhancers at the Nanog locus differentially regulate neighboring pluripotency-associated genes. Cell Rep. 17 (1), 19-28 (2016).
  54. Zhao, S., Ye, Z., Stanton, R. Misuse of RPKM or TPM normalization when comparing across samples and sequencing protocols. RNA. 26 (8), 903-909 (2020).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Potenciadores interg nicospotenciadores intrag nicosan lisis de GRO seqdatos de ATAC seqacetilaci n de H3K27datos de picos de cromatinacuantificaci n espec fica de cadenagr ficos de agregaci n

Artículos relacionados