Artículo de método

Algoritmos de llamada de picos (WonderPeaks y PeakStream) como herramientas para mejorar el análisis transcriptómico y ChIP-seq en patógenos fúngicos

DOI:

10.3791/68301

8 de agosto de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este informe presenta WonderPeaks, una novedosa herramienta computacional para analizar datos de RNA-seq y ChIP-seq. Esta herramienta identifica con éxito los picos (léase acumulaciones) en los datos de secuenciación, lo que permite la caracterización de los límites de las regiones no traducidas en RNA-seq y la detección del enriquecimiento de la cromatina en ChIP-seq, lo que proporciona información valiosa para la investigación de patógenos fúngicos.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La caracterización de los cambios en la expresión génica a través de la transcriptómica y la actividad del regulador de la transcripción se ha convertido en un enfoque fundamental para comprender las diversas respuestas involucradas en la patogénesis fúngica. Este artículo presenta dos herramientas computacionales diseñadas para abordar desafíos clave en el estudio de la regulación transcripcional en patógenos fúngicos, particularmente no modelo con anotación genómica limitada. En primer lugar, presentamos WonderPeaks, un novedoso algoritmo de llamada de picos que aprovecha el primer derivado de datos genómicos mapeados de experimentos de secuenciación de próxima generación (NGS) para identificar picos enriquecidos en inmunoprecipitación de cromatina seguidos de secuenciación (ChIP-seq). En segundo lugar, presentamos PeakStream, una extensión de WonderPeaks para anotar regiones no traducidas (UTR) 3' en datos transcriptómicos generados mediante la preparación de bibliotecas con poli(A). Juntas, estas herramientas proporcionan una canalización de análisis de datos de extremo a extremo, ofreciendo una solución fácil de usar para los investigadores que estudian la regulación de la transcripción en hongos. Demostramos su eficacia con datos del patógeno fúngico Candida albicans, identificando con éxito picos verificados en los datos de ChIP-seq y anotando UTR validadas a través de la comparación con los datos totales de secuenciación de ARN en las mismas condiciones. También discutimos las limitaciones de WonderPeaks para los datos de ChIP-seq en comparación con los métodos actuales de vanguardia y proponemos direcciones para futuras mejoras. En última instancia, este trabajo proporciona una guía práctica y recursos poderosos para estudiar la regulación transcripcional, con relevancia inmediata para los hongos patógenos y posibles aplicaciones en estudios genómicos más amplios.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los patógenos fúngicos son un problema de salud mundial emergente, con un aumento de las infecciones en los últimos años1. Muchos de estos patógenos exhiben una alta resistencia a los antifúngicos y están asociados con tasas de mortalidad significativas2. Sin embargo, en comparación con los organismos fúngicos modelo, muchos hongos patógenos siguen estando mal caracterizados, lo que pone de manifiesto la necesidad de seguir investigando sus mecanismos de patogenicidad. Las técnicas de secuenciación de próxima generación (NGS) como la secuenciación de inmunoprecipitación de cromatina (ChIP-Seq) y la secuenciación de ARN (RNA-Seq) desempeñan un papel fundamental en el descubrimiento de los mecanismos moleculares de expresión génica subyacentes a la patogenicidad fúngica.

La calidad de los conocimientos derivados de los datos de NGS depende en gran medida de la precisión del software utilizado para el análisis de datos sin procesar. Entre los desafíos clave para el análisis de datos de NGS se encuentra la llamada máxima, que identifica con precisión las regiones de lecturas de NGS enriquecidas, que es particularmente compleja debido a la amplia variedad de técnicas de preparación y secuenciación de bibliotecas, lo que hace que una solución universal no sea práctica. El algoritmo MACS3, incluida su versión más reciente, MACS3, es ampliamente considerado como el estándar de oro para analizar conjuntos de datos ChIP-seq. Sin embargo, MACS se basa en parámetros definidos por el usuario, como la longitud mínima del pico y la brecha máxima, que pueden no ser universalmente aplicables y, a menudo, son difíciles de determinar antes del análisis. En particular, la última versión de MACS3 incluye una función de análisis de corte que permite a los usuarios estimar los parámetros antes de la llamada máxima. Para mejorar el rendimiento, los usuarios también pueden proporcionar una lista de regiones genómicas "incluidas en la lista negra" que se sabe que introducen sesgos debido a la estructura de la cromatina o la variación del número de copias. Si bien MACS sigue siendo la herramienta de llamada de picos más utilizada y confiable para los datos de ChIP-seq, hay pocos algoritmos alternativos disponibles, particularmente para casos que requieren configuraciones de parámetros altamente personalizadas.

RNA-Seq es una técnica invaluable para estudiar las respuestas de expresión génica de hongos patógenos durante el crecimiento in vivo, como en cultivos de tejidos o modelos de infección de ratón 4,5,6,7. Se requiere una alta profundidad de secuenciación para un análisis preciso de la expresión diferencial en estas condiciones, que puede ser prohibitivo en cuanto a costos y recursos 8,9. Métodos de preparación de bibliotecas como la secuenciación de poliadenilación (poli(A))-priming (3'RNA-Seq), que utiliza cebadores diseñados para recocer las colas de poli(A)del ARNm para la generación de ADNc, pueden ayudar a reducir la profundidad de secuenciación necesaria para el análisis de la expresión génica10. Sin embargo, este enfoque se basa en anotaciones genómicas de alta calidad, particularmente de regiones no traducidas (UTR) 3', donde los picos de eventos de cebado de poli (A) generalmente se encuentran11. Las anotaciones del genoma de muchos patógenos fúngicos poco estudiados carecen de anotaciones UTR, lo que dificulta el uso de 3'RNA-Seq en estos organismos. Además, la longitud de UTR para un solo gen puede ser dinámica en diferentes condiciones de crecimiento y tipos de células12,13. Si bien se han desarrollado una serie de nuevas herramientas de análisis para identificar y anotar UTR, muchas de ellas están diseñadas para conjuntos de datos de mamíferos, cuya organización genética difiere mucho de la de los hongos, o requieren datos de experimentos de secuenciación independientes, como la secuenciación de ARNm unicelular o inversa, que pueden aumentar el tiempo y los costos para un investigador que buscarealizar análisis de transcriptoma. 14,15.

En este artículo, presentamos WonderPeaks, un novedoso software de llamada de picos, diseñado según los principios de la primera derivada, que se puede utilizar para llamar dinámicamente a picos en conjuntos de datos NGS (Figura 1). WonderPeaks identifica los picos calculando la primera derivada de la señal de cobertura y utilizando este valor, la pendiente del pico, para definir los picos potenciales. El algoritmo busca instancias en las que la primera derivada exhibe un máximo local por encima de un umbral de pendiente proporcionado por el usuario o inferido por datos (lo que indica una señal creciente), seguido de un mínimo local por encima del mismo umbral (lo que indica una señal decreciente), detectando así todos los picos candidatos en el conjunto de datos. Para las aplicaciones ChIP-seq, WonderPeaks compara todos los picos candidatos entre las muestras de prueba y control para identificar picos enriquecidos de forma única. Al aplicar WonderPeaks a un conjunto de datos ChIP-seq publicado anteriormente de un factor de transcripción en el patógeno fúngico Candida albicans16, demostramos su capacidad para identificar con éxito los picos aguas arriba de los genes clave destacados en el estudio original, al tiempo que discutimos las limitaciones actuales del algoritmo en esta aplicación.

También presentamos PeakStream, una herramienta de software que aprovecha WonderPeaks para identificar picos en conjuntos de datos de 3'RNA-Seq. Las bibliotecas de 3'RNA-Seq dependen de anotaciones UTR 3' precisas, ya que las lecturas generadas a través del cebado de poli(A) a menudo se extienden más allá del codón de terminación de las secuencias codificantes (CDS) de los genes y, por lo tanto, no se cuentan cuando se utilizan anotaciones estándar centradas únicamente en regiones codificantes. La línea de análisis PeakStream fue diseñada para crear nuevas anotaciones genómicas utilizando datos de 3 'RNA-Seq, centrándose en las regiones aguas abajo de las regiones de secuencia codificante de genes (CDS). PeakStream asigna estos picos a los genes, generando una nueva anotación del genoma para su uso en programas de conteo de lecturas posteriores. Demostramos que el uso de PeakStream puede identificar y asignar con precisión picos generados por poli (A) aguas abajo al gen adecuado en un conjunto de datos de C. albicans 3'RNA-Seq. PeakStream también anota picos que es poco probable que estén asociados con las anotaciones genéticas actuales, lo que facilita el descubrimiento de posibles transcripciones novedosas. Juntos, PeakStream y WonderPeaks representan un poderoso conjunto de herramientas fáciles de usar para la detección de picos en conjuntos de datos de secuenciación de próxima generación (NGS).

figure-introduction-1
Figura 1: Figura general de llamadas de picos por WonderPeaks y PeakStream. Izquierda: Llamada de pico usando la primera derivada. Arriba a la derecha: Llamada de picos en conjuntos de datos ChIP-Seq usando WonderPeaks. Abajo a la derecha: Llamada de picos en conjuntos de datos de RNA-Seq usando PeakStream. Haga clic aquí para ver una versión más grande de esta figura.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Instalación (omitir si se ha completado)

  1. Prerrequisitos
    1. Instale Anaconda o Minconda para cargar los requisitos para ejecutar el preprocesamiento (sección 5) y WonderPeaks (sección 6 o sección 7).
      NOTA: Para obtener una guía del usuario de Anaconda, consulte la referencia16.
    2. Instale Python: Python dentro de Anaconda o Miniconda.
    3. Instale Jupyter Notebooks para ejecutar todas las funciones de este método.
      NOTA: Puede encontrar una guía de usuario para principiantes de Jupyter Notebooks en la referencia17.
      PRECAUCIÓN: Para genomas fúngicos (≤100 Mbp), asegúrese de un entorno informático con al menos 20 núcleos, 8 GB de RAM y 30 GB de espacio disponible en disco.
  2. Instale funciones de preprocesamiento.
    1. En el terminal, ejecute: conda create -n WP_preprocessing
    2. En el terminal, ejecute: conda active WP_preprocessing
    3. En la terminal, ejecute: conda env update --file environment.yml --name
      NOTA: El environment.yml es un archivo que contiene todas las dependencias del paquete y debe descargarse de https://github.com/mgarber21/WonderPeaks_preprocessing.git.
    4. En la terminal, ejecute: pip install WonderPeaks-preprocessing
    5. En el terminal, ejecute: conda desactive WP_preprocessing
  3. Instalar las funciones de WonderPeaks:
    1. En la terminal, ejecute: conda create -n WonderPeaks
    2. En la terminal, ejecute: conda active WonderPeaks
    3. En la terminal, ejecute: conda env update --file environment.yml --name
      NOTA: El environment.yml es un archivo que contiene todas las dependencias del paquete y debe descargarse de https://github.com/mgarber21/WonderPeaks.git.
    4. En la terminal, ejecute: pip install WonderPeaks
    5. En la terminal, ejecute: conda desactivar WonderPeaks
      NOTA: Los pasos 1.2 y 1.3 logran lo siguiente: Crean un entorno Conda dedicado para el preprocesamiento (sección 5) y WonderPeaks (secciones 6 y 7), aislando las dependencias para evitar conflictos con otro software. Activan el entorno, configurándolo para instalar y ejecutar WP_preprocessing o funciones específicas de WonderPeaks. Instalan las dependencias de software y las herramientas necesarias para preprocesar los datos. Desactivan el entorno cuando no están en uso para evitar modificaciones accidentales y liberar recursos del sistema.
  4. Descargue Jupyter Notebooks y plantillas desde el repositorio de GitHub de WonderPeaks. Cargue las descargas de WonderPeaks en el sistema operativo que contiene los datos sin procesar (el directorio se creará en la sección 2).
    NOTA: Los cuadernos de Jupyter Notebook contienen scripts y plantillas preescritos necesarios para ejecutar flujos de trabajo de preprocesamiento, WonderPeaks y PeakStream. Cargarlos en el mismo sistema que los datos sin procesar garantiza que las rutas y los directorios se alineen correctamente.

2. Crear un directorio de datos

NOTA: Los flujos de trabajo de WonderPeaks y PeakStream requieren que todos los datos (sin procesar y procesados) se almacenen en el mismo directorio. En este paso se explica cómo crear este nuevo directorio ({data_directory} = /path/to/your/data) y cómo mover datos sin procesar experimentales (lecturas de secuenciación sin procesar) a una carpeta dentro de este directorio llamada raw_data.

  1. Cree un directorio de datos.
    1. En el terminal, ejecute mkdir {data_directory} (por ejemplo, mkdir /ruta/a/su/datos)
  2. Cree un subdirectorio de datos sin procesar para lecturas de secuenciación sin procesar.
    1. En el terminal, ejecute mkdir {data_directory}/raw_data (por ejemplo, mkdir /ruta/a/su/datos/ raw_data)
  3. Mueva las lecturas de secuenciación sin procesar al directorio de datos sin procesar.
    1. En el terminal, ejecute mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data (por ejemplo, mv current/data/path/*fastq* /path/to/your/data /raw_data

3. Crear el archivo de entradas de usuario (NGS_user_input.csv)

NOTA: El archivo de entrada especifica las configuraciones generadas por el usuario para ejecutar el preprocesamiento y WonderPeaks.

  1. Descargue la plantilla NGS_user_inputs.csv desde el repositorio de GitHub de WonderPeaks.
  2. Actualizar campos en NGS_user_inputs.csv. Actualice los campos de la siguiente manera:
    Directorio de datos: /ruta/a/tu/datos
    Directorio del genoma: /path/to/your/genome
    Genoma fasta: genome.fasta
    Anotación del genoma: genome_annotation.gtf (proporcione el nombre de archivo de la anotación del genoma en formato GTF)
  3. Guarde NGS_user_inputs.csv actualizados en el directorio de datos creado en la sección 2.
    PRECAUCIÓN: No cambie el nombre del archivo; WonderPeaks solo reconocerá este archivo si se llama NGS_user_input.csv.

4. Crear archivo de metadatos (NGS_user_metadata.csv)

NOTA: El archivo de metadatos se utiliza para almacenar cualquier información relevante para el experimento. Se pueden agregar columnas adicionales para describir las condiciones del experimento, pero estas no afectarán los pasos posteriores.

  1. Descargue la plantilla NGS_user_metadata.csv desde el repositorio de GitHub de WonderPeaks.
  2. Actualizar campos en NGS_user_metadata.csv Los campos son los siguientes:
    1. file: asegúrese de que el nombre del archivo no tenga espacios, incluya el identificador del archivo (por ejemplo, fastq, fastq.gz) y no incluya la ruta absoluta.
    2. bedgraph: especifique si el archivo debe incluirse en PeakStream estableciendo este campo en TRUE o FALSE.
      1. Establezca el campo bedgraph en FALSE cuando el archivo se pueda excluir razonablemente del análisis de PeakStream. Por ejemplo, en un experimento de RNAseq, establezca el parámetro bedgraph bedgraph=FALSE para mutantes u otros casos en los que no se esperan diferencias UTR entre muestras. Sin embargo, asegúrese de establecer el campo bedgraph en TRUE para todos los archivos de control en un experimento RNAseq y para todos los archivos en un experimento ChIPseq .
    3. factor de diseño
      1. factor de diseño1: especifique un factor de diseño relevante para el diseño experimental (por ejemplo, tratamiento o sample_type).
      2. factor de diseño 2: especifique un segundo factor de diseño relevante para el diseño experimental (por ejemplo, deformación o epítopo). Para un experimento de RNAseq , incluya el tratamiento y la cepa como factores de diseño típicos. La columna de tratamiento enumera los tratamientos aplicados (p. ej., control, fármaco1) y la columna de cepa enumera la información de la cepa (p. ej., tipo salvaje, mutante). Para un experimento ChIPseq , incluya sample_type y epítopo como factores de diseño típicos. La columna sample_type enumera si la proteína fue etiquetada o no etiquetada, y la columna de epítopo enumera el nombre del epítopo utilizado.
        NOTA: los factores de diseño son atributos específicos del diseño experimental.
        WonderPeaks es compatible con controles sin etiquetar o controles de entrada como línea de base.
      3. Asegúrese de que las columnas de factor de diseño no incluyan un número de réplica único (por ejemplo, sample_type: [tagged, tagged, untagged_control, untagged_control] y no sample_type: [tagged_1, tagged_2, untagged_control _1, untagged_control _2]. Proporcionar números de réplica únicos dará como resultado un error durante la ejecución.
      4. Asegúrese de utilizar guiones bajos (_) en lugar de espacios en los nombres de los factores de diseño.
      5. Para la aplicación ChIPseq, asegúrese de que la columna sample_type (o nombre personalizado) del archivo de metadatos incluya términos que contengan palabras tag y control.
        NOTA: Por ejemplo, las entradas válidas podrían incluir etiquetado y untagged_control. Proporcionar una columna sample_type sin estos términos dará lugar a un error durante la ejecución.
        PRECAUCIÓN: Para la aplicación ChIP, el usuario debe especificar dos factores de diseño.
      6. Agregue factores de diseño a la fila de NGS_user_inputs.csv correspondiente. Asegúrese de que los nombres de columna utilizados para los factores de diseño se muestren como una cadena separada por punto y coma (por ejemplo, tratamiento; distensión o sample_type; epítopo).
        PRECAUCIÓN: Los factores de diseño en NGS_user_inputs.csv deben coincidir exactamente con las columnas de NGS_user_metadata.csv . Cualquier ejecución no coincidente dará lugar a un error durante la ejecución (Figura 2, Tabla complementaria S1 y Tabla complementaria S2).

figure-protocol-1
Figura 2: Ejemplo NGS_user_input.csv y NGS_user_metadata.csv. Ejemplos de NGS_user_input.csv (panel superior) y NGS_user_metadata.csv (panel inferior), resaltando la coincidencia entre las columnas designfactor y designfactor con texto y flechas rosas o azules. Haga clic aquí para ver una versión más grande de esta figura.

5. Preprocesamiento de datos NGS

NOTA: Vaya a la sección 5 o a la sección 6 si utiliza el preprocesamiento personalizado.

  1. Abra el cuaderno de Jupyter Notebook de preprocesamiento de NGS (NGS_Preprocessing.ipynb).
  2. Active WP_preprocessing entorno (creado en el paso 1.2) en la esquina superior derecha de la interfaz del bloc de notas.
  3. Ejecute la primera celda manteniendo presionada la tecla Mayús y luego presionando Enter (Shift + Enter).
  4. En la segunda celda del Jupyter Notebook, actualice la ruta del directorio estableciendo Directory = "path/to/your/data", donde path/to/your/data/ es el directorio creado en la sección 2.
  5. Generar archivos de alineación. Las funciones de preprocesamiento realizarán el recorte usando FastP18; Control de calidad mediante FastQC19 y MultiQC20; Alineación con STAR21. Los archivos de alineación de salida se guardan en un subdirectorio llamado startout dentro del directorio de datos (por ejemplo, path/to/your/data/starout); Filtrado (opcional) usando samtools view22, filtra el archivo de alineación para mantener solo las lecturas por encima de un umbral especificado en NGS_user_inputs.csv.
    NOTA: Estas funciones procesarán solo lecturas individuales (por ejemplo, R1) del conjunto de datos a la vez. Los usuarios pueden especificar opciones de ejecución para FastP y STAR en el NGS_user_inputs.csv (por ejemplo, FastP: adapter_sequence (opcional); STAR: genomeDir, genomeFastaFiles, sjdbGTFfil).
  6. Ejecute funciones de preprocesamiento en la segunda celda con Mayús + Intro.
    NOTA: Las tareas en la segunda celda pueden tardar varias horas en completarse. Si se interrumpe la ejecución, repita los pasos 5.3 a 5.6 para reiniciar la ejecución. El progreso de los pasos anteriores no se sobrescribirá y el proceso continuará donde lo dejó.
  7. Genere archivos de seguimiento de la cobertura de alineación utilizando BamCoverage23 (consulte los pasos 5.7.1 y 5.7.2).
    NOTA: Para ChIPseq, WonderPeaks requiere archivos de gráfico de base única que contengan cobertura para lecturas directas e inversas. Para RNAseq con cebado Poly(A), PeakStream requiere dos archivos de bedgraph, uno para lecturas directas (_fwd.bedgraph) y otro para lecturas inversas (_rev.bedgraph). Las lecturas directas e inversas se generan utilizando el parámetro filterRNAstrand dentro de BamCoverage23.
    1. ChIPseq usando los siguientes parámetros: outfilfeformat="bedgraph", strand=None, binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      NOTA: Salida: Produce archivos de gráfico de base única que contienen cobertura para lecturas directas e inversas. La salida se almacena en /path/to/your/data/bedgraphout (Figura 3).
      1. Ejecute la función BamCoverage en la tercera celda usando Mayús + Entrar.
    2. RNAseq usando los siguientes parámetros: outfilfeformat="bedgraph", strand="forward" or "reverse", binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      PRECAUCIÓN: Asegúrese de ejecutar la función dos veces con la hebra configurada en adelante o atrás para generar archivos para lecturas en ambas direcciones.
      NOTA: Salida: Produce dos archivos de bedgraph: uno para lecturas directas (_fwd.bedgraph) y otro para lecturas inversas (_rev.bedgraph). La salida se almacena en /path/to/your/data/ bedgraphout (Figura 3).
      1. Ejecute la función BamCoverage en la tercera celda usando Mayús + Entrar.

figure-protocol-2
Figura 3: Organización de archivos para WonderPeaks. Una captura de pantalla de la carpeta de datos con los archivos bedgraph en el directorio bedgrapghout/normalizeUsingCPM. Haga clic aquí para ver una versión más grande de esta figura.

6. WonderPeaks para ChIPseq

  1. Comprobación previa
    1. Confirme que todos los archivos bedgraph con filehandle .bedgraph estén en un subdirectorio dentro del directorio de datos llamado bedgraphout (Figura 3).
    2. Confirme que los factores de diseño de user_inputs archivo (NGS_user_inputs.csv) (figura 2) coincidan con las columnas del archivo de metadatos (NGS_user_metadata.csv) y que las filas de las columnas de factores de diseño no sean únicas (consulte la precaución en el paso 4.2.4).
  2. Abra el cuaderno de Jupyter Notebook de preprocesamiento de NGS (WP4ChIP.ipynb).
  3. Active WonderPeaks (entorno creado en el paso 1.3) en la esquina superior derecha de la interfaz del bloc de notas.
  4. Ejecute las celdas con Mayús+Entrar hasta el punto de interrupción para ejecutar la llamada máxima. Una vez finalizado, se guardará un registro de los datos procesados y se almacenará en un subdirectorio dentro del directorio de datos llamado WonderPeaks
    1. Busque WOnder_init.csv: una concatenación de toda la cobertura bruta y los resultados del cálculo de la primera derivada.
    2. Nota WOnder_unfiltered_peaks.csv: una concatenación de todos los picos sin filtrar llamados en función de la primera derivada.
    3. Observe bedgraph_summary.csv: un resumen de las estadísticas de puntuación después de agrupar cada archivo y cromosoma.
  5. Defina los parámetros de ejecución:
    1. Ejecute la celda debajo del punto de interrupción de la rebaja.
      NOTA: Aparecerá un gráfico que muestra los datos sin procesar segregados por los factores de diseño especificados y una tabla que muestra los factores de diseño; use la tabla y el gráfico para determinar los valores en los pasos posteriores (Figura 4).
    2. En la siguiente celda, especifique los valores de score_cut, fold_change y designfactor (Figura 4).
      1. score_cut es el valor umbral utilizado para determinar si se debe considerar un pico en la salida. Para determinar la score_cut, observe el gráfico y elija un valor cercano a la mediana de los datos etiquetados (consulte la línea hash, Figura 4). Introduzca este valor de la siguiente manera: score_cut= valor.
      2. fold_change es el valor umbral de las puntuaciones de proporción de tagged:untagged que se utiliza para determinar si un pico se considera real. Para determinar la fold_change, observe el gráfico y elija un valor por encima de la relación de las medianas de los datos etiquetados y sin etiquetar. Introduzca este valor de la siguiente manera: fold_change= valor.
      3. designfactor_value se especifica como parte del diseño experimental. Los posibles factores de diseño se enumeran en rojo en la tabla impresa. Para determinar el factor de diseño, elija uno de los valores enumerados en rojo. Introduzca este valor entre comillas de la siguiente manera: designfactor_value ="{ valor}".
  6. Ejecute las siguientes celdas usando Mayús + Entrar para ejecutar el filtrado y la asignación de picos. Los datos y los gráficos de resumen se almacenarán en un subdirectorio dentro del directorio de datos llamado WonderPeaks.
    1. Observe {designfactor_value}_taggedVuntagged.csv: una tabla dinámica de todos los picos superpuestos con columna para cada una de las muestras etiquetadas y no etiquetadas.
    2. Nota {designfactor_value}_all_tagged_peaks.csv: Una tabla resumen de todos los picos reales, basada en parámetros de usuario (paso 6.5).
    3. Observe {designfactor_value}_peaks2gtf.csv: Un mapeo de los picos reales, basado en parámetros del usuario (paso 6.5), a los genes en el archivo de anotaciones especificado por el usuario.
  7. Opcional: Alterna los parámetros del paso 6.5 volviendo a ejecutar los pasos 6.5-6.6. Si se utiliza el mismo designfactor_value, los archivos generados, como se describe en el paso 6.6, se sobrescribirán.

figure-protocol-3
Figura 4: Captura de pantalla que resalta los umbrales designfactor_value y especificados por el usuario en WonderPeaks para ChIP-seq. Captura de pantalla del cuaderno jupyter de WonderPeaks, destacando las posibles opciones de designfactor_value de la tabla mostrada y cómo implementar el designfactor_value en la siguiente celda. La flecha negra superior apunta a una tabla que muestra posibles entradas de designfactor_value; el valor de Op se encierra en un círculo y se muestra como la entrada del usuario seleccionada para designfactor_value en la celda de opciones (flecha negra inferior). En el gráfico, las líneas continuas y discontinuas indican las puntuaciones máximas medianas aproximadas para muestras etiquetadas y no etiquetadas, respectivamente, en los experimentos de células opacas. Estas medianas se utilizan para definir los parámetros score_cut (mediana etiquetada) y fold_change (la proporción de medianas etiquetadas y no etiquetadas). Haga clic aquí para ver una versión más grande de esta figura.

7. PeakStream para 3'RNAseq

  1. Comprobación previa:
    1. Confirme que todos los archivos de bedgraph están en un subdirectorio dentro del directorio de datos llamado bedgraphout (Figura 2).
    2. Abrir el cuaderno de Jupyter Notebook de preprocesamiento de NGS (PeakStream.ipynb)
    3. Active WonderPeaks (entorno creado en el paso 1.3) en la esquina superior derecha de la interfaz del bloc de notas.
  2. Ejecute las celdas con Mayús+Entrar hasta el punto de interrupción para ejecutar la llamada de picos y la asignación de picos. Una vez terminado, se guardará un nuevo archivo de anotación con UTR de 3' predichos y archivos de recuento de lecturas de FeatureCounts24 y se almacenará en un subdirectorio dentro de su directorio de datos llamado PeakStream (Figura 5).
    NOTA: De forma predeterminada, el archivo de salida solo incluirá anotaciones para biotipos de codificación de proteínas, pero esto se puede alternar usando la opción biotipo.

figure-protocol-4
Figura 5: Organización de archivos para PeakStream. Una captura de pantalla de la carpeta de datos con los archivos bedgraph en el directorio bedgrapghout. Haga clic aquí para ver una versión más grande de esta figura.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Picos Maravilla
Después de realizar un experimento de ChIP-seq, los investigadores suelen utilizar llamadas de pico, como MACS3, para identificar regiones genómicas enriquecidas por una proteína de unión al ADN marcada con epítopos. Desarrollamos WonderPeaks como un llamador de picos fácil de usar diseñado para identificar picos utilizando el método descrito anteriormente.

WonderPeaks identifica los picos calculando primero la primera derivada de la ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Las técnicas de secuenciación de próxima generación (NGS) brindan una visión incomparable de la regulación y expresión génica en patógenos fúngicos. Como tal, las herramientas computacionales deben ser integrales, capturando todos los datos generados en un experimento, y accesibles para los usuarios en general, particularmente los científicos de banco. En este informe, presentamos dos herramientas, WonderPeaks y PeakStream, que abordan estas necesidades de los investigadores de patógenos...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por las subvenciones RO1AI175080 y R01GM037049 de los Institutos Nacionales de Salud (NIH) (a Alexander D. Johnson) y una subvención de capacitación NIH T32 AI 60537-20 (a H.G). Agradecemos a Alexander Johnson, Matthew Lohse, Jenny Zhang y Brian Wang por sus útiles discusiones y consejos. También agradecemos a los miembros del Laboratorio de Carol Gross por sus comentarios. Agradecemos a Ananda Mendoza por su apoyo técnico. La secuenciación se realizó en el CAT de la UCSF, con el apoyo de las subvenciones UCSF PBBR, RRP IMIA y NIH 1S10OD028511-01. Reconocemos el uso de ChatGPT de OpenAI para ayudar a solucionar problemas de código y brindar sugerencias para editar el manuscrito.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Kit de secuenciación de ARN total CORALL V1Lexogen095Material de laboratorio húmedo
Hongos filamentosos riboPOOLsiTOOLsdp-P096-6 Material delaboratorio húmedo
Cinta de pantalla de ARN de alta sensibilidadAgilent5067-5579Material de laboratorio húmedo
Escalera de cinta de pantalla de ARN de alta sensibilidadAgilent5067-5581Material de laboratorio húmedo 
Tampón de muestra de cinta de pantalla de ARN de alta sensibilidadAgilent5067-5580Material de laboratorio húmedo 
lista de dependencias para WonderPeaks
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymllista de dependencias para WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040LMaterial de laboratorio húmedo 
pygenometracks (3.9)
QuantSeq 3′ mRNA-Seq FWD Library Prep Kit V1Lexogen015Material de laboratorio húmedo 
Kit de ensayo de alta sensibilidad (HS) de ARN QubitInvitrogenQ32852Material delaboratorio húmedo 
ARN limpio y Concentrador-5Zymo ResearchR1016Material de laboratorio húmedo
Kit TURBO sin ADNThermoFisherAM1907Material de laboratorio húmedo
WonderPeaks(0.1.14)
WonderPeaks_preprocessing(0.2.3)
https://github.com/mgarber21/WonderPeaks/blob/main/environment.yml

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

An lisis de ChIP SeqAlgoritmo WonderPeaksHerramienta PeakStreamRegulaci n de la transcripci nAnotaci n de la regi n 3 UTRSecuenciaci n de nueva generaci nCandida albicans
Video próximamente

Artículos relacionados