$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Los patógenos fúngicos son un problema de salud mundial emergente, con un aumento de las infecciones en los últimos años1. Muchos de estos patógenos exhiben una alta resistencia a los antifúngicos y están asociados con tasas de mortalidad significativas2. Sin embargo, en comparación con los organismos fúngicos modelo, muchos hongos patógenos siguen estando mal caracterizados, lo que pone de manifiesto la necesidad de seguir investigando sus mecanismos de patogenicidad. Las técnicas de secuenciación de próxima generación (NGS) como la secuenciación de inmunoprecipitación de cromatina (ChIP-Seq) y la secuenciación de ARN (RNA-Seq) desempeñan un papel fundamental en el descubrimiento de los mecanismos moleculares de expresión génica subyacentes a la patogenicidad fúngica.
La calidad de los conocimientos derivados de los datos de NGS depende en gran medida de la precisión del software utilizado para el análisis de datos sin procesar. Entre los desafíos clave para el análisis de datos de NGS se encuentra la llamada máxima, que identifica con precisión las regiones de lecturas de NGS enriquecidas, que es particularmente compleja debido a la amplia variedad de técnicas de preparación y secuenciación de bibliotecas, lo que hace que una solución universal no sea práctica. El algoritmo MACS3, incluida su versión más reciente, MACS3, es ampliamente considerado como el estándar de oro para analizar conjuntos de datos ChIP-seq. Sin embargo, MACS se basa en parámetros definidos por el usuario, como la longitud mínima del pico y la brecha máxima, que pueden no ser universalmente aplicables y, a menudo, son difíciles de determinar antes del análisis. En particular, la última versión de MACS3 incluye una función de análisis de corte que permite a los usuarios estimar los parámetros antes de la llamada máxima. Para mejorar el rendimiento, los usuarios también pueden proporcionar una lista de regiones genómicas "incluidas en la lista negra" que se sabe que introducen sesgos debido a la estructura de la cromatina o la variación del número de copias. Si bien MACS sigue siendo la herramienta de llamada de picos más utilizada y confiable para los datos de ChIP-seq, hay pocos algoritmos alternativos disponibles, particularmente para casos que requieren configuraciones de parámetros altamente personalizadas.
RNA-Seq es una técnica invaluable para estudiar las respuestas de expresión génica de hongos patógenos durante el crecimiento in vivo, como en cultivos de tejidos o modelos de infección de ratón 4,5,6,7. Se requiere una alta profundidad de secuenciación para un análisis preciso de la expresión diferencial en estas condiciones, que puede ser prohibitivo en cuanto a costos y recursos 8,9. Métodos de preparación de bibliotecas como la secuenciación de poliadenilación (poli(A))-priming (3'RNA-Seq), que utiliza cebadores diseñados para recocer las colas de poli(A)del ARNm para la generación de ADNc, pueden ayudar a reducir la profundidad de secuenciación necesaria para el análisis de la expresión génica10. Sin embargo, este enfoque se basa en anotaciones genómicas de alta calidad, particularmente de regiones no traducidas (UTR) 3', donde los picos de eventos de cebado de poli (A) generalmente se encuentran11. Las anotaciones del genoma de muchos patógenos fúngicos poco estudiados carecen de anotaciones UTR, lo que dificulta el uso de 3'RNA-Seq en estos organismos. Además, la longitud de UTR para un solo gen puede ser dinámica en diferentes condiciones de crecimiento y tipos de células12,13. Si bien se han desarrollado una serie de nuevas herramientas de análisis para identificar y anotar UTR, muchas de ellas están diseñadas para conjuntos de datos de mamíferos, cuya organización genética difiere mucho de la de los hongos, o requieren datos de experimentos de secuenciación independientes, como la secuenciación de ARNm unicelular o inversa, que pueden aumentar el tiempo y los costos para un investigador que buscarealizar análisis de transcriptoma. 14,15.
En este artículo, presentamos WonderPeaks, un novedoso software de llamada de picos, diseñado según los principios de la primera derivada, que se puede utilizar para llamar dinámicamente a picos en conjuntos de datos NGS (Figura 1). WonderPeaks identifica los picos calculando la primera derivada de la señal de cobertura y utilizando este valor, la pendiente del pico, para definir los picos potenciales. El algoritmo busca instancias en las que la primera derivada exhibe un máximo local por encima de un umbral de pendiente proporcionado por el usuario o inferido por datos (lo que indica una señal creciente), seguido de un mínimo local por encima del mismo umbral (lo que indica una señal decreciente), detectando así todos los picos candidatos en el conjunto de datos. Para las aplicaciones ChIP-seq, WonderPeaks compara todos los picos candidatos entre las muestras de prueba y control para identificar picos enriquecidos de forma única. Al aplicar WonderPeaks a un conjunto de datos ChIP-seq publicado anteriormente de un factor de transcripción en el patógeno fúngico Candida albicans16, demostramos su capacidad para identificar con éxito los picos aguas arriba de los genes clave destacados en el estudio original, al tiempo que discutimos las limitaciones actuales del algoritmo en esta aplicación.
También presentamos PeakStream, una herramienta de software que aprovecha WonderPeaks para identificar picos en conjuntos de datos de 3'RNA-Seq. Las bibliotecas de 3'RNA-Seq dependen de anotaciones UTR 3' precisas, ya que las lecturas generadas a través del cebado de poli(A) a menudo se extienden más allá del codón de terminación de las secuencias codificantes (CDS) de los genes y, por lo tanto, no se cuentan cuando se utilizan anotaciones estándar centradas únicamente en regiones codificantes. La línea de análisis PeakStream fue diseñada para crear nuevas anotaciones genómicas utilizando datos de 3 'RNA-Seq, centrándose en las regiones aguas abajo de las regiones de secuencia codificante de genes (CDS). PeakStream asigna estos picos a los genes, generando una nueva anotación del genoma para su uso en programas de conteo de lecturas posteriores. Demostramos que el uso de PeakStream puede identificar y asignar con precisión picos generados por poli (A) aguas abajo al gen adecuado en un conjunto de datos de C. albicans 3'RNA-Seq. PeakStream también anota picos que es poco probable que estén asociados con las anotaciones genéticas actuales, lo que facilita el descubrimiento de posibles transcripciones novedosas. Juntos, PeakStream y WonderPeaks representan un poderoso conjunto de herramientas fáciles de usar para la detección de picos en conjuntos de datos de secuenciación de próxima generación (NGS).

Figura 1: Figura general de llamadas de picos por WonderPeaks y PeakStream. Izquierda: Llamada de pico usando la primera derivada. Arriba a la derecha: Llamada de picos en conjuntos de datos ChIP-Seq usando WonderPeaks. Abajo a la derecha: Llamada de picos en conjuntos de datos de RNA-Seq usando PeakStream. Haga clic aquí para ver una versión más grande de esta figura.