$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Грибковые патогены представляют собой новую глобальную проблему здравоохранения, и в последние годы число инфекций возросло1. Многие из этих патогенов проявляют высокую устойчивость к противогрибковым препаратам и связаны со значительными показателямисмертности2. Однако, по сравнению с модельными грибковыми организмами, многие патогенные грибы остаются слабо охарактеризованными, что подчеркивает необходимость дальнейших исследований механизмов их патогенности. Методы секвенирования нового поколения (NGS), такие как иммунопреципитационное секвенирование хроматина (ChIP-Seq) и секвенирование РНК (RNA-Seq), играют решающую роль в раскрытии молекулярных механизмов экспрессии генов, лежащих в основе грибковой патогенности.
Качество аналитических сведений, полученных на основе данных NGS, в значительной степени зависит от точности программного обеспечения, используемого для анализа необработанных данных. Одной из ключевых проблем анализа данных NGS является пиковый вызов — точное определение областей обогащенных чтений NGS, что особенно сложно из-за большого разнообразия методов подготовки библиотек и секвенирования, что делает универсальное решение непрактичным. Алгоритм MACS3, включая его более позднюю версию, MACS3, широко известен как золотой стандарт для анализа наборов данных ChIP-seq. Тем не менее, MACS полагается на определяемые пользователем параметры, такие как минимальная длина пика и максимальный зазор, которые могут быть не универсально применимы и часто трудно определить до анализа. Примечательно, что последняя версия MACS3 включает в себя функцию анализа отсечки, которая позволяет пользователям оценивать параметры перед пиковым вызовом. Для повышения производительности пользователи также могут предоставить список «черных» областей генома, которые, как известно, вносят смещение из-за структуры хроматина или вариации числа копий. Несмотря на то, что MACS остается наиболее часто используемым и надежным инструментом для обработки данных ChIP-seq, существует несколько альтернативных алгоритмов, особенно для случаев, требующих узкоспециализированных настроек параметров.
РНК-Seq является бесценным методом для изучения реакций экспрессии генов патогенных грибов во время роста in vivo, например, в культуре тканей или на моделях мышиной инфекции 4,5,6,7. Для точного анализа дифференциальной экспрессии в этих условиях требуется большая глубина секвенирования, которая может быть недоступной по стоимости и ресурсам 8,9. Методы подготовки библиотек, такие как полиаденилирование (поли(А)))-праймирование секвенирования (3'RNA-Seq), в котором используются праймеры, предназначенные для отжига поли(А)-хвостов мРНК для генерации кДНК, могут помочь уменьшить глубину секвенирования, необходимуюдля анализа экспрессии генов. Тем не менее, этот подход опирается на высококачественные аннотации генома, в частности, 3'-нетранслируемых областей (UTR), где пики от событий поли(А)-прайминга обычно расположены11. В аннотациях генома многих малоизученных грибковых патогенов отсутствуют какие-либо аннотации UTR, что затрудняет использование 3'RNA-Seq в этих организмах. Кроме того, длина UTR для одного гена может быть динамической при различных условиях роста и типах клеток12,13. Несмотря на то, что для идентификации и аннотирования UTR был разработан ряд новых инструментов анализа, многие из них предназначены для наборов данных млекопитающих, чья организация генов сильно отличается от структуры грибов, или требуют данных независимых экспериментов по секвенированию, таких как секвенирование одиночных клеток или обратной мРНК, что может увеличить время и затраты для исследователя, желающегопровести транскриптомный анализ. 14,15.
В этой статье мы представляем WonderPeaks, новое программное обеспечение для вызова пиков, разработанное на принципах первой производной, которое может быть использовано для динамического вызова пиков в наборах данных NGS (рис. 1). WonderPeaks определяет пики, вычисляя первую производную сигнала покрытия и используя это значение - наклон пика - для определения потенциальных пиков. Алгоритм ищет случаи, когда первая производная демонстрирует локальный максимум выше порога наклона, предоставленного пользователем или выведенного из данных (что указывает на растущий сигнал), за которым следует локальный минимум выше того же порога (что указывает на убывающий сигнал), тем самым обнаруживая все потенциальные пики в наборе данных. Для приложений ChIP-seq WonderPeaks сравнивает все потенциальные пики между тестовыми и контрольными образцами, чтобы определить уникально обогащенные пики. Применив WonderPeaks к ранее опубликованному набору данных ChIP-seq о факторе транскрипции грибкового патогена Candida albicans16, мы продемонстрировали его способность успешно идентифицировать пики перед ключевыми генами, выделенными в оригинальном исследовании, а также обсудили текущие ограничения алгоритма в этом приложении.
Мы также представляем PeakStream — программный инструмент, который использует WonderPeaks для определения пиков в наборах данных 3'RNA-Seq. Библиотеки 3'RNA-Seq зависят от точных аннотаций 3' UTR, поскольку чтения, полученные с помощью поли(А)-прайминга, часто выходят за пределы стоп-кодона кодирующих последовательностей (CDS) генов и, таким образом, не учитываются при использовании стандартных аннотаций, ориентированных исключительно на кодирующие области. Конвейер анализа PeakStream был разработан для создания новых аннотаций генома с использованием данных 3' RNA-Seq, уделяя особое внимание областям ниже областей кодирующей последовательности генов (CDS). PeakStream присваивает эти пики генам, генерируя новую аннотацию генома для использования в программах подсчета последующих считываний. Мы показываем, что использование PeakStream позволяет точно идентифицировать и отнести нисходящие поли(A)-генерируемые пики к соответствующему гену в наборе данных 3'RNA-Seq C. albicans . PeakStream также аннотирует пики, которые вряд ли могут быть связаны с какими-либо текущими аннотациями генов, что облегчает обнаружение возможных новых транскриптов. Вместе PeakStream и WonderPeaks представляют собой мощный набор удобных инструментов для обнаружения пиков в наборах данных секвенирования нового поколения (NGS).

Рисунок 1: Обзорный рисунок пиковых вызовов от WonderPeaks и PeakStream. Слева: Пиковый колл с использованием первой производной. Вверху справа: вызов пиков в наборах данных ChIP-Seq с помощью WonderPeaks. Внизу справа: вызов пика в наборах данных RNA-Seq с помощью PeakStream. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.