Методическая статья

Алгоритмы вызова пиков (WonderPeaks и PeakStream) как инструменты для улучшения ChIP-seq и транскриптомного анализа у грибковых патогенов

DOI:

10.3791/68301

8 августа 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом отчете представлен WonderPeaks, новый вычислительный инструмент для анализа данных RNA-seq и ChIP-seq. Этот инструмент успешно идентифицирует пики (считывание pileups) в данных секвенирования, позволяя охарактеризовать нетранслируемые границы областей в RNA-seq и обнаруживать обогащение хроматином в ChIP-seq, предоставляя ценную информацию для исследований грибковых патогенов.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Характеристика изменений в экспрессии генов с помощью транскриптомики и активности регулятора транскрипции стала фундаментальным подходом к пониманию различных реакций, участвующих в грибковом патогенезе. В данной статье представлены два вычислительных инструмента, предназначенных для решения ключевых проблем в изучении регуляции транскрипции у грибковых патогенов, в частности, немодельных с ограниченной геномной аннотацией. Во-первых, мы представляем WonderPeaks, новый алгоритм вызова пиков, который использует первую производную картированных геномных данных из экспериментов по секвенированию нового поколения (NGS) для идентификации обогащенных пиков в иммунопреципитации хроматина с последующим секвенированием (ChIP-seq). Во-вторых, мы представляем PeakStream, расширение WonderPeaks для аннотирования 3'-нетранслируемых областей (UTR) в транскриптомных данных, сгенерированных с помощью подготовки поли(A)-праймированной библиотеки. Вместе эти инструменты обеспечивают сквозной конвейер анализа данных, предлагая удобное решение для исследователей, изучающих регуляцию транскрипции в грибах. Мы демонстрируем их эффективность на данных по грибковому патогену Candida albicans, успешно выявляя верифицированные пики в данных ChIP-seq и аннотируя валидированные UTR путем сравнения с данными секвенирования общей РНК в тех же условиях. Мы также обсуждаем ограничения WonderPeaks для данных ChIP-seq по сравнению с текущими современными методами и предлагаем направления для будущих улучшений. В конечном счете, эта работа предоставляет практическое руководство и мощные ресурсы для изучения транскрипционной регуляции, имеющей непосредственное отношение к патогенным грибам и потенциальным приложениям в более широких геномных исследованиях.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Грибковые патогены представляют собой новую глобальную проблему здравоохранения, и в последние годы число инфекций возросло1. Многие из этих патогенов проявляют высокую устойчивость к противогрибковым препаратам и связаны со значительными показателямисмертности2. Однако, по сравнению с модельными грибковыми организмами, многие патогенные грибы остаются слабо охарактеризованными, что подчеркивает необходимость дальнейших исследований механизмов их патогенности. Методы секвенирования нового поколения (NGS), такие как иммунопреципитационное секвенирование хроматина (ChIP-Seq) и секвенирование РНК (RNA-Seq), играют решающую роль в раскрытии молекулярных механизмов экспрессии генов, лежащих в основе грибковой патогенности.

Качество аналитических сведений, полученных на основе данных NGS, в значительной степени зависит от точности программного обеспечения, используемого для анализа необработанных данных. Одной из ключевых проблем анализа данных NGS является пиковый вызов — точное определение областей обогащенных чтений NGS, что особенно сложно из-за большого разнообразия методов подготовки библиотек и секвенирования, что делает универсальное решение непрактичным. Алгоритм MACS3, включая его более позднюю версию, MACS3, широко известен как золотой стандарт для анализа наборов данных ChIP-seq. Тем не менее, MACS полагается на определяемые пользователем параметры, такие как минимальная длина пика и максимальный зазор, которые могут быть не универсально применимы и часто трудно определить до анализа. Примечательно, что последняя версия MACS3 включает в себя функцию анализа отсечки, которая позволяет пользователям оценивать параметры перед пиковым вызовом. Для повышения производительности пользователи также могут предоставить список «черных» областей генома, которые, как известно, вносят смещение из-за структуры хроматина или вариации числа копий. Несмотря на то, что MACS остается наиболее часто используемым и надежным инструментом для обработки данных ChIP-seq, существует несколько альтернативных алгоритмов, особенно для случаев, требующих узкоспециализированных настроек параметров.

РНК-Seq является бесценным методом для изучения реакций экспрессии генов патогенных грибов во время роста in vivo, например, в культуре тканей или на моделях мышиной инфекции 4,5,6,7. Для точного анализа дифференциальной экспрессии в этих условиях требуется большая глубина секвенирования, которая может быть недоступной по стоимости и ресурсам 8,9. Методы подготовки библиотек, такие как полиаденилирование (поли(А)))-праймирование секвенирования (3'RNA-Seq), в котором используются праймеры, предназначенные для отжига поли(А)-хвостов мРНК для генерации кДНК, могут помочь уменьшить глубину секвенирования, необходимуюдля анализа экспрессии генов. Тем не менее, этот подход опирается на высококачественные аннотации генома, в частности, 3'-нетранслируемых областей (UTR), где пики от событий поли(А)-прайминга обычно расположены11. В аннотациях генома многих малоизученных грибковых патогенов отсутствуют какие-либо аннотации UTR, что затрудняет использование 3'RNA-Seq в этих организмах. Кроме того, длина UTR для одного гена может быть динамической при различных условиях роста и типах клеток12,13. Несмотря на то, что для идентификации и аннотирования UTR был разработан ряд новых инструментов анализа, многие из них предназначены для наборов данных млекопитающих, чья организация генов сильно отличается от структуры грибов, или требуют данных независимых экспериментов по секвенированию, таких как секвенирование одиночных клеток или обратной мРНК, что может увеличить время и затраты для исследователя, желающегопровести транскриптомный анализ. 14,15.

В этой статье мы представляем WonderPeaks, новое программное обеспечение для вызова пиков, разработанное на принципах первой производной, которое может быть использовано для динамического вызова пиков в наборах данных NGS (рис. 1). WonderPeaks определяет пики, вычисляя первую производную сигнала покрытия и используя это значение - наклон пика - для определения потенциальных пиков. Алгоритм ищет случаи, когда первая производная демонстрирует локальный максимум выше порога наклона, предоставленного пользователем или выведенного из данных (что указывает на растущий сигнал), за которым следует локальный минимум выше того же порога (что указывает на убывающий сигнал), тем самым обнаруживая все потенциальные пики в наборе данных. Для приложений ChIP-seq WonderPeaks сравнивает все потенциальные пики между тестовыми и контрольными образцами, чтобы определить уникально обогащенные пики. Применив WonderPeaks к ранее опубликованному набору данных ChIP-seq о факторе транскрипции грибкового патогена Candida albicans16, мы продемонстрировали его способность успешно идентифицировать пики перед ключевыми генами, выделенными в оригинальном исследовании, а также обсудили текущие ограничения алгоритма в этом приложении.

Мы также представляем PeakStream — программный инструмент, который использует WonderPeaks для определения пиков в наборах данных 3'RNA-Seq. Библиотеки 3'RNA-Seq зависят от точных аннотаций 3' UTR, поскольку чтения, полученные с помощью поли(А)-прайминга, часто выходят за пределы стоп-кодона кодирующих последовательностей (CDS) генов и, таким образом, не учитываются при использовании стандартных аннотаций, ориентированных исключительно на кодирующие области. Конвейер анализа PeakStream был разработан для создания новых аннотаций генома с использованием данных 3' RNA-Seq, уделяя особое внимание областям ниже областей кодирующей последовательности генов (CDS). PeakStream присваивает эти пики генам, генерируя новую аннотацию генома для использования в программах подсчета последующих считываний. Мы показываем, что использование PeakStream позволяет точно идентифицировать и отнести нисходящие поли(A)-генерируемые пики к соответствующему гену в наборе данных 3'RNA-Seq C. albicans . PeakStream также аннотирует пики, которые вряд ли могут быть связаны с какими-либо текущими аннотациями генов, что облегчает обнаружение возможных новых транскриптов. Вместе PeakStream и WonderPeaks представляют собой мощный набор удобных инструментов для обнаружения пиков в наборах данных секвенирования нового поколения (NGS).

figure-introduction-1
Рисунок 1: Обзорный рисунок пиковых вызовов от WonderPeaks и PeakStream. Слева: Пиковый колл с использованием первой производной. Вверху справа: вызов пиков в наборах данных ChIP-Seq с помощью WonderPeaks. Внизу справа: вызов пика в наборах данных RNA-Seq с помощью PeakStream. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Установка (пропустить, если завершена)

  1. Необходимые условия
    1. Установите Anaconda или Minconda для загрузки требований для запуска предварительной обработки (раздел 5) и WonderPeaks (раздел 6 или раздел 7).
      ПРИМЕЧАНИЕ: Руководство пользователя для Anaconda см. в ссылке16.
    2. Установите Python: Python в Anaconda или Miniconda.
    3. Установите Jupyter Notebooks для выполнения всех функций в этом методе.
      ПРИМЕЧАНИЕ: Руководство пользователя Jupyter Notebooks для начинающих можно найти в справочнике17.
      ВНИМАНИЕ: Для грибковых геномов (≤100 Mbp) убедитесь, что компьютерная среда содержит не менее 20 ядер, 8 ГБ ОЗУ и 30 ГБ доступного дискового пространства.
  2. Установите функции предварительной обработки.
    1. В терминале выполните: conda create -n WP_preprocessing
    2. В терминале выполните: conda activate WP_preprocessing
    3. В терминале выполните: conda env update --file environment.yml --name
      ПРИМЕЧАНИЕ: environment.yml - это файл, который содержит все зависимости пакета и должен быть загружен из https://github.com/mgarber21/WonderPeaks_preprocessing.git.
    4. В терминале выполните: pip install WonderPeaks-preprocessing
    5. В терминале выполните: conda deactivate WP_preprocessing
  3. Установите функции WonderPeaks:
    1. В терминале выполните: conda create -n WonderPeaks
    2. В терминале выполните: conda activate WonderPeaks
    3. В терминале выполните: conda env update --file environment.yml --name
      ПРИМЕЧАНИЕ: environment.yml - это файл, который содержит все зависимости пакета и должен быть загружен из https://github.com/mgarber21/WonderPeaks.git.
    4. В терминале выполните: pip install WonderPeaks
    5. В терминале выполните: conda deactivate WonderPeaks
      ПРИМЕЧАНИЕ: Шаги 1.2 и 1.3 достигают следующего: Они создают выделенную среду Conda для предварительной обработки (раздел 5) и WonderPeaks (разделы 6 и 7), изолируя зависимости, чтобы избежать конфликтов с другим программным обеспечением. Они активируют среду, настраивая ее на установку и запуск функций WP_preprocessing или функций, специфичных для WonderPeaks. Они устанавливают программные зависимости и инструменты, необходимые для предварительной обработки данных. Они деактивируют среду, когда она не используется, чтобы предотвратить случайное изменение и освободить системные ресурсы.
  4. Скачайте записные книжки и шаблоны Jupyter Notebooks из репозитория WonderPeaks на GitHub. Загрузите загрузки WonderPeaks в операционную систему, содержащую исходные данные (каталог будет создан в разделе 2).
    ПРИМЕЧАНИЕ: Jupyter Notebooks содержат предварительно написанные скрипты и шаблоны, необходимые для выполнения процессов предварительной обработки, WonderPeaks и PeakStream. Загрузка их в ту же систему, что и исходные данные, обеспечивает правильное выравнивание путей и каталогов.

2. Создайте каталог данных

ПРИМЕЧАНИЕ: Рабочие процессы WonderPeaks и PeakStream требуют, чтобы все данные (необработанные и обработанные) хранились в одном каталоге. На этом шаге объясняется, как создать новый каталог ({data_directory} = /path/to/your/data) и как переместить экспериментальные необработанные данные (необработанные чтения с упорядочением) в папку внутри этого каталога под названием raw_data.

  1. Создайте каталог данных.
    1. В терминале выполните mkdir {data_directory} (например, mkdir /путь/к/вашему/данным)
  2. Создание подкаталога необработанных данных для необработанных операций последовательного чтения.
    1. В терминале выполните mkdir {data_directory}/raw_data (например, mkdir /path/to/your/data /raw_data)
  3. Переместите необработанные последовательности чтения в каталог необработанных данных.
    1. В терминале выполните mv {current_path_to_raw_data}/*fastq* {data_directory}/raw_data (например, mv current/data/path/*fastq* /path/to/your/data /raw_data

3. Создание файла пользовательских входных данных (NGS_user_input.csv)

ПРИМЕЧАНИЕ: Входной файл определяет пользовательские конфигурации для запуска предварительной обработки и WonderPeaks.

  1. Скачайте шаблон NGS_user_inputs.csv из репозитория WonderPeaks на GitHub.
  2. Обновление полей в NGS_user_inputs.csv. Обновите поля следующим образом:
    Каталог данных: /путь/к/вашему/данным
    Каталог генома: /path/to/your/genome
    Геном fasta: genome.fasta
    Аннотация генома: genome_annotation.gtf (укажите имя файла аннотации генома в формате GTF)
  3. Сохраните обновленные NGS_user_inputs.csv в каталог данных, созданный в разделе 2.
    ВНИМАНИЕ: Не меняйте имя файла; WonderPeaks распознает этот файл только в том случае, если он назван NGS_user_input.csv.

4. Создание файла метаданных (NGS_user_metadata.csv)

ПРИМЕЧАНИЕ: Файл метаданных используется для хранения любой информации, относящейся к эксперименту. Можно добавить дополнительные столбцы для описания условий эксперимента, но они не повлияют на последующие шаги.

  1. Скачайте шаблон NGS_user_metadata.csv из репозитория WonderPeaks на GitHub.
  2. Обновление полей в NGS_user_metadata.csv Поля следующие:
    1. file: Убедитесь, что имя файла не содержит пробелов, включает дескриптор файла (например, fastq, fastq.gz) и не включает абсолютный путь.
    2. bedgraph: укажите, должен ли файл быть включен в PeakStream, установив для этого поля значение TRUE или FALSE.
      1. Установите поле bedgraph в значение FALSE , если файл можно разумно исключить из анализа PeakStream. Например, в эксперименте с RNAseq установите параметр bedgraph bedgraph=FALSE для мутантов или других случаев, когда различия UTR между образцами не ожидаются. Однако убедитесь, что в поле bedgraph установлено значение TRUE для всех контрольных файлов в эксперименте RNAseq и для всех файлов в эксперименте ChIPseq .
    3. ДизайнФактор
      1. designfactor1: Укажите фактор дизайна, относящийся к плану эксперимента (например, лечение или sample_type).
      2. designfactor2: Укажите второй фактор дизайна, относящийся к плану эксперимента (например, штамм или эпитоп). Для эксперимента с RNAseq включите лечение и штамм в качестве типичных факторов дизайна. В столбце лечения перечислены применяемые методы лечения (например, контроль, препарат 1), а в столбце штамма — информация о штамме (например, дикий тип, мутантный). Для эксперимента ChIPseq включите sample_type и эпитоп в качестве типичных факторов дизайна. В столбце sample_type указано, был ли белок помечен или нет, а в столбце эпитопа указано название используемого эпитопа .
        ПРИМЕЧАНИЕ: факторы дизайна — это атрибуты, специфичные для экспериментального дизайна.
        WonderPeaks совместим либо с элементами управления без тегов, либо с элементами управления вводом в качестве базового уровня.
      3. Убедитесь, что столбцы коэффициента проектирования не содержат уникальный номер репликации (например, sample_type: [tagged, tagged, untagged_control, untagged_control], а не sample_type: [tagged_1, tagged_2, untagged_control _1, untagged_control _2]. Указание уникальных номеров репликации приведет к ошибке во время выполнения.
      4. Обязательно используйте символы подчеркивания (_) вместо пробелов в именах факторов дизайна.
      5. Для приложения ChIPseq убедитесь, что столбец sample_type (или пользовательское имя) в файле метаданных содержит термины, содержащие слова tag и control.
        ПРИМЕЧАНИЕ: Например, допустимые записи могут включать теги и untagged_control. Указание столбца sample_type без этих терминов приведет к ошибке во время выполнения.
        ВНИМАНИЕ: Для приложения ChIP пользователь должен указать два коэффициента проектирования.
      6. Добавьте коэффициенты проектирования в соответствующую строку NGS_user_inputs.csv. Убедитесь, что имена столбцов, используемые для расчетных факторов, перечислены в виде строки, разделенной точкой с запятой (например, treatment; процеживание или sample_type; эпитоп).
        ВНИМАНИЕ: Конструктивные факторы в NGS_user_inputs.csv должны точно совпадать со столбцами NGS_user_metadata.csv . Любое несовпадающее выполнение приведет к ошибке во время выполнения (рис. 2, Дополнительная таблица S1 и Дополнительная таблица S2).

figure-protocol-1
Рисунок 2: Пример NGS_user_input.csv и NGS_user_metadata.csv. Примеры NGS_user_input.csv (верхняя панель) и NGS_user_metadata.csv (нижняя панель), выделяющие соответствие между столбцами дизайнфактора и дизайнфактора розовым или синим текстом и стрелками. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

5. Предварительная обработка данных NGS

ПРИМЕЧАНИЕ: Перейдите к разделу 5 или разделу 6, если вы используете пользовательскую предварительную обработку.

  1. Откройте записную книжку Jupyter Notebook для предварительной обработки NGS (NGS_Preprocessing.ipynb).
  2. Активируйте WP_preprocessing среду (созданную на шаге 1.2) в правом верхнем углу интерфейса записной книжки.
  3. Выполните первую ячейку, удерживая нажатой клавишу Shift и нажав Enter (Shift+Enter).
  4. Во второй ячейке Jupyter Notebook обновите путь к каталогу, установив Directory = "path/to/your/data", где path/to/your/data/ - это каталог, созданный в разделе 2.
  5. Создание файлов выравнивания. Функции предварительной обработки выполнят обрезку с помощью FastP18; контроль качества с помощью FastQC19 и MultiQC20; Юстировка с помощью STAR21. Выходные файлы выравнивания сохраняются в подкаталоге с именем startout в каталоге данных (например, path/to/your/data/starout); Фильтрация частности) с помощью samtools view22, фильтрует файл выравнивания так, чтобы чтение превышало только пороговое значение, указанное в NGS_user_inputs.csv.
    ПРИМЕЧАНИЕ: Эти функции будут обрабатывать только одно чтение (например, R1) набора данных за раз. Пользователи могут указать параметры запуска для FastP и STAR в NGS_user_inputs.csv (например, FastP: adapter_sequence (опционально); STAR: genomeDir, genomeFastaFiles, sjdbGTFfil).
  6. Выполните функции предварительной обработки во второй ячейке с помощью клавиш Shift + Enter.
    ПРИМЕЧАНИЕ: Выполнение задач во второй ячейке может занять несколько часов. Если выполнение прервано, повторите шаги 5.3-5.6, чтобы начать его заново. Ход выполнения предыдущих шагов не будет перезаписан, и процесс продолжится с того места, на котором остановился.
  7. Сгенерируйте файлы трассировки покрытия трассы с помощью BamCoverage23 (см. шаги 5.7.1 и 5.7.2).
    ПРИМЕЧАНИЕ: Для ChIPseq WonderPeaks требуются файлы с одним бедграфом, содержащие покрытие как прямого, так и обратного чтения. Для RNAseq с праймингом Poly(A) PeakStream требуется два файла bedgraph, один для прямого чтения (_fwd.bedgraph) и один для обратного чтения (_rev.bedgraph). Прямое и обратное чтение генерируется с использованием параметра filterRNAstrand в BamCoverage23.
    1. ChIPseq с использованием следующих параметров: outfilfeformat="bedgraph", strand=None, binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      ПРИМЕЧАНИЕ: Вывод: Создает файлы с одним бедграфом, содержащие покрытие как для прямого, так и для обратного чтения. Вывод хранится в /path/to/your/data/bedgraphout (рисунок 3).
      1. Выполните функцию BamCoverage в третьей ячейке с помощью клавиш Shift + Enter.
    2. RNAseq с использованием следующих параметров: outfilfeformat="bedgraph", strand="forward" or "reverse", binsize=20, smoothLength=60, minMappingQuality=255, normalizeUsing="CPM".
      ВНИМАНИЕ: Обязательно выполните функцию дважды с цепью, установленной в положение "вперед" или "назад", чтобы создать файлы для чтения в обоих направлениях.
      ПРИМЕЧАНИЕ: Вывод: Создает два файла bedgraph: один для прямого чтения (_fwd.bedgraph) и один для обратного чтения (_rev.bedgraph). Вывод хранится в /path/to/your/data/ bedgraphout (Рисунок 3).
      1. Выполните функцию BamCoverage в третьей ячейке с помощью клавиш Shift + Enter.

figure-protocol-2
Рисунок 3: Организация файлов для WonderPeaks. Скриншот папки с данными с файлами bedgraph в директории bedgrapghout/normalizeUsingCPM. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

6. WonderPeaks для ChIPseq

  1. Предварительная проверка
    1. Убедитесь, что все файлы bedgraph с файловым дескриптором .bedgraph находятся в подкаталоге в каталоге данных bedgraphout (рисунок 3).
    2. Убедитесь, что designfactors в файле user_inputs (NGS_user_inputs.csv) (рис. 2) совпадают со столбцами в файле метаданных (NGS_user_metadata.csv) и что строки столбцов designfactor не являются уникальными (см. предостережение на шаге 4.2.4).
  2. Откройте блокнот предварительной обработки NGS Jupyter Notebook (WP4ChIP.ipynb).
  3. Активируйте WonderPeaks (среда, созданная на шаге 1.3) в правом верхнем углу интерфейса записной книжки.
  4. Выполняйте ячейки с помощью клавиш Shift+Enter до точки останова для выполнения пикового вызова. После завершения запись об обработанных данных будет сохранена и сохранена в подкаталоге внутри каталога данных под названием WonderPeaks
    1. Ищите WOnder_init.csv: конкатенацию всего исходного покрытия и результатов вычисления первой производной.
    2. Примечание WOnder_unfiltered_peaks.csv: конкатенация всех нефильтрованных пиков, вызванных на основе первой производной.
    3. Обратите внимание на bedgraph_summary.csv: сводка статистики оценки после группировки каждого файла и хромосомы.
  5. Определите параметры прогона:
    1. Запустите1-ю ячейку ниже точки останова уценки.
      ПРИМЕЧАНИЕ: Появится график, отображающий исходные данные, разделенные по указанным коэффициентам проектирования , и таблица, показывающая коэффициенты проектирования; используйте таблицу и график для определения значений на последующих шагах (рисунок 4).
    2. В следующей ячейке укажите значения для score_cut, fold_change и designfactor (рис. 4).
      1. score_cut — это пороговое значение, используемое для определения того, следует ли учитывать пик в выходных данных. Чтобы определить score_cut, понаблюдайте за графиком и выберите значение, близкое к медиане размеченных данных (см. хешированную линию, рисунок 4). Введите это значение следующим образом: score_cut= значение.
      2. fold_change — это пороговое значение отношения баллов tagged:untagged используемого для определения того, считается ли пик реальным. Чтобы определить fold_change, понаблюдайте за графиком и выберите значение, превышающее отношение медиан данных без тегов и данных. Введите это значение следующим образом: fold_change= значение.
      3. designfactor_value указан в рамках экспериментального плана. Возможные конструктивные факторы перечислены красным цветом в печатной таблице. Чтобы определить коэффициент проектирования, выберите одно из значений, перечисленных красным цветом. Введите это значение между кавычками следующим образом: designfactor_value ="{ значение}".
  6. Выполните следующие ячейки, используя Shift + Enter , чтобы запустить фильтрацию и сопоставление пиков. Данные и сводные графики будут храниться в подкаталоге внутри каталога данных под названием WonderPeaks.
    1. Обратите внимание на {designfactor_value}_taggedVuntagged.csv: сводная таблица всех перекрывающихся пиков со столбцом для каждого из помеченных и непомеченных образцов.
    2. Примечание {designfactor_value}_all_tagged_peaks.csv: Сводная таблица всех реальных пиков, основанная на пользовательских параметрах (шаг 6.5).
    3. Обратите внимание на {designfactor_value}_peaks2gtf.csv: Отображение реальных пиков, основанное на пользовательских параметрах (шаг 6.5), на гены в файле аннотаций, указанном пользователем.
  7. Необязательно: Переключите параметры на шаге 6.5, повторно выполнив шаги 6.5-6.6. При использовании того же designfactor_value, сгенерированные файлы, как описано в шаге 6.6, будут перезаписаны.

figure-protocol-3
Рисунок 4: Скриншот, показывающий designfactor_value и заданные пользователем пороговые значения в WonderPeaks для ChIP-seq. Скриншот записной книжки Jupyter WonderPeaks, на котором выделены возможные варианты designfactor_value из отображаемой таблицы, а также способы реализации designfactor_value в следующей ячейке. Верхняя черная стрелка указывает на таблицу с возможными designfactor_value входами; значение Op обведено кружком и отображается как выбранный пользовательский ввод для designfactor_value в ячейке параметров (нижняя черная стрелка). На графике сплошными и пунктирными линиями обозначены приблизительные медианные пиковые баллы для помеченных и немеченых образцов соответственно в экспериментах с непрозрачными клетками. Эти медианы используются для определения параметров score_cut (медиана с тегами) и fold_change (отношение медиан с тегами к медианам без тегов). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

7. PeakStream для 3'RNAseq

  1. Предварительная проверка:
    1. Убедитесь, что все файлы bedgraph находятся в подкаталоге в каталоге данных bedgraphout (рисунок 2).
    2. Откройте записную книжку Jupyter для предварительной обработки NGS (PeakStream.ipynb)
    3. Активируйте WonderPeaks (среда, созданная на шаге 1.3) в правом верхнем углу интерфейса записной книжки.
  2. Выполняйте ячейки с помощью клавиш Shift+Enter до точки останова, чтобы выполнить пиковый вызов и сопоставление пиков. После завершения будет сохранен новый файл аннотации с прогнозируемыми 3' UTR и файлами FeatureCounts24 с числом прочтений, который будет сохранен в подкаталоге в вашем каталоге данных под названием PeakStream (рисунок 5).
    ПРИМЕЧАНИЕ: По умолчанию выходной файл будет включать аннотации только для биотипов, кодирующих белки, но это можно переключить с помощью опции биотип.

figure-protocol-4
Рисунок 5: Организация файлов для PeakStream. Скриншот папки с данными с файлами bedgraph в директории bedgrapghout. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Чудо-пики
После проведения эксперимента ChIP-seq исследователи обычно используют пиковые коллеры, такие как MACS3, для идентификации областей генома, обогащенных ДНК-связывающим белком, помеченным эпитопами. Мы разработали WonderPeaks как удобный для пользователя пиковый вызовщик, предназначенный для определения пиков с помощью метода, описанного выше.

WonderPeaks определяет пики, сначала вычисляя первую производную покрытия, и использует это значени...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Методы секвенирования нового поколения (NGS) обеспечивают беспрецедентное понимание регуляции и экспрессии генов в грибковых патогенах. Таким образом, вычислительные инструменты должны быть как всеобъемлющими, охватывающими все данные, полученные в ходе эксперимента, так и доступными для обычных пользователей, особенно для ученых. В этом отчете мы представили два инструмента, WonderPeaks и PeakStream, которые удовлетворяют эти потребности исследователей грибковых патогенов в рабочих проц...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, о котором можно было бы заявить.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была поддержана грантами Национальных институтов здравоохранения (NIH) RO1AI175080 и R01GM037049 (Александру Д. Джонсону) и грантом NIH T32 Training Grant Award T32 AI 60537-20 (H.G.). Мы благодарим Александра Джонсона, Мэтью Лозе, Дженни Чжан и Брайана Вана за полезные обсуждения и советы. Мы также благодарим членов Лаборатории Кэрол Гросс за отзывы. Благодарим Ананду Мендосу за техническую поддержку. Секвенирование проводилось в UCSF CAT при поддержке грантов UCSF PBBR, RRP IMIA и NIH 1S10OD028511-01. Мы признательны за использование ChatGPT от OpenAI для помощи в устранении неполадок в коде и предоставления предложений по редактированию рукописи.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
CORALL Total RNA-seq V1 наборLexogen095Влажный лабораторный материал 
Filamentous-Fungi riboPOOLsiTOOLsdp-P096-6Материал для влажной лаборатории 
Высокочувствительная РНК-лентаAgilent5067-5579Материал для влажной лаборатории 
Высокочувствительная лента для скрининга РНКLadder Agilent5067-5581Wet lab material 
Высокочувствительный буфер для образцов РНК ScreenTapeAgilent5067-5580Wet lab material 
список зависимостей для WonderPeaks
https://github.com/mgarber21/WonderPeaks_preprocessing/blob/main/environment.ymlсписок зависимостей для материала WonderPeaks_preprocessing
Monarch Spin RNA Cleanup KiNEBT2040LWet lab 
pygenometracks (3.9)
QuantSeq 3′ mRNA-Seq FWD Library Prep Kit V1Lexogen015Wet lab material 
Набор для анализа высокочувствительной (HS) РНК кубитаInvitrogenQ32852Wet lab material 
РНК Clean & Концентратор-5Zymo ResearchR1016Материал для влажной лаборатории 
TURBO Набор без ДНКThermoFisherAM1907Материал для влажной лаборатории 
Чудо-пики(0.1.14)
WonderPeaks_preprocessing(0.2.3)
https://github.com/mgarber21/WonderPeaks/blob/main/environment.yml

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. fungal priority pathogens list to guide research, development and public health action. , WHO. https://www.who.int/publications/i/item/9789240060241 (2022).
  2. Fisher, M. C., Denning, D. W. The WHO fungal priority pathogens list as a game-changer. Nat Rev Microbiol. 21 (4), 211-212 (2023).
  3. Gaspar, J. M. Improved peak-calling with MACS2. bioRxiv. 496521, (2018).
  4. Muñoz, J. F., et al. Coordinated host-pathogen transcriptional dynamics revealed using sorted subpopulations and single macrophages infected with Candida albicans. Nat Commun. 10 (1), 1607(2019).
  5. Miramón, P., Pountain, A. W., Lorenz, M. C. Candida auris-macrophage cellular interactions and transcriptional response. Infect Immun. 91 (11), e0027423(2023).
  6. Lindemann-Perez, E., Rodríguez, D. L., Pérez, J. C. An approach to analyze spatiotemporal patterns of gene expression at single-cell resolution in Candida albicans-infected mouse tongues. mSphere. 9 (9), e0028224(2024).
  7. Mo, X., et al. In vivo RNA sequencing reveals a crucial role of Fus3-Kss1 MAPK pathway in Candida glabrata pathogenicity. mSphere. 9 (11), e0071524(2024).
  8. Haas, B. J., Chin, M., Nusbaum, C., Birren, B. W., Livny, J. How deep is deep enough for RNA-Seq profiling of bacterial transcriptomes. BMC Genomics. 13, 734(2012).
  9. Zaheer, R., et al. Impact of sequencing depth on the characterization of the microbiome and resistome. Sci Rep. 8 (1), 5890(2018).
  10. Xiong, Y., et al. A comparison of mRNA sequencing with random primed and 3′-directed libraries. Sci Rep. 7 (1), 14626(2017).
  11. Ma, F., et al. A comparison between whole transcript and 3' RNA sequencing methods using Kapa and Lexogen library preparation methods. BMC Genomics. 20, 9(2019).
  12. Fansler, M. M., Mitschka, S., Mayr, C. Quantifying 3′UTR length from scRNA-seq data reveals changes independent of gene expression. Nat Commun. 15 (1), 4050(2024).
  13. Tuch, B. B., et al. The transcriptomes of two heritable cell types illuminate the circuit governing their differentiation. PLoS Genet. 6, e1001070(2010).
  14. Shenker, S., Miura, P., Sanfilippo, P., Lai, E. C. IsoSCM: improved and alternative 3′ UTR annotation using multiple change-point inference. RNA. 21 (1), 14-27 (2015).
  15. Haese-Hill, W., Crouch, K., Otto, T. D. peaks2utr: a robust Python tool for the annotation of 3′ UTRs. Bioinformatics. 39 (3), btad112(2023).
  16. Anaconda - Getting started. , https://docs.anaconda.com/anaconda/getting-started/ (2025).
  17. Pryke, B. Jupyter Notebook tutorial. , https://www.dataquest.io/blog/jupyter-notebook-tutorial/ (2025).
  18. Chen, S., Zhou, Y., Chen, Y., Gu, J. fastp: an ultra-fast all-in-one FASTQ preprocessor. Bioinformatics. 34 (17), i884-i890 (2018).
  19. Andrews, S. FastQC: a quality control tool for high throughput sequence data. , https://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  20. Ewels, P., Magnusson, M., Lundin, S., Käller, M. MultiQC: summarize analysis results for multiple tools and samples in a single report. Bioinformatics. 32 (19), 3047-3048 (2016).
  21. Dobin, A., et al. STAR: ultrafast universal RNA-seq aligner. Bioinformatics. 29 (1), 15-21 (2013).
  22. Danecek, P., et al. Twelve years of SAMtools and BCFtools. Gigascience. 10 (2), giab008(2021).
  23. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  24. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  25. Lohse, M. B., Johnson, A. D. Identification and characterization of Wor4, a new transcriptional regulator of white-opaque switching. G3 (Bethesda). 6 (3), 721-729 (2016).
  26. Nagalakshmi, U., et al. The transcriptional landscape of the yeast genome defined by RNA sequencing. Science. 320 (5881), 1344-1349 (2008).
  27. Diaz, A., Park, K., Lim, D. A., Song, J. S. Normalization, bias correction, and peak calling for ChIP-seq. Stat Appl Genet Mol Biol. 11 (3), Article 9(2012).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

ChIP SeqWonderPeaksPeakStream3 UTRCandida albicans
Видео скоро будет доступно

Похожие статьи