$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Экспрессия генов должна строго регулироваться для того, чтобы клетки могли установить и поддерживать свою правильную биологическую функцию. Хорошо известно, что аберрантная экспрессия генов лежит в основе патогенеза многих заболеваний, и поэтому большой исследовательский интерес заключается в пониманиимеханизмов регуляции генов. Экспрессия генов облегчается регуляторными элементами, такими как промоторы и энхансеры. В своей последовательности эти элементы содержат сайты связывания фактора транскрипции (TF), которые при активации обеспечивают платформу для связывания TF. Связывание ТФ в этих сайтах приводит к смещению нуклеосом, что приводит к увеличению доступности ДНК и последующему увеличению допустимости для транскрипционного механизма. В результате этой повышенной доступности эти участки ДНК более чувствительны к нуклеазам и транспозазам, таким как ДНКаза и Tn5, биохимическое свойство, которое было использовано исследователями, изучающими транскрипционную регуляцию 2,3.
DNase-seq и ATAC-seq позволяют исследователям картировать области открытого хроматина, сайты связывания TF и нуклеосомное расположение по всему геному. Из этих двух методов популярность ATAC-seq выросла за последнее десятилетие благодаря простому двухэтапному протоколу и низкому требованию к количеству клеток (50 000 клеток по сравнению с 1 миллионом на репликацию для DNase-seq). В то время как ATAC-seq дает представление об общем ландшафте хроматина в популяции клеток, он в значительной степени не имеет значения, с какими специфическими белками связываются с геномом 4,5. Для того, чтобы определить места, где конкретный белок взаимодействует с геномом, золотым стандартом является иммунопреципитация хроматина (ChIP)-секвенирование. ChIP-seq включает в себя химическую фиксацию белок-ДНК-взаимодействий в клетке с последующей иммунопреципитацией («pull-down») с использованием антитела, специфичного к интересующему белку, для отбора фрагментов ДНК, связанных с интересующим белком (POI). Эти фрагменты ДНК могут быть секвенированы для выявления мест геномного связывания специфических белков, таких как TF, или сайтов, содержащих специфические модификации гистонов1. Комбинируя наборы данных ATAC-seq и ChIP-seq, можно получить подробную картину регуляторного ландшафта для популяции клеток.
Основной рабочий процесс, необходимый для анализа, заключается в следующем: качество необработанных прочитанных данных секвенирования должно контролироваться перед выравниванием с референсным геномом («картированием»). Успешно картированные чтения затем могут быть отфильтрованы для удаления как некачественных прочтений, так и дубликатов ПЦР. Для того, чтобы визуализировать эти картированные и отфильтрованные чтения, необходимо рассчитать «покрытие» этих прочтений по всему геному. При этом генерируется файл, который может быть загружен в браузер генома, такой как мультилокусный просмотр (MLV) или браузер генома UCSC в качестве «трека»6,7. Идентификация пиков, или «вызов пиков» этих треков покрытия, обычно достигается с помощью таких инструментов, как LanceOtron или MACS2 8,9. Наконец, с помощью анализа расположения, формы и размера пика можно провести сравнение образцов или биологических условий. Анализ и интеграция этих наборов данных представляет собой сложный многоступенчатый процесс, в котором могут быть реализованы различные комбинации биоинформационных инструментов. Различные версии инструментов могут быть несовместимы друг с другом и могут изменить вывод обработки данных. Кроме того, существует большое разнообразие вычислительной мощности и квалификации пользователя, необходимых для реализации различных частей обработки данных, как показано в конвейерах nf-core10, panpipes11, genpipe12, PEPATAC13 или ChIP-AP14.
В целом, это привело к несоответствиям как в анализе, так и в отчетности по анализу, что, в свою очередь, привело к плохой воспроизводимости, доступности и удобству для тех, кто обладает ограниченными знаниями в области биоинформатики. Мы решаем все эти проблемы с помощью CATCH-UP (полный восходящий конвейер ATAC-seq и ChIP-seq), простого в использовании, гибкого и модульного конвейера для обработки данных ChIP-seq и ATAC/DNase-seq. Внедрение CATCH-UP требует минимального опыта в области биоинформатики; Он может быть запущен в различных вычислительных инфраструктурах и обеспечивает воспроизводимый анализ данных внутри и между исследовательскими группами.
CATCH-UP — это конвейер Snakemake на основе Python, созданный для стандартизации анализа данных ChIP-seq и ATAC-seq. Он принимает необработанные данные секвенирования (fastq.gz файлы) в качестве входных данных и генерирует выходные данные в виде файлов peak (.bed), предоставляющих соответствующий результат для каждого шага. Мы предоставляем конфигурационный файл в формате yaml (config.yaml), в котором пользователь может редактировать параметры каждого шага анализа. Система управления, реализованная в snakemake, позволяет использовать различные вычислительные инфраструктуры (например, серверы, кластеры, облачные системы или персональные компьютеры) и параллельно, если пользователь предоставляет большой объем данных.
Ниже приведено подробное описание каждого шага рабочего процесса (иллюстрацию рабочего процесса см. на рисунке 1 ). Это объяснение необходимо для того, чтобы следовать пошаговым инструкциям в разделе протокола:
Перемещение fastq: первым шагом конвейера является копирование необработанных файлов fastq в указанный каталог анализа. При этом исходные данные остаются нетронутыми, чтобы избежать повреждения или изменения файлов необработанных данных.
Конкатенация: если исходные данные секвенирования содержат несколько полос движения, этот шаг необходим для объединения полос перед анализом. По умолчанию конвейер обрабатывает все fastq-файлы как отдельные выборки. Этот шаг конкатенации должен быть определен в файле конфигурации.
Обрезка: необязательный шаг очистки данных. Это позволяет обрезать некачественные чтения или последовательности адаптеров с помощью trimmomatic15. Пользователь может предоставить пользовательские fasta файлы последовательностей адаптеров; Пример приведен в каталоге адаптера. Дополнительные параметры обрезки могут быть определены в файле конфигурации. По умолчанию рабочий процесс пропускает это правило.
Aligner: для выравнивания по умолчанию применяется Bowtie216 ; Также можно указать альтернативные инструменты юстировки, такие как BWA-MEM217 . Инструмент выравнивания Bowtie2 выбран по умолчанию, поскольку он особенно хорошо подходит для выравнивания относительно коротких прочтений относительно больших геномов и, следовательно, хорошо подходит для выравнивания данных ChIP-seq и ATAC-seq с геномами млекопитающих. Чтобы избежать каких-либо промежуточных файлов, выравниватель передается по конвейеру в представление samtools для сохранения файла bam на выходе. Для этого правила пользователь должен указать предпочтительную сборку генома, на которую будут сопоставлены чтения, например, hg19/hg38 (человек), mm10/mm39 (мышь).
Фильтрация: правильно сопоставленные чтения сохраняются, а чтения с низким качеством отфильтровываются. По умолчанию: вид samtools, с параметрами: -bShuF 4 -f 3 -q 30.
Сортировка: выровненные чтения сортируются в порядке крайней левой координаты. По умолчанию: samtools sort (обертка snakemake), с параметром: -m 4G.
Пометить дубликаты: все дубликаты чтения идентифицируются и помечаются. Пользователь может принять решение об их удалении, изменив параметр файла конфигурации. По умолчанию: Picard MarkDuplicates (обёртка snakemake), с параметром: --REMOVE_DUPLICATES False для пометки и сохранения дубликатов.
Merge bam: Если данные секвенирования состоят из реплик или образцов, пользователь может захотеть объединить их в один bam. В этом случае пользователь может выбрать слияние bams или хранить файлы bam отдельно на протяжении всего анализа. Если пользователь выбирает слияние bams (с помощью samtools merge), для объединенного bams должен быть указан общий префикс.
Индекс: на этом шаге индексируются отсортированные координаты. По умолчанию: индекс samtools (оболочка snakemake), с использованием параметров по умолчанию, заданных samtools.
BamCoverage: это правило создает большой трек покрытия из выровненных прочтений. Применяется инструмент bamCoverage от deepTools, и покрытие рассчитывается как количество прочтений на ячейку, в которой ячейка представляет собой окно заданного размера. В этом конвейере bamCoverage применяется со следующими параметрами, установленными по умолчанию: -bs 1 -normalizeUsing RPKM -extendReads.
Пиковый вызов: LanceOtron8 был выбран в качестве пикового вызова по умолчанию для этого конвейера. В отличие от традиционных пиковых вызовов, которые в основном основаны на статистических тестах, LanceOtron — это пиковый вызов на основе глубокого обучения, который включает в себя измерения геномного обогащения и статистическое тестирование и, как было показано, превосходит стандартный отраслевой пиковый вызов MACS29. Для того, чтобы большие шишки были совместимы с LanceOtron, покрытие должно быть рассчитано по паре оснований, а RPKM нормализовано; это отражено в настройках по умолчанию для шага BamCoverage. MACS2 может быть выбран в качестве альтернативного пикового вызова. Высвобождение новых пиковых вызовов будет отслеживаться и учитываться по мере необходимости, чтобы поддерживать и оптимизировать производительность этого конвейера анализа.
TrackDb: создает ассоциацию пар «ключ-значение» больших файлов для их загрузки и визуализации в таких инструментах, как платформы MLV6 или UCSC Genome Browser18 .
В дополнение к выходным данным, на каждом этапе конвейера выводится файл журнала, и предоставляются соответствующие проверки качества, чтобы пользователь мог отслеживать ход анализа. FastQC19 применяется к необработанным и обрезанным (если выбранным) данным секвенирования (шаги 1 - Перемещение fastq и 2 - Обрезка). Статистика Samtools плюс MultiQC20 используются для сбора, создания и визуализации отчетов о контроле качества в файлах bam на выходе в шагах 3 - Выравнивание, 6 - Маркировка дубликатов и 7 - Объединение бам. Для получения дополнительной информации о каждом из инструментов, применяемых в вышеуказанных шагах, см. Таблицу 1.