Методическая статья

Вводный анализ и валидация данных секвенирования CUT&RUN

DOI:

10.3791/67359

13 декабря 2024 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол помогает новичкам в биоинформатике пройти через вводный конвейер анализа CUT&RUN, который позволяет пользователям завершить первоначальный анализ и проверку данных секвенирования CUT&RUN. Выполнение описанных здесь этапов анализа в сочетании с аннотацией нисходящих пиков позволит пользователям получить механистическое представление о регуляции хроматина.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Метод CUT&RUN облегчает обнаружение белок-ДНК-взаимодействий по всему геному. Типичные области применения CUT&RUN включают профилирование изменений в модификациях хвоста гистонов или картирование занятости хроматина транскрипционного фактора. Широкое распространение CUT&RUN обусловлено, в частности, техническими преимуществами по сравнению с обычным ChIP-seq, которые включают в себя более низкие требования к входу клеток, более низкие требования к глубине секвенирования и повышенную чувствительность при снижении фонового сигнала из-за отсутствия сшивающих агентов, которые в противном случае маскируют эпитопы антител. Широкое внедрение CUT&RUN также было достигнуто благодаря щедрому обмену реагентами лабораторией Henikoff и разработке коммерческих наборов для ускорения освоения для начинающих. По мере расширения технического внедрения CUT&RUN анализ и валидация секвенирования CUT&RUN становятся критически важными узкими местами, которые необходимо преодолеть, чтобы обеспечить полное внедрение преимущественно мокрыми лабораторными командами. Анализ CUT&RUN обычно начинается с проверки качества необработанных прочтений секвенирования для оценки глубины секвенирования, качества чтения и потенциальных смещений. Затем прочтения выравниваются с эталонной сборкой последовательности генома, а затем используются несколько биоинформационных инструментов для аннотирования областей обогащения генома белками, подтверждения интерпретируемости данных и получения биологических выводов. Несмотря на то, что для поддержки анализа данных CUT&RUN было разработано множество конвейеров анализа in silico , их сложная многомодульная структура и использование нескольких языков программирования делают платформы сложными для новичков в биоинформатике, которые могут не быть знакомы с несколькими языками программирования, но хотят понять процедуру анализа CUT&RUN и настроить свои конвейеры анализа. Здесь мы предоставляем одноязычный протокол пошагового анализа CUT&RUN, предназначенный для пользователей с любым уровнем опыта в области биоинформатики. Этот протокол включает в себя выполнение критических проверок качества для подтверждения того, что данные секвенирования пригодны для биологической интерпретации. Мы ожидаем, что следование вводному протоколу, представленному в этой статье, в сочетании с аннотацией нисходящих пиков позволит пользователям извлекать биологические выводы из своих собственных наборов данных CUT&RUN.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Возможность измерения взаимодействий между белками и геномной ДНК имеет фундаментальное значение для понимания биологии регуляции хроматина. Эффективные анализы, которые измеряют занятость хроматина для данного белка, дают по крайней мере две ключевые части информации: 1) геномную локализацию и 2) распространенность белка в данной области генома. Отслеживание изменений рекрутмента и локализации белка, представляющего интерес в хроматине, может выявить локусы-мишени белка и выявить механистическую роль этого белка в биологических процессах на основе хроматина, таких как регуляция транскрипции, репарация ДНК или репликация ДНК. Доступные сегодня методы профилирования белково-ДНК-взаимодействий позволяют исследователям изучать регуляцию с беспрецедентным разрешением. Такие технические достижения стали возможными благодаря внедрению новых методов профилирования хроматина, которые включают в себя разработку методов расщепления под мишенями и высвобождения с использованием нуклеазы (CUT&RUN) лабораторией Henikoff. CUT&RUN имеет ряд технических преимуществ по сравнению с обычной иммунопреципитацией хроматина (ChIP), которые включают в себя более низкие требования к входу клеток, более низкие требования к глубине секвенирования и повышенную чувствительность при сниженном фоновом сигнале из-за отсутствия сшивающих агентов, которые в противном случае маскируют эпитопы антител. Использование этого метода для изучения регуляции хроматина требует глубокого понимания принципа, лежащего в основе этого метода, а также понимания того, как анализировать, проверять и интерпретировать данные CUT&RUN.

Процедура CUT&RUN начинается со связывания клеток с конканавалином А, конъюгированным с магнитными шариками, чтобы обеспечить манипуляции с низким количеством клеток на протяжении всей процедуры. Изолированные клетки проникают с помощью мягкого детергента, чтобы облегчить введение антитела, нацеленного на интересующий белок. Затем микрококковая нуклеаза (MNase) рекрутируется в связанное антитело с помощью метки Protein A или Protein A/G, привязанной к ферменту. Кальций вводится для инициирования ферментативной активности. В результате расщепления МНазы образуются мононуклеосомные ДНК-белковые комплексы. Кальций впоследствии хелатируют, чтобы завершить реакцию расщепления, и короткие фрагменты ДНК в результате расщепления MNазы высвобождают из ядер, затем подвергают очистке ДНК, подготовке библиотеки и высокопроизводительному секвенированию1 (рис. 1).

Подходы in silico к картированию и количественной оценке занятости белка в геноме развивались параллельно с лабораторными подходами, используемыми для обогащения этих ДНК-белковых взаимодействий. Идентификация областей обогащенных сигналов (пиков) является одним из наиболее важных этапов биоинформатического анализа. Первоначальные методы анализа ChIP-seq использовали такие алгоритмы, как MACS2 и SICER3, в которых использовались статистические модели для различения истинных сайтов связывания белка и ДНК от фонового шума. Тем не менее, более низкий фоновый шум и более высокое разрешение данных CUT&RUN делают некоторые программы пиковых вызовов, используемые в анализе ChIP-seq, непригодными для анализа CUT&RUN4. Эта проблема подчеркивает потребность в новых инструментах, лучше подходящих для анализа данных CUT&RUN. SEACR4 представляет собой один из таких инструментов, недавно разработанных для обеспечения пиковых вызовов из данных CUT&RUN при одновременном преодолении ограничений, связанных с инструментами, обычно используемыми для анализа ChIP-seq.

Биологические интерпретации данных секвенирования CUT&RUN извлекаются из выходных данных после пикового вызова в конвейере анализа. Для прогнозирования потенциальной биологической значимости вызываемых пиков по данным CUT&RUN может быть реализовано несколько функциональных программ аннотации. Например, проект Gene Ontology (GO) обеспечивает хорошо зарекомендовавшую себя функциональную идентификацию генов, представляющих интерес 5,6,7. Различные программные инструменты и ресурсы облегчают анализ GO для выявления генов и наборов генов, обогащенныхпиками CUT&RUN 8,9,10,11,12,13,14. Кроме того, программное обеспечение для визуализации, такое как Deeptools15, Integrative genomics viewer (IGV)16 и UCSC Genome Browser17, позволяет визуализировать распределение сигналов и закономерности в интересующих областях генома.

Способность извлекать биологические интерпретации из данных CUT&RUN в решающей степени зависит от валидации качества данных. К критически важным компонентам для валидации относятся оценка: i) качества секвенирования библиотеки CUT&RUN, ii) сходства реплик и iii) распределения сигнала в пиковых центрах. Завершение валидации всех трех компонентов имеет решающее значение для обеспечения надежности образцов библиотеки CUT&RUN и результатов последующего анализа. Поэтому важно создать вводные руководства по анализу CUT&RUN, чтобы позволить начинающим биоинформатикам и исследователям мокрых лабораторий проводить такие этапы проверки в рамках своих стандартных аналитических конвейеров CUT&RUN.

Наряду с разработкой эксперимента CUT&RUN в мокрой лаборатории, для поддержки анализа данных CUT&RUN были разработаны различные конвейеры анализа in silico CUT&RUN, такие как CUT&RUNTools2.0 18,19, nf-core/cutandrun20 и CnRAP21. Эти инструменты обеспечивают эффективные подходы к анализу одноклеточных и массовых наборов данных CUT&RUN и CUT&Tag. Тем не менее, относительно сложная модульная структура программы и необходимое знакомство с несколькими языками программирования для проведения этих конвейеров анализа могут препятствовать внедрению биоинформатики новичками, которые стремятся досконально понять этапы анализа CUT&RUN и настроить свои собственные конвейеры. Чтобы обойти этот барьер, требуется новый вводный конвейер анализа CUT&RUN, который предоставляется в виде простых пошаговых скриптов, закодированных с использованием простого единого языка программирования.

В этой статье мы опишем простой одноязычный протокол конвейера анализа CUT&RUN, который предоставляет пошаговые скрипты с подробными описаниями, позволяющими новым и начинающим пользователям проводить анализ секвенирования CUT&RUN. Программы, используемые в этом конвейере, являются общедоступными для исходных групп разработчиков. Основные этапы, описанные в этом протоколе, включают выравнивание чтения, вызов пиков, функциональный анализ и, что наиболее важно, этапы валидации для оценки качества образца для определения пригодности и надежности данных для биологической интерпретации (рис. 2). Кроме того, этот конвейер предоставляет пользователям возможность сопоставлять результаты анализа с общедоступными наборами данных CUT&RUN. В конечном счете, этот протокол конвейера анализа CUT&RUN служит вводным руководством и справочником для начинающих специалистов в области биоинформатического анализа и исследователей в мокрых лабораториях.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ПРИМЕЧАНИЕ: Информация о файлах CUT&RUN fastq в GSE126612 доступна в Таблице 1. Информация, относящаяся к программным приложениям, использованным в данном исследовании, приведена в Таблице материалов.

1. Загрузка конвейера Easy-Shells_CUTnRUN со страницы на Github

  1. Откройте терминал из операционной системы.
    ПРИМЕЧАНИЕ: Если пользователь не знает, как открыть терминал в macOS и Windows, просмотрите эту веб-страницу (https://discovery.cs.illinois.edu/guides/System-Setup/terminal/). Для Linux ознакомьтесь с этой веб-страницей (https://www.geeksforgeeks.org/how-to-open-terminal-in-linux/).
  2. Загрузите сжатый конвейер анализа с Github, набрав в терминале wget https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/archive/refs/heads/main.zip -O ~/Desktop/Easy-Shells_CUTnRUN.zip.
  3. После загрузки zip-файла распакуйте скачанный zip-файл, набрав в терминале unzip ~/Desktop/Easy-Shells_CUTnRUN.zip -d ~/Desktop/.
  4. После распаковки удалите zip-файл, набрав rm ~/Desktop/Easy-Shells_CUTnRUN.zip в терминале, и измените имя папки, набрав mv ~/Desktop/Easy-Shells_CUTnRUN-master ~/Desktop/Easy-Shells_CUTnRUN.
  5. После удаления заархивированного файла введите в терминале chmod +x ~/Desktop/Easy-Shells_CUTnRUN/script/*.sh , чтобы установить разрешение на выполнение для всех сценариев оболочки в рабочем каталоге. С этого момента просто введите путь и имя этих сценариев оболочки в терминале или перетащите скрипты в терминал и войдите, чтобы запустить эти сценарии оболочки в терминале.
    ПРИМЕЧАНИЕ: Оболочка Bash обычно предустановлена на большинстве дистрибутивов Linux. Однако в последних версиях macOS больше нет предустановленной оболочки Bash. Если в системе нет Bash, сначала установите оболочку Bash. Перейдите по ссылкам ниже, чтобы получить инструкции по установке оболочки Bash в ОС Linux (https://ioflood.com/blog/install-bash-shell-linux/) и macOS (https://www.cs.cornell.edu/courses/cs2043/2024sp/styled-3/#:~:text=The first thing you will,you will see the following:). Эти пошаговые скрипты оболочки написаны для создания одной папки ~/Desktop/GSE126612 для выполнения большей части анализа CUT&RUN в этой директории без каких-либо изменений. Если пользователь понимает, как использовать эти сценарии оболочки, он может пересмотреть и настроить эти сценарии оболочки для анализа других наборов данных CUT&RUN и изменения параметров в соответствии с потребностями конкретного проекта. Для чтения и редактирования этих сценариев оболочки рассмотрите возможность использования Visual studio Code (https://code.visualstudio.com/) в качестве одного из вариантов простой в использовании программы, доступной для основных операционных систем.

2. Установка программ, необходимых для Easy Shells CUTnRUN

  1. Среди shell-скриптов с именем Script_01_installation_***.sh выясните, имя какого скрипта включает в себя тип операционной системы пользователя. В настоящее время Easy Shells CUTnRUN поддерживает скрипт установки для систем на базе macOS, Debian/Ubuntu и CentOS/RPM.
  2. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  3. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  4. В терминале запустите скрипт оболочки установки, набрав ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_01_installation_***.sh или перетащите файл скрипта оболочки в терминал и введите.
  5. Чтение файла Test_README.md в папке /path/to/SEACR-1.3/Testfiles. Следуйте инструкциям в файле README, чтобы уточнить, правильно ли работает SEACR в системе пользователя.
    ПРИМЕЧАНИЕ: Крайне важно проверить работу функции SEACR с помощью тестовых файлов, предоставленных страницей SEACR на Github, чтобы получить правильные результаты пиковых вызовов из данных CUT&RUN. Поэтому следуйте инструкциям Test_README.md в /path/to/SEACR-1.3/Testfiles сразу после установки SEACR. Несмотря на то, что Easy Shells CUTnRUN предоставляет сценарии установки оболочки для некоторых операционных систем, эти сценарии могут не работать в системах некоторых пользователей для установки всех программ, необходимых для Easy Shells CUTnRUN. Если при установке возникли какие-либо проблемы, просмотрите оригинальный веб-сайт удаленной программы или обратитесь за помощью, используя веб-страницу проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).

3. Загрузка общедоступного набора данных CUT&RUN из архива чтения последовательностей (SRA)

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_02_download-fastq.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ:Этот скрипт: (i) Создаст одну папку (~/Desktop/GSE126612/fastq) и загрузит список файлов SRA, записанных в текстовом файле (~/Desktop/Easy-Shells_CUTnRUN/sample_info/SRR_list.txt) в папке fastq. В качестве примера SRR_list.txt включает fastq-файлы подмножества GSE126612 примеров CUT&RUN. (ii) Загрузите необработанные файлы fastq в папку fastq. (iii) Создайте одну папку (~/Desktop/GSE126612/log/fastq) и запишите файл журнала (download-fastq_log.txt) и загруженный файл с образцом информации (SRR_list_info.txt) в эту папку журнала.
  4. После запуска скрипта проверьте файл журнала. Если в файле журнала есть сообщение об ошибке, исправьте ошибку и повторите попытку шага 3.3. Если возникла проблема для решения проблемы, обратитесь за помощью в веб-страницу проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Чтобы облегчить практику работы с этим конвейером анализа CUT&RUN, из SRA извлекаются следующие общедоступные образцы: один образец из имитационного контроля (IgG), три образца белка с архитектурой хроматина и фактором транскрипции (CTCF), четыре образца, соответствующие «активной» метке гистона (H3K27Ac), и три образца, соответствующие областям инициации транскрипции, помеченным РНК-полимеразой II (RNAPII-S5P). Секвенирование выполнялось как pair-end, поэтому для каждого образца объединяются два файла.

4. Первичная проверка качества исходных файлов секвенирования

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_03_fastQC.sh в терминале или перетащите скрипт оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт оболочки: (i) запустит программу FastQC для всех необработанных файлов fastq в папке ~/Desktop/GSE126612/fastq и сохранит файлы отчета о проверке качества в папке ~/Desktop/GSE126612/fastqc.1st . (ii) Запишите файл журнала (fastqc.1st.log.SRR-number.txt) для каждого прогона FastQC в папку журнала (~/Desktop/GSE126612/log/fastqc.1st).
  4. После завершения выполнения сценария оболочки просмотрите файл журнала, чтобы уточнить успешность выполнения. Если в файле журнала есть сообщение об ошибке, исправьте ошибку и повторите шаг 4.3. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Среди выходных файлов fastqc.html файлы содержат удобные для пользователя результаты проверки качества. Если есть серьезные проблемы с качеством, обсудите с коллегами по биоинформатике, чтобы определить пригодность данных для последующего анализа. Аналогичные отчеты о контроле качества используются для подтверждения улучшения качества данных после обрезки адаптера. Чтобы использовать этот скрипт для других наборов данных, отредактируйте путь к рабочему и выходному каталогам в соответствии с потребностями пользователя. Заметное различие при интерпретации контроля качества CUT&RUN по сравнению с чтением ChIP-seq заключается в том, что дубликаты прочтений в CUT&RUN не обязательно указывают на дубликаты ПЦР. Это связано с тем, что рекрутированная MNase будет перевариваться в тех же или похожих местах в экспериментальных группах.

5. Обрезка качества и адаптера для файлов необработанной секвенирования

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_04_trimming.sh в терминале или перетащите Script_04_trimming.sh скрипт в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт оболочки: (i) Запустит программу Trim-Galore для всех необработанных файлов fastq в ~/Desktop/GSE126612/fastq для выполнения обрезки адаптера и качества. (ii) Создайте одну папку (~/Desktop/GSE126612/trimmed) и сохраните выходные файлы Trim-Galore в обрезанной папке. (iii) Создайте одну папку журнала (~/Desktop/GSE126612/log/trim_galore) и запишите файл журнала trim_galore_log_RSS-number.txt для каждого прогона Trim-Galore.
  4. После завершения прогона внимательно просмотрите файл журнала. Если в файле журнала есть сообщение об ошибке, исправьте ошибку и повторите шаг 5.3. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
  5. После завершения этого процесса сравните .html выходные файлы с файлами fastqc.html, созданными в версии 4.3. Пересмотрите путь к входным и выходным каталогам, чтобы выполнить этап обрезки для всех файлов fastq, расположенных в другом месте.

6. Загрузка индекса bowtie2 для референсных геномов для фактических и контрольных образцов

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_05_bowtie2-index.sh в терминале или перетащите скрипт оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт будет: (i) загружать индексы Bowtie2 для фактических образцов референсных геномов (человека; hg19; использован в оригинальной публикации22) и контрольных референсных геномов Spike-in (почковающиеся дрожжи; R64-1-1) в папку bowtie2-index (~/Desktop/Easy-Shells_CUTnRUN/bowtie2-index). (iii) Запишите файл журнала (bowtie2-index-log.txt) в каталог журнала (~/Desktop/GSE126612/log/bowtie2-index).
  4. После завершения прогона проверьте файл журнала. Если есть какое-либо сообщение об ошибке, исправьте ошибку и повторите шаг 6.3. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: В настоящее время индексы Bowtie2 для различных референсных геномов представлены на веб-сайте Bowtie2 (https://bowtie-bio.sourceforge.net/bowtie2/manual.shtml). Пользователи могут редактировать Script_05_bowtie2-index.sh для загрузки любого индекса Bowtie2 в соответствии с требованиями пользователя. Если пользователь не может найти интересующий его индекс Bowtie2 референсного генома, найдите файлы fasta референсной последовательности генома из:
    1. Энсембл ftp (https://ftp.ensembl.org/pub/current_fasta/)
    2. Веб-страница UCSC (https://hgdownload.soe.ucsc.edu/downloads.html)
    3. или другие базы данных по конкретным видам.
      После поиска файлов fasta референсной последовательности генома создайте индекс Bowtie2 для загруженного референсного генома, следуя разделу «Индексатор bowtie2-build» (https://bowtie-bio.sourceforge.net/bowtie2/manual.shtml#the-bowtie2-build-indexer) на веб-сайте Bowtie2.

7. Картирование обрезанных считываний секвенирования CUT&RUN с референсными геномами

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_06_bowtie2-mapping.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт оболочки: (1) Запустит программу "галстук-бабочка" для сопоставления всех адаптеров и качественных fastq-файлов как с экспериментальными (человек; hg19), так и с контрольными шипами (почковающиеся дрожжи; R64-1-1) референсные геномы независимо. (ii) Запустите функцию просмотра samtools , чтобы сжать сопоставленные файлы прочитанных пар в формат bam. (iii) Создайте одну папку (~/Desktop/GSE126612/bowtie2-mapped) и сохраните сжатый файл сопоставленных read pairs в папке bowtie2-mapped. (iv) Создайте одну папку (~/Desktop/GSE126612/log/bowtie2-mapped) и запишите журнал процесса картирования в виде текстового файла bowtie2_log_hg19_SRR-number.txt для пар чтения, отображенных на референсном геноме hg19, и bowtie2_log_R64-1-1_SRR-number.txt для пар чтения, отображенных на R64-1-1), чтобы указать эффективность картирования в папке bowtie2-mapping log.
  4. После завершения прогона проверьте файл журнала. Если в файле журнала есть сообщение об ошибке, исправьте ошибку и запустите скрипт оболочки еще раз. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Этот скрипт оболочки запускает bowtie2 с опциями для отображения файлов секвенирования парных концов для поиска согласованно отображенных пар чтения с длиной фрагментов 10-700 bp. Откройте для себя описания опций, набрав в терминале bowtie2 --help или посетив веб-сайт bowtie2 (https://bowtie-bio.sourceforge.net/bowtie2/manual.shtml#the-bowtie2-aligner), чтобы понять и изменить варианты по мере необходимости. Используйте этот скрипт оболочки для отображения любых других fastq-файлов, изменив путь и формат имен fastq-файлов и индексов Bowtie2.

8. Сортировка и фильтрация сопоставленных файлов прочитанных пар

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, набрав в терминале "chsh -s $(which bash)". Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_07_filter-sort-bam.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт выполнит: (i) Запустит функцию просмотра samtools для всех сжатых сопоставленных файлов прочитанных пар в папке ~/Desktop/GSE126612/bowtie2-mapped, чтобы отфильтровать пары чтения, отображенные в неканонических областях хромосом, публично аннотированных черных списках и областях повтора TA. (ii) Выполните функцию сортировки samtools для сортировки отфильтрованных файлов bam по именам фрагментов или координации в пределах одного каталога. (iii) Запишите файл журнала в соответствии с входным файлом bam в каталоге ~/Desktop/GSE126612/log/filter-sort-bam .
  4. После завершения прогона внимательно просмотрите файлы журнала. Если в файлах журнала есть сообщение об ошибке, исправьте ошибку и попробуйте запустить скрипт оболочки еще раз. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Результирующие файлы bam (выходные), отсортированные по именам фрагментов, будут служить входными файлами для создания фрагментов BED и необработанных файлов bedGraph с подсчетом прочтений. Файлы bam, отсортированные по координатам, будут служить входными файлами для создания фрагментных файлов BEDPE. Все BED, bedGraph и BEDPE будут использоваться для пиковых вызовов и визуализации в нисходящем анализе. Все файлы аннотаций для канонических областей хромосом (chr1~22, chrX, chrY и chrM), публично аннотированные областичерного списка 23 и области повторов TA18 расположены в каталоге ~/Desktop/Easy-Shells_CUTnRUN/blacklist . При необходимости используйте эту директорию для добавления дополнительных файлов черного списка. Используйте этот скрипт оболочки для выполнения тех же функций для других сопоставленных пар чтения файлов bam, изменив путь и имя файлов bam. Введите samtools view --help и samtools sort --help в терминале для более подробного описания этих функций.

9. Конвертация сопоставленных пар чтения во фрагменты файлов BEDPE, BED и необработанных счетчиков прочтений bedGraph

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_08_bam-to-BEDPE-BED-bedGraph.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт будет: (i) запускать функции macs3 filterdup и awk для преобразования файлов bam, отсортированных по координатам, во фрагменты файлов BEDPE, длина фрагментов которых меньше 1 кб, и сохранять файлы BEDPE в ~/Desktop/GSE126612/BEDPE. (ii) Создайте каталог журнала (~/Desktop/GSE126612/log/bam-to-BEDPE) и запишите файл журнала для каждого сопоставленного файла прочитанных фрагментов. (iii) Запуск функций bedtools bamtobed и awk, cut, sort для преобразования файлов bam, отсортированных по именам фрагментов, в фрагменты файлов BED, длина фрагментов которых меньше 1 кб. (iv) Создайте одну папку (~/Desktop/GSE126612/bam-to-bed) и сохраните фрагменты файлов BED в папке bam-to-bed. (v) Записывает файл журнала для каждого сопоставленного фрагмента чтения BED файла в каталог журнала (~/Desktop/GSE126612/log/bam-to-bed). (vi) Выполнить функцию bedtools genomecov для генерации необработанных файлов bedGraph с использованием фрагментов файлов BED в одной папке (~/Desktop/GSE126612/bedGraph).
  4. После завершения прогона внимательно проверьте файлы логов. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Выходные необработанные файлы счетчиков чтения bedGraph будут использоваться в качестве входных файлов для программы SEACR peak caller с опцией нормализации в разделе 12 и нормализацией масштабируемого дробного числа прочтений (SFRC)22 в разделе 10. Фрагментные файлы BED будут служить входными файлами для Spike-in normalized Reads Per Million maped reads in the negative Control (SRPMC) нормализации24,25 в разделе 10.To захватывать короткие фрагменты (>100.н.) только для данных CUT&RUN по хроматин-ассоциированным факторам, изменять шаг фильтрации фрагментов в этом скрипте и переходить к этапу нормализации. Для сравнения сигналов CUT&RUN между короткими и обычными фрагментами в одной и той же выборке может быть полезна нормализация SFRC для уменьшения потенциального эффекта понижения дискретизации, вызванного захватом только коротких фрагментов. Используйте этот сценарий оболочки для выполнения тех же процессов для других отсортированных файлов bam с парным концом, изменяя путь и формат имени файлов bam и bed.

10. Конвертация необработанных файлов bedGraph с подсчетом прочтений в нормализованные файлы bedGraph и bigWig

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_09_normalization_SFRC.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска цикла for с функцией awk для создания нормализованных файлов bedGraph SFRC с использованием необработанных файлов bedGraph в ~/Desktop/GSE126612/bedGraph. (ii) Выполните функцию bedGraphToBigWig для создания сжатого формата (.bw) нормализованных файлов bedGraph SFRC в ~/Desktop/GSE126612/bigWig. (iii) Запишите один файл журнала для записи коэффициента нормализации, используемого для расчета SFRC за прогон, и сохраните файл журнала в ~/Desktop/GSE126612/log/SFRC.
  4. После завершения прогона проверьте файлы логов. Если есть какое-либо сообщение об ошибке, исправьте ошибку и запустите скрипт оболочки еще раз. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Масштабированная нормализация количества дробных операций чтения была использована в исходной публикации22 набора данных CUT&RUN GSE126612 CUT&RUN. Формула нормализации в ячейке i аналогична приведенной ниже:
    figure-protocol-1
    Поскольку этот метод нормализации не включает нормализацию с отрицательным контролем (например, образец IgG) или контролем всплесков, этот подход может быть не идеальным для наблюдения за полногеномной разницей сигналов между образцами. Однако, поскольку этот метод теоретически аналогичен другим нормализациям, основанным на общем количестве прочтений (например, Count Per Million), было бы достаточно наблюдать локальную разницу сигналов между выборками.
  5. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_09_normalization_SRPMC.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт будет: (i) запускать for-loop с функцией bedtools genomecov для создания нормализованных файлов SRPMC bedgraph в ~/Desktop/GSE126612/bedGraph с использованием фрагментов файлов BED в ~/Desktop/GSE126612/bam-to-bed. (ii) Запишите файл журнала для записи коэффициентов нормализации, используемых для нормализации SRPMC за один прогон в ~/Desktop/GSE126612/log/SRPMC. (iii) Выполните функцию bedGraphToBigWig для создания сжатого формата (.bw) нормализованных файлов bedGraph и сохранения нормализованных файлов bigWig в папку ~/Desktop/GSE126612/bigWig .
  6. После завершения прогона внимательно просмотрите файлы журнала. Если в файлах журнала есть сообщение об ошибке, исправьте ошибку и запустите скрипт оболочки еще раз. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Формула нормализации SRPMC была разработана для нормализации фактического количества прочтений выборки как с отрицательным контролем (например, образец IgG), так и с контролем спайка путем объединения коэффициента нормализации RPM (Reads Per Million Mapped Reads), RPS (Ratio Reads Per Spike-in Read) и относительного отношения сигнала к контролю24,25. Определение RPS такое же, как и ниже:
    figure-protocol-2
    Применяя RPS как для фактической, так и для отрицательной контрольной выборки, относительное отношение сигнала (RS) к управляющему для фактической выборки можно рассчитать следующим образом:
    figure-protocol-3
    И определение коэффициента нормализации RPM (RPM:NF) такое же, как ниже:
    figure-protocol-4
    Отсюда был получен коэффициент нормализации SPMC (SRPMC:NF) путем объединения RS и RPM:NF:
    figure-protocol-5
    А упростить эту формулу можно следующим образом:
    figure-protocol-6
    Таким образом, метод SRPMC нормализует чтение на (1) отношение пиковых считываний между контролем и выборкой и (2) нормализованное управление чтением RPM. Поскольку этот нормализующий фактор учитывает всплески прочтений и делает контрольные прочтения сопоставимыми между образцами вместе, этот метод будет целесообразным для наблюдения за различиями между образцами на уровне генома и уменьшения пакетного эффекта при общем количестве прочтений фактических образцов и контрольной группы в различных периодических экспериментах. Эти нормализованные файлы bedGraph станут входными файлами для вызова пиков с использованием SEACR в разделе 11. И эти нормализованные файлы bigWig будут использоваться для визуализации локусов через IGV и создания тепловой карты и усредненного графика через Deeptools. Настоятельно рекомендуется использовать браузер генома для визуализации ландшафтной структуры набора данных CUT&RUN с использованием нормализованных файлов bigWig в репрезентативных областях генома для оценки качества данных. Образцы CUT&RUN, отображающие зашумленные фоновые сигналы, напоминающие контроль IgG, скорее всего, следует опустить для последующих анализов. Используйте эти сценарии оболочки для нормализации других операций чтения файлов bedGraph и необработанных файлов bedGraph, изменяя путь и имена файлов как для входных, так и для выходных файлов bedGraph и bedgraph. Отредактируйте эти скрипты, чтобы применить другие вычисления нормализации, изменив коэффициенты и формулу в этом скрипте.

11. Валидация распределения фрагментов по размерам

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_10_insert-size-analysis.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для того, чтобы: (i) запустить функцию CollectInsertSizeMetrics picard.jar использованием сопоставленных пар чтения bam файлов в папке ~/Desktop/GSE126612/filtered-bam для определения распределения размеров вставки. (ii) Создайте одну папку (~/Desktop/GSE126612/insert-size-distribution) и сохраните результаты анализа распределения размеров вставки в созданную папку. (iii) Запишите файл журнала в папку input bam в папке ~/Desktop/GSE126612/log/insert-size-distribution .
  4. После завершения прогона внимательно проверьте файлы логов. Если в файлах журнала есть сообщение об ошибке, исправьте ошибку и попробуйте запустить скрипт оболочки еще раз. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: В целом, анализ размера вставки (Output) для образцов CUT&RUN показывает основные пики в диапазонах размеров моно- (100-300.н.) и di- (300-500.н.). Технические ошибки/ограничения (такие как избыточное/недостаточное переваривание MNазы во время подготовки образцов CUT&RUN или неправильный выбор размера во время подготовки библиотеки) могут привести к обогащению таких же или больших, чем тринуклеосомные (500-700.о.) фрагменты, и таких же или более коротких, чем субнуклеосомные (<100.о.) фрагменты. Иногда отсутствие пиков мононуклеосомных размеров при обогащении длинными (>500.н.) и короткими фрагментами (<100.н.) может быть связано с диапазонами выбора размера библиотеки, выбранными на стадии мокрой лаборатории, или низкой глубиной секвенирования. Сравните глубину секвенирования («общее количество секвенированных оснований» / «общий размер референсного генома»), обзор геномного ландшафта с использованием нормализованных файлов bigWig в разделе 10 и схему распределения размеров вставки вместе, чтобы уточнить качество обработанных образцов CUT&RUN. Пунктирные линии на гистограммах представляют собой «совокупную долю» прочтений с размером вставки, большим или равным значению на оси x. Эта пунктирная линия позволяет определить распределение размеров вставок во входном сопоставленном файле чтения. Последовательность движения по оси x связана с увеличением размера пластины. Пунктирная линия обозначает долю сопоставленных пар чтения во входном файле bam, размер вставки которых по крайней мере такой же большой, как указано в положении пересекающейся оси X. Таким образом, интерпретация начинается с цифры 1 слева, указывая на то, что все операции чтения имеют размер вставки, больше или равный наименьшему размеру, и уменьшается до 0 по мере увеличения размера вставки.

12. Вызов пиковых значений с использованием MACS2, MACS3 и SEACR

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_11_peak-calling_MACS.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функций macs2 callpeak и macs3 callpeak с контролем IgG и без него, используя фрагменты файлов BEDPE, для вызова пиков и сохранения результатов пиковых вызовов в выходных директориях (~/Desktop/GSE126612/MACS2 и ~/Desktop/GSE126612/MACS3). (ii) Запишите журнал этих пиковых вызовов в виде текстового файла в каталоге журнала (~/Desktop/GSE126612/log/MACS2 и ~/Desktop/GSE126612/log/MACS3)
  4. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_11_peak-calling_SEACR.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот сценарий написан для: (i) Запуска SEACR_1.3.sh скрипта с контролем IgG и без него, со строгими и ослабленными параметрами с использованием необработанных файлов чтения bedGraph и нормализованных файлов bedGraph для вызова пиков. (ii) Создайте выходной каталог (~/Desktop/GSE126612/SEACR-peaks) и сохраните результаты пиковых вызовов с помощью SEACR. (iii) Запишите журнал этих пиковых вызовов в виде текстового файла в каталоге журнала (~/Desktop/GSE126612/log/SEACR).
  5. После завершения запуска shell-скриптов внимательно проверьте файлы логов. Если в файлах журнала есть сообщение об ошибке, сначала исправьте ошибку. Некоторые программы могут не вызывать пики для контрольного образца IgG с опцией контроля IgG вместе, поэтому сообщение об ошибке относительно контрольного образца IgG с опцией контроля IgG может быть опущено. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Эти два сценария оболочки выполняют пиковые вызовы для образцов CUT&RUN с использованием трех пиковых вызовов (MACS2, MACS3 и SEACR) с различными опциями: с/без опции управления IgG, с использованием необработанных прочитанных файлов bedGraph с опцией нормализации пикового вызывающего или нормализованных прочитанных файлов bedGraph без опции нормализации пикового вызывающего абонента, а также строгих и ослабленных опций пикового вызова SEACR. Поскольку выходных файлов вызовов пиков недостаточно для использования непосредственно в нисходящем анализе, Easy Shells CUTnRUN включает один скрипт для обработки этих называемых выходных файлов пиков для создания новых файлов пиков, которые включают хромосому, начало, конец и имя пиков. Благодаря интенсивным подходам к пиковым вызовам, Easy Shells CUTnRUN предоставляет возможность выбрать программу пиковых вызовов, наиболее подходящую для проекта пользователя CUT&RUN, путем сравнения пиковых вызовов по трем пиковым вызовам. Кроме того, этот конвейер анализа CUT&RUN также предоставляет возможность выбрать варианты пиковых вызовов, наиболее подходящие для проекта пользователя CUT&RUN. Эти сравнения будут производиться с помощью диаграммы Венна, а визуализация будет выполнена в виде тепловой карты и усредненного графика.

13. Создание файлов с вызовом пикового ложа

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_12_make-peak-bed.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функции awk с использованием файлов bed в папке ~/Desktop/GSE126612/SEACR для создания двух типов файлов SPACR peak bed ~/Desktop/GSE126612/pic-bed_SEACR . Целые файлы ложа пика включают начало и конец каждого пика, а файлы сфокусированного слоя пика включают начало и ложе самого высокого сигнального столбца в пределах каждого пика. (ii) Запустите функцию awk с использованием файлов _peaks.xls в папках ~/Desktop/GSE126612/MACS2 и ~/Desktop/GSE126612/MACS3 для создания целых файлов ложа пика, которые включают начало и конец каждого пика, вызванного MACS2 и MACS3 в папках ~/Desktop/GSE126612/peak-bed_MACS2 и ~/Desktop/GSE126612/peak-bed_MACS3 . (iii) Запустите функцию awk с использованием файлов _summits.bed в папках ~/Desktop/GSE126612/MACS2 и ~/Desktop/GSE126612/MACS3 для создания сфокусированных файлов порогового слоя, которые включают начало и конец наиболее значимого столбца в пределах каждого пика. (iv) Файлы журнала записываются в текстовом формате в папку ~/Desktop/GSE126612/log/peak-bed .
  4. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_13_filter-peaks.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуск функции пересечения кроватей с использованием файлов ложа пиков, которые вызываются без опции контроля IgG для удаления пиков, перекрывающихся с контрольными пиками IgG. (ii) Отфильтрованные файлы peak bed сохраняются в папках ~/Desktop/GSE126612/peak-bed-filtered_MACS2, ~/Desktop/GSE126612/peak-bed-filtered_MACS3 и ~/Desktop/GSE126612/peak-bed-filtered_SEACR . (iii) Файл журнала log_filter-peaks.txt создается в папке ~/Desktop/GSE126612/log/filter-peaks .
  5. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_14_cat-merge-peak-bed_MACS.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функций cat и сортировки для объединения полных файлов MACS2 и MACS3 всех пиковых кроватей реплик в один файл пиковой кровати и сортировки объединенного файла в папке ~/Desktop/GSE126612/bed-for-comparison . (ii) Запустите функцию объединения инструментов для кроватей с использованием объединенных файлов целого слоя вершин для объединения вершин, которые перекрывают друг друга. (iii) Файл журнала log_cat-merged-peak-bed_MACS.txt записывается в папку журнала ~/Desktop/GSE126612/log/cat-merged-peak-bed.
  6. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_14_cat-merge-peak-bed_SEACR.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для того, чтобы: (i) Запустить функции cat и sort для объединения всех файлов SEACR всех пиковых кроватей репликантов в один файл пиковой кровати и отсортировать объединенный файл пиковой кровати в папке ~/Desktop/GSE126612/bed-for-comparison . (ii) Запустите функцию объединения инструментов для кроватей с использованием объединенных файлов целого слоя вершин для объединения вершин, которые перекрывают друг друга. (iii) Файл журнала log_cat-merged-peak-bed_SEACR.txt записывается в папку журнала ~/Desktop/GSE126612/log/cat-merged-peak-bed.
  7. После завершения запуска сценариев оболочки внимательно просмотрите файлы логов. Если в файлах журнала есть сообщение об ошибке, исправьте ошибку и запустите скрипт(ы) снова. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Файлы ложа пика целых областей пика будут использоваться в качестве входных файлов анализа диаграммы Венна для сравнения сходства между вариантами вызова пиков, методами вызова пиков, репликациями и наблюдениями геномного ландшафта вблизи пиковых областей. Объединенные файлы ложа пиковых областей будут использоваться для анализа главных компонент (ПК) и корреляционного анализа коэффициентов Пирсона с использованием инструментов deeptools. Файлы сфокусированного ложа пика будут использоваться для тепловой карты и анализа графиков средних значений с помощью Deeptools.

14. Проверка сходства между репликациями с помощью корреляции Пирсона и анализа главных компонент (ПК).

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, пользователи могут увидеть следующее: /path/to/bash (или аналогичное сообщение, такое как /bin/bash) в терминале.
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, пропустите этот шаг.
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_15_correlation_plotCorrelation.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функции BED-файла multiBamSummary с использованием файлов bam репликатов, которые были отсортированы по координатам, и объединенных целых файлов ложа пика для CTCF, H3K27Ac и RNAPII-S5P для создания матричных файлов для корреляционного анализа Pearson в папке Desktop/GSE126612/deeptools_multiBamSummary . (ii) Запустите функцию plotCorrelation с использованием файлов матрицы для вычисления коэффициента корреляции Пирсона и кластеризации тепловой карты и сохраните результат в папке ~/Desktop/GSE126612/deeptools_plotCorrelation . (iii) Запишите файл журнала log_plotCorrelation.txt в папку ~/Desktop/GSE126612/log/correlation .
  4. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_15_correlation_plotPCA.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функции BED-файла multiBamSummary с использованием файлов bam, которые были отсортированы по координатам, и объединенных целых файлов ложа пика, которые включают все пики CTCF, H3K27ac и RNAPII-S5P, для создания матричных файлов для анализа главных компонент (PCA) в папке Desktop/GSE126612/deeptools_multiBamSummary . (ii) Запустите функцию plotPCA с использованием файлов матрицы для выполнения PCA и сохраните результат в папке ~/Desktop/GSE126612/deeptools_plotPCA . (iii) Запишите файл журнала log_plotPCA.txt в папку ~/Desktop/GSE126612/log/correlation .
  5. После завершения выполнения shell-скриптов проверьте файлы логов. Если есть какое-либо сообщение об ошибке, исправьте ошибку и запустите скрипты оболочки снова. Если возникла проблема для ее устранения, обратитесь за помощью с помощью веб-страницы проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    Примечание: В принципе, правильно подготовленные и обработанные реплики показывают более высокие значения коэффициента корреляции Пирсона в одной и той же кластерной группе и близкое позиционирование в анализе главных компонент. Любая реплика, которая показывает более низкий коэффициент корреляции Пирсона и большое расстояние от других реплик на графике главных компонент, может представлять собой потенциальное исключение среди репликатов. Этот скрипт оболочки применим для любого формата bam, сопоставленных с данными чтения. Изменяйте путь и имя файла bigwig в соответствии с требованиями проекта.

15. Проверка сходства между репликациями, методами вызова пиков и опциями с помощью диаграммы Венна

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, то в терминале может быть что-то вроде /path/to/bash (например, /bin/bash).
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, подумайте о том, чтобы пропустить этот шаг
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_16_venn-diagram_methods.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функции intervention venn с использованием файлов ложа пика всей области пика для поиска перекрытий между пиками, вызываемыми различными вариантами (с/без опции контроля IgG, с/без нормализации и строгими/ослабленными опциями вызова пиков для SEACR). (ii) Создайте одну папку (~/Desktop/GSE126612/intervene_methods) и сохраните результаты анализа диаграммы Венна в этой папке. (iii) Запишите один файл журнала log_intervene_methods.txt в папку ~/Desktop/GSE126612/log/intervention .
  4. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_16_venn-diagram_replicates.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для того, чтобы: (i) запустить функцию intervention venn с использованием файлов ложа пика всей области пика для поиска перекрытий между пиками реплик. (ii) Создайте одну папку (~/Desktop/GSE126612/intervene_replicates) и сохраните результаты анализа диаграммы Венна в этой папке. (iii) Запишите один файл журнала log_intervene_replicates.txt в папку ~/Desktop/GSE126612/log/intervention .
  5. После завершения запуска сценариев оболочки просмотрите файлы журнала. Если есть какое-либо сообщение об ошибке, исправьте ошибку и запустите скрипты оболочки снова. Если у вас возникли проблемы с использованием конвейера анализа Easy Shells CUTnRUN, обратитесь за помощью на веб-странице проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: Эти результаты анализа диаграммы Венна дают представление о выборе наиболее подходящих опций, методов и репликаций пиковых вызовов с высокой воспроизводимостью для последующего анализа. Может быть предпочтительнее выбирать опции и методы пикового вызова, которые показывают наибольшие пиковые числа вызовов с хорошим перекрытием с другими методами и опциями пиковых вызовов.

16. Анализ тепловых карт и усредненных графиков для визуализации называемых пиков.

  1. Откройте терминал и введите echo $SHELL , чтобы проверить оболочку по умолчанию в активном терминале. Если оболочка Bash является оболочкой по умолчанию в текущем терминале, то в терминале может быть что-то вроде /path/to/bash (например, /bin/bash).
  2. Если оболочка по умолчанию не Bash, установите оболочку Bash в качестве оболочки по умолчанию, введя chsh -s $(which bash) в терминале. Если терминал использует оболочку Bash по умолчанию, подумайте о том, чтобы пропустить этот шаг
  3. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_27_plotHeatmap_focused.sh в терминале или перетащите файл скрипта оболочки в терминал и введите.
    ПРИМЕЧАНИЕ: Этот скрипт написан для: (i) Запуска функции опорных точек computeMatrix с использованием нормализованных файлов bigWig и файлов сфокусированных пиковых лож для создания нормализованных матриц чтения в центре сфокусированных пиков в папке ~/Desktop/GSE126612/deeptools_computeMatrix . (ii) Запустите функцию plotHeatmap с использованием нормализованной матрицы чтений для создания тепловых карт и усредненных графиков, которые визуализируют нормализованную схему распределения счетчиков прочтений в сфокусированных пиковых точках. (iii) Создайте одну папку (~/Desktop/GSE126612/deeptools_plotHeatmap) и сохраните выходные файлы plotHeatmap в этой папке. (iv) Запишите один файл журнала log_plotHeatmap_focused.txt в папку ~/Desktop/GSE126612/log/plotHeatmap .
  4. Введите ~/Desktop/Easy-Shells_CUTnRUN/scripts/Script_27_plotHeatmap_whole.sh в терминале или перетащите файл скрипта оболочки в терминал и войдите.
    Этот скрипт написан для: (i) Запуска функции опорных точек computeMatrix с использованием нормализованных файлов bigWig и файлов всего ложа пика для создания нормализованных матриц счетчиков чтения в центре всех пиков в папке ~/Desktop/GSE126612/deeptools_computeMatrix . (ii) Запустите функцию plotHeatmap с использованием нормализованной матрицы счетчиков прочтений для создания тепловых карт и усредненных графиков, которые визуализируют схему распределения нормализованных чисел чтения во всех местах пиковых нагрузок. (iii) Создайте одну папку (~/Desktop/GSE126612/deeptools_plotHeatmap) и сохраните выходные файлы plotHeatmap в этой папке. (iv) Запишите один файл журнала log_plotHeatmap_whole.txt в папку ~/Desktop/GSE126612/log/plotHeatmap .
  5. После завершения запуска сценариев оболочки просмотрите файлы журнала. Если есть какое-либо сообщение об ошибке, исправьте ошибку и запустите скрипты оболочки снова. Если у вас возникли проблемы с использованием конвейера анализа Easy Shells CUTnRUN, обратитесь за помощью на веб-странице проблем Easy Shells CUTnRUN на github (https://github.com/JunwooLee89/Easy-Shells_CUTnRUN/issues).
    ПРИМЕЧАНИЕ: В идеале, пиковые вершины пиков MACS2/3 и сфокусированные пики SEACR демонстрируют резкое и сфокусированное распределение сигнала в центре графиков. Однако, если алгоритм вызова пиков не работает должным образом для данных CUT&RUN, на графиках может появиться менее сфокусированное «зашумленное» распределение сигнала. Таким образом, использование количества вызываемых пиков и шаблонов распределения пикового сигнала на выходных графиках будет определять пиковую достоверность для дальнейшего анализа CUT&RUN, который включает аннотацию нисходящих пиков.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Качество и обрезка адаптера сохраняют прочтения с высоким качеством секвенирования
Методы секвенирования с высокой пропускной способностью склонны к возникновению ошибок секвенирования, таких как «мутации» последовательностей при чтении. Кроме того, димеры адаптера секвенирования могут быть обогащены в наборах данных секвенирования из-за плохого удаления адаптера во время подготовки библиотеки. Чрезмерные ошибки секвенирования, такие как мутации чтения, генерация прочтений короче, чем требуется для правильного картирования, и обогащение димерами адаптера, могут увеличить время картирования чтения и привести к ложноположительным картированным чтениям, которые искажают результаты последующего биоинформатического анализа. Таким образом, требуется качественная фильтрация и подстройка адаптера для сохранения высокого качества чтения для последующего анализа и интерпретации.

Чтобы сохранить высокое качество чтения для анализа, в этом конвейере анализа CUT&RUN (рис. 2) используются FastQC26 и Trim Galore27. Скрипт оболочки "Script_03_fastQC.sh" запускает FastQC для всех файлов fastq в рабочем каталоге. Результаты (Рисунок 3) этого шага с использованием общедоступного набора данных CTCF CUT&RUN из GSE126612 (SRR8581589) выявляют некоторые чтения с низким качеством баз оценки (Рисунок 3A, C) и некоторую степень несоответствия содержимого GC для каждой последовательности между теоретической оценкой и фактическими чтениями (Рисунок 3E).

Выполнение сценария "Script_04_trimming.sh" для запуска Trim Galore успешно удаляет чтения с низким качеством оценки (ниже 20 на рисунке 3A) и низким средним качеством последовательности, очевидными перед обрезкой (рисунок 3B-D). Кроме того, "Script_04_trimming.sh" также успешно удаляет 55~60% среднего обогащения GC, отображаемого на графике GC "pre-trimming" по графику последовательности (Рисунок 3E, F). Эти результаты демонстрируют, что этот конвейер анализа CUT&RUN фильтрует высококачественные чтения, чтобы обеспечить быстрое и точное сопоставление прочтений с референсным геномом.

Распределение размеров вставки может дать оценку пиковых результатов вызова
Из-за использования MNазы в CUT&RUN (Рисунок 1), ожидается, что картированные чтения CUT&RUN будут демонстрировать пики моно- (~200.н.) и динуклеосомных (~350.н.) размеров фрагментов ДНК в пределах графиков распределения размеров вставок (Рисунок 4). Проблемы с обнаружением некоторых целей могут привести к коротким вставкам (< 100.о.) (Рисунок 4C). Высокий уровень коротких прочтений сокращает количество прочтений, которые могут быть использованы для пиковых вызовов с высокой степенью достоверности, тем самым уменьшая пиковые числа и влияя на последующий анализ. В этом конвейере анализа CUT&RUN "Script_10_insert-size-analysis.sh" использует функцию "picard.jar CollectInsertSizeMetrics" для выполнения анализа распределения размеров вставки и экспорта гистограмм в качестве выходных данных визуализации (рис. 2). На выходных графиках (рис. 4A-C) ось x показывает диапазон размеров вставок, левая сторона оси y и заполненная гистограмма представляют количество вставок со значением по оси x, а правая сторона оси y показывает и пунктирная линия кумулятивную долю вставок с размером вставки, равным или превышающим значение по оси x. Таким образом, как расположение на оси X с наиболее резким изменением наклона пунктирной линии, которая пересекается с уровнем максимумов на гистограмме, определяет основной размер вставки в выборке. Среди прочтений, картированных на представляющем интерес референсном геноме (человек, hg19), фрагменты образца H3K27Ac (активная метка гистонов) демонстрируют ожидаемое распределение размеров вставки CUT&RUN с наибольшим однонуклеосомным размером и обнаруживаемыми пиками динуклеосомных размеров (рис. 4B). Фрагменты образца CTCF показали дополнительные группы в областях длины фрагмента 100~200.о. (Рисунок 4A). В целом, конвейер анализа CUT&RUN предоставляет простые в использовании сценарии оболочки для выполнения анализа распределения размеров вставок после картирования прочтений на референсных геномах. Эти анализы становятся важными при оценке эффективности пиковых вызовов перед последующим анализом.

Конвейер анализа Easy Shells CUTnRUN предоставляет фильтрацию и параметры нормализации для создания достоверных счетчиков чтения
Одним из критических моментов анализа CUT&RUN является получение правильных отображенных пар чтения путем фильтрации проблемных пар чтения из исходных выходов отображения и нормализации отфильтрованных отображенных счетчиков прочтений с помощью специального метода расчета нормализации, который может удовлетворить цели/потребности пользовательского анализа. Конвейер анализа CUT&RUN, обсуждаемый в данном исследовании, включает в себя сценарий «Script_07_filter-sort-bam.sh» для удаления прочитанных пар, которые отображены либо на неканонических хромосомах, либо на публично аннотированных областяхчерного списка 23, и TA повторяет области18,22 из прочитанных пар, которые были картированы с помощью bowtie2 с использованием «Script_06_bowtie2-mapping.sh». Эти фильтрации необходимы для удаления пар чтения, которые могут давать ложноположительные, отклоняющиеся сигналы всплесков и называемые пиками в нисходящем анализе (рис. 5; области желтого прямоугольника).

В дополнение к фильтрации, применение правильного метода нормализации является важным фактором для точной визуализации разницы сигналов между образцами. Таким образом, конвейер анализа CUT&RUN включает в себя сценарии «Script_09_normalization_SFRC.sh» и «Script_09_normalization_SRPMC.sh» для предоставления двух общедоступных методов нормализации - масштабируемого дробного чтения (SFRC)22 и нормализованных чтений на миллион сопоставленных прочтений в отрицательном контроле (SRPMC)24,25 (рисунок 5A-D). Поскольку SFRC не включает в формулу контрольный образец (например, IgG) или образец с шиповым входом, нормализация SFRC может быть использована для образцов, которые не включают контрольный образец или ожидается, что они продемонстрируют различия сигналов только в локальных областях без различий в масштабе всего генома. Нормализованные выборки SFRC, обработанные конвейером анализа CUT&RUN (рисунок 5A-D; красные дорожки), создают те же шаблоны распределения сигнала, что и общедоступные картографированные чтения из GEO (рисунок 5A-D; черные дорожки), что позволяет предположить, что этот конвейер может воспроизводить результаты публикации.

Метод SRPMC полезен для нормализации выборок, которые включают как контрольные, так и спайковые выборки и должны показывать глобальную разницу сигналов между выборками (рисунок 5A-D; зеленые дорожки). Поскольку одна выборка H3K27Ac (SRR8581599) демонстрирует гораздо более высокое соотношение «(фактические чтения CUT&RUN)/(пиковые чтения)» (RPS выборки; 997), чем другие реплики (237, 175 и 161), относительные сигналы H3K27Ac различаются между репликациями в нормализованных выборках SFRC и SRPMC (рисунок 5A-D; H3K27Ac сравнивается по всем трекам). Образцы RNAPII-S5P демонстрируют относительно более низкие RPS образца (1,7, 0,8, 2,1), чем контрольный IgG (259), таким образом, образцы RNAPII-S5P демонстрируют более низкий сигнал, чем контрольный IgG после нормализации SRPMC (рис. 5A-D; Сравнение RNAPII-S5P по всем трекам). Таким образом, рассматриваемый здесь конвейер анализа CUT&RUN рекомендует использовать метод SRPMC только для образцов, которые имеют достаточное количество прочтений в экспериментальных образцах относительно как контрольных считываний IgG, так и контрольных чтений с пиковым входом.

Сравнение диаграммы Венна может дать идеи по выбору лучшего метода и опций вызова пика
Программы множественных пиковых вызовов позволяют идентифицировать значительно обогащенную занятость белка по всему геному. К таким программам, используемым для анализа CUT&RUN, относятся программы семейства MACS2 и SEACR4 в качестве основных методов на сегодняшний день. Тем не менее, может быть непросто, особенно для новичков в биоинформатике, определить наиболее подходящий метод вызова пика и варианты для конкретного проекта CUT&RUN. Таким образом, конвейер анализа CUT&RUN включает в себя шаги анализа диаграммы Венна, чтобы дать пользователям возможность сравнить сходство и различие результатов пиковых вызовов между различными вариантами пиковых вызовов (Script_17_intervene-вариантами) и программами пиковых вызовов (Script_19_intervene_methods.sh) (рис. 6A-H).

В соответствии с сравнением объединенных пиков CTCF, H3K27ac и RNAPII-S5P, которые вызываются с опцией контроля IgG и без нее во время шага вызова пика, MACS2 и MACS3 вызывали больше пиков с опцией управления IgG (Рисунок 6A), но SEACR вызывал больше пиков без опции контроля IgG как в строгом, так и в ослабленном вариантах (Рисунок 6B-D). Таким образом, конвейер анализа CUT&RUN предлагает (1) применить опцию контроля IgG для MACS2 и MACS3, (2) вызывать пики для экспериментальных образцов CUT&RUN и контрольных образцов IgG отдельно, а затем отфильтровывать пики IgG позже для вызывающего пик SECR. Между MACS2 и MACS3 MACS3 вызывал немного больше пиков (рис. 6A).

Кроме того, сравнение пиков, вызываемых MACS2 и MACS3 с опцией управления IgG и SEACR без опции управления IgG, показывает, что пики SEACR, вызванные с помощью строгой опции, перекрываются с пиками MACS 2 и MACS3 в большей степени, чем пики SECR, вызываемые с ослабленной опцией (рис. 6E, F). Таким образом, выходные данные конвейера анализа CUT&RUN позволяют предположить, что строгий вариант максимизирует согласованность SEACR с пиковым вызовом MACS. Наконец, диаграмма Венна для сравнения перекрытия пиков, вызванных SEACR, с нормализацией для файлов CUT&RUN bedGraph и без нормализации для нормализованных чисел чтения файлов CUT&RUN bedGraph не показывает разницы между методами SFRC и SRPMC для SEACR со строгим параметром. Пики SFRC демонстрируют гораздо более высокие пиковые значения и лучшее перекрытие с пиками нормализованных вариантов («норма» на рисунке 6), чем пики SRPMC для SEACR с ослабленными вариантами (рисунок 6G, H).

Статистические сравнения между репликациями и выборками
Чтобы сделать точные выводы по нескольким репликациям, необходимо оценить сходство реплик. Используемый здесь конвейер анализа CUT&RUN использует расчет статистического коэффициента корреляции на основе15 Deeptools2, кластеризацию тепловых карт и анализ главных компонент (PCA) для облегчения идентификации образцов и реплик, подходящих для достоверного последующего анализа. Кластеризация тепловых карт на основе коэффициента корреляции Пирсона показала статистически значимую корреляцию между репликациями для CTCF, H3K27Ac и RNAPII-S5P в их называемых пиковых областях (рис. 7A-C). Тем не менее, PCA показал, что один образец CTCF (SRR8581590) и H3K27Ac (SRR8581608) расположен относительно далеко от других реплик (рисунок 7D) во всех CTCF, H3K27Ac и RNAPII-S5P, называемых пиковыми областями.

Согласно диаграмме Венна для сравнения пиков между репликами, пики CTCF (SRR8581590) показали наименьшее перекрытие с другими репликациями во всех трех результатах пиковых вызовов (рисунок 7E-G), а пики H3K27Ac (SRR8581608) показали наименьшее перекрытие с другими репликами в результатах пиковых вызовов SEACR (рисунок 7F). пики H3K27Ac (SRR8581608) не показали минимального перекрытия с другими репликациями в результатах вызовов пиков MACS2 и MACS3 (рисунок 7F), что может свидетельствовать о том, что расстояние между репликациями в PCA недостаточно для определения выборки выбросов. Таким образом, конвейер анализа CUT&RUN предлагает определять репликацию выброса как «выборку, которая показывает низкий коэффициент корреляции Пирсона в группе кластеризации тепловой карты, большое расстояние на графике PCA с другими репликациями и наименьшее перекрытие пиков среди репликатов».

Пиковые вызовы облегчают визуализацию и интерпретацию данных CUT&RUN
В конвейере анализа CUT&RUN, подробно описанном в этом исследовании, используются два типа общедоступных пиковых вызовов: семейство MACS и SEACR. Чтобы оптимизировать визуализацию называемых пиков, этот конвейер выбирает самый высокий сигнальный бин в качестве центра пиков для анализа тепловой карты и метаграфиков. Все пики CTCF, H3K27Ac и RNAPII-S5P, вызванные MACS3 и SEACR пиковыми вызовами, показали более резкое распределение пиков в центре самых высоких сигнальных бинов (рис. 8A-F, «сфокусированные» графики), чем в центре целых пиковых областей (рис. 8A-F, «целые» графики). Образцы CUTnRUN CUTnRUN, обработанные Easy Shells Конвейер анализа CUTnRUN с нормализацией SFRC (рис. 8 A-F, графики SFRC), демонстрируют схожие с паттернами распределения сигналов нормализованных сэмплов SFRC, необработанные сопоставленные пары чтения которых общедоступны в GEO (рис. 8A-F, «общедоступные» графики) на пиках, вызываемых конвейером анализа. Таким образом, конвейер анализа CUT&RUN может успешно воспроизводить результаты публикации.

figure-results-1
Рисунок 1: Схема экспериментальной процедуры CUT&RUN. CUT&RUN — это ферментативный подход к обнаружению белок-ДНК-взаимодействий по всему геному. Процедура CUT&RUN начинается со связывания клеток (или изолированных ядер) с конканавалином А, конъюгированным с магнитными шариками, чтобы обеспечить выделение и манипуляции с низким количеством клеток на протяжении всей процедуры. Изолированные клетки проникают с помощью мягкого детергента, чтобы облегчить введение антитела, нацеленного на интересующий белок. Микрококковая нуклеаза (МНКаза), привязанная к белку А или белку A/G, затем вводится в проникнутую клетку. pA-MNase (или pAG-MNase) рекрутируется в связанное антитело с помощью метки Protein A или Protein A/G. После того, как МНаза локализована в целевых участках, нуклеаза на короткое время активируется путем введения кальция для переваривания ДНК вокруг целевого белка. В результате расщепления МНазы образуются мононуклеосомные ДНК-белковые комплексы. Кальций впоследствии хелатируют, чтобы завершить реакцию пищеварения, и короткие фрагменты ДНК в результате расщепления MNазы высвобождают из ядер путем короткой инкубации при 37°C, а затем подвергают очистке ДНК, подготовке библиотеки и высокопроизводительному секвенированию. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-2
Рисунок 2: Схематическое резюме конвейера анализа Easy-Shell CUT&RUN. Конвейер анализа Easy-Shell CUT&RUN состоит из трех основных разделов: (1) контроль качества и сопоставление необработанных прочитанных файлов (слева; фиолетовый), (2) нормализация сопоставленных операций чтения и чтения и вызовов пиков (в центре; зеленый) и (3) проверка сопоставленных прочтений и вызываемых пиков (справа; розовый). На каждом шаге указывается соответствующий номер сценария оболочки, краткое описание и программное средство, используемое на этом этапе (в скобках). Простые стрелки показывают прямые потоки между шагами. Этот конвейер анализа CUT&RUN предоставляет два метода нормализации чтения, которые могут удовлетворить потребности пользователей с контрольным чтением и без него, многоуровневые процессы валидации для определения правильных репликатов для последующего анализа и целенаправленную идентификацию пиков для создания четко сфокусированной тепловой карты и метаграфика. Этот конвейер анализа написан в виде простых в использовании сценариев оболочки шаг за шагом, чтобы предоставить новичкам в биоинформатике возможность изучить и попрактиковаться в базовом анализе данных CUT&RUN, читая и редактируя сами скрипты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-3
Рисунок 3: Сравнение результатов проверки качества до и после обрезки качества. Выберите выходные данные отчета о проверке качества из FastQC, чтобы отобразить эффект обрезки качества с использованием операций чтения из SRR8581589 (GSM3609748, CTCF). Показанные результаты включают: (A) Оценка качества по базам предварительной обрезки. (B) Те же показания, что и A) после обрезки. (C) Распределение показателей качества по всем последовательностям предварительной обрезки. (D) Те же показания, что и C) после обрезки. (E) Распределение GC по всем последовательностям предварительной обрезки. (F) Та же индикация, что и E) после обрезки. Минимальная оценка качества в каждой позиции в течение прочтений секвенирования (A, B) и минимальное среднее качество последовательности (C, D) увеличиваются после качественной обрезки. Кроме того, этот шаг может уменьшить разницу между теоретическим распределением количества GC и фактическим числом GC на основание в чтениях (E, F) за счет удаления пар прочтений, которые имеют высокий коэффициент несовпадения оснований. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-4
Рисунок 4: Анализ распределения размеров вставки. Вставьте гистограмму размера для (A) CTCF, (B) H3K27Ac и (C) серин-5 фосфорилированной РНК-полимеразы II (RNAPII-S5P). Гистограммы отображают относительные различия в распределении размеров вставки между образцами. Пунктирная линия на гистограмме представляет собой совокупную долю операций чтения с размером вставки, большим или равным значению на оси X. n: количество согласованно отображенных уникальных прочтений на образец после фильтрации. FR: фрагменты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-5
Рисунок 5: Ландшафтный обзор образцов CUT&RUN. Общедоступные картированные чтения CUT&RUN, нормализованные по масштабированному дробному подсчету (SFRC) без дополнительной фильтрации (черные дорожки), образцы CUT&RUN, обработанные конвейером анализа Easy Shells CUTnRUN с нормализацией SFRC (красные дорожки) и «Всплеск нормализованных прочтений на миллион картированных прочтений в отрицательном контроле (SRPMC; зеленые дорожки)» показаны в (A) области кластера генов гистонов, и (B-D) другие три области с пиками CTCF, H3K27Ac и RNAPII-S5P, вызываемыми всеми пиковыми вызовами MACS2, MACS3 и SEACR. Желтыми прямоугольниками выделено расположение сигналов спайков, отфильтрованных на этапе фильтрации в конвейере анализа Easy Shells CUTnRUN. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-6
Рисунок 6: Диаграмма Венна для сравнения пиковых вызовов, вызванных разными пиковыми вызовами, и вариантов пиковых вызовов. (A) Сравнение пиковых вызовов, вызванных MACS2 и MACS3, с опцией ввода IgG и без нее во время пикового вызова. (Б-Г) Сравнение пиков, вызванных SEACR, с опцией ввода IgG и без нее, опциями «строгого» и «ослабленного», а также с опцией нормализации с использованием файлов необработанных пар чтения (B), без опции нормализации с использованием нормализованных файлов счетчиков прочтений SFRC (C) или нормализованных файлов счетчиков прочтений SRPMC (D). (Э,Ж) Сравнение пиков, вызываемых MACS2, MACS3 с опцией ввода IgG и SEACR с опцией строгого (E) или ослабленного (F) опции. (Г,Н) Сравнение пиков, вызываемых SEACR без опции ввода IgG и с жесткими (G) или ослабленными (H) опциями. w/ IgG: пики, вызываемые с опцией ввода IgG. без IgG: пики вызываются без опции ввода IgG. Норма: пики вызываются с опцией нормализации. non: пики, вызванные без опции нормализации. SFRC: пиковые значения, вызванные числом чтения, файлы, нормализованные методом «масштабируемого дробного подсчета (SFRC)». SRPMC: пиковые значения, вызванные числом прочтений, файлы, нормализованные с помощью метода "Spike-in normalized Reads Per Million mapped reads in the negative Control (SRPMC)". Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-7
Рисунок 7: Корреляция Пирсона, анализ главных компонент и диаграмма Венна для подтверждения сходства между репликациями. (A-C) Кластеризация тепловой карты со значениями коэффициента корреляции Пирсона отображает степень сходства между репликами на пиках, называемых MACS2 (A), MACS3 (B) и SEACR (C). Коэффициент корреляции Пирсона находится в диапазоне от -1 до 1. Большее абсолютное значение коэффициента корреляции Пирсона указывает на более сильную корреляцию между двумя переменными, а положительное значение коэффициента корреляции Пирсона указывает на положительную корреляцию, при которой две переменные движутся в одном направлении. Таким образом, образцы с более высоким сходством демонстрируют более близкую родословную в кластеризации тепловых карт и более высокое значение коэффициента Пирсона. (D) Анализ главных компонент (PCA) показывает степень сходства между репликами и образцами во всех пиковых областях CTCF, H3K27Ac и RNAPII-S5P, которые называются MACS2 (слева), MACS3 (в центре) и SEACR (справа). Образцы с более высоким сходством располагаются ближе друг к другу на графике PCA. (Э-Г) Анализ диаграммы Венна для сравнения пиков, обнаруженных в каждой реплике с помощью MACS2 (E), MACS3 (F) и SEACR (G). В конвейере анализа Easy-Shell CUT&RUN предлагается применять все три метода для выявления реплик с высокой степенью сходства, которые могут быть пригодны для объединения вызываемых пиков для последующего анализа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-8
Рисунок 8: Тепловая карта и метаграфик визуализации распределения сигнала на пиках. Тепловая карта и метаграфики отображают распределение обогащения вокруг пиковых центров, вызываемых с использованием различных пиковых вызовов. (А,Б) Пики CTCF CUT&RUN вызываются из одной репликации (SRR8581589) с помощью MACS3 (A) и SEACR (B). (К,Г) Пики H3K27Ac CUT&RUN вызываются из одной реплики (SRR8581607) с использованием MACS3 (C) и SEACR (D). (Э,Ж) Пики RNAPII CUT&RUN вызываются из одной репликации (SRR8581589) с помощью MACS3 (E) и SEACR (F). Общедоступные сопоставленные пары чтения («Public» на рисунке 8) и фрагменты, сопоставленные конвейером анализа CUTnRUN от Easy Shells («SFRC» на рисунке 8), сравниваются после нормализации «масштабируемого дробного числа (SFRC)». Пики вызываются MACS3 с опцией ввода IgG («MACS3 с IgG» на рисунке 8) и SEACR без ввода IgG и без опции нормализации с использованием нормализованных файлов подсчета прочтений SFRC в строгом режиме («SEACR w/o IgG non SFRC strictent» на рисунке 8). Подготавливаются два варианта файлов координат вызываемых вершин: от начала до конца вызываемых вершин («целый» на рисунке 8) и местоположение бина с наибольшим сигналом в пределах вызываемых вершин (вершины в MACS3 называются пиками; «сфокусированный» на рисунке 8). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Таблица 1: Информация для файлов CUT&RUN fastq в GSE126612. Все необработанные прочитанные файлы CUT&RUN fastq, которые включены в GSE126612 и выбраны в качестве примера набора данных для конвейера анализа Easy Shells CUTnRUN, перечислены в виде таблицы. В столбце "Имя файла" отображаются имена необработанных файлов fastq, которые будут показаны в '~/Desktop/GSE126612/fastq' после запуска 'Script_02_download-fastq.sh'. 'md5sum' использует MD5 (Message-Digest Algorithm 5) для примера набора данных, который можно использовать для проверки целостности файлов после загрузки набора данных с помощью 'Script_02_download-fastq.sh'. В последнем столбце описывается цель CUT&RUN для каждого образца. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Возможность картирования занятости белка на хроматине имеет основополагающее значение для проведения механистических исследований в области биологии хроматина. По мере того, как лаборатории внедряют новые методы профилирования хроматина, возможность анализировать данные секвенирования из этих лабораторных экспериментов становится распространенным узким местом для ученых, изучающих мокрую лабораторию. Поэтому мы описываем вводный пошаговый протокол, который позволит новичкам в биоинформатике преодолеть узкое место в анализе и начать анализ и проверку качества своих собственных данных секвенирования CUT&RUN.

Этот протокол анализа CUT&RUN описывает применение нескольких этапов для обеспечения количественной оценки истинных сигналов. Удаление некачественных операций чтения и последовательностей адаптеров из необработанных данных чтения является одним из первых шагов контроля качества и одним из наиболее важных шагов для получения точных результатов анализа. Таким образом, данный конвейер анализа включает в себя простые в применении этапы обработки качества и обрезки адаптеров с помощью программы Trim-galore27. В связи с важностью этого процесса данный конвейер анализа включает в себя шаги для сравнения качества результатов до (шаг 4.3) и после (шаг 5.3) процесса обрезки (шаг 5.5). В дополнение к обрезке качества и адаптеров, этот конвейер анализа также удаляет неканонические чтения хромосом, области повторов TA и области черного списка, которые могут привести к смещению содержимого GC и ложноположительным всплескам/так называемым пикам. Эти этапы фильтрации обеспечивают надлежащий вводный конвейер для начинающих биоинформатиков, чтобы понять критически важные шаги контроля качества для анализа данных CUT&RUN.

После этапа фильтрации этот конвейер анализа CUT&RUN предоставляет два варианта нормализации: «масштабированное дробное число чтений (SFRC)22» и «пиковое нормализованное количество чтений на миллион сопоставленных чтений в отрицательном контроле (SRPMC)24,25 для создания входных файлов для нисходящих пиковых вызовов и визуализации. Если ожидается, что набор данных CUT&RUN будет выявлять только локальные различия без различий сигналов между образцами на уровне генома, то для последующего анализа может быть достаточно масштабированного дробного счетчика прочтений (доля счетчиков, умноженная на размер эталонного гнома). Однако, если существует вероятность того, что между выборками CUT&RUN будут присутствовать глобальные различия в сигналах, пользователи могут выбрать метод SRPMC, который учитывает соотношение прочтений между спайковым и сэмплом (как экспериментальными образцами CUT&RUN, так и отрицательными контрольными образцами) вместе с нормализацией считываний на миллион (RPM) для отрицательных контрольных считываний, чтобы сделать отрицательные контрольные считывания сопоставимыми между различными образцами. Поскольку SRPMC обеспечивает нормализованное чтение относительно нормализованных отрицательных контрольных считываний, этот подход минимизирует отрицательный управляющий сигнал и позволяет сравнивать наборы данных, созданные в разных пакетах и группах.

Важным фактором при определении пиковых значений CUT&RUN является исключение ложноположительных результатов CUT&RUN пиков во время анализа in silico , в частности, путем включения образцов IgG. В частности, этот конвейер анализа предоставляет подходы к пиковым вызовам для различных пиковых вызовов, чтобы отбросить ложноположительные вызовы, вызванные CUT&RUN. Для пиковых вызовов MACS2/3 наш конвейер анализа применяет фиктивные чтения IgG в качестве входной выборки во время пиковых вызовов. Для SEACR этот конвейер анализа рекомендует сначала вызывать пики для экспериментальных образцов и отрицательных контрольных образцов независимо друг от друга, а затем удалять пики, которые перекрываются между экспериментальными образцами и отрицательными контрольными образцами, поскольку SEACR может «потерять» большинство пиков, если предоставить отрицательный контроль во время вызова пиков экспериментальных образцов. Курируемые пики демонстрируют сопоставимое сходство между различными пиковыми вызовами и репликами (рис. 5). В целом, удаление некачественных неканонических хромосом, областей черного списка и повторов TA, обрезка последовательностей адаптеров, нормализация ДНК со спайками и правильная обработка негативного контроля во время пиковых этапов вызова предоставляют пользователям правильные файлы с подсчетом прочтений, которые подходят для последующего анализа. С помощью высококачественных нормализованных файлов чтения и курируемых называемых пиков пользователи могут сравнивать сходство между репликациями и создавать тепловые карты и метаграфики с ультрачистым фоновым сигналом для проверки эффективного вызова пиков.

Пиковые вызовы с высоким качеством чтения знаменуют собой начало построения биологических интерпретаций на основе данных CUT&RUN. Этот протокол описывает получение сфокусированных пиковых сигналов на тепловых картах и метаграфиках путем назначения мест с самым высоким сигналом или наиболее статистически значимых сигналов в качестве центров пиков. При некоторых подходах к пиковым вызовам не выбираются самые высокие сигналы или наиболее статистически значимые сигналы в их центральном расположении. Таким образом, переопределение центра каждого пика в качестве места с самым высоким сигналом или наиболее статистически значимым сигналом служит важным шагом для создания визуальных выходных данных с хорошо сфокусированными сигналами в центре графиков. Файлы пластов исходно называемых пиками сохраняются для выполнения аннотации пиков и анализа функциональной релевантности в качестве следующих шагов после завершения шагов, описанных в данном протоколе.

Несмотря на то, что этот конвейер анализа CUT&RUN включает в себя шаги по описанию установки необходимых программ, новички в биоинформатике могут столкнуться с трудностями при установке инструментов анализа. В связи с этим была создана соответствующая страница проблем на Github, чтобы предоставить более подробные пошаговые описания установки программ и облегчить коммуникацию для поддержки пользователей во время установки программы в их собственной системе. Следующие шаги в конвейере анализа CUT&RUN помимо протокола, описанного в этой статье, включают аннотацию пиков, выявление перекрытий между различными типами вызываемых пиков и функциональную аннотацию для вызываемых пиков. Выполнение этапов контроля качества и вызова пиков, описанных в этом протоколе, в сочетании с аннотацией нисходящих пиков позволит пользователям извлекать биологический смысл из своих данных CUT&RUN.

Этот конвейер анализа CUT&RUN был создан для предоставления общих вводных пошаговых рекомендаций по массовому анализу CUT&RUN. Этот конвейер имеет некоторые ограничения. Во-первых, несмотря на то, что этот конвейер анализа пытается справиться с эффектом, обусловленным вариацией содержимого ГХ, путем фильтрации чтений в областях черного списка (которые включают «области с высоким уровнем артефактов сигнала» и «области повтора артефактов», а также области повтора ТА), этот подход может быть недостаточным для некоторых организмов, которые могут иметь отличительное содержание ГК в своем геноме. Поэтому, если пользователи обеспокоены какими-либо предубеждениями, вызванными содержимым GC, рассмотрите возможность добавления еще одного шага для исправления сопоставленных чтений. Для новичков в биоинформатике «computeGCBias» и «correctGCBias» в Deeptools могут быть вариантами для этой цели. Во-вторых, этот конвейер анализа обрабатывает как обычный размер вставки (100.о.н-1.о.), так и малый размер вставки (< 100.н.), которые могут быть фактическими чтениями некоторых белков, связанных с хроматином, в одном файле. Поскольку этот конвейер анализа написан в сценариях оболочки, пользователи могут изменить «Script_08_bam-to-BEDPE-BED-bedGraph.sh», чтобы получать короткие чтения размера вставки отдельно от обычных считываний размера фрагмента на этапе создания файла ложа сопоставленных прочтений. Впоследствии, короткий размер считывания вкладыша может быть нормализован независимо от обычного сопоставленного размера вкладыша, чтобы свести к минимуму эффект уменьшения. В-третьих, чтобы упростить конвейер анализа, Easy Shells CUTnRUN не включает шаг понижения выборки в соответствии с глубиной секвенирования образцов CUT&RUN. Тем не менее, пользователи могут применить шаг понижения выборки после фильтрации файлов bam с помощью samtools view28 или PositionBasedDownsampleSam (Picard)29.

Все шаги анализа в этом протоколе написаны в виде сценариев оболочки, чтобы новички в биоинформатике могли изучить основы анализа CUT&RUN путем просмотра сценариев. Мы ожидаем, что пользователи смогут практиковаться в биоинформатическом анализе шаг за шагом, последовательно запуская каждый сценарий оболочки в терминале. Кроме того, простота сценариев оболочки, предоставляемых в этом конвейере анализа CUT&RUN, позволяет пользователям пересматривать и настраивать эти сценарии для применения этого конвейера анализа к своим собственным данным CUT&RUN. В конечном счете, мы ожидаем, что этот конвейер анализа CUT&RUN может уменьшить распространенные узкие места в процессе анализа данных CUT&RUN, чтобы позволить исследователям в лабораториях и новичкам в области биоинформатики делать биологические выводы на основе собственных данных секвенирования CUT&RUN.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют о неразглашении информации.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Все иллюстрированные рисунки были созданы с использованием BioRender.com. CAI выражает признательность за поддержку, предоставленную в виде премии Альянса по исследованию рака яичников для исследователей в начале карьеры, гранта Фонда Форбека и Национальной премии за исследования в области раннего выявления рака яичников Миннесотского альянса по раку яичников.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
bedGraphToBigWigENCODEhttps://hgdownload.soe.ucsc.edu/admin/exe/Программное обеспечение для сжатия и преобразования подсчетов чтения bedGraph в bigWig
bedtools-2.31.1The Quinlan Lab @ the U. of Utahhttps://bedtools.readthedocs.io/en/latest/index.htmlПрограммное обеспечение для обработки файлов bam/bed/bedGraph
bowtie2 2.5.4УниверситетДжонса Хопкинсаhttps://bowtie-bio.sourceforge.net/bowtie2/index.shtmlПрограммное обеспечение для построения индекса галстука-бабочки и выполнения выравнивания
CollectInsertSizeMetrics (Picard)Broad Institutehttps://github.com/broadinstitute/picardПрограммное обеспечение для анализа распределения размеров вставок
CutadaptNBIShttps://cutadapt.readthedocs.io/en/stable/index.htmlПрограммное обеспечение для выполнения обрезки
адаптеровDeeptoolsv3.5.1Институт Макса Планкаhttps://deeptools.readthedocs.io/en/develop/index.htmlПрограммное обеспечение для выполнения корреляционного анализа коэффициента Пирсона, анализа главных компонент и анализа тепловой карты/среднего графика
FastQC Версия 0.12.0Babraham Bioinformaticshttps://github.com/s-andrews/FastQCПрограммное обеспечение для проверки качества файла fastq
Interventionv0.6.1Вычислительная биология и Регуляция генов - Mathelier grouphttps://intervene.readthedocs.io/en/latest/index.htmlПрограммное обеспечение для выполнения анализа диаграмм Венна с использованием файлов пиков
MACSv2.2.9.1Инициатива Чана Цукербергаhttps://github.com/macs3-project/MACS/tree/macs_v2Программное обеспечение для вызова пиков
MACSv3.0.2Инициатива Чана Цукербергаhttps://github.com/macs3-project/MACS/tree/masterПрограммное обеспечение для вызова пиков
Samtools-1.21Wellcome Sanger Institutehttps://github.com/samtools/samtoolsПрограммное обеспечение для обработки файлов sam/bam
SEACRv1.3Howard Hughes Medial Institutehttps://github.com/FredHutch/SEACRПрограммное обеспечение для вызова пиков
SRA Toolkit Release 3.1.1NCBIhttps://github.com/ncbi/sra-toolsПрограммное обеспечение для загрузки SRR из GEO
Trim_Galore v0.6.10Babraham Bioinformaticshttps://github.com/FelixKrueger/TrimGaloreпрограммное обеспечение для выполнения качественной и атаптерной обрезки

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Hainer, S. J., Fazzio, T. G. High-resolution chromatin profiling using CUT&RUN. Curr Protoc Mol Biol. 126 (1), e85(2019).
  2. Zhang, Y., et al. Model-based analysis of ChiP-Seq (MACS). Genome Biology. 9 (9), R137(2008).
  3. Xu, S., Grullon, S., Ge, K., Peng, W. Stem cell transcriptional networks: Methods and Protocols. , Springer. New York, NY. (2014).
  4. Meers, M. P., Tenenbaum, D., Henikoff, S. Peak calling by sparse enrichment analysis for cut&run chromatin profiling. Epigenetics Chromatin. 12 (1), 42(2019).
  5. Ashburner, M., et al. Gene ontology: Tool for the unification of biology. The gene ontology consortium. Nat Genet. 25 (1), 25-29 (2000).
  6. Harris, M. A., et al. The gene ontology (GO) database and informatics resource. Nucleic Acids Res. 32 (Database issue), D258-D261 (2004).
  7. The Gene Ontology Consortium. The gene ontology resource: 20 years and still going strong. Nucleic Acids Res. 47 (D1), D330-D338 (2019).
  8. Conesa, A., et al. Blast2go: A universal tool for annotation, visualization and analysis in functional genomics research. Bioinformatics. 21 (18), 3674-3676 (2005).
  9. Carbon, S., et al. AmiGO: Online access to ontology and annotation data. Bioinformatics. 25 (2), 288-289 (2009).
  10. Eden, E., Navon, R., Steinfeld, I., Lipson, D., Yakhini, Z. Gorilla: A tool for discovery and visualization of enriched go terms in ranked gene lists. BMC Bioinformatics. 10, 48(2009).
  11. Huang Da, W., Sherman, B. T., Lempicki, R. A. Bioinformatics enrichment tools: Paths toward the comprehensive functional analysis of large gene lists. Nucleic Acids Res. 37 (1), 1-13 (2009).
  12. Huang Da, W., Sherman, B. T., Lempicki, R. A. Systematic and integrative analysis of large gene lists using david bioinformatics resources. Nat Protoc. 4 (1), 44-57 (2009).
  13. Ge, S. X., Jung, D., Yao, R. ShinyGO: A graphical gene-set enrichment tool for animals and plants. Bioinformatics. 36 (8), 2628-2629 (2020).
  14. Tang, D., et al. SRplot: A free online platform for data visualization and graphing. PLoS One. 18 (11), e0294236(2023).
  15. Ramírez, F., et al. Deeptools2: A next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44 (W1), W160-W165 (2016).
  16. Robinson, J. T., et al. Integrative genomics viewer. Nat Biotechnol. 29 (1), 24-26 (2011).
  17. Kent, W. J., et al. The human genome browser at ucsc. Genome Res. 12 (6), 996-1006 (2002).
  18. Yu, F., Sankaran, V. G., Yuan, G. -C. CUT&RUNTools 2.0: A pipeline for single-cell and bulk-level CUT&RUN and CUT&Tag data analysis. Bioinformatics. 38 (1), 252-254 (2021).
  19. Zhu, Q., Liu, N., Orkin, S. H., Yuan, G. -C. CUT&RUNTools: A flexible pipeline for CUT&RUN processing and footprint analysis. Genome Biol. 20 (1), 192(2019).
  20. Chris Cheshire, C. -W., et al. Nf-core/cutandrun: Nf-core/cutandrun v3.2.2 iridium ibis. , At https://github.com/nf-core/cutandrun/tree/3.2.2 (2024).
  21. Kong, N. R., Chai, L., Tenen, D. G., Bassal, M. A. A modified CUT&RUN protocol and analysis pipeline to identify transcription factor binding sites in human cell lines. STAR Protoc. 2 (3), 100750(2021).
  22. Meers, M. P., Bryson, T. D., Henikoff, J. G., Henikoff, S. Improved CUT&RUN chromatin profiling tools. eLife. 8, e46314(2019).
  23. Amemiya, H. M., Kundaje, A., Boyle, A. P. The encode blacklist: Identification of problematic regions of the genome. Sci Rep. 9 (1), 9354(2019).
  24. Deberardine, M. BRgenomics for analyzing high-resolution genomics data in R. Bioinformatics. 39 (6), btad331(2023).
  25. Deberardine, M., Booth, G. T., Versluis, P. P., Lis, J. T. The nelf pausing checkpoint mediates the functional divergence of cdk9. Nat Commun. 14 (1), 2762(2023).
  26. Andrews, S. Fastqc: A quality control tool for high throughput sequence data. , At http://www.bioinformatics.babraham.ac.uk/projects/fastqc/ (2010).
  27. Krueger, F., James, F. O., Ewels, P. A., Afyounian, E., Schuster-Boeckler, B. FelixKrueger/TrimGalore: v0.6.7 - DOI via Zenodo. , (2021).
  28. Mcgaughey, D. Easy bam downsampling. , Available from: https://davemcg.github.io/post/easy-bam-downsampling/ (2018).
  29. Positionbaseddownsamplesam (picard). , GATK Team. At https://gatk.broadinstitute.org/hc/en-us/articles/360041850311-PositionBasedDownsampleSam-Picard (2020).

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

CUT RUNBowtie

Похожие статьи