$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Качество и обрезка адаптера сохраняют прочтения с высоким качеством секвенирования
Методы секвенирования с высокой пропускной способностью склонны к возникновению ошибок секвенирования, таких как «мутации» последовательностей при чтении. Кроме того, димеры адаптера секвенирования могут быть обогащены в наборах данных секвенирования из-за плохого удаления адаптера во время подготовки библиотеки. Чрезмерные ошибки секвенирования, такие как мутации чтения, генерация прочтений короче, чем требуется для правильного картирования, и обогащение димерами адаптера, могут увеличить время картирования чтения и привести к ложноположительным картированным чтениям, которые искажают результаты последующего биоинформатического анализа. Таким образом, требуется качественная фильтрация и подстройка адаптера для сохранения высокого качества чтения для последующего анализа и интерпретации.
Чтобы сохранить высокое качество чтения для анализа, в этом конвейере анализа CUT&RUN (рис. 2) используются FastQC26 и Trim Galore27. Скрипт оболочки "Script_03_fastQC.sh" запускает FastQC для всех файлов fastq в рабочем каталоге. Результаты (Рисунок 3) этого шага с использованием общедоступного набора данных CTCF CUT&RUN из GSE126612 (SRR8581589) выявляют некоторые чтения с низким качеством баз оценки (Рисунок 3A, C) и некоторую степень несоответствия содержимого GC для каждой последовательности между теоретической оценкой и фактическими чтениями (Рисунок 3E).
Выполнение сценария "Script_04_trimming.sh" для запуска Trim Galore успешно удаляет чтения с низким качеством оценки (ниже 20 на рисунке 3A) и низким средним качеством последовательности, очевидными перед обрезкой (рисунок 3B-D). Кроме того, "Script_04_trimming.sh" также успешно удаляет 55~60% среднего обогащения GC, отображаемого на графике GC "pre-trimming" по графику последовательности (Рисунок 3E, F). Эти результаты демонстрируют, что этот конвейер анализа CUT&RUN фильтрует высококачественные чтения, чтобы обеспечить быстрое и точное сопоставление прочтений с референсным геномом.
Распределение размеров вставки может дать оценку пиковых результатов вызова
Из-за использования MNазы в CUT&RUN (Рисунок 1), ожидается, что картированные чтения CUT&RUN будут демонстрировать пики моно- (~200.н.) и динуклеосомных (~350.н.) размеров фрагментов ДНК в пределах графиков распределения размеров вставок (Рисунок 4). Проблемы с обнаружением некоторых целей могут привести к коротким вставкам (< 100.о.) (Рисунок 4C). Высокий уровень коротких прочтений сокращает количество прочтений, которые могут быть использованы для пиковых вызовов с высокой степенью достоверности, тем самым уменьшая пиковые числа и влияя на последующий анализ. В этом конвейере анализа CUT&RUN "Script_10_insert-size-analysis.sh" использует функцию "picard.jar CollectInsertSizeMetrics" для выполнения анализа распределения размеров вставки и экспорта гистограмм в качестве выходных данных визуализации (рис. 2). На выходных графиках (рис. 4A-C) ось x показывает диапазон размеров вставок, левая сторона оси y и заполненная гистограмма представляют количество вставок со значением по оси x, а правая сторона оси y показывает и пунктирная линия кумулятивную долю вставок с размером вставки, равным или превышающим значение по оси x. Таким образом, как расположение на оси X с наиболее резким изменением наклона пунктирной линии, которая пересекается с уровнем максимумов на гистограмме, определяет основной размер вставки в выборке. Среди прочтений, картированных на представляющем интерес референсном геноме (человек, hg19), фрагменты образца H3K27Ac (активная метка гистонов) демонстрируют ожидаемое распределение размеров вставки CUT&RUN с наибольшим однонуклеосомным размером и обнаруживаемыми пиками динуклеосомных размеров (рис. 4B). Фрагменты образца CTCF показали дополнительные группы в областях длины фрагмента 100~200.о. (Рисунок 4A). В целом, конвейер анализа CUT&RUN предоставляет простые в использовании сценарии оболочки для выполнения анализа распределения размеров вставок после картирования прочтений на референсных геномах. Эти анализы становятся важными при оценке эффективности пиковых вызовов перед последующим анализом.
Конвейер анализа Easy Shells CUTnRUN предоставляет фильтрацию и параметры нормализации для создания достоверных счетчиков чтения
Одним из критических моментов анализа CUT&RUN является получение правильных отображенных пар чтения путем фильтрации проблемных пар чтения из исходных выходов отображения и нормализации отфильтрованных отображенных счетчиков прочтений с помощью специального метода расчета нормализации, который может удовлетворить цели/потребности пользовательского анализа. Конвейер анализа CUT&RUN, обсуждаемый в данном исследовании, включает в себя сценарий «Script_07_filter-sort-bam.sh» для удаления прочитанных пар, которые отображены либо на неканонических хромосомах, либо на публично аннотированных областяхчерного списка 23, и TA повторяет области18,22 из прочитанных пар, которые были картированы с помощью bowtie2 с использованием «Script_06_bowtie2-mapping.sh». Эти фильтрации необходимы для удаления пар чтения, которые могут давать ложноположительные, отклоняющиеся сигналы всплесков и называемые пиками в нисходящем анализе (рис. 5; области желтого прямоугольника).
В дополнение к фильтрации, применение правильного метода нормализации является важным фактором для точной визуализации разницы сигналов между образцами. Таким образом, конвейер анализа CUT&RUN включает в себя сценарии «Script_09_normalization_SFRC.sh» и «Script_09_normalization_SRPMC.sh» для предоставления двух общедоступных методов нормализации - масштабируемого дробного чтения (SFRC)22 и нормализованных чтений на миллион сопоставленных прочтений в отрицательном контроле (SRPMC)24,25 (рисунок 5A-D). Поскольку SFRC не включает в формулу контрольный образец (например, IgG) или образец с шиповым входом, нормализация SFRC может быть использована для образцов, которые не включают контрольный образец или ожидается, что они продемонстрируют различия сигналов только в локальных областях без различий в масштабе всего генома. Нормализованные выборки SFRC, обработанные конвейером анализа CUT&RUN (рисунок 5A-D; красные дорожки), создают те же шаблоны распределения сигнала, что и общедоступные картографированные чтения из GEO (рисунок 5A-D; черные дорожки), что позволяет предположить, что этот конвейер может воспроизводить результаты публикации.
Метод SRPMC полезен для нормализации выборок, которые включают как контрольные, так и спайковые выборки и должны показывать глобальную разницу сигналов между выборками (рисунок 5A-D; зеленые дорожки). Поскольку одна выборка H3K27Ac (SRR8581599) демонстрирует гораздо более высокое соотношение «(фактические чтения CUT&RUN)/(пиковые чтения)» (RPS выборки; 997), чем другие реплики (237, 175 и 161), относительные сигналы H3K27Ac различаются между репликациями в нормализованных выборках SFRC и SRPMC (рисунок 5A-D; H3K27Ac сравнивается по всем трекам). Образцы RNAPII-S5P демонстрируют относительно более низкие RPS образца (1,7, 0,8, 2,1), чем контрольный IgG (259), таким образом, образцы RNAPII-S5P демонстрируют более низкий сигнал, чем контрольный IgG после нормализации SRPMC (рис. 5A-D; Сравнение RNAPII-S5P по всем трекам). Таким образом, рассматриваемый здесь конвейер анализа CUT&RUN рекомендует использовать метод SRPMC только для образцов, которые имеют достаточное количество прочтений в экспериментальных образцах относительно как контрольных считываний IgG, так и контрольных чтений с пиковым входом.
Сравнение диаграммы Венна может дать идеи по выбору лучшего метода и опций вызова пика
Программы множественных пиковых вызовов позволяют идентифицировать значительно обогащенную занятость белка по всему геному. К таким программам, используемым для анализа CUT&RUN, относятся программы семейства MACS2 и SEACR4 в качестве основных методов на сегодняшний день. Тем не менее, может быть непросто, особенно для новичков в биоинформатике, определить наиболее подходящий метод вызова пика и варианты для конкретного проекта CUT&RUN. Таким образом, конвейер анализа CUT&RUN включает в себя шаги анализа диаграммы Венна, чтобы дать пользователям возможность сравнить сходство и различие результатов пиковых вызовов между различными вариантами пиковых вызовов (Script_17_intervene-вариантами) и программами пиковых вызовов (Script_19_intervene_methods.sh) (рис. 6A-H).
В соответствии с сравнением объединенных пиков CTCF, H3K27ac и RNAPII-S5P, которые вызываются с опцией контроля IgG и без нее во время шага вызова пика, MACS2 и MACS3 вызывали больше пиков с опцией управления IgG (Рисунок 6A), но SEACR вызывал больше пиков без опции контроля IgG как в строгом, так и в ослабленном вариантах (Рисунок 6B-D). Таким образом, конвейер анализа CUT&RUN предлагает (1) применить опцию контроля IgG для MACS2 и MACS3, (2) вызывать пики для экспериментальных образцов CUT&RUN и контрольных образцов IgG отдельно, а затем отфильтровывать пики IgG позже для вызывающего пик SECR. Между MACS2 и MACS3 MACS3 вызывал немного больше пиков (рис. 6A).
Кроме того, сравнение пиков, вызываемых MACS2 и MACS3 с опцией управления IgG и SEACR без опции управления IgG, показывает, что пики SEACR, вызванные с помощью строгой опции, перекрываются с пиками MACS 2 и MACS3 в большей степени, чем пики SECR, вызываемые с ослабленной опцией (рис. 6E, F). Таким образом, выходные данные конвейера анализа CUT&RUN позволяют предположить, что строгий вариант максимизирует согласованность SEACR с пиковым вызовом MACS. Наконец, диаграмма Венна для сравнения перекрытия пиков, вызванных SEACR, с нормализацией для файлов CUT&RUN bedGraph и без нормализации для нормализованных чисел чтения файлов CUT&RUN bedGraph не показывает разницы между методами SFRC и SRPMC для SEACR со строгим параметром. Пики SFRC демонстрируют гораздо более высокие пиковые значения и лучшее перекрытие с пиками нормализованных вариантов («норма» на рисунке 6), чем пики SRPMC для SEACR с ослабленными вариантами (рисунок 6G, H).
Статистические сравнения между репликациями и выборками
Чтобы сделать точные выводы по нескольким репликациям, необходимо оценить сходство реплик. Используемый здесь конвейер анализа CUT&RUN использует расчет статистического коэффициента корреляции на основе15 Deeptools2, кластеризацию тепловых карт и анализ главных компонент (PCA) для облегчения идентификации образцов и реплик, подходящих для достоверного последующего анализа. Кластеризация тепловых карт на основе коэффициента корреляции Пирсона показала статистически значимую корреляцию между репликациями для CTCF, H3K27Ac и RNAPII-S5P в их называемых пиковых областях (рис. 7A-C). Тем не менее, PCA показал, что один образец CTCF (SRR8581590) и H3K27Ac (SRR8581608) расположен относительно далеко от других реплик (рисунок 7D) во всех CTCF, H3K27Ac и RNAPII-S5P, называемых пиковыми областями.
Согласно диаграмме Венна для сравнения пиков между репликами, пики CTCF (SRR8581590) показали наименьшее перекрытие с другими репликациями во всех трех результатах пиковых вызовов (рисунок 7E-G), а пики H3K27Ac (SRR8581608) показали наименьшее перекрытие с другими репликами в результатах пиковых вызовов SEACR (рисунок 7F). пики H3K27Ac (SRR8581608) не показали минимального перекрытия с другими репликациями в результатах вызовов пиков MACS2 и MACS3 (рисунок 7F), что может свидетельствовать о том, что расстояние между репликациями в PCA недостаточно для определения выборки выбросов. Таким образом, конвейер анализа CUT&RUN предлагает определять репликацию выброса как «выборку, которая показывает низкий коэффициент корреляции Пирсона в группе кластеризации тепловой карты, большое расстояние на графике PCA с другими репликациями и наименьшее перекрытие пиков среди репликатов».
Пиковые вызовы облегчают визуализацию и интерпретацию данных CUT&RUN
В конвейере анализа CUT&RUN, подробно описанном в этом исследовании, используются два типа общедоступных пиковых вызовов: семейство MACS и SEACR. Чтобы оптимизировать визуализацию называемых пиков, этот конвейер выбирает самый высокий сигнальный бин в качестве центра пиков для анализа тепловой карты и метаграфиков. Все пики CTCF, H3K27Ac и RNAPII-S5P, вызванные MACS3 и SEACR пиковыми вызовами, показали более резкое распределение пиков в центре самых высоких сигнальных бинов (рис. 8A-F, «сфокусированные» графики), чем в центре целых пиковых областей (рис. 8A-F, «целые» графики). Образцы CUTnRUN CUTnRUN, обработанные Easy Shells Конвейер анализа CUTnRUN с нормализацией SFRC (рис. 8 A-F, графики SFRC), демонстрируют схожие с паттернами распределения сигналов нормализованных сэмплов SFRC, необработанные сопоставленные пары чтения которых общедоступны в GEO (рис. 8A-F, «общедоступные» графики) на пиках, вызываемых конвейером анализа. Таким образом, конвейер анализа CUT&RUN может успешно воспроизводить результаты публикации.

Рисунок 1: Схема экспериментальной процедуры CUT&RUN. CUT&RUN — это ферментативный подход к обнаружению белок-ДНК-взаимодействий по всему геному. Процедура CUT&RUN начинается со связывания клеток (или изолированных ядер) с конканавалином А, конъюгированным с магнитными шариками, чтобы обеспечить выделение и манипуляции с низким количеством клеток на протяжении всей процедуры. Изолированные клетки проникают с помощью мягкого детергента, чтобы облегчить введение антитела, нацеленного на интересующий белок. Микрококковая нуклеаза (МНКаза), привязанная к белку А или белку A/G, затем вводится в проникнутую клетку. pA-MNase (или pAG-MNase) рекрутируется в связанное антитело с помощью метки Protein A или Protein A/G. После того, как МНаза локализована в целевых участках, нуклеаза на короткое время активируется путем введения кальция для переваривания ДНК вокруг целевого белка. В результате расщепления МНазы образуются мононуклеосомные ДНК-белковые комплексы. Кальций впоследствии хелатируют, чтобы завершить реакцию пищеварения, и короткие фрагменты ДНК в результате расщепления MNазы высвобождают из ядер путем короткой инкубации при 37°C, а затем подвергают очистке ДНК, подготовке библиотеки и высокопроизводительному секвенированию. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 2: Схематическое резюме конвейера анализа Easy-Shell CUT&RUN. Конвейер анализа Easy-Shell CUT&RUN состоит из трех основных разделов: (1) контроль качества и сопоставление необработанных прочитанных файлов (слева; фиолетовый), (2) нормализация сопоставленных операций чтения и чтения и вызовов пиков (в центре; зеленый) и (3) проверка сопоставленных прочтений и вызываемых пиков (справа; розовый). На каждом шаге указывается соответствующий номер сценария оболочки, краткое описание и программное средство, используемое на этом этапе (в скобках). Простые стрелки показывают прямые потоки между шагами. Этот конвейер анализа CUT&RUN предоставляет два метода нормализации чтения, которые могут удовлетворить потребности пользователей с контрольным чтением и без него, многоуровневые процессы валидации для определения правильных репликатов для последующего анализа и целенаправленную идентификацию пиков для создания четко сфокусированной тепловой карты и метаграфика. Этот конвейер анализа написан в виде простых в использовании сценариев оболочки шаг за шагом, чтобы предоставить новичкам в биоинформатике возможность изучить и попрактиковаться в базовом анализе данных CUT&RUN, читая и редактируя сами скрипты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 3: Сравнение результатов проверки качества до и после обрезки качества. Выберите выходные данные отчета о проверке качества из FastQC, чтобы отобразить эффект обрезки качества с использованием операций чтения из SRR8581589 (GSM3609748, CTCF). Показанные результаты включают: (A) Оценка качества по базам предварительной обрезки. (B) Те же показания, что и A) после обрезки. (C) Распределение показателей качества по всем последовательностям предварительной обрезки. (D) Те же показания, что и C) после обрезки. (E) Распределение GC по всем последовательностям предварительной обрезки. (F) Та же индикация, что и E) после обрезки. Минимальная оценка качества в каждой позиции в течение прочтений секвенирования (A, B) и минимальное среднее качество последовательности (C, D) увеличиваются после качественной обрезки. Кроме того, этот шаг может уменьшить разницу между теоретическим распределением количества GC и фактическим числом GC на основание в чтениях (E, F) за счет удаления пар прочтений, которые имеют высокий коэффициент несовпадения оснований. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 4: Анализ распределения размеров вставки. Вставьте гистограмму размера для (A) CTCF, (B) H3K27Ac и (C) серин-5 фосфорилированной РНК-полимеразы II (RNAPII-S5P). Гистограммы отображают относительные различия в распределении размеров вставки между образцами. Пунктирная линия на гистограмме представляет собой совокупную долю операций чтения с размером вставки, большим или равным значению на оси X. n: количество согласованно отображенных уникальных прочтений на образец после фильтрации. FR: фрагменты. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 5: Ландшафтный обзор образцов CUT&RUN. Общедоступные картированные чтения CUT&RUN, нормализованные по масштабированному дробному подсчету (SFRC) без дополнительной фильтрации (черные дорожки), образцы CUT&RUN, обработанные конвейером анализа Easy Shells CUTnRUN с нормализацией SFRC (красные дорожки) и «Всплеск нормализованных прочтений на миллион картированных прочтений в отрицательном контроле (SRPMC; зеленые дорожки)» показаны в (A) области кластера генов гистонов, и (B-D) другие три области с пиками CTCF, H3K27Ac и RNAPII-S5P, вызываемыми всеми пиковыми вызовами MACS2, MACS3 и SEACR. Желтыми прямоугольниками выделено расположение сигналов спайков, отфильтрованных на этапе фильтрации в конвейере анализа Easy Shells CUTnRUN. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 6: Диаграмма Венна для сравнения пиковых вызовов, вызванных разными пиковыми вызовами, и вариантов пиковых вызовов. (A) Сравнение пиковых вызовов, вызванных MACS2 и MACS3, с опцией ввода IgG и без нее во время пикового вызова. (Б-Г) Сравнение пиков, вызванных SEACR, с опцией ввода IgG и без нее, опциями «строгого» и «ослабленного», а также с опцией нормализации с использованием файлов необработанных пар чтения (B), без опции нормализации с использованием нормализованных файлов счетчиков прочтений SFRC (C) или нормализованных файлов счетчиков прочтений SRPMC (D). (Э,Ж) Сравнение пиков, вызываемых MACS2, MACS3 с опцией ввода IgG и SEACR с опцией строгого (E) или ослабленного (F) опции. (Г,Н) Сравнение пиков, вызываемых SEACR без опции ввода IgG и с жесткими (G) или ослабленными (H) опциями. w/ IgG: пики, вызываемые с опцией ввода IgG. без IgG: пики вызываются без опции ввода IgG. Норма: пики вызываются с опцией нормализации. non: пики, вызванные без опции нормализации. SFRC: пиковые значения, вызванные числом чтения, файлы, нормализованные методом «масштабируемого дробного подсчета (SFRC)». SRPMC: пиковые значения, вызванные числом прочтений, файлы, нормализованные с помощью метода "Spike-in normalized Reads Per Million mapped reads in the negative Control (SRPMC)". Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 7: Корреляция Пирсона, анализ главных компонент и диаграмма Венна для подтверждения сходства между репликациями. (A-C) Кластеризация тепловой карты со значениями коэффициента корреляции Пирсона отображает степень сходства между репликами на пиках, называемых MACS2 (A), MACS3 (B) и SEACR (C). Коэффициент корреляции Пирсона находится в диапазоне от -1 до 1. Большее абсолютное значение коэффициента корреляции Пирсона указывает на более сильную корреляцию между двумя переменными, а положительное значение коэффициента корреляции Пирсона указывает на положительную корреляцию, при которой две переменные движутся в одном направлении. Таким образом, образцы с более высоким сходством демонстрируют более близкую родословную в кластеризации тепловых карт и более высокое значение коэффициента Пирсона. (D) Анализ главных компонент (PCA) показывает степень сходства между репликами и образцами во всех пиковых областях CTCF, H3K27Ac и RNAPII-S5P, которые называются MACS2 (слева), MACS3 (в центре) и SEACR (справа). Образцы с более высоким сходством располагаются ближе друг к другу на графике PCA. (Э-Г) Анализ диаграммы Венна для сравнения пиков, обнаруженных в каждой реплике с помощью MACS2 (E), MACS3 (F) и SEACR (G). В конвейере анализа Easy-Shell CUT&RUN предлагается применять все три метода для выявления реплик с высокой степенью сходства, которые могут быть пригодны для объединения вызываемых пиков для последующего анализа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Рисунок 8: Тепловая карта и метаграфик визуализации распределения сигнала на пиках. Тепловая карта и метаграфики отображают распределение обогащения вокруг пиковых центров, вызываемых с использованием различных пиковых вызовов. (А,Б) Пики CTCF CUT&RUN вызываются из одной репликации (SRR8581589) с помощью MACS3 (A) и SEACR (B). (К,Г) Пики H3K27Ac CUT&RUN вызываются из одной реплики (SRR8581607) с использованием MACS3 (C) и SEACR (D). (Э,Ж) Пики RNAPII CUT&RUN вызываются из одной репликации (SRR8581589) с помощью MACS3 (E) и SEACR (F). Общедоступные сопоставленные пары чтения («Public» на рисунке 8) и фрагменты, сопоставленные конвейером анализа CUTnRUN от Easy Shells («SFRC» на рисунке 8), сравниваются после нормализации «масштабируемого дробного числа (SFRC)». Пики вызываются MACS3 с опцией ввода IgG («MACS3 с IgG» на рисунке 8) и SEACR без ввода IgG и без опции нормализации с использованием нормализованных файлов подсчета прочтений SFRC в строгом режиме («SEACR w/o IgG non SFRC strictent» на рисунке 8). Подготавливаются два варианта файлов координат вызываемых вершин: от начала до конца вызываемых вершин («целый» на рисунке 8) и местоположение бина с наибольшим сигналом в пределах вызываемых вершин (вершины в MACS3 называются пиками; «сфокусированный» на рисунке 8). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.
Таблица 1: Информация для файлов CUT&RUN fastq в GSE126612. Все необработанные прочитанные файлы CUT&RUN fastq, которые включены в GSE126612 и выбраны в качестве примера набора данных для конвейера анализа Easy Shells CUTnRUN, перечислены в виде таблицы. В столбце "Имя файла" отображаются имена необработанных файлов fastq, которые будут показаны в '~/Desktop/GSE126612/fastq' после запуска 'Script_02_download-fastq.sh'. 'md5sum' использует MD5 (Message-Digest Algorithm 5) для примера набора данных, который можно использовать для проверки целостности файлов после загрузки набора данных с помощью 'Script_02_download-fastq.sh'. В последнем столбце описывается цель CUT&RUN для каждого образца. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.