December 10th, 2012
Наши байесовского Точка изменения (BCP) алгоритм основывается на состоянии самой современной прогресс в области моделирования изменения точки через скрытых Марковских моделей и применяет их к иммунопреципитации хроматина секвенирования (ChIPseq) анализ данных. BCP хорошо работает как в широком и точечные типов данных, но превосходит точно идентифицировать надежные, воспроизводимые острова диффузного гистонов обогащения.
Общая цель следующего эксперимента состоит в том, чтобы использовать плотность картированных позиций считывания из данных иммунопреципитации хроматина для оценки апостериорной средней плотности считывания по всему геному. Это достигается за счет предварительной обработки. Сопоставленный ChIP-seq считывается в профили блокированной плотности с тем же количеством прочтений, попадающих в пределах 200 неперекрывающихся ячеек пар оснований.
Любые соседние ячейки с одинаковой плотностью объединяются в более крупный блок в качестве второго шага: апостериальные средние плотности каждого блока вычисляются рекурсивно в контексте всех окружающих блоков с использованием байесовской модели с прямым и обратным фильтрами. Где счетчик прочтений для блока моделируется с помощью распределения Пуассона с параметром тета, который принимает априорное распределение гамма с альфа- и бета-параметрами. Следующие оценки апостериальной средней плотности каждого блока оцениваются на предмет значимости на основе того, превышает ли он 90-й квантиль по отношению к входной контрольной фоновой плотности, чтобы получить окончательные обогащенные сегменты генома. и, наконец, обогащенные островки на данных ChIP-seq во время анализа BCP.
Кроме того, результаты показывают, что BCP превосходит конкурирующий инструмент cer. Основное преимущество этого метода перед существующими методами, такими как CER, заключается в том, что BCP использовала самые последние достижения А в моделях скрытых маркеров, поэтому он лучше характеризует нюансы анализа данных чипса, чем предыдущие эвристические методы. Этот метод может помочь в решении ключевых вопросов в области эпигеномики, таких как роль гисто-модификаций путем характеристики их полногеномных паттернов обогащения.
Несмотря на то, что этот пациентский метод может дать представление об анализе данных ChIP-seq, базовая структура также может быть применена к анализу данных секвенирования следующего поколения, таким как идентификация дифференциально метилированных областей в данных суфийского секвенирования bis, новых локусов транскрипции в RNA-Seq, вариации числа копий или любого количества данных микрочипирования. Визуальная демонстрация этого метода имеет решающее значение для четкого понимания методологии и имеет свои преимущества. Теоретические преимущества скрыты в программном обеспечении.
Все показанные здесь процедурные шаги были упакованы в один исполняемый файл в программном пакете BCP, который доступен для загрузки в этом видео. Описываются шаги, выполняемые программой для запуска программного обеспечения. Три параметра обязательны для выполнения.
Файл, содержащий уникально сопоставленные чтения из образца микросхемы и аналогичный файл для входных контрольных считываний, а также имя выходного файла для подготовки входных файлов для анализа BCP. Во-первых, выровняйте короткие прочтения, полученные в результате секвенирования, с соответствующим референсным геномом с помощью предпочитаемого программного обеспечения для выравнивания коротких считываний. Сопоставленные местоположения должны быть преобразованы в расширяемые данные браузера с шестью столбцами или формат BED, разделенный табуляцией для каждого сопоставленного чтения, указывающий начальную позицию сопоставленной хромосомы, конечную позицию, имя чтения, оценку и цепь.
Расширьте местоположения микросхемы и карты ввода до заданной длины фрагмента. Например, размер фрагмента, на который нацелены во время ферментативного расщепления или ультразвуковой обработки ДНК, обычно около 200 пар оснований. Затем подсчет фрагментов агрегируется в соседних ячейках.
По умолчанию размер бина равен предполагаемой длине фрагмента в 200 пар оснований. Любые возможные точки изменения в наборе ячеек с идентичным пересчетом, скорее всего, попадут на крайние границы. Соответственно, маловероятно, что точка изменения произойдет на внутренней границе между двумя ячейками с одинаковым количеством прочтений.
Таким образом, сгруппируйте соседние ячейки с идентичными показаниями на ячейку в один блок. После подготовки входных файлов вызовите оценку BCP, просто введя команду, показанную в нижней части экрана. Плотность чтения каждого блока моделируется в виде распределения Пуассона со средним параметром theta, следующего за смесью гамма-распределений с альфа- и бета-параметрами и априорной вероятностью возникновения точки изменения в любом блоке.
Граница P, обуславливая таким образом каждый блок, эффективно визуализирует бесконечное состояние, скрытую марковскую модель или HMM. Гиперпараметры альфа, бета и P оцениваются с использованием максимального апостериорного правдоподобия. Оценки отсеков явно рассчитываются для каждого блока тета-под-Т в качестве математического ожидания тета-под-Т, при этом под-Т, более традиционные, но трудоемкие прямые и обратные фильтры, часто используемые в HMS, заменяются более эффективным с вычислительной точки зрения приближением смеси ограниченной сложности для оценки апостериорных средних тета-хаб под-Т. Полученные апостериорные средние будут сглажены в приближенный кусочно-постоянный профиль, поэтому блоки с идентичными тета хат sub T должны быть дополнительно заблокированы вместе с обновленными граничными координатами.
BCP использует количество входных операций чтения на блок в качестве фоновой скорости и определяет обогащение. Использование простой проверки гипотезы, основанной на том, превышает ли средняя плотность положения чипа для блока некоторый порог значимости. 90-й квантиль является пороговым значением по умолчанию и подходит в большинстве случаев.
Затем BCP объединяет смежные блоки апостериорной средней плотности, превышающие обогащение, в одну область и сообщает объединенные координаты в браузере. Расширяемый формат данных BCP превосходно подходит для идентификации областей широкого обогащения в данных модификации гистонов. Здесь. Результаты БКП сравниваются с результатами cser, существующего инструмента, который продемонстрировал высокую производительность, предшествующая работе в этой лаборатории, изучающей триметилирование H 3K 36, показала тенденцию к гораздо большему размеру островков в BCP, чем cer.
Более крупные островки в большей степени соответствуют традиционному ожиданию получения широких диффузных островов обогащения триметилированием H 3 K 36. Большие острова сами по себе указывают не на точность. Таким образом, известная ассоциация островов триметилирования H three K 36 с активно транскрибируемыми телами генов, а также их взаимно исключительная с островками триметилирования H three K 27 была использована для оценки эффективности BCP и CER по сравнению с BCP CER более крупными смежными островками, которые лучше захватывают тела генов без ущерба для повышенного перекрытия с H three K 27. Острова триметилирования.
BCP поддерживает высокое перекрытие активных генов островками триметилирования H three K 36 с границами, близко выровненными по телам генов, без увеличения степени ложноположительного перекрытия с генами межгенного пространства с подавленной транскрипцией или репрессивной меткой H three K 27 TRIMETHYLATION при оценке воспроизводимости вызовов острова BCP в двух реплицируемых наборах данных, Было замечено, что BCP не страдает от сильной зависимости от глубины покрытия тростника в конкурирующем алгоритме CER, дополнительные доказательства устойчивости и воспроизводимости BCPS получены путем изучения дополнительных отдельных областей, демонстрирующих согласованные границы островов, несмотря на меньшую глубину покрытия. Чтобы в полной мере продемонстрировать универсальность БКП, был получен широкий спектр данных о модификации гистонов, включая точечные метки H три K 27 ацетилирование, H три K девять ацетилирование и H три K четыре триметилирования, а также диффузную метку H три K девять триметилирования в дополнение к H три K 27 триметилирование и H три K 36 триметилирование. Эти наборы данных были проанализированы с использованием настроек параметров по умолчанию для BCP и cser.
В центре находится обогащение триметилированием H three K 36 в гене PX DN, маркирующем активную транскрипцию, ожидаемо падающую на место начала транскрипции, находятся дополнительные точечные активные метки H три K 27 ацетилирование, H три K девять ацетилирование и H три K четыре триметилирования. Чуть ниже по течению от PXDN находится подавленное межгенное пространство, отмеченное обогащением триметилированием H three K 27, на противоположном фланге находится ген H three K 27 TRIMETHYLATION подавленный. Делаем еще один шаг наружу.
Наш замалчиваемый хроматин, на что указывает присутствие обогащения триметилированием H 3 K nine, что, по-видимому, указывает на подавление триметилирования SN TG two и MYT 1 L, возможно, в менее переходном смысле, чем подавление триметилирования H three K 27. Эта область охватывает большинство явлений, встречающихся в ChIPseek модификаций гистонов. Это иллюстрирует, как динамическая природа BCP может идентифицировать как точечное ацетилирование, так и метки триметилирования H three K four, в то же время различая большие смежные островки триметилирования H three K 27 и H three K nine триметилирования, а также H three K 36 триметилирования активной транскрипции.
Этот алгоритм может быть выполнен примерно за 30 минут в зависимости от количества прочтений и результата признаков генома. Любая существенная оптимизация, как это часто требуется при других методах выполнения данной процедуры. Многие различные белки-мишени иммунопреципитации хроматина могут быть изучены с помощью BBCP, включая различные другие модификации гизона, а также факторы транскрипции, связывающие ДНК, чтобы ответить на дополнительные вопросы об эпигеномных механизмах и регуляции генов.
После просмотра этого видео у вас должно сложиться хорошее представление о том, как BCP используется для определения областей в зоне досягаемости диффузных отметок гизона при анализе данных чипса.
View the full transcript and gain access to thousands of scientific videos
В данном исследовании представлен алгоритм байесовской точки изменения (BCP), который улучшает анализ данных секвенирования иммунопреципитации хроматина (ChIP-seq). Используя скрытые модели Маркова, BCP эффективно идентифицирует области обогащения гистонов как в широких, так и в пунктирных типах данных.
The Bayesian Change Point (BCP) algorithm provides a unified, parameter-light approach to identifying enriched genomic regions across diverse ChIP-seq data types, from punctate transcription factor binding to diffuse histone modification islands. By reducing reliance on heuristic thresholds and model switching, BCP enhances reproducibility and cross-lab comparability in epigenomic target validation. This supports mechanistic de-risking in early discovery by delivering statistically grounded, quantitative read density profiles that inform target confidence and pathway analysis.
The BCP algorithm fits into the discovery continuum from raw sequencing data to biological insight, supporting hypothesis-driven target validation, reproducible epigenomic profiling, and data integration across early screening and preclinical validation stages.