Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Роман байесовского Изменение точки Алгоритм всему геному анализ различных типов данных ChIPseq

10.7K просмотров

DOI:

10.3791/4273

10 декабря 2012 г.

В этой статье

Краткое содержание

Наши байесовского Точка изменения (BCP) алгоритм основывается на состоянии самой современной прогресс в области моделирования изменения точки через скрытых Марковских моделей и применяет их к иммунопреципитации хроматина секвенирования (ChIPseq) анализ данных. BCP хорошо работает как в широком и точечные типов данных, но превосходит точно идентифицировать надежные, воспроизводимые острова диффузного гистонов обогащения.

Аннотация

ChIP-seq — это широко используемый метод исследования взаимодействий белок-ДНК. Профили плотности чтений создаются путем секвенирования следующего поколения ДНК, связанной с белком, и выравнивания коротких чтений по референсному геному. Обогащенные области проявляются в виде пиков, форма которых часто существенно различается в зависимости от целевого белка1. Например, транскрипционные факторы часто связываются с сайтами и последовательностями специфическим образом и имеют тенденцию к образованию точечных пиков, в то время как модификации гистонов более распространены и характеризуются широкими диффузными островами обогащения2. Надежная идентификация этих областей была основной целью нашей работы.

Алгоритмы анализа данных ChIP-seq основывались на различных методологиях: от эвристических подходов3-5 до более строгих статистических моделей, например, скрытых марковских моделей (СММ)6-8. Мы стремились найти решение, которое минимизировало бы необходимость в трудноопределяемых параметрах ad hoc, которые часто снижают разрешение и затрудняют интуитивное использование инструмента. В отношении методов на базе СММ нашей целью было сократить количество процедур оценки параметров и упростить часто используемые классификации с конечным числом состояний.

Кроме того, традиционный анализ данных ChIP-seq предполагает классификацию ожидаемых профилей плотности чтений как точечных или диффузных с последующим применением соответствующего инструмента. Мы стремились заменить необходимость использования этих двух различных моделей единой, более универсальной моделью, способной эффективно обрабатывать весь спектр типов данных.

Для достижения этих целей мы сначала разработали статистическую структуру, которая естественным образом моделирует структуры данных ChIPseq с использованием передового метода HMM9, основанного исключительно на явных формулах — инновации, имеющей решающее значение для повышения производительности. Наша HMM, являясь более сложной, чем эвристические модели, поддерживает бесконечное количество скрытых состояний благодаря байесовской модели. Мы применили её для идентификации обоснованных точек изменения плотности чтений, которые далее определяют сегменты обогащения. Наш анализ показал, что алгоритм байесовских точек изменения (BCP) обладает сниженной вычислительной сложностью, что подтверждается сокращенным временем выполнения и меньшим объемом занимаемой памяти. Алгоритм BCP был успешно применен как для идентификации точечных пиков, так и диффузных островов с высокой точностью и ограниченным количеством задаваемых пользователем параметров. Это продемонстрировало как универсальность, так и простоту использования данного метода. Следовательно, мы полагаем, что он может быть легко внедрен для широкого спектра типов данных и конечных пользователей таким образом, который позволяет легко проводить сравнение и сопоставление, что делает его отличным инструментом для анализа данных ChIPseq, способствующим сотрудничеству и подтверждению результатов между исследовательскими группами. Здесь мы демонстрируем применение BCP к существующим данным по транскрипционным факторам10,11 и эпигенетическим данным12, чтобы показать его полезность.

Протокол

1. Подготовка входных файлов для анализа BCP

  1. Совместите короткий читает производится из последовательности серий (чип и ввод библиотеки) к соответствующим геном ссылки с использованием предпочтительного короткие программного обеспечения выравнивания чтения. Отображаемых мест должны быть преобразованы в 6 колонке обозревателя расширяемых данных (BED) формата 13 (УСК геноме браузера, http://genome.ucsc.edu/ ), табуляции линии на отображенные читать с указанием отображенных хромосомы, исходное положение (0-основе), конечное положение (полуоткрытые), прочитать название, оценка (опционально), и пряди.

2а. Диффузный Читайте профили: Предварительная обработка ChIP Читать плотности для обнаружения Обогащенный островов в диффузных данных

  1. Расширение Чип и ввод отображаемых мест до заданной длины фрагмента, то есть. размер фрагмента мишенью в ферментативного расщепления или ультразвуком ДНК, как правило, около 200 пар. Фрагмент подсчеты, то агрегацииТед в соседних ячеек. По умолчанию бен установлен размер расчетная длина фрагмента 200 п.н..
  2. Любое возможное изменение точки в набор контейнеров с одинаковым читать рассчитывает, скорее всего, падение на внешнем самых границ. Таким образом, маловероятно, что изменение точки будет происходить на внутренней границе двух бункеров с тем же рассчитывает чтения. Таким образом, группа соседних бункерах, с одинаковыми говорится в мусорное ведро, в единый блок, то есть. bedGraph формате 13.

2b. Точечные Читайте профили: Chip предварительной обработки и входных файлов кровать для обнаружения пиков в мелкоточечный данных

  1. Совокупный перекрытия говорится в плюс и минус нити ChIP читает отдельно. Нить конкретные читать плотность должна стать бимодального профиля плюс и минус пиков. Выберите плюс / минус пар из наиболее обогащенных пики и использовать расстояние между их встречами на высшем уровне, как оценка длины фрагмента библиотеки.
  2. Сдвиг Чип и ввод читает половина фрагмент леngth к центру и пересчитать читать плотность смещается и объединены плюс и минус нить читает. Эта методология для оценки длины фрагмента была принята от Zhang, и др.. 3. Позиции с одинаковым счетом слияния должны быть сгруппированы в блоки, похожие на шаг 2а.2.

3. Оцените Задний средний Читать плотность каждого блока с помощью нашего приближения BCMIX

  1. Читать плотность каждого блока моделируется как распределение Пуассона, объекты POI т), со средним параметром следующие смеси гамма-распределений, Γ (α, β), и перед вероятность изменения, происходящие точки в любой границы блока р. принадлежности POI т) на G (α, β) эффективно делает модель бесконечной HMM государства. Оцените гипер-параметров, α, β, р, максимально используя задние правдоподобия.
  2. Явно вычислить байесовской оценкикаждого блока, θ т, а E (θ T | γ Z). Заменить более традиционный, но много времени вперед и назад, фильтры часто используются в ПММ, с более вычислительно эффективно Ограниченные приближении Смесь Сложность оценить задние средств, θ с. В результате задние средства будут "размазанной" в приближенных кусочно-постоянной профиль, чтобы блоки с одинаковыми, θ с, следует продолжить их вместе с обновленной границы координаты.

4а. Диффузный Читайте профили: Post-процессов Задний средств в сегменты Диффузный обогащению

  1. Используйте количество входных говорится в каждый новый блок с θ в качестве фона ставки, объекты POI (λ) и определить обогащения с помощью простого теста гипотеза, основанная на чипе ли задний средний, θ с, превышает некоторый порог δ. 90-й </ SUP>-квантиль по умолчанию D и подходит в большинстве случаев.
  2. Слияние соседних θ с блоками, которые превышают обогащения в одном регионе и доклад слияния координаты в простом формате BED. Кроме того, можно сообщить о θ с для каждого блока в формате bedGraph сохранить высокое разрешение деталей для чтения оценках плотности.

4б. Точечные Читайте профили: Post-процессов Задний средства в пик кандидатов

  1. Определить фоне ставки, объекты POI (λ), а в среднем по всем прочитать отсчетов (γ 2) и выявления всех блоков, которые превышают порог, г. Так как точечные пики ожидается, будет более существенно обогатили по умолчанию δ установлен в 99-е-квантиль POI (λ).
  2. Установите блок с максимальным θ с, как саммит пик кандидата и примыкающие фланговые блоки, которые имеют аналогичные ден чтенияплотности (± 1 прочитаны, чтобы обеспечить небольшие изменения). Это присоединенных регион определен как кандидат сайт связывания.
  3. Рассчитать λ 2, средняя читать рассчитывает в чип кандидата сайта связывания и проверки гипотезы этом фоне в зависимости от входного была нулевой гипотезы, H 0, является то, что λ 1λ 2 и отклонить H 0 на основе р-порогового значения. Выходные кандидата пика в постели формате.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

BCP выделяется на выявление регионов широком обогащения гистонов модификации данных. В качестве точки отсчета, ранее мы сравнивали наши результаты с результатами SICER 3, существующий инструмент, который продемонстрировал высокие показатели. Чтобы лучше проиллюстрировать преимущества BCP, мы рассмотрели модификация гистонов, которые были хорошо изучены, чтобы создать основу для оценки успеха ставок. Имея это в виду, мы затем анализируются H3K36me3, так как она была показана, чтобы связать сильно с активно тра...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Мы задались целью разработать модель для анализа ChIPseq данных, которые могут идентифицировать как точечные и диффузные структуры данных, одинаково хорошо. До сих пор регионы обогащения, в частности, диффузные регионов, которые отражают предполагает ожидание больших размеров остров, было трудно идентифицировать. Для решения этих проблем, мы использовали самые последние достижения в области технологии HMM, которые обладают многими преимуществами по сравнению с существующими эвристическими моделями и менее инновационные ...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Нет конфликта интересов объявлены.

Благодарности

STARR основу премии (MQZ), NIH грант ES017166 (MQZ), NSF гранта DMS0906593 (HX).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Название реагента Компания Номер в каталоге Комментарии (по желанию)
Linux рабочих станций на базе

Ссылки

  1. Park, P. J. ChIP-seq: advantages and challenges of a maturing technology. Nat. Rev. Genet. 10, 669-680 (2009).
  2. Barski, A., et al. High-resolution profiling of histone methylations in the human genome. Cell. 129, 823-837 (2007).
  3. Zhang, Y., et al. Model-based Analysis of ChIP-Seq (MACS). Genome Biol. 9, R137(2008).
  4. Zang, C., et al. A clustering approach for identification of enriched domains from histone modification ChIP-Seq data. Bioinformatics. 25, 1952-1958 (2009).
  5. Jothi, R., Cuddapah, S., Barski, A., Cui, K., Zhao, K. Genome-wide identification of in vivo protein-DNA binding sites from ChIP-Seq data. Nucleic Acids Res. 36, 5221-5231 (2008).
  6. Qin, Z. S., et al. HPeak: an HMM-based algorithm for defining read-enriched regions in ChIP-Seq data. BMC Bioinformatics. 11, 369(2010).
  7. Song, Q., Smith, A. D. Identifying dispersed epigenomic domains from ChIP-Seq data. Bioinformatics. 27, 870-871 (2011).
  8. Spyrou, C., Stark, R., Lynch, A. G., Tavaré, S. BayesPeak: Bayesian analysis of ChIP-seq data. BMC Bioinformatics. 10, 299(2009).
  9. Lai, T., Xing, H. A simple Bayesian approach to multiple change-points. Statistica Sinica. , (2011).
  10. Robertson, G., et al. Genome-wide profiles of STAT1 DNA association using chromatin immunoprecipitation and massively parallel sequencing. Nat. Methods. 4, 651-657 (2007).
  11. Stitzel, M. L., et al. Global epigenomic analysis of primary human pancreatic islets provides insights into type 2 diabetes susceptibility loci. Cell Metab. 12, 443-455 (2010).
  12. Bernstein, B. E., et al. The NIH Roadmap Epigenomics Mapping Consortium. Nat. Biotechnol. 28, 1045-1048 (2010).
  13. Karolchik, D., et al. The UCSC Table Browser data retrieval tool. Nucleic Acids Res. 32, 493-496 (2004).
  14. Matys, V., et al. TRANSFAC: transcriptional regulation, from patterns to profiles. Nucleic Acids Res. 31, 374-378 (2003).
  15. Portales-Casamar, E., et al. JASPAR 2010: the greatly expanded open-access database of transcription factor binding profiles. Nucleic Acids Res. 38, D105-D110 (2010).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

ChIP seq