ChIP-seq — это широко используемый метод исследования взаимодействий белок-ДНК. Профили плотности чтений создаются путем секвенирования следующего поколения ДНК, связанной с белком, и выравнивания коротких чтений по референсному геному. Обогащенные области проявляются в виде пиков, форма которых часто существенно различается в зависимости от целевого белка1. Например, транскрипционные факторы часто связываются с сайтами и последовательностями специфическим образом и имеют тенденцию к образованию точечных пиков, в то время как модификации гистонов более распространены и характеризуются широкими диффузными островами обогащения2. Надежная идентификация этих областей была основной целью нашей работы.
Алгоритмы анализа данных ChIP-seq основывались на различных методологиях: от эвристических подходов3-5 до более строгих статистических моделей, например, скрытых марковских моделей (СММ)6-8. Мы стремились найти решение, которое минимизировало бы необходимость в трудноопределяемых параметрах ad hoc, которые часто снижают разрешение и затрудняют интуитивное использование инструмента. В отношении методов на базе СММ нашей целью было сократить количество процедур оценки параметров и упростить часто используемые классификации с конечным числом состояний.
Кроме того, традиционный анализ данных ChIP-seq предполагает классификацию ожидаемых профилей плотности чтений как точечных или диффузных с последующим применением соответствующего инструмента. Мы стремились заменить необходимость использования этих двух различных моделей единой, более универсальной моделью, способной эффективно обрабатывать весь спектр типов данных.
Для достижения этих целей мы сначала разработали статистическую структуру, которая естественным образом моделирует структуры данных ChIPseq с использованием передового метода HMM9, основанного исключительно на явных формулах — инновации, имеющей решающее значение для повышения производительности. Наша HMM, являясь более сложной, чем эвристические модели, поддерживает бесконечное количество скрытых состояний благодаря байесовской модели. Мы применили её для идентификации обоснованных точек изменения плотности чтений, которые далее определяют сегменты обогащения. Наш анализ показал, что алгоритм байесовских точек изменения (BCP) обладает сниженной вычислительной сложностью, что подтверждается сокращенным временем выполнения и меньшим объемом занимаемой памяти. Алгоритм BCP был успешно применен как для идентификации точечных пиков, так и диффузных островов с высокой точностью и ограниченным количеством задаваемых пользователем параметров. Это продемонстрировало как универсальность, так и простоту использования данного метода. Следовательно, мы полагаем, что он может быть легко внедрен для широкого спектра типов данных и конечных пользователей таким образом, который позволяет легко проводить сравнение и сопоставление, что делает его отличным инструментом для анализа данных ChIPseq, способствующим сотрудничеству и подтверждению результатов между исследовательскими группами. Здесь мы демонстрируем применение BCP к существующим данным по транскрипционным факторам10,11 и эпигенетическим данным12, чтобы показать его полезность.