$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Описанный протокол Capture Hi-C основан на подготовке полногеномной 3C-матрицы с помощью четырехбазового резака (DpnII). Последующее обогащение фрагментов лигирования по интересующей области генома получается путем гибридизации массива тайлинговых РНК-зондов и их захвата на основе стрептавидина в соответствии с целевой системой обогащения, используемой в данном исследовании (рис. 1). Были выбраны биотинилированные РНК-зонды, поскольку они демонстрируют более плотное сродство к своим мишеням по сравнению с ДНК-зондами52,60. Затем захваченные библиотеки индексируются и объединяются в пулы для мультиплексирования с высокой пропускной способностью. Данные захвата Hi-C могут быть визуализированы в виде карт взаимодействия Hi-C с высоким разрешением, а также в виде карт контактов с одной точкой обзора в стиле 4C, чтобы специально визуализировать взаимодействия меньших последовательностей, таких как промоторы или усилители, во всей области захвата. Рабочий процесс протокола показан на рисунке 4. Контроль качества предварительного секвенирования показан на рисунке 2 и включает оценку правильного разложения и повторного лигирования шаблона 3C, а также его эффективную резку и очистку на различных этапах протокола. Ожидается, что срезанная матричная ДНК 3C будет работать в диапазоне от 150 до 700.н., и обогащение фрагментов >2 кб не должно быть обнаружено. Во время следующих этапов выполняется несколько этапов очистки ДНК на основе шариков и выбора размера, сначала после сдвига, затем после ПЦР до и после захвата. Очищенные библиотеки показывают отчетливый профиль обогащения фрагментов, визуализированный на высокочувствительном биоанализаторе ДНК (рис. 2). Средний размер фрагмента увеличивается в процессе подготовки библиотеки за счет лигирования адаптеров, секвенирования и индексации праймеров. Контроль качества после секвенирования осуществляется с помощью Hi-C Pro и показан на рисунке 3. Для обработки и анализа данных, подобных 3C, было предложено множество различных программных приложений для биоинформатики. Среди них конвейер HiC-Pro является одним из самых популярных решений, позволяющих обрабатывать необработанные данные секвенирования до конечных карт контактов при различных разрешениях55. HiC-Pro использует двухэтапную стратегию картирования для выравнивания чтений секвенирования в эталонном геноме. Затем продукты 3C реконструируются и отфильтровываются, чтобы удалить неинформативные пары контактов и создать карты контактов. Кроме того, он может использовать список известных полиморфизмов для проведения аллель-специфического анализа и разделения контактов, исходящих от двух родительских аллелей, в различных контактных картах. Совсем недавно HiC-Pro был включен и расширен в структуру nf-core (nf-core-hic), обеспечивая высокомасштабируемый и воспроизводимый конвейер, управляемый сообществом61,62.
Для захвата мыши Xic был разработан массив из 28 913 РНК-зондов, разбивающих 3 Мб Х-хромосомы. Эта область включает в себя ключевого игрока в XCI, длинный некодирующий ген Xist, и его известный регуляторный ландшафт ~ 800 кб (рис. 5). Эта область размером ~800 кб разделена на два TAD: один, включающий промотор Xist и его известные положительные регуляторы (т.е. некодирующие транскрипты Ftx, Jpx и Xert и ген, кодирующий белок Rnf12), и соседний TAD, охватывающий отрицательные цис-регуляторы Xist (т.е. его антисмысловой транскрипт Tsix, элемент энхансера Xite и некодирующий транскрипт Linx) (для обзора44,45).
Применив описанный протокол Capture Hi-C к Xic, топологическая организация этого локуса была получена с беспрецедентным разрешением (рис. 6 и рис. 7). Это особенно ясно при сравнении профиля Capture Hi-C с ранее опубликованным профилем 5C47 (рис. 6 и рис. 7; Дополнительная таблица 1) и Hi-C61 (рис. 6 и рис. 7; Дополнительная таблица 1) Профили. Например, структуры суб-TAD более очевидны — TAD, содержащий промотор Xist ( Xist-TAD ), четко подразделяется на два меньших домена (рис. 6A, синяя стрелка). Ранее об этом можно было только визуально «догадаться» по профилю 5С (рис. 6В), правда, обнаружение границы в этой области с помощью алгоритма оценки изоляции. Аналогичным образом, разрешение профиля Capture Hi-C позволяет идентифицировать два меньших домена в соседнем TAD (рис. 6A, B), который содержит промотор локуса Tsix ( Tsix-TAD ); ранее это не достигалось с помощью 5C (рис. 6B). Следует отметить, что топологические границы, определяемые оценкой изоляции по данным Capture Hi-C и 5C, обычно обнаруживаются в несколько разных местах и с разной относительной прочностью.
Более того, другие структуры суб-TAD, такие как контактные петли, хорошо видны из данных Capture Hi-C, такие как петля между Xist и Ftx (рис. 7A), ранее идентифицированная с Capture-C63, и петля между Xist и Xert (рис. 7B), недавно идентифицированная с использованием аналогичного протокола для Capture Hi-C48. Другие контакты также могут быть отображены более точно из-за увеличенного разрешения профилей Capture Hi-C, таких как те, которые образуют известные горячие точки контакта в Tsix-TAD между локусами Linx, Chic1 и Xite (рис. 7A).
По сравнению с данными Hi-C, показанными на рисунке 7, Capture Hi-C позволил увеличить разрешение в четыре раза, но потребовал только одну четвертую глубины секвенирования (т. е. 126 М считываний против 571 М) (Дополнительная таблица 1). Это увеличение разрешения позволяет обнаруживать субТАД и циклические взаимодействия, которые не могут быть обнаружены Hi-C на глубине секвенирования, показанной на рисунках 6 и 7. Таким образом, описанный протокол для Capture Hi-C позволяет получить гораздо более подробную характеристику с высоким разрешением большой интересующей области генома по сравнению с предыдущими подходами.

Рисунок 1: Конструкция зонда. Схематическое изображение стратегии, используемой для проектирования зонда. Области 300.н. вверх и вниз по течению от каждого сайта рестрикции DpnII в целевой области 3 Mb были выбраны и покрыты перекрывающимися биотинилированными РНК-зондами. Показан один из этих выбранных регионов, chrX: 102 474 805-102 475 500. В каждом зонде допускается не более 40 оснований повторяющихся последовательностей. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Контроль качества предварительного секвенирования Hi-C . (A) Репрезентативный пример контроля качества шаблонов 3C. 200 нг ДНК были загружены на 1% агарозный гель. Переулок 1: лестница 1 кб. Полоса 2: Непереваренный, сшитый и интактный хроматин работает в виде резкой полосы со скоростью >10 кб. Полоса 3: Сшитый хроматин, переваренный DpnII, представляет собой мазок размером от 1 до 3 кб. Полоса 4: Окончательная библиотека или шаблон 3C; свободные концы переваренных сшитых фрагментов ДНК перелигируются. Мазок ДНК с меньшим молекулярным размером практически не обнаруживается, а продукт лигирования обнаруживается в виде полосы размером >10 кб. (B) Репрезентативные примеры высокочувствительных профилей ДНК биоанализатора. Слева вверху: успешно срезанная библиотека 3C, показывающая распределение размера фрагмента от 150 до 700.н. Вверху справа: неудовлетворительно срезанная библиотека 3C. Несрезанная ДНК обнаруживается как широкое обогащение фрагментов >2 кб. (C) Внизу слева: срезанный образец ДНК после отбора размера левой стороны 1:1 с использованием шариков SPRI. Фрагменты ~300.н. обогащены. Нижняя середина: ПЦР-профиль предварительного захвата после лигирования адаптеров с парными концами в соответствии с протоколом производителя. Внизу справа: окончательная библиотека Capture Hi-C, включающая адаптеры, праймеры для секвенирования и индексирования для мультиплексного секвенирования. Сокращения: bp = пары оснований, FU = произвольная единица флуоресценции. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Захват контроля качества Hi-C после секвенирования с помощью HiC-Pro . (A) Пример скорости картирования эталонного генома для первого помощника пар секвенирования. Светло-голубая дробь представляет собой показания, выровненные HiC-Pro и охватывающие соединение лигирования. Таким образом, эта метрика может быть использована для проверки экспериментального этапа лигирования. (B) После того, как партнеры секвенирования выровнены в геноме, для анализа сохраняются только однозначно выровненные пары считывания. (C) Недопустимые пары (выделены красным цветом), такие как свисающий конец, автокруг или перевязка, исключаются из анализа. Доля допустимых пар является хорошим показателем эффективности лигирования и вытягивания. (D) Действительные пары могут быть дополнительно разделены на внутрихромосомные и ближние/дальние контакты. Дублированные пары чтения, которые, вероятно, представляют артефакты ПЦР, отбрасываются из анализа. (E) Для аллель-специфического анализа HiC-Pro сообщает о количестве аллельных считываний, поддерживаемых одним или двумя партнерами для каждого родительского генома (т.е. C57BL/6J x CASTEi/J). Ожидается одинаковая доля считываний, отнесенных к материнскому и отцовскому аллелю. (F) Наконец, для построения карт контактов выбираются только допустимые пары, перекрывающие область захвата. Пары захват-захват представляют контакты в целевом регионе, в то время как пары захват-репортер предполагают взаимодействие между целевым регионом и нецелевым регионом. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Рабочий процесс протокола Capture Hi-C. Схематическое изображение различных шагов протокола. Для создания полногеномного шаблона 3C хроматин сначала сшивают с формальдегидом, а затем расщепляют ферментом рестрикции DpnII. Затем свободные концы ДНК повторно лигируются, сшивание обращается вспять, и ДНК очищается. Чтобы обогатить фрагменты, охватывающие целевую область, массив биотинилированных РНК-зондов гибридизуют с матрицей 3C и захватывают с помощью стрептавидин-опосредованного вытягивания. Библиотеки захвата обрабатываются для мультиплексного секвенирования, а действительные фрагменты лигирования количественно оцениваются, чтобы определить частоту контактов хроматина по мишени, которые визуализируются в виде карт взаимодействия с высоким разрешением. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Обзор области, охватывающей Xic на Х-хромосоме мыши. Схематическое изображение Х-хромосомы мыши и увеличение захваченной области размером 3 Мб (ChrX: 102 475 000-105 475 000). Целевая область включает ~ 800 кб ДНК, соответствующей Xic, главному регуляторному локусу XCI. Xic включает в себя длинные некодирующие гены, Xist, ключевого игрока XCI, и его регуляторный ландшафт. Положительные регуляторы Xist показаны зеленым цветом, а отрицательные - фиолетовым. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Захват карт взаимодействия Hi-C, 5C и Hi-C в захваченной области размером 3 Мб. (A) Захват карты взаимодействия Hi-C целевого объекта размером 3 Мб, охватывающего Xic мыши с разрешением 10 кб (это исследование). (B) Карта взаимодействия 5C того же целевого региона, что и в A, с разрешением 6 кб (данные, обработанные из47). Повторяющиеся области, не включенные в анализы, замаскированы белым цветом. Данные 5C требуют собственной биоинформационной обработки (см.47). После очистки и выравнивания карты 5C с разрешением праймера объединяются с использованием бегущей медианы (окно = 30 кб, шаг = 5) для достижения окончательного разрешения 6 кб. (C) Карта взаимодействия Hi-C той же области генома, что и в A и B, с разрешением 40 кб (данные, обработанные из64). Все карты взаимодействия были сгенерированы с помощью ЭСК мыши. Оценка изоляции была рассчитана с помощью cooltools и представлена в виде гистограмм с минимумами изоляции на границах TAD. Границы TAD отображаются в виде вертикальных линий под картой. Высота каждой линии указывает на граничную прочность. Гены показаны в виде стрелок, указывающих в направлении транскрипции. Границы суб-TAD, которые определяются исключительно или более точно на картах Capture Hi-C, обозначаются пурпурными и синими стрелками для суб-TAD в Tsix и Xist TAD соответственно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Захват карт взаимодействия Hi-C, 5C и Hi-C на 1 Мб в захваченной области. (A) Захват карты взаимодействия Hi-C геномной области размером 1 Мб, охватывающей Xic мыши, с разрешением 5 кб (это исследование). (B) Карта взаимодействия 5C той же области генома, что и в A. при разрешении 6 КБ (данные обработаны из47). Повторяющиеся области, не включенные в анализы, замаскированы белым цветом. Следует отметить, что данные 5C требуют собственной биоинформационной обработки (см.47). После очистки и выравнивания карты 5C с разрешением праймера объединяются с использованием бегущей медианы (окно = 30 кб, шаг = 5) для достижения окончательного разрешения 6 кб. (C) Карта взаимодействия Hi-C той же области генома, что и в A и B Hi-C, с разрешением 20 кб (данные, обработанные из64). Все карты взаимодействия были сгенерированы с помощью mESCs. Оценка изоляции была рассчитана с помощью cooltools и представлена в виде гистограмм с минимумами изоляции на границах TAD. Границы TAD отображаются в виде вертикальных линий под картой. Высота каждой линии указывает на граничную прочность. Гены показаны в виде стрелок, указывающих на направление транскрипции. Контактные петли, которые обнаруживаются исключительно или более точно в Capture Hi-C, обозначаются пурпурными и синими звездочками для петель в Tsix и Xist TAD соответственно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Дополнительная таблица 1: Статистика после секвенирования для наборов данных, используемых в этой рукописи: Capture Hi-C (это исследование), Hi-C64 и 5C47. Пожалуйста, нажмите здесь, чтобы загрузить этот файл.