Методическая статья

Вычислительный конвейер для количественного определения межгенной/внутригенной энхансерной РНК в эмбриональных стволовых клетках мыши

DOI:

10.3791/69400

28 октября 2025 г.

* These authors contributed equally

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Этот протокол предоставляет оптимизированный вычислительный конвейер для количественной оценки зарождающихся транскриптов энхансеров. Интегрируя доступность хроматина, свойство хроматина и транскрипционные данные, он позволяет точно обнаруживать и анализировать активность энхансера в сложных внутригенных областях, оставаясь при этом доступным для исследователей без обширной подготовки в области биоинформатики.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Основные цис-регуляторные элементы, известные как энхансеры, играют центральную роль в обеспечении точной транскрипционной регуляции генов-мишеней, которые контролируют различные клеточные функции и процессы развития. Эти энхансеры часто транскрибируются в обоих направлениях, образуя длинные некодирующие транскрипты, называемые энхансерными РНК (эРНК). Экспрессия эРНК тесно связана с активными особенностями хроматина, такими как H3K27ac и рекрутирование коактиваторов, и функционально способствует транскрипционной активации генов-мишеней. Тем не менее, обнаружение и количественное определение эРНК остается сложной задачей, особенно когда они перекрываются с транскрипцией гена хозяина. Чтобы решить эту проблему, мы представляем стандартизированный, удобный для пользователя вычислительный рабочий процесс для анализа транскрипции энхансера из зарождающихся данных секвенирования РНК. Протокол помогает пользователям пройти предварительную обработку данных, картирование чтения и контроль качества, за которыми следует количественная оценка транскрипции, связанной с энхансером, специфичная для нити, с помощью специальных процедур для внутригенных энхансеров, где назначение сигналов является сложным. Модули визуализации позволяют четко контролировать активность энхансеров в разных геномных контекстах, а встроенные опции поддерживают анализ как межгенных, так и внутригенных энхансеров. Разработанный для исследователей с ограниченными знаниями в области биоинформатики, этот рабочий процесс обеспечивает практическую основу для последовательных, воспроизводимых и масштабируемых исследований энхансерной транскрипции, способствуя более широкому применению энхансерной биологии в различных системах.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Энхансеры представляют собой цис-регуляторные элементы ДНК, которые контролируют транскрипцию гена-мишени путем организации петли хроматина и рекрутирования транскрипционного механизма 1,2,3. Их тканеспецифичная активность обеспечивает точную регуляцию во время развития и приверженности линии 4,5,6,7,8. Активные энхансеры демонстрируют характерные свойства хроматина, такие как H3K4me1 (монометилирование гистона H3 Лизина 4) и H3K27ac (ацетилирование гистона H3 Лизина 27) и обычно обнаруживаются в гиперчувствительных областях ДНКазы I, которые отмечают открытый хроматин 9,10,11,12. Эти особенности позволяют факторам транскрипции и РНК-полимеразе II получать доступ к ДНК, инициируя зарождающуюся транскрипцию в энхансерных локусах 13,14,15,16.

В результате этого последовательного биологического процесса образуются транскрипты, полученные из энхансеров, называемые эРНК, которые представляют собой двунаправленные, некодирующие и, как правило, неполиаденилированные РНК 13,14,15,16. ЭРНК служат маркерами энхансерной активности и функционируют как эффекторы сами по себе 16,17,18,19,20,21,22,23,24. Они способствуют продуктивному удлинению за счет высвобождения отрицательного фактора элонгации (NELF) из приостановленной РНК-полимеразы II16,19 и помогают стабилизировать петли энхансер-промотор17,18,20. Они также поддерживают образование транскрипционных конденсатов, потенциально через m6A (N 6-метиладенозин) модификацию 21,22,23.

Тем не менее, функция транскрипции внутригенного энхансера, инициируемой регуляторными элементами в телах генов, остается спорной. В некоторых исследованиях сообщается, что эРНК из внутригенных энхансеров усиливают экспрессию генов хозяина25, потенциально способствуя высвобождению NELF и стимулирующему продуктивному удлинению 26,27. Напротив, другая работа предполагает, что эта транскрипция может препятствовать генам хозяина через коллизии РНК-полимеразы II или транскрипционную интерференцию, что приводит к ослаблению или преждевременному прекращению28,29. Эти противоречивые наблюдения, наряду с двойной ролью эРНК в качестве маркеров и регуляторов, подчеркивают необходимость тщательной количественной оценки и функционального препарирования. Тем не менее, измерение внутригенных эРНК затруднено, потому что они часто перекрывают сенсорно-цепные транскрипты хозяина 13,25,26,30. Проблема усугубляется, когда энхансеры находятся в областях с вложенными генами или перекрывающейся транскрипцией на обеих цепях, что затемняет сигналы, специфичные для энхансеров.

Чтобы преодолеть эти проблемы, мы разработали биоинформатический конвейер для обнаружения, количественной оценки и визуализации транскриптов, связанных с энхансерами, уделяя особое внимание внутригенным областям. В конвейер интегрированы анализы на доступный для транспозазы хроматин с использованием секвенирования (ATAC-seq), иммунопреципитационного секвенирования хроматина (ChIP-seq), глобального повторного секвенирования (GRO-seq) и геномных аннотаций для достижения разрешения на уровне энсерсера даже в сложных геномных контекстах.

Конвейер состоит из четырех основных этапов: (i) предварительная обработка, выравнивание, пиковые вызовы и генерация сигнала31; (ii) идентификация энхансеров с использованием свойств хроматина; (iii) назначение ориентации цепи, особенно в пределах тел генов; и (iv) количественная оценка и визуализация зарождающихся транскриптов энхансеров. Эта структура особенно полезна для систем с данными секвенирования с высоким разрешением, таких как эмбриональные стволовые клетки мыши, проанализированные в этом исследовании, и она может быть расширена на другие организмы при наличии подходящих наборов данных. Обеспечивая количественную оценку специфичных энхансеров там, где существующие конвейеры не справляются, этот рабочий процесс предлагает практический инструмент для сравнительного анализа и изучения внутригенной транскрипции eRNA в различных геномных контекстах.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ПРИМЕЧАНИЕ: Все исходные наборы данных, используемые в рабочем процессе, перечислены в таблице 1. Подробная информация об инструментах биоинформатики представлена в Таблице материалов. Количество потоков, используемых в этом конвейере, можно регулировать, изменяя переменную THREADS, определенную в верхней части каждого скрипта. Пользователи могут увеличивать это число для ускорения анализа в зависимости от ресурсов процессора пользователя.
После каждого шага создается файл журнала. Для быстрой проверки сбоев используйте такие команды, как cat StepXX_log.txt; grep -qF "ERROR" StepXX_log.txt & echo "ERROR found. Исправьте перед следующим шагом." || echo "OK: без маркеров ERROR". Если появляется какая-либо ошибка, считайте шаг неудачным и устраните его в первую очередь.

1. Загрузка полного конвейера анализа из репозитория GitHub

(https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/)

  1. Запустите интерфейс командной строки (CLI), соответствующий используемой операционной системе.
    1. Windows: настройка среды Linux с помощью подсистемы Windows для Linux (WSL). Следуйте официальным инструкциям по установке и настройке WSL, прежде чем продолжитьработу 32.
    2. macOS: продолжите без дополнительной настройки, так как macOS основана на Unix. Обратитесь к официальному руководству по открытию терминала33.
    3. Пользователи Linux, особенно использующие Ubuntu: Откройте терминал, как описано в инструкции34.
  2. Запустите wget https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to-visualization/archive/refs/heads/main.zip -O ~/pipeline.zip   в терминале, чтобы загрузить конвейер для идентификации энхансера и количественного определения энхансерной РНК.
  3. Введите unzip ~/pipeline.zip -d ~/ в терминале. Это позволит извлечь все необходимые файлы в домашний каталог.
  4. Запустите rm ~/pipeline.zip и введите mv ~/Enhancer-transcript-identification-from-read-to-visualization-main ~/Enhancer-transcript-identification-from-read-to-visualization , чтобы удалить архив и переименовать извлеченную папку.
  5. Введите cd ~/Enhancer-transcript-identification-from-read-to-visualization/, и выполните chmod +x scripts/* , чтобы сделать все скрипты в каталоге "scripts/" исполняемыми.

2. Настройка среды mamba/conda для конвейера анализа

  1. Введите bash scripts/Step1_conda_environment_formation.sh , чтобы создать и запустить виртуальную среду мамбы. Если во время выполнения появится запрос , введите Y и нажмите Enter , чтобы подтвердить установку пакета. Для macOS следуйте шагу 2.1.1; Для систем с уже установленными Mamba или Conda выполните шаг 2.1.2.
    1. MacOS: Откройте скрипт и замените ссылку для скачивания miniconda на версию macOS:
      https://repo.anaconda.com/miniconda/Miniconda3-latest-MacOSX-x86_64.sh
      Затем выполните шаг 2.1.
    2. Как только (enhancer-env) появится в командной строке, введите bash scripts/Step2_package_installation.sh , чтобы установить необходимые пакеты для нисходящего анализа. Введите Y и нажмите Enter , если во время установки появится соответствующий запрос.
    3. После выполнения шага 2.2 проверьте вывод терминала на наличие сообщений об ошибках. Решить любые вопросы; затем повторите Шаг 2.2.
    4. (НЕОБЯЗАТЕЛЬНО) Запустите mamba list , чтобы убедиться, что все пакеты, управляемые mamba, в таблице материалов установлены. HOMER устанавливается вручную и не отображается в списке мамбы. Проверьте HOMER, убедившись, что каталог "~/homer/" существует.

3. Загрузите общедоступные наборы данных ChIP-seq, ATAC-seq и GRO-seq из SRA (Sequence Read Archive)

  1. Запустите cp scripts/Step{3..12}_*.sh ./ для копирования необходимых сценариев оболочки для обработки необработанного чтения.
  2. Введите bash Step3_download_file_list.sh > Step3_log.txt 2>&1 и нажмите клавишу Enter , чтобы загрузить и обработать необработанные данные секвенирования из SRA.
    ПРИМЕЧАНИЕ: Этот скрипт автоматизирует загрузку и подготовку общедоступных данных секвенирования для анализа. Он создает стандартизированную структуру папок в разделе "MATERIAL/", организованную по типу анализа и репликации (биологический: rep1/rep2; технический: trep1/trep2). Встроенный список номеров доступа SRA обеспечивает извлечение данных с помощью предварительной выборки (версия 3.2.0), преобразование в FASTQ с помощью fasterq-dump (версия 3.2.0) (paired-end: --split-files) и сжатие с помощью pigz (версия 2.8) для уменьшения объема хранилища. Обработка осуществляется по принципам prefetch, fasterq-dump, pigz, с выходами, записанными в соответствующие директории "00.Rawdata/".

4. Выполнение контроля качества и обрезки необработанных прочтений

  1. Введите bash Step4_read_trimming_and_QC.sh > Step4_log.txt 2>&1 , чтобы выполнить обрезку чтения и контроль качества необработанных файлов FASTQ.
    ПРИМЕЧАНИЕ: Этот скрипт обрабатывает необработанные файлы FASTQ из GRO-seq, ATAC-seq и ChIP-seq (H3K27ac, H3K4me1) с соответствующими элементами управления вводом. Он запускает FastQC (v0.12.1)35 на необработанных чтениях, а затем обрезает адаптеры с помощью Trim Galore (v0.6.10)36 , используя параметры, специфичные для анализа. Для GRO-seq он сначала удаляет хвосты NextSeq G и очень короткие чтения (--nextseq 20, --length 20), затем использует Cutadapt (v5.1)37 для удаления длинных поли-A трактов, сохраняя при этом чтения длиннее 20 нуклеотидов ( -a A{15}, -m 20). Для ATAC-seq он обрабатывает библиотеки с парным концом и нацелен на адаптеры Tn5/Nextera (--paired, --nextera). Для H3K27ac и соответствующего ввода он обрабатывает парные библиотеки ChIP-seq (--paired). Для H3K4me1 и его ввода он выполняет стандартную одностороннюю обрезку (по умолчанию). FastQC снова запускается на обрезанных операциях чтения. Выходные данные записываются в каталог "01.Clean/" каждого анализа, а промежуточные файлы, обрезанные адаптером GRO-seq, удаляются.

5. Подготовьте справочный указатель Bowtie2

  1. Выберите один из двух вариантов ниже, чтобы подготовить индекс генома Bowtie2 (v2.5.4)38 для референсного генома mm10 (Mus musculus).
    1. Запустите bash Step5_1_download_reference_index.sh > Step5_1_log.txt 2>&1 , чтобы использовать предварительно созданный индекс Bowtie2, предоставленный разработчиками.
    2. Бежать Баш Step5_2_download_reference_make_index_with_
      bowtie2.sh > Step5_2_log.txt 2>&1
      для загрузки необработанной последовательности генома mm10 и построения индекса вручную.
      ПРИМЕЧАНИЕ: Оба подхода генерируют индексный файл в каталог "reference_index/" и функционально эквивалентны стандартному выравниванию.

6. Выравнивание обрезанных прочтений по референсному геному mm10

  1. Введите bash Step6_alignment_to_make_bam.sh > Step6_log.txt 2>&1 , чтобы выровнять прочтения каждого анализа со ссылочными и создать файлы BAM.
    ПРИМЕЧАНИЕ: На этом шаге прочтения каждого анализа сопоставляются с ранее проиндексированным эталоном mm10. H3K27ac ChIP-seq и соответствующий вход используют сопряженное отображение концов для сбалансированной точности (-1, -2) с чувствительностью по умолчанию. H3K4me1 ChIP-seq и соответствующий ввод используют одностороннее отображение при настройках по умолчанию (-U). ATAC-seq использует высокочувствительное отображение для размещения переменных, длинных фрагментов, полученных из Tn5 (--very-sensitive, -X 2000) с парным входом (-1, -2). GRO-seq использует высокочувствительное отображение для лучшего размещения коротких, обрезанных операций чтения (--very sensitive) с односторонним вводом (-U). Файлы SAM конвертируются в BAM и фильтруются с помощью представления samtools (v1.22.1)39 , используя умеренный MAPQ для ChIP/input (-b, -q 10) и более строгие пороговые значения для ATAC-seq и GRO-seq (-b, -q 30); окончательные файлы BAM записываются в директорию "02.Align/" каждого набора данных.

7. Объединение технических реплик данных H3K27ac ChIP-seq

  1. Запустите bash Step7_merge_trep.sh > Step7_log.txt 2>&1 для объединения технических реплик H3K27ac ChIP-seq и соответствующих входных файлов BAM.
    ПРИМЕЧАНИЕ: Этот скрипт сортирует файлы BAM для технических реплик с помощью сортировки sambamba (v1.0.1)40 , а затем объединяет H3K27ac ChIP-seq и соответствующие входные реплики в консолидированные BAM с помощью sambamba merge. Если набор данных пользователя не содержит технических репликаций, пропустите этот шаг и перейдите к отдельным файлам BAM.

8. Удалите дубликаты и второстепенные хромосомы

  1. Удалите дубликаты и отсортируйте сопоставленные чтения для ChIP-seq и GRO-seq.
    1. Введите bash Step8_1_duplicate_removal_sorting-ChIP_GRO.sh > Step8_1_log.txt 2>&1 , чтобы удалить дубликаты из наборов данных histone ChIP-seq и отсортировать выходные BAM ChIP-seq и GRO-seq.
      ПРИМЕЧАНИЕ: Этот скрипт удаляет дубликаты PCR с помощью sambamba markdup (-r) и координаты-сортировки с помощью sambamba sort. Для H3K27ac обработка целевых BAM из объединенных технических реплик, обрабатывая ChIP и ввод отдельно. Для H3K4me1 каждая репликация и согласованный вход обрабатываются индивидуально. Для GRO-seq удаление дубликатов пропускается, и применяется только сортировка по координатам. Выходные данные сохраняются в каталоге "02.Align/" каждого набора данных.
  2. Удаляйте дубликаты и фильтруйте митохондриальные хромосомные картированные чтения из ATAC-seq.
    1. Введите bash Step8_2_duplicate_chrM_removal_sorting_ATAC.sh > Step8_2_log.txt 2>&1 для удаления дубликатов ПЦР, фильтрации митохондриальных прочтений (chrM) и сортировки ATAC-seq BAM.
      ПРИМЕЧАНИЕ: Этот скрипт ссылается на рекомендации конвейера ENCODE для обработки данных ATAC-seq. Он начинается с сортировки имен с помощью сортировки sambamba (-n) и исправления информации о паре mate с помощью samtools fixmate (-m). Этот шаг гарантирует, что информация о сопряжении правильно назначена перед маркировкой дубликатов. После этого дубликаты ПЦР удаляются с помощью разметки самбамба (-r). Митохондриальные чтения удаляются путем создания keep-list из samtools idxstats (за исключением chrM и *) и сохранения только перечисленных ссылок с помощью samtools view (-b). Окончательная сортировка координат выполняется с помощью сортировки самбамба. Очищенные BAM записываются в каталог "02.Align/" каждой репликации.

9. Выполнение пиковых вызовов для каждого набора данных

  1. Запустите сценарий шага 9, введя bash Step9_peak_calling.sh > Step9_log.txt 2> и 1 , чтобы выполнить пиковый вызов для данных ChIP-seq и ATAC-seq.
    ПРИМЕЧАНИЕ: Этот скрипт выполняет пиковые вызовы с помощью MACS3 (v3.0.3)41 для ATAC-seq и ChIP-seq (H3K27ac, H3K4me1). ATAC-seq генерирует пики, подавая все реплики BAM в качестве сигнала в режиме no-model со сдвигом/расширением (-f BAMPE, --nomodel, --shift -100, --extsize 200, -q 0.01). H3K27ac вызывает широкие пики из объединенных технических реплик с согласованными входными данными (-f BAMPE, --broad). Процессы H3K4me1 реплицируются индивидуально с соответствующим входом в одностороннем широком режиме (-f BAM, --wide), а перекрывающиеся пики получаются с помощью bedtools (v2.31.1)42 intersect. Выходные данные записываются в каталог "peak_calling/" каждого набора данных, при этом пики H3K4me1 с высокой степенью достоверности находятся в "peak_calling/overlapped_peak/".

10. Объединение биологических реплик файлов ChIP-seq и ATAC-seq BAM для анализа нисходящих сигналов

  1. Запустите bash Step10_merge_rep_forMakingSignal.sh > Step10_log.txt 2>&1 для объединения файлов BAM из биологических реплик ATAC-seq и H3K4me1 ChIP-seq.
    ПРИМЕЧАНИЕ: Этот скрипт сочетает в себе репликацию BAM с слиянием sambamba для ATAC-seq, H3K4me1 ChIP-seq и соответствующего входа H3K4me1. Объединенные BAM поддерживают нисходящий анализ (например, генерацию сигналов bigWig, нормализацию). Выходные BAM сохраняются в каталогах "merge/02.Align/" под каждым образцом пути.

11. Генерация каталогов тегов и сигнализация файлов bigWig из сопоставленных прочтений

  1. Запустите bash Step11_make_tag_to_signal.sh > Step11_log.txt 2>&1 для создания каталогов тегов и генерации файлов сигналов bigWig для сопоставленных прочтений каждого набора данных.
    ПРИМЕЧАНИЕ: Этот скрипт строит каталоги тегов HOMER с помощью makeTagDirectory , а затем генерирует сигнальные треки bigWig с помощью команды makeUCSCfile , используя пакеты HOMER (v5.1)43 и ucsc-bedgraphtobigwig (v482)44 . Все сигнальные треки создаются с использованием файлов размеров хромосом из UCSC Genome Browser (https://hgdownload.soe.ucsc.edu/goldenPath/mm10/). GRO-seq создает сигнальные дорожки, специфичные для нитей (-style rnaseq, -strand + / -, -bigWig). ATAC-seq создает ненормализованные треки из объединенных BAM (-bigWig). ChIP-seq (H3K27ac, H3K4me1) создает нормализованные на входе дорожки с псевдо-счетчиком, равным 1 (-bigWig, -i, -pseudo 1). Выходные данные упорядочены по "03.TagDir/" и "04.bigwig/".

12. Подготовка файлов для идентификации энхансера

  1. Введите bash Step12_E_identification_material.sh > Step12_log.txt 2>&1 в терминале, чтобы подготовить необходимые файлы и ссылку для идентификации энхансера.
    ПРИМЕЧАНИЕ: На этом шаге все необходимые файлы для идентификации энхансера собираются в папки "01.E_identification/material/", организованные в папки "ATAC/", "Histon/" и "Annotation/". Он копирует пиковые файлы (ATAC-seq, H3K27ac, H3K4me1) в соответствующие директории. Файл аннотации GENCODE M23 (mm10) загружается автоматически, а справочные файлы, включая черный список ENCODE45 (mm10-blacklist.v2.bed) и файл размера хромосомы (mm10.chrom.sizes), копируются из заранее определенного пути.

13. Идентификация кандидатов в промоторы и генных тел по аннотации

  1. Введите cd 01.E_identification/ , чтобы войти в рабочий каталог, затем запустите cp .. /scripts/Step{13..20}_*.sh ./ для копирования скриптов с улучшением идентификации.
  2. Запустите bash Step13_promoter_candidates_genebody_identification.sh > Step13_log.txt 2>&1 для создания файлов BED для промоторных областей, тел генов и генов, кодирующих белки (PCG), с помощью аннотации GENCODE.
    ПРИМЕЧАНИЕ: Этот скрипт обрабатывает загруженный формат переноса генов GENCODE M23 (GTF) для создания файлов BED для кандидатов в промоторы, всех тел генов и тел PCG, сохраняя выходные данные в "material/Annotation/". Промоторы определяются как окно размером 2 КБ вокруг TSS (Transcription Start Site) каждой транскрипции с помоями для постельных инструментов (-b 2000, -g mm10.chrom.sizes). Гены и белки-кодирующие тела получают из записей GTF, аннотированных как гены, при этом белок-кодирующие записи дополнительно фильтруются по "gene_type = protein_coding".

14. Пики процесса для идентификации энхансера

  1. Запустите bash Step14_ATAC_ChIP-seq_processing.sh > Step14_log.txt 2>&1 для предварительной обработки файлов ATAC-seq и histone ChIP-seq peak для идентификации энхансера.
    ПРИМЕЧАНИЕ: Этот скрипт предварительно обрабатывает наборы пиков для вызова энхансера. Для ATAC-seq он удаляет области, перекрывающиеся в черном списке, области с помощью инструментов для кроватей вычитает (-A), а затем исключает пики, перекрывающие кандидатов в промоторы с помощью инструментов для кроватей вычитает (-A); для меток гистонов (H3K27ac, H3K4me1) симметрично расширяет каждый пик на 1 кб с каждой стороны с помощью помоев для подстилающего инструмента (-b 1000 -g mm10.chrom.sizes) и затем удаляет перекрытия промотора с помощью вычитания подстилающего инструмента.

15. Идентификация и классификация энхансеров

  1. Запустите bash Step15_inter_intragenic_E_sets_identification.sh > Step15_log.txt 2>&1 для определения и классификации энхансеров с использованием данных о пиках хроматина.
    ПРИМЕЧАНИЕ: На этом шаге определяются и аннотируются усилители с помощью инструментов для кроватей. Перекрытия между пиками ATAC-seq и пиками H3K4me1 с расширением откоса получаются с пересечением (-wa, -u), а области, которые также перекрывают фланкированные пики H3K27ac, классифицируются как активные энхансеры с пересечением (-wa, -u); Неактивные энхансеры получаются путем удаления активных областей из полного набора энхансеров с помощью вычитания. Вершины ATAC-seq, перекрывающие каждый набор энхансеров, собираются с помощью пересечения (-u), затем вершины разбиваются на межгенные и внутригенные с помощью пересечения (-v или -u) против тела гена. Интервалы энхансеров окончательно присваиваются межгенным/внутригенным классам на основе вершины, связанной с пересечением пика (-u). Все результаты сохраняются в "01.E_identification/" под "01.allE/", "02.interE/" и "03.intraE/".

16. Присвоение информации о временных цепях внутригенным энхансерам

  1. Введите bash Step16_assign_temp_strand_from_gene_overlap.sh > Step16_log.txt 2>&1 , чтобы назначить информацию о временной цепи внутригенному усилителю BED.
    Примечание: На этом этапе внутригенным энхансерам присваиваются метки генных цепей путем перекрытия интервалов энхансеров с телами генов с помощью пересечения постельных инструментов (-wa, -wb). Столбцы 1, 2, 3, 4, 5, 16 сохраняются с awk, затем записи сортируются и дедуплицируются. Вывод сохраняется как "03.intraE/strand_designation/01.overlapped_gene_strand/ES_E_intragenic_strand_with_dup.bed".

17. Приоритизируйте назначение цепей для энхансеров, перекрывающих гены обеих цепей

  1. Тип bash Step17_initial_strand_assignment_for_both_strand_enhancers_PCG_based.sh > Step17_log.txt 2>&1 для определения направления цепи для внутригенных энхансеров, перекрывающих гены на обеих цепях.
    ПРИМЕЧАНИЕ: Этот скрипт устраняет неоднозначность цепей для внутригенных энхансеров, перекрывающих гены на обеих цепях, путем приоритизации перекрытий PCG. Энхансеры, присутствующие на обеих цепях, сначала выделяются (awk группировка по хрому/началу/концу/id/цепи), случаи с перекрытием PCG на одной и той же цепи выбираются с помощью пересечения с помощью инструментов для кроватей (-s, -wa, -u), а случаи, не относящиеся к PCG, сохраняются с помощью пересечения с инструментами для кроватей (-v). Выбранные и сохраненные наборы объединяются и упорядочиваются. Вывод: "03.intraE/strand_designation/02.enhancer_with_PCG_priority/ES_E_intragenic_PCG_priority.bed".

18. Расчет специфичных для цепи значений Reads Per Kilobase per Million Maped Reads (RPKM) для генов, перекрывающих внутригенные энхансеры, приоритизированные PCG

  1. Введите bash Step18_RPKM_cal_from_partially_strand_assigned_enhancers.sh > Step18_log.txt 2>&1 для расчета RPKM, специфичных для цепи, для генов, перекрывающих энхансеры на одной цепи.
    ПРИМЕЧАНИЕ: На этом этапе используется "ES_E_intragenic_PCG_priority.bed" из Шага 17, который содержит энхансеры, которые (i) перекрывали PCG на одной цепи и получали цепь, (ii) перекрывали PCG на обеих цепях и оставались неоднозначными, или (iii) не имели перекрытия PCG и сохраняли обе цепи. Одноцепочечные перекрывающиеся гены отбираются с помощью bedtools intersect (-s, -wa, -u), преобразуются в GTF с помощью awk и количественно оцениваются из GRO-seq с помощью featureCounts (v2.1.1)46 режима подсчета цепей, специфичных для нитей (-s 1, -t ген, -g gene_id, -O, --fraction). Общее картированное чтение получается с помощью sambamba flagstat, а RPKM вычисляется на основе длины гена, количества и итогов. Выходные данные записываются в "03.intraE/strand_designation/03.RPKM_calculation_of_overlapped_gene/".

19. Окончательное присвоение цепи на основе экспрессии генов (RPKM) перекрывающихся генов

  1. Введите bash Step19_second_strand_assignment_by_RPKM.sh > Step19_log.txt 2>&1 для завершения назначения цепей для внутригенных энхансеров.
    ПРИМЕЧАНИЕ: На этом этапе цепи относят к внутригенным энхансерам с использованием поддержки экспрессии генов, начиная с Шага 18. Одноцепочечные перекрытия между энхансерами (ES_E_intragenic_PCG_priority.bed) и генами обнаруживаются при пересечении инструментов для кроватей (-s, -wa, -wb). Значения RPKM генов присоединяются к интервалам генов с помощью awk/sort/join, производя gene-RPKM BED. Для каждого энхансера выбирается перекрывающийся ген с самым высоким RPKM, и энхансер наследует цепь этого гена. Результаты сохраняются в "03.intraE/strand_designation/04.enhancer_strand_designation_by_RPKM_of_gene/ES_E_intragenic_PCG_priority_strand_by_gene_RPKM.bed."

20. Присвоение информации о цепях внутригенным энхансерам и вершинам энхансеров

  1. Введите bash Step20_strand_assignment_for_intragenicE_and_summits.sh > Step20_log.txt 2>&1 , чтобы присвоить информацию о выбранных цепочках всем внутригенным энхансерам и каждой вершине.
    ПРИМЕЧАНИЕ: На этом этапе завершается назначение нитей для внутригенных энхансеров и соответствующих вершин с использованием инструментов для кроватей. Интервалы с противоположными цепями удаляются с помощью вычитания (-S), назначенные для них энхансеры пересекаются с активными и неактивными наборами с помощью интерсекции (-wa, -u), а файлы вершин повторно аннотируются перекрывающимися вершинами с помощью энхансеров, назначенных для нитей, с помощью интерсекции (-wa, -wb) и получают нить с помощью awk. Результаты сохраняются в "03.intraE/final_strand_IntragenicE/" и его подпапке "summit/".

21. Подготовка входных файлов для валидации энхансера, количественного определения и визуализации эРНК

  1. Тип cd .. / или cd ~/Enhancer-transcript-identification-from-read-to-visualization для перехода к корню конвейера, затем введите cp scripts/Step21_preparing_quantification_and_visualization.sh ./ для копирования скрипта для подготовки последующего анализа.
  2. Запустите bash Step21_preparing_quantification_and_visualization.sh > Step21_log.txt 2>&1 , чтобы подготовить все необходимые файлы для агрегации энхансеров, обработки сигналов GRO-seq и количественного определения eRNA.
    ПРИМЕЧАНИЕ: На этом этапе подготавливаются входные файлы и структура каталогов для валидации энхансера, количественного определения эРНК и визуализации сигналов в соответствии с "02.E_visualization_quantification/". Подпапки создаются для файлов bigWig, улучшенных BED, BAM, матриц сигналов, подсчетов и графиков. Ключевые входные данные, такие как BED саммита, bigWigs, списки усилителей и BAM GRO-seq, копируются в соответствующие расположения.

22. Создание графиков агрегирования для проверки энхансера

  1. Введите cd 02.E_visualization_quantification/ для входа в рабочий каталог, затем введите cp .. /scripts/Step{22..24}_*.* ./ для копирования необходимых скриптов для последующего анализа.
  2. Запустите bash Step22_generation_of_aggregation_plot.sh > Step22_log.txt 2>&1 для создания графиков агрегации сигналов хроматина вокруг каждого типа вершины энхансера.
    ПРИМЕЧАНИЕ: На этом шаге визуализируется среднее обогащение хроматинового сигнала, сосредоточенное на вершинах энхансера, с помощью computeMatrix и plotProfile из deepTools (v3.5.6)47. Для каждого определенного набора усилителей точка отсчета computeMatrix (--referencePoint center, -a 5000, -b 5000, --missingDataAsZero) вычисляет плотность сигнала в пределах окна размером 10 КБ вокруг вершин усилителя с помощью файлов bigWig для ATAC-seq, H3K27ac и H3K4me1. Выходная матрица передается в plotProfile, который генерирует кривые агрегации сигнала для сравнения между группами усилителей. Графики агрегации сохраняются в директории "01.Profiling/04_1.aggregation/".

23. Количественная оценка и визуализация экспрессии энхансерной РНК

  1. Запустите bash Step23_quantifing_eRNA_RPKM.sh > Step23_log.txt 2>&1 для количественной оценки уровней экспрессии эРНК из GRO-seq с помощью featureCounts.
    ПРИМЕЧАНИЕ: На этом этапе количественно определяется транскрипция эРНК из определенных областей энхансера специфическим для нити способом с использованием GRO-seq. Межгенные энхансеры подсчитываются с помощью featureCounts в неверстовом режиме (-s 0, -t enhancer, -g gene_id, -O, --fraction), а внутригенные энхансеры количественно оцениваются в антисмысловом режиме (-s 2) для исключения сигнала из перекрывающейся транскрипции генов. Регионы BED преобразуются в GTF с помощью awk перед подсчетом. Общее количество сопоставленных прочтений поступает из sambamba flagstat, а количество нормализуется в RPKM с использованием enhancer length, count count и total maped reads. Мероприятия сгруппированы в разделе "02.eRNA_quantification/03.count_normalized_with_RPKM/" по категориям "inter/" и "intra/".
  2. Запустите Rscript Step24_visualization_of_enhancer_transcript. R > Step24_log.txt 2>&1 для визуализации и сравнения уровней экспрессии эРНК в группах энхансеров с использованием R.
    ПРИМЕЧАНИЕ: Скрипт R использует пакеты ggplot2 (v3.5.2)48 и cowplot (v1.2.0)49 для генерации графиков скрипки и бокса, сравнивающих активное и неактивное выражение энхансера на основе значений RPKM. Для визуализации и статистического тестирования значения RPKM преобразуются в log2 (RPKM + 1). Статистическая значимость оценивается с помощью критерия ранговой суммы Вилкоксона. Как сводные графики, так и таблица p-значений сохраняются в "03.eRNA_visualization/" для последующей интерпретации.
    ПРИМЕЧАНИЕ: Если какой-либо шаг в этом конвейере завершается сбоем и сохраняется даже после повторного запуска, сообщите о проблеме в разделе https://github.com/myunggeunO/Enhancer-transcript-identification-from-read-to визуализации/проблемах. Четкое указание неудачного шага и прикрепление файла журнала обеспечивает точную поддержку по устранению неполадок.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Схематический рабочий процесс для конвейера количественного определения энхансерных транскриптов
Общедоступные наборы данных ChIP-seq (H3K27ac, H3K4me1), ATAC-seq и GRO-seq (Таблица 1) были обработаны с помощью стандартизированного конвейера, предназначенного в первую очередь для валидации. Обрезка адаптера и фильтрация качества были выполнены с помощью Trim Galore и Cutadapt с последующим выравниванием по референсному геному mm10 с помощью Bowtie2 (по...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

После открытия транскриптов, полученных из энхансеров 13,14,15, точное количественное определение эРНК остается серьезной проблемой, особенно во внутригенных контекстах, где эРНК часто перекрываются с транскриптами генов хозяина. Это перекрытие усложняет присвоение цепей и атрибуцию сигнала, что затрудняет различение подлинной транскрипции энхансера от фоновой экспрессии генов 13,25,26,30.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, который можно было бы раскрыть.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было поддержано исследовательским фондом Национального университета Чхуннам [2022-0582-01 (S.-K.K.) и 2023-0545-01 (S.-K.K.)], Южная Корея. Рисунок 1 был создан с помощью BioRender (https://biorender.com/).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Инструменты для кроватиЛаборатория Куинлана, Университет Юты v2.31.1Утилиты для редактирования файлов BED
Бабочка2Лаборатория Лэнгмид, Университет Джонса Хопкинсаv2.5.4Многопоточный выравниватель для отображения считывает в эталонный геном
CowplotЛаборатория Уилке, Техасский университетv1.2.0Инструменты для объединения и выравнивания фигур на основе ggplot2
cutadaptЛаборатория «Наука для жизни», Стокгольмский университетv5.1Адаптер и триммер для хвоста poly-A/G
deeptoolsБиоинформатика, Институт Макса Планкаv3.5.6Инструмент подсчёта чтения для количественной оценки чтений в озачернённых геномных областях
fastQCБиоинформатика Бабрахам, Институт Бабрахамv0.12.1Контроль качества для чтения секвенирования
featureCounts (субред.)Лаборатория Ши, Университет Монашv2.1.1Инструменты для подсчёта необработанного считывания для заданных геномных областей
ГомерЛаборатория Беннера, Калифорнийский университет в Сан-Диего (UCSD)v5.1Набор инструментов для анализа ChIP-seq, ATAC-seq и зарождающихся РНК; включает создание каталога тегов и профилирование сигналов
macs3Инициатива Чана Цукербергаv3.0.3Пиковые вызовы для наборов данных ChIP-seq и ATAC-seq
pigz.v2.8Многопоточный инструмент сжатия для генерации gzip-сжатых файлов
самбамбаПетербургский государственный университетv1.0.1Многопоточный набор инструментов для обработки файлов SAM/BAM
samtoolsИнститут Wellcome Trust Sangerv1.22.1Инструменты для обработки и обработки файлов SAM/BAM
SRA-инструментыНациональный центр биотехнологической информации (NCBI)v3.2.0Для загрузки файлов SRR из базы данных NCBI SRA
tidyversePosit PBCv2.0.0Сбор R-пакетов для обработки и визуализации данных
Изобилие обложкиAltos Labs, Кембриджский институт наукиv0.6.10Адаптер и низкокачественная обрезка базы с использованием многопоточного
Ubuntu 20.04Разработка и тестирование конвейера
UCSC-bedgraphtobigwig Лаборатория Кента, Калифорнийский университет в Санта-Крузеv482Инструменты для генерации сигнальных треков bigWig

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Bulger, M., Groudine, M. Functional and mechanistic diversity of distal transcription enhancers. Cell. 144 (3), 327-339 (2011).
  2. Smith, E., Shilatifard, A. Enhancer biology and enhanceropathies. Nat Struct Mol Biol. 21 (3), 210-219 (2014).
  3. Li, W., Notani, D., Rosenfeld, M. G. Enhancers as non-coding RNA transcription units: recent insights and future perspectives. Nat Rev Genet. 17 (4), 207-223 (2016).
  4. Whyte, W. A., et al. transcription factors and mediator establish super-enhancers at key cell identity genes. Cell. 153 (2), 307-319 (2013).
  5. Plank, J. L., Dean, A. Enhancer function: mechanistic and genome-wide insights come together. Mol Cell. 55 (1), 5-14 (2014).
  6. Alexander, J. M., et al. Brg1 modulates enhancer activation in mesoderm lineage commitment. Development. 142 (8), 1418-1430 (2015).
  7. Huang, J., et al. Dynamic control of enhancer repertoires drives lineage and stage-specific transcription during hematopoiesis. Dev Cell. 36 (1), 9-23 (2016).
  8. Xiong, L., et al. Genome-wide identification and characterization of enhancers across 10 human tissues. Int J Biol Sci. 14 (10), 1321-1332 (2018).
  9. Heintzman, N. D., et al. Histone modifications at human enhancers reflect global cell-type-specific gene expression. Nature. 459 (7243), 108-112 (2009).
  10. Creyghton, M. P., et al. Histone H3K27ac separates active from poised enhancers and predicts developmental state. Proc Natl Acad Sci. 107 (50), 21931-21936 (2010).
  11. Calo, E., Wysocka, J. Modification of enhancer chromatin: what, how, and why. Mol Cell. 49 (5), 825-837 (2013).
  12. Barakat, T. S., et al. Functional dissection of the enhancer repertoire in human embryonic stem cells. Cell Stem Cell. 23 (2), 276-288 (2018).
  13. Kim, T. -K., et al. Widespread transcription at neuronal activity-regulated enhancers. Nature. 465 (7295), 182-187 (2010).
  14. Melgar, M. F., Collins, F. S., Sethupathy, P. Discovery of active enhancers through bidirectional expression of short transcripts. Genome Biol. 12 (11), R113(2011).
  15. Djebali, S., et al. Landscape of transcription in human cells. Nature. 489 (7414), 101-108 (2012).
  16. Gorbovytska, V., et al. Enhancer RNAs stimulate Pol II pause release by harnessing multivalent interactions to NELF. Nat Commun. 13 (1), 2429(2022).
  17. Mousavi, K., et al. eRNAs promote transcription by establishing chromatin accessibility at defined genomic loci. Mol Cell. 51 (5), 606-617 (2013).
  18. Hsieh, C. -L., et al. Enhancer RNAs participate in androgen receptor-driven looping that selectively enhances gene activation. Proc Natl Acad Sci. 111 (20), 7319-7324 (2014).
  19. Schaukowitch, K., et al. Enhancer RNA facilitates NELF release from immediate early genes. Mol Cell. 56 (1), 29-42 (2014).
  20. Pnueli, L., Rudnizky, S., Yosefzon, Y., Melamed, P. RNA transcribed from a distal enhancer is required for activating the chromatin at the promoter of the gonadotropin α-subunit gene. Proc Natl Acad Sci. 112 (14), 4369-4374 (2015).
  21. Sabari, B. R., et al. Coactivator condensation at super-enhancers links phase separation and gene control. Science. 361 (6400), eaar3958(2018).
  22. Nair, S. J., et al. Phase separation of ligand-activated enhancers licenses cooperative chromosomal enhancer assembly. Nat Struct Mol Biol. 26 (3), 193-203 (2019).
  23. Lee, J. -H., et al. Enhancer RNA m6A methylation facilitates transcriptional condensate formation and gene activation. Mol Cell. 81 (16), 3368-3385 (2021).
  24. Chen, Q., et al. Enhancer RNAs in transcriptional regulation: recent insights. Front Cell Dev Biol. 11, 1205540(2023).
  25. Moon, J., et al. Embryonic stem cell-specific intragenic enhancer RNA essential for NSUN2-mediated stem cell fate regulation. Int J Biol Macromol. 245, 470(2025).
  26. Tuvikene, J., et al. Intronic enhancer region governs transcript-specific Bdnf expression in rodent neurons. Elife. 10, e65161(2021).
  27. Cheng, F., et al. Intronic enhancers of the human SNCA gene predominantly regulate its expression in brain in vivo. Sci Adv. 8 (47), eabq6324(2022).
  28. Hobson, D. J., Wei, W., Steinmetz, L. M., Svejstrup, J. Q. RNA polymerase II collision interrupts convergent transcription. Mol Cell. 48 (3), 365-374 (2012).
  29. Cinghu, S., et al. Intragenic enhancers attenuate host gene expression. Mol Cell. 68 (1), 104-117 (2017).
  30. Bressin, A., et al. High-sensitive nascent transcript sequencing reveals BRD4-specific control of widespread enhancer and target gene transcription. Nat Commun. 14 (1), 4971(2023).
  31. Lee, J., et al. Introductory analysis and validation of CUT&RUN sequencing data. J Vis Exp. (214), e67359(2024).
  32. How to install Linux on Windows with WSL. , Microsoft. https://learn.microsoft.com/en-us/windows/wsl/install (2025).
  33. Terminal user guide. , Apple. https://support.apple.com/guide/terminal/welcome/mac (2025).
  34. How to open terminal in Linux. , GeeksforGeeks. https://www.geeksforgeeks.org/linux-unix/how-to-open-terminal-in-linux/ (2025).
  35. Simon, A. FastQC: a quality control tool for high throughput sequence data. Version 0.10.1, (2010).
  36. Krueger, F. Trim Galore!: a wrapper around Cutadapt and FastQC to consistently apply adapter and quality trimming to FastQ files, with extra functionality for RRBS data. Babraham Inst. , (2015).
  37. Martin, M. Cutadapt removes adapter sequences from high-throughput sequencing reads. EMBnet J. 17 (1), 3(2011).
  38. Langmead, B., Salzberg, S. L. Fast gapped-read alignment with Bowtie 2. Nat Methods. 9 (4), 357-359 (2012).
  39. Li, H., et al. The sequence alignment/map format and SAMtools. Bioinformatics. 25 (16), 2078-2079 (2009).
  40. Tarasov, A., Vilella, A. J., Cuppen, E., Nijman, I. J., Prins, P. Sambamba: fast processing of NGS alignment formats. Bioinformatics. 31 (12), 2032-2034 (2015).
  41. Zhang, Y., et al. Model-based analysis of ChIP-Seq (MACS). Genome Biol. 9 (9), R137(2008).
  42. Quinlan, A. R., Hall, I. M. BEDTools: a flexible suite of utilities for comparing genomic features. Bioinformatics. 26 (6), 841-842 (2010).
  43. Heinz, S., et al. Simple combinations of lineage-determining transcription factors prime cis-regulatory elements required for macrophage and B cell identities. Mol Cell. 38 (4), 576-589 (2010).
  44. Kent, W. J., Zweig, A. S., Barber, G., Hinrichs, A. S., Karolchik, D. BigWig and BigBed: enabling browsing of large distributed datasets. Bioinformatics. 26 (17), 2204-2207 (2010).
  45. Amemiya, H. M., Kundaje, A., Boyle, A. P. The ENCODE blacklist: identification of problematic regions of the genome. Sci Rep. 9 (1), 9354(2019).
  46. Liao, Y., Smyth, G. K., Shi, W. featureCounts: an efficient general purpose program for assigning sequence reads to genomic features. Bioinformatics. 30 (7), 923-930 (2014).
  47. Ramírez, F., et al. deepTools2: a next generation web server for deep-sequencing data analysis. Nucleic Acids Res. 44, W160(2016).
  48. Wickham, H. ggplot2: elegant graphics for data analysis. , Springer. 189-201 (2016).
  49. Wilke, C. O. cowplot: streamlined plot theme and plot annotations for ggplot2. CRAN Contrib. Packages. , (2015).
  50. Andersson, R., et al. An atlas of active enhancers across human cell types and tissues. Nature. 507 (7493), 455-461 (2014).
  51. Spicuglia, S., Vanhille, L. Chromatin signatures of active enhancers. Nucleus. 3 (2), 126-131 (2012).
  52. Zentner, G. E., Tesar, P. J., Scacheri, P. C. Epigenetic signatures distinguish multiple classes of enhancers with distinct cellular functions. Genome Res. 21 (8), 1273-1283 (2011).
  53. Blinka, S., Reimer, M. H., Pulakanti, K., Rao, S. Super-enhancers at the Nanog locus differentially regulate neighboring pluripotency-associated genes. Cell Rep. 17 (1), 19-28 (2016).
  54. Zhao, S., Ye, Z., Stanton, R. Misuse of RPKM or TPM normalization when comparing across samples and sequencing protocols. RNA. 26 (8), 903-909 (2020).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

GRO seqATAC seqH3K27

Похожие статьи