Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Вычислительный протокол для количественной оценки артесунат-ассоциированных транскриптомических сдвигов в экспериментальной ткани мозга при малярии с использованием DESeq2

75 просмотров

DOI:

10.3791/70870

31 июля 2026 г.

* These authors contributed equally

В этой статье

Краткое содержание

Экспериментальная церебральная малярия (ЭКМ) вызывает нейровоспаление и нарушение гематоэнцефалического барьера. Используя GSE162535, воспроизводимый R-основанный рабочий процесс с РНК-секвенцией сравнивает контрольный (CB), ECM (MB) и артесунат-обработанный (AB) мозг, проводя анализы QC, PCA и DESeq2. Он выявляет транскрипционные изменения, вызванные ЭКМ, и оценивает артесунатно-опосредованную модуляцию воспалительных и нейроваскулярных путей.

Аннотация

Секвенирование РНК (РНК-секвенирование) широко используется для определения транскрипционных программ, связанных с болезнью, но для обеспечения воспроизводимых сравнений между экспериментальными группами и для обеспечения биологически интерпретируемых результатов необходимы последовательные сквозные рабочие процессы. Здесь представлен полный протокол анализа РНК-секвенции для оценки транскриптомических изменений мозга при экспериментальной церебральной малярии (ЭКМ) и последующего артесунатного лечения с использованием публичного набора данных GSE162535. Рабочий процесс анализирует три группы — контрольный мозг (CB), мозг ECM (MB) и артесунат-обработанный мозг ECM (AB) — начиная с матрицы HTSeq-count. После импорта и форматирования исходных подсчетов протокол формирует набор данных DESeq2 с CB в качестве эталонного уровня, фильтрует гены с низким количеством и осуществляет контроль качества с помощью визуализации размера библиотеки, анализа основных компонентов и кластеризации расстояния выборки. Затем рассчитывается дифференциальная экспрессия для трёх первичных контрастов (MB против CB, AB против MB, AB против CB), с применением лог2-кратного уменьшения для стабильной оценки размера эффекта. Протокол экспортирует полные и значимые таблицы дифференциальной экспрессии, генерирует диаграммы вулканов и диаграммы MA, а также создаёт тепловые карты наиболее вариабельных генов и лучших дифференциально экспрессированных генов по контрасту. Для поддержки механистической интерпретации рабочий процесс включает целевую экстракцию иммунных маркеров (например, цитокины, хемокины, маркеры микроглиальной активации, гены BBB/эндотелии), а также проведение анализов генной онтологии и обогащения KEGG для значительного увеличения и понижения регуляции генов. Этот протокол предоставляет воспроизводимый шаблон для характеристики нейровоспалительных транскрипционных программ, связанных с ЭКМ, и для количественной оценки артесунат-ассоциированной модуляции этих сигнатур.

Введение

Церебральная малярия (КМ) — это угрожающее жизни неврологическое осложнение инфекции Plasmodium falciparum , которое остаётся одним из основных факторов смертности от малярии, несмотря на достижения в ведении случаев. КМ характеризуется острой энцефалопатией, дисфункцией микрососудистой системы, активацией эндотелиума и нарушением гематоэнцефалического барьера (БББ), с нейровоспалением, которое может привести к кому, а у выживших — устойчивыми нейрокогнитивнымипоследствиями 1. Патогенез КМ многофакторен и включает взаимодействие воспалительных реакций хозяина с факторами, происходящими от паразитов и хозяина, на нейроваскулярной границе, что затрудняет выводы причинных механизмов только из клиническихконечных показателей 1.

Экспериментальные модели церебральной малярии (ЭКМ), особенно инфекция Plasmodium berghei ANKA у мышей C57BL/6, предоставляют удобную платформу для изучения специфической иммунопатологии мозга, травмы BBB и нейровоспалительных сигналов в контролируемыхусловиях 2,3. Эти модели использовались для картирования клеточных и молекулярных ответов на разных стадиях заболевания и для тестирования дополнительных вмешательств invivo 2,3. Однако патобиология ЭКМ сложна и очень динамична, и таргетные анализы могут упускать скоординированные сдвиги на уровне путей, которые происходят в различных иммунных и нейроваскулярных программах.

Артесунат является рекомендованной парентеральной терапией первой линии при тяжёлой малярии и продемонстрировал значительную пользу для выживаемости по сравнению с хинином по ключевымдоказательствам 4. Хотя быстрая очистка паразитов играет ключевую роль в эффективности артесунатов, неврологические исходы, вероятно, отражают как уменьшение паразита, так и вторичную модуляцию воспалительных и нейроваскулярныхпутей 1,4. Понимание того, как лечение артемизинином меняет транскрипционные программы мозга во время ЭКМ, может дать механистические инсайты, дополняющие данные о клинической эффективности и выявляющие кандидатные пути для дополнительных нейропротективных стратегий.

РНК-секвенирование (РНК-секвенирование) обеспечивает беспристрастное, общегеномное профилирование транскрипционных ответов при заболеваниях и состояниях лечения, поддерживая дифференциальный анализ экспрессии и интерпретацию функций на последующих этапах. Публичные хранилища, такие как NCBI Gene Expression Omnibus (GEO), предоставляют отобранные наборы данных, подходящие для воспроизводимого повторного анализа, включая GSE162535, содержащий мозг РНК-секвенцию мозга из контрольных мозгов (CB), мозгов ECM (MB) и мозгов с обработкой артесунатом ECM (AB)5. Для поддержки воспроизводимого открытия из таких наборов данных необходимы надёжные статистические рамки для дифференциальной экспрессии на основе подсчёта, а также инструменты обогащения для интерпретации изменений на уровне генов с точки зрения биологических путей и процессов.

В данном исследовании представлен воспроизводимый сквозной процесс анализа РНК-секвенации для групп мозговой ткани между контролем (КБ), экспериментальных групп по церебральной малярии (МБ) и артесунатно-лечённым (AB). Новизна этой статьи заключается в её стандартизированном конвейере на основе DESeq2, включающем заранее определённые биологически значимые контрасты (MB против CB, AB против MB и AB против CB), строгие результаты контроля качества (оценка размера библиотеки, анализ основных компонентов и тепловые карты расстояния выборок), а также интегрированную интерпретацию последующей интерпретации через генную онтологию (GO) и обогащение путей KEGG с помощью clusterProfiler 6,7. Кроме того, рабочий процесс реализует структурированную интерпретацию на основе иммунной панели, что позволяет систематически характеризовать нейровоспалительные и нейроваскулярные транскрипционные реакции. Сочетая статистическую строгость, прозрачность и готовность к публикации результаты, этот протокол предоставляет надёжную и многоразовую основу для анализа транскриптомической дисрегуляции, связанной с ЭКМ, и оценки модуляции, управляемой лечением, в доклинических исследованиях малярии.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

В этом исследовании использовались общедоступные данные RNA-seq и не включали новых экспериментов на людях или животных. Поэтому этическое одобрение и информированное согласие не требовались (Таблица материалов).

1. Подготовьте вычислительную среду и структуру папок

  1. Настройка аппаратного обеспечения и операционной системы
    1. Используйте рабочую станцию или ноутбук с не менее 8 ГБ оперативной памяти (рекомендуется 16 ГБ) и ≥10 ГБ свободного дискового пространства для загрузок и вывода.
    2. Используйте Windows, macOS или Linux с разрешением устанавливать пакеты R и записывать файлы в рабочую директорию.
  2. Установка необходимого программного обеспечения
    1. Установите R (версии 4.2 или выше). Установите RStudio Desktop (рекомендую) для интерактивного запуска рабочего процесса и управления директорией проекта.
  3. Создайте каталог проекта и папки вывода
    1. Создайте новую папку для анализа (например, GSE162535_RNAseq_DESeq2). Установите эту папку как рабочую папку R.
    2. Создайте папки вывода точно следующим образом:
      1. Создайте результаты/. Создайте результаты/рис/. Создавайте результаты/таблицы/.
  4. Установка требуемых пакетов R
    1. Установите пакеты CRAN: tidyverse, pheatmap и RColorBrewer. Установите пакеты Bioconductor: DESeq2, apeglm (опционально), clusterProfiler и org. Mm.eg.db.
    2. Загрузите необходимые пакеты в начале скрипта: DESeq2, tidyverse, pheatmap, RColorBrewer, clusterProfiler, org. Mm.eg.db и ggplot2. Задайте семя для воспроизводимости, запустив set.seed(123).
  5. Применяйте меры по целостности данных и защите конфиденциальности
    1. Храните загруженные файлы только в директории проекта. Ограничить доступ к каталогу проекта, если среда содержит чувствительные или эмбаргованные данные. Записывайте версии программного обеспечения, экспортируя sessionInfo() в результаты/sessionInfo.txt в конце рабочего процесса.
      ПРИМЕЧАНИЕ: Этот протокол выполняет in silico анализ публичных данных подсчёта РНК-секвенсоров и не включает работу с биологическими образцами.

2. Получить матрицу подсчёта РНК-последователей и определить экспериментальные группы

  1. Скачайте файлы набора данных GEO для GSE162535
    1. Скачайте файл HTSeq count for GSE162535 из GEO и сохраните его в каталоге проекта как GSE162535_All.HTSeq.counts.txt.gz. Проверьте целостность файла, убедившись, что файл открывается без ошибок с помощью gzfile() и read.delim().
  2. Загрузите счёты HTSeq в R
    1. Импортируйте сжатую таблицу с помощью read.delim(gzfile(...), header = TRUE, check.names = FALSE, quote = "", comment.char = """). Проверьте импортированный объект с помощью str(), head() и colnames(), чтобы убедиться, что:
      1. Первый столбец содержит идентификаторы генов (например, AccID). Оставшиеся столбцы содержат подсчёты на уровне выборок.
  3. Стандартизировать типы данных и разрешить дублированные идентификаторы генов
    1. Определите столбцы выборки как все столбцы, кроме столбца идентификатора гена (AccID). Заставьте все столбцы выборки отсчитывать целочисленные счёты. Коллапсируйте дублированные идентификаторы генов, суммируя количество в рядах с одним и тем же AccID.
    2. Преобразуйте свернувшуюся таблицу в стандартный кадр данных. Установите имена строк для идентификатора гена и удалите столбец идентификатора из матрицы счёта.
  4. Проверьте структуру матрицы счёта
    1. Убедитесь, что матрица подсчёта содержит 12 столбцов выборок. Убедитесь, что названия примеров столбцов соответствуют формату AB_1..AB_4, CB_1..CB_4 и MB_1.MB_4.
    2. Остановить выполнение, если матрица счёта не содержит 12 столбцов.
  5. Создание и проверка метаданных образца
    1. Создайте образцовую таблицу метаданных (colData), содержащую следующие столбцы:
      1. Пример: уникальные идентификаторы выборки, соответствующие названиям столбцов матрицы счёта. Группа: биологическое состояние, присваиваемое каждому образцу.
    2. Получите соответствующие примеры аннотаций для набора данных GSE162535 из Gene Expression Omnibus (GEO).
    3. Проверьте идентичность каждого образца с помощью информации о доступе GEO и полей аннотации образца, описывающих состояние эксперимента. Сопоставьте каждый идентификатор выборки в матрице подсчёта с его проверенной GEO-аннотацией.
    4. Каждый подтверждённый образец отнесите к одной из следующих групп: контрольный мозг (CB), экспериментальный мозг при церебральной малярии (MB) или экспериментальный мозг, лечённый артесунатом, (AB).
    5. Организуйте таблицу метаданных так, чтобы порядок выборок совпадал с порядком столбцов матрицы счёта.
    6. Сравните идентификаторы выборок в таблице метаданных с матрицей подсчёта для подтверждения соответствия один к одному. Закодировать групповую переменную как фактор с уровнями, упорядочёнными как CB, MB и AB.
    7. Установите CB в качестве эталонного уровня, чтобы определить контрольную группу мозга как исходную точку для дальнейшего дифференциального анализа экспрессии.
    8. Установить имена строк в таблице метаданных равными идентификаторам выборки.
      ПРИМЕЧАНИЕ:Групповые метки не присваивались исключительно по порядку выборок в матрице подсчёта. Идентичности выборок независимо проверялись с использованием метаданных GEO и информации о доступе перед выравниванием с матрицей экспрессии для повышения воспроизводимости и снижения риска ошибочной классификации выборки.

3. Сформировать набор данных DESeq2 и выполнить базовый контроль качества

  1. Прочистить матрицу счёта
    1. Замените недостающие значения в матрице счёта на ноль. Подтвердите отсутствие пропущенных значений с помощью сводок по столбцам is.na().
  2. Создать набор данных DESeq2
    1. Создайте набор данных DESeqDataSet с помощью DESeqDataSetFromMatrix() с: countData = counts; colData = sample_info; дизайн = ~ группа.
  3. Фильтрация генов с низким количеством
    1. Удалять гены с общим количеством <10 по всем образцам, используя dds <- dds[rowSums(counts(dds)) >= 10, ]. Запишите количество сохранившихся генов, напечатав сводку объекта.
  4. Оценка размеров библиотек
    1. Вычислите размеры библиотек как столбцовские суммы отфильтрованной матрицы счёта. Сгенерируйте барплот размером библиотеки и сохраните его как результаты/рисок/library_sizes.pdf.
    2. Изучите график размера библиотеки и убедитесь, что ни одна выборка не имеет экстремальной глубины секвенирования, несовместимую с дизайном исследования.

4. Запустить DESeq2 и сгенерировать объекты трансформации для визуализации

  1. Подходите к модели DESeq2
    1. Запускайте моделирование дифференциальных выражений с использованием dds <- DESeq(dds). Сохраняйте объект приспособленного DDS для всех последующих результатов извлечения.
  2. Создание преобразованных экспрессионных матриц
    1. Вычислите регуляризованное преобразование логарифма с помощью rld <- rlog(dds, blind = FALSE). Вычислите преобразование, стабилизирующее дисперсию, используя vsd <- vst(dds, blind = FALSE). Используйте rld и vsd для PCA, кластеризации и тепловых карт.
      ПРИМЕЧАНИЕ: Используйте слепое = ЛОЖНОЕ для сохранения структуры дисперсии, зависящей от группы.

5. Выполнение глобального контроля качества с использованием PCA и кластеризации расстояния между образцами

  1. Генерируя анализ главных компонент (PCA)
    1. Вычислите PCA с помощью plotPCA(rld, intgroup = «группа», returnData = TRUE). Процентная дисперсия экстракта объясняется для PC1 и PC2. Постройте PC1 и PC2 с помощью ggplot2, маркируя точки по названию образца и раскрашивая по группе.
    2. Сохраните график PCA как результаты/рисок/PCA_samples.pdf. Подтвердите, что биологические реплицируются по группам и что ни один образец не выделяется как исключение.
  2. Сгенерируйте тепловую карту выборочного расстояния
    1. Вычислите парные расстояния выборки с помощью dist(t(assay(vsd))). Преобразите объект расстояния в матрицу для визуализации. Создайте таблицу аннотации столбцов, содержащую фактор группы для каждого выборка.
    2. Постройте матрицу расстояний с помощью pheatmap() и сохраните как результаты/рисок/sample_distance_heatmap.pdf. Подтвердите, что выборки группируются преимущественно по группам.

6. Вычислить дифференциальное выражение для трёх первичных контрастов

  1. Определите контрасты
    1. Определите эффект заболевания как ЭКМ против контроля: MB против CB. Определите эффект лечения внутри ЭКМ как артесунат, обработанный артесунатом, против ЭКМ: AB против MB. Определите лечение и базовое состояние как артесунат, обработанное и контролируемое лечение: AB против CB.
  2. Извлечение результатов DESeq2 с усадкой при изменении fold log2
    1. Извлекайте исходные результаты для каждого контраста с помощью результатов (dds, contrast = c("группа", groupA, groupB)). Уменьшение log2 fold с помощью lfcShrink(dds, contrast = c("группа", groupA, groupB), res = res, type = "нормальный").
    2. Преобразуйте результаты в кадр данных и храните идентификатор гена в виде столбца с названием gene_id. Упорядочивайте результаты по номинальному p-значению для стабильной отчетности.
    3. Сохраняйте каждую полную таблицу результатов в результаты/таблицы/ как:
      1. DESeq2_MB_vs_CB_all_genes.csv, DESeq2_AB_vs_MB_all_genes.csv, DESeq2_AB_vs_CB_all_genes.csv
        ПРИМЕЧАНИЕ: Если усадка не удаётся из-за конфигурации пакета, перезапускайте с альтернативным типом усадки, поддерживаемым в локальной установке.
  3. Определить пороги значимости и экспортировать значимые наборы генов
    1. Определите дифференциально экспрессированные гены (DEG) с помощью скорректированного p-значения (FDR) < 0,05 и абсолютного логарифмического изменения ≥ 1. Фильтруйте каждый контраст, чтобы исключить гены с отсутствующими скорректированными p-значениями.
    2. Экспортировать значимые таблицы DEG в: результаты/таблицы/DESeq2_MB_vs_CB_sig.csv, результаты/таблицы/DESeq2_AB_vs_MB_sig.csv, результаты/таблицы/DESeq2_AB_vs_CB_sig.csv
  4. Суммировать количество DEG на контраст
    1. Вычислите количество значимых генов на один контраст. Сохраните таблицу сводок как результаты/таблицы/DE_summary_counts.csv.

7. Генерируйте вулканические графики для каждого контраста.

  1. Создайте функцию графика вулкана.
    1. Вычислите -log10 (скорректированное p-значение) для каждого гена. Классифицировать каждый ген как Up, Down или Not Significant по пороговым значениям: FDR < 0,05 и |log2FC| ≥ 1.
    2. Постройте log2FC (ось x) против -log10(FDR) (ось y) с использованием ggplot2. Добавьте пунктирные пороговые линии при log2FC = ±1 и -log10(0.05).
  2. Экспортные участки вулканов
    1. Сохраните каждый график в PDF в результатах/рис/: volcano_MB_vs_CB.pdf, volcano_AB_vs_MB.pdf, volcano_AB_vs_CB.pdf.
      ПРИМЕЧАНИЕ: Используйте согласованные ограничения осей по контрастам для визуального сравнения между фигурами.

8. Генерируйте графики MA для каждого контраста

  1. Экспорт графиков MA в один PDF.
    1. Откройте PDF-устройство с именем results/fig/MA_plots.pdf. Постройте графики MA для каждого исходного объекта результата DESeq2 с помощью plotMA(). Обозначьте каждый участок названием Contrast. Закройте PDF-устройство.

9. Создать тепловые карты экспрессии для глобальной изменчивости и контрастно-специфических генов DE.

  1. Нанесите верхние переменные гены по всем образцам.
    1. Вычислите дисперсию по строкам по образцам из матрицы vsd. Выберите топ-100 самых вариативных генов. Среднецентризируйте каждый ген по образцам.
    2. Сгенерируйте тепловую карту с помощью pheatmap() с аннотациями выборочных групп. Сохраните фигуру как результаты/рисок/heatmap_top100_variable_genes.pdf.
  2. Постройте график наиболее дифференциально экспрессируемых генов для каждого контраста.
    1. Выберите топ-50 генов по скорректированному p-значению для каждого контраста. Извлеките их экспрессионную матрицу VSD и средний центр по гену. Сгенерируйте тепловую карту для каждого контраста и сохраните её как:
    2. Результаты/рис/heatmap_top50_MB_vs_CB.pdf, результаты/рис/heatmap_top50_AB_vs_MB.pdf, результаты/рис/heatmap_top50_AB_vs_CB.pdf
      ПРИМЕЧАНИЕ: Увеличить ширину и высоту PDF, если включены метки строк.

10. Проведите целенаправленный анализ иммунных маркеров.

  1. Суммировать выбранные иммунные гены по контрастам.
    1. Определите набор иммунных маркеров: Il6, Il1b, Il10, Tnf, Ifng, Il21 и Icam1. Извлеките log2FC, p-значение и скорректированное p-значение для этих генов из каждой таблицы контрастных результатов.
    2. Объедините три контрастных резюме по идентификатору гена. Сохраните объединённую таблицу как результаты/таблицы/immune_genes_summary.csv.
  2. Создайте тепловую карту иммунного маркера (rlog).
    1. Идентифицировать иммунные гены, присутствующие в трансформированной анализной матрице. Извлеките матрицу выражения rlog для существующих иммунных генов.
    2. Экспрессия среднего центра по гену. Сгенерируйте и сохраните тепловую карту в результаты/рис/heatmap_immune_genes.pdf.

11. Проведение расширенного анализа иммунной панели по функциональным категориям

  1. Определите иммунные панели.
    1. Определите панели иммунных маркеров по категориям, включая: провоспалительные цитокины и гены реакции интерферона, противовоспалительные и регуляторные гены, хемокины, микроглиальные активационные маркеры, астроцитные маркеры, BBB и эндотелиальные активации, Т-клеточные маркеры и маркеры истощения, маркеры моноцитов/макрофагов, гены путей комплемента, а также гены окислительного стресса и клеточной гибели.
  2. Извлеките результаты иммунной панели DE для каждого контраста.
    1. Создайте таблицу отображения из символов генов в иммунные категории. Фильтруйте каждую таблицу результатов контраста по генам иммунной панели. Присоедините отображение категорий к каждой отфильтрованной таблице результатов.
    2. Объедините три контрастно-специфические иммунные таблицы в одну таблицу. Сохраните объединённую таблицу как результаты/таблицы/immune_panels_DE_all_contrasts.csv. Сгенерировать классифицированную тепловую карту экспрессии иммунной панели.
    3. Идентифицировать гены иммунной панели, присутствующие в матриксе RLD-анализа. Добавьте метки категорий к названиям строк, чтобы сохранить классификацию панелей на рисунке. Постройте тепловую карту rlog с аннотациями примеров групп.
  3. Сохраняйте выходы.
    1. Сохранить как: results/fig/heatmap_immune_panels_all.pdf, results/fig/heatmap_immune_panels_all.png

12. Создание участков вулканов с иммунным наложением

  1. Создайте участки вулканов с иммунным наложением.
    1. Отмечайте гены как иммунные или неиммунные, объединяя отображение иммунной панели с каждой таблицей результатов контраста. Все неиммунные гены отображают как серые точки на фоне. Разместите иммунные гены, окрашенные по иммунной категории, на переднем плане. Добавьте пороговые линии при log2FC = ±1 и -log10(0.05).
  2. Экспортные участки вулканов с иммунным наложением.
    1. Сохраняйте участки вулканов с иммунным наложением MB и CB следующим образом:
      1. Результаты/рис/volcano_MB_vs_CB_immune_overlay.pdf
      2. Результаты/рис/volcano_MB_vs_CB_immune_overlay.png
    2. Сохраняйте графики вулканов с иммунным наложением AB и MB как:
      1. Результаты/рис/volcano_AB_vs_MB_immune_overlay.pdf
      2. Результаты/рис/volcano_AB_vs_MB_immune_overlay.png
        ПРИМЕЧАНИЕ: Курированные панели иммунных генов были заранее определены и сгруппированы по функциональным категориям; полный список символов генов с аннотациями приведён в дополнительной таблице S1. Эта таблица обеспечивает прозрачность и воспроизводимость, позволяя прямое повторно использовать и валидировать анализы на основе панелей во всех исследованиях.

13. Провести функциональный анализ обогащения (GO и KEGG)

  1. Определите генные наборы для обогащения
    1. Для каждого контраста (MB против CB и AB против MB) выделяйте значительно дифференцированно экспрессированные гены (DEGs) с использованием скорректированного порога p-значения < 0,05 и абсолютного порога логарифм₂ fold-change ≥ 1.
    2. Разделите ДЭГы на повышенную регуляцию генов (log₂FC > 0) и пониженные гены (log₂FC < 0).
  2. Определите фоновый (вселенный) генный набор
    1. Используйте все гены, оставшиеся после фильтрации подсчёта в наборе данных DESeq2, как фоновую вселенную. Извлечь символы генов из фильтрованного объекта DESeq2. Преобразовать фоновые генные символы в идентификаторы Entrez с помощью функции bitr() с org. Mm.eg.db.
      ПРИМЕЧАНИЕ: Использование единого фонового набора генов обеспечивает беспристрастные результаты обогащения.
  3. Идентификаторы генов карты для обогащения
    1. Преобразовать генные символы каждого набора DEG в идентификаторы Entrez с помощью bitr(). Сохраняйте только успешно картированные гены для обогащения KEGG. Пропускать анализ обогащения для набора генов, если ни один ген не был успешно картирован.
      ПРИМЕЧАНИЕ: Обогащение генной онтологии (GO) использует символы генов, тогда как обогащение KEGG требует идентификаторов Entrez.
  4. Обогащение генной онтологии (GO) (биологический процесс)
    1. Запускайте обогащение GO с помощью enrichGO() с OrgDb = org. Mm.eg.db. Set keyType = «SYMBOL» и онтология (ont) = «BP». Закажите вселенную как все отфильтрованные генные символы из набора данных DESeq2.
    2. Используйте pAdjustMethod = «BH» для коррекции с множественным тестированием. Примените пороги значимости pvalueCutoff = 0.05 и qvalueCutoff = 0.05. Ограничить размеры наборов генов с помощью minGSSize = 10 и maxGSSize = 500.
    3. Экспортируйте результаты обогащения GO в результаты/таблицы/каталог. Генерируйте бар-графики с топовыми обогащёнными терминами GO и сохраняйте в результаты/рис.
  5. Выполните обогащение пути KEGG
    1. Проведите обогащение KEGG с помощью enrichKEGG() с организмом = "mmu". Предоставить идентификаторы Entrez наборов DEG как входных генов. Используйте отображённый фон Entrez как вселенную.
    2. Применить pAdjustMethod = «BH». Используйте пороги значимости pvalueCutoff = 0.05 и qvalueCutoff = 0.05. Ограничить размеры наборов генов с помощью minGSSize = 10 и maxGSSize = 500.
    3. Экспортировать таблицы обогащения KEGG в результаты/таблицы/. Генерируйте бар-графики обогащённых путей KEGG и сохраняйте в результаты/рис.
      ПРИМЕЧАНИЕ: Обогащение KEGG может не дать результатов, если картирование генов недостаточно; Такие случаи решаются без прерывания рабочего процесса.

14. Проведение анализа обогащения только иммунитета (необязательный модуль)

  1. Конструировать иммунноспецифические генные наборы
    1. Определите гены иммунной панели на основе кураторских функциональных категорий. Пересечение DEG с генами иммунной панели. Разделите иммунноспецифические ДЭГГ на апрегуляционные и пониженные наборы для каждого контраста.
  2. Проведите обогащение иммунноспецифических генетических наборов.
    1. Применяйте те же процедуры обогащения GO и KEGG, описанные в разделе 13. Используйте одинаковые настройки фоновой вселенной и параметров. Сохраняйте выходные данные с использованием имён файлов с меткой «иммунный», чтобы отличить их от глобальных результатов обогащения.

15. Генерировать точечные графики обогащения (дополнительный модуль)

  1. Результаты обогащения нагрузки.
    1. Импортируйте таблицы обогащения GO или KEGG из результатов/таблиц/каталога.
  2. Трансформируйте метрики обогащения.
    1. Преобразовать значения GeneRatio из дробного формата (x/y) в числовые отношения. Вычислите −log₁₀(скорректированные p-значения) для визуализации.
  3. Генерируйте точечные диаграммы.
    1. Постройте соотношение генов по оси x и обогащённые описания терминов по оси y. Размер точки масштаба по количеству генов и цвет по −log₁₀ (скорректированное p-значение).
    2. Выбирайте лучшие обогатённые термины на основе скорректированного рейтинга p-значения. Сохраняйте точечные диаграммы в формате PDF и PNG в каталоге результатов/рисунок/файлов.

16. Сохранить информацию о сессии и завершить запуск

  1. Экспортировать информацию о сессии.
    1. Сохранить выход sessionInfo() в results/sessionInfo.txt в документирование версии R и версий пакета.
  2. Подтвердить успешное завершение
    1. Убедитесь, что рабочий процесс сгенерировал: Рисунки в результатах/рис/, таблицы в результатах/таблицах/.
    2. Подтвердите, что три выхода первичного контраста существуют и не пустые: DESeq2_MB_vs_CB_all_genes.csv, DESeq2_AB_vs_MB_all_genes.csv, DESeq2_AB_vs_CB_all_genes.csv

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Оценка качества данных и глобальная транскриптомическая структура

Данные РНК-секвенции из 12 образцов мозга (CB, MB, AB; n = 4 на группу) были обработаны с использованием стандартизированного рабочего процесса. После фильтрации малочисленных генов (≥10 всего подсчетов) набор данных сохранялся для дальнейших анализов. Анализ основных компонентов (PCA) rlog-трансформированных подсчетов продемонстрировал разделение выборок по экспериментальным гр...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

В данном исследовании представлен воспроизводимый рабочий процесс на основе DESeq2 для анализа объёмных данных РНК-секвенции между заранее определёнными биологическими контрастами. Протокол интегрирует стандартизированную предобработку, проверенное назначение метаданных, нормализацию, дифференциальное тестирование экспрессии и структурированные выходные данные, обеспечивая последовательную и прозрачную генерацию транскриптомических результатов. Чётко определяя аналитические шаги и параме...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

У авторов нет конкурирующих интересов.

Благодарности

Авторы не имеют признаний.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
clusterProfiler (пакет R)BioconductorRRID:SCR_016884Функциональный анализ обогащения (GO и пути KEGG)
DESeq2 (пакет R)BioconductorRRID:SCR_015687Анализ дифференциальной экспрессии данных RNA-seq на основе подсчета
ggplot2 (пакет R)CRANRRID:SCR_014601Визуализация графиков PCA, вулканических графиков и сводных фигур
GitHub (по желанию)GitHub Inc.RRID:SCR_002630Управление версиями и обмен воспроизводимыми сценариями
HTSeq-count RNA-seq набор данных (GSE162535)NCBI Gene Expression Omnibus (GEO)RRID:SCR_005012Матрица подсчета массового RNA-seq, используемая в качестве входных данных для анализа
matrixStats (пакет R)CRANRRID:SCR_016361Эффективное вычисление строковых/столбцовых статистик (например, дисперсия)
openxlsx (пакет R)CRANRRID:SCR_019215Экспорт таблиц с результатами в формат Excel
Операционная системаMicrosoft / Apple / LinuxN/AПоддержка Windows 10+, macOS или Linux
org.Mm.eg.db (пакет R)BioconductorRRID:SCR_002815База данных аннотации генов мыши для сопоставления идентификаторов генов
Просмотрщик PDFЛюбойN/AПросмотр выходных графиков (PCA, тепловые карты, вулканических графиков)
Персональный компьютер или рабочая станцияЛюбойN/AРекомендуется минимум 16 ГБ оперативной памяти для анализа RNA-seq
pheatmap (пакет R)CRANRRID:SCR_016418Тепловая визуализация экспрессии генов и кластеризации
R Statistical Software (версия ≥ 4.2)R Foundation for Statistical ComputingRRID:SCR_001905Основная вычислительная среда для всех анализов RNA-seq
RColorBrewer (пакет R)CRANRRID:SCR_015742Цветовые палитры для тепловых карт и графиков
RStudio DesktopPosit SoftwareRRID:SCR_000432Интегрированная среда разработки (IDE) для сценариев и воспроизводимости
Файл метаданных образца (формат CSV)Создано / аннотации GEON/AРазработанная аннотация образцов, связывающая образцы с группами CB, MB и AB
stringr (пакет R)CRANRRID:SCR_019195Обработка строк для визуализации и форматирования обогащения
tibble (пакет R)CRANRRID:SCR_019186Обработка структур данных и упорядоченных данных
tidyverse (набор пакетов R)CRANRRID:SCR_019186Манипуляция данными, преобразование и визуализация

Ссылки

  1. Storm J, Craig AG. Pathogenesis of cerebral malaria—inflammation and cytoadherence. Front Cell Infect Microbiol. 2014;4:100.
  2. Hinduja S, Kunieda M. Modelling of ECM and EDM processes. CIRP Annals. 2013 Jan 1;62(2):775–97.
  3. Soares SMA, Gualberto ACM, da Costa AC, Gonçalves DA, Gameiro J. A high-fat diet protects C57BL/6 mice from Plasmodium berghei ANKA infection in an experimental malaria study. Front Trop Dis. 2023;4:1188902.
  4. Manzoni G, Try R, Guintran JO, Christiansen-Jucht C, Jacoby E, Sovannaroth S, Zhang Z, Banouvong V, Shortus MS, Reyburn R, Chanthavisouk C. Progress towards malaria elimination in the Greater Mekong Subregion: perspectives from the World Health Organization. Malaria Journal. 2024 Mar 1;23(1):64.
  5. Wang Q, Tang Y, Pan Z, Yuan Y, Zou Y, Zhang H, et al. RNA-seq-based transcriptome analysis of the anti-inflammatory effect of artesunate in early treatment of a mouse cerebral malaria model. Mol Omics. 2022;18(8):716–30.
  6. Love MI, Huber W, Anders S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 2014;15(12):550.
  7. Anders S, Huber W. Differential expression analysis for sequence count data. Genome Biol. 2010;11(10):R106.
  8. Robinson MD, McCarthy DJ, Smyth GK. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data. bioinformatics. 2010 Jan 1;26(1):139-40.
  9. McCarthy DJ, Chen Y, Smyth GK. Differential expression analysis of multifactor RNA-Seq experiments with respect to biological variation. Nucleic Acids Res. 2012;40(10):4288–97.
  10. Conesa A, Madrigal P, Tarazona S, Gomez-Cabrero D, Cervera A, McPherson A, et al. A survey of best practices for RNA-seq data analysis. Genome Biol. 2016;17:13.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–7.
  12. Hänzelmann S, Castelo R, Guinney J. GSVA: gene set variation analysis for microarray and RNA-seq data. BMC Bioinformatics. 2013 Jan 16;14(1):7.
  13. Shen-Orr SS, Gaujoux R. Computational deconvolution: extracting cell type–specific information from heterogeneous samples. Curr Opin Immunol. 2013;25(5):571–8.
  14. Subramanian A, Tamayo P, Mootha VK, Mukherjee S, Ebert BL, Gillette MA, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545–50.
  15. Stark R, Grzelak M, Hadfield J. RNA sequencing: the teenage years. Nat Rev Genet. 2019;20(11):631–56.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

Иммунология и инфекциивыпуск 233выпуск 233пустое значениевыпусксеквенирование всего транскриптома (bulk RNA sequencing)транскриптомный анализнейровоспалениетерапия артесунатомдифференциальная экспрессия геновпрофилирование иммунных путей

Эта статья была опубликована

Видео скоро будет доступно