Для просмотра этого контента требуется подписка на JoVE. Войдите или начните свой бесплатный пробный период.

Методическая статья

Воспроизводимый протокол на основе Сёра для анализа секвенирования одноклеточной РНК периферических мононуклеарных клеток CD4+ Т-клеток во время повторного заражения малярией

106 просмотров

DOI:

10.3791/70858

31 июля 2026 г.

В этой статье

Краткое содержание

Здесь мы представляем воспроизводимый протокол на базе Сёра для анализа данных секвенирования одноклеточной РНК из периферических мононуклеарных клеток CD4⁺ Т-клеток с целью характеристики транскрипционной гетерогенности и функциональных иммунных программ во время повторного заражения малярией. Этот протокол обеспечивает последовательную идентификацию, сравнение и биологическую интерпретацию динамических состояний CD4⁺ Т-клеток и иммунных ответов в разных состояниях.

Аннотация

Здесь мы представляем воспроизводимый протокол на базе Seurat для анализа данных секвенирования одноклеточной РНК PBMC CD4⁺ T-клеток в разных временных точках реинфекции малярией. Этот протокол демонстрирует воспроизводимый рабочий процесс на базе Seurat для анализа данных PBMC CD4⁺ scRNA-seq Т-клеток по разным временным периодам реинфекции малярией, используя репрезентативные общедоступные наборы данных для демонстрации его применения: специфический для Plasmodium TCR-трансгенный набор данных CD4⁺ T-клеток (GSE233703) и поликлональный набор данных CD4⁺ T-клеток, сравнивающий временные точки, связанные с повторной инфекцией (GSE233713; D27₍₃₎ против D30). Рабочий процесс включает стандартизированную предобработку, интеграцию, кластеризацию и последующий транскриптомический анализ в рамках единой вычислительной структуры. Метод позволяет систематически вычислять баллы модулей для заранее определённых иммунных и CD4⁺ Т-клеточных программ, выявлять кластерно-специфические маркерные гены, анализировать дифференциальную экспрессию с временным разрешением, а также последующий анализ генной онтологии и обогащения путей KEGG. Применение этого рабочего процесса выявляет различные функциональные состояния CD4⁺ Т-клеток и выявляет динамические транскрипционные изменения между временными точками повторного заражения малярией. Протокол генерирует стандартизированные визуализационные выводы и табульированные результаты, а также предоставляет практические рекомендации по выбору параметров и устранению неполадок, обеспечивая последовательный и воспроизводимый анализ наборов данных CD4⁺ scRNA-seq T-клеток в малярии и связанных иммунологических контекстах. Этот протокол позволяет воспроизводимый и биологически интерпретируемый анализ иммунных ответов и может применяться к аналогичным наборам данных о отдельных клетках в иммунологических исследованиях.

Введение

Малярия остаётся серьёзной глобальной нагрузкой для здоровья, при этом повторяющиеся инфекции формируют иммунитет хозяина сложными и неполностью понятымиспособами: 1. Т-клетки CD4⁺ играют центральную роль в противомалярийных иммунных ответах, координируя производство эффекторных цитокинов, поддерживая помощь B-клеток и регулируявоспаление 2,3. Во время повторного заражения малярией Т-клетки CD4⁺ подвергаются динамическому транскрипционному перепрограммированию, отражая сдвиги между эффекторными, регуляторными, памятью, пролиферативными и истощёнными состояниями, влияющими как на контроль паразитов, так и на иммунопатологию 4,5. Точное определение этой гетерогенности важно для понимания иммунной защиты, иммунной дисфункции и прочности естественно приобретённого или вакцинированного иммунитета к инфекции Plasmodium. Здесь мы представляем воспроизводимый протокол на основе Сёра для анализа данных CD4⁺ Т-клеток scRNA-seq в разных временных точках реинфекции малярией.

Секвенирование одноклеточной РНК (scRNA-seq) позволяет высокоразрешающе характеризуть иммунную гетерогенность и выявило чувствительные к паразитам подгруппы CD4⁺ Т-клеток, программы истощения и регуляторные сети прималярии 6,7,8,9. Однако аналитическая вариабельность в контроле качества, нормализации, кластеризации и интеграции может ограничивать воспроизводимость и усложнять сравнения междуисследованиями 10,11. Однако отсутствует стандартизированный и биологически управляемый рабочий процесс, специально оптимизированный для анализа динамики CD4⁺ Т-клеток во время повторного заражения малярией.

Существующие вычислительные рамки для анализа scRNA-seq, включая Seurat и Scanpy, предоставляют комплексные наборы инструментов для предварительной обработки, кластеризации и последующего интерпретирования одноячейковых данных 12,13,14. Seurat, реализованный в R, предлагает тесно интегрированные рабочие процессы для нормализации, интеграции данных и визуализации, включая подходы стабилизации дисперсии, такие как SCTransform, которые улучшают обнаружение сигналов в гетерогенных иммунных наборахданных 13. Scanpy, реализованный на Python, предоставляет масштабируемые решения, оптимизированные для больших наборов данных и эффективное использование памяти, что делает его особенно подходящим для высокопроизводительных или облачных анализов12, 14. Несмотря на эти достижения, остаётся необходимость в стандартизированных, воспроизводимых рабочих процессах, которые явно решают биологические вопросы в условиях заражения, сохраняя при этом прозрачность, адаптивность и согласованность между наборами данных. Настоящий протокол устраняет этот разрыв, сочетая устойчивость предварительной обработки на основе Сёра со структурированной биологической интерпретацией, адаптированной к ответам CD4⁺ Т-клеток во время повторного заражения малярией. По сравнению с существующими рабочими процессами общего назначения, этот протокол делает акцент на воспроизводимости, биологически обоснованном выборе параметров и последовательном анализе между временными точками, адаптированном к моделям инфекции.

Ключевой особенностью этого протокола является акцент на воспроизводимости и практической удобстве. Пороги контроля качества не являются фиксированными, а определяются с помощью адаптивных к данным подходов на основе медианного абсолютного отклонения, что позволяет масштабировать пороги сложности транскриптов, глубине секвенирования и содержания митохондрий с учетом специфических распределений набора данных. Такая конструкция делает рабочий процесс применимым к наборам данных разного размера, обычно от нескольких тысяч до десятков тысяч ячеек, и на широком диапазоне глубин секвенирования, часто встречающихся в экспериментах с scRNA-seq на основе капель. Руководство, встроенное в рабочий процесс, поддерживает правильный выбор параметров для уменьшения размерности, разрешения кластеризации и интеграции, обеспечивая биологическую значимость анализа и техническую устойчивость. Тем не менее, рабочий процесс зависит от качества данных и глубины секвенирования и может потребовать корректировки для наборов данных с экстремальной разрежённостью или эффектами пакетного распределения.

Этот протокол предназначен для пользователей среднего и продвинутого, обладающих базовыми знаниями в анализе R и отдельных ячейках, при этом оставаясь доступным для мотивированных новичков благодаря структурированной, поэтапной реализации и полностью воспроизводимым результатам. Рабочий процесс генерирует стандартизированные таблицы и цифры на каждом этапе, включая сводки по контролю качества, результаты кластеризации, результаты дифференциального выражения и анализ обогащения, что способствует прозрачности, валидации и повторному использованию в совместных или многоисследовательских контекстах. Этот протокол особенно подходит для исследований, изучающих иммунную гетерогенность между временными точками или условиями в исследованиях инфекций и иммунологии.

Метод обеспечивает воспроизводимый сквозный рабочий процесс на основе Сёра для анализа scRNA-seq CD4⁺ на разных этапах повторного заражения малярией. Он интегрирует адаптивный контроль качества, стабилизацию дисперсии, уменьшение размеров, кластеризацию и многообразную интеграцию принеобходимости 13,15. Для повышения биологической интерпретируемости рабочий процесс включает оценку модулей генов иммунных и CD4⁺ подмножества Т-клеток для количественной оценки функциональных программ, включая Th1, Tfh, Tr1, Treg, центральную память, память эффекторов, пролиферацию, цитотоксичность иистощение 16,17,18. Для поддержки надёжной аннотации и сравнения состояний Т-клеток включены идентификация комплементарных кластерных маркеров, анализ дифференциальной экспрессии по временным точкам и обогащение путей с использованием баз данных генной онтологии и KEGG. Хотя протокол был продемонстрирован на использовании общедоступных наборов данных Plasmodium scRNA-seq, он широко применим к другим моделям реинфекции малярии и иммунологическим нарушениям, где требуется воспроизводимый и интерпретируемый одноклеточный анализ CD4⁺ Т-клеток. В целом, этот протокол обеспечивает воспроизводимую и биологически интерпретируемую основу для одноклеточного анализа ответов CD4⁺ Т-клеток, поддерживая надёжное исследование иммунной динамики при малярии и связанных с ней системах.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Этическое заявление:

Все данные, использованные в этом исследовании, были получены из общедоступных наборов данных (GSE233703 и GSE233713). Первоначальные исследования соответствовали институциональным и этическим рекомендациям по проведению экспериментов на животных. Это исследование включало вторичный биоинформатический анализ общедоступных и деидентифицированных наборов данных секвенирования отдельных клеток РНК, полученных из репозитория Gene Expression Omnibus (GEO) (GSE233703 и GSE233713). В этом исследовании не участвовали новые человеческие участники, клинические образцы или идентифицируемая информация о пациентах. Согласно институциональным и национальным рекомендациям по исследованиям, связанным с публично доступными анонимизированными наборами данных, дополнительное этическое одобрение и информированное согласие не требовались для такого биоинформатического анализа. Оригинальные исследования, связанные с этическими наборами данных, проводились в соответствии с соответствующими институциональными этическими стандартами и применимыми руководящими принципами для биомедицинских исследований.

1. Воспроизводимый рабочий процесс анализа CD4⁺ T-клеток scRNA-seq на основе Seurat для GSE233703 и GSE233713

ПРИМЕЧАНИЕ: Этот рабочий процесс предоставлен как дополнительный файл S1. Также обратитесь к схеме, которая даёт обзор всего рабочего процесса (рисунок 1).

  1. Определите область действия и целенаправленных пользователей перед началом протокола
  2. Определите целевых пользователей
    1. Используйте этот протокол, если пользователь обладает промежуточным или продвинутым уровнем знакомства с анализом секвенирования R-клеточных РНК (scRNA-seq).
    2. Примените этот рабочий процесс к наборам данных CD4⁺ T-клеток селезёнки мышиной селезёнки, сгенерированных в матричном формате 10x. Используйте пошаговую структуру и ожидаемые выходы для проверки каждого этапа перед продолжением.
      ПРИМЕЧАНИЕ: Обеспечьте соответствующие практики обработки данных и безопасное хранение при работе с большими секвенирующими наборами данных.
  3. Определим scRNA-seq
    1. Рассматривайте секвенирование одноклеточной РНК (scRNA-seq) как транскриптомический метод²¹, который количественно оценивает экспрессию генов в отдельных клетках.
    2. Используйте scRNA-seq для выявления дискретных клеточных состояний, переходных популяций и гетерогенных иммунных программ внутри сложных тканей.
  4. Подготовьте программное обеспечение и требования к пакетам
  5. Установка основного программного обеспечения
    1. Установите R 4.2 или выше.
    2. Откройте интерфейс RStudio. Задайте рабочий каталог с помощью setwd().
    3. Выполняйте скрипты последовательно с помощью функции source(). Запишите точные версии R, RStudio и операционной системы в заметках к проекту.
  6. Установка пакетов R
    1. Установите необходимые пакеты CRAN: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi и ggplot2.
    2. Установите необходимые пакеты Bioconductor: clusterProfiler, org. Mm.eg.db, enrichplot и DESeq2.
    3. Устанавливайте дополнительные пакеты только при необходимости: DoubletFinder для удаления дублетов и monocle3 для анализа траектории. Загрузите все необходимые пакеты в начале сессии анализа.
  7. Версии пластинок
    1. Сохраняйте информацию о пакете и сессии в конце рабочего процесса, используя sessionInfo() или аналогичную функцию.
    2. В рукописи явно указываются ключевые компоненты анализа, включая версию R, версию Seurat, версию DESeq2 и версию clusterProfiler.
  8. Запустите примеры команд установки, упомянутые в дополнительном файле 2
  9. Подтвердите требования к аппаратному обеспечению и хранилищу
  10. Подтвердите минимальные ресурсы
    1. Используйте рабочую станцию с не менее 16 ГБ оперативной памяти, 4 ядрами процессора и 20 ГБ свободного дискового пространства для рутинного анализа наборов данных, содержащих от нескольких тысяч до десятков тысяч ячеек.
  11. Подтвердите рекомендуемые ресурсы
    1. Используйте 32 ГБ и более оперативной памяти для интегрированного анализа, повторного построения графиков или опционального обнаружения дублетов.
    2. Увеличивайте future.globals.maxSize, если крупные объекты или интегрированные наборы данных создают ошибки, связанные с памятью.
    3. Применить пример настройки памяти
  12. Выполните следующие команды для настройки параметров памяти, указанных в дополнительном файле 2

2. Создайте структуру проекта

  1. Создайте корневую директорию проекта
    1. Создайте каталог проектов для анализа.
    2. Создайте подкаталоги с названиями data/, scripts/ и results_spleen_cd4/.
  2. Используйте стандартизированную структуру вывода
    1. Убедитесь, что рабочий процесс записывает результаты в следующие каталоги:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/tables/
      results_spleen_cd4/GSE233703/rds/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/tables/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. Используйте согласованное имя файлов
    1. Переименуйте входные файлы GEO, чтобы они соответствовали траекториям, ожидаемым скриптом.
    2. Используйте следующие точные имена файлов:
      data/GSE233703_matrix.mtx.gz
      data/GSE233703_genes.tsv.gz
      data/GSE233703_barcodes.tsv.gz
      data/GSE233713_d27_3_matrix.mtx.gz
      data/GSE233713_d27_3_features.tsv.gz
      data/GSE233713_d27_3_barcodes.tsv.gz
      data/GSE233713_d30_matrix.mtx.gz
      data/GSE233713_d30_features.tsv.gz
      data/GSE233713_d30_barcodes.tsv.gz
    3. Имя необязательных метаданных файлов метаданных следующим образом:
      data/GSE233703_cell_metadata.csv
      data/GSE233713_cell_metadata.csv
  4. Подтверждение требований к метаданным
    1. Убедитесь, что в каждом файле метаданных есть столбец штрихкода. Добавляйте опциональные столбцы, такие как sample, timepoint, и репликуйте, когда доступны.
    2. Используйте точные совпадения штрихкодов между метаданными и матрицами счёта.
      Внимание: перед началом импорта убедитесь, что матричные триплеты и файлы метаданных существуют на ожидаемых путях.

3. Импорт матриц счёта и проверка целостности входных данных

  1. Читайте матрицы в стиле 10x
    1. Читайте каждый matrix.mtx.gz файл как разрежённую матрицу.
    2. Читайте соответствующие файлы признаков (или генов) и файл штрихкодов в виде таблиц с разделением по табуляциям.
    3. Назначайте генные символы матричным строкам с помощью второго столбца файла признаков, когда они доступны. Привязать уникальные символы генов с помощью make.unique().
    4. Присваивать идентификаторы штрихкодов столбцам матрицы.»
  2. Запустить пример функции импорта
    1. Выполните код, указанный в дополнительном файле 2, чтобы импортировать матрицу и назначить идентификаторы.
  3. Проверка целостности матрицы
    1. Проверьте, что количество матричных строк равно числу признаков. Проверьте, что количество столбцов матрицы равно числу штрихкодов.
    2. Остановите рабочий процесс, если обнаружено несоответствие.
      ПРИМЕЧАНИЕ: Если обнаружены несоответствия, проверьте целостность файла и правильно выравнивайте файлы функций и штрихкодов перед повторным запуском шага.
      Контрольная точка: Продолжайте только если количество строк совпадает с признаками, а столбцы — штрих-коды.

4. Определить панели маркеров и модулей

  1. Определите панели CD4⁺ T-клеток, релевантные для малярии
    1. Определите названные генные панели: Th1, Tfh, Tr1, Treg, Tcm, Tem, Exhaustion, Proliferation, Cytotoxic, Activation_early, Interferon_response, Immune_regulation
    2. Храните эти панели в названном списке R для оценки модулей по следующим линиям.
  2. Запустите R-код, указанный в дополнительном файле 2 , чтобы определить панели генов.
  3. Определите гены валидации маркеров
    1. Определите отдельную панель валидации, содержащую канонические маркерные гены, такие как Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 и Lef1.

5. Создавать объекты Seurat и вычислять метрики контроля качества

  1. Инициализация объектов Seurat
    1. Создайте объект Seurat для каждого набора данных, используя min.cells = 3 и min.features = 0. Не накладывайте произвольные ограничения признаков при импорте.
    2. Добавьте метаданные набора данных, выборок и временных точек. Объединяйте необязательные метаданные с помощью сопоставления штрихкодов.
  2. Пример запуска Инициализация объекта Seurat
    1. Выполните R-код, указанный в дополнительном файле 2 , чтобы создать объект Seurat и назначить метаданные.
  3. Вычисление метрик контроля качества
    1. Вычислите долю митохондриального транскрипта с помощью приставка мыши ^mt-.
    2. Определите следующие метрики
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Запустите пример кода, упомянутый в дополнительном файле 2.
  5. Визуализируйте предвариальный контроль качества
    1. Создавайте скрипичные графики для nFeature_RNA, nCount_RNA и percent.mt. Генерируйте графики рассеяния признаков для nCount_RNA против nFeature_RNA и nCount_RNA против percent.mt.
    2. Сохраняйте предварительные данные с помощью стандартизированных названий, таких как QC_pre_filter_AllCells_vln.png и QC_pre_filter_AllCells_scatter.png.
      Внимание: ожидайте широкие предфильтрованные распределения с низкокачественными хвостами и возможными выбросами с высоким количеством.

6. Вывод адаптивных порогов контроля качества и фильтрация ячеек низкого качества

  1. Вывод порогов, специфичных для набора данных,
    1. Логарифмическое преобразование nFeature_RNA + 1 и nCount_RNA + 1. Вычислите медианное и медианное абсолютное отклонение (MAD) для обеих преобразованных переменных.
    2. Определим следующие пороги:
      min_features = 10^(медиана - 3 × MAD) - 1
      max_features = 10^(медиана + 3 × MAD) - 1
      min_counts = 10^(медиана - 3 × MAD) - 1
      max_counts = 10^(медиана + 3 × MAD) – 1
    3. Определите порог митохондрий как 95-й процентиль percent.mt плюс 3 × MAD, ограниченный между 5 % и 20 %.
    4. Убедитесь, что dataset_id, sample_id и out_dir правильно указаны перед запуском функции.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. Примените фильтрацию
    1. Сохранять клетки, удовлетворяющие всем адаптивным критериям:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Запустите пример кода, упомянутый в дополнительном файле 2.
  3. Сохранение выходов фильтрации
    1. Сохраните QC_thresholds_*.csv и cell_counts_summary_*.csv.
      ТОЧКА ПАУЗЫ: При необходимости сохраняйте промежуточные выходы и продолжайте анализ с этого шага.
    2. Генерируйте и сохраняйте постфильтрационные QC скрипки и диаграммы рассеяния.
      Контрольная точка: Ожидайте более плотных распределений после фильтрации, удаления ячеек с низкой сложностью и уменьшения экстремальных выбросов.

7. Нормализация данных и выполнение PCA

  1. Нормализация и стабилизация дисперсии
    1. Нормализуйте РНК-анализ перед оценкой клеточного цикла. Если включено, запускайте ячейку по циклам очков. Используйте SCTransform() для стабилизации дисперсии.
    2. Регрессировать митохондриальное содержание только в том случае, если оно биологически обосновано и явно разрешено.
    3. Регрессировать показатели клеточных циклов можно только в случае необходимости для дизайна исследования.
  2. Запустите пример нормализации, как указано в дополнительном файле 2.
  3. Определить значения параметров
    1. Используйте n_variable_features = 3000.
    2. Используйте dims_max_for_pca = 50.
    3. Эти значения явно указаны в рукописи.
  4. Запустите PCA и выберите основные компоненты
    1. Проведите PCA на нормализованном анализе. Подтвердите успешное выполнение PCA, проверив объяснения дисперсий и основные компоненты.
    2. Вычислите дисперсию, объяснённую каждой главной компонентой.
  5. Выберите ПК по всем трём критериям:
    1. Сохраняйте персонажей, объясняющих дисперсию минимум 1%,
    2. Обеспечьте накопленную дисперсию примерно 80 %.
    3. Ограничите окончательный выбор между 10 и 40 персонажами.
    4. Сохраните PCA_variance_table_*.csv, PCA_selection_rationale_*.csv и PCA_Elbow_*.png.
  6. Пример запуска PCA
    1. Пример, как указано в дополнительном файле 2.
      Контрольная точка: Ожидайте график локтя с заметным снижением прироста предельной дисперсии после выбранного среза.

8. Постройте окрестности, выберите разрешение и кластеруйте ячейки

  1. Структура построения графа
    1. Постройте граф общего ближайшего соседа с использованием выбранных ПК.
    2. Запускайте начальную низкоразрешённую кластеризацию, если для обнаружения дублетов нужны метки кластера.
  2. По желанию убрать дублеты
    1. Используйте DoubletFinder только если он установлен и совместим.
      ПРИМЕЧАНИЕ: Выполняйте обнаружение дублетов только для наборов данных с большим количеством ячеек, где ожидаются артефакты мультиплетов.
    2. Пересчитайте нормализацию и PCA после удаления дублета.
  3. Выберите разрешение кластеризации
    1. Оценить резолюции 0.2, 0.4, 0.6, 0.8, 1.0 и 1.2.8.3.2
    2. Вычислите среднюю ширину силуэта для каждого проверяемого разрешения. Выберите разрешение с наивысшим результатом силуэта среди решений с как минимум двумя кластерами.
    3. Сохраните resolution_sweep_*.csv, resolution_selection_rationale_*.csv и resolution_sweep_*.png.
  4. Запустите выбор примера разрешения, выполнив код, указанный в дополнительном файле 2
  5. Запустите UMAP и финальное кластерирование.
    1. Запускайте UMAP с выбранных ПК.
    2. Перестройте граф ближайшего соседа. Кластеруйте ячейки с выбранным разрешением.
    3. Сохраняйте графики UMAP, помеченные по кластерам и сгруппированные по образцам или временной точке. Выполните следующий код, указанный в дополнительном файле 2.
      Внимание: Ожидайте стабильное разделение кластеров и интерпретируемую структуру UMAP, соответствующую основным иммунным состояниям.

9. Выполнить интеграцию на основе SCT для GSE233713

  1. Подготовьте отдельные объекты
    1. Создайте отдельные объекты Seurat для D27_3 и D30.
    2. Применяйте контроль качества и фильтрацию отдельно к каждому образцу. Нормализуйте каждый образец отдельно с помощью SCTransform().
  2. Обоснование интеграции
    1. Используйте интеграцию на основе SCT для снижения технических различий между временными точками при сохранении общей биологической структуры.
    2. Не считайте, что интеграция автоматически приносит пользу. Проверяйте это явно.
  3. Интегрируйте сэмплы
    1. Выберите функции интеграции с помощью SelectIntegrationFeatures(). Подготовьте объекты с помощью PrepSCTIntegration().
    2. Найти анкоры с помощью FindIntegrationAnchors (normalization.method = "SCT"). Интегрировать наборы данных с IntegrateData(normalization.method = "SCT").
  4. Запуск примера интеграции, упомянутой в дополнительном файле 2
  5. Валидация интеграции
    1. Генерируйте графики UMAP до и после интеграции, сгруппированные по временным точкам. Интерпретировать улучшенное смешение ячеек между временными точками как доказательство успешной интеграции.
    2. Вычисление смешивания соседей до и после интеграции. Рассчитывайте состав кластера по временным точкам и генерируйте графики сложенной композиции.
    3. Сохраните следующие выходы:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Внимание: Ожидайте снижения временной сегрегации после интеграции, увеличения смешения соседей и многовременного вклада в большинство кластеров без полной потери биологически значимой структуры.

10. Аннотировать кластеры и валидировать структуру маркеров

  1. Оценить модули, связанные с малярией
    1. Запустите AddModuleScore() для заранее определённых панелей CD4⁺ Т-клеток малярии.
    2. Сохраняйте средства и рейтинги модулей на уровне кластера.
  2. Запустите пример оценки модулей, упомянутый в дополнительном файле 2
  3. Присваивать прогнозируемые метки кластера
    1. Назначите модуль с верхним рангом каждому кластеру в качестве прогнозируемой метки.
    2. Сохранение:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Валидация кластеров с помощью канонических маркеров
    1. Запускайте DotPlots и FeaturePlots с помощью панели канонических маркеров.
    2. Сохранение:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Внимание: Ожидайте согласованную экспрессию нескольких канонических генов в каждом функциональном состоянии, а не изолированных одногенных сигналов.

11. Определить маркеры и выполнить дифференциальные экспрессии.

  1. Найдите маркеры кластера
    1. Запускайте FindAllMarkers(), используя только положительные маркеры.
    2. Сохраните markers_all_clusters_*.csv.
  2. Выполните код, указанный в дополнительном файле, чтобы выполнить пример идентификации маркера
  3. Используйте дифференциальное выражение, учитывающее репликацию, когда доступно
    1. Проверьте, доступны ли действительные метаданные для реплики. Если репликации доступны, агрегируйте подсчёты за каждую реплику и условие и запускайте псевдообъёмный DE с DESeq2.
    2. Сохраните DE_pseudobulk_*.
  4. Используйте эксплоративную дифференциальную экспрессию на уровне клеток при отсутствии репликаций
    1. Если метаданные репликации отсутствуют или недостаточны, запускайте одноклеточный DE в качестве исследовательского анализа.
    2. Сохраните DE_WARNING_*, чтобы задокументировать статус исследования. Сохраняйте результаты исследования как DE_exploratory_celllevel_*.
  5. Генерировать выходы глобальных дифференциальных выражений
    1. Создайте диаграммы вулканов для результатов DE и сохраняйте Volcano_*.
    2. Сохраняйте значительные результаты DE в виде отфильтрованных таблиц.
  6. Генерировать выходы функционального обогащения
    1. Запустите GO Biological Process enrichment и сохраните GO_BP_*. Запускайте обогащение KEGG и сохраняйте KEGG_*.
    2. Запускайте GSEA с ранжированными изменениями лог2 и сохраняйте GSEA_GO_*. Сохраняйте соответствующие бар-плоты и дот-диаграммы.
  7. Генерируйте дифференциальные выходы для кластерных выражений
    1. Запускайте DE внутри каждого кластера между временными точками.
    2. Сохраните DE_cluster_* и DE_cluster_specific_combined_*.
  8. Генерировать выходы иммунно-ориентированных дифференциальных экспрессий
    1. Извлечь результаты DE для отдельных иммунных генов, таких как Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 и Tbx21.
    2. Сохраните DE_immune_focus_*.
    3. Генерируйте и сохраняйте следующие выходы:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Осторожность: ожидайте согласованности между глобальным DE, выходами обогащения, специфическим для кластера DE и иммунно-ориентированными сигнатурами.

12. Сохранить финальные результаты и заархивировать сессию

  1. Сохранить объекты Seurat
    1. Сохраняйте финальные объекты Seurat в формате .rds для каждого набора данных.
  2. Сохранить информацию о сессии
    1. Запишите sessionInfo() в текстовый файл в выходной директории.
  3. Выполните код, указанный в дополнительном файле 2 , чтобы запустить пример экспорта сессии
  4. Проверьте полноту выхода
    1. Убедитесь, что директории ожидаемой fig/, tables/и rds/ содержат соответствующие файлы.
    2. Архивируйте скрипты, информацию о сессиях и выходные данные вместе.
      Внимание: не продолжайте отчёты о записи, пока не будут присутствуют и не будут согласованы внутри сводки по QC, выходы PCA, выбор разрешения, диагностика интеграции, файлы аннотации модулей, выходы DE и файлы обогащения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Качество секвенирования и контроль качества на уровне клеток (антиген-специфические (PcAS-реактивные) TCR-трансгенные CD4⁺ Т-клетки (GSE233703))

Распределения контроля качества до фильтрации (рисунок 2A) показали гетерогенную сложность транскриптов: большинство клеток демонстрировали умеренное количество генов и UMI, а меньшая часть — профили выбросов с высоким количеством, соответствующие потенциальным мультиплет...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

В данном исследовании представлен стандартизированный и воспроизводимый рабочий процесс на основе Сёра для анализа динамики транскрипции CD4⁺ T-клеток во время повторного заражения малярией. Протокол интегрирует адаптивный контроль качества, нормализацию, уменьшение размерности, кластеризацию, интеграцию наборов данных, валидацию маркеров, оценку модулей и анализ дифференциальных выражений в единой вычислительной системе. Вместе эти аналитические шаги позволили воспроизводимую идентифика...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Авторам нечего раскрывать.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Название материала / оборудованияКомпания / ИсточникНомер каталогаКомментарии / Описание
10x Genomics–отформатированные матрицы подсчетаNCBI GEON/AФайлы Matrix Market (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (пакет R)BioconductorN/ARRID:SCR_016884; Функциональный анализ обогащения (GO, KEGG)
enrichplot (пакет R)BioconductorN/ARRID:SCR_017030; Визуализация результатов анализа обогащения
Набор данных GEO GSE233703NCBI Gene Expression OmnibusGSE233703Данные scRNA-seq специфичных для PcAS TCR-трансгенных CD4+ T-клеток
Набор данных GEO GSE233713NCBI Gene Expression OmnibusGSE233713Данные scRNA-seq поликлональных CD4+ T-клеток (D273 vs D30)
GitHub (по желанию)GitHub Inc.N/ARRID:SCR_002630; Контроль версий и воспроизводимость (по желанию)
glmGamPoi (пакет R)BioconductorN/ARRID:SCR_021001; Ускоренная установка модели SCTransform
Matrix (пакет R)CRANN/ARRID:SCR_008389; Обработка разреженных матриц для данных scRNA-seq
Операционная системаMicrosoft / Apple / LinuxN/AПоддерживается Windows 10+, macOS или Linux
org.Mm.eg.db (пакет R)BioconductorN/ARRID:SCR_002643; База данных аннотации генов мыши
patchwork (пакет R)CRANN/ARRID:SCR_018787; Составление многопанельных фигур
Программа для просмотра PDFЛюбаяN/AПросмотр QC графиков, UMAP и тепловых карт
Персональный компьютер или рабочая станцияЛюбаяN/AРекомендуется минимум 16–32 ГБ ОЗУ для интеграции
pheatmap (пакет R)CRANN/ARRID:SCR_016418; Визуализация тепловой карты экспрессии генов
R Statistical Software (версия ≥ 4.2)R Foundation for Statistical ComputingN/ARRID:SCR_001905; Основная вычислительная среда
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Интегрированная среда разработки для R
Seurat (пакет R, v4 или более поздняя версия)Satija LabN/ARRID:SCR_016341; Анализ scRNA-seq
tidyverse (пакет R)CRANN/ARRID:SCR_019186; Манипулирование и визуализация данных

Ссылки

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Теги

Иммунология и инфекцииВыпуск 233Выпуск 233Пустое значениеВыпускscRNA-seqPBMCТранскриптомная интеграцияОценка иммунных модулей

Эта статья была опубликована

Видео скоро будет доступно