Method Article

Использование R, Seurat и CellChat для анализа набора данных по транскриптомике одноклеточного заживления ран на коже мыши

DOI:

10.3791/67266

August 1st, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь мы представляем пошаговый визуальный рабочий процесс для анализа набора данных транскриптомики временного хода одной клетки заживления ран на коже мышей с помощью R. Протокол включает в себя стандартный конвейер для загрузки наборов данных, контроля качества, визуализации и аннотаций типов клеток с помощью Seurat, а также анализ межклеточного взаимодействия с помощью CellChat.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Процесс заживления ран регулируется сложными взаимодействиями между различными типами клеток в пространстве и времени. Благодаря профилированию отдельных клеток в их сложном окружении, методы транскриптомики одиночных клеток позволяют исследовать клеточную гетерогенность, клеточные коммуникационные сети и межклеточные взаимодействия, участвующие в процессе заживления ран. Тем не менее, многие инструменты анализа одиночных клеток работают в среде компьютерного кодирования, и их более широкое использование учеными, занимающимися заживлением ран, затрудняется очевидным отсутствием опыта в области биоинформатики. Поэтому представлен пошаговый рабочий процесс, показывающий, как использовать графическую среду кодирования под названием RStudio для выполнения базового анализа отдельных клеток временного набора данных об иссечении кожи мыши для заживления ран. Этот визуальный и управляемый протокол позволит ученым, не имеющим опыта в области биоинформатики, загружать ранее опубликованный набор данных о заживлении ран, выполнять критически важные шаги по контролю качества, запускать стандартный рабочий процесс анализа отдельных клеток, включая визуализацию наборов данных и аннотации типов клеток с помощью Seurat, выполнять анализ подтипов клеток, выполнять анализ оценки модулей, выполнять анализ межклеточного взаимодействия с помощью CellChat и выполнять интегративный анализ нескольких наборов данных с помощью Seurat. Для каждого шага в протоколе предоставляются описательные пояснения, а также графические результаты по каждой строке кода, чтобы безопасно направлять пользователя по рабочему процессу. Цель этого визуального введения в конвейер анализа одиночных клеток — дать возможность большему количеству ученых, занимающихся заживлением ран, использовать инструменты биоинформатики непосредственно в своих лабораториях, чтобы облегчить более глубокий анализ своих собственных наборов данных об отдельных клетках, а также более широкий повторный анализ ранее опубликованных наборов данных об отдельных клетках.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Заживление ран является одним из самых сложных процессов в биологии млекопитающих и включает в себя спектр из трех фаз заживления: воспалительной, пролиферативной и Resolution 1,2. Эти фазы заживления в широком смысле классифицируют скоординированные действия десятков типов клеток и сотен их молекулярных продуктов в пространстве ивремени заживления раны. Несколько десятилетий гистологических и молекулярных исследований, основанных на отборе проб из раневой ткани в течение всего периода заживления, пролили свет на всеобъемлющие клеточные паттерны восстановления тканей3, особенно в воспроизводимых мышиных моделях заживления исцизионных ран кожи 4,5,6. Только в последние два десятилетия стало возможным более полно оценить сложность заживления ран, начиная с появления высокопроизводительных транскриптомных анализов ран в масштабах объемных тканей 7,8,9 и клеток 10,11,12,13,14. Совсем недавно в нескольких исследованиях было проведено транскрипционное профилирование кожных ран на уровне отдельных клеток, что позволило выявить новые подтипы раневых клеток и показать, как они могут взаимодействовать друг с другом во время заживления 15,16,17,18,19,20. Hu et al. использовали инновационный подход к пространственному секвенированию одноклеточной РНК для профилирования кожных ран на протяжении всего времени заживления на нескольких радиальных расстояниях от центра раны, что выявило новые межклеточные и молекулярные «движения» в пространстве и времени. Такие исследования раскрывают сложность заживления ран в беспрецедентных деталях и начинают рисовать картину огромной клеточной и молекулярной гетерогенности.

Основные последние достижения в методах биоинформатического анализа позволяют придать биологический смысл сложным мультиомным наборам данных, генерируемым в области исследований заживления ран. Пакеты анализа отдельных клеток, такие как Seurat, предоставляют инструменты для надежного анализа и интеграции наборов данных, включая классификацию типов клеток в сложных тканях, таких как раны21. Для последующей интерпретации данных об отдельных клетках используются такие инструменты, как CellChat, для выявления предполагаемых программ межклеточного взаимодействия, которые могут объяснить, как клетки координируют свои действия длязаживления ран. Несмотря на то, что эти инструменты хорошо документированы и хорошо цитируются, они должны работать в среде компьютерного кодирования, такой как R, статистический и графический язык программирования, который чаще всего используется в областях биоинформатики геномики и транскриптомики. В то время как биологи и клиницисты в области заживления ран все чаще используют одноклеточные подходы для изучения восстановления тканей, немногие из них имеют необходимую биоинформатическую подготовку, чтобы использовать такие инструменты, как Seurat и CellChat, непосредственно в своих лабораториях. Такой барьер в использовании этих инструментов биоинформатики не только мешает ученым более глубоко анализировать свои собственные наборы данных без помощи биоинформатиков, но и не позволяет ученым надежно повторно анализировать огромное количество данных об отдельных клетках, уже опубликованных другими группами.

Таким образом, здесь представлен пошаговый рабочий процесс, позволяющий ученым, не имеющим образования в области биоинформатики, проанализировать ранее опубликованный и общедоступный набор данных о заживлении ран одиночнымиклетками20. Протокол использует распространенную и бесплатную графическую среду кодирования R под названием RStudio и демонстрирует, как перемещаться по этой среде для выполнения предписанных строк кода, которые позволяют провести базовый анализ сложного набора данных с одной клеткой с помощью Seurat и CellChat. В рамках этого протокола представлены семь основных методов, имеющих отношение к исследованиям заживления ран, в том числе: 1) установка среды кодирования, 2) загрузка набора данных и критических этапов контроля качества, 3) рабочие процессы анализа отдельных клеток, включая визуализацию и аннотации типов клеток, 4) анализ подтипов клеток, 5) анализ оценки модулей, 6) анализ межклеточного взаимодействия и 7) интегративный анализ нескольких наборов данных. В каждом методе предоставляется фактический код, который пользователь может выполнять параллельно с протоколом, а фактические графические результаты каждой строки кода отображаются для того, чтобы помочь пользователю в рабочем процессе. Основная цель этого пошагового и наглядного введения в RStudio и фундаментального рабочего процесса анализа одиночных клеток — дать возможность большему количеству ученых, занимающихся заживлением ран, использовать эти мощные инструменты напрямую, чтобы обеспечить более быстрый прогресс в области исследований.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ЗАМЕТКА: В следующих рабочих процессах, подробно описывающих семь методов биоинформатики, все этапы протоколов сопровождаются соответствующими блоками кода, которые должны выполняться непосредственно в собственном пользовательском интерфейсе RStudio в том порядке, в котором они перечислены. Чтобы сделать этот протокол максимально удобным для пользователя, в него включен файл скрипта R (Supplementary File 1: JoVE_Rscript.R), который может быть загружен непосредственно в сессию RStudio пользователя, так что каждая строка кода может быть просто запущена. Это избавляет пользователя от необходимости вводить или копировать и вставлять код из документа протокола, что может привести к ошибкам. Все инструкции протокола также включены в файл скрипта R в виде комментариев, обозначенных символом хештега «#» в начале каждой строки комментария.

1. Установка R, RStudio и необходимых пакетов R для рабочего процесса анализа одиночных клеток

  1. Скачайте и установите R (версия 4.4.1) на компьютер. Воспользуйтесь ссылкой, которая соответствует операционной системе компьютера.
    1. Если вы используете компьютер под управлением Microsoft Windows, воспользуйтесь этой ссылкой: https://cran.rstudio.com/bin/windows/base/
    2. Если вы используете компьютер под управлением MacOS, воспользуйтесь этой ссылкой: https://cran.rstudio.com/bin/macosx/
  2. Установите на компьютер последнюю версию RStudio. Перейдите по следующей ссылке и следуйте инструкциям:
    https://www.rstudio.com/products/rstudio/download/#download
  3. Установите Rtools (версия 4.4), который позволит R компилировать определенные пакеты. Перейдите по следующей ссылке и следуйте инструкциям:
    1. Если вы используете Windows, воспользуйтесь этой ссылкой: https://cran.rstudio.com/bin/windows/Rtools/
    2. Если вы используете MacOS, воспользуйтесь этой ссылкой:
      https://mac.r-project.org/tools/
  4. Установите локальную рабочую директорию; Это папка на компьютере, из которой будут загружаться и сохраняться все файлы. Установите рабочий каталог, выбрав «Сеанс » в строке меню RStudio и нажав «Установить рабочий каталог» > «Выбрать каталог » и выбрав нужную папку.
    1. Если вы используете компьютер с Windows, используйте следующую команду для установки рабочего каталога. Измените [Директория] в следующей строке кода на фактическую структуру директории. Имейте в виду, что разделителем каталога в R является символ "/"
      setwd("C:/[Directory]")
    2. Если вы используете компьютер с MacOS, следующая команда также установит рабочий каталог. Измените [Директория] в следующей строке кода на фактическую структуру директории. Имейте в виду, что разделителем каталога в R является символ "/"
      setwd("~/[Directory]")
    3. В любой момент сеанса R проверьте рабочий каталог, используя следующую строку кода:
      getwd()
    4. В RStudio визуально изучите структуру рабочих каталогов, включая все файлы и папки, содержащиеся в них, в правом окне на вкладке «Файлы ». Чтобы перейти из проводника файлов RStudio в рабочий каталог, нажмите значок шестеренки -> Перейти к рабочему каталогу.
  5. Установите следующие пакеты из репозитория пакетов R CRAN, которые являются необходимыми зависимостями для протокола. Чтобы установить эти пакеты, выполните следующие команды.
    install.packages("devtools")
    install.packages("readxl")
    install.packages("openxlsx")
    install.packages("tidyverse")
    install.packages("scCustomize")

    ЗАМЕТКА: Во время установки пакетов R различные окна появляются и исчезают нормально. Если появится окно с запросом на компиляцию пакета, нажмите кнопку ДА. Если появится окно с запросом на перезапуск R перед установкой пакета, нажмите кнопку НЕТ.
  6. Установите следующие пакеты из курируемого репозитория пакетов R Bioconductor
    (https://bioconductor.org/), которые являются необходимыми зависимостями для протокола. Чтобы установить эти пакеты, выполните следующие команды.
    if (! requireNamespace("BiocManager", quietly = TRUE) )
      install.packages("BiocManager")
    BiocManager::install("NMF", update=F)
    BiocManager::install("ComplexHeatmap", update=F)
    BiocManager::install("BiocNeighbors", update=F)
    BiocManager::install("SingleCellExperiment", update=F)
    BiocManager::install("circlize", update=F)
    BiocManager::install("edgeR", update=F)
    BiocManager::install("scDblFinder", update=F)
  7. Установите следующие пакеты, которые необходимы для рабочего процесса, описанного в данной рукописи.
    install.packages("Seurat")
    devtools::install_github("jinworks/CellChat")
  8. Загрузите каждый пакет, чтобы убедиться в успешном выполнении установки. В случае, если какой-либо из пакетов приводит к ошибке «пакет не найден», повторно установите его, используя соответствующий код выше.
    library(readxl)
    library(openxlsx)
    library(tidyverse)
    library(scCustomize)
    library(edgeR)
    library(scDblFinder)
    library(Seurat)
    library(CellChat)

2. Загрузка набора данных для заживления ран с одной клеткой и выполнение этапов контроля качества

ЗАМЕТКА: Для данного рабочего процесса в области биоинформатики проведен повторный анализ ранее опубликованного пространственно-временного эксперимента по заживлению ран на одноклеточной коже20. Файлы наборов данных хранятся в курируемом репозитории NCBI Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/).

  1. Перейдите к файлам набора данных из ГЕО, используя номер доступа GSE204777. Воспользуйтесь следующей ссылкой и ознакомьтесь с планом эксперимента исследования: https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE204777
  2. На странице репозитория GEO есть пять отдельных пакетов данных, полученных из пяти полос секвенирования. Нажмите на первый набор данных, озаглавленный GSM6190913. Ниже приведена прямая ссылка на образец: https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSM6190913
  3. Прокрутите страницу вниз и загрузите следующие три файла, используя ссылки ftp или html . В файловом менеджере компьютера переместите эти три файла в каталог с именем b1. Убедитесь, что папка b1 находится в пределах рабочего каталога, установленного в шаге 1.4.
    Имя файла: GSM6190913_b1_barcodes.tsv.gz / размер файла: 18.5 Mb
    Имя файла: GSM6190913_b1_features.tsv.gz / размер файла: 254.1 Kb
    Имя файла: GSM6190913_b1_matrix.mtx.gz / размер файла: 151.2 Mb
  4. Получите информацию о каталоге для файлов секвенирования отдельных ячеек, загруженных на шаге 2.3.
    b1_data_dir <- file.path(getwd(), "b1")
  5. Загрузите файлы секвенирования отдельных ячеек. Параметр gene.column указывает используемое именование гена/признака. В этом случае используйте gene.column = 2 для символов генов (gene.column = 1 для имен генов Ensembl).
    b1 <- Read10X_GEO(data_dir = b1_data_dir, gene.column = 2)
    ЗАМЕТКА: Большинство наборов данных с одной ячейкой не содержат дополнительных мультиплексированных данных, поэтому файлы 10x, созданные с использованием этого шага, не будут иметь нескольких слоев. Для текущего мультиплексированного набора данных перейдите к шагу 2.6. Для наборов данных без мультиплексирования данных перейдите к шагу 2.7.
  6. Демультиплексируйте набор данных из одной ячейки с помощью пространственно-временных штрихкодов.
    1. Для рабочего набора данных разделите данные экспрессии генов и данные HTO (мультиплексирования).
      dataset_rna_counts <- b1$GSM6190913_b1_$`Gene Expression`
      ​dataset_barcodes <- b1$GSM6190913_b1_$`Antibody Capture`
    2. Создайте объект Сёра, используя данные об экспрессии генов, при этом немедленно отфильтровав гены, экспрессируемые менее чем в 5 клетках, и клетки с менее чем 200 обнаруженными генами.
      dataset <- CreateSeuratObject(counts = dataset_rna_counts, min.cells = 5, min.features = 200)
    3. Создайте набор данных об экспрессии генов в виде слоя и сгенерируйте список клеток и штрих-кодов, общих для обоих анализов.
      dataset_rna_counts2 <- LayerData(dataset, data = "RNA")
      ​dataset_joint.barcodes <- intersect(colnames(dataset_rna_counts2), colnames(dataset_barcodes))
    4. Экспрессия подмножеств генов и количество HTO по совместным клеточным штрих-кодам.
      dataset_rna_counts2 <- dataset_rna_counts2[, dataset_joint.barcodes]
      ​dataset_barcodes2 <- as.matrix(dataset_barcodes[, dataset_joint.barcodes])
    5. Убедитесь, что у HTO есть ожидаемые имена штрихкодов.
      ​rownames(dataset_barcodes2)
    6. Создайте новый анализ для хранения информации о штрих-коде и добавьте этот анализ к ранее созданному объекту Сёра.
      dataset_barcode_assay <- CreateAssayObject(counts = dataset_barcodes2)
      ​dataset[["barcodes"]] <- dataset_barcode_assay
    7. Убедитесь, что объект теперь содержит несколько анализов.
      DefaultAssay(dataset)
    8. Нормализация данных штрих-кода и выполнение демультиплексирования с помощью функции HTODemux. Этот метод подробно описан в следующей виньетке Сёра: https://satijalab.org/seurat/articles/hashing_vignette
      ​dataset <- HTODemux(dataset, assay = "barcodes", positive.quantile = 0.99)
    9. Группируйте ячейки на основе результатов глобальной классификации и удаляйте ячейки без классификации по штрихкоду.
      Idents(dataset) <- "barcodes_classification.global"
      ​dataset <- subset(dataset, idents = "Negative", invert = TRUE)
    10. Группируйте ячейки на основе максимального сигнала HTO.
      Idents(dataset) <- "barcodes_maxID"
    11. Визуализируйте распределение обнаруженных генов в клетках по их мультиплексным штрих-кодам (дополнительный рисунок 1).
      VlnPlot(dataset, features = "nFeature_RNA", pt.size = 0.1, log = TRUE)
    12. Переименуйте штрих-коды в соответствии с их фактическим временем раны (дни после ранения) и интервалом (2-8 мм) (взятыми из оригинальной рукописи) и назначьте их новой переменной метаданных под названием time_space.
      Idents(dataset) <- "barcodes_maxID"
      levels(dataset)
      dataset <- RenameIdents(dataset,
      "Barcode-1" ="D01_2mm",
      "Barcode-2" ="D01_4mm",
      "Barcode-3" ="D01_6mm",
      "Barcode-4" ="D01_8mm",
      "Barcode-5" ="D03_2mm",
      "Barcode-6" ="D03_4mm",
      "Barcode-7" ="D03_6mm",
      "Barcode-8" ="D03_8mm",
      "Barcode-9" ="D07_2mm",
      "Barcode-10" ="D07_4mm",
      "Barcode-11" ="D07_6mm",
      "Barcode-12" ="D07_8mm",
      "Barcode-13" ="D14_2mm",
      "Barcode-14" ="D14_4mm",
      "Barcode-15" ="D14_6mm",
      "Barcode-16" ="D14_8mm",
      "Barcode-17" ="UW")
      levels(dataset)
      dataset[["time_space"]] <- Idents(dataset)
  7. Для наборов данных без мультиплексирования данных: создайте объект Сёра, при этом немедленно отфильтруйте гены, экспрессируемые менее чем в 5 клетках, и клетки с менее чем 200 обнаруженными генами.
    dataset <- CreateSeuratObject(counts = b1, min.cells = 5, min.features = 200)
  8. Переключитесь на анализ анализа экспрессии генов набора данных.
    DefaultAssay(dataset) <- "RNA"
    Idents(dataset) <- "data"
  9. В качестве важного шага контроля качества рассчитайте процент митохондриальных генов в каждой клетке и назначьте его в качестве переменной метаданных. Этот метод подробно описан в следующей виньетке Сёра: https://satijalab.org/seurat/articles/pbmc3k_tutorial#qc-and-selecting-cells-for-further-analysis
    dataset[["percent.mt"]] <- PercentageFeatureSet(dataset, pattern = "^mt-")
  10. Визуализируйте распределение обнаруженных генов, количество РНК и процент митохондрий во всех клетках (дополнительный рисунок 2).
    plot1 <- FeatureScatter(dataset, feature1 = "nCount_RNA", feature2 = "percent.mt")
    plot2 <- FeatureScatter(dataset, feature1 = "nFeature_RNA", feature2 = " percent.mt ")
    plot1 + plot2
  11. Существует ряд клеток с большим содержанием митохондрий, что коррелирует с низким количеством РНК; Это мертвые или умирающие клетки. Удалите эти ячейки низкого качества из набора данных, используя справедливое ограничение. В этом случае используют значения исходного набора данных, описанного в ранее опубликованном исследовании20, в котором удаляются клетки с более чем 25% митохондриальных генов.
    dataset <- subset(dataset, subset = nFeature_RNA > 200 & percent.mt < 25)
  12. Визуализируйте распределение обнаруженных генов, количество РНК и процент митохондрий во всех клетках после удаления клеток низкого качества (дополнительный рисунок 3).
    plot1 <- FeatureScatter(dataset, feature1 = "nCount_RNA", feature2 = "percent.mt")
    plot2 <- FeatureScatter(dataset, feature1 = "nFeature_RNA", feature2 = " percent.mt ")
    plot1 + plot2
  13. В качестве дополнительного важного шага контроля качества необходимо выявить вероятные дублеты в наборе данных. Это клетки, которые были соединены во время капельного секвенирования и, таким образом, приведут к экспрессии генов, которая не находится на уровне отдельных клеток. Для противодействия этой проблеме было разработано несколько инструментов. Важно отметить, что каждый инструмент делает определенные предположения о данных об отдельных ячейках, поэтому важно, чтобы пользователь прочитал всю соответствующую документацию, прежде чем использовать какой-либо один инструмент. В этом рабочем процессе реализуйте метод scDblFinder23. Обратите внимание, что в этом методе используется алгоритм, который накладывает фиксированную ожидаемую скорость дублета. Используйте следующие команды для запуска конвейера scDblFinder.
    DefaultAssay(dataset) <- "RNA"
    sce <- scDblFinder(GetAssayData(dataset, assay="RNA", slot="counts"), samples=Idents(dataset))

    ЗАМЕТКА: Мультиплексированные наборы данных с одной ячейкой, такие как этот, также могут быть проверены на наличие дублетов путем удаления ячеек, содержащих несколько штрих-кодов. В этом рабочем процессе этот метод не демонстрировался, так как большинство наборов данных с одной ячейкой не имеют этой уникальной функции. Вместо этого показан более обобщенный конвейер для скрининга дублетов с использованием метода scDblFinder.
  14. Назначьте оценку дублета новой переменной метаданных.
    dataset$scDblFinder.score <- sce$scDblFinder.score
  15. Визуализируйте распределение дублетной оценки во всех ячейках (дополнительный рисунок 4).
    VlnPlot(dataset, features = "scDblFinder.score", raster=FALSE, pt.size=0.5)
  16. Удалите ячейки выше порогового значения удвоения счета 0,25. Этот порог был выбран на основе построенного выше графика скрипки, который показал, что большинству ячеек в наборе данных можно присвоить либо очень высокие, либо очень низкие двойные оценки, и 0,25 является разумным пределом для этого набора данных, который удалил бы подавляющее большинство вероятных дублетов без удаления многих маловероятных дублетов.
    dataset <- subset(dataset, scDblFinder.score < 0.25)
  17. Сохраните объект Seurat набора данных в виде файла RDS в рабочем каталоге.
    saveRDS(dataset, "dataset_post_Method2.rds")

3. Анализ набора данных об заживлении одноклеточных ран с помощью Seurat

ПРИМЕЧАНИЕ: (Необязательный шаг) Если вы запускаете рабочий процесс здесь, загрузите сохраненный файл RDS как объект Seurat.

dataset <- readRDS("dataset_post_Method2.rds")

  1. Выполнение стандартного рабочего процесса Seura для нормализации набора данных по отдельным ячейкам, масштабирования и анализа главных компонент (PCA). Этот стандартный рабочий процесс описан в следующих виньетках Seurat:
    Seura - Учебное пособие по управляемой кластеризации: https://satijalab.org/seurat/articles/pbmc3k_tutorial
    Список команд Сёра: https://satijalab.org/seurat/articles/essential_commands
    DefaultAssay(набор данных) <- "РНК"
    dataset <- NormalizeData(object = dataset)
    dataset <- FindVariableFeatures(object = dataset)
    dataset <- ScaleData(object = dataset)
    dataset <- RunPCA(object = dataset)
  2. Визуализируйте количество вариаций набора данных по отношению к первым 50 измерениям PCA (дополнительный рисунок 5).
    ElbowPlot(dataset, reduction = "pca", ndims = 50)
    Большая часть основных вариаций происходит в пределах первых 13 измерений.
  3. Выполните кластеризацию ячеек набора данных, используя заданный диапазон размеров PCA от 1 до 13 и заданное разрешение 0,1.
    dataset <- FindNeighbors(dataset, verbose = TRUE, dims = 1:13)
    dataset <- FindClusters(dataset, verbose = TRUE, resolution = 0.1)

    ЗАМЕТКА: Этот рабочий процесс фокусируется на крупномасштабных различиях между типами ячеек. Таким образом, он использует довольно консервативный параметр для диапазона измерений PCA, в котором первые 13 измерений представляют подавляющее большинство вариаций в наборе данных. Для разделения клеток на более мелкие и более редкие подтипы пользователь может использовать большее количество измерений для последующего анализа, поскольку на эти редкие подтипы клеток, вероятно, приходится более низкий уровень вариации набора данных. Параметр resolution находится в диапазоне от 0 до 1 и определяет величину категориального разделения, наложенного на набор данных. Настройка этого параметра зависит от исследовательского вопроса пользователя. Для кластеризации клеток в многочисленные мелкие и редкие подтипы используйте более высокое разрешение для последующего анализа. Поскольку этот рабочий процесс направлен на изучение более широких различий между основными типами клеток, он использует довольно низкое значение разрешения 0,1, которое, как ожидается, кластеризует ячейки в меньшее количество более крупных групп. Использование настроек, описанных в шаге 3.3, приведет к различению 8 уникальных кластеров ячеек. Эти кластеры автоматически назначаются переменной метаданных под названием "seurat_clusters".
  4. Выполните уменьшение размерности UMAP и анализ нахождения соседей с использованием первых 13 измерений PCA. Добавьте начальное число 123, чтобы обеспечить воспроизводимость результирующей проекции данных.
    dataset <- RunUMAP(dataset, verbose = TRUE, dims = 1:13, seed.use = 123)
    ЗАМЕТКА: Алгоритм UMAP является стохастическим и вносит случайность в уменьшение размерности (см. раздел «Стабильность и воспроизводимость» в https://cran.r-project.org/web/packages/umap/vignettes/umap.html). Несмотря на то, что использование согласованного начального значения обеспечивает «минимальный уровень воспроизводимости» алгоритма, результирующий график все же может немного отличаться от того, что показано на репрезентативных рисунках и в последующих результатах. Тестирование показало, что результаты будут особенно отличаться между компьютерами под управлением Windows и MacOS, вероятно, из-за разных реализаций случайности в этих операционных системах.
  5. Визуализируйте кластеризацию ячеек на графике UMAP (рисунок 1).
    DimPlot(dataset, group.by = "seurat_clusters", raster = FALSE, label = TRUE)
    ЗАМЕТКА: Случайность алгоритма UMAP может генерировать немного другие графики, как показано на рисунке, показывающем альтернативные графики UMAP, сгенерированные с использованием того же кода, что и выше, на компьютерах под управлением Windows и MacOS; Обратите внимание на небольшие различия в формах гроздей. Поэтому крайне важно, чтобы пользователь сохранял и отмечал время всех данных и графиков по мере их создания, а все последующие анализы кластеров выполнялись тщательно и с учетом биологических знаний, как это описано ниже для аннотации типов клеток.
  6. Поскольку в исследование включены оригинальные экспериментальные метки, указывающие на то, откуда и когда появились клетки во время заживления раны, визуализируйте временно-пространственную аннотацию клеток раны на графике UMAP (рис. 2).
    DimPlot(dataset, group.by = "time_space", raster = FALSE, label = FALSE)
  7. Сгенерируйте таблицу ассоциаций клеточных кластеров с аннотацией времени/пространства раны.
    table(dataset$time_space, dataset$seurat_clusters)
  8. Определите идентичности основных типов ячеек в наборе данных. Для этого рассчитают дифференциально экспрессируемые гены (DEG) между всеми кластерами. Получите списки DEG для кластеров, назначьте их переменной и сохраните выходные данные в виде текстового файла с разделителями в рабочем каталоге.
    ЗАМЕТКА: Этот шаг требует больших затрат на процессор и может занять много времени, в зависимости от аппаратного обеспечения пользователя.
    Idents(dataset) <- "seurat_clusters"
    Cell_markers <- FindAllMarkers(dataset, max.cells.per.ident = 500, only.pos = TRUE, min.pct = 0.10, logfc.threshold = 0.25)
    write.csv(Cell_markers, file = file.path(getwd(), "dataset_cluster_markers.txt"))
  9. Загрузите и откройте включенный файл dataset_cluster_markers.txt в таблице (например, Excel), скопировав содержимое текстового файла и с помощью мастера импорта текста укажите разделитель запятых и идентичность столбцов имен генов как Text. Важно указать, что названия генов являются «Текстом», в противном случае Excel автоматически преобразует определенные имена генов в даты, например, 7 сентября изменится на 7 сентября.
  10. В таблице отфильтруйте результаты по следующим рекомендуемым параметрам:
    1. Ранжируйте столбец avg_log2FC от большего к меньшему, чтобы упорядочить все строки в соответствии с убывающим log2-кратным изменением (log2FC).
    2. Ранжируйте столбец кластера от наименьшего к большему, чтобы упорядочить все строки в соответствии с возрастанием номеров кластеров Сёра.
    3. Отфильтруйте столбец avg_log2FC по числам, превышающим или равным 2,5, чтобы отобразить только наиболее дифференциально экспрессируемые гены (DEG) в указанном кластере по сравнению с другими кластерами.
    4. Отфильтруйте столбец pct.1 на наличие чисел, больше или равных 0,4. В этом столбце указан процент клеток в указанном кластере, экспрессирующих указанный ген (Cluster %), и установка порогового значения 0,4 означает, что отображаются только гены, экспрессируемые не менее чем в 40% клеток указанного кластера.
    5. Отфильтруйте столбец pct.2 по числам, меньшим или равным 0,2. В этом столбце указан процент клеток, НЕ экспрессирующих указанный ген в указанном кластере (Non-cluster %), а установка порогового значения на 0,2 означает, что отображаются только гены, экспрессируемые не более чем в 20% клеток, НЕ входящих в указанный кластер.
    6. Отфильтруйте столбец p_val_adj на наличие чисел, меньших или равных 0,01. Этот столбец относится к скорректированному значению P или коэффициенту ложных обнаружений (FDR), указывая на статистическую силу указанного DEG, а установка порогового значения 0,01 означает, что отображаются только гены с FDR < 0,01.
      ПРИМЕЧАНИЕ: Дополнительная таблица 1 (JoVE_DEGs_cellMarkers.xlsx) содержит полный вывод ранжированных дифференциально экспрессируемых генов, использованных на шаге 3.10 протокола. В дополнительной таблице 2 показаны 5 основных генов для каждого кластера в этом анализе, с генами, выделенными жирным шрифтом, используемыми для последующей визуализации.
  11. Для несмещенного аннотирования кластеров по типу ячеек используйте веб-инструмент анализа обогащения EnrichR.
    Воспользуйтесь ссылкой: https://maayanlab.cloud/Enrichr/
  12. Скопируйте списки DEG для каждого кластера в отдельное окно EnrichR, затем нажмите кнопку Анализировать. Инструмент EnrichR пропускает список генов через сотни тщательно отобранных баз данных и ранжирует каждый обогащенный термин в каждой категории.
  13. Чтобы добавить аннотацию к типам ячеек, перейдите на вкладку «Типы ячеек» выше и сосредоточьтесь на 5 основных дополнениях в курируемых базах данных с тремя маркерами ячеек слева (рисунок 3):
    CellMarker 2024 (http://bio-bigdata.hrbmu.edu.cn/CellMarker/)
    Tabula Sapiens (https://tabula-sapiens-portal.ds.czbiohub.org/)
    PanglaoDB Augmented (https://panglaodb.se/)
  14. На основе обогащения DEG в этих базах данных подтвердите вероятную идентичность 8 кластеров. Обратите внимание, что существуют два кластера (2, 6), которые обогащаются в виде фибробластов; Поэтому объедините эти кластеры в аннотации типов отдельных ячеек. Назначьте идентификаторы типов ячеек в качестве меток новой переменной метаданных с именем cell_types.
    Idents(dataset) <- "seurat_clusters"
    dataset[["cell_types"]] <- Idents(dataset)
    Idents(dataset) <- "cell_types"
    dataset <- RenameIdents(dataset,
    "0" = "Macrophage",
    "1" = "Neutrophil",
    "2" = "Fibroblast",
    "3" = "Epithelial cell",
    "4" = "Endothelial cell",
    "5" = "T cell",
    "6" = "Fibroblast",
    "7" = "Smooth muscle cell"
    )
    levels(dataset)
    dataset[["cell_types"]] <- Idents(dataset)
  15. Визуализируйте переименованные кластеры ячеек в виде аннотаций на графике UMAP (рисунок 4).
    DimPlot(dataset, group.by = "cell_types", raster = FALSE, label = FALSE)
  16. Визуализируйте локализацию генов маркеров кластера из таблицы 1 на серии графиков UMAP (рисунок 5).
    DefaultAssay(dataset) <- "RNA"
    FeaturePlot(dataset, features = c("Arg1", "Retnlg", "Fgf7", "Dsp", "Tie1", "Cd3g", "Cdh4", "Rgs5"), raster=FALSE, ncol = 4)
  17. Визуализируйте верхние маркеры кластера DEG на точечной диаграмме, сгруппированной по исходным номерам кластеров (дополнительный рисунок 6).
    DotPlot(dataset, group.by = "seurat_clusters", features = c("Arg1","Retnlg","Fgf7","Dsp","Tie1", "Cd3g","Cdh4","Rgs5")) + RotatedAxis() + scale_colour_gradient2(low = "blue", mid = "grey", high = "red")
  18. Визуализируйте верхние маркеры кластера DEG на точечной диаграмме, сгруппированной по аннотированным типам ячеек (рис. 6).
    DotPlot(dataset, group.by = "cell_types", features = c("Arg1","Retnlg","Fgf7","Dsp","Tie1", "Cd3g","Cdh4","Rgs5")) + RotatedAxis() + scale_colour_gradient2(low = "blue", mid = "grey", high = "red")
  19. Чтобы выполнить анализ временных рядов, сначала упростите набор данных, удалив пространственный компонент. Для анализа временного хода сгруппируйте аннотации о времени/пространстве раны в общее количество дней после ранения (DPW) с помощью новой переменной метаданных под названием «DPW».
    Idents(dataset) <- "time_space"
    dataset[["DPW"]] <- Idents(dataset)
    Idents(dataset) <- "DPW"
    new.cluster.ids <- c("D1", "D1", "D1", "D1", "D3", "D3", "D3", "D3", "D7", "D7", "D7", "D7", "D14", "D14", "D14", "D14", "UW")
    names(new.cluster.ids) <- levels(dataset)
    dataset <- RenameIdents(dataset, new.cluster.ids)
    dataset[["DPW"]] <- Idents(dataset)
    Idents(dataset) <- "DPW"
  20. Визуализируйте новые группировки времени раны на графике UMAP (дополнительный рисунок 7).
    DimPlot(dataset, group.by = "DPW", raster = FALSE, label = FALSE)
  21. Создание таблиц, показывающих, сколько ячеек каждого типа встречается в каждой DPW.
    ​table(dataset$DPW, dataset$cell_types)
    1. Необязательный шаг: Чтобы также получить списки DEG для групп временных курсов раны, назначьте их переменной и сохраните выходные данные в виде текстового файла с разделителями.
      Idents(dataset) <- "DPW"
      Cell_DPW_markers <- FindAllMarkers(dataset, max.cells.per.ident = 500, only.pos = TRUE, min.pct = 0.10, logfc.threshold = 0.25)
      write.csv(Cell_DPW_markers, file = file.path(getwd(), "dataset_DPW_markers.txt"))
  22. Преобразуйте количество клеток в пропорции для каждой категории, чтобы лучше понять относительные изменения в составе клеток на протяжении всего периода заживления. Визуализируйте долю DPW в каждом типе клеток (дополнительный рисунок 8):
    pt1 <- table(dataset$DPW, dataset$cell_types)
    pt1 <- as.data.frame(pt1)
    pt1$Var1 <- as.character(pt1$Var1)
    ggplot(pt1, aes(x = Var2, y = Freq, fill = Var1)) +
    theme_bw(base_size = 15) +
    geom_col(position = "fill", width = 0.5) +
    xlab("Sample") + RotatedAxis() +
    ylab("Proportion") +
    theme(legend.title = element_blank())
  23. Визуализируйте долю типов клеток в каждом DPW ( рис. 7).
    pt2 <- table(dataset$cell_types, dataset$DPW)
    pt2 <- as.data.frame(pt2)
    pt2$Var1 <- as.character(pt2$Var1)
    ggplot(pt2, aes(x = Var2, y = Freq, fill = Var1)) +
    theme_bw(base_size = 15) +
    geom_col(position = "fill", width = 0.5) +
    xlab("Sample") +
    ylab("Proportion") +
    theme(legend.title = element_blank())
  24. Сохраните объект Seurat набора данных в виде файла RDS в рабочем каталоге.
    saveRDS(dataset, "dataset_post_Method3.rds")

4. Анализ подтипов клеток с помощью Сёра

ЗАМЕТКА: Возможности анализа отдельных клеток позволяют обнаруживать и анализировать редкие подтипы в основных типах клеток, которые были проанализированы выше. В этом примере основное внимание уделяется фибробластам, которые первоначально были сгруппированы в два кластера Сёра, прежде чем они были объединены в одну категорию. Эта часть протокола фокусируется конкретно на фибробластах, исключая все другие типы клеток, и исследует их идентичность и временные свойства во время заживления ран. В качестве дополнительного шага, при необходимости, загрузите сохраненный файл RDS как объект Seurat.

dataset <- readRDS("dataset_post_Method3.rds")

  1. Подмножество исходного набора данных в соответствии с идентичностью клеток фибробластов.
    Idents(набор данных) <- "cell_types"
    dataset_fibroblast <- subset(dataset, idents = "Fibroblast")
  2. Выполните PCA для этого меньшего набора данных и визуализируйте количество вариаций набора данных по отношению к измерениям PCA (дополнительный рисунок 9).
    dataset_fibroblast <- RunPCA(dataset_fibroblast, verbose = TRUE)
    ElbowPlot(dataset_fibroblast, reduction = "pca", ndims = 50)

    ЗАМЕТКА: Большая часть основных вариаций происходит в пределах первых 9 измерений.
  3. Выполните кластеризацию ячеек набора данных, используя заданный диапазон размеров PCA от 1 до 9 и заданное разрешение 0,1.
    dataset_fibroblast <- FindNeighbors(dataset_fibroblast, verbose = TRUE, dims = 1:9)
    dataset_fibroblast <- FindClusters(dataset_fibroblast, verbose = TRUE, resolution = 0.1)

    ЗАМЕТКА: Используя эти настройки, алгоритм дискриминирует 3 уникальных кластера фибробластов. Эти кластеры автоматически назначаются переменной метаданных с именем seurat_clusters.
  4. Выполните уменьшение размерности UMAP и анализ поиска соседей с использованием первых 9 измерений PCA. Добавьте начальное число 123, чтобы обеспечить воспроизводимость результирующей проекции данных.
    dataset_fibroblast <- RunUMAP(dataset_fibroblast, verbose = TRUE, dims = 1:9, seed.use = 123)
  5. Визуализируйте кластеризацию ячеек на графике UMAP (рисунок 8).
    DimPlot(dataset_fibroblast, group.by = "seurat_clusters", raster = FALSE, label = TRUE)
  6. Визуализируйте аннотацию клеток по времени раны на графике UMAP (дополнительный рисунок 10).
    DimPlot(dataset_fibroblast, group.by = "DPW", raster = FALSE, label = FALSE)
  7. Получите списки DEG для трех подтипов фибробластов и сохраните их в текстовом файле в рабочем каталоге.
    Idents(dataset_fibroblast) <- "seurat_clusters"
    fibroblast_markers <- FindAllMarkers(dataset_fibroblast, max.cells.per.ident = 500, only.pos = TRUE, min.pct = 0.10, logfc.threshold = 0.25)
    write.csv(fibroblast_markers, file = file.path(getwd(), "fibroblast_cluster_markers.txt"))
  8. Выполните действия, аналогичные приведенным выше (шаги 3.9-3.10) в электронной таблице, чтобы отфильтровать ДЭГ по основным маркерам подтипа фибробластов.
  9. Определите пользовательский список генов в качестве переменной, скопировав 5 основных маркеров подтипов фибробластов для каждого из трех кластеров из текстового файла DEG.
    FB_type_marker <- c("Plac8", "Cthrc1", "Adam12", "Ifi211", "Plat", "Cdh4", "Aldh3a1", "Ppp1r14a", "Oxtr", "Serpina3c", "Sostdc1", "Scube3", "Ptprz1", "Corin", "Alx4")
  10. Визуализируйте гены в списке в наборе данных, предназначенном только для фибробластов, вызвав переменную в параметре features точечной диаграммы (рисунок 9).
    DotPlot(dataset_fibroblast, group.by="seurat_clusters", features = FB_type_marker) + RotatedAxis() + scale_colour_gradient2(midpoint = 0, low = "blue", mid = "grey", high = "red")
    DotPlot(dataset_fibroblast, group.by="DPW", features = FB_type_marker) + RotatedAxis() + scale_colour_gradient2(midpoint = 0, low = "blue", mid = "grey", high = "red")
  11. Визуализируйте гены в списке в исходном наборе данных для отдельных клеток, вызвав переменную в параметре features точечной диаграммы (дополнительный рисунок 11).
    DotPlot(dataset, group.by="cell_types", features = FB_type_marker) + RotatedAxis() + scale_colour_gradient2(midpoint = 0, low = "blue", mid = "grey", high = "red")
  12. Визуализируйте долю подтипов фибробластов в каждой категории DPW (дополнительный рисунок 12).
    pt3 <- table(dataset_fibroblast$seurat_clusters, dataset_fibroblast$DPW)
    pt3 <- as.data.frame(pt3)
    pt3$Var1 <- as.character(pt3$Var1)
    ggplot(pt3, aes(x = Var2, y = Freq, fill = Var1)) +
    theme_bw(base_size = 15) +
    geom_col(position = "fill", width = 0.5) +
    xlab("Sample") +
    ylab("Proportion") +
    theme(legend.title = element_blank())
  13. Визуализируйте долю клеток фибробластов DPW в каждой категории подтипов фибробластов (дополнительный рисунок 13).
    pt4 <- table(dataset_fibroblast$DPW, dataset_fibroblast$seurat_clusters)
    pt4 <- as.data.frame(pt4)
    pt4$Var1 <- as.character(pt4$Var1)
    ggplot(pt4, aes(x = Var2, y = Freq, fill = Var1)) +
    theme_bw(base_size = 15) +
    geom_col(position = "fill", width = 0.5) +
    xlab("Sample") +
    ylab("Proportion") +
    theme(legend.title = element_blank())
  14. Сохраните объект Seurat набора данных в виде файла RDS в рабочем каталоге.
    saveRDS(dataset_fibroblast, "dataset_fibroblast_post_Method4.rds")

5. Пример последующего анализа с помощью модульного скоринга

ЗАМЕТКА: Одним из полезных методов анализа наборов данных с отдельными ячейками является модульная оценка. В этом рабочем процессе можно определить список генов в соответствии с предыдущими знаниями, а затем рассчитать модульные оценки, которые могут определить потенциальное обогащение списка генов в каждой клетке. Эти оценки могут быть усреднены по аннотациям клеток, чтобы выявить потенциальные закономерности обогащения.

Здесь используются списки генов из ранее опубликованного исследования2, в котором гены, специфичные для фазы заживления ран, были идентифицированы с использованием объемных РНК-секвенированных образцов со всего континуума заживления. Списки генов были сохранены в текстовом файле, разделенном табуляцией (Дополнительный файл 2: JoVE_PhaseSpecificGenes.txt), который теперь можно загрузить в рабочий каталог и использовать для создания списков генов, определяющих три основные фазы заживления.

  1. Загрузите списки генов в переменную, прочитав файл TEXT.
    PhaseSpecificGenes <- read_delim("JoVE_PhaseSpecificGenes.txt", delim="\t", col_names = T)
  2. Разделите столбцы на отдельные переменные списка генов и измените гены на имена мышей, первая буква которых написана с заглавной буквы.
    PS_Inflammatory <- PhaseSpecificGenes[1]
    PS_Inflammatory_ms <- lapply(PS_Inflammatory, str_to_sentence)
    PS_Proliferative <- PhaseSpecificGenes[2]
    PS_Proliferative_ms <- lapply(PS_Proliferative, str_to_sentence)
    PS_Resolution <- PhaseSpecificGenes[3]
    PS_Resolution_ms <- lapply(PS_Resolution, str_to_sentence)

    ПРИМЕЧАНИЕ: (Необязательно) При необходимости загрузите сохраненный файл RDS как объект Seurat.
    dataset <- readRDS("dataset_post_Method3.rds")
  3. Используйте списки генов в качестве модулей для оценки каждой клетки в наборе данных в соответствии с тремя фазами заживления.
    dataset <- AddModuleScore(
    object = dataset,
    features = PS_Inflammatory_ms,
    ctrl = 100,
    name = 'Inflammatory'
    )
    dataset <- AddModuleScore(
    object = dataset,
    features = PS_Proliferative_ms,
    ctrl = 100,
    name = 'Proliferative'
    dataset <- AddModuleScore(
    object = dataset,
    features = PS_Resolution_ms,
    ctrl = 100,
    name = 'Resolution'
    )
  4. Визуализируйте совокупные баллы модулей по категориям ячеек, включая DPW и основные типы ячеек (рис. 10).
    DotPlot(dataset, group.by="DPW", features = c("Inflammatory1","Proliferative1", "Resolution1")) + RotatedAxis() + scale_colour_gradient2(midpoint = 0, low = "blue", mid = "grey", high = "red")
    DotPlot(dataset, group.by="cell_types", features = c("Inflammatory1","Proliferative1", "Resolution1")) + RotatedAxis() + scale_colour_gradient2(midpoint = 0, low = "blue", mid = "grey", high = "red")

6. Пример последующего анализа через CellChat

ЗАМЕТКА: Еще одним полезным и хорошо цитируемым методом анализа наборов данных об отдельных клетках является вывод о межклеточных взаимодействиях. В этом рабочем процессе используется пакет CellChat, который выводит межклеточные коммуникации путем анализа дифференциальных лиганд-рецепторных взаимодействий между клеточными группами22. Недавно разработчики CellChat опубликовали подробный пошаговый протокол для его обобщенного использования24, и это отличный ресурс для пользователей, поскольку они прорабатывают следующий рабочий процесс и применяют его к своим наборам данных. В качестве примера в следующем рабочем процессе сравниваются взаимодействия всех основных клеток в ранах через 1 и 14 дней после ранения (DPW). Каждый шаг не описан очень подробно, так как все шаги уже описаны в официальной публикации CellChat24 , а также в руководствах, ссылки на которые можно найти здесь:

Вывод и анализ межклеточной коммуникации с использованием
Сотовый чат: https://github.com/jinworks/CellChat/blob/master/tutorial/CellChat-vignette.html

Сравнительный анализ нескольких наборов данных с помощью CellChat:
https://github.com/jinworks/CellChat/blob/master/tutorial/Comparison_analysis_of_multiple_datasets.html

Необязательный шаг: При необходимости загрузите сохраненный файл RDS в качестве объекта Seurat:

dataset <- readRDS("dataset_post_Method3.rds")

  1. Подразделите исходный набор данных на два набора данных в соответствии с аннотацией DPW.
    Idents(dataset) <- "DPW"
    dataset_D1 <- subset(dataset, ident = "D1")
    dataset_D14 <- subset(dataset, ident = "D14")
  2. Определите аннотацию, с помощью которой будет выполняться CellChat, --- в этом случае используйте основные типы ячеек.
    Idents(dataset_D1) <- "cell_types"
    Idents(dataset_D14) <- "cell_types"
  3. Создайте объекты CellChat и следуйте типичному рабочему процессу CellChat. Смотрите учебные пособия, ссылки на которые приведены выше, в качестве подробных справочников по каждому шагу.
    cellchat_D1 <- createCellChat(dataset_D1, group.by = "ident", assay = "RNA")
    cellchat_D14 <- createCellChat(dataset_D14, group.by = "ident", assay = "RNA")
    CellChatDB <- CellChatDB.mouse
    CellChatDB.use <- CellChatDB
    cellchat_D1@DB <- CellChatDB.use
    cellchat_D14@DB <- CellChatDB.use
    cellchat_D1 <- subsetData(cellchat_D1)
    cellchat_D14 <- subsetData(cellchat_D14)
    future::plan("multisession", workers = 4)
    cellchat_D1 <- identifyOverExpressedGenes(cellchat_D1, do.fast = F)
    cellchat_D14 <- identifyOverExpressedGenes(cellchat_D14, do.fast = F)
    cellchat_D1 <- identifyOverExpressedInteractions(cellchat_D1)
    cellchat_D14 <- identifyOverExpressedInteractions(cellchat_D14)
    cellchat_D1 <- computeCommunProb(cellchat_D1, type = "triMean", population.size = TRUE)
    cellchat_D14 <- computeCommunProb(cellchat_D14, type = "triMean", population.size = TRUE)
    cellchat_D1 <- filterCommunication(cellchat_D1, min.cells = 10)
    cellchat_D14 <- filterCommunication(cellchat_D14, min.cells = 10)
    cellchat_D1 <- computeCommunProbPathway(cellchat_D1)
    cellchat_D14 <- computeCommunProbPathway(cellchat_D14)
    cellchat_D1 <- aggregateNet(cellchat_D1)
    cellchat_D14 <- aggregateNet(cellchat_D14)
    cellchat_D1 <- netAnalysis_computeCentrality(cellchat_D1, slot.name = "netP")
    cellchat_D14 <- netAnalysis_computeCentrality(cellchat_D14, slot.name = "netP")
  4. Визуализируйте силу входящего и исходящего взаимодействия во всех основных типах клеток в каждой точке заживления раны (дополнительный рисунок 14).
    netAnalysis_signalingRole_scatter(cellchat_D1)
    netAnalysis_signalingRole_scatter(cellchat_D14)

    Фибробласты резко увеличивают свое взаимодействие между D1 и D14 DPW.
  5. Отображение списков всех значимых предполагаемых путей коммуникации между клетками.
    cellchat_D1@netP$pathways
    cellchat_D14@netP$pathways

    Коллагеновый путь является одним из важных путей как на D1, так и на D14 DPW.
  6. Сосредоточьтесь на сигнальном пути коллагена и его взаимодействии с фибробластами.
    pathways.show <- c("COLLAGEN")
  7. Визуализируйте взаимодействие коллагеновых сигнальных путей между типами клеток с помощью круговых диаграмм (дополнительный рисунок 15).
    par(mfrow=c(1,2))
    netVisual_aggregate(cellchat_D1, signaling = pathways.show, layout = "circle")
    netVisual_aggregate(cellchat_D14, signaling = pathways.show, layout = "circle")
    par(mfrow=c(1,1))
  8. Визуализируйте взаимодействие коллагеновых сигнальных путей между типами клеток с помощью диаграмм хорд (дополнительный рисунок 16).
    par(mfrow=c(1,2))
    strwidth <- function(x) {0.5}
    netVisual_aggregate(cellchat_D1, signaling = pathways.show, layout = "chord", vertex.label.cex = 0.6)
    netVisual_aggregate(cellchat_D14, signaling = pathways.show, layout = "chord", vertex.label.cex = 0.6)
    par(mfrow=c(1,1))
  9. Визуализируйте взаимодействие сигнального пути COLLAGEN с фибробластами как клетками-источниками (дополнительный рисунок 17).
    ЗАМЕТКА: Типы клеток в объектах cellchat перечислены как идентификаторы в том порядке, в котором они были назначены в исходном объекте Сёра: 1 = Макрофаг, 2 = Нейтрофил, 3 = Фибробласт, 4 = Эпителиальная клетка, 5 = Эндотелиальная клетка, 6 = Т-клетка, 7 = Гладкомышечная клетка.
    par(mfrow=c(1,2))
    strwidth <- function(x) {0.5}
    netVisual_aggregate(cellchat_D1, signaling = pathways.show, layout = "chord", vertex.label.cex = 0.6, sources.use = 3)
    netVisual_aggregate(cellchat_D14, signaling = pathways.show, layout = "chord", vertex.label.cex = 0.6, sources.use = 3)
    ​par(mfrow=c(1,1))
  10. Визуализируйте вклад каждой пары лиганд-рецептор в сигнальный путь COLLAGEN с фибробластами в качестве исходных клеток.
    1. Использование пузырьковых диаграмм (дополнительный рисунок 18):
      gg1 <- netVisual_bubble(cellchat_D1, sources.use = 3, targets.use = NULL, signaling = pathways.show, remove.isolate = FALSE)
      gg2 <- netVisual_bubble(cellchat_D14, sources.use = 3, targets.use = NULL, signaling = pathways.show, remove.isolate = FALSE)
      ​gg1 + gg2
    2. Использование диаграмм хорд (дополнительный рисунок 19):
      par(mfrow=c(1,2))
      strwidth <- function(x) {0.4}
      netVisual_chord_gene(cellchat_D1, sources.use = 3, targets.use = NULL, signaling = pathways.show, lab.cex = 0.6, show.legend= F)
      netVisual_chord_gene(cellchat_D14, sources.use = 3, targets.use = NULL, signaling = pathways.show, lab.cex = 0.6, legend.pos.x = 60)
      ​par(mfrow=c(1,1))
  11. Сосредоточьтесь на взаимодействии лиганд-рецептор Col1a1-Cd44 в сигнальном пути COLLAGEN.
    ​LR.show <- "COL1A1_CD44"
  12. Визуализируйте лиганд-рецепторные взаимодействия Col1a1-Cd44 между типами клеток с помощью хордовых диаграмм (дополнительный рисунок 20).
    strwidth <- function(x) {0.5}
    netVisual_individual(cellchat_D1, signaling = pathways.show, pairLR.use = LR.show, layout = "chord")
    netVisual_individual(cellchat_D14, signaling = pathways.show, pairLR.use = LR.show, layout = "chord")
  13. Выполнение дифференциального анализа CellChat путем создания объединенного объекта CellChat.
    object.list_D14_v_D1 <- list(D1 = cellchat_D1, D14 = cellchat_D14)
    cellchat_D14_v_D1 <- mergeCellChat(object.list_D14_v_D1, add.names = names(object.list_D14_v_D1))
  14. Визуализируйте общее количество и относительную силу межклеточных взаимодействий в точках заживления ран (дополнительный рисунок 21).
    gg1 <- compareInteractions(cellchat_D14_v_D1, show.legend = F)
    gg2 <- compareInteractions(cellchat_D14_v_D1, show.legend = F, measure = "weight")
    gg1 + gg2
  15. Визуализируйте с помощью кругового графика дифференциальную силу межклеточного взаимодействия между каждым типом клеток при переходе раны от 1-го дня к 14-му дню (дополнительный рисунок 22).
    netVisual_diffInteraction(cellchat_D14_v_D1, weight.scale = T, measure = "weight")
  16. Визуализируйте с помощью тепловой карты дифференциальную силу межклеточного взаимодействия между каждым типом клеток при переходе раны от 1-го дня к 14-му дню (дополнительный рисунок 23).
    netVisual_heatmap(cellchat_D14_v_D1, measure = "weight")
  17. Визуализируйте с помощью ранговой диаграммы относительный вклад отдельных путей в межклеточные взаимодействия с фибробластами в качестве исходных клеток на 14-й день по сравнению с 1-м днем (дополнительный рисунок 24).
    rankNet(cellchat_D14_v_D1, mode = "comparison", measure = "weight", sources.use = 3, targets.use = NULL, stacked = T, do.stat = TRUE)
  18. Визуализируйте с помощью пузырьковых графиков относительный вклад отдельных пар лиганд-рецептор в сигнальный путь коллагена с фибробластами в качестве исходных клеток на 14-й день по сравнению с 1-м днем (дополнительный рисунок 25).
    gg1 <- netVisual_bubble(cellchat_D14_v_D1, sources.use = 3, targets.use = NULL, signaling = pathways.show, comparison = c(1, 2), max.dataset = 2, title.name = "Increased signaling in D14", angle.x = 45, remove.isolate = F)
    gg2 <- netVisual_bubble(cellchat_D14_v_D1, sources.use = 3, targets.use = NULL, signaling = pathways.show, comparison = c(1, 2), max.dataset = 1, title.name = "Decreased signaling in D14", angle.x = 45, remove.isolate = F)
    gg1 + gg2
  19. Как и объекты Seurat, объекты CellChat можно сохранять и открывать в виде файлов RDS.
    saveRDS(cellchat_D1, "cellchat_D1.rds")
    saveRDS(cellchat_D14, "cellchat_D14.rds")
    saveRDS(cellchat_D14_v_D1, "cellchat_D14_v_D1.rds")
  20. Необязательный шаг: объекты CellChat также могут быть открыты из файлов RDS.
    cellchat_D1 <- readRDS("cellchat_D1.rds")
    cellchat_D14 <- readRDS("cellchat_D14.rds")
    cellchat_D14_v_D1 <- readRDS("cellchat_D14_v_D1.rds")

7. Пример интегративного анализа путем объединения нескольких наборов данных по одной ячейке

ЗАМЕТКА: Наборы данных с одной ячейкой часто разделяются на несколько файлов, так как они были упорядочены в пакетах или группах. В этом рабочем процессе показано, как интегрировать две из пяти партий набора данных 20 по заживлению ран. Современные методы интеграции наборов данных описываются следующими виньетками Сёра:

Введение в интеграцию scRNA-seq:
https://satijalab.org/seurat/articles/integration_introduction

Интегративный анализ в Seurat v5:

https://satijalab.org/seurat/articles/seurat5_integration

Заметка: Существует множество методов интеграции наборов данных с одной ячейкой, каждый из которых имеет свои сильные и слабые стороны. Подробнее см. в комплексном бенчмарке методов интеграции25. Важно, чтобы пользователь прочитал всю соответствующую документацию, прежде чем полагаться на какой-либо один метод интеграции.

  1. Повторите все шаги, описанные в методе 2, для другой партии набора данных20 Hu et al. В следующем протоколе используется партия #3. Дополнительный файл скрипта R включен в комплект поставки и может быть использован для обработки пакета #3 (Supplementary File 3: JoVE_Rscript_b3. R). Не забудьте создать и использовать новую переменную для набора данных --- в приведенном ниже коде используйте "dataset_b3" для пакета набора данных #3.
    1. Необязательный шаг: При необходимости откройте два набора данных как объекты Seura из их RDS-файлов, сохраненных в рабочем каталоге:
      dataset <- readRDS("dataset_post_Method2.rds")
      dataset_b3 <- readRDS("dataset_b3_post_Method2.rds")
  2. Назначьте каждому набору данных новую переменную с именем "batch", чтобы пометить исходный набор данных в последующих анализах.
    dataset@meta.data$batch <- "b1"
    dataset_b3@meta.data$batch <- "b3"
  3. Выполните слияние двух наборов данных по методу Сёра, добавив аннотации идентификаторов ячеек на основе пакета, а затем выполните стандартный рабочий процесс Сёра для объединенного набора данных, как описано в методе 3.
    dataset_merged <- merge(x = dataset, y = c(dataset_b3), add.cell.ids = c("b1", "b3"), merge.data = TRUE)
    DefaultAssay(dataset_merged) <- "RNA"
    dataset_merged <- NormalizeData(dataset_merged)
    dataset_merged <- FindVariableFeatures(dataset_merged)
    dataset_merged <- ScaleData(dataset_merged)
    dataset_merged <- RunPCA(dataset_merged)
    ElbowPlot(dataset_merged, reduction = "pca", ndims = 50)
  4. Выполнение кластеризации и анализа UMAP на объединенном наборе данных перед интеграцией данных.
    dataset_merged <- FindNeighbors(dataset_merged, dims = 1:10, reduction = "pca")
    dataset_merged <- FindClusters(dataset_merged, resolution = .1, cluster.name = "unintegrated_clusters")
    dataset_merged <- RunUMAP(dataset_merged, dims = 1:10, seed.use = 123, reduction = "pca", reduction.name = "umap.unintegrated")
  5. Визуализируйте график UMAP в соответствии с номерами кластеров и партий (дополнительный рисунок 26).
    DimPlot(dataset_merged, reduction = "umap.unintegrated", group.by = c("seurat_clusters", "batch"))
  6. Отображение распределения номеров ячеек в каждом кластере в соответствии с номером партии.
    table(dataset_merged$batch, dataset_merged$seurat_clusters)
    ЗАМЕТКА: Из графика UMAP и таблицы видно, что для этих двух наборов данных не существует каких-либо существенных пакетных эффектов. Свидетельства пакетных эффектов будут проявляться в виде неожиданных расхождений в распределении кластеров между двумя наборами данных, что может означать, что между наборами данных существуют потенциальные технические различия, которые перекрывают фактические биологические сходства.
  7. Выполните интеграцию данных Seura с помощью метода RPCA. Для получения дополнительной информации об этом и других методах интеграции данных, пожалуйста, ознакомьтесь с виньеткой Seura по ссылке выше.
    dataset_merged <- IntegrateLayers(
    object = dataset_merged, method = RPCAIntegration,
    orig.reduction = "pca", new.reduction = "integrated.rpca",
    verbose = TRUE
    )
  8. Выполнение кластеризации и анализа UMAP на объединенном наборе данных после интеграции данных.
    FindNeighbors(dataset_merged, dims = 1:10, reduction = "integrated.rpca")
    dataset_merged <- FindClusters(dataset_merged, resolution = .1, cluster.name = "rpca_clusters")
    dataset_merged <- RunUMAP(dataset_merged, dims = 1:10, seed.use = 123, reduction = "integrated.rpca", reduction.name = "umap.rpca")
  9. Визуализируйте график UMAP в соответствии с номерами кластеров и партий после интегрирования (дополнительный рисунок 27).
    DimPlot(dataset_merged, reduction = "umap.rpca", group.by = c("seurat_clusters","batch"))
  10. Отображение распределения номеров ячеек в каждом кластере в соответствии с номером пакета после интеграции.
    table(dataset_merged$batch, dataset_merged$seurat_clusters)
    Судя по графику UMAP и таблице интегрированных данных, теперь наблюдается отличное перекрытие между двумя пакетами в разных кластерах. Интересно, что интеграция данных привела к выявлению дополнительного кластера с использованием тех же параметров кластеризации.
  11. После интеграции набора данных и перед последующим анализом слои объединенного набора данных должны быть соединены.
    dataset_merged <- JoinLayers(dataset_merged)
  12. Сохраните объект Seurat набора данных в виде файла RDS в рабочем каталоге.
    saveRDS(dataset_merged, "merged_dataset_post_Method7.rds")

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Начиная с метода #2, протокол проходит через шаги по загрузке и выполнению шагов контроля качества на наборе данных о заживлении ран из одной клетки. После создания объекта Сёра (шаг 2.6.2) серия шагов объединяет два анализа в наборе данных (РНК и белок; шаги 2.6.3-2.6.7) и выполняет декомплексирование анализа белка в соответствии с пространственно-временными штрих-кодами (шаги 2.6.8-2.6.9). Функция декомплексинга присваивает несколько меток метаданных каждой ячейке в наборе данных, включая «barcodes_maxID», которая определяет наиболее вероятный пространственно-временной штрих-код каждой ячейки (шаг 2.6.10). На шаге 2.6.11 выполняется функция графика скрипки для визуализации распределения обнаруженных генов в клетках на основе их мультиплексированных штрих-кодов. Репрезентативный результат этого шага (дополнительный рисунок 1) показывает, что существует довольно равномерное распределение обнаруженных генов для каждого штрих-кода, что важно для целостности набора данных и последующего анализа временных точек заживления ран. После присвоения соответствующей метки белковым штрих-кодам (шаг 2.6.12) протокол показывает, как выполнять этапы контроля качества анализа РНК набора данных, начиная с расчета процента митохондриальных генов в каждой клетке (шаг 2.9). На шаге 2.10 выполняется функция диаграммы рассеяния признаков для визуализации распределения обнаруженных генов, количества РНК и процентного соотношения митохондрий во всех клетках. Репрезентативные результаты этого этапа (дополнительный рисунок 2) показывают, что существует ряд клеток с большим содержанием митохондрий, что коррелирует с низким количеством РНК и идентифицирует мертвые или умирающие клетки. После удаления клеток с низким количеством РНК и большим содержанием митохондрий (шаг 2.11) на шаге 2.12 выполняется еще одна функция диаграммы рассеяния признаков на наборе данных, и репрезентативный результат этого шага (дополнительный рисунок 3) показывает, что распределение обнаруженных генов и процентное содержание митохондриальных РНК на клетку теперь более нормальное, что открывает путь для надежного последующего анализа. Далее протокол описывает использование функции scDblFinder для определения вероятных дублетов в наборе данных и присваивает каждой ячейке новые метаданные под названием «scDblFinder.score» (шаги 2.13-2.14). На шаге 2.15 выполняется функция графика скрипки для визуализации распределения дуплетных оценок в наборе данных, и репрезентативный результат этого шага (дополнительный рисунок 4) показывает, что существует ряд ячеек с относительно высокими дублетными оценками, и что 0,25 выглядит как естественный порог, выше которого находится популяция вероятных дублетов. Таким образом, в следующих шагах этот параметр используется для подмножества набора данных до ячеек ниже порогового значения (шаг 2.16), тем самым завершая шаги контроля качества для этого набора данных с одной ячейкой.

Начиная с метода #3, протокол проходит через этапы анализа набора данных о заживлении одиночных ран с контролем качества с использованием пакета Сёра и рабочего процесса. После нормализации и масштабирования данных РНК проводится анализ PCA (шаг 3.1). На шаге 3.2 функция графика локтя используется для визуализации величины вариации набора данных по отношению к первым 50 измерениям PCA и репрезентативного результата этого шага (Дополнительный рисунок 5) показывает, что большая часть основных вариаций происходит в пределах первых 13 измерений, обозначенных изгибом графика. Затем в протоколе показано, как найти соседей и выполнить кластеризацию клеток (шаг 3.3) и уменьшение размерности UMAP (шаг 3.4) набора данных с использованием первых 13 измерений PCA и относительно низкого параметра разрешения кластеризации 0,1, оба из которых были выбраны для определения наиболее обобщаемых основных типов клеток в ранах. На шаге 3.5 функция размерного графика выполняется для визуализации кластеризации ячеек на графике UMAP и репрезентативного результата этого шага (Рисунок 1) показывает, что все ячейки в наборе данных сгруппированы вокруг 8 основных кластерных групп Сёра с цветовой кодировкой, с немного отличающимися графиками UMAP, полученными с компьютера под управлением Windows (слева) и MacOS (справа). На шаге 3.6 выполняется еще одна функция размерного графика для визуализации аннотации клеток во времени/пространстве раны и репрезентативного результата этого шага (Рисунок 2) показывает, что все ячейки в наборе данных распределены в соответствии с их временно-пространственным происхождением, без видимой кластеризации в соответствии с аннотацией времени/пространства. Далее в протоколе описывается, как получить списки дифференциально экспрессируемых генов и сохранить их в текстовом файле (шаг 3.8), открыть таблицу данных в электронной таблице и выполнить различные шаги фильтрации для получения наиболее ранжированных кластерных маркеров для каждого кластера клеток (шаги 3.9-3.10.6). Репрезентативный результат этих шагов (Дополнительная таблица 1) — конечный файл электронной таблицы, содержащий полный вывод ранжированных дифференциально экспрессируемых генов, в то время как другой репрезентативный результат (Дополнительная таблица 2) представляет собой упрощенную таблицу, показывающую 5 основных активированных и экспрессированных генов для каждого кластера Сёра. Затем в протоколе описывается, как использовать веб-инструмент анализа функционального обогащения под названием EnrichR для идентификации предполагаемых типов клеток в соответствии с основными генами кластерных маркеров (шаги 3.11-3.12), а также репрезентативные результаты этих шагов (Рисунок 3) — это обрезанные скриншоты выходных данных EnrichR, показывающие наиболее обогащенные типы ячеек для каждого из восьми кластеров ячеек. Затем протокол присваивает новую метку метаданных под названием «cell_types» всем ячейкам в соответствующих кластерах Seura в соответствии с их наиболее обогащенными аннотациями типов клеток (шаг 3.14). На шаге 3.15 выполняется функция размерного графика для визуализации переименованных кластеров ячеек в виде аннотаций типов ячеек на графике UMAP, а репрезентативные результаты этого шага (Рисунок 4) показало, что все ячейки в наборе данных кластеризованы вокруг основных типов ячеек с цветовой кодировкой. На шаге 3.16 функция графика признаков была использована для визуализации локализации генов основных кластерных маркеров (из дополнительной таблицы 2) на серии графиков UMAP, и репрезентативные результаты (Рисунок 5) представляет собой сетку графиков UMAP, показывающую высокую экспрессию генов основных клеточных маркеров в соответствующих кластерах основных типов клеток. На этапах 3.17 и 3.18 была выполнена функция точечной диаграммы для визуализации относительных уровней экспрессии генов основных кластерных маркеров в клетках, сначала сгруппированных по их исходным номерам кластеров Сёра (шаг 3.17), а затем сгруппированных по аннотированным меткам типов клеток (шаг 3.18). Репрезентативные результаты этих этапов подтвердили высокий уровень экспрессии генов ведущих клеточных маркеров только в соответствующих кластерах Сёра (Дополнительный рисунок 6) и только в соответствующих основных типах ячеек (Рисунок 6). Следующим шагом в протоколе является упрощение исходных пространственно-временных белковых меток до строго временных аннотаций, которые идентифицируют клетки на основе дней после ранения (DPW), из которых они произошли. На шаге 3.20 выполняется функция размерного графика для визуализации ячеек в виде аннотаций DPW на графике UMAP и репрезентативных результатов этого шага (Дополнительный рисунок 7) показала локализацию аннотаций о временном течении раны в наборе данных о заживлении одиночных клеток. Как и ожидалось, аннотации первого дня (D1) доминировали в кластерах нейтрофилов и макрофагов, в то время как более поздние временные точки заживления ран были более представлены в других типах клеток. На следующих этапах протокола использовались столбчатые диаграммы с накоплением, чтобы сначала визуализировать пропорции DPW в различных типах клеток (шаг 3.22), а затем визуализировать пропорции типов клеток в различных временных точках (3.23). Репрезентативными результатами этих шагов являются пропорциональные графики, показывающие относительное количество ячеек DPW в каждой категории основных типов ячеек (Дополнительный рисунок 8) и относительное число основных типов ячеек в каждой категории DPW (Рисунок 7). Эти результаты подтвердили известный клеточный каскад заживления кожных ран, при котором иммунные клетки (нейтрофилы и макрофаги) доминируют в ранних временных точках во время воспалительной фазы, а другие типы клеток (эпителиальные клетки и эндотелиальные клетки) начинают появляться во время пролиферативной фазы, причем фибробласты особенно доминируют в более поздние временные точки во время заживления раны.

Начиная с метода #4, в протоколе описываются шаги по использованию метода Сёра, чтобы сосредоточиться на отдельном основном типе клеток в наборе данных одиночных клеток с целью идентификации потенциальных клеточных подтипов во время заживления ран. Протокол фокусируется на фибробластах, которые первоначально были сгруппированы в два кластера Сёра, прежде чем они были объединены в одну категорию, и описывает, как создать новый объект Сёра, который содержит только фибробласты из исходного набора данных (шаг 4.1). Рабочий процесс Сёра выполняется на этом наборе данных, специфичном для фибробластов (шаги 4.2-4.4), при этом на шаге 4.2 создается график локтя (дополнительный рисунок 9), показывающий, что большая часть основных вариаций в наборе данных фибробластов происходит в пределах первых 9 измерений PCA. На шаге 4.5 выполняется функция размерного графика для визуализации кластеризации клеток на графике UMAP, и репрезентативные результаты этого шага (рис. 8) показали, что фибробласты в наборе данных сгруппированы вокруг 3 подтипов клеток с цветовой кодировкой. Визуализация набора данных фибробластов в соответствии с их аннотацией DPW (шаг 4.6) привела к созданию графика UMAP (дополнительный рисунок 10), показывающего фибробласты в наборе данных, распределенные по всему набору данных в соответствии с их аннотацией DPW. Далее в протоколе описывается, как получить списки дифференциально экспрессируемых генов и сохранить их в текстовом файле (шаг 4.7), открыть таблицу данных в Excel и выполнить различные шаги фильтрации для получения наиболее ранжированных кластерных маркеров для каждого клеточного кластера (шаг 4.8), а также назначить новую переменную, перечисляющую основные гены маркеров фибробластов с именем «FB_type_marker» (шаг 4.9). На шаге 4.10 функция точечной диаграммы используется для визуализации генов в списке в наборе данных, предназначенном только для фибробластов, путем вызова переменной «FB_type_marker» в параметре features, и репрезентативными результатами этого шага (рис. 9) являются точечные диаграммы, подтверждающие высокую экспрессию маркеров подтипов фибробластов только в соответствующих кластерных категориях (вверху), но справедливо распределенных по категориям DPW (внизу). На шаге 4.11 вызывается та же переменная признаков для визуализации генов маркеров фибробластов в общем наборе данных о заживлении ран, и репрезентативным результатом (дополнительный рисунок 11) является точечная диаграмма, которая подтвердила высокую экспрессию маркеров подтипа фибробластов в основном в исходном фибробласте. Наконец, на следующих этапах протокола использовались сложенные столбчатые диаграммы, чтобы сначала визуализировать пропорции DPW по трем подтипам фибробластов (шаг 4.12), а затем визуализировать пропорции подтипов фибробластов в различные временные точки (шаг 4.13). Репрезентативными результатами этих этапов являются пропорциональные графики, показывающие относительное количество клеток DPW в каждой категории подтипов фибробластов (дополнительный рисунок 12) и относительное количество подтипов фибробластов в каждой категории DPW (дополнительный рисунок 13). Эти результаты указывают на значительное изменение пропорций подтипов фибробластов в течение периода заживления, при этом первый подтип фибробластов (кластер 0) преимущественно доминирует в ранах на ранних стадиях (D1 и D3), второй подтип (кластер 1) доминирует во время разрешения раны (D14), а третий подтип (кластер 2) наиболее доминирует во время пролиферативной фазы заживления раны (D7).

Начиная с метода #5, протокол проходит через шаги по анализу набора данных об заживлении одноклеточных ран с использованием функции оценки модуля в Seurat. Сначала в протоколе описываются этапы использования текстового файла с вкладками для загрузки наборов генов в переменные в R (шаги 5.1-5.2), а затем применяется функция модульной оценки к трем наборам генов, относящимся к трем основным фазам заживления ран (шаг 5.3). На шаге 5.4 функция точечной диаграммы используется для визуализации совокупных оценок модулей по двум различным категориям метаданных, и репрезентативными результатами для этого шага (рис. 10) являются точечные диаграммы, показывающие среднюю экспрессию основных модулей фазы заживления по клеткам в категории дней после ранения (DPW, справа) и по категории основных типов клеток (слева). Эти результаты показывают, что применение профилей экспрессии генов, основанных на массовом секвенировании, к наборам данных экспрессии одиночных клеток в псевдообъемном виде является мощным методом для сравнительных подходов биоинформатики с использованием ранее опубликованных наборов данных в области заживления ран.

Начиная с метода #6, протокол проходит через этапы анализа набора данных о заживлении одиночных ран, полученного из метода Сёра, с использованием пакета CellChat и рабочего процесса в соответствии с конкретным научным вопросом сравнения клеток, полученных из ран ранней и поздней фазы, по сравнению с ранами поздней стадии. Протокол сначала подразделяет общий набор данных Сёра на две временные точки после травмы, одна во время воспалительной фазы (день 1 (D1)) и другая во время заживления раны (день 14 (D14)) (шаг 6.1). Создаются два объекта CellChat, и протокол проходит через все типичные функции протокола CellChat для вычисления всех предполагаемых взаимодействий между типами клеток, идентифицированными в методе #3 протокола (шаги 6.2-6.3). На шаге 6.4 выполняется функция диаграммы рассеяния сигнализации для визуализации силы входящего и исходящего взаимодействия во всех основных типах клеток в каждой точке заживления раны. Репрезентативные результаты этого шага (Дополнительный рисунок 14) представляют собой точечные диаграммы, показывающие силу входящих (ось y) и исходящих (ось x) взаимодействий для основных типов ячеек в точках D1 (слева) и D14 (справа). Эти результаты показали, что иммунные клетки, такие как нейтрофилы и макрофаги, имеют самую высокую силу межклеточного взаимодействия во время воспалительной фазы, но фибробласты доминируют во взаимодействиях между клетками во время разрешения ран, что подтверждает десятилетия исследований заживления ран. Следующие шаги сосредотачивают анализ на одном из значительно обогащенных путей, коллагеновом пути (шаги 6.5-6.6). На шаге 6.7 выполняется функция круговой диаграммы для визуализации взаимодействия сигнальных путей коллагена между типами клеток в двух временных точках. Репрезентативные результаты этого шага (Дополнительный рисунок 15) представляют собой круговые графики, показывающие предполагаемые сигнальные взаимодействия коллагеновых путей между всеми типами клеток в точках D1 (слева) и D14 (справа). На шаге 6.8 те же взаимодействия визуализируются с помощью функции диаграммы хорд с репрезентативными результатами (Дополнительный рисунок 16) представляют собой хордовые диаграммы, показывающие предполагаемые сигнальные взаимодействия коллагеновых путей между всеми типами клеток в каждый момент времени. Как и ожидалось, эти результаты показали, что фибробласты являются основными клетками-источниками для сигнального пути коллагена, хотя поток информации был более ограничен иммунными клетками в D1 по сравнению с D14. Чтобы сосредоточиться на фибробласте как на исходной клетке во взаимодействиях между клетками, на шаге 6.9 повторяется функция диаграммы хорды, добавляется параметр исходной клетки, и репрезентативные результаты (Дополнительный рисунок 17) представляют собой хордовые диаграммы, показывающие предполагаемые взаимодействия коллагенового пути с фибробластами в качестве исходных клеток в каждой временной точке. На шаге 6.10 выполняются две функции для визуализации вклада каждой пары лиганд-рецептор в сигнальный путь коллагена с фибробластами в качестве исходных клеток, одна из которых используется с помощью пузырьковых диаграмм (шаг 6.10.1), а другая – с помощью хордовых диаграмм (шаг 6.10.2). Репрезентативные результаты показывают предполагаемый вклад каждой пары лиганд-рецептор в передачу сигналов коллагенового пути с фибробластами в качестве исходных клеток в точках D1 (слева) и D14 (справа) с использованием обоих пузырьковых графиков (Дополнительный рисунок 18) и аккордовые диаграммы (Дополнительный рисунок 19). Эти результаты показали, что в D1 коллагеновый путь, идущий от фибробластов, был ограничен нейтрофилами и макрофагами с доминированием рецепторов Cd44 и Sdc4, но в D14 другие клетки действовали как реципиенты через различные рецепторы, включая интегрины. Чтобы сосредоточиться на лиганд-рецепторном взаимодействии Col1a1-Cd44, которое продемонстрировало сильные стороны во взаимодействиях фибробластов, задается параметр (шаг 6.11), который затем используется на шаге 6.12 в функции диаграммы хорд для визуализации этого конкретного лиганд-рецепторного взаимодействия между всеми типами клеток с репрезентативными результатами (Дополнительный рисунок 20) — хордовые диаграммы, показывающие предполагаемые взаимодействия лиганд-рецепторов Col1a1-Cd44 между всеми типами клеток в точках времени D1 (слева) и D14 (справа). Эти результаты показали, что в то время как в D1 это взаимодействие ограничено фибробластами в качестве исходных клеток, в D14 макрофаги и гладкомышечные клетки также выступают в качестве исходных клеток. Далее в протоколе описывается, как выполнить дифференциальный анализ CellChat путем слияния объектов D1 и D14 CellChat (шаг 6.13). На шаге 6.14 выполняется функция сравнения взаимодействий для визуализации общего числа и относительной силы межклеточных взаимодействий между двумя временными точками заживления ран, а также репрезентативных результатов (Дополнительный рисунок 21) представляют собой результирующие столбчатые диаграммы, показывающие общее число (слева) и силу (справа) предполагаемых взаимодействий в клетках, содержащих раны D1 и D14, с более высоким числом взаимодействий в D14 по сравнению с более высокими относительными силами взаимодействий в D1. На шагах 6.15 и 6.16 используются две функции для визуализации дифференциальной интенсивности межклеточного взаимодействия между клетками между каждым типом клеток при переходе раны от дня 1 к дню 14 с соответствующими репрезентативными результатами, первая из которых представляет собой круговой график (шаг 6.15, Дополнительный рисунок 22) и второе - тепловая карта (шаг 6.16, Дополнительный рисунок 23), где повышенное взаимодействие в D14 по сравнению с D1 показано красным цветом, а уменьшенное — синим. Как и ожидалось, нейтрофильно- и макрофагально-опосредованные взаимодействия увеличиваются в D1, а фибробласт-опосредованные взаимодействия увеличиваются в D14. На шаге 6.17 функция ранжирования используется для создания графика, который ранжирует относительный вклад отдельных путей в межклеточные взаимодействия с фибробластами в качестве исходных клеток на D14 по сравнению с D1, а репрезентативные результаты (Дополнительный рисунок 24) показывают результирующую диаграмму рангов, где D1 представлен вверху красным цветом, а D14 внизу синим, при этом несколько путей представлены исключительно в D1 или D14, а многие другие показывают градиент активации. Наконец, на шаге 6.18 используются две функции пузырьковых диаграмм, чтобы показать относительный вклад отдельных пар лиганд-рецептор в сигнальный путь коллагена с фибробластами в качестве исходных клеток в D14 по сравнению с D1, с соответствующими репрезентативными результатами (Дополнительный рисунок 25), демонстрируя увеличение (слева) и уменьшение (справа) сигнальных пар в D14 по сравнению с D1 во многих межклеточных взаимодействиях на оси X. Как и ожидалось, фибробласты имели гораздо больше исходящих парных взаимодействий лиганд-рецептор через несколько клеток-приемников в ранах D14 по сравнению с ранами D1, где связь была более ограниченной в сторону нейтрофилов и макрофагов во время воспалительной фазы.

Начиная с метода #7, протокол проходит через шаги по интеграции двух наборов данных о заживлении одиночных клеток ран с помощью Seurat. Сначала в протоколе описываются шаги по объединению двух пакетов опубликованных наборов данных с отдельными ячейками и применению стандартного рабочего процесса Seurat к объединенному набору данных (шаги 7.1–7.4). На шаге 7.5 функция размерного графика используется для визуализации графика UMAP в соответствии с номерами кластеров и партий объединенного, но еще не интегрированного набора данных о заживлении ран. Репрезентативными результатами этого шага (дополнительный рисунок 26) являются графики UMAP, которые визуализируют распределение кластеров Сёра (слева) и номеров партий (справа), показывая, что для этих двух наборов данных не наблюдается каких-либо существенных пакетных эффектов до интеграции данных. Затем протокол выполняет интеграцию данных с использованием метода RPCA и последующего рабочего процесса Seurat интегрированного набора данных (шаги 7.7-7.8). На шаге 7.9 функция размерного графика используется для визуализации графика UMAP в соответствии с номерами кластеров и партий интегрированного набора данных о заживлении ран. Репрезентативными результатами этого шага (дополнительный рисунок 27) являются графики UMAP, которые визуализируют распределение кластеров Сёра (слева) и номеров партий (справа), показывая, что теперь между двумя пакетами наблюдается еще большее перекрытие в разных кластерах. Результаты также показывают появление дополнительного кластера после интеграции данных, что может указывать на повышенную способность идентифицировать потенциально значимые подтипы клеток после контроля технических эффектов пакетов данных.

figure-results-1
Рисунок 1: График UMAP, показывающий все ячейки в наборе данных, сгруппированные вокруг 8 основных кластерных групп с цветовой кодировкой. Результаты получены с компьютера под управлением Windows (слева) и MacOS (справа). Этот рисунок соответствует шагу 3.5. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-2
Рисунок 2: График UMAP, показывающий все ячейки в наборе данных, распределенные в соответствии с их временно-пространственным происхождением, без видимой кластеризации в соответствии с аннотацией времени/пространства. Этот рисунок соответствует шагу 3.6. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-3
Рисунок 3: Обрезанные скриншоты выходных данных EnrichR, показывающие наиболее обогащенные типы клеток для каждого кластера ячеек. Этот рисунок соответствует шагу 3.13. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-4
Рисунок 4: График UMAP, показывающий все ячейки в наборе данных, сгруппированные вокруг основных типов ячеек с цветовой кодировкой. Этот рисунок соответствует шагу 3.15. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-5
Рисунок 5: Сетка графиков UMAP, показывающая высокую экспрессию генов основных клеточных маркеров в кластерах основных типов клеток. Этот рисунок соответствует шагу 3.16. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-6
Рисунок 6: Точечные диаграммы, подтверждающие высокий уровень экспрессии генов основных клеточных маркеров только в соответствующих основных типах клеток. Этот рисунок соответствует шагу 3.18. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-7
Рисунок 7: График пропорций, показывающий относительное количество основных типов клеток в каждой категории DPW. Этот рисунок соответствует шагу 3.23. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-8
Рисунок 8: График UMAP, показывающий фибробласты в наборе данных, сгруппированные вокруг 3 подтипов клеток с цветовой кодировкой. Этот рисунок соответствует шагу 4.5. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-9
Рисунок 9: Точечные диаграммы, подтверждающие высокую экспрессию маркеров подтипов фибробластов только в соответствующих кластерных категориях, но справедливо распределенные по категориям DPW. Этот рисунок соответствует шагу 4.10. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

figure-results-10
Рисунок 10: Точечные диаграммы, показывающие среднюю экспрессию основных модулей фазы заживления в клетках для каждого DPW и для каждого основного типа клеток. Этот рисунок соответствует шагу 5.4. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этой цифры.

Дополнительный рисунок 1: Результаты, показывающие, что существует довольно равномерное распределение обнаруженных генов для каждого штрих-кода, что важно для целостности набора данных и последующего анализа временных точек заживления ран. Этот рисунок соответствует шагу 2.6.11. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 2: Диаграммы рассеяния, показывающие, что существует ряд клеток с большим содержанием митохондрий, что коррелирует с низким количеством РНК --- это мертвые или умирающие клетки. Этот рисунок соответствует шагу 2.10. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 3: Диаграммы рассеяния, показывающие, что распределение обнаруженных генов и процентное содержание митохондриальной РНК в клетке теперь более нормальное, что открывает путь для надежного последующего анализа. Этот рисунок соответствует шагу 2.12. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 4: График Скрипки, показывающий, что существует ряд клеток с относительно высокой оценкой дуплета, и что 0,25 выглядит как естественный предел, выше которого находится популяция вероятных дублетов. Этот рисунок соответствует шагу 2.15. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 5: График локтя, показывающий, что большая часть основных вариаций происходит в пределах первых 13 измерений. Этот рисунок соответствует шагу 3.2. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 6: Точечная диаграмма, подтверждающая высокий уровень экспрессии генов ведущих клеточных маркеров только в соответствующих кластерах Сёра. Этот рисунок соответствует шагу 3.17. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 7: График UMAP, показывающий локализацию аннотаций о временном ходе раны в наборе данных о заживлении ран. Этот рисунок соответствует шагу 3.20. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 8: График пропорций, показывающий относительное количество ячеек DPW в каждой основной категории типов клеток. Этот рисунок соответствует шагу 3.22. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 9: График локтя, показывающий, что большая часть основных вариаций в наборе данных фибробластов происходит в пределах первых 9 измерений. Этот рисунок соответствует шагу 4.2. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 10: График UMAP, показывающий фибробласты в наборе данных, распределенные по всему набору данных в соответствии с их аннотацией DPW. Этот рисунок соответствует шагу 4.6. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 11: Точечная диаграмма, подтверждающая высокую экспрессию маркеров подтипа фибробластов в основном в исходном кластере фибробластов. Этот рисунок соответствует шагу 4.11. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 12: График пропорций, показывающий относительное число подтипов фибробластов в каждой категории DPW. Этот рисунок соответствует шагу 4.12. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 13: График пропорций, показывающий относительное количество фибробластов по DPW в каждой категории подтипов фибробластов. Этот рисунок соответствует шагу 4.13. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 14: Диаграммы рассеяния, показывающие силу входящих (ось y) и исходящих (ось x) взаимодействий для основных типов клеток в точках 1 дня (D1, слева) и дня 14 (D14, справа). Этот рисунок соответствует шагу 6.4. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 15: Круговые графики, показывающие предполагаемые сигнальные взаимодействия коллагенового пути между всеми типами клеток в каждой категории DPW. Этот рисунок соответствует шагу 6.7. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 16: Хордовые диаграммы, показывающие предполагаемые сигнальные взаимодействия коллагенового пути между всеми типами клеток в каждой категории DPW. Этот рисунок соответствует шагу 6.8. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 17: Хордовые диаграммы, показывающие предполагаемые сигнальные взаимодействия коллагенового пути с фибробластами в качестве исходных клеток в каждой категории DPW. Этот показатель соответствует шагу 6.9. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 18: Пузырьковые диаграммы, показывающие предполагаемый вклад каждой пары лиганд-рецептор в передачу сигналов коллагенового пути с фибробластами в качестве исходных клеток в каждой категории DPW. Этот рисунок соответствует шагу 6.10.1. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 19: Хордовые диаграммы, показывающие предполагаемый вклад каждой пары лиганд-рецептор в передачу сигналов коллагенового пути с фибробластами в качестве исходных клеток в каждой категории DPW. Этот рисунок соответствует шагу 6.10.2. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 20: Хордовые диаграммы, показывающие предполагаемые взаимодействия лиганд-рецептор Col1a1-Cd44 между всеми типами клеток в каждой категории DPW. Этот рисунок соответствует шагу 6.12. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 21: Столбчатые диаграммы, показывающие количество (слева) и силу (справа) предполагаемых взаимодействий в ранах 1-го и 14-го дней. Этот рисунок соответствует шагу 6.14. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 22: Круговая диаграмма, показывающая дифференциальную силу межклеточного взаимодействия между каждым типом клеток при переходе раны от 1-го дня (синий) к 14-му дню (красный) DPW. Этот рисунок соответствует шагу 6.15. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 23: Тепловая карта, показывающая дифференциальную силу межклеточного взаимодействия между каждым типом клеток при переходе раны от 1-го дня (синий) к 14-му дню (красный) DPW. Этот рисунок соответствует шагу 6.16. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 24: Ранговая диаграмма, показывающая относительный вклад отдельных путей в межклеточные взаимодействия между фибробластами и другими типами клеток в 1-й день и в 14-й день DPW. Этот рисунок соответствует шагу 6.17. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 25: Пузырьковые диаграммы, показывающие относительный вклад отдельных пар лиганд-рецептор в сигнальный путь коллагена с фибробластами в качестве исходных клеток в 1-й день и в 14-й день DPW. Этот рисунок соответствует шагу 6.18. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 26: Графики UMAP, показывающие распределение кластеров Seura (слева) и номера партий (справа) до интеграции данных. Этот рисунок соответствует шагу 7.5. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный рисунок 27: Графики UMAP, показывающие распределение кластеров Сёра (слева) и номера партий (справа) после интеграции данных. Этот рисунок соответствует шагу 7.9. Пожалуйста, нажмите здесь, чтобы скачать эту цифру.

Дополнительный файл 1: JoVE_Rscript.R: Основной файл скрипта кода R, который включает в себя все шаги и пояснения, описанные для всех частей протокола. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 2: JoVE_PhaseSpecificGenes.txt. Текстовый файл с разделителями-табуляторами, содержащий списки генов, загруженных на шаге 5.1 протокола. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительный файл 3: JoVE_Rscript_b3.R. Файл дополнительного скрипта кода R, который включает в себя все шаги и пояснения, необходимые для анализа пакета #3 набора данных для использования на шаге 7.1 протокола. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Дополнительная таблица 1: JoVE_DEGs_cellMarkers.xlsx. Excel, который содержит полный вывод ранжированных дифференциально экспрессируемых генов, используемых на шаге 3.10 протокола. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Дополнительная таблица 2: Топ-5 повышенных и экспрессированных генов для каждого кластера Сёра. Пожалуйста, нажмите здесь, чтобы скачать эту таблицу.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В этом протоколе RStudio используется для выполнения предписанных строк кода, которые позволяют проводить базовый анализ сложного набора данных из одной ячейки с помощью Seurat. Представлено несколько методов, которые имеют отношение к исследованиям заживления ран, включая установку среды кодирования R, загрузку ранее опубликованного набора данных о заживлении ран одиночными клетками, выполнение критических этапов контроля качества и стандартные рабочие процессы анализа отдельных клеток, включая визуализацию, аннотации основных типов клеток, анализ подтипов клеток и интегративный анализ с помощью Seurat, а также выполнение анализа межклеточного взаимодействия с помощью CellChat.

Представленные здесь методы представляют собой упрощенные краткие описания типичных рабочих процессов для анализа одиночных клеток с использованием R и его популярных научных пакетов с открытым исходным кодом Seurat21 и CellChat22. Действительно, рабочий процесс является лишь одним из примеров того типа анализа, который можно выполнить с помощью сложного набора данных о заживлении ран одиночными клетками. Возможные модификации этого метода почти бесконечны, единственным ограничением является конкретное научное исследование пользователя. Например, пользователь может изменить некоторые ключевые параметры, такие как типы ячеек и временные точки, в соответствии с исследовательскими вопросами, которые он может захотеть задать в этом наборе данных. Авторы также надеются, что пользователь чувствует себя достаточно комфортно, чтобы адаптировать этот рабочий процесс к интересующему их набору данных с одной ячейкой; Тем не менее, необходимо соблюдать осторожность при использовании этого рабочего процесса для анализа других наборов данных, так как каждый эксперимент может распространить технические проблемы и проблемы подготовки образцов на сами данные. Поэтому крайне важно, чтобы пользователь прочитал и понял все детали эксперимента, прежде чем интерпретировать результаты любых ранее опубликованных и повторно проанализированных наборов данных об отдельных клетках. Важно помнить, что инструменты биоинформатики являются мощным методом исследования биологических процессов и генерации гипотез, и что любые критические биологические интерпретации результатов должны быть подтверждены в последующих экспериментах.

Обратите внимание, что во всем протоколе могут быть внесены значительные изменения в определенные области рабочего процесса для выполнения других задач. Тем не менее, детали всех возможных комбинаций изменений в рабочем процессе выходят за рамки данной рукописи. Например, разрешение, используемое для кластеризации клеток, и размеры, используемые для анализа UMAP, неизбежно субъективны, а представленные здесь инструменты позволяют проводить как крупномасштабные анализы (как было продемонстрировано здесь для широко определенных основных типов клеток), так и очень специфические анализы, которые могут повлечь за собой субкластеризацию клеток в более редкие субпопуляции в рамках более крупного набора данных. Для получения дополнительной информации об этом аспекте метода анализа одиночных клеток, а также для получения подробной информации обо всех других параметрах, которые могут быть изменены в конвейере анализа одиночных клеток, авторы отсылают пользователя к публикациям Seurat21,26 и веб-сайту (https://satijalab.org/seurat/), где авторы этого развивающегося инструмента предоставляют подробные объяснения, виньетки и учебные пособия.

В этой рукописи представлены некоторые из наиболее цитируемых и используемых инструментов в литературе по транскриптомике одиночных клеток, а именно Seurat21 и CellChat22, для анализа взаимодействия одиночных клеток и межклеточных взаимодействий соответственно. Однако существуют и другие инструменты, которые выполняют аналогичные функции немного по-другому. Для анализа наборов данных с отдельными ячейками существуют Scran27, Scater 28 и ScanPy29 на основе Python, которые используют различные методы интеграции наборов данных25. В этом протоколе было продемонстрировано ручное аннотирование типов клеток, которое полагается на суждение пользователя для интерпретации обогащения кластерных клеточных маркеров, но в настоящее время существуют различные инструменты, позволяющие автоматизировать классификацию типов клеток, такие как SingleR30 и scGate31, среди прочих. Для анализа межклеточной коммуникации в этом протоколе был продемонстрирован CellChat, но существуют и другие инструменты для оценки межклеточных коммуникаций, включая CellPhoneDB32, Cytotalk33 и другие базы данных лиганд-рецепторов, которые реализованы в рамках консенсусной структуры LIANA (LIgand-receptor ANalysis)34. Все инструменты биоинформатики уникальны и имеют свои особенности и изменяемые параметры. Поэтому важно, чтобы пользователь внимательно прочитал документацию по каждому инструменту, чтобы понять его нюансы, прежде чем интерпретировать какие-либо выходные данные, полученные в результате их использования. Наконец, какие бы инструменты биоинформатики вы ни использовали, важно помнить, что такие инструменты постоянно развиваются и что разные версии пакетов могут давать разные результаты.

В R синтаксис имеет решающее значение, и неправильно поставленная знаки препинания, кавычки, квадратные скобки или даже неправильно написанная заглавная буква приведут к ошибке. Поэтому для пользователя жизненно важно обращать внимание на детали при наборе кода и быть особенно внимательным при копировании строк кода, чтобы адаптировать его к новым научным вопросам и наборам данных. Для устранения конкретных ошибок, с которыми можно столкнуться, авторы рекомендуют просто скопировать и вставить сообщение об ошибке в любимую поисковую систему пользователя и просмотреть результаты с форумов по биоинформатике, таких как GitHub и Stack Overflow, поскольку на наиболее часто встречающиеся ошибки, скорее всего, уже ответил знающий опытный пользователь. На некоторых форумах наиболее удачные ответы получают от других пользователей, которые сочли решение наилучшим для решения проблемы. Пользователь должен быть осторожен, чтобы просто не скопировать и не вставить строки кода, найденные в Интернете, на свой компьютер (особенно если решение требует изменения системных настроек за пределами языка программирования R), поскольку существует вероятность того, что такие программы могут быть вредоносными. Захватывающим новым методом устранения ошибок кодирования является использование мощных генеративных моделей большого языка искусственного интеллекта, таких как ChatGPT от OpenAI, Copilot от Microsoft или Gemini от Google. Эти модели оказались особенно полезными для разработки программного обеспечения в целом и устранения неполадок в частности. Для этого пользователь может скопировать и вставить целые строки своего кода, предоставив чат-боту простую подсказку о намерении пользователя использовать код. Обычное предостережение заключается в том, что эти модели не являются надежными, и пользователю, возможно, придется попробовать несколько подсказок, чтобы сгенерировать ответ, подходящий для решения проблемы.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, который можно было бы раскрыть.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Лаборатория М.С. Витеча получила финансирование от гранта NIH/NIGMS R35-GM154921, исследовательского гранта Общества заживления ран и кафедры биологии полости рта в Колледже стоматологии UIC.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Ноутбук или настольный компьютерН/ДН/ДЗапуск Windows или MacOS 
RН/ДВерсия 4.4.1Можно бесплатно скачать с https://cran.rstudio.com/
СтудияPosit Software, PBCВерсия 2024.09.0Можно бесплатно скачать с https://posit.co/download/rstudio-desktop/
Офис ExcelМайкрософтЛюбая версияДля анализа табличных данных
Интернет-браузерН/ДН/ДДля перехода на веб-сайты
Пакеты RRepositoryVersion
Инструменты для разработкиКРАН2.4.5
ЧитатьXLКРАН1.4.3
OpenXLSXКРАН4.2.7.1
Аккуратная вселеннаяКРАН2.0.0
scНастроитьКРАН2.1.2
БиокМенеджерБиопроводник1.30.25
НМФБиопроводник0.28
ComplexТепловая картаБиопроводник2.20.0
БиососедиБиопроводник1.22.0
Эксперимент с сингл-клеткойБиопроводник1.26.0
ЦиркулироватьБиопроводник0.4.16
edgeRБиопроводник4.2.1
scDblFinderБиопроводник1.18.0
СёраКРАН5.1.0
Сотовый чатГитхаб2.1.2

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Eming, S. A., Martin, P., Tomic-Canic, M. Wound repair and regeneration: mechanisms, signaling, and translation. Sci Transl Med. 6 (265), 265sr6(2014).
  2. Wietecha, M. S., et al. Phase-specific signatures of wound fibroblasts and matrix patterns define cancer-associated fibroblast subtypes. Matrix Biol. 119, 19-56 (2023).
  3. Rodrigues, M., Kosaric, N., Bonham, C. A., Gurtner, G. C. Wound healing: a cellular perspective. Physiol Rev. 99 (1), 665-706 (2019).
  4. Chen, L., Mirza, R., Kwon, Y., DiPietro, L. A., Koh, T. J. The murine excisional wound model: contraction revisited. Wound Repair Regen. 23 (6), 874-877 (2015).
  5. Rhea, L., Dunnwald, M. Murine excisional wound healing model and histological morphometric wound analysis. J Vis Exp. (162), e61616(2020).
  6. Fischer, K. S., et al. Protocol for the splinted, human-like excisional wound model in mice. Bio-Protocol. 13 (3), e4606(2023).
  7. Iglesias-Bartolome, R., et al. Transcriptional signature primes human oral mucosa for rapid wound healing. Sci Transl Med. 10 (451), aap8798(2018).
  8. Chen, L., Arbieva, Z. H., Guo, S., Marucha, P. T., Mustoe, T. A., DiPietro, L. A. Positional differences in the wound transcriptome of skin and oral mucosa. BMC Genomics. 11, 471(2010).
  9. Leonardo, T. R., et al. Transcriptional changes in human palate and skin healing. Wound Repair. 31 (2), 156-170 (2023).
  10. Rognoni, E., et al. Fibroblast state switching orchestrates dermal maturation and wound healing. Mol Syst Biol. 14 (8), e8174(2018).
  11. Bergmeier, V., et al. Identification of a myofibroblast-specific expression signature in skin wounds. Matrix Biol. 65, 59-74 (2018).
  12. Plikus, M. V., et al. Regeneration of fat cells from myofibroblasts during wound healing. Science. 355 (6326), 748-752 (2017).
  13. Shook, B. A., et al. Myofibroblast proliferation and heterogeneity are supported by macrophages during skin repair. Science. 362 (6417), aar2971(2018).
  14. Rinkevich, Y., et al. Skin fibrosis. Identification and isolation of a dermal lineage with intrinsic fibrogenic potential. Science. 348 (6232), aaa2151(2015).
  15. Guerrero-Juarez, C. F., et al. Single-cell analysis reveals fibroblast heterogeneity and myeloid-derived adipocyte progenitors in murine skin wounds. Nat Commun. 10 (1), 650(2019).
  16. Gay, D., et al. Phagocytosis of Wnt inhibitor SFRP4 by late wound macrophages drives chronic Wnt activity for fibrotic skin healing. Sci Adv. 6 (12), eaay3704(2020).
  17. Haensel, D., et al. Defining epidermal basal cell states during skin homeostasis and wound healing using single-cell transcriptomics. Cell Rep. 30 (11), 3932-3947.e6 (2020).
  18. Phan, Q. M., Sinha, S., Biernaskie, J., Driskell, R. R. Single-cell transcriptomic analysis of small and large wounds reveals the distinct spatial organization of regenerative fibroblasts. Exp Dermatol. 30 (1), 92-101 (2021).
  19. Foster, D. S., et al. Integrated spatial multiomics reveals fibroblast fate during tissue repair. Proc Natl Acad Sci U S A. 118 (41), e2110025118(2021).
  20. Hu, K. H., et al. Transcriptional space-time mapping identifies concerted immune and stromal cell patterns and gene programs in wound healing and cancer. Cell Stem Cell. 30 (6), 885-903.e10 (2023).
  21. Hao, Y., et al. Dictionary learning for integrative, multimodal and scalable single-cell analysis. Nat Biotechnol. 42 (2), 293-304 (2024).
  22. Jin, S., et al. Inference and analysis of cell-cell communication using CellChat. Nat Commun. 12 (1), 1088(2021).
  23. Germain, P. -L., Lun, A., Garcia Meixide, C., Macnair, W., Robinson, M. D. Doublet identification in single-cell sequencing data using scDblFinder. F1000Research. 10, 979(2021).
  24. Jin, S., Plikus, M. V., Nie, Q. CellChat for systematic analysis of cell-cell communication from single-cell transcriptomics. Nat Protoc. 20 (1), 180-219 (2024).
  25. Luecken, M. D., et al. Benchmarking atlas-level data integration in single-cell genomics. Nat Methods. 19 (1), 41-50 (2022).
  26. Hao, Y., et al. Integrated analysis of multimodal single-cell data. Cell. 184 (13), 3573-3587.e29 (2021).
  27. Lun, A. T. L., McCarthy, D. J., Marioni, J. C. A step-by-step workflow for low-level analysis of single-cell RNA-seq data with Bioconductor. F1000Research. 5, 2122(2016).
  28. McCarthy, D. J., Campbell, K. R., Lun, A. T. L., Wills, Q. F. Scater: pre-processing, quality control, normalization and visualization of single-cell RNA-seq data in R. Bioinformatics (Oxford, England). 33 (8), 1179-1186 (2017).
  29. Wolf, F. A., Angerer, P., Theis, F. J. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 19 (1), 15(2018).
  30. Aran, D., et al. Reference-based analysis of lung single-cell sequencing reveals a transitional profibrotic macrophage. Nat Immunol. 20 (2), 163-172 (2019).
  31. Andreatta, M., Berenstein, A. J., Carmona, S. J. scGate: marker-based purification of cell types from heterogeneous single-cell RNA-seq datasets. Bioinformatics. 38 (9), 2642-2644 (2022).
  32. Efremova, M., Vento-Tormo, M., Teichmann, S. A., Vento-Tormo, R. CellPhoneDB: inferring cell-cell communication from combined expression of multi-subunit ligand-receptor complexes. Nat Protoc. 15 (4), 1484-1506 (2020).
  33. Hu, Y., Peng, T., Gao, L., Tan, K. CytoTalk: de novo construction of signal transduction networks using single-cell transcriptomic data. Sci Adv. 7 (16), eabf1356(2021).
  34. Dimitrov, D., et al. Comparison of methods and resources for cell-cell communication inference from single-cell RNA-Seq data. Nat Commun. 13 (1), 3224(2022).

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Single Cell TranscriptomicsWound HealingSeurat AnalysisCellChat WorkflowMouse Skin DatasetCell Type AnnotationUMAP VisualizationDifferential Gene ExpressionCell CommunicationBioinformatics Workflow

Related Articles